Imagination 介绍了在日常设备上加速 LLM 的工作,并解释了两个关键性能指标:首次输出时间(TTFT)和 token 间延迟(ITL)。文章还说明了 KV 缓存、prefill 与 decode 两种模式,以及这些阶段对 GPU 计算吞吐和内存带宽的不同要求。……
Imagination 介绍了在日常设备上加速 LLM 的工作,并解释了两个关键性能指标:首次输出时间(TTFT)和 token 间延迟(ITL)。文章还说明了 KV 缓存、prefill 与 decode 两种模式,以及这些阶段对 GPU 计算吞吐和内存带宽的不同要求。……