mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4
415 字
1 分钟
大模型推理的 Prefill 和 Decode:为什么首字等待与生成速度不同
2026-02-10

大模型推理的 Prefill 和 Decode:为什么首字等待与生成速度不同#

一篇关于三张 V100 部署 27B 模型的系列文章,先从推理的两个阶段讲起。理解它们可以解释一个常见现象:模型有时“想很久才开口”,之后输出却很快;有时首字很快,长回答又逐渐变慢。

Prefill 与 Decode 两个推理阶段的示意图

  • Prefill(预填充):模型读取整段输入提示词并建立中间状态。输入越长、上下文越大,这一阶段通常越重,也会影响首 token 延迟。
  • Decode(逐 token 生成):模型每一步生成一个或多个 token,直到回答结束;交互中常用 token/s 描述输出速度。
  • KV Cache:保存已经处理过的上下文状态,避免每一步重新计算全部历史,但会占用显存或内存。

所以测试模型时,至少分开记录首 token 时间、生成速度、输入长度、输出长度、并发和缓存状态。只写一个“每秒多少 token”,很难知道性能瓶颈是在长提示词预填充,还是在逐 token 解码。

三张 V100 的公开测试表现来自特定配置与优化;硬件代际、推理框架、量化方式和并发都会改变数字,不宜直接当作其他机器的预期值。

资料来源:三张 V100 跑 27B 大模型推理优化系列(本文配图为原帖中的概念图)

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

大模型推理的 Prefill 和 Decode:为什么首字等待与生成速度不同
https://blog.zpooi.com/posts/v100-prefill-decode-basics/
作者
zpooi
发布于
2026-02-10
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录