mobile wallpaper 1mobile wallpaper 2mobile wallpaper 3mobile wallpaper 4
341 字
1 分钟
AI 编程服务突然变慢,先分清首 token、生成速度和缓存
2025-06-13

AI 编程服务突然变慢,先分清首 token、生成速度和缓存#

服务变慢时,我会把首 token 时间、生成速度、缓存命中率和请求路由分开记录。单次截图看不出问题来自服务负载、缓存策略还是客户端设置,先复现差异再判断更可靠。

复测时把指标拆开:

  • TTFT(首 token 时间):包含排队、网络和 prefill,决定“等多久开始回答”;
  • Decode token/s:开始输出后每秒生成多少 token;
  • 缓存命中:受提示词前缀、会话复用和服务路由影响;
  • 错误与中断:记录是否有流断开、超时或服务端报错。

选一组固定任务,在相近时间、同一模型标识和同一客户端版本下各跑几次,使用中位数而非单次峰值。测试提示词尽量不含私密代码;如果服务商没有公开模型路由和用量统计,就把结果写成“观测到的表现”,不要推断模型被替换或降级。

资料来源:Command Code 的 DeepSeek Flash 变慢原因讨论(原帖列出了多项观察,但原因未确认)

分享

如果这篇文章对你有帮助,欢迎分享给更多人!

AI 编程服务突然变慢,先分清首 token、生成速度和缓存
https://blog.zpooi.com/posts/commandcode-latency-benchmark/
作者
zpooi
发布于
2025-06-13
许可协议
CC BY-NC-SA 4.0

部分信息可能已经过时

目录