341 字
1 分钟
AI 编程服务突然变慢,先分清首 token、生成速度和缓存
AI 编程服务突然变慢,先分清首 token、生成速度和缓存
服务变慢时,我会把首 token 时间、生成速度、缓存命中率和请求路由分开记录。单次截图看不出问题来自服务负载、缓存策略还是客户端设置,先复现差异再判断更可靠。
复测时把指标拆开:
- TTFT(首 token 时间):包含排队、网络和 prefill,决定“等多久开始回答”;
- Decode token/s:开始输出后每秒生成多少 token;
- 缓存命中:受提示词前缀、会话复用和服务路由影响;
- 错误与中断:记录是否有流断开、超时或服务端报错。
选一组固定任务,在相近时间、同一模型标识和同一客户端版本下各跑几次,使用中位数而非单次峰值。测试提示词尽量不含私密代码;如果服务商没有公开模型路由和用量统计,就把结果写成“观测到的表现”,不要推断模型被替换或降级。
资料来源:Command Code 的 DeepSeek Flash 变慢原因讨论(原帖列出了多项观察,但原因未确认)
分享
如果这篇文章对你有帮助,欢迎分享给更多人!
AI 编程服务突然变慢,先分清首 token、生成速度和缓存
https://blog.zpooi.com/posts/commandcode-latency-benchmark/ 部分信息可能已经过时
相关文章 智能推荐
1
语音输入跨应用复用:先选系统热键,再比较识别质量
工具分享 比较系统听写、热键工具和手机输入在多应用语音工作流中的差别。
2
个人服务器需要电话告警?先设计升级路径,再挑 API
开发实践 个人服务器的电话告警常受账号资质限制;先设计多层告警,再按合规条件选择服务。
3
给单个应用走代理:Antigravity 的进程级配置思路
开发实践 当编辑器不遵循系统代理时,可只转发指定进程的流量,并逐层验证辅助进程与代理日志。
4
Agent 桌面端能操作终端和 SSH 后,权限边界要怎么设
开发实践 从 LiveAgent 展示的终端、文件、浏览器、隧道和 SSH 功能出发,整理桌面 Agent 的隔离与授权检查。
5
代理节点显示断开,为什么应用还在收到响应?
开发实践 界面状态、代理进程和既有网络连接反映的是不同层;用新连接和日志验证实际出口,别只凭一条回复判断直连。






