361 字
1 分钟
12GB 显卡跑大参数模型:Strata 测试里值得看的指标
12GB 显卡跑大参数模型:Strata 测试里值得看的指标
在一套 RTX 5070 12GB 显卡、64GB 内存和 Ryzen 5 7600 配置上,Strata 测试了 Qwen Flash-Next MoE 的多种量化格式。Q2、IQ2 和 IQ3 的 decode 速度与内存需求差异明显;这些数据只适用于该测试环境,不能直接当作其他机器的预期值。

看这类数字时,先分清两个阶段:
- Prefill:模型读取提示词和上下文,影响首 token 等待时间;长上下文会让这一步更重。
- Decode:模型逐 token 生成回答,通常以 token/s 观察交互速度。
量化越激进,通常越省内存,但速度、输出质量和可用上下文都可能变化。实际运行还要把模型权重、KV cache、推理框架和系统预留内存一起算进去。
因此,别只比较一张“最高速度”截图。固定同一提示词和上下文长度,分别记录 prefill、decode、峰值内存和输出质量;模型版本、量化格式、驱动和推理框架也要一起记下。文中成绩只反映一套特定机器与版本,不等于所有 RTX 5070 都能复现。
分享
如果这篇文章对你有帮助,欢迎分享给更多人!
12GB 显卡跑大参数模型:Strata 测试里值得看的指标
https://blog.zpooi.com/posts/strata-inference-on-5070/ 部分信息可能已经过时
相关文章 智能推荐
1
单卡跑 27B 模型,权重能装下只是第一步
技术观察 单卡运行 27B 模型时,量化、KV Cache、上下文和推理框架都会影响速度与质量。
2
把车规域控制器当离线 AI 工作站:先验证硬件边界
技术观察 将 Orin X 用作本地 AI 工作站前,核对板卡型号、系统运行时和开发环境隔离。
3
大模型推理的 Prefill 和 Decode:为什么首字等待与生成速度不同
技术学习 从三张 V100 跑 27B 模型的系列帖第一章,解释 Prefill、Decode 与 KV Cache 的基础含义。
4
本地 Embedding 模型怎么选:别从参数量开始,先做检索小测
开发实践 根据目标语料、检索召回、延迟和内存占用选择本地 Embedding 模型。
5
“模型降智”先做回归测试:固定题目、版本和路由再比较
技术观察 固定用例、版本和路由做回归测试,区分模型能力变化与服务环境差异。






