379 字
1 分钟
单卡跑 27B 模型,权重能装下只是第一步
单卡跑 27B 模型,权重能装下只是第一步
在 RTX 5090 上运行 Qwen 27B 量化模型时,权重之外还要考虑上下文长度、KV Cache 量化、推理框架和 MTP 等设置。不同 harness 会改变工具调用和输出体验,速度数字不能脱离配置单独比较。

做自己的配置时,可以按顺序调整:
- 确认显存预算:权重之外还需要运行时、KV Cache 和图像等多模态缓存;长上下文可能比权重更快占满资源。
- 从保守量化开始:记录质量、显存峰值和速度,再尝试更低比特数,不要只追求最小文件。
- 固定一组任务比较框架:使用同一模型、提示词、上下文和硬件,分别跑代码、中文问答和长文任务。
- 区分实际质量和单次演示:一个生成页面或一次回答不能说明模型适合所有场景。
更可靠的结果应包含模型文件版本、量化格式、推理框架、上下文长度、并发、首字延迟和输出速度。社区数字适合提供起点,复现时还要考虑显存型号和软件版本差异。
资料来源:Qwen 27B 在 RTX 5090 上的本地推理体验(原帖的指标为作者自测)
分享
如果这篇文章对你有帮助,欢迎分享给更多人!
单卡跑 27B 模型,权重能装下只是第一步
https://blog.zpooi.com/posts/qwen-5090-local-inference/ 部分信息可能已经过时
相关文章 智能推荐
1
12GB 显卡跑大参数模型:Strata 测试里值得看的指标
技术观察 在 RTX 5070 上运行量化 MoE 模型时,分别衡量 decode、prefill、内存和输出质量。
2
把车规域控制器当离线 AI 工作站:先验证硬件边界
技术观察 将 Orin X 用作本地 AI 工作站前,核对板卡型号、系统运行时和开发环境隔离。
3
本地 Embedding 模型怎么选:别从参数量开始,先做检索小测
开发实践 根据目标语料、检索召回、延迟和内存占用选择本地 Embedding 模型。
4
“模型降智”先做回归测试:固定题目、版本和路由再比较
技术观察 固定用例、版本和路由做回归测试,区分模型能力变化与服务环境差异。
5
Claude Code 或 Codex 连不上服务:区分代理、DNS 与证书问题
AI 工具 AI 编程工具连接失败时,按名称解析、TCP、TLS 和应用代理设置分层检查,不要用关闭证书校验掩盖问题。






