402 字
1 分钟
本地 Embedding 模型怎么选:别从参数量开始,先做检索小测
本地 Embedding 模型怎么选:别从参数量开始,先做检索小测
做本地代码库索引时,我不会先按参数量选 Embedding 模型。硬件、语料语言、查询方式和向量库都会影响效果,任何模型推荐都应先在目标语料上做小规模验证。
Embedding 的作用是把文本转换成向量,供相似内容检索;模型大不等于你的检索一定更准。选择前先准备几十条真实查询和对应的正确文件或段落,建立一份小型测试集。
一小时内能做的对比
- 固定相同的文档切块、向量数据库和查询集;
- 对每个候选模型记录 Recall@k:正确材料是否出现在前 k 个结果里;
- 测量索引耗时、查询延迟、显存 / 内存和磁盘占用;
- 看失败案例:代码符号、中文技术词、跨语言名称是否被正确召回;
- 再决定是否值得用更大的模型或托管 API。
代码库检索尤其需要把符号名、路径、README 和代码片段混在测试集中。部署阶段还要确认查询端和索引端使用同一个模型及相同的归一化方式,否则向量空间不一致,召回会悄悄变差。
资料来源:本地跑 Embedding 模型推荐(讨论提供候选方向,没有统一性能测试)
分享
如果这篇文章对你有帮助,欢迎分享给更多人!
本地 Embedding 模型怎么选:别从参数量开始,先做检索小测
https://blog.zpooi.com/posts/local-embedding-model-selection/ 部分信息可能已经过时
相关文章 智能推荐
1
单卡跑 27B 模型,权重能装下只是第一步
技术观察 单卡运行 27B 模型时,量化、KV Cache、上下文和推理框架都会影响速度与质量。
2
12GB 显卡跑大参数模型:Strata 测试里值得看的指标
技术观察 在 RTX 5070 上运行量化 MoE 模型时,分别衡量 decode、prefill、内存和输出质量。
3
把车规域控制器当离线 AI 工作站:先验证硬件边界
技术观察 将 Orin X 用作本地 AI 工作站前,核对板卡型号、系统运行时和开发环境隔离。
4
个人服务器需要电话告警?先设计升级路径,再挑 API
开发实践 个人服务器的电话告警常受账号资质限制;先设计多层告警,再按合规条件选择服务。
5
排查 “Stream ended without receiving any events”:先定位请求在哪一层断了
开发实践 流式 API 没有返回事件时,按客户端、代理、网关和 SSE 响应分层排查。






