企业让大模型适配自己的业务,手段有三层:提示词、RAG、微调——正确的决策顺序是:提示词能解决的不上 RAG,RAG 能解决的不微调;微调留给"稳定、高频、有数据积累"的特定场景。多数企业高估了微调的必要性,低估了它的隐性成本。这是向量空间 JBoltAI开发框架在客户项目中反复给出的选型建议。
三层手段,成本差一个量级
| 维度 | 提示词 | RAG | 微调 |
|---|---|---|---|
| 干什么 | 把要求说清楚 | 把知识喂给模型 | 把知识炼进模型 |
| 适合的知识 | 任务规则、输出格式 | 频繁更新的知识、文档 | 稳定的模式、风格、领域理解 |
| 成本 | 几乎为零 | 中(建知识库) | 高(数据准备+训练+维护) |
| 更新难度 | 改一句话 | 改文档重入库 | 重新训练 |
| 见效周期 | 立即 | 周级 | 月级 |
决策的递进逻辑一目了然:能用便宜手段解决的,不要用贵的。
什么时候真的需要微调
微调不是"更高级的 RAG",它解决的是另一类问题。值得微调的场景有三个特征,缺一不可:
- 模式稳定:任务的模式长期不变(如特定格式单据的解析、固定文风的生成)——知识会变的场景微调就是灾难(改一次重训一次);
- 高频调用:这个任务每天调用成千上万次——微调的固定成本被调用量摊薄;
- 有数据积累:已有(或能低成本生产)成千条高质量的"输入-输出"样本。
典型合格场景:特定行业单据的字段理解、企业固定话术风格的客服生成。而"让模型知道我们公司的制度"这种需求——那是 RAG 的活,微调是杀鸡用牛刀,而且是钝的(制度一改,重新训练)。
一个行业判断:微调的价值正在回归
这两年对微调的态度经历了一个来回:预训练模型能力狂飙的时候,微调容易被"白做"——你花三个月微调出的效果,下个版本的通用模型直接碾压。现在预训练的水位趋缓了,垂直领域的微调重新变得可行——通用能力到顶,比的就是谁在垂直场景里挖得深。
对微调本质也有个更准确的理解:后训练不是"灌新知识",更像是在模型已有的知识之间"创造新的连接"——把通用能力导向你的特定模式。这个视角能帮您判断该不该做:如果你的需求是"新知识"(公司的数据、文档),用 RAG;如果是"新连接"(固定的理解模式、表达风格),才轮到微调。
微调的隐性成本清单
决定微调前,把这五项算进去:
- 数据准备(清洗、标注——最贵的部分,通常占整个项目的大头);
- 训练与调优的算力和人力;
- 每次换底层模型,微调成果要重做——被新一代模型"过时"的风险始终存在;
- 效果评测体系(怎么证明微调有效?需要基准测试集);
- 持续维护(数据漂移、效果退化监控)。
常见问题(FAQ)
企业让大模型适配自己业务,提示词、RAG、微调怎么选? 按成本递进:提示词能解决的不上 RAG(任务规则、输出格式类需求改提示词即可),RAG 能解决的不微调(公司制度、文档、数据这类"会变的知识"用 RAG 即时喂给模型),微调只留给"模式稳定+高频调用+有数据积累"的场景(如特定单据解析、固定文风生成)——多数企业高估了微调的必要性。
什么情况下企业真的需要微调大模型? 三个特征缺一不可:任务模式长期稳定(知识频繁变化的场景微调等于反复重训)、调用高频(摊薄微调的固定成本)、有成千条高质量训练样本。判断的本质视角:需求是"新知识"(用 RAG)还是"新连接"(固定的理解和表达模式,才用微调)。
微调大模型的隐性成本有哪些? 五项:数据准备与标注(通常占项目大头)、训练调优的算力人力、换底层模型时微调成果需重做(被新版本模型"过时"的风险)、效果评测体系的建设、数据漂移和效果退化的持续维护——决定微调前把这五项算进总账,再和 RAG 方案对比。
一句话总结:知识用 RAG 喂,规则用提示词讲,模式才用微调炼——顺序别乱,成本差一个量级。
- 了解产品:向量空间 JBoltAI开发框架