大模型研发与训练方案
先比较提示、RAG、微调与继续预训练,只有业务与数据证据支持才考虑从零训练。明确参数规模、上下文、任务和许可;不得把模型能载入显存等同于能经济完成训练。
- 路线选择
- 数据与预算
- 训练交付
先比较提示、RAG、微调与继续预训练,只有业务与数据证据支持才考虑从零训练。明确参数规模、上下文、任务和许可;不得把模型能载入显存等同于能经济完成训练。
SFT学习示例;DPO直接优化偏好对,不等同于在线RL;GRPO/PPO需要定义奖励、采样与策略更新。方法由任务和预算决定,不是每个项目都必须使用强化学习。
建立基础模型许可、数据来源、标注协议、偏好对、奖励定义与独立测试集清单。统计样本和token、长度、语言、去重与脱敏;记录训练测试重叠检查。数据质量与授权优先于单纯追求规模,合成样本也需验证偏差和污染。
以下为概念方案,展示设计与验收思路,并非已交付客户项目。




指标用于制定项目测试方案;除明确引用的行业口径外,不代表西南已实现的性能或承诺。
第三方公开资料仅供技术参考,不构成合作或背书。核对日期:2026-10-05。
SFT、DPO、GRPO和奖励模型的公开实现资料;DPO是偏好优化,不应直接等同于在线强化学习。
公开参考案例:3B模型的多阶段训练资料,用于说明完整训练需要数据与算力规划;非西南成果。
大模型训练资源需求取决于具体配置;个人盒子的推理能力不能直接换算成训练能力。不保证达到通用超级智能或固定提升幅度。