垂直领域专家模型实战
「怎么给医疗/金融/法律做一个行业大模型?」是企业级大模型能力体系(L4 阶段「垂直领域专家模型」)的收官命题,也是微调岗和解决方案岗的高频综合题。它考的不是单点技术,而是决策链:哪些知识进权重、哪些走 RAG、数据从哪来、怎么评、怎么防退化。本文给出完整方法论与行业案例拆解。领域模型盘点见 中文大模型生态全景,微调技术见 微调范式(SFT / PEFT)、LoRA / QLoRA 详解,选型原则见 RAG vs 长上下文 vs 微调。
面试先背这几句话
- 标准技术路线:开源底座 →(可选)领域继续预训练 CPT → 领域 SFT →(可选)偏好对齐 → RAG 外挂时效知识——每一步都要能说清「做不做的判断依据」。
- 知识分两类:语感/术语/推理套路进权重(训练),时效性/条款型事实走 RAG(检索)——这是整个领域模型设计的第一性原理。
- 继续预训练(CPT)的触发条件:领域语料与通用分布差异大(专业术语密集、格式特殊,如法条/病历/研报),且有 数 B~数十 B token 级语料;否则直接 SFT。
- 最大风险是灾难性遗忘:领域能力上去了,通用能力(指令遵循/安全)掉下来——靠**混合通用数据回放(replay)**与评估双轨制防守。
- 评估必须行业基准 + 自建业务评测集双轨:C-Eval 高不代表会写你们医院的病历摘要。
一、先想清楚:要不要训模型
面试第一个加分点是先质疑需求。决策树:
业务需求
├─ 通用模型 + 好 prompt 能解决? ──是──► 别训(80% 场景到此为止)
├─ 缺的是「事实知识」(条款/价格/文档)? ──是──► RAG(见 RAG vs 微调)
├─ 缺的是「输出格式/风格/任务范式」? ──是──► SFT/LoRA(数千条即可)
└─ 缺的是「领域语感/术语理解/推理套路」
且有大量领域语料? ──是──► 继续预训练 CPT + SFT反模式:客户说「我们要一个法律大模型」,直接开训。正解是先拆需求——如果 80% 的问题是「查某条法条」,那是 RAG 问题不是训练问题。
二、标准四段式技术路线 ★
2.1 底座选择
- 首选强中文开源底座:Qwen 系列(尺寸全/生态好)或 DeepSeek 蒸馏版(推理强),法务确认 license。
- 尺寸决策:7B~14B 满足多数领域任务(配合微调),32B~72B 用于复杂推理场景;先小后大,用评估证明需要更大再升。
2.2 领域继续预训练(CPT,可选)★
在底座上用领域语料继续做自回归预训练:
- 何时做:语料与通用分布差异大 + 语料量足(经验上 B 级 token 起步才有明显收益)。
- 数据配方关键:领域语料要与通用语料混合(常见从 1:1 到 8:2 不等)——纯领域语料训练会加速灾难性遗忘。
- 学习率要小(通常为预训练末期的 1/10 量级),避免大幅扰动已有能力。
- 产物是「领域 Base」:更懂行话,但还不会对话。
2.3 领域 SFT ★
- 数据来源:真实业务问答脱敏、专家撰写、强模型合成+专家审核(见 合成数据与自我改进)、领域考试题改造(执业医师/法考/CPA)。
- 配方同样要混通用指令数据(常见 领域:通用 ≈ 7:3 到 5:5),防止指令遵循能力退化。
- 质量 >> 数量:数千到数万条高质量领域指令即可显著起效;用 LoRA 起步,全参微调仅在数据充足且预算够时考虑。
- 格式即产品:病历摘要的模板、法律意见书的结构——SFT 最擅长的就是把这些「行业输出范式」焊进模型。
2.4 对齐与安全(行业强相关)
- 医疗:禁给确诊/处方,必须附「请就医」类提示;法律:禁保证胜诉、要引法条出处;金融:合规话术、投资建议边界。
- 手段:拒答类偏好数据 + DPO(见 RLHF / DPO 对齐),再叠系统级护栏(见 大模型安全与对齐)。
2.5 RAG 补时效(永远需要)
药品说明书更新、法条修订、金融产品价格——这些永远不该训进权重。领域模型 + 领域 RAG 是标配组合:模型管「懂行 + 会说」,RAG 管「最新 + 可溯源」(见 RAG 生产化与系统设计)。
三、灾难性遗忘:领域模型的头号大坑 ★
现象:法律能力涨了 10 分,通用对话/安全拒答掉了 20 分。
| 防守手段 | 做法 |
|---|---|
| 数据回放(replay) | CPT/SFT 阶段混入通用数据(比例见上文),最重要的手段 |
| 小学习率 + 少 epoch | 领域数据反复刷太多遍必遗忘 |
| LoRA 而非全参 | 底座权重冻结,天然缓解遗忘;且可多领域各挂一个 adapter |
| 模型合并 | 领域模型与通用模型做权重合并找平衡(见 模型融合与合并) |
| 评估双轨制 | 每个 checkpoint 同时跑领域评测和通用评测(MMLU/CMMLU+安全集),任何一边超阈值下降即报警 |
四、行业案例拆解(面试可直接引用的叙事)
4.1 医疗(HuatuoGPT / DISC-MedLLM 类路线)
- 数据:医学文献+教材(CPT),真实医患对话+医学考题+合成问诊对话(SFT),专家标注偏好(对齐)。
- 关键设计:真实对话教「问诊追问」能力,蒸馏数据教「表达规范」——两类数据缺一不可;安全上强约束诊断边界。
- 评测:医学执业考题 + 专家盲评问诊质量。
4.2 法律(LaWGPT / DISC-LawLLM 类路线)
- 数据:法条+判例(CPT/RAG 双用),法考题+法律咨询对话(SFT)。
- 关键设计:法条原文走 RAG 保证引用准确(法条背错是致命伤),模型负责理解案情与组织意见;输出强制带条文引用。
4.3 金融(轩辕 / DISC-FinLLM 类路线)
- 数据:研报+公告+财经资讯(CPT),金融问答+计算题+工具调用样本(SFT)。
- 关键设计:数值计算不靠模型硬算,教会它调计算器/查行情工具(Function Calling);合规话术进对齐数据。
三个案例的共同模式:「领域理解靠训练,精确事实靠检索,数值计算靠工具,行业边界靠对齐」——这句话本身就是满分答案的骨架。
五、评估:双轨制 + 业务金标准
- 行业公开基准:医疗 PromptCBLUE/MedBench、法律 LawBench、金融 FinEval 等——证明「懂行」。
- 自建业务评测集(更重要):从真实业务抽 200~500 条带专家标准答案的样本,覆盖高频任务+已知坑;每次迭代跑回归。
- 通用能力守门:CMMLU/MMLU + 指令遵循 + 安全拒答,防遗忘。
- 上线后:专家抽检 + 用户反馈回流,构成数据飞轮(见 LLMOps)。
六、常见坑清单
- ❌ 把「查询类需求」当训练需求 → 白花几十万训练费,RAG 一周能上线。
- ❌ 纯领域数据猛训 → 灾难性遗忘,通用能力崩。
- ❌ 只用蒸馏合成数据 → 模型「说得像专家」但推理浅(合成数据同质化)。
- ❌ 只刷行业榜 → 榜单高分、业务不可用(榜题≠业务分布)。
- ❌ 法条/药品剂量训进权重 → 更新即错,且无法溯源;该走 RAG。
- ❌ 忽略行业合规边界 → 一次「AI 开处方」类事故足以叫停整个项目。
高频追问
- 给某行业做专家模型的完整路线? 底座选型→(语料够且分布差异大时)CPT→领域 SFT(混通用数据)→行业对齐→RAG 补时效;每步给出做/不做的判断依据。
- 哪些知识进权重、哪些走 RAG? 语感/术语/推理套路/输出范式进权重;时效性事实、条款、需溯源内容走 RAG;数值计算交给工具。
- 什么时候需要继续预训练而不是直接 SFT? 领域语料与通用分布差异大(术语密集/格式特殊)且有 B 级 token 语料;否则 SFT 起步。
- 灾难性遗忘怎么防? 数据回放(领域:通用混合)、小学习率少 epoch、LoRA 冻结底座、模型合并、领域+通用评估双轨守门。
- 领域 SFT 数据从哪来? 真实业务脱敏、专家撰写、强模型合成+专家审核、行业考题改造;质量优先,数千条起效。
- 怎么评估领域模型? 行业基准(证明懂行)+ 自建业务金标准集(证明可用)+ 通用/安全守门(证明没退化),三者缺一不可。
- 7B 领域模型能打过 72B 通用模型吗? 在窄域高频任务上完全可能(微调后格式/术语更贴合),且成本低数倍;但复杂推理和长尾泛化仍是大模型占优——按任务分布选型。
- 医疗/法律模型的特殊红线? 医疗禁确诊处方、法律禁胜诉承诺且需引条文、金融守投资建议合规边界;对齐数据+系统护栏双保险。