缩放规律、容量与能力边界
“参数越大能力越强”只是一句不完整的经验。真正需要掌握的是:模型能力由参数、训练 token、数据质量、计算预算、后训练和推理时计算共同塑造;规模会带来可预测的收益,也会带来显存、延迟、成本、数据污染和可靠性的新边界。
一、什么是缩放规律
缩放规律(scaling laws)描述在一定模型族、数据分布与优化配置下,损失或能力指标如何随参数量 N、数据 token 数 D、训练计算量 C 变化。常见经验形式为幂律:
$$L(N,D)\approx L_\infty+aN^{-\alpha}+bD^{-\beta}$$
这里并不意味着所有能力都能被一个公式精确预测。它表达的是一个工程直觉:当其他条件合理时,增加模型、数据和计算通常有连续收益,但边际收益递减;若其中一个资源明显不足,另一个资源的投入会被浪费。
1.1 参数、数据与计算的三角形
- 参数量决定可学习函数的容量,也影响权重显存、通信与推理成本。
- 训练 token决定模型看过多少模式,数据质量和多样性决定这些 token 是否有信息量。
- 计算量由前向、反向、优化器更新和硬件效率组成,常用近似
C ≈ kND讨论量级。
把大模型只理解为“更多参数”是误区。一个巨大但训练 token 太少的模型会欠训练;一个小模型无限重复数据也会过拟合或遇到数据质量上限。计算最优训练关注的是在固定 C 下如何平衡 N 与 D,而不是单独把其中一个拉到极致。
二、Chinchilla 视角:为什么数据同样稀缺
早期大模型常被认为应优先增大参数规模,随后更系统的研究提示:许多模型相对其参数量看,训练 token 不够。这推动了“更小但训练更充分”的方向。具体比例并不是放之四海皆准的常数,因为模型架构、数据质量、重复率、训练目标和推理需求都不同;应记住的原则是参数量与训练 token 需要共同优化。
2.1 面试中如何避免背错数字
不要脱离前提背“每参数多少 token”。更稳妥的表述:
在固定算力预算下,参数和数据应平衡;过度偏向大参数会导致欠训练,过度重复有限数据会增加记忆与污染风险。实际配比必须基于目标域、数据质量、训练曲线和成本约束做实验验证。
这既说明你知道缩放规律,也避免把特定论文设置伪装成普遍定律。
三、容量不等于知识库
模型权重是训练数据的有损统计压缩,而不是能按主键查询的数据库。参数更多会提升对长尾模式的拟合和泛化潜力,但不保证:
- 某个冷门事实准确、最新且可引用;
- 用户私有数据已被模型知道;
- 同一问题每次都稳定给出相同答案;
- 复杂多步推理不会在中间步骤偏离;
- 模型会在不确定时诚实承认不知道。
这解释了为什么企业系统仍需要 RAG、工具、数据库、规则、引用和人工复核。把知识放在权重、上下文还是外部工具里,是新鲜度、更新频率、解释性、权限、延迟和成本的联合决策。
| 需求 | 更优先的手段 | 原因 |
|---|---|---|
| 经常更新且需可引用的事实 | RAG/数据库 | 可更新、可做 ACL、可给证据 |
| 稳定的格式、语气、领域动作 | SFT/PEFT | 改变行为分布,降低 prompt 负担 |
| 精确计算、实时状态、写操作 | 工具调用 | 让确定性系统承担确定性工作 |
| 一般语言与代码能力 | 更强底座/更多训练 | 需要通用表示与生成能力 |
四、能力涌现与阈值:应怎样理解
有些 benchmark 在模型规模跨过某个区间时分数跃升,常被称为“涌现能力”。需要谨慎解读:测量指标是离散的、提示格式会影响成功率、算力允许的推理策略也会变化,因此曲线中的突变不一定表示模型内部出现了神秘开关。
工程上更有用的问题是:能力是否在你的任务、prompt、语言、工具环境和成本预算下稳定出现。对一个任务而言,至少要做:
- 按模型规模和版本画质量-成本曲线,而非只挑最高分模型。
- 用多 seed、多模板、多难度切片测方差。
- 分开测“直接回答”“带检索”“带工具”“带验证”的增益。
- 记录失败模式是否从简单错误变成高置信的复杂错误。
五、推理时计算:同一权重也能有不同能力
能力不仅来自训练时算力,还来自推理时计算(test-time compute)。增加思考 token、采样候选、搜索、验证器调用或工具调用,可以提升一些可验证任务的成功率。但它换来的是更高延迟、成本和潜在的错误路径。
5.1 常见策略
- 更长推理预算:允许模型生成更长的中间过程;需防止无效冗长。
- Best-of-N / self-consistency:采样多个候选,再投票或用 verifier 选择;适合有可判别结果的任务。
- Speculative decoding:草稿模型先提议 token,目标模型批量验证;主要优化速度,不必然改变最终能力。
- 工具增强:计算器、代码执行、检索和数据库给模型外部状态;关键在于调用边界与结果校验。
- 反思与重试:让模型根据失败信号修正;没有可靠反馈时,反复自我对话可能只是放大幻觉。
一个成熟答案要同时说收益和门槛:如果没有可靠的验证器,采样更多回答未必更正确;如果是客户实时聊天,十倍推理 token 可能无法满足 P95 延迟;如果是高风险业务,工具权限和审批比“想得更久”更重要。
六、显存与成本:把参数规模翻译成工程量
6.1 权重显存的粗估
仅考虑权重,显存约为:
$$M_{weights}\approx N\times bytes_per_parameter$$
70B 参数以 BF16/FP16 存储约需 70B × 2 bytes ≈ 140GB,还没有包括 runtime buffer、分片冗余、通信和 KV Cache。INT8、INT4 等量化可减少权重占用,但会引入精度、算子和硬件兼容性取舍。
6.2 训练比推理更贵在哪里
训练除权重外还需要梯度、优化器状态和激活。以 Adam 类优化器为例,常会保存一阶/二阶动量;反向传播还要保存或重算激活。因此“某模型推理能放进两张卡”不代表“微调或预训练也能放进去”。ZeRO、FSDP、activation checkpointing、LoRA/QLoRA 都是在不同维度降低这些成本。
6.3 KV Cache 为什么会改变并发上限
自回归 decoder 需要在每层存储每个历史 token 的 K/V。粗略地,缓存与层数、头数或 KV head 数、head dim、序列长度、并发请求数成正比。上下文从 8k 提到 128k 不只是“多 16 倍文本”,还会显著挤占可并发请求数。GQA/MQA、paged KV cache、长度分桶、请求抢占和上下文压缩,都是为了把这个约束变成可运营的服务。
七、数据边界:高质量 token 才是燃料
互联网可用文本并非无限。规模化训练会面对:重复数据、版权与许可、个人信息、训练-评测污染、低质量机器生成内容和语言/领域不均衡。合成数据能扩大覆盖面、提供可验证轨迹或稀缺格式,但也可能让模型在自己的偏差上循环。
治理上应保留数据 lineage:样本来自哪里、经过哪些过滤、属于哪个版本、为何被采样、能否按删除请求回溯。对合成数据尤其需要记录生成模型、prompt、过滤器和验证方式。没有这些记录,线上发现偏见、泄露或错误时无法定位根因。
八、能力边界与安全边界
能力上升会扩大可完成任务的范围,也会扩大错误和滥用的影响范围。系统设计时应显式分层:
- 模型层:拒答、对齐、内容分类、输出格式能力。
- 应用层:输入净化、上下文隔离、schema 校验、引用要求。
- 工具层:最小权限、参数 allowlist、读写分离、审批与幂等。
- 运营层:审计、告警、红队、回滚、事故响应。
不能把安全完全外包给模型,也不要把“模型能力边界”误当成“产品风险边界”。一个会生成 SQL 的模型即使没有恶意,也可能在权限过大的环境里造成严重副作用。
九、模型选型的质量-成本前沿
选模型不应问“哪个最好”,而应找满足业务约束的 Pareto 前沿。可定义一个候选表:
| 指标 | 说明 | 典型门槛 |
|---|---|---|
| 任务质量 | 业务通过率、事实性、格式正确率 | 不低于基线且置信区间可接受 |
| 延迟 | TTFT、P50/P95、流式体验 | 满足用户等待预算 |
| 成本 | 输入/输出 token、GPU、工具和人工兜底 | 单任务经济模型成立 |
| 稳定性 | 超时、空输出、schema 失败、重试率 | 能支撑峰值流量 |
| 风险 | 注入、泄露、越权、偏见切片 | 发布门禁通过 |
大型模型可能质量最高,却在低风险批处理任务上被小模型支配;小模型可能便宜,却因人工复核率增加而使全链路成本更高。正确做法是按任务路由并做灰度实验,不是所有请求一刀切。
十、面试高频问答
Q1:Scaling law 对工程有什么实际意义?
**答法:**它提醒我们参数、数据和计算存在可量化的权衡,不能只盲目堆模型。工程上可用小规模实验观察 loss/质量曲线,估算继续训练、扩大数据或换架构的边际收益;最终仍要用目标任务、成本和风险来决定,而非用一条论文公式替代验证。
Q2:大模型的参数越多是不是一定越好?
**答法:**不一定。大参数带来容量,但需要足够高质量 token 和计算训练充分;线上还会增加权重显存、KV Cache 压力、延迟和成本。特定任务中,经过充分训练和良好路由的小模型可能有更好的单位成本表现。
Q3:长上下文和 RAG 应该怎么选?
**答法:**长上下文适合需要整体阅读、跨段推理且资料量可控的任务;RAG 适合大规模、持续更新、需权限过滤和引用的知识。实际常混合:先检索缩小候选,再把关键文档以较长上下文交给模型;需要按文档长度、事实性、成本和延迟做评测。
Q4:如何理解“推理模型更强”?
**答法:**它通常意味着模型或系统在推理阶段分配了更多计算、搜索或验证预算,能提高某些任务的成功率。要同时衡量响应时间、token 成本、可验证性和失败模式;不能把隐藏中间过程或更长输出自动等同于更可靠。
十一、复习与项目表达
面试前请准备一个质量-成本决策案例:说明候选模型、离线任务集、延迟与成本预算、灰度方式、回滚条件和最终路由策略。一个可复述的项目故事可以是:
“我们没有按榜单直接选择最大模型,而是用生产问题集比较三档模型,记录格式正确率、证据覆盖率、P95 和单任务总成本。低风险摘要走小模型,复杂带引用问答升级强模型;当上下文超过预算时先 rerank 和摘要。发布采用 5% 灰度,若关键切片质量下滑或人工兜底率上升就自动回滚。”
这段话把缩放、容量、评测、路由和运营串成了工程能力,而不只是解释一条幂律公式。