跳转至

2026-04-05 周报

自然周:2026-03-30 至 2026-04-05

本周主线

本周在"理解大模型能力"这个方向上建立了两个互补视角:训练端关注缩放律(Scaling Laws)如何指导资源分配,评估端关注如何用"人类等效时间"来度量模型能力。两者共同构成一个从投入到产出的大模型能力认知框架。此外独立接触了一个 Claude Code 多 profile 管理工具,解决了多身份切换的工程痛点。

主题一:大模型能力的理解框架

核心脉络

  • 问题起点:训练大模型时资源有限(算力、数据),如何分配才能让模型最强?模型训练出来后,又如何客观衡量它到底有多强?
  • 推进关系:缩放律回答了第一个问题——Kaplan 等人(2020)最早提出模型性能与参数量、数据量、算力之间的幂律关系,但 Chinchilla(2022)修正了其中"参数量权重过高"的偏差,指出在固定算力预算下应该给数据分配更多资源、适当控制参数规模。能力衡量回答了第二个问题——将任务难度转换为"人类完成所需时间",再测试模型以 50% 成功率能覆盖到什么时间上限,从而把"模型有多强"翻译成人人都能理解的刻度。
  • 最终判断:理解大模型能力需要两条线索并进——缩放律告诉你"在给定预算下怎么分配资源效率最高",能力衡量框架告诉你"分配完之后模型实际达到了什么水平"。两者结合,才能从投入和产出两端建立完整的判断。

沉淀认知

  • 缩放律中的"计算量"指训练算力:Kaplan 论文中讨论的 compute budget 是训练阶段的总浮点运算量,不是推理延迟或推理成本。参数量增大会增加每次前向/反向传播的算力消耗,数据量增大会增加迭代次数,两者都消耗同一个算力池——算力是真正的瓶颈,它同时约束了模型能有多大、数据能跑多少。
  • Chinchilla 修正了 Kaplan 对参数量的高估:Kaplan 的结论倾向于"模型越大越好",但 Chinchilla 的实验表明,在固定算力预算下,应该用更少的参数配合更多的数据(而非反过来),这样能达到更低的验证 loss。换句话说,Kaplan 当年低估了数据量的边际收益。
  • 用"人类等效时间"衡量模型能力:核心方法是给每个任务标定一个难度——让人类完成它需要多长时间,然后测试模型以 50% 成功率能覆盖到多长的人类时间。例如 Opus 4.6 有一半概率能完成人类需要 12 小时的任务。这个框架把抽象的 benchmark 分数翻译成了直观的"相当于人类干多久的活"。
  • 大模型能力呈指数级增长:在对数坐标下,模型能力的"人类等效时间"指标随时间线性增长,意味着绝对能力在以指数速度提升。这不是某个模型的特性,而是跨越多个模型世代呈现的系统性规律。

适用边界

  • 缩放律的结论主要适用于预训练阶段的资源分配决策。微调、RLHF、推理优化等场景的资源投入规律与此不同,不能直接套用。
  • Chinchilla 的"最优"分配是针对给定算力预算最小化训练 loss。实际场景中数据质量、数据重复度、架构差异(如 MoE)等因素可能导致偏离理论最优。
  • "人类等效时间"能力衡量是一种宏观比较框架,适合用来把握不同模型之间的能力差距和增长趋势,不适合做具体下游任务的性能预测。

来源

  • 2026-03-31:Transformer 扩展规律与 Chinchilla 修正
  • 2026-04-03:大模型能力衡量