大模型的能力不是写出来的,而是试出来的:从炼金术到实验科学

大模型的能力不是写出来的,而是试出来的:从炼金术到实验科学
大模型的能力不是写出来的,而是试出来的:从炼金术到实验科学

对于拥有多年软件开发经验的人来说,第一次阅读大模型的训练日志时,往往会感到极度的不适应。在传统软件工程中,Bug 的定位是精确的:你能找到具体哪一行代码出了问题,修改它,并且能提前预知修改后的行为。然而,大模型并不提供这种确定性。调整数据配比,能力可能整体跃升,也可能此消彼长;在训练完成之前,没有任何人能提前推导出最终结果。

这种差异的核心不在于技术难度的高低,而在于对“正确性”的定义不同。软件的正确性是可以断言和证明的,通过规格说明书即可验证;而大模型的正确性只能被测量。你只能通过一系列测试题目来评估模型,比较不同版本的分数,从而判断哪一版更好。你无法证明它“好”,只能测出它“好”。这标志着两种完全不同的知识生产方式。

确定性 vs 测量性

大模型更像化学,而非纯数学

要理解大模型的本质,可以将其类比为化学。化学建立在物理和数学之上,拥有大量的公式,但没有化学家能仅靠推导直接算出一种新材料。化学家的工作方式是:选择原料、确定配方、控制火候、反复试验,成功后再回头寻找理论解释。

大模型的工作流程与此几乎一致:

  • 数据是原料;
  • 架构和训练方案是配方;
  • 计算集群是炉子;
  • 算力是炉火;
  • 评测则是检验结果的手段。

大模型研发即化学实验

需要澄清的是,将大模型研发比作“炼金术”或实验科学,并非否认其数学基础。大模型完全建立在数学之上,梯度、矩阵、概率等概念缺一不可。区别在于:使用数学工具通过数学推导创造结果是两回事。大模型的创造过程是实验性的,而非推导性的。

理论往往是工程的产物

将大模型研发视为实验科学,并非贬低其科学性。人类工程制品的历史表明,实践往往先于理论理解。最典型的例子是蒸汽机:蒸汽机的出现比热力学早了近一百年。

历史顺序甚至更加反直觉:并非先有热力学才造出蒸汽机,而是蒸汽机的存在倒逼出了热力学。工程师们为了节省煤炭、增加动力,反复试验,直到无法再通过经验优化时,才有人回头追问效率极限,从而催生了热力学理论。

大模型目前正站在蒸汽机当年的位置上:机器已经在运转,但完整的理论解释仍在路上。

实践倒逼理论

论文体裁揭示的知识生产方式

如果不听观点,直接观察前沿大模型的技术报告,会发现一个显著特征:里面几乎找不到定理和证明。

  • 数学论文结构:定理 + 证明。
  • 大模型技术报告结构:设置(Setup)+ 对照(Control)+ 结果(Result)。

报告中常见的描述是:“我们尝试了三种数据配比,第二种效果最好。”甚至连“消融实验”(Ablation Study)这一术语也是借自实验科学,意指移除某个部件以观察整体性能的变化。这种结构分明是化学论文的逻辑。一个学科采用何种格式撰写论文,直接反映了其知识生产的方式。

另一个直观信号是作者名单。数学顶刊的论文通常只有 1-3 位作者,而大模型技术报告的作者往往多达几十甚至上百人。这并非排场,而是因为一次有效的实验需要整支队伍的协作:有人负责数据清洗,有人监控训练稳定性,有人执行评测,有人盯着曲线随时准备叫停。单靠个人在纸上推导,无法诞生一个大模型。

“炼金术”之争与行业现状

“炼金术”这一说法并非空穴来风。在 2017 年的机器学习顶级会议上,一位研究者公开指出机器学习已沦为“炼金术”,意指行业往往只关注结果而缺乏对“为何有效”的解释。次日,另一位顶级学者反驳称,工程先于理论本就是常态。

这场争论至今未有定论,但双方默认了一个前提:当前确实缺乏理论解释。争论的焦点在于:没有理论解释的有效结果,是否算作科学?

为什么软件经验在大模型领域失效?

许多资深软件工程师发现,过去的经验在大模型领域难以直接复用,原因在于两种经验的性质不同:

  1. 软件积累的是因果经验:你知道“为什么”会这样,这种经验可以写入文档、在会议中传达,新人阅读设计文档后大多能接手工作。
  2. 实验学科积累的是手感经验:你知道某种曲线形状意味着该停止训练,知道某种配比会出问题,知道异常是源于数据脏了还是学习率过高。这种经验难以言表,无法完全文档化,只能靠亲手实践获得。

这解释了大模型行业的一个现象:整队挖人。如果核心知识都在论文里,挖走第一作者即可;但事实是,各家都在整建制地挖团队。因为真正值钱的经验藏在团队的协作流程和失败记录中。论文是公开的配方,但配方背后那些未写出的“火候”,才是真正的护城河。

因果经验 vs 手感经验

结论:实验学科的胜负手

基于以上分析,可以得出第一条核心判断:

大模型当然建立在数学和计算机之上,但其创造方式是实验科学的方式。它的能力不是被推导出来的,而是被试出来的。

一旦接受这一前提,后续的问题逻辑将发生根本变化。如果这是一门实验学科,那么决定成败的因素就不再是“谁更聪明”。数学和理论物理可能诞生改写分支的天才,但在化学史上,几乎没有个人能仅凭聪明单独改写学科。

实验学科有其独特的规矩。那么,这门手艺真正的胜负手究竟是什么?是算力规模,还是迭代速度?下一集,我们将深入探讨这门手艺的核心竞争逻辑。