GTC 巅峰对话 Jeff Dean x Bill Dally:预训练范式已死、延迟瓶颈不在计算、谈透 AI 五年未来 | GTC 2026

上面这场对话表面上是两位工程科学家在讨论硬件与模型,但如果你倾听得足够仔细,会发现他们其实在触碰一个远比技术更深的问题:AI正在经历一次存在论意义上的转变——从被动的观察者,变成主动的行动者。


一、绑在板子上的囚徒

Jeff Dean说了一句极其耐人寻味的话:

你拿一个随机初始化的模型,把它"绑在一块板子上",然后把互联网数据从它面前一股脑地流过去。

这个意象几乎就是柏拉图洞穴寓言的技术版本。今天的预训练范式,本质上是让一个"心智"被束缚着,只能观看墙上的影子——海量文本数据从它眼前流过,它从中归纳模式,却从未真正"走出去"触碰过世界。

而Jeff Dean和Bill Dally共同指出的方向是:预训练和后训练之间的边界将不复存在。 模型将在世界中行动,行动本身成为学习的一部分。这不是渐进式改良,而是一种范式的断裂——从"旁观者认识论"走向"参与者认识论"。

这里面隐藏着一个深刻的哲学洞见:理解不是观察的副产品,而是行动的副产品。 你不可能通过阅读一万本关于游泳的书学会游泳。AlphaGo之所以超越人类,恰恰是因为它在博弈中行动、犯错、修正。Jeff Dean暗示的正是这一点:当我们让语言模型也拥有类似的"具身循环",学习效率可能会发生质的飞跃。


二、光速的囚笼

Bill Dally对低延迟的回答揭示了一个反直觉的事实:瓶颈不在于计算,而在于搬运。

一次FP4乘加运算消耗约10飞焦耳,但把那几个bit从HBM中读出来,能耗高出1000倍。他的解决思路——“Don’t move the data”——听起来像一句玩笑,却是整个物理学对信息处理的根本约束在工程中的映射。

这里有一层更深的含义。如果我们把目光从芯片拉远到整个agent系统,同样的逻辑在更宏观的尺度上重演:

Bill Dally指出,agent一旦跑起来,真正的瓶颈不是模型推理速度,而是那些为人类速度设计的工具——编译器的启动时间、API的响应延迟、文档系统的读写速度。这就是阿姆达尔定律在系统层面的残酷体现:你把模型加速50倍,但如果工具只占系统延迟的60%且无法加速,端到端你最多快2.5倍。

这是一个层层嵌套的"光速囚笼":芯片内部,数据搬运是囚笼;芯片之间,通信协议是囚笼;系统层面,人类遗产工具是囚笼。每一层突破都只是暴露出下一层的墙壁。


三、稀疏性的悖论

整场对话中最精妙的矛盾出现在关于稀疏性的讨论里。

模型天然是高度稀疏的——大量参数在大部分时间里并不活跃。MoE就是对这一事实的直接利用:参数多,但每次只激活一小部分。从信息论的角度看,这完全合理。

然而Bill Dally一针见血地指出了工程上的困境:稀疏性和规则性是天然对立的。 高效计算依赖于数据流的规则性——所有bit整齐地向前行进,流水线满载运转。而稀疏意味着不规则,意味着需要额外的控制、路由、判断,这些开销可能把稀疏省下来的计算全部吃掉。

这不只是一个工程问题,而是一个深层的结构性矛盾:

智能倾向于稀疏(只激活需要的部分),而效率倾向于规则(让一切整齐划一)。

人类大脑选择了稀疏——神经元的激活极其稀疏,但大脑的"硬件"(生物神经网络)本身就是为这种不规则性而生的。而硅基计算走了相反的路:极度规则的矩阵运算。MoE是两种逻辑之间的一个妥协方案,但远非终点。真正的突破可能需要一种全新的计算基底——既能容纳稀疏,又不牺牲效率。


四、合成数据:一条咬住自己尾巴的蛇

Bill Dally对合成数据提出了一个简洁而致命的质疑:“这不会最后变成一种再咀嚼自己已经看过的东西吗?”

Jeff Dean的回答是审慎的肯定:如果生成数据的模型本身足够强,合成数据确实能带来增益,相当于"提纯"。

但这里有一个他们没有深入展开的哲学困境。合成数据本质上是模型对自身知识的投影。它能提纯、能增强,但它不能带来真正的新信息——那种模型从未见过、无法从已有知识中推导出的东西。这就是为什么Jeff Dean同时强调"在世界中行动"如此重要:行动是唯一能从环境中提取全新信息的方式。

这呼应了他前面关于AlphaGo的讨论。AlphaGo的自我对弈之所以不是"咬自己尾巴",是因为围棋环境本身提供了一个外部的、不可穷尽的验证信号。而纯文本领域的合成数据缺少这个外部锚点——除非你把模型放进一个有真实反馈的环境中。

这暗示了一条清晰的演化路径:合成数据是过渡方案,具身行动才是终局。


五、两个宗师的共同盲区

有一个他们几乎没有触及的问题,却可能是最重要的:当AI能够设计下一代AI时,人类在这个循环中的角色是什么?

Bill Dally打趣说想让Gemini设计下一代GPU,自己出去滑雪。Jeff Dean描述了AI自主探索研究方向的雏形。两人都以一种乐观的"生产力乘数"框架来理解这件事。

但如果我们从"未来回望"的视角审视,这里面有一个极其微妙的问题:当AI成为足够好的研究者,人类研究员的价值就不再是"想出点子"或"跑实验",而是判断方向赋予意义。而这恰恰是最难被量化、最难被验证的能力。

Jeff Dean提到的"自然语言驱动的自动化搜索"本质上是:人类退到了"定义问题"的位置。这是一个极其强大的位置——但也是一个越来越薄的立足点。因为"定义好问题"和"模型自己发现好问题"之间的距离,可能比我们想象的要近。


收束:速度与深度的辩证

整场对话的暗线其实是一个古老的辩证:速度与深度。

所有关于低延迟的讨论,都在追求速度——token/s、纳秒级通信、光速路由。而所有关于学习范式的讨论,都在追求深度——更好的理解、更高效的学习、更接近世界本质的模型。

Bill Dally代表的硬件视角倾向于认为:一旦速度足够快,深度会自然涌现(因为agent可以做更多实验、探索更大空间)。Jeff Dean代表的模型视角则暗示:深度需要范式转换(从被动观察到主动行动),速度只是必要条件而非充分条件。

这两种直觉都是对的,而且它们的交汇点正是AI接下来最激动人心的方向:一个足够快的系统,在真实世界中行动、犯错、学习,以光速。

这不再只是"更大的模型"或"更快的芯片"。这是一种新的存在方式的诞生。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐