【论文阅读||2025|下】Aligning generalization between humans and machines
论文来源:https://doi.org/10.1038/s42256-025-01109-4 (nature)
新兴方向
在前面的文章中,我们说明人机泛化对齐的动机,并分析当前人类和机器对齐的现状,我们从泛化方法中了解了机器的三大泛化范式:统计方法、实例方法、知识方法。我们不能用单一的方法去实现与人类对齐,我们需要结合这三者优势来更好实现人机对齐。
下面我将简要列出这三个范式在实现人类泛化对齐目标的优势,同时加入我自己理解的对于人类的泛化类型
| AI范式 | 人类方法 | 优势 |
| 统计方法 | 直觉 | 用通用逼近和推断正确性,能处理复杂任务 |
| 实例方法 | 经验 | 有鲁棒性和记忆性,适应变化和少样本学习 |
| 知识方法 | 推理 | 支持组合性和可解释性,人类能理解其逻辑 |
接下来作者提出四个未来具体的研究方向:先进的泛化理念、混合方法、评估实践、人与机器团队的对齐。
基础模型时代的一般化理论
在新时代的大模型所展现出的惊人的泛化能力与其理论基础的缺失存在巨大的差距。
隐形泛化
最近像GPT这样的大语言模型,可以通过零样本和上下文学习来隐式的处理他们在训练数据中没有学习过的任务。
目前的解释(假设)是模型在预训练过程中,已经隐形完成了泛化的“过程”,形成了高度抽象的泛化“产物”,从而能作为“操作”应用到全新的任务和领域中。
但是这个假设并没有被验证,这种隐式的泛化让我们只知道他能有效,但无法理解他为什么有效,这很可能导致我们高估了模型的泛化能力。
研究方向
上面的问题更加表明我们需要进一步研究。
我们需要超越当前“下一个词预测”的范式,设计新的范式(泛化过程和产品)来保证零样本应用到新任务是可行的,以下是作者给出的两个方向:
编码不变形/等变性:让模型显式学习到那些在变化中保持不变的核心规律。例如AlphaFold。它成功的关键在于融入了对蛋白质物理结构的深刻理解(如三维旋转的等变性)。这意味着,无论蛋白质如何折叠,其基本物理法则是不变的。将这种“不变性”编码到模型架构中,能带来极其强大的泛化能力。
认知启发的表示:向人类认知学习。
使用原型来表示概念。一个“鸟”的原型,可能包含了“有喙、有羽毛、会飞”等典型特征。这种表示本身就具有很强的泛化性,能快速适应新的、非典型的“鸟”(如鸵鸟),因为它抓住了概念的本质。
使用基本层次范畴。如下图,在人类的认知中,都有一个被优先使用的分类层次,让AI模仿这种层次化结构可以优化其知识组织和检索效率。

类比结构映射。这个属于更高层的抽象(电子围绕原子和地球围绕太阳),这种类比结构映射可以让AI学习不同领域之间关系的相似性(围绕概念)
除了新的泛化过程和产品外,我们还需要新的数学理论。经典统计学习理论无法解释大模型的零样本或者少样本学习,所以我们需要一套新理论来回答:什么时候零样本应用是可行的?
启发:与传统理论认为高维是灾难相反,新研究发现信号的高维度可能是少样本/零样本学习和过参数化深度网络泛化能力的关键。这暗示着我们可能需要一套基于高维概率和几何的全新数学工具来理解现代AI。
信号的高维性:数据的特征数量很多。低维信号可能一两个特征,可以用在二维平面上表示,而高维信号而是成千上万的特征。
在经典理论中,维度越高、数据越稀疏、模型越难学习,但现代AI的实践结果却恰恰相反:
过参数化:当模型的参数数量远远超过数据量时,它反而能更轻松地找到一条平滑的、泛化能力好的路径来拟合数据,而不是死记硬背。
高维几何:这里是一个反直觉,高维空间中的质量几乎完全分布在其表面,现代深度学习能有如此大的成果是因为它创造了一个数据分布的环境,使得复杂的模式分离变得可能,从而支撑了强大的泛化能力。
可泛化的神经符号学方法
神经符号AI将神经网络作为感知并转换为符号,符号AI作为符号推理引擎接受这些符号信息,从而通过逻辑推理给出决策结论。

神经符号AI的三种结合方式
-
符号引导神经:用符号知识(如物理定律)去约束神经网络的学习过程,让它学习更合理、更符合逻辑的表示。
-
神经支持符号:用神经网络作为符号系统的“前端”,负责将现实世界混乱的数据“翻译”成清晰的符号,供符号系统推理。
-
紧密融合:设计一种全新的架构,让神经和符号组件原生地结合在一起,可以端到端地共同学习和推理。
神经符号AI这个有巨大潜力的领域还存在以下的挑战:
可证明的保证
目前的研究开始利用神经符号系统的组合性推导出泛化系统鲁棒性的上下界(性能在最坏的情况能有多差,最好的情况有多好)。
而目前为解决的难题是验证正确性而不仅仅是鲁棒性,我们要从数学上证明一个神经符号系统给出的答案不仅稳定,而且正确。
丰富的表达性
当前神经符号系统的符号部分,通常用知识图片(表示实体间的关系)和命题逻辑(简单命题表达)。
这种方法只能支持有限形式的泛化,对于更复杂、更抽象的概念却无从下手。最近探索了一个更丰富的方法——描述逻辑。它本身就是为捕捉和分类概念、以及概念间的层次关系(泛化!) 而设计的。
组合泛化理论
目前关于神经符号系统的组合性理论在逐渐优化,但是我们缺乏一个关于“如何组合泛化本身”的理论,在符号层面的组合已有成熟理论(父亲母亲概念组合成父母)。
但是如何构成潜在的表征是一个问题,例如我们有两个概念(如“红色”和“圆形”)的嵌入向量,我们如何通过一个数学操作得到新概念(“红色的圆形物体”)的嵌入向量,并保证这个新嵌入的泛化能力是可控和可预测的?
上下文的依赖性
这是决定泛化灵活性的重要因素,人类的泛化是高度依赖上下文的。即在不同情境下同一事物有不同的意义。(这让我想到一个梗,送礼人说意思意思,然后被送礼的说这是什么意思)
目前的挑战在于
-
如何量化上下文之间的距离? 比如,“在厨房”和“在野餐中”这两个上下文,对于“杯子”这个概念的相似度是多少?
-
如何跨上下文应用泛化? 如何知道一个在厨房学到的规则,能多大程度应用于野餐场景?
-
如何识别“过度泛化”? 如何判断一个新上下文已经陌生到不能直接应用旧知识,否则就会犯错?
作者给出的方向是
-
对上下文进行形式化建模:将时间、空间、目的等上下文维度定义为明确的数学变量。
-
复兴“微理论”概念:借鉴CYC项目的思想,将知识组织成层次化的微理论——每个微理论都是一组在特定上下文(如“在餐厅”、“在物理世界”)下成立的公理。
-
神经符号实现:用灵活的神经网络(如LLMs)来学习和表达这些微理论的公理,使系统能动态地选择和应用与当前上下文最相关的知识模块。
持续学习下的泛化
这段的核心是在持续学习新任务的同时,能避免灾难性遗忘,并且保持强大的泛化学习。
趋势:以往针对每一个新任务,都需要从头开始训练模型,而如今却可以基于一个预训练好的模型,对其进行持续调整以学习新数据。
灾难性遗忘:当模型学习新任务的时候,可能会覆盖或者破坏以前学过的东西,作者提出一个反直觉的发现:当模型越大,那么灾难性遗忘的风险也越大。可能这是因为大模型有很强的能力去学习新数据,然后过渡改变原来的策略和记忆。
持续学习与泛化:
持续学习和泛化直接的关系是复杂的,一方面,持续学习的目标是在泛化新任务的同时不忘记旧任务,另一方面,在任务内泛化有助于更快的学习并在持续学习任务重提高性能。
所以模型需要学习底层的特征,这样当上下文变化,这些特征也能很好的泛化到新任务中。
潜在方向
引入符号知识约束:将统计模型与符号AI结合,通过把规则形式化为符号来约束模型,当输入或者输出违反了这个规则就会触发预警信号。
图流中使用神经符号原型。
数据驱动进行回放:通过反复“复习”旧知识来防止遗忘。在训练新任务的同时会加入一部分旧任务的数据(可以通过自监督的方式生成类似旧数据的样本)。
但这种方法需要存储生成旧数据,增加了计算的存储成本。
融合基于实例的表示:将基于实例的表示融合到统计模型中,模型可以动态查询和更新一个记忆库,而不是把知识固定在网络权重里。
这种方法提供了更加自然灵活的方式来增加/遗忘知识。
基础理论的补全:我们在实践方面其实远远超过了理论,例如我们不理解过参数化的模型是如何影响泛化和遗忘,任务之间的相似性如何影响这一过程。目前的理论仅仅适用于非常简单的模型,但是对于大模型这种复杂系统难以给出理论性的支持。
基础模型泛化的评估
目前问题
数据污染:测试数据可能会混入训练集,导致高估模型。
虚假相关:模型从数据中学到的是表面相关,但不是本质因果。
过拟合:模型在特定测试集上表现太好,但泛化能力不行。
四大评估方向
设计更高级的基准测试:设计视觉推理(不看物体,而是理解场景中的关系和规律),类比(测试跨领域转移知识的能力),横向思维(从不同角度解决问题)。
众包:利用线上大量人员来创建和标注数据,这样能快速抽检大规模数据集。但是标注是主观的,会引入标注者的认知和文化偏见。
私有测试集与排行榜:组织一个私有服务器(公开训练集不公开测试集),研究人员只能提交模型在私有服务器运行。虽然这个方法有效能防止过拟合和数据污染,保证评估公平,但是缺少标准化,不同排行榜(针对特定的任务)的规则、数据集、指标都不同且维护成本高。
仿真与合成数据:使用模拟环境来生成无限、可控的测试数据。但是模拟器的仿真和真实世界还是有一定差距,容易出现在仿真效果好,但是在真实世界中表现结果差。
核心问题
上面无论哪一种方向,都要面临“可复现问题”(每个人都能用论文中的方法和材料获取相似的结果),在AI领域尤其是大模型领域,由于代码/数据不公开,计算成本高、API私有模型、深度学习的随机性都会导致复习困难。
解决思路:
设计模型卡和数据卡:像产品说明书一样写一份模型的详细情况、使用数据和局限性。
可复现清单:基于社区共识制定清单,确保论文包含了足够的信息让其他人复现实验。
未来人机团队泛化对齐
一些人工智能的法律法规要求透明的工作流程,而在解释时人类和AI直接联系的重点。
失调(人机分歧)和重排(重对齐)难点
根据前面所说,当人类和AI协同工作的时候容易被AI“带偏”,导致目标是解决问题,结果变成交流会议。
作者提出需要建立实时再对齐与纠错机制。这要求协作必须深入到过程层面,即双方要能就所使用的概念和关系进行沟通。
在语言的方面的重排例如:通过多轮对话和互动,双方的概念和定义自然趋同。例如,医生问:“你为什么认为是类型1?你所说的‘边界不规则’是指这样吗?”通过问答,双方对“边界不规则”这一概念达成共识。
还有物理信息模型:将物理定律(如物体永久性)嵌入AI,使其预测更符合人类对世界的基本认知,从而减少根本性的分歧。
对齐推理范式
这个是一个重大挑战,将人类的因果模型(为什么)和AI的统计模型(是什么)对齐。解决这个问题的大致方向是创造一个共同解释语言,也就是一个中介翻译官,让双方都能理解对方的意思。
-
基于概念的解释:将AI的黑箱决策,映射到人类可理解的概念上(如“这个预测80%基于‘细胞核分裂’特征”)。
-
考虑关系的解释:不仅解释概念,还解释概念之间的关系(如“因为‘细胞核分裂’与‘恶性程度’高度相关,所以预测为恶性”)。
评估人机团队的整体表现
在现在人机交互特别是具身智能越来越火热,我们不仅需要评估AI,还需要评估人机团队整体,不过目前研究这方面还是很少的。例如团队是否高效、准确完成任务(任务结果),在团队协作的过程中人类是否信任AI,协作任务是否顺畅(任务过程),这种协作模式长期下去对人是有益还是阻碍(长期影响)。
目前的用于人类的评估框架:人类增强AI(手工数据标注)、帮助人类的AI(问答)、平衡协作双方贡献(共同完成决策)。
核心问题:虽然有一些方面的研究,但是我们仍不知道如何评估整个团队的泛化能力。
总结
最后总结这篇论文,以下是我总结的思考
Q:为什么要实现人与AI的泛化能力对齐?如果不对齐有多大影响?
A:从自动驾驶的方向入手,一个接受正常路况训练的AI,如果无法像人类一样泛化理解“孩子可能会突然跑上马路”这一常识,那么当它遇到训练数据中未曾出现的、一个皮球滚到路上的情况时,它可能不会像人类司机一样预见到风险而提前减速,从而酿成事故。可见泛化的对齐是保证AI可信任的前提。实现人机泛化对齐,其本质是防止AI在陌生环境中因“愚蠢”而犯错、让AI成为无缝集成、心领神会的得力伙伴、确保AI的“智能”在合乎伦理的轨道上发展,为人类服务。
Q:现在的AI有什么局限性?
A:当前的AI本质是一个统计模式,而非真正的思考和推理,他可以对文章进行很好的总结,但是却无法提出全新的科学理论,在依赖庞大的数据和算力成本越来越表明其性能的提升速度已大不如前,还有深度学习中的“黑箱”,导致我们不能理解模型的内部决策,比如幻觉的发生,让我们难以信任,这在医疗、金融等高风险领域是很大的隐患。
Q:发展的新方法在哪?
A:首当其冲的就是要超越统计模型,追求因果与理解,让模型不仅知道是什么,而且要知道为什么,这里神经符号AI和因果推理将是一个新兴方向;其次从最近的具身智能发展,我们让AI拥有了可与真实物理环境交互的媒介,所以我们要从被动给AI喂知识到让AI主动去探索交互获取知识和概念;然后是打开黑箱,让人类能理解AI的内部决策,更信任AI和让AI与人的能力对齐,更像“人”;最后则是更宏大的方向,我们要从自然中寻找一个新的计算架构,从人脑的脉冲神经网络和量子计算的特征,找到一个更高效、更灵活的架构。
总而言之,这篇论文让我们从头思考AI的新方向,AI不只是能力的提升,还有让它更加聪明、可靠、值得信赖。
更多推荐


所有评论(0)