张洳源课题组:让AI像人类一样"举一反三"

—心理自举法实现人类水平的概念学习

 从婴儿在连续的语音流中自发切分出词语,到孩子只用几个例子就学会一个新概念,人类大脑似乎天生擅长从稀疏、多样的经验中抽取抽象规律。这种“无师自通”的能力,体现为无需明确标签、仅凭有限样例即可归纳抽象概念并灵活迁移至新情境。它向来被视为人类智能的显著标志,也长期是人工系统难以逾越的认知屏障。

2026年8月28日,北京大学心理与认知科学学院、IDG麦戈文脑科学研究所张洳源研究员课题组,联合中山大学杨凌霄、谢晓华和赖剑煌,北京师范大学甄宗雷等合作者,在《Science Advances》发表题为"Mental bootstrapping enables human-level concept learning in self-supervised deep models"的研究论文。该研究受人类认知发展中"心理自举"(mental bootstrapping)机制的启发,提出了一种全新的自监督学习框架SSLvMB,让深度学习模型像人类一样"先学简单、再解复杂",在多项抽象视觉推理任务中达到甚至超越了人类水平。

图片1.png

图1. 瑞文推理(Raven’s Progressive Matrix, RPM)与Bongard问题示例。在RPM问题中,观察者需从8个上下文图像中识别抽象规律,并从8个选项中选出正确图像补全3×3矩阵;在Bongard问题中,观察者需从12张正例/反例图像中归纳出隐藏概念,再判断新图像属于哪一类。

抽象概念学习:AI的"阿喀琉斯之踵"

人类不仅能识别"这是一只猫",更能理解"这只猫比那只大""圆形在三角形左边"等抽象关系。当前机器学习模型在图像识别、自然语言处理等领域已取得惊人进展,但面对抽象关系概念时,往往仍依赖海量标注数据进行暴力训练。

如何公平地比较人类与机器的抽象概念学习能力?心理学和神经科学指出瑞文智力测试(Raven's Progressive Matrices, RPM)和Bongard问题被公认为理想的"智力试金石"。这些任务使用符号化的视觉刺激,而非自然图像,能最大程度减少文化和语言背景的影响。在RPM问题中,受试者需从8个上下文图像中识别出行或列之间的抽象规律(如颜色递进、形状恒常、大小变化等),并从8个候选图像中选出正确选项补全3×3矩阵。Bongard问题则更具挑战性:受试者只能从6张正例和6张反例图像中归纳出隐藏概念,再判断新图像是否符合该概念——这要求真正的"小样本概念学习"。

向人类学习:"心理自举"的智慧

认知科学研究表明,人类学习复杂概念时并非从零开始,而是通过"心理自举"——将已掌握的简单概念作为积木,逐步搭建更复杂的知识结构。例如,儿童先学会"一、二、三"和递增规则,便能自举出无限整数概念;先掌握基本形状和颜色,便能更快理解"红色三角形在蓝色圆形左边"这样的复合概念。

然而,将这种"由简入繁"的学习机制引入机器的自监督学习,面临一个根本挑战:机器不像人类那样"天生知道"什么概念更简单。为此,研究团队设计了一套巧妙的"问题简化"策略,将复杂的完整推理任务转化为结构相同但认知负荷更低的简化版本。

图片2.jpg

图2. SSLvMB的核心思想。训练阶段,模型在简化问题上学习概念一致性(如RPM中只用两行上下文而非三行);测试阶段,模型将学到的抽象表示推广到完整问题。这模仿了人类从简单概念自举到复杂推理的过程。

SSLvMB:先解"简化题",再攻"完整题"

研究团队提出的SSLvMB(Self-Supervised Learning via Mental Bootstrapping)框架包含两个核心设计:

第一,问题简化与伪样本构造。针对每一个RPM问题,研究团队对第一和第二行的某一图像位置进行随机遮盖,并将该位置所对应的图像作为正确备选答案,由此构成当前RPM问题的简化本本;针对每一个Bongard问题,则从正例和反例中各随机剔除一个样本,将提出的作为候选图像,由此构造出只含10个上下文信息的简化问题。这种设计保留了原始问题的组合结构,但降低了关系复杂度,这正如人类在信息不完整时仍能提取部分规律。

第二,概念归纳模块(CIM)。简化后的多图像特征被送入CIM,该模块通过特殊的"概念卷积"同时建模跨图像的依赖关系和空间特征,提取出抽象的概念级表征。整个训练过程完全自监督,不依赖任何人工标注的概念标签。

超越现有方法,比肩乃至超越人类

研究团队在12个数据集上进行了系统评估,涵盖分布内概念归纳、分布外概念泛化和小样本概念学习三大核心能力。

在分布内概念归纳上,SSLvMB在RAVEN、I-RAVEN、RAVEN-FAIR和PGM-Neutral四个数据集上平均准确率达到82.3%,远超此前最好的自监督方法NCD(47.2%)和PRD(45.6%)。尤其值得注意的是,SSLvMB仅使用127万参数,比竞争对手小近一个数量级。

在分布外概念泛化上,研究人员使用PGM数据集的七个OOD子集进行测试,这些子集专门测试模型能否将学到的概念迁移到训练时从未见过的属性组合上。SSLvMB在七个子集上的平均准确率达到30.9%,在插值(Interpolation)任务上更是达到62.1%,显著优于现有方法。

在小样本概念学习上,研究人员在极具挑战性的Bongard-LOGO数据集进行测试,,SSLvMB作为无监督方法,竟超越了所有有监督的竞争对手:在自由形状(FF)、基础形状(BA)和组合形状(CM)三个测试集上均取得最佳表现,平均准确率达78.3%。

图片3.jpg图3. 人类与SSLvMB在各项任务上的直接对比。蓝色为人类表现,斜纹为模型表现。SSLvMB在I-RAVEN、RAVEN-FAIR、PGM-Neutral、PGM-Interpolation和Bongard-LOGO的BA、CM、NV等任务上达到或超越人类水平。

更引人注目的是,研究团队还招募了人类被试,在完全相同的刺激和任务条件下进行测试。结果显示,SSLvMB在绝大多数任务上达到甚至超越了人类表现,例如在I-RAVEN、RAVEN-FAIR、PGM-Neutral和PGM-Interpolation等任务上显著优于人类所有任务的平均准确率,SSLvMB达到72%,而人类为54%。

这一结果挑战了"人类在抽象推理上具有绝对优势"的传统假设。研究者分析,人类虽然擅长视觉属性识别,但在从海量候选规则中搜索正确概念时受限于认知资源;而SSLvMB通过结构化简化和概念卷积,有效约束了假设空间,使抽象归纳更加高效。

中山大学系统科学与工程学院杨凌霄副教授为第一作者,北京大学心理与认知科学学院、IDG麦戈文脑科学研究所张洳源研究员为论文通讯作者。北京大学前沿交叉学科研究院博士生吕沐阳、上海交通大学硕士生王滢洁为共同作者;中山大学计算机学院谢晓华教授和赖剑煌教授,北京师范大学心理学部甄宗雷教授做出了重要贡献。研究得到国家自然科学基金专项基金、上海市教育委员会、广东省信息安全技术重点实验室、北京大学中央高校基本科研业务费等资助。

原文链接

https://www.science.org/doi/10.1126/sciadv.aeae7202