用F1赛车与万智牌考验AI科学家:新基准发现AI不缺创意、缺「求真筛选」
【前沿科学转载】
【编者按】如何给”AI科学家”打分?现有评测大多用合成任务或回顾性课题,AI很容易”背答案”。牛津大学团队另辟蹊径:用两个快速演化、充满对抗的真实世界领域——F1方程式赛车设计与万智牌卡牌竞技——来当AI科学家的”考场”,结果发现:AI并不缺创意,缺的是”求真筛选”的能力。本文带你解读这项入选ICML 2026 AI for Science研讨会的最新研究。
论文摘要:评测AI科学家提出新颖想法的能力是出了名的困难。现有基准虽在评估科学推理与研究复现方面取得进展,但往往依赖合成任务或回顾性目标,可能因先验暴露而产生混淆。研究团队提出假设:复杂、对抗性、快速演化的真实世界领域——其中专家从业者独立产出可观测成果——可以为填补这一空白提供实用解决方案,从而评估AI科学家所需的能力,包括推理、新颖性与假设提出。团队在两个结构迥异的领域进行了验证:其一是F1方程式赛车,让模型围绕2026赛季赛车设计概念展开构思,并以真实的季前创新作为标准答案;其二是万智牌(Magic: The Gathering, MTG),让模型从近期更新的卡池中提出卡组,并以19份职业巡回赛(Pro Tour)牌表作为评估基准。
结果显示:在两个领域中,模型都能产出看似合理的输出,但很少有输出与真实世界的专家方案吻合。在F1领域,表现最好的模型GPT-5.2在多次运行中共提出166个构想,其中仅10个与40项真实创新吻合;在万智牌领域,Gemini 3 Flash提出的最佳卡组找回了第三名职业牌表中的7张新卡中的5张;而在全部108副卡组中,模型最常选择的卡牌与职业巡回赛牌表最广泛采用的卡牌高度相关(Spearman ρ=0.74, p=0.0003)。这些结果表明:AI科学家的关键能力缺口并非想法生成,而是筛选(filtering)、优先级排序(prioritization)与连贯的新颖性(coherent novelty)。
科学意义:这项研究为AI科研能力评测提供了可复现、抗污染的新范式——用真实世界快速演化的领域当”试金石”,让AI与人类专家在同一竞技场上较量。其结论也为下一代AI科学家系统指明方向:与其堆砌更多”点子”,不如教会AI如何像真正的科学家一样”去伪存真”。
来源:
📄 arXiv:2608.03569 — “Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities”
👥 作者:William Bolton, Philip Torr(牛津大学)
🏷️ 分类:cs.AI(人工智能)、cs.LG(机器学习)
📅 提交日期:2026-08-04(已入选ICML 2026 AI for Science研讨会)
科学小舟观点点评(观点相同,支持我们理论):这项研究的结论与《科学小舟新科学》的核心主张不谋而合,堪称对书中观点的又一实证支持。书中反复强调:”正确的理论离不开正确的实验验证,成功的实验也离不开正确的理论指导”——而本研究恰恰用真实世界、可独立验证的对抗性领域(F1、万智牌)来检验AI的科学能力,这正是”将未知与已知相比较”的类比检验法在AI时代的科学应用。更耐人寻味的是其发现:AI生成想法的能力已经很强,短板在于筛选、验证与取舍——这与书中对现代科学界的批评如出一辙:缺乏哲学思维、只重”生成”不重”求真”的科研,最终只会”沦为已有科学的复印机或复读机”。科学小舟认为,无论AI还是人类,真正的科学进步都源于正确哲学指导下的验证与筛选,AI科学家若想从”点子机器”升级为”真理发现者”,就必须补上这堂”求真课”。
