SciDisco:可扩展的科学发现智能体训练框架——让AI在可验证环境中自主做科研

【前沿科学转载】

大语言模型(LLM)智能体在数据驱动的科学发现任务中展现出巨大潜力——它们可以与执行环境交互、分析数据并产出统计结论。然而,长周期的科学分析一直受限于一个关键瓶颈:缺乏建立在真实科学数据之上的”过程监督”训练环境,导致智能体难以学会严谨、可验证的科学推理路径。

来自清华大学等机构的研究团队近日在arXiv发表论文,提出了SciDisco——一个可扩展的科学发现智能体训练框架。该框架的核心思想是:把科学发现过程转化为智能体可以在其中”边做边被检查”的强化学习环境,从而让智能体在真实数据的推理过程中学会如何做科学。

SciDisco由三个关键组件构成:SciThèque将研究假设、数据集、隐藏证据图和验证器编译为任务环境,在智能体交互过程中即可实时检查其分析进度是否产生可验证的证据;DAG锚定的轨迹合成(DAG-grounded trajectory synthesis)利用这些环境构建经过验证器过滤的多轮演示数据;DiscoPO则以环境本身作为训练信号来源,将回合级信用分配给那些产生可验证分析证据的动作,实现精细的回合级强化学习。

实验结果表明,基于该框架训练的SciDisco-14B模型在假设驱动的科学数据分析基准测试上达到了当前最优水平(state-of-the-art),证明了即使参数量不大,经过过程可验证环境训练的智能体也能展现出卓越的科学推理能力。

这项工作的深远意义在于:它为”AI科学家”的规模化训练开辟了可行路径——不再依赖昂贵的人工标注,而是通过自动化验证器提供密集的监督信号。随着更多科学领域(生物信息、材料、天文等)构建起可验证的环境,AI有望在真实科研场景中承担越来越多的分析任务。

来源:
📄 arXiv:2607.28990 — “Scaling Scientific Discovery Environments for Turn-Level Agentic RL”
👥 作者:Yucheng Xu, Keyi Zhang, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu
🏷️ 分类:cs.AI(人工智能)
📅 提交日期:2026-07-31

— 分享本文 —

类似文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注