用F1赛车与万智牌考验AI科学家:新基准发现AI不缺创意、缺「求真筛选」
牛津大学用F1与万智牌真实世界领域评测AI科学家:AI不缺创意,缺的是筛选与求真能力。
牛津大学用F1与万智牌真实世界领域评测AI科学家:AI不缺创意,缺的是筛选与求真能力。
OmniQEC用大语言模型作为编排器,以快慢协同工作流自动发现硬件友好的量子纠错码,性能超越现有BB码。
Distilled RL:将教师知识直接融入RL梯度的大语言模型后训练新框架,跨家族蒸馏中性能显著超越传统RL和OPD方法。
MemOps新基准系统评估LLM智能体在长对话中的全生命周期记忆操作,揭示不同模型记忆能力的关键差异。