前沿科学转载 Distilled RL:融合教师知识的新型大语言模型后训练框架 作者admin 2026-07-212026-07-29 Distilled RL:将教师知识直接融入RL梯度的大语言模型后训练新框架,跨家族蒸馏中性能显著超越传统RL和OPD方法。