Distilled RL:融合教师知识的新型大语言模型后训练框架
【前沿科学转载】
大语言模型(LLM)后训练是提升模型推理、指令遵循和任务适应能力的关键环节。传统的强化学习(RL)方法存在粗粒度奖励带来的信用分配难题,且难以向学生模型引入其策略中缺失的新知识。另一方面,同策略蒸馏(OPD)虽然提供更密集的token级反馈,但无条件KL散度优化导致教师在相似时知识增益有限、在差异过大时噪声干扰严重。
发表于arXiv的最新论文提出了Distilled Reinforcement Learning(Distilled RL),一种将教师知识直接融入RL梯度的统一后训练框架。该框架包含三个核心组件:
(1)逆重要性采样(Reverse Importance Sampling):计算教师策略对每个学生生成token的相对偏好程度,并通过裁剪防止梯度不稳定放大;
(2)负样本重置(Negative Sample Reset):仅对具有正优势的响应应用基于教师的重新加权,对负样本保持原始重要性权重,避免学生沿负向轨迹模仿教师偏好;
(3)序列级几何归一化(Sequence-Level Geometric Normalization):对裁剪后的token级比率进行归一化,使其几何均值为1,保留教师对token的相对偏好差异。
通过精准设计对照实验,研究团队证明了Distilled RL能够有效将教师模型中的”新知识”转移给学生——这是标准RL无法实现的关键能力。跨模型系列(cross-family)蒸馏实验中,传统的OPD方法因教师-学生分布不匹配而性能显著下降,而Distilled RL在pass@1和pass@k两个指标上均稳定超越RL和OPD基线。
这一工作为LLM后训练开辟了新范式:将教师从”无条件模仿目标”转变为”选择性细粒度引导者”,在保留RL探索优势的同时引入密集知识信号,为大模型的高效对齐和推理能力增强提供了重要的技术路径。
来源:
📄 arXiv:2607.17247 — “Distilled Reinforcement Learning for LLM Post-training”
👥 作者:Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue Wang
🏷️ 分类:cs.LG, cs.AI
📅 提交日期:2026-07-19
