HuggingFace Papers 2026-06-30
数据来源:HuggingFace Papers
Latest Papers
1. AsyncOPD: How Stale Can On-Policy Distillation Be?
Abstract:On-policy distillation (OPD) trains a student on its own rollouts guided by teacher feedback and is becoming increasingly important for large language model (LLM) post-training. Like reinforcement learning (RL), however, OPD faces an on-policy systems bottleneck, as rollouts can dominate training time for reasoning workloads. Asynchronous training pipelines can alleviate this bottleneck by decoupling rollout generation from learner updates, but doing so introduces stale-policy data. While prior work has studied stale data in asynchronous RL, its effects in OPD remain underexplored. We present the first systematic study of staleness in asynchronous OPD, focusing on a practical setting where teacher feedback is implemented through local KL losses and full-vocabulary teacher logits are too expensive to store or transfer, necessitating finite teacher-score caches. We first show that KL direction changes the stale-data problem: teacher-weighted forward KL is more robust to stale rollouts, whereas student-weighted reverse KL is vulnerable. Second, for this vulnerable reverse-KL case, we study whether methods designed to stabilize asynchronous RL can mitigate OPD staleness. In our experiments, they do not improve over a simpler OPD-specific surrogate: recomputing the reverse-KL signal under the current student at learner time. Third, we analyze how finite teacher-score caches create a bias-variance tradeoff for sparse and sampled reverse-KL OPD estimators. This motivates multi-sample Monte Carlo (MC), which preserves MC correctability while reducing one-sample variance. Finally, we present and open-source AsyncOPD, a fully asynchronous OPD training pipeline built from these estimator choices. Experiments show that AsyncOPD improves training throughput by $1.6\times$ to $3.8\times$ over strict synchronous training while reaching comparable accuracy.
中文摘要
摘要:策略内蒸馏(On-policy distillation, OPD)通过学生自身的 rollout 并在教师反馈的指导下进行训练,正在成为大语言模型(LLM)训练后阶段越来越重要的技术。然而,像强化学习(RL)一样,OPD 面临策略内系统瓶颈,因为 rollout 可能会主导推理工作负载的训练时间。异步训练管线可以通过将 rollout 生成与学习器更新解耦来缓解这个瓶颈,但这会引入过时策略数据。虽然此前的工作研究了异步 RL 中的过时数据,其在 OPD 中的影响仍未被充分探索。我们首次对异步 OPD 中的过时性进行了系统研究,聚焦于一种实际场景,其中教师反馈通过本地 KL 损失实现,而全词表教师 logits 的存储或传输成本过高,因此需要有限的教师评分缓存。我们首先展示了 KL 方向如何改变过时数据问题:教师加权的前向 KL 对过时 rollouts 更具鲁棒性,而学生加权的反向 KL 则容易受到影响。其次,对于这种易受影响的反向 KL 情况,我们研究了旨在稳定异步 RL 的方法是否能缓解 OPD 的过时性。实验表明,它们并没有优于一个更简单的 OPD 特定替代方法:在学习器时间基于当前学生重新计算反向 KL 信号。第三,我们分析了有限教师评分缓存如何为稀疏和采样的反向 KL OPD 估计器带来偏差-方差权衡。这促使我们采用多样本蒙特卡洛(MC)方法,它在降低单样本方差的同时保持 MC 可纠正性。最后,我们提出并开源了 AsyncOPD,一种完全异步的 OPD 训练管线,构建于这些估计器选择之上。实验表明,AsyncOPD 相比严格同步训练,将训练吞吐量提高了 $1.6\times$ 到 $3.8\times$,同时达到相当的准确率。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文试图解决大规模语言模型(LLM)后训练中On-policy Distillation (OPD)的系统效率瓶颈问题,具体聚焦于如何在引入异步训练以提升吞吐量的同时,有效处理由此产生的**陈旧策略数据(stale-policy data)**问题。
核心问题可分解为以下三个层面:
1. 异步OPD中的陈旧数据鲁棒性问题
OPD与强化学习(RL)类似,面临”on-policy系统瓶颈”:每次模型更新必须等待当前策略生成的fresh rollouts完成,这在推理任务中耗时巨大。异步训练通过解耦rollout生成与learner更新来缓解瓶颈,但会引入策略滞后(rollout生成时的旧策略与更新时的当前策略之间的差异)。论文首先识别到:
- KL散度方向决定了对陈旧数据的敏感度:教师加权的前向KL (Forward KL) 对陈旧rollouts相对鲁棒
- 学生加权的反向KL (Reverse KL) 则因依赖学生当前策略的支持集(support)而易受陈旧数据影响
2. 异步RL稳定方法向OPD的迁移有效性
针对脆弱的反向KL场景,论文检验了为异步RL设计的先进稳定化方法(如Decoupled PPO、M2PO等)是否能有效缓解OPD中的陈旧性问题。研究发现:
- 这些方法并不能比简单的OPD特定替代方案(即在learner时刻重新计算反向KL信号而不使用PPO裁剪)表现更好
- 需要重新计算优势函数 Aθ 而非使用行为策略时刻的冻结优势 A(old)
3. 有限教师缓存约束下的估计器设计
在实际系统中,完整的教师词汇表logits过于昂贵无法存储或传输,必须使用有限的教师分数缓存。这引发了偏差-方差权衡:
- 稀疏Top-k方法:使用陈旧的学生Top-k支持集会因支持集不匹配(support mismatch)而产生偏差
- 单样本蒙特卡洛(MC):通过重要性采样保持无偏性,但方差过高
- 多样本MC:在保持MC可校正性的同时降低方差,是异步OPD中的优选方案
最终,论文基于上述发现实现了AsyncOPD系统,在Qwen3模型上实现了1.6倍至3.8倍的训练吞吐量提升,同时保持与同步训练相当的准确率。
Q: 有哪些相关研究?
论文在第3页的”Related Works”章节系统梳理了相关研究,主要可分为以下四个方向:
1. On-Policy Distillation (OPD)
这类工作是本文的直接研究基础,关注如何在学生模型自身生成的rollouts上进行蒸馏:
- GKD
1
:首次提出token级KL散度形式的OPD框架 - MiniLLM
6
:研究了序列级反向KL变体 - Li et al.
11
:分析了token级OPD的训练动态和不稳定配置的解决方案 - TIP
22
:通过学生熵和教师-学生散度表征token重要性 - G-OPD
25
:将token级OPD解释为稠密KL约束的RL,并引入奖励缩放机制 - 自蒸馏与多教师蒸馏:近期研究表明OPD不仅适用于大教师向小学生蒸馏,还支持on-policy自蒸馏
32
和从与学生规模相当的领域专业教师进行多教师蒸馏
2, 21
2. Asynchronous Reinforcement Learning (异步RL)
这些工作缓解了同步RL中的生成-训练耦合瓶颈,为AsyncOPD提供了系统架构灵感:
- Async RLHF
14
:通过重叠生成与学习阶段,使新样本在learner训练早期样本时并行产生 - StreamRL
34
:将RLHF流水线进一步解耦为流式阶段 - AReaL
4
:完全解耦rollout workers与训练workers,实现连续异步执行 - Laminar
18
:使用细粒度权重同步实现轨迹级异步
3. Asynchronous RL的稳定化方法
针对异步执行中陈旧策略数据导致的训练不稳定问题,现有研究提出了多种策略梯度替代方案:
- Decoupled PPO
4
:将用于陈旧rollouts的行为策略与锚定PPO更新的近端策略分离 - M2PO
33
:利用二阶矩重要性权重约束稳定陈旧更新 - A-3PO
10
:通过陈旧性感知插值降低Decoupled PPO的开销
4. Asynchronous OPD
直接针对异步OPD系统的探索:
- VeRL
19
:实现了k-step-off OPD调度器,通过将rollout滞后固定为1-2个learner步骤来重叠学生rollout、教师评分和learner更新,验证了异步OPD的可行性,但未深入分析陈旧教师缓存下的估计器行为 - KDFlow
29
:通过解耦教师推理与learner训练并传输教师隐藏状态来提升蒸馏效率,但针对同步OPD设计,将异步执行留作未来工作
本文与上述工作的区别:现有OPD研究假设rollout、教师评分和learner更新保持同步;现有异步RL研究针对奖励反馈接口设计,而OPD具有不同的反馈接口(通过局部KL损失实现教师反馈)。本文首次系统研究了带有限教师缓存约束的异步OPD中的陈旧数据问题,并提出了专门的估计器设计方案。
Q: 论文如何解决这个问题?
论文通过系统性分析KL方向对陈旧数据的敏感性、设计专门的Reverse-KL策略梯度替代方案、以及提出多样本蒙特卡洛估计器来解决异步OPD中的核心挑战,最终构建出高效的AsyncOPD训练系统。具体解决方案如下:
1. 基于KL方向差异的针对性策略
论文首先识别出KL散度方向决定了对陈旧rollouts的鲁棒性:
- Forward KL(教师加权):对陈旧数据天然鲁棒,因其权重由教师策略 q 决定,不依赖于学生当前策略的支持集
- Reverse KL(学生加权):脆弱,因其依赖于学生当前策略 p_θ 的支持集,而陈旧缓存可能缺失当前学生需要评估的动作
因此,论文将后续分析重点置于Reverse KL的鲁棒性改进上。
2. Reverse-KL的策略梯度替代方案设计
针对Reverse KL在陈旧数据下的训练稳定性,论文通过理论分析和实验验证,确定了最优的策略梯度替代方案:
核心发现:最有效的替代方案是在learner时刻重新计算当前策略的优势函数 A_θ 且不进行PPO裁剪。
具体而言,对于从陈旧策略 p(old) 采样的动作 a ,使用以下目标函数:
L(noclip)^(θ)(θ) = -E(asim p_old) [ rhoθ(a, s) · sg(Aθ(a, s)) ]
其中 rhoθ(a, s) = (pθ(a|s)) / (p(textold))(a|s) 为重要性采样比率, Aθ(a, s) = log q(a|s) - log pθ(a|s) 为重新计算的当前优势函数。
论文验证了这一简单OPD特定的替代方案优于为异步RL设计的先进方法(如Decoupled PPO
4
和 M2PO
33
),后者引入的裁剪或二阶矩约束在此场景下并无益处。
3. 有限教师缓存下的估计器设计
针对无法存储完整教师词汇表logits的约束,论文解决了稀疏实现与采样实现中的偏差-方差权衡:
问题诊断:
- 稀疏Top-k:使用陈旧学生支持集 TopK(p_(old)) 缓存教师分数,会导致支持集不匹配(support mismatch)——当前学生需要的动作可能不在缓存中,且无法通过重加权恢复缺失的教师分数
- 单样本蒙特卡洛(MC):通过从 p_(old) 采样动作并使用重要性采样校正,可在期望上保持无偏,但方差过高
解决方案:多样本蒙特卡洛(Multi-sample MC) 在每个解码时间步,从行为策略 p(old) 采样 m 个局部动作(而非仅1个),缓存这些动作及其教师分数。在learner时刻,使用平均的重要性采样校正梯度:
L(MC)^m(θ; s) = -(1) / (m) ∑(i=1)^m rhoθ(ai, s) · sg(Aθ(a_i, s))
该方法保留了MC估计的可校正性(correctability),同时通过多样本平均将方差降低约 1/m (实验显示 m=64 时序列级方差降低至单样本的11.2%)。
4. AsyncOPD系统实现
基于上述估计器选择,论文构建了完全异步的OPD训练管道:
- 架构设计:采用与AReaL
4
类似的流式架构,重叠学生rollout、教师评分和learner更新三个阶段 - 调度策略:使用流式调度器(streaming scheduler)替代传统的批处理障碍(batch barriers),允许rollout workers持续生成数据,仅在权重同步时暂停
- 队列管理:实现基于信号量的深度控制(queue-depth parameter τ ),在保持FIFO顺序的同时限制未消费rollout的积压深度
实验表明,该系统在Qwen3-Base模型上实现了1.6倍至3.8倍的训练吞吐量提升,同时保持与严格同步训练相当的最终准确率。
Q: 论文做了哪些实验?
论文进行了系统性的实验验证,涵盖从算法组件消融到完整系统评估的多个层次。主要实验如下:
1. 基础实验设置
- 模型:学生模型主要使用 Qwen3-4B-Base(算法实验),并在系统实验中扩展至 Qwen3-{1.7B, 4B, 8B}-Base;教师模型为 Qwen3-30B-A3B-Instruct-2507
- 数据:训练使用 DeepMath 数据集(过滤后 57,630 道难度≥6 的数学题);评估使用 AIME24、AIME25 和 AMC 2023
- 指标:Avg@32(每题采样 32 次的平均通过率)、训练吞吐量(tokens/second)、流水线重叠度(concurrent OPD-stage activity)
- 硬件:单节点 8×B200 GPU,使用 vLLM 进行推理,PyTorch FSDP 进行训练
2. KL 方向对陈旧数据的敏感性实验
目的:验证 Forward KL 与 Reverse KL 在异步环境下的鲁棒性差异。
- 方法:对比稀疏 Top-k Forward KL 与 PPO-style Reverse-KL 在不同程度的陈旧数据(staleness 从 0 到 128)下的表现
- 结果(Figure 2):
- Reverse KL 在零陈旧度时准确率更高,但随陈旧度增加快速下降
- Forward KL 准确率曲线更为平坦,对陈旧数据更鲁棒
- 在高陈旧度(如 128)时,Forward KL 反超 Reverse KL
3. Reverse-KL 策略梯度替代方案消融实验
目的:确定 Reverse KL 在陈旧数据下的最优策略梯度估计方法。
- 2×2 消融(Figure 3, Table 1a):
- 优势函数选择:冻结行为策略优势 A(old) vs 重新计算当前优势 Aθ
- 比率裁剪:使用 PPO 裁剪 (clip) vs 不使用裁剪 (no clip)
- 发现: A_θ without clipping 在所有陈旧度下表现最稳定,斜率最小(-0.69 vs -1.44 for AIME24)
- 与先进异步 RL 方法对比(Figure 4, Table 1a):
对比方法:Decoupled PPO
4
、M2PO
33发现:这些为异步 RL 设计的复杂替代方案未能超越简单的 A_θ without clipping 基线
- 重要性采样比率分析(Figure 5):
- 验证重新计算 Aθ 显著降低了重要性采样比率 rhoθ 的 99th percentile 尾部风险
4. 缓存支持集与估计器设计实验
目的:解决有限教师缓存下的偏差-方差权衡。
- 稀疏 Top-k vs 蒙特卡洛 (MC)(Figure 6):
- 对比:稀疏 Top-k(有/无重加权)vs 单样本 MC(有/无 IS 校正)
- 发现:单样本 MC with IS 校正显著优于 Top-k 方法;Top-k 的重加权无法修复支持集不匹配问题
- 多样本 MC 效果验证(Figure 7, Table 1b):
- 对比不同样本数:MC1、MC4、MC16、MC64
- 发现:增加样本数(特别是从 1 到 4)显著改善大陈旧度下的准确率;MC64 在高陈旧度下最稳定
- 方差量化分析(Table 6):
- 测量固定前缀和序列级方差比率
- MC64 将固定前缀方差降至单样本的 1.49%,序列级方差降至 11.2%
- IS 校正必要性验证(Figure 10):
- 对比 MC1/MC16 with/without IS 校正
- 证明增加样本数(降低方差)与 IS 校正(修正偏差)是互补的,两者都需要
5. AsyncOPD 系统端到端实验
目的:验证完整异步系统的训练效率和最终模型质量。
- 调度器对比(Table 2, Figure 11):
- 对比方案:Strict sync(严格同步)、Two-step-off(VeRL 风格,固定 2 步滞后)、AsyncOPD(本文流式调度器)
- 变量:Qwen3-{1.7B, 4B, 8B}-Base 学生模型,MC64 和 MC1 两种估计器设置
- 关键结果:
- 吞吐量:AsyncOPD 实现 1.6× 至 3.8× 的加速(MC64 下 1.7B 模型达 3.28×,MC1 下达 3.28×-3.8×)
- 流水线重叠度:AsyncOPD 达到 2.07-2.56,显著高于 Two-step-off(1.49-1.78)和 Strict sync(~0.8)
- 准确率保持:在吞吐量大幅提升的同时,最终 AIME24 Avg@32 准确率与同步训练相当或更优(如 4B-Base MC64 达 25.00,匹配同步训练的 25.00)
- 附加模型验证(Table 7, Figure 12):
- 对非 Base 的 Qwen3 模型(thinking disabled)重复实验
- 确认 AsyncOPD 在 1.7B、4B、8B 规模上均保持最高吞吐量和可比准确率(最高达 3.82× 加速)
Q: 有什么可以进一步探索的点?
基于论文的”Limitations and Future Work”章节及研究讨论,以下是值得进一步探索的方向:
1. 稠密KL(Dense Full-Vocabulary KL)的异步实现
当前研究聚焦于稀疏Top-k和蒙特卡洛估计器,因其在有限教师缓存下的实用性。然而,稠密KL(在整个词汇表上计算)天然避免支持集不匹配问题。挑战在于:
- 如何在解耦的rollout、教师评分和learner更新阶段高效实现
- KDFlow
29
提出了传输教师隐藏状态并重新计算学生logits的路径,但仅针对同步OPD设计 - 开放问题:将该方法扩展至异步场景,同时处理陈旧rollouts并保持高吞吐量
2. 大规模多节点集群扩展
当前实验受限于单节点8-GPU环境(资源约束而非架构约束):
- AsyncOPD的流式架构理论上支持横向扩展,但需验证在多节点、多机环境下的:
- 权重同步开销与延迟隐藏策略
- 教师评分的分布式部署优化
- 队列深度与网络带宽的联合调优
3. 自适应或混合KL目标设计
论文发现Forward KL对陈旧数据鲁棒但准确率上限可能受限,Reverse KL准确率高但易受陈旧性影响:
- 动态KL方向选择:根据当前陈旧度水平自适应切换或插值Forward/Reverse KL
- 替代散度度量:探索JS散度、Wasserstein距离或f-散度在异步OPD中的行为,寻找对陈旧数据鲁棒且保持高准确率的折中方案
4. 教师缓存策略的优化
当前使用固定大小的有限缓存(Top-k或固定样本数):
- 动态缓存大小调整:根据训练阶段或策略变化率自适应调整缓存动作数量
- 智能动作选择:除随机采样或Top-k外,探索基于不确定性或教师-学生分歧度的主动采样策略,以最大化有限缓存的信息价值
5. 多教师与异构教师场景
Related Works提到OPD支持多教师蒸馏
2, 21
:
- 异步管道中多个领域专业教师的评分延迟可能不同
- 探索如何处理异构陈旧性(不同教师评分具有不同的滞后时间)
- 教师缓存的分布式管理与聚合策略
6. 与先进异步训练技术的结合
- 梯度压缩与量化:在权重同步阶段应用压缩技术,进一步降低通信开销
- 陈旧性感知学习率调度:根据检测到的新鲜度/陈旧度动态调整优化器参数,而非仅依赖估计器修正
- 推测性执行(Speculative Execution):在教师评分阶段使用推测性解码加速,与异步管道协同
7. 理论分析深化
- 收敛性保证:为提出的多样本MC估计器在异步非凸优化设定下提供理论收敛保证
- 最优陈旧度界限:量化特定任务/模型规模下可容忍的最大陈旧度与最终性能损失之间的理论关系
这些方向既包含直接的系统实现挑战(稠密KL、多节点扩展),也涵盖算法创新(自适应目标、缓存策略),为异步OPD的后续研究提供了丰富的探索空间。
Q: 总结一下论文的主要内容
本文针对大规模语言模型(LLM)后训练中的On-policy Distillation (OPD) 面临的系统瓶颈,系统研究了异步OPD中的陈旧策略数据(stale-policy data)问题,并提出了高效的解决方案。
核心问题
OPD 通过在模型自身生成的 rollouts 上进行训练并使用教师模型提供稠密 token 级反馈来提升推理能力。然而,与强化学习(RL)类似,OPD 面临 on-policy 系统瓶颈:训练需等待当前策略生成的 rollouts 完成,导致计算资源闲置。异步训练可通过解耦 rollout 生成与 learner 更新来缓解此问题,但会引入策略滞后(rollout 时的旧策略与更新时的当前策略不一致),可能降低模型质量。
主要发现与贡献
1. KL 方向决定陈旧数据鲁棒性
通过理论分析与实验验证,发现 KL 散度的方向选择决定了 OPD 对陈旧 rollouts 的敏感度:
- Forward KL(教师加权, ∑ q log (q) / (p_θ) ):对陈旧数据相对鲁棒,因其权重由教师策略 q 决定,不依赖学生当前策略的支持集。
- Reverse KL(学生加权, ∑ pθ log (pθ) / (q) ):易受陈旧数据影响,因其依赖学生当前策略 p_θ 的支持集,而陈旧缓存可能缺失当前学生需要评估的动作。
2. Reverse-KL 的最优策略梯度替代方案
针对脆弱的 Reverse KL,研究了多种策略梯度替代方案在陈旧数据下的表现:
- 关键发现:最有效的方案是在 learner 时刻重新计算当前策略的优势函数 Aθ(a,s) = log q(a|s) - log pθ(a|s) 且不进行 PPO 裁剪,配合重要性采样比率 rhoθ = (pθ) / (p_(textold)) 使用。
- 对比结论:为异步 RL 设计的先进稳定化方法(如 Decoupled PPO、M2PO)未能超越这一简单的 OPD 特定替代方案。
3. 有限教师缓存下的估计器设计
实际系统中无法存储完整教师词汇表 logits,必须在有限缓存约束下设计估计器:
- 稀疏 Top-k:使用陈旧学生支持集会导致支持集不匹配(support mismatch),无法通过重加权修复缺失的教师分数。
- 单样本蒙特卡洛 (MC):通过从 p_(old) 采样并使用重要性采样校正,可保持无偏性,但方差过高。
- 多样本 MC (Multi-sample MC):提出在每个解码步缓存 m 个局部样本(如 m=64 ),在保持蒙特卡洛可校正性的同时,将方差降低至单样本的约 1/m ,显著改善大陈旧度下的训练稳定性。
4. AsyncOPD 系统实现
基于上述算法选择,构建了完全异步的 OPD 训练管道 AsyncOPD:
- 采用流式架构重叠学生 rollout、教师评分和 learner 更新三个阶段。
- 使用基于信号量的队列深度控制,允许 rollout workers 持续生成数据,仅在权重同步时暂停。
实验结果
在 Qwen3-Base 模型(1.7B、4B、8B)上的实验表明:
- 吞吐量提升:AsyncOPD 相比严格同步训练实现 1.6× 至 3.8× 的加速(MC64 下达 2.7×,MC1 下达 3.3×)。
- 准确率保持:在大幅提升训练效率的同时,最终 AIME24、AIME25 和 AMC 的 Avg@32 准确率与同步训练相当或更优。
- 流水线重叠度:AsyncOPD 的并发 OPD 阶段活动度(overlap)达 2.0 以上,显著高于 step-off 调度器(1.5)和同步训练(0.8)。
局限与未来方向
- 当前未探索稠密 full-vocabulary KL 在异步设定下的高效实现。
- 实验限于单节点 8-GPU,多节点集群扩展有待验证。
- 可探索自适应 KL 方向选择、动态教师缓存策略及多教师场景下的异构陈旧性处理。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Wonjun Kang,Kevin Galim,Seunghyuk Oh,Minjun Kang,Sanghyun Park,Donghoon Kim,Minjae Lee,Minseo Kim,Rishabh Tiwari,Yuchen Zeng,Hyung Il Koo,Kangwook Lee
PDF URL: https://arxiv.org/pdf/2606.24143.pdf
Arxiv URL: https://arxiv.org/abs/2606.24143
Arxiv ID: 2606.24143
CoolPaper URL: https://papers.cool/arxiv/2606.24143
Published: 2026-06-30T01:35:47.633Z
Updated: 2026-06-30T01:35:47.633Z