数据来源:HuggingFace Papers

Latest Papers

1. Unlocking Lossless Speedups in LLMs via Discrete Diffusion

Abstract:Large Language Models (LLMs) owe much of their success to next-token prediction (NTP), but their autoregressive (AR) structure requires slow, sequential token generation. To overcome this bottleneck, we introduce diffusion-augmented LLMs, a new class of models that defines an AR model distribution while using diffusion to draw multiple tokens in parallel from that distribution. We decouple the parameters of these models into two sets: AR weights, trained using the standard NTP objective, and lightweight diffusion weights, trained to generate multiple tokens simultaneously. The diffusion weights are learned through a simple Diffusion Distillation phase that adds negligible overhead to existing LLM training pipelines. We also introduce $\Psi$-Spec, a family of samplers that enables lossless acceleration and inference-time scaling at a fixed context length. Unlike speculative decoding, our method requires no separate draft model. Unlike diffusion LLMs (d-LLMs), it accelerates generation without sacrificing the quality of the underlying AR model. The resulting models, called Uno, can be trained from scratch or built by augmenting existing open-weight AR LLMs. Uno achieves higher throughput than leading speculative-decoding methods at every evaluated batch size and delivers up to $3\times$ speedups over the base AR model, including at the largest batch size supported by the device. Notably, our 8B Uno model outperforms the leading open d-LLM, the 26B DiffusionGemma, and the proprietary Mercury 2 across all evaluated benchmarks in agentic tool use, coding, and long-context reasoning. We release code and checkpoints at: this https URL

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决大型语言模型(LLMs)在推理阶段因自回归(Autoregressive, AR)结构导致的生成效率瓶颈,同时克服现有加速方案的关键局限。具体而言,论文试图解决以下核心问题: ### 1. 自回归生成的固有顺序瓶颈 基于 next-token prediction(NTP)训练的 LLM 在推理时必须逐个顺序生成 token,产生 L 个 token 需要 L 次串行解码步骤。这种顺序约束在长文本生成、推理链(reasoning traces)变长时,会显著增加 serving 延迟,并在强化学习(RL)后训练中成为主要计算瓶颈。 ### 2. 现有加速方案的不完备性 现有方法仅部分缓解了上述问题,各自存在显著缺陷: - \*\*Speculative Decoding(推测解码)\*\*:依赖一个独立的小型 draft 模型生成候选 token,再由基础模型验证。这要求额外维护一个高效且与目标模型对齐的 draft 模型,增加了系统复杂性和内存开销。 - \*\*离散扩散语言模型(d-LLMs)\*\*:虽原生支持并行生成,但领先的 d-LLM 仍面临\*\*质量-速度的权衡\*\*——加速往往以牺牲基础 AR 模型质量为代价。此外,其速度优势在较大的推理 batch size 下会消失,难以适应现代以 agentic 工作负载为主的并发 serving 场景。 - \*\*多 token 预测(MTP)\*\*:需修改 Transformer 架构(如增加未来 token 预测头),与标准 LLM 训练流程的兼容性较差。 ### 3. 实际部署场景下的 batch size 挑战 当代 LLM 应用(如 agentic 工具调用、并行智能体、分支轨迹和重试机制)往往产生高并发请求,serving 系统通常跨请求做 batching 以提升加速器利用率。因此,仅在 \*\*batch size = 1\*\* 的低延迟场景下测得的加速收益,无法反映真实生产环境中并发请求下的吞吐量表现。实用的加速方案必须在\*\*各种 batch size 下\*\*均保持有效。 ### 4. 核心解决思路 针对上述问题,论文提出 \*\*diffusion-augmented LLMs\*\*(称为 Uno),其核心思想是: - \*\*解耦参数\*\*:将模型参数分为两组——决定响应质量的 \*\*AR weights\*\*(通过标准 NTP 目标训练)和轻量级的 \*\*diffusion weights\*\*(通过 Diffusion Distillation 训练,用于并行生成多个 token)。 - \*\*无损加速\*\*:通过提出的 Psi -Spec 采样器,利用 diffusion 路径并行起草(draft)token 块,再用 AR 路径执行拒绝采样验证,严格保持基础 AR 模型的输出分布不变,实现\*\*无需单独 draft 模型\*\*的 lossless 加速。 - \*\*全 batch size 适用\*\*:在从 batch size 1 到设备支持的最大 batch size 的范围内均实现加速,最高可达 \*\*3×\*\* 的推理加速,并在最大 batch size 下仍保持高达 \*\*2×\*\* 的加速,同时支持 RL 后训练阶段的 rollout 加速。 Q2: 有哪些相关研究? 根据论文内容,相关研究主要涵盖以下几个方向: ## 1. Speculative Decoding(推测解码) 这类方法通过小型 draft 模型快速生成候选 token,再由目标模型并行验证以加速推理,同时保证无损采样。 - \*\*基础方法\*\*:Leviathan et al. (2023) 与 Chen et al. (2023) 提出了标准的推测解码框架,利用 draft 模型生成候选序列,再通过拒绝采样保留目标分布。 - \*\*EAGLE-3\*\* (Li et al., 2026b):为目标模型(如 Qwen3-8B)训练了一个轻量级的自回归 draft 模型(约 0.4B 参数),从融合的中间特征中顺序预测 token。 - \*\*DFlash\*\* (Chen et al., 2026):使用一个 1.05B 参数的扩散 draft 模型,基于目标模型特征并行预测多个 token,但训练成本显著更高(需要 B · L 的训练上下文长度)。 - \*\*使用大型 d-LLM 作为 drafter\*\*:Li et al. (2026a) 和 Sandler et al. (2026) 采用大规模预训练扩散语言模型作为 draft 模型,配合独立的 AR 验证模型,但引入了显著的内存和延迟开销。 \*\*与本文的区别\*\*:Uno 无需单独的 draft 模型,而是在单一架构内通过 LoRA 适配器实现 drafting 和 verification,共享 KV cache,减少了峰值内存和额外参数。 ## 2. Self-Speculative Decoding(自推测解码) 这类方法旨在消除对独立 draft 模型的依赖,使用单一网络同时承担提案和验证功能。 - \*\*Blockwise Parallel Decoding\*\* (Stern et al., 2018):在基础模型上增加辅助预测头,并行预测未来 token 块,再通过同一模型验证,但仅保证 greedy decoding 的等价性。 - \*\*TiDAR\*\* (Liu et al., 2025):将 AR 模型转换为扩散模型,使其能在扩散模式下起草、在 AR 模式下验证。然而,这种方法需要修改基础 AR 权重,因此是\*\*有损的\*\*(lossy),且加速效果局限于小 batch size。 - \*\*并发工作\*\*: - \*\*FLARE\*\* (Zhu et al., 2026) - \*\*I-DLM\*\* (Yu et al., 2026b):其中 I-DLM (R-ISD) 变体使用 gated LoRA,但论文指出其官方采样器未能实现无损加速。 \*\*与本文的区别\*\*:Uno 冻结 AR 权重,仅训练轻量级扩散适配器,严格保持基础 AR 分布不变,实现无损加速,且在全 batch size 范围内有效。 ## 3. Discrete Diffusion Language Models(离散扩散语言模型,d-LLMs) 这类模型通过离散扩散过程支持并行生成,在生物序列生成等领域取得成功,但在语言建模上仍面临质量-速度的权衡。 - \*\*基础理论\*\*:Austin et al. (2021a) 与 Sahoo (2026) 奠定了离散状态空间扩散模型的基础。 - \*\*大规模 d-LLM\*\*: - \*\*DiffusionGemma\*\* (DiffusionGemmaTeam et al., 2026):基于 Gemma 4 微调的稀疏 MoE 模型(26B 总参数 / 4B 激活参数)。 - \*\*Nemotron-Labs-Diffusion\*\* (Fu et al., 2026):14B 参数模型,先自回归预训练再微调成扩散模型,采用掩码扩散与块内双向注意力。 - \*\*Mercury 2\*\* (Ermon, 2026):专有闭源 d-LLM。 - 其他:\*\*LLaDA2.1-Flash\*\* (Bie et al., 2026)、\*\*Fast-dLLM v2\*\* (Wu et al., 2025)、\*\*SDAR\*\* (Cheng et al., 2026) 等。 \*\*与本文的区别\*\*:现有 d-LLM 通常需要修改基础 AR 权重(有损),且其速度优势在小 batch size 下明显,但在大 batch size 下消失。Uno 则通过与 AR 模型解耦的扩散适配器,在保留 AR 质量的同时实现全 batch size 无损加速。 ## 4. Multi-Token Prediction(多 token 预测,MTP) 这类方法通过修改 Transformer 架构,增加额外的预测头来同时预测未来多个 token。 - \*\*Medusa\*\* (Cai et al., 2024):在基础模型上添加多个解码头,分别预测第 n 个未来 token。 - \*\*Gloeckle et al. (2024)\*\*:探索了多 token 预测训练目标对模型性能和推理加速的影响。 \*\*与本文的区别\*\*:Uno 不修改模型架构或增加预测头,而是通过轻量级扩散适配器实现并行生成,且论文指出其速度超过了基于 MTP 的方法。 ## 5. 采样与蒸馏技术 - \*\*Ψ-Samplers\*\* (Deschenaux et al., 2026):一类预测-校正采样器,通过调节 kappa_t 参数在离散扩散中实现推理时扩展(inference-time scaling)。 - \*\*Discrete Consistency Distillation (DCD)\*\* (Sahoo et al., 2025a):将多步均匀态扩散过程压缩为少步生成器,本文将其扩展为单步块去噪蒸馏,用于训练扩散适配器。 - \*\*Quadratic Sampling\*\* (Samragh et al., 2025):将 drafting 和 verification 合并为单次前向传播的技术,被 TiDAR 和 Nemotron-Labs-Diffusion 采用,但需要高效的定制化内核支持。 ## 6. 参数高效微调 - \*\*LoRA\*\* (Hu et al., 2022):低秩适配器技术,本文用其实现扩散权重 θ_Delta ,使其以极少参数(如 rank-128)附加在 AR 权重上,实现低内存开销的推理加速。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*diffusion-augmented LLMs\*\*(称为 \*\*Uno\*\*)来解决上述问题。该方法的核心思路是:在单一架构内解耦“生成质量”与“生成速度”的权重参数——利用标准的自回归(AR)权重定义高质量的目标分布,再通过轻量级的扩散权重学习从该分布中并行采样多个 token。具体解决方案可分为以下几个层面: --- ### 1. 架构设计:双路径参数解耦 每一层 Transformer 包含两套解耦的权重: - \*\*AR 权重 θ_(AR) \*\*:通过标准的 next-token prediction(NTP)目标训练,决定模型的响应质量。推理时作为验证器(verifier),严格保持目标分布不变。 - \*\*扩散权重 θ_Delta \*\*:以轻量级 LoRA(Low-Rank Adaptation)适配器的形式附加在 AR 权重上,仅用于加速并行生成。推理时与 AR 权重共同构成 drafting 路径,即使用参数 θ_(AR) + θ_Delta 。 这种设计的优势在于: - \*\*无需单独 draft 模型\*\*:与 EAGLE-3、DFlash 等推测解码方法不同,Uno 不依赖独立的外部 draft 网络。 - \*\*共享 KV Cache\*\*:draft 与 verifier 共享基础参数和缓存,降低峰值内存。 - \*\*无损性\*\*:AR 权重在训练中保持冻结,验证分布不变,从而保证最终输出严格遵循基础 AR 模型的分布。 --- ### 2. 训练流程:两阶段流水线 训练分为两个解耦阶段(见论文图 1 顶部): #### 阶段一:AR 权重训练 使用标准的 LLM 训练流程(预训练 arrow SFT arrow RL 后训练)优化 θ_(AR) 。此阶段完全遵循现有实践。 #### 阶段二:Diffusion Distillation(扩散蒸馏) 冻结 θ_(AR) ,仅训练 LoRA 适配器 θ_Delta 。目标是将多步扩散过程蒸馏为\*\*单步块去噪生成器\*\*,使其输出的 token 块分布尽可能匹配 AR 模型的块分布。 关键训练技术包括: - \*\*块级单步蒸馏\*\*:将长度为 L 的序列划分为 N 个大小为 B 的块。对每个块,模型从完全噪声 z_1 sim π^B 出发,经单步去噪恢复该块。蒸馏损失为块内每个 token 的 KL 散度:

L(DCD)(θ_Delta; θ(AR), x, z1) = ∑(b=1)^(N) ∑(ell=1)^(B) D(KL)!( x(θ_Delta,θ_AR)^((N+b,ell))([x, z_1]) ,|, x(θ_AR)^((b,ell))([x, z_1]) )

  • **块因果注意力(Block-Causal Attention)**:在拼接序列 $
    x, z1
    上,干净前缀 x 内部保持因果注意力;每个噪声块 z_1^((b)) 内部也保持因果注意力,但可 attend 到所有前面的干净块 x^((<b)) 。这使得单步前向传播即可同时计算 teacher(AR)和 student(diffusion)的 logits。 - Gated LoRA:在同一前向传播中,对干净序列位置禁用 LoRA(仅 θ
    (AR) 生效,输出 teacher 分布),对噪声位置启用 LoRA( θ(AR) + θ_Delta$ 生效,输出 student 分布)。 - Total Variation(TV)损失:为提升推测采样的接受长度,额外最小化扩散分布与 AR 分布的块级 TV 距离:
    L
    (TV)(θDelta; θ(AR), x, z1) = ∑(b=1)^(N) ∑(ell=1)^(B) | xDelta,θ_AR)^((N+b,ell)) - x(θ_AR)^((b,ell)) |
  • **课程学习**:对块大小 B 采用课程,从 B=2 逐步增加到 B=16 ,以稳定训练。 综合训练目标为:
    L(θDelta; θ(AR), α, β) = E(x sim D), z_1 sim π^L [ α L(DCD) + β L_(TV) ]
    —- ### 3. 推理采样: Psi -Speculative Sampler( Psi -Spec) 论文提出 Psi -Spec 采样器,在保持 AR 分布无损的前提下实现并行生成。每次迭代包含两个步骤: #### 步骤一:扩散起草(Diffusion Drafting) 给定已生成长度为 L 的前缀 x ,首先拼接 B-1 个从先验采样的噪声 token,构成输入块 $

xL, z_t
。通过单步扩散( t=1 to t=0 )生成候选块。根据论文推导,单步扩散的边际分布退化为: - 第 1 个 token:使用纯 AR 权重采样, z_0^1 sim x
AR)^1(·) ,因此该 token 必定被接受。 - 第 2 到 B 个 token:使用扩散路径联合采样, z_0^(2:B) sim p(draft) = prod(ell=2)^(B) x(θ_AR),θ_Delta^ell(·) 。 #### 步骤二:AR 验证(AR Verification) 将候选集合 C 提交给冻结的 AR 模型进行标准推测解码拒绝采样(Leviathan et al., 2023),保留被接受的最长连续前缀。若所有 B 个 draft token 均被接受, verifier 还会额外采样一个 token,因此每轮迭代输出 B+1$ 个 token;若立即拒绝,也至少输出 2 个 token(1 个必然接受的 draft 首 token + 1 个 verifier 重采样 token)。 Tokens-Per-Forward-pass(TPF) 的上下界为:

1 ≤ TPF ≤ (B+1) / (2)

两种采样配置 - **Linear Sampler**:仅从边际分布采样单个候选序列,适合高 batch size、追求系统吞吐量的场景。 - **Tree Sampler**:在每个位置采样 top- K token,构建候选前缀树,通过树注意力并行验证多个候选。适合 batch size 为 1、追求单用户低延迟的场景。 —- ### 4. 推理时扩展(Inference-Time Scaling) Psi -Spec 还提供了一条不增加上下文长度的推理时扩展轴:允许去噪步数 T 超过 draft 块大小 B 。通过增加额外的扩散去噪步骤,可以持续提升样本质量。论文指出,若多步去噪最终能超越 AR 模型的质量,则可关闭 AR 验证,以充分释放扩散路径的潜力。该方向留待未来系统研究。 —- ### 5. 实际部署与训练策略 论文针对两种实际场景提供了训练策略: - **仅加速推理**:在 AR 预训练与后训练全部完成后,冻结 θ(AR) ,单独执行 Diffusion Distillation。 - **同时加速 RL 训练与推理**:在 SFT 之后、RL 之前插入 Diffusion Distillation。RL 阶段仅更新 θ(AR) ,冻结的扩散适配器继续用于加速 rollout 生成。实验表明,即使经过大量 RL 训练,SFT 阶段学习的扩散适配器仍能保持显著的加速效果(TPF 仅下降约 6%)。 —- ### 6. 从开源模型构建 Uno 除从头训练外,论文还展示了“drop-in”增强能力:直接冻结开源模型(如 Qwen3-8B)的权重,仅在其上训练 LoRA 扩散适配器。即使适配器在与 AR 权重不同的数据分布(如 OpenThoughts)上训练,仍能在原始模型的基准评测上实现无损加速,验证了方法的通用性与数据分布鲁棒性。 Q4: 论文做了哪些实验? 论文围绕 **Uno**(diffusion-augmented LLM)开展了系统性实验,涵盖从头训练、开源模型增强、与多种基线的全面对比,以及详细的消融研究。实验设计强调在**全 batch size 范围内**评估无损加速能力,并采用统一的 **1K/8K throughput test**(输入 1024 tokens、输出 8192 tokens)确保吞吐量比较公平。 —- ## 1. 端到端从头训练实验(End-to-End Training) ### 1.1 模型与训练设置 - **Uno 架构**:36 层 dense causal Transformer,约 6.95B body 参数 + 2.05B vocab 参数,总上下文长度最高 524K tokens。每层的扩散权重为 rank-128、 α(LoRA)=256 的 LoRA 适配器。 - **AR 权重训练**:约 23T tokens,分阶段进行上下文长度扩展(8K to 32K to 128K to 512K)。 - **扩散权重训练**:在 SFT 数据上训练 7B tokens,采用块大小课程学习( B ∈ 2,4,8 后固定为 B=8 ),冻结 AR 权重,仅更新 LoRA。 ### 1.2 评测基准 | 类别 | 基准 | |———|———| | Agentic Tool Use | τ^3 -Bench (Banking/Telecom/Retail), τ^2 -Bench, Terminal-Bench v2.1 | | Agentic Coding | SWE-bench Verified | | Long-Context Reasoning | AA-LCR | | Science & Knowledge | AA-Omniscience, Humanity’s Last Exam (HLE), GPQA-Diamond | | Math | GSM8K, MATH500, AIME-24/25/26 | | Coding | MBPP, HumanEval | ### 1.3 主要结果 - **与基础 AR 模型对比**:在最大可支持 batch size(64)下,Uno 实现 **1.5×** 系统吞吐量提升;在 batch size 1 下达到 **2.2×** 单请求加速,且输出分布与基础 AR 模型一致(无损)。 - **与开源 d-LLM 对比**(DiffusionGemma-26B-A4B、Nemotron-Labs-Diffusion-14B):Uno 在所有评测基准上均取得更高精度,且在系统吞吐量上领先。 - **与专有 d-LLM 对比**(Mercury 2):8B 参数的 Uno 在全部 agentic、coding 和 long-context 基准上超越 Mercury 2;系统吞吐量约为 Mercury 2 报告的 **4.6×**。 - **RL 后训练加速**:从 SFT 检查点出发,使用 DAPO 算法训练数学、代码、工具使用和搜索四个专家。冻结的扩散适配器将端到端 RL 训练加速最高达 **40%**;RL 收敛后,适配器仍保持约 **94%** 的原始 TPF(仅下降约 6%)。 —- ## 2. 开源权重增强实验(Open Weights LLMs) ### 2.1 UnoQwen 设置 - **基础模型**:冻结 Qwen3-8B 的 AR 权重。 - **扩散适配器**:rank-128 LoRA,引入 0.35B 可训练参数,在 OpenThoughts 数据集上训练 14.7B tokens(3 epochs)。 - **块大小课程**: B ∈ 2,4,6,8,12,16 ,每半 epoch 递增。 ### 2.2 评测基准与基线 | 类别 | 基准 | |———|———| | Math | GSM8K, MATH500, AIME-24/25/26 | | Coding | HumanEval, MBPP, LiveCodeBench v6 | | Science | GPQA, GPQA-Diamond, MMLU-Pro | | Instruction Following | IFEval | **无损基线**: - **EAGLE-3**:为 Qwen3-8B 训练的 0.4B AR drafter。 - **DFlash**:为 Qwen3-8B 训练的 1.05B 扩散 drafter。 **有损基线**: SDAR、Jacobi Forcing、Fast-dLLM v2、OPDLM、I-DLM、FLARE、LLaDA2.1-Flash 等。 ### 2.3 主要结果 - **与无损推测解码对比**(表 2、图 2): - **系统吞吐量**:在最大 batch size 下,UnoQwen(Linear, B=4 )达到 **5733 tok/s**,比 EAGLE-3(4944)和 DFlash(5351)更快,为基础 AR 模型的 **1.6×**。 - **单 Q5: 有什么可以进一步探索的点? 基于论文的讨论与局限,以下几个方面值得进一步探索: —- ### 1. 推理时扩展(Inference-Time Scaling)的系统化研究 Psi -Spec 允许将去噪步数 T 设置为大于 draft 块大小 B ,从而在不增加上下文长度的前提下分配额外计算资源。论文第 4.3 节指出,若多步去噪质量最终能超越基础 AR 模型,则应关闭 AR 验证以充分释放扩散路径的潜力。这一**质量-计算权衡(quality-compute tradeoff)**尚未得到系统性刻画,包括: - 确定使扩散样本质量超过 AR 基线的临界步数; - 设计自适应步数选择策略; - 分析多步去噪后分布偏离 AR 模型的理论边界。 —- ### 2. Quadratic Sampler 的高效实现 论文第 6 节指出,Quadratic Sampling(如 Samragh et al., 2025 所述)可将 drafting 与 verification 合并为单次前向传播,从而将每步所需的两次前向 pass 减少为一次。然而,这需要为“在当前 draft 位置后插入 k 个掩码占位符以表示未来延续”的特殊结构开发**高效的定制化 GPU kernel**。探索并实现此类 kernel,验证其在实际 serving 中的端到端加速效果,是一个明确的工程与系统研究方向。 —- ### 3. 与多 Token 预测(MTP)架构的融合 论文第 6 节提到,Medusa 等 MTP 方法通过增加未来 token 预测头来实现无损加速,而 Uno 当前仅通过 LoRA 适配器修改现有层。将 MTP 的显式多步预测能力与 Uno 的扩散 draft 机制相结合,可能进一步提高候选 token 的接受率(acceptance rate)。具体可探索: - 在 Uno 的扩散路径中引入 MTP 风格的并行预测头; - 联合优化 NTP 与块级扩散目标,以提升单步去噪的块内一致性。 —- ### 4. 动态块大小与自适应采样策略 当前 Uno 在训练和推理中采用固定块大小 B 。进一步探索包括: - **推理时动态块大小**:根据前缀复杂度或模型置信度自适应选择 B ,例如在低熵区域(如代码格式化、常见短语)使用更大的 B ,在高熵区域(如数学推理、罕见命名)缩小 B ; - **自适应树采样**:在 Tree Sampler 中根据实时接受的 token 分布动态调整分支因子 K 与前缀预算 V ,而非使用固定的 (B, K, V) 超参数。 —- ### 5. 扩散权重的在线更新与 RL 深度融合 论文第 5.1.3 节显示,RL 后训练期间冻结扩散权重仍能保持大部分加速比,但存在约 6% 的 TPF 下降。未来可探索: - **在线 Diffusion Distillation**:在 RL 过程中定期或在每轮迭代后,用当前更新的 θ(AR) 作为教师,重新蒸馏或微调 θDelta ,以消除分布漂移; - **端到端联合优化**:研究是否可在保持无损性的前提下,设计同时更新 AR 与扩散权重的 RL 目标函数,使 draft 分布主动适应策略模型的演化。 —- ### 6. 非 Transformer 架构与更大规模的验证 论文第 3 节指出,该框架原则上适用于任何因果神经网络,包括 State-Space Models(SSMs,如 Mamba)。值得验证: - 在 SSM 中,扩散 LoRA 适配器是否仍能在保持状态空间递归效率的同时实现无损加速; - 将方法扩展至数十亿到万亿参数规模时,LoRA 秩 r 与缩放比 α(LoRA)/r 的最优配置是否随模型规模系统性变化; - MoE(Mixture-of-Experts)架构下的专家路由与扩散 draft 的交互。 —- ### 7. 损失函数与蒸馏目标的理论分析 消融实验(第 5.2.4 节)发现,单独使用 L(TV) 的 TPF 优于单独使用 L(DCD) ,而 α=0.01, β=1 的加权组合略优于纯 TV。进一步的理论工作可包括: - 建立 L(TV) 与期望接受长度之间的严格数学联系; - 分析单步块去噪蒸馏的误差传播上界,指导块大小 B 和课程学习 schedule 的设计; - 探索替代散度(如 Jensen-Shannon、Wasserstein)在扩散蒸馏中的效果。 —- ### 8. 长上下文场景下的块级去噪优化 论文在最高 512K 上下文的模型上验证了 Uno,但块大小 B 在训练中被限制在较小范围(如 8 或 16)。对于极长序列生成,可探索: - **分层块去噪**:在段落或文档级别使用更大的块,在句子级别使用更细的块; - 长上下文下 KV cache 管理与扩散 draft 内存占用的联合优化,特别是在块因果注意力(block-causal attention)结构下。 Q6: 总结一下论文的主要内容 这篇论文介绍了 **Uno**,一种新型的 **diffusion-augmented LLM**,旨在不牺牲自回归(AR)模型输出质量的前提下,实现全批量(batch size)范围内的无损推理加速,并支持即插即用地增强现有开源模型。 ### 1. 核心问题 - **自回归生成的顺序瓶颈**:标准 LLM 基于 next-token prediction,必须逐个串行生成 token,导致推理延迟高,且在 RL 后训练中 rollout 生成成为主要瓶颈。 - **现有方案局限**: - **Speculative Decoding** 需要维护独立且对齐良好的 draft 模型,增加系统复杂度与内存开销; - **Diffusion LLM (d-LLM)** 虽支持并行生成,但通常以修改 AR 权重为代价(有损加速),且其速度优势在大 batch size 下往往消失,难以适应现代高并发的 agentic 负载。 ### 2. 核心方法:Diffusion-Augmented LLMs 论文提出将单一架构内的参数解耦为两组: - **AR 权重 θ(AR) **:通过标准 NTP 预训练与后训练,决定模型输出质量,并在推理时作为**无损验证器**。 - **Diffusion 权重 θDelta **:以 **LoRA 适配器**形式附加于每层,仅用于并行起草(draft)token 块。推理时 draft 路径使用 θ(AR) + θDelta ,验证路径仅使用冻结的 θ(AR) 。 #### 训练流程 采用两阶段流水线(如图 1 所示): 1. **AR 训练**:标准预训练、SFT 及可选的 RL 后训练。 2. **Diffusion Distillation**:冻结 θ(AR) ,通过单步块去噪目标训练 θ_Delta 。具体包括: - **Block-Causal Attention**:将干净序列 x 与噪声块 z_1 拼接,使噪声块既能内部因果注意,又能 attend 到前方所有干净上下文;通过 Gated LoRA 在同一前向传播中分别计算 teacher(仅 θ(AR) )与 student( θ(AR)+θ_Delta )的分布。 - **蒸馏损失 L(DCD) **:最小化单步扩散输出与 AR 教师分布在块内各 token 上的 KL 散度。 - **Total Variation 损失 L_(TV) **:最小化扩散分布与 AR 分布的 TV 距离,以提升推测采样的接受长度。 #### 推理采样: Psi -Spec Sampler 论文提出 Psi -Spec 采样器,每轮迭代包含: - **Diffusion Drafting**:通过单步扩散并行生成 B 个 token 的候选块。推导表明,单步下边际分布退化为:

z0^1 sim xAR)^1(·), quad z_0^(2:B) sim prod(ell=2)^(B) x_(θ_AR),θ_Delta^ell(·)

  • **AR Verification**:对候选块执行标准推测解码的拒绝采样,保留最长接受前缀,严格保持 AR 目标分布。 **Tokens-Per-Forward-pass(TPF)**满足:
    1 ≤ TPF ≤ (B+1) / (2)
    论文支持两种采样模式: - **Linear Sampler**:采样单条候选,适合高 batch size、最大化系统吞吐量。 - **Tree Sampler**:采样多条候选并以前缀树并行验证,适合 batch size 为 1、最大化单用户吞吐量。 ### 3. 主要实验与结果 #### 设置 - **从头训练(Uno)**:约 7B body 参数的 dense Transformer,上下文最长 524K;扩散权重为 rank-128 LoRA,在 7B tokens 上蒸馏。 - **开源增强(UnoQwen)**:冻结 Qwen3-8B,添加 0.35B 参数的 LoRA,在 OpenThoughts 上训练。 #### 关键结果 - **与基础 AR 模型对比**: - Uno 在最大可支持 batch size(64)下系统吞吐量提升 **1.5×**,在 batch size 1 下提升 **2.2×**,且输出质量无损。 - UnoQwen 在最大 batch size 下提升 **1.6×**,在 batch size 1 下提升 **2.5×**。 - **与 Speculative Decoding 对比**: - UnoQwen **Pareto 主导** EAGLE-3 与 DFlash:在所有 batch size 下均更快,且额外参数更少(0.35B vs. 0.4B/1.05B),共享 KV cache 使峰值内存更低(122 GiB vs. ~130 GiB)。 - **与 Diffusion LLM 对比**: - 8B Uno 在所有评测的 agentic、coding 与 long-context 基准上超越 26B DiffusionGemma 与专有模型 Mercury 2;最大系统吞吐量约为 Mercury 2 的 **4.6×**。 - 与 Nemotron-Labs-Diffusion、DiffusionGemma 等需要修改 AR 权重的有损 d-LLM 不同,Uno 在实现更高吞吐的同时保持基础 AR 分布不变。 - **RL 后训练加速**: - 冻结的扩散适配器在 DAPO RL 训练中可将端到端训练加速最高 **40%**;RL 收敛后 TPF 仅下降约 **6%**,仍保持显著加速。 ### 4. 贡献总结 - **架构层面**:提出 diffusion-augmented LLM,首次在单一架构内通过解耦 AR 与扩散权重,实现无需独立 draft 模型的无损加速。 - **训练层面**:提出 Diffusion Distillation 与块级单步去噪目标,以极低成本(少量 tokens、轻量 LoRA)为现有 AR 模型增加并行生成能力。 - **推理层面**:提出 Psi -Spec 采样器,在全部 batch size 范围内提供稳定加速,支持从低延迟到高吞吐的灵活部署。 - **实践层面**:展示方法既可从头训练,也可直接增强现有开源权重模型(如 Qwen3-8B),且扩散权重与 AR 权重无需同分布训练数据。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Subham Sekhar Sahoo,Lingjie Chen,Khiem Pham,Jonathan Geuter,Chaitanya Dwivedi,Varad Pimpalkhute,Yash Akhauri,Alexander Moreno,Mikhail Yurochkin,Zhenting Wang,Mostafa Elhoushi,Nolan Dey,Shane Bergsma,Joel Hestness,John Thickstun,Eric Xing,Zhengzhong Liu

Categories:

PDF URL: https://arxiv.org/pdf/2609.04010.pdf

Arxiv URL: https://arxiv.org/abs/2609.04010

Arxiv ID: 2609.04010

CoolPaper URL: https://papers.cool/arxiv/2609.04010

Published: 2026-09-09T01:31:22.913Z

Updated: 2026-09-09T01:31:22.913Z


2. FlowBalance: Verifier-Grounded Self-Improvement from On-Policy Reasoning Experience

Abstract:A reasoning model can improve from its own on-policy experience, but this inner loop is fragile: terminal verifiers provide reliable yet sparse supervision, while dense same-model guidance can reinforce false confidence or overconcentrate learning on a narrow solution mode. We introduce FlowBalance, a verifier-grounded self-improvement method that learns a normalized distribution over complete responses. For each on-policy trajectory, a frozen training-time view of the same policy uses privileged context to produce token-level log-probability gains, which are aggregated into a trajectory-level self-guidance score. FlowBalance calibrates this score with the verifier-derived group advantage: guidance is retained on positive-advantage trajectories, reversed on negative-advantage trajectories, and disabled when the rollout group provides no outcome preference. The resulting energy exponentially reweights a reference policy, and profiled trajectory balance fits the normalized target with one log-partition estimate per rollout group. This realizes outcome-calibrated self-guidance via trajectory balance, without a separate token-level imitation loss. Our analysis establishes within-group contrast preservation, a minimum-change reverse-KL characterization, monotonic verifier control of target reward, and an exact correction against false-positive self-guidance on rejected responses. On mathematical reasoning, FlowBalance improves average performance over FlowRL on both Qwen3-4B and Qwen3-8B, while also improving training speed and stability, avoiding direct OPSD’s response-length collapse, and exhibiting higher correct-strategy diversity in a controlled AIME24 diagnostic.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*推理模型如何从自身的 on-policy 经验中实现可靠、稳定且分布保持的自我改进(self-improvement)\*\*这一核心问题。具体而言,论文聚焦于以下关键挑战: --- ### 1. 稀疏终端反馈的局限 在基于可验证奖励的强化学习(RLVR)中,终端验证器(terminal verifier)仅提供稀疏的终端奖励(例如最终答案是否正确)。对于包含数百至数千个 token 的长程推理轨迹,这种稀疏信号难以有效利用轨迹内部细粒度的推理结构信息。虽然基于组(group-based)的目标函数改进了响应间的比较,但仍将响应级别的信号均匀附加给每一个决策 token,无法充分挖掘采样推理路径上的局部证据。 --- ### 2. 密集自指导的不可靠性 模型可以通过冻结的特权后见视角(privileged-hindsight view,即同一策略在训练时参考标准答案或任务反馈后对已采样 token 的打分)提供密集的 token 级自我指导。然而,这种同模型、密集的自我指导存在以下风险: - \*\*错误自信(false confidence)\*\*:后见视角可能观察到推理时不可用的信息,从而对最终被验证器拒绝的轨迹赋予高置信度; - \*\*自我确认(self-confirmation)\*\*:模型自身的错误偏好可能成为下一轮更新的监督信号,形成正反馈循环; - \*\*模式坍缩(mode collapse)\*\*:过度集中于单一的局部偏好解模态,抑制不确定性驱动的探索,甚至导致推理长度急剧缩短。 --- ### 3. 分布性自我改进的核心问题 基于上述两种信号的互补性与冲突性,论文明确提出以下问题: > \*\*给定 on-policy 推理经验、稀疏但可靠的验证结果,以及密集但不完美的自我指导,下一个策略应当学习什么样的归一化完整响应分布?\*\* 现有方法未能妥善处理这一组合:纯验证器方法缺乏细粒度轨迹引导;而直接将密集自指导与 RL 目标混合(如 OPSD、RLSD)则可能因为未对自指导进行验证器校准,导致错误信号被放大或分布坍缩。 --- ### 4. FlowBalance 的解决目标 为回答上述问题,论文提出 \*\*FlowBalance\*\*,其旨在构建一个\*\*验证器锚定的、归一化的完整响应分布\*\*,通过以下机制解决前述问题: - \*\*结果校准(outcome-calibrated self-guidance)\*\*:利用组相对优势(group-relative advantage)的符号门控(sign gating)——在正优势轨迹上保留自我指导,在负优势轨迹上反转自我指导,在无差异组中禁用指导——从而将密集信号约束在验证器确定的方向上; - \*\*轨迹平衡(trajectory balance)\*\*:将复合能量(验证器优势 + 校准后的自指导)通过配分函数(partition function)转换为归一化的目标分布,避免独立的 token 级模仿损失; - \*\*保守更新\*\*:在保持参考策略支持的同时,以最小反向 KL 散度位移实现分布更新,保留组内所有概率对比度,防止模式坍缩。 简言之,该论文试图克服“稀疏终端奖励无法提供细粒度监督”与“密集自指导不可盲目信任”之间的张力,设计一种既能加速和稳定训练、又能保持正确策略多样性的\*\*分布性自我改进算子\*\*。 Q2: 有哪些相关研究? 根据论文第6节及相关论述,相关研究可沿以下四条主线梳理: --- ### 1. 基于可验证结果的强化学习(RLVR) 这类方法利用可自动检查的终端奖励(如最终答案正确性)来提升大语言模型的推理能力,核心代表包括: - \*\*DeepSeekMath\*\*

4
与 **DAPO**
5
:将组相对策略优化(GRPO)扩展至数学推理,通过采样多条响应并基于组内奖励估计优势函数,实现无需单独学习critic模型的策略更新。 - **组级优化变体**:Group Sequence Policy Optimization
17
、Simple Policy Optimization
18
、GVPO
19
、DCPO
20
、以及引入方差感知基线与自适应学习率的工作
21
:在GRPO框架内改进序列级比率、信任域、方差加权、动态裁剪等。 **与 FlowBalance 的区别**:上述方法提供可靠的结果基础,但其监督始终停留在**响应级别**(response-level)。FlowBalance 试图回答一个互补问题——如何利用这些稀疏结果与轨迹上的密集证据,共同定义一个**归一化的完整响应分布**。 —- ### 2. 特权自指导与 On-Policy 蒸馏 该方向研究如何在训练时利用特权信息(如参考答案、任务反馈)对模型自身采样的轨迹进行密集打分: - **知识蒸馏基础**:经典教师–学生蒸馏

22, 23
;On-policy distillation(Agarwal et al., 2024)
24
则从模型自生成的错误中学习。 - **同模型特权打分**:OPSD
7
、Self-Distilled Reasoner
8
、RLSD
12
、Privileged Information Distillation
25
、Self-Distillation Enables Continual Learning
26
、On-Policy Context Distillation
27
:均使用当前模型或固定特权教师的“后见视角”为已采样 token 提供密集信号。 - **已知风险与修正**:近期工作指出,直接模仿特权教师可能缩短推理、抑制不确定性表达、甚至退化模型能力
9, 10, 12, 28
。为此,研究者提出对比式自蒸馏(RLCSD
29
)、双路径蒸馏(DOPD
30
)、反思式自蒸馏
31
、方向自适应蒸馏
32
、非对称蒸馏
33
、Token 重要性加权
34
、以及反向教师信号
35
等修正方案。同期工作 **β-OPSD**
36
则推导了带 KL 正则化的效率目标,可调参考策略与教师信号的权衡。 **与 FlowBalance 的区别**:现有方法大多将特权信号作为**局部优化目标**(如 token 级模仿损失或直接插入 RL 目标)。FlowBalance 则将同模型特权打分仅视为**停止的轨迹特征(stopped trajectory feature)**,算法核心对象是验证器锚定的完整响应分布,通过轨迹平衡进行拟合,不设独立的 token 级模仿损失。 —- ### 3. 分布匹配与轨迹平衡(Trajectory Balance) 这类方法关注如何学习一个按非归一化奖励成比例采样的分布,而非仅奖励最大化: - **GFlowNets**:Bengio 等人

38, 39
提出基于流网络的生成模型,通过随机构造策略实现多样化候选生成。 - **轨迹平衡(Trajectory Balance)**:Malkin et al. (2022)
43
改进长程信用分配,强制完整轨迹层面的平衡条件。 - **LLM 推理中的流方法**:Flow of Reasoning
44
、FlowRL
6
将轨迹平衡实例化为带提示条件配分函数的推理方法;GFlowRL
45
用组内 rollout 估计替代辅助配分网络。 **与 FlowBalance 的区别**:FlowBalance 延续该分布匹配谱系,但**改变了目标能量函数**——它将验证器组优势与**结果校准的特权后见自指导**结合,并在 rollout group 上通过剖面化(profiled)配分估计拟合目标。与 FlowRL 的对比实验尤其 isolates 这一差异:两者属于同一轨迹平衡家族,但 FlowBalance 在能量中引入校准后的自指导,带来一致的性能提升。 —- ### 4. 引导式自我进化系统 - **R-Few**

37
:构建 Challenger–Solver 外循环,通过小规模人工锚点与在线难度课程稳定任务演化。 **与 FlowBalance 的关系**:R-Few 等系统关注**外循环**的任务生成与课程设计。FlowBalance 研究的是**内循环**(inner-loop)问题——给定固定任务提示与 on-policy 解轨迹,如何更新策略分布而不放大错误自信或坍缩成功策略多样性。两者互补:外循环生成新任务,内循环的 FlowBalance 算子负责从经验中学习策略分布。 Q3: 论文如何解决这个问题? 论文通过提出 **FlowBalance** 方法,将策略自我改进重新定义为**学习一个归一化的完整响应分布**。其解决路径可分为三个紧密衔接的环节:提取密集的自指导信号、用验证器结果校准该信号以避免错误自信、最后通过轨迹平衡将复合能量转化为可拟合的归一化目标。具体机制如下。 —- ### 1. 从特权后见视角提取密集自指导 对于每个提示 x 及训练专属上下文 c (如参考答案),FlowBalance 使用当前策略的**冻结快照** π(θ^-) 对已采样的 token 进行打分。具体地,对一条 on-policy 轨迹 y = (y_1, dots, y_T) ,计算每条采样 token 在“后见视角”与固定参考策略 π(ref) 之间的裁剪对数概率增益:

δt^H(y; x, c) = clip( log π_H(y_t mid s_t, c) - log π(ref)(yt mid s_t), -B, B )
再沿轨迹平均,得到**轨迹级自指导增益**:
G_H(y mid x, c) = (1) / (T) ∑
(t=1)^T δ_t^H(y; x, c)
该指标衡量了同一模型在观察到特权上下文后,对这条已采样轨迹的平均认可程度。重要的是, π_H 不重新采样轨迹,也不接收梯度——它仅作为**停止的特征(stopped feature)**提供密集证据。 —- ### 2. 结果校准:用验证器优势为自指导定向 密集自指导可能错误地偏好被验证器拒绝的轨迹。FlowBalance 引入**符号门控(sign gating)**,以组相对优势 A_i = A_G(y^((i))) 决定自指导的流向:

E_(FlowBalance)(y^((i)) mid x, c) = eta_A A_i + β_G G_H(y^((i)) mid x, c) , sgn(A_i)
其中: - 当 A_i > 0 (验证器认可),正的自指导被**保留**,用于在成功模式内部做细粒度区分; - 当 A_i < 0 (验证器拒绝),正的自指导被**反转**( -β_G G_H ),防止模型将错误自信转化为自我强化监督; - 当 A_i = 0 (组内无结果偏好),密集分支被**禁用**。 这一步将验证器稀疏但可靠的终端结果,转化为对密集信号的方向性控制,确保自指导**细化验证器的方向而非覆盖它**。 —- ### 3. 构建并拟合归一化的参考支持目标分布 FlowBalance 将校准后的能量转化为一个**归一化的完整响应分布**,而非仅作为局部优化信号:

p^star(FlowBalance),G(y mid x, c) propto π(ref)(y mid x) exp( E(FlowBalance)(y mid x, c)τ )
其中 π
(ref) 保证分布的支撑集与参考策略一致,控制漂移;能量项则决定响应间的相对偏好。在实现上,基于采样的 rollout group G = y^((1)), dots, y^((N)) ,组内归一化形式为:
p^star(FlowBalance),G(y^((i)) mid x, c) = π(ref)(y^((i)) mid x) exp( E(FlowBalance)(y^((i)) mid x, c)/τ )∑(j=1)^N π(ref)(y^((j)) mid x) exp( E(FlowBalance)(y^((j)) mid x, c)/τ )
—- ### 4. 剖面化轨迹平衡(Profiled Trajectory Balance) 为将上述目标内化为可训练策略 π_θ ,FlowBalance 使用**轨迹平衡残差**:

Delta(TB)(y^((i)); x, c) = τ log Z(FlowBalance)(x, c) + τ log πθ(y^((i)) mid x)π(ref)(y^((i)) mid x) - E(FlowBalance)(y^((i)) mid x, c)
当残差为零时,策略的组内概率对比完全匹配目标能量决定的对比。优化目标为残差的平方损失:
L
(FlowBalance)(θ) = E((x,c) sim D) [ (1) / (2N) ∑(i=1)^N Delta(TB)(y^((i)); x, c)^2 ]
**配分函数的剖面化估计**: Z
(FlowBalance)(x, c) 不需要单独的网络学习,而是直接从 rollout group 中估计:
log Z(FlowBalance)(x, c) = (1) / (N) ∑(i=1)^N ( E(FlowBalance)(y^((i)) mid x, c)τ - log πθ(y^((i)) mid x)π_(ref)(y^((i)) mid x) )
这一设计仅吸收组内公共偏移(一个标量),保留了其余 N-1 个独立的组内概率对比方向供策略学习。 —- ### 5. 整体算法循环 FlowBalance 的完整内循环可概括为: 1. 当前策略快照生成 on-policy 响应组; 2. 验证器提供终端奖励,计算组相对优势; 3. 冻结的特权后见视角对采样 token 打分,聚合为 G_H ; 4. 符号门控结合优势与自指导,构建复合能量; 5. 剖面化轨迹平衡将能量转化为归一化目标并更新策略。 该框架的核心创新在于:**策略仅通过完整响应的分布匹配目标进行更新,不存在独立的 token 级模仿损失**。这避免了直接蒸馏(如 OPSD)中特权信号泄露到策略梯度、导致推理长度坍缩或模式锐化的问题,同时比纯验证器 RL(如 GRPO)更有效地利用了轨迹内部的密集结构信息。 Q4: 论文做了哪些实验? 论文的实验验证围绕**数学推理性能**、**训练动态**、**消融分析**、**策略多样性**以及**精确数值诊断**五个层面展开,具体包括以下内容。 —- ### 1. 主实验:数学推理基准对比 **实验设置** - **模型**:Qwen3-4B 与 Qwen3-8B - **数据集**:AIME24、HMMT25、Minerva、MATH500、OlympiadBench - **基线方法**:GRPO、OPSD、RLSD、FlowRL - **评估指标**:AIME24 采用 Pass@16,其余采用 Pass@1;报告 5 个种子的均值与样本标准差 - **检查点**:主表结果在训练第 180 步报告 **核心结果(表 1)** - 在 Qwen3-4B 上,FlowBalance 的五个基准平均分为 **64.26**,超过 GRPO(62.31)、FlowRL(63.22)、RLSD(59.55)与 OPSD(54.12)。 - 在 Qwen3-8B 上,FlowBalance 平均分为 **67.61**,在每个基准上均取得最佳均值,超过 GRPO(65.49)、FlowRL(65.85)、RLSD(64.12)与 OPSD(41.16)。 —- ### 2. 训练动态分析 在 Qwen3-8B 上追踪训练过程中的 AIME24 验证准确率与响应长度,诊断更新效率、稳定性及行为模式(图 2)。 - **训练加速**:FlowBalance 约在 **100 步**达到 0.5 的 AIME24 验证准确率,而 GRPO 约需 **143 步**(快 1.43 倍)。 - **训练稳定性**:在 400 步训练范围内,FlowBalance 始终接近峰值性能;GRPO 在约 180 步后出现显著退化。 - **响应长度**:直接 OPSD 的响应长度迅速坍缩至较短序列,而 FlowBalance 保持较长的推理轨迹,未出现捷径行为。 —- ### 3. 消融实验 对 FlowBalance 能量中的两个系数进行一维扫描,隔离验证器锚定与自指导强度的贡献(表 2、表 3;完整结果见附录表 6、表 7)。 **验证器系数 eta_A 扫描**(固定 β_G = 1 ,Qwen3-8B,step 180) - eta_A ∈ 5, 10, 15 - 五个基准平均分分别为 65.65、65.41、**67.61**(默认配置) **自指导系数 β_G 扫描**(固定 eta_A = 15 ,Qwen3-8B,step 180) - β_G ∈ 1, 2, 3 - 五个基准平均分分别为 **67.61**、66.48、65.95 - 结果显示单纯增大 β_G 反而降低性能,证明自指导需要**校准**而非盲目增强。 —- ### 4. 正确策略多样性诊断 为避免自我改进仅锐化单一成功模板,论文在 AIME24 上通过 LLM-judge(GPT-5.5)评估正确响应的**语义策略多样性**(附录 D.3)。 - **指标**:正确样本的 Simpson 策略多样性

D(Simpson) = 1 - ∑_k p_k^2
其中 p_k 为第 k 个语义策略簇在正确响应中的占比。 - **结果(图 3)**: - FlowBalance:**0.2194** - RLSD:**0.1456** - GRPO:**0.1017** **案例研究(表 4 与附录 D.5)** - 以 AIME24 Problem 23 为例:GRPO 采用标准的 Cayley–Menger 行列式路径;FlowBalance 则发现了一条基于隐藏 4 × 5 × 8 长方体嵌入的替代正确路径。 - 附录进一步展示 Problem 5(全局包络 vs 重根唯一性)、Problem 15(子午面圆切线 vs 隐式曲面法线)、Problem 27(坐标消元 vs 正切双曲线参数化)的策略差异,表明 FlowBalance 的概率质量分布在**数学表示根本不同**的正确推导上,而非同一模板的措辞变体。 —- ### 5. 精确数值诊断(附录 C.1) 在可精确枚举的合成响应空间上,直接实例化 FlowBalance 的目标分布,验证其理论性质(图 4–7)。 - **四模式机制视图**(图 4):两个失败模式与两个成功模式。FlowBalance 将成功概率质量提升至 **0.900**(reward-only 为 0.818,ungated 为 0.832),并将鲁棒成功模态的质量从 0.327 提升至 **0.440**。 - **二元虚假自信修正**(图 5):在混合结果组中,对失败响应赋予正向虚假支持 G^- 时,FlowBalance 始终保持对验证成功响应的偏好;当 G^- = 0.5 时,FlowBalance 的成功概率为 **0.894**,优于 reward-only(0.817)与 ungated(0.807)。 - **可靠性–强度边界图**(图 6):映射自指导在不同可靠性 q 与强度 β_G/τ 下的表现,证明符号门控仅在指导可靠性高于阈值时提升验证成功率,且不会将任意错误指导变为安全信号。 - **结构性质验证**(图 7): - FlowBalance 指数倾斜路径达到给定复合能量水平时,反向 KL 仅为 **0.273**,而构造的匹配能量固定数据目标需要 **0.973**(3.6 倍差距),证实其**最小保守位移**特性。 - 在 rollout group 大小 N = 32 时,剖面化配分估计的局部高斯参数风险仅为逐对对比估计器的 **2.92%**(约 1/34),证实其**保留所有组内对比**的统计效率。 —- ### 6. 共享实验协议与可复现性控制(附录 D.1) 所有方法在相同主干模型内共享以下设置以确保公平比较: - 相同的训练提示、rollout group 大小、最大响应长度、验证器、优化器调度与评估脚本 - OPSD 使用固定特权教师;RLSD 与 FlowBalance 使用冻结的当前策略快照作为特权打分路径 - 评估时部署策略仅接收问题陈述,不接触特权上下文 c Q5: 有什么可以进一步探索的点? 基于论文结论与讨论部分所明确的局限,以及方法论层面的自然延伸,可进一步探索的方向包括: —- ### 1. 跨领域泛化验证 现有大规模实验集中于数学推理任务。FlowBalance 在**具身智能(agentic)任务**、**多模态长程推理**(如视觉-语言联合推理)或其他需要复杂长序列决策的领域中的表现仍有待验证。不同领域的奖励稀疏性与验证器可靠性差异,可能会改变符号门控与轨迹平衡的有效性边界。 —- ### 2. 外层循环(outer loop)与课程生成的结合 论文刻意将研究范围限定在**固定任务分布上的内循环**(inner-loop)策略更新。一个自然的下一步是将 FlowBalance 的分布匹配算子与**自进化任务生成器**或**难度自适应课程**(如 R-Few 风格的 Challenger–Solver 框架)相结合。这需要额外研究任务漂移(task drift)、策略稳定性与策略多样性在循环迭代中的联合动态。 —- ### 3. 响应长度与推理质量的因果机制 实验观察到 FlowBalance 避免了 OPSD 的响应长度坍缩,但论文明确指出,这**并未建立“更长响应导致更高准确率”的因果结论**。后续工作可设计受控实验,分离推理链长度、自我修正频率与最终正确性之间的关系,以理解长度作为中介变量的具体机制。 —- ### 4. 多种子、多检查点的人类/专家多样性评估 当前策略多样性分析依赖单一种子、单一检查点的 LLM-judge(GPT-5.5)诊断。未来需要: - **多种子重复实验**,检验多样性增益的统计稳健性; - **人类专家标注**,替代或补充 LLM judge,以验证语义策略聚类的有效性; - **训练全过程追踪**,观察策略多样性随训练步数的演化轨迹,而非仅测量终点。 —- ### 5. 子轨迹平衡(Subtrajectory Balance)的实证研究 论文在方法部分提出了子轨迹平衡框架(第 3.3 节),允许对长响应的中间片段施加残差约束,以提供更密集的拟合信号。然而,主实验采用完整响应实现。后续可探索: - 子轨迹采样策略(如固定长度区间、关键推理节点、或基于注意力权重的自适应分段); - 中间状态配分函数 Z(s) 的估计方法及其对超长推理链的信用分配改进。 —- ### 6. 自适应或情境化的系数机制 FlowBalance 的能量系数 eta_A (验证器权重)与 β_G (自指导权重)在当前实现中为全局超参数。消融实验表明 β_G 过大反而损害性能。未来可研究: - **提示级或任务级的自适应系数**,根据问题难度或组内奖励方差动态调整 eta_A 与 β_G ; - **学习到的门控机制**,替代固定的符号函数 sgn(A_i) ,以处理验证器信号本身存在噪声或组内优势接近零的模糊情形。 —- ### 7. 特权信息来源的扩展与风险 当前特权 hindsight 仅依赖模型自身的冻结快照与训练上下文(如参考答案)。可探索: - **跨模型指导**:使用更强的外部模型(而非同模型快照)提供 π_H ,并分析其与 FlowBalance 校准机制的结合; - **部分正确反馈**:当验证器仅提供部分可验证结果(如多步推理中的中间检查点)时,如何扩展能量函数 E
(FlowBalance) 以利用细粒度的过程监督(process supervision)。 —- ### 8. 优化器层面的全局收敛理论 论文的理论分析集中于**目标分布层面的性质**(如最小反向 KL、单调奖励控制、错误自信修正),并明确声明这些不等同于“任意神经网络优化器的全局收敛保证”。后续工作可研究: - 在参数化策略与有限样本下,轨迹平衡损失的几何性质; - FlowBalance 更新算子在重复应用下的不动点与收敛条件。 Q6: 总结一下论文的主要内容 这篇论文针对**推理模型如何从自身的 on-policy 经验中实现可靠、稳定且分布保持的自我改进**这一核心问题,提出了 **FlowBalance** 方法。以下从研究动机、方法框架、理论分析与实验验证四个维度进行总结。 —- ### 1. 研究动机:自我改进内循环的脆弱性 推理模型的自我改进面临两个相互矛盾的信号: - **稀疏但可靠的终端验证**:基于可验证奖励的强化学习(RLVR)仅提供终端正确性信号,无法利用长推理链内部的细粒度结构。 - **密集但不可全信的自指导**:利用冻结的特权后见视角(privileged hindsight)对采样 token 进行打分,虽能提供密集的轨迹级证据,却可能因观察到推理时不可用的信息而产生**错误自信**(false confidence),进而导致自我确认(self-confirmation)、模式坍缩或推理长度急剧缩短。 因此,论文提出一个分布性自我改进问题:**给定 on-policy 经验、稀疏验证结果与密集但不完美的自指导,下一个策略应学习何种归一化的完整响应分布?** —- ### 2. FlowBalance:验证器锚定的分布匹配 FlowBalance 将策略更新重新定义为**学习一个归一化的完整响应分布**,而非局部优化信号。其核心包含三个机制: **(1)特权后见自指导提取** 对每条 on-policy 轨迹 y ,利用冻结的当前策略快照在训练上下文 c (如参考答案)条件下的打分,计算相对于固定参考策略的裁剪 token 级对数概率增益,并沿轨迹平均得到自指导增益:

GH(y mid x, c) = (1) / (T)∑(t=1)^T clip(log (πH(y_tmid s_t, c)) / (π(textref))(ytmid s_t), -B, B)
**(2)结果校准的复合能量(符号门控)** 利用组相对优势 A_i 的符号决定自指导方向,防止错误自信被放大:
E
(FlowBalance)(y^((i)) mid x, c) = eta_A A_i + β_G G_H(y^((i)) mid x, c),sgn(A_i)

  • 若 Ai > 0 (验证通过),保留 +G_H 以细化成功模式; - 若 A_i < 0 (验证失败),反转为 -G_H ,避免失败轨迹被自我强化; - 若 A_i = 0 ,禁用密集分支。 **(3)剖面化轨迹平衡拟合** 将校准后的能量转化为参考支持的 Gibbs 目标分布:
    p^star
    (FlowBalance),G(y mid x, c) propto π(ref)(ymid x)exp(E(FlowBalance)(ymid x, c)τ)
    并通过**剖面化轨迹平衡**(profiled trajectory balance)拟合该目标。每组的配分函数用一个标量估计吸收公共偏移,保留全部 N-1 个组内概率对比方向,且无独立的 token 级模仿损失:
    Delta(TB)(y^((i)); x, c) = τlogZ + τlogπθ(y^((i))mid x)π(ref)(y^((i))mid x) - E(FlowBalance)(y^((i))mid x, c)
    —- ### 3. 理论性质 论文证明了 FlowBalance 目标分布在四个关键方面的优良性质: - **组内对比保留**:剖面化配分仅移除一个公共偏移,所有 N-1 个独立的组内概率对比均用于训练。 - **最小保守位移**:该目标是达到其复合能量水平时,相对于参考策略的**唯一最小反向 KL 散度**位移。 - **单调验证器控制**:固定自指导下,增大验证器系数 eta_A 单调提升目标分布的期望验证奖励:

(∂) / (∂etaA)E(p^star)[R] = Var_(p^star)(R)τ(σ_R(x)+ε) ≥ 0

  • **错误自信精确修正**:对于验证成功的 y^+ 与被拒的 y^- ,符号门控将其目标概率比相对于未门控情形精确修正 exp(2β_G G_H(y^-)/τ) 倍,将失败轨迹上的正向虚假支持转化为对成功轨迹的相对奖励。 —- ### 4. 实验验证 在 Qwen3-4B 与 Qwen3-8B 上的数学推理实验表明: - **准确率领先**:FlowBalance 在 AIME24、HMMT25、MATH500、OlympiadBench 等基准上取得最佳平均表现。在 Qwen3-4B 上,五基准平均分 **64.26**,超过 GRPO(62.31)、RLSD(59.55)与 FlowRL(63.22);在 Qwen3-8B 上平均分 **67.61**,全面领先所有基线。 - **训练效率与稳定性**:在 Qwen3-8B 上,FlowBalance 以约 **100 步**达到 0.5 AIME24 验证准确率(GRPO 约需 143 步),且在 400 步内保持稳定;GRPO 在约 180 步后出现显著退化。 - **避免长度坍缩**:直接 OPSD 的响应长度迅速坍缩,而 FlowBalance 保持长推理轨迹。 - **策略多样性更高**:在 AIME24 的 LLM-judge 诊断中,FlowBalance 的正确样本 Simpson 语义策略多样性为 **0.2194**,显著高于 GRPO(0.1017)与 RLSD(0.1456),其成功解覆盖数学表示根本不同的推导路径(如隐藏长方体嵌入 vs Cayley–Menger 行列式)。 —- ### 5. 结论 FlowBalance 将自我改进视为**分布学习问题**,通过验证器锚定的符号门控机制,将密集但不完美的自指导约束在可靠的终端结果方向上,并以轨迹平衡将其转化为可拟合的归一化完整响应分布。该方法在数学推理任务上实现了比纯验证器 RL 和直接自蒸馏组合更优的性能、更快的收敛、更高的稳定性与更广的正确策略覆盖。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Zixun Huang,Kishan Panaganti,Haitao Mi,Leowei Liang

Categories:

PDF URL: https://arxiv.org/pdf/2609.03241.pdf

Arxiv URL: https://arxiv.org/abs/2609.03241

Arxiv ID: 2609.03241

CoolPaper URL: https://papers.cool/arxiv/2609.03241

Published: 2026-09-09T01:31:22.970Z

Updated: 2026-09-09T01:31:22.970Z


3. ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation

Abstract:We present ENEAS, a unified, text-promptable method for instance tracking and semantic discovery. Text-promptable segmentation models, including the latest foundation models such as SAM 3, still suffer from temporal hallucinations, spatial fragmentation, and semantic misclassification: they fail to report target absence when an object leaves the field of view, segment local textures instead of the complete object during extreme close-ups, and prioritize visual features over ontological reality, so that visually similar artifacts such as statues, paintings, or reflections are segmented as target entities. ENEAS works two ways from a single method: precise tracking and high-quality segmentation of a unique instance, and open-concept discovery of every instance a text query names, resolved by a semantic verification layer. For tracking, we extend the geometrically robust SeC architecture, previously limited to point interactions, with a text-prompting adapter and leverage its temporal memory, so that the target is held through disappearance without drifting to distractors and kept whole even when it fills the entire view. For discovery, the verification layer combines high-speed visual embedding matching with conditional VLM refinement, invoking semantic reasoning only for ambiguous candidates, which filters out the ontological errors that visual-only models cannot distinguish while keeping latency low. Designed with 3D reconstruction in mind, where a single misclassified distractor corrupts the asset, ENEAS unlocks high-quality semantic tracking and segmentation of video, of broad libraries, and of collections of temporally or spatially unordered data, together with the discrimination to tell true instances from their doppelgangers: things that look alike but are not the same. The code and models are available at this https URL

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决现有文本可提示分割模型(包括 SAM 3 等最新基础模型)在真实场景,尤其是面向 3D 重建等下游任务时,面临的三大核心失效模式: - \*\*时间幻觉与身份漂移\*\*:当目标对象离开视野或被完全遮挡时,现有模型无法报告其缺失,反而会在视觉上相似的干扰物(如背景、其他同类物体)上重新"检测"并分割,导致实例身份丢失与跟踪漂移。 - \*\*空间碎片化\*\*:在目标占据整个画面的极端特写或视角剧变下,模型倾向于分割局部纹理或细节(如画作中的笔触、雕像的局部),而非保持对完整对象实例的空间一致性。 - \*\*语义错误分类与本体论混淆\*\*:模型过度依赖视觉先验,将视觉上相似但本体论上完全不同的实体误判为目标类别,例如将超写实雕像、波普艺术肖像、镜中倒影等分割为"人"。 为应对上述问题,论文提出 \*\*ENEAS\*\*,其核心贡献在于通过一个统一框架同时实现: 1. \*\*实例级别的鲁棒跟踪\*\*:引入文本驱动的初始化,扩展基于记忆的视频对象分割架构(SeC),使模型在目标消失时不漂移、在极端尺度变化下不碎片化,并正确输出空掩膜表示目标缺失。 2. \*\*语义级别的精确发现\*\*:构建由高速视觉嵌入匹配与条件式视觉语言模型(VLM)裁判组成的级联验证层。仅当视觉嵌入处于"不确定区间"时才调用 VLM 进行本体论推理,从而在过滤雕像、画作等语义干扰物的同时控制延迟。 简言之,该论文解决的是\*\*强感知能力与弱验证能力之间的不匹配\*\*——即现有模型能生成几何正确的掩膜,却无法保证其在时间、空间和语义层面的真实性与可靠性。 Q2: 有哪些相关研究? 相关研究主要涵盖以下七个方向: \*\*1. 可提示与通用分割\*\* - \*\*闭集实例与全景分割\*\*:Faster R-CNN、Mask R-CNN、DETR、DINO、Mask2Former、OneFormer 等,这些方法均在固定类别词汇表上进行分割。 - \*\*Segment Anything 系列\*\*:SAM 打破闭集限制,支持点、框、掩膜提示;后续工作分别改进了掩膜质量、效率、粒度与提示多样性。SAM 2 引入流式记忆库实现视频中的单标注跟踪;SAM 3 进一步提出可提示概念分割(Promptable Concept Segmentation),以名词短语检测、分割并跟踪所有匹配实例。 - \*\*ENEAS 的定位\*\*:以 SAM 2.1 作为分割头,但专注于弥补文本提示化后仍存在的可靠性缺口,包括目标缺失与遮挡下的身份保持、以及视觉歧义下的本体正确性。 \*\*2. 开放词汇检测与分割\*\* - \*\*知识蒸馏与图像级监督\*\*:如基于 CLIP 的开放词汇检测、Grounded Language-Image Pre-training 等。 - \*\*开放集检测器\*\*:Grounding DINO 及其后继工作融合语言与视觉特征实现开放集检测;YOLO-World 将能力推向实时场景。 - \*\*开放词汇分割\*\*:LSeg、OpenSeg、ODISE、SAN、X-Decoder、OpenSeeD 等从像素嵌入对齐、掩膜-标题对齐、扩散模型表示等角度实现分割。 - \*\*检测-分割级联与统一模型\*\*:Grounded SAM 将开放集检测器与 SAM 级联;Florence 与 Florence-2 作为统一的序列到序列模型处理检测、定位与描述任务。 - \*\*ENEAS 的选择\*\*:使用 Florence-2 作为区域提议组件。 \*\*3. 指代与推理分割\*\* - \*\*指代分割\*\*:在图像与视频中根据自然语言表达式定位单个对象,近期基准强调包含运动描述的复杂表达式。 - \*\*多模态大语言模型驱动分割\*\*:LISA、GLaMM(图像),以及 VISA、VideoLISA、Sa2VA(视频)等让语言模型直接输出分割标记以回答提示。 - \*\*概念级记忆跟踪\*\*:SeC 以不同方式使用 VLM——不直接回答语言提示,而是在给定空间提示后维护被跟踪对象的概念级记忆,并在场景变化时注入掩膜解码器。ENEAS 的跟踪模式即基于 SeC 并为其扩展了文本接口。 \*\*4. 基于记忆的视频对象分割\*\* - \*\*时空记忆传播\*\*:通过时空记忆网络、长期记忆模型、对象级读出与分层传播等方法将掩膜从标注帧传播至整个视频。 - \*\*SAM 2 的扩展\*\*:后续工作针对长视频、运动感知跟踪、干扰物感知记忆等进行了增强。 - \*\*解耦式跟踪\*\*:DEVA、SAM-Track 将图像级开放词汇分割与时间传播解耦;多目标跟踪器通过语言关联或纯外观关联进行跨帧匹配。 - \*\*与 ENEAS 的关系\*\*:SeC 为 SAM 2 补充了基于 VLM 的概念记忆,ENEAS 继承其对目标消失与极端尺度变化的鲁棒性,并提供了缺失的文本驱动初始化。 \*\*5. 视觉-语言嵌入\*\* - \*\*对比式图像-文本预训练\*\*:CLIP、ALIGN 及其在 LAION-5B 等超大规模数据上的开源复现。 - \*\*独立评分机制\*\*:SigLIP 以成对 sigmoid 损失替代 batch softmax,使每对图像-文本独立评分;SigLIP 2 进一步提升语义理解与定位能力,并引入原生宽高比(NaFlex)处理变体。 - \*\*提示集成与分数校准\*\*:包括可学习的提示集成方法,以及对嵌入分数校准的长期研究。 \*\*6. 视觉-语言模型作为裁判\*\* - \*\*指令调优 VLM\*\*:LLaVA、BLIP-2、InternVL、PaliGemma、Qwen-VL 系列等能够回答图像开放问题。 - \*\*模型评判与成本权衡\*\*:LLM/VLM 作为评判者(LLM-as-a-Judge)的范式;显式推理链可提升准确率但显著增加 token 开销;约束 Q3: 论文如何解决这个问题? ENEAS 通过\*\*统一的架构与分阶段级联验证\*\*解决上述问题。该方法接受自然语言提示与图像/视频帧集合,根据提示指代的是特定实例还是语义类别,分别激活实例跟踪或语义发现模式,二者共享同一套定位与分割后端,但采用不同的验证策略确保时间、空间与语义层面的鲁棒性。 --- ### 1. 共享基础组件 两种模式均依赖以下两个算子: - \*\*定位算子\*\* G(I, p) :由 Florence-2 Large 实现,负责将自然语言提示 p 映射到图像 I 中的候选区域。 - \*\*分割算子\*\* S(I, r) :由 SAM 2 实现,负责将候选区域 r 转换为精确的二进制掩膜。 --- ### 2. 实例跟踪:文本驱动的记忆传播 针对特定实例(如 \*"the blue painting"\*),ENEAS 扩展了 SeC 跟踪器,使其支持\*\*文本初始化\*\*并继承其\*\*概念级时间记忆\*\*: - \*\*初始化\*\*:在任意选定的参考帧 I_(t_0) 上,通过定位算子获得目标区域 r_0 = G(I_(t_0), p) ,而非依赖手动标注的点。 - \*\*传播\*\*:利用 SeC 的跟踪器 T 及其历史记忆 H_t ,逐帧传播实例身份:

M_t = T(I_t mid r_0, H_t)

  • 目标缺失处理:当对象离开视野或被完全遮挡时,记忆机制强制输出空掩膜 M_t = 0 ,而非在视觉上相似的干扰物上重新检测,从而避免身份漂移。 - 极端尺度保持:概念级记忆使模型在目标占据整个画面的极端特写中,仍分割完整实例而非碎片化局部纹理。 —- ### 3. 语义发现:由粗到精的级联语义验证 针对开放类别(如 “person”),ENEAS 对每帧独立重新评估,以发现新进入场景的实例。该流程按成本递增组织为四级级联,仅将模糊样本路由至高成本阶段: #### 阶段一:区域提议 Florence-2 在每帧上提出候选区域集合 R_t = G(I_t, p) 。此阶段刻意保持高召回率,允许引入干扰物,由后续阶段过滤。 #### 阶段二:嵌入验证(轻量过滤) 使用基于 SigLIP 2 的视觉-语言嵌入模型对每个候选 r 独立评分。关键设计包括: - 独立二元评分:采用 sigmoid 损失而非 softmax,使每个图像-文本对的评分不受图像中其他物体影响,避免”分数抑制”现象。 - 提示集成:将类别提示的多种表述嵌入取平均,得到鲁棒分数 $s(r) ∈

0, 1
,以缓解裁剪图与完整训练图像之间的域偏移。 - 双阈值路由:设定 τ(rej) < τ(acc)$,将候选划分为三组:
r mapsto accept & if s(r) ≥ τ(acc), discard & if s(r) < τ(rej), verify & otherwise.
高置信度样本直接接受或拒绝,仅**不确定区间** $
τ(rej), τ(acc)) 内的候选进入下一阶段。 #### 阶段三:语义验证(条件 VLM 裁判) 对嵌入模型无法确定的候选,调用轻量级 Qwen3-VL 作为二元裁判: - 上下文隔离:将相邻候选的像素进行黑色掩码处理,确保判断仅聚焦于当前候选,避免上下文干扰。 - 结构化裁决:模型以固定格式返回二元判决 v(r) ∈ 0, 1 ,被显式约束回答对象是否真正属于目标类别而非视觉仿品(如雕像、画作、人体模型),且禁用自由形式推理以降低 token 开销与延迟。 - 按需激活:由于该阶段仅处理真正模糊的候选,其成本随场景歧义程度而非物体数量缩放。 #### 阶段四:掩码生成 最终接受集 At (包含直接接受的候选与经 VLM 验证为真的候选)输入 SAM 2,生成每个实例的掩膜: M_t^((i)) = S(I_t, r_i), quad r_i ∈ A_t —- ### 4. 关键设计原理总结 | 问题根源 | ENEAS 的解决机制 | |————-|————————| | 时间幻觉与身份漂移 | SeC 概念记忆 + 文本初始化,强制目标缺失时输出空掩膜 | | 空间碎片化 | 概念级记忆指导分割头保持实例完整性,而非响应局部纹理 | | 视觉-语义混淆 | 几何提议(Florence-2 / SAM 2)与语义验证(SigLIP 2 + VLM)解耦;VLM 引入本体论推理层,基于全局上下文与材质属性区分”看起来像”与”真的是” | | 计算成本 | 级联架构 + 不确定区间机制,将昂贵的 VLM 调用限制在最小必要集合,标准场景下延迟可降至约 1 秒/帧 | 简言之,ENEAS 的核心在于将”快速感知”与”慢速验证”结构性分离:视觉嵌入负责过滤明确的背景与噪声,视觉-语言模型仅作为认知裁判介入语义灰色地带,从而在保持高召回的同时,将本体错误导致的假阳性从 90% 量级压至 5% 以下。 Q4: 论文做了哪些实验? 论文的实验围绕实例跟踪的时序鲁棒性语义发现的本体精确性两大核心能力展开,涵盖定性可视化对比、定量基准测试及系统性的消融分析。具体实验内容包括: —- ### 1. 实验设置与数据集 实验在以下四类数据上进行,覆盖从本体歧义到常规跟踪的多种场景: | 数据集/基准 | 用途与特点 | |——————|—————-| | Church Statues | 真实 3D 重建采集,教堂内超写实宗教雕塑与游客并存,天然最大化”person”类别的本体歧义,用于测试语义严谨性 | | Blue Painting | 动态室内序列,单幅画作经历视角变化、遮挡、消失及极端特写,用于测试实例跟踪 | | Moving Boxes | 室内搬运场景,人员与箱子、家具相互遮挡,用于测试多实例发现与杂乱环境 | | SA-Co/VEval (SA-V Test) | 外部标准基准,按提示类型拆分为实例跟踪(指代特定物体)与语义发现(指代类别)两个子集 | 硬件环境标准化为单张 NVIDIA L4 GPU(24 GB VRAM)与 Intel Xeon CPU,以模拟成本敏感的生产环境。 —- ### 2. 实例跟踪鲁棒性实验 在 Blue Painting 序列上,以文本提示 “blue painting” 评估 ENEAS 对三类失效模式的处理能力: - 目标缺失与身份保持 - 与 Grounded SAM(Grounding DINO + SAM 2.1)对比:当目标被完全遮挡或离开视野时,基线模型出现严重的身份漂移,将窗帘、头发等背景元素误判为目标;ENEAS 借助 SeC 的时间记忆正确输出空掩膜(True Negative),避免假阳性累积。 - 极端尺度下的空间完整性 - 与 SAM 3Grounded SAM 对比:在画作占据整个画面的极端特写中,基线模型发生空间碎片化,仅分割局部笔触或细节;ENEAS 保持对完整实例的掩膜连贯性。 —- ### 3. 语义发现与新实例检测实验 在 Moving BoxesChurch Statues 上评估开放类别的发现能力: - 多实例与杂乱环境 - 在 Moving Boxes 上以 “chair” 为提示:Grounded SAM 出现灾难性过度分割,将桌子、纸箱、墙壁误判为椅子;ENEAS 通过 VLM 验证实现”手术式”精确过滤,仅保留真实椅子。 - 在 Church Statues 上以 “real person” 为提示:ENEAS 能够持续发现新进入视野的实例,无需重新提示,解决了仅支持传播模型(如 SAM 2.1)的静态初始化瓶颈。 —- ### 4. 与基础模型的直接对比 #### 4.1 定性分析:本体歧义挑战 - 波普艺术测试(Pop-Art Test):背景中的大型平面肖像画在视觉上具有人脸特征。SAM 3 因缺乏本体过滤层,反复将画作分割为 “person”;ENEAS 通过 VLM 裁判正确识别其为非生命表征。 - 雕像测试(Statue Test):面对超写实宗教雕塑,SAM 3 为几乎所有雕像生成高置信度掩膜;ENEAS 的语义验证层成功拒识雕像,仅保留活体目标。值得注意的是,二者在缺乏上下文的极端特写中均可能出现泄漏,但 ENEAS 显著降低了错误频率。 #### 4.2 定量基准:Church Statues 在 “person” 提示下,以 Precision / Recall / F1 评估本体正确性: | 模型 | Precision (%) | Recall (%) | F1-Score (%) | |———|———————-|——————|———————| | SAM 3 | 11.1 | 83.7 | 19.5 | | ENEAS-2B | 94.7 | 73.5 | 82.8 | | ENEAS-4B | 97.5 | 79.6 | 87.6 | SAM 3 虽召回率极高,但 precision 仅为 11.1%,表明每检测到一个真人约伴随八个语义假阳性(雕像、画作等)。ENEAS-2B 将 precision 提升至 94.7%,F1 提高四倍;换用 4B 裁判模型后,在保持近乎完美的语义纯度的同时进一步挽回召回。 #### 4.3 SA-Co/VEval 基准 按提示类型分组对比 ENEAS 与 SAM 3: - 实例跟踪子集:ENEAS 在 HOTA(26.70 vs 26.51)与 TETA(17.86 vs 16.65)上略优,核心优势来自关联质量 AssA(90.77 vs 90.18),即时间身份一致性更强;SAM 3 在 LocA(定位精度)上稍占上风。 - 语义发现子集:ENEAS 在 HOTA(9.23 vs 9.19)与 TETA(9.53 vs 9.10)上同样小幅领先,DetA 与 LocA 二者基本持平。 —- ### 5. 消融研究 #### 5.1 组件必要性分析 在 Church Statues 上逐步叠加模块,验证各组件贡献: | 配置 | 验证逻辑 | Precision | Recall | F1 | 行为特征 | |———|—————|—————-|————|——|—————| | RPN 基线 | 仅文本提示 | 10.5% | 79.6% | 18.6% | 严重幻觉 | | RPN + Embeddings(宽松) | 固定阈值 T > 0.50 | 55.7% | 79.6% | 65.5% | 滤除噪声,但保留雕像 | | RPN + Embeddings(严格) | 固定阈值 T > 0.80 | 94.3% | 67.4% | 78.6% | 去伪成功,但遗漏真人 | | ENEAS-2B | 自适应区间 0.10 < T < 0.90 | 94.7% | 73.5% | 82.8% | 速度与性能最优平衡 | | ENEAS-4B | 自适应区间 0.10 < T < 0.90 | 97.5% | 79.6% | 87.6% | 最佳性能,延迟更高 | 结果表明:纯嵌入过滤无法在高精度高召回之间兼得;仅在不确性区间引入 VLM,才能在不牺牲太多速度的前提下恢复被严格阈值误杀的实例。 #### 5.2 不确定性区间阈值敏感性 使用 ENEAS-2B 在 Church Statues 上测试不同区间配置: | 配置 | 区间 | VLM 激活率 | 平均延迟 | F1 | |———|———|—————-|————-|——| | Aggressive / Fast | 0.40–0.60 | 16.2% | 1.04 s | 74.3% | | Balanced | 0.15–0.75 | 59.4% | 2.48 s | 79.6% | | Robust | 0.10–0.90 | 78.1% | 3.29 s | 82.8% | | VLM-Only | 0.00–1.00 | 100% | 5.05 s | 79.1% | 关键发现:VLM-Only 模式不仅延迟最高,F1 反而低于 Robust 配置,说明对所有样本强制进行语言推理会引入”过度推理”导致的随机误差。 #### 5.3 场景适应性与效率 在 Moving Boxes 上采用 Fast Mode(接受阈值降至 0.40): - VLM 激活率从 Church Statues 的 78.1% 骤降至 27.0% - 延迟降至 1.14 秒/帧(约为鲁棒模式的 3 倍加速) - 在存在遮挡的标准语义场景下仍保持 F1 = 98.0% 且零假阳性,证明系统能根据场景歧义动态分配计算资源。 #### 5.4 VLM 规模分析 对比 2B 与 4B 裁判模型在 Robust 配置下的表现: | 模型 | 平均延迟 | F1 | 速度因子 | |———|————-|——|————-| | 2B | 3.29 s | 82.8% | 1.0× | | 4B | 5.02 s | 87.6% | 1.5× 更慢 | 4B 模型作为语义性能上限,解决了 2B 模型仍感模糊的剩余 hard cases;2B 被确立为默认配置,4B 作为离线高精度场景的可选配置。 Q5: 有什么可以进一步探索的点? 基于论文的局限性讨论与未来工作声明,可进一步探索的方向可分为以下三个层面: —- ### 一、论文明确提出的未来工作 1. 时序一致性的跨帧关联 当前语义发现模式逐帧独立执行,不跨帧维护实例身份。未来可将实例跟踪中使用的记忆传播机制复用于语义发现,把每帧检测到的新实例链接为时间连贯的轨迹,从而同时获得”发现”与”跟踪”能力,解决多目标在视频中的持久身份分配问题。 2. 校准的置信度分数估计 现有系统输出二元掩膜但不提供置信度分数,这限制了其在需要分数阈值调优或概率融合的后处理流程中的应用。未来可从 SigLIP 2 的嵌入分数与 VLM 的判决中联合导出经过校准的置信度估计(例如通过 Platt scaling 或温度缩放),使系统输出具有概率解释性。 3. VLM 裁判知识向嵌入层的蒸馏 当前不确定区间的存在导致 VLM 仍需处理大量模糊候选。未来可通过将 VLM 的判决结果蒸馏到视觉-语言嵌入过滤器中,使嵌入模型逐渐学习那些原本仅能通过显式推理解决的本体特征(如”石材质感” vs. “皮肤纹理”)。随着蒸馏进行,不确定区间可动态收缩,在保持精度的同时降低平均延迟。 —- ### 二、由现有局限性衍生的改进方向 4. 突破区域提议网络的召回瓶颈 系统召回率受 Florence-2 提议能力上限约束:过小、过远或重度遮挡的目标若未被提议,后续验证阶段无从恢复。未来可探索: - 多尺度或金字塔式提议策略; - 结合 3D 重建中的多视图几何一致性,利用跨帧/跨视角线索恢复被单帧遗漏的实例; - 引入显式处理微小目标的专用检测头。 5. 极端视觉条件下的上下文补全 VLM 裁判在极端特写(无周围场景或材质线索)和低分辨率小目标(远处物体)时性能退化。未来工作可探索: - 在 VLM 输入中显式注入周边上下文摘要(而非简单黑掩码邻居),或利用视频时序上下文补全单帧缺失的语义线索; - 基于超分辨率或细节增强的预处理,提升小目标上的裁判可靠性。 6. 面向高密度场景的弹性扩展 当前架构的验证成本随每帧候选数量线性增长,在拥挤街道等密集场景中计算负担过重。未来需要设计候选聚合或层级验证机制(如先在场景级进行语义场景分类,再决定是否触发逐实例验证),或利用稀疏注意力/批处理推理降低 VLM 的单位成本。 7. 实时性优化与硬件协同 鲁棒配置在 L4 GPU 上约为 3 秒/帧,虽对离线 3D 重建可接受,但尚未达到实时视频处理要求。可通过: - VLM 的模型量化、剪枝或专家混合(MoE)架构; - 嵌入过滤器与 VLM 的流水线并行化; - 针对边缘设备的轻量化 VLM 设计(如 0.5B 以下专用裁判模型)。 —- ### 三、面向下游任务与系统级扩展的潜在研究 8. 3D 语义-几何联合优化 既然 ENEAS 的设计初衷是服务 3D 重建,可进一步将 2D 分割结果与 3D 高斯泼溅(3D Gaussian Splatting)或神经辐射场(NeRF)结合,利用多视图光度一致性反向约束和精化 2D 掩膜,形成”2D 语义发现 → 3D 一致性正则化 → 2D 掩膜优化”的闭环。 9. 自适应阈值与提示集成学习 当前 τ(rej) 与 τ(acc) 为固定超参数,且提示集成采用人工模板平均。未来可引入在线自适应机制,根据场景类别或历史验证结果的分布动态调整阈值,甚至通过元学习自动优化提示模板集合,使系统在标准场景自动进入 Fast Mode,在歧义场景自动切换至 Robust Mode。 10. 多模态提示的统一验证框架 目前系统支持文本与点两种初始化模式,但语义验证层仅服务于文本驱动的发现。未来可探索将点、框、草图等空间提示同样纳入 VLM 的判别语境,构建一个能同时处理并仲裁多种模态提示冲突的统一验证协议。 Q6: 总结一下论文的主要内容 ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation 提出了一种统一的文本可提示分割方法,旨在解决现有基础模型(如 SAM 3)在真实视频与无序图像集合中面临的时间幻觉空间碎片化语义误分类问题。 —- ### 1. 研究动机与问题 现有文本可提示分割模型存在三类核心失效: - 时间幻觉与身份漂移:目标离开视野后,模型无法报告缺失,反而在视觉相似物上重新检测,导致实例身份丢失。 - 空间碎片化:极端特写或视角剧变时,模型分割局部纹理而非完整对象。 - 本体论混淆:仅凭视觉先验将雕像、画作、倒影等视觉仿品误判为目标实体(如将雕像识别为“人”)。 这些缺陷在 3D 重建等下游任务中代价极高——单个误分类的干扰物即可破坏重建资产。 —- ### 2. 方法概述 ENEAS 是一个统一的文本驱动分割框架,根据自然语言提示的类型自动选择两种工作模式: #### (1) 实例跟踪(特定对象) 针对如 “the blue painting” 的特定实例提示,ENEAS 扩展了 SeC 跟踪架构: - 利用 Florence-2 将文本提示转化为初始区域,替代原有的点交互; - 继承 SeC 的概念级时间记忆,在视频传播中维持对象身份; - 目标被遮挡或消失时输出空掩膜,避免漂移;在极端尺度变化下保持对象的空间完整性。 #### (2) 语义发现(开放类别) 针对如 “person” 的类别提示,ENEAS 采用由粗到精的级联验证流程(见论文 Figure 1): | 阶段 | 组件 | 功能 | |———|———|———| | 区域提议 | Florence-2 | 每帧高召回地提出候选区域 | | 嵌入验证 | SigLIP 2 + 提示集成 | 独立 sigmoid 评分,通过双阈值 τ(rej) < τ_(acc) 将候选分为直接接受、直接丢弃或进入不确定区间 | | 语义验证 | Qwen3-VLM(条件激活) | 仅对不确定区间的候选进行二元本体裁判,通过邻居掩码隔离与结构化输出,判断其是否为真实目标而非仿品 | | 掩码生成 | SAM 2 | 对最终接受的候选生成精确实例掩膜 | 该级联设计将昂贵的 VLM 调用限制在真正模糊的样本上,使系统在保持高语义精度的同时控制延迟。 —- ### 3. 核心实验结果 实验在具有本体歧义的真实采集数据(Church Statues)、常规视频(Blue Painting、Moving Boxes)及标准基准 SA-Co/VEval 上展开: - 语义严谨性:在 Church Statues(提示 “person”)上,SAM 3 的 F1 为 19.5%,精度仅 11.1%;ENEAS-2B 将 F1 提升至 82.8%(精度 94.7%),ENEAS-4B 进一步达到 87.6%(精度 97.5%),有效过滤了超写实雕像与画作。 - 实例跟踪鲁棒性:在 Blue Painting 序列中,ENEAS 正确处理了目标的完全消失(输出 True Negative),并在极端特写中保持了完整对象掩膜,避免了 SAM 3 与 Grounded SAM 的碎片化与漂移问题。 - SA-Co/VEval:在实例跟踪与语义发现两个子集上,ENEAS 的 HOTA 与 TETA 均优于或持平于 SAM 3,尤其在时间关联一致性(AssA)上优势显著。 —- ### 4. 消融研究洞察 - 组件必要性:纯区域提议网络幻觉严重;纯嵌入过滤无法同时在严格阈值下兼顾精度与召回;仅在不确定区间引入 VLM 才实现了最优的 F1-精度权衡。 - 阈值敏感性:将不确定区间设为 [0.10, 0.90

$ 的 Robust 配置达到最佳 F1(82.8%);而 VLM-Only 模式不仅更慢(延迟 5.05 秒),反而因过度推理导致 F1 下降至 79.1%。 - **场景适应性**:在标准场景(Moving Boxes)中使用 Fast Mode,VLM 激活率从 78.1% 降至 27.0%,延迟缩短至 1.14 秒/帧,仍保持 F1 = 98.0%。 - **模型规模**:4B VLM 作为语义性能上限缓解了 2B 模型的剩余 hard cases,但延迟增加 52%;2B 模型被确立为默认的高效配置。 —- ### 5. 主要贡献与局限 **贡献**: - 统一了实例跟踪与语义发现,兼容有序视频与无序图像集合; - 引入文本初始化的记忆跟踪,解决了目标消失与极端尺度下的失效; - 提出基于不确定区间的条件 VLM 验证,以低成本实现高本体精度; - 在具有严重本体歧义的真实数据上验证了现有基础模型的局限性,并提供了可量化的改进。 **局限与未来方向**: - 召回受限于区域提议网络(Florence-2)对过小或重度遮挡目标的检测能力; - VLM 在缺乏上下文的极端特写或低分辨率小目标上仍可能失效; - 当前语义发现不跨帧维护实例身份,且未输出置信度分数; - 计算成本随候选数量线性增长,密集人群场景超出设计范畴; - 鲁棒配置延迟约 3 秒/帧,尚非实时。 未来工作包括将记忆传播用于跨帧实例关联、将 VLM 知识蒸馏至嵌入层以压缩不确定区间,以及为系统提供校准的置信度输出。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Javier del Pino,Salvador Rodríguez,Alejandro Garabito,Javier Álvarez,Chema Garabito

Categories:

PDF URL: https://arxiv.org/pdf/2609.03756.pdf

Arxiv URL: https://arxiv.org/abs/2609.03756

Arxiv ID: 2609.03756

CoolPaper URL: https://papers.cool/arxiv/2609.03756

Published: 2026-09-09T01:31:22.944Z

Updated: 2026-09-09T01:31:22.944Z


4. Causal Foundation Models

Abstract:Causal inference is the practice of estimating the effect of a treatment or intervention from data. It traditionally requires a bespoke pipeline for every new problem: first proposing a causal mechanism, selecting a compatible estimator, and finally training it. Meanwhile, across diverse settings and modalities, much of machine learning has shifted to the paradigm of foundation models: networks pretrained once at scale and applied to new tasks without fine-tuning. Causal foundation models (CFMs) bring this paradigm to causal inference. CFMs are pretrained neural networks that estimate causal quantities, such as the average treatment effect, on entirely new datasets using in-context learning without requiring model updates. This work provides a practical introduction to this emerging area. We summarize the necessary background in causal inference and machine learning before discussing CFMs. Throughout, we include example code and Jupyter notebooks.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03003 (stream has been aborted)

Authors: Christopher Stith,Hossein Rahmani,Jesse C. Cresswell

Categories:

PDF URL: https://arxiv.org/pdf/2609.03003.pdf

Arxiv URL: https://arxiv.org/abs/2609.03003

Arxiv ID: 2609.03003

CoolPaper URL: https://papers.cool/arxiv/2609.03003

Published: 2026-09-09T01:31:22.957Z

Updated: 2026-09-09T01:31:22.957Z


5. EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

Abstract:Vision-language-action (VLA) models map visual observations and language instructions directly to robot actions, but long-horizon tasks require more than action prediction. An agent must coordinate perception, planning, execution, progress verification, and recovery as the physical state evolves. An action prediction or a model-generated skill decision does not, by itself, guarantee that the proposed operation is valid in the current state or that its outcome will be verified. We propose EmbodiedSkills, a unified framework that treats each skill decision as an execution proposal: the runtime checks its prerequisites before execution and verifies the outcome afterward. A shared executable-skill interface connects high-level skill selection, bounded low-level VLA execution, and post-action verification within a single agent loop. Because this interface remains fixed, low-level VLA policies can be replaced or adapted without changing the agent loop. The interface also records planning, execution, verification, and recovery events as structured trajectories, which provide supervision for individual components and can support optional online adaptation when interactive feedback is available. We instantiate EmbodiedSkills with Qwen3-VL and OpenPI/pi0.5 on RoboTwin 2.0 and LIBERO. Task-adapted low-level VLA policies achieve an average success rate of 86.20% across 50 RoboTwin 2.0 tasks and 97.40% across the four LIBERO suites. These results establish the execution performance of the task-adapted low-level VLA policies used in EmbodiedSkills. On four memory-dependent RMBench tasks, the same task-adapted execution approach achieves 12.5% average success. The framework provides a trainable and inspectable agent layer for turning these policies into closed-loop embodied systems.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*视觉-语言-动作(VLA)模型在长程机器人任务中面临的决策与物理执行脱节问题\*\*。 具体而言,现有工作存在以下核心局限: - \*\*端到端 VLA 策略的决策隐式化\*\* 现有 VLA 策略(如 π0.5 、RT-2 等)将感知、规划、执行、验证和恢复等中间环节隐式地嵌入模型内部。当任务失败时,难以定位失败根源——无法区分是对象定位错误、子目标选择不当、低级动作执行失败、进度验证缺失,还是恢复机制失效。 - \*\*LLM-based 机器人代理的决策缺乏物理约束与验证\*\* 虽然基于大语言模型的机器人代理能够将推理和工具调用显式化,但其生成的决策在当前物理状态下未必有效。提出的技能可能与当前阶段不兼容、依赖过时的观察、缺少必要参数,或执行后无法产生预期结果。仅靠提示词(prompting)无法强制执行约束或验证物理结果。 - \*\*模型级决策与物理执行之间的鸿沟\*\* 长程操作要求机器人不仅预测下一步动作,还必须协调感知、规划、执行、进度验证和恢复。核心挑战在于:如何确保\*\*提出的操作在执行前经过先决条件检查、执行后通过结果验证,且验证证据能够反馈给后续决策与学习\*\*。 为弥合上述鸿沟,论文提出 \*\*EmbodiedSkills\*\* 框架,其核心设计目标包括: 1. \*\*将技能决策视为执行提案\*\* 每个技能调用不是直接动作,而是需要经过运行时检验的提案:执行前验证先决条件(prerequisites)、阶段兼容性、输入完整性和状态合法性;执行后验证实际结果。 2. \*\*建立共享的可执行技能接口\*\* 通过统一的技能契约(skill contract)连接高级策略(子目标选择与规划)与低级 VLA 策略(有界动作块生成),使得低级策略可在不改变代理循环(AgentLoop)的前提下独立替换或适配。 3. \*\*构建闭环的六阶段代理循环\*\* 通过显式的观察(Observe)、规划(Plan)、预检(Preflight)、执行(Execute)、验证(Verify)和恢复(Recover)阶段,使失败显式化、可追溯,并支持基于结构化轨迹的组件级训练与可选的在线策略优化。 简言之,该论文试图将“只能预测动作”的 VLA 模型转变为能够\*\*持续感知、验证、纠错和适应\*\*的可靠具身智能体。 Q2: 有哪些相关研究? 根据论文第2节(Related Work),相关研究可从以下四个维度进行梳理: ### 1. 视觉-语言-动作(VLA)策略与机器人控制 该类研究关注如何将视觉-语言预训练与机器人动作生成统一为端到端模型,并不断提升低级动作策略的能力。 - \*\*大规模机器人策略\*\* - \*\*RT-1 / RT-2\*\*

1, 2
:展示了基于 Transformer 的策略可从真实机器人数据中学习,并将视觉-语言知识迁移到机器人控制。 - **Open X-Embodiment / RT-X**
3
:进一步跨具身尺度扩展了上述方向。 - **OpenVLA、Octo、 π0 、 π0.5 、Qwen-VLA**
4–7, 21
:推动了开源、可复用且通用的机器人策略发展。 - **低级动作生成策略** 包括扩散策略(Diffusion Policy)
22
、ACT 风格的动作分块(ACT-style action chunking)
23
、扩散与稀疏专家模型(DexVLA、Sparse Diffusion Policy、MoE-DP)
24–27
、世界-动作模型(World2Act、Fast-WAM)
29, 30
,以及原子技能解码器(AtomicVLA)
28
等。这些工作显著增强了低级机器人控制能力。 **EmbodiedSkills 的定位**:不替换上述低级 VLA 策略,而是通过共享执行接口将其接入智能体层,专注于决定策略何时、如何被调用、验证与重试。 —- ### 2. 机器人智能体、技能与分层控制 该类研究探索如何利用语言或视觉-语言模型协调机器人技能,以及经典的分层控制方法。 - **LLM/VLM 协调技能** - **SayCan**

10
:结合语言模型评分与学习到的可供性(affordances)。 - **Inner Monologue**
31
:将环境反馈纳入规划。 - **Code as Policies**
32
:生成可执行的机器人程序。 - **VoxPoser**
11
:构建语言条件的 3D 价值图。 - **PaLM-E**
33
:将具身多模态输入集成到大型语言模型中。 - **近期模块化与分层执行系统** 包括以对象为中心的操作(ManipLLM)
34
、视觉提示(MOKA)
35
、语言接地规划(Planar)
36
、模块化路由(MOIRA)
37
,以及层次化 VLA 执行系统(RoboClaw、HiVLA)
38, 39
。 - **经典分层控制** 涵盖选项框架(options)、分层强化学习(HRL)、技能链与行为树
14–17, 40
。 **EmbodiedSkills 的差异**:不仅将技能视为规划词汇或模型内部分解,而是让策略提出结构化技能调用,并由**独立的运行时**强制执行先决条件、证据时效性与合法状态转移,使可执行技能成为闭环编排、轨迹记录与组件适配的共享契约。 —- ### 3. 智能体级强化学习 该类研究关注如何通过环境或验证器反馈改进大模型的推理与智能体行为。 - **通用智能体 RL** GRPO 风格的推理训练与近期系统(如 DeepSeekMath

41
、DeepSeek-R1
42
、SWE-RL
43
、SWE-Gym
44
、ToolRL
45
、WebAgent-R1
46
、RAGEN
47
)表明,语言模型可通过数学、软件工程、工具使用与网络交互中的反馈进行自我提升。 - **机器人强化学习** 物理交互带来独特挑战:探索成本高、状态部分可观测、奖励稀疏或延迟
12, 13
。代表性工作包括 QT-Opt
48
、Relay Policy Learning
49
、AWAC
50
。 - **面向 VLA 的 RL 与后训练** 如 RLinf-VLA
51
、 π^ 0.6
52
、World2Act
29
,表明部署反馈对机器人基础策略日益重要。 \
*EmbodiedSkills 的定位**:与具体 RL 算法或优化目标正交。其结构化轨迹支持对单个智能体组件进行监督适配,也可在具备交互反馈与可靠环境评估器时,为可选的在线策略优化提供一致的上下文。 —- ### 4. 评估、验证与部署基础设施 该类研究提供了评测环境与分析工具,用于衡量长程任务性能并诊断失败原因。 - **评测基准** 从桌面操作扩展到长程、语言条件、双手、家庭与跨具身场景,包括 RLBench

53
、CALVIN
54
、LIBERO
19
、ManiSkill
55
、RoboCasa
56
、SimplerEnv
57
、RoboTwin / RoboTwin 2.0
8, 9
。 - **执行监控与失败分析** 涵盖执行监控、失败解释、失败恢复与 VLA 动作验证
58–63
。 - **开发基础设施** 如 StarVLA
64
,反映了可复用的 VLA 开发与评估栈的需求。 **EmbodiedSkills 的定位**:依托上述评估生态,但通过**通用的结构化技能轨迹**来评估与部署智能体。它将终端成功、子目标进度、无效决策、低级策略失败、验证错误、恢复行为与延迟统一在同一个运行时抽象中,实现了跨基准的可诊断性。 Q3: 论文如何解决这个问题? 论文通过提出 **EmbodiedSkills** 框架,将 VLA 模型转化为受守卫的闭环具身智能体,核心解决思路是**将策略决策与物理执行分离,并通过显式契约和运行时验证确保两者可靠衔接**。具体方法如下: —- ### 1. 策略–运行时分离与共享技能契约 框架定义了一个统一的**可执行技能接口(shared executable-skill interface)**,将高层策略的决策与运行时的物理执行解耦。 - **技能契约**:每个技能 k 被形式化为一个六元组:

k = (X_k, Y_k, pre_k, exec_k, post_k, fail_k)
其中 X_k 和 Y_k 为类型化的输入输出模式; pre_k 定义执行先决条件; exec_k 为可执行操作; post_k 指定状态更新规则; fail_k 将失败映射为显式状态与证据。 - **工件时效性**:所有中间结果(观察、计划、动作等)均以**带来源和时效信息的工件(artifacts)**形式存储。当依赖的观察或状态改变时,运行时自动使下游依赖工件失效,防止过期预测被静默用于新的物理动作。 —- ### 2. 六阶段闭环智能体循环(AgentLoop) 运行时通过有序阶段集 Z 组织执行语义:

Z = (Observe, Plan, Preflight, Execute, Verify, Recover)
各阶段职责如下: | 阶段 | 核心职责 | 典型操作 | |———|————-|————-| | **Observe** | 获取当前视觉与任务相关证据 | 捕获视角、提取视觉证据、更新场景表征 | | **Plan** | 将任务分解为可验证子目标 | 构建语义计划、选择活跃子目标、分配执行预算 | | **Preflight** | 检查活跃子目标是否就绪 | 校验任务上下文、观察、机器人状态与策略可用性 | | **Execute** | 生成并应用有界动作块 | 构建 VLA 请求、生成动作块、在环境中执行 | | **Verify** | 根据执行后证据判断进度 | 对比观察状态与子目标、选择下一语义路由 | | **Recover** | 在不可继续的失败后进行修正 | 解释失败证据、修订计划、选择安全重入阶段 | 该循环并非固定顺序的线性管道。策略可根据当前状态重新观察、修订计划、继续执行当前子目标、推进至下一子目标或进入恢复流程。 —- ### 3. 受守卫的决策验证(Guarded Runtime Transition) 策略仅负责**提出**结构化决策,运行时负责**强制执行**执行语义。决策分为三类:

dt ∈ RunSkill(k, q), AdvanceStage, FinishRun
运行时为每类决策设置独立的守卫函数: - **技能执行守卫**:
G
(skill)(st, d_t) = 1[d_t = RunSkill(k,q)] · 1[stage(d_t)=z_t] · 1[k ∈ K(zt)] · prod(r ∈ R(k,q)) 1[r(st)=1]
确保阶段兼容、技能在可接受集合中,且所有先决条件 R(k,q) 满足。 - **阶段推进守卫**:
G
(advance)(st, d_t) = 1[d_t = AdvanceStage] · 1[R(zt)(s_t)=1]
确保当前阶段已产生下一阶段所需的证据。 - **终止守卫**:
G
(finish)(dt) = 1[d_t = FinishRun]
状态更新规则为:
s
(t+1) = U(st, k(q)), & G(skill)(st, d_t)=1 N(s_t), & G(advance)(st, d_t)=1 F(s_t), & G(finish)(d_t)=1 B(s_t, d_t), & otherwise
其中 U 记录执行结果并失效过期依赖; N 推进循环; F 终止; B 记录被阻塞的决策及其证据,使失败显式化。 —- ### 4. 有界动作执行与低级 VLA 接口 在 Execute 阶段,低级 VLA 策略将活跃子目标、当前观察、机器人状态和预检证据映射为有界动作块:

(gt, O_t, F_t) longrightarrow a_t longrightarrow e_t
动作块 a_t 被定义为:
a_t = (τ_t, U_t, H_t, eta_t), quad U_t = [u_t^1, …, u_t^(H_t)]
其中 τ_t 为动作类型, H_t 为执行时域(horizon), eta_t 将其绑定至对应子目标与观察上下文。运行时通过以下规则验证动作块:
R
(act)(at, s_t) = 1[0 < H_t ≤ H(max)] · 1[a_t models Sigma_p] · 1[fresh(a_t; g_t, O_t)] · 1[valid(U_t)]
一个语义子目标可能需要多个有界动作块。每执行完一块,循环获取新证据,由验证器决定继续执行或推进子目标。 —- ### 5. 验证与恢复机制 Verify 阶段仅评估**活跃子目标**,基于最新动作块后的观察证据,从以下语义路由中选择:

V = Advance, Continue, Reobserve, Replan, Recover, Finish

  • **Advance**:子目标完成,推进至下一子目标 - **Continue**:子目标未完成,继续当前子目标的另一有界尝试 - **Reobserve / Replan**:观察或计划失效时刷新场景证据或修订计划 - **Recover**:进入恢复阶段,利用显式失败证据生成修订的执行上下文 - **Finish**:任务完成 整体任务成功由环境提供的终端评估协议定义,而非局部子目标判断。 —- ### 6. 组件级训练与可选闭环优化 EmbodiedSkills 的接口结构支持独立训练与替换各个组件: - **规划器(Planner)**:在任务指令与视觉上下文监督下,学习生成有序的**语义子目标序列**。子目标定义应达到的物理状态,而不嵌入模拟器特定的控制细节。 - **低级 VLA 策略**:使用**子任务级演示**单独适配。训练样本配对观察、机器人状态、活跃子目标与对应动作序列。部署时通过 Execute 接口接收相同条件的上下文。 - **高层调度器(Scheduler)**:以 Qwen3-VL 为基础,在**冻结低级 VLA 策略**的条件下进行监督微调(SFT)。输入包括任务指令、当前阶段 z_t 、图像 I_t 、紧凑运行状态 s_t 、可接受技能集 K_t 与近期历史 h_t ;输出为阶段适配的技能决策及其结构化参数。 - **部署一致的样本构造**:训练时遵循与部署相同的输入边界和历史压缩规则,确保组件不会在训练时接触到测试时不可用的证据。 - **可选在线闭环适配**:完整循环可收集交互轨迹:

τ = langle (x1, y_1), …, (x_T, y_T), e(1:T), R rangle
支持基于组相对策略优化(如 GRPO 风格)的在线优化,但论文将其作为可选精化机制,而非替代组件级监督。 —- ### 7. 模块化适配与跨基准验证 框架通过模型适配器、环境适配器和动作策略模块,保持接口在不同具身与基准间的一致性。感知、规划、动作生成、验证与恢复既可共享基础模型并使用阶段专属适配器,也可完全替换为独立模型,只要遵守相同的技能与状态契约。这使得: - 低级 VLA 策略可在不改变智能体循环的前提下替换或特化; - 高层组件可在冻结低级策略的情况下单独改进; - 终端成功、子目标进度、无效决策、低级失败、验证错误与恢复行为均可在同一运行时抽象中跨基准诊断。 Q4: 论文做了哪些实验? 论文在第5节(Experiments)中开展了多组实验,涵盖跨基准的低级VLA策略性能验证、闭环智能体循环的消融分析,以及定性执行案例。具体实验内容如下: —- ### 1. 评估协议与实验设置 实验在三个基准上评估通过EmbodiedSkills执行接口暴露的任务适配低级VLA策略: - **RoboTwin 2.0**

9
:涵盖50个操作任务。对每个任务单独微调一个 π0.5 策略,策略通过统一执行接口接收当前观察、机器人状态与活跃子目标。报告任务级宏观平均成功率,并与LingBot-VA
18
报告的 π0.5 参考结果(82.74%)对比。 - **LIBERO**
19
:在四个套件(LIBERO-Spatial、LIBERO-Object、LIBERO-Goal、LIBERO-Long)上评估,报告套件级成功率,并与官方OpenPI发布结果(96.85%)对比。 - **RMBench**
20
:在四个记忆依赖的 M(n) 任务上测试,评估当正确动作依赖先前交互历史时,子任务条件化执行接口的表现。 - **AgentLoop消融实验**:在全部50个RoboTwin 2.0任务上,每任务评估100个回合,控制比较语义子任务、中间验证与重复动作块三种机制的贡献。 —- ### 2. RoboTwin 2.0 任务级执行性能 表2报告了全部50个任务的成功率。任务适配的低级VLA策略达到**86.20%**的宏观平均成功率,较LingBot-VA参考的82.74%提升**3.46个百分点**。 - **显著提升的任务**:Hanging Mug(+20)、Blocks Ranking Size(+15)、Open Microwave(+15)、Move Can Pot(+10)、Move Stapler Pad(+10)。 - **整体对比**:在50个任务中的39个上超过参考值,1个持平,10个略低;多数下降幅度仅为1–2个百分点,且集中在参考成功率已高于90%的任务。 —- ### 3. LIBERO 跨套件泛化 表3对比了四个LIBERO套件的结果。任务适配策略的宏观平均成功率为**97.40%**,较官方OpenPI参考的96.85%提升**0.55个百分点**。 | 套件 | OpenPI | Ours | 变化 | |———|————|———|———| | Spatial | 98.8 | 99.0 | +0.2 | | Object | 98.2 | 98.6 | +0.4 | | Goal | 98.0 | 98.4 | +0.4 | | Long | 92.4 | 93.6 | +1.2 | LIBERO-Long的提升最为明显(+1.2个百分点),表明该执行接口在较长任务序列上具有优势,同时保持了短程空间与对象操作上的强性能。 —- ### 4. RMBench 记忆依赖任务 表4报告了四个 M(n) 记忆依赖任务的结果。任务适配策略的宏观平均成功率为**12.5%**。 | 任务 | DP | ACT | π0.5 | X-VLA | Ours | |———|——|——-|————-|———-|———| | Battery Try | 10 | 19 | 16 | 26 | 19 | | Blocks Ranking Try | 10 | 0 | 6 | 1 | 9 | | Cover Blocks | 0 | 0 | 0 | 2 | 6 | | Press Button | 0 | 0 | 0 | 0 | 16 | 该结果提供了对**依赖历史交互的子任务条件化执行**的额外评估,显示在需要记忆的历史依赖场景中,该接口相较于对比基线仍具优势。 —- ### 5. AgentLoop 消融实验 表5与图3(c)通过控制实验隔离了三个关键机制的贡献。所有变体共享相同的规划器、低级策略、初始状态与终端评估器,仅在循环结构上存在差异: | 配置 | 宏观平均成功率 | |———|———————-| | **Full**(完整循环) | **86.20%** | | w/o Verify(无中间验证) | 48.2% | | w/o Subtask(无语义子任务条件) | 34.4% | | 1 chunk/subtask(每子任务仅一块32步动作) | 19.5% | 关键发现: - **移除中间验证(w/o Verify)**:保留子任务序列与总动作预算,但执行时不检查中间结果,成功率下降**38.0个百分点**。表明执行后验证对检测失败、触发重试或恢复至关重要。 - **移除语义子任务(w/o Subtask)**:每个动作块仅接收原始完整任务指令,成功率下降**51.8个百分点**。说明低级策略难以从长指令中同时推断当前阶段与所需运动。 - **固定单块分配(1 chunk)**:每个子任务仅允许单次32步动作块且无重试,成功率降至**19.5%**。表明语义分解本身不足,许多子目标需要多个有界动作块并根据观察进度自适应延续。 —- ### 6. 定性执行示例 图4展示了三个随机选取的RoboTwin 2.0成功执行案例(Adjust Bottle、Stack Three Blocks、Turn Switch)。在每个案例中,规划器将语言指令转换为短的视觉 grounded 子目标序列(如“Red to center → Green on red → Blue on green”),任务适配的VLA策略逐步推进场景状态,最终由环境评估器独立验证通过。 Q5: 有什么可以进一步探索的点? 基于论文第6节(Limitations)与整体框架设计,以下方向值得进一步探索: —- ### 1. 开发通用子目标条件化 VLA 策略 当前 RoboTwin 2.0 的实例化为每个任务维护了单独的低级 π0.5 策略,这带来了显著的**训练、存储与部署开销**。未来可探索训练**单一通用策略**,使其能根据任意语义子目标指令生成相应动作块,同时保持与 EmbodiedSkills 执行接口的兼容性。这需要在跨任务、跨具身的子目标级别数据上实现有效的知识迁移与动作接地。 —- ### 2. 端到端或分层联合训练 目前框架主要依赖**组件级独立监督适配**(规划器、调度器、验证器、低级策略分开训练),并通过固定的共享接口组合。虽然这保证了模块化,但也引入了**组件间协调风险**。未来可研究在保持技能契约与运行时守卫不变的前提下,进行**分层端到端训练**或**策略-运行时联合优化**,以减少各阶段之间的分布偏移与累积误差。 —- ### 3. 高效在线适配与细粒度信用分配 论文中的可选在线优化采用**回合级别(episode-level)的回报归因**(公式 17–18),这种方式对多个决策的因果贡献区分较粗。未来可探索: - **步骤级别或子目标级别的信用分配机制**; - **样本高效的闭环强化学习算法**,降低物理交互中的探索成本; - 将运行时记录的显式失败证据(blocked decisions, invalid transitions)直接作为**密集反馈信号**用于策略更新,而非仅依赖稀疏的终端回报。 —- ### 4. 降低延迟与系统开销 六阶段循环中的多次 VLM 调用、后动作观察捕获与验证推理引入了**额外延迟**。对于需要实时响应的物理系统,可进一步探索: - **轻量级阶段压缩**:例如将 Preflight 与 Verify 合并为轻量级局部检查,或使用蒸馏后的小模型承担高频验证; - **预测性执行与并行化**:在验证当前子目标的同时,预生成下一子目标的候选计划; - **工件缓存与增量更新机制**,减少重复感知与重新推理。 —- ### 5. 鲁棒验证与主动感知 当前 Verify 阶段受限于**视觉遮挡、属性模糊及无法从现有视角推断的物理状态**。未来方向包括: - **主动感知(active perception)策略**:当验证器对进度不确定时,智能体主动调整视角或交互以获取更多信息; - **多模态验证**:融合触觉、力矩或音频信号,弥补纯视觉验证的不足; - **不确定性量化**:让验证器输出置信度,触发条件化的重观察或人工介入。 —- ### 6. 复杂失败恢复与根因分析 现有 Recover 阶段主要基于失败证据修订计划或重试。未来可构建**结构化根因分析模块**: - 利用轨迹中的守卫阻塞记录( B(s_t, d_t) )与运行时错误,自动诊断失败源于感知、规划、低级执行还是环境动态; - 实现**从失败中学习**(learning from failure),将恢复后的成功经验固化到规划器或验证器中,避免同类重复失败。 —- ### 7. 从仿真到真实世界(Sim-to-Real)部署 论文实验集中于 RoboTwin 2.0、LIBERO 等仿真基准。真实世界中的**部分可观测性、物理不确定性、非结构化背景与执行延迟**将显著放大框架各阶段的挑战。未来需在真实机器人平台上验证: - 运行时守卫对传感器噪声与状态估计误差的鲁棒性; - 语义子目标与低级策略在真实视觉域偏移下的接地稳定性; - 额外延迟对闭环决策频率与任务成功率的定量影响。 —- ### 8. 长程自主性与误差累积抑制 论文指出,长回合中**规划与执行的小误差会累积**,导致观察与重试次数增加。未来可引入: - **世界模型(world models)**进行短程前瞻模拟,在物理执行前预判子目标可行性; - **层次化时间抽象**:在现有六阶段之上增加更高层的任务级元控制(meta-controller),用于长期目标管理与资源分配; - **动态预算分配**:根据任务复杂度与历史失败率自适应调整各子目标的执行预算与重试上限。 —- ### 9. 多智能体与协作式具身技能 当前框架聚焦于单机器人闭环。将其扩展至**多机器人或多智能体协作场景**时,共享技能接口需要支持跨实体的先决条件检查、动作协调与联合验证。这涉及分布式规划、冲突消解以及共享工件状态的一致性维护。 —- ### 10. 人机协作与交互式对齐 在框架中引入**人类反馈循环**,允许操作者在关键决策点(如 Preflight 或 Verify 阶段)进行确认或纠正。这将: - 提供高保真的在线监督信号,加速策略对齐; - 作为高风险动作(如接触易碎物体)的安全冗余; - 支持基于人类纠正的**增量式技能库扩展**,使系统能够逐步习得新的语义子目标类型。 Q6: 总结一下论文的主要内容 本文介绍了 **EmbodiedSkills**,一个用于编排、训练和部署视觉-语言-动作(VLA)具身智能体的统一框架,核心目标是将端到端 VLA 动作模型转化为可靠、可诊断的闭环机器人系统。 ### 1. 研究背景与问题 现有 VLA 策略(如 π0.5 等)擅长将视觉观察与语言指令映射为低级动作,但在长程操作中面临根本性局限: - **决策隐式化**:中间环节(规划、验证、恢复)被嵌入模型内部,失败时难以定位根因; - **决策与物理脱节**:基于大语言模型的智能体虽能显式推理,但生成的技能调用缺乏对当前物理状态的强制执行与结果验证,易执行无效或过期动作。 ### 2. 核心方法:EmbodiedSkills 框架 该框架的核心设计是**策略提案与运行时执行的分离**,通过一个**共享的可执行技能接口**连接高层决策与低级控制。 #### 六阶段闭环 AgentLoop 运行时围绕六个语义阶段循环运转,而非固定线性管道: - **Observe**:获取视觉与任务证据; - **Plan**:将指令分解为有序的语义子目标; - **Preflight**:检查执行先决条件与状态就绪性; - **Execute**:由低级 VLA 策略生成**有界动作块**(bounded action chunk)并执行; - **Verify**:根据执行后观察判断子目标进度; - **Recover**:在失败时修订计划或重试。 循环可根据证据在阶段间灵活跳转(重观察、重规划、继续执行或恢复)。 #### 可执行技能契约与受守卫的运行时 每个技能被定义为包含类型化输入输出、先决条件(pre-requisites)、状态更新与失败映射的显式契约:

k = (X_k, Y_k, pre_k, exec_k, post_k, fail_k)
运行时通过守卫函数(guards)拦截非法决策: - 验证**阶段兼容性**、**输入完整性**、**工件时效性**(artifact freshness)与**合法状态转移**; - 仅当所有条件满足时才允许物理执行; - 阻塞的决策及其证据被显式记录,使失败可追溯、可诊断。 ### 3. 训练范式 框架支持**组件级独立适配**,无需端到端联合训练: - **规划器**:学习生成可执行的语义子目标序列; - **低级 VLA 策略**:基于子任务级演示单独微调,通过统一接口接收子目标与观察; - **高层调度器与验证器**:基于部署一致的轨迹进行监督微调,低级策略可保持冻结。 此外,结构化循环轨迹支持可选的**在线闭环策略优化**(如组相对优化),但论文将其作为组件级监督之外的精化手段。 ### 4. 实验结果 通过基于 Qwen3-VL 的调度器和 OpenPI/ π0.5 低级策略的实例化,论文在多个基准上验证了执行性能: - **RoboTwin 2.0**(50 个任务):任务适配策略平均成功率达 **86.20%**,较参考值(82.74%)提升 3.46 个百分点; - **LIBERO**(四个套件):平均成功率达 **97.40%**,较官方 OpenPI 参考(96.85%)提升 0.55 个百分点,在长程套件(LIBERO-Long)上提升最明显; - **RMBench**(记忆依赖任务):在需要历史交互的 4 个任务上平均成功率为 **12.5%**。 消融实验表明,移除**中间验证**、**语义子任务条件**或**多块自适应延续**均会导致成功率急剧下降(分别降至 48.2%、34.4% 和 19.5%),验证了闭环分解与验证的核心价值。 ### 5. 主要贡献 - **技能导向的闭环 AgentLoop**:将长程 VLA 智能体形式化为围绕显式技能循环的闭环系统,而非固定管道; - **策略–运行时分离**:通过共享技能契约使高层决策与物理执行守卫解耦,失败显式化,智能体轨迹可诊断; - **模块化适配与跨基准验证**:规划、验证、动作生成与环境交互接口独立可替换,并在 RoboTwin 2.0 与 LIBERO 上验证了跨基准的强执行性能。 简言之,EmbodiedSkills 提供了一个可训练、可检查、可部署的**智能体层**,使现有的 VLA 动作策略能够在显式约束与验证下完成长程闭环物理任务。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Wei Wang,Wenqiao Zhang,Yutong Lin,Yuqian Yuan,Tianwei Lin,Jinhao Mao,Zhenxuan Fan,Mingjian Gao,Yang Dai,Wentong Li,Zheqi Lv,Zheng Dong,Yingjie Niu,Jiaqi Zhu,Jun Xiao,Chao Li,Yueting Zhuang

Categories:

PDF URL: https://arxiv.org/pdf/2609.01281.pdf

Arxiv URL: https://arxiv.org/abs/2609.01281

Arxiv ID: 2609.01281

CoolPaper URL: https://papers.cool/arxiv/2609.01281

Published: 2026-09-09T01:31:22.930Z

Updated: 2026-09-09T01:31:22.930Z


6. Verify Before You Distill: Prompt-Level Teacher Gating for On-Policy Distillation

Abstract:On-policy distillation (OPD) accelerates post-training by providing dense token-level supervision from a frozen teacher on the student’s own rollouts. Vanilla OPD applies this supervision uniformly across prompts, without checking whether the teacher is reliable for each prompt. Because reverse KL is mode-seeking, a confidently wrong teacher can induce a strong yet misleading update. Distributional proxies, such as entropy or teacher-student likelihood agreement, measure uncertainty or agreement but do not directly verify outcome correctness. We introduce Teacher-Gated On-Policy Distillation (TGOPD), built on the principle that teacher reliability should be verified at the prompt level before dense supervision is admitted. TGOPD estimates reliability from a small set of verifier-scored teacher probes and routes each prompt exclusively to dense OPD when the reliability check passes or to verifier-grounded GRPO otherwise. Across 4B and 35B students in mathematics, code, and instruction following, TGOPD outperforms Vanilla OPD in all six single-domain settings and achieves higher seven-benchmark averages at both scales under multi-domain training. By using otherwise-idle teacher capacity for reliability estimation, TGOPD also reduces teacher-side compute waste in asynchronous OPD, increasing teacher-node GPU utilization from 9.8% to 78.9% in the measured 4B single-domain run.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文主要解决 \*\*Vanilla On-Policy Distillation (OPD)\*\* 中存在的两个相互关联的核心问题: ### 1. Prompt-level 教师可靠性缺失导致错误监督被无条件采纳 Vanilla OPD 对所有 prompt 统一施加教师模型的密集 token 级监督,其更新基于反向 KL 散度:

A^(OPD)(i,t) = β , sg[ log π_T(y_t^i mid x, y(<t)^i) - log πθ(y_t^i mid x, y(<t)^i) ]
由于反向 KL 具有 **mode-seeking** 特性,它会将学生模型推向教师模型的高概率行为。当教师在某些 prompt 上表现出 “自信但错误”(confidently wrong)时,这种密集监督不仅无法被识别,反而会被放大并传播给学生,导致误导性更新。论文指出,教师的全局能力并不等同于其在每个具体 prompt 上的局部可靠性,而现有方法(如基于熵或师生似然一致性的分布代理)只能衡量不确定性或分布兼容性,**不能直接验证结果的正确性**。 ### 2. 异步 OPD 部署中教师节点的计算资源严重闲置 在典型的异步 OPD 训练流程中,学生节点负责自回归生成 rollout,而冻结的教师节点仅对已生成的 token 进行前向评分(forward evaluation)。由于评分计算量远小于自回归解码,且必须等待学生 batch 就绪后才能开始,教师节点在大部分训练周期内处于空闲状态。论文测量显示,在 4B 模型的单次域训练中,教师节点平均 GPU 利用率仅为 **9.8%**,且在 **59%** 的测量时间内利用率低于 5%,造成大量算力浪费。 —- ### 论文提出的解决思路 针对上述问题,论文提出了 **Teacher-Gated On-Policy Distillation (TGOPD)**,其核心原则是: - **先验证,后蒸馏**:在接纳密集监督之前,于 prompt 层面通过 verifier 评分的教师探针(teacher probes)估计可靠性 q_T(x) ; - **路由而非混合**:仅当可靠性检查通过(如 q_T(x) ≥ τ )时使用密集 OPD;否则完全改用 verifier-grounded GRPO,避免错误信号的干扰; - **复用闲置算力**:将教师探针的生成与异步训练循环中教师的空闲窗口重叠,从而将教师节点利用率从 9.8% 提升至 78.9%,在改善训练信号的同时减少计算浪费。 Q2: 有哪些相关研究? 根据论文第 5 节及相关章节的梳理,现有研究可归纳为以下四个方向: —- ### 1. On-Policy Distillation (OPD) 与多教师框架 **基础 OPD 方法**。早期工作提出了通过 reverse-KL 进行 token 级监督的框架:

A^(OPD)(i,t) = β , sg[ log π_T(y_t^i mid x, y(<t)^i) - log πθ(y_t^i mid x, y(<t)^i) ]
代表性工作包括 MiniLLM
5
、Agarwal 等人提出的从自生成错误中学习的 OPD 框架
1
,以及 Thinking Machines Lab 的 OPD 系统实现
23
。研究表明,这种密集反馈相比单条轨迹级奖励可显著提升样本效率
23
。 **多教师 OPD**。为整合多领域能力,Mimo-v2-flash
14
、MOPD
15
和 D3-MOPD
22
等框架将每个 prompt 路由到对应的领域专家教师,但仍无条件地使用被选中教师的密集 token 级奖励,未在 prompt 层面验证该教师的可靠性。 **OPD 的失败模式分析**。近期研究指出教师信号的有用性因实例而异:当教师知识对学生不可局部利用时
9
、学生前缀偏离教师支持状态时
4
,或教师过强导致负迁移时
10
,OPD 可能失效。这些工作为实例级教师选择提供了动机,但未通过重复采样的 verifier 评分来估计 prompt 级可靠性。 —- ### 2. 基于分布信号的可靠性感知蒸馏 该方向利用模型分布自身的统计量来调节监督强度,**不依赖外部 verifier 的结果验证**: - **熵感知方法**。EOPD

6
在高熵教师 token 处引入 forward KL,以应对不确定性。PW-OPSD
12
进一步指出,高教师熵可能同时反映”非可行不确定性”与”良性解多样性”,二者难以仅凭熵区分。 - **信任区域与解码一致性**。TrOPD
24
基于师生解码一致性定义 token 级信任区域:区域内使用 reverse KL,区域外使用 forward KL 及教师前缀 off-policy 指导。 - **稳定性与兼容性优化**。REOPOLD
7
通过混合裁剪和学生熵采样稳定隐式 token 奖励;REOPD
21
在无外部 verifier 时,从批次级兼容性信号外推 token 奖励。ESR
29
发现 off-policy 教师指导的位置依赖性退化无法完全由 KL 或熵解释。 - **内部一致性代理**。GATES
20
在无外部评分器时,利用多条采样 tutor 轨迹之间的一致性作为轨迹级可靠性代理。 这些方法的共同局限在于:它们能量化不确定性、分布不匹配或优化风险,但**无法直接区分同等自信的正确与错误答案**。 —- ### 3. 基于结果证据的可靠性感知蒸馏 该方向显式引入外部反馈(如 verifier、环境奖励)来调控监督: - **轨迹级门控**。RG-OPD

2
仅在 verifier 反馈与师生似然差距一致时保留轨迹级蒸馏,不一致的轨迹被整体丢弃。 - **方向-幅度分解**。RLSD
26
用环境正确性决定更新方向,同时用(自)蒸馏调节更新幅度。 - **分支/候选评估**。SPOT
16
在更细粒度上评估教师提出的候选分支:通过 verifier 评分的学生延续来校准局部蒸馏目标。 - **训练前数据验证**。RAFT
3
、基于自训练的方法
18
以及 Speculative Knowledge Distillation
25
等则在训练前对静态响应或 token 进行验证与筛选。 —- ### 4. TGOPD 与现有工作的区别定位 与上述研究相比,TGOPD 的核心差异体现在**验证粒度**与**决策时机**: | 维度 | 现有代表性工作 | TGOPD (本文) | |———|————————|———————| | **验证对象** | 单个 token

6, 24
、单个轨迹
2
、候选分支
16
| 重复完整教师 rollout 的聚合结果 | | **决策层级** | token 级或轨迹级混合/裁剪 | prompt 级硬路由(二选一) | | **信号关系** | 混合或加权两种监督
26
| OPD 与 GRPO 互斥,从不叠加 | | 可靠性定义 | 分布不确定性或轨迹一致性 | Verifier 通过的期望奖励 $RT(x) = E(ysimπ_T)
r(x,y)
$ | 简言之,现有方法或在微观层面混合信号,或依赖分布代理推断可靠性;TGOPD 则在宏观 prompt 层面通过少量 verifier 评分探针完成**结果正确性的直接验证**,并据此在密集 OPD 与 verifier-grounded GRPO 之间进行排他性路由。 Q3: 论文如何解决这个问题? 论文通过 **Teacher-Gated On-Policy Distillation (TGOPD)** 解决该问题,其核心原则是**在 prompt 级别先验证教师可靠性,再决定是否接纳密集监督**。具体实现分为三个层次: —- ### 1. Prompt 级可靠性估计:Verifier-Scored 教师探针 TGOPD 将教师可靠性定义为特定 prompt 上的期望验证器奖励:

RT(x) = E(ysimπT(·|x)) [ r(x, y) ] ∈ [0, 1]
即教师采样输出通过 verifier 的概率。由于该期望无闭式解,TGOPD 令冻结教师对当前 prompt 独立生成 K_T 条探针 rollout y_k
(k=1)^(KT) sim π_T(·|x) ,用同样的 verifier 评分后得到经验通过率:
q_T(x) = (1) / (K_T) ∑
(k=1)^(K_T) r(x, y_k)
该估计量无偏,且直接基于任务结果而非教师自置信度或分布熵。主实验取 K_T = 3 。 —- ### 2. 硬门控与监督路由:二选一而非混合 基于估计量 q_T(x) 与阈值 τ ∈ (0,1] (主实验取 τ = 2/3 ),定义硬门控:

g(x) = 1[ qT(x) ≥ τ ] ∈ 0, 1
门控决定每个 prompt 的监督信号: - **门控打开**( g(x)=1 ):教师可靠性达标,使用密集 token 级 OPD 优势:
A^(OPD)
(i,t) = β , sg[ log πT(y_t^i mid x, y(<t)^i) - log πθ(y_t^i mid x, y(<t)^i) ]

  • **门控关闭**( g(x)=0 ):教师监督被**完全撤回**,改用 verifier-grounded GRPO 作为 fallback:
    A^(GRPO)i = r(x, y_i) - (1) / (G)∑(j=1)^(G) r(x, yj), quad A^(GRPO)(i,t) = A^(GRPO)i ,, ∀ t
    最终 per-token 优势为二者之**互斥选择**:
    A^(TGOPD)
    (i,t) = g(x) , A^(OPD)(i,t) + (1 - g(x)) , A^(GRPO)(i,t)
    该式是**选择器而非插值**:同一 prompt 上 OPD 与 GRPO 绝不同时出现。这避免了不同密度、不同来源的信号在单条轨迹内纠缠。门控关闭时,若学生 rollout 组内奖励无差异,GRPO 中心化优势为零,该 prompt 不产生更新。 上述优势进入标准 PPO-clip 策略梯度目标:
    L^(TGOPD)(θ) = -E(xsimD),y_isimπ(old) [ (1) / (∑i |y_i|) ∑(i=1)^(G) ∑(t=1)^(|y_i|) min( rho(i,t)(θ) A^(TGOPD)(i,t), , clip(rho(i,t)(θ), 1-ε, 1+ε) A^(TGOPD)(i,t) ) ]
    其中 rho
    (i,t)(θ) = πθ(y_t^i|x,y(<t)^i) / π(old)(y_t^i|x,y(<t)^i) 。 —- ### 3. 系统实现:复用异步循环中的闲置教师算力 在异步 OPD 部署中,学生节点执行自回归解码,教师节点仅对已生成 token 做前向评分,且必须等待学生 batch 就绪。这导致教师节点天然存在大量空闲窗口(基线利用率不足 10%)。 TGOPD 将探针生成与学生 rollout 并发执行: - 在每个训练周期的起始,教师节点在等待学生 batch 的同时生成 KT 条探针; - 探针计算主要占用原本闲置的教师容量; - 评分前向 pass 仍对所有 prompt 执行(避免数据依赖的分支开销),但仅用于门控已打开的 prompt。 实测结果表明,此举将教师节点 GPU 利用率从 9.8% 提升至 78.9%(4B 单次域),集群平均利用率从 51.5% 提升至 69.5%,而端到端 wall-clock 开销有限(35B 代码任务上平均步时增加 5.9%)。 —- ### 4. 关键设计取舍 - Prompt 级粒度:整条轨迹统一接受 OPD 或 GRPO,避免 token 级混合带来的有效监督依赖于任意插值权重的问题。 - Verifier grounded:以实际结果正确性 r(x,y) 作为可靠性标准,而非教师置信度或分布熵等代理指标。 - 保守撤回:仅在审计失败的 prompt 上撤回教师信号,通过审计的 prompt 上保留完整 OPD 信号的方向与幅度。 Q4: 论文做了哪些实验? 论文的实验围绕 单领域蒸馏、多领域扩展、计算效率验证 以及 门控机制消融 展开,具体如下: —- ### 1. 实验设置 - 模型规模:在 4B(Qwen3.5-4B)与 35B(Qwen3.6-35B-A3B,MoE,3B 激活参数)两种学生规模上评估。 - 领域与教师:数学(MATH)、代码(CODE)、指令遵循(IF)三个独立领域。每个领域使用经 GRPO 微调后冻结的领域专家作为教师。 - 基线方法: - Vanilla OPD(均匀应用密集 token 级监督) - TrOPD(基于信任区域的 token 级自适应蒸馏) - RG-OPD(仅在 verifier 与师生似然差距一致时保留轨迹级蒸馏) - RLSD-style(verifier 决定更新方向,外部教师仅调节幅度) - 训练数据:数学使用 DAPO-Math-17K;代码使用 CodeI/O 的 input–output 预测任务;IF 使用过滤后的 Nemotron-Cascade 2 数据。 - 评估基准: - 数学:AIME 2025、AIME 2026(64 次采样平均)、HMMT-Feb 2025(32 次采样平均) - 代码:LiveCodeBench(code generation,6 次采样 pass@1)、OJBench(C++/Python 总体聚合) - IF:IFBench、IFEval —- ### 2. 主实验:单领域蒸馏结果 在 6 个“领域 × 规模”设置中,TGOPD 全面优于 Vanilla OPD: - 代码领域增益最大(4B 平均 +3.0,35B 平均 +2.9),与教师置信度无法区分代码 prompt 可靠性的诊断一致(AUROC 仅 0.51)。 - 35B 代码:所有对比蒸馏方法(Vanilla OPD、TrOPD、RG-OPD、RLSD-style)均出现负迁移(学生表现低于未训练基础模型);唯有 TGOPD 实现正迁移,并在 LiveCodeBench 与 OJBench 上超过教师本身。 - 4B 代码:Vanilla OPD 仅关闭了基础模型到教师差距的 21%,而 TGOPD 关闭了 55%。 - RLSD-style 失效:该基线在所有 prompt 上统一削弱教师作用,导致 14 个 in-domain 列中有 8 列低于未训练基础模型,验证了“仅在审计失败 prompt 上撤回信号”的必要性。 —- ### 3. 扩展实验:多领域 OPD(MOPD) 将 TGOPD 应用于 Multi-domain OPD(MOPD),单一学生同时学习数学、代码、IF,prompt 按领域路由至对应专家教师: - 4B:7-benchmark 平均从 53.40 提升至 54.54(+1.14),7 列中赢 6 列。 - 35B:平均从 60.99 提升至 61.94(+0.95),7 列中赢 5 列。 - 最大单列增益出现在 AIME 2026(4B +3.85)、IFBench(4B +2.94)与 OJBench(4B +0.87,35B +4.31)。 —- ### 4. 计算效率:回收闲置教师容量 在 4 种配置(4B/35B × 单领域/多领域)下测量 GPU 利用率与端到端开销: - 教师节点利用率: - 基线 Vanilla OPD:均值 5.0%–9.8%,idle(<5% 利用率)占比 57%–78%。 - TGOPD:均值提升至 57.7%–82.8%,idle 占比降至 0%–2%。 - 集群平均利用率: - 4B 单领域:51.5% → 69.5%(+18.0) - 35B 单领域:44.5% → 56.3%(+11.8) - 4B 多领域:40.8% → 53.5%(+12.7) - 35B 多领域:42.9% → 51.5%(+8.6) - 资源争用:Rollout 节点利用率在 Vanilla 与 TGOPD 间变化均在 ±2% 正常波动内,无持续争用。 - 端到端开销:35B CodeIO 对齐测量显示,TGOPD 平均步时增加 5.9%,decode 吞吐量变化 <0.1%,表明探针主要复用原本闲置的算力。 —- ### 5. 消融实验一:门控阈值 τ 固定探针数 K_T = 5 ,在 Qwen3.5-4B 数学域上扫描 τ ∈ 1/5, 2/5, 3/5, 4/5, 5/5 (训练 99 步): - 结果呈倒 U 型: - τ = 3/5 时三列 benchmark(AIME 2025/2026、HMMT-Feb)均达峰值,显著优于 Vanilla OPD。 - τ ≤ 2/5 时过滤不足,仍纳入大量低可靠性信号。 - τ ≥ 4/5 时过度严格,HMMT-Feb 在 τ = 5/5 时甚至低于 Vanilla OPD 基线。 - 最优解位于多数通过准则附近,与主实验默认的 K_T=3, τ=2/3 一致,说明粗粒度可靠性决策已足够。 —- ### 6. 消融实验二:门控关闭后的更新策略 在相同门控( K_T=3, τ=2/3 )下,比较门控关闭 prompt 的两种处理方式: - GRPO fallback(默认):使用 verifier-grounded GRPO 更新。 - Mask only:仅屏蔽 OPD 信号,该 prompt 完全不参与梯度更新。 结果: - 单领域数学:两种策略均优于 Vanilla OPD;GRPO fallback 平均略优(4B +1.47 vs +1.32;35B +1.24 vs +0.64)。 - 多领域训练: - 4B:Mask only 更强(+1.57 vs +1.14)。 - 35B:GRPO fallback 更强(+0.95 vs +0.79)。 - 核心结论:阻断错误教师信号本身贡献了约 90% 的增益,fallback 替代策略提供额外较小收益;论文最终采用 fallback 作为默认策略。 Q5: 有什么可以进一步探索的点? 基于论文的局限性与实验发现,以下方向值得进一步探索: —- ### 1. 开放端任务的可扩展验证机制 当前 TGOPD 依赖二元自动验证器(unit tests、rule-based judge)。对于缺乏明确验证程序的开放端任务(创意写作、开放式问答、复杂多轮对话),直接估计 $R_T(x) = E(ysimπ_T)

r(x,y)
变得不可行。未来可探索: - 基于模型的结果验证:利用更强或专门训练的评判模型(judge model)作为 verifier 的替代,但需解决评判模型自身的可靠性偏差。 - 无验证器的一致性代理:在完全无外部反馈时,通过教师多次采样间的语义一致性或学生-教师答案分布匹配,间接推断结果可靠性,从而将 TGOPD 的思路外推至无 ground-truth 的领域。 —- ### 2. 超越二元路由:不确定性感知的软门控 TGOPD 采用硬门控 g(x) ∈ 0,1 ,以阈值 τ 进行二元切分。虽然实验显示粗粒度决策已足够,但更细粒度的门控可能带来进一步收益: - 概率化或连续门控:将 g(x) 松弛为

0,1
内的连续权重,依据 qT(x) 的置信度(如 Var(q_T(x)) )动态调节 OPD 与 GRPO 的混合比例,而非互斥选择。 - 自适应阈值:根据训练进程、领域特性或学生当前能力动态调整 τ 。例如,早期训练放宽门控以利用教师信号,后期收紧以减少错误传播;或按领域分别设置 τ(dom) 。 —- ### 3. 门控失败后的监督策略精细化 消融实验(§4.6)表明,单纯屏蔽(mask only)不可靠教师信号已贡献约 90% 的增益,而 GRPO fallback 提供边际额外收益,且最优策略随模型规模与领域变化。深入方向包括: - 条件性 fallback:区分门控关闭 prompt 上的学生 rollout 奖励分布——当组内全对或全错时,GRPO 中心化优势为零,此时 mask only 与 fallback 等价;当组内存在质量差异时,GRPO 可提供相对信号。未来应显式报告这种 breakdown,并研究按领域选择关闭门控后的策略(如代码领域使用 verifier-grounded GRPO,数学领域采用 mask only)。 - 学生自蒸馏或迭代修正:在教师不可信时,不直接回退到稀疏 GRPO,而是让学生基于自身多次采样的一致性生成自监督信号。 —- ### 4. 动态探针预算 KT 的分配 论文固定 K_T = 3 (主实验)或 K_T = 5 (消融),并发现多数通过准则已足够。但统一预算可能非最优: - 基于先验难度的自适应采样:对模型已知困难(如学生早期训练损失高或历史通过率低的 prompt 子集)增加 K_T ,对简单 prompt 减少探针数以降低开销。 - 序贯检验与早停:将探针生成视为序贯决策过程,当累计通过/失败次数已能高置信度确定 q_T(x) 相对于 τ 的位置时,提前终止探针生成,进一步压缩 wall-clock 成本。 —- ### 5. 多教师系统中的层级可靠性路由 TGOPD 已扩展至多领域 OPD(MOPD),但当前仅在“领域选定后的教师”上做可靠性审计。更高层次的路由可探索: - 跨教师竞争门控:当多个教师可能回答同一 prompt 时(如通用教师与领域专家并存),不仅审计被选教师的可靠性,还将其与候选教师集合的探针表现对比,动态选择最可靠的教师进行蒸馏。 - 异构能力集成:研究不同能力谱系的教师(如强推理但弱代码,反之亦然)组合时,TGOPD 门控如何影响学生的能力边界与负迁移抑制。 —- ### 6. 教师-学生能力差距与理论刻画 论文观察到教师可能在某些 prompt 上“自信但错误”,且反向 KL 会放大此类错误。理论层面可深化: - 模式寻求风险的定量边界:在已知教师可靠性分布 P(R_T(x)) 的条件下,推导 Vanilla OPD 与 TGOPD 的期望错误传播上界,量化门控在何种分布假设下带来最大收益。 - 局部可学习性(local exploitability)的在线诊断:除 aggregate pass rate q_T(x) 外,结合学生当前策略 πθ 与教师的分布距离(如 KL(πθ | π_T) 在 prompt 上的局部值),判断教师知识是否处于学生当前能力可吸收的范围内,避免“过强教师导致负迁移”。 —- ### 7. 系统层面的完全 wall-clock 中性化 虽然 TGOPD 大幅提升了教师节点利用率(9.8% → 78.9%),但 35B 实验仍存在 5.9% 的端到端步时增长。可探索: - 更激进的流水线重叠:将探针生成与上一次训练步的回传重叠,或利用多流推理在单节点上并发服务探针与评分请求。 - 探针缓存与重用:当训练数据存在重复或相似 prompt 时,缓存历史探针结果以减少冗余解码;但需注意学生分布漂移导致的非平稳性。 Q6: 总结一下论文的主要内容 该论文提出了 Teacher-Gated On-Policy Distillation (TGOPD),一种在策略蒸馏框架下基于 prompt 级教师可靠性验证的自适应监督方法。 ### 1. 研究背景与核心问题 On-policy distillation (OPD) 通过 reverse-KL 散度将强教师的密集 token 级监督施加于学生自身的 rollout 上,相比稀疏的轨迹级奖励具有更高的样本效率。然而,Vanilla OPD 存在两个结构性缺陷: - 无条件信任教师信号:reverse-KL 具有 mode-seeking 特性,会促使学生模仿教师的高概率行为。当教师在某些 prompt 上表现出”自信但错误”(confidently wrong)时,这种密集监督会被无条件接纳并放大,导致误导性梯度更新。分布层面的代理指标(如熵、师生似然一致性)无法直接验证结果正确性。 - 教师节点算力严重闲置:在异步训练流水线中,教师仅对已生成的 token 执行前向评分,其计算量远小于学生的自回归解码,导致教师节点在大部分周期内空闲(实测平均 GPU 利用率不足 10%)。 ### 2. 方法:TGOPD 论文核心原则是 “先验证,后蒸馏”(Verify Before You Distill),在 prompt 层面检验教师可靠性,再决定是否接纳其密集监督。 #### 2.1 可靠性估计与硬门控 对输入 prompt x ,冻结教师独立生成 K_T 条探针 rollout y_k(k=1)^(K_T) sim π_T(·|x)$,由 verifier 评分后得到经验通过率:

qT(x) = (1) / (K_T) ∑(k=1)^(K_T) r(x, y_k)
该估计量直接反映教师在特定 prompt 上的期望正确率,而非模型自信度。基于阈值 τ 构建硬门控:
g(x) = 1[ q_T(x) ≥ τ ] ∈ 0, 1

2.2 互斥监督路由 门控决定每个 prompt 的更新方式,两种信号**绝不混合**: - **门控打开**( g(x)=1 ):教师可靠性达标,使用密集 OPD 优势:

A^(OPD)(i,t) = β , sg[ log π_T(y_t^i mid x, y(<t)^i) - log πθ(y_t^i mid x, y(<t)^i) ]

  • **门控关闭**( g(x)=0 ):教师监督被完全撤回,改用 verifier-grounded GRPO 作为 fallback:
    A^(GRPO)i = r(x, y_i) - (1) / (G)∑(j=1)^(G) r(x, yj), quad A^(GRPO)(i,t) = A^(GRPO)i
    最终 per-token 优势为二者之排他选择:
    A^(TGOPD)
    (i,t) = g(x) , A^(OPD)(i,t) + (1 - g(x)) , A^(GRPO)(i,t)

    2.3 系统实现:复用闲置算力 探针生成与学生 rollout 并发执行,主要占用异步流水线中教师节点原本空闲的窗口。此举将教师节点利用率从 **9.8%** 提升至 **78.9%**,在改善信号质量的同时减少了计算浪费。 ### 3. 实验结果 论文在 4B(Qwen3.5-4B)与 35B(Qwen3.6-35B-A3B)两种规模、数学/代码/指令遵循三个领域上进行了系统验证。 - **单领域蒸馏**:TGOPD 在所有 6 个领域×规模设置上均优于 Vanilla OPD。代码领域增益最大(4B 平均 +3.0,35B 平均 +2.9),这与代码任务上教师置信度几乎无法区分可靠性的诊断(AUROC 0.51)一致。在 35B 代码任务上,所有对比蒸馏方法均导致负迁移,唯有 TGOPD 实现正迁移并**超过教师本身**。 - **多领域蒸馏(MOPD)**:将 TGOPD 应用于多教师联合训练,4B 与 35B 的七项 benchmark 平均分别提升 **+1.14** 与 **+0.95**,证明 prompt 级门控可直接扩展至多领域路由场景。 - **计算效率**:教师节点空闲时间从 57–78% 降至 0–2%;集群平均利用率提升 8.6–18.0 个百分点;端到端 wall-clock 开销仅 5.9%。 - **消融实验**: - 阈值 τ 在多数通过准则( τ ≈ 3/5 sim 2/3 )附近呈现 broad optimum,表明粗粒度可靠性判断已足够。 - 对比门控关闭后的”完全屏蔽”与”GRPO fallback”,发现**单纯阻断错误教师信号即贡献约 90% 的性能增益**,GRPO fallback 提供额外边际收益。 ### 4. 结论 TGOPD 通过在 prompt 层面以 verifier-scored 教师探针直接验证结果正确性,实现了对密集 OPD 监督的选择性准入。该方法有效抑制了”自信但错误”的教师信号传播,同时利用异步流水线中的闲置教师算力提升了整体训练效率,为可靠且高效的 on-policy 蒸馏提供了新的范式。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Zhiwei Zhang,Zechen Sun,Fei Zhao,Kang Peng,Bin Liang,Huayu Deng,Yao Hu,Kam-Fai Wong,Mu Chuan

Categories:

PDF URL: https://arxiv.org/pdf/2609.02998.pdf

Arxiv URL: https://arxiv.org/abs/2609.02998

Arxiv ID: 2609.02998

CoolPaper URL: https://papers.cool/arxiv/2609.02998

Published: 2026-09-09T01:31:24.123Z

Updated: 2026-09-09T01:31:24.123Z


7. One Symptom, Three Levers: A Critical Review of On-Policy Self-Distillation

Abstract:On-policy distillation trains a language model on its own generations while a teacher scores them token by token. It combines the dense supervision of imitation learning with the on-policy sampling of reinforcement learning. But it requires a second, larger model to act as teacher. On-Policy Self-Distillation (OPSD) removes that cost. The teacher is the model itself, conditioned on privileged information the student will not have at test time, such as a reference solution, a plan, or environment feedback. The teacher is no stronger than the student, only better informed. Early results were promising, with accuracy comparable to reinforcement learning at a fraction of the generated tokens. But the same asymmetry that produces the signal also biases it. One failure mode now dominates the field: collapse, the progressive narrowing of the set of reasoning paths the model can produce. Collapse is not specific to OPSD, though privileged information aggravates it. This review treats collapse as a symptom governed by three levers: (i) where the signal is applied, that is, how tokens are weighted; (ii) what the teacher is shown, that is, the nature of the privileged information; and (iii) when the signal changes, that is, the teacher’s dynamics and the decay of guidance. We restrict our scope to mathematical reasoning, where the method originated and where its failure modes are best documented. We report no new experiments. The contribution is structural: a shared vocabulary for phenomena named differently across papers, and a clear line between what is settled and what is still disputed.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文试图对 \*\*On-Policy Self-Distillation (OPSD)\*\* 这一后训练方法进行系统性批判与结构化解构,核心目标是理解并控制由其密集监督信号引发的主导性失败模式——\*\*collapse(崩溃)\*\*。 具体而言,论文试图解决以下几个层面的问题: ### 1. 核心矛盾:密度与崩溃的权衡 OPSD 试图在不依赖更大外部教师模型的前提下,将模仿学习的\*\*密集 token 级信号\*\*与强化学习的\*\*在线采样\*\*相结合。其机制是让模型自身充当教师,通过测试时无法获得的\*\*特权信息\*\*(如参考答案、环境反馈)来指导学生。然而,这种产生信号的不对称性同时也使其产生偏置:密集监督会加速模型输出多样性的坍缩,即模型能生成的推理路径集合逐渐变窄。 ### 2. 对 "collapse" 症状的结构化归因 论文将 collapse 视为一个可被三个独立杠杆调控的症状,并试图厘清每个杠杆上\*\*已确立的结论\*\*与\*\*仍存在争议的问题\*\*: - \*\*杠杆 A:信号几何(Where)\*\* 解决蒸馏信号应如何施加的问题——采用何种散度(前向 KL、反向 KL 或插值)、如何对 token 进行选择性加权,以避免均匀加权导致格式 token 淹没关键推理决策。 - \*\*杠杆 B:特权信息的性质(What)\*\* 解决应向教师展示何种特权信息的问题。论文指出,直接提供完整参考答案(OPSD 的标准做法)会使教师变成"先知",抑制学生的审慎思考(deliberation)token,从而加剧崩溃。需要确定何种信息(如提示、评分标准、错误反馈)既能传递技能又不至于让学生记住测试时无法复现的捷径。 - \*\*杠杆 C:循环稳定性与时序动态(When)\*\* 解决教师模型应如何随时间演变的问题——教师权重应冻结、以指数移动平均(EMA)更新,还是按性能门控刷新;同时探讨特权信息本身是否应随训练进程逐步衰减,以防止过早脱离或后期过拟合。 ### 3. 领域整合与术语统一 OPSD 领域在半年内积累了超过两百项工作,但相同现象在不同论文中被冠以不同名称。论文试图建立一个\*\*共享的术语体系\*\*,将分散的观察(如 PMI 机制、rich-get-richer 动态、特权信息泄漏)整合到统一的分析框架中,并明确划分该领域已知事实与开放问题之间的界限。 ### 4. 评估与生产适用的审慎性 论文还试图纠正对该方法早期乐观印象的过度简化:通过梳理评估陷阱(基准方差、数据污染、模型家族特异性),指出在小规模推理模型上,OPSD 目前仍是一种需要严格对照实验的研究技术,而非可直接投入生产的现成训练方案。 \*\*总结而言\*\*,该论文并非提出一种新算法,而是通过"一个症状(collapse)、三个杠杆(信号位置、特权信息、时序动态)"的结构,为 OPSD 领域提供一幅批判性地图,以回答:\*\*如何在利用密集自蒸馏信号加速学习的同时,避免模型推理多样性与分布外能力的崩溃。\*\* Q2: 有哪些相关研究? 与 OPSD(On-Policy Self-Distillation)相关的研究可按其角色与主题归入以下类别。 --- ### 1. 奠基理论与自蒸馏思想 这些工作为“模型从自身信号中学习”或“利用特权信息训练”提供了理论源头。 | 研究 | 核心贡献 | |------|---------| | Vapnik & Vashist (2009)

48
| 提出**学习使用特权信息(LUPI)**框架:教师持有的额外信息应帮助学生识别困难样本,而非被直接复制。 | | Lopez-Paz et al. (2016)
33
| 将**蒸馏**重新表述为 LUPI 的特例,统一了特权信息与知识蒸馏的理论。 | | Furlanello et al. (2018)
12
| Born-again neural networks:证明模型可从自身输出中蒸馏并提升性能。 | | Mobahi et al. (2020)
36
| 证明自蒸馏在希尔伯特空间中放大了正则化效应。 | | Zelikman et al. (2022)
58
| STaR(Self-Taught Reasoner):通过自举法(bootstrapping)让模型从自身生成的推理中迭代学习。 | —- ### 2. On-Policy Distillation(外部教师阶段) OPSD 的直接前驱,其核心特征是“学生生成、教师打分”,但依赖一个**更大、更强的外部模型**作为教师。 | 研究 | 核心贡献 | |———|————-| | Agarwal et al. (2024)

1
| **GKD(Generalized Knowledge Distillation)**:形式化 on-policy distillation,允许使用前向/反向 KL 或 JSD 散度。 | | Gu et al. (2024)
16
| **MiniLLM**:在 LLM 中推广**反向 KL** 蒸馏,改善校准但可能牺牲多样性。 | | Lu (2025)
34
| 系统阐述 on-policy distillation 的框架与权衡。 | —- ### 3. On-Policy Self-Distillation(OPSD)的奠基与同期工作 这些论文首次移除了对外部大模型的依赖,改用**模型自身+特权信息**作为教师。 | 研究 | 核心贡献 | |———|————-| | Zhao et al. (2026)

61
| **OPSD(Self-Distilled Reasoner)**:奠基论文。用参考答案 y^star 作为特权信息,在数学推理上以极少生成 token 达到 GRPO 级别性能。 | | Hübotter et al. (2026)
21
| **SDPO(Self-Distillation Policy Optimization)**:与 OPSD 同期独立提出,将特权信息改为**环境文本反馈**(如代码执行错误),并引入 EMA 教师稳定训练。 | —- ### 4. 强化学习与可验证奖励(RLVR) OPSD 试图替代的基准范式,以稀疏的终端奖励训练模型。 | 研究 | 核心贡献 | |———|————-| | DeepSeek-AI (2025)

11
| **DeepSeek-R1**:通过 GRPO 风格的 RLVR 激发推理能力,成为该领域分水岭。 | | Shao et al. (2024)
39
| **DeepSeekMath**:提出 GRPO 算法,为后续 RLVR 方法奠定算法基础。 | —- ### 5. Collapse(崩溃)的现象、机制与诊断 这些工作记录了密集自蒸馏导致的多样性坍缩,并试图解释其成因。 | 研究 | 核心贡献 | |———|————-| | Shumailov et al. (2024)

44
| **模型崩溃(Model Collapse)**:证明在递归训练自生成数据时,分布尾部先消失,最终收敛至单峰。 | | Cui et al. (2025)
10
| 提出 RL 推理的熵定律 R = -a e^H + b :性能提升以单调消耗的熵预算为代价。 | | Nicolicioiu et al. (2026)
37
| 证明 on-policy self-distillation 虽提升 pass@1,却降低 pass@k;且**熵不能作为多样性的代理指标**。 | | Kaur et al. (2026)
24
| 显示特权信息对 **thinking models** 的损害可达 -17% (avg@16),因其抑制了审慎思考(deliberation)token。 | | Kim et al. (2026)
25
| 分析“认识论言语化(epistemic verbalization)”的抑制:过知情的教师表达更少不确定性,导致分布外性能崩溃。 | | Shen et al. (2026)
40
| 提出 **PMI(Pointwise Mutual Information)机制**:教师对参考答案的条件作用使信号膨胀为“先知”偏差,惩罚探索性 token。 | —- ### 6. 信号几何与选择性密度(杠杆 A) 探讨应使用何种散度、是否应对所有 token 均匀加权。 | 研究 | 核心贡献 | |———|————-| | Ko et al. (2024)

26
| **DistiLLM**:引入 skew KL 作为前向/反向 KL 的稳定中间地带。 | | Li et al. (2025)
28
| **DPH-RL**:在 RLVR 中按题目难度切换散度——已掌握题目用前向 KL/JS 锚定,未掌握题目则移除散度自由探索。 | | Jin et al. (2026)
22
| **Entropy-Aware OPD**:在高熵(不确定)token 上使用**前向 KL** 保持覆盖,在低熵 token 上使用**反向 KL** 保持精确。 | | Armandpour et al. (2026)
3
| **Unmasking OPD**:提出 token 级**对齐分数**(alignment score),发现仅约一半 token 的正向对齐信号才真正有用。 | —- ### 7. 特权信息的设计与优化(杠杆 B) 研究何种特权信息(参考答案、提示、评分标准、反馈)最能传递技能而不引入捷径。 | 研究 | 核心贡献 | |———|————-| | Kara & Ersoy (2026)

23
| 对比三种教师上下文:二元奖励、参考答案、**步骤对齐的 critique**;后者显著优于标准 OPSD。 | | Yu et al. (2026)
56
| **DOPD**:比较五种特权信息形式,发现**逐步提示(不带执行)**最优,而仅给最终答案反而低于无特权基线。 | | Zhang (2026)
60
| **AR-OPD(Anchored Residual)**:将教师信号分解为“可学习的锚点”(前半段轨迹)与“泄漏残差”,后者仅部分保留( λ=0.6 )。 | | Shen et al. (2026)
41
| **Purified OPSD**:通过“无问题条件下的答案教师”识别并剔除来自捷径的不可迁移信号。 | | Gu et al. (2026)
15
| **Rubric-conditioned distillation**:给教师评分标准而非答案,保留多样性,但手工评分标准远优于模型生成 Q3: 论文如何解决这个问题? 这篇论文本身是一篇**批判性综述(Critical Review)**,其作者明确声明未报告新的实验(”We report no new experiments”)。因此,它并非通过提出一种全新算法来“根治”崩溃(collapse),而是通过**结构化的理论框架**来重新定义、诊断和控制这一问题。其核心贡献在于建立了一套共享词汇,将分散在不同论文中命名各异的现象统一起来,并清晰划分了“已确立的结论”与“仍存在争议的问题”。 具体而言,论文将 collapse 视为一个由三个独立杠杆调控的症状,并系统性地梳理了每个杠杆上的现有解决思路与开放空间。 —- ### 1. 杠杆 A:信号几何(Where)—— 控制信号施加的位置与密度 该杠杆解决“密集信号应施加在何处、以何种几何形式施加”的问题。论文指出,均匀施加于所有 token 的密集信号会稀释关键决策点的梯度,并让格式 token 占据主导地位。 **已有的解决方向包括:** - **散度方向的选择**:使用**前向 KL**(mass-covering)而非反向 KL(mode-seeking),以避免学生过早锁定在教师的单一模式上。OPSD 奠基论文

61
即采用此策略。 - **选择性密度(Token 加权)**:拒绝“越密越好”的直觉。已有工作表明,仅有少量 token 真正承载学习信号: - **Entropy-Aware OPD**
22
在高熵(教师不确定)的决策 token 上施加前向 KL 以保持覆盖,在低熵 token 上使用反向 KL 以保持精确; - **DPH-RL**
28
按题目难度切换散度:对已掌握题目用 JS 散度锚定初始策略,对未掌握题目则移除约束自由探索; - **Unmasking OPD**
3
提出仅对“正向对齐”的 token(约半数)进行蒸馏,可提升信号质量。 **论文的界定**:方向选择与加权准则(如熵 vs. 理想梯度对齐)之间的权衡已初步明确,但一个**既可在训练时在线计算、又与 token 实际效用强相关的统一权重准则**仍待建立。 —- ### 2. 杠杆 B:特权信息(What)—— 控制教师所见信息的性质与剂量 该杠杆解决“应向教师提供何种特权信息(Privileged Information, PI)”的问题。论文指出,标准 OPSD 使用完整参考答案作为 PI,这使教师成为“先知”,通过点互信息(PMI)机制膨胀捷径 token 并惩罚审慎思考(deliberation),从而加剧崩溃。 **已有的解决方向包括:** - **建立安全准则**:论文引用机器人学与 LUPI 理论,提出核心判据——**特权信息只有在学生能在测试时自行重构的情况下才是安全的**。据此可对 PI 按风险排序: - 高风险:最终答案(oracle)、完整参考答案(reasoning + answer); - 中风险:完整思维链(CoT); - 低风险:计划/骨架(plan)、评分标准(rubric)、错误对齐的 critique、环境反馈。 - **信号提纯与分解**: - **AR-OPD**

60
将教师信号分解为“可学习的锚点”(前半段轨迹)与“泄漏残差”,仅保留部分残差( λ = 0.6 ),使捷径事件下降逾 20% ; - **Purified OPSD**
41
通过“无问题条件下的答案教师”识别并剔除来自不可迁移捷径的信号; - **DemoPSD**
30
依据师生分布分歧度动态决定跟随教师的程度,分歧过大时自动忽略教师信号。 - **改变信息形式**:**Rubric-conditioned distillation**
15
以评分标准替代答案,使教师可覆盖多条推理路径;**DOPD**
56
发现逐步提示(不带执行)显著优于最终答案。 **论文的界定**:PI 的选择已从“越多越好”转向“越可重构越好”,但在**严格自蒸馏框架下对多种 PI(oracle、CoT、plan、rubric、feedback)的系统对比**仍付阙如。 —- ### 3. 杠杆 C:循环稳定性(When)—— 控制时序动态与指导衰减 该杠杆解决“教师的权重与信息应如何随时间演变”的问题。论文区分了两个独立的时序机制:教师权重的更新与特权信息本身的衰减。 **已有的解决方向包括:** - **教师权重动态**:避免完全冻结(很快过时)与完全同步(导致循环崩溃)的两个极端: - **EMA(指数移动平均)**:如 SDPO

21
采用 θ_T arrow rho θ_T + (1-rho) θ_S ,使教师滞后于学生; - **门控刷新(Gated Refresh)**:**CGTR**
17
主张仅在学生性能确实提升时刷新教师,以保持“隔离期”,防止状态遗忘型崩溃; - **近端约束**:**TOP-D**
54
将教师限制在学生的信任区域内,以控制梯度方差。 - **特权信息衰减**:将离线路程中的课程学习思想移植到 OPSD: - **ATESD**
18
提出“教师侧暴露不匹配”问题,通过一个控制器根据学生学习速率自适应地调整向教师暴露的推理轨迹比例; - **PAINT**
46
采用自适应掩码逐步揭示验证后的解答。 **论文的界定**:EMA 在视觉领域的动量校准
5
尚未在 LLM 教师上验证;且关于 OPSD 在**持续学习场景中的遗忘排序**(SFT > 密集自蒸馏 > 稀疏 RL)仍存在相互矛盾的证据
21, 43, 49
,需进一步厘清。 —- ### 4. 综合:通过结构化框架“解决”问题 论文在第三部分(Synthesis)将三个杠杆映射到训练循环中,形成可操作的诊断网格:

Lever A (Where) arrow Token 加权 quad Lever B (What) arrow 改变 PI 性质 quad Lever C (When) arrow 使 PI 随时间演化 使教师权重演化
**最终,论文“解决”这一问题的方式是:** - **诊断上**:指出 collapse 不能通过平均准确率(mean score)或熵(entropy)来检测,而必须通过 **pass@k** 来衡量; - **概念上**:将 collapse 的症状归因于三个可独立干预的杠杆,而非笼统地归咎于“自蒸馏”本身; - **实践上**:确立了两条基本原则——(1) 特权信息必须满足可重构性(reconstructible at test time);(2) 信号的价值在于选择性而非密度。 因此,论文并未给出一种放之四海而皆准的新算法,而是提供了一幅**控制地图**:它告诉研究者与工程师,已有的干预手段分别作用于哪个杠杆、取得了何种效果,以及哪些组合仍属未知。 Q4: 论文做了哪些实验? 该论文是一篇**批判性综述(Critical Review)**,作者在开篇即明确声明:**“We report no new experiments.”** 论文本身并未设计或执行任何新的训练、蒸馏或评估实验。其贡献被界定为结构性的——为分散在不同研究中命名各异的现象建立共享词汇,并划清“已确立结论”与“仍存争议问题”之间的界限。 尽管如此,论文对现有文献中的实验证据进行了系统性的梳理、对比与批判性再分析。具体而言,它围绕以下主题组织并评估了已有实验: —- ### 1. OPSD 奠基论文的实验基线 论文详细回顾了 Zhao et al.

61
的原始实验设置与结果,包括: - **效率对比**:OPSD 以单条最长 1,024 token 的生成替代 GRPO 的 8 条 16k token 采样; - **性能基准**:在 Qwen3-1.7B 上,OPSD 在 AIME24/25、HMMT25 等数学推理基准上的准确率变化(如 AIME25 从 36.7 提升至 43.9); - **计算成本分析**:指出 OPSD 单步耗时约为 GRPO 的两倍(20.6 s vs. 11.2 s),优势在于收敛速度而非单步成本。 —- ### 2. Collapse 症状的实验证据 论文整合多项独立研究的实验观察,以证明 collapse 的多层表现: - **功能多样性下降**:引用 Nicolicioiu et al.

37
在 Qwen3-8B 上的测量——self-distillation 使 pass@1 从 71.9 升至 73.4,而 pass@16 从 83.6 降至 78.5,证明均值准确率与多样性脱钩; - **审慎思考(deliberation)token 的抑制**:引用 Kaur et al.
24
的实验,显示特权信息导致 thinking model 性能相对下降高达 -17% (avg@16); - **熵与多样性的解耦**:明确指出 token 级熵不能作为多样性的代理指标,因为自蒸馏模型的熵可能高于 RL 训练模型,但其功能多样性却更低。 —- ### 3. 杠杆 A(信号几何)的实验对比 论文汇总了关于散度方向与信号密度的实验发现: - **散度方向**:引用 GKD

1
、MiniLLM
16
及 DPH-RL
28
的实验,对比前向 KL(mass-covering)与反向 KL(mode-seeking)在 pass@1 / pass@k 上的权衡; - **选择性密度**:引用 Entropy-Aware OPD
22
的实验,显示在高熵 token 上保留覆盖可使学生维持 6.8% 的高熵 token(教师为 18.5%),而标准反向 KL 几乎将其全部消除;引用 Unmasking OPD
3
的梯度对齐分析,指出仅约半数 token 具有正向学习价值。 —- ### 4. 杠杆 B(特权信息)的受控对比实验 论文重点整理了对不同特权信息(PI)形式的**固定模型、固定数据**下的对比实验: - **Kara & Ersoy

23
**:在严格自蒸馏下对比二元奖励(GRPO)、参考答案(OPSD)与步骤对齐 critique,后者以 avg@12 计分别高出 +5.27 与 +16.11; - **Yu et al.
56
(DOPD)**:比较五种 PI 形式,发现仅给最终答案时 C-Eval 得分 59.5,甚至低于无特权的 63.0,而逐步提示(无执行)达到 71.3; - **Zhang
60
(AR-OPD)**:通过分解教师信号为锚点与残差,并固定 λ = 0.6 ,实验显示捷径事件下降逾 20%。 论文以**表 1** 系统汇总了这些实验,按 PI 的“预设答案程度”排序,并标注其可重构性、测量效应与所需资源。 —- ### 5. 杠杆 C(循环稳定性)的实验与机制分析 论文梳理了关于教师动态与指导衰减的实验: - **EMA 与教师刷新**:引用 SDPO

21
的内部消融实验(单一论文内),对比冻结教师、EMA 与插值策略;引用 CGTR
17
的实验,论证固定间隔刷新导致状态遗忘型崩溃,而基于奖励增益的门控刷新可提升稳定性; - **特权信息衰减**:引用 ATESD
18
在 Qwen3-1.7B/4B/8B 上的自适应暴露实验,显示 avg@12 提升 +0.95 至 +2.33;引用 Prefix-RFT
20
、AdaBack
2
等离线路程中的课程衰减实验,指出其对收敛的必要性。 —- ### 6. 评估协议的方法论批判 虽然这不是“实验”,但论文在 **§1.4** 提出了一套严格的**评估规范**,作为阅读现有实验结果的批判性透镜: - 要求报告 avg@k 与多种子置信区间,而非单点得分; - 要求同时追踪 pass@k 与 G-Pass@k 以暴露多样性损失; - 要求四项实验对照:零特权/随机特权对照、等计算预算对照、污染检测对照(新旧基准对比)、跨模型家族(非 Qwen)复现。 —- **总结而言**,该论文并未产生新的实验数据,而是对已有实验进行了**结构化的元分析(meta-analysis)**。其“解决”问题的方式并非通过新增实证结果,而是通过重新组织现有证据、统一诊断标准(pass@k 而非熵)、并将 collapse 归因于三个可独立干预的杠杆,从而为后续实验指明方向与未竟空间。 Q5: 有什么可以进一步探索的点? 基于该综述的“未竟问题”与“仍存争议”部分,以下方向值得进一步探索: —- ### 1. 杠杆 A — 信号几何:从“均匀密集”到“自适应选择性” - **在线可计算的 token 效用准则** 现有两个准则各有根本缺陷:基于教师熵的加权

22
可在线获得,但不保证与 token 实际贡献相关;基于理想梯度对齐的分数
3
理论基础更扎实,却需事后知晓轨迹成败才能计算。需构建一个**训练时可实时估计、且与最终成功率相关**的代理指标。 - **加权粒度的最优性** 当前选择性仅存在于两个极端:逐 token
22
或逐问题
28
。对于长推理链(如数学证明),决策可能发生在“推理步”或“段落”级别,而非单个 token 或整题。需探索**可变粒度加权**,并验证短轨迹(工具使用)与长轨迹(数学推理)是否需要不同粒度。 - **正向对齐信号的实际转化** Armandpour et al.
3
的 oracle 分析表明,仅蒸馏正向对齐 token 可提升信号质量 10 – 15 倍。如何在不依赖事后知晓答案的情况下,于训练动态中**实时识别并隔离这些 token**,仍是未被转化的理论增益。 —- ### 2. 杠杆 B — 特权信息:从“给定参考答案”到“可重构技能” - **严格自蒸馏下的系统 PI 比较** 现有比较要么在强到弱蒸馏 regime

56
,要么仅覆盖三种形式
23
。需在**严格自蒸馏(同模型、同规模)**下,对最终答案、完整 CoT、部分轨迹、计划/骨架、评分标准、错误对齐 critique 和环境反馈进行**固定模型、固定数据**的系统性横评。 - **分支点的显式保护与增强** Kaur et al.
24
指出需显式保留“推理可分岔”的位置。可探索在教师分布中**识别高 fork-rate 的决策节点**(如多路径数学分解点),并在这些节点上强制保持覆盖(mass-covering),而非均匀施加散度。 - **自适应剂量与形式衰减** AR-OPD
60
的残差系数 λ 固定;ATESD
18
仅改变揭示的“量”。尚未探索的是随训练进程改变 PI 的“质”——例如早期给 oracle,中期转为 plan,后期转为 hint 的**课程式 PI 衰减**。需比较固定形式衰减与自适应控制器(如 ATESD)的优劣。 - **可扩展的评分标准生成** Rubric-conditioned distillation
15
显示手写评分标准远优于模型生成,但人工撰写难以扩展。需研究**自动提取或合成高质量 rubric** 的方法(如从多正确解中归纳验证标准),同时保持其对多样性的保护作用。 —- ### 3. 杠杆 C — 循环稳定性:教师动态与遗忘谱系 - **教师更新规则的受控比较** 现有比较分散于不同论文与设置:冻结教师

61
、EMA
21
、门控刷新
17
、近端约束
54
。需在**固定特权信息、固定模型规模**下,系统对比四种规则的稳定性、收敛速度与最终 pass@k。 - **EMA 动量在 LLM 教师上的校准** Busbridge et al.
5
在视觉领域证明 EMA 动量 rho 需随 batch size 重新校准,否则可能失稳。该结论**从未在 LLM 自蒸馏场景下验证**,而小规模 LLM 的崩溃行为更为激进。 - **OPSD 在遗忘谱系中的精确位置** 现有证据矛盾:SDFT
43
认为自蒸馏减少遗忘,Denser ≠ Better
49
则认为密集自蒸馏在持续学习中遗忘更多。需建立统一协议(单任务 vs. 任务序列),验证假设排序
forgetting(SFT) > forgetting(dense self-distillation) > forgetting(sparse RL)
是否成立,并找出将 OPSD 推向“低遗忘端”的条件。 - **视觉自监督工具的移植** SimSiam
8
、BYOL
14
、Mean Teacher
47
等视觉领域的防崩溃机制(stop-gradient、预测器不对称性、动量编码器)在 LLM 中的适用性**基本未被挖掘**。特别是 BYOL 提出的“学生-教师结构不对称”在 OPSD 中仅由 PI 提供,是否足够? —- ### 4. 症状机制:Collapse 的预测与诊断 - **PMI 作为先验预测器** 目前 Shen et al.

40
的 PMI 机制主要用于**事后解释**。需验证其是否能作为**先验工具**:在训练前根据 PI 与解答 token 的互信息强度,预测特定 PI 将导致何种程度的 deliberation token 抑制与多样性损失。 - **超越 pass@k 的动态监测指标** 论文指出熵是失效代理
37
,pass@k 是必要但不充分的诊断。可探索在训练过程中实时监测**功能模式数量**(如基于聚类的推理路径计数)或**分布外解的存活率**,以更早检测 collapse。 —- ### 5. 评估与领域扩展 - **跨模型家族与规模的复现** 现有工作高度集中于 Qwen 系列( le 8 B)。需在 Llama、OLMo 等家族上验证已有杠杆的有效性,并测试在**更大规模**( > 10 B)模型上崩溃是否缓解或加剧。 - **数学推理之外的方法论迁移** 综述明确限制于数学推理,而 OPSD 的两条最大分支——多模态学习与工具使用智能体——是否服从相同的三杠杆结构?特别是 SDPO

21
的环境反馈机制在**部分可观察、延迟反馈**的 agentic 环境中的稳定性,尚未被系统研究。 - **污染控制与更严苛的基准** 需在新近发布、明确无训练数据泄漏的基准(如 MathArena
4
)上,以多种子、avg@k、pass@k 和 G-Pass@k 的完整协议,重新评估现有 OPSD 变体的真实增益。 Q6: 总结一下论文的主要内容 这篇论文是一篇关于 **On-Policy Self-Distillation (OPSD)** 的批判性综述,不报告新的实验,而是通过结构化的分析为领域内命名各异的现象建立共享词汇,并划定已知与未知的边界。 ### 1. 背景与问题 论文追溯了后训练方法的演进链条,以此定位 OPSD 的来源: - **SFT(监督微调)**:信号密集,但应用于模型自身不生成的序列(off-policy),导致暴露偏差(exposure bias); - **RLVR(可验证奖励的强化学习)**:在线生成(on-policy),但奖励稀疏(仅终端一个标量),信用分配困难且采样昂贵; - **OPD(在线策略蒸馏)**:引入外部大模型作为教师,提供逐 token 的密集信号,解决信用分配,但依赖更大的外部模型; - **OPSD(在线策略自蒸馏)**:移除外部教师,使用**模型自身**作为教师,但赋予其测试时无法获得的**特权信息**(如参考答案 y^star 、环境反馈)。 OPSD 的核心承诺是:以自足的密集信号实现高效推理训练,无需更大模型。但其不对称性(教师知情、学生不知情)在产生信号的同时也引入了偏置,导致主导性失败模式——**collapse(崩溃)**。 ### 2. 核心症状:Collapse Collapse 指模型可生成的推理路径集合逐渐收窄,表现为三个层面: - **行为层面**:pass@1 上升,但 pass@k 下降,模型失去探索罕见正确解的能力; - **分布层面**:策略熵趋向于零,概率质量集中于少数延续; - **几何层面**:目标分布趋向单峰,模型对同一问题仅记住一条正确路径。 论文区分了两类成因: - **通用成因**:RL 梯度本身侵蚀熵预算;任何自训练循环都会因有限采样导致分布尾部消失(model collapse)。 - **OPSD 特有成因**:教师对参考答案的条件化产生**点互信息(PMI)**偏差,使教师成为“先知”。它过度奖励与答案直接相关的 token(如连接词、可验证内容),同时惩罚审慎思考(deliberation)token(如“wait”、“maybe”),从而摧毁学生多步搜索的能力。 ### 3. 三个分析杠杆 论文将 collapse 视为可通过三个独立杠杆调控的症状,并系统梳理了每个杠杆上的已有进展与开放问题。 #### 杠杆 A:信号几何(Where) 探讨密集信号应施加在何处、以何种形式施加。 - **散度方向**:前向 KL(mass-covering,保留覆盖)与反向 KL(mode-seeking,锁定单峰)构成性能与多样性的基本权衡。OPSD 采用前向 KL,但均匀加权所有 token 仍会导致问题。 - **选择性密度**:一个 rollout 中仅少数 token 真正决定推理方向,其余多为格式 token。均匀密度会稀释信号。已有方向包括:基于教师熵加权

22
、基于理想梯度对齐筛选
3
、按题目难度切换散度
28
。 - **开放问题**:缺乏一个**既可在训练时在线计算、又与 token 实际效用强相关**的统一加权准则。 #### 杠杆 B:特权信息(What) 探讨应向教师提供何种信息(Privileged Information, PI)。 - **核心准则**:特权信息仅在学生能在测试时自行重构的情况下才是安全的;若必须被预设或记忆,则会引入测试时不可用的捷径。 - **风险排序**(由高到低):最终答案(oracle)> 完整解答(reasoning + answer)> 完整 CoT > 部分轨迹/锚点 > 计划/骨架 > 评分标准(rubric)> 错误反馈/环境反馈。 - **改进方向**:AR-OPD

60
将信号分解为可学习锚点与泄漏残差;Purified OPSD
41
识别并剔除不可迁移的捷径信号;DemoPSD
30
依据师生分歧动态调整跟随程度;基于 rubric 的蒸馏
15
用评价标准替代答案以保持多样性。 - **开放问题**:尚未有研究在严格自蒸馏下对 oracle、CoT、plan、rubric 和 feedback 进行系统的固定模型/固定数据横评。 #### 杠杆 C:循环稳定性(When) 探讨教师的权重与信息应如何随时间演变。 - **教师权重动态**:完全冻结(OPSD 原始做法)会迅速过时;完全同步更新会导致循环崩溃。中间方案包括 EMA(指数移动平均)

21
、基于奖励增益的门控刷新(CGTR)
17
、以及近端信任区域约束(TOP-D)
54
。 - **特权信息衰减**:ATESD
18
与 PAINT
46
探索随学生进步逐步减少对教师暴露的参考答案比例,从密集指导过渡到自主推理。 - **遗忘与持续学习**:OPSD 在“遗忘谱系”中的精确位置仍存争议——密集自蒸馏比 SFT 遗忘更少,但是否比稀疏 RL 遗忘更多,现有证据相互矛盾
21, 43, 49
。 - **开放问题**:视觉自监督领域(如 SimSiam
8
、BYOL
14
)的防崩溃机制尚未系统移植到 LLM 教师上;EMA 动量随 batch size 的校准在 LLM 场景下未被测试。 ### 4. 关键结论 - **密度本身不再是变量**:OPSD 的早期直觉“越密越好”已被修正。真正重要的是信号的选择性、特权信息的可重构性,以及时序上的渐进释放。 - **参考答案是最危险的 PI 之一**:它使教师失去不确定性表达,导致学生跳过推理步骤。中间抽象(hints、plans、error-aligned critiques)是更安全的传递媒介。 - **诊断指标**:collapse 无法通过平均准确率或 token 熵检测,必须通过 **pass@k**(及 G-Pass@k)衡量功能多样性。 - **生产适用性**:在当前阶段,OPSD 不应被天真地用于生产。它是一种有前景的研究技术,但需配合严格的评估协议(多种子、多采样、跨模型家族复现、污染检测)。 ### 5. 局限性与范围 - 综述范围被刻意限制在**数学推理**领域,未覆盖 OPSD 在多模态学习与工具使用智能体中的分支; - 引用的文献多为近半年内的预印本,且实验主要集中在**不超过 80 亿参数的 Qwen 模型家族**上,结论的推广性有待更大规模与跨家族验证。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Justin Robert,Raheel Qader

Categories:

PDF URL: https://arxiv.org/pdf/2608.25936.pdf

Arxiv URL: https://arxiv.org/abs/2608.25936

Arxiv ID: 2608.25936

CoolPaper URL: https://papers.cool/arxiv/2608.25936

Published: 2026-09-09T01:31:24.454Z

Updated: 2026-09-09T01:31:24.454Z


8. Unifying Conformal Language Tasks with In-Context Ensembles

Abstract:Many NLP tasks, such as summarization and extractive question answering, reduce to retrieving relevant content from documents under two constraints: coverage, retaining enough pertinent information to achieve some goal, and conciseness, removing as much irrelevant information as possible. Conformal prediction methods have been used to guarantee coverage, and must be optimized for conciseness through design of a score function. State-of-the-art scoring functions use hand-engineered LLM prompts asking the model to rate the importance of content, but manual prompt engineering is labor-intensive and task-specific. We introduce the Conformal Relevance framework which uses in-context learning example curation and ensembling to create a score function which maintains coverage while improving conciseness with minimal manual input. We demonstrate this framework’s application on seven NLP tasks, and also theoretically study the impact of diversity for ensembled conformal scores, giving a complementarity condition that characterizes when ensembling improves worst-case sentence scores, and a saturation bound on ensemble improvement.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03005 (HTTP 429)

Authors: Xiao Shi Huang,Chen-Yuan Lin,Bruce Kuwahara,Kin Kwan Leung,Jesse C. Cresswell

Categories:

PDF URL: https://arxiv.org/pdf/2609.03005.pdf

Arxiv URL: https://arxiv.org/abs/2609.03005

Arxiv ID: 2609.03005

CoolPaper URL: https://papers.cool/arxiv/2609.03005

Published: 2026-09-09T01:31:24.677Z

Updated: 2026-09-09T01:31:24.677Z


9. Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal

Abstract:Safety alignment is usually posed as a topic-level question: is this subject harmful? Deployments ask a narrower one. A civics tutor and a public-sector assistant may share a base model yet need different boundaries inside the same topic, refusing targeted political manipulation while still answering factual questions about the same election. We formulate this as narrow-boundary safety and introduce an offline self-generated framework combining controlled topic generation, coverage repair, in-distribution compensation data, and harmful-benign pairs for training and evaluation. Single-shot generation leaves 19.88% of prompts without accepted refusal traces, whereas escalating retries leave 0.20%. On political persuasion with Qwen3-8B, training on refusal data completed through Escalate increases target-domain refusal from 9.47% to 84.75% and reduces the mean unsafe-response rate across three broader harmfulness benchmarks from 26.26% to 0.14%, but increases XSTest over-refusal from 2.00% to 74.00%. In a separate matched comparison, replacing external responses with verified target-model responses reduces over-refusal from 15.20% to 5.20%. Boundary-pair data reduces comply-side over-refusal on held-out pairs from 32.94% to 4.16%, while harmful-side refusal decreases only from 91.88% to 87.72%. These results show that data composition controls the safety and usability trade-off, and that safety alignment should be evaluated on both sides of the intended refusal boundary.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.04482 (HTTP 429)

Authors: Alejo López-Ávila,Iker García-Ferrero,Jezabel Garcia,Antonio Tiene,Román Orús

Categories:

PDF URL: https://arxiv.org/pdf/2609.04482.pdf

Arxiv URL: https://arxiv.org/abs/2609.04482

Arxiv ID: 2609.04482

CoolPaper URL: https://papers.cool/arxiv/2609.04482

Published: 2026-09-09T01:31:24.687Z

Updated: 2026-09-09T01:31:24.687Z


10. Privacy Failure in Split-LLM Training, The Returned Gradient Nullifies the Decoys

Abstract:We present a systems-security case study of a two-node split-LLM training system whose privacy evaluation passed while leaving an observable channel untested. The Trusted Local Node (TLN) sends protected activations to the Untrusted Cloud Node (UCN), the UCN returns its output, and TLN, holding the private loss, returns the output gradient. The frame the UCN receives mixes real rows with decoys, and the loss ignores the decoys. Their gradients are exactly zero, so the pattern of zeros reveals which rows were real. We measure it with a protocol fixed in advance: a leak injected at known strength to prove the instrument can see one, a shuffled-label control to prove it does not report absent leaks, and a threshold set before the runs. Across nine seeds, the zeros identified the real rows on every frame, 4,096 of 4,096 per run. An attack on the frame contents recovered about one extra token per hundred over a constant-guess baseline (+0.65 to +1.50 percentage points); the shuffled controls recovered nothing. A second set of runs repeated this on a configuration that keeps model quality within budget, so the finding is not confined to a setting nobody would deploy. On both datasets, every such run passed the forward-channel privacy check and the quality check, yet failed that same check once the returned gradient was included. Clipping and noising each row of the gradient closed the leak for about 0.01 nats of held-out cross-entropy. The system is not thereby safe: five classes of attack, including those accumulating observations across training steps, were never measured.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决分割学习大语言模型(Split-LLM)训练系统中因\*\*隐私评估遗漏可观察通道\*\*而导致的\*\*错误安全保证(false assurance)\*\*问题。具体而言,论文针对一个双节点分割训练系统,诊断了其隐私评估在仅检测前向激活通道(forward wire)时通过门限,却未检测后向梯度通道(backward wire)上的结构性信息泄露,从而系统性地低估了实际隐私风险。 更具体地,该工作聚焦以下核心问题: 1. \*\*未被检测的后向通道泄露\*\* 在评估的系统中,可信本地节点(TLN)向不可信云端节点(UCN)发送混合了诱饵行(decoys/chaff)的激活帧,并在本地计算损失后返回输出梯度。由于私有损失在计算时截断于诱饵行之前,诱饵行对应的返回梯度恒为零。这种\*\*零支持构造(zero-support construction)\*\*使得UCN能够通过观察梯度中非零行的位置,精确区分80行中的32个真实行与48个诱饵行( 4,096/4,096 帧,行一致率 1.000 ),从而瓦解了填充机制所设计的匿名集。 2. \*\*评估方法的系统性缺陷\*\* 原始隐私评估仅将前向激活声明为隐私表面(privacy surface)并进行仪器检测,而未将后向梯度纳入声明的对抗者视图。这导致一个\*\*实现与系统设计缺陷\*\*(诱饵梯度恒为零)与一个\*\*评估设计缺陷\*\*(遗漏可观察通道)相互叠加,使隐私门(privacy gate)在未测试的通道上产生\*\*静默失效(silent failure)\*\*。换言之,系统在前向通道上通过了隐私检测,但在联合视图(forward frame parallel returned gradient)下却突破了预声明的门限( G > +1.0 pp)。 3. \*\*泄露的实际后果与配置泛化性\*\* 论文进一步量化该结构泄露如何转化为内容推断优势:在联合视图中,攻击者每百个词元可额外恢复约 0.65 – 1.50 个词元。关键的是,论文验证了该泄露不仅存在于一个高损耗的不可部署配置中,在\*\*通过效用门限(utility gate)的浅层分割配置\*\*(4层委托层)中同样存在——6/6的防御单元在通过前向隐私与效用检测的同时,联合视图仍突破了门限。 4. \*\*缓解措施的验证\*\* 论文测试了针对该泄露的缓解方案:对返回的梯度施加逐行 L_2 裁剪( C=0.01 )与高斯噪声( σ=0.35C )。该措施以约 0.01 nats的保留交叉熵代价消除了零支持分区信号,使所有探测臂回到基线(floor),且结构泄露从 1,024/1,024 帧降至 0/1,024 帧。 简言之,这篇论文并非提出通用隐私方法论,而是通过一个经校准的审计协议(包括受控泄露注入、洗牌标签负控制、预声明门限与逐通道阈值),对一个具体Split-LLM系统进行了系统安全案例研究,证实了\*\*“仅前向评估通过”不足以证明系统隐私性\*\*,并诊断了后向梯度通道上由零支持构造引起的结构性元数据泄露。 Q2: 有哪些相关研究? 根据论文第7节及全文引用,相关研究可分为以下几个脉络: ### 1. 分割学习(Split Learning)的攻防研究 这一脉络直接对应论文所研究的Split-LLM训练场景,涵盖攻击面、防御机制与评估基准: - \*\*攻击方向\*\*: - \*\*UnSplit\*\*

9
:针对诚实但好奇(honest-but-curious)场景的模型逆向、模型窃取与标签推断攻击。 - **标签泄露**
18
:两方可分割学习中的标签泄露与保护机制。 - **恶意后向信号操控**
24
:展示如何通过操控后向梯度实施推断攻击。 - **中间训练状态泄露**
10
:通过伪客户端攻击(Pseudo-Client Attack)从分割学习中窃取功能与数据。 - **BiSR**
6
:针对基于扰动的防御机制,展示双向(bidirectional)重建攻击,但论文指出其缺乏注入校准、负控制或预声明的接受门限。 - **TAG / LAMP / DAGER**
7, 1, 25
:从梯度中恢复文本或进行精确梯度反演(gradient inversion)的方法(论文指出这些序列重建技术尚未适配到本研究的对象——分割边界的梯度截断)。 - **防御与评估基准**: - **DualGuard**
20
:参数空间变换方法,用于双向防御;论文肯定其正确评估了前向、后向与双向攻击路径,但指出其缺少注入检测金丝雀、洗牌标签负控制(shuffled-label negative control)或预声明隐私门限。 - **Prompts to Responses**
12
:前后向数据泄露与防御研究,但论文指出其评估范围仅限于前向,且附录中的基线是不匹配的随机词元。 - **MIXGUARD**
5
:针对公开代理的自适应梯度扰动,论文指出其报告的是防御与攻击的比较,而非针对检测器的校准。 - **VFLAIR-LLM**
11
:模块化的评估框架,报告了5种攻击×9种防御的基准,但被定位为缺乏校准零假设(calibrated null)的评估基板。 - **SIMBA**
27
:分割推断的机制、基准与攻击评估框架。 ### 2. 差分隐私与隐私审计方法论 论文将自身工作置于经验性隐私审计的学术传统中,强调**受控泄露注入(controlled leak injection)**与**校准决策规则**: - **植入秘密暴露测试**

4
(Carlini et al., *The Secret Sharer*):评估与测试神经网络中的非预期记忆。 - **基于攻击的DP审计**
15, 22, 29
:通过成员推断攻击审计差分隐私机器学习(如Jagielski et al.; Nasr et al.; Steinke et al.)。 - **随机多金丝雀审计**
26
(Pillutla et al.):包含显式零假设与决策规则。 - **校准成员推断**
3, 28
(Carlini et al.; Song & Mittal):强调参考分布与声明操作点。 - **重建指标的非一致性**
30
:论文引用Sun et al.说明不同重建指标在隐私风险上可能不一致,支持其“逐指标校准”的必要性。 ### 3. 相邻的隐私保护系统与技术 论文在Table 13中将自身与多种相邻技术进行对比,这些技术覆盖了可信执行环境、密码学推理、混淆与设备端保护: - **可信执行环境(TEE)**:如NVIDIA Hopper GPU上的机密计算基准

35
;论文指出其依赖硬件厂商信任根。 - **安全多方计算/同态加密(MPC/HE)**
13, 17, 33, 16
:如SIGMA、BumbleBee、NEXUS、PUMA等,提供密码学级别的隐私,但计算开销通常在 10^2 – 10^4 倍。 - **混淆与边缘计算**: - **ObfNet**
32
:轻量级边缘数据混淆。 - **PermLLM**
34
:基于置换的LLM隐私推断,论文指出其被匹配家族攻击破解(>99%重建)。 - **AloePri**
19
/ **GELO**
2
:面向协作文本推断的混淆方法,但分别处于推断阶段或微基准阶段,不覆盖训练梯度通道。 - **可验证推理(Integrity-only)**:如**TOPLOC**
23
,通过局部敏感哈希实现无信任验证推理,但不处理隐私。 - **LLM内部状态反演**
8
(Dong et al.):指出模型深度可能带来虚假隐私感,与论文中对深度/宽度的审计发现相关。 ### 4. 分割学习的基础工作 - **Split Learning原始工作**

31
(Vepakomma et al.):提出在不共享原始患者数据的情况下进行分布式深度学习,是本文系统架构的起点。 - **Deep Leakage from Gradients**
36
(Zhu et al.):建立了梯度泄露的基础认识,说明双向攻击面在分割学习中已得到确立。 ### 论文对这些研究的定位 本文的核心论点是:尽管上述研究分别建立了**双向攻击面**、**梯度反演**与**隐私审计**的成熟认识,但现有分割LLM的评估实践存在**系统性漏洞**——即缺少对**所有声明通道**的枚举、缺少**针对已知泄露的剂量-响应校准**,以及缺少**洗牌标签负控制**。论文通过针对三个近期评估(BiSR、DualGuard、Prompts to Responses)的目标审计表明,没有一项工作同时结合了**注入校准、负控制与预声明门限**这三种控制手段。 Q3: 论文如何解决这个问题? 这篇论文从**诊断验证**与**工程缓解**两个维度处理该隐私泄露问题。核心思路是:先通过一套预声明、经校准的评估协议定位并量化泄露,再对后向梯度施加边界保护以关闭该通道,最后验证缓解后的系统是否仍满足效用约束。 —- ### 一、评估与诊断:通道显式、指标校准、门限预置的审计协议 论文并未止步于发现“梯度为零”这一现象,而是设计了一套可复现、可证伪的审计流程,使“通过/不通过”的裁决仅对实际测试过的通道有效。 #### 1. 枚举并声明全部通道 论文要求隐私评估必须预先列出对抗者可观察的所有通道(前向激活、后向梯度、成员推断、时序、状态累积等)。原始评估仅声明前向通道为隐私表面,而论文明确将后向梯度(backward wire)纳入对抗者视图,从而暴露出零支持构造的泄露。 #### 2. 逐指标进行剂量–响应校准 在施加门限之前,论文先通过**受控泄露注入**(injected leak)建立每条指标的检测曲线。具体地,以已知覆盖度(coverage)与幅度(amplitude)向前向或后向通道注入词元泄露,测定四项指标(token top-1、rare token top-1、token cross entropy、membership AUC)的响应起点: - token top-1 在覆盖度约 0.04 – 0.06 时开始抬升; - rare token top-1 最敏感,于 0.04 即有响应; - token cross entropy 直到泄露占主导时才显著变化; - membership AUC 对该类词元信号不敏感,故被证伪并降级为诊断项。 校准后,每条指标拥有独立阈值(Table 5),避免了“一刀切”导致的假阴性。 #### 3. 预定义门限统计量与配对负控制 论文定义门限统计量为

G = max(j ∈ J) U(Bonf)^(0.95)(pj) - p(const),
其中 U(Bonf)^(0.95)(p_j) 是经 Bonferroni 校正的 Wilson 上界, p(const) 为恒猜最常见词元的基线准确率。 G > +1.0 pp 即判定为突破门限(fail)。 为排除假阳性,论文引入**洗牌标签负控制**(shuffled-label negative control):对同一帧的标签进行置换后重新打分,得到
N = (1) / (F)∑(f=1)^F Delta_f(s),
若真实攻击臂 A = (1) / (F)∑
(f=1)^F Delta_f(r) 与 N 分离,且 N 自身贴地(floor),则结果可信。 在该协议下,论文证实: - 结构泄露:后向梯度中诱饵行恒为零,使真实/诱饵分区在 4,096/4,096 帧上精确暴露; - 内容泄露:联合视图(前向帧 parallel 后向梯度)在 6/6 个通过效用门限的配置上仍突破 +1.0 pp 门限,而前向单通道评估却给出通过(false assurance)。 —- ### 二、工程缓解:对返回梯度施加逐行裁剪与加噪 针对已定位的零支持泄露,论文测试了最小侵入式修复:**对 TLN 返回给 UCN 的输出梯度实施逐行边界保护**。 - **方法**:对每行梯度先作 L_2 裁剪(clip),界 C = 0.01 ;再加高斯噪声 σ = 0.35 C 。 - **效果**: - 结构信号消失:零支持分区从 1,024/1,024 帧降至 0/1,024 帧,行一致率跌落至随机基线( 0.400 ); - 探测臂全部贴地:所有预设攻击家族(preset battery)的得分低于门限,负控制同步贴地; - 效用代价极低:保留交叉熵增加约 0.01 nats,仍低于 0.35 nats 的效用门限。 —- ### 三、范围界定与局限声明 论文明确将自身定位为**系统安全案例研究**,而非通用方法论。其“解决”不意味着系统已绝对安全: - 五种攻击家族(成员推断、状态累积、时序元数据、响应侧恢复、主动扰动)仍被声明为未测量(unmeasured); - 所有结果仅针对该实现与所声明的通道、攻击家族及泄露剂量有效; - 缓解措施仅关闭了已诊断的零支持通道,对其他潜在跨张量攻击(如 X G^top 交叉 Gram 项)在本探测族下未观测到信号,但并未穷尽。 简言之,论文通过**“先校准仪器、再测量泄露、最后施加针对性边界保护并复测”**的三段式流程,解决了“后向通道因未被评估而静默泄露结构元数据”这一具体问题,并以 ≈ 0.01 nats 的效用代价验证了修复的可行性。 Q4: 论文做了哪些实验? 论文围绕一个双节点分割大语言模型训练系统,开展了一系列实验以诊断、量化并缓解后向梯度通道上的隐私泄露。实验可归纳为以下六个类别: —- ### 1. 主配置与复现实验(Main Configuration and Replication Runs) 该组实验在**11层委托**的分割拓扑上执行,用于确立核心泄露现象的可复现性。 - **系统设置**:基于 Qwen3-0.6B 模型,在层14后分割、层26恢复;每帧包含 32 个真实行与 48 个诱饵行,潜变量宽度 D=64 ;前向与返回激活施加逐行 L_2 裁剪( C=1.0 )及高斯噪声( σ=0.35C ),而**返回梯度保持开放**(无裁剪、无噪声)。 - **数据规模**:每轮捕获 4,096 帧( 2,048 帧用于探测训练, 2,048 帧用于评估)。 - **种子覆盖**:探索性运行 6 个种子(42–47),固定协议复现 3 个种子(48–50),共 9 个独立训练种子。 - **核心测量**: - 零支持结构检查:验证诱饵行对应的返回梯度是否**精确为零**,从而披露真实/诱饵分区。 - 梯度臂(gradient-only)与联合臂(forward frame parallel gradient)的探测效果。 - 洗牌标签负控制(shuffled-label negative control),用于排除假阳性。 结果显示:在全部 9 个种子上, 4,096/4,096 帧的零支持模式完全匹配真实/诱饵分区(行一致率 1.000 );联合视图在 6/6 个有效防御单元上突破 +1.0 pp 的预声明隐私门限。 —- ### 2. 仪器校准实验(Instrument Calibration) 在施加任何通过/不通过裁决之前,论文先对各指标进行**剂量–响应校准**,以确定其检测阈值。 - **泄露注入扫描**:设计 19 个剂量点,以受控覆盖度(coverage 从 0.02 到 1.00 ,幅度固定为 1.0 )向前向或后向通道注入已知词元泄露。 - **四项指标同步测量**: - token top-1 : sharp onset 位于覆盖度 0.04 – 0.06 ; - rare token top-1 :最敏感,于 0.04 即开始响应; - token cross entropy :对低剂量不敏感,直到泄露占主导; - membership auc :对该类词元身份信号无响应(AUC -0.5 在 0.058 – 0.159 之间),故被证伪为通道指标,仅保留为诊断项。 - **表示匹配正控制**:为排除“探测自身不敏感”的解释,论文在**裸边界**( D=1024 ,无防御)上训练了一个四层八头 Transformer 编码器作为正控制。该探测在裸边界上达到 +24.19 pp,而在防御边界( D=64 与 D=1024 维度匹配)上均贴地(floor,约 +0.27 – +0.29 pp),证明地板读数源于防御有效而非探测失灵。 —- ### 3. 结构泄露与内容推断实验(Structural Leakage and Content Inference) 该组实验将泄露拆解为**结构元数据披露**与**有限内容恢复**两个层次。 - **结构披露**:利用返回梯度帧的零支持模式,逐行比对真实/诱饵标签。在 9 个种子的全部评估帧上,该分类精确无误。 - **内容探测**:在已知分区(由梯度零支持提供)的条件下,对前向帧实施预设的频繁词元探测(frequent-token probe)。 - 梯度臂单独的内容效应在私有语料上接近地板(约 +0.50 pp),但在公共语料上 2/3 的种子突破门限( +1.18 与 +1.22 pp)。 - 联合臂(实际对抗者持有的完整视图)在 6/6 个防御单元上突破门限( +1.44 至 +2.18 pp),而前向单通道评估均显示通过。 - **负控制**:所有 9 个种子的洗牌标签控制均贴地( |N| ≤ 0.08 pp),证实结果非假阳性。 —- ### 4. 缓解实验(Mitigation Runs) 为验证泄露是否可在可接受效用代价下关闭,论文在**通过效用门限**的浅层配置(4层委托,split 21/26)上重新运行。 - **两种数据集**:私有 WikiText-2 切片与公共 WikiText-2 语料,各 3 个种子(51–53),每轮 1,024 帧。 - **三种条件对比**: 1. **防御+梯度开放**:前向隐私门限通过,但联合视图在全部 6 个单元上仍突破门限。 2. **防御+梯度裁剪与加噪**:对返回梯度施加逐行 L_2 裁剪( C=0.01 )与高斯噪声( σ=0.35C )。结果:所有探测臂贴地(门限统计量约 +0.48 pp),零支持信号消失( 0/1,024 帧,一致率跌落至随机基线 0.400 )。 3. **裸控制(无防御)**:联合视图达到 +33.9 至 +34.0 pp,确认仪器对强信号仍有响应。 - **效用代价**:保留交叉熵增加约 0.01 nats,远低于 0.35 nats 的效用门限。 此外,论文测试了 X G^top 交叉 Gram 项(余弦与尺度保持形式),在防御与裸配置下均贴地,说明在已实施的探测族中,联合视图效应并非通过旋转抵消项传导。 —- ### 5. 攻击特定形状审计(九单元审计) 为考察泄露对模型深度、潜变量宽度与训练预算的依赖性,论文在种子 42 上执行了 9 个诊断单元(单轮运行)。 - **深度阶梯**(2k 步):分别在 12 、 11 、 8 、 6 个委托层上运行。 - 探测效应在 12 与 11 层被检测到( +0.48 与 +0.93 pp),在 8 与 6 层贴地(负值)。 - 零支持分区在所有深度上均**精确暴露**,说明深度仅影响内容转换,不影响结构信号。 - **宽度扫描**(10k 步):比较 D=64 、 96 、 128 。 - 效应在 D=64 与 D=96 被检测到,在 D=128 贴地。 - **预算扫描**(40k vs. 100k 步,11 委托层): - 梯度暴露从 40k 增至 100k( 2.5× ),探测效应从 +0.93 微降至 +0.91 pp,未呈现单调放大。 —- ### 6. 历史攻击电池与验证实验(附录 C) 作为补充证据,论文记录了此前针对防御前向单元的攻击家族结果(已被第 4.2 节的表示匹配正控制所取代 Q5: 有什么可以进一步探索的点? 基于论文第8节(Scope and Limitations)及全文论证,可进一步探索的研究方向包括: —- ### 1. 覆盖已声明但尚未测量的对抗通道 论文明确枚举了九个通道家族,其中五个至今仍无适用的度量或正控制,构成直接的后续工作: - **成员推断与属性推断**(membership/property AUC):需在训练流程中引入随机化的成员分配机制,以建立可校准的参考分布。 - **状态化远程状态攻击**(stateful remote state):跨会话累积云端观测,检验长程统计是否能突破逐帧防御。 - **累积历史攻击**(accumulated history):利用多步梯度或激活的时序聚合,测试零支持信号在跨步平均下是否仍保持精确。 - **时序元数据侧信道**(timing metadata):量化帧大小、请求间隔或计算延迟与数据内容之间的信息泄露。 - **响应侧恢复**(response-side recovery):针对 UCN 返回给 TLN 的远程输出张量设计逆向探测。 —- ### 2. 适配序列级重建攻击至分割边界梯度 当前实验仅验证了频繁词元(frequent-token)判别,未触及序列重建。可将现有梯度反演框架适配到 split 边界的截断梯度场景: - **TAG / LAMP / DAGER**:这些针对完整参数梯度的文本恢复方法尚未适配到仅含输出梯度(output gradient at the split boundary)的情形。需重新设计先验与发射器,以评估是否能从 g 与对应前向帧的联合视图中重建提示词(prompt)或序列。 - **稀有词元恢复**(rare-token recovery):在现有探测族下,梯度臂的稀有词元恢复率趋近于零,但更深或更宽的分割拓扑可能改变该阈值。 —- ### 3. 收敛规模训练下的隐私-效用权衡 论文的所有诊断单元均在 2,000 步或 40,000 步的有限预算下完成,且主配置本身未通过效用门限(utility gate): - 需在**完整收敛规模**(full convergence-scale)上重复缓解配置(4层委托,梯度裁剪加噪),验证 ≈ 0.01 nats 的交叉熵代价在长期训练中是否保持稳定,抑或随模型收敛而放大。 - 探索更细粒度的效用预算划分,例如在不同数据集复杂度或模型容量下重新校准 C 与 σ 的帕累托前沿。 —- ### 4. 跨语料、跨架构与跨分割点的系统性验证 论文的证据集中于 Qwen3-0.6B 与 WikiText-2(含块级而非文档级划分): - **语料独立性**:仅在三组种子上进行了公共/私有语料的诊断性对比,需在更多领域与文档级独立划分上检验结构泄露的普遍性。 - **拓扑迁移**:测试不同分割深度(如 1–3 层 vs. 11 层以上)与不同潜变量宽度( D=32, 256 等)下,零支持信号是否持续存在,以及内容转换的阈值如何漂移。 - **模型族泛化**:验证该缺陷是否同样出现在其他 LLM 架构(如 Llama、Mistral 等)的 split 实现中。 —- ### 5. 消除零支持构造的系统设计改进 当前缓解措施是对症治疗(逐行裁剪与加噪),而非根治零支持这一实现缺陷: - **合成诱饵梯度**:为诱饵行构造满足差分隐私或保持统计一致性的合成梯度,使其不再恒为零,从而消除结构侧信道本身。 - **行无关损失耦合**:重新设计损失函数,使诱饵行仍以某种形式参与梯度计算(例如通过辅助任务或一致性正则化),避免支持集直接暴露。 - **自适应梯度硬化**:探索根据帧内容动态调整裁剪阈值的机制,而非固定 C=0.01 ,以在关闭泄露的同时进一步降低效用损失。 —- ### 6. 将校准审计协议推广为通用方法论 论文强调其贡献为单一系统案例研究,但其协议(通道枚举、注入校准、洗牌标签负控制、预声明门限)具有方法论外推潜力: - **自动化审计框架**:开发可复用的工具链,对任意 split-LLM 系统自动执行剂量–响应扫描与负控制注入。 - **多指标一致性决策**:当前四项指标对同一泄露的响应曲线不一致,需研究如何在多指标分歧时形成统一的隐私裁决规则。 - **跨系统对比基准**:在 VFLAIR-LLM 等现有基准上引入本文的校准控制,比较不同防御在相同仪器下的真实检测阈值。 —- ### 7. 主动攻击与自适应扰动 论文指出主动扰动(active perturbation)具有适用的校准度量,但未在缓解规模上执行: - **振幅扫描**(amplitude sweep):向返回梯度注入受控扰动,观测防御是否崩溃或产生可检测的异常响应。 - **对抗性训练探测**:将 UCN 的 surrogate 训练目标从重建转为对抗性最大化信息提取,测试静态防御的鲁棒性。 —- 简言之,论文在诊断层面完成了对单一通道、单一系统的闭合验证;后续研究可向**更广的通道覆盖**、**更深的攻击适配**、**更大规模的训练验证**以及**协议化评估框架**四个方向延伸。 Q6: 总结一下论文的主要内容 该论文是一项针对双节点分割大语言模型(Split-LLM)训练系统的**系统安全案例研究**。其核心内容可概括如下: —- ### 1. 研究背景与问题 Split learning 允许数据所有者将中间激活发送至云端进行训练,而无需上传原始数据。本文研究的系统包含一个**可信本地节点(TLN)**(持有数据、嵌入层与损失函数)和一个**不可信云端节点(UCN)**(持有中间 Transformer 层)。原始隐私评估仅将**前向通道**(UCN 接收的激活帧)声明为隐私表面并予以攻击测试,最终通过了门限;然而,**后向通道**(TLN 返回给 UCN 的输出梯度)从未被纳入对抗者视图,导致评估存在盲区。 —- ### 2. 核心缺陷:零支持构造(Zero-Support Construction) 该系统每帧包含 32 个真实行与 48 个诱饵行(decoys/chaff),潜变量宽度为 D=64 。由于 TLN 在计算私有损失时**将诱饵行排除在外**,诱饵行对应的输出梯度被硬编码为**精确零值**。当这些梯度在**无裁剪、无噪声**的状态下返回给 UCN 时,UCN 仅需观察梯度帧中的零支持模式,即可在每一训练帧中**精确区分**真实行与诱饵行,从而彻底瓦解填充机制所设计的匿名集。 —- ### 3. 实验发现 论文采用了一套预声明且经校准的审计协议(包含通道枚举、受控泄露注入、洗牌标签负控制及预声明门限),验证出以下结果: - **结构元数据泄露**:在 9 个独立种子的全部评估帧上( 4,096/4,096 ),零支持模式与真实/诱饵分区完全一致(行一致率 1.000 )。UCN 可百分之百地丢弃诱饵行,将匿名集从 80 行压缩至 32 行。 - **内容推断**:在联合视图(前向帧拼接返回梯度)下,预设的频繁词元探测突破了 +1.0 pp 的隐私门限,每百词元额外恢复约 0.65 – 1.50 个词元;而所有洗牌标签负控制均贴地(floor),排除了假阳性。 - **部署相关性**:该泄露不仅存在于一个高损耗、不可部署的深度分割配置(11 层委托),在**通过效用门限的浅层配置**(4 层委托,且通过前向隐私检查)中同样成立—— 6/6 个单元在联合视图中均突破门限。 - **原始评估的失效模式**:前向单通道的隐私门限会错误地给出“通过”结论,因为它从未测试后向通道;这是一个**静默的评估失效**。 —- ### 4. 缓解措施与代价 针对已定位的零支持泄露,论文测试了最小侵入式修复:对返回的输出梯度施加**逐行 L_2 裁剪**( C=0.01 )与**高斯加性噪声**( σ=0.35C )。结果显示: - 零支持分区信号完全消失( 0/1,024 帧,一致率跌落至随机基线); - 所有探测臂回到基线以下; - 保留交叉熵代价仅约 ** 0.01 nats**,远低于效用预算。 但论文明确指出,该修复仅关闭了已诊断的特定通道,**系统并非因此绝对安全**。 —- ### 5. 方法论定位与外部审计 本文的贡献不在于提出通用隐私方法论,而在于: - 诊断了一个具体系统中的**评估失效模式**——遗漏可观察通道导致隐私门限给出虚假保证; - 实践了“仪器校准 + 负控制 + 预声明门限”的审计协议,并将该协议用于对三个近期 Split-LLM 评估工作(BiSR、DualGuard、Prompts to Responses)的目标审计,指出它们均未同时结合全部三种控制。 —- ### 6. 局限与未测通道 论文诚实声明了五个仍**未测量**的对抗家族:成员推断、累积历史观测、状态化远程状态、时序元数据侧信道,以及响应侧恢复。所有结论仅对该实现、所测试的通道、攻击家族与泄露量级有效。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Georgios Politis,Evangelos Pappas

Categories:

PDF URL: https://arxiv.org/pdf/2609.04382.pdf

Arxiv URL: https://arxiv.org/abs/2609.04382

Arxiv ID: 2609.04382

CoolPaper URL: https://papers.cool/arxiv/2609.04382

Published: 2026-09-09T01:31:24.696Z

Updated: 2026-09-09T01:31:24.696Z


11. What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation

Abstract:Large Language Models (LLMs) often help users generate artifacts through iterative cycles of generation and revision in conversation. A challenge here is that, when users specify only a local change during revision, LLMs must instead identify the relevant dependencies and propagate the revision to all affected parts of the artifact. This paper studies this ability of LLMs on conversationally generated artifacts, where the artifact context and its dependencies may be embedded in the conversation history. Toward practical use, we also explore cost-effective test-time compute for this new setting. Specifically, we introduce a new benchmark for this setting, and evaluate nine revision methods, including sequential reflection and parallel sampling variants, using gpt-oss-20b/120b, gpt-5.4-mini, and qwen3.5-9b/27b/122b on the benchmark. The results show that baselines achieve accuracies of 68.3—93%, and the most cost-effective method is selecting from three parallel samples using either LLM-based or medoid selection, which improves accuracy by 2.2—9.7%. Our code and dataset are available at this https URL.

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*对话式生成工件中的修订传播(revision propagation)问题\*\*,具体可分解为以下三个层面: ### 1. 核心任务:局部修订请求的全局一致性维护 在基于大语言模型(LLM)的对话系统中,用户通常通过多轮交互逐步生成文档、代码、计划等结构化工件(artifacts)。当用户后续提出局部修订请求时,LLM不仅要修改被明确提及的元素,还必须\*\*自动识别隐式依赖关系\*\*,并将修订传播至所有受影响的依赖元素,以维持工件内部的一致性。例如,用户要求“删除行程中的景点B”,LLM还需同步调整预算、时间安排等依赖元素;若仅修改局部而遗漏传播,就会产生不一致(如图1所示的“Missed budget revision”)。 ### 2. 研究空白:隐式依赖与对话上下文的特殊性 现有关于修订传播的研究主要集中于以下领域,且依赖关系相对明确: - \*\*代码编辑\*\*:依赖关系可通过调用图、导入关系等静态分析获取; - \*\*知识编辑\*\*:依赖关系基于预存的知识图谱; - \*\*文档编辑\*\*:依赖关系通过章节引用、图表编号等显式链接确定。 相比之下,对话式生成的工件(如旅行计划、项目排期、发票记录等JSON格式数据)具有两个显著差异: - \*\*依赖关系往往是隐式的\*\*,无法通过静态结构预先提取; - \*\*依赖信息可能嵌入在多轮对话历史之中\*\*,而非仅仅存在于最终工件内。 该论文指出,\*\*这一实际场景下的修订传播能力尚未被充分探索\*\*。 ### 3. 实践目标:成本效益高的测试时计算(Test-Time Compute) 在确立上述问题的基础上,论文进一步研究如何\*\*以经济高效的方式提升LLM的修订传播性能\*\*。具体包括: - 构建专门针对该场景的人工标注基准测试 \*\*RevPropBench\*\*,涵盖9个领域、3种工件规模(10/50/100个JSON元素)及6类传播模式; - 系统评估9种修订方法(包括单次推理基线、顺序反思、并行采样及基于规则或LLM的选择策略); - 验证在测试时增加计算(如并行采样+选择)能否以较低成本提升准确率,并给出实用的方法选择建议(如SELECT或MED方法可在成本可控范围内提升2.2–9.7%的准确率)。 简言之,该论文聚焦于\*\*对话历史驱动的隐式依赖场景下,LLM能否以及如何经济高效地将局部修订传播至全局工件\*\*。 Q2: 有哪些相关研究? 根据论文第5节及相关引用,相关研究可分为以下三个主要方向: ## 1. 修订传播(Revision Propagation) ### 仓库级代码编辑(Repository-level Code Editing) 研究聚焦于LLM如何定位相关文件并在代码库范围内传播编辑以维护全局一致性。代表性工作包括: - \*\*SWE-bench\*\* (Jimenez et al., 2024) 与 \*\*CodePlan\*\* (Bairi et al., 2024):评估LLM解决真实GitHub问题的能力,要求跨文件传播修改; - \*\*DependEval\*\* (Du et al., 2025):针对仓库依赖理解的基准测试; - 后续改进工作表明,显式提取仓库级依赖图(如调用图、导入关系)可显著提升性能,例如 \*\*GraphCoder\*\* (Liu et al., 2024)、\*\*CodexGraph\*\* (Liu et al., 2025)、\*\*RepoGraph\*\* (Ouyang et al., 2025)、\*\*CoRet\*\* (Fehr et al., 2025) 和 \*\*Code Graph Model\*\* (Tao et al., 2025)。 ### 知识编辑(Knowledge Editing) 研究关注事实编辑后的涟漪效应(ripple effect),即修改一个事实后,相关事实是否同步更新: - \*\*RippleEdits\*\* (Cohen et al., 2024):评估编辑目标事实后,对应当改变或应保持不变的相关事实的查询表现; - \*\*ChainEdit\*\* (Dong et al., 2025):通过从知识图谱提取逻辑规则,引导LLM推理更新逻辑关联事实链。 ### 文档编辑(Document Editing) 研究关注长文档中局部修订对依赖文本元素的一致性维护: - \*\*EditPropBench\*\* (Kruthof, 2026):衡量科学手稿中事实编辑的传播,测试LLM是否仅修改直接编辑的句子,同时更新依赖声明; - \*\*LEDGER\*\* (Wang et al., 2026):构建基于文档结构与LLM推断语义依赖的依赖图,通过图引导检索选择必要的编辑上下文。 ### 与本文的核心区别 上述研究依赖的依赖关系基本显式或静态可分析(代码依赖图、知识图谱、章节/引用结构),而本文聚焦于\*\*对话式生成的工件\*\*,其依赖关系往往\*\*预先不可用\*\*,且可能通过\*\*对话历史隐式建立\*\*。 --- ## 2. LLM系统中的JSON工件(JSON Artifacts in LLM-based Systems) JSON作为结构化输出格式广泛应用于LLM系统的工具调用、智能体动作及数据处理 (OpenAI, 2024; The LangChain Team, 2024)。相关工作包括: - \*\*JSON Whisperer\*\* (Duanis et al., 2025):研究LLM生成JSON patch以编辑JSON工件的准确性,但仅关注修改操作本身,\*\*不考虑生成该工件的对话过程\*\*。 本文与其目标不同:不仅评估JSON patch的准确性,更关注\*\*对话历史隐含的依赖关系\*\*以及\*\*成本效益高的测试时计算策略\*\*。 --- ## 3. 测试时计算(Test-Time Compute) 测试时计算通过增加推理阶段计算量(推理、采样或搜索)提升输出质量,主要分为两类: ### 并行采样(Parallel Sampling) - \*\*自一致性(Self-Consistency)\*\* (Wang et al., 2023):从采样的多条推理路径中选择最一致的答案; - \*\*Best-of-N\*\* (Cobbe et al., 2021):利用学习得到的验证器或奖励模型从生成候选中选择最优结果。 ### 顺序反思(Sequential Reflection) - \*\*Self-Refine\*\* (Madaan et al., 2023):通过自反馈迭代优化输出; - \*\*Reflexion\*\* (Shinn et al., 2023):利用语言智能体的言语强化学习进行反思。 本文在这些通用方法基础上,针对\*\*对话式工件修订传播\*\*这一新场景,系统评估了顺序反思与并行采样(包括基于规则聚合与LLM选择)的成本效益权衡。 Q3: 论文如何解决这个问题? 论文通过\*\*构建专门基准测试\*\*、\*\*系统评估上下文与模型能力\*\*、\*\*对比多种测试时计算策略\*\*以及\*\*成本效益分析\*\*四个层面解决对话式生成工件中的修订传播问题。具体路径如下: --- ### 1. 构建专用评估基准 RevPropBench 为系统性研究该问题,论文首先建立了一个面向对话式 JSON 工件的人工标注基准: - \*\*两阶段任务定义\*\*:包含\*\*生成阶段\*\*(LLM 与用户通过多轮对话逐步构建 JSON 工件)和\*\*修订阶段\*\*(用户给出局部修订请求,LLM 输出 JSON Patch)。 - \*\*合成采样与人工校验\*\*:基于 GPT-5.5 生成场景与对话,Claude-Opus-4.8 生成候选 gold patch,再由人工 annotator 审核修正,确保传播结果唯一且确定。 - \*\*多维覆盖\*\*:涵盖 9 个实用领域(旅行计划、发票、项目排期等)、3 种工件规模(10 / 50 / 100 个 JSON 元素)以及 6 种传播模式(算术重算、引用替换、时间偏移、阈值门控、结构增删、状态传播)。 - \*\*标准化评估\*\*:采用 JSON Patch(RFC 6902)作为修订操作格式,以\*\*完成率\*\*(completion rate,即生成工件与 gold 工件完全匹配的比例)为主指标,并细分为遗漏(miss)、过度编辑(over edit)和错误值(wrong value)三类失败模式。 --- ### 2. 验证单次推理基线与对话上下文的作用 论文评估了仅提供最终工件(J)、仅提供对话历史(H)、以及同时提供两者(J+H)三种基线设置: - \*\*上下文必要性\*\*:在所有模型上均观察到一致的性能排序 J < H < J+H 。这表明对话历史蕴含了工件内部隐式依赖的关键线索(如元素间的推导关系),而最终工件本身无法完全恢复这些信息;同时,显式提供最终工件又能帮助 LLM 避免路径错误和遗漏修订。 - \*\*基础能力确认\*\*:在单次推理(J+H)下,六个代表性模型(gpt-oss-20b/120b、gpt-5.4-mini、qwen3.5-9b/27b/122b)的完成率达到 68.3% – 93.0% ,证明 LLM 已具备初步的修订传播能力,但仍有显著提升空间。 --- ### 3. 系统探索测试时计算(Test-Time Compute)策略 为在推理阶段以额外计算成本换取更高准确性,论文设计并评估了九种方法: | 类别 | 方法 | 核心机制 | |:---|:---|:---| | \*\*基线\*\* | J / H / J+H | 单次推理,输入不同上下文 | | \*\*顺序反思\*\* | REFLECT | 基于自反馈迭代修正 patch,共 k 次 LLM 调用 | | \*\*并行采样+规则聚合\*\* | OR / AND / MAJ | 并行生成多个 patch,按元素级“或/与/多数表决”合并 | | \*\*并行采样+选择\*\* | MED(medoid) | 选择与其他候选在叶节点层面平均分歧最小的完整候选 | | \*\*并行采样+选择\*\* | SELECT | 并行生成候选后,由 LLM 从中选择最优的一个 | 关键发现包括: - \*\*规则聚合不可靠\*\*:AND 因要求所有候选一致而丢弃大量正确编辑,性能显著低于基线( -13.2% 至 -21.3% );OR 因接受任意编辑而引入大量过度编辑;MAJ 介于两者之间,但跨模型稳定性差。 - \*\*顺序反思收益有限\*\*:REFLECT 能带来小幅稳定提升( +0.5% – +8.2% ),但很少超越并行采样选择方法。 - \*\*选择策略最优\*\*:SELECT 和 MED 提升最稳定且显著。SELECT 通过 LLM 推理倾向于选出最完整的候选,最大限度减少遗漏;MED 通过统计典型性减少异常过度编辑,但恢复遗漏的能力略逊于 SELECT。 --- ### 4. 成本效益分析与实用方案推荐 论文进一步将性能提升与 API 成本、推理延迟进行联合分析: - \*\*性能饱和\*\*:多数方法在 4–5 次 LLM 调用后性能趋于饱和。 - \*\*成本效益最优\*\*:在平均意义下,\*\*SELECT 使用 3–4 次 LLM 调用\*\*或 \*\*MED 使用 3 次 LLM 调用\*\*时,单位成本带来的准确率增益最高(相对于 J+H 基线提升 2.2% – 9.7% )。 - \*\*实用指南\*\*: - \*\*均衡首选\*\*:\*\*SELECT + 4 次 LLM 调用\*\*(3 次并行采样 + 1 次选择)。该方法在成本曲线中处于最佳权衡点,适合追求最高完成率的场景。 - \*\*低延迟备选\*\*:\*\*MED + 3 次 LLM 调用\*\*。由于 MED 仅需单阶段并行采样(选择过程无需额外 LLM 调用),其延迟增幅最小(通常低于 1.5× ),适合对响应速度敏感的生产环境。 通过上述路径,论文不仅量化了 LLM 在隐式依赖场景下的修订传播能力,还给出了可落地的测试时计算配置建议,以在准确率、成本与延迟之间取得平衡。 Q4: 论文做了哪些实验? 论文围绕对话式 JSON 工件的修订传播问题,开展了从基准构建到多维性能评估的系列实验,具体如下: --- ### 1. 基准构建与标注实验 \*\*RevPropBench 的构建与验证\*\* - \*\*合成采样\*\*:基于 50 个人工设计的场景(覆盖旅行计划、发票、购物车、项目排期、课程计划、数据管道、软件配置、组织访问计划、制造 BOM 共 9 个领域),使用 GPT-5.5 生成多轮对话式工件及局部修订请求。每个场景按 10、50、100 个 JSON 元素生成 3 个样本,总计 150 个样本。 - \*\*传播模式覆盖\*\*:确保样本涵盖 6 类传播模式——算术重算(arithmetic recompute)、引用替换(reference substitution)、结构增删(structural add/remove)、阈值门控(threshold gating)、时间偏移(temporal shift)、状态传播(status propagation)。 - \*\*人工标注校验\*\*:使用 Claude-Opus-4.8 生成候选 gold patch,再由人工标注者审核修正,最终 23/150 个样本(15%)被人工修订,以确保 gold patch 的唯一性与确定性。 --- ### 2. 主性能对比实验 \*\*数据划分\*\* - 按场景级别划分:10 个场景(30 样本)为开发集,40 个场景(120 样本)为测试集。所有报告结果均基于测试集,并在 5 个随机种子(0, 42, 84, 126, 168)上取平均。 \*\*评估模型\*\* 共测试 6 个代表性模型,覆盖两个模型家族与三种参数量级: - gpt-oss-20b / gpt-oss-120b - gpt-5.4-mini - qwen3.5-9b / qwen3.5-27b / qwen3.5-122b \*\*评估方法\*\* 对比 9 种修订方法: - \*\*基线\*\*:仅输入最终工件(J)、仅输入对话历史(H)、同时输入两者(J+H) - \*\*顺序反思\*\*:REFLECT(基于 J+H 进行 4 轮迭代反思,共 5 次 LLM 调用) - \*\*并行采样 + 规则聚合\*\*:OR、AND、MAJ(分别按元素级“任一修改即采纳”、“全体一致才采纳”、“严格多数才采纳”进行合并) - \*\*并行采样 + 选择\*\*:MED(选择与其他候选叶节点分歧最小的完整候选)、SELECT(由 LLM 从并行样本中选择最优一个) \*\*关键发现\*\* - \*\*上下文重要性\*\*:所有模型均呈现一致的准确率排序 J < H < J+H ,证明对话历史蕴含隐式依赖信息,而最终工件能辅助减少路径错误。 - \*\*模型差异\*\*:单次推理(J+H)的完成率跨度为 68.3% (qwen3.5-9b)至 93.0% (gpt-5.4-mini),大体随模型规模增大而提升。 - \*\*测试时计算效果\*\*: - SELECT 提升最稳定(比 J+H 高 3.3% – 12.5% ),在 6 个模型中 4 个取得最高完成率; - MED 次之(提升 1.8% – 7.7% ); - AND 因要求全体一致而严重损失性能(下降 13.2% – 21.3% ); - REFLECT 有小幅提升( 0.5% – 8.2% ),但 rarely 超越 SELECT 或 MED。 --- ### 3. 失败模式分解实验 将错误细分为三类,并在元素级别统计: - \*\*miss(遗漏)\*\*:未执行必要的依赖修订,占大多数错误; - \*\*over edit(过度编辑)\*\*:修改了不应改变的元素; - \*\*wrong value(错误值)\*\*:必要修订被执行但数值错误。 \*\*结果\*\* - 多数方法的失败以 miss 为主,表明模型倾向于“传播不足”; - REFLECT 通过迭代反思可减少部分 miss,但效果有限; - OR 因采纳任意候选修改而引入大量 over edit; - MED 通过选择典型候选抑制了异常 over edit,但对 miss 的恢复弱于 SELECT; - SELECT 通过 LLM 推理倾向于选择最完整的候选,最大程度降低了 miss。 --- ### 4. 成本效益分析实验 将完成率与 API 成本(输入+输出 token 费用)进行联合分析: - \*\*成本-性能曲线\*\*:绘制不同 LLM 调用次数(1 至 5 次及以上)下的完成率随成本变化曲线。结果显示多数方法在 4–5 次调用后性能趋于饱和。 - \*\*固定调用次数对比\*\*:在 5 次调用下,GPT 系列各方法成本相近;而 Qwen 系列中 SELECT 因生成更多推理 token,成本比 J+H 高 5.7× – 7.5× 。 - \*\*固定成本对齐\*\*:将其他方法的调用次数扩展至与 SELECT 成本相当后,方法间的相对性能排序基本不变,说明 SELECT 的优势并非单纯来自更高成本。 - \*\*最优成本效益点\*\*:通过事后分析计算单位相对成本带来的准确率增益( gaincost/cost_(J+H) - 1 ),发现跨模型平均最优解为 \*\*SELECT 使用 3–4 次 LLM 调用\*\* 或 \*\*MED 使用 3 次 LLM 调用\*\*,可在成本与准确率间取得最佳平衡。 --- ### 5. 延迟分析实验(附录 A) 测量各方法相对于 J+H 基线的推理延迟倍数: - \*\*REFLECT\*\*:延迟随调用次数近似线性增长( 2.0× – 6.0× ); - \*\*MED\*\*:因采样并行执行,延迟增幅最小,即使 5 次调用仍低于 1.5× ; - \*\*SELECT\*\*:GPT 模型约为 2.0× – 2.4× ;Qwen 模型因推理 token 量大,延迟达 3.3× – 6.2× 。 \*\*延迟效益\*\*:以“单位相对延迟带来的准确率增益”衡量,MED( k=3 )是平均延迟效益最高的方法,为低延迟场景提供了替代方案。 --- ### 6. 方法机制验证实验(附录 D) 对并行采样中的规则聚合与选择机制进行内部验证: - 定义了叶节点级别的合并单元(leaf-level merge units),区分对象键值对与数组元素; - 验证 OR、AND、MAJ 的元素级合并逻辑,以及 MED 的 mean leaf-level disagreement 计算方式; - 确认 MED 返回完整候选而非合并 patch,从而避免了规则聚合可能产生的结构冲突。 Q5: 有什么可以进一步探索的点? 基于论文的局限性分析与实验发现,以下方向值得进一步探索: --- ### 1. 真实对话数据的引入与模糊性处理 当前基准采用 LLM 合成对话,且人为控制了依赖关系的确定性。未来工作可: - 收集\*\*真实的人机交互对话日志\*\*,构建修订请求与传播结果天然存在歧义或主观解释空间的评测集; - 研究\*\*不确定性建模\*\*,允许模型在依赖关系不明确时输出多个候选修订或主动询问用户,而非强制要求唯一 gold patch。 --- ### 2. 显式依赖挖掘与隐式依赖的混合推理 论文场景假设依赖关系完全隐式且仅存于对话历史。后续研究可探索: - \*\*动态依赖图构建\*\*:在多轮生成阶段实时提取元素间的显式依赖结构(如数值公式、引用关系、时序约束),形成轻量级图谱; - \*\*混合传播策略\*\*:将显式图推理与 LLM 的隐式上下文理解相结合,在保留对话灵活性的同时降低纯依赖 LLM 推断的遗漏率。 --- ### 3. 自适应测试时计算(Adaptive Test-Time Compute) 当前实验固定采样次数(如 3 或 5 次)。更精细的方案包括: - \*\*难度感知采样\*\*:根据修订请求的局部性复杂度、传播链长度或模型置信度,动态决定并行采样数量; - \*\*早期退出机制\*\*:在顺序反思(REFLECT)中引入收敛检测,当连续迭代不再修改 patch 时提前终止,以降低延迟与成本。 --- ### 4. 跨格式与跨领域的扩展 论文聚焦 JSON 工件,但对话式生成还涉及: - \*\*非结构化文本\*\*(如长文档、报告)中的修订传播,需处理段落级语义依赖而非键值对路径; - \*\*多模态工件\*\*(如图文混排的演示文稿、带 UI 截图的配置界面),要求模型在模态间传播修订; - \*\*领域迁移\*\*:验证当前方法在医疗记录、法律合同等低容错领域的鲁棒性。 --- ### 5. 人在回路中的高效协同(Human-in-the-Loop) 论文附录 E 提到关键修订需人工审查,但未展开实验验证。可进一步研究: - \*\*差异可视化与优先级排序\*\*:如何向用户呈现模型推断出的级联修订,使其快速定位关键修改; - \*\*交互式确认协议\*\*:允许用户逐条批准/拒绝传播修订,模型根据反馈实时调整剩余依赖链,而非一次性应用全部 patch。 --- ### 6. 针对修订传播的模型专门化 当前结果基于通用基础模型。未来可探索: - \*\*持续预训练或微调\*\*:使用大规模合成修订传播数据训练专用模型,提升单次推理的基线完成率,缓解性能饱和问题; - \*\*结构化输出约束\*\*:在模型架构或解码阶段硬编码 JSON Patch 的依赖一致性约束,减少路径错误和算术重算失误。 --- ### 7. 更复杂的依赖拓扑 现有 6 类传播模式以树状或线性依赖为主。更复杂的场景包括: - \*\*循环依赖\*\*:如双向引用或闭环计算(A 依赖 B,B 同时依赖 A 的更新后值); - \*\*多跳长链与条件分支\*\*:传播路径跨越 5 步以上,或涉及嵌套条件语句(如 \`if-elif-else\` 链)的动态分支选择; - \*\*冲突修订\*\*:同一元素受多个独立修改请求影响时,模型需解决冲突并给出一致性方案。 Q6: 总结一下论文的主要内容 该论文围绕\*\*对话式生成工件中的修订传播问题\*\*展开系统研究,核心内容可概括如下: ## 1. 研究背景与问题定义 在基于大语言模型(LLM)的对话系统中,用户通过多轮交互逐步生成结构化工件(如计划、配置、记录等)。当用户后续提出\*\*局部修订请求\*\*时,LLM 不仅要修改被显式提及的元素,还必须识别\*\*隐式依赖关系\*\*,将修订自动传播至所有受影响的依赖元素,以维持工件内部一致性。 与代码编辑(依赖显式调用图)、知识编辑(依赖预存知识图谱)、文档编辑(依赖章节引用结构)不同,对话式生成的工件具有以下独特性: - 元素间依赖关系往往是\*\*隐式的\*\*; - 依赖信息可能嵌入在\*\*多轮对话历史\*\*之中,而非仅存在于最终工件内。 该论文指出,这一实际场景下的修订传播能力及成本效益优化策略尚未被充分探索。 ## 2. RevPropBench 基准测试 为系统性评估该能力,论文构建了名为 \*\*RevPropBench\*\* 的人工标注基准: - \*\*任务定义\*\*:两阶段设定——先通过对话历史生成 JSON 工件,再基于局部修订请求输出 JSON Patch(RFC 6902); - \*\*规模与覆盖\*\*:共 150 个样本,涵盖 9 个实用领域(旅行计划、发票、项目排期等)、3 种工件规模(10 / 50 / 100 个 JSON 元素); - \*\*传播模式\*\*:覆盖 6 类依赖传播模式,包括算术重算、引用替换、结构增删、阈值门控、时间偏移和状态传播; - \*\*数据构建\*\*:采用 GPT-5.5 合成对话与修订请求,Claude-Opus-4.8 生成候选 gold patch,再经人工审核修正,确保修订结果唯一且确定。 ## 3. 实验设计与评估方法 论文在 120 个测试样本上,对 6 个代表性模型(gpt-oss-20b/120b、gpt-5.4-mini、qwen3.5-9b/27b/122b)评估了 9 种修订方法: | 方法类别 | 具体方法 | 说明 | |:---|:---|:---| | \*\*基线\*\* | J / H / J+H | 单次推理,分别输入最终工件、对话历史、或两者 | | \*\*顺序反思\*\* | REFLECT | 基于自反馈迭代修正 patch(共 5 次 LLM 调用) | | \*\*并行采样+规则聚合\*\* | OR / AND / MAJ | 多路采样后按元素级“或/与/多数表决”合并 | | \*\*并行采样+选择\*\* | MED | 选择与其他候选叶节点平均分歧最小的完整候选 | | \*\*并行采样+选择\*\* | SELECT | 由 LLM 从并行候选中选择最优 patch | 评估指标以\*\*完成率\*\*(completion rate,即生成结果与 gold 工件完全匹配的比例)为主,并细分为遗漏(miss)、过度编辑(over edit)和错误值(wrong value)。 ## 4. 主要结果与发现 ### 单次推理基线性能 - 最强基线(J+H)的完成率为 68.3% (qwen3.5-9b)至 93.0% (gpt-5.4-mini),性能大体随模型规模提升; - 上下文重要性显著:所有模型均呈现一致排序 J < H < J+H ,表明对话历史蕴含隐式依赖信息,而最终工件能减少路径错误。 ### 测试时计算策略的有效性 - \*\*SELECT\*\*(LLM-based 选择)表现最稳定,在 6 个模型中 4 个取得最高完成率,相对 J+H 提升 3.3% – 12.5% ; - \*\*MED\*\*(medoid 选择)次之,提升 1.8% – 7.7% ,且因仅需单阶段并行采样,延迟增幅最小(低于 1.5× ); - \*\*规则聚合方法\*\*可靠性差:AND 因要求全体一致而严重损失性能( -13.2% 至 -21.3% ),OR 引入大量过度编辑; - \*\*REFLECT\*\* 仅有小幅提升( +0.5% – +8.2% ),且 rarely 超越 SELECT 或 MED。 ### 成本效益与延迟权衡 - 性能在 4–5 次 LLM 调用后趋于饱和; - 跨模型平均而言,\*\*成本效益最高\*\*的方案为: - \*\*SELECT + 3–4 次 LLM 调用\*\*(追求准确率的最佳均衡点); - \*\*MED + 3 次 LLM 调用\*\*(低延迟场景下的替代方案); - 相比单次推理,上述方案可将完成率进一步提升 2.2% – 9.7% 。 ### 失败模式分析 - 绝大多数错误为 \*\*miss\*\*(遗漏必要修订),表明模型倾向于“传播不足”而非“过度传播”; - SELECT 通过 LLM 推理选择最完整候选,最大程度降低了 miss;MED 则通过统计典型性抑制了异常过度编辑。 ## 5. 贡献与资源 论文的主要贡献包括: - 提出了首个针对\*\*对话式 JSON 工件中隐式依赖修订传播\*\*的人工标注基准 RevPropBench; - 系统评估了 9 种修订方法与 6 个 LLM,提供了成本效益最优的测试时计算策略选择指南; - 开源了基准实例、数据采样与标注工具,支持复现与未来扩展。 综上,该论文不仅量化了 LLM 在隐式依赖场景下的修订传播能力边界,还验证了通过\*\*有限次数的并行采样与智能选择\*\*(SELECT 或 MED)可在可控成本内显著提升可靠性,为对话式 AI 系统中的工件一致性维护提供了实用参考。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [**这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是What%20Else%20Needs%20Fixing%3F%20Exploring%20Cost-Effective%20Test-Time%20Compute%20for%20Revision%20Propagation%20in%20Artifacts%20Generated%20Through%20Conversation,链接是https://arxiv.org/pdf/2609.03254,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.03254。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Daisuke Kikuta

Categories:

PDF URL: https://arxiv.org/pdf/2609.03254.pdf

Arxiv URL: https://arxiv.org/abs/2609.03254

Arxiv ID: 2609.03254

CoolPaper URL: https://papers.cool/arxiv/2609.03254

Published: 2026-09-09T01:31:24.883Z

Updated: 2026-09-09T01:31:24.883Z


12. SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models

Abstract:Long-horizon manipulation is partially observable: the information needed to choose the next action may appear only in observations from minutes earlier. Existing memory mechanisms: retrieval banks, learned compressors, recurrent states must decide what to keep from the past before knowing what a future decision will require. This was motivated by the assumption that minute-scale history is too large to process directly, which modern VLM backbones no longer make true. In this work, we introduce SimpleMemVLA, a VLA without a dedicated memory module. It keeps the sampled history intact and passes it to the backbone in the timestamped video format the backbone was pretrained to process; the hidden states of a generated sub-task then form the only channel from history to a standard flow-matching action head. Since consecutive decisions share most of their history, prefilling the shared prefix during action execution keeps latency close to a single-frame VLA. SimpleMemVLA sets a new state of the art on four memory benchmarks without cost on general-purpose control. Holding the backbone and training setup fixed, it outperforms retrieval, compression and recurrent-state mechanisms by a wide margin, and causal interventions confirm that the policy genuinely reads its history. Code available at this https URL

中文摘要

翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.05533 (HTTP 429)

Authors: Cheng Yin,Wang Xu,Junpeng Yang,Sikyuen Tam,Hanyu Liu,Yuan Yao,Xiangrui Zeng,Junbo Cui,Yequan Wang,Zhouping Yin,Yankai Lin

Categories:

PDF URL: https://arxiv.org/pdf/2609.05533.pdf

Arxiv URL: https://arxiv.org/abs/2609.05533

Arxiv ID: 2609.05533

CoolPaper URL: https://papers.cool/arxiv/2609.05533

Published: 2026-09-09T01:31:24.995Z

Updated: 2026-09-09T01:31:24.995Z