数据来源:HuggingFace Papers

Latest Papers

1. ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment

Abstract:Long-horizon search agents must make multiple sequential actions (steps) to search, retrieve, verify, and integrate evidence to reach a final answer. However, existing methods for training these agents typically treat all steps within a trajectory uniformly during both supervised fine-tuning (SFT) and reinforcement learning (RL), failing to distinguish useful actions from erroneous or redundant ones. In this paper, we propose Answer-Backtracked Credit Assignment (ABC), a fine-grained credit assignment framework for training long-horizon search agents by converting sparse trajectory-level outcomes into dense step-level supervision that rewards useful actions (even in failed trajectories) while suppressing erroneous or redundant actions. Specifically, given a potentially obscure query and its corresponding ground-truth answer, ABC first performs Answer-Backtracked Clue Recovery, which traces back from the answer to recover intermediate clues required to solve the question. It then applies Clue-Anchored Step Scoring to evaluate each search step against these clues, converting sparse binary outcome supervision into dense step-level rewards. Based on these rewards, we develop ABC-SFT, which reweights the loss of each turn, and ABC-GRPO, which uses the step-level scores as rewards in GRPO. Building on this framework, we train ABSeeker based on Qwen3.5-4B with only 8.5k examples. ABSeeker achieves 37.3% on BrowseComp and 39.1% on BrowseComp-ZH. With context management, the scores further improve to 55.3% and 52.9%, respectively, significantly outperforming same-scale (4B) agents and even matching the performance of larger ones (approximately 30B). These results demonstrate the effectiveness of answer-backtracked step-level credit assignment for training long-horizon search agents.

中文摘要

摘要:长程搜索代理必须执行多个连续动作(步骤)来搜索、检索、验证和整合证据,以得出最终答案。然而,现有训练这些代理的方法通常在监督微调(SFT)和强化学习(RL)中对轨迹中的所有步骤一视同仁,未能区分有用的动作与错误或冗余的动作。在本文中,我们提出了答案回溯信用分配(Answer-Backtracked Credit Assignment, ABC),这是一种用于训练长程搜索代理的精细化信用分配框架,通过将稀疏的轨迹级结果转化为密集的步骤级监督,从而奖励有用的动作(即使在失败的轨迹中),同时抑制错误或冗余的动作。具体来说,针对一个可能模糊的查询及其对应的真实答案,ABC首先执行答案回溯线索恢复(Answer-Backtracked Clue Recovery),从答案向回追溯以恢复解决问题所需的中间线索。随后,它应用基于线索的步骤评分(Clue-Anchored Step Scoring)对每个搜索步骤进行评估,将稀疏的二元结果监督转化为密集的步骤级奖励。基于这些奖励,我们提出了ABC-SFT,通过重新加权每一轮的损失,以及ABC-GRPO,在GRPO中将步骤级评分用作奖励。在该框架基础上,我们基于Qwen3.5-4B训练了ABSeeker,仅使用了8.5k个示例。ABSeeker在BrowseComp上达到37.3%,在BrowseComp-ZH上达到39.1%。在上下文管理下,成绩进一步提升至分别为55.3%和52.9%,显著超过相同规模(4B)的代理,甚至与规模更大的代理(约30B)的性能相当。这些结果表明,基于答案回溯的步骤级信用分配在训练长程搜索代理中具有显著效果。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决长程搜索智能体(long-horizon search agents)训练过程中的细粒度信用分配(credit assignment)问题。具体而言,现有方法在监督微调(SFT)和强化学习(RL)阶段通常对整条轨迹内的所有步骤进行统一处理,无法区分各步骤对最终答案的独立贡献,从而限制了模型对关键搜索与推理行为的针对性优化。

该问题的核心表现可归纳为以下两方面:

  • 失败轨迹中的有用行为被错误惩罚:即使最终答案错误,轨迹中仍可能包含检索到关键证据、验证线索或修正方向等有效步骤。然而,基于轨迹级二元奖励(正确/错误)的训练会将整条轨迹标记为负例,导致这些有价值的中间行为无法获得正向激励。
  • 成功轨迹中的错误行为被错误强化:即使最终答案正确,轨迹中也可能混杂冗余检索、错误推理或丢弃有效证据等低质量步骤。统一的正向奖励无法识别并抑制这些不良行为,反而可能将其固化到策略中。

为应对上述挑战,论文提出基于答案回溯的信用分配框架(Answer-Backtracked Credit Assignment, ABC)。该框架的核心思路是:利用已验证的正确答案反向回溯,恢复出解答问题所需的中间证据线索(entities, facts, relations),进而将稀疏的轨迹级结果监督转化为密集的步骤级奖励,实现对每一步搜索或推理行为的独立、稳定、细粒度评估。

Q: 有哪些相关研究?

根据论文第2节(Related Work),相关研究主要涵盖以下两个方向:

1. 长程搜索智能体(Long-Horizon Search Agents)

  • ReAct 范式:Yao et al. (2022) 奠定了基于大语言模型的智能体标准框架,即通过交错推理、工具调用与环境观察来解决知识密集型任务。
  • 长程搜索系统:近期工作将该框架扩展到需要数十轮检索-浏览-整合循环的深度研究任务,代表性系统包括 OpenAI Deep Research、Tongyi DeepResearch 与 MiroThinker 等。
  • 共同局限:尽管上述系统在交互规模上不断扩展,其训练方式主要依赖轨迹级监督——将成功轨迹整体视为正例、失败轨迹整体视为负例,无法精细刻画中间决策对最终答案的真实贡献。

2. 搜索智能体的信用分配(Credit Assignment for Search Agents)

为缓解轨迹级监督的稀疏性问题,近期研究探索了多种细粒度信用分配方法,但各自存在不足:

方法 核心思想 局限性
IGPO (Wang et al., 2026) 根据模型对正确答案的似然度增量分配步骤级奖励 信用信号依赖于模型自身的信念估计,会随策略更新而波动,缺乏稳定性
CSO (Li et al., 2026) 通过测试替代动作并验证其是否导致正确结果,识别关键步骤 仅对已验证的关键决策分配信用,对轨迹中其余步骤不提供直接监督,监督密度不足
SAPO (Liu et al., 2026) 基于中间实体与答案的图邻近度评估步骤贡献 实体级信号无法直接判定每个搜索或推理决策本身是否正确
MindDR (Team and Inc, 2026) 基于轨迹中中间实体的覆盖度分配信用 同上,无法直接评估单步决策的有效性与正确性

3. 本文方法与现有研究的区别

现有方法均未能提供密集且可靠的过程监督,以直接评估轨迹中每一步决策的正确性与贡献。作为对比,本文提出的 Answer-Backtracked Credit Assignment (ABC) 框架具有以下特点:

  • 利用已验证答案进行回溯:通过 Answer-Backtracked Clue Recovery 从答案反向恢复出中间证据线索(entities, facts, relations),构建固定的评估锚点。
  • 密集步骤级监督:通过 Clue-Anchored Step Scoring 为每一步分配标量分数,将稀疏的二元结果监督转化为密集的步骤级奖励
  • 兼容 SFT 与 RL:所得奖励既可用于 ABC-SFT 对每轮损失进行重加权,也可作为 ABC-GRPO 中的步骤级奖励信号,从而在失败轨迹中奖励有效行为、在成功轨迹中抑制错误或冗余行为。

Q: 论文如何解决这个问题?

该论文提出 Answer-Backtracked Credit Assignment (ABC) 框架,通过将稀疏的轨迹级结果监督转化为密集的步骤级监督,实现对长程搜索智能体的细粒度训练。具体解决方案包含两个核心阶段与两种训练范式,其流程如下:

一、核心阶段

1. Answer-Backtracked Clue Recovery(答案回溯线索恢复)

给定训练问题 (q, a^) (其中 q 为查询, a^ 为已验证答案),该方法首先利用大语言模型从答案反向回溯,恢复出一组中间证据线索:

C = c_1, c_2, …, c_K

每个 c_k 代表一个可验证的中间证据(如特定实体、事实、属性或关系)。该过程本身是一个主动的 ReAct 循环:恢复模型通过调用搜索和浏览工具,从答案出发反向追踪至查询,并将每条线索锚定在真实的网页内容中。这些经受了验证的线索构成固定的评估基准,为后续步骤打分提供稳定参照。

2. Clue-Anchored Step Scoring(线索锚定的步骤评分)

在获得线索集合 C 后,对每条轨迹中的每一步 s_t (包含推理、工具调用与工具响应),依据以下评分细则进行评估:

评分行为 分数变化 Delta
发现或验证正确线索 +0.8
排除错误候选 +0.4
错误排除正确线索 -0.8
提交验证的正确答案 +1.0
提交错误答案 -1.0

每步起始基础分为 1.0 ,同一行为可能多次发生(如涉及多条线索),对应增量累加后裁剪至 $
0, 2.0
$:

rt = clip(1.0 + ∑(j ∈ A_t) Delta_j, 0, 2.0)

其中 A_t 表示在第 t 步检测到的评分行为实例集合。该机制确保:

  • 即使轨迹最终失败,只要某步发现了有效线索,仍可获得 r_t > 1.0 的正向奖励;
  • 即使轨迹最终成功,只要某步错误地丢弃了正确线索,仍会受到 r_t < 1.0 的惩罚。

二、基于步骤奖励的训练范式

基于上述细粒度的步骤奖励 r_t ,论文进一步开发了两种训练方法:

1. ABC-SFT:奖励加权监督微调

在标准 SFT 基础上,对收集到的全部轨迹(含正确与错误轨迹)中每轮步骤的损失进行重加权。设第 t 步中第 j 个策略生成 token 为 x_(t,j) ,则训练目标为:

L(SFT)(θ) = -∑(t=1)^(T) w(rt) ∑(j) log pθ(x(t,j) mid x_(t,<j))

其中步骤权重通过 sigmoid 函数映射:

w(r_t) = σ(α · (r_t - β))

α 控制映射锐度, β 为中性基线。高质量步骤获得更大梯度权重,低质量步骤则被自然抑制。

2. ABC-GRPO:步骤级强化学习

在在线 RL 阶段,将步骤得分直接作为奖励信号。对于第 i 条 rollout 的第 t 步,定义奖励为:

R(i,t) = r(i,t)

随后在每组 rollout 内部对奖励进行归一化得到 R_(i,t) ,并计算折扣步骤级优势

A(i,t) = ∑(k=t)^(Ti) γ^(k-t) R(i,k)

其中 γ 控制未来奖励向早期决策的回溯幅度。该优势值 A_(i,t) 被赋给第 t 步中所有策略生成的 token,用于替换标准 GRPO 中的轨迹级优势,从而实现对每步决策的精细优化。

三、整体效果

通过上述框架,ABC 将原本仅依赖最终答案对错( r^(ans)(τ) ∈ 0, 1 )的稀疏信号,转化为覆盖整条轨迹的密集、可解释、基于固定锚点的步骤级监督。这使得智能体能够在失败轨迹中学习有效探索,在成功轨迹中抑制冗余与错误行为,从而显著提升长程搜索的准确性与效率。

Q: 论文做了哪些实验?

论文在第4节(Experiments)中开展了一系列实验,涵盖训练配置、多基准性能对比、奖励分布分析、训练动态监测、上下文管理影响及消融研究。具体内容如下:

1. 实验设置

训练配置

  • 数据:基于 OpenSeeker 收集训练轨迹,保留最终正确与错误的轨迹,每条约 200 步。
  • 骨干模型:Qwen3.5-4B。
  • SFT:在 8.5K 条轨迹上训练 3 个 epoch。
  • RL:从 SFT 检查点出发,对 1,000 个问题各采样 8 条 rollout。
  • 线索恢复与评分模型:使用 DeepSeek-V4-Flash 作为 Answer-Backtracked Clue Recovery 和 Clue-Anchored Step Scoring 的推理骨干。

评估基准

  • BrowseComp:英语长程浏览与多约束信息检索基准。
  • BrowseComp-ZH:对应的中文版本。
  • xbench-2505 / xbench-2510:测试深度研究能力(规划、推理与跨源综合)。
  • GAIA-text(纯文本):综合网页浏览、工具使用与多跳推理的通用助手任务。

对比基线 实验将 ABSeeker 与三类系统对比:

  • 前沿基础模型+工具:Gemini-3.1-Pro、Seed-2.0-Pro、GLM-5、DeepSeek-V4-Pro-Max、GPT-5 High。
  • 约 30B 参数搜索智能体:MiroThinker-1.7-mini、RedSearcher、DeepMiner、Tongyi-DeepResearch、OpenSeeker。
  • 4B 参数搜索智能体:QUEST-4B、DR-Venus、AgentCPM-Explore。

2. 主要结果(跨基准性能对比)

表2报告了 ABSeeker 与上述基线在五个基准上的平均表现(部分结果经三次运行平均):

模型类别 模型 BrowseComp BrowseComp-ZH xbench-2505 xbench-2510 GAIA-text
基础模型+工具 GPT-5 High 54.9 63.0 77.9 75.0 76.4
~30B 智能体 MiroThinker-1.7-mini 67.9 72.3 57.2 80.3
~30B 智能体 Tongyi-DeepResearch 43.4* 46.7* 75.0 70.9
4B 智能体 QUEST-4B 40.0 77.7
4B 智能体 DR-Venus 29.1* 37.7* 74.7 40.7 64.4
4B 智能体 ABSeeker 37.3/55.3* 39.1/52.9* 77.0 46.0 81.6

注:带 * 的结果为未启用上下文管理的得分;ABSeeker 的两组数字分别对应无/有上下文管理。

关键发现:

  • 在 4B 规模中,ABSeeker 在所有基准上均取得最优成绩。
  • 尽管模型规模仅 4B,其性能在 xbench-2505 与 GAIA-text 上超过所有报告的 ~30B 智能体,在 BrowseComp 与 BrowseComp-ZH 上也优于多个大尺度系统。
  • 仅在 BrowseComp 风格数据上训练,却能有效泛化至 xbench 与 GAIA,展现出良好的跨基准迁移能力。

3. 奖励分布分析

论文对用于 ABC-SFT 的 8.5K 条轨迹进行了步骤级奖励分布统计(见图4):

  • 成功轨迹中仍有约 4% 的步骤奖励低于 1.0,表明其中存在错误冗余行为。
  • 失败轨迹中近 10% 的步骤获得高于 1.0 的奖励,说明这些步骤实际上发现了有效线索或进行了有益验证。

该分析验证了轨迹级监督的缺陷:统一的成功/失败标签会强化成功轨迹中的劣质步骤,同时惩罚失败轨迹中的有效探索;而 ABC 的独立步骤评估可避免此问题。

4. RL 训练动态监测

在 BrowseComp 验证集(200 道随机题目)上,论文对比了 ABC-GRPO 与标准轨迹级 GRPO 的训练过程(见图5):

  • 性能:ABC-GRPO 在训练启动后持续获得更高的 BrowseComp 得分。
  • 探索长度:ABC-GRPO 产生的交互轮次更长,表明步骤级信用分配不仅提升准确性,还促进了更充分的搜索探索。

5. 上下文管理的影响

借鉴 MiroThinker 与 LongSeeker 的做法,论文将最大上下文长度设为 256K,并在 BrowseComp 与 BrowseComp-ZH 上采用 discard-all 策略(最多 5 轮):

  • BrowseComp:从 37.3% 提升至 55.3%
  • BrowseComp-ZH:从 39.1% 提升至 52.9%

6. 消融实验

表3对比了标准方法与 ABC 方法在全部五个基准上的表现(均不使用上下文管理):

模型 BrowseComp BrowseComp-ZH xbench-2505 xbench-2510 GAIA-text
+Standard SFT 28.5 30.4 73.0 27.0 66.0
+ABC-SFT 30.8 31.8 72.0 35.0 72.8
+Standard GRPO 33.5 36.3 75.0 41.0 77.7
+ABC-GRPO 37.3 39.1 77.0 46.0 81.6

实验结论:

  • 相较于标准 SFT,ABC-SFT 在 BrowseComp、BrowseComp-ZH、xbench-2510 与 GAIA-text 上均有提升,xbench-2505 基本持平。
  • 在此基础上,ABC-GRPO 在所有基准上均持续优于标准轨迹级 GRPO。
  • 该消融结果证明,细粒度步骤级信用分配能够同时改善监督微调与强化学习阶段的训练效果。

Q: 有什么可以进一步探索的点?

根据论文第5节(Conclusion)末尾的 Future Work 部分,可进一步探索的方向主要包括以下两点:

  • 向更大规模模型的扩展
    受计算资源限制,当前实验仅聚焦于 4B 规模的紧凑模型。一个自然的下一步是将 ABSeeker 扩展至更大参数量的骨干模型,检验在更高模型容量下,基于答案回溯的信用分配是否能带来更显著的性能增益。

  • 向其他长程智能体任务的泛化
    该框架不仅限于网页搜索场景。未来可将其推广至其他长程智能体任务——只要这些任务的最终成果能够被回溯分解为中间证据、子目标或决策点,即可利用类似的细粒度过程监督机制进行训练。

Q: 总结一下论文的主要内容

该论文针对长程搜索智能体的细粒度信用分配问题,提出了 Answer-Backtracked Credit Assignment (ABC) 框架,并基于该框架训练出高性能的 ABSeeker 模型。以下是主要内容的系统总结:

1. 研究背景与核心问题

长程搜索智能体需要通过多轮检索、浏览、验证与整合才能得出最终答案。然而,现有的监督微调(SFT)与强化学习(RL)方法通常对整条轨迹内的所有步骤进行统一处理——成功轨迹的全部步骤被视为正例,失败轨迹则全部视为负例。这种稀疏的轨迹级监督导致两个根本缺陷:

  • 失败轨迹中的有用步骤被埋没:即使最终答案错误,轨迹中仍可能包含发现关键证据或修正方向的有效步骤,却得不到正向激励。
  • 成功轨迹中的错误步骤被强化:即使最终答案正确,轨迹中也可能存在冗余检索、错误推理或误丢弃有效证据等行为,却无法被识别和抑制。

2. 方法:Answer-Backtracked Credit Assignment (ABC)

为将稀疏的轨迹级结果监督转化为密集的步骤级监督,ABC 框架包含两个核心阶段:

(1) Answer-Backtracked Clue Recovery(答案回溯线索恢复)

给定训练样本 (q, a^) (查询与已验证答案),通过一个大语言模型执行主动的 ReAct 式搜索,*从答案反向回溯,恢复出一组可验证的中间证据线索:

C = c_1, c_2, …, c_K

其中每个 c_k 代表连接查询与答案的实体、事实、关系或约束。这些线索在实际网页内容中得到验证,构成后续评估的固定锚点。

(2) Clue-Anchored Step Scoring(线索锚定的步骤评分)

基于恢复的线索集 C ,对每条轨迹的每一步 s_t (包含推理、工具调用与环境响应)进行独立评分。评分规则包括:

行为 分值变化
发现或验证正确线索 +0.8
排除错误候选 +0.4
错误排除正确线索 -0.8
提交正确答案 +1.0
提交错误答案 -1.0

每步基础分为 1.0 ,各项增量累加后裁剪至 $
0, 2.0
$:

rt = clip(1.0 + ∑(j ∈ A_t) Delta_j, 0, 2.0)

这确保了即使轨迹最终失败,发现有效线索的步骤仍可获得 r_t > 1.0 的奖励;反之,成功轨迹中的错误步骤也会受到惩罚。

(3) 基于步骤奖励的训练范式

  • ABC-SFT(奖励加权监督微调)
    对收集到的全部轨迹(含正确与错误),依据步骤奖励 r_t 对每轮损失进行重加权:

L(SFT)(θ) = -∑(t=1)^(T) w(rt) ∑(j) log pθ(x(t,j) mid x_(t,<j))

其中 w(r_t) = σ(α · (r_t - β)) 。高质量步骤获得更大梯度权重,低质量步骤则被抑制。

  • ABC-GRPO(步骤级强化学习)
    将步骤得分直接作为奖励信号 R(i,t) = r(i,t) ,并在每组 rollout 内归一化后计算折扣步骤级优势:

A(i,t) = ∑(k=t)^(Ti) γ^(k-t) R(i,k)

该优势替换标准 GRPO 中的轨迹级优势,实现对早期决策与未来步骤奖励的精细回溯。

3. 实验与结果

基于 Qwen3.5-4B,仅使用 8.5K 条轨迹训练得到 ABSeeker,在多个长程搜索基准上取得显著性能:

基准 无上下文管理 有上下文管理
BrowseComp 37.3% 55.3%
BrowseComp-ZH 39.1% 52.9%
xbench-2505 77.0%
xbench-2510 46.0%
GAIA-text 81.6%

关键结论包括:

  • 在 4B 规模模型中达到最优性能,且超越多个 ~30B 规模的搜索智能体(如 Tongyi-DeepResearch、OpenSeeker)。
  • 仅在 BrowseComp 风格数据上训练,即可有效泛化至 xbench 与 GAIA,展现出强大的跨基准迁移能力。
  • 消融实验表明,ABC-SFT 与 ABC-GRPO 均持续优于对应的标准 SFT 与标准轨迹级 GRPO。
  • 奖励分布分析显示,失败轨迹中近 10% 的步骤实际包含高质量探索行为,验证了细粒度信用分配的必要性。

4. 主要贡献

  • 提出 ABC 框架:首次系统性地利用已验证答案反向恢复中间线索,构建固定、可解释的步骤级评估锚点,实现“在失败轨迹中奖励有效行为,在成功轨迹中抑制错误行为”。
  • 开发 ABC-SFT 与 ABC-GRPO:将细粒度步骤奖励分别集成到监督微调与强化学习中,提供密集的过程监督。
  • 实现 ABSeeker:以 4B 参数规模在多项长程搜索基准上取得领先性能,证明了答案回溯式信用分配对搜索智能体训练的高效性与可扩展性。

5. 未来方向

论文指出,后续研究可向两个方向拓展:一是将 ABC 框架扩展至更大参数量的骨干模型,验证其在更高容量下的增益;二是将该框架推广至其他可回溯分解为中间证据或子目标的长程智能体任务。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yijun Lu,Rui Ye,Jiajun Wang,Yuwen Du,Tian Jin,Songhua Liu,Siheng Chen

PDF URL: https://arxiv.org/pdf/2608.05102.pdf

Arxiv URL: https://arxiv.org/abs/2608.05102

Arxiv ID: 2608.05102

CoolPaper URL: https://papers.cool/arxiv/2608.05102

Published: 2026-08-07T01:53:26.717Z

Updated: 2026-08-07T01:53:26.717Z


2. ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

Abstract:Text-to-image (T2I) models can produce visually compelling images, yet they remain limited on open-world tasks that require complex semantic understanding, multi-step reasoning, and the integration of external world knowledge. Existing efforts introduce agent capabilities into image generation, but they either prescribe a fixed workflow or place only a subset of the open-world image generation process under agent control. Consequently, reasoning, tool invocation, and image generation are not coordinated by a single policy. We propose ToolArtist, a fully agentic image generation model obtained by post-training a Unified Multimodal Model (UMM). ToolArtist dynamically orchestrates reasoning, external tool use, and native image generation within one unified policy. During Supervised Fine-Tuning (SFT), we equip a teacher agent with search tools alongside an image-generation tool. We then convert the collected trajectories into a UMM compatible format, where the image-generation tool is concealed while the resulting generated images are retained. During Reinforcement Learning (RL), we develop an agentic RL infrastructure for UMMs and introduce Reason-Act-Draw GRPO (RAD-GRPO), which uses complementary intent and quality rewards to jointly optimize the model. Experiments show that placing the entire open-world image-generation process under an agent policy consistently outperforms approaches with fixed pipelines or only partially agent-controlled components. We release the training data and the complete post-training infrastructure.

中文摘要

摘要:文本到图像(T2I)模型可以生成视觉上引人注目的图像,但在需要复杂语义理解、多步骤推理以及整合外部世界知识的开放世界任务中仍然存在局限。现有的努力在图像生成中引入了智能体能力,但它们要么规定了固定的工作流程,要么仅将开放世界图像生成过程的一部分置于智能体控制之下。因此,推理、工具调用和图像生成并未由单一策略协调。我们提出了 ToolArtist,一种通过对统一多模态模型(UMM)进行后训练获得的完全智能体图像生成模型。ToolArtist 在一个统一的策略下动态协调推理、外部工具使用和原生图像生成。在监督微调(SFT)期间,我们为教师智能体配备了搜索工具以及图像生成工具。然后,我们将收集到的轨迹转换为 UMM 兼容格式,其中隐藏了图像生成工具,但保留了生成的图像。在强化学习(RL)期间,我们为 UMM 开发了智能体 RL 基础设施,并引入了 Reason-Act-Draw GRPO(RAD-GRPO),该方法使用互补的意图和质量奖励对模型进行联合优化。实验表明,将整个开放世界图像生成过程置于智能体策略下,始终优于具有固定管道或仅部分由智能体控制组件的方法。我们发布了训练数据和完整的后训练基础设施。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文旨在解决开放世界图像生成中现有方法在自主性与协调性方面的核心缺陷。具体而言,其针对的关键问题可归纳如下:

  • 封闭生成假设的失效
    传统文本到图像(T2I)模型假设生成所需的全部信息要么显式包含在用户指令中,要么已隐式存储于模型参数内。然而,在涉及长尾概念、严格事实约束或高度时效性知识的开放世界场景中,这一假设不再成立,模型常生成视觉上合理但事实上错误的图像。

  • 现有代理化范式的局部性局限
    当前引入代理能力的方法主要分为两类,但均存在根本性不足:

  1. 固定工作流范式:将提示理解、搜索、证据聚合与图像合成组织为预定义的刚性流水线,搜索与生成的顺序和角色被提前规定,缺乏灵活性。
  2. 提示优化代理范式:依赖搜索代理重写用户指令并生成优化后的提示,再将其传递给外部图像生成器。此时,代理策略在生成阶段即终止,图像合成被委托给独立的生成器。

在上述两种范式中,图像生成并非由模型自主选择和发起的动作,推理、工具调用与图像生成未能被单一策略统一协调。

  • 完全代理化图像生成的缺失
    论文指出,真正的开放世界图像生成需要模型自主完成完整的决策链条:从识别知识缺口,到选择与调用外部工具,再到整合检索到的多模态证据,最终原生地生成并可能迭代修正图像。现有工作尚未实现工具使用与图像生成作为同一策略下的自主行为。

为解决上述问题,论文提出 ToolArtist,通过对统一多模态模型(UMM)进行后训练,构建了一个完全代理化的图像生成模型。该模型将自主推理、外部工具调用(文本搜索与图像搜索)与原生视觉生成纳入统一的策略框架内,使图像生成本身成为代理策略的一部分,而非下游独立模块的任务。

Q: 有哪些相关研究?

该论文的相关研究主要围绕三个紧密关联的方向展开,具体梳理如下。

1. 统一多模态模型(Unified Multimodal Models, UMMs)

传统基于扩散模型或流模型的文本到图像生成器(如 PixArt、FLUX、Stable Diffusion 系列)在视觉质量上表现突出,但无法将推理、多模态观测与图像合成表达为同一策略下的动作。UMMs 通过将理解与生成纳入共享模型来解决这一局限:

  • Janus-Pro:分离视觉理解与生成的路径,同时保留共享的自回归骨干网络;
  • BLIP3-o:利用扩散变换器(Diffusion Transformer)生成语义图像特征;
  • BAGEL:通过大规模交错预训练,联合学习多模态理解、生成与编辑;
  • Emu3:将文本、图像与视频标记化为离散序列,完全基于 next-token prediction 进行统一建模,即
    pθ(x) = prod(j=1)^(L) pθ(x_j mid x(<j))
    其中序列 x 中的 token 可同时来自文本词表 V(text) 与视觉词表 V(visual) ;
  • Emu3.5:在 Emu3 的基础上扩展至交错的视觉-语言输入与输出,并通过后训练增强推理与生成能力。

ToolArtist 即基于 Emu3.5 进行后训练,将其原生文本-图像 token 策略转化为能够自主决定何时推理、搜索与绘制的开放世界代理。

2. 工具使用代理与代理化图像生成(Tool-Using Agents and Agentic Image Generation)

ReAct 范式确立了推理与环境动作交错交互的通用框架。在图像生成领域,相关研究沿此脉络发展,但在“代理性”的归属上存在关键分歧:

  • 检索增强生成:Re-imagen 等早期工作通过外部证据条件化图像合成;
  • 规划与工具编排:后续系统(如 Visual ChatGPT、Idea2Img、Genevolve、GenClaw、GenPilot 等)引入规划、迭代优化或多工具编排;
  • 结构化流水线代理:Unify-Agent 使用 UMM 执行预定义的提示理解、多模态证据搜索、基础重新描述与最终合成阶段,但生成环节仍属于工作流中的固定阶段;
  • 搜索-生成分离范式:GenSearcher 通过 SFT 与 RL 训练搜索代理执行多跳文本与视觉检索,随后将检索结果传递给独立的图像生成器;SearchGen 进一步指出搜索应根据生成器演化的知识边界选择性触发,以避免引入噪声。

上述工作的核心局限在于:图像生成要么是被预先规定的阶段,要么是在搜索代理完成后被委托给下游独立模块,而非由同一策略自主选择和发起。

3. 视觉生成的强化学习(Reinforcement Learning for Visual Generation)

  • GRPO:移除学习得到的 Critic 网络,通过采样输出组估计组相对优势(group-relative advantage),为 outcome-driven 的推理优化提供高效基础;
  • UniGRPO:将组相对优化扩展至统一视觉生成,联合优化单轮推理-生成过程;
  • Interleaved GRPO:研究针对多模态交错文本-图像输出的统一策略优化。

ToolArtist 提出的 RAD-GRPO 进一步扩展了这一方向,通过双重奖励(意图奖励与质量奖励)直接优化完整的代理化图像生成轨迹,将结果级反馈传播至推理、工具调用、证据利用与原生图像生成的全部环节。

Q: 论文如何解决这个问题?

论文通过提出 ToolArtist 框架来解决开放世界图像生成的协调性与自主性问题。该框架以统一多模态模型(UMM)为基座,采用完全代理化的范式,将推理、外部工具调用与原生图像生成统一于单一策略之下。具体解决方法可归纳为以下层面。

1. 核心范式:单一策略下的完全代理化生成

不同于预定义固定流水线或将生成委托给外部模型的方法,ToolArtist 将图像生成本身视为策略可自主选择和执行的动作。给定用户请求后,模型自主决定:

  • 何时进行推理以识别知识缺口;
  • 是否以及如何使用搜索工具获取外部证据;
  • 何时将累积的证据转化为生成意图并原生地绘制图像;
  • 是否基于已生成图像继续迭代修正。

这一过程由模型根据不断演化的多模态上下文动态控制,而非由外部工作流预设。

2. 模型基座:Emu3.5 统一多模态模型

ToolArtist 基于 Emu3.5 构建,该模型将文本与图像统一表示为离散 token,并通过自回归 next-token prediction 建模:

pθ(x) = prod(j=1)^(L) pθ(x_j mid x(<j))

其中序列 x 中的 token 可同时来自文本词表 V(text) 与视觉词表 V(visual) 。在此框架下,用户指令、推理痕迹与工具调用被表示为文本 token,而工具返回的参考图像以及模型生成的图像则被表示为视觉 token 片段。这使得推理、行动与绘图能够在同一自回归上下文中无缝衔接

3. 两阶段后训练策略

3.1 监督微调(SFT)

SFT 通过一个“采集-转换”流程建立基础代理能力,仅使用 7,132 条高质量轨迹。

教师代理 Rollout
首先,一个配备 TextSearch、ImageSearch 与外部图像生成工具的教师代理,针对用户请求执行多轮交互。该过程是交替式的:代理可自由穿插推理、搜索与生成,而非遵循静态的“先搜索后画图”顺序。搜索工具被增强以返回带来源摘要的稳定证据。

轨迹转换(Convert)
原始轨迹被转换为 UMM 兼容的训练样本:

  • 搜索返回的文本与图像保留在上下文中;
  • 关键的转换在于:隐藏外部图像生成工具。教师调用外部生成器的行为被重写为 UMM 自身的原生生成格式——即先输出一个视觉描述片段(visual-caption span),后接对应的图像视觉 token 片段(visual-token span)。

由此,教师的外部工具使用行为被内化为 UMM 自身可执行的策略动作。

SFT 目标函数
训练仅对策略生成的 token(推理与动作片段)进行监督,用户指令与环境观测被掩码排除:

L(SFT)(θ) = -E((xi,y_i)sim D{text{SFT Q4: 论文做了哪些实验? 论文在 WISEWorldGenBench-Humanities 两个基准上开展了系统评估,并辅以训练动态分析、消融实验与定性案例研究。 1. 评估基准 WISE WISE 评估文本到图像模型整合世界知识的能力,而非仅执行浅层词-像素对齐。该基准包含 1,000 条提示,覆盖 25 个子领域,归为三大类: - 文化常识(Cultural common sense) - 时空推理(Spatio-temporal reasoning) - 自然科学(Natural science) 论文报告六个类别得分:Cultural、Time、Space、Biology、Physics、Chemistry 及 Overall。官方 WiScore 采用 LLM-as-judge 协议,依据图像-文本一致性(权重 0.4)、真实性(0.3)与美学质量(0.3)进行评判。 WorldGenBench-Humanities 该基准面向推理驱动的世界知识图像生成,论文采用其人文社科划分(Humanities split),涵盖 244 个国家与地区的 732 条提示,按大洲组织。评估通过知识清单得分(Knowledge Checklist Score, KCS)进行:针对每条提示构建特定的知识检查清单,判断生成图像是否满足预期的语义得分点(如文化适配的服饰、地方建筑、地标、植被、海岸线或可辨认标签等)。最终得分为归一化的清单满足率。论文报告各大洲得分(AF、AN、AS、EU、NA、OC、SA)及其平均值。 2. 对比基线 实验将对比方法分为四类: | 类别 | 代表模型 | | —- | —- | | 前沿专有模型 | Nano Banana-Pro, Nano Banana | | 通用图像生成模型 | FLUX.1-schnell/dev, SD-XL, SD-3.5-medium/large, PixArt-Alpha, Playground-v2.5, LongCat-Image | | 统一多模态模型(UMMs) | Janus-Pro-1B/7B, VILA-u-7B-256, Emu3, Emu3.5, Hunyuan-Image-3.0, BLIP3o-8B, BAGEL, BAGEL+CoT | | 代理化图像生成模型 | Unify-Agent, GenSearcher-Qwen-Image | 3. 主要结果 WISE 上的表现 ToolArtist 在 WISE 上取得 0.79 的 Overall 得分,优于表中所有开源代理化图像生成基线(Unify-Agent 为 0.77,GenSearcher-Qwen-Image 为 0.77)。尽管最强的专有图像模型在部分类别(尤其是 Time 和 Space)仍保持领先,但 ToolArtist 在知识密集型的自然科学类别上表现突出: - Physics: 0.81 - Chemistry: 0.79 WorldGenBench-Humanities 上的表现 ToolArtist 取得了当前非专有模型中最高的平均 KCS 得分 22.10,显著领先于: - Qwen-Image(作为最强新评估开源基线):21.76 - Unify-Agent:15.58 - GenSearcher-Qwen-Image:13.66 在各大洲层面,ToolArtist 在非洲(AF)、南极洲(AN)和亚洲(AS)领先;Qwen-Image 在欧洲(EU)、北美洲(NA)和大洋洲(OC)领先;Unify-Agent 在南美洲(SA)领先。 4. 分析实验 4.1 RL 训练动态(RAD-GRPO) 论文追踪了 RAD-GRPO 训练过程中的两项关键指标: - 整体奖励:尽管在线搜索轨迹、Caption Reward 与 Image Reward 联合计算的原始奖励存在明显波动,但移动平均曲线呈总体上升趋势。训练初期(约第 10–20 步)奖励快速提升;中期在 0.37–0.40 区间波动;后期进一步上升至约 0.41。 - 策略熵:训练初期熵约为 12.03,随后逐渐下降并在后半段稳定于 11.87–11.91 之间。熵的平缓下降伴随奖励提升,表明策略逐步将概率质量集中于高奖励行为,且未出现熵坍缩。 4.2 源感知图像搜索摘要的消融 为验证图像搜索工具附加的 LLM 生成源网页摘要的作用,论文进行了消融实验: - 完整系统:WISE Overall 为 0.79 - 移除源感知摘要(w/o summary):WISE Overall 降至 0.61(下降 0.18) 其中 Biology 类别受损最严重(从 0.75 降至 0.25,下降 0.50),表明当参考图像需要与细粒度事实身份而非通用外观绑定时,源感知摘要至关重要。 4.3 定性案例对比 论文在 WorldGenBench-Humanities 上选取多个典型案例进行 checklist 级别的细粒度对比,包括: - 索科特拉岛龙血树脂采集(1955年):ToolArtist 的 KCS 为 0.625,显著优于 Unify-Agent(0.000)与 GenSearcher(0.250)。模型正确呈现了传统树脂采集工具、热带传统服饰、当地山羊、储存容器与海岸线等要素。 - 1889年伦敦白教堂区女工:KCS 0.600 vs. 对比方法的 0.300,正确呈现了鹅卵石街道、打补丁的工人阶级裙装、砖砌维多利亚联排公寓、铸铁煤气路灯、煤烟与 soot-darkened 建筑立面。 - 1891年安托法加斯塔硝石矿工1975年莫雷阿岛 noni 果实采摘1961年圣多明各蔗糖作坊等案例均显示 ToolArtist 在历史文化与地理 grounding 上的优势。 4.4 SFT 数据分布统计 论文分析了用于 SFT 的 7,132 条轨迹的统计特性: - 主题分布:涵盖 Geo/Architecture(18.9%)、Sci/Engineering(14.8%)、History(11.6%)、Music/Film(10.7%)、IP/Game(10.4%)等,显示数据多样性。 - 轨迹长度:输入 token 均值约 20.5k,中位数 20.2k,表明多为包含大量检索证据的长程多模态上下文。 - 工具调用:工具调用次数的均值与中位数均为 4.0,表明数据主要由多轮搜索-生成轨迹构成,而非单步图像提示。 Q5: 有什么可以进一步探索的点? 基于论文所呈现的方法与局限,以下几个方向具有进一步探索的价值: 1. 扩展工具集与外部环境交互的广度 当前 ToolArtist 仅配备了 TextSearchImageSearch 两类工具。在更复杂的开放世界任务中,可探索将工具集扩展至代码执行器(如 Python)、三维建模接口、矢量数据库或领域特定 API。通过引入多工具协同工具组合推理,模型有望处理涉及数值计算、结构化数据查询或物理仿真的生成请求。此外,现有搜索依赖外部检索系统,其结果质量与实时性难以保证,探索可学习的检索策略(如自适应检索阈值、来源可信度评估)将进一步提升证据的可靠性。 2. 强化学习阶段的信用分配与探索效率优化 RAD-GRPO 将轨迹级的优势信号 hat{A)i 均匀分配给所有策略生成的 token:
A_i = tilde{R_i - mean(R_b
(b=1)^B)}{std(Rb(b=1)^B) + varepsilon}
这种均匀分配在长程多轮交互中可能导致精细的信用分配(credit assignment)问题——即难以准确判断某一轮推理或某一工具调用对最终图像质量的具体贡献。未来可探索针对多轮代理轨迹的细粒度优势分解方法,或引入课程化训练(curriculum RL)以逐步增加交互轮次与任务难度,从而提升样本效率并降低在线交互的训练成本。 3. Scaling 训练数据的规模、多样性与语言覆盖 论文仅使用 7,132 条高质量轨迹完成 SFT,虽然已证明小规模高质量数据的有效性,但数据规模与主题覆盖仍存在上限。进一步探索可集中在: - 数据量扩展:通过更高效的教师代理 pipeline 或半自动过滤机制,将轨迹规模扩大一至两个数量级; - 多语言与跨文化扩展:当前基准主要覆盖英语语境下的世界知识,增加非英语文化、地域特异性知识及低资源语言数据,有助于检验模型的跨文化泛化能力; - 负例与失败轨迹的利用:当前数据主要包含成功轨迹,引入失败案例及其修正路径可能增强模型的自我纠错能力。 4. 推理效率与交互成本的优化 完全代理化范式带来了显著高于单次生成的推理延迟与 API 调用开销(平均 4 轮工具调用、约 20.5k 输入 token)。未来可探索: - 自适应终止机制:学习动态判断何时已获取足够证据、无需进一步搜索,从而避免冗余交互; - 模型蒸馏:将训练好的代理策略蒸馏为更轻量的单轮或少数几轮生成策略,在简单请求上快速回落(fast fallback); - 检索缓存与知识记忆:利用模型参数或外部记忆模块缓存高频知识,减少对重复搜索的依赖。 5. 安全对齐与错误信息传播风险 开放世界搜索可能引入过时、偏见或版权受限的内容,而模型对检索证据的过度依赖可能导致错误信息的视觉化传播。需进一步探索: - 来源感知的生成抑制:在策略中引入对检索来源可信度(source credibility)的显式建模,对低可信度证据降低生成权重; - 安全护栏的集成:在 RL 奖励中增加事实安全性、版权合规性与有害内容抑制等约束项,防止 reward hacking(如通过搜索规避内容审查); - 可解释性:使模型的推理链条(reasoning traces)不仅能指导生成,还能向用户提供证据来源与决策依据的可视化说明。 6. 向动态媒体与更复杂多模态输出的扩展 ToolArtist 基于 Emu3.5 的 next-token prediction 框架:
pθ(x) = prod(j=1)^(L) pθ(x_j mid x(<j))
该框架理论上支持视频与交错多模态序列。未来可探索将代理化生成从静态图像扩展至视频生成多页漫画交错的图文叙事,使模型能够在更长的时间轴上规划视觉内容,调用时序一致性相关的工具(如关键帧搜索、动作参考检索),实现真正意义上的长程多模态内容创作。 Q6: 总结一下论文的主要内容 该论文提出 ToolArtist,一种通过完全代理化(fully agentic)方式解决开放世界图像生成问题的统一多模态模型。以下从问题背景、方法框架、训练策略、实验验证与核心贡献五个方面进行总结。 1. 核心问题:开放世界图像生成的自主性缺失 传统文本到图像(T2I)模型假设所有生成信息均包含在用户指令 q 或模型参数内。然而,在涉及长尾概念、严格事实约束与时效性知识的开放世界场景中,这一假设失效,模型易产生事实上错误的图像。现有代理化方法存在两类局限: - 固定流水线范式:将搜索与生成组织为预定义阶段,缺乏灵活性; - 提示优化范式:由代理完成搜索后,将生成委托给独立的外部生成器,图像合成并非代理策略的自主动作。 因此,推理、工具调用与图像生成未被单一策略统一协调。 2. 方法框架:完全代理化的统一策略 ToolArtist 基于统一多模态模型 Emu3.5 构建,将文本与图像统一表示为离散 token,通过自回归 next-token prediction 建模:
pθ(x) = prod(j=1)^(L) pθ(x_j mid x(<j))
其中 x 为来自文本词表 V(text) 与视觉词表 V(visual) 的交错序列。 在该框架下,ToolArtist 被实例化为一个代理 Aθ = (πθ, T, W) ,其中 πθ 为 UMM 策略, T = TextSearch, ImageSearch 为工具集, W 为开放世界环境。策略在每一轮 t 基于多模态历史 H(t-1) 自主决定: - 推理与工具调用:产生推理片段 rt 并选择动作 a_t ∈ A(tools) ,调用搜索工具获取文本或视觉证据 ot ; - 原生图像生成:选择动作 a_t ∈ A(draw) ,由策略自身输出视觉描述片段 gt (visual-caption span)与图像 token 片段 v_t (visual-token span),即 a_t = (g_t, v_t) 。 生成图像保留在历史上下文中,代理可据此继续搜索、推理并迭代修正。图像生成是策略自由选择的动作,而非外部模块的任务。 3. 训练策略:SFT 初始化与 RAD-GRPO 强化优化 3.1 监督微调(SFT) SFT 数据合成分为两个阶段: - Rollout 阶段:教师代理自主交互,调用搜索工具与外部图像生成器完成多轮轨迹; - Convert 阶段:将轨迹转换为 UMM 兼容格式——隐藏外部图像生成工具,将其替换为 UMM 原生的 visual-caption 与 visual-token 片段,使教师的工具使用行为内化为模型自身的生成能力。 经筛选后保留 7,132 条高质量轨迹。SFT 目标仅对策略生成的 token(推理与动作片段)进行监督,掩码掉用户指令与环境观测:
L
(SFT)(θ) = -E((x_i,y_i)sim D_SFT)
(j=1)^(Li) M(i,j) log Pθ(u(i,j) mid u(i,<j))∑(j=1)^(Li) M(i,j)

其中 M(i,j) = I[u(i,j) ∈ Ti] 为策略支撑掩码。 3.2 Reason–Act–Draw GRPO(RAD-GRPO) 为突破 SFT 数据覆盖限制,论文提出 RAD-GRPO 在线优化完整策略,采用双重互补奖励: - 意图奖励 R_i^I :评估最终视觉描述 g(T_i) 是否准确、充分地将用户请求与获取证据转化为可执行的生成意图; - 质量奖励 R_i^Q :评估解码后的图像是否忠实于用户请求与最终描述,同时保持视觉质量(由忠实度、视觉正确性、文本准确性、美学四个维度加权构成)。 主奖励为二者的线性组合:
R_i = α R_i^I + (1-α) R_i^Q, quad α ∈
0,1

此外引入四种辅助信号:格式奖励、绘制信号(鼓励实际生成图像)、长度惩罚(抑制过长轨迹)与未绘制惩罚(防止策略退化为纯搜索模式)。组合后的最终奖励 Ri 用于计算组相对优势:
A_i = tilde{R_i - mean(R_b
(b=1)^B)}{std(Rb(b=1)^B) + varepsilon}
RAD-GRPO 目标函数为 token 归一化的 GRPO:
J(θ) = E(qsim D, {H_i)(i=1)^B sim π(θ_old)(·|q)}
(1) / (B) ∑
(i=1)^B (1) / (∑(j=1)^(L_i) M_i,j) ∑(j=1)^(Li) M(i,j) ( min( rho(i,j)(θ)A_i, clip(rho(i,j)(θ), 1-ε, 1+ε)Ai ) - β D^(KL)(i,j) )

$$

该目标将最终意图与图像质量的反馈联合传播至推理、工具调用与原生生成的全部 token,实现完整轨迹的端到端优化。

4. 实验验证

4.1 评估设置

  • WISE:1,000 条提示,评估文化常识、时空推理与自然科学,使用 LLM-as-judge 的 WiScore;
  • WorldGenBench-Humanities:732 条提示,覆盖 244 个国家/地区,使用知识清单得分(KCS)评估细粒度语义满足率。

4.2 主要结果

基准 ToolArtist 表现 关键对比
WISE Overall 0.79 优于 Unify-Agent (0.77) 与 GenSearcher (0.77);在 Physics (0.81) 与 Chemistry (0.79) 上表现突出
WorldGenBench-Humanities Avg. 22.10 显著领先于 Qwen-Image (21.76)、Unify-Agent (15.58) 与 GenSearcher (13.66),为非专有模型最优

4.3 关键分析

  • 消融实验:移除图像搜索的源感知摘要后,WISE Overall 从 0.79 降至 0.61,Biology 类别下降 0.50,表明来源摘要对于细粒度事实身份绑定至关重要;
  • 训练动态:RAD-GRPO 的整体奖励呈上升趋势,策略熵平缓下降,未出现熵坍缩;
  • 定性案例:在索科特拉岛树脂采集、1889 年伦敦白教堂等历史地理场景中,ToolArtist 在文化服饰、地方工具、地形与海岸 grounding 上显著优于对比方法。

5. 核心贡献

  • 完全代理化图像生成范式:首次将自主推理、外部工具利用与原生视觉生成统一于单一 UMM 策略,图像生成本身成为代理策略的自主动作;
  • UMM 后训练策略:设计了包含教师轨迹采集-转换的 SFT 与基于双重奖励的 RAD-GRPO 强化学习框架,仅 7k 轨迹即可激活复杂代理能力;
  • 开源资源:公开 7,132 条高质量 SFT 轨迹及完整的代理化 SFT 与 RL 训练基础设施,推动后续研究。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Jiahao Zhao,Xiaomin Yu,Zhongxiang Sun,Fengwei Teng,Chengwei Qin,Xiaobin Hu,Jun Xu,Shuicheng Yan

PDF URL: https://arxiv.org/pdf/2608.04436.pdf

Arxiv URL: https://arxiv.org/abs/2608.04436

Arxiv ID: 2608.04436

CoolPaper URL: https://papers.cool/arxiv/2608.04436

Published: 2026-08-07T01:53:41.936Z

Updated: 2026-08-07T01:53:41.936Z


3. Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

Abstract:Vision offers a critical axis for advancing foundation models, driving a shift towards natively unified multimodal pretraining. Despite this momentum, the design space and the fundamental mechanisms of how modalities interact during unified training remain underexplored. We provide empirical clarity through a systematic exploration of multimodal pretraining. Our controlled experiments on both synthetic and large-scale real-world datasets yield four key insights into the physics of multimodal pretraining: (i) Knowledge Flow: We disentangle how language, visual understanding, and visual generation transfer knowledge across modalities, revealing distinct patterns of influence and asymmetry; (ii) Synergy vs. Competition: We show that data “complexity” largely determines whether modalities are synergistic, identify architectural choices that promote synergy: such as shared attention and normalization with modality-specific feed-forward layers, and find that these behaviors generalize across different visual tokenizer designs; (iii) Early Unification: Unifying modalities from the very early stages and training them jointly is shown to be more effective than late alignment or sequential training. This process uncovers a vision laziness phenomenon, where delayed integration leads models to rely on language priors; (iv) Recipes: We derive efficient pretraining recipes that achieve strong generative performance using only 5% of the compute budget. These core findings are subsequently validated at scale by training multiple 13.5B MoE models on 2T tokens. We hope this study provides a principled foundation for understanding and scaling multimodal pretraining.

中文摘要

摘要:视觉为推进基础模型提供了一个关键的轴心,推动向原生统一的多模态预训练转变。尽管这种势头强劲,但在统一训练过程中模态之间如何相互作用的设计空间和基本机制仍未得到充分探索。我们通过对多模态预训练的系统性探索提供了实证上的清晰理解。在对合成数据集和大规模真实世界数据集进行的受控实验中,我们获得了关于多模态预训练物理机制的四个关键见解:(i) 知识流动:我们解析了语言、视觉理解和视觉生成如何在模态之间传递知识,揭示了不同的影响模式和不对称性;(ii) 协同与竞争:我们展示了数据“复杂性”在多大程度上决定模态是否具有协同作用,并确定了促进协同作用的架构选择,例如共享注意力机制和具有模态专用前馈层的规范化,并发现这些行为在不同的视觉标记器设计中具有普遍性;(iii) 早期统一:从一开始就统一模态并联合训练被证明比后期对齐或顺序训练更有效。这一过程揭示了一种视觉懒惰现象,即延迟整合会导致模型依赖语言先验;(iv) 配方:我们推导出高效的预训练配方,仅使用5%的计算预算即可实现强大的生成性能。这些核心发现随后通过在2T标记上训练多个13.5B MoE模型得到了规模化验证。我们希望这项研究为理解和扩展多模态预训练提供原则性基础。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在为**原生统一多模态预训练(natively unified multimodal pretraining)**建立系统性的原则基础,解决该领域在从单模态语言模型向同时支持视觉理解与视觉生成的统一范式演进过程中,所面临的核心设计空间与基础机制不明晰的问题。

具体而言,论文试图回答并解决以下四个层面的关键问题:

1. 模态知识流动的非对称性与概念依赖性

现有研究对语言、视觉理解与视觉生成之间的知识如何跨模态流动尚未达成共识,且结论常相互矛盾。论文系统性地解耦并量化了这三个能力之间的知识转移方向与强度,揭示其固有的非对称性(语言作为通用先验驱动视觉,理解驱动生成,但生成几乎不反向促进理解),以及这种转移的概念依赖性(低层视觉属性与高层结构概念呈现截然不同的迁移模式)。

2. 模态协同与竞争的调控机制

统一模型必须在单一参数空间中同时处理语言建模、视觉理解与视觉生成,但模态之间究竟是相互增强(synergy)还是相互争夺容量(competition)尚不明确。论文探究了数据与任务复杂度如何决定交互性质,并定位了Transformer架构中协同与竞争发生的具体位置,进而识别出促进协同的架构选择(如共享注意力与归一化层)与缓解竞争的策略(如模态专属的前馈网络)。

3. 早期统一的必要性与“视觉惰性”现象

业界普遍采用先预训练纯语言模型、再后期对齐视觉的范式(late alignment)。论文挑战了这一启发式做法,系统研究了视觉整合的时机与训练顺序,证明了早期联合训练的必要性:延迟视觉整合会持续损害原生视觉能力。论文进一步揭示了由此产生的**“视觉惰性”(vision laziness)**现象——当语言主干先硬化后,模型会过度依赖语言先验,导致视觉通路优化不足、激活减弱、注意力分配下降。

4. 可扩展的高效预训练配方

基于上述机理洞察,论文试图将发现转化为可操作的预训练策略。通过大规模数据混合比例的实证搜索,论文推导出高度非对称的数据配方(如语言:理解:生成 = 70:25:5),证明在极低的生成数据占比下,借助语言和理解的强先验仍可高效启动高质量的视觉生成能力,从而显著降低计算开销。这些配方结合架构设计与早期统一策略,在13.5B参数的MoE模型与2T token的大规模训练中得到了验证。

综上,该工作的核心贡献在于用受控的、自下而上的实验证据取代领域目前依赖的启发式直觉,为统一多模态基础模型的设计、训练时序安排与扩展策略提供了一套原则性的“物理规律”。

Q: 有哪些相关研究?

根据论文第7节(Related Work),相关研究主要分布在以下四个维度:

1. 统一多模态模型(Unified Models)

  • 从理解到生成的范式演进:早期研究将视觉仅作为文本模型的条件输入(Li et al., 2024a; Shukor et al., 2025; Wu et al., 2026),随后发展为能同时处理视觉理解与生成的统一架构(Zhang et al., 2025; Xiao et al., 2025; Geng et al., 2025; Xu et al., 2025; Xin et al., 2025 等)。
  • 离散 token 自回归建模:早期统一范式将图像量化为离散视觉 token 进行自回归建模(Oord et al., 2017; Razavi et al., 2019; Lee et al., 2022; Aghajanyan et al., 2022; Team, 2024; Lu et al., 2024; Wang et al., 2024b; Schlarmann et al., 2025)。
  • 连续-离散混合建模:近期如 Transfusion(Zhou et al., 2025; Shi et al., 2024; Tong et al., 2026a)等方法成功结合连续扩散机制与离散语言预测,建立了联合模态建模的高效标准。
  • 统一视觉表征空间:为桥接感知与生成,研究者在统一视觉表示方面取得进展(Tong et al., 2026b; Zheng et al., 2026; Han et al., 2026a; Li et al., 2025c; Team, 2026b; Yue et al., 2026; Jiao et al., 2025; Lu et al., 2025; Liu et al., 2026 等)。

2. 视觉集成策略(Vision Integration)

  • 晚期融合(Late-Fusion):主流方法是将预训练大语言模型与独立预训练视觉编码器通过适配器拼接,再进行后验微调(Li et al., 2023; Liu et al., 2023a; Alayrac et al., 2022; Qwen3-vl, 2025)。这种方法迫使丰富视觉信号适应已固化的语言空间,存在固有瓶颈。
  • 早期融合(Early-Fusion):为克服上述限制,领域逐渐转向从一开始训练就集成视觉,使视觉与语言表征共同演化,以实现更深层的原生视觉理解(K2.5, 2026; Llama4, 2025; Gemini, 2025; TML, 2026)。
  • 从理解扩展到生成:当前范式进一步将视觉生成作为核心目标,通过统一感知与创造使系统向世界模型演进(Tong et al., 2026a),从而支持交错式生成(Niu et al., 2025b; Yang et al., 2026a)及机器人等现实任务(Hu et al., 2026; Intelligence et al., 2026; Team, 2026a)。

3. 知识流动(Knowledge Flow)

  • 统一模型的生成优势:近期基准测试观察到,统一多模态模型在复杂生成任务上常超越专用文本到图像系统(Niu et al., 2025b; Li et al., 2026a; Wang et al., 2026a; Yang et al., 2026b; Wang et al., 2026f),暗示语言与理解能力对视觉生成具有根本性助益(Tong et al., 2025; Liao et al., 2025; Han et al., 2026b)。
  • 本文的系统性剖析:现有文献对模态间知识流动的结论常相互矛盾。本文通过大规模真实数据与严格控制的合成环境,形式化地揭示了能力转移的高度非对称性概念依赖性,并据此推导出非对称数据混合配方。

4. 统一模型的架构设计(Architecture Designs in Unified Models)

  • 参数共享的争论
  • 完全共享:部分方法使用单一 Transformer 处理所有模态(Zhou et al., 2025; Wu et al., 2025a; Ma et al., 2025; Chen et al., 2025b; Wu et al., 2024a)。
  • 部分解耦:另一些研究通过模态特定前馈网络(FFN)(Shi et al., 2024; Lin et al., 2024)或分离注意力块(Liang et al., 2024; Deng et al., 2025)强制隔离参数。
  • 高度解耦:在极端情况下,框架可保持几乎完全分离的网络,仅将 LLM 提取的文本特征作为条件信号传递给独立的扩散模型(Wu et al., 2025b; Chen et al., 2025c; Pan et al., 2025)。
  • 视觉编码器/解码器设计:视觉编解码器的选择仍是开放问题(Han et al., 2026a; Fan et al., 2025; Tong et al., 2026b; Team, 2026b; Liu et al., 2026)。本文系统比较了多种视觉表征设计(RAE、Raw Pixels、CLIP+VAE、AR),评估其对知识流动与协同的具体影响。

Q: 论文如何解决这个问题?

论文通过系统性、自下而上的受控实验设计取代启发式直觉,从合成环境到大规模真实数据逐步隔离变量,最终建立多模态预训练的“物理规律”。具体解决方法沿四个核心维度展开:

1. 解耦模态知识流动(Knowledge Flow)

为厘清语言、视觉理解与视觉生成之间的知识转移方向与强度,论文采用了固定预算下的混合比例实验严格控制的合成概念剔除实验相结合的策略:

  • 真实世界数据上的混合实验:固定某一模态的 token 预算(如 50B),系统性地在 0%, 20%, 40%, 60%, 80% 范围内改变另一模态的混入比例,观测下游性能变化。例如,固定视觉数据为 50B,逐步增加语言数据,测量视觉理解与生成指标的变化趋势。
  • 合成 CLEVR 控制研究:为排除真实世界数据中的混杂因素,论文扩展了 CLEVR 数据集,在颜色、形状、空间关系、尺寸、数量五个概念轴上,通过正则表达式和场景图元数据精确剔除特定概念。例如,在生成数据流中移除所有含“黄色”的样本,但保留理解数据流中的该概念,从而因果性地检验零样本跨模态迁移。进一步通过微调恢复曲线,测量潜在先验(latent prior)的存在性。

2. 区分协同与竞争(Synergy vs. Competition)

为确定模态间何时协同、何时竞争,论文从数据复杂度架构设计两个互补维度进行操控:

  • 任务复杂度梯度:在固定 100B token 预算下,对视觉流设置从“纯色背景 arrow 噪声 arrow OCR arrow 视频 arrow 真实自然图像”的七级复杂度递进;对语言流设置从“重复单字母 arrow 随机无意义字符串 arrow DCLM 真实文本”的三级递进。通过观测交叉模态指标(语言困惑度、视觉扩散损失)的变化,量化复杂度阈值如何使协同转为竞争。
  • Transformer 组件消融:将标准 Transformer 模块解构为 FFN、Attention、FinalNorm 三组参数,通过排列组合实现五种共享/解耦设置(dense、split_ffn、split_ffn_attn、split_ffn_norm、split_all)。在最大化协同效应的探测数据(简单语言 + 纯色背景)上训练,定位协同的来源(共享 Attention 与 Normalization)与竞争的来源(共享 FFN)。
  • 跨视觉分词器验证:将上述实验重复于四种视觉表征设计(RAE、Raw Pixels、CLIP + VAE、AR/UniTok),验证发现是否依赖于特定视觉 tokenization,确认协同是目标驱动与架构驱动的普遍现象。

3. 论证早期统一的必要性(Early Unification)

为挑战“先语言后视觉”的晚期对齐范式,论文在固定总计算预算(1T tokens)下系统操控视觉引入时机训练顺序

  • 统一时机对比:设置纯语言预热阶段为 0, 200, 400, 600, 800 B tokens,剩余预算用于 50/50 的统一训练,观测语言与视觉性能的权衡曲线。
  • 顺序训练 vs. 联合训练:在 1T token 预算与固定 50/25/25 模态配比下,枚举语言(L)、理解(U)、生成(G)的全部六种训练顺序,并对比严格顺序训练与带 12.5% 回放(replay)的顺序训练,以联合训练为基线。
  • “视觉惰性”的四轴机制测量:为解释晚期对齐为何损害视觉能力,论文在固定后续训练预算(200B unified tokens)下,对从 0, 200, 400, 600, 800 B 语言检查点初始化的模型进行机制层面的探测:
  • A:训练时 img_ffn 的 L2 激活范数;
  • B:图像包装器 token(<begin_of_img>, <end_of_img>)的嵌入 L2 范数;
  • C:推理时 img_ffn 的逐元素激活;
  • D:推理时图像 token 获得的注意力比例。 四组测量共同揭示了晚期对齐模型中视觉通路激活减弱、与语言流形整合不足、以及注意力从视觉 token 流失的系统规律。

4. 推导高效预训练配方(Recipes)

基于前述发现(知识流动非对称、架构解耦促进协同、早期统一必要),论文将洞察转化为可扩展的预训练策略:

  • 数据配比网格搜索:在 1T token 预算下执行三轴搜索(Fix MM:固定视觉内部比例,改变语言占比;Fix Lan:固定语言 50%,改变理解/生成比例;Next:固定语言 70%,微调视觉内部比例)。搜索空间验证了理解对生成的强先验作用,发现视觉生成仅需极少数据即可达到高性能。
  • 大规模受控验证:将最优非对称配比(L70/U25/G5)与 MoE 架构(共享 Attention/Norm,模态专属 FFN/专家)及早期统一结合,训练 13.5B 参数 MoE 模型(每 token 激活 1.5B)2T tokens。通过单变量控制比较(Balanced Recipe vs. Asymmetric、Dense vs. MoE、Late-Fusion vs. Early-Fusion),在语言、视觉理解与生成三个维度同时验证了前述原则的可扩展性。

综上,论文的解决路径可概括为:通过合成数据实现因果隔离,通过真实数据实现规模泛化,通过架构消融定位机制,通过机制探测解释现象,最终通过大规模受控训练验证配方。

Q: 论文做了哪些实验?

论文围绕多模态预训练的底层机制,设计并执行了从受控合成环境到大规模真实数据、从小规模消融到 13.5B 参数 MoE 模型验证的系统性实验。主要实验可归纳为以下五个板块:

1. 基础实验设置(Experimental Setup)

  • 训练协议:默认采用 1.5B 参数的 Llama-3 风格 Transformer(16 层、隐藏维度 2048、GQA),基于 Transfusion 框架统一离散文本预测与连续流匹配。实验覆盖四种视觉 tokenization 方案:
  • RAE(默认):SigLIP-2 编码 + 表示自编码器解码;
  • Raw Pixels:14×14 卷积 patchify,无预训练编解码器;
  • CLIP + VAE:SigLIP-2 用于理解,SD3 VAE 用于生成;
  • AR (UniTok):离散残差量化码本的自回归建模。
  • 评估协议
  • 语言:11 个下游任务平均准确率(ARC、BoolQ、CoQA、HellaSwag 等)及 DCLM/C4 验证困惑度;
  • 视觉理解:16 个 VQA 基准,分 General、Knowledge、OCR & Chart、Vision-Centric 四类;
  • 视觉生成:GenEval、DPG-Bench、短/中/长文本 CLIP 相似度、保留扩散损失。

2. 模态知识流动实验(Knowledge Flow)

2.1 真实世界数据上的混合比例消融(§3.1)

在固定总预算(如 50B)的前提下,通过系统改变某一模态的混入比例( 0%, 20%, 40%, 60%, 80% ),观测对另一模态的因果影响:

  • 语言 arrow 视觉:固定 50B 视觉数据,增加语言 token。观测语言比例提升对视觉理解与生成(含无条件/有条件生成)指标的单调影响。
  • 视觉理解 arrow 语言/生成:固定 50B 语言或生成数据,增加视觉理解 token。观测语言准确率、困惑度及生成指标(DPG、GenEval、CLIP-Sim、扩散损失)的变化。
  • 视觉生成 arrow 语言/理解:固定 50B 语言或理解数据,增加视觉生成 token。语言侧从 scratch 训练;理解侧从 50B 语言预训练模型初始化,随后微调 Cambrian-VQA 评估。

2.2 合成 CLEVR 概念剔除实验(§3.2)

为排除真实数据混杂因素,构建严格控制的合成环境:

  • 数据构建:扩展 CLEVR,覆盖颜色、形状、空间关系、尺寸、数量五个概念轴。对每个目标概念(如 yellow、sphere、front-left、large、4+),在某一模态流(生成或理解)中通过正则与场景图元数据完全剔除该概念,另一模态保留。
  • 零样本概念转移(§3.2.2)
  • 理解 arrow 生成:生成流剔除概念,评估模型在生成提示中零样本渲染该概念的能力(VLM-judge 自动评分)。
  • 生成 arrow 理解:理解流(caption + VQA)剔除概念,评估模型在 VQA 中零样本回答该概念的能力。
  • 设置三组对照:baseline(双模态均见)、held-out(单模态剔除)、control(双模态均剔除)。
  • 潜在先验与恢复曲线(§3.2.3):对零样本转移失败的低层概念(颜色、形状),从消融检查点出发,用含该概念的混合数据微调 2000 步,每 200 步评估恢复轨迹,对比“有先验”与“无先验”控制组的面积差异。

3. 协同与竞争机制实验(Synergy vs. Competition)

3.1 任务复杂度梯度实验(§4.1)

固定 100B token 预算(50/50 双模态),系统改变单模态数据复杂度,观测交叉模态指标:

  • 视觉复杂度递进(视觉 arrow 语言):语言侧固定 DCLM,视觉侧从简单到复杂替换为:纯色背景 arrow 模式噪声 arrow 随机噪声 arrow 文本渲染 arrow OCR arrow 视频 arrow SSTK 真实图像。观测指标:语言困惑度( Delta PPL)。
  • 语言复杂度递进(语言 arrow 视觉):视觉侧固定 SSTK,语言侧替换为:简单重复字母 arrow 随机无意义字符串 arrow DCLM 真实文本。观测指标:视觉扩散损失( Delta diffusion loss)。

3.2 Transformer 参数共享消融(§4.2)

在最大化协同效应的探测数据(简单语言 + 纯色背景)上,对 100B token 预算的模型进行架构解耦:

  • dense:全共享(FFN + Attention + FinalNorm);
  • split_ffn:仅 FFN 模态分离,Attention 与 FinalNorm 共享;
  • split_ffn_attn:FFN 与 Attention 分离,仅 FinalNorm 共享;
  • split_ffn_norm:FFN 与 FinalNorm 分离,Attention 共享;
  • split_all:三者全分离。 对比各配置相对单模态基线的语言困惑度与视觉扩散损失变化。

3.3 跨视觉编码器泛化验证(§4.3)

将上述 split_ffn 协议复现于四种视觉 tokenization(RAE、Raw Pixels、CLIP + VAE、AR),使用纯色背景(测 Delta PPL)与简单语言(测相对扩散损失变化率)作为统一探针,验证协同效应是否依赖特定视觉表征。

4. 早期统一时序实验(Early Unification)

4.1 统一时机对比(§5.1)

固定总预算 1T token,改变纯语言预热阶段长度:在 0, 200, 400, 600, 800 B 语言 token 后引入视觉数据,剩余预算以 50/50 语言/视觉(理解与生成分半)统一训练。观测语言准确率/困惑度及全部视觉理解、生成指标随预热延长的变化。

4.2 训练顺序与回放机制(§5.2)

固定 1T token 与 50/25/25(语言/理解/生成)配比,枚举六种离散顺序训练方案(L arrow U arrow G、L arrow G arrow U、U arrow L arrow G、U arrow G arrow L、G arrow L arrow U、G arrow U arrow L),每种设置分别执行:

  • 严格顺序训练;
  • 带 12.5% 历史模态回放的顺序训练(缓解灾难性遗忘)。 以联合训练(joint training)为

Q: 有什么可以进一步探索的点?

基于论文的系统探索与附录 A 中明确提及的局限,以下从模态扩展、规模推演、机理深化、架构优化、评估体系五个维度梳理可进一步探索的研究方向:

1. 动态与连续模态的扩展

当前研究主要局限于文本与静态图像。向动态模态(视频、音频)乃至传感器流扩展时,以下问题尚待验证:

  • 时间维度对协同/竞争阈值的影响:视频引入额外的时间复杂性,可能改变任务复杂度与模态竞争的临界点(§4.1 中“简单视觉任务促进语言”的结论是否仍成立?)。
  • 时序推理所需的架构解耦:视频理解与生成的联合训练是否需要针对时间轴设计额外的参数隔离机制,抑或现有的 FFN 解耦 + 共享注意力范式可直接迁移。
  • 世界模型属性的涌现:论文推测统一预训练可导向世界模型(world models),视频作为物理动态的自然载体,是检验该推论的关键场景。

2. 极端规模下的涌现行为

论文的规模化验证止于 13.5B 参数 / 2T tokens,而前沿模型正向 1T 参数以上推进。在此区间内存在若干开放问题:

  • 双向知识流动的可能性:当前观测到生成对理解的反向转移极弱(§3.1.3, §3.2.2)。当模型容量极大时,生成任务是否可能充当内部世界模拟器,从而涌现出生成 arrow 理解的强反向流动,打破现有的非对称性?
  • 协同-竞争相移:随着参数量增长,模态从竞争转向协同的“复杂度阈值”可能发生系统性偏移,需要重新标定数据混合比例与架构解耦策略。

3. 概念依赖性的理论解释与泛化

合成实验(§3.2)揭示了低层属性(颜色、形状)与高层结构(关系、数量)在跨模态迁移中的本质差异,但其深层机制仍待解释:

  • 表征几何的差异:为何理解学到的判别特征对生成无用,而生成学到的像素级分布却可加速理解?需从表征流形(representation manifolds)与梯度传播路径角度给出形式化分析。
  • 概念层级图谱:建立一个系统性的概念分类学,预测任意给定视觉概念在理解 arrow 生成之间的可迁移性,从而指导课程学习(curriculum learning)设计。

4. “视觉惰性”的缓解与逆向干预

论文发现晚期对齐导致视觉通路激活衰减(§5.3),但仅通过“早期统一”这一单一手段预防。未来可探索:

  • 对已训练 LLM 的视觉再激活:若必须基于现成 LLM 构建多模态系统,是否存在参数外科手术(如低秩扰动、专家增广)或优化器层面的重启策略,可逆转视觉惰性?
  • 视觉优先的课程设计:人类发育过程中视觉早于语言获得(§5.2)。实验显示“视觉优先”顺序训练(G arrow U arrow L)仍不及联合训练,但是否存在更细粒度的交替课程(如高频视觉脉冲注入),可在不牺牲语言能力的前提下逼近联合训练效果?

5. 架构与训练策略的精细化

  • MoE 路由的动态模态自适应:论文采用固定 2 个模态专属专家 + 14 个共享专家的静态配置(§6.2)。可探索动态路由,使网络根据输入样本的模态复杂度与概念类型自适应决定专家激活模式。
  • 归一化层与注意力机制的进一步解耦:实验表明共享 Attention 和 FinalNorm 对协同至关重要(§4.2),但未深入探讨 QK-Norm、RoPE 等组件的模态特异性需求。
  • 生成目标函数的统一:论文对比了扩散(流匹配)与自回归(UniTok)两种视觉生成范式,但未系统回答:不同生成目标(如 x_0 -prediction vs. v -prediction vs. 离散 next-token)如何影响跨模态知识压缩效率?

6. 数据混合与计算分配的理论化

  • 非对称配方的泛化边界:70/25/5 的配比在 2T 规模上有效(§6.1),但最优比例是否随总计算量 C 、模型大小 N 、数据分布 D 变化?需要建立多模态缩放律(multimodal scaling laws)以预测不同预算下的帕累托最优配比。
  • 生成数据的“质量-数量”权衡:既然极少量的高质量生成数据即可启动视觉生成能力,是否可用合成-真实混合课程化生成难度进一步压缩对真实图像的需求?

7. 评估方法论与基准建设

  • 细粒度视觉缺陷探测:现有 VQA 基准难以区分“真正视觉理解”与“语言先验捷径”(§5.3)。需构建专门探测视觉惰性的诊断工具,如要求模型在文本提示与图像内容冲突时进行裁决(forced choice)。
  • 连续模态的统一评估:随着模型支持视频、音频、3D 输出,需开发能够同时评测跨模态理解、生成、编辑与物理一致性的综合基准

Q: 总结一下论文的主要内容

该研究系统性地探索了原生统一多模态预训练(natively unified multimodal pretraining)的基础物理机制,旨在为同时支持视觉理解、视觉生成与语言建模的统一模型建立超越启发式的原则性基础。通过受控的合成环境实验与大规模真实数据训练,论文揭示了以下核心内容:

1. 研究背景与核心问题

当前多模态模型正从“晚期对齐预训练语言模型与视觉编码器”转向“从一开始就联合训练视觉与语言”。然而,这一统一范式的设计空间——包括模态间知识如何流动、参数如何共享、视觉何时引入——仍缺乏系统性的机理解释。该工作通过严格的变量控制实验,试图回答这些基础问题。

2. 四大核心发现

(一)知识流动:高度不对称且概念依赖

通过固定预算下的模态混合比例实验与合成 CLEVR 概念剔除实验,论文揭示了跨模态能力转移的严格规律:

  • 语言是通用先验:增加语言数据能单调提升所有视觉理解与生成指标。
  • 视觉理解驱动生成:视觉理解数据对生成任务具有强转移效应,能显著降低扩散损失并提升生成质量。
  • 生成几乎无反向转移:增加视觉生成数据对语言与视觉理解能力仅产生中性波动,无显著正向或负向影响。
  • 概念依赖性:在严格剔除特定概念的 CLEVR 环境中,低层视觉属性(颜色、形状)在理解与生成之间严格无法实现零样本转移;而高层结构概念(空间关系、尺寸、数量)可从理解零样本转移至生成,反向则几乎失败。不过,生成任务学到的像素级潜在先验(latent prior)能通过微调显著加速后续低层概念的理解学习。

(二)协同与竞争:由数据复杂度与架构共同决定

论文发现模态间同时存在协同(synergy)与竞争(competition)两种力量,其主导因素可被精确调控:

  • 任务复杂度的阈值效应:当视觉任务极其简单(如纯色背景、噪声)时,联合训练反而能提升语言困惑度;而当视觉任务升级为真实图像或视频时,模态间转为竞争,导致语言性能下降。对称地,极简语言数据对视觉生成的协同增益最大。
  • 架构定位:通过解构 Transformer 模块,论文证明**共享注意力(Attention)与归一化(Normalization)是协同的来源(允许模态间相互语境化),而分离前馈网络(FFN)**是缓解竞争的关键(避免参数空间冲突)。完全共享(dense)导致严重性能劣化,完全分离则退化为单模态基线。
  • 跨 tokenizer 泛化:上述协同效应在 RAE、Raw Pixels、CLIP + VAE 与自回归(UniTok)四种视觉表征方案中一致成立,表明其不依赖于特定的视觉分词器设计。

(三)早期统一:训练时序的机械必要性

论文挑战了“先预训练语言、再对齐视觉”的主流范式:

  • 视觉引入时机:在固定 1T token 总预算下,延长纯语言预热阶段虽能轻微提升语言指标,但会系统性、单调地损害几乎所有视觉理解与生成能力。
  • 顺序训练无效:无论采用何种模态顺序(如语言 arrow 理解 arrow 生成),离散的课程式训练均显著劣于同步联合训练;即使引入 12.5% 的数据回放(replay)缓解灾难性遗忘,仍无法匹敌联合基线。
  • “视觉惰性”(Vision Laziness)机制:为解释上述现象,论文从四个独立维度进行机制探测,发现晚期对齐模型的视觉 FFN 激活强度衰减、图像包装器 token 嵌入范数收缩、推理时视觉 FFN 输出幅度降低、且注意力从图像 token 向文本上下文流失。这表明预训练语言主干硬化后,模型会过度依赖语言先验“走捷径”,而非真正优化视觉通路。

(四)高效预训练配方:非对称数据混合

基于知识流动的不对称性,论文推导出计算高效的预训练配方:

  • 数据配比:通过 1T token 规模的网格搜索,发现最优配比并非均等。当采用 Language 70% / Visual Understanding 25% / Visual Generation 5% 时,模型在保持语言与理解性能的同时,生成质量(GenEval、DPG、CLIP-Sim)达到甚至超越平衡配比。
  • 大规模验证:将非对称配方与 MoE 架构(共享注意力/归一化,模态专属专家 FFN)及早期联合训练结合,训练了 13.5B 参数的 MoE 模型(每 token 激活 1.5B)2T tokens。单变量控制实验证实:非对称配方优于平衡配方,MoE 优于 Dense 模型,早期统一优于晚期对齐。

3. 结论与意义

该研究将统一多模态预训练从依赖直觉的“炼金术”推向基于证据的“物理学”。其核心结论表明:强大的视觉生成能力可以通过早期联合训练架构上的注意力共享与 FFN 解耦、以及极度倾斜向语言与理解的数据配比来高效引导,无需耗费大量生成专用计算资源。这些原则为构建支持任意输入/输出模态的下一代基础模型提供了可扩展的蓝图。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Junlin Han,Shengbang Tong,David Fan,Minghao Chen,Philip Torr,Filippos Kokkinos,Mike Lewis

PDF URL: https://arxiv.org/pdf/2608.05000.pdf

Arxiv URL: https://arxiv.org/abs/2608.05000

Arxiv ID: 2608.05000

CoolPaper URL: https://papers.cool/arxiv/2608.05000

Published: 2026-08-07T01:53:50.286Z

Updated: 2026-08-07T01:53:50.286Z


4. The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

Abstract:Personalized LLMs with persistent memory are increasingly deployed, yet the faithfulness of their user models remains unexamined. We study over-inference (OI): the phenomenon where LLMs fabricate user attributes beyond what evidence supports. We introduce MirageBench, comprising 150 personas balanced across stereotypical, counter-stereotypical, and neutral profiles, 6 personalization tasks spanning an ``imagination gradient’’, a four-way faithfulness taxonomy operationalized by an independent judge (validated against a blind human annotator on 400 claims: Cohen’s kappa = 0.863 four-class, kappa = 0.900 binary), and a leaderboard of 12 models across 7 families on 143616 judged claims. We find that over-inference is pervasive: every one of the 12 models over-infers 35%—49% of its claims (cross-model mean 41.6%; claim-weighted 41.8%), with no model in this evaluation escaping it. Most strikingly, we surface a Self-Monitoring Inversion: at the model-selection level, models’ self-assessed OI is negatively rank-correlated with their judge-measured OI (rho = -0.60, p = 0.044; exploratory, wide bootstrap CI [-0.90, +0.06], n = 12). The models that report the least over-inference tend to be flagged as fabricating the most, so self-reported confidence is a misleading signal for comparing models, even though within a single model self-audit still ranks that model’s own claims moderately well (AUROC 0.58—0.83). We further show that OI is task-dependent (27%—59%) and that, in a multi-turn pilot, inferred attributes accumulate approximately linearly with little revision. MirageBench positions external verification, rather than model self-report, as a more reliable foundation for trustworthy personalization.

中文摘要

摘要:具有持久记忆的个性化大型语言模型(LLM)正在越来越多地部署,但其用户模型的真实性仍未得到检验。我们研究了过度推断(OI)现象:即LLM在没有证据支持的情况下虚构用户属性。我们引入了MirageBench,包括150个人物角色,这些角色在刻板印象型、反刻板型和中性型之间平衡,涵盖6个跨“想象梯度”的个性化任务,以及一个由独立评审员操作化的四类真实度分类法(在400条声明上与盲人类标注者验证后:Cohen’s kappa = 四类0.863,二分类0.900),并提供了一个排行榜,涵盖7个模型家族的12个模型,共评判143616条声明。我们发现过度推断普遍存在:12个模型的每一个都有35%–49%的声明出现过度推断(跨模型平均41.6%;按声明加权41.8%),在此次评估中没有模型幸免。最显著的是,我们发现了“自我监控反转”现象:在模型选择层面上,模型自评的过度推断与评审员测量的过度推断呈负相关(rho = -0.60,p = 0.044;探索性分析,宽自助法置信区间[-0.90,+0.06],n = 12)。报告过度推断最少的模型往往被标记为虚构行为最多,因此自我报告的信心是比较模型的误导信号,即使在单一模型内部,自我审计仍能对该模型自身声明进行中等水平的排序(AUROC 0.58–0.83)。我们进一步表明,过度推断依赖任务(27%–59%),并且在一次多轮试验中,推断属性几乎线性累积,修改很少。MirageBench强调,将外部验证而非模型自我报告作为可靠的可信个性化基础更为稳妥。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文试图解决个性化大语言模型(LLM)在构建和维护用户画像时的忠实性(faithfulness)问题,核心聚焦于**过度推断(Over-Inference, OI)**现象的系统性测量、机制理解与评估。

具体而言,论文试图回答以下几个层面的问题:

  1. 过度推断的普遍性与程度
  • 当用户仅提供极少量的真实信息(如3条事实)时,个性化LLM在生成个性化内容时,会在多大程度上捏造或推测超出证据支持范围的用户属性?
  • 这种“幻觉式”用户画像构建是否广泛存在于当前主流模型中?
  1. 自我监控的可靠性
  • LLM是否能够通过自我审计(self-audit)准确识别自己产生的过度推断?
  • 模型自我报告的“安全性”是否可以作为跨模型比较的可靠信号?
  1. 任务需求对过度推断的调制作用
  • 不同个性化任务(如撰写约会简历、描述公寓、推荐礼物等)对不可观测属性的依赖程度不同,这种“可证实性梯度”(groundability gradient)如何影响过度推断的发生率?
  1. 多轮交互中的记忆累积与污染
  • 在持续的多轮对话中,模型是否会将未经验证的推断持续累积到长期记忆中?
  • 这些错误推断是否会被后续修正,还是会作为“静默记忆污染”持续存在?

简言之,该论文试图揭示:当前基于持久记忆的个性化LLM系统,其“了解用户”的能力在多大程度上是真实的记忆,又有多少是基于刻板印象和纯粹编造的幻觉;以及依赖模型自我评估来保障个性化安全性为何是不可靠的。

Q: 有哪些相关研究?

根据论文第2–3页的 Related Work 章节,相关研究可归纳为以下三个主要方向:

1. 个性化记忆系统与基准测试

该方向关注如何让LLM在跨会话场景中存储、检索和应用用户信息,并评估其记忆能力。

  • 商业与开源记忆系统:包括 OpenAI 的 ChatGPT 记忆功能(OpenAI 2024b)、Mem0(Chhikara et al. 2025)、MemGPT(Packer et al. 2023)以及 GRAVITY(Sun et al. 2026a)、AdaMem(Yan et al. 2026)、Memoria(Sarin et al. 2025)等框架。
  • 记忆能力基准测试:如 PersonaMemv2(Jiang et al. 2025b)、Perma(Liu et al. 2026)、CRAG(Yang et al. 2024)、LongMemEval(Wu et al. 202

Authors: Yushi Sun,Yanjie Zhang,Rui Sheng

PDF URL: https://arxiv.org/pdf/2608.04570.pdf

Arxiv URL: https://arxiv.org/abs/2608.04570

Arxiv ID: 2608.04570

CoolPaper URL: https://papers.cool/arxiv/2608.04570

Published: 2026-08-07T01:54:01.368Z

Updated: 2026-08-07T01:54:01.368Z


5. OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

Abstract:LLM agents are increasingly applied to open-ended everyday requests that span work, study, and life. These tasks are long-horizon, cross-environment, and multimodal, forcing the agent to preserve goals and constraints across many steps while navigating heterogeneous tools and attachments. While prior work has addressed individual failure modes such as goals drift, states loss, and context overflow, whether a single harness can manage them jointly and remain effective across backends has received less study. We present OneDayAgent, a long-horizon harness for autonomous agents. OneDayAgent turns an open-ended request into a managed execution process that decomposes tasks into bounded subtasks, maintains execution memory under context pressure, and verifies and repairs the final deliverable. We evaluate OneDayAgent on AgentIF-OneDay across 104 tasks. With the GLM-5.2 backend, OneDayAgent sets a new state of the art with an overall score of 0.821. The same harness runs across five backend LLMs from three model families, indicating the harness generalizes across backends without tuning, even as different models induce distinct execution styles under the same workflow.

中文摘要

摘要:LLM 代理正越来越多地被应用于涵盖工作、学习和生活的开放式日常请求。这些任务具有长时间跨度、跨环境和多模态的特点,迫使代理在使用异构工具和附件的同时,在多个步骤中保持目标和约束。虽然以往的研究已经解决了诸如目标漂移、状态丢失和上下文溢出等单一失败模式,但是否有一种单一机制能够联合管理这些问题并在不同后端中保持有效却研究较少。我们提出了 OneDayAgent,一种用于自主代理的长时间跨度机制。OneDayAgent 将开放式请求转化为可管理的执行过程,将任务分解为有限的子任务,在上下文压力下维护执行记忆,并验证和修复最终交付物。我们在 AgentIF-OneDay 的 104 个任务上评估了 OneDayAgent。在 GLM-5.2 后端下,OneDayAgent 以总体得分 0.821 创下新纪录。相同的机制可在来自三个模型家族的五个后端 LLM 上运行,这表明该机制能够在不同后端之间通用,无需调整,即使不同模型在相同工作流下呈现出不同的执行风格。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文针对长程开放式日常任务中的自主智能体执行可靠性问题,提出一个统一的执行框架 OneDayAgent,以解决现有方法在应对复杂日常请求时无法联合治理的多重失效模式。

具体而言,论文试图解决以下核心问题:

1. 长程日常任务带来的三重执行挑战

现实场景中,用户提出的开放式日常请求(涵盖工作、学习与生活)具有**长程(long-horizon)、跨环境(cross-environment)与多模态(multimodal)**特征。这些特征导致智能体在持续数分钟至数小时的执行过程中面临:

  • 目标漂移(Goal Drift):早期约束与隐含要求在多步推理后被遗忘,最终交付物偏离原始意图。
  • 状态丢失与跨环境转移失败(State Loss & Transfer Failures):在网页、本地文件、代码执行等异构环境间切换时,中间证据或工作状态无法有效传递,导致后续步骤重复劳动或遗漏已获取的信息。
  • 上下文溢出(Context Overflow):随着轨迹延长,原始观察、工具返回结果与中间历史不断累积,最终超出后端大语言模型的可用上下文预算,造成决策质量下降或执行中断。

2. 现有研究的碎片化局限

此前的研究通常仅针对上述某一种失效模式进行优化,例如通过推理脚手架缓解目标漂移、通过反馈循环进行修订、或通过记忆机制管理上下文。然而,这些失效模式在真实执行中会相互影响并叠加(例如上下文压力会加剧目标漂移,状态丢失会放大修复难度),孤立地修复单一环节不足以保障长程任务的最终交付质量。此外,现有工作对“同一套执行框架能否在不针对特定后端调参的情况下,稳定迁移到不同模型家族”的研究也较为有限。

3. 本文的解决思路

为联合应对上述问题,论文提出 OneDayAgent,一个面向长程自主智能体的执行框架(harness),其核心设计包括:

  • 任务分解(Task Decomposition):将过载的开放式请求拆分为有界的、可顺序执行的子任务,使每一步只需关注局部目标,同时由框架保留全局意图。
  • 执行记忆(Execution Memory):通过摘要截断、子任务状态传递与自动上下文压缩,在上下文压力环境下保留任务级关键状态,并丢弃低价值的低层交互痕迹。
  • 全局验证与修复(Global Verification and Repair):在所有子任务完成后,对最终交付物进行面向原始请求的全局合规性检查;若发现缺陷,则触发针对性的修复循环,而非重启整个流程。

实验表明,该框架在 AgentIF-OneDay 基准上取得了新的最优成绩(GLM-5.2 后端总体得分 0.821),且同一套框架无需后端专属调参即可稳定运行于来自三个模型家族的五种不同后端大语言模型上。

Q: 有哪些相关研究?

论文在第4节(Related Work)中系统梳理了相关研究,主要围绕日常数字任务的通用智能体长程智能体执行框架两大主线展开。具体可归纳为以下类别:

1. 面向日常数字任务的通用智能体

这类研究将大语言模型从文本生成扩展为能够推理意图、调用工具并反馈环境的问题求解系统。

  • 基础方法:ReAct
    8
    提出了交错推理与行动(reasoning-acting)的范式;Reflexion
    12
    与 Self-Refine
    13
    引入基于反馈的迭代修订;AutoGen
    31
    则探索多智能体对话工作流。
  • 专用智能体系统
  • 网页与信息检索:WebSailor-V2
    32
    、WebResearcher
    37
  • 计算机使用:Agent S2
    33
  • 软件工程:AlphaEvolve
    34
    、ContextCov
    35
    、SEMAG
    36
  • 深度研究:Marco DeepResearch
    14
    、MiroThinker
    38
  • 机器学习研究执行:ForeAgent
    39
  • 基于训练的改进:AgentRL
    40
    、Temp-R1
    41
  • 评测环境:WebArena
    11
    、WebChoreArena
    42
    (网页交互);OSWorld2.0
    43
    、WindowsWorld
    44
    、MobileWorld
    45
    (桌面/移动端);SWE-Bench Pro
    46
    、DeepSWE
    47
    (软件工程);BrowseComp
    48
    、DeepResearch Bench
    49
    、 τ^2 -Bench
    50
    及专家级学术基准
    51
    (浏览、研究与对话)。OneDayAgent 则遵循 AgentIF-OneDay
    6
    ,面向横跨工作、生活与学习的日常请求。

2. 长程智能体执行的框架(Harness)

随着任务时长从分钟级扩展到小时级,执行框架(运行时与状态管理基质)成为研究重点。

  • 长程与跨环境基准:Tool Decathlon
    54
    、LifeSim
    55
    、AgencyBench
    56
    、OdysseyArena
    57
    、WeaveBench
    58
    、Workspace-Bench
    59
    、Terminal-Bench
    60
    ;以及面向可验证约束
    61
    、交互式真实工作流
    62
    、大规模工具生态
    63
    、多语言场景
    64
    与战略决策
    65
    的评测。
  • 框架作为运行时基质:AI Harness Engineering
    66
    与 Agent-diff
    67
    将框架视为基础模型软件智能体的运行时与状态基底。
  • 规划能力提升:通过搜索式推理脚手架、子目标分解或层次化规划改进长程智能体
    9, 10, 68
  • 长上下文与持久状态管理
  • 上下文折叠(context folding)
    69, 70
  • 智能体记忆特征刻画
    16
    与长程记忆环境
    17
  • 轻量级记忆增强生成
    18
    、A-mem
    71
    等记忆增强结构;
  • 基础模型记忆机制综述
    72
  • 学习式上下文策划
    73
    与层次记忆基准测试
    74
  • InfiAgent
    75
    通过文件中心的状态外部化与严格有界推理上下文追求无限长程目标。
  • 验证与修复:AgentFixer
    15
    实现从失效检测到修复建议;轨迹级失效分类
    76
    与面向长程攻击的对抗鲁棒性
    77
    也受到关注。
  • 工具与工作流编排:MCP-Atlas
    78
    针对真实 MCP 服务器的大规模工具使用能力评测。

OneDayAgent 属于第二类研究脉络,其贡献在于将子任务规划、环境交互执行、记忆与状态传递、上下文管理、最终交付物验证与修复整合为同一套可迁移的执行框架,并系统测量了不同后端模型在该框架下表现出的执行风格差异。

Q: 论文如何解决这个问题?

该论文提出 OneDayAgent,一个面向长程日常任务(long-horizon everyday tasks)的执行框架(harness)。其解决方案通过显式引入分解、记忆与验证三大阶段,将传统单一连续的 ReAct 轨迹转化为受管理的执行过程,从而联合治理目标漂移、状态丢失与上下文溢出。具体实现可从以下四个层面展开:

1. 总体执行架构:从任务意图到交付物

OneDayAgent 将开放式请求视为一个端到端的受管理过程。如图 2 所示,工作流遵循以下路径:

  • 保留原始用户请求作为全局意图
  • 由规划器将其转换为有序子任务序列
  • 每个子任务在 ReAct 循环(观察-推理-行动)内执行,调用工具并与环境交互;
  • 中间发现与制品被写入执行记忆工作区,供后续步骤复用;
  • 全部子任务完成后,合成器整合输出为候选交付物;
  • 验证器对候选交付物进行全局合规检查,若发现缺陷则触发针对性修复,直至通过验证。

2. 核心能力一:任务分解(Capability I: Task Decomposition)

长程日常请求常包含隐式约束与多步骤依赖,单一不间断的执行器轨迹容易被过载。OneDayAgent 通过任务分解将请求转化为有界的可执行单元:

  • 有序子任务生成:规划器将原始请求拆分为最多 6 个严格顺序执行的子任务,每个子任务拥有独立的局部目标与工具调用权限。
  • 全局意图保持:框架始终保留原始请求作为全局意图,确保每个局部子任务最终服务于端到端交付目标。
  • 上下文节省接口:子任务边界天然构成状态截断点。后续子任务仅继承任务级状态(如先前收集的证据文件、搜索结果、生成图像的路径句柄),而非继承完整的低层 ReAct 交互历史,从而抑制上下文膨胀。

3. 核心能力二:全局验证与修复(Capability II: Global Verification and Repair)

完成所有子任务并不保证最终交付物满足原始请求。OneDayAgent 将最终检查与修复视为紧密耦合的两个阶段:

  • 全局验证:验证器对照原始请求各子任务提交的答案以及声明的附件,对候选交付物进行任务级合规检查。此过程关注制品(artifact)级别的实质内容,而非仅评判最终文本响应。
  • 针对性修复:若验证发现缺陷(如遗漏文件、格式错误、内容不一致),框架进入 ReAct 风格的修复阶段。利用验证器输出的缺陷描述,仅对交付物的缺失或错误部分进行局部修订(如修改特定幻灯片、补充缺失图片),而非重启全部子任务。
  • 闭环重评估:修复后的交付物将再次接受验证,形成“验证—修复—重评估”的闭环,确保交付风险可观测、可恢复。

4. 核心能力三:执行记忆(Capability III: Execution Memory)

执行记忆的目标并非存储所有令牌,而是在上下文压力下保留后续推理与制品构建所依赖的关键信息。其由三重机制组成:

  • 摘要截断(Summarized Truncation):针对搜索返回、网页访问、文件读取等高容量噪声观察,框架将其压缩为有界证据。例如,搜索结果保留结构化片段,长页面保留带限定的原始前缀摘要,大文件读取转为模态感知预览。这保证了执行器与外部环境保持接地,同时过滤掉冗余内容。
  • 子任务状态传递(Subtask State Passing):以子任务提交的答案及其声明的结果文件句柄作为跨环境、跨模态的紧凑检查点。后续子任务可直接引用先前生成的文件、图像、搜索证据或代码输出,无需重放完整历史轨迹。
  • 自动上下文压缩(Automatic Context Compression):在对话层监控累积轨迹长度。当上下文超过后端窗口的可配置比例(如 0.9 × 上下文预算)时,早期交互轮次被压缩为 LLM 生成的技术摘要,同时保留系统提示、原始任务与近期动作轮次;若接近硬限制,则回退到低价值历史的确定性紧急剪枝,防止上下文压力成为执行瓶颈。

5. 统一工具与环境接口

为支持跨环境与多模态工作,OneDayAgent 将异构资源封装为统一的 ReAct 动作空间(见表 1):

  • 工具组覆盖:网页访问(搜索、浏览)、学术检索(Google Scholar、OpenAlex)、计算执行(Python、Shell 命令)、文件工作区(读、写、编辑)以及多模态处理(图像分析、生成)。
  • 工作区制品持久化:工具调用不仅返回文本观察,还会创建或修改文件、图像、代码输出等制品。这些制品保存在任务工作区中,并以状态句柄形式贯穿分解、合成、验证与修复各阶段,使后续步骤能够引用具体的环境输出,而非仅依赖对话历史中的易失性文本。

6. 端到端工作流总结

综上所述,OneDayAgent 的解决方案可概括为以下执行管线:

  1. 接收用户请求与附件,锁定全局意图;
  2. 分解为有序、有界的子任务;
  3. 执行各子任务,在统一工具空间内完成环境交互;
  4. 记忆中间状态,通过摘要与检查点维持跨步骤依赖;
  5. 合成子任务输出为候选最终交付物;
  6. 验证交付物与原始意图的全局一致性;
  7. 修复局部缺陷并闭环重评估;
  8. 输出经过验证的可靠交付物

通过将分解、记忆与验证整合在同一套框架内,OneDayAgent 在不针对特定后端调参的情况下,实现了对长程日常任务的稳定执行与跨模型迁移。

Q: 论文做了哪些实验?

论文从五个维度对 OneDayAgent 进行了系统评估:主性能、消融研究、执行行为分析、后端可迁移性,以及代表性案例研究。所有实验均在 AgentIF-OneDay 基准(104 个任务,涵盖工作、学习与生活场景)上展开。

1. 实验设置

  • 评测基准:采用 AgentIF-OneDay
    6
    ,包含 104 个任务与 767 个实例级评分点。任务分为三种交互模式:开放式工作流执行(OWE)、隐式指令推断(LII)与迭代精炼(IR)。评分基于二元实例级评分表,含奖励与惩罚项,最终归一化至 $
    0,1
    $。
  • 主实验后端:GLM-5.2
    7
    ,温度 1.0 、top- p 0.95 、最大上下文 128 K、最多 200 轮 ReAct、超时 7200 秒、最多 6 个子任务、上下文压缩触发阈值 0.9× 预算。
  • 基线对比:包括官方发布的 Minimax-Agent、ChatGPT-Agent、Genspark、Manus、AutoClaw,以及额外运行的 Codex (GPT-5.5 medium)。
  • 评分器:使用 Gemini-3.1-Pro-Preview 作为 LLM-as-judge(因官方所用的 Gemini-3-Pro-Preview 已不可用)。附录 F 的配对比较表明,新评分器比旧评分器严格 3.12 个百分点,因此报告分数相对保守。

2. 主性能结果(Main Results)

OneDayAgent 在 AgentIF-OneDay 上取得新的最优表现(表 2):

  • 总体得分:GLM-5.2 后端达到 0.821 ,超越所有通用智能体基线(次优为 AutoClaw 的 0.799 ,其余基线在 0.56 – 0.66 区间)。
  • 全面领先:在全部任务类型(OWE、LII、IR)、领域(Work、Life、Study)、评分维度(指令遵循、事实性、逻辑/功能性)以及有无输入附件的设置上均取得最高分。

3. 消融实验(Ablation Study)

通过 2× 2 消融隔离任务分解全局验证/修复两个模块(执行记忆在所有变体中保持开启,否则任务无法完成),结果如表 3 所示:

变体 删除模块 总体得分 相对 FULL 变化 平均延迟 工具调用 修复率
DIRECT 分解 + 验证 0.771 27.6 min 28.4
DECOMP 仅验证 0.804 +3.3 pp 38.1 min 45.7
VERIFY 仅分解 0.804 +3.3 pp 29.7 min 29.3 3.9%
FULL 0.821 53.6 min 51.6 8.6%

关键发现:

  • 分解或验证单独使用均可带来约 3.3 个百分点的提升;两者联合使用达到最佳 0.821 ,但增益存在重叠。
  • 成本不对称:仅增加验证几乎不增加延迟( +2.1 min),而仅增加分解则显著增加成本( +10.6 min,工具调用增加约 60% )。
  • 全量配置并非总是最优:VERIFY 在 17 个任务上得分高于 FULL,DECOMP 在 13 个任务上更高,DIRECT 在 12 个任务上更高,说明模块组合需根据分数优先还是成本优先进行权衡。

4. 执行行为分析(Execution Behavior)

基于 GLM-5.2 的运行数据,论文分析了长程执行压力下的内部行为(图 3):

  • 子任务深度分布:多数任务( 88/104 )被分解为 2 – 4 个子任务;仅 16 个任务单步完成, 1 个任务达到 5 个子任务。分解深度与执行成本正相关: 1 个子任务平均 20.6 分钟/ 17 次工具调用, 5 个子任务则达 117.2 分钟/ 156 次调用。
  • 验证与修复流程: 104 个任务中, 95 个首次验证即通过, 9 个进入修复;修复任务中 6 个成功恢复, 3 个仍失败。修复集中在更难的任务类型(如 IR 任务、学习领域任务、长时间预算任务),表明验证/修复是交付风险暴露与恢复机制,而非简单的分数放大器。
  • 上下文管理: 35/104 个任务触发了上下文压缩,最高压力任务累积约 350 K 上下文令牌。压缩次数与最终得分几乎无相关性( r ≈ 0 ),说明自动上下文压缩在维持任务质量的同时,有效缓解了上下文压力。

5. 后端可迁移性分析(Backend Analysis)

为检验 OneDayAgent 是后端专属系统还是可迁移框架,论文在不改变 harness 配置的情况下测试了五种来自三个模型家族的后端 LLM(表 4):

后端 家族/厂商 报告规模 总体得分 延迟
GLM-5.2 GLM / Zhipu 744 B 0.821 3216.8 s
Gemini-3.1-Pro-Preview Gemini / Google 未公开 0.743 1281.6 s
Qwen3.5-397B-A17B Qwen / Alibaba 397 B-A 17 B 0.708 964.5 s
Qwen3.6-27B Qwen / Alibaba 27 B 0.613 1280.5 s
Qwen3.5-9B Qwen / Alibaba 9 B 0.624 1895.2 s

关键发现:

  • 跨后端稳定性:所有后端均完成全部 104 个任务,且在各类切片上均获得非平凡分数,证明 harness 可零调参迁移
  • 参数规模趋势:公开规模的模型中,大体呈规模-性能正相关( 9 B to 397 B to 744 B),但并非严格单调律(如 Qwen3.6-27B 未超越 Qwen3.5-9B;Gemini 规模据信大于 1 T 但得分次之)。
  • 执行风格差异:同一 harness 下,不同后端展现出 distinct 的操作特征。GLM-5.2 采用高成本、高探索风格( 53.6 min, 51.6 次工具调用, 585.7 KB 上下文);Gemini-3.1-Pro-Preview 更精简( 21.4 min, 18.7 次调用, 118.1 KB);Qwen3.6-27B 触发最高修复率( 56.7% )。这表明 harness 的通用性与后端诱导的差异化执行风格并存。

6. 案例研究(Case Study)

论文提供了一个具有代表性的 “Language of Flowers” PPT 编辑任务(图 5)的完整轨迹,展示:

  • 任务被分解为研究子任务(收集 Wikipedia 内容与 Pexels 图片)与修改子任务(应用修改);
  • 第二子任务因文件描述符错误失败;
  • 合成器如实报告失败,未将任务标记为完成;
  • 验证器识别出核心交付物(修改后的 PPT)缺失,并给出针对性修复建议;
  • 修复阶段通过 12 次工具调用生成缺失的 PPT;
  • 二次验证确认所有 6 项修改要求均已满足,最终交付。

7. 附录中的补充实验与分析

  • 评判器一致性比较(Appendix F):通过配对实验量化评分器差异。Gemini-3.1-Pro-Preview 比 Gemini-3-Pro-Preview 严格 3.12 个百分点,确认主实验报告分数为保守估计。
  • 运行时成本明细(Appendix C):记录 GLM-5.2 运行的完整服务调用量(约 9.0 K 次后端调用、 601 次摘要服务调用、 633 次图像分析调用、 123 次图像生成调用)。
  • 安全性讨论(Appendix E):分析当前无沙箱部署下的潜在风险(未信任内容注入、命令执行、记忆持久化攻击面),并提出容器化、命令白名单等未来加固方向。

Q: 有什么可以进一步探索的点?

基于论文的实验发现与讨论,以下是可以进一步探索的研究方向:

1. 跨基准的泛化验证

论文结论明确指出,当前发现特定于 AgentIF-OneDay 基准,更广泛的泛化性需要在额外基准上验证。未来可在以下场景测试 OneDayAgent 框架:

  • 其他长程日常任务基准(如 LifeSim、AgencyBench、Workspace-Bench 等)
  • 更具对抗性的多步任务环境(如 OdysseyArena、Terminal-Bench)
  • 需要实时用户交互的开放式任务,而非仅离线交付物生成

2. 自适应模块配置与成本-质量权衡

消融实验表明,全量模块配置并非总是最优:VERIFY 在 17 个任务上得分高于 FULL,DECOMP 在 13 个任务上更高。这暗示:

  • 探索动态模块选择策略,根据任务复杂度、成本预算或实时执行状态,自动决定是否启用分解、验证或特定记忆压缩策略
  • 建立帕累托最优的模块调度策略,在延迟、API 成本与任务成功率之间取得平衡

3. 上下文压缩与任务性能的因果机制

执行行为分析显示,上下文压缩次数与最终得分几乎无相关( r ≈ 0 ),但论文明确指出因果隔离留待未来工作。需要进一步探索:

  • 压缩策略对特定任务类型(如需要精细事实追踪的 LII 任务)是否存在隐性损伤
  • 更精细的选择性记忆保留机制(如基于任务关键实体的检索增强,而非统一摘要)
  • 与 InfiAgent 等文件中心外部化方法的系统对比,明确何种状态保持策略更适合长程日常任务

4. 后端执行风格的理解、预测与利用

后端分析揭示,同一 harness 下不同模型展现出截然不同的执行风格(工具调用量、修复率、延迟分布)。未来可探索:

  • 执行风格预测模型:基于后端 LLM 的小样本试探,预测其在 harness 下的典型行为轮廓
  • 后端感知的 harness 自适应:例如,针对高修复率后端(如 Qwen3.6-27B)在验证阶段增加预检查步骤,或针对低探索后端增强子任务描述的详细程度
  • 从“无调参迁移”迈向“轻量适配”,在不破坏通用性的前提下,通过元提示(meta-prompting)或少量示例提升特定后端效率

5. 更鲁棒的跨环境状态传递与错误恢复

案例研究中出现的 [Errno 9] Bad file descriptor 表明,跨子任务的状态传递仍可能因环境细节而失败。未来工作包括:

  • 引入事务式子任务边界:确保子任务产生的文件句柄、环境状态在传递前经过完整性校验
  • 设计自动重试与回退机制:不仅修复最终交付物,也能在子任务边界处自动检测并重新生成损坏的中间状态
  • 探索工作区快照与版本化,使合成器与验证器能够回溯到任意子任务完成时的精确状态

6. 安全加固与沙箱化部署

附录 E 指出当前实现直接在宿主机运行,缺乏工作空间隔离。这是一个紧迫的工程与研究方向:

  • 容器化工作区:为每个任务建立隔离的文件系统与网络命名空间
  • 命令执行白名单与审批:对 execute_command 引入权限分级,对破坏性操作实施显式授权
  • 抗提示注入的记忆过滤:在上下文压缩与子任务状态传递中,加入对潜在对抗性指令的检测与清除机制,防止恶意网页或文档内容通过记忆机制持久化传播

7. 验证与修复的深度优化

当前验证-修复循环采用固定上限(最多 3 次修复尝试)。未来可探索:

  • 可学习的修复终止条件:基于缺陷类型、历史修复成功率与剩余预算,动态决定是否继续修复或降级交付
  • 分层验证:在子任务边界引入轻量级局部验证,避免缺陷累积到最终阶段才暴露
  • 验证器本身的可靠性:论文因评分器更替导致分数保守偏移( -3.12 pp),未来可研究更稳定、可解释的验证准则,甚至多验证器集成(ensemble verification)

8. 从单智能体到多智能体协作

OneDayAgent 目前采用单智能体 harness。鉴于日常任务常涉及多领域能力(研究、编码、设计、写作),未来可探索:

  • 将 harness 扩展为多智能体编排框架:让不同后端或不同角色(研究者、编辑者、验证者)的智能体并行或流水执行子任务
  • 借鉴 AutoGen 的多智能体对话模式,但保留 OneDayAgent 的全局意图锁定与跨智能体记忆传递机制

9. 多模态交付物的精细化验证

当前验证主要依赖文本化检查与文件元数据。对于包含 PPT、图像、复杂表格等多模态交付物,未来需要:

  • 结合视觉-语言模型对生成图像的布局符合性内容相关性进行像素级验证
  • 对表格、代码等结构化输出引入可执行验证(如运行生成的 Python 代码、解析 Excel 公式结果),而非仅检查文本描述

Q: 总结一下论文的主要内容

该论文针对长程开放式日常任务中 LLM 智能体的可靠性问题,提出了 OneDayAgent 执行框架,并在 AgentIF-OneDay 基准上验证了其有效性与跨后端通用性。

1. 研究背景与问题

现实场景中日益增长的日常智能体请求(涵盖工作、学习与生活)具有**长程(long-horizon)、跨环境(cross-environment)与多模态(multimodal)**三大特征,导致执行过程中出现三种相互叠加的失效模式:

  • 目标漂移(Goal Drift):早期约束与隐式要求在多步推理后被遗忘;
  • 状态丢失(State Loss):在网页、本地文件、代码执行等异构环境间切换时,中间证据无法有效传递;
  • 上下文溢出(Context Overflow):轨迹累积超出后端上下文预算,造成决策质量下降。

现有研究通常仅针对上述某一种失效模式进行优化,缺乏能够联合治理这些问题的统一执行框架,且对框架在不针对特定后端调参情况下的跨模型迁移能力研究有限。

2. OneDayAgent 框架

论文提出 OneDayAgent,一个将开放式请求转化为受管理执行过程的长程 harness,核心包含三大能力:

  • 任务分解(Task Decomposition):将过载的原始请求拆分为有序、有界的子任务。每个子任务拥有局部目标,框架保留原始请求作为全局意图;子任务边界同时充当上下文截断点,后续步骤仅需继承紧凑的状态检查点,而非完整低层轨迹。
  • 执行记忆(Execution Memory):通过三重机制维持长程状态——摘要截断将高容量工具输出压缩为有界证据;子任务状态传递以结果文件句柄跨环境、跨模态复用中间制品;自动上下文压缩在轨迹接近预算时生成技术摘要并保留关键历史,防止上下文压力成为瓶颈。
  • 全局验证与修复(Global Verification and Repair):所有子任务完成后,验证器对照原始请求与制品内容检查候选交付物的全局合规性;若发现缺陷,则触发针对性的 ReAct 风格修复,仅修订缺失或错误部分并闭环重评估,而非重启全部流程。

此外,OneDayAgent 将网页访问、学术检索、代码执行、文件操作与多模态处理封装为统一的工具动作空间,并通过持久化工作区使环境交互结果可供后续阶段直接引用。

3. 实验与结果

论文在 AgentIF-OneDay(104 个任务,覆盖开放式工作流执行、隐式指令推断与迭代精炼三种模式)上开展系统评估:

  • 主性能:OneDayAgent 搭配 GLM-5.2 后端取得 0.821 的总体得分,超越所有通用智能体基线,且在任务类型、领域、评分维度及有无附件设置上全面领先。
  • 消融研究:任务分解与全局验证各自带来约 3.3 个百分点的提升,两者联合达到最优 0.821;但两者成本不对称——验证几乎不增加延迟,而分解显著增加工具调用与耗时。
  • 执行行为:大多数任务被分解为 2–4 个子任务;95/104 个任务首次验证通过,9 个进入修复且 6 个成功恢复;35 个任务触发上下文压缩,且压缩次数与最终得分无系统性负相关。
  • 后端可迁移性:同一套未调参 harness 在 5 个来自 3 个模型家族的后端(GLM-5.2、Gemini-3.1-Pro-Preview、Qwen3.5-397B-A17B、Qwen3.6-27B、Qwen3.5-9B)上均稳定运行,总体得分从 0.613 到 0.821 不等,证明框架具有跨后端通用性;同时发现不同后端在延迟、工具调用量、修复率上呈现出** distinct 的执行风格**。
  • 案例研究:通过一个 PPT 编辑任务,展示了框架如何在子任务失败、验证识别缺失交付物、修复生成最终文件并二次验证通过的完整闭环。

4. 主要结论

论文的核心发现可归纳为两点:

  1. 单一 harness 可联合管理任务分解、执行记忆与交付物验证,无需针对特定后端定制即可在长程日常任务上达到新的最优表现;
  2. 跨后端迁移并非静默等价——不同大语言模型在同一工作流下会诱导出不同的执行风格(如探索强度、修复倾向、资源消耗),提示未来研究需关注后端-框架交互效应。

论文已开源 harness 与执行轨迹,并指出未来需在更多基准上验证泛化性、探索自适应模块配置、深化上下文压缩的因果机制,以及引入沙箱化等安全加固措施。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Jingsheng Zheng,Xinyuan Fang,Jintian Zhang,Zhengke Gui,Huajun Chen,Ningyu Zhang

PDF URL: https://arxiv.org/pdf/2608.05013.pdf

Arxiv URL: https://arxiv.org/abs/2608.05013

Arxiv ID: 2608.05013

CoolPaper URL: https://papers.cool/arxiv/2608.05013

Published: 2026-08-07T01:55:03.575Z

Updated: 2026-08-07T01:55:03.575Z


6. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

Abstract:Long-horizon reasoning in recent LLMs demands that the model switch between distinct skills inside a reasoning chain, such as first doing a math derivation, then using the result to plan a schedule. We call such problems cross-skill long-horizon tasks: multi-step tasks whose steps require different reasoning skills and depend on earlier outputs. Existing benchmarks often evaluate individual skills, lacking a principled way to measure how well a model switches between skills. We address this gap from both the evaluation and training sides. We introduce Skill Entropy, a measure of the difficulty of switching from one skill to another. We then propose Skill^2-Bench, a benchmark of cross-skill long-horizon tasks built over 558 skills across 9 verifiable and open-ended domains. Each task is assigned a task-level skill-entropy score and grouped into three difficulty levels. Evaluating 8 frontier and 4 open-source models on Skill^2-Bench reveals a skill-switching gap: accuracy decreases on higher-entropy tasks. We then turn skill entropy from a benchmark scale into a training signal. We propose Skill-Entropy RL, an RL framework where the model predicts not only the answer at each step but also the skill used to produce it. The reward combines step-level correctness with a skill-entropy reward that measures the alignment between the model-predicted skill sequence and the gold skill sequence. On Qwen3-4B-Instruct and Qwen3-1.7B, Skill-Entropy RL improves the Skill^2-Bench score from 34.4% to 68.4% and from 14.6% to 40.1%, respectively, outperforming competitive baselines. The same pipeline can be applied to off-the-shelf training data such as OpenR1-Math, indicating that skill entropy is a reusable training signal. Code available at: this https URL

中文摘要

摘要:近期大型语言模型中的长时程推理要求模型在推理链中切换不同的技能,例如先进行数学推导,然后利用结果来制定计划。我们将此类问题称为跨技能长时程任务:多步骤任务,其步骤需要不同的推理技能并依赖于先前的输出。现有基准通常评估单一技能,缺乏衡量模型在技能之间切换能力的系统方法。我们从评估和训练两方面填补了这一空白。我们提出了技能熵(Skill Entropy),一种衡量从一种技能切换到另一种技能难度的指标。随后,我们提出了Skill^2-Bench,这是一个基于9个可验证和开放领域构建的、涵盖558种技能的跨技能长时程任务基准。每个任务被分配一个任务级技能熵分数,并分为三个难度等级。在Skill^2-Bench上评估8个前沿模型和4个开源模型显示存在技能切换差距:在高熵任务上的准确率下降。随后,我们将技能熵从基准尺度转化为训练信号。我们提出了技能熵强化学习(Skill-Entropy RL)框架,在该框架中,模型不仅预测每一步的答案,还预测用于生成答案的技能。奖励函数结合了步骤级正确性和技能熵奖励,用于衡量模型预测的技能序列与真实技能序列的一致性。在Qwen3-4B-Instruct和Qwen3-1.7B上,技能熵强化学习分别将Skill^2-Bench的分数从34.4%提升至68.4%和从14.6%提升至40.1%,优于竞争基线。该流程同样可应用于现成训练数据,例如OpenR1-Math,表明技能熵是一种可复用的训练信号。代码可在此https URL获取。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文致力于解决大语言模型(LLM)在长程推理(long-horizon reasoning)中面临的**跨技能切换(cross-skill switching)**难题,具体体现在评估与训练两个层面。

1. 现有基准测试无法衡量技能切换能力

当前的主流基准大多针对单一领域或单一技能设计(如数学、编程、逻辑等),缺乏一种系统化的方法来评估模型在一条连贯的推理链中从一个技能平滑切换到另一个技能的能力。论文指出,真实世界中的长程任务(如规划旅行、撰写研究报告)往往需要模型在单条思维链内连续调用不同技能(例如先进行数学推导,再用结果规划日程),而现有评估未能覆盖这种“跨技能”场景。

2. 模型存在显著的技能切换鸿沟(Skill-Switching Gap)

论文观察到,前沿模型在孤立地测试某一技能时表现优异,但在将该技能嵌入需要多步、跨领域技能组合的长程任务后,准确率会出现明显下降(下降幅度可达 -4% 至 -13% )。更关键的是,即使每个组成技能单独都能被模型很好处理,组合后的任务依然会失败,这说明**“技能切换能力”与“单技能掌握程度”是两个相对正交的能力维度**,而现有基准无法暴露这一脆弱性。

3. 缺乏量化技能切换难度的任务级指标

为了定位模型在何处失败,需要一种任务级别的度量标准来量化任务内部技能切换的困难程度。然而,现有工作未提供此类指标。为此,论文提出了Skill Entropy(技能熵) SkE(s_a, s_b) ,作为一种有向的成对度量,用于衡量在推理过程中从技能 s_a 切换到技能 s_b 的难度,并据此构建分级难度的基准测试 Skill2-Bench

4. 将评估信号转化为训练信号

在暴露上述评估缺口后,论文进一步解决如何训练模型以缩小技能切换鸿沟的问题。现有基于正确性的强化学习(RL)奖励信号稀疏,且未显式建模步骤间的技能结构。论文提出 Skill-Entropy RL,将技能熵从单纯的评估尺度转化为训练奖励的一部分,引导模型在生成答案的同时显式预测并遵循正确的技能序列,从而提升跨技能长程推理的可靠性。

Q: 有哪些相关研究?

相关研究可沿以下三个主要方向进行梳理,论文在第5节及附录A中对其进行了详细讨论。

1. 大语言模型的推理基准测试(Reasoning Benchmarks)

现有基准大致可分为三类:

  • 单一技能孤立评估:针对数学、多领域知识、编码、逻辑、规划、研究生级别推理及心智理论等单一能力设计,每域报告单一准确率,如 MATH
    10
    、MMLU-Pro
    51
    、LiveCodeBench
    21
    、ZebraLogic
    32
    、NaturalPlan
    69
    、BIG-Bench Extra Hard
    24
    、R-Bench
    14
    、Hi-ToM
    54
    等。后续变体进一步探究数据分析保真度、AI 研究复现能力及多选题评估鲁棒性
    45, 46, 41, 25

  • 长程智能体环境:要求模型在复杂环境中链接多轮交互、工具调用或程序步骤,如 GAIA
    34
    、AgentBench
    33
    、OdysseyBench
    50
    、HeroBench
    3
    、LongProc
    60
    、MTR-Bench
    30
    、MSCoRe
    26
    等。

  • 单一段落内的技能组合测试:探究模型在处理组合技能时的能力边界,发现一旦将两个技能组合,准确率会急剧下降
    61, 67, 43, 1, 42, 35, 2
    。另有研究构建带技能标签的基准,以覆盖固定技能库的方式评分
    28, 71, 40

与本文的区别:上述工作均未显式度量“特定技能切换”的难度。Skill2-Bench 继承了技能中心视角,但构建的长程任务要求每一步调用不同技能,并引入技能熵(Skill Entropy) SkE(s_a, s_b) 作为有向成对量,用以衡量从技能 s_a 切换到 s_b 的困难程度,而非将所有切换视为同质。

2. 技能感知的分析与训练(Skill-Aware Analysis and Training)

该方向 growing body of work 将技能作为训练数据的结构透镜:

  • 技能标签数据的诊断与激励:早期研究表明,技能标注数据既能诊断组合行为缺陷,也能激励组合能力涌现
    61, 67, 11

  • 沿技能轴合成或选择训练数据:包括采样技能组合、诱导技能分类体系、检索技能目标示例、向缺失技能重加权、剪枝技能冗余步骤、选择紧凑且技能平衡的子集等方法
    23, 53, 15, 16, 22, 64, 4

  • 技能的发现与增长:将技能视为从思维链痕迹中诱导出的潜在对象,或作为强化学习智能体随时间扩展的技能库
    57, 48

  • 推理时的技能应用:利用技能进行检索、工具使用评估及专家组合
    70, 6, 5

与本文的区别:现有方法均将技能信号注入数据层、潜在层或路由层。本文则将其整合进强化学习的奖励层:模型不仅因答案正确性受奖,还因其预测的技能链与任务黄金技能链的难度分布(通过技能熵刻画)对齐程度而受奖,从而将技能结构显式纳入优化目标。

3. 基于可验证奖励与密集奖励的强化学习(RL with Verifiable and Dense Rewards)

  • 标准流程:基于 GRPO 等算法,利用可验证的二元正确性信号训练推理模型
    44, 13, 9

  • 解决奖励稀疏性:一类工作通过过程奖励模型(Process Reward Models)提供步骤级监督
    31, 49, 68
    ;另一类通过自修正、批判或并行样本聚合在单条解答内部密集化结果信号
    17, 58, 38, 55

  • 轮次级与元推理奖励:为长程智能体设计奖励,以评分中间认知步骤
    52, 66

  • RL 的能力涌现研究:探讨在适当训练任务下的技能组合、从数学 RL 到广义推理的迁移,以及学习何时调用显式推理
    62, 36, 12

  • 训练分布塑造:通过自演进课程、工具使用或图结构计划来塑造训练轨迹
    7, 27, 65, 59

与本文的区别:上述所有方法均针对步骤内的难度进行信号密集化(如单步推理质量、单步正确性)。本文方法则添加了一个正交的跨步骤密集信号:通过技能熵奖励 r_(ent) 衡量预测技能序列与黄金技能序列在任务结构层面的匹配度。二者可天然组合——过程奖励与自修正奖励密集化“步内”信号,而技能熵奖励密集化“步间”信号。

Q: 论文如何解决这个问题?

论文从评估训练两个层面系统性解决跨技能长程推理的度量与提升问题,核心方案可概括为以下三个部分。

1. 评估层面:提出 Skill Entropy 并构建 Skill2-Bench

1.1 形式化定义与度量

为量化任务内部技能切换的固有难度,论文首先形式化跨技能长程任务(Cross-Skill Long-Horizon Task)。一个任务 τ 被定义为一个长度为 L 的问题–答案序列:
τ = (q_1, a_1), (q_2, a_2), …, (q_L, a_L), quad L ∈ [2, 10]
并伴随一条技能序列:
μ(τ) = (s_1, s_2, …, s_L)
其中每步 (q_i, a_i) 调用不同领域的技能 s_i ,且后续步骤依赖前面步骤的输出。

在此基础上,论文引入Skill Entropy(技能熵) SkE(sa, s_b) ,作为衡量从技能 s_a 切换到 s_b 之困难程度的有向成对量。给定参考模型,设 Accuracy(s) 为该模型在单技能问题上的准确率, Accuracy(s_a, s_b) 为在“先 s_a 后 s_b ”的两步跨技能问题上的平均准确率,加入 Laplace 平滑 α = 0.1 后定义:
SkE(s_a, s_b) = (frac1) / (2)(Accuracy(s_a) + Accuracy(s_b)) + αAccuracy(s_a, s_b) + α
SkE > 1 表示切换困难, SkE ≤ 1 表示切换容易。进一步地,一个任务 τ 的任务级技能熵定义为其技能序列上所有相邻切换的平均值:
SkE(τ) = (1) / (L-1)∑
(i=1)^(L-1) SkE(si, s(i+1))

1.2 Skill2-Bench 基准构建

基于上述度量,论文构建了 Skill2-Bench 基准:

  • 覆盖 9 个领域(数学、科学、编码、逻辑、信息抽取、规划、创意写作、上下文检索、指令遵循),共计 558 个细粒度技能
  • 每个任务由 LLM 根据统一场景 σ 将来自不同领域的种子问题重写为相互依赖的长程任务,长度 $L ∈
    2, 10
    $;
  • 依据任务级技能熵 SkE(τ) 将任务划分为低、中、高三个难度级别,从而实现对模型技能切换能力的精细校准与评估。

2. 训练层面:Skill-Entropy RL 框架

为解决模型在长程推理中“遗忘切换技能”的失效模式(即后续步骤重复使用前一步的技能与回答模态),论文将技能熵从评估尺度转化为可优化的训练信号,提出 Skill-Entropy RL

2.1 技能标注的响应格式

模型被训练为在生成每步答案前,显式预测该步所调用的技能。响应格式强制交替输出 <skill><answer> 标签:

1
2
3
4
<think> [推理过程] </think>
<skill> Domain_1, Skill_1 </skill><answer> Step_1 Answer </answer>
...
<skill> Domain_L, Skill_L </skill><answer> Step_L Answer </answer>

由此可从模型输出中解析出预测的技能序列 μ(τ) = (s_1, …, s_L) 与答案序列。

2.2 奖励函数设计

训练采用 GRPO 算法,每任务的奖励 r 由两部分加权组成:
r = λ(ans) r(ans) + λ(ent) r(ent)

  • 答案奖励 r(ans) :各步答案在对应领域评估器下的平均准确率,即 r(ans) = (1) / (L)∑(i=1)^L eval(d_i)(a_i, a_i, q_i) ;
  • 技能熵奖励 r(ent) :衡量预测技能链与黄金技能链在“难度分布”上的对齐程度。设 F 为训练集上黄金任务级技能熵 SkE^star(τ) 的经验累积分布函数,定义排序:
    rho = F(SkE(τ)), quad rho^star = F(SkE^star(τ))
    则:
    r
    (ent) = 1 - |rho - rho^star|
    该奖励通过 CDF 归一化,使模型受到与任务相对难度排名匹配的塑形信号,而非绝对数值差异的干扰。

对于模型输出的非标准技能标签,论文采用嵌入模型(Qwen3-Embedding-0.6B)将其映射至技能库中最近的规范条目,以计算对应的技能熵。

2.3 训练流程与数据

  • 两阶段训练:先用 3K 条由强教师模型(Qwen3-8B)生成的技能标注轨迹进行 SFT 预热,使模型学会输出结构化技能标签;再在 6K 条跨技能任务上使用上述奖励函数进行 RL 训练。
  • 超参数:采用 λ(ans) = 0.7, λ(ent) = 0.3 ,GRPO group size 为 8,KL 系数 10^(-3) 。

3. 效果验证与泛化应用

  • 主实验:在 Qwen3-4B-Instruct 上,Skill-Entropy RL 将 Skill2-Bench 总分从基线的 34.4% 提升至 68.4%;在 Qwen3-1.7B 上从 14.6% 提升至 40.1%,均显著优于纯 GRPO 及 Skill-Distill、STAT 等技能感知基线。
  • 失败模式缓解:训练后模型在后续步骤中“复用前一步错误技能”的现象显著减少,能够根据当前步骤需求切换至正确的领域与回答模态。
  • 即插即用:该框架可直接应用于现成训练数据(如 OpenR1-Math)。通过为现有数据标注每步技能并计算任务级技能熵,加入 r_(ent) 后,在六个数学基准上的平均准确率较纯 GRPO 提升 +1.9%,较基线模型提升 +7.7%,表明技能熵是一种可复用的通用训练信号。

Q: 论文做了哪些实验?

论文开展了系统性的实验验证,涵盖评估诊断训练优化消融分析泛化测试稳健性检验五个层面,具体如下:

1. Skill2-Bench 上的大规模模型评估

目的:验证技能熵(Skill Entropy)是否能有效衡量跨技能长程任务的难度,并暴露现有模型的“技能切换鸿沟”。

设置

  • 模型:8 个前沿闭源模型(Claude-haiku-4.5、Claude-sonnet-4.5、Claude-opus-4.7、Gemini-3.1-flash、Gemini-3.1-pro、GPT-5.4-mini、O4-mini、GPT-5.5)与 4 个开源模型(Qwen3-4B、Qwen3-8B、Qwen3-32B、Olmo-3-7B-Think)。
  • 任务:300 条跨技能长程任务(长度 $L ∈
    2,10
    $),均衡覆盖低、中、高三种技能熵级别与 9 个领域。
  • 协议
  • 单技能模式(Single-Skill):每步独立提问,无上下文场景;
  • 跨技能模式(Cross-Skill):输入完整长程任务,要求模型按序回答。

结果

  • 几乎所有模型的 Skill2-Bench 得分随任务级技能熵从低到高呈单调下降
  • 同一技能在跨技能任务中的准确率比单技能模式下降 -4% 至 -13% ,且对 Planning 等技能尤为脆弱;
  • 即使模型在单技能模式下接近饱和的技能(如 Logic),嵌入跨技能链后仍出现显著失效。

2. 失败模式分析

目的:定位模型在跨技能任务中的主要失效机制。

方法:对比模型在单技能与跨技能设置下的逐步输出,分析预测技能标签与答案模态的匹配情况。

发现

  • 主导失效模式:在任务后续步骤中,模型倾向于复用前一步的技能与答案模态,而非切换至当前步骤所需的技能。例如,在完成数学计算步骤后,下一步要求创意写作时,模型仍输出短数字答案而非长文本(见图 3)。
  • 量化分析:对最强的一批前沿模型,在跨技能任务中选错技能家族(skill family)的步骤,其准确率(约 32% – 57% )大致仅为选对技能家族步骤准确率(约 63% – 79% )的一半(见图 5)。

3. Skill-Entropy RL 的训练实验

目的:验证将技能熵转化为训练信号能否提升模型的跨技能推理能力。

设置

  • 基座模型:Qwen3-4B-Instruct、Qwen3-1.7B。
  • 数据:9K 条跨技能任务(来自 6 个可验证领域),3K 用于 SFT 预热,6K 用于 RL;3 个开放式领域仅用于测试。
  • 对比基线
  • 无微调的基座模型(Base);
  • 纯 SFT;
  • 标准 GRPO(仅答案奖励,即 Skill-Entropy RL 去掉 r_(ent) 的消融);
  • 三种技能感知后训练方法:Skill-Distill
    63
    、SkillRL
    56
    、STAT
    16

结果

  • Qwen3-4B-Instruct:Skill-Entropy RL 将 Skill2-Bench 总分从基线的 34.4% 提升至 68.4% ,较 GRPO 提升 +9.6% ,较最强基线 STAT 提升 +7.0% ;
  • Qwen3-1.7B:总分从 14.6% 提升至 40.1% ,较 GRPO 提升 +7.9% ,较 STAT 提升 +7.1% ;
  • 在 9 个领域中,Skill-Entropy RL 在 7 个领域取得最佳准确率,且对开放式领域(如 Creative Writing)的增益在未见于 RL 训练数据的情况下依然显著,表明技能熵奖励具有良好的迁移性。

4. 现成数据上的即插即用验证

目的:证明技能熵奖励无需专门构建的跨技能数据集,可直接应用于现有训练数据。

设置

  • 选取 OpenR1-Math
    20
    的 6K 子集,使用 Qwen3-8B 为每条推理轨迹的每步自动标注技能标签,并计算任务级技能熵;
  • 采用与主实验相同的 SFT + RL 流程训练 Qwen3-4B-Instruct。

结果

  • 训练曲线显示,加入 r_(ent) 后,最终答案奖励在标准 GRPO 趋于平稳后继续上升(见图 4);
  • 在 6 个数学基准(AIME24、AIME25、HMMT25、AMOBench、OpenR1-Math test、MATH)上,Skill-Entropy RL 全部取得最高分,平均较 GRPO 提升 +1.9% ,较基座模型提升 +7.7% 。

5. 泛化到外部基准

目的:检验 Skill-Entropy RL 是否损害或提升模型在领域外任务上的通用推理能力。

设置:将在 Skill2-Bench 上训练的 Qwen3-4B-Instruct 与 Qwen3-1.7B 检查点,零样本迁移至 5 个外部基准:

  • 长程推理:MuSR、LongBench-MuSiQue;
  • 通用推理:GPQA-Diamond、MMLU、IFEval。

结果

  • Skill-Entropy RL 在两个模型尺度上均取得最高的五基准平均分
  • 在长程基准 MuSR 上达到最佳表现,在 LongBench-MuSiQue 上优于或持平 GRPO;
  • 在通用推理基准上未出现遗忘现象,多数指标持平或超越基座模型与 GRPO。

6. 额外模型与消融实验

  • 额外基座模型:在 Llama-3.2-3B-Instruct 与 Olmo3-7B-Instruct 上重复相同训练流程,Skill-Entropy RL 均取得最高 Skill2-Bench 总分,趋势与 Qwen 系列一致(见表 15)。
  • 奖励权重消融:在 Qwen3-4B-Instruct 上测试 (λ(ans), λ(ent)) 的不同组合。当 λ(ent)=0.1 时得分下降 7.6 点;当 λ(ent) ≥ 0.5 时下降 12.8 – 19.8 点。默认配置 (0.7, 0.3) 为最优(见表 13)。
  • 与单技能上限对比:Skill-Entropy RL 在跨技能设置下的总分甚至超过基座模型在单技能设置下的表现,表明其提升源于底层技能能力的增强,而非仅适应跨技能格式(见表 14)。

7. 稳健性检验与人工验证

  • 参考模型稳健性:使用 Gemini-3.1-pro 与 GPT-5.5 替代 Claude-opus-4.7 作为参考模型重新计算技能熵,任务难度分层与原始分区重叠率超过 80% ,交叉技能平均准确率差异在 sim 2 个百分点以内(见表 7)。Spearman 秩相关与 Cohen’s kappa 均显示分层稳定(见表 8)。
  • 人类对齐研究:4 名独立标注者盲评 9 个任务的技能切换难度,其判断与模型技能熵标签的一致性接近标注者间上限(Cohen’s kappa = 0.444 vs. 0.625 ),说明技能熵确实反映了人类可感知的难度结构(见表 9)。
  • 开放式领域评委校准:对 Creative Writing、Context Retrieval、Instruction Following 三个开放式领域,LLM 评委(Claude-opus-4.7)与人工评分的 Pearson 相关达 0.84 – 0.91 ,平均绝对误差仅 0.05 – 0.08 (见表 10)。

Q: 有什么可以进一步探索的点?

基于论文的框架与发现,以下方向值得进一步深入探索:

1. 动态与自适应的技能熵度量

当前 Skill Entropy 基于固定参考模型(Claude-opus-4.7)预先计算,并通过技能→领域因子化进行近似。未来可探索:

  • 模型自适应技能熵:使 SkE(s_a, s_b) 随训练模型的能力演化而动态更新,而非依赖静态参考表,从而更精准地反映当前模型的真实切换瓶颈。
  • 细粒度上下文感知:将技能熵从标量推广为依赖于任务上下文、历史推理链长度或中间结论复杂度的条件度量,以捕捉同一对技能在不同情境下的异质性切换成本。

2. 自动化与层次化的技能库构建

论文中的技能库(Skill Bank)依赖 LLM 标注与人工审核来保持粒度一致。进一步工作可包括:

  • 无监督技能发现:借鉴潜在技能归纳(latent skill induction)方法,从大规模推理轨迹中自动挖掘技能本体,减少对人工定义种子列表的依赖。
  • 层次化技能表示:建立“粗粒度领域—细粒度技能—微操作”的多层结构,使技能熵能够在不同抽象层级上刻画切换难度,从而兼容从原子操作到高阶策略的多尺度任务。

3. 开放式领域的强化学习训练

现有 Skill-Entropy RL 的训练数据仅覆盖六个可验证领域,开放式领域(创意写作、上下文检索、指令遵循)仅用于评估。后续研究可致力于:

  • 开放式奖励设计:为开放式步骤构建可扩展的自动化验证或判分机制,使技能熵奖励能直接在这些领域上进行 RL 优化,消除训练与评估之间的领域断层。
  • 人类偏好对齐:将技能切换的流畅性纳入 RLHF 框架,使模型不仅在技能序列的结构难度上对齐,还在人类主观感知的连贯性与风格一致性上对齐。

4. 与过程级监督的深度融合

论文指出技能熵奖励与过程奖励模型(PRM)等步内密集信号正交。未来可系统研究:

  • 多目标奖励融合策略:探索技能熵奖励与步骤级正确性、自我修正(self-revision)、元推理(meta-reasoning)等信号的最优融合方式,例如通过多任务学习或层次化强化学习动态调整各奖励的权重。
  • 信用分配细化:在极长的推理链中,将技能熵的惩罚或奖励更精细地归因到具体的状态转移 si to s(i+1) ,而非仅作用于任务级标量,以提升学习效率。

5. 认知科学启发的技能切换机制

论文观察到模型存在“技能惯性”(即后续步骤复用前一步技能与回答模态)。从人类认知科学出发:

  • 任务切换成本建模:引入认知心理学中的任务切换范式(task-switching paradigm),显式建模“切换成本”与“启动延迟”,设计能够模拟人类执行控制的推理架构。
  • 工作记忆与技能缓存:探索在模型推理过程中维护一个显式的“技能上下文缓存”,在切换时主动刷新表征空间,减少前序技能的干扰效应。

6. 超长视野与动态环境扩展

当前 Skill2-Bench 的任务长度限制在 $L ∈
2, 10
$。进一步可拓展至:

  • 开放式长程任务:在智能体环境(如操作系统、网页浏览、科学实验模拟)中评估技能熵的适用性,其中任务长度不固定,且技能序列可能随环境反馈动态调整。
  • 在线技能规划:使模型在推理过程中不仅执行预设的技能序列,还能基于中间结果重新规划后续技能顺序,形成闭环的“计划–执行–重计划”能力。

7. 架构层面的原生技能路由

论文通过训练信号间接塑造技能切换行为。更根本的改进可能来自架构:

  • 显式技能路由模块:在模型中引入可学习的技能选择门控(skill routing gates)或符号混合专家(symbolic Mixture-of-Experts),使不同技能对应不同的子网络或表征子空间,从结构上降低技能间的干扰。
  • 模块化推理系统:构建具备显式模块接口的 LLM,使技能切换通过模块间的结构化信息传递完成,而非完全依赖隐式上下文学习。

8. 跨模态技能切换

论文聚焦于文本领域的推理技能。随着多模态大模型的发展:

  • 视觉–语言–代码等多域切换:研究在需要同时处理图像理解、空间推理、代码生成和自然语言解释的任务中,如何定义与计算跨模态的技能熵。
  • 模态间对齐难度量化:探索不同模态间(如从数学推导切换到图表解析)的切换是否遵循与文本技能熵相似的统计规律,并构建相应的多模态 Skill2-Bench 变体。

9. 可解释性与诊断工具

论文揭示了技能选择错误是主要失效模式。未来可开发:

  • 实时技能切换诊断器:在推理过程中监测模型隐状态的领域归属(domain attribution),在模型即将“滑入”错误技能时触发预警或干预。
  • 技能覆盖与薄弱点分析工具:基于技能熵矩阵为特定模型生成个性化的技能切换薄弱点图谱,用于针对性数据增强或课程学习。

Q: 总结一下论文的主要内容

这篇论文的核心目标是解决大语言模型(LLM)在长程推理中的跨技能切换问题,即模型如何在单条推理链中流畅地从一种推理技能(如数学推导)切换到另一种(如规划或创意写作)。论文从评估训练两个层面提出了系统性方案。

1. 核心问题:技能切换鸿沟

现实世界的复杂任务(如撰写研究报告、规划旅行)要求模型在多步推理中调用不同领域的技能,且后续步骤依赖前面的输出。然而,现有基准大多评估单一技能,无法衡量这种“跨技能长程推理”能力。论文发现,即使前沿模型在孤立技能上表现优异,一旦将这些技能嵌入需要切换的长程任务中,准确率会显著下降( -4% 至 -13% )。这表明**“技能切换能力”与“单技能掌握程度”是两个相对独立的能力维度**。

2. 核心概念:Skill Entropy(技能熵)

为量化任务内部技能切换的固有难度,论文提出了Skill Entropy SkE(s_a, s_b) ,一种有向的成对度量,用于衡量在推理链中从技能 s_a 切换到技能 s_b 的困难程度。其定义为参考模型在单技能设置下的平均准确率与跨技能设置下准确率之比(经平滑处理):
SkE(s_a, s_b) = (frac1) / (2)(Accuracy(s_a) + Accuracy(s_b)) + αAccuracy(s_a, s_b) + α

进一步地,一个长度为 L 的任务 τ 的任务级技能熵定义为其技能序列上所有相邻切换的平均值:
SkE(τ) = (1) / (L-1)∑(i=1)^(L-1) SkE(s_i, s(i+1))

3. 评估基准:Skill2-Bench

基于技能熵,论文构建了 Skill2-Bench 基准:

  • 覆盖 9 个领域(数学、科学、编码、逻辑、信息抽取、规划、创意写作、上下文检索、指令遵循),共计 558 个细粒度技能
  • 包含 300 个跨技能长程任务(长度 2 sim 10 ),每个任务被分配一个任务级技能熵分数,并划分为低、中、高三个难度级别。

评估发现:在 12 个模型(8 个前沿模型 + 4 个开源模型)上的实验表明,几乎所有模型的准确率都随任务级技能熵的增加而近乎单调下降。模型最常见的失效模式是在后续步骤中复用前一步的技能和答案模态,而非切换至当前步骤所需的技能。

4. 训练方法:Skill-Entropy RL

为弥合上述鸿沟,论文将技能熵从评估指标转化为训练信号,提出 Skill-Entropy RL

  • 结构化输出:模型在回答每步问题前,需显式预测该步调用的技能标签(<skill> 标签),输出格式为交替的 <skill><answer>
  • 复合奖励函数:在 GRPO 框架下,奖励 r 结合了两部分:
  • 答案奖励 r_(ans) :各步答案正确性的平均值;
  • 技能熵奖励 r(ent) :衡量模型预测的技能序列所对应的任务级技能熵,与黄金技能序列的难度分布(经 CDF 排名归一化)的对齐程度:
    r
    (ent) = 1 - |rho - rho^star|

5. 主要实验结果

  • 主实验:在 Qwen3-4B-Instruct 上,Skill-Entropy RL 将 Skill2-Bench 总分从基线的 34.4% 提升至 68.4%;在 Qwen3-1.7B 上从 14.6% 提升至 40.1%,显著优于标准 GRPO 及 Skill-Distill、STAT 等技能感知基线。
  • 泛化性:训练仅使用 6 个可验证领域,但在 3 个未见过的开放式领域测试时仍有提升,且能迁移至 5 个外部基准(MuSR、LongBench-MuSiQue、GPQA-Diamond、MMLU、IFEval)。
  • 即插即用:将相同框架应用于现成的 OpenR1-Math 数据(自动标注每步技能后),在 6 个数学基准上平均比 GRPO 高 +1.9%,比基座模型高 +7.7%,表明技能熵是一种可复用的通用训练信号。

6. 主要贡献

  • 形式化了跨技能长程任务,并引入技能熵作为有向成对度量,量化技能切换难度。
  • 发布了 Skill2-Bench,一个覆盖 9 大领域、558 个技能、按技能熵分级的基准,暴露了现有单领域评估无法检测的技能切换脆弱性。
  • 提出了 Skill-Entropy RL,将技能熵显式纳入强化学习奖励,显著提升了开源模型的跨技能推理能力,且能迁移至未见领域和现成数据集。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yinghui He,Ling Yang,Jiarui Liu,Yongjin Yang,Lechen Zhang,Yingcheng Wu,Zhenfei Yin,Mengdi Wang,Sanjeev Arora

PDF URL: https://arxiv.org/pdf/2608.05139.pdf

Arxiv URL: https://arxiv.org/abs/2608.05139

Arxiv ID: 2608.05139

CoolPaper URL: https://papers.cool/arxiv/2608.05139

Published: 2026-08-07T01:55:10.890Z

Updated: 2026-08-07T01:55:10.890Z


7. GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks

Abstract:Agent self-evolution updates an agent’s persistent state from prior experience and reuses it to solve related tasks more effectively. Evaluating self-evolution is difficult: existing benchmarks provide limited coverage of economically valuable task domains, do not always design training and test tasks such that test-time gains can be attributed to training experience, and remain vulnerable to data contamination. We present GDPevo, an evolution-native benchmark grounded in GDP-related enterprise workflows, together with the fully automated data pipeline that generates it. Its core mechanism, rule hybridization, decomposes each enterprise workflow into atomic business rules, distributes subsets of these rules across training tasks, and recombines them in held-out test tasks so that test-time gains are attributable. GDPevo spans CRM, ERP, finance, healthcare, legal, and data-centric workflows. Its V1 release contains 120 tasks in 12 groups, with five training and five held-out test tasks per group. Full automation enables the pipeline to expand the suite to 240 tasks in 24 groups (V2) within two days, providing a practical response to contamination. Using GDPevo, we evaluate four agents, each comprising a harness and a model, under four supervision types. Self-evolution consistently improves held-out accuracy by up to 16.44 percentage points. But the best evolved agents remain far below the fully informed oracle ceiling of 91.6%, indicating that the self-evolution ability of current agents remains far from fully realized. We publicly release the pipeline, benchmark, and full evaluation results at this https URL.

中文摘要

摘要:代理自我进化通过利用先前的经验更新代理的持久状态,并将其重复使用以更有效地解决相关任务。评估自我进化是困难的:现有基准测试涵盖的经济价值任务领域有限,并且并不总是设计训练任务和测试任务,使得测试时的收益可以归因于训练经验,同时仍然容易受到数据污染的影响。我们提出了GDPevo,这是一个基于GDP相关企业工作流的原生进化基准,同时提供生成该基准的全自动数据管道。其核心机制——规则混合,将每个企业工作流分解为原子业务规则,将这些规则的子集分配到训练任务中,并在保留的测试任务中重新组合,从而使测试时的收益具有可归因性。GDPevo涵盖了CRM、ERP、金融、医疗、法律及数据中心工作流。其V1版本包含12组共120个任务,每组有5个训练任务和5个保留测试任务。全自动化使得该管道能够在两天内将套件扩展到24组共240个任务(V2),为数据污染提供了实用的应对方案。使用GDPevo,我们在四种监督类型下评估了四个代理,每个代理由一个接口和一个模型组成。自我进化在保留测试任务上始终将准确率提高了最多16.44个百分点。但最佳进化代理仍远低于充分知晓的“神谕”上限91.6%,这表明当前代理的自我进化能力仍远未完全实现。我们公开发布了该管道、基准测试和完整评估结果,网址如下 https URL。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Leijun Zhou,Zhihao Liu,Xiang Qu,Chenxu Liu,Yifei Liu,Yanke Yu,Jingzhe Xu,Xuejun Wu,Buyue Qian,Xi Chen,Yaowei Zheng,Junhao Hu

PDF URL: https://arxiv.org/pdf/2608.03764.pdf

Arxiv URL: https://arxiv.org/abs/2608.03764

Arxiv ID: 2608.03764

CoolPaper URL: https://papers.cool/arxiv/2608.03764

Published: 2026-08-07T01:55:19.345Z

Updated: 2026-08-07T01:55:19.345Z


8. Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

Abstract:Learning generalizable robot manipulation policies requires large-scale and diverse demonstration data. Egocentric human manipulation videos offer rich scene and task diversity, and prior work has shown that retargeting and rendering such videos into robot-format data can yield effective per-task policies at small scale. However, whether this approach can provide pretraining benefits for vision-language-action models at scale remains unexplored. We present \textbf{Ego2Robot}, a scalable pipeline that converts egocentric human manipulation videos into robot training data through action retargeting, robot-arm visual synthesis, and multi-level quality curation. Ego2Robot supports both curated datasets and in-the-wild videos, producing 18,561 hours of robot training data spanning 15 robot morphologies, making it the largest ego-to-robot dataset to date. To evaluate generalization, we extend RoboTwin2.0 with disentangled perturbation axes covering visual appearance, scene layout, embodiment morphology, and task semantics. Experiments show that joint pretraining on Ego2Robot-synthesized and robot data consistently improves out-of-distribution generalization across multiple perturbation types, with benefits validated on real-robot deployment. Project page: this https URL

中文摘要

摘要:学习具备广泛适应能力的机器人操作策略需要大规模且多样化的示范数据。自我视角的人类操作视频提供了丰富的场景和任务多样性,先前的研究表明,将此类视频重新定向并渲染为机器人格式的数据,可以在小规模下产生有效的单任务策略。然而,这种方法是否能够为大规模的视觉-语言-动作模型提供预训练收益仍未得到探索。我们提出了\textbf{Ego2Robot},这是一个可扩展的流水线,通过动作重定向、机器人手臂视觉合成和多层次的质量筛选,将自我视角的人类操作视频转化为机器人训练数据。Ego2Robot支持经过策划的数据集和野外视频,生成了18,561小时的机器人训练数据,涵盖15种机器人形态,使其成为迄今为止最大规模的自我视角至机器人数据集。为了评估泛化能力,我们扩展了RoboTwin2.0,使用可拆分的扰动轴覆盖视觉外观、场景布局、机器人形态和任务语义。实验表明,在Ego2Robot合成数据与机器人数据上进行联合预训练,能够在多种扰动类型下持续提高分布外泛化能力,并且在真实机器人部署中验证了其效果。项目页面:这个 https URL

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文旨在解决利用大规模以自我为中心的人类操作视频(egocentric human manipulation videos)来扩展机器人学习数据规模与多样性,从而提升视觉-语言-动作(VLA)模型的泛化能力这一核心问题。具体而言,其聚焦于以下几个关键子问题:

1. 机器人演示数据的规模与多样性瓶颈 现有大规模机器人数据集(如 Open X-Embodiment、DROID、AgibotWorld)的收集成本高昂、依赖硬件与遥操作,且在任务、场景和物体交互上的多样性受限。这直接制约了 VLA 模型在分布外(out-of-distribution, OOD)场景下的泛化性能。

2. 人类视频与机器人数据之间的多维度域鸿沟 以自我为中心的人类视频虽然海量且丰富,但无法直接用于机器人训练,主要存在以下错位:

  • 形态鸿沟(Embodiment Gap):人类手部与机器人机械臂在关节结构、运动学及执行器(如平行夹爪)上差异显著;
  • 视觉鸿沟(Visual Gap):人类手臂的视觉外观与机器人手臂完全不同,直接训练会导致严重的视觉域不匹配;
  • 动作空间鸿沟(Action Space Gap):人手操作速度与机器人遥操作速度分布差异大,且缺乏与特定机器人基座(base pose)关联的物理一致性。

3. 大规模 ego-to-robot 数据合成对 VLA 预训练的价值未被验证 先前工作仅在有限规模或单任务场景下验证了“重定向+渲染”路线的可行性,但大规模合成的 ego-to-robot 数据能否作为 VLA 模型的有效预训练数据、能否在多种扰动(视觉、场景、形态、语义)下带来互补性泛化增益,仍然是一个开放问题。

4. 缺乏解耦的泛化评估协议 现有基准(如 RoboTwin 2.0)通常将多种分布偏移(背景、光照、物体、语言、形态等)捆绑为单一 OOD 指标,难以精细分析预训练数据在哪些维度上真正提升了策略的鲁棒性。

为应对上述问题,论文提出了 Ego2Robot——一个端到端的可扩展流水线,通过动作对齐(action alignment)、视觉对齐(visual alignment)与多级质量筛选(quality curation),将约 1,940 小时的人类第一视角视频转换为覆盖 15 种机器人形态的 18,561 小时合成训练数据;并进一步构建了基于 RoboTwin 2.0 扩展的解耦评估框架,独立评测视觉外观、场景布局、形态迁移与任务语义四个轴上的泛化性能。

Q: 有哪些相关研究?

根据论文第2节(Related Work),相关研究可归纳为以下三个方向:

1. 机器人数据扩展与从人类数据学习

该方向探讨如何通过大规模机器人数据或人类操作视频来提升策略学习与泛化能力。

  • 大规模机器人数据集与采集系统
    代表性工作包括 Open X-Embodiment
    6
    DROID
    7
    AgibotWorld
    8
    等,旨在通过汇集多平台、多任务的遥操作数据来扩展训练规模;另有 UMI
    9
    ALOHA
    10
    GELLO
    11
    等低成本采集框架,试图降低数据收集门槛。然而,这类数据仍受限于硬件可及性、采集成本与交互多样性不足。

  • 基于人类视频的表征与先验学习
    早期工作主要利用人类视频进行辅助性预训练,而非直接生成机器人训练数据,例如视觉表征预训练(R3M
    19
    、MVP
    20
    VIP
    21
    )、奖励学习
    22
    、运动先验提取
    23
    、以及点跟踪与流估计(Flow As Cross-Domain Interface
    24
    Motion Tracks
    25
    )。这些方法仍需依赖机器人数据来弥补形态鸿沟。

  • 人类视频到机器人策略的直接迁移
    近年来出现了更为直接的利用方式:

  • 联合训练:将第一视角人类视频与机器人数据共同训练,如 EgoMimic
    15
    EgoScale
    26
    BEING-H0 / H0.5
    27, 28
    ViTRA
    29

  • 重定向与渲染:通过将人手动作重定向到机器人运动学,并在视觉上替换为人类手臂,生成机器人格式的演示数据。代表性工作包括 PHANTOM
    14
    EasyMimic
    30
    ,以及采用形态掩码(embodiment masking)的 EgoMimic
    15

    论文指出,上述重定向-渲染路线此前仅在有限规模或单任务场景下验证,尚未有工作系统性地验证其作为 VLA 模型大规模预训练数据的有效性。

2. 机器人学习中的数据增强

该方向关注在不额外采集真实机器人数据的前提下,通过合成或编辑手段扩充训练分布。

  • 仿真增强
    MimicGen
    31
    RoboCasa
    32
    利用仿真环境生成大规模合成演示或数字孪生场景,以扩展任务与布局多样性。

  • 跨形态视觉增强(机器人到机器人)
    为缓解不同机器人平台之间的视觉域差异,RoviAug
    33
    Mirage
    34
    OXEAugE
    35
    等通过图像修复(inpainting)和编辑技术,将源机器人视觉外观转换为目标机器人形态。
    与这些工作不同,本文的 Ego2Robot 将增强对象从“机器人-机器人”拓展到“人类-机器人”,利用更为海量的人类第一视角视频合成 15 种机器人形态的训练数据,并系统评估其在多维度扰动下的泛化增益。

3. 机器人泛化基准

该方向关注如何评估机器人策略在分布外条件下的鲁棒性。

  • 传统操作基准
    RoboTwin
    36, 16
    LIBERO
    37
    CALVIN
    38
    RLBench
    39
    SIMPLER
    40
    等提供了标准化的任务与评估协议,但通常将多种扰动因素(视觉、布局、物体、语言等)捆绑为单一 OOD 指标,难以归因失败原因。

  • 多形态仿真平台
    ManiSkill2/3
    41, 42
    RoboCasa
    32
    支持多种机器人配置,但缺乏标准化的跨形态零样本迁移评估。

  • 解耦扰动基准
    近期工作开始将泛化维度解耦,如 Colosseum
    43
    LIBERO-Plus
    44
    LIBERO-PRO
    45
    ,在单臂设置下分别评测视觉、场景或物体扰动。
    RoboTwin 2.0
    16
    EBench
    46
    支持双臂操作与跨形态评估,但仍主要报告捆绑式(bundled)结果。

本文在 RoboTwin 2.0 基础上进行扩展,将扰动解耦为四个独立坐标轴——视觉外观(Visual Appearance)场景布局(Scene Layout)形态迁移(Embodiment)任务语义(Task Semantics),从而能够精细分析 ego-to-robot 合成数据在哪些泛化维度上提供了互补价值。

Q: 论文如何解决这个问题?

论文通过提出 Ego2Robot 这一端到端的可扩展合成流水线,以及配套的解耦评估协议,系统性地解决了从人类第一视角视频到机器人训练数据的转换与验证问题。核心方案可分为以下五个层面:

1. 总体框架:Ego2Robot Pipeline

该流水线将输入的以自我为中心的人类操作视频,通过动作对齐(Action Alignment)视觉对齐(Visual Alignment)多级质量筛选(Quality Curation) 三个阶段,转换为适用于特定机器人运动学形态的训练数据。整个流程支持 15 种不同的机器人构型(如 Panda、UR5e、ARX-L5、Franka 等),最终从约 1,940 小时的原始人类视频生成了 18,561 小时的合成机器人训练数据。

2. 动作对齐(Action Alignment)

动作对齐旨在将人手运动映射为机器人末端执行器(EEF)的平行夹爪轨迹,解决人与机器人在动作空间与执行器结构上的差异。

  • 手部到夹爪的重定向(Hand-to-Gripper Retargeting)
    从检测到的 21 个手部关键点中提取紧凑的夹爪表征。定义虚拟指尖为食指与中指尖的加权和:
    p(vf) = 0.7 · p(index) + 0.3 · p(middle)
    工具中心点(TCP)与夹爪开度由拇指与虚拟指尖共同确定:
    p
    (tcp) = p(thumb) + p(vf)2, quad w = |p(thumb) - p(vf)|
    通过构建基于拇指-指尖方向的右手正交坐标系 $R =
    x, y, z
    ,将人手姿态统一映射到夹爪的朝向空间,其中 z 轴沿夹爪 jaw line, y 轴为 jaw plane 法向, x$ 轴为接近方向。

  • 时序平滑(Temporal Smoothing)
    针对逐帧手部检测引入的高频噪声,对位置与宽度应用 Savitzky-Golay 滤波,对朝向应用高斯加权 SLERP 插值,以保留运动结构的同时平滑轨迹。

  • 动作速度对齐(Action Speed Alignment)
    人类手部操作速度显著高于机器人遥操作。论文按数据源进行帧率降采样(如 ANT 和 EgoDex 降至 60%,ViTRA 降至 25%),使合成数据的速度分布与真实机器人数据匹配。

3. 视觉对齐(Visual Alignment)

视觉对齐负责将视频中的人类手臂替换为渲染的机器人手臂,消除人与机器人在视觉外观上的域鸿沟。

  • 手臂分割与移除(Arm Segmentation & Hand Removal)
    首先利用 SAM 3 生成跨帧时序一致的手臂掩码,随后采用 ProPainter 进行视频修复,在移除人类手臂的同时重建背景。

  • 机器人基座位姿搜索(Robot Base Pose Search)
    由于人类视频不包含物理机器人基座信息,需为每种机器人形态寻找最优基座位姿 T(base) = (t, R) ∈ SE(3) ,使得重定向后的轨迹在整个工作空间内运动学可行。该问题被形式化为基于网格搜索与逆运动学(IK)验证的优化:
    T
    (base)^* = argmax(T_base) (1) / (|K|) ∑(k ∈ K) 1IK(T(base)^(-1) T(ee)^k) is feasible
    其中 K 为覆盖轨迹空间极端位置的关键帧子集。候选位姿在轨迹质心周围按机器人最大工作半径 r_(max) 进行网格采样,并通过 MuJoCo 的 IK 求解器逐点验证可行性。

  • 深度感知合成(Depth-Aware Compositing)
    在原始相机视角下渲染机器人,并基于深度排序将其合成到修复后的场景中:
    I(final)(u, v) = I(robot)(u, v) & if D(robot)(u, v) < D(scene)(u, v) land M(robot)(u, v)=1 I(inpaint)(u, v) & otherwise
    这确保了机器人在几何上与场景物体产生合理的遮挡关系。

4. 多级质量筛选(Quality Curation)

为确保合成数据对预训练的有效性,论文设计了三层筛选机制:

  • L1(流水线内部筛选):在生成过程中实时标记 IK 失败、自碰撞、动作异常值或工作空间覆盖不足的帧。
  • L2(统计筛选):后验地剔除具有极端动作值、突变不连续或无效帧比例过高的轨迹。
  • L3(VLM 一致性筛选):利用视觉-语言模型(Qwen3.5)审核合成视频,判断渲染的机器人动作是否与原始人类操作语义一致,剔除语义不匹配片段。

5. 支持多样化输入与扩展评估

  • 双路径输入支持
    Path A 直接处理带有手部姿态注释的 ego 数据集(ANT、EgoDex、ViTRA、EgoVerse);Path B 面向无注释的野外视频,先通过 WiLoR 进行逐帧手部重建、DynHaMR 进行时序优化,并利用 Qwen3.5 将长视频分割为带自然语言描述的离散子任务。

  • 解耦泛化评估框架
    为精确度量合成数据的预训练价值,论文扩展了 RoboTwin 2.0,将传统捆绑式 OOD 评估解耦为四个独立扰动轴:

  1. 视觉外观:背景纹理、光照变化、机器人颜色偏移;
  2. 场景布局:桌面高度、干扰物体、相机视角偏移;
  3. 形态迁移:零样本跨形态迁移(UR5-WSG、ARX-X5、Franka Panda);
  4. 任务语义:未见物体实例、口语化改写指令。
    这种解耦设计使得能够精细归因模型在哪些维度上受益于 ego-to-robot 合成数据。

Q: 论文做了哪些实验?

论文围绕 Ego2Robot 合成数据对 VLA 模型预训练及泛化性能的影响,在仿真基准与真实机器人平台上开展了系统性实验,具体包括以下五个部分:

1. 实验设置(Experimental Setup)

  • 模型架构:采用以 Qwen3.5-4B 为视觉-语言骨干、Diffusion Transformer(DiT)为动作头的 VLA 架构。模型预测 32 步动作块(action chunks),使用相机坐标系下的相对末端执行器(camera-frame relative EEF)动作表示,扩散过程为 8 步。
  • 训练协议:预训练在 8 块 A100 GPU 上进行,每卡 batch size 为 12,学习率从 10^(-5) 余弦衰减至 10^(-6) ,共训练 200K 步。所有配置处理的样本总量相同(约 19.2M 帧),以保证公平对比。微调阶段加载预训练权重,使用 ColorJitter 增强,训练 50K 步。
  • 预训练数据配置:共比较四种设置:
  1. Robot-only:仅真实机器人数据(DROID + AgibotWorld + InternData,约 6,565 小时);
  2. Ego2R+Robot (1:3):合成数据与机器人数据按 1:3 混合;
  3. Ego2R+Robot (3:1):合成数据与机器人数据按 3:1 混合;
  4. Ego2R+Robot (1:1):合成数据与机器人数据按 1:1 混合。
  • 微调与评估:在 RoboTwin 2.0 的 50 个干净场景任务(每任务 50 条演示)上微调;在 12 种解耦扰动设置下各评估 50 个 episode。EBench 模型在其自有训练集上单独微调。真实机器人实验在 ARX ACone 平台上开展。

2. 主要结果(Main Results)

RoboTwin 2.0EBench 上,论文对比了不同数据混合比例下的策略成功率。

  • 整体性能(Table 1):Ego2R+Robot (1:1) 在七个评估维度中的五项取得领先。在 RoboTwin Randomized 设置下达到 53.5%(较 Robot-only 的 50.9% 提升 2.6%),同时在 Clean 设置下达到 68.1%(提升 5.9%)。1:3 比例增益有限,而 3:1 与 1:1 带来显著改进。
  • 按扰动维度分解(Table 2):
  • 视觉外观(Visual Appearance):1:1 比例下,背景扰动提升 +4%,光照扰动提升 +8%,机器人颜色扰动提升 +6%,表明多场景 ego 视频与多形态渲染显著增强了视觉鲁棒性。
  • 场景布局(Scene Layout):相机视角偏移鲁棒性提升 +6%(1:1),受益于 ego 视频自然包含的多样化头戴视角。
  • 形态迁移(Embodiment):ARX-X5 上从 44% 提升至 51%(1:1),UR5-WSG 在 3:1 比例下达到峰值 31%,直接受益于预训练阶段接触 15 种机器人形态。Franka Panda 因运动学差异过大,提升有限(<7%)。
  • 任务语义(Task Semantics):未见物体实例泛化从 29% 提升至 40%(3:1,+11%);口语化改写指令鲁棒性在 1:1 比例下达到 69%(+5.4%)。
  • EBench 验证:在视角更接近 ego 场景的 EBench 上,3:1 比例取得最佳成绩 51.7%,较 Robot-only 提升 +12.1%,说明当视角偏置部分匹配时,联合预训练收益被放大。

3. 消融实验(Ablation Studies)

为隔离 pipeline 各组件的贡献,论文在仅使用 ego 源数据(不含真实机器人数据)的条件下进行了预训练消融(Figure 3)。

  • Pipeline 对齐的必要性:直接用原始 ego 视频进行联合预训练,在 RoboTwin Randomized 上仅取得 28.1% 的成功率;经过 Ego2Robot 完整流水线处理(单形态渲染后)提升至 31.7%(+3.6%),验证了视觉与动作对齐阶段的价值。
  • 形态数量扩展的增益:将支持的机器人形态从 1 种逐步增加到 15 种,性能从 31.7% 稳步提升至 33.5%
  • 原始 ego 数据的补充作用:在 15 形态 Ego2R 数据基础上额外加入原始 ego 视频(视为第 16 种“形态”),成功率进一步跃升至 37.3%,表明未经渲染的 ego 数据仍能作为多样化的动作与视觉分布来源。

4. 真实机器人实验(Real Robot Experiments)

ARX ACone 双机械臂平台上,论文评估了五个长程操作任务(Figure 4、Figure 5):

  • Put Fruits:将水果放入篮子;
  • Put Blocks:打开抽屉、放入积木、关闭抽屉;
  • Fold Towel:两次折叠毛巾;
  • Sweep Trash:拾取扫帚、清扫、倾倒、归位;
  • Insert Screw:双手协作递送并旋入螺丝。

实验设置三种配置:

  1. Robot-only:仅真实机器人预训练 + 20 条遥操作演示微调;
  2. Mix:Ego2R+Robot (1:1) 预训练 + 相同遥操作演示微调;
  3. Mix + Ego2R Play:在 Mix 预训练基础上,微调时将遥操作演示与 Ego2R 流水线转换的 ego 视频按 1:1 混合。

结果:Mix + Ego2R Play 在所有五项任务中均取得最高成功率,其中 Put Blocks 提升 +14%、Insert Screw 提升 +13%(相对于 Robot-only)。仅 Mix 预训练已优于 Robot-only,而加入 Ego2R Play 合成数据后进一步带来一致增益,证明随意采集的第一视角人类视频经流水线转换后可成为有效的训练信号。

5. 补充对比与逐任务分析(Additional Results)

  • 与 Pi0.5 的对比(Appendix F.1,Figure 9):在相同 RoboTwin EEF 设置下,Ego2R+Robot (1:1) 在几乎所有视觉、场景、形态与语义扰动设置上均优于 Robot-only 基线。
  • 逐任务成功率(Appendix F.2,Table 5):报告了全部 50 个 RoboTwin 任务在 Clean 与 Randomized 条件下,Pi0.5 与四种数据配置(Robot-only、Ego2R 1:3、3:1、1:1)的详细成功率,为分析任务级差异提供了细粒度数据。

Q: 有什么可以进一步探索的点?

基于论文第6节(Limitations)及全文实验洞察,可进一步探索的研究方向包括但不限于以下几个方面:

1. 从平行夹爪到灵巧多指手

当前动作重定向将人手映射为平行夹爪(parallel-jaw gripper),丢失了手指的精细关节运动信息。未来工作可探索:

  • 将人手 21 关键点映射至多自由度灵巧手(dexterous multi-finger hand),如 Shadow Hand 或 Allegro Hand;
  • 保留手指关节级动作( w 仅表示开度,未来可扩展为多维手指姿态 θ_(hand) ),从而迁移需要精细捏取、旋转、滑动等更广泛的操纵技能。

2. 提升视觉合成保真度

现有视觉对齐依赖视频修复(inpainting)深度感知合成(depth-aware compositing),在严重遮挡、复杂光照或透明/反光物体场景下易产生伪影。潜在改进包括:

  • 引入生成式模型(如视频扩散模型或 NeRF/3DGS 场景重建)替代基于深度的前景叠加,实现更逼真的机器人手臂与场景光照、阴影、材质的一致性融合;
  • 显式建模环境光估计反射一致性,减小残留的视觉域差异。

3. 扩展评估任务与形态覆盖

当前实验主要围绕 RoboTwin 2.0 的任务集展开,技能类型集中于桌面级双臂操作。后续可扩展至:

  • 移动操作(mobile manipulation):结合导航底座与机械臂,检验 ego-to-robot 数据在更大工作空间下的有效性;
  • 人形机器人全身控制:将人类全身 ego 视频(如家务活动)重定向到人形机器人(humanoid)的全身动作,验证流水线在更高维形态空间中的可扩展性;
  • 长程复合任务(long-horizon tasks):当前任务多为短程操作,扩展到需要 10+ 步骤的复杂任务链。

4. 跨越极大运动学差距的形态迁移

实验表明,Franka Panda 上的零样本迁移成功率仍低于 7%,反映出当目标机器人与预训练形态的运动学差异(连杆长度、关节构型、工作空间)过大时,相机坐标系相对动作表示的泛化能力受限。未来可探索:

  • 显式引入形态感知(embodiment-aware)编码,如将机器人 URDF 参数或运动学特征注入策略网络;
  • 基于自适应归一化或**元学习(meta-learning)**在线调整动作输出,以适配未见过的极端形态。

5. 融合被忽略的物理模态

人类视频仅提供视觉与运动学信息,缺乏机器人实际操作中关键的力/触觉反馈。后续研究可尝试:

  • 在重定向过程中结合物理仿真(如 MuJoCo 接触力估计),为合成数据生成伪力矩或触觉标签;
  • 训练多模态 VLA,将合成视觉-动作数据与真实或仿真的触觉数据对齐,提升对接触丰富任务的鲁棒性。

6. 动态数据混合与课程学习

当前实验采用固定的 Ego2R 与真实机器人数据混合比例(1:3、1:1、3:1)。未来可研究:

  • 自适应采样策略:根据训练过程中的验证损失或 OOD 表现,动态调整合成数据与真实数据的采样权重;
  • 课程学习(curriculum learning):早期训练使用大量易合成的 ego 数据学习通用视觉-语言先验,后期逐步增加真实机器人数据以精调物理一致性。

7. 在线与实时流水线部署

现有 Ego2Robot 为离线批量处理(offline batch processing),限制了其对快速变化场景的响应能力。值得探索的方向包括:

  • 开发**流式处理(streaming)**版本,支持将实时采集的人类 ego 视频即时转换为机器人训练数据;
  • 结合持续学习(continual learning),使机器人能够在部署过程中不断利用新生成的人类视频数据自我更新。

8. 质量筛选机制的自动化与可解释性

当前 L3 质量筛选依赖**视觉-语言模型(VLM)**进行语义一致性判断,存在计算成本高、阈值敏感及潜在误判的问题。可进一步研究:

  • 训练轻量化的专用质量评估网络,替代通用 VLM,以提升筛选效率与准确性;
  • 建立可解释的失败归因框架,不仅剔除低质量片段,还能反馈给上游模块(如重定向或基座搜索)进行针对性修正。

9. 处理更复杂的场景拓扑

当前场景以桌面级静态环境为主,未来可扩展至:

  • 非结构化环境(如户外、厨房、仓库),其中背景动态变化、光照极端、物体堆叠复杂;
  • 动态物体与交互者:视频中存在其他运动人类或物体,需要更鲁棒的时序分割与背景修复策略。

Q: 总结一下论文的主要内容

本文提出 Ego2Robot,一种将大规模以自我为中心的人类操作视频(egocentric human videos)转化为机器人训练数据的可扩展范式,并系统验证了其作为视觉-语言-动作(VLA)模型预训练数据对分布外(OOD)泛化的增益。

核心问题

现有机器人演示数据的收集受限于硬件成本、遥操作开销与场景多样性不足,制约了 VLA 模型的泛化能力。人类第一视角视频虽海量且多样,但与人形机器人存在形态鸿沟(hand vs. robot arm)、视觉鸿沟(human arm vs. robot appearance)与动作速度鸿沟,无法直接用于训练。

Ego2Robot 流水线

本文设计了一个三阶段端到端流水线(支持带注释数据集与纯视频两条输入路径):

  1. 动作对齐:将 21 个手部关键点重定向为平行夹爪的末端执行器(EEF)轨迹。定义虚拟指尖
    p(vf) = 0.7 · p(index) + 0.3 · p(middle)
    并据此计算工具中心点 p
    (tcp) 、开度 w 与抓取朝向 $R =
    x, y, z
    $;通过 Savitzky-Golay 滤波与 SLERP 进行时序平滑;按数据源降采样以匹配机器人动作速度分布。
  2. 视觉对齐:利用 SAM 3 分割手臂区域,ProPainter 修复背景;通过网格搜索与 MuJoCo 逆运动学(IK)优化求解机器人基座位姿 T(base) ∈ SE(3) ,确保轨迹运动学可行;最终以深度感知方式将渲染的机器人合成到修复场景中:
    I
    (final)(u, v) = I(robot)(u, v) & if D(robot)(u, v) < D(scene)(u, v) land M(robot)(u, v)=1 I_(inpaint)(u, v) & otherwise

  3. 多级质量筛选:L1(流水线内部标记 IK 失败、自碰撞)、L2(统计异常值剔除)、L3(VLM 语义一致性审核)。

该流水线支持 15 种机器人形态(如 Panda、UR5e、ARX-L5、Franka 等),将约 1,940 小时的原始人类视频(ANT、EgoDex、ViTRA、EgoVerse)转换为 18,561 小时合成机器人训练数据,为迄今最大规模的 ego-to-robot 数据集。

解耦泛化评估框架

为精细度量合成数据的预训练价值,本文扩展 RoboTwin 2.0,将传统捆绑式 OOD 评估解耦为四个独立坐标轴:

  • 视觉外观:背景纹理、光照变化、机器人颜色偏移;
  • 场景布局:桌面高度、干扰物、相机视角偏移;
  • 形态迁移:零样本跨形态迁移(ARX-X5、UR5-WSG、Franka Panda);
  • 任务语义:未见物体实例、口语化改写指令。

主要实验发现

在 Qwen3.5-4B + DiT 的 VLA 架构上,论文对比了仅真实机器人数据与不同混合比例的 Ego2Robot 合成数据:

  • 联合预训练持续提升 OOD 性能:Ego2R+Robot (1:1) 在 RoboTwin Randomized 上达到 53.5%(较 Robot-only 提升 2.6%),在 Clean 上达 68.1%(提升 5.9%)。
  • 视觉与语义维度受益最显著:光照鲁棒性提升 +8%,机器人颜色偏移 +6%,未见物体 +11%,口语化指令 +5.4%。
  • 形态迁移部分可行:ARX-X5 提升 +7.1%(1:1),UR5-WSG 在 3:1 比例下峰值达 31%,但 Franka 因运动学差距过大仍低于 7%。
  • 真实机器人验证:在 ARX ACone 平台上的 5 个长程任务(放水果、叠毛巾、拧螺丝等)中,使用 Ego2Robot 合成数据微调的模型全面优于仅真实数据基线,其中 Put Blocks 与 Insert Screw 分别提升 14% 与 13%。
  • 消融实验:将形态数量从 1 种扩展至 15 种,在仅 ego 数据预训练条件下性能从 31.7% 稳步提升至 33.5%;加入原始 ego 数据作为第 16 种“形态”后进一步跃升至 37.3%,验证了流水线对齐与多形态多样性的独立贡献。

局限与未来方向

当前工作限于平行夹爪映射、修复-合成视觉保真度有待提升、评估任务范围集中于 RoboTwin 2.0 设定。未来可向灵巧手重定向生成式渲染移动操作与人形全身控制、以及动态数据课程等方向拓展。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Ye Wang,Pei Lin,Xiong-Hui Chen,Haoqi Yuan,Zhixuan Liang,Yiyang Huang,Anzhe Chen,Zixing Lei,Jie Zhang,Tao Zhang,Haoyang Li,Tong Zhang,Chenxi Xiao,Ziyuan Jiao,Qin Jin

PDF URL: https://arxiv.org/pdf/2608.02580.pdf

Arxiv URL: https://arxiv.org/abs/2608.02580

Arxiv ID: 2608.02580

CoolPaper URL: https://papers.cool/arxiv/2608.02580

Published: 2026-08-07T01:56:59.791Z

Updated: 2026-08-07T01:56:59.791Z


9. When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

Abstract:On-Policy distillation (OPD) transfers teacher capabilities by supervising student-sampled trajectories with dense token-level teacher signals. Recent selective OPD methods improve this process by prioritizing signals that are confident, informative, or learnable. However, the assumptions overlook a fundamental failure mode of language models: their token-level judgments can be driven by input-agnostic language priors, formatting conventions, or stereotyped reasoning templates rather than task-specific evidence. We refer to such optimization-relevant but weakly input-grounded supervision as spurious signals in OPD, which may produce large gradients while contributing little task-improving direction. To mitigate this issue, we propose SA-OPD, a Spurious-Signal-Aware On-Policy Distillation framework that identifies and filters misleading token-level supervision based on input-groundedness and optimization impact. SA-OPD introduces a lightweight input-groundedness proxy estimating whether a token-level distillation signal truly depends on the input. It then filters only tokens that simultaneously exhibit low input-groundedness and extreme distillation divergence, thereby removing high-impact spurious updates and achieving fine-grained OPD optimization. Extensive experiments on both large language model (LLM) and vision-language model (VLM) settings demonstrate that SA-OPD consistently outperforms Vanilla OPD and competitive selective methods. These results establish input-groundedness as a key dimension for OPD supervision selection and offer a simple, effective strategy for mitigating spurious updates.

中文摘要

摘要:在策略内蒸馏(On-Policy Distillation,OPD)中,通过使用教师提供的密集令牌级信号监督学生采样的轨迹来转移教师能力。最近的选择性OPD方法通过优先使用自信、信息量大或可学习的信号来改进这一过程。然而,这些假设忽略了语言模型的一个基本失败模式:它们的令牌级判断可能由与输入无关的语言先验、格式约定或刻板推理模板驱动,而非任务特定的证据。我们将这种与优化相关但对输入依赖性弱的监督称为OPD中的虚假信号,这些信号可能产生较大梯度,但对任务改进的方向贡献甚微。为缓解这一问题,我们提出了SA-OPD,一种虚假信号感知的策略内蒸馏框架,通过基于输入依赖性和优化影响识别和过滤误导性的令牌级监督。SA-OPD引入了一个轻量级的输入依赖性代理,用于估计令牌级蒸馏信号是否真正依赖输入。然后,它仅过滤同时表现出低输入依赖性和极端蒸馏差异的令牌,从而去除高影响的虚假更新,实现精细的OPD优化。在大语言模型(LLM)和视觉-语言模型(VLM)设置上的大量实验表明,SA-OPD始终优于标准OPD和其他有竞争力的选择性方法。这些结果确立了输入依赖性作为OPD监督选择的关键维度,并提供了一种简单有效的策略来缓解虚假更新。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文旨在解决在线策略蒸馏(On-Policy Distillation, OPD)中由教师模型产生的虚假信号(spurious signals)导致的优化失败问题

具体而言,论文试图解决以下几个层面的问题:

1. OPD中教师监督的可靠性缺陷

在OPD中,学生模型采样轨迹,并由教师模型提供密集的token级监督信号。现有选择性OPD方法主要依据置信度信息量可学习性来筛选监督信号,但其基本假设是:教师判断本身是可靠的。论文指出,这一假设忽略了语言模型的一个根本缺陷:

教师模型的token级判断可能并非由任务特定的输入证据驱动,而是由输入无关的语言先验格式约定刻板推理模板所支配。

2. 虚假信号的形式化与危害

论文将这类优化相关但弱输入接地的监督定义为虚假信号,并分析了其危害性:

  • 大梯度但弱任务对齐:虚假信号可表示为 A_t = A_t^(grd) + A_t^(prior) ,其中先验驱动分量 A_t^(prior) 会产生显著的梯度能量 $E
    |g_t^(prior)|^2
    gg 0 ,但其与理想任务改进方向的对齐度接近零 E
    langle g_t^(prior), g_t^star rangle
    ≈ 0$。
  • 低信噪比(SNR)更新:这类信号导致梯度信噪比下降:
    SNR_t = |E[g_t^(grd)]|^2E[|g_t^(prior)|^2]
    当梯度功率由输入无关分量主导时,学生模型继承的是教师的输入无关偏见,而非任务相关的知识。
  • 参数漂移:即使先验驱动的更新均值为零,其持续的二阶矩能量仍会导致参数轨迹偏离以输入接地信号为基准的理想路径。

3. 现有诊断指标的盲区

常见的OPD诊断指标(如熵、教师-学生分歧、推理模式一致性)只能衡量信号的强度差异性可学习性,但无法判断该信号是否真正依赖于当前输入。因此,一个token可能在现有标准下显得”信息丰富”,实则其教师信号完全由语言先验驱动。

4. 提出的解决框架:SA-OPD

为应对上述问题,论文提出Spurious-Signal-Aware On-Policy Distillation (SA-OPD),其核心解决策略包括:

  • 输入接地性代理估计:通过比较token在原始输入上下文去除任务输入的残差上下文下的教师-学生分歧差异,构造轻量化的输入接地性代理:
    Delta_t^(IG) = |A_t^(full) - A_t^(res)|
    若去除输入后分歧几乎不变,则该信号极可能由先验模板主导。

  • 双重条件过滤:仅过滤同时满足以下两个条件的token:

  1. 低输入接地性( Delta_t^(IG) 小)
  2. 高优化影响( |A_t^(full)| 大)

通过动态控制被过滤的损失质量比(FLMR),在抑制虚假高影响更新的同时,保留有效的教师监督。

  • 广泛的实证验证:在大型语言模型(LLM)数学推理与视觉语言模型(VLM)视觉理解/推理任务上,SA-OPD一致优于标准OPD及竞争性选择性基线,证明了输入接地性作为OPD监督选择关键维度的有效性。

简言之,该论文识别并形式化了OPD中一个被忽视的关键失败模式——高影响但弱输入接地的虚假蒸馏信号,并提供了一种无需外部验证标签、计算开销可控的细粒度过滤策略,以提升密集监督蒸馏的有效性与稳定性。

Q: 有哪些相关研究?

根据论文第2节内容,相关研究主要围绕以下两大方向展开:

1. 在线策略蒸馏(On-Policy Distillation, OPD)

OPD 近年来作为一种有效的后训练范式受到广泛关注,其核心思想是通过在当前学生策略上采样轨迹,并由教师模型提供密集的 token 级监督,以缓解传统蒸馏中训练状态与学生策略之间的分布不匹配问题。

该方向的相关工作可进一步细分为:

  • 基础 OPD 目标与方法:早期研究提出了基于 reverse-KL 的目标函数,并强调对学生自生成错误进行监督的重要性,以改进开放式生成与推理任务。
  • 可扩展性与稳定性优化:近期工作致力于通过奖励外推(reward extrapolation)、熵感知目标(entropy-aware objectives)、推理前缀加速(reasoning-prefix acceleration)、能力感知课程(competence-aware curricula)、发散约束(divergence constraints)以及混合滚动蒸馏(rollout mixture distillation)等手段,提升 OPD 的可扩展性、稳定性与泛化能力。
  • 扩展变体:OPD 已被进一步拓展至自蒸馏(self-distillation)、强化学习与蒸馏的混合框架(hybrid RL-distillation frameworks),以及多模态蒸馏(multimodal distillation)等场景。

2. 后训练中的 Token 级选择(Token-level Selection in Post-training)

该方向的核心洞见是:并非所有 token 对策略改进的贡献都是均等的。相关研究从强化学习(RL)和 OPD 两个并行视角展开:

2.1 强化学习中的 Token 级选择

在 RL 后训练研究中,学者们识别出若干驱动策略改进或崩溃的关键 token 类型,包括:

  • 高熵分叉 token(high-entropy forking tokens)
  • 优势值与对数概率协方差(advantage–log-probability covariance)
  • 决策关键分支点(decision-critical branch points)
  • 过度自信的错误(overconfident errors)

这些研究表明,后训练应重点关注对应不确定决策、高影响分支或自信错误的 token,而非均匀对待所有 token。

2.2 OPD 中的 Token 级选择

鉴于 OPD 中教师提供密集监督,token 级别的信号分配尤为重要。代表性方法包括:

  • TIP(Token Importance in OPD):选择高熵 token,或低熵但与教师高度分歧的 token。
  • Token Teachability:基于局部可学习性(local learnability)对教师-学生分歧进行进一步筛选。
  • Entropy-Aware OPD:在高教师熵位置自适应调整 KL 方向,以保留生成多样性。
  • FiRe-OPD:结合轨迹级过滤与 token 级软重加权,在不完全丢弃监督的前提下强调信息丰富的 token。

3. 现有研究的局限与本文的互补性

上述 OPD token 选择方法共同遵循一个基本假设:一旦某个 token 是自信的、显著的或可学习的,教师的判断本身就是可靠的。它们主要关注 token 是否:

  • 不确定(uncertain)
  • 与教师存在分歧(divergent)
  • 局部可学习(locally learnable)

然而,这些标准均未检验教师判断是否与当前任务输入真正相关。一个 token 可能在上述标准下显得“信息丰富”,但其教师信号实际上由语言先验、格式约定或刻板推理模板驱动,而非输入特定的证据。

因此,本文工作对上述研究形成了关键补充:

  • 输入接地性(input-groundedness) 作为 OPD 监督选择的独立且关键维度;
  • 提出仅过滤同时具有低输入接地性与高优化影响的 token,以抑制高影响的虚假更新,同时保留输入接地的有效监督。

Q: 论文如何解决这个问题?

论文通过提出 SA-OPD(Spurious-Signal-Aware On-Policy Distillation) 框架来解决上述问题。该方法不引入额外的可训练参数或外部验证标签,而是通过一个轻量化的输入接地性估计与双重条件过滤机制,精准识别并剔除有害的虚假监督信号。具体解决方案可分为以下几个层面:

1. 核心诊断:输入接地性(Input-Groundedness)代理

论文的核心洞察是,一个真正依赖任务输入的教师信号,应当在移除输入后发生显著变化。基于这一思想,SA-OPD 对每个 token 计算两组教师–学生分歧:

  • 完整输入上下文下的分歧
    At^(full) = log πθ(yt mid x, y(<t)) - log πT(y_t mid x, y(<t))

  • 去除任务输入后的残差上下文下的分歧(保留学生生成的相同前缀):
    At^(res) = log πθ(yt mid varnothing, y(<t)) - log πT(y_t mid varnothing, y(<t))

由此定义 输入接地间隙(Input-Grounding Gap)
Delta_t^(IG) = | A_t^(full) - A_t^(res) |

该指标充当条件互信息 I(X; At mid Y(<t)) 的轻量化经验代理。若 Delta_t^(IG) 很小,说明即使移除任务输入,教师对学生该 token 的评判几乎不变,该信号极可能由输入无关的语言先验、格式偏好或刻板推理模板所主导。

2. 双重条件 Token 过滤

论文指出,虚假信号的危害性体现在两个维度的交集:不仅是弱输入接地的,还必须具有足够大的优化影响(即大的梯度贡献)。因此,SA-OPD 仅过滤同时满足以下两个条件的 token:

TokenFilteredt = 1[ Delta_t^(IG) < τ(IG) ] · 1[ | A_t^(full) | > τ_A ]

  • 低输入接地性( Delta_t^(IG) 小):确保该 token 的监督信号与当前任务输入 weakly correlated;
  • 高优化影响( |A_t^(full)| 大):确保该 token 在原 OPD 目标中占据显著的梯度质量,若不排除将实质性地干扰参数更新。

在实际实现中,SA-OPD 采用基于分位数的 top- p 选择规则:
F(p1, p_2) = Bottom(p1)( Delta_t^(IG) ) ∩ Top(p_2)( | A_t^(full) | )
即选取输入接地性最低的前 p_1 比例 token 与绝对分歧最大的前 p_2 比例 token 的交集。

3. 动态损失质量比约束(Dynamic FLMR Constraint)

固定阈值 (p_1, p_2) 在不同任务或训练阶段可能过于激进或保守。为此,SA-OPD 引入 Filtered Loss-Mass Ratio (FLMR) 来衡量被过滤 token 在总 OPD 损失中的权重占比:

FLMR(F) = ∑(t ∈ F) | A_t^(full) |∑(t ∈ V) | A_t^(full) | + ε

其中 V 为一个 batch 内所有有效响应 token。通过动态调整 p_1, p_2 ,使过滤后的损失质量比始终受限于一个超参数 β :

FLMR(F(p_1, p_2)) ≤ β

这一机制防止过滤操作过度移除仍然有效的、输入接地的教师监督,实现可靠性与优化效率之间的自适应平衡。

4. 过滤后的优化目标

在确定最终过滤集合 F 后,SA-OPD 仅在保留的 token 上执行标准的 reverse-KL 蒸馏:

L(SA) = (1) / (|mathcalV) setminus F| ∑(t ∈ V) setminus F D(KL)( πθ(· mid x, y(<t)) ,|, π_T(· mid x, y(<t)) )

5. 理论视角:梯度信噪比(Gradient SNR)

从理论层面,论文将 token 级 OPD 更新分解为输入接地分量与先验驱动分量:
gt^(OPD) = -A_t s_t = -A_t^(grd) s_t(gt^(grd)) + -A_t^(prior) s_t(g_t^(prior))

并论证先验驱动梯度 g_t^(prior) 具有弱任务对齐性(定理 1):
| E[ langle g_t^(prior), tildeg_t^star rangle ] |{√E|g_t^(prior)|^2 · √E|g_t^star|^2} ≤ kappa_t ll 1

以及低信噪比更新会导致参数漂移(定理 2):
E[ |θ_K - θ_K|^2 ] = eta^2 K v

因此,通过过滤掉那些先验驱动能量占主导的高影响 token,SA-OPD 实质上提升了有效梯度信噪比,使得学生模型从教师处继承的是输入相关的任务知识,而非输入无关的偏见与模板。

综上所述,SA-OPD 的解决路径可概括为:通过残差无输入上下文对比,诊断每个 token 的教师信号是否真正接地于任务输入;进而仅过滤那些既弱接地又高影响的 token;最终在一个受控的损失质量预算下,保留并优化来自可靠输入证据的密集监督。

Q: 论文做了哪些实验?

该论文在大型语言模型(LLM)与视觉语言模型(VLM)两种设定下,开展了系统性的实验验证,涵盖性能对比、消融研究、训练动态分析与计算效率评估。

1. 实验设置

模型与数据

实验基于 Qwen3Qwen3.5 系列模型的非思考变体(non-thinking variants),主要采用以下教师–学生配对进行蒸馏:

  • VLM 主实验:Qwen3.5-35B-A3B → Qwen3.5-2B
  • LLM 主实验:Qwen3-4B-Instruct → Qwen3-1.7B
  • 可扩展性验证:Qwen3.5-9B → Qwen3.5-2B(VLM);DeepSeek-R1-0528-Qwen3-8B → Qwen3-1.7B(LLM)

训练数据方面:

  • LLM:采用 DeepMath 数据集,保留难度等级不低于 6 的样本并随机采样 30%,获得约 7K 数学推理训练样本。
  • VLM:从 VERO-600K 中采样 Captioning & IF、Grounding、Counting & Search 子集的 10% 构建视觉理解数据;从 MMRL-30k 中采样 10% 构建视觉推理数据。

评估基准

  • VLM(6项)
  • 视觉理解:EvoChart、MMIFEval、CountQA
  • 视觉推理:MathVision、Geo3K、MathVista
  • LLM(5项):AIME 2024、AIME 2025、Math500、AMC 2023、MinervaMATH

对比基线

  • 标准 OPD:Vanilla OPD、ExOPD
  • 选择性 OPD:TIP、FiRe-OPD

2. 主要实验结果

性能对比(Table 1 与 Table 2)

在全部 11 个基准上,SA-OPD 均取得一致且显著的提升:

  • VLM 设定(Table 1):
    SA-OPD 在 6 个视觉基准上全部取得最佳或次佳表现。相较于 Vanilla OPD,视觉理解平均分数从 50.5 提升至 54.0(+3.5),视觉推理平均分数从 60.4 提升至 63.5(+3.1)。其中 CountQA(+7.2)、Geo3K(+5.0)和 MathVista(+3.2)提升尤为突出。

  • LLM 设定(Table 2):
    SA-OPD 在 5 个数学推理基准上均取得最佳或并列最佳表现,平均分数从 Vanilla OPD 的 28.5 提升至 30.4(+1.9)。相比最强基线 TIP(平均 29.3),SA-OPD 在 Math500 上提升达 3.0 分。

可扩展性验证(Table 3)

论文在不同教师–学生规模组合下验证了 SA-OPD 的鲁棒性。结果表明,无论是缩小教师规模(Qwen3.5-9B → Qwen3.5-2B)还是更换教师来源(DeepSeek-R1 → Qwen3-1.7B),SA-OPD 相较 Vanilla OPD 均保持稳定正收益,说明该方法对模型尺度与教师强度变化具有良好泛化能力。

3. 消融实验(Table 4)

为验证 SA-OPD 两个核心维度的必要性,论文在控制相近过滤比例(约 1% 差异内)的前提下,对比了以下变体:

  • Random Filter:随机过滤相同比例 token,性能提升微弱。
  • Divergence-only Filter:仅依据教师–学生分歧绝对值过滤。虽优于随机过滤,但劣于 SA-OPD,因为高分歧可能对应输入接地的有效纠正信号。
  • Input-Groundedness-only Filter:仅过滤低输入接地性 token,未考虑优化影响。在 MathVista 上有效,但整体次优,因许多弱接地 token 的梯度影响有限。
  • Proxy Replacement:将输入接地性代理中的学生侧替换为教师对数概率。表现优于单维度变体,但仍不及完整 SA-OPD。

结论:唯有同时考虑低输入接地性与高优化影响,方能最有效地识别并剔除有害 token。

4. 深入分析

训练动态差异(Figure 3)

论文对比了 LLM 数学推理与 VLM 任务的训练曲线,发现:

  • LLM 数学推理:绝对蒸馏损失在训练初期迅速下降后趋于平稳,FLMR(Filtered Loss-Mass Ratio)也快速降至接近零,表明高影响虚假信号主要集中在初始对齐阶段。
  • VLM 任务:绝对蒸馏损失与 FLMR 在全程训练中持续波动,说明 VLM 教师信号受视觉感知不确定性与语言先验纠缠影响,虚假监督是持续性而非暂时性的污染。这也解释了 SA-OPD 在 VLM 任务上增益更大的原因。

超参数敏感性(Figure 4a)

针对视觉理解任务中 FLMR 较高、易误伤有效监督的问题,论文测试了动态阈值 β 的影响。结果表明,当 β 不过于激进时,动态阈值化均能稳定带来提升;最优性能出现在 β = 1.8 处,CountQA 分数从基线 26.4 提升至 33.6。

被过滤 Token 的特征分析(Table 5 与 Figure 4b)

  • 词类分布(Table 5):被过滤 token 并非仅是格式噪声。内容词(content words)占比达 69.9%,其中大量为前文已出现过的重复 token(60.2%)、重复双词(27.9%)或重复三词(13.9%),表明模型易对局部文本上下文产生高置信度的刻板延续。
  • 熵分布(Figure 4b):被过滤 token 并非集中于高熵区域,而是有相当一部分分布在低熵区域。这说明仅凭熵无法捕捉所有虚假信号;SA-OPD 通过显式测量输入接地性,有效补充了熵基选择标准的盲区。

5. 计算开销分析(Appendix D / Table 8)

论文在 8×H20 GPU 上量化了 SA-OPD 的额外训练成本。由于仅需增加一次无输入上下文下的教师与学生前向评分(用于构造过滤掩码,无额外反向传播),实际时间开销仅为 2.64% 至 7.53%。具体而言:

  • 数学推理:+6.74%
  • 视觉理解:+7.53%
  • 视觉推理:+2.64%

这表明 SA-OPD 以极小的计算边际代价,换取了更可靠的密集监督信号。

Q: 有什么可以进一步探索的点?

基于论文所述内容,以下方向可作为后续深入研究的潜在切入点:

1. 更精细化的输入接地性度量机制

当前 SA-OPD 采用去除完整提示(no-prompt)后的分歧差异 Deltat^(IG) = |A_t^(full) - A_t^(res)| 作为条件互信息 I(X; A_t mid Y(<t)) 的轻量化代理。然而,这种二元对比可能无法捕捉输入中局部关键证据的精细贡献。未来工作可探索:

  • 基于扰动的敏感性分析:系统性地扰动输入的不同组成部分(如图像的特定区域或文本中的关键实体),观测教师–学生分歧的边际变化,从而构造更细粒度的归因分数。
  • 梯度归因方法:利用积分梯度(Integrated Gradients)或输入梯度范数,直接量化教师输出对该 token 的依赖程度,替代启发式的残差上下文对比。

2. 因果推断视角下的虚假信号归因

现有框架通过经验相关性识别虚假信号,但尚未严格建立因果关系。教师信号中的先验成分 A_t^(prior) 与输入成分 A_t^(grd) 可能存在混杂因子(confounders)。后续研究可借鉴因果推断:

  • 构造更严谨的反事实(counterfactual)残差上下文,例如保持输入的语法结构但替换任务相关的语义内容;
  • 利用前门或后门准则,从观测到的教师–学生分歧中分离出输入的因果效应,从而更准确地界定何者为”真正接地”的监督。

3. 长程推理链中的虚假信号传播与累积效应

论文主要关注单步 token 级的虚假更新。在长篇思维链(long-chain-of-thought)或复杂多步视觉推理中,早期的虚假信号可能通过自回归特性级联放大,导致后续推导偏离正确轨迹。值得探索:

  • 虚假信号在序列中的时间传播动力学:一个弱接地的早期 token 是否会导致后续 token 的输入接地性系统性下降;
  • 开发具有前瞻能力的过滤机制,不仅评估当前 token 的接地性,还评估其对未来推理步骤的潜在误导风险。

4. 与在线强化学习的深度协同

SA-OPD 目前聚焦于纯蒸馏设定。将其核心思想拓展至混合 RL–蒸馏框架(如 RLVR、R1 类方法)具有重要价值:

  • 将输入接地性作为辅助正则项或**奖励塑形(reward shaping)**信号,抑制来自任务奖励或教师监督的双重虚假激励;
  • 在策略梯度更新中引入接地性加权的优势估计,使得高接地性的轨迹片段获得更大的策略更新权重。

5. 可学习的自适应过滤门控

当前 SA-OPD 依赖基于分位数的硬过滤与动态 FLMR 约束,虽简单有效,但仍属手工设计的启发式规则。更优雅的解决方案可能是:

  • 训练一个轻量的元网络(meta-network)门控模块,以学生和教师的隐层状态为输入,预测每个 token 的”应被过滤概率”;
  • 通过元学习(meta-learning)或双层优化(bi-level optimization),使过滤策略自动适应不同任务、不同训练阶段乃至不同模态的数据特性,减少超参数 β 、 p_1 、 p_2 的调参负担。

6. 多教师一致性框架下的接地性验证

当存在多个异构教师模型时,可利用教师间分歧模式辅助判断信号的输入接地性:

  • 若多个独立教师在去除输入后对某 token 给出高度一致的评判,则该信号更可能源于共享的预训练语言先验,而非输入特定证据;
  • 构建基于集成(ensemble)或投票机制的一致性代理,可能降低对单一教师先验的依赖,进一步提升过滤的可靠性。

7. 计算效率与实时性的进一步优化

尽管 SA-OPD 的额外开销已控制在较低水平(2.64%–7.53%),但在超大规模模型或实时在线蒸馏场景中,残差上下文的二次前向传播仍不可忽略。未来可研究:

  • 蒸馏学生侧代理模型:训练学生模型自身输出一个”虚假信号指示器”,基于其内部激活(hidden activations)预测当前位置的监督是否可靠,从而完全避免对教师进行二次推理;
  • 稀疏激活与缓存策略:利用响应前缀 y_(<t) 在原始输入与无输入上下文下的计算重叠,设计更高效的 KV-Cache 复用机制,降低冗余计算。

Q: 总结一下论文的主要内容

该论文针对在线策略蒸馏(On-Policy Distillation, OPD)中教师模型产生虚假监督信号这一关键问题,提出了 SA-OPD(Spurious-Signal-Aware On-Policy Distillation) 框架,通过轻量化的输入接地性估计与双重条件过滤机制,在 LLM 与 VLM 蒸馏设定中实现了稳定且显著的性能提升。

1. 研究背景与核心问题

OPD 通过在学生策略采样的轨迹上施加密集的 token 级教师监督,缓解了传统离线蒸馏中的分布不匹配问题。现有选择性 OPD 方法主要依据教师置信度、信息量或可学习性筛选监督,但其隐含假设是:教师判断本身是可靠的

论文指出,该假设忽视了语言模型的一个根本缺陷:教师的 token 级评判可能并非由任务特定证据驱动,而是受输入无关的语言先验格式约定刻板推理模板支配。这类优化相关但弱输入接地的监督被称为虚假信号(spurious signals)。其危害性在于:

  • 可产生较大的梯度能量,但与理想任务改进方向几乎正交;
  • 导致学生继承教师的输入无关偏见,降低有效梯度信噪比(SNR);
  • 引发持续的参数漂移,尤其在 VLM 中表现为全训练周期的密集监督污染。

2. 方法:SA-OPD

为识别并剔除有害虚假信号,SA-OPD 引入以下核心机制:

(1)输入接地性代理(Input-Groundedness Proxy)

对每个学生生成的 token,计算两组教师–学生分歧:

  • 原始输入上下文下的分歧 A_t^(full)
  • 去除任务输入、仅保留已生成前缀的残差上下文下的分歧 A_t^(res)

定义输入接地间隙
Delta_t^(IG) = | A_t^(full) - A_t^(res) |

若去除输入后分歧几乎不变,则该信号极可能由语言先验或模板偏好主导,而非输入特定证据。

(2)双重条件 Token 过滤

仅过滤同时满足以下两个条件的 token:

  • 低输入接地性: Delta_t^(IG) 小
  • 高优化影响: | A_t^(full) | 大

通过 top- p 分位数选择构造候选过滤集,并引入动态损失质量比约束(FLMR)
FLMR(F) = ∑(t ∈ F) |A_t^(full)|∑(t ∈ V) |A_t^(full)| + ε ≤ β

动态调整过滤强度,防止过度移除有效监督。

(3)过滤后的蒸馏目标

仅在保留 token 上优化标准 reverse-KL 损失:
L(SA) = (1) / (|mathcalV) setminus F| ∑(t ∈ V) setminus F D(KL)( πθ(· mid x, y(<t)) ,|, π_T(· mid x, y(<t)) )

3. 理论分析

论文形式化地分解 token 级分歧为输入接地分量与先验驱动分量:
A_t = A_t^(grd) + A_t^(prior)

并证明:

  • 定理 1:先验驱动梯度具有弱输入特定对齐性,即使其梯度能量很大;
  • 定理 2:持续的低 SNR 更新会导致参数轨迹偏离理想路径,漂移量随优化步数线性增长。

这为过滤高影响但弱接地 token 提供了理论动机。

4. 实验验证

论文在 Qwen3 / Qwen3.5 系列模型上开展了系统性实验:

(1)主实验

  • LLM:Qwen3-4B-Instruct → Qwen3-1.7B,在 5 个数学推理基准(Math500、AIME、AMC、MinervaMATH)上测试。
  • VLM:Qwen3.5-35B-A3B → Qwen3.5-2B,在 6 个视觉基准(EvoChart、MMIFEval、CountQA、MathVision、Geo3K、MathVista)上测试。

结果表明,SA-OPD 在全部 11 个基准上均优于 Vanilla OPD 及竞争性选择性基线(TIP、FiRe-OPD 等)。VLM 任务增益尤为显著(视觉理解平均 +3.5,视觉推理平均 +3.1)。

(2)消融实验 验证了两个条件的必要性:仅按分歧过滤或仅按接地性过滤均劣于完整 SA-OPD;随机过滤几乎无效。

(3)训练动态与 token 分析

  • LLM 数学推理的虚假信号主要集中在训练初期;VLM 任务的虚假监督则持续全周期,解释了 VLM 上更大的增益。
  • 被过滤 token 中有大量低熵内容词(如重复出现的双词/三词),说明熵基标准无法完全捕捉虚假信号。

(4)计算开销 SA-OPD 仅需额外的无输入上下文前向评分,训练时间 overhead 仅为 2.64%–7.53%,且无需额外可训练参数。

5. 结论与贡献

论文的核心贡献可概括为:

  1. 识别并形式化了 OPD 中一个被忽视的失败模式:高影响但弱输入接地的虚假蒸馏信号;
  2. 提出 SA-OPD,一种轻量、无需外部标签的 token 级过滤框架,通过输入接地性估计与双重条件过滤抑制虚假更新;
  3. 跨模态验证:在 LLM 数学推理与 VLM 视觉理解/推理任务上均取得一致且显著的性能提升,确立了输入接地性作为可靠密集监督的关键选择维度。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yinuo Jiang,Yongjie Ye,Zhou Tao,Xiang Zhuang,Qiang Zhang,Huajun Chen,Tiankai Li

PDF URL: https://arxiv.org/pdf/2608.03632.pdf

Arxiv URL: https://arxiv.org/abs/2608.03632

Arxiv ID: 2608.03632

CoolPaper URL: https://papers.cool/arxiv/2608.03632

Published: 2026-08-07T01:57:06.623Z

Updated: 2026-08-07T01:57:06.623Z


10. NOLLI: A Difficulty-Calibrated Puzzle Benchmark for Diagnosing the English-Korean Performance Gap

Abstract:We introduce NOLLI, a procedurally generated English-Korean puzzle benchmark designed to diagnose where Korean performance gaps arise. It comprises 15 puzzle types (25 tasks; 7,500 items), with every instance seed-regenerable, verified to have a unique solution, and scored deterministically. Rather than equating harder with bigger, we calibrate difficulty behaviorally, tuning each generator until a fixed reference model lands in target accuracy bands. Its three-level design combines matched direct translations, script adaptations over Hangul jamo (sub-syllabic letters), and Korean-only tasks grounded in Korean culture or orthography. We evaluate 15 frontier, open-weight, and Korean-developed models; among the 12 above a 3% overall-accuracy floor, matched English-Korean accuracy is statistically equivalent within a +/- 10 pp margin (TOST), suggesting little cost from presentation language alone. Writing-system-intensive tasks show sharper gaps: Korean Cipher falls behind English by up to 68.7 pp, whereas Cryptarithmetic over the same jamo shows no systematic penalty, and Jamo Composition accuracy predicts Korean Cipher accuracy. These contrasts are diagnostic rather than causal, consistent with difficulty in multi-step sub-syllabic execution. Korean-only tasks separate rule-application deficits, which vary in sign, from a Kinship deficit positive in all 12. Finally, a salient size measure fails to grow from Easy to Hard in 7 of 15 types, making structural size an unreliable proxy for empirical difficulty.

中文摘要

摘要:我们介绍了NOLLI,这是一个程序生成的英韩谜题基准,旨在诊断韩语表现差距出现的原因。它包括15种谜题类型(25个任务;7,500个题目),每个实例都可以通过种子重新生成,验证其具有唯一解,并且评分是确定性的。我们不是将难度等同于题目数量,而是根据行为对难度进行校准,调整每个生成器,直到固定参考模型达到目标准确率范围。其三级设计结合了匹配的直接翻译、基于韩文字母(音节子字母)的文字适配,以及以韩国文化或正字法为基础的仅韩语任务。我们评估了15个前沿、公开权重和韩国开发的模型;在12个总体准确率高于3%的模型中,匹配的英韩准确率在±10个百分点范围内统计上相当(TOST),表明仅语言呈现几乎不会带来成本。对文字系统要求高的任务显示出更明显的差距:韩文密码任务落后于英文高达68.7个百分点,而在相同音节子字母上进行的算术编码任务没有系统性的惩罚,音节子字母组合准确率可预测韩文密码任务的准确率。这些对比是诊断性的,而非因果性的,与多步骤子音节执行困难一致。仅韩语任务区分了规则应用缺陷(符号变化不一),以及亲属关系缺陷(在所有12个模型中均为正向)。最后,一个显著的大小度量在15种类型中有7种从简单到困难未增加,使结构大小成为经验难度的不可靠代理。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Dasol Choi,Joonyong Park,Daegon Yu,Soo Yong Kim,Youngsook Song,Seunghyeok Hong

PDF URL: https://arxiv.org/pdf/2608.04397.pdf

Arxiv URL: https://arxiv.org/abs/2608.04397

Arxiv ID: 2608.04397

CoolPaper URL: https://papers.cool/arxiv/2608.04397

Published: 2026-08-07T01:57:14.105Z

Updated: 2026-08-07T01:57:14.105Z


11. AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

Abstract:While instruction-based video editing has advanced rapidly, real-world videos contain tightly coupled audio and visual signals, and editing one modality often requires coordinated changes in the other. Existing benchmarks primarily evaluate visual transformations on silent clips or isolated audio editing, leaving complex audio-visual editing and cross-modal consistency underexplored. We introduce AVE-Compass, a comprehensive benchmark with 145 curated source videos, 196 audio-visually coupled editing instructions, and 2,688 fine-grained checklist items. It evaluates Instruction Following, Fidelity Preserving, Realism, and Editing Intent through checklist-based MLLM judging and a dedicated realism rubric, complemented by automated cross-modal, video, and audio metrics. Extensive evaluation shows that state-of-the-art models still struggle to execute cross-modal instructions while preserving non-target content. We further propose AVE-Agent, a modular agent framework that decomposes complex instructions into dependent subtasks and iteratively improves editing results through self-reflection and evaluator feedback. AVE-Agent improves instruction execution, Fidelity Preserving, and audio-visual alignment in joint editing while maintaining competitive perceptual quality.

中文摘要

摘要:尽管基于指令的视频编辑发展迅速,但现实世界的视频包含紧密耦合的音频和视觉信号,编辑一种模态通常需要另一种模态的协调变化。现有基准主要评估静音片段上的视觉转换或独立音频编辑,对于复杂的音视频编辑和跨模态一致性研究不足。我们引入了AVE-Compass,这是一个综合基准,包含145个精心挑选的源视频、196条音视频耦合编辑指令以及2,688个细粒度检查表项目。它通过基于检查表的多模态大模型(Multimodal Large Language Model, MLLM)评判和专门的真实性评分标准评估指令执行、保真性、真实性和编辑意图,同时辅以自动化的跨模态、视频和音频指标。大量评估表明,现有最先进模型在执行跨模态指令的同时保持非目标内容仍然困难。我们进一步提出AVE-Agent,这是一种模块化代理框架,将复杂指令分解为相互依赖的子任务,并通过自我反思和评审者反馈迭代改进编辑结果。AVE-Agent在联合编辑中提升了指令执行、保真性和音视频对齐,同时保持了具有竞争力的感知质量。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Yuqing Wen,Yukai Huang,Qianqian Xie,Jiangtao Wu,Yibin Lin,Yikai Gu,Jialu Chen,Yuanxing Zhang,Jiaheng Liu

PDF URL: https://arxiv.org/pdf/2607.24821.pdf

Arxiv URL: https://arxiv.org/abs/2607.24821

Arxiv ID: 2607.24821

CoolPaper URL: https://papers.cool/arxiv/2607.24821

Published: 2026-08-07T01:58:54.783Z

Updated: 2026-08-07T01:58:54.783Z


12. HelloWorld: Enabling Socially Interactive Characters in Video World Models

Abstract:Despite the remarkable recent progress of video world models, social interaction between users and the characters within these worlds remains unsupported. To fill this gap, we present HelloWorld, a video world model that enables social interaction with in-world characters. With a single button press, users can prompt the on-screen character to respond toward the camera, e.g., turning to the viewer, waving, nodding, or speaking a short greeting. To make these interactions natural, we propose a self-distillation pipeline that finetunes the video generation model on data synthesized by itself. Each synthesized clip contains both social interactions and camera motion, allowing the model to learn camera-pose conditioning without degrading interaction quality. At inference, we further introduce a training-free module that determines when the interaction occurs. Upon a button press, it modulates the cross-attention masks of the DiT so that the interaction-related text prompt attends only to the frames within the press window, temporally localizing the character’s response. We further build HelloWorldBench, a 400-sample benchmark with three social interaction metrics alongside three conventional metrics, for evaluation. Experiments demonstrate that HelloWorld surpasses a variety of baselines in interaction quality, while maintaining state-of-the-art picture aesthetics and camera-pose following. Project page: this https URL

中文摘要

摘要:尽管视频世界模型在近期取得了显著进展,但用户与这些世界中的角色之间的社交互动仍未得到支持。为填补这一空白,我们提出了HelloWorld,这是一种能够与世界中角色进行社交互动的视频世界模型。只需按下一个按钮,用户即可提示屏幕上的角色朝向摄像机做出反应,例如转向观众、挥手、点头或说一句简短的问候语。为了使这些互动更加自然,我们提出了一种自我蒸馏流程,将视频生成模型在自身合成的数据上进行微调。每个合成片段都包含社交互动和摄像机运动,从而使模型能够学习摄像机姿态条件而不降低互动质量。在推理阶段,我们进一步引入了一个无需训练的模块来确定互动发生的时机。按下按钮时,它会调节DiT的交叉注意力掩码,使与互动相关的文本提示只关注按钮按下窗口内的帧,从而在时间上定位角色的反应。我们还构建了HelloWorldBench,这是一个包含400个样本的基准,包括三项社交互动指标和三项传统指标,用于评估。实验表明,HelloWorld在互动质量上超过多种基线,同时保持了最先进的图片美学和摄像机姿态追踪。项目页面:该https URL

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决现有视频世界模型中用户与内部角色之间缺乏社交互动的问题。具体而言,其试图突破的局限与核心目标包括:

  • 现有模型的不足:尽管当前视频世界模型已能模拟视觉世界并支持相机控制、事件触发等交互探索,但其中的角色要么是静态的像素,要么仅表现出与环境相关的自发行为(ambient behaviors),无法响应用户的社交指令或与观众建立互动。
  • 核心任务:论文提出 HelloWorld,旨在赋予视频世界模型中的角色主动、自然的社交响应能力。通过引入一个交互按钮 F ,用户能够提示屏幕中的角色面向镜头执行特定社交动作——例如转向观众、挥手、点头、进行简短语言问候等——并确保这些动作在指定时间窗口内精确发生。

  • 关键子问题:为实现上述目标,论文同时着力解决两个伴随挑战:

  1. 在将视频生成模型转化为世界模型时,如何避免相机轨迹控制对角色社交动作质量的损害;
  2. 在推理阶段以免训练的方式精确控制社交互动发生的时间窗口,使角色仅在用户触发期间做出响应,其余时间保持环境行为。

简言之,该工作试图填补视频世界模型在用户导向的社交互动生成这一维度的空白,推动从“可探索的世界”向“可社交交互的世界”演进。

Q: 有哪些相关研究?

相关研究主要涵盖两大方向,整理如下:

1. 交互式视频世界模型(Interactive Video World Models)

该方向致力于构建可交互的视觉世界模拟器,相关工作可分为以下层次:

  • 基础视频世界模型:旨在从大规模真实或虚拟环境视频中学习视觉世界的动态演化规律,例如早期探索及后续基于视频生成模型的实现。
  • 交互控制接口:近年来研究者在世界模型中引入了多种交互控制手段,主要包括:

  • 相机轨迹控制:通过键盘或指定轨迹操控视角移动;

  • 键盘/动作控制:将用户键盘输入转换为世界中的代理行为;
  • 技能与事件控制:触发特定技能或环境事件以改变世界状态;
  • 物体级交互:支持拿起、放置物品或控制物体动力学。
  • 现有局限:尽管上述工作实现了环境探索与物体操控,但与世界内部角色的社交互动仍处空白。近期并发工作 ReactiveGWM 虽能控制 NPC 间交互,但局限于单一游戏场景,无法支持跨角色的多模态社交行为。

2. 多模态社交互动(Multimodal Social Interactions)

该方向关注人类在多模态下的社交交流行为,主要包括:

  • 社交互动理解:早期工作聚焦于识别与分析人类间的社交行为,包括:
  • 社交视频问答;
  • 社交行为分类;
  • 多模态社交对话建模。
  • 社交互动生成:随着生成模型的发展,研究转向多人物社交互动的合成,涵盖:
  • 说话视频生成:音频驱动的肖像或多人对话视频生成;
  • 社交互动视频生成:直接生成包含社交行为的人物视频;
  • 3D 人体动作生成:在三维空间中合成多人交互动作。
  • 社交世界模型:近期部分研究采用大语言模型(LLM)构建社交世界模型以模拟社交动态,但仅限于文本模态,缺乏视觉与音频等多模态交互能力,且未涉及人与非人类角色(如动物、玩具、机器人)的社交互动。

与现有工作的区别:HelloWorld 首次将用户导向的多模态社交互动引入视频世界模型,不仅覆盖动作、手势、面部表情与语音等多种交互模态,还支持人类、动物、机器人、卡通形象等多样化角色,并实现了对交互发生时刻的精确时序控制。

Q: 论文如何解决这个问题?

论文通过自蒸馏微调免训练时序控制相结合的技术路线解决该问题,并配套构建了评测基准。具体方案可分为以下三个层面:

1. 训练阶段:自蒸馏管道(Self-Distillation Pipeline)

为了让模型在获得相机轨迹控制能力的同时不损失社交互动生成质量,论文提出了一种无需外部数据、无需人工标注的自蒸馏训练策略。

  • 合成训练数据
    首先,使用冻结的基座视频生成模型(LTX-2.3)自主合成一批训练视频。提示词 y 由四部分构成:场景描述 y(scene) 、角色互动描述 y(∫er) 、相机轨迹描述 y(camera) 以及画质要求 y(quality) 。生成的视频片段同时包含社交互动相机运动,构成后续微调的监督信号。

  • 相机轨迹显式编码(Warp Video)
    对每条生成的视频,使用 Pi3X 从首帧恢复点云,并估计每帧相机位姿 C = ci(i=1)^N 。随后将首帧点云按照目标相机轨迹重投影,合成 Warp Video:
    V_(warp) = warp(x_0, C)
    该视频作为显式的几何引导,告知模型每一帧对应的相机运动,但保留遮挡/视野外区域为空洞,由模型自行补全。

  • 轻量化微调
    将 Warp Video 的可见 token 与噪声 token、首帧 token 拼接后输入视频 DiT。论文采用秩为 32 的 LoRA 对视频分支的自注意力投影矩阵进行微调,优化流匹配损失:
    L = E(z_0, t, ε) | vθ(zt, t, x_0, y(scene), y(∫er), y(quality), V(warp)) - (ε - z_0) |_2^2
    其中 z_t = (1-t)z_0 + tε 。值得注意的是,微调时显式移除文本提示中的相机描述 y
    (camera) ,从而确保相机运动完全由 Warp Video 条件控制,避免文本与几何条件冲突导致的互动质量退化。

2. 推理阶段:免训练时序交叉注意力掩码(Temporal Cross-Attention Mask)

为了在推理时精确控制社交互动发生的时刻,论文提出了一种无需额外训练的时序掩码机制。

  • 交互窗口定义
    用户在时刻按下交互按钮 F ,系统定义一个交互时间窗口 $W =
    τ_s, τ_e
    $。在此窗口内角色需响应观众,其余时间保持环境自发行为。

  • 掩码调制
    在 DiT 的交叉注意力层中,引入时序掩码 M 调制视频/音频 query 与文本 key 之间的注意力权重:
    M(ij) = -∞, & i ∉ W and j ∈ y(∫er) 0, & otherwise

Attention = softmax((QK^top) / (√d) + M) V
其中 i 为 query(视频/音频 token)的时间索引, j 为文本 token 索引, j ∈ y_(∫er) 表示属于互动描述的 token。该掩码阻止窗口 W 之外的帧去关注互动相关文本,从而将角色的社交响应时间局域化在按钮按压窗口内。该模块计算开销可忽略不计,且无需任何微调。

3. 评测基准:HelloWorldBench

为系统评估社交互动质量,论文构建了首个面向世界模型社交互动的评测基准。

  • 数据构成
    收集 120 张涵盖人类、动物、玩具及机器人的高质量首帧图像,由 LLM 设计角色适配的互动提示,并搭配四种相机轨迹(静止、扫描、推轨、环绕)与随机时序(早/中/晚),共构成 400 个评测样本

  • 三维互动指标
    将社交互动解耦为三个维度进行评估:

  1. ActAcc:衡量角色是否执行了提示指定的互动动作(VLM 八选一问答正确率);
  2. TimeAcc:衡量互动是否发生在用户指定的时序窗口内(VLM 三时段选择题正确率);
  3. GazeDev:衡量互动是否面向观众,计算角色注视方向与相机光轴的平均角度偏差。
  • 传统指标
    同时报告背景一致性(BgCons)、美学分数(Aesthetic)与相机可控性(CamCtrl),以验证模型在提升互动能力的同时未牺牲视频质量与相机跟随精度。

Q: 论文做了哪些实验?

论文在 HelloWorldBench 上开展了一系列定量、定性与感知实验,系统验证了所提出方法在社交互动、视频质量与相机控制三个维度的表现。实验内容可归纳如下:

1. 与现有基线方法的对比实验(Main Results)

  • 对比基线:选取了 5 个近期有竞争力的视频世界模型——WorldPlay、Matrix-Game 3.0、LingBot-World、SANA-WM、Warp-as-History,以及基础视频生成模型 LTX-2.3(无轨迹接口)。
  • 评测设置:所有方法在相同的文本提示与相机运动输入下生成 10 秒视频,使用 3 个不同随机种子取平均。
  • 结果(见 Table 1):
  • HelloWorld 在三个社交互动指标上全面领先:ActAcc 达到 41.4% ,TimeAcc 达到 81.7% ,GazeDev 降至 40.2^circ 。
  • 尤其在时序控制(TimeAcc)上,现有方法仅接近随机猜测水平(约 30% – 40% ),而 HelloWorld 实现了精确的时序定位。
  • 在视频质量(BgCons、Aesthetic)与相机跟随(CamCtrl)方面,HelloWorld 与最优基线相当或更优,证明自蒸馏未带来副作用。
  • 定性可视化(见 Figure 5):展示了各方法在“双臂交叉”“比心”“振翅”等提示下的生成结果。基线常出现角色不看镜头、动作错误或 hallucination(如凭空多出人物),而 HelloWorld 能生成面向观众且动作自然的互动。

2. 消融实验(Ablation Studies)

2.1 训练数据的影响

对比了三种训练数据配置(见 Table 2):

训练数据 说明
Real-video 使用真实视频数据(无社交互动)训练
Human-only 使用自生成的含互动视频,但仅限人类角色
Full 使用自生成的含互动视频,覆盖人类、动物、卡通等
  • 关键发现:自生成数据(Human-only / Full)显著提升了 ActAcc 与 GazeDev,而 TimeAcc 不受影响(因其由免训练掩码控制)。Full 配置在泛化到非人类角色时表现最佳。视频质量与相机跟随指标在各配置间保持稳定。

2.2 时序交叉注意力掩码的影响

对比了三种掩码设置(见 Table 3):

  • 无掩码:互动可在任意时刻发生;
  • M_v :仅对视频流施加时序掩码;
  • M_v + M_a :同时对视频与音频流施加掩码。

额外引入 SpeechInWin 指标,检测生成语音是否在规定窗口内开始。

  • 关键发现:每增加一个掩码流,对应模态的时序控制精度便提升;联合掩码达到最佳整体性能(TimeAcc 81.7% ,SpeechInWin 69.1% )。无掩码时 ActAcc 略高,这是因为角色在整段视频中重复动作而非精确定时。

2.3 计算成本分析

对比了各模型生成 10 秒片段的推理开销(见 Table 4):

  • HelloWorld 单样本生成时间为 60.2,s ,每帧 0.26,s ,FLOPs 为 9.4 × 10^(15) 。
  • 相较基座模型 LTX-2.3,引入 Warp Video token 带来了约 20% 的延迟增长与 36% 的 FLOPs 增长。
  • 与同类高分辨率方法(如 WorldPlay 0.56,s/帧 、LingBot-World 0.39,s/帧 )相比,HelloWorld 的计算效率仍具竞争力。

3. 用户研究(User Study)

  • 实验设置:邀请 30 名人类评分者,在 41 个样本上对比 HelloWorld 与四种竞争方法(Real-video LoRA、SANA-WM、Warp-as-History、LingBot-World)。每对视频随机排序,评分者回答三个问题:
  1. 哪个视频中目标动作更自然?
  2. 哪个视频中的角色更像在与你(观众)互动?
  3. 哪个视频场景质量更高?
  • 结果(见 Table 5):
  • HelloWorld 在所有对比中均获得超过 66% 的偏好率,且 95% 置信区间下限均高于 66% 。
  • 在与 Real-video LoRA 的对比中,互动感知维度偏好率高达 88.5% ,进一步验证了自蒸馏策略对保留并增强社交先验的关键作用。

4. 定性消融展示

  • 训练数据对比(见 Figure 6a):使用真实视频训练的模型虽能执行提示动作,但角色不面向观众,甚至出现伪影(红框);而自蒸馏训练使角色自然地注视镜头并做出 viewer-directed 动作。
  • 时序掩码对比(见 Figure 6b):无 F 控制时,角色问候动作发生时间随机;引入时序掩码后,动作严格落入指定的 0 – 3,s 、 3 – 6,s 或 6 – 9,s 窗口内(绿框)。

Q: 有什么可以进一步探索的点?

根据论文末尾的“Limitation and future work”章节,可进一步探索的方向主要包括以下几个方面:

1. 实时交互能力

当前 HelloWorld 的生成过程依赖预先指定的相机轨迹与交互脚本,且受限于基座模型架构与计算开销,尚无法支持用户与角色的实时动态交互。未来工作可重点探索自回归架构(autoregressive architectures),以期在生成 latency 与交互响应之间取得平衡,从而真正实现可实时游玩或对话的社交世界模型。

2. 长时程视频生成

现有方法在视频时长上仍存在局限。如何扩展至长视频生成(long video generation),在维持角色一致性、场景连贯性与相机轨迹精确跟随的同时,避免时序上的质量衰退与错误累积,是后续研究的重要课题。

3. 角色身份与多轮交互的一致性

当前模型缺乏对个体角色的持久化建模(persistent identities)。未来需要研究如何在长时段、多轮次的交互中保持角色的外貌、性格与行为风格的一致性,即实现:

  • 持续身份保持:角色在多次交互中维持稳定的视觉与语义特征;
  • ** sustained multi-round interactions**:支持记忆化的、上下文连贯的多轮社交对话与行为,而非单次、独立的响应片段。

此外,结合全文内容,还可从以下角度延伸探索:

  • 更细粒度的交互控制:除时间窗口与动作类别外,引入强度、情绪风格或个性化响应等连续或离散控制信号;
  • 多角色协同交互:从单一角色响应扩展至多角色间、以及多角色与观众之间的复杂社交动态;
  • 音频-视觉联合时序掩码的精细化设计:在现有 M_v + M_a 基础上,进一步探索跨模态对齐的掩码策略,以支持更复杂的语音-动作同步需求。

Q: 总结一下论文的主要内容

该论文提出 HelloWorld,首个支持用户与视频世界模型中角色进行社交互动的框架。以下从问题背景、技术方案、评测基准与实验结论四个维度进行总结。

1. 核心问题

现有视频世界模型虽已支持相机漫游、键盘控制与事件触发等交互形式,但世界中的角色要么是静态背景,要么仅执行与环境相关的自发行为,无法响应用户的社交指令。该论文旨在填补这一空白,使角色能够面向镜头执行诸如挥手、点头、问候等 viewer-directed 社交动作,并精确控制互动发生的时机。

2. 技术方案

2.1 自蒸馏微调管道(Self-Distillation Finetuning)

为避免引入相机控制后损害模型原有的社交生成能力,作者提出一种无需外部数据、无需人工标注的自蒸馏策略:

  • 合成训练数据:利用冻结的基座视频生成模型(LTX-2.3)自主生成同时包含社交互动相机运动的视频片段;
  • Warp Video 几何引导:对生成视频的首帧通过 Pi3X 恢复点云,再按估计的相机轨迹 C = ci(i=1)^N 重投影,合成 Warp Video:
    V_(warp) = warp(x_0, C)
    该视频作为显式的相机运动条件注入 DiT;
  • 轻量化微调:采用秩为 32 的 LoRA 微调视频分支,优化流匹配损失:
    L = E(z_0, t, ε) | vθ(zt, t, x_0, y(scene), y(∫er), y(quality), V_(warp)) - (ε - z_0) |_2^2
    其中 z_t = (1-t)z_0 + tε 。微调时显式剔除文本中的相机描述,确保相机运动完全由 Warp Video 控制,从而保留社交互动质量。

2.2 免训练时序交叉注意力掩码(Temporal Cross-Attention Mask)

为实现对互动时刻的精确控制,论文在推理阶段引入一种无需额外训练的掩码机制:

  • 用户按下交互按钮 F 定义窗口 $W =
    τ_s, τ_e
    $;
  • 在 DiT 交叉注意力层中施加时序掩码:
    M(ij) = -∞, & i ∉ W and j ∈ y(∫er) 0, & otherwise

Attention = softmax((QK^top) / (√d) + M) V
该掩码阻止窗口外的视频/音频 token 关注互动相关文本 token,从而将角色响应严格局域化在指定时段内。

3. 评测基准:HelloWorldBench

由于现有基准仅关注场景保真度与相机可控性,论文构建了首个面向社交互动的评测基准:

  • 数据规模:120 张高质量首帧图像(涵盖人类、动物、玩具、机器人),配对设计提示与相机轨迹,共 400 个评测样本;
  • 评估指标
  • ActAcc:动作识别准确率(是否执行指定互动);
  • TimeAcc:时序定位准确率(是否在指定窗口内发生);
  • GazeDev:注视方向与相机光轴的平均角度偏差(是否面向观众);
  • 辅以背景一致性、美学分数与相机跟随精度等传统指标。

4. 实验结论

  • 主实验:在 HelloWorldBench 上,HelloWorld 的社交互动指标显著优于 WorldPlay、Matrix-Game 3.0、LingBot-World、SANA-WM 与 Warp-as-History 等基线。尤其时序控制(TimeAcc 达 81.7% )远超现有方法(约 30% – 40% ,接近随机水平);同时在视频质量与相机跟随精度上保持竞争性或最优。
  • 消融实验:验证了自生成互动数据对提升 ActAcc 与 GazeDev 的关键作用,以及时序掩码对精准控制互动时刻的有效性;计算开销分析表明引入 Warp Video 仅带来约 20% 的推理延迟增长。
  • 用户研究:30 名人类评分者对 41 个样本的对比显示,HelloWorld 在动作自然度、互动感知与场景质量三个维度上均获得超过 66% 的偏好率。

5. 主要贡献

  • 提出 HelloWorld,首次在视频世界模型中实现用户与多样化角色的多模态社交互动;
  • 设计自蒸馏训练管道与免训练时序掩码,在赋予相机与时序控制能力的同时保留生成质量;
  • 发布 HelloWorldBench,建立首个面向世界模型社交互动的系统性评测基准。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Liangyang Ouyang,Ruicong Liu,Xuangeng Chu,Kaipeng Zhang,Yoichi Sato

PDF URL: https://arxiv.org/pdf/2608.05070.pdf

Arxiv URL: https://arxiv.org/abs/2608.05070

Arxiv ID: 2608.05070

CoolPaper URL: https://papers.cool/arxiv/2608.05070

Published: 2026-08-07T02:00:35.135Z

Updated: 2026-08-07T02:00:35.135Z


13. K-EXAONE 2.0 Technical Report

Abstract:This technical report presents K-EXAONE 2.0, an open-weight multilingual foundation model developed by LG AI Research as a step in our effort toward global frontier-scale foundation models. Rather than training from scratch, we upcycle K-EXAONE and expand its architecture, yielding a Mixture-of-Experts (MoE) model with 750B total parameters and approximately 37B activated per token—-more than three times the capacity of its predecessor. K-EXAONE 2.0 supports context lengths of up to 256K tokens and expands multilingual coverage from six to ten languages. Its training pipeline combines continual pre-training, difficulty-focused mid-training, and post-training to strengthen reasoning, agentic coding, multilingual capability, and safety grounded in Korean sociocultural contexts. Across nine evaluation categories selected to reflect the conditions of practical use, K-EXAONE 2.0 improves over K-EXAONE and remains competitive with open-weight models, showing its largest gains in agentic coding and long-context understanding and its clearest strengths in long-context retrieval and safety. Released under the Apache 2.0 license, K-EXAONE 2.0 enables the wider AI ecosystem to evaluate, deploy, adapt, and build upon it, while marking the beginning—-rather than the endpoint—-of our challenge toward the global frontier.

中文摘要

摘要:本技术报告介绍了 K-EXAONE 2.0,这是由 LG AI 研究院开发的开放权重多语言基础模型,作为我们迈向全球前沿规模基础模型努力的一步。我们并非从零训练,而是对 K-EXAONE 进行了升级扩展其架构,从而生成了一个专家混合(MoE)模型,总参数量达到 7500 亿,每个 token 激活的参数约为 370 亿——是其前身容量的三倍以上。K-EXAONE 2.0 支持最长达 256K token 的上下文长度,并将多语言覆盖范围从六种扩展至十种。其训练流程结合了持续预训练、以难度为重点的中期训练和后期训练,以增强推理能力、代理式编码、多语言能力及基于韩国社会文化环境的安全性。在九个选定的评估类别中,这些类别反映了实际使用条件,K-EXAONE 2.0 比 K-EXAONE 有所提升,并且在开放权重模型中仍具有竞争力,其中在代理式编码和长上下文理解方面的提升最为显著,而在长上下文检索和安全性方面表现出最明显的优势。K-EXAONE 2.0 在 Apache 2.0 许可下发布,使更广泛的 AI 生态系统能够评估、部署、适应并在其基础上进行构建,同时标志着我们迈向全球前沿挑战的开始——而非结束。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文旨在解决如何基于已有投资高效构建一个面向全球前沿规模、但深植本土及多语言语境的可实用部署的开源基础模型这一核心问题。具体而言,其试图解决的关键挑战可归纳为以下五个方面:

1. 主权 AI 能力与全球前沿规模的张力

现有前沿基础模型多由少数西方机构主导。对于韩国等寻求建立持久 AI 能力的国家,单纯使用外部模型无法确保在本土语言、文化、历史和制度语境下的可靠性。论文试图解决如何在资源受限的国家计算基础设施下,自主构建并持续运营一个总参数量达 750B、激活参数量约 37B 的 Mixture-of-Experts(MoE)模型,使其既能跻身全球前沿,又能深度反映韩国社会文化特异性。

2. 高效跨越式架构扩展与训练稳定性

从零训练如此规模的模型将丢弃前代模型(K-EXAONE,236B 总参数)的全部参数与训练投入。论文解决的核心工程问题是:如何通过“升级再利用”(upcycling)在深度(48 → 78 层)和专家宽度(128 → 256 名专家)两个维度上扩展 MoE 架构,并在持续预训练中保持稳定性。这包括解决深层专家激活值爆炸(通过 Clamped SwiGLU 约束上界)以及新旧专家负载均衡等技术难点,从而避免重复耗费巨额计算资源。

3. 推理效率与超长上下文的可用性

模型容量的指数级增长必须与推理成本可控性相平衡。论文试图解决如何在总参数扩大 3 倍以上的同时,维持高效推理并支持长达 256K token 的上下文。为此,模型保留了混合注意力架构(滑动窗口与全局注意力交替),并引入两条自推测解码路径(Multi-Token Prediction 与 DSpark),以在不改变目标权重的前提下提升解码吞吐。

4. 从通用能力到部署关键能力的定向增强

前代模型在高级推理、代理式编程(agentic coding)、多语言覆盖及安全方面存在明显短板。论文通过难度聚焦的中期训练(mid-training)与后期训练(post-training),解决如何将增量容量转化为实际部署所需的可靠能力,包括:

  • 代理式编码与工具使用:处理跨文件代码库、多步工具调用及终端环境任务;
  • 多语言扩展:将覆盖语言从 6 种扩展至 10 种(新增法语、意大利语、波兰语、葡萄牙语),并确保跨语言知识迁移均衡;
  • 韩国特定安全:建立非西方中心的安全评估与训练标准(K-AUT-V2),覆盖 296 个风险领域,而非直接套用外部过滤规则。

5. 实用部署导向的评估与持续进化

论文指出,模型不应仅在狭窄基准上刷分,而需在反映真实使用条件的场景中表现稳健。因此,其试图解决如何建立一套覆盖世界知识、数学、编程、代理能力、指令遵循、长上下文、韩国语言、多语言及安全九大类的评估体系,以验证模型在真实部署条件下的综合表现,并通过 Apache 2.0 开源释放,供更广泛的生态系统检验、适配与迭代。

综上所述,K-EXAONE 2.0 并非将“规模”本身视为终点,而是试图系统性地解决**“如何在继承既有技术资产的前提下,以高效、稳定、可推理、可对齐的方式,将模型规模转化为面向多元文化语境的实用前沿能力”**这一核心问题。

Q: 有哪些相关研究?

与 K-EXAONE 2.0 相关的研究工作可按照技术主题与评估维度划分为以下八个方面,均基于论文正文及参考文献中明确提及的学术成果与基础模型:

1. Mixture-of-Experts (MoE) 与大规模基础模型

论文将 K-EXAONE 2.0 置于全球开源 MoE 模型的竞争格局中,直接参照或对比了以下前沿工作:

  • DeepSeek-V3
    10
    与 DeepSeek-V4
    9
    :在万亿/近万亿参数 MoE 架构、FP8 训练优化及长上下文智能方面的探索,为 K-EXAONE 2.0 的专家路由与容量扩展提供了参照。
  • Kimi K3
    52
    :在 MoE 架构与工具调用格式上被引为相关前沿工作。
  • Llama 4
    34
    Qwen3
    63
    GLM-5.1gpt-oss
    38
    :作为开源权重模型的代表,其规模、数据与训练方法论被用于定位 K-EXAONE 2.0 的能力边界。
  • K-EXAONE
    6
    :前代模型,其混合注意力架构(LLLG 块)、QK

Q: 论文如何解决这个问题?

K-EXAONE 2.0 通过架构升级再利用、分阶段渐进训练、双路径推理优化、本土安全框架与部署导向评估的系统性组合,解决了高效构建前沿规模且深植本土语境的基础模型这一问题。具体解决方案按技术环节分解如下:

1. 架构与效率:通过 Upcycling 与混合设计实现低成本扩容

深度与宽度的协同扩展

  • 深度升级(Depth Upcycling):以 K-EXAONE 的 LLLG 块(3 层 Sliding-Window Attention + 1 层 Global Attention)为单位,将 12 个块扩展至 19 个块,总层数由 48 层增至 78 层。相比逐层复制,块级重复在中间层插入时训练稳定性更优。
  • 宽度升级(Width Upcycling):将每层专家池从 128 个复制并扩展至 256 个,对复制后的专家施加随机旋转噪声以打破梯度对称性,确保新增专家在训练中被实际利用而非保持完全耦合。路由机制继承自 K-EXAONE(sigmoid 评分、序列级负载均衡、无丢弃策略),无需额外干预即可实现 256 个专家的均衡激活。

训练稳定性机制

  • 针对深层 MoE 中 SwiGLU 激活值随深度单调爆炸的问题(末层峰值可达 6862),在最后 16 层引入 Clamped SwiGLU:将 gate 分支上界与 linear 分支双侧限制在阈值 τ = 7.0 ,使峰值激活被约束在 silu(7.0) · 7.0 ≈ 48.96 ,从而在 FP8 训练与低精度推理中保持数值稳定。

混合注意力与长上下文

  • 保留并继承 K-EXAONE 的混合注意力架构:在第二层设置 4096 token 的滑动窗口,其余滑动窗口层保持 128 token,全局注意力层按 LLLG 模式分布。该设计使模型在总参数量达 750B、激活参数约 37B 的情况下,仍能以较低成本支持长达 256K token 的上下文。

2. 推理加速:同一目标权重下的双路径自推测解码

为缓解大 MoE 模型的推理开销,K-EXAONE 2.0 在同一冻结的目标权重上提供两条互补的推测解码路径:

  • Multi-Token Prediction (MTP):与主干联合训练,在 RL 阶段前通过 Total-Variation Loss 进行端到端精修,直接优化多步拒绝采样验证下的接受率,而非仅优化交叉熵。
  • DSpark 草稿模块:在模型权重固定后单独训练的半自回归草稿器。其块扩散(block-diffusion)主干以目标模型中间层隐状态为条件,单次前向生成整个草稿块;再由轻量顺序模块从左至右精修,恢复块内依赖关系。DSpark 采用 5 层结构、块大小 γ = 7 ,相比 MTP 在代码与数学任务上将接受长度提升 32%–66%,端到端加速比从 1.27–1.77× 提升至 1.81–2.57×。

3. 训练流程:三阶段渐进式能力构建

论文将容量增长转化为实际部署能力,核心在于持续预训练 → 中期训练 → 后期训练的渐进流程:

3.1 持续预训练(Continual Pre-training)

  • 愈合阶段(Healing):在架构扩展后,先使用 K-EXAONE 后期训练数据的一个子集进行稳定性恢复。
  • 增量训练:在愈合后,使用 K-EXAONE 2.0 数据混合再训练 8T tokens
  • 知识导向合成数据
  • Active Reading (AR):针对维基百科文档生成策略性阅读式合成数据,在 ARC-C 等知识密集型任务上优于传统教科书式生成。
  • Latent Thought 扩展:将思维增强预训练扩展至包含潜在中间推理过程的数据构造。
  • 本土与多语言数据:新增韩国公共机构数据(K-DATA、NIA、国立国语院、东北亚历史财团等)以强化韩国历史、文化与专业领域知识;将语言覆盖从 6 种扩展至 10 种(新增法语、意大利语、波兰语、葡萄牙语),基于 FineWeb2 构建高质量有机语料,并引入翻译与合成 QA 数据促进跨语言迁移。

3.2 中期训练(Mid-training)

分两个阶段渐进扩展上下文窗口,并注入高难度领域数据:

  • Mid-Stage 1:在 64K 上下文 上训练 400B tokens,奠定长上下文基础。
  • Mid-Stage 2:在 超过 64K 至 256K 上下文 上再训练 400B tokens,增加长程推理、代码库级跨文件依赖、多步工具调用工作流的比例。
  • 合成多跳(multi-hop)长上下文数据,要求模型在远距离证据间进行定位、关联与综合,避免仅依赖局部检索。

3.3 后期训练(Post-training)

  • 监督微调(SFT):使用 350B tokens 的多领域数据(推理、代码、长上下文、知识、通用对话、Agent 系统)进行微调。冻结路由参数以保护预训练阶段建立的专家特化与负载模式。模型被联合训练以同时支持 thinking 模式(显式推理)与 non-thinking 模式(直接回答)。
  • 双阶段偏好学习
  • 多任务偏好优化:覆盖数学、代码、知识、Agent 与对话任务,使用可验证信号(数学答案、代码执行测试)与 LLM-as-judge 构造偏好对,采用 GROUPER(Group-wise SimPER)目标函数。
  • 安全感知偏好优化:基于 K-AUT-V2 安全分类法,对不可回答查询的拒答、有害请求拒绝及越狱攻击鲁棒性进行优化。

4. Agent 与工具使用:保留推理状态的代理能力

  • 工具调用格式:采用 XML 风格工具调用以避免转义开销,并训练模型接触多种工具调用模板,实现格式无关的泛化。
  • 保留思考模式(Preserved Thinking):在多轮 Agent 交互中,不丢弃历史 reasoning block,而是将其完整保留在上下文窗口中跨越轮次边界,使模型能在后续轮次直接基于先前的中间结论继续推理,而非重新推导。
  • 软件工程(SWE)与终端 Agent:构建可执行的 Docker 环境,从真实 PR 提取 issue、patch、F2P/P2P 测试用例;终端任务则通过种子任务 → 环境构建 → Agent rollout → 成功率筛选的迭代循环,构造经过验证的训练任务。

5. 安全框架:超越西方中心标准的本土安全

  • K-AUT-V2(Korea-Augmented Universal Taxonomy v2):在 K-AUT 226 个风险领域基础上,通过与 UNESCO APCEIU 合作的 46 名 GCED 认证教师 组成的安全顾问委员会进行 red teaming,扩展至 296 个风险领域(新增 70 个),覆盖韩国地缘政治(如朝鲜核问题、宪法秩序、历史修正主义)、多元文化反向歧视叙事、AI 目标错配及多轮对话累积风险。
  • 标准融合:将证据基础从国内法扩展至 ICCPR、ICERD 等国际人权标准,同时保留韩国历史与文化特异性。
  • 分歧处理:不平均化专家评分,而将分歧本身视为信号,表明该议题具有敏感性,由研究团队综合各方修订建议后确定最终标准。
  • 训练与验证闭环:基于修订后的标准构造安全训练数据,通过人类评估与模型评估双重验证,确保标准变化实际转化为模型行为改变。

6. 评估验证:九类部署导向基准

论文不追求单一基准的极限分数,而是建立覆盖世界知识、数学、编程/代理式编程、代理工具使用、指令遵循、长上下文理解、韩语、多语言、安全九大类的 24 项基准评估体系:

  • 长上下文:OpenAI-MRCR、AA-LCR、Ko-LongBench(内部)验证 256K 检索与推理。
  • Agent 编程:SWE-Bench Verified、Terminal-Bench 2.1、SciCode 验证仓库级工程与终端交互。
  • 安全:KGC-SAFETY(内部,韩国全球公民安全)与 ROK-Fortress 验证对韩国语境及跨文化攻击的鲁棒性。
  • 多语言:MMMLU、GlobalMMLU-Lite、PolyMath 验证 10 语言均衡能力。

通过在上述体系中验证,K-EXAONE 2.0 确保其 750B 参数规模不仅体现为训练损失下降,更转化为可在实际部署中可靠运作的多维能力。模型最终以 Apache 2.0 许可证发布,使生态系统能够独立验证、部署与进一步适配这些解决方案。

Q: 论文做了哪些实验?

论文围绕架构扩展有效性、推理加速、数据配方、训练阶段贡献、综合能力与安全等维度开展了系统实验。以下按技术环节分类陈述:

1. 模型升级再利用与训练稳定性实验

深度扩展位置对比
在将 K-EXAONE 的 LLLG 块(3 层 Sliding-Window Attention + 1 层 Global Attention)从 12 个块扩展至 19 个块时,论文对比了在模型输入端、输出端与中间层重复块的策略。实验表明,在中间层重复块取得的最终性能优于在输入端或输出端重复。

宽度扩展与专家分化验证
论文将每层专家数从 128 复制并扩展至 256。为验证新增专家是否被实际利用而非保持完全耦合,实验对比了:

  • 仅复制专家(权重完全绑定,接收相同梯度);
  • 复制后施加随机旋转噪声(保持范数的前提下打破对称性)。

结果显示,施加旋转噪声后,256 个专家的路由负载保持均衡,新增专家在训练中被有效激活。

Clamped SwiGLU 稳定性实验
为验证深层 MoE 中 SwiGLU 激活爆炸问题,论文测量了有/无 clamp 时各层峰值激活值:

  • 无 clamp:末层峰值激活达 6862 ;
  • 有 clamp(阈值 τ = 7.0 ):峰值被约束在 silu(τ) · τ ≈ 48.96 。

该实验在图 3 中展示,证实了在末 16 层应用 Clamped SwiGLU 可将激活抑制约 140× ,从而支撑 FP8 训练与低精度推理的稳定性。

2. 推测解码路径对比实验

在固定 K-EXAONE 2.0 (FP8) 目标权重与相同草稿预算 γ = 7 的条件下,论文对比了两种自推测解码路径:

指标 对比维度 关键结果
接受长度 MTP vs DSpark DSpark 在数学与代码基准上提升 32% – 66%
端到端加速比 MTP vs DSpark MTP 为 1.27 – 1.77× ,DSpark 达 1.81 – 2.57×

具体地,在 GSM8K 上 DSpark 接受长度达 5.25 (非思考模式)与 5.20 (思考模式),对应端到端加速 2.49× 与 2.56× ;在 HumanEval 上达 5.41 (非思考模式),加速 2.57× 。该实验(表 2)证实 DSpark 作为生产级草稿器的优越性。

3. 持续预训练数据配方实验

Active Reading (AR) vs. 教科书式合成数据
从 K-EXAONE 晚期检查点出发,论文独立训练三个模型:

  • Baseline:原预训练混合数据 30B tokens;
  • Active Reading:30B baseline + 10B AR 合成数据;
  • Textbook-style:30B baseline + 10B 教科书式合成数据。

实验测量了 ARC-C、MMLU、GSM8K、HellaSwag 的绝对分数变化(表 3)。AR 在 ARC-C 上提升 +1.54 ,平均提升 +0.75 ;教科书式在 MMLU 与 GSM8K 上略优,但 AR 在知识密集型领域整体表现最佳。基于此,论文将 AR 选择性应用于知识密集型域,并构建轻量级伪 AR 流水线以降低成本。

韩国数据来源消融
论文对比了两类韩语数据:

  • 机构来源数据(K-DATA、NIA、国立国语院、东北亚历史财团等);
  • 开源高教育价值数据

在韩国文化历史 vs. 知识推理基准上的实验(表 4)显示:机构数据在文化历史基准上得分 68.23 ,优于开源数据的 67.19 ;开源数据在知识推理上略高( 47.21 vs. 46.47 )。结论为:通用知识跨语言迁移有效,而国别特定历史文化知识显著受益于高质量本土数据源。

韩语预训练损失曲线
论文绘制了 K-EXAONE 系列(含小尺度模型、K-EXAONE、K-EXAONE 2.0)在韩语子集上的预训练损失随估计累积计算量 6 · N_(active) · D (FLOPs)的变化曲线(图 4)。K-EXAONE 2.0 在相同血统内呈现一致的损失递减,并展示了与 EXAONE 4.0、GLM-5 系列的外部参考对比。

4. 中期训练阶段贡献实验

长上下文检索验证
在将上下文窗口从 64K 扩展至 256K 后,论文执行 Needle-in-a-Haystack (NIAH) 测试,在 256K token 内不同深度位置插入 needle 并测量召回准确率。实验结果(图 5)显示 K-EXAONE 2.0 在全部评估长度与位置下均达到完美检索

Mid-Stage 1 vs. Mid-Stage 2 的推理增益
使用同一家族的小尺度模型,论文对比了三条训练路径在 HUMANITY’S LAST EXAM (HLE) 上的绝对提升(表 5):

  • Mid-Stage 1 to Base SFT: +3.15 分;
  • Mid-Stage 1 to Mid-Stage 2: +4.71 分;
  • Mid-Stage 1 to Mid-Stage 2 to Base SFT: +5.66 分。

实验证实 Mid-Stage 2 不仅直接提升高级知识与推理能力,其增益还能与后续 SFT 互补叠加,而非被 SFT 覆盖。

5. 综合能力主评估实验

论文在 24 个基准 上开展九类评估,与 K-EXAONE、Qwen3.5、GLM-5.1、DeepSeek V4 Pro 等开源模型对比(表 6)。关键实验发现包括:

  • Agentic Coding:SWE-Bench Verified 从 49.4 提升至 68.2 ( +18.8 ),Terminal-Bench 2.1 从 30.3 提升至 43.8 ( +13.5 );
  • 长上下文:OpenAI-MRCR 从 52.3 跃升至 94.4 ;
  • 安全:KGC-SAFETY 达 99.8 ,ROK-Fortress 达 89.5 ;
  • 多语言数学:PolyMath 从 57.4 提升至 71.3 ( +13.9 )。

6. 多语言能力实验

论文在支持的总计 10 种语言 上测试了模型扩展后的均衡性:

  • POLYMATH(表 7):覆盖韩语、德语、西班牙语、日语、越南语、葡萄牙语、法语、意大利语,K-EXAONE 2.0 在各语言上均有显著提升,无单一语言主导或衰退。
  • GLOBALMMLU-LITE(表 8):涵盖 9 种非英语语言,表现均衡, Delta_(lang) 显示语言间方差可控。
  • WMT24++ 翻译(表 9):测试英 arrow 目标语双向翻译。EN to XX 方向语言间差异为 ± 2.8 ,XX to EN 为 ± 1.4 ,显示多语言扩展未引入严重的翻译质量倾斜。

7. 安全评估与 Red Teaming 实验

K-AUT 扩展验证
通过与 46 名 UNESCO GCED 认证教师组成的安全顾问委员会进行为期四周的闭环 red teaming,论文对模型进行多轮对抗测试。教师直接提出修订意见与新风险领域,研究团队整合后返回进行第二轮人工审查。

  • 分类法扩展统计(表 10):通用人类价值域从 55 增至 69(+14),社会安全域从 75 增至 89(+14),韩国敏感性域从 60 增至 87(+27),未来风险域从 36 增至 51(+15),总计从 226 扩展至 296 个风险领域(+70)。

安全性能基准对比
在 KGC-SAFETY(内部基准,评估韩国语境下的全球公民安全)上,K-EXAONE 2.0 在各维度均取得高于前代与竞品的安全率(表 11):

维度 K-EXAONE 2.0 K-EXAONE Qwen3.5 GLM-5.1 DeepSeek V4 Pro
Universal Human Values 100 97.5 95.8 76.4 87.5
Social Safety 99.9 96.9 96.8 76.7 87.3
Korean Sensitivity 99.3 94.3 85.5 60.3 80.8
Future Risk 100 95.0 86.7 58.3 69.7
Total 99.8 96.1 92.0 69.3 82.8

该实验证实,通过基于本土

Q: 有什么可以进一步探索的点?

基于论文中明确的局限性陈述、结论展望及各章节中的开放问题,可进一步探索的研究方向可分为以下九个方面:

1. 向万亿参数规模及更高计算效率迈进

论文指出,K-EXAONE 2.0 并未在每一项基准上领先,缩小剩余差距需要模型规模、训练方法、推理效率的持续推进。作者明确将下一阶段目标定为万亿参数及以上规模的模型。可探索的方向包括:

  • 更激进的 MoE 扩展策略(如专家数量、激活比例与层深的更优组合);
  • 针对万亿参数规模的分布式训练稳定性通信优化
  • 在 FP8 或更低精度下的数值稳定性机制,超越当前的 Clamped SwiGLU 设计。

2. 高级知识与推理数据的数据配方优化

第 4.2 节明确提出,未来工作需要规模化生成和筛选高级知识及推理数据,并识别能够将中期训练收益更大程度转化为后训练(SFT)增益的数据配方。具体可探索:

  • 针对研究生及专家级 STEM 内容的自动挖掘与质量判定方法;
  • Active Reading 与教科书式合成数据的动态混合策略,以同时提升知识密集型任务(MMLU、ARC-C)与数学推理(GSM8K);
  • 将潜在思维(latent thought)数据构造与思考增强预训练更深度结合,以进一步降低训练损失。

3. 复杂推理能力的边界突破

主评估表(表 6)显示,K-EXAONE 2.0 在部分高难度推理基准上仍显著落后于顶级专有/开源模型,例如:

  • HMMT FEB 2026: 78.4 vs. DeepSeek V4 Pro 的 95.2 ;
  • IMO-ANSWERBENCH: 78.6 vs. 89.8 ;
  • HUMANITY’S LAST EXAM: 18.3 vs. 37.7 。

可探索的方向包括:

  • 针对竞赛级数学与定理证明的专门化后训练范式
  • 更高效的测试时计算扩展(test-time compute scaling)与推理链验证机制;
  • 将形式化数学验证器(formal verifiers)融入 RL 流程,超越当前基于执行和 LLM-as-judge 的验证。

4. 长上下文理解从检索向深度推理的跃迁

尽管 Needle-in-a-Haystack 实验达到完美检索(图 5),但在需要多跳综合推理的长上下文基准上仍有提升空间(如 AA-LCR 56.2 ,而 DeepSeek V4 Pro 达 66.3 )。可进一步探索:

  • 超越当前合成多跳数据的更复杂长程依赖构造(如跨文档时间线推理、矛盾信息消解);
  • 混合注意力架构中滑动窗口与全局注意力比例的动态自适应调整,而非固定 LLLG 模式;
  • 支持超过 256K token 的上下文的有效训练与推理机制。

5. Agent 能力与工具使用的泛化及可靠性

K-EXAONE 2.0 在 SWE-Bench Verified( 68.2 )与 Terminal-Bench 2.1( 43.8 )上虽有大幅提升,但对比顶级模型( 80.6 与 64.0 )仍有明显差距。可探索:

  • Preserved Thinking 模式在多轮、多 Agent 协作场景中的扩展性与上下文开销权衡;
  • 从 XML 工具调用向更通用、多模态的工具接口(如 GUI 操作、浏览器控制)迁移;
  • 开放域、不可验证环境中(非 Docker 化的真实软件工程场景)的 Agent 鲁棒性;
  • τ^3 -BANKING 得分 14.2 显著低于 DeepSeek V4 Pro( 25.8 ),表明金融/领域特定工具使用仍需专门优化。

6. 安全评估与风险发现的范式创新

论文在安全章节(附录 F)明确指出现有 red teaming 的结构性局限:它仅能测试已被识别和枚举的风险,对全新、未定义的风险发现能力较弱。未来可探索:

  • 超越已知攻击模板的自动化风险发现方法(如利用前沿模型自主探索模型盲区);
  • 将安全顾问委员会机制扩展到更多元化的地域与文化视角(超越当前以韩国教师为主的配置),以发现跨文化冲突与全球性风险;
  • 针对多轮对话累积风险(如模型谄媚、错误共情、有害前提共谋)的动态评估与实时干预机制;
  • K-AUT-V2 中 296 个风险领域的高效训练数据覆盖与专家模型路由的协同设计。

7. 多语言能力的深度均衡化

虽然论文将语言覆盖扩展至 10 种并实现了相对均衡的表现,但附录 E 的 WMT24++ 结果显示 EN to XX 方向的语言间差异( ± 2.8 )仍大于 XX to EN( ± 1.4 )。可进一步探索:

  • 低资源语言方向(如波兰语、意大利语)的翻译质量瓶颈
  • 跨语言知识迁移的因果机制(为何某些语言在数学推理上提升更显著);
  • 针对新增四种语言(法、意、波、葡)的本土安全与文化对齐数据,避免安全能力随语言扩展而稀释。

8. 评估框架与部署导向基准的持续演进

论文强调评估应反映实际部署条件,但现有基准仍存在局限:

  • 韩国本土评估的深度:当前韩国基准(KMMLU-PRO、CLICK、HRM8K-KSM)覆盖有限,需构建更多反映韩国专业领域(法律、医疗、公共行政)的专家级评估
  • 动态评估:现有基准多为静态,未来需引入对抗性动态测试(如模型发布后持续更新的越狱尝试库);
  • 人类评估与模型评估的融合:附录 F 提到人类评估忠实但昂贵、模型评估可扩展但有偏见。可探索可扩展的人类偏好推断方法(如基于主动学习的人类反馈采集)。

9. 推测解码与推理架构的联合优化

当前 DSpark 与 MTP 作为附加模块在固定权重后训练,未来可探索:

  • 草稿器与主干的联合训练纳入 RL 阶段,而非仅在预训练后固定;
  • 自适应草稿预算:根据任务难度(简单代码 vs. 复杂数学证明)动态调整 γ 与草稿策略;
  • 探索非自回归或半自回归生成在 MoE 大模型中的更深度集成,超越当前块扩散方案。

综上,论文将 K-EXAONE 2.0 定位为起点而非终点,上述方向均围绕一个核心主题:如何将规模增长持续、可靠地转化为在多元文化语境下可实际部署的前沿智能。

Q: 总结一下论文的主要内容

该报告介绍了 K-EXAONE 2.0,一款由 LG AI Research 开发的开源多语言 MoE 基础模型,旨在迈向全球前沿规模的同时深植韩国及多语言本土语境。以下为主要内容的系统性总结:

1. 核心定位与模型规模

  • 参数规模:总参数量 750B,每 token 激活参数约 37B,为前代 K-EXAONE(236B / 23B)的 3.2 倍
  • 上下文长度:支持最长 256K tokens
  • 语言覆盖:从 6 种扩展至 10 种(新增法语、意大利语、波兰语、葡萄牙语)。
  • 开源协议:以 Apache 2.0 发布,支持独立评估、部署与二次开发。

2. 架构设计与效率优化

升级再利用(Upcycling)

  • 基于 K-EXAONE 的权重,沿深度(48 → 78 层)与宽度(128 → 256 名专家/层)两个维度扩展,避免从零训练造成的参数与计算投入浪费。
  • 采用块级重复(LLLG 块:3 层 Sliding-Window Attention + 1 层 Global Attention),在中间层插入新块以优化性能。
  • 对复制后的专家施加随机旋转噪声以打破对称性,确保新增专家被有效利用。

训练稳定性机制

  • 针对深层 SwiGLU 激活值爆炸问题(末层峰值可达 6862),在最后 16 层引入 Clamped SwiGLU,将激活上界约束为:
    silu(τ) · τ ≈ 48.96 quad (τ = 7.0)

推理加速:双路径自推测解码

  • MTP(Multi-Token Prediction):与主干联合训练,RL 阶段前以 Total-Variation Loss 精修。
  • DSpark:权重固定后训练的半自回归草稿器(5 层,块大小 γ = 7 ),接受长度较 MTP 提升 32%–66%,端到端加速达 1.81–2.57×

3. 三阶段训练流程

阶段一:持续预训练(Continual Pre-training)

  • 先以 K-EXAONE 后期数据进行愈合训练恢复稳定性,再以增量 8T tokens 继续训练。
  • 数据增强
  • Active Reading (AR):针对知识密集型域的合成数据生成方法,优于传统教科书式生成。
  • Latent Thought 扩展:融入潜在中间推理过程。
  • 韩国本土数据:引入 K-DATA、NIA、国立国语院、东北亚历史财团等机构数据,强化韩国历史、文化与专业知识。
  • 多语言数据:基于 FineWeb2 构建 10 语言高质量语料,加入翻译与合成 QA 以促进跨语言迁移。

阶段二:中期训练(Mid-training)

  • 分阶段扩展上下文:64K(400B tokens)→ 256K(400B tokens)。
  • 数据配比向长程推理、代码库级跨文件依赖、多步工具调用工作流倾斜。
  • 合成多跳长上下文数据,要求模型在远距离证据间进行关联与综合。

阶段三:后期训练(Post-training)

  • 监督微调(SFT):使用 350B tokens 的多域数据,冻结路由参数以保护专家特化;联合训练 thinking 与 non-thinking 模式。
  • 偏好学习
  • 多任务阶段:覆盖推理、代码、Agent、对话,采用 GROUPER 目标函数。
  • 安全阶段:基于 K-AUT-V2 分类法,优化拒答、有害请求拒绝与越狱鲁棒性。

4. 安全框架:K-AUT-V2

  • 将前代 K-AUT 从 226 个风险领域扩展至 296 个(新增 70 个),涵盖韩国地缘政治、历史修正主义、AI 目标错配、多轮对话累积风险等。
  • UNESCO APCEIU 合作,组建 46 名 GCED 认证教师的安全顾问委员会进行 red teaming。
  • 将证据基础从国内法扩展至 ICCPR、ICERD 等国际人权标准,同时保留韩国文化特异性。

5. 评估结果与关键发现

9 个类别 24 项基准上的评估显示:

  • Agentic Coding 提升最显著:SWE-Bench Verified 从 49.4 → 68.2(+18.8),Terminal-Bench 2.1 从 30.3 → 43.8(+13.5)。
  • 长上下文理解:OpenAI-MRCR 从 52.3 → 94.4,在 NIAH 测试中 256K 内达完美检索。
  • 安全:KGC-SAFETY 达 99.8,ROK-Fortress 达 89.5,显著优于可比开源模型。
  • 多语言数学:PolyMath 从 57.4 → 71.3(+13.9),10 语言能力分布均衡。
  • 韩国本土能力:KMMLU-PRO、CLICK、HRM8K-KSM 上保持强劲表现。

6. 局限性与未来方向

  • 在部分高难度推理基准(如 HUMANITY’S LAST EXAM、HMMT FEB 2026)上仍落后于顶级前沿模型。
  • 复杂金融/领域特定工具使用( τ^3 -BANKING)有待提升。
  • Red teaming 对全新、未定义风险的发现能力存在结构性局限。
  • 未来工作将瞄准 万亿参数及以上规模,并持续优化数据配方、推理效率、评估框架与跨文化安全对齐。

7. 结论

K-EXAONE 2.0 通过架构升级再利用、渐进式长上下文扩展、双路径推测解码、本土安全整合与部署导向评估,展示了如何在继承既有技术资产的前提下,将模型规模高效转化为可实际部署的全球前沿能力。该模型并非 K-EXAONE 系列的终点,而是向更大规模、更强能力与更可靠安全迈进的起点。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Eunbi Choi,Kibong Choi,Sehyun Chun,Seokhee Hong,Junwon Hwang,Hyojin Jeon,Ahra Jo,Hyunjik Jo,Yeonsik Jo,Minhyeok Jung,Doyoung Kim,Heegyu Kim,Joonkee Kim,Seonghwan Kim,Soyeon Kim,Sunkyoung Kim,Yireun Kim,Yongil Kim,Byungoh Ko,Changhun Lee,Dohaeng Lee,Haeju Lee,Jinsik Lee,Kyungmin Lee,Minwoo Lee,Wonkee Lee,Sangha Park,Sungjune Park,Kwangrok Ryoo,Kijung Seo,Minju Seo,Yongwoo Song,Sejong Yang,Heuiyeen Yeen,Stanley Jungkyu Choi,Yemuk Choi,Yongchan Chun,Jiwon Ham,Dasol Hong,Sujeong Im,Kijeong Jeon,Gerrard Jeongwon Jo,Hyeongjun Jo,Yujin Jo,Jiyeon Jung,Naeun Kang,Daeseong Kim,Euisoon Kim,Hayeon Kim,Hyosang Kim,Myoungshin Kim,Unsol Kim,Youchul Kim,Chaeeun Lee,ChaeYoon Lee,Edward Hwayoung Lee,Honglak Lee,Hwansoo Lee,Minkyung Lee,Sangeun Lee,Solji Lim,Woohyung Lim,Chanwoo Moon,Jueun Mun,Jimin Park,Seojeong Park,Yongmin Park,Hyerin Seo,Donghyeon Shin,Donghyun Son,Eunyong Son,Kaehyun Um,Sihoon Yang,Chang En Yea,Sihyuk Yi,Kyungjae Yoo,Chansik Yoon

PDF URL: https://arxiv.org/pdf/2608.04505.pdf

Arxiv URL: https://arxiv.org/abs/2608.04505

Arxiv ID: 2608.04505

CoolPaper URL: https://papers.cool/arxiv/2608.04505

Published: 2026-08-07T02:00:42.507Z

Updated: 2026-08-07T02:00:42.507Z


14. When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

Abstract:Memory-augmented VLM agents act on persistent spatial knowledge, yet that knowledge silently goes stale as the environment changes. We ask what happens when an agent must reconcile a confident memory claim with a contradicting observation, and whether current models can catch the conflict before it becomes a safety-relevant mistake. Using a dynamic FrozenLake testbed, we pair a staleness-detection task with a downstream navigation task across three closed-source models and three open-weight VLMs under both text and image inputs (1,800 detection runs, and 12,000 text-mode navigation episodes over four LLM navigators at a shared 50-seed scale). Three findings emerge. First, text solvability does not imply visual grounding: models that flag stale entries reliably from text nonetheless span vision F1 from 0.887 down to 0.067 on the identical grids, and the weakest keeps making fluent, confident decisions that ignore the image. Second, consuming stale memory without an audit is a safety liability: in our primary GPT-4o setting, an agent that trusts raw memory dies more than twice as often as the same agent given no memory at all. Third, auditing helps but does not close the gap: a transparent read-time filter removes much of the safety cost in text mode, yet even oracle stale labels bring no further significant gain on the current grid size, and when visual auditing is unreliable, filtering yields no consistent benefit. Together these results frame spatial-memory staleness as a safety failure mode and isolate reliable visual grounding and action selection under memory—observation conflict as the central open challenges for memory-augmented agents.

中文摘要

摘要:增强记忆的VLM(视觉-语言模型)代理依赖持久的空间知识,但随着环境变化,这些知识会悄然过时。我们探讨当代理必须调和一个自信的记忆断言与相互矛盾的观察时会发生什么,以及当前模型能否在冲突演变为安全相关错误之前捕捉到它。通过使用动态FrozenLake测试平台,我们将陈旧检测任务与下游导航任务配对,涵盖三种闭源模型和三种开放权重VLM,输入包括文本和图像(1,800次检测运行,以及在共享50个随机种子规模下,四个LLM导航器进行了12,000次文本模式导航实验)。得到三点发现。首先,文本可解性不意味着视觉 grounding:能够通过文本可靠标记陈旧条目的模型,在相同的网格上视觉F1从0.887下降到0.067,而最弱的模型仍会做出流畅、自信但忽视图像的决策。其次,未经审核使用陈旧记忆是一种安全隐患:在我们主要的GPT-4o实验中,信任原始记忆的代理死亡率是完全不使用记忆的同类代理的两倍多。第三,审核有助于减少风险但无法完全消弭差距:文本模式下,透明的实时读取过滤器能消除大部分安全成本,但即便是拥有完美陈旧标签,也未在当前网格大小下带来进一步显著提升,而当视觉审核不可靠时,过滤无法带来一致的好处。这些结果将空间记忆陈旧界定为一种安全失败模式,并指出在记忆与观察冲突下,可靠的视觉 grounding 和动作选择是增强记忆代理面临的核心未解决挑战。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Yushi Sun,Yanjie Zhang

PDF URL: https://arxiv.org/pdf/2608.04574.pdf

Arxiv URL: https://arxiv.org/abs/2608.04574

Arxiv ID: 2608.04574

CoolPaper URL: https://papers.cool/arxiv/2608.04574

Published: 2026-08-07T02:00:49.785Z

Updated: 2026-08-07T02:00:49.785Z


15. Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

Abstract:Reinforcement learning with verifiable rewards (RLVR) has become a standard paradigm for post-training large language models (LLMs). While Group Relative Policy Optimization (GRPO) is widely adopted, it suffers from sparse reward signals and loses gradients entirely when all responses within a group receive identical rewards. On-policy distillation (OPD) offers a natural remedy by providing dense, token-level supervision from a teacher model. However, naively combining GRPO with OPD leads to degraded performance, due to three underlying causes: not all samples benefit from distillation; fitting too quickly to the teacher undermines the exploratory capacity of RL; and OPD’s advantages are asymmetric, suppressing most tokens. To address these challenges, we propose RSTG (Recovering Learning Signals via Adaptive Teacher Guidance), which applies distillation selectively and precisely where it matters most. At the sample level, OPD is restricted to negative zero-variance prompts with each sample weighted by the teacher’s confidence score. At the token level, distillation targets only tokens with high student entropy or large teacher-student divergence. We further augment training with SFT on correct trajectories generated by the teacher model, injecting positive gradient signals where RL yields none. Experiments demonstrate that RSTG substantially outperforms naive GRPO+OPD by +4.02% on math and +3.05% on code.

中文摘要

摘要:具有可验证奖励的强化学习(RLVR)已经成为训练后大语言模型(LLM)的标准范式。虽然组相对策略优化(GRPO)被广泛采用,但它存在奖励信号稀疏的问题,当组内所有响应获得相同奖励时,梯度会完全丢失。策略蒸馏(OPD)提供了一种自然的解决方案,通过教师模型提供密集的、逐令牌的监督。然而,将GRPO与OPD简单结合会导致性能下降,原因有三:并非所有样本都能从蒸馏中受益;过快拟合教师模型会削弱强化学习的探索能力;以及OPD的优势是非对称的,会抑制大多数令牌。为了解决这些挑战,我们提出了RSTG(通过自适应教师指导恢复学习信号),在最关键的地方选择性、精确地应用蒸馏。在样本层面上,OPD仅限于负零方差提示,并且每个样本按教师的置信度评分加权。在令牌层面上,蒸馏仅针对学生熵高或教师-学生差异大的令牌。我们进一步通过在教师模型生成的正确轨迹上进行SFT训练,注入正梯度信号,以弥补强化学习未产生的信号。实验表明,RSTG在数学任务上的表现比简单的GRPO+OPD高出4.02%,在代码任务上高出3.05%。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Zhuowen Han,Jinwei Xiao,Zhengxi Lu,Renren Jin,Zhiyuan Yao,Yuxin Liu,Hongyan Hao,Yueqing Sun,Yu Yang,Qi GU,Xunliang Cai,Deyi Xiong

PDF URL: https://arxiv.org/pdf/2608.00782.pdf

Arxiv URL: https://arxiv.org/abs/2608.00782

Arxiv ID: 2608.00782

CoolPaper URL: https://papers.cool/arxiv/2608.00782

Published: 2026-08-07T02:02:34.298Z

Updated: 2026-08-07T02:02:34.298Z


16. FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

Abstract:GUI agents must remember both useful experience from earlier tasks and unfinished progress in the current interaction. Latent memory offers a compact solution by compressing multimodal trajectories into a few continuous tokens. Existing methods, however, usually map each trajectory to one fixed memory block and train it mainly through next-action supervision. This creates three practical problems: important details may be lost during compression, the same memory block must serve different decision stages, and irrelevant retrieved trajectories may still mislead the agent. We introduce FocusMem, which separates these responsibilities within a compact latent-memory interface. A role-aware content basis encourages episodic memory to retain reusable experience and working memory to retain task progress. A state-conditioned readout generates a decision-specific view of the same stored evidence, while a lightweight trust gate can suppress memory blocks that appear irrelevant to the current step. All components are trained while the GUI policy remains frozen. Across five GUI-agent benchmarks, FocusMem consistently outperforms a fully matched action-only fixed-memory baseline and prior latent memory adaptations. Further analysis shows that semantic and functional supervision preserve complementary information, state-conditioned readout is more robust as surrounding trajectory context grows, and the trust gate reduces the harm caused by injected irrelevant episodic evidence. These results show that effective latent memory depends not only on compressing past interaction, but also on what is retained, what is exposed, and what is allowed.

中文摘要

摘要:GUI 代理必须记住来自先前任务的有用经验以及当前交互中的未完成进度。潜在记忆通过将多模态轨迹压缩为少数连续标记,提供了一种紧凑的解决方案。然而,现有方法通常将每条轨迹映射到一个固定的记忆块,并主要通过下一动作监督进行训练。这带来了三个实际问题:在压缩过程中可能丢失重要细节,相同的记忆块必须服务于不同的决策阶段,以及不相关的检索轨迹可能仍会误导代理。我们提出了 FocusMem,它在紧凑的潜在记忆接口内分离了这些职责。角色感知的内容基础鼓励情景记忆保留可重复使用的经验,而工作记忆保留任务进度。状态条件读取生成对同一存储证据的决策特定视图,同时轻量级信任门能够抑制对当前步骤看来不相关的记忆块。所有组件在 GUI 策略保持冻结的情况下训练。在五个 GUI 代理基准测试中,FocusMem 一贯优于完全匹配的仅动作固定记忆基线和之前的潜在记忆改进方法。进一步分析表明,语义和功能监督可保留互补信息,状态条件读取在周围轨迹上下文增加时更加稳健,信任门减少了注入的不相关情景证据造成的损害。这些结果表明,有效的潜在记忆不仅依赖于压缩过去的交互,还依赖于保留什么、展示什么以及允许什么。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Zhuoran Zhang,Bowen Li,Jingcheng Ju,Yang Shi,Qixun Wang,Haotian Wang,Wei Chen,Tengjiao Wang

PDF URL: https://arxiv.org/pdf/2608.04530.pdf

Arxiv URL: https://arxiv.org/abs/2608.04530

Arxiv ID: 2608.04530

CoolPaper URL: https://papers.cool/arxiv/2608.04530

Published: 2026-08-07T02:04:14.674Z

Updated: 2026-08-07T02:04:14.674Z


17. SKILL-KD: Contrastive Skill Distillation for LLM Agents

Abstract:Skill-based prompting has become a practical mechanism for improving large language model (LLM) agents, yet existing skill acquisition methods often treat skills as experience summaries, memory entries, or direct summaries of successful demonstrations. This creates a mismatch for weaker student agents: when a student fails because it lacks task knowledge or operational strategy, its failed trajectory may not contain enough evidence to infer the missing behavior, while the teacher trajectory may be too implicit to be internalized as reusable guidance. We propose SKILL-KD, a contrastive skill distillation framework that treats skills as an explicit distillation medium between agents of different capabilities. Given a student failure and the teacher trajectory on the same task, SKILL-KD distills their actionable discrepancy into a textual skill patch, evaluates the patch by re-running the student, and iteratively refines the patch when the student still fails. To prevent repeated local updates from causing skill drift, SKILL-KD further maintains trace-linked edit histories and performs Drift-Aware Skill Consolidation, deciding whether each patch should add a new rule, delete or modify an existing rule, or be skipped. Across five agent benchmarks and two student settings, SKILL-KD consistently improves frozen student agents over fixed-model adaptation baselines.

中文摘要

摘要:基于技能的提示已成为提高大语言模型(LLM)代理实用机制,但现有的技能获取方法通常将技能视为经验总结、记忆条目或成功示范的直接总结。这为能力较弱的学生代理带来了不匹配:当学生因为缺乏任务知识或操作策略而失败时,其失败轨迹可能不包含足够的证据来推断缺失的行为,而教师轨迹可能过于隐晦,无法被内化为可重用的指导。我们提出了 SKILL-KD,这是一种对比技能提炼框架,将技能视为不同能力代理之间的显式提炼媒介。给定学生失败和同一任务上的教师轨迹,SKILL-KD 将它们可操作的差异提炼为文本技能补丁,通过重新运行学生对补丁进行评估,并在学生仍然失败时迭代优化补丁。为了防止重复的局部更新引起技能漂移,SKILL-KD 进一步维护跟踪关联的编辑历史,并执行漂移感知技能巩固,决定每个补丁是应增加新规则、删除或修改现有规则,还是跳过。在五个代理基准和两种学生设置中,SKILL-KD 始终在固定模型适应基线之上提升冻结学生代理的表现。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文试图解决** frozen LLM 智能体在技能获取与迁移过程中面临的行为证据转换瓶颈**。具体而言,现有基于技能的提示机制虽能提升智能体表现,但传统技能抽取方式将技能视为经验总结、记忆条目或成功演示的直接摘要,这导致以下核心问题:

  • 学生失败轨迹的信息不充分
    当较弱的学生智能体因缺乏任务知识或操作策略而失败时,其失败轨迹往往仅呈现错误的动作,并不包含足以推断缺失行为或正确策略的证据。换言之,失败记录能说明“做错了什么”,却难以直接推导出“应该怎么做”。

  • 教师成功轨迹过于隐式且难以内化
    较强教师智能体的成功轨迹虽包含所需行为,但直接将其总结为文本规则往往过于抽象、局部化或与学生的实际策略不对齐。学生智能体难以将这些隐式演示转化为可复用、可执行的程序性指导。

  • 现有方法缺乏针对性的策略对齐机制
    无论是基于自身轨迹反思的方法,还是基于强模型演示的方法,均未显式地建模教师-学生之间的行为能力差距。这导致抽取出的技能无法确保对学生策略产生实际的行为改变,容易产生局部有效但全局不可复用的规则。

  • 技能库的持续维护与漂移问题
    在反复通过局部补丁更新技能库时,现有方法缺乏对编辑历史的追踪与全局一致性维护,容易出现三种漂移现象:案例特异性漂移(case-specific drift)、技能膨胀漂移(skill-bloat drift)以及破坏性更新漂移(destructive-update drift),导致技能库冗余、不稳定或相互冲突。

为应对上述问题,论文提出将技能重新定义为不同能力智能体之间显式的蒸馏媒介,通过对比教师-学生轨迹差异、自适应验证候选技能补丁,并基于可追溯的编辑历史进行漂移感知的技能整合,从而在不更新学生模型参数的前提下,实现可复用且紧凑的程序性知识迁移。

Q: 有哪些相关研究?

该论文的相关研究主要围绕两大方向展开:技能获取与优化,以及面向 LLM 智能体的知识蒸馏

1. 技能获取与优化(Skill Acquisition and Optimization)

  • 持久化技能库与轨迹蒸馏
    早期工作如 Voyager(Wang et al. 2023)提出了面向开放式探索的持久化技能库。后续系统进一步从轨迹、验证反馈或验证门控文本编辑中演化技能,包括 Trace2Skill、SkillOpt 等(Ni et al. 2026; Yang et al. 2026c; Ma et al. 2026; Wang et al. 2026b,a; Zheng et al. 2025; Alzubi et al. 2026)。部分方法引入对比或干预式验证以过滤不可靠技能(Ma et al. 2026)。

  • 提示优化与经验记忆
    另一支线通过文本梯度或进化搜索,利用执行反馈优化提示及其他语言制品(Yuksekgonul et al. 2024; Pryzant et al. 2023; Agrawal et al. 2026)。经验记忆方法(如 Reflexion、ExpeL)则存储轨迹派生的反思供未来试验复用(Shinn et al. 2023; Zhao et al. 2024)。这些方案的学习信号均来自智能体自身的轨迹、轨迹集合或通用执行分数。

  • 技能库治理与生命周期管理
    近期研究关注大规模技能库的冗余控制、路由负担与未经证实编辑的治理问题(Yang et al. 2026c; Cho, Kang, and Kim 2026; Gao et al. 2026; Liu et al. 2026a,b)。Trace2Skill 与 SkillOpt 分别通过分组轨迹和验证集反馈应对此问题,但其整合效果依赖于轨迹批次选择或验证集覆盖范围。

  • 与 SKILL-KD 的区别
    SKILL-KD 并非依赖智能体自身的执行反馈,而是将教师-学生行为对比作为主要学习信号;同时,它将技能蒸馏视为在文本技能空间中的自适应搜索过程,通过迭代精炼与行为验证将候选补丁转化为学生可用的策略,而非一次性摘要或固定步编辑。此外,SKILL-KD 利用可追溯的编辑历史(trace-linked edit histories)来整合局部补丁,而非依赖验证集覆盖或轨迹批次选择。

2. 面向 LLM 智能体的知识蒸馏(Knowledge Distillation for LLM Agents)

  • 基于轨迹与模块的蒸馏
    经典知识蒸馏通过软目标、理由或轨迹将强模型行为迁移至弱模型(Hsieh et al. 2023; Gu et al. 2024)。在智能体场景中,既有工作通过基于轨迹的训练蒸馏工具使用行为(Kang et al. 2025),或通过可复用的外部模块实现免训练迁移(Qiu et al. 2025)。

  • 训练时技能监督
    近期研究将技能或特权信号主要用于训练时的策略学习或强化学习监督(Wang et al. 2026c; Yang et al. 2026b; Xia et al. 2026; Yang et al. 2026a),其载体通常为参数更新或内部表示。

  • 与 SKILL-KD 的区别
    SKILL-KD 以同任务教师-学生轨迹对比作为蒸馏信号,并以提示时(prompt-time)文本技能补丁作为迁移载体,在不更新学生模型参数的前提下,实现跨能力智能体的程序性知识迁移。

Q: 论文如何解决这个问题?

论文通过提出 SKILL-KD(Contrastive Skill Distillation)框架,从三个层面系统性地解决上述问题:将技能重新定义为跨能力智能体的显式蒸馏媒介,通过对比轨迹差异提取可操作的文本补丁,并以自适应验证与可追溯的编辑历史确保技能的全局复用性与稳定性。具体机制如下。

1. 对比技能蒸馏(Contrastive Skill Distillation)

该框架不再孤立地总结学生失败或教师成功,而是将同任务上教师与学生的轨迹对比作为核心学习信号。

  • 对于训练实例 x ,学生首先基于当前技能库 K 生成轨迹:
    τ_S^0 = S(x; K)
    若任务评估器给出 r(x, τ_S^0) < 1 ,表明学生失败。

  • 随后,教师在同实例上生成轨迹:
    τ_T = T(x; K)
    即使教师也未得满分,其局部决策与学生轨迹的分歧仍包含关键行为证据。

  • 整合代理(consolidation agent) C 将两条轨迹的对比差异、评估分数及历史编辑记录 H 结合,生成候选技能补丁。每个补丁内部表示为:
    p = (title, content, why, trace)
    其中 title 与 content 渲染为可见规则, why 与 trace 保留在内部审计历史中,用于追溯该补丁的原始动机与来源轨迹。

2. 自适应技能蒸馏(Adaptive Skill Distillation)

针对教师轨迹过于隐式、单次摘要难以对齐学生策略的问题,框架将技能提取视为文本技能空间中的迭代搜索,而非一次性总结。

  • 整合代理提出初始补丁:
    p_1 = Cl(K, H, (τ_S^0, r_S^0), (τ_T, r_T)r)
    将其应用于技能库 Apply(p_1, K) 后,重运行学生:
    τ_S^1 = Sl(x; Apply(p_1, K)r)

  • 若学生仍失败,代理观察新轨迹并基于累积证据:
    Ei = (τ_S^j, p_j, r_S^j)r(j=1)^i
    提出修订补丁:
    p_(i+1) = Cl(K, H, (τ_S^0, r_S^0), (τ_T, r_T), E_ir)
    此过程持续至多 n 轮,直至学生成功或达到上限。

  • 只有经学生重运行验证、确实改变其行为并导向成功的补丁,才会被提交至全局技能库;中间失败的候选仅保留在实例级精炼记录中,不写入 K 或持久历史 H 。该机制确保补丁从“事后摘要”转化为“经行为验证的策略对齐指导”。

3. 漂移感知技能整合(Drift-Aware Skill Consolidation)

针对反复局部更新导致的技能漂移,框架维护完整的可追溯编辑历史,并通过多轮工具调用实现全局整合决策。

  • 编辑历史定义为:
    H = h_1, h_2, dots, h_m, quad h_j = (op_j, p_j)
    其中 op_j ∈ add, modify, delete, skip 。每条记录均保留 why 与 trace ,索引原始轨迹而不直接加载全文。

  • 整合代理配备两类工具:

  1. trace-link 工具:按 edit_index 检索关联的完整教师/学生轨迹;
  2. patch 工具:执行 add 、 modify 、 delete 或 skip 操作。
  • 在提交补丁前,代理通过多轮 trace-link 调用回溯相关历史,识别跨实例模式、检测与现有技能的冲突,并判断当前补丁应新增规则、修改现有规则、删除冗余规则,抑或因过于个案化而跳过。这一过程直接抑制了三类漂移:
  • 案例特异性漂移:通过恢复早期案例证据,将反复微调的边界条件分离为多条稳定规则;
  • 技能膨胀漂移:将多次验证但仅含偶然细节的坐标级补丁合并为通用操作规则;
  • 破坏性更新漂移:在覆盖旧规则前检索其原始轨迹,避免新补丁削弱先前有效的计算策略。

4. 免训练的知识迁移载体

整个框架的核心在于:学生模型完全冻结,蒸馏载体不是参数更新,而是外部文本技能制品。由于载体为自然语言规则而非 logits 或隐藏表示,该方法对模型架构、分词器及预训练数据分布无依赖,可在同质(如 Qwen 系列内部)与异质(如 Qwen 与 GPT 系列之间)教师-学生配置间通用。

Q: 论文做了哪些实验?

论文在五个智能体基准测试上开展了系统实验,涵盖两种教师-学生配置,并通过多组消融分析验证各模块的有效性。实验内容可归纳如下:

1. 实验设置

  • 教师-学生配置
  • Group 1(同质设置):学生为 Qwen3.5-4B,教师为 Qwen3.7-plus,整合代理使用 Qwen3.7-plus。
  • Group 2(异质设置):学生为 Qwen3.6-35B-A3B,教师为 ChatGPT-5.5,整合代理使用 ChatGPT-5.5。
  • 评估基准 实验覆盖五类任务:
  • SearchQA:搜索式问答
  • SpreadsheetBench:电子表格操作
  • DocVQA:多模态文档问答
  • LiveMath:数学推理
  • ALFWorld:具身环境交互
  • 数据划分 对具有官方划分的基准采用原生训练/验证/测试集;无官方划分者按 2:1:7 的比例确定性划分。SKILL-KD 仅使用训练集构建技能库,验证集留给基线方法进行模型选择,不参与 SKILL-KD 的技能训练。
  • 基线方法 对比的基线包括:No Skill(无外部技能的冻结学生)、EvoSkill、Trace2Skill、SkillGen、SkillOpt。

2. 主实验结果(Table 1)

在两种配置下,SKILL-KD 均在所有五个基准的留出测试集上取得提升:

  • Qwen3.5-4B 学生:平均得分从 43.5%(无技能)提升至 66.8%,尤其在 SpreadsheetBench、LiveMath 和 ALFWorld 上增益显著。
  • Qwen3.6-35B-A3B 学生:平均得分从 57.9% 提升至 74.6%,在结构化、数学与具身任务上保持明显优势。

结果表明,蒸馏出的技能具有跨任务的程序性指导能力,而非针对特定基准的提示调优。此外,异质设置(跨模型家族)与同质设置均获得一致提升,说明基于自然语言技能的蒸馏不依赖模型内部结构相似性。

3. 消融实验与分析

(1)自适应技能蒸馏的效果(Table 2)

为验证“对比+自适应精炼”机制的必要性,论文在 Group 1 上对比了四种技能获取变体:

  • Teacher-only:仅从教师轨迹提取技能,不观察学生失败。
  • Student-only:仅从学生失败轨迹进行自我反思。
  • Pairwise:单次对比提取,无自适应重试精炼。
  • Batch:单次聚合四条轨迹进行更新。

结果显示:

  • Teacher-only 平均仅达 58.3,证实单纯暴露强模型行为不足以生成学生可执行的指导。
  • Student-only 虽达 60.1,但生成了 96 条规则、6,821 词的臃肿库,表明自我反思易积累局部启发式规则。
  • Pairwise 与 Batch 分别停留在 59.0 与 59.4,且库体积较大。
  • SKILL-KD 以仅 38 条规则、3,010 词的紧凑库达到 66.8,说明自适应重运行验证能有效将“教师-学生差距”转化为真正改变学生行为的策略。

(2)漂移感知整合的效果(Table 3)

通过移除编辑历史(edit log)与轨迹链接(trace-link)访问权限,构建“w/o Consol.”变体。结果表明:

  • 在 SearchQA 与 ALFWorld 上,无整合变体与完整版接近;
  • 但在 SpreadsheetBench、LiveMath 与 DocVQA 上显著落后。

这说明局部有效补丁若缺乏历史上下文,易与早期积累的知识重叠或冲突,导致全局稳定性下降。

(3)案例研究:三种技能漂移模式

论文通过检查编辑历史,具体展示了无整合机制时出现的三类失败模式:

  • 案例特异性漂移(Case-specific drift):同一规则在 DocVQA 中因不同个案反复微调边界(如单位保留策略摇摆),而整合机制通过追溯早期案例将其分离为多条稳定规则。
  • 技能膨胀漂移(Skill-bloat drift):SpreadsheetBench 中出现大量绑定具体单元格坐标(如 P6:Q6)的局部补丁,整合机制将其合并为动态查找、分层计算等通用规则。
  • 破坏性更新漂移(Destructive-update drift):新补丁为推广可执行代码而覆盖了早期有效的分层奖金算法,整合机制通过检索历史将通用指导与具体算法分离保存。

(4)自适应轮数敏感性(Figure 3 与 Table 6)

在 Group 1 上分析最大自适应轮数 n 对训练效率的影响:

  • n=0 (初始尝试)平均训练成功率为 58.9%;
  • 第 1 轮后跃升至 67.7%,贡献了绝大部分总增益;
  • 第 2、3 轮分别提升至 70.8% 与 72.7%,额外增益集中于 SpreadsheetBench、LiveMath 与 ALFWorld 等多步工具使用或环境交互任务。

结果支持“有界自适应”策略:多数可迁移修正可在首轮验证中发现,少数困难案例可从后续精炼中获益,无需无限制搜索。

(5)不完美教师信号下的自适应验证(Table 4)

论文进一步考察教师并非.oracle 的场景:在学生失败的训练实例中,教师平均仅成功 46.1%。

  • 当教师成功时,补丁接受率为 45.3%;
  • 当教师失败时,接受率仍有 23.2%,且这些案例贡献了 38.5% 的已接受补丁。

这表明即使教师轨迹最终失败,其局部有效决策或替代中间策略仍可作为对比信号;自适应学生重运行起到了关键的过滤作用,确保只有实际改善学生行为的补丁被保留。

Q: 有什么可以进一步探索的点?

基于论文的框架设计与实验观察,以下几个方向值得进一步探索:

1. 技能检索与动态路由机制

论文采用将完整技能文件直接注入提示(full-skill-file setting)的方式,聚焦于技能获取、验证与整合本身。当技能库规模进一步扩大时,全量加载将带来上下文长度压力与信息过载风险。未来可探索:

  • 基于任务语义或轨迹上下文的动态技能检索,仅激活最相关的规则子集;
  • 技能路由网络,学习在不同任务阶段调用不同技能组合;
  • 检索与蒸馏的联合优化,使技能不仅“生成好”,而且“找得准”。

2. 跨任务与跨领域的技能迁移

当前实验为每个基准单独维护技能库,技能规则高度针对特定环境(如电子表格操作、具身导航)。未来可研究:

  • 技能库在不同基准之间的迁移能力,即从一个领域(如 SpreadsheetBench)蒸馏出的技能能否迁移到结构相似的新领域;
  • 跨领域技能迁移时的冲突检测与领域适配,避免通用规则在特定领域产生副作用;
  • 元技能(meta-skills)的提取,例如“先验证再执行”、“遇到异常时回退”等跨领域程序性模式。

3. 多教师对比与集成蒸馏

现有框架仅涉及单一教师-学生对。引入多教师设置可能带来更丰富的对比信号:

  • 不同教师模型可能在同一任务上采取不同但均有效的策略,通过多轨迹对比可提取更鲁棒的技能;
  • 教师之间的分歧区域可作为“技能不确定性”的指示,用于识别需要更精细规则或额外工具支持的任务类型;
  • 多教师信号也可用于构建技能质量投票机制,减少单一教师偏差导致的错误规则。

4. 在线持续学习与技能库生命周期

当前框架基于固定的训练实例批次构建技能库。在真实部署环境中,智能体通常面临非平稳任务分布:

  • 探索在线 SKILL-KD,即在测试或部署阶段遇到新失败时,实时触发对比蒸馏与库更新;
  • 研究技能库的遗忘与过时机制:当环境动态变化(如工具 API 更新、文档格式变更)时,如何自动识别并淘汰失效规则;
  • 长期运行中的技能库规模控制与压缩,在保持效果的同时避免无限增长。

5. 与参数级蒸馏的混合训练范式

SKILL-KD 完全冻结学生参数,以纯文本技能作为蒸馏载体。一个自然延伸是探索双轨蒸馏

  • 将 SKILL-KD 提取的高质量文本技能作为训练信号,用于监督微调(SFT)或强化学习(RL)阶段的学生模型;
  • 或者反过来,利用参数蒸馏得到的软标签或中间表示,辅助整合代理生成更贴合学生内部表示空间的技能规则;
  • 研究文本技能库与参数记忆之间的互补边界,何时外部规则更有效,何时内化到参数中更优。

6. 理论分析:收敛性与样本复杂度

论文以实验验证为主,未来可从理论层面刻画:

  • 自适应技能蒸馏的收敛条件:在何种教师-学生能力差距下,迭代补丁精炼能在有限轮数 n 内以高概率找到有效规则;
  • 技能库大小与任务表现之间的缩放规律(scaling law),以及漂移感知整合对库复杂度的控制作用;
  • 对比信号(教师-学生轨迹差异)相对于单信号(仅教师或仅学生)的信息论优势

7. 多模态与复杂工具链扩展

当前基准主要覆盖文本问答、电子表格与简化具身环境。未来可验证 SKILL-KD 在以下场景的适用性:

  • 视觉-语言-行动(VLA)智能体:将对比蒸馏扩展到图像观察、机器人动作序列与文本技能的联合空间;
  • 复杂软件工程/数据科学工作流:涉及多步骤代码生成、调试与外部工具链(如数据库、浏览器、IDE)的深层交互,检验技能补丁对长程错误传播的修复能力;
  • 技能规则本身从纯文本扩展为代码片段、工具调用模板或结构化配置

8. 技能安全性、可审计性与对齐治理

技能库作为持久化的外部知识库,其内容质量直接影响智能体行为的可靠性与安全性:

  • 研究对抗性或误导性教师轨迹的影响:若教师偶尔产生不安全行为,对比蒸馏能否通过学生重运行自动过滤,抑或会将错误策略编码为规则;
  • 构建技能可解释性指标:利用内部保存的 why 与 trace 字段,开发自动审计工具,追踪任意规则的数据来源与行为影响;
  • 探索价值对齐的技能约束,在蒸馏过程中注入安全准则,防止为追求任务成功率而牺牲诚实性或无害性。

Q: 总结一下论文的主要内容

该论文围绕冻结 LLM 智能体的技能级知识蒸馏展开,提出 SKILL-KD 框架,通过显式的文本技能媒介在不同能力的智能体之间迁移可复用的程序性知识。主要内容可概括如下。

1. 研究背景与核心问题

基于技能的提示机制已成为提升 LLM 智能体的重要途径,但现有技能获取方法存在根本性局限:

  • 学生失败轨迹的信息不足:学生因缺乏任务知识或操作策略而失败时,其失败轨迹往往仅呈现错误动作,难以直接反推出缺失的正确行为。
  • 教师成功轨迹过于隐式:强模型的成功演示直接总结为规则后,常因过于抽象或与学生的实际策略不对齐,无法被弱模型有效执行。
  • 局部更新导致技能漂移:基于单条轨迹证据反复修补技能库,易引发案例特异性漂移、技能膨胀漂移与破坏性更新漂移,使技能库冗余、不稳定。

为此,论文主张将技能重新定义为跨能力智能体之间的显式蒸馏媒介,以教师-学生行为差异为核心信号,构建可验证、可复用且全局稳定的技能库。

2. SKILL-KD 框架

框架包含三个相互衔接的机制:

(1)对比技能蒸馏

针对同一任务实例,分别运行学生与教师智能体,获取对比轨迹。整合代理(consolidation agent)不孤立分析任一方,而是以两者的行为差异及评估分数为依据,提取候选技能补丁。每个补丁内部记录为 (title, content, why, trace) ,其中标题与内容对学生可见,原理与轨迹索引仅用于内部审计与追溯。

(2)自适应技能蒸馏

将技能提取视为文本空间中的迭代搜索,而非一次性摘要。候选补丁被临时应用于技能库后,学生被重新运行以验证其实际效果。若学生仍失败,代理基于新的失败轨迹与累积证据修订补丁,重复此过程至多 n 轮。只有确实改变学生行为并导向成功的补丁,才会被提交至全局技能库。

(3)漂移感知技能整合

为应对反复局部更新带来的库级漂移,框架维护完整的可追溯编辑历史 H = h_1, dots, h_m ,记录每条规则的增、删、改、跳过操作及其原始动机与来源轨迹。整合代理通过 trace-link 工具按需检索历史轨迹,在提交新补丁前进行多轮审查,从而:

  • 将摇摆的个案边界固化为多条稳定规则;
  • 合并冗余的局部坐标级补丁为通用操作规则;
  • 防止新补丁覆盖先前有效的策略。

3. 实验验证

  • 评估设置:在五个智能体基准(SearchQA、SpreadsheetBench、DocVQA、LiveMath、ALFWorld)上开展实验,覆盖搜索问答、电子表格操作、文档视觉问答、数学推理与具身环境交互。测试涵盖两组配置:同质蒸馏(Qwen3.5-4B → Qwen3.7-plus)与异质蒸馏(Qwen3.6-35B-A3B → ChatGPT-5.5)。
  • 主结果:SKILL-KD 在两种配置的全部基准上均一致提升冻结学生的表现。例如,Qwen3.5-4B 的平均分从 43.5% 提升至 66.8%;Qwen3.6-35B-A3B 从 57.9% 提升至 74.6%。ALFWorld 的留出环境测试表明,技能库捕捉的是可泛化的交互策略,而非训练轨迹记忆。

  • 消融分析

  • 相较于仅从教师、仅从学生、单次对比或批量聚合的变体,自适应验证机制以显著更少的规则数(38 条 vs. 最多 96 条)实现了更高的平均得分(66.8 vs. 最高 60.1)。
  • 移除漂移感知整合后,局部有效补丁在无历史上下文时导致库不稳定,尤其在 SpreadsheetBench 与 LiveMath 上性能明显下降。
  • 自适应轮数分析显示,首轮重运行贡献了最主要增益,后续轮次对多步工具使用与交互任务仍有边际改进。
  • 教师不完美场景:即使在教师失败的训练实例中(占学生失败案例的 53.9%),仍有约 23.2% 的补丁被接受,说明对比信号在教师非.oracle 时依然有效,自适应学生重运行起到了关键过滤作用。

4. 主要贡献

  • 问题定义:将技能级知识蒸馏形式化为冻结 LLM 智能体的外部优化目标,以文本技能为蒸馏载体,以教师-学生行为差异为学习信号。
  • 方法创新:提出 SKILL-KD,通过对比蒸馏提取差异、自适应重运行验证补丁、可追溯历史实现漂移感知整合,在不更新模型参数的前提下完成跨模型族知识迁移。
  • 系统验证:在五项基准与两种教师-学生配置上的实验表明,该方法在提升任务表现的同时,维持了技能库的紧凑性与稳定性。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Qiming Shi,Yibo Dou,Jiawen Zhu,Yulong Tao,Linbo Jin,Zhaolu Kang,Yunfan Zhou,Di Weng

PDF URL: https://arxiv.org/pdf/2607.28048.pdf

Arxiv URL: https://arxiv.org/abs/2607.28048

Arxiv ID: 2607.28048

CoolPaper URL: https://papers.cool/arxiv/2607.28048

Published: 2026-08-07T02:05:57.027Z

Updated: 2026-08-07T02:05:57.027Z


18. WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

Abstract:Interactive video world models are essential for long-horizon planning and exploration, yet they suffer from compounding errors. Post-training methods such as reinforcement learning (RL) can improve these models, but they hit a verification bottleneck: for arbitrary action sequences, no ground-truth future state exists to measure long-term drift. Our key insight is that reversible action cycles make this verification possible: a sequence composed with its inverse must analytically return to the initial state, yielding annotation-free supervision on long-horizon correctness. Building on this, we introduce WorldCycle, a self-verifiable RL framework that constructs closed action cycles and their repeated executions from ordinary action sequences, and optimizes two complementary rewards: a spatial closure reward enforcing symmetry between mirrored forward and reverse segments, and a temporal consistency reward aligning states across repeated cycle executions. These rewards force the model to learn actions as consistent state operators rather than memorized temporal patterns, and extend naturally to out-of-distribution composite action cycles that the base model handles poorly. We further release CycleBench, a diagnostic benchmark for state-returning ability under complex action structures. WorldCycle reduces state returning drift by up to 44% and lifts composite-action accuracy nearly 4x over the base model, providing a vital foundation for physically grounded world models.

中文摘要

摘要:交互式视频世界模型对于长时规划和探索至关重要,但它们存在误差累积问题。训练后的方法如强化学习(RL)可以改进这些模型,但它们遇到了验证瓶颈:对于任意动作序列,没有真实的未来状态可用于衡量长期偏差。我们的关键见解是,可逆动作循环使这种验证成为可能:由动作序列与其逆序组成的序列在理论上必须回到初始状态,从而在长时正确性上提供无需标注的监督。在此基础上,我们提出了WorldCycle,一种自验证的RL框架,它从普通动作序列构建闭合的动作循环及其重复执行,并优化两种互补的奖励:空间闭合奖励,用于强制镜像的前向和反向段之间的对称性;时间一致性奖励,用于对齐重复循环执行中的状态。这些奖励迫使模型将动作学习为一致的状态操作符,而不是记忆的时间模式,并自然地扩展到基础模型处理不佳的分布外复合动作循环。我们进一步发布了CycleBench,这是一个用于复杂动作结构下状态回归能力的诊断基准。WorldCycle将状态回归偏差最多降低44%,并将复合动作准确率提升近4倍,为物理基础的世界模型提供了重要基础。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Bohai Gu,Yueyang Yuan,Taiyi Wu,Dazhao Du,Jian Liu,Xiaoyi Pang,Jie Zhang,Xiaocheng Lu,Haobin Zhong,Xiaotong Zhao,Alan Zhao,Song Guo

PDF URL: https://arxiv.org/pdf/2608.04964.pdf

Arxiv URL: https://arxiv.org/abs/2608.04964

Arxiv ID: 2608.04964

CoolPaper URL: https://papers.cool/arxiv/2608.04964

Published: 2026-08-07T02:06:05.112Z

Updated: 2026-08-07T02:06:05.112Z


19. Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models

Abstract:Leading open text-to-image models often carry complementary strengths: one may lead on preference-aligned aesthetics while another follows compositional instructions more faithfully. However, differences in their autoencoders and noise schedules make it difficult to transfer these strengths across models. In this paper, we present Poly-OPD, a framework that can consolidate complementary strengths of heterogeneous teachers into a single compact flow-matching student. To bridge the incompatible latent spaces of different teachers, Poly-OPD performs on-policy distillation through a pixel bridge. Each student-generated image is re-encoded by a selected teacher’s encoder and refined from a noise level matched by magnitude under the teacher’s noise schedule. The resulting target is further matched to the student in frozen DINOv2 space, enabling supervision across incompatible latent spaces. To retain complementary capabilities without cross-teacher interference, Poly-OPD uses a gradient compatibility diagnostic to organize its adapters: attention LoRA modules are shared across teachers, whereas feed-forward adapters remain teacher-specific. During distillation, a gap-aware curriculum devotes more training to compositional categories where the student still falls short of the teacher. As each gap narrows, training shifts toward categories with larger remaining gaps. By distilling FLUX.1-dev and Z-Image into a 2.5B SD3.5-Medium student, Poly-OPD improves GenEval from 67.3 to 73.3, surpassing both larger teachers, and raises DrawBench HPSv3 from 9.34 to 11.35, consolidating both strengths within a switchable model.

中文摘要

摘要:领先的开放文本生成图像模型通常具有互补的优势:一种模型可能在符合偏好的美学上表现突出,而另一种模型在遵循构图指令方面更为精准。然而,它们在自编码器和噪声调度上的差异,使得这些优势难以在不同模型间迁移。在本文中,我们提出了 Poly-OPD 框架,该框架能够将异构教师模型的互补优势整合到一个紧凑的流匹配学生模型中。为了桥接不同教师模型不兼容的潜在空间,Poly-OPD 通过像素桥进行在线策略蒸馏。每一张学生生成的图像会被选定教师的编码器重新编码,并在教师噪声调度下按幅度匹配的噪声水平进行优化。生成的目标进一步在冻结的 DINOv2 空间中与学生匹配,实现跨不兼容潜在空间的监督。为了在不引起跨教师干扰的情况下保留互补能力,Poly-OPD 使用梯度兼容性诊断来组织其适配器:注意力 LoRA 模块在教师间共享,而前馈适配器则保持教师专属。在蒸馏过程中,Gap-aware 教学策略会将更多训练投入仍落后于教师的构图类别。随着各个差距缩小,训练将转向尚存在较大差距的类别。通过将 FLUX.1-dev 和 Z-Image 蒸馏到 2.5B SD3.5-Medium 学生模型中,Poly-OPD 将 GenEval 从 67.3 提升至 73.3,超过了两位更大的教师模型,并将 DrawBench HPSv3 从 9.34 提升至 11.35,在可切换模型中整合了两者的优势。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文围绕异构多教师模型能力整合与蒸馏这一核心问题展开,旨在将多个在架构上互不兼容、各有所长的文本到图像生成模型的能力, consolidated 到一个轻量级的流匹配学生模型中。具体而言,论文试图解决以下四个层面的关键难题:

  • 潜空间与噪声调度不兼容的异构教师蒸馏障碍
    现有的扩散/流模型蒸馏方法(如轨迹匹配、速度匹配)通常要求教师与学生共享相同的自编码器和噪声调度,以便在统一的潜空间坐标系中进行监督。然而,本文设定中的教师模型(如 FLUX.1-dev 与 Z-Image)在自编码器、去噪器结构及噪声调度上存在本质差异,其潜空间与轨迹彼此不可读,导致传统蒸馏方法在构造上即不适用。论文需要一种不依赖共享潜空间的蒸馏机制。

  • 训练–推理分布错配的离策略(off-policy)瓶颈
    一种常见的退而求其次方法是直接让学生在教师生成的图像上进行训练。但这属于离策略学习:训练时监督的状态来自教师输出,而推理时学生沿着自身的轨迹采样,二者分布不一致,严重限制了学生对教师的逼近精度。论文需要实现异构教师场景下的在策略(on-policy)监督,即教师能够修正学生自身生成的样本。

  • 多能力共存时的梯度冲突与破坏性干扰
    当试图将“偏好对齐(美学质量)”与“组合指令遵循(计数、属性、空间关系等)”这两种互补能力同时蒸馏到同一个学生网络时,不同能力对应的参数更新方向存在冲突。实验发现,偏好模式与构图模式的梯度在部分网络层(尤其是前馈网络层)甚至指向相反方向。因此需要可测量的参数共享/隔离机制,以避免能力间的相互退化。

  • 组合能力内部子技能进展不均与训练预算错配
    即使在单一的“组合”能力内部,不同子类别(如双物体、位置、颜色绑定、计数等)的学习难度与当前学生–教师差距也各不相同:部分子技能早已饱和,而另一些仍是瓶颈。均匀采样会系统性地将训练预算浪费在已掌握的技能上。论文需要基于剩余差距的自适应课程采样策略,动态将更多计算资源分配给仍存在较大提升空间的子类别。

简言之,论文旨在回答:如何将架构异构、潜空间不兼容、能力互补的多个大型教师模型,蒸馏为一个单一、紧凑、可在推理时低成本切换能力模式的流匹配学生模型,同时克服跨模型坐标对齐、在策略监督、多能力干扰及子技能不平衡等核心挑战。

Q: 有哪些相关研究?

根据论文第2节(Related Work),相关研究主要围绕扩散/流模型蒸馏多教师知识适应两大方向展开,具体如下。

1. 扩散与流模型蒸馏(Diffusion & Flow-Matching Distillation)

  • 基础生成范式
    扩散模型与流匹配模型通过迭代去噪或连续概率流变换实现高质量图像生成(Ho, Jain, and Abbeel 2020; Song et al. 2021; Lipman et al. 2023; Liu, Gong, and Liu 2023)。

  • 传统蒸馏方法
    现有工作主要采用轨迹匹配、一致性训练、对抗目标或分布匹配等手段,将单个教师模型的知识迁移到兼容的少步学生模型(Salimans and Ho 2022; Luo et al. 2023; Song and Dhariwal 2024; Yin et al. 2024b,a)。

  • 在策略(On-Policy)蒸馏
    近期研究转向对学生自身采样轨迹进行监督,以缓解训练–推理分布不匹配:

  • DiffusionOPD(Li et al. 2026):为扩散模型推导了转移级别的在策略目标。

  • Flow-OPD(Fang et al. 2026):利用密集速度监督整合任务专门化的流教师。
  • CollectionLoRA(Wu et al. 2026):将多个定制化的LoRA教师与少步生成整合到共享适配器中。

与本文的区别:上述在策略方法均假设教师与学生具有兼容的转移核、向量场或模型派生适配器,无法直接适用于潜空间与噪声调度互不一致的异构教师。

2. 多教师适应与知识整合(Multi-Teacher Adaptation)

  • 多教师知识蒸馏
    经典研究致力于将多个教师的互补知识迁移到紧凑学生模型(You et al. 2017; Gu et al. 2024; Ko et al. 2025)。

  • 异构架构下的知识融合(Knowledge Amalgamation)
    针对任务不同或架构异构的教师,现有工作通常借助特征变换或选择性教师监督实现知识整合(Shen et al. 2019; Jing et al. 2021)。

  • 多能力联合适应中的干扰问题
    当同时适配多种能力时,常出现破坏性干扰与学习进度不均。解决方案包括:

  • 多任务优化方法:梯度归一化、冲突投影、动态任务加权(Chen et al. 2018; Yang et al. 2026; Jin et al. 2026)。

  • 模块化参数隔离:利用适配器或LoRA专家分离任务特定知识(Hu et al. 2022; Feng et al. 2024)。

与本文的区别:已有方法未同时处理异构潜空间不可读流匹配模型在策略蒸馏两大约束;Poly-OPD 通过像素桥接、DINOv2语义空间监督以及基于梯度兼容性诊断的适配器设计,将多教师适应扩展到架构完全不兼容的流模型场景。

Q: 论文如何解决这个问题?

论文提出的 Poly-OPD 通过三个相互耦合的组件解决异构多教师在策略蒸馏中的核心难题,分别对应跨模型坐标对齐多能力参数隔离子技能预算分配。以下分点详述。

1. 异构在策略蒸馏:像素桥接与语义空间监督

由于教师与学生使用不同的自编码器、去噪器及噪声调度,二者潜空间与轨迹坐标互不兼容。为此,论文设计了两阶段在策略蒸馏管线,绕过潜空间直接利用像素作为公共媒介,并在冻结的 DINOv2 语义空间中施加监督。

Stage 1:Warm Start(离策略初始化)

在训练初期,教师仅作为数据生成器提供高质量样本。对模式 e 的提示 c sim Pe ,教师生成图像 x_e^star 后,经学生编码器重编码至学生潜空间:
z
(clean)^(S,e) = E_S(x_e^star).

随后执行标准流匹配插值:
zσ^S = (1-σ) z(clean)^(S,e) + σ ε, quad ε sim N(0,I),

并以目标速度 ε - z(clean)^(S,e) 监督学生速度场 vθ :
L(WS)^e = E(c,σ,ε) | vθ(zσ^S, σ, c) - (ε - z_(clean)^(S,e)) |_2^2.

该阶段将学生分布拉近教师分布,为后续在策略精炼提供稳定基础。

Stage 2:On-Policy Distillation via Pixel Bridge

Warm Start 仍是离策略的。为消除训练–推理分布错配,第二阶段直接以学生自身生成的样本查询教师。

  1. 学生 Rollout(无梯度):学生从噪声 z0^S sim N(0,I) 出发,经欧拉积分生成轨迹 z_i^S(i=0)^(NS) ,并解码至像素:
    x^S = G_S(z
    (N_S)^S).

  2. 跨模型像素桥接:像素是异构模型唯一共享的坐标系。将学生输出经教师编码器映射到教师潜空间:
    z_(clean)^e = E_e(x^S).

  3. 教师精炼(Refinement):采样精炼深度 r sim r(min), …, r(max) ,令 ke = N_e - r 。将桥接后的潜态重噪声化至教师噪声水平 σ(ke)^e ,再运行教师去噪器剩余的 r 步:
    x
    (ref)^e = Ge!( Euler(Te)(z(k_e)^e,, k_e !to! N_e,, c) ).

此结果 x_(ref)^e 是教师对学生实际输出的在策略修正; r 连续插值了离策略模仿( r=N_e )与局部在策略校正( r=1 )之间的频谱。

  1. 噪声幅度对齐(Noise-Magnitude Alignment):教师与学生噪声调度偏移不同,故不直接匹配时间步索引,而按噪声幅度对齐。在学生轨迹中寻找满足
    j = max i : σi^S ≥ σ(ke)^e > σ(i+1)^S
    的断点 j ,令学生从缓存状态 z_j^S 继续有梯度的欧拉积分:
    x^S = G_S!( Euler_S(sg[z_j^S],, j !to! N_S,, c;, θ) ).

  2. DINOv2 语义监督:由于潜空间不兼容,损失不直接比较像素或潜态,而是比较冻结 DINOv2 的 CLS 嵌入:
    L(OPD)^e = 1 - cos!( f(x^S),; sg![ f(x(ref)^e) ] ).

DINOv2 的语义不变性抹平了不同模型特有的像素统计差异,使跨模型监督成为可能。

联合目标

每步从模式先验 π 中采样一个能力模式(如 π(pref)=λ ),并仅更新对应组件:
L^((1)) = E(esimπ)![ L(WS)^e ],

L^((2)) = E(esimπ)![ L(OPD)^e + λ(WS) L(WS)^e ],
其中 λ_(WS) 防止在策略阶段偏离过多。

2. 能力可选适配器:基于梯度兼容性的共享–隔离边界

直接将偏好与构图能力同时蒸馏到同一网络会导致破坏性干扰

Q: 论文做了哪些实验?

论文的实验围绕主性能对比消融验证两大板块展开,涵盖定量的自动评估指标与定性的可视化对比。以下按实验设置、主结果、消融研究三个层次分述。

1. 实验设置(Experimental Setup)

  • 模型配置
    学生模型采用 SD3.5-Medium(2.5 B),蒸馏源为两个架构异构的冻结教师:FLUX.1-dev(12 B) 负责偏好/美学能力,Z-Image(6 B) 负责组合指令遵循能力。提示源分别为 Pick-a-Pic(偏好模式)与 GenEval 风格的 Flow-GRPO 划分(组合模式)。

  • 训练细节

  • Warm Start:500 步。
  • OPD 阶段:800 步,学生使用 20 步欧拉采样器;教师精炼深度 $r ∈
    15, 20
    $(在 20 步教师网格上)。
  • Gap-Aware 采样:覆盖五个组合子类别(双物体、计数、颜色、位置、属性绑定),每类持有 k=32 个探针提示;每 K=50 步评估一次学生探针分数,EMA 动量 β = 0.8 ,温度 τ = 0.1 。
  • 评估协议
    所有模型在 512 × 512 分辨率下测试。

  • DrawBench(999 提示,单样本):使用偏好适配器,报告 Aesthetic Score、ImageReward、PickScore、HPSv3、UnifiedReward(及其子项 Alignment / Coherence / Style)。

  • GenEval(553 提示,每提示 4 样本)与 DPG-Bench(1065 提示):使用组合适配器,报告总体准确率及子类(位置、双物体、颜色、属性、计数等)拆分。

2. 主结果(Main Results)

2.1 偏好模式:DrawBench

使用偏好适配器时,2.5 B 的 Poly-OPD 在多项指标上超越其 SD3.5-Medium 基线,并在部分指标上超过 12 B 的 FLUX.1-dev 教师:

关键指标 SD3.5-Medium FLUX.1-dev† Poly-OPD-Preference
ImageReward ↑ 0.922 0.916 1.168
HPSv3 ↑ 9.341 11.925 11.354
UR-Alignment ↑ 3.057 3.199 3.206

Poly-OPD 在 ImageReward 与 UR-Alignment 上超过了 FLUX.1-dev,HPSv3 恢复了学生与教师之间约 78% 的绝对差距。

2.2 组合模式:GenEval 与 DPG-Bench

使用组合适配器时,Poly-OPD 将 GenEval 总体准确率从基线的 67.30 提升至 73.30,超过 Z-Image 教师(69.40)与 FLUX.1-dev 教师(65.20)。增益集中在结构化子技能:

子类别 SD3.5-M Z-Image† Poly-OPD-Composition
Overall 67.30 69.40 73.30
Two-Object 82.07 86.90 97.00
Attribute 58.75 52.80 67.00
Position 24.00 32.00 31.20
Color 81.12 83.80 84.60

值得注意的是,Attribute Binding 子类中,学生(67.00)显著高于两个教师(52.80 与 44.30),说明在策略蒸馏不受教师单项分数上限的严格束缚。DPG-Bench 总体从 84.51 提升至 85.80,关系类(Rel.)达到 85.20

2.3 定性对比

图 4 展示了 Poly-OPD 如何在视觉样本中融合教师优势:保留 FLUX 的美学质量,同时改善 Z-Image 擅长的物体计数、空间关系、颜色绑定等组合约束。

3. 消融研究(Ablation Studies)

3.1 核心组件消融

固定其余条件,逐一移除 Poly-OPD 的三大设计:

变体 GenEval HPSv3 ImageReward DPG-Bench
Full 73.3 11.354 1.168 85.80
w/o gap-aware 68.5 11.214 0.966 83.76
w/o CSA 62.3 10.117 0.804 83.59
w/o warm start 49.2 9.828 0.860 81.00
  • 移除 Capability-Selectable Adapters(CSA):将教师专用的 FFN 适配器替换为单一共享适配器,导致 GenEval 暴跌 11.0 分,HPSv3 下降 1.24,确认 FFN 层的梯度冲突会相互抵消。
  • 移除 Gap-Aware Sampling:组合子类均匀采样,主要损害双物体(88.4 vs 97.0)、属性绑定(54.8 vs 67.0)与计数(53.8 vs 59.9),证明自适应预算分配对弥补剩余差距至关重要。
  • 移除 Warm Start:直接从基线学生启动 OPD,GenEval 下降 24.1 分,表明在学生分布尚未靠近教师分布时,教师精炼信号不可靠。

3.2 教师精炼噪声范围

在 20 步教师网格上调整精炼区间 $
r(min), r(max)
$:

精炼范围 GenEval DPG ImgRwd HPSv3 UR-Avg
高噪声 [15, 20] 73.3 85.80 1.168 11.354 3.275
中噪声 [10, 15] 70.5 82.74 0.990 11.218 3.304
低噪声 [0, 10] 67.2 81.58 1.001 11.113 3.323

偏好指标对噪声范围不敏感,但组合能力需要教师在高噪声阶段介入,以便重新组织布局、物体数量和空间关系;低噪声仅能提供局部外观润色。

3.3 感知表示空间

替换式 (4) 中的特征提取器 f(·) ,其余条件固定:

特征空间 GenEval DPG ImgRwd HPSv3 UR-Avg
Student Latent MSE 崩溃
ConvNeXt 66.2 81.54 0.936 11.192 3.266
SigLIP 65.8 84.62 0.850 11.338 3.291
DINOv2 73.3 85.80 1.168 11.354 3.275
  • 直接在学生潜空间计算 MSE 导致训练崩溃,再次验证异构模型间潜空间坐标不可比。
  • DINOv2 的自监督 ViT 表征在物体结构信息上显著优于 ConvNeXt 与 SigLIP,对组合蒸馏尤为关键。

3.4 Warm Start 的定性影响

图 5 显示,仅使用 Warm Start(在教师生成图像上训练)会产生过度平滑的输出并丢失细节;而仅使用 OPD(无 Warm Start)则信号不稳定。两阶段结合能在保留细节的同时获得教师修正的可靠目标。

Q: 有什么可以进一步探索的点?

基于 Poly-OPD 的框架设计与实验观察,以下几个方向值得进一步探索:

1. 理论分析:像素桥接与在策略收敛性

当前像素桥接(Pixel Bridge)通过双重 VAE 编解码实现跨模型对齐,但学生解码再教师编码的过程会引入额外重构误差。可以进一步建立该误差在流匹配 ODE 轨迹上的传播界限,分析噪声幅度对齐策略下,教师精炼目标 x^S 与真实在策略修正之间的偏差上界。此外,精炼深度 r 的分布选择(如 r(min), r(max) )目前依赖启发式,理论上推导最优的 r 调度策略以最大化收敛速率,将提升方法论的严谨性。

2. 超越双教师:大规模异构教师网络的整合

本文聚焦于 M=2 个教师(FLUX.1-dev 与 Z-Image)。当教师数量增加时(如引入风格教师、布局教师、少步生成教师),简单的二分类共享–隔离策略可能不足。可以探索:

  • 高维梯度兼容性分析:将式 (6) 中的成对余弦相似度扩展为梯度兼容性图或张量,利用谱聚类自动划分网络模块的共享边界。
  • 层次化或混合专家(MoE)适配器:不再仅区分 Attention 与 FFN,而是在 FFN 内部引入稀疏路由,令不同能力激活不同专家子网络,公式上可写作
    h(out) = ∑(e=1)^(M) ge(x) · FFN_e(h(∈)),
    其中 g_e(x) 为基于提示语义的门控权重。

3. 潜空间桥接:绕过像素以提升效率

像素桥接虽解决了异构潜空间不可读的问题,但每步训练需执行学生 VAE 解码、教师 VAE 编码及教师精炼,计算开销显著。未来可尝试学习一个轻量的潜空间对齐网络(Latent Aligner) A(Sto T) ,直接将学生潜态映射到教师潜态空间:
z
(aligned)^(T) = A_(Sto T)(z^S).

若该对齐网络能在保持语义一致性的同时避免像素往返,训练成本将大幅降低。难点在于如何在不访问教师内部参数的情况下,仅以像素级 DINOv2 监督训练该对齐器。

4. 动态与混合的感知监督空间

Poly-OPD 固定使用 DINOv2 CLS 特征作为跨模型语义空间。然而不同能力可能更适配不同视觉基础模型:美学质量或许受益于美学预测器的隐层特征,细粒度属性绑定或许需要 CLIP 的密集 token 特征。可探索自适应感知融合
f(mix)(x) = ∑(k=1)^(K) w_k(c) · f_k(x),
其中 f_k 为不同的冻结视觉编码器,权重 w_k(c) 依据当前提示 c 或模式 e 动态选取。这要求设计一个元网络,根据蒸馏目标自动分配感知监督来源。

5. 与少步/实时生成范式的结合

当前学生仍使用 20 步欧拉采样器。将 Poly-OPD 蒸馏至一步或两步生成(如结合一致性模型、分布匹配蒸馏 DMD 或对抗蒸馏)是极具应用价值的方向。核心挑战在于:少步 regime 下学生轨迹的分布偏移更大,教师精炼需从更高噪声水平介入,且像素桥接中的单次解码–编码误差对低步数样本的损害更显著。需要重新设计 Warm Start 与 OPD 的过渡机制,或直接在少步空间定义噪声幅度对齐策略。

6. 完全在线的无探针课程学习

Gap-Aware Sampling 依赖每 K 步在固定探针集上评估学生,这引入了额外的推理开销与类别先验。可以探索无探针的在线差距估计,直接利用训练 batch 内部的损失景观或学生生成置信度来推断各子技能的剩余提升空间:
g_a arrow β g_a + (1-β) max( L_a^(teacher) - L_a^(student),, 0 ).

若无需维护离线探针集与定期评估,课程学习将更加轻量,且能适应动态变化的能力边界。

7. 跨模态扩展:视频、3D 与图像编辑

像素作为“公共坐标系”的思想可推广至其他模态:

  • 文生视频:不同视频生成模型(如 CogVideoX、Mochi)的时空潜空间同样互不兼容,可将像素桥接扩展为帧序列桥接,利用视频 DINO 或时空一致性模型作为公共感知空间。
  • 文生 3D:点云或 NeRF 渲染图像可作为异构 3D 生成模型之间的像素级桥梁。
  • 可控生成:将 Poly-OPD 与 ControlNet、IP-Adapter 等条件机制结合,研究在策略蒸馏下如何保持异构教师的组合能力与控制精度。

8. 基于梯度诊断的自动化架构搜索

当前通过式 (6) 的梯度余弦相似度手动决定 Attention 共享、FFN 隔离。这一诊断过程可进一步自动化:引入可学习的软共享门控 $g_l^u ∈
0,1
$ 控制每一层、每一模块类型的共享程度,通过元学习或双层优化在蒸馏过程中动态调整,使网络自动发现最优的知识隔离边界,而非预设“Attention 共享、FFN 隔离”的硬规则。

Q: 总结一下论文的主要内容

这篇论文提出 Poly-OPD(Heterogeneous Multi-Teacher On-Policy Distillation),旨在将架构异构、潜空间互不兼容的多个文本到图像生成教师模型的互补能力,蒸馏到单一紧凑的流匹配学生模型中,且推理时可通过切换适配器低成本选择激活的能力。

1. 核心问题

  • 异构潜空间不可读:现有蒸馏方法(轨迹匹配、速度匹配等)要求教师与学生共享自编码器和噪声调度。FLUX.1-dev、Z-Image 等教师使用不同的 VAE 和去噪器,其潜空间坐标与轨迹对学生无效。
  • 离策略(Off-Policy)瓶颈:直接用教师生成图像训练属于离策略学习,训练状态来自教师分布,而推理时学生沿自身轨迹采样,分布错配限制了逼近精度。
  • 多能力干扰:偏好对齐(美学)与组合遵循(计数、颜色、空间关系等)的更新梯度在部分网络层相互冲突,简单共享参数会导致能力退化。
  • 子技能进度不均:组合能力内部各子类别(如双物体、属性绑定)学习难度不同,均匀采样浪费预算在已饱和技能上。

2. 方法框架

Poly-OPD 通过三个相互耦合的组件解决上述问题:

2.1 异构在策略蒸馏(Heterogeneous On-Policy Distillation)

利用像素空间作为异构模型唯一共享的坐标系,构建两阶段管线:

  • Stage 1: Warm Start
    教师生成图像经学生 VAE 编码后作为流匹配目标,将学生分布初步拉近教师:
    L(WS)^e = E(c,σ,ε) | vθ(zσ^S, σ, c) - (ε - z_(clean)^(S,e)) |_2^2.

  • Stage 2: On-Policy Distillation via Pixel Bridge
    学生无梯度 Rollout 生成图像 x^S = GS(z(NS)^S) ,经教师编码器进入教师潜空间 z(clean)^e = Ee(x^S) 。采样精炼深度 r ,将潜态重噪声化至教师噪声层级 σ(ke)^e 后,运行教师剩余的 r 步去噪:
    x
    (ref)^e = Ge!( Euler(Te)(z(k_e)^e,, k_e !to! N_e,, c) ).

为对齐不兼容的噪声调度,不采用时间步索引,而是按噪声幅度匹配学生在断点 j 处的缓存状态继续有梯度生成 x^S 。监督在冻结的 DINOv2 CLS 语义空间进行,规避模型特定的像素统计差异:
L(OPD)^e = 1 - cos!( f(x^S),; sg![ f(x(ref)^e) ] ).

2.2 能力可选适配器(Capability-Selectable Adapters)

通过梯度兼容性诊断量化不同能力模式下各模块梯度的余弦相似度:
kappal^u = E![ langle ∇l^u) L(pref),, ∇(θ_l^u) L(comp) rangle|∇(θ_l^u) L(pref)| |∇(θ_l^u) L(comp)| ].

实验发现 Attention 梯度跨模式对齐,而 FFN 梯度在多块中冲突甚至反向。据此设计:

  • 共享:注意力层插入单一 LoRA, W_l^(attn) arrow W_l^(attn) + B_l^(attn) A_l^(attn) 。
  • 隔离:FFN 层为每模式保留独立适配器, Wl^(ffn) arrow W_l^(ffn) + B(l,e)^(ffn) A_(l,e)^(ffn) 。

冻结主干,选择能力时仅需切换 FFN 适配器。

2.3 差距感知自适应采样(Gap-Aware Adaptive Sampling)

针对组合模式内的子技能,每 K 步用探针提示评估教师–学生剩余差距:
ga arrow β g_a + (1-β) max(s_a^T - s_a^S,, 0),
并归一化为采样分布:
p(a) = (exp(g_a / τ)) / (∑
(a’) exp(g_a’) / τ).

预算向差距仍大的类别倾斜,且随差距缩小自动退火,无需外部调度。

3. 实验结果

SD3.5-Medium(2.5 B) 为学生,FLUX.1-dev(12 B) 为偏好教师,Z-Image(6 B) 为组合教师:

  • 偏好模式(DrawBench):ImageReward 从 0.922 提升至 1.168,HPSv3 从 9.341 提升至 11.354;在 ImageReward 与 UR-Alignment 上超过 FLUX.1-dev
  • 组合模式(GenEval):总体准确率从 67.30 提升至 73.30,超越两位教师;双物体(82.07→97.00)、属性绑定(58.75→67.00)、位置(24.00→31.20)等结构化类别显著增益。DPG-Bench 从 84.51 提升至 85.80

消融验证了各组件的必要性:移除 FFN 隔离(CSA)导致 GenEval 下降 11.0 分;移除 gap-aware 采样主要损害双物体与属性绑定;移除 warm start 导致训练崩溃;高噪声精炼区间 $
15,20
$ 对组合能力至关重要;DINOv2 显著优于 ConvNeXt、SigLIP 及直接潜空间 MSE。

4. 主要贡献

  • 首次形式化并解决了异构、潜空间不兼容多教师流模型的在策略蒸馏问题,突破了传统方法对共享坐标系的依赖。
  • 提出像素桥接 + 噪声幅度对齐 + DINOv2 语义监督的跨模型在策略蒸馏范式,以及基于实测梯度兼容性的自适应参数共享/隔离边界
  • 提出差距感知课程采样,动态将训练预算分配至剩余教师–学生差距最大的子技能。
  • 在 2.5 B 参数规模上实现能力整合,多项指标超越更大的异构教师,证明了在策略训练相较于纯模仿教师样本的优势。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Siming Fu,Haojun Xu,Ruizhe He,Zheming Fu,Hualiang Wang,Jie Huang,Xiaoxiao Ma,Mingchen Zhong,Weihu Huang,Xiaoxuan He,Linjiang Huang,Si Liu

PDF URL: https://arxiv.org/pdf/2608.04349.pdf

Arxiv URL: https://arxiv.org/abs/2608.04349

Arxiv ID: 2608.04349

CoolPaper URL: https://papers.cool/arxiv/2608.04349

Published: 2026-08-07T02:07:45.701Z

Updated: 2026-08-07T02:07:45.701Z


20. OPD-V: Visual On-Policy Self-Distillation with Modality Balance

Abstract:On-Policy Self-Distillation (OPSD) has become a standard post-training approach for improving visual reasoning in multimodal large language models (MLLMs). Existing methods draw privileged information from diverse input sources to guide self-distillation. Yet these designs overlook Modality Imbalance, a challenge inherent to MLLM reasoning. When textual information dominates generation, the model cannot fully integrate its multimodal input. Consequently, carefully designed privileged information remains underused, limiting the effectiveness of OPSD. To examine this limitation, we construct a Positive Teacher with the Zoom-In Image and a Negative Teacher with the Mask Image, which exhibit different degrees of Modality Imbalance. Changes in their reasoning correctness and token logits reveal that Modality Balance can itself serve as privileged information. Motivated by this finding, we introduce OPD-V, a visual OPSD paradigm that instantiates such information through the Positive Teacher and Negative Teacher. Positive Modality-Balance Logits Margins define a Modality-Balance Trust Region that selects the on-policy tokens used for self-distillation. Experiments across 6 benchmarks, 4 MLLM backbones, and 5 post-training methods show that OPD-V consistently improves reasoning performance while reducing training cost.

中文摘要

摘要:在策略自蒸馏(On-Policy Self-Distillation, OPSD)已经成为提高多模态大语言模型(MLLM)视觉推理能力的标准后训练方法。现有方法从多样输入源中获取特权信息以指导自蒸馏。然而,这些设计忽略了模态不平衡(Modality Imbalance)——这是MLLM推理中固有的一大挑战。当文本信息在生成过程中占主导时,模型无法充分整合其多模态输入。因此,精心设计的特权信息往往未能得到充分利用,从而限制了OPSD的效果。为了研究这一限制,我们构建了使用放大图像(Zoom-In Image)的正向教师(Positive Teacher)和使用遮罩图像(Mask Image)的负向教师(Negative Teacher),它们表现出不同程度的模态不平衡。其推理正确性和词元(token)对数几率的变化表明,模态平衡(Modality Balance)本身可以作为特权信息。受此发现启发,我们提出了OPD-V,一种视觉OPSD范式,通过正向教师和负向教师来实现这种信息。正向模态平衡对数几率边际(Positive Modality-Balance Logits Margins)定义了一个模态平衡信任区域(Modality-Balance Trust Region),用于选择自蒸馏所使用的策略内词元。跨6个基准数据集、4个MLLM骨干网络和5种后训练方法的实验表明,OPD-V在提高推理性能的同时,还能降低训练成本。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文主要解决多模态大语言模型(MLLMs)在 On-Policy Self-Distillation(OPSD)后训练过程中面临的模态不平衡(Modality Imbalance)问题,具体可分解为以下三个层面:

1. 识别现有限制:模态不平衡削弱特权信息的效用

现有视觉 OPSD 方法普遍通过构造特权信息(privileged information)——如文本参考答案、证据中心裁剪(evidence-centered crop)或视觉思维链——来指导教师模型(teacher)对策略轨迹进行打分。然而,这些方法忽略了一个内生于 MLLM 推理的现象:模态不平衡,即模型的生成过程被文本上下文(textual priors)过度主导,而视觉输入未被充分整合。由此导致的结果是,即使教师模型接收了精心设计的特权输入,其输出的监督信号仍可能主要反映语言先验,而非视觉证据,造成特权信息的低效利用。

2. 提出核心研究问题

论文在引言中明确将问题形式化为:

在模态不平衡的条件下,如何设计特权信息,才能使其在 MLLM 的 OPSD 中保持有效?

换言之,问题不仅在于“给教师模型提供更多信息”,而在于确保特权信息能够显式地促进视觉与文本模态的均衡利用,从而提升自蒸馏对视觉推理的真实贡献。

3. 解决方案:将模态平衡本身转化为特权信息

为回答上述问题,论文提出 OPD-V,其核心思想是把**模态平衡(Modality Balance)**本身作为一种新的特权信息,而非依赖外部的参考答案或额外视觉输入。具体通过以下机制实现:

  • 正教师(Positive Teacher):接收放大图像(Zoom-In Image),增强对任务相关视觉区域的关注,提升模态平衡度;
  • 负教师(Negative Teacher):接收掩码图像(Mask Image),削弱视觉信息,降低模态平衡度;
  • 模态平衡信任区域(Modality-Balance Trust Region):利用正负教师对同一策略 token 的 logits 差异(Modality-Balance Logits Margin)筛选出那些真正因视觉证据增强而获得更高支持的 token,仅在这些 token 上执行 Jensen–Shannon 自蒸馏。

综上,论文试图解决的问题可概括为:如何克服 MLLM OPSD 中的模态不平衡,使特权信息的设计不再仅仅增加输入量,而是显式地引导模型在视觉与文本模态之间实现更平衡的推理,从而提升视觉推理性能并降低训练成本。

Q: 有哪些相关研究?

该论文的相关研究主要集中在两大脉络:On-Policy Self-Distillation(OPSD)方法的发展,以及多模态大语言模型(MLLM)中的模态不平衡(Modality Imbalance)现象

1. 从监督微调到 On-Policy Self-Distillation

  • 监督微调(SFT)与知识蒸馏:SFT 通过强制教师前缀(teacher-forced prefixes)在参考响应上训练模型,但监督信号固定于参考轨迹,无法覆盖学生自身生成的状态。知识蒸馏(Knowledge Distillation)将目标从单 token 变为教师分布,代表性工作包括 Hinton 等人提出的通用蒸馏框架
    33
    与序列级知识蒸馏
    34
    ,以及后续针对推理过程的建模
    35
    与基于 rollout echoing 的强化学习
    36

  • On-Policy Distillation(OPD):Agarwal 等人
    1
    与 Lu 等人
    2
    提出在策略轨迹上进行蒸馏——学生先采样自身的响应,再由教师评估学生实际访问的前缀状态。相比 SFT,OPD 能够暴露模型在自身 rollout 上的错误并提供 token 级反馈。

  • On-Policy Self-Distillation(OPSD):Zhao 等人
    3
    进一步将外部教师替换为与当前学生参数分离的模型副本(detached copy),使教师在学生生成的每个前缀上提供密集监督,无需单独训练外部教师。

  • 视觉 OPSD 的近期扩展:为增强特权信息(privileged information),近期研究转向利用变换后的视觉输入:

  • Vision-OPD
    4
    :以证据中心裁剪(evidence-centered crop)为教师条件,突出任务相关区域;
  • Visual-OPSD
    5
    :引入特权视觉思维链(privileged visual thoughts)进行跨模态蒸馏;
  • VA-OPD
    6
    :通过改变教师对视觉内容的访问权限构建对比信号;
  • VCSD
    7
    :采用视觉对比自蒸馏策略;
  • 解耦感知与推理
    37
    :探讨在捷径(shortcut)存在时如何分离感知与推理阶段进行自蒸馏。

2. MLLM 中的模态不平衡(Modality Imbalance)

模态不平衡指 MLLM 在生成过程中对文本上下文(textual priors)的依赖程度显著高于视觉输入,即使任务需要视觉证据支持。该现象限制了 OPSD 中特权信息的有效性,因为教师的高置信度分布可能主要反映语言先验,而非视觉证据。

  • 模态失衡的发现与度量:研究表明,文本信息可在视觉问答与推理中主导预测
    8, 9, 10, 11
    。例如,Park 等人
    9
    探讨了从简单视觉推理到困难视觉推理的泛化障碍,并指出模态失衡是核心因素;Zhang 等人
    10, 11
    系统评估并剖析了 MLLM 的模态偏好与仲裁机制。

  • 缓解模态失衡的相关方向:其他工作从互补角度探索了视觉信息的有效利用,包括:

  • 基于模态线性表征操控的指令微调
    8
  • 无训练多模态数据选择
    38
  • 视觉 token 压缩基准
    39
  • 注意力可引导的对比解码以减少幻觉
    40
  • 面向多模态时序知识与知识注入的更新方法
    41, 42

3. 与 OPD-V 的直接对比关系

OPD-V 与上述视觉 OPSD 方法
4, 5, 6, 7
的核心差异在于:现有方法侧重于构造外部特权输入(如裁剪图像或视觉思维),但未显式考虑模态不平衡对教师信号质量的内在影响。OPD-V 首次将模态平衡本身视为特权信息,通过正负教师(Zoom-In Image vs. Mask Image)的对比与 Modality-Balance Trust Region 的筛选,确保蒸馏信号优先来自视觉与文本模态更均衡的预测位置。

Q: 论文如何解决这个问题?

论文通过提出 OPD-V(Visual On-Policy Self-Distillation with Modality Balance) 框架来解决模态不平衡问题。该框架将模态平衡本身转化为可操作的特权信息(privileged information),通过构造具有不同模态平衡度的教师模型对比,筛选出真正受视觉证据支持的策略 token 进行蒸馏。具体解决路径可分为以下五个层面:

1. 核心思想:将模态平衡作为特权信息

不同于传统 OPSD 直接附加文本参考答案或变换视觉输入作为特权信息,OPD-V 认为模态平衡状态——即模型在生成过程中对视觉与文本信息的内部分配比例——才是关键的监督信号。论文构造了两个匹配的教师视图:

  • 正教师(Positive Teacher):接收放大图像(Zoom-In Image) I_(zoom) ,以增强任务相关视觉区域的显著性,促使模型提升视觉依赖度;
  • 负教师(Negative Teacher):接收掩码图像(Mask Image) I_(mask) ,通过遮蔽局部视觉信息削弱视觉证据,使模型更易依赖文本先验。

两者共享相同的文本查询 x 与学生生成前缀 y_(<t) ,其分布差异仅源于视觉输入的变换,从而显式暴露出生成过程中模态不平衡程度的变化。

2. 双教师分布的对比定义

设学生模型为 pθ ,其生成轨迹为 y sim pθ(· mid I, x) 。在 token 位置 t ,学生分布为:

p(θ,t)(·) := pθ(· mid I, x, y_(<t))

正负教师通过分离的 EMA 参数 θ 对相同学生前缀进行打分:

qt^+(·) = p(θ)(· mid I(zoom), x, y(<t)), quad qt^-(·) = p(θ)(· mid I(mask), x, y(<t))

其中 I(zoom) 为对原始图像中证据区域裁剪并放大后的结果; I(mask) 则在 I_(zoom) 基础上将随机矩形区域替换为黑色像素,形成视觉弱化条件。

3. 模态平衡信任区域(Modality-Balance Trust Region)

为将模态平衡转化为 token 级选择标准,OPD-V 定义模态平衡 Logits 边际(Modality-Balance Logits Margin)

δ_t^(MB) = log q_t^+(y_t) - log q_t^-(y_t)

该边际衡量同一学生生成 token y_t 在视觉增强(Zoom-In)与视觉弱化(Mask)条件下的对数概率差异。当 δ_t^(MB) > 0 时,表明该 token 在视觉证据被放大时获得更强支持,其推理更可能建立在视觉信息之上,而非纯粹文本先验。

据此,模态平衡信任区域被定义为所有具有正边际的 token 索引集合:

R_(MB)(y) = t ∈ T_y ,|, δ_t^(MB) > 0

该区域动态筛选出模态平衡度较高的状态,作为蒸馏的目标位置。

4. 蒸馏目标函数与训练算法

在信任区域内,OPD-V 仅对正教师分布 qt^+ 与学生分布 p(θ,t) 执行 Jensen–Shannon 蒸馏,并以 δ_t^(MB) 对所选 token 进行加权。设 r_t ∈ 0,1 为有效生成 token 指示器,则目标函数为:

L(OPD-V)(θ) = E[ (1) / (∑(t ∈ Ty) r_t) ∑(t ∈ RMB)(y) r_t , δ_t^(MB) , D(JS)!(qt^+, p(θ,t)) ]

其中 D(JS) 为 Jensen–Shannon 散度。由于所有 t ∈ R(MB)(y) 均满足 δ_t^(MB) > 0 ,该边际自然起到了放大高置信度视觉信号、抑制文本主导 token 的作用。

训练流程(对应论文 Algorithm 1)总结如下:

  1. 学生基于原始图像 I 采样 n 条 on-policy 轨迹;
  2. 对每个 token 位置,并行计算学生分布 p_(θ,t) 、正教师分布 q_t^+ 与负教师分布 q_t^- ;
  3. 计算 δ_t^(MB) ,保留满足 δ_t^(MB) > 0 且 r_t = 1 的位置;
  4. 在这些位置上计算加权 JS 散度损失,反向传播更新学生参数;
  5. 以 EMA 率 τ 更新教师参数: θ arrow (1-τ)θ + τθ 。

5. 计算效率与工程优化

尽管 OPD-V 引入了一个额外的负教师前向传播,但通过以下设计实现了整体训练成本的降低:

  • 响应长度显著缩短:如图 3(a) 所示,OPD-V 避免了 OPSD 后期的响应长度膨胀,最终平均响应长度较 OPSD 减少约 74.5%,直接降低了生成、前向传播与反向传播的 token 数量;
  • 更高效的特权输入构造:OPD-V 仅需对图像进行裁剪与遮蔽操作,无需像 OPSD 那样插入参考答案并重构多模态教师序列,使得教师批次构造时间从 79.2 秒降至 15.3 秒(以 9B 模型为例);
  • Top-K 蒸馏:为避免全词表 logit 的内存开销,仅在学生 top-K( K=100 )token 上计算教师分布,并通过尾部概率桶(tail bucket)保留剩余词表质量,实现近似无损的内存高效蒸馏。

综上,OPD-V 通过正负教师对比显式量化模态平衡,通过信任区域选择视觉依赖度高的策略状态,并通过加权 JS 蒸馏将模态平衡转化为密集的监督信号,最终在提升视觉推理准确率的同时降低了训练延迟。

Q: 论文做了哪些实验?

该论文围绕 OPD-V 展开了系统性实验,覆盖 4 个 MLLM 骨干网络6 个多模态基准测试 以及 5 类后训练方法。实验从整体有效性计算效率机制有效性三个研究问题(RQ)切入,具体包括以下方面:

1. 实验设置

  • 骨干网络:在以下四种架构上验证 OPD-V:
  • Qwen3.5-4B / Qwen3.5-9B(采用早期视觉–文本融合与 3:1 混合语言骨干)
  • Qwen3-VL-4B-Instruct / Qwen3-VL-8B-Instruct(采用 Interleaved-MRoPE 与 DeepStack 视觉特征注入)
  • 训练数据:使用 Vision-OPD 提供的 6.2K 合成视觉推理样本。
  • 训练配置:采用 Jensen–Shannon 散度( β = 0.5 )作为蒸馏目标;为降低全词表 logit 蒸馏的内存开销,实施 Top-K 蒸馏( K=100 )并辅以尾部概率调整;教师参数通过学生权重的指数移动平均(EMA, τ=0.05 )维护;最大生成长度为 1024 个 token,训练 1 个 epoch。

  • 评估基准:共 6 项,覆盖高分辨率、细粒度视觉推理与真实场景:

  • V* Bench:高分辨率密集场景中的小目标定位与识别
  • ZoomBench:从完整图像中恢复细微区域证据
  • HR-Bench(4K / 8K):原生高分辨率图像理解
  • MME-RealWorld(EN / CN):真实世界多模态任务(含中英文)
  • 对比基线
  • 闭源模型:GPT-5.2、GPT-5.4、Gemini-3.1-Pro、Gemini-3.5-Flash
  • 开源模型:DeepEyes、Thyme、DeepEyesV2、SenseNova-MARS、MiMo-VL-RL、ZwZ、MiniCPM-V-4.5、GLM-4.6V、Qwen3-VL-Instruct(235B)、Qwen3.5(397B)、Kimi-K2.6(1T)等
  • 同设置后训练方法(基于 Qwen3.5-4B 与相同数据):SFT、GRPO、OPSD、Vision-OPD、VA-OPD

2. RQ1:整体有效性实验

(1) 与现有后训练方法的对比

在 Qwen3.5-4B 上,OPD-V 将平均准确率从基础模型的 64.30% 提升至 80.01%(绝对提升 15.71 个百分点),显著优于同设置下最强的 Vision-OPD(77.10%),并在全部 6 个基准上均取得优势。

(2) 跨架构与参数规模的泛化

如图 4 所示,OPD-V 在不同模态融合机制的骨干上均实现一致提升:

  • Qwen3-VL-4B:平均从 68.00% 提升至 74.14%
  • Qwen3-VL-8B:平均从 68.93% 提升至 73.03%
  • Qwen3.5-9B:平均从 69.75% 提升至 77.63%

值得注意的是,经 OPD-V 训练的 Qwen3.5-4B(仅 4B 参数)在平均准确率上超过了 GPT-5.2、GPT-5.4、Gemini-3.1-Pro、Gemini-3.5-Flash 等闭源模型,也超过了 397B 参数的 Qwen3.5 与 1T 参数的 Kimi-K2.6。

(3) 训练动态分析

通过监测训练过程(图 3),论文验证了以下行为特征:

  • 响应长度:OPD-V 的响应长度在训练后期保持稳定(平均约 141 个 token),而标准 OPSD 出现显著膨胀(约 554 个 token),相对减少 74.5%
  • 模态平衡信任区域(Modality-Balance Trust Region):训练预热后,约 53.8%(4B)与 49.6%(9B)的 on-policy token 落在信任区域内,表明正负教师的筛选机制在整个训练过程中持续有效。
  • 策略熵(Policy Entropy):预热后策略熵保持稳定(4B 约 0.827,9B 约 0.761),说明 OPD-V 维持了非退化的学习信号。

3. RQ2:计算效率实验

通过对比 wall-clock 单步时间(图 5),OPD-V 在增加一个负教师前向传播的情况下,仍实现了训练加速:

  • Qwen3.5-4B:单步延迟从 352 秒降至 240 秒,降低 31.8%
  • Qwen3.5-9B:单步延迟从 451 秒降至 340 秒,降低 24.7%

效率提升主要来自两方面:

  1. 更短的响应长度:减少了生成、前向与反向传播的 token 数量;
  2. 更高效的特权输入构造:OPD-V 仅需对图像做裁剪与掩码操作,而 OPSD 需插入参考答案并重构多模态教师序列,使得教师批次构造时间从 79.2 秒降至 15.3 秒(9B 模型)。

4. RQ3:机制有效性实验(消融研究)

(1) 正负教师的互补性(图 6a)

在 Qwen3.5-4B 上的消融表明:

  • 仅使用负教师(Mask Image):平均准确率 71.98%
  • 仅使用正教师(Zoom-In Image):平均准确率 74.62%
  • 两者结合(OPD-V):平均准确率 80.01%

结合后的性能超过较强单教师变体 5.39 个百分点,验证了正负教师在蒸馏目标与信任区域筛选中的互补作用。

(2) 视觉变换策略的对比(图 6b)

固定一侧教师,替换另一侧的视觉操作:

  • 正教师变换(固定 Mask Image):将 Zoom-In Image 替换为 Repeat Image(重复原始图像),准确率从 80.01% 降至 75.95%。
  • 负教师变换(固定 Zoom-In Image):对比 Mask Image、Blur(模糊)、Prune(剪枝)与 No Image(无图像):
  • Mask Image:80.01%
  • Blur:74.31%
  • Prune:73.74%
  • No Image:72.17%

结果表明,Zoom-In Image 与 Mask Image 的组合能够产生最有效的模态平衡对比与信任区域,优于其他视觉退化策略。

5. 实验结论

综合上述实验,论文验证了 OPD-V 在多种架构不同参数规模多样化视觉推理任务上均能实现性能提升,同时通过更短的响应长度与更高效的输入构造降低了训练成本,且其双教师对比机制与特定的视觉变换策略对最终效果具有决定性作用。

Q: 有什么可以进一步探索的点?

基于论文的方法设计与实验观察,以下方向具有进一步探索的潜力:

1. 正负教师视觉变换策略的自动化与自适应化

论文中 I(zoom) 依赖于训练数据提供的证据中心裁剪(bounding box),而 I(mask) 采用随机矩形遮蔽。可探索的方向包括:

  • 任务无关的 Zoom-In 生成:在缺乏显式边界框标注的场景中,借助显著性检测(saliency detection)或模型自身的梯度反馈自动定位任务相关区域,从而摆脱对预标注裁剪的依赖。
  • 结构化负样本构造:当前随机遮蔽可能破坏图像的语义一致性;可探索基于注意力反演的“对抗性遮蔽”(adversarial masking),即刻意遮蔽对学生推理影响最大的区域,以产生更具区分度的负教师信号。
  • 多尺度教师集成:使用多个不同放大倍率的 Zoom-In 图像构建正教师集合,或引入模糊(Blur)、降采样(Down-sample)等连续谱的负教师,形成更细粒度的模态平衡连续度量,而非二元的信任区域。

2. 信任区域选择机制的动态化与可学习化

当前 Modality-Balance Trust Region 采用硬阈值 δ_t^(MB) > 0 进行 token 筛选,且权重直接等于 margin 本身。可探索:

  • 自适应阈值/软化选择:将硬截断替换为可学习的门控函数(gating function)或基于课程学习(curriculum learning)的动态阈值,在训练早期放宽视觉证据要求,后期逐步收紧。
  • 上下文感知的 margin 重加权:当前 δ_t^(MB) 对信任区域内所有 token 一视同仁;可引入 token 位置(如推理步骤的起始 vs. 结尾)或全局样本难度作为调节因子,对关键推理节点施加更高权重。
  • 信任区域与置信度的联合建模:探索将模态平衡 margin 与教师分布的预测置信度(entropy 或 max-probability)相结合,防止在视觉信息增强但教师本身高度不确定的 token 上施加错误监督。

3. 模态不平衡的理论形式化与因果归因

论文通过注意力质量比 rho(c; y) 对 Modality Imbalance 进行了操作性定义,但其与最终推理正确性的因果机制仍偏经验性:

  • 因果干预分析:通过结构化因果模型(SCM)或 do-calculus 显式分离“视觉输入变化”与“文本先验变化”对教师 logits 的独立影响,量化模态平衡在推理链条中的因果效应。
  • 跨层注意力流追踪:当前 rho(c; y) 聚合了全序列的注意力质量;可借助注意力流(attention flow)或基于梯度的归因方法,追踪视觉与文本信息在 Transformer 各层的交互路径,识别模态不平衡发生的具体层与头。
  • 模态平衡的纳什均衡视角:将视觉与文本模态的贡献建模为博弈或信息瓶颈问题,探讨在何种信息分配比例下模型的推理能力达到最优。

4. 与强化学习及大规模训练的深度融合

论文在对比基线中包含了 GRPO,但 OPD-V 本身仍属于蒸馏范式:

  • OPD-V + 结果奖励的混合训练:将 Modality-Balance Trust Region 作为策略梯度中的基线(baseline)或优势函数(advantage function)的调节项,把过程级的模态平衡监督与结果级的正确性奖励相结合。
  • 大规模与长周期训练:当前实验仅在 6.2K 样本上训练 1 个 epoch。探索 OPD-V 在更大规模(如百万级)视觉指令数据与多轮迭代训练下的扩展性(scaling behavior),以及信任区域比例是否会随数据量发生系统性漂移。
  • 在线 EMA 更新率的自适应:当前教师 EMA 率 τ = 0.05 固定;可探索基于训练步数或学生-教师分歧度的动态 τ 调整,以在训练初期保持教师稳定性,后期加速教师对策略分布的追踪。

5. 跨架构与跨模态的迁移验证

论文仅在 Qwen 系列(Qwen3.5 与 Qwen3-VL)上验证:

  • 异构视觉编码器:测试 OPD-V 在采用不同视觉编码策略的模型上的有效性,例如 PixelShuffle 下采样、Perceiver Resampler 或原生高分辨率 ViT(如 NaViT),观察视觉编码方式是否影响 Modality-Balance Attention Ratio 的可靠性。
  • 非文本模态扩展:将“模态平衡”概念推广至视频(视觉-时序平衡)、音频(听觉-文本平衡)或任意模态对,构建通用的 Modality-Balance OPD 框架。
  • Thinking / Long-Chain Reasoning 模式:论文明确在 non-thinking 模式下评估。在支持长思维链(long chain-of-thought)的 MLLM 中,模态不平衡可能在中间推理步骤与最终答案步骤呈现不同模式,信任区域的选择策略可能需要针对 reasoning steps 重新设计。

6. 推理阶段的模态平衡干预

OPD-V 将模态平衡作为仅存在于训练时的特权信息,推理阶段学生仅接收 Original Image:

  • 测试时增强(Test-Time Augmentation):在推理时以较低成本运行正负教师的前向传播,利用 δ_t^(MB) 作为解码阶段的对比校准信号(如对比解码或 Speculative Rejection),实时纠正模态失衡导致的错误生成。
  • 视觉提示工程(Visual Prompting):基于训练阶段学到的信任区域模式,在推理时通过输入级视觉提示(如在图像上叠加任务相关标记)主动提升视觉注意力占比,作为免训练的推理增强手段。

Q: 总结一下论文的主要内容

该论文围绕多模态大语言模型(MLLMs)的后训练优化展开,核心内容可概括为以下五个方面:

1. 研究背景与核心问题

On-Policy Self-Distillation(OPSD) 已成为提升 MLLM 视觉推理能力的标准后训练方法。现有工作通过构造各类特权信息(privileged information)——如文本参考答案、证据中心图像裁剪或视觉思维链——来指导教师模型对学生策略轨迹进行监督。然而,这些设计普遍忽略了 MLLM 推理中固有的 模态不平衡(Modality Imbalance) 现象:模型在生成过程中过度依赖文本上下文(textual priors),而未能充分整合视觉输入。这导致即使教师接收了精心设计的特权信息,其监督信号仍可能主要由语言先验驱动,视觉信息未被有效利用,从而限制了 OPSD 的上限。

2. 核心发现:模态平衡作为特权信息

论文通过构造两种匹配的教师条件验证了这一假设:

  • 正教师(Positive Teacher):输入 Zoom-In Image(放大任务相关区域),视觉注意力占比高,模态平衡度较高;
  • 负教师(Negative Teacher):输入 Mask Image(遮蔽局部视觉区域),视觉注意力占比低,模态平衡度较低。

实验表明,随着**模态平衡 Logits 边际(Modality-Balance Logits Margin)**增大,正负教师的注意力比率差距扩大,同时学生推理的正确率提升。由此得出关键结论:模态平衡本身可以作为一种有效的特权信息,用于指导 OPSD。

3. 方法:OPD-V 框架

基于上述发现,论文提出 OPD-V(Visual On-Policy Self-Distillation with Modality Balance),其核心机制如下:

(1) 双教师评分

学生基于 Original Image I 生成 on-policy 轨迹 y sim pθ(· mid I, x) ;正负教师分别基于 I(zoom) 与 I(mask) 对同一前缀打分:
q_t^+(·) = p
(θ)(· mid I(zoom), x, y(<t)), quad qt^-(·) = p(θ)(· mid I(mask), x, y(<t))

(2) 模态平衡信任区域

定义 token 级的模态平衡边际:
δt^(MB) = log q_t^+(y_t) - log q_t^-(y_t)
仅当 δ_t^(MB) > 0 时,该 token 被纳入模态平衡信任区域
R
(MB)(y) = t ∈ T_y ,|, δ_t^(MB) > 0
这表示该 token 在视觉增强条件下获得了比视觉弱化条件下更强的支持,暗示其推理更依赖视觉证据而非纯文本先验。

(3) 蒸馏目标

仅在信任区域内,以正教师分布为目标,对学生进行 Jensen–Shannon 蒸馏,并以 δt^(MB) 加权:
L
(OPD-V)(θ) = E (1) / (∑(t ∈ T_y) r_t) ∑(t ∈ RMB)(y) r_t , δ_t^(MB) , D(JS)!(qt^+, p(θ,t)) 效率优化

采用 Top-K 蒸馏( K=100 )与尾部概率调整,避免全词表 logit 的内存开销;教师参数通过学生 EMA 维护,不引入额外可训练参数。

4. 实验验证

论文在 6 个基准测试(V* Bench、ZoomBench、HR-Bench 4K/8K、MME-RealWorld EN/CN)、4 个 MLLM 骨干网络(Qwen3.5-4B/9B、Qwen3-VL-4B/8B)以及 5 种后训练方法上进行了评估:

  • 性能提升:在 Qwen3.5-4B 上,OPD-V 将平均准确率从 64.30% 提升至 80.01%,超越同设置下最强的 Vision-OPD(77.10%)。在 Qwen3-VL-4B/8B 与 Qwen3.5-9B 上亦实现一致提升。经过 OPD-V 训练的 4B 模型甚至超过了 GPT-5.2、Gemini-3.5-Flash、Kimi-K2.6(1T)等闭源大模型。
  • 训练成本降低:相比标准 OPSD,OPD-V 将响应长度降低 74.5%,单步 wall-clock 时间降低 31.8%(4B)与 24.7%(9B)。
  • 训练动态稳定:模态平衡信任区域在训练中持续覆盖约 50% 的 token;策略熵在预热后保持稳定,避免了策略退化。
  • 消融验证:正负教师具有显著互补性(组合增益 5.39%);Zoom-In Image 与 Mask Image 的搭配优于 Repeat、Blur、Prune、No Image 等替代操作。

5. 主要贡献

  • 问题识别:首次指出模态不平衡是限制 MLLM OPSD 中特权信息有效性的关键因素。
  • 范式创新:提出将模态平衡本身作为特权信息,而非依赖外部参考答案或额外的显式输入。
  • 方法设计:通过正负教师对比与模态平衡信任区域,实现了对视觉证据依赖度的显式建模与选择性蒸馏。
  • 实用价值:在多种架构与基准上验证了推理性能的一致提升,同时通过更短的生成长度与更高效的输入构造实现了训练加速。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Aniri,Jinhe Bi,Peng Liao,Zengjie Jin,Volker Tresp,Fei Shen,Yunpu Ma,Tat-Seng Chua

PDF URL: https://arxiv.org/pdf/2608.05131.pdf

Arxiv URL: https://arxiv.org/abs/2608.05131

Arxiv ID: 2608.05131

CoolPaper URL: https://papers.cool/arxiv/2608.05131

Published: 2026-08-07T02:07:55.211Z

Updated: 2026-08-07T02:07:55.211Z