HuggingFace Papers 2026-07-29
数据来源:HuggingFace Papers
Latest Papers
1. Kimi K3: Open Frontier Intelligence
Abstract:We introduce Kimi K3, a 2.8T parameter Mixture-of-Experts model with 104 billion activated parameters, native vision capabilities, and a 1-million-token context window. Kimi K3 is built on Kimi Delta Attention and Attention Residuals, which improve information flow across sequence length and model depth. Together with Stable LatentMoE, which effectively activates 16 of 896 routed experts per token, and refined training and data recipes, these advances yield an approximately 2.5x improvement in overall scaling efficiency over Kimi K2. Post-training highlights reinforcement learning across general, agentic, and coding domains and multiple reasoning-effort levels, enabling compositional generalization and robust long-horizon execution. At 2.8T scale, Kimi K3 is supported by infrastructure advances in multiple areas: algorithm-system co-design for KDA, perfectly balanced expert-parallel training with efficient memory management, million-token agentic RL with persistent rollout and sandbox states, and deployment innovations. Extensive evaluations show that Kimi K3 achieves frontier-level performance across long-horizon coding, agentic, knowledge, reasoning, and vision tasks. While its overall performance still trails the most powerful proprietary models, namely Claude Fable 5 and GPT-5.6 Sol, Kimi K3 consistently outperforms other open and proprietary models evaluated in our suite. We release the full Kimi K3 model weights to facilitate future research and accelerate the broader deployment and adoption of frontier intelligence.
中文摘要
摘要:我们介绍了 Kimi K3,一款拥有 2.8 万亿参数的专家混合模型(Mixture-of-Experts),激活参数达 1040 亿,具备原生视觉能力,并支持 100 万令牌的上下文窗口。Kimi K3 构建在 Kimi Delta Attention 和 Attention Residuals 之上,这些技术提升了跨序列长度和模型深度的信息流动。结合 Stable LatentMoE,每个令牌可有效激活 896 个路由专家中的 16 个,以及经过优化的训练和数据方案,这些进展使整体扩展效率较 Kimi K2 提升约 2.5 倍。训练后亮点包括在通用、智能体和编程领域以及多层次推理任务中的强化学习,实现了组合泛化和稳健的长程执行。在 2.8 万亿参数的规模下,Kimi K3 得益于多方面的基础设施创新:KDA 的算法-系统协同设计、具有高效内存管理的完美平衡专家并行训练、具有持久回滚和沙箱状态的百万令牌智能体强化学习以及部署创新。广泛评测显示,Kimi K3 在长程编程、智能体、知识、推理和视觉任务中均达到了前沿水平的表现。虽然其总体性能仍落后于最强大的专有模型,即 Claude Fable 5 和 GPT-5.6 Sol,Kimi K3 仍在我们测试套件中持续优于其他公开和专有模型。我们公开完整的 Kimi K3 模型权重,以促进未来研究并加速前沿智能的广泛部署与应用。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇技术报告试图解决的核心问题是:在开源领域同时推进预训练规模与测试时计算规模的极限,以缩小与最强专有模型之间的能力差距。具体而言,论文围绕以下几个关键子问题展开:
预训练规模的停滞
尽管开源社区在推理与后训练(test-time scaling)方面进展迅速,但近期开源模型大多仍停留在1T参数量级。与之相对,顶尖专有系统持续扩大预训练基础模型的规模。Kimi K3 旨在突破这一瓶颈,将开源模型的预训练规模推进到2.8T总参数、104B激活参数的3T级别,并通过架构与数据优化实现约2.5倍的整体扩展效率提升。百万级上下文下的长程智能体(Agentic)能力
现有模型难以在1M token上下文窗口内稳定执行长程任务。Kimi K3 试图解决超长序列中的信息流动、状态保持与工具调用问题,使模型能够在数百至数千次工具调用、数百万累积上下文token的尺度上,完成推理、行动、观察、验证与适应的闭环。极端稀疏MoE的优化稳定性
在将路由专家规模扩展到896个、每token激活16个(稀疏度达56)的极端条件下,论文解决了传统MoE中常见的内部激活爆炸、负载失衡与训练不稳定问题,提出了Stable LatentMoE、SiTU-GLU与Quantile Balancing等机制。多领域、多推理强度的统一后训练
如何在通用任务、通用智能体、编码智能体三大领域,以及低/高/最大(low/high/max)三种推理强度上分别进行强化学习,并通过**多教师在线策略蒸馏(MOPD)**将多个专家策略合并为单一模型,是论文在后训练阶段的核心目标。3T参数×1M上下文的系统基础设施
论文还解决了支撑上述规模所需的工程挑战:包括KDA的算法-系统协同设计、完美负载均衡的专家并行训练、百万token代理RL的持久化状态与可恢复沙盒、以及面向生产的缓存感知调度和预算控制推理服务等。
Q: 有哪些相关研究?
该论文在多个技术维度上与大量前沿研究形成对话与继承关系,主要相关研究工作可归纳如下:
1. 预训练与Scaling Laws
- Kaplan et al. (2020) 与 Hoffmann et al. (2022) 奠定了大语言模型训练计算量与参数规模之间的经典Scaling Laws基础,Kimi K3在此基础上通过架构与数据recipe的改进实现了约 2.5× 的整体Scaling效率提升。
- GLM-5
145
、MiMo
135
、Inkling
120
等代表了近期开源模型在1T参数 regime 附近的探索,Kimi K3明确将开源预训练规模推进至3T级别以打破收敛趋势。
2. 推理模型与测试时计算(Test-Time Scaling)
- OpenAI o-series
84, 83
通过强化学习与测试时推理扩展模型能力。 - Anthropic extended-thinking models
6, 7
引入自适应思考预算与工具交错的推理模式。 - DeepSeek-R1
40
与 Kimi K1.5
118
展示了大规模RL可从强预训练模型中激发复杂推理行为。 - Kimi K2.5 Agent Swarm
59
将测试时扩展从顺序推理推广到并行智能体协调。
3. 注意力机制与架构创新
- 线性注意力与Delta Rule:KDA基于 Schlag et al. (2021) 的delta-rule recurrence
105
,并继承 Gated Delta Networks
138
与 Kimi Linear
63
的chunkwise并行形式。 - 多头潜在注意力(MLA):源自 DeepSeek-V2
28
,Kimi K3将其与KDA以3:1比例混合,并采用NoPE(无位置编码)设计。 - Attention Residuals (AttnRes)
57
:使每一层能够选择性地 attend 到所有先前层的表示,扩展了深度维度的信息流。
4. 混合专家模型(MoE)
- DeepSeekMoE
23
的共享专家与路由专家分离设计被Stable LatentMoE继承。 - LatentMoE
32
提出在紧凑潜在空间中进行路由,Kimi K3将其扩展至896个路由专家、每token激活16个的极端稀疏度。 - Switch Transformers
33
与 BASE Layers
67
为MoE负载均衡提供了早期范式。 - 无辅助损失的负载均衡:DeepSeek-V3
30
的专家偏置更新策略被Quantile Balancing (QB) 所改进。
5. 激活函数与训练稳定性
- GLU
26
与 SwiGLU
107
是Transformer FFN的主流门控设计,Kimi K3提出的 SiTU-GLU 针对极端规模下的激活爆炸问题,引入了有界的Sigmoid-Tanh单元。 - RMSNorm
146
被广泛用于稳定化,Kimi K3在LatentMoE中增加了额外的RMSNorm以抑制路由分支的尺度敏感性问题。
6. 优化器
- Muon
53
作为矩阵参数的优化器被Kimi K2与Kimi K3采用;Kimi K3进一步提出 Per-Head Muon,沿注意力头维度对投影矩阵进行正交化,以平衡多头的学习动态。
7. 长上下文与系统协同设计
- Ring Attention
72
与 LASP
114, 113
针对softmax与线性注意力的序列并行策略为KDA Context Parallelism (KCP) 提供了参照。 - DeltaNet Context Parallelism
142
直接启发了KCP中基于前缀扫描(prefix scan)的状态合成机制。 - Flash Linear Attention
139
与 FlashKDA
14
为KDA的chunkwise计算提供了高性能内核支持。
8. 后训练、蒸馏与推理加速
- 在线策略蒸馏(On-Policy Distillation)
75, 134
与 MiMo-V2-Flash
134
为多教师蒸馏(MOPD)提供了方法论基础。 - EAGLE-3
71
的draft模型架构被Kimi K3用于MTP层的微调,以实现推测解码(speculative decoding)。 - LK Loss
104
被用于直接优化draft模型的token接受率。
9. 基础设施与工程系统
- 专家并行通信:DeepEP
147
、ECHO
137
、UltraEP
132
为MoonEP的零拷贝通信与完美负载均衡提供了对比基准。 - 内存高效训练:SonicMoE
41
的梯度重计算技巧、Pipeline ZeRO-2
145
、ZeRO-1
100
被集成到Kimi K3的训练框架中。 - KV Cache与推理服务:Mooncake
96
的分离式架构影响了Kimi K3的外部KV缓存池设计;Firecracker
3
与 OverlayBD
68
被用于AgentENV微VM沙箱的构建。
10. 评估基准
论文引用并参与了大量公开与内部基准的评估,包括:
推理与知识:GPQA Diamond
101
、Humanity’s Last Exam (HLE)
93
、CritPt
8编码:DeepSWE
31
、FrontierSWE
35
、SWE-Marathon
117
、Terminal-Bench
78智能体:BrowseComp
131
、OSWorld
136, 143
、JobBench
70
、AutomationBench
108视觉:Video-MME
36
、MMMU-Pro
144
、CharXiv
130
、ZeroBench
102
Q: 论文如何解决这个问题?
Kimi K3 的解决方案贯穿架构设计、预训练、后训练与基础设施四个层面,核心思路是在序列长度、网络深度和模型宽度三个维度上同时扩展信息流动能力,并通过算法–系统的深度协同使 3T 参数规模与 1M 上下文长度在训练、强化学习与推理全生命周期中可控且高效。
1. 架构设计:三维信息流动扩展
1.1 序列长度维度——Hybrid Attention
Kimi K3 采用 3:1 的 KDA 与 Gated MLA 混合层(每个 block 含 3 层 KDA + 1 层 Gated MLA,末端再加一层 Gated MLA),兼顾长序列效率与全局交互能力:
Kimi Delta Attention (KDA):基于 delta-rule 递推,引入通道级遗忘门。状态更新为
St = l(I - β_t k_t k_t^topr) Diag(α_t) S(t-1) + βt k_t v_t^top
其中 α_t ∈ (0,1)^(d_k) 为通道级 retention factor, β_t ∈ (0,1) 为写强度。通过 chunkwise 并行形式实现块内并行、块间递推,并引入 下界衰减参数化
g_t^h = g(min) Sigmoidl(e^(Ah) z_t^hr), quad α_t^h = exp(g_t^h)
其中 g(min)=-5 ,保证累积衰减倒数始终处于 BF16 动态范围,从而消除对角 tile 的显式位置对计算瓶颈,全部使用 dense Tensor Core GEMM。Gated MLA:以低维潜在向量压缩 KV,保留全局注意力;Kimi K3 对其采用 NoPE(无位置编码),位置敏感性完全由 intervening KDA 层提供,避免长上下文外推时的位置编码重调。
1.2 网络深度维度——Attention Residuals (AttnRes)
标准残差将历史信息压缩为单一状态,形成深度维度的瓶颈。AttnRes 令每一层通过可学习的 pseudo-query w_l 对嵌入层及所有先前层输出进行选择性检索:
α(i to l) = expl(q_l^top RMSNorm(k_i)r)∑(j=0)^(l-1) expl(ql^top RMSNorm(k_j)r), quad h_l = ∑(i=0)^(l-1) α_(i to l) · v_i
为降低 O(L^2 d) 开销,Kimi K3 采用 Block AttnRes:将 93 层划分为 8 个 block(每 block 12 层),块内做局部归约,块间做完整注意力,使显存与通信开销从 O(Ld) 降至 O(Nd) ( N≈ 8 )。
1.3 模型宽度维度——Stable LatentMoE
在 896 个路由专家、每 token 激活 16 个(稀疏度 56)的极端条件下,通过三项机制稳定训练:
- Normalized LatentMoE:在路由专家聚合后、上投影前插入 RMSNorm,抑制路由分支的尺度波动。
- SiTU-GLU:以有界双曲正切平滑裁剪 SwiGLU 的两个分支:
SiTU-GLU(x) = l[β1 tanh(W_g x) / (β_1) odot σ(W_g x)r] odot l[β_2 tanh(W_u x) / (β_2)r]
其中 β_1=4, β_2=25 ,保证 |SiTU-GLU(x)|∞ le β_1β_2 = 100 ,防止低精度训练中的激活爆炸。 - Quantile Balancing (QB):基于 router score 的 (1-k/n) 分位数动态调整专家偏置 b_j ,实现无辅助损失的精确负载均衡。全局分位数通过直方图估计与单次 all-reduce 汇总,通信开销仅数百 bins/专家/层。
1.4 原生视觉通路——MoonViT-V2
摒弃 SigLIP 等对比预训练初始化,从零开始以 next-token 预测目标联合训练视觉编码器,避免联合优化时的梯度范数尖峰。采用 27 层 ViT,融合帧内空间与帧间时间注意力,通过 2× 2 pixel-shuffle 将视觉 token 数压缩 4 倍,支持最高 3584×3584 像素输入。
2. 预训练:数据与 Scaling Recipe 的联合优化
- 多模态联合预训练:文本(Web、Code、Math、Knowledge)与视觉数据(caption、OCR、视频、视觉代码等)从训练起始即在同一 next-token 预测目标下联合优化,而非后期对齐。
- Scaling Law 重调:针对新架构独立搜索最优 batch size、学习率、tokens-per-parameter 比例与模型形状,在 OOD 验证集上确认整体 Scaling 效率较 Kimi K2 提升约 2.5× ;采用 cosine decay 作为默认策略。
- 渐进式长上下文扩展:以四阶段课程将上下文从 8K 逐步扩展至 1M(8K→64K 在预训练阶段,256K→1M 在 cooldown 阶段)。利用 NoPE 实现无需位置编码修改的直接外推,并通过合成远距离依赖数据(将多模态文档与子任务穿插排列,迫使模型在完整 1M 上下文中检索信息)防止注意力退化为局部模式。
3. 后训练:多领域、多强度能力的统一
后训练采用 SFT → 多领域/多 effort RL → Multi-Teacher On-Policy Distillation (MOPD) 三阶段范式。
3.1 跨领域与跨强度的强化学习
将 RL 同时扩展到通用任务、通用智能体、编码智能体三大领域,并在每个领域内训练 low / high / max 三种推理强度,共产生 9 个专家策略:
- 部分回滚(Partial Rollout):对 N× K 条轨迹维护活跃工作负载,当 λ 比例轨迹完成即触发策略优化,剩余轨迹挂起并在下一迭代优先恢复,消除长尾延迟阻塞。
- 推理强度控制:为每个问题关联初始 token 预算 b_0(x) ,若轨迹总长度 T(y) > τ · b_0(x) 则奖励置 -1 。通过阶段性课程从大 τ (max)退火至小 τ (low/high),获得不同思考深度的专家。
- Agentic 生成奖励模型 (GRM):对非可验证任务采用锦标赛式组内比较,强制裁判模型遵循“阅读输出→生成评分标准→逐项打分→记录分数”的协议,并结合基于预算的长度控制抑制奖励黑客。
3.2 多教师在线策略蒸馏 (MOPD)
将 9 个领域-强度专家蒸馏为单一模型。对输入查询 x 与前缀 y(<t) ,针对采样得到的领域 d 与强度 e ,使用对应教师 π(teacher)^((d,e)) 计算逐 token OPD 奖励:
r(opd)^(d)(y_t mid e, x, y(<t)) = clip!(sg!(log π(teacher)^((d,e))(y_t mid x, y(<t))πθ(y_t mid e, x, y(<t))), -R(max), R(max))
该密集奖励直接融入 RL 框架,天然兼容部分回滚等长程优化基础设施。
3.3 部署感知后训练
- MXFP4 量化感知训练 (QAT):MoE 专家权重以 MXFP4 存储、MXFP8 计算,其余模块保持高精度;SFT 与 RL 全程采用同一量化配置,消除训练-推理失配。
- EAGLE-3 Draft 模型微调:将预训练 MTP 层微调为推测解码 draft 模型,融合低/中/高层 AttnRes 特征;以 LK Loss 直接优化接受率:
L(LK) = -log ∑(x ∈ V) minl(p(x), q(x)r)
4. 基础设施:算法–系统深度协同
4.1 KDA 的算法–系统协同设计
- FlashKDA:基于 CUTLASS 的 chunkwise 内核,重叠块内并行计算与跨块状态传递,同时服务训练与 prefill。
- Intra-device Context Parallelism:单卡内将序列划分至
Q: 论文做了哪些实验?
论文的实验与评估覆盖公开基准、内部基准、第三方独立评测、成本效率分析、安全能力评测及代表性案例研究六大板块,具体如下:
1. 主结果(Main Results,§6.1)
在四个能力维度上与前沿专有模型(Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5)及开源模型(GLM-5.2)全面对比:
- 推理与知识:GPQA Diamond、CritPt、AA-LCR、Humanity’s Last Exam (HLE-Full,含工具/无工具)。Kimi K3 在 GPQA Diamond 上达 93.5%,但在 HLE-Full 与 CritPt 上仍落后于 Claude Fable 5 与 GPT-5.6 Sol。
- 编程:DeepSWE、ProgramBench、Terminal-Bench 2.1、FrontierSWE、SWE-Marathon、PostTrainBench、MLS-Bench-Lite、SciCode。Kimi K3 在 ProgramBench (77.8%)、SWE-Marathon (42.0%)、Terminal-Bench 2.1 (88.3%) 上表现突出,FrontierSWE (81.2%) 仅次于 Claude Fable 5。
- 智能体:BrowseComp、DeepSearchQA、ResearchRubrics、Toolathlon-Verified、MCPMark-Verified、MCP-Atlas、AutomationBench、JobBench、GDPval-AA v2 (Elo)、AA-Briefcase、Agents’ Last Exam、APEX-Agents、OfficeQA Pro、SpreadsheetBench 2、OSWorld-Verified / 2.0、SaaS-Bench、τ3-Banking、Harvey Lab-AA、CorpFin v2、Finance Agent v2、Legal Research Bench。Kimi K3 在 BrowseComp (91.2%)、DeepSearchQA (95.0 F1)、MCPMark-Verified (94.5%)、AutomationBench (30.8%)、τ3-Banking (33.4%) 等多处取得领先或次优。
- 视觉:WorldVQA、OmniDocBench、PerceptionBench、Video-MME、MMVU、BabyVision(含 Python 工具)、MMMU-Pro、CharXiv (RQ)、Math-Vision、ZeroBench-main (Pass@5)。工具增强后 Math-Vision 达 97.8%,ZeroBench-main 达 41.0% (Pass@5)。
2. 内部评估(Internal Evaluation,§6.2)
2.1 能力评测(Capability Evaluation,表 3、表 4)
覆盖公开基准未充分涉及的能力域:
- 编程能力与体验:Kimi Code Bench 2.0(使用 Claude Code / Kimi Code / Codex 三种 harness)、Kimi Webdev Bench(盲评专家打分,表 4 显示 Kimi K3 对 Claude Opus 4.8 整体 Win−Lose 为 +31.0%,3D/WebGL 领域达 +59.1%)、Coding Experience。
- 通用智能体体验:24/7 ClawBench 2.0、MIRA Bench、KAET、CLIF Bench、Agentic Vision Bench、Swarm Bench (76.3,领先)、Online Experience、Deep Research Bench (90.0,领先)、Finance Bench、KWV Bench、DECK Bench、Agent Behavior Bench。
- 对话体验:Faithfulness(幻觉率,1−幻觉率 = 85.5%)、Chat All-in-One Bench。
2.2 网络安全评测(Cyber Security Evaluation,§6.2.2)
设计了两级渐进式评估:
- Tier 1 — 漏洞发现:在操作系统内核、数据库、AI 服务、Web 框架、区块链、VPN 等广泛部署的软件中,模型识别出数百个候选漏洞,经人工审核约 70% 确认为真实漏洞,包含 16 个此前未知的漏洞。典型案例包括 Linux 内核中一个远程可触发的堆越界写,以及 RDMA 子系统中一个 Dirty-COW 类的本地提权漏洞。
- Tier 2 — 端到端漏洞利用开发:共 36 个任务(16 个用户空间 + 20 个 Linux 内核)。Kimi K3 解决 14/36 (38.9%),优于 GLM-5.2 的 8/36 (22.2%),但用户空间任务占成功项的 10/14,内核利用仍显著落后人类专家。
3. 第三方独立评测(Third-Party Evaluation,§6.3,表 5)
- Artificial Analysis:Intelligence Index v4.1 得 57.1,在 580 个模型中排名第 4(若合并 GPT-5.6 Sol 变体则为第 3)。
- Vals AI:在 GDP 加权的行业基准套件上 Vals Index 为 74.7%,39 个模型中排名第 2。
- LMArena 众测:
- WebDev Arena:1,678 Elo,99 个模型中排名第 1,为首度登顶该榜的开源模型。
- Text Arena:1,486 Elo,排名第 8。
- Agent Arena:排名第 4(9.1 分)。
4. 成本效率分析(Cost Efficiency,§6.4,图 13)
在四个套件上对比模型得分与单任务推理成本(美元):
- Kimi Code Bench 2.0:Kimi K3 得分接近 Claude Opus 4.8 (max) 时,成本约为其 1/3;距离 Claude Fable 5 (max) 差 4.0 分,但成本仅 38%。
- BrowseComp:Kimi K3 以 $2.03/任务 取得 91.2%,成本约为 GPT-5.6 Sol 的一半,比 Claude 系列低一个数量级。
- GDPval-AA v2:以低 13% 的成本接近 GPT-5.6 Sol,比 Claude Fable 5 便宜 2.6×。
- AA-Briefcase:得分仅次于 Claude Fable 5,成本约为其一半。
5. 案例研究(Case Studies,§7)
展示模型在复杂技术任务上的端到端能力:
- GPU 内核优化:在 24 小时预算内独立优化 AttnRes、DeepSeek Sparse Attention (DSA)、KDA、MLA 四个内核。AttnRes 延迟从 283.6 ms 降至 114.4 ms;KDA 加速 73.6%;MLA 达到峰值 TFLOPS 的 50% 以上。性能轨迹优于 GPT-5.6 Sol、GPT-5.5 与 Claude Opus 4.8(图 14)。
- GPU 编译器开发:从零构建 MiniTriton(类 Triton 编译器),包含 Python 前端、MLIR 中间层与 PTX 代码生成管线,以及 PyTorch 式张量库与反向自动微分。在 NVIDIA L20 上核心 benchmark 几何均值优于 torch eager 与 torch.compile,矩阵乘法达到 cuBLAS 约 90%,KDA prefill 超越 Triton 基线;成功端到端训练 GPT 模型,loss 曲线与 PyTorch 一致(图 15)。
- 芯片设计:在 48 小时内自主设计面向 nano 架构的推理芯片原型(4 mm² 面积预算),使用开源 EDA 与 Nangate45 标准单元库,完成 RTL 与验证,时序闭合于 100 MHz,解码吞吐 >8,700 tokens/s。
- 科研代码:约 2 小时内复现计算天体物理学 I–Love–Q 普适关系,审阅 20+ 篇论文,实现完整数值管线,评估 300+ 状态方程,并生成交互式 HTML 仪表板。
- 知识工作:在 Kimi Work 中制作覆盖 AI ASIC 行业 42 年的交互式研究网站,迭代 120+ 轮,处理 11,000+ 页 PDF 与 2,800+ 次搜索;另用 20+ 并发子代理分析 391 个引力波事件,产出科学可视化与文献综述。
- 视频编辑与动态设计:基于原生多模态架构,自主完成 3Blue1Brown 风格运动图形解说视频制作,以及包含 56 个素材片段的预告片剪辑(镜头选择、节拍同步、音频处理等)。
6. 训练与消融中的实验证据
除上述评测外,论文在正文与附录中还提供了关键模块的消融与验证实验:
- Vision Encoder 稳定性:对比 SigLIP 初始化的 MoonViT-3D 与从头训练的 MoonViT-V2,证明后者梯度范数更低、尖峰更少(图 6)。
- Scaling Law:在 OOD 验证集上拟合 Kimi K2 与 Kimi K3 的 Scaling 曲线,确认约 2.5× 效率提升(图 7)。
- RL 扩展性:展示随着 RL FLOPs 增加,多领域(编程体验、通用工具使用、Web 开发、智能体搜索、专业工作流等)得分与平均步数同步提升(图 8)。
- Quantile Balancing:以示意图与算法描述展示其相对固定步长 sign 更新的负载均衡优势(图 5)。
- SiTU-GLU:对比 GLU、SwiGLU 与 SiTU-
Q: 有什么可以进一步探索的点?
基于论文内容,以下是可以进一步探索的研究方向,按技术层次组织:
1. 架构设计与模块优化
动态混合注意力比率
论文采用固定的 3:1 KDA–Gated MLA 混合比例。不同任务(如长文档检索 vs. 代码局部推理)对全局注意力和线性递推的依赖程度不同,探索输入依赖或任务依赖的动态比率,或学习化的层间分布,可能进一步提升特定领域的效率。
自适应块大小的 Attention Residuals
Block AttnRes 将 93 层固定划分为 8 个块(每块 12 层)。网络深度的信息聚合需求在不同训练阶段或不同数据域中可能变化,研究自适应块划分策略(如基于梯度信号或激活统计动态调整块边界)有望在保持效率的同时恢复更多 Full AttnRes 的表达能力。
SiTU-GLU 的理论与泛化
SiTU-GLU 通过双曲正切有界化 SwiGLU,但软帽超参数 β_1=4, β_2=25 的选取仍具有经验性。可以开展:
- 从激活分布动力学或信息瓶颈角度推导最优软帽边界;
- 在更广泛的模型规模(如 <1B 或 >10T)和精度格式(FP4、INT8)上验证其相对于 PowLU 等同期工作的稳定性优势。
专家路由的细粒度化
Stable LatentMoE 实现了 56 倍稀疏度,但当前路由仍以 token 为单位。探索子 token(sub-token)或 patch 级别的路由,以及专家之间的动态协同机制(如激活专家间的轻量级通信),可能突破现有专家特化的上限。
2. 预训练策略与 Scaling Law
对比预训练 vs. 从头训练视觉编码器的边界条件
论文发现 MoonViT-V2(从头训练)与 SigLIP 初始化基线性能相当且更稳定。这一结论是否在极低数据量或需要精确细粒度空间关系的任务(如医学影像、CAD 几何推理)上仍然成立,值得进一步验证。
学习率调度的重新审视
Scaling Law 研究表明在 Kimi K3 的配置下 cosine decay 优于 WSD,但论文指出两者的最优超参数空间不同。可以构建统一框架来公平比较不同调度器,或探索将 WSD 的衰减阶段与 cosine 的平滑性结合的混合调度。
Muon 在 MoE 稀疏参数上的扩展
Per-Head Muon 仅应用于注意力投影矩阵。将其推广到路由专家权重或视觉编码器的大规模卷积/线性层,并分析 Newton–Schulz 迭代在极度稀疏激活下的收敛特性,仍是开放问题。
3. 长上下文机制与推理效率
KDA 衰减下界的理论指导
当前 g(min)=-5 是工程上保证 BF16 范围的启发式选择。可以从数值精度–模型表达能力权衡的角度,建立关于 g(min) 的优化理论,或设计自适应下界机制,使其在短序列时更激进、长序列时更保守。
百万级上下文的动态推理深度
论文通过 token 预算控制推理强度,但模型在每个层仍执行完整计算。探索**早期退出(early exiting)**与 KDA 状态的结合——例如基于当前 token 的置信度或信息增益动态跳过某些层或专家——可在保持质量的同时降低长程推理的 FLOPs。
长上下文中的信息检索与遗忘机制
KDA 的通道级遗忘门提供了隐式的位置衰减,但在百万 token 的极端长度下,显式的关键信息标记(landmark tokens)或层次化记忆机制(如将 KDA 状态周期性地压缩为摘要向量)可能改善对远端依赖的精确召回。
4. 后训练与强化学习
多教师蒸馏中的专家冲突消解
MOPD 将 9 个领域-强度专家蒸馏为单一模型。当不同专家给出低重叠分布时(如 low-effort 与 max-effort 在数学推理上的策略差异),KL-based OPD 奖励可能产生冲突梯度。研究显式的专家分歧检测与条件化路由机制(如让模型先选择“教师身份”再生成)可能提升蒸馏上限。
完全可验证的 Agentic 奖励
当前 Agentic GRM 仍依赖 LLM 裁判,存在奖励黑客风险。构建形式化验证接口(如将代码执行结果与定理证明器结合)或基于环境状态转移图的确定性奖励,可使 RL 在更复杂的开放域任务中保持稳定。
Partial Rollout 的数据陈旧性理论
论文通过逐 token 正则化容忍跨迭代的状态陈旧,但部分回滚本质上引入了非马尔可夫偏差。分析该偏差对策略梯度方差的定量影响,以及设计无偏或方差缩减的部分回滚采样器,具有理论价值。
5. 系统与基础设施
MoonEP 冗余界的最优逼近
定理证明 MoonEP 的 E/R 冗余界是紧的,但这是在任意最坏分布下的结果。实际路由分布具有长尾特性,研究基于历史分布的在线预测式专家放置,或允许极小概率的轻微失衡以换取更低的冗余开销,可能提升实际利用率。
KDA Prefix Cache 的跨请求压缩
KDA 状态虽为固定大小,但在百万 token 前缀下累积的 checkpoint 仍占用大量显存。探索基于低秩近似或微分编码的 KDA 状态压缩,以及跨请求共享相似前缀状态的语义级去重,可进一步降低服务成本。
AgentENV 的状态迁移学习
AgentENV 支持微 VM 的 fork 与快照,当前主要用于 RL 中的状态恢复。利用这些快照开展基于世界状态相似性的迁移学习(如将在沙箱 A 中学会的操作迁移到沙箱 B 的相似状态),可能加速长程 Agentic 策略的学习。
6. 安全能力与评估
研究级推理的瓶颈分析
论文在 HLE-Full 与 CritPt 上显著落后于最强专有模型。需要更细粒度的错误分析:区分是知识缺失、长链推理中的累积误差还是对研究文献的深层语义理解不足,并针对性地设计数据合成与课程 RL。
网络安全能力的阶梯式提升
Tier 2 内核利用的成功率仅为 38.9%,且主要集中于用户空间。针对论文识别的四大失败模式(最终利用链完成、缓解策略选择、调试循环陷阱、最终验证不足),可以构建专门的 kernel-exploit 子环境与反事实验证奖励,训练模型在利用开发中进行更有策略的探索与回溯。
幻觉与忠实度的跨模态关联
Faithfulness 评估显示幻觉率仍有 14.5%。探索视觉输入如何影响文本幻觉(例如模型是否因错误解读图表而产生事实错误),以及利用原生多模态架构进行跨模态一致性检查,是提升可信度的关键路径。
7. 更广泛的开放问题
- 3T 参数模型的知识编辑与遗忘:如何在如此稀疏且大规模的 MoE 中实现高效的局部知识更新,而不触发全量重训练?
- 开源与专有模型的差距收敛:论文显示 Kimi K3 在部分编程与 Agentic 任务上已接近或超越专有模型,但在知识工作 Elo 评分上仍有差距。这种差距是数据质量、RL 环境丰富度还是推理计算预算导致的?
- 边缘设备上的 3T 模型服务:当前部署依赖大规模 GPU 集群,探索针对 KDA 固定状态特性的极致压缩与流式解码,使百万上下文能力向终端设备下沉。
Q: 总结一下论文的主要内容
以下是该论文(Kimi K3 技术报告)的主要内容总结:
1. 核心定位与目标
Kimi K3 是一个开源的前沿多模态混合专家(MoE)模型,旨在同步扩展预训练规模与测试时计算规模。关键规格包括:
- 2.8T 总参数,104B 激活参数
- 原生视觉能力与最高 1M token 的上下文窗口
- 相较于前代 Kimi K2,整体 Scaling 效率提升约 2.5×
尽管整体性能仍略低于最强专有模型(Claude Fable 5、GPT-5.6 Sol),Kimi K3 在评估套件中持续优于其他开源与专有模型,并发布了完整权重以促进研究。
2. 架构设计:三维信息流动扩展
Kimi K3 的架构围绕序列长度、网络深度与模型宽度三个维度优化信息流动:
2.1 序列长度——Hybrid Attention
每个 block 包含 3 层 Kimi Delta Attention (KDA) + 1 层 Gated MLA:
- KDA:基于带通道级遗忘门的 delta-rule 递推,状态更新为
St = l(I - β_t k_t k_t^topr) Diag(α_t) S(t-1) + βt k_t v_t^top
通过 chunkwise 并行实现高效长序列建模。引入下界衰减参数化:
g_t^h = g(min) Sigmoidl(e^(Ah) z_t^hr), quad α_t^h = exp(g_t^h)
其中固定 g(min)=-5 ,确保累积衰减倒数始终在 BF16 动态范围内,从而消除显式位置对计算瓶颈,全部使用 dense Tensor Core 矩阵乘法。 - Gated MLA:采用 NoPE(无位置编码),由 KDA 提供位置敏感性,负责全局内容交互。
2.2 网络深度——Attention Residuals (AttnRes)
突破标准残差的深度信息瓶颈,使每层可通过可学习的 pseudo-query 选择性检索所有先前层输出。采用 Block AttnRes 将 93 层划分为约 8 个块,将显存与通信开销从 O(Ld) 降至 O(Nd) 。
2.3 模型宽度——Stable LatentMoE
扩展至 896 个路由专家,每 token 激活 16 个(稀疏度 56),通过三项机制稳定训练:
- Normalized LatentMoE:在路由聚合后插入 RMSNorm,抑制尺度波动。
- SiTU-GLU:以有界双曲正切平滑裁剪 SwiGLU:
SiTU-GLU(x) = [β1 tanh(W_g x) / (β_1) odot σ(W_g x)] odot [β_2 tanh(W_u x) / (β_2)]
设置 β_1=4, β_2=25 ,保证输出 |·|∞ ≤ 100 ,防止低精度训练中的激活爆炸。 - Quantile Balancing (QB):基于 router score 的 (1-k/n) 分位数动态调整专家偏置,实现无辅助损失的精确负载均衡。
2.4 原生视觉与优化
- MoonViT-V2:视觉编码器完全从头以 next-token 预测目标训练,避免了 SigLIP 初始化带来的联合优化不稳定性。
- Per-Head Muon:对注意力投影矩阵沿头维度逐块进行 Newton–Schulz 正交化,平衡多头的学习动态。
3. 预训练策略
- 多模态联合训练:文本与视觉数据从训练起始即共享 next-token 预测目标,无需后期对齐。
- Scaling Law 重调:针对新架构独立搜索最优 batch size、学习率与 tokens-per-parameter 比例,在 OOD 验证集上确认效率提升;采用 cosine decay 作为默认调度。
- 渐进式长上下文扩展:以四阶段课程将上下文从 8K 逐步扩展至 1M(8K→64K 在预训练阶段,256K→1M 在 cooldown 阶段)。利用 NoPE 实现无需位置编码修改的直接外推,并合成远距离依赖数据防止注意力退化。
4. 后训练:多领域多强度能力统一
采用 SFT → 跨领域 RL → Multi-Teacher On-Policy Distillation (MOPD) 三阶段范式:
- 强化学习:覆盖通用任务、通用智能体、编码智能体三大领域,并在每领域内训练 low / high / max 三种推理强度,共产生 9 个专家策略。
- 使用 Partial Rollout 机制:当 λ 比例轨迹完成即触发策略优化,消除长尾延迟阻塞。
- 通过 per-problem token 预算控制与课程退火,获得不同思考深度的专家。
- Agentic Generative Reward Model (GRM):对非可验证任务采用带强制协议与预算控制的锦标赛式比较,抑制奖励黑客。
MOPD 蒸馏:将 9 个专家合并为单一模型,逐 token OPD 奖励定义为:
r(opd)^(d)(y_t mid e, x, y(<t)) = clip!(sg!(log π(teacher)^((d,e))(y_t mid x, y(<t))πθ(y_t mid e, x, y(<t))), -R(max), R(max))部署感知训练:
- MXFP4 QAT:MoE 专家权重以 MXFP4 存储、MXFP8 计算,SFT 与 RL 全程采用同一量化配置。
- EAGLE-3 Draft 模型:微调预训练 MTP 层用于推测解码,以 LK Loss 直接优化接受率:
L(LK) = -log ∑(x ∈ V) minl(p(x), q(x)r)
5. 基础设施:算法–系统深度协同
- KDA 内核与并行:
- FlashKDA:基于 CUTLASS 的 chunkwise 内核,重叠块内并行与跨块状态传递。
- KDA Context Parallelism (KCP):利用前缀扫描(prefix scan)与固定大小的 all-gather 同步 KDA 递推状态,实现线性计算扩展。
- MoonEP:完美负载均衡的专家并行系统,冗余专家上界为 E/R ,通过在线规划与零拷贝通信消除动态形状开销。
- 内存高效训练:统一激活存储抽象(支持重计算、量化、卸载)、Pipeline ZeRO-2 梯度分片、P2P Muon 正交化。
- 百万级 Agentic RL 系统:
- 外部 KV 缓存池:将空闲前缀卸载至 CPU DRAM,训练状态暂存至 NVMe。
- AgentENV:基于 Firecracker 的微 VM 沙箱,支持增量快照(低至 133 ms)、fork 与暂停/恢复,共创建超过 5100 万个沙箱实例。
- 推理服务:
- KDA 感知前缀缓存:将 KDA 状态与 MLA KV 统一至分页池,支持 512 token 细粒度前缀复用。
- 专用解码内核:KDA 投机解码通过缓存投影输入而非状态快照实现高效回滚;Block AttnRes 与稀疏 LatentMoE 经内存与调度优化降低延迟。
- 预算感知准入控制:为不同请求类别分配独立资源预算,防止长上下文突发流量 degrade 全系统 SLO。
6. 实验与评估
6.1 公开基准
- 编程:ProgramBench 77.8%(第一)、SWE-Marathon 42.0%(领先)、Terminal-Bench 2.1 88.3%、FrontierSWE 81.2%(第二)。
- 智能体:BrowseComp 91.2%、DeepSearchQA F1 95.0%、MCPMark-Verified 94.5%、AutomationBench 30.8%。
- 视觉:Math-Vision 工具增强后 97.8%、ZeroBench-main (Pass@5) 工具增强后 41.0%、OmniDocBench 91.1%。
- 推理与知识:GPQA Diamond 93.5%,但在 HLE-Full 与 CritPt 上仍落后于最强专有模型。
6.2 内部评估
- Kimi Code Bench 2.0 与 Coding Experience 表现强劲;Kimi Webdev Bench 盲评中相对 Claude Opus 4.8 整体 Win−Lose 为 +31.0%。
- Swarm Bench (76.3)、Deep Research Bench (90.0) 领先,显示复杂任务分解与并行协调优势。
6.3 网络安全
- Tier 1(漏洞发现):在广泛部署系统中识别数百候选漏洞,约 70% 经确认为真实漏洞,含 16 个此前未知漏洞(含 Linux 内核远程 DoS 与本地提权)。
- Tier 2(利用开发):36 个任务中解决 14 个(38.9%),优于 GLM-5.2 的 22.2%,但内核利用与人类专家仍有明显差距。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Kimi Team,Tongtong Bai,Yifan Bai,Yiping Bao,M. C.,Jianfeng Cai,Xinyuan Cai,Peizhou Cao,Yuxuan Cao,Ziwei Chai,Y. Charles,H.S. Che,Guanduo Chen,Guangyu Chen,Guanzheng Chen,Huarong Chen,Jia Chen,Jianlong Chen,Jun Chen,Kexin Chen,Peng Chen,Ruijue Chen,Wentao Chen,Xin Chen,Yang Chen,Yanru Chen,Yifei Chen,Yingjiang Chen,Yuankun Chen,Yujie Chen,Yutian Chen,Zhirong Chen,Dazhi Cheng,Yean Cheng,Jialei Cui,Jingbing Cui,Anqi Dai,Jiaqi Deng,Hao Ding,Rui Ding,Shaofeng Ding,Mengfan Dong,Mengnan Dong,Yuhao Dong,Yuxin Dong,Angang Du,Chenzhuang Du,Dikang Du,Jusen Du,Yulun Du,Yu Fan,Jing Feng,Qiulin Feng,Yichen Feng,Kelin Fu,Qiang Fu,Fuxuan Gao,Hongcheng Gao,Jingyue Gao,Tong Gao,Weijia Gao,Shangyi Geng,Jie Gong,Linhu Gong,Shengao Gong,Xiaochen Gong,Qizheng Gu,Yicheng Gu,Shuhao Guan,Haiqing Guo,Shiqi Guo,Xiang Guo,Zhengyan Guo,Beixi Hao,Wenxin Hao,Xiaoru Hao,Dailan He,Haotian He,Lehan He,Qi He,Weiran He,Xinran He,Xinyi He,Yibo He,Yunjia He,Chao Hong,Tiange Hong,Hao Hu,Jiaxi Hu,Ruikun Hu,Weiming Hu,Yangyang Hu,Zhenxing Hu,Liang Hua,Jinbin Huang,Ke Huang,Ruiyuan Huang,Siying Huang,Weixiao Huang,Yan Huang,Zhengjie Huang,Zhiqi Huang,Yulong Hui,Chaobo Jia,Yutong Jiang,Zhejun Jiang,Zuoyou Jiang,Wenyi Jin,Xinyi Jin,Yu Jing,Huanjun Kong,Guokun Lai,Aidi Li,Cheng Li,Chengyuan Li,Cong Li,Fang Li,Guanyu Li,Haoyang Li,Jia Li,Junxiong Li,Lei Li,Letian Li,Lincan Li,Weihong Li,Wentao Li,Xintong Li,Yang Li,Yishen Li,Yiwei Li,Yuxiao Li,Zhaowei Li,Zhaoxi Li,Zheming Li,Zhengxiao Li,Zhiyuan Li,Jiawei Lin,Xiaohan Lin,Yibo Lin,Zichao Lin,Ziyan Lin,Bill Liu,Boxiao Liu,Chuan Liu,Liang Liu,Shaowei Liu,Shudong Liu,Shuran Liu,Tianwei Liu,Weizhou Liu,Yangyang Liu,Yanming Liu,Yibo Liu,Yipeng Liu,Zhengying Liu,Zhiheng Liu,Enzhe Lu,Haoyu Lu,Linqiang Lu,Tingzhan Lu,Zhiyuan Lu,Aotian Luo,G. Luo,Junyu Luo,Yifan Luo,B. Lyu,Wenzhou Lyu,Shaoguang Mao,Yuan Mei,Xin Men,Minqing Ni,Yixuan Niu,Siyuan Pan,Shujun Peng,Zhangyang Qi,Ruoyu Qin,ZeChao Qin,Zeyu Qin,Haiquan Qiu,Jianxin Qiu,Jiezhong Qiu,Bowen Qu,Yuhao Qu,Zeyu Shang,Youbo Shao,Han Shen,Jincheng Shi,Juanfeng Shi,Lidong Shi,Shengyuan Shi,Wingchun Siu,Pengwei Song,Xiaoxi Song,Jianlin Su,Yunfeng Su,Zhaochen Su,Lin Sui,Jingsong Sun,Junyao Sun,Shaoning Sun,Shuzhe Sun,Tongyu Sun,Yujun Sun,Yunpeng Tai,Chuning Tang,Heyi Tang,Sirui Tang,Zecheng Tang,Chaoran Tian,Rongpeng Tian,Yu Tian,Wei Tu,Chensi Wang,Chuang Wang,Chunjie Wang,Dinglu Wang,Feng Wang,Hailong Wang,Haiming Wang,Hao Wang,Hao Wang,Huaqing Wang,Hui Wang,Jiayi Wang,Jinglong Wang,Jinhong Wang,Jiuzheng Wang,Linian Wang,Shaobo Wang,Shenzhi Wang,Shuyi Wang,Si Wang,Siyuan Wang,Tianfu Wang,Wenjue Wang,Xingran Wang,Xinmei Wang,Xinyuan Wang,Xusheng Wang,Yalin Wang,Yangkun Wang,Yao Wang,Yaoyu Wang,Yejie Wang,Yiqin Wang,Yucheng Wang,Yuzhi Wang,Zhaoji Wang,Zhaowei Wang,Zhengtao Wang,Zhenhao Wang,Zhongsheng Wang,Zifan Wang,Chu Wei,Ming Wei,Shouxin Wei,Zichen Wen,Fan Wu,Haoning Wu,Rucong Wu,Wenhao Wu,Xiaoxue Wu,Yingcong Wu,Yongqi Wu,Yuxin Wu,Zijian Wu,Xinglang Xian,Chenxuan Xiang,Yuye Xiang,Bocheng Xiao,Chenjun Xiao,Xin Xiao,Jin Xie,Xiaotong Xie,Yifeng Xie,Zhe Xie,Bowei Xing,Yiming Xiong,Baosheng Xu,Boyu Xu,Jiale Xu,Jianfan Xu,Jing Xu,Jinjing Xu,L.H. Xu,Qingtao Xu,Shuyao Xu,Suting Xu,Tiantian Xu,Tianxiang Xu,Weixin Xu,Xinran Xu,Yangchuan Xu,Ye Xu,Yueni Xu,Ziyao Xu,Haonan Xue,Junjie Yan,Yaoyao Yan,Fan Yang,Guangyao Yang,Hao Yang,Junwei Yang,Ruoyu Yang,Wenjie Yang,Xiaofei Yang,Xinyu Yang,Yi Yang,Yiling Yang,Ying Yang,Yuchen Yang,Zhen Yang,Zhilin Yang,Zian Yang,Zuhao Yang,Haotian Yao,Dan Ye,Haoran Ye,Wenjie Ye,Zhanbo Ye,Bohong Yin,Haoxiang Yin,Xietong Yin,Chengzhen Yu,Haozhen Yu,Longhui Yu,Shengnan Yu,Shuying Yu,Tianxiang Yu,Enming Yuan,Mengjie Yuan,Tongtian Yue,Wei Yue,Yang Yue,Dunyuan Zha,Haobing Zhan,B.H. Zhang,Dehao Zhang,Fei Zhang,Hao Zhang,Haoyuan Zhang,Huanyu Zhang,Jiapei Zhang,Jiaxuan Zhang,Jin Zhang,Kaiyi Zhang,Miaozhen Zhang,Puqi Zhang,Qinglei Zhang,Rong Zhang,Rui Zhang,Shaoshuai Zhang,Shiyi Zhang,Xiaobin Zhang,Xiaoyun Zhang,Y. Zhang,Yangkun Zhang,Ye Zhang,Yichi Zhang,Yikun Zhang,Yizhi Zhang,Yongting Zhang,Yu Zhang,Yutao Zhang,Yutong Zhang,Zheng Zhang,Zijing Zhang,Bin Zhao,Chenguang Zhao,Feifan Zhao,Jinglun Zhao,Jinxiang Zhao,Shuai Zhao,Wenshuo Zhao,Xiangyu Zhao,Xuanle Zhao,Yikai Zhao,Zijia Zhao,Haozhi Zheng,Huabin Zheng,Ruihan Zheng,Shaojie Zheng,Tengyang Zheng,Haofeng Zhong,Lei Zhong,Longguang Zhong,M. Zhou,Qiankang Zhou,Runjie Zhou,Ruozhang Zhou,Xinyu Zhou,Yiqiao Zhou,Zaida Zhou,Jinguo Zhu,Liya Zhu,Xinhao Zhu,Yangjunfeng Zhu,Yuxuan Zhu,Zhen Zhu,Chen Zhuang,Weiyu Zhuang,Xinxing Zu,et al. (302 additional authors not shown)
PDF URL: https://arxiv.org/pdf/2607.24653.pdf
Arxiv URL: https://arxiv.org/abs/2607.24653
Arxiv ID: 2607.24653
CoolPaper URL: https://papers.cool/arxiv/2607.24653
Published: 2026-07-29T01:06:07.520Z
Updated: 2026-07-29T01:06:07.520Z
2. JarvisHub: An Open Harness for Canvas-Native Multimodal Creative Agents
Abstract:Creative AI is moving from single-step asset generation toward long-horizon multimodal production. Although recent generative models can synthesize high-quality images, videos, audio clips, UI elements, storyboards, slides, and other creative assets, real-world creative work requires more than isolated prompt-output interactions. It involves references, drafts, alternatives, edits, failed attempts, version relations, tool actions, evaluation signals, and human feedback, which together form an evolving project state. Existing prompt-based, chat-based, and node-based generation systems only partially support this state, as they often discard intermediate context, rely on linear conversations, or require manually specified workflows. Recent commercial systems indicate a shift toward agent-assisted creative production, but their closed architectures make it difficult to study how agents represent context, choose tools, revise artifacts, recover from failures, and maintain consistency over time. To address this gap, we introduce JarvisHub, a canvas-native creative agent harness for long-horizon multimodal creation. JarvisHub treats an editable canvas as the user workspace, the agent’s external memory, action space, and shared project state, representing multimodal artifacts, dependencies, versions, and feedback as typed canvas nodes and links. Through a three-layer architecture of canvas state, protocol bridge, and agent runtime, JarvisHub enables agents to act within an inspectable and editable creative state. This design moves creative agents beyond isolated tool use toward sustained, human-steerable creative automation, where agents can progressively plan, generate, revise, and organize multimodal projects while users remain able to inspect, guide, and intervene throughout the process.
中文摘要
摘要:创造性人工智能正在从单步资产生成发展为长周期的多模态生产。尽管近期生成模型能够合成高质量的图像、视频、音频片段、UI 元素、分镜、幻灯片及其他创意资产,但现实世界的创作工作需要的不仅仅是孤立的提示与输出交互。它涉及参考资料、草稿、备选方案、编辑、失败尝试、版本关系、工具操作、评估信号以及人类反馈,这些共同构成了一个不断发展的项目状态。现有的基于提示、基于对话和基于节点的生成系统只能部分支持这一状态,因为它们往往会丢弃中间上下文、依赖线性对话或需要手动指定工作流程。近期的商业系统显示出向代理辅助创作生产的转变,但其封闭的架构使得研究代理如何表示上下文、选择工具、修改作品、从失败中恢复以及随时间保持一致性变得困难。为了解决这一空白,我们提出了 JarvisHub,这是一个面向长周期多模态创作的画布本地创意代理工具。JarvisHub 将可编辑画布视为用户的工作空间、代理的外部记忆、动作空间以及共享项目状态,通过将多模态资产、依赖关系、版本和反馈表示为类型化画布节点和链接。通过画布状态、协议桥和代理运行时三层架构,JarvisHub 使代理能够在可检视且可编辑的创意状态中行动。这一设计将创意代理从孤立的工具使用提升到持续的、可被人类引导的创意自动化,代理可以逐步计划、生成、修改和组织多模态项目,同时用户在整个过程中仍能够检视、指导并干预。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文试图解决长时程多模态创意生产中项目状态管理与代理运行时框架缺失的问题,具体可归纳为以下三方面:
现有系统难以维持演化的创意项目状态
实际创意工作涉及参考素材、草稿、备选方案、编辑记录、失败尝试、版本关系、工具操作、评估信号及人类反馈等,这些中间材料共同构成了演化的项目状态。然而,现有的”提示-输出”工具、聊天式代理及节点式工作流系统往往丢弃中间上下文、依赖线性对话,或要求手动指定固定管线,无法为长时程创作提供统一、可持续编辑的项目状态。商业创意系统的封闭性阻碍了基础研究
近期商业产品(如Claude Design、Google Stitch、MiniMax Hub等)虽展现出向代理辅助创意生产转型的趋势,但其架构封闭,研究者无法检视代理如何表示上下文、调度工具、修订产物、修复失败及在长时间工作流中保持一致性,导致难以系统性地研究创意代理的行为机制。缺乏面向画布原生代理的开放运行时工具
论文指出,当前领域缺失的并非另一款创意生成产品,而是一个开放的工具(open harness),能够以可编辑画布作为共享工作空间与外部记忆,使代理具备持续规划、生成、修订与组织多模态项目的能力,同时允许人类在整个过程中检查、引导与干预。为此,论文提出了 JarvisHub,通过画布状态层、协议桥与代理运行时三层架构,将长时程多模态创作形式化为代理在可编辑项目图上的持续操作过程。
Q: 有哪些相关研究?
根据论文第1–2节及相关文献,现有研究可归纳为以下五个方向:
1. 单步多模态生成模型
该方向聚焦高质量图像、视频、音频、UI元素等单资产合成,代表工作包括:
- 图像生成:如 FLUX.1 Kontext
2
、InstructPix2Pix
3
、Seedream 系列
4, 38
、Step1x-edit
29
、OmniGen
45
、Show-o2
46
、Qwen-image
43
、Stable Diffusion/Imagen 类工作
34, 36, 37, 50
及 HQ-edit
19
、Magicbrush
51
、UltraEdit
52
等指令级编辑数据集与模型; - 视频生成:如 Seedance 2.0
41
、Dynamic Storyboard
35
; - 音频与网页生成:如 Kimi-audio
10
、Vision2Web
17
、Design2Code
39
、WebSight
23
; - 统一多模态预训练:如
9, 45, 46
。
局限:这些模型擅长孤立地响应提示产出单资产,但通常隐藏或丢弃中间决策、失败尝试、备选方案与修订历史,难以支撑长时程创作。
2. 提示-输出(Prompt-to-Output)工具
此类系统直接将文本提示映射为最终创意资产,涵盖大量近期商业与学术图像/视频/音频生成工具
2, 3, 6, 9, 13, 19, 29, 34, 36–38, 43, 45, 46, 50–52
。
局限:它们仅保留最终输出,缺乏对参考关系、版本分支、局部编辑与项目状态的显式表示。
3. 聊天式创意代理(Chatbot Agent Platforms)
此类系统以多轮对话为上下文,可调用工具并遵循多步指令,代表包括:
- 图像修图代理:PhotoArtAgent
5
、MonetGPT
11
、JarvisArt
27
、JarvisEvo
28
; - 具备图像生成能力的对话模型:Gemini 3.1 Flash Image Preview
16
、Seedream 5.0 Lite
4
; - 通用多模态代理:Unify-Agent
6
。
局限:其主要上下文仍为线性聊天记录,难以有效表示空间布局、资产关系、版本分支与局部编辑目标。
4. 节点式与可视化工作流工具
该方向通过图形节点编排生成步骤,增强执行过程的可视性,代表包括:
- ComfyUI 生态:ComfyGPT
18
、ComfyUI-R1
47
、ComfyUI-Copilot
48
、ComfyBench
49
; - 节点式多模态编辑:Node-based Editing
20
、StoryNodes
21
; - 提示链可视化:PromptChainer
44
; - 分支叙事生成:GENEVA
24
; - 人机回环代理系统:Magentic-UI
31
。
局限:这些系统多围绕手动指定的固定管线组织,而非持续可编辑、代理可自主检查与修订的项目状态。
5. 商业创意生产系统(闭源)
近期产品展现出向代理辅助、长时程创意生产转型的趋势,例如:
- Claude Design
1
:支持对话式设计与迭代细化; - Google Stitch
22
:连接提示式UI生成与多页原型及前端代码; - TapNow
40
、LibTV
26
:面向叙事内容,整合脚本、角色、分镜、图像、视频与音频; - MiniMax Hub
30
:协调图像、视频、音频与文本生成的多模态工作流。
局限:上述系统多为闭源架构,研究者无法检视其项目状态表示、动作校验、工具调度、反馈利用及失败修复机制,难以开展基础性的创意代理研究。
6. 评估与数据基准
相关工作还包括面向创意代理的评测:如 CLAW-Eval-Live
25
、Gen-Searcher
12
、PosterCraft
7
、Genevolve
8
等,但论文指出目前仍缺乏以画布项目状态为核心的长时程创意代理基准。
Q: 论文如何解决这个问题?
论文通过提出 JarvisHub,一个面向长时程多模态创作的画布原生代理工具(canvas-native agent harness),从状态表示、交互协议、运行时编排和反馈追溯四个层面系统性地解决了上述问题。具体方案如下:
1. 画布原生的项目状态表示
JarvisHub 将可编辑画布同时视为用户工作空间、代理的外部记忆、动作空间与共享项目状态,而非仅作为可视化界面。在第 t 轮,一个创意项目被形式化为结构化的画布状态:
C_t = (G_t, X_t, M_t, U_t, L_t), quad G_t = (V_t, E_t)
其中 G_t 为类型化产物图, V_t 是画布节点集合, E_t ⊂eq V_t × R × V_t 表示有向类型关系(如参考引用、版本谱系、生成依赖、分组或工作流延续)。每个节点表示为:
vi = (id_i, k_i, p_i, x_i, y_i, m_i, s_i), quad k_i ∈ K(node)
这里 id_i 为稳定标识符, k_i 为节点类型, p_i 记录空间位置与布局, x_i 存储可编辑输入(如提示词或配置), y_i 存储生成输出或产物句柄, m_i 记录来源与执行诊断, s_i 表示运行时状态。通过该表示,产物具备可寻址性(代理可精确引用某一图像或视频片段)、可复用性(草稿、被拒候选或中间结果可作为后续步骤输入)与依赖可检查性(可追踪材料影响关系、版本选择及下游依赖)。
2. 协议约束的画布交互
为确保长时程创作中的画布更新显式、有效且可恢复,JarvisHub 在代理与画布之间引入协议桥(Protocol Bridge)。在每轮交互中,代理接收用户请求 q_t 并观察当前画布 C_t ;协议桥提供能力清单 Gamma_t (列出可用节点类型、变更操作、工具与产物句柄),并推导执行授权 Omega_t 以限制本轮允许的操作。代理据此提出动作 a_t ,协议桥仅当其能被编码为受检的工具调用、画布变更、评估请求、澄清请求或面向用户的响应时才予以执行。
执行有效动作后产生工具或环境观察 o_t ,并可能接收来自人类、模型评论者或结构化评估器的反馈信号 f_t ,进而触发修复或后续决策 r_t 。画布状态通过状态转移算子 F 演化:
C_(t+1) = F(C_t, a_t, o_t, f_t, r_t)
这使得画布交互可审计:任何修改均留下变更记录,任何产物使用均关联其来源观察,避免了传统聊天式代理将过程隐藏在私有工具调用或瞬态对话历史中的问题。
3. 代理运行时与创意编排
代理运行时(Agent Runtime) 负责将用户请求转化为协议校验后的画布更新。给定 (q_t, C_t, Gamma_t, Omega_t) ,运行时首先针对当前画布解释请求,随后在执行授权下过滤可用操作,调用相应能力并经由协议桥返回证据。每轮的动作空间被严格定义为:
A_t = A(Omega_t, Gamma_t, C_t, q_t), quad a_t ∈ A_t
该契约确保代理动作必须基于观察到的画布、由能力清单暴露、被 Omega_t 允许,并通过协议桥提交,从而防止运行时维护独立的隐藏状态。
为支持长时程工作流,运行时将能力组织为五大工具家族:
- 画布工具:读写、创建、连接、分组、分支节点,维护产物句柄与运行状态;
- 生成工具:图像、视频、音频及合成媒体生成;
- 原生工具:浏览器、文件、代码、搜索、文档与演示操作;
- 恢复工具:结构化反馈、验证、检查点与局部修复;
- MCP 工具:通过 Model Context Protocol 扩展外部服务。
在此基础上,运行时借助三项高层机制进行能力编排:
- Skills(技能):编码可复用的创意流程(如分镜设计、参考引导生成、网页重建、演示文稿构建),为长任务提供结构而不必将每一步硬编码;
- Memory(记忆):跨轮保留用户偏好、先前决策与过程知识,确保动作与早期项目上下文一致;
- Subagents(子代理):在可分支工作流中并行处理独立子任务(如分别探索不同视频镜头),由父代理筛选结果并整合回共享画布图。
4. 反馈机制与轨迹记录
JarvisHub 将反馈视为状态转移的驱动因素,而非仅对中间结果的评判。反馈信号 f_t 可来自用户选择、拒绝、风格调整、局部缺陷指出,或系统自动执行的节点一致性、证据完整性、视觉质量与任务约束检查。基于反馈,代理决定是继续执行、局部修复失败节点、请求用户澄清,还是在证据不足时停止。
整个创作过程被记录为完整的轨迹:
τ = (qt, C_t, Gamma_t, Omega_t, a_t, o_t, f_t, r_t, C(t+1))_(t=1)^T
该轨迹包含每轮的用户请求、画布状态、可用能力、执行授权、代理动作、工具观察、反馈信号、修复决策及更新后的状态。这不仅使过程级失败(如忽略参考、覆盖有用变体、全局重生成而非局部修复)变得可见,还为构建项目状态基准、评估长时程行为指标(上下文保持、工具使用适当性、依赖正确性、反馈遵循率、修复成功率)以及训练后续创意代理提供了结构化数据基础。
总结
通过将画布作为统一的项目图、以协议桥强制执行受控的读写操作、以运行时整合工具编排与长程规划、并以完整轨迹保障可追溯与可恢复,JarvisHub 使创意代理从孤立的工具调用转向持续的、人类可引导的创意自动化,在叙事媒体生成、交互式网页开发与演示文稿生成等高价值长时程任务中实现了可检查、可复用的代理工作流。
Q: 论文做了哪些实验?
论文在第3节开展了针对长时程多模态创意任务的定性实验,旨在验证画布原生工具(canvas-native harness)能否支撑需要持久项目上下文、迭代产物生成与反馈驱动细化的真实创意工作流。
实验配置
所有任务均在同一 JarvisHub 环境中运行,后端配置如下:
- 主代理后端:GPT-5.5
- 图像生成后端:GPT Image 2
- 视频生成后端:Seedance 2.0
- 多模态评估后端:Gemini 3.1 Pro
评估任务
实验选取了三个具有代表性的高价值长时程创意任务,涵盖不同模态与创作流程:
| 任务 | 核心定义与挑战 | 代表性输出 |
|---|---|---|
| 叙事媒体生成 | 将故事、脚本或场景简报转化为时间连贯的视觉或视听序列,考察叙事规划、角色身份保持、风格一致性与跨镜头连续性。 | 角色参考图、场景设计、分镜面板、镜头计划、图像序列、视频片段、动态脚本。 |
| 交互式网页开发 | 将设计目标、信息结构或交互需求转化为可渲染的网页产物,考察布局设计、交互逻辑、前端代码、预览检查与迭代修订的协调能力。 | 静态页面、动态网站、落地页、网页界面、交互原型、渲染预览、前端实现。 |
| 演示文稿生成 | 将主题、源文档或沟通目标转化为结构化的多幻灯片演示,考察内容选择、叙事组织、幻灯片布局、视觉合成与跨幻灯片一致性。 | 演示文稿、学术讲座、项目报告、Pitch Deck、面试演示、视觉摘要、解释性图表。 |
定性结果呈现方式
对每个任务,论文均提供了两种互补的视图,以展示画布状态如何支撑长时程创作:
工作空间轨迹(Workspace Trace)
截图展示 JarvisHub 画布上的实际生产过程,包括任务简报、规划笔记、视觉参考、产物候选、依赖链接、版本分支、修订状态与代理进度。这表明在长时程工作中,计划、参考、资产与进度始终保持可检查。最终生成产物(Generated Artifact)
展示任务完成后得到的可交付成果,验证累积的画布状态是否支持连贯、高质量的输出。
具体而言:
- 叙事媒体生成(对应图4、图5):将”牛仔机器人僵尸拾荒者”短剧提示转化为具有关键帧的视觉序列,画布记录了故事规划与视觉参考,最终输出在多个镜头间保持了角色、场景线索与动作连续性。
- 交互式网页开发(对应图6、图7):将”Awwwards 风格轻量摄影网站”的审美与交互简报转化为渲染网站,画布追踪了设计参考、布局草稿、实现产物与预览,最终输出保持了排版、图像放置与视觉方向的一致性。
- 演示文稿生成(对应图8、图9):将”机器学习决策树”讲座主题转化为斯坦福风格的幻灯片,画布记录了内容规划、生成图表、幻灯片草稿与依赖关系,最终输出保持了布局、图表风格与跨幻灯片组织的一致性。
Q: 有什么可以进一步探索的点?
基于论文第4–5节的讨论与局限性,以下方向值得进一步探索:
1. 构建项目状态基准与定量评估体系
论文目前仅提供了定性演示,尚未建立可复现的基准测试或排行榜。未来工作可定义一系列项目状态基准任务,每个任务不仅包含目标提示,还指定初始画布、参考素材、可用工具集、约束条件、预期反馈事件与检查点。这要求设计标准化的画布状态初始化协议、成功准则与跨系统对比接口,从而将长时程创意代理的评估从个案展示推向系统性度量。
2. 过程级评估与诊断分析
最终产物的质量不足以完全刻画代理行为。未来研究需发展过程级评估协议,综合考察以下维度:
- 上下文保持(context preservation):代理是否持续使用并更新画布上的参考与依赖;
- 工具使用适当性(tool-use appropriateness):所选工具与当前子任务的匹配程度;
- 依赖正确性(dependency correctness):产物间的引用与版本谱系是否一致;
- 反馈遵循与修复成功率(feedback adherence & repair success):代理对人类或评估器反馈的响应精度;
- 错误恢复模式:代理在失败后是执行局部修复还是不必要的全局重生成。
3. 轨迹驱动的代理学习与数据飞轮
论文记录了完整的轨迹
τ = (qt, C_t, Gamma_t, Omega_t, a_t, o_t, f_t, r_t, C(t+1))_(t=1)^T
但明确指出原始轨迹需经过质量过滤、同意授权、匿名化与版权审查方可用于训练。未来可探索:
- 如何从海量轨迹中自动筛选高质量、可学习的策略片段;
- 如何设计基于 canvas-state transitions 的强化学习或模仿学习算法,以提升代理在规划、工具选择、多模态状态跟踪与反馈引导修订方面的能力;
- 建立符合伦理与法律规范的轨迹共享与开源机制。
4. 语义级正确性保障与自动验证
协议桥确保了画布操作的语法有效性与可恢复性,但并不保证代理的创意决策在语义上正确。未来可引入:
- 更强的模型化评估器(model-based critics),在画布状态提交前对产物一致性、风格连贯性与任务约束进行结构化验证;
- 形式化或可学习的预条件/后条件检查,确保节点更新不会破坏下游依赖;
- 代理自我批判(self-critique)循环,在工具调用前对计划进行模拟与冲突检测。
5. 画布状态的可扩展性与复杂项目管理
在长时程创作中,画布图 G_t = (V_t, E_t) 可能随时间指数级增长,导致观察上下文过长。未来需研究:
- 画布状态的分层摘要(hierarchical summarization),在保留关键依赖的同时压缩历史;
- 基于相关性的局部观察机制,使代理每轮仅加载与当前任务相关的子图;
- 检查点(checkpointing)与分支合并策略,支持大规模项目中的版本控制与回溯。
6. 多代理并行编排与冲突消解
论文初步提及子代理(subagents)可并行探索独立子任务,但由父代理整合结果。在更复杂的场景中,需进一步探索:
- 多代理同时读写共享画布时的并发控制与冲突消解协议;
- 代理间的显式通信机制,而非仅通过画布状态间接交互;
- 动态任务分解与资源分配算法,以优化并行工作流中的计算成本与产物一致性。
7. 细粒度人机协同与反馈机制
当前反馈信号 f_t 主要包括接受、拒绝、修复请求与澄清。未来可支持更细粒度的交互模式:
- 空间化局部反馈(如在画布特定节点或区域直接标注缺陷);
- 对比式反馈(comparative feedback),用户通过并排比较候选版本给出偏好;
- 隐式反馈推断(如根据用户编辑行为自动推断意图),减少显式标注负担。
8. 跨项目记忆与用户个性化
现有记忆机制主要服务于单项目内的上下文保持。长期来看,可探索跨项目的用户创意画像:学习个体在风格选择、布局偏好、工具使用习惯上的稳定模式,并在新项目初始化时自动注入相关偏好节点,实现个性化创意自动化。
Q: 总结一下论文的主要内容
论文围绕长时程多模态创意生产中项目状态的持续演化与代理可审计性问题,提出并实现了 JarvisHub,一个画布原生的开放代理工具。核心内容可概括如下:
1. 研究背景与问题 创意 AI 正从单步资产生成转向长时程、多模态的生产流程。实际创作涉及参考素材、草稿、备选方案、编辑记录、版本关系、工具操作及人类反馈等,这些共同构成持续演化的项目状态。现有三类系统均存在显著局限:
- Prompt-to-output 工具仅产出最终资产,丢弃中间过程;
- 聊天式代理以线性对话为主要上下文,难以表示空间布局、资产关系与版本分支;
- 节点式工作流依赖手动指定的固定管线,而非代理可自主检查与修订的连续项目状态。 此外,近期商业创意产品(如 Claude Design、Google Stitch、MiniMax Hub 等)虽呈现向代理辅助生产转型的趋势,但其封闭架构阻碍了研究者对状态表示、工具调度、失败修复等机制的系统研究。因此,领域缺失的是一个开放的运行时工具,能够在可编辑的共享工作空间中支撑代理进行可持续、人类可引导的创意自动化。
2. JarvisHub 的核心设计 论文提出将**画布(canvas)**同时作为用户工作界面、代理的外部记忆、动作空间与共享项目状态。系统由三层架构组成:
画布状态层(Canvas State)
将创意项目形式化为类型化产物图。在第 t 轮,画布状态表示为:
C_t = (G_t, X_t, M_t, U_t, L_t), quad G_t = (V_t, E_t)
其中 G_t 为产物图, V_t 为可寻址节点集合, E_t ⊂eq V_t × R × V_t 表示有向类型关系(如参考、版本谱系、生成依赖)。每个节点 v_i = (id_i, k_i, p_i, x_i, y_i, m_i, s_i) 分别存储标识、类型、位置、可编辑输入、生成输出、来源诊断及运行时状态。该表示确保了产物的可寻址性、可复用性与依赖可检查性。协议桥(Protocol Bridge)
通过能力清单 Gammat 与执行授权 Omega_t 限制代理每轮对画布的读写权限。代理提出的动作 a_t 须经校验后方能执行,产生的观察 o_t 与反馈 f_t 共同驱动画布状态转移:
C(t+1) = F(C_t, a_t, o_t, f_t, r_t)
这使得所有画布变更均可审计,避免了过程隐藏在瞬态对话或私有工具调用中。代理运行时(Agent Runtime)
负责将用户请求转化为协议校验后的画布更新。每轮动作空间严格定义为:
A_t = A(Omega_t, Gamma_t, C_t, q_t), quad a_t ∈ A_t
运行时整合五大工具家族(画布工具、生成工具、原生工具、恢复工具、MCP 扩展工具),并借助 Skills(可复用创意流程)、Memory(跨轮上下文保持)与 Subagents(并行子任务探索)实现长程编排。
3. 反馈与轨迹记录 系统将反馈视为状态转移的驱动因素,而非仅对最终产物的评判。完整轨迹被记录为:
τ = (qt, C_t, Gamma_t, Omega_t, a_t, o_t, f_t, r_t, C(t+1))_(t=1)^T
该记录支撑过程级诊断、错误恢复与未来模型的训练数据积累。
4. 实验验证 论文在统一环境中(后端采用 GPT-5.5、GPT Image 2、Seedance 2.0 与 Gemini 3.1 Pro)对三类高价值长时程任务进行了定性实验:
- 叙事媒体生成:验证跨镜头的叙事连贯性与角色一致性;
- 交互式网页开发:验证设计参考、布局迭代与预览反馈的协调;
- 演示文稿生成:验证多幻灯片的内容结构、视觉风格与跨页一致性。 每项任务均同时展示画布工作空间轨迹(规划、参考、依赖、进度)与最终生成产物,证明画布状态能够有效支撑可检查、可复用的长时程创意工作流。
5. 主要贡献
- 将长时程多模态创作形式化为代理在可编辑项目图上的持续操作过程;
- 提出并实现了一个画布原生的创意代理工具,统一了项目状态表示、受控运行时执行与轨迹记录;
- 在叙事媒体、网页开发与演示文稿三个领域展示了该工具对高价值长时程任务的支持能力。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yunlong Lin,Zixu Lin,Zhaohu Xing,Biqiang Li,Chenxin Li,Haonan Wang,Haitao Wu,Hengyu Liu,Jianghai Chen,Kaituo Feng,Kaixin Li,Shawn Chen,Shijue Huang,Sixiang Chen,Tsung-Yi Ho,Wenxuan Huang,Xiangyan Liu,Xiaomeng Hu,Xuanhua He,Yan Sun,Yunqing Zhao,Zhiqin Yang,Zehan Wang,Zhengyang Tang,Tianyu Pang,Xiangyu Yue
PDF URL: https://arxiv.org/pdf/2607.23588.pdf
Arxiv URL: https://arxiv.org/abs/2607.23588
Arxiv ID: 2607.23588
CoolPaper URL: https://papers.cool/arxiv/2607.23588
Published: 2026-07-29T01:06:18.622Z
Updated: 2026-07-29T01:06:18.622Z
3. Progress Reward Modeling for Robotic Learning: A Comprehensive Survey
Abstract:Robotic learning takes place in dynamic environments with large behavior spaces. A terminal success signal only tells the robot whether the task is completed. It does not explain whether the current behavior is making progress, remaining unchanged, or undoing earlier progress. For this reason, recent studies have increasingly explored progress rewards that provide feedback during task execution. However, the current literature lacks a shared framework. Existing methods use different observations, goal specifications, output signals, supervision sources, and evaluation protocols. This makes it difficult to compare them and understand what their results actually validate. In this survey, we provide a unified view of progress reward modeling for robotic learning. We organize the field in three connected steps. We first study the interface of a progress model. This defines the problem from the outside by asking what information the model receives and what form of progress signal it produces. We then move inside the model and study the methods used to construct this signal. This reveals the different assumptions and mechanisms behind progress estimation and reward generation. Finally, we examine the data and benchmarks that support these methods. This shows how progress supervision is obtained and what different evaluations actually measure. Together, these three perspectives connect what a progress model is, how it is built, and how its quality is validated. We further summarize the main limitations of current approaches and discuss future research directions.
中文摘要
摘要:机器人学习发生在具有大行为空间的动态环境中。终端成功信号只告诉机器人任务是否完成,但并不说明当前行为是在取得进展、保持不变还是在撤销先前的进展。因此,近年来的研究越来越多地探索在任务执行过程中提供反馈的进展奖励。然而,现有文献缺乏一个共享的框架。现有方法使用不同的观测、目标规范、输出信号、监督来源和评估协议,这使得比较它们并理解其结果真正验证了什么变得困难。在本综述中,我们提供了机器人学习进展奖励建模的统一视角。我们将该领域组织为三个相互关联的步骤。首先,我们研究进展模型的接口。这从外部定义了问题,询问模型接收何种信息以及生成何种形式的进展信号。然后,我们进入模型内部,研究用于构建该信号的方法。这揭示了进展估计和奖励生成背后的不同假设和机制。最后,我们检查支持这些方法的数据和基准。这展示了进展监督是如何获得的,以及不同评估实际上测量的内容。这三种视角共同连接了进展模型的定义、构建方式及其质量验证方法。我们还总结了当前方法的主要局限性,并讨论了未来的研究方向。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇综述论文试图解决机器人学习领域中与**进展奖励建模(Progress Reward Modeling)**相关的两个核心层次的问题:
1. 机器人学习本身的信号稀疏性问题
在动态、序列化且高维的机器人学习环境中,传统方法主要依赖终端成功信号(terminal success signal)。这类信号仅告知任务最终是否完成,无法提供关于中间执行过程的反馈:
- 无法判断当前行为是在推进任务、原地停滞还是撤销了已有进展
- 在长程任务(long-horizon tasks)中,成功结果稀疏,机器人在获得任何有效反馈前需要做出大量决策,导致信用分配(credit assignment)困难
进展奖励(progress rewards)被提出以提供随时间变化的稠密反馈,但如何统一地定义、构建和评估这些信号仍缺乏系统性梳理。
2. 进展奖励建模文献的碎片化与不可比性
近年来该领域发展迅速,但现有研究处于高度碎片化状态:
- 接口不统一:不同方法使用不同的输入表示(单帧/视频/轨迹)、目标指定方式(语言/视觉/结构化程序)和输出形式(标量分数/进度增量/排序/可执行奖励函数)
- 构建机制各异:信号来源涵盖冻结的基础模型、时序/相对监督、指令微调及程序化构造,其底层假设差异巨大
- 评估标准混乱:有的评估标量校准,有的评估时序一致性,有的评估下游策略性能,不同基准验证的是不同属性,导致难以横向比较
3. 综述的核心目标
为应对上述碎片化问题,论文提供了一个统一的视角,将进展奖励建模组织为三个相互关联的维度:
- 接口层(Interface):统一界定模型接收什么信息、如何指定目标、输出何种进度信号
- 方法层(Methods):按信号来源与转换机制分类,阐明各类方法的核心假设
- 数据与评估层(Data & Benchmarks):梳理监督信号的构建方式,并区分“进度保真度”“鲁棒性/泛化性”“下游效用”三类评估目标及其能/不能验证的内容
简言之,该论文试图通过建立共享的概念框架,将进展奖励建模从一组零散的技术实践转化为可被系统理解、比较和推进的研究领域。
Q: 有哪些相关研究?
根据论文的梳理,相关研究可按照接口设计、信号构建机制与数据及评估三个层面进行组织。以下按照论文的核心分类框架,对主要相关研究进行系统概述。
一、基于冻结基础模型的语义奖励评分器
这类方法无需任务特定训练,直接提取预训练视觉-语言模型(VLM)或对比语言-图像预训练(CLIP)模型的语义先验作为奖励信号。
- CLIP 相似度奖励:Baumli et al. (2023)、Rocamonde et al. (2024)、Mahmoudieh et al. (2022) 等通过计算当前观测与语言目标在嵌入空间的对齐分数,将其作为进程奖励。
- TOPReward (Chen et al., 2026a):不直接提取嵌入相似度,而是向冻结的 VLM 提问任务是否完成,利用模型输出 “true” 标记的隐含概率作为零样本奖励。
- GVL / OpenGVL (Ma et al., 2025; Budzianowski et al., 2025):利用冻结 VLM 估计视频帧的时间顺序或时间进展,用于数据筛选与评估。
二、基于时序与相对监督的奖励学习
该类方法从演示数据的时间结构或相对比较中学习奖励几何,避免了对绝对进度标签的依赖。
1. 时序顺序监督
- Goal-Prox (Lee et al., 2021):假设演示中越靠后的状态越接近目标完成,利用目标接近度的变化构造奖励。
- VIP (Ma et al., 2023b):学习一种视觉表征,使得当前状态与目标状态在该表征空间中的距离反映目标可达性(goal reachability),进而将距离作为奖励。
- R3M (Nair et al., 2023) 与 LIV (Ma et al., 2023a):通过人类视频或离线数据学习通用的视觉表征,用于后续的控制与奖励推断。
- Sermanet et al. (2017):基于无监督感知奖励进行模仿学习。
2. 奖励草图与偏好比较
- Reward Sketching (Cabi et al., 2020):由人类提供轨迹级别的粗略奖励曲线,而非逐帧标注。
- RL-VLM-F (Wang et al., 2024):利用冻结 VLM 自动生成成对偏好标签,再训练标量奖励模型。
- PEARL (Liu et al., 2024):实现跨任务的零样本偏好对齐与鲁棒奖励学习。
- Rank2Reward (Yang et al., 2024):从被动视频的排序中学习塑形奖励函数。
- DVD (Cabi et al., 2020):基于轨迹比较进行奖励推断。
三、基于指令微调的进展预测模型
该类方法将进展估计显式定义为指令遵循任务,通过微调大模型使其具备专门的进度估计能力。
- RoboReward (Lee et al., 2026):使用基于评分标准(rubric-based)的提示微调 VLM,输出结构化的轨迹进展分数。
- **Robometer
Q: 论文如何解决这个问题?
这篇综述通过建立一个统一的三步分析框架,将碎片化的进展奖励建模研究重新组织为可比较、可定位的知识体系。具体解决方式如下:
1. 提出接口视角(Interface):统一问题的外部边界
论文将各类进展模型视为“任务条件下的黑盒”,从三个维度统一界定其输入输出结构,消除因术语混用导致的比较困难:
- 当前任务状态表示:区分“单帧观测”“时序上下文(近期窗口/完整轨迹)”“关系对比(前后状态、初始-当前、当前-目标)”以及“状态访问接口(API/仿真器状态)”四类输入形式,明确不同模型可利用的证据范围。
- 任务目标指定方式:区分“语言条件”“视觉条件(目标图像/演示轨迹)”与“结构化/程序化目标”三种接口,澄清目标描述的粒度与适用场景差异。
- 输出形式:区分“状态级标量分数”“进展增量(Delta)”“排序/偏好”与“可执行奖励函数”四类信号,揭示不同输出对下游使用的隐含要求(如标量需校准、排序需转换、程序需状态访问)。
通过这一接口语言,原本架构迥异的方法可被纳入同一描述框架进行横向对比。
2. 提出方法视角(Methods):按信号来源与构建机制分类
论文打开模型黑盒,依据“进展信号从何而来”以及“如何转换为可用奖励”两个核心问题,将现有方法归纳为四大范式,并揭示其底层假设:
| 范式 | 核心机制 | 关键假设与局限 |
|---|---|---|
| 冻结基础模型评分 | 直接提取CLIP/VLM的语义相似度或token概率作为奖励 | 假设预训练语义先验与任务进展对齐;通常需后处理(归一化/差分/提示工程) |
| 时序与相对监督学习 | 从演示时序(越往后越接近成功)或成对偏好中学习奖励几何 | 假设时间与进展单调相关;偏好易获取但需转化为标量奖励 |
| 指令微调进展预测 | 将进展估计显式定义为指令遵循任务,微调VLM/VLA模型 | 假设显式指令监督可使模型习得可泛化的进度推理;需密集标注或自动生成数据 |
| 程序化奖励构造 | 由LLM/VLM生成可执行代码、谓词或特征函数 | 假设任务可分解为显式子目标且状态变量可访问;对开放域物理场景依赖性强 |
此分类避免了将不同机制混为一谈,使研究者能够根据可用资源(预训练模型、标注预算、仿真器API)选择合适路径。
3. 提出数据与评估视角(Data and Benchmarks):连接监督来源与验证目标
论文进一步将数据构建与评估协议系统化,澄清“不同结果实际验证了什么”:
- 数据构建维度:按人类参与程度划分为
- 人工驱动(遥操作、逐帧标注、偏好比较)
- 人在回路(稀疏锚点插值、主动查询、人工验证的自动生成)
- 全自动(时序标签、仿真器状态、LLM/VLM自动生成与数据增强)
这一划分揭示了语义精度与可扩展性之间的核心权衡。
- 评估目标维度:区分三类不应混同的基准目的
- 进展保真度(Progress Fidelity):标量校准、时序一致性、相对排序正确性、任务 grounding(相同观测在不同指令下应有不同判断)、可回答性与不确定性校准。
- 鲁棒性与泛化性:未见任务、视角/场景变化、跨本体迁移、非单调执行(失败、回退、重试)中的表现。
- 下游效用(Downstream Utility):在线策略学习、离线重标注、检索重排序、规划与动作选择中的表现。论文特别强调:策略性能提升不等于奖励对进展的忠实估计,反之亦然。
4. 综合效果
通过上述三步框架,论文将原本在“观测、目标、输出、监督、评估”五个维度上各自为政的研究,转化为可在统一坐标系中定位的条目。具体而言:
- 解决不可比性:任何进展模型均可被描述为“
状态表示- 目标接口
→
输出形式
”的实例,并按“
信号来源
—
构建机制
”归类。
- 目标接口
- 澄清评估内涵:读者可依据评估类型判断某篇论文的结果是证明了“校准的进度估计”“鲁棒的视觉判断”还是“可用的策略辅助信号”,避免将排序准确率误读为进展保真度,或将策略成功率等同于奖励设计优良。
- 指明发展方向:基于框架,论文在结尾归纳了现有方法在细粒度敏感性、自适应时间建模、在线推理效率和长程显式记忆四个方面的共性局限,为后续研究提供明确切入点。
Q: 论文做了哪些实验?
作为一篇综述论文(survey),该文的核心贡献在于构建统一的概念框架与系统性文献梳理,并未进行新的算法实验或训练新的模型。文中不包含传统意义上的实验章节(如实现细节、训练曲线、对比实验结果等)。
具体而言,该文的“研究活动”体现为以下概念性与分析性工作,而非实验验证:
1. 文献演化梳理
通过 Figure 1 展示了2017年至2026年间进展奖励建模领域的主要方法演进脉络,将现有研究按时间线归类为不同阶段的技术范式。
2. 统一接口框架的建立与实例化
通过 Figure 2 构建了“进展模型接口”的三维分类体系:
- 当前任务状态表示(单帧/时序上下文/关系对比/状态访问接口)
- 任务目标指定方式(语言/视觉/结构化程序)
- 输出形式(状态级标量/进展增量/排序/可执行奖励函数)
作者将数十篇现有工作映射到该框架中,以此揭示不同方法在输入输出层面上的本质差异与可比性边界。
3. 方法论分类与机制剖析
通过 Figure 3 将现有方法归纳为四大构建范式,并对每一类范式的信号来源、转换机制及隐含假设进行定性分析:
- 冻结基础模型评分
- 时序与相对监督学习
- 指令微调进展预测
- 程序化奖励构造
4. 数据构建与评估协议的系统化分析
通过 Figure 4 区分了:
- 数据层面:按人类参与程度(人工驱动/人在回路/全自动)梳理监督信号的获取方式;
- 评估层面:明确区分“进展保真度”“鲁棒性与泛化性”“下游效用”三类评估目标,并指出各类基准能且只能验证何种属性。
总结
该文的价值不在于提出新的实验结果,而在于通过上述框架重新解释和组织现有文献,解决领域内“同类术语指代不同问题、不同评估验证不同属性”的碎片化困境。若需了解具体某项方法的实验设置与结果,需查阅该综述所引用的原始研究(如 RoboReward、Robometer、VLAC、TOPReward 等)。
Q: 有什么可以进一步探索的点?
基于该综述对现有局限性的分析,未来研究可在以下方向进行深化探索:
1. 细粒度物理进展感知
现有模型多基于稀疏采样帧、短片段或离散阶段进行估计,难以捕捉精确对齐、轻微物体位移、不稳定抓取或早期接触失败等细微变化。未来工作可探索:
- 多模态信号融合:将视觉观测与本体感知(proprioception)、力/力矩(force/torque)、触觉(tactile)等信号结合,构建对微妙物理状态变化敏感的混合表征;
- 高时空分辨率架构:开发能够处理密集视频流或事件相机(event camera)数据的细粒度时序模型,以替代当前基于稀疏关键帧的粗略估计。
2. 自适应非线性时间建模
当前方法常依赖时间顺序或归一化时间戳作为监督,隐含假设进展随时间均匀增长。然而真实任务进展往往是非线性的:关键子目标达成时可能突变,而搜索、对齐阶段可能长期停滞。未来需研究:
- 事件驱动的进展表示:建立能够根据任务里程碑(milestones)自适应调整进度跃变幅度的模型,而非输出平滑递增的伪进度;
- 停滞与回退检测:显式建模执行平台期(plateaus)与进展撤销(regressions),区分“缓慢但有意义”与“无效重复”的行为。
3. 高效在线推理机制
大型视觉-语言模型(VLM)每步控制均需处理多帧图像、解析指令并推理执行历史,延迟过高,难以满足实时闭环控制需求。可探索:
- 分层推理架构:设计轻量级局部模型处理高频常规步骤,仅在关键状态转换或不确定性较高时调用大型模型;
- 流式编码与缓存机制:利用流式视觉编码器、任务表征缓存(task embedding caching)及模型蒸馏(distillation)降低单步计算开销;
- 边缘-云端协同:在机器人端部署紧凑的进展估计器,将复杂推理卸载至云端。
4. 长程历史依赖与显式记忆
在包含多个相似子任务的长程操作中(如依次抓取多个外观相同的物体),当前观测本身无法区分所处阶段,因为进展是历史依赖的潜在状态。未来方向包括:
- 紧凑任务记忆模块:维护显式的子目标状态记录(已完成/待完成/已失效),使模型能将当前观测锚定到全局任务执行坐标系中;
- 可更新的记忆表征:支持对过往子目标完成状态的修正(例如检测到先前步骤被意外撤销时更新记忆),以处理非单调执行。
5. 非单调执行与失败恢复建模
现有基准多基于成功且单调的演示构建,无法检验模型对真实场景中失败、重试、回溯等行为的处理能力。亟需:
- 非单调进展数据集:系统性地构建包含失败、回溯、重复尝试及异常顺序完成任务的大规模轨迹数据;
- 进展的“可逆性”建模:显式建模某些动作对先前进展的破坏效应,使奖励函数能够识别并惩罚导致状态回退的行为。
6. 不确定性与选择性预测(Selective Prediction)
当观测因遮挡、视角缺失或目标描述不足而导致进展无法可靠推断时,模型应能表达不确定性或选择拒绝回答,而非强制输出可能误导策略的伪置信分数。未来可研究:
- 进展估计的校准(Calibration):使模型输出的置信度与真实准确率一致;
- 策略安全的弃权机制:在不确定性超过阈值时触发安全回退或请求人类协助,而非继续执行。
7. 跨本体与跨域泛化
利用人类视频或互联网视频学习进展表示,再迁移到不同机器人本体(cross-embodiment)具有重大数据效率优势,但目前面临运动学差异、视角变化和交互方式不一致等挑战。未来需探索:
- 本体无关的进展表征:提取与执行者无关的任务结构表征(如物体状态转移、空间关系变化),而非与特定运动轨迹绑定的视觉特征;
- 视觉-物理解耦的域自适应:分离视觉外观变化与物理进展语义,提升在新场景、新视角下的稳定性。
8. 评估协议与基准的标准化
当前评估指标混杂(标量误差、排序准确率、策略成功率等),且不同指标验证的属性常被混淆。未来应推动:
- 分层次评估基准:明确区分并独立评测“进展保真度”“鲁棒性”与“下游效用”,避免用策略性能直接反推奖励设计的优劣;
- 诊断性基准测试:设计针对性探针(probes),检验模型是否依赖时间捷径(temporal shortcuts)、视觉表面相似度或指令忽略等伪相关(spurious correlations)。
9. 可解释与可修正的奖励程序生成
在程序化奖励构造方向,现有方法依赖LLM/VLM自动生成代码,但缺乏对生成奖励与真实任务目标对齐性的诊断能力。未来可探索:
- 人机协同的奖励调试:允许操作者通过自然语言反馈或反例修正自动生成的奖励程序;
- 奖励程序的形式化验证:在仿真环境中对生成的谓词或代码进行可满足性检查,确保其不与任务约束冲突。
10. 进展模型与策略学习的协同进化
当前研究多将进展模型视为固定奖励函数供给策略学习。未来可探索二者联合优化:
- 奖励塑形(reward shaping)的自适应调整:根据策略学习阶段的探索效率动态调整进展奖励的粒度与幅度;
- 反事实奖励评估:利用训练中的策略反馈识别进展模型中的系统性偏差,并据此迭代修正奖励信号。
这些方向共同指向一个目标:构建对物理细节敏感、对时间动态自适应、对历史依赖有记忆、对不确定性诚实、且可高效部署的进展奖励模型,使其从实验室基准走向真实长程机器人操作的闭环控制。
Q: 总结一下论文的主要内容
这篇综述系统梳理了机器人学习中的**进展奖励建模(Progress Reward Modeling)**研究,核心内容与贡献可概括如下:
1. 研究背景与核心问题
机器人学习发生在动态、高维且行为空间巨大的环境中。传统方法主要依赖终端成功信号(terminal success signal),该信号仅告知任务最终是否完成,无法解释中间行为是在推进任务、停滞不前还是撤销了已有进展。尤其在长程任务中,此类稀疏反馈导致信用分配困难。
进展奖励通过在执行过程中提供关于任务推进的稠密反馈来解决上述问题。然而,该领域文献高度碎片化:不同方法在观测输入、目标指定、输出信号、监督来源与评估协议上差异巨大,导致难以横向比较,亦不清楚各项结果究竟验证了什么属性。
2. 统一分析框架:三个相互关联的视角
为整合该领域,论文提出了一个由外而内的三步分析框架:
(1)接口层(Interface):界定模型的输入输出结构
论文将进展模型视为任务条件下的黑盒,从三方面统一其外部边界:
- 当前状态表示:包括单帧观测、时序上下文(近期窗口或完整轨迹)、关系对比(前后状态、初始-当前、当前-目标)以及状态访问接口(API/仿真器状态)。
- 任务目标指定:分为语言条件(text instruction)、视觉条件(目标图像或演示轨迹)与结构化/程序化目标(谓词、代码)。
- 输出形式:涵盖状态级标量分数(state-wise score)、进展增量(progress delta)、排序/偏好(ranking)以及可执行奖励函数(programmatic reward)。
(2)方法层(Methods):揭示奖励信号的构建机制
依据“信号从何而来”与“如何转换为可用奖励”,现有方法被归纳为四大范式:
- 冻结基础模型评分:直接提取CLIP/VLM的语义相似度或token概率作为奖励,具备零样本能力,但输出仅为语义先验,需后处理方能使用。
- 时序与相对监督学习:利用演示的时间顺序(越靠后越接近成功)或成对偏好比较学习奖励几何,避免绝对标签依赖,但需解决单调性假设与偏好到标量的转换问题。
- 指令微调进展预测:将进展估计显式定义为指令遵循任务,通过微调VLM/VLA模型习得可泛化的进度推理能力。
- 程序化奖励构造:由大模型生成可执行代码、谓词或特征函数,灵活且可解释,但依赖任务可分解性与状态变量的显式访问。
(3)数据与评估层(Data and Benchmarks):连接监督来源与验证目标
- 数据构建:按人类参与程度分为人工驱动( teleoperation、逐帧标注)、人在回路(稀疏锚点插值、主动查询、人工验证自动生成)与全自动(时序标签、仿真器状态、LLM/VLM自动生成)。
- 评估协议:明确区分三类不应混同的评估目标:
- 进展保真度:标量校准、时序一致性、相对排序正确性、任务grounding及不确定性校准;
- 鲁棒性与泛化性:未见任务、视角/场景变化、跨本体迁移及非单调执行(失败、回退、重试);
- 下游效用:在线策略学习、离线重标注、检索重排序与规划中的表现。论文强调,下游策略性能提升不等于奖励对进展的忠实估计。
3. 主要局限性
当前进展模型仍存在四方面共性不足:
- 细粒度敏感性不足:难以捕捉微小但关键的物理变化(如精确对齐、不稳定抓取)。
- 时间建模僵化:多假设进展随时间均匀增长,缺乏对突变、平台期与回退的自适应能力。
- 在线推理效率低下:大型VLM的高延迟限制了其在实时闭环控制中的每一步部署。
- 长程历史记忆薄弱:在包含重复子任务或需要回溯的长程执行中,模型难以区分历史状态相似但任务阶段不同的情形。
4. 未来研究方向
基于上述局限,论文指出值得探索的方向包括:多模态(视觉-力觉-触觉融合)细粒度感知、事件驱动的非线性进展建模、分层/流式高效推理架构、显式子目标记忆维护、非单调执行与失败恢复建模、不确定性表达与选择性预测、跨本体无关表征学习,以及评估基准与诊断性探针的标准化建设。
总结
该论文并未提出新算法或新实验,而是通过建立**“接口—方法—数据/评估”**的三维统一框架,对碎片化的进展奖励建模文献进行系统性重构。其核心贡献在于:使不同输入输出设计、不同信号构建机制与不同评估目标的研究可被清晰定位与公正比较,从而为该领域的后续研究提供了共享的术语体系与分析坐标。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Jianshu Zhang,Keliang Wu,Haoran Lu,Anbang Liu,Ce Zhang,Weijie Yin,Chengxuan Qian,Xiyuan Yang,Zhenyu Pan,Guo Ye,Han Liu
PDF URL: https://arxiv.org/pdf/2607.21655.pdf
Arxiv URL: https://arxiv.org/abs/2607.21655
Arxiv ID: 2607.21655
CoolPaper URL: https://papers.cool/arxiv/2607.21655
Published: 2026-07-29T01:06:27.223Z
Updated: 2026-07-29T01:06:27.223Z
4. From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
Abstract:Agentic search enables large language models to solve knowledge-intensive tasks by interleaving multi-step reasoning with retrieval, yet optimizing this with outcome-based reinforcement learning (RL) provides only sparse supervision. Knowledge distillation can supply denser guidance, and advanced proprietary models with their strong reasoning capabilities are promising teachers. While distilling from proprietary models can densify this supervisory signal, conventional logit-matching is precluded by hidden logits and mismatched tokenizers, whereas raw natural language trajectory imitation transfers superficial stylistic artifacts rather than core reasoning competence. To address the heterogeneous distillation problem and bridge the distribution gap, we propose Multi-Agent Protocol Distillation (MAPD), a joint distillation and RL framework uses a structured, style-normalized protocol as an intermediate representation. An offline multi-agent system (MAS) decomposes each query, retrieves supporting evidence, repairs failed searches, and converts the resulting exploration trace into a JSON protocol containing the task type, reasoning plan, and extractive grounding facts. During training, the protocol is provided only to a privileged branch of the student policy, whose token distributions furnish a dense distillation signal alongside the sparse RL objective. Extensive evaluations across seven QA benchmarks demonstrate that MAPD consistently outperforms competitive distillation and RL, achieving average success rates of 39.4\% on Qwen3-1.7B and 44.4\% on Qwen3-4B. Crucially, the framework generalizes robustly across diverse proprietary teachers while effectively mitigating the student policy from style drift and verbosity degeneration.
中文摘要
摘要:代理式搜索使大型语言模型能够通过交错多步推理与检索来解决知识密集型任务,但基于结果的强化学习(RL)优化仅提供稀疏监督。知识蒸馏可以提供更密集的指导,而具有强推理能力的先进专有模型是有前景的教师。虽然从专有模型进行蒸馏可以加密这种监督信号,但由于隐藏的logits和不匹配的分词器,传统的logit匹配受到限制,而原始自然语言轨迹模仿则传递表面风格特征而非核心推理能力。为了应对异构蒸馏问题并弥合分布差距,我们提出了多智能体协议蒸馏(MAPD),这是一种联合蒸馏与RL的框架,使用结构化、风格标准化的协议作为中间表示。一个离线多智能体系统(MAS)分解每个查询、检索支持证据、修复失败搜索,并将生成的探索轨迹转换为包含任务类型、推理计划和可提取基础事实的JSON协议。在训练过程中,该协议只提供给学生策略的特权分支,其令牌分布提供了密集的蒸馏信号,同时辅以稀疏的RL目标。在七个问答基准上的广泛评估显示,MAPD始终优于具有竞争力的蒸馏和RL方法,在Qwen3-1.7B和Qwen3-4B上分别实现了39.4%和44.4%的平均成功率。关键是,该框架在不同专有教师间具有稳健的泛化能力,同时有效减轻了学生策略的风格漂移和冗长退化问题。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决将专有模型(proprietary teacher)的推理能力高效迁移至开源学生模型(open-source student)时面临的异构蒸馏瓶颈与分布差距问题,具体体现在以下三个层面:
1. 传统蒸馏机制在专有模型场景下失效
基于 Logit 匹配的知识蒸馏(如 KL 散度对齐)依赖于可访问的教师 token 分布。然而,专有模型仅暴露黑盒 API,其内部 logits 不可见,且与开源模型使用异构分词器(heterogeneous tokenizers),导致数学上的 token 级对齐无定义。
2. 自由形式自然语言轨迹模仿引发风格漂移与幻觉
作为常见退而求其次的方案,直接让学生模型模仿专有模型生成的自然语言推理轨迹(Chain-of-Thought / agentic trajectories),会迫使学生拟合教师特有的语言外壳——包括冗长的表达习惯、权威语气及格式伪影。这种表层风格迁移不仅无法传递底层的认知策略(如任务分解、多跳证据聚合),反而加剧分布差距,导致严重的风格漂移(style drift)与幻觉(hallucination),显著降低 agentic 任务性能。
3. 结果导向的强化学习信号过于稀疏
Agentic search 涉及多轮检索与生成交错的复杂轨迹,而基于最终答案正确性的二元奖励( R ∈ 0,1 )仅能提供稀疏的轨迹级监督,难以对中间推理、检索查询与诊断步骤进行细粒度的信用分配(credit assignment)。
核心解决思路
为弥合上述差距,论文提出 Multi-Agent Protocol Distillation (MAPD):利用一个结构化的、风格归一化的 JSON 协议作为中间表示,将专有模型的核心认知策略(任务类型、推理计划、抽取式证据、答案验证)与其特有的语言外壳解耦。该协议由离线多智能体系统(MAS)合成,在训练阶段作为**特权信息(privileged information)**注入学生策略的特权分支,通过同模型的自蒸馏(OPSD)提供密集的 token 级监督,与稀疏的 GRPO 强化学习目标联合优化。这样既能规避 logits 不可见与分词器异构的障碍,又能抑制风格漂移,实现从专有到开源的安全高效迁移。
Q: 有哪些相关研究?
该论文在第 5 节系统梳理了三个密切相关研究方向的代表性工作,并阐明了其与 MAP
Authors: Junlin Liu,Jiangwang Chen,Zixin Song,Shuaiyu Zhou,Chunji Lv,Hank Wu,Kailin Jiang,Jinyang Wu,Bohan Yu,Chenxi Zhou
PDF URL: https://arxiv.org/pdf/2607.24280.pdf
Arxiv URL: https://arxiv.org/abs/2607.24280
Arxiv ID: 2607.24280
CoolPaper URL: https://papers.cool/arxiv/2607.24280
Published: 2026-07-29T01:06:34.604Z
Updated: 2026-07-29T01:06:34.604Z
5. Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation
Abstract:On-policy distillation (OPD) adapts diffusion models by querying a teacher along trajectories generated by the current student, but how it should behave under classifier-free guidance (CFG), a default component of modern diffusion systems, remains poorly understood. Existing OPD methods naturally extend velocity matching to the CFG-composed prediction, directly matching teacher and student guided velocities. We show that this objective is under-identified at the branch level: positive- and negative-branch errors can compensate in the guided prediction. Through two contrasting cases, we find that naive matching remains effective under shared negative conditioning, where both branch errors decrease jointly. When the model’s native CFG schema retains privileged information in the teacher’s negative branch that is unavailable to the student, however, this joint reduction breaks down and the composed objective induces antagonistic branch-error dynamics, reducing the positive-branch error while increasing the negative-branch error. We term this failure mode Negative Branch Asymmetry (NBA). To address NBA, we introduce Positive—Direction Matching (PDM), a branch-aware OPD objective that separately constrains the positive prediction and the CFG conditional direction. We apply PDM to dense-to-sparse video control, where naive guided matching is highly sensitive to inference guidance scales, while branch-aware supervision enables more robust and effective knowledge transfer.
中文摘要
摘要:在策略内蒸馏(OPD)中,通过沿当前学生生成的轨迹查询教师来调整扩散模型,但在现代扩散系统的默认组件——无分类器引导(CFG)下,其行为方式仍然理解不足。现有的OPD方法自然地将速度匹配扩展到由CFG组合的预测上,直接匹配教师和学生的引导速度。我们表明,这一目标在分支层面上存在未被识别的问题:正分支和负分支的误差可以在引导预测中相互补偿。通过两个对比案例,我们发现,在共享负条件的情况下,天真的匹配仍然有效,此时两个分支的误差会共同下降。然而,当模型自身的CFG架构在教师的负分支中保留了学生无法获取的特权信息时,这种共同减少机制将失效,组合目标会导致分支误差之间的对抗性动态,即降低正分支误差的同时增加负分支误差。我们将这种失效模式称为负分支不对称(NBA)。为了解决NBA,我们引入了正向匹配(PDM),这是一种识别分支的OPD目标,可分别约束正向预测和CFG条件方向。我们将PDM应用于从密集到稀疏的视频控制,在此场景下,天真的引导匹配对推理引导尺度非常敏感,而分支感知的监督则能够实现更稳健和高效的知识转移。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文试图解决在策略扩散蒸馏(On-Policy Distillation, OPD)中,分类器自由引导(Classifier-Free Guidance, CFG)组合目标存在的分支级欠识别问题,以及由此引发的**负分支不对称(Negative Branch Asymmetry, NBA)**现象。
具体而言,论文针对以下核心问题展开:
1. CFG组合目标的 branch-level 歧义性
现有OPD方法自然地将速度匹配扩展到CFG组合后的预测上,即直接最小化教师与学生组合速度之间的差异:
L_(naive) propto |v_T - v_S|_2^2
其中 v = γ v^+ + (1-γ) v^- 。该目标仅约束组合后的误差 γ e^+ + (1-γ) e^- ,允许正分支误差 e^+ 与负分支误差 e^- 相互补偿。这导致:
- 存在无穷多非零的 (e^+, e^-) 对满足训练目标;
- 分支级别的监督信号不可识别(under-identified)。
2. 特权负分支条件下的 NBA 失效模式
当教师的负分支包含特权信息(如参考图像、密集控制信号),而学生无法获取时,上述歧义性会演变为有害的优化动态:
- **共享负条件(shared negative conditioning)**下,两个分支误差可联合下降,歧义性无害;
- 特权负条件(privileged negative conditioning)下,朴素的组合匹配会诱导对抗性分支误差动态:正分支误差下降的同时,负分支误差被刻意放大。
论文将这种在特权负条件下,由CFG组合目标导致的、正负分支误差此消彼长的失败模式定义为负分支不对称(NBA)。
3. 推理引导尺度的过度敏感性
由于NBA在训练尺度 γ(train) 下被隐藏(正负误差相互抵消),一旦推理时更换引导尺度 γ(test) ,原有的补偿关系即被打破,导致学生性能急剧退化。这种现象表现为:
- 学生对推理CFG尺度极度敏感;
- 出现超出教师固有CFG依赖范围的额外退化。
4. 提出的解决方向
为消除分支歧义与NBA,论文提出分支感知(branch-aware)的蒸馏目标,核心方案为Positive–Direction Matching (PDM):
ell_(PDM) = |e^+|_2^2 + λ |d_T - d_S|_2^2
其中 d = v^+ - v^- 为CFG条件方向。通过分别约束正预测与条件方向,PDM强制 e^+ = e^- = 0 ,从根本上移除跨分支误差补偿的自由度,恢复可识别的监督信号,并提升跨推理引导尺度的鲁棒性。
总结:该论文重新审视了OPD中处理CFG的朴素方式,揭示了其在特权信息传递场景下的内在缺陷(NBA),并通过分支感知的目标函数(PDM)实现了更鲁棒、更有效的知识迁移。
Q: 有哪些相关研究?
相关研究主要围绕扩散模型蒸馏、**在策略蒸馏(OPD)以及分类器自由引导(CFG)**的处理方式展开,可分为以下几个方向:
1. 扩散模型蒸馏(Diffusion Model Distillation)
早期及当前主流的扩散蒸馏研究以降低采样步数为核心目标,通过将多步教师模型压缩为少步或单步学生模型来加速推理:
- 渐进式蒸馏(Progressive Distillation):通过递归地将多个教师步骤压缩为单个学生步骤实现加速(Salimans & Ho, 2022)。
- 一致性模型(Consistency Models / Consistency Trajectory Models):训练模型在同一概率流轨迹上的不同状态输出一致结果,支持一步或少数几步生成(Song et al., 2023; Kim et al., 2024)。
- 潜在一致性模型(Latent Consistency Models):在高分辨率潜在空间上实现少步推理的一致性训练(Luo et al., 2023)。
- 分布匹配蒸馏(Distribution Matching Distillation, DMD):通过匹配分数函数将学生分布与教师分布对齐(Yin et al., 2024b)。
- 对抗扩散蒸馏:结合扩散监督与对抗训练,如 Adversarial Diffusion Distillation(Sauer et al., 2024; Yin et al., 2024a)。
上述方法在蒸馏CFG引导的教师时,通常将CFG组合后的预测作为蒸馏目标,从而将引导效应“烘焙”进单一的学生预测中,避免推理时进行双分支评估。
2. 在策略蒸馏(On-Policy Distillation, OPD)
近期研究将“在策略”思想引入扩散与流模型,让学生在自身生成的轨迹上探索,并由教师在学生访问的状态上提供稠密监督:
- D-OPSD:利用特权上下文进行在策略自蒸馏,使学生沿自身去噪轨迹向更强的教师学习(Jiang et al., 2026)。
- Flow-OPD:将任务专用的流匹配教师通过OPD方式蒸馏到统一学生中(Fang et al., 2026)。
- DiffusionOPD:从转移级KL散度出发推导OPD,并证明在标准扩散转移下可归结为预测匹配(Li et al., 2026b)。
- DanceOPD:将CFG等算子定义的场通过OPD内化为单一学生预测,不再在推理时暴露独立分支(Zhou et al., 2026)。
与本文设置的关键区别在于:现有OPD工作要么将CFG吸收为单预测,要么在保留分支时默认教师与学生共享相同的负条件,因而未考察教师负分支包含特权信息时的优化动态。
3. 分类器自由引导(Classifier-Free Guidance, CFG)
CFG 是现代扩散系统的默认组件,由 Ho & Salimans (2022) 提出,通过组合正负分支预测实现条件控制:
v = γ v^+ + (1 - γ) v^-
当前主流系统(如 FLUX.2、Stable Diffusion 3.5、Wan 等)均依赖CFG进行高质量生成。然而,现有蒸馏文献对如何在保留分支接口的OPD框架下正确监督CFG行为缺乏深入理解,这正是本文试图填补的空白。
4. 下游应用与基础设施
论文涉及的具体应用场景也依托于近期相关技术:
- 视频控制生成:基于 Wan-VACE(Jiang et al., 2025)实现密集到稀疏的视频控制迁移。
- 数据集与评测:使用 OpenHumanVid(Li et al., 2025)构建密集-稀疏控制基准,并采用 DWPose、DPT-Hybrid(Ranftl et al., 2020)等进行控制信号重提取。
- 参数高效微调:所有实验均基于 LoRA(Hu et al., 2022)适配器进行,冻结基座模型仅训练低秩分支。
Q: 论文如何解决这个问题?
论文通过分支感知(branch-aware)监督解决该问题,核心思想是在CFG组合之前分别约束教师与学生的分支级预测,从而消除跨分支误差补偿的自由度。具体解决方案包括以下方面:
1. 核心思想:在组合前进行监督
朴素目标 L_(naive) 仅约束组合后的速度 v = γ v^+ + (1-γ) v^- ,导致正、负分支误差 e^+ 与 e^- 可通过
γ e^+ + (1-γ) e^- = 0
相互抵消。为打破这一歧义性,论文提出直接监督组合前的分支预测,确保分支级误差同时趋于零。
2. 主要方法:Positive–Direction Matching (PDM)
PDM 是论文提出的主要分支感知目标函数,包含两项独立的监督:
(1)正分支预测匹配 直接约束正分支的误差:
|e^+|_2^2 = |v_T^+ - v_S^+|_2^2
(2)CFG条件方向匹配 定义模型的CFG条件方向为 d = v^+ - v^- ,并约束教师与学生的方向一致:
|d_T - d_S|_2^2
由于 d_T - d_S = (v_T^+ - v_S^+) - (v_T^- - v_S^-) = e^+ - e^- ,该项等价于 |e^+ - e^-|_2^2 。
综合目标函数
ell(PDM) = |e^+|_2^2 + λ |d_T - d_S|_2^2 = |e^+|_2^2 + λ |e^+ - e^-|_2^2
其中 λ > 0 为方向匹配权重(默认取 λ = 1 )。当 ell(PDM) = 0 时,必须满足 e^+ = 0 且 e^- = 0 ,从而彻底消除跨分支误差补偿的可能,恢复可识别的监督信号。
3. 对比基线:Independent Branch Matching (IBM)
为验证“移除交叉补偿”本身带来的收益,论文同时引入IBM作为对照:
ell_(IBM) = γ^2 |e^+|_2^2 + (γ-1)^2 |e^-|_2^2
IBM 保留朴素目标展开后的分支权重,但丢弃其交叉项 2γ(1-γ)langle e^+, e^- rangle 。与PDM类似,IBM也具有唯一的分支级零损失解,但直接匹配两个分支而非正预测与条件方向。
4. 高效训练策略(视频场景)
在密集到稀疏的视频控制任务中,完整轨迹监督计算昂贵。论文采用截断轨迹监督:仅对学生去噪轨迹的前 K 个状态计算教师监督(取 K=8 ,总步数 N=50 ),
L(OPD)^((K)) = E({xt_k)^S sim pθ} [ (1) / (K) ∑(k=0)^(K-1) w(t_k) , ell(x(t_k)^S, t_k) ]
学生在训练中仍需完成完整去噪 rollout,但教师仅需在初始阶段提供监督,从而大幅降低训练成本,同时保持控制精度。
5. 实验验证与效果
论文通过两类实验验证方案有效性:
- 图像域诊断实验:在文本渲染(共享负条件,NBA未发生)和参考条件蒸馏(特权负条件,NBA发生)中对比。PDM在参考条件设置下抑制了负分支误差的异常增长,且在推理引导尺度 γ ≠ γ_(train) 时,避免了朴素方法出现的风格漂移与视觉失真。
- 密集到稀疏视频控制:在 Wan-VACE 上进行姿态、深度、涂鸦三种控制的联合训练。PDM不仅在训练尺度 γ=5 上取得最优的控制保真度(如最低的MPJPE、最高的PCK),在推理尺度偏移至 γ=3 或 γ=1 时,仍保持稳定性能,而朴素OPD则出现严重的质量退化与结构崩坏。
综上,PDM通过分离正预测匹配与条件方向匹配,消除了分支歧义,阻断了负分支不对称(NBA)的对抗性动态,从而实现了对推理CFG尺度变化具有鲁棒性的高质量知识迁移。
Q: 论文做了哪些实验?
论文从诊断性图像实验、密集到稀疏视频控制应用和消融实验三个层面展开验证,具体如下:
1. 图像域诊断实验:NBA 何时出现?
该部分设计了两组对比实验,以负条件是否共享为变量,检验朴素 CFG 匹配是否会导致负分支不对称(NBA)。
1.1 文本渲染蒸馏(共享负条件,NBA 未发生)
- 设置:基于 SD3.5-Medium,教师与学生使用相同的文本提示(正分支)和相同的空文本(负分支),训练指导尺度 γ_(train) = 4.5 。
- 方法:对比 Naive OPD、PDM 与 Positive-only 消融(仅匹配正分支)。
- 观测指标:
- 训练过程中正、负分支的 ell_2 误差范数动态;
- 1,018 个 held-out 提示上的 OCR reward(基于编辑距离)。
- 发现:
- 正、负分支误差联合下降(图2 上);
- 在推理指导尺度 γ ∈ 1, 2, 3, 4, 4.5 上,学生和教师表现出相似的 CFG 响应模式(表1),说明性能下降源于教师本身的 CFG 依赖,而非蒸馏引入的额外敏感性。
1.2 参考条件蒸馏(特权负条件,NBA 发生)
- 设置:基于 FLUX.2-klein-base-4B。教师正分支接收 (y, r) (提示+参考图),负分支接收 (∅, r) ;学生正分支仅接收 y ,负分支仅接收 ∅ 。训练指导尺度 γ_(train) = 2 。
- 方法:对比 Naive OPD、PDM 与 Positive-only 消融。
- 观测指标:
- 分支误差动态;
- 不同推理指导尺度下的视觉质量(风格保持、失真程度)。
- 发现:
- Naive 与 Positive-only 均出现对抗性分支误差动态:正分支误差下降,负分支误差持续上升(图2 下);
- PDM 抑制了负分支误差的恶化;
- 当推理 γ ≠ γ_(train) (尤其是 γ=1 )时,Naive 学生出现显著的风格漂移和视觉伪影,而 PDM 紧密跟随教师行为(图3、图5)。
2. 密集到稀疏视频控制应用
将分支感知 OPD 应用于实际场景:教师接收密集逐帧控制,学生仅接收稀疏关键帧。
2.1 实验设置
- 基座模型:Wan2.1-VACE-1.3B(冻结权重,仅训练 LoRA)。
- 任务:三种控制模态联合训练——姿态(Pose)、深度(Depth)、涂鸦(Scribble)。
- 条件不对称:
- 教师: cT^+ = (y, p(dense)) , cT^- = (∅, p(dense)) ;
- 学生: cS^+ = (y, p(sparse)) , cS^- = (∅, p(sparse)) 。
- 训练配置: γ_(train) = 5 ,监督前 K=8 个去噪状态(共50步)。
- 测试集:基于 OpenHumanVid 构建的 600 段难度分层视频。
2.2 对比方法
- 未适配的稀疏控制学生(Student)
- 标准监督微调(SFT)
- 离策略蒸馏(Off-policy)
- OPD (Naive)
- OPD (IBM,独立分支匹配基线)
- OPD (PDM)
2.3 主要结果(表2)
在训练指导尺度 γ=5 下评估:
| 控制模态 | 核心发现 |
|---|---|
| 姿态 | PDM 在 MPJPE(全部/关键帧:4.13/2.83)、PCK@0.2(92.98/96.12)和 PCK@0.1(82.48/91.03)上均优于 Naive、IBM、SFT 和 Off-policy。 |
| 深度 | PDM 取得最优的 SI-RMSE(10.31/5.68)和次优的 CORR(91.24/97.13),FID/FVD 也显著优于 Naive。 |
| 涂鸦 | PDM 在 Recall(76.42/93.03)、F1(76.22/93.03)上领先,且 FVD(50.53)显著低于 Naive(59.95)。 |
2.4 指导尺度泛化(表3,仅姿态模态)
将训练于 γ_(train)=5 的模型在推理时切换到不同 γ :
| 方法 | γ=5 | γ=3 | γ=1 |
|---|---|---|---|
| Naive | MPJPE 4.62 / FID 14.05 | MPJPE 4.94 / FID 22.66 | MPJPE 8.98 / FID 78.20 / FVD 507.70(严重退化) |
| IBM | 稳定 | 稳定 | 轻微下降 |
| PDM | 最优 | 最优 | 最优(MPJPE 4.48 / FID 15.25 / FVD 60.97) |
- Naive 在 γ=1 时发生结构性崩溃,而 PDM 与 IBM 保持稳定,PDM 控制精度更高(图4、图6)。
2.5 跨模态定性比较
附录提供额外的可视化证据(图7-9):
- 姿态:PDM 生成的人体结构更一致;
- 深度:PDM 更好地保持深度引导的几何结构;
- 涂鸦:PDM 更忠实于稀疏线条引导,视觉质量更稳定。
3. 消融实验
3.1 条件方向权重 λ 的影响(表4)
在姿态控制上研究 PDM 中 λ 的取值:
| λ | MPJPE (All/Key) | PCK@0.2 (All/Key) | FID/FVD |
|---|---|---|---|
| 0(仅正分支) | 4.24 / 2.81 | 92.71 / 96.24 | 13.97 / 59.72 |
| 1(默认) | 4.27 / 2.75 | 92.71 / 96.38 | 13.83 / 58.65 |
| 3 | 4.36 / 2.95 | 92.08 / 95.77 | 13.33 / 61.79 |
| 10 | 4.49 / 3.07 | 91.60 / 95.35 | 12.96 / 56.91 |
- λ=1 在控制保真度(MPJPE、PCK)上取得最佳平衡;过大的 λ 会牺牲控制精度。
3.2 监督范围 K 的影响(表5)
在姿态控制上比较不同监督步数:
| K | MPJPE (All/Key) | PCK@0.2 (All/Key) | 训练时间 |
|---|---|---|---|
| 1 | 4.33 / 2.98 | 92.53 / 95.68 | ~23 s/step |
| 2 | 4.45 / 3.11 | 92.18 / 95.57 | ~38 s/step |
| 8 | 4.27 / 2.75 | 92.71 / 96.38 | ~132 s/step |
| 50(完整轨迹) | 4.65 / 3.14 | 91.34 / 95.25 | ~790 s/step |
- K=8 在控制精度和训练效率之间取得最佳权衡,被选为视频实验的默认配置。
实验总结
| 实验层级 | 核心目的 |
|---|---|
| 文本渲染 | 验证:共享负条件下,朴素匹配无害,无 NBA |
| 参考条件蒸馏 | 验证:特权负条件下,NBA 导致对抗性误差与 CFG 敏感性,PDM 可修复 |
| 视频控制主实验 | 验证:分支感知 OPD 在密集→稀疏知识迁移中的实用价值 |
| 指导尺度泛化 | 验证:PDM 对推理 CFG 变化的鲁棒性 |
| 消融( λ , K ) | 确定 PDM 的默认超参数与训练效率方案 |
Q: 有什么可以进一步探索的点?
基于论文的局限性与未竟问题,以下方向值得进一步探索:
1. 分支感知目标的理论刻画
PDM 与 IBM 在非退化权重下共享相同的分支级零损失解,但实验上 PDM 整体表现更优。目前这一优势是经验性的,缺乏优化动态层面的严格理论分析。未来工作可建立分支感知目标的收敛性理论,刻画 PDM 的“正预测 + 条件方向”参数化在优化 landscape 上相较于 IBM 的直接分支匹配具有何种结构性优势。
2. NBA 在其他引导机制与不对称条件下的扩展
当前 NBA 分析集中于 CFG 与特权负条件。可将其推广至:
- 其他引导范式:如基于分类器引导(Classifier Guidance)、无分类器引导的变体、或新近提出的学习式引导(learned guidance);
- 更广泛的教师-学生不对称性:例如正分支上的信息差异、多条件分支(multi-branch CFG)、或连续型条件 dropout 策略下的不对称设置。
3. 动态或自适应的方向匹配权重 λ
PDM 目前采用全局固定的 λ (默认 λ = 1 )。消融实验显示过大的 λ 会削弱控制精度。可探索:
- 时间步自适应:根据去噪阶段 t 动态调整 λ(t) ,例如在高噪声阶段更侧重方向匹配以稳定结构,在低噪声阶段侧重正预测匹配以精修细节;
- 任务自适应:基于当前控制模态或样本难度自动学习 λ 。
4. 与少步推理蒸馏的联合设计
现有工作(如 Consistency Models、DMD)将 CFG “烘焙”进单预测以实现少步生成。本文聚焦于保留分支接口的 OPD,未涉及步数压缩。可将 PDM 与步数蒸馏结合:在保留分支结构的同时,通过一致性约束或分布匹配实现单步/少步推理,从而在不牺牲 CFG 尺度鲁棒性的前提下加速采样。
5. NBA 严重程度的预测与诊断指标
当前需通过完整训练才能观测 NBA 是否发生。可开发先验诊断指标:
- 在训练前或训练初期,量化教师与学生负分支之间的“特权信息差距”;
- 建立该差距与 NBA 诱导的对抗性误差动态之间的定量关系,用于预判何种知识迁移场景必须采用分支感知监督。
6. 全量微调(Full Fine-tuning)下的验证
论文实验均在 LoRA 适配器设置下进行。全量微调会改变模型基底表示空间,可能改变正负分支误差的耦合方式。验证 PDM 与 IBM 在全量微调下的相对行为,有助于确定分支感知目标的适用范围与参数效率之间的权衡。
7. 跨模态与更复杂场景的应用
当前验证限于图像风格迁移与视频稀疏控制。可拓展至:
- 3D/4D 生成:教师拥有密集视角或深度监督,学生仅有稀疏输入;
- 多模态联合生成:如音频-视频协同生成中,某一模态的负分支包含另一模态的特权信息;
- 长视频与复杂运动:在更长时序、更剧烈运动的场景下,检验 K=8 的截断监督策略是否仍然充分。
8. 负分支信息的结构化利用
PDM 目前通过约束条件方向 d = v^+ - v^- 来避免负分支误差恶化,但并未显式利用教师负分支中的特权信息。未来可探索:
- 设计辅助任务或辅助损失,使学生从教师负分支的特权信号中间接获益(例如通过知识蒸馏或特征对齐),而非仅被动防止其干扰。
Q: 总结一下论文的主要内容
这篇论文围绕在策略扩散蒸馏(On-Policy Distillation, OPD)中分类器自由引导(Classifier-Free Guidance, CFG)的.branch-level 歧义性展开,识别了**负分支不对称(Negative Branch Asymmetry, NBA)**这一失败模式,并提出了相应的分支感知解决方案。以下是主要内容概括:
1. 研究背景与核心问题
现代扩散系统普遍采用 CFG 进行条件引导,其去噪速度由正、负分支组合而成:
v = γ v^+ + (1-γ) v^-
其中 γ 为引导尺度。在 OPD 中,一种自然的做法是让教师与学生直接匹配 CFG 组合后的速度:
L_(naive) propto |v_T - v_S|_2^2
论文指出,该目标在分支级别是欠识别(under-identified)的。设分支误差为 e^+ = vT^+ - v_S^+ 和 e^- = v_T^- - v_S^- ,则朴素目标仅约束:
γ e^+ + (1-γ) e^- = 0
这允许 e^+ 与 e^- 相互补偿,存在无穷多非零解对。当教师负分支包含学生无法获取的特权信息(如参考图像、密集控制信号)时,这种补偿自由度会导致对抗性优化动态:正分支误差下降的同时,负分支误差反而被放大。论文将这一现象定义为负分支不对称(NBA)。NBA 在训练尺度 γ(train) 下被掩盖,但在推理尺度变化时会暴露为严重的性能退化。
2. 方法:分支感知蒸馏目标
为解决分支歧义,论文提出在 CFG 组合之前分别进行监督。
2.1 Positive–Direction Matching (PDM)
PDM 同时约束正分支预测与 CFG 条件方向 d = v^+ - v^- :
ell(PDM) = |e^+|_2^2 + λ |d_T - d_S|_2^2 = |e^+|_2^2 + λ |e^+ - e^-|_2^2
当 ell(PDM) = 0 时,强制 e^+ = e^- = 0 ,彻底消除跨分支误差补偿。
2.2 Independent Branch Matching (IBM)
作为对照基线,IBM 直接匹配正、负分支并保留原权重:
ell_(IBM) = γ^2 |e^+|_2^2 + (γ-1)^2 |e^-|_2^2
IBM 同样移除了交叉补偿项,但其参数化方式与 PDM 不同。
2.3 高效视频监督
在密集到稀疏的视频控制中,论文采用截断轨迹监督:仅对学生去噪轨迹的前 K 个状态(如 K=8 ,总步数 N=50 )计算教师监督,显著降低训练成本。
3. 实验验证
3.1 图像域诊断:NBA 何时出现
- 文本渲染(共享负条件):教师与学生使用相同空文本。此时正、负分支误差联合下降,朴素匹配有效,无 NBA。
- 参考条件蒸馏(特权负条件):教师负分支保留参考图像,学生无法获取。此时朴素匹配与仅正分支训练均出现 NBA(正误差降、负误差升),PDM 则抑制了负分支恶化。推理尺度偏移时(尤其 γ=1 ),朴素学生出现显著风格漂移,而 PDM 紧密跟随教师。
3.2 密集到稀疏视频控制
基于 Wan-VACE 在姿态、深度、涂鸦三种控制模态上进行实验:
- 训练尺度下( γ=5 ):PDM 在控制保真度(MPJPE、PCK、CORR、F1 等)上全面优于朴素 OPD、SFT 和离策略蒸馏。
- 推理尺度泛化:将训练于 γ=5 的模型用于 γ=3 或 γ=1 时,朴素 OPD 发生严重结构崩溃与质量退化(如 γ=1 时 FID 从 14.05 升至 78.20),而 PDM 保持稳定。
3.3 消融研究
- 方向权重 λ : λ=1 在控制精度与视觉质量间取得最佳平衡。
- 监督范围 K : K=8 在效果与效率(约 132 秒/步)间最优,远快于全轨迹监督(约 790 秒/步)。
4. 主要贡献
- 识别 CFG-composed OPD 的分支歧义:证明仅匹配组合速度会在分支级别留下欠识别问题。
- 定义 NBA 失效模式:揭示当教师负分支包含特权信息时,朴素匹配会诱导正负分支误差的对抗性动态。
- 提出 PDM:通过分别监督正预测与 CFG 条件方向,恢复可识别的分支级监督,提升推理引导尺度的鲁棒性。
- 拓展到视频控制:在密集到稀疏的视频控制任务中验证分支感知 OPD 在姿态、深度、涂鸦模态上的有效性与稳定性。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Bingnan Li,Haozhe Wang,Haozhong Xiong,Fangtai Wu,Jinpeng Yu,Yang Shi,Jiaming Liu,Ruihua Huang
PDF URL: https://arxiv.org/pdf/2607.24731.pdf
Arxiv URL: https://arxiv.org/abs/2607.24731
Arxiv ID: 2607.24731
CoolPaper URL: https://papers.cool/arxiv/2607.24731
Published: 2026-07-29T01:08:04.370Z
Updated: 2026-07-29T01:08:04.370Z
6. StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents
Abstract:Computer-use agents are usually improved by strengthening perception: better models for reading a screenshot and choosing where to click. Yet a screenshot is only a lossy rendering of the underlying program state, e.g., the files, application backends, and DOM that hold the task data. Different states can produce the same pixels, while code can inspect and modify that state directly. StateAct is a code-first, multi-agent harness built around this distinction. Its main agent works directly with program state by using code, while a dedicated GUI subagent handles screenshot-and-click interaction on the few subgoals that need it, just 28 of 108 tasks and 1.1% of main-agent steps. The same direct access to program state also supports verification: an independent finish gate double-checks the saved result for structural failures, e.g., output that is missing, unsaved, or written to the wrong path. To stay on track over hundreds of steps, the main agent hands subgoals to fresh subagents, keeping its own context focused. On OSWorld 2.0, StateAct lifts Claude Opus 4.8 from 20.6% to 26.9% on binary success, and from 54.8% to 61.6% on partial success, at ~ 9x lower cost per task than the same model driven by screenshots alone; a code-only variant with no GUI subagent reaches only 45.9% partial, below that screenshot-based baseline’s 54.8%. In general, grounding action, verification, and memory in state, what we call state-grounding, shifts the main bottleneck from perception toward reasoning: failures depend more on what the agent thinks than on what it sees.
中文摘要
摘要:计算机使用代理通常通过增强感知能力来提升:为阅读截图和选择点击位置提供更好的模型。然而,截图只是底层程序状态的有损呈现,例如保存任务数据的文件、应用后端和 DOM。不同的状态可能产生相同的像素,而代码可以直接检查和修改这些状态。StateAct 是一个以代码为核心的多代理框架,围绕这种区别构建。其主要代理通过使用代码直接与程序状态交互,而专门的 GUI 子代理只处理少量需要截图和点击交互的子目标,仅占 108 个任务中的 28 个,以及主要代理步骤的 1.1%。对程序状态的直接访问同样支持验证:独立的完成门会对保存结果进行双重检查,防止结构性错误,例如输出缺失、未保存或写入错误路径。为了在数百步操作中保持进度,主要代理会将子目标交给新的子代理处理,从而保持自身上下文的集中。在 OSWorld 2.0 上,StateAct 将 Claude Opus 4.8 的二进制成功率从 20.6% 提升至 26.9%,部分成功率从 54.8% 提升至 61.6%,同时每个任务的成本比仅通过截图驱动的同模型低约 9 倍;而不包含 GUI 子代理的纯代码变体仅达到 45.9% 的部分成功率,低于基于截图的基线 54.8%。总体而言,将动作、验证和记忆根植于状态,即我们所称的状态根植,使主要瓶颈从感知转向推理:失败更多取决于代理的认知而非所见内容。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决长程计算机使用代理(long-horizon computer-use agents)过度依赖屏幕像素感知而导致的系统性瓶颈。具体而言,现有工作主要通过强化截图阅读能力(如更优的视觉模型、点击定位算法)来提升代理性能,但论文指出这一范式存在根本性局限:
1. 像素通道的固有损失性
- 截图( o(πx) = f(render)(s) )是程序状态 s 的非单射(non-injective)渲染,多个不同状态可能映射到几乎相同的像素。
- 例如,电子表格单元格显示的总值可能来自公式或字面量,相关行可能被隐藏或滚出屏幕,而截图无法区分这些任务关键差异。
- 在长程任务中,单步的轻微感知误差会在数百步依赖操作中累积为错误的交付物。
2. 验证困境
- 长程任务的最终评判标准是程序状态的持久化变更(如保存的文件、应用后端数据),而非屏幕截图。
- 截图无法提供关于最终产物是否正确完成、已保存、或写入正确路径的可靠信号,导致代理难以自我验证。
3. 长程执行的上下文漂移
- 在数百步的交互中,单一代理的上下文窗口会被过时的视觉细节填满,导致任务事实和计划逐渐丢失。
StateAct 的核心解决思路
论文提出 StateAct,一种以**程序状态(program state)**为主要接口的代码优先(code-first)多代理架构,其关键设计包括:
| 组件 | 功能 | 作用 |
|---|---|---|
| 主代理(Main Agent) | 直接通过代码(Bash、Python、文件编辑器、DOM查询)读写程序状态 | 消除像素中介的歧义,精确操作底层数据 |
| GUI 子代理 | 仅在遇到不可约的视觉子目标(如拖拽画布、处理非脚本化弹窗)时调用 | 覆盖状态通道无法触及的交互,仅在 1.1% 的主代理步骤和 28/108 任务中使用 |
| 完成门(Finish Gate) | 独立、 narration-blind 地重新读取持久化产物,检查结构性缺陷(缺失、未保存、路径错误) | 将验证扎根于真实状态而非代理自述 |
| 上下文管理 | 通过子代理委托、自动压缩、外部化计划清单维持长程聚焦 | 防止上下文溢出导致的长程记忆衰减 |
在 OSWorld 2.0 基准上,StateAct 将 Claude Opus 4.8 的二元成功率从 20.6% 提升至 26.9%,部分成功率从 54.8% 提升至 61.6%,同时将单任务成本降低约 9 倍(从约 72 降至约 7.8)。诊断分析表明,状态接地(state-grounding)将主要瓶颈从感知转移到了推理:代理的失败更多地取决于其思考内容,而非所见内容。
Q: 有哪些相关研究?
论文在第2节(Related Work)从三个维度梳理了相关研究,并在诊断分析中补充了关于验证偏见的讨论。以下按论文的分类体系归纳:
1. 基于屏幕感知的计算机使用代理(Grounding-based computer-use agents)
这类研究致力于强化代理对屏幕像素的感知与操作能力,代表了当前的主流范式:
- UI-TARS (Qin et al., 2025):原生GUI动作模型,专注于自动化GUI交互。
- Aguvis (Xu et al., 2024):统一的纯视觉代理,用于自主GUI交互。
- GTA1 (Yang et al., 2025a):通过测试时选择(test-time selection)优化GUI代理的感知-行动链路。
- Set-of-Mark (Yang et al., 2023):通过视觉提示增强大语言模型的视觉定位能力。
StateAct与这类工作互补,但反转了默认范式:它将程序状态作为主要接口,而将屏幕交互降级为少数场景下的委托回退。
2. 代码与混合动作空间(Code and hybrid action spaces)
这类研究探索以代码或可执行动作作为代理的操作空间,或尝试融合API与GUI控制:
- CodeAct (Wang et al., 2024):将可执行代码确立为代理的动作空间,使LLM通过代码行动。
- OSWorld原生动作空间:直接以Python via pyautogui作为操作接口。
- CoAct-1 (Song et al., 2025):采用多代理编排,将程序员角色与对等的GUI操作员配对。
- UltraCUA (Yang et al., 2025b) 与 ComputerRL (Lai et al., 2025):通过强化学习训练混合API/GUI动作空间。
- UFO2 (Zhang et al., 2025):融合统一的GUI–API层,支持桌面操作系统级别的代理执行。
- SWE-agent (Yang et al., 2024):主张代理应拥有为其专门构建的计算机接口,而非仅依赖通用GUI。
StateAct的架构区别在于默认路由策略:主代理保留代码/状态操作,仅将直接GUI控制委托给子代理;同时将同样的状态检查纪律扩展到验证环节。
3. 代理的自我验证(Self-verification for agents)
这类研究关注如何将验证扎根于系统状态,而非代理的自述轨迹:
- OpenComputer (Wei et al., 2026):使用硬编码的、按应用划分的状态验证器,与人类裁决更对齐。
- Agentic Reward Modeling (Cui et al., 2026):通过主动交互探测隐藏的系统状态进行验证。
- MCPWorld (Yan et al., 2025):通过后端仪器(backend instrumentation)进行验证。
- Reflexion (Shinn et al., 2023) 与 Self-Refine (Madaan et al., 2023):让代理反思自己的叙述轨迹,以自我一致性作为验证基础。
- Andrade et al. (2025):指出受叙述条件影响的判断器会被观察到的行为所偏见(agreement bias)。
StateAct的完成门(finish gate)设计上更接近演员-评论家分离或独立验收测试:它在终端边界执行一次全新的、独立的第三方检查,直接检查持久化产物,且完全不读取代理的叙述历史,从而规避叙述条件导致的偏见。论文明确指出,这种设计比Reflexion式的自我反思更适用于长程任务的结构性验证。
Q: 论文如何解决这个问题?
论文通过提出 StateAct 框架解决上述问题,其核心在于状态接地(state-grounding):将程序状态(文件、应用后端、DOM 等)而非屏幕像素作为代理的主要观察与操作接口。具体解决方案围绕三个互锁的组件展开。
一、核心原则:区分状态通道与像素通道
论文首先建立形式化区分。设程序状态为 s ∈ S ,像素通道为 o(πx) = f(render)(s) ,状态通道为 o(state) = g(s) (如 shell 命令、工作簿读取、DOM 序列化)。由于渲染映射 f(render) 不是单射(non-injective),不同状态可能产生相同像素;而状态通道在任务所触及的子状态上通常是可逆的。因此,StateAct 的默认假设是:
- **状态可寻址(state-addressable)**任务:直接通过代码读写底层状态;
- **混合(hybrid)**任务:以状态操作为主,仅在遇到不可约的视觉子目标时回退到 GUI;
- **纯渲染(render-only)**任务(如图像编辑、布局调整):保留屏幕交互,状态通道不提供额外优势。
二、基于状态的行动(Act on State)
主代理(Main Agent)的动作空间完全排除直接的鼠标/键盘控制,代之以代码和结构化操作:
- 核心工具:持久化 Bash、文件编辑器、只读图像查看器、计划清单、完成动作(finish)以及代理委托工具。
状态发现(State Discovery):代理结合先验知识(如邮件存储位置、Office 文档格式、浏览器配置文件路径)与主动探测(
find/ls/grep/sqlite3)来定位应用持久化状态的位置,但从不通过探测直接获取目标值。委托规则:仅在以下情形触发专用的 GUI 子代理(CUA specialist):
- 经探测后仍无文件/后端/DOM 路径可达目标;
- 交互效果只能通过渲染表达(如画布拖拽、非脚本化弹窗关闭、仅存在于屏幕上的值读取)。
实测中,GUI 子代理仅覆盖 28/108 个任务,占主代理步数的 1.1%。
- 浏览器子代理:负责网页交互,但采用 DOM 序列化为 Markdown 与 CSS 选择器点击,而非基于截图的坐标定位,从而将浏览器操作也“状态化”。
三、基于状态的验证(Verify on State)
长程任务的关键风险是代理自认为已完成,但产物未保存、路径错误或结构缺失。StateAct 引入独立的 Finish Gate(完成门) 进行终端验证:
- 触发条件:主代理调用
finish(仅在至少执行三步非 finish 操作后允许),最多支持 3 轮修正循环。 - 四大设计属性:
- 叙述盲(Narration-blind):Gate 的上下文仅包含原始任务指令与机器访问权限(Bash、文件读取、DOM 查询),完全屏蔽主代理的消息历史、计划、完成理由或预期值,防止被代理的“故事”说服。
- 状态接地(State-grounded):直接检查持久化产物(如日历存储文件、电子表格单元格公式、应用后端),而非通过 UI 间接推断。
- 反捕获(Anti-capture):Gate 必须独立定位任务指定的真实交付物;仅在代理自行创建的旁支文件中找到的证据会被拒绝。
- 有界修正(Bounded correction):若验证失败,Gate 向主代理返回具体缺陷描述,主代理修复后重新提交,最多 3 轮。
四、长程状态维持(Sustain State)
为应对长达数百步(主代理平均约 57 轮,加上子代理内部轮次总计约 155 轮/任务)的上下文压力,StateAct 采用三层记忆管理:
- 新鲜上下文专家(Fresh-context specialists):每次子代理委托在独立的上下文窗口中运行,仅向主代理返回简洁报告,使图像密集或探索性工作不污染主代理的状态模型。
- 自动压缩(Auto-compaction):接近上下文长度上限时,系统在 assistant 边界处对最旧前缀进行文本摘要,并剥离历史图像,在回收上下文预算的同时保留关键状态事实。
- 外部化计划(Externalized plan):任务清单持久化存储于消息历史之外,每轮重新注入,确保多部分任务的目标在压缩后仍能锚定。
五、边界与兜底机制
论文明确界定了状态通道的失效边界:当任务目标是纯粹视觉结果(如 WYSIWYG 输出、图表外观、图像编辑)时,渲染屏幕本身就是相关观测,此时 GUI 子代理作为必要的互补通道被精确调用。StateAct 并非完全摒弃视觉感知,而是通过架构级别的默认路由(主代理走状态,子代理走像素)将像素降级为少数不可约场景下的专用回退。
六、成效概要
在 OSWorld 2.0 上,该方案使 Claude Opus 4.8 的二元成功率从 20.6% 提升至 26.9%,部分成功率从 54.8% 提升至 61.6%,单任务成本从约 72 降至约 7.8(约 9 倍降低)。消融实验表明,移除状态行动(-act)后部分成功率降至 51.3%,甚至低于纯视觉基线(54.8%),证明状态接地本身是增益的首要来源,而非增加的代理层级深度。
Q: 论文做了哪些实验?
论文的实验围绕 OSWorld 2.0(108个长程桌面任务)展开,涵盖主结果、消融研究、跨基准迁移、故障诊断及子代理必要性分析。所有主要实验均以 Claude Opus 4.8 为骨干模型(除非特别说明),报告二元成功率(binary success)、平均部分得分(mean partial score)及单任务成本(USD)。
1. 实验设置
- 基准:OSWorld 2.0(长程真实计算机环境,最多 200 轮主代理预算)。
- 成本核算:区分主代理轮次与子代理内部轮次;StateAct 平均约 57 轮主代理 + 98 轮子代理内部轮次,总计约 155 轮模型轮次/任务。
- 对比基线:同一骨干的计算机使用代理(CUA)参考框架(Opus 4.8 ref.)、GPT-5.5、Opus-4.7、Sonnet-4.6 等公开轨迹。
2. 主实验结果(OSWorld 2.0)
- 整体表现(表 1、图 1、图 6):
- StateAct 将 Claude Opus 4.8 的二元成功率从 20.6% 提升至 26.9%(+6.3),部分成功率从 54.8% 提升至 61.6%(+6.8)。
- 单任务成本从约 72 降至约 7.8,降低约 9 倍。
- 在成本–准确率前沿(图 6)中,StateAct 位于唯一的“左上”区域:准确率高于所有公开基线,且成本低于绝大多数较强基线。
- 按能力分解(表 1、图 7):
- 在 10 个能力标签(如 multi-item state、cross-source、conflict disambiguation、visual-spatial 等)上逐层对比。
- StateAct 在 state-addressable 能力(multi-item state、cross-source、conflict disambiguation)上优势最大;在 render-only 能力(human-in-the-loop、multimodal editing)上优势最小,与理论预期一致。
- 轮次效率(表 2):
- StateAct 总计约 155 轮/任务,高于 Opus 4.8 参考(103 轮)和 GPT-5.5(95 轮),但显著低于 Sonnet-4.6(253 轮)、MiniMax M3(327 轮)和 GLM-5V(314 轮)。
3. 消融实验
(1)组件敏感性(表 3a): 通过从完整 StateAct 中逐一移除模块,定位增益来源:
| 配置 | 二元成功率 | 部分成功率 | 结论 |
|---|---|---|---|
| StateAct(完整) | 26.9% | 61.6% | 基准 |
| −verify(禁用 Finish Gate) | 23.1% | 57.5% | 验证模块有正向作用 |
| −sustain(关闭 plan/compaction) | 21.3% | 58.7% | 上下文管理有正向作用 |
| −act(主代理改用 GUI,禁用 CUA) | 18.5% | 51.3% | 状态接地是最大单一贡献,且低于纯视觉基线(54.8%) |
(2)委托深度(表 3b): 固定状态接地,比较三种代理层级结构(flat、worker recursion depth ≤ 2、nested self-recursion with own finish gate):
- Flat 委托(默认 StateAct)表现最优(61.6% 部分得分)。
- 递归变体仅触发于 7/108 个任务且从未嵌套,表现下降(57.6% 和 57.9%)。
- 结论:增益来自观察对象(状态而非像素),而非增加的代理层级深度。
4. 额外设计与跨基准实验(表 4、表 6)
(1)诊断性配置(表 4a):
- Bash-only:仅暴露 shell,无 GUI、子代理或 Finish Gate。部分成功率仅 45.9%,低于纯视觉基线(54.8%),证明仅有代码动作而无 GUI 兜底和验证门不足够。
(2)骨干网络迁移(表 4b):
- 在 Claude Sonnet 4.6 上,StateAct 将二元成功率从 8.3% 提升至 11.1%(部分得分 41.5% → 42.0%),证明状态接地对较弱骨干同样有效。
(3)短程基准验证(表 4c):
- 在 OSWorld-Verified(短程任务)上,StateAct(78.4%)与参考框架(77.3%)表现接近,符合状态接地的优势集中于长程任务的假设。
(4)GUI 子代理必要性(表 6): 跨 5 个基准比较使用 Claude Opus 4.8 vs. SFR-CUA(31B 内部紧凑模型)作为 GUI 子代理:
| 基准 | StateAct (Opus GUI) | StateAct (SFR-CUA GUI) | 纯 SFR-CUA |
|---|---|---|---|
| OSWorld-Verified | 81.9% | 81.1% | 66.9% |
| OSWorld 2.0 | 61.6% | 43.2% | 7.6% |
| WindowsAgentArena | 50.6% | 51.2% | 40.9% |
| AndroidWorld | 81.9% | 84.1% | 68.1% |
| MobileWorld | 70.1% | 68.4% | 48.7% |
- 在短程/移动基准上,紧凑 GUI 子代理即可胜任;但在 OSWorld 2.0(最难长程桌面任务)上,弱 GUI 子代理将性能拉低至 43.2%,证明最难长程任务仍需要前沿 GUI 模型作为视觉回退。
5. 失败分析(第 6 节)
(1)任务级根因审计(图 8): 对 79 个未获满分任务进行人工轨迹审计,归类主导失败原因:
- 推理错误(38 个):错误值、误读指令、错误选择、算术/公式错误等,占主导地位。
- 验证器漏检(14 个):Finish Gate 错误地通过了本可发现的结构性失败。
- 模态瓶颈/感知限制(18 个):音频、视频、实时交互或复杂视觉链超出能力。
- 指令歧义(4 个):存在多种合理解读。
- 其他(5 个):未充分分解。
(2)Finish Gate 运行特征(表 5、图 4):
- 在 79 个非完美任务中,76 个调用了 Finish Gate。
- Gate 正确拒绝了 8 个,错误通过了 68 个。
- 正确拒绝率:占所有拒绝的 88.9%(高精确率);占所有到达 Gate 的非完美任务的 10.5%。
- 重试转化:26.7% 的任务被重试,其中 21.4% 最终获得二元成功。
(3)验证器天花板(Verifier Ceiling):
- Finish Gate 能可靠捕获结构性缺陷(文件缺失、路径错误、格式不匹配、未保存),但无法独立裁决值正确性(value correctness)。
- 68/76 的通过任务属于“共同模式失败”:Gate 与主代理共享同一数据源和解释,无法发现推导过程中的数值错误。
- 论文明确指出,这是无真值标签(ground-truth-free)的通用验证器的内在天花板,而非叙述偏见(narration bias)。
6. 结论性实验发现
综合上述实验,论文得出以下关键结论:
- 增益来源:状态接地(state-grounding)是性能提升的首要驱动,而非代理层级深度或递归。
- 瓶颈转移:状态接地将主要瓶颈从感知(像素误读、坐标漂移)转移至推理(数值计算、任务理解、逻辑推导)。
- 成本–准确率协同:状态接地同时提高了准确率并降低了成本(输出 token 从 224K 降至 100K)。
Q: 有什么可以进一步探索的点?
基于论文的实验发现、诊断分析与架构设计,以下是可以进一步探索的研究方向,按问题层次与系统模块组织:
1. 突破值正确性验证的天花板
论文明确指出,Finish Gate 能可靠捕获结构性缺陷(文件缺失、路径错误、格式不匹配),但无法独立裁决值正确性(value correctness),导致 68/76 的非完美任务被错误放行(§6.1)。这是当前系统最硬的瓶颈。
- 专用验证器的自动化生成:OpenComputer(Wei et al., 2026)通过硬编码的按应用验证器实现了更强的值检查,但牺牲了通用性。未来可探索自动合成或检索任务专用验证程序(如根据任务指令自动生成断言、单元测试或数据不变量),在保持零 per-task 工程的同时逼近 oracle 级验证。
- 对抗性多路径推导:为规避主代理与验证器的共同模式失败(shared interpretation),可强制验证器使用不同的数据源、不同算法或甚至不同语义解释重新推导结果(例如用 SQL 查询替代 Python pandas 计算),从而暴露数值错误。
- 渐进式验证协议:将长程任务拆分为多个中间交付里程碑(intermediate deliverables),在每个里程碑引入轻量级状态检查,而非仅在终点验证,以局部化错误传播。
2. 将瓶颈从感知迁移到推理后的下一步
StateAct 将主要瓶颈从“看见什么”转移到了“如何思考”(§7)。失败审计显示,推理错误(错误取值、误读指令、算术/公式错误)占 79 个非完美任务中的 38 个(§6.1)。
- 测试时推理扩展(Test-time Scaling for State):当前主代理每步采取单一动作。可借鉴代码生成领域的 Best-of-N、过程奖励模型(PRM)或蒙特卡洛树搜索(MCTS),在状态操作空间中进行搜索与验证,利用状态通道的精确性来低成本评估中间状态。
- 状态感知的反思机制:论文刻意排除了基于叙述的反思(Reflexion),以避免叙述偏见(§2)。未来可探索状态差异驱动的反思:代理对比“预期状态变更”与“实际状态变更”(state diff),仅基于客观的结构化差异进行修正,而非基于自然语言自述。
- 长程算术与符号推导外置:对于电子表格公式、复杂条件筛选等高频错误源,可将计算委托给符号求解器(如 Z3、Wolfram)或类型化 DSL,而非完全依赖 LLM 的隐含推理。
3. 压缩纯渲染(Render-only)任务的性能差距
状态接地对**人类在环(human-in-the-loop)和多模态编辑(multimodal editing)**等纯视觉任务几乎无增益(§5.2, 图 7)。
- 视觉链的层次化状态提取:对于 WYSIWYG 编辑器、CAD 或幻灯片软件,可尝试逆向工程其文档格式(如解析
.pptx的 Open XML、CAD 文件的几何结构),将“外观”问题部分转化为可查询的状态问题,减少对原始像素的依赖。 - 像素-状态混合表征学习:训练专用编码器,将屏幕截图与同时可获取的部分状态(如 DOM、应用内部对象树)联合嵌入,使代理在必须依赖 GUI 时仍能从潜在状态约束中获益。
4. 自适应与轻量化的 GUI 子代理
论文发现,紧凑的 31B GUI 模型在短程/移动基准上与前沿模型等效,但在最难的 OSWorld 2.0 上显著拖累性能(§6.2, 表 6)。
- 难度感知的子代理路由:开发元策略(meta-policy),根据子目标复杂度(如任务长度、所需视觉链深度、历史失败率)动态选择 GUI 模型规格,以在成本与能力间自适应权衡。
- 通过 RL 蒸馏 GUI 回退策略:将前沿 GUI 模型在长程任务中的视觉子轨迹蒸馏到紧凑模型中,专门训练其处理 StateAct 主代理最频繁委托的那类视觉子目标(如弹窗处理、画布确认)。
5. 状态发现的自动化与标准化
当前主代理依赖模型先验与主动探测(find/ls/grep)来定位应用状态(§4.1),这一过程在长程任务中仍可能消耗大量轮次。
- 通用状态发现协议:构建跨桌面应用的模型上下文协议(MCP)式状态接口,为常见软件(邮件客户端、日历、Office 套件、CRM)提供标准化的状态查询端点,使代理无需猜测文件路径或数据库位置。
- 学习探测策略:将状态发现建模为部分可观察马尔可夫决策过程(POMDP),通过强化学习训练代理以最少探测命令最大化信息增益,而非依赖贪婪的
find/grep。
6. 长程上下文的更高效记忆机制
StateAct 通过自动压缩与外部化计划清单管理 200+ 轮上下文(§4.3),但仍有约 155 轮模型轮次/任务。
- 状态差异摘要(Delta Summary):在上下文压缩时,不仅压缩自然语言对话,更以结构化形式(如 git diff、JSON Patch)记录环境状态的关键变更,使代理能快速回溯到任意历史 checkpoint。
- ** episodic 记忆检索**:将过往子代理委托的结果、失败模式与修复方案存入向量记忆,供后续相似子目标直接检索复用,减少重复探测。
7. 扩展状态接地的模态边界
18 个非完美任务受限于音频、视频、3D/CAD 或实时交互等模态(§6.1, 图 8)。
- 非视觉状态的语义提取:为视频编辑任务提取时间线/关键帧结构,为音频任务提取波形元数据或转录文本,将这些“隐藏状态”纳入主代理的代码操作空间,而非仅依赖像素级播放控制。
8. 更严格的验证器集成架构
论文的 Finish Gate 是单点、单提示验证。可探索验证器集成:
- 多专家验证委员会:并行运行结构验证器(检查存在性与路径)、语义验证器(检查数据模式)、派生验证器(重新计算关键值),以多数投票或级联方式裁决。
- 反事实测试(Counterfactual Probing):验证器主动对持久化产物进行小幅破坏性修改并观察预期外效应,以确认代理是否正确理解了任务语义(例如故意移动文件看代理是否真正依赖该路径)。
Q: 总结一下论文的主要内容
该论文提出 StateAct,一种面向长程计算机使用代理(long-horizon computer-use agents)的代码优先(code-first)多代理架构。其核心论点是:程序状态(文件、应用后端、DOM 等)应替代屏幕截图,成为代理观察、行动与验证的主要接口,从而解决像素通道固有的信息损失、长程误差累积与验证不可靠问题。
1. 研究动机:像素通道的局限
现有代理主要通过强化屏幕感知(如视觉定位、点击预测)来提升性能。然而,截图只是程序状态 s 的一个有损、非单射渲染( o(πx) = f(render)(s) ):
- 不同状态可能产生相同像素(如单元格显示的总值可能来自公式或字面量,相关行可能被隐藏);
- 在长程任务中,单步的轻微感知误差会在数百步依赖操作中累积为错误交付物;
- 截图无法可靠验证最终产物是否已保存、路径正确、结构完整,因为任务的成功判据 G(s) 本质上是关于持久化状态的谓词,而非渲染图像的函数。
2. StateAct 架构
StateAct 围绕**状态接地(state-grounding)**构建,包含三个互锁组件(图 2):
(1)基于状态的行动(Act on State)
- 主代理的动作空间为代码与结构化操作(Bash、Python、文件编辑器、DOM 查询),不包含直接的鼠标/键盘控制。
- 主代理通过状态发现(结合先验知识与主动探测如
find/ls/grep)定位应用持久化状态,直接读写底层数据。 - 当子目标不可约地为视觉性(如画布拖拽、非脚本化弹窗、仅存在于屏幕上的值)时,委托给专用的 GUI 子代理;该子代理仅被调用在 28/108 个任务中,占主代理步数的 1.1%。
- 浏览器操作由专用 Web 子代理处理,其基于 DOM 序列化与 CSS 选择器,而非截图坐标。
(2)基于状态的验证(Verify on State)
- 独立的 **Finish Gate(完成门)**在主代理调用
finish后触发。 - Gate 完全不读取主代理的叙述历史、计划或推理,仅依据原始任务指令直接检查持久化产物(文件、后端存储、DOM 状态)。
- 具备四大属性:叙述盲(narration-blind)、状态接地、反捕获(拒绝旁支文件证据)、有界修正(最多 3 轮重试)。
(3)长程状态维持(Sustain State)
- 新鲜上下文委托:子代理在独立窗口运行,仅返回简洁报告,避免图像污染主代理上下文。
- 自动压缩:接近上下文上限时,对旧前缀进行文本摘要并剥离历史图像。
- 外部化计划:任务清单持久化于消息历史之外,每轮重新注入,锚定多部分目标。
3. 实验结果
在 OSWorld 2.0(108 个长程真实桌面任务)上,以 Claude Opus 4.8 为骨干:
| 指标 | Opus 4.8 参考(CUA) | StateAct | 变化 |
|---|---|---|---|
| 二元成功率 | 20.6% | 26.9% | +6.3 |
| 平均部分成功率 | 54.8% | 61.6% | +6.8 |
| 单任务成本 | ~ 72 | ~ 7.8 | ~9× 降低 |
- StateAct 是公开最优结果,且同时实现更高准确率与更低成本(图 6)。
- 按能力分解:在 state-addressable 能力(multi-item state、cross-source、conflict disambiguation)上优势最大;在 render-only 能力(human-in-the-loop、multimodal editing)上优势最小,符合理论预期(表 1)。
关键消融发现(表 3a):
- 移除状态接地(
-act,主代理改用 GUI)后,部分成功率降至 51.3%,甚至低于纯视觉基线(54.8%),证明状态接地是最大单一贡献。 - 改变代理层级深度(递归 vs. 扁平)对性能无显著提升,说明增益来自观察对象(状态而非像素),而非代理深度。
跨基准与骨干:
- 在较弱骨干 Sonnet 4.6 上同样有效(8.3% → 11.1% 二元)。
- 在短程基准 OSWorld-Verified 上与参考框架持平(78.4% vs. 77.3%),印证优势集中于长程任务(表 4)。
- 紧凑 GUI 子代理(31B)在短程/移动基准上可替代前沿模型,但在最难的 OSWorld 2.0 上显著拖累性能(43.2% vs. 61.6% 部分),说明极端长程任务仍需强视觉回退(表 6)。
4. 诊断、洞察与限制
失败分析(图 8)揭示:
- 推理错误(38/79 个非完美任务)占主导:错误取值、误读指令、算术/公式错误。
- 模态瓶颈(18)与指令歧义(4)构成硬边界。
- 验证器漏检(14)属于可改进的结构性问题。
验证器天花板(§6.1):
- Finish Gate 能高精确率地捕获结构性缺陷(文件缺失、未保存、路径错误),正确拒绝率达 88.9%。
- 但其无法独立裁决值正确性:主代理与 Gate 共享同一数据源与解释时,数值推导错误会同时复现。这是无真值标签的通用验证器的内在天花板。
5. 核心结论
StateAct 将长程计算机使用代理的主要瓶颈从感知迁移到了推理。状态接地(state-grounding)通过让代理直接操作和验证程序状态,消除了像素中介的歧义与累积误差,使失败更多地取决于“代理如何思考”而非“代理看到了什么”。然而,值正确性的验证仍构成开放挑战,是未来需要突破的关键方向。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yan Yang,Xiangru Jian,Ziyang Luo,Zirui Zhao,Yutong Dai,Ziji Shi,Hanshu Yan,Jun Hao Liew,Silvio Savarese,Junnan Li
PDF URL: https://arxiv.org/pdf/2607.22798.pdf
Arxiv URL: https://arxiv.org/abs/2607.22798
Arxiv ID: 2607.22798
CoolPaper URL: https://papers.cool/arxiv/2607.22798
Published: 2026-07-29T01:08:13.096Z
Updated: 2026-07-29T01:08:13.096Z
7. Data Pyramid for Embodied Manipulation
Abstract:Multimodal foundation models learned to see and to speak by consuming the whole internet. Embodied agents admit no such shortcut, since they require data that couple observations with physical states and actions. These signals can be provided, to varying degrees, by multiple data sources. In this work, we organize the embodied data ecosystem as a “pyramid” spanning five complementary sources: real-robot data, UMI-style data, egocentric and exocentric data, simulation data, and general vision-language data. We organize the pyramid around the tension between scalability and robot alignment, and further characterize each source in terms of data quality, diversity, reusability, and physical fidelity. We then analyze recent embodied foundation models through the lens of their data recipes, examining how different sources are selected, aligned, and mixed during pretraining. For embodied brain models, vision-language-action models, and world-action models alike, we relate data composition to capabilities in perception, reasoning, planning, action generation, and world prediction. We close by discussing six open challenges: building large-scale tactile datasets, collecting failure and recovery data, developing scalable data-collection pipelines, aligning actions across embodiments, leveraging egocentric data for dexterous manipulation, and designing principled data recipes for robot learning. We hope this work paves the foundation for the design of next-generation embodied systems.
中文摘要
摘要:多模态基础模型通过消费整个互联网学会了“看”和“说”。具身代理不允许这种捷径,因为它们需要将观察与物理状态和动作耦合的数据。这些信号可以在不同程度上由多种数据源提供。在这项工作中,我们将具身数据生态系统组织为一个跨越五种互补来源的“金字塔”:真实机器人数据、UMI 风格数据、以自我为中心和以外部为中心的数据、仿真数据,以及通用视觉-语言数据。我们围绕可扩展性与机器人对齐之间的紧张关系组织金字塔,并进一步从数据质量、多样性、可重用性和物理逼真度方面对每个来源进行特征描述。然后,我们通过数据配方的视角分析了近期的具身基础模型,考察在预训练过程中不同数据源是如何被选择、对齐和混合的。对于具身大脑模型、视觉-语言-动作模型以及世界-动作模型,我们将数据组成与感知、推理、规划、动作生成和世界预测能力联系起来。最后,我们讨论了六个未解决的挑战:构建大规模触觉数据集、收集失败与恢复数据、开发可扩展的数据收集流程、跨具身对齐动作、利用自我中心数据进行灵巧操作,以及为机器人学习设计有原则的数据配方。我们希望这项工作为下一代具身系统的设计奠定基础。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文试图系统性地解决具身基础模型(embodied foundation models)在训练数据层面的核心组织与利用问题。具体而言,其针对的问题可归纳为以下几个方面:
1. 具身数据缺乏系统化的生态组织
现有具身智能研究探索了多种监督来源(如真实机器人轨迹、人类演示视频、仿真数据、通用视觉-语言数据等),但这些来源在**可扩展性(scalability)与机器人对齐性(robot alignment)**之间存在根本张力,且各自在数据质量、多样性、可重用性和物理保真度上的差异尚未被系统梳理。论文指出,该领域长期缺乏一个能够统一描述、比较和整合这些异构数据源的类别级框架。
2. 异构数据的有效利用策略不明确
具身基础模型(包括具身大脑模型、视觉-语言-动作模型 VLA、以及世界-动作模型 WAM)在预训练中如何选择、对齐和混合不同来源的数据,其背后的数据配方(data recipes)尚未得到充分分析。例如:
- 如何将无动作标签的通用视频数据与有动作标签的机器人轨迹结合?
- 如何处理跨具身形态(cross-embodiment)的状态与动作表示差异?
- 如何平衡真实世界数据的高成本与仿真数据的可扩展性?
3. 数据特性与模型能力之间的关联未被充分建立
论文试图连接不同数据层的属性(如语义覆盖、时间结构、动作监督、物理保真度)与模型的具体能力(如感知、推理、规划、动作生成、世界预测),从而回答“何种数据贡献何种能力”这一问题。
4. 未来数据建设的开放挑战
论文进一步识别出当前数据生态中的关键缺口,包括:
- 大规模触觉数据的缺失;
- 失败与恢复轨迹(failure and recovery data)的不足;
- 跨具身动作对齐(cross-embodiment action alignment)的困难;
- 缺乏原则性的数据配方设计方法(principled data recipes)。
总结
该论文的核心目标是构建一个以**“数据金字塔”(Data Pyramid)**为统领的分类体系,将具身数据按可扩展性与机器人对齐性组织为五个互补层级(真实机器人数据、UMI 数据、自我中心/外中心数据、仿真数据、通用数据),并在此基础上从数据视角分析具身基础模型的训练范式,为下一代具身系统的数据设计提供理论基础和路线图。
Q: 有哪些相关研究?
根据论文内容,相关研究可围绕具身数据生态与具身基础模型两大主线展开,具体分类如下:
一、具身数据金字塔:五类互补数据源
1. 真实机器人数据(Real-Robot Data)
早期研究聚焦于特定任务的规模化采集,如抓取数据集 QT-Opt、Pinto and Gupta、RoboNet;后续扩展至多任务场景,代表性工作包括:
- RT-1、MT-Opt:大规模多任务真实机器人轨迹
- Open X-Embodiment:跨机构、跨平台的机器人数据聚合(覆盖22种具身形态,240万条轨迹)
- DROID、RoboMIND / RoboMIND 2.0、AgiBot World:涵盖单臂、双臂、移动操作、人形机器人等多样化设置
- RH20T、FMB、BridgeData V2:引入力/扭矩、触觉等多模态感知
2. UMI 风格数据(UMI-Style Data)
以 Universal Manipulation Interface (UMI) 为开端,通过手持式夹爪接口实现无机器人环境下的野外采集:
- FastUMI / FastUMI-100K、LEGATO:提升可移植性与规模化
- DexUMI、DexWild:扩展至灵巧手操作
- FreeTacMan、ViTaMIn、Touch in the Wild:融入触觉与力反馈信号
- HuMI / UMI on Legs:支持双臂、移动及人形平台
3. 自我中心与外中心数据(Egocentric & Exocentric Data)
通过可穿戴设备记录人类日常交互,提供真实物理与丰富多样性:
- EPIC-KITCHENS、Ego4D、Ego-Exo4D:大规模第一人称视频与多视角记录
- H2O、Assembly101、ARCTIC:提供手部姿态、物体6-DoF位姿等几何监督
- HoloAssist、EgoDex:结合眼动追踪、深度、IMU等多模态信号
- EgoVLA、EgoMimic:将人类视频重定向为机器人可执行动作
4. 仿真数据(Simulation Data)
利用物理引擎生成可扩展、带特权标签的机器人交互轨迹:
- 基础引擎:MuJoCo、Isaac Sim / Isaac Gym / Isaac Lab、SAPIEN、PyBullet、Genesis
- 操作基准:RLBench、Meta-World、CALVIN、LIBERO、ManiSkill2/3、RoboCasa
- 大规模合成数据集:MimicGen / DexMimicGen、DexGraspNet / DexGraspNet 2.0、InternData-A1/M1、RoboTwin
- 视觉-触觉仿真:Tactile Gym 2.0、TacSL、UniVTAC、Tac2Real
- 程序化生成:GenSim / GenSim2、RoboGen、ManiTwin:利用LLM自动生成任务、场景与演示
5. 通用视觉-语言数据(General Vision-Language Data)
为机器人模型提供语义、推理与空间感知先验:
- 视觉-语言对齐:LLaVA、ShareGPT4V、PixMo、LLaVA-OneVision
- 指代表达与分割:RefCOCO、SA-1B、ADE20K、PACO-LVIS、RoboPoint
- 3D场景理解:ScanNet / ScanNet++、Matterport3D、ARKitScenes、MMScan
- 物理与规划推理:CLEVRER、A-OKVQA、EgoPlan-IT、ALFRED
二、具身基础模型:三种主要范式
1. 具身大脑模型(Embodied Brain Models)
侧重感知、物理推理、记忆与高层规划,通常利用通用多模态数据与具身 grounding 数据预训练:
- PaLM-E、RynnBrain、HY-Embodied、Pelican-VL / Pelican-Unified
- 典型能力: affordance 理解、任务分解、空间-时序推理
2. 视觉-语言-动作模型(Vision-Language-Action Models, VLAs)
将VLM backbone扩展至机器人控制,直接生成可执行动作:
- 早期代表:RT-2(将动作离散化为token)、Octo、OpenVLA
- 扩散/流匹配策略:π0 / π0.5 / π0.7(流匹配)、RDT-1B / RDT2、Diffusion-VLA、GR-2、GR00T N1/N1.5/N1.6/N1.7、Being-H0 / Being-H0.5 / Being-H0.7
- 跨具身通用策略:Qwen-VLA / Qwen-RobotManip(语义动作槽)、UniDex、METIS、LingbotVLA / LingbotVLA 2.0
- 动作表示:离散token、连续扩散、流匹配(flow matching)、语义槽(semantic action slots)等
3. 世界-动作模型(World-Action Models, WAMs)
建模环境动态与动作后果,可作为学习仿真器、规划器或策略评估器:
- 世界模型基础:Dreamer 系列、DayDreamer、UniSim
- 视频生成式世界模型:Genie / Genie 3、GAIA-1、Cosmos / Cosmos 3、V-JEPA 2、DreamDojo
- 机器人世界-动作模型:GR-2、UWM、Motus、WorldVLA、LingbotVA / LingbotVA 2.0、GigaWorld-0 / GigaWorld-Policy、DreamZero
三、关键技术与方法的相关研究
| 技术方向 | 代表性研究 |
|---|---|
| 跨具身动作对齐 | Open X-Embodiment、METIS、Qwen-RobotManip、X-VLA、JoyAI-RA 0.1 |
| 人机动作重定向 | EgoMimic、EgoVLA、EgoScale、MotionTrans、DexMV、H-RDT、VideoDex |
| 人在回路数据增强 | DAgger、ThriftyDAgger、Fleet-DAgger、IntervenGen、CR-DAgger |
| 触觉感知 | HapTile、OmniViTac、EgoTouch、FEEL、Tac2Real、Taxim、TACTO |
| 失败与恢复数据 | RoboFail、RACER、FailSafe、Reflect、IntervenGen |
| Sim-to-Real | Domain Randomization、SIMPLER-Env、数字孪生(RoboTwin)、Tac2Real |
四、综述与基准
论文还引用了若干聚焦于特定子领域的综述与基准:
- VLA 模型综述(如从动作token化视角的调研)
- 世界模型综述(World model for robot learning)
- 3D/4D 世界建模综述
- 机器人学习基准:RoboVerse、The Colosseum、RoboEval、REALM、RMBench 等
这些研究共同构成了当前具身智能的数据与模型生态,而本文的数据金字塔正是在此基础上首次系统性地将异构数据源按照可扩展性与机器人对齐性进行层级化组织,并分析其支撑不同模型范式的内在机制。
Q: 论文如何解决这个问题?
该论文通过构建一个系统性的“数据金字塔”(Data Pyramid)框架,并在此基础上开展分层解析、模型映射与未来路径规划,来解决具身基础模型在数据组织与利用上的核心问题。具体解决方案可归纳为以下四个层面:
一、建立“数据金字塔”分类体系
论文提出将现有的具身数据生态系统组织为一个由五层互补数据源构成的金字塔,以**可扩展性(Scalability)与机器人对齐性(Robot Alignment)**作为两条主轴进行层级划分:
| 层级 | 数据类型 | 核心特征 |
|---|---|---|
| 顶层 | 真实机器人数据(Real-Robot Data) | 动作可直接执行,物理保真度最高,但采集成本极高 |
| 第二层 | UMI 风格数据(UMI-Style Data) | 通过手持式接口采集,保留末端执行器监督,摆脱机器人硬件束缚 |
| 第三层 | 自我中心/外中心数据(Ego/Exo Data) | 记录真实世界中的人类交互,多样性与物理保真度高,但存在人机形态差异 |
| 第四层 | 仿真数据(Simulation Data) | 可并行生成,带特权标签,规模可控,但受限于 sim-to-real 差距 |
| 底层 | 通用数据(General Data) | 网络级视觉-语言数据,语义与推理覆盖极广,但缺乏动作与物理接地 |
此外,论文引入四个补充维度对各层数据进行精细化刻画:
- 质量(Quality):有效性、一致性与任务相关性
- 多样性(Diversity):任务、场景、视角与交互模式的覆盖度
- 可重用性(Reusability):跨任务、跨具身、跨传感器的迁移能力
- 物理保真度(Physical Fidelity):对真实接触、动力学与反馈的还原程度
二、系统性的分层解析与数据构建方法
针对金字塔的每一层,论文提供了标准化的分析模板,系统梳理其采集基础设施、监督构造方式、规模演进与适用边界:
- 真实机器人数据:详尽对比脚本采集(Script)、遥操作(Teleoperation,包括示教、主从跟随、视觉遥操作等)与人在回路增强(Human-in-the-Loop)三种范式,并统计主流数据集在模态、规模与多样性上的演进。
- UMI 数据:追踪从原始 UMI 到 FastUMI、DexUMI、FreeTacMan 等系统的演进,分析其“相对轨迹动作表示”(Relative Trajectory Action Representation)与跨具身部署(Cross-Embodiment Deployment)机制。
- 自我中心/外中心数据:区分视觉传感、运动追踪与辅助传感(触觉、肌电、眼动)三类采集硬件,并归纳语义监督、几何监督、多模态监督与机器人导向监督四种后处理方式。
- 仿真数据:拆解仿真基础设施的三大耦合组件(具身-传感器系统、场景资产、物理与渲染后端),并分类讨论人工演示、规则执行、轨迹回放与自主策略生成四种合成轨迹生产方式。
- 通用数据:按功能划分为视觉-语言数据、分割与定位数据、3D 数据、规划数据、时序数据、物理推理数据与抓取数据,明确各类数据对感知、推理与规划的支撑作用。
三、数据-模型对齐:从数据配方到动作表示
论文进一步从**数据视角(data-centric perspective)**分析具身基础模型如何利用金字塔中的异构数据,将其分为三大模型族:
1. 具身大脑模型(Embodied Brain)
- 主要依赖无动作标签数据(通用视觉-语言数据、自我中心视频)建立物理世界理解、空间-时序推理与高级规划能力。
- 利用带动作标签数据(机器人轨迹、仿真回滚)提取 affordance、轨迹路点与任务结构,作为感知与执行之间的桥梁。
2. 视觉-语言-动作模型(VLA)
- 核心监督源为带动作标签的数据(真实机器人轨迹、UMI 数据、仿真数据)。
- 探讨了动作表示的演变:从早期离散动作 token(如 RT-2)到连续扩散策略(如 π_0 、RDT-1B),再到基于流匹配(flow matching)的生成(如 GR00T N1)。
- 提出利用自我中心人手视频扩展灵巧操作(dexterous manipulation)数据覆盖,通过人手重定向(retargeting)与视觉修复(hand inpainting)缓解人机形态差异。
3. 世界-动作模型(WAM)
- 采用两阶段训练策略:先用大规模无动作视频(通用视频、自我中心视频)预训练世界动态先验,再通过带动作标签的交互数据(机器人轨迹、仿真)进行动作条件化后训练。
- 区分了基于扩散/流匹配的连续动作去噪(如 Motus、Cosmos Policy)与基于自回归的离散动作 token 预测(如 WorldVLA)两种范式。
4. 跨具身动作空间对齐
为解决异构机器人数据联合训练时的动作空间不一致问题,论文系统总结了现有结构对齐与几何对齐策略:
- 结构对齐:
- 具身特定投影(Embodiment-specific projection)
- 固定维度零填充(Fixed-dimensional zero-padded action interfaces)
- 语义动作槽(Semantic action slots,如 Qwen-RobotManip 定义的 80 维标准状态-动作向量)
- 几何对齐:
- 机器人中心表示(Robot-centric)
- 相机中心表示(Camera-centric)
- 手腕中心表示(Wrist-centric)
四、识别开放挑战与未来方向
论文最后围绕“采集什么”“如何采集”“如何使用”三个问题,提出六个需优先解决的方向,以完善数据金字塔的实际效用:
- 触觉数据:构建大规模触觉数据集,弥补接触丰富操作(contact-rich manipulation)中的感知缺口。
- 失败与恢复数据:系统采集并标注失败轨迹、诊断原因与恢复策略,超越当前以成功演示为主的数据偏差。
- 可扩展采集 pipeline:降低对昂贵人工遥操作的依赖,发展自适应、分布感知的自动化采集系统。
- 跨具身状态-动作对齐:统一坐标系、标定参数与控制器元数据,实现异构数据在共享参考系下的聚合。
- 自我中心先验用于灵巧手策略:将人手视频作为结构化交互先验,结合形态条件策略与不确定性感知重定向,分离可迁移知识与具身相关执行细节。
- 原则性数据配方(Data Recipes):通过系统性消融实验,确定不同金字塔层级数据在预训练各阶段的最优配比与采样策略。
总结
该论文的解决方案并非提出单一算法或数据集,而是建立了一个涵盖分类、刻画、分析与前瞻的完整数据-centric 框架。通过“数据金字塔”将原本碎片化的具身数据生态结构化,并连接数据属性与模型能力,为下一代具身系统提供了从数据采集、对齐到训练配比的全链路设计基础。
Q: 论文做了哪些实验?
需要明确的是,这是一篇综述性论文(survey paper),其核心贡献在于对具身数据生态进行系统化的分类、回顾与分析,而非提出一种新算法并在基准上训练测试。因此,论文没有进行传统意义上的控制实验(如训练新的基础模型并报告成功率、泛化性能等数值结果)。
取而代之的是,论文通过以下几类数据驱动的分析与可视化来支撑其论点:
1. 数据规模演化的时序分析
图 2(Figure 2: Evolution of Data Scale)
- 对金字塔五层中代表性数据集的时间轴进行梳理,展示各类数据从早期到近期的规模增长趋势。
- 揭示了从2015年到2026年,真实机器人数据、UMI 数据、自我中心数据、仿真数据和通用数据在规模上的数量级跃升。
2. 具身基础模型“数据配方”的演进分析
图 3(Figure 3: Evolution of Data Utilization) 与 表 7(Table 7: Representative VLA and WAM approaches)
- 系统回顾了2023年至2026年间发布的代表性 VLA 和 WAM 模型(如 RT-2、π0/π0.5/π0.7、GR00T N1、Qwen-VLA、Motus 等)。
- 统计并标注了每个模型在预训练阶段使用了金字塔中的哪些数据源(真实机器人、自我中心、UMI、仿真、通用)。
- 分析出从早期依赖单一真实机器人数据,向近期**异构数据混合(co-training)**演变的趋势。
3. 动作轨迹多样性的空间分布可视化
图 4(Figure 4: Visualization of action-trajectory diversity)
- 选取了金字塔不同层级的代表性数据集(AgiBot-World-2026、RoboMIND、RoboMIND 2.0、Fast-UMI、EgoVerse、InternData-A1),在相似的初始配置下提取关键交互帧。
- 通过展示抓取与交互关键帧的三维空间分布,直观对比了各数据集在轨迹覆盖范围、空间分布密度和多样性上的差异。
- 例如:指出仿真数据集 InternData-A1 的动作关键帧高度集中,暗示其技能多样性不足;而 EgoVerse 的人类手部轨迹则呈现广泛的空间覆盖。
4. 各层级数据集的统计对比
论文通过多张表格对五层数据进行了大规模的统计梳理与属性对比:
- 表 1(Table 1):真实机器人数据集统计(涵盖时间、手臂类型、具身数量、轨迹数/时长、任务数、模态、标定、灵巧手、移动操作等)。
- 表 2(Table 2):UMI 数据集统计(涵盖手臂类型、任务数、末端执行器、演示数量、触觉感知等)。
- 表 3(Table 3):自我中心/外中心数据集统计(涵盖视角、时长/片段、模态、相机标定、手部姿态、3D 监督等)。
- 表 4 & 表 5(Table 4 & 5):仿真基准与大规模仿真数据集统计(涵盖具身配置、触觉、可变形物体、灵巧操作、移动操作、数据规模等)。
- 表 6(Table 6):通用数据集统计(按视觉-语言、分割/定位、时序、3D、规划、物理/失败推理、抓取等类别组织)。
5. 数据属性与模型能力的关联分析
在第 7 节(Data Applications in Embodied Foundation Models)中,论文进行了概念层面的映射分析:
- 将无动作标签数据(通用视频、自我中心视频)与具身大脑模型的感知、推理、规划能力相联系;
- 将有动作标签数据(机器人轨迹、仿真、UMI)与 VLA 的动作生成、WAM 的世界动态预测能力相联系;
- 总结了跨具身动作表示的三种结构对齐策略与三种几何对齐策略,并引用了现有文献中的设计选择作为例证。
总结
该论文的“实验”本质上是大规模、系统性的文献计量与数据集特征分析,而非训练模型的实证实验。其通过时间轴统计、空间可视化、多维度表格对比和数据-模型映射,为“数据金字塔”框架提供了经验证据,并揭示了当前具身数据生态的关键趋势与缺口。
Q: 有什么可以进一步探索的点?
基于该论文对具身数据生态的系统梳理,以下从数据采集、数据对齐、数据利用与数据评估四个维度,归纳可进一步探索的研究方向:
一、数据采集:填补感知缺口与扩展规模
1. 大规模触觉与力觉数据的标准化构建
当前数据金字塔在接触丰富操作(contact-rich manipulation)中存在明显的触觉感知缺口。未来研究可聚焦于:
- 开发低成本、模块化、无线化的可穿戴触觉采集系统(如指尖压力阵列、GelSight 风格视觉触觉传感器),支持野外大规模部署;
- 建立触觉数据的统一表示标准(如接触力分布、滑动信号、材料属性),解决现有数据格式碎片化问题;
- 构建视觉-触觉-力觉的多模态融合数据集,探索触觉信号与视觉观测在时空上的对齐与互补机制。
2. 失败与恢复轨迹的系统化 curation
现有数据集严重偏向成功演示,导致策略缺乏错误诊断与恢复能力。可探索:
- 设计失败感知的采集 pipeline,在遥操作或自主运行中自动检测失败前兆(pre-failure context),并记录完整的失败-诊断-恢复三段式轨迹;
- 构建细粒度的失败本体论(failure ontology),对失败类型(感知错误、规划错误、接触失败、累积误差等)进行因果标注;
- 研究从失败数据中学习**恢复策略(recovery policies)**的方法,如对比学习成功与失败轨迹、基于强化学习的错误修正等。
3. 自动化与自适应的数据采集范式
为降低对人工遥操作的依赖,可发展:
- **主动学习(active learning)**驱动的采集策略:模型主动请求对信息增益最大的状态-动作对进行标注;
- 自主探索与人在回路结合的混合采集系统(如 Fleet-DAgger 的扩展),利用策略 rollout 覆盖人类演示难以到达的状态分布;
- 基于 AIGC 的场景与轨迹合成,通过数字孪生(digital twins)或世界模型生成多样化的初始化配置与交互序列。
二、数据对齐:跨具身与跨模态的统一表示
4. 跨具身状态-动作对齐的几何与语义标准化
论文指出,简单聚合异构数据集并不保证兼容的监督信号。关键问题包括:
- 开展系统性的坐标系消融研究:对比机器人基座系(robot-centric)、相机系(camera-centric)与手腕系(wrist-centric)对跨具身迁移与数据缩放律(data scaling laws)的影响;
- 设计可学习的跨具身动作对齐模块:将不同机器人的动作映射到共享的潜在动作空间(latent action space),同时保留各平台特有的动力学约束;
- 建立数据集的元数据标准:将坐标约定、标定参数、控制模式等作为必备元数据,支持自动化的坐标变换与策略适配。
5. 人手到灵巧手的先验迁移
自我中心视频(egocentric video)是连接人类操作与机器人灵巧手的重要桥梁,但人机形态差异巨大。可研究:
- 形态感知(morphology-aware)的重定向:不仅映射手腕姿态,更考虑手指关节拓扑差异、运动范围约束与接触动力学;
- 视觉-动作联合域自适应:通过人手修复(hand inpainting)或机器人手渲染减少视觉分布偏移,同时保证物理一致性;
- 利用大规模人类视频(如 HumanNet、EgoScale)进行预训练-微调策略,明确人类交互先验在何种粒度(任务意图、接触序列、affordance、细粒度力控制)上可迁移。
三、数据利用:数据配方与世界模型
6. 原则性的数据配方(Data Recipes)设计
当前模型训练中的数据混合比例多凭经验,缺乏科学指导。亟待研究:
- 计算资源匹配的数据消融:在固定算力下,系统比较不同金字塔层级数据(通用视频、自我中心视频、仿真、UMI、真实机器人)的边际收益;
- 课程式与自适应数据混合:设计根据模型当前能力动态调整数据来源与采样权重的课程策略(curriculum mixing),例如早期多用通用数据建立语义基础,后期逐步增加真实交互数据精调动作;
- 数据价值量化:引入数据 Shapley 值或影响函数(influence functions),评估不同子集对下游策略性能的贡献。
7. 世界模型作为可扩展的数据引擎与评估器
世界模型(World Models)位于数据金字塔的反馈环路中,其作为仿真器的潜力尚未充分释放:
- 提升世界模型的物理一致性与动作可控性:解决当前生成视频中存在的视觉-动作错位、动态幻觉等问题;
- 开发基于世界模型的策略评估协议(如 WorldEval、RoboWM-Bench):在物理部署前利用世界模型预测策略成功率、鲁棒性与安全性;
- 探索生成式数据工厂(generative data factories):结合视频世界模型与逆向动力学,从少量种子数据大规模合成带动作标签的训练数据。
四、数据评估:质量、多样性与物理保真度
8. 具身数据集的多样性度量与质量评估
论文强调数据多样性比单纯规模更重要,但目前缺乏统一评估框架:
- 设计超越统计指标的功能性多样性度量:例如基于状态覆盖度(state coverage)、行为模式熵(behavioral entropy)或技能可组合性(skill compositionality)评估数据集;
- 建立物理保真度评分体系:量化仿真数据在接触动力学、摩擦、材料变形等方面与真实世界的偏差,并研究该偏差与 sim-to-real 迁移性能的相关性;
- 发展数据-策略共同评估范式:不仅评估数据集本身的属性,更直接衡量其对特定模型家族(VLA vs. WAM)的能力增益。
总结
这些方向共同指向一个核心目标:从“以规模为中心”的具身数据收集,转向“以信息覆盖、跨域对齐与高效利用为中心”的数据科学。其中,跨金字塔层级的数据配方优化、触觉与失败数据的系统整合、以及世界模型驱动的合成数据引擎,最具短期内产生突破性进展的潜力。
Q: 总结一下论文的主要内容
这篇综述论文系统性地回答了“应使用何种数据训练具身基础模型”这一核心问题,其主要内容可概括如下:
一、核心问题与动机
当前具身智能领域的数据来源高度异构,包括真实机器人轨迹、人类演示视频、仿真数据及通用视觉-语言数据等。这些数据在可扩展性与机器人对齐性之间存在根本张力,且缺乏统一的组织框架来指导采集、对齐与利用。论文旨在建立一个系统化的数据-centric 分析框架,以支撑下一代具身系统的设计。
二、数据金字塔(Data Pyramid)框架
论文提出以**可扩展性(Scalability)和机器人对齐性(Robot Alignment)**为两条主轴,将具身数据生态组织为从顶到底的五层金字塔:
| 层级 | 数据类型 | 核心权衡 |
|---|---|---|
| 顶层 | 真实机器人数据 | 动作可直接执行,物理保真度最高,但采集成本极高 |
| 第二层 | UMI 风格数据 | 通过手持接口采集,保留末端执行器监督,无需机器人在场 |
| 第三层 | 自我中心/外中心数据 | 真实物理与日常多样性丰富,但存在人机形态差距 |
| 第四层 | 仿真数据 | 可并行生成、带特权标签,但受限于 sim-to-real 差距 |
| 底层 | 通用视觉-语言数据 | 网络级规模与语义覆盖,但缺乏动作与物理接地 |
此外,论文引入四个补充维度对各层进行精细化刻画:质量(Quality)、多样性(Diversity)、可重用性(Reusability)和物理保真度(Physical Fidelity)。
三、各层级数据的系统梳理
论文对金字塔每一层进行了详尽回顾:
- 真实机器人数据:对比脚本采集、遥操作(示教、主从跟随、视觉/可穿戴遥操作)与人在回路增强三种范式;
- UMI 数据:追踪从单臂夹爪到灵巧手、双臂及触觉增强系统的演进,分析其相对轨迹表示与跨具身部署机制;
- 自我中心/外中心数据:区分视觉传感、运动追踪与辅助传感(触觉、肌电、眼动),并归纳语义、几何、多模态与机器人导向四类监督;
- 仿真数据:拆解仿真基础设施(具身-传感器系统、场景资产、物理渲染后端),并分类讨论人工演示、规则执行、轨迹回放与自主策略生成;
- 通用数据:按功能划分为视觉-语言、分割定位、3D 空间、规划、时序、物理推理与抓取数据,明确其对感知与推理的支撑作用。
四、数据在具身基础模型中的应用
论文从数据视角分析了当前三类主要模型范式:
- 具身大脑模型(Embodied Brain):主要利用无动作标签数据(通用视频、自我中心视频)建立物理世界理解与推理能力,辅以动作数据提取 affordance 与任务结构;
- 视觉-语言-动作模型(VLA):以带动作标签数据为核心,推动动作表示从离散 token(如 RT-2)向连续扩散/流匹配(如 π_0 、GR00T N1)演进,并开始大规模利用自我中心人手视频扩展灵巧操作;
- 世界-动作模型(WAM):通常采用两阶段策略,先用大规模无动作视频预训练世界动态先验,再通过动作条件化数据后训练,实现作为学习仿真器、规划器或评估器的功能。
同时,论文系统总结了跨具身动作对齐的策略,包括结构对齐(具身特定投影、零填充、语义动作槽)与几何对齐(机器人中心、相机中心、手腕中心表示)。
五、开放挑战与未来方向
论文围绕“采集什么”“如何采集”“如何使用”三个问题,提出六个优先方向:
- 构建大规模触觉数据集,弥补接触丰富操作中的感知缺口;
- 系统采集失败与恢复轨迹,超越成功演示的偏差;
- 发展可扩展、自适应的数据采集 pipeline,降低人工遥操作依赖;
- 实现跨具身状态-动作的几何与语义标准化对齐;
- 将自我中心视频作为结构化交互先验,优化人手到灵巧手的迁移;
- 建立原则性的数据配方(Data Recipes),通过系统性消融确定最优数据混合比例与采样策略。
六、总结
该论文的核心贡献在于构建了首个系统化的具身数据金字塔分类体系,将异构数据源按可扩展性与机器人对齐性层级化,并深入分析了各层数据的采集方法、监督构造、规模演进及其对具身大脑、VLA 与世界-动作模型的支撑机制,最终为具身智能领域的数据设计、整合与评估提供了统一框架与前瞻路线图。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yifan Ye,Yankai Fu,Yaoxu Lv,Bohan Hou,Jun Cen,Lingdong Kong,Duo Zheng,Tianxing Chen,Jiaming Liu,Ziang Cao,Yunfan Lou,Wei Chow,Xian Sun,Yingshuo Wang,Kuangzhi Ge,Xiaowei Chi,Xidong Zhang,Zhibo Pang,Yiwu Zhong,Sirui Han,Zhihe Lu,Weihao Yuan,Qifeng Chen,Michael Yu Wang,Yao Mu,Ziwei Liu,Jianfei Yang,Ping Luo,Shanghang Zhang
PDF URL: https://arxiv.org/pdf/2607.24744.pdf
Arxiv URL: https://arxiv.org/abs/2607.24744
Arxiv ID: 2607.24744
CoolPaper URL: https://papers.cool/arxiv/2607.24744
Published: 2026-07-29T01:08:21.729Z
Updated: 2026-07-29T01:08:21.729Z
8. Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification
Abstract:Diffusion transformers are essential for high-fidelity video generation, but long token sequences make attention a dominant inference bottleneck. Training-free dynamic sparse attention alleviates this bottleneck by computing only selected key-value blocks, yet existing methods struggle to sparsify attention both efficiently and accurately for two reasons: (1) Rigid, unpredictable, and costly routing: selecting a fixed fraction of top-ranked blocks by proxy score imposes fixed budgets, whereas retaining blocks to reach a target cumulative proxy probability mass yields dynamic but potentially imbalanced budgets; both incur non-negligible overhead from computing and materializing proxy scores. (2) Lossy keep-or-drop sparsification: unselected blocks are discarded entirely, degrading accuracy under aggressive sparsity. These limitations motivate cheaper dynamic-budget routing while limiting accuracy degradation. In this paper, we introduce training-free Sol-Attn (Sparsifying online attention), which unifies dynamic routing, sparse computation, and approximation correction in a single online-softmax pass, achieving a better accuracy-efficiency trade-off in sparse attention. The core of Sol-Attn is on-the-fly block thresholding with proxy-score reuse, which selects critical blocks by comparing block proxy scores against a threshold during online softmax. This design enables dynamic yet controllable block budgets without materializing the proxy map, while directly reusing the proxy scores of unselected blocks to approximate their contribution. Experiments across image and video generation tasks show that Sol-Attn advances the quality-efficiency frontier of training-free sparse attention, delivering 2.1 times and 2.3 times end-to-end speedups for video generation and editing, respectively, while preserving visual quality.
中文摘要
摘要:扩散变压器对于高保真视频生成至关重要,但长序列的令牌使注意力成为主要的推理瓶颈。无训练动态稀疏注意力通过仅计算选定的键值块来缓解这一瓶颈,然而现有方法在高效且准确地稀疏化注意力方面面临两大困难:(1) 刚性、不可预测且成本高的路由:通过代理分数选择固定比例的顶级块会强加固定预算,而保留块以达到目标累积代理概率质量则产生动态但可能不平衡的预算;两者都需要计算和实例化代理分数的不可忽略开销。(2) 有损的保留或丢弃稀疏化:未选择的块会被完全丢弃,在激进稀疏情况下会降低准确性。这些限制促使我们研究更经济的动态预算路由,同时限制准确性下降。在本文中,我们提出了无训练的 Sol-Attn(在线稀疏注意力),它在单次在线 softmax 计算中统一了动态路由、稀疏计算和近似校正,实现了稀疏注意力的更佳准确性-效率权衡。Sol-Attn 的核心是即时块阈值化与代理分数复用,它通过在在线 softmax 过程中将块代理分数与阈值比较来选择关键块。这一设计在不实例化代理图的情况下实现动态但可控的块预算,同时直接复用未选择块的代理分数以近似其贡献。在图像和视频生成任务中的实验表明,Sol-Attn 推进了无训练稀疏注意力的质量-效率前沿,在保持视觉质量的同时,为视频生成和编辑分别提供了 2.1 倍和 2.3 倍的端到端加速。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决基于Diffusion Transformer(DiT)的视频生成中,自注意力机制因长序列带来的二次计算复杂度所导致的推理瓶颈,并具体针对现有无训练动态稀疏注意力方法在路由效率与近似精度上的双重缺陷。
具体而言,论文识别并试图克服以下两个核心局限:
1. 路由机制僵化、难控且开销高昂
现有块稀疏方法通常依赖离线代理分数图(proxy score map)进行路由决策,主要采用两种策略:
- Top- k :为每个查询块强制保留固定数量的键值块,预算 rigid,无法适应不同查询块实际的注意力分布差异。
- Top- p :基于累积概率质量动态保留块,虽预算动态,但易受注意力分布集中度影响,导致不同查询块的保留数量严重失衡(例如 sink token 主导时可能保留极少块,分布弥散时保留过多)。
这两种策略均需在稀疏注意力计算前,在HBM中完整物化代理分数图与路由索引,在长序列下产生不可忽视的内存流量与延迟开销。
2. “保留或丢弃”式稀疏化造成信息损失
现有方法对未被路由选中的键值块采取完全丢弃(keep-or-drop)策略。即便这些块携带非平凡的注意力质量,其贡献也被归零。这导致在高稀疏度场景下,稀疏注意力与稠密注意力之间的近似误差急剧增大,显著降低生成质量。
核心目标
论文致力于回答以下问题:能否在实现低成本动态预算路由的同时,有效限制因丢弃块带来的精度退化?
为此,论文提出 Sol-Attn,通过在单一在线 softmax(online-softmax)核内融合基于阈值的动态路由、稀疏精确计算与代理分数复用近似校正,在不修改预训练权重、不物化完整代理图的前提下,达成更优的精度–效率权衡。
Q: 有哪些相关研究?
围绕该论文主题,相关研究主要分布在块稀疏注意力架构、动态路由策略以及带近似校正的稀疏注意力三个方向,此外还包括作为基准的高效稠密注意力实现。
1. 块稀疏注意力(Block Sparse Attention)
为降低注意力机制 O(L^2) 的二次复杂度,块稀疏注意力仅计算选定的键值块。现有工作大致可分为:
- 结构化静态稀疏:早期方法通过预设模式减少计算,如 Sparse Transformers
27
、Longformer
28
、Big Bird
29
;或利用内容哈希与分组,如 Reformer
30
、Routing Transformers
31
。 - 视频生成中的结构化稀疏:利用视频时空冗余设计固定稀疏掩码,包括 Sparse VideoGen
35
、Radial Attention
36
、Sliding Tile Attention
37
以及 Sparse-vDiT
38
。 - 视频生成中的内容自适应动态稀疏:运行时基于轻量级代理分数动态选择块,代表性方法有 Sparse VideoGen2 (SVG2)
8
、Faster Video Diffusion with Trainable Sparse Attention
39
、DFSAttn
40
和 FPSAttention
41
。 - 原生可训练稀疏架构:如 SeerAttention
32
、Native Sparse Attention
33
与 MoBA
34
,将压缩、选择与局部注意力整合到可训练的原生稀疏结构中。
2. 路由策略(Routing Strategies)
动态稀疏的核心在于如何高效地选择重要键值块。相关研究围绕重要性度量和筛选原语展开:
- Top- k 与 Top- p 及其组合:
- SpargeAttn
9
在 top- k 基础上引入置信度阈值,并结合 online-softmax-aware 阈值跳过可忽略更新。 - SpargeAttn2
42
取 top- k 与 top- p 掩码的并集以避免各自的失效模式。 - Twilight
43
先构建保守的 top- k 候选集,再用 top- p 剪枝。 - 替代性重要性度量:
- XAttention
10
利用反对角线求和作为块评分标准。 - VecAttention
44
保留与行最大值处于固定边距内的分数,并将比较操作融入瓦片化分数计算。 - 系统级搜索优化:
- 包括基于查询感知的页选择(QUEST
45
)、层次化剪枝
46
、上下文依赖稀疏模式
47
,以及基于学习语义哈希的 HashAttention
48
。
与上述方法不同,Sol-Attn 提出查询相关阈值路由,在 online-softmax 流式计算过程中即时应用阈值,无需在 HBM 中物化完整代理图。
3. 带校正的稀疏注意力(Sparse Attention with Correction)
为缓解“保留或丢弃”策略带来的信息损失,部分研究尝试近似恢复被忽略块的贡献:
- 基于泰勒展开的校正:PISA
11
对未选中块应用块级泰勒展开,将精确项与近似项统一于同一 softmax 的分子与分母中。 - 基于质心/协方差的线性补偿:SVG-EAR
49
采用基于质心的线性补偿并结合错误感知路由;BA-Att
50
引入协方差补偿的块近似。 - 稀疏-线性混合架构:SLA
51
为稀疏注意力分配关键权重,为线性注意力分配边缘权重;SLA2
52
在此基础上增加了可学习路由、加权稀疏-线性组合以及量化感知训练。
现有校正方法通常依赖于独立路由阶段构建的稀疏模式,或需要模型微调。Sol-Attn 的区别在于:从同一块分数瓦片同时派生路由与校正,在单一流式的 online-softmax 传递中完成,无需额外训练。
4. 高效稠密注意力基线
作为对比基准,FlashAttention 系列
12, 21, 22
通过 IO-Aware 的瓦片化 online-softmax 计算,在不改变算法输出的前提下降低 HBM 访问量,是评估稀疏方法加速比与精度损失的基准实现。
Q: 论文如何解决这个问题?
论文提出 Sol-Attn(Sparsifying online attention),通过将动态路由、稀疏精确计算与近似校正统一在单一的 online-softmax 流式核内,系统地解决了现有无训练稀疏注意力在路由效率与近似精度上的双重瓶颈。其方法论包含以下三个相互耦合的组件:
1. 查询相关阈值路由(Query-Dependent Thresholding)
针对传统 top- k 预算僵化、top- p 预算失衡且二者均需物化完整代理分数图的局限,Sol-Attn 采用基于轻量级统计量的阈值路由。
动态但可控的密度控制
对于第 i 个查询块,令其代理分数行 si 的均值与标准差分别为 μ_i 和 σ_i 。引入全局共享的标准化截断参数 β>0 ,定义查询相关阈值与选中集合:
τ_i = μ_i + βσ_i, quad S_i = j : s(ij) > τ_i.
在预训练视频模型中,聚合后的代理 logits 呈近高斯分布,因此 β 对应高斯上尾密度 rho_G(β)=1-Phi(β) ,可在模型层面校准整体稀疏度;同时每个查询块的保留块数 |S_i| 可随其自身分布自适应变化,兼具动态预算与可控性。避免物化代理图的高效统计量计算
关键观察在于 μi 与 σ_i^2 可直接由池化键(pooled keys)的一阶和二阶矩导出,无需先计算并存储完整的 N× N 代理分数图:
μ_i = Q_il((1) / (N)∑(j=1)^N K_jr)^top,
σi^2 = Q_il((1) / (N)∑(j=1)^N K_j^top K_jr)Q_i^top - μ_i^2.
该计算的时间复杂度为 O(Ld+Nd^2) ,辅助存储仅为 O(d^2) ,消除了长序列下代理图物化带来的 HBM 流量开销。
2. 即时稀疏化(On-the-Fly Sparsification)
为消除离线路由导致的非平凡延迟与中间张量存储,Sol-Attn 将阈值比较直接嵌入 online softmax 的瓦片化计算流程。
Chunk-wise 流式阈值判定
将长度为 N 的池化键序列划分为大小为 C 的 chunk。在第 t 个 chunk 上,查询块 Qi 即时计算 chunk-wise 代理分数:
s_i^((t)) = Q_i(K^((t)))^top ∈ R^(1× C),
并立即在芯片上(on chip)与阈值 τ_i 比较,得到 chunk-wise 选中集合 S_i^((t)) 。由于 S_i = ∪(t=0)^(T-1)S_i^((t)) ,该流式过程与全局行级阈值在数学上等价。嵌套循环结构
算法自然形成嵌套循环:外层循环:密集遍历池化键 chunk,完成路由决策与近似计算;
- 内层循环:仅对当前 chunk 中被选中的原始键值块执行精确注意力计算。
代理分数在产生的同时即被消费,无需将完整代理图或路由索引写入 HBM,从而将路由开销吸收进 online-softmax 的流水线中。
3. 代理分数重用与近似校正(Proxy-Score Reuse)
针对“保留或丢弃”策略在高稀疏度下的精度退化,Sol-Attn 对未选中块保留低成本的近似贡献,而非直接归零。
零阶泰勒近似
对于未选中的键值块 j ,利用其池化键 K_j 对块内指数分数矩阵做零阶展开:
exp(Q_i K_j^top) ≈ exp(Q_iK_j^top)odot 1,
其中 1 为 B× B 的全一矩阵(broadcast 自 B× 1 中心)。该近似以极低成本保留了被跳过块对 softmax 分子与分母的贡献。统一精确与近似的 Softmax 状态
令 Ui 为未选中块集合, V_j 为 V_j 沿 token 维度的求和。输出块 O_i 的逐行归一化基于如下联合分母与分子:
D_i := ∑(j∈U)i B·exp(Q_ibarK_j^top)(Approx.) + ∑(j∈S)_iRowSuml(exp(Q_i K_j^top)r)(Exact),
Ni := ∑(j∈U)iexp(Q_ibarK_j^top)V_j(Approx.) + ∑(j∈S)_iexp(Q_i K_j^top)V_j(Exact).
精确分支与近似分支更新同一个 online-softmax 状态(累积器、求和项与最大值),保证数值稳定性与计算统一性。
- 计算零开销重用
外层循环在计算近似项时,实际产生的是 token-to-block 分数瓦片:
S_i^((t)) := Q_i(K^((t)))^top ∈ R^(B× C).
该瓦片按列取均值即精确恢复 chunk-wise 路由分数 s_i^((t)) = Mean(S_i^((t))) 。因此,路由所需的代理分数与近似校正所需的指数分数源自同一份 on-chip 计算结果,实现了路由、稀疏计算与近似校正在单一 online-softmax 传递内的完全融合。
4. 硬件对齐的统一执行管线
上述设计被实现为单一 GPU kernel(见论文 Algorithm 1)。查询块与阈值驻留于共享内存,online-softmax 状态维护在寄存器中。外层循环流式加载池化键/值 chunk 以执行近似与路由;内层循环仅在路由命中时加载原始键值块。由于路由与近似共用同一份分数瓦片,端到端开销被降至最低——实验表明,相比独立路由的块稀疏注意力,近似校正仅引入不足 10% 的核级开销,而端到端延迟反而因避免了外部路由阶段而降低 6% 以上。
Q: 论文做了哪些实验?
论文围绕核级效率、生成质量与端到端加速、系统集成及消融分析四个层面展开系统实验,覆盖文生视频、视频编辑/细化、文生图等多类视觉生成任务。
1. 实验设置(Experimental Setup)
- 评测模型:
- 文生视频:Wan2.1-14B(720p, 81帧)、HunyuanVideo-13B(720p, 129帧)、LTX 2.3-22B(1080p, 两阶段 coarse-to-fine 流水线)。
- 视频到视频:Bernini-14B(视频编辑)、SANA-WM Refiner(一分钟草稿视频细化)。
- 文生图:Ideogram 4(原生 2K 分辨率)。
- 评测指标:
- 任务质量:VBench、Bernini-Bench、Qwen-Image-Bench、姿态精度(R.Err./T.Err./CMC)等。
- 与稠密注意力的一致性:PSNR、SSIM、LPIPS。
- 效率:端到端墙钟加速比(相对于 FlashAttention-3/4)。
- 对比基线:FlashAttention-3 (FA3) 作为稠密基线;训练-free 稀疏方法 XAttention (XAttn)、Sparse-VideoGen2 (SVG2)、PISA。
- 硬件与实现:NVIDIA H100/B200/RTX 5090 GPU,自定义 CUDA kernel,不同模型采用前 20% 步或前若干步稠密 warm-up。
2. Kernel 效率评估(Kernel Efficiency Evaluation)
- 加速比随序列长度与稀疏度变化(Figure 5a): 在 16K–128K token 范围、70%–90% 稀疏度下,Sol-Attn 的 kernel 加速比随序列长度与稀疏度单调提升,于 128K token 且 90% 稀疏度时达到 5.41× 。
路由延迟对比(Figure 5b): 在 LTX 2.3 与 Bernini 上,Sol-Attn 的 on-the-fly 阈值路由延迟分别比 top- p 快 32.7× 、比 top- k 快 11.5× ,因为无需在 HBM 中物化并全局遍历代理分数图。
峰值内存占用(Figure 5c): Sol-Attn 的注意力处理器峰值内存接近稠密注意力;而 SVG2 因路由结构与置换缓存需约 7.9× 的额外内存。
3. 视觉生成质量与端到端加速(Visual Generation Evaluation)
文生视频(Text-to-Video)
Table 1 报告了三个模型上的 VBench 质量、与稠密输出的相似度及端到端加速比。在匹配稀疏度(约 83%–90%)条件下:
- Wan 2.1:Sol-Attn 取得最优的 VBench 平均分(76.13)与相似度(PSNR 20.59),端到端加速 2.02× 。
- HunyuanVideo:端到端加速 2.12× ,质量与相似度均优于 XAttn、SVG2。
- LTX 2.3(两阶段,Sol-Attn 作用于 stage-2):stage-2 加速 2.4× ,整体加速 1.9× ;VBench 平均分 74.69,LPIPS 最低(0.1197),表明与稠密输出最接近。
视频到视频(Video-to-Video)
- SANA-WM 细化(Table 2):在 720p 一分钟视频细化任务中,Sol-Attn 在姿态精度(R.Err. 8.781, T.Err. 1.233, CMC 1.296)与稠密相似度(PSNR 17.72, SSIM 0.507)上均优于其他稀疏方法,端到端加速 3.04× 。
- Bernini 编辑(Table 3):在 Bernini-Bench 四项子指标(IF/VC/GQ/OS)上,Sol-Attn 均取得最优或次优,平均分最高(3.50/3.80/3.80/3.50),PSNR 达 30.18,加速 2.34× 。
文生图(Text-to-Image)
- Ideogram 4(Table 4):在 2K 分辨率、90% 稀疏度下,Sol-Attn 的 Qwen-Image-Bench 平均分(55.31)与稠密相似度(PSNR 21.26, SSIM 0.764)均优于标准 BSA 与 PISA,加速 1.56× 。
消费级 GPU 验证
- RTX 5090(Figure 6, Table 5):在 8K–64K token 范围,Sol-Attn 相对于 FlashAttention-4 的 kernel 加速随稀疏度提升;在 Wan2.1-1.3B 480p 生成上,取得 1.71× 端到端加速,PSNR/SSIM 优于 XAttn 与 SVG2。
4. 与 Sol-Engine 的系统集成(Integration with Sol-Engine)
为验证 Sol-Attn 与互补加速技术的兼容性,论文将其集成进全栈推理框架 Sol-Engine,在 NVIDIA B200 上逐步叠加 kernel 融合优化、扩散步缓存(diffusion-step caching)与 Sol-Attn(Figure 7):
- Wan2.1-14B:端到端延迟从 563.8 s 降至 161.8 s,综合加速 3.48× 。
- HunyuanVideo:端到端延迟从 866.9 s 降至 170.6 s,综合加速 5.08× 。
5. 消融实验(Ablation Study)
- 查询相关阈值路由的有效性(Figure 8): 在相同平均密度 15% 下,top- k 的每查询块密度固定为 15%;top- p 的密度分布宽泛且离散;而 Sol-Attn 的密度分布紧密集中于目标值附近,证明其在动态预算下仍保持稳定的密度控制。
近似校正的有效性(Figure 9): 在 32K 序列长度、70%–90% 稀疏度下,对比“仅精确(Exact-only)”与“精确或近似(Exact-or-approx)”。随着稀疏度增加,标准稀疏注意力的相对 ell_2 误差快速累积、余弦相似度下降;而 Sol-Attn 的近似校正持续降低误差并维持更高余弦相似度,优势随稀疏度增大而扩大。
统一执行管线的延迟分解(Figure 10): 在 32K 序列长度、10%/15%/20% 精确密度下,与 cuDNN BSA 对比:
- Kernel 级:Sol-Attn 因融合近似校正,仅比 BSA 慢 9.4% 、 3.9% 、 1.6% 。
- 端到端:Sol-Attn 因避免了独立路由阶段,反而比 BSA 快 6.2% – 6.6% ,证实 on-the-fly 路由在完整管线中近乎零开销。
6. 补充定性结果(Appendix C)
论文附录提供了额外的可视化对比,涵盖:
- Wan 2.1、HunyuanVideo、LTX 2.3 上的文生视频样例;
- Bernini 视频编辑与 SANA-WM 视频细化的条件生成样例。
在全部样例中,Sol-Attn 与稠密注意力在视觉质量上无明显可察差异,与定量指标一致。
Q: 有什么可以进一步探索的点?
基于论文的技术路线与结论部分的讨论,以下几方面值得进一步探索:
1. 面向新一代硬件的 Kernel 极致优化
论文指出当前 B200 实现尚未充分挖掘 Blackwell 架构的潜在性能。未来可围绕异步执行、Tensor Memory Accelerator (TMA) 的更高效使用、以及 FP4/FP8 低精度单元与稀疏计算的协同设计展开深度优化,以逼近理论峰值吞吐。
2. 从训练无关(Training-Free)到可训练稀疏(Trainable Sparsity)
Sol-Attn 当前为纯推理加速设计,不涉及梯度计算。若将其统一执行管线扩展至反向传播,使阈值路由与近似校正均可微,则可在微调或从头训练阶段联合优化稀疏模式与模型权重,有望突破当前精度–效率边界,并适配特定数据分布。
3. 向自回归(Autoregressive)视频/序列生成扩展
现有评估局限于双向扩散模型。自回归视频生成(如 AR World Models)采用因果掩码,且对 KV-Cache 极度敏感。将 on-the-fly 阈值路由与近似校正适配到因果注意力及增量式 KV-Cache 场景,需要重新设计 chunk-wise 扫描顺序与在线 softmax 状态维护机制,是一个高价值但具挑战性的方向。
4. 更高阶的近似校正与自适应近似策略
当前采用零阶泰勒展开保留未选中块的贡献。理论上可引入一阶甚至二阶中心矩项,以进一步降低高稀疏度下的近似误差。更进一步的探索是自适应近似:根据块内 token 分布的异质性(heterogeneity)动态选择零阶、一阶或精确计算,而非统一采用零阶。
5. 跨层、跨头、跨时间步的联合稀疏调度
论文中层与头独立执行路由决策。未来可探索层间稀疏度的协同分配(如深层语义层允许更高稀疏度,浅层保留更多计算),或利用扩散去噪步的连续性实现跨步路由缓存与重用,减少冗余计算。
6. 与结构化稀疏/线性注意力的混合架构
Sol-Attn 可与全局结构化稀疏(如局部窗口、膨胀模式)或线性注意力(Linear Attention)结合,形成“关键块精确计算 + 远场线性近似 + 尾部零阶补偿”的多级层次化注意力,在极长序列(如分钟级乃至小时级视频)上实现次二次乃至近线性的复杂度。
7. 动态阈值分布建模的精细化
当前假设代理分数服从近高斯分布并使用统一 β 。若实际分布呈现多峰、重尾或偏态特征,可引入更轻量的在线分布拟合(如基于滑动窗口的百分位数估计或核密度估计),使阈值更精准地匹配当前激活的动态特征,提升极端查询块的路由鲁棒性。
8. 与模型压缩、量化的全栈协同
稀疏计算与量化正交。探索 Sol-Attn 的近似分支在 INT8/FP8 甚至更低精度下的数值稳定性,以及精确分支与近似分支是否可采用混合精度,有望与现有量化加速方案(如 FPSAttention)叠加,实现更高倍率的实际墙钟加速。
9. 理论化的误差界与最优稀疏预算分配
论文给出了零阶近似的误差上界(Appendix B)。未来可基于该误差界建立端到端生成质量的显式保证,并推导在给定 FLOPs 预算下最优的块级稀疏度分配策略,使稀疏注意力从启发式方法迈向可证明的近似算法。
Q: 总结一下论文的主要内容
该论文针对扩散 Transformer(DiT)视频生成中自注意力的二次复杂度推理瓶颈,提出了一种无训练的动态稀疏注意力方法 Sol-Attn(Sparsifying online attention)。其核心内容与贡献可概括如下:
1. 研究背景与动机
随着高分辨率、长时长视频生成需求的增长,DiT 中的 token 序列长度显著增加,导致自注意力成为推理主导瓶颈。现有无训练动态块稀疏注意力方法存在两个尖锐局限:
- 路由机制僵化且开销高昂:top- k 强制固定预算,无法适应不同查询块的注意力分布差异;top- p 虽动态,但预算受概率分布集中度影响而严重失衡。两者均需在 HBM 中完整物化代理分数图与路由索引,引入非平凡的内存与延迟开销。
- “保留或丢弃”式稀疏化损失信息:未选中的键值块被完全丢弃,在高稀疏度下显著 degrade 生成精度。
2. 核心方法
Sol-Attn 将动态路由、稀疏精确计算与近似校正统一在单一流式的 online-softmax GPU kernel 内,避免物化中间代理张量,主要包含三个技术组件:
- 查询相关阈值路由(Query-Dependent Thresholding)
基于观察到预训练模型中块代理 logits 呈近高斯分布,论文提出利用每行代理分数的均值 μi 与标准差 σ_i 构建动态阈值:
τ_i = μ_i + βσ_i,
其中 β 为全局共享的标准化截断参数,用于控制整体稀疏密度。该策略既保留了查询级别的动态预算,又通过 β 实现了模型级的密度标定。关键的是, μ_i 与 σ_i^2 可通过池化键(pooled keys)的一阶与二阶矩直接解析计算:
μ_i = Q_il((1) / (N)∑(j=1)^N K_jr)^top,
σi^2 = Q_il((1) / (N)∑(j=1)^N K_j^top K_jr)Q_i^top - μ_i^2,
从而以 O(Ld+Nd^2) 时间、 O(d^2) 辅助存储获得阈值,无需物化完整的 N× N 代理分数图。
即时稀疏化(On-the-Fly Sparsification)
在 online softmax 的 chunk-wise 扫描过程中,查询块边计算代理分数 s_i^((t)) = Q_i(K^((t)))^top 边与阈值 τ_i 在片上比较。选中的块立即被派发至内层循环进行精确注意力计算;未选中块则进入近似分支。代理分数在产生的同时即被消费,无需存储完整代理图或路由索引。代理分数重用与近似校正(Proxy-Score Reuse)
对于未选中的键值块,Sol-Attn 并不直接丢弃,而是利用已计算的 token-to-block 分数瓦片,通过零阶泰勒展开近似其指数分数矩阵的贡献:
exp(Q_iK_j^top) ≈ exp(Q_iK_j^top)odot 1.
精确分支与近似分支更新同一个 online-softmax 状态(累积器、求和项与行最大值),将路由、稀疏计算与校正融合为单一算子。该瓦片的列均值即复用于路由判定,实现了计算零开销重用。
3. 实验验证
论文在文生视频、视频编辑/细化、文生图等多类任务上进行了系统评估,主要结果包括:
- Kernel 效率:在 NVIDIA H100 上,于 128K token 且 90% 稀疏度时实现 5.41× 的 kernel 加速;on-the-fly 阈值路由延迟较 top- p 降低 32.7× ,较 top- k 降低 11.5× ;峰值内存占用接近稠密注意力,显著低于现有方法(如 SVG2 需约 8× 额外内存)。
- 生成质量与端到端加速:
- 文生视频:在 Wan2.1-14B、HunyuanVideo-13B 与 LTX 2.3-22B 上,Sol-Attn 在匹配稀疏度下取得最优或次优的 VBench 分数与稠密参考相似度(PSNR/SSIM/LPIPS),端到端加速达 2.02× – 2.4× (stage-2)。
- 视频到视频:Bernini-14B 编辑任务加速 2.34× ,SANA-WM 一分钟视频细化任务加速 3.04× ,均优于对比的稀疏方法。
- 文生图:Ideogram 4 的 2K 生成上实现 1.56× 加速,Qwen-Image-Bench 与相似度指标领先。
- 系统集成:将 Sol-Attn 融入 Sol-Engine 并与扩散步缓存、kernel 融合等技术叠加,在 B200 上实现 Wan2.1-14B 的 3.48× 与 HunyuanVideo 的 5.08× 端到端加速。
- 消融分析:查询相关阈值路由的密度分布较 top- p 显著更稳定;近似校正在高稀疏度下有效降低相对 ell_2 误差并维持更高余弦相似度;统一执行管线因避免了独立路由阶段,端到端延迟反而低于分离式实现。
4. 结论与局限
Sol-Attn 通过将阈值路由与近似校正嵌入 online-softmax 的流式计算,消除了传统方法中独立路由阶段的开销与信息损失,在无训练前提下显著推进了稀疏注意力的质量–效率边界。论文同时指出,当前实现尚不支持反向传播与训练,且未覆盖自回归视频生成场景;未来工作将面向 Blackwell 架构进一步优化 kernel、扩展至可训练与自回归设定。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Haopeng Li,Yitong Li,Junsong Chen,Tian Ye,Haozhe Liu,Jincheng Yu,Duomin Wang,Ruihua Zhang,Zeke Xie,Enze Xie,Song Han
PDF URL: https://arxiv.org/pdf/2607.24027.pdf
Arxiv URL: https://arxiv.org/abs/2607.24027
Arxiv ID: 2607.24027
CoolPaper URL: https://papers.cool/arxiv/2607.24027
Published: 2026-07-29T01:08:29.777Z
Updated: 2026-07-29T01:08:29.777Z
9. OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation
Abstract:Recent generative models are moving beyond silent video or standalone audio synthesis toward the joint generation of synchronized audio and video. Despite this progress, jointly generating audio and video with fine-grained cross-modal correspondence remains challenging due to their fundamental structural differences. Most existing methods use audio and video VAEs trained separately. As a result, the two latent spaces lack cross-modal alignment, leaving the downstream generative model to learn cross-modal synchronization from scratch. We present OmniVAE, a jointly trained audio-video VAE that learns fine-grained semantic alignment between audio and video latent representations. Beyond reconstruction, OmniVAE uses a segment-level audio-video contrastive objective to capture temporal-semantic correspondence and align the two latent spaces. In parallel, it distills features from pretrained modality-specific semantic encoders into each modality, improving the downstream learnability of both latent spaces. Extensive experiments show that both objectives consistently improve the learnability of the latent spaces, translating into higher generation quality and more accurate cross-modal synchronization in downstream text-to-audio-video generation. These findings underscore the importance of learning unified representations as a foundation for omnimodal modeling.1
中文摘要
摘要:近期的生成模型正从静默视频或独立的音频合成,向同步音视频的联合生成发展。尽管取得了一些进展,由于音频和视频在结构上的根本差异,实现具有细粒度跨模态对应的音视频联合生成仍然具有挑战性。大多数现有方法使用分别训练的音频和视频 VAE。因此,这两个潜在空间缺乏跨模态对齐,导致下游生成模型必须从零学习跨模态同步。我们提出了 OmniVAE,一种联合训练的音视频 VAE,可学习音频和视频潜在表示之间的细粒度语义对齐。除了重建之外,OmniVAE 使用分段级别的音视频对比目标来捕捉时间-语义对应并对齐两个潜在空间。同时,它将从预训练的特定模态语义编码器中提取的特征蒸馏到每个模态中,提高两个潜在空间的下游可学习性。大量实验表明,这两个目标都能持续提高潜在空间的可学习性,从而在下游文本到音视频生成中实现更高的生成质量和更准确的跨模态同步。这些发现强调了学习统一表示作为全模态建模基础的重要性。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文试图解决联合音频-视频生成中潜在空间的跨模态对齐问题,具体表现为以下两个核心挑战:
1. 独立训练的模态特定VAE导致潜在空间缺乏跨模态对应关系 现有音频-视频生成系统通常依赖独立训练的音频VAE和视频VAE。这种分离式训练使得两个潜在空间在语义和时间维度上未经过显式对齐,跨模态的细粒度对应关系(如特定视觉事件与对应声音的时间同步)完全依赖于下游生成器从零学习。这不仅增加了生成器的负担,也使得精确的音频-视频同步变得尤为困难。
2. 重建目标无法保证潜在空间的语义结构与可学习性 传统VAE仅以重建(及对抗)损失为目标,其潜在空间缺乏显式的语义结构组织。对于需要同时生成视频和同步音频的下游任务而言,这要求生成器既要建模各模态的数据分布,又要自行发现跨模态的时间-语义关联,导致联合生成质量受限,尤其在细粒度时间同步方面表现不足。
为应对上述问题,论文提出 OmniVAE,通过以下方式直接在tokenizer层面嵌入跨模态对齐:
- 引入段级音频-视频对比目标(segment-level audio-video contrastive objective),在共享嵌入空间中对齐细粒度时间片段,使潜在表示 intrinsic 地编码时间同步信息;
- 引入模态特定语义蒸馏(modality-specific semantic distillation),利用冻结的预训练编码器为各模态潜在空间注入语义结构,提升其独立可学习性。
这两个训练目标仅在训练阶段生效,不增加推理开销,旨在为下游联合生成模型提供一个既保留重建能力、又具备跨模态对齐的统一表示基础。
Q: 有哪些相关研究?
该论文的相关工作围绕以下三个维度展开:
1. 多模态统一表示(Multimodal Unified Representation)
此类研究旨在将不同模态组织于共同的语义坐标系中,使语义对应的内容能够跨模态直接关联。实现方式可分为两类:
- 全局对比方法:如 CLIP、ImageBind、LanguageBind 等,通过对比学习将异构模态对齐到共享的语义空间中。
- 离散表示学习:追求模态无关的离散编码,以支持跨模态迁移。
- 时间同步方法:如 SyncNet 和 Synchformer,显式学习音频与视频之间的细粒度时间对应关系。
局限性:上述方法主要面向判别任务设计,未针对原始信号的重建进行优化,因此不能直接作为生成模型的潜在空间使用。OmniVAE 旨在弥合这一差距,在保留可解码性的同时建立细粒度跨模态对齐。
2. 音频与视频 Tokenizer(Audio and Video Tokenizers)
现代潜在生成模型依赖 tokenizer 将高维原始信号压缩为紧凑的潜在表示:
- 视频侧:连续 VAE(如 Wan-VAE、Movie Gen VAE)通过时空下采样将像素映射为连续潜在。
- 音频侧:神经编解码器与连续 VAE(如 DAC、Stable Audio VAE、Qwen-Audio-VAE)起到类似作用。
语义增强的 Tokenizer:
- 视觉侧:VA-VAE、REPA-E 等通过预训练视觉编码器的特征对齐来增强潜在空间的语义结构;RAE 直接复用预训练基础编码器;UniTok 和 VTP 则联合优化重建与语义预训练。这些工作表明,语义结构对视觉潜在空间的可学习性至关重要。
- 音频侧:SpeechTokenizer 和 MOSS-Audio-Tokenizer 将语义学习整合到音频 token 化过程中。
局限性:现有语义 tokenizer 均为模态特定的,仅独立改进各模态的表示,未建立跨模态的对应关系。OmniVAE 首次在语义 token 化中同时实现模态特定语义蒸馏与段级跨模态潜在空间对齐。
3. 音视频联合生成(Audio-Video Generation)
该领域旨在联合合成语义一致且时间同步的视频与音频:
- 早期框架:MM-Diffusion 提出耦合的双 U-Net 扩散结构;AV-DiT 将这一思想扩展至 Diffusion Transformer(DiT)骨干。
- 工业级系统:如 Sora 2、Veo 3、Seedance 2.0,已实现大规模原生音视频同步生成。
- 开源方案:
- 双塔/双流架构:JavisDiT、Ovi、LTX-2、MOVA 等通过分层时空同步先验或双向跨模态注意力耦合视频与音频生成骨干。
- 外部同步特征注入:MMAudio 和 HunyuanVideo-Foley 将 Synchformer 提取的帧级视觉特征作为外部条件,通过 AdaLN 或门控时间调制注入生成器,显著提升同步精度。
现有系统的共性问题:这些方法的音视频潜在均由独立预训练的 VAE 产生,跨模态对应关系必须由下游生成器从零学习,或通过外部条件特征显式注入。OmniVAE 的动机在于将跨模态对应关系直接构建到 tokenizer 层面,使下游联合生成器操作于已内在编码了对应关系的潜在空间之上。
Q: 论文如何解决这个问题?
论文通过提出 OmniVAE 解决该问题,其核心思路是在保留独立音频/视频编解码器与重建能力的前提下,于训练阶段显式地将模态特定语义结构与细粒度跨模态时间对应关系嵌入潜在空间。具体解决方案包含以下方面:
1. 整体架构设计
OmniVAE 保留独立的视频 VAE 与音频 VAE,二者在推理时不产生交互,因此可独立或联合部署:
- 视频分支:将输入 x_v ∈ R^((1+T)× H × W × 3) 编码为潜在表示 z_v ∈ R^(C_v × T_v × (H/8) × (W/8)) ,其中 T_v = 1 + T/4 ;
- 音频分支:将 48 kHz 波形 x_a ∈ R^(1× L) 编码为 1D 潜在 z_a ∈ R^(C_a × T_a) ,其中 T_a = L/d_a 。
在此基础之上,训练阶段引入两个互补目标:段级音视频对比学习与模态特定语义蒸馏。
2. 段级音视频对齐(Segment-Level Audio-Video Alignment)
该目标旨在使音视频潜在表示在细粒度时间尺度上 intrinsic 地编码跨模态对应关系,从而降低下游生成器学习同步的负担。
2.1 段表示聚合
通过模态特定的聚合路径,将异构的潜在空间映射为共享 d 维空间中的时序段特征序列(共 S 段):
- 视频侧:对 z_v 先进行空间聚合(使用轻量级 Transformer)得到帧级特征,再经时间池化与投影得到段特征 u_v^(i,s) ∈ R^d ;
- 音频侧:对 z_a 沿时间维度变换并池化,得到段特征 u_a^(i,s) ∈ R^d 。
其中 i 为样本索引, s ∈ 1,dots,S 为时间分段索引。
2.2 层次化负样本构建
为学习细粒度时间判别能力,论文利用“源视频–片段–段”三级层次结构构建负样本池。对于锚定段 (i,s) ,其正样本为另一模态的对应段,负样本集 N_(i,s) 包含:
- 片段内负样本(Intra-clip):同一片段内的其余 S-1 个段;
- 兄弟片段负样本(Sibling-clip):同一源视频中时间不相交的其它片段的段;
- 跨视频负样本(Cross-video):分布式批处理中来自无关源视频的段。
默认配置下采用约 2:2:1 的比例(47 个片段内、48 个兄弟片段、24 个跨视频),以兼顾时间判别精度与语义多样性。
2.3 双向 InfoNCE 对比损失
定义相似度 sim(i,s,j,t) = u_v^(i,s) · u_a^(j,t) (余弦相似度),候选集 P(i,s) = (i,s) ∪ N_(i,s) 。视频到音频的 InfoNCE 损失为:
L(v to a) = -(1) / (BS) ∑(i=1)^(B) ∑(s=1)^(S) log exp(sim(i,s,i,s)/τ)∑((j,t)∈P)(i,s) exp(sim_(i,s,j,t)/τ)
其中 τ 为可学习温度参数。音频到视频的损失 L_(a to v) 对称定义。最终对齐损失为:
L(avclip) = (1) / (2)(L(v to a) + L_(a to v))
3. 模态特定语义蒸馏(Modality-Specific Semantic Distillation)
为使各潜在空间在独立模态上更易被下游生成器建模,论文将冻结的预训练语义编码器知识蒸馏至各分支。
3.1 教师模型选择
采用 Qwen3-Omni 的冻结视觉编码器与音频编码器作为教师,分别覆盖图像/视频与一般音频/语音场景。
3.2 特征蒸馏机制
通过轻量级投影器将 VAE 潜在映射至教师特征的通道维度与时间分辨率:
- 视频侧:首个因果潜在帧对齐教师图像特征,其余帧对齐视频特征;投影器使用卷积与平均池化,并对教师特征进行空间归一化以强调局部变化;
- 音频侧:使用 1D 卷积投影器。
在每一对齐位置 j ,对投影后的潜在 z_j 与教师特征 f_j 施加 sigmoid-余弦损失:
L(cos) = -(1) / (|J|) ∑(j ∈ J) log σ!(cos(z_j, f_j))
其中 J 索引视频的时空位置或音频的时间位置。由此分别得到视频蒸馏损失 L(vd) 与音频蒸馏损失 L(ad) 。
4. 联合训练目标与策略
4.1 损失函数
视频与音频 VAE 的联合目标分别定义为:
Lv = λ(vr)L(vr) + λ(vd)L(vd) + λ(avclip)L_(avclip)
La = λ(ar)L(ar) + λ(ad)L(ad) + λ(avclip)L_(avclip)
其中 L(vr) 、 L(ar) 为重建损失(视频侧含 L1、LPIPS、KL;音频侧含波形、多分辨率 mel、KL),系数通过损失量级加权平衡。
4.2 三阶段训练调度
- 阶段 1:独立预训练两个 VAE,仅使用重建目标(含对抗监督),使模型获得基本重建能力;
- 阶段 2:引入对比对齐与语义蒸馏,移除判别器以节省显存,联合训练两个 VAE;
- 阶段 3:冻结音频编码器,仅以阶段 1 的损失微调音频解码器(恢复对抗与特征匹配监督),消除阶段 2 中因移除判别器导致的轻微电子伪影,同时保持已对齐的潜在空间不变。
5. 下游生成验证
为验证潜在空间的有效性,论文将训练后的 OmniVAE 冻结作为 tokenizer,在其上构建文本到音视频(T2AV)生成模型。该模型采用流匹配(flow matching)训练,先分别预训练视频生成分支与音频生成分支,再通过轻量级交叉注意力桥接进行联合训练。实验表明,相较于独立训练的 VAE,OmniVAE 显著提升了生成质量与音视频同步精度。
Q: 论文做了哪些实验?
论文围绕 重建质量保持、潜在空间对齐探测、下游文本到音视频(T2AV)生成性能 及 关键设计消融 四个维度展开实验,具体包括以下内容:
1. 实验设置与基线配置
实验在约 23M 音视频片段 上进行,数据经过去噪、同步过滤与事件检测,并配有视觉、音频及统一音视频三种文本描述。为隔离各目标的贡献,论文构建了四种渐进式训练配置作为基线:
- Recon:仅模态特定重建损失,两 VAE 独立训练;
- Recon+Distill:增加语义蒸馏,仍独立训练;
- Recon+AVCLIP:增加段级音视频对比损失,联合训练;
- OmniVAE(完整模型):联合训练,同时启用重建、蒸馏与对比目标。
2. 重建质量评估(§4.2)
验证对比与蒸馏目标是否损害 VAE 的基本重建能力。
- 视频重建:在 UCF-101 与 Panda-70M 上评估,指标包括 PSNR、SSIM、LPIPS、L1、rFVD。
- 结果显示,增加蒸馏与对比目标后,视频重建指标与纯重建基线基本接近,未出现显著退化。
- 音频重建:在 LibriSpeech(语音)、AudioSet(一般音频)、MUSDB18(音乐)上评估,指标包括 SIM、STOI、PESQ、Mel 距离、STFT 距离、ViSQOL。
- 语义蒸馏基本保持重建质量;对比对齐导致轻微下降,但 OmniVAE 整体仍与外部先进音频 VAE(如 HunyuanVideo-Foley VAE)相当或更优。
3. 音视频同步探测(§4.3)
作为下游联合生成的高效代理任务,论文在 VGGSound-Sparse (VGS-Sp) 上执行时间偏移预测:将音频偏移 N × 0.2 秒后,训练轻量级头部分类 21 个偏移类别( -2 至 +2 秒)。
- 评估指标:A@1、A@5、A@1tol( ± 1 类容差)。
- 实验协议:
- Frozen:仅训练分类头,冻结 VAE;
- +ft:同时微调对比聚合器。
- 结果:对比学习(AVCLIP)带来主要增益;完整 OmniVAE 在两种协议下均取得最佳同步精度(Frozen 下 A@1 达 20.2%,+ft 下达 22.3%)。
4. 下游文本到音视频生成(§4.4)
将各 VAE 配置冻结后训练统一的 T2AV 模型,在 Verse-Bench(含 Set1-I、Set2-V、Set3-TED 三个子集)上评估,并取最后三个检查点的平均结果。
- 跨模态对齐指标:
- 时间同步:DeSync ↓ 、LSE-C ↑ (唇同步);
- 语义一致性:Video-Audio Sim ↑ 、Text-Audio Sim ↑ 。
- AVCLIP 变体在此类指标上持续领先,OmniVAE 综合最优。
- 视频质量指标:Aesthetic ↑ 、MusiQ ↑ 、ManiQA ↑ 、Motion Score ↑ 。
- AVCLIP 提升视觉美学,蒸馏提升 MusiQ 与 ManiQA。
- 音频质量指标:Inception Score ↑ 、KL Divergence ↓ 、Fréchet Distance ↓ 、Speech WER ↓ 。
- 蒸馏与 AVCLIP 各自改善音频质量,二者结合效果最强。
- 音频美学指标(AudioBox):Content Enjoyment ↑ 、Content Usefulness ↑ 、Production Complexity ↓ 、Production Quality ↑ 。
- OmniVAE 在所有四项上均优于各消融基线。
训练过程动态(图 2)进一步表明:AVCLIP 配置在所有同步指标上始终领先,而完整 OmniVAE 在音频质量与美学上达到最佳权衡。
5. 消融实验(§4.5)
5.1 对比池大小与时间粒度(§4.5.1)
在 VGS-Sp 同步探测上,论文消融了视频帧率、片段时长与段长度对 A@1 的影响:
- 提高帧率(如 24 fps)、延长片段时长(如 8 秒)或采用更细粒度段(如 0.17 秒)均显著扩大负样本池,从而提升同步探测准确率;
- 段长度本身在评估范围内相对稳定,最终采用 24 fps、8 秒片段、0.17 秒段 的默认配置。
5.2 重建与对齐的损失平衡策略(§4.5.2)
联合训练中重建损失与对比损失量级差异大,论文比较了三种平衡策略:
- 损失量级加权(Loss-magnitude weighting);
- GradNorm(以最后一编码器层为代理的梯度归一化);
- 不确定性自适应加权。
通过段检索准确率(Intra A@48 / Overall A@64)衡量对齐强度,同时监测音频 STOI/PESQ 与视频 PSNR 衡量重建质量。结果表明,三种策略重建质量相近,但损失量级加权在段检索上显著优于后两者,因此被采纳为默认策略。
Q: 有什么可以进一步探索的点?
基于论文的实验发现与讨论,以下几个方向值得进一步探索:
1. 更大规模的数据与模型验证
论文在约 2300 万音视频片段上验证了 OmniVAE 的有效性,但结论部分明确指出需在更大规模上进一步验证。未来工作可探索:
- 在十亿级音视频数据上训练,观察跨模态对齐与语义蒸馏的收益是否持续或出现新的瓶颈;
- 将方法扩展至更大容量的 VAE 骨干网络,检验对齐目标在高维潜在空间中的稳定性。
2. 更细粒度与更高效的跨模态对齐机制
当前采用**段级(segment-level)**对比学习,时间粒度约为 0.17 秒。未来可研究:
- 帧级或事件级对齐:超越固定长度分段,针对视觉事件起始点与音频 onset 进行精确对齐,以捕捉更瞬时的跨模态关联;
- 动态负样本挖掘:当前层次化负样本为手工设计(固定比例),可引入难例挖掘或自适应负样本选择,提升对比效率;
- 非对称对齐策略:音频与视频的信息密度与时间分辨率本质不同,探索自适应聚合策略(如基于注意力机制的可变长段聚合)可能更优。
3. 模态特定语义蒸馏的深化
论文使用冻结的 Qwen3-Omni 编码器进行单模态蒸馏,未来可在以下方面改进:
- 多教师蒸馏:融合多个预训练视觉或音频编码器(如 CLIP、DINO、ImageBind)的互补语义,避免单一教师偏见;
- 层次化语义监督:在不同网络深度匹配不同抽象层级的教师特征,而非仅在单一高层特征上对齐;
- 可学习教师适配:探索轻量级可训练适配器替代固定投影器,使教师知识更灵活地注入 VAE 潜在空间。
4. 多模态甚至全模态(Omnimodal)扩展
OmniVAE 目前聚焦于音视频两个模态。向三模态及以上(如加入文本、深度图、动作信号)扩展时,将面临:
- 如何设计多向对比目标,避免模态对数量随模态数平方增长带来的计算与优化难题;
- 是否应引入一个共享的语义枢纽(hub)(如语言空间),以星型拓扑连接所有模态,而非两两对齐。
5. 与下游生成器的端到端联合优化
论文将 OmniVAE 冻结后训练下游 T2AV 模型。未来可探索:
- VAE 与生成器的协同训练:在生成任务上端到端微调 OmniVAE,使潜在空间进一步适应生成模型的动力学;
- 跨模态生成指导:利用 OmniVAE 已对齐的潜在空间,设计更轻量的生成器架构(如减少显式跨模态注意力层),降低联合生成的计算成本。
6. 长视频与长程时间一致性
当前训练基于 8 秒片段,负样本构造也局限于片段级别。对于长视频生成(分钟级),需研究:
- 如何在保持细粒度段级对齐的同时,建模长程时间依赖(如音乐结构与视觉叙事的宏观对应);
- 是否需要引入分层潜在表示( coarse-to-fine latent hierarchy),分别处理局部同步与全局结构。
7. 离散跨模态 Tokenizer 的探索
OmniVAE 采用连续 VAE。借鉴离散表示学习(如 VQ-VAE、SpeechTokenizer)的最新进展,可探索:
- 离散音频-视频联合码本:学习跨模态共享或对齐的离散码本,直接支持跨模态转译(audio-to-video 或 video-to-audio);
- 离散化是否有利于与自回归生成模型或大型多模态语言模型对接。
8. 音频重建与对齐的联合优化
论文 Stage 3 需要单独微调音频解码器以消除电子伪影,说明当前联合训练对音频感知质量仍有轻微损害。未来可研究:
- 设计不牺牲对抗训练的内存高效联合训练方案,例如梯度检查点、可逆网络或解耦判别器更新;
- 探索对音频重建更友好的对齐损失形式(如基于感知损失而非纯对比损失的对齐)。
Q: 总结一下论文的主要内容
该论文提出 OmniVAE,一种面向联合音频-视频生成的变分自编码器,旨在将细粒度跨模态对齐与模态特定语义结构直接嵌入潜在表示空间。以下是论文的主要内容总结:
1. 研究背景与核心问题
现有音视频联合生成系统通常依赖独立训练的音频 VAE 与视频 VAE。这种分离式训练导致两个潜在空间缺乏显式的语义与时间对应关系,下游生成器必须从零学习跨模态同步,难以实现高质量的细粒度音视频对齐。此外,传统 VAE 仅以重建为目标,其潜在空间缺乏语义组织,不利于生成模型学习。
2. 方法概述:OmniVAE
OmniVAE 保留独立的视频编码器-解码器对与音频编码器-解码器对,推理时两模态无交互,可独立或联合部署。在训练阶段,除了标准的重建目标外,引入两个仅训练时生效的互补目标:
2.1 段级音视频对比对齐
通过将异构的音视频潜在映射至共享的 d 维嵌入空间,对时间对应的段特征进行双向 InfoNCE 对比学习。
- 段特征聚合:视频潜在 z_v 先经空间聚合(轻量 Transformer)得到帧序列,再池化为段特征 u_v^(i,s) ∈ R^d ;音频潜在 z_a 经时序聚合直接得到段特征 u_a^(i,s) ∈ R^d 。
- 层次化负样本:对锚定段 (i,s) ,负样本同时来自同片段其余段(intra-clip)、同源视频不相交片段(sibling-clip)及跨视频样本(cross-video),以强化时间判别力与语义多样性。
- 双向 InfoNCE 损失:
L(v to a) = -(1) / (BS) ∑(i=1)^(B) ∑(s=1)^(S) log exp(sim(i,s,i,s)/τ)∑((j,t)∈P)(i,s) exp(sim(i,s,j,t)/τ)
其中 sim(i,s,j,t) = uv^(i,s) · u_a^(j,t) 为余弦相似度, P(i,s) 包含正样本与三级负样本。总对齐损失为 L(avclip) = (1) / (2)(L(v to a) + L_(a to v)) 。
2.2 模态特定语义蒸馏
利用冻结的 Qwen3-Omni 视觉与音频编码器作为教师,通过轻量级投影器将 VAE 潜在与教师特征对齐,采用 sigmoid-余弦损失:
L(cos) = -(1) / (|J|) ∑(j ∈ J) log σ!(cos(z_j, f_j))
分别为视频与音频分支提供独立的语义监督,提升各潜在空间的可学习性。
2.3 三阶段训练策略
- 阶段 1:独立预训练两 VAE,仅使用重建与对抗损失;
- 阶段 2:联合训练,引入对比对齐与语义蒸馏,移除判别器以节省显存;
- 阶段 3:冻结音频编码器,以对抗与特征匹配监督微调音频解码器,消除阶段 2 的轻微伪影,同时保持已对齐的潜在空间不变。
3. 实验验证
论文在约 2300 万经过滤的音视频片段上训练,并设计了四种渐进配置进行消融:仅重建(Recon)、重建+蒸馏(Recon+Distill)、重建+对比(Recon+AVCLIP)、以及完整 OmniVAE。
3.1 重建质量
在 UCF-101、Panda-70M(视频)及 LibriSpeech、AudioSet、MUSDB18(音频)上的评估表明,增加对比与蒸馏目标后,OmniVAE 仍保持了与纯重建基线相近的重建质量,未出现显著退化。
3.2 同步探测
在 VGGSound-Sparse 上进行时间偏移分类探测(Frozen 与 +ft 两种协议)。结果显示,对比学习是同步性能的主要来源,完整 OmniVAE 在 A@1 上分别达到 20.2%(Frozen)与 22.3%(+ft),显著优于无对比基线。
3.3 下游文本到音视频(T2AV)生成
冻结各 VAE 作为 tokenizer,在 Verse-Bench 上训练并评估 T2AV 模型:
- 跨模态对齐:AVCLIP 变体在 DeSync、LSE-C、Video-Audio Sim、Text-Audio Sim 上持续领先,OmniVAE 综合最优;
- 视频质量:AVCLIP 提升美学指标,蒸馏改善 MusiQ 与 ManiQA;
- 音频质量:两目标互补,OmniVAE 在 Inception Score、KL Divergence、Fréchet Distance、Speech WER 及 AudioBox 美学四项指标上均取得最佳表现。
3.4 消融实验
- 时间粒度与负样本规模:更长的片段(8 秒)与更细的段划分(0.17 秒)通过扩大负样本池,显著提升同步探测准确率;
- 损失平衡策略:对比了损失量级加权、GradNorm 与不确定性自适应加权,损失量级加权在段检索任务上表现最优,同时保持重建质量。
4. 结论与贡献
论文的核心贡献可概括为:
- 提出首个显式面向跨模态潜在对齐的音频-视频 VAE OmniVAE;
- 设计了两个互补的训练目标——段级对比对齐与模态特定语义蒸馏,二者仅在训练时生效,不增加推理开销;
- 通过潜在空间探测与下游生成实验,证明对齐目标显著改善音视频同步,蒸馏目标增强各模态生成质量,二者结合达到最优的整体性能。
该工作强调了在 tokenizer 层面统一模态特定语义与跨模态对应关系对全模态生成建模的重要性,并为未来向更大规模、更多模态及更长视频的扩展奠定了基础。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Jun Zhan,Chen Yang,Yitian Gong,Donghua Yu,Kuangwei Chen,Wenbo Zhang,Kexin Huang,Qi Luo,Zhe Xu,Ying Zhu,Jin Wang,Tengyue Zhang,Qi Chen,Cheng Chang,Songlin Wang,Junqi Dai,Jiasheng Ye,Xiaogui Yang,Tianyi Liang,Xiangyu Peng,Zhaoye Fei,Shimin Li,Qinyuan Cheng,Xie Chen,Xinchi Chen,Xipeng Qiu
PDF URL: https://arxiv.org/pdf/2607.23855.pdf
Arxiv URL: https://arxiv.org/abs/2607.23855
Arxiv ID: 2607.23855
CoolPaper URL: https://papers.cool/arxiv/2607.23855
Published: 2026-07-29T01:08:39.049Z
Updated: 2026-07-29T01:08:39.049Z
10. Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Abstract:We present Oxygen-TryOn, a unified foundation model for any-item virtual try-on. Rather than repurposing a general-purpose image editor, Oxygen-TryOn is fashion-native, built for try-on through a dedicated data engine and try-on-specific training. Given one or more reference items (clean product shots or in-the-wild worn-on photos) and a single target subject image, it synthesizes a photorealistic image of the subject wearing the items across virtually any fashion category. Prior systems handle a single garment category in a studio setting, and recent multi-reference methods remain garment-centric; in contrast, Oxygen-TryOn supports diverse items and scenarios, including full- and half-body views, a variable number of references, and free multi-item composition, while faithfully preserving both subject identity and item appearance. Instead of mask-based inpainting, we reformulate try-on as a multi-reference, understanding-driven generation task. We build a data engine that collects, manufactures, annotates, and filters high-quality try-on data at scale, and design a three-stage recipe of continued pre-training (CPT), supervised fine-tuning (SFT), and reinforcement learning (RL). The RL stage uses a hybrid reward combining an in-house try-on reward model with a proprietary, rubric-guided general-purpose model, jointly supervising fine-grained consistency and instruction-level quality. It also follows general editing instructions (e.g., pose changes) in the same pass. Across public benchmarks and our in-house Oxygen-TryOn Bench, it achieves state-of-the-art consistency and realism on single-item try-on and leads on multi-item try-on, matching or surpassing both leading proprietary systems (Nano Banana Pro, GPT-Image-2, Seedream5 Lite) and open-source models (FLUX.2).
中文摘要
摘要:我们提出了Oxygen-TryOn,这是一款适用于任何物品的虚拟试穿统一基础模型。Oxygen-TryOn并非改造通用图像编辑器,而是专为时尚领域设计,基于专用数据引擎和针对试穿的特定训练打造。给定一个或多个参考物品(干净的产品照片或实景穿搭照片)以及一张目标人物图像,它可以生成该人物穿上各类时尚单品的逼真图像。此前的系统只处理单一服装类别并且通常在工作室场景下进行,而最近的多参考方法仍以服装为中心;相比之下,Oxygen-TryOn支持多样的物品和场景,包括全身及半身视角、可变数量的参考物,以及自由的多物品组合,同时忠实保留人物身份和物品外观。我们将试穿任务重新定义为多参考、基于理解的生成任务,而非基于遮罩的图像修复。我们构建了一个数据引擎,用于大规模收集、生成、标注及筛选高质量试穿数据,并设计了三阶段方案:持续预训练(CPT)、监督微调(SFT)及强化学习(RL)。RL阶段使用混合奖励,通过内部试穿奖励模型与专有的基于评分标准的一般模型共同监督细粒度一致性和指令级质量,同时可在同一流程中遵循一般编辑指令(如姿态变化)。在公共基准测试及我们内部的Oxygen-TryOn Bench上,其在单件试穿任务上实现了最先进的一致性和逼真度,并在多件试穿任务中领先,可匹配甚至超越领先的专有系统(如Nano Banana Pro、GPT-Image-2、Seedream5 Lite)及开源模型(如FLUX.2)。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Yong Liu,Xiaolong Fu,Zihang Xu,Wen Xue,Xueheng Li,Lin Song,Yuan Zhang,Chuyang Zhao,Haoyang Huang,Nan Duan,Yipeng Sun,Yan Li,Simiu Gu
PDF URL: https://arxiv.org/pdf/2607.21694.pdf
Arxiv URL: https://arxiv.org/abs/2607.21694
Arxiv ID: 2607.21694
CoolPaper URL: https://papers.cool/arxiv/2607.21694
Published: 2026-07-29T01:08:46.788Z
Updated: 2026-07-29T01:08:46.788Z
11. The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
Abstract:Multi-turn long-horizon planning is critical for foundation model agents, yet how to fundamentally improve it remains unclear. Existing models are trained on uncontrollable and opaque Internet data, making it difficult to identify how planning ability is acquired, shaped, and integrated. To address this challenge, we introduce a unified and controlled multi-turn environment that enables precise control. It allows systematically study long-horizon planning across three stages. (1) Planning ability acquisition during pre-training. We study data format, distribution, and quality. Explicit world model construction through CoT state transition modeling yields stronger long-horizon generalization. Atomic skills alone are insufficient for compositional generalization, whereas a litte long-horizon data works. Moreover, suboptimal trajectories severely impair performance because errors amplify over long horizons. (2) Planning ability shaping via GRPO and OPD post-training. Through mutual information, we distinguish general planning patterns from task-specific planning knowledge. For planning patterns, we identify three application regions of post-training: unnecessary, effective, and unsupported. OPD has a broader effective region than GRPO under low-quality and long-horizon settings, as it provides more consistent update directions. For planning knowledge, distilling unseen procedures from a teacher with different knowledge may impair student’s prior world modeling without fully establishing new knowledge. (3) Planning ability integration through MOPD post-training. We show that multi-teacher on-policy distillation (MOPD) integrates capabilities by converging to shared planning-pattern across environments. Compatible patterns enable cross-environment generalization, partially shared patterns support continual learning, while completely conflicting patterns cause severe interference.
中文摘要
摘要:多轮长远规划对于基础模型代理至关重要,但如何从根本上改进仍不清楚。现有模型在不可控且不透明的互联网数据上训练,这使得难以识别规划能力是如何获得、形成和整合的。为了解决这一挑战,我们介绍了一个统一且可控的多轮环境,实现精确控制。它允许系统地研究三个阶段的长远规划。(1) 预训练过程中规划能力的获取。我们研究数据格式、分布和质量。通过链式思维(CoT)状态转移建模显式构建世界模型,可以获得更强的长远泛化能力。仅有基础技能不足以实现组合泛化,而少量长远数据则有效。此外,次优轨迹会严重削弱性能,因为错误会在长远过程中放大。(2) 通过GRPO和OPD后训练进行规划能力的塑形。通过互信息,我们区分了通用规划模式与任务特定的规划知识。对于规划模式,我们识别了后训练的三个应用区域:不必要区、有效区和不支持区。在低质量和长远设置下,OPD的有效区域比GRPO更广,因为它提供了更一致的更新方向。对于规划知识,从拥有不同知识的教师提炼未见过的程序,可能会损害学生先前的世界建模,而不能完全建立新的知识。(3) 通过MOPD后训练实现规划能力的整合。我们表明,多教师策略内蒸馏(MOPD)通过在环境间收敛到共享规划模式,整合能力。兼容模式可实现跨环境泛化,部分共享模式支持持续学习,而完全冲突的模式会导致严重干扰。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在从根本上理解和提升基础模型智能体(foundation model agents)在多轮次长程规划(multi-turn long-horizon planning)任务中的能力,并系统性地揭示这种能力在训练全流程中是如何被获得、塑造和整合的。
具体而言,论文针对现有模型通常在不可控且不透明的互联网数据上训练、导致难以追溯规划能力来源的痛点,提出了一个核心问题:
如何在预训练、后训练及模型整合等不同阶段,从根本上提升基础模型的长程规划能力?
围绕这一核心问题,论文将其分解为三个递进的基本子问题,并在一个统一且可控的多轮次实验环境中进行了系统研究:
1. 预训练阶段:规划能力的获得(Planning Ability Acquisition)
研究模型如何通过预训练数据习得长程规划能力,具体关注:
- 数据格式:显式构建世界模型(world model)进行状态转移建模,是否比直接预测动作更有利于长程泛化;
- 数据分布:仅依靠原子技能(atomic skills)是否足以实现组合泛化(compositional generalization),以及少量长程轨迹数据的作用;
- 数据质量:次优轨迹(suboptimal trajectories)如何因错误在长程决策中累积放大而严重损害规划性能。
2. 后训练阶段:规划能力的塑造(Planning Ability Shaping via GRPO and OPD)
从互信息(mutual information)的视角区分规划模式(planning patterns,跨任务共享的通用行为)与规划知识(planning knowledge,任务特定的程序性知识),研究强化学习后训练的适用边界:
- 对于低互信息的规划模式,识别出RL优化的三个区域:不必要的区域(unnecessary)、有效的区域(effective)和不支持的区域(unsupported);
- 比较 GRPO 与 OPD(On-Policy Distillation) 发现:在低质量预训练数据和长程规划任务下,OPD因提供更一致的更新方向而具有比GRPO更广的有效区域;
- 对于高互信息的规划知识,发现当教师与学生的底层程序知识不一致时,强行蒸馏未见过的多路径知识会损害学生已有的世界建模能力。
3. 多教师整合阶段:规划能力的整合(Planning Ability Integration through MOPD)
研究**多教师策略蒸馏(Multi-Teacher On-Policy Distillation, MOPD)**如何整合来自不同环境的能力:
- 当不同环境间存在兼容且共享的规划模式时,MOPD可实现跨环境泛化(cross-environment generalization);
- 当规划模式部分共享但存在冲突时,MOPD可在缓解灾难性遗忘的同时支持持续学习(continual learning);
- 当规划模式完全冲突且无共享时,MOPD会导致严重的灾难性遗忘和跨环境干扰。
总结
该研究通过构建一个可精确控制任务长度、数据质量、规划知识与模式的多轮次环境,提供了对长程规划能力在预训练→单教师后训练→多教师后训练全阶段物理机制的统一的、可控的理解,并为开发更强的智能体基础模型提供了实践指导。
Q: 有哪些相关研究?
根据论文第7节,相关研究主要集中在以下四个方向:
1. 长程智能体规划(Long-Horizon Agentic Planning)
该方向可分为基准评测与训练方法两条主线。
- 基准评测:包括 OSWorld 2.0、EdgeBench、DeepPlanning 以及 Long-Horizon-Terminal-Bench 等,用于评估智能体在长程任务中的表现。
- 训练数据合成:如 Agent-A1 与 Openresearcher,专注于长程轨迹的合成与构建。
- RL 训练算法:如 SAO 与 TurnOPD,针对长程智能体设计的强化学习训练策略。
- 过程奖励建模(Process Reward Modeling):Agent-RewardBench 等研究尝试在多轮长程规划中引入步骤级奖励信号。
现有研究的主要局限在于,当前大语言模型通常在规模庞大且不透明的互联网语料上进行预训练,难以系统分析其规划能力的来源与提升机制。本文通过构建可控环境与数据划分,提供了更为精细的能力归因分析。
2. 单轮与多轮策略蒸馏(Single-Turn and Multi-Turn OPD)
OPD(On-Policy Distillation)因其能提供比标准 GRPO 更细粒度的监督信号而日益受到关注。
- 单轮 OPD(Single-Turn OPD):
- 早期作为知识蒸馏方法提出(如 MiniLLM)。
- 近期随 RL 与大模型能力的发展,主要分为三条技术路线:
- 强到弱蒸馏(Strong-to-Weak Distillation)
- 自蒸馏(Self-Distillation)
- 弱到强蒸馏(Weak-to-Strong Distillation)
- 多轮 OPD(Multi-Turn OPD):现有研究较少,本文属于该方向的早期探索之一。
既有工作多聚焦于后训练阶段,且由于预训练数据的不透明性,难以对底层机制进行深入分析。本文则从预训练到单专家、多专家蒸馏进行了统一研究。
3. 多教师策略蒸馏(Multi-Teacher OPD)
多教师 OPD 作为一种模型整合(或持续学习)技术,在基础模型发展中具有重要作用。
- 应用场景:
- 跨领域能力整合:如 MiMo-V2-Flash 与 DeepSeek-V4,将不同领域的专家模型能力进行合并。
- 跨阶段能力保持:如 GLM-5 与 Nemotron-Cascade 2,通过课程式学习或多阶段 RL 保留先前阶段的能力。
- 算法变体:包括 CoPD、MAD-OPD 与 Uni-OPD 等,探索多专家蒸馏的不同实现形式。
现有研究的不足在于缺乏对模型整合何时有效、何时失效的系统分析。本文通过严格可控的实验设置,刻画了多教师蒸馏的有效边界与失效条件。
4. 世界建模与组合泛化(World Modeling and Compositional Generalization)
这两者被视为长程规划中的核心能力。
- 世界建模(World Modeling):部分研究探讨将世界模型内部化到语言模型中是否能提升规划能力,例如通过显式状态转移建模来辅助决策。
- 组合泛化(Compositional Generalization):研究语言模型能否仅通过原子技能的学习,自发地将其组合为长程规划能力。
然而,已有工作难以厘清这些能力究竟在预训练阶段即已存在、仅在后训练中被激活,还是可以在后训练中自发产生。本文从预训练阶段出发,利用干净、可控的数据环境,明确追踪了这些能力的起源与演化。
Q: 论文如何解决这个问题?
论文通过构建一个统一且可控的多轮次长程规划环境,并在此基础上对训练全流程进行系统性的受控实验与机制拆解,来回答“如何在不同阶段提升长程规划能力”这一核心问题。具体解决路径可分为以下四个层面:
1. 构建统一可控的多轮规划环境(基础平台)
为解决现有模型在“不可控且不透明的互联网数据”上训练、难以归因能力来源的痛点,论文首先搭建了一个名为 Controllable Planning Gym 的实验框架:
- 层次化技能图:在三个独立领域(Fantasy Alchemy、Livestock Farming、Electronic Assembly)中构建具有 AND/OR 合成规则的树状技能图,精确控制任务复杂度。
- 难度分级:依据完成目标所需的最少动作步数,将任务严格划分为 Short(1–5 步)、Middle(6–8 步)、Long(9+ 步)三个层级。
- 防泄漏的实例映射:通过抽象节点到具体物品索引的映射,确保测试集使用训练阶段未见的物品组合,从而准确评估泛化能力。
- 端到端可控训练:基于 Qwen2.5 架构从零随机初始化 100M 参数的模型,并从头训练专用 tokenizer,实现对预训练语料、后训练数据及测试分布的完全掌控。
2. 预训练阶段:数据层面的受控归因
在可控环境中,论文通过逐步放松对预训练数据的三个假设,系统研究规划能力的获得机制:
- 数据格式:对比两种训练范式——(1)直接动作预测(w/o World Modeling);(2)显式构建世界模型的思维链状态转移建模(w/ World Modeling),以验证内部化世界模型对长程泛化的关键作用。
- 数据分布:通过调整 Short / Middle / Long 三类数据的比例(如 100% Short、100% Short + 5% Long 等),检验原子技能是否能自动组合为长程规划能力,并量化少量长程数据对激活组合泛化的“突增”效应。
- 数据质量:设置不同比例的最优与次优轨迹混合(如 4 Optimal、4 Optimal : 4 Suboptimal、4 Optimal : 8 Suboptimal),精确测量次优决策在长程交互中因错误累积放大而导致的性能崩溃。
3. 后训练阶段:基于互信息的机制拆解与算法边界刻画
论文从互信息视角将规划能力解构为两个正交维度,分别研究后训练算法的适用边界:
(1)规划模式(Planning Patterns)与规划知识(Planning Knowledge)的区分
- 规划模式 P :跨任务共享的通用推理结构(如 DFS、反思、回溯),与具体任务间互信息较低,即 I(T;P) 较小。
- 规划知识 K :任务特定的程序性知识(如具体合成配方、状态转移规则),与任务紧密相关,互信息较高,即 I(T;K) 较大。
(2)GRPO 与 OPD 的系统性对比
沿着规划长度与预训练数据质量两个维度,论文定义了后训练的三种适用区域:
- 不必要区域(Unnecessary Region):不同模式性能相近,RL 优化无显著收益;
- 有效区域(Effective Region):模式间存在明显性能差异,RL 能够筛选出更优模式;
- 不支持区域(Unsupported Region):长程任务中稀疏奖励导致信用分配失败,常规 RL 难以激活最优模式。
通过对比 GRPO(基于结果奖励)与 OPD(On-Policy Distillation)(基于教师分布的细粒度监督),论文发现:
- 在低质量预训练数据与长程任务场景下,GRPO 因稀疏信用分配导致梯度方向不一致甚至消失,而 OPD(在理想教师条件下)提供更一致的 token 级更新方向,因此具有更广的有效区域。
- 通过 Top-k SVD 子空间余弦相似度分析参数更新方向,定量验证了 OPD 在长程与低质量设置下的方向稳定性显著优于 GRPO。
(3)知识蒸馏中的“知识鸿沟”
论文构建“同目标、异路径”的教师模型(如合成羊毛的 Recipe A 与 Recipe B),系统测试错配知识蒸馏的影响:
- 使用 token 级 KL 散度动态分析与轨迹/步骤正确性四分类(正确轨迹-正确步骤、正确轨迹-错误步骤等),揭示当教师与学生的底层程序知识不一致时,OPD 会损害学生已有的域内世界建模能力,而非有效建立新知识。
4. 多教师整合阶段:模式兼容性的结构化分析与参数动态追踪
针对多教师策略蒸馏(MOPD),论文提出一个由两个维度(是否共享模式、模式是否冲突)构成的分析框架,将跨环境关系归纳为三种典型类型,并逐一验证:
- Type I(共享且兼容):不同环境存在通用的优质推理模板。实验证明 MOPD 会收敛到教师间的共享模式分布,实现跨环境泛化;即使学生预训练数据被大量低质量轨迹稀释,MOPD 仍能激活并强化这些共享模式。
- Type II(共享但冲突):环境间存在共享结构,但领域特定的捷径或陷阱导致行为冲突。实验表明,只要仍存在可用的共享模式结构,MOPD 可在学习新领域的同时缓解严重遗忘,支持持续学习。
- Type III(无共享且冲突):环境间完全不存在通用模式。此时 MOPD 会导致学生过拟合于最新教师,引发灾难性遗忘与严重的跨环境干扰。
为揭示其底层机制,论文进一步通过参数级 PCA 降维、参数 L2 距离矩阵与更新方向余弦相似度分析,证明 MOPD 的每一步更新都保持在初始模型(Instruct)附近的局部参数空间中,以小幅、方向各异的方式逐层叠加任务信号——这也解释了为何 OPD 难以注入预训练中完全缺失的大规模任务特定知识。
总结
简言之,论文的解决思路是:以可控环境为根基,以“数据格式-分布-质量”为预训练阶段的抓手,以“互信息解构+算法对比+梯度动态”为后训练阶段的分析工具,以“模式兼容性分类+参数动态追踪”为模型整合阶段的理论框架,从而对多轮长程规划能力的获得、塑造与整合提供了全链条的物理机制解释。
Q: 论文做了哪些实验?
论文围绕多轮次长程规划能力的获得、塑造与整合,在统一可控环境中开展了一系列系统性实验。以下按三个训练阶段进行梳理:
1. 预训练阶段:规划能力的获得(Section 4)
1.1 世界模型内化对比实验
- 目的:验证显式构建内部世界模型(World Modeling, WM)进行状态转移建模,是否优于直接动作预测。
- 设置:在 Qwen2.5-100M 架构上从零训练,对比 w/ WM(先输出状态转移推理链再执行动作)与 w/o WM(直接预测动作)。覆盖 3 个领域、5 个层级,评估 Short / Middle / Long 三种难度。
- 评估指标:avg@8、pass@8,以及按操作步数细分的 op=1–5、6–8、9–20 性能曲线。
- 核心结果:
- w/ WM 在所有难度下均显著优于 w/o WM(例如 Long 难度 avg@8 提升 45.8%)。
- w/o WM 虽在训练初期收敛更快、token 开销更低,但很快触及性能上限;w/ WM 最终收敛到更高的准确率,展现出更强的长程泛化能力。
1.2 原子技能组合泛化实验
- 目的:检验仅通过短程原子技能数据预训练,模型能否自动组合出长程规划能力;以及少量长程数据的作用。
- 设置:系统调整预训练数据分布,设置 8 种数据配比(如 100% Short、100% Short+5% Middle、100% Short+100% Middle+5% Long 等)。统一训练 9000 步。
- 核心结果:
- 仅使用 100% Short 数据时,模型在 Middle 和 Long 任务上准确率接近 0%,表明原子技能无法自动组合为长程能力。
- 引入仅 5% 的 Middle 或 Long 数据即可带来性能的突然跃升(例如 Long 任务 pass@8 从 0% 提升至 11.46%),说明极少量的长程轨迹即可“激活”长程规划。
1.3 次优轨迹影响实验
- 目的:量化预训练数据中存在次优(suboptimal)轨迹时,对长程规划的损害程度。
- 设置:构建 8 种数据质量分布,包括 1 种最优模式、4 种最优模式、4 最优:4 次优、4 最优:8 次优等。所有设置保持相同的数据规模和训练步数。
- 核心结果:
- 增加多种最优推理模板(1 Optimal → 4 Optimal)不会显著影响性能。
- 引入次优轨迹(4 Optimal : 8 Suboptimal)后,Short 任务性能部分保留,但 Middle 和 Long 任务性能断崖式下跌至接近 0。
- 证实长程决策中的错误会随时间逐步累积与放大,导致模型在后续步骤中不可恢复地偏离目标。
2. 后训练阶段:规划能力的塑造(Section 5)
2.1 互信息视角下的机制定义
- 在实验分析前,论文从互信息角度建立理论框架:
- 规划模式(Planning Patterns):跨任务共享的通用推理结构,与任务间互信息较低,即 I(T; P) < I(T; K) 。
- 规划知识(Planning Knowledge):任务特定的程序性知识(如合成配方),与任务间互信息较高。
2.2 规划模式的后训练适用边界实验(GRPO vs. OPD)
- 目的:刻画强化学习在塑造规划模式时的有效边界,并对比 GRPO 与 OPD(On-Policy Distillation)。
- 设置:
- 基座模型:4 Opt、4 Opt:4 Sub、4 Opt:8 Sub(对应不同预训练数据质量)。
- 后训练数据:完全使用 Fantasy Alchemy 域的 post-training 数据,分别按 Short / Middle / Long 长度进行训练。
- 算法:Multi-turn GRPO(二值化结果奖励)与 Multi-turn OPD(Top- k , k=100 )。
- 评估:定义了三个适用区域——不必要区域(Unnecessary)、有效区域(Effective)、不支持区域(Unsupported)。
- 核心结果:
- GRPO 的有效区域较窄;在预训练数据质量低且规划长度长时,其性能提升有限甚至失效(Unsupported Region)。
- OPD 在相同条件下拥有更广的有效区域,因其通过理想教师提供了更细粒度、更一致的 token 级更新方向。
- 随着采样次数 k 增加,GRPO 的 pass@ k 上限更高,而 OPD 倾向于降低输出熵、压缩多样性。
- 后训练会改变模型的 CoT 长度,使其向预训练数据中高奖励模式的长度靠拢。
2.3 梯度方向一致性分析实验
- 目的:从参数更新方向的角度,解释 OPD 在长程与低质量设置下优于 GRPO 的内在机制。
- 方法:基于 Top- k SVD 子空间余弦相似度分析。设第 ell 层在 checkpoint t 的权重矩阵为 Well^((t)) ,定义更新矩阵 Delta W_ell^((t)) = W_ell^((t)) - W_ell^((b)) ,对其做 SVD 分解后,提取前 k 个左奇异向量 U(ell,k)^((t)) ,计算其与最终 checkpoint f 对应向量的绝对余弦相似度:
s(ell,i)(t, f) = |(u(ell,i)^((t)))^top u(ell,i)^((f))||u(ell,i)^((t))|2 |u(ell,i)^((f))|_2
进而对所有层取平均得到 $S^((k))(t, f) ∈
0,1
$。 - 设置:在 4 Opt.:4 Sub 基座上,对比不同长度(Short / Middle / Long)与算法(GRPO / OPD);并在 Long 难度下对比三种数据质量(4 Opt / 4:4 / 4:8)。
- 核心结果:
- 随着规划长度增加,GRPO 的梯度方向与最终方向的相似度显著降低;在 4 Opt.:8 Sub 的 Long 任务中,早期 checkpoint 的相似度直接降至 0 并保持平坦,出现梯度消失。
- OPD 在所有设置下均保持较高的方向一致性,证明其在长程与低质量预训练数据条件下具有更强的更新稳定性。
2.4 规划知识蒸馏的“知识鸿沟”实验
- 目的:检验当教师与学生的底层程序知识不一致时(同目标、异路径),OPD 是否仍能成功蒸馏。
- 设置:以合成“羊毛(wool)”为目标,构建两条互斥但均正确的路径:
- Recipe A:water + grass seed → grass → lamb → wool
- Recipe B:water + cotton seed → cotton → spinning → wool
- 学生 A 基于 Recipe A 预训练;教师 A 与教师 B 分别基于 Recipe A 与 Recipe B 训练,且均达到 100% 准确率。
- 对比:Student + Teacher A(知识对齐) vs. Student + Teacher B(知识错配)。
- 核心结果:
- 即使 Teacher B 完美无缺,Student + Teacher B 的整体 pass@8(36.60)甚至低于基座 Instruct 模型(44.03),表明完美教师无法弥合底层知识错配。
- 错配蒸馏导致学生域内(ID)规划知识崩溃(例如 Middle 难度 FA 域 avg@8 下降 36.09),而对域外(OOD)影响相对较轻。
- 训练动态显示:早期 OPD 可成功对齐通用规划模式并提升奖励;但后期试图注入异构知识时,因更新幅度不足而导致训练崩溃。
2.5 Token
Q: 有什么可以进一步探索的点?
基于论文的实验设置与结论,以下几个方向具有进一步探索的价值:
1. 预训练阶段的数据策略与鲁棒性
- 次优轨迹的鲁棒预训练机制 论文发现次优轨迹会因错误累积而严重损害长程规划能力。未来可探索专门针对含噪长程数据的预训练目标函数(如基于置信度的样本重加权、对比学习或硬负样本挖掘),以在不完美数据条件下提升模型的容错与恢复能力。
最优数据混合比例与课程学习 实验表明少量长程数据即可“激活”组合泛化,但并未系统探索不同难度数据的最优混合比例或课程学习调度策略。可进一步研究如何动态调整 Short / Middle / Long 数据的采样比例,以在有限训练预算下最大化长程泛化性能。
从合成环境到真实世界环境 当前实验基于确定性的、规则明确的合成技能图。在部分可观察、随机动态、状态空间连续的真实世界环境(如网页浏览、机器人控制)中,世界模型内化与组合泛化的结论是否依然成立,仍需验证。
2. 后训练算法的扩展与融合
- 非理想教师条件下的 OPD 表现 论文中 OPD 的优势建立在“理想教师”假设之上。当教师模型自身也存在错误、偏见或分布偏移时,OPD 的一致性更新方向是否反而会加速错误知识的传播?未来需要研究带噪教师的 OPD 鲁棒性边界,以及教师选择与质量过滤机制。
规划模式与规划知识的自适应分离训练 论文从互信息角度区分了低互信息的规划模式与高互信息的规划知识,并指出前者适合 RL、后者适合 SFT。未来可探索自动化识别或动态分离这两类 token 的方法,设计混合训练框架(如对模式 token 应用 GRPO/OPD,对知识 token 应用 SFT 或检索增强),避免统一优化策略带来的相互干扰。
扩展 GRPO 的有效区域 论文揭示了 GRPO 在长程与低质量预训练数据下存在梯度消失与信用分配失败的问题。可探索引入过程级奖励模型(Process Reward Model, PRM)、子目标分解或课程式强化学习,以提供细粒度的中间步骤监督,从而扩展 GRPO 在长程任务中的有效边界。
- OPD 与过程奖励的结合 OPD 依赖教师分布提供密集监督,但缺乏对环境反馈的显式利用。研究如何将 OPD 的细粒度蒸馏信号与基于环境反馈的奖励信号(如结果奖励或过程奖励)相结合,可能在保持更新稳定性的同时提升探索效率。
3. 多教师蒸馏的理论深化与算法改进
- 复杂模式关系下的整合策略 论文将教师间模式关系分为三类:共享兼容、共享冲突、无共享冲突。然而现实中更常见的是部分共享且部分冲突的复杂模式结构。需要更细粒度的理论框架来描述此类场景,并设计能够主动“桥接”而非仅“寻找交集”的蒸馏策略。
模型合并 vs. 顺序 MOPD 论文发现顺序 MOPD 的参数量变极小且靠近基座模型。这暗示**参数空间插值(model merging / arithmetic)**可能是一种替代方案。未来可系统比较顺序 OPD、并行 OPD(mixture)与模型合并在跨环境泛化、灾难性遗忘及训练开销上的优劣。
蒸馏顺序与动态调度 论文采用固定的 FA → LF → EA 顺序进行顺序蒸馏。不同领域顺序是否会导致差异化的遗忘程度与最终性能?探索最优的教师调度顺序(如基于领域相似度或难度排序)或动态切换策略(如根据学生当前能力状态选择下一位教师),可能提升整合效率。
- 主动模式补全与元学习 当目标环境缺少某种规划模式时,MOPD 无法凭空创造该模式(如论文中 T3 Planning 在 LF 环境中无法被触发)。未来可研究元学习(meta-learning)或抽象模式生成方法,使模型能够从多教师信号中提炼出更高层的元策略,而非仅仅收敛到已有模式的交集。
4. 模型规模与架构的 scaling 研究
- 大模型的涌现行为 论文使用 100M 参数规模的模型进行受控实验。随着模型规模增大(如 7B、70B),原子技能的组合泛化是否会在无需显式长程数据的情况下自发涌现?大模型对次优轨迹的鲁棒性是否会增强?这些 scaling 特性对实际大模型训练具有重要指导意义。
- 架构改进 当前实验基于标准 Transformer 架构。可探索为长程规划专门设计的架构改进,如增强循环机制、显式状态记忆模块或层次化规划模块,以验证世界模型内化与长程信用分配的效率是否可以进一步提升。
5. 量化理论框架的完善
- 互信息的可操作化计算 论文从概念上利用互信息区分规划模式与规划知识,但未给出在真实模型中量化计算 I(T;P) 与 I(T;K) 的具体方法。未来可发展基于信息论或因果推断的度量工具,实现对模型内部表示中“通用模式”与“特定知识”的自动化分离与监测。
- OPD 收敛性的理论分析 论文通过实验观察了 OPD 的参数动态与 KL 散度演化,但缺乏严格的收敛性理论保证。建立 OPD 在多轮长程设置下的收敛条件、收敛速率以及教师-学生差异的上界,将为算法设计提供更坚实的理论基础。
Q: 总结一下论文的主要内容
该论文系统研究了基础模型智能体在多轮次长程规划(multi-turn long-horizon planning)任务中的能力来源与提升机制,通过构建一个统一且可控的多轮规划环境(Controllable Planning Gym),从预训练、单教师后训练到多教师后训练三个阶段,揭示了规划能力的获得、塑造与整合规律。
1. 核心问题与研究动机
当前基础模型的长程规划能力面临一个根本性挑战:模型通常在不可控且不透明的互联网数据上训练,难以追溯规划能力究竟是在哪个阶段、通过何种机制获得和提升的。为此,论文提出一个核心问题:
如何在预训练、后训练及模型整合等不同阶段,从根本上提升多轮次长程规划能力?
2. 统一可控实验环境
为精确归因能力来源,论文构建了覆盖三个领域(Fantasy Alchemy、Livestock Farming、Electronic Assembly)的合成环境:
- 层次化技能图:通过 AND/OR 逻辑规则定义合成路径,支持对任务难度的精确控制(Short: 1–5步, Middle: 6–8步, Long: 9+步)。
- 全阶段可控:基于 Qwen2.5-100M 架构从零训练专用模型与 tokenizer,实现对预训练语料、数据质量、规划知识与规划模式的完全掌控。
3. 三阶段核心发现
(1)预训练阶段:规划能力的获得
- 显式世界模型内化:将状态转移函数 T: S × A to S 显式建模于思维链(CoT)中,相比直接动作预测,能显著提升长程泛化能力(例如 Long 难度 avg@8 提升 45.8%)。
- 组合泛化的局限性:仅依赖原子技能(atomic skills)预训练无法实现自动组合泛化;但引入极少量的长程轨迹(如 5% 的 Long 数据)即可“激活”长程规划能力,使性能从接近 0 跃升至可用水平。
- 次优轨迹的累积危害:预训练数据中的次优轨迹(suboptimal trajectories)会因决策错误在长程交互中逐步累积放大,导致 Middle 与 Long 任务性能断崖式崩溃至接近 0。
(2)后训练阶段:规划能力的塑造(GRPO vs. OPD)
论文从互信息视角将规划能力解构为两个维度:
- 规划模式(Planning Patterns):跨任务共享的通用推理结构,与任务间互信息较低,即 I(T; P) 较小。
- 规划知识(Planning Knowledge):任务特定的程序性知识(如合成配方),与任务间互信息较高,即 I(T; K) 较大。
基于上述区分,论文沿规划长度与预训练数据质量两个维度,定义了后训练的三种适用区域:不必要区域(Unnecessary)、有效区域(Effective)、不支持区域(Unsupported)。通过对比 GRPO(基于结果奖励)与 OPD(On-Policy Distillation) 发现:
- 规划模式更适合 RL:低互信息的规划模式可通过 RL 在有效区域内被筛选和激活;OPD 在理想教师条件下,因提供比 GRPO 更细粒度、更一致的 token 级更新方向,在长程与低质量预训练数据场景下拥有更广的有效区域。
- 规划知识更适合 SFT:高互信息的规划知识需要精确、样本级的更新;当教师与学生底层知识不一致时(如到达同一目标的不同路径),强行通过 OPD 蒸馏未见知识会损害学生已有的域内世界建模,导致性能崩溃。
- 梯度动态验证:通过 Top- k SVD 子空间分析,定量验证了 GRPO 在长程与低质量设置下出现梯度方向不一致甚至消失,而 OPD 保持稳定的参数更新方向。
(3)多教师整合阶段:规划能力的整合(MOPD)
论文提出 Multi-Teacher On-Policy Agentic Distillation (MOPD),并基于两个维度(是否共享模式、模式是否兼容)将跨环境关系分为三类:
| 类型 | 模式关系 | MOPD 表现 |
|---|---|---|
| Type I | 共享且兼容 | 收敛到教师间的共享分布,实现跨环境泛化;即使学生预训练被低质量数据稀释,仍能激活底层共享模式。 |
| Type II | 共享但冲突 | 保留可用共享结构,支持持续学习(continual learning),在获取新能力的同时缓解灾难性遗忘。 |
| Type III | 无共享且冲突 | 学生过拟合于最新教师,导致严重灾难性遗忘与跨环境干扰。 |
参数动态分析表明,MOPD 的更新始终保持在初始模型附近的局部参数空间内,通过小幅、方向各异的变化逐层叠加任务信号——这也解释了为何 OPD 难以注入预训练中完全缺失的大规模任务特定知识。
4. 总结与贡献
该研究的主要贡献在于:
- 提供了一个可控、端到端的实验框架,将长程规划能力的分析从“黑箱” Internet 数据转向精确归因的物理机制研究。
- 揭示了预训练数据格式、分布与质量对长程规划能力获得的关键作用。
- 从互信息理论出发,首次系统刻画了 GRPO 与 OPD 在塑造规划模式与规划知识时的适用边界与失效条件。
- 阐明了多教师蒸馏的核心机制是收敛到共享模式分布,并识别了决定其成功(泛化/持续学习)或失败(灾难性遗忘)的模式兼容性条件。
总体而言,论文为开发具有更强多轮次长程规划能力的智能体基础模型提供了从数据构建、算法选择到模型整合的全链条实践指导。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Tianyi Men,Zhuoran Jin,Kang Liu,Jun Zhao
PDF URL: https://arxiv.org/pdf/2607.24720.pdf
Arxiv URL: https://arxiv.org/abs/2607.24720
Arxiv ID: 2607.24720
CoolPaper URL: https://papers.cool/arxiv/2607.24720
Published: 2026-07-29T01:10:28.802Z
Updated: 2026-07-29T01:10:28.802Z
12. dRAE: Representation Autoencoder with Hyper-Spherical Codes
Abstract:In this work, we aim to discretize the high-dimensional visual representations to bridge the gap with language models - a non-trivial challenge, as existing quantization methods suffer from codebook collapse, failing to scale while preserving semantic coherence. We identify the root cause as metric mismatch: standard Euclidean codebook objectives are fundamentally misaligned with the anisotropic geometry of representation space, leading to codebook embeddings with high-variance magnitude scales and uneven angular distributions that hinder scalability. To address this, we propose Hyper-Spherical Quantization (HSQ), which decouples semantic content from feature magnitude via angular routing, preventing code assignment from being dominated by scale rather than meaning. The resulting discrete Representation Autoencoder (dRAE) achieves high-fidelity reconstruction while preserving semantic integrity and supporting scalable codebook budget. Extensive experiments demonstrate consistent performance gains as the vocabulary size scales to 131{,}072, along with 100\% codebook utilization, simplified training pipeline, and strong performance across understanding and generation tasks.
中文摘要
摘要:在本研究中,我们旨在将高维视觉表示离散化,以弥合与语言模型之间的差距——这是一项非平凡的挑战,因为现有的量化方法存在码本坍塌问题,在保持语义一致性的同时无法扩展。我们将根本原因归结为度量不匹配:标准的欧几里得码本目标与表示空间的各向异性几何结构根本不一致,导致码本嵌入具有高方差的幅值尺度和不均匀的角度分布,从而阻碍可扩展性。为了解决这一问题,我们提出了超球量化(HSQ),通过角度路由将语义内容与特征幅值解耦,防止编码分配被尺度而非意义主导。由此产生的离散表示自编码器(dRAE)在保持语义完整性的同时,实现了高保真重建并支持可扩展的码本预算。大量实验表明,随着词汇表规模扩展至131,072,性能持续提升,同时实现了100%的码本利用率、简化的训练流程,以及在理解和生成任务上表现出强劲性能。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决高维视觉表征离散化过程中存在的**码本崩溃(codebook collapse)**问题,具体而言:
核心问题
- 现有向量量化(Vector Quantization, VQ)方法在将高维视觉基础模型(VFM)表征转换为离散token时,无法随着码本规模扩大而保持语义一致性,通常当词汇量超过16K时即出现性能瓶颈。
- 这种崩溃现象直接抵消了基于表征的tokenizer的主要优势——高维潜在空间丰富的语义容量无法被有限且利用不足的离散码本充分捕获。
根本原因:度量失配(metric mismatch)
- 视觉基础模型中的语义信息主要编码在潜在向量的方向(角度)上,而传统VQ使用欧几里得距离进行码本分配与更新。
- 这种不一致使得量化目标对特征向量的**各向异性尺度(anisotropic scale)**过度敏感,导致:
- 码本嵌入的幅度(magnitude)方差过大;
- 角度分布不均匀;
- 幅度较大的向量无论语义是否匹配,都会 disproportionately 主导码本分配,造成某些码本条目被”劫持”,而其他条目闲置。
目标 dilemma
- 单纯丢弃幅度信息(如强制单位球归一化)虽能保留语义方向,却会损害图像重建所需的结构/纹理细节;
- 保留原始欧几里得度量则无法避免尺度偏差带来的崩溃。
解决方案方向 论文提出超球面量化(Hyper-Spherical Quantization, HSQ),核心思路是:
- 解耦语义内容(角度)与特征幅度:通过角度路由(angular routing)分配离散码,同时保留幅度信息用于解码器重建;
- 构建离散表征自编码器(dRAE),在支持可扩展码本预算(scaling to 131,072)的同时,实现高保真重建、100%码本利用率,并兼顾理解与生成任务。
Q: 有哪些相关研究?
根据论文第2节内容,相关研究主要围绕以下两个方向展开:
1. 视觉语义表征与生成式潜在空间的演进
- 自监督与对比学习构建语义基础:通过掩码建模(masked modeling)、自蒸馏(self-distillation)及图像-文本对齐(image-text alignment)等目标,视觉模型将图像块映射至高维潜在空间(如维度 $d ∈
768, 1536
$),学习具有结构化语义且可跨任务泛化的表征。代表性工作包括 CLIP、DINO 系列及 JEPA 等。 - 生成模型依赖低维流形:当前先进的生成模型(如扩散模型)通常运行于经重建优化的低维 VAE 空间(维度 $d ∈
8, 64
$)。这导致了语义丰富的高维嵌入与紧凑的生成式潜在空间之间存在显著维度不兼容。
2. 统一视觉理解与生成的方法探索
为弥合上述分歧,现有研究主要沿两条技术路线推进:
- 端到端联合优化:如 VTP 探索从头训练以同时统一理解与生成,但此类方法对数据收集与训练预算的要求极高。
- 基于预训练编码器的复用:更主流的趋势是直接利用预训练的视觉基础模型(VFM)支持多下游任务:
- VILA-U:采用残差量化(residual quantization)对齐图像潜在表征与文本嵌入。
- TokLIP:通过蒸馏与对比训练,将 CLIP 特征“烘焙”进预训练的 VQGAN tokenizer。
- RAE(Representation Autoencoder):提出专为语义优化的高维特征可直接用于图像重建,证明高维向量在联合捕获语义密度与细粒度结构信息方面具有巨大潜力,有益于视觉世界建模。
- VQRAE:作为 RAE 的离散化扩展,采用 SimVQ 对高维 token 进行量化,但受限于码本崩溃(codebook collapse)问题,难以扩展至大词汇量。
这些相关工作共同指向一个核心缺口:缺乏一种能在高维语义空间中稳定扩展、且同时服务于理解与生成的可扩展离散化机制。
Q: 论文如何解决这个问题?
论文通过提出Hyper-Spherical Quantization (HSQ) 与 discrete Representation Autoencoder (dRAE) 框架解决该问题。整体解决方案围绕度量解耦与几何对齐展开,具体机制如下:
1. 核心诊断:度量失配(Metric Mismatch)
论文指出,码本崩溃的根本原因在于标准 VQ 的欧几里得目标与视觉基础模型(VFM)潜在空间的各向异性几何结构不匹配。VFM 的语义信息主要编码在特征向量的**方向(角度)上,而欧几里得距离对向量幅度(magnitude)**线性敏感,导致:
- 大范数向量无论语义是否匹配,均会主导码本分配;
- 码本嵌入出现高方差幅度与聚集化角度分布(见图 1c);
- 部分码本条目被”劫持”,其余条目闲置,引发崩溃。
2. Hyper-Spherical Quantization (HSQ) 设计
HSQ 的核心创新在于显式解耦用于码本路由的度量与用于重建的量化解码目标,具体通过以下三项机制实现:
(a) 角度路由(Angular Routing)
将标准 VQ 的欧几里得最近邻搜索替换为基于余弦相似度的角度路由:
i^* = argmax_i (z · c_i) / (|z|_2 |c_i|_2)
其中 z ∈ R^d 为未量化的嵌入, c_i 为码本条目。此举确保码本分配完全依据语义方向,而非数值幅度。
(b) 球形码本损失(Spherical Codebook Loss)
为维持角度约束,将码本损失重写为球形目标,限制码本更新在切空间内:
L_(codebook) = 1 - sg[(z) / (|z|_2)] · (z_q) / (|z_q|_2)
其中 $sg
·
为停止梯度操作, z_q$ 为量化后的向量。该损失直接对齐单位超球面上的方向。
(c) 幅度感知的承诺损失(Magnitude-Aware Commitment Loss)
若全部损失均使用角度形式,则幅度将完全无监督,导致收敛不稳定(见表 7)。因此,HSQ保留欧几里得承诺损失:
L_(commit) = |z - sg[z_q]|_2^2
此损失为投影特征提供幅度感知指导,确保解码器仍能获取重建所需的结构/纹理尺度信息。
3. dRAE 架构与训练范式
基于 HSQ,论文构建离散表征自编码器(dRAE):
- 编码器:采用预训练且冻结的 Vision Foundation Model(如 SigLIP2 ViT-So400M)提取高维语义特征;
- 解码器:采用对称设计的可训练 ViT,负责从量化表征重建像素;
- 量化器:插入 HSQ 模块,通过上述角度-幅度解耦机制完成离散化;
- 训练策略:端到端联合优化重建损失、HSQ 量化损失及蒸馏损失,无需分阶段训练、特定的嵌入初始化、防崩溃技巧或课程学习。
整体训练目标为:
L(total) = L(rec) + L_(VQ) + λ|Z - T(x)|_2^2
其中 L(rec) 包含 L1、感知与对抗损失, L(VQ) = L(codebook) + βL(commit) , T(x) 为教师模型(原始 VFM)提供的自蒸馏监督。
4. 与现有量化方案的关键区别
论文进一步厘清 HSQ 与两类流行范式的差异:
- 对比 FSQ:FSQ 通过固定网格量化低维连续潜在变量,其词汇量随维度指数增长( K=L^d ),无法扩展至高维;HSQ 直接在原生高维空间中运行,保持高度利用的可学习码本。
- 对比 SVQ:SVQ 将潜在变量强制投影至单位球并传递归一化向量给解码器,严格施加了先验;HSQ 仅在最近邻分配步骤使用球面几何,实际传递给解码器的仍为未归一化的码向量,从而避免破坏重建所需的幅度信息。
5. 解决效果
上述设计带来两个关键几何性质:
- 幅度均质化(Magnitude Homogenization):约束码本嵌入处于更稳定的幅度尺度,消除触发崩溃的高方差异常值;
- 角度均匀性(Angular Uniformity):降低幅度噪声后,潜在空间在超球面上分布更各向同性、更均匀,码本容量被完全用于表示不同语义方向。
最终,dRAE 在词汇量扩展至 131,072 时仍保持 100% 码本利用率,同时实现高保真重建与语义完整性,统一支持视觉理解与生成任务。
Q: 论文做了哪些实验?
论文围绕图像重建、多模态理解与视觉生成三大任务开展了系统实验,并辅以多组消融研究与扩展验证。具体实验内容整理如下:
1. 实验设置(Setups)
- Tokenizer 训练:以 SigLIP2 ViT-So400M 为冻结编码器,对称 ViT 为可训练解码器;端到端单阶段训练,无需特定的嵌入初始化、防崩溃技巧或课程学习。
- 图像理解:以 Qwen2.5-7B 为 LLM 主干,采用 LLaVA-1.5 的视觉指令调优流程。
- 文本到图像(T2I)生成:以 Flan-T5-XXL 进行文本条件,采用带离散预测头的 Diffusion Transformer(DiT),遵循离散扩散范式。
- 类别到图像(C2I)生成:在 ImageNet 上训练生成式变体用于消融。
- 评估指标:
- 重建:rFID、PSNR、SSIM(ImageNet-1K 验证集)
- 多模态理解:GQA、TextVQA、MMBench-en、MME-Perception、SEEDBench-Img
- C2I 生成:gFID、Inception Score(IS)
- T2I 生成:GenEval、DPG-Bench
2. 图像重建实验(Image Reconstruction)
- 码本规模扩展行为:将词汇量从 K=2^(14) 扩展至 2^(17) ,观测活跃码数量、PSNR 与 rFID。结果显示 HSQ 随词汇量增加持续提高重建保真度,而 VQ 基线(VQRAE)在扩大词汇量时活跃码数量与 PSNR 仅边际改善。
- 抗崩溃验证:在 K=65,536 、每 GPU batch size 为 64 时,VQRAE 每轮前向传播仅激活约 6K 个码,而 dRAE 持续激活超过 12K 个码,全局码本利用率高于 90%。
- 与现有离散 Tokenizer 对比:在相同码本预算(16,384)下,dRAE 显著优于 VQRAE;当码本扩大至 131,072 时,dRAE 达到 0.42 rFID、24.52 PSNR 与 0.72 SSIM,为对比方法中最优。
3. 多模态任务实验(Multimodal Tasks)
3.1 图像理解(Image Understanding)
在多个基准上评估 Tokenizer 对高层语义任务的保留能力:
- 基准:GQA、TextVQA、MMBench-en、MME-Perception、SEEDBench-Img。
- 对比方法:LLaVA-1.5、LLaVA-OV、VILA-U、UniTok、QLIP、TokLIP、Tar、VQRAE 等。
- 结果:dRAE 在 MMBench 与 SEEDBench 等感知与推理基准上表现竞争力强,且在使用重建优化后的编码器进行端到端训练后,仍最大限度保留了预训练编码器的语义知识。
3.2 视觉生成(Visual Generation)
- 文本到图像(T2I):
- 在 GenEval 与 DPG-Bench 上评估。
- 尽管可训练参数量仅约 7 亿且训练数据仅 1200 万图文对,dRAE 在 GenEval 总体得分达到 0.63,在 DPG-Bench 达到 80.58,与参数量和数据量显著更大的基线(如 Janus、Meissonic 等)相比具有竞争力。
- 类别到图像(C2I):
- 在 ImageNet 上对比 HSQ 与 VQ 在不同码本大小(32,768 与 65,536)下的生成质量。
- HSQ 在所有码本规模下均优于 VQ 基线,gFID 更低且 IS 更高。
4. 消融实验(Ablative Study)
4.1 损失函数设计消融(Loss Design)
系统性地移除或替换路由机制与损失项,验证各组件贡献:
- 基线:标准 VQ(欧几里得路由 + 欧几里得码本损失 + 欧几里得承诺损失)。
- 变体组合:将路由替换为余弦相似度,将码本损失替换为球形目标,以及将承诺损失也改为余弦形式。
- 关键发现:最佳性能由余弦路由 + 球形码本损失 + 欧几里得承诺损失组合取得;若承诺损失也改为全球形,则性能显著下降,证明幅度监督对收敛至关重要。
4.2 对语义影响的消融(Impact on Semantics)
- 使用量化特征训练多模态大模型,比较 VQ 与 HSQ 在下游理解任务上的表现。
- 结果:HSQ 随码本规模增大(16,384 → 65,536)性能持续提升;VQ 基线则相对停滞。此外,VQ 训练后期存在重建损失持续震荡与蒸馏损失不可逆上升的不稳定现象,而 HSQ 未出现此问题。
4.3 表征对齐消融(Alignment)
- 引入 iREPA 以改进内部表征对齐。
- 结果:HSQ 从对齐策略中获益更明显;VQ 基线虽早期收敛加速,但随后进入性能平台期并伴随显著训练震荡。
5. 超越图像重建的扩展实验(Beyond Image Reconstruction)
为验证 HSQ 对不同代理任务的通用性,论文开展了两种初步实验:
5.1 特征重建(Feature Reconstruction)
- 以冻结编码器提取的特征 z 为重建目标,训练码本与 ViT 解码器以输出 z ,监督信号为 L2 距离。
- 结果:HSQ(PSNR 8.24,余弦相似度 0.92)显著优于 VQ(PSNR 4.91,余弦相似度 0.81)。
5.2 联合图像-语义建模(Joint Image-Semantic Modeling)
- 在冻结视觉编码器与可训练语言主干之间插入量化器,同时并联可训练 ViT 像素解码器;使用 400 万图像-查询-回复对进行端到端联合优化。
- 对比方法:VQ、IBQ、IBQ-L2(归一化变体)。
- 结果:HSQ 在不依赖随机采样的情况下,实现了最高的码本利用率,并在图像重建与视觉理解两个代理任务上收敛最快。
6. 附录补充实验(Additional Results in Appendix)
- DINOv2 编码器验证:使用 DINOv2-B 作为编码器训练 256 分辨率变体,验证 HSQ 对自监督视觉编码器分布的有效捕获;同时测试了融合多层特征(RAEv2 风格)的变体。
- 标准化理解设置对比:使用 Vicuna-7B 与仅 LLaVA-1.5 数据的标准化设置,进一步验证 dRAE 在统一 tokenizer 设置下的理解能力。
Q: 有什么可以进一步探索的点?
基于论文的实验发现与讨论,以下几方面值得进一步探索:
1. 数据与模型规模的系统扩展
论文在文本到图像生成部分明确指出,尚未进行详尽的数据整理与模型规模扩展(”We leave the exhaustive data and model curation for future study”)。当前生成模型仅使用约 1,200 万图文对和约 7 亿可训练参数。未来可在更大规模的数据集与模型容量下验证 dRAE 的 scaling law,探索其在高分辨率生成(如 1024×1024 及以上)中的极限性能。
2. 代理任务范式的泛化与优化
论文第 7 节初步验证了 HSQ 在特征重建与联合图像-语义建模中的有效性,但指出重建高维 patch embedding 仍具挑战性,归因于编码器表征的内在噪声与感知监督的缺失。未来可深入探索:
- 为高维特征重建设计专用的感知损失或蒸馏策略;
- 在更多样化的代理任务(如视频预测、3D 表征量化)中测试 HSQ 的通用性;
- 优化联合优化框架下语言模型与视觉 tokenizer 的协同训练动态,特别是进一步研究熵正则化在不同解码器架构中的必要性与最优配置。
3. 更高效的码本结构与层次化设计
尽管 HSQ 在 K=131,072 时实现了 100% 码本利用率,但词汇量的线性增长仍会带来输出层的显存压力。未来可探索:
- 残差量化或层次化超球面量化:在保持角度路由优势的同时,通过多阶段离散化进一步压缩词汇表的实际存储开销;
- 可变码长机制:根据语义复杂度自适应分配码本条目数,而非固定每 token 单码。
4. 理论分析与收敛性保证
当前对 HSQ 有效性的分析主要基于经验观察(如梯度范数稳定、角度分布均匀)。未来工作可从理论上刻画:
- 角度路由目标在高维超球面上的 Voronoi 剖分性质;
- 码本更新的切空间动力学与局部收敛条件;
- 欧几里得承诺损失与球形码本损失联合优化时的稳定性边界。
5. 跨编码器与跨模态的通用性验证
论文主要基于 SigLIP2 与 DINOv2 系列编码器。HSQ 的设计理念依赖于 VFM 表征的超球面集中特性,未来需系统验证:
- 在其他对比学习、掩码自编码器或最新联合嵌入预测架构(如 JEPA 系列)中的兼容性;
- 将超球面量化扩展至视频、音频或多模态对齐空间(如统一图文音的嵌入空间),考察其是否同样能缓解高维离散化中的崩溃问题。
6. 与先进表征对齐技术的深度融合
消融实验表明 HSQ 与 iREPA 等表征对齐方法结合时获益更显著。未来可研究:
- 将超球面几何显式纳入对齐目标的度量设计;
- 探索对比学习或互信息最大化在 HSQ 码本学习中的辅助作用,以进一步强化语义保持能力。
7. 统一多模态模型中的端到端训练策略
论文在联合图像-语义建模实验中发现,当 LLM 作为解码器时,码本利用高度依赖熵正则化。这提示在统一理解与生成的 MLLM 中,tokenizer 的训练目标与 LLM 的预训练/微调目标之间存在复杂的相互作用。未来可探索:
- 无需显式熵正则化的自适应码本利用机制;
- 将 dRAE 直接集成到下一代统一多模态预训练框架中的最佳实践。
Q: 总结一下论文的主要内容
该论文提出了一种面向高维视觉表征的离散化框架,旨在解决现有向量量化方法在扩展词汇规模时面临的**码本崩溃(codebook collapse)**问题,并统一支持视觉理解与生成任务。以下从问题背景、核心方法、实验验证与主要结论四个方面进行总结。
1. 问题背景与动机
视觉理解与生成任务长期依赖异构的表征体系:视觉基础模型(VFMs)通过对比或自监督学习将图像映射到高维、语义丰富的空间(维度 $d ∈
768, 1536
),而生成模型通常依赖低维 VAE 瓶颈( d ∈
8, 64
$)。近期研究表明,高维语义特征可直接用于图像重建(Representation Autoencoder, RAE),从而有望统一两种范式。然而,将此类高维信号离散化时,传统向量量化(VQ)方法在码本规模超过 16K 后迅速崩溃——大量码本条目闲置,语义保真度与重建质量难以兼顾。
论文识别出崩溃的根因在于度量失配(metric mismatch):VFM 的语义信息主要编码在特征向量的角度/方向上,而 VQ 采用欧几里得距离进行码本分配与更新。这使得量化过程对特征幅度的各向异性尺度过度敏感,导致码本嵌入出现高方差幅度与不均匀角度分布,最终被少数大范数向量”劫持”,引发崩溃。
2. 核心方法:Hyper-Spherical Quantization (HSQ)
为化解上述矛盾,论文提出 dRAE(discrete Representation Autoencoder),其核心模块为 HSQ。关键设计在于显式解耦语义方向与特征幅度:
角度路由(Angular Routing):以余弦相似度替代欧几里得距离进行最近邻码本搜索,使码本分配完全基于语义方向:
i^* = argmax_i (z · c_i) / (|z|_2 |c_i|_2)球形码本损失(Spherical Codebook Loss):约束码本更新在切空间内,直接对齐单位超球面上的方向:
L_(codebook) = 1 - sg[(z) / (|z|_2)] · (z_q) / (|z_q|_2)幅度感知的承诺损失(Magnitude-Aware Commitment Loss):保留欧几里得 ell2 承诺损失,为投影特征提供幅度监督,避免重建所需的结构/纹理信息丢失:
L(commit) = |z - sg[z_q]|_2^2
通过上述”角度-幅度”解耦,HSQ 在实现幅度均质化与角度均匀性的同时,避免了对输入强制施加严格的单位球先验,兼顾了语义完整性与重建保真度。
3. 实验验证
论文围绕三大任务开展广泛实验:
- 图像重建:在 ImageNet-1K 上,dRAE 随码本规模从 2^(14) 扩展至 131,072 持续改进,实现 100% 码本利用率、0.42 rFID 与 24.52 PSNR,显著优于 VQRAE 等基线。
- 多模态理解:基于 Qwen2.5-7B 的 MLLM 在 MMBench、TextVQA、SEEDBench 等基准上表现竞争力强,证明离散化后的表征最大限度保留了预训练编码器的语义知识。
- 视觉生成:在文本到图像(T2I)与类别到图像(C2I)任务中,基于 HSQ 的 tokenizer 均优于 VQ counterpart;结合 iREPA 表征对齐技术后,HSQ 展现出更显著的增益与更稳定的训练动态。
消融实验进一步验证了各组件的必要性:单纯全局使用球形损失会导致收敛失败,而”角度路由 + 球形码本损失 + 欧几里得承诺损失”的组合为最优配置。
此外,论文还探索了 HSQ 在特征重建与联合图像-语义建模中的通用性,表明其不依赖特定的代理任务或随机采样技巧即可实现高码本利用率与快速收敛。
4. 主要结论
- 度量对齐是关键:在高维视觉表征离散化中,码本优化的几何必须与潜在空间的内在结构(超球面)对齐,否则难以避免崩溃。
- 解耦优于强制归一化:通过角度路由与幅度保留的解耦设计,HSQ 在不牺牲重建质量的前提下实现了可扩展的离散化。
- 简化与可扩展性:dRAE 无需分阶段训练、特定的嵌入初始化、防崩溃技巧或课程学习,训练流程大幅简化,且词汇量可扩展至 131K 以上。
- 统一视觉理解与生成:该研究为下一代多模态大模型提供了一个高吞吐、语义密集且瓶颈自由的视觉 tokenizer 基础。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Tianren Ma,Lin Long,Chuyan Chen,Mu Zhang,Junbo Zhao,Tong Zhang,Qixiang Ye
PDF URL: https://arxiv.org/pdf/2607.22148.pdf
Arxiv URL: https://arxiv.org/abs/2607.22148
Arxiv ID: 2607.22148
CoolPaper URL: https://papers.cool/arxiv/2607.22148
Published: 2026-07-29T01:10:37.189Z
Updated: 2026-07-29T01:10:37.189Z
13. ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
Abstract:Multimodal large language models (MLLMs) hold immense potential to revolutionize clinical practice, yet deploying them in the medical domain is fundamentally a vision-centric challenge: models must absorb knowledge from heterogeneous 2D and 3D medical images, and evaluation protocols must align with radiologists’ clinical practice and provide an accurate, fine-grained and factualness-driven assessment. In this paper, we introduce ClinFusion, a vision-centric MLLM designed for holistic medical understanding that systematically addresses these limitations. We propose a compositional and cascaded vision encoder architecture featuring a Cascade Spatial-Aware Locality Fusion operator that unifies diverse 2D and native 3D medical image understanding within a fused encoder. We further introduce a vision-grounded evaluation framework, including MedIF-Bench for instruction-following assessment and a region-of-interest-grounded method for clinically aligned and factualness-driven report generation evaluation. We show that ClinFusion sets a new state-of-the-art across a comprehensive suite of 2D and 3D multimodal medical benchmarks—-spanning visual question answering, report generation, and instruction following—-as well as textual medical tasks, outperforming leading open-source medical MLLMs (\textit{e.g.}, Hulu-Med, Lingshu) on 20 out of 24 benchmarks and demonstrating multimodal capabilities better than powerful proprietary models such as GPT-5.2 and Gemini-3-Flash on 13 out of 16 benchmarks, and can be further augmented with agentic tool use for retrieval-augmented and tool-assisted clinical workflows. A blinded evaluation by board-certified radiologists confirms that ClinFusion produces the highest-ranked reports, and validates our RoI-grounded metric as achieving the strongest correlation with expert judgment among all automatic evaluation metrics examined.
中文摘要
摘要:多模态大型语言模型(MLLMs)具有变革临床实践的巨大潜力,但在医疗领域的部署本质上是一个以视觉为中心的挑战:模型必须从异构的二维和三维医学影像中吸收知识,评估协议必须与放射科医师的临床实践保持一致,并提供准确、细粒度且以真实性为导向的评估。在本文中,我们提出了 ClinFusion,一种面向视觉中心的 MLLM,旨在实现整体性医学理解,并系统性地解决这些局限性。我们提出了一种组合式的级联视觉编码器架构,包含一个级联空间感知局部融合(Cascade Spatial-Aware Locality Fusion)操作器,可在融合编码器内统一理解多种二维和原生三维医学影像。我们进一步引入了面向视觉的评估框架,包括用于指令遵循评估的 MedIF-Bench,以及用于临床对齐和真实性驱动报告生成评估的基于感兴趣区域(ROI)的方法。结果表明,ClinFusion 在涵盖视觉问答、报告生成和指令遵循的全面二维与三维多模态医学基准测试,以及文本医学任务中,均创下了新的最先进水平,领先于主要开源医学 MLLMs(如 Hulu-Med、Lingshu)在 24 个基准测试中的 20 个,在 16 个基准测试中,其多模态能力优于像 GPT-5.2 和 Gemini-3-Flash 这样的强大专有模型的 13 个基准测试,并且可以通过智能代理工具进一步增强,用于检索增强和工具辅助的临床工作流。由持证放射科医师进行的盲评确认,ClinFusion 生成的报告排名最高,并验证了我们的基于 ROI 的指标在所有自动评估指标中与专家判断的相关性最强。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文试图解决将多模态大语言模型(MLLMs)部署到医疗临床实践中时,在以视觉为核心的医学理解与评估方面存在的根本性局限。具体而言,论文系统性地针对以下三个紧密耦合的挑战:
1. 异构视觉知识吸收的架构局限 现有医学MLLM大多依赖单一的单体式视觉编码器,难以同时捕捉嵌入在高度多样化医学影像中的丰富视觉知识。医学影像本质上具有多模态异质性,涵盖多种2D模态(如X光、病理切片、眼底图像)和3D模态(如CT与MRI)。现有策略通常陷入两种极端:
- 2D中心方法:将3D体数据采样为密集2D切片处理,不可避免地牺牲关键的3D空间结构信息;
- 3D中心方法:采用专门的3D编码器,但需要大量复杂的数据对齐流程。 因此,亟需一种能够原生统一处理多样化2D与3D医学影像,并渐进式丰富视觉表征的组合式架构。
2. 视觉基础评估与临床实践的脱节 当前医学MLLM的评估协议存在两个关键缺陷,阻碍了其向真实临床场景的转化:
- 指令遵循能力被忽视:医学领域微调往往会损害模型的指令遵循(instruction-following)能力,而这是可靠临床交互和后续评估的先决条件。现有基准未对此进行系统评估。
- 报告生成评估范式失准:临床报告生成是最重要的应用之一,但现有评估存在双重问题:其一,评估时要求模型在无患者临床背景(如转诊指征、病史)的情况下生成全面报告,这与放射科医生在实际临床中基于特定背景聚焦特定解剖区域的实践严重不符;其二,现有自动指标(如BLEU、ROUGE、RadGraph-F1等)仅依赖表面词汇/语义匹配或实体提取,存在同义词不敏感、长度偏差等问题,无法对诊断声明进行准确、细粒度、基于事实的分解(如区分正确匹配、遗漏与幻觉)。
3. 模型知识的静态性与感知瓶颈 MLLMs本质上是被动且孤立的系统:其参数知识是静态的,推理过程缺乏可追溯性,并在某些需要像素级精度的专业感知任务上存在瓶颈,而专门的AI模型在这些任务上仍具优势。
为应对上述挑战,论文提出了 ClinFusion,一个以视觉为中心的多模态大语言模型系统,其核心贡献包括:
- 提出组合式级联视觉编码器架构及Cascade Spatial-Aware Locality (CaSL) Fusion 算子,通过2D编码器的级联交互与2D锚定的深度感知融合,统一异构2D与原生3D医学影像理解;
- 引入视觉基础评估框架,包括用于评估医学指令遵循的 **
Authors: Hangjie Yuan,Yichen Qian,Zhiwei Tang,Xianzhe Xu,Lirong Wu,Sicheng Yang,Jinwang Wang,Pengju Wang,Zhitao Zeng,Yizeng Han,Yan Xing,Shengxuan Luo,Tao Feng,Qing Xie,Weigen Yao,Yi Yang,Zuozhu Liu,Jiasheng Tang,Shaocheng Wang,Jitao Wang,Jiahong Dong,Weihua Chen,Feng Xu,Fan Wang
PDF URL: https://arxiv.org/pdf/2607.24743.pdf
Arxiv URL: https://arxiv.org/abs/2607.24743
Arxiv ID: 2607.24743
CoolPaper URL: https://papers.cool/arxiv/2607.24743
Published: 2026-07-29T01:10:43.964Z
Updated: 2026-07-29T01:10:43.964Z
14. Chamaileon: Cross-Context Binder Design with Contextualized Modeling and Mixed Sampling
Abstract:The rapid evolution of generative models has unlocked new potentials in protein binder design, a pivotal task in structural biology, by facilitating end-to-end generation via joint sequence-structure modeling or hallucination. However, existing approaches are predominantly implemented under a single-target, single-state assumption, limiting their ability to model multi-target or multi-state interactions required for advanced function-oriented protein design. Here, we introduce Chamaileon, which unifies multi-target and multi-state binder design by formulating the problem as cross-context binding landscape modeling. The framework is underpinned by a training paradigm termed In-Context Complex Co-Design (I3CD) for context-aware sequence-structure co-modeling. During inference, we employ Mixture-of-Paths Sampling (MoPS), a scalable strategy that optimizes a single sequence across contexts while alleviating the scarcity of high-quality multi-conformational paired data. Extensive evaluation on our newly constructed benchmark, CROSS, demonstrates that Chamaileon effectively generates sequences adaptable to diverse conformational landscapes and multi-target requirements. The code is available on this https URL.
中文摘要
摘要:生成模型的快速发展通过联合序列-结构建模或“幻觉”实现的端到端生成,解锁了蛋白质结合剂设计的新潜力,这是一项在结构生物学中至关重要的任务。然而,现有的方法主要是在单目标、单状态假设下实现的,限制了其对先进功能导向蛋白质设计所需的多目标或多状态相互作用的建模能力。在此,我们介绍了Chamaileon,它通过将问题表述为跨情境结合景观建模,实现了多目标和多状态结合剂设计的统一。该框架基于一种称为情境内复合体协同设计(In-Context Complex Co-Design, I3CD)的训练范式,用于情境感知的序列-结构协同建模。在推理过程中,我们采用路径混合采样(Mixture-of-Paths Sampling, MoPS),这是一种可扩展策略,可在多情境下优化单个序列,同时缓解高质量多构象配对数据的稀缺问题。在我们新构建的基准CROSS上进行的广泛评估表明,Chamaileon能够有效生成适应不同构象景观和多目标需求的序列。代码可在此https URL获取。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决蛋白质结合剂(binder)设计中的“单靶点、单状态”局限,并将其统一扩展至复杂的跨上下文(Cross-Context)结合场景。具体而言,论文识别并试图解决以下核心问题:
1. 多状态(Multi-State)结合剂设计的缺失
许多蛋白质通过在不同构象状态间切换来执行生物学功能。现有方法通常针对目标的单一静态结构进行优化,所生成的结合剂难以在目标蛋白发生显著构象重排(如功能开关过程中的大尺度结构变化)时保持界面兼容性与亲和力。这导致设计的结合剂在实际动态环境中可能失效。
2. 多靶点(Multi-Target)结合剂设计的困难
在治疗与功能调控中,常需要单一结合剂同时高亲和力地结合多个不同靶点(或遵循特定的选择性模式,如“结合A和B,但不结合C”)。然而,现有流程多为逐靶点独立优化;简单的联合优化易导致非特异性结合,而串行优化则常因过度拟合某一靶点而在其他靶点上失败。
3. 统一计算框架与方法学缺口
论文指出,多状态与多靶点设计在计算结构上具有共性——即单一序列必须同时满足多个存在显式权衡的约束。现有生成模型缺乏支撑这一“多对一”映射的关键能力:
- 序列-结构噪声调度的解耦:在联合建模中,需要独立的序列与结构噪声调度,以维持序列在多个构象上下文之间的一致性;
- 推理时的多目标权衡优化:缺乏在推理阶段引导采样过程、以平衡不同结构上下文间冲突约束的策略;
- 跨上下文的系统评估:缺乏能够衡量结合剂在多种构象或靶标集合上联合兼容性的基准测试,而非仅在孤立快照上评估性能。
4. 高质量多构象配对数据的稀缺
端到端地训练一个直接映射多目标输入到单一序列与多构象输出的模型面临严峻的数据瓶颈:相比静态结构,能够捕捉结构多样性的高质量多状态相互作用数据极为有限,且现有架构难以灵活处理可变数量的构象条件。
为应对上述挑战,论文提出了 Chamaileon 框架,通过上下文感知的序列-结构协同设计(I3CD)与混合路径采样(MoPS),在训练与推理阶段分别实现对跨上下文依赖的建模与对多约束的平衡,并构建了专门的 CROSS 基准用于系统评估。
Q: 有哪些相关研究?
根据论文第2节(Related Work),相关研究主要围绕以下三个方向展开:
1. 多状态设计(Multi-state Design)
该领域的生成式方法主要利用推理时轨迹混合与显式集合训练来支持多状态兼容性:
- ProteinGenerator (L
Authors: Hengyuan Cao,Shizhuo Cheng,Mingxuan Liu,Weicheng Huang,Yunhong Lu,Chenxi Cai,Yan Zhang,Min Zhang
PDF URL: https://arxiv.org/pdf/2607.23518.pdf
Arxiv URL: https://arxiv.org/abs/2607.23518
Arxiv ID: 2607.23518
CoolPaper URL: https://papers.cool/arxiv/2607.23518
Published: 2026-07-29T01:12:22.442Z
Updated: 2026-07-29T01:12:22.442Z
15. Reasoning Denoiser: Denoising Reasoning Traces for Hallucination Detection in Large Reasoning Models
Abstract:Large reasoning models (LRMs) generate long reasoning traces before producing final answers. While these traces may contain useful signals for hallucination detection, harnessing them is non-trivial because long trajectories often include noisy steps that obscure the cues relevant to truthfulness assessment. In this paper, we identify two prevalent forms of reasoning noises, i.e., irrelevant steps and repetitive steps, and show that both substantially degrade hallucination detection performance. Existing confidence-based scores and naive embedding-based filtering fail to reliably separate noisy from informative steps. To address this challenge, we propose REDE, a novel learning framework for denoising reasoning traces for hallucination detection. Specifically, REDE leverages final-answer attention as an automatic supervision signal to shape the step-level representation space, yielding refined embeddings in which noisy steps can be reliably identified and filtered. REDE can be readily plugged into diverse hallucination detectors by operating on the filtered reasoning trajectory after removing noisy steps. Extensive experiments on multiple reasoning benchmarks show that REDE consistently improves detection performance over competitive baselines.
中文摘要
摘要:大规模推理模型(LRMs)在产生最终答案之前会生成长推理轨迹。虽然这些轨迹可能包含对幻觉检测有用的信号,但利用它们并非易事,因为长轨迹通常包含噪声步骤,这些噪声会掩盖与真实性评估相关的线索。本文中,我们识别了两种普遍存在的推理噪声形式,即无关步骤和重复步骤,并表明这两者都会显著降低幻觉检测性能。现有的基于置信度的评分和简单的基于嵌入的过滤方法都无法可靠区分噪声步骤与信息步骤。为应对这一挑战,我们提出了REDE,一种用于为幻觉检测去噪推理轨迹的新型学习框架。具体而言,REDE利用最终答案注意力作为自动监督信号来塑造步级表示空间,从而生成精炼的嵌入,在该嵌入中可以可靠地识别并过滤噪声步骤。REDE可以通过在移除噪声步骤后的过滤推理轨迹上操作,轻松地接入各种幻觉检测器。在多个推理基准上的大量实验表明,REDE在检测性能上持续超越有竞争力的基线方法。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决大型推理模型(LRMs)在进行幻觉检测时,其生成的长推理轨迹中包含大量噪声步骤(无关步骤与重复步骤),从而掩盖或稀释了与答案真实性相关的有效信号,导致幻觉检测性能下降的问题。
具体而言,论文关注的核心挑战包括:
- 噪声步骤对检测信号的干扰:LRMs 在给出最终答案前会产生冗长的推理轨迹,其中普遍存在两类噪声——无关步骤(不贡献问题特定信息)和重复步骤(信息已被后续步骤覆盖)。实验表明,这些步骤会显著降低幻觉检测性能。
- 现有信号的失效:
- 基于置信度的分数(confidence-based scores)无法可靠区分信息丰富步骤与噪声步骤,其分布高度重叠。
- 基于原始嵌入的朴素过滤方法(如 k NN)虽能识别部分无关步骤,但无法区分语义相近的重复步骤与真正的信息丰富步骤。
- 推理轨迹不能直接用于下游检测:简单地使用完整推理轨迹非但无法持续提升幻觉检测效果,反而可能因噪声累积而损害检测器表现。
为此,论文提出了 REDE(Reasoning Denoiser)框架,其核心思路是:利用最终答案 token 对各推理步骤的注意力分数作为无需人工标注的监督信号,学习一个轻量级投影网络来重塑步骤级表示空间,使得信息丰富步骤聚集成团、噪声步骤分散孤立,进而通过基于距离的简单规则(如 k NN)滤除噪声步骤,最终将清洗后的推理轨迹接入各类下游幻觉检测器,以提升检测性能与可靠性。
Q: 有哪些相关研究?
与这篇论文相关的研究可大致归纳为以下四个方向:
1. 通用幻觉检测方法
针对标准大语言模型(LLMs)的幻觉检测,已有大量研究探索了不同范式:
- 基于 Logit 与概率的不确定性估计:利用模型输出的概率分布或置信度进行不确定性量化。
- 基于一致性的评分方法:通过多次采样并衡量响应间的一致性来检测幻觉,例如基于语义熵或特征值分解的评分。
- 言语化置信度(Verbalized Confidence):直接引导模型以自然语言形式表达其对自身输出的确信程度。
- 基于嵌入(Embedding-based)的方法:在隐藏状态或表示空间中构建探测分类器,以区分真实与幻觉内容。
- 机制性区分研究:从神经元或回路层面揭示事实性幻觉与推理驱动型幻觉的内在差异。
这些工作对标准 LLMs 有效,但**未针对生成冗长推理轨迹的大型推理模型(LRMs)**进行设计。
2. 面向 LRM 的幻觉检测方法
随着 LRMs(如 OpenAI o 系列、DeepSeek-R1)的兴起,近期研究开始直接利用其推理轨迹进行幻觉检测:
- 推理与答案一致性评估:联合检查最终答案与推理过程之间的一致性。
- 流式幻觉检测:在长链式推理过程中进行实时检测。
- 答案级表示塑造(ARS):通过在推理轨迹边界施加潜在扰动来塑造答案级表示。
然而,上述方法未解决推理轨迹内部嵌入的噪声步骤问题。其中与 REDE 最相近的是 ARS,但它将整条推理轨迹视为单一上下文整体处理,缺乏对步骤级噪声的显式建模与过滤。
3. 推理步骤选择与压缩
近期亦有工作聚焦于从长推理轨迹中选择或压缩步骤,以提升生成质量与效率:
- 基于困惑度变化的步骤评估(如 SPIRIT):通过移除某步骤后困惑度的变化来衡量其重要性。
- 基于首词惊讶度(Surprisal)的支点识别(如 ASAP):利用第一个 token 的惊讶度定位逻辑转折点。
- 基于步骤级熵的压缩(如 Step Entropy):通过熵值压缩冗余推理。
- 基于隐藏状态探针的步骤贡献评估(如 STEP):训练轻量探针判断步骤价值。
- 其他重要性信号:利用多种步骤级信号识别关键或冗余步骤。
这些方法的核心目标是改进推理生成本身,而非服务于下游的幻觉检测任务;因此其选择信号并不能可靠地识别出对幻觉检测有害的噪声步骤。
4. 注意力机制的应用
注意力分数在 LLMs 中的应用也为相关技术提供了基础:
- Token 级过滤与 KV 缓存压缩:利用注意力模式剪枝不重要的 token 以加速推理。
- 可解释性分析:应用注意力模式识别推理过程中的关键句子,以理解模型行为。
REDE 与上述工作的核心区别在于:首次将最终答案对推理步骤的注意力作为训练与过滤信号,专门塑造面向幻觉检测的步骤级表示空间,从而在无需人工标注的情况下实现可靠的噪声步骤滤除。
Q: 论文如何解决这个问题?
论文提出 REDE(Reasoning Denoiser) 框架,通过**塑造步骤级表示空间(step-level representation space)**来识别并滤除推理轨迹中的噪声步骤,从而提升下游幻觉检测器的性能。其核心解决思路可概括为:以最终答案的注意力作为无监督监督信号,学习一个轻量级投影,将原始嵌入空间转化为“信息丰富步骤紧凑聚集、噪声步骤分散孤立”的新空间,再基于简单距离规则完成过滤。具体方法包含三个关键组件:
1. 以最终答案注意力为步骤赋予无监督分数
REDE 首先利用大型推理模型(LRM)自身的内部注意力机制,估算每个推理步骤对最终答案的贡献程度。设 a_T 为答案的最后一个 token, I_i 为第 i 个推理步骤对应的 token 索引集合,步骤得分定义为 a_T 对该步骤所有 token 的注意力质量之和:
si = ∑(t ∈ Ii) exp(q(a_T)^top k(x_t)/√ω){∑(u=1)^(N) exp(q(a_T)^top k(x_u)/√ω)}
其中 q(·) 、 k(·) 分别为查询与键投影, ω 为投影维度。该分数的直觉在于:
- 无关步骤与答案查询对齐弱,获得低注意力;
- 重复步骤的信息已被后续步骤覆盖,注意力倾向于流向后面的重复项,同样获得低注意力;
- 信息丰富步骤直接支撑答案,获得高注意力。
论文指出,尽管该注意力信号具有区分性,但直接以注意力阈值作为推理时的过滤规则存在两大局限:其一,测试时需为每个样本重新计算注意力,推理开销大;其二,逐样本的原始注意力分数对轨迹长度与结构敏感,稳定性不足。因此,REDE 将其作为训练监督信号而非直接推理规则。
2. 学习去噪的步骤表示空间
REDE 训练一个轻量投影网络 f_varphi: R^d to R^(d’) ,将原始步骤嵌入映射至一个更利于噪声过滤的新空间。
步骤嵌入提取。 为突出内容承载型 token,每个步骤的嵌入通过困惑度加权平均(perplexity-weighted aggregation)计算:
ei = ∑(t ∈ Ii) PPL(x_t) , h(x_t)∑(t ∈ Ii) PPL(x_t), quad PPL(x_t) = (1) / (pθ(xt mid x(<t)))
其中 h(xt) 为 token 的隐藏状态, pθ(xt mid x(<t)) 为模型赋予的下一 token 概率。困惑度越高的 token 权重越大,因其通常携带更丰富的语义信息。
构造代理集合。 对每条训练轨迹,按注意力分数 si(i=1)^K 排序,取 top- rho% 构成信息丰富步骤的代理集合 T ,取 bottom- rho% 构成噪声步骤的代理集合 B 。
投影学习。 投影网络 fvarphi 以余弦相似度 sim(ij) = (z_i^top z_j) / (|z_i|_2 |z_j|_2) 为基础,优化以下三项目标:
L = E(i, j ∈ T) (1 - sim(ij))(L)(compact) + λ(disperse) E(i, j ∈ B) sim(ij)(L)(disperse) + λ(separate) E(i ∈ T), j ∈ mathcalB sim(ij)(L)(separate)
- L_(compact) :拉近信息丰富步骤,使其形成紧凑簇;
- L_(disperse) :打散噪声步骤,防止其聚集成团而难以被识别为孤立点;
- L_(separate) :增大两类步骤的全局间距。
通过该目标,投影后的空间中信息丰富步骤呈现局部高密度,而噪声步骤呈现局部稀疏,从而为基于距离的过滤奠定几何基础。
3. 推理时过滤与下游检测
在推理阶段,REDE 无需计算注意力,也无需标注数据,仅依赖学习到的投影 f_varphi 完成过滤:
- 嵌入投影:对测试轨迹 C = c1, dots, c(K) ,提取困惑度加权嵌入 e_i 并投影得到 z_i = f_varphi(e_i) ;
- 距离评分:计算每个步骤的 k -最近邻( k NN)余弦距离得分:
Si = 1 - barz_i^top z_i^((k)){|z_i|_2 Q4: 论文做了哪些实验? 论文在四个推理基准数据集、两种LRM家族及多种下游检测器上开展了系统性实验,涵盖主结果对比、跨数据集迁移、大规模模型扩展、消融分析与补充验证五个层面。以下为具体实验内容: 1. 实验设置 - 数据集:TruthfulQA(开放域问答)、MATH(由 MATH500、AIME 2024 与 AIME 2025 构成)、CodeElo(竞赛级代码生成)、MULTIHOPQA(多跳问答);附录另补充 GSM8K。 - 模型:Qwen3-8B/32B、DeepSeek-R1-Distill-Llama-8B、DeepSeek-R1-Distill-Qwen-32B。 - 下游检测器:Contrast-Consistent Search(CCS)、Supervised Probing、Perplexity-based detector、Verbalized Certainty。 - 基线方法:涵盖 Lexical Similarity、SelfCheckGPT、Semantic Entropy、EigenScore、P(True)、HaloScope、TSV、CED、HaMI、RHD、RACE、HalluGuard、ARS 等十余种竞争方法。 - 评估指标:主指标为 AUROC;附录补充 Accuracy、F1 及任务级正确率。 2. 主要结果 2.1 原始轨迹 vs. 过滤后轨迹 在 Qwen3-8B 与 DeepSeek-R1-Distill-Llama-8B 上,论文对比了使用完整原始推理轨迹与使用 REDE 过滤后轨迹的检测性能(Table 2)。结果表明: - 在所有数据集与全部四种检测器上,REDE 过滤均带来一致且显著的提升。 - 例如,Qwen3-8B 在 TruthfulQA 上,CCS 的 AUROC 从 68.63% 提升至 87.32%;Supervised Probing 从 80.42% 提升至 86.44%。 2.2 与竞争基线的全面对比 Table 1 报告了 REDE 与 14 种基线的 AUROC 对比: - REDE (CCS) 在无监督设置下全面优于所有基线,在 TruthfulQA 达到 87.32%。 - REDE (Probing) 在有监督设置下达到最高性能,例如 MATH 上 87.06%、CodeElo 上 87.19%。 - 相比最强的表示塑造基线 ARS,REDE 在 MATH 上领先 4.3 个百分点(81.33 vs. 77.03),证明步骤级去噪对幻觉检测的关键作用。 3. 泛化能力与模型扩展 3.1 跨数据集迁移 REDE 的投影网络在源数据集上训练后直接应用于目标数据集(Figure 5a)。结果显示: - 投影学到的去噪信号具有较强的分布外泛化性。 - 例如,在 MULTIHOPQA 上训练、CodeElo 上测试,AUROC 达到 88.04%,甚至略高于同域结果(87.19%)。 3.2 更大规模 LRM 在 Qwen3-32B 与 DeepSeek-R1-Distill-Qwen-32B 上的实验(Figure 5b 与 Table 13)表明: - REDE 持续超越 RACE 与 ARS 等强基线。 - 在 Qwen3-32B 的 TruthfulQA 上达到 90.87%(相对 RACE 提升 5.73%);在 DeepSeek-R1-Distill-Qwen-32B 上达到 78.95%(相对 RACE 提升 13.11%)。 4. 消融实验与设计选择分析 论文系统验证了 REDE 各组件的有效性(Section 5.2 与 Appendix B): | 实验内容 | 关键发现 | | —- | —- | | 替代步骤选择策略(Table 3) | 与 Random、STEP、SPIRIT、ASAP、Step Entropy、LLM-as-Judge 对比,REDE 在所有检测器上均最优。 | | 直接注意力过滤 vs. REDE(Table 4) | 直接以注意力阈值过滤(如 80.51%)一致弱于 REDE 的学习型过滤(87.32%),证明投影学习的必要性。 | | 损失函数组件(Figure 6a, 12) | 移除 Lcompact 、 Ldisperse 或 Lseparate 均导致性能下降;移除 Ldisperse 下降最大(86.44% → 80.06%)。t-SNE 可视化确认了各损失对嵌入空间的几何塑形作用。 | | 推理丢弃比例 zeta (Figure 6b) | 从 zeta=0 开始性能随过滤比例上升,在 zeta=70% 达到峰值,随后因过度过滤而下降。 | | 输出维度 d’ (Figure 6c) | d’=1024 时最佳,但在 32 至 4096 的宽范围内均保持较强性能。 | | 训练所用层(Figure 6d) | 中间至后期层最具判别力,但 REDE 在所有层上均优于原始轨迹。 | | 距离度量(Table 8) | 余弦、欧氏、马氏距离在过滤阶段效果相当,验证投影空间的稳定性。 | | 训练选择比例 rho (Table 7) | rho ∈ [20, 25] 时性能最优,过小则对比信号不足,过大则边界模糊。 | | 近邻数 k (Table 9) | k=15 时最优,且在所有测试取值下均优于原始轨迹。 | | 答案 token 位置(Table 10) | 使用最后一个答案 token 计算注意力最优,优于首 token、中间 token 或均值池化。 | | 步骤嵌入加权策略(Table 11) | 困惑度(PPL)加权平均 优于均匀平均与仅使用末 token。 | | 嵌入提取位置(Table 12) | 从 Transformer 块输出( f )提取优于从注意力输出或 QAttn(f) 提取。 | 5. 补充验证与鲁棒性分析 - 注意力信号验证(Appendix C.7):在 AIME 2024 上,丢弃高注意力步骤严重损害检测性能与答案嵌入相似度,而丢弃低注意力步骤则保持甚至提升性能,反向验证了注意力信号与步骤信息量的正相关性。同时,与基于位置的过滤(Drop-Earliest/Latest)对比,REDE 显著更优(Table 17, 18)。 - 黑盒适用性(Appendix C.8, Table 19):在仅能通过 API 访问目标模型时,使用代理白盒模型(Qwen3-32B)计算注意力与嵌入,REDE 仍一致优于原始轨迹,恢复大部分白盒场景下的增益。 - 真值标注鲁棒性(Appendix C.5, Table 15):分别采用 ROUGE-L、BLEURT 及不同法官模型(DeepSeek-R1-Distill-Qwen-32B)作为真值标签来源,REDE 始终表现最优。 - 生成采样策略(Appendix C.3, Table 14):Greedy decoding 一致优于温度 0.5 的多项式采样,为实际部署提供参考。 - 额外数据集(Appendix C.6, Table 16):在 GSM8K 上,REDE 过滤后的轨迹在 CCS、Probing、Perplexity、Verbalized 检测器上均显著优于原始轨迹。 - 步骤选择准确率(Appendix C.4):在人工标注的 AIME 2024 上,REDE 对“信息丰富 vs. 噪声”的二分类准确率达 86.37%。 - 对下游任务准确率的影响(Appendix C.9):在 MATH 上过滤约 70% 步骤后,任务正确率从 81. Q5: 有什么可以进一步探索的点? 基于论文内容与局限性,未来研究可从以下方向进一步拓展: 1. 将去噪机制前置于生成阶段 当前 REDE 属于后处理过滤模块,仅在推理轨迹生成完成后进行步骤筛选。一个自然的延伸是研究如何将步骤级信息量信号内嵌至 LRM 的训练或解码过程中,使模型在生成长链推理时主动抑制噪声步骤的产出。例如,可在强化学习或监督微调阶段引入步骤级紧凑性/稀疏性正则化,或在解码时设计基于注意力的早停与回溯机制。 2. 细粒度噪声类型建模与差异化处理 论文主要识别了无关步骤与重复步骤两类噪声。然而,实际推理轨迹中还可能存在其他有害模式: - 逻辑矛盾步骤:与先前推理或已知事实相冲突; - 低质量/错误推理步骤:虽与问题相关,但包含错误逻辑或计算; - 过渡性填充步骤:如“让我再想想”“嗯…”等元认知话语。 未来工作可构建更精细的噪声分类体系,并针对不同噪声类型设计差异化的检测与处理策略(如修正错误步骤而非简单丢弃)。 3. 探索替代性内部监督信号 REDE 以最终答案 token 对步骤的注意力作为核心监督信号。可进一步探索其他无需标注的内部信号是否同样有效,或与之互补: - 步骤间的相互注意力:利用后续步骤对先前步骤的引用强度判断冗余性; - 反向注意力(步骤→答案):衡量步骤自身对最终答案生成的“贡献度”; - Token 级 surprisal 或熵:高困惑度区域可能对应推理转折点或噪声; - 梯度/归因方法:通过输入梯度或集成梯度量化各步骤对答案正确性的因果影响。 4. 自适应与动态的过滤策略 REDE 在推理时采用固定的全局丢弃率 zeta (如 70%)。未来可研究自适应过滤: - 根据推理轨迹长度、问题复杂度或模型置信度,动态调整保留步骤的比例; - 设计基于阈值或贝叶斯决策的过滤准则,替代固定的 top- zeta% 删除规则; - 探索在线学习机制,使投影网络随用户反馈或新任务持续更新。 5. 与推理效率优化的协同设计 去噪后的轨迹长度显著缩短(约 70% 步骤被移除),这为计算效率优化提供了空间: - 将步骤级去噪与 KV Cache 压缩结合,在去除噪声步骤的同时释放对应的键值缓存; - 研究去噪后轨迹的投机解码(speculative decoding)或层跳过加速; - 开发针对长推理模型的轻量级流式去噪架构,避免对完整轨迹的后处理延迟。 6. 向多模态与工具使用场景扩展 当前 REDE 聚焦于文本型数学与问答推理。随着多模态推理模型(如视觉-语言推理)和工具增强模型(如代码解释器、搜索引擎)的兴起,未来可探索: - 视觉推理轨迹去噪:去除对图像理解无贡献的重复视觉分析或无关描述; - 工具调用链去噪:在 Agent 推理中识别冗余或无效的工具调用步骤,提升决策可靠性。 7. 从“去噪”到“纠错”:错误步骤的检测与修正 REDE 当前通过删除噪声步骤来降低干扰。更进一步的挑战是识别并修正导致幻觉的错误推理步骤,而非简单丢弃。这需要: - 区分“无关/重复”与“错误但相关”的步骤; - 结合外部验证器(如代码执行器、定理证明器)对可疑步骤进行修正; - 研究错误步骤的局部化与后续推理链的自动修复机制。 8. 理论分析的深化与推广 论文附录从 Fisher 可分性与 k -NN 局部密度角度给出了初步理论保障。未来可在更宽松的分布假设下(如非线性决策边界、重尾噪声)建立去噪后的风险上界,并量化不同噪声类型(无关 vs. 重复 vs. 错误)对下游检测器泛化误差的差异化影响。 Q6: 总结一下论文的主要内容 该论文针对大型推理模型(LRMs)的幻觉检测问题,提出了一种通过去噪推理轨迹来提升检测性能的新框架。以下是论文核心内容的系统总结: 1. 研究背景与核心问题 当前 LRMs(如 OpenAI o 系列、DeepSeek-R1)在给出最终答案前会生成冗长的推理轨迹。直觉上,这些中间推理步骤应包含判断答案是否真实的有效信号;然而,论文发现长轨迹中充斥的噪声步骤会严重稀释甚至掩盖这些信号,导致直接使用时幻觉检测性能不升反降。 论文识别了两类普遍存在的推理噪声: - 无关步骤:不提供与问题相关的有意义信息; - 重复步骤:其信息已被后续步骤覆盖,属于冗余内容。 实验表明,仅去除这些噪声步骤即可显著提升下游检测器的 AUROC(如提升 13.73%),印证了去噪的必要性。 2. 现有方法的局限 - 基于置信度的信号:反映的是模型对自身生成内容的确定性,而非步骤对下游幻觉检测的实用性;其分布在信息丰富步骤与噪声步骤间高度重叠。 - 基于原始嵌入的朴素过滤(如 k NN):虽能识别部分语义偏离的无关步骤,但无法区分与信息步骤语义相近的重复步骤。 3. 提出的方法:REDE 论文提出 Reasoning Denoiser(REDE),一个轻量级、无需人工标注的推理轨迹去噪框架,可即插即用于各类幻觉检测器。其核心思想是:利用 LRM 自身最终答案对推理步骤的注意力作为监督信号,学习一个投影网络来重塑步骤级表示空间,使得信息步骤与噪声步骤在投影空间中可分离。 3.1 步骤评分:最终答案注意力 设 a_T 为最终答案的最后一个 token, I_i 为第 i 个推理步骤的 token 索引集合,步骤得分 s_i 定义为 a_T 对该步骤的注意力质量之和:
s_i = ∑(t ∈ Ii) exp(q(a_T)^top k(x_t)/√ω){∑(u=1)^(N) exp(q(aT)^top k(x_u)/√ω)}
直觉上,无关步骤和重复步骤(信息已被后续步骤覆盖)均获得低注意力,而直接支撑答案的信息丰富步骤获得高注意力。 3.2 投影学习:塑造去噪表示空间 REDE 训练一个轻量级投影网络 f_varphi: R^d to R^(d’) ,将原始步骤嵌入映射至新空间。步骤嵌入采用困惑度加权平均以突出内容承载型 token:
e_i = ∑(t ∈ Ii) PPL(x_t) , h(x_t)∑(t ∈ Ii) PPL(x_t), quad PPL(x_t) = (1) / (pθ(xt mid x(<t)))
在训练中,按注意力分数取 top- rho% 和 bottom- rho% 分别作为信息丰富与噪声步骤的代理集合 T 和 B 。投影网络通过以下目标优化:
L = E(i, j ∈ T) (1 - sim(ij))(L)(compact) + λ(disperse) E(i, j ∈ B) sim(ij)(L)(disperse) + λ(separate) E(i ∈ T), j ∈ mathcalB sim(ij)(L)(separate)$$
其中 sim_(ij) 为余弦相似度。该目标使信息步骤紧凑聚集,噪声步骤分散不聚团,且两类全局分离。
3.3 推理时过滤
在测试阶段,REDE 将步骤嵌入投影后,计算每个步骤与其同轨迹内 k -最近邻的余弦距离 S_i 。信息步骤在投影空间中形成高密度簇,故 S_i 较小;噪声步骤稀疏孤立,故 S_i 较大。去除距离最大的 top- zeta% 步骤后,将过滤后的轨迹送入任意下游检测器(如 CCS、Supervised Probing、Perplexity、Verbalized Certainty)。
4. 实验结果
论文在 TruthfulQA、MATH、CodeElo、MULTIHOPQA 四个基准上,使用 Qwen3 与 DeepSeek-R1-Distill 系列模型进行验证。
- 相比原始轨迹的一致性提升:在全部数据集与检测器上,REDE 过滤后的轨迹均显著优于原始轨迹。例如,Qwen3-8B 在 TruthfulQA 上,CCS 的 AUROC 从 68.63% 提升至 87.32%;Supervised Probing 从 80.42% 提升至 86.44%。
- 相比竞争基线的优势:REDE 在有无监督设置下均达到最优。无监督的 REDE(CCS) 在 TruthfulQA 达到 87.32%;有监督的 REDE(Probing) 在 MATH 达到 87.06%,显著超越最强基线 ARS。
- 跨数据集泛化:在某一数据集上训练的投影网络可直接迁移至其他数据集,性能保持强劲(如在 MULTIHOPQA 上训练、CodeElo 上测试达到 88.04%)。
- 大模型扩展性:在 Qwen3-32B 与 DeepSeek-R1-Distill-Qwen-32B 上,REDE 持续超越基线(如 Qwen3-32B 在 TruthfulQA 达到 90.87%)。
- 消融验证:系统验证了损失函数各组件、丢弃比例 zeta 、投影维度、训练层选择、距离度量、注意力计算位置等设计选择,确认各部分均对性能有正向贡献。
5. 主要贡献
- 问题识别:首次系统揭示并量化了推理轨迹中的噪声步骤(无关与重复)对 LRM 幻觉检测的损害,确立步骤级过滤的重要性。
- 方法创新:提出 REDE 框架,以最终答案注意力为无监督信号,通过轻量级投影学习将步骤级表示空间重塑为“信息紧凑、噪声分散”的结构,实现可靠的噪声步骤识别与滤除。
- 广泛适用性:REDE 无需人工标注,推理时无需重新计算注意力,且与多种下游检测器兼容,在跨数据集、跨模型规模场景下均表现稳健。
- 理论与实证支持:附录提供理论分析,证明去噪后的轨迹在理想过滤条件下趋近 oracle 信息轨迹的检测风险上界;大量实验与定性分析验证了方法的有效性。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Junlin Fang,Do Nguyen-Thanh,Xiaogang Xu,Zhen Fang,Sean Du
PDF URL: https://arxiv.org/pdf/2607.22098.pdf
Arxiv URL: https://arxiv.org/abs/2607.22098
Arxiv ID: 2607.22098
CoolPaper URL: https://papers.cool/arxiv/2607.22098
Published: 2026-07-29T01:13:42.225Z
Updated: 2026-07-29T01:13:42.225Z
16. Codifying the Judge: Scalable Evaluation via Program Distillation
Abstract:LLM-as-a-judge has become the standard for automated evaluation, but it suffers from high cost, significant latency, and opaque decisions — limitations that undermine its scalability and reliability. We address these with a simple, efficient alternative: program distillation. Instead of prompting an LLM at the evaluation time, we distill its decision logic into a committee of programs that score candidates directly. These programmatic judges offer transparency, are easily inspected or edited, and eliminate per-sample API costs. Building on this notion, we introduce PAJAMA, a system that synthesizes programs as judges, aggregates their decisions into a joint verdict, and incorporates a fallback mechanism to selectively escalate low-confidence cases to an LLM. Across five datasets and four model families, we show that programmatic judges can match the performance of a 13B-size LLM judge. When using program outputs as routing signals, PAJAMA improves both accuracy and throughput and advances the Pareto frontier. Beyond evaluation, programmatic judges produce cheap and effective reward signals: on RewardBench, a reward model distilled from programs’ verdicts outperforms one trained on a proprietary LLM’s labels at two orders of magnitude lower API cost.
中文摘要
摘要:作为裁判的巨大语言模型(LLM-as-a-judge)已成为自动评估的标准,但其存在成本高、延迟大以及决策不透明的问题——这些限制削弱了其可扩展性和可靠性。我们提出了一种简单且高效的替代方案:程序蒸馏。与在评估时直接提示LLM不同,我们将其决策逻辑蒸馏为一个由程序组成的委员会,这些程序能够直接对候选项进行评分。这些程序化裁判具有透明性,可以轻松检查或编辑,并且消除了每条样本的API成本。在此基础上,我们引入了PAJAMA系统,该系统生成程序作为裁判,将它们的决策聚合为联合判决,并引入回退机制,选择性地将低置信度的案例升级到LLM。在五个数据集和四个模型家族上的实验表明,程序化裁判能匹配13B规模LLM裁判的性能。当使用程序输出作为路由信号时,PAJAMA在准确率和吞吐量上均有所提升,并推进了帕累托前沿。除了评估之外,程序化裁判还能够生成廉价且有效的奖励信号:在RewardBench上,由程序判决蒸馏而成的奖励模型其表现超过了以专有LLM标签训练的模型,同时API成本降低了两个数量级。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Tzu-Heng Huang,Shengqi Qiu,Frederic Sala
PDF URL: https://arxiv.org/pdf/2607.22561.pdf
Arxiv URL: https://arxiv.org/abs/2607.22561
Arxiv ID: 2607.22561
CoolPaper URL: https://papers.cool/arxiv/2607.22561
Published: 2026-07-29T01:13:49.619Z
Updated: 2026-07-29T01:13:49.619Z
17. DecoupleMix: Decoupled Ratio Search and Convex Allocation for Scalable VLM Data Recipes
Abstract:While data curation for Vision Language Models (VLMs) is increasingly active, public practice for constructing pretraining mixtures remains largely heuristic: practitioners stack datasets that pass quality filters, set cross-domain ratios by intuition, and lack a principled, attributable criterion for admitting new data, while frontier recipes remain undisclosed. We formulate data construction as a systematic mixture-optimization problem and turn it into a reproducible engineering discipline by decoupling the mixture into two orthogonal sub-problems: inter-class ratios across capabilities and intra-class ratios within a category. For inter-class allocation, we use a single-variable iterative search; for intra-class composition, we apply a multidimensional, dataset-level assessment scoring Quality and Difficulty, and formulate selection as a constrained convex optimization with a diversity objective. The DecoupleMix framework delivers two critical capabilities: guiding what data to collect next and rendering dataset validation a controlled, attributable experiment. Experiments show our approach consistently surpasses heuristic baselines. Moreover, optimal ratios discovered on small-scale proxies transfer seamlessly to larger scales without retuning. Using 80B additional multimodal continue-pretraining tokens, our VLM is competitive with strong open-source models trained with substantially larger multimodal budgets.
中文摘要
摘要:尽管视觉语言模型(VLM)的数据整理日益活跃,但用于构建预训练混合数据的公开实践仍主要依赖经验:从业者堆叠通过质量过滤的数据集,根据直觉设定跨领域比例,并且缺乏用于引入新数据的系统性、可追溯标准,而前沿的配方尚未公开。我们将数据构建形式化为系统的混合优化问题,并通过将混合拆分为两个正交子问题,使其成为可复现的工程学科:即能力间类别比例和类别内比例。对于类别间分配,我们使用单变量迭代搜索;对于类别内组成,我们应用多维数据集级评分评估质量和难度,并将选择问题形式化为带有多样性目标的约束凸优化。DecoupleMix 框架提供了两个关键功能:指导下一步应收集的数据,并将数据集验证转化为可控、可追溯的实验。实验表明,我们的方法始终优于经验性基线。此外,在小规模代理上发现的最优比例可以无缝迁移到更大规模而无需重新调整。使用额外 800 亿多模态连续预训练 tokens,我们的 VLM 在性能上可以与使用大得多多模态预算训练的强大开源模型竞争。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Jiahao Xie,Zhongbin Guo,Qianle Wang,Ruiqi Lu,Dongling Xiao,Wanxuan Sun,Cheng Yang
PDF URL: https://arxiv.org/pdf/2607.24516.pdf
Arxiv URL: https://arxiv.org/abs/2607.24516
Arxiv ID: 2607.24516
CoolPaper URL: https://papers.cool/arxiv/2607.24516
Published: 2026-07-29T01:15:29.956Z
Updated: 2026-07-29T01:15:29.956Z
18. A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever
Abstract:Improving a language model today means retraining it: enormous compute, a new opaque model each cycle, non-deterministic output. We take the opposite path: the model stays frozen, and a persistent memory of verified solutions grows beside it. Once a problem family is solved and has passed an independent verification step that never consults the answer key, every new instance of that family is answered at zero generation tokens, bit-exact, deterministically. Across 180 fresh instances spanning nine problem families, four architectures from four vendors - dense and mixture-of-experts - each score 180/180 at zero generation tokens per answer: execution-bound capability decoupled from parameter scaling. A negative control attributes the capability fully to the memory: emptied, it solves nothing. The same verify-before-store contract holds for open-ended reasoning: 88/88 consistency-gated acceptances across all four models, machine-checked formal proof, and reasoning-method transfer at 77/80. Memory selection takes 1.4 microseconds; a full reuse completes in 6-23 ms at 36 mWh. Approximate similarity retrieval selects the wrong item 94.3% of the time on a 4,500-item verified store where exact addressing makes zero errors. The store also serves as working context at a scale no shipped engine matches: a 6,000,000-token movable window on a single 46 GB GPU at flat memory, where vLLM stops at 30,399 tokens and SGLang silently truncates past 32,000. On published benchmarks, frontier models remain far ahead of any 12B at raw from-scratch reasoning; on everything this system has solved and verified, the comparison inverts: a frontier API call pays a fresh generation pass on every query, forever, while verified reuse costs zero tokens and returns the identical bits every time. A public testbench with free, rate-limited access accompanies this report: this https URL
中文摘要
摘要:如今改进语言模型意味着重新训练它:巨大的计算量,每个周期都会得到一个新的不透明模型,输出结果不确定。我们采取了相反的路径:模型保持冻结,同时一个经过验证的解决方案的持久记忆在其旁边增长。一旦某个问题家族被解决,并通过了独立验证步骤(该步骤从不查询答案),该家族的每个新实例都可以在零生成令牌下得到回答,位精确且确定性的。在涵盖九个问题家族的180个全新实例中,来自四家供应商的四种架构——密集型和专家混合型——每个在每个答案上以零生成令牌的得分为180/180:执行绑定能力与参数规模无关。一个负对照完全将能力归因于记忆:如果清空,什么也解决不了。同样的“先验证后存储”合同适用于开放式推理:在所有四种模型中,88/88的一致性门控接受,机器核验形式化证明,以及77/80的推理方法迁移。记忆选择耗时1.4微秒;完整重用在36 mWh下完成需要6-23毫秒。在一个有4,500条已验证存储项的近似相似性检索中,错误选择项的概率为94.3%,而确切寻址则零错误。该存储还作为工作上下文,其规模远超任何已发布引擎:在单个46 GB GPU上的6,000,000令牌可移动窗口,vLLM在30,399令牌时停止,SGLang在32,000令牌后默默截断。在已发布的基准测试中,前沿模型在原始从零推理能力上仍远超任何12B模型;在本系统已解决并验证的所有内容上,比较结果反转:前沿API调用需要每次查询都进行一次新的生成,而验证重用成本为零令牌,每次返回相同的位。附带一个公开测试平台,提供免费、限速访问:https URL
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文试图解决当前大型语言模型(LLM)部署与能力增长中的三个核心结构性缺陷,并提出一种替代性的系统级方案。具体而言,其针对的问题可归纳如下:
1. 对已解决工作的重复推导成本
当前的前沿模型API被用作“过度参数化的非确定性执行引擎”——对于早已解决并长期验证过的任务,每次查询仍需支付完整的生成令牌(generation tokens)与代码执行成本,重新从头推导答案。论文指出这是一种架构性浪费,并试图通过“一次推导、一次验证、永久复用”的机制,将边际生成成本降至零。
2. 模型输出的非确定性与不可审计性
传统生成范式下,同一问题对同一模型重复提问无法保证位精确(bit-exact)的一致输出。这种非确定性排除了模型在需要审计追踪、可复现性或监管签名的场景中的应用。论文试图通过冻结模型权重(frozen weights)并配合确定性复用路径,实现每次输出完全相同的比特序列。
3. 能力增长对重新训练的依赖
现有范式下,提升模型能力意味着重新训练:消耗巨量计算资源(GPU-月)、产生需要重新审计的新黑箱模型,且每次迭代都伴随行为漂移的风险。论文试图证明:能力增长可以脱离参数规模的缩放与权重更新,转而通过在模型旁侧积累经过独立验证的持久化记忆(verified persistent memory)来实现。
4. 近似检索在可验证知识上的灾难性失效
论文指出,行业默认的向量近似相似性检索(vector-style retrieval)在可验证的可执行知识场景中会灾难性地失败(实验测得在4,500项存储中错误率高达94.3%)。因此,论文试图建立一种基于**精确内容寻址(exact content addressing)**的存储与完整性层,确保选中的是正确的已验证项,而非“看起来验证过的错误邻居”。
总结
论文并非试图在原始推理能力上超越前沿模型(明确承认在冷启动推理上12B模型落后于前沿模型),而是试图解决**“已验证领域的执行经济学”**问题:对于可验证、可复现的工作负载,如何以零边际令牌、毫秒级延迟、位精确且可审计的方式提供服务,同时使模型能力随验证记忆的积累而永久增长,无需重新训练。
Q: 有哪些相关研究?
论文在 §2.9 及相关章节中,将相关研究划分为六大功能类别,并明确区分了本文系统(Galahad/Merlin)与这些工作的输入–输出差异:现有工作通常只覆盖四大核心属性(精确选择、位精确确定性输出、无答案密钥验证、零生成令牌复用)中的一个或部分,而本文系统首次将四者整合为一条完整的链条。以下是详细的文献分类与对照:
1. 语义缓存与检索增强生成(Semantic Cache / RAG)
这类系统通过近似相似性匹配来加速回答,但设计上即非精确。
- GPTCache
7
(Bang, 2023):面向 LLM 应用的开源语义缓存,通过相似性检索命中缓存结果以节省成本。
与本文的区别:语义缓存是近似匹配,无法保证选中的是经过验证的确切项目;§2.7 的测量显示,在 4,500 项已验证存储上,近似匹配的错误率高达 94.3%,而本文的精确内容寻址实现零碰撞。
2. 前缀与 KV 缓存复用(Prefix / KV Caching)
这类研究通过复用注意力状态或前缀计算来降低延迟,但仍需逐次解码新令牌,且不具备验证环节。
- Prompt Cache
5
(Gim et al., 2024):模块化的注意力复用,用于低延迟推理。 - CacheBlend
6
(Yao et al., 2025):面向 RAG 场景的缓存知识融合,加速 LLM 服务。 - SGLang
8
(Zheng et al., 2024):结构化语言模型程序的高效执行。 - PagedAttention
9
(Kwon et al., 2023):vLLM 中的高效内存管理,支持服务级别的 KV 缓存管理。
与本文的区别:这些系统复用的是部分计算状态(prefix/KV),每次调用仍需生成新令牌(非零生成令牌),且不对存储内容进行独立验证。
3. 智能体技能库与工具归纳(Agent Skill Libraries / Tool Induction)
这类工作关注让模型积累可复用的工具或程序,但其接受/验证步骤通常依赖另一个模型的判断或特定任务的神谕(oracle),而非独立的、不依赖答案密钥的验证门。
- Large Language Models as Tool Makers
1
(Cai et al., 2023) - Voyager
2
(Wang et al., 2023):开放式具身智能体,通过技能库终身学习。 - TroVE
3
(Wang et al., 2024):诱导可验证且高效的工具箱以解决程序化任务。 - DreamCoder
4
(Ellis et al., 2021):通过觉醒–睡眠库学习引导归纳式程序合成。
与本文的区别:这些系统的库积累通常由模型自身或任务特定的裁判判定是否接受,缺乏能够拒绝微妙错误候选的独立验证门(§2.6)。
4. 智能体记忆与计划缓存(Agent Memory & Plan Caching)
这类工作探索智能体的程序性记忆、计划缓存和来源感知记忆,但未实现已验证可执行解决方案的零生成令牌复用。
- Agentic Plan Caching
19
(Zhu et al., 2025):测试时记忆,用于快速且低成本的 LLM 智能体。 - Memp
20
(Fang et al., 2025):探索智能体的程序性记忆。 - From Lossy to Verified: A Provenance-Aware Tiered Memory for Agents
21
(Zhu et al., 2026):来源感知的分层智能体记忆。 - Portable Agent Memory
15
(Ravindran, 2026):跨异构 AI 智能体的密码学验证记忆转移协议。
与本文的区别:尽管部分工作引入了密码学验证或来源追踪,它们并未将精确选择、位精确复用与预存储验证整合为一条零生成令牌的执行路径。
5. KV 缓存优化、共享与持久化记忆(KV Cache Optimization & Persistent Memory)
这类研究聚焦于 KV 缓存的压缩、共享或训练出的持久化记忆,但同样未覆盖完整的验证–复用链条。
- VeriCache
16
(Yao et al., 2026):将有损 KV 缓存转换为无损 LLM 推理,关注压缩保真度的验证。 - Trained Persistent Memory for Frozen Decoder-Only LLMs
17
(Jeong, 2026):为冻结模型训练持久记忆。 - DroidSpeak
18
(Liu et al., 2026):跨微调模型变体的 KV 缓存共享。
与本文的区别:这些工作处理的是模型内部状态(KV cache)的持久化或共享,而非在模型外建立经过独立验证的可执行知识记忆,并不要求零生成令牌或位精确输出。
6. 验证与测试方法论基础(Foundations of Verification & Testing)
本文的验证门并非凭空构建,而是建立在经典的软件测试与形式化验证方法之上:
- LeanDojo
10
(Yang et al., 2023):基于检索增强语言模型的定理证明,提供机器检验证明的能力。 - Differential Testing
11
(McKeeman, 1998):差分测试。 - On Testing Non-Testable Programs
12
(Weyuker, 1982):变质测试(metamorphic testing)的理论基础。 - CodeT
13
(Chen et al., 2022):基于生成测试的代码生成。 - Self-Consistency Improves Chain of Thought Reasoning
14
(Wang et al., 2022):自洽性检验。
与本文的关系:这些经典方法构成了 Merlin 验证管道中“独立、无答案密钥验证门”的基础组件(§2.6),用于在存储前捕获包括微妙错误候选在内的无效解。
7. 作者的前期工作(Author’s Prior Work)
本文报告的 Galahad/Merlin 系统是作者先前工作的延伸与集成:
- Byte-Exact Deduplication in Retrieval-Augmented Generation
25
:检索场景下的字节精确去重实证分析。 - Merlin: Deterministic Byte-Exact Deduplication for Lossless Context Optimization
26
:确定性字节精确去重引擎。 - Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel
27
:冻结模型上的字节精确状态复用。
与本文的关系:这些前期工作分别解决了去重、存储完整性与状态复用问题;本报告将其扩展为一个完整的已验证知识系统,并在四个模型架构上进行了统一的输入–输出级测量。
Q: 论文如何解决这个问题?
论文通过一种名为 Galahad 的系统及其底层的确定性存储与完整性引擎 Merlin,在输入–输出层面重新定义了模型与知识之间的契约。该方案不修改模型权重,而是通过一个与模型并行增长的、经过独立验证的持久化记忆(verified persistent memory)来解决问题。具体机制可分为以下几个层面:
1. 核心设计原则:冻结模型,增长记忆
- 模型冻结:底层语言模型(如 Gemma-4-12B 等)的权重永久保持不变,不进行微调、持续训练或任何参数更新。
- 能力外置化:所有能力提升均通过在模型旁积累“已验证解决方案”的记忆来实现。该记忆一旦写入便永久保留,且只会增长不会收缩。
- 经济逻辑转换:将成本结构从 C(percall)(N) = N · C(query) (每次查询都付费生成)转换为 C(system)(N) = C(deposit) + N · C(reuse) ,其中 C(reuse) = 0 生成令牌。盈亏平衡点 N^* = C(deposit) / C(query) 通常在数十次查询内即可达到。
2. 沉积路径:先验证,后存储(Solve → Verify → Store)
任何知识进入记忆前,必须通过一个不依赖答案密钥(answer-key-free)的独立验证门。该流程在输入–输出层面的表现为:
- 候选生成:由冻结模型或外部来源产生候选解决方案(可以是可执行程序、形式证明、推理框架或参数化方法)。
- 独立验证:
- 机器检验的形式证明:形式证明需通过独立的形式证明检查器(如 Lean 类系统),且故意错误的陈述会被拒绝。
- 自动化一致性/变质检查:对开放式推理,采用可机器检查的自洽性门控;自相矛盾的变体会被拒绝。
- 分层边界测试:对计算类候选,会在 150 个边界案例上运行,以捕获那些能通过单一检查但存在微妙错误的解。
- 精确去重与写入:Merlin 引擎以字节级精确度执行去重。在 6,000 个候选项(含 2,000 个唯一项)的测试中,恰好存入 2,000 个,过滤掉全部 4,000 个重复项;单字节差异即视为新项。
3. 复用路径:精确寻址与零令牌执行
当面对新查询时,系统并非重新生成答案,而是通过以下步骤执行:
- 精确内容寻址(Exact Content Addressing):系统在 1.4 µs(95th percentile)内从存储中选择正确的验证项。在 4,500 个独立存储项的测试中,精确寻址的碰撞率为 0%,而行业标准的近似相似性匹配在此规模下的错误选择率高达 94.3%。
- 参数化重执行而非缓存查找:存储的是“参数化验证方法”,而非具体答案。面对同一问题家族的新参数实例(即模型从未见过的输入值),冻结模型会重新执行该方法,计算出针对新输入的答案。因此这不是传统意义上的记忆化(memoization)。
- 零生成令牌输出:重执行过程消耗 0 个生成令牌,在 6–23 ms 内返回位精确(bit-exact)且完全确定性的答案。
4. 组合与上下文扩展:记忆作为可移动、可合并的单元
已验证知识不仅可以单独复用,还能在运行时组合:
- 单一上下文合并:多个独立存入的验证项可被合并为一个工作上下文(working context)。已测上限包括九个小项(约 1,300 令牌)或六个 specialist 域项(共 14,134 令牌)。模型能在其中识别各来源、追溯事实归属,并进行跨项计算(例如结合物理常数项与计算规则项得出新结果)。
- 复合问题求解:对于需要调用三个独立存储方案才能求解的复合问题,系统在零生成令牌下完成计算(实测 5/5)。移除任一必需项则结果降为 0/5,证明能力完全归因于记忆组合。
5. 开放式推理的验证合约
该机制不仅适用于精确计算,也扩展到无唯一数值答案的开放式领域:
- 形式推理:机器检查的形式证明作为准入门槛。
- 一致性门控:模型以机器可检查的形式输出推理过程;一致性门接受自洽推理,拒绝自相矛盾变体。在跨四模型的测试中,88/88 次一致性门控接受均正确复用。
- 推理方法迁移:已验证的推理方法可被迁移到全新领域(如医学分诊),迁移后的适配版本同样需通过一致性门。跨四模型测试达 77/80。
6. 完整性层 Merlin 的保障
Merlin 作为确定性存储引擎,提供了支撑上述行为的可测量保障:
- 崩溃安全性与中断恢复:在强制内存上限下,传统存储会崩溃(访问冲突),而 Merlin 拒绝超限请求并保持存活;写入中断后,已提交条目零损坏,且进程重启后可字节级精确恢复。
- 可信路径加速:存在一条经信任优化的复用路径,其运行速度比完全沙盒路径快 93.9 倍,但在 140/140 实例中与沙盒路径字节级一致,且能正确容纳对抗性输入。
- 存储完整性:在撕裂写入(torn-write)测试中,传统文件存储完全不可读,而 Merlin 保持先前提交条目完整可读。
7. 超大上下文窗口作为运行时载体
已验证存储还充当可移动的工作上下文窗口。在单张 46 GB GPU 上,系统维持了 6,000,000 令牌的 movable window,GPU 内存保持平坦(仅漂移 +263 MB),且深层探针检索耗时与浅层相同(约 0.55–0.59 秒)。相比之下,vLLM 在 30,399 令牌处硬错误,SGLang 在约 32,000 令牌后静默截断。
总结
简言之,论文通过将“推导”(derivation)与“执行”(execution)解耦来解决问题:一次性地求解并独立验证,然后永久以零边际生成成本、毫秒级延迟、位精确且确定性的方式执行。该能力被外置到一个模型无关的持久化记忆层中,通过精确内容寻址和完整性保证,替代了传统部署中对昂贵、非确定性、不可审计的重复生成的依赖。
Q: 论文做了哪些实验?
论文报告了覆盖九大实验领域的系统性测量,所有结果均基于实际运行而非理论估算。以下按实验类别整理:
1. 核心验证复用实验(§2.1)
- 设置:将一台冻结的 120 亿参数开放模型(Gemma-4-12B)接入一个覆盖九个算法与数学问题家族的已验证记忆库。
- 测试负载:180 个全新参数实例(其中五个家族各 12 个实例,四个家族各 30 个实例),每个实例的输入值均未在记忆库中出现过。
- 结果:180/180(100%)正确,每答案 0 生成令牌;整个电池消耗实测能量 6.5 Wh。
- 沉积成本:九个家族的一次性求解–验证活动共消耗 16,579 生成令牌。
- 经济平衡点:对于每查询 500–1,000 令牌的典型任务,盈亏平衡点在
N^ = C(deposit)C(query)
即 *17–34 次查询 之间;超过后边际成本恒为零。
2. 架构不变性与模型独立性实验(§2.2)
- 设置:将同一套记忆–验证机制原封不动地应用于四家不同厂商、四种无关架构的开放权重模型。
- 参测模型:
- Gemma-4-12B(dense)
- Qwen3-14B(dense)
- DeepSeek-Coder-V2-Lite(mixture-of-experts)
- Phi-4(14B,dense)
- 结果:四个模型均达到 180/180,0 生成令牌,每答案能量 6.3–6.5 Wh。
- 结论:能力层完全外置于模型,验证知识的投入不因换模型而失效。
3. 负面控制与归因实验(§2.3)
- 空内存对照:在保持冻结权重不变的前提下,将记忆库完全清空。系统无法解决任何问题,证明全部可观测能力归属于存储的验证知识,而非模型权重本身。
- 外部解决方案探针:选择一个超出冻结模型自身冷启动能力的问题家族,将独立编写、预先通过验证门(不接触基准答案密钥)的外部解决方案存入记忆。系统在 30 个全新实例上达到 30/30,0 生成令牌,模型本身未输出任何内容。
4. 知识组合与复合问题求解实验(§2.4, §2.4b)
- 跨项计算(复合问题):构造需要同时调用三个独立存储方案才能回答的复合问题。
- 完整记忆:5/5 正确,0 生成令牌。
- 移除任一必需项:0/5,证实答案由组合计算产生,而非查找。
- 合并上下文识别:
- 2 项合并(~2,400 tokens):2/2 正确识别并描述来源。
- 3 项合并:3/3 正确。
- 5 项合并:输出窗口触及的 4 项全部正确识别。
- 9 项小项合并(~1,300 tokens):触及的 7/9 正确命名,零错误归属。
- 大规模合并上下文:将六个 specialist 域独立验证项合并为 14,134 tokens 的单一工作上下文。系统输出单一复合分阶段答案,每项事实均可追溯至原始来源,无跨源误归。
- 跨域计算:合并物理常数项与计算规则项,要求模型使用两者计算新结果;输出 44 N,与真值一致。另将医学与天文学两个无关域事实合并,模型在两种配置下均能于同一答案中正确调用两个域的事实。
5. 开放式推理验证实验(§2.5)
- 机器检验的形式证明:模型撰写形式数学证明,独立形式证明检查器首次接受;作为对照,故意错误的命题( 2+2=5 )被同一检查器拒绝。
- 一致性门控开放式推理:模型以机器可检查格式输出推理过程,自动一致性门接受自洽推理、拒绝自相矛盾变体。跨上述四个模型,各覆盖二十余种推理框架,共 88/88 次门控接受后复用正确。
- 推理方法迁移:将已验证的推理方法迁移至全新领域(医学分诊),由模型自行适配;适配版本仍须通过一致性门。跨四模型:77/80 通过。
- 声明性事实知识早期门控:对照 grounded reference corpus,门控对 3 个虚构声明全部拒绝(0/3),对 6 个真实声明接受 5 个(5/6);伴随推理通过三项独立一致性不变性检查,矛盾变体被拒绝。
- 复用延迟:完整恢复–再验证周期实测中位数 6–23 ms(因模型而异)。
6. Merlin 完整性层实验(§2.6)
- 错误候选捕获:一个能通过朴素单次检查但存在微妙错误的候选解,被分层验证过程捕获并拒绝,且记录具体反例;每个候选在准入前经受 150 个边界案例测试。
- 零错误准入:在所有测试输入上,存款门准入的错误候选数为 0。
- 大规模精确去重:注入 6,000 个候选(含 2,000 个唯一项),存储层恰好存入 2,000 个,过滤全部 4,000 个字节级重复;单字节差异即视为新项。
- 内容密钥性能:在六类密钥中速度最快;原生计算耗时 3.7 ns/key(每秒 2.71 亿键),比加密哈希快 60.2×,比标准库默认快 18.5×;10 万次重复解析输出完全一致;单核吞吐 16 GB/s,16 核 63 GB/s。
- 硬内存上限生存性:在强制内存上限下,朴素存储直接崩溃(访问冲突、进程死亡),Merlin 拒绝超限需求并保持运行。
- 中断写入恢复:模拟写入中断后,Merlin 先前已提交条目零损坏,进程重启后字节级精确恢复;同条件下传统文件存储完全不可读。
- 保障套件:14 项引擎保障全部通过实测(14/14)。
7. 寻址精度与性能开销实验(§2.7)
- 选择基准:在 4,500 项已验证存储中,精确内容寻址耗时 1.4 µs(95th percentile),9/9 选择正确;全程集成路径(含生产存储层)中位数 1.6 µs,95th percentile 17 µs。
- 碰撞率:4,500 个
Q: 有什么可以进一步探索的点?
基于论文第 6 节(Roadmap)及第 4 节(Boundary Conditions)中明确声明的边界与未来方向,以下是可进一步探索的研究与实践路径:
1. 大规模跨域验证记忆的构建与压力测试
- 当前状态:系统已在数百个验证项上完成测量,但尚未扩展到数千级别跨域条目。
- 探索方向:将记忆库从当前规模扩展至数千个已验证条目,验证 Merlin 的精确去重、完整性保障与寻址性能在更大规模下的表现。安全存款门(safe-deposit gate)与唯一性账本(uniqueness ledger)的机制已就绪,需在大规模异构知识上进行实测。
2. 知识组合深度的上限突破
- 当前状态:已验证的组合上限为 9 个并行小项(约 1,300 tokens)或 6 个 specialist 项(14,134 tokens)的合并上下文,且跨项计算仅演示了 2 个领域的融合。
- 探索方向:
- 测试超过 9 个独立存储项的合并上下文行为;
- 探索更复杂的跨域复合推理链(multi-hop computation across >2 domains);
- 验证更长合并上下文下的来源归因(source attribution)是否保持零错误。
3. 生产流量中的命中率与系统级经济性量化
- 当前状态:论文已给出单一家族的盈亏平衡点 N^* ≈ 17–34 次查询,但尚未提供真实生产负载下的系统级命中率统计。
- 探索方向:在实际业务流量中测量“已解决家族”的命中比例,将单家族成本模型转化为全局节能/降本指标,量化全量替换为 Galahad 后的总拥有成本(TCO)。
4. 大规模公开基准的预注册评估
- 当前状态:作者明确表示大型公开基准扫测需要庞大的预存记忆库作为前提,目前尚未完成测量,因此未做声明。
- 探索方向:在积累足够大的验证记忆库后,对标准公开基准(如数学、代码推理基准)进行配对统计(paired statistics)评估,比较冷启动与已验证复用两种状态下的完整性能曲线。
5. 验证门向声明式事实知识的扩展
- 当前状态:验证门主要针对可执行的算法/数学/形式证明,以及开放式一致性推理。声明性事实知识的验证尚处早期(6 取 5 的初步结果已存档)。
- 探索方向:建立基于独立符号权威(independent symbolic authorities)的声明式事实验证门,对非执行类知识(如医学事实、法律条文)进行无答案密钥的准入控制,并在 held-out 评估集上测量假阳性/假阴性率。
6. 自主知识积累(自治飞轮)
- 当前状态:当前所有验证知识均为人工触发或半自动沉积;论文明确指出“自主发明真正的新颖困难知识”是路线图内容,而非当前声明。
- 探索方向:实现持续自导向的求解–验证–沉积循环(continuous self-directed solve-verify-deposit),使系统能够在无人干预的情况下扩展已验证领土,同时保持同等证据标准。
7. 超大规模可移动上下文窗口的架构扩展
- 当前状态:在单张 46 GB GPU 上已测得 600 万 tokens 的平坦内存窗口,容量受存储带宽而非显存容量限制。
- 探索方向:探索跨多节点或多卡的存储带宽扩展方案,测试千万级甚至亿级 token 的可移动窗口在分布式环境下的延迟与一致性表现。
8. 冷启动推理能力的弥补与混合策略
- 当前状态:论文明确承认在冷启动(cold-start)推理上,前沿模型显著优于 12B 模型;本文系统的优势仅限于“已解决并验证”的领土。
- 探索方向:研究如何将 Galahad 的零成本复用机制与前沿模型的强冷启动能力结合,例如以前沿模型作为“教师”生成候选解,经 Merlin 验证后存入记忆供冻结小模型永久复用,形成大小模型的分层架构。
9. 验证机制对更长形式证明与更复杂软件任务的适应性
- 当前状态:形式验证演示了机器检查证明的准入,但复杂度有限。
- 探索方向:测试验证门在更大规模软件项目(如完整算法实现)、更长数学证明(如竞赛级几何证明)上的延迟与可靠性,特别是在 150 边界案例分层测试无法穷举时的替代策略。
10. 近似检索与精确寻址的混合架构
- 当前状态:论文以测量表明,在可验证知识上近似相似性检索灾难性失败(94.3% 错误率),因此完全采用精确内容寻址。
- 探索方向:在非可验证、模糊语义领域(如创意写作、开放式对话)探索近似检索作为精确寻址的前置过滤层,仅在进入可验证执行域时切换为精确寻址,构建分层路由机制。
Q: 总结一下论文的主要内容
这篇论文报告了一种名为 Galahad(底层引擎为 Merlin)的工业系统的测量结果,其核心主张是:在可验证、重复出现的任务领域,冻结一个 120 亿参数的小模型,并通过一个严格验证的持久化外置记忆执行复用,可以在成本、延迟、确定性和可审计性上同时超越前沿大模型的逐次生成模式。以下是论文主要内容的结构化总结。
1. 研究背景与核心问题
当前语言模型部署存在三个结构性缺陷:
- 重复推导的浪费:对已解决的工作,每次 API 调用仍支付全额生成成本,重新“推理”早已验证的答案。
- 非确定性与不可审计性:传统生成无法保证相同输入产生位精确(bit-exact)的相同输出,排除其在审计、监管和复现性场景中的应用。
- 能力增长绑定重新训练:提升能力意味着消耗 GPU-月进行再训练,产出新的黑箱模型,且行为需重新审计。
此外,论文指出,行业默认的向量近似检索在可验证的可执行知识场景中会灾难性失效,不能作为安全复用的基础。
2. 核心方案:冻结模型,验证后存储,零成本复用
论文提出的系统采取“模型冻结 + 记忆增长”的替代范式:
- 模型冻结:底层语言模型(如 Gemma-4-12B)权重永不更新,不做微调。
- 验证-存储合约:任何知识进入记忆前,必须通过独立的、**从不接触答案密钥(answer-key-free)**的验证门。验证形式包括机器检验的形式证明、自动化一致性/变质检查、以及 150 个边界案例的分层测试。
- 精确内容寻址:通过 Merlin 引擎实现字节级精确的内容寻址与去重,拒绝近似相似性匹配。
- 参数化重执行:记忆库存储的是参数化验证方法,而非具体答案。面对同一问题家族的全新输入,模型重执行该方法计算答案,因此不是传统记忆化(memoization)。
- 经济学结构:成本从线性增长模式 C(percall)(N) = N · C(query) 转变为
C(system)(N) = C(deposit) + N · C(reuse)
其中 C(reuse) = 0 生成令牌。一次性沉积成本(如 16,579 令牌覆盖 9 个家族)在 17–34 次查询后摊平,之后边际成本恒为零。
3. 关键实验发现
(1) 核心复用:零令牌、位精确、100% 覆盖
在 9 个问题家族共 180 个全新参数实例上,冻结的 12B 模型配合验证记忆达到 180/180(100%),每答案 0 生成令牌,总耗时 6–23 ms,每答案能耗约 36 mWh。
(2) 架构不变性
将同一记忆机制应用于四家不同厂商、四种无关架构(dense 与 mixture-of-experts):
- Gemma-4-12B、Qwen3-14B、DeepSeek-Coder-V2-Lite、Phi-4(14B) 所有模型均达到 180/180,0 生成令牌,证明能力完全外置于模型架构。
(3) 归因与负控制
- 空记忆对照:清空记忆后系统完全失效(0/180),证实能力全部来自记忆。
- 外部方案探针:将一个超出冻结模型冷启动能力的家族的独立验证解存入记忆,系统在 30 个全新实例上达到 30/30,模型本身零输出。
(4) 知识组合与合并上下文
- 复合问题:需同时调用 3 个独立存储方案的复合问题达到 5/5;移除任一必需项则降至 0/5。
- 合并上下文:支持将多达 9 个独立小项(约 1,300 令牌)或 6 个 specialist 项(共 14,134 令牌)合并为单一工作上下文,模型可正确识别来源、无跨源误归,并能跨域计算(如结合物理常数与计算规则得出 44 N)。
(5) 开放式推理验证
- 机器检验证明:形式证明首次通过独立检查器;故意错误命题被拒绝。
- 一致性门控:跨四模型的 88 次自洽推理复用全部正确(88/88)。
- 推理迁移:已验证推理方法迁移至全新领域(如医学分诊),跨四模型达到 77/80。
(6) 精确寻址 vs. 近似检索
在 4,500 项已验证存储上:
- 精确内容寻址:选择错误率 0%,零碰撞。
- 有损近似匹配(控制组):错误映射到邻项的比例高达 94.3%。
(7) 超大可移动上下文窗口
在单张 46 GB GPU 上,系统维持 6,000,000 令牌的可移动窗口,GPU 内存保持平坦(漂移仅 +263 MB),深层探针检索与浅层同速(约 0.55–0.59 秒)。相比之下,vLLM 在 30,399 令牌处硬错误,SGLang 在约 32,000 令牌后静默截断。
4. Merlin 完整性层的保障
作为底层存储与完整性引擎,Merlin 的实测保障包括:
- 零错误准入:所有测试输入上,错误候选进入记忆的数量为 0。
- 大规模精确去重:6,000 候选中含 2,000 唯一项,恰好存入 2,000 个,过滤全部 4,000 个重复项。
- 崩溃与中断恢复:在强制内存上限下,传统存储崩溃而 Merlin 存活;模拟写入中断后,已提交条目零损坏,进程重启可字节级精确恢复。
- 性能:内容密钥计算 3.7 ns/key,单核寻址吞吐 16 GB/s;完整复用路径比全沙盒快 93.9 倍,且在 140/140 实例中字节级一致。
5. 边界条件与局限
论文明确声明了系统的适用边界,未做超范围宣称:
- 优势域:严格限定于可验证、重复性工作流(计算、形式化程序、参数分析等)。在冷启动开放式推理上,前沿模型仍显著优于 12B 模型。
- 封闭 API 不适用:需模型自主操作,无法在不暴露必要中间状态的商业封闭 API 上实现。
- 窗口性质:600 万令牌为可移动窗口,非全局注意力;合并上下文的上限为已测边界(9/6 项),未做外推。
- 自主积累:持续自导向的求解-验证-沉积循环属于路线图,非当前已声明能力。
6. 可验证性与公开资源
- 公共测试台:提供可公开访问的交互实例(Hugging Face Space),任何人可直接观测“冷启动 vs. 验证复用”的零令牌、位精确行为。
- 产物存档:每项主要结果均对应 SHA-256 哈希锚定的原始产物文件,完整清单公开发布,可在 NDA 下审计。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Sietse Schelpe
PDF URL: https://arxiv.org/pdf/2607.23806.pdf
Arxiv URL: https://arxiv.org/abs/2607.23806
Arxiv ID: 2607.23806
CoolPaper URL: https://papers.cool/arxiv/2607.23806
Published: 2026-07-29T01:17:10.035Z
Updated: 2026-07-29T01:17:10.035Z
19. Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models
Abstract:Historical documents act as invaluable knowledge archives but often suffer from illegibility due to physical deterioration and damage. While existing restoration methods based on masked language modeling effectively utilize local context, they struggle to restore named entities that require external historical knowledge. To address this limitation, we introduce a novel framework for historical document restoration that leverages large language models with retrieval-augmented generation (RAG). By combining the implicit knowledge of pre-trained LLMs with explicitly retrieved external context, our model ARI effectively mitigates the challenge of inferring context-dependent proper nouns. Extensive experiments on Korean historical documents demonstrate that our approach significantly outperforms baselines, achieving substantial gains in restoring both general characters and named entities. Furthermore, comprehensive evaluations including expert assessments confirm that ARI serves as a practical tool for domain experts, promising to accelerate the analysis of historical records.
中文摘要
摘要:历史文献作为宝贵的知识档案,但由于物理劣化和损坏,往往难以辨认。虽然现有基于掩码语言模型的修复方法能够有效利用局部上下文,但在恢复需要外部历史知识的专有名词时仍存在困难。为了解决这一局限性,我们提出了一种利用检索增强生成(RAG)的语言大模型进行历史文献修复的新框架。通过将预训练大语言模型的隐性知识与显式检索的外部上下文相结合,我们的模型 ARI 有效缓解了推断依赖上下文的专有名词的挑战。在韩文历史文献上的大量实验表明,我们的方法显著优于基线模型,在恢复普通字符和专有名词方面均取得了显著提升。此外,包括专家评估在内的综合评估也确认,ARI 可作为领域专家的实用工具,有望加速历史记录的分析。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文旨在解决历史文献修复中依赖外部知识的命名实体恢复难题。具体而言,该研究针对以下核心问题:
- 历史文献的物理退化与损坏:古代文献因材质脆弱、环境侵蚀及人工抄写误差等因素,大量字符变得难以辨认,形成”空白”或损坏标记,严重阻碍后续的历史分析与研究。
- 现有修复方法的知识瓶颈:传统的基于掩码语言建模(MLM)的方法仅依赖损坏文档自身的局部上下文进行推断。这类方法在恢复普通字符时有效,但在面对需要外部历史知识的命名实体(如人名、地名、官职、书名等专有名词)时表现严重不足。
- 命名实体损坏的高频性与关键性:论文统计数据显示,在实际损坏字符中,约 44.8% 属于命名实体(其中人名占比最高)。这些实体无法仅通过局部语法或语义推断,必须借助外部历史资料(如同时期其他文献、编年记录等)才能准确还原。
为应对上述挑战,论文提出了一个基于检索增强生成(RAG) 的大语言模型框架 ARI(Archive Restoration Intelligence),通过整合预训练模型内化的隐式知识与显式检索得到的相关历史文档,显著提升对依赖外部上下文的专有名词的修复能力。
Q: 有哪些相关研究?
论文在第2节(Related Work)及相关章节中梳理了以下几类相关研究:
1. 历史文献修复的早期深度学习方法
此类研究主要利用深度学习技术对损坏的历史文本进行恢复或校正:
- Tang et al. (2018) 与 Domingo and Nolla (2018):探索使用机器翻译或序列转换思路来纠正历史文献中的拼写与排版错误。
- Assael et al. (2019) — Pythia:专门用于预测希腊铭文(Greek epigraphy)中缺失的字符,在 top-20 准确率上达到 73.5% 。
- Kang et al. (2021):提出通过联合训练掩码语言建模(MLM)与机器翻译,同时实现历史文献的修复与翻译。
- Assael et al. (2022) — Ithaca:在修复文本的基础上,联合预测地理与年代等元数据属性,以提升可解释性;不过该研究依赖的地理元数据在本文目标语料(AJD、JRS)中并不存在。
- Liu et al. (2025):展示了利用预训练大语言模型(LLM)以零样本(zero-shot)方式直接进行历史文本修复的可行性。
2. 基于掩码语言建模(MLM)的修复方法
- Devlin et al. (2019) — BERT:采用双向 Transformer Encoder 与 MLM 目标进行预训练,通过预测被掩码位置的原 token 来实现文本恢复。由于该目标与损坏文本修复任务高度相似,BERT 及其变体被广泛应用于历史文献修复。
- 局限性:BERT 类模型以非自回归方式独立预测各掩码位置,往往难以捕捉多个损坏字符之间的依赖关系。
3. 基于因果语言建模的大语言模型(LLM)
近年来,因果语言建模(Causal Language Modeling)成为主流预训练范式,使模型在大规模语料中内化了丰富的语言知识与历史背景知识:
- Gemini-2.5 (Comanici et al., 2025)
- Sonnet 4.5 (Anthropic, 2025)
- Kimi K2 (Team et al., 2025)
- GPT-5.1 (OpenAI, 2025)
- Qwen3 (Yang et al., 2025)
这些模型所内化的隐式知识(如对汉语文言、朝鲜汉文文献及历史记录的了解)可被用作修复损坏历史文献时的外部知识来源。
4. 检索增强生成(RAG)及其应用
为缓解 LLM 仅依赖参数化知识的局限,RAG 通过显式检索外部文档来辅助生成:
- Lewis et al. (2020):提出 RAG 框架,利用基于词汇的检索(如 BM25)或基于嵌入的检索,从外部知识库中获取与用户查询相关的文档,并将其作为上下文提供给模型。
- 低资源语言与特定领域任务:Nie et al. (2023) 与 Chang et al. (2025) 将 RAG 应用于低资源语言任务;Xie et al. (2025) 将其用于命名实体识别(NER),验证了 RAG 在知识密集型任务中的有效性。
- RAG 微调:Zhang et al. (2024) 指出,对 RAG 系统进行领域特定的微调,可显著提升模型利用检索文档的能力,从而在下游任务上取得更好表现。
5. 本文所对比的基线模型
在实验部分,论文还与以下具体模型进行了性能比较:
- BERT-Res:基于 ModernBERT-large (Warner et al., 2025) 从零开始训练的基线模型,仅依赖损坏文本自身上下文,不引入外部知识。
- 各类商用与开源 LLM:包括 Gemini-2.5-Pro/Flash、Sonnet 4.5、GPT-5.1、Kimi K2、Qwen3-8B/32B 等,用于评估不同规模与架构的模型在修复任务上的零样本或少样本表现。
Q: 论文如何解决这个问题?
为解决历史文献中依赖外部知识的命名实体(如人名、地名、书名等)恢复难题,论文提出了一个基于检索增强生成(RAG)与大语言模型(LLM)的框架 ARI(Archive Restoration Intelligence)。该框架通过融合模型内化的隐式历史知识与显式检索的外部上下文,系统性提升对损坏字符(尤其是专有名词)的修复能力。具体解决方法包括以下关键组件:
1. 显式位置标记的提示工程设计
鉴于自回归语言模型的生成特性,论文设计了包含显式位置索引的输入输出格式。损坏字符被标记为 [D1], [D2] 等占位符,模型需输出严格的 JSON 格式:
1 | {"[D1]": "原汉字", "[D2]": "原汉字", ...} |
该设计确保了模型能够精确定位每个待恢复字符,并自回归地建模多个损坏位置间的依赖关系。
2. 多源外部知识的注入与检索优化
论文通过三种互补策略向模型提供外部知识,以弥补单一文档内部上下文的不足:
- 时间元数据增强:将文献的书写时间(国王年号、年、月、日)嵌入提示。实验表明,这种时间锚点信息能够显著提升模型对时代背景和相关实体的推断能力。
检索增强生成(RAG):从训练语料库中为每个待修复文档检索最相关的 Top-20 篇参考文档作为上下文。通过系统比较随机检索、基于 Gemini Embedding 的密集检索与 BM25 稀疏检索,发现 BM25 在汉字修复任务中表现最优。这归因于汉字作为表意文字的特性,字符级别的词汇匹配比语义嵌入相似度更具判别力。
检索结果去重:为避免重复或近重复文档限制知识多样性并引入偏差,论文采用字符串相似度算法(RapidFuzz)对检索文档进行去重,设定相似度阈值为 80% 。该策略有效提升了命名实体与随机字符的恢复准确率。
3. 领域专用微调策略
在开源模型 Qwen3-32B 与 Qwen3-8B 的基础上,论文通过领域适配微调构建了 ARI 模型:
- 混合训练数据构建:训练集由随机掩码样本(DRand)与命名实体优先掩码样本(DNE)混合构成。实验对比了不同混合比例,最终采用 25% DNE 与 75% DRand 的配置,在提升命名实体恢复能力的同时,保持了对一般字符的恢复性能。
动态掩码机制:为避免模型对固定掩码位置过拟合,每轮训练 epoch 动态改变掩码位置(类似 RoBERTa 策略),从而增强模型对多样化损坏模式的泛化能力。
两阶段训练:在隔离于测试集的古代文献语料(AJD 与 JRS)上进行全参数微调,使模型专门适应朝鲜王朝汉文文献的语言风格与历史知识体系。
4. 字节级约束解码与 Top-K 候选生成
由于标准字节级 BPE 分词器常将低频汉字拆分为多个字节 token,论文在推理阶段实现了字节级约束解码。具体而言,在生成某个损坏字符的首个字节 token 后,模型被约束继续生成后续字节直至拼成一个合法汉字。候选字符的得分通过其组成字节的对数概率平均值计算,最终输出按概率排序的 Top-K 个候选字符。该机制不仅解决了分词碎片化问题,还为领域专家提供了可选的候选列表,降低人工校对成本。
5. 细粒度评估体系
论文构建了两种平行的评估数据集以精确衡量不同维度上的修复能力:
- DRand:损坏字符随机分布,用于评估模型对一般字符的整体恢复性能。
- DNE:损坏字符专门采样自命名实体,用于评估模型在外部知识密集型场景下的恢复能力。
通过上述框架,ARI 将预训练 LLM 的隐式历史知识、RAG 提供的显式相关文献、时间元数据以及领域微调相结合,系统性地解决了传统方法在处理需要外部知识的专有名词恢复时的瓶颈。
Q: 论文做了哪些实验?
论文开展了系统性实验验证,涵盖数据集构建、多维度基线对比、外部知识注入消融、训练策略优化、专家人工评估及跨域鲁棒性分析。主要实验内容如下:
1. 数据集构建与评估设定
- 语料来源:基于《朝鲜王朝实录》(AJD)与《承政院日记》(JRS)构建训练、验证与测试集。
- 数据隔离:严格将含真实损坏的文档(DRD)留出,专用于后续人工专家评估,避免数据泄露。
- 合成损坏策略:在测试/验证集上依据真实损坏分布模拟损坏,平均损坏率设定为 2.96% ,并确保每篇至少含一个损坏字符。
- 双版本评估集:
- DRand:损坏字符随机分布,评估一般字符恢复能力。
- DNE:损坏字符全部来自命名实体,评估外部知识依赖型恢复能力。
2. LLM 基线性能评估
在无任何外部检索、仅使用基础提示的条件下,评估了多款开源与闭源大语言模型的零样本恢复能力:
- 模型覆盖:Qwen3-8B/32B、Kimi K2、Gemini-2.5-Flash/Pro、GPT-5.1、Sonnet 4.5。
- 推理模式对比:针对支持思考模式(thinking mode)的模型(如 Kimi K2、Gemini-2.5-Flash),对比了开启与关闭推理模式对命名实体恢复与随机字符恢复的影响。
3. 外部知识注入的消融实验
以 Qwen3-32B 为骨干,逐层验证外部知识组件的有效性:
- 时间元数据增强:验证加入日期(国王年号、年、月、日)对恢复准确率的影响。
- 少样本提示(Few-shot):验证静态格式示例对输出规范性与性能的提升。
- 检索增强生成(RAG):
- 对比三种检索策略:随机选取、基于 Gemini Embedding 的稠密检索、BM25 稀疏检索。
- 混合检索比例实验:在总共检索 16 篇文档的条件下,对比 BM25 与 Embedding 的不同配比(16:0、12:4、8:8、4:12、0:16)。
- 重排序实验:额外引入 Qwen3-Reranker-8B 对检索结果重排序,验证其效果。
- 检索文档数量实验:测试检索 1、2、4、8、12、16、20、24 篇文档时的性能变化。
- 去重策略实验:基于字符串相似度(RapidFuzz)对检索文档去重,系统扫描阈值从 70% 到精确匹配( 100% ),确定最优去重阈值。
4. 训练策略消融实验
- 数据混合比例:固定总训练样本量为 100K,对比 DNE 与 DRand 的不同混合比例(100:0、75:25、50:50、25:75、0:100),权衡命名实体恢复与一般字符恢复。
- 动态掩码:在微调阶段采用每轮动态变更掩码位置的策略,验证其对防止过拟合与增强泛化性的作用。
5. 主实验:与基线模型的全面对比
在统一的外部知识提示(含 RAG 与元数据)条件下,对比以下模型的 Top-1 恢复准确率:
- ARI-32B / ARI-8B(论文提出,基于 Qwen3 微调)
- BERT-Res(基于 ModernBERT-large 从零训练,无外部知识)
- 各商用与开源 LLM(Qwen3-32B、Kimi K2、Gemini-2.5-Pro、GPT-5.1、Sonnet 4.5 等) 评估指标覆盖 DRand 与 DNE 上的 Top-1 准确率,并以散点图形式展示命名实体恢复与一般字符恢复的联合表现。
6. 命名实体细粒度分类评估
针对 DNE 测试集中明确带标签的样本,按实体类别进行分层评估:
- 类别:人物(PER)、地点(LOC)、史书典籍(POH)。
- 方法:仅掩码目标命名实体,使用 Gemini-2.5-Pro 进行实体分类后,测量各模型在各类别上的 Top-1 准确率。
7. 真实损坏文档的专家人工评估
为验证模型作为实用辅助工具的价值,开展盲测评估:
- 样本:从 DRD 中随机抽取 100 篇真实损坏文档。
- 参评专家:3 位汉学与韩国史领域专家。
- 对比模型:ARI-32B、BERT-Res、Gemini-2.5-Pro。
- 评估指标:
- Top-1 与 Top-10 准确率(以专家选定答案为 ground truth)。
- nDCG@10(衡量候选排序质量,Gemini 因黑盒特性不参与此项)。
- Win Ratio(专家综合恢复质量与协作效用,选择最优模型的比例)。
8. 跨时代域迁移鲁棒性实验
为检验时间分布偏移对模型的影响:
- 测试语料:使用《高丽史》(Goryeosa),时间跨度早于训练语料(AJD/JRS 主要为 14–19 世纪)。
- 设定:以 14–19 世纪文献为检索库,在 10–19 世纪各时期测试文档上评估性能。
- 结论:验证了模型在中等时间偏移下仍具鲁棒性,但随着时间跨度增大,性能呈下降趋势。
9. 训练过程与解码策略分析
- 训练动态监测:绘制 ARI-32B 在训练过程中于 DRand 与 DNE 上的 Top-1/Top-5/Top-10 准确率曲线。
- 字节级约束解码:针对 Hanja 字符常被拆分为多字节 token 的问题,验证基于对数概率平均的约束解码与 Top-K 候选生成机制的有效性。
Q: 有什么可以进一步探索的点?
基于论文的实验发现与局限性分析,以下方向值得进一步探索:
1. 长上下文历史文档建模
论文因计算约束将模型最大输入长度限制在 4,096 tokens,导致约 1.7% 的超长文档被过滤。未来可探索:
- 采用支持更长上下文窗口的 LLM 架构(如 128K 或更长的上下文模型),以容纳整篇古代文献及其检索到的多篇相关文档;
- 研究针对超长古文的层次化检索与分块策略,避免关键上下文被截断。
2. 多模态历史文献修复
当前框架仅依赖文本模态,而韩国历史研究所等档案机构同时提供了原始文献的高清图像。后续研究可探索:
- 视觉-语言联合建模:将文档图像(如褪色、墨迹、纸张纹理等视觉特征)与文本上下文结合,利用多模态大模型(MLLM)同时感知视觉损伤与语义内容;
- 图像超分辨率与字符修复:在 OCR 前端引入基于扩散模型或 GAN 的图像修复模块,与后端语言模型形成级联式修复管线。
3. 跨时代与跨档案的域自适应
实验显示,当目标文档年代与训练/检索库存在显著时间鸿沟时(如以 14–19 世纪文献修复 10–12 世纪《高丽史》),模型性能随时间偏移加剧而衰减。未来可研究:
- 时间感知的检索增强机制:在检索阶段显式建模文档年代相似度,优先检索时间上更接近的文献;
- 持续学习与域自适应技术:使模型能够快速适应新的历史时期或不同王朝档案(如中国明清档案、日本古文献),缓解因语言演变和史实差异导致的性能退化。
4. 更精细的领域特定检索器与重排序器
论文发现通用嵌入模型与重排序器(如 Qwen3-Reranker-8B)在汉文古籍上的效果有限,BM25 反而更优。后续可探索:
- 在朝鲜汉文或东亚古典文献上预训练专用的密集检索器与重排序器,以弥补现代语料预训练模型在字符级古汉语匹配上的不足;
- 研究融合字形结构(如部首、笔画)的混合检索策略,超越纯字符匹配或语义嵌入。
5. 真实损坏分布的精准建模
论文指出,基于统计特征构建的合成损坏数据集与真实世界损坏分布之间可能存在固有差异。未来工作可:
- 利用真实损坏文档(DRD)的更大规模标注,建立更精确的损坏位置与跨度长度先验分布;
- 探索半监督或主动学习框架,在少量真实损坏样本上迭代优化模型,缩小合成训练与真实推理之间的分布差距。
6. 交互式人机协作修复系统
论文初步验证了提供 Top-K 候选供专家选择的有效性。进一步可开发:
- 人在回路(Human-in-the-loop)机制:允许专家在修复过程中实时修正候选字符,并将修正结果动态反馈至模型上下文,实现交互式自回归修复;
- 不确定性量化:为模型预测提供置信度估计,在低置信度位置主动请求人工干预,优先保障高风险的命名实体修复准确性。
7. 跨语言与低资源古代语言的泛化验证
论文提出该框架具有推广至其他低资源古代语言的潜力。系统性验证方向包括:
- 将 ARI 框架迁移至中文古籍(如《明实录》《清实录》)、日文古文献或欧洲中世纪拉丁文档案,检验 RAG 与领域微调在不同文字体系与语言谱系中的通用性;
- 构建多语言古代文献的统一修复基准,促进跨文化档案保护技术的比较与协作。
Q: 总结一下论文的主要内容
论文提出了一种名为 ARI(Archive Restoration Intelligence) 的新型历史文献修复框架,旨在解决传统方法仅依赖局部上下文、难以恢复需要外部历史知识的命名实体(如人名、地名、官职、书名等)的问题。以下为主要内容的结构化总结:
研究背景与动机
- 历史文献的价值与脆弱性:以《朝鲜王朝实录》(AJD)和《承政院日记》(JRS)为代表的古代文献是珍贵的知识档案,但因材质老化、环境侵蚀及手工抄写误差,大量字符存在损坏或难以辨认的问题。
- 现有方法的局限:基于掩码语言建模(MLM)的方法(如 BERT-Res)仅利用单篇文档内部的局部上下文,在恢复普通字符时有效,但对需要外部历史知识的命名实体(约占真实损坏字符的 44.8% )表现严重不足。
核心挑战
- 命名实体恢复的知识依赖性:例如,在推断句子 “In 1492, Columbus first landed in
M
.” 中的缺失地名时,模型必须依赖超越当前文档范围的历史知识。 - 训练与推理的分布不匹配:传统方法采用固定掩码概率进行训练,与真实文档中损坏字符的实际分布存在差异。
方法概述:ARI 框架
论文提出的 ARI 框架基于检索增强生成(RAG) 与大语言模型(LLM),通过整合两类知识提升修复精度:
- 隐式知识:利用在大量网络数据(含历史文献)上预训练的 LLM(如 Qwen3)内化的历史与语言知识。
- 显式知识:通过 RAG 从外部训练语料库中检索与待修复文档高度相关的历史记录,并注入时间元数据(年号、年月日),为模型提供精确的外部上下文。
关键技术细节
- 显式位置标记与自回归修复:将损坏字符标记为
[D1],[D2]等,要求模型以严格 JSON 格式输出修复结果,实现损坏字符间依赖关系的自回归建模。 - 优化检索策略:
- 采用 BM25 稀疏检索,利用汉字的表意特性与字符级匹配优势,性能优于基于 Embedding 的稠密检索。
- 对检索文档进行 80% 相似度阈值的去重(RapidFuzz),避免冗余文档限制知识多样性。
- 检索文档数量设定为 Top-20。
- 领域专用微调:
- 基于 Qwen3-32B / Qwen3-8B 在朝鲜汉文语料上全参数微调。
- 采用 动态掩码策略(每轮 epoch 变化掩码位置)防止过拟合。
- 训练数据混合策略:75% 随机掩码 + 25% 命名实体优先掩码,在提升实体恢复能力的同时保持一般字符性能。
- 字节级约束解码:针对 Hanja 字符被字节级 BPE 分词器拆分为多 token 的问题,通过约束解码拼合完整汉字,并基于平均对数概率输出 Top-K 候选供专家选择。
实验与结果
论文构建了双版本测试集进行系统评估:
- DRand:损坏字符随机分布,评估一般字符恢复。
- DNE:损坏字符专门来自命名实体,评估外部知识依赖型恢复。
主要实验发现:
- 主实验对比:ARI-32B 在 DNE 与 DRand 上的 Top-1 准确率均显著超越所有基线,包括 BERT-Res(无外部知识)以及 Gemini-2.5-Pro、GPT-5.1、Sonnet 4.5 等商用大模型(参见 Figure 1)。
- 细粒度实体分析:ARI-32B 在人物(PER)与地点(LOC)类实体上表现最优;Gemini-2.5-Pro 在史书典籍(POH)上略优,可能受益于其多语言预训练中的中国经典知识。
- 专家人工评估:针对 100 篇真实损坏文档的盲测显示,ARI-32B 的 Top-1 准确率、Top-10 准确率、nDCG@10 及专家偏好胜率( 46.0% )均高于 BERT-Res 与 Gemini-2.5-Pro。
- 跨时代鲁棒性:以《高丽史》(早于训练语料)测试时,ARI 在中等时间偏移下保持鲁棒,但随着与训练数据时间跨度增大,性能呈下降趋势。
局限与未来方向
- 合成损坏与真实分布的潜在差异:训练与测试数据基于统计特征模拟损坏,可能与真实损坏的固有特性存在差距。
- 输入长度限制:最大 4,096 tokens 的上下文窗口导致少量超长文档被过滤。
- 单一文本模态:尚未利用档案机构提供的原始文献图像;未来可探索融合视觉特征的多模态修复框架。
- 跨时代自适应:需进一步缓解因历史语言演变与时期特定知识差异导致的域迁移性能衰减。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Gabeen Kim,Kyeongpil Kang
PDF URL: https://arxiv.org/pdf/2607.21936.pdf
Arxiv URL: https://arxiv.org/abs/2607.21936
Arxiv ID: 2607.21936
CoolPaper URL: https://papers.cool/arxiv/2607.21936
Published: 2026-07-29T01:17:17.852Z
Updated: 2026-07-29T01:17:17.852Z
20. WorldDiT: A Unified Diffusion Architecture for World and Action Modeling
Abstract:Many recent robot policies pursue stronger control by using large pretrained vision-language models (VLMs) as the action backbone. We introduce WorldDiT, a unified diffusion transformer architecture that couples action generation with visual world modeling and achieves strong performance without a large pretrained VLM action backbone. During training, a single diffusion transformer generates continuous action chunks and predicts normalized RGB patch targets from future camera frames. Across four LIBERO simulation suites, WorldDiT lies on the reported Pareto frontier for total model parameters and mean success among methods reporting all four suites. These results provide a strong sub-billion-parameter baseline for future scaling studies.
中文摘要
摘要:许多近期的机器人策略通过使用大型预训练视觉-语言模型(VLM)作为动作骨干来追求更强的控制能力。我们介绍了 WorldDiT,这是一种统一的扩散变换器架构,将动作生成与视觉世界建模相结合,在没有大型预训练 VLM 动作骨干的情况下实现了强大的性能。在训练过程中,单个扩散变换器生成连续的动作片段,并从未来的摄像机帧中预测标准化的 RGB 贴片目标。在四个 LIBERO 仿真套件中,对于报告了所有四个套件的方法,WorldDiT 在总模型参数和平均成功率方面位于帕累托前沿。这些结果为未来的规模扩展研究提供了一个强大的低于十亿参数的基线。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Sen Wang,R. Gnana Praveen,Bidhan Roy,Marcos Villagra
PDF URL: https://arxiv.org/pdf/2607.23909.pdf
Arxiv URL: https://arxiv.org/abs/2607.23909
Arxiv ID: 2607.23909
CoolPaper URL: https://papers.cool/arxiv/2607.23909
Published: 2026-07-29T01:17:25.627Z
Updated: 2026-07-29T01:17:25.627Z