HuggingFace Papers 2026-08-05
数据来源:HuggingFace Papers
Latest Papers
1. SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks
Abstract:Speech and audio generation is often needed in animation dubbing, audio drama, movies, advertising, games, podcasts, and short-video production. In these scenarios, creators may need to design voices without reference recordings, control speaker styles with natural language, support acoustic scenes with environments and audio effects, and later reuse the designed voices. Therefore, it is important to support multi-speaker speech and audio generation for both instruct and zero-shot tasks. The instruct task requires a caption of the environment, speaker styles, and fine-grained content, while the zero-shot task uses reference audio together with the same fine-grained content. We address these tasks from both the data and model sides. First, we propose SwanData-Caption, which cleans raw speech and audio data, adds targeted synthetic coverage, and annotates diverse and accurate multi-level captions. Then, we propose SwanTale, a multi-speaker expressive speech and audio generation model that supports both zero-shot and instruct tasks. We introduce SwanVAE to support high-quality multi-audio-modality generation. Then, we adopt reward-conditioned quality control and Engram conditioning, along with Unified MoE for multi-task and multi-audio-modality modeling. In addition, we use curriculum learning and GRPO post-training to let the model progressively learn and strengthen its capabilities. Experimental results show that SwanTale leads on multiple key zero-shot and instruct metrics, achieves the best expressiveness scores in both tasks, and supports complex instruct generation involving multi-speaker speech and audio. Demos can be found at this https URL.
中文摘要
摘要:在动画配音、广播剧、电影、广告、游戏、播客和短视频制作中,经常需要进行语音和音频生成。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,通过自然语言控制说话者风格,支持带有环境和音效的声学场景,并在后续重复使用设计好的声音。因此,支持多说话者语音和音频生成以应对指导任务和零样本任务非常重要。指导任务需要环境描述、说话者风格以及细粒度内容,而零样本任务则使用参考音频加上相同的细粒度内容。我们从数据和模型两个方面解决这些任务。首先,我们提出了 SwanData-Caption,它清理原始语音和音频数据,增加有针对性的合成覆盖,并标注多样且准确的多层次字幕。随后,我们提出 SwanTale,这是一种多说话者的表达性语音与音频生成模型,支持零样本和指导任务。我们引入 SwanVAE 支持高质量的多音频模态生成。然后,我们采用基于奖励的质量控制和 Engram 条件化,并结合统一专家模型(Unified MoE)进行多任务和多音频模态建模。此外,我们使用课程学习和 GRPO 后训练,让模型逐步学习并增强能力。实验结果表明,SwanTale 在多个关键零样本和指导指标上领先,在两类任务中均实现最佳表达力评分,并支持涉及多说话者语音和音频的复杂指导生成。演示可以在此 https URL 查看。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决统一的多说话人语音与音频生成问题,使单一模型能够同时支持基于自然语言指令的生成(instruct task)与基于参考音频的零样本克隆(zero-shot task),并在生成过程中整合语音、环境声场与局部音效。具体而言,论文试图克服以下核心难题:
1. 创作流程中“从无到有”的声音设计与复用
现有零样本语音合成系统依赖已有录音作为参考音频进行声音克隆,但实际的媒体创作(如动画配音、广播剧、广告、游戏、短视频等)往往始于没有参考录音的场景。创作者需要:
- 通过自然语言描述从零开始设计角色声音(包括人物性格、音色、 habitual style 等稳定特质);
- 在生成语音的同时构建完整的声学场景(环境氛围、混响、背景噪声、局部音效等);
- 将设计好的声音通过参考音频在后续内容中复用(零样本合成)。
因此,论文提出系统需在同一模型内统一支持 instruct 与 zero-shot 两种任务模式。
2. 细粒度、多模态的音频联合生成
现有指令式语音合成系统大多仅输出干声(clean speech),环境音频与局部音效若由下游管线单独生成,易出现时间错位、响度漂移与声学纹理不一致的问题。该论文追求在单一波形中联合生成:
- 多说话人表现力语音(含对话、情绪、语速、停顿等细粒度控制);
- 持续性环境背景声(如风、雨、人群嘈杂、室内反射等);
- 瞬时局部音效(如玻璃杯碰撞声、脚步声等);
- 偶发的歌唱声与背景音乐。
这要求模型处理语音、一般音频、音乐等不同时间结构的模态共存问题。
3. 数据稀缺与高质量多层级标注
支撑上述能力需要覆盖场景丰富、标注精准的数据。论文指出,零样本任务可依赖公开语音语料,但 instruct 任务需要:
- 包含环境、说话人风格与细粒度内容的多层级自然语言描述;
- 针对罕见场景(如老年语音、超短语句、多音字/专有名词等)的定向合成与补充;
- 可靠的语音片段切分、说话人分离与文本锚点对齐。
因此,论文构建了专门的数据处理流程 SwanData-Caption,通过清洗、定向合成覆盖、多级caption标注与质量筛选来缓解数据瓶颈。
4. 任务兼容性与异构音频模态建模
联合训练 instruct 与 zero-shot 任务时存在条件路径冲突:
- Instruct 样本通过自然语言 caption 描述全局说话人风格;
- Zero-shot 样本通过参考音频提取说话人身份;
- 两者需共享同一套细粒度内容(文本、情绪、局部风格)控制。
若直接在单一密集网络中联合训练,两种条件路径可能相互削弱。为此,论文提出 Unified MoE(统一混合专家网络),通过任务路由与音频路由动态分配模型容量,以适配不同任务与异构音频区域(语音、环境声、音效、音乐)的 specialized 建模需求。
5. 生成质量与可控性的逐步强化
在多任务、多模态联合训练的基础上,论文进一步通过课程学习(从 zero-shot 基础能力到 instruct 适配,再到全混合数据与高质量微调)与 GRPO(Group Relative Policy Optimization)后训练,逐步提升发音准确性、生成稳定性、说话人属性对齐度与整体表现力。
综上所述,该论文的核心贡献在于提出并实现了 SwanTale——一个能够在统一框架内完成“自然语言设计声音—场景化音频生成—参考音频复用”全流程的多说话人表现力语音与音频生成系统。
Q: 有哪些相关研究?
根据论文内容,相关研究可归纳为以下六个方向:
1. 零样本语音合成(Zero-shot TTS)
该方向旨在仅通过一段参考音频克隆说话人音色并合成新内容,是 SwanTale 零样本任务的基础。代表性工作包括:
- 基础模型:CosyVoice
21
、F5-TTS
13
、MegaTTS 系列
50, 51
、NaturalSpeech 2
85
、Generspeech
44
等,奠定了基于语义 token 或流匹配的零样本合成框架; - 对话与长篇章:SwanVoice
64
、ZipVoice
119
、MoonCast
52
、FireRedTTS-2
96
、SoulX-Podcast
95
、CovoMix
105
等,将零样本能力扩展到多说话人对话与长音频生成; - 近期进展:CosyVoice-3
22
、FishSpeech
28
、GLM-TTS
17
、SparkTTS
94
、VibeVoice
78
、IndexTTS2
116
等,在韵律控制与说话人相似度上持续优化。
2. 指令式/自然语言控制语音合成(Instruct TTS)
该方向通过自然语言描述控制说话人属性、风格与场景,是 SwanTale instruct 任务的核心背景:
- 早期控制合成:Parler-TTS
61, 69
、VoiceSculptor
39
、FlexiVoice
8
、OV-InstructTTS
82
等,验证了文本描述控制说话人风格的可行性; - 大语言模型驱动的 TTS:Qwen3-TTS
79
、MiMo-Audio
106
、VoxInstruct
117
、VoxCPM2
118
、MOSS-VoiceGenerator
43
等,利用 LLM 的指令理解能力实现更灵活的语音生成; - 评估基准:InstructTTSEval
42
建立了指令跟随能力的标准化评测体系。
3. 统一音频生成与多模态建模(Unified Audio Generation)
针对语音、环境声、音效与音乐在同一波形中的联合生成,相关研究涵盖:
- 通用音频生成:UniAudio
101
、Make-an-audio
45
等探索了文本到通用音频的生成; - 语音与音乐统一:UniMoEAudio
67
采用动态容量 MoE 统一语音与音乐生成; - 空间与场景音频:MRSAudio
35
、RealMAN
100
等数据集与评测框架
72, 120
支持了空间音频与场景建模的研究; - 音频编辑:Pan 等人
73
综述了基础模型时代的音频编辑方法,与生成后处理密切相关。
4. 神经音频编解码器与连续表示学习(Neural Codecs & Audio VAE)
SwanTale 的 SwanVAE 模块建立在以下音频表示学习研究基础上:
- 离散/矢量量化编解码器:EnCodec
19
、DAC
60
、WavTokenizer
48
等,通过 RVQ/VQ 实现低码率音频压缩; - 连续自编码器:Stable Audio Open
23
、SAME-L
76
、MegaTTS 3 WaveVAE
51
、VoxCPM2 AudioVAE V2
118
、ACE-Step Music-DCAE
30
等,为扩散/流模型提供连续潜在空间; - 自编码器可学习性:Skorokhodov 等人
87
研究了改善自编码器潜在空间可扩散性的方法,与 SwanVAE 的 latent alignment 目标相关。
5. 数据资源与多层级标注方法(Data & Annotation)
支撑多任务训练的数据工程研究包括:
- 公开语音语料:LibriSpeech
75
、LibriTTS
102
、GigaSpeech
9
、AISHELL-3
86
、LibriHeavy
53
等; - 歌唱与特效数据:GTSinger
110
、FSD50K
29
、MUSDB18-HQ
88
等; - 自动标注与对齐:WhisperX
4
、NeMo Forced Aligner
40
、3D-Speaker toolkit
11
、Seed-ASR
7
、SwanAligner
64
等提供了转录、对齐与说话人分割工具; - 音频描述与情感标注:AudioCaps
54
、STARS
37
、Speech Emotion Captioning
97
等推动了多层级文本描述的研究。
6. 基础架构与训练范式(Architectures & Training)
SwanTale 的模型设计直接借鉴了以下技术:
- 流匹配与扩散 Transformer:Flow matching
65
、DiT
77
、Classifier-free guidance
38
及其在语音中的应用
13, 64
; - 混合专家模型(MoE):Switch Transformer
26
、ST-MoE
121
、DeepSeekMoE
18
、辅助损失无关的负载均衡
93
等,为 Unified MoE 提供了稀疏路由基础; - 条件记忆与检索:Engram
14
的可扩展查找记忆机制被用于 caption 条件编码; - 强化学习后训练:Reward-conditioned policies
59
、GRPO
84
、Flow-GRPO
66, 91
、DiffusionNFT
115
等,为 SwanTale 的 RL 后训练阶段提供了算法基础; - 语音表征与评估:WavLM
10
、ECAPA-TDNN
20
用于说话人编码;PESQ
83
、STOI
89
、ViSQOL
15
、DNSMOS
81
、SQUIM
58
、SRMR
25
等用于质量评估。
Q: 论文如何解决这个问题?
论文从数据构建与模型设计两个维度协同解决上述问题,具体方案如下。
1. 数据层面:SwanData-Caption 数据处理管线
为支持 instruct 任务所需的细粒度自然语言控制,论文构建了 SwanData-Caption,一个包含约 7000 万条记录的四阶段数据处理管线。
1.1 覆盖度设计(Coverage Design)
- 真实媒体数据:覆盖短剧、动漫、广告、播客等 speech-centered 媒体音频,包含多样说话人密度、录制条件、角色风格与声场环境。
- 定向合成数据:针对真实语料中稀缺的场景,利用音素感知的 TTS 教师模型合成三类补充数据:
- 老年语音(Elderly Speech):缓解年龄覆盖不足;
- 超短语句(Short Utterance):增强对单字、名称及短句的稳定性;
- 难发音目标(Hard Pronunciation):针对中文多音字、专有名词、中英混合文本等,通过 pypinyin 注入发音提示,确保合成波形与目标文本一致。
1.2 SwanData-Speech 预处理
在语音中心片段上执行:
- 分离:使用 Ultimate Vocal Remover 分离人声与背景,保留原始带环境声场的音频用于 caption 标注;
- 说话人分割:采用 3D-Speaker 工具包进行 VAD、嵌入提取与聚类;
- 转录:使用 Seed-ASR 2.0 与 SenseVoice 进行双重 ASR,特别关注发音校验;
- 对齐:通过 SwanAligner 将转录文本与人声流对齐,记录停顿证据,供后续标点优化使用。
1.3 Caption 标注
利用 Seed2.0 Lite 作为标注器,将原始音频与去标点转录转换为结构化、多层级 caption。每条 caption 包含三个字段:
| 字段 | 内容 |
|---|---|
| Environment | 场景位置、声场印象、录制空间、混响、持续性背景声或音乐 |
| Speakers | 实际说话人的感知性别、年龄、角色/人设、稳定音色、发音习惯、语速、口音等 |
| Content | 按时间顺序组织的细粒度局部风格描述,包含情绪、音量、语速变化,以及被 |
为克服标注器生成贫乏说话人描述的问题,论文设计了 Style-Persona Library,为动漫、短剧/影视、广告/数字人三类媒体提供软先验,引导标注器区分稳定特质(写入 Speakers)与瞬时表达(写入 Content)。
1.4 数据精炼(Data Refinement)
- 波形过滤:基于 DNSMOS、SQUIM(STOI、PESQ、SI-SDR、MOS)阈值剔除低质量语音;
- Caption 归一化:通过 SwanVerifier 校验性别与年龄标签,利用对齐结果规范化停顿标点,移除非法索引、未匹配标签等;
- 人工校验:审核转录准确性、caption 质量、音频质量与表现力,采用组内最优-最差比较(best–worst scaling)评估表现力,降低尺度偏差。
2. 模型层面:SwanTale 统一生成框架
论文提出 SwanTale,一个支持 instruct 与 zero-shot 双任务、覆盖多说话人语音与音频的统一生成模型。
2.1 SwanVAE:高质量多音频模态潜在表示
SwanVAE 将 48 kHz 单声道音频编码为 25 Hz、96 维的连续潜在向量。其设计核心为局部声学建模与下游可学习性的平衡:
- 非对称编解码器:编码端采用抗混叠卷积网络,保持局部时域支撑;解码端采用 Transformer Resampling Block(TRB),将每个潜在向量映射为 6 个可学习的输出 token,再投影为 1920 样本(40 ms)的波形片段。
- 重建与对抗训练:目标函数为
L(wav) = L(rec) + λ(KL)L(KL) + λ(adv) ∑(D ∈ D) wD L(adv)^D + λ(fm) ∑(D ∈ D) L(fm)^D,
其中 L(rec) 包含多分辨率复数 STFT 损失、多频带 Mel 损失与帧能量损失;对抗判别器包括 MPD、MRD 与 MBCSD。 - 潜在对齐目标:为避免潜在变量高频波动增加流模型负担,在训练阶段对后验均值 μ_φ 施加弱对齐约束:
- 生成对齐:联合训练轻量级无条件流匹配预测器与因果未来预测器,提供流可建模性信号;
- 语义与声学读出:预测多尺度色度分布、归一化帧能量与频带能量分布,促使潜在空间保留有意义的局部结构。
训练完成后,SwanVAE 固定,SwanTale 使用全局归一化的后验均值作为确定性声学目标。
2.2 基于流匹配的 Transformer 生成器
SwanTale 采用非因果扩散 Transformer(DiT)与流匹配作为生成骨干,引入以下关键机制:
(1)条件编码分离
- Caption 分支:使用 Qwen 系列文本编码器理解 caption,通过交叉注意力注入所有 DiT 层;同时添加类别嵌入区分语音内容、局部音效、环境信息等。
- 文本分支:使用 CosyVoice 2.0 tokenizer 与轻量 Transformer 编码 spoken content,通过时间插值与噪声潜在序列对齐,避免长度不匹配问题。
- 说话人轮次嵌入:从结构化说话人标签构造,与文本嵌入对齐后注入。
(2)Reward-Conditioned 质量控制
将波形质量指标(STOI、PESQ、SI-SDR、MOS)映射为质量 caption 与质量标志 q ∈ low, normal, high, unknown 注入模型。训练时以一定概率将 q 置为 unknown 以支持 classifier-free guidance;推理时固定为 high,使生成偏向最高质量。这构成一种无需在线强化学习即可实现的奖励条件策略。
(3)Engram 条件化
为增强对固定 caption 模式(如人设描述、常见音效)的识别,在 caption 分支引入 Engram 记忆层。对于 caption 序列 c = (c1, dots, c_L) ,以位置 i 为中心的 n-gram 窗口为
w_i^((n)) = c(i-lfloor(n-1)/2rfloor : i+lfloor n/2rfloor),
经哈希检索与门控残差更新后增强 caption 表示:
u_i = u_i + σ( RMSNorm(u_i)^top RMSNorm(W_K e_i){√d} + b ) W_V e_i.
(4)统一的双任务流匹配目标
设任务类型 τ ∈ ∈st, zero ,目标潜在序列为 x^star 。Instruct 样本使用完整 caption c(full) 且无提示上下文;zero-shot 样本使用内容 caption c(content) 与参考潜在提示 r^((τ)) = m^((τ)) odot x^star 。对生成区域施加噪声:
xt^((τ)) = (1 - m^((τ))) odot ((1-t)ε + t x^star),
DiT 预测速度场 vθ ,训练损失为生成区域上的掩码均方误差:
L(flow) = E[ | (1 - m^((τ))) odot (hatvθ - (x^star - ε)) |2^2max(1, ∑(i=1)^T (1 - m_i^((τ)))) ].
该形式使同一骨干网络同时学习全轨迹 caption 控制(instruct)与上下文参考生成(zero-shot)。
2.3 Unified MoE:任务与音频模态的动态容量分配
为处理 instruct/zero-shot 双任务与语音/环境声/音效/音乐等多音频模态的异构性,论文提出 Unified MoE,以动态稀疏前馈层替代部分 DiT 的 FFN:
任务路由器(Task Router):在样本级别选择共享专家 Tτ ,编码 instruct(强调 caption 遵循与多事件组合)与 zero-shot(强调提示说话人保持)的样本级先验:
o(shared)(h, τ) = ∑(j ∈ Tτ) E_(shared)^j(h).音频路由器(Audio Router):在帧级别对隐藏状态 h(ell,m) 执行动态 Top-P 路由。引入时间条件:
r(ell,m) = h(ell,m) + W_t e_t, quad ell(ell,m) = Wg r(ell,m) + b(null)(t),
其中 b(null)(t) 为时变 null 专家偏置。通过 Gumbel-Softmax 进行可微路由,温度 τg(n) 随训练退火。时间感知预算 q(t) = σ(W_b e_t) 联合控制 Top-P 阈值 p(t) 、null 偏置 b(null)(t) 与专家容量 c(t) :
p(t) = p(min) + (p(max) - p(min))q(t), quad c(t) = c(min) + (c(max) - c(min))q(t).
音频分支输出为
o(audio)(h(ell,m), t) = ∑(i ∈ S_ell,m)^r π(ell,m,i) E(audio)^i(h(ell,m)),
其中 S(ell,m)^r 为选定的路由音频专家集合。最终 MoE-FFN 输出为
o(MoE)(h(ell,m), t, τ) = o(shared)(h(ell,m), τ) + o(audio)(h_(ell,m), t).
- 负载与稳定性控制:通过容量截断限制每专家分配数,并引入 router z-loss 与 null-collapse 惩罚作为轻量辅助目标:
L(MoE) = λ_z L_z + λ(null) L_(null).
2.4 课程学习(Curriculum Learning)
训练分为四个阶段,逐步提升条件复杂度与数据覆盖度:
- Zero-shot 基础模型:在 SwanVAE 潜在空间上,基于 2300 万小时单说话人与 170 万小时双说话人数据训练 zero-shot 基础能力,参考音频以 50% 概率丢弃;
- Dense Caption 适配:在 7000 万条干净、属性丰富的语音数据上,使用密集 FFN 学习从文本条件到 caption 条件的过渡,此时 instruct 与 zero-shot 采样比例约为 7:3;
- 全 Caption 混合训练:引入 Unified MoE,在完整 SwanData-Caption 语料(含环境声、音效、更广人设)上训练,扩展
Q: 论文做了哪些实验?
论文的实验围绕 SwanVAE 重建质量、Zero-shot 语音合成、Instruct 语音生成 与 关键模块消融 四个维度展开,使用了多个自动评估指标与自建/已有的评测基准。
1. 实验设置与评测基准
1.1 评估指标
- SwanVAE:在语音、歌声、一般音频、音乐四个域各取 1000 条片段,评测 PESQ、STOI、MCD、ViSQOL(语音/歌声)以及 ViSQOL、LSD(一般音频/音乐)。
- Zero-shot:在 SwanBench-Speech 上评测独白(monologue)与双说话人对话(dialogue),指标包括:
- Timbre Consistency(音色一致性)
- Reverb Consistency(混响一致性)
- Sound Fidelity(音质)
- Content Error(内容错误率,中英平均)
- SpeechJudge、Expressive Richness、Expressive Hierarchy(均由 Gemini 3 Pro 评分)
- Instruct:在三个基准上评测:
- InstructTTSEval:评测 Acoustic-Parameter Specification(APS)、Descriptive-Style Directive(DSD)、Role-Play(RP),含中英文。
- SwanBench-Scene:180 条指令(广告/喜剧/一般场景各 60 条),5 名专业标注员对 Overall Expressiveness、Prosodic Naturalness、Audio Fullness、Scene Appropriateness 进行 1–5 分 MOS 评估。
- SwanBench-Caption:64 条复杂指令(含环境/局部音效/歌声/音乐/多语言/多说话人对话),由 gemini-3.5-flash 对 Instruction Accuracy、Acoustic Quality、Overall Expressiveness 进行 1–5 分评估。
1.2 对比基线
- SwanVAE:对比 DAC、EnCodec、WavTokenizer Large Unify、VoxCPM2 AudioVAE V2、MegaTTS 3 WaveVAE、Stable Audio Open 1.0、SAME-L、ACE-Step Music-DCAE。
- Zero-shot(独白):CosyVoice-2/3、FishSpeech、F5-TTS、GLM-TTS、IndexTTS-2、MegaTTS-3、SparkTTS、VibeVoice、ZipVoice、SwanVoice。
- Zero-shot(对话):FireRedTTS-2、MoonCast、MOSS-TTSD、SoulX-Podcast、VibeVoice、ZipVoice-Dialog、SwanVoice。
- Instruct:Parler-TTS-large、VoxInstruct、VoiceSculptor、MiMo-Audio-7B-Instruct、Qwen3-TTS-12Hz-1.7B-VD、MOSS-VoiceGenerator、VoxCPM2;SwanBench-Scene 上额外对比 Seedance 2.0。
2. SwanVAE 重建实验
SwanVAE 将 48 kHz 音频编码为 25 Hz、96 维连续潜在向量(名义码率 38.40 kbps)。
- 语音:在 PESQ(4.1683)与 MCD(0.9638)上取得最佳,STOI(0.9680)与 ViSQOL(4.1248)接近最优。
- 歌声:在 PESQ(3.9821)、STOI(0.9001)、MCD(1.5661)上均排名第一,ViSQOL(3.7085)排名第二。
- 一般音频:ViSQOL(4.1269)最高,LSD(0.9455)仅次于 Stable Audio Open 1.0。
- 音乐:ViSQOL(4.2623)排名第二,LSD(0.9172)排名第三;同一检查点跨四域使用,未做域特定选择。
3. Zero-shot 语音合成实验
在 SwanBench-Speech 上的结果显示:
- 独白:SwanTale 在 Timbre Consistency(0.95)、Expressive Richness(3.90)、Expressive Hierarchy(3.70)上排名第一;SpeechJudge(3.75)与 FishSpeech 等持平;Content Error(0.086)优于 SwanVoice,但不及 FishSpeech(0.066)。
- 对话:SwanTale 在 Timbre Consistency(0.94)、SpeechJudge(3.92)、Expressive Richness(3.66)、Expressive Hierarchy(3.85)上均排名第一;相比 SwanVoice,五项关键指标均有提升(如 Timbre Consistency 从 0.92 提升至 0.94,Content Error 从 0.145 降至 0.120)。
论文指出,FishSpeech 在 Content Error 与 Sound Fidelity 上、SoulX-Podcast 在对话的 Sound Fidelity 与 Content Error 上仍具优势,说明 SwanTale 在内容精度与音频保真度上仍有提升空间。
4. Instruct 语音生成实验
4.1 InstructTTSEval
- 中文 APS:86.1,排名第一。
- 英文 APS:84.2,与 VoxCPM2 并列第一。
- 中文 DSD:80.1,排名第二。
- 英文 DSD:79.2,落后于 MiMo-Audio、Qwen3-TTS、VoxCPM2 等基线。
- RP(角色扮演):中英文均约 64 分左右,相对薄弱。论文分析认为当前 caption 与 style matrix 对长尾角色/职业模仿覆盖不足。
4.2 SwanBench-Scene
SwanTale 取得最高 Overall Mean MOS(4.22) 与全部四个维度的最高分:
- Overall Expressiveness(4.12)
- Prosodic Naturalness(4.20)
- Audio Fullness(4.47)
- Scene Appropriateness(4.10)
分场景看,广告(3.88)、喜剧(4.45)、一般场景(4.34)的 Mean MOS 均为所有系统最高;仅在喜剧场景的 Audio Fullness(4.60)上排名第二。
4.3 SwanBench-Caption(复杂指令与音频生成)
该基准测试含环境/局部音效、歌声、背景音乐、多语言与多说话人对话。消融结果显示:
- 移除 Unified MoE:Instruction Accuracy 从 3.39 降至 3.02,Acoustic Quality 从 4.31 降至 4.09,Overall Expressiveness 从 3.82 降至 3.56,证明 MoE 对指令实现、音质与表现力均有显著贡献。
- 放大 Caption Encoder(8B → 32B):三指标分别提升至 3.70、4.34、3.98,其中 Instruction Accuracy 提升最明显。
5. 训练与推理配置验证
论文还报告了实现层面的关键配置:
- 训练硬件:SwanVAE 阶段使用 32 张 A100;SwanTale 监督阶段使用 64 张 A100;GRPO 后训练使用 8 张 GPU。
- 两阶段分解 Classifier-Free Guidance:文本/说话人轮次分支权重 1.5,全条件分支权重 3.0;结合时间步相关的 guidance annealing( γ(t) = a + b(1-t)^p ,其中 (a,b,p)=(0.6,0.6,1.0) )与 sway sampling 进行推理。
Q: 有什么可以进一步探索的点?
基于论文结论与实验分析,以下方向值得进一步探索:
1. 复杂背景音乐的时序动态生成
当前系统在生成需要随情绪变化或场景转换而改变类型、节奏或配器的背景音乐时仍面临困难。未来可探索音乐与语音/音效在时间轴上的细粒度对齐机制,以及通过 caption 描述实现音乐风格平滑过渡或情绪响应式变化的方法。
2. 长篇章多说话人场景生成
论文指出,对于超过两分钟且包含多说话人、音频效果与复杂场景交互的长音频,生成质量与一致性仍具挑战。这需要更高效的长序列建模策略(如更优的上下文压缩、记忆机制或分层生成),以维持长时段内的说话人身份一致性、场景逻辑与事件时序准确性。
3. 精确的局部风格与韵律控制
连续情绪变化、特定词汇的强调、说话节奏的精准调控以及停顿与音效的精确同步,目前对数据标注与模型设计均构成挑战。未来可研究:
- 更细粒度的时序对齐标注(如字级别或音素级别的风格标签);
- 连续值控制信号(如强度曲线、语速轮廓)与离散 caption 的融合机制;
- 流匹配/扩散模型在中间步骤的可解释性,以实现生成过程中的局部干预。
4. 统一生成与音频编辑框架
论文明确将现有音频的编辑(修改文本内容、说话人身份、情绪等)视为重要未来方向。构建一个同时支持从头生成与局部编辑的统一模型,需要在保持非编辑区域声学一致性的同时,实现高质量的内容替换与风格迁移,这对掩码策略、部分生成与上下文感知编码均提出新要求。
5. 角色扮演与长尾说话人风格的覆盖
InstructTTSEval 中 Role-Play (RP) 任务得分相对薄弱,表明模型在将未见过的职业、角色原型或情境映射到可识别的声音表演方面存在局限。未来需要:
- 扩充 caption 数据与 style matrix 对长尾角色、职业、社会身份与情境的覆盖;
- 研究从有限角色描述到声学特征的少样本或零样本角色泛化机制。
6. 跨语言指令跟随能力的平衡
实验显示中文 DSD 与 APS 表现较强,但英文 DSD 在跨系统对比中竞争力不足。这暗示模型在理解英文自由风格描述方面仍有提升空间。可能的路径包括:更均衡的多语言 caption 数据、跨语言一致的语义编码,以及针对英文表达习惯的特定数据增强。
7. 多说话人与多模态场景的强化学习优化
当前 GRPO 后训练主要聚焦于单说话人的发音准确性、稳定性与属性控制,而多说话人对话与含音频场景的能力依赖监督锚点回放来维持。未来可探索:
- 适用于多说话人切换、对话交互与音频事件的可靠奖励设计;
- 在不遗忘多模态能力的前提下,将在线 RL 直接应用于多说话人与场景音频生成。
8. 自动化数据标注与风格矩阵的精细化扩展
SwanData-Caption 依赖 style-persona library 作为软先验,但当前仅覆盖动漫、短剧/影视、广告/数字人三类媒体。向更多媒体类型(如纪录片、游戏、播客)扩展,并结合自动化的细粒度属性提取(如更精确的年龄段估计、口音识别、表演风格分类),可进一步提升 instruct 控制的维度与精度。
Q: 总结一下论文的主要内容
该论文提出了 SwanTale,一个面向 instruct 与 zero-shot 双任务的统一多说话人表现力语音及音频生成系统。以下是论文主要内容的结构化总结:
1. 研究背景与核心问题
现有文本转语音(TTS)系统多在单一任务上取得进展:零样本系统依赖参考音频克隆说话人,而指令式系统通过自然语言控制风格。然而,实际媒体创作(动画配音、广播剧、广告、游戏、短视频等)要求创作者能够:
- 从无到有地通过自然语言描述设计声音(人设、音色、年龄、性别等);
- 将该声音置于包含环境声场与局部音效的完整声学场景中;
- 后续通过参考音频复用已设计的角色声音。
因此,论文旨在解决统一支持 instruct 与 zero-shot 任务的多说话人语音及音频生成问题,核心挑战包括:
- 数据稀缺:缺乏覆盖丰富场景且具备多层级自然语言标注的高质量数据;
- 任务兼容性:instruct 的 caption 条件与 zero-shot 的参考音频条件需在统一模型内共存且不相互削弱;
- 多音频模态复杂性:语音、环境声、局部音效、歌声与音乐具有各异的时间结构,需在单一波形内统一建模。
2. 数据方案:SwanData-Caption
论文构建了包含约 7000 万条记录的数据处理管线,分为四个阶段:
- 覆盖度设计:整合内部真实媒体音频(短剧、动漫、广告、播客等),并针对老年语音、超短语句、难发音文本(多音字、专有名词、中英混合)三类稀缺场景进行定向合成补充。
SwanData-Speech 预处理:通过人声分离(Ultimate Vocal Remover)、说话人分割(3D-Speaker)、ASR 转录(Seed-ASR 2.0)及对齐(SwanAligner),获取干净语音片段与可靠文本锚点。
Caption 标注:使用多模态大语言模型生成结构化三级 caption:
- Environment:场景位置、声场印象、混响、持续性背景声;
- Speakers:说话人感知性别、年龄、人设、稳定音色、习惯风格;
- Content:按时间顺序组织的细粒度内容,包括被
<S{id}>包裹的语音文本及情绪、语速、停顿等局部风格描述,以及被<Audio>包裹的局部音效。
为避免标注风格贫乏,引入 Style-Persona Library 作为软先验,针对动漫、短剧/影视、广告/数字人三类媒体引导区分稳定特质与瞬时表达。
- 数据精炼:基于 DNSMOS、SQUIM 等波形质量指标过滤,通过 SwanVerifier 校验说话人性别/年龄标签,规范化标点,并经人工审核修正转录与 caption 错误,采用组内最优-最差比较评估表现力。
3. 模型方案:SwanTale
3.1 SwanVAE:多音频模态潜在表示
SwanVAE 将 48 kHz 单声道音频编码为 25 Hz、96 维的连续潜在向量。其设计强调局部声学建模与下游流模型可学习性的平衡:
- 编码端采用局部抗混叠卷积,解码端采用 Transformer Resampling Block(TRB)生成 40 ms 波形片段;
- 训练目标结合多分辨率复数 STFT 损失、Mel 损失、能量损失、KL 正则化,以及 MPD/MRD/MBCSD 对抗训练;
- 对后验均值 μ_φ 施加弱潜在对齐目标:包括无条件流匹配预测、因果未来预测、多尺度色度读出与频带能量读出,以抑制潜在空间高频波动,降低下游流模型负担。
3.2 流匹配 Transformer 生成器
以非因果流匹配 DiT 为骨干,引入以下机制:
- 条件分离编码:Caption 经 Qwen 编码器通过交叉注意力注入;文本经 CosyVoice 2.0 tokenizer 与轻量 Transformer 编码,并通过时间插值与潜在序列对齐;说话人轮次嵌入同步注入。
- Reward-Conditioned 质量控制:将 STOI、PESQ、SI-SDR、MOS 等质量指标映射为显式质量 caption 与质量标志 q ∈ low, normal, high, unknown 。训练时以一定概率 dropout,推理时固定为 high,无需在线强化学习即可偏向高质量生成。
Engram 条件化:在 caption 分支引入 Engram 记忆层,通过 n-gram 窗口哈希检索与门控残差更新,增强对固定描述模式(如人设模板、常见音效)的识别:
u_i = u_i + σ( RMSNorm(u_i)^top RMSNorm(W_K e_i){√d} + b ) W_V e_i.统一双任务目标:对于任务类型 τ ∈ ∈st, zero ,instruct 样本使用完整 caption c(full) 且无提示掩码;zero-shot 样本使用内容 caption c(content) 与参考潜在提示 r^((τ)) = m^((τ)) odot x^star 。生成区域施加流匹配噪声:
x_t^((τ)) = (1 - m^((τ))) odot ((1-t)ε + t x^star),
训练损失为生成区域上的掩码均方误差,使同一网络同时学习全轨迹 caption 控制与参考条件生成。
3.3 Unified MoE:动态容量分配
为解决异构任务与音频模态的竞争,论文提出 Unified MoE 稀疏前馈层:
任务路由器(Task Router):在样本级别选择共享专家,编码 instruct(强调 caption 遵循)与 zero-shot(强调说话人保持)的先验:
o(shared)(h, τ) = ∑(j ∈ Tτ) E(shared)^j(h).音频路由器(Audio Router):在帧级别执行动态 Top-P 路由,通过时间感知预算 q(t) = σ(Wb e_t) 联合控制 Top-P 阈值、null 专家偏置与专家容量,利用 Gumbel-Softmax 实现可微训练,温度随训练退火。音频分支输出为:
o(audio)(h(ell,m), t) = ∑(i ∈ Sell,m)^r π(ell,m,i) E(audio)^i(h(ell,m)).最终输出为共享分支与音频分支之和,并辅以 router z-loss 与 null-collapse 惩罚保证稳定性。
3.4 课程学习与 GRPO 后训练
训练分为四阶段:
- Zero-shot 基础模型:学习单/多说话人参考音频条件生成;
- Dense Caption 适配:使用标准密集 FFN 学习 caption 条件(70% instruct / 30% zero-shot);
- 全 Caption 混合训练:引入 Unified MoE,扩展至含环境声、音效、歌声的完整数据;
- 高表现力 SFT:在自动质量阈值与人类表现力审核筛选的高质量子集上微调。
随后采用 Flow-GRPO 进行后训练,针对发音准确性、生成稳定性与 caption 条件说话人属性控制进行优化。定义群体相对优势:
A_i = R_i^((τ)) - μ_R(c)σ_R(c) + ε,
并通过带 KL 约束的裁剪目标更新策略,同时以多说话人/音频样本的监督锚点回放保留多模态能力。
4. 实验结果
4.1 SwanVAE 重建
在语音、歌声、一般音频、音乐四域的同一检查点上,SwanVAE 取得:
- 语音:PESQ 与 MCD 最优;
- 歌声:PESQ、STOI、MCD 最优;
- 一般音频:ViSQOL 最优;
- 音乐:ViSQOL 第二。
4.2 Zero-shot 合成(SwanBench-Speech)
- 独白:SwanTale 在 Timbre Consistency(0.95)、Expressive Richness(3.90)、Expressive Hierarchy(3.70)上排名第一;Content Error(0.086)较 SwanVoice 显著降低。
- 对话:在 Timbre Consistency(0.94)、SpeechJudge(3.92)、Expressive Richness(3.66)、Expressive Hierarchy(3.85)上均排名第一。
4.3 Instruct 生成
- InstructTTSEval:中文 APS(86.1)排名第一,英文 APS(84.2)并列第一;中文 DSD(80.1)排名第二;RP 任务相对薄弱。
- SwanBench-Scene:Overall Mean MOS(4.22)及全部四维子指标(Overall Expressiveness、Prosodic Naturalness、Audio Fullness、Scene Appropriateness)均为最高。
- SwanBench-Caption:消融验证 Unified MoE 显著提升 Instruction Accuracy(3.39 vs 3.02)、Acoustic Quality(4.31 vs 4.09)与 Overall Expressiveness(3.82 vs 3.56);将 caption encoder 从 8B 扩至 32B 进一步提升三指标。
5. 结论与展望
SwanTale 通过 SwanData-Caption 提供多层级细粒度监督,通过 SwanVAE、流匹配 DiT、Unified MoE、课程学习与 GRPO 后训练 实现了统一的多说话人语音与音频生成,在 zero-shot 与 instruct 任务上均取得领先的表现力与关键指标。
未来待解决的方向包括:
- 复杂背景音乐的时序动态生成与情绪响应式过渡;
- 超过两分钟的长篇章多说话人复杂场景生成;
- 连续情绪、强调、停顿与音效的精确局部控制;
- 现有音频的文本、说话人、情绪统一编辑能力;
- 长尾角色扮演风格与跨语言指令跟随能力的进一步扩展。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yu Zhang,Ruiqi Li,Changhao Pan,Ke Lei,Xiang Yin,Cheng Yang
PDF URL: https://arxiv.org/pdf/2608.02023.pdf
Arxiv URL: https://arxiv.org/abs/2608.02023
Arxiv ID: 2608.02023
CoolPaper URL: https://papers.cool/arxiv/2608.02023
Published: 2026-08-05T01:01:35.874Z
Updated: 2026-08-05T01:01:35.874Z
2. LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
Abstract:Large language model (LLM) agents increasingly undertake long-horizon tasks that require sustained reasoning, tool use, and revision across many interdependent steps. However, existing agent harnesses maintain task execution, task state, and completion assessment within a growing context, making the state difficult to track and allowing incorrect self-assessments to propagate into later decisions. We reformulate long-horizon execution as a task-state management problem and propose LongHorizon-Harness, which maintains the task state explicitly outside execution and updates it only with facts independently verified from the environment. Its Manage-Execute-Audit(MEA) loop uses a manager to maintain the task state and determine the next subtask, a fresh-context executor to perform it, and a read-only auditor to verify the resulting environment state before the next round. A lightweight AgentAdapter supports interchangeable model and harness backends without modifying their native agent loops. LongHorizon-Harness improves Qwen~3.7-Plus from 51.8% to 80.7% on WeaveBench, from 69.7% to 77.2% on Terminal-Bench~2.1, and from 2.8% to 8.3% on OSWorld~2.0. It also raises Claude Opus~4.7 from 20.0% to 34.3% on an OSWorld2.0 subset, demonstrating consistent gains across models, harnesses, and interaction domains.
中文摘要
摘要:大型语言模型(LLM)代理越来越多地承担需要持续推理、工具使用以及在许多相互依赖步骤中进行修订的长周期任务。然而,现有的代理框架将任务执行、任务状态和完成评估保持在不断增长的上下文中,这使得状态难以跟踪,并且允许错误的自我评估传播到后续决策中。我们将长周期执行重新表述为任务状态管理问题,并提出了 LongHorizon-Harness,该方法将任务状态显式地维护在执行之外,并且仅通过环境独立验证的事实进行更新。其管理-执行-审核(MEA)循环使用管理器维护任务状态并确定下一个子任务,使用新上下文执行器执行任务,并通过只读审核器在下一轮之前验证环境状态。轻量级的 AgentAdapter 支持可互换的模型和框架后台,而无需修改其原生代理循环。LongHorizon-Harness 将 Qwen~3.7-Plus 在 WeaveBench 上的成绩从 51.8% 提升至 80.7%,在 Terminal-Bench~2.1 上从 69.7% 提升至 77.2%,在 OSWorld~2.0 上从 2.8% 提升至 8.3%。它还将 Claude Opus~4.7 在 OSWorld2.0 子集上的成绩从 20.0% 提升至 34.3%,展示了在模型、框架和交互域中一致的性能提升。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文旨在解决长程智能体执行(long-horizon agent execution)中的可靠性瓶颈,即智能体在需要持续推理、工具调用和跨多步修正的复杂任务中,难以保持一致且准确的执行轨迹的问题。
具体而言,论文指出当前主流智能体框架(如 Claude Code、Codex CLI 等)存在两个深层结构性限制,导致以下系统性挑战:
1. 核心结构性限制
- 任务执行与任务状态管理共享同一增长式上下文:现有框架让智能体在单一持续会话中同时执行动作和维护任务状态。随着交互历史膨胀,关键状态信息被淹没在冗长轨迹中,导致状态追踪困难。
- 任务执行与完成评估相互耦合:智能体既负责执行子任务,又自行判断其是否完成。错误的自我评估会被纳入任务状态,成为后续决策的错误前提,从而向后续步骤传播。
2. 由此引发的三大执行挑战
- 错误累积与目标漂移(Compounding errors and goal drift):早期动作或决策中的错误沿轨迹累积,扭曲后续选择,逐步偏离原始目标。
- 上下文腐烂(Context rot):随着交互历史增长,相关信息检索与利用难度急剧上升,一旦上下文利用跨越临界阈值,性能便显著下降。
- 任务状态丢失(Task-state loss):长程任务需要准确且持续更新的任务状态(待满足的需求、已完成动作、产生的产物、从环境发现的事实),但现有智能体常在执行过程中丢失、遗忘或错误更新该状态。
3. 论文的解决思路
为应对上述问题,论文将长程执行重新表述为任务状态管理问题,并提出 LongHorizon-Harness 框架。其核心思想是:将任务状态显式维护在执行过程之外,仅通过独立审计从环境验证的事实来更新状态,并通过 Manage-Execute-Audit(MEA)循环 实现状态管理与环境交互的解耦——由管理器(manager)维护状态并规划子任务,执行器(executor)在全新上下文中执行,只读审计器(auditor)独立验证环境变化后,管理器再进入下一轮状态更新。
Q: 有哪些相关研究?
根据论文内容,相关研究可从以下五个维度进行梳理:
1. 长程智能体应用与趋势
研究者们已将大语言模型(LLM)从对话模型扩展为自主智能体的决策核心,涵盖:
- 软件工程:如 SWE-agent (Yang et al., 2024)、OpenHands (Wang et al., 2025)、SaaSBench (Ren et al., 2026)、NL2Repo-Bench (Ding et al., 2025) 等;
- 通用辅助:Claude Code (Anthropic, 2025)、ChatGPT Agent (OpenAI, 2025b)、Claude Cowork (Anthropic, 2026);
- 科学发现:ScienceBoard (Sun et al., 2025)、从 AI for Science 到 Agentic Science 的综述 (Wei et al., 2025a);
- 计算机使用:Claude Computer Use (Anthropic, 2024)、Operator (OpenAI, 2025c)、Gemini 2.5 Computer Use (Google DeepMind, 2025)、ColorBrowserAgent (Zhou et al., 2026)、Code2World (Zheng et al., 2026) 及该领域综述 (Sager et al., 2026);
- 多模态交互:AppAgent (Zhang et al., 2023)、Agent S (Agashe et al., 2025)。
此外,METR (Kwa et al., 2026) 报告了高级智能体任务完成时长的增长趋势,指出近月来任务完成范围(horizon)的翻倍周期正在缩短。
2. 长程执行的核心挑战
论文明确引用了三类关键挑战的实证与综述研究:
- 错误累积与目标漂移:早期决策错误会沿轨迹累积并扭曲后续选择 (Sun et al., 2026);
- 上下文腐烂(Context rot):输入 token 增加对 LLM 性能的负面影响 (Liu et al., 2024; Hong et al., 2025);
- 长程智能体综述:Dong et al. (2026) 对长程智能体的系统性综述指出了执行可靠性问题。
3. 模型能力扩展
为提升长程执行能力,前沿模型在规模、上下文窗口及智能体专用能力上持续演进,相关训练与优化工作包括:
- 强化学习与推理:SWE-RL (Wei et al., 2025b)、GPG (Chu et al., 2026)、AdaCurl (Li et al., 2025);
- 智能体进化与树搜索:SkillClaw (Ma et al., 2026)、Coevolve (Yang et al., 2026b)、Tree Search for LLM Agent RL (Ji et al., 2025)。
4. 智能体框架与系统层(Harnesses)
作为组织提示、工具调用、上下文管理与多步执行的标准系统层,现有代表性框架包括:
- Claude Code (Anthropic, 2025)
- Codex CLI (OpenAI, 2025a)
- OpenClaw (OpenClaw Contributors, 2026)
- Hermes Agent (Nous Research, 2026)
这些框架虽支持规划、任务分解与隔离上下文的子代理,但仍存在“执行与状态管理共享增长式上下文”及“执行与完成评估耦合”的结构性局限。
5. 评估、验证与状态审计
LongHorizon-Harness 的设计也受到评估与验证研究的启发,特别是:
- Agent-as-a-Judge (Zhuge et al., 2024):利用智能体评估智能体;
- MT-Bench 与 Chatbot Arena (Zheng et al., 2023):LLM-as-a-Judge 的评估框架;
- ReAct (Yao et al., 2023):推理与行动协同的经典范式,LongHorizon-Harness 通过 AgentAdapter 保留其后端原生的 ReAct 式循环。
6. 评测基准
论文本身在以下长程基准上进行验证,这些基准也是该领域的关键研究:
- WeaveBench (Li et al., 2026):跨 GUI 与 CLI 混合界面的长程真实任务基准;
- OSWorld 2.0 (Yuan et al., 2026):面向专业桌面工作流的长程计算机使用基准;
- Terminal-Bench 2.1 (Merrill et al., 2026):面向命令行的高难度真实任务基准。
Q: 论文如何解决这个问题?
论文通过提出 LongHorizon-Harness 框架,将长程执行从”单一增长式会话”重新架构为”显式任务状态管理”问题。其核心解决路径包含以下五个层面:
1. 问题重构:将长程执行视为任务状态转换序列
与传统方法将执行历史本身作为隐式状态不同,该框架将任务状态 S_i 显式维护在执行过程之外。任务状态是一个结构化记录集合,包含:
- 需求(requirements):从原始任务派生的目标与约束
- 产物(artifacts):执行过程中创建或修改的输出
- 事实(facts):从环境获取的、后续轮次所需的信息
每条记录均标记为已完成(completed)、待处理(pending)、阻塞(blocked)或不可信(untrusted),并保留指向审计证据的引用。初始状态 S_1 由原始任务 T 构造,所有需求初始标记为待处理。
2. Manage-Execute-Audit(MEA)循环
论文设计了严格解耦的三阶段循环替代传统单体执行:
(S(i+1), q(i+1), c(i+1)) = Phi(mgr)(T, S_i, V_i)
(ei, o_i) = Phi(exec)(T, Si, c_i; e(i-1))
vi = Phi(aud)(T, S_i, c_i, o_i; e_i)
其中 V_i = (v_1, …, v_i) 为累积审计报告, e_i 为第 i 轮后的环境状态, c_i 为子任务合约, o_i 为执行报告, v_i 为审计报告。
循环流程如下:
- **管理器(Manager)**读取当前任务状态 Si 与审计历史 V_i ,输出下一轮状态 S(i+1) 、控制决策 q(i+1) (execute / done / blocked / ask)及子任务合约 c(i+1) ;
- 执行器(Executor)接收合约 ci ,在全新、预算受限的上下文中执行,将环境从 e(i-1) 转换为 e_i ;
- **审计器(Auditor)**通过只读工具独立检查 e_i ,生成审计报告 v_i ;
- 仅当审计确认后,管理器才将发现纳入 S_(i+1) ;执行器的原始交互轨迹在轮次结束后被丢弃。
3. 角色隔离与权限边界
管理器(Manager)
- 无环境直接接口:不能调用 GUI/CLI 工具、修改环境或观察应用状态;
- 纯状态驱动决策:仅基于任务状态与审计证据决定下一步;
- 合约构造:为选定的未解决目标构建有界合约 c_(i+1) ,明确包含即时目标、验收标准、边界约束及相关前置证据。
执行器(Executor)
- 唯一可有意修改环境的角色;
- 全新上下文执行:每轮启动独立会话,不接收先前轮的原始交互轨迹,仅接收当前状态、合约及被引用的审计报告;
- 能力边界分离:GUI 执行器(负责应用与界面状态转换)与 CLI 执行器(负责工作区、进程与程序状态转换)通过不同工具集严格区分。
审计器(Auditor)
- 只读权限:禁止创建、编辑、删除受保护产物或执行状态变更命令;
- 独立于执行器上下文:启动时不包含执行器的原始轨迹或内部推理;
- 环境直接验证:通过独立观察(GUI 审计器检查屏幕状态,CLI 审计器使用非变异命令检查文件、元数据、日志、进程等)确认合约的完成状态、完整性状态(clean / suspect / violation)及剩余缺口。
4. 关键机制:基于独立验证的状态更新
框架引入两项关键规则以阻断错误传播:
- 执行器声明不直接改变持久状态:产物或需求仅在被清洁审计证据支持时才标记为已完成;
- 审计报告是唯一跨轮持久记忆:执行器的交互历史 o_i 仅为执行摘要,不能作为完成证明;只有 v_i 才能支持状态转移。
这解决了传统框架中”错误自我评估被记录为前提并传播”的问题。
5. AgentAdapter:后端无关的模块化支持
通过轻量级 AgentAdapter,框架支持在不修改原生智能体循环的前提下接入现有后端:
- 模型后端:Claude Opus、GPT、Qwen 等;
- 执行后端:Claude Code、Codex CLI、OpenClaw、Hermes Agent 等。
适配器控制提供的上下文、可用工具、环境权限、执行预算及返回报告格式,允许三个角色分别调用不同后端,实现模型能力与 harness 组织的解耦组合。
6. 终止条件
MEA 循环在以下任一条件满足时终止:
- 审计后的状态满足原始任务 T 且无未解决的完整性违规;
- 无允许的子任务能推进剩余需求;
- 需要用户信息或授权;
- 轮次预算耗尽(论文设置最大轮次 N_(max) = 25 )。
简言之,该方案通过显式状态外置、执行上下文刷新、独立第三方审计这三重机制,将长程任务中的”持续增长会话”转化为一系列可验证的、有界的状态转换,从而抑制错误累积、缓解上下文腐烂,并确保任务状态始终基于环境事实而非智能体自我断言。
Q: 论文做了哪些实验?
论文在三个互补的长程基准上进行了系统评估,涵盖混合界面、桌面工作流与纯命令行环境,并围绕性能、成本、任务分解与案例展开多维度分析。
1. 实验配置与对比方案
- 骨干模型:以 Qwen-3.7-Plus 为主,另用 Claude Opus-4.7 验证跨模型泛化性。
- 执行后端:主实验以 Claude Code 为执行后端;Terminal-Bench 上额外使用 Codex CLI。
- 角色预算:执行器每轮限 1800 秒,管理器与审计器各限 300 秒;最大 MEA 轮次 N_(max) = 25 。
- 基准选取:
- WeaveBench:114 项混合 GUI–CLI 的真实任务,指标为 PassRate(满分任务占比)与 Overall(均分),覆盖 Desktop、Document、Games、Web、Data Analysis、DevOps、Spatial/3D、Design 八个领域。
- OSWorld 2.0:108 项桌面工作流任务(中位人类完成时间约 1.6 小时),指标为 Binary Accuracy(最终得分为 1 的任务占比)与 Partial Accuracy(全部任务均分)。
- Terminal-Bench 2.1:高难度命令行任务,使用 Harbor + Docker 后端,每任务运行 3 次取平均。
2. 主基准性能结果
WeaveBench(跨界面长程任务)
使用相同模型(Qwen 3.7-Plus)与相同执行后端(Claude Code)进行对照:
- PassRate:从 51.8% 提升至 80.7%(+28.9 个百分点);
- Overall 均分:从 0.702 提升至 0.835;
- 八个领域全部取得 PassRate 提升,其中 Design(+60.0 pp)、Spatial/3D(+50.0 pp)与 Games(+29.4 pp)增益最大。
OSWorld 2.0(桌面工作流)
- Binary:Qwen 3.7-Plus 从 2.8% 提升至 8.3%(约 3.0×);
- Partial:从 21.5% 提升至 35.2%。
OSWorld 2.0 子集(Claude Opus 4.7)
在 34 任务子集上:
- Binary:从 20.6% 提升至 35.3%;
- Partial:从 55.8% 提升至 66.9%,验证增益不局限于单一模型。
Terminal-Bench 2.1(纯命令行)
- Qwen 3.7-Plus + Claude Code:成功率从 69.7% 提升至 77.2%;
- GPT-5.6 Luna + Codex:在 LongHorizon-Harness 下达到 83.1%,表明框架可泛化至不同后端。
3. 成本与角色分解分析
- 成本–性能前沿(Fig. 4):在 OSWorld 2.0 上,LongHorizon-Harness 将 Qwen 3.7-Plus 推至明显更优的前沿位置;平均每任务输出 token 从 28.9K 增至 104K。
- 角色 token 占比(Fig. 5):
- 管理器仅占总 token 的 2.0%–8.1%,说明显式状态管理开销极低;
- 审计器占 19.4%–38.1%,是框架的主要额外计算投入;
- Terminal-Bench 上总 token 反而比基线低 24%,说明成本并非固定倍数,而取决于任务复杂度与所需恢复轮次。
4. 任务类型与失败模式细粒度分析
- 跨任务类型增益(Fig. 6):
- WeaveBench 中 Design、Spatial/3D、Games 增益最大;Desktop 基线已高(83.3%),增益相对较小(+5.6 pp)。
- OSWorld 2.0 中 streaming interaction、human-in-the-loop、tutorial-following 提升最显著。
- Terminal-Bench 2.1 中 system-administration 与 games 提升最大;纯分析/数学类任务增益较小,说明框架主要解决“长程执行可靠性”瓶颈,而非替代单步推理能力。
- 难度相关:在 Terminal-Bench 上,hard 任务(+12.2 pp)的增益高于 medium(+4.2 pp)与 easy(+16.7 pp 但样本少),符合“越长越复杂越受益”的预期。
5. 模型–Harness 系统属性验证
在 WeaveBench Games 的 17 任务子集上(Table 4),同时评估 Claude Opus 4.7 与 Qwen 3.7-Plus:
- Opus 均分从 0.680 提升至 0.809;Qwen 从 0.524 提升至 0.733。
- Qwen + LongHorizon-Harness(0.733)超越 Opus + 基线 Claude Code(0.680),表明 harness 强度可弥补模型差距,提升固定模型可达到的任务级性能。
- -token 消耗呈现相反模式:Opus 在 harness 下 token 下降(16.5M → 11.1M),而 Qwen 上升(10.7M → 34.3M),说明更强模型可减少审计–重规划轮次,模型与 harness 共同决定最终性能与成本。
6. 定性案例研究
论文通过配对轨迹对比,展示 MEA 循环如何具体生效:
- 从停滞交互恢复(Fig. 7):基线在 Wireshark “Decode As” 对话框无响应后陷入 400+ 步重复点击;LongHorizon-Harness 将失败外部化为任务状态,后续执行器直接收集缺失的图表与包级证据,分数从 0.59 提升至 0.92。
- 审计表面完成(Fig. 8):基线直接修改 XML 后终止,视觉上正确但不符合 LibreOffice 工作流要求,得 0.00;框架通过 GUI 操作并审计底层 XML,确认 15 个标题样式均合规,得 0.89。
- 保留修复前证据(Fig. 9):基线在收集完 pre-repair 证据前修改表格,导致前后状态不一致;框架将缺失证据标记为待处理,在修改前强制完成取证,分数从 0.45 提升至 0.87。
- 从已验证进度继续(Fig. 10):基线完成核心优化后,因在同一增长会话中继续操作 DevTools 而耗尽预算;框架将已验证优化存入任务状态,后续执行器仅需处理剩余交付物,分数从 0.53 提升至 0.85。
7. 附录补充实验
- 详细逐任务得分:附录 Table 5 给出 OSWorld 2.0 Opus 4.7 子集 34 项任务的基线与框架得分对照。
- 细粒度分解表:
- WeaveBench 领域级得分与 PassRate 变化(Table 6);
- WeaveBench Games 17 项任务逐题得分(Table 7);
- OSWorld 2.0 按能力标签分解(Table 8),覆盖 streaming_interaction、human_in_the_loop、visual_spatial_precision 等;
- Terminal-Bench 2.1 按类别(Table 9)、难度(Table 10)与标签(Table 11)分解,显示 system-administration、version-control、images 等标签增益最大。
- 扩展案例研究:附录 C 补充了桌面工作流、文档处理、游戏分析、Web 诊断、数据分析、DevOps、CAD 工作流、设计工作流及 Terminal-Bench 构建/逆向工程等额外案例,进一步验证跨域通用性。
Q: 有什么可以进一步探索的点?
基于论文的核心设计与实验观察,以下方向值得进一步探索:
1. 任务状态表示的自动化与层级化
当前任务状态依赖预定义的结构化记录(需求、产物、事实)。未来可探索:
- 动态状态模式学习:让管理器根据任务领域自动演进状态 schema,而非依赖人工设计。例如,科学计算任务可能需要“实验假设–验证结果–误差范围”记录,而网页自动化任务需要“DOM 路径–事件监听器–网络请求”记录。
- 层级任务状态:将扁平记录扩展为树状或图状结构,支持子任务状态的嵌套与合并,以处理具有深层依赖关系的项目级任务(如仓库级代码重构)。
2. 审计机制的可靠性层级与成本优化
审计器目前消耗 19%–38% 的 token,且其可靠性直接影响状态更新质量:
- 分层审计(Hierarchical Auditing):先以低成本启发式或轻量模型进行快速筛查,仅对高风险状态变更触发深度 LLM 审计,降低整体开销。
- 审计器的审计(Meta-Auditing):当审计报告与管理器预期冲突时,引入仲裁机制或更高阶验证器,避免审计错误导致的级联阻塞。
- 形式化验证接入:对于编译、配置管理、文件系统操作等子任务,将 LLM 审计与符号执行、类型检查或文件哈希校验结合,替代部分高成本的语义审计。
3. 跨轮次记忆压缩与上下文生命周期管理
尽管每轮丢弃执行轨迹,但审计报告 V_i 随轮次线性累积,长期任务仍可能面临上下文压力:
- 审计报告摘要与向量化:对历史审计报告进行压缩,仅保留与当前子任务相关的证据片段,或将其编码为外部检索向量,使管理器上下文长度与轮次解耦。
- 关键状态快照:在极长任务中引入检查点机制,允许管理器基于里程碑状态重新规划,而非携带全部历史证据。
4. 自适应预算与动态子任务粒度
论文固定设置 N_(max) = 25 与单轮 1800 秒执行预算:
- 基于不确定性的预算分配:对高置信度子任务减少审计深度,对低置信度或频繁失败的合约增加执行与审计预算。
- 子任务粒度的在线调整:当执行器连续超时或审计器连续报告不完整时,管理器应自动将合约拆分为更细粒度的子合约,而非重复尝试同一粒度。
5. 开放世界任务与目标演化
现有评估假设任务目标 T 是静态且明确的:
- 目标发现与细化:在开放世界场景(如自主科研探索、开放式数据挖掘)中,管理器需同时维护“已知需求”与“待验证假设”,并支持任务目标随环境反馈动态演化。
- 用户意图对齐:当前
ask路由仅用于获取信息或授权,可扩展为持续的人机协作模式,允许用户在执行过程中修正或细化验收标准。
6. 异构后端与角色专用化
AgentAdapter 已支持模型与后端的互换,但未探讨最优组合:
- 角色级模型路由:为管理器、执行器、审计器分配不同规模或专精的模型(如强规划模型担任管理器,强编码模型担任 CLI 执行器,强视觉模型担任 GUI 审计器),以性能-成本帕累托前沿为目标进行自动配置。
- 执行器能力的动态扩展:根据子任务需求,在运行时临时为执行器挂载或卸载特定工具集(如仅在某轮授予数据库写权限),实现最小权限原则的动态化。
7. 失败模式驱动的领域特化
实验显示,隐藏阈值、时序定位与视频处理等标签上表现不佳:
- 领域专用审计协议:为性能测试、视频处理、机器学习训练等任务设计专用审计工具链(如自动提取 FPS 时间序列、帧级差异哈希、模型收敛曲线分析),将难以直接观察的“隐性状态”转化为可验证产物。
- 对抗性合约生成:针对易失败的任务类型,让管理器在合约中显式包含“负向约束”(如不得修改的敏感文件、不得突破的内存上限),并通过审计器强制执行。
8. 与强化学习的协同训练
当前 MEA 循环通过提示工程实现角色分离,其策略均为冻结模型能力:
- 管理器策略的 RL 优化:以任务完成率、轮次效率、审计通过率为奖励,对管理器的子任务分解与状态更新策略进行强化学习微调。
- 执行器轨迹的价值学习:虽然执行轨迹不跨轮持久化,但可在单轮内利用 RL 优化工具调用序列,减少单轮内的时间与 token 浪费。
9. 形式化建模与错误传播分析
论文经验性地验证了错误抑制效果,但缺乏理论量化:
- 将 MEA 建模为 POMDP:将管理器视为策略,审计器视为带噪声的观测函数,推导在独立审计条件下错误信念的后验上界。
- 状态转移的可靠性边界:分析“执行-审计”解耦对错误传播概率的衰减效应,为轮次预算 N_(max) 的设置提供理论依据。
10. 实际部署中的系统级挑战
- 并发与竞态条件:当多个 MEA 实例共享环境(如多代理协作编辑同一仓库)时,审计器需检测跨实例的状态干扰,并引入锁或事务机制。
- 安全沙箱的精细化:当前按角色划分工具权限,可进一步探索基于合约内容的动态沙箱(如某轮仅允许访问特定目录的网络命名空间)。
Q: 总结一下论文的主要内容
这篇论文针对长程智能体执行中的可靠性瓶颈,提出了 LongHorizon-Harness 框架,其核心是将长程任务执行从传统的“单一增长式会话”重新架构为显式任务状态管理问题,并通过解耦的 Manage-Execute-Audit(MEA) 循环实现稳定的跨步推进。
1. 核心问题
现有智能体框架(如 Claude Code、Codex CLI 等)在长程任务中面临两大结构性限制:
- 执行与状态管理共享增长上下文:任务状态淹没在膨胀的交互历史中,导致信息检索困难与上下文腐烂(context rot)。
- 执行与完成评估相互耦合:智能体自行判断子任务是否完成,错误的自我评估被记录为状态前提并向后续步骤传播,引发错误累积与目标漂移。
由此产生三大挑战:复合错误与目标漂移、上下文腐烂、以及任务状态丢失。
2. 方法:LongHorizon-Harness
论文提出将长程执行视为一系列经独立审计的任务状态转换。框架维护一个显式的结构化任务状态(包含需求、产物与事实),并严格遵循 MEA 循环:
- Manager(管理器):负责拥有并维护持久的任务状态。它基于原始任务目标与经审计的历史证据,选取未解决目标、检查依赖,并构造有界子任务合约(含目标、验收标准、边界约束与相关证据)。管理器无直接环境接口,所有决策完全基于显式状态。
- Executor(执行器):作为唯一被允许有意修改环境的角色,它在全新、预算受限的上下文中执行合约。每轮结束后,其原始交互轨迹被丢弃,仅返回执行摘要。
- Auditor(审计器):以只读权限独立检查执行后的环境状态,不接收执行器的内部推理。它通过独立的 GUI 观察或 CLI 非变异命令验证结果,生成审计报告,明确判定完成状态、完整性状态(clean/suspect/violation)及剩余缺口。
关键机制:任务状态仅依据审计报告更新,执行器的自我完成声明不直接写入持久状态。跨轮次保留的只有紧凑的、经审计的任务状态与审计历史,而非完整的执行轨迹。
此外,AgentAdapter 提供轻量级适配层,支持为三个角色分别接入不同的模型(如 Claude Opus、GPT、Qwen)与执行后端(如 Claude Code、Codex CLI、OpenClaw),无需修改后端原生智能体循环。
3. 实验与结果
论文在三个互补的长程基准上进行了评估:
- WeaveBench(114 项混合 GUI–CLI 真实任务):使用 Qwen 3.7-Plus 与 Claude Code,PassRate 从 51.8% 提升至 80.7%,Overall 均分从 0.702 提升至 0.835,且在全部八个领域中均获得提升。
- OSWorld 2.0(108 项桌面工作流):Qwen 3.7-Plus 的 binary completion 从 2.8% 提升至 8.3%(约 3 倍),Partial Accuracy 从 21.5% 提升至 35.2%。在 34 任务子集上,Claude Opus 4.7 的 binary completion 从 20.0% 提升至 34.3%。
- Terminal-Bench 2.1(高难度命令行任务):Qwen 3.7-Plus 成功率从 69.7% 提升至 77.2%;使用 GPT-5.6 Luna 与 Codex 后端时达到 83.1%。
成本与机制分析表明:管理器仅消耗约 2%–8% 的额外 token,审计器是主要附加成本来源;但总体开销并非固定倍数,而是取决于任务复杂度与所需恢复轮次。定性案例研究显示,框架能够有效从停滞交互中恢复、审计表面完成但实际不合规的结果、保留修复前证据,以及从已验证进度继续推进。
4. 结论
论文的主要贡献在于:
- 将长程执行重新表述为显式任务状态管理问题,状态仅通过环境独立验证的事实更新。
- 设计了基于 MEA 循环的 LongHorizon-Harness,实现任务规划、环境交互与独立验证的解耦。
- 在混合界面、桌面与纯 CLI 环境中验证了其跨模型、跨后端的一致有效性。
最终结论强调:长程智能体能力不仅是底层模型的属性,更是 harness 如何将模型的局部能力组织、验证并累积为端到端任务完成的系统属性。LongHorizon-Harness 通过显式状态维护、有限上下文执行与独立审计,显著提升了长程任务执行的可靠性与完成率。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Ziyu Ma,Hailang Huang,Shun Zou,Yong Wang,Shidong Yang,Yiming Hu,Fei Wei,XiangXiang Chu
PDF URL: https://arxiv.org/pdf/2608.01964.pdf
Arxiv URL: https://arxiv.org/abs/2608.01964
Arxiv ID: 2608.01964
CoolPaper URL: https://papers.cool/arxiv/2608.01964
Published: 2026-08-05T01:01:46.879Z
Updated: 2026-08-05T01:01:46.879Z
3. DAPD: Dual-Anchored Policy Distillation
Abstract:On-policy (self) distillation (OPSD) is increasingly adopted for language-model post-training. It strengthens the teacher with privileged information but can induce a privilege illusion: the student learns privilege-dependent behavior it cannot reproduce from its inference-time context, yet behaves as if the training-time privileged information remained available, ultimately degrading performance. In this paper, we identify information asymmetry between the privileged teacher and the student at inference as the root cause of this failure in OPSD. To resolve this asymmetry, we propose Dual-Anchored Policy Distillation (DAPD), a unified framework with two levels of anchoring. Dual-Path Anchoring (DPA) introduces a self-conditioned bridge and aligns reference and rollout behavior along two matched-information paths, preventing privilege-dependent behavior from being transferred to the inference-time student. Dual-Source Anchoring (DSA) applies these paths in both reference-to-rollout and rollout-to-reference directions, reducing reliance on privileged reference guidance while preserving correctness supervision. Extensive experiments show that DAPD significantly alleviates privilege illusion, outperforming OPSD on Qwen3-4B by +2.00 points on average across tasks. Notably, its gains persist across scales, reaching +2.69 at 4B and +2.78 at 32B.
中文摘要
摘要:在语言模型后训练中,策略内(自我)蒸馏(OPSD)越来越被采用。它通过特权信息增强教师模型,但可能引发特权错觉:学生模型学习了依赖特权的行为,而这些行为在推理时无法从上下文再现,但表现却好像训练时的特权信息仍然可用,最终导致性能下降。在本文中,我们确定了特权教师和推理时学生模型之间的信息不对称是OPSD失败的根本原因。为解决这一不对称性,我们提出了双锚策略蒸馏(DAPD),一个具有双层锚定的统一框架。双路径锚定(DPA)引入自条件桥梁,并沿两个信息匹配路径对参考行为和回滚行为进行对齐,防止特权依赖行为被传递给推理时的学生模型。双源锚定(DSA)在参考到回滚以及回滚到参考两个方向上应用这些路径,减少对特权参考指导的依赖,同时保持正确性监督。大量实验表明,DAPD显著缓解了特权错觉,在Qwen3-4B上比OPSD平均高出2.00分。值得注意的是,其增益在不同规模上持续存在,在4B模型上达到+2.69,在32B模型上达到+2.78。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文旨在解决 On-Policy (Self) Distillation (OPSD) 中存在的 特权幻觉(privilege illusion) 问题。
具体而言,论文试图解决的核心问题及其根源可概括为以下几个方面:
1. 核心问题:特权幻觉
在 OPSD 中,教师模型(teacher)在训练时被赋予了特权信息(如参考答案 y^ 或工具输出),而学生模型(student)在推理时无法访问这些信息。这种信息不匹配导致学生模型学习到一种*依赖特权信息的行为__——即它在推理时无法复现这些行为,却表现得好像训练时的特权信息仍然可用。这表现为学生模型做出无根据的断言(unsupported claims)、编造答案或继续推导仿佛 unseen 的参考存在一样,最终导致任务性能下降。
2. 现有方法的局限性
现有缓解特权幻觉的方法主要分为两类,但均存在结构性缺陷:
- 直接使用特权信息:将教师模型条件化于特权信息并进行全监督蒸馏;
- 选择性迁移特权监督:通过过滤或重加权来抑制特权依赖的监督信号。
这些方法的问题在于,它们修改的是特权教师信号本身,而非解决教师与学生之间的信息不匹配。它们未能可靠地将可复现的指导(reproducible guidance)与特权依赖行为(privilege-dependent behavior)分离开来。此外,这些方法仅以参考答案作为唯一指导源,忽视了学生模型自身生成的 rollout 中包含的有意义推理信号。
3. 根本原因:信息不对称(Information Asymmetry)
论文将特权幻觉的根本成因归结为信息不对称:训练时,拥有特权信息的教师模型监督的是一个不具备该信息的学生分布;而推理时,学生模型必须在完全没有特权信息的条件下进行预测。这种不对称使得 OPSD 的目标函数将有用监督与不可复现的教师变化纠缠(entangle)在一起,形成了所谓的纠缠蒸馏(Entangled Distillation)。
4. 提出的解决方案:DAPD
为解决上述信息不对称问题,论文提出了 Dual-Anchored Policy Distillation (DAPD),一个统一的框架,通过两种锚定机制来纠正 OPSD 的结构性缺陷:
- Dual-Path Anchoring (DPA):引入一个**自条件分布(Self distribution)**作为可训练的桥梁,构建两条互补的对齐路径:
- 无条件路径(Unconditioned Path):在无特权信息的条件下,通过**推理锚点(Inference Anchor)**对齐参考与 rollout 行为;
- 特权路径(Privileged Path):在双方均拥有特权信息的条件下,通过**特权锚点(Privileged Anchor)**对齐行为。
这使得 DPA 能够在信息匹配的条件下进行蒸馏,防止特权依赖行为被转移到推理时的学生模型。
- Dual-Source Anchoring (DSA):将上述路径同时应用于参考指导 rollout(reference-to-rollout)和rollout 指导参考(rollout-to-reference)两个方向,从而平衡可靠的参考指导( correctness-oriented )与学生可到达的 on-policy 指导(student-reachable)。
通过这两种机制,DAPD 在六个基准测试和从 1.7B 到 32B 的 Qwen3 模型上显著缓解了特权幻觉,并持续优于 OPSD。
Q: 有哪些相关研究?
根据论文第5节(Related Work)及全文引用,相关研究主要分布在以下两个方向:
1. 推理语言模型(Reasoning Language Models)
将预训练语言模型转化为推理模型的后训练方法主要包括监督微调(SFT)、强化学习(RL)与蒸馏。现有研究探索了多种监督信号来源及其权衡:
- 参考完成(Reference Completions):提供可靠的正确性导向指导,但可能偏离当前策略分布(off-policy)。
- 代表性工作:Wei et al. (2022) 的 Chain-of-Thought Prompting;Kojima et al. (2022) 的 Zero-Shot Reasoners;Cobbe et al. (2021) 的 Training Verifiers;Lewkowycz et al. (2022) 的 Minerva;Lightman et al. (2024) 的 Process Reward Models(Let’s Verify Step by Step);Hendrycks et al. (2021) 的 MATH 数据集。
- 自生成 Rollout 与奖励反馈:反映当前模型行为(on-policy),但可能包含错误。
- 代表性工作:Zelikman et al. (2022) 的 STaR(Bootstrapping Reasoning With Reasoning);Shao et al. (2024) 的 DeepSeekMath;DeepSeek-AI (2025) 的 DeepSeek-R1;Guha et al. (2025) 的 OpenThoughts。
- 一致性方法:Wang et al. (2023) 提出 Self-Consistency Improves Chain of Thought Reasoning。
DAPD 的设计原则正是利用参考(reference)与 Rollout 的互补性:参考提供可靠的正确性信号,而 Rollout 提供学生可达(student-reachable)的 on-policy 信号。
2. 策略(自)蒸馏(On-Policy and Self-Distillation)
该方向关注如何在模型自身采样的轨迹上提供密集的 token 级监督,以减少离线蒸馏中的分布不匹配。
- 经典蒸馏与序列级蒸馏:
- Hinton, Vinyals, and Dean (2015) 提出知识蒸馏(Knowledge Distillation);
- Kim and Rush (2016) 提出序列级知识蒸馏(Sequence-Level Knowledge Distillation)。
- On-Policy Distillation (OPD):
- Agarwal et al. (2024) 与 Thinking Machines Lab (2025) 在 on-policy 设置下提供密集教师监督,减少 rollout 不匹配。
- 后续工作通过改变教师上下文、目标函数或 token 权重来改进 OPD:Ye et al. (2026);Yang et al. (2026);Hou et al. (2026);Jin et al. (2026);Xu et al. (2026)。
- On-Policy Self-Distillation (OPSD) 及特权信息的使用:
- Zhao et al. (2026a) 提出 OPSD,通过条件化同一模型于特权信息(如参考答案)来构建更强的自教师;
- Penaloza et al. (2026) 探索特权信息蒸馏;
- Shenfeld et al. (2026) 提出 SDFT,使用指数移动平均自教师条件化于专家演示;
- Hübotter et al. (2026) 提出 SDPO,条件化自教师于成功的 Peer Rollout 或环境反馈。
- 缓解特权幻觉的近期扩展: 这些工作在信息不对称的框架下修改或路由特权监督信号,但未从根本上匹配教师与学生的信息可用性:
- 过滤/校准/路由方法:Nguyen et al. (2026) 的 AVSD;Zheng et al. (2026) 的 SCOPE;Yu et al. (2026) 的 DOPD;Tu et al. (2026) 的 UCOB;Ko et al. (2026);Shen et al. (2026) 的 Purified OPSD(通过点互信息修正移除可单独从参考预测出的监督分量);Zhao et al. (2026b) 的 ROSD。
- 机制分析:Li et al. (2026) 与 Kaur et al. (2026) 对 on-policy 蒸馏的现象学、机制与扩展性进行了分析。
DAPD 与上述工作的核心区别在于:保留 on-policy 采样与特权教师构造,但通过引入匹配信息可用性的中间锚定分布(Self distribution)以及双向指导源(参考与 Rollout),从根本上纠正 OPSD 中的信息不对称,而非仅对不对称的监督信号进行过滤或重加权。
Q: 论文如何解决这个问题?
论文通过提出 Dual-Anchored Policy Distillation (DAPD) 框架来解决 OPSD 中的特权幻觉问题。其核心思路是:消除教师分布与学生分布在训练时的信息可用性差异(information asymmetry),并同时利用参考(reference)与 Rollout 两种互补的指导源。具体解决方案分为两个相互协同的层级:
1. 关键创新:引入 Self 分布作为可训练桥梁
DAPD 首先引入了一个中间分布——Self distribution,定义为:
p^(Self)(θ,t) = pθ(· mid x, y_(<t), y)
即在预测第 t 个 token 时,条件化于当前正在生成的完整完成序列 y 本身。这与以下两个分布形成关键对比:
- None: p^(None)(θ,t) = pθ(· mid x, y_(<t)) ,无任何特权信息,对应推理时的学生;
- Cross: p^(Cross)(θ,t) = pθ(· mid x, y(<t), y^) ,条件化于参考答案 y^_ ,对应 OPSD 中的特权教师。
Self 分布的独特作用在于:
- 相对于 Cross(脱离的特权教师),Self 是可训练的,因为它与 None 共享同一策略参数;
- 相对于 None(推理时的学生),Self 与 Cross 是信息匹配的,因为它同样接收了完整的完成序列作为条件。
由此,Self 填补了“无特权的可训练学生”与“有特权的脱离教师”之间的空缺,成为连接两者的桥接锚点(bridging anchor)。
2. Dual-Path Anchoring (DPA):在匹配信息条件下对齐行为
基于 Self 分布,DAPD 定义了三个有向目标函数( s ∈ y, y^* 表示当前完成源, s 表示另一完成源):
Entangled Distillation(保留原始 OPSD 监督):
L^s(ent) = E[D(sg[p^s(Cross)] ,|, p^s_(None))]Inference Anchor(推理锚点,将 Self 拉向 None):
L^s(infer) = E[D(sg[p^s(None)] ,|, p^s_(Self))]Privileged Anchor(特权锚点,将 Self 拉向 Cross):
L^s(priv) = E[D(sg[p^s(Cross)] ,|, p^s_(Self))]
DPA 将上述目标组合为两条互补的对齐路径,针对每个有序方向 s to s (如 Rollout 指导 Reference):
(1)无条件路径(Unconditioned Path) 该路径旨在对齐双方均无特权信息时的行为,即对齐两个 None 分布。它通过 Inference Anchor 与 Entangled Distillation 的联合实现:
L^(s to s)(uncond) = L^(s)(infer) + L^s_(ent)
以 y to y^* 方向为例:
- L^y(ent) 将 Rollout 侧的 p^y(None) 推向其特权教师 p^y_(Cross) ;
- L^(y^)(infer) 将 Reference 侧的 p^(y^)(Self) 推向 p^(y^*)_(None) 。
由于 p^(y^)(Self) 与 p^y(Cross) 共享模型参数且均条件化于 y^ ,二者充当代理桥梁(proxy bridge)。这一联合更新隐式地使得 p^y(None) 向 p^(y^*)(None) 对齐,从而在无特权信息的条件下实现了参考行为与 Rollout 行为的对齐。
(2)特权路径(Privileged Path) 当双方均可获得完整完成序列时(即 Self 与 Cross 均拥有特权信息),直接通过 Privileged Anchor 进行对齐:
L^(s to s)(priv) = L^s(priv)
DPA 的完整目标为两条路径之和:
L^(s to s)(DPA) = L^(s to s)(uncond) + L^s(priv) = L^(s)(infer) + L^s(ent) + L^s(priv)
3. Dual-Source Anchoring (DSA):平衡两种互补的指导源
DPA 解决了“如何在匹配信息条件下对齐”的问题,而 DSA 解决“以哪个完成序列作为指导源”的问题。DAPD 认为,参考( y^* )与 Rollout( y )提供互补的指导:
- Reference:可靠、面向正确性,但可能偏离当前策略(off-policy);
- Rollout:学生可达(student-reachable)、on-policy,但可能包含错误。
因此,DSA 将 DPA 同时应用于两个方向:
- Rollout → Reference( y to y^* ):Rollout 作为完成序列,Reference 提供指导,强调正确性;
- Reference → Rollout( y^* to y ):Reference 作为完成序列,Rollout 提供指导,强调学生可达性。
最终,DAPD 的总目标通过系数 $λ ∈
0, 1
$ 平衡两个方向:
L(DAPD) = λ L^(y to y^)(DPA) + (1 - λ) L^(y^ to y)_(DPA)
4. 总结:如何缓解特权幻觉
通过上述设计,DAPD 从信息结构的根源上解决了 OPSD 的缺陷:
- 消除信息不对称:特权教师不再直接监督无特权的学生。取而代之的是,在无条件路径中,双方通过 Self 桥接在“无特权”条件下间接对齐;在特权路径中,双方均在“有特权”条件下直接对齐。这阻止了特权依赖行为向推理时的学生转移。
- 解开纠缠蒸馏(Entangled Distillation):原始 OPSD 将可复现的指导与不可复现的特权依赖行为混合在一起。DAPD 通过分离的锚定路径,确保学生只在能够复现的信息条件下接受监督。
- 利用互补信号:DSA 同时利用可靠的 Reference 和 on-policy 的 Rollout,避免了单一指导源的局限性,使训练既受益于参考答案的正确性,又保持对学生自身推理轨迹的敏感性。
Q: 论文做了哪些实验?
论文进行了系统的实验验证,涵盖整体性能对比、跨规模扩展性、分布外泛化、定性行为分析,以及针对框架核心组件的受控消融实验和敏感性分析。具体如下:
1. 实验设置
- 模型:Qwen3 系列,参数规模覆盖 1.7B、4B、8B、14B 与 32B。
- 训练数据:OpenThoughts,按任务域划分:
- 推理(Reasoning):math 域
- 代码(Coding):code 域
- 指令遵循(Instruct):math + code + science 混合域
- 评测基准:
- 推理:AIME24、AIME25、HMMT25(指标为 Avg@12,即每题采样 12 次取平均正确率)
- 代码:LiveCodeBench v5(LCB v5)、BFCL v3
- 指令遵循:IFBench
- 对比基线:Base、OPSD、SDFT、SDPO、Purified OPSD、DOPD。
- 实现:基于 LoRA(rank 64, scale 128),使用分量裁剪的前向 KL 散度(component-clipped forward KL)作为蒸馏目标。
2. 主要结果
(1)整体性能对比(Qwen3-4B)
在六个基准上全面对比(Table 1)。DAPD 在推理、代码和指令任务上均取得最佳或次佳表现,六任务平均达到 57.34,相较 OPSD 提升 +2.00 分。其中 AIME25 提升最大(+4.44),HMMT25 提升 +3.06。
(2)跨模型规模的扩展性(Figure 1b, Table 6)
在 1.7B 至 32B 五个规模上评估。关键发现:
- OPSD 相对 Base 的收益随规模增大而显著衰减(从 1.7B 的 +5.19 降至 32B 的 +0.28)。
- DAPD 的收益则稳定保持:4B 时 +2.69,8B 时 +2.41,14B 时 +2.04,32B 时 +2.78。
这表明大模型生成更高质量的 Rollout 时,OPSD 因特权幻觉反而抵消了收益,而 DAPD 通过信息匹配监督保留了这些收益。
(3)分布外(OOD)泛化(Table 2)
在推理数据上训练,直接零样本评测于代码(LCB v5、BFCL v3)和指令(IFBench)任务。DAPD 取得 OOD 平均最佳成绩 49.64,较 OPSD(48.27)提升 +1.37,且在 LCB v5 上提升达 +4.82,验证了信息匹配目标对鲁棒性的增益。
(4)定性行为与特权幻觉动态(Figure 2, Figure 4, Table 7, Table 9)
- 定义行为探针(Behavioral Probe):检测模型在推导失败后是否声称“回忆起”一个无根据的答案。
- 训练动态(Table 7):OPSD 的 wrong claims 从训练初期的 7.41/万代 上升至 300 步时的 37.04;而 DAPD 在 300 步时仅为 11.11,相对 OPSD 减少 73%。
- 推理案例可视化(Figure 4, Table 9):展示 OPSD 在相同解码设置下编造答案(如“I recall that the answer is likely 36/7”),而 DAPD 能从提示独立推导出正确答案。
3. 消融实验
(1)Dual-Path Anchoring (DPA) 路径组件消融(Table 3a)
对单一指导源(Reference 或 Rollout),逐步添加路径组件:
| 组件组合 | Reference 源 Avg@12 | Rollout 源 Avg@12 |
|---|---|---|
| Entangled Distillation alone | 62.13 | 63.33 |
| + Inference Anchor | 63.43 | 64.91 |
| + Inference + Privileged Anchor | 63.89 | 65.09 |
结果证明:无条件路径(Inference Anchor)和特权路径(Privileged Anchor)均为必要,逐步添加均带来性能提升。
(2)Dual-Source Anchoring (DSA) 指导源消融(Table 3b)
对比仅使用 Reference 指导、仅使用 Rollout 指导、以及两者结合:
| 指导源 | Avg@12 |
|---|---|
| 仅 Reference | 63.89 |
| 仅 Rollout | 65.09 |
| 两者结合(DSA) | 65.28 |
验证了两个来源的互补性:结合后优于任一单一来源。
(3)敏感性与鲁棒性分析(Table 3c, 3d)
- Privileged Anchor 权重(Table 3c):不同规模对锚点强度的偏好不同。例如,4B 模型在 Reference-guided Privileged Anchor 权重为 1 时最佳(65.28),而 8B 和 14B 在权重为 2 时更优。
- 指导权重 λ 的尺度依赖性(Table 3d):
- 1.7B 小模型:最优 λ = 0.5 (更依赖可靠的 Reference)
- 4B/8B/14B 大模型:最优 λ = 0.2 (更信任自身 Rollout)
这揭示了**可靠性—可达性权衡(reliability–reachability trade-off)**随模型规模演化的现象。
(4)无参考(Reference-Free)DAPD(Table 3e)
探索是否可以去除人工 curated 的参考答案:
- Dual Rollout:用两个独立采样的 Rollout 互为参考/学生源。在 1.7B/4B/8B 上分别比 OPSD 提升 +0.46/+2.41/+2.41。
- Verified Rollout:对参考侧的 Rollout 用验证器筛选正确答案。进一步提升至 43.15(1.7B)、66.11(4B)、67.59(8B)。
证明 DSA 机制可在无参考设置下运作,且正确性验证信号能进一步放大收益。
4. 实现层面的补充实验
- 散度方向与裁剪(Table 8, Appendix C.3):对比 Forward KL vs. Reverse KL,以及有无 component cap(0.05)。Component-clipped Forward KL 表现最佳(65.28),支持其作为默认实现。
- 理论假设的实证检验(Appendix B.4):在 Qwen3-4B 的 LoRA 子空间中直接测量公式 (20) 的梯度兼容性标量,得到正均值(256.62)和正余弦相似度(0.101),95% 自助置信区间不包含零,实证支持了 Inference Anchor 通过共享参数影响 Cross 分布的理论机制。
Q: 有什么可以进一步探索的点?
基于论文的结论与局限性分析,以下几个方向值得进一步探索:
1. 完全无参考(Reference-Free)的 DAPD
论文的初步实验(Table 3e)表明,双 Rollout 机制可在无人工 curated 参考答案的情况下取得增益。后续可系统研究:
- 如何用**验证器(verifier)或共识机制(consensus)*动态选择并更新参考侧的完成序列,替代固定的 y^ ;
- 设计在线迭代流程,使指导源随策略改进而持续演化,降低对高质量参考答案的依赖。
2. 自适应源信任与动态权重分配
现有 DAPD 使用全局固定的系数 λ 平衡参考与 Rollout 指导。进一步的研究可探索:
- token 级或样本级的自适应权重:根据当前模型容量、Rollout 可靠性或任务难度,动态调整 L_(DAPD) 中各方向的权重;
- 避免硬门控:用基于不确定性或价值估计的连续权重替代离散的源选择,以更好地处理不同规模模型(如 1.7B 与 32B)对参考指导与 Rollout 指导的差异化需求。
3. 更广泛形式的特权信息
论文框架以参考答案 y^ 作为特权信息的典型代表,但其核心思想——*匹配教师与学生的信息可用性——可推广至其他训练时可用、推理时不可用的信息模态:
- 检索得到的文档(retrieved documents);
- 工具执行轨迹(tool traces);
- 中间规划或验证器反馈(intermediate plans, verifier feedback)。
探索这些场景需要重新设计相应的 Self/Cross/None 分布构造,以及适用于结构化输出的锚定机制。
4. 训练效率与计算开销优化
DAPD 在每次训练步需构造多个条件分布( p(None), p(Cross), p_(Self) )并计算双向目标,增加了训练时计算量。未来工作可关注:
- 蒸馏路径的稀疏化或层级化,减少冗余的前向传播;
- 高效共享计算:利用 Cross 与 Self 在特权条件上的重叠,设计更紧凑的实现,或探索是否可通过单次前向同时获取多个视图。
5. 开放式生成任务的适用性
当前 verified-rollout 变体依赖自动正确性信号(如数学答案的精确匹配),这在开放式指令遵循、创意写作等任务中难以获得。需研究:
- 针对无明确正确性标签任务的特权幻觉检测与缓解方法;
- 基于模型自评(self-critique)或偏好模型(preference model)的软验证信号,以扩展 DAPD 的应用边界。
6. 理论机制的深化
论文通过 Proposition 1 及梯度兼容性条件(Eq. 20)初步形式化了无条件路径的有效性。后续可进一步:
- 在更弱假设下量化桥接一致性(bridge-consistency) ε_(bridge) 的边界;
- 分析 DAPD 目标在策略优化动力学中的收敛性质,特别是在与强化学习(RL)目标结合时的交互效应。
Q: 总结一下论文的主要内容
论文针对 On-Policy (Self) Distillation (OPSD) 中的**特权幻觉(privilege illusion)**问题,提出了 Dual-Anchored Policy Distillation (DAPD) 框架。以下是核心内容的系统总结:
1. 问题与动机
OPSD 通过让教师模型条件化于特权信息(如参考答案 y^ )来增强监督信号,但学生模型在推理时无法访问该信息。这导致学生学习到*依赖特权的行为__——在推理时做出无根据的断言、编造答案或继续不可复现的推导——最终损害性能。现有方法(如直接特权监督或选择性信号过滤)未能可靠分离可复现指导与特权依赖行为,因为它们未解决教师与学生之间的结构性信息错配。
2. 根本原因:信息不对称
论文识别出 信息不对称(information asymmetry) 是特权幻觉的根源。在 OPSD 目标中:
L(OPSD) = E[(1) / (|y|)∑(t=1)^(|y|) D(sg[p(Cross)] ,|, p(None))]
教师分布 p(Cross) = pθ(· mid x, y(<t), y^) 拥有特权信息,而学生分布 p(None) = pθ(· mid x, y(<t)) 没有。这种不对称使得*可复现指导与不可复现的特权依赖行为被纠缠__(Entangled Distillation)并一同蒸馏给学生。
3. 方法:DAPD
为纠正信息不对称,论文提出 DAPD,包含两个互补层级:
3.1 Dual-Path Anchoring (DPA):信息匹配对齐
引入**自条件分布(Self distribution)**作为可训练的桥接锚点:
p^(Self)(θ,t) = pθ(· mid x, y_(<t), y)
Self 与 Cross 信息匹配(均接收完整完成序列),同时又与 None 共享参数(可训练)。基于 Self,DPA 构建两条路径:
- 无条件路径(Unconditioned Path):通过 Inference Anchor $L^s(infer) = E
D(sg[p(None)
,|, p(Self))] 与 Entangled Distillation L^s(ent) 的组合,在无特权信息条件下隐式对齐 p(None) 与 p^(y^*)(None)$。 - 特权路径(Privileged Path):通过 Privileged Anchor $L^s(priv) = E
D(sg[p(Cross)
,|, p_(Self))]$,在双方均拥有特权信息时直接对齐。
3.2 Dual-Source Anchoring (DSA):平衡互补指导源
DPA 解决了“如何对齐”,DSA 解决“以谁为指导”。论文认为**参考(Reference)**提供可靠但可能 off-policy 的正确性信号,而 Rollout 提供 on-policy 但可能错误的学生可达信号。DSA 将 DPA 同时应用于两个方向:
- Rollout → Reference( y to y^* ):Rollout 作为完成,参考提供指导;
- Reference → Rollout( y^* to y ):参考作为完成,Rollout 提供指导。
最终目标通过权重 λ 平衡:
L(DAPD) = λ L^(y to y^)(DPA) + (1-λ) L^(y^ to y)_(DPA)
4. 实验结果
在 Qwen3 模型族(1.7B 至 32B)与六个基准(AIME24/25、HMMT25、LCB v5、BFCL v3、IFBench)上的实验表明:
- 性能提升:DAPD 在 Qwen3-4B 上六任务平均得分为 57.34,较 OPSD 提升 +2.00,其中 AIME25 提升达 +4.44。
- 规模扩展性:OPSD 相对 Base 的收益随规模增大而消失(32B 仅 +0.28),而 DAPD 收益稳定保持,32B 时仍达 +2.78。
- 分布外泛化:在推理数据上训练的模型零样本迁移至代码与指令任务,DAPD OOD 平均优于 OPSD +1.37。
- 特权幻觉缓解:行为探针显示,DAPD 将 late-stage wrong claims 较 OPSD 减少 73%。
- 消融验证:逐步添加 Inference Anchor 与 Privileged Anchor 均带来单调提升;Reference 与 Rollout 双向指导的组合优于任一单向指导。
5. 核心贡献
- 机理诊断:首次将 OPSD 中的特权幻觉归因于教师与学生的信息不对称,而非单纯的教师质量问题。
- 框架创新:提出 DAPD,通过信息匹配锚定(DPA)与双向指导源平衡(DSA),在不增加推理开销的前提下根本性地缓解特权幻觉。
- 实证验证:在跨任务、跨规模(1.7B–32B)及分布外场景下,系统验证了 DAPD 相对于现有 OPSD 变体的一致优势。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Jianyu Wu,Yizhou Wang,Encheng Su,Chen Tang,Shixiang Tang
PDF URL: https://arxiv.org/pdf/2608.01735.pdf
Arxiv URL: https://arxiv.org/abs/2608.01735
Arxiv ID: 2608.01735
CoolPaper URL: https://papers.cool/arxiv/2608.01735
Published: 2026-08-05T01:01:55.362Z
Updated: 2026-08-05T01:01:55.362Z
4. Progressive Agent Skill Generation via Reinforcement Learning
Abstract:Existing skill generation methods largely rely on heuristics or pipeline-style consolidation, which must be specially designed for different evidence sources. In contrast, learning-based approaches offer a more unified way to model skill generation across heterogeneous sources. However, learning-based skill generation remains challenging because skills lack a natural supervision signal based on relevance or correctness; their value can largely be determined only by whether they improve the behavior of the agent on downstream tasks. To address this challenge, we propose Skill-$\alpha$, a reinforcement learning method for progressively generating high-quality agent skills. Specifically, we formulate skill generation as a sequential editing process that decomposes skill construction into individually evaluable edits, and introduce a novel rollback reward that evaluates each edit by comparing downstream execution under the original and edited skills on an anchored query. Extensive experiments show that Skill-$\alpha$ generates more effective skills than methods based on heuristics or pipelines in both document-to-skill and experience-to-skill settings. Under the main GPT-4o worker, Skill-$\alpha$ improves average downstream success rates over the strongest skill-generation baseline by 3.3 points on CL-Bench and 6.7 points on tau2-bench. Further ablations validate the importance of rollback reward and progressive generation.
中文摘要
摘要:现有的技能生成方法在很大程度上依赖于启发式或流水线式整合,这些方法必须针对不同的证据来源进行专门设计。相比之下,基于学习的方法为跨异构来源建模技能生成提供了一种更统一的方式。然而,基于学习的技能生成仍然具有挑战性,因为技能缺乏基于相关性或正确性的自然监督信号;它们的价值在很大程度上只能通过是否改善代理在下游任务中的行为来确定。为了解决这一挑战,我们提出了Skill-$\alpha$,这是一种用于逐步生成高质量代理技能的强化学习方法。具体而言,我们将技能生成表述为一个序列编辑过程,将技能构建分解为可以单独评估的编辑,并引入了一种新颖的回滚奖励,通过在锚定查询上比较原始技能和编辑后技能的下游执行情况来评估每次编辑。大量实验表明,Skill-$\alpha$在文档到技能和经验到技能的设置中生成的技能比基于启发式或流水线的方法更有效。在主要的GPT-4o工作者下,Skill-$\alpha$在CL-Bench上的平均下游成功率比最强的技能生成基线提高了3.3个百分点,在tau2-bench上提高了6.7个百分点。进一步的消融实验验证了回滚奖励和逐步生成的重要性。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决自动从异构证据源生成高质量智能体技能的问题,并克服现有方法与学习信号两方面的核心挑战。
具体而言,论文试图解决以下关键问题:
1. 现有方法缺乏统一的跨源学习框架
- 当前的技能生成方法主要依赖启发式规则或流水线式整合,需要针对不同的证据来源(如文档、任务描述、执行轨迹等)进行专门设计。
- 文档到技能(document-to-skill)与经验到技能(experience-to-skill)通常使用互不兼容的管道,难以用一个统一的框架处理。
2. 技能缺乏直接可监督的学习信号
- 与数学推理、网络搜索或记忆管理等任务不同,技能的质量没有基于相关性或正确性的自然监督信号。
- 一个流畅的技能可能是冗余的、过度具体的或具有误导性的;而一个紧凑的编辑可能显著改善智能体行为。因此,技能的真实价值只能通过其在下游任务上对智能体行为的实际影响来间接评估。
- 这种**基于执行的信用分配(execution-grounded credit assignment)**是基于学习的技能生成面临的主要障碍。
3. 将技能生成转化为可学习的局部决策过程
- 为应对上述挑战,论文提出将技能构建视为一个渐进的顺序编辑过程,将整体技能生成分解为一系列可单独评估的局部编辑(如创建、更新、合并、剪枝、不操作)。
- 核心难点在于如何为每一次局部编辑提供有效的训练信号,以判断该编辑是否真正改善了下游执行效果。
简言之,该论文致力于构建一个基于强化学习的统一技能生成框架,使其能够跨越文档与经验等异构证据源,通过执行反馈驱动的局部编辑学习,渐进地生成能够切实提升下游任务成功率的高质量技能。
Q: 有哪些相关研究?
该论文在第2节系统梳理了三个密切相关的研究方向,并在引言与实验部分对比了具体基线方法。相关研究可归纳如下:
1. 智能体技能(Agent Skills)
该方向将技能视为可复用的程序模块,用于条件化智能体的推理过程并重塑其在下游任务中的行为。代表性研究涵盖:
- 技能演化:如 Shen et al. (2026)、Xia et al. (2026)、Ouyang et al. (2026) 等工作探索技能随使用或时间自动迭代更新;
- 技能选择与检索:如 Zeng et al. (2026)、Liu et al. (2026)、Zheng et al. (2026) 研究从大规模技能库中挑选适配当前任务的技能;
- 技能利用与内化:如 Wang et al. (2023; 2025a) 与 Wang et al. (2026b) 分别关注如何在推理中加载技能,以及如何将外部技能沉淀为模型内部能力。
这些研究表明,技能可作为功能单元指导规划、工具调用与长期任务求解(Wang et al., 2026c;d; Xu & Nie, 2025)。近期研究重心逐渐转向自动技能生成与获取(Si et al., 2026; Yang et al., 2026; Ni et al., 2026; Mi et al., 2026)以及相应的基准评估(Huang et al., 2026; Zhou et al., 2026; Li et al., 2026)。
2. 技能生成与获取(Skill Generation and Acquisition)
该方向关注如何从文档、任务上下文、经验或执行轨迹等证据源中构建可复用的技能模块,大致可分为三类:
- 早期经验蒸馏:ExpeL(Zhao et al., 2024)与 Agent Workflow Memory(Wang et al., 2025c)将验证器反馈或工作流记忆转化为可复用的程序知识;
- 基于提示的自动创建:Anthropic (2026) 探索了通过提示让语言模型直接生成技能;
- 流水线式自动构建系统:
- 文档到技能(Document-to-skill):Ctx2Skill(Si et al., 2026)与 AutoSkill(Yang et al., 2026)将任务文档、规则或长上下文压缩为可执行的程序指令;
- 经验到技能(Experience-to-skill):Trace2Skill(Ni et al., 2026)、SkillX(Wang et al., 2026a)与 SkillPro(Mi et al., 2026)将执行轨迹、环境反馈或层次化经验蒸馏为可复用技能。
这些自动化方法虽然在特定设定下有效,但大多依赖启发式规则或面向特定证据类型的流水线式整合,缺乏统一的跨源学习机制。
3. 用于外部模块优化的强化学习(RL for External Module Optimization)
近年来,研究者将强化学习应用于大语言模型智能体的外部模块管理,而非直接优化智能体本身的行为策略:
- 推理能力优化:如 PPO(Schulman et al., 2017)、DeepSeek-R1(DeepSeek-AI et al., 2025)、DAPO(Yu et al., 2025)等通过 RL 增强慢思考与推理能力;
- 工具使用与网络搜索:优化外部工具调用策略(Li et al., 2025; Singh et al., 2025)、环境交互方式(Cheng et al., 2025; Zhao et al., 2026)以及搜索结果的利用(Qi et al., 2024; Jin et al., 2025);
- 外部记忆管理:Memory-R1(Yan et al., 2025)与 Mem-α(Wang et al., 2025b)使用 RL 优化记忆的构建、更新与检索。
论文指出,技能生成与上述方向存在本质差异:工具调用与记忆管理决策通常可通过事实正确性或相关性直接评判;而技能作为程序模块,其价值主要体现在对智能体未来行为分布的改变程度,因此缺乏直接的监督信号,难以直接套用既有 RL 框架。Skill-α 的核心贡献正是通过渐进式编辑分解与Rollback Reward解决了这一独特的信用分配问题。
Q: 论文如何解决这个问题?
论文提出 Skill-α,一种基于强化学习的渐进式技能生成框架,通过将整体生成重构为局部编辑决策序列,并引入**回滚奖励(rollback reward)**实现基于执行的信用分配。具体解决方案包含以下四个层面:
1. 渐进式局部编辑:将技能生成重构为顺序决策过程
为克服一次性整体生成中证据过载、操作纠缠及信用分配模糊的问题,Skill-α 将技能构建视为一个顺序编辑过程:
At sim πφ(· mid z(t-1), x_t), quad z_t = Edit(z(t-1), A_t)
其中 z(t-1) 为当前技能状态,x_t 为第 t 步读取的证据单元,A_t 为策略 πφ 采样的局部编辑动作。经过 T 步后,最终技能 z_T 即为生成结果。
动作空间被定义为五种原子操作,覆盖技能的生命周期管理:
- CREATE:补充缺失的规则或流程;
- UPDATE:修正不完整或不准确的规则;
- MERGE:整合重叠或冗余内容;
- PRUNE:删除有害或过度具体的片段;
- NOOP:当当前证据无新增价值时保持技能不变。
这种渐进式分解将技能生成从”黑盒式整体写作”转化为”可单独评估的局部编辑决策”,既缓解了长上下文压力,也为后续的逐编辑信用分配提供了结构基础。
2. Rollback Reward:基于执行的编辑级信用分配
针对技能缺乏直接监督信号、价值仅能通过下游执行体现的难题,论文提出 rollback reward 作为核心训练信号。其关键思想是:在相同的证据相关锚定查询(anchored query)上,比较编辑前后技能的执行效果。
对于第 t 步的编辑决策,选取一个与证据同源的任务查询 qt^(anc),令固定工作者(worker)分别在原始技能 z(t-1) 和编辑后技能 z_t 上执行:
at^(ctrl) sim π_psi(· mid q_t^(anc), z(t-1)), quad a_t^(edit) sim π_psi(· mid q_t^(anc), z_t)
随后由基准特定的验证器 Vt 对两次执行结果打分:r_t^(ctrl) = V_t(a_t^(ctrl)) 与 r(t,i)^(edit) = Vt(a(t,i)^(edit))。候选编辑 A_t^((i)) 的回滚奖励定义为:
R(rb)(A_t^((i))) = 1, & 若 A_t^((i)) = NOOP 且 r(t,i)^(edit) > r_t^(ctrl) 1, & 若 A_t^((i)) = NOOP 且 无其他有效编辑超越 r_t^(ctrl) 0, & 其他情况
该设计确保:
- 非 NOOP 编辑仅在严格优于原始技能时获得正奖励,避免将查询本身的简单性或工作者的固有能力误判为编辑的贡献;
- NOOP 作为组内回退机制,在当前技能已足够优时被激励,防止不必要的修改引入噪声。
附录中的理论分析进一步表明,在校准验证器下,期望回滚奖励能够保持理想偏序关系;对于二元验证器,其期望严格保持编辑后成功概率的排序。
3. 基于 GRPO 的策略优化
Skill-α 采用 Group Relative Policy Optimization (GRPO) 训练编辑策略 πφ。对于每个局部编辑状态,从旧策略中采样一组候选动作 A_t^((i))(i=1)^G,计算组内相对优势:
A_i = r_i - mean(r_1, dots, r_G){std(r_1, dots, r_G)}
策略通过如下 clipped 目标进行优化:
J(GRPO)(φ) = E[ (1) / (G)∑(i=1)^G min( rhoi(φ)A_i, clip(rho_i(φ), 1-ε, 1+ε)A_i ) - β D(KL)(πφ | π(ref)) ]
其中 rhoi(φ) = (πφ(Ai mid X)) / (πφ^(textold))(A_i mid X)。这种组内相对归一化降低了对绝对奖励尺度的依赖,适合技能生成中验证器信号差异大的场景。
4. 统一跨证据源的训练实现
Skill-α 通过共享的序列化接口统一处理异构证据:
- 文档到技能:将长文档分解为有序自然段,逐段渐进编辑;短文档直接处理。
- 经验到技能:将执行轨迹、工具观察及环境反馈序列化为紧凑的标准化视图,每批包含最多 4 条轨迹,每条保留至多 8 步与 3000 字符。
训练分为两阶段:
- 监督微调(SFT):使用 DeepSeek-V4-Pro 从训练集中合成高质量的编辑演示数据,让策略学习动作语法与基本的证据 grounded 编辑行为;
- 强化学习(GRPO):在固定的 GPT-4o 工作者上,基于回滚奖励优化局部编辑策略。验证器在 CL-Bench 上使用 GPT-5.5 的任务专属评分规则,在 SpreadsheetBench 与 tau2-bench 上使用基准环境直接反馈。
总结
Skill-α 的解决路径可概括为:通过渐进式编辑将不可直接监督的技能生成问题拆解为局部决策序列,再通过回滚奖励将下游执行反馈精准归因到每一次局部编辑,最终利用 GRPO 学习一个跨文档与经验证据的统一编辑策略。
Q: 论文做了哪些实验?
论文在 第5节 和 附录B–C 中开展了系统的实验评估,涵盖文档到技能与经验到技能两种设定,并辅以消融实验、训练动态分析与证据敏感性分析。具体实验内容如下:
1. 实验设置
基准测试(Benchmarks)
| 设定 | 基准 | 说明 |
|---|---|---|
| 文档到技能 | CL-Bench | 训练使用 Rule System Application 与 Procedural Task Execution 两个源类别;评估涵盖上述类别的 held-out 任务,以及未见过的 OOD 类别 Domain Knowledge Reasoning 和 Empirical Discovery & Simulation |
| 经验到技能 | SpreadsheetBench | 测试基于执行的电子表格操作技能,采用 200/200 的源/测试分层划分 |
| 经验到技能 | tau2-bench | 测试跨 Airline、Retail、Telecom 三个领域的工作流技能复用,遵循官方领域划分 |
基线方法(Baselines)
- 文档到技能:NO SKILL、Anthropic Skill-Creator、Progressive Prompt Skill、Ctx2Skill、AutoSkill
- 经验到技能:NO SKILL、Anthropic Skill-Creator、Progressive Prompt Skill、ExpeL、Agent Workflow Memory (AWM)、Trace2Skill、SkillX、SkillPro
评估协议
- 同工作者评估:固定下游 worker 为 GPT-4o,生成技能后注入该 worker 进行测试。
- 跨工作者迁移:使用 Claude-Sonnet-4.5 作为下游 worker,消费由 GPT-4o 轨迹池生成的技能,以检验技能的可迁移性。
- 评价指标:各基准的 pass rate(成功率,%)。CL-Bench 使用 GPT-5.5 基于官方任务专属 rubric 评判;SpreadsheetBench 与 tau2-bench 使用基准端环境直接反馈。
2. 主要结果
文档到技能(CL-Bench)
在 GPT-4o 上,Skill-α 的 CL-Bench 平均成功率达到 10.38%,较最强基线 Ctx2Skill(7.07%)和 Anthropic Skill-Creator(7.01%)分别提升约 3.3 个百分点。其中在 Procedural Task Execution 上提升尤为显著:从 NO SKILL 的 4.30% 提升至 9.68%。在 Claude-Sonnet-4.5 上,Skill-α 平均达到 9.55%,在四个类别中均为最佳或并列最佳,表明技能具备跨 worker 的可复用性。
经验到技能(SpreadsheetBench 与 tau2-bench)
在 GPT-4o 上,Skill-α 在 SpreadsheetBench 达到 27.50%,较最强基线 Anthropic Skill-Creator(26.00%)进一步提升;在 tau2-bench 的 Airline、Retail、Telecom 三个领域分别达到 65.00%、80.00%、22.50%,平均 55.83%,较最强基线 SkillPro(49.17%)提升 6.7 个百分点。在 Claude-Sonnet-4.5 上,Skill-α 的 tau2-bench 平均达到 70.33%,在 SpreadsheetBench 和多数 tau2 领域保持最佳或并列最佳。
3. 消融实验
为验证各组件的有效性,论文设计了四个消融变体,结果如下(以 pass rate % 表示):
| 变体 | CL-Bench 平均 ↑ | SpreadsheetBench ↑ | tau2-bench 平均 ↑ |
|---|---|---|---|
| Skill-α(完整) | 10.38 | 27.50 | 55.83 |
| SFT only | 3.46 | 15.50 | 44.17 |
| w/o rollback reward | 3.68 | 17.00 | 46.67 |
| w/o MERGE/PRUNE | 4.74 | 20.00 | 39.17 |
| w/o NOOP | 9.55 | 22.00 | 53.33 |
关键发现:
- SFT only 性能显著下降,说明仅靠监督热身不足以产生有效策略;
- 移除 rollback reward 后性能接近 SFT only,验证了 rollback reward 是将局部编辑与下游改进关联起来的关键信号;
- 移除 MERGE/PRUNE 导致 tau2-bench 平均大幅下降至 39.17%,说明技能构建需要显式的整合与删除机制,否则冗余内容会不断累积;
- 移除 NOOP 仍有较强表现,但略低于完整模型,表明 NOOP 作为校准动作在技能已足够优时具有避免噪声的作用。
4. 训练动态与编辑行为分析
论文通过训练过程中的奖励曲线与动作分布(Figure 2)进一步解释消融结果:
- 完整 Skill-α:奖励随训练逐步提升,动作分布均衡——CREATE 占比最高,但 UPDATE、MERGE、PRUNE 与 NOOP 均保持活跃,呈现”既持续新增又主动维护”的混合策略。
- 无 rollback reward:奖励轨迹更平坦嘈杂,动作分布被 NOOP 主导,反映出在信用分配薄弱时策略趋向保守的”不编辑”捷径。
- 无 MERGE/PRUNE:初期奖励上升较快,但后期表现乏力,表明纯新增无法防止冲突与冗余内容的堆积。
- 无 NOOP:保持活跃的编辑行为与相对稳健的奖励曲线,确认 Skill-α 并不依赖 NOOP 作为捷径,但强制编辑仍会引入可避免的错误。
5. 证据顺序与粒度分析
论文进一步分析了渐进生成对证据排列方式和批量大小的敏感性(Table 5):
证据顺序(固定 batch size = 4)
| 顺序变体 | SpreadsheetBench ↑ | tau2-bench 平均 ↑ |
|---|---|---|
| Source order | 27.50 | 55.83 |
| Shuffled order | 28.00 | 51.67 |
| Reverse order | 26.00 | 57.50 |
结果表明 Skill-α 对证据顺序具有一定鲁棒性,但 tau2-bench 在 shuffled 下略有下降,暗示相邻证据的局部连续性对相关工作流结构的渐进编辑仍有帮助。
证据批次大小(固定 source order)
| 每步证据单元数 | SpreadsheetBench ↑ | tau2-bench 平均 ↑ |
|---|---|---|
| 1 | 22.00 | 47.50 |
| 2 | 23.50 | 53.33 |
| 4 | 27.50 | 55.83 |
| 8 | 20.00 | 48.33 |
结果表明中等粒度(4个单元/步)最优:批次过小时编辑器容易短视,过度反应于局部失败,导致技能碎片化;批次过大时则因模式混杂而削弱编辑焦点与信用清晰度。这说明渐进技能生成依赖于适度的证据粒度,而非一次性暴露尽可能多的证据。
Q: 有什么可以进一步探索的点?
基于论文的结论、局限性讨论以及实验分析,可从以下几个层面展开进一步探索:
1. 验证器与奖励接口的泛化
论文指出,当前 rollback reward 的验证器接口仍依赖于特定基准的设计(如 CL-Bench 的 rubric judge、SpreadsheetBench 的环境反馈)。未来可探索:
- 更通用、可迁移的验证协议:设计不依赖于具体 benchmark 实现的通用评估接口,使 Skill-α 能更便捷地迁移到新环境或开放域任务。
- 更强健的验证器:利用更强大的模型或集成验证机制,降低单次比较中的噪声与偏差。
2. 技能表示的丰富化与多模态扩展
当前 Skill-α 采用文本型 SKILL.md 作为技能载体,动作空间也围绕文本段落展开。未来可探索:
- 结构化与可执行技能格式:例如将技能表示为形式化规则、代码片段、状态机或带参数的程序模板,而非纯自然语言描述。
- 多模态技能:在涉及视觉、表格、图形界面等场景中,技能可能需要包含图像示例、UI 布局信息或结构化数据模式,这要求技能表示超越纯文本范畴。
3. 超越局部回滚的长程训练信号
论文的理论分析与训练目标均基于局部编辑与单步 rollback 比较。未来可探索:
- 长程信用分配:不仅比较单步编辑的即时效果,还评估一系列编辑组合对最终技能质量的累积影响,从而捕捉编辑之间的依赖关系与协同效应。
- 端到端技能级优化:在保持渐进生成可解释性的同时,引入对整个技能在任务族(task family)上期望表现的直接估计。
4. 降低奖励噪声与建立全局保证
附录 E 指出,当前 rollback reward 本质上是带噪声的二元信号,单次比较既不估计期望分数差异,也不严格保证重复局部更新一定能提升最终技能的全局表现。未来可探索:
- 方差缩减技术:例如通过多次锚定查询采样、自适应置信度加权或贝叶斯优化来精炼编辑级奖励。
- 全局收敛或单调性条件:在更宽松的假设下建立渐进编辑过程的全局理论保证。
5. 自适应证据粒度与动态排序
实验分析(Table 5)显示,Skill-α 对证据顺序具有鲁棒性,但对证据批次大小(batch size)较为敏感。未来可探索:
- 自适应粒度机制:根据当前技能状态与证据复杂度动态调整每步处理的证据量,而非固定 batch size。
- 主动证据选择:学习如何选择或重排证据单元,以最大化信息增益并加速技能收敛,而非被动按源顺序处理。
6. 动作空间的扩展
消融实验表明,移除 MERGE/PRUNE 或 NOOP 均会导致性能下降,说明当前五种原子操作各司其职。未来可探索:
- 更细粒度的编辑操作:如条件化分支(IF-THEN 规则)、参数化模板、跨节引用或元数据标注等。
- 技能组合与层次化编辑:支持将多个子技能组合为工作流,或在高层次进行架构级重组。
7. 技能的持续演化与生命周期管理
论文引用了技能演化(skill evolution)的相关工作(如 Shen et al., 2026; Ouyang et al., 2026)。Skill-α 目前聚焦于从静态证据生成技能,未来可探索:
- 在线持续更新:在智能体持续与环境交互的过程中,不断收集新经验并迭代更新已有技能,处理概念漂移与技能过时问题。
- 技能版本控制与冲突解决:当新证据与既有技能冲突时,学习何时覆盖、保留或分叉技能版本。
8. 跨工作者迁移与个性化适配
实验显示,由 GPT-4o 生成的技能可在 Claude-Sonnet-4.5 上取得一定迁移效果。未来可探索:
- 工作者感知的技能生成:在生成阶段显式建模下游 worker 的能力边界与风格差异,生成更具针对性的技能。
- 迁移学习与领域自适应:研究如何将技能从一个基础模型高效迁移到另一个架构或能力分布差异更大的模型。
9. 开放域与更复杂环境的扩展
当前评估集中在有明确验证器的 benchmark 上。未来可探索:
- 开放域任务:在缺乏自动验证器、需要人工或半自动评估的开放场景中,如何设计替代性的 rollback 比较机制。
- 更长周期、多智能体协作:将技能生成扩展到需要多轮协作或极长执行轨迹的复杂决策场景中。
Q: 总结一下论文的主要内容
这篇论文提出 Skill-α,一种基于强化学习的渐进式智能体技能生成框架。以下从研究背景、核心挑战、方法设计、实验验证与主要贡献五个方面进行总结。
1. 研究背景与动机
近期大语言模型(LLM)智能体常依赖外部技能作为可复用的程序模块,以指导任务分解、工具调用与中间结果验证。自动从异构证据源(如文档、规则、执行轨迹或经验反馈)生成高质量技能,已成为扩展智能体能力的关键问题。现有方法多依赖启发式规则或针对特定证据类型设计的流水线,缺乏统一的学习框架;同时,技能质量缺乏基于相关性或正确性的直接监督信号,其价值通常只能通过下游任务执行效果间接体现。
2. 核心挑战
技能生成面临的主要障碍是基于执行的信用分配(execution-grounded credit assignment):
- 与数学推理、网络搜索等任务不同,技能文本本身的流畅性或正确性无法直接衡量其效用;
- 一个看似合理的技能可能是冗余或误导性的,而一个微小的局部编辑却可能显著改善智能体行为;
- 因此,必须建立一种机制,将下游执行反馈精准归因到技能生成过程中的局部决策。
3. 方法:Skill-α
为应对上述挑战,论文将技能生成形式化为一个可学习的渐进编辑过程,并引入**回滚奖励(rollback reward)**作为训练信号。
3.1 渐进式局部编辑
Skill-α 从初始技能 z_0 出发,逐步读取证据单元 x_1, dots, x_T,并在每一步采样局部编辑动作:
At sim πφ(· mid z(t-1), x_t), quad z_t = Edit(z(t-1), A_t)
动作空间包含五种原子操作:
- CREATE:新增缺失规则或流程;
- UPDATE:修正不准确的内容;
- MERGE:整合重叠片段;
- PRUNE:删除有害或冗余内容;
- NOOP:当前证据无价值时保持技能不变。
该分解将整体生成转化为一系列可单独评估的局部决策,缓解了长上下文压力,并为信用分配提供了结构基础。
3.2 Rollback Reward
Rollback reward 的核心思想是:在相同的证据相关锚定查询 qt^(anc) 上,比较编辑前后技能的执行效果。固定工作者(worker)π_psi 分别在原始技能 z(t-1) 和编辑后技能 z_t 上执行:
at^(ctrl) sim π_psi(· mid q_t^(anc), z(t-1)), quad a_t^(edit) sim π_psi(· mid q_t^(anc), z_t)
由验证器 V_t 打分后,候选编辑 A_t^{(i)} 的奖励为:
R_(rb)(A_t^((i))) = 1, & 若 A_t^((i)) = NOOP 且编辑结果优于控制组 1, & 若 A_t^((i)) = NOOP 且组内无其他编辑超越控制组 0, & 其他情况
该奖励确保:非 NOOP 编辑仅在严格提升下游执行时获得正反馈;NOOP 则在当前技能已足够优时被激励,避免不必要的修改引入噪声。
3.3 基于 GRPO 的训练实现
编辑策略 π_φ 以 Qwen3-8B 为初始化模型,先经监督微调(SFT)学习动作语法,再通过 Group Relative Policy Optimization (GRPO) 优化。对于每个局部编辑状态,策略采样一组候选动作,利用组内相对优势降低奖励尺度敏感性:
A_i = r_i - mean(r_1, dots, r_G){std(r_1, dots, r_G)}
并通过 clipped 目标更新策略。该框架统一处理文档到技能与经验到技能两种设定,仅在证据序列化方式上有所区别。
4. 实验验证
4.1 设定与基准
论文在两类设定下评估:
- 文档到技能:CL-Bench(涵盖规则应用、程序执行、领域推理等类别);
- 经验到技能:SpreadsheetBench(电子表格操作)与 tau2-bench(Airline/Retail/Telecom 工作流)。
评估采用 GPT-4o 作为同工作者,Claude-Sonnet-4.5 作为跨工作者迁移测试。基线包括 Anthropic Skill-Creator、AutoSkill、Ctx2Skill、ExpeL、Trace2Skill、SkillX、SkillPro 等。
4.2 主要结果
- CL-Bench:GPT-4o 下平均成功率达 10.38%,较最强基线提升约 3.3 个百分点;在 Procedural Task Execution 上从 4.30% 提升至 9.68%。
- 经验到技能:GPT-4o 下 tau2-bench 平均达 55.83%,较最强基线提升 6.7 个百分点;SpreadsheetBench 达 27.50%。Claude-Sonnet-4.5 作为下游工作者时,Skill-α 仍保持多数指标最优或并列最优,表明技能具有跨模型可迁移性。
4.3 消融与分析
- 移除 rollback reward 后性能接近纯 SFT,验证其为关联局部编辑与下游改进的关键信号;
- 移除 MERGE/PRUNE 导致 tau2-bench 平均大幅下降,说明显式整合与删除对防止冗余累积至关重要;
- 移除 NOOP 性能略有下降,表明该动作用于避免不必要的噪声编辑;
- 证据顺序分析:Skill-α 对证据重排具有较好鲁棒性;
- 证据粒度分析:每步 4 个证据单元 时性能最优,过小导致碎片化,过大削弱编辑焦点。
5. 主要贡献
- 统一框架:将文档到技能与经验到技能统一为单一的渐进式编辑学习问题;
- 回滚奖励机制:提出基于锚定查询对比的回滚奖励,解决了技能生成中缺乏直接监督信号的难题;
- 实证效果:在三个基准上显著超越启发式与流水线式基线,并验证跨工作者迁移能力;
- 深入分析:通过消融、训练动态与证据敏感性分析,揭示渐进生成与完整动作空间的必要性。
6. 局限与未来方向
当前局限包括:验证器接口仍依赖基准特定设计;技能表示为纯文本,尚未扩展至结构化或多模态格式;训练信号局限于局部回滚比较,缺乏长程全局保证。未来可探索通用验证协议、多模态技能格式、自适应证据粒度、在线技能演化以及更强的跨工作者个性化适配。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Junhao Shen,Zhanqiu Zhang,Yiwen Guo,Hong Cheng
PDF URL: https://arxiv.org/pdf/2608.01678.pdf
Arxiv URL: https://arxiv.org/abs/2608.01678
Arxiv ID: 2608.01678
CoolPaper URL: https://papers.cool/arxiv/2608.01678
Published: 2026-08-05T01:02:01.865Z
Updated: 2026-08-05T01:02:01.865Z
5. VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
Abstract:Multimodal on-policy distillation (OPD) transfers fine-grained visual knowledge by supervising student-generated trajectories with a privileged-view teacher. Yet its next-token corrections are source-mixed, combining visual signals with linguistic priors and teacher-specific effects. The key challenge is to estimate which corrections are supported by visual evidence, not merely where or how strongly to distill. We introduce Visual Attribution Distillation (VAD), a counterfactual target-reconstruction algorithm that estimates the visually attributable part of a teacher correction. At each student-generated prefix, VAD evaluates the same fixed teacher with the relevant evidence present and removed. The corresponding change in centered log-probabilities defines ut, a signed proxy for the visual evidence direction that estimates how revealing the evidence supports or refutes candidate tokens. VAD projects the original correction onto this proxy to obtain an intervention-aligned component and a proxy-unexplained residual, then reconstructs a student-anchored target from the former. During training, this reconstructed target supplies the primary supervision signal, while the privileged teacher contributes a weak regularizer. Across six fine-grained visual benchmarks at 4B and 9B scales, VAD outperforms direct privileged-view distillation and visual-advantage weighting. Token- level and controlled-target analyses show that the proxy-aligned component is enriched in task-relevant visual corrections and yields stronger target shifts, especially when evidence refutes a mistaken answer. These results support counterfactual target reconstruction as an effective alternative to source-mixed supervision.
中文摘要
摘要:多模态在策略蒸馏(OPD)通过使用特权视角教师监督学生生成的轨迹来传递细粒度视觉知识。然而,其下一步令牌的纠正是混合来源的,将视觉信号与语言先验和教师特定效应结合在一起。关键挑战在于估计哪些纠正是由视觉证据支持的,而不仅仅是在哪里或以多强的程度进行蒸馏。我们提出了视觉归因蒸馏(VAD),这是一种反事实目标重建算法,用于估计教师纠正中可归因于视觉的部分。在每个学生生成的前缀处,VAD对同一固定教师进行评估,分别在相关证据存在和移除的情况下进行。中心化对数概率的相应变化定义了ut,这是视觉证据方向的有符号代理,用于估计揭示证据如何支持或反驳候选令牌。VAD将原始纠正投影到该代理上,以获得干预对齐组件和代理无法解释的残差,然后从前者重建以学生为锚的目标。在训练过程中,这一重建目标提供主要监督信号,而特权教师提供弱正则化。在4B和9B规模上的六个细粒度视觉基准测试中,VAD优于直接特权视角蒸馏和视觉优势加权。令牌级别和受控目标分析表明,代理对齐组件在任务相关的视觉纠正中得到增强,并产生更强的目标偏移,尤其是在证据反驳错误答案时。这些结果支持反事实目标重建作为源混合监督的有效替代方案。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文针对多模态在线策略蒸馏(Multimodal On-Policy Distillation, OPD)中教师监督信号的“源混合”问题,提出了一种新的归因与目标重建方法。具体而言,核心待解决问题可概括为以下三个方面:
1. 教师修正是“源混合”的,视觉归因不明确
在特权视角蒸馏框架下,教师模型基于包含精细视觉证据的裁剪视图(privileged-view)对学生的生成轨迹进行逐 token 纠正。然而,这些纠正信号并非纯粹的视觉证据,而是混合了视觉信号、语言先验以及教师模型自身特有偏好的复合体。直接蒸馏完整的教师分布会引入大量非视觉因素,导致学生模型难以准确学习“哪些纠正真正由视觉证据支持”。
2. 现有方法无法显式分离视觉归因分量
- Vision-OPD 直接将证据呈现(evidence-present)教师的完整分布作为监督目标,但诊断显示仅有约 23% 的强纠正位置与视觉证据高度对齐,其余均为源混合纠正。
- VA-OPD / V-Zero 等通过对比清晰视图与退化视图来加权 token 或轨迹,虽然提升了选择性,但仍以完整证据呈现教师为底层目标,未从目标构造层面剔除视觉无法解释的分量。此外,这类方法常依赖“正的视觉优势”,容易遗漏视觉证据对错误答案的反驳作用(即证据呈现后应降低学生错误 token 的概率)。
3. 需要重建“学生锚定”且“视觉可归因”的监督目标
关键挑战在于:估计教师纠正中哪一部分可由受控的视觉干预解释,并基于该分量重新构造蒸馏目标,而非简单地对源混合信号进行强度缩放或样本筛选。这要求方法能够:
- 区分视觉证据的支持(support)与反驳(refutation);
- 将归因后的视觉分量锚定在学生的当前分布上,避免直接复制特权教师带来的非视觉偏差;
- 在训练稳定性的同时,保留语言实现、格式控制等非视觉但必要的教师信号。
为应对上述问题,该论文提出了 Visual Attribution Distillation (VAD),其核心思想是:通过对比同一固定教师在“证据呈现”与“证据移除”条件下的分布变化,构建一个干预衍生的视觉证据方向代理 u_t ;进而将原始教师纠正投影到该方向上,提取视觉可归因分量,并据此重建一个学生锚定的、带有符号信息的监督目标,用于替代直接特权蒸馏。
Q: 有哪些相关研究?
该论文在第2节系统梳理了相关研究,主要涵盖以下四个维度:
1. 在线策略蒸馏与特权蒸馏
基础OPD方法
- MiniLLM(Gu et al., 2024):在学生采样上优化逆向KL散度。
- GKD(Agarwal et al., 2024):统一不同散度与师生数据混合策略。
- DistiLLM(Ko et al., 2024):结合偏斜KL与自适应学生生成。
- DistiLLM-2(Ko et al., 2025):引入跨师生生成数据的对比目标。
特权蒸馏方法
- On-Policy Context Distillation(Ye et al., 2026):将解法历史或优化提示内化为特权知识。
- Visual-OPSD(Li et al., 2026):迁移特权视觉思维轨迹。
- Anchored Residual OPD(Zhang, 2026):分离完全特权与部分特权引导。
- Contrastive OPD(Ruan et al., 2026):对比轻量与重度推理指令。
与上述方法不同,VAD关注特权教师修正中可归因于视觉证据的部分,而非直接使用完整特权分布或未来条件化的文本残差。
2. 细粒度视觉感知与特权证据获取
主动获取更好视图的方法
- V*(Wu and Xie, 2023)与 ZoomEye(Shen et al., 2025):搜索图像关键区域。
- ReFocus(Fu et al., 2025):将图像编辑为视觉思维。
- DeepEyes(Zheng et al., 2026)、Thyme(Zhang et al., 2025a)、DeepEyesV2(Hong et al., 2026)、SenseNova-MARS(Chng et al., 2026):调用图像操作或多模态工具暴露细节,但需推理时搜索或工具调用开销。
区域到图像训练(内化特权局部证据)
- Zooming without Zooming(Wei et al., 2026):将区域中心感知蒸馏到全图前向传播。
- Vision-OPD(Yuan et al., 2026):使用基于裁剪的自教师沿学生 rollout 进行蒸馏。
- ViCuR(Tian et al., 2026):训练学生恢复特权视觉线索。
此类工作改进了证据获取或表示,而VAD则聚焦于目标构造,即排除未被揭示证据所解释的教师变化。
3. 反事实视觉监督
- Visual Contrastive Decoding(Leng et al., 2024):在推理时对比原始与失真图像。
- HALC(Chen et al., 2024b):增加焦点视觉对比以减轻幻觉。
- Thinking with Deltas(Gao et al., 2026):在强化学习中使用原始、掩码与扰动图像。
这些方法面向解码时修正或结果驱动优化,而非VAD所针对的密集在线策略目标构造。
4. 多模态OPD中的视觉对比方法
直接匹配或加权蒸馏
- Vision-OPD(Yuan et al., 2026):直接匹配证据呈现的教师分布 p_T^+ 。
- VA-OPD(Liu et al., 2026)与 Med-OPD(Qian et al., 2026):使用证据感知 rollout 或 token 加权。
- V-Zero(Sun et al., 2026):构建组相对轨迹门控。
- DOPD(Yu et al., 2026):在教师与学生策略之间路由 token 监督。
上述方法决定在哪里、多强、从哪个策略蒸馏,但未从视觉干预角度重构特权目标本身。
分解式蒸馏
- Decomposed OPD(Yoon et al., 2026):将多模态蒸馏分解为语言先验与视觉 grounding 目标,通过学生纯文本先验与教师多模态到纯文本的信息增益构造视觉目标,并使用 Visual Gradient Steering 与标准蒸馏结合。
VAD与Decomposed OPD均重构视觉监督,但二者解决的问题不同:Decomposed OPD优先匹配一般视觉信息增益,而VAD将特权教师到学生的修正投影到同一教师的证据呈现 vs. 证据移除方向上,锚定于全图学生分布,并显式预算视觉支持与反驳。
Q: 论文如何解决这个问题?
该论文提出 Visual Attribution Distillation (VAD),通过反事实目标重建将特权教师修正分解为视觉可归因分量与残差,并围绕学生当前分布重构监督信号。具体解决路径包含以下五个环节:
1. 在线策略反事实视图构建
对于学生生成的每个前缀 y_(<t) ,VAD 固定教师参数与文本上下文不变,仅改变视觉输入,构建两种训练专用视图:
- 证据呈现视图 x^+ :包含关键局部证据的清晰裁剪图;
- 证据移除视图 x^- :对同一区域进行退化(如 0.1× 双线性下采样再上采样)后的图像。
由此获得三个下一个 token 分布:
pS^0 = πθ(· mid x^0, y(<t)), quad p_T^+ = πθ(· mid x^+, y(<t)), quad p_T^- = πθ(· mid x^-, y_(<t))
在共享的候选坐标集 V_t (由学生 top- K 候选构造)上,定义中心化对数概率:
φ_t(p) = log(p[V_t] + ε) - mean(log(p[V_t] + ε))
2. 教师修正的视觉归因
定义两个核心向量:
- 完整特权教师修正: r_t = φ_t(p_T^+) - φ_t(p_S^0)
- 干预衍生视觉代理: u_t = φ_t(p_T^+) - φ_t(p_T^-)
其中 u_t 是一个有符号的代理向量:若某个候选 token i 满足 u_t(i) > 0 ,表示揭示证据支持该 token;若 u_t(i) < 0 ,表示证据反驳该 token。
通过单侧投影提取与视觉干预方向对齐的修正分量:
βt = ([langle r_t, u_t rangle]+) / (|u_t|_2^2 + zeta), quad r_t^(vis) = β_t u_t, quad r_t^(res) = r_t - r_t^(vis)
其中 $
a
_+ = max(a, 0) 。若 r_t 与 u_t 不一致,则 β_t = 0$,不施加视觉偏移。此步骤将源混合的教师修正分离为:
- r_t^(vis) :视觉可归因分量;
- r_t^(res) :代理无法解释的残差(不被假定为纯语言噪声)。
3. 预算化的支持与反驳分离
为分别控制证据支持(提升概率)与反驳(降低概率)的候选 token,VAD 将 ut 分解为正负分支:
u_t^+ = [u_t]+, quad ut^- = [u_t]-, quad st^± = [langle r_t, u_t^± rangle]+
通过归一化与截断分配视觉修正预算 Bt = |r_t^(vis)|_2 :
Z_t = s_t^+ + s_t^- + ε, quad ω_t^+ = min((s_t^+) / (Z_t), τ+), quad ω_t^- = (s_t^-) / (Z_t)
仅对支持分支施加上限 τ_+ ,防止不确定的正证据主导训练。最终视觉修正为:
r_t^(VAD) = B_t ( (ω_t^+ u_t^+) / (|u_t^+|_2 + ε) + (ω_t^- u_t^-) / (|u_t^-|_2 + ε) )
4. 学生锚定目标重建
VAD 不直接匹配特权教师分布,而是将预算化的视觉修正加到学生当前分布上,重建学生锚定目标:
q_(T,t)^(VAD) = softmax( φ_t(p_S^0) + clip(r_t^(VAD), -c, c) )
该目标的行为语义为:
- 提升被视觉证据支持的候选 token 的相对赔率;
- 压制被视觉证据反驳的候选 token 的相对赔率;
- 排除未被 u_t 捕获的教师修正成分,从而避免蒸馏源混合信号。
5. 训练目标与稳定化正则化
主监督信号采用标准 token 级 Jensen-Shannon 散度,但作用于重建目标而非原始教师:
D(JS)(q, p) = (1) / (2)[D(KL)(q | m) + D_(KL)(p | m)], quad m = (q + p) / (2)
L(vis) = (1) / (|T|) ∑(t ∈ T) D(JS)(stopgrad(q(T,t)^(VAD)), p_S^0)
弱特权教师正则化:仅使用 L_(vis) 会导致语言实现、回答格式与停止行为漂移。因此 VAD 引入一个基于残差的弱正则化器,其权重随视觉归因比例降低而增大:
rho_t = |r_t^(VAD)|_2|r_t|_2 + ε, quad a_t = stopgrad(clip(1 - rho_t, 0, 1))
L(reg) = (1) / (|T|) ∑(t ∈ T) at D(JS)(stopgrad(pT^+), p_S^0), quad L = L(vis) + λ L_(reg)
该正则化器弱锚定语义、格式与长度,同时让重建的视觉目标保持主导地位。所有目标侧量(包括用于构造 q_(T,t)^(VAD) 的 p_S^0 拷贝)在优化中被 detach。
6. 推理阶段
训练完成后,VAD 退化为标准全图学生策略。教师、裁剪图与退化视图仅在训练时用于构造监督目标,推理时不引入额外模型调用或视觉视图。
Q: 论文做了哪些实验?
论文围绕五个研究问题(RQ1–RQ5)展开了系统实验,并在附录中补充了诊断分析、训练效率对比与机制层面的 token 级比较。实验基于 Qwen3.5-4B 与 Qwen3.5-9B 两个规模,在 6,241 条合成长尾视觉问答数据上训练,评测覆盖六项细粒度视觉基准与四项 held-out 任务。
RQ1:细粒度视觉精度对比(主实验)
在六个细粒度视觉基准上,与多组基线进行控制变量比较:
- 评测基准:V⋆、ZoomBench、HRBench (4K/8K)、MME-RealWorld (EN/CN)。
- 对比基线(同初始化、同数据、同训练预算):
- 强化学习基线 GRPO
- 特权蒸馏基线 Vision-OPD
- 视觉优势加权基线 VA-OPD、V-Zero
- 分解蒸馏基线 Decomposed OPD
- 结果(Table 1):
- 4B 规模:VAD 的 Avg6 达到 78.32,领先最优同规模基线 2.40 分;在六项基准上全部取得最高或次高精度。
- 9B 规模:Avg6 达到 79.93,领先最优同规模基线 2.80 分。
- 跨族对比:4B 与 9B 的 VAD 检查点均超过了 Gemini 3 Flash、Gemini 3.1 Pro、Qwen3.5-397B 等更大或闭源模型。
RQ2:归因修正的语义分解分析
通过冻结模型前缀,分析教师完整修正 r_t 、视觉可归因分量 r_t^(vis) 与残差 r_t^(res) 的语义构成:
- 类别组成(Figure 3a):视觉属性、物体/内容、A–D 决策选项在 r_t^(vis) 的 top-5 中占比 42.0%,显著高于 r_t (26.7%)与 r_t^(res) (17.7%);语言/格式与伪影/元信息在残差中占主导(82.3%)。
- Token 级权重(Figure 3b):答案符号(A–D)、颜色、材质、形状等视觉相关 token 在 r_t^(vis) 中得分更高;介词(to)、空间词(inside)及退化相关词在 r_t^(res) 中更突出。
- 高幅值词表画像(Figure 3c): r_t^(vis) 富集颜色、形状、材料、空间关系与答案选项; r_t^(res) 富集语言实现与提示/退化相关词汇。
该分析验证了投影操作确实将视觉与决策相关内容集中到代理对齐分量中,而非简单地对教师修正做标量缩放。
RQ3:替代监督目标的消融与离线分析
在 Qwen3.5-4B 上保持数据与预算一致,比较六种目标构造策略:
| 目标设定 | 说明 |
|---|---|
| Direct | 直接使用完整特权教师 p_T^+ |
| Scalar-shrunk | 将 r_t 缩放至视觉归因范数,但保留原方向 |
| One-sided w/o reg. | 单侧投影 r_t^(vis) = β_t u_t ,无正则 |
| One-sided | 单侧投影 + 弱教师锚定 |
| VAD w/o reg. | 分支分离目标 q_(T,t)^(VAD) ,无正则 |
| Full VAD | 完整 VAD 目标 + 弱正则 |
- 训练后精度(Table 2):Full VAD(78.32)> VAD w/o reg.(78.06)> One-sided(77.52)> One-sided w/o reg.(77.06)> Scalar-shrunk(76.19)> Direct(75.92)。分支感知重建带来主要增益,弱正则进一步提供稳定性收益。
- 离线 answer-slot 分析(Figure 4):在固定前缀下,VAD 目标对正确 token 的支持(+7.89 分)与对错误 token 的压制(-6.61 分)均强于直接教师修正、标量缩放及单侧投影目标,表明重建目标在 token 级具有更强的符号一致性。
RQ4:Held-out 泛化能力
验证视觉专业化是否牺牲通用能力,在训练与选点循环之外的四个基准上测试:
- 评测基准:MMVP、CVBench、MMStar、POPE。
- 结果(Table 3):
- 4B:VAD 的 Avg4 为 79.14,相对 Base 提升 +0.24,是唯一在两项规模上均保持正增量的后训练方法。
- 9B:VAD 的 Avg4 为 82.62,相对 Base 提升 +0.23;Decomposed OPD 在该规模下降 1.36 分,VAD 领先其 1.59 分。
- 结论:基于归因的目标重建在提升细粒度感知的同时,更稳定地保持了通用视觉推理能力。
RQ5:训练选择与超参数敏感性
- 弱正则权重 λ 与正分支上限 τ_+ (Figure 5):
- 在 (λ, τ+) = (0.10, 0.80) (4B)附近存在宽广最优区,邻近配置波动在 0.20 分以内;仅边界设定(如 λ=0 且 τ+=0.5 )导致明显下降(76.81)。
- 监督散度选择(Table 4):
- 对比 JSD、Forward KL、Reverse KL。JSD 在 4B 与 9B 上均取得最高 Avg6(78.32 / 79.93),在多数单项上领先;Reverse KL 在 HRBench-8K 与 MME-RealWorld 上偶发领先,但 JSD 跨任务与跨规模最均衡。
附录补充实验
- 附录 A(视觉对齐诊断):在冻结的 Base 模型上量化“强教师修正”与“强视觉对齐”的重合度。仅 23.2%(4B)与 22.8%(9B)的高强度修正同时具有高视觉对齐,证实源混合问题的普遍性。
- 附录 C(训练效率与计算成本,Table 5):记录 65 步训练的平均步时与 GPU 小时。VAD 的步时与 Vision-OPD、VA-OPD 处于同一量级(4B 仅高 3.1%–3.8%,9B 高 3.9%–11.1%),但 Avg6 提升 2.4–3.4 分,表明精度增益并非来自显著更大的训练开销。
- 附录 D(Token 级机制比较):以统一符号形式推导 Vision-OPD、VA-OPD、Decomposed OPD 与 VAD 的逐 token 目标,证明:
- Vision-OPD 直接复制 p_T^+ ;
- VA-OPD 仍使用 p_T^+ 作为局部目标,仅通过 rollout/token 组重加权改变聚合梯度;
- Decomposed OPD 重构视觉信息增益目标,但不基于同一教师的证据干预做投影;
- VAD 则通过 δ_t^(VAD) 直接设置候选级赔率,显式区分支持与反驳。
Q: 有什么可以进一步探索的点?
基于论文的方法设计、实验发现与明确指出的局限性,以下方向值得进一步探索:
1. 从单一视图对扩展到组合干预基
当前 VAD 为每个前缀仅构造一组 evidence-present 与 evidence-removed 视图,其代理方向 u_t 本质上是单一干预轴上的对比。对于需要组合多区域、多尺度或时序证据才能作答的复杂场景(如多跳视觉推理、视频理解),单一裁剪对比可能产生偏差。未来可探索:
- 多视图聚合:在同一前缀下采样多个互补区域或退化等级,通过低秩基或注意力机制融合多组 u_t ,构建更丰富的视觉证据子空间。
- 可学习的干预字典:不再依赖手工设计的退化操作,而是学习一组通用的“证据移除”基函数,自适应地针对任务选择或组合干预方向。
2. 带因果/grounding 约束的可识别分解
论文指出,当前投影产生的是语义富集但非可识别的分离: r_t^(vis) 仍可能混入教师自身的非视觉偏差,而 r_t^(res) 亦非纯粹语言噪声。可引入更严格的结构化假设:
- 因果归因框架:利用后门调整或工具变量方法,将视觉干预从教师参数、语言先验等混淆因子中显式分离,量化“视觉证据”的因果效应而非仅相关性。
- Grounding 正则化:在投影阶段增加像素级或区域级对齐约束(如 Grad-CAM、SHAP 一致性),迫使 r_t^(vis) 的 token 级响应对应到可定位的图像区域,从而提升归因的物理可解释性。
3. 跨模态与多模态推广
VAD 的核心思想——反事实干预归因 + 学生锚定目标重建——并不局限于视觉-语言蒸馏。可向以下场景迁移:
- 视频-语言模型:将证据干预从“空间裁剪”扩展为“时序掩码”或“帧率退化”,归因运动与外观线索。
- 音频-语言或多传感模型:通过频谱掩蔽、声道退化等反事实操作,估计听觉或触觉证据对教师修正的贡献。
- 任意模态的通用 OPD 框架:构建模态无关的“证据呈现/移除”接口,使 VAD 成为多模态蒸馏的通用插件。
4. 训练效率与推理时扩展
VAD 在训练时需对同一前缀执行三次前向传播(学生全图、教师 evidence-present、教师 evidence-removed),虽然计算成本与同代方法处于同一量级,但仍存在优化空间:
- 蒸馏目标缓存与复用:利用滚动窗口或前缀树复用重叠 rollouts 中重复前缀的 p_T^+ 与 p_T^- ,降低冗余计算。
- 推理时视觉归因:目前 VAD 仅在训练阶段使用干预视图。若允许推理时轻量级地调用 evidence-present 视图进行自纠正(如对比解码或视觉引导的重采样),可在不增加学生参数的情况下进一步提升部署精度。
5. 与强化学习的深度结合
当前 VAD 完全在监督蒸馏框架下运行,其重建目标 q_(T,t)^(VAD) 可天然地与强化学习结合:
- 作为 dense reward:将 r_t^(VAD) 的幅值或正确 token 的相对赔率提升转化为每步的 dense reward,用于在线策略优化(如 PPO/GRPO),实现“归因即奖励”。
- 与 VA-OPD / V-Zero 的互补:VAD 解决了“重构什么目标”的问题,而 VA-OPD/V-Zero 解决了“如何加权 rollout”。二者结合可在 token 级目标与轨迹级筛选之间形成双层视觉监督。
6. 自动证据定位与动态视图生成
VAD 目前依赖外部提供的 evidence crop(论文使用 Vision-OPD 发布的标记区域)。解除这一依赖可扩大适用性:
- 学生驱动的证据搜索:训练学生模型预测需要放大的区域,再以其为 x^+ 执行 VAD,形成“感知-归因-学习”闭环。
- 动态退化策略:根据当前学生困惑度或注意力熵,自适应决定证据退化的强度与类型,使反事实干预的难度与学生能力匹配。
7. 幻觉诊断与模型审计工具
VAD 的 u_t 与 r_t^(res) 提供了细粒度的 token 级视觉归因信号,可用于:
- 幻觉检测:若某 token 获得高教师修正 r_t 但 r_t^(vis) ≈ 0 ,则提示该修正缺乏视觉支撑,可能存在语言先验主导的幻觉。
- 教师审计:系统性地分析 r_t^(res) 的语义分布,识别特权教师中重复出现但非视觉驱动的系统性偏差,进而清洗或修正教师策略。
Q: 总结一下论文的主要内容
这篇论文围绕多模态在线策略蒸馏(Multimodal On-Policy Distillation, OPD)中特权教师修正的“源混合”问题,提出了视觉归因蒸馏(Visual Attribution Distillation, VAD),通过反事实干预归因与学生锚定目标重建,实现了更纯净的视觉知识迁移。
1. 研究背景与核心问题
在特权多模态 OPD 中,教师模型基于包含精细局部证据的裁剪视图(privileged view)对学生的生成轨迹进行逐 token 监督。然而,教师提出的修正信号是源混合的:其中既包含与视觉证据相关的成分,也混入了语言先验、教师自身偏好等非视觉因素。直接蒸馏完整的教师分布会导致学生难以辨识“哪些修正确实由视觉证据支撑”。现有方法如 Vision-OPD 直接匹配教师分布,或如 VA-OPD 仅对 token/轨迹进行视觉优势加权,均未能从目标构造层面显式分离视觉可归因的修正分量,且容易遗漏视觉证据对错误答案的反驳作用。
2. 方法:视觉归因蒸馏(VAD)
VAD 的核心思想是:通过受控的视觉干预对比,估计教师修正中可由视觉证据解释的部分,并据此重建一个围绕学生当前分布的监督目标。
2.1 在线策略反事实视图
对于学生生成的每个前缀 y_(<t) ,固定教师参数与文本上下文,仅改变视觉输入,构造两种训练专用视图:
- 证据呈现视图 x^+ :关键区域的清晰裁剪;
- 证据移除视图 x^- :同一区域的退化版本(如极度下采样再上采样)。
获取三个分布 p_S^0 (学生全图)、 p_T^+ (教师 evidence-present)、 p_T^- (教师 evidence-removed),并在共享候选集上计算中心化对数概率 φ_t(·) 。
2.2 干预代理与修正归因
定义完整教师修正与视觉干预响应:
r_t = φ_t(p_T^+) - φ_t(p_S^0), quad u_t = φ_t(p_T^+) - φ_t(p_T^-)
其中 ut 是一个有符号的干预代理向量: u_t(i) > 0 表示证据支持候选 token i , u_t(i) < 0 表示证据反驳该 token。通过单侧投影提取视觉对齐分量:
β_t = ([langle r_t, u_t rangle]+) / (|u_t|_2^2 + zeta), quad r_t^(vis) = β_t u_t, quad r_t^(res) = r_t - r_t^(vis)
2.3 预算化支持与反驳
将视觉修正预算 Bt = |r_t^(vis)|_2 按证据支持( u_t^+ )与反驳( u_t^- )分离,并分别分配归一化权重 ω_t^+ 与 ω_t^- (支持分支设上限 τ+ ),得到预算化修正 r_t^(VAD) 。
2.4 学生锚定目标重建
重建的监督目标以学生分布为中心,仅施加视觉可归因的符号化偏移:
q_(T,t)^(VAD) = softmax( φ_t(p_S^0) + clip(r_t^(VAD), -c, c) )
该目标提升视觉支持的候选、压制视觉反驳的候选,并剔除无法被视觉代理解释的教师修正成分。
2.5 训练目标
主监督采用 token 级 Jensen-Shannon 散度 L(vis) ,作用于重建目标 q(T,t)^(VAD) 。为避免纯视觉监督导致的语言漂移,引入基于残差比例的弱特权教师正则化 L(reg) ,总损失为:
L = L(vis) + λ L_(reg)
训练完成后,VAD 退化为标准全图学生模型,推理无额外开销。
3. 实验结果
3.1 细粒度视觉精度(RQ1)
在 V⋆、ZoomBench、HRBench (4K/8K)、MME-RealWorld (EN/CN) 六项基准上,VAD 在 Qwen3.5-4B 与 9B 规模均取得最优表现:
- 4B:Avg6 达 78.32,领先最优同规模基线 2.40 分;
- 9B:Avg6 达 79.93,领先最优同规模基线 2.80 分。
3.2 语义分解验证(RQ2)
对冻结前缀的 token 级分析表明, r_t^(vis) 显著富集视觉属性、物体内容与答案选项(相对 top-5 占比 42.0%,而完整修正 r_t 仅 26.7%,残差 r_t^(res) 仅 17.7%),而语言格式与退化相关词汇集中于残差。这验证了 VAD 的投影操作确实将视觉与决策相关内容分离出来。
3.3 消融与离线分析(RQ3)
对比六种目标构造策略,VAD 的完整目标(78.32)显著优于直接教师匹配(75.92)、标量缩放(76.19)与单侧投影(77.52)。离线 answer-slot 分析显示,VAD 目标对正确 token 的支持(+7.89 分)与对错误 token 的压制(-6.61 分)均强于其他目标。
3.4 Held-out 泛化(RQ4)
在 MMVP、CVBench、MMStar、POPE 四项训练未涉及的基准上,VAD 是唯一在 4B 与 9B 规模均保持相对 Base 正增量的后训练方法(4B +0.24,9B +0.23),表明其在提升细粒度感知的同时未牺牲通用能力。
3.5 训练选择与效率(RQ5)
- 超参数 (λ, τ_+) 在宽广范围内稳定;
- JSD 作为监督散度跨任务最均衡;
- 训练步时与 Vision-OPD/VA-OPD 处于同一量级(4B 仅高 3%–4%),但精度提升显著。
4. 主要贡献
- 问题识别:揭示了特权多模态 OPD 中“源混合教师修正”的核心局限,并量化了仅约 23% 的强修正与视觉证据高度对齐。
- 方法创新:提出基于反事实干预的归因-重建框架,通过 u_t 代理分离视觉可归因分量,实现学生锚定的符号化目标构造,明确区分支持与反驳。
- 系统验证:在六项细粒度基准与两项模型规模上取得一致提升,配合语义分析与控制实验,支撑了归因重建相对于直接蒸馏与视觉加权的优越性。
5. 局限性与展望
VAD 仍存在两方面局限:其一,单一视图对的干预可能无法充分捕捉组合式视觉证据;其二,当前的投影分离属于语义富集而非因果可识别分解, r_t^(vis) 仍可能残留非视觉教师效应。未来可探索多干预基聚合、带 grounding 约束的可识别分解、向视频/音频等多模态场景的扩展,以及与强化学习的深度结合。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Kangning Zhang,Yixing Li,Shuai Shao,Qingyao Li,Zhengxi Lu,Zhiyuan Yao,Jianghao Lin,Wenxiang Jiao,Yuan Lu,Weiwen Liu,Weinan Zhang,Yong Yu
PDF URL: https://arxiv.org/pdf/2607.28590.pdf
Arxiv URL: https://arxiv.org/abs/2607.28590
Arxiv ID: 2607.28590
CoolPaper URL: https://papers.cool/arxiv/2607.28590
Published: 2026-08-05T01:02:10.224Z
Updated: 2026-08-05T01:02:10.224Z
6. UEmbed: Unified Sparse and Dense Multimodal Embeddings
Abstract:Sparse retrieval underpins modern search systems, from web search to retrieval-augmented generation. Existing work has introduced Learned Sparse Retrieval (LSR) to push beyond exact lexical matching toward richer semantics. Yet LSR has so far remained tied to encoder-style bidirectional architectures, and its extension to multimodal settings still relies heavily on auxiliary cross-modal modules. To address these limitations, we introduce UEmbed (Unified Embedding), a decoder-only multimodal embedding model that produces both sparse lexical and dense representations in one causal forward pass. UEmbed appends N learnable special tokens to the input and partitions the vocabulary into N disjoint subsets. Each token’s causal hidden state predicts sparse weights over its assigned subset, and the N subsets are concatenated into the full sparse vector. Trained on public data, we release UEmbed at 2B, 4B, and 9B scales. UEmbed-9B reaches 71.8 (dense) and 71.0 (sparse) on MMEB-v2, outperforming multimodal embedding models trained on publicly available data (e.g., RzenEmbed). On BEIR, UEmbed also remains competitive with strong dense and sparse baselines. Furthermore, we demonstrate the practical utility of UEmbed across three dimensions: effectiveness, efficiency, and agentic applications. Overall, UEmbed offers a new paradigm: it unifies dense and sparse embeddings in one model, while further extending sparse retrieval to unify text and multimodal inputs.
中文摘要
摘要:稀疏检索支撑着现代搜索系统,从网络搜索到增强检索生成。现有研究已经引入了学习型稀疏检索(LSR),以突破精确词汇匹配,向更丰富的语义发展。然而,LSR迄今仍与编码器式的双向架构绑定,其在多模态环境中的扩展仍严重依赖辅助的跨模态模块。为了解决这些局限性,我们提出了UEmbed(统一嵌入),一种仅解码器的多模态嵌入模型,可在一次因果前向传递中同时生成稀疏词汇表示和密集表示。UEmbed在输入中附加N个可学习的特殊标记,并将词汇表划分为N个不相交的子集。每个标记的因果隐藏状态预测其分配子集上的稀疏权重,随后将N个子集合并为完整的稀疏向量。在公共数据上训练后,我们发布了规模为2B、4B和9B的UEmbed模型。UEmbed-9B在MMEB-v2上达到71.8(密集)和71.0(稀疏)的成绩,超越了基于公开数据训练的多模态嵌入模型(如RzenEmbed)。在BEIR上,UEmbed在强劲的密集和稀疏基线中也保持竞争力。此外,我们展示了UEmbed在三个维度上的实际应用价值:效果、效率和智能代理应用。总体而言,UEmbed提供了一种新范式:它在一个模型中统一了密集和稀疏嵌入,同时进一步扩展了稀疏检索,将文本与多模态输入统一起来。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决**学习稀疏检索(Learned Sparse Retrieval, LSR)**在架构、模态和实际部署中的三重局限,具体如下:
架构约束:LSR与因果解码器不兼容
现有LSR方法主要依托编码器风格的双向架构(如BERT)。由于单向注意力的因果掩码限制,decoder-only模型无法直接复用传统的全局池化策略来生成稀疏表示。若要将大语言模型(LLM)用于稀疏检索,通常需将因果主干改造为双向架构,或设计专门的训练课程,这不仅带来额外训练成本,也破坏了与vLLM等针对因果模型优化的高吞吐服务框架的兼容性。模态局限:LSR难以原生支持多模态输入
当前LSR方法大多局限于文本域,因其依赖缺乏原生多模态能力的文本专用编码器。少数多模态稀疏检索方案通过引入辅助跨模态模块来解释非文本模态,而非直接从单一多模态主干派生稀疏表示,导致其难以向新模态扩展。实际效用未被充分验证
现有稀疏方法多在传统基准(如COCO)上评估,主要关注准确率,而其在真实场景中的有效性、效率与代理式(agentic)应用价值缺乏系统性检验。
为应对上述挑战,论文提出 UEmbed(Unified Embedding),其核心思路是:在decoder-only多模态大语言模型(MLLM)的输入末尾追加 N 个可学习的特殊token,将词表划分为 N 个不相交子集,使每个特殊token的因果隐藏状态负责预测对应子集的稀疏权重,从而在一次因果前向传播中同时输出稀疏词法表示与密集向量表示。该方案无需双向注意力或辅助跨模态模块,即可在统一模型中实现文本与多模态的密集/稀疏检索。
Q: 有哪些相关研究?
该论文在第2节系统梳理了两个主要研究方向的相关文献,现归纳如下:
1. 学习稀疏检索(Learned Sparse Retrieval)
早期与经典方法
传统稀疏检索依赖固定词法统计(如BM25)。随后,学习稀疏检索(LSR)通过神经网络替代固定统计,对既有词项重新赋权,并扩展出原始文本中未出现的语义相关词项。代表性工作包括 SPLADE 系列(Formal et al., 2021b,a; 2022),其通过上下文token变换与最大池化,显著提升了稀疏检索质量,使其足以与强密集基线竞争。最新迭代 SPLADE-v3(Lassance et al., 2024)进一步巩固了该路线的性能。大模型时代的LSR
近期研究开始利用LLM主干与更强的训练方案推进LSR(Xu et al., 2026)。相关探索大致分为两类:一类将decoder-only骨干改造为双向行为以适配检索(Xu et al., 2026);另一类在单一模型内联合训练密集与稀疏检索(Chen et al., 2024; Song et al., 2025)。与UEmbed的区别
上述工作要么改变模型注意力机制,要么采用多头但非因果的架构。UEmbed则不同:它在**统一的decoder-only主干中、在因果注意力下原生地(natively)**研究稀疏检索,无需将因果主干改造为双向,也无需额外的专用训练课程。
2. 多模态检索(Multimodal Retrieval)
多模态嵌入模型
近年来,多模态大语言模型(MLLMs)(Google, 2024; Bai et al., 2025; Singh et al., 2025)在各类任务中表现卓越。基于此,通用多模态嵌入模型(Jiang et al., 2024; Cui et al., 2025; Li et al., 2026)被提出,并在 MMEB-v2(Meng et al., 2025)等基准上取得了极具竞争力的成绩。多模态稀疏检索
相比密集检索,多模态稀疏检索的探索仍然非常有限。现有LSR工作通常引入辅助模块或额外模型来解释非文本模态(如图像、视频),例如 Lu et al. (2021); Chen et al. (2023); Nguyen et al. (2024); Wang et al. (2024); Formal et al. (2026)。这些辅助模块将稀疏模型限制在特定的模态对上,并使其向新模态的扩展变得复杂。与UEmbed的区别
UEmbed旨在填补这一空白:它将decoder-native稀疏检索、统一密集/稀疏建模以及多模态支持整合到单一因果主干中,无需依赖辅助跨模态模块即可直接处理文本、图像、视频和视觉文档等多种模态。
Q: 论文如何解决这个问题?
针对前述的三重局限,论文提出 UEmbed(Unified Embedding),通过“分区投影 + 统一训练”的策略,在单一的 decoder-only 多模态大语言模型(MLLM)内同时生成密集与稀疏表示。具体解决路径如下:
1. 词表压缩与语义分区:缓解因果注意力下的信息瓶颈
现有稀疏检索(如 SPLADE)依赖双向编码器对全序列做 max-pooling,而 decoder-only 模型的因果掩码使单个 EOS token 难以承载对整个词表 |V| 的投影,形成严重的表示瓶颈。UEmbed 的解决方案分为两步:
- 词表压缩:在分区前,通过去除重音符号、小写化、空白折叠(whitespace collapsing)等规则合并同形词(如
Hello、HELLO、héllò统一映射为hello),将词表规模从 248,320 缩减至 184,016,降低冗余。 - 语义分区:利用 k-means 聚类将词表 V 划分为 N 个互不相交的子集 V_1, dots, V_N (默认 N=16 ),使每个子集对应一个特定的语义方向。
2. 分区稀疏头(Partitioned Sparse Heads):在因果前向传播中生成稀疏向量
UEmbed 在输入序列末尾追加 N 个可学习的特殊 token langle s_1 rangle, dots, langle s_N rangle 。在因果注意力机制下,每个 langle s_k rangle 可以 attend 到其之前所有的输入 token,从而对全局信息进行摘要。每个特殊 token 配备一个子集专属的稀疏头:
对于子集 V_k 中的词项 t ,其稀疏权重通过线性投影计算:
wt^((k)) = log!(1 + ReLU!(W_t^((k)top) h(s_k) + b_t^((k)))), quad ∀ t ∈ V_k
其中 h_(s_k) 为 langle s_k rangle 的最终隐藏状态, W_t^((k)) 与 b_t^((k)) 为第 k 个稀疏头中对应词项 t 的参数。
最终,将 N 个子集的权重向量拼接,得到完整的稀疏表示:
w = (wt^((1)))(t ∈ V)1 oplus ·s oplus (w_t^((N)))(t ∈ V)_N
该设计使得 N 个特殊 token 各司其职,每个 token 只需在尺寸约为 |V|/N 的子空间内做投影,有效规避了单 token 表示瓶颈,同时天然兼容自回归生成框架(如 vLLM)。
3. 密集表示提取:与稀疏分支共享主干、分离输出
对于密集检索,UEmbed 直接取位于特殊 token 之前的 EOS token 的隐藏状态作为密集嵌入 d ∈ R^D 。当仅需密集检索时,可完全省略追加的特殊 token,不引入任何额外前向计算开销。
4. 统一训练目标:联合优化密集与稀疏检索
模型通过统一的对比学习损失进行端到端训练:
L = L(InfoNCE)^(dense) + λ, L(InfoNCE)^(sparse) + αq, L(FLOPS)^q + αd, L(FLOPS)^d
其中:
- L_(InfoNCE)^(dense) 采用余弦相似度,用于优化密集向量;
- L_(InfoNCE)^(sparse) 采用内积,用于优化稀疏向量;
- L(FLOPS)^q 与 L(FLOPS)^d 为 FLOPS 正则项,通过惩罚查询与文档的平均项权重的平方,鼓励稀疏性;
- λ, α_q, α_d 为平衡各损失项的系数。
此外,为避免负迁移,实验验证了联合训练不会显著损害单模态 specialists 的性能(见图 2a)。
5. 数据策划与难负样本挖掘:提升训练稳定性与跨模态能力
训练数据来自 3 个公开源(共 3.94M 样本),覆盖文本、图像、视频与视觉文档。针对多模态数据缺乏难负样本的问题,论文使用 Qwen3-VL-Embedding-8B 作为教师模型,为所有多模态数据挖掘 top-k 难负样本。消融实验表明,混合文本数据对稳定稀疏分支的训练至关重要——纯多模态训练需约 500 步才能使模型区分正负样本,而加入文本数据后仅需不到 100 步。
总结
通过上述设计,UEmbed 在不改造因果注意力、不引入辅助跨模态模块的前提下,实现了:
- 架构统一:单一 decoder-only 主干同时输出 dense 与 sparse 表示;
- 模态统一:文本、图像、视频、视觉文档均可直接输入并生成稀疏词法表示;
- 训练与服务统一:模型保持与 vLLM 等自回归服务栈的兼容性,且稀疏向量可直接接入倒排索引进行高效检索。
Q: 论文做了哪些实验?
论文围绕多模态与文本检索基准、组件消融、跨模态案例以及实际部署效用四个维度展开系统实验,具体如下:
1. 主基准实验
1.1 多模态检索(MMEB-v2)
- 设置:在 MMEB-v2 的 78 个数据集上评估,涵盖图像(Image)、视频(Video)、视觉文档(VisDoc)三大类任务。
- 对比基线:包括 Qwen3-VL-Embedding(8B/2B)、RzenEmbed-V2-7B、Embed-RL(4B/2B)、Ops-MM-Embed(7B/2B)、UniME(7B/2B)、GME-7B、VLM2Vec-V2-2.0B 等。
- 结果:UEmbed-9B(dense)取得 71.8 的均分,在仅使用公开数据训练的模型中领先;UEmbed-9B(sparse)达到 71.0,与 dense 差距不足 1 分,且首次在多模态稀疏检索上建立强基线。
1.2 文本检索(BEIR)
- 设置:在 9 个 BEIR 数据集上采用 nDCG@10 评估,同时对比 dense 与 sparse 模式。
- 对比基线:密集模型包括 GME-7B、Qwen3-VL-Embedding;稀疏模型包括 SPLADE-v3、Echo-Mistral-SPLADE。
- 结果:UEmbed-9B(dense)平均 56.3,超越 GME-7B 与 Qwen3-VL-Embedding-8B;UEmbed-9B(sparse)平均 55.2,与专用稀疏模型 Echo-Mistral-SPLADE 持平。
2. 组件与消融分析
| 实验 | 目的 | 关键发现 |
|---|---|---|
| vs. 双向 SPLADE 基线 | 验证因果架构本身是否带来收益 | 在相同 backbone、数据与正则化下,UEmbed-2B 在 dense 上平均提升 +3.2,sparse 上提升 +2.1(表 3) |
| 词汇分区策略 | 验证 k-means 语义聚类的必要性 | 语义聚类(Semantic)优于随机分区与最大距离配对策略(表 4) |
| 联合训练鲁棒性 | 验证 dense/sparse 联合训练是否导致负迁移 | 联合训练与单模式 specialists 性能几乎持平(图 2a) |
| 稀疏温度 τ_s | 处理 sparse 内积极大的动态范围 | 解耦温度并使用较大 τ_s (默认 32)显著改善 sparse 性能(图 2b) |
| 特殊 token 数量 N | 平衡表示容量与序列长度 | N=16 时性能稳定, N=32 因词表子集过小而显著下降(图 2c) |
3. 跨模态案例与定性分析
- 稀疏激活可视化:在图 1(b) 与图 3 中展示 UEmbed 在图像(火箭/SpaceX)、视频(主题识别)、视觉文档(数学/群论)和文本上的 top-10 激活词。结果表明模型能够捕捉跨模态语义并映射到可解释的词法单元。
- 误差与局限分析:
- 偶发异常 token(如
_alt、_gap),归因于现代 LLM 词表过大; - 多语言偏向(以英文与中文激活为主),反映训练数据分布。
- 与 Qwen3-VL-Embedding 的差距剖析(附录 C):在细粒度图像分类、视频时序推理、多语言视觉文档上,UEmbed 仍落后于使用专有数据与蒸馏策略的 Qwen3-VL-Embedding。
4. 实际部署效用评估
4.1 混合评分(Hybrid Scoring)
- 方法:线性插值 dense 余弦相似度与 sparse 内积,按模态微调权重。
- 结果:在 Text(+0.3)与 VisDoc(+0.5)上获得提升;图像与视频因表面词法信息有限,增益不显著(表 5)。
4.2 检索效率
- 分析:对比 Faiss dense 索引与 Lucene 倒排索引。
- 结果:通过限制每查询最大激活 token 数( K_(prune) ),可在延迟与 NDCG@5 之间灵活权衡(图 6)。
4.3 Agentic 搜索(BrowseComp-Plus)
- 设置:以 DeepResearch-30A3B 为推理引擎,使用 UEmbed 作为检索工具,评估迭代式研究任务。
- 结果:sparse 模式在 2B/4B/9B 上均减少了每问题的平均搜索轮次(Avg. Search),在 2B 上 Recall 更高,验证了稀疏检索在关键词密集查询与成本敏感场景中的实用价值(表 6)。
5. 训练动态与附加验证
- 训练稳定性:附录 A.3 通过对比“含文本数据”与“不含文本数据”的训练曲线(图 5),证明文本数据对稀疏分支早期收敛与正负样本区分至关重要。
- 超参数敏感性:附录 B.4 在固定随机种子下复现了联合训练、 N 与 τ_s 的消融,结论与主实验一致(表 10–12)。
Q: 有什么可以进一步探索的点?
基于论文的局限性分析与实验观察,以下方向值得进一步探索:
1. 多语言与跨文化扩展
当前训练语料高度偏向英语和中文,导致稀疏头激活在其他语言上泛化不足,且存在显著的文化视角偏差。未来工作可致力于:
- 构建覆盖更多语系的大规模多语言、多文化训练数据;
- 探索语言自适应的词汇分区策略,使不同语言群在稀疏子空间中拥有更均衡的表示容量。
2. 词汇稳定性与异常 Token 抑制
现代 LLM 的庞大词表偶尔会导致非标准子词或伪影 token(如 "_alt"、")a")被异常激活。可进一步研究:
- 目标词汇剪枝:在压缩阶段引入基于频率或语义贡献的剪枝,而非仅依赖规则化合并;
- 事后过滤机制:设计轻量级判别器,在推理阶段抑制低置信度或不合规的激活 token;
- 更精细的语义聚类:将聚类目标从纯词嵌入空间扩展到考虑 token 共现模式的混合空间。
3. 视频与动态模态的稀疏表示增强
论文观察到,稀疏与密集表示在文本和静态视觉文档上差距极小,但在视频任务上差距相对明显。原因在于视频具有高信息密度和时间动态性,简单的扁平稀疏向量可能遇到容量瓶颈。后续可探索:
- 时序感知的稀疏头设计:为特殊 token 引入时间维度上的分层聚合,而非单一的前向汇总;
- 视频专属训练课程:增加动作识别、时刻定位、长视频推理等任务的数据与监督信号;
- 三维时空词汇分区:将视频特征的空间-时间维度显式映射到不同的词汇子集。
4. 混合检索的融合策略优化
当前混合评分采用固定权重的线性插值:
s(hybrid)(q, d) = α, s(dense)(q, d) + β, s_(sparse)(q, d)
且仅在文本和视觉文档上观察到适度提升,图像与视频中增益有限。未来可研究:
- 自适应或学习型的融合权重:根据查询模态、长度或词汇密度动态调整 α, β ;
- 后期交互(late interaction)机制:在分数层之外,探索 token 级的密集-稀疏交互,以捕获更精细的跨模态对齐。
5. 大规模索引与检索效率的系统性评估
论文在效率分析中初步对比了 Faiss 密集索引与 Lucene 倒排索引,但指出系统性的多规模评估仍待完成。后续工作可:
- 在十亿级语料上对比稀疏倒排索引与近似最近邻(ANN)索引的延迟-召回权衡;
- 探索稀疏表示的动态截断( K_(prune) )与量化策略,以进一步优化存储与检索开销。
6. 训练目标与蒸馏策略的改进
附录的定性分析指出,Qwen3-VL-Embedding 在细粒度任务上的优势部分来源于 rank-KL 蒸馏目标(将重排序器分数蒸馏到嵌入模型)。未来可探索:
- 将排序蒸馏或对比蒸馏引入 UEmbed 的联合训练框架,以提升密集分支的判别性;
- 针对稀疏分支设计专属的蒸馏损失,使因果稀疏头能够学习双向重排序器或交叉编码器的细粒度匹配模式。
7. 更细粒度的跨模态对齐与可解释性
尽管 UEmbed 无需辅助跨模态模块即可处理多模态输入,但在细粒度识别(如 ImageNet-A、SUN397)和问答定位任务上仍有提升空间。可进一步研究:
- 模态间词汇对齐:显式约束图像区域或视频片段与文本词项在稀疏子空间中的对应关系;
- 稀疏激活的可解释性审计:利用稀疏表示天然的可解释性,建立自动化偏见检测与纠偏流程,特别是在高风险的检索应用场景中。
Q: 总结一下论文的主要内容
该论文提出 UEmbed(Unified Embedding),一种基于 decoder-only 多模态大语言模型的统一嵌入框架,能够在单次因果前向传播中同时生成密集(dense)与稀疏(sparse)表示,并原生支持文本、图像、视频与视觉文档等多种模态。
1. 研究背景与问题
学习稀疏检索(Learned Sparse Retrieval, LSR)虽已在文本检索中取得显著进展,但仍面临三重局限:
- 架构约束:现有 LSR 依赖双向编码器(如 BERT),难以直接适配因果 decoder-only 模型,且与 vLLM 等自回归服务框架不兼容;
- 模态局限:稀疏检索多局限于文本,现有少数量方法需引入辅助跨模态模块,难以扩展至新模态;
- 实际效用不明:稀疏方法多在传统基准上评估,其在混合检索、服务效率与智能体(agentic)场景中的价值缺乏系统验证。
2. 核心方法
UEmbed 的核心设计是在 decoder-only MLLM 的输入末尾追加 N 个可学习的特殊 token langle s_1 rangle, dots, langle s_N rangle ,并通过 词表语义分区 与 分区稀疏头 解决因果注意力下的信息瓶颈:
- 词表压缩与分区:先通过规则合并(小写化、去重音等)将词表从 248,320 压缩至 184,016;再利用 k-means 聚类将词表 V 划分为 N 个互不相交的语义子集 V_1, dots, V_N (默认 N=16 )。
- 分区稀疏投影:每个特殊 token langle sk rangle 的因果隐藏状态 h(sk) 仅负责预测对应子集 V_k 上的稀疏权重:
w_t^((k)) = log!(1 + ReLU!(W_t^((k)top) h(s_k) + b_t^((k)))), quad ∀ t ∈ V_k
最终拼接所有子集得到完整稀疏向量 w ∈ R^(|V)| 。 - 密集表示:取位于特殊 token 之前的 EOS token 隐藏状态作为密集嵌入 d ∈ R^D ;若仅需密集检索,可完全省略特殊 token,避免额外计算。
- 统一训练目标:
L = L(InfoNCE)^(dense) + λ, L(InfoNCE)^(sparse) + αq, L(FLOPS)^q + αd, L(FLOPS)^d
其中密集分支采用余弦相似度,稀疏分支采用内积,FLOPS 正则项鼓励稀疏性。
3. 实验与结果
论文在公开数据上训练了 2B、4B、9B 三个规模的模型,并展开以下评估:
- 多模态检索(MMEB-v2):UEmbed-9B 在 dense 模式下达到 71.8,在仅使用公开数据的模型中领先;sparse 模式达到 71.0,与 dense 差距不足 1 分,首次在多模态稀疏检索上建立强基线。
- 文本检索(BEIR):UEmbed-9B(dense)在 9 个数据集上平均 nDCG@10 为 56.3,超越 GME-7B 与 Qwen3-VL-Embedding-8B;sparse 模式平均 55.2,与专用稀疏模型 Echo-Mistral-SPLADE 持平。
- 组件分析:消融实验表明,因果架构下的 UEmbed 优于同配置的双向 SPLADE 基线;k-means 语义分区优于随机分区;联合训练几乎不造成负迁移;稀疏温度 τ_s=32 与 N=16 为稳健选择。
- 实际效用:
- 混合评分:线性融合 dense 与 sparse 相似度,在文本与视觉文档任务上进一步提升效果;
- 服务效率:稀疏表示可直接接入倒排索引(如 Lucene),兼容 vLLM 等自回归高吞吐服务栈;
- 智能体搜索(BrowseComp-Plus):在迭代式推理检索中,sparse 模式平均搜索轮次更少,在 2B 规模上 Recall 更高,验证了其在关键词密集查询中的成本优势。
4. 局限与未来方向
论文亦指出当前局限:训练语料偏重英中文导致多语言稀疏激活不足;超大词表偶尔产生异常 token;视频任务上稀疏与密集表现差距略大,暗示扁平稀疏向量对高动态模态的容量瓶颈。
5. 贡献总结
- 首次在单一 decoder-only 因果主干中统一了密集与稀疏检索,无需双向化改造或辅助模块;
- 首次将稀疏检索系统评估于 MMEB-v2 多模态基准,并建立该设置下的新状态;
- 验证了统一模型在有效性、推理效率与智能体应用中的综合实用价值,推动稀疏检索从独立模块转变为 MLLM 的原生能力。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Tingyu Song,Mingxin Li,Yanzhao Zhang,Dingkun Long,Pengjun Xie,Zhijie Nie,Yilun Zhao,Shu Wu
PDF URL: https://arxiv.org/pdf/2608.02583.pdf
Arxiv URL: https://arxiv.org/abs/2608.02583
Arxiv ID: 2608.02583
CoolPaper URL: https://papers.cool/arxiv/2608.02583
Published: 2026-08-05T01:02:18.312Z
Updated: 2026-08-05T01:02:18.312Z
7. WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity
Abstract:Controllable video generation models are increasingly being developed as world models. Accordingly, evaluating them in this role extends beyond the apparent appearance of generated videos to the inherent reactivity of the worlds they depict: the ability to infer from the scene state how the world should react and to generate plausible consequences not explicitly described in the input. Yet existing benchmarks mainly assess visual quality or explicit instruction fulfillment by checking whether requested actions and interaction outcomes are realized, leaving inherent reactivity underexamined. We introduce WorldExam, a hierarchical diagnostic benchmark spanning four levels: Visual Quality, Control Adherence, Spatial Consistency, and World Reactivity. It comprises 1,474 cases across eight dedicated tasks and supports unified evaluation of camera-, action-, and language-driven model paradigms. The World Reactivity level evaluates scene-conditioned reactions and goal-directed behaviors beyond what is explicitly specified in the input. Evaluation of 20 representative models reveals a clear capability split. Camera-driven models excel at camera control, but their interfaces do not support dynamic interaction; action-driven models control subjects more precisely but often leave the world unresponsive; and language-driven models perform better on interaction but follow complex controls less faithfully. No model combines broad task coverage with consistently strong performance, showing that high visual quality and explicit instruction fulfillment do not guarantee inherent reactivity.
中文摘要
摘要:可控视频生成模型正日益被开发作为世界模型。因此,以这一角色评估它们不仅涉及生成视频的表观外观,更涉及它们所描绘世界的内在反应性:从场景状态推断世界应如何反应以及生成输入中未明确描述的合理后果的能力。然而,现有基准测试主要评估视觉质量或通过检查是否实现请求的动作和交互结果来评估明确指令的完成情况,内在反应性却未被充分研究。我们提出了WorldExam,这是一个分层诊断基准,涵盖四个层级:视觉质量、控制遵守性、空间一致性和世界反应性。它包含8个专门任务的1,474个案例,并支持对基于摄像机、动作和语言的模型范式进行统一评估。世界反应性层级评估场景条件下的反应和目标导向行为,这些反应和行为超出了输入中明确规定的内容。对20个具有代表性的模型进行评估显示出明显的能力分化:基于摄像机的模型在摄像机控制上表现优异,但其接口不支持动态交互;基于动作的模型对主体控制更精确,但常常让世界无响应;基于语言的模型在交互上表现更好,但对复杂控制的遵循不够忠实。没有哪种模型同时具备广泛任务覆盖和持续强劲表现,这表明高视觉质量和明确指令的完成并不保证内在反应性。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决现有视频世界模型基准测试对“内在反应性”(inherent reactivity)评估不足的问题。
具体而言,当前可控视频生成模型正被逐步视为世界模型(world models),其评估标准不应仅停留在生成视频的表观视觉质量或显式指令的完成度上。现有基准大多预先指定了期望的布局、相机轨迹、动作序列或交互结果,然后检验模型是否实现了这些被明确描述的目标。然而,这种评估方式忽略了一个关键能力:模型应当能够根据初始场景状态推断出世界应如何反应,并生成那些未被输入显式描述、但由场景条件所隐含的合理后果——例如主体踏上楼梯时运动姿态的地形自适应、接近障碍物时的接触/避让反应,或进入其他智能体社交距离时对方的合理回应等。
为填补这一空白,论文提出了 WorldExam,一个从表观外观到内在反应性的层次化诊断基准。该基准通过构造“仅指定显式控制或目标、而将场景条件化反应留给模型推断”的测试用例,系统性地评估模型在以下四个诊断层级上的表现:视觉质量(Visual Quality)、控制遵循(Control Adherence)、空间一致性(Spatial Consistency)和世界反应性(World Reactivity)。其核心贡献在于将评估重点从“输入是否被直接复现”拓展到“场景蕴含的合理推论是否被正确生成”。
Q: 有哪些相关研究?
根据论文第2节,相关研究可分为视频世界模型与视频世界模型基准两大类别,具体如下:
2.1 视频世界模型(Video World Models)
现有视频世界模型依据其主要控制接口,可分为三种范式:
相机驱动模型(Camera-Driven)
以相机轨迹为条件生成视频。代表性方法包括:通过学习的相机编码器或嵌入注入轨迹:ReCamMaster
3
、FantasyWorld
9从输入重建三维先验并重投影到目标视角:NeoVerse
56
、InSpatio-World
39
、Voyager
13
、TrajectoryCrafter
59动作驱动模型(Action-Driven)
基于离散动作序列(如键盘式接口)生成未来帧。代表性方法包括:强调实时交互与一致生成:WorldPlay
38
、LingBot-World
40其他:Hunyuan-GameCraft
20
、Astra
65
、Yume 1.5
30
、Infinite-World
50
、Matrix-Game 3.0
46语言驱动模型(Language-Driven)
从文本或图文提示生成语义复杂的视频。代表性方法包括:Kling 2.5
17
、Veo 3.1
12
、Hailuo 2.3
32
、Wan 2.6 I2V
44
、Seedance 1.5
35
、Vidu Q3
5
、HappyHorse 1.0
1
2.2 视频世界模型基准(Video World Model Benchmarks)
现有基准从多个互补维度评估视频世界模型:
感知与时间质量
如 VBench
14
、VBench++
15
、EvalCrafter
27
、FETV
28
等,关注视频的感知合理性与时间稳定性。组合性、世界知识与隐式规则
如 T2V-CompBench
37
、T2V-WorldBench
8
、RISE-Video
26
、WorldReasonBench
48
等,评估组合生成、世界知识与未来状态推理。物理一致性
如 VideoPhy
4
、PhyGround
24
、WorldBench
43
、WorldModelBench
18
、ACWMPhys
53
等,专注于诊断特定物理定律、几何一致性与交互泛化。具身智能(Embodied AI)
如 RoboWM-Bench
16
、RobotrustBench
19
、WorldEval
21
、KineBench
29
、WorldArena
36
、MiraBench
55
、EWMBench
60
等,评估动作保真度、物理可执行性与规划效用。自动驾驶
如 Act-Bench
2
、WorldLens
22
、DrivingGen
64
等,关注自车动作控制、轨迹合理性与安全性。通用交互式基准(与 WorldExam 直接对比)
- WorldScore
10
:评估基于相机轨迹的布局控制与几何一致性 - MIND
57
:关注动作控制与闭环重访一致性 - WorldMark
52
与 iWorld-Bench
11
:通过标准化或统一动作表示改进跨模型比较 - Omni-WorldBench
49
:评估提示指定的交互结果、受影响实体与中间因果状态转换 - WBench
58
:扩展至多轮导航、主体动作、事件编辑与视角切换 - WorldOlympiad
62
:探测长程交互与物理规律 - WorldRoamBench
51
:结合长程动作条件生成,诊断可控性、视觉漂移、力学、光学、三维一致性与记忆
论文指出,上述通用基准虽大幅拓展了交互式评估范围,但多数仍以“显式指令完成度”为核心:即预先指定期望的控制或交互结果,再检验模型是否实现该结果。相比之下,WorldExam 的核心区别在于通过场景条件化反应与目标导向行为,评估模型在输入未显式说明的推论性后果上的生成能力。
Q: 论文如何解决这个问题?
论文通过构建 WorldExam 基准,从评估框架、任务设计、接口适配、用例构建与度量协议五个方面系统性地解决该问题。
1. 建立层次化诊断框架
区别于单一总分排名,论文将世界模型评估划分为四个独立的诊断层级,由浅入深地定位模型能力缺陷:
- Visual Quality:视频的表观视觉质量、时序稳定性与美学质量;
- Control Adherence:受控相机或主体是否严格遵循输入指令;
- Spatial Consistency:相机重访已有视角时,场景几何、外观与内容是否保持一致;
- World Reactivity:模型能否基于场景状态推断出未被输入显式描述的合理后果,包括场景条件化反应与目标导向行为。
四个层级分别报告分数,避免高视觉质量或显式指令完成度掩盖内在反应性的缺失。
2. 设计“World Reactivity”评估范式
核心创新在于重构输入与期望输出的关系:
- 反应导向任务(Terrain Interaction、Object Interaction、Social Interaction、Physical Reaction):输入仅包含初始图像与单一原子控制(如“前进”),不陈述应触发的场景反应。例如,主体走向楼梯时,模型需自行推断攀爬动作;走向障碍物时,需推断避让或接触后果。
- 目标导向任务(Goal Completion):输入仅提供高层目标(如“将三个螺栓按高度排列”)与初始场景,不给出逐步执行指令。模型需基于场景中的实体、干扰项与约束,自行规划并生成帧级执行过程。
这种设计强制模型从场景状态推断隐含后果,而非仅仅复现输入描述。
3. 统一多范式接口适配
为使相机驱动、动作驱动与语言驱动三种范式可在同一案例上可比,论文将可控行为分解为原子控制单元的有序组合,并映射至各范式的原生接口:
- 相机驱动:映射为 SE(3) 相机轨迹;
- 动作驱动:映射为离散动作序列( W, S, A, D, ↑, ↓, arrow, arrow, varnothing );
- 语言驱动:映射为自然语言提示(如“The camera moves forward, then pans right”)。
该适配机制使同一控制意图能以原生格式输入不同模型,实现跨范式的统一评估。
4. 双轨道评估机制
为避免将“接口不支持”误判为“能力失败”,论文采用双轨道而非全局排名:
- Static-Scene Track:包含 Camera Control 与 Scene Revisit,评估静态场景下的相机运动与空间记忆。所有三种范式均可参与。
- Dynamic-Interaction Track:包含 Subject Control 与五个 World Reactivity 任务,要求可观测的主体-环境交互。仅兼容的动作驱动与语言驱动模型参与;相机驱动模型因接口限制天然排除,Goal Completion 仅限语言驱动模型。
5. 专业化测试用例构建流程
针对动态交互任务,论文设计了严格的用例生成流程(图3):
- 任务模式库:预定义语义覆盖范围(如地形类型、社交冲突场景、物理过程类型);
- 结构化草稿生成:由模式驱动,经 LLM 生成场景描述、初始图像提示、控制意图与可选评估清单;
- 初始图像生成与人工过滤:生成 N 张候选初始图像,过滤掉事件已发生、关键实体不可见或物理不可行的样本;
- 图像条件细化:将草稿中的实体引用、空间关系、提示与清单锚定到选定的具体图像,确保评估条件与图像内容严格一致;
- 清单固化:对于 Object Interaction、Social Interaction、Physical Reaction 与 Goal Completion,最终确定案例专属检查清单 L = ellk(k=1)^K 。
最终用例包含:初始图像 I_0 、控制意图/高层目标、 grounded 文本提示,以及(可选)评估清单。
6. 多维度评估指标
针对不同层级与任务类型,论文采用差异化的度量方式:
- 几何重建评估(Camera Control、Scene Revisit、Subject Control、Terrain Interaction):利用 VGGT- Omega 重建三维相机位姿与主体轨迹,计算平移误差 et 、旋转误差 e_r 、重访成功率 S(succ) 及外观一致性(PSNR、LPIPS、SSIM)。
- VLM 清单评估(Object Interaction、Social Interaction、Physical Reaction、Goal Completion):以 GPT-5.5 为视觉-语言裁判,对照预定义清单逐项判定,案例得分 $S(check)(V, L) = (100) / (K)∑(k=1)^K I
ell_k is satisfied in V
$。 - 图像空间位移对齐:针对相机驱动模型,在生成前校准输入轨迹的平移幅度,使不同模型在图像空间产生可比的位移 d^* = W/2 ,消除因接口对平移尺度解释差异带来的不公平。
Q: 论文做了哪些实验?
论文在第5节及附录中开展了以下系统性实验:
1. 总体实验设置
在20个代表性世界模型上进行评估,涵盖三种控制范式:
- 相机驱动:6个模型(TrajectoryCrafter、ReCamMaster、Voyager、FantasyWorld、NeoVerse、InSpatio-World)
- 动作驱动:7个模型(Hunyuan-GameCraft、Astra、WorldPlay、Yume 1.5、LingBot-World、Infinite-World、Matrix-Game 3.0)
- 语言驱动:7个模型(Kling 2.5、Veo 3.1、Hailuo 2.3、Wan 2.6 I2V、Seedance 1.5、Vidu Q3、HappyHorse 1.0)
所有模型均参与静态场景轨道(Static-Scene Track);仅有支持可靠第三人称主体控制的 WorldPlay、LingBot-World 及全部7个语言驱动模型参与动态交互轨道(Dynamic-Interaction Track)。生成分辨率与帧长保持各模型默认设置,流式模型限制输出100–200帧。
2. 静态场景轨道评估
评估 Camera Control 与 Scene Revisit 两项任务,并报告五项通用视觉指标(3D Consistency、Photometric Consistency、Temporal Flickering、Aesthetic Quality、Imaging Quality)。关键发现包括:
- Camera Control:基于三维先验重建的相机驱动模型(NeoVerse、InSpatio-World)表现最优;语言驱动模型因难以精确表达有序复杂视角变化,分数普遍较低。
- Scene Revisit:NeoVerse 与 InSpatio-World 均实现 1.000 的重访成功率;语言驱动模型在返回初始视角及恢复场景一致性方面差距显著。
3. 输入平移乘数消融实验
以 NeoVerse 为对象,在保持旋转不变的前提下,将输入 SE(3) 轨迹的平移分量分别乘以 0.10× 、 0.50× 、 0.75× 、 1.00× 、 2.00× 。实验表明:
- 随着乘数增大,图像空间位移增加,Camera Control 分数从 98.25 降至 95.32 ;
- Scene Revisit 分数从 90.98 降至 88.37 ;
- 通用指标均值从 80.42 降至 75.05 。 该结果验证了图像空间位移对齐(Sec. 4.2)的必要性:未对齐的平移输入会直接加剧生成控制与场景保持的难度。
4. 动态交互轨道评估
评估 Subject Control 及五个 World Reactivity 任务(Terrain Interaction、Object Interaction、Social Interaction、Physical Reaction、Goal Completion)。主要结论:
- Subject Control:动作驱动模型(LingBot-World 55.47 、WorldPlay 49.75 )显著优于语言驱动模型最优的 Veo 3.1( 37.28 )。
- Terrain Interaction:语言驱动模型领先(Vidu Q3 64.39 、Hailuo 2.3 61.57 ),而动作驱动模型最佳仅 27.49 ,表明精确的水平控制并不保证垂直地形自适应。
- Object / Social Interaction:语言驱动模型(Veo 3.1、Vidu Q3、Hailuo 2.3)普遍占优;动作驱动模型常出现物体无响应或主体穿透现象。
- Physical Reaction:Hailuo 2.3( 63.84 )、Veo 3.1( 61.76 )、Vidu Q3( 61.23 )领先,动作驱动模型多低于 35 。
- Goal Completion:HappyHorse 1.0( 85.33 )与 Veo 3.1( 85.30 )最强;部分通用视觉指标高的模型(如 Kling 2.5)在此项得分显著偏低( 48.25 ),证明视觉质量与目标执行能力不直接等价。
5. 跨任务诊断分析
将各模型在八个任务上的得分进行范式级比对(图8),揭示出鲜明的能力分化:
- 相机驱动模型:在 Camera Control 与 Scene Revisit 上表现最强,但接口不支持动态交互。
- 动作驱动模型:Subject Control 更精确,然而 Terrain、Object、Social、Physical 反应任务常出现“世界无响应”。
- 语言驱动模型:交互与目标完成更优,但对复杂组合控制的遵循度较低。
没有单一模型在全部任务上同时达到强劲表现,且通用视觉指标(General averages)与深层任务指标(Task averages)范围窄化与离散化的差异表明:四个诊断层级度量的是不同能力,不可互相替代。
6. 检查清单评估的人类对齐验证
对基于检查清单的四个任务(Goal Completion、Physical Reaction、Object Interaction、Social Interaction),在800个评估实例(共5,793个检查项)上对比 GPT-5.5 评判与三名人工标注者的多数票标签。结果显示:
- 总体 Spearman 相关系数 rho = 0.8614 ,PLCC = 0.8583 ;
- 各任务 rho 介于 0.7019 (Social Interaction)至 0.8960 (Goal Completion)之间。 表明 VLM 裁判与人类判断具有高度一致性。
7. 重建后端稳定性验证
为排除几何重建后端对结论的敏感性,使用 Depth Anything 3 (DA3) 替代 VGGT- Omega 重新计算所有基于三维重建的指标:
- 静态场景轨道:20个模型总体平均绝对相对变化为 3.09% ;相机驱动与动作驱动模型的组内排名完全保留。
- 动态交互轨道:总体平均绝对相对变化仅 0.57% ,最大变化 1.16% ,组内排名完全不变。 验证了论文的主要模型对比结论不依赖于特定的重建后端。
Q: 有什么可以进一步探索的点?
基于论文的局限性与讨论,可进一步探索的方向包括:
1. 统一控制接口与跨范式模型的评估
当前评估受限于各范式的原生接口能力分割(相机驱动不支持动态主体交互,动作驱动难以完成语言级目标规划)。未来可探索:
- 统一多模态接口模型的评估,即同时支持 SE(3) 轨迹、离散动作与自然语言指令的单一模型,检验其在 WorldExam 全层级上的联合表现;
- 将动态交互轨道与 Goal Completion 任务扩展至动作驱动或混合接口模型,随着接口能力进化更新评估覆盖。
2. 从端到端行为到内部因果表征的诊断
现有指标仅评估生成视频的可观测行为,无法确定模型是否真正习得了内部物理/因果表征,抑或仅依赖表面统计关联。未来方向包括:
- 设计干预式(intervention-based)评估,如通过修改场景局部状态(改变障碍物材质、隐藏支撑物)检验模型是否基于因果规则而非纹理记忆生成后续帧;
- 利用**表征探测(representation probing)或概念激活向量(CAV)**分析视频生成器的隐层是否编码了稳定的物理量(如重力方向、动量、刚体约束)。
3. 长程交互与持久世界记忆
当前测试以相对短程的场景条件反应为主。可进一步探索:
- 长程(long-horizon)World Reactivity:评估模型在多步交互后仍保持物理状态一致性的能力,例如连续推动多个物体后它们的位置与动量是否合理累积;
- 持久空间记忆对反应性的影响:结合 Scene Revisit 与动态交互,测试主体在离开并返回交互现场后,被移动物体的状态是否被正确保持。
4. 更精细的物理正确性度量与仿真器耦合
尽管论文验证了重建后端稳定性,几何重建仍存在误差。未来可:
- 引入物理引擎仿真器作为参考真值,将生成视频中的物体运动与仿真轨迹进行逐帧比对,量化力、摩擦、碰撞响应的精确度;
- 开发三维场景图(3D scene graph)级别的评估,超越像素级或检查清单评判,直接验证实体关系与状态转移的语义正确性。
5. 将诊断指标用于训练闭环
WorldExam 目前定位为离线诊断基准,但其层级化指标可进一步用于模型训练:
- 将 Control Adherence 与 World Reactivity 得分作为强化学习奖励或 RLHF 信号,直接优化生成模型的可控性与场景推断能力;
- 针对检查清单中的失败模式(如穿透、浮空、无响应)设计专门的损失项或微调目标,实现从“评估缺陷”到“修复缺陷”的闭环。
6. 开放世界与领域泛化
当前用例在受控场景下构建。未来扩展方向包括:
- 开放世界基准:引入非结构化野外场景(in-the-wild),检验模型对罕见地形、未知物体动力学与社会规范的泛化;
- 具身智能与自动驾驶闭环:将 WorldExam 的反应性评估协议迁移至真实机器人或自动驾驶闭环系统,验证生成模型作为世界模型在下游决策中的可靠性。
7. 闭源系统的黑箱机制解析
对于闭源商业语言驱动模型,其内部可能包含专有的提示增强与场景规划模块。可进一步探索:
- 逆向工程或消融其提示增强流程,量化自动场景 grounding 与目标分解对 Goal Completion 得分的贡献;
- 建立透明性评估协议,区分模型自身的生成能力与外部预处理系统的贡献。
8. 多智能体复杂社会交互
Social Interaction 目前以二元局部冲突为主。未来可深化为:
- 多智能体协作与竞争:评估模型在群体交互中维持个体意图、社会规范与空间礼仪的能力;
- 通信与符号交互:检验模型是否能生成包含手势、视线交流或语言沟通的社会反应序列。
Q: 总结一下论文的主要内容
该论文针对可控视频生成模型作为世界模型(world models)的评估问题,提出了一个从表观外观到内在反应性的层次化诊断基准 WorldExam。以下是论文的主要内容总结:
1. 研究动机与问题
- 可控视频生成模型正被日益视为世界模型,其评估不应仅停留在生成视频的视觉质量或显式指令完成度上。
- 现有基准大多预先指定期望的布局、相机轨迹、动作序列或交互结果,检验模型是否实现了这些被输入显式描述的目标。
- 核心不足:现有工作缺乏对内在反应性(Inherent Reactivity)的评估,即模型根据初始场景状态推断世界应如何反应,并生成未被输入显式描述、但由场景条件隐含的合理后果的能力(如地形自适应、障碍物避让、社交距离反应等)。
2. WorldExam 基准设计
2.1 四层级诊断框架
WorldExam 将评估组织为四个独立的诊断层级,由浅入深:
- Visual Quality:视觉保真度、时序稳定性与美学质量;
- Control Adherence:受控相机或主体是否严格遵循输入指令;
- Spatial Consistency:相机重访已有视角时,场景几何与内容是否保持一致;
- World Reactivity:模型能否基于场景状态推断并生成合理的场景条件化反应与目标导向行为。
2.2 八项评估任务
四个层级被实例化为八项任务:
- Control Adherence:Camera Control、Subject Control
- Spatial Consistency:Scene Revisit
- World Reactivity:Terrain Interaction、Object Interaction、Social Interaction、Physical Reaction、Goal Completion
其中,World Reactivity 层级的核心设计在于:输入仅指定显式控制(如“前进”)或高层目标(如“按高度排列三个螺栓”),不陈述预期的场景反应或详细执行步骤,迫使模型自行推断。
2.3 三范式统一接口适配
为使不同控制接口的模型可比较,论文将控制意图表示为原子控制单元的有序组合,并适配至三种范式:
- 相机驱动: SE(3) 相机轨迹;
- 动作驱动:离散动作序列(如 W, S, A, D, ↑, ↓, arrow, arrow, varnothing );
- 语言驱动:自然语言提示。
2.4 双轨道评估机制
为避免将接口不支持误判为能力失败,采用双轨道而非全局排名:
- Static-Scene Track(Camera Control、Scene Revisit):适用于所有三种范式;
- Dynamic-Interaction Track(Subject Control 及五项 World Reactivity 任务):仅适用于支持第三人称主体交互的动作驱动与语言驱动模型;Goal Completion 仅限语言驱动模型。
3. 实验与结果
3.1 实验规模
在 20 个代表性模型上评估(6个相机驱动、7个动作驱动、7个语言驱动),共 1,474 个测试用例。
3.2 关键发现
- 相机驱动模型(如 NeoVerse、InSpatio-World):在 Camera Control 与 Scene Revisit 上表现最强,但接口不支持动态交互;
- 动作驱动模型(如 WorldPlay、LingBot-World):Subject Control 更精确,但在 Terrain Interaction、Object Interaction 等反应任务中常出现“世界无响应”;
- 语言驱动模型(如 Veo 3.1、Hailuo 2.3、Vidu Q3):在交互与目标完成(Goal Completion)上更优,但对复杂组合控制的遵循度较低;
- 能力分化:没有任何单一模型在四个层级与全部任务上同时达到强劲表现;
- 指标解耦:高视觉质量与显式指令完成度不保证内在反应性。例如,Kling 2.5 的通用视觉指标领先,但 Goal Completion 得分显著偏低。
3.3 验证实验
- 图像空间位移对齐:验证了不同相机驱动模型对相同 SE(3) 输入的图像空间位移差异会显著影响评估公平性,因此引入预生成校准机制;
- 人类对齐验证:基于 GPT-5.5 的检查清单评估与人工标注的 Spearman 相关系数达 0.8614 ,PLCC 达 0.8583 ;
- 后端稳定性:使用 Depth Anything 3 替代 VGGT- Omega 重新计算后,模型排名与主要结论保持不变。
4. 结论与贡献
- 理论贡献:将世界模型评估从“显式指令复现”拓展至“场景隐含推论生成”,定义并量化了内在反应性;
- 工程贡献:提出了支持相机/动作/语言三种范式统一评估的层次化基准,包含 1,474 个测试用例与完整的评估工具链;
- 实证贡献:系统评估揭示了当前视频世界模型在控制精度、空间记忆与场景反应性之间的范式依赖型能力分割,为未来模型开发指明了需联合提升的方向。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yuxue Yang,Shuyao Shang,Jiahe Wang,Zitong Zhou,Liang Tan,Junhan Zeng,Ruizhi Li,Junyan Li,Yu Liu,Xiao Yang,Yong Li,Jun Zhu,Hongsheng Li,Tieniu Tan,Lue Fan,Zhaoxiang Zhang
PDF URL: https://arxiv.org/pdf/2608.02603.pdf
Arxiv URL: https://arxiv.org/abs/2608.02603
Arxiv ID: 2608.02603
CoolPaper URL: https://papers.cool/arxiv/2608.02603
Published: 2026-08-05T01:02:25.652Z
Updated: 2026-08-05T01:02:25.652Z
8. Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs
Abstract:Recent Vision-Language-Action (VLA) models for autonomous driving (AD) increasingly utilize chain-of-thought (CoT) supervision to enhance the reasoning capabilities of their Vision-Language Model (VLM) components, yet existing annotation pipelines commonly expose the teacher model to the logged ground-truth (GT) future trajectory. We empirically show that this induces trajectory anchoring bias: teacher models rationalize the revealed outcome rather than infer a decision from scene evidence, producing less causally faithful CoTs and substantially more severe hallucinations, especially in causally challenging scenes. Removing the GT trajectory eliminates this shortcut, but open-ended trajectory generation entangles high-level decision-making with precise geometric synthesis and low-level dynamics. To make trajectory-level driving decisions verifiable without requiring open-ended trajectory synthesis, we introduce Autonomous-Driving Multiple-Choice Question (AD-MCQ), which casts planning as selection among explicit trajectory candidates. Taking this a step further, we propose Deferred Exposure of Future Trajectories for RLVR (DEFT-RLVR) to transform future trajectories from pre-decision anchors into post-decision verification targets. Experimental results show that DEFT-RLVR improves AD reasoning while preserving or even enhancing general visual capabilities. With VLM-only inference and controllable difficulty through candidate construction, AD-MCQ provides a flexible, scalable, and extensible foundation for future research on verifiable AD reasoning.
中文摘要
摘要:最近用于自动驾驶(AD)的视觉-语言-动作(VLA)模型越来越多地利用链式思维(CoT)监督来增强其视觉-语言模型(VLM)组件的推理能力,然而现有的标注流程通常让教师模型接触记录的真实(GT)未来轨迹。我们通过实验证明,这会引发轨迹锚定偏差:教师模型更倾向于对已揭示的结果进行合理化,而不是根据场景证据推断决策,从而产生因果不够真实的CoT,并在因果上具有挑战的场景中导致更严重的幻觉。去除GT轨迹可以消除这一捷径,但开放式轨迹生成会将高层决策与精确几何合成及低层动力学纠缠在一起。为了在无需开放式轨迹生成的情况下使轨迹级驾驶决策可验证,我们引入了自动驾驶多选问题(AD-MCQ),将规划视为在明确轨迹候选中进行选择。进一步地,我们提出了用于RLVR的未来轨迹延迟暴露方法(DEFT-RLVR),将未来轨迹从决策前的锚点转化为决策后的验证目标。实验结果表明,DEFT-RLVR在保持甚至增强视觉能力的同时,提升了自动驾驶推理能力。通过仅使用VLM推理并通过候选构建实现可控难度,AD-MCQ为未来可验证自动驾驶推理研究提供了灵活、可扩展且可扩展的基础。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文主要解决自动驾驶视觉-语言模型(AD VLMs)在思维链(CoT)监督中因提前暴露真实未来轨迹而导致的轨迹锚定偏差(trajectory anchoring bias)问题,并在此基础上提出了一套可验证的推理与训练框架。
具体而言,论文试图解决的问题及其解决路径可概括为以下几个方面:
1. 核心问题:轨迹锚定偏差
现有面向自动驾驶的 Vision-Language-Action(VLA)模型在利用 CoT 监督增强 VLM 的推理能力时,标注流程通常将已记录的真实未来轨迹(logged ground-truth future trajectory)提前暴露给教师模型。这导致教师模型并非从场景证据中因果推断驾驶决策,而是对已知的未来结果进行事后合理化(post-hoc rationalization)。论文将这一现象定义为轨迹锚定偏差,其后果包括:
- 因果忠实性降低:生成的 CoT 虽然几何上与 GT 轨迹一致,但未能忠实识别真正支持该动作的场景证据;
- 幻觉显著增加:尤其在因果关系复杂的场景中,模型会捏造不存在的因果线索(如虚构不存在的交通标志)来支持已暴露的轨迹;
- 推理捷径:未来轨迹成为推理的前提而非验证目标,破坏了”先求解后验证”(solve-then-verify)的范式。
2. 开放式轨迹生成的验证困境
若直接隐藏 GT 轨迹以消除锚定偏差,会面临新的难题:开放式的轨迹合成将高层决策与精确的连续几何、低级动力学深度耦合。这使得:
- 轨迹级别的决策难以通过自动化方式进行精确验证;
- 语言模型难以在自身词汇表内直接生成满足物理约束的连续轨迹坐标。
3. 解决方案:可验证的候选轨迹选择与延迟暴露
为在消除锚定偏差的同时实现可验证的轨迹级决策,论文提出了两个核心组件:
(1)AD-MCQ:自动驾驶多项选择基准
将规划任务重新建模为从显式轨迹候选集中进行选择(Autonomous-Driving Multiple-Choice Question)。通过 K-Means 构建离散轨迹原型库(codebook),将连续的 GT 未来轨迹量化为可索引的原型,并为每个场景构造包含 oracle 与 hard-negative distractors 的候选集。这使得:
- 轨迹级决策可通过选项字母进行精确验证(exact verification),无需开放式坐标生成;
- 候选保留了制动时机、速度曲线、横向几何等细粒度差异,避免了粗粒度元动作(meta actions)的信息损失。
(2)DEFT-RLVR:面向强化学习验证奖励的轨迹延迟暴露
提出 Deferred Exposure of Future Trajectories for RLVR,通过两阶段交互将轨迹从决策前锚点转变为决策后验证目标:
- Turn 1(因果决策推理):策略模型仅基于场景上下文(多视角历史帧、自车状态、导航指令)生成候选盲(candidate-blind)的高层决策(HLD)与因果推理链;
- Turn 2(显式轨迹落地):在模型已做出场景衍生的决策承诺后,再暴露候选轨迹,要求模型将已固定的决策匹配到最接近的显式轨迹实现。
在优化层面,该方法采用 GRPO 联合优化两阶段交互,并结合基于结构化评分标准的推理过程监督(rubric-based process supervision):仅当最终选项正确时,才对 Turn-1 的因果推理链施加基于实例特定评分标准的奖励,从而抑制通过捷径或猜测获得正确答案的推理路径。
4. 预期效果
实验表明,该框架能够在以下方面取得平衡:
- 提升自动驾驶推理与决策质量:在 AD-MCQ 基准上显著提高准确率(ACC)、因果忠实性评分(CFS)与高层决策一致性(HLD),且性能增益可跨域泛化至 nuScenes;
- 保持甚至增强通用视觉能力:与导致通用能力严重退化的监督微调(SFT)不同,DEFT-RLVR 在提升 AD 专用能力的同时,保持了基础模型的通用视觉-语言性能。
综上,该论文通过揭示轨迹锚定偏差的现象,将轨迹级驾驶决策转化为可验证的显式选择问题,并通过延迟暴露机制与强化学习验证奖励,实现了因果更忠实、幻觉更少且可扩展的自动驾驶视觉-语言推理。
Q: 有哪些相关研究?
基于论文内容,相关研究可归纳为以下三个主要方向:
1. 自动驾驶中的视觉-语言推理(Vision–Language Reasoning for Autonomous Driving)
该方向探索如何将视觉-语言模型(VLM)集成到自动驾驶的感知、推理与规划回路中,经历了从语言辅助监督到端到端多模态架构的演进:
- 早期语言条件驾驶模型:将驾驶任务建模为图视觉问答(Graph VQA)、语言条件行为预测或可解释轨迹生成,例如 GPT-Driver、DriveLM、DriveMLM 与 DriveGPT4 等。
- 统一视觉-语言-动作(VLA)架构:后续工作扩展至多视角场景推理、知识增强、行为规划状态对齐,如 EMMA、SENNA、DriveVLM、OpenDriveVLA 与 WiseAD 等。
- 驾驶专用推理基准:包括 NuPlanQA、LingoQA、Reason2Drive、WOMD-Reasoning、NuScenes-QA 等,用于衡量场景理解、空间推理与可解释决策。
- 显式思维链(CoT)监督:近期研究尝试通过结构化 CoT 或自适应推理增强驾驶模型,如 DriveCoT、Drivelmm-o1、AD²-Bench、CoT-VLA 与 AutoVLA 等。
与上述工作不同,本文并非直接设计新的 CoT 结构或 VLA 架构,而是聚焦于**监督方向(direction of supervision)**的问题:当教师模型在生成推理时已接触真实未来轨迹,轨迹会成为推理的前提而非验证目标。本文通过延迟暴露机制,将未来轨迹从”预推理线索”转化为”后决策验证目标”。
2. 轨迹表示与端到端规划(Trajectory Representations and End-to-End Planning)
该方向关注如何用连续的或离散化的方式表示未来运动,并在端到端框架中实现规划:
- 端到端驾驶策略:基于传感器融合的策略(如 TransFuser)、面向规划的表示(如 UniAD)、稀疏场景抽象(如 VAD、SparseDrive)以及集成预测-规划架构(如 GameFormer、可微分集成运动预测与规划)。
- 生成式规划器:采用扩散模型、流匹配或自回归目标对多模态未来进行建模,如 DiffusionDrive、GenAD、Gen-Drive 与基于流匹配的规划方法。
- 离散化动作与轨迹表示:为使连续控制与语言模型的 token 解码兼容,研究者提出了动作/轨迹 token 化方法,如 FAST、Trajeglish、SMART 以及闭环监督微调(Closed-loop SFT)等。
本文的 AD-MCQ 与上述表示方法存在本质差异:论文利用 K-Means 构建的轨迹原型库(codebook)并非要求 VLM 在自身词汇表内生成轨迹 token,而是将轨迹原型仅用于检索显式的候选轨迹。规划任务被重新建模为在场景特定候选集上的选择问题,从而将轨迹级规划转化为精确可验证的决策,避免了开放式坐标生成的瓶颈。
3. 可验证的后训练与忠实推理(Verifiable Post-Training and Faithful Reasoning)
该方向关注如何通过强化学习或监督微调提升模型推理能力,并确保推理过程的忠实性:
- 后训练方法:包括监督指令微调(SFT)、基于人类反馈的强化学习(RLHF/PPO)、直接偏好优化(DPO)等。
- 基于可验证结果的强化学习:DeepSeek-R1、DeepSeekMath、Qwen3 等工作利用可自动检查的结局奖励(outcome reward)激发推理能力,无需对每一步中间过程进行人工标注。
- 超越精确符号答案的验证:近期研究通过多维评分标准(rubric)扩展可验证奖励的适用范围,如 Rubrics as Rewards、LLM-Rubric、AutoRubric 与 Online Rubrics Elicitation 等。
- 多选题强化学习验证奖励(RLVR):研究表明干扰项(distractor)的构建方式与答案格式会显著影响模型的学习行为与推理策略。
- 推理忠实性与锚定效应:多项研究指出,思维链并不总是对产生答案的证据的忠实描述。提前暴露答案会扭曲后续推理(如 Chain-of-Thought Reasoning in the Wild、Preemptive Answer Attacks),多模态推理模型中亦观察到幻觉放大现象。
本文的 DEFT-RLVR 整合了上述两个分支:一方面采用精确的多选题结局奖励(R(MCQ))实现自动验证;另一方面引入基于实例特定评分标准的过程奖励(R(RUB)),且该过程奖励仅对结局正确的推理轨迹发放,从而抑制通过捷径或猜测获得正确答案的行为。此外,本文通过延迟暴露机制,将未来轨迹从认知心理学中的”锚定信息”转化为验证目标,直接回应了关于推理忠实性与答案提前暴露风险的研究。
Q: 论文如何解决这个问题?
该论文通过将开放式轨迹生成重新建模为可验证的显式候选选择,并配合延迟暴露未来轨迹的两阶段交互与强化学习优化,系统性地解决了轨迹锚定偏差与可验证性缺失的问题。具体方法由以下两个核心组件构成:
1. AD-MCQ:构建可验证的候选轨迹基准
为使轨迹级驾驶决策摆脱开放式几何合成的不可验证性,论文提出 Autonomous-Driving Multiple-Choice Question(AD-MCQ),将规划任务形式化为从显式轨迹候选集中进行精确选择。
1.1 离散轨迹原型库(Codebook)的构建
设固定时域的自车轨迹为 P = (p_1, …, p_T) ∈ R^(T × 2),其中 p_t = (x_t, y_t) 表示相对于当前自车位姿的纵向与横向位移。论文将大量已记录的未来轨迹展平后应用 K-Means 聚类,得到包含 K 个原型的码本:
C = C1, …, C_K, quad C_k = (c(k,1), …, c_(k,T))
任意轨迹 P 通过最近原型赋值完成量化:
z(P) = argmin(k ∈ 1,…,K) ∑(t=1)^(T) |pt - c(k,t)|_2^2
论文选取 K=8192,在 N=489{,}042 条轨迹上聚类,该配置在样本外重建精度与码本利用率之间取得平衡。
1.2 场景特定的候选构造
基于码本中的原型相似度:
d(ij) = (1) / (T)∑(t=1)^(T) |c(i,t) - c(j,t)|2, quad rho(ij) = 1 - d(ij) - d(min)d(max) - d(min)
对每个驾驶场景 i,先将真实轨迹 Pi^(gt) 量化至最近原型 z_i^,随后从一个预定义的相似度区间 rho(min) ≤ rho(z,zi^) ≤ rho_(max) 中采样 M-1 个困难负样本(hard negatives),并与 z_i^* 随机shuffle后构成 M 个选项。解码后得到显式的路点候选集:
Ai := (P(i,m))(m=1)^(M) = {C(zi,m)}(m=1)^(M) ∈ (R^(T × 2))^(M)
由于只有一个选项对应量化后的真实轨迹,其shuffle后的位置 a_i^ ∈ 1,…,M 成为*完全可验证的目标,规避了开放式坐标生成的模糊性。
2. DEFT-RLVR:延迟暴露与结构化过程监督
仅将任务改为多选题仍不足够:若在推理前即暴露候选轨迹,模型可能转而利用选项间的相对比较形成新的推理捷径(candidate-set anchoring)。为此,论文提出 Deferred Exposure of Future Trajectories for RLVR(DEFT-RLVR)。
2.1 DEFT 两阶段交互机制
设场景上下文为 X_i = (V_i, H_i, I_i)(多视角历史帧、自车状态、导航指令),候选轨迹为 A_i,选项标签集为 L_i。
Turn 1:因果决策推理(Candidate-Blind)
仅基于场景上下文,通过候选盲提示 p1 促使模型先进行因果推理并做出高层决策(High-Level Decision, HLD): u(1,i) = p1(X_i), quad y(1,i) sim πθ(· mid u(1,i)) 此时模型完全看不到任何候选轨迹,必须从场景证据中推断驾驶含义,避免轨迹信息在决策前锚定推理方向。Turn 2:显式轨迹落地(Candidate-Grounded Matching)
在模型已做出场景衍生的决策承诺后,才通过提示 p2 揭示候选集 A_i,要求模型将已固定的决策匹配到最接近的显式轨迹实现: u(2,i) = p2(A_i), quad y(2,i) sim πθ(· mid u(1,i), y(1,i), u(2,i))
最终解析选项 ai = parse(y(2,i)) ∈ Li ∪ perp 。 这一设计将未来轨迹从决策前的前提转化为决策后的验证与落地目标,恢复了”先求解后验证”(solve-then-verify)的范式。 2.2 基于 GRPO 的联合优化 尽管 DEFT 在推理时分离了候选暴露时机,论文通过 Group Relative Policy Optimization(GRPO) 将两阶段交互作为一个完整 rollout 进行联合优化。对每个问题 i 采样 G 个两阶段 rollout,序列化为: s(i,j) = u(1,i) oplus y(1,i,j) oplus u(2,i) oplus y(2,i,j) 通过单次前向传播计算 token 似然,并对 prompt token 进行掩码,使策略目标仅作用于 y(1,i,j) 与 y(2,i,j) 中的生成 token。两阶段共享同一个 rollout 奖励 R(i,j) 及其组归一化优势(advantage),确保高层决策推理与轨迹选择被协同优化。 2.3 结构化评分标准奖励(Rubric Rewards) 单纯的结局正确率 R^(MCQ)(i,j) = I[a(i,j) = a_i^] 无法区分”基于场景证据的忠实推理”与”利用捷径或猜测后的合理化”。为此,DEFT-RLVR 引入基于评分标准的过程监督: 1. *离线评分标准生成:对每个场景,使用视觉-语言评分标准生成器 G 在仅输入场景上下文(无真实轨迹、无候选选项)的条件下,离线生成实例特定的评分标准:
C_i = G(p(rub)(Xi)) = (c(i,k), w(i,k))(k=1)^(Ki)
其中每条标准均为带正权重的原子化、可检查准则,显式编码场景证据及其驾驶含义。 2. 在线文本评判:对于结局正确的 rollout,将 Turn-1 的归一化推理轨迹 y(1,i,j) 提交给一个仅接收文本、不接收图像、候选选项或真实轨迹的 VLM 评判器 J,按标准逐一检查:
b(i,j) = J(p(txt)(Ci, y(1,i,j))) ∈ 0,1^(K_i)
- 奖励计算:评分标准奖励为各准则满足情况的加权归一化得分:
R^(RUB)(i,j) = w_i^top b(i,j)|w_i|_1 ∈
0,1
最终 rollout 奖励为结局正确性与推理质量的乘积:
R(i,j) = R^(MCQ)(i,j) · R^(RUB)(i,j)
关键设计在于:真实轨迹 P_i^(gt) 从不直接提供给评分标准生成器、策略模型或评判器。评判器仅依据预定义的标准文本评估推理质量,从而避免视觉 token 对评判注意力的稀释,同时确保过程监督独立于结局信息。 3. 方法总结:为何能有效解决问题 | 原始问题 | DEFT-RLVR 的解决机制 | | —- | —- | | 轨迹锚定偏差 | 通过 DEFT 延迟暴露,强制模型在接触任何未来轨迹前先从场景证据中做出因果决策,消除事后合理化。 | | 开放式轨迹不可验证 | AD-MCQ 将连续轨迹生成转化为离散选项选择,使轨迹级决策可通过选项字母进行精确验证。 | | 推理捷径与幻觉 | 基于实例特定评分标准的过程监督仅对正确结局发放,抑制猜测与捷径行为;文本-only 评判聚焦推理忠实性。 | | 通用能力退化 | RLVR 基于当前策略采样进行细粒度 token 级优化,避免了 SFT 对模型分布的强制偏移,保留甚至提升通用视觉能力。 | 通过上述设计,论文在提升自动驾驶推理与决策能力的同时,实现了对高层因果推理与低层轨迹落地的解耦与协同优化。 Q4: 论文做了哪些实验? 论文围绕 AD-MCQ 与 DEFT-RLVR 开展了一系列受控实验,涵盖自动驾驶(AD)专用推理、通用视觉能力保留、跨域泛化、训练范式对比及机制消融。以下是主要实验内容的系统梳理: 1. 实验设置与基准 1.1 数据与任务构建 - 数据来源:Waymo Open E2E 与内部驾驶语料库,共约 51.4 万场景-轨迹对。 - 数据划分: - Train:5,000 场景,遵循自然分布; - Dev:100 场景,聚焦于因果困难的”长尾”场景(急停、硬刹车、急转弯); - AD-MCQ-500 Test:500 场景,用于最终评估,同样聚焦因果挑战。 - 候选构造:基于 K=8192 的轨迹原型库(codebook),每个问题包含 M=6 个显式轨迹候选(1 个 oracle + 5 个困难负样本)。 1.2 评估指标 - AD 专用指标: - ACC:AD-MCQ-500 的严格选项准确率; - CFS(Normalized Causal-Faithfulness Score):基于 grounding、无幻觉、特异性、因果连贯性四个维度的归一化评分; - HLD(High-Level-Decision Consistency):预测高层决策与真实轨迹诱导动作在方向和速度上的一致性。 - 通用视觉能力:在 12 个基准上评估四类能力——基础视觉感知(Basic Visual)、具身空间推理(Embodied Spatial)、3D/多视角推理(3D/Multi-View)、指代表达空间定位(RefSpatial),并报告宏平均(Avg.)。 - 跨域迁移:在 500 场景的 nuScenes 验证集上测试,使用相同 codebook 与任务接口。 1.3 模型与基线 - 基础模型:Qwen3-VL-8B-Instruct、Qwen3.5-4B。 - 教师/评判模型:Qwen3.5-397B-A17B(提供蒸馏目标与开放指标评判);Qwen3.6-35B-A3B(离线评分标准生成与在线文本评判)。 - 核心对比设置: - JEFT(Joint Exposure of Future Trajectories):候选轨迹与场景从一开始就联合暴露; - DEFT(Deferred Exposure):先场景推理、后暴露候选; - RLVR 变体:R(MCQ)(仅结局奖励)、R(MCQ) R(GEN)(在线共享图像条件评分标准)、R(MCQ) R(RUB)(DEFT-RLVR,离线实例特定评分标准); - 蒸馏变体:JEFT Distillation、DEFT Distillation(仅 Turn-1 计划 / 完整交互 / 混合目标)。 2. 候选轨迹训练提升可泛化的 AD 推理 2.1 DEFT 显著优于候选可见基线 - 训练自由设置:相比 JEFT,DEFT 将 Qwen3-VL-8B 的 ACC 从 28.1% 提升至 56.6%,Qwen3.5-4B 从 34.0% 提升至 65.6%,表明单纯改变推理时的信息顺序即可大幅缓解候选锚定偏差。 - RLVR 训练:在相同结局奖励下,DEFT + RLVR (R(MCQ)) 相比 JEFT + RLVR (R(MCQ)) 分别提升 15.3 与 6.7 个百分点。 - DEFT-RLVR:联合优化两阶段交互并引入评分标准奖励后,在 Qwen3-VL-8B 上达到 77.9% ACC、0.658 CFS 与 0.501 HLD,全面优于无训练的 DEFT。 2.2 蒸馏实验中的交互完整性 - DEFT Distillation (Full Interaction) 在等量数据下将 MCQ 准确率从 JEFT Distillation 的 64.0% 提升至 82.4%,CFS 提升 0.289,HLD 提升 0.111。 - 混合目标(Mixed Targets)进一步将准确率提升至 84.1%,CFS 达 0.934,HLD 达 0.627,证明 Turn-2 的细粒度轨迹判别不仅是提供可验证奖励的机制,其本身也能改善推理质量。 2.3 跨域泛化 在域外 nuScenes 上(表 3): - DEFT-RLVR 将训练自由 DEFT 的 ACC 从 39.6% 提升至 49.5%,CFS 提升 0.114,HLD 提升 0.073; - DEFT Distillation (Mixed Targets) 达到 55.8% ACC,表明学到的场景-决策推理具有跨域迁移性。 3. RLVR 提升 AD 推理且不牺牲通用视觉能力 3.1 蒸馏导致通用能力退化 - JEFT Distillation 使 Qwen3-VL-8B 的通用视觉平均从 54.81% 降至 49.80%; - 等量 DEFT 蒸馏变体也仅能保留 50.98%–51.80%,表明密集的教师模仿会牺牲通用能力。 3.2 冷启动 SFT 的早期衰退 - 以教师标注进行 1-epoch 冷启动 SFT 后,虽然 Dev 准确率上升,但四个通用能力组在第一个 epoch 即全部下降(图 5)。因此 DEFT-RLVR 选择直接从基础 VLM 启动,避免 KL 正则化锚定到已偏移的策略。 3.3 DEFT-RLVR 保持并略增通用能力 - 在 Qwen3-VL-8B 上,DEFT-RLVR 将通用视觉平均从 54.81% 提升至 56.09%; - 在 Qwen3.5-4B 上从 52.56% 提升至 53.24%。 - 论文归因于 RL 基于当前策略采样的细粒度 token 级优化,以及因果推理过程对共享视觉-空间推理能力的锻炼。 4. RLVR 设计的消融实验 4.1 延迟暴露避免捷径驱动优化 - JEFT + RLVR (R(MCQ)) 对比 DEFT + RLVR (R(MCQ)): - 图 6 显示 JEFT 变体的策略漂移(response length、entropy、KL loss)远大于 DEFT 变体,同时准确率最低; - 表 2 显示 DEFT 将准确率从 61.1% 提升至 76.4%(Qwen3-VL-8B),CFS 与 HLD 同步提升。 4.2 评分标准监督修剪无效探索 - DEFT + RLVR (R_(MCQ)) 对比 DEFT-RLVR: - 图 6 显示无评分标准监督时,模型产生更长、更高熵的响应; - 引入评分标准后,响应更短、熵更低,同时 CFS 与 HLD 持续提升,表明评分标准有效抑制了无效探索。 4.3 离线评分标准的高效性 - DEFT-RLVR 对比 DEFT + RLVR (R(MCQ) R(GEN)): - 后者使用在线图像条件共享评分标准,每步耗时 724.4 秒; - DEFT-RLVR 采用离线生成实例特定评分标准 + 在线仅文本评判,每步仅 426.5 秒(快 41.1%),且训练开销相比纯 R(MCQ) 仅增加 0.5%(表 4),同时取得更高推理质量。 5. 为何将 AD 规划建模为候选 MCQ? 5.1 直接轨迹 Token 生成的双重瓶颈 为验证外部化选择优于内部化生成,论文对 Qwen3-VL-8B 进行了直接轨迹 token 预测的 SFT 诊断实验(附录 D.6): - 轨迹精度瓶颈:即使 SFT 开始过拟合,域内/域外预测 ADE 仍远高于 codebook 的 0.279 m 量化下限(图 7a-b),表明主要误差来自 token 推断而非量化。 - 通用能力瓶颈:直接轨迹生成严重退化通用视觉能力(12 项平均从 53.49% 降至接近 0),即便加入 CoT 也仅能延缓衰退(图 7c)。 - 结论:迫使 VLM 在原始词汇表内内化大规模轨迹 token 会严重扰动预训练分布;AD-MCQ 将生成外部化为选择,规避了这两个瓶颈。 5.2 候选集构造的鲁棒性 固定场景与 oracle 轨迹,重新采样不同困难负样本: - 在候选数 M ∈ 2,4,6,8,10 与相似度上界 rho(max) ∈ 0.50, 0.70, 0.85, 0.95 的全部 20 种配置下,DEFT-RLVR 均优于训练自由 DEFT(图 8、表 11)。 - 结果表明所学能力迁移至新的候选构造,而非依赖特定干扰项几何形状。 6. 人类验证与辅助分析 6.1 自动评判的人类一致性验证 - 在 200 个随机样本上,自动 CFS 评判与人类标注的 Spearman rho = 0.78,平均绝对误差 0.067,88.5% 落在 0.125 容差内;HLD 的精确一致率为 92.0%,Cohen’s kappa = 0.84(附录 E、表 12)。 6.2 轨迹原型库的规模分析 - 在 N 与 K 上的系统扫描(附录 C)表明,K=8192、N=489,042 在样本外重建 ADE(0.290 m)与利用率(92.0%)之间达到有利平衡。 6.3 完整案例研究 - 附录 G 提供了红灯停车(图 17)与停车标志让行(图 18)的完整两阶段 rollout 示例,展示模型如何在未见候选前基于场景证据做出因果决策,再将已固定的决策匹配到显式轨迹。 Q5: 有什么可以进一步探索的点? 基于该论文的理论框架与实验发现,以下几个方向值得进一步深入探索: 1. 动态候选轨迹生成与自适应 Codebook 当前 AD-MCQ 依赖静态 K-Means 原型库与预定义相似度区间采样困难负样本。未来可探索: - 场景条件化候选生成:利用扩散模型或流匹配网络,以场景上下文为条件动态生成候选轨迹,而非从固定 codebook 中检索。这可在保持可验证性的同时,覆盖更丰富的长尾运动模式。 - 自适应候选难度:根据策略模型的当前能力在线调整干扰项的相似度上界 rho(max) 与候选数量 M,实现自动化的课程学习(curriculum learning),而非固定参数。 2. 细粒度过程奖励与实时推理验证 DEFT-RLVR 的评分标准(rubric)为离线生成、在线文本评判,本质上仍是回合级(turn-level)的稀疏过程奖励。可进一步研究: - 逐步过程奖励模型(Step-wise PRM):将 Turn-1 的因果推理链拆解为更细粒度的推理步骤(如证据提取→因果推断→速度决策→方向决策),为每一步赋予可验证的中间奖励,从而更精确地定位推理断裂点。 - 基于形式化规则的自动验证:将交通规则、碰撞约束、可达性分析编码为可微或符号化验证器,直接对推理链中的逻辑断言进行自动判定,减少对 VLM-as-a-Judge 的依赖。 3. 从开环选择到闭环控制的无缝衔接 AD-MCQ 将规划转化为离散选择,解决了验证难题,但引入了选择到执行的接口间隙: - 平滑后处理与轨迹优化:选定 codebook 原型后,可通过轻量级优化器(如模型预测控制 MPC 或微分轨迹优化)在原型邻域内精细调整,兼顾选择决策的可验证性与最终执行的连续性。 - 闭环 RLVR:当前评估基于开环场景,未来可在闭环仿真环境中进行 rollout,将碰撞率、舒适度、交通合规性等闭环指标纳入奖励函数,探索 DEFT-RLVR 在闭环策略学习中的稳定性。 4. 多模态感知输入与更复杂的场景推理 当前框架主要依赖前视多摄像头历史帧与 ego 状态。扩展至多模态可显著提升推理上限: - LiDAR 与 HDMap 的语义注入:将点云语义或高精地图信息转化为文本/结构化描述,纳入 Turn-1 的场景上下文,验证 DEFT 机制在更复杂的三维拓扑(如多层立交桥、无保护左转)下的因果推理能力。 - 时序动态场景图:引入显式的交通参与者交互图(如 Graph VQA 形式),测试模型在多智能体交互中的因果归因能力,而非仅基于 ego 视角的像素推理。 5. 长时域规划与层次化决策 论文固定于 5 秒、10 个路点的短期未来。长期自动驾驶需要层次化时间抽象: - 多尺度 DEFT:设计分层的延迟暴露机制,如先进行 5 秒内的即时决策(reactive),再在更高层进行 10–30 秒的路线级规划(strategic),验证锚定偏差是否在更长时域中表现不同。 - 抽象-具体决策链:探索高层意图(如”变道超车”)与底层轨迹之间的延迟暴露是否同样适用于长时域,以及高层决策错误如何向底层传播。 6. 跨域泛化与跨地理迁移的系统化研究 论文仅在 nuScenes 上验证了跨域迁移。更系统的研究可包括: - 极端域外场景:不同国家的交通规则(左舵/右舵)、极端天气(暴雨、雪天)、非结构化道路(施工现场、乡村无标线路段)下的候选集构造与推理忠实性。 - 零样本代码本迁移:当目标域的数据分布与训练域显著偏离时,静态 codebook 的重建误差可能增大。探索域自适应(domain adaptation)或在线 codebook 更新机制。 7. 更大规模基础模型的 Scaling Law 实验主要在 4B 与 8B VLM 上进行。未来需验证: - 模型规模与锚定偏差的关系:更大的教师模型是否对 GT 暴露更敏感(因具备更强的”合理化”能力)?延迟暴露带来的收益是否随模型规模单调递增? - 推理长度与思维深度的权衡:大规模推理模型(如 32B/70B)在 DEFT 框架下是否会产生更长的探索性思维链?评分标准奖励是否需要相应扩展以覆盖更深层的推理模式? 8. 计算效率与实时推理优化 DEFT 的两阶段交互本质上增加了推理延迟(两次模型调用): - 单轮次模拟延迟暴露:通过特殊的 prompt 结构或注意力掩码设计,在单次前向传播中模拟”先决策后接地”的信息流,减少端到端延迟。 - 候选集的高效编码:当前轨迹以稠密路点序列文本形式输入,探索更紧凑的轨迹表示(如参数化曲线系数、傅里叶基)以降低上下文长度与推理成本。 9. 与其他后训练范式的深度融合 - 拒绝采样与 DEFT 的结合:在 RLVR 前引入基于 DEFT 的拒绝采样阶段,仅保留候选盲推理忠实且结局正确的样本进行冷启动,可能加速收敛并进一步降低 KL 散度。 - 多智能体对抗性候选构造:利用对抗性方式生成”迷惑性”候选轨迹,迫使策略模型在 Turn-1 阶段进行更鲁棒的因果推理,而非依赖 Turn-2 的相对比较。 Q6: 总结一下论文的主要内容 该论文围绕自动驾驶视觉-语言模型(AD VLMs)中思维链(CoT)监督的因果忠实性问题展开,核心贡献在于识别了轨迹锚定偏差,并提出了一套可验证的推理与训练框架。以下是主要内容的系统总结: 1. 核心问题:轨迹锚定偏差(Trajectory Anchoring Bias) 现有 Vision-Language-Action(VLA)模型在利用 CoT 增强 VLM 推理时,通常将已记录的真实未来轨迹(logged GT trajectory)提前暴露给教师模型。论文发现,这导致教师模型并非从场景证据中因果推断决策,而是对已知结果进行事后合理化(post-hoc rationalization)。该偏差引发三个严重后果: - 因果忠实性降低:CoT 几何上与 GT 一致,但未忠实反映真正支持动作的场景证据; - 幻觉显著增加:尤其在因果复杂的场景中,模型会捏造不存在的线索(如虚构交通标志); - 推理捷径:未来轨迹从”验证目标”沦为”决策锚点”,破坏了”先求解后验证”(solve-then-verify)范式。 直接隐藏 GT 轨迹虽可消除偏差,但开放式轨迹生成将高层决策与连续几何、低层动力学深度耦合,导致决策难以自动验证。 2. AD-MCQ:可验证的候选轨迹基准 为使轨迹级决策摆脱开放式生成的不可验证性,论文提出 Autonomous-Driving Multiple-Choice Question(AD-MCQ),将规划重新建模为从显式轨迹候选集中进行选择。 - 离散轨迹原型库:对固定时域轨迹 P = (p_1, …, p_T) ∈ R^(T × 2) 应用 K-Means 聚类,构建含 K=8192 个原型的 codebook: z(P) = argmin(k ∈ 1,…,K) ∑(t=1)^(T) |p_t - c(k,t)|2^2 - 场景特定候选构造:将真实轨迹量化至最近原型 z_i^,并从相似度区间 rho(min) ≤ rho(z,zi^) ≤ rho(max) 中采样 M-1=5 个困难负样本,随机 shuffle 后构成 6 路候选集 A_i 。 - 精确可验证性:由于仅有一个选项对应量化后的真实轨迹,其位置 a_i^ ∈ 1,…,M 可通过选项字母进行精确验证,规避了连续坐标生成的模糊性。 3. DEFT-RLVR:延迟暴露与结构化强化学习 若仅将任务改为多选题但在推理前暴露候选,模型仍可能利用选项间相对比较形成新的捷径。为此,论文提出 Deferred Exposure of Future Trajectories for RLVR(DEFT-RLVR)。 3.1 两阶段延迟暴露机制 - Turn 1(因果决策推理):策略模型仅基于场景上下文 X_i = (V_i, H_i, I_i),在*完全看不到候选轨迹的情况下生成高层决策(HLD)与因果推理链: y(1,i) sim πθ(· mid p_1(X_i)) - Turn 2(显式轨迹落地):在模型已做出场景衍生承诺后,才揭示候选集 A_i,要求将固定决策匹配到最接近的显式轨迹实现: y(2,i) sim πθ(· mid u(1,i), y(1,i), u(2,i))
该设计将未来轨迹从决策前锚点转化为决策后验证目标,强制模型从场景证据而非轨迹提示中推导因果链。
3.2 联合优化与过程监督
- GRPO 训练:将两阶段交互作为一个完整 rollout 联合优化,两阶段共享组归一化优势(advantage)。
- 结构化 Rubric 奖励:为防止强化正确猜测或捷径行为,论文引入实例特定的过程监督:
- 离线评分标准生成:基于场景上下文(无 GT、无候选)生成原子化、带权重的评判准则 Ci = (c(i,k), w_(i,k)) ;
在线文本评判:仅对 MCQ 结局正确的 rollout,由无图像、无候选信息的文本评判器检查 Turn-1 推理链满足多少准则:
R^(RUB)(i,j) = w_i^top b(i,j)|w_i|_1 ∈ [0,1]最终奖励:
R(i,j) = R^(MCQ)(i,j) · R^(RUB)_(i,j)
4. 主要实验发现
4.1 自动驾驶推理性能
在 Qwen3-VL-8B-Instruct 与 Qwen3.5-4B 上,DEFT-RLVR 显著优于基线:
| 设置 | ACC ↑ | CFS ↑ | HLD ↑ |
|---|---|---|---|
| Qwen3-VL-8B Base | 28.1 | — | — |
| + DEFT (无训练) | 56.6 | — | — |
| + DEFT-RLVR | 77.9 | 0.658 | 0.501 |
- 相比联合暴露(JEFT),延迟暴露(DEFT)在 RLVR 和蒸馏设置下均大幅提升准确率与因果忠实性;
- 蒸馏实验中,DEFT Distillation (Mixed Targets) 达到 84.1% ACC,证明完整两阶段交互优于仅模仿 Turn-1 计划。
4.2 跨域泛化
在域外 nuScenes 验证集上,DEFT-RLVR 将训练自由 DEFT 的 ACC 从 39.6% 提升至 49.5%,CFS 与 HLD 同步提升,表明所学场景-决策推理具有跨域迁移性。
4.3 通用视觉能力保留
- 监督微调(SFT)导致退化:JEFT Distillation 使通用视觉平均从 54.81% 降至 49.80%;
- DEFT-RLVR 保持甚至提升通用能力:在 Qwen3-VL-8B 上将通用视觉平均提升至 56.09%,且 12 项基准中多数持平或改善。这归因于 RLVR 基于策略采样的细粒度优化,以及因果推理过程对共享视觉-空间能力的锻炼。
4.4 直接轨迹生成的瓶颈诊断
论文对比了直接预测轨迹 token 的方案:即使经过 SFT,预测 ADE 仍远高于 codebook 量化下限(0.279 m),且通用视觉能力急剧退化至接近 0。这验证了将轨迹生成外部化为显式选择的必要性。
5. 核心贡献总结
- 识别并实证验证了轨迹锚定偏差:通过控制实验与人类评估,证明提前暴露 GT 轨迹会降低因果忠实性并加剧幻觉;
- 提出 AD-MCQ:一种可验证的候选轨迹基准,将轨迹级规划转化为精确的多项选择,支持候选盲推理评估与可控难度构造;
- 提出 DEFT-RLVR:通过延迟暴露候选轨迹与基于评分标准的过程监督,在提升自动驾驶因果推理与决策能力的同时,保持了基础模型的通用视觉能力。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Zixuan Huang,Yang Zhou,Kaixuan Wang,Guli Zhang,Hongyan Xie,Yakun Zhu,Hao Geng,Xiaozhi Chen,Yikun Ban,Deqing Wang
PDF URL: https://arxiv.org/pdf/2608.01755.pdf
Arxiv URL: https://arxiv.org/abs/2608.01755
Arxiv ID: 2608.01755
CoolPaper URL: https://papers.cool/arxiv/2608.01755
Published: 2026-08-05T01:02:33.873Z
Updated: 2026-08-05T01:02:33.873Z
9. CADENA: Stepwise CAD Reverse Engineering
Abstract:Computer-Aided Design (CAD) underpins modern engineering, yet converting existing shapes into editable models still demands substantial expert effort. Most AI systems emit the entire CAD program in a single pass, never inspecting the intermediate geometry. In contrast, human engineers build a part feature by feature, checking after each operation what remains to be modeled. We introduce CADENA (Spanish for “chain”), a model that reconstructs a 3D mesh as a parametric CAD program, growing its sequence of operations one at a time and comparing the target with the currently predicted geometry at every step. We also address the lack of benchmarks for evaluating reverse-engineering methods on mechanical parts, introducing CADENA-Bench, a benchmark that measures performance across categories of mechanical parts. CADENA outperforms prior methods on CADENA-Bench and on the DeepCAD, Fusion 360, and MCB datasets. Code is available at this https URL, model weights at this https URL, and CADENA-Bench at this https URL.
中文摘要
摘要:计算机辅助设计(CAD)支撑着现代工程,但将现有形状转换为可编辑模型仍然需要大量专家的努力。大多数人工智能系统会在一次运行中输出完整的CAD程序,从不检查中间几何体。相比之下,人类工程师会按特征逐步构建零件,在每次操作后检查仍需建模的部分。我们提出了CADENA(西班牙语意为“链”),这是一个将三维网格重建为参数化CAD程序的模型,它一次增加一个操作序列,并在每一步将目标与当前预测的几何体进行比较。我们还解决了机械零件逆向工程方法缺乏评估基准的问题,推出了CADENA-Bench,这是一个衡量机械零件不同类别性能的基准。CADENA在CADENA-Bench以及DeepCAD、Fusion 360和MCB数据集上均优于现有方法。代码可在此 https URL 获取,模型权重可在此 https URL 获取,CADENA-Bench 可在此 https URL 获取。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文着力解决将现有三维网格逆向重建为可编辑参数化CAD程序这一核心任务,并围绕以下两个层面展开:
1. 方法层面的问题:单遍生成的固有缺陷
现有基于学习的逆向工程方法大多采用单遍(single-pass)解码,即模型一次性输出完整的CAD程序,且在整个生成过程中从不执行或检视中间几何体。这导致两个关键缺陷:
- 错误静默累积:模型在生成早期操作后便无法修正,后续步骤只能基于已出错的程序文本继续展开,致使偏差不断放大。
- 脱离实际几何:模型的决策仅依赖于已生成的程序token序列的统计规律,而非目标形状与当前重建体之间的真实剩余差异(residual),因此其操作选择服从训练语料的组合先验,而非眼前输入的几何结构。
与之相对,人类工程师采用逐步(step-by-step)方式建模:每执行一个特征操作后,都会检查当前几何与目标零件的差异,再决定下一步如何修改。论文指出,现有AI系统缺乏这种显式几何反馈闭环。
2. 评估层面的问题:基准与指标的失配
论文认为,当前领域缺乏适用于真实机械零件逆向工程的可靠评估体系:
- 数据集偏差:主流测试集(如DeepCAD、Fusion 360)以简单的拉伸-草图(sketch–extrude)形状为主,无法反映真实机械零件(如齿轮、轴套、弹簧等)的复杂度。
- 指标失效:常用的IoU(交并比)和Chamfer距离仅衡量体积或点云的重合度,而非 construction tree(构造树)或表面类型的正确性。一个由错误基元拼装但恰好填满相同空间的模型,会在这些指标上获得高分,却违背了逆向工程“恢复可编辑程序”的本质目标。
总结
论文旨在通过以下方式解决上述问题:
- 提出 CADENA,一种逐步生成的逆向工程模型,它在每一步仅预测下一个CAD操作,立即执行并渲染,再将目标与当前重建体的差异作为视觉反馈输入模型,从而打破单遍生成的错误累积与分布依赖;
- 引入 CADENA-Bench,一个包含3396个真实机械零件、按六个功能族分类的基准;
- 提出 GMS(Generalized Match Score) 指标,通过匹配表面法向与位置来评估程序级重建质量,而非仅评估形状占用。
Q: 有哪些相关研究?
根据论文第2节(Related Work),相关研究可归纳为以下五个主要方向:
1. 生成式CAD建模(Generative CAD Modelling)
这类工作生成的是CAD构造历史(construction history)而非原始几何,但主要面向无条件或文本驱动的合成,而非对给定形状的逆向重建,且大多局限于**草图-拉伸(sketch-and-extrude)**范式。
- 早期序列模型:DeepCAD
Wu et al., 2021
使用Transformer建模草图-拉伸序列,是该领域最常用的训练语料;Fusion 360 Gallery
Willis et al., 2021
提供了人类设计序列及可交互环境;SkexGen
Xu et al., 2022
将拓扑、几何与拉伸解耦到独立码本以实现可控合成。 - 草图建模:SketchGen
Para et al., 2021
、Vitruvion
Seff et al., 2022
、CadVLM
Wu et al., 2024
、SketchDNN
Chereddy and Femiani, 2025
等通过自回归、多模态或扩散模型直接生成带约束的CAD草图。 - 多模态与专用分词:CAD-MLLM
Xu et al., 2024a
统一多模态条件生成;CAD-Tokenizer
Wang et al., 2025
和 HierCAD
Xu et al., 2026
针对CAD基元结构定制tokenization。 - 突破草图-拉伸限制:
- 数据层面:CADFS
Pyatov et al., 2026
采用覆盖15种操作的FeatureScript表示;Zero-to-CAD
Ataei et al., 2026
通过智能体搜索合成百万级可执行序列;CADEvolve
Elistratov et al., 2026
通过程序演化逼近工业复杂度。 - 表示层面:Pointer-CAD
Qi et al., 2026
引入显式B-Rep实体选择以支持倒角、圆角等操作;HistCAD
Dong et al., 2026a
记录使编辑可传播的约束。
2. 重建为非程序表示(Reconstruction into Non-Program Representations)
这类方法将几何重建为结构化但不可执行的表示,与本文“恢复可执行程序”的目标不同。
- 边界表示(B-Rep):ComplexGen
Guo et al., 2022
、Split-and-fit
Liu et al., 2024
通过检测与组装基元恢复B-Rep;后续工作如 SolidGen
Jayaraman et al., 2023
、BrepGen
Xu et al., 2024b
、HoLa
Liu et al., 2025
、AutoBrep
Xu et al., 2025
、BrepGPT
Li et al., 2025
、DualBrep
Liu et al., 2026
等采用自回归或扩散模型直接生成B-Rep。 - 构造实体几何(CSG)与基元装配:Neural shape parsers
Sharma et al., 2022
、UCSG-Net
Kania et al., 2020
、CAPRINet
Yu et al., 2022
、D2CSG
Yu et al., 2023
、SuperFrusta
Ganeshan et al., 2025
等将形状分解为CSG树或基元组合。 - 草图-拉伸子集:Point2Cyl
Uy et al., 2022
、ExtrudeNet
Ren et al., 2022
、SECAD-Net
Li et al., 2023
、zone graphs
Xu et al., 2021
等专注于推断拉伸圆柱或无监督地学习逆草图-拉伸操作。
3. CAD逆向工程(CAD Reverse Engineering)
与本文最直接相关,其核心差异在于生成程序时是否执行并检视中间几何。
- 单遍生成(永不执行):
- CADRecode
Rukhovich et al., 2025
将点云映射为CadQuery程序; - cadrille
Kolodiazhnyi et al., 2025
支持点云、图像、文本输入,并首次将在线RL微调应用于该任务; - CADEvolve
Elistratov et al., 2026
通过演化的训练程序扩展监督规模; - CAD-Coder
Doris et al., 2025
等视觉-语言模型微调后从图像生成CadQuery。 - 直接优化(逐步拟合):CADFit
Nehme et al., 2026
不学习生成器,而是通过优化循环逐步拟合参数化操作,以IoU为目标并基于学习到的草图先验剪枝候选集;其搜索成本随零件复杂度增长。 - 迭代全程序编辑(中间执行):CADReasoner
Kabisov et al., 2026
(本文最接近的先前工作)通过多轮精炼闭环,以输入与当前重建体之间的差异为条件重新生成整个程序。 - 同期逐步工作:SOV-CAD
Feng et al., 2026
同样采用逐步策略,但基于离线强化学习与决策Transformer,且方法细节(投影方式、历史利用、模型规模等)与CADENA存在显著差异。
4. 迭代与逐步生成(Iterative and Stepwise Generation)
这类工作用闭环替代单遍解码,但几乎都以整个程序为交互单元,且反馈多通过语言中介。
- 智能体系统:CAD-Assistant
Mallis et al., 2025
、IterCAD
Hu et al., 2026
、ToolCAD
Gong et al., 2026
、COSMO-Agent
Deng et al., 2026
等将冻结或微调的VLM/LLM作为工具使用者,通过多轮交互与CAD内核或仿真引擎交互。 - 执行作为训练信号:部分工作将几何一致性
Guan et al., 2025, Niu et al., 2025
或编译器反馈
Zhou et al., 2025
作为奖励训练生成模型。 - 编辑现有模型:CAD-Editor
Yuan et al., 2025
、PR-CAD
An et al., 2026
等关注基于文本的CAD编辑。
5. 基准与指标(Benchmarks and Metrics)
- 标准测试集:DeepCAD
Wu et al., 2021
和 Fusion 360
Willis et al., 2021
的测试划分被广泛使用,但均以草图-拉伸零件为主。 - 真实机械零件语料:MCB
Kim et al., 2020
、TMCAD
Zou and Zhu, 2025
、CADNet
Colligan et al., 2022
等虽收集了大量真实零件,但最初用于分类、检索或加工特征识别,且包含大量简单基元与近似重复件。 - 指标改进:现有IoU和Chamfer距离仅衡量形状重合,无法区分“正确程序”与“错误基元拼凑的相似形状”。近期工作尝试改进:
- IterCAD
Hu et al., 2026
提出容忍度-召回曲线; - HistCAD
Dong et al., 2026a
衡量编辑是否保持设计意图; - CAD-MLLM
Xu et al., 2024a
增加拓扑质量指标; - 文本驱动评估方向:CADTests
Mallis et al., 2026
、Text2CAD-Bench
Wang et al., 2026
、MUSE
Dong et al., 2026b
、BenchCAD
Zhang et al., 2026
等提出可执行测试、难度分层提示与可制造性评分等。
Q: 论文如何解决这个问题?
论文通过方法架构、训练范式与评估体系三个层面的创新解决上述问题,核心在于将“单遍程序生成”转变为“带显式几何反馈的逐步决策”。
1. 核心思想:逐步闭环重建
现有方法一次性输出完整程序且从不执行中间步骤。与之相反,CADENA将重建建模为一个序列决策过程:在每一步,模型仅预测一个CAD操作,立即执行该操作以更新当前几何体,再将目标网格与新建几何体的差异渲染为图像,作为下一步的输入。这一闭环使得:
- 每个操作都基于当前实际几何状态与目标之间的**残差(residual)**做出决策,而非基于已生成的程序文本的统计先验;
- 早期错误可被后续步骤直接感知并修正,避免静默累积;
- 由于目标网格在推理时即是输入,每一步都可与目标进行真实几何比对。
2. 观察表示:残差几何的可视化编码
为了让模型“看见”当前重建与目标的差异,论文设计了一种专用的多视图图像表示 R(M, S_t):
- 渲染方式:将目标网格 M 和当前预测体 S_t 在同一坐标系下从8个视角渲染(6个轴对齐正交投影 + 2个等轴测视图),分辨率为 504 × 1008。
- 颜色编码:
- 绿色通道:目标网格 M;
- 红色通道:当前预测 S_t;
- 黄色:两者投影重叠区域(深度差异通过明暗度编码)。
- 几何可读性:纯绿区域表示缺失几何,纯红区域表示多余材料,使模型可直接从像素层面读取下一步应“添加”或“切除”的位置。
此外,模型接收一个提示点(hint point)——一个三维坐标文本,用于在多个不连通差异区域存在时,明确指定下一步应修改的区域。该点在训练时从新增几何与已有几何的交界处采样,在推理时通过最近邻图与贪心行走自动定位。
3. DSL 设计:单变量延续式语法
为了让“任意前缀 + 下一步操作”始终构成合法程序,论文采用基于 CadQuery 的专用领域语言(DSL),其核心约束是单变量延续:
r = extrude(r, point, plane, “sketch(…)”, h)
- 每个操作都消费单一变量 r 并重新绑定给 r;
- 除
gear(作为首操作)和边操作(fillet/chamfer的 selector chain)外,不存在对前面代码中特定变量名的引用; - 坐标为绝对整数,归一化至
-100, 100
。
这意味着策略 π 的决策完全依赖于几何观察 R(M, S_t),而非程序文本历史 P_t,从而实现了“条件作用于几何而非代码”。
4. 训练:监督微调与在线强化学习结合
4.1 监督微调(SFT)
训练数据来自一个规则化过程生成器,该生成器在采样有效CAD程序的同时,自然输出逐步监督信号:
- 将程序在任意步骤截断,执行前缀得到中间状态 S_t;
- 以 (R(M, St), hint, o(t+1)) 为训练样本,即“给定当前残差图像和提示点,预测下一步操作”。
训练分两阶段:
- Warm-up:186万样本来自不超过2步的短程序,学习DSL与基础几何-代码对应关系;
- Main:1800万样本来自至多12步的程序,按深度(2, 4, 6, 8, 10, 12步)混合,确保模型见过各种累积历史状态。
使用 Qwen2-VL 作为骨干,通过教师强制(teacher forcing)进行下一个操作预测。
4.2 在线强化学习(RL)
SFT 之后,模型通过在线策略梯度(GRPO)进一步微调,奖励直接来自执行后的几何:
- 奖励函数:当前构建实体与目标网格的体积 IoU。若程序执行失败(如语法错误或内核崩溃),奖励为 0。这直接将“可执行性”纳入优化目标,而非事后过滤。
- 轨迹构建:对每批16个目标网格,当前策略先通过贪心解码生成参考轨迹(至多10步)。然后对每个前缀状态,采样32个候选续接操作并执行评分。
- 优势估计:按组内奖励标准化计算优势,保留每组中绝对优势最大的两个候选(无论正负)进行梯度更新。
- 无 KL 惩罚:实验发现添加 KL 惩罚在完整测试集上未带来一致增益,故最终模型 β = 0。
5. 推理:前缀选择与预算外推
推理时采用贪心解码,每步预测一个操作,预算为20步(尽管RL训练仅在10步轨迹上进行,模型展现出对更长视野的外推能力)。
关键设计在于返回策略:
- 由于每一步前缀都是可执行的,推理过程产生一条操作链及其对应的中固体序列;
- 最终返回的是使IoU最高的前缀,而非最后一步。
这使得模型具有**优雅退化(graceful degradation)**特性:若后续操作损害了重建质量,系统会自动选择更早的、更优的中间结果,而不会因继续生成而变得更差。
6. 评估体系创新
针对真实机械零件评估缺失的问题,论文同步提出:
- CADENA-Bench:从 MCB、TMCAD、CADNet 三个真实机械语料库中,经过去重、去简单基元、去装配体后,保留3396个独特零件,并按功能分为6个家族(轴套、齿轮轴承、壳体框架、板杆、弹簧紧固件、工装量具),按家族分别报告性能。
- GMS(Generalized Match Score):一种表面匹配指标。通过采样点云,同时匹配位置与法向一致性(而非仅体积占用),要求“圆柱必须被圆柱匹配,而非被填塞同体积的多棱柱匹配”。其定义为:
Rec(τ, α) = |A ∩(τ,α) B||A|, quad Prec(τ, α) = |B ∩(τ,α) A||B|
g(τ, α) = 2 ( Rec(τ, α)^(-1) + Prec(τ, α)^(-1) )^(-1)
GMS = (100) / (α(max)) ∫_0^(α(max)) g(τ, α) , dα, quad α_(max) = 25^(circ)
该指标对非水密几何同样有效,且对表面类型敏感,从而真正衡量“程序级”重建质量。
总结
论文的解决方案可概括为:
| 问题根源 | CADENA 的解决方式 |
|---|---|
| 单遍生成、不检查中间几何 | 逐步闭环:每步执行并渲染,基于残差图像决策 |
| 条件依赖于程序文本历史 | 单变量 DSL + 视觉观察:使决策仅依赖几何状态 |
| 缺乏真实机械零件基准 | CADENA-Bench:3396个去重真实零件,按家族报告 |
| IoU/Chamfer 无法区分正确程序 | GMS 指标:联合匹配位置与法向,评估表面类型一致性 |
| 训练分布与复杂零件不匹配 | 在线 RL + 几何奖励:以执行 IoU 为信号,直接优化可执行重建精度 |
Q: 论文做了哪些实验?
论文的实验围绕外部基准测试、提出的新基准 CADENA-Bench、** BenchCAD 排行榜以及消融与诊断分析**展开,具体包括以下内容:
1. 主要基准与对比方法
1.1 评估数据集
DeepCAD
Wu et al., 2021Fusion 360
Willis et al., 2021MCB
Kim et al., 2020CADENA-Bench(本文新提出,3396 个真实机械零件,分 6 个家族)
- BenchCAD
Zhang et al., 2026
(用于与前沿大模型对比)
1.2 对比基线
CAD-Recode
Rukhovich et al., 2025cadrille
Kolodiazhnyi et al., 2025CADReasoner
Kabisov et al., 2026CADEvolve
Elistratov et al., 2026CADFit
Nehme et al., 2026
(直接优化而非学习型生成器)
另有若干近期系统(如 SOV-CAD、CADFS、Zero-to-CAD、HistCAD、IterCAD)因权重/代码/协议不兼容而未纳入主表对比(详见 Appendix A.6)。
2. 核心定量实验
2.1 外部基准上的逆向工程(Table 1)
在 DeepCAD、Fusion360、MCB 上报告:
- CD(Chamfer Distance,中位数,8k / 30k 采样点)
- IoU(均值,%)
- GMS(均值,%)
- IR(Invalid Rate,无效率,%)
关键发现:
- 在 DeepCAD 上各方法差距极小(接近饱和);
- 迁移到真实机械零件(MCB)时,所有学习型方法性能大幅下降,而 CADENA-RL 的领先优势从 1.7 GMS(DeepCAD)扩大到 12.2 GMS(CADENA-Bench);
- CADENA-RL 在三个外部数据集上均达到最佳报告结果,且无效率极低(0.3%–1.2%)。
2.2 CADENA-Bench 的按家族评估(Table 2)
将 3396 个零件按六个家族(Shafts & bushings、Gears & bearings、Housings & frames、Flat & levers、Springs & fasteners、Tooling & gauges)分别报告 GMS。
关键发现:
- Gears & bearings 与 Springs & fasteners 是所有学习型方法的最弱家族;
- CADENA-RL 在 6 个家族中的 5 个领先;仅在 Gears & bearings 上略逊于 CADFit(58.1 vs 61.3);
- 在 Springs & fasteners 上优势最大(63.4 vs 基线最佳 47.9)。
2.3 与前沿大模型在 BenchCAD 上的对比(Table 3)
使用 BenchCAD 的 Vision2Code 协议,报告 Voxel IoU 与 IR。
对比对象包括:
- 前沿 VLM:GPT-5.6(Sol/Luna/Terra/thinking)、Claude Opus 5 / Mythos 5、Gemini 3.1 Pro、Claude Opus 4.7
- 专用模型:qwen3-2b-rl-iid、CADEvolve
结果:CADENA-RL 达到 0.910 Voxel IoU / 0.9% IR,显著高于所有列表中的其他系统(注:输入条件不完全对等,CADENA 使用网格而非单张图像,且支持测试时前缀选择)。
2.4 贪心解码 vs. 采样解码(Table 4)
对比同一检查点在两种解码策略下的表现:
- Greedy:每步 1 个候选;
- Sampling(T=1.0, E=12):每步采样 12 个候选,保留执行后 IoU 最高者。
结果:采样解码在所有数据集上均不差于贪心解码,且对 SFT 模型在 MCB 上的提升尤为显著(GMS 从 63.3 提升至 70.0,IR 从 12.04% 降至 0.36%)。
3. 训练与推理消融实验
3.1 RL 奖励函数变体(Appendix A.3)
在 1000 例子集上对比了以下奖励配置:
- IoU(体积交并比)——主文报告配置
- MPR(Mean Precision/Recall,对称权重 0.5/0.5 与偏精度 0.9/0.1)
- IoU + KL(增加 KL 惩罚)
- GMS(将评估指标直接作为奖励)
发现:
- IoU 与 MPR 均优于 SFT 基线;
- 在完整测试集上,IoU + KL 相对 IoU 的优势落入噪声水平,故主模型未使用 KL 项;
- GMS 作为奖励虽提升 GMS 指标,但导致 IoU 与 CD 恶化,尤其在 MCB 上 CD 中位数翻倍,因此 GMS 仅用于评估而非训练。
3.2 推理时消融(Appendix A.4)
通过重放 CADENA-RL 的逐步记录,分析以下问题:
| 实验 | 内容 | 结论 |
|---|---|---|
| 操作预算 k(Figure 4a) | 将预算限制为 k 步,返回最佳前缀;k=1 等价于单遍模型 | k=2 即可带来显著增益;k ≈ 8 后趋于饱和;预算 20 并非精细调参结果 |
| 增益来源(Figure 4b / Table 10) | 按第一步质量分四分位,观察各档从 k=1 到 k=20 的 GMS 增益 | 增益几乎完全集中在最难的四分之一(DeepCAD Q1 +21.3,MCB Q1 +14.2);易例无增益 |
| 单例救援(Figure 4c) | 逐零件对比第一步与最终选中前缀的 IoU | 约 15% 零件 IoU 提升 ≥ 0.10;少数零件从近乎失败(IoU<0.3)被救回至 0.7 以上 |
| 前缀选择规则 | 对比“最佳前缀” vs “最后一步” vs “按 GMS 选择” | 最佳前缀仅比最后一步提升约 +0.3 GMS;按 GMS 选择增益极小,确认 IoU 选择已足够 |
| 操作分布分析(Table 11) | 对比训练语料与推理输出的操作类型分布 | 模型首操作分布随输入几何剧烈变化(DeepCAD 首步 80.1% extrude,MCB 首步 73.2% revolve),证明决策服从几何而非语料先验 |
4. 完整按家族评估(Appendix A.5)
在 CADENA-Bench 上补充了按六个家族的完整指标(CD8k、CD30k、IoU、GMS、IR),见 Table 12–14。这验证了:
- CADENA-RL 几乎在所有家族的 CD、IoU、GMS 上最优;
- 其低 IR 并非源于仅在易例上求平均,而是在各家族均保持高可靠度。
5. 失败模式分析(Appendix A.7)
通过定性案例(Figure 5)归纳了四种典型失败:
- 可数特征近似化:齿轮、花键轴等零件的齿数被近似而非精确计数;
- 遮挡几何不可见:内部型腔、盲孔、底切在 8 视图渲染中不可见,导致模型收敛到外部匹配的实体;
- 词汇外特征:自由曲面、非圆螺旋、拔模斜度等超出 DSL 表达范围,被近似为拉伸堆叠;
- 早期坐标系错误未恢复:首步若选错平面/原点,后续步骤只能局部修补,无法回退纠正。
6. 实验协议说明
论文强调了两项刻意的协议选择(使评估更严格):
- 固定坐标系评估:不对每个预测单独做边界框归一化,绝对尺度与位置误差会计入指标;
- 定义域内平均:每个指标仅在其有定义的样本上平均(如 IoU 仅对水密ground truth计算),无效预测单独计入 IR,避免用替代值填充混淆结果。
Q: 有什么可以进一步探索的点?
基于论文的局限性与方法边界,可从以下方向展开进一步探索:
1. 生成式与优化式方法的融合
论文发现 CADENA 在齿轮与轴承族上的 GMS(58.1)略逊于直接几何优化的 CADFit(61.3),原因在于后者不依赖训练分布对旋转对称/模式化零件的覆盖。一个直接的探索点是混合范式:以 CADENA 的逐步生成为初始解,对关键参数(如齿数、螺距、倒角半径)施加基于 CAD 内核的局部数值优化,或在每一步生成后以可微分渲染/可微分 CAD 的方式微调操作参数。这有望保留程序可解释性的同时,提升对精密机械特征的拟合精度。
2. 引入“撤销”与程序编辑机制
当前 CADENA 仅支持**追加(append)**操作:若早期步骤选错了工作平面或原点,后续步骤只能通过在错误框架上堆叠新材料进行局部修补,而无法回退或替换历史节点。探索方向包括:
- 允许策略预测 edit / delete / replace 操作,将构造历史建模为可编辑的抽象语法树(AST)而非线性链;
- 借鉴 CADReasoner 的整轮重写能力,但在 CADENA 的残差反馈框架下实现“局部程序重写”而非全序列重生成;
- 利用指针机制(如 Pointer-CAD
Qi et al., 2026
)显式选择 B-Rep 面/边进行特征抑制或重排序。
3. 处理遮挡几何与内部特征
现有观察函数 R(M, S_t) 基于 8 视图渲染,对内部腔体、盲孔、底切等不可见几何天然失明。论文明确提到这是引入点云模态的动机。进一步可研究:
- 多模态残差编码:将目标网格的内外部点云与当前预测做点云配准差异编码,与渲染图像共同输入 VLM;
- 可查询的几何注意力:允许模型在推理时主动请求特定截面视图或内部切片(类似视觉问答中的“glimpse”机制),而非被动接受固定视角;
- 隐式场残差:用神经隐式表示(如 Occupancy/SDF)编码“目标有而当前预测无”的体素区域,解决正交投影的遮挡歧义。
4. 可数特征的精确重建
齿轮齿、弹簧圈、散热鳍片等可数重复特征是 CADENA 的典型失败模式:残差图像对“少一个齿”与“正确齿数”几乎不敏感,导致策略倾向于近似而非计数。探索方向包括:
- 离散计数token:在 DSL 中引入显式的
pattern(count=...)或array(n=...)结构,使计数成为可直接监督/奖励的离散决策; - 循环一致性与对称检测:在渲染前对目标网格检测旋转/平移对称群,将检测到的阶数(order)作为提示(hint)注入策略;
- 组合测试时计算:对每个候选齿数生成完整零件并比较,利用论文已验证的“采样解码提升显著”这一结论,在计数维度上进行小范围搜索。
5. 工业 CAD 软件的原生兼容与迁移
CADENA 输出 CadQuery 代码,而论文指出 CadQuery 的构造树在极端情况下与 SolidWorks、NX、CATIA 等工业软件的历史树存在语义鸿沟。可探索:
- 跨平台 DSL:直接生成工业软件的原生 API 脚本(如 SolidWorks VBA、Fusion 360 Python API、Onshape FeatureScript);
- 约束感知的历史树:类似 HistCAD
Dong et al., 2026a
,在逆向工程的同时恢复参数间的尺寸约束与拓扑约束,使导出模型在工业 CAD 中具备真正的参数可编辑性; - STEP 语义保留:确保导出的 STEP 文件不仅包含正确几何,还保留特征识别的元数据(如圆柱面→孔特征、倒角边→chamfer 特征)。
6. 训练规模与强化学习的扩展
当前在线 RL 仅在 sim4k 个目标网格上训练(5,000 batches × 16),且 rollouts 受限于 10 步预算(32 分支)以控制计算成本。进一步可研究:
- 大规模离线+在线混合:先在大规模合成数据上做离线行为克隆,再针对真实机械零件(如完整的 MCB、CADENA-Bench)进行在线微调;
- 分层 RL:将高层策略(选择特征类型:孔、凸台、倒角)与低层策略(确定草图平面与尺寸)解耦,降低长程 credit assignment 难度;
- 模型基础规划(Model-based Planning):学习一个前向几何预测模型,以在内部模拟操作效果,减少实际调用 OpenCASCADE 执行的次数,从而支持更长的推理链与更宽的候选搜索。
7. 单遍模型与逐步策略的严格解耦
论文承认尚未报告一个仅由本文合成语料训练的单遍基线,因此 CADENA 的增益部分来自训练数据分布,部分来自逐步反馈。未来可训练一个同规模、同语料的单遍 Transformer(条件于 8 视图直接输出完整程序),以严格量化“逐步闭环”本身带来的边际收益。此外,可探索蒸馏策略:将 CADENA 的逐步教师模型蒸馏为单遍学生模型,在推理速度与精度之间做权衡。
8. 测试时计算(Test-Time Compute)的深度利用
Table 4 显示,每步采样 E=12 个候选并选取最优可显著提升质量(尤其在 MCB 上)。这暗示了测试时搜索的巨大潜力:
- 束搜索(Beam Search):维护多个具有不同提示点(hint points)的分支,利用文中提到的“不同连通差异区域可初始化不同 beam”的机制;
- 蒙特卡洛树搜索(MCTS):以 IoU 或 GMS 作为节点价值,结合策略网络的先验概率进行非对称树搜索;
- 自适应预算:根据当前残差的熵或体积自动决定继续生成或提前停止,而非固定 20 步上限。
9. 评估基准与指标的细化
CADENA-Bench 按 6 个粗粒度家族报告结果,但标签与真实功能类别仅有 70% 的人工一致率。可进一步:
- 难度分层:在 CADENA-Bench 上引入操作步数、基元数量、对称阶数等客观难度指标,绘制难度-准确率曲线;
- 可制造性评估:引入 MUSE
Dong et al., 2026b
等可制造性、功能性、装配性指标,检验逆向生成的程序是否对应可实际加工的零件; - 编辑传播测试:类似于 HistCAD 的 benchmark,测量对恢复出的程序修改一个参数后,几何是否按设计意图正确传播(如修改孔径不影响整体定位)。
10. 更丰富的几何操作词汇
当前 DSL 仍无法表达自由曲面放样(freeform loft)、变半径倒角、拔模(draft)、螺纹(除弹簧外)等特征。扩展词汇并验证其可学习性,是向工业级复杂零件逆向工程迈进的必要步骤。同时,可探索从草图约束层面逆向:不仅恢复“有一个圆孔”,还恢复“该圆孔与某边同心/等距/相切”的草图约束关系。
Q: 总结一下论文的主要内容
本文介绍了一种名为 CADENA 的逐步式计算机辅助设计(CAD)逆向工程模型,以及配套的基准数据集 CADENA-Bench 和评估指标 GMS。以下是对论文主要内容的系统总结。
1. 研究背景与核心问题
现代机械工程依赖可编辑的参数化 CAD 模型,但大量现有三维资产仅以网格形式存在(如扫描件、遗留档案),无法直接修改。现有基于学习的逆向工程方法大多采用单遍(single-pass)生成:模型一次性输出完整程序,从不执行或检视中间几何,导致两类缺陷:
- 错误静默累积:早期操作失误无法被后续步骤感知和修正;
- 脱离目标几何:决策仅依赖已生成程序文本的统计规律,而非当前重建体与目标形状之间的真实差异。
此外,领域缺乏针对真实机械零件的可靠评估基准与指标:主流测试集(DeepCAD、Fusion 360)以简单草图-拉伸体为主,而常用指标(IoU、Chamfer 距离)仅衡量体积重合,无法区分“正确程序”与“错误基元拼凑的相似形状”。
2. CADENA 方法
论文将逆向工程建模为序列决策问题。给定目标网格 M,策略 π 在第 t 步观察目标与当前重建体 St = exec(P_t) 的差异,输出下一个操作 o(t+1):
o_(t+1) sim π(· mid R(M, S_t))
其核心创新在于显式几何反馈闭环,具体包括:
2.1 残差视觉观察 R(M, S_t)
- 将目标网格 M(绿色通道)与当前预测 S_t(红色通道)在统一坐标系下从 8 个视角(6 个轴对齐正交投影 + 2 个等轴测视图)渲染为单张图像;
- 颜色语义:纯绿表示缺失几何,纯红表示多余材料,黄色表示重叠区域,深度差异通过明暗度编码;
- 配合一个 3D 提示点(hint point),用于在多个不连通差异区域中指定下一步修改位置。
2.2 单变量延续式 DSL
采用基于 CadQuery 的领域专用语言,强制每步操作消费单一变量 r 并重新绑定给 r:
r = extrude(r, point, plane, “sketch(…)”, h)
由于不存在对前面代码中特定变量名的交叉引用,下一步操作仅依赖于几何观察,而非程序文本历史。
2.3 训练范式
- 监督微调(SFT):使用规则化过程生成器产生 186 万(短程序,≤2 步)和 1800 万(长程序,≤12 步)单步训练样本,每样本包含 (残差图像, 提示点, 下一步操作)。骨干网络为 Qwen2-VL。
- 在线强化学习(RL):在 \sim4k 个训练网格上执行 GRPO(Group Relative Policy Optimization)。每步从当前策略生成的参考轨迹分支采样 32 个候选续接,执行后以体积 IoU 作为奖励;执行失败的候选奖励为 0,从而将可执行性直接纳入优化目标。
2.4 推理与前缀选择
推理时贪心解码,预算 20 步。由于每一步前缀均可执行,系统保留所有中间状态,最终返回使 IoU 最高的前缀而非最后一步。这赋予模型优雅退化能力:后续若产生破坏性操作,系统可自动回退到更优的中间结果。
3. 评估体系创新
3.1 CADENA-Bench
从 MCB、TMCAD、CADNet 三个真实机械语料库中经过去重、去简单基元、去装配体处理,保留 3396 个独特零件,并分为六个功能家族:
- 轴套类(Shafts & bushings)
- 齿轮轴承类(Gears & bearings)
- 壳体框架类(Housings & frames)
- 板杆类(Flat & levers)
- 弹簧紧固件类(Springs & fasteners)
- 工装量具类(Tooling & gauges)
3.2 GMS 指标
提出 Generalized Match Score(GMS),通过采样点云联合匹配位置与法向一致性:
GMS = (100) / (α(max)) ∫_0^(α(max)) g(τ, α) , dα, quad α_(max) = 25^(circ)
其中 g(τ, α) 为给定距离容差 τ 和角度容差 α 下的 F1 风格调和均值。该指标要求“圆柱必须被圆柱匹配”,对开放/非水密几何同样有效,更能反映程序级重建质量。
4. 实验结果
4.1 外部基准(DeepCAD / Fusion360 / MCB)
- 在 DeepCAD 上各方法接近饱和,CADENA-RL 仍达到 97.0% GMS / 0.3% IR;
- 在真实机械零件 MCB 上,基线方法 GMS 普遍跌至 48–58%,而 CADENA-RL 达到 73.7% GMS / 0.7% IR,领先优势显著扩大;
- CADENA-RL 在所有三个外部数据集上均报告最佳性能。
4.2 CADENA-Bench 按家族评估
- CADENA-RL 在 6 个家族中的 5 个领先,总体 67.0% GMS;
- 齿轮轴承类(Gears & bearings)是唯一例外(58.1 vs CADFit 的 61.3),因直接优化法不依赖训练分布对旋转对称零件的覆盖;
- 在弹簧紧固件类(Springs & fasteners)和轴套类(Shafts & bushings)上优势最大(分别领先基线约 15.5 和 13.4 GMS)。
4.3 BenchCAD 排行榜
在 BenchCAD 的 Vision2Code 评测中,CADENA-RL 达到 0.910 Voxel IoU / 0.9% IR,显著高于 GPT-5.6、Claude Opus 5 等前沿视觉-语言模型及现有专用模型。
4.4 关键消融
- 逐步增益主要来自最难样本:将样本按第一步质量分四分位,最难四分位(Q1)在 DeepCAD 上增益 +21.3 GMS,最易四分位几乎无增益;
- 采样解码优于贪心:每步采样 12 个候选并选最优,在 MCB 上将 SFT 模型 GMS 从 63.3 提升至 70.0,IR 从 12.04% 降至 0.36%。
5. 主要贡献
- CADENA:首个在每一步均执行并检视几何、以残差视觉反馈为条件的逐步 CAD 逆向工程模型,结合 SFT 与在线 RL,在所有五个评估数据集上达到最佳报告结果;
- CADENA-Bench:首个面向真实机械零件逆向工程的大规模去重基准,按家族报告性能以揭示方法的适用域;
- GMS:一种基于表面类型匹配的评估指标,对开放几何有效,弥补现有体积/点云指标的不足。
6. 局限性与讨论
- 词汇外与遮挡几何:8 视图无法感知内部腔体与底切;自由曲面、非圆螺旋等特征超出 DSL 表达能力;
- 可数特征:齿轮齿数等可数重复特征易被近似而非精确恢复,因残差信号对“少一个齿”不敏感;
- 不可逆的早期错误:若首步选定错误平面或原点,后续只能通过堆叠新材料局部修补,无法回退;
- 工业兼容性:输出为 CadQuery 代码,向 SolidWorks、CATIA 等工业软件的转换可能存在语义鸿沟。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Soslan Kabisov,Gennadiy Savrasov,Maksim Elistratov,Antonio Rodriguez,Daniil Ignatiev,Nikita Gavrilov,Rustam Uzdenov,Alexey I. Boyko,Igor Pasechnik,Anton Konushin,Andrey Kuznetsov,Dmitrii Zhemchuzhnikov
PDF URL: https://arxiv.org/pdf/2608.00799.pdf
Arxiv URL: https://arxiv.org/abs/2608.00799
Arxiv ID: 2608.00799
CoolPaper URL: https://papers.cool/arxiv/2608.00799
Published: 2026-08-05T01:02:41.886Z
Updated: 2026-08-05T01:02:41.886Z
10. SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation
Abstract:Agent skills have become an important mechanism for equipping language-model agents with reusable procedural knowledge. However, providing skills alone does not guarantee that current models can effectively identify, apply, and coordinate them. To improve skill-use capabilities, we introduce SKT, a verified data synthesis pipeline that constructs skill-grounded tasks and executable trajectories from large collections of agent skills. SKT selects suitable single-skill and multi-skill configurations, synthesizes tasks through rule-based and agent-based verification with feedback-guided repair, and retains only successful trajectories that substantially use every required skill. Using 2,000 public skills, SKT produces 4,000 task packages and 27,164 verified trajectories. Based on the same pipeline and a disjoint test pool, we further construct SkillEval, a held-out executable benchmark for evaluating skill use. Experiments across diverse models, benchmarks, and agent harnesses show that supervised fine-tuning on SKT-generated trajectories consistently improves skill-use performance. Verification ablations, cross-harness evaluation, and scaling experiments further demonstrate that these gains depend on high-quality supervision, extend beyond a single agent interface, and increase with broader skill coverage. Together, these results establish verified data synthesis as an effective and scalable approach for skill-use training.
中文摘要
摘要:代理技能已成为为语言模型代理配备可重复使用的程序化知识的重要机制。然而,仅提供技能并不能保证当前模型能够有效地识别、应用和协调这些技能。为了提升技能使用能力,我们引入了SKT,一种经过验证的数据合成流程,可以从大量代理技能集合中构建基于技能的任务和可执行轨迹。SKT选择合适的单技能和多技能配置,通过基于规则和基于代理的验证以及反馈引导修复来合成任务,并仅保留充分使用每个必需技能的成功轨迹。使用2000个公开技能,SKT生成了4000个任务包和27,164条经过验证的轨迹。基于相同流程和不重叠的测试池,我们进一步构建了SkillEval,一个用于评估技能使用的保留可执行基准。跨不同模型、基准和代理接口的实验表明,在SKT生成的轨迹上进行监督微调可以持续提升技能使用性能。验证消融实验、跨接口评估和规模化实验进一步证明,这些提升依赖于高质量的监督,不仅限于单一代理接口,并随着技能覆盖面的扩大而增加。综合来看,这些结果确立了经过验证的数据合成为技能使用训练提供了一种有效且可扩展的方法。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文旨在解决大语言模型(LLM)智能体难以有效利用外部 Agent Skills 的问题。
尽管 Agent Skills(封装了领域知识、程序工作流和辅助工具的可重用技能包)已成为扩展模型能力的重要机制,但现有研究表明,仅仅向模型提供技能并不足以保证其能够可靠地识别、应用和协调这些技能来完成复杂任务。具体而言,论文指出当前面临的核心挑战包括:
- 识别困难:模型难以判断在何时、何种场景下应该调用特定技能;
- 理解困难:模型难以充分理解技能的操作约束和执行流程;
- 协调困难:模型难以将多个互补技能组合成连贯的工作流;
- 执行困难:模型难以严格遵循技能指令并正确调用关联工具。
现有工作多聚焦于技能检索、将技能内化到模型参数中,或利用技能进行自我改进,但并未充分解决模型如何有效理解、协调和运用外部技能以解决多样化任务的问题。
为此,论文提出了 SKT(Skill-use Training),一个基于验证的合成数据生成框架,通过构建可验证的、复杂度可控的、基于技能的任务及执行轨迹,来系统性地提升 LLM 智能体的技能使用能力。
Q: 有哪些相关研究?
根据论文第2节,相关研究可归纳为以下五个方向:
1. 学习与进化外部技能(Learning and evolving external skills) 该方向将技能视为与智能体共同演化的持久化、可编辑记忆:
- SAGE:在连续 rollout 中积累可执行技能,并对技能的创建与重用给予奖励。
- SkillRL:将成功演示与失败教训蒸馏为分层 SkillBank,并在策略学习过程中根据验证失败更新技能库。
- Skill1:通过共享结果信号训练统一策略,以同时完成技能选择、使用和蒸馏。
- Skill-R1:冻结任务模型,转而训练轻量级编辑器,在多轮验证器评分的生成过程中修订文本化技能。
2. 技能内化(Skill internalization) 该方向将外部技能作为临时训练脚手架,逐步降低对外部技能文档的依赖:
- SKILL0:依据技能在策略上的实际帮助程度,渐进式地撤回技能。
- SkillC:利用“有技能”与“无技能”的配对 rollout,构建直接的对比信用分配信号。
- SIRI:从策略自身的成功 rollout 中挖掘技能、验证其效用,并仅将有益的技能引导动作蒸馏为无技能策略。
- Skill0.5:采用混合策略,内化通用技能的同时强制使用任务特定技能,以提升分布外迁移能力。
3. 参数化技能表示(Parameterized skill representations) 该方向以权重空间方法替代重复注入技能文本,实现模块化加载与组合:
- Skill-to-LoRA:合成技能引导的演示数据,将每个 SKILL.md 蒸馏为独立可加载的 LoRA 适配器。
- LatentSkill 与 ParametricSkills:训练超网络将文本技能映射为 LoRA 权重,无需逐技能微调骨干网络;两者均探索参数空间组合,其中 ParametricSkills 进一步基于单轮与多轮技能利用轨迹训练,并支持测试时技能演化。
4. 智能体技能评估(Evaluating Agent Skills)
- SkillsBench:通过配对执行(有技能 vs. 无技能)衡量策划技能的边际价值,发现聚焦式技能集可胜过穷尽式捆绑。
- SWE-Skills-Bench:在真实软件仓库上应用受控的、基于执行的评估,发现增益高度依赖技能特异性与上下文兼容性。
- AgentSkillOS:研究生态系统规模的技能发现与基于 DAG 的编排,并附带工件生产基准。
- MolClaw / MolBench:将药物发现工具组织为三级技能层次结构,并引入 MolBench 评估长程工作流。
5. 智能体数据合成(Agentic data synthesis)
- STEPS:将能力组织为层次化技能分类法,采样连贯技能组合以进行组合式指令合成。
- AgentSynth:将独立生成的子任务组合为长程计算机使用任务,通过子任务数量控制复杂度。
- TermiGen:针对终端智能体,联合合成可执行环境与包含错误恢复行为的轨迹。
- CLI-Universe:基于多维能力分类法采样,构建并验证容器化任务。
- SkillSynth:从场景介导的技能图中采样工作流,以多样化所需执行路径。
- Terminal-World:直接利用 Agent Skills 协同生成任务指令、环境与教师轨迹,并将技能组合为团队或图结构以扩大任务覆盖。
Q: 论文如何解决这个问题?
论文通过引入 SKT(Skill-use Training) 框架解决该问题。SKT 是一个三阶段验证式数据合成管道,旨在生成高质量、可执行、且忠实使用技能的训练数据,进而通过监督微调(SFT)提升大语言模型对 Agent Skills 的识别、应用与协调能力。整体方案包含以下核心环节:
1. 核心思想
不同于直接内化技能或改进技能检索,SKT 聚焦于构建以技能为根基的可验证任务与执行轨迹。其关键在于:
- 通过规则与智能体验证确保任务可解、可验、且真正依赖指定技能;
- 通过反馈引导的修复机制迭代提升任务质量;
- 通过双重验证过滤仅保留成功的、实质性使用技能的轨迹作为监督信号。
2. 三阶段管道
Stage I:技能策划(Skill Curation)
- 从公开技能库中,利用基于评分标准的 LLM 筛选器保留能够支撑可执行、可客观检验任务的技能。
- 配置单技能与多技能组合:按可控基数 k ∈ 1, 2, 3 采样技能集合 S 。
- 当 k > 1 时,引入组合判断器(composition judge),仅保留那些能形成角色分明、连贯工作流的技能组合;不符合要求的组合被重新采样。
Stage II:任务合成与验证(Task Synthesis)
该阶段通过模板驱动合成与多重验证门控,确保任务包的质量:
模板驱动创作(Template-driven authoring)
给定技能集合 S ,TaskGen 读取每个技能并填充固定模板,生成包含以下内容的任务包 T :任务指令、隔离的运行环境、执行配置、可执行评估器以及参考解法。规则验证器(Rule-based verifier)
执行确定性检查:确认任务包组件完整、路径有效、评估器定义受支持、创作痕迹记录了 S 中每个技能的访问;在仅由任务输入初始化的干净工作区中执行参考解法,要求其产物获得评估器满分;检查求解器可见材料未逐字复制参考值或技能规则。智能体验证器(Agent-based verifier)
由 LLM 对任务包进行语义审查:确认指令明确指定了所需产物与输出位置、本地环境包含完成所需的全部信息、求解器可见材料未在语义上泄露隐藏答案、评估逻辑或决定性技能要求。技能依赖性检验(Skill dependence)
通过配对 rollout 验证任务对技能的真实依赖:固定任务与环境,分别在提供 S 和不提供 S 的条件下执行,比较评估器得分 r^+ 与 r^- ,要求 r^+ > r^- ,以确保技能访问在整体任务完成上确实带来收益。难度控制(Difficulty control)
使用固定求解器与 harness 对任务执行 N 次独立 rollout。若通过估计值
p(pass)(T, S) = (1) / (N)∑(j=1)^(N) 1[rj = 1]
满足 p(pass) ≥ θ_(easy) ,则判定任务过易,退回修复。反馈引导修复(Feedback-guided repair)
任务在任一验证门失败时,将具体错误、语义反馈或基于轨迹的难度建议返回给 TaskRepair;修订后的任务包从规则验证器重新开始检验。仅当通过全部三门验证后,任务才进入已接受任务集 D_(task) 。
Stage III:轨迹合成与验证(Trajectory Synthesis)
- 对已接受的任务–技能对 (T, S) ,配置教师模型–harness 对 (m, h) ,由教师模型在 harness 中完整求解任务,保留包含模型消息、工具调用与结果、输出产物的完整轨迹 τ 。
- 规则验证:要求轨迹获得评估器满分、正常完整终止、工具轨迹格式正确、并显式访问了所需技能。
- LLM 验证:检查轨迹中每个技能是否在指导动作前被查阅、是否影响了具体决策或操作、以及是否被正确应用。
- 失败重采样:未通过验证的 rollout 被直接丢弃,下一次尝试在全新会话与工作区中重新采样,不向教师模型暴露前次失败原因或验证器反馈。首个通过双重验证的轨迹被保留至训练集 D_(traj) 。
3. 训练策略
将验证后的轨迹集转换为 harness 原生的训练样本,执行掩码自回归监督微调。对于 tokenized 轨迹 τ = (x1, dots, x_T) ,优化目标为:
L(SFT) = -∑(t ∈ A(τ)) log pθ(xt mid x(<t))
其中 A(τ) 包含所有由助手生成的推理、工具调用与回复 token;系统消息、任务消息与工具观察值保留在条件上下文中,但被排除在损失计算之外。这使模型学习从定位相关指令到执行并校验技能引导动作的完整过程,而非仅拟合最终答案。
4. 可扩展的基准构建
基于同一管道和互不相交的任务池,论文进一步构建了 SkillEval 这一保留评测基准。该基准完全隔离于训练数据,用于公正评估模型在软件工程、数据分析、安全、金融分析等领域的技能使用能力。
综上,SKT 通过“严格筛选技能 → 多维度验证合成任务 → 双重过滤收集轨迹 → 端到端监督微调”的完整链路,系统性地提升了 LLM 智能体有效利用外部 Agent Skills 的能力。
Q: 论文做了哪些实验?
论文在 第4节 与附录中开展了系统性实验,涵盖模型微调、数据消融、harness 迁移、规模扩展与技能基数分解等多个维度。具体实验内容如下:
1. 实验设置与评测基准
- 模型与训练:选取 Qwen3.5-9B 与 Gemma 4 E4B-IT 作为骨干模型,对完整参数进行一 epoch 监督微调(SFT),学习率 5× 10^(-6) ,余弦调度,有效 batch size 为 8,序列上限 64k tokens。
- 数据合成:从 2,000 个公开技能中合成 4,000 个被接受的任务包(1,520 单技能、1,295 双技能、1,185 三技能)与 27,164 条通过验证的轨迹,使用 DeepSeek V4 Pro、Qwen3.5-35B-A3B 等作为教师/验证模型,在 DeepAgents 与 OpenCode 两种 agent harness 上采集轨迹。
- 评测基准:
- SkillsBench:77 项通用多步技能任务;
- MolBench-Bind:37 项分子结合亲和力预测任务;
- AgentSkillOS-Bench:30 项多格式工件生产任务;
- SkillEval:论文新构建的保留评测集,100 项跨领域可执行任务(30/46/24 项分别对应 1/2/3 个技能),与训练技能池完全不相交。
2. 整体有效性验证(匹配 harness)
在“训练与评估使用同一 harness”的设置下,对比原始检查点(Original)与 SKT 微调后的检查点,覆盖 2 个模型 × 2 个 harness × 4 个基准 = 16 组对比。
- 结果:SKT 在 全部 16 组对比中均取得提升,绝对增益范围为 3.20–18.91 点。
- 例如,Qwen3.5-9B 在 OpenCode 上于 SkillEval 从 55.24 提升至 72.48;在 MolBench-Bind 上从 33.11 提升至 44.59。
3. 改进来源分析
- 对外部技能的依赖性:在 SkillsBench 与 SkillEval 上分别测试“提供指定技能”与“不提供技能”两种条件。当技能被扣留时,SKT 相较于 Original 的增益仅为 0.53–5.69 点;当技能提供时,增益达 8.68–18.91 点。这表明 SKT 主要提升的是利用外部技能的能力,而非单纯增强内在推理。
- 验证管道的必要性:构建一套同等规模但不经任何验证与修复的原始合成数据,用于训练 Qwen3.5-9B。结果显示,未经校验的数据会导致所有四项基准的分数下降(相比 Original),而 SKT 数据则一致提升。这证明了多阶段验证与反馈修复对数据质量至关重要。
4. Harness 迁移与混合训练
- 跨 harness 迁移:评估在 harness A 上采集轨迹训练得到的模型,在 harness B 上执行的表现。在 SkillsBench 与 SkillEval 上,跨 harness 模型均显著优于 Original,能保留 49.1%–58.1% 的“匹配 harness”增益;但匹配 harness 训练始终更优,说明学习到的技能使用行为部分通用,部分与具体交互接口相关。
- 混合 harness 训练:将 DeepAgents 与 OpenCode 的验证轨迹混合,训练单一模型。该混合模型在所有 8 组 benchmark–harness 组合上均优于 Original,且与专门的单 harness 模型(Specialist)差距不超过 2.71 点,在部分设置上甚至略超 Specialist。这表明一个统一检查点即可有效支持多种 harness,无需为每种接口单独维护模型。
5. 训练池规模扩展
将合成训练池从 100 个技能逐步扩展到 2,000 个技能(对应增加验证后的 OpenCode 轨迹),训练 Qwen3.5-9B 并在 SkillEval 上评测。
- SkillEval 得分随训练技能数量单调上升:从 Original 的 55.24 提升至 100 技能的 59.8、500 技能的 67.4、1,000 技能的 70.8,最终在 2,000 技能时达到 72.48。这验证了扩大技能覆盖范围可带来持续的性能收益。
6. 按技能基数(Skill Cardinality)分解
将 SkillsBench 的 77 项任务按所需技能数量 K 分为三组: K=1 (25 项)、 K=2 (19 项)、 Kge 3 (33 项),在 Qwen3.5-9B–OpenCode 上比较 Original 与 SKT。
- Original 在 K=2 与 Kge 3 时基线极低(分别为 3.95 与 4.04),而 SKT 将其提升至 20.72 与 12.08,对应增益 16.77 与 8.04 点; K=1 时增益为 7.40 点。
- 这说明 SKT 的效益不仅限于单技能场景,在多技能协调任务上同样显著,尤其在双技能任务上改进最为突出。
7. 附录中的补充实验与统计
- 端到端算法与验证标准(附录 A–B):形式化描述 SKT 控制流,详细规定任务侧(规则验证、语义验证、技能依赖、难度控制)与轨迹侧(确定性检查、LLM 忠实使用检查)的通过准则与反馈策略。
- 数据集组成与轨迹统计(附录 C):报告任务–技能组合分布、SkillEval 的保留集构造方式,以及保留轨迹中助手轮次、工具调用、技能加载请求的中位数与 90 分位数。
- 训练与评估细节(附录 D):提供轨迹序列化方式、损失掩码策略、优化器配置、Qwen3.5-9B 在三种训练设置(DeepAgents / OpenCode / Mixed)下的单 epoch 损失曲线,以及推理协议与可复现性设置。
Q: 有什么可以进一步探索的点?
基于论文的框架与实验发现,以下方向值得进一步探索:
1. 高阶与动态技能组合的扩展
论文当前将技能基数控制在 k ∈ 1, 2, 3 。未来可探索:
- 更大规模的技能协同:当 k > 3 时,技能间的依赖关系与冲突消解更为复杂,需要更强大的工作流规划能力。
- 动态技能图与 DAG 编排:借鉴 AgentSkillOS 与 Terminal-World 的思路,在 SKT 中引入非线性的技能调用拓扑(如条件分支、并行执行、循环迭代),训练模型处理更贴近真实生态系统的技能网络。
2. 与强化学习及对比学习的深度融合
论文目前仅采用监督微调(SFT)。验证后的轨迹数据天然适合作为高级训练范式的种子:
- 过程级 RL:将 SKT 的验证器作为奖励信号,对同一任务下多条候选轨迹进行排序或优化(类似 SkillRL、Skill-R1),可能进一步放大技能使用的忠实度。
- 对比信用分配:借鉴 SkillC,利用 SKT 已生成的“有技能/无技能”配对 rollout,显式区分技能带来的边际贡献,从而训练模型更精准地判断“何时需要调用技能”。
3. 技能内化与外部调用的混合策略
实验表明 SKT 提升的是外部技能利用能力,而相关研究(SKILL0、Skill0.5、Skill-to-LoRA)关注将技能内化到模型参数中。下一步可探索:
- 渐进式内化管道:先用 SKT 建立强大的外部技能使用行为,再对高频技能进行参数化蒸馏(如 LoRA),最终在“无外部文件”场景下保持性能,同时在遇到新技能时恢复外部调用能力。
- 参数-文本混合表示:如 ParametricSkills 所述,训练超网络将文本技能映射为权重,SKT 的验证轨迹可为这类参数化技能提供高质量的对齐数据。
4. 验证与数据合成的自动化与轻量化
SKT 严重依赖强 LLM(如 DeepSeek V4 Pro)作为任务/轨迹验证器,成本较高:
- 专用验证模型:训练一个轻量级的、专门用于检测“技能是否被实质性使用”的验证模型,以降低数据合成成本并提高吞吐量。
- 可编程验证的泛化:当前规则验证高度依赖任务模板,研究如何将规则验证组件自动泛化到更开放、更少结构化的任务领域,将进一步提升 SKT 的可扩展性。
5. 跨领域与极端分布外的泛化
SkillEval 采用了与训练池不相交的任务与技能组,但仍属于相似的宏观领域。可进一步检验:
- 领域鸿沟场景:例如,训练数据主要源于软件工程技能,测试时面对医疗诊断或法律合规技能,评估模型能否将学习到的“元技能使用能力”迁移到全新领域。
- 跨语言技能使用:当前技能库以英文为主,探索多语言技能文档下的技能识别与执行,也是现实应用中的关键问题。
6. 在线与持续进化机制
SKT 当前是离线批量合成管道。结合智能体生态系统的开放性,可探索:
- 在线数据飞轮:部署后的模型在实际环境中产生新的成功/失败轨迹,经 SKT 验证器实时筛选后回流至训练池,实现模型与技能库的协同进化(co-evolution)。
- 技能版本感知训练:公开技能库不断更新,模型需要学会应对同一技能的多个版本或向后不兼容的 API 变更。
7. Harness 通用性与交互协议的标准化
论文发现匹配 harness 训练收益最大,跨 harness 仅保留约 50%–58% 的增益:
- 通用交互中间表示:设计一种 harness 无关的“元协议”或抽象动作空间,使 SKT 轨迹在训练时不绑定具体工具调用格式,从而提升跨平台迁移率。
- 少样本 harness 适应:研究如何利用极少量的目标 harness 示范,快速将 SKT 预训练模型适配到新的 agent 接口(如新的终端环境或浏览器自动化框架)。
8. 安全对齐与对抗鲁棒性
论文未深入讨论技能使用中的安全风险:
- 恶意技能防御:当外部技能可能被投毒(如包含隐藏提示注入或危险代码)时,如何在 SKT 训练阶段引入安全验证门,使模型学会在遵循技能指令前进行风险审查。
- 过度依赖与技能冲突:当多个技能给出矛盾指令时,模型应如何仲裁?SKT 的验证框架可扩展为包含“冲突检测”与“安全回退”机制的训练数据。
9. 细粒度错误分析与认知诊断
论文展示了宏观性能提升,但未系统剖析剩余失败案例:
- 失败模式分类:将轨迹验证失败细分为“技能识别失败”“参数填充错误”“执行顺序错误”“工具解析失败”等类别,可针对性地增强数据合成策略。
- 难度自适应合成:当前难度控制使用固定阈值 θ_(easy) ,未来可基于模型能力动态调整任务复杂度,实现类似课程学习(curriculum learning)的合成节奏。
Q: 总结一下论文的主要内容
这篇论文围绕大语言模型(LLM)智能体如何有效利用外部 Agent Skills这一核心问题展开,提出了一个系统性的数据合成与训练框架,并进行了广泛的实验验证。主要内容可概括如下:
1. 研究背景与核心问题
Agent Skills(封装了领域知识、程序工作流与工具指令的可复用技能包)已成为扩展 LLM 能力的重要机制,公开生态中的技能数量已超过 60 万。然而,技能的可获得性并不等同于模型的可利用性。现有模型在识别何时调用技能、理解其操作约束、协调多技能工作流以及忠实执行技能指令等方面仍存在显著不足。以往研究多聚焦于技能检索或参数内化,而非直接提升模型的“技能使用”能力本身。
2. SKT 方法框架
论文提出 SKT(Skill-use Training),一种基于验证的合成数据生成管道,通过构造可解、可验、复杂度可控的技能根植任务及其执行轨迹,来训练模型掌握技能使用能力。整个流程分为三个阶段:
Stage I:技能策划(Skill Curation)
从公开技能库中筛选高质量技能,并按可控基数 k ∈ 1, 2, 3 采样单技能或多技能组合。对于 k > 1 ,通过组合判断器确保所选技能能构成角色分明、连贯协同的工作流。Stage II:任务合成与验证(Task Synthesis)
基于固定模板自动生成包含指令、隔离运行环境、评估器与参考解法的可执行任务包。每个任务包需依次通过三重门控:
- 规则验证器:检查文件完整性、路径有效性、参考解法可执行性,并防止隐藏答案泄露;
- 智能体验证器:审查语义合理性,确保指令明确、环境自洽,且求解器可见材料未在语义上暴露评估逻辑;
- 技能依赖性检验:通过配对 rollout(提供技能 vs. 不提供技能)验证任务对指定技能的真实依赖,要求 r^+ > r^- ;
- 难度控制:使用固定求解器执行 N 次 rollout,若估计通过率
p(pass)(T, S) = (1) / (N)∑(j=1)^(N) 1[rj = 1]
超过阈值 θ(easy) ,则判定任务过易并触发修复。
未通过验证的任务经由**反馈引导修复(Feedback-guided Repair)**迭代修订,直至通过或超出修复预算。
Stage III:轨迹合成与验证(Trajectory Synthesis)
由强教师模型在 agent harness 中执行已接受的任务,收集完整交互轨迹。轨迹需通过双重验证:规则层面要求评估满分、正常终止、格式正确且显式访问技能;LLM 层面则逐技能检查其是否在动作前被查阅、是否影响具体决策、且应用正确。失败的 rollout 被直接丢弃并在全新环境中重采样,不向教师暴露失败反馈。首个通过验证的轨迹进入训练集 D_(traj) 。训练目标
将验证轨迹用于监督微调(SFT),优化掩码自回归目标:
L(SFT) = -∑(t ∈ A(τ)) log pθ(x_t mid x(<t))
其中 A(τ) 仅包含助手生成的推理、工具调用与回复 token,系统消息与工具观察值被掩码。这使模型学习从定位指令到执行校验的完整技能使用过程。
3. 实验设计与核心发现
基于 2,000 个公开技能,SKT 合成了 4,000 个任务包与 27,164 条验证轨迹。论文训练了 Qwen3.5-9B 与 Gemma 4 E4B-IT,并在四个基准(SkillsBench、MolBench-Bind、AgentSkillOS-Bench 与论文新提出的保留集 SkillEval)上进行了系统评估:
- 一致且显著的性能提升:在 2 个模型 × 2 个 harness × 4 个基准共 16 组对比中,SKT 全面优于原始检查点,绝对增益达 3.20–18.91 点,证明其能有效提升多样化场景下的技能使用能力。
- 增益来源于外部技能利用:当推理时扣留指定技能,SKT 的优势大幅收缩(仅 0.53–5.69 点),表明其主要增强了利用外部技能而非纯粹内在推理的能力。
- 验证管道的必要性:消融实验显示,未经任何验证/修复的原始合成数据用于训练会导致性能全面下降,而 SKT 的多阶段验证机制是保障数据质量与训练效果的关键。
- 跨 harness 迁移与统一训练:SKT 学习到的技能使用行为部分可跨 agent 接口迁移(保留约 49%–58% 的匹配增益);混合两种 harness 的轨迹训练单一模型,可在多数设置上接近甚至匹配专用模型,减少维护多套模型的开销。
- 规模扩展性:将训练技能池从 100 扩展至 2,000,SkillEval 得分从 55.24 单调提升至 72.48,验证了扩大技能覆盖范围可带来持续收益。
- 多技能协调有效性:在 SkillsBench 上按技能基数分解,SKT 在 K=2 与 K ge 3 的多技能任务上同样带来显著提升(最高达 16.77 点),证明其不仅改善单技能调用,也增强了技能间的协调与编排能力。
4. 主要贡献
- 提出 SKT 框架,首次系统性地通过验证式合成数据提升 LLM 的 Agent Skill 使用能力;
- 开发可扩展的数据合成管道,支持从单技能到多技能、从任务生成到轨迹验证的闭环质量控制,并可复用于构建保留评测基准(SkillEval);
- 通过跨模型、跨 harness、跨基准的大量实验,确立了高质量验证数据作为技能使用训练有效途径的地位,并证明其具备跨环境泛化与规模扩展潜力。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Zelin Tan,Yiqun Zhang,Hao Li,Zhiyao Cui,Hejia Geng,Shao Zhang,Hangfan Zhang,Yang Chen,Xiaosong Wang,Lilong Wang,Zhenfei Yin,Shuyue Hu,Chen Zhang,Lei Bai
PDF URL: https://arxiv.org/pdf/2608.02287.pdf
Arxiv URL: https://arxiv.org/abs/2608.02287
Arxiv ID: 2608.02287
CoolPaper URL: https://papers.cool/arxiv/2608.02287
Published: 2026-08-05T01:02:48.374Z
Updated: 2026-08-05T01:02:48.374Z
11. DiffusionGemma Technical Report
Abstract:We introduce DiffusionGemma, an experimental open-weight language model that uses discrete diffusion to generate text at exceptionally high speed. Rather than decoding one token at a time, DiffusionGemma iteratively refines blocks of 256 tokens in parallel, avoiding the sequential decoding bottleneck of conventional autoregressive (AR) large language models. Instead of training from scratch, we obtain DiffusionGemma by fine-tuning the mixture-of-experts Gemma 4 model with 3.8B activated and 25.2B total parameters. Our compute-efficient two-stage training pipeline uses fewer than 10% of the starting AR model’s total training token budget. The first stage uses supervised fine-tuning to teach bidirectional denoising, while the second stage combines reinforcement learning with sampler distillation to jointly improve generation quality and inference efficiency. DiffusionGemma establishes a new Pareto frontier for the trade-off between generation speed and model capability. Averaged across our full evaluation suite, it generates around 20 tokens per forward pass and achieves roughly 1,500 output tokens per second on a single NVIDIA H100 GPU, which is substantially faster than AR models even with state-of-the-art speculative decoding. DiffusionGemma also retains the starting model’s support for thinking mode, multimodal inputs, and long contexts. Despite diffusion fine-tuning, it remains capable of AR generation with only minor performance degradation, suggesting a path toward hybrid diffusion-AR decoding.
中文摘要
摘要:我们介绍了 DiffusionGemma,这是一种实验性的开源权重语言模型,使用离散扩散以极高速度生成文本。DiffusionGemma 并非一次解码一个标记,而是并行迭代精炼 256 个标记的块,从而避免了传统自回归(AR)大型语言模型的顺序解码瓶颈。我们并非从零开始训练,而是通过微调混合专家 Gemma 4 模型(激活参数 38 亿,总参数 252 亿)来获得 DiffusionGemma。我们高效的两阶段训练流程使用的训练 token 数不到起始 AR 模型总训练 token 预算的 10%。第一阶段使用监督微调教授双向去噪,第二阶段结合强化学习与采样器蒸馏,共同提升生成质量和推理效率。DiffusionGemma 在生成速度与模型能力的权衡上建立了新的帕累托前沿。在我们完整评测套件中的平均表现来看,它每次前向传播大约生成 20 个标记,在单个 NVIDIA H100 GPU 上实现约 1500 个输出标记每秒,这远比即使采用最先进的预测解码的 AR 模型要快。DiffusionGemma 还保留了起始模型对思维模式、多模态输入和长上下文的支持。尽管经过扩散微调,它仍能进行 AR 生成且性能仅有轻微下降,这表明了一条向混合扩散-AR 解码发展的途径。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文主要试图解决自回归(AR)语言模型在文本生成中的顺序解码瓶颈,以及现有文本扩散模型在速度、能力与可访问性之间的权衡困境。具体而言,其核心目标可归纳为以下几个方面:
- 缓解AR模型的内存带宽瓶颈 传统AR大语言模型严格按从左到右的逐token方式生成序列,导致推理过程严重受限于内存带宽(memory-bound):在单用户或低并发场景下,模型权重和KV缓存的内存传输时间远超实际计算时间,使得加速器计算单元利用率低下,严重制约了每用户的生成速度。
突破现有文本扩散模型的能力与速度妥协 尽管文本扩散模型理论上可通过并行迭代整段文本以规避顺序瓶颈,但当前可选方案面临尖锐的权衡:闭源模型(如Gemini Diffusion、Mercury)被锁定在专有API后;而开源替代品则普遍存在推理能力有限、多模态理解不足,或未能兑现扩散技术所承诺的极端低延迟优势等问题。此前尚未出现同时具备高智能、超高速度和开放可访问性的文本扩散模型。
建立速度-能力的新帕累托前沿 论文提出DiffusionGemma,通过对Gemma 4模型进行两阶段微调(监督微调+在线采样器蒸馏与强化学习),使其能够以平均约20 tokens/forward pass的速度、在单张NVIDIA H100 GPU上达到约1,500 output tokens/sec的吞吐量,同时保留原模型的多模态理解、长上下文与思考模式(thinking mode)等能力。
- 探索混合解码路径 该工作还试图验证一种实用路径:在将AR模型高效转换为扩散范式的同时,保留其原有的AR生成能力,从而为未来的混合扩散-自回归解码(hybrid diffusion-AR decoding)及动态请求路由提供可能性。
Q: 有哪些相关研究?
根据论文内容,相关研究可归纳为以下几个主要方向:
1. 自回归语言模型与解码加速
- 经典自回归建模:包括基于RNN (Graves, 2013; Mikolov et al., 2010)、LSTM/Seq2Seq (Sutskever et al., 2014) 和 Transformer (Vaswani et al., 2017; Bengio et al., 2003) 的逐token条件概率分解
p(x) = prod(i=1)^(L) p(x_i mid x(<i))
。 - 推测解码(Speculative Decoding):为缓解AR模型的顺序瓶颈,研究者提出了利用小型草稿模型生成候选序列再由大模型并行验证的方法 (Chen et al., 2023a; Leviathan et al., 2023; Xia et al., 2024)。后续工作扩展了多token预测(MTP)(Li et al., 2026)、块级并行解码 (Stern et al., 2018) 与前瞻策略 (Zhao et al., 2024),但存在后续草稿位置接受率下降的问题 (Cheng et al., 2026)。
2. 连续空间文本扩散
早期工作尝试将标准高斯扩散适配到文本,通过在连续嵌入空间上定义扩散过程再映射回离散token:
- Diffusion-LM (Li et al., 2022) 与 SED (Strudel et al., 2022) 生成连续向量后通过“硬舍入”(rounding)投影回词汇表。
- CDCD (Dieleman et al., 2022) 在连续过程中直接预测类别logits。
近期连续/混合方法试图克服舍入误差与空间漂移问题:
- Embedded Language Flows (ELF) (Hu et al., 2026) 在连续嵌入空间中保持无约束直到最终离散化。
- Flow maps (Lee et al., 2026; Potaptchik et al., 2026) 将离散数据生成轨迹压缩为单步或少步映射。
- Cosmos / TEncDM (Meshchaninov et al., 2025; Shabalin et al., 2025) 利用预训练自编码器将文本映射到压缩平滑的潜空间进行高斯扩散。
- CANDI (Pynadath et al., 2026) 解耦离散与连续损坏过程。
- 超球面流 (Deschenaux and Gulcehre, 2026b) 在超球面上旋转token嵌入以更好匹配语言几何结构。
3. 离散状态扩散与流匹配理论
- 离散扩散基础:Austin et al. (2021); Hoogeboom et al. (2021, 2022) 将掩码与随机token替换形式化为多步马尔可夫过程,使用显式转移矩阵(均匀噪声或吸收态掩码)。
连续时间马尔可夫链(CTMC)与离散流匹配:Campbell et al. (2022, 2024); Gat et al. (2024); Ou et al. (2025) 建立了在离散状态空间上的连续时间前向-反向过程理论,定义了从干净数据分布 p 到均匀先验 Unif(V^C) 的边际概率路径:
P(Xt = x_t mid X_0 = x_0) = prod(i=1)^(C) [ kappa_t δ(x_t^i, x_0^i) + (1-kappa_t)(1) / (V) ]与早期双向模型的联系:BERT (Devlin et al., 2019)、RoBERTa (Liu et al., 2019) 的掩码语言建模以及 ELECTRA (Clark et al., 2020) 的替换token检测被视为现代离散扩散中分类状态转移的直接前身。
4. 并发生成与块自回归策略
- 块级(Blockwise)生成:为处理开放式文本生成,Wu et al. (2025); Arriola et al. (2025); Deschenaux and Gulcehre (2026a) 独立开发了类似的块级序列建模与KV缓存方法,通过因果编码器处理历史上下文、双向解码器逐块(如256-token画布)去噪。
- 非自回归与半自回归生成:Gu et al. (2018); Ghazvininejad et al. (2019); Gong et al. (2023) 探索了并行或迭代式解码方案。
5. 近期文本扩散大模型
论文明确将DiffusionGemma与以下同期或近期模型对比:
- Gemini Diffusion (Google DeepMind, 2025) — 闭源。
- Mercury (Inception Labs et al., 2025) — 闭源,基于扩散的超高速度模型。
- LLaDA (Bie et al., 2025; Nie et al., 2026) — 开源,大规模扩散语言模型。
- Seed Diffusion (Song et al., 2025) — 高速推理扩散模型。
- Nemotron-Labs-Diffusion (Fu et al., 2026) — 统一自回归、扩散与自推测解码的三模态模型。
- DFlash (Chen et al., 2026) 与 TiDAR (Liu et al., 2026b) — 扩散草稿+AR验证的混合推测解码方案。
6. 训练、对齐与采样器压缩方法
- 从AR模型热启动扩散模型:Gong et al. (2025); Han et al. (2024) 展示了利用预训练AR权重初始化扩散模型以降低训练成本的可行性。
- 自条件化(Self-Conditioning):Chen et al. (2023c); Strudel et al. (2022); Jo et al. (2026) 将模型前一步的预测作为条件信号重新注入,以提升迭代生成的一致性与可解释性。
- 强化学习用于扩散:Black et al. (2024); Clark et al. (2024); Liu et al. (2025); Ma et al. (2026) 等将RL框架扩展到扩散模型以优化奖励。
- 采样器蒸馏/少步生成:Salimans and Ho (2022); Luo et al. (2023); Liu et al. (2024); Sauer et al. (2024); Song et al. (2023); Yin et al. (2024); Deschenaux and Gulcehre (2025); Fu et al. (2025); Hoogeboom et al. (2026) 致力于将多步扩散轨迹压缩到极少采样步数。
- 熵界限采样:Ben-Hamu et al. (2026) 提出按熵升序接受token、对剩余位置重新加噪的机制;Chang et al. (2022) 的 MaskGIT 采用类似的按置信度排序解码策略。
7. 推理优化与高效 serving
- 注意力优化:FlashAttention (Dao et al., 2022) 及其后续版本 FlashAttention-4 (Zadouri et al., 2026) 用于加速画布上的双向注意力。
- MoE Serving:Huang et al. (2024); Rajbhandari et al. (2022) 分析了稀疏MoE在单请求serving时的内存带宽瓶颈。
- KV缓存与调度:Kwon et al
Q: 论文如何解决这个问题?
论文通过DiffusionGemma这一实验性开放权重模型,采用“微调现有AR模型为离散扩散模型”的核心思路,配合算法与系统层面的联合优化,系统性地解决了上述问题。具体解决路径可分为以下五个层面:
1. 绕过预训练,基于公开AR权重热启动
不同于从头预训练扩散模型的高昂成本,论文选择直接基于已公开权重的 Gemma 4 26B A4B(Mixture-of-Experts,MoE)模型进行初始化。通过复用其Transformer骨干网络,实现了:
- 能力继承:直接保留原模型的多模态理解、长上下文窗口、思考模式(thinking mode)等高级特性。
- 成本压缩:整个两阶段训练消耗不到原AR模型总训练token预算的10%。
- 双模态兼容:由于架构完全一致,最终权重既能以扩散模式运行,也能无缝切回标准自回归(AR)因果解码模式。
2. 编码器-解码器架构与块自回归生成
论文设计了一种架构倒置的编码器-解码器结构,以兼容长序列开放式生成:
因果编码器(Causal Encoder):使用因果注意力处理系统指令、用户提示及已生成的历史画布,构建并增量维护KV缓存 H :
H arrow H oplus Encoder_θ(x_0)双向解码器(Bidirectional Decoder):在固定长度 C=256 的“画布”(canvas)上执行全双向注意力,并行去噪整段文本;画布之间则采用块自回归(block-AR)方式从左到右串接。
这种结构既消除了AR的逐token顺序依赖,又通过因果编码避免了长上下文重复编码的开销,实现了扩散与AR的结构性融合。
3. 两阶段训练流程:从适应到压缩
论文提出了一套计算高效的在线学习管线,分两个阶段将AR模型转化为低延迟扩散模型:
阶段一:监督微调(SFT)
目标是将模型适配到离散扩散的“噪声到数据”范式:
- 采用离散多项式扩散(multinomial diffusion)作为前向加噪过程,按噪声水平 $t sim Unif
0,1
以概率 t$ 将画布token替换为词汇表均匀随机样本。 - 使用块对角注意力掩码,在256-token画布内启用双向注意力,但阻止模型偷窥其他去噪画布。
- 训练目标为标准的交叉熵损失:
L(θ) = -∑(i=1)^(C) log pθ(x_0^i mid x_t, z_t, H)
其中 z_t 为自条件化(self-conditioning)信号,将前一步预测注入当前步以提升一致性。
阶段二:采样器蒸馏与强化学习(SD·RL)
这是解决“少步生成时质量崩溃”问题的关键。论文将传统上分离的“奖励对齐”与“采样器蒸馏”统一为单阶段在线目标:
- 奖励最大化:通过RL提升模型在数学推理、代码生成、指令遵循等任务上的绝对质量。
- 采样器蒸馏(Sampler Distillation):联合优化以压缩去噪轨迹,使模型在极少步数下即可输出高质量结果。
- 隐式课程效应:随着训练进行,模型预测熵逐渐降低,触发自适应停止(adaptive stopping)的条件越来越早,训练分布自动向更短去噪轨迹偏移。这使得模型被显式特化在少步 regime,最终平均仅需约12步即可收敛。
4. 熵界限采样与自适应停止算法
为在推理时动态平衡质量与延迟,论文设计了专用的熵界限采样器(Entropy-Bounded Sampler),核心机制包括:
- 熵排序接受(Entropy-bounded token refinement):按token预测熵从低到高排序,在累计互信息预算 b=0.1 内接受低熵token,超出预算的位置则重新施加均匀噪声,强制下一步继续探索。
- 温度退火(Temperature Annealing):线性降低温度 τt = (τ(max) - τ(min))t + τ(min) ,从初始 τ(max)=0.8 降至 τ(min)=0.4 ,使早期充分探索、后期果断收敛。
- 自适应停止(Adaptive Stopping):当画布平均预测熵低于阈值 e_(stop)=0.005 且连续两步的确定性预测(argmax)完全一致时,立即终止去噪。这使得:
- 简单任务(如结构化JSON、代码补全)可提前至2–4步完成;
- 复杂推理任务(如竞赛级数学、困难代码)自动分配更多步数。
5. 系统级推理优化
在算法层面提升“每步生成token数”(TPF)的同时,论文针对GPU kernel进行了针对性优化,以降低单步延迟 t_(fwd) :
- 注意力加速:利用高度优化的 FlashAttention-4 处理画布上的双向注意力。
- 消除CPU-GPU同步:将自适应停止的逻辑与两种前向传播(去噪步与KV缓存更新)完全放在GPU内异步调度,避免额外的CPU-GPU同步开销。
- 低并发场景特化:文本扩散通过增加每步计算量(FLOPs)换取大幅减少的前向传播次数,在单用户/低batch size下将执行瓶颈从内存带宽转移至计算,从而在单张H100上达到约1,500 tokens/second的吞吐量,比原AR基线(204 TPS)提升约7倍,比带MTP的AR基线(303 TPS)提升约4.8倍。
总结
论文的解决逻辑可概括为:以公开AR模型为能力基座 → 通过SFT赋予其双向离散扩散能力 → 通过SD·RL联合优化质量与步数压缩 → 以熵界限采样和自适应停止实现推理时动态计算分配 → 配合系统级GPU优化实现超低延迟。最终,DiffusionGemma在单张H100上实现了约20 tokens/forward pass、约1,500 output tokens/second的生成速度,同时建立了开放权重文本扩散模型的新性能前沿。
Q: 论文做了哪些实验?
论文中的实验涵盖能力评估、推理效率分析、训练动态验证、下游任务适配以及扩散机制定性分析五个层面,具体如下:
1. 主能力基准测试(Section 7 & Table 3)
在与同规模及前沿模型的对比中,论文评估了DiffusionGemma在三大能力域的表现:
- 对比模型:DiffusionGemma(TD/AR模式)、其初始化基线 Gemma 4 26B A4B(标准AR及MTP推测解码)、开源扩散模型 LLaDA 2.1 Flash 100B 与 Nemotron Diffusion 14B,以及闭源模型 Mercury 2。
- 评估域与数据集:
- 推理与知识:AIME 2026、GPQA-Diamond、BIG-Bench EH、GSM8K、MGSM、MMMLU、Putnam、MMLU-Pro、HiddenMath
- 代码生成:LiveCodeBench-v6、Codeforces ELO、HumanEval、BigCodeBench、LBPP、Natural2Code
- 指令遵循与智能体:IFEval、Tau-bench(Retail/Airline/Telecom)
- 多模态:MMMU-Pro
- 操作模式:每种模型在Thinking(思考模式)与No-Thinking下分别测试;DiffusionGemma额外测试了纯AR模式以验证能力保留。
- 核心结论:DiffusionGemma在TD模式下以接近5倍的输出吞吐(1,479 TPS)超越Gemma 4 AR基线(303 TPS,带MTP),同时质量仍处于高度竞争区间;在AR模式下则部分恢复基线性能。
2. 推理效率与延迟剖析(Section 6 & Table 4)
论文对单卡(NVIDIA H100, FP8, batch size 1)上的生成效率进行了系统量化:
- 端到端速度指标:Tokens Per Second(TPS)、Tokens Per Forward(TPF)、有效去噪步数(Effective Denoising Steps)、总前向传播次数、总生成token数及端到端延迟(排除prefill)。
- 逐层GPU时间分解(Figure 11):对比DiffusionGemma与Gemma 4 AR的每步kernel耗时,定位三大慢速来源:
- MoE层(4.3×慢于AR,因单卡单请求下专家激活数从8升至约84)
- 采样层(3.06 ms vs 0.56 ms,因需在256×262k维度上执行self-conditioning与softmax)
- 注意力层(4×慢于AR,使用FlashAttention-4处理双向画布注意力)
- 并发扩展性(Figure 12):在低batch size(≤32)下,DiffusionGemma在单用户TPS与总吞吐上均优于AR+MTP基线;仅在中等并发(约32以上)时AR模型才显现吞吐优势。
- 自适应停止的域间差异(Figure 5 & Table 4):展示模型如何根据任务复杂度动态调整去噪步数——结构化代码任务(如HumanEval)平均约9步收敛,而复杂推理(如Codeforces)可达17步以上。
3. 训练阶段动态验证(Sections 4–5)
- SFT收敛曲线(Figure 6 & 7):追踪非思考与思考模式在SFT过程中的下游性能演化。结果显示非思考模式在SFT早期迅速达标,而思考模式需更长时间才能稳定(避免循环或口吃)。
- SD·RL联合优化动态(Figure 8):在训练过程中同步监测平均奖励与在线教师(online teacher)的有效去噪步数,验证奖励提升与步数压缩的协同效应。
- 帕累托前沿推进(Figure 9):对比SFT检查点与最终SD·RL检查点的质量-速度权衡。SD·RL在GPQA-Diamond与LiveCodeBench-v6联合指标上带来约10分质量提升,并将TPF从约5提升至近20。
- 最大步数缩放行为(Figure 10):在关闭自适应停止与退火的控制条件下,测量不同最大去噪步数 N (1–128及完整步数)下的性能。SFT模型需 N=192 才饱和,而SD·RL模型在 N=48 后即进入收益递减区,证明其被显式特化至少步生成。
4. 下游任务微调实验(Section 8 & Appendix C)
论文开源了微调工具链,并在两个代表性任务上验证快速领域适配能力:
- 数独求解(Sudoku):
- 使用LoRA(rank 8)或全量微调,在开源数独数据集上训练。
- 微调前模型完全无法输出合法网格(准确率0%);微调后LoRA rank 8达到**84.4%**谜题级准确率(Table 5),且有效去噪步数从40.65降至10.72。
- Figure 14展示不同LoRA rank的准确率权衡;Figure 18展示微调前后对严格格式约束的遵循能力对比。
- PubMedQA生物医学问答:
- 使用LoRA rank 4微调,在长答案生成任务上BLEU从10.76提升至20.67(Table 6),准确率亦小幅提升,证明在领域自然语言生成上的有效性。
5. 扩散机制优势的定性/可视化分析(Section 9 & Appendix G)
通过控制实验与去噪轨迹可视化,论证文本扩散区别于AR的结构性优势:
- 双向推理与自校正:
- 数学问题(Figure 15):展示DiffusionGemma如何在去噪过程中先倾向错误答案( -1 ),随后通过双向注意力与迭代修正收敛至正确值( -25 ),而AR基线一旦承诺错误答案便只能后续打补丁。
- 青蛙过河谜题(Figure 23):AR模型因无法预见陷阱而给出矛盾回答(Yes→自相矛盾),扩散模型则在6步内通过全局约束传播自校正为正确(No)。
- 动态自适应计算:
- 难任务(序列依赖,Figure 24):输出严格依赖前序生成token,模型自适应地以近似从左到右方式解析,耗时7步(仍远少于AR的40步)。
- 易任务(静态输入依赖,Figure 25):无动态因果依赖,模型通过双向注意力在4步内并行解析全部局部规则。
- 结构化/约束输出加速收敛:
- JSON提取(Figure 26–27):由于输出被JSON schema高度约束,模型在2步内即达100%置信收敛。
- Python代码调试(Figure 28–29):仅需局部语义修改、大量token可复制输入,模型在3步内完成修复。
6. SD·RL前后的退化样本对比(Appendix B)
- GPQA-Diamond样例(Figure 16–17):呈现SFT模型在少步 regime 下的典型失效模式——先生成正确推理轨迹,随后陷入单一token(如数字“1”或右括号“)”)的无限循环,导致最终输出为空。SD·RL后相同样本可干净完成推理并输出正确答案,直观验证SD·RL对“循环退化”的消除作用。
7. Mercury 2 速度估计(Appendix E)
作为闭源模型的补充实验,论文通过OpenRouter API以最小二乘模型(非负约束)从总 wall-clock 时间中分离prefill与生成时间,估计Mercury 2的生成速度约为 489–600 TPS(依推理 effort 等级与评测集而异),用于图1与表3的速度对比。
Q: 有什么可以进一步探索的点?
基于论文的局限性与未竟方向,以下是可以进一步探索的研究点:
1. 原生离散扩散预训练与架构重设计
论文采用从AR模型热启动的策略以压缩训练成本,但这被明确指出是导致绝对性能低于AR基线的核心原因之一。未来的工作可探索:
- 从头预训练原生离散扩散LLM,摆脱AR架构在深度、宽度、注意力模式及数据混合上的历史负担,可能解锁更高的渐近质量。
- 为扩散范式定制的架构优化,例如重新设计MoE路由策略以降低每画布激活专家数(当前单请求下激活约84个专家,导致4.3倍的MoE kernel减速),或探索Dense架构以消除MoE在并行解码中的带宽瓶颈。
2. 推理长度、简洁性与质量的联合优化
SD·RL阶段涌现出的高度简洁输出虽然作为速度乘数极具价值,但也使模型放弃了通过更长推理链(longer reasoning traces)获得的典型能力增益。值得探索的方向包括:
- 显式控制输出长度的奖励塑形(reward shaping),在保持低延迟的同时允许模型在必要时展开更深入的推理。
- 研究“短思考”与“长思考”模式的可切换机制,或引入分层计算预算,使模型能根据问题难度动态决定推理深度而非单纯压缩。
3. 采样算法与测试时计算(Test-Time Compute)的深化
论文将文本扩散的采样视为一个丰富的设计空间(predictor-corrector、多步求解器等),但当前仅实例化了熵界限采样器的一种形式。后续可挖掘:
- 更激进的少步/单步采样器:结合离散流匹配理论中的高阶求解器(如离散Euler更新的高阶扩展)或一致性模型(consistency models),进一步突破12步平均去噪的极限。
- 自适应计算的高级形式:除了基于熵的早期停止,可探索基于任务复杂度估计的变长画布(dynamic canvas sizing),或允许模型在生成过程中按需扩展画布,而非固定256-token块。
4. 混合扩散-自回归解码与动态路由
DiffusionGemma保留了AR生成能力,但论文仅将其作为能力验证。更具前瞻性的方向是:
- 请求级动态路由:建立一套在线调度机制,根据延迟约束、任务复杂度或输入结构(如高度结构化的JSON vs.开放式创作)自动选择扩散模式(低延迟)或AR模式(高质量)。
- 块内混合解码:在同一生成序列中交替使用扩散(用于可并行化的局部段落)与AR(用于需要严格顺序依赖的推理链),实现细粒度的计算-质量权衡。
5. 系统级Serving优化与高并发扩展
当前实验主要聚焦于batch size = 1的低延迟场景,且承认在高并发(>32请求)下AR模型开始 reclaim 吞吐优势。未来工程研究可针对:
- 高batch size下的采样优化:例如对256×262k维度的softmax引入top- k 截断、量化采样路径,或开发定制的GPU kernel以替代当前基于PyTorch原语的实现。
- 实时流量下的MoE与注意力协同优化:DiffusionGemma通过减少KV cache传输次数将瓶颈从内存带宽移至计算,但在真实长尾流量(长上下文、多模态交织)下的表现尚需系统性实证。
6. 连续与混合扩散范式的融合
附录A讨论了连续/混合扩散方法的复兴(如Embedded Language Flows、超球面流、CANDI等)。这些方向提示:
- 离散-连续混合表示:在保持最终输出离散性的同时,利用连续嵌入空间的几何优势进行去噪,可能缓解离散空间中的局部不一致性(如当前画布内token间的条件独立假设导致的语法冲突)。
- 潜空间扩散(Latent Diffusion for Text):借鉴Cosmos/TEncDM的思路,将文本压缩至连续、平滑的潜空间执行扩散,可能彻底规避多项式扩散中的词汇级计算开销。
7. 鲁棒性与多模态可靠性
论文明确列出了若干已知问题,它们直接指向可改进的实证研究方向:
- token口吃与循环退化:在超低速延迟机制下,极少的去噪步数偶尔导致鲁棒性崩溃。可研究更保守的自适应停止启发式,或引入显式的“重复惩罚”与循环检测机制。
- 多模态thinking标签闭合失败:在多模态输入下,模型偶尔遗漏闭合思考标签,导致thinking mode评分被人为拉低。这需要针对视觉-语言对齐数据进行更精细的SFT或RL调整。
8. 领域适配与工具生态的扩展
开源下游SFT已展示了数独与PubMedQA的快速适配,但更广泛的探索包括:
- 工具调用与智能体工作流:结合第D.4节详述的工具序列化模板,研究扩散模型在需要精确格式输出(如JSON模式工具调用)时的可靠性,以及其在多轮工具-模型交互中的误差传播特性。
- 极低资源设备上的LoRA微调:验证在低 rank LoRA 下,模型是否能在边缘设备(如移动GPU)上保持1,500+ TPS量级的领域特化推理。
9. 可解释性与透明度
论文提及自条件化信号 z_t 可映射到可解释的token瓶颈。进一步的工作可:
- 系统性地解析扩散模型在每步去噪中实际执行的“计算”(例如哪些token在何时被承诺、修正或重新噪声化),以建立对并行生成过程的 mechanistic understanding。
- 利用这种可解释性来诊断并修正特定类型的推理错误(如数学问题中的中间步骤传播失败)。
Q: 总结一下论文的主要内容
这篇技术报告介绍了 DiffusionGemma,一种基于离散扩散机制的超高速开放权重语言模型,通过微调现有的自回归(AR)大模型实现,在生成速度与模型能力之间建立了新的帕累托前沿。
1. 核心动机
传统自回归语言模型严格遵循从左到右的逐token生成方式,导致推理过程严重受限于内存带宽(memory-bound),单用户场景下计算单元利用率低下。尽管推测解码等技术可缓解此问题,但其顺序本质仍构成瓶颈。与此同时,现有文本扩散模型在能力、速度与可访问性之间面临尖锐权衡:闭源模型受限于API,而开源替代品在推理质量或多模态支持上存在不足。DiffusionGemma 旨在提供一种高智能、极高速、且完全开放的文本生成方案。
2. 模型架构与生成范式
DiffusionGemma 基于 Gemma 4 26B A4B(总参数量25.2B,激活参数量3.85B的MoE模型)初始化,复用其Transformer骨干,采用编码器-解码器架构:
- 因果编码器:使用因果注意力处理输入提示与历史上下文,构建并增量维护KV缓存 H ;
- 双向解码器:在固定长度 C=256 的“画布”(canvas)上执行全双向注意力,通过交叉注意力条件化于 H ,并行迭代去噪整块文本。
生成长序列时采用**块自回归(block-AR)**策略:逐块生成256-token画布,每块去噪完成后通过编码器追加至KV缓存,再生成下一块。这种结构兼具扩散的并行性与AR的序列扩展能力。
3. 两阶段训练流程
为规避从头预训练的巨大成本,论文设计了计算高效的在线学习管线(消耗不足原AR模型10%的训练token):
阶段一:监督微调(SFT)
将AR模型适配到离散多项式扩散范式。对256-token画布按均匀噪声水平 $t ∈
0,1
$ 进行多项式加噪,训练模型通过双向注意力预测干净token,目标为交叉熵损失:
L(θ) = -∑(i=1)^(C) log pθ(x_0^i mid x_t, z_t, H)
其中引入**自条件化(self-conditioning)**信号 z_t ,将前一步预测反馈至当前步骤以提升一致性。阶段二:采样器蒸馏与强化学习(SD·RL)
统一 reward maximization 与 sampler distillation 为单一在线目标。模型作为“在线教师”生成高质量去噪轨迹,同时通过RL提升生成质量,并通过压缩预测熵将高质量输出映射到少步生成机制。此阶段涌现出隐式课程效应:随着模型置信度提升,自适应停止触发更早,训练分布自动向更短去噪轨迹偏移。
4. 推理优化:熵界限采样与自适应停止
论文提出专用的熵界限采样器以在推理时动态平衡质量与延迟:
- 熵排序接受:按token预测熵由低到高接受,在累计信息预算 b=0.1 内锁定低熵token,超出预算位置重新均匀加噪;
- 温度退火:线性降低采样温度 τ_t (从0.8至0.4),早期鼓励探索,后期促进收敛;
- 自适应停止:当画布平均预测熵低于 e_(stop)=0.005 且连续两步确定性预测完全一致时提前终止。
该机制使模型平均仅需约 12次有效去噪步(最大预算48步),且能根据任务复杂度动态分配计算:结构化代码任务可能4–9步收敛,而复杂推理任务可能需要15步以上。
5. 主要实验结果
- 速度:在单张NVIDIA H100(FP8,batch size 1)上,DiffusionGemma 平均输出约 20 tokens/forward pass,达到约 1,500 output tokens/second 的吞吐量;相比Gemma 4 AR基线(204 TPS)提升约7倍,相比带MTP的AR基线(303 TPS)提升约4.8倍。
- 能力:在涵盖数学推理(AIME、GPQA-Diamond)、代码生成(LiveCodeBench-v6、HumanEval)、指令遵循(IFEval)、智能体任务(Tau-bench)及多模态(MMMU-Pro)的广泛评测中,DiffusionGemma 建立了开放权重文本扩散模型的新性能前沿,与闭源模型 Mercury 2 质量相当但速度提升约2.5倍。
- 双模态保留:模型权重可直接加载回原始AR架构,以标准因果解码运行,性能介于扩散模式与原始基线之间,支持动态路由与混合解码。
- 下游适配:通过LoRA在数独求解(准确率从0%提升至84.4%)和PubMedQA等任务上验证了快速领域适配能力。
6. 开放性与实际优势
- 开放发布:模型以 Apache 2.0 许可证发布,并提供了 HuggingFace Transformers 与 vLLM 的参考实现。
- 超越速度的结构优势:论文通过定性分析展示了文本扩散在双向推理与自校正(未来token可修正早期错误)、动态自适应计算(任务难度决定步数)以及结构化输出加速(JSON、代码修复可在2–3步内收敛)方面的独特价值。
7. 局限与未来方向
当前版本存在与AR基线之间的绝对性能差距、输出高度简洁导致的部分能力损失、极少情况下的token口吃,以及高batch size下尚未优化的吞吐量限制。论文指出,未来可通过原生扩散预训练、专用架构设计、更激进的少步采样器、混合解码策略以及系统级高并发优化进一步突破现有边界。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: DiffusionGemma Team,Adrien Ali Taïga,James Assiene,Daniele Calandriello,Rahma Chaabouni,João Gante,Tamara von Glehn,Nate Keating,Chris Knutsen,Martin Kukla,Tianlin Liu,Ivan Lobov,Ofir Nabati,João Gabriel Oliveira,Nicolas Perez-Nieves,Nastasia Prutianova,Bobak Shahriari,Jean Tarbouriech,Pavel Tyletski,Çağlar Ünlü,Cindy Wu,Glenn Cameron,Jerome Connor,Sertan Girgin,Maarten Grootendorst,Alon Levkovitch,Eliya Nachmani,Omar Sanseviero,Piotr Stanczyk,Quentin Berthet,Andrew Campbell,Clément Crepy,Valentin De Bortoli,Arnaud Doucet,Romuald Elie,Alexandre Galashov,Klaus Greff,Alexis Jacq,David Ruhe,Yu-Han Wu,Sebastian Flennerhag,Brendan O’Donoghue,George Scrivener,Shantanu Thakoor
PDF URL: https://arxiv.org/pdf/2608.00146.pdf
Arxiv URL: https://arxiv.org/abs/2608.00146
Arxiv ID: 2608.00146
CoolPaper URL: https://papers.cool/arxiv/2608.00146
Published: 2026-08-05T01:02:58.804Z
Updated: 2026-08-05T01:02:58.804Z
12. SWE-Touch: Benchmarking Coding Agents When Users Touch the Code
Abstract:Real-world software development requires coding agents to operate in shared workspaces where users may inspect and modify code during an ongoing task, yet existing repository-level benchmarks typically evaluate agents working alone or restrict user participation to messages. This leads us to ask: how do coding agents understand and respond to code changes in a shared workspace? We introduce SWE-Touch, a framework that stress-tests this setting through validated Counter-Edits: plausible edits to task-relevant code that conflict with task completion. SWE-Touch mines task-critical regions from multiple repair trajectories, uses a separate User Patch Generator to construct the edits, and injects them with contextual user messages when agents reach the relevant code. We evaluate nine coding models on SWE-bench Verified, with additional experiments on longer-horizon tasks from SWE-Bench Pro and DeepSWE. Counter-Edit lowers average resolve rate by 7.7 percentage points on SWE-bench Verified, with degradation also persisting on both longer-horizon benchmarks. Trajectory analysis links these failures to limited awareness of the evolving workspace: agents may retain conflicting code or replace it without sufficiently re-inspecting the repository and validating the revised code with targeted tests. These findings show that strong autonomous performance does not yet ensure the state awareness and adaptive behavior needed for shared-workspace collaboration, and point to detecting workspace changes, reconciling conflicting edits with the task, and verifying the affected behavior as key capabilities for future optimization.
中文摘要
摘要:现实世界的软件开发要求编码代理在共享工作区中操作,在此期间用户可能会检查和修改代码,而现有的库级基准通常评估独立工作的代理,或者限制用户参与仅限于消息交流。这让我们提出问题:编码代理如何理解并响应共享工作区中的代码更改?我们引入了SWE-Touch,一个通过经过验证的反向编辑(Counter-Edits)来压力测试这一环境的框架:这些反向编辑是与任务完成冲突但合理的任务相关代码修改。SWE-Touch从多个修复轨迹中挖掘任务关键区域,使用独立的用户补丁生成器构造编辑,并在代理到达相关代码时注入这些编辑及上下文用户消息。我们在SWE-bench Verified上评估了九个编码模型,并在SWE-Bench Pro和DeepSWE的长周期任务上进行了额外实验。反向编辑使SWE-bench Verified的平均解决率下降了7.7个百分点,且在两种长周期基准中也存在性能下降。轨迹分析将这些失败归因于对不断变化的工作区的有限意识:代理可能保留冲突代码,或在未充分重新检查仓库并使用针对性测试验证修改后代码的情况下进行替换。这些发现表明,强大的自主性能尚不足以确保共享工作区协作所需的状态感知和适应行为,并指出检测工作区变化、将冲突编辑与任务调和以及验证受影响行为是未来优化的关键能力。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决现有代码智能体(coding agents)基准测试对真实共享工作区(shared workspace)交互场景刻画不足的问题。
具体而言,现有主流的仓库级基准测试(如SWE-Bench系列)通常采用静态评估范式:智能体在接收到任务描述和初始代码库后独立工作,最终根据测试通过率评分。这种范式忽略了真实软件开发中的一个关键交互维度——用户可能在任务进行过程中直接修改共享代码库中的可执行代码,从而改变智能体后续操作所观察到的程序状态。
论文通过分析SWE-chat数据发现,59.0%的会话包含用户导致的仓库变更,表明用户直接编辑代码是与消息反馈同等重要的交互渠道。然而,尚无现有基准系统评估智能体在以下情境下的表现:当用户注入的修改与任务完成相冲突时,智能体能否正确检测外部代码变更、协调冲突状态,并重新验证受影响的行为。
为此,论文引入SWE-Touch框架,核心目标是通过注入经过验证的、与任务要求相冲突的Counter-Edit(对抗性用户编辑),系统性地评估代码智能体在动态共享工作区中的状态感知能力与适应性行为,具体包括:
- 检测工作区变化:识别用户修改对当前修复轨迹的影响;
- 协调冲突编辑:在自身修复计划与用户代码之间进行正确取舍与整合;
- 重新验证受影响行为:针对修改后的代码状态执行针对性测试,确保修复的正确性。
简言之,该论文将代码智能体的评估从“孤立自主完成”拓展至“用户参与下的共享工作区协作”,揭示了当前智能体在应对用户实时代码干预时的脆弱性。
Q: 有哪些相关研究?
论文第2节(Related Work)系统梳理了相关研究,可归纳为以下两个主要方向:
1. 编码智能体基准测试(Benchmarks for coding agents)
该方向经历了从孤立代码生成到仓库级端到端修复的演进:
- 早期基准关注从自然语言规格说明进行自包含的程序合成,随后逐步扩展至复杂指令遵循、现实场景下的指导编辑、多样化函数与库调用,以及多步数据科学编程任务(代表工作:Austin et al., 2021
3
;Chen et al., 2021
6
;Chi et al., 2025
8
;Huang et al., 2024
19
;Zhuo et al., 2025
56
)。 - 仓库级软件工程基准将评估范式从孤立生成转向真实代码库中的 issue 修复,典型代表为 SWE-Bench
20
及其后续改进 SWE-bench Verified
9
。这类基准结合 issue 描述、代码仓库与测试套件,形成端到端的修复任务。 - 后续拓展进一步检验更长程的修复能力(SWE-Bench Pro
12
、DeepSWE
18
、FrontierSWE
10
、SWE-evo
22
、SWE-marathon
13
、Slopcodebench
31
、CodeClash
49
、Programbench
50
)、仓库探索行为(SWE-Explore
54
),以及智能体是否应对已正确仓库保持不动(Coding agents don’t know when to act
15
)。
SWE-Touch 与上述工作的核心区别在于:保留仓库级修复设置,但引入用户在任务执行过程中对共享代码库的实时修改,考察智能体在动态工作区中的状态感知与协调能力。
2. 用户与智能体交互(User interaction with agents)
该方向关注评估环境中人类用户的参与方式,可细分为三类:
- 通用交互式基准研究多轮对话与模拟用户行为,包括多样化或不协作的用户策略(UserBench
34
、Non-collaborative user simulators
40
、DEMO
44
、 τ -bench
52
),以及双方在共享环境中采取行动、智能体需跟踪用户引入状态变化的协作框架( τ^2 -bench
4
、Collaborative Gym
38
)。 - 编码领域交互式基准捕获了澄清需求、选择性求助、需求演进与纠正反馈等交互场景,但用户影响完全通过消息介导,不涉及对可执行代码库的直接修改(代表工作:Ask or assume?
14
;Dialogue SWE-bench
21
;ICAE-Bench
33
;SWE-Interact
37
;EvoCode-Bench
39
;HiL-Bench
42
;Ambig-SWE
43
;SWE-Together
46
;Talk2Code
51
;TOM-SWE
55
)。 - 代码状态同步与接受行为方面,SyncMind
16
考察智能体如何从与仓库不同步的状态中恢复;Baumann et al.
5
、Chen et al.
7
、Liang et al.
23
、Pan et al.
32
、Shukla et al.
41
等则文档化或分析了开发者在实践中如何选择性接受、修改或拒绝智能体生成的代码。
研究空白:尽管上述工作覆盖了消息交互与状态恢复,但尚无现有编码基准评估用户在任务进行期间主动修改可执行代码库的情形。SWE-Touch 通过向实时修复轨迹中注入模拟的、与任务冲突的用户代码编辑(Counter-Edit),填补了该空白,要求智能体在修改后的工作区状态下继续完成修复。
Q: 论文如何解决这个问题?
论文通过引入 SWE-Touch 框架来解决该问题。该框架在现有仓库级修复任务的基础上,向智能体正在执行的共享工作区中注入受控的、与任务要求相冲突的代码编辑(Counter-Edit),从而系统性地评估智能体检测、协调和验证用户代码变更的能力。具体实现分为三个核心阶段:
1. 挖掘任务关键区域(Task-Critical Regions)
论文首先通过多模型轨迹交集定位与任务完成高度相关的代码区域。将代码区域表示为 r = (p, s, e) ,其中 p 为仓库相对路径,$
s, e
为包含性行区间,其覆盖行集合记为 L(r) = (p, ell) : s le ell le e$。通过运行来自不同模型家族(如 GPT 5.5、GLM 5.1、MiniMax M2.7)的修复轨迹,分别对读取(Read)和编辑(Edit)证据进行跨轨迹交集:
Ci^X = ∩(τ ∈ Z_i, X(τ) ne ∅) L(X(τ)), quad X ∈ Read, Edit
得到读取核心 C_i^(Read) 和编辑核心 C_i^(Edit) 。随后按确定性优先级(编辑证据优先于读取证据,实现文件优先于测试或元数据)选取至多八个关键区域 C_i ,作为后续用户编辑的锚点。
2. 构造并验证 Counter-Edit(User Edit Construction)
论文设计了一个独立的 User Patch Generator(由 GPT 5.5 驱动),其唯一目标是生成看似合理、但与正确修复相冲突的小型代码补丁。生成器围绕关键区域 C_i 检查周边代码,输出一个语法有效的统一差异格式补丁 p_i^- (即 Counter-Edit),该补丁仅修改实现代码,不改动测试或基准元数据。
每个候选补丁必须通过以下三项验证(记 R_i^0 为初始代码库, p_i^star 为参考修复):
- 令 R_i^- = Apply(R_i^0, p_i^-) , R_i^star = Apply(R_i^0, p_i^star) , R_i^(-star) = Compose(R_i^0, p_i^-, p_i^star) ;
- 验证条件为:
V_i^F(R_i^-) = 0, quad V_i^F(R_i^star) = 1, quad V_i^F(R_i^(-star)) = 0
即 Counter-Edit 单独不能解决任务,参考修复能够解决任务,而两者组合后仍然失败。这确保了用户编辑既非可忽略的无害修改,也非独立正确的修复,从而迫使智能体必须主动协调冲突。
3. 共享工作区评估(Shared Workspace Evaluation)
在评估阶段,框架监控智能体的实时动作,并在其访问与补丁区域 U_i (实际被编辑覆盖的区域)重叠的代码时,尝试注入用户编辑,最多尝试 K=3 次。当触发条件满足时,运行时将补丁应用到当前仓库状态 R_t ,并附带一条由用户模拟器生成的情境化自然语言消息(基于轨迹历史、候选差异和干预阶段 j 生成),共同交付给智能体。
智能体随后从被修改后的仓库状态继续执行,最终通过原始验证器 V_i 判定是否解决任务。论文通过对比 Vanilla(自主无干预运行)与 Counter-Edit(注入冲突编辑)条件下的通过率(resolve rate),量化智能体在共享工作区中的鲁棒性。此外,论文还引入了 Co-Edit 作为对照条件——注入与任务方向一致但不足以独立完成修复的小幅编辑——以排除“任何外部修改都会干扰智能体”这一替代解释。
通过上述流程,SWE-Touch 将评估焦点从静态的孤立修复能力,转向动态共享工作区中的状态感知、冲突协调与行为再验证能力。
Q: 论文做了哪些实验?
论文开展了多组实验,涵盖主评估、长程任务扩展、消融控制以及轨迹行为分析四个层面。以下是系统梳理:
1. 实验设置
任务与接口
- 主评估:从 SWE-bench Verified
9, 20
中随机抽取 200 个任务,要求三个区域挖掘模型(GPT 5.5、GLM 5.1、MiniMax M2.7)均能产生完整自主轨迹。 - 长程扩展:各选取 25 个任务 来自 SWE-Bench Pro
12
与 DeepSWE
18
。 - 智能体接口:统一采用 Mini-SWE-Agent shell 接口
47
;主评估预算为 100 步,长程任务预算为 500 步。
评估模型 共测试 9 个代码模型:
Claude Opus 4.8
2GPT 5.5
30GLM 5.1
53MiniMax M2.7
26
/ M2.5
25Qwen 3.7 Max
36Qwen3-Coder-480B-A35B
35Kimi K2.6
27DeepSeek V4 Pro
11
评估条件与指标
- Vanilla:智能体自主运行,无用户干预。
- Counter-Edit:运行时注入与任务冲突的 Counter-Edit,并附带情境化用户消息。
- 指标:解决率(resolve rate,通过完整验证器的任务百分比)、保留率(retention,Vanilla 多数解决任务在 Counter-Edit 下仍多数解决的比例)、步数(steps,模型调用次数)、归一化总 token 消耗(每完成任务的千级 token 数)。
2. 主评估:Vanilla 与 Counter-Edit 对比(SWE-bench Verified)
在 200 个 SWE-bench Verified 任务上,每个模型运行 3 次独立实验,对比自主运行与注入冲突编辑后的表现:
- 平均解决率下降 7.7 个百分点,所有模型均呈负增长,但个体损失差异显著(1.3 至 16.5 点不等)。
- 排名重洗:例如 MiniMax M2.7 与 M2.5 在 Vanilla 下差距仅 0.8 点,但 Counter-Edit 后 M2.5 反超;Qwen 3.7 Max 从落后 M2.7 变为领先。
- 保留率:Claude Opus 4.8(96.0%)与 GPT 5.5(95.0%)表现最稳定;Qwen3-Coder-480B 仅保留 60.8%。
- 资源消耗:Counter-Edit 下 7/9 的模型消耗更多步数与 token,但更多调用并不必然带来更小损失。
3. 长程任务扩展(SWE-Bench Pro 与 DeepSWE)
为验证缺陷是否在更长程、多文件编辑场景中持续,论文在 SWE-Bench Pro 和 DeepSWE 上进行了额外实验:
- 干预方式:因长程任务探索范围更广,改为按 Vanilla 轨迹长度的固定比例(25%、50%、75%)注入 不同的局部编辑,确保每位智能体必然收到干预。
- 结果:解决率下降在两个基准上均持续存在,但受损模型组合不同。
- Claude Opus 4.8 与 GPT 5.5 在 SWE-Bench Pro 上无变化,但在 DeepSWE 上分别下降 10.0 与 8.0 点。
- GLM 5.1 与 Qwen 3.7 Max 在 SWE-Bench Pro 下降更明显(分别为 10.3 与 10.0 点)。
- 步数增加:多数模型在 Counter-Edit 下步数增加(如 GLM 5.1 在 DeepSWE 上增加 31.4 步),但额外调用未转化为有效恢复。
4. 消融与控制实验
消息 vs. 代码编辑的分离效应
- 仅发送消息(无代码变更):影响有限且不一致(−2.0 至 +3.0 点)。
- 静默应用代码编辑(无消息):所有模型一致下降(−1.0 至 −9.5 点),表明智能体需从代码本身检测冲突。
- 消息+代码组合:并未一致改善;部分模型(如 GLM 5.1)略有恢复,其余表现更差。
编辑频率(K 值)敏感性
- 在 SWE-bench Verified 上,部分模型(MiniMax M2.7、Qwen 3.7 Max)随 K 从 1 增至 5 稳定恶化;部分(GPT 5.5、GLM 5.1)在中间预算持平或部分恢复。
- 在长程基准上,SWE-Bench Pro 的平均损失随 K 增加而加深( K=1 时 −3.9 点, K=5 时 −6.7 点);DeepSWE 则在 K ge 3 时趋于平稳,暗示额外暴露可能为强模型提供定位线索。
Co-Edit 对照
- 注入与任务方向一致、但不足以独立解决任务的小幅正向编辑(Co-Edit)。
- 结果:7 个模型平均变化仅 −0.1 点,6 个模型波动在 ±1.2 点以内;而同一批模型在 Counter-Edit 下平均损失 7.2 点。
- 该对照排除了“任何外部工作区修改都会干扰智能体”的替代解释,确认核心难点在于协调与任务冲突的程序状态。
5. 智能体行为轨迹分析
失败模式审计 对 Vanilla 解决但 Counter-Edit 未解决的 526 条运行轨迹进行人工标注(双标注+仲裁),分类结果如下:
- 保留冲突(Retained conflict):63.3% 的失败仍在最终代码中保留了用户的有害编辑。
- 错误替换(Incorrect replacement):13.9% 的智能体主动替换用户编辑,但替换本身错误。
- 不完全协调(Incomplete reconciliation):11.6% 的修复未在关联状态、调用者或分支间完整传播。
- 离靶实现(Off-target):5.5% 的缺陷出现在远离用户编辑的区域。
- 模型间差异显著:MiniMax M2.7、M2.5 与 DeepSeek V4 Pro 的保留冲突占比超 70%;Claude Opus 4.8 仅 17.2%,但错误替换占比高达 37.9%。
最终编辑后的行为窗口 在最后一次用户编辑后的诊断样本中,将智能体响应分为三类:
- 对抗(Counteract):移除或替换用户编辑;
- 遵循(Follow):保留或基于用户编辑继续构建;
- 无承诺(No commitment):仅检查但未明确表态。
分析发现:
- GPT 5.5 在 90% 轨迹中对抗编辑,尽管后续读取命令较少;Claude Opus 4.8 对抗率为 80%。
- Kimi K2.6 同样达到 80% 对抗率,但读取次数约为 GPT 5.5 的三倍,表明定位与理解冲突的效率存在模型差异。
- 对抗本身不保证恢复:28% 的对抗轨迹最终仍未解决。
成本–性能偏移 在长程基准上绘制各模型 Vanilla 到 Counter-Edit 的成本(美元)与解决率变化箭头图(Figure 3a),显示多数模型向右上方移动——即成本增加但性能下降,表明额外计算投入未能有效买回解决率。
Q: 有什么可以进一步探索的点?
基于论文第7节(Limitations & Future Work)及实验发现,可进一步探索的方向包括:
1. 扩展干预类型与交互空间
SWE-Touch 当前采用受控的、与任务冲突的 Counter-Edit 作为基础评估条件。未来可在此基础上,系统性地扩展用户贡献的类别,构建更丰富的协作评估套件:
- 互补性编辑(complementary edits):用户提供的修改与任务方向一致、可部分推进修复,考察智能体能否识别并整合有用贡献;
- 部分正确修复(partially correct fixes):用户编辑解决了部分症状但未通过全部验证,测试智能体在已有基础上的补全能力;
- 需求变更(requirement changes):用户在执行过程中修改 issue 描述或目标行为,评估智能体对动态需求的适应;
- 模糊或开放式干预:引入不明确用户意图的编辑,检验智能体的澄清求助行为。
2. 走向全双工协作的用户模拟器
当前评估采用基于区域的确定性触发规则(region-triggered delivery),虽保证了实验的可比性,但与真实开发流程仍有距离。未来可探索:
- 自适应用户模拟器:模拟器实时观察智能体的动作、diff 输出与测试结果,动态决定干预的时机、内容与方式,而非预先固定触发点;
- 双向状态跟踪:用户不仅修改代码,还可能根据智能体的反馈再次调整,形成多轮“用户–智能体–用户”的循环;
- 干预策略的多样化:模拟不同风格的用户(如保守型、激进型、非协作型),评估智能体在异质协作风格下的鲁棒性。
3. 从评估到训练:协作感知型智能体
论文指出当前优化过度聚焦于静态排行榜性能,未能转化为共享工作区中的鲁棒性。未来研究可设计显式奖励协作行为的训练目标:
- 外部变化检测奖励:鼓励智能体在执行读取/编辑前,显式检查工作区状态是否被外部修改;
- 意图推断与贡献整合:训练智能体判断用户编辑是 helpful、incomplete、ambiguous 还是 conflicting,并据此选择接受、扩展、修正或澄清;
- 冲突解决与再验证:在强化学习或模仿学习框架中,奖励成功协调冲突状态并运行针对性测试的行为,而非仅奖励最终测试通过率;
- 失败模式专项训练:针对轨迹分析中发现的典型失败(如保留冲突、错误替换、不完全协调)构建课程学习或专项微调数据。
4. 增强状态感知与验证机制
实验显示,63.3% 的失败源于智能体保留了用户的有害编辑,且额外调用往往未转化为有效恢复。未来可探索:
- 显式工作区同步机制:在智能体架构中引入“diff 感知”模块,自动对比当前代码与先前信念状态的差异,生成变更摘要;
- 对抗性编辑的自动定位:训练智能体在收到用户消息后,优先检查最近被修改的区域,而非按原有计划继续执行;
- 针对性回归测试:开发轻量级测试选择策略,确保用户编辑触及的代码路径在后续步骤中被优先验证,而非仅运行通用测试套件。
5. 模型特定弱点的精细化改进
轨迹分析揭示不同模型的失败模式存在显著差异,未来可针对模型族进行定向优化:
- 高“保留冲突”模型(如 MiniMax M2.7、DeepSeek V4 Pro):需改进其对用户权威的过度服从,增强在代码层面挑战并替换错误编辑的决策能力;
- 高“错误替换”模型(如 Claude Opus 4.8):需提升替换后的验证严谨性,确保对抗用户编辑后的替代方案经过充分测试与跨组件一致性检查;
- 高资源消耗低回报模型:研究如何在增加步数的同时提升有效信息获取效率,避免无效的重读与重复搜索。
Q: 总结一下论文的主要内容
该论文研究了代码智能体在共享工作区中应对用户实时代码修改的能力,指出现有基准测试多假设智能体孤立工作,忽略了真实开发中用户会直接修改可执行代码库这一关键交互维度。为此,论文提出 SWE-Touch 框架,通过向进行中的修复任务注入经过验证的、与任务要求相冲突的 Counter-Edit(对抗性用户编辑),系统评估智能体检测外部变更、协调冲突状态并重新验证受影响行为的能力。
核心方法
SWE-Touch 包含三个关键阶段:
任务关键区域挖掘:通过多模型(GPT 5.5、GLM 5.1、MiniMax M2.7)修复轨迹的交集,定位与任务高度相关的代码区域 r = (p, s, e) ,其中 p 为文件路径,$
s, e
$ 为行区间。利用公式
Ci^X = ∩(τ ∈ Z_i, X(τ) ne ∅) L(X(τ)), quad X ∈ Read, Edit
提取读取核心与编辑核心,并选取至多八个关键区域。Counter-Edit 构造与验证:由独立的 User Patch Generator 生成小型的、看似合理但编码错误假设的补丁 p_i^- 。每个补丁必须满足三项验证:
V_i^F(R_i^-) = 0, quad V_i^F(R_i^star) = 1, quad V_i^F(R_i^(-star)) = 0
即用户编辑单独不能解决任务、参考修复可以解决任务、两者组合后仍然失败,从而确保冲突的不可忽略性。共享工作区评估:在智能体访问与补丁区域重叠的代码时,将编辑与情境化用户消息注入工作区,智能体从修改后的状态继续执行,最终通过原始验证器判定。
主要实验结果
论文在 SWE-bench Verified(200 任务)及更长程的 SWE-Bench Pro、DeepSWE(各 25 任务)上评估了 9 个模型:
- 性能普遍下降:在 SWE-bench Verified 上,Counter-Edit 使平均解决率下降 7.7 个百分点,个体损失从 1.3 到 16.5 点不等,且显著重洗了模型排名。
- 稳定性分化:Claude Opus 4.8(96.0%)与 GPT 5.5(95.0%)的保留率最高;Qwen3-Coder-480B 保留率仅 60.8%,损失最大(16.5 点)。
- 长程任务持续受损:在 SWE-Bench Pro 与 DeepSWE 上,退化依然存在,但受损模型组合不同。多数模型在 Counter-Edit 下消耗更多步数与 token,却未能有效恢复。
- 失败模式集中于状态感知缺失:轨迹审计显示,63.3% 的失败是因为智能体最终保留了用户的冲突代码;其余则源于错误替换(13.9%)或不完全协调(11.6%)。模型间失败原因差异显著,部分模型过度服从用户编辑,部分虽主动对抗但验证不足。
消融与控制
- 仅发送消息几乎不影响结果(−2.0 至 +3.0 点),而静默应用代码编辑导致一致下降,说明检测冲突主要依赖代码状态而非语言提示。
- Co-Edit 对照(注入有帮助但不完整的外部编辑)平均仅造成 −0.1 点波动,证实核心难点在于处理与任务冲突的程序状态,而非外部修改本身。
核心结论与贡献
- 评估维度拓展:将交互式编码评估从纯消息反馈推进到用户直接修改共享工作区的场景。
- 关键能力缺口:当前代码智能体的自主解决率不能可靠预测其在共享工作区中的表现;强大的静态 leaderboard 性能并未确保所需的状态感知与适应性行为。
- 未来优化方向:未来编码智能体需显式具备三种能力——识别工作区变化、协调冲突编辑与任务要求、对修改后行为进行针对性再验证,方能适应真实的人机协作开发环境。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yuqiao Tan,Jinxiang Meng,Fangyu Lei,Minzheng Wang,Shizhu He,Jun Zhao,Kang Liu
PDF URL: https://arxiv.org/pdf/2608.02499.pdf
Arxiv URL: https://arxiv.org/abs/2608.02499
Arxiv ID: 2608.02499
CoolPaper URL: https://papers.cool/arxiv/2608.02499
Published: 2026-08-05T01:03:05.961Z
Updated: 2026-08-05T01:03:05.961Z
13. WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning
Abstract:Reinforcement learning (RL) post-training of Vision-Language-Action (VLA) models has shown strong promise for robotic manipulation. Among RL methods, critic-based approaches rely on a value estimator that predominantly operates on single-frame observations or single-frame VLM backbone latents, which is a fundamental mismatch with the partially observable nature of robot control. A naive approach to incorporate observation history into the critic incurs exponential complexity with high-dimensional visual space, and still fails because pure scalar-return regression provides insufficient supervision for learning cross-temporal dynamics. We identify the root cause as a state approximation problem: without an explicit world modeling objective, the critic’s representation cannot capture the temporal structure needed for accurate value estimation. To address this, we propose the World Critic Model (WCM), built on a lightweight LeJEPA architecture; WCM jointly predicts future latent state and estimates values, such that the critic’s representation is explicitly trained to capture temporal dynamics rather than merely regress scalar returns. WCM integrates seamlessly into both on-policy and off-policy training pipelines and is compatible with state-of-the-art VLA backbones including Pi0, Pi0.5, and OpenVLA-OFT. Extensive experiments on 149 tasks across four benchmarks demonstrate that WCM consistently achieves state-of-the-art performance in both in-distribution and out-of-distribution settings, with particularly strong generalization gains. We further validate WCM on seven real-world manipulation tasks using OpenVLA-OFT and Pi0.5 with off-policy RL, confirming stable deployment across diverse settings.
中文摘要
摘要:视觉-语言-动作(VLA)模型的强化学习(RL)后训练在机器人操作中表现出强大的潜力。在RL方法中,基于评论者的方法依赖于一个值估计器,该估计器主要在单帧观测或单帧VLM骨干潜变量上操作,这与机器人控制的部分可观测性质存在根本不匹配。将观测历史纳入评论者的简单方法在高维视觉空间下会带来指数级复杂性,并且仍然失败,因为单纯的标量回归无法提供足够的监督来学习跨时间的动态。我们将根本原因归结为状态近似问题:如果没有明确的世界建模目标,评论者的表示无法捕捉准确值估计所需的时间结构。为了解决这一问题,我们提出了世界评论者模型(WCM),其构建在轻量级的LeJEPA架构上;WCM联合预测未来潜状态并估计价值,使评论者的表示明确接受训练以捕捉时间动态,而不仅仅是回归标量回报。WCM能够无缝集成到策略内和策略外的训练流程中,并兼容包括Pi0、Pi0.5和OpenVLA-OFT在内的最先进VLA骨干。在四个基准测试的149个任务上的大量实验表明,WCM在分布内和分布外场景中均能持续实现最先进的性能,表现出特别强的泛化能力。我们进一步在七个真实世界操作任务上使用OpenVLA-OFT和Pi0.5进行策略外RL实验验证了WCM,确认其在多样化场景中的稳定部署。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决基于Critic的Vision-Language-Action强化学习(VLA-RL)中,价值估计与机器人控制部分可观测性之间的根本性错配问题。
具体而言,现有方法存在以下核心局限:
- 单帧输入的信息缺失:现有Critic模型主要依赖单帧观测或单帧VLM骨干网络的隐特征进行价值估计。然而,机器人操控本质上是一个部分可观测马尔可夫决策过程(POMDP),单帧图像虽能捕捉物体外观与场景布局,却常缺失关键动态信息(如运动趋势、接触进度、未来状态演化等),导致价值估计不准确。
历史信息引入的失效:简单扩展输入以包含观测历史(如帧堆叠或时序聚合)并不能可靠解决问题。在高维视觉空间中,这种做法计算代价高昂;更关键的是,纯标量回报回归提供的监督信号过于稀疏,无法有效引导模型学习跨时间动态,Critic可能仅将历史输入视为更大的静态特征向量,而未真正学习环境如何随时间演化。
表征瓶颈的根源:论文将此问题归结为状态近似问题——缺乏显式的世界建模目标,Critic的表征无法捕捉准确价值估计所需的时序结构。经典POMDP理论表明,最优决策依赖于历史信息的充分统计量以及对未来状态的预测性表征,而非仅依赖瞬时观测。
为应对上述挑战,论文提出了World Critic Model(WCM)。该模型的核心思想是:
通过轻量级LeJEPA架构,将世界建模与价值估计统一在端到端框架中:给定历史观测序列,WCM在预测未来潜在状态动态的同时估计状态价值。由此,Critic的表征被显式地训练以编码环境动力学,而非仅仅回归标量回报,从而更好地逼近预测性状态表示(即对任务相关未来结果的紧凑且可更新的摘要)。
Q: 有哪些相关研究?
根据论文第2节(Related Works)及全篇引用,相关研究可归纳为以下五个方向:
1. Vision-Language-Action (VLA) 模型与RL后训练范式
VLA模型在大规模机器人操控与图文数据上预训练后,经任务特定数据后训练展现出优异性能与泛化潜力。代表性架构分为两类:
- 自回归(AR)模型:如OpenVLA-OFT、RT-2、FAST等,通过next-token prediction生成动作;
- 流匹配(Flow-matching)模型:如 π0 、 π(0.5) 、 π_(0.7) 等,通过常微分方程(ODE)学习从噪声到动作分布的连续概率路径。
传统监督微调(SFT)受限于专家演示的覆盖范围,而RL通过环境交互优化策略,在分布内(IND)与分布外(OOD)场景中均展现出更强的泛化性、更平滑的部署效果以及更好的sim-to-real迁移能力。对于AR模型,可直接利用动作的对数概率应用PPO、GRPO、SAC、IQL、AWR等标准RL算法;流匹配模型由于涉及确定性ODE过程,则需显式注入随机性(如Flow-SDE、Flow-Noise、Flow-GRPO、DPPO)以适配RL训练。
2. VLA-RL中的Critic模型与部分可观测性
Critic模型在on-policy与off-policy VLA-RL中均提供密集监督,是样本效率与最终性能的关键因素。现有Critic大多从单帧观测或VLM骨干网络的单帧隐特征中回归标量价值,隐式假设单帧足以重建系统状态。然而,机器人操控本质上是部分可观测马尔可夫决策过程(POMDP),单帧常缺失运动、接触进度等动态信息。尽管近期研究认识到历史信息对VLA策略的重要性,但将历史有效融入Critic的工作仍较为匮乏。
3. 部分可观测决策与历史信息表征
经典POMDP理论(如预测状态表征,PSR)指出,最优决策依赖历史信息的充分统计量与对未来状态的预测性表征,而非仅依赖瞬时观测。在VLA-RL之外,已有研究尝试将历史信息融入Critic(如基于循环神经网络的值函数或帧堆叠方法),但这些扩展在VLA-RL的高维视觉空间中面临根本性困难:大观测空间导致计算与优化困难,稀疏的标量监督难以支撑跨时间动态学习,且缺乏显式的帧间动力学学习信号易导致表征坍缩。
4. 世界模型与世界动作模型
世界模型通过预测未来状态提供密集监督信号,有助于学习可迁移的表征。近期,World Action Model (WAM) 及其变体(如Cosmos Policy、Motus)通过联合输出动作与未来预测,验证了世界预测作为学习目标的有效性。类似研究表明,良好的状态表征应具备预测自身未来的能力,这为WCM将世界建模与价值估计统一提供了理论动机。
5. 带历史感知的VLA策略
近期若干工作开始探索将历史感知机制引入VLA策略本身,例如通过感知-认知记忆(MemoryVLA)、历史感知策略切换(HAMLET)或多帧潜在运动迁移(CronusVLA)来增强策略的时序推理能力。然而,这些工作主要聚焦于策略网络的历史建模,而非针对Critic的价值估计进行时序动态显式建模。
Q: 论文如何解决这个问题?
论文通过提出 World Critic Model (WCM),以“联合未来预测与价值估计”的统一架构解决上述问题。具体方法论如下:
1. 核心思想:将世界建模作为表征学习的显式目标
不同于简单堆叠历史帧或仅用标量回报监督历史编码,WCM 将 Critic 的表征学习从“纯回报回归”重新定义为预测性状态重构。其关键假设是:若 Critic 的隐状态能够准确预测未来潜在动态,则该表征必然编码了足够的时间结构,从而更逼近 POMDP 中真实隐藏状态的充分统计量。
2. 模型架构(基于轻量级 LeJEPA)
WCM 由四个可端到端训练的组件构成,输入为过去 K 帧观测历史与语言指令:
观察编码器:独立处理每一帧观测,生成逐帧潜在嵌入
z(t-k) = encε(o_(t-k)),quad ∀ k ∈ 0, 1, dots, K-1语言适配器:将 CLIP 编码的语言指令 ell 映射到 WCM 的潜在空间
uell = A(lang)(CLIP(ell)) ∈ R^d世界预测器(因果 Transformer 历史主干):对语言条件化的视觉历史序列进行因果建模,输出隐状态
ht = Trφ(XAttn(z_(t-K+1:t), u_ell)) ∈ R^d双分支解码头:
价值头:基于隐状态估计标量价值
Vt = D(value)(h_t) ∈ R世界预测头:基于隐状态、当前动作 at 与当前潜在状态 z_t ,通过门控 FiLM 残差块预测下一时刻潜在状态
z(t+1) = D_(world)(h_t, a_t, z_t) ∈ R^d
3. 训练目标:三损失联合优化
总损失函数由价值回归、未来状态预测与潜在空间正则化三部分组成:
L = L(value) + λ · L(pred) + eta · L_(SIGReg)
各分项定义如下:
世界预测损失(提供密集时序监督): 采用教师强制(teacher-forcing)最小化预测与真实下一潜在状态的 L2 误差
L(pred) = |z(t+1) - z(t+1)|_2^2价值估计损失(保留原始 RL 监督): 最小化预测价值与折扣回报 Gt 之间的 L_2 误差。其中回报基于稀疏任务奖励计算:
r_t = 0 & if t=T and success, -C(fail) & if t=T and failure, -1 & otherwise,
Gt = ∑(t’=t)^(T) γ^(t’-t) r(t’)
经 min-max 归一化至 $
-1, 1
$ 后:
L(value) = |V_t - G_t|_2^2
- SIGReg 正则化(防止潜在空间坍缩): 通过随机单位向量投影,强制潜在表示 z 的各一维投影匹配标准正态分布的特征函数,从而鼓励各向同性高斯潜在空间,避免维度坍缩或模式退化:
L(SIGReg) = E(a sim U)(S^(d-1)) [ ∫(R) |φ(a^top z)(t) - φ(t)|^2 e^(-t^2) dt ]
其中 φ(t) = e^(-t^2/2) 为标准正态特征函数, φ_(a^top z)(t) 为投影后经验特征函数。
4. 与现有 RL 训练管线的无缝集成
WCM 作为 Critic 模块可直接替换现有 VLA-RL 框架中的价值网络,兼容 on-policy 与 off-policy 设置:
- On-policy 设置:
- 对自回归模型(如 OpenVLA-OFT):采用 PPO,WCM 替代原始 MLP Critic,利用历史观测估计价值并计算 GAE 优势。
- 对流匹配模型(如 π0 、 π(0.5) ):采用 Flow-SDE,同样以 WCM 作为 Critic 提供优势估计。
- Off-policy 设置:
- 对自回归模型:采用 AWR,利用 SFT 数据与策略 rollout 数据共同更新 WCM。
- 对流匹配模型:采用 RECAP,在统一数据缓冲区(包含专家演示与失败轨迹)上联合更新 WCM 与策略。
在这两种设置中,策略网络的更新方式保持不变,仅将价值估计来源替换为 WCM。
5. 解决原始问题的关键机制总结
| 原始问题 | WCM 的解决方式 |
|---|---|
| 单帧观测缺失动态信息 | 显式编码 K 帧历史,并通过因果 Transformer 建模时序依赖 |
| 历史输入被视为“更大的静态向量” | 引入未来潜在状态预测任务,强制表征捕获跨帧演化而非静态汇总 |
| 标量回报监督稀疏 | 世界预测损失提供逐帧密集梯度,补充价值回归的弱监督信号 |
| 价值估计在 POMDP 中不准确 | 预测性状态表征更逼近真实隐藏状态的充分统计量,从而提升价值估计精度与策略梯度质量 |
Q: 论文做了哪些实验?
论文围绕仿真与真实机器人环境开展了系统性实验,涵盖性能对比、泛化评估、消融分析与机制可视化。具体实验内容如下:
1. 实验设置
仿真基准:在共计 149 个任务 上评估,覆盖四个基准:
- ManiSkill:评估分布内(IND)与分布外(OOD)性能,OOD 沿视觉、语义、执行三个维度施加扰动;
- MetaWorld:评估非拾取-放置类任务(如需要稳定接触的任务);
- CALVIN:评估长程操控能力;
- LIBERO-Plus:评估 VLA 模型的泛化能力。
真实世界平台:WidowX-250S 机械臂,配备第三视角与腕部相机,控制频率 10 Hz。
基线方法与骨干网络:
- On-policy:Flow-SDE、Flow-Noise、 π -stepNFT、PPO、GRPO;
- Off-policy:AWR、RECAP;
- 策略骨干: π0 、 π(0.5) 、OpenVLA-OFT。
2. 主要仿真结果
ManiSkill IND/OOD(表 1):
- 在 π0 、 π(0.5) 与 OpenVLA-OFT 上,以 WCM 替换原始 Critic 后,IND 与 OOD 成功率均显著提升;
- OpenVLA-OFT 在零样本初始化(Success Rate 仅 0.78%)下,经 RL 训练后提升至 98.7%,相对提升达 +97.9%(↑12551%)。
MetaWorld 与 CALVIN(图 4):
- MetaWorld 上,WCM 在需要稳定接触的任务中优于基线;
- CALVIN 上,WCM 的平均任务完成长度更高,体现更强的长程能力。
3. 泛化性能
LIBERO-Plus(表 2):
- 从仅含单条演示的 SFT 初始化(One-SFT)出发,经约 250 步 RL 训练后,WCM 在相机、环境、初始状态、语言、噪声、布局、光照等七个泛化维度上均超越使用 50 条演示训练的 Full-SFT 模型。
OOD 泛化:
- 在 ManiSkill-OOD 上,WCM 的 OOD 平均成功率显著优于传统 Flow-SDE 与 PPO,且超过以 OOD 性能著称的 π -stepNFT。
4. 真实世界实验(表 3)
在 7 个物理任务 上开展 off-policy RL 训练,包括:
- 动态操控:旋转寿司拾取;
- 可变形物体:布折叠、毛巾折叠;
- 长程任务:灶台清洁;
- 拾取-放置:胡萝卜、香蕉、辣椒。
以 OpenVLA-OFT + AWR 与 π_(0.5) + RECAP 为基线,WCM 在所有任务上均取得更高成功率,且行为更平滑(如避免单帧 Critic 导致的 tabletop 碰撞与抓取后延迟)。
5. 消融与机制分析
世界预测目标的必要性(图 5): 对比三种 Critic 架构:
- MLP Value Head:原始基线,仅单帧输入;
- ViT Value Head:WCM 变体但令 λ = 0 (无世界预测),仅具时序建模能力;
- WCM Value Head:完整模型( λ > 0 )。
结果表明:
- 简单扩展历史帧数(2–5 帧)对 MLP 提升有限甚至次优;
- 纯时序 ViT( λ=0 )仍不足;
- 引入世界预测目标后,各配置下成功率均达最高。
观察历史长度的影响(图 5):
- 将历史长度 K 从 1 增至 5,发现 K=3 平均表现最佳;
- 论文推测三帧可隐式捕捉二阶动力学(加速度),而两帧仅捕捉一阶(速度),对本任务集已足够。
6. 附录中的补充实验
训练目标权重 λ 的影响(附录 A,图 6):
- 在 $
0.1, 0.9
范围内扫描 λ ,发现 IND 与 OOD 最优值均落在
0.3, 0.5
$; - OOD 对 λ 更敏感(波动 10.6%),且 λ=0.9 时 OOD 优于 λ=0.1 ,证实世界预测目标对泛化的正向作用。
Sim-to-real 迁移(附录 B,表 4):
- 对比纯仿真 SFT、仿真 RL、真实 SFT 及真实 SFT + 仿真 RL 等设置;
- 发现纯仿真 SFT 在真实环境完全失败(0/25),而经 RL 后策略具备一定 sim-to-real 能力;同时探讨了真实数据 SFT 后接仿真 RL 的复杂现象。
Critic 模型对泛化性的影响(附录 C,图 7):
- 观察到标准 Flow-SDE 的 OOD 性能在训练后期出现 “dropping phenomenon”(下降现象),暗示 Critic 过拟合;
- 固定 V(o)=0 的 Zero-Value 消融反而在可比 IND 水平下取得更好 OOD,进一步暗示传统 Critic 的过拟合风险;
- WCM 在前 500 步未观察到此类下降。
训练曲线(附录 D.4,图 11):
- 记录 8 种设置下从初始步到最优收敛的训练动态,验证稳定性。
价值曲线可视化(附录 E,图 12–13):
- 仿真中:WCM 对成功轨迹给出单调上升价值,对随机失败与近成功失败具有明显可分的价值模式;
- 真实世界中:尽管存在视觉噪声与次优演示,WCM 仍能区分成功与失败轨迹。
Critic 泛化热力图(附录 F,图 14):
- 在 LIBERO→LIBERO-Plus、LIBERO-Object→LIBERO-Goal、ManiSkill-IND→ManiSkill-OOD 三种跨分布设置中,WCM 的价值分布保持更好的判别性与稳定性,而基线 Critic 在 OOD 点出现极端离群值。
Q: 有什么可以进一步探索的点?
基于该论文的研究框架与实验发现,以下几方面值得进一步探索:
1. 自适应历史长度与选择性记忆机制
论文发现固定历史长度 K=3 在多数任务中表现最优,但这一结论可能受限于特定任务的动力学复杂度。未来可探索:
- 动态历史窗口:根据任务阶段或环境不确定性自适应调整 K ,例如在接触密集阶段延长历史,在静态定位阶段缩短历史。
- 选择性注意力记忆:引入可学习的记忆门控机制,使模型主动遗忘无关历史帧(如相机抖动),而非被动堆叠固定窗口。
2. 多步与多模态预测目标
当前 WCM 仅预测下一时刻潜在状态 z_(t+1) 。扩展预测目标可能增强表征的时空覆盖:
- 多步潜在预测:同时预测 z(t+1), dots, z(t+N) ,学习长期动力学一致性,这对长程任务(如 CALVIN 中的多阶段操作)尤为重要。
- 跨模态预测:除视觉潜在状态外,联合预测未来力/触觉反馈或本体觉变化,使 Critic 在接触丰富的操控中能更准确地估计价值。
3. 不确定性量化与风险敏感探索
现有世界预测头输出点估计,未能利用预测不确定性指导策略:
- 概率性世界模型:令 D_(world) 输出潜在状态的高斯分布或潜变量分布,通过预测方差衡量模型置信度。
- 乐观/悲观价值估计:在探索阶段使用乐观价值函数(如加入预测不确定性 bonus),在安全关键任务中使用悲观估计,从而提升样本效率与安全性。
4. 与模型预测控制(MPC)的深度耦合
WCM 已具备动作条件化的未来预测能力,可进一步打破 Critic 与策略的严格分离:
- 隐式 MPC:利用 WCM 在潜在空间中进行短程 rollout,通过预测未来价值梯度直接优化当前动作序列,而非仅提供标量价值供策略梯度使用。
- Crollout 规划:在推理阶段,利用学习到的世界模型进行蒙特卡洛树搜索或交叉熵方法(CEM)规划,验证动作可行性。
5. POMDP 框架下的理论分析
论文将问题建模为 POMDP,但未提供 WCM 价值估计的收敛性或误差界:
- 表征误差与价值逼近界:量化潜在状态预测误差 |z(t+1) - z(t+1)| 如何传导至价值估计误差 |V_t - V^*_t| ,并证明在可学习的预测性状态表征下,策略梯度估计的偏差上界。
- 历史充分统计量的完备性:分析 LeJEPA 架构在什么条件下能恢复真实信息状态(information state)的近似充分统计量。
6. 持续学习与灾难性遗忘抑制
真实世界实验涉及多任务增量训练,但论文未深入讨论知识保持:
- 任务自适应正则化:在持续接入新任务数据时,通过 EWC、弹性权重巩固或潜在空间正交化约束,防止早期任务的价值表征被覆盖。
- 模块化 Critic:为不同技能学习分离的潜在动态子空间,通过路由机制组合,支持机器人终身学习。
7. 边缘部署与计算效率优化
尽管 LeJEPA 已属轻量,真实机器人推理仍需考虑实时性:
- 模型量化与蒸馏:将 WCM 的 Transformer 历史主干蒸馏为更小的因果 ConvNet 或 Mamba 架构,在维持时序建模能力的同时降低延迟。
- 异步价值估计:解耦高频策略推理与低频 Critic 更新,使世界预测头仅在策略请求优势估计时触发,减少计算冗余。
8. 失败检测与自主恢复策略
附录 E 的价值曲线显示 WCM 能区分失败轨迹,这一特性可用于闭环控制:
- 基于价值骤降的失败预警:当 V_t 连续多步下降并低于阈值时,触发预定义的恢复原语(reorientation、re-grasp)。
- 价值引导的重试机制:在检测到局部最优或碰撞风险时,利用历史价值梯度回溯至更高价值状态重新规划。
9. 多智能体与人机协作扩展
当前 WCM 聚焦于单机器人单臂操控:
- 他者行为预测:在多智能体或人机协作场景中,将其他智能体的观测历史纳入世界预测器的输入,学习联合潜在动态,从而估计交互状态下的社会价值函数。
- 人机共享控制中的价值对齐:利用 WCM 预测人类干预后的未来状态,实时调整机器人策略的价值估计以实现平滑交接。
10. 跨基准的 Sim-to-Real 机制深化
论文附录 B 初步揭示了仿真与真实数据训练的复杂交互:
- 域随机化与 WCM 联合训练:在仿真阶段对世界预测头施加显式的域随机化(如视觉参数、物理参数扰动),增强潜在动态对真实环境噪声的不变性。
- 真实数据驱动的仿真修正:利用少量真实 rollout 数据微调世界预测头(而非完整策略),实现仿真到现实的动态对齐(dynamic alignment),降低真实环境样本需求。
Q: 总结一下论文的主要内容
该论文围绕 Vision-Language-Action (VLA) 模型的强化学习后训练 展开,提出了一种新的 Critic 模型架构以解决机器人操控中的部分可观测性问题。
研究背景与动机
VLA 模型通过在大规模数据上预训练,已在机器人操控中展现出优异性能。然而,传统的监督微调(SFT)受限于专家演示的覆盖范围,而强化学习(RL)通过与环境交互能够进一步提升策略的泛化性与平滑性。在基于 Critic 的 VLA-RL 方法中,Critic 负责提供密集的价值监督,对样本效率和最终性能至关重要。
核心问题
现有 Critic 模型存在与部分可观测性的根本性错配:
- 单帧输入的信息缺失:现有方法大多从单帧图像或单帧 VLM 骨干网络隐特征中回归标量价值。但机器人操控本质上是部分可观测马尔可夫决策过程(POMDP),单帧无法捕捉运动、接触进度等关键动态信息。
- 简单历史扩展的失效:直接堆叠多帧或使用时序聚合在高维视觉空间中代价高昂,且纯标量回报回归提供的监督过于稀疏,无法有效引导模型学习跨时间动力学,导致历史信息被当作“更大的静态向量”处理,而无法真正建模环境演化。
方法:World Critic Model (WCM)
为解决上述问题,论文提出了 World Critic Model (WCM),其核心思想是将世界建模与价值估计统一在端到端框架中:
- 架构:基于轻量级 LeJEPA 架构,WCM 包含观察编码器、因果 Transformer 世界预测器,以及两个解码头——价值头(估计标量价值 Vt )和世界预测头(在动作条件化下预测下一时刻潜在状态 z(t+1) )。
- 训练目标:联合优化三类损失:
L = L(value) + λ · L(pred) + eta · L(SIGReg)
其中 L(value) 为标量价值回归损失, L(pred) 为未来潜在状态的 L_2 预测损失(提供密集时序监督), L(SIGReg) 为 SIGReg 正则化(防止潜在空间坍缩)。 - 兼容性:WCM 可直接替换现有 RL 框架中的 Critic,无缝集成到 on-policy(如 PPO、Flow-SDE)与 off-policy(如 AWR、RECAP)训练管线中,兼容 π0 、 π(0.5) 、OpenVLA-OFT 等主流 VLA 骨干。
实验验证
论文在 149 个仿真任务(涵盖 ManiSkill、MetaWorld、CALVIN、LIBERO-Plus 四个基准)和 7 个真实世界操控任务 上进行了系统验证:
- 仿真性能:WCM 在分布内(IND)和分布外(OOD)设置下均 consistently 达到 SOTA。例如,OpenVLA-OFT 从零样本的 0.78% 成功率提升至 98.7%,相对提升达 12551%;在 LIBERO-Plus 上,仅从单条演示出发的 RL 训练即可超越使用 50 条演示的 Full-SFT。
- 真实世界部署:在动态抓取、可变形物体操作、长程任务等场景中,WCM 相比标准 VLM-Critic 基线取得更高成功率与更平滑的操作表现。
- 消融分析:验证了世界预测目标的必要性(单纯时序 ViT 即 λ=0 不足以带来提升),并发现历史长度 K=3 在实验任务中平均最优。
主要结论
WCM 通过显式地将未来潜在状态预测作为表征学习目标,使 Critic 的隐状态编码了环境时序动力学,从而更准确地逼近 POMDP 中真实隐藏状态的充分统计量。该方法不仅显著提升了 VLA-RL 的样本效率与最终性能,更在 out-of-distribution 泛化和真实机器人部署中展现出卓越的鲁棒性与可扩展性。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Senyu Fei,Xiaopeng Yu,Siyin Wang,Xianzhong Zhao,Jingjing Gong,Xipeng Qiu
PDF URL: https://arxiv.org/pdf/2607.29613.pdf
Arxiv URL: https://arxiv.org/abs/2607.29613
Arxiv ID: 2607.29613
CoolPaper URL: https://papers.cool/arxiv/2607.29613
Published: 2026-08-05T01:03:13.643Z
Updated: 2026-08-05T01:03:13.643Z
14. GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning
Abstract:Optimization-based latent reasoning improves large language model outputs by optimizing instance-specific continuous states at test time while keeping model parameters frozen. Existing methods, however, typically connect these states to the reasoning trajectory through decoded tokens, making sequence-level credit assignment indirect and obscuring how latent updates shape subsequent reasoning. We introduce GradCuit (gradient through circuit), which inserts optimizable latent states at a selected Transformer layer between the hidden representations of the prompt and the generated continuation. Causal self-attention provides every continuation-token log-probability with a differentiable path to every preceding latent state through the remaining Transformer blocks, enabling reward-weighted gradients from the entire continuation to be assigned directly to the latents. Across five instruction-tuned backbones, three reasoning benchmarks, and two answer formats, GradCuit achieves an average accuracy of 64.5%, outperforming chain-of-thought prompting by 6.6 percentage points and the strongest competing method by 2.4 points. GradCuit also demonstrates greater robustness: across seven learning-rate settings, it consistently outperforms LatentSeek while reducing the standard deviation of accuracy from 1.53 to 0.82, and even its random-walk variant remains competitive with LatentSeek. For interpretability, token-level gradient attribution reveals that latent influence concentrates on reasoning-connector tokens, while layer analysis identifies early-to-middle Transformer layers as the most effective optimization space. By directly optimizing internal reasoning from outcome feedback, GradCuit opens a new axis of robust and interpretable test-time scaling, where LLMs adapt how they reason rather than merely regenerate, sample, or rerank outputs.
中文摘要
摘要:基于优化的潜在推理通过在测试时优化实例特定的连续状态来提升大型语言模型的输出,同时保持模型参数不变。然而,现有方法通常通过解码的令牌将这些状态与推理轨迹连接起来,使序列级的信用分配变得间接,并掩盖了潜在更新如何影响后续推理。我们提出了GradCuit(梯度穿越电路),它在选定的Transformer层中插入可优化的潜在状态,位于提示的隐藏表示与生成的续写之间。因果自注意力为每个续写令牌的对数概率提供了一条可微分路径,可通过剩余的Transformer块传递到每个先前的潜在状态,使得来自整个续写的奖励加权梯度能够直接分配到潜在状态上。在五个经过指令调优的骨干模型、三个推理基准和两种答案格式上,GradCuit的平均准确率为64.5%,比链式思维提示高出6.6个百分点,比最强的竞争方法高出2.4个百分点。GradCuit还表现出更强的稳健性:在七种学习率设置下,它始终优于LatentSeek,同时将准确率标准差从1.53降低到0.82,即使是其随机游走变体仍然能与LatentSeek竞争。在可解释性方面,令牌级梯度归因显示潜在影响集中在推理连接令牌上,而层级分析表明早中层的Transformer层是最有效的优化空间。通过从结果反馈中直接优化内部推理,GradCuit开辟了一个新的稳健且可解释的测试时扩展方向,使大型语言模型可以适应其推理方式,而不仅仅是重新生成、采样或重新排序输出。
LLM Analysis
Q: 这篇论文试图解决什么问题?
这篇论文旨在解决基于优化的测试时隐式推理(test-time latent reasoning)中的信用分配(credit assignment)问题。
具体而言,现有方法(如 LatentSeek 等)通常将可优化的隐式变量(latent variables)置于模型输出侧,通过将其解码为离散 token 来连接推理轨迹。这种设计带来了两个根本性挑战:
间接优化(Indirect optimization) 解码过程在隐式变量与其下游效应之间引入了信息瓶颈。优化信号必须反向传播经过离散解码步骤才能到达隐式状态,导致信号间接且与中间 token 表示高度纠缠,难以精准优化。
隐式动态不透明(Opaque latent dynamics) 由于隐式变量通过离散生成路径影响后续预测,难以解释单个隐式更新如何塑造后续的推理 token 及最终答案,使得隐式推理过程缺乏可解释性。
为应对上述问题,论文提出 GRADCUIT(gradient through circuit)。其核心思路是:将可优化的隐式状态直接插入到 Transformer 中间层的隐藏空间中,利用自注意力机制作为前向计算与反向梯度传播的双重通路。这使得每个生成 token 的对数概率对每个隐式状态都是直接可微的,从而允许序列级别的奖励信号直接、透明地归因到对应的隐式状态,实现更鲁棒且可解释的测试时隐式推理。
Q: 有哪些相关研究?
根据论文第5节及相关引用,该研究主要与以下三个方向的工作密切相关:
1. 测试时优化(Test-Time Optimization)
这类方法通过在推理阶段分配额外计算资源来提升语言模型输出,无需更新模型参数。
- 离散方法:包括重复采样与聚合策略,如 Self-Consistency(Wang et al., 2023);通过复述增强生成的方法(Sun et al., 2023);以及显式轨迹搜索(Hao et al., 2023)。
- 连续隐式调控:如 PPLM(Dathathri et al., 2020),在推理时通过可微属性模型的梯度更新内部激活值;Amulet(Zhang et al., 2025)将每个解码步骤表述为在线优化问题以实现测试时偏好适应;CTRL(Keskar et al., 2019)则通过预训练期间学习的控制码进行条件生成。
- 测试时训练(Test-Time Training, TTT):如 Sun et al. (2020, 2025) 和 Hardt & Sun (2024),通过自监督目标在线更新模型参数或快速模型状态。
与上述方法不同,GRADCUIT 保持所有模型参数固定,仅优化插入到选定 Transformer 层的少量实例特定状态。
2. 语言模型的强化学习(Reinforcement Learning for Language Models)
这类工作关注训练阶段的对齐与优化,与 GRADCUIT 的测试时优化形成对比。
- 人类/AI反馈强化学习:包括 InstructGPT(Ouyang et al., 2022)和 Constitutional AI(Bai et al., 2022)。
- 策略梯度与对齐算法:如 PPO(Schulman et al., 2017)、DPO(Rafailov et al., 2023)、统计拒绝采样(Liu et al., 2024a)以及 GRPO(Shao et al., 2024; Guo et al., 2025)。
- 奖励建模:从人类偏好模型发展到自动化奖励设计(Kwon et al., 2023)和多智能体验证框架(Lifshitz et al., 2025)。
- 变分视角:Chen et al. (2024) 通过更新模型参数来改进隐式轨迹拟合。
GRADCUIT 完全在测试时运行,不更新策略模型,而是利用 token 级目标的梯度来精炼实例特定的隐式状态。
3. 隐式推理(Latent Reasoning)
该方向探索用连续表示替代或压缩显式思维链(Chain-of-Thought, CoT)中的文本推理痕迹。
- 显式推理提示:如 CoT Prompting(Wei et al., 2022)、Zero-shot CoT(Kojima et al., 2022)和 Least-to-Most Prompting(Zhou et al., 2023);以及根据任务复杂度调整推理计算量的自适应策略(Snell et al., 2025; Inoue et al., 2025)。
- 隐式思维链:将推理痕迹替换为连续表示,如 Hao et al. (2025)、Shen et al. (2025)、Cheng & Van Durme (2024) 和 Deng et al. (2024)。
- 提示微调与前缀提示(Prompt/Prefix Tuning):如 Prompt Tuning(Lester et al., 2021)、Prefix-Tuning(Li & Liang, 2021)和 P-Tuning(Liu et al., 2022, 2024b),但这些通常需要监督数据和训练时反向传播。
- 测试时隐式优化:与 GRADCUIT 最直接相关:
- LatentSeek(Li et al., 2025):优化输出侧隐式表示,将其解码为 token 序列以进行奖励评估。
- LTPO(Ye et al., 2026):利用置信度奖励和基于扰动的策略梯度优化输入级隐式思维向量。
- MILR(Mi et al., 2026):针对多模态生成搜索中间文本-图像输出表示。
- DMLR(Liu et al., 2026):使用置信度引导的策略梯度和动态视觉注入来精炼隐式思考 token。
GRADCUIT 的独特之处在于将可优化状态插入到选定的 Transformer 层,并直接通过后续 Transformer 计算对延续 token 的对数概率进行微分,从而实现直接的信用分配。
Q: 论文如何解决这个问题?
论文通过提出 GRADCUIT(Gradient through Circuit)方法,从架构设计和优化机制两个层面系统性地解决了测试时隐式推理中的信用分配问题。具体解决方案可归纳为以下几个关键环节:
1. 将隐式状态从输出层迁移至中间隐藏层
现有方法(如 LatentSeek)将可优化的隐式变量 z 定义在模型的输出空间,必须先将其解码为离散 token 才能参与后续自回归生成。这种“输出侧”设计引入了不可微的解码瓶颈,使得序列级奖励无法直接归因到隐式状态。
GRADCUIT 将隐式状态插入到 Transformer Decoder 的中间层(第 l 层的隐藏空间)。对于输入提示 c 和已生成的 token x(<t) ,先经过前 l 层得到隐藏表示 h_c^((l)) 和 h(x_<t)^((l)) ,随后将可优化的隐式变量 z^((l)) 与二者拼接:
[ hc^((l)),; z^((l)),; h(x_<t)^((l)) ]
该拼接序列再通过剩余的 l+1 至 M 层及语言模型头,得到下一 token 分布:
π(xt mid x(<t), z^((l)), c) = LMHead!( Transformer(l+1:M)![ hc^((l)), z^((l)), h(x_<t)^((l)) ] )
2. 利用自注意力机制建立直接的梯度通路
由于隐式状态 z^((l)) 在剩余层中与所有 token 隐藏状态共同参与因果自注意力计算,每个后续生成的 token x_t 都可以直接 attend 到所有前置的隐式位置。这建立了一条可微的前向计算路径,同时也构成了一条反向的梯度传播路径:
∇(z_i^((l))) , π(x_t mid x(<t), z^((l)), c)
该梯度衡量第 t 个 token 的概率对第 i 个隐式状态的敏感度,完全通过剩余 Transformer 块中的自注意力连接直接传播,无需经过离散解码过程。这使得信用分配从“间接、经过 token 解码”转变为“直接、经过注意力电路”。
3. 聚合全序列奖励的策略梯度更新
基于上述直接梯度通路,GRADCUIT 执行策略梯度风格的测试时优化。隐式状态的更新规则为:
z^((l)) arrow z^((l)) + eta , ∇_(z^((l))) J(z^((l)))
其中梯度聚合了整个续写序列中所有 token 位置的贡献:
∇(z^((l))) J = ∑(t=1)^(T) E(x sim π(x mid z^((l)), c)) [ R(x, c) × ∇(zi^((l))) log π(x_t mid x(<t), z^((l)), c) ]
与 LatentSeek 中每个隐式变量仅通过其对应解码 token 的 log-probability 接收梯度不同,GRADCUIT 允许从任意位置的续写 token 向任意位置的隐式状态传播奖励加权梯度,实现了真正意义上的序列级直接信用分配。
4. 工程实现:基于前缀偏移的轻量优化
在具体实现中(附录 A),GRADCUIT 采用了一种轻量且稳定的参数化方式:
- 使用固定文本前缀(如 “Let’s think about this problem and solve it step by step.”)经过前 l 层后得到初始前缀表示 z_0^((l)) ;
- 引入可训练偏移量 Delta z^((l)) (初始化为零),实际优化的隐式状态为 z^((l)) = z_0^((l)) + Delta z^((l)) ;
- 在测试时仅更新 Delta z^((l)) ,模型参数保持冻结;
- 优化目标为最小化:
L(opt) = -R(x, c) ∑(t=1)^(T) log π!(xt mid x(<t), z^((l)), c)
其中生成的 token ID 与奖励标量均被 detached,确保梯度仅从续写 token 的对数概率经剩余 Transformer 块回流至隐式偏移。
5. 带来的直接收益
- 鲁棒性:由于梯度通路绕过了离散解码,优化景观更平滑。实验显示,在 7 个不同学习率设置下,GRADCUIT 的准确率标准差从 LatentSeek 的 1.53 降至 0.82。
- 可解释性:自注意力电路提供了 token-to-latent 的雅可比矩阵,可直接检视隐式动态。分析表明,隐式影响主要集中在 because、therefore、then 等推理连接词上。
- 纠错能力:直接更新隐藏状态而非解码 token,避免了在优化过程中引入重复或畸形文本(如 “that that”),同时能修正推理策略和最终答案。
Q: 论文做了哪些实验?
论文围绕 GRADCUIT 的有效性、鲁棒性与可解释性开展了一系列实验,涵盖以下五个层面:
1. 主实验:跨模型、跨基准的准确率对比
在 5 个指令微调骨干网络(LLaMA3.2-3B、LLaMA3.1-8B、Qwen2.5-7B、Qwen2.5-14B、Qwen3-4B)与 3 个推理基准(GPQA-Diamond、GSM8K、MATH-500)上,以 Boxed 与 JSON 两种答案格式,将 GRADCUIT 与以下基线进行全面对比:
- CoT(标准链式思考)
- Self-Reflection(单轮自我反思)
- Self-Consistency(5 路采样多数投票)
- Self-Scored Best-of-N(5 路采样+自奖励重排)
- LatentSeek(输出侧隐式优化)
实验结果表明,GRADCUIT 在 30 个配置上的平均准确率达到 64.5%,较 CoT 提升 6.6 个百分点,较最强竞争方法提升 2.4 个百分点,且在 23/30 个设置中取得最佳单点性能。
2. 鲁棒性实验
(1) 学习率敏感性
在 LLaMA-3.2-3B-Instruct 上对 MATH-500(Boxed 格式)测试了 7 个学习率缩放系数( 0.4, 0.6, 0.8, 1.0, 1.2, 1.4, 1.6 )。GRADCUIT 的准确率波动范围为 51.4%–53.8%(标准差 0.82),显著优于 LatentSeek 的 47.6%–51.8%(标准差 1.53),说明直接层内优化对学习率选择更稳定。
(2) 优化方向鲁棒性(随机游走变体)
将 GRADCUIT 的奖励梯度替换为高斯随机方向(random walk),在 3 个代表性骨干上的平均准确率为 60.6%,仍略高于奖励引导的 LatentSeek(60.3%)。这表明 GRADCUIT 所选择的层内隐式空间本身即具备较好的优化特性,即使无明确奖励引导也能发现有效推理轨迹。
3. 隐式动态与可解释性分析
Token 级梯度归因
基于 LLaMA-3.2-3B-Instruct,计算续写 token 对全部优化隐式状态的梯度 L2 范数,并按规则将 token 划分为五类(见 Table 2):
- Formatting(标点、格式符号)
- Reasoning Connector(because, therefore, then 等)
- Content Explanation(compute, equation, value 等)
- Answer Marker(boxed, final, answer 等)
- Answer Content(具体数值或选项)
结果显示(Figure 4),Reasoning Connector 类别的梯度强度在三项基准上均为最高,说明优化后的隐式状态主要通过调控推理连接词来影响模型的推理路径,而非均匀作用于所有续写 token。
4. 消融实验
在 5 个骨干 × 3 个基准(Boxed 格式)上验证了三个变体(Table 3):
| 变体 | 说明 | 关键发现 |
|---|---|---|
| w/o Gradient | 以随机方向替代奖励梯度 | 在 14/15 设置中优于固定前缀,说明“更新隐式状态”本身即可暴露替代推理轨迹 |
| w/o Latent Update | 插入固定前缀但不优化 | 平均准确率 62.0%,仅较 CoT 提升 1.5 个百分点,且在 6 个设置中下降 |
| w/o Inserted Prefix | 退化为标准 CoT | 平均准确率 60.5%,作为基准对照 |
综合表明:插入前缀、隐式状态优化、奖励引导 三者缺一不可,且后两者提供互补增益。
5. 层位置与效率分析
(1) 优化层深度分析
在 LLaMA-3.2-3B 上,将可优化隐式前缀分别置于网络深度的 0%(嵌入层)、25%、50%、75%。结果(Figure 5)显示:
- 25%–50% 的中间层位置普遍最优;
- 嵌入层(0%)或深层(75%)效果较弱,其中 MATH-500 对层位置最敏感,50% 深度较嵌入层提升约 4 个百分点。
这说明早期至中期的 Transformer 层在“已充分上下文化”与“保留足够下游计算以传播优化效应”之间取得了最佳权衡。
(2) 计算预算统计(附录)
GRADCUIT 的平均优化轮数(含初始未优化生成)为 2.42 轮,在所有 30 个设置中均低于 5 轮;而 Self-Consistency 与 Self-Scored BoN 的固定采样预算为 5 轮。这表明 GRADCUIT 的精度提升并非来自更高的推理计算量。
6. 案例研究
通过定性对比展示了:
- LatentSeek:优化后虽改变了早期解码 token,但仍输出错误答案,且引入重复文本(如 “that that”);
- GRADCUIT:直接修改隐藏状态,未破坏 token 序列的语法完整性,同时将错误答案 20 纠正为正确答案 17。
附录中补充了 GPQA-Diamond 与 GSM8K 的额外案例,进一步说明 GRADCUIT 能够重组整体推理策略(如修正多步合成反应顺序、纠正利润比较逻辑),而非仅修改局部措辞。
Q: 有什么可以进一步探索的点?
基于论文的框架与发现,以下方向值得进一步探索:
1. 跨层联合隐式优化
论文将可优化状态插入单一层(通常位于网络深度的 25%–50%)。一个自然的延伸是同时在多个 Transformer 层插入并联合优化隐式状态:
L(opt) = -R(x, c) ∑(t=1)^(T) log π!(xt ,|, x(<t), z^((l_1)), z^((l_2)), dots, c)
这种分层优化可能允许模型在不同抽象层级上协同调整表示,但也引入了层间梯度干扰与计算开销的新问题,需要设计高效的信用分配机制。
2. 动态隐式状态长度与自适应结构
当前方法使用固定文本前缀对应的 token 数量 N 作为隐式状态长度。未来可探索任务自适应的隐式状态长度:例如,根据问题复杂度动态增减 N ,或引入结构化稀疏性(如仅优化前缀中的关键位置)。这要求开发不依赖固定前缀维度的可微长度控制机制。
3. 与过程级奖励的深度融合
现有实验采用二元结果奖励 R(x, c) ∈ 0, -1 。若结合过程奖励模型(Process Reward Model, PRM),可将每一步推理的中间正确性信号注入梯度:
∇(z^((l))) J = ∑(t=1)^(T) E[ rt · ∇(z^((l))) log π(xt mid x(<t), z^((l)), c) ]
其中 r_t 为第 t 步的过程奖励。这可能进一步细化隐式状态的信用分配,尤其在长程多步推理中。
4. 更高效的梯度传播实现
GRADCUIT 在计算梯度时需禁用 KV Cache 并采用教师强制(teacher forcing),导致显存与延迟开销随序列长度线性增长。未来可探索:
- 开发兼容 KV Cache 的反向传播近似算法;
- 将隐式优化与**投机解码(speculative decoding)或前瞻解码(lookahead decoding)**结合,以降低迭代优化的推理延迟;
- 研究低秩或低精度隐式偏移 Delta z^((l)) 的参数量化方案。
5. 细粒度电路级可解释性
论文通过 token 级梯度归因发现隐式影响集中于推理连接词。下一步可利用 Transformer Circuits 框架(Elhage et al., 2021)进行更精细的分析:
- 识别具体哪些注意力头承担了从隐式状态到推理连接词的梯度通路;
- 构建隐式状态与特定推理操作(如变量代换、边界条件检验)之间的因果映射;
- 对比显式 CoT 与隐式推理在电路层面的计算等价性。
6. 向多模态与工具使用场景扩展
近期工作如 MILR 与 DMLR 已将测试时隐式推理扩展至多模态生成。GRADCUIT 的电路梯度流可自然推广至视觉-语言模型:
- 在跨模态 Transformer 的中间层插入隐式状态,优化图像生成或视觉推理的潜在表示;
- 在工具增强 LLM 中,利用隐式状态优化工具调用序列的潜在规划,避免显式 API 调用链的离散不可微问题。
7. 无奖励或少奖励的隐式空间探索
随机游走变体已表明,GRADCUIT 选定的层内隐式空间本身具有良好结构。这提示可以系统研究:
- 纯噪声探索或基于不确定性的主动采样作为替代优化方向;
- 结合进化策略(Evolution Strategies)或贝叶斯优化,在避免频繁反向传播的前提下搜索高质量隐式状态;
- 探索隐式空间的内在几何结构(如流形假设),以设计更高效的探索方向。
8. 训练-测试协同设计
当前 GRADCUIT 完全冻结模型参数。未来可在训练阶段引入有利于测试时隐式优化的归纳偏置:
- 在预训练或微调时加入“可优化前缀”的元学习(meta-learning)目标,使模型生成对测试时梯度更新更敏感的中间表示;
- 联合优化模型权重与隐式空间先验,使得在测试时仅需极少步数(甚至单步)即可收敛到高质量推理轨迹。
9. 理论刻画:最优层位置的深度机制
实验发现早期至中期层(25%–50% 深度)最有效,但其理论机制尚不清晰。值得从表示学习角度建立形式化分析:
- 刻画不同深度隐藏状态的 Information Bottleneck 特性与可优化性之间的权衡;
- 分析深层隐式优化效果下降是否源于梯度消失或注意力模式的刚性化;
- 针对不同模型族(如 MoE、Mamba、RWKV)推导最优层位置的解析或经验规律。
Q: 总结一下论文的主要内容
这篇论文提出 GRADCUIT(gradient through circuit),一种通过 Transformer 自注意力机制实现直接信用分配的测试时隐式推理方法。以下从问题背景、方法设计、实验验证与核心贡献四个方面进行总结。
1. 核心问题
现有测试时隐式推理方法(如 LatentSeek)通常将可优化的隐式变量(latent variables)置于模型输出侧,通过将其解码为离散 token 来驱动后续推理。这种设计带来两个根本性缺陷:
- 间接优化:离散解码过程在隐式状态与下游效应之间引入信息瓶颈,序列级奖励只能通过解码 token 的 log-probability 间接回传,导致优化信号纠缠且脆弱;
- 隐式动态不透明:难以解释单个隐式更新如何影响后续推理 token 及最终答案,缺乏可解释性。
2. 方法:GRADCUIT
GRADCUIT 将可优化的隐式状态直接插入到 Transformer 中间隐藏层(第 l 层),利用自注意力机制同时承担前向计算与反向梯度传播的双重功能。
前向通路
对于输入提示 c 和已生成 token x(<t) ,先经前 l 层得到隐藏表示 h_c^((l)) 与 h(x<t)^((l)) ,再与可优化隐式状态 z^((l)) 拼接后传入后续层:
π(x_t mid x(<t), z^((l)), c) = LMHead!( Transformer(l+1:M)![ hc^((l)),; z^((l)),; h(x_<t)^((l)) ] )
反向通路
由于因果自注意力的全连接性,每个续写 token xt 均可直接 attend 到所有前置隐式状态,因此梯度可沿注意力边直接传播:
∇(zi^((l))) log π(x_t mid x(<t), z^((l)), c)
优化更新
采用策略梯度风格更新,聚合整个序列所有 token 的奖励加权梯度:
z^((l)) arrow z^((l)) + eta ∑(t=1)^(T) E(x)![ R(x, c) · ∇(z^((l))) log π(x_t mid x(<t), z^((l)), c) ]
工程实现上,GRADCUIT 以固定文本前缀的初始隐藏表示 z_0^((l)) 为基,仅优化一个零初始化的偏移量 Delta z^((l)) ,即 z^((l)) = z_0^((l)) + Delta z^((l)) ,所有模型参数保持冻结。
3. 实验与关键发现
实验设置
在 5 个指令微调骨干模型(LLaMA3.2-3B、LLaMA3.1-8B、Qwen2.5-7B、Qwen2.5-14B、Qwen3-4B)、3 个推理基准(GPQA-Diamond、GSM8K、MATH-500)及 Boxed / JSON 两种答案格式下,与 CoT、Self-Reflection、Self-Consistency、Self-Scored Best-of-N 和 LatentSeek 进行全面对比。
主要结果
- 精度领先:在 30 个配置下平均准确率达 64.5%,较 CoT 提升 6.6 个百分点,较最强竞争方法提升 2.4 个百分点;
- 学习率鲁棒性:在 7 个学习率设置下,准确率标准差由 LatentSeek 的 1.53 降至 0.82,且平均精度更高;
- 优化方向鲁棒性:即使将奖励梯度替换为随机高斯方向,GRADCUIT 仍与 LatentSeek 相当,说明所选层内隐式空间本身具备良好的优化特性;
- 可解释性:Token 级梯度归因显示,隐式影响集中于 Reasoning Connector(如 because、therefore、then),表明隐式状态主要通过调控推理步骤间的连接来驱动推理;
- 层位置分析:早期至中期层(网络深度的 25%–50%)是最有效的优化空间,深层或嵌入层效果较弱;
- 效率:平均仅需 2.42 轮优化(含初始生成),低于 Self-Consistency / BoN 的固定 5 轮采样预算。
4. 核心贡献
- 电路化隐式推理架构:首次将自注意力机制作为同时支持前向推理与反向信用分配的计算电路,绕过离散解码瓶颈;
- 直接信用分配:实现从续写序列中任意 token 到任意隐式状态的直接梯度传播,显著提升优化稳定性与最终性能;
- 可解释的隐式动态:通过梯度归因揭示隐式状态对推理连接词的关键调控作用,并为层内优化空间的选择提供实证依据。
综上,GRADCUIT 开辟了一条新的测试时计算扩展路径:通过直接优化模型内部隐藏状态,使大语言模型能够在推理时调整其推理方式,而非仅仅重新生成、采样或重排输出。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Zhaoxin Yu,Qi Shen,Hengli Li,Zhaowei Zhang,Song-Chun Zhu,Chi Zhang,Zilong Zheng
PDF URL: https://arxiv.org/pdf/2608.02585.pdf
Arxiv URL: https://arxiv.org/abs/2608.02585
Arxiv ID: 2608.02585
CoolPaper URL: https://papers.cool/arxiv/2608.02585
Published: 2026-08-05T01:03:20.542Z
Updated: 2026-08-05T01:03:20.542Z
15. Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations
Abstract:Video motion transfer aims to animate a target object using dynamics from a reference video. Existing formulations largely rely on fixed structural correspondence, which becomes ill-defined when reference and target objects differ substantially in morphology, articulation, or deformation mechanisms. We introduce Motion Beyond Morphology, a perspective that seeks to transfer motion beyond fixed structural correspondence, by preserving dynamics that remain meaningful across different target morphologies. To realize this, we propose a two-stage framework. Stage~I learns complementary multi-granularity abstract motion views and uses them to bootstrap cross-category video pairs that preserve transferable dynamics across diverse morphologies. Stage~II internalizes this supervision into direct reference-video-conditioned generation, removing the need for explicit motion extraction at inference. We further introduce OpenVMT-Dataset and OpenVMT-Bench for training and evaluating image- and text-conditioned motion transfer across Same, Near, and Far category gaps. Extensive experiments demonstrate state-of-the-art motion fidelity and target preservation. Project page: this https URL
中文摘要
摘要:视频运动迁移旨在利用参考视频的动态为目标对象赋予动画效果。现有的方法在很大程度上依赖固定的结构对应关系,但当参考对象和目标对象在形态、关节动作或变形机制上存在显著差异时,这种对应关系就变得不明确。我们提出了“超越形态的运动”(Motion Beyond Morphology)的视角,旨在通过保留在不同目标形态间仍具有意义的动态,实现超越固定结构对应关系的运动迁移。为此,我们提出了一个两阶段框架。阶段 I 学习互补的多粒度抽象运动视图,并利用这些视图引导跨类别的视频对,以保留可在不同形态间迁移的动态。阶段 II 将这种监督信息内化为直接参考视频条件生成,从而在推理阶段无需显式的运动提取。我们进一步引入了 OpenVMT-Dataset 和 OpenVMT-Bench,用于训练和评估基于图像和文本的运动迁移,覆盖相同类别、相近类别和远类别的差距。大量实验表明,该方法在运动保真度和目标保持方面达到了最先进水平。项目页面:此 https URL
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Zhixue Fang,Zhimin Zhang,Bi’an Du,Zijie Meng,Yan Zhou,Wei Hu,Guoxin Zhang,Pengfei Wan,Kun Gai
PDF URL: https://arxiv.org/pdf/2608.01628.pdf
Arxiv URL: https://arxiv.org/abs/2608.01628
Arxiv ID: 2608.01628
CoolPaper URL: https://papers.cool/arxiv/2608.01628
Published: 2026-08-05T01:03:29.841Z
Updated: 2026-08-05T01:03:29.841Z
16. To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing
Abstract:Large language models increasingly write and repair production code, yet evidence is mounting that their test-passing patches leave codebases harder to maintain. We identify one concrete source: deletion avoidance, the systematic tendency to retain code that an intended edit requires removing. Across the five leading models on the official SWE-bench Verified leaderboard, deletion recall against the developer patch reaches at most 71.7% even on tasks all five solve, and models reach the right file for over 92% of required deletions but cut the exact line in under 52% of cases. Instead, 29.0% of passing patches wrap the targeted code in a guard or fallback, a pattern we call Guard-and-Go. Such patches pass because the original tests rarely check removal: when we retrofit 34 Verified tasks with tests that fail if the targeted code remains, four frontier models spanning closed and open weights fall from 63.2% to 41.9%. Because real repairs mix removal with addition, we curate CanItDelete, a benchmark of 200 tasks mined from real commits whose entire required edit is deletion. Even with the addition work gone, the best model still fails one task in five, and smaller open models fall to 18.0%. We then ablate GPT-5.6 Sol under four cumulative prompts; success moves little until we supply the exact lines, which nearly eliminate incomplete deletion yet raise success only to 80.5% because the model then deletes beyond the spans or adds code instead. Finally, through a pilot study we show one potential fix: teaching deletion during post-training reduces deletion avoidance and improves broader code-editing performance, suggesting the behavior is undertrained rather than beyond reach.
中文摘要
摘要:大型语言模型越来越多地编写和修复生产代码,但证据越来越多地表明,它们通过测试的补丁使代码库更难维护。我们确定了一个具体来源:删除回避,即系统性地倾向于保留原本需要删除的代码。在官方 SWE-bench Verified 排行榜上的五个领先模型中,即使在所有五个模型都能解决的任务上,对比开发者补丁的删除召回率最多也只有 71.7%,而模型在超过 92% 的必需删除中找到正确文件,但精确删除正确行的情况不足 52%。相反,29.0% 的通过测试的补丁会将目标代码包裹在保护或回退机制中,这一模式我们称之为“护而走”。这些补丁之所以通过,是因为原始测试很少检查代码删除:当我们为 34 个 Verified 任务添加如果目标代码残留则失败的测试时,覆盖封闭和开放权重的四个前沿模型的通过率从 63.2% 降至 41.9%。由于实际修复通常混合删除与添加,我们整理了 CanItDelete,这是一个包含 200 个任务的基准,从真实提交中挖掘,其所需编辑完全为删除。即使删除工作没有包涵添加,最佳模型仍每五个任务失败一个,而较小的开源模型下降到 18.0%。随后,我们在 GPT-5.6 Sol 上进行四种累积提示消融实验;成功率几乎没有变化,直到我们提供了精确行,这几乎消除了不完整删除,但成功率仅提高至 80.5%,因为模型此时要么删除了超出范围的内容,要么添加了代码。最后,通过一项初步研究,我们展示了一种潜在修复方法:在后训练阶段教授删除操作可以减少删除回避并改善更广泛的代码编辑性能,表明这种行为是训练不足而非无法实现。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Amir M. Ebrahimi,Mohammed Mehedi Hasan,Aaditya Bhatia,Gopi Krishnan Rajbahadur,Ahmed E. Hassan
PDF URL: https://arxiv.org/pdf/2607.28887.pdf
Arxiv URL: https://arxiv.org/abs/2607.28887
Arxiv ID: 2607.28887
CoolPaper URL: https://papers.cool/arxiv/2607.28887
Published: 2026-08-05T01:05:10.809Z
Updated: 2026-08-05T01:05:10.809Z
17. GPTQ-2D: Cubic-Time Two-Sided Adaptive Rounding
Abstract:Adaptive rounding methods such as GPTQ, or equivalently Babai’s nearest plane algorithm, round a real matrix to integers under a quadratic metric. They process the entries in a fixed order, one at a time, propagating each rounding error to the entries not yet processed through a triangular feedback matrix. We study the two-sided version of this task, in which fixed nonsingular basis matrices act on both the left and the right of the residual; the familiar one-sided case is the special case of an identity right basis. Vectorizing the matrix turns the two-sided objective into a quadratic metric whose Gram matrix is a Kronecker product, so the one-dimensional algorithm applies verbatim, but takes quartic time in the matrix dimension. We present GPTQ-2D, which produces the identical rounded matrix in cubic time. It rounds the entries anti-diagonal by anti-diagonal; entries on the same anti-diagonal are independent and are rounded in parallel.
中文摘要
摘要:自适应舍入方法,如 GPTQ,或者等价地 Babai 最近平面算法,会在二次度量下将实矩阵四舍五入为整数。它们按固定顺序逐个处理矩阵元素,并通过三角反馈矩阵将每次舍入误差传播到尚未处理的元素。我们研究该任务的双边版本,其中固定的非奇异基矩阵作用于残差矩阵的左右两侧;熟悉的单边情况是右侧基矩阵为单位矩阵的特例。将矩阵向量化会将双边目标转化为二次度量,其 Gram 矩阵为 Kronecker 积,因此一维算法可以原样应用,但在矩阵维度上需要四次时间。我们提出了 GPTQ-2D,它在立方时间内生成相同的舍入矩阵。它按反对角线逐个对矩阵元素进行舍入;同一反对角线上的元素相互独立,可并行舍入。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Jiale Chen,Torsten Hoefler,Dan Alistarh
PDF URL: https://arxiv.org/pdf/2607.27042.pdf
Arxiv URL: https://arxiv.org/abs/2607.27042
Arxiv ID: 2607.27042
CoolPaper URL: https://papers.cool/arxiv/2607.27042
Published: 2026-08-05T01:06:55.928Z
Updated: 2026-08-05T01:06:55.928Z
18. Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis
Abstract:Existing indoor layout generators produce globally plausible layouts yet may retain local violations such as collisions, out-of-bounds placements, obstructed openings, and blocked circulation. Most prior work focuses on full-scene synthesis or scene-level optimization, with limited support for identifying responsible objects and locally repairing affected regions. We present Roomer, a reflective repair framework that casts these violations as sparse, object-grounded repair problems. Roomer encodes layouts as RoState'' and usesRoReview’’ to bind measured violations to implicated objects. A geometry-conditioned vision-language model planner proposes a structured local edit, while a deterministic solver validates it and generates a finite set of candidate edits when needed. Each candidate is committed only if full-scene verification confirms that it resolves the target violation without new hard violations or broken protected constraints. We train the planner on Roomer-CC, a controlled-corruption dataset that pairs faulty layouts with object-grounded violation evidence and known-feasible inverse StatePatches. Since existing benchmarks rarely assess whether physically valid layouts are usable, we introduce Roomer-Eval to assess distributional quality, physical validity, and practical usability. Experiments show that Roomer repairs residual violations while preserving valid regions, improves physical validity and usability, and transfers across external generators.
中文摘要
摘要:现有的室内布局生成器能够生成全局上合理的布局,但可能仍存在局部违规情况,如碰撞、越界放置、开口阻塞和通行受阻。大多数以往的工作集中于全景合成或场景级优化,而在识别责任对象和局部修复受影响区域方面支持有限。我们提出了Roomer,一种反思性修复框架,将这些违规行为视为稀疏的、基于对象的修复问题。Roomer 将布局编码为“RoState”,并使用“RoReview”将测量到的违规行为绑定到相关对象上。几何条件化的视觉-语言模型规划器提出结构化的局部编辑方案,而确定性求解器则进行验证,并在需要时生成有限的候选编辑集。每个候选方案仅在全景验证确认其能解决目标违规且不会产生新的严重违规或破坏受保护约束的情况下才会被采用。我们使用 Roomer-CC 训练规划器,这是一个受控破坏数据集,将有错误的布局与基于对象的违规证据及已知可行的逆 StatePatches 配对。由于现有基准很少评估物理上有效的布局是否可用,我们引入了 Roomer-Eval 来评估分布质量、物理有效性和实际可用性。实验表明,Roomer 可以修复残余违规,同时保留有效区域,提高物理有效性和可用性,并可跨外部生成器迁移。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Lingwei Dang,Ziyan Qiu,Jiajia Cheng,Shishuo Shang,Zhenhao Zhang,Yufei Zhu,Qingxin Xiao,Pan Liu,Shenghui Huang,Yun Hao,Juntong Li,Qingyao Wu
PDF URL: https://arxiv.org/pdf/2608.01973.pdf
Arxiv URL: https://arxiv.org/abs/2608.01973
Arxiv ID: 2608.01973
CoolPaper URL: https://papers.cool/arxiv/2608.01973
Published: 2026-08-05T01:08:35.720Z
Updated: 2026-08-05T01:08:35.720Z
19. DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents
Abstract:Multimodal large language models (MLLMs) have advanced visual understanding and reasoning, yet their static parametric knowledge limits their ability to address knowledge-intensive and dynamically evolving open-world problems. To move beyond this limitation, multimodal deep search has emerged as a key direction for open-world information access, evolving from single-turn factual retrieval toward long-horizon, multi-turn search guided by visual evidence. However, existing methods typically confine vision to the input or answer stage, overlooking its role in intermediate reasoning, and lack designs tailored to long-horizon interaction. Consequently, visual evidence rarely drives continued retrieval, constraining both interaction depth and reasoning span. To address these limitations, we propose DeepVoyager-VL, a long-horizon multimodal deep-search framework for vision-in-the-loop search. Specifically, we construct a multimodal event graph to drive data synthesis, yielding problems with intermediate visual dependencies and long reasoning chains. We then design an agent framework for active visual acquisition and on-demand image loading. Finally, we fine-tune models on the synthesized data without reinforcement learning. Extensive experiments across ten multimodal search benchmarks demonstrate the effectiveness of our method.
中文摘要
摘要:多模态大语言模型(MLLMs)在视觉理解和推理方面取得了进展,但其静态的参数化知识限制了其应对知识密集型和动态演变的开放世界问题的能力。为突破这一限制,多模态深度搜索成为开放世界信息访问的关键方向,从单轮事实检索发展到由视觉证据引导的长时域、多轮搜索。然而,现有方法通常将视觉限制在输入或答案阶段,忽视其在中间推理中的作用,并且缺乏针对长时域交互的设计。因此,视觉证据很少推动持续检索,限制了交互深度和推理跨度。为了解决这些局限性,我们提出了 DeepVoyager-VL,一种用于循环视觉搜索的长时域多模态深度搜索框架。具体而言,我们构建了多模态事件图来驱动数据合成,生成具有中间视觉依赖和长推理链的问题。随后,我们设计了一个用于主动视觉获取和按需图像加载的智能体框架。最后,我们在合成数据上进行模型微调,无需强化学习。在十个多模态搜索基准上的大量实验表明了我们方法的有效性。
LLM Analysis
Q: 这篇论文试图解决什么问题?
该论文旨在解决多模态深度搜索中视觉证据未能有效驱动长程推理与持续检索的问题。具体而言,其针对的核心局限可归纳如下:
1. 静态参数化知识的边界
多模态大语言模型(MLLMs)在视觉理解与推理方面已取得显著进展,但其知识受限于训练时的参数化记忆,难以应对知识密集且动态演化的开放世界问题。尽管深度搜索智能体通过迭代推理与工具调用可部分缓解该问题,现有多模态搜索系统仍未能充分释放视觉信息在搜索全周期中的潜力。
2. 视觉被边缘化为输入或终端模态
现有方法通常仅在以下环节引入视觉:
- 输入阶段:通过实体替换将图像作为查询起点;
- 回答阶段:在文本推理链末端嫁接视觉检索子链;
- 前置阶段:将输入图像的视觉探索集中在搜索前的单轮描述中。
这些范式均先构建文本推理链,再插入视觉,导致搜索过程中新获取的视觉观测极少成为后续检索动作的必要条件。换言之,视觉未被纳入循环推理(loop reasoning),无法作为驱动变量决定下一步查询。
3. 长程交互中的证据管理困境
在长程搜索中,智能体需要在多轮交互中持续利用新发现的视觉证据。然而,现有机制面临双重挑战:
- 上下文成本:若将搜索返回的每一张候选图像立即完整加载至多模态上下文中,会导致上下文急剧膨胀;
- 信息损耗:若仅以文本摘要替代图像,则可能丢弃后续推理所需的细节。
现有系统多被动地管理已进入上下文的证据(如压缩或卸载),却缺乏主动决定何时、加载何种视觉内容的设计,难以支撑跨轮次的视觉发现、选择性观测、局部操作与后续检索之间的连贯衔接。
4. 训练数据缺乏中间视觉依赖的监督
现有数据合成范式难以产生具有显式中间视觉依赖的长程问题。由于推理链先在文本空间构建,视觉证据往往只是装饰性或替代性存在,而非解决中间变量所必需。这导致模型缺乏监督信号来学习“视觉观测→解析中间变量→触发下一步检索”的行为。
解决方案概述
为弥合上述鸿沟,论文提出 DeepVoyager-VL,一个面向长程交互的多模态深度搜索框架,核心创新包括:
- EventVoyage-VL 数据合成管道:基于多模态事件图(multimodal event graph),以“先结构后语言”(structure-before-language)的方式合成问题,确保视觉证据在推理链的中间环节成为必要依赖;
- 主动视觉获取与按需加载机制:将图像发现(轻量级引用)与视觉观测(显式加载/裁剪)解耦,构建可跨轮次复用的视觉工作记忆;
- 纯监督微调训练:在筛选后的长程教师轨迹上进行监督微调(SFT),无需额外的强化学习阶段,即可习得视觉在环(vision-in-the-loop)的搜索行为。
综上,该论文的核心目标是激励并学习“视觉在环”的长程多模态搜索行为,使智能体能够在持续交互中利用新获取的视觉证据驱动检索,突破现有方法在推理深度与交互跨度上的限制。
Q: 有哪些相关研究?
根据论文内容,相关研究主要围绕多模态大语言模型、多模态深度搜索智能体以及数据集与基准测试三个层面展开,具体如下:
1. 多模态大语言模型(MLLMs)
该方向为深度搜索智能体提供了基础视觉理解与推理能力,可分为两个子类:
- 基础架构与预训练:早期工作通过轻量级投影模块将视觉编码器与语言模型连接,建立视觉指令跟随能力(Liu et al., 2023)。后续研究通过扩大模型规模与视觉-语言语料,提升跨模态理解与推理性能(Li et al., 2024; Bai et al., 2025b; Zhu et al., 2025; Hurst et al., 2024; Comanici et al., 2025)。近期模型在预训练阶段即融合跨模态数据,继承了更强的推理与工具使用能力(Bai et al., 2025a; Team et al., 2026)。
- “图像思维”与视觉工具使用:后训练研究推动模型从被动接收图像转向主动操作视觉内容。一类工作通过强化学习直接激励视觉推理行为(Zheng et al., 2025; Guo et al., 2025),另一类则强调通过冷启动监督建立视觉工具使用能力。例如,Pixel Reasoner(Su et al., 2025a)识别了模型绕过新引入视觉工具的学习陷阱;Mini-o3(Lai et al., 2025)发现纯强化学习难以产生困难搜索所需的深度视觉轨迹。此外,视觉操作空间已从固定裁剪扩展到代码合成的图像变换(Zhao et al., 2025; Zhang et al., 2025a)。
然而,上述研究主要操作已给定的图像,而未解决开放世界中发现新图像并驱动后续检索的问题。
2. 多模态深度搜索智能体
该方向通过迭代推理与工具调用来获取外部证据,可进一步细分为:
2.1 文本深度搜索基础
早期工作建立了“推理-行动”交替的交互范式,如 ReAct(Yao et al., 2023)、Search-R1(Jin et al., 2025)、WebDancer(Wu et al., 2026)、WebSailor(Li et al., 2025a)以及 Tongyi DeepResearch(Team et al., 2025)。
2.2 多模态搜索的扩展
近期系统将图像搜索、反向图像搜索与视觉操作引入交互循环,包括:
- 端到端强化学习:MMSearch-R1(Wu et al., 2025)基于结果奖励与搜索惩罚优化策略,激励按需调用工具。
- 冷启动监督 + 强化学习:WebWatcher(Geng et al., 2025)、Vision-DeepResearch(Huang et al., 2026)、OpenSearch-VL(Chen et al., 2026)、MM-DeepResearch(Yao et al., 2026)、SenseNova-MARS(Chng et al., 2026)等先在合成多轮轨迹上进行监督微调,再进行 RL 优化。DeepEyesV2(Hong et al., 2026)的实验也表明,纯 RL 难以可靠诱导工具使用。
- 纯监督学习:部分研究认为高质量、规划一致的轨迹已足够,无需额外 RL 阶段,如 POINTS-Seeker(Liu et al., 2026)、Visual-Seeker(Zhang et al., 2026b)以及 REDSearcher-MM(Chu et al., 2026)。
2.3 上下文与证据管理
长程交互中的上下文膨胀问题催生了一系列管理机制:
- 视觉上下文压缩:LMM-Searcher(Du et al., 2026)通过卸载视觉资产减少上下文增长;相关研究将陈旧上下文折叠到视觉空间(Liu et al., 2026)。
- 文本记忆与摘要:MemAgent(Yu et al., 2025)学习记忆更新,AgentFold(Ye et al., 2025)主动折叠上下文,Glyph(Cheng et al., 2025a)将长历史压缩为视觉表示。
与上述方法不同,DeepVoyager-VL 强调在视觉内容进入上下文之前主动管理证据获取:将轻量级候选发现与选择性视觉观测解耦,支持跨轮次的视觉工作记忆,而非仅在证据进入历史后被动压缩。
3. 数据集与基准测试
3.1 基准测试的演进
多模态搜索基准逐步将视觉推理推向交互更深层:
- 早期基准:MMSearch(Jiang et al., 2025)与 LiveVQA(Fu et al., 2025)主要将输入图像用于实体识别,随后进行文本检索。
- 细粒度输入感知:MMSearch-Plus(Tao et al., 2026)与 VDR-Bench(Zeng et al., 2026)要求对初始视觉输入进行更精细的感知,并与检索信息深度整合。
- 长程视觉浏览:MM-BrowseComp(Li et al., 2025b)、BrowseComp-V3(Zhang et al., 2026a)、VisBrowse-Bench(Zhang et al., 2026c)以及 InterLV-Search(Hou et al., 2026)要求智能体检查搜索过程中新发现的图像,进行跨页、跨模态证据整合,并从获取的视觉观测中继续浏览。
3.2 数据合成范式
现有训练数据合成方法在视觉与推理的耦合方式上存在局限:
- 实体替换:OpenSearch-VL(Chen et al., 2026)等先在文本空间构建推理链,再将某个实体提及替换为图像。尽管可通过调整锚点位置(如靠近输入端)减少单跳捷径,但视觉仍是文本链的替代物。
- 前置视觉推理:Vision-DeepResearch(Huang et al., 2026)在搜索前对输入图像进行充分探索并生成详细文本描述,随后将该描述交给文本导向的深度搜索。视觉推理被集中在搜索前阶段。
- 答案侧嫁接:Visual-Seeker(Zhang et al., 2026b)将视觉检索-感知子链注入现有实例的答案端,使视觉检索局部化于答案附近。
上述三种范式均先构建文本推理链,再插入视觉,导致中间视觉观测极少决定后续检索动作。作为对比,DeepVoyager-VL 提出的 EventVoyage-VL 采用“先结构后语言”策略,从多模态事件图中组合推理程序,使视觉依赖内生于推理结构之中。
Q: 论文如何解决这个问题?
论文通过提出 DeepVoyager-VL 框架,从数据合成、智能体架构与训练策略三个层面系统性地解决视觉在长程搜索中被边缘化的问题。整体方法遵循五阶段流水线:数据合成(阶段 1–2)、难度感知的轨迹筛选(阶段 3–4)与监督智能体训练(阶段 5)。
1. 核心概念:视觉在环(Vision-in-the-Loop)
论文首先形式化地定义了“视觉在环”的判定条件。设轨迹为 τ = (x, r1, a_1, o_1, dots, r_T, a_T, o_T, y) ,其中 x=(q, I_s) 为查询与输入图像, a_t 为动作, o_t 为观测。若存在时刻 t < t’ ,使得第 t 步新获取的视觉观测 o_v^t 解析了后续动作 a(t’) 所需的变量,则称该轨迹满足视觉在环:
∃ 1 le t < t’ le T: ov^t squigarrow a(t’)
同时要求反事实的视觉必要性:设 Y(q, I_s, I_r, K) 为在检索图像集合 I_r 与其他证据 K 下一致的答案集合,则需满足:
|Y(q, I_s, I_r, K)| = 1,quad |Y(q, I_s, ∅, K)| > 1
即视觉证据对得出唯一答案是必要的。基于此定义,解决方案围绕“如何让视觉证据真正成为推理链的中间驱动变量”展开。
2. Vision-in-the-Loop 数据合成(EventVoyage-VL)
现有方法通常先构建文本推理链再插入图像,导致视觉仅起装饰或替代作用。论文采用先结构后语言(structure-before-language)的范式,从多模态事件图中合成具有显式中间视觉依赖的长程问题。
2.1 多模态事件图构建与丰富
从维基百科与多领域新闻中提取实体与事件,将每条记录规范化为 r = (u_s, u_t, c, t, l) ,包含参与者、关系类型、时间与地点。时空共现的记录聚合为宏观事件(macro-events),重复实体交互形成关系束,构建基础图 G_0 = (V, E, M) 。
随后,通过一个搜索智能体对图进行主动视觉证据丰富:
- 为实体或事件添加图像 I ,充当输入锚点、跨实体转换或视觉中间/端点;
- 每张图像存储检索上下文 K(ret)(I) (用于重新定位该图像)与视觉内容证据 F(vis)(I) (如属性、计数、文本、物体、关系等像素级信息);
- 通过 K_(ret)(I) ∩ Alias(y) = ∅ 防止答案泄露;
- 视觉识别假设需与页面及图像证据交叉核验。
丰富后的图为:
G = (V, E, M, I, A, F)
其中 A 将图像与实体/事件对齐,所有字段保留来源追溯。
2.2 子图提取、组合与 VQA 合成
基于结构谓词 rho 确定性提取连通子图:
Phi_rho(G) = g ⊂eq G : rho(g) = 1
提取的结构类型包括:
- 视觉共现网络:共享图像或事件的关联;
- 时序事件链:共同参与者串联的时序结构;
- 空间共位结构:场景化地点与共处事件的链接;
- 多关系稠密模体:汇聚约束的组合。
视觉节点进一步提供场景级、物体中心或视觉知识接地。通过组合这些局部结构形成全局依赖。
对于程序组合,设 ∈(g_i) 与 out(g_i) 为原子结构 g_i 的输入/输出接口变量。程序 g_1 circ dots circ g_n 要求相邻接口兼容,且至少有一个内部接口由视觉证据解析:
out(gi) = ∈(g(i+1)), i < n,quad ∃ j < n: out(gj) ∈ Var(F(vis)(I_r))
同时要求下游目标不出现在源图像中以防止绕过。每个子图转化为推理程序 Pi = (D, U, L, I_s, I_r, y) ,其中候选空间 U 与约束 L 满足:
|UL| = 1,quad |U(L setminus ell)| > 1 ∀ ell ∈ L
确保每条主约束在候选空间中都是必要的。
2.3 QA 实现与质量控制
多模态生成器将程序 Pi 语言化为问题,并进行受控掩码得到最终问题。视觉声明仅使用 F_(vis) ,文本桥接内容需有来源支撑。验证器检查程序完整性、约束最小性、泄露、重复、图文对齐与证据可读性。通过反事实移除测试可解性与视觉必要性,并进行双语实现等价性校验。
3. 长程多模态搜索智能体框架
长程交互中,盲目加载所有候选图像会导致上下文膨胀,而纯文本摘要可能丢失关键细节。论文设计了一个主动视觉获取与按需加载的智能体框架。
3.1 智能体框架与分级证据接口
智能体遵循每轮生成推理 rt 与动作 a_t 、接收观测 o_t 、更新上下文 C(t+1) = C_t oplus (r_t, a_t, o_t) 的交互循环。支持的工具包括:
- 候选发现:
TEXTSEARCH、IMAGESEARCH、REVERSEIMAGESEARCH - 目标导向阅读:
WEBVISIT - 主动感知:
FETCHIMAGE、CROPIMAGE - 计算:
PYTHONINTERPRETER
关键设计在于目标条件摘要:WEBVISIT、IMAGESEARCH 或 REVERSEIMAGESEARCH 的输出在进入策略上下文前,先经过一个辅助视觉-语言模型,仅保留与当前目标相关的结论、来源线索与图像引用。这些查询相关的摘要指导导航,但不替代承载答案的图像。
3.2 主动视觉获取(Active Visual Acquisition)
核心创新是将图像可发现性与可观测性解耦:
- 搜索工具返回轻量级的 URL–标题–摘要引用,候选图像以引用形式存在,不消耗多模态上下文;
FETCHIMAGE将选中的图像具体化为可复用的视觉观测;CROPIMAGE在已加载图像上创建局部、可复用的裁剪观测。
由此,候选图像仅以引用形式增加极少量文本上下文,视觉 token 仅在智能体明确执行获取或裁剪动作时才进入策略上下文。视觉寄存器 V 跨轮次保留观测,支持后续视觉操作与检索。
4. 数据筛选与智能体训练
4.1 难度分层与教师轨迹生成
- 直接回答探针:使用无工具模型独立回答三次,若任意一次正确(Pass@3)则丢弃该问题,确保保留的问题真正需要外部工具。
- 难度分层:对保留的问题进行 8 次工具增强采样,按经验 Pass@K 分为简单(7–8 次正确,丢弃)、中等(4–6 次)与困难(0–3 次)。
- 教师轨迹再生:使用更强模型在 DeepVoyager-VL 工具接口下为所有保留问题重新生成轨迹,经 LLM 评判与协议验证后,仅保留正确、合法且可重放的轨迹。难度估计与轨迹生成分离,避免低容量探针行为污染监督信号。
4.2 监督微调(Supervised Fine-Tuning)
筛选后的语料混合了通用搜索轨迹与视觉在环轨迹,统一序列化为多轮格式 zi = (z(i,1), dots, z_(i,L_i)) 。优化目标为:
L(SFT)(θ) = -∑_i ∑(t=1)^(Li) m(i,t) log pθ(z(i,t) mid z(i,<t))∑_i ∑(t=1)^(Li) m(i,t)
其中 m_(i,t) = 1 仅针对助手生成的推理、工具调用与答案 token;系统消息、用户消息、多模态占位符与工具返回 token 均作为条件上下文,不参与损失计算。
训练仅更新语言主干,冻结视觉编码器与多模态融合模块,且不引入额外的强化学习阶段。通过该监督蒸馏,模型直接学习在长程交互中何时发现图像、何时加载视觉证据、如何利用新获取的视觉观测驱动后续检索。
Q: 论文做了哪些实验?
论文围绕效果验证、组件贡献与行为分析三个层面开展了系统实验,涵盖十个公开基准、多组基线对比、数据与框架消融,以及轨迹统计比较。
1. 实验设置
- 评测基准:共选用十个多模态信息检索基准,覆盖事实性视觉问答(MMSearch、SimpleVQA、LiveVQA、FVQA)、深度多模态浏览(BrowseComp-VL、MM-BrowseComp、MMSearch-Plus、VDR-Bench)以及视觉原生可验证浏览(BrowseComp-V3、VisBrowse-Bench)。
- 对比基线:分为三组:
- 直接回答(Direct Answer):GPT-5.5、Gemini-3.1-Pro、Claude-Opus-4.6、Qwen3-VL-8B/30B-A3B-Instruct,无外部工具;
- 智能体工作流(Agentic Workflow):上述模型在 DeepVoyager-VL 工具环境下零样本运行,参数冻结;
- 多模态深度搜索智能体:包括 MMSearch-R1、WebWatcher、DeepEyesV2、SenseNova-MARS、Vision-DeepResearch、REDSearcher-MM、MM-DeepResearch、LMM-Searcher、OpenSearch-VL、SimpleSearch-VL、Visual-Seeker 等 13 个现有方法。
- 评估方式:所有智能体最多允许 50 轮交互;采用 Qwen3.6-35B-A3B 作为评判模型的 LLM-as-judge 判定答案正确性。
- 训练配置:在 Qwen3-VL-8B 与 Qwen3-VL-30B-A3B-Instruct 上执行监督微调(SFT),训练 4 个 epoch,全局 batch size 为 64,峰值学习率 2 × 10^(-5) ,冻结视觉编码器与多模态融合模块,不引入强化学习。
2. 主要结果
2.1 整体性能(Table 1)
- 相较同基线模型的提升:引入智能体工作流后,30B-A3B 模型的平均性能从 20.7 提升至 40.7( +20.0 );经轨迹 SFT 后进一步升至 58.6( +17.9 )。8B 模型趋势一致:17.5 to 35.3( +17.8 ) to 54.8( +19.5 )。
- 同规模开源模型中的领先性:DeepVoyager-VL-30B-A3B 在 10 个基准中的 9 个取得最佳报告结果;8B 版本在 10 个中领先 8 个。
- 增益分布:提升高度集中于搜索密集型基准。相对于同框架基线,30B-A3B 在 BrowseComp-VL 至 VisBrowse-Bench 六个基准上平均提升 23.1 分,远高于前四个基准的 10.3 分;8B 模型对应提升分别为 23.4 与 13.8 分。最大单项提升包括 BrowseComp-VL( +22.6 )、BrowseComp-V3( +23.7 )与 VisBrowse-Bench( +30.7 )。
- 与闭源模型差距:尽管仅使用开源 30B 级主干与 SFT,DeepVoyager-VL 平均 58.6 分,与采用相同智能体工作流的专有模型差距仅为 6.1–8.6 分。
2.2 框架泛化性(Table 2)
为验证框架本身的通用性,将 DeepVoyager-VL 分别与 GPT-5、Gemini-2.5-Pro、Qwen3-VL-30B-A3B-Thinking 三个基础模型配对,与 Vision-DeepResearch 和 LMM-Searcher 在 4 个基准上比较。结果显示:
- DeepVoyager-VL 在所有三个基础模型上均取得最高平均性能;
- 相对于 LMM-Searcher,平均提升分别为 GPT-5( +18.2 )、Gemini-2.5-Pro( +11.5 )、Qwen3-VL-30B-A3B-Thinking( +4.8 );
- 最大框架增益出现在 VisBrowse-Bench(Gemini-2.5-Pro, +27.8 )与 MM-BrowseComp(GPT-5, +26.1 )。
3. 消融实验与分析
3.1 数据消融(Table 3)
采用累积式消融设计,固定训练与推理配置,比较:
- 现成智能体基线;
- 叠加 20K 多源公开轨迹(来自 OpenSearch-VL、Vision-DeepResearch、REDSearcher-MM);
- 再叠加 7K 本论文合成的 Vision-in-the-Loop(VIL)轨迹。
结果如下:
| 训练设置 | BC-VL | BC-V3 | VisBrowse | 平均 |
|---|---|---|---|---|
| Qwen3-VL-8B(智能体基线) | 34.6 | 7.7 | 15.4 | 19.2 |
| +20K 多源轨迹 | 54.4 | 26.7 | 40.8 | 40.6 |
| +7K VIL 轨迹 | 58.4 | 32.3 | 47.3 | 46.0 |
| 训练设置 | BC-VL | BC-V3 | VisBrowse | 平均 |
|---|---|---|---|---|
| Qwen3-VL-30B-A3B(智能体基线) | 41.6 | 11.3 | 23.1 | 25.3 |
| +20K 多源轨迹 | 62.2 | 28.7 | 42.6 | 44.5 |
| +7K VIL 轨迹 | 64.2 | 35.0 | 53.8 | 51.0 |
20K 多源轨迹先带来约 20 分提升;在此基础上,仅 7K VIL 轨迹进一步带来 5.4(8B)与 6.5(30B)分的平均增益,且在图像为中心的扩展浏览任务上提升更为显著,确立了 VIL 数据在强基线之上的独立贡献。
3.2 框架组件消融(Table 4)
以 Qwen3.6-35B-A3B 为基础模型,从完整框架中逐一移除组件:
| 设置 | FVQA | VDR | BC-V3 | 平均 |
|---|---|---|---|---|
| 完整 DeepVoyager-VL | 78.0 | 36.0 | 39.3 | 51.1 |
| w/o Summary | 74.0 | 35.0 | 32.3 | 47.1 |
| w/o Image Search | 77.7 | 35.4 | 32.7 | 48.6 |
| w/o Fetch Image | 76.3 | 35.6 | 33.3 | 48.4 |
| w/o Crop Image |
Q: 有什么可以进一步探索的点?
基于论文附录及方法设计的内在逻辑,可进一步探索的方向主要包括以下五个方面:
1. 从多模态搜索迈向完整的多模态研究
当前框架与评测主要聚焦于答案导向的检索任务(answer-oriented search),即接收明确问题、收集证据并返回简洁答案。未来可扩展至开放式多模态研究(open-ended multimodal research),要求智能体具备以下能力:
- 将开放性目标分解为层次化的研究子问题;
- 在证据收集过程中动态维护与修订研究计划;
- 比较、调和甚至解决跨来源的冲突信息;
- 生成带有可追溯引用的结构化长篇报告。
相应地,评估范式也需从单一的答案正确性,扩展至来源覆盖度、引用完整性、证据忠实度、冲突信息处理质量以及长篇综合质量等维度。
2. 提升证据处理效率并降低交互延迟
论文中采用的目标条件摘要(goal-conditioned summarization)机制虽有效压缩了上下文,但每次调用 WEBVISIT、IMAGESEARCH 等工具时均需引入辅助视觉-语言模型进行处理,这带来了额外的推理延迟与部署成本。未来工作可探索:
- 自适应摘要触发:对短文本或已结构化响应绕过摘要步骤;
- 缓存与复用:对重复访问的页面复用已生成的摘要表示;
- 异步与并行执行:在无即时依赖时并行生成摘要与执行其他检索;
- 蒸馏轻量化摘要器:使用更小规模的模型承担证据提取,以平衡质量与速度。
最终目标是联合优化证据效用、上下文消耗、推理延迟与 monetary 成本,而非仅优化答案准确率。
3. 构建模块化的研究智能体架构(Agent Harness)
现有框架可进一步扩展为更丰富的执行层,以协调规划、工具、记忆与中间研究产物。具体可包括:
- 层次化多模态记忆系统:区分瞬态工作观测(transient working observations,如刚加载的图像裁剪)与巩固证据(consolidated evidence),避免简单累积;
- 证据索引与来源图谱:建立可检索的索引,支持对早期文本、图像及局部裁剪的跨轮次召回;构建来源图(provenance graph)显式连接每个声明与其来源;
- 学习化的保留与驱逐策略:让模型自主决定哪些观测应被保留、压缩或丢弃,从而控制长程交互中的上下文增长;
- 子任务调度与容错机制:支持子任务的并行调度、检查点(checkpointing)与失败搜索的恢复,使智能体能够在更长的时间跨度上 suspend 与 resume 研究进程。
4. 突破视觉工作记忆的边界
当前视觉工作记忆(visual working memory)是累积式且轨迹局部的:输入图像、FETCHIMAGE 加载的图像及 CROPIMAGE 产生的局部观测被直接保留为可引用对象,但不具备以下能力:
- 不学习哪些观测具有高价值、应被长期保留,哪些属于冗余应被丢弃;
- 不按来源、子任务或置信度对证据进行显式组织。
随着交互轮次增长,低价值观测可能持续积累,导致相关证据在上下文中难以定位。未来可探索基于注意力或价值估计的动态记忆整理机制,使视觉工作记忆从“可引用”升级为“可推理、可组织”。
5. 扩展数据合成中的模态与领域覆盖
EventVoyage-VL 基于多模态事件图合成数据,当前主要依托维基百科与新闻文本,并以静态图像为核心视觉证据。未来可进一步探索:
- 引入视频、3D 场景或多页文档作为事件图中的视觉节点,构建更丰富的多模态证据结构;
- 跨语言事件图构建:将事件关联与视觉证据拓展至多语言场景,提升非英语环境下的视觉在环搜索能力;
- 结合强化学习进行数据增强或策略优化:论文当前采用纯监督微调(SFT),未来可在高质量冷启动数据基础上,引入 outcome-based 或 process-based 的强化学习阶段,进一步细化智能体的决策边界。
Q: 总结一下论文的主要内容
该论文提出 DeepVoyager-VL,一种面向长程多模态深度搜索的框架,核心目标是让视觉证据在搜索过程中成为驱动推理与持续检索的中间变量,而非仅停留在输入或输出阶段。
1. 核心问题
现有工作存在两个紧密关联的局限:
- 视觉被边缘化:现有数据合成范式(实体替换、前置视觉推理、答案侧嫁接)均先在文本空间构建推理链,再将视觉插入特定位置。这导致搜索过程中新获取的视觉观测极少决定后续的检索动作,视觉仅作为输入或终端模态,未形成”闭环”。
- 长程交互中的证据管理困境:长程搜索需要持续利用跨轮次的视觉证据,但盲目加载所有候选图像会导致上下文急剧膨胀,而纯文本摘要又可能丢失关键视觉细节。现有机制缺乏”何时、加载何种视觉内容”的主动决策设计。
2. 主要方法
论文的解决方案由数据合成、智能体架构与训练策略三部分构成。
2.1 数据合成:EventVoyage-VL
采用**“先结构后语言”**(structure-before-language)的范式:
- 构建多模态事件图 G=(V,E,M,I,A,F) ,融合实体、事件、时空聚合(宏观事件)与可检索的视觉证据;
- 每张图像显式分离检索上下文 K(ret)(I) 与视觉内容证据 F(vis)(I) ;
- 基于结构谓词确定性提取连通子图(视觉共现网络、时序事件链、空间共位结构等),组合为推理程序 Pi=(D,U,L,I_s,I_r,y) ;
- 强制要求至少一个内部接口变量由视觉证据解析( ∃ j: out(gj) ∈ Var(F(vis)(I_r)) ),且每条约束对候选空间是必要的,从而保证视觉在环(vision-in-the-loop)与反事实必要性。
2.2 智能体框架:主动视觉获取与按需加载
- 解耦发现与观测:搜索工具(
IMAGESEARCH,REVERSEIMAGESEARCH)仅返回轻量级的 URL–标题–摘要引用;FETCHIMAGE按需将选中图像具体化为视觉观测;CROPIMAGE生成可复用的局部裁剪观测。 - 目标条件摘要:
WEBVISIT等工具的返回内容在进入策略上下文前,先由辅助视觉-语言模型提取与当前目标相关的结论、来源线索及图像引用,减少上下文噪声,同时不替代承载答案的原始图像。 - 视觉寄存器 V :跨轮次保留已获取的视觉观测,支持后续的局部操作与检索引用。
2.3 训练:难度感知的监督微调
- 直接回答探针(Pass@3 过滤)与工具增强采样(Pass@K 分层)剔除无需工具的简单问题,保留中、高难度问题;
- 使用更强教师模型在统一工具接口下重新生成轨迹,经评判与验证后保留正确、可重放的轨迹;
- 对 Qwen3-VL-8B/30B-A3B 执行纯监督微调(SFT),仅更新语言主干,冻结视觉编码器与多模态融合模块,不引入强化学习阶段。
3. 实验结果
- 整体性能:在 10 个多模态搜索基准上,DeepVoyager-VL 相较同基线的智能体工作流,8B 模型平均提升 19.5 分(17.5 to 54.8),30B-A3B 模型提升 17.9 分(20.7 to 40.7 to 58.6)。同规模开源智能体中,30B 版本在 9/10 个基准上取得最佳结果,8B 版本在 8/10 上领先。
- 框架泛化性:将 DeepVoyager-VL 框架与 GPT-5、Gemini-2.5-Pro、Qwen3-VL-30B-A3B-Thinking 配对,均优于 Vision-DeepResearch 与 LMM-Searcher 框架。
- 消融分析:
- 数据消融:在 20K 多源公开轨迹基础上,仅增加 7K VIL 合成轨迹,在 BrowseComp-VL、BrowseComp-V3、VisBrowse-Bench 上进一步带来显著增益,验证了视觉在环数据的独立价值。
- 组件消融:移除摘要、图像搜索、获取图像、裁剪图像任一模块均导致性能下降,其中摘要机制影响最大。
- 行为分析:相比现有公开数据集(OpenSearch-VL、Vision-DeepResearch、REDSearcher-MM),EventVoyage-VL 数据诱发的轨迹中视觉工具调用占比达 64.3%,且交互峰值位于 16–20 轮(现有数据多在 1–10 轮),证实了更长程、更视觉驱动的搜索行为。
4. 核心贡献
- 提出 EventVoyage-VL:一种基于多模态事件图的结构化数据合成管道,显式构建具有中间视觉依赖与长推理链的问题。
- 提出 DeepVoyager-VL:一个支持主动视觉获取、按需加载与目标条件上下文管理的长程多模态搜索智能体框架。
- 通过纯监督轨迹微调,在 10 个多模态搜索基准上验证了方法的有效性,表明具有中间视觉依赖的监督数据是实现长程视觉在环搜索的高效路径。
Q: 想要进一步了解论文
以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Huanyao Zhang,Jiepeng Zhou,Runhao Zhao,Yanzhe Shan,Jiaoyang Chen,Bowen Zhou,Bo Li,Fang Wang,Jialong Wu,Zhengwei Tao,Lang Mei,Xiaohan Yu,Liyan Liu,Chong Chen,Wentao Zhang
PDF URL: https://arxiv.org/pdf/2608.01827.pdf
Arxiv URL: https://arxiv.org/abs/2608.01827
Arxiv ID: 2608.01827
CoolPaper URL: https://papers.cool/arxiv/2608.01827
Published: 2026-08-05T01:10:16.217Z
Updated: 2026-08-05T01:10:16.217Z
20. 3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering
Abstract:Recent 3D vision-language models (3D VLMs) construct geometry aware tokens by projecting 2D visual features into world coordinates, enabling spatial reasoning for tasks such as 3D question answering. However, this design generates thousands of tokens per scene, resulting in substantial computational and memory overhead. While token compression has been extensively studied in 2D VLMs, existing approaches rely on semantic relevance or attention-based selection that overlook the structured spatial nature of 3D tokens. Moreover, redundancy in 3D representations cannot be resolved by spatial proximity alone, as object-level token imbalance persists even after spatial aggregation. To address this, we propose 3DZip, a three-stage token compression framework that first applies coarse voxelization to remove point-level redundancy, then selects anchor tokens based on feature-space diversity via a Determinantal Point Process, and finally merges remaining tokens under spatial constraints to preserve geometric coherence. Experiments on three 3D question answering benchmarks demonstrate that 3DZip consistently outperforms existing compression methods, retaining 94.7% of the original performance with only 128 tokens, achieving a $1.92\times$ faster inference speed.
中文摘要
摘要:近期的三维视觉-语言模型(3D VLMs)通过将二维视觉特征投影到世界坐标中构建几何感知的标记,从而使空间推理成为可能,例如用于三维问答任务。然而,这种设计每个场景会生成成千上万的标记,导致巨大的计算和内存开销。尽管在二维VLMs中标记压缩已被广泛研究,但现有方法依赖于语义相关性或基于注意力的选择,忽略了三维标记的结构化空间特性。此外,三维表示中的冗余不能仅通过空间邻近关系来解决,因为即使在空间聚合之后,仍然存在对象级别的标记不平衡问题。为了解决这一问题,我们提出3DZip,一种三阶段的标记压缩框架:首先应用粗略体素化来去除点级冗余,然后通过行列式点过程(Determinantal Point Process)根据特征空间多样性选择关键标记,最后在空间约束下合并剩余标记以保持几何一致性。在三个三维问答基准上的实验表明,3DZip始终优于现有压缩方法,仅使用128个标记便能保留94.7%的原始性能,同时实现$1.92 imes$更快的推理速度。
LLM Analysis
LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded
Authors: Changwoo Baek,Kyeongbo Kong
PDF URL: https://arxiv.org/pdf/2608.01185.pdf
Arxiv URL: https://arxiv.org/abs/2608.01185
Arxiv ID: 2608.01185
CoolPaper URL: https://papers.cool/arxiv/2608.01185
Published: 2026-08-05T01:10:23.228Z
Updated: 2026-08-05T01:10:23.228Z