数据来源:HuggingFace Papers

Latest Papers

1. NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness

Abstract:Recursive self-improvement (RSI) requires a concrete mechanism through which an AI system observes its capabilities and converts that evidence into the next round of learning. We present NeoHorse-1, a family of agent-native models developed to explore this path through agentic post-training. Our system combines a heterogeneous model pool with intelligent routing, recording the predicted capability demand, selected service tier, and subsequent interaction for each user turn. These records are converted into training examples that preserve interleaved reasoning, tool calls, and harness context, and are admitted through structural validation, six-dimensional semantic evaluation, and subscene-level labeling. Routing signals organize supervised fine-tuning into a three-stage curriculum and extend to routing-guided on-policy distillation, where a teacher supervises student-generated responses under the same progression. Capability-guided allocation then converts evaluation feedback into the next training mixture, closing an evaluation-selection-update loop in which what the system learns to do shapes what it learns from next. Across eleven benchmarks covering harness-based agents, tool use, coding, and instruction following, post-training raises the macro-average from 58.94 to 64.87 at 4B and from 65.60 to 69.04 at 9B, substantially narrowing the aggregate gap between the post-trained 4B model and the 9B base model. NeoHorse-1 provides an initial prototype of this feedback-driven process and a path toward harness-mediated RSI across successive iterations.

中文摘要

摘要:递归自我改进(RSI)需要一个具体机制,通过该机制,人工智能系统能够观察自身能力并将这些证据转化为下一轮学习。我们提出了NeoHorse-1,这是一系列面向智能体的模型,旨在通过代理后训练探索这一路径。我们的系统结合了异构模型池与智能路由,为每个用户轮次记录预测的能力需求、所选服务等级以及后续交互。这些记录被转化为训练示例,保留了交错推理、工具调用和应用上下文,并通过结构验证、六维语义评估及子场景级标注进行审核。路由信号将监督微调组织为三阶段课程,并扩展至路由引导的策略内蒸馏,在此过程中教师在相同进程下监督学生生成的响应。能力引导的分配随后将评估反馈转化为下一轮训练混合,形成评估-选择-更新循环,其中系统学会做的事情决定了其下一步的学习内容。在覆盖基于应用的代理、工具使用、编程和指令执行的十一项基准测试中,后训练使4B模型的宏平均从58.94提升至64.87,使9B模型从65.60提升至69.04,显著缩小了后训练4B模型与9B基础模型之间的整体差距。NeoHorse-1提供了这一反馈驱动过程的初步原型,并为在连续迭代中通过应用驱动的RSI提供了一条路径。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*递归自我改进(Recursive Self-Improvement, RSI)缺乏具体实现机制\*\*的问题,核心在于探索如何将AI系统部署环境中的运行时信号转化为可持续的、自动化的模型自我提升闭环。具体而言,论文针对以下几个关键子问题展开: ## 核心问题 ### 1. RSI 的"证据-学习"转化机制缺失 现有RSI研究多停留在方向性讨论,缺乏让系统\*\*观察自身能力边界\*\*并将这些观察\*\*自动转化为下一轮训练\*\*的工程化路径。论文提出,部署环境中的\*\*路由 harness(routing harness)\*\*本身就是现成的RSI载体:它天然记录了每次交互的能力需求预测、实际执行的模型层级、以及完整的执行轨迹,这些构成了模型自我观察的"证据"。 ### 2. 如何从无序的交互轨迹中提炼结构化训练信号 智能体在实际部署中产生的交互数据(工具调用、环境反馈、多轮推理)远非静态的"指令-回答"对可比。论文需要解决: - 如何\*\*保留交错推理、工具调用和 harness 上下文\*\*的完整性 - 如何对海量轨迹进行\*\*质量控制\*\*(结构验证、六维语义评估、子场景级标注) - 如何将不同能力需求的交互按难度组织为有效的\*\*课程学习\*\*材料 ### 3. 如何将"能力差距"反馈转化为数据分配策略 论文试图建立一种\*\*评估-选择-更新\*\*的闭环:系统在当前任务上的表现缺陷不应仅作为评分,而应直接决定下一轮训练数据的混合比例(capability-guided allocation)。这要求解决: - 如何根据路由信号估计能力需求(C0-C3四级服务层级) - 如何利用评估结果将训练 mixture \*\*动态倾斜\*\*至表现不足的领域 - 如何让更新后的模型重新进入 harness,产生新的轨迹以驱动下一轮迭代 ### 4. 小模型通过后训练逼近大模型能力的可行性 在固定模型规模下,论文试图验证:通过 harness 介导的 agentic post-training,能否让\*\*4B模型显著缩小与9B基础模型\*\*之间的性能鸿沟,从而论证RSI在资源受限场景下的实用价值。 ## 总体目标 论文最终将上述问题归约为一个可操作的反馈循环:\*\*路由 harness 产生交互经验与能力信号 → 经验被转化为带上下文 preservation 的训练样本 → 路由分数组织为三阶段课程学习与策略内蒸馏 → 评估反馈重新配置数据 mixture → 更新模型返回 harness 继续产生新经验\*\*。NeoHorse-1 被视为这一 \*\*harness-mediated RSI\*\* 流程的初始原型。 Q2: 有哪些相关研究? 该论文的相关研究主要围绕三个核心维度展开:\*\*智能体模型后训练\*\*、\*\*LLM路由与课程学习\*\*,以及\*\*递归自我改进\*\*。这些维度共同构成了将部署环境中的交互轨迹转化为模型自我提升信号的理论与技术基础。 --- ## 1. 智能体模型后训练(Agentic Model Post-Training) ### 基于轨迹的监督微调(Trajectory-based SFT) 早期工作通过交互轨迹来迁移规划与工具使用能力: - \*\*FireAct\*\* 与 \*\*AgentTuning\*\* 直接从交互轨迹中学习; - \*\*Agent-FLAN\*\* 和 \*\*AgentBank\*\* 则表明数据构成与规模对泛化能力具有显著影响; - \*\*Llama 3\*\* 进一步扩展了该范式,结合合成多步工具使用数据、迭代SFT、拒绝采样与直接偏好优化(DPO)进行后训练。 ### 策略内蒸馏(On-Policy Distillation, OPD) 传统轨迹SFT主要模仿固定的教师策略,而OPD通过允许学生生成轨迹、教师在其访问的状态上提供token级logits监督,从而缩小分布差距: - 相比传统教师轨迹蒸馏(Hinton et al.),OPD提供了与学生不断演化的行为更对齐的\*\*密集过程监督\*\*; - 相关工作包括 Agarwal et al. (2024) 与 Lu (2025) 对语言模型策略内蒸馏的系统性研究。 ### 交互式 Harness 设计 交互环境(harness)决定了哪些工具、观察与反馈进入训练分布: - \*\*SWE-agent\*\* 与 \*\*The Interplay of Harness Design and Post-Training\*\* 证实界面选择对智能体性能与鲁棒性具有决定性影响; - \*\*Terminal-Lego\*\* 强调了显式结构化、环境锚定的轨迹价值。 ### 基于可执行环境反馈的智能体强化学习 用工具执行结果与任务结局替代固定的行为标签: - \*\*Search-R1\*\*、\*\*ReTool\*\* 与 \*\*RAGEN\*\* 分别针对搜索、工具使用与长程交互开展研究; - \*\*Agent Lightning v1.0\*\* 将环境循环保留在部署harness内部; - \*\*Co-Harness\*\* 则尝试联合更新harness与模型权重。 --- ## 2. LLM路由与课程学习(LLM Routing and Curriculum Learning) ### LLM 路由(LLM Routing) 路由系统根据查询请求动态分配合适的模型,以平衡响应质量与推理成本: - \*\*FrugalGPT\*\* 研究了成本感知的模型级联(model cascades); - \*\*RouteLLM\*\* 利用偏好数据学习在强弱模型间进行路由; - \*\*Agentic Routing\*\* 将这一思想扩展到多智能体LLM系统,使决策层能够为每个传入请求选择最合适的模型或子智能体。 ### 课程学习(Curriculum Learning) 课程学习按照估计的难度顺序呈现样本,已被证明在LLM后训练中有效: - 经典工作如 \*\*Bengio et al.\*\* (2009) 奠定了理论基础; - \*\*Lee et al.\*\* (2024) 研究了面向指令微调的人类课程设计。 与现有方法通常依赖显式难度标签或数据集特定启发式不同,该论文提出\*\*利用路由系统提供的请求级与上下文级预测\*\*作为能力需求估计,从而组织课程训练。关键在于,论文使用路由预测作为排序依据,而非将最终实际服务的模型身份直接作为难度标签——因为实际路由结果可能受用户覆盖、服务可用性与部署策略影响。 --- ## 3. 递归自我改进(Recursive Self-Improvement, RSI) RSI 研究关注系统在何种粒度上、以何种方式利用自身经验或生成产物来改进模型、脚手架或改进过程本身。 ### 任务行为与智能体脚手架层面 - \*\*MetaSkill-Evolve\*\* 联合演化任务技能与支配其改进的元技能(meta-skill); - \*\*AREX\*\* 交替进行证据收集与答案审计; - \*\*Self-Harness\*\*、\*\*Agentic Harness Engineering\*\* 与 \*\*Retrospective Harness Optimization\*\* 利用失败记录、可观察性与历史轨迹来更新harness; - \*\*Continual Harness\*\* 将这一设定扩展到无需重置的在线自适应与模型更新。 ### 训练过程自动化层面 - \*\*AI4AI-Bench\*\* 评估智能体是否能够修改训练算法,使后续运行继承改进收益; - 系统级工作(如 \*\*Anthropic\*\* 与 \*\*OpenAI\*\* 的相关论述,以及 \*\*Weng\*\* 对 harness engineering 的综述)开始将模型改进的自动化组件(harness设计、服务基础设施、训练流水线)纳入RSI框架。 --- ## 与本文的关系 上述研究为 NeoHorse-1 提供了层叠式的技术背景: - \*\*轨迹SFT与OPD\*\* 提供了将交互记录转化为模型参数更新的基本方法; - \*\*Harness设计\*\* 研究确立了执行环境作为性能决定因素的地位; - \*\*路由与课程学习\*\* 的工作为利用部署时信号组织训练数据提供了可行路径; - \*\*RSI 的近期进展\*\* 则证明了在行为、脚手架与训练流程三个层次上实现自我改进的可能性。 NeoHorse-1 的核心差异在于:它\*\*将路由harness本身同时作为服务机制与数据源\*\*,把路由预测(能力需求估计)、执行轨迹(训练样本)与评估反馈(数据重分配)整合进一个统一的\*\*评估-选择-更新\*\*闭环,从而将RSI从概念设计推向可操作的训练实践。 Q3: 论文如何解决这个问题? 该论文通过将\*\*部署级路由 harness(routing harness)的日常运行同时作为服务机制与数据飞轮\*\*,把递归自我改进(RSI)从抽象概念转化为可操作的训练闭环。解决方案由三个相互连接的组件构成:数据工程、训练方法、以及能力引导的数据分配。 --- ### 1. 利用 Routing Harness 构建可观测的交互经验 系统以异构模型池支撑多个 harness(包括 OpenSquilla),在多样化真实任务上执行用户请求。每轮交互中,harness 记录三类信号: - \*\*能力需求预测\*\*:路由器根据当前请求、近期对话与执行状态,将交互标记为 C0–C3 四个服务能力层级之一; - \*\*执行轨迹\*\*:包含用户请求、模型交错推理、工具调用、环境观察、恢复尝试与终止结果; - \*\*预测-行动-结果分离\*\*:保留原始预测、策略调整后的决策、以及实际服务的层级,使后续分析能够区分“模型需要什么能力”与“系统实际分配了什么资源”。 这些记录构成了 RSI 所需的“自我观测证据”——不仅提供训练样本,还提供模型能力边界的结构化反馈。 --- ### 2. 从原始轨迹到结构化训练语料 #### 2.1 三级粒度组织 论文将语料组织为三个相互关联的粒度: - \*\*Trajectory\*\*:由 harness 执行的完整交互; - \*\*User Turn\*\*:从一次用户请求到下一次用户请求(或任务终止)的基本训练单元; - \*\*Subscene\*\*:共享局部目标的相邻 user turn 组合,用于语义属性标注。 在每个 user turn 中,当前轮的交错推理、工具调用与观察被完整保留;历史轮次保留可见响应与工具交互,但省略历史推理,以确保序列长度可控且上下文不丢失。 #### 2.2 质量控制与语义表征 - \*\*结构验证\*\*:通过规则检查请求/响应存在性、因果事件顺序、工具调用与结果配对闭合性等。轨迹被划分为“完整”“可部分恢复”“隔离”三类。 - \*\*六维语义评估\*\*:对结构可用的轨迹,在目标达成、指令遵循、工具使用、证据一致性、错误恢复、终止六个维度上分别判定 PASS / WARN / FAIL / NOT\_EVALUATED。 - \*\*子场景三维标注\*\*: - \*\*Scene\*\*:任务类型、应用领域、使用情境; - \*\*Goal\*\*:验收标准、跨轮次关系(新建/延续/修改/恢复); - \*\*Outcome\*\*:可验证的实际结果与目标满足程度。 这些信号共同定位能力缺口,为后续数据分配提供坐标。 --- ### 3. 路由引导的后训练方法 #### 3.1 智能体监督微调(Agentic SFT) 每个 user turn 被序列化为训练样本,仅对助手目标片段(当前轮推理、工具调用、可见响应及结束符)计算损失。历史上下文、用户消息、工具结果等掩码为 0。 目标函数为 token 级掩码交叉熵,按批次内被监督 token 总数归一化:

L(SFT)(θ; B) = -∑(i ∈ B) ∑(t=2)^(T_i) m(i,t) log pθ(x(i,t) mid x(i,<t))∑(i ∈ B) ∑(t=2)^(T_i) m(i,t)
其中 m(i,t) 为二进制损失掩码, x(i,t) 为第 i 条序列的第 t 个 token。 #### 3.2 路由引导的课程学习(Routing-Guided Curriculum Learning) 利用路由估计的能力需求对样本排序。对每条示例,定义硬排序分数(分配层级 k_i )或软排序分数(层级概率加权均值):

si = k_i, & hard ordering, ∑(k=0)^(3) k , π(i,k), & soft ordering.
训练分为三阶段,逐步引入更高 s_i 的示例,同时在后期保留部分低分示例以防灾难性遗忘: - **Stage 1**:聚焦较低估计需求; - **Stage 2**:覆盖更广分数范围; - **Stage 3**:聚焦较高估计需求。 整个过程中优化器与学习率调度不重置,仅通过数据混合比例实现课程效果。 #### 3.3 路由引导的策略内蒸馏(Routing-Guided On-Policy Distillation, OPD) SFT 学习的是记录下来的助手响应,而部署时模型实际面对的是自己生成的历史前缀。为弥合这一分布差距,论文将同样的三阶段路由调度扩展至 OPD: 1. **上下文调度**:从记录中抽取助手响应前的起始状态作为生成起点,按路由分数分三阶段分配; 2. **学生生成与教师监督**:学生模型 p
(θ) 从阶段分布 rhoj 中采样上下文并生成响应;固定教师模型在每个生成位置提供 next-token 分布; 3. **紧凑监督**:仅保留学生每步的 top- K 候选 token,将其余概率质量聚合为一个额外 bin,构造 K+1 个分桶的粗化分布 P(θ,r,t) (学生)与 Q_(r,t) (教师); 4. **目标函数**:最小化响应归一化的 reverse KL 散度:

L(OPD)(θ; R) = (1) / (∑(r ∈ R) wr) ∑(r ∈ R) wr · (1) / (L_r) ∑(t=1)^(Lr) D(KL)!(P(θ,r,t) ,|, Q(r,t))
其中 Lr 为响应长度, w_r 为响应权重。阶段目标综合上下文分布与学生生成:
L
(R-OPD)^((j))(θ) = E(C sim rho_j,; R sim pθ)(· mid C) [ L(OPD)(θ; R) ], quad j ∈ 1,2,3.
训练过程中定期刷新学生 rollout 检查点,使后续上下文获得针对更新后学生行为的教师监督。 —- ### 4. 能力引导的数据分配:关闭 RSI 闭环 最后一步将评估反馈转化为下一轮训练 mixture,实现“评估—选择—更新”循环: - **缺陷画像**:在保持与训练数据不相交的基准套件上评估当前检查点,按语义属性、质量维度、结果状态与路由层级聚合,形成模型能力缺陷画像; - **动态倾斜**:将下一 iteration 的训练 mixture 向表现不足的领域倾斜,同时保留广泛覆盖;验证成功的轨迹提供正监督,信息性失败则指示需要补充或重新平衡的数据区域; - **持续流入**:harness 在两轮迭代之间持续产生新轨迹,新旧数据一起重新分配,使语料随使用模式与系统能力演化; - **迭代返回**:更新后的模型重新加入 heterogeneous model pool,其在新轨迹中的行为暴露出下一批能力边界,从而驱动后续训练。 —- ### 总结 论文解决 RSI 问题的核心路径是:**将 harness 的运行时记录(路由信号、执行轨迹、结果验证)同时视为服务日志与训练资产**。通过结构化的数据工程保留交互上下文,通过路由分数组织课程学习与策略内蒸馏,再通过评估反馈重新配置数据混合比例,最终形成一个无需完全依赖人工策划数据的自我增强循环。 Q4: 论文做了哪些实验? 论文中的实验围绕**基准性能评测**、**智能体执行行为分析**、以及**训练数据消融**三个层面展开,系统验证了路由引导的后训练(routing-guided agentic post-training)在不同规模模型上的效果与机制。 —- ## 1. 主基准评测(Main Benchmark Evaluation) 在 4B 与 9B 两个参数规模上,论文将 NeoHorse-1 与多个同量级或相近量级的开源模型进行全面对比,覆盖 10 个基准测试,分为三大类: ### 评测基准 - **智能体能力(Agentic)** - **端到端智能体执行**:QwenClawBench、WorkBuddy Bench、PinchBench、VitaBench - **工具使用与交互式任务**:BFCL V4、 τ^2 -Bench(覆盖 Airline、Retail、Telecom 领域) - **代码生成(Coding)**:HumanEval、LiveCodeBench v6 - **指令遵循(Instruction Following)**:IFEval、IFBench ### 对比基线 - **4B 赛道**:Qwen3.5-4B、Spark-X2.5-4B、Gemma-4-E4B-it、Nanbeige-4.2-3B、Agents-A1-4B - **9B 赛道**:Granite-4.2-8B、Qwen3.5-9B、Ornith-1.5-9B、Gemma-4-12B-it、Muse-Glimmer-30B ### 关键结果(见 Table 1 与 Table 2) - **4B 规模**:后训练将宏观平均分(macro-average)从基线 Qwen3.5-4B 的 58.94 提升至 NeoHorse-1-4B 的 64.87 ,在全部可获得对比结果的基准上均超过基线,且在 harness-based 智能体任务与代码基准上提升最为显著。 - **9B 规模**:宏观平均分从 Qwen3.5-9B 的 65.60 提升至 NeoHorse-1-9B 的 69.04 ,优势仍集中在多步交互、工具调用与执行密集型任务上。 - **跨规模补偿**:后训练后的 4B 模型在多个基准上已逼近或超过 9B 基线模型,表明 agentic post-training 可在一定程度上弥补参数规模差距。 ### 实验设置细节 - 所有模型统一使用 benchmark 特定 harness、工具接口、上下文长度与交互预算。 - NeoHorse-1 及其 Qwen3.5 基线均采用 thinking 模式(`enable_thinking: true`),temperature =1.0 ,top- p=0.95 ,top- k=20 。 - QwenClawBench、WorkBuddy Bench 与 τ^2 -Bench 执行 3 次独立运行并报告算术均值。 —- ## 2. 智能体轨迹定性分析(Agent Trace Analysis) 为理解后训练与规模扩展如何改变模型行为,论文对代表性智能体轨迹进行了定性剖析,重点关注**证据获取、约束跟踪、执行验证、故障恢复与策略调整**五个维度。 ### 实验 2.1:后训练如何弥合端到端执行闭环 - **任务**:QwenClawBench 项目调度场景。 - **观察**:Qwen3.5-4B 基线虽能识别工作目录文件,但**遗漏**了包含更新依赖约束的经理邮件,导致基于过时信息制定无效计划并将产物写入错误路径。 - **后训练效果**:NeoHorse-1-4B 能够检索该额外证据、识别更新后的依赖关系、重新计算并验证调度方案,最终将产物保存至指定路径。这说明后训练改善了从局部动作到完整工作流的组织能力。 ### 实验 2.2:规模在反馈与失败恢复中的收益 - **任务 A**:WorkBuddy 代码修复场景。 - NeoHorse-1-4B 在单次实现尝试后停止,未能建立有效的**编辑-测试-检查-修复**循环,遗留线程执行语义错误。 - NeoHorse-1-9B 则持续整合执行反馈,反复迭代直至验证通过,展现了更强的**迭代调试与错误修复**能力。 - **任务 B**:PinchBench 数据分析场景(环境约束:pandas 不可用)。 - NeoHorse-1-4B 反复尝试安装依赖、手动解析 CSV 与本地脚本修补,均告失败,最终无法生成报告。 - NeoHorse-1-9B 在发现原始路径被阻塞后,**放弃**重复尝试,转而使用 Python 标准库 `csv` 与数学库完成分析与报告,模型请求数、执行时间与 token 消耗分别降低约 70.8% 、 76.7% 与 83.6% 。 上述案例表明:后训练提升工作流完整性;更大的规模则在**持续闭环执行、策略重构与资源效率**上体现优势。 —- ## 3. 数据消融实验(Data Analysis) 本节在受控条件下隔离数据**来源**与**规模**对性能的影响,所有实验均基于 4B 模型(Qwen3.5-4B 初始化),并在 LiveCodeBench、HumanEval、IFBench、BFCL V4 与 τ^2 -Bench 五个稳定可用的基准上评估。 ### 实验 3.1:路由 Harness 数据 vs. 公开智能体数据 - **对照设计**:将论文使用的 **routing-harness 轨迹数据**与公开合成工具智能体数据集 **Toucan** 在完全相同的条件下对比——两者均经过相同离线路由标注流程获得能力需求分数,使用相同的三阶段课程调度、优化器设置、随机种子、打包方法与评测协议,且训练预算 closely matched。 - **结果(见 Table 3)**:Routing-harness 数据在所有五个基准上均优于 Toucan,无加权平均分提升 +6.26 个百分点;最大单点增益出现在 τ^2 -Bench( +11.31 )与 HumanEval( +8.54 )。 - **结论**:路由介导的真实交互数据相比公开合成轨迹,能提供更强且更可迁移的智能体监督信号。 ### 实验 3.2:路由 Harness 监督规模的扩展 - **设计**:从单一质量排序轨迹池中构造严格嵌套的子集(每级包含前一级全部样本),固定模型初始化、优化、打包与遍历轮数,仅改变**独立监督 token 数量**。 - **结果(见 Figure 7)**:随着数据规模(对数轴)增加,五基准无加权平均分从基线的 69.31 单调上升至最大规模时的 71.45 。 - **结论**:在评测范围内,高质量智能体监督的扩展能够带来一致的聚合性能增益,支持将数据量视为**能力依赖型分配决策**(capability-dependent allocation)而非固定超参数。 —- ## 4. 附录案例研究(Appendix B) 论文在附录中补充了三组详细的深度案例,对比 Qwen3.5-9B 与 NeoHorse-1-9B 在复杂约束下的执行与产物质量: | 案例 | 任务描述 | 核心差异 | |———|—————|—————| | **Case A** | 在时间与审计约束下生成中文 Markdown 票务日报 | Qwen3.5-9B 保留矛盾总计并错将次日状态赋予当日记录;NeoHorse-1-9B 正确识别 50 条合格记录与 19 张票据,排除次日更新,但状态摘要表仍存在标签错配。 | | **Case B** | 按仓库需求实现时间泄漏审计器 | Qwen3.5-9B 未读取 README,使用 2 秒容忍度(而非要求的 5 分钟),错误拒绝合法样本并破坏输出模式;NeoHorse-1-9B 遵循文档阈值与数据契约,输出符合指定模式。 | | **Case C** | 用 HTML 实现可交互的双人五子棋 | Qwen3.5-9B 的点击处理器读取不存在的 DOM 属性,导致 26 次点击均产生索引错误,页面无棋子显示;NeoHorse-1-9B 在 26 次点击中无运行时异常,正确维护落子位置、颜色与回合切换。 | 这些案例从**长程状态一致性**、**需求发现与接口兼容**、以及**交互式前端正确性**三个角度,验证了后训练模型在真实世界复杂约束下的执行鲁棒性。 Q5: 有什么可以进一步探索的点? 基于论文所述局限与现有技术路径,以下几方面值得进一步探索: —- ### 1. 跨代际闭环迭代的持续性验证 论文当前仅完成了**单轮**“评估—选择—更新”循环。核心待验证问题是:当每一代改进后的模型重新投入路由 harness 生成新的交互轨迹时,其能力增益能否在**连续多轮迭代**中持续累积,抑或会迅速遭遇收益递减或分布漂移导致的性能天花板?未来工作需系统性地返回每一代检查点至异构模型池,观测多轮迭代后的能力曲线与数据 mixture 的演化形态。 —- ### 2. 向更广泛任务域与执行环境的扩展 现有验证集中于文本型智能体、代码生成与指令遵循任务。然而,部署级 harness 通常覆盖更广泛的**多模态输入**(图像、文档解析)、**复杂软件界面**(GUI、终端、浏览器)以及**长程企业工作流**。将经验收集、路由分数估计与课程学习机制扩展到这些异构环境与任务类型,是验证 harness-mediated RSI 通用性的必要步骤。 —- ### 3. 路由信号的校准化与路由器联合优化 当前路由信号主要服务于数据排序与分配,但其预测精度与校准度仍有提升空间。未来可探索: - 将记录的“预测—行动—结果”三元组转化为**经过良好校准的难度估计与缺陷估计**; - 引入针对路由器本身的监督或强化学习,使其不仅分配请求,还能**主动提出模型应尝试的下一个能力边界区域**; - 探索路由器与目标模型的**协同演化**(co-evolution),而非将路由器视为固定基础设施。 —- ### 4. 与强化学习及偏好优化的深度融合 论文的后训练栈以监督微调(SFT)与策略内蒸馏(OPD)为主。将 harness 产生的可执行环境反馈(如工具执行成败、任务完成信号)转化为**细粒度奖励信号**,进而与强化学习(如 ReTool、RAGEN 范式)或直接偏好优化(DPO)结合,可能进一步释放交互式反馈的价值。特别是,OPD 中教师模型提供的 logits 监督可进一步替换为基于环境验证的**结果奖励或过程奖励**。 —- ### 5. 更大规模模型与多模态能力的验证 实验仅在 4B 与 9B 规模上展开。随着基座模型参数量提升至数十亿乃至数百亿级别,需要检验: - 路由引导的课程学习与 OPD 是否仍能有效组织训练; - 后训练收益在更大模型上的**边际效应**如何变化; - 将架构扩展至多模态 agent 时,交错推理与工具调用的序列化与掩码策略是否需要重构。 —- ### 6. Harness 本身的动态演化 论文将 harness 视为记录与分发生成数据的**静态执行层**。参考 Co-Harness、Self-Harness 与 Agentic Harness Engineering 等方向,未来可探索: - 利用模型失败轨迹**自动更新工具集、系统提示词与交互接口**; - 在 RSI 循环中同时优化模型权重与 harness 配置,形成**双向反馈回路**。 —- ### 7. 自动化数据质量评判与细粒度缺陷画像 当前的六维语义评估与场景标注仍部分依赖模型判断与规则检测。未来可研究: - 将结构验证与语义评估进一步自动化,以降低人工设计评判维度的成本; - 将子场景级(subscene)的缺陷画像从当前的聚合统计推进到**实例级、细粒度归因**,实现更精准的数据 mixture 重分配; - 探索在线学习机制,使数据准入阈值与 quarantine 策略随模型能力动态调整。 —- ### 8. RSI 的理论分析 目前 harness-mediated RSI 的有效性仍属经验性发现。未来有必要从理论上探讨: - 在课程学习与数据分布持续漂移的条件下,模型性能的**收敛性**与**稳定性**保证; - 能力引导的数据分配策略与模型泛化边界之间的**定量关系**; - 异构模型池中多模型交互对单一模型自我改进动力学的**系统性影响**。 Q6: 总结一下论文的主要内容 该论文围绕**递归自我改进(Recursive Self-Improvement, RSI)**的工程化实现展开,提出并验证了通过**部署级路由 harness(routing harness)**驱动模型自我提升的完整闭环。以下是论文主要内容的系统总结。 —- ## 1. 核心问题与动机 递归自我改进要求系统能够观察自身能力边界,并将这些观察转化为下一轮学习信号。论文的核心论点是:**已部署的智能体路由 harness 天然包含这样的机制**。它在服务用户请求的同时,记录了每一次交互的能力需求预测、实际执行路径、环境反馈与任务结果。这些运行轨迹与信号不仅是服务日志,更是可用于持续训练的结构化自我观测证据。 —- ## 2. NeoHorse-1 系统架构 NeoHorse-1 是一个面向该目标构建的 agent-native 模型家族,其核心设计包括: - **异构模型池与多 harness 部署**:结合 OpenSquilla 等 harness,在多样化真实任务上执行; - **智能路由层**:每轮用户交互根据请求、对话历史与执行状态,预测能力需求并分配服务层级; - **信号记录**:保留预测、决策与实际服务层级,以及完整的执行轨迹,形成“预测—行动—结果”分离的可分析记录。 该系统构成了 harness-native 数据飞轮的基础:服务执行产生经验,经验经处理回流为训练数据,更新后的模型重新进入 harness,形成迭代。 —- ## 3. 数据工程:从原始轨迹到训练语料 论文将 harness 生成的交互记录转化为高质量、结构化的训练数据,关键步骤包括: ### 三级粒度组织 - **Trajectory**:完整交互记录; - **User Turn**:从一次用户请求到下一次请求或任务终止,作为基本训练单元; - **Subscene**:共享局部目标的相邻 user turn 组合,用于语义标注。 ### 质量控制 - **结构验证**:检查因果顺序、工具调用闭合性、事件完整性,产出“完整/部分恢复/隔离”三类; - **六维语义评估**:在目标达成、指令遵循、工具使用、证据一致性、错误恢复、终止六个维度上独立判定; - **三维场景标注**:每个 subscene 从 **Scene**(用户做什么)、**Goal**(验收标准)、**Outcome**(可验证结果)三个轴进行属性化。 ### 路由信号 路由系统将每轮交互标记为 C0(低风险)至 C3(高能力需求)四级,保留原始预测分数 π
(i,k) ( k=0,1,2,3 ),用于后续课程排序与能力分析,而非直接作为难度标签。 —- ## 4. Agentic 后训练方法 基于上述数据,论文提出了一套路由引导的后训练栈: ### 4.1 Agentic 监督微调(SFT) 将每个 user turn 序列化为训练样本,保留当前轮的交错推理与工具调用,历史轮仅保留可见响应而省略历史推理。仅对助手目标片段计算损失:

L(SFT)(θ; B) = -∑(i ∈ B) ∑(t=2)^(T_i) m(i,t) log pθ(x(i,t) mid x(i,<t))∑(i ∈ B) ∑(t=2)^(T_i) m(i,t)
其中 m(i,t) 为助手 token 的二进制掩码。 ### 4.2 路由引导的课程学习 利用路由估计的能力需求分数对样本排序。定义硬排序 s_i = k_i 或软排序 s_i = ∑(k=0)^(3) k , π_(i,k) 。训练分为三阶段,逐步引入更高 s_i 的示例,同时保留部分低分示例以防遗忘:

si = k_i, & hard ordering, ∑(k=0)^(3) k , π_(i,k), & soft ordering.

4.3 路由引导的策略内蒸馏(OPD) 为解决 SFT 中记录响应与学生实际生成分布不一致的问题,论文将路由课程扩展至 OPD: - 按路由分数分三阶段采样起始上下文; - 学生模型 p_(θ) 生成响应; - 固定教师模型在学生生成的每个前缀上提供 next-token 分布; - 采用 top- K 粗化与 reverse KL 目标:

L(OPD)(θ; R) = (1) / (∑(r ∈ R) wr) ∑(r ∈ R) wr · (1) / (L_r) ∑(t=1)^(Lr) D(KL)!(P(θ,r,t) ,|, Q(r,t))
阶段目标综合上下文分布与学生生成:
L(R-OPD)^((j))(θ) = E(C sim rhoj,; R sim pθ)(· mid C) [ L_(OPD)(θ; R) ].
—- ## 5. 能力引导的数据分配:关闭 RSI 闭环 论文提出将评估反馈转化为下一轮训练 mixture 的机制: - 在保密的基准套件上评估当前模型,按语义属性、质量维度与路由层级聚合为**能力缺陷画像**; - 将后续训练 mixture **动态倾斜**至表现不足的领域,同时保持广泛覆盖; - Harness 持续产生新轨迹,新旧数据统一重新分配; - 更新后的模型返回 harness,其行为暴露新的能力边界,从而闭合**评估—选择—更新**循环。 —- ## 6. 实验结果 ### 6.1 主基准评测 在覆盖智能体、代码与指令遵循的 10 个基准上: - **4B 模型**:宏观平均分从基线 58.94 提升至 64.87 ; - **9B 模型**:宏观平均分从基线 65.60 提升至 69.04 ; - 后训练后的 4B 模型在多个基准上逼近或超过 9B 基线,显著缩小规模差距; - 最大增益集中在 harness-based 智能体任务、工具调用与代码生成。 ### 6.2 智能体轨迹分析 定性分析表明: - 后训练使模型能够完成更完整的端到端工作流(证据获取、约束更新、验证、产物交付); - 更大规模模型在迭代调试、失败恢复与策略调整(如发现依赖不可用后果断切换方案)方面更具优势。 ### 6.3 数据消融 - **数据来源**:在相同课程配置下,routing-harness 数据相比公开合成智能体数据集(Toucan)平均提升 6.26 分,证明部署轨迹具有更强的迁移性; - **数据规模**:在严格嵌套的子集扩展实验中,五基准平均分随唯一监督 token 数量增加从 69.31 稳步提升至 71.45 。 —- ## 7. 结论与未来方向 NeoHorse-1 被定位为 harness-mediated RSI 的**初始原型**,其核心价值在于证明:日常部署中的路由 harness 已能提供持续自我改进所需的经验与反馈。论文同时指出若干待探索方向: - **跨代际迭代**:当前仅验证单轮闭环,需测试多轮迭代的持续累积效应; - **更广任务域**:向多模态、GUI、浏览器与企业工作流扩展; - **路由信号优化**:提升路由器校准度,探索路由器与目标模型的协同演化; - **深度融合 RL**:将环境反馈转化为过程/结果奖励,与强化学习结合; - **Harness 动态演化**:在 RSI 循环中同时优化模型权重与 harness 配置。 综上,该论文通过数据工程、课程学习、策略内蒸馏与能力引导分配的系统集成,首次将路由 harness 的运行时信号转化为可操作的模型自我改进闭环,为 RSI 从概念设计走向工程实践提供了经验基础与可行路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: NeoHorse Team,Guoliang Cao,Guohao Dai,Tianyu Guo,Kai Han,Hailin Hu,Zihan Jiang,Xiang Kuang,Boxun Li,Yulong Li,Zehua Pei,Yuchuan Tian,Jiamin Wang,Yu Wang,Yunhe Wang,Yihong Wu,Haiyang Xu,Shuo Zhang,Hang Zhou,Siyang Cheng,Jiayu Fan,Wei He,Qingrui Jiao,Hongguang Li,Zhiyuan Li,Runke Liu,Xi Liu,Xinchen Liu,Sinno Jialin Pan,Yi Ren,Liuyang Song,Chenyu Wang,Bei Yu,Quanlu Zhang,Xiangyu Zhang,Mengyu Zheng,Yingjie Zong

Categories:

PDF URL: https://arxiv.org/pdf/2609.08183.pdf

Arxiv URL: https://arxiv.org/abs/2609.08183

Arxiv ID: 2609.08183

CoolPaper URL: https://papers.cool/arxiv/2609.08183

Published: 2026-09-10T01:26:52.087Z

Updated: 2026-09-10T01:26:52.087Z


2. AuK Technical Report: An Open-Source Foundational Model for Speech Generation and Editing

Abstract:We introduce AuK, an open-source foundational model that unifies speech generation and editing through a common interface of natural-language instructions and audio context. To support this broad capability set, we construct approximately 3.03 billion instruction—audio instances and 1.95 million hours of effective supervision across five task families: speech generation, content editing, enhancement and separation, paralinguistic editing, and acoustic editing. AuK combines a multimodal large language model for semantic conditioning, an VAE jointly trained on speech, general audio, and music for acoustic conditioning, and a hybrid rectified-flow Transformer that performs dual-stream MMDiT blocks followed by unified single-stream DiT blocks for generation. Training begins with generation-only warm-up and proceeds to joint generation—editing pre-training. We then apply complementary post-training strategies: human-feedback preference optimization for open-ended editing and reward-based reinforcement learning for speech generation. To reduce inference cost, we further distill the model with consistency initialization and task-routed Decoupled DMD. The resulting AuK-Flash performs 4-step inference without classifier-free guidance and achieves a 4.5 wall-clock speedup over the full model under matched conditions. Experiments demonstrate leading performance on zero-shot and instruction-controlled speech generation and general instruction-guided editing, while remaining competitive on signal-level restoration tasks. We release both the source code and model weights to support reproducibility and further research.

中文摘要

摘要:我们介绍了 AuK,一种开源的基础模型,通过自然语言指令和音频上下文的通用接口统一了语音生成和编辑。为了支持这一广泛的能力集,我们构建了约 30.3 亿条指令-音频实例,以及涵盖五类任务(语音生成、内容编辑、增强与分离、副语言编辑和声学编辑)的 195 万小时有效监督。AuK 结合了用于语义条件的多模态大语言模型,用于声学条件的在语音、通用音频和音乐上联合训练的 VAE,以及执行双流 MMDiT 模块并随后进行统一单流 DiT 模块生成的混合整流流 Transformer。训练从仅生成的预热开始,然后进行生成-编辑联合预训练。随后,我们采用互补的后训练策略:用于开放式编辑的人类反馈偏好优化,以及用于语音生成的基于奖励的强化学习。为了降低推理成本,我们进一步通过一致性初始化和任务路径分离 DMD 对模型进行蒸馏。最终得到的 AuK-Flash 可在无分类器引导的情况下进行 4 步推理,在相同条件下相比完整模型实现 4.5 倍的实时时钟加速。实验表明,该模型在零样本和指令控制的语音生成以及通用指令引导的编辑上表现领先,同时在信号级恢复任务上仍保持竞争力。我们发布了源代码和模型权重,以支持可重复性研究和进一步探索。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*语音生成与编辑能力碎片化\*\*的问题,即现有系统通常针对特定任务(如零样本语音克隆、指令控制合成或语音编辑)单独建模,导致用户体验割裂、建模资源重复,且难以应对真实场景中多样化、复合式的语音处理需求。 具体而言,论文识别并试图克服以下核心挑战: - \*\*输出约束的异质性\*\*:不同任务的输出要求截然不同。语音生成需要创造全新的音频;内容编辑仅修改指定片段;副语言与声学编辑必须保留原始语言内容;而增强与分离任务则需根据指令保留或移除特定场景成分。 - \*\*条件接口的不一致性\*\*:部分任务仅需文本输入,而另一些任务要求模型对自然语言指令与参考音频进行联合推理,传统单一接口难以统一支持。 - \*\*监督与评估标准的差异\*\*:生成任务可通过语音识别准确率、说话人相似度等自动指标评估,但开放式编辑任务高度依赖主观判断(如自然度、编辑强度、上下文适当性及未指定属性的保持),缺乏可扩展的统一优化信号。 为此,论文提出了 \*\*AuK\*\*,一个开源的基础模型,试图通过\*\*自然语言指令与可选音频上下文\*\*的统一接口,将语音生成、声学编辑、副语言编辑、内容编辑以及增强与分离五大任务家族整合到单一框架中,并兼顾可扩展的训练与高效的推理。 Q2: 有哪些相关研究? 与 AuK 相关的研究工作可按照任务领域与技术路线梳理如下。 ### 1. 语音生成(Speech Generation) - \*\*零样本语音克隆(Zero-Shot TTS)\*\*:Seed-TTS

1
、CosyVoice / CosyVoice 2 / CosyVoice 3
10, 12, 11
、F5-TTS
6
、MegaTTS 3
29
、VoxCPM2
88
、IndexTTS2
86
、FireRedTTS-2
68
、DiTAR
28
、VibeVoice
51
、OmniVoice
89
、Qwen3-TTS
22
。 - **指令控制合成(Instruct TTS)**:PromptTTS
19
、PromptStyle
38
、VoxInstruct
87
、Mimo-Audio
78
、VoiceSculptor
23
、MOSS-VoiceGenerator
24
、Parler-TTS
43
、Hume AI
26
。 ### 2. 语音编辑(Speech Editing) - **端到端语音编辑模型**:CosyEdit / CosyEdit2

4, 3
、Step-Audio-EditX
73
、Ming-UniAudio
72
、MMEdit
63
、Audio-Omni
65
、SmartDJ
33
。 - **编辑任务基准**:MMAE
44
、SpeechEditBench
79
、Ming-Freeform-Audio-Edit
72
。 - **专用编辑技术**:X-VC
85
(用于音色编辑)、Audio-Oscar
13
(多智能体音频编辑管线)。 ### 3. 语音增强与分离(Enhancement and Separation) - **语音增强**:Resemble-Enhance

54
、DaSheng
62
、AudioSR
39
、SAM-Audio-Large
58
、AnyEnhance
80
、RE-USE
15
。 - **说话人分离**:MossFormer2-SS
83
、Sidon
47
。 ### 4. 统一/通用音频模型(Unified Audio Models) - 试图在单一框架内覆盖理解、生成与编辑的工作包括:Ming-UniAudio

72
、Audio-Omni
65
、SAM-Audio-Large
58
。 ### 5. 模型架构与基础技术(Architectural Components) - **Transformer 与扩散骨干**:FLUX / MMDiT

14, 32
、DiT
50
、RoPE
61
、SwiGLU
57
、RMSNorm / LayerNorm
2, 76
。 - **音频编解码与重建**:BigVGAN
34
、DAC
31
、HiFi-GAN
30
、多尺度 CQT 判别器
18
、MiniMax-H3-AudioVAE
46
、MMAudio-VAE
7
、Stable-Audio-3-SAME-L
49
。 - **流匹配与生成**:Rectified flow、Flow-GRPO
40
、MixGRPO
36
。 - **偏好优化与对齐**:Diffusion-DPO
66
、LiPO
42
。 - **模型蒸馏与加速**:一致性模型
60
、Decoupled DMD
37
、APG
55
、CausVid
74
、MeanFlow
17
。 ### 6. 多模态语义编码与数据工具(Multimodal Conditioning & Data) - **多模态大语言模型**:Qwen2.5-Omni

69
、Qwen3-Omni
70
(作为语义编码器与标注器)。 - **对齐与合成工具**:Qwen3-ForcedAligner
59
、Qwen3-TTS-CustomVoice
22
、SeedVCSmall
41
、YingMusic-Singer-Plus
20
。 Q3: 论文如何解决这个问题? 论文通过统一接口设计、大规模多任务数据、多模态混合架构、分阶段训练策略与推理加速五个层面系统性地解决了语音生成与编辑的碎片化问题。 —- ### 1. 统一任务接口 将所有任务形式化为统一的输入–输出映射: - 输入:一条自然语言指令 + 可选的输入音频(参考音频或待编辑音频)。 - 输出:目标波形。 这一接口覆盖了五大任务家族: 1. 语音生成(零样本TTS、指令TTS) 2. 声学编辑(语速、音高、响度) 3. 副语言编辑(情感、音色、口音、非语言发声、耳语风格) 4. 内容编辑(语音替换/插入/删除、歌词编辑) 5. 增强与分离(降噪、去混响、分离、超分辨率) —- ### 2. 大规模异构数据构建 为支撑上述能力,论文构建了约 3.03 billion 的指令–音频实例,总计 195 万小时 有效监督,并针对不同任务采用特定的数据合成策略: - 生成任务:通过多阶段筛选构建高质量双语零样本TTS数据,并采用跨 utterance 上下文学习(同一说话人不同语句互为 prompt 与目标),使推理时无需参考音频的转录文本;指令TTS数据通过 Qwen3-Omni 标注自由形式的自然语言描述。 - 编辑任务: - 声学编辑:使用确定性信号处理(时域拉伸、音高移位、增益)生成成对数据。 - 副语言编辑:利用合成管线(如 IndexTTS2、OmniVoice、F5-TTS)生成情感、音色、去口音、非语言事件插入/删除、耳语转换等成对样本。 - 内容编辑:基于强制对齐(Forced Aligner)定位编辑区间,通过掩码填充(masked infilling)仅修改指定区域,保留说话人身份与上下文。 - 增强与分离:通过对干净语音叠加多种退化(噪声、混响、信道失真)构建混合场景;指令不仅要求完全恢复,也要求选择性恢复(如仅去噪而保留混响),从而避免模型将指令与单一声学签名绑定。 —- ### 3. 多模态混合生成架构 论文提出 AuK,其核心由三个互补模块组成: #### (1) MLLM 语义条件 采用 Qwen2.5-Omni 作为语义编码器,对文本指令与参考音频进行联合编码。通过可学习的逐层加权求和聚合 MLLM 各层隐藏状态,平衡不同抽象层次的语言学、声学及跨模态信息。 #### (2) AuK-VAE 声学条件 训练一个联合覆盖语音、通用音频与音乐的流增强 VAE。编码器将 24 kHz 波形压缩为 50 Hz、64 维的潜空间;解码器采用 BigVGAN 结构保证高保真重建。该 VAE 同时为参考音频条件与波形重建提供共享的声学潜空间。 #### (3) 混合 Rectified-Flow Transformer 骨干 采用 FLUX 风格的双流–单流混合设计: - 前 M 层(MMDiT):语义流与声学流各自保留残差路径,但通过联合注意力(Joint Attention)实现双向交互。 - 后 N 层(DiT):将两流拼接为单一流,通过自注意力统一精修,并预测 rectified flow 的速度场。 - 该设计天然兼容两种模式:无参考音频时(如指令TTS)仅输入噪声潜变量与语义条件;有参考音频时则额外注入 VAE 参考潜变量。 —- ### 4. 分阶段对齐训练 训练流程分为三个阶段,以应对生成与编辑任务的不同优化需求: #### 阶段一:统一预训练(两阶段课程) 1. 生成预热:仅用生成任务训练 50k 步,建立稳定的文本–语音对齐。 2. 联合训练:再训练 600k 步,混合五大任务家族,采用共享的 flow-matching 目标与分层条件丢弃(condition dropout),以支持推理时的 Classifier-Free Guidance (CFG)。 #### 阶段二:后训练(Post-Training) - 编辑偏好优化:针对开放式编辑缺乏自动指标的问题,收集人类对自由形式编辑结果的序数偏好(失败/部分成功/成功)。基于 Diffusion-DPO 的隐式偏好分数,结合 LiPO 的列表级序数目标进行优化。 - 生成强化学习:针对零样本TTS与指令TTS,采用 Flow-GRPO 进行在线强化学习。奖励由自动 ASR(内容正确率)、说话人验证模型(说话人相似度)及专门训练的副风格一致性模型构成,并通过约束标准化防止奖励作弊。 —- ### 5. 推理加速:AuK-Flash 为解决完整模型迭代采样与 CFG 带来的高推理成本,论文通过两阶段蒸馏得到 AuK-Flash: 1. 一致性初始化:在教师模型指导下进行轨迹级一致性蒸馏,使学生模型学会从任意噪声状态直接预测干净端点,获得稳定的 4 步生成能力。 2. 任务路由解耦 DMD:采用 Decoupled DMD 分离 CFG 增强(CA)与分布匹配(DM);为避免过饱和,CA 分支使用自适应投影引导(APG)替代 CFG。此外,观察到统一 DMD 会损害分离任务,因此将分离样本路由到监督 clean-prediction 目标,排除在 DMD 更新之外。 最终 AuK-Flash 以 4 步、无 CFG 的设定实现推理,在相同硬件下相对 32 步教师模型获得 4.5× 的 wall-clock 加速,同时保留广泛的生成与编辑能力。 —- ### 6. 推理流程:Prompt Enhancer 为弥合训练分布与自由形式用户请求之间的差异,推理时先经过 Prompt Enhancer (PE): - 通过语言模型识别用户意图、提取任务参数、将口语化描述映射到训练时的离散/标准化值域; - 对输入音频进行轻量级预处理; - 根据任务类型估计输出时长(如基于文本字节长度、语速系数、情感因子等),从而确定目标潜序列长度。 通过上述设计,AuK 在单一模型内实现了从文本/音频条件到波形输出的统一映射,并通过分阶段训练与蒸馏在能力广度、对齐精度与推理效率之间取得平衡。 Q4: 论文做了哪些实验? 论文围绕 AuKAuK-Flash 两个模型变体,从重建保真度、生成能力、编辑能力、信号级处理及定性发现五个维度开展了系统实验。所有实验均在 24 kHz 单声道条件下进行,主要结果汇总于正文表 3,详细指标见附录表 5–14。 —- ### 1. VAE 重建实验(§7.1,表 4) 验证 AuK-VAE 在语音、通用音频与音乐三类数据上的重建保真度。 - 测试集:Seed-TTS-Eval(语音)、AudioSet 随机采样(通用音频)、MUSDB18-HQ(音乐)。 - 对比基线:MiniMax-H3-AudioVAE、Ming-Omni-TTS、Stable-Audio-3-SAME-L、MMAudio-VAE。 - 评价指标:PESQ、STOI、Mel-spectrogram Distance、Multi-resolution STFT Distance。 - 结论:AuK-VAE 在三个域的全部四项指标上均取得最佳,证明其共享潜空间对语音、一般音频和音乐均具有高保真重建能力。 —- ### 2. 语音生成实验(§7.2,表 3/5/6) #### (a) 零样本语音克隆(Zero-Shot TTS) - 基准:Seed-TTS-Eval,覆盖英文(test-en)、中文(test-zh)及中文困难文本(test-zh-hard)。 - 指标:WER/CER(↓,衡量可懂度)、SIM(↑,衡量说话人相似度)。 - 对比系统:Seed-TTS、Qwen3-TTS、VoxCPM2、F5-TTS、IndexTTS2、MegaTTS 3 等。 - 结果: - AuK 平均 WER 为 2.65% ,平均 SIM 为 0.795 ,均优于对比系统; - AuK-Flash 平均 WER 2.85% 、SIM 0.790 ,在加速设定下仍保持强竞争力。 #### (b) 指令控制合成(Instruct TTS) - 基准:InstructTTSEval,覆盖中文与英文,测评声学参数、描述风格与角色扮演三类指令遵循能力。 - 指标:APS、DSD、RP(↑)。 - 对比系统:Qwen3-TTS-VD、Mimo-Audio、MOSS-VoiceGenerator 等。 - 结果: - AuK 中文 DSD 达到 83.37% ,优于最强基线 Qwen3-TTS-VD; - AuK-Flash 英文 DSD 达 82.40% ,与 Qwen3-TTS-VD 持平。 —- ### 3. 一般语音编辑实验(§7.3.1,表 3/7/8/9/10) #### (a) MMAE-Speech(表 7) 评估基于规则指令的遵循率与属性保持率。 - 指标:IFR(指令遵循率)、CR(一致性/保留率)、EMR(精确匹配率,即同时满足所有规则的样本比例)。 - 结果:AuK 在 IFR( 48.23% )和 CR( 88.11% )上最优;AuK-Flash 的 EMR( 13.85% )最高。 #### (b) SpeechEditBench(表 3) 评估五类编辑(内容、情感、韵律、副语言、声学)的联合成功率。 - 结果:AuK 在内容( 91.83% )、情感( 9.94% )、韵律( 71.33% )和声学( 37.07% )上领先;AuK-Flash 在副语言编辑( 39.25% )上表现最佳。 #### (c) Ming-Freeform-Audio-Edit(表 8–10) 细分为语义编辑与声学编辑,覆盖中英双语及 Basic/Full 两种难度。 - 语义编辑(删除、插入、替换): - 指标:WER↓、ACC↑、SIM↑、no-edit WER↓。 - 结果:在更具挑战性的 Full 设置下,AuK 中文平均 WER 降至 3.09% (vs. Ming-UniAudio 10.46% ),英文降至 3.96% (vs. 14.28% );准确率分别提升至 91.47% 与 85.25% 。 - 声学编辑(语速、音高、音量): - 指标:WER↓、SIM↑、RDE(相对时长误差)↓、RAE(相对振幅误差)↓。 - 结果:AuK 在多数设置下 WER 最低;AuK-Flash 在说话人相似度(SIM)上更优。 —- ### 4. 语音增强与分离实验(§7.3.2,表 3/11–14) #### (a) 语音增强 - DNS Challenge 2020(表 11):AuK 取得最低 dWER( 2.66% ),AuK-Flash 取得最高 UTMOS( 4.05 ),两者 SIM 均达 0.99 。 - CHiME-4(表 12):AuK-Flash 取得最低 WER( 7.84% )与最高 UTMOS( 3.91 )。 #### (b) 说话人分离 - Libri2Mix(表 13):AuK 取得最低 WER( 9.12% )与 PER( 6.63% );AuK-Flash 取得最高 OVRL( 3.32 )与 UTMOS( 4.03 )。两者 SIM 均为 0.96 ,与 MossFormer2-SS 持平。 #### (c) 语音超分辨率 - VCTK-SR(表 14):对 500 句语音施加 8 种退化(带限 2–11 kHz、电话、扩音器、水下等)。 - AuK-Flash 在 OVRL、UTMOS、WER、PER 六项指标中的四项最优; - AuK 取得最高 SIM( 0.97 )。 —- ### 5. 发现与定性分析(§7.4) 除基准测试外,论文还报告了以下观察性实验与消融洞察: - 跨 utterance 上下文学习:通过使用同一说话人不同语句互为 prompt 与目标进行训练,相较于传统的单句切分方式,提升了表现力与说话人相似度,并实现了无需参考音频转录文本的零样本克隆接口。 - 跨任务/跨语言迁移:模型仅通过编辑任务(如中文去口音、正常↔耳语转换)进行监督,却涌现出直接生成能力(如从文本直接合成耳语音)与跨语言泛化(如降低英语中的印度/日本口音)。 - 自由形式指令理解的局限:尽管通过 Audio-Oscar 式 agent 管线增加了指令多样性,模型对任意自然语言请求的鲁棒调用仍依赖 Prompt Enhancer 的任务路由与改写,提示原生指令 grounding 仍是未充分解决的问题。 —- ### 6. 效率对比实验(§5/6,表 2) 论文在统一硬件与输出长度下对比了 AuK 与 AuK-Flash 的推理开销: - AuK:32 步 Euler ODE 求解器,CFG scale 2.0 。 - AuK-Flash:4 步,无 CFG。 - 结论:AuK-Flash 实现 4 Q5: 有什么可以进一步探索的点? 基于论文的局限性分析与实验观察,以下方向值得进一步探索: —- ### 1. 原生自由形式指令理解与组合泛化 论文发现,尽管模型具备广泛的编辑与生成能力,但对任意措辞的用户请求仍依赖 Prompt Enhancer 进行任务识别、参数归一化与指令改写(§7.4)。如何提升模型对非结构化自然语言指令的原生理解能力(native instruction grounding),并支持跨属性的组合式请求(如同时改变情感、语速与音色而不依赖显式模板),是缩小”具备能力”与”可靠调用能力”之间差距的关键。 —- ### 2. 开放式音频变换的可扩展对齐 当前编辑任务的偏好优化依赖人类序数标注(§4.3.1),共收集 818 个有效偏好组。这一规模对于覆盖所有编辑类型、强度与语言组合仍显不足。未来需要探索: - 可自动扩展的编辑专用奖励模型; - 无需成对标注的离线偏好学习合成偏好方法; - 能够同时衡量编辑忠实度自然度未指定属性保持的多维奖励构造。 —- ### 3. 分离任务的高效蒸馏与无损加速 在模型加速阶段(§5),Decoupled DMD 蒸馏会导致多说话人分离与歌声分离能力退化,因此论文被迫采用任务路由(task-routed)机制将分离样本排除在 DMD 更新之外。如何设计对混合-分离任务更友好的蒸馏目标,避免分布失配导致的源泄漏(source leakage),是实现真正统一且高效的小步数推理的开放问题。 —- ### 4. 跨任务与跨语言迁移的机制化 论文定性观察到意外的涌现迁移:仅通过中文去口音与正常↔耳语编辑训练,模型即可对英文口音或从文本直接合成耳语音(§7.4)。这些现象尚未经过系统量化,其背后的表示解耦机制(如说话人、语言、副语言属性在潜空间中的因子化方式)有待深入分析,以指导更高效的数据策略与模型设计。 —- ### 5. 长上下文与流式处理 当前训练序列长度对应最长 35 秒的音频片段(§4.2)。对于长音频(如播客、会议记录、音乐作品)的生成与编辑,需要解决: - 长程一致性(如跨段落的说话人一致性、旋律连贯性); - 流式或块级推理架构,避免整段音频的端到端 latent 展开; - 长音频下的时间精确定位与局部编辑。 —- ### 6. 进一步降低推理成本 AuK-Flash 虽已实现 4 步推理与 4.5×$ 加速(§5/§6),但相对于自回归或单步生成模型仍有压缩空间。未来可探索: - 单步生成(如通过改进的 consistency model 或 GAN-based 蒸馏); - 动态步数分配:根据任务复杂度与输入信噪比自适应选择 NFE,而非固定 4 步; - 更轻量级的骨干网络或 VAE 压缩,以降低显存与计算开销。 —- ### 7. 更细粒度的时频控制与多模态扩展 当前的内容编辑与声学编辑主要基于词级或整句级操作。更细粒度的控制(如音素级时长微调局部颤音插入共振峰实时修正)尚未充分探索。此外,AuK 的 MLLM 语义条件架构天然支持多模态输入,未来可向音视频联合编辑(如根据视觉口型同步调整语音内容)或音乐–语音混合场景的更复杂交互延伸。 Q6: 总结一下论文的主要内容 ## 论文主要内容总结 ### 1. 研究背景与核心问题 语音合成与编辑领域长期面临能力碎片化的困境:零样本语音克隆、指令控制合成、声学编辑、内容编辑、语音增强与分离等任务通常由独立模型或管线实现,导致用户体验割裂、建模资源重复。论文指出,统一这些能力存在三重挑战: - 输出约束异质性:生成任务要求创造新音频,编辑任务要求局部修改并保留未指定属性,增强/分离任务要求按指令选择性地保留或移除场景成分; - 条件接口不一致:部分任务仅需文本,另一些需对文本指令与参考音频进行联合推理; - 监督与评估标准差异:生成任务可通过自动指标(如 WER、SIM)评估,而开放式编辑高度依赖主观偏好,缺乏现成的奖励模型。 ### 2. AuK:统一的语音生成与编辑基础模型 论文提出 AuK**,一个开源的基础模型,其核心设计是将所有任务映射到统一接口:

(自然语言指令, 可选输入音频) arrow 目标波形
该接口覆盖五大任务家族: 1. **语音生成**:零样本 TTS(无需参考转录)、指令 TTS; 2. **声学编辑**:语速、音高、响度控制; 3. **副语言编辑**:情感、音色、口音、非语言发声、耳语风格; 4. **内容编辑**:语音替换/插入/删除、歌词编辑; 5. **增强与分离**:降噪、去混响、说话人分离、歌声分离、超分辨率。 ### 3. 大规模多任务数据构建 为支撑上述能力,论文构建了包含约 **30.3 亿** 指令–音频实例、总计 **195 万小时** 有效监督的语料库。针对不同任务采用特定合成策略: - **生成**:通过跨 utterance 配对实现无需转录文本的零样本克隆;利用多模态模型生成自由形式风格描述用于指令 TTS; - **编辑**:基于信号处理(声学)、合成管线级联(副语言)及强制对齐下的掩码填充(内容编辑)构建成对监督; - **增强与分离**:对干净信号叠加随机组合的退化(噪声、混响、信道失真等),并构造**选择性恢复目标**(如仅去噪而保留混响),使模型理解指令决定输出内容。 ### 4. 模型架构 AuK 由三个互补模块组成: - **MLLM 语义条件**:基于 Qwen2.5-Omni,通过**可学习的逐层加权求和**聚合各层隐藏状态,同时编码文本指令与可选参考音频; - **AuK-VAE 声学条件**:在语音、通用音频与音乐上联合训练的流增强 VAE,将 24 kHz 波形压缩为 50 Hz、64 维的共享潜空间,用于参考条件与波形重建; - **混合 Rectified-Flow Transformer**:前 M 层为双流 MMDiT 块(语义流与声学流通过联合注意力交互但保留独立残差),后 N 层为单流 DiT 块(拼接后统一精修),预测流速度场。 ### 5. 分阶段训练与对齐 - **VAE 预训练**:采用多尺度梅尔重建、对抗训练与流正则化; - **统一预训练**:先进行 **50k 步生成预热**,再进行 **600k 步五大任务联合训练**,使用共享 Flow-Matching 目标与分层条件丢弃(支持 CFG); - **后训练**: - **编辑偏好优化**:收集人类对自由形式编辑结果的序数反馈(失败/部分成功/成功),基于 Diffusion-DPO 与 LiPO 列表级目标优化; - **生成强化学习**:采用 Flow-GRPO,以 ASR、说话人验证及副风格一致性模型构建自动奖励,提升零样本与指令跟随生成质量。 ### 6. 推理加速:AuK-Flash 为解决迭代采样与 CFG 的高推理成本,论文通过两阶段蒸馏得到 **AuK-Flash**: 1. **一致性初始化**:轨迹级一致性蒸馏使模型适应少步积分; 2. **Task-routed Decoupled DMD**:解耦 CFG 增强与分布匹配,以 APG 替代 CFG 防止过饱和;并观察到统一蒸馏会损害分离任务,故将分离样本**路由到监督 clean-prediction 目标**,排除在 DMD 更新外。 最终 AuK-Flash 实现 **4 步无 CFG 推理**,在匹配条件下相对 32 步教师模型获得 ** 4.5× 墙钟加速**。 ### 7. 实验结果 论文在重建、生成、编辑及信号级处理任务上进行了系统评估: - **VAE 重建**:在语音、通用音频、音乐三个域的 PESQ、STOI、Mel Dist、STFT 指标上均优于对比基线; - **语音生成**:在 Seed-TTS-Eval 上取得最低平均 WER( 2.65% )与最高 SIM( 0.795 );在 InstructTTSEval 中文 DSD 达到 83.37% ,优于现有系统; - **一般语音编辑**:在 MMAE-Speech、SpeechEditBench、Ming-Freeform-Audio-Edit 上领先,尤其在 Full 设置下的语义编辑 WER 大幅降低(如中文从 10.46% 降至 3.09% ); - **增强与分离**:在 DNS Challenge、CHiME-4、Libri2Mix、VCTK-SR 上保持竞争力,AuK-Flash 在感知质量(UTMOS)上常优于教师模型,AuK 在内容保持(WER/SIM)上更优; - **定性发现**:跨 utterance 训练提升说话人相似度并解除对参考转录的依赖;模型涌现出跨任务(编辑能力迁移至生成)与跨语言(中文去口音能力迁移至英文)的泛化。 ### 8. 结论与开源贡献 论文证明了通过统一接口、大规模异构数据、混合流 Transformer 与分阶段对齐训练,单一模型可同时实现领先的语音生成、一般指令编辑与有竞争力的信号级处理能力。AuK-Flash 进一步表明,通过任务感知蒸馏,可在大幅加速下保留上述能力。论文已**开源源代码与模型权重**,以支持可复现性与后续研究。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Ziyang Ma,Zhikang Niu,Wenming Tu,Tianrui Wang,Ruiqi Yan,Junxi Liu,Yanru Huo,Nickk Huang,Yang Liu,Qicong Xie,Zeyu Xie,Hui Wang,Haitao Li,Zixuan Jiang,Yalin Li,Jie Fang,Yifan Duan,Zeyue Tian,Guangzheng Li,Haina Zhu,Shuyi Wang,Jinwen Wang,Mingyu Cui,Tian Tan,Auden,Sen Liang,Steve Yves,Shan Yang,Liefeng Bo,Zilong Zheng,Kai Yu,Eng-Siong Chng,Xie Chen

Categories:

PDF URL: https://arxiv.org/pdf/2609.08936.pdf

Arxiv URL: https://arxiv.org/abs/2609.08936

Arxiv ID: 2609.08936

CoolPaper URL: https://papers.cool/arxiv/2609.08936

Published: 2026-09-10T01:26:52.098Z

Updated: 2026-09-10T01:26:52.098Z


3. Omni Interaction Agent Technical Report

Abstract:In this work, we present Gander, an end-to-end model that unifies omni perception, realtime interaction, and agentic capabilities within a single framework. In contrast to turn-based conventional paradigms, Gander continuously receives streaming inputs across multiple modalities, including video, speech, and text, enabling natural full-duplex interaction in both everyday conversations and complex workflow-oriented agent scenarios. Users can interrupt the model at any time, while the model can also proactively provide intermediate feedback or ask follow up questions. To natively support these capabilities, Gander adopts two key architectural designs: 1) It employs a Cerebellum-Brain collaborative framework, in which the Cerebellum is responsible for realtime interaction and omni conversational capabilities, while the Brain handles complex reasoning and higher-level agentic tasks. The two components interact continuously through tool calling and the agent orchestration runtime. 2) The Cerebellum is built upon a streaming Thinker-Talker architecture, user inputs and model outputs are further flattened into an ordered token stream at the chunk level, providing a unified representation for low latency, continuous interaction. We conduct comprehensive evaluations of Gander across four dimensions: conversational ability, omni understanding, interactive capability, and agentic intelligence. Internal human evaluations demonstrate that Gander maintains the natural and expressive spoken dialogue capabilities of SOTA open source models while achieving competitive performance in omni interaction. Gander also demonstrates robustness in challenging real-world scenarios, including background noise interference, multi-party interactions, and backchannel communication. We release Gander together with its models, code, and data to facilitate further research and development in the community.

中文摘要

摘要:在本研究中,我们提出了 Gander,一种端到端模型,将全方位感知、实时交互和自主代理能力统一在单一框架内。与基于回合的传统范式不同,Gander 持续接收跨多种模态的流输入,包括视频、语音和文本,从而在日常对话和复杂面向工作流的代理场景中实现自然的全双工交互。用户可以随时中断模型,而模型也可以主动提供中间反馈或提出后续问题。为了原生支持这些能力,Gander 采用了两个关键的架构设计:1)采用小脑-大脑协作框架,其中小脑负责实时交互和全方位对话能力,而大脑负责复杂推理和高阶自主代理任务。两个组件通过工具调用和代理编排运行时持续互动。2)小脑基于流式“思考者-对话者”架构构建,用户输入和模型输出在块级层次进一步被展平成有序的标记流,为低延迟、连续交互提供统一表示。我们从四个维度对 Gander 进行了全面评估:对话能力、全方位理解、交互能力和自主智能。内部人工评估表明,Gander 在保持最先进开源模型的自然且富有表现力的口语对话能力的同时,在全方位交互方面也取得了有竞争力的性能。Gander 还在挑战性的真实场景中表现出稳健性,包括背景噪声干扰、多方互动和回传通道通信。我们发布了 Gander 及其模型、代码和数据,以促进社区的进一步研究和开发。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*传统人机交互范式与自然人类协作模式之间的根本性差距\*\*,具体可归纳为以下核心问题: --- ### 1. 超越回合制(Turn-Based)的交互限制 现有的大语言模型(LLM)交互主要局限于文本驱动的回合制通信:用户发出完整指令,模型等待接收后生成离散响应。这种模式与人类交流中\*\*连续、并发、多模态\*\*的本质截然不同——人类在对话中会同时听和说、观察环境、灵活地打断或转换话题。论文指出,真正有效的人机协作需要AI系统从被动的"请求-响应"模式,转变为\*\*持续参与、主动协作\*\*的交互伙伴。 --- ### 2. 全双工实时交互的原生支持 论文质疑了传统方案(如将VAD、ASR、TTS等模块拼接为外部编排层)的可行性,并提出一个根本问题:\*\*交互性是否必须内嵌于模型本身,而非依赖独立设计的外部模块?\*\* 现实场景中涉及动态打断、重叠语音、背景噪声、多方对话、简短反馈(backchannel)等复杂行为,这些难以通过传统的语音活动检测(VAD)等硬编码规则可靠捕获。因此,需要一种\*\*端到端的统一架构\*\*,使模型能够基于语义内容自主决定何时倾听、何时发言、何时中断。 --- ### 3. 实时响应与长期推理的统一 论文提出了第二个关键问题:\*\*单一模型能否同时满足实时交互的低延迟需求与复杂Agent任务所需的长期推理能力?\*\* 这两类任务在计算和推理特性上存在本质冲突: - \*\*实时对话\*\*要求毫秒级响应和持续的上下文适应; - \*\*复杂工作流\*\*(如编码、文件操作、多步规划)需要长程推理、工具调用和持续执行。 论文指出,试图用单一单体模型同时满足两者,会在"响应速度"与"智能水平"之间产生固有的权衡。 --- ### 4. 感知-交互-执行的统一整合 现有系统通常将多模态感知(视觉、听觉)、对话交互和任务执行作为独立组件处理。论文致力于探索是否可以将这三者整合为\*\*单一的连续过程\*\*:模型在持续接收流式音视频输入的同时,既能进行自然对话,又能调用工具、协调后台Agent完成长期任务,并在执行过程中随时响应用户的新约束、澄清或打断。 --- ### 总结 综上所述,该论文试图解决的核心问题是:\*\*如何构建一个统一的端到端Omni交互Agent,使其具备内生的全双工实时交互能力、全模态感知能力以及长期Agent推理与执行能力,从而摆脱传统回合制和模块化拼接的局限,实现真正自然、流畅、可扩展的人机协作。\*\* 为此,论文提出了Gander架构,通过"大脑-小脑"(Brain-Cerebellum)协作框架与基于流式块(chunk-based)的统一序列建模,将上述能力整合于单一系统之中。 Q2: 有哪些相关研究? 该论文在第2节系统梳理了相关研究,将其归纳为三个紧密关联的发展方向:语音语言模型与全双工交互、全模态连续交互,以及从全模态对话到语音智能体的演进。 --- ### 1. 语音语言模型与全双工交互(Speech Language Models and Full-Duplex Interaction) 该方向致力于突破传统回合制对话的局限,使模型能够持续感知声学环境并自主调控交互时机。 - \*\*早期语音语言模型\*\*(如 An et al., 2024; Ding et al., 2025; Huang et al., 2025; Ji et al., 2024a):在语音理解(Chu et al., 2023, 2024)与语音生成(Du et al., 2025; Ji et al., 2024b, 2025a,b,c)方面取得显著进展,但其交互仍依赖外部模块(如 VAD (Silero, 2024))显式控制轮次,模型本身对交互决策的掌控有限。 - \*\*BayLing-Duplex\*\* (Fang et al., 2026):将"何时倾听、何时发言、何时终止"的决策直接纳入单一自回归模型,通过引入少量专用状态token,使模型在流式语音生成过程中自主完成交互决策,无需额外的轮次控制器。 - \*\*Qwen-Audio-3.0-Realtime\*\* (QwenAudio Team, 2026b):从流式视角处理实时语音交互,将连续音频流以增量式分块处理,使模型能够持续获取上下文信息并降低交互延迟。 - \*\*Audio Interaction Model\*\* (Xie et al., 2026b):将实时交互范围从对话语音扩展至一般在线音频交互,强调模型的主动交互能力——即模型可根据持续音频流的语义主动判断是否需要介入响应。 - \*\*Seeduplex\*\* (ByteDance Seed Team, 2026b):聚焦真实声学环境下的连续倾听,要求模型在同时听和说的基础上,区分相关用户语音与背景声或其他说话人的语音,并在用户打断时作出恰当响应。 - \*\*GPT-Live\*\* (OpenAI, 2026):采用类似 Moshi (Défossez et al., 2024) 的全双工架构,支持持续处理输入音频与并行生成语音输出,能够在对话过程中动态决定继续倾听、响应、暂停或中断。 \*\*局限性\*\*:上述工作主要围绕音频交互展开,对周围环境的理解主要源于声学信息,交互能力的评估仍局限于相对受限的对话场景。 --- ### 2. 全模态与连续多模态交互(Omni Modalities and Continuous Multimodal Interaction) 该方向将视觉、音频与视频信息整合进统一的基础模型,使交互不再局限于语音,而是能够结合视觉上下文进行推理。 - \*\*Qwen Omni\*\* (Team, 2026; Xu et al., 2025b) 系列:在统一基础模型内整合多种输入模态,支持流式语音生成,为实时多模态交互提供了通用基础。 - \*\*MiniCPM-o 4.5\*\* (Cui et al., 2026):提出 Omni Flow,将多模态感知与响应生成置于统一的时间轴上,使模型在生成响应的同时持续感知视觉与音频信号,展示了基于连续环境观察的主动行为。 - \*\*JoyAIVL-Interaction\*\* (Yao et al., 2026):聚焦连续视觉流上的交互,将连续视觉感知本身视为交互过程的一部分,模型根据环境随时间的变化决定是否需要响应。 - \*\*SeedRealtime\*\* (ByteDance Seed Team, 2026a):引入原生音视频全双工交互,将音频、视频与文本联合整合于统一架构中。该工作表明,视觉上下文可直接改善交互质量,例如帮助解决语音歧义、解释时间指代,并在无需显式用户请求的情况下对环境变化作出主动响应。 \*\*局限性\*\*:上述方法显著提升了对话交互的自然度,但尚未充分解决模型在复杂工作流中执行实际任务的需求。 --- ### 3. 从全模态对话到语音智能体(From Omni Conversation to Voice Agents) 该方向进一步将自然语音交互与任务执行能力相结合,使AI系统不仅能对话,还能完成编码、文件操作、工具调用等实际任务。 - \*\*Qwen Audio Agent\*\* (QwenAudio Team, 2026a):提供实时语音运行时,使智能体在保持连续语音交互的同时,将更复杂的任务(如代码生成、文件操作)委托给后端工作流执行。 - \*\*GPT-Live with CodeX\*\* 与 \*\*Claude Voice Mode\*\*:代表了产品化的实现路径,将自然语音交互与通用AI助手能力深度整合,使复杂的AI功能可通过连续语音交互访问。 \*\*局限性与挑战\*\*:现有语音智能体系统在实际交互工作流中仍面临重大挑战。用户在任务执行过程中可能随时打断并提供新约束;智能体需要主动沟通中间结果、请求澄清;简短的反馈(backchannel)不应导致当前任务终止;在多方环境中,系统需区分相关语音、处理背景噪声与视觉环境变化。这些场景要求模型联合推理交互状态、环境状态与任务状态,而不仅仅将语音视为输入输出接口。 --- ### 总结 现有研究在\*\*全双工语音交互\*\*、\*\*多模态连续感知\*\*和\*\*语音界面与Agent执行结合\*\*三个方面取得了重要进展。然而,这些能力通常被作为独立的系统组件处理。Gander 的提出正是为了回答一个更根本的问题:\*\*对话交互、多模态感知与任务执行能否被整合进单一的连续端到端过程中,而非作为独立的系统模块?\*\* 该论文通过 Brain–Cerebellum 协作框架与流式块扁平化机制,将上述三个方向的能力统一于单一架构之中。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*Gander\*\*,一个端到端的统一架构,从系统架构设计和数据工程两个层面系统性地解决了上述问题。核心解决方案包含以下三个相互支撑的支柱: --- ### 1. 大脑-小脑协作框架(Brain–Cerebellum Collaborative Framework) 针对\*\*实时响应与长期推理存在根本冲突\*\*的问题,Gander 采用了一种解耦的双层架构,而非依赖单一模型同时承担两种负荷。 - \*\*Front Cerebellum(前端小脑)\*\*:作为实时、全双工的多模态模型,持续处理流式语音、摄像头与屏幕输入。它负责维持活跃的对话上下文,并自主决定交互行为(倾听、发言、简短反馈、中断或调用工具)。 - \*\*Back Brain(后端大脑)\*\*:作为通用任务执行智能体(如 Codex 或 Claude Code),无需针对特定任务训练,专责复杂规划、长程推理与多步骤工作流执行。 - \*\*Agent Orchestration Runtime(智能体编排运行时)\*\*:作为中间协调层,管理实时多模态推理与异步后台任务。它将小脑感知到的转录文本与关键视觉帧传递给大脑,大脑异步执行后可将中间结果、计划或最终结论回传给小脑,由其整合进持续进行的交互中。 这一设计的核心优势在于,\*\*大脑可作为即插即用组件自由替换\*\*。更强的推理模型可直接接入而无需重新训练核心交互模型,从而在不牺牲实时性的前提下,使系统智能水平随底层推理能力同步提升。小脑通过结构化工具调用(\`task\_start\`、\`task\_send\`、\`task\_resolve\`)与运行时交互,确保用户能在后台任务执行期间继续对话、修改需求或接收进度更新。 --- ### 2. 流式 Thinker-Talker 架构与块级扁平化(Streaming Thinker-Talker with Chunk Flattening) 针对\*\*全双工交互必须内生于模型\*\*以及\*\*多模态感知-响应统一\*\*的问题,Gander 的前端小脑构建于一种流式架构之上,将所有模态和输入输出统一到一个自回归序列中。 #### 统一的时序 token 流 论文将连续交互划分为固定时长(1秒)的窗口,每个窗口组装为一个 \*\*chunk(块)\*\*。在每个块内,所有内容按时间对齐并扁平化为单一序列: - \*\*感知段\*\*:该窗口内到达的视觉 token( V )与音频 token( A ); - \*\*控制 token\*\*:模型预测的一个离散交互决策; - \*\*生成段\*\*:模型选择输出的 N 个文本 token( N 可为零)。 这些块按时间顺序拼接为一个因果语言模型可消费的统一 token 流。模型在每个块内首先处理新到达的感知 token,再生成输出,确保每个生成都以最新观察为条件。 #### 交互控制的内生化 在每个块的输出段起始位置,模型显式预测一个控制 token,决定当前窗口的交互行为: - \*\*Listen Token(倾听)\*\*:模型保持沉默,仅推进感知; - \*\*Speak Token(发言)\*\*:模型生成文本内容并触发下游语音合成; - \*\*Interrupt Token(中断)\*\*:模型终止当前正在进行的输出,以响应用户打断或环境突变。 这种设计将“是否说话”与“说什么”解耦,使交互决策基于与内容生成相同的动态表示,从而避免了外部 VAD 模块在语义不完整时仅凭声学静默错误触发轮次切换的问题。 #### 轻量级滑动上下文 为维持任意长会话中的推理成本稳定,Gander 采用固定预算的滑动窗口(128 个块,约对应两分钟交互历史)。当新块进入时,最旧的块被逐出,确保上下文长度有界,同时保留最近且交互相关的历史。 #### 语音生成解耦 前端小脑不直接生成声学单元,而是由 Thinker(语言模型主干)负责语义规划与交互决策,再通过 Talker 将隐藏状态注入轻量级自回归语音 token 解码器,最终由流式流匹配(flow-matching)解码器实时合成为波形。这种解耦使得语言主干保持在其擅长的文本推理域,同时通过参考音频实现零样本音色控制,并以因果分块方式输出音频,满足全双工低延迟要求。 --- ### 3. 面向交互与智能体的数据工程(Data Construction Pipeline) 为使模型习得上述能力,论文构建了一个包含约 \*\*270 万样本\*\*的大规模语料库,分为四个数据族,针对性解决交互行为、多模态感知与任务协调的监督问题: #### (1)语音交互数据(约 37%) 不仅包含基础对话与问答,还通过专用管道 \*\*InteractionSpeech\*\* 显式合成全双工行为监督。该管道生成包含\*\*竞争性打断\*\*(competitive interruption)与\*\*支持性简短反馈\*\*(supportive backchannel)的对话,精确标注时间轴上的重叠区间,确保模型在训练中观察到真实的声学证据(如用户插话时助手未说完的内容被隐藏),从而学习何时倾听、何时发言、何时被打断。 #### (2)音视频交互数据(约 40%) 将交互从纯语音扩展至连续变化的多模态环境,涵盖流式视频问答、视频叙述与\*\*主动视觉响应\*\*。数据经过时间对齐精修,响应被重写为约每秒 8 个 token 的速率,以平衡信息量与语音延迟,训练模型在视觉事件出现时及时作出反应。 #### (3)智能体交互数据(约 13%) 针对\*\*感知-交互-执行统一\*\*的需求,构建了描述用户、前端小脑与后端大脑三方协调的轨迹数据。包括: - \*\*Audio-agentic 交互\*\*:基于分层采样的任务种子,合成覆盖任务启动、增量更新、约束修正、进度查询、取消与结果交付的全生命周期轨迹; - \*\*Omni-agentic 交互\*\*:基于 GUI 和视频轨迹,要求模型在持续追踪视觉界面状态的同时,与用户交互并同步后台执行。 #### (4)鲁棒性与负样本数据(约 8%) 为提升真实场景可靠性,引入: - \*\*无关视频负样本\*\*:训练模型忽略无关视觉事件; - \*\*无指令环境\*\*:训练模型在无有效用户请求时保持沉默; - \*\*抗干扰数据\*\*:提升对噪声与重叠干扰者的鲁棒性; - \*\*多方交互数据\*\*:支持说话人与受话人追踪,判断某段语音是否针对智能体。 --- ### 总结 论文通过 \*\*架构解耦\*\*(Brain–Cerebellum 分离实时交互与长程推理)、\*\*表示统一\*\*(Chunk Flattening 将所有模态与输入输出扁平化为单一自回归流)、\*\*决策内化\*\*(控制 token 直接预测交互状态)以及\*\*数据驱动\*\*(覆盖全双工、音视频、智能体协调与负样本的大规模语料),系统性地解决了传统范式在\*\*实时性、多模态融合、交互自然度与复杂任务执行\*\*之间的冲突,实现了单一端到端模型下的 Omni 感知、实时交互与智能体能力统一。 Q4: 论文做了哪些实验? 论文在第5节围绕\*\*全双工交互\*\*、\*\*语音对话能力\*\*与\*\*全模态理解\*\*三个维度展开系统评估,旨在分离交互导向训练的收益与代价,并定位各组件的失效模式。以下按评估设置与三项主要实验逐一说明。 --- ### 1. 评估设置(Evaluation Setup) 所有结果均来自\*\*单一 Gander 检查点\*\*,解码参数与流式单元格式跨评估保持一致,系统提示与训练时完全一致,未针对任何基准进行调优。 | 评估维度 | 数据集/基准 | 设置说明 | |---|---|---| | \*\*全双工交互\*\* | Full-Duplex-Bench v3(100个场景) | 端到端评估:音频输入 Thinker,Talker 与语音解码器合成回复,评分基于 ASR 转录。后端大脑(Back Brain)通过 Codex 工作提供者实例化,由 GPT-5.6 驱动。额外报告\*\*仅后端大脑\*\*条件:绕过前端小脑与音频路径,直接以用户轮次文本转录驱动同一智能体与工具服务器。 | | \*\*语音对话\*\* | SpokenQA(Llama Q., Web Q.)
VoiceBench(AlpacaEval, SD-QA)
共 2,052 条话语 | 语音直接进入 Thinker,生成文本响应后评分;开放端回复由 GPT-4o 按基线协议评判。按交互机制分组对比(基于轮次 vs. 全双工流式)。 | | \*\*全模态理解\*\* | WorldSense( n=3,172 )
Daily-Omni( n=1,197 )
共 4,369 道多选题 | 基于轮次设置:完整题目在解码前一次性提供,不合成语音,不涉及后端大脑,采用贪婪解码以确保确定性。额外执行\*\*模态消融\*\*:分别测试音视频联合、仅视频、仅音频三种输入条件,总计 13,107 次推理。 | --- ### 2. 全双工交互实验(Full-Duplex Interaction) 该实验在工具增强的服务场景中,评估 Gander 的\*\*交互时机控制\*\*与\*\*任务执行准确性\*\*。 \*\*关键结果:\*\* - \*\*轮次接管(Take-turn)\*\*:Gander 在全部 100 个场景中均在适当时机接管对话,达到 100.0% ,与级联管道(Whisper → GPT-4o → TTS)持平,显著优于 Gemini Live 3.1 的 78.0% 。 - \*\*打断率(Interrupt↓)\*\*:Gander 的过早发言率仅为 8.0% ,为所有对比系统中最低(GPT-Realtime 13.5% ,Ultravox 47.9% ),表明基于语义而非声学静默的交互决策有效抑制了伪打断。 - \*\*填充词(Filler)\*\*: 51.6% 的回复以会话占位符开头,这并非交互时序缺陷,而是 Gander 将任务委托给后端大脑时保持轮次的自然行为。 - \*\*任务精度\*\*:在 Pass@1(要求工具多重集完全正确且参数无误)上,Gander 得分为 0.400 ,低于最强基线 GPT-Realtime 的 0.600 ;工具选择 F1(ToolSel)为 0.759 ,参数正确率(ArgAcc)为 0.503 。 \*\*诊断分析\*\*:仅后端大脑(文本驱动)条件下,Pass@1 提升至 0.520 ,RespQual 提升至 0.740 ,ToolSel 达到 0.934 (超过表中所有其他系统)。这表明\*\*执行层并非瓶颈\*\*;端到端系统的精度损失主要源于前端小脑的委托决策以及语音合成-识别通路引入的误差。 --- ### 3. 语音对话实验(Spoken Conversation) 该实验评估前端小脑在\*\*独立处理自包含问答\*\*时的语音理解与生成能力(此设置下后端大脑未被触发)。 \*\*关键结果:\*\* - \*\*SpokenQA\*\*:在全双工流式模型组内,Gander 领先于 Audio-Interaction 与 Moshi。在 Llama Questions 上得 \*\*75.60%\*\*(领先 Audio-Interaction 8.29 分),在 Web Questions 上得 \*\*59.30%\*\*(领先 4.96 分)。 - \*\*VoiceBench\*\*:在全双工组内,Gander 的 AlpacaEval 得 \*\*3.96\*\*(组内第二),SD-QA 得 \*\*46.84%\*\*(组内第二)。 - \*\*跨机制对比\*\*:即使在包含基于轮次模型的完整对比场中,Gander 的 SpokenQA 得分仍位列\*\*全场第二\*\*,表明流式分块公式本身并未损害语言主干保留的事实性知识。 论文指出,AlpacaEval 与 SD-QA 相对较弱,是因为交互监督数据主要由短对话轮次构成,既未奖励长篇论述性生成,也未扩展基础模型之外的口音覆盖;这两点可通过数据工程分别改进。 --- ### 4. 全模态理解实验(Omni Understanding) 该实验将前端小脑降级为文本回答模式,测量其在\*\*音视频流上的感知与推理能力\*\*,并通过模态消融检验真正的跨模态融合。 \*\*关键结果:\*\* - \*\*基准表现\*\*(表5): - Daily-Omni:\*\*78.53%\*\*,接近其初始化模型 MiniCPM-o 4.5 的 80.20% ,并高于 Qwen3-Omni 的 70.70% 。 - WorldSense:\*\*49.62%\*\*,较 MiniCPM-o 4.5 的 55.70% 下降 6.08 分。论文将此归因于训练数据主要由交互流构成,几乎不包含针对静态片段的细粒度属性级监督。 - \*\*模态消融\*\*(表6): | 基准 | 音视频(AV) | 仅视频(V) | 仅音频(A) | 融合增益(AV − max(V, A)) | |---|---|---|---|---| | WorldSense | 49.62 | 44.61 | 43.32 | \*\*+5.01\*\* | | Daily-Omni | 78.53 | 59.40 | 57.81 | \*\*+19.13\*\* | | \*\*总体\*\* | \*\*57.54\*\* | \*\*48.66\*\* | \*\*47.29\*\* | \*\*+8.88\*\* | 消融表明,Gander \*\*真正融合了双模态信息\*\*,而非仅依赖较强单一模态。Daily-Omni 的融合增益(+19.13)显著高于 WorldSense(+5.01),这与两者的任务特性一致:Daily-Omni 测试跨模态时间对齐推理,单一模态不足以支撑;WorldSense 侧重细粒度感知属性,往往可从单一模态获得。 --- ### 总结 论文的实验设计具有明确的诊断目的: 1. \*\*Full-Duplex-Bench\*\* 验证 Gander 在实时工具使用场景中的\*\*交互时机控制\*\*达到当前最佳水平,同时揭示语音通路是任务精度的主要损耗来源; 2. \*\*SpokenQA / VoiceBench\*\* 证明流式架构在\*\*独立对话任务\*\*中未牺牲语言知识与生成质量; 3. \*\*WorldSense / Daily-Omni\*\* 及其模态消融确认模型具备\*\*真正的音视频融合能力\*\*,并量化了交互导向训练对静态细粒度感知任务的权衡。 Q5: 有什么可以进一步探索的点? 基于论文第6节及全文实验分析,可进一步探索的方向可归纳为以下五个方面: --- ### 1. 数据与模型规模的系统性扩展 当前智能体调用行为与会话策略对训练数据分布仍较敏感,尤其在复杂全模态(omni)场景中。未来需在工业级基础模型(如论文提及的 Hy-Realtime)上,系统研究\*\*数据合成规模\*\*、\*\*任务覆盖多样性\*\*与\*\*模型参数量\*\*的联合扩展规律。此外,当前数据合成重度依赖外部大语言模型(如 DeepSeek-V4-Pro),探索更高效率、更低偏差的多模态数据生成与过滤策略,亦是提升鲁棒性的关键。 --- ### 2. 稳定的后训练(Post-Training)方法 Gander 目前尚未充分采用\*\*在线策略蒸馏\*\*(On-Policy Distillation, OPD)或\*\*强化学习\*\*(Reinforcement Learning, RL)针对长程 Omni 交互智能体场景进行深度优化。该方向面临的开放挑战包括: - \*\*奖励设计\*\*:如何为同时包含实时交互质量与长程任务完成度的复合目标设计有效奖励; - \*\*信用分配\*\*:在跨越前端小脑与后端大脑的多阶段决策中,如何准确归因成功或失败; - \*\*优化稳定性\*\*:在多模态流式生成与工具调用交织的动态环境中,避免 RL 训练崩溃或模式坍塌。 特别地,Brain–Cerebellum 架构引入了新的协调维度——需同时优化局部交互的流畅性与全局任务目标的达成,这要求发展更稳定、可扩展的后训练算法。 --- ### 3. 大脑-小脑(Brain–Cerebellum)架构的深度探索 当前设计中,两层之间的通信主要依赖\*\*ASR 转录文本\*\*作为信号,信息带宽与结构较为有限。未来可探索: - \*\* richer 双向通信机制\*\*:例如让大脑向小脑传递结构化的中间推理状态、执行计划或不确定性估计,而非仅传递最终文本结果; - \*\*小脑到大脑的细粒度反馈\*\*:如将用户的打断意图、环境变化的多模态嵌入(而非仅转录文本)实时回传至大脑,以动态调整任务执行策略; - \*\*非文本模态的直接传输\*\*:探索绕过文本瓶颈,以嵌入向量或视觉 token 形式在两层间传递信息,降低语义压缩损耗。 --- ### 4. 记忆与长上下文管理 当前前端小脑采用固定 128 个 chunk(约 2 分钟)的滑动窗口,这在日常对话中足够,但在涉及长程工具调用、多轮任务修订与复杂工作流追踪时,上下文容量明显受限。未来需开发: - \*\*高效的长程多模态记忆机制\*\*:支持在数十分钟乃至数小时的交互中,精准保留与检索任务相关的关键视觉事件、语音指令与工具调用历史; - \*\*动态记忆压缩与索引\*\*:在流式场景下,如何实时判断哪些感知信息应被写入长期记忆、哪些可被丢弃,以平衡实时延迟与历史回溯精度。 --- ### 5. 统一评估框架的构建 现有基准(如 Full-Duplex-Bench、SpokenQA、WorldSense 等)大多\*\*孤立地\*\*评估全模态理解、双工交互或智能体执行,缺乏对\*\*统一 Omni 交互智能体\*\*的综合评测。具体缺失包括: - \*\*跨组件协作评估\*\*:尚无基准能够量化衡量大脑与小脑之间的通信效率、信息传递损耗与协调一致性; - \*\*动态交互与任务执行联合度量\*\*:需要能够同时考察模型在实时对话中维持交互自然度、处理打断、以及正确推进长程任务的多维评估协议; - \*\*真实世界鲁棒性基准\*\*:现有测试多在受控环境下进行,缺乏对持续背景噪声、多人场景、视觉干扰与异步任务中断的系统化评估体系。 --- ### 补充方向:语音通路的端到端优化 实验结果表明,将后端大脑的文本结果通过前端小脑与语音合成通路传递后,RespQual 从文本条件下的 0.740 显著下降至端到端语音条件的 0.490 。这暗示\*\*语音识别-合成链路\*\*是当前系统的主要误差来源之一。未来可探索更紧密的语音-文本联合训练,或开发对合成失真更具鲁棒性的语音表示,以收窄文本与语音模态之间的性能差距。 Q6: 总结一下论文的主要内容 该论文提出了 \*\*Gander\*\*,一个端到端的统一架构,旨在将全模态感知、实时全双工交互与长程智能体任务执行整合于单一系统之中。其核心内容可概括如下: --- ### 1. 研究动机与核心问题 传统的大语言模型交互以\*\*回合制、文本为主\*\*,与人类自然交流中的\*\*连续、并发、多模态、可打断\*\*等特征存在根本差距。论文聚焦于两个核心问题: - \*\*交互性是否必须内生于模型\*\*,而非依赖外部模块(如 VAD、ASR)的硬编码拼接? - \*\*单一模型如何同时满足\*\*实时对话的低延迟需求与复杂智能体任务的长程推理需求? --- ### 2. 核心架构:Brain–Cerebellum 协作框架 为化解实时交互与复杂推理之间的内在冲突,Gander 采用了一种解耦的双层架构: - \*\*Front Cerebellum(前端小脑)\*\*:基于流式 \*\*Thinker-Talker\*\* 架构的实时全双工多模态模型。它持续接收流式音频与视频输入,自主决定交互状态(倾听、发言、中断),并处理日常对话与简单任务。 - \*\*Back Brain(后端大脑)\*\*:一个即插即用、无需额外训练的通用任务执行智能体(如 Codex),负责长程推理、工具调用与复杂工作流。 - \*\*Agent Orchestration Runtime(编排运行时)\*\*:协调前后端之间的异步通信。小脑通过结构化工具调用(\`task\_start\`、\`task\_send\`、\`task\_resolve\`)将任务委托给大脑,大脑异步返回中间结果或最终结论,由小脑整合进持续进行的对话中。 该设计的优势在于:\*\*大脑可独立升级替换\*\*,其推理能力的提升可直接传导至整个系统,而小脑始终保持低延迟的实时交互。 --- ### 3. 流式块级扁平化:统一的多模态交互表示 Gander 的前端小脑将连续交互离散为固定时长(约1秒)的 \*\*chunk(块)\*\*,每个块被扁平化为统一的自回归 token 序列:

C_t = [V_1, V_2, dots, A_1, A_2, dots, Control, T_1, T_2, dots]
其中包含视觉 token、音频 token、一个**控制 token**(Listen / Speak / Interrupt)以及模型生成的文本 token。通过滑动窗口(128 个块,约2分钟)管理上下文,模型在每个时间窗口内基于最新感知动态决定交互行为,无需外部语音活动检测模块。 语音生成采用解耦设计:Thinker(LLM 主干)负责语义与交互规划,Talker 及下游流式流匹配解码器负责将隐藏状态实时合成为波形,并支持零样本音色控制。 —- ### 4. 数据工程:面向交互与智能体的训练语料 为支撑上述能力,论文构建了约 **270 万样本**的四族数据: - **语音交互数据**(37%):包含显式合成全双工行为的 **InteractionSpeech**,涵盖竞争性打断与支持性简短反馈(backchannel)。 - **音视频交互数据**(40%):涵盖流式视频问答、叙述与主动视觉响应,训练模型基于持续视觉输入及时反应。 - **智能体交互数据**(13%):合成覆盖任务全生命周期(启动、修订、进度查询、取消、交付)的三方交互轨迹(用户-小脑-大脑)。 - **鲁棒性与负样本数据**(8%):包括无关视频、无指令环境、噪声干扰与多方对话,以抑制错误响应。 —- ### 5. 实验评估 论文从三个互补维度进行评估,诊断系统各组件的表现: - **全双工交互**(Full-Duplex-Bench v3):Gander 在 **轮次接管率** 上达到 **100%**,**过早打断率** 仅为 **8.0%**,均为对比系统中最佳,证明其内生交互决策的有效性。任务精度(Pass@1 0.400)虽略低于部分商业系统,但消融实验表明瓶颈主要在于语音合成-识别通路,而非后端大脑的执行能力。 - **语音对话**(SpokenQA, VoiceBench):在全双工流式模型组内领先,且在整体对比中保持前列,说明流式训练未损害语言主干的知识能力。 - **全模态理解**(WorldSense, Daily-Omni):Gander 在 Daily-Omni 上达 **78.53%**,接近其基础初始化模型。模态消融表明,音视频联合输入较单一模态有显著增益(Daily-Omni 上 **+19.13**),证实模型实现了真正的跨模态融合。 —- ### 6. 贡献与未来方向 **主要贡献**包括: 1. 提出统一的端到端 Omni 交互智能体架构,原生集成感知、实时交互与智能体能力; 2. 通过 Brain–Cerebellum 框架与流式 chunk 设计,实现了强全双工对话、鲁棒打断与异步任务执行的协同; 3. 开源模型权重与代码。 **未来工作**涵盖:数据与模型规模的系统性扩展;针对长程交互场景的 OPD/RL 后训练;丰富 Brain–Cerebellum 间的双向通信(超越文本转录);长程多模态记忆管理;以及构建统一的 Omni 交互智能体评估基准。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Orantqing,Shengpeng Ji,Junlong Tong,Jialong Zuo,Dongjie Fu,Di Cao,Yangzhuo Li,Shangda Wu,Franz,Evan,Theron Veyra,Changhao Pan,Jingyu Lu,Dongchao Yang,Zhifei Xie,Yang Tan,Xiaoyu Shen,Xiaoda Yang,Wenfu Wang,Teddy Sun,Steve Yves,Zhou Zhao

Categories:

PDF URL: https://arxiv.org/pdf/2609.08977.pdf

Arxiv URL: https://arxiv.org/abs/2609.08977

Arxiv ID: 2609.08977

CoolPaper URL: https://papers.cool/arxiv/2609.08977

Published: 2026-09-10T01:26:52.106Z

Updated: 2026-09-10T01:26:52.106Z


4. Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation

Abstract:Weak-to-strong generalization asks whether stronger models can learn from weaker supervisors and surpass them. This question is particularly important for successive model generations and multi-domain consolidation, where repeating frontier-scale post-training from scratch can be prohibitively expensive. Yet conventional distillation treats the weak teacher as an optimization target, potentially imposing its capacity ceiling on the student. We introduce On-Policy Reverse Distillation (OPRD), which evaluates the teacher’s policy shift relative to its reference policy on student rollouts and amplifies the component of the student’s verifier-driven policy gradient along that direction. By rescaling only verifier-supported updates, OPRD preserves the stationary points of policy optimization while accelerating learning beyond the teacher. In both successive model transfer and multi-teacher distillation, OPRD achieves higher performance with fewer student updates than existing RL and distillation approaches. Response-style analysis shows that OPRD students remain closer to models trained with verifier-based RL alone than to their weak teachers, suggesting that teacher guidance accelerates rather than redirects the student’s own optimization. Results in conventional strong-to-weak distillation further demonstrate that OPRD effectively combines verifier-driven policy optimization with teacher guidance regardless of capacity ordering.

中文摘要

摘要:弱到强的泛化问题在于,是否更强的模型可以从较弱的监督者学习并超越它们。这个问题对于连续的模型迭代和多领域整合尤为重要,因为从零开始重复前沿规模的后训练成本可能会高得令人望而却步。然而,传统的蒸馏方法将弱教师视为优化目标,可能会将其容量上限强加给学生模型。我们提出了在策略反向蒸馏(On-Policy Reverse Distillation, OPRD)方法,它通过在学生 rollout 中评估教师策略相对于其参考策略的变动,并放大学生的验证器驱动策略梯度沿该方向的分量来进行优化。通过仅重新缩放由验证器支持的更新,OPRD 在加速超越教师模型的学习的同时,保留了策略优化的稳态点。在连续模型迁移和多教师蒸馏中,OPRD 在学生模型更新次数更少的情况下,取得了比现有强化学习和蒸馏方法更高的性能。响应式分析显示,OPRD 学生模型仍然更接近仅通过验证器驱动强化学习训练的模型,而不是它们的弱教师,表明教师指导加速了学生自身的优化,而不是改变其方向。在传统的强到弱蒸馏实验结果中,OPRD 进一步证明了无论容量排序如何,它都能有效结合验证器驱动的策略优化与教师指导。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文研究的是\*\*弱到强泛化(Weak-to-Strong Generalization)\*\*问题,即在现代基础模型开发中,如何将较弱(或较小)模型的后训练收益高效迁移到更强(或更大)的学生模型,并使其最终能\*\*超越\*\*弱教师,而非被教师的能力上限所束缚。 具体而言,论文聚焦于以下两个关键场景: - \*\*连续模型迁移(Successive Model Transfer)\*\*:将一个经过后训练的较小规模模型(如4B)作为教师,监督下一代更大规模的模型(如8B),使后者继承先前的后训练成果并在此基础上进一步提升。 - \*\*多领域整合(Multi-Domain Consolidation)\*\*:将多个独立开发的小规模领域专家模型后训练策略整合到一个统一的大规模基础模型中。 \*\*现有方法的核心局限\*\* 传统的知识蒸馏(Knowledge Distillation)以及当前流行的\*\*在线策略蒸馏(On-Policy Distillation, OPD)\*\*将弱教师的最终策略或其衍生目标作为学生优化的直接目标。这导致: - 学生被优化去\*\*匹配\*\*弱教师的完整策略分布,从而继承了教师因容量有限而产生的所有偏差与上限; - 即使结合强化学习(RL),教师匹配仍作为一个独立的目标函数,可能与基于验证器的奖励最大化产生竞争,抑制学生发现超越教师的、但受验证器支持的新行为。 \*\*论文的解决思路\*\* 为突破上述限制,论文提出\*\*在线策略反向蒸馏(On-Policy Reverse Distillation, OPRD)\*\*。其核心思想是: - \*\*不直接匹配弱教师的策略\*\*,而是提取教师相对于其参考策略的\*\*策略偏移(policy shift)\*\*,即仅捕捉教师在RL后训练中学到的相对偏好变化; - 在学生生成的轨迹上,将该偏移方向与学生自身由验证器驱动的策略梯度对齐,\*\*仅放大沿该方向的分量\*\*,而保持正交分量不变; - 由于这种变换只重新缩放验证器已支持的更新,它\*\*保留了RL目标在logit空间中的平稳点\*\*,同时加速收敛,并允许学生在发现更优解时偏离教师。 简言之,论文试图解决的问题是:\*\*如何在不将弱教师策略或其偏移作为独立优化目标的前提下,利用弱模型的后训练经验来加速并增强强模型的学习,使其最终突破弱教师的能力天花板。\*\* Q2: 有哪些相关研究? 根据论文第5节(Related Work)及引言中的讨论,相关研究可归纳为以下五个主要方向: --- ### 1. 弱到强泛化(Weak-to-Strong Generalization) 该方向研究更强的模型能否从较弱的监督者(如小模型或不完美的人类反馈)中学习并最终超越它们。 - \*\*基础观察\*\*:Burns 等人(2024)首次系统性地展示了这一现象,但指出弱监督通常只能恢复强监督性能差距的一部分。 - \*\*理论分析\*\*:Lang 等人(2024)、Charikar 等人(2024)、Medvedev 等人(2025)从假设类差异、表示学习等角度解释了弱到强泛化的机制;Dong 等人(2025)与 Xue 等人(2025)则分析了表示几何对泛化的影响。 - \*\*过拟合风险\*\*:Somerstep 等人(2025)、Yao 等人(2025)及 Shi 等人(2025)指出, naive fine-tuning 可能导致学生过拟合弱监督者的错误。 - \*\*利用弱教师轨迹的方法\*\*: - \*\*W2SR-P\*\*(Yuan 等人,2026):在验证正确的弱教师轨迹上进行监督微调(SFT)。 - \*\*S2L-PO\*\*(Ren 等人,2026):将弱模型的 off-policy rollout 与学生 rollout 混合,以扩展探索多样性。 - \*\*弱批评者方法\*\*(Wang 等人,2026a;Jin 等人,2026):利用弱模型生成并筛选改进的响应。 \*\*与 OPRD 的区别\*\*:上述方法通过改变训练数据、探索策略或反馈来源来利用弱教师;而 OPRD 不改变这些要素,仅通过重新缩放学生自身的策略梯度来引入教师信号。 --- ### 2. 在线策略蒸馏(On-Policy Distillation, OPD) OPD 通过在\*\*学生生成的前缀\*\*上查询教师,解决训练与推理前缀分布不匹配的问题。 - \*\*基础方法\*\*:从固定或教师生成序列上的传统知识蒸馏(Hinton 等人,2015;Kim & Rush, 2016)发展到学生生成序列上的目标(Gu 等人,2024;Ko 等人,2024)。Agarwal 等人(2024)提出了完全在线的蒸馏框架。 - \*\*推理后训练应用\*\*:OPD 已成为前沿模型推理后训练的常见步骤(Qwen Team, 2025b;GLM-5 Team, 2026)。 - \*\*多教师整合\*\*:Ma 等人(2026)、Kimi Team(2026)、Xiaomi Team(2026)及 DeepSeek-AI(2026)将多个领域专家教师的能力整合到单一学生模型中。 - \*\*特权信息与奖励外推\*\*:Zhao 等人(2026)、Ye 等人(2026)利用训练期间独有的特权信息;Yang 等人(2026a)尝试外推 OPD 中隐含的奖励。 \*\*与 OPRD 的区别\*\*:所有这些方法中,学生仍被训练去匹配由教师定义的 token 分布。在弱到强设置下,这意味着优化目标的最优解就是弱教师本身(或其衍生目标),从而可能将学生的能力上限限制在教师水平。 --- ### 3. 蒸馏与强化学习的结合(Distillation with RL) 这类方法尝试将教师监督与基于验证器的强化学习(RLVR)相结合。 - \*\*KDRL\*\*(Xu 等人,2025)及 Ramos 等人(2026):在奖励目标中额外添加一个教师匹配项,作为联合优化目标。 - \*\*其他干预策略\*\*:Zhang 等人(2026a)、Akhondzadeh 等人(2026)、Zhang 等人(2026b)、Ko 等人(2026)及 Jia 等人(2026)通过策略比率、基于奖励的选择、组级校准或 token 级干预来修改教师指导。 - \*\*自教师信用分配\*\*:Wang 等人(2026b)使用特权自教师来控制多步多轮 LLM Agent 中 token 级信用的幅度。 \*\*与 OPRD 的区别\*\*:这些方法引入了教师匹配作为\*\*第二个独立的目标函数\*\*,该目标可能与验证器奖励最大化产生竞争——尤其当教师偏好的解并非验证器奖励最高的解时。OPRD 则不添加任何额外目标,仅优化奖励本身。 --- ### 4. 策略偏移的迁移(Transferring Policy Shifts) 该方向关注迁移后训练策略与其参考策略之间的\*\*偏移量\*\*(policy delta),而非最终策略本身。 - \*\*解码阶段\*\*:Liu 等人(2024)与 Zhou 等人(2024)利用该偏移引导更大的冻结模型生成。 - \*\*训练阶段\*\*: - \*\*对齐目标\*\*:Zhu 等人(2025)将偏移作为更强模型的对齐目标。 - \*\*W2S-OPD\*\*(Yu 等人,2026):将偏移重新锚定到学生的基础策略上,构建代理教师(proxy teacher)进行蒸馏。 - \*\*Direct-OPD\*\*(Heo 等人,2026;Feng 等人,2026):将偏移直接作为学生 rollout 上的密集奖励进行优化。 \*\*与 OPRD 的区别\*\*:上述方法均使策略偏移本身成为\*\*独立的优化目标\*\*。由于该偏移仅编码了弱教师在其自身容量限制下实现的改进,直接优化它仍可能限制更强学生的最终性能。OPRD 仅将偏移方向用于重新缩放学生已有的验证器驱动梯度,而非将其作为目标。 --- ### 5. 梯度操作与多任务优化(Gradient Manipulation) OPRD 在形式上与多任务学习中的梯度操作策略相关。 - \*\*梯度手术(Gradient Surgery)\*\*:Yu 等人(2020)提出当任务梯度冲突时,将一个梯度投影到另一个梯度的法平面上。 - \*\*稳定性改进\*\*:Hsieh 等人(2024)利用过去梯度的移动平均使投影更稳定。 - \*\*梯度门控\*\*:Du 等人(2019)与 Zhou 等人(2022)通过与主梯度的余弦相似度来门控辅助梯度。 \*\*与 OPRD 的区别\*\*:在这些方法中,每个方向都是某个损失函数的梯度,冲突分量被\*\*移除或降权\*\*。OPRD 形式上最接近这一家族,但它\*\*不删除任何分量\*\*,仅放大学生策略梯度中已与教师方向对齐的部分,并完全保留正交分量。因此,学生在 logit 空间中的优化平稳点不会发生移动。 --- 综上,OPRD 的核心创新在于:\*\*它不属于上述任何一个独立的“匹配”或“偏移优化”范式,而是通过一种保持平稳点的梯度重缩放机制,将弱教师的经验嵌入到学生自身的验证器驱动优化过程中。\*\* Q3: 论文如何解决这个问题? 论文通过提出\*\*在线策略反向蒸馏(On-Policy Reverse Distillation, OPRD)\*\*来解决弱到强泛化问题。其核心在于:\*\*利用弱教师在强化学习后训练中获得的策略偏移(policy shift)来加速强学生的优化,但绝不将弱教师的最终策略或其偏移作为独立的优化目标。\*\* 具体解决路径可分为以下四个层面: --- ### 1. 提取教师的策略偏移,而非匹配教师策略 传统蒸馏(包括 OPD)将学生的优化目标设为匹配弱教师的最终策略 π_T ,这会把教师因容量限制产生的所有行为(包括从参考模型继承的偏好、后训练获得的改变以及容量瓶颈导致的次优行为)一并传递给学生。 OPRD 改为提取\*\*教师相对于其自身参考策略(reference policy)的策略偏移\*\*:

Delta_t := C( z_T(s_t) - z_T^(ref)(s_t) ) = C( log π_T(·|s_t) - log π_T^(ref)(·|s_t) )
其中 z_T 和 z_T^(ref) 分别为教师及其参考模型的 next-token logits, C(·) 为均值中心化操作。该偏移 Delta_t 捕捉了教师在 RL 后训练中**相对偏好发生的改变**,排除了参考模型继承的无关偏好。 OPRD 仅保留其单位方向:
d_t := Delta_t / |Delta_t|_2
用于后续的梯度缩放,而非优化 Delta_t 本身。 —- ### 2. 沿教师方向重缩放学生自身的验证器驱动梯度 在学生生成的 rollout 上,OPRD 首先计算标准的、由验证器(verifier)驱动的策略梯度:

gt := A_t ∇(zt) log πθ(yt | s_t)
其中 A_t 为优势值。关键步骤是将 g_t 相对于教师方向 d_t 进行分解: - 投影分量: Proj
(dt)(g_t) := u_t d_t ,其中 u_t := d_t^top g_t - 正交分量: g_t^perp := g_t - Proj(dt)(g_t) OPRD 构造修正后的梯度:
g_t := g_t + λ_t · Proj
(dt)(g_t) = (1+λ_t)Proj(dt)(g_t)(放大) + gt^perp(不变)
这一操作的本质是:**仅放大验证器驱动的梯度中已与教师后训练方向对齐(或相反)的分量,而完全保留与教师方向正交的分量。** 由于正交分量 g_t^perp 不受教师信号约束,学生仍可沿验证器支持但教师未探索的方向自由优化。 —- ### 3. 不对称对齐缩放:先跟随,再超越 u_t 的符号决定了学生梯度与教师方向的关系: - u_t ≥ 0 :学生更新与教师偏移同向,此时放大有助于快速迁移教师经验。 - u_t < 0 :学生更新与教师偏移反向,意味着验证器支持学生采取与教师偏好不同的行动,这是学生可能超越教师的关键信号。 为避免早期训练中学生 rollout 质量较差时负向对齐带来的噪声,OPRD 采用**不对称分支调度**:

λt := λ, & u_t ≥ 0 [6pt] λ · min{ (k) / (K(textwarm)), 1 }, & ut < 0
其中 k 为当前优化步数, K
(warm) 为 warm-up 长度。该设计**立即激活正向分支**以加速早期学习,**逐步引入负向分支**以鼓励学生后期发现超越教师的策略。 —- ### 4. 理论保证:保留平稳点,仅加速收敛 对于任意 λ_t ≥ 0 ,修正梯度 g_t = (I + λ_t d_t d_t^top) g_t 满足两个关键性质: **平稳点不变性:**

g_t = 0 quad 当且仅当 quad g_t = 0
这意味着 OPRD 不会改变 RL 目标在 logit 空间中的驻点,学生的最终性能上限由验证器目标及其自身的策略类别决定,而非被弱教师的容量所限制。 **一阶对齐增益:**
langle g_t, g_t rangle = |g_t|_2^2 + λ_t u_t^2 ≥ |g_t|_2^2
该非负增益随对齐系数 |u_t| 增大而增大,确保 OPRD 在每一步都提供不少于原始梯度的进展保证。 —- ### 总结 OPRD 的解决逻辑可概括为: | 传统方法的局限 | OPRD 的解决方式 | |—-|—-| | 将弱教师最终策略 π_T 作为优化目标 | 提取教师后训练偏移的方向 d_t ,**不作为目标** | | 教师匹配与奖励最大化可能竞争 | 无额外损失函数,仅重缩放学生**已有的**验证器梯度 | | 学生性能被教师容量天花板限制 | 保留正交分量 g_t^perp ,允许验证器驱动学生**超越**教师 | | 正负向对齐同等对待导致早期噪声 | 不对称 warm-up:先利用教师经验,再鼓励Verifier支持的偏离 | 通过这种方式,OPRD 既继承了弱教师在 RL 后训练中获得的有效信号,又避免了将其策略或其偏移变为优化约束,从而实现了**“教师指导加速,验证器驱动超越”**的弱到强泛化。 Q4: 论文做了哪些实验? 论文围绕**弱到强泛化**与**在线策略反向蒸馏(OPRD)**的有效性,在数学与逻辑推理任务上开展了一系列系统实验。实验可归纳为**三大主实验设置**、**扩展对比与消融分析**,以及**附录中的补充验证**。 —- ### 一、主实验设置 #### 1. 连续模型迁移(Successive Model Transfer) 旨在验证较小规模的后训练模型能否加速下一代更大模型的后训练,并使其超越教师。 - **配置**: - 数学任务:以经过 GRPO 后训练的 **Qwen3-4B** 为教师,**Qwen3-8B** 为学生,在 DAPO-Math-17K 上训练,评估于 AIME’24、AIME’25、HMMT’25 与 OlympiadBench。 - 逻辑推理任务:以 **Qwen3-4B-Base** 为教师,**Qwen3-8B-Base** 为学生,在 Reasoning Gym(Knights & Knaves、Quantum Lock、String Manipulation、Countdown)上训练与评估。 - **基线**:GRPO(纯 RLVR)、OPD(在线策略蒸馏)、KDRL(蒸馏与 RL 联合优化)。 - **核心结果**: - OPRD 达到弱教师水平所需的更新量比 GRPO 少 **33–67%**,早期检查点性能最高高出 **22.7** 个百分点。 - OPD 初期提升快,但很快在教师平均水平附近饱和;OPRD 则在快速继承后继续提升,最终超越教师。 #### 2. 多教师领域整合(Multi-Domain Consolidation) 旨在验证能否将多个独立训练的小规模领域专家高效整合进单一的大规模学生模型。 - **配置**:使用四个任务专门的 **Qwen3-4B-Base** 教师(分别针对上述四项 Reasoning Gym 任务),将示例按域混合后训练单个 **Qwen3-8B-Base** 学生,共训练 300 步。每个示例激活其对应的领域教师。 - **基线**:Mix-RL(纯 RLVR)、MOPD(多教师在线蒸馏)、KDRL。 - **核心结果**: - OPRD 达到教师水平所需的更新量比 Mix-RL 少 **55%**。 - 最终平均 Pass@1 达到 **58.77**,超出 Mix-RL **11.09** 分、超出专家平均 **14.12** 分,且在四个异构任务上**同时超越**对应专家,未出现跨任务折损。 #### 3. 强到弱蒸馏(Strong-to-Weak Distillation) 旨在验证 OPRD 的有效性是否依赖于“教师弱、学生强”这一特定容量顺序。 - **配置**: - 数学:**Qwen3-8B → Qwen3-1.7B**,评估于 AIME’24。 - 逻辑推理:**Qwen3-8B-Base → Qwen3-0.6B**,评估于 Knights & Knaves。教师均取自第 105 步 GRPO 检查点。 - **核心结果**:OPRD 依然显著优于 OPD 与 KDRL(如在 Knights & Knaves 上领先 OPD **29.20** 分)。这表明 OPRD 通过放大验证器驱动梯度中可利用的教师分量,即使在常规强到弱场景下也能有效结合教师指导与验证器优化。 —- ### 二、扩展对比与消融分析 #### 4. 与更广泛的弱到强方法对比 OPRD 与若干利用弱教师信号但技术路线不同的方法进行了比较: - **W2SR-P**:在弱教师验证正确的轨迹上进行 SFT。 - **S2L-PO**:将弱教师 rollout 与学生 rollout 混合以扩展探索。 - **OPSD(变体)**:以弱教师生成的正确草稿作为特权上下文进行自蒸馏。 - **Direct-OPD**:将弱策略偏移直接作为密集奖励优化。 - **W2S-OPD**:将偏移重新锚定到学生基础策略上构建代理教师再蒸馏。 **结果**:OPRD 在三项任务上的平均表现(**60.81**)分别超出最强的对比方法 S2L-PO **6.60** 分、W2S-OPD **11.59** 分、Direct-OPD **23.00** 分。这说明**仅提取偏移方向并重缩放验证器梯度,优于直接以偏移为目标进行优化**。 #### 5. 教师指导的设计与动态(消融实验) - **教师检查点质量**:使用第 15/60/105/150 步的弱教师检查点进行 OPRD。发现更好的教师提供更有信息量的方向,加速效果更强;但即使第 60 步教师仅达 **29.0%** Pass@1,OPRD 学生仍能快速达到约 **88%**,表明学生绝对性能不受教师绝对水平硬约束。 - **指导方向 d_t 的构建**:比较弱策略偏移 Delta_t 、OPD 教师-学生梯度、OPSD 自蒸馏梯度。**弱策略偏移**提供了最稳定且有效的指导方向。 - **放大强度 λ **:在 $

0, 1.0
间扫描。所有 λ > 0 均优于 GRPO; λ 不超过 0.5 时早期加速随 λ 单调提升,超过后收益平缓,故默认取 0.5。 - 梯度对齐动态:追踪 d_t 与学生策略梯度 g_t 的夹角。训练初期两者耦合强(显著同向或反向),表明教师有效引导;后期夹角均趋近 90^circ ,说明学生梯度越来越多地沿着验证器支持但教师未捕捉的方向演化,教师指导自然衰减。 #### 6. 学生行为分析 - 推理路径:通过可视化 AIME’25 的 token-level 对齐,展示 OPRD 学生在验证器支持下可选择与教师偏好不同的、更直接的推理路径(例如跳过中间求和直接给出答案),而非被迫模仿教师的冗长路径。 - 响应风格:基于 101 个标准化风格特征(连接词、情态、语法、标点、结构五类)的比较显示:OPD 学生的响应风格随训练逐步趋近弱教师;而 OPRD 学生在所有检查点、所有类别上均更接近纯 GRPO 训练的学生风格,佐证了 OPRD 是“通过学生自身优化表达教师经验”,而非模仿教师外在风格。 —- ### 三、附录中的补充实验 - 额外模型与任务:附录 D.2 报告了 Qwen3-Base 模型在数学及额外三项 Reasoning Gym 任务(Zebra Puzzles、Color Cube Rotation、Binary Matrix)上的结果;附录 H 进一步验证了指导方向在不同教师质量下的鲁棒性。 - 长度偏差与参考策略选择:附录 I 与正文 4.3 节指出,若参考策略 π_T^(ref) 选择不当(如使用 step-0 基础模型),教师偏移可能编码强烈的响应长度偏差,导致 OPRD 过早收敛。将参考策略移至 step-30 可有效缓解。 - 正负分支的隔离与调度:附录 B 通过仅激活正向或负向分支,验证了两者的互补作用;并比较了 λ^- warm-up、 λ^+ annealing 与固定对称缩放三种策略,确认了默认的不对称 warm-up 设计最优。 - 计算开销:附录 K 显示,相较于 GRPO,OPRD 每步墙钟时间增加 11.9%,峰值 GPU 显存增加 10.2%(主要来自额外的参考策略前向传播与梯度修正的张量分配)。 —- 综上,实验从同族跨尺度迁移多专家融合反向容量顺序验证三个维度确立了 OPRD 的普适优势,并通过广泛的对比、消融与行为分析,验证了其“提取教师偏移方向、重缩放学生验证器梯度、保留超越空间”机制的有效性。 Q5: 有什么可以进一步探索的点? 基于论文的展望与核心机制,以下是可以进一步探索的研究方向: —- ### 1. 扩展至更广泛的复杂任务与环境 当前实验集中于具备精确程序化验证器的数学与逻辑推理任务。未来工作可将 OPRD 扩展至: - 代码生成:利用程序执行反馈作为验证器,测试策略偏移能否迁移不同编程语言或算法范式。 - 智能体环境(Agentic Environments):在交互式环境中,早期动作影响后续观察与奖励链,需验证教师偏移能否有效传递长期信用分配经验。 - 多模态推理:在视觉-语言或工具使用场景中,验证器反馈可能涉及多模态匹配或执行结果,探索跨模态策略偏移的提取与放大机制。 —- ### 2. 在更大规模模型上的 Scaling 验证 论文实验覆盖 0.6B 至 8B 参数范围。在更大规模(frontier-scale)模型上,需回答: - 容量差距放大效应:当学生容量远大于教师时,相同教师偏移能支撑学生多大程度的超越?是否存在边际效益递减? - 样本效率的持续性:OPRD 在 8B 规模上显著减少了达到教师水平所需的更新步数,这一优势在数十亿甚至千亿参数模型上是否依然成立? - 训练成本权衡:小规模教师的后训练成本相比直接大规模 RLVR 的节省是否随规模扩大而更具经济效益。 —- ### 3. 系统层面的高效实现 OPRD 需额外加载教师与参考策略,并在 logit 空间执行投影与缩放。在分布式训练场景下,可探索: - 异构并行策略:如何高效地在混合并行(张量并行、流水线并行、FSDP)框架中放置冻结的教师与参考模型,减少与学生活动进程的通信开销。 - 内存与计算优化:当前峰值显存增加约 10.2%,墙钟时间增加约 11.9%。需研究梯度修正的稀疏化实现、参考策略的权重量化或 KV-cache 共享,以进一步降低系统开销。 —- ### 4. 递归自改进(Recursive Self-Improvement)流水线 论文指出,OPRD 天然适合跨代模型知识传递。未来可构建: - 代际训练循环:第 n 代模型的后训练偏移直接通过 OPRD 指导第 n+1 代模型的优化,形成“每一代改进下一代”的递归链路。 - 动态教师更新机制:在持续学习或在线学习设定中,探索何时应替换教师检查点、如何聚合多代教师的偏移历史,以避免过时指导的累积。 —- ### 5. 参考策略选择与偏差分离 论文发现教师偏移 Delta_t 可能编码与奖励无关的结构偏差(如响应长度偏好),且参考策略 π_T^(ref) 的选择直接影响偏差强度。可进一步研究: - 自适应参考策略选择:开发自动选择或动态调整 π_T^(ref) 的算法,以最小化长度偏好等伪相关信号,同时保留任务相关的策略进步。 - 显式偏差解耦:在提取 Delta_t 时,显式分离奖励相关偏移与行为惯性(如长度、格式模板),仅将前者用于梯度重缩放。 —- ### 6. 非对称对齐缩放的理论与自适应机制 OPRD 当前采用固定 warm-up 策略调度负向分支 λ^- 。更精细的研究包括: - 理论驱动的动态调度:基于学生 rollout 质量、梯度噪声水平或验证器奖励分布,自适应调整正负分支的相对强度,而非预设线性 ramp-up。 - 分支可靠性估计:在 token 或序列级别建立置信度机制,当负向对齐的梯度信号不可靠时自动抑制其放大,进一步稳定早期训练。 —- ### 7. 多教师冲突下的方向组合策略 在多领域整合实验中,OPRD 隐式表现出类似 PCGrad 的冲突缓解效果。系统性拓展方向包括: - 多方向投影:当多个领域教师的偏移方向 d_t^((1)), d_t^((2)), dots 相互冲突时,如何最优地将其投影到学生验证器梯度的子空间中,或构造凸组合。 - 层次化教师架构:探索嵌套式指导(如领域教师提供细粒度偏移,通用教师提供高层偏好),构建多层 OPRD 框架。 —- ### 8. 与探索机制的结合以解决梯度消失 在强到弱或极难任务中,学生初始 rollout 质量过差可能导致验证器梯度 g_t 近乎消失,使 OPRD 失去修正基础。可探索: - 混合启动策略:先用短阶段的 SFT 或标准 OPD 启动学生,使其生成足够多样化的有效响应,再切换至 OPRD 进行 RLVR 优化。 - 辅助探索奖励:设计廉价的密集探索奖励(如格式正确性、中间步骤存在性),在初始阶段提供非零梯度信号,供 OPRD 放大。 —- ### 9. 跨架构与跨代迁移 论文实验主要在 Qwen3 同族模型内进行。未来需验证: - 跨架构迁移:当教师与学生架构不同(如 Qwen-to-Llama 或 Transformer-to-Mamba)时,logit 空间偏移的语义是否仍可对齐,以及投影操作是否依然有效。 - 跨代际迁移:如论文提及的从 Qwen2.5 到 Qwen3 的初步尝试,需克服分布差异,测试 OPRD 在代际差距更大时的鲁棒性。 —- ### 10. 全局收敛与超越条件的理论刻画 论文给出了 token-level 的平稳点保留与一步上升界。更深层理论问题包括: - 全局收敛速率:在策略优化框架下,OPRD 的梯度缩放是否能在理论上证明比标准 RLVR 更快的收敛到局部最优? - 超越教师的充分条件:建立数学条件,明确在何种验证器结构、策略类别与教师偏移质量下,OPRD 保证学生最终性能严格超过弱教师的上确界。 Q6: 总结一下论文的主要内容 该论文围绕弱到强泛化(Weak-to-Strong Generalization)问题,提出了一种名为在线策略反向蒸馏(On-Policy Reverse Distillation, OPRD)的方法,旨在让更强的学生模型利用较弱教师的后训练经验,同时不被教师的能力上限所束缚。 —- ### 1. 研究背景与核心问题 在大模型迭代开发中,存在两个关键场景: - 连续模型迁移:用后训练的小模型(如4B)监督下一代大模型(如8B)。 - 多领域整合:将多个独立训练的小规模领域专家模型整合为单一的大模型。 传统蒸馏方法(包括在线策略蒸馏 OPD)通常将学生优化目标设为匹配弱教师的最终策略。这导致强学生继承了教师的全部行为(包括其容量限制带来的次优解),性能往往在教师水平附近饱和,难以超越。 —- ### 2. 核心方法:OPRD OPRD 的核心思想是不直接匹配教师策略,而是提取并借用教师在后训练中“学到了什么”步骤概览: - 提取策略偏移(Policy Shift):对于每个学生访问的前缀 s_t ,计算教师 π_T 与其参考策略 π_T^(ref)$ 的 next-token logits 差异,经均值中心化后得到偏移向量:

Delta_t := C( z_T(s_t) - z_T^(ref)(s_t) )
该向量捕捉了教师在后训练中获得的**相对偏好改变**。OPRD 仅取其单位方向:
d_t := Delta_t / |Delta_t|_2

  • **重缩放学生梯度**:在学生生成的 rollout 上,计算由验证器(verifier)驱动的策略梯度 gt := A_t ∇(zt) log πθ(yt | s_t) 。将其相对于 d_t 分解为投影分量 Proj(dt)(g_t) 与正交分量 g_t^perp 。修正后的梯度为:
    g_t := (1+λ_t) · Proj
    (d_t)(g_t) + g_t^perp
  • **不对称对齐调度**:正向对齐( u_t ≥ 0 ,学生与教师同向)立即以强度 λ 放大;负向对齐( u_t < 0 ,验证器支持学生偏离教师)通过 warm-up 逐步激活,以避免早期弱 rollout 带来的噪声。 —- ### 3. 关键理论特性 - **平稳点不变性**:对于 λ_t ≥ 0 ,有 g_t = 0 iff g_t = 0 。这意味着 OPRD **不改变 RL 优化目标的平稳点**,学生的性能上限由验证器与其自身容量决定,而非被弱教师限制。 - **一阶对齐增益**: langle g_t, g_t rangle = |g_t|_2^2 + λ_t u_t^2 ≥ |g_t|_2^2 ,保证每一步进展不小于原始梯度。 —- ### 4. 实验验证 | 实验设置 | 核心结果 | |—-|—-| | **连续模型迁移(4B→8B)** | OPRD 达到教师水平所需更新比 GRPO 少 **33–67%**,早期检查点高 **22.7** 个百分点,最终显著超越教师;而 OPD 在教师水平附近饱和。 | | **多教师整合(4个4B→1个8B)** | OPRD 比 Mix-RL 快 **55%** 达到专家水平,最终平均 Pass@1 达 **58.77**,同时超越所有四位专家,无跨任务折损。 | | **强到弱蒸馏(8B→1.7B/0.6B)** | OPRD 依然优于 OPD 和 KDRL,证明其有效性**不依赖**“教师弱、学生强”的容量顺序。 | | **与其他弱到强方法对比** | 相较于 W2SR-P、S2L-PO、Direct-OPD、W2S-OPD 等,OPRD 在平均性能上分别领先 **6.6–23.0** 分。 | | **行为分析** | OPRD 学生的响应风格更接近纯 RL 训练的学生,而非弱教师;在 token 级别可选择比教师更直接、更优的推理路径。 | —- ### 5. 核心结论 OPRD 通过将弱教师的**策略偏移方向**融入学生**自身的验证器驱动优化**,实现了“**教师指导加速,验证器驱动超越**”。它在不引入额外优化目标、不转移教师容量天花板的前提下,为跨代模型能力迁移与多领域专家整合提供了一条高效且可扩展的路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Youngrok Park,Sangmin Bae,Hojung Jung,Jongwoo Ko,Yunseon Choi,Young Jin Kim,Pashmina Cameron,Aaron Courville,Se-Young Yun

Categories:

PDF URL: https://arxiv.org/pdf/2609.08798.pdf

Arxiv URL: https://arxiv.org/abs/2609.08798

Arxiv ID: 2609.08798

CoolPaper URL: https://papers.cool/arxiv/2609.08798

Published: 2026-09-10T01:26:52.119Z

Updated: 2026-09-10T01:26:52.119Z


5. DriveZero: End-to-End Driving Beyond Human Demonstrations

Abstract:Most end-to-end autonomous-driving systems learn by imitating human driving logs, leaving their learned behavior constrained by the quality and behavioral coverage of the recorded trajectories. This report presents DriveZero, an end-to-end system that learns driving behavior beyond human demonstrations. It decomposes driving into a perception model and an action model, pretrains each in the regime best suited to it, and combines them into one end-to-end planner. The two models call for different learning recipes: perception must understand the world, and benefits from massive and diverse visual data; action must interact with it, and requires closed-loop feedback. On the action side, we introduce DriveRL, a mixed-agent closed-loop reinforcement-learning framework. It converts real driving logs into interactive worlds, where a privileged teacher policy is trained with PPO through closed-loop rollouts. For the perception model, DriveVFM consolidates multiple frozen vision foundation models, including DINOv3, SigLIP2, SAM and Depth Anything V2, into a single backbone from raw images alone, requiring no task-specific annotations. DriveZero then unifies the two: a camera-only planner that distills the frozen DriveRL teacher through its rolled-out trajectories. The goal-conditioned teacher can moreover be queried under augmented driving intents, yielding diverse, goal-consistent supervision that logged data cannot provide. On nuPlan, DriveRL with value-guided test-time action search achieves a mean score of 93.57 across the Val14, Test14-hard, and Test14-random community splits in both non-reactive and reactive modes, exceeding the Log-Replay expert on all three splits. DriveZero achieves state-of-the-art performance on NAVSIMv1, NAVSIMv2 and the closed-loop HUGSIM benchmark without any human trajectory supervision.

中文摘要

摘要:大多数端到端自动驾驶系统通过模仿人类驾驶日志进行学习,这使得它们的学习行为受到记录轨迹的质量和行为覆盖范围的限制。本报告介绍了DriveZero,一个能够超越人类示范学习驾驶行为的端到端系统。它将驾驶行为分解为感知模型和动作模型,在最适合各自的环境中进行预训练,然后将它们结合成一个端到端规划器。两个模型需要不同的学习方法:感知模型必须理解世界,并且受益于大量且多样化的视觉数据;动作模型必须与世界进行交互,并且需要闭环反馈。在动作方面,我们引入了DriveRL,一个混合智能体闭环强化学习框架。它将真实驾驶日志转换为交互式世界,在该世界中,通过闭环展开,使用PPO训练一个特权教师策略。对于感知模型,DriveVFM将多个冻结的视觉基础模型整合,包括DINOv3、SigLIP2、SAM和Depth Anything V2,仅通过原始图像构建单一主干网络,无需任务特定标注。随后,DriveZero将二者统一:一个仅依赖摄像头的规划器,通过其展开的轨迹蒸馏冻结的DriveRL教师策略。此外,可以在增强的驾驶意图下查询目标条件教师,从而产生多样且与目标一致的监督,这是日志数据无法提供的。在nuPlan上,通过价值引导的测试时动作搜索,DriveRL在Val14、Test14-hard和Test14-random社区分区中的非反应模式和反应模式下平均得分达到93.57,超过所有三个分区的Log-Replay专家。DriveZero在NAVSIMv1、NAVSIMv2以及闭环HUGSIM基准上,在无需任何人类轨迹监督的情况下,实现了最先进的性能。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*端到端自动驾驶系统受限于人类驾驶日志监督\*\*的核心问题。 现有基于行为克隆(Imitation Learning)的方法将记录的人类轨迹作为唯一的监督来源,导致学习到的行为存在根本性约束: - \*\*行为覆盖不足\*\*:每个日志场景只包含单一实现轨迹,即使多种动作都有效,模型也只能复制人类驾驶员的单一选择; - \*\*安全关键状态缺失\*\*:危险偏差和恢复 maneuvers 在日志中极为罕见,且策略自身诱导的状态在离线数据中完全不存在; - \*\*分布外误差累积\*\*:一旦策略偏离演示分布,错误会迅速复合(distributional shift / covariate shift)。 为突破上述瓶颈,论文提出了 \*\*DriveZero\*\*,一个将驾驶分解为感知与动作、并分别在最适宜的学习机制中预训练的端到端系统: | 模块 | 学习机制 | 核心功能 | |------|----------|----------| | \*\*DriveRL\*\* (动作模型) | 混合智能体闭环强化学习 (PPO) | 在由真实日志构建的交互世界中从头训练特权教师策略,通过闭环反馈优化驾驶行为,超越日志演示 | | \*\*DriveVFM\*\* (感知模型) | 多教师特征蒸馏 (无任务标注) | 将 DINOv3、SigLIP2、SAM、Depth Anything V2 等冻结视觉基础模型蒸馏为单一驾驶骨干网络,从原始图像恢复语义、几何与空间结构 | | \*\*DriveZero\*\* (统一规划器) | 教师轨迹蒸馏 + 目标增强 | 以相机为唯一输入,通过赢家通吃 (Winner-Takes-All) 蒸馏将 DriveRL 教师的行为迁移至可部署的视觉策略;利用目标条件特性生成多样化、目标一致的增强监督 | 具体而言,该系统解决了以下三个关键子问题: 1. \*\*如何在不依赖人类轨迹的情况下学习高质量驾驶行为?\*\* 通过 DriveRL 的闭环强化学习框架,将 nuPlan 日志转换为交互世界,训练特权策略直接优化纵向加速度和转向角速率,其性能在 nuPlan 六个闭环测试拆分上均超越 Log-Replay 专家。 2. \*\*如何在不使用检测/分割/深度等任务标注的情况下获得强大的驾驶视觉表征?\*\* 通过 DriveVFM 的聚合蒸馏,将异构视觉基础模型的互补能力(空间结构、开放词汇语义、边界敏感特征、几何线索)整合为统一骨干,训练数据可自由混合网络规模图像与驾驶场景。 3. \*\*如何将特权教师的行为有效迁移至仅依赖相机的端到端策略?\*\* 通过目标增强的轨迹蒸馏,DriveZero 不仅在单帧上回归教师 rollout,还能对同一场景查询不同导航意图,生成日志数据无法提供的反事实监督,从而在 NAVSIMv1、NAVSIMv2 和 HUGSIM 上实现无需人类轨迹监督的最先进性能。 Q2: 有哪些相关研究? 根据论文第4节(Related Work),相关研究主要分布在以下三个方向: ### 1. 闭环强化学习用于自动驾驶(Closed-Loop RL for Driving) 这类研究关注如何让策略从自身动作诱导的状态中学习,而非仅模仿固定专家轨迹: - \*\*Urban Driver\*\*

65
:在日志初始化的城市场景中使用策略梯度训练驾驶策略。 - **BC-SAC**
53
:结合模仿学习与强化学习,提升安全关键场景中的鲁棒性。 - **CarPlanner**
97
:通过一致的自回归 Rollout 使大规模模型无关的 RL 训练成为可能。 - **CaRL**
29
:证明可扩展的模拟与简单奖励足以实现有效的策略优化。 - **PlannerRFT**
36
:对模仿预训练的扩散规划器进行高效的闭环 RL 微调。 - **基于世界模型的方法**:如 Think2Drive
38
、AdaWM
80
与 Raw2Drive
92
,在潜在世界模型中学习与探索以降低交互成本。 - **多智能体自博弈(Self-Play)**:GigaFlow
14
通过大规模自博弈获得无需人类数据的可靠驾驶策略;SPICED
13
则利用少量人类数据正则化自博弈行为。 ### 2. 视觉基础模型用于自动驾驶(Visual Foundation Models for Driving) 这类研究探索如何从通用或驾驶特定的视觉预训练中获取可迁移表征: - **通用视觉表征**:包括 ImageNet 监督

63
、自监督 DINO 系列目标
4, 57, 71
、以及视觉-语言对齐(如 SigLIP
96
、SigLIP2
78
)。 - **驾驶特定预训练**:如 BEVContrast
64
、Visual Point Cloud Forecasting
91
等,设计面向自动驾驶传感器数据的自监督目标;还有几何导向预训练(如 Pseudo-LiDAR 方法
58, 87
)将三维结构注入视觉表征。 - **多教师知识聚合**:**RADIO**
60
提出将多个冻结视觉基础模型的表征通过聚合蒸馏(agglomerative distillation)整合为单一通用骨干,并引入 PHI Standardization (PHI-S)
59
平衡异构教师特征;DriveVFM 继承了这一范式,将 DINOv3
71
、SigLIP2
78
、SAM
35
与 Depth Anything V2
90
蒸馏为面向驾驶的专用骨干。 ### 3. 端到端自动驾驶(End-to-End Autonomous Driving) 这类研究涵盖从行为克隆到交互式视觉策略迁移的多种范式: - **基于行为克隆(BC)的方法**:大部分现有系统通过模仿人类日志训练,包括条件模仿学习

11
、统一感知-规划架构(如 UniAD
28
、VAD
31, 32
)、以及多模态轨迹生成与选择(如 Hydra-MDP
42
、DiffusionDrive
45
、DriveSuprim
93
、DrivoR
34
等)。这些方法的监督信号通常仍局限于单条记录的人类轨迹。 - **特权教师到视觉策略的迁移**: - **ROACH**
100
:将 CARLA 中的 RL 教练策略蒸馏为单目视觉策略。 - **TerraTransfer**
86
:将视觉编码器与向量化自博弈策略对齐,无需专家演示。 - **GigaPixel**
62
:在简化渲染器中通过自博弈 DAgger 训练基于像素的策略。 - **Pictura**
94
:通过高吞吐量渲染直接从透视图像实现大规模自博弈。 - **基于重建世界的 RL/后训练**:如 ReconDreamer-RL
55
、RAD
22
、SimScale
76
等,将视觉策略置于照片级真实感的重建世界中进行强化学习、合成数据训练或后训练优化。 DriveZero 与上述工作的核心区别在于:它**独立预训练动作模型与感知模型**(分别在闭环 RL 与大规模视觉蒸馏的最优机制中),随后通过目标增强的轨迹蒸馏将两者统一为可部署的纯相机策略,无需人类轨迹监督即可在闭环与伪闭环基准上达到最先进性能。 Q3: 论文如何解决这个问题? 该论文通过**解耦感知与动作、分别在最优学习机制中预训练、再通过蒸馏统一为可部署策略**的三阶段范式,解决端到端自动驾驶受限于人类演示的问题。具体技术路径如下: —- ### 1. DriveRL:通过闭环强化学习从零学习特权教师策略 **核心思想**:将真实驾驶日志转化为交互式世界,让策略在闭环中自主探索,从而习得超出日志覆盖范围的驾驶行为。 #### 1.1 混合智能体交互世界(Mixed-Agent Interactive Worlds) 从 nuPlan 日志初始化场景,为背景交通参与者分配独立的行为提供器,支持三种模式共存: - **Log Replay**:按日志回放轨迹; - **规则模型**:如 IDM 跟车模型与前端车辆紧急制动; - **Self-Play**:策略控制的部分背景车辆,暴露自我于更自然的交互中。 运行时通过场景一致性门控处理延迟进入的参与者:仅当自车姿态与日志偏差在 5,m 和 0.35,rad 以内且无碰撞时才释放,避免自车偏离后出现不合逻辑的插入。 #### 1.2 结构化输入与策略网络 - **观测** O_t :包含自车与周围交通参与者(最多 96 个,各 5 帧历史, 5,Hz )、局部向量化地图(最多 256 个 token)及交通灯状态。 - **目标** G_t :双锚点目标点表示(近点与远点),具有排列不变性,通过正弦位置编码嵌入后均值池化。 - **网络**:专用编码器分别嵌入参与者、自车运动学与地图信息;两层交叉注意力聚合参与者上下文,一层 ego-to-map 交叉注意力提取地图上下文;最终通过 MLP 融合并输入策略头。策略共 570 万参数。 #### 1.3 Beta 动作分布与车辆动力学 策略头为归一化纵向加加速度(jerk)与轮胎转向角速率输出独立的 Beta 分布。形状参数通过 softplus(x)+1 约束至 (1, ∞) ,保持单峰并避免极端指令过权重:

α, β > 1
采样动作经仿射变换映射至物理边界(jerk $
-8, 5
,m/s^3 ,转向速率
-0.8, 0.8
,rad/s$),并由运动学自行车模型执行。 #### 1.4 奖励设计与值函数分解 标量奖励为:

rt = h_t + (1 - d_t)[ g_t + (1) / (H)∑(k ∈ K) q(t,k) ]
其中 h_t 为硬安全事件惩罚(如碰撞、驶离道路), d_t 为终止指示, g_t 为一次性到达奖励,$q
(t,k) ∈
0,1
为 6 项软驾驶质量指标(安全、合规、舒适等), H=110 为展开步长。软项通过乘法要求联合满足。 评论网络(critic)被分解为 8 个独立通道(硬事件、目标到达、6 项软标准),各通道经 GAE 分别估计后求和,既保留标量策略目标,又提供结构化的值监督。 #### 1.5 基于值引导的测试时动作搜索(TTS) 推理时,以策略的模态动作为候选 0,并从策略中采样 N-1 个替代首步动作。对每个候选进行 L$ 步短视界闭环评估:首步执行候选动作,后续由策略模态继续;背景交通用恒定速率和加速度模型外推。候选得分:

S(i) = ∑(ell=0)^(L-1) γ^ell prod(u<ell)(1-du) r_ell + γ^L prod(u<L)(1-d_u) V(O_L)
仅当最高得分候选超过模态动作得分达固定裕度 δ 时才替换执行,确保搜索是策略的保守扩展。该过程无需重新训练,通过增加候选数 N 或搜索深度 L 即可在测试时缩放计算量。 —- ### 2. DriveVFM:将多视觉基础模型蒸馏为单一驾驶骨干 **核心思想**:无需检测、分割、车道或深度标注,直接通过匹配冻结基础模型的特征,将异构视觉能力整合为统一表征。 #### 2.1 多教师特征蒸馏 选用四个互补的冻结视觉基础模型作为教师: - **DINOv3**

71
:提供空间结构与视觉对应关系; - **SigLIP2**
78
:提供图像级语义与开放词汇信息; - **SAM**
35
:提供类分割的边界敏感特征; - **Depth Anything V2**
90
:提供几何线索。 架构采用共享 Vision Transformer,为每个教师输出一个汇总 token(summary token),并共享一组空间 patch token。通过轻量级适配器分别对齐各教师的汇总与 patch 表征。监督是非对称的: - DINOv3:监督汇总 + patch token; - SigLIP2:仅监督汇总 token; - SAM:仅监督 patch token; - Depth Anything V2:蒸馏其视觉特征而非深度预测。 损失函数为:
L(DriveVFM) = ∑(k ∈ T) ( λ_k^(∑) L_k^(∑) + λ_k^(patch) L_k^(patch) )
其中汇总特征用余弦距离,patch 特征用均方误差。 #### 2.2 异构特征标准化(PHI-S) 各教师特征的尺度、方差与激活分布差异显著。DriveVFM 对 patch 特征应用 **PHI Standardization (PHI-S)**:离线估计均值与协方差,通过 PCA-Hadamard 旋转均衡各维度方差,并以共享标量重缩放,使所有模型呈现相似的回归目标条件,防止某一教师主导梯度。 #### 2.3 稳定训练与渐进分辨率 - **QK-Clip**:受 Kimi K2

54
启发,在优化器更新后监控各头的最大 pre-softmax 对数值,若超过阈值 1000,则对 Query 与 Key 投影权重施加等比例平方根缩放,避免注意力 logits 过大导致的损失尖峰或发散,同时保障 FP16 部署的数值稳定性。 - **训练 schedule**:第一阶段 256×256 分辨率训练 600K 步;第二阶段 512×512 分辨率训练 200K 步,全局 batch size 2048。 - **数据**:混合 LAION-2B、ImageNet-21K、SA-1B 等通用图像与 OpenDV、nuPlan、Waymo 等驾驶场景,无需任何任务标注。 —- ### 3. DriveZero:将 RL 教师蒸馏为纯相机规划器 **核心思想**:利用日志中每帧配对的多视角图像与结构化状态,将 DriveRL 教师从状态空间展开的轨迹转化为相机策略的监督信号,并通过目标增强生成日志无法提供的反事实驾驶意图。 #### 3.1 架构 - **输入**:当前帧 4 路相机图像、自车运动学、导航指令(与教师共享相同驾驶意图)。 - **编码**:DriveVFM 骨干(冻结,仅微调 rank-32 的 Q/V LoRA)编码各相机图像,输出视觉 token 经 3D 位置编码增强;16 个可学习 register token

16
压缩每相机特征为少量场景 token。 - **解码**:自车运动学与导航指令嵌入为 ego token,与 M=64 条可学习轨迹查询相加;4 层轨迹解码器通过交叉注意力将查询映射为候选轨迹。独立评分解码器将每条候选编码为得分查询,经交叉注意力预测 PDM 的 6 项驾驶质量分量 logits。 #### 3.2 赢家通吃(WTA)轨迹蒸馏 对每帧日志,冻结的 DriveRL 教师接收结构化状态与目标点,在背景交通按日志回放的环境中展开 20 步轨迹 τ_T 。学生生成 M 条候选轨迹 τ_m ,仅最接近教师轨迹的候选参与回归损失:

L_(traj) = min_m dist(τ_m, τ_T)
其中 dist(·,·) 为逐点平均 L1 距离。不同查询因此可捕获不同驾驶模式,选择交由评分分支处理。 #### 3.3 候选评分与 PDM 监督 评分分支预测每条候选的 6 项 PDM 分量(避碰、可行驶区域合规、进度、碰撞时间、舒适、行驶方向合规),使用二元交叉熵损失:

L(score) = (1) / (M) ∑(m=1)^(M) ∑(k=1)^(6) BCE(σ(s(mk)), s_(mk))
候选轨迹在进入评分分支前被 detach,解耦轨迹生成与排序。推理时选择预测聚合得分最高的候选。 #### 3.4 目标增强(Goal Augmentation) 人类日志仅在单一记录路线意图下包含一条实现轨迹。DriveRL 是目标条件的,可在同一场景状态下查询不同导航目标。DriveZero 在生成教师监督前对路线意图与对应导航指令进行增强,使教师产生多样化但目标一致的轨迹。增强后的路线也用于评估学生候选,确保导航指令、教师轨迹与候选评分三者一致。该机制将每个日志场景扩展为多个有效监督目标,直接利用闭环 RL 教师的生成能力弥补日志数据的天花板。 #### 3.5 完整训练目标

L(DriveZero) = λ(traj) L(traj) + λ(score) L_(score)
—- ### 4. 效果总结 通过上述解耦-再统一范式,论文实现了: - **DriveRL** 在 nuPlan 六个闭环测试拆分上均超越 Log-Replay 专家(平均 93.01,测试时搜索达 93.57),证明闭环 RL 可习得超出种子日志的行为; - **DriveZero** 无需任何人类轨迹监督,在 NAVSIMv1 navtest 达到 95.3 PDMS(超越人类驾驶员 94.8),在 NAVSIMv2 navhard 达到 57.1 EPDMS,在 HUGSIM 真实闭环基准零样本达到 46.6 HD-Score,均为最先进水平。 该范式的关键突破在于:**动作学习脱离人类演示的分布约束,视觉预训练脱离昂贵的任务标注,而统一蒸馏通过目标增强进一步突破了日志的单轨迹限制。** Q4: 论文做了哪些实验? 论文在三个主要模块(DriveRL、DriveZero、DriveVFM)及真实部署上进行了系统性实验,涵盖闭环基准评测、测试时计算缩放、消融分析与可视化验证。 ### 1. DriveRL 闭环强化学习实验 #### 1.1 nuPlan 闭环基准评测 在 nuPlan

2
的六个社区拆分上评估:Val14(1,118 场景)、Test14-hard(272 场景)、Test14-random(261 场景),各含非反应式(NR)与反应式(R)模式。评价指标为标准 nuPlan 闭环得分(CLS,0–100)。 - **与现有方法对比**(Table 2):DriveRL 在六个设置上均超越 Log-Replay 专家(无需人类数据),平均得分 93.01;加入价值引导的测试时动作搜索(TTS)后提升至 93.57。同时超过 CaRL、GigaFlow 等同样无需人类数据的 prior 方法。 - **详细指标分解**(Table A5):报告了碰撞、可行驶区域、方向合规、进度、TTC、速度、舒适等子项。 #### 1.2 测试时缩放(Test-Time Scaling) 固定 DriveRL 检查点,仅改变推理时候选动作数量 N (8/16/32/64),搜索深度 L=5 ,切换裕度 δ=0.03 (Table 3)。 - 随着 N 增加,平均得分单调提升, N=64 时达 93.57。 - 最大增益出现在非反应式 Test14 拆分:Test14-hard NR 提升 1.16 分,Test14-random NR 提升 1.43 分。 #### 1.3 自博弈(Self-Play)研究 在混合智能体环境中让策略同时控制自车与最多 10 辆背景车辆(Table A6、A7)。 - 单自车基线与自博弈变体(有无历史丢弃、动力学噪声、前车制动增强)进行对比。 - 最优自博弈配置性能与单自车基线相当(Mean 93.11 vs. 93.01),验证了统一策略的每智能体实现可行,但在 nuPlan 评估协议下未观察到一致优势。 #### 1.4 交通灯输入与奖励消融 在受控 32-GPU 训练设置下: - **输入消融**(Table A8):加入交通灯状态后,六个评估设置得分全面提升(Val14 NR +1.41,Test14-random R +1.65)。 - **奖励与终止消融**(Table A9):添加交通灯违规惩罚将违规率从 3.88% 降至 2.03%,但 aggregate nuPlan 分数下降,说明 aggregate score 未能完全捕捉合规性改善。 #### 1.5 目标锚点布局分析 - **固定检查点灵敏度**(Table A10):默认近-远双锚点与近-近、远-远重复布局对比。远-远布局显著降低所有得分,表明近锚点提供关键的局部引导。 - **训练分布消融**(Table A11):训练时以 1:1 混合单锚点/双锚点采样,对比始终采样双锚点并重复较早或较晚目标。混合分布获得最高平均得分(91.92),较晚目标重复表现最差(89.18)。 —- ### 2. DriveZero 端到端视觉规划器实验 #### 2.1 NAVSIMv1 navtest 伪闭环评测 在 100K navtrain 上训练,使用相机输入,评价 PDM 及其分量(NC、DAC、TTC、Comfort、EP、DDC → PDMS)。 - **主结果**(Table 4):DriveZero 在无人类轨迹监督下达到 94.8 PDMS,超越所有 prior 相机-only 与相机-LiDAR 融合方法。使用 SimScale

76
的 237K OOD 仿真数据扩展后(DriveZero-Scale),提升至 95.3 PDMS,首次在该榜单上超越人类驾驶员(94.8)。 - **特权教师基线**:DriveRL 使用真值结构化输入达 95.8 PDMS。 #### 2.2 NAVSIMv2 navhard 伪闭环评测 评价两阶段 EPDMS 及其安全、合规、进度、规划质量分量(Table 5)。 - DriveZero 在仅 navtrain 上训练达 51.5 EPDMS,超过所有仅在 navtrain 上训练的方法,也超过 RL-Teacher 方法 GigaPixel

62
(50.1)。 - DriveZero-Scale 达 57.1 EPDMS,建立新 SOTA,超越同样使用 SimScale 的 DrivoR-Scale
34
(54.6)与使用真值的 PDM-Closed
17
(56.6)。 #### 2.3 HUGSIM 真实闭环零样本评测 在 KITTI-360、nuScenes、PandaSet、Waymo 重建的场景上测试,无 HUGSIM 微调。 - **主结果**(Table 6):DriveZero-Scale 平均 HD-Score 46.6,在 Easy、Medium、Hard 三个难度上均创 SOTA,较 prior SOTA GigaPixel

62
(38.5)提升 8.1 分。 - 同时报告了路线完成度(RC)与各难度层级得分。 #### 2.4 消融研究(Table 7) 所有消融使用 DriveVFM ViT-S 骨干与 navtrain 数据,在 NAVSIMv1 navtest 上评估: - **视觉骨干对比**:将 DriveVFM 替换为 DA3 Small、DA2 ViT-S、DINOv2 ViT-S、DINOv3 ViT-S。DriveVFM 以 94.41 PDMS 领先,较 DINOv3 ViT-S(93.88)高 0.53 分。 - **教师累加贡献**:以 DINOv3+SigLIP2 为基线(93.69),加入 SAM 提升至 94.10(+0.41),再加入 Depth Anything V2 达 94.41(+0.31),验证互补监督的累积增益。 - **监督来源对比**: - 人类轨迹:93.92 - DriveRL 轨迹:93.61(略低于人类) - DriveRL + 目标增强:94.41(超过人类轨迹 0.49 分,超过 DriveRL-only 0.80 分),证明目标增强是教师监督超越人类监督的关键。 #### 2.5 特征与规划可视化 - **DriveVFM 表征可视化**(Figure 3):通过 PCA 与相对于地面原型的余弦相似度热图,显示 DriveVFM 比 DINOv3 对路面响应更一致,且更能区分长尾障碍物与小目标。 - **与人类驾驶员对比**(Figure 4):DriveZero-Scale 在人类犹豫或停止的场景中更流畅地通过。 - **与 prior SOTA 对比**(Figure 5、6):在 NAVSIM navtest 与 HUGSIM 中,DrivoR-Scale 出现碰撞或驶离可行驶区域时,DriveZero-Scale 保持安全与车道内行驶;在 HUGSIM 中,前车急刹时 DriveZero-Scale 及时减速,对向来车时仅轻微横向调整而非驶上路缘。 —- ### 3. DriveVFM 补充实验(Appendix B) #### 3.1 视觉骨干缩放 对比 DriveVFM ViT-S、ViT-B、ViT-L,以及 DINOv3 ViT-L 作为替代骨干(Table A13)。所有下游设置固定(navtrain、rank-32 Q/V LoRA、无 SimScale)。 - PDMS 从 ViT-S(94.41)→ ViT-B(94.54)→ ViT-L(94.83)单调提升,呈现正缩放趋势。 - DriveVFM ViT-L 亦优于 DINOv3 ViT-L(94.55),尽管后者预训练规模更大。 #### 3.2 QK-Clip 稳定性与 FP16 部署 - **训练稳定性**(Figure A1):对比有无 QK-Clip 的训练损失曲线。QK-Clip 避免损失尖峰,实现更平滑下降与更低终损。 - **FP32 到 FP16 偏差**(Table A14):Baseline 最大 QK logit 达 308,320,FP16 转换后平均绝对误差 0.109,余弦相似度 0.893;QK-Norm 改善至 0.032 / 0.981;QK-Clip 进一步降至 0.004 / 0.999,实现近乎无损的 FP16 部署。 —- ### 4. 真实世界部署验证 在小型车队上部署 DriveRL(Section 3.3): - 使用自车真实驾驶日志训练,启用 Self-Play,无人类演示监督。 - 结构化状态来自自动标注感知真值,并混入录制的车载感知输出作为降级输入,训练时施加广泛域随机化。 - 在密集城市交通的拥挤道路上进行闭环实车演示,验证系统在实际交通中的可行性。 Q5: 有什么可以进一步探索的点? 基于该论文的方法论与实验观察,以下几个方向具有进一步探索的价值: —- ### 1. 从开环蒸馏到闭环视觉策略优化 当前 DriveZero 通过开环蒸馏(在日志帧上离线回归教师轨迹)获得视觉策略,学生从未在闭环交互环境中验证自身行为。论文指出,直接的视觉 RL 因耦合了样本密集型探索与昂贵的视觉仿真而难以扩展。未来工作可探索: - **高吞吐量视觉仿真**:如结合 3D Gaussian Splatting

76, 103
或实时神经渲染,使相机策略能在闭环中进行策略梯度更新或 DAgger 式迭代收集; - **世界模型蒸馏**:将 DriveRL 教师的行为先蒸馏到一个潜空间世界模型(如 Think2Drive
38
、AdaWM
80
),再让视觉策略在该潜空间内执行闭环规划,降低像素级仿真的计算壁垒; - **渐进式特权降级**:设计训练课程,逐步将结构化输入替换为带噪声的视觉特征,而非一次性从真值状态跳变到原始图像。 —- ### 2. 测试时计算扩展(Test-Time Compute Scaling)的深度探索 论文在特权教师上验证了价值引导的测试时动作搜索(TTS),但未将该机制迁移至相机-only 的 DriveZero。未来可研究: - **学生端的推理时搜索**:在 DriveZero 的轨迹提案空间中引入基于学习价值函数或 PDM 评分的重排序机制,使视觉策略在部署时通过增加推理计算而非重新训练来提升性能; - **生成式提案扩展**:结合扩散模型或流匹配(flow matching)在推理时生成大量候选轨迹,利用 DriveRL 训练的价值函数进行快速评估,实现视觉策略的 test-time scaling。 —- ### 3. 多智能体交互与自博弈的深化 论文发现自博弈(Self-Play)在 nuPlan 标准评估下收益有限,因该基准的背景交通由 IDM 驱动,不奖励更自然的交互行为。未来可探索: - **更具交互性的评估协议**:在支持真实响应式交通的基准(如 NAVSIMv2、HUGSIM)上系统评估 Self-Play 对相机策略迁移的影响; - **异构多智能体训练**:不仅将单一策略部署于所有背景车辆,而是训练多样化的行为提供者(保守型、激进型、不确定型),提升 ego 策略对长尾交互场景的鲁棒性; - **社交意图推理**:将其他交通参与者的预测意图(如变道、让行)显式编码为结构化输入或增强目标,超越当前纯几何目标点的 conditioning 方式。 —- ### 4. 视觉表征的动态更新与时空建模 DriveVFM 通过蒸馏**冻结**的基础模型获得静态视觉表征,未在驾驶数据上端到端微调教师网络。未来方向包括: - **可微教师更新**:探索在保持 DriveVFM 骨干可训练的情况下,以辅助梯度更新基础模型权重,使其更适配驾驶域的长尾目标; - **时序与视频基础模型**:当前 DriveVFM 仅处理单帧图像。引入视频预训练模型(如视频 DINO、视频语言模型)进行时序蒸馏,可显式编码运动、遮挡与动态场景演化; - **3D 几何感知的预训练**:除深度估计外,引入 occupancy、表面法向、光流等几何监督,强化 BEV 空间推理与遮挡处理能力。 —- ### 5. 奖励学习与安全约束的形式化 DriveRL 依赖手工设计的奖励函数(硬安全惩罚 + 软驾驶质量指标)。这可能导致: - **奖励篡改(reward hacking)**:在未见场景中优化代理目标而非真实安全; - **长尾安全事件覆盖不足**:罕见危险状态仍难以通过随机探索覆盖。 未来可探索: - **基于人类偏好的奖励学习(RLHF)**:利用人类接管数据或排名反馈学习隐式奖励,减少对启发式质量函数的依赖; - **形式化安全层**:将控制屏障函数(CBF)或可达性分析作为硬约束嵌入策略优化,确保 RL 探索始终满足安全边界; - **对抗式场景生成**:训练对手智能体或环境生成模型主动制造危险场景,强迫策略学习恢复行为(recovery maneuvers)。 —- ### 6. 跨模态蒸馏与传感器鲁棒性 DriveZero 目前仅使用相机输入。在真实部署中,系统常面临传感器降级(雨雾、眩光、相机遮挡)。未来工作可研究: - **LiDAR-到-相机知识蒸馏**:利用 LiDAR 提供的精确几何作为额外教师,蒸馏到纯视觉学生,增强深度与遮挡感知; - **多模态融合策略**:在保持端到端可微的前提下,探索相机与廉价雷达/超声波的后期融合,而非仅依赖多视角相机; - **传感器缺失的鲁棒训练**:在训练时随机遮蔽相机视图或添加域随机化,验证系统在传感器故障时的优雅降级(graceful degradation)。 —- ### 7. 长程规划与时间一致性 当前 DriveZero 预测 20 步(4 秒)轨迹,对于复杂城市交叉口或高速公路匝道可能不足。可进一步探索: - **分层规划器**:将 DriveRL 教师扩展为高层路线策略(秒级)与低层控制策略(毫秒级)的分层结构,蒸馏时保持层级对应; - **显式时间一致性损失**:在轨迹解码器中引入相邻时间步的运动学平滑约束,减少长期闭环中的抖动与不一致; - **记忆与地图先验**:利用在线高清地图或矢量地图记忆,增强在复杂拓扑(如多车道汇入、环岛)中的长程决策能力。 Q6: 总结一下论文的主要内容 该论文提出了 **DriveZero**,一种通过解耦感知与动作、并分别在最优学习机制中预训练来实现**超越人类演示的端到端自动驾驶**的系统。 ### 1. 研究背景与核心问题 现有端到端自动驾驶系统主要依赖**行为克隆**(模仿人类驾驶日志),导致学习到的行为受限于日志的质量与覆盖范围: - 每个场景仅包含单一实现轨迹,忽略其他合理驾驶选择; - 缺乏安全关键偏差与恢复 maneuvers 的样本; - 策略自身诱导的分布外状态在离线数据中完全缺失,导致误差累积。 ### 2. 方法论:解耦预训练与统一蒸馏 论文将驾驶任务分解为**动作模型**与**感知模型**,各自在最适合的范式中预训练,最后通过蒸馏统一为可部署的相机-only 策略。 #### 2.1 DriveRL:闭环强化学习特权教师 - **混合智能体交互世界**:将 nuPlan 日志转换为交互式仿真环境,背景交通可由日志回放、IDM 规则模型或自博弈策略共同驱动。 - **策略架构**:基于结构化状态(自车/参与者/地图/目标点)的 570 万参数 Transformer,输出纵向加加速度与转向角速率的 Beta 分布。 - **奖励设计**:结合硬安全事件惩罚、目标到达奖励与六项软驾驶质量指标的联合标量奖励;评论网络(critic)采用八通道分解以稳定值估计。 - **测试时动作搜索(TTS)**:推理时采样多个候选首步动作,通过短视界闭环 rollouts 与价值函数重排序,以额外计算换取策略提升,无需重新训练。 #### 2.2 DriveVFM:多视觉基础模型蒸馏 - **异构教师聚合**:将冻结的 DINOv3(空间结构)、SigLIP2(语义)、SAM(边界)与 Depth Anything V2(几何)蒸馏为单一 Vision Transformer 骨干。 - **无需任务标注**:监督完全来自教师模型的特征匹配,训练数据可自由混合网络级通用图像与驾驶场景。 - **PHI 标准化(PHI-S)**:对各教师的 patch 特征进行离线 PCA-Hadamard 旋转与重缩放,平衡异构特征的梯度贡献。 - **QK-Clip**:通过约束注意力 logits 上限稳定训练,并支持近乎无损的 FP16 部署。 #### 2.3 DriveZero:相机-only 规划器 - **架构**:DriveVFM 编码多视角相机图像(冻结骨干 + LoRA 适配),经 3D 位置编码与可学习 register tokens 压缩为场景 token;Transformer 解码器生成 64 条轨迹提案,独立评分子网络预测 PDM 质量分量。 - **赢家通吃(WTA)蒸馏**:每帧由冻结的 DriveRL 教师展开轨迹,学生仅回归最接近教师的提案,使不同查询覆盖多模态驾驶行为。 - **目标增强(Goal Augmentation)**:利用教师的目标条件特性,对同一场景查询不同导航意图,生成日志无法提供的反事实、目标一致的监督,显著扩展训练信号多样性。 ### 3. 实验与主要结果 | 模块 | 基准 | 关键结果 | |———|———|—————| | **DriveRL** | nuPlan Val14/Test14-hard/Test14-random (NR/R) | 平均 93.01,超越 Log-Replay 专家;TTS ( N=64 ) 提升至 **93.57** | | **DriveZero** | NAVSIMv1 navtest | **95.3 PDMS**(DriveZero-Scale),超越人类驾驶员 (94.8),无需人类轨迹监督 | | **DriveZero** | NAVSIMv2 navhard | **57.1 EPDMS**(DriveZero-Scale),建立新 SOTA | | **DriveZero** | HUGSIM (零样本) | **46.6 HD-Score**(DriveZero-Scale),超越 prior SOTA 8.1 分 | **消融验证**: - DriveVFM 较单一 DINOv3 骨干提升 0.53 PDMS,且各教师模型贡献累加; - DriveRL 轨迹 + 目标增强 (94.41) 显著优于仅人类轨迹 (93.92) 或仅 DriveRL 轨迹 (93.61); - 视觉骨干从 ViT-S 到 ViT-L 呈现正缩放趋势。 ### 4. 核心贡献 - 提出**闭环 RL 动作模型**(DriveRL),从零训练即可超越种子日志中的专家行为; - 提出**无标注视觉预训练框架**(DriveVFM),将异构基础模型的互补能力整合为统一驾驶表征; - 通过**目标增强的轨迹蒸馏**将两者统一为相机-only 规划器,在多个闭环与伪闭环基准上实现无需人类监督的最先进性能,验证了端到端驾驶超越人类演示的可扩展路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Hao He,Chengcheng Hu,Zirun Su,Heng Zhang,Haisong Liu,Jinke Li,Haochen Tian,Zhenwei Shen,Hongyang Li,Zhichao Li,Yunchen Yang,Bochao Huang,Siyu Zhang,Kuangye Chen,Xiongjie Zhang,Wentao Dai,Hengchen Dai,Siyuan Liu,Zehao Huang,Naiyan Wang

Categories:

PDF URL: https://arxiv.org/pdf/2609.06055.pdf

Arxiv URL: https://arxiv.org/abs/2609.06055

Arxiv ID: 2609.06055

CoolPaper URL: https://papers.cool/arxiv/2609.06055

Published: 2026-09-10T01:26:52.071Z

Updated: 2026-09-10T01:26:52.071Z


6. OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

Abstract:World-Action Models inherit world knowledge from video-generative priors, and channel it into executable control signals through embodied experience. Existing systems, however, are monolithic: the generative backbone, visual representation, architecture, information flow, inference procedure, and training data are tightly coupled, obscuring which design choices matter and why. We introduce OpenWAM, an open research stack that turns world-action pretraining into a controlled experimental program. OpenWAM-Infra factorizes the WAM design space into composable modules with unified training, inference, deployment, and evaluation. On this substrate, OpenWAM-Study examines three questions through controlled experiments: what to inherit, how world and action learning interact, and how their synergy scales; and distills three principles: upstream knowledge transfers through a sufficiently capable generative backbone and a compact, information-rich latent space; world-action synergy requires dedicated action capacity, explicit world-to-action information flow, and synchronized joint denoising; and embodied pretraining principally improves out-of-domain generalization, with one-stage co-training over egocentric and robot data integrating world coverage and action grounding. Composing these principles, we build OpenWAM-{\alpha}, an open WAM pretrained on roughly 6,400 hours of egocentric human and robot data and evaluated across simulation and real-world benchmarks. Across the eight simulation benchmarks and the real-robot experiments, which together span embodiments from single-arm and bimanual manipulation to dexterous hands, OpenWAM-{\alpha} delivers consistently excellent performance, sustaining its top-tier standing from simulation to the physical world. We release the full stack, including infrastructure, evaluation protocols, pretrained models, and data recipes, to facilitate future research.

中文摘要

摘要:世界-动作模型(World-Action Models, WAM)从视频生成的先验中继承世界知识,并通过具身经验将其转化为可执行的控制信号。然而,现有系统是单块结构的:生成主干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合,这使得难以看清哪些设计选择重要以及原因。我们提出了 OpenWAM,一个开放的研究栈,它将世界-动作预训练转化为可控的实验程序。OpenWAM-Infra 将 WAM 设计空间分解为具有统一训练、推理、部署和评估的可组合模块。在此基础上,OpenWAM-Study 通过受控实验探讨三个问题:继承什么内容、世界学习与动作学习如何相互作用及其协同如何扩展;并提炼出三条原则:上游知识通过足够强大的生成主干和紧凑且信息丰富的潜在空间进行传递;世界-动作协同需要专门的动作能力、明确的世界到动作的信息流,以及同步的联合去噪;具身预训练主要改善域外泛化,通过对自我视角与机器人数据的一阶段共同训练整合了世界覆盖和动作落地。结合这些原则,我们构建了 OpenWAM-{α},这是一个公开的 WAM,在约 6,400 小时的自我视角人类和机器人数据上进行预训练,并在仿真与真实世界基准上进行评估。在八个仿真基准和真实机器人实验中,这些实验涵盖了从单臂与双臂操作到灵巧双手等不同的具身动作,OpenWAM-{α} 始终表现卓越,从仿真到现实世界均保持领先地位。我们发布了完整栈,包括基础设施、评估协议、预训练模型和数据方案,以促进未来研究。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*世界–动作模型(World–Action Models, WAMs)在设计与扩展过程中缺乏系统性和可解释性\*\*的问题。具体而言,现有WAM系统通常以单体(monolithic)形式构建,其生成骨干、视觉表示、模型架构、跨模态信息流、推理调度与训练数据等组件高度耦合,导致研究者难以判断哪些设计选择真正重要、为何有效,以及它们在不同领域和具身形态上的泛化行为。 为化解这一困境,论文围绕三个核心问题展开系统性探索: - \*\*继承什么世界知识?\*\* 即WAM应如何从视频生成先验与视觉表示中有效继承世界动态知识。 - \*\*世界学习与动作学习如何产生协同?\*\* 即如何在世界预测与动作生成之间建立有效的信息流动与容量分配,使二者相互促进而非简单拼接。 - \*\*协同效应如何跨域扩展?\*\* 即如何将这种协同从单一机器人任务推广到包含人类自我中心视频、真实机器人轨迹与仿真数据的多域、多具身预训练中。 为此,论文提出了 \*\*OpenWAM\*\*,一个开放的研究栈,通过以下三层架构将WAM开发转化为可控实验程序: 1. \*\*OpenWAM-Infra\*\*:将WAM设计空间因子化为可互换的视觉编码器、流骨干网络与可见性注意力掩码等模块化组件,并提供统一的训练、推理、部署与评估接口; 2. \*\*OpenWAM-Study\*\*:基于该基础设施开展对照实验,回答上述三个问题,提炼出“强生成骨干 + 紧凑信息丰富的隐式空间”、“显式世界到动作的信息流 + 同步联合去噪”、“单阶段人类与机器人数据共训”等设计原则; 3. \*\*OpenWAM-α\*\*:将上述原则实例化为一个在大规模异构数据上预训练的开源WAM,并在仿真与真实机器人平台上验证其有效性与泛化能力。 Q2: 有哪些相关研究? 根据论文第2节(Related Work),相关研究主要分布于以下三个方向: ### 1. 世界–动作模型(World–Action Models, WAMs) - \*\*世界模型(World Models)\*\* 经典世界模型从观测中学习预测结构,以支持规划(Zhou et al., 2024; Maes et al., 2026; Huang et al., 2026)、基于模型的强化学习(Hafner et al., 2019; M. Moerland et al., 2023)以及策略评估(Huang et al., 2025; Wang et al., 2026b)。 - \*\*WAMs 与 VLAs 的区别\*\* 相较于主要从视觉–语言预训练中继承语义知识的 VLA 模型(Brohan et al., 2023; Kim et al., 2024; Black et al., 2024),WAMs(Ye et al., 2026c; Pai et al., 2025; Li et al., 2026b)选择从\*\*视频生成先验\*\*初始化,使动作学习直接建立在具备丰富视觉动态先验的模型之上(Wan et al., 2025; Ali et al., 2025)。 - \*\*现有瓶颈\*\* 当前 WAM 系统多为\*\*单体(monolithic)\*\*架构,生成骨干、训练流程、数据配方与采样调度高度耦合,导致难以辨识各组件的真实作用与跨域泛化行为。 ### 2. 通用机器人策略学习的开放研究生态 - \*\*开源 VLA 基线与平台\*\* - \*\*OpenVLA\*\*(Kim et al., 2024)建立了开源预训练权重基线。 - \*\*StarVLA\*\*(Community, 2026)提供了模块化、可组合的 VLA 开发平台。 - \*\*StarVLA-α\*\*(Ye et al., 2026b)以极简设计补充了开源预训练模型。 - \*\*XPolicyLab\*\*(Community et al., 2026)贡献了统一的策略评估与部署标准。 - \*\*WAM 领域的生态空白\*\* 上述工作显著降低了 VLA 社区的开发门槛,但 WAM 领域尚缺乏类似的模块化基础设施与开放预训练模型,难以支撑可控的科学研究与社区复现。 ### 3. 模型设计的科学化理解 - \*\*模型设计作为经验科学\*\* growing line of work 将复杂系统分解为可控变量,测试机制、提炼配方并验证其可扩展性(Allen-Zhu, 2026; Karras et al., 2022; McKinzie et al., 2024; Liu et al., 2022; Wen et al., 2026)。 - \*\*多模态预训练的系统研究\*\* - \*\*Cambrian-1\*\*(Tong et al., 2024)与 \*\*Beyond Language Modeling\*\*(Tong et al., 2026)系统探讨了视觉表示、模态专属容量、数据组成与统一预训练。 - \*\*Towards Physics of Multimodal Pretraining\*\*(Han et al., 2026)进一步隔离了知识流、模态协同/竞争以及模态统一时机。 - \*\*机器人学习中的机制研究\*\* - \*\*Action Chunking\*\*(Simchowitz et al., 2025; Zhang et al., 2025b; Lazzati et al., 2026)与 \*\*Generative Control Policies\*\*(Pan et al., 2026)重塑了社区对行为克隆与生成式控制的理解。 - 在数据与系统层面,\*\*Large Behavior Models\*\*(Barreiros et al., 2026)、\*\*LBM co-train\*\*(Lin et al., 2026a)、\*\*StarVLA-α\*\*(Ye et al., 2026b)与 \*\*OpenHLM\*\*(Hu et al., 2026)通过对照实验研究多任务迁移、异质监督、动作设计与具身接口。 - \*\*OpenWAM 的定位\*\* OpenWAM 将上述“分解–控制–验证”的方法论引入 WAM 领域:OpenWAM-Infra 构建实验基板,OpenWAM-Study 围绕继承、协同与扩展提出科学问题,OpenWAM-α 则在异构多域预训练下验证所得配方。 Q3: 论文如何解决这个问题? 论文通过构建 \*\*OpenWAM\*\* 这一开放研究栈,将世界–动作建模从高度耦合的单体实现转化为可控的实验程序。解决方案由三个相互支撑的层次组成,分别对应\*\*基础设施解耦\*\*、\*\*设计原则提炼\*\*与\*\*规模化验证\*\*。 --- ### 1. OpenWAM-Infra:模块化基础设施 为消除现有系统中模型、训练、部署与评估的紧耦合,论文将 WAM 的设计空间因子化为可组合模块,并通过严格单向依赖的接口实现“即插即用”。 - \*\*可组合模型架构 C(E, S, M) \*\* 任意 WAM 被拆解为三个正交模块: - \*\*视觉编码器 E \*\*:支持重构式编码器(如 Wan2.2-VAE、FLUX.2-VAE)与表征式编码器(如 DINOv3、V-JEPA 2.1),并可通过 S-VAE 进行维度压缩; - \*\*流骨干网络 S \*\*:支持视频生成骨干(如 Wan2.1、Cosmos 系列)、动作骨干(ActionDiT)及可选的 VLM 骨干; - \*\*可见性注意力掩码 M \*\*:通过 M = (M_(V arrow V), M_(V arrow A); M_(A arrow V), M_(A arrow A)) 精确控制跨模态信息流,支持 Mutual、Action-Sees-Video、Video-Sees-Action、Isolated 四种模式。 基于上述模块,论文实现了六大架构变体,横跨单系统(Vanilla / MoE)、双系统(Joint Self-Attention / Joint Cross-Attention / IDM)与三系统(Tri-System)。 - \*\*统一训练运行时\*\* 所有架构共享同一训练器与同一联合流匹配目标:

L = λv E(tv,ε_v)![ w(t_v), |v_z - (z - ε_v)|_2^2 ] + λ_a E(ta,ε_a)![ w(t_a), |m odot (v_a - (a - ε_a))|_2^2 ]
其中视频与动作噪声层级 t_v, t_a 独立采样,覆盖完整的联合噪声平面,使任意推理调度均落在分布内。 - **统一部署运行时** 单一策略服务器通过自包含检查点重建任意架构,并将推理模式(同步 / 异步)与去噪调度(同步 / 方差偏移 / 线性偏移)正交化,支持:
f
α(s) = (α s) / (1 + (α - 1)s), quad ho(s) = max! (s - o) / (1 - o),, 0
同时集成 DiT 速度缓存、torch.compile、提示词嵌入缓存与视频解码跳过等加速手段。 - **统一评估协议** 仿真与真实基准通过 WebSocket 以标准化客户端–服务器架构接入,所有观测预处理与动作反归一化均在服务端完成。论文还定义了 **80-D 统一动作空间**:
u = Scatter
π(Norm(a)), quad a = Norm^(-1)(Gatherπ(u))
使跨具身训练与评估成为可能。 —- ### 2. OpenWAM-Study:对照实验与原则提炼 在模块化基础设施之上,论文通过严格对照实验回答三个核心科学问题,并将证据凝结为可复用的设计原则。 - **问题一:应继承何种世界知识?** 实验发现,上游知识迁移的有效性取决于两个因素: 1. **生成骨干的容量**:在 Wan2.1-VACE-1.3B 到 Wan2.1-I2V-14B 的对比中,WAM 性能随视频生成骨干规模单调提升; 2. **视觉隐空间的紧凑性与信息丰富性**:通过 S-VAE 压缩后的表征式编码器(DINOv3 w/ S-VAE、V-JEPA 2.1 w/ S-VAE)可达到甚至超越重构式编码器的性能。 - **问题二:世界与动作学习如何产生协同?** 实验从三个层面给出答案: 1. **架构容量**:从单系统到双系统再到三系统,性能持续提升;双系统中 **Joint Self-Attention** 最优; 2. **训练时信息流**:必须允许动作流“看见”视频流(Action Sees Video),世界到动作的显式信息流是必要的; 3. **推理时去噪**:同步联合去噪(Sync)显著优于任何异步领先/滞后调度,表明协同发生在表示层面,而非“先规划再反解”的隐式两阶段推理。 - **问题三:跨域知识如何整合?** 在 600 小时数据预算下对比多种预训练策略后,发现: 1. 具身预训练的主要增益体现在 **OOD 泛化**(Clean→Randomized 提升达 +12.12pp),而非 ID 拟合; 2. 机器人数据强化动作落地,自我中心视频扩展世界覆盖,**单阶段共训(ego + robot co-train)** 效果最佳; 3. 预训练规模扩大后,**双向互见(Mutual)** 注意力成为最优选择,因为在充足数据下世界与动作可建立可靠的双向对应。 这些发现被汇总为一张可向前携带的“配方表”,直接指导后续模型构建。 —- ### 3. OpenWAM-α:原则的规模化验证 最后,论文将上述原则组合为 **OpenWAM-α**,在真实的大规模异构数据上验证其是否成立。 - **架构实例化** 采用 Wan2.2-TI2V-5B 作为视频骨干,1B 参数的 ActionDiT 作为动作骨干,通过 Joint Self-Attention 与 Mutual Mask 耦合,使用 Wan2.2-VAE 作为视觉编码器。 - **大规模预训练** 在 **518.5M 帧(约 6,369 小时)** 的自我中心人类视频与机器人数据上进行单阶段端到端共训,覆盖 21 种具身形态,动作监督通过 80-D 统一空间与有效性掩码 m 实现。 - **跨域评估** 在 8 个仿真基准(涵盖单臂、双臂、移动、灵巧手等 5 类具身)与 3 类真实机器人平台(Franka-Research-3 单臂、RoboDojo 双臂、Wuji 灵巧手)上评估,证明该配方在从仿真到物理世界、从分布内到分布外的迁移中均保持顶尖性能。 通过“解耦基础设施 → 控制实验 → 规模化验证”这一闭环,论文不仅构建了一个高性能的预训练模型,更重要的是建立了一套可复现、可扩展、可社区共享的 WAM 科学研究框架。 Q4: 论文做了哪些实验? 论文围绕“世界–动作模型(WAM)应如何继承世界知识、如何实现世界与动作的协同、以及如何跨域扩展”这三个核心问题,在 **OpenWAM-Study** 和 **OpenWAM-α** 两个阶段开展了系统的对照实验与大规模评估。具体实验如下: —- ### 一、OpenWAM-Study:设计原则的受控实验 所有对照实验均以 **RoboTwin2.0** 为主要评估环境(涵盖双臂桌面操控),并在固定其他变量的情况下逐层解耦测试。 #### 1. 生成世界先验的继承(§4.1.1) - **目的**:检验视频生成骨干的容量是否决定 WAM 的上游知识迁移效果。 - **设置**:将四种不同参数量的视频生成模型(Wan2.1-VACE-1.3B、Cosmos-Predict2.5-2B、Wan2.2-TI2V-5B、Wan2.1-I2V-14B)分别作为 WAM 的视频骨干,在 **RoboTwin2.0-Full** 上评估平均成功率。 - **发现**:性能随视频骨干容量单调提升,验证了强生成先验的必要性。 #### 2. 视觉表示先验的继承(§4.1.2) - **目的**:比较重构式编码器与表征式编码器在世界–动作建模中的适用性。 - **设置**:在 **RoboTwin2.0-Full** 上对比六种编码器: - 重构式:Wan2.2-VAE、FLUX.2-VAE; - 表征式:DINOv3、V-JEPA 2.1(含 naive 版本与经 S-VAE 压缩至 48-D 的版本)。 - **发现**:表征式编码器经维度压缩后可达到甚至超越重构式编码器,关键在于隐空间的**紧凑性**与**信息丰富度**。 #### 3. 架构容量的消融(§4.2.1) - **目的**:确定动作专属容量与双流/三流分离程度对协同的影响。 - **设置**:在 **RoboTwin2.0-Full** 上测试 7 种架构变体: - 单系统:Vanilla、MoE; - 双系统:Joint Self-Attention、Joint Cross-Attention、Detached Cross-Attention、IDM; - 三系统:Joint Self-Attention(加入 VLM 流)。 - **发现**:从单系统到双系统再到三系统性能逐步提升;双系统中 Joint Self-Attention 最强,三系统更优但复杂度更高。 #### 4. 训练时信息流控制(§4.2.2) - **目的**:检验世界与动作在训练时的跨模态可见性要求。 - **设置**:固定双系统 Joint Self-Attention,通过四种注意力掩码控制信息流,在 **RoboTwin2.0-Full** 上评估: - Isolated(无交互) - Video Sees Action(单向) - Action Sees Video(单向) - Mutual(双向) - **发现**:Action Sees Video 是性能涌现的必要条件,反向路径的增益在从头训练时不显著。 #### 5. 推理时去噪调度策略(§4.2.3) - **目的**:验证推理阶段是否需要显式的世界/动作领先调度,还是同步去噪最优。 - **设置**:在 **RoboTwin2.0-Full** 上对比: - 同步(Sync):两模态沿对角线联合去噪; - 异步:Video-Leading / Action-Leading,通过方差偏移(Variance Shift, α ∈ 4,8,16,32 )与线性偏移(Linear Offset, o ∈ 0.2,0.4,0.6,0.8 )实现。 - **发现**:**同步去噪(Sync)** 始终最优,不支持“先想象世界再反推动作”的两阶段隐式规划假说。 #### 6. 跨域预训练策略(§4.3) - **目的**:检验人类自我中心视频与机器人数据的组合方式如何影响泛化。 - **设置**:在固定 600 小时数据预算下,对比四种策略,在 **RoboTwin2.0-Clean2Random**(ID/OOD)与 **RoboTwin2.0-Full** 上评估: - From Scratch - Robot Only - Ego → Robot(两阶段) - Ego + Robot(单阶段共训) - **发现**:预训练主要提升 **OOD 泛化**(+12.12pp);单阶段共训(Ego + Robot)综合最优。 #### 7. 预训练对信息流偏好的改变(§4.3.3) - **目的**:验证预训练规模是否改变最优注意力掩码的选择。 - **设置**:比较 From Scratch 与 Pretrained 模型在 Action Sees Video vs. Mutual 下的表现,覆盖 RoboTwin2.0-Full 与 RoboTwin2.0-Clean2Random(含 ID/OOD)。 - **发现**:从头训练时单向与双向掩码接近;**预训练后 Mutual(双向互见)稳定更优**,表明大规模数据使世界与动作能建立可靠的双向对应。 —- ### 二、OpenWAM-α:规模化验证与跨域评估 将上述原则组合为 OpenWAM-α(518.5M 帧预训练),在仿真与真实世界进行端到端验证。 #### 8. 仿真基准综合评估(§5.3) - **覆盖范围**:在 8 个仿真基准上评估,横跨 5 类具身: - **单臂**:LIBERO、LIBERO-Plus、VLABench - **双臂**:RoboTwin2.0-Full、RoboTwin2.0-Clean2Random、RoboDojo - **移动单臂**:RoboCasa365 - **移动双臂**:EBench - **灵巧手**:RoboCasa-GR1 - **对比基线**:与代表性 VLA(如 π 0 、 π 0.5 、StarVLA、Qwen-RobotManip)及 WAM(如 Fast-WAM、LingBot-VA、ABot-M0.5)进行全面对比。 - **发现**:OpenWAM-α 在绝大多数基准上处于第一梯队,并在 EBench 上取得 SOTA。 #### 9. VLA vs. WAM 范式对比(§5.3.2) - **目的**:从 ID/OOD 视角厘清两种端到端范式的相对优势。 - **设置**:将 OpenWAM-α 与最强 VLAs 在分布内(Clean、In-dist.)与分布外(Randomized、Open、LIBERO-Plus 扰动)上分组对比;同时对比无预训练的 Fast-WAM 与 StarVLA。 - **发现**:WAM 在 **ID 拟合** 上更强(视频隐式监督提供额外优化信号),VLA 在 **OOD 泛化** 上更强(无长程像素预测误差累积);两者缺陷均可通过更充分、 Q5: 有什么可以进一步探索的点? 根据论文附录 A(Limitations and Future Work)及结论部分的讨论,以下是可以进一步探索的方向: ### 1. 后训练(Post-training)与适配方法 论文主要聚焦于具身预训练阶段的设计与扩展。后续可系统研究后训练与适配方法(如微调策略、测试时优化、提示工程等)对 WAM 性能的影响,并提炼其经验配方与底层机制。 ### 2. 更原生的模态融合架构 当前探索的架构主要依赖跨模态注意力(cross-modality attention)或硬路由混合专家(hard-routed MoE)实现世界与动作的融合。未来可借鉴统一多模态模型(UMM)社区的经验,探索: - **Tokenizer 阶段的早期融合**(tokenization-phase early fusion) - **软路由 MoE**(soft-routed MoE) - 其他更原生的模态交互机制,以替代或补充现有的桥接层注意力设计 ### 3. 预训练数据混合的扩展 - **UMI 风格数据**:论文未纳入 UMI 风格(如 UMI、DexUMI)采集的数据。这类数据在理论上可提供与人类自我中心视频相当的任务与场景多样性,同时保留机器人可执行的动作标注。通过 UMI 接口或后处理 pipeline 获取此类数据进行共训,可能是通向自主具身智能的更数据高效的路径。 - **仿真数据的突破**:仿真可不受物理世界时间与人力成本限制,原生生成场景多样、运动轨迹真实的机器人操作数据。期待仿真技术在规模与真实性上的进一步突破,以实现机器人数据数量级的扩展。 ### 4. 视觉编码器的改进 论文最终采用的 Wan2.2-VAE 是现有选项中的最佳权衡,而非最优解。实验表明,基于像素重建的编码器对**视角变化、噪声扰动与场景变动**的鲁棒性不足。亟需探索同时满足以下三方面的新型视觉表示: - 对环境变化具有**鲁棒性** - 携带**丰富的世界信息** - 保持**足够的紧凑性**(低维隐空间) ### 5. WAM 与 VLA 的范式融合 论文的对比分析揭示了两个端到端范式的互补性:WAM 在分布内拟合上占优,VLA 在分布外泛化上更强,且各自缺陷均可被充足数据弥补。如何设计统一的端到端架构,**结合视频隐式监督的拟合能力与动作-only 模型的泛化稳定性**,是提升具身基础模型能力边界的重要方向。 ### 6. 跨域泛化的极限与 Scaling Law 论文发现预训练主要扩展 OOD 泛化而非 ID 拟合。未来可进一步探索: - 世界–动作协同效应随数据规模、模型参数与计算量的 scaling law - 异构数据(egocentric / robot / simulation)的最优配比理论 - 从预训练到下游任务的迁移机制与泛化边界 Q6: 总结一下论文的主要内容 论文围绕世界–动作模型(World–Action Models, WAMs)的系统性设计与预训练展开,提出了一个开放研究栈 **OpenWAM**,将 WAM 的开发从高度耦合的单体实现转化为可控的实验程序,并在此基础上提炼设计原则、构建开源预训练模型。以下是主要内容总结。 —- ### 一、研究背景与核心问题 现代视频生成模型蕴含丰富的视觉动态先验,世界–动作模型(WAMs)旨在继承这些先验,并通过具身经验将其转化为可执行的控制信号。然而,现有系统通常将生成骨干、视觉表示、架构、信息流、推理调度与训练数据紧密耦合,导致研究者难以辨识: - **应继承何种世界知识?** - **世界预测与动作生成如何产生协同?** - **这种协同如何跨域、跨具身扩展?** —- ### 二、OpenWAM 三层架构 为回答上述问题,论文构建了 **OpenWAM**,包含三个递进层次: #### 1. OpenWAM-Infra:模块化基础设施 将 WAM 设计空间因子化为三个正交模块,通过组合规则 C(E, S, M) 组装: - **视觉编码器 E **:支持重构式(如 Wan2.2-VAE)与表征式(如 DINOv3、V-JEPA 2.1)编码器,并可通过 S-VAE 压缩维度; - **流骨干网络 S **:支持视频生成 DiT(如 Wan2.1、Cosmos 系列)、动作 DiT 及可选 VLM 骨干,涵盖单系统、双系统与三系统共六种架构变体; - **可见性注意力掩码 M **:通过 M = (M
(V arrow V), M(V arrow A); M(A arrow V), M_(A arrow A)) 精确控制跨模态信息流,支持 Mutual、Action-Sees-Video、Video-Sees-Action、Isolated 四种模式。 该基础设施提供**统一的训练运行时**(单一联合流匹配目标)、**统一部署运行时**(正交化的推理模式与去噪调度)以及**统一的评估协议**(覆盖 8 个仿真基准与真实机器人的标准化客户端–服务器接口),并定义了**80-D 统一动作空间**以实现跨具身训练。 #### 2. OpenWAM-Study:设计原则提炼 基于模块化基板,论文通过严格对照实验回答三个核心问题,提炼出三项原则: - **继承原则**:上游知识通过**足够强大的生成骨干**与**紧凑且信息丰富的视觉隐空间**最有效迁移;表征式编码器经 S-VAE 压缩后可媲美甚至超越重构式编码器。 - **协同原则**:世界–动作协同需要**专属的动作容量**(双/三系统优于单系统)、**训练时显式的世界到动作信息流**(Action Sees Video 为必要条件),以及**推理时的同步联合去噪**(Sync 最优,异步调度无增益)。 - **跨域原则**:具身预训练主要扩展**分布外(OOD)泛化**;机器人数据强化动作落地,人类自我中心视频扩展世界覆盖,**单阶段共训(ego + robot co-train)** 为最优整合策略;且在预训练规模下,**双向互见(Mutual)注意力**成为首选。 #### 3. OpenWAM-α:原则的规模验证 将上述原则组合实例化为 **OpenWAM-α**: - 采用 Wan2.2-TI2V-5B 视频骨干 + 1B 参数 ActionDiT,通过 Joint Self-Attention 与 Mutual Mask 耦合; - 在 **518.5M 帧(约 6,369 小时)** 的异构数据(人类自我中心视频 + 真实机器人 + 仿真数据)上进行单阶段端到端预训练; - 通过 80-D 统一动作空间实现 21 种具身形态的跨域训练。 —- ### 三、实验与评估 #### 1. 受控实验(OpenWAM-Study) 以 RoboTwin2.0 为主要环境,逐层解耦验证: - **生成骨干消融**:参数规模越大,WAM 性能越高; - **视觉编码器消融**:紧凑性(S-VAE 压缩)与信息丰富度决定表示质量; - **架构消融**:双/三系统显著优于单系统,Joint Self-Attention 最优; - **信息流与去噪消融**:训练时必须开放 A arrow V ,推理时同步去噪最优; - **预训练策略消融**:单阶段 ego + robot 共训在 OOD 上提升最显著(如 Clean→Randomized 提升达 +12.12pp)。 #### 2. 大规模跨域评估(OpenWAM-α) - **仿真基准**:在 8 个基准上评估,涵盖单臂(LIBERO、LIBERO-Plus、VLABench)、双臂(RoboTwin2.0、RoboDojo)、移动单臂(RoboCasa365)、移动双臂(EBench)及灵巧手(RoboCasa-GR1)。OpenWAM-α 在绝大多数基准上处于顶尖水平,并在 EBench 上取得 SOTA。 - **真实机器人**:在 Franka-Research-3(单臂)、RoboDojo(双臂,3 种平台)及 Wuji 灵巧手(全新未见具身)上验证,表现出强泛化与适应能力。 - **范式对比**:WAM 在分布内(ID)拟合上优于 VLA,VLA 在分布外(OOD)泛化上更强;两者互补,数据规模可弥补各自短板。 —- ### 四、主要贡献与开放资源 - **OpenWAM-Infra**:首个面向 WAM 的模块化、可扩展、统一训练/部署/评估的开源基础设施; - **OpenWAM-Study**:通过控制变量实验,系统回答了 WAM 设计中的继承、协同与扩展问题,提炼出可复现的经验配方; - **OpenWAM-α**:在大规模异构数据上预训练的开源 WAM,在仿真与真实世界中均展现顶尖性能; - **全面开源**:释放完整代码库、预训练权重、评估协议与数据配方,以推动 WAM 领域的可复现研究与社区共建。 —- ### 五、未来方向 论文指出了若干值得深入探索的方向:后训练与适配方法、更原生的模态融合架构(如 tokenizer 早期融合、软路由 MoE)、UMI 风格与大规模仿真数据的整合、对环境变化更鲁棒且紧凑的视觉表示,以及融合 WAM 与 VLA 互补优势的统一端到端架构。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yuran Wang,Siqiao Huang,Mingleyang Li,Chenhao Zhang,Jiaqi Liang,Weiyang Jin,Yue Chen,Xuemin Chi,Donghao Zhou,Qize Yu,Yu-Kai Wang,Yuhan Rui,Shenzhe Yao,Zhen Yuan,Zhenhao Shen,Kefei Zhu,Zijie Zhu,Ning Gao,Xiaowei Chi,Guanqi He,Shanghang Zhang,Hao Dong,Lin Shao,Hang Zhao

Categories:

PDF URL: https://arxiv.org/pdf/2609.07398.pdf

Arxiv URL: https://arxiv.org/abs/2609.07398

Arxiv ID: 2609.07398

CoolPaper URL: https://papers.cool/arxiv/2609.07398

Published: 2026-09-10T01:26:56.757Z

Updated: 2026-09-10T01:26:56.757Z


7. GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

Abstract:World-action models (WAM) predict future states to guide robot actions, enabling learning from both action-free video and action-labeled interaction. Most inherit pretrained video generators, leaving WAM pretraining and scaling underexplored. We introduce Genie Envisioner Act 2.0 (GE-Act 2.0), a world-action model whose trainable generative and action components are all initialized from scratch on manipulation data. It combines a control-oriented autoencoder (CoAE), a single-step visual planner (SVP), and an inverse dynamics model (IDM). CoAE retains action- and instruction-relevant information under aggressive compression, while SVP produces a complete future state in one differentiable pass, so visual planning and inverse dynamics can be pretrained separately on complementary data. The components are then jointly trained with knowledge-aligned selective optimization (KASO), which reduces mismatched supervision by selecting only predicted futures judged behaviorally compatible with the recorded action. We evaluate pretrained checkpoints directly, without per-task fine-tuning, on 100 tasks across 20 manipulation skill groups with held-out scenes, backgrounds, lighting, and object instances. Scaling co-training data from 300 to 30,000 hours raises success from 17.1% to 44.1% on G1-OP and from 13.4% to 31.1% on G2-90D; despite comprising less than 2% of the co-training data, G2-90D improves by 17.7 points, suggesting cross-embodiment transfer. Gains span 19/20 and 18/20 skill groups, and skill-specific coverage strongly correlates with zero-shot out-of-distribution (OOD) success (Pearson r=0.80; Spearman rho=0.85). Under the same protocol, the model grounds object, color, shape, and position references in at least 90% of trials and follows explicit instructions even when they conflict with an already-committed behavior or a conventional scene association.

中文摘要

摘要:世界-动作模型(WAM)通过预测未来状态来指导机器人动作,使其能够从无动作视频和带动作标记的交互中学习。大多数模型继承了预训练的视频生成器,但WAM的预训练和规模化研究仍然不足。我们引入了Genie Envisioner Act 2.0(GE-Act 2.0),这是一种世界-动作模型,其可训练的生成组件和动作组件均从操控数据中从零初始化。它结合了以控制为导向的自编码器(CoAE)、单步视觉规划器(SVP)和逆动力学模型(IDM)。CoAE在强压缩下保留了与动作和指令相关的信息,而SVP在一次可微传递中生成完整的未来状态,因此视觉规划和逆动力学可以在互补数据上分别进行预训练。然后,通过知识对齐选择优化(KASO)对这些组件进行联合训练,该方法通过仅选择被评估为与记录动作在行为上兼容的预测未来来减少不匹配监督。我们在不进行任务特定微调的情况下,直接评估预训练检查点,在20个操控技能组的100个任务中测试了未见过的场景、背景、光照和物体实例。将联合训练数据从300小时扩展到30,000小时,使G1-OP任务的成功率从17.1%提升至44.1%,G2-90D任务从13.4%提升至31.1%;尽管G2-90D的数据量不到联合训练数据的2%,其提升却达到17.7个百分点,表明存在跨实体迁移。提升覆盖了19/20和18/20的技能组,且技能特定覆盖率与零样本分布外(OOD)成功率高度相关(Pearson r=0.80;Spearman rho=0.85)。在相同实验方案下,该模型在至少90%的试验中能实现对物体、颜色、形状和位置引用的落地,并能遵循明确指令,即便这些指令与已执行行为或传统场景关联相冲突。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决世界–动作模型(World–Action Model, WAM)在机器人操作领域中\*\*预训练与规模化扩展\*\*的核心问题,具体可归纳为以下四个方面: ### 1. 继承式预训练的局限性 现有世界–动作模型大多直接继承自然视频上预训练的视频生成器,再将动作模型与之耦合。这种做法使得WAM作为一个整体系统的\*\*从头预训练与数据扩展\*\*未被充分探索,留下两个系统级问题未解决: - 视觉生成与逆动力学如何在各自互补数据上独立预训练,再有效连接; - 当所有可训练的视觉生成与动作组件均从零初始化时,WAM能力如何随操作数据规模增长。 ### 2. 机器人控制导向的表征空间缺失 标准视频自编码器针对内容重建优化,空间压缩率有限,且未显式设计以支持下游视觉规划与动作预测。论文指出,机器人操作需要一个\*\*激进压缩且保留控制相关信息\*\*的潜在空间,以同时满足: - 视觉未来预测的高效性; - 逆动力学模型从预测未来中恢复动作的能力; - 语言指令在场景中的 grounding 能力。 ### 3. 多步生成阻碍了解耦预训练与数据利用 在传统的多步扩散/视频生成框架中,完整的未来视觉状态需要 K 步 sequential denoising 才能获得。这导致动作梯度回传至生成器时需保留并微分整个 K 步链,计算与内存开销巨大。因此,现有系统难以支持: - 视觉规划器在无动作标签的视频数据上独立预训练; - 逆动力学模型(IDM)在无语言指令的轨迹(如失败片段、部署回传数据)上独立预训练; - 两者在联合训练时通过可微分的“生成未来→预测动作”接口端到端优化。 ### 4. 联合训练中的“有效性差距”(Validity Gap) 即使视觉预测质量很高,生成的未来视觉状态也可能对应与记录动作\*\*不同的行为模式\*\*(outcome mode)。操纵任务本身具有内在多模态性:同一指令下存在多种正确完成方式。在模仿学习中: - 记录的演示只提供某一种有效行为的动作监督; - 独立采样的生成未来可能描绘另一种有效行为; - 将不匹配的未来与记录动作配对训练,会抹除动作多样性、缩小后续探索与强化学习可利用的动作空间。 为应对上述问题,论文提出 \*\*GE-Act 2.0\*\*,其设计包括: - \*\*控制导向自编码器(CoAE)\*\*:通过多教师特征对齐,在 64× 空间压缩下保留控制与指令相关信息; - \*\*单步视觉规划器(SVP)\*\*:基于 MeanFlow 在单步可微分前向传播中生成完整未来,使视觉规划与逆动力学可先解耦预训练再联合优化; - \*\*知识对齐选择优化(KASO)\*\*:在联合训练时,仅保留被当前 IDM 判定为与记录动作“行为兼容”的生成未来候选,从而缓解 validity gap 并保护动作空间多样性。 Q2: 有哪些相关研究? 基于论文第2节及相关引用,相关研究可归纳为以下五个方向: ### 1. 通才策略与世界–动作模型(Generalist Policies & WAMs) \*\*视觉–语言–动作(VLA)策略\*\* Black 等人(2024)、Brohan 等人(2022)以及 Physical Intelligence 团队(2025)等通过大规模语言条件控制,将观测与指令直接映射到电机指令,但其直接动作优化并未显式要求建模物理交互动态。 \*\*世界–动作模型(WAMs)\*\* 作为新兴范式,WAMs 通过预测场景演化来支撑动作生成,主要形成三类接口: - \*\*解耦两阶段设计\*\*:先生成未来视觉状态,再用独立动作模型推断动作(Jang 等人, 2025) - \*\*联合设计\*\*:在共享主干中同时预测视频与动作(Cheang 等人, 2024; Motubrain Team, 2026; Wu 等人, 2024b; Ye 等人, 2026b) - \*\*特征耦合设计\*\*:从生成主干的内部表示中解码动作(Hu 等人, 2025; Liao 等人, 2025) GE-Act 2.0 采用显式的“已完成未来”作为视觉规划器与独立预训练逆动力学模型(IDM)之间的接口,区别于 GE-Act 1.0 的并行动作分支。 --- ### 2. 面向机器人视频与控制的表征学习 \*\*标准视频自编码器\*\* NVIDIA 团队(2025a)与 Wan 团队(2025)开发的自编码器以内容重建为目标,空间压缩率有限(通常 8× 或 16× ),且未针对控制任务优化。 \*\*机器人导向表征\*\* - \*\*Genie\*\*(Bruce 等人, 2024):从视频中发现离散潜在动作 - \*\*LAPA / Moto\*\*(Chen 等人, 2025c; Ye 等人, 2025):将学习到的运动 token 与机器人动作关联 - \*\*IGOR\*\*(Chen 等人, 2024):将视觉变化压缩至共享潜在动作空间 \*\*预测性视觉特征用于控制\*\* 包括视频预训练主干(Cheang 等人, 2024; Wu 等人, 2024b)、扩散特征(Hu 等人, 2025)以及点轨迹(Wen 等人, 2024)。 \*\*表征对齐方法\*\* 在图像生成领域,REPA 与 VA-VAE(Yao 等人, 2025b; Yu 等人, 2025)表明,将 tokenizer 的隐变量或生成器的中间特征与冻结的语义编码器对齐可改善生成质量。 --- ### 3. 世界模型中的快速视频生成 \*\*基于预训练视频生成器的多步方法\*\* 多数机器人世界模型继承自然视频预训练的生成器,保留多步扩散或通过蒸馏压缩采样器(Chen 等人, 2026; Guo 等人, 2025; Huang 等人, 2025; Jang 等人, 2025; Jiang 等人, 2025; Li 等人, 2026; NVIDIA 等人, 2025a; Zhang 等人, 2026; Zhu 等人, 2025)。 \*\*少步/单步生成技术 lineage\*\* - \*\*渐进与分布匹配蒸馏\*\*(Salimans & Ho, 2022; Yin 等人, 2024a,b) - \*\*一致性模型\*\*(Kim 等人, 2024a; Luo 等人, 2023; Song 等人, 2023):沿概率流轨迹强制一致性 - \*\*整流/快捷流\*\*(Frans 等人, 2025; Lipman 等人, 2023; Liu 等人, 2023b, 2024):学习适合小积分预算的路径 - \*\*MeanFlow / improved MeanFlow\*\*(Geng 等人, 2025, 2026):训练平均速度场,无需先蒸馏多步教师即可单步 traversing 完整噪声区间 - \*\*Seaweed-APT\*\*(Lin 等人, 2025):通过对抗后训练实现单步自然视频生成 GE-Act 2.0 的单步视觉规划器(SVP)以 MeanFlow 为方法论起点,将其条件化扩展至多视角未来视觉状态,并作为可微分的训练–部署接口服务于动作模型。 --- ### 4. 将生成未来与动作相连接 \*\*纯规划/表征提取的世界模型\*\* Hafner 等人(2018, 2019)、Hu 等人(2025)与 Wu 等人(2022)的工作无需将动作模型暴露于生成的未来视觉样本。 \*\*世界–动作训练中的耦合策略\*\* - \*\*教师强制(Teacher forcing)\*\*:在记录的未来视觉状态上训练动作模型,导致部署时的“生成–记录输入差距”(LingBot-VA; Li 等人, 2026; Zhang 等人, 2026) - \*\*梯度截断或鲁棒性吸收\*\*:部分系统在生成未来上训练,但截断采样路径或依赖模型鲁棒性消化生成误差(Chen 等人, 2026) \*\*GE-Act 2.0 的 Validity Gap 与 KASO\*\* 论文指出,即使合理的视觉预测也可能代表与记录动作不同的结果模式(outcome mode)。为此提出的 \*\*KASO\*\* 与同期 Gladstone 等人(2026)在通用生成建模中独立出现的 best-of-K 选择规则相关;区别在于 KASO 在动作空间中通过活跃 IDM 判断兼容性,并用于对齐视觉规划器与逆动力学模型。 --- ### 5. 预训练机器人模型的评估协议 \*\*任务特定微调(SFT)评估\*\* Black 等人(2024)、Brohan 等人(2022)、Cheang 等人(2024)、Kim 等人(2024b)、Li 等人(2026)、Wu 等人(2024b)、Ye 等人(2026a)、Zhang 等人(2026)及 Zhou 等人(2026)等常在下游任务上执行 SFT 后评估。部分工作进一步在与 SFT 相同的光照、背景和物体集上测试,使测试实质为域内评估。 \*\*零样本评估\*\* Generalist AI Team(2025, 2026)、Physical Intelligence 等人(2025)及 Zhou 等人(2026)等报告了零样本结果。GE-Act 2.0 以\*\*无微调、无任务特定适应\*\*的零样本 OOD(out-of-distribution)评估作为主要度量,固定协议以隔离预训练本身获得的能力。 \*\*仿真基准\*\* 包括 RLBench(James 等人, 2020)、LIBERO(Liu 等人, 2023a)与 WorldArena(Shang 等人, 2026)等,提供横向参考点而非直接证明操作视频预训练获得的能力。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*GE-Act 2.0\*\* 框架,从表征学习、生成建模、动作预测与联合优化四个层面系统性地解决了世界–动作模型的预训练与扩展难题。具体方案如下: --- ### 1. 控制导向自编码器(CoAE):构建紧凑且控制友好的潜在空间 针对标准视频自编码器压缩率不足、未面向控制优化的问题,CoAE 在以下方面进行重新设计: - \*\*极端空间压缩\*\*:采用 64× 空间下采样(远高于常规的 8× 或 16× ),将 256×384 的输入帧映射为仅 4×6 的潜在网格(24 个 token),显著降低视觉规划器的 token 负担。 - \*\*多教师特征对齐\*\*:在像素重建损失之外,引入三个冻结视觉教师(SigLIP 2、V-JEPA 2.1、DINOv3)的表征对齐目标:

L(align) = ∑(k=1)^(3) λk (1 - cos(g_k(z), G_k(o)))
其中 G_k(o) 为第 k 个教师的最终层表示, g_k 为可学习的对齐头。该设计同时保留语言对齐语义、时空结构与密集视觉特征。 - **控制兼容性验证**:通过冻结编码器上的逆动力学探针与指令匹配探针双重评估,证明 CoAE 在仅使用 1/16 token 的情况下,动作恢复误差接近 V-JEPA 2.1 与 DINOv3,且指令 grounding 准确率优于所有教师基线。 —- ### 2. 单步视觉规划器(SVP):实现可微分的解耦预训练与一步生成 针对多步扩散模型阻碍梯度回传、无法支持独立预训练的问题,SVP 采用以下策略: - **单步 MeanFlow 生成**:将条件多视角视觉预测建模为单步流匹配问题。对于记录的未来潜在变量 z 与高斯噪声 ε ,线性轨迹为 z_t = (1-t)z + tε 。通过共享 DiT 主干分别输出平均速度头 u
θ 与瞬时速度头 v_θ ,利用 Jacobian–Vector Product(JVP)构建复合预测:

Vθ = uθ + (t-r),sg![(duθ) / (dt)]
并在掩码后的预测坐标上回归流目标:
L_u = |m odot (V
θ - vc)|_2^2, quad L_v = |m odot (vθ - vc)|_2^2
其中 m 为区分条件帧与未来帧的二值掩码。 - **端到端可微接口**:在 (r,t)=(0,1) 下,单步前向传播即可完全去噪得到未来潜在状态 z ,且 z 对生成器所有参数可微。这使得 SVP 与 IDM 可以先在互补数据上独立预训练,再通过生成的未来进行端到端联合优化。 - **多尺度时序预测**:同时预测稠密近帧(控制率动作执行区间)与稀疏远帧(任务意图区间),使视觉规划兼具精细交互动力学与长程场景演化。 —- ### 3. 多模态理解与条件生成解耦:VLM 场景 Grounding 针对语言指令中的指代消解依赖当前场景的问题,SVP 引入冻结的 Qwen3.5 视觉–语言模型(VLM)作为多模态理解模块: - 联合处理当前头部观测 o
(head) 与指令 c ,产生逐层隐藏状态 h^0, h^1, dots, h^L = VLM(o_(head), c) 。 - 通过输入依赖的门控网络对文本跨度状态进行层间融合:

αell = softmax_ell(g(Pool(h_ell[T]))), quad c(vlm) = LN(∑_(ell=0)^(L) α_ell h_ell[T])

  • 生成 DiT 交叉注意力聚焦于 c(vlm) ,实现“VLM 解析指令指代,DiT 预测场景演化”的分工。IDM 不直接接收语言输入,因此语言不影响 IDM 的独立预训练。 —- ### 4. 知识对齐选择优化(KASO):消除联合训练中的有效性差距(Validity Gap) 针对生成未来与记录动作之间可能存在行为模式不匹配(Validity Gap)的问题,KASO 提出在线选择机制: - **动作空间兼容性评估**:对同一上下文,SVP 采样 N 个候选未来 z_n(n=1)^N 。利用当前活跃的 IDM,在共享的高噪声探针点 t_p 与共享动作噪声 ε 下,计算每个候选与记录未来 z 在动作速度空间中的能量:

En = (1) / (|D|)∑(i∈ D) |v(φ,i)(a, t_p; o, s, z_n) - v(φ,i)(a, tp; o, s, z)|_2^2
其中 a = t_pε + (1-t_p)a , D 为稠密动作 token 集合。低能量意味着 IDM 无法从候选未来与记录未来中区分出不同的动作意图,即二者行为兼容。 - **Top-k 选择与可微重放**:选择能量最低的 k 个候选(实现中取 k=1 ),保留其生成噪声并在梯度开启下精确重放,计算联合动作损失:
L
(E2E)^(sel) = (1) / (k)∑(n∈ S_k) ell(FM)(a; o, s, z_n)

  • **完整 KASO 目标**:在保留各自预训练损失的前提下联合更新:
    L(KASO) = L(E2E)^(sel) + L(SVP) + L(IDM)
    其中 L(SVP) 作用于记录视频, L(IDM) 作用于记录的未来–动作对。该设计既防止单独优化 L_(E2E) 导致预训练能力退化,又通过选择机制避免跨模式监督抹除动作多样性。 —- ### 5. 分阶段数据利用与扩展策略 GE-Act 2.0 通过三阶段训练最大化异构数据的利用: | 阶段 | 数据类型 | 核心组件 | 数据规模 | |———|————-|————-|————-| | SVP 预训练 | 指令–视频数据(无需动作标签),含人操作视频 | CoAE + SVP | 39,000 小时 | | IDM 预训练 | 动作标注轨迹(无需语言指令),含失败与回传数据 | IDM | 32,000 小时 | | KASO 联合训练 | 完整标注的机器人演示(指令+视频+动作) | SVP + IDM | 30,000 小时 | - **解耦预训练释放数据瓶颈**:SVP 可利用无动作标签的大规模视频;IDM 可利用无语言标注的失败尝试与部署回传,突破成功演示数据稀缺的限制。 - **规模化的零样本 OOD 评估**:在 100 项真实机器人任务、两种本体(G1-OP 与仅占训练数据 <2% 的 G2-90D)上,不执行任何任务特定微调,直接评估预训练检查点。实验表明,将联合训练数据从 300 小时扩展至 30,000 小时,G1-OP 成功率从 17.1% 提升至 44.1% ,G2-90D 从 13.4% 提升至 31.1% ,且技能特定数据覆盖率与零样本 OOD 成功率呈强相关(Pearson r=0.80 ;Spearman rho=0.85 )。 Q4: 论文做了哪些实验? 论文中的实验可归纳为以下五大类,涵盖表征探针、受控消融、规模化真实机器人评估、指令跟随压力测试以及标准化仿真基准测试。 --- ### 1. 控制导向自编码器(CoAE)的表征探针实验 为验证 CoAE 在极端压缩下仍保留控制相关信息,论文设计了两组冻结编码器探针实验: - \*\*动作恢复探针(Action Recovery)\*\* 在视觉杂乱的货架整理任务上,冻结各视觉编码器,用相同容量的两层逆动力学网络训练 400 个样本,测试 100 个样本。对比方法包括 DC-AE、DINOv3、V-JEPA 2.1 与 SigLIP。 结果表明,CoAE 的动作平均绝对误差(MAE)为 0.01673 ,仅落后最优的 DINOv3( 0.01273 )约 31% ,但每帧仅使用 1/16 的 token;DC-AE 与 SigLIP 的误差分别比 CoAE 高 54% 与 88% 。 - \*\*指令匹配探针(Instruction Grounding)\*\* 在 GenieSim-Instruction 的 5,000 个片段上训练八层分类网络,判断观测与指令是否匹配。CoAE 的错误率为 2.05% ,优于所有教师基线与 DC-AE,表明其在激进压缩下仍能有效保持语言–场景关联信息。 --- ### 2. 有效性差距(Validity Gap)的受控验证 #### 2.1 玩具两阶段系统(Toy Two-Stage System) 为孤立验证 validity gap 的影响,论文构建了一个三维潜在空间、单维动作的玩具系统:未来视觉状态为四个高斯模式的混合,动作由确定性映射 a = z_1 z_2 / (1.5 × 1.8) 产生。对比了四种训练策略: - \*\*Decoupled Pretraining\*\*:SVP 与 IDM 各自独立训练,不交换生成未来; - \*\*End-to-End(E2E)\*\*:仅通过生成未来联合优化动作损失; - \*\*E2E + Pretraining Losses(E2E+PT)\*\*:保留各自预训练损失,但无选择机制; - \*\*KASO\*\*:在 E2E+PT 基础上增加动作兼容性选择。 结果显示,E2E 与 E2E+PT 的确定性回归器在冲突监督下将动作分布坍缩至均值(零附近),而 KASO 恢复了真实的双模动作分布与四模视频分布。 #### 2.2 真实机器人受控消融(Real-Robot Ablation) 在相同的全规模预训练组件(SVP 39,000 小时;IDM 32,000 小时)与 300 小时联合训练混合数据上,对比三种连接策略: | 方法 | 四物体 Follow Score | 四物体 Pick Success | 单物体 Pick Success | |------|---------------------|---------------------|---------------------| | E2E | 87.5% | 27.5% | 12% | | E2E+PT | 95% | 22.5% | 12% | | KASO | 95% | 37.5% | 40% | KASO 在目标跟随率与 E2E+PT 持平的情况下,将四物体宏观平均抓取成功率提升 15 个百分点,单物体场景提升 28 个百分点,验证了选择机制对缓解 validity gap 的实际效用。 --- ### 3. 零样本 OOD 真实机器人规模化评估 核心实验在 \*\*100 项原子任务、20 个技能组\*\* 上进行,覆盖 G1-OP 与 G2-90D 两种本体,测试场景、背景、光照与物体实例均不可见于训练数据,且\*\*不进行任何任务特定微调(SFT)\*\*。 - \*\*数据扩展轨迹\*\*:使用嵌套的联合训练数据池(300 h、1,200 h、5,000 h、30,000 h),其余设置固定。 - G1-OP 套件级成功率: 17.1% to 22.6% to 27.3% to 44.1% ; - G2-90D 套件级成功率: 13.4% to 21.0% to 23.5% to 31.1% 。 尽管 G2-90D 仅占联合训练数据的 <2% ,仍获得 17.7 个百分点的总提升,显示出跨本体迁移能力。 - \*\*技能级扩展分析\*\*:19/20 的 G1-OP 技能组与 18/20 的 G2-90D 技能组在 30,000 小时模型上优于 300 小时模型。从 300 小时到 30,000 小时,G1-OP 上具有非零成功率的任务数从 39 增至 76,G2-90D 从 24 增至 72。 - \*\*技能覆盖率与成功率的定量关系\*\*:对 19 个非平凡技能组,训练数据小时数(对数尺度)与零样本 OOD 成功率(logit 尺度)呈强相关: Pearson r = 0.80 ,Spearman rho = 0.85 ,拟合斜率为每十年数据增加 1.94 logit 单位。该关系解释了为何 Wipe(824.1 小时)可达 76.7% ,而 Sweep(64.6 小时)仅 3.3% 。 --- ### 4. 复杂场景中的指令跟随实验 #### 4.1 细粒度指代消解(Fine-Grained Grounding) 在 G1-OP 上评估最终 KASO 检查点,任务限定为 Pick 与 Place 两种基础原语,分解为六个维度:物体身份、颜色、大小、形状、位置、顺序。共 59 条指令、295 次真实机器人 rollout。 - \*\*结果概要\*\*:物体身份、颜色、位置与形状的 Follow Score 均不低于 90% ;大小降至 82.5% (Pick)与 65.7% (Place);顺序最低,仅 13.3% 与 26.7% 。 - 总体 Follow Score 为 83.1% ,完整任务成功率为 72.9% ,表明部分失败发生在已正确指代目标后的物理执行阶段。 #### 4.2 行为与语义冲突压力测试 通过定性实验检验策略在冲突指令下的响应能力: - \*\*目标切换(Target switch)\*\*:在末端执行器已接近当前目标时更换指令对象,策略最终能重定向至最终目标; - \*\*手臂切换(Arm switch)\*\*:在右臂已接近目标时改为左臂执行新指令,策略可迅速切换; - \*\*语义冲突(Semantic conflict)\*\*:如将杯子放入鞋盒(违背常规场景关联),策略仍遵循显式指令完成放置。 --- ### 5. 标准化仿真基准的 OOD 测试 为提供跨模型可比参考,论文在三个仿真基准上执行 \*\*先按官方协议在域内数据上 SFT,再在 hold-out OOD 条件上评估\*\*: - \*\*RoboTwin Clean-to-Random\*\*:在 Easy/Clean 上 SFT,测试背景、光照、 clutter、桌高及 combined Hard 条件。GE-Act 2.0 在六项条件中的五项取得最优,Hard 条件下达 60.52% ,领先次优的 π 0.5 ( 47.90% ) 12.62 个百分点。 - \*\*GenieSim-Instruction\*\*:在官方训练数据上 SFT,测试未见场景配置中的指令跟随。GE-Act 2.0 平均标准化得分为 0.770 ,优于 ACoT-VLA( 0.757 )与 π 0.5 ( 0.746 ),尤其在逻辑组合(logical composition)与常识指代(common-sense reference)上优势显著。 - \*\*LIBERO-Plus\*\*:在标准 LIBERO 上 SFT,评估相机视角、机器人初始状态、语言、光照、背景、传感器噪声与物体布局七种扰动。总体成功率 80.4% ,超过 StarVLA( 74.1% ),但低于 π 0.5 ( 84.4% );背景与机器人状态扰动仍是主要弱点。 --- ### 6. 关键实验附录 论文在附录中提供了完整的实验支撑材料: - \*\*附录 B\*\*:训练配方与超参数(架构配置、时序调度、SVP/IDM/KASO 各阶段优化细节、Toy 系统的完整网络结构与训练协议); - \*\*附录 C\*\*:100 项原子任务的完整分类体系、逐项成功率表格(表 8),以及细粒度指令跟随的逐条指令结果(表 9)与词汇匹配规则(表 10)。 Q5: 有什么可以进一步探索的点? 基于论文的局限性讨论与实验发现,可进一步探索的方向包括: ### 1. 第一人称视角视频的规模化预训练 论文指出,GE-Act 2.0 的训练混合中仅包含少量 egocentric 与人工操作视频(图 8),尚未充分利用该来源的规模潜力。未来可系统研究: - 如何扩大 egocentric 视频的预训练量级、多样性与任务语义覆盖; - 此类视频对视觉生成预训练及下游机器人能力的定量影响机制。 ### 2. 与 System-2 推理能力的闭环结合 当前 GE-Act 2.0 聚焦于 System-1 风格的指令条件低层控制,缺乏显式推理、长程规划、任务分解与自我修正。可探索: - 将可扩展的世界–动作模型与具备记忆、反思与规划能力的 deliberative 高层系统耦合; - 在闭环交互中,使两层系统协同规划、执行并持续改进。 ### 3. 跨本体迁移的极限与机制解析 实验显示,G2-90D 虽仅占联合训练数据的不足 2% ,却实现了 17.7 个百分点的零样本 OOD 提升。未来可深入研究: - 跨形态(cross-embodiment)迁移发生的具体表示层与数据条件; - 如何设计预训练目标以最大化数据稀缺本体的性能借用。 ### 4. 长尾技能覆盖率的主动扩展 技能级分析揭示训练小时数与零样本成功率存在强相关(Pearson r=0.80 ;Spearman rho=0.85 )。因此可探索: - 针对 Rare skill groups(如 Order、Sweep、Zip)的主动数据收集或课程学习策略; - 利用世界模型自身生成长尾交互数据,以缓解真实演示中的分布不平衡。 ### 5. KASO 选择机制的深度扩展 KASO 通过动作空间兼容性筛选缓解 validity gap。未来方向包括: - 将选择机制推广至强化学习后训练阶段,保护并进一步扩展动作空间覆盖; - 研究多候选( k>1 )选择、自适应组大小 N 或基于不确定性的动态阈值; - 在生成式逆动力学模型而非确定性回归器上验证 KASO 的普适性。 ### 6. 长程组合任务与错误恢复 当前 100 项原子任务主要评估局部可执行技能。后续可探索: - 将原子技能组合为需要多阶段规划与错误恢复的复合任务; - 利用 SVP 的多尺度时序预测能力,评估其在长程动态中的误差累积与修正行为。 ### 7. 视觉–语言–动作耦合的进一步解耦与对齐 论文中 VLM 保持冻结,语言仅通过生成未来间接影响动作。可研究: - 在保持 IDM 可独立预训练优势的前提下,部分微调 VLM 以提升场景 grounding 精度; - 探索更精细的跨模态对齐目标,将语言指代、视觉预测与动作意图在潜在空间中显式关联。 ### 8. 更激进压缩与实时性边界 CoAE 已实现 64× 空间压缩,但未来可追问: - 在保持控制相关信息的条件下,压缩极限位于何处; - 单步视觉规划器在边缘计算硬件上的延迟–精度权衡,以及针对实时控制的架构剪枝或蒸馏。 ### 9. 闭环部署中的持续学习 论文提及失败轨迹与部署回传数据可用于 IDM 预训练,但未展开闭环持续学习。可探索: - 部署后如何自动筛选高价值失败片段并增量更新世界–动作模型; - 防止灾难性遗忘的机制,使模型在扩展新技能时保持已有能力。 Q6: 总结一下论文的主要内容 本文介绍 **GE-Act 2.0**,一个面向机器人操作、支持从头预训练与规模化扩展的世界–动作模型(World–Action Model, WAM)。核心内容可概括如下: —- ### 1. 研究动机与问题 现有世界–动作模型大多继承自然视频上预训练的生成器,再耦合动作模块,导致 WAM 整体在操作数据上的**从头预训练与系统级扩展**未被充分探索。具体挑战包括: - **表征空间不匹配**:标准视频自编码器压缩率低,且优化目标为重建保真度而非机器人控制; - **生成–动作耦合瓶颈**:多步扩散模型导致梯度回传困难,视觉规划器与逆动力学模型(IDM)无法先在互补数据上独立预训练再联合优化; - **有效性差距(Validity Gap)**:联合训练时,独立采样的生成未来可能与记录动作属于不同行为模式(outcome mode),产生错误的跨模态监督,抹除动作多样性。 —- ### 2. 方法:GE-Act 2.0 架构 系统由三个从零预训练的组件及一项联合优化策略构成: #### 2.1 控制导向自编码器(CoAE) - 实现 64× 空间压缩(每帧仅 24 个 token),显著降低下游计算负担; - 在像素重建外,引入多教师特征对齐损失:

L(align) = ∑(k=1)^(3) λ_k (1 - cos(g_k(z), G_k(o)))
对齐 SigLIP 2(语义)、V-JEPA 2.1(时空结构)与 DINOv3(密集视觉特征),使紧凑潜在空间同时支持视觉预测与动作恢复。 #### 2.2 单步视觉规划器(SVP) - 基于 MeanFlow,通过单步可微分前向传播生成完整未来视觉潜在状态:

z^((i)) = z1^((i)) - m_i · uθ^((i))(z_1, r=0, t=1)

  • 支持多尺度时序预测(稠密近帧用于精细控制,稀疏远帧用于任务意图); - 集成冻结的 Qwen3.5 VLM 进行场景 grounding,使语言条件通过生成的未来视觉状态间接作用于 IDM,无需语言即可预训练 IDM。 #### 2.3 逆动力学模型(IDM) 将当前与预测的视觉潜在状态结合本体感知,映射为稠密动作块与稀疏长程目标,可独立在动作标注轨迹(包括失败与回传数据)上预训练。 #### 2.4 知识对齐选择优化(KASO) 针对 Validity Gap,在联合训练阶段: 1. 对同一上下文,SVP 采样 N 个候选未来 z_n ; 2. 利用当前活跃 IDM 在动作流空间计算各候选与记录未来的能量:

En = (1) / (|D|)∑(i∈ D) |v(φ,i)(a, t_p; o, s, z_n) - v(φ,i)(a, t_p; o, s, z)|_2^2

  1. 选择 Top- k (实现中 k=1 )能量最低的候选,判定为与记录动作“行为兼容”; 4. 仅对选中候选重放并执行梯度更新,保留预训练损失 L(SVP) 与 L(IDM) :
    L(KASO) = L(E2E)^(sel) + L(SVP) + L(IDM)
    —- ### 3. 训练与数据策略 采用三阶段解耦训练,最大化异构数据利用: | 阶段 | 数据类型 | 规模 | 关键特性 | |———|————-|———|————-| | SVP 预训练 | 指令–视频(可含无动作标签的人操作视频) | 39,000 小时 | 无需动作标签 | | IDM 预训练 | 动作标注轨迹(可含失败/部署回传,无需语言) | 32,000 小时 | 无需语言指令 | | KASO 联合训练 | 完整标注的机器人演示 | 30,000 小时 | 连接两组件 | —- ### 4. 核心实验结果 #### 4.1 表征探针 - CoAE 动作恢复 MAE 接近 DINOv3 与 V-JEPA 2.1,仅落后 13% – 31% ,但每帧使用 1/16 的 token; - 指令匹配错误率 2.05% ,优于所有教师基线。 #### 4.2 Validity Gap 消融 - **玩具系统**:KASO 恢复四模视频分布与双模动作分布,E2E 与 E2E+PT 导致动作分布坍缩; - **真实机器人**:在 300 小时联合训练上,KASO 将单物体抓取成功率从 12% (E2E)/ 12% (E2E+PT)提升至 40% ,四物体宏观平均抓取成功率从 22.5% 提升至 37.5% 。 #### 4.3 大规模零样本 OOD 评估 在 100 项原子任务、20 个技能组上,**不进行任何任务特定微调**,测试场景、背景、光照与物体均不可见于训练: - **G1-OP**(主要本体, >50% 数据):300 h → 30,000 h,套件级成功率从 17.1% 提升至 44.1% ; - **G2-90D**(稀有本体, <2% 数据):从 13.4% 提升至 31.1% ,展现出显著的跨本体迁移; - 提升广泛分布于 19/20(G1-OP)与 18/20(G2-90D)技能组; - 技能级训练覆盖率与零样本成功率强相关(Pearson r = 0.80 ;Spearman rho = 0.85 )。 #### 4.4 指令跟随 - 物体身份、颜色、位置、形状的 Follow Score 均不低于 90% ; - 在目标切换、手臂切换等行为冲突及违背常规场景关联的语义冲突测试中,策略仍能遵循显式指令。 #### 4.5 仿真基准 OOD 测试 先按各基准官方协议域内 SFT,再评估 hold-out OOD 条件: - **RoboTwin Clean-to-Random**:Hard 条件 60.52% ,领先次优基线 π 0.5 ( 47.90% )达 12.62 个百分点; - **GenieSim-Instruction**:平均标准化得分 0.770 ,领先现有最优方法; - **LIBERO-Plus**:总体 80.4% ,背景与机器人状态扰动为主要弱点。 —- ### 5. 贡献与展望 **主要贡献**: - 提出首个所有可训练组件均从零在操作数据上预训练的世界–动作模型; - 识别并定义 Validity Gap,提出 KASO 实现生成未来与动作监督的对齐; - 验证操作数据规模化对零样本 OOD 能力的系统级提升及跨本体迁移。 **未来方向**: - 大规模 egocentric 视频预训练; - 与 System-2 推理、长程规划模块的闭环结合; - 扩展长尾技能数据以覆盖低资源行为类别。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: AgiBot Research Team,Renhang Liu,Wenzhi Zhao,Zhuo Yang,Liliang Chen,Pengfei Zhou,Shengcong Chen,Guanghui Ren,Youlun Peng,Rongjun Jin,Nan Wang,Sukai Wang,Xindong He,Jinyuan Feng,Ziyu Xiong,Linqing Zhong,Yifei Wei,Feng Han,Long Zhang,Da Huang,Nanshu Zhao,Chenghao Yin,Mo Wu,Zhaodong Yan,Kongtao Hu,Yuxiang Yan,Aogelijiang Niyazi,Yu Fang,Jia Zeng,Lizhu Meng,Daizhen Lv,Haoyu Cao,Zhiwen Hou,Lianjin Ye,Yuehan Niu,Zhikai Cai,Xuan Hu,Hui Min,Xiongfeng Cai,Yue Liao,Jing Wu,Soujanya Poria,Ye Li,Sanping Zhou,Maoqing Yao

Categories:

PDF URL: https://arxiv.org/pdf/2609.05588.pdf

Arxiv URL: https://arxiv.org/abs/2609.05588

Arxiv ID: 2609.05588

CoolPaper URL: https://papers.cool/arxiv/2609.05588

Published: 2026-09-10T01:26:57.389Z

Updated: 2026-09-10T01:26:57.389Z


8. Marigold V2: Revisiting Diffusion Transformers for Monocular Depth Estimation

Abstract:Monocular depth estimation is a ubiquitous yet highly ill-posed computer vision task, with downstream applications in scene reconstruction, computational photography, and robotics, among others. Despite the field’s maturity, recent models still struggle to generalize to out-of-distribution inputs and to produce sharp and detailed depth maps. In this paper, we revisit Marigold, a set of techniques for repurposing modern image generation and editing models, powered by the diffusion transformer (DiT) architecture, into state-of-the-art monocular depth estimators. Our recipes target single-step inference from pretrained multi-step flow-matching models, with quantization where needed, preserving model capacity while remaining cheap to run. We analyze the artifacts of naive training and identify two effective remedies: aligning the model’s internal representations with semantic features extracted from ground-truth, and adopting a 2-stage fine-tuning protocol built around a novel Sinkhorn-based loss. The results are crisper, cleaner depth maps that generalize well out-of-distribution, with 16-26% improvement in AbsRel over the previous best on KITTI and ETH3D. Qualitatively, our model resolves fur, foliage, and hair-thin edges that have eluded prior models. Furthermore, Marigold V2 achieves state-of-the-art results when applied to other dense regression tasks, such as surface normals estimation and intrinsic image decomposition. Project website: this https URL

中文摘要

摘要:单目深度估计是一项普遍存在但高度病态的计算机视觉任务,其下游应用包括场景重建、计算摄影和机器人技术等。尽管该领域已较为成熟,近期的模型仍然难以推广到分布外的输入,并生成清晰且细节丰富的深度图。在本文中,我们重新审视了Marigold,这是一套利用扩散变换器(DiT)架构,将现代图像生成和编辑模型改造为最先进单目深度估计器的技术方法。我们的方案针对从预训练的多步流匹配模型进行单步推理,同时在必要时进行量化,既保持模型容量又能低成本运行。我们分析了天真训练的伪影,并提出两种有效的补救方法:将模型的内部表征与从真实数据中提取的语义特征进行对齐,以及采用基于新型Sinkhorn损失的两阶段微调策略。结果是生成了更清晰、更干净且能很好的泛化到分布外的深度图,在KITTI和ETH3D数据集上的AbsRel性能较之前最佳提高了16-26%。从定性来看,我们的模型能够处理以往模型难以捕捉的毛发、叶片以及细发边缘。此外,Marigold V2在应用于其他密集回归任务(如表面法线估计和固有图像分解)时,也达到了最先进水平。项目网站:此 https URL

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决单目深度估计(Monocular Depth Estimation)中几个长期存在且相互交织的关键问题,尤其是在基于生成式扩散模型(特别是扩散Transformer, DiT)的范式下: \*\*1. 细粒度几何细节丢失与边缘过平滑\*\* 现有的基于扩散模型的深度估计器,特别是依赖VAE(变分自编码器)的潜空间监督方法,普遍面临预测深度图过度平滑、边界模糊的问题。这导致在深度不连续处产生“飞像素”(flying pixels)现象,且难以重建精细结构(如毛发、 foliage、玻璃后景物、发丝级边缘),严重影响下游的三维重建与计算摄影应用。 \*\*2. 分布外泛化能力与数据规模瓶颈\*\* 判别式模型虽精度较高,但受限于百万级有标注深度数据的分布覆盖,在非朗伯表面、透明/反射材质、恶劣天气等分布外场景中精度显著下降。而生成式模型虽在十亿级图像上预训练、蕴含更丰富的世界几何先验,但将其适配为深度估计器时,高昂的训练成本(如DiT从头训练需数十GPU)阻碍了个体研究者与小规模实验室的可及性。 \*\*3. 噪声与模糊真值监督的困境\*\* 在合成数据集(如HyperSim)中,薄结构或透明物体的深度真值因渲染管线的随机采样而本质上是模糊、有噪声的。严格的像素级监督会迫使网络拟合这种随机噪声,反而损害深度图的整体连贯性与边界锐度,使得传统的像素级损失函数在此类区域失效。 \*\*4. 训练与推理的效率壁垒\*\* 早期基于多步扩散的深度估计方法推理延迟高、对噪声初始化敏感;后续单步前馈方法虽提速,但在DiT架构上微调仍需大量计算资源(如多卡GPU训练数日)。如何在保持模型容量的同时,以低成本(单张消费级GPU、数天训练)完成适配,是一个核心工程挑战。 为应对上述问题,该论文提出了 \*\*Marigold V2\*\*,通过一种轻量两阶段微调协议,将开源图像编辑DiT(Qwen-Image-Edit)重新定位为单目深度估计器。其核心贡献——\*\*iREPA-depth\*\*(从真值深度提取语义特征进行表示对齐)与 \*\*SinkLoss\*\*(基于Sinkhorn最优传输的块级匹配损失)——分别针对语义-几何一致性缺失与噪声真值下的边缘退化问题,最终在保持轻量训练成本的同时,实现了对尖锐细节与鲁棒几何的兼顾。 Q2: 有哪些相关研究? 根据论文第2节,相关研究可归纳为以下四个方向: ## 1. 判别式单目深度估计 早期方法依赖单域有监督训练(如 Eigen et al. 2014; Fu et al. 2018)、自监督学习(如 Godard et al. 2017, 2019; Poggi et al. 2020)或代理标注(如 Tosi et al. 2019)。随后,第二代方法通过混合数据集学习仿射不变深度,实现了零样本跨数据集泛化(如 Eftekhar et al. 2021; Ranftl et al. 2020, 2021)。第三代方法基于 Vision Transformers(如 Dosovitskiy et al. 2021; Oquab et al. 2024)与百万级数据,进一步推动了仿射不变深度(如 Lin et al. 2026; Yang et al. 2024a,b)、通用度量深度(如 Ganesan et al. 2026; Piccinelli et al. 2024, 2025)及视频深度估计(如 Chen et al. 2025; Piccinelli et al. 2026)的发展。然而,此类模型受限于训练数据的规模与分布覆盖,且难以妥善处理非朗伯面、透明或反射表面。 ## 2. 生成式先验用于单目深度估计 利用生成模型(尤其是扩散模型)的预训练先验进行深度估计的方法大致分为三类: - \*\*多步扩散范式\*\*:保留迭代采样过程(如 Fu et al. 2024; Gui et al. 2025; He et al. 2025b; Ke et al. 2024),但推理延迟高且对噪声初始化敏感。 - \*\*单步前馈网络\*\*:将骨干网络重构为单次前向传播(如 He et al. 2025b; Ke et al. 2025; Martin Garcia et al. 2025)。 - \*\*非纯微调策略\*\*:将粗糙模态估计作为辅助输入(如 Ye et al. 2024; Zhang et al. 2024),或扩展 VAE 以支持更广的输出模态(如 Krishnan et al. 2025; Xu et al. 2025b)。 随着生成社区从 U-Net(如 Rombach et al. 2022)迁移至 Diffusion Transformers(DiT)(如 Peebles and Xie 2023; Esser et al. 2024; BFL.ai 2024; Wu et al. 2025),模型 repurposing 成本显著上升:DICEPTION(Zhao et al. 2025)需 96 GPU-days,Lotus-2(He et al. 2025a)需 8 块 GPU。此外,Vision Banana(Gabeur et al. 2026)表明指令微调可激活生成模型中已有的几何理解能力。 ## 3. 用于深度估计的表示对齐 利用预训练视觉编码器的特征对扩散式深度估计器进行正则化,已成为弥合生成式与判别式表示差距的有效策略。REPA(Yu et al. 2025)与 iREPA(Singh et al. 2026)证明此类正则化可提升扩散模型的语义保真度与训练收敛性。在单目深度估计中: - \*\*DepthMaster\*\*(Song et al. 2026)将 U-Net 中间特征与从输入 RGB 提取的 DINOv2 表示对齐。 - \*\*Pixel-Perfect Depth\*\*(Xu et al. 2025a)通过 Semantics-Prompted DiT 将视觉基础模型的语义表示直接注入扩散过程。 上述方法均对齐从 RGB 输入提取的特征。与之相对,本文提出的 \*\*iREPA-depth\*\* 将从真值深度图(而非 RGB)提取的 DINOv3 特征作为对齐目标,为几何重建提供更直接的监督信号,且不引入推理时的额外依赖。 ## 4. 深度质量与伪影处理 深度图的实用价值不仅取决于整体精度,还依赖于边界重建的忠实度与细粒度表面细节。既有工作从不同角度对此进行了探索: - \*\*边缘感知损失\*\*(如 Yang et al. 2022)、\*\*架构改进\*\*(如 Bochkovskii et al. 2025)与扩散后处理可提升锐度,但难以可靠保留细粒度细节。 - \*\*SharpDepth\*\*(Pham et al. 2025)将生成模型的边界锐度蒸馏至判别式骨干,但预测结果在深度边缘处仍过平滑。 - \*\*InfiniDepth\*\*(Yu et al. 2026a)利用神经隐式场支持任意分辨率查询。 - \*\*Lotus-2\*\*(He et al. 2025a)采用 predictor-sharpener 设计缓解细节丢失,但代价是多步推理。 - \*\*Pixel-Perfect Depth\*\*(Xu et al. 2025a)在像素空间执行扩散以减少飞像素(flying pixels)伪影,但未能恢复细粒度细节。 现有方法尚未在单步、基于 VAE 的生成式框架内,同时解决\*\*细节保持\*\*与\*\*噪声/模糊真值下的鲁棒监督\*\*问题,这正是本文方法所针对的核心空白。 Q3: 论文如何解决这个问题? 该论文通过一套轻量、两阶段的微调协议,将开源图像编辑扩散Transformer(Qwen-Image-Edit)重新定位为零样本单目深度估计器。核心方法论围绕\*\*参数高效微调\*\*、\*\*跨空间监督\*\*与\*\*最优传输匹配\*\*展开,具体解决路径如下。 --- ### 1. 整体框架:单步推理与参数高效微调 为降低训练与推理门槛,论文采用以下工程基础: - \*\*单步Rectified Flow公式化\*\*:不同于传统多步扩散采样,模型在固定时间步 t=0.5 下直接回归潜空间速度场。给定RGB编码 z_I 与深度编码 z_d ,目标速度为 v = z_I - z_d ,DiT f_θ 被训练以最小化

L(latent) = | fθ(zI, t) - v |_2^2.
推理时仅需单次前向传播即可得深度潜码 z_d = z_I - f
θ(z_I, t) ,从而消除迭代去噪延迟。 - **4-bit量化与QLoRA**:对预训练DiT权重进行4-bit量化,并训练rank-128的QLoRA适配器。该配置将训练压缩至单张32GB GPU,数天内完成,显著降低了DiT repurposing的计算壁垒。 —- ### 2. Stage 1:建立全局几何与语义一致的强基线 第一阶段在冻结VAE的前提下微调DiT,联合潜空间、像素空间与语义特征空间的多重监督,解决细节丢失与收敛稳定性问题。 #### 2.1 仿射不变对数深度参数化 将度量真值深度 D 转换为归一化对数深度目标 d :

d = 2 ( (log(D + ε) - d2) / (d(98) - d2) - (1) / (2) ),
其中 d_2, d
(98) 分别为有效像素对数深度的第2与第98百分位数。该表示消除全局尺度与平移歧义,且对数域的 L1 惩罚在 |ε| ll 1 时近似于AbsRel误差,更契合评估指标。 #### 2.2 跨空间像素级监督 除潜空间MSE外,引入像素空间损失以直接约束解码后的几何质量: - **像素重建**: L(πx) = | d - d |1 - **空间梯度**: L(grad) = | ∇_x d - ∇_x d |_1 + | ∇_y d - ∇_y d |_1 #### 2.3 iREPA-depth:从真值深度提取的语义特征对齐 为解决复杂区域( foliage、灌木、重复纹理)中的结构不一致与细节丢失,论文提出 **iREPA-depth**。不同于既有方法将DiT中间特征与**RGB输入**的DINOv3特征对齐,iREPA-depth将DiT内部表示与从**真值深度图**本身提取的DINOv3语义特征进行对齐:

L(DiT) = λ(latent)L(latent) + λ(πx)L(πx) + λ(grad)L(grad) + λ(iREPA)L_(iREPA).
该策略为几何重建提供了更直接的语义监督,无需在推理时引入额外的视觉编码器,同时加速了收敛并改善了密集区域的视觉质量。 —- ### 3. Stage 2:基于SinkLoss的边缘精细化与噪声鲁棒性 针对透明物体、薄结构及渲染管线引入的真值噪声(如图4所示,HyperSim中薄结构的深度真值因随机采样而本质模糊),第二阶段在解冻VAE解码器的同时,引入一种基于最优传输的新型目标函数 **SinkLoss**。 #### 3.1 局部块级Sinkhorn匹配 SinkLoss放弃严格的像素级空间对应,转而在局部区域内进行集合级匹配: - 将图像划分为不重叠的 K × K 块(取 K=5 )。 - 在块内构建代价矩阵 C ∈ R^(K^2 × K^2) ,其中

C_(ij) = | d_i - d_j |.

  • 对无效像素(掩码 mi=0 )施加极大惩罚 B gg max(ij) C(ij) ,确保无效区域不参与监督。 通过熵正则化最优传输求解软分配矩阵 M :
    M = argmin
    (M ∈ U) langle M, C rangle - τ H(M),
    其中 U 为均匀边缘的传输多面体, H(M) 为香农熵, τ=0.1 。该问题通过Sinkhorn–Knopp迭代在log域稳定求解。 最终的SinkLoss为有效像素对的期望传输代价:
    L(SinkLoss) = ∑(ij) mi m_j M(ij) C(ij)∑(ij) mi m_j M(ij).

    3.2 作用机制与效果 - **抗噪声性**:由于仅要求局部块内预测深度值的**集合**与真值匹配(允许排列),网络无需拟合透明/边缘像素上的随机前景-背景噪声。 - **边缘锐化**:该约束鼓励模型生成具有清晰不连续面的连贯深度图,显著减少飞像素(flying pixels),同时保留毛发、 foliage 等高频细节(见图5、图7)。 —- ### 4. 向其他密集回归任务的迁移 上述两阶段协议具有良好的任务迁移性,仅需替换像素空间损失即可适配: - **深度补全**:冻结Stage-2权重,附加轻量rank-16 LoRA与可学习尺度/平移参数,在测试时通过稀疏深度测量进行少量梯度迭代(100步)。 - **表面法线估计**:将像素 L1 替换为角度损失,保留iREPA与SinkLoss(此时Sinkhorn代价基于角度距离)。 - **本征图像分解(反照率)**:以 L_1 损失与iREPA监督微调,实现高质量的albedo估计。 —- ### 总结 论文通过**Stage 1的iREPA-depth跨空间监督**建立语义与几何一致性的强先验,再通过**Stage 2的SinkLoss最优传输匹配**在噪声真值条件下锐化边缘、抑制伪影,并辅以**QLoRA量化的单步推理架构**保证训练与部署的经济性。该协议在解决细粒度细节丢失、噪声监督鲁棒性与计算可及性三大难题的同时,可无缝推广至法线估计、深度补全等其他密集预测任务。 Q4: 论文做了哪些实验? 论文的实验验证围绕**零样本单目深度估计**、**边缘质量评估**、**模块化消融分析**以及**跨任务迁移能力**四个维度展开,具体实验内容如下。 —- ### 1. 零样本仿射不变深度估计 在五个标准基准数据集上评估模型的零样本泛化能力,包括 NYUv2、KITTI、ETH3D、ScanNet 与 DIODE。预测通过与真值进行鲁棒的 RANSAC 尺度-平移对齐后,计算标准指标 **AbsRel**(平均绝对相对误差,越低越好)与 ** δ_1 **(预测值在真值 1.25 倍范围内的像素比例,越高越好)。 实验将 Marigold V2(Stage-2 检查点)与十余种判别式及生成式方法对比,涵盖 Depth Anything V2、MoGe、 π^3 、Marigold V1、GeoWizard、DepthFM、Lotus-2、Pixel-Perfect Depth(PPD)、InfiniDepth、FE2E 等。结果表明,Marigold V2 在训练数据量相当(74K)的方法中取得最优表现,尤其在 ETH3D 上达到 **AbsRel 2.8**,相较此前最佳结果(3.8)有显著优势。 —- ### 2. 边缘感知评估 为定量衡量细粒度几何细节保留与飞像素(flying pixels)抑制能力,在 **HyperSim** 合成测试集上计算 **Soft Edge Error(SEE _k )**。该指标首先识别深度不连续边界像素,随后计算预测视差与局部 k × k ( k ∈ 3,5,7 )窗口内真值视差的最小绝对误差,允许边界附近的小范围空间容差。 对比方法包括专为细节保留设计的 PPD 与 InfiniDepth。Marigold V2 在 SEE3、SEE5、SEE7 三项指标上均为最佳,证明其在尖锐边缘与薄结构处的重建优势。 —- ### 3. 消融研究(Analysis and Ablation Studies) #### 3.1 Stage 1 损失组件消融 控制训练步数为 30K,逐层验证各损失项的贡献: - **基线**:仅潜空间 MSE 损失 L(latent) ; - **+ 像素损失**:加入 L(πx) 与 L(grad) ; - **+ iREPA-RGB**:将 DiT 特征与 RGB 输入的 DINOv3 特征对齐; - **+ iREPA-depth**:将 DiT 特征与**真值深度图**的 DINOv3 特征对齐。 结果(表 3)显示,iREPA-depth 在所有数据集上均取得最低的 AbsRel 与最高的 δ_1 。进一步将训练延长至 **160K 步**后,iREPA-depth 仍保持优势,且定性结果表明其能显著减少视觉伪影、改善密集 foliage 等复杂区域(图 3)。 #### 3.2 深度参数化方式比较 在统一配置下比较三种目标深度表示: - 线性深度(Linear Depth) - 视差(Disparity) - 对数深度(Log Depth) 实验(表 4)验证了对数深度的优越性:其在平均 AbsRel 与 δ_1 上均优于其他两种表示,这与对数域 L_1 误差在一阶近似下等价于相对深度误差的理论分析一致:

log x(pred) - log x(gt) = log(1 + x(pred) - x(gt)x(gt)) ≈ x(pred) - x(gt)x(gt) = ε.

3.3 骨干网络迁移实验 为验证训练策略与骨干网络无关,将相同的损失配方(含/不含 SinkLoss)应用于: - **Stable Diffusion V1.5**(U-Net 架构) - **FLUX.2 klein**(DiT 架构) - **Qwen-Image-Edit-2509**(本文默认 DiT 架构) 表 5 的 HyperSim 边界敏感指标显示,SinkLoss 在所有骨干上均一致降低 SEE3/5/7,证明该方法具有良好的迁移性,增益来源于训练配方而非特定骨干的先验。 #### 3.4 Stage 2 组件消融 以 Soft Edge Error 为指标,系统分析 Stage 2 的贡献: - **Stage 1 检查点**作为基准; - **Stage 2 无 SinkLoss**:仅解冻 VAE 解码器继续训练; - **Stage 2 有 SinkLoss**:加入 SinkLoss 与解冻 VAE。 图 5 与图 7 显示,SinkLoss 在**不损害 AbsRel 与 δ_1 **的前提下,大幅改善 SEE 指标。消融确认:单纯解冻 VAE 对边缘提升有限,而 SinkLoss 是减少飞像素、保留毛发/ foliage 等薄细节的关键。 #### 3.5 推理延迟与显存占用 在单张 32GB GPU 上,对比不同模型在 ** 1024 × 1024 ** 与 ** 2048 × 2048 ** 分辨率下的延迟(秒)与峰值显存(GB)。参试模型包括 InfiniDepth、PPD、Lotus-2(含/不含 sharpener)、FE2E 与 Marigold V2。 结果表明,Marigold V2 在 1024 × 1024 下速度优于 Lotus-2 与 FE2E,慢于 InfiniDepth;在 2048 × 2048 下,PPD、Lotus-2 与 FE2E 均出现 OOM(显存溢出),而 Marigold V2 仍可运行(9.6 秒,29.3 GB),展现出更优的高分辨率可扩展性。 —- ### 4. 其他密集回归任务迁移 #### 4.1 深度补全(Depth Completion) 冻结预训练的仿射不变深度先验,在测试时附加一个零初始化的 rank-16 LoRA 与两个可学习标量(尺度 a 与平移 b ),通过稀疏深度测量进行 **100 步 Adam 迭代**适配。在 **iBims-1、NYUv2、KITTI-DC、DDAD** 上评估 MAE、RMSE、AbsRel 与 δ_1 。 实验对比了 Marigold-DC、Marigold-SSD、CAPA、LDCM。结果显示,Marigold V2 基础测试时适配已具备竞争力;结合**高分辨率推理**(Lanczos 上采样)与**分块局部适配**(Tiling)后,在全部四个数据集上取得最低 RMSE,并在 KITTI-DC 与 DDAD 上达到最佳或次佳的 AbsRel 与 δ_1 。 #### 4.2 透视深度(See-Through Depth) 针对玻璃等透明表面后的几何估计,使用 LayeredDepth-Syn 数据集的 l_8 (最深层)对模型进行 30K 步微调。在 LayeredDepth-Syn l_8 验证集上,透视深度模型的 **AbsRel 从 13.66 降至 8.17**,** δ_1 从 83.96 提升至 92.65**,有效克服了基线模型偏向玻璃表面深度的偏差。 #### 4.3 表面法线估计(Surface Normal Estimation) 将像素空间损失替换为预测法线与真值法线之间的**角度损失**,保留 iREPA 并引入 SinkLoss(此时 Sinkhorn 代价基于 L_1 角度距离)。在 **NYUv2、ScanNet、iBims-1、Sintel** 上评估平均角度误差(MeanErr)与 11.25^circ 准确率。 与 DSINE、GeoWizard、StableNormal、Lotus-2、FE2E 等方法对比,Marigold V2 取得具有竞争力的结果。此外,定义 **Soft Angular Edge Error(SAEE)** 以评估边界处的角度一致性;消融实验(表 10)表明 SinkLoss 在所有 SAEE 指标上均带来一致改善。 #### 4.4 反照率估计(Albedo Estimation) 以 HyperSim 训练集对基模型进行 30K Q5: 有什么可以进一步探索的点? 基于论文结论与实验分析,以下方向具有进一步探索的价值: —- ### 1. 实时推理与模型轻量化 当前 Marigold V2 以 Qwen-Image-Edit 这一大型 DiT 为骨干,尽管通过 QLoRA 与单步推理降低了成本,但其延迟与显存占用仍不适用于实时系统。未来可探索: - 将生成先验**蒸馏至轻量级判别式骨干**(如 MobileViT 或 CNN),在保持细节质量的同时实现毫秒级推理; - 开发面向 DiT 的**专用推理加速技术**(如稀疏注意力、Token 剪枝或神经架构搜索),进一步压缩计算图。 —- ### 2. 不确定性量化与歧义区域显式建模 论文指出,**反射、运动模糊与散焦区域**的深度仍然具有本质歧义。现有方法输出点估计,无法告知用户何处不可信。引入**不确定性估计机制**(如贝叶斯深度学习、集成方法或在潜空间建模显式不确定性头)可: - 在自动驾驶或增强现实等安全关键应用中提供置信度掩码; - 指导主动感知系统在这些区域采集额外观测(如多视角或传感器融合)。 —- ### 3. 多层深度与透明介质几何重建 Marigold V2 在 See-Through Depth 任务上仅对 LayeredDepth-Syn 的最深层 l_8 进行了初步微调,尚未建模透明表面的**完整深度分层**。未来工作可: - 扩展至**完整多层深度估计**(如同时预测玻璃表面与其后景几何); - 结合语义分割先验,区分玻璃、水面、雾等透明/半透明介质,并学习其物理折射属性。 —- ### 4. 视频深度估计与时序一致性 当前方法为**单帧推理**,未利用时序信息。对于动态场景,相邻帧的深度估计可能出现抖动。将 Marigold V2 扩展至视频领域时,可研究: - 在 DiT 中注入**时序位置编码**或跨帧注意力,保持帧间深度一致性; - 利用视频生成模型(如视频扩散 Transformer)的预训练先验,替代静态图像编辑模型,以原生支持运动与遮挡推理。 —- ### 5. 统一多任务密集预测框架 论文通过替换像素空间损失,将同一协议分别应用于深度、法线、反照率与深度补全,但各任务**独立训练**。未来可探索: - **单模型联合训练**:让单一 DiT 同时输出深度、法线、反照率乃至语义分割,利用任务间的几何-光照耦合关系提升各任务性能; - 研究不同密集模态在 DiT 特征空间中的**共享表示结构**,优化多任务适配器的参数效率。 —- ### 6. 任意分辨率推理与高边界保真度 尽管 Marigold V2 支持 2048 × 2048 推理,但仍受限于 VAE 固定下采样率的离散潜空间网格。结合 InfiniDepth 等工作的启示,可进一步研究: - **神经隐式场或坐标网络**与 DiT 潜空间耦合,实现连续坐标上的任意分辨率查询; - 在保持 SinkLoss 边缘锐化优势的同时,消除 VAE 上采样引入的块状伪影,达到像素级完美边界。 —- ### 7. 训练数据规模与分布外鲁棒性 当前训练仅依赖 **HyperSim + vKITTI(共 74K 样本)**。虽然小数据量已展现强泛化性,但在极端分布外场景(如夜间、恶劣天气、非朗伯材质)仍有提升空间: - 纳入**十亿级合成数据**或大规模真实世界无标/弱标视频,通过自监督或半监督方式扩大覆盖; - 针对传感器噪声与真实世界采集伪影,设计更鲁棒的 SinkLoss 变体,使其在**带噪真实标签**上仍能学习锐化边界。 —- ### 8. 从其他生成基础模型迁移 本文验证了基于 Qwen-Image-Edit 的适配,但生成模型生态仍在快速演进。可进一步探索: - **3D 原生生成模型**(如 3D-aware diffusion 或 Gaussian Splatting 生成器)的几何先验,其内部表示可能蕴含更精确的空间结构; - **视频/多模态大模型**(如视频编辑 Transformer 或视觉-语言模型)作为起点,利用其跨模态对齐能力提升几何推理的语义一致性。 Q6: 总结一下论文的主要内容 这篇论文提出了 **Marigold V2**,一种基于扩散 Transformer(DiT)的单目深度估计方法,通过轻量两阶段微调协议将开源图像编辑模型(Qwen-Image-Edit)重新定位为高性能密集几何预测器。以下是对主要内容的系统总结。 —- ### 1. 研究背景与核心挑战 单目深度估计是从单张图像恢复三维几何的 ill-posed 问题。近期基于生成式扩散模型的方法凭借十亿级预训练数据展现出强大泛化能力,但仍面临三个未解决的关键瓶颈: - **细粒度细节丢失与边缘过平滑**:基于 VAE 的潜空间监督导致预测深度图模糊,在物体边界产生“飞像素”(flying pixels),难以重建毛发、 foliage、发丝级结构。 - **训练与推理成本高昂**:DiT 架构复杂,现有微调方案需多卡 GPU 与数周时间,个体研究者难以复现。 - **噪声与模糊真值的鲁棒监督缺失**:合成数据(如 HyperSim)中薄结构或透明物体的深度真值因渲染随机采样而本质含噪,严格像素级损失迫使网络拟合随机噪声,损害深度图连贯性。 —- ### 2. Marigold V2 总体框架 论文提出一种**低成本、单步推理**的微调协议,仅需**单张 32GB GPU 与数天训练**即可完成适配。核心设计包括: - **骨干网络**:Qwen-Image-Edit-2509(图像编辑 DiT)。 - **参数高效训练**:4-bit 量化 + rank-128 QLoRA 适配器,显著降低显存占用。 - **单步 Rectified Flow**:固定时间步 t=0.5 ,将 RGB 潜码直接映射为深度潜码,推理无需迭代去噪:

zd = z_I - fθ(z_I, t).

  • **两阶段渐进微调**:Stage 1 建立全局几何与语义一致性;Stage 2 专门锐化边缘并抑制伪影。 —- ### 3. 关键技术创新 #### 3.1 Stage 1:iREPA-depth 与跨空间监督 为加速收敛并提升复杂区域(如 foliage、重复纹理)的结构保真度,Stage 1 联合三类监督: - **潜空间损失**: L(latent) = | fθ(zI, t) - (z_I - z_d) |_2^2 ; - **像素空间损失**: L_1 重建损失 L(πx) 与空间梯度损失 L_(grad) ,直接约束解码后几何; - **iREPA-depth**:一种改进的表示对齐策略。不同于既有方法将 DiT 特征与 **RGB 图像** 的 DINOv3 特征对齐,iREPA-depth 将 DiT 内部表示与从 **真值深度图** 提取的 DINOv3 语义特征对齐。这为几何重建提供了更直接的语义监督,无需推理时引入额外编码器,并显著改善密集区域的视觉质量。 Stage 1 总目标函数为:

L(DiT) = λ(latent)L(latent) + λ(πx)L(πx) + λ(grad)L(grad) + λ(iREPA)L_(iREPA).

3.2 Stage 2:SinkLoss 与边缘精细化 针对薄结构、透明物体及渲染噪声导致的真值模糊问题,Stage 2 在**解冻 VAE 解码器**的同时引入 **SinkLoss**。该损失放弃严格的逐像素空间对应,转而在局部 K × K 块内通过 **Sinkhorn 最优传输** 进行集合级匹配: - 构建块内预测深度与真值深度的代价矩阵 C_(ij) = |d_i - d_j| ; - 通过熵正则化最优传输求解软分配矩阵 M ; - 最终损失为有效像素对的期望传输代价:

L(SinkLoss) = ∑(ij) mi m_j M(ij) C(ij)∑(ij) mi m_j M(ij).
SinkLoss 仅要求局部区域内预测深度值的**集合**与真值匹配(允许排列),使网络无需拟合透明/边缘像素上的随机前景-背景噪声,从而在保持 AbsRel 与 δ_1 的同时,显著减少飞像素并锐化边界。 —- ### 4. 实验验证 #### 4.1 零样本深度估计 在 NYUv2、KITTI、ETH3D、ScanNet、DIODE 上进行零样本评估(与真值做 RANSAC 仿射对齐)。在训练数据量相当(74K)的方法中,Marigold V2 达到 **SOTA**,尤其在 ETH3D 上取得 **AbsRel 2.8**,较此前最佳结果提升约 26%。 #### 4.2 边缘质量评估 在 HyperSim 测试集上计算 **Soft Edge Error(SEE _k )**。Marigold V2 在 SEE3、SEE5、SEE7 上均优于 Pixel-Perfect Depth 与 InfiniDepth,证明其在细粒度边界重建上的优势。 #### 4.3 消融与效率分析 - **Stage 1 消融**:iREPA-depth 在所有配置下均优于 RGB 特征对齐与无特征对齐基线;对数深度参数化在 AbsRel 与 δ_1 上均优于线性深度与视差。 - **Stage 2 消融**:SinkLoss 在 Stable Diffusion、FLUX.2、Qwen 三种骨干上均一致降低 SEE 指标,验证其迁移性。 - **效率**:在 2048 × 2048 分辨率下,PPD、Lotus-2、FE2E 均 OOM,而 Marigold V2 可在单张 32GB GPU 上运行(9.6 秒)。 #### 4.4 跨任务迁移 将同一两阶段协议迁移至其他密集回归任务,均取得 SOTA 或强竞争力结果: - **深度补全**:测试时附加轻量 LoRA 与可学习尺度/平移,结合高分辨率推理与分块适配,在 iBims-1、NYUv2、KITTI-DC、DDAD 上取得最低 RMSE。 - **透视深度**:针对玻璃后几何微调,AbsRel 从 13.7 降至 8.2。 - **表面法线估计**:在 NYUv2、ScanNet、iBims-1、Sintel 上表现优异;SinkLoss 同样改善 Soft Angular Edge Error。 - **反照率估计**:在 HyperSim 上取得最佳 PSNR 与 LPIPS。 —- ### 5. 主要贡献与结论 论文的核心贡献可概括为: 1. **Marigold V2 微调协议**:一种经济可行的方案,将开源图像编辑 DiT 转化为 SOTA 单目深度估计器,单个消费级 GPU 数天即可完成训练。 2. **iREPA-depth**:通过将 DiT 特征与真值深度的语义特征对齐,提升几何一致性与训练收敛速度。 3. **SinkLoss**:基于 Sinkhorn 最优传输的块级匹配损失,有效处理噪声真值,锐化深度边缘并保留细粒度细节。 Marigold V2 表明,通过精心设计的轻量适配策略,开放生成模型的几何先验可被高效蒸馏为高质量、低伪影的密集预测器,且该范式可广泛推广至深度补全、法线估计、本征分解等视觉任务。论文同时指出,未来可在**实时推理、不确定性量化、多层透明介质重建、视频时序一致性**等方向进一步拓展。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Igor Pavlovic,Thiemo Wandel,Anton Obukhov,Luca Bartolomei,Andrey Davydov,Fabio Tosi,Matteo Poggi,Sabine Süsstrunk,Dengxin Dai

Categories:

PDF URL: https://arxiv.org/pdf/2609.08084.pdf

Arxiv URL: https://arxiv.org/abs/2609.08084

Arxiv ID: 2609.08084

CoolPaper URL: https://papers.cool/arxiv/2609.08084

Published: 2026-09-10T01:26:57.405Z

Updated: 2026-09-10T01:26:57.405Z


9. Miles v0.1: Production-Level Post-Training

Abstract:We present Miles v0.1, a full-stack, production-ready system for frontier post-training. Building upon the clean design of slime, Miles designs each stage of the reinforcement-learning (RL) training loop around a single principle: components should be verified, clean, and customizable. With accuracy, efficiency, reliability, and scalability as first-class goals, Miles aims to make frontier-scale RL accessible to researchers and enterprises alike. This report walks through the system end to end: rollout engines built on SGLang, a trainer with a choice of two backends (NVIDIA Megatron-LM and PyTorch FSDP), and three weight-synchronization transports for different deployment topologies. Beyond full-parameter RL, Miles also supports LoRA RL, on-policy distillation, supervised fine-tuning, and true-on-policy rollout-training alignment, and extends the same architecture to diffusion models. We close with an end-to-end case study: fully asynchronous agentic RL on a GLM-5.2 744B-A40B model over terminal-use coding tasks, running on 64 NVIDIA GB300 GPUs with a median step time of 263 seconds over the first 30 measured steps. Miles is open-sourced at this https URL, with the project website at this https URL.

中文摘要

摘要:我们介绍了 Miles v0.1,这是一个面向前沿后训练的全栈、生产就绪系统。在 Slime 的简洁设计基础上,Miles 将强化学习(RL)训练循环的每个阶段设计围绕一个原则:组件应当经过验证、干净且可定制。Miles 以准确性、效率、可靠性和可扩展性为一流目标,旨在让前沿规模的 RL 可被研究人员和企业轻松使用。本报告从头到尾介绍了该系统:基于 SGLang 的 rollout 引擎、拥有两种后端选择(NVIDIA Megatron-LM 和 PyTorch FSDP)的训练器,以及针对不同部署拓扑的三种权重同步传输方式。除了全参数 RL,Miles 还支持 LoRA RL、策略内蒸馏、监督微调以及真正的策略内 rollout-训练对齐,并将相同架构扩展到扩散模型。我们最后给出了一个端到端案例研究:在 GLM-5.2 744B-A40B 模型上进行完全异步的智能体 RL,用于终端使用的编码任务,在 64 个 NVIDIA GB300 GPU 上运行,前 30 个测量步骤的中位步时为 263 秒。Miles 已在此 https URL 开源,项目网站为此 https URL。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*前沿规模(frontier-scale)强化学习后训练(post-training)所面临的系统性挑战\*\*,核心目标是在保证数值准确性的同时,提升端到端训练效率、可靠性与可扩展性。具体而言,论文试图解决以下几个关键问题: ### 1. 端到端硬件利用率低下 传统 RL 训练采用“生成—更新”交替执行的同步模式,导致严重的 GPU 空闲(bubble)。在前沿场景中,rollout 往往涉及多轮交互、工具调用和长上下文,单条轨迹的生成时间差异极大;同步等待最慢的轨迹会使大部分算力闲置。论文提出\*\*全异步 RL\*\* 架构,将 rollout 生成与训练解耦到独立的 GPU 池,使两者能够并发推进,从而消除因单条慢速轨迹导致的整批空闲。 ### 2. 训练与 rollout 之间的数值不匹配(Train–Rollout Mismatch) 由于推理引擎(SGLang)与训练后端(Megatron-LM / FSDP)使用不同的内核、精度、批处理形状和并行策略,二者即使面对相同的权重,也可能为同一 token 计算出不同的概率。这种差异会累积放大,导致重要性比率

r = exp(log π(train) - log π(rollout))
偏离 1,进而破坏梯度质量甚至导致训练崩溃。论文通过以下手段系统性缓解该问题: - **Token-In-Token-Out (TITO)**:确保训练器看到的 token 序列与推理引擎实际采样的完全一致; - **Rollout Routing Replay (R3)**:在 MoE 模型中精确复现推理阶段的专家路由,避免训练时 token 被发送到错误的专家; - **True-On-Policy Alignment**:在支持的模型上,通过确定性、批次不变的内核与逐位一致的浮点行为,使训练与 rollout 对采样 token 的对数概率差异严格为零。 ### 3. 大规模模型权重同步的传输瓶颈 在分布式部署中,每次训练步骤后需将更新后的权重同步到所有 rollout 引擎。对于万亿参数级别的 MoE 模型,全量广播(NCCL broadcast)可能成为步骤时间的主导项。论文设计了三种权重传输机制——**NCCL 广播、点对点 RDMA(P2P)以及基于增量差异的磁盘同步(disk-delta)**——以适应不同的部署拓扑,并通过分桶(bucketed)流水线、主机侧重分片(re-sharding)和差异编码(XOR / overwrite)显著降低同步开销。 ### 4. 低精度训练的全阶段一致性 使用 FP8 / NVFP4 等低精度格式可显著提升矩阵乘法吞吐,但若推理与训练阶段的量化逻辑不一致,会引入额外的数值差异。论文提出**端到端精度契约(precision contract)**,要求 checkpoint 转换、训练前向、推理 rollout 和实时权重导出四个阶段采用完全一致的量化器与分块缩放策略,确保低精度不会加剧 train–rollout mismatch。 ### 5. 显存容量限制下的训练可扩展性 大模型的权重、梯度与优化器状态(如 Adam 的 FP32 主权重和二阶矩)极易超出 GPU HBM 容量。论文提供了两级显存卸载机制: - **Actor 卸载(offloading the paused actor)**:在训练 actor 暂停时将其完整状态搬离 GPU; - **优化器状态流式存储(streaming optimizer state to disk)**:将优化器状态分桶存盘,仅在更新时按需加载,使 GPU 无需同时驻留完整优化器状态。 ### 6. 多轮 Agentic 环境与复杂后训练范式的工程集成 现有框架往往假设单轮补全(single-turn completion),难以支持多轮工具调用、沙盒环境与多样化奖励计算。论文通过**三层嵌套插件架构(agent / generate / rollout function)**兼容不同控制范围的外部环境框架,并将 LoRA RL、策略蒸馏(OPD)、监督微调与扩散模型后训练统一在同一套组件之上,避免为每种算法重写训练循环。 ### 7. Day-0 模型与多厂商硬件的验证覆盖 新架构模型与不同厂商 GPU(NVIDIA / AMD)的快速适配缺乏系统化验证。论文明确记录了模型支持等级(从完整训练曲线到仅单元测试)与硬件精度映射关系(如 MXFP8 / NVFP4 仅限 Blackwell,FP8 blockwise 支持 Hopper / Blackwell / AMD MI350X 等),使研究者能判断给定配置下运行是否可行。 综上,Miles v0.1 试图构建一个**数值可验证、组件可替换、部署可扩展**的全栈后训练系统,核心矛盾在于**协调延迟敏感的生成推理与吞吐敏感的训练优化**,并在万亿参数、多轮 Agentic、MoE、低精度等前沿设定下维持这一目标。 Q2: 有哪些相关研究? 与 Miles v0.1 直接相关的研究可按照技术主题归纳为以下几类。 ### 1. 后训练系统与推理引擎 - **slime**

1
:THUDM 提出的 LLM 后训练框架,Miles 在其简洁设计基础上构建了生产级全栈系统。 - **SGLang**
2
:用于结构化语言模型程序的高效执行框架,Miles 的 rollout 引擎即基于 SGLang 构建,利用其 serving stack 与 agentic 负载优化实现高吞吐推理。 ### 2. 分布式训练后端 - **Megatron-LM**

3
:NVIDIA 提出的基于模型并行的多十亿参数训练系统,是 Miles 的默认训练后端,支持张量、流水线、上下文与专家并行。 - **PyTorch FSDP**
4
:PyTorch 全分片数据并行方案,Miles 将其作为替代后端,用于直接加载 Hugging Face 格式模型或快速验证新架构。 ### 3. 低精度训练与量化 - **LoRA**

5
:低秩适配方法,Miles 将其集成到 RL 循环中,仅训练适配器并冻结基座权重。 - **Four Over Six**
23
:针对 NVFP4 块量化的自适应缩放策略,Miles 在端到端精度契约中采用该方案以降低量化误差。 - **FP8 / MXFP8 / NVFP4 实践**
20, 21, 22
:Miles 团队发表的系列工作,分别介绍了统一 FP8、INT4 QAT 以及 Blackwell 原生 8/4-bit 端到端 RL 训练方案。 ### 4. RL 算法与优化目标 - **GRPO**

6
:Group Relative Policy Optimization,DeepSeekMath 提出,是 Miles 支持的群组相对优势估计器之一。 - **GSPO**
25
:Group Sequence Policy Optimization,扩展了 GRPO 的序列级优化视角。 - **REINFORCE++**
26
:无学习价值函数的 critic-free 策略优化方法。 - **PPO**
27
:近端策略优化,Miles 支持带学习价值函数的 PPO 变体。 - **DAPO**
43
:开源大规模 LLM 强化学习系统,Miles 在蒸馏与对齐实验中以其作为评估基准。 ### 5. 训练-推理一致性与确定性计算 - **Stabilizing MoE RL by Aligning Training and Inference Routers**

19
:Ma 等人指出 MoE 中推理与训练的路由差异会导致训练失稳甚至崩溃,并提出了 **Rollout Routing Replay (R3)**,Miles 实现了该机制以精确复现 rollout 专家分配。 - **FlashAttention-3**
44
:Miles 在 true-on-policy alignment 中采用该注意力内核,以确保推理与训练的逐位一致性。 - **Defeating Nondeterminism in LLM Inference**
45
:Horace He 讨论了批次不变性(batch invariance),Miles 借鉴此思想选择不随批次大小改变输出的矩阵乘法内核。 ### 6. 知识蒸馏 - **On-Policy Distillation (OPD)**

40
:由 Kevin Lu 提出,让学生模型在其自身轨迹上训练,教师模型提供逐 token 的反向 KL 信号。 - **Rethinking On-Policy Distillation**
41
:Li 等人进一步提出 top-K 变体,在部分 token 集合上估计散度,Miles 的 top-K OPD 实现即源于此。 ### 7. 扩散模型后训练 - **Flow-GRPO**

48
:将在线 RL 引入流匹配扩散模型的训练框架。 - **DiffusionNFT**
49
:基于前向过程的在线扩散强化学习方法。 - **SD3.5**
50
、**Wan2.2**
47
、**LTX-2.3**
52
、**Cosmos 3**
53
、**Qwen-Image**
51
:Miles-Diffusion 支持的主流图像/视频扩散模型。 ### 8. 环境与评估框架 Miles 集成或兼容了多种 agent 环境接口,包括 **Harbor**

7
、**NeMo Gym**
8
、**OpenEnv**
9
、**HUD**
10
、**Strands Agents**
11
、**τ-bench**
12
、**Prime Intellect Verifiers**
13
;以及沙盒后端 **AgentENV**
14
、**Daytona**
15
、**E2B**
16
、**Modal**
17
。 ### 9. 前沿语言模型 Miles 提供 day-0 或已验证支持的模型涵盖 **Kimi K2/K2.5/K3**

28, 34, 55
、**DeepSeek-V3/V3.2/V4**
56, 60
、**GLM-5/5.1/5.2**
31, 36
、**Qwen2.5/3/3.5/3.6/3.8**
32, 30, 37, 38, 57
、**Nemotron 3 Ultra**
59
、**Inkling**
39, 58
、**Gemma 4**
62
、**gpt-oss**
33
与 **MiniMax H3**
54
等。 此外,在工程实现层面,Miles 还参考了 **Megatron Bridge**
24
以实现 Hugging Face 与 Megatron-LM 格式互转,以及 **USP**
46
用于长视频序列的序列并行。 Q3: 论文如何解决这个问题? Miles v0.1 通过**全栈、模块化、可验证**的设计,对上述问题给出了系统性的工程解决方案。以下按照技术环节分述其核心机制。 ### 1. 全异步执行架构消除 GPU 空闲 针对同步“生成—更新”交替导致的硬件空转,Miles 采用**完全异步 RL(fully asynchronous RL)**: - **离散化部署(disaggregated placement)**:rollout 引擎与训练器各占独立的 GPU 池,从根本上解除两者的执行耦合。 - **有界数据缓冲区(bounded data buffer)**:完成的轨迹组先进入缓冲区,训练器按需取批。缓冲区吸收两阶段的速率差异,同时通过 staleness 阈值、用户过滤器和生成超时三种条件决定数据是否弃用。 - **样本粒度 replenishment**:默认采用 sample granularity 规则,单个轨迹完成即释放槽位并启动新轨迹,保持并发请求数接近上限,避免因组内个别长轨迹阻塞整组。 - **三种异步评估模式**:共享 rollout 引擎(暂停生成)、专用评估集群或外部快照服务,使评估不阻塞训练主线。 ### 2. 三层数值保真机制消除训练-推理不匹配 为消除推理引擎(SGLang)与训练后端(Megatron/FSDP)在相同权重下输出概率不一致的问题,Miles 从数据结构、路由重放到逐位精确对齐逐层加固: - **Token-In-Token-Out (TITO) 会话服务器**:由 Miles 而非外部 harness 控制 tokenization。服务器逐轮精确记录引擎返回的 token IDs、log-probabilities 与 routed experts,并复用最深可用 checkpoint 仅对新后缀编码,保证训练器重构的序列与采样轨迹完全一致。支持线性(单轨迹)与分支(多轨迹)两种会话扩展规则,并提供可配置的 replay 比较策略以适配不同 agent 框架的消息序列化差异。 - **Rollout Routing Replay (R3)**:针对 MoE 模型,将 rollout 阶段每层每个 token 的 top-k 专家分配作为轨迹数据的一部分保存。训练前向时直接重放这些分配,避免推理与训练因精度、内核差异导致路由不一致,从而防止梯度更新发送到未参与采样的专家。对于长序列,该数据以 (tokens-1) × layers × k 个 32-bit 整数存储。 - **True-On-Policy Alignment**:在支持的模型(如 dense Qwen3)上,通过以下手段实现训练器与引擎对采样 token 的 log-probability **绝对差异为零**: - 统一使用 FlashAttention-3 并确保其 prefill 与 decode 路径逐位一致; - 采用**批次不变(batch-invariant)**的矩阵乘法内核,消除批大小差异带来的数值扰动; - Megatron 侧替换融合算子为本地实现,禁用融合 rotary-embedding 与 bias-SwiGLU,并遵循 per-model kernel contract 匹配 SGLang 实现; - 启用 SGLang 确定性推理模式,cuBLAS、Transformer Engine 与 NCCL 均配置确定性执行; - 推理引擎在序列完成后以 prefill 方式重新评分,确保与训练的计算形状一致。 对于无法完全消除的剩余不匹配,目标函数层提供 **Truncated Importance Sampling (TIS)**(将重要性比率

r = exp(log π(train) - log π(rollout))
钳位至 $
0, 2
区间作为权重)与 Clip-or-pop(区间外 token 的梯度权重置零)两种修正策略,并监控 pre-clamp ratio、clipped fraction 和 mean absolute deviation |r-1| 。 ### 3. 多级权重传输系统突破同步瓶颈 针对每次训练步后全量广播万亿参数权重的高开销,Miles 设计了共享分桶流水线,并提供三种传输方式按需选择: - 共享分桶流水线:Megatron 后端将权重按 512 MB 桶聚合,先 all-gather 张量并行切片,再转换为 Hugging Face 布局。对于 MoE 的 routed expert 权重,采用独立的 expert pass,延迟 expert-parallel gather 至 flush 时刻,以控制传输体积。 - NCCL 广播(默认):通过异步 NCCL broadcast 将桶发送到每个 rollout rank,适合共享 NCCL fabric 的场景。 - 点对点 RDMA(P2P):训练 rank 直接通过 RDMA 写入 rollout rank 内存。通过传输计划(transfer plan)将目标 rank 均匀分配给发送方;在 CPU 内存中构建与目标并行布局一致的 SGLang 模型副本以完成主机侧重分片;使用单一固定 pinned buffer staging 数据。当训练与 rollout 集群均跨多节点时,P2P 可将权重更新时间降低 85% 以上(如 GLM-5 从 58.30 s 降至 8.48 s)。 - Disk-Delta 更新:利用相邻 RL 步的稀疏修改特性,仅传输变更字节。系统以共享文件系统为中介,支持 XOR(默认,体积更小)与 Overwrite(幂等,更安全)两种编码。rollout 主机从共享基线 checkpoint 出发,按需拉取增量并打补丁,无需训练与推理节点间存在直接网络 fabric。 ### 4. 端到端低精度契约保障量化一致性 为避免低精度格式加剧训练-推理不匹配,Miles 实施端到端精度契约,要求 checkpoint 转换、训练前向、SGLang rollout、实时权重导出四个阶段使用完全相同的量化逻辑与位精确量化器: - 支持 FP8 blockwiseMXFP8NVFP4(E2M1,内嵌 E4M3 块缩放),以及 INT4 QAT 与“BF16 训练 + FP8 服务”的过渡模式。 - 允许按层范围和张量名称在四阶段统一覆盖精度回退(如 final transformer layers、shared experts 等保持 BF16)。 - 对 NVFP4 提供可选的 dequantized backward(反向 GEMM 在 BF16 执行以换取梯度稳定性)与 four-over-six 自适应块缩放策略,且两者均在训练与推理侧同步启用。 ### 5. 分层显存卸载支撑超大模型训练 当权重、梯度与优化器状态超出 GPU HBM 时,Miles 提供两级可组合的卸载机制: - 暂停 Actor 卸载(offloading the paused actor):在训练 actor 暂停期间(如 colocated 部署中让位给 rollout 引擎),通过 allocator 级别将整个 actor 状态(权重、梯度缓冲、优化器状态)搬至固定主机内存或节点本地磁盘。Megatron 后端支持磁盘流式卸载(通过固定 staging buffer 控制内存),FSDP 后端仅支持主机内存。 - 优化器状态流式存储(streaming optimizer state to disk):将参数划分为桶,每桶的优化器状态独立存盘。训练步中仅在更新该桶参数时加载对应状态,使 GPU 无需同时驻留全部 Adam 状态。可进一步将流式 Adam 矩降至 BF16 精度以节省带宽。与 actor 卸载组合时,可显著缩短卸载/恢复时间(如 Qwen3-30B-A3B 上从 24 s / 8.9 s 降至 5.2 s / 1.3 s)。 ### 6. 可插拔后端与目标函数统一训练逻辑 - 双训练后端NVIDIA Megatron-LM 作为默认后端,支持 TP × PP × CP Q4: 论文做了哪些实验? 论文报告的实验与验证可划分为端到端案例研究系统组件消融算法与精度验证、以及跨模型/硬件覆盖验证四类。 ### 1. 端到端案例研究:GLM-5.2 Agentic RL(第 9 节) 这是论文的核心系统级实验,在 64 张 NVIDIA GB300 GPU 上运行完全异步的 agentic RL。 | 实验设置 | 内容 | |————-|———| | 模型 | GLM-5.2,744B 总参 / A40B 激活参 | | 硬件拓扑 | 32 卡 rollout + 32 卡训练,各由 8 个四卡节点组成 | | 任务 | terminal-bench-2 终端编程任务,通过 OpenEnv + Daytona 沙盒执行 | | 并行策略 | 训练侧 TP 2 / PP 4 / CP 4 / EP 8,推理侧 8 台 DP-attention 引擎(DP 4),启用 MTP | | 精度 | 训练 BF16,推理 FP8 权重 + FP8 KV Cache | | 调度 | 全异步,最多 128 条轨迹并发,训练 batch size = 64(8 任务 × 8 次尝试)| | 目标函数 | GRPO + Truncated Importance Sampling | 关键结果(100 步运行): - 步长时间:前 30 个有效步的中位耗时为 263 秒(第 0 步预热 1042 秒已截断)。 - KV Cache 命中率:通过 affinity 路由与 least-loaded 放置策略,前缀缓存命中率保持在 96%。 - 训练-推理概率差异:log-probability 分歧均值 0.0369,且在整个训练过程中未发散。 - 原始任务奖励:9 步滑动平均从 0.438 上升至 0.556(单 run,未排除运行间方差)。 —- ### 2. 系统传输与存储消融 #### 2.1 P2P 权重传输 vs. NCCL 广播(第 4.2 节,Table 8) 在 H100 集群上对比两种权重同步方式,使用 1 GB 传输桶: | 模型 | 节点数(每侧) | NCCL 广播 | P2P RDMA | 降幅 | |———|———————|—————-|—————|———| | Qwen3-30B-A3B | 2 | 2.67 s | 2.16 s | -19.1\% | | GLM-5 744B-A40B | 16 | 58.30 s | 8.48 s | -85.5\% | | Kimi K2 1T-A32B | 32 | 53.28 s | 7.23 s | -86.4\%$ | 其中 Kimi K2 包含约 884 ms 的 GPU 重量化开销。实验表明 P2P 的优势随集群宽度扩大而增长,但在单节点场景下比广播慢约 70%。 #### 2.2 优化器状态流式存储的显存/时间收益(第 3.2.2 节) 在 **Qwen3-30B-A3B** 上测量 actor 卸载耗时: - **未启用流式**:offload 24 s,reload 8.9 s。 - **启用流式**:offload 降至 **5.2 s**,reload 降至 **1.3 s**。 —- ### 3. 算法与精度验证实验 #### 3.1 低精度端到端精度契约(第 3.1 节) 验证三种低精度格式在推理与训练之间保持逐值一致,通过与 BF16 baseline 对比奖励曲线与 log-probability 偏差: | 格式 | 测试模型 | 成熟度 | |———|————-|————| | FP8 blockwise | Qwen3-4B, Qwen3-30B-A3B, DeepSeek-V4 | Generally available | | MXFP8 | Qwen3-30B-A3B, DeepSeek-V3.2 | Beta | | NVFP4 (E2M1) | Qwen3-30B-A3B | Beta | 验证方法:对相同采样 token,比较 SGLang(rollout)与 Megatron-LM(训练)输出的 log-probabilities,确保奖励曲线跟踪 BF16 baseline。 #### 3.2 True-On-Policy Alignment 验证(第 5.3 节) 在 **dense Qwen3 0.6B 与 4B** 上启用严格确定性模式: - 使用 FlashAttention-3 的确定性路径、批次不变 GEMM 内核、确定性 cuBLAS/NCCL。 - rollout 引擎以 prefill 方式重新评分序列。 - **结果**:训练器与推理引擎对采样 token 的 log-probability **绝对差异严格为零**;DAPO 提示集上的奖励曲线与 baseline 匹配,但 rollout 耗时增加。 #### 3.3 On-Policy Distillation (OPD) 验证(第 5.2 节) 在 **Qwen3.5-35B-A3B** 上进行纯蒸馏(task reward = 0): - Teacher 为经过 5 步 RL 的同架构模型,student 从 base checkpoint 出发。 - 评估集:DAPO 提示。 - **结果**:5 步后,响应长度从 **14,070** token 降至 **6,132** token(缩短约 56%),准确率从 **84.0%** 微升至 **85.2%**(处于约 1.6 个标准误的噪声范围内,未视为显著改善)。 —- ### 4. Miles-Diffusion 组件验证(第 6 节) 在 **LTX-2.3** 配方上验证流式反序列化与奖励计算重叠: - 将视频微组的原始字节反序列化从主事件循环移至工作进程池。 - **结果**:每步 rollout 时间从 **157.4 s** 降至 **87.6 s**;总步长时间从 **321.9 s** 降至 **252.1 s**。 —- ### 5. 跨模型与硬件的覆盖验证(第 7 节) #### 5.1 Day-0 模型支持(Section 7.1) 论文将以下 6 个前沿模型的发布日支持作为系统验证: - Kimi K3 - DeepSeek-V4 - GLM-5.2 - Qwen3.8(2.4T MoE) - Inkling - NVIDIA Nemotron 3 Ultra 其中 Kimi K3 与 Qwen3.8 因规模限制,发布日仅验证了 LoRA RL 适配器训练。 #### 5.2 多厂商硬件持续集成 - **NVIDIA**:覆盖 A100、H100/H200(Hopper)、B200/B300/GB200/GB300(Blackwell)。CI 主要运行在 Hopper 上;GB300 用于第 9 节参考运行;Blackwell 独占运行 MXFP8 与 NVFP4。 - **AMD**:原生 ROCm 支持 MI300X、MI325、MI350X、MI355X。每轮 PR 在 MI350 runner 上与 NVIDIA 并行运行端到端训练测试;夜间测试覆盖更大规模 MI350 配置。 #### 5.3 Diffusion 配方证据等级(Section 6) | 配方 | 证据等级 | |———|————-| | SD3.5 | Fully gated(完整训练曲线 + 夜间确定性测试) | | LTX-2.3 | Fully gated | | Wan2.2(多节点) | Proxy gated(单节点代理测试) | | Qwen-Image, Cosmos 3 | Verified(已跑通完整曲线,无确定性测试) | | Wan2.2 LoRA | Not verified | —- ### 6. 其他系统级验证 - **前缀缓存命中率**:在 GLM-5.2 参考运行中,通过 session-aware + DP-rank-aware affinity 路由,测得 **96%** 的 prefix-cache hit rate(第 2.1 节)。 - **权重传输正确性检查**:在 P2P 开发过程中,使用随机值填充 + 逐张量比对(支持量化容差),在 1 至 8 Q5: 有什么可以进一步探索的点? 基于论文中明确陈述的局限、处于早期阶段的功能以及架构预留的扩展接口,以下方向值得进一步探索: —- ### 1. 视觉-语言模型(VLM)的 Token 精确轨迹记录 当前 TITO(Token-In-Token-Out)会话服务器仅支持文本 token,尚未承载图像或视频输入。这导致 VLM 无法通过会话服务器获得逐 token 精确的轨迹记录与训练对齐,只能退回到 SGLang 的低层 token 接口。未来可探索: - 将多模态输入(图像 patch、视频帧)纳入会话服务器的 checkpoint 与增量 tokenization 机制; - 验证视觉特征提取器在推理与训练前向之间的数值一致性,防止多模态场景下的 train-rollout mismatch。 —- ### 2. True-On-Policy Alignment 的模型覆盖扩展 True-on-policy alignment 目前仅对 **dense Qwen3 的 0.6B 与 4B 变体**注册了逐位精确配置文件。其扩展空间包括: - 将确定性 kernel contract、批次不变算子与并行策略无关的 all-reduce 实现推广到 **MoE 架构**与更大规模模型; - 在 FP8 / NVFP4 低精度场景下验证逐位一致性,或建立量化感知的容差标准,替代当前的“绝对差异为零”阈值。 —- ### 3. 权重同步传输的模型与拓扑扩展 P2P RDMA 与 disk-delta 两种传输路径目前受限于 Megatron 与 SGLang 之间的统一权重名称映射覆盖范围: - 扩展 P2P 的 CPU 重分片逻辑以支持更多模型家族(如 Nemotron、Gemma、MiniMax H3); - disk-delta 当前不支持与 LoRA、colocation、prefill-decode 解耦或外部推理服务组合。实现外部服务端点集成与增量适配器同步是明确的工程前沿。 —- ### 4. LoRA RL 的后端支持与多适配器训练 - **FSDP 后端目前不支持 LoRA**(Table 6),这限制了研究者在使用 Hugging Face 原生路径时的低秩微调能力; - Multi-LoRA 同时训练多个适配器的功能仍处于开放 Pull Request 状态,尚未正式发布。其在共享基座下的资源隔离、适配器间干扰与路由策略需要更多验证。 —- ### 5. 低精度格式的稳定性与覆盖深化 MXFP8 与 NVFP4 目前标记为 **Beta**,且仅在有限模型上完成端到端验证: - 在万亿参数 MoE 模型上验证 NVFP4 的 four-over-six 自适应缩放与 dequantized backward 的长期训练稳定性; - 探索 FP4/INT3 等更低精度在 RL 循环中的可行性,同时维持梯度质量与策略收敛。 —- ### 6. Agentic 环境的感知模态扩展 - **会话服务器尚未支持截图记录**,导致计算机使用(computer-use)类 agent 必须在 generate-function 层自行记录轨迹,无法利用 TITO 的 token 精确保障。未来可集成视觉感知流的增量编码; - 环境连接器与沙盒后端目前以实验性状态存在,可建立跨 Harbor、HUD、NeMo Gym 等框架的统一多模态观测协议。 —- ### 7. 异步数据流的智能调度与课程学习 当前数据缓冲区在丢弃策略上采用固定阈值(staleness limit、用户过滤器、生成超时)。可探索的方向包括: - 基于 staleness 分布或优势估计值的**自适应采样权重**,替代简单的丢弃/保留; - 在完全异步模式下实现**动态课程**:根据训练阶段或策略熵调整 rollout 长度、工具调用深度与任务难度,而非使用静态的 prompt 分布。 —- ### 8. 扩散模型后训练的精度与并行优化 Miles-Diffusion 虽已支持 Flow-GRPO、DiffusionNFT 与 SFT,但存在以下开放问题: - 确定性模式对 FlashAttention 后端的依赖限制了部分视频模型的注意力实现选择; - 长视频序列的序列并行(sequence parallelism)与流式反序列化在 **Wan2.2** 等配方上的多节点扩展仍需从 proxy gated 提升至 fully gated 的完整验证; - 探索扩散模型中的 **true-on-policy alignment**:确保去噪步骤的推理引擎 log-probability 与训练器重评分完全一致,当前该问题比语言模型更敏感。 —- ### 9. 跨节点弹性与动态并行重配置 论文中的并行布局(TP/PP/CP/EP/DP)在运行前静态设定,且优化器状态流式存储要求恢复时保持相同并行拓扑。未来可探索: - 训练过程中的 **动态重新并行化**(dynamic repartitioning),以适应集群故障或 job 抢占; - 检查点格式与流式优化器状态的布局无关化,支持在不同 GPU 规模或节点拓扑间无缝恢复。 —- ### 10. 大规模异步 RL 的系统诊断工具 论文强调了缓冲区指标(queue size、staleness、aborted groups)对监控异步漂移的重要性。可进一步构建: - **在线因果诊断**:自动识别训练步时间抖动是由某类特定任务(如长上下文代码、多轮工具调用)还是由权重同步传输引起; - **混合精度下的数值异常预警**:在 MXFP8/NVFP4 训练中实时监控重要性比率的分布漂移,作为低精度训练失稳的早期信号。 Q6: 总结一下论文的主要内容 这篇论文介绍了 **Miles v0.1**,一个面向前沿规模(frontier-scale)大语言模型后训练(post-training)的全栈生产级系统。以下从问题背景、核心架构、关键技术、扩展能力与实验验证五个维度进行总结。 —- ### 1. 核心问题 前沿模型的强化学习(RL)后训练面临以下系统性挑战: - **执行效率低下**:多轮 agentic rollout、工具调用与长上下文导致单条轨迹生成长度差异巨大,同步“生成—训练”交替模式造成严重 GPU 空闲。 - **训练-推理数值不匹配**:推理引擎(SGLang)与训练后端(Megatron/FSDP)使用不同的内核、精度与批处理形状,即使权重相同,二者对同一 token 的 log-probability 也会偏离,导致重要性比率

r = exp(log π(train) - log π(rollout))
漂移,破坏梯度质量;对 MoE 模型,该不匹配还会引发专家路由差异,甚至导致训练崩溃。 - **权重同步瓶颈**:万亿参数模型的全量广播耗时可达分钟级,阻塞训练流水线。 - **显存限制**:全参数 RL 的优化器状态、权重与梯度难以容纳于单卡 HBM。 - **工程可扩展性**:新模型、新硬件、新算法(如 LoRA、蒸馏、扩散模型)需要快速接入而不重写整个训练循环。 —- ### 2. 系统架构:异步 RL 三阶段循环 Miles 将 RL 训练循环解耦为三个可并发执行的阶段: - **Rollout(生成)**:基于 SGLang 的推理引擎持续生成轨迹(trajectory),支持多轮 agentic 交互。 - **Training(训练)**:使用 NVIDIA Megatron-LM 或 PyTorch FSDP 消费轨迹组(group),计算 RL 损失并更新策略。 - **Weight Update(权重同步)**:将新权重传输至所有 rollout 引擎,且支持最小化中断。 三阶段通过**离散化部署(disaggregated placement)**实现全异步:rollout 与训练各占独立 GPU 池,通过有界数据缓冲区解耦,消除因单条慢速轨迹导致的整批等待。 —- ### 3. 关键技术贡献 #### 3.1 Rollout 层:保真与吞吐 - **亲和性路由(Affinity Routing)**:通过 session-aware 与 DP-rank-aware 路由键,将多轮 episode 的各回合绑定至同一引擎,保持 KV cache 前缀复用(参考运行中命中率达 96%)。 - **Token-In-Token-Out (TITO)**:会话服务器接管 tokenization,逐轮精确记录引擎输出的 token IDs、log-probabilities 与 routed experts,确保训练器重构的序列与采样轨迹完全一致,消除由消息解析、工具调用重序列化引入的静默偏差。 - **Rollout Routing Replay (R3)**:针对 MoE 模型,将推理阶段的专家分配作为轨迹数据保存,训练时精确重放,避免路由差异导致的梯度错误。 - **Agentic 环境集成**:三层嵌套插件架构(agent / generate / rollout function),支持 Harbor、NeMo Gym、OpenEnv、HUD、τ-bench 等多种外部框架与沙盒后端(Daytona、E2B 等)。 #### 3.2 训练层:精度、显存与后端 - **端到端低精度契约**:支持 FP8 blockwise、MXFP8 与 NVFP4,要求 checkpoint 转换、训练前向、推理 rollout、实时权重导出四阶段使用**位精确(bit-exact)**的相同量化逻辑,防止低精度加剧数值不匹配。 - **显存卸载机制**: - **Actor 卸载**:暂停时将训练进程完整状态搬至主机内存或节点本地磁盘; - **优化器状态流式存储**:将 Adam 状态分桶存盘,更新时按需加载,使 GPU 无需同时驻留全部优化器状态(可将 offload 时间从 24 s 降至 5.2 s)。 - **双训练后端**:Megatron-LM(默认,支持 TP/PP/CP/EP 多维并行)与 PyTorch FSDP(直接加载 Hugging Face 格式,适合快速验证新架构)。 #### 3.3 权重同步层:可扩展传输 提供三种传输模式适配不同拓扑: - **NCCL 广播(默认)**:利用共享分桶流水线异步广播。 - **点对点 RDMA(P2P)**:训练 rank 直接写入 rollout rank 内存,配合 CPU 重分片与固定 staging buffer;在多节点场景下可将权重更新时间降低 **85% 以上**(如 GLM-5 从 58.3 s 降至 8.48 s)。 - **Disk-Delta**:仅传输相邻 RL 步的变更字节(XOR 或 Overwrite 编码),通过共享文件系统实现,无需训练与推理节点间直接互联。 #### 3.4 目标函数与数值修正 内置 GRPO、GSPO、REINFORCE++、PPO 等优势估计器;提供两种重要性采样修正: - **Truncated Importance Sampling (TIS)**:将比率 r 钳位至 $

0, 2
$; - **Clip-or-pop**:区间外 token 的梯度权重置零。 #### 3.5 True-On-Policy Alignment 在支持的 dense Qwen3 模型上,通过确定性 FlashAttention-3、批次不变 GEMM、统一算子实现与 prefill 重评分,使训练器与推理引擎对采样 token 的 log-probability **绝对差异严格为零**。 —- ### 4. 扩展能力:超越全参数 RL Miles 将核心组件复用于多种后训练范式: - **LoRA RL**:仅训练低秩适配器,同步数据量极小;支持多适配器并发训练(实验性功能)。 - **On-Policy Distillation (OPD)**:学生模型在自身轨迹上训练,教师模型提供逐 token 的反向 KL 信号;可实现响应长度缩短 56% 而准确率不变。 - **监督微调(SFT)**:复用同一训练器,无 rollout 引擎。 - **Miles-Diffusion**:将架构扩展至图像/视频扩散模型,支持 Flow-GRPO、DiffusionNFT 与序列并行,覆盖 SD3.5、Wan2.2、LTX-2.3 等配方。 —- ### 5. 实验验证与覆盖 #### 5.1 端到端案例研究(第 9 节) 在 **64 张 NVIDIA GB300 GPU** 上训练 **GLM-5.2 744B-A40B**: - 配置:32 卡 rollout + 32 卡训练,BF16 训练 / FP8 推理,全异步 GRPO,terminal-bench-2 任务。 - 结果:前 30 步中位步长时间 **263 秒**;KV cache 命中率 **96%**;训练-推理 log-prob 分歧均值 **0.0369**;原始任务奖励 9 步滑动平均从 0.438 升至 0.556。 #### 5.2 系统组件消融 - **P2P 权重传输**:在 GLM-5 与 Kimi K2 上分别实现 85.5% 与 86.4% 的同步时间降低。 - **流式优化器状态**:在 Qwen3-30B-A3B 上将 actor 卸载/恢复时间从 24 s/8.9 s 降至 5.2 s/1.3 s。 - **Miles-Diffusion 流式反序列化**:在 LTX-2.3 上将 rollout 时间从 157.4 s 降至 87.6 s。 #### 5.3 Day-0 与跨硬件验证 - **Day-0 模型支持**:发布日即支持 Kimi K3、DeepSeek-V4、GLM-5.2、Qwen3.8、Inkling、Nemotron 3 Ultra。 - **硬件覆盖**:NVIDIA(A100/H100/H200/B200/GB200/GB300)与 AMD(MI300X/MI325/MI350X/MI355X)原生 ROCm 支持;CI 在 NVIDIA Hopper 与 AMD MI350 上并行运行端到端测试。 —- ### 6. 设计原则与开源 Miles 遵循“组件应可验证、简洁且可定制”的原则,通过小型类型化接口(rollout、reward、loss、correction 等)使用户无需分叉代码即可注入自定义逻辑。系统已开源: - 代码:https://github.com/radixark/miles - 文档:https://miles.radixark.com Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: RadixArk,Tom Chen,Mao Cheng,Shi Dong,Kangrui Du,Yanbin Jiang,Jiajun Li,Yiming Li,Tao Lin,Yusheng Su,Andy Ye,Yueming Yuan,Zhichen Zeng

Categories:

PDF URL: https://arxiv.org/pdf/2609.08368.pdf

Arxiv URL: https://arxiv.org/abs/2609.08368

Arxiv ID: 2609.08368

CoolPaper URL: https://papers.cool/arxiv/2609.08368

Published: 2026-09-10T01:26:57.430Z

Updated: 2026-09-10T01:26:57.430Z


10. Mask Forcing: Improving Autoregressive Video Diffusion Distillation via Dual-Noise Masking Rollout

Abstract:Autoregressive (AR) video diffusion models have shown great potential in real-time video generation. Recent methods distill pretrained bidirectional video diffusion models into causal AR students through Distribution Matching Distillation (DMD), but the generated videos often suffer from over-saturation and over-smoothing issues, resulting in limited visual quality and realism. The key contributing factor is the mode-seeking behavior of the reverse KL objective in DMD, which can cause the student distribution to collapse onto only a few modes of the teacher distribution. To address this, we propose Mask Forcing, a Dual-Noise Masking Rollout strategy that perturbs the AR student self-rollout to mitigate mode collapse induced by reverse-KL mode seeking. The core idea is to inject cleaner signals into noisy rollout inputs via random masks along spatial and temporal axes during the self-rollout process of AR diffusion distillation. Such perturbations encourage the student rollouts to explore more regions of the teacher distribution, allowing DMD to provide learning signals beyond the modes already covered by the student. Moreover, the cleaner tokens act as denoising guidance for other noisier tokens, improving the intermediate rollout predictions and reducing error accumulation. Extensive experiments demonstrate that our method improves multiple AR video diffusion distillation methods with higher visual quality efficiently, without incorporating real video data or additional post-training stages.

中文摘要

摘要:自回归(AR)视频扩散模型在实时视频生成方面展示了巨大的潜力。最近的方法通过分布匹配蒸馏(DMD)将预训练的双向视频扩散模型蒸馏为因果AR学生模型,但生成的视频常常存在过度饱和和过度平滑的问题,导致视觉质量和真实感有限。主要原因是DMD中逆KL目标的模式寻求行为,这可能导致学生分布仅在教师分布的少数模式上塌缩。为了解决这个问题,我们提出了Mask Forcing,一种双噪声掩码展开策略,通过扰动AR学生的自回归展开,从而缓解由逆KL模式寻求引起的模式塌缩。核心思想是在AR扩散蒸馏自回归展开过程中,通过沿空间和时间轴的随机掩码将更干净的信号注入噪声展开输入。这类扰动鼓励学生展开探索教师分布的更多区域,使DMD能够提供超出学生已覆盖模式的学习信号。此外,更干净的令牌也作为其他更嘈杂令牌的去噪指导,改善中间展开预测并减少误差积累。大量实验表明,我们的方法能够高效地提升多种AR视频扩散蒸馏方法的视觉质量,同时无需引入真实视频数据或额外的后训练阶段。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*自回归(AR)视频扩散模型在分布匹配蒸馏(DMD)过程中因反向KL目标的模态寻找行为而导致的模态坍缩问题\*\*,以及由此引发的生成视频\*\*过饱和、过度平滑、视觉质量低下和真实感不足\*\*等问题。 具体而言,论文针对以下核心挑战展开: ### 1. 模态坍缩与视觉质量退化 - \*\*问题表现\*\*:通过DMD将预训练的双向视频扩散模型蒸馏为因果AR学生模型时,生成的视频常出现\*\*过饱和(over-saturation)\*\*和\*\*过度平滑(over-smoothing)\*\*现象,缺乏细粒度视觉细节和现实感。 - \*\*根本原因\*\*:DMD采用的\*\*反向KL散度(reverse KL divergence)\*\*具有固有的\*\*模态寻找(mode-seeking)\*\*特性,倾向于将学生分布集中在教师分布的少数高概率模态上,导致学生分布坍缩,无法覆盖教师分布的多个模态区域。 ### 2. 自展开过程中的误差积累 - \*\*问题表现\*\*:在自回归自展开(self-rollout)训练中,中间去噪步骤的预测没有显式的训练信号,这些中间预测会被后续步骤和后续块重复使用,导致误差在展开过程中不断累积。 - \*\*影响\*\*:误差积累进一步降低了生成视频的质量,加剧了视觉伪影。 ### 3. 现有缓解方案的局限性 - \*\*依赖真实数据\*\*:部分方法通过引入真实视频数据或GAN损失来缓解模态坍缩,但这需要复杂的数据整理流程,并增加了多阶段训练的开销。 - \*\*后训练依赖\*\*:强化学习后训练或额外的蒸馏阶段虽然能提升质量,但依赖奖励模型、对超参数敏感,且增加了训练复杂度。 - \*\*联合目标方法\*\*:一些工作尝试联合优化模态寻找与模态覆盖目标,但生成结果仍可能出现过饱和,且缺乏丰富的视觉细节。 ### 4. 本文的核心解决思路 针对上述问题,论文提出 \*\*Mask Forcing\*\*,一种\*\*双噪声掩码展开(Dual-Noise Masking Rollout)\*\*策略。该方法在AR学生模型的自展开过程中,通过随机掩码沿空间和时间轴向带噪的展开输入中注入\*\*更低噪声的干净信号\*\*,从而: - \*\*扰动学生展开轨迹\*\*,使其探索教师分布中更多的高概率区域,缓解模态坍缩; - \*\*利用干净token作为去噪上下文\*\*,改善中间展开预测,减少误差积累。 该方法无需引入真实视频数据,也无需额外的后训练阶段,即可在多种AR视频扩散蒸馏基线方法上显著提升视觉质量和收敛速度。 Q2: 有哪些相关研究? 根据论文第2节内容,相关研究可归纳为以下三个主要方向: --- ### 1. 自回归视频生成(Autoregressive Video Generation) 自回归视频扩散模型通过因果注意力机制顺序生成视频块,支持实时推理与无限长度视频生成。该领域的代表性训练范式包括: - \*\*Teacher Forcing\*\*:训练时基于真实的过往帧(ground-truth context)预测下一帧,导致训练与推理之间的分布偏移及曝光偏差。 - \*\*Diffusion Forcing\*\*:为每帧独立采样噪声级别以近似展开分布,虽缓解了分布偏移,但仍未能完全对齐训练与推理过程。 - \*\*Self Forcing\*\*:通过在自生成历史(self-generated histories)上执行自回归自展开(self-rollout),并使用DMD损失蒸馏双向教师模型的知识,从而弥合训练-测试差距。 - \*\*Causal Forcing\*\*:利用自回归教师模型进行ODE初始化,以减少双向教师与因果学生之间的架构差距。 - \*\*LongLive\*\*:通过短窗口注意力、帧汇聚(frame sink)与流式长视频微调,将因果自回归生成扩展至长视频场景。 为改善蒸馏后AR模型的视觉质量,近期研究尝试引入额外训练信号或后训练阶段,但也带来新的复杂性: - \*\*DMD2\*\*引入GAN损失与真实训练数据,但面临训练不稳定及额外数据整理成本。 - \*\*DFD\*\*将真实数据集成至蒸馏分数,但依赖于DMD2预训练模型并需额外的后训练阶段。 - \*\*Astrolabe\*\*探索在蒸馏AR模型上进行强化学习后训练,但其性能受限于奖励模型且对超参数敏感。 --- ### 2. 视频扩散蒸馏中的模态寻找与模态覆盖(Mode Seeking and Mode Covering) DMD框架中的目标函数设计直接决定了学生分布与教师分布的对齐方式: - \*\*模态寻找(Mode Seeking)\*\*:DMD与DMD2采用基于分数的反向KL散度(reverse KL divergence)进行分布匹配,其梯度更新可表示为:

(θ) L(DMD) = E[ -(s(real)(x_t, t) - s(fake)(x_t, t)) (dG) / (dθ) ]
该目标倾向于将学生分布集中于教师分布的少数高概率模态,虽可提升样本保真度,但会导致模态坍缩。 - **模态覆盖(Mode Covering)**:基于轨迹的一致性目标(如一致性模型)通常关联于前向散度(forward divergence),能够覆盖更多教师模态,但可能在模态间取平均,导致单样本质量下降。 - **联合优化方法**:近期工作尝试平衡上述两种行为: - **Mode Seeking meets Mean Seeking**:使用独立网络头分别执行长视频上的监督流匹配(模态覆盖)与短视频教师的反向KL匹配(模态寻找)。 - **rCM**:在连续时间一致性蒸馏基础上增加分数蒸馏正则化。 - **DistillAlign**:分析初始化效应,联合优化DMD损失与一致性蒸馏损失。 与上述方法修改损失函数不同,本文提出的Mask Forcing保留原始DMD目标,转而通过双噪声掩码扰动学生展开轨迹,使DMD能够接触到学生尚未覆盖的教师模态。 —- ### 3. 掩码建模(Masked Modeling) 掩码建模作为视觉表征与生成的核心范式,其思想是通过掩蔽输入的一部分并训练模型进行恢复: - **表征学习**:MAE通过随机掩蔽图像中的大量patch并基于可见部分在像素空间重建,学习可扩展的视觉表征。 - **生成建模**:MaskGIT采用”掩码-预测”目标与并行迭代解码进行图像合成。 - **异构噪声掩码**:在多模态生成中,不同token可通过异构噪声级别实现信息保留: - **Self-Flow**:结合混合时间步调度与掩码的自监督流匹配框架,用于表征对齐。 - **Diffusion Forcing**:为每帧分配随机独立的噪声级别,可视为沿时间轴的部分掩码。 受上述工作启发,本文将双噪声掩码引入自回归视频蒸馏,通过随机掩码在时空轴上注入低噪声信号,以多样化自展开轨迹并为更嘈杂的token提供去噪上下文。 Q3: 论文如何解决这个问题? 论文提出 **Mask Forcing**,一种**双噪声掩码展开(Dual-Noise Masking Rollout)**策略,在不引入真实视频数据或额外后训练阶段的前提下,从两个层面解决自回归(AR)视频扩散蒸馏中的模态坍缩与误差积累问题。 ### 1. 核心机制:双噪声掩码展开 在标准的自展开(self-rollout)DMD训练中,学生模型逐步去噪生成视频块,每一步的输入完全由前一步的预测重新加噪得到。Mask Forcing 在每一步去噪时,通过随机掩码将**更低噪声级别的干净信号**注入到输入中,构造出具有双重噪声级别的混合输入。 #### 1.1 时间窗内的低噪声采样 设当前去噪步骤对应的时间步为 t_j ,训练时间步总数为 N_t 。论文定义一个时间窗大小 Delta ,并在窗口内均匀采样一个额外的时间步 t’_k :

ellj = max(t(min), t_j - (Delta) / (N_t))

t’k sim Uniform([ell_j, t_j])
其中 t’_k 对应比 t_j 更低的噪声水平, t
(min) 防止注入信号过于接近干净状态。 #### 1.2 双噪声输入构造 对于第 i 个视频块,在步骤 j 中,基于前一步的干净预测 x^0_(i,j+1) 和共享的高斯噪声 ε_j sim N(0, I) ,分别构造**更干净样本**与**更嘈杂样本**:

x^(t’k)_i = (1 - t’_k) x^0(i,j+1) + t’_k ε_j

x^(tj)_i = (1 - t_j) x^0(i,j+1) + tj ε_j
接着,采样一个二进制掩码 M_i (掩码比例为 α ),将两者混合为双噪声输入:
x^(mix)_i = M_i odot x^(t’_k)_i + (1 - M_i) odot x^(t_j)_i
模型在该步骤仍以原始时间步 t_j 为条件进行去噪:
x^0
(i,j) = Gθ(x^(mix)_i mid x(<i), c, t_j)

1.3 掩码采样策略 掩码在**空间轴**(块内各帧之间)和**时间轴**(不同块之间)独立采样。论文采用**每帧独立(per-frame)**与**每块独立(per-chunk)**的组合策略,确保不同时空位置的token接收到多样化的双噪声模式,从而最大化展开轨迹的多样性。 —- ### 2. 双重作用机理 #### 2.1 缓解模态坍缩:扰动与扩展分布覆盖 反向KL散度的模态寻找行为会使学生分布坍缩到教师分布的少数高密度区域。Mask Forcing 通过对展开输入注入随机低噪声扰动,**多样化学生展开轨迹**,使DMD损失在训练过程中评估的学生样本覆盖更广阔的样本空间。 从分布角度分析,设 V 为展开过程中所有掩码与低噪声时间步的集合, q^V_(θ,τ) 为给定轨迹 V=v 时的条件学生分布,则边际学生分布为:

q(θ,τ)(x) = E(V sim π)[q^V(θ,τ)(x)]
该边际分布的反向KL可分解为:
D
(KL)(q(θ,τ) | pτ) = E(V)[D(KL)(q^V(θ,τ) | pτ)] - Iθ(V; Xτ mid c)
其中 Iθ(V; Xτ mid c) 为掩码轨迹与输出之间的互信息。当不同轨迹诱导出不同的条件分布时,互信息为正,使得边际分布的反向KL严格小于各条件分布反向KL的均值。这意味着,即使单个条件分布仍可能是模态寻找的,其**混合边际分布能够覆盖多个教师模态**,从而在整体上缓解模态坍缩。 #### 2.2 减少误差积累:干净上下文引导去噪 在自展开中,中间去噪预测没有显式监督,其误差会累积至后续步骤和后续块。Mask Forcing 中,被掩码选中的低噪声token保留了更多来自前一步预测的结构信息,可作为**去噪上下文**帮助模型从更嘈杂的token中恢复信号。这与掩码建模和Self-Flow中的观察一致:混合噪声输入中更干净的上下文能够促进去噪,从而改善中间展开预测的质量,抑制误差沿时间轴和空间轴的传播。 —- ### 3. 训练与推断 训练时,仅在展开的出口步骤(sampled exit step s )计算DMD损失并回传梯度,中间步骤的双噪声输入作为扰动参与前向传播。推断时,学生模型遵循原始去噪时间表,不引入任何掩码或双噪声混合,因此**无需修改推理流程**。 该方法无需额外的真实视频数据、对抗训练、后训练阶段或奖励模型,仅需在现有自展开DMD训练流程中替换重噪操作,即可无缝集成到各类AR视频扩散蒸馏框架中。 Q4: 论文做了哪些实验? 论文围绕所提出的 **Mask Forcing** 方法,在多个自回归(AR)视频扩散蒸馏基线上开展了系统性实验验证,涵盖短/长视频生成、帧级/块级自回归设置,以及消融分析与人类评估。实验结果主要呈现在第4节与附录第6节,具体内容如下: —- ### 1. 实验设置 - **基线方法**:选取了三种代表性的AR视频蒸馏方法进行验证,包括 **Self Forcing**、**LongLive** 与 **Causal Forcing**。 - **模型与数据**:以 Wan2.1-T2V-1.3B 作为基础学生模型,Wan2.1-T2V-14B 作为双向教师模型;训练提示采样自 VidProM 数据集;生成分辨率为 832×480、共 81 帧的视频。 - **生成设置**:分别在 **chunk-wise**(每块3个潜在帧)与 **frame-wise** 两种自回归生成设置下进行实验。 - **评估指标**: - 视觉质量:HPSv3、VisionReward(含 Vision.、Instruct.、MQ 子分数) - 运动质量:Dynamic Degree(基于 RAFT 光流) - 综合基准:VBench(Total、Quality、Semantic) - 分布对齐:CMMD(CLIP 特征空间 MMD)、VMMD(V-JEPA2 特征空间 MMD) —- ### 2. 与基线方法的比较 #### 2.1 定量结果(短/长视频生成) - **短视频(100-prompt set 与 VBench)**:在 chunk-wise 与 frame-wise 两种设置下,Mask Forcing 对所有基线方法均带来一致提升。如表1所示,加入 Mask Forcing 后,HPSv3、VisionReward 视觉分数、Instruct. 语义分数与 MQ 运动质量均显著提高;VBench 的 Total、Quality 与 Semantic 分数也全面优于各基线。 - **长视频(30秒单提示生成)**:在 LongLive 框架下,对 MovieGen 与 VBench-Long 基准进行评估(表2)。Mask Forcing 在 HPSv3、Vision.、Instruct. 等指标上均有提升,证明其在长时程生成中的有效性。 #### 2.2 定性结果 - 图3展示了在 100-prompt set 与 MovieGen 上的可视化对比:基线方法普遍存在过饱和、过度平滑及细粒度细节缺失的问题;引入 Mask Forcing 后,生成视频的真实感与高频细节显著增强。 - 图4展示了 LongLive 的长视频生成结果:Mask Forcing 在30秒视频的多个时间点均保持了更丰富的纹理(如毛绒、烛光、沙石质感),缓解了随展开进行而产生的视觉退化。 —- ### 3. 消融实验 为验证 Mask Forcing 中关键设计选择的影响,以 Self Forcing 为基线开展了系统消融: #### 3.1 掩码比例 α (表3) 测试了 α ∈ 0.1, 0.2, 0.3, 0.4, 0.5 。 - α=0.1 :扰动不足,模态覆盖有限,运动动态弱(Dynamic Degree=47)。 - α=0.4 sim 0.5 :视觉质量(HPSv3)最高,但过度依赖干净预测导致运动多样性下降。 - α=0.2 :在视觉质量与运动动态之间取得最佳平衡(HPSv3=9.84,Dynamic Degree=82),被选为默认值。 #### 3.2 时间窗大小 Delta (表4) 测试了 Delta ∈ 50, 150, 250, 450, 600 (以训练时间步为单位)。 - Delta=50 :扰动过弱,HPSv3 较低(9.16)。 - Delta=600 :干净信号过强,限制了运动模式的修正与多样性。 - Delta=250 :兼顾了视觉质量与运动动态,被选为默认值。 #### 3.3 掩码采样策略(表5) 在空间轴(块内帧间)与时间轴(跨块/跨步)上比较了多种组合: - **空间**:shared(块内所有帧共用同一掩码) vs. per-frame(每帧独立采样)。 - **时间**:per-rollout(整个展开固定)、per-chunk(每块重采样)、per-step(每步重采样)。 - **结论**:**per-frame + per-chunk** 组合在 HPSv3(9.84)与 Dynamic Degree(82)上均表现最优。 #### 3.4 收敛速度(图1、图5、图9) 通过监测训练过程中的 HPSv3、CMMD 与 VMMD 评估收敛性: - Mask Forcing 在所有基线(Self Forcing、Causal Forcing、LongLive)上均实现了**更快的收敛速度**,在更少的训练步数内达到更高的视觉质量与更好的分布对齐。 —- ### 4. 人类评估(图6) 招募了 24 名用户进行成对偏好测试,要求从匿名化的视频对中选择视觉质量与真实感更高的一方: - **Self Forcing vs. +Ours**:Mask Forcing 获得 **80%** 偏好率。 - **Causal Forcing vs. +Ours**:Mask Forcing 获得 **79%** 偏好率。 - **LongLive vs. +Ours**:Mask Forcing 获得 **83%** 偏好率。 - **LongLive(长视频)vs. +Ours**:Mask Forcing 获得 **72%** 偏好率。 —- ### 5. 附录中的补充实验 #### 5.1 与联合蒸馏方法的比较(表6、图7、图8) 将 Mask Forcing 与旨在平衡模态寻找/覆盖的联合蒸馏方法 **DistillAlign** 和 **Causal-rCM** 进行对比: - Mask Forcing 在 HPSv3、Vision.、Instruct.、MQ 与 Dynamic Degree 上均优于两者。 - 人类偏好率分别为 **83%**(对 DistillAlign)与 **77%**(对 Causal-rCM)。 #### 5.2 长视频生成的时序细粒度评估(表8) 在 MovieGen 上按每 6 秒区间(0–6s, 6–12s, …, 24–30s)评估 CLIP Score 与 HPSv3: - 两种方法均随展开进行呈现分数下降趋势(误差积累),但 Mask Forcing 在**所有时间段**均保持更高分数,说明其有效减缓了长时程展开中的质量退化。 #### 5.3 多样性评估(表7) 使用 CLIP-ViT-Large 与 DINOv3-ViT-Large 在 100-prompt set 上评估生成多样性: - Mask Forcing 在 Self Forcing、LongLive、Causal Forcing 上均提升了 **CLIP 多样性**;对 LongLive 与 Causal Forcing 也显著提升了 **DINOv3 多样性**,表明其在改善视觉质量的同时未牺牲生成多样性。 #### 5.4 交互式视频世界模型应用(图10) 在**相机控制的图像到视频(I2V)**任务中,以 Wan2.2-5B-TI2V 为基座,在 Sekai-Game 与 Sekai-Walking 测试集上验证: - Self Forcing 随展开进行出现画面变暗与细节丢失; - Mask Forcing 在整个展开过程中保留了更丰富的场景细节,展示了其在交互式世界模型中的潜力。 #### 5.5 额外定性结果(图11–13) 附录提供了在 100-prompt set 与 MovieGen 上更多基线与 Mask Forcing 的定性对比,进一步验证了其缓解过饱和、增强真实感与细节的一致性效果。 Q5: 有什么可以进一步探索的点? 基于论文内容与实验观察,以下几个方向值得进一步探索: —- ### 1. 自适应与可学习的掩码策略 论文采用随机采样的二进制掩码(固定比例 α )进行时空扰动。一个自然的延伸是**让掩码分布本身成为可学习的参数**,或根据输入内容动态调整: - **基于内容感知的掩码**:根据帧内运动幅度、纹理复杂度或注意力图自适应地选择掩码位置。例如,在运动剧烈区域保留更多干净信号以稳定展开,在静态背景区域增加扰动以促进模态探索。 - **课程式掩码调度**:训练初期使用较大掩码比例以鼓励广泛探索,后期逐渐降低比例以精细化对齐高频细节,这可能比固定 α=0.2 获得更优的收敛权衡。 —- ### 2. 掩码机制与联合蒸馏目标的协同 论文将 Mask Forcing 与纯 DMD 目标结合,并展示了其相对于联合蒸馏方法(如 DistillAlign、Causal-rCM)的优势。然而,Mask Forcing 作为一种** rollout 层面的扰动机制**,理论上可与多种蒸馏目标正交互补: - **与一致性蒸馏结合**:在保持一致性模型减少推理步数优势的同时,利用双噪声掩码缓解其平均化倾向带来的模糊问题。 - **与对抗损失或流匹配正则化结合**:探索掩码扰动是否能为 GAN-based 或 forward-KL 目标提供更稳定的学生样本分布,减少训练震荡。 —- ### 3. 更长时程生成中的误差传播控制 论文在 30 秒长视频上验证了 Mask Forcing 的有效性,但 AR 模型的核心优势在于**无界长度生成**: - **超长时间展开(>30s)**:随着块数增加,误差积累的二次效应可能使得双噪声掩码的局部修正不足以维持长期一致性。需要研究更激进的上下文刷新策略(如 LongLive 的 frame sink)与 Mask Forcing 的耦合机制。 - **误差积累的定量刻画**:论文通过最终生成质量间接验证了误差减少,但缺少对中间去噪步骤预测误差的逐层定量分析(如逐块 FID 或感知距离)。建立中间误差与掩码参数 Delta 、 α 之间的定量关系,可指导更精细的参数搜索。 —- ### 4. 从训练扰动到推理时增强 Mask Forcing 目前仅应用于训练阶段,推理时仍遵循标准去噪路径。可以探索其在**推理阶段(test-time)**的变体: - **自洽性解码(Self-Consistent Decoding)**:在推理时对同一初始噪声进行多次不同掩码的并行展开,通过聚合多个扰动轨迹的结果(如投票或平均)进一步提升生成稳健性和细节丰富度。 - **迭代细化**:将双噪声输入作为一种推理时的修正机制,允许模型在生成过程中根据已生成块的质量自适应回退并重采样部分区域。 —- ### 5. 掩码分布的理论刻画与最优性 论文在附录中通过 KL 分解揭示了掩码轨迹多样性(以互信息 Iθ(V; Xτ mid c) 衡量)与模态覆盖之间的关系: - **最优掩码分布 π^ \*:可以进一步求解在固定教师分布 pτ 下,使 D(KL)(q(θ,τ) | pτ) 最小化的最优掩码分布,而非依赖启发式的均匀采样。 - **互信息的估计与最大化**:实际训练中可引入辅助目标,显式最大化不同掩码轨迹诱导的输出分布差异,从而系统性地提升边际分布的模态覆盖能力。 —- ### 6. 向更广泛的交互式世界模型迁移 论文在附录 6.5 中初步探索了相机控制的 I2V 场景,但仅涉及较短序列(5 秒): - **动作/指令条件生成**:在需要严格遵循物理规律或用户交互信号的世界模型中(如游戏智能体、机器人操作),验证 Mask Forcing 是否能在保持指令跟随精度的同时缓解 DMD 导致的视觉退化。 - **多模态自回归生成**:将双噪声掩码扩展至**音频-视频联合生成**或**3D/4D 场景生成**,考察时空掩码在跨模态注意力机制中的扰动效果。 —- ### 7. 计算效率与掩码稀疏化 当前方法在训练时仍需对掩码区域执行完整的前向传播: - **稀疏注意力与掩码的协同**:若掩码区域对应低噪声 token,是否可利用其稀疏性减少 KV Cache 的计算与存储开销?这对实时交互式应用(如论文强调的 streaming generation)具有重要的工程价值。 Q6: 总结一下论文的主要内容 该论文针对自回归(AR)视频扩散模型在分布匹配蒸馏(DMD)中因反向KL散度模态寻找行为导致的模态坍缩与视觉质量退化问题,提出了 **Mask Forcing** 方法。以下从研究背景、方法、理论、实验与贡献五个方面进行总结。 —- ### 1. 研究背景与问题 自回归视频扩散模型通过因果注意力顺序生成视频块,支持实时流式推理。现有方法(如 Self Forcing)通过自展开(self-rollout)与 DMD 损失将预训练的双向教师模型蒸馏为因果学生模型,但存在两个核心问题: - **模态坍缩**:DMD 采用的反向 KL 散度具有模态寻找(mode-seeking)特性,使学生分布坍缩到教师分布的少数高概率模态上,导致生成视频**过饱和、过度平滑、缺乏真实感与高频细节**。 - **误差积累**:自展开的中间去噪步骤缺乏显式监督信号,其预测误差会在后续步骤及后续块中累积,进一步降低生成质量。 现有解决方案往往依赖真实视频数据、复杂的后训练阶段或强化学习,增加了训练流程的复杂度。 —- ### 2. 核心方法:Mask Forcing 论文提出 **双噪声掩码展开(Dual-Noise Masking Rollout)** 策略,在训练过程中向学生模型的自展开输入注入随机低噪声信号,以扰动展开轨迹。 #### 2.1 双噪声输入构造 在第 j 个去噪步(对应时间步 t_j ),除原始噪声样本外,论文在时间窗 $

ellj, t_j
内采样一个更低的时间步 t’_k$(对应更低噪声),分别构造:
x^(t’_k)_i = (1 - t’_k) x^0
(i,j+1) + t’_k ε_j

x^(tj)_i = (1 - t_j) x^0(i,j+1) + tj ε_j
通过二进制掩码 M_i (掩码比例为 α )将两者混合:
x^(mix)_i = M_i odot x^(t’_k)_i + (1 - M_i) odot x^(t_j)_i
模型仍以原始时间步 t_j 为条件进行预测:
x^0
(i,j) = Gθ(x^(mix)_i mid x(<i), c, t_j)

2.2 双重作用 - **缓解模态坍缩**:随机掩码与双噪声设计使学生展开轨迹多样化,迫使 DMD 在更广阔的区域评估学生分布,从而接触到学生尚未覆盖的教师模态。 - **减少误差积累**:掩码选中的低噪声 token 保留了更清晰的结构信息,可作为上下文引导模型对高噪声 token 的去噪,改善中间预测质量,抑制误差沿时空轴传播。 掩码在空间(块内帧间)与时间(跨块)轴上独立采样,推理阶段无需任何修改。 —- ### 3. 理论分析 论文从分布角度对 Mask Forcing 进行刻画。设 V 为展开过程中所有掩码与低噪声时间步的集合, q^V_(θ,τ) 为给定轨迹的条件学生分布,则边际学生分布为:

q(θ,τ)(x) = E(V sim π)[q^V(θ,τ)(x)]
该边际分布与教师分布 p
τ 的反向 KL 可分解为:
D(KL)(q(θ,τ) | pτ) = E(V)[D(KL)(q^V(θ,τ) | pτ)] - Iθ(V; Xτ mid c)
其中 I
θ(V; X_τ mid c) 为掩码轨迹与输出之间的互信息。当不同轨迹诱导出不同的条件分布时,互信息为正,使得边际分布的反向 KL 严格小于各条件分布反向 KL 的平均值。这表明,即使单个条件分布仍集中于局部模态,其**混合边际分布也能覆盖多个教师模态**,从而在理论上解释了掩码扰动缓解模态坍缩的机制。 —- ### 4. 实验验证 #### 4.1 主实验 在 **Self Forcing、LongLive、Causal Forcing** 三个基线上,分别在 chunk-wise 与 frame-wise 设置下进行评估。实验表明,Mask Forcing 在以下方面均带来一致且显著的提升: - **视觉质量**:HPSv3、VisionReward 视觉分数显著提升,缓解了过饱和与过度平滑。 - **语义与运动**:Instruct.(指令遵循)与 MQ(运动质量)分数提高,Dynamic Degree 在多数设置下改善。 - **综合基准**:VBench 的 Total、Quality、Semantic 分数全面优于基线。 - **长视频生成**:在 30 秒单提示长视频设置中,视觉质量与语义对齐指标同样获得提升。 #### 4.2 消融研究 - **掩码比例 α **: α=0.2 在视觉质量与运动动态间取得最佳平衡。 - **时间窗 Delta **: Delta=250 能充分扰动轨迹而不至于过度限制运动多样性。 - **掩码策略**:空间上每帧独立(per-frame)与时间轴上每块独立(per-chunk)的组合效果最优。 - **收敛速度**:相比基线,Mask Forcing 在更少的训练步数内达到更高的 HPSv3 与更低的 CMMD/VMMD,收敛更快。 #### 4.3 人类评估 成对偏好测试中,Mask Forcing 在短/长视频生成上分别获得 **72%–83%** 的人类偏好率,验证了其在视觉真实感上的优势。 #### 4.4 扩展验证 - 与联合蒸馏方法(DistillAlign、Causal-rCM)相比,Mask Forcing 在多项指标与人类偏好上均更优。 - 在相机控制的图像到视频(I2V)交互式世界模型任务中,Mask Forcing 有效缓解了展开过程中的细节丢失与画面退化。 —- ### 5. 主要贡献 - **问题定位**:揭示了反向 KL 模态寻找行为与自展开误差积累在 AR 视频扩散蒸馏中的耦合危害。 - **方法创新**:提出 Mask Forcing,通过双噪声掩码展开在训练时扰动学生轨迹,无需真实数据或后训练即可提升蒸馏质量。 - **理论支撑**:给出了掩码展开边际分布的 KL 分解,阐明了随机扰动扩展模态覆盖的分布机制。 - **广泛验证**:在多种基线、生成设置(chunk-wise/frame-wise、短/长视频)及交互式场景中均证明了有效性,且实现简单、收敛迅速。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Zhuoran Zhao,Shengju Qian,Tongtong Liang,Xianghao Kong,Songchun Zhang,Junchao Huang,Guian Fang,Xin Wang,Pan Hui,Anyi Rao

Categories:

PDF URL: https://arxiv.org/pdf/2609.09123.pdf

Arxiv URL: https://arxiv.org/abs/2609.09123

Arxiv ID: 2609.09123

CoolPaper URL: https://papers.cool/arxiv/2609.09123

Published: 2026-09-10T01:26:58.272Z

Updated: 2026-09-10T01:26:58.272Z


11. SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution

Abstract:Diverse and simulation-ready indoor scenes are essential for interactive entertainment and embodied AI, yet their scalable generation remains challenging. Recent agentic text-to-3D scene pipelines that rely on vision-language models (VLMs) can generate scenes of high fidelity but require costly iterative object placement and refinement. Another mainstream paradigm, parametric image-to-3D scene models, produces scenes efficiently from strong priors learned from 2D images but often leads to imprecise and physically invalid scenes. More importantly, both paradigms struggle to output diverse scenes for a single input, making it hard for them to reflect the dynamically changing nature of real scenes. In this paper we propose \textbf{SceneMosaic}, a framework that combines the merits of both paradigms. It obtains the initial candidate from the learned image-based prior, and subsequently evolves the result through VLM agents, ensuring both efficiency and physical validity. Within the evolution process, SceneMosaic exploits the locality of natural scenes and decomposes a scene into independent local units, allowing separate evolution within each unit before composing the global scene via Cartesian product. On SceneEval-100, SceneMosaic matches the strongest agentic baseline in semantic layout quality with a 24x speedup, substantially reduces physical violations, and receives the highest human ratings. Our code is publicly available at this https URL.

中文摘要

摘要:多样化且可用于模拟的室内场景对于互动娱乐和具身人工智能至关重要,但其可扩展生成仍然具有挑战性。依赖视觉-语言模型(VLMs)的新型智能文本到3D场景管线可以生成高保真场景,但需要高成本的迭代对象放置和优化。另一种主流范式,参数化图像到3D场景模型,则通过从2D图像中学习的强先验高效生成场景,但常常导致不精确和物理上不合理的场景。更重要的是,这两种范式都难以为单一输入输出多样化场景,使其难以反映真实场景的动态变化性。在本文中,我们提出了\textbf{SceneMosaic},一个结合两种范式优点的框架。它从基于图像的学习先验中获取初步候选结果,随后通过VLM代理演化结果,从而保证效率和物理合理性。在演化过程中,SceneMosaic利用自然场景的局部性,将场景分解为独立的局部单元,允许在每个单元内分别演化,然后通过笛卡尔积组成整体场景。在SceneEval-100上,SceneMosaic在语义布局质量上与最强的智能基线相匹配,速度提升24倍,大幅减少物理违规,并获得最高的人类评分。我们的代码在此https URL公开提供。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*室内仿真场景可扩展生成\*\*中的两个核心瓶颈,具体可归纳如下: --- ### 1. 效率与质量之间的固有权衡 现有主流范式在生成速度与场景保真度之间存在显著矛盾: - \*\*Agentic Text-to-3D 方法\*\*(如 SceneSmith、SAGE)依赖视觉-语言模型(VLM)进行迭代式物体放置与修正,虽能产出语义合理、物理有效的高质量场景,但单一场景的生成轨迹长达数小时,难以支撑大规模仿真需求。 - \*\*参数化 Image-to-3D 方法\*\*(如 SAM-3D、MIDI、SceneGen)利用从二维图像中学得的强布局先验实现快速前馈生成,但推断出的物体 6D 姿态往往不精确,导致频繁的\*\*悬浮(floating)\*\*、\*\*穿模(clipping/collision)\*\*与\*\*越界(out-of-bounds)\*\*等物理违规问题。 --- ### 2. 单输入布局多样性缺失 现有方法针对单一输入通常仅输出\*\*确定性布局\*\*,难以反映真实场景的动态本质: - 真实室内环境会因人类活动而不断发生\*\*结构化重排\*\*(如重新定位、重新定向家具),在保持功能与物理合理性的前提下产生多种合理变体。 - 简单地对现有方法重复采样无法有效捕捉这种保持场景连贯性的结构化变化,导致生成的布局变体要么冗余,要么破坏语义一致性。 --- ### 3. 对交互式娱乐与具身 AI 的仿真瓶颈 上述两点共同制约了仿真就绪(simulation-ready)场景的规模化生产:既需要足够快的生成速度以批量化构建环境,又需要物理与语义上的严格有效性以保证仿真可靠性,同时还需要\*\*多样化布局变体\*\*以覆盖训练和评估所需的动态环境条件。 --- ### 论文的解决思路 为突破上述障碍,论文提出 \*\*SceneMosaic\*\*,其核心策略为: - \*\*混合范式\*\*:利用图像先验进行快速初始化,再通过 VLM Agent 迭代进化修正布局,兼顾效率与物理/语义有效性。 - \*\*局部单元分解\*\*:基于场景局部性将场景拆分为独立的局部单元,各单元独立进化后通过\*\*笛卡尔积(Cartesian product)\*\*组合,从单一路径进化中组合出指数级数量的候选场景。 - \*\*正交投影与动态选择\*\*:在二维正交视图下进行布局编辑以降低空间推理复杂度,并通过新颖性感知的场景距离度量与动态贪心筛选,提炼出紧凑且多样的布局集合。 简言之,该论文试图在\*\*不牺牲物理有效性与语义对齐的前提下,将 agentic 场景生成的耗时降低一个数量级,并为单一输入系统地合成大量物理合理、功能连贯的布局变体\*\*。 Q2: 有哪些相关研究? 根据论文第2节(Related Work)及相关实验对比,该研究主要涉及以下三大方向的相关工作: --- ### 1. 传统 3D 室内场景合成 早期方法主要依赖带标注的布局数据集(如 3D-FRONT

9
)学习家具排列模式,代表性技术路线包括: - **自回归模型**:ATISS
25
、SceneFormer
38
等利用 Transformer 按顺序预测物体类别与位置; - **扩散模型**:DiffuScene
35
、EchoScene
44
通过去噪扩散过程生成场景布局; - **显式先验与约束图**:LayoutEnhancer
19
、InstructScene
22
、基于约束图的生成式布局建模
24
引入布局先验或语义图指导合成。 此外,另一支研究通过显式几何或神经辐射场表示直接在文本或场景图条件下组合完整 3D 场景,例如 CasaGPT
8
、GraphDreamer
11
、GALA3D
50
。程序化生成方法(如 ProcTHOR
5
、Infinigen Indoors
29
、Pair2Scene
31
、Proc-GS
21
)则依靠 handcrafted 或学习到的规则实现大规模环境合成,但语义可控性有限。与这些工作不同,SceneMosaic 无需类别特定的训练数据,而是通过视觉布局先验与 agentic 精修相结合来生成密集且物理合理的场景。 —- ### 2. 基于 LLM/VLM 的场景生成(Agentic Text-to-3D) 该方向利用大语言模型(LLM)与视觉-语言模型(VLM)的推理能力指导场景构建,可进一步分为两类: - **直接预测与程序合成**:LayoutGPT

7
、LLPlace
41
、基于层次化结构化的开放词汇室内场景合成
33
以及 Direct Numerical Layout Generation
30
直接输出数值化布局或结构化场景描述;Open-universe Indoor Scene Generation
1
、From Programs to Poses
14
则通过 LLM 程序合成在物体数据库上操作以构建场景。 - **迭代式 Agentic 流程**:近期主流范式将感知、放置与迭代修正组织为工具调用与多模态反馈的闭环,代表性方法包括: - HoloDeck
42

  • I-Design
    3
  • Global-Local Tree Search
    6
  • AnyHome
    10
  • MESATask
    13
  • LayoutVLM
    32
  • SceneWeaver
    43
  • SceneSmith
    26
  • SAGE
    39
  • HSM
    27
    这类方法在语义保真度上表现强劲,但推理成本高昂(如 SceneSmith 生成单一场景需数小时)。SceneMosaic 保留了 agentic 推理的灵活性,但将其 grounded 于图像初始化,并通过**局部单元分解**实现高效且多样化的布局进化。 —- ### 3. 图像到 3D 生成(Image-to-3D) 该领域受益于前馈式 3D 资产生成技术的进步,如 Hunyuan3D 2.5

18
、Structured 3D Latents
40
、Clay
45
、PixarMesh
47
、Hunyuan3D 2.0
48
。在此基础上,近期研究开始从单张参考图像联合推断物体几何与粗略场景布局,代表性工作包括: - **MIDI**
15
:多实例扩散模型用于单图像到 3D 场景生成; - **SceneGen**
23
:单张图像前馈生成 3D 场景; - **SAM-3D**
4
:基于分割的图像到 3D 场景重建。 这些方法借助逼真的视觉先验实现了快速初始化,但推断出的物体 6D 姿态往往不精确,导致物体间碰撞、悬浮与越界等物理违规问题频发。SceneMosaic 正是利用此类方法进行快速场景初始化,继而通过 **agentic layout evolution** 对物体姿态进行物理一致性与语义合理性的迭代精修。 —- ### 总结 SceneMosaic 的定位在于**桥接上述两种范式**:以图像到 3D 模型的强先验实现高效初始化,以局部化、正交投影的 agentic 进化保障物理与语义有效性,并通过局部单元的笛卡尔组合解决现有方法在**多样性**与**扩展性**上的不足。 Q3: 论文如何解决这个问题? 该论文提出 **SceneMosaic**,一个混合式(hybrid)场景生成框架,通过“快速初始化 + 局部化 Agentic 进化 + 组合式多样性合成”的三阶段管线,系统性地解决效率、物理有效性与多样性之间的矛盾。具体方法论可分解为以下核心环节: —- ### 1. 场景重建与结构化:从图像先验到局部单元分解 **统一输入与对象级重建** 首先将文本或图像输入统一为场景图像。一个感知 Agent(perception agent)执行实例级物体注册,输出带语义标签、文本描述与 2D 边界框的物体清单。随后利用 SAM-3

2
结合文本提示与边界框进行实例分割,并通过迭代式掩膜精修解决缺漏、重复与嵌套区域问题。最终,每个物体通过 SAM-3D
4
从图像及其验证掩膜中独立重建,得到网格 M_i 与初始 6D 布局参数:
T_i = (p_i, R_i, s_i)
其中 p_i ∈ R^3 为平移, R_i ∈ SO(3) (或单位四元数 q_i ∈ S^3 )为旋转, s_i ∈ R^3 为各向异性缩放。 **关系引导的场景结构化** 在初始布局基础上,论文进一步推断房间结构、物体关系与物理属性。该过程被组织为一个有向无环图(DAG),由管理 Agent 动态调度多个子任务 Agent(支撑推理、包含分析、墙面恢复、语义精修等)。基于推断出的 **attach**(依附)与 **contain**(包含)关系,场景被组织为一棵层次化的**场景树**。 **局部单元的显式定义** 核心设计在于利用室内布局的模块性与局部独立性:每个**局部单元(local unit)**被定义为一颗子树,由一个非叶节点(作为锚点 anchor)及其所有直接子节点组成。局部单元之间可独立进化;少量跨单元功能约束(如地板上的椅子须面向书桌,桌上的显示器须保持与书桌同向)被提取为**单元局部指导(unit-local guidance)**注入对应上下文。这种分解为后续的并行进化与组合式多样性生成奠定了结构基础。 —- ### 2. 物理布局稳定化:建立进化前的物理基础 在进入 Agentic 进化之前,每个局部单元先经过物理一致性优化,沿着场景树自顶向下执行: - **包含校正(Containment Correction)**:在正交投影下检查每个目标物体是否被其锚点物体包围,修正无效布局。 - **重力模拟(Gravity-Based Simulation)**:将局部单元置于刚体仿真环境中,依据锚点类型施加对应方向的重力(地板锚点为向下重力 (0, -g, 0) ,天花板为反向重力,墙面为沿外法线方向),使物体自然沉降以消除碰撞与悬浮。 此步骤产出**物理上稳定的局部布局**,为后续 Agentic 精修提供可靠起点。 —- ### 3. Agentic 布局进化:Critic-Actor 循环与正交 2D 抽象 对于每个局部单元,系统从原始布局派生出一组多样化的候选变体,随后原始布局与候选变体并行进入 Agentic 进化。 **Critic-Actor 循环** 每一轮进化包含以下闭环: - **Critic**:接收当前正交渲染图、2D 布局状态、碰撞检测报告、跨单元约束与布局记忆,诊断硬物理错误(深度穿模、越界)与语义错误(不合理的位置/朝向),输出定性修正建议(如“将椅子略微靠近桌子”)与整体质量评分,**不输出精确坐标**。 - **Actor**:将定性建议解析为符号化的位姿表达式(如相对对齐、等距分布、偏移量),在沙箱算数求值器中基于当前 2D 布局解析为具体的平移与旋转更新。 **正交 2D 投影与坐标映射** 为降低空间推理复杂度,每个局部单元被渲染为 1024 × 1024 的**正交 2D 视图**(地板锚点用俯视图,墙面锚点沿外法线方向,包含单元沿锚点正面方向)。视图叠加坐标网格、2D 边界框与朝向箭头。Agent 仅需在 2D 平面内预测中心坐标 (u, v) 与平面内旋转角,随后通过预存网格的双线性插值确定性反投影回 3D 位姿:

T_i^(3D) = BilinearLift(u, v, θ)
这消除了透视畸变与复杂 3D 变换空间的干扰,将布局编辑简化为 2D 平移与平面旋转。 **记忆与防死锁机制** 每个局部布局维护显式的历史摘要,记录每轮初始位姿、Critic 建议、Actor 表达式与碰撞历史。Critic 被显式指示检查记忆以识别循环调整模式(如沿同一轴的左右震荡、重复的越界修正),一旦发现即要求转向定性不同的修正策略(调整另一轴、更大幅度的移动、或修改另一物体),从而避免优化死锁。 进化收敛条件包括:Critic 不再要求修改、达到最大轮数、或连续轮次中最大单物体平移量低于阈值且无碰撞/越界。最终选中的布局再经过一次重力仿真,确保严格物理合理后进入组合阶段。 —- ### 4. 多样性驱动的场景组合:从局部变体到全局候选 **组合式变体装配** 每个局部单元经进化后产生一组经过验证的、物理合理的局部布局变体。由于各局部单元在各自锚点坐标系中表示,系统通过**笛卡尔积(Cartesian product)**跨所有局部单元进行组合:

V1 × V_2 × ·s × V_k arrow C
其中 C 为全局候选场景池。子单元通过齐次变换矩阵逐层嫁接到父场景:
M_i^(scene) = M_a^(scene) · (M_a^(local))^(-1) · M_i^(local)
随后经极分解恢复有效的 (p_i, R_i, s_i) 。装配后的候选场景还需通过最终的全局碰撞检测,剔除残余穿模者。 **新颖性感知的场景距离** 为从指数级候选池中筛选紧凑且多样的子集,论文定义了成对场景距离 N(S_A, S_B) ,综合三项归一化差异: 1. **相对位置差异** D
(pos) :将物体对 i,j 的位移向量投影到物体 i 的局部坐标系:
v_(ij,local)^((X)) = (R_i^((X)))^top (p_j^((X)) - p_i^((X)))

D(pos) = ( ∑(i ≠ j) |v(ij,local)^((A)) - v(ij,local)^((B))|2^2∑(i ≠ j) |p_j^((A)) - p_i^((A))|_2^2 )^(1/2)

  1. **绝对距离差异** D(dist) :衡量全局物体间距变化:
    D
    (dist) = ( ∑(i ≠ j)(d(ij)^((A)) - d(ij)^((B)))^2∑(i ≠ j)(d(ij)^((A)))^2 )^(1/2), quad d(ij)^((X)) = |p_j^((X)) - p_i^((X))|_2
  2. **旋转差异** D_(rot) :基于四元数内积:
    θ_i = 2arccos(|q_i^((A)) · q_i^((B))|) ∈ [0, π]

D(rot) = (1) / (π N)∑(i=1)^(N)θi
综合距离为:
N(S_A, S_B) = w_p D
(pos) + wu D(dist) + wr D(rot)
其中 wp + w_u + w_r = 1 ,实验中取 (w_p, w_u, w_r) = (0.4, 0.4, 0.2) 。 **动态最大-最小贪心选择** 为选出 m 个高多样性变体,算法执行动态贪心搜索: - 以原始基线场景 S(org) 作为初始种子保留; - 每轮选取使得到已选集合 R 的最小距离最大化的候选:
S^* = argmax(S ∈ C) min(S_r ∈ R) N(S_r, S)

  • 每轮选择后,以动态阈值 τ = α · d_(max) ( α=0.1 )剪除距已选集合过近的候选,防止局部聚集并加速搜索。 —- ### 总结 SceneMosaic 的解决逻辑可概括为: | 核心问题 | 解决机制 | |————-|————-| | **效率–质量权衡** | 图像先验提供快速初始化,Agentic 进化仅做局部精修,避免从零开始的漫长迭代 | | **物理违规** | 物理预稳定化(包含校正 + 重力仿真)+ Critic-Actor 闭环 + 最终验证 | | **语义偏离** | 正交 2D 投影降低空间推理难度,跨单元约束保持全局功能一致性 | | **多样性不足** | 局部单元独立进化 → 笛卡尔积组合 → 新颖性感知距离 + 动态贪心筛选 | 通过上述设计,SceneMosaic 将单次输入转化为一个基线场景与 m 个多样化变体,在 SceneEval-100 上实现了与最强 Agentic 基线相当的语义质量,同时获得 **24 倍加速**,并将物理违规(碰撞率、越界率)降至零。 Q4: 论文做了哪些实验? 论文围绕 **SceneEval-100** 基准开展了系统性的实验评估,涵盖定量对比、定性可视化、用户主观评测及多维度消融分析,具体如下: —- ### 1. 实验设置 **评估基准与数据**:采用包含 100 个手动设计室内场景文本描述的 **SceneEval-100**

34
作为统一测试集。对于 text-to-3D 基线直接输入文本提示;对于 image-to-3D 基线及本文方法,则先将文本渲染为对应图像再作为输入。 **对比基线**: - **Agentic text-to-3D**:HoloDeck
42
、SceneWeaver
43
、SAGE
39
、SceneSmith
26

  • **Image-to-3D**:MIDI
    15
    、SceneGen
    23
    、SAM-3D
    4
    **评价指标**: - **语义质量**:POS(物体位置合理性)与 ROT(朝向合理性),由 GPT-5.5 自动评判; - **物理有效性**:NAV(可导航性)、COL(碰撞率)、OOB(越界率); - **效率**:单场景平均生成时间(小时)。 —- ### 2. 主实验:定量对比(Table 1) 在 **SceneEval-100** 上全面对比各方法,本文方法分别报告了**基线场景(Base Scenes)**与 **5 个变体场景(Variant Scenes, m=5 )** 的指标。核心发现包括: - Agentic 基线(如 SceneSmith、SAGE)语义分数较高,但生成耗时极长(SceneSmith 约 3.43 小时,SAGE 约 7.56 小时); - Image-to-3D 基线(如 SAM-3D、MIDI、SceneGen)速度快,但碰撞率与越界率显著更高; - 本文方法在语义指标上达到或接近最强 agentic 基线水平,同时将物理违规(COL、OOB)降至 **0**,且基线场景仅需约 **0.14 小时**,变体场景均摊仅需约 **0.03 小时**,相较 SceneSmith 实现约 **24 倍加速**。 —- ### 3. 定性对比(Figure 3) 选取多种复杂室内场景(如卧室与客厅组合、家庭收藏展厅、陶艺工作室、浴室洗衣房等),与 SAGE、SceneSmith、SAM-3D 进行可视化比较: - **SAGE / SceneSmith**:语义有意义,但长优化轨迹导致耗时高且可能偏离原始语义; - **SAM-3D**:初始化迅速,但存在物体悬浮、结构穿模等物理不合理现象; - **本文方法**:保持了输入图像的全局空间结构,通过 agentic 进化改善物体关系,同时展示了与基线场景保持一致的多样化变体布局。 —- ### 4. 用户研究(Table 2) 招募 **48 名参与者**,对 15 个场景(5 种方法 × 每种 3 个场景)在**语义合理性(Sem.)**与**物理合理性(Phy.)**两个维度上进行 5 点李克特量表评分。结果显示: - 本文方法在两项指标上均获得**最高平均分**(Sem. 4.33 ± 0.89 ,Phy. 4.47 ± 0.82 ),且标准差最小; - SceneSmith 位列第二,但生成成本远高于本文; - Kendall’s W 系数表明评分者间具有高度一致性( W ≥ 0.633, p < 0.001 )。 —- ### 5. 消融实验(Table 3) 为验证关键设计,论文在基线场景与变体场景上各设计了 **4 组消融**: | 消融设置 | 核心改动 | 验证目的 | |————-|————-|————-| | **(1) w/o Image Init** | 以纯文本驱动初始化替代图像先验 | 验证图像先验对效率与语义对齐的贡献 | | **(2) w/o Physics** | 移除物理预稳定化与进化中的物理仿真工具 | 验证物理处理对消除碰撞/越界的必要性 | | **(3) Perspective 3D Ops + Local Decomposition** | 保留局部分解,但将正交 2D 投影换为透视 3D 视图与 3D 编辑 | 验证正交 2D 抽象对推理效率与精度的影响 | | **(4) Global Evolution + Perspective 3D Ops** | 移除局部分解,全局透视 3D 进化 | 验证局部单元分解对效率与多样性的关键作用 | 主要结论: - 去除图像初始化后,生成时间显著增加(base 从 0.14h 增至 1.25h),语义分数略有下降; - 去除物理处理导致碰撞率与越界率大幅上升(COL 约 18.9%,OOB 约 8.5%); - 透视 3D 操作显著降低语义指标并增加耗时; - 全局进化(无局部分解)语义分数最低,且**完全无法加速变体生成**,而局部分解框架可将变体均摊时间压至 0.03h。 —- ### 6. 多样性分析(补充材料 Table 4 & Table 5) 在固定相同重建资产的前提下,进一步评估变体生成的多样性机制: - **与退化流程对比(Table 4)**: - **w/o Novelty Selection**:从候选池随机均匀采样,Div-IoU 显著升高(布局更冗余),Div-N 降低; - **Repeated Sampling**:不采用局部单元分解与笛卡尔组合,而是对同一场景用不同随机种子重复完整进化 5 次。该方案 Div-IoU 最高(最缺乏多样性)且耗时最高(0.14h/变体),验证了本文组合式策略与动态筛选的有效性。 - **多样性与质量的权衡(Table 5)**: - 向基线布局施加高斯扰动( σ = 0.10, 0.25, 0.50 )后进行重力仿真。随着 σ 增大,Div-IoU 降低(多样性提升),但语义指标(POS、ROT)与关系保持率(RelKeep)急剧崩溃; - 在匹配本文多样性水平的 σ = 0.25 设置下,扰动方法的 POS/ROT 远低于本文,证明本文的多样性**并非以牺牲布局有效性为代价**。 —- ### 7. 实现与算法细节验证(补充材料) 补充材料进一步提供了以下实验与工程细节: - **Agent 配置**:所有 Agent 基于同一 VLM 通过角色提示实例化,局部单元的进化与变体生成可并行执行; - **物理仿真参数**:基于 CoACD 凸分解的刚体仿真,针对不同锚点类型(地板/天花板/墙面)施加对应方向重力; - **正交投影坐标映射**: 1024 × 1024 正交视图配合网格双线性插值,实现 2D Agent 预测到 3D 位姿的确定性反投影; - **动态最大-最小贪心搜索**:给出完整伪代码(Algorithm 1),明确非对称距离计算方向与动态剪枝阈值 τ = α · d_(max) 的运作方式。 Q5: 有什么可以进一步探索的点? 基于论文所呈现的方法论与明确指出的局限性(Section 11),可从以下几个维度展开进一步探索: —- ### 1. 从房间尺度到建筑级别的层次化生成 论文明确指出,由于当前框架依赖单张图像初始化,而单张图像通常仅能描绘单个房间,因此生成结果本质上被限制在**房间尺度(room-scale)**。一个极具价值的延伸方向是构建**层次化组合框架**:将 SceneMosaic 的局部单元分解思想向上扩展,通过房间级锚点(room-level anchor)将多个独立生成的房间(如客厅、卧室、厨房)在保持功能连通性(functional connectivity)与风格一致性(style coherence)的前提下组合为完整的公寓或建筑。这需要引入跨房间的拓扑约束(如门廊位置、动线规划)与全局一致的光照和材质分布。 —- ### 2. 动态场景与时序演化建模 论文强调真实场景具有动态性(dynamically changing nature),当前方法虽能生成多样化的静态布局变体,但尚未建模**时序连续的场景演化过程**。后续研究可探索: - **活动驱动的布局变迁**:结合人类日常活动轨迹(如清晨起床、烹饪、就寝)生成具备因果连贯性的场景序列; - **交互式物理仿真**:在生成阶段即纳入物体使用过程中的物理变化(如椅子被拉出、书籍被翻开、柜门被打开),从而产出可直接支持交互仿真的 4D 场景。 —- ### 3. 增强物理真实性与复杂物理属性 当前物理稳定化主要依赖刚体仿真与重力沉降,对物体物理属性的建模相对简化。未来可引入: - **异质物理属性估计**:在重建阶段同步推断物体的质量分布、摩擦系数、重心位置等参数,使生成场景在后续机器人交互仿真中具备更高保真度; - **非刚体与可变形物体**:将当前主要面向刚性家具(桌椅、柜子)的框架扩展至支持软体家具(沙发靠垫、床铺被褥)、悬挂物(窗帘、衣物)及液体容器的物理合理放置。 —- ### 4. 面向具身 AI 的任务导向生成(Task-Driven Generation) 现有评估主要聚焦于布局的语义与物理合理性,而仿真就绪场景的最终服务对象常包含具身智能体。因此可进一步研究: - **Affordance 显式建模**:在布局进化中引入可供性约束,确保生成的场景不仅视觉上合理,且对目标智能体具备可操作的功能结构(如确保机器人可达的抓取空间、足够宽的通道宽度); - **任务适应性布局演化**:根据具体下游任务(如导航、物体重排、家庭辅助)反向优化场景布局,实现“为训练而生成”的闭环。 —- ### 5. 细粒度用户可控性与条件多样性 尽管论文提出了基于笛卡尔积与新颖性感知距离的多样性生成,但用户对多样性的控制仍较为粗粒度。未来工作可探索: - **部分约束布局编辑**:允许用户显式固定某些关键物体的位置(如“沙发必须靠墙”),仅对指定区域或物体进行变体生成; - **风格-布局解耦控制**:将场景风格(现代、复古、极简)与空间布局分别参数化,实现跨风格的同布局生成或同风格的多布局生成。 —- ### 6. 多模态输入条件的扩展 当前框架统一以图像(或文本渲染为图像)作为初始化信号。可进一步拓展至多模态条件输入: - **草图与 CAD 图纸**:支持用户手绘布局草图或输入建筑 CAD 图纸作为先验,提升专业设计场景下的可控性; - **稀疏深度或点云**:结合 RGB-D 扫描或 LiDAR 点云进行初始化,使框架能直接作用于真实场景扫描数据,支持数字孪生应用。 —- ### 7. 计算效率与实时生成 尽管 SceneMosaic 已将生成时间从数小时压缩至分钟级,但对于需要大规模即时生成(如游戏关卡流式加载、交互式 VR 设计工具)仍存在瓶颈。后续研究可探索: - **蒸馏与轻量化 Agent**:将 Critic-Actor 的推理过程蒸馏为轻量级视觉-语言模型或专门的布局修正策略网络,减少 VLM 调用次数; - **神经场替代显式网格**:在进化阶段使用隐式表示(如 3D Gaussian Splatting 或 NeRF)替代显式网格与刚体仿真,以可微方式加速物理一致性优化。 —- ### 8. 更全面的评估体系 SceneEval-100 主要评估静态布局的语义与物理指标。未来可建立: - **长程依赖评估**:衡量跨房间、跨楼层布局的全局一致性; - **动态多样性指标**:超越静态 IoU 与距离度量,引入基于智能体行为覆盖率的场景效用评估; - **物理仿真鲁棒性测试**:在生成场景中引入外部扰动(如推动物体、改变光照),检验布局的物理与视觉稳定性。 —- 简言之,SceneMosaic 为“高效且多样化的仿真就绪场景生成”建立了坚实的混合范式基础,其最有前景的延伸方向在于**向上扩展至建筑级别**、**向深融入动态交互与具身智能需求**,以及**向更多模态、更细粒度可控的生成模式**演进。 Q6: 总结一下论文的主要内容 该论文提出 **SceneMosaic**,一种面向交互式娱乐与具身 AI 的混合式室内场景生成框架,旨在同时解决现有方法在**效率–保真度权衡**与**布局多样性缺失**上的双重瓶颈。以下是论文主要内容的高度概括: —- ### 1. 研究背景与核心问题 当前仿真就绪室内场景的生成存在两大范式,但各自面临固有缺陷: - **Agentic Text-to-3D 方法**(如 SceneSmith、SAGE):依赖视觉-语言模型(VLM)进行迭代式物体放置与修正,语义与物理质量高,但单场景生成耗时长达数小时,难以规模化。 - **参数化 Image-to-3D 方法**(如 SAM-3D、MIDI):利用从二维图像中学得的强布局先验实现快速前馈生成,但推断出的 6D 姿态往往不精确,导致严重的物理违规(悬浮、穿模、越界)。 此外,两类方法均缺乏**单一输入下的多样化布局生成能力**:真实场景会随人类活动发生结构化重排,而现有方法通常只输出确定性布局,难以覆盖仿真训练所需的动态环境条件。 —- ### 2. 方法概述:SceneMosaic 框架 SceneMosaic 采取**“快速初始化 + 局部 Agentic 进化 + 组合式多样性合成”**的三阶段策略,其整体流程可概括如下: #### 2.1 场景重建与结构化 给定参考图像,首先通过 SAM-3 进行实例级分割与掩膜精修,再利用 SAM-3D 重建每个物体的网格 M_i 及其初始布局参数:

T_i = (p_i, R_i, s_i)
其中 p_i ∈ R^3 为位置, R_i ∈ SO(3) (或单位四元数 q_i ∈ S^3 )为旋转, s_i ∈ R^3 为各向异性缩放。 随后,通过由管理 Agent 调度的有向无环图(DAG)推断物体间的 **attach**(依附)与 **contain**(包含)关系,构建层次化场景树。基于室内布局的模块性,将场景显式分解为若干**局部单元(local units)**:每个单元由一个锚点(非叶节点)及其直接子节点组成,可独立进化。 #### 2.2 物理布局稳定化 在进入 Agentic 进化前,每个局部单元先进行物理一致性优化: - **包含校正**:在正交投影下修正锚点与目标物体的空间包含关系; - **重力仿真**:依据锚点类型(地板/天花板/墙面)施加对应方向的重力,使物体自然沉降,消除碰撞与悬浮。 #### 2.3 Agentic 布局进化(Critic-Actor 循环) 对每局部单元的原始布局及其衍生变体并行执行迭代进化: - **Critic**:基于正交 2D 渲染图( 1024 × 1024 )、2D 布局状态、碰撞检测报告与布局记忆,诊断物理错误(穿模、越界)与语义错误,输出**定性修正建议**与质量评分; - **Actor**:将定性建议解析为符号化位姿表达式,在 2D 正交平面内执行平移与平面旋转更新,再经网格双线性插值确定性反投影回 3D。 正交投影的使用消除了透视畸变,将复杂的 3D 姿态调整简化为 2D 操作,显著降低了 VLM 的空间推理负担。布局记忆机制则通过检测循环调整模式来防止优化死锁。 #### 2.4 多样性驱动的场景组合 每个局部单元经进化后产生一组物理有效的布局变体。SceneMosaic 通过**笛卡尔积(Cartesian product)**跨所有局部单元组合这些变体:

V1 × V_2 × ·s × V_k arrow C
生成指数级候选场景池 C 。 为从中提炼紧凑且多样的子集,论文定义了**新颖性感知的场景距离**:
N(S_A, S_B) = w_p D
(pos) + wu D(dist) + wr D(rot)
其中: - D(pos) 衡量物体对相对位置差异(局部坐标系下的归一化位移); - D(dist) 衡量全局物体间距变化; - D(rot) 衡量朝向差异,通过四元数内积 θ_i = 2arccos(|q_i^((A)) · q_i^((B))|) 计算。 随后采用**动态最大-最小贪心搜索**:以原始布局为种子,每轮选取使得到已选集合最小距离最大化的候选,并以动态阈值 τ = α · d(max) 剪除过近候选,最终保留基线场景与 m 个高多样性变体。 —- ### 3. 实验与结果 论文在 **SceneEval-100** 基准上开展了系统评估,对比了 agentic 方法(HoloDeck、SceneWeaver、SAGE、SceneSmith)与 image-to-3D 方法(MIDI、SceneGen、SAM-3D)。 #### 3.1 定量结果 - **语义质量**:在 POS(位置合理性)与 ROT(朝向合理性)上,SceneMosaic 基线场景达到 84.3±2.0 与 78.4±3.4 ,与最强 agentic 基线 SceneSmith 相当。 - **物理有效性**:碰撞率(COL)与越界率(OOB)均降至 **0%**,显著优于 image-to-3D 方法(SAM-3D 的 COL 为 20.2±6.1 ,OOB 为 8.9±4.2 )。 - **效率**:基线场景平均仅需 **0.14 小时**,变体场景均摊仅 **0.03 小时**,相较 SceneSmith(3.43 小时)实现约 **24 倍加速**。 #### 3.2 用户研究 48 名参与者对语义与物理合理性进行 5 点评分。SceneMosaic 获得最高分(语义 4.33±0.89 ,物理 4.47±0.82 ),且标准差最小,Kendall’s W 系数显示评分者间高度一致。 #### 3.3 消融实验 - **去除图像初始化**:生成时间大幅增加(基线 0.14h to 1.25h),语义指标下降,验证视觉先验对效率与对齐度的关键作用; - **去除物理处理**:碰撞率与越界率急剧上升,证明物理稳定化不可或缺; - **透视 3D 替代正交 2D**:语义指标下降且耗时增加,验证正交抽象的有效性; - **全局进化替代局部分解**:语义分数最低,且**完全丧失变体快速生成能力**(变体耗时 0.65h vs. 本文 0.03h),凸显局部单元分解的核心价值。 —- ### 4. 主要贡献 - 提出 SceneMosaic 混合框架,将图像布局先验的快速初始化与 Agentic 迭代的物理/语义精修相结合,突破了效率与保真度的传统权衡; - 提出基于局部单元分解的 Agentic 布局进化方案,通过独立进化与笛卡尔积组合,将单次进化路径扩展为组合级数量的候选布局,并以新颖性感知距离与动态贪心搜索实现紧凑多样的变体选择; - 通过正交 2D 投影将 3D 姿态编辑简化为 2D 操作,显著降低 VLM 空间推理复杂度并提升进化稳定性。 —- ### 5. 局限与未来方向 论文明确指出,由于单张图像通常仅包含单个房间,当前框架被限制在**房间尺度**。将框架扩展至多房间建筑级别的层次化组合、引入动态时序演化、增强面向具身 AI 的任务导向生成,以及支持草图、CAD 图纸等多模态输入,是极具前景的后续研究方向。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Xingjian Ran,Xiaoye Mo,Sihao Liu,Jianyu Zhang,Li Luo,Bo Dai

Categories:

PDF URL: https://arxiv.org/pdf/2609.05594.pdf

Arxiv URL: https://arxiv.org/abs/2609.05594

Arxiv ID: 2609.05594

CoolPaper URL: https://papers.cool/arxiv/2609.05594

Published: 2026-09-10T01:27:00.846Z

Updated: 2026-09-10T01:27:00.846Z


12. BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference

Abstract:Large Reasoning Models (LRMs) achieve superior problem-solving through extended Chain-of-Thought (CoT) generation, but the resulting key-value (KV) cache grows linearly with sequence length and creates severe memory bottlenecks, often exceeding GPU capacity for long reasoning traces. Existing KV cache compression methods rely on recent queries to estimate future token importance, implicitly assuming these serve as reliable proxies for future attention patterns. We demonstrate that this assumption fails in long-horizon reasoning: certain decoding steps generate Thought Revisiting Tokens (TRT) that re-attend to distant previous context, such as task-solving plans formulated early in the trace. Through systematic analysis, we discover that queries corresponding to the TRT cluster into a small number of similarity groups in the embedding space. Based on this insight, we propose BeaconKV, a training-free KV cache compression method that maintains beacon queries, compact representatives for each global query cluster, to anticipate which KV pairs will be revisited without storing the entire query history. Across four open-source LRMs and diverse reasoning benchmarks, BeaconKV generally outperforms existing compression methods, achieving up to $5.8\times$ memory reduction while nearly preserving full cache accuracy and improving throughput by over $4.3\times$.

中文摘要

摘要:大型推理模型(LRMs)通过扩展的思维链(CoT)生成实现卓越的问题解决能力,但由此产生的键值(KV)缓存会随着序列长度线性增长,造成严重的内存瓶颈,对于长推理轨迹,往往超过GPU容量。现有的KV缓存压缩方法依赖于最近的查询来估计未来的token重要性,隐含地假设这些查询可以作为未来注意力模式的可靠代理。我们证明了这一假设在长程推理中失效:某些解码步骤会生成“思维重访token”(TRT),重新关注遥远的先前上下文,例如在轨迹早期制定的任务解决计划。通过系统分析,我们发现对应TRT的查询在嵌入空间中聚类成少数相似组。基于这一洞察,我们提出了BeaconKV,一种无需训练的KV缓存压缩方法,它保留“信标查询”,即每个全局查询簇的紧凑代表,以预测哪些KV对会被重访,而无需存储整个查询历史。在四个开源LRMs和多种推理基准测试中,BeaconKV通常优于现有的压缩方法,实现了最多5.8倍的内存减少,同时几乎保持完整缓存的准确性,并将吞吐量提高超过4.3倍。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决大型推理模型(Large Reasoning Models, LRMs)在长链式思维(Chain-of-Thought, CoT)生成过程中面临的\*\*关键值(KV)缓存内存瓶颈\*\*问题。具体而言,论文试图解决以下核心挑战: \*\*1. 长推理轨迹导致 KV 缓存急剧膨胀\*\* - LRMs 通过生成极长的推理轨迹(通常可达数万 token)来实现复杂问题的逐步求解。 - 在自回归解码中,KV 缓存随序列长度线性增长,极易超出 GPU 内存容量,严重制约了模型的实际部署和推理效率。 \*\*2. 现有 KV 缓存压缩方法在长程推理中的失效\*\* - 现有的压缩方法(如 RPC、R-KV 等)普遍依赖\*\*近期生成的查询(recent queries)\*\*来估计未来 token 的重要性,并据此驱逐“不重要”的 KV 对。 - 论文指出,这些方法隐含了一个关键假设:近期查询是未来注意力模式的可靠代理。然而,在长程推理中,该假设\*\* fundamentally fails\*\*。 \*\*3. 思维回溯 token(Thought Revisiting Tokens, TRT)的识别与保留\*\* - 论文发现,在推理过程中存在一种称为 \*\*TRT\*\* 的现象:某些解码步骤生成的 token 会重新关注遥远的先前上下文(例如早期制定的解题计划、问题约束等),以维持全局连贯性。 - 这类 TRT 对应的查询(global queries)与主要关注邻近上下文的局部查询(local queries)具有截然不同的注意力模式。 - 由于 TRT 稀疏且不可预测地出现在推理轨迹中,仅依赖近期查询的压缩方法会\*\*过早驱逐\*\*这些 TRT 后续需要访问的远距离 KV 对,从而导致推理质量严重下降。 \*\*4. 在有限内存下预判未来全局注意力需求\*\* - 论文进一步发现,这些 global queries 在嵌入空间中并非随机分布,而是\*\*聚类为少量相似性群组\*\*。 - 基于这一几何结构洞察,论文提出 \*\*BeaconKV\*\*:一种无需训练的 KV 缓存压缩框架。该方法通过维护一组紧凑的 \*\*beacon queries\*\*(全局查询簇的代表),在不存储完整查询历史的前提下,预判哪些 KV 对将被未来的 TRT 重新访问,从而在大幅压缩内存的同时保留关键推理上下文。 简言之,该论文试图解决的核心问题是:\*\*如何在严格受限的 GPU 内存预算下,有效压缩不断膨胀的 KV 缓存,同时克服现有方法因无法预判“思维回溯”行为而误删关键远距离上下文的缺陷,从而保障长程推理的准确性与连贯性。\*\* Q2: 有哪些相关研究? 根据论文第6节(Related Work)及前文引述,与 BeaconKV 相关的研究工作可归纳为以下四个主要方向: --- ### 1. KV 缓存压缩(KV Cache Compression) 这是与 BeaconKV 最直接相关的方向,旨在通过驱逐不重要的 KV 对来缓解长序列推理中的内存压力。 - \*\*基于注意力分数的驱逐方法\*\* 早期工作如 \*\*H2O\*\*(Zhang et al., 2023)、\*\*SnapKV\*\*(Li et al., 2024)等利用注意力权重为 KV 对打分,保留得分较高的条目。这些方法为后续面向 LRM 的压缩奠定了基础。 - \*\*面向大型推理模型(LRM)的压缩方法\*\* 近期研究专门针对 LRM 的长链式思维(CoT)特性进行优化: - \*\*RPC\*\*(Song et al., 2025):基于近期查询的注意力权重对 KV 缓存进行压缩,是 LRM 推理场景中的代表性基线。 - \*\*R-KV\*\*(Cai et al., 2025):采用联合驱逐策略,同时融合注意力分数与基于键相似性的冗余分数。 - \*\*KeyDiff\*\*(Park et al., 2025):通过键相似性驱动压缩。 - \*\*LazyEviction\*\*(Zhang et al., 2025a):利用注意力模式的重复性进行延迟驱逐。 - \*\*基于可训练模块的方法\*\* 部分工作引入轻量级可训练模块来学习驱逐策略: - \*\*TRIM-KV\*\*(Bui et al., 2026)、\*\*LightThinker\*\*(Zhang et al., 2025b)、\*\*Fast KVzip\*\*(Kim et al., 2026a)等通过蒸馏或监督微调训练小型门控/压缩模块。 - 与上述方法不同,\*\*BeaconKV 无需任何训练\*\*,仅利用查询嵌入空间的固有几何结构来识别关键 KV 对。 --- ### 2. 面向大型推理模型的稀疏注意力(Sparse Attention for LRMs) 此类方法不减少 KV 缓存的物理存储量,而是通过限制每个查询只 attend 到 KV 缓存的一个子集来降低计算开销。 - \*\*Quest\*\*(Tang et al., 2024)与 \*\*Minference 1.0\*\*(Jiang et al., 2024):通过动态稀疏注意力加速长上下文推理。 - \*\*Multipole Attention\*\*(Hooper et al., 2025):对 KV 缓存聚类,精确 attend 到选中的条目并对其余项进行近似。 - \*\*ReSA\*\*(Sun et al., 2025):通过周期性密集修正(periodic dense rectification)缓解稀疏注意力中的累积误差。 - \*\*SeerAttention-R\*\*(Gao et al., 2026):利用自蒸馏门控模块学习稀疏模式。 --- ### 3. 推理长度的自适应控制(Adaptive Control of Reasoning Length) 该方向与 KV 缓存压缩正交,旨在通过分析 CoT 特性来优化推理路径长度,而非直接压缩缓存。 - \*\*DEER\*\*(Yang et al., 2026):提出无需训练的动态早退出机制,在推理转换点退出以缩短生成长度。 - \*\*SEAL\*\*(Chen et al., 2025):通过可操控干预(steerable interventions)校准推理路径。 - \*\*InftyThink\*\*(Yan et al., 2026):采用基于训练的框架,通过交错短推理步骤与中间总结实现更深层次的推理。 --- ### 4. 记忆增强架构(Memory-Augmented Architectures) 该范式通过在模型架构中引入显式记忆模块来扩展长上下文能力。 - \*\*Titans\*\*(Behrouz et al., 2026)与 \*\*GNM\*\*(Bennett et al., 2026):利用记忆模块作为上下文存储,实现重要信息的动态压缩、存储与重用。 - 相比之下,\*\*BeaconKV 不修改模型架构,也不引入额外记忆模块\*\*,而是作为一种即插即用的、无需训练的推理阶段框架,通过 beacon queries 充当选择器来保留关键 KV 缓存条目。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*BeaconKV\*\* 这一无需训练的 KV 缓存压缩框架来解决该问题。其核心思路是:识别出长程推理中独特的“思维回溯”现象,并利用全局查询在嵌入空间中的几何聚类结构,以极小的代表性查询集合预判未来可能重新访问的远距离 KV 对。具体解决路径可分为以下几个层面: --- ### 1. 核心洞察:识别 Thought Revisiting Tokens (TRT) 与查询聚类结构 论文首先系统分析了 LRM 推理过程中的注意力动态,发现两类截然不同的查询: - \*\*局部查询(Local Queries)\*\*:主要关注邻近的近期上下文,维持局部连贯性。 - \*\*全局查询(Global Queries)\*\*:对应 \*\*Thought Revisiting Tokens (TRT)\*\*,会将注意力重新定向到推理轨迹早期的遥远上下文(如问题陈述、高层解题计划),以维持全局连贯性。 关键发现是:这些全局查询在预旋转位置编码(pre-RoPE)的查询嵌入空间中\*\*并非随机分布,而是聚类为少量相似性群组\*\*。这表明,整个推理过程中可能出现的 diverse 全局查询,可以被一个紧凑的“信标查询”(beacon queries)集合有效代表。 --- ### 2. 观察查询集的重新设计:Beacon Queries + Recent Queries 现有方法(如 RPC、R-KV)仅使用近期查询(recent queries)作为观察集来估计 KV 重要性,因此无法预判稀疏但关键的 TRT。BeaconKV 扩展了观察查询集 Q_(obs) ,使其包含两个互补组件: - \*\*Recent Queries( Q_(recent) )\*\*:来自最近解码步骤的查询,用于捕获局部注意力信号,保证短期上下文连贯。 - \*\*Beacon Queries( Q_(beacon) )\*\*:从历史查询中选取的几何代表性查询,用于覆盖全局查询的各个聚类,预判未来 TRT 可能重新访问的远距离 KV 对。 --- ### 3. 在线信标查询选择:Continual Farthest Point Sampling (FPS) 为了在推理过程中以有界内存开销维护 beacon queries,论文提出了 \*\*Continual FPS\*\*: - 每个注意力头维护一个大小受限的预 RoPE 查询缓冲区。 - 当缓冲区中的查询数量达到上限 B_Q^(max) 时,触发一次最远点采样(Farthest Point Sampling, FPS):

Q(obs)^(pre) arrow FPS(Q(obs)^(pre), B_Q^(min))

  • FPS 基于余弦相似度迭代选择几何上最具多样性的查询,从而保留能代表不同全局注意力模式的“信标”。 - 这种“填充-压缩”循环确保了查询历史不会无限增长,同时持续演化以覆盖长程推理中出现的新的全局模式。 —- ### 4. 差异化的位置编码对齐与重要性评分 在每次执行 KV 缓存驱逐时,BeaconKV 对观察集中的两类查询施加不同的 RoPE 对齐策略: - **Beacon Queries**:将其旋转到**当前解码步位置 t **。这模拟了“如果此刻出现一个 TRT,它会如何 attend 到当前缓存中的 key”。 - **Recent Queries**:保持其**原始生成位置 τ **。这保留了标准的局部注意力信号。 随后,基于观察集计算注意力权重,并采用 **Max-Aggregation**(而非 Mean-Aggregation)聚合重要性分数:

Score[j] = max(h ∈ g) max(q ∈ Qobs) W[h, q, j]
由于 TRT 是稀疏且事件驱动的,其对应的注意力信号往往是高幅度但罕见的。Max-Aggregation 确保只要任意一个 beacon query 指示某个远距离 KV 对重要,该 KV 对就不会被稀释或遗漏。 —- ### 5. 周期性驱逐与保留策略 当 KV 缓存达到最大预算 B
(KV)^(max) 时,BeaconKV 执行驱逐: - **强制保留**:前缀 token(问题输入等)和最近的 token(保证局部流畅性)。 - **选择性保留**:在剩余预算内,根据上述 max-aggregated 分数选择 Top-K KV 对。 - **状态更新**:驱逐后,当前的 beacon 和 recent queries 被合并并再次通过 FPS 压缩,为下一轮压缩周期准备新的观察集。 —- ### 6. 效果总结 通过上述机制,BeaconKV 在**不修改模型结构、无需额外训练**的前提下,实现了: - **内存缩减**:峰值 GPU 显存使用降低达 **5.8×**。 - **精度保持**:在极低缓存预算下,精度接近完整 KV 缓存推理,较现有方法提升最高达 **31.7** 个百分点。 - **吞吐提升**:相比无压缩基线,吞吐量提升超过 **4.3×**。 简言之,论文通过将“查询空间的几何聚类结构”转化为“紧凑的信标查询集合”,解决了现有方法因只能看到局部近期上下文而误删远距离关键推理轨迹的根本缺陷。 Q4: 论文做了哪些实验? 论文围绕 **BeaconKV** 的有效性、效率及设计选择展开了一系列系统实验,涵盖推理准确率对比、消融分析、系统效率评估及查询选择策略验证。具体实验内容如下: —- ### 1. 实验设置 **模型与数据集** - **模型**:在四个开源大型推理模型(LRMs)上评估: - R1-Distill-Qwen-7B - R1-Distill-Llama-8B - Qwen3-4B - Qwen3-14B - **数据集**:覆盖多领域推理任务: - **AIME24**、**MATH-500**:数学推理 - **LiveCodeBench**:代码推理 - **GPQA-Diamond**:生物、物理、化学问答 - **生成配置**:最大生成长度 32,768 tokens,Top-p = 0.95,温度 = 0.6。AIME24 报告 8 次运行的平均 pass@1 准确率,其余为 4 次运行平均。 **预算与基线配置** - **KV 缓存预算**:在 256 至 4096 之间变化最大缓存预算 B(KV)^(max) ,最小预算设为 (7) / (8)B(KV)^(max) ,触发驱逐时淘汰 (1) / (8)B(KV)^(max) 个 tokens。 - **对比基线**: - **SnapKV**(Li et al., 2024):基于注意力分数的 KV 驱逐 - **RPC**(Song et al., 2025):面向 LRM 的注意力压缩方法 - **R-KV**(Cai et al., 2025):融合注意力分数与冗余分数的联合驱逐策略 - **BeaconKV 配置**:beacon query 预算上限 32 / 下限 16;recent query 预算固定 16;保留最近 32 个 tokens(R-KV 保留 8 个)。 —- ### 2. 推理任务准确率对比 在不同 KV 缓存预算下,与基线方法进行全面的准确率比较(如图 8 所示)。 - **实验内容**:在四个模型和四个任务上,测试预算从 256 到 4096 的多种配置。 - **关键结果**: - BeaconKV 在绝大多数基准和模型上均取得最高准确率,尤其在**低预算区域**优势显著。 - 相比现有方法,最大准确率提升达 **31.7 个百分点**(Qwen3-14B 在 AIME24 上预算为 1024 时)。 - 验证了 beacon queries 能有效捕获 TRT 对应的全局注意力模式,避免远距离关键推理轨迹被过早驱逐。 —- ### 3. 消融实验(Ablation Study) #### (1) Beacon Queries 与 Recent Queries 的数量权衡 - **设置**:在 Qwen3-4B / AIME24 上,固定总观察查询预算为 32,系统改变 beacon queries ( n(beacon) ) 与 recent queries ( n_(recent) ) 的配比(如 (1,31), (16,16), (31,1) 等),预算上限为 2048。 - **结果**(表 1): - 过度偏向 beacon queries(如 1:31)导致延迟极高(10871.3s)且准确率下降(63.5%),因为局部上下文信号不足。 - 平衡配置 **(16, 16)** 取得最优权衡:准确率 64.6%,延迟 4355.7s,显著优于纯 recent queries 配置。 #### (2) 聚合策略对比(Max vs. Mean) - **设置**:在 R1-Distill-Qwen-7B / AIME24 上,比较 Max-Aggregation 与 Mean-Aggregation 在不同预算(256–4096)下的表现。 - **结果**(表 2): - Max-Aggregation 在所有预算下普遍优于 Mean-Aggregation,在低预算时差距更大(如预算 256 时:23.3 vs. 18.8)。 - 原因在于 TRT 信号稀疏但幅度高,Max-Aggregation 能保留这些关键信号,而 Mean-Aggregation 会将其稀释。 #### (3) 与 Initial+Recent 基线对比 - **设置**:对比 BeaconKV 与一种固定保留**初始查询+近期查询**的变体(Initial+Recent),以验证 Continual FPS 的动态选择是否必要。预算固定为 1024。 - **结果**(表 3): - BeaconKV 在所有模型和任务上均优于 Initial+Recent,例如 R1-Distill-Qwen-7B 在 AIME24 上为 39.17% vs. 20.42%。 - 证明仅保留初始查询不足以覆盖长程推理中动态涌现的全局回溯模式,Continual FPS 动态演化 beacon queries 至关重要。 —- ### 4. 系统效率评估 在单张 NVIDIA A100 80GB GPU 上,以 Qwen3-4B、生成长度 32K 为设置,对比 **Full KV**、**RPC** 与 **BeaconKV** 的系统指标(表 4)。 - **实验指标**:吞吐量(tokens/s)、解码延迟(s)、峰值 GPU 内存(GB)、LiveCodeBench 准确率。 - **关键结果**: - **内存缩减**:BeaconKV(预算 2K)将峰值内存从 Full KV 的 77.0 GB 降至 **13.3 GB**,实现 **5.8×** 压缩,使 batch size 可从 14 提升至 14(Full KV 在更大 batch 下已 OOM)。 - **吞吐提升**:相比 Full KV,BeaconKV 吞吐量从 82.3 提升至 **356.4 tokens/s**,延迟从 5573.4s 降至 1287.3s。 - **与 RPC 的对比(同预算)**: - 预算 2K、batch size 192 时,BeaconKV 与 RPC 吞吐量(~700 tokens/s)和内存(~79 GB)相当,但准确率高出 **+6.3** 个百分点。 - 预算 1K、batch size 320 时,BeaconKV 与 RPC 系统效率相近,但准确率高出 **+12.3** 个百分点。 —- ### 5. 观察查询选择策略分析 #### (1) 不同选择策略的相似度与准确率验证 - **设置**:分析不同观察查询集构造策略与**未来解码步查询**的最大余弦相似度(图 6(a)),以及其在 AIME24 上的准确率(图 6(b))。 - **策略对比**:16 Recent + 16 FPS-Selected、16 Recent + 16 Random、32 Recent、16 Recent。 - **结果**: - **16 Recent + 16 FPS-Selected** 与未来查询的相似度最高,且在各预算下准确率最优。 - 证明 KV 评分的有效性更依赖查询的**几何代表性/覆盖度**,而非单纯增加近期查询数量。 #### (2) Continual FPS 与离线方法的效率-准确率权衡 - **设置**:对比 Continual FPS、K-Means Centroids、Centroid-Nearest Data Points 及 Naive FPS(图 7)。 - **结果**: - Continual FPS 在准确率损失(Accuracy Degradation)上与理想的离线采样方法(K-Means、Naive FPS)相当。 - 但 Continual FPS 的**峰值 GPU 内存显著更低**,验证了其在内存受限场景下的实用性。 —- ### 6. 补充实验 - **与 SnapKV 的直接效率对比**(附录 A.1,表 5): - 在 Qwen3-4B、预算 1K、batch size 320 下,BeaconKV(42.2%)较 SnapKV(30.9%)和 RPC(29.9%)准确率大幅提升,而吞吐量和内存占用处于同等水平。 - **输出长度统计**(附录 A.2,表 6): - 报告了各模型在不同任务上的平均输出长度(AIME24 可达 13K–14K tokens),量化了 LRM 长 CoT 生成带来的实际内存压力,进一步佐证压缩方法的必要性。 Q5: 有什么可以进一步探索的点? 基于论文内容,以下几方面可作为后续深入探索的方向: —- ### 1. 扩展至非推理类长上下文任务 论文的评估主要聚焦于数学、代码与科学问答等长程推理场景。BeaconKV 在标准非推理任务上的有效性——如**长文档检索、文本摘要、通用长上下文生成**——尚未得到充分验证。未来工作可系统检验 TRT 现象与 beacon query 聚类结构在这些任务中是否同样存在,并评估方法的泛化边界。 —- ### 2. 超参数的自适应动态调整 当前 BeaconKV 在推理过程中对 beacon query 数量、recent query 数量及 KV 缓存预算等关键超参数采用**固定配置**。然而,不同模型架构(如 Qwen 与 Llama 系列)及不同任务的最优配置可能存在显著差异。值得探索的方向包括: - 开展系统性的超参数敏感性分析,建立配置选择的经验准则; - 设计**自适应压缩策略**,在推理过程中根据当前解码阶段(如规划期、验证期、总结期)动态调整 beacon query 数量或缓存预算,而非全程固定。 —- ### 3. 与其他正交技术的深度融合 BeaconKV 属于 KV 缓存压缩范畴,可与以下方向形成互补: - **稀疏注意力机制**:将 beacon queries 作为稀疏注意力中的“锚点”,同时降低计算与存储开销; - **自适应推理长度控制**(如 DEER、SEAL):在动态调整 CoT 长度的同时,利用 beacon queries 更高效地管理被保留的中间上下文; - **记忆增强架构**:将 beacon queries 的选择逻辑与外部记忆模块(如 Titans、GNM)结合,实现跨多轮会话的长期知识复用。 —- ### 4. 训练感知的方法增强 BeaconKV 强调其无需训练的优势,但引入轻量级可学习组件可能进一步提升性能。例如: - 训练一个小型门控网络,以辅助判断何时应增加 beacon query 的采样密度; - 通过蒸馏或微调,让模型主动生成更易于被 beacon queries 捕获的“高可回溯性”特征。 —- ### 5. TRT 现象的理论与语义分析 论文通过实证发现了 Thought Revisiting Tokens 及其查询聚类结构,但其深层机制仍待挖掘: - **理论层面**:从优化景观或损失函数角度解释为何 global queries 会在预-RoPE 空间中形成少数聚类; - **语义层面**:分析不同 beacon query 聚类是否对应特定的推理功能(如“目标重述”、“约束检查”、“中间结果验证”),从而为可解释性推理提供新的分析维度。 —- ### 6. 新型架构与多模态场景的迁移 现有分析基于 Transformer 架构与文本模态。未来可探索: - 在**状态空间模型**(如 Mamba)或**线性注意力**架构中,是否存在类似的全局回溯模式,以及如何适配 beacon query 机制; - 将方法扩展至**多模态长序列推理**(如长视频理解、多轮工具调用),其中跨模态的远距离依赖可能呈现更复杂的查询分布。 Q6: 总结一下论文的主要内容 该论文提出 **BeaconKV**,一种面向大型推理模型(LRMs)的无需训练 KV 缓存压缩方法,旨在缓解长链式思维(Chain-of-Thought, CoT)生成过程中的严重内存瓶颈。 —- ### 1. 研究背景与问题 大型推理模型(如 DeepSeek-R1、Qwen3 等)通过生成数万 token 的扩展推理轨迹来解决复杂任务。在自回归 Transformer 解码中,KV 缓存随序列长度线性增长,极易超出 GPU 内存容量,成为部署瓶颈。 现有 KV 缓存压缩方法(如 RPC、R-KV)普遍依赖**近期生成的查询**(recent queries)来估计未来 token 的重要性,其隐含假设是:近期查询可作为未来注意力模式的可靠代理。该论文指出,这一假设在长程推理中** fundamentally fails**,导致关键上下文被过早驱逐。 —- ### 2. 核心发现:思维回溯 Token(TRT)与查询聚类 通过系统分析 LRM 的注意力动态,论文揭示了两个关键现象: - **Thought Revisiting Tokens (TRT)**:在推理过程中,某些解码步骤生成的 token(全局查询)会重新关注推理轨迹早期的远距离上下文(如问题约束、高层计划),以维持全局连贯性。这与主要关注邻近上下文的局部查询形成鲜明对比。 - **查询空间的几何聚类**:这些全局查询在预旋转位置编码(pre-RoPE)的嵌入空间中**并非随机分布,而是聚类为少量相似性群组**。这表明,多样化的全局查询可被一组紧凑的**代表性查询**(beacon queries)有效覆盖。 —- ### 3. 方法:BeaconKV 基于上述洞察,论文提出 BeaconKV,其核心机制包括: #### (1) 双重观察查询集 KV 缓存驱逐时的重要性评分不再仅依赖近期查询,而是结合: - **Recent Queries**:保留局部连贯性信号; - **Beacon Queries**:通过历史查询选取的代表性查询,预判未来 TRT 可能重新访问的远距离 KV 对。 #### (2) Continual Farthest Point Sampling (FPS) 为在有限内存下动态维护 beacon queries,论文提出 Continual FPS: - 每个注意力头维护一个**有界缓冲区**,存储预 RoPE 查询; - 当缓冲区达上限 B_Q^(max) 时,通过最远点采样(基于余弦相似度)压缩至下限 B_Q^(min) ,保留几何上最具多样性的查询代表; - 该“填充-压缩”循环确保查询历史不会无限膨胀,同时持续演化以覆盖新兴的全局注意力模式。 #### (3) 差异化的 RoPE 对齐与 Max-Aggregation - **Beacon Queries** 被施加当前解码位置 t 的 RoPE,模拟“若此刻出现 TRT,其将如何 attend 到现有 KV”; - **Recent Queries** 保持原始生成位置 τ 的 RoPE,保留标准局部信号; - 重要性评分采用 **Max-Aggregation**:

Score[j] = max(h ∈ g) max(q ∈ Qobs) W[h, q, j]
以保留稀疏但高幅度的 TRT 信号,避免 Mean-Aggregation 导致的信号稀释。 #### (4) 周期性驱逐策略 当 KV 缓存达上限 B
(KV)^(max) 时,强制保留前缀与最近 token,剩余预算依据上述分数保留 Top-K KV 对;驱逐后合并并重新压缩 beacon 与 recent queries,进入下一周期。 —- ### 4. 实验结果 论文在 **R1-Distill-Qwen-7B、R1-Distill-Llama-8B、Qwen3-4B、Qwen3-14B** 四个模型上,针对 **AIME24、MATH-500、GPQA-Diamond、LiveCodeBench** 展开评估: - **准确率优势**:BeaconKV 在绝大多数配置下优于 SnapKV、RPC、R-KV 等基线,尤其在低预算下优势显著,最大准确率提升达 **31.7 个百分点**(Qwen3-14B / AIME24 / 预算 1024)。 - **内存与吞吐**:在 Qwen3-4B 上,BeaconKV 将峰值 GPU 内存从 77.0 GB 降至 13.3 GB(**5.8× 压缩**),吞吐量提升超过 **4.3×**(82.3 → 356.4 tokens/s)。 - **消融验证**: - Beacon 与 Recent 查询的均衡配置(如 16:16)取得最优效率-准确率权衡; - Max-Aggregation 在低预算下显著优于 Mean-Aggregation; - Continual FPS 在准确率上媲美离线 K-Means / Naive FPS,同时大幅降低峰值内存。 —- ### 5. 贡献总结 - **现象发现**:首次系统识别并量化了 LRM 长程推理中的 Thought Revisiting Tokens(TRT)现象,揭示全局查询在嵌入空间中的聚类结构。 - **方法创新**:提出 BeaconKV,通过紧凑的 beacon queries 预判未来全局注意力需求,突破了近期查询假设在长程推理中的局限性。 - **系统价值**:在不修改模型架构、无需额外训练的前提下,实现了高达 5.8× 的内存缩减与 4.3× 的吞吐提升,同时接近完整 KV 缓存的推理精度。 论文为在资源受限环境下高效部署大型推理模型提供了有效的实践路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Janghyeon Kim,Minsoo Kim,Kyuhong Shim,Jungwook Choi

Categories:

PDF URL: https://arxiv.org/pdf/2609.04971.pdf

Arxiv URL: https://arxiv.org/abs/2609.04971

Arxiv ID: 2609.04971

CoolPaper URL: https://papers.cool/arxiv/2609.04971

Published: 2026-09-10T01:27:00.979Z

Updated: 2026-09-10T01:27:00.979Z


13. Reason Through the Latent! Making Latent Visual Reasoning Necessary

Abstract:Latent visual reasoning aims to perform multimodal reasoning through hidden-state computation rather than explicit textual chains of thought. However, visual information being present in a latent state does not imply that the model actually relies on that state when producing its answer, especially when alternative image-conditioned paths remain available. We introduce \textbf{C}ausal \textbf{V}isual \textbf{R}ecurrent \textbf{R}easoning (CVRR), which preserves pretrained visual competence while making recurrent computation the required image-conditioned path to prediction. CVRR initializes recurrence from the question hidden state after the pretrained vision-language model has incorporated the image, then repeatedly updates this state while re-reading the same fixed visual evidence. Before decoding, visual states and the original multimodal KV cache are removed so that only the final recurrent state carries image-conditioned information to the answer. Across the $V^*$, MMVP, BLINK, and MME-RealWorld-Lite benchmarks, CVRR retains strong performance under this strict interface, while compatible latent reasoners fail to recover comparable visual competence even when retrained under the same constraint. Causal interventions further show that predictions remain sensitive to recurrent content when the question is held fixed, and that persistent visual evidence causally revises the recurrent trajectory. These results distinguish latent informativeness from latent computation that is actually used for prediction.

中文摘要

摘要:潜在视觉推理旨在通过隐藏状态计算而非显式的文本思路链来执行多模态推理。然而,视觉信息处于潜在状态并不意味着模型在生成答案时实际上依赖该状态,尤其是当存在可替代的图像条件路径时。我们提出了\textbf{因果视觉循环推理(CVRR)},它在保留预训练视觉能力的同时,使循环计算成为预测所需的图像条件路径。CVRR在预训练视觉-语言模型整合图像后,从问题隐藏状态初始化循环,然后在反复读取相同的固定视觉证据时更新该状态。在解码之前,视觉状态和原始多模态KV缓存会被移除,因此只有最终的循环状态携带图像条件信息到答案。在$V^*$、MMVP、BLINK和MME-RealWorld-Lite等基准测试中,CVRR在这一严格接口下仍保持强性能,而兼容的潜在推理器即使在相同约束下重新训练,也未能恢复相当的视觉能力。因果干预进一步表明,当问题固定时,预测仍对循环内容敏感,并且持续的视觉证据会因果性地修正循环轨迹。这些结果区分了潜在信息性与实际用于预测的潜在计算。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.06746 (HTTP 429)

Authors: Suhyeong Park,Junha Jung,Jaewoo Kang

Categories:

PDF URL: https://arxiv.org/pdf/2609.06746.pdf

Arxiv URL: https://arxiv.org/abs/2609.06746

Arxiv ID: 2609.06746

CoolPaper URL: https://papers.cool/arxiv/2609.06746

Published: 2026-09-10T01:27:01.022Z

Updated: 2026-09-10T01:27:01.022Z


14. Steering Geometry: Validating Human Value Geometry in LLM Steering Space

Abstract:As large language models (LLMs) are increasingly deployed in alignment-sensitive contexts, activation steering has emerged as a lightweight, inference-time alternative to fine-tuning methods (e.g., RLHF, DPO) for behavioral control. However, existing work typically validates steering on isolated behaviors, leaving it unclear whether steering vectors encode coherent semantic structure or merely exploit behavior-specific shortcuts. We investigate whether the latent geometry of LLM steering vectors reflects theory-specified structure in human values and morality. Using Schwartz’s Theory of Basic Human Values as our primary fine-grained framework, we introduce a 26K-sample benchmark covering 20 human values and analyze distribution-driven methods (e.g., CAA, SphericalSteer, ODESteer) and behavior-centric approaches (e.g., COLD-Steer, BiPO) across diverse model families and sizes. We find that distribution-driven methods recover human value topologies aligned with theoretical predictions (Spearman $\rho$ up to 0.51, $p < 10^{-13}$). In contrast, behavior-centric methods achieve comparable steering performance but show little correlation with the expected value geometry. Geometric fidelity improves with model scale but drops after instruction tuning. Finally, better geometric alignment also leads to more human-consistent transfer across values: steering one value correctly lifts compatible values and suppresses opposing ones. Code and data are available at: this https URL.

中文摘要

摘要:随着大型语言模型(LLM)越来越多地部署在对齐敏感的场景中,激活引导作为一种轻量级、推理时的替代方法,已经成为行为控制的一种选择,区别于微调方法(例如 RLHF、DPO)。然而,现有工作通常仅在孤立的行为上验证引导,使得不清楚引导向量是否编码了一致的语义结构,还是仅仅利用了特定行为的捷径。我们研究了 LLM 引导向量的潜在几何结构是否反映了理论指定的人类价值观和道德结构。以 Schwartz 的基本人类价值理论作为我们的主要细粒度框架,我们引入了一个包含 26K 样本、覆盖 20 种人类价值的基准,并分析了分布驱动方法(例如 CAA、SphericalSteer、ODESteer)和以行为为中心的方法(例如 COLD-Steer、BiPO)在不同模型家族和规模上的表现。我们发现,分布驱动方法能够恢复与理论预测一致的人类价值拓扑结构(Spearman ρ 高达 0.51,$p < 10^{-13}$)。相比之下,以行为为中心的方法虽然在引导性能上相当,但与预期的价值几何相关性很低。几何保真度随着模型规模增长而提高,但在指令微调后下降。最后,更好的几何对齐也会带来跨价值的人类一致性转移:正确引导一个价值会提升兼容价值并抑制相对立的价值。代码和数据可在以下网址获取:this https URL。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.06289 (HTTP 429)

Authors: Mohammad Mahdi Abootorabi,Armin Saghafian,Ali Bazshoushtari,Hamid Rezaei,EunJeong Hwang,Vered Shwartz,Parvin Mousavi,Purang Abolmaesumi

Categories:

PDF URL: https://arxiv.org/pdf/2609.06289.pdf

Arxiv URL: https://arxiv.org/abs/2609.06289

Arxiv ID: 2609.06289

CoolPaper URL: https://papers.cool/arxiv/2609.06289

Published: 2026-09-10T01:27:01.830Z

Updated: 2026-09-10T01:27:01.830Z


15. Kalman Delta Networks: Uncertainty-aware Associative Memory

Abstract:Linear attention is increasingly used in frontier language models for efficient long-context inference and constant-memory decoding. Its fixed-size recurrent memory, however, requires an online decision at each token: what to write and how strongly to overwrite existing associations before knowing which information future queries will require. Delta-rule models learn this strength from the current token embedding but do not track confidence in the memory estimate, preventing each write from adapting to accumulated evidence. To represent this uncertainty explicitly, we reformulate recurrent associative memory as a linear—Gaussian state-space model, for which the Kalman filter is the optimal recursive estimator, and introduce a new family of models, Kalman Delta Networks (KDNs). Within KDNs, the transition propagates both the memory state and its uncertainty, allowing the Kalman gain to weight each residual write by accumulated evidence and observation reliability. Under this formulation, Delta-style updates emerge as a special case that substitutes a token-wise isotropic surrogate for predictive covariance and omits covariance tracking. Exact tracking, however, entails a dense, state-dependent Riccati recursion that is poorly suited to GPU-parallel linear-attention scans. To address this issue, we introduce two scan-compatible KDN approximations. Diagonal KDN projects each one-step posterior onto the diagonal Gaussian family through online mean-field variational inference, whereas Isotropic KDN uses an isotropic approximation with a single uncertainty scalar per head. Their uncertainty recurrences are Mobius maps, enabling associative scans with logarithmic parallel depth. Across controlled pretraining at 750M and 1.3B parameters, KDN variants consistently improve perplexity and mean downstream accuracy over state-of-the-art linear-attention models.

中文摘要

摘要:线性注意力正越来越多地应用于前沿语言模型,以实现高效的长上下文推理和恒定内存解码。然而,其固定大小的递归记忆要求在每个标记上做出在线决策:在不知道未来查询需要哪些信息之前,应写入什么以及以多大力度覆盖现有关联。Delta规则模型从当前标记嵌入中学习这种强度,但不跟踪对记忆估计的置信度,这会阻止每次写入根据累积的证据进行调整。为了明确表示这种不确定性,我们将递归联想记忆重新表述为线性-高斯状态空间模型,其中卡尔曼滤波器是最优递归估计器,并引入了一类新模型——卡尔曼增量网络(KDNs)。在KDNs中,状态转移既传播记忆状态又传播其不确定性,使得卡尔曼增益可以根据累积证据和观测可靠性对每次残差写入进行加权。在这一表述下,Delta式更新作为特殊情况出现,它用每个标记的各向同性替代预测协方差,并省略协方差跟踪。然而,精确跟踪涉及稠密且状态依赖的里卡提递归,这不适合用于GPU并行的线性注意力扫描。为解决这一问题,我们引入了两种兼容扫描的KDN近似方法。对角KDN通过在线平均场变分推断将每一步的后验投影到对角高斯族,而各向同性KDN则使用每个头单一不确定性标量的各向同性近似。它们的不确定性递归是莫比乌斯映射,从而实现具有对数并行深度的联想扫描。在750M和1.3B参数的受控预训练中,KDN变体在困惑度和下游平均准确率上均持续优于最先进的线性注意力模型。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*线性注意力(linear attention)循环记忆模型中缺乏显式不确定性追踪\*\*导致的记忆更新决策次优问题,同时在保持硬件并行效率的前提下实现这一点。 具体而言,其核心关注可归纳为以下三点: - \*\*现有 Delta-rule 模型的写入强度与记忆置信度解耦\*\* 诸如 DeltaNet、Gated DeltaNet 与 KDA 等模型虽然通过残差(delta)写入实现了对记忆的选择性修正,但写入增益(如 β_t )仅从当前 token 的表示预测得出。这些模型不维护对记忆估计的置信度或不确定性,因此无法在写入时区分“已被反复确认、应当保护”的关联与“尚不确定、应当修正”的关联。 - \*\*精确卡尔曼滤波与 GPU 并行扫描不兼容\*\* 若将循环记忆严格建模为线性–高斯状态空间模型并以卡尔曼滤波进行最优估计,则需在每一步维护一个稠密的 d_k × d_k 预测协方差,并执行状态依赖的 Riccati 递归。这打破了线性注意力所依赖的输入无关、可并行扫描(associative scan)结构,无法直接用于高效训练。 - \*\*近似后的过度覆盖(overwrite)风险\*\* 即使对协方差施加对角近似以恢复扫描并行性,简单的逐通道均值场投影会因丢弃跨通道相关性而过度自信,导致后续同方向查询对已有记忆的过度覆盖。 为此,论文提出 \*\*Kalman Delta Networks (KDNs)\*\*,将循环联想记忆重新阐释为对潜在非平稳键–值映射的在线滤波问题,并导出两种扫描兼容的近似变体(Diagonal KDN 与 Isotropic KDN),使得残差写入的强度能够由传播的累积不确定性与观测噪声共同决定,从而在保持 O(d_k) 或 O(1) 辅助状态的同时实现自适应的记忆更新。 Q2: 有哪些相关研究? 根据论文第6节及相关章节的系统综述,相关研究可归纳为以下两大脉络: --- ## 1. 固定记忆注意力机制(Fixed-memory attention) ### 从二次注意力到线性循环注意力 - \*\*标准自注意力\*\*(Transformer; Vaswani et al., 2017)及其 \*\*RoPE 变体\*\*(Su et al., 2024)保留完整的 token 历史,导致自回归缓存随序列线性增长、计算量呈二次增长。 - \*\*成本降低方法\*\*:包括稀疏注意力(Liu et al., 2025)与有界 KV 缓存保留策略(Xiao et al., 2024; Bui et al., 2026a,b)。 - \*\*低秩与线性方案\*\*:Linformer(Wang et al., 2020)通过低秩投影降低复杂度;\*\*线性注意力\*\*(Katharopoulos et al., 2020)则将历史压缩为固定大小的循环状态 S_t ∈ R^(d_k × d_v) ,实现常数内存解码与扫描并行训练。 ### Delta-rule 及门控循环设计 该方向专注于如何在固定大小记忆中实现选择性的擦除与写入: - \*\*DeltaNet\*\*(Schlag et al., 2021; Yang et al., 2024b):用误差修正的 delta 规则替代纯加法更新,仅写入预测残差。 - \*\*Gated DeltaNet\*\*(Yang et al., 2024a):在 delta 更新前引入数据依赖的标量衰减 α_t ,防止陈旧关联无限累积。 - \*\*KDA\*\*(Kimi Team, 2025):进一步将标量衰减替换为对角转移 D_t = diag(α_t) ,使单个头内不同键通道可拥有不同的衰减率。 - \*\*其他并行工作\*\*:GLA(Yang et al., 2023)、Comba(Hu et al., 2025)、RWKV-7(Peng et al., 2025)等探索了门控与修正循环的不同形式。 - \*\*扩展与变体\*\*:FoX、DeltaFormer、PaTH-FoX(Lin et al., 2025; Zhong et al., 2025; Yang et al., 2025)将遗忘门、联想修正与乘法位置编码引入指数核注意力。 - \*\*GDN-2\*\*(Hatamizadeh et al., 2026):解耦了擦除(erase)与写入(write)操作。 - \*\*Preconditioned DeltaNet\*\*(Tumma et al., 2026):通过逆 Gram 预条件将 DeltaNet 转化为精确在线最小二乘求解器,并开发了扫描兼容的对角变体;其设定对应于 Kalman 滤波在\*\*静态、固定噪声\*\*极限下的特例。 --- ## 2. 状态空间序列混合器与贝叶斯记忆(State-space sequence mixers and Bayesian memory) ### 结构化状态空间模型(SSM) 该 lineage 提供了互补的固定记忆序列建模路径: - \*\*S4\*\*(Gu et al., 2022):通过结构化卷积使长程连续时间动态可处理。 - \*\*S5\*\*(Smith et al., 2023):将其重新表述为可扫描并行的 MIMO 循环。 - \*\*Mamba 系列\*\*:Mamba-1(Gu and Dao, 2023)引入输入选择机制;Mamba-2(Dao and Gu, 2024)建立注意力–SSM 对偶与 SSD;Mamba-3(Lahoti et al., 2026)进一步引入指数–梯形离散化、复值动态及 SISO/MIMO 变体。 与上述模型相比,\*\*Mamba 采用控制驱动的加性输入更新\*\*( h_t = A_t h_(t-1) + B_t x_t ),而 KDN 将 token 值视为对\*\*潜在非平稳键–值映射的噪声观测\*\*,并用传播的协方差对创新项(innovation)加权。 ### 贝叶斯滤波视角 - \*\*Kalman Linear Attention\*\*(Shaj et al., 2026):同样追踪不确定性并使用扫描并行的信息形式滤波器,但其在特征/状态扩展坐标上分解信念,并假设时不变的 OU 动态。 - \*\*KDN 的定位\*\*:KDN 观测的是键空间中的关联矩阵,其精确后验协方差在键空间中稠密,并在值通道间共享;Isotropic KDN 与 Diagonal KDN 则是对该精确后验的扫描兼容近似。 --- ### 简要总结 | 方向 | 代表性工作 | 与 KDN 的核心区别 | |------|-----------|------------------| | \*\*Delta-rule 混合器\*\* | DeltaNet, GDN, KDA | 使用 token 预测的固定/标量增益,无显式协方差追踪 | | \*\*SSM / Mamba 系列\*\* | Mamba-1/2/3 | 控制驱动的加性状态更新,而非键条件化的残差修正 | | \*\*预条件 DeltaNet\*\* | Preconditioned DeltaNet | 静态固定噪声下的精确在线最小二乘,增益与协方差传播分离 | | \*\*贝叶斯线性注意力\*\* | Kalman Linear Attention | 在扩展特征上分解信念,时不变动态;KDN 在键空间处理向量值、键条件化测量 | Q3: 论文如何解决这个问题? 该论文通过\*\*将循环联想记忆重新阐释为线性–高斯状态空间模型\*\*,并推导\*\*扫描兼容的近似卡尔曼滤波器\*\*,解决了 delta-rule 模型缺乏显式不确定性追踪与硬件并行效率之间的矛盾。具体方法论可分解为以下层次: --- ### 1. 核心重构:将记忆更新视为最优滤波 论文将循环记忆 S_t ∈ R^(d_k × d_v) 视为对潜在非平稳键–值映射的隐状态估计,并建立如下线性–高斯状态空间模型:

St = D_t S(t-1) + Wt, quad W_t sim N(col)(0, Omega_t),

vt = S_t^top k_t + e_t, quad e_t sim N(0, r_t I(dv)).
在此框架下,每一 token 提供一个沿方向 k_t 的带噪观测 v_t ,而 D_t 刻画记忆在观测间的漂移或衰减。由此,在线最小均方误差(MMSE)估计天然导出一个**卡尔曼滤波器**(Kalman filter),其最优递归更新为: **预测:**
S_t = D_t S
(t-1), quad Pt = D_t P(t-1) Dt^top + Omega_t.
**更新:**
kappa_t = hatP_t k_tr_t + k_t^top P_t k_t, quad S_t = S_t + kappa_t (v_t - S_t^top k_t)^top, quad P_t = (I - kappa_t k_t^top) P_t.
该解表明,delta-rule 的残差写入形式 S_t = S_t + kappa_t δ_t^top 本质上是卡尔曼创新更新;不同的是,**最优增益 kappa_t 由记忆的不确定性 P_t 与观测噪声 r_t 共同决定**,而非由当前 token 独立预测。 —- ### 2. 精确解的障碍与近似策略 精确卡尔曼滤波要求维护一个稠密的 d_k × d_k 协方差 P_t ,并执行状态依赖的 Riccati 递归,这破坏了线性注意力所依赖的输入无关、可关联扫描(associative scan)结构。为恢复并行效率,论文提出 **Kalman Delta Networks (KDNs)** 家族,通过对协方差施加结构化近似,将不确定性状态压缩至可扫描的规模。 —- ### 3. Diagonal KDN:通道级不确定性的变分在线投影 这是论文的核心实用化方案,包含三项关键技术: - **对角约束**:要求协方差、转移矩阵与过程噪声均为对角阵,即 P_t, D_t, Omega_t ∈ D
(dk)^(++) 。此时预测协方差保持对角: p_t = α_t^2 odot p(t-1) + ωt 。 - **在线均值场变分推断**:尽管预测协方差是对角的,精确后验 P_t^star = (P_t^(-1) + k_t k_t^top / r_t)^(-1) 在观测后仍变为稠密。论文通过在每一步最小化逆向 KL 散度 KL(q | N(col)(St^star, P_t^star)) ,将后验投影回对角高斯族 Q(col) 。该投影**精确保留后验均值** S_t^star ,仅将协方差替换为对角精度之和:

p(t,i) = ( p(t,i)^(-1) + k_(t,i)^2r_t )^(-1).

  • **Möbius 关联扫描**:上述逐通道递归可表示为 Möbius 变换,进而写成 2 × 2 矩阵乘法:
    M(t,i) = α(t,i)^2 & ω(t,i) u(t,i) α(t,i)^2 & 1 + u(t,i) ω(t,i) , quad n(t,i) d(t,i) = M(t,i) n(t-1,i) d(t-1,i) , quad p(t,i) = n(t,i)d(t,i),
    其中 u
    (t,i) = μ k(t,i)^2 / r_t 。这允许使用对数级并行深度的关联扫描计算所有 kappa_t ,辅助状态复杂度为每头 O(d_k) 。 - **信息缩放(Information Scaling)**:对角均值场投影因丢弃跨通道相关性而倾向于过度自信,导致后续同方向查询过度覆盖(overwrite)已有记忆。论文引入缩放因子 μ > 0 作用于后验精度增量:
    u_t = (μ) / (r_t) k_t odot k_t.
    该因子**不影响当前写入的增益**,而是通过降低保留的不确定性来削弱未来对相同键方向的写入强度,起到保护已确认关联的作用。 —- ### 4. Isotropic KDN:标量不确定性的进一步压缩 为进一步降低状态开销,Isotropic KDN 将协方差限制为各向同性 P_t ≈ b_t I 。由于该族在预测与更新下均不封闭,论文采用**两次投影**策略: - **预测后**:对 D_t P
    (t-1) Dt^top + ω_t I 执行 Frobenius 最近各向同性投影,保留平均特征值 b_t = a_t b(t-1) + ωt ,其中 a_t = (1) / (d_k)∑(i=1)^(dk) α(t,i)^2 。 - **观测后**:对各向同性族最小化逆向 KL,保留精确后验均值,并将协方差收缩为:

bt = ( (1) / (hatb)_t + (|k_t|_2^2) / (d_k r_t) )^(-1).
这退化为标量 Möbius 扫描,辅助状态仅为每头 O(1) 。增益退化为 kappa_t = β_t k_t 的形式,但 β_t 现在由累积不确定性 b_t 与观测噪声 r_t 推导,而非独立预测。 —- ### 5. 硬件高效的块级实现 为使上述递归适配 GPU 并行训练,论文设计了**两阶段块级扫描**: - **阶段一(增益扫描)**:通过分块 Möbius 扫描计算所有 token 的卡尔曼增益 kappa_t 。块内并行归约,块间通过 2 × 2 矩阵前缀扫描传递状态。 - **阶段二(记忆扫描)**:在 kappa_t 已知后,记忆更新变为仅依赖输入的不对称 delta-rule,可使用紧凑 WY 变换(compact-WY kernel)进行块级并行求值。 两个阶段均暴露独立的块内并行性,且仅需携带短状态跨块传递,从而保持了线性注意力的训练效率。 —- ### 6. 建模选择的统一视角 通过上述框架,论文将现有模型统一为对 Kalman Associative Memory 的不同近似: | 模型 | 转移 D_t | 增益形式 | 不确定性追踪 | |———|—————-|————-|——————-| | DeltaNet | I | β_t k_t (token 预测) | 无 | | Gated DeltaNet | α_t I | β_t k_t (token 预测) | 无 | | KDA | diag(α_t) | β_t k_t (token 预测) | 无 | | Isotropic KDN | diag(α_t) | β_t k_t (由 b_t, r_t 导出) | 标量 b_t | | Diagonal KDN | diag(α_t) | kappa_t = p_t odot k_t / (r_t + ∑_i p
(t,i) k_(t,i)^2) | 向量 p_t ∈ R^(d_k) | —- 综上,论文的解决路径可概括为:**以卡尔曼滤波赋予 delta-rule 残差写入严格的不确定性语义 → 通过对角/各向同性变分近似将协方差追踪压缩至可扫描规模 → 以 Möbius 关联扫描与信息缩放实现硬件高效的并行训练与记忆保护**。 Q4: 论文做了哪些实验? 论文在第5节开展了系统的实验评估,涵盖预训练语言建模、零样本推理、长上下文检索、真实世界检索、消融分析与吞吐量测试。具体实验内容如下: —- ### 1. 实验设置(Experimental Setup) - **预训练数据与规模**:在 FineWeb-Edu 上进行从头预训练,两个参数/数据量配置: - **750M 参数 / 50B tokens** - **1.3B 参数 / 100B tokens** - **评估任务**: - **语言建模困惑度**:WikiText、LAMBADA - **零样本常识推理**:LAMBADA、PIQA、HellaSwag、WinoGrande、ARC-Easy、ARC-Challenge(六项平均) - **合成上下文检索**:RULER 的单键(S-NIAH-1/2/3)与多键(MK-NIAH)needle-in-a-haystack 任务 - **真实世界检索**:SWDE、SQuAD、FDA、TriviaQA、Natural Questions、DROP(遵循 JRT 协议,输入限制为 2K tokens) - **模型架构**: - **纯循环(Recurrent-only)**:基于 KDA 的骨干,将 β_t 门控替换为过程噪声 ω_t 与观测噪声 r_t - **混合(Hybrid)**:在 1.3B 规模下,交替 9 层循环混合器与 9 层 2K 滑动窗口注意力(SWA) - **对比基线**:DeltaNet、Gated DeltaNet、KDA、Mamba-3(SISO 与 MIMO)、GDN-2,以及纯 Transformer(2K SWA) —- ### 2. 主要实验结果 #### 2.1 语言建模与零样本常识推理(表 1) - **750M/50B(纯循环)**: - Isotropic KDN 与 Diagonal KDN 在 WikiText 和 LAMBADA 困惑度上均低于所有基线。 - Diagonal KDN 在六项零 shot 平均准确率(54.97%)上领先,优于 KDA(53.87%)与 Mamba-3 MIMO(54.39%)。 - **1.3B/100B(纯循环)**: - Diagonal KDN 取得最低的 WikiText(15.04)与 LAMBADA(9.75)困惑度。 - Diagonal KDN 与 Isotropic KDN 的零 shot 平均准确率(60.45% 与 60.35%)均优于 KDA(60.28%)与 Mamba-3 系列。 - **1.3B/100B(混合)**: - Diagonal KDN + SWA 获得最高的平均零 shot 准确率(60.11%),超过 KDA + SWA(59.94%)与 Transformer(56.23%)。 #### 2.2 合成上下文检索:RULER(表 2) - **纯循环设置**: - Diagonal KDN 在 750M 和 1.3B 两个规模上均取得最高的 RULER 综合表现。 - 尤其在 S-NIAH-3(8K 长度)与 MK-NIAH 任务上优势显著,表明通道级不确定性有助于在干扰存在时保护已存储的关联。 - **混合设置**: - 加入 SWA 后所有模型性能均提升;Diagonal KDN + SWA 在多键检索上表现尤为突出。 #### 2.3 真实世界检索任务(表 3) - **纯循环 1.3B/100B**: - Diagonal KDN 在六项任务平均值上最佳(34.86%),在 FDA、TriviaQA 和 DROP 上领先。 - Isotropic KDN 排名第二(33.40%),优于 KDA(33.76%)与 Mamba-3 变体。 - **混合 1.3B/100B**: - Isotropic KDN + SWA 平均最佳(45.94%)。 - Diagonal KDN + SWA 在 FDA 上领先(66.58%),平均排名第二(45.55%)。 —- ### 3. 消融实验与运行时分析 #### 3.1 信息尺度 μ 消融(表 4) 在 750M 规模的 Diagonal KDN 上测试不同固定信息尺度: - μ ∈ {1, √d_k, d_k, 4d_k} 以及**可学习 μ **(初始化为 d_k ) - 增加 μ 持续改善 LAMBADA 困惑度( 4d_k 最佳),但 WikiText 困惑度与平均准确率在 μ = d_k 时达到峰值。 - 可学习 μ 在 WikiText 上表现最好,但在 LAMBADA 与平均准确率上略低于固定 μ = d_k 。 #### 3.2 观测噪声与过程噪声消融(表 5) 在 μ = 1 条件下比较: - **学习得到的** r_t, ω_t - **固定 r_t = 1 **(过程噪声仍学习) - **固定两者均为 1** 结果显示固定 r_t 可改善 WikiText 困惑度,但轻微损害 LAMBADA 与平均准确率;固定两者无一致改进,支持让模型学习噪声参数。 #### 3.3 吞吐量基准测试(图 4) - 在 H200 GPU 上测试 **mixer 层级别**的吞吐量(非端到端模型),序列长度从 2K 到 32K。 - **Isotropic KDN** 与 KDA 的吞吐量曲线几乎重合。 - **Diagonal KDN** 因通道级不确定性扫描引入额外开销,但接近 GDN-2,且保持**线性扩展**。 - Mamba-3 SISO 在长序列上吞吐量最高;标准 Transformer 的因果注意力随长度增长急剧下降。 —- ### 4. 实验结论 上述实验表明: - 在参数匹配的受控预训练条件下,**Isotropic 与 Diagonal KDN 在困惑度、零 shot 准确率、长上下文检索与真实世界检索上 consistently 优于现有线性时间循环混合器**(包括 KDA、Mamba-3、GDN-2)。 - Diagonal KDN 在需要精细保护存储关联的任务(如 RULER 多键检索)上优势最大。 - 信息尺度 μ 是控制未来覆盖程度的关键超参数,固定 μ = d_k 在多数指标上提供了均衡表现。 - 不确定性追踪带来的额外计算开销(尤其是 Diagonal KDN)保持在可接受范围内,仍显著优于二次注意力的扩展性。 Q5: 有什么可以进一步探索的点? 基于论文第7节及全文讨论,以下是可以进一步探索的研究方向: —- ### 1. 更丰富、可扫描的转移动力学 论文指出,现有 KDN 近似将对角转移 D_t 限制为实值衰减(遗忘)。一个直接延伸是引入 **Mamba-3 式的阻尼旋转**(damped rotations),使存储的关联不仅能够按通道衰减,还能在键空间中旋转:

St = D_t R_t S(t-1) + Wt,
其中 R_t 为(块)正交或酉矩阵。如何使此类富动力学的协方差传播与 Riccati 更新仍保持 **扫描并行效率**(logarithmic depth, associative scan),目前仍是开放问题。 —- ### 2. 介于对角与稠密之间的结构化协方差近似 精确卡尔曼滤波要求维护稠密 d_k × d_k 协方差与状态依赖的 Riccati 递归,而 Diagonal KDN 将其压缩至 d_k 个标量。中间层次的结构化近似可能提供更有利的精度–效率权衡,例如: - **低秩加对角**(low-rank plus diagonal): P_t = diag(p_t) + L_t L_t^top - **Kronecker 积或块对角**结构 - **管状(tubal)/张量环**分解 关键在于此类结构是否仍能导出输入无关的关联扫描算子。 —- ### 3. 自适应或动态的信息尺度 μ 论文通过固定信息尺度 μ 来缓解对角均值场投影导致的过度覆盖。消融显示(表4), μ 的最优值依赖于评估指标(WikiText 对 LAMBADA)。未来可探索: - **逐 token、逐头或逐层**自适应的 μ_t - 将 μ 设计为当前预测方差 p_t 或观测信噪比的函数 - 在逆向 KL 投影中引入 **更精细的变分族**(如块对角、链式图结构),以替代单一标量缩放 —- ### 4. 噪声参数的学习与分层建模 当前观测噪声 r_t 与过程噪声 ω_t 仅依赖当前 token 的隐藏状态 x_t 。更复杂的噪声建模可能包括: - **依赖历史不确定性**:让 r_t 或 ω_t 受累积协方差 P
(t-1) 调制,实现信噪比的长程自适应 - **跨通道相关性建模**:在 Diagonal KDN 中,过程噪声 ω_t 虽为对角,但可引入共享隐变量驱动的相关过程噪声 - **层间噪声传递**:不同层的噪声参数可共享先验,形成层级贝叶斯结构 —- ### 5. 混合架构(Hybrid)的系统性搜索 论文仅在 1.3B 规模采用固定交替的 9 层循环 + 9 层 SWA 结构,并指出 **最优循环–注意力层比例** 尚未确定。未来工作可包括: - 基于任务复杂度动态分配注意力与 KDN 层的 **可学习路由机制** - 在长上下文区域使用 KDN,在局部依赖区域使用 SWA 的 **空间混合策略** - 将 KDN 的不确定性状态作为信号,决定何时调用注意力层进行“深度复盘” —- ### 6. 更大规模与更长序列的扩展性验证 当前实验限于 1.3B 参数 / 100B tokens 与 32K 序列长度。关键开放问题包括: - KDN 的辅助状态(Diagonal KDN 的 O(d_k) 每头)在 **7B–70B 规模** 下的显存与带宽开销是否仍可接受 - 在 **100K+ 长上下文** 上,不确定性追踪对“大海捞针”式检索和上下文学习的增益是否持续 - 与 **专家混合(MoE)** 骨干结合时,协方差扫描的路由兼容性 —- ### 7. 理论分析:不确定性与可解释性 论文 empirically 显示追踪协方差能改善下游任务,但缺乏理论刻画: - **记忆保持与覆盖的界限**:在给定转移 D_t 和噪声 (Omega_t, r_t) 下,Diagonal KDN 对重复键的写入强度上界为何? - **与在线最小二乘的联系**:Preconditioned DeltaNet 在静态噪声极限下是在线最小二乘求解器;KDN 在非平稳高斯假设下的 **后悔界(regret bound)** 或收敛性质 - 协方差轨迹 P_t 作为 **模型置信度的可解释探针** —- ### 8. 与 KV 缓存压缩及记忆驱逐策略的结合 论文作者团队已有 KV 缓存驱逐的相关工作(Bui et al., 2026a,b)。KDN 的协方差状态 P_t 天然量化了每个键方向的记忆置信度,可进一步用于: - **缓存保留策略**:仅保留低置信度或高预测方差方向的键–值对 - **记忆驱逐**:将 P_t 作为优先级分数,实现不确定性感知的动态缓存剪枝 - 在 **流式(streaming)或无限上下文** 场景下,将 KDN 层作为压缩器,向下游注意力层提供经不确定性过滤的摘要状态 Q6: 总结一下论文的主要内容 该论文围绕线性注意力模型中的**循环记忆更新**问题展开,核心内容可概括如下: —- ### 1. 研究背景与核心问题 现代语言模型中,**线性注意力**通过将前缀压缩为固定大小的循环状态 S_t ∈ R^(d_k × d_v) 实现常数内存解码与线性时间复杂度。然而,这要求每个 token 在未知未来查询需求的情况下,在线决定如何改写记忆。现有 **delta-rule** 模型(如 DeltaNet、Gated DeltaNet、KDA)虽然通过残差写入提升了选择性,但其写入增益(例如标量 β_t )仅从当前 token 的表示预测,**不追踪对记忆估计的置信度或不确定性**。这导致模型无法区分:一个较大的残差究竟应强烈修正一个不确定的新关联,还是应被折扣以避免破坏一个已被反复确认的可靠关联。 —- ### 2. 核心思想:将循环记忆视为最优滤波 论文将循环记忆重新阐释为对一个**潜在非平稳键–值映射** S_t 的在线估计,并建立如下线性–高斯状态空间模型:

St = D_t S(t-1) + Wt, quad W_t sim N(col)(0, Omega_t),

vt = S_t^top k_t + e_t, quad e_t sim N(0, r_t I(dv)).
在此框架下,每个 token 提供一个沿方向 k_t 的带噪观测 v_t 。在线最小均方误差估计的解即为**卡尔曼滤波器**:
S_t = D_t S
(t-1), quad Pt = D_t P(t-1) D_t^top + Omega_t,

kappa_t = hatP_t k_tr_t + k_t^top P_t k_t, quad S_t = S_t + kappa_t (v_t - S_t^top k_t)^top, quad P_t = (I - kappa_t k_t^top) P_t.
该更新保留了 delta-rule 的残差写入形式,但增益 kappa_t 由**预测协方差** P_t 与观测噪声 r_t 共同决定:记忆越不确定,新观测的权重越高;反之,则保护已有内容。现有 delta-rule 模型正是该滤波器在冻结协方差动态、并用各向同性近似替代 P_t 后的固定增益特例。 —- ### 3. Kalman Delta Networks (KDNs) 精确卡尔曼滤波需维护稠密 d_k × d_k 协方差与状态依赖的 Riccati 递归,无法直接用于 GPU 并行的线性注意力扫描。为此,论文提出两种扫描兼容的近似: #### Diagonal KDN - 将对角结构施加于转移 D_t = diag(α_t) 、过程噪声 Omega_t = diag(ω_t) 与协方差 P_t = diag(p_t) 。 - 尽管预测协方差保持对角,观测后的精确后验 P_t^star = (P_t^(-1) + k_t k_t^top / r_t)^(-1) 仍为稠密。论文通过**在线均值场变分推断**,最小化逆向 KL 将后验投影回对角高斯族,**精确保留后验均值**,并导出闭合的逐通道精度更新:

p(t,i) = ( p(t,i)^(-1) + k_(t,i)^2r_t )^(-1).

  • 该递归可表示为 **Möbius 变换**,从而支持对数并行深度的关联扫描,辅助状态为每头 O(d_k) 。 - 为缓解对角投影丢弃跨通道相关性导致的过度覆盖,引入**信息缩放因子** μ > 0 ,通过降低保留不确定性来削弱未来同方向写入强度。 #### Isotropic KDN - 进一步将协方差压缩为标量 P_t ≈ b_t I ,通过 Frobenius 投影与逆向 KL 投影分别在预测步和更新步维持各向同性。 - 导出标量 Möbius 递归,辅助状态仅为每头 O(1) ,增益退化为 kappa_t = β_t k_t ,但 β_t 由累积不确定性 b_t 与观测噪声 r_t 推导。 两种变体均通过两阶段硬件实现:先并行扫描计算所有卡尔曼增益,再执行常规的 delta-rule 记忆扫描。 —- ### 4. 实验结果 论文在 FineWeb-Edu 上进行参数匹配的从头预训练,对比了 DeltaNet、Gated DeltaNet、KDA、Mamba-3(SISO/MIMO)、GDN-2 等基线: - **语言建模**:在 750M/50B 与 1.3B/100B 两个规模下,Isotropic KDN 与 Diagonal KDN 的 WikiText 和 LAMBADA 困惑度均低于所有评估的线性时间循环模型。 - **零样本推理**:KDN 变体在六项常识推理任务(LAMBADA、PIQA、HellaSwag、WinoGrande、ARC-e、ARC-c)上的平均准确率 consistently 领先;Diagonal KDN + SWA 在 1.3B 混合架构中达到最高平均准确率。 - **长上下文检索**:在 RULER 的 needle-in-a-haystack 任务中,Diagonal KDN 在纯循环设置下于两个规模均取得最高综合得分,尤其在多键干扰场景表现突出。 - **真实世界检索**:在 SWDE、SQuAD、FDA、TriviaQA、NQ、DROP 六项任务中,Diagonal KDN 在纯循环 1.3B 模型上平均最佳;混合架构下 Isotropic KDN + SWA 平均领先。 - **效率**:Diagonal KDN 的通道级扫描引入额外开销但仍接近 GDN-2 并维持线性扩展;Isotropic KDN 吞吐量与 KDA 基本持平。 —- ### 5. 主要贡献 - **统一视角**:将 delta-rule 模型家族(DeltaNet、Gated DeltaNet、KDA)统一为卡尔曼滤波在冻结协方差与不同转移模型下的特例,明确不确定性为缺失的关键状态变量。 - **实用化算法**:通过对角与各向同性变分近似,将精确卡尔曼滤波压缩为兼容 GPU 并行扫描的递归,分别仅需 O(d_k) 与 O(1) 每头的辅助状态。 - **信息缩放机制**:识别对角均值场投影的过度覆盖问题,并以信息缩放因子校准未来写入保护。 - **经验验证**:在受控的大规模预训练实验中,证明 KDN 变体在困惑度、零样本准确率与长程检索上 consistently 优于现有线性注意力与状态空间基线。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Ngoc Bui,Tinglin Huang,Rex Ying

Categories:

PDF URL: https://arxiv.org/pdf/2609.07816.pdf

Arxiv URL: https://arxiv.org/abs/2609.07816

Arxiv ID: 2609.07816

CoolPaper URL: https://papers.cool/arxiv/2609.07816

Published: 2026-09-10T01:27:02.582Z

Updated: 2026-09-10T01:27:02.582Z


16. CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements

Abstract:Transferring human hand demonstrations to robotic grippers has recently emerged as a cost-effective solution for robot learning. However, existing methods are largely confined to simple, planar tasks and fail to handle complex spatial movements (e.g., intricate trajectories involving rotations or flips) that are essential for robot manipulation. Motivated by this gap, we adopt an implicit, data-driven approach guided by fine-grained hand-pose motions. To this end, we introduce a scalable acquisition pipeline to collect hand-gripper paired demonstrations, governed by a rigorous protocol that prioritizes motion complexity and leverages a handheld gripper for seamless action mimicry. This yields a large-scale paired dataset comprising 6,189 episodes across 1,254 unique objects, exhibiting significantly higher spatial complexity than existing benchmarks. However, learning such complex mappings remains challenging. We observe that naive end-to-end generation of full gripper pose sequences is insufficient, as minor trajectory deviations compound rapidly under intricate dynamics. To address this, we propose a two-stage framework: Stage I predicts sparse gripper keyframes (initial and terminal) to simplify the mapping objective, while Stage II generates the full continuous action sequence conditioned on these keyframes. Furthermore, to mitigate cumulative drift, we keep the gripper’s orientation being learned while post-optimizing its translation based on the grasping heuristic and kinematic consistency. In both simulation and real-robot experiments, our framework enables stable and precise hand-to-gripper transfer of complex spatial manipulations, significantly outperforming traditional baselines. Project page: this https URL.

中文摘要

摘要:将人手示范转移到机器人夹具上最近成为机器人学习的一种成本效益较高的解决方案。然而,现有方法大多局限于简单的平面任务,无法处理机器人操作所必需的复杂空间运动(例如涉及旋转或翻转的复杂轨迹)。针对这一空白,我们采用了一种由精细手势动作引导的隐式数据驱动方法。为此,我们引入了一个可扩展的采集流程,以收集手-夹具配对示范,该流程遵循严格的协议,优先考虑动作复杂性,并利用手持夹具实现无缝动作模拟。由此产生的大规模配对数据集包含 1,254 个独特对象上的 6,189 个实验示例,其空间复杂性显著高于现有基准。然而,学习这种复杂映射仍然具有挑战性。我们观察到,简单的端到端生成完整夹具姿态序列是不够的,因为在复杂动力学下,轨迹的微小偏差会迅速累积。为了解决这一问题,我们提出了一个两阶段框架:第一阶段预测稀疏夹具关键帧(初始和终止),以简化映射目标;第二阶段生成以这些关键帧为条件的完整连续动作序列。此外,为减轻累积漂移,我们在学习夹具方向的同时,根据抓取启发式和运动学一致性对其平移进行后优化。在仿真和真实机器人实验中,我们的框架实现了复杂空间操作的人手到夹具的稳定且精准迁移,明显优于传统基线。项目页面:此 https URL。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.07498 (HTTP 429)

Authors: Hongxiang Zhao,Mutian Xu,Zeyu Jin,Yiming Hao,Shuguang Cui,Xiaoguang Han

Categories:

PDF URL: https://arxiv.org/pdf/2609.07498.pdf

Arxiv URL: https://arxiv.org/abs/2609.07498

Arxiv ID: 2609.07498

CoolPaper URL: https://papers.cool/arxiv/2609.07498

Published: 2026-09-10T01:27:04.439Z

Updated: 2026-09-10T01:27:04.439Z


17. Online Draft Co-Training for Speculative Decoding in Large-Scale, Long-Context RL Post-Training

Abstract:Speculative decoding accelerates rollout generation, which dominates the cost of reinforcement learning (RL) post-training. Online co-training can further increase the draft’s accuracy, yielding greater speedups. However, scaling this approach to co-training on large models with long contexts poses two obstacles: (1) branch attention is unsupported by standard causal context-parallel (CP) implementations, and (2) target features span across pipeline-parallel (PP) stages. We address both with an end-to-end system for large-scale online draft co-training. For CP, we extend packed, load-balanced zigzag ring attention by merging rank-local branch attention with causal main-sequence attention. For PP, TapChannel transports intermediate target features across stages via a separate path, leaving the pipeline schedule unaffected. Experiments demonstrate that co-trained drafts closely track the policy baseline while delivering substantial rollout and end-to-end speedups across model scales up to 122B. Our CP design achieves strong scaling at 256K tokens with significant memory savings over prior work, and our PP transport incurs modest overhead. Code can be found at this https URL.

中文摘要

摘要:推测性解码加速了生成回滚的过程,而这在强化学习(RL)训练后阶段是成本的主要部分。在线联合训练可以进一步提高草稿的准确性,从而获得更大的加速效果。然而,将这种方法扩展到具有长上下文的大模型联合训练时存在两个障碍:(1)标准因果上下文并行(CP)实现不支持分支注意力,且(2)目标特征跨越流水线并行(PP)阶段。我们通过一个端到端的大规模在线草稿联合训练系统解决了这两个问题。对于CP,我们通过将秩本地分支注意力与因果主序列注意力合并,扩展了打包、负载平衡的锯齿环注意力。对于PP,TapChannel通过单独路径在各阶段间传输中间目标特征,从而不影响流水线调度。实验表明,联合训练的草稿在紧随策略基线的同时,在模型规模高达122B的情况下实现了显著的回滚和端到端加速。我们的CP设计在256K token下实现了强扩展性,并比以往工作显著节省内存,而我们的PP传输只带来了适度的开销。代码可在此 https URL 获取。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*大规模、长上下文强化学习(RL)后训练中,在线草稿协同训练(online draft co-training)所面临的系统级扩展障碍\*\*。 具体而言,投机解码(speculative decoding)通过小型草稿模型生成候选token并由目标策略并行验证,可显著加速rollout生成;而在线协同训练能随着策略演化持续提高草稿模型的接受长度,从而获得更大的加速比。然而,将这一方法扩展到\*\*大规模模型\*\*与\*\*长上下文\*\*场景时,存在两个核心障碍: - \*\*上下文并行(Context Parallelism, CP)不支持分支注意力结构\*\* 先进的草稿架构(如EAGLE-3、DFlash、DSpark)引入了分支注意力机制:草稿中的每个分支query既要 attending 到主序列的因果前缀,又要 attending 到分支自身的局部key/value。标准的因果上下文并行(如ring attention)仅支持单一的因果主序列,无法直接处理这种分支结构。 - \*\*流水线并行(Pipeline Parallelism, PP)下的跨阶段目标特征传输\*\* 上述草稿架构需要消费目标模型中间层产生的隐藏状态(target features)作为条件输入。在流水线并行下,这些特征可能分布在远离草稿模型所在阶段的多个上游阶段。标准的流水线通信仅连接相邻阶段,无法高效地将这些非相邻特征送达草稿阶段。 为克服上述障碍,论文提出了端到端的系统设计: - \*\*CP层面\*\*:将分支注意力分解为\*\*因果主序列分量\*\*与\*\*本地分支分量\*\*,在打包(packed)、负载均衡的zigzag-ring attention框架下分别计算,并通过online-softmax机制合并结果:


ell = log(e^(ell_m) + e^(ell_b)), quad O = e^(ell_m - ell)O_m + e^(ell_b - ell)O_b

  • **PP层面**:引入**TapChannel**,在标准流水线调度之外建立一条独立的侧路径(RDMA/CUDA IPC),将中间目标特征从各源阶段直接传输至草稿阶段,无需修改现有流水线调度。 通过这两项机制,论文实现了在NeMo-RL框架中对EAGLE-3、DFlash、DSpark等草稿家族的在线协同训练,覆盖从8B到122B的多种模型规模,并在高达256K token的长上下文下保持可扩展性。 Q2: 有哪些相关研究? 论文在第2节系统梳理了相关研究,可归纳为以下几个方向: ### 1. 用于RL Rollout的投机解码(Speculative Decoding for RL Rollouts) - **基础机制**:Leviathan et al. (2023) 与 Chen et al. (2023) 提出通过小型草稿模型并行生成候选token并由目标模型验证,在保持输出分布不变的前提下加速自回归生成。 - **系统集成**:近期工作将投机解码集成至RL rollout引擎。Nemo-RL (Iso et al., 2026) 将MTP与EAGLE-3同时集成到同步与异步RL rollout中,研究部署与草稿配置对端到端训练速度的影响;SPEC-RL (Liu et al., 2025) 避免使用独立草稿模型,转而重用前一次策略迭代的响应片段作为投机前缀,在当前策略下验证,既保留on-policy样本又利用跨迭代相似性;EfficientRollout (Kim et al., 2026) 从目标模型构建量化自草稿器,根据观测到的接受率动态调整投机长度,仅在预期获益时启用投机。 ### 2. 演化策略下的草稿自适应(Draft Adaptation under Evolving RL Policies) - **独立草稿模型自适应**:FastGRPO (Zhang et al., 2026) 将在线草稿学习与并发感知配置相结合;ReSpec (Chen et al., 2026b) 动态选择投机参数并将策略蒸馏至草稿器。 - **MTP模块自适应**:部分工作选择适配MTP模块而非独立草稿模型。MTPRL (Wang et al., 2026a) 采用参数共享的MTP模块与优势感知优化;OCC (Wang et al., 2026b) 推导自适应系数以平衡辅助损失与策略更新;Bebop (Li et al., 2026b) 直接使用总变差目标训练以最大化接受率,并研究RL前的预自适应阶段。 ### 3. 目标特征条件化与并行草稿架构(Target-Feature-Conditioned & Parallel Draft Architectures) - **多token预测**:Blockwise parallel decoding (Stern et al., 2018) 引入多个未来token预测器配合前缀验证;MTP (Gloeckle et al., 2024) 将其泛化为辅助训练目标;FastMTP (Cai et al., 2025) 通过共享头与递归条件化降低顺序成本。 - **高级草稿架构**:EAGLE-3 (Li et al., 2026c) 以目标模型中间层融合特征为条件训练独立草稿器,并通过Training-Time Test (TTT) 暴露多步误差;DFlash (Chen et al., 2026a) 利用块扩散语言模型单次前向并行生成整块token;DSpark (Cheng et al., 2026) 在并行主干上增加轻量Markov头,通过低秩、前token条件化偏置自左向右精修块,以较小开销恢复块内因果依赖;Domino (Huang et al., 2026a) 同样将并行建模与序列依赖解耦。 ### 4. 分布式训练与长上下文基础设施(Distributed Training & Long-Context Systems) - **通用并行与长上下文**:大模型训练通常结合张量、流水线等多种并行策略 (Shoeybi et al., 2019; Yan et al., 2026)。针对长上下文,RingAttention (Liu et al., 2024) 将长序列分发到多设备并重叠KV通信与计算,但仅支持标准因果注意力。 - **草稿专用系统**:P-EAGLE (Hui et al., 2026) 通过结构化掩码实现EAGLE并行化;LongSpec (Yang et al., 2026) 针对长上下文推理优化KV缓存与位置编码;SpecForge (Li et al., 2026a) 开发了目标-草稿解耦与混合并行TTT训练框架,包含序列并行分支注意力。 ### 与现有工作的关系 上述研究分别从**rollout系统集成**、**训练目标设计**、**草稿网络结构**和**分布式基础设施**四个层面推进了投机解码。该论文的聚焦点与这些工作互补:其不修改目标模型的并行布局,而是在现有CP与PP拓扑基础上,通过分支注意力分解与TapChannel侧路径传输,解决大规模、长上下文RL后训练中在线草稿协同训练的系统级扩展难题。 Q3: 论文如何解决这个问题? 论文通过一套**端到端的系统设计**,在不改变目标模型现有并行拓扑(CP/PP)的前提下,将在线草稿协同训练扩展至大规模、长上下文场景。具体解决方案包含以下三个层面: ### 1. 在线草稿协同训练框架 将策略参数 θ 与草稿参数 φ 联合优化。草稿模型作为子模块驻留在流水线的最后一个阶段,训练时使用与策略相同的 rollout token,并对目标模型中间层产出的隐藏状态 H_θ(x) 施加 stop-gradient。联合目标函数为:

L(θ, φ) = L(RL)(θ) + λ , L(draft)(φ; , x, , sg(H_θ(x)))
其中 x 为 rollout token, sg 表示 stop-gradient。该设计使草稿在策略演化过程中持续对齐,从而维持或提升投机解码的接受长度。 ### 2. 上下文并行(CP)下的分支注意力分解与合并 针对 EAGLE-3、DFlash、DSpark 等架构引入的**分支注意力**,论文提出将每个分支 query 的 key/value 集合显式拆分为两部分并独立计算,最后合并: - **因果主序列分量(causal main-sequence component)**:分支需要 attending 的主序列因果前缀。该部分采用**打包(packed)、负载均衡的 zigzag-ring attention** 在 CP 组内计算:主序列的 K/V 沿 ring 循环传递,query 保持本地常驻。 - **局部分支分量(rank-local branch component)**:分支自身的局部 K/V 保留在拥有该分支锚点(anchor)的 rank 上本地计算,无需跨 rank 通信。 在每一步 ring attention 之后,将两个分量通过标准的 online-softmax 规约合并,恢复完整的注意力输出:

ell = log(e^(ellm) + e^(ell_b)), quad O = e^(ell_m - ell) O_m + e^(ell_b - ell) O_b
其中 (O_m, ell_m) 与 (O_b, ell_b) 分别对应主序列与局部分支的注意力输出及 log-sum-exp。该统一机制兼容: - **EAGLE-3**:Training-Time Test (TTT) 产生的逐位置增长分支; - **DFlash**:块扩散生成的整块并行分支; - **DSpark**:带 Markov 头精修的块内因果恢复分支。 通信方面,主序列 K/V 的 ring 通信量与分支数量/深度无关,仅取决于 CP 度 C 与序列长度 N :
V
(CP)^(fwd) = 2(C-1)(N) / (C) d(kv) b
其中 d
(kv) 为 K/V 宽度, b 为每元素字节数。通信以 ring-step 粒度与 attention 计算重叠。 ### 3. 流水线并行(PP)下的 TapChannel 跨阶段特征传输 在 PP 下,产生目标特征(taps)的策略层分布在多个阶段,而草稿模型仅位于最后一阶段。标准流水线通信仅连接相邻阶段,无法直接送达非相邻特征。论文引入 **TapChannel**,在标准流水线调度之外建立一条**独立的侧路径**(side path): - **邮箱机制(mailbox)**:在草稿阶段为每个上游源阶段预分配一块 buffer slot。源阶段完成该 microbatch 的策略前向后,将 taps 写入自身对应的 slot;草稿阶段在执行同个 microbatch 的前向之前读取该 slot。 - **同步方式**:每个 slot 附带 sequence stamp,生产者和消费者通过增减 stamp 完成握手,不介入标准 pipeline schedule。 - **传输后端**:同节点源阶段使用 CUDA IPC;跨节点源阶段使用独立的 NCCL 通信器配合 GPUDirect RDMA。 每 microbatch 的特征传输总量为:

V(Tap) = b n ∑(s ∈ S) ds
其中 n 为 microbatch 的 token 行数, S 为源阶段集合, d_s 为源阶段 s 的每 token 特征维度。由于流水线调度天然存在源阶段产出 tap 到草稿阶段消费之间的**松弛窗口(slack window)**,若传输在该窗口内完成则不增加额外延迟。残余的 rendezvous 延迟为:
E
(Tap)^((m)) = max(s ∈ S) max(τ(s,m) - Delta(s,m), , 0)
其中 τ
(s,m) 为传输时间, Delta(s,m) 为 slack。实验表明,TapChannel 的 one-sided 写操作相比 host staging 快 4.5–8.5 倍,且对源阶段几乎无干扰。 ### 总结 通过上述机制,论文在不修改目标模型并行布局的前提下,实现了: - **CP 层面**:以 zigzag-ring + 本地分支 + online-softmax 合并的方式支持任意分支注意力结构; - **PP 层面**:以 TapChannel 侧路径高效汇聚跨阶段目标特征。 二者结合,构成了可扩展的在线草稿协同训练系统,覆盖从 8B 到 122B 的模型规模及长达 256K token 的上下文。 Q4: 论文做了哪些实验? 论文在第4节开展了系统性的实验验证,涵盖**学习正确性**、**跨架构/规模性能**、**长上下文扩展性**以及**系统开销**四个维度。具体实验内容如下: ### 4.1 实验设置 - **模型**:目标模型包括 Qwen3-8B、Qwen3.5-35B-A3B、Qwen3.5-122B-A10B、Nemotron-3.5-Lightning-30B-A3B 及 GPT-OSS-120B;草稿模型覆盖 EAGLE-3、DFlash、DSpark 三个代表性家族。 - **任务与训练**:在 NeMo-RL 框架中使用 GRPO 算法。 - **单轮数学推理**:DAPOMath-17K 训练集,AIME 2024 评估;序列长度 4,096(输入)+ 16,384(响应)。 - **多轮工具使用**:NeMo Gym Workplace Assistant(基于 WorkBench benchmark),序列长度 32,768,包含工具调用与环境反馈。 - **指标**:训练奖励(reward)、验证准确率(accuracy)、训练–推理 KL 散度(衡量数值一致性)、接受长度(acceptance length)、rollout 吞吐(throughput)、端到端步时间(step time)。 ### 4.2 策略学习正确性验证 在 **Qwen3-8B** 上对比四组配置:无投机解码 baseline、在线协同训练 EAGLE-3、DFlash 与 DSpark。 - **观测指标**:奖励曲线、AIME 2024 验证准确率、训练–推理 KL 散度、接受长度、rollout 吞吐、端到端步时间(图3)。 - **结论**:三种草稿配置的奖励、准确率与 KL 散度均紧密跟踪 baseline,证实投机解码与在线协同训练**未改变 RL 学习轨迹**。 ### 4.3 跨草稿架构与模型规模的端到端性能 在 **8B 至 122B** 的多个目标模型上评估三种草稿家族,结果汇总于表1: - **接受长度(Accepted Length)**:EAGLE-3 为 2.28–2.65;DFlash 为 3.45–4.78;DSpark 为 3.63。 - **Rollout 加速比**:1.19×(Nemotron-3.5-Lightning + DSpark)至 2.23×(Qwen3-8B + DFlash)。 - **端到端训练加速比**:1.16× 至 1.88×。值得注意的是,更大的 MoE 模型(如 Qwen3.5-122B-A10B、GPT-OSS-120B)尽管接受长度高,但因验证前向激活稀疏专家计算,端到端收益相对有限。 ### 4.4 多轮工作负载评估 在 **NeMo Gym Workplace Assistant** 多轮环境上测试 Qwen3-8B(图4): - 所有配置奖励一致,接受长度随训练单调提升。 - 由于 rollout 仅占步时间的 55.8%(其余为工具执行与环境延迟),端到端加速比(1.25–1.43×)显著低于 rollout 阶段加速比(1.75–2.23×)。 ### 4.5 上下文并行(CP)注意力性能 - **与 USP 对比**(图5):在相同变长工作负载(最长 20,480 tokens)下,对比 SpecForge 的 USP 实现(Ulysses × ring,带 padding)。 - **延迟**:在 CP=2, 4, 8 下,打包 zigzag-ring attention 分别比最优 USP 配置快 **2.9×、2.3×、1.5×**。 - **显存**:每 GPU 峰值 HBM 降低 **2.7×**(USP 因 padding 导致有效 batch 膨胀至 2.25 倍真实 token 数)。 - **长上下文扩展性**(图6):在全局长度 16K–256K、CP∈{1,2,4,8} 下测试: - **EAGLE-3 TTT**:CP=8 时延迟从 CP=1 的 17.7 s 降至 2.35 s(7.5× 加速,94% 并行效率),显存从 53.2 GB 降至 7.5 GB。 - **DFlash / DSpark**:块扩散注意力受 launch 开销主导而非 FLOP 主导,即使 CP=8 仍保持极低延迟(≤55 ms),在 256K 时分别实现 6.9× 与 5.6× 加速。 ### 4.6 流水线并行(PP)开销 - **TapChannel 微观基准**(图7):在 PP=4 的 fan-in 场景下,对比 one-sided RDMA 写与 host staging(pinned host memory): - **延迟**:one-sided 写(27–39 GB/s)比 host staging 快 **4.5–8.5×**。 - **干扰**:TapChannel 对源阶段几乎无干扰( slowdown 在噪声范围内),接收端草稿阶段仅增加 1.6% HBM 争用;而 host staging 使所有 rank slowdown 超过 **80%**。 - **完整训练 overhead**(表2):在 Qwen3-8B (PP=4) 上测量前 10 个策略更新步: - 块扩散草稿(DFlash/DSpark)的更新阶段时间 overhead 低于 **15%**;EAGLE-3 因 TTT 多轮前向 overhead 为 34%。 - 投机 rollout 减少生成时间 28–52%,净得端到端加速 **1.31×–1.85×**。 - **Tap wait** 时间仅为 0.37–0.57 秒/更新步(占优化时间 1.5–2.2%),说明 rendezvous 成本基本被流水线调度重叠吸收。 Q5: 有什么可以进一步探索的点? 基于论文的实验观察与结论,以下方向值得进一步探索: ### 1. 稀疏 MoE 与线性注意力模型的投机解码优化 论文结论明确指出,当前方法在这两类模型上的收益受限: - **稀疏 MoE**:如 Qwen3.5-122B-A10B 与 GPT-OSS-120B 的实验所示,尽管接受长度较高,但验证前向会触发大量专家计算,稀释了端到端加速比。未来可探索**专家路由感知的草稿设计**,使草稿模型与目标模型的专家激活模式更紧密对齐,或设计仅激活部分专家的轻量验证路径。 - **线性注意力**:由于线性注意力的验证步骤本身开销较低( O(N) 或近似线性复杂度),投机解码的相对收益天然较小。可研究**针对线性注意力的专用草稿架构**(如利用其递归状态的块级并行),或转而优化内存带宽瓶颈而非纯计算延迟。 ### 2. 多轮/工具调用场景下的系统瓶颈突破 在多轮工作负载(如 NeMo Gym Workplace Assistant)中,端到端加速比(1.25–1.43×)显著低于 rollout 阶段加速比(1.75–2.23×),因为工具执行与环境延迟占据了 44.2% 的步时间且无法被更快的解码压缩。未来工作可包括: - **异步工具执行与投机解码流水线化**:将环境反馈与下一轮的草稿生成重叠; - **跨轮次缓存与重用**:利用多轮对话中的上下文相似性,设计跨轮次的 KV 缓存或草稿前缀复用机制。 ### 3. 超长上下文(>256K)与混合并行扩展 论文在 256K tokens 上验证了 CP 的强扩展性,但面向更长序列(如 1M+ tokens)或更高 CP 度时: - **通信–计算重叠的极限**:当本地序列长度 N/C 过小,ring attention 的通信开销 2(C-1)(N) / (C)d(kv)b 将压倒注意力计算,需探索**层次化 ring 拓扑**或**异步 K/V 预取**; - **与专家并行(EP)的协同**:当前实验对 MoE 模型使用了 EP,但 EP 的 all-to-all 通信与 CP 的 ring 通信可能存在资源争用,需研究联合调度策略。 ### 4. TapChannel 与跨阶段特征传输的精细化 - **动态 Slack 感知传输**:当前 TapChannel 依赖流水线调度的固有松弛窗口 Delta(s,m) 。若 PP 深度增加或 microbatch 调度更紧凑,slack 可能不足。可探索**动态微批调度**或**弹性 TapChannel 优先级**,在松弛不足时启用特征压缩; - **目标特征量化/稀疏化**:传输量 V(Tap) = b n ∑(s ∈ S) d_s 随模型宽度线性增长。对中间隐藏状态 Hθ 进行低比特量化(如 FP8/BF16 混合)或稀疏采样,可进一步降低带宽压力,且需验证其对草稿学习稳定性的影响。 ### 5. 在线协同训练的目标函数与优化策略 论文采用固定系数 λ 的联合目标:

L(θ, φ) = L(RL)(θ) + λ , L(draft)(φ; , x, , sg(H_θ(x)))
未来可研究: - **自适应系数 λ **:如 OCC (Wang et al., 2026b) 所提示,根据策略更新幅度或草稿接受率动态平衡两项损失,避免草稿过度拟合早期策略; - **课程式草稿训练**:在长上下文 RL 中,从短序列起步逐步扩展上下文长度,可能改善分支注意力的学习稳定性与收敛速度。 ### 6. 新型草稿架构的系统支持 论文的 CP 分支注意力机制统一支持了 EAGLE-3、DFlash、DSpark,但未来草稿架构可能引入更复杂的依赖结构(如非树状的图注意力、跨层特征聚合)。当前基于 online-softmax 的两路合并公式

ell = log(e^(ell_m) + e^(ell_b)), quad O = e^(ell_m - ell) O_m + e^(ell_b - ell) O_b
需扩展为**多路( k ≥ 3 )softmax 规约**,以支持更丰富的分支拓扑,同时保持 ring attention 的通信效率。 Q6: 总结一下论文的主要内容 该论文针对**大规模、长上下文强化学习(RL)后训练中的在线草稿协同训练**问题,提出了系统级的并行优化方案,实现了在保持学习稳定性的同时显著提升端到端训练速度。 ### 1. 研究背景与核心挑战 RL 后训练的 wall-clock 时间通常由 rollout 生成主导。**投机解码(Speculative Decoding, SD)**通过小型草稿模型生成候选 token、目标策略并行验证的方式,在不改变输出分布的前提下加速自回归生成。**在线协同训练(online co-training)**可进一步使草稿模型随策略演化而自适应,维持较高的 token 接受长度。 然而,将在线协同训练扩展到**大模型(如 122B)**与**长上下文(如 256K tokens)**时面临两个系统级障碍: - **上下文并行(CP)不支持分支注意力**:EAGLE-3、DFlash、DSpark 等先进草稿架构要求草稿中的每个分支 query 同时 attend 到主序列的因果前缀与分支自身的局部 key/value。标准因果 ring attention 无法直接表达这种分支结构。 - **流水线并行(PP)下的目标特征传输**:草稿模型需消费目标策略中间层产生的隐藏状态(target features)作为条件输入。在 PP 下,这些特征分散在多个上游阶段,而标准流水线通信仅连接相邻阶段,无法高效送达位于末端的草稿模型。 ### 2. 核心方法 论文提出了两项机制,在不改变目标模型现有并行拓扑的前提下解决上述问题: #### (1)CP 下的分支注意力分解与合并 将每个分支 query 的注意力显式拆分为两部分独立计算后合并: - **因果主序列分量**:主序列前缀的 key/value 采用**打包(packed)、负载均衡的 zigzag-ring attention** 在 CP 组内循环传递计算; - **局部分支分量**:分支自身的 key/value 保留在所属 rank 本地计算,无需跨 rank 通信。 在每一步通过标准的 online-softmax 规约合并结果:

ell = log(e^(ell_m) + e^(ell_b)), quad O = e^(ell_m - ell) O_m + e^(ell_b - ell) O_b
其中 (O_m, ell_m) 与 (O_b, ell_b) 分别为主序列与局部分支的注意力输出及 log-sum-exp。该机制统一支持 EAGLE-3(TTT 多步分支)、DFlash(块扩散分支)与 DSpark(Markov 头精修分支)。 #### (2)PP 下的 TapChannel 跨阶段特征传输 引入 **TapChannel**,在标准流水线调度之外建立一条独立的侧路径(RDMA/CUDA IPC),将上游各阶段产生的目标特征直接传输至末端的草稿阶段: - 在草稿阶段为每个源阶段预分配 buffer slot(邮箱机制); - 通过 sequence stamp 实现无干扰的生产者–消费者同步; - 传输与流水线 schedule 重叠,若特征送达时间在固有的松弛窗口(slack window)内,则不增加额外延迟。 ### 3. 实验结果 实验基于 NeMo-RL 框架,覆盖 8B 至 122B 的多种目标模型、三种草稿家族,以及单轮数学推理(DAPOMath-17K / AIME 2024)和多轮工具使用(NeMo Gym Workplace Assistant)任务。 - **学习正确性**:在线协同训练的奖励、验证准确率与训练–推理 KL 散度均紧密跟踪无投机解码的 baseline,证实未破坏 RL 学习轨迹。 - **端到端加速**:接受长度达 2.28–4.78,rollout 加速 1.19–2.23×,端到端训练加速 **1.16–1.88×**。DFlash 与 DSpark 的表现优于 EAGLE-3;MoE 与线性注意力模型因验证开销特性,相对收益较低。 - **CP 效率**:打包 zigzag-ring attention 在 CP=2,4,8 下分别优于 USP 实现 **2.9×、2.3×、1.5×** 的延迟,并降低 **2.7×** 的每 GPU 峰值 HBM 占用;在 256K tokens 下仍保持近线性扩展(94% 并行效率)。 - **PP 开销**:TapChannel 的 one-sided RDMA 写比 host staging 快 4.5–8.5 倍,对源阶段几乎无干扰;块扩散草稿的 PP 时间开销低于 15%,端到端净加速达 **1.31–1.85×**。 ### 4. 结论 该论文通过**分支注意力分解**与**TapChannel 侧路径传输**,首次实现了在现有 CP/PP 并行拓扑下的端到端在线草稿协同训练,支持高达 256K tokens 的长上下文与百B级大模型。未来工作可进一步探索针对稀疏 MoE、线性注意力模型的专用优化,以及多轮场景中工具执行与解码加速的协同流水线化。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Zili Wang,Zhaopeng Qiu,Yuekai Zhang,Shuang Yu,Junjie Lai

Categories:

PDF URL: https://arxiv.org/pdf/2609.07108.pdf

Arxiv URL: https://arxiv.org/abs/2609.07108

Arxiv ID: 2609.07108

CoolPaper URL: https://papers.cool/arxiv/2609.07108

Published: 2026-09-10T01:27:04.792Z

Updated: 2026-09-10T01:27:04.792Z


18. Agentic Visual Generation: From Generative Models to Agentic Control

Abstract:Visual generation is evolving from generative models used through a single invocation into agentic control processes that can plan, select tools, inspect intermediate synthesized outputs, revise failures, and reuse prior experience. In most existing systems, the controller is an LLM or VLM, while visual generation models serve as tools or executors. However, existing work lacks a consistent criterion for determining when a generation system becomes agentic. Planning depth, tool use, multi-role collaboration, and reinforcement learning are often treated as evidence of agenticity, even though none of them necessarily determines which generation decisions the controller can make. We organize the field according to what the controller can directly control in the generation process. At L1 Conditioning Control, the controller prepares the input to a predetermined generator but does not control which visual operation is executed. At L2 Execution Control, it selects and invokes actual generation, editing, rendering, or other content-modifying operations. At L3 Outcome-Adaptive Control, it observes an intermediate outcome and uses that observation to change a subsequent operation within the current task. At L4 Experience-Adaptive Control, it retains experience from completed tasks and uses that experience to change decisions on future tasks. L0 Fixed Support separately denotes generators, editors, evaluators, reward models, benchmarks, and fixed pipelines without a deployed controller that makes generation-level decisions. These levels describe a progressively broader decision-making scope rather than model size, system complexity, output quality, tool or role count, or training method. Applying this framework across image, video, editing, 3D, world, slide, and user-interface generation reveals how controller capabilities have evolved and how their mechanisms are distributed across levels.

中文摘要

摘要:视觉生成正在从通过单次调用使用的生成模型发展为能够进行计划、选择工具、检查中间合成输出、修正失败并复用先前经验的代理控制过程。在大多数现有系统中,控制器是大型语言模型(LLM)或视觉语言模型(VLM),而视觉生成模型则作为工具或执行器。然而,现有研究缺乏一致的标准来判断何时生成系统具有代理性。规划深度、工具使用、多角色协作和强化学习常被视为代理性的证据,尽管它们并不一定决定控制器可以做出的生成决策。我们根据控制器在生成过程中可以直接控制的内容对该领域进行组织。在L1条件控制(Conditioning Control)层级,控制器会准备预定生成器的输入,但不控制执行哪种视觉操作。在L2执行控制(Execution Control)层级,它选择并调用实际的生成、编辑、渲染或其他内容修改操作。在L3结果自适应控制(Outcome-Adaptive Control)层级,它观察中间结果,并利用该观察来改变当前任务中的后续操作。在L4经验自适应控制(Experience-Adaptive Control)层级,它保留已完成任务的经验,并利用这些经验来改变未来任务的决策。L0固定支持(Fixed Support)则单独指代生成器、编辑器、评估器、奖励模型、基准测试及不具备生成级决策控制器的固定流程。这些层级描述的是逐步扩大的决策范围,而非模型规模、系统复杂性、输出质量、工具或角色数量,或训练方法。将此框架应用于图像、视频、编辑、3D、世界、幻灯片和用户界面生成,可揭示控制器能力的演化及其机制在各层级中的分布情况。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决视觉生成领域中\*\*缺乏一致标准来界定“智能体性”(agenticity)\*\*的核心问题,并在此基础上建立系统化的分类与评估框架。具体而言,其针对的问题可归纳为以下几个方面: ### 1. 智能体性判定标准的缺失与混淆 现有研究常将规划深度、工具使用、多角色协作、强化学习等特征直接视为系统具备“智能体性”的证据,但这些特征并不必然等同于控制器在生成过程中实际能够干预的决策范围。论文指出,一个系统是否属于智能体视觉生成,不应由其架构复杂度、模型规模、输出质量或训练方式决定,而应取决于\*\*控制器能够在生成轨迹的哪个最深节点上因果地改变未来的生成决策\*\*。 ### 2. 控制器决策范围与生成能力的混为一谈 当前文献往往将生成器(generator)本身的进展(如更高的分辨率、更好的文本对齐)与控制器(controller)的决策能力混为一谈。论文强调,生成器能够“做什么”(L0 Fixed Support)与控制器能够“决定怎么做”(L1–L4)是两个独立维度。一个强大的扩散模型并不自动构成智能体系统;关键在于是否存在一个决策过程来控制生成轨迹的推进。 ### 3. 跨任务与跨模态的碎片化描述 现有工作在不同视觉模态(图像、视频、3D、幻灯片、界面等)之间缺乏统一的描述语言,导致难以横向比较不同系统的智能体能力。论文提出,需要一种\*\*模态无关的因果检验\*\*——即“控制器能够改变的最晚的未来生成决策是什么”——来统一衡量各类系统的决策边界。 ### 4. 评估方法无法隔离控制器决策的边际价值 现有评估往往比较不同系统(具备不同的生成器、工具集、计算预算和评估器)的终端输出质量,从而无法判断性能提升究竟来源于更强的生成器、更大的采样预算,还是控制器更广泛的决策能力。论文试图建立一种\*\*层级条件评估(level-conditioned evaluation)协议\*\*,通过固定生成器、工具、预算和评估器,单独检验从L1到L4每一级决策范围扩展所带来的因果性增益。 ### 总结 简言之,论文试图解决的核心问题是:\*\*如何以可复现、因果明确且与实现无关的方式,界定和评估视觉生成系统中控制器的智能体决策范围\*\*,从而将研究重点从“生成器能产出什么”转移到“控制器能在生成过程的何时、以何种证据改变未来的决策”。 Q2: 有哪些相关研究? 该论文将相关研究按照\*\*控制器决策范围\*\*(controller decision-making scope)重新组织为五个层级(L0–L4),同时涵盖训练方法与评估基础设施。以下按此框架梳理代表性相关工作: --- ### 1. L0 Fixed Support:固定支撑组件 这一层包含被控制器调用但不具备生成级决策能力的基座模型、数据 pipeline、评估器与基准。 - \*\*图像与视频生成基座\*\*:Latent Diffusion、SDXL、DALL-E 3、Video Diffusion Models、Lumiere、Imagen Video 等,提供从条件到像素的固定映射。 - \*\*可控生成与编辑\*\*:ControlNet、T2I-Adapter、DreamBooth、IP-Adapter、InstructPix2Pix、MGIE、SmartEdit,执行给定条件但不做路由选择。 - \*\*3D 生成\*\*:DreamFusion、Magic3D、DreamGaussian。 - \*\*检索组件\*\*:Re-Imagen,按固定路径检索参考图像。 - \*\*数据与训练基础设施\*\*:ScaleEdit-12M、DataEvolver、AgentComp、Gen-n-Val(数据构造);DPOK、AeSlides、T2I-R1、ReasonGen-R1、FrontCoder(固定生成器训练)。 - \*\*评估器与基准\*\*:ImageReward、Pick-a-Pic(奖励模型);T2I-CompBench、GenEval、VBench、EvalCrafter、AgenticVBench、DECKBench、3DCodeBench、VisEditBench(诊断基准)。 --- ### 2. L1 Conditioning Control:条件控制 控制器在生成前构建输入规范(prompt、布局、检索证据等),但不决定执行哪个视觉操作。 - \*\*文本提示优化\*\*:Promptist、TIPO、APE、DiffChat、POSI、ICG、ThinkGen,将用户请求改写为模型友好的文本条件。 - \*\*空间与几何规范\*\*:LMD、LayoutGPT、GoT、LLMControl(布局与区域);LLM Blueprint、NaLA、DAC-Pose(场景与姿态)。 - \*\*检索增强生成\*\*:World-To-Image、Gen-Searcher(检索策略);Cross-modal RAG、RealRAG、MosAIG、ORIG(证据到条件的接地)。 - \*\*时间与相机规范\*\*:Aurora、TempAct、AgentHOI、VideoGen-of-Thought、MovieAgent、OmniDrive(动作与时序);ShotVerse、CinemaTraj、LiVER(相机路径)。 - \*\*结构化内容规范\*\*:Think-Then-Generate、CANVAS、S2ED、MangaFlow(叙事与故事板);SlideTailor、ScreenCoder、PosterGen(文档与界面结构)。 --- ### 3. L2 Execution Control:执行控制 控制器能够选择、调用并组合实际的视觉操作(生成、编辑、渲染等),但执行路线在开环中运行,不受生成结果反馈的直接影响。 - \*\*模型与工具路由\*\*:Visual ChatGPT、LLM-I、Boogu-Image-0.1、SearchGen、Mind-Brush,选择调用哪个视觉基础模型或外部工具。 - \*\*工作流构建\*\*:ComfyUI-Copilot、ComfyUI-R1、GenClaw,构建可执行的节点图或代码工作流。 - \*\*图像与结构化图形操作\*\*:VPGen、IEAP、ImageEdit-R1(程序级图像操作);VisPainter、MiLDEdit、SceneCraft(元素级结构化操作)。 - \*\*视频与视听操作\*\*:RIVER、VideoAgent(片段级编辑);The Script is All You Need、StoryAgent、DreamFactory、CineAgents、ViMax(镜头与时间线操作);LVAS-Agent、Mora、MultiMedia-Agent(跨模态视听协调)。 - \*\*文档与界面操作\*\*:PresentAgent-2、TVIR。 - \*\*3D、CAD 与世界操作\*\*:CADIR、Vinedresser3D(几何与资产);AutoUE、3D Space as a Scratchpad、Unify-Agent(场景与引擎操作)。 --- ### 4. L3 Outcome-Adaptive Control:结果自适应控制 控制器观察中间执行结果(渲染图、视频帧、程序状态、物理模拟等),并在\*\*同一任务内\*\*据此修改后续动作。 - \*\*感知结果反馈(图像/结构化内容)\*\*:RPG、SLD、RS-Gen、GenPilot、CountLoop、MetaPoint、FiRe、VisualPrompter、IA-T2I、GenArtist,依据可见缺陷进行提示词修正或局部重采样。 - \*\*感知结果反馈(视频)\*\*:GenMAC、MotionAgent、AniME、Hollywood Town、CoAgent、MAViS、Co-Director、VISTA,依据生成帧修正运动、构图或镜头。 - \*\*感知结果反馈(3D/多视图)\*\*:SceneAssistant、VIGA、SceneConductor、Scenethesis、WorldClaw、Kubrick,依据渲染视图修正几何与布局。 - \*\*感知结果反馈(文档/界面)\*\*:PPTAgent、UI2CodeN、DesignCoder、VisRefiner、CITL、GameUIAgent、AceCoder,依据渲染截图修正代码或文档状态。 - \*\*结构化与执行状态反馈\*\*:COMIC、LayerCraft、I2E、GVR-Coder(程序/工作流状态);ReCA、LAVE、Crayotter、T2VTree(时间线与源状态);Authoring for Living Worlds、HDSL、MUSE、SimWorlds、StateFlow(场景与引擎状态)。 - \*\*物理与约束反馈\*\*:NEWTON、MoReGen、VideoCoCo(模拟动力学);PhyScensis、SAGE、Agentic Designer、SceneSmith(几何与世界约束)。 - \*\*人工审查反馈\*\*:Promptify、CoGen3D、OrchestrXR,在任务 episode 内根据人类审批调整生成。 --- ### 5. L4 Experience-Adaptive Control:经验自适应控制 控制器将已完成的 episode 经验持久化,并用于改变\*\*后续独立任务\*\*的决策。 - \*\*能力与工具画像\*\*:DiffusionAgent、OctoT2I、PerfGuard、GenRouter,记录模型/工具的路由与性能画像。 - \*\*情景与用户记忆\*\*:MemoGen、BrandFusion、UniVA、MemSlides、Action Agent,检索过往 episode 或用户偏好。 - \*\*可复用程序与技能\*\*:GenEvolve、EvoDiagram、ManimAgent、SEAR、SceneCraft,将成功/失败轨迹蒸馏为可复用策略。 - \*\*可执行工作流与 Harness\*\*:COMFYCLAW、FigAgent、AutoDesign、VideoWeaver,存储并复用经过验证的图/程序/中间件。 - \*\*策略与模型更新\*\*:SIDiffAgent、JarvisEvo、SPIRAL、CLARE、SymbOmni,通过参数或策略更新改变未来行为。 - \*\*递归自我改进(概念性)\*\*:Gödel Agent、Darwin Gödel Machine,作为跨任务自改进的架构先例。 --- ### 6. 训练与强化学习方法 - \*\*监督微调(SFT)\*\*:Promptist、ReasonGen-R1、FrontCoder、GenAgent、ToolArtist,用于初始化条件策略或可执行控制器轨迹。 - \*\*奖励模型与反馈\*\*:ImageReward、Pick-a-Pic、PIGReward(终端偏好);GenEval、T2I-CompBench、GUV、AlphaGRPO(过程与可验证奖励)。 - \*\*策略优化\*\*:DPOK(扩散模型奖励优化)、NEWTON(在线交互式 RL)、OctoT2I(路由策略优化)、GenEvolve(经验蒸馏)、SPIRAL/ Q3: 论文如何解决这个问题? 论文通过以下六个相互关联的方面,系统性地解决了视觉生成领域缺乏一致智能体性标准的问题: --- ### 1. 建立基于最大因果范围的层级框架 论文提出一个以\*\*控制器决策的因果范围\*\*为核心组织原则的五级框架(L0–L4),将“智能体性”从实施细节中抽象出来: - \*\*L0 Fixed Support\*\*:固定支撑组件(生成器、编辑器、评估器、基准),仅执行预设路径,无生成级决策能力,构成纳入边界。 - \*\*L1 Conditioning Control\*\*:控制器构建输入规范(提示词、布局、检索证据、时序结构等),但仅面向\*\*预定的执行器\*\*。 - \*\*L2 Execution Control\*\*:控制器选择并调用实际的视觉操作(生成、编辑、渲染、工作流节点等),执行路线在开环中运行。 - \*\*L3 Outcome-Adaptive Control\*\*:控制器观察中间结果(渲染输出、程序状态、物理模拟、人工审查),并在\*\*当前任务内\*\*据此修改后续动作。 - \*\*L4 Experience-Adaptive Control\*\*:控制器保留已完成任务的经验,并用其改变\*\*后续独立任务\*\*的决策。 该框架的关键在于,每一级扩展的是\*\*证据能够改变未来生成决策的最晚时间点\*\*,而非模型规模、系统复杂度、输出质量或工具数量。系统的智能体水平由其控制器在生成轨迹上可达到的最大因果范围决定:

L(S) = maxi : c_i = 1
其中 c(S) = (c_1, c_2, c_3, c_4) 为能力路径向量,分别对应规范控制、执行控制、结果自适应与经验自适应。 —- ### 2. 制定可复现的判定规则 为避免标题中的术语(如“multi-agent”“self-reflective”)造成误判,论文建立了一套从高到低依次检验的**决策流程**: 1. 若存在跨任务持久化并改变后续控制,则判定为 **L4**; 2. 若存在观测结果到当前任务内后续动作的因果链,则判定为 **L3**; 3. 若存在对视觉操作的选择与调用,则判定为 **L2**; 4. 若仅存在对预定执行器的输入规范构建,则判定为 **L1**; 5. 若以上皆无,则归入 **L0**。 当某一级别的因果链路缺乏实证时,采取**保守降级**策略。这一规则使分类可复现,并将控制器能力与架构实现解耦。 —- ### 3. 构建细粒度的第二轴分类体系 在确定最大因果范围(第一轴)后,论文为每一级引入**第二轴**以区分技术实现路径,避免同一能力层级下的系统混为一谈: - **L1** 按生成器面对的规范类型细分:文本提示、空间几何、检索证据、时序相机、结构化内容; - **L2** 按可执行对象细分:模型/工具路由、图像/图形操作、视频/视听操作、文档/界面操作、3D/CAD/世界操作; - **L3** 按决定性反馈来源细分:感知渲染结果、结构化/执行状态、物理/约束验证、人工审查; - **L4** 按经验载体细分:能力画像、情景记忆、可复用程序/技能、可执行工作流、策略/模型参数更新。 —- ### 4. 开发层级条件评估协议 为解决“无法隔离控制器决策边际价值”的评估难题,论文提出 **level-conditioned evaluation**:在固定生成器、可用工具、计算预算和评估器的前提下,每次仅增加一类控制器决策,测量其因果性增益。 | 比较层级 | 核心问题 | 控制变量 | 关键反事实(Counterfactual) | |————-|————-|————-|—————————————-| | L0 | 固定执行器本身能做什么? | 输入条件、种子、采样参数、候选预算 | 无控制器干预的基线 | | L1 | 规范控制是否改进同一执行器? | 生成器、种子、采样参数、预算 | 原始输入或固定规范规则 | | L2 | 路由选择是否优于固定路线? | 可用模型/工具、动作预算、评估器 | 固定/随机/频率基线或先知路由 | | L3 | 结果反馈是否导致成功修复? | 初始计划、工具、生成器、评估器、总预算 | 移除中间观测的开放环执行 | | L4 | 经验是否提升未来任务? | 未来任务分布、工具、生成器、预算 | 移除、打乱、注入过期或无关经验 | 该协议要求报告**决策有效性、轨迹效用、鲁棒性与恢复能力、忠实归因**四个共享维度,并强调必须通过干预测试(如强制/移除某诊断或某段记忆)来建立因果主张,而非仅比较终端输出质量。 —- ### 5. 构建结构化语料库与定量分析 论文汇编并发布了一个去重、带标注的结构化语料库,字段包括层级、任务、机制、控制器类型、视觉执行器、反馈边界、评估类型、跨任务持久化等。基于该语料库的统计揭示了领域现状: - **时序演化**:2025 年后文献呈爆发式增长,主要由 L3(任务内结果反馈)驱动; - **任务分布**:L3 在所有模态(图像、视频、3D、幻灯片、界面)中均占主导,但 L4(跨任务经验复用)占比极小,表明持久化适应仍不成熟; - **控制器组织**:单控制器架构在各层级均占主导,多角色设计集中在 L1–L3,统一多模态策略仍较少见。 这些发现为后续研究指出了从 L3 向 L4 过渡的关键瓶颈。 —- ### 6. 界定关键转变与未来范式 论文进一步用该框架识别了四个关键转变,并讨论了超越当前 LLM/VLM-as-controller 范式的可能性: - **L1→L2**:从声明式规范转向可执行控制,需解决安全、来源追溯与预算约束下的选择性干预; - **L2→L3**:从开环执行转向可靠反馈控制,需整合多源诊断、精确信用分配与人机协同中的状态保持; - **L3→L4**:从任务内状态转向可复用经验,需验证时序鲁棒性(避免经验过时)、负迁移与回滚机制; - **L4 之后:Generator-as-Controller**:提出一种未来范式,即生成器自身同时承担控制功能,在共享的生成-控制状态上直接操作,缩短反馈环路,实现更细粒度的局部修正与更低的交互成本。该范式仍需满足同样的因果检验:其演进中的视觉状态必须能因果地改变后续动作,且保留的经验必须能改变未来独立任务。 通过上述方案,论文将碎片化的视觉生成研究重新组织为一个以**控制器决策因果范围**为主线、以**可复现评估**为支撑的连贯体系。 Q4: 论文做了哪些实验? 该论文是一篇**框架性综述论文**(framework survey),其核心贡献在于建立分类体系与评估协议,而非在特定数据集上训练并测试某一具体模型。因此,论文中**不包含传统意义上的算法实验**(如端到端模型训练与消融实验)。不过,论文开展了以下几类**实证与分析工作**: —- ### 1. 结构化语料库的构建与大规模标注分析 论文作者系统性地收集、去重并标注了一个覆盖智能体视觉生成领域的结构化语料库,记录了每个系统的首次公开发布时间、主层级、能力路径、模态、机制、控制器类型、视觉执行器、反馈边界、评估类型、跨任务持久化等字段。基于该语料库,论文进行了以下定量分析: - **时序演化统计(Figure 5)**:按半年度统计各层级(L0–L4)的系统数量,发现 2025 年后领域呈爆发式增长,且增长主要由 **L3 Outcome-Adaptive Control**(任务内结果反馈)驱动。 - **模态分布统计(Figure 6a)**:展示不同视觉模态(图像、编辑、视频、幻灯片、界面、3D、世界)在各层级的分布,发现 L3 横跨所有模态均占主导,而 **L4 Experience-Adaptive Control**(跨任务经验复用)在各类任务中均极为稀少。 - **控制器组织统计(Figure 6b)**:分析单控制器、多角色控制器与统一多模态策略在各层级的占比,发现单控制器架构在所有层级均占主导。 这些统计揭示了领域现状:**任务内自适应修正已较为普遍,但跨任务的持久化经验学习与复用仍不成熟**。 —- ### 2. 层级条件评估框架的设计(Level-Conditioned Evaluation) 论文未报告已完成的评估实验,而是**提出了一套可复现的评估协议**,旨在解决“无法隔离控制器决策边际价值”的难题。该框架的核心是**固定生成器、工具、预算与评估器,每次仅增加一类控制器决策**,通过反事实(counterfactual)对比来测量因果性增益。具体包括: | 评估层级 | 实验设计要点 | 反事实基线 | 需报告的证据 | |————-|——————|—————-|——————| | **L0** | 测试固定执行器在固定输入、种子、采样参数和候选预算下的表现 | 无控制器干预 | 硬性约束通过率、合成内容质量、人类偏好、资源成本 | | **L1** | 比较控制器构建的规范 vs. 原始输入或固定规范规则 | 原始用户输入 / 固定重写规则 | 意图保持度、规范有效性、生成器依从性 | | **L2** | 比较控制器路由 vs. 固定/随机/频率基线或先知路由 | 固定路线、随机路线、频率路线 | 路由遗憾值、无效动作率、匹配成本下的成功率与质量 | | **L3** | 比较闭环(可观察中间结果)vs. 开环(无中间观测)执行 | 移除中间观测的开放环执行 | 诊断精确度、修复成功率、非目标区域保持度、校准停止率 | | **L4** | 比较有经验记忆 vs. 无/打乱/过期/无关经验 | 移除、打乱、注入过时或无关经验 | 前向迁移率、负迁移率、遗忘率、检索准确率、回滚成功率 | | **跨层级** | 从 L1 到 L4 逐步增加决策范围,保持预算与工具一致 | 每次增加一个决策类别 | 质量–成本前沿曲线、每一过渡的边际增益 | —- ### 3. 边界案例的判定与一致性检验(Table II) 论文通过一系列边界案例,展示了所提判定规则在实践中的应用,以证明分类框架的可操作性: - **Prompt rewrite + fixed generator** → 判定为 **L1**(范围止于声明式规范) - **Generator/editor choice** → 判定为 **L2**(控制器选择执行的操作) - **Critique + repair/regeneration** → 判定为 **L3**(结果改变同一任务内的后续动作) - **Current-task state only** → **≤L3**(状态未跨越 episode 边界) - **Reusable skill from a completed task** → 判定为 **L4**(经验改变后续独立任务) - **RL-trained fixed generator** → **L0/L1**(层级遵循推理时决策,而非优化过程本身) 这些案例研究起到了**概念验证**的作用,证明该规则能够区分文献中常被混淆的智能体性声称。 —- ### 4. 对现有系统的设计空间映射 论文将代表性系统映射为一个由**受控变量**和**反馈路径**组成的设计空间(Figure 4 与 Figure 8),并分析了不同层级之间的过渡机制: - **L0→L1**:如何解决“用户请求无法直接作为可用空间规范”的问题; - **L1→L2**:如何解决“无法决定执行哪个视觉操作”的问题; - **L2→L3**:如何解决“执行后可见的失败无法被修正”的问题; - **L3→L4**:如何解决“任务内状态无法帮助未来独立任务”的问题。 这本质上是对现有文献的一次**系统性重分类与因果归因分析**。 —- ### 总结 简言之,该论文的“实验”并非训练某个新模型,而是通过**大规模语料标注与统计、评估协议的形式化设计、边界案例的因果判定**,来验证所提框架的: 1. **覆盖性**(能容纳现有各类系统); 2. **区分性**(能精确分离不同决策范围); 3. **可评估性**(能指导未来受控实验的设计)。 论文明确将**执行具体层级条件评估实验**留作未来工作,并在项目仓库中发布了语料库与统计脚本,供后续研究基于此框架开展实证对比。 Q5: 有什么可以进一步探索的点? 基于论文提出的层级框架与评估协议,以下几个方面可作为具有前瞻性的研究方向: —- ### 1. L1→L2:可执行控制的安全性、溯源与预算约束 从声明式规范转向可执行控制时,控制器开始直接调用外部工具、模型与代码,这引入了新的研究空间: - **权限感知的路由与溯源**:执行控制扩大了安全与合规的攻击面。需要探索如何在操作执行前(而非仅在输出后)进行许可证检查、隐私风险评估与内容安全过滤。可进一步研究为检索到的参考、调用的模型、编辑参数与操作历史附加**机器可读的溯源信息**(machine-readable provenance),使每一次生成动作的来源与责任边界可被审计。 - **预算约束下的选择性干预**:实际场景中,工具调用存在货币成本、延迟与计算预算限制。可研究如何在路由阶段显式估计预期质量增益、延迟与风险,构建一个带资源惩罚的决策目标。论文提示的目标形式可扩展为:

E[∑(t=0)^(T) γ^t ( α r(goal,t) + β r(process,t) - λ c(a_t) ) ]
其中 c(a_t) 需同时建模 API 费用、推理延迟与人工干预成本,而非仅考虑候选样本数。 —- ### 2. L2→L3:多源反馈融合、信用分配与人机协同 这一过渡要求中间观测真正改变后续动作,但现有系统在反馈的可靠性与归因方面仍不成熟: - 多源异构反馈的整合与解耦:未来需探索如何联合利用局部多模态诊断、专用检测器、可执行验证器、物理模拟器状态、不确定性估计与人工升级信号。关键难点在于,不同反馈源(如外观渲染 vs. 物理碰撞 vs. 编译错误)对应不同的失败模式,控制器需要学习按 violated requirement 选择修复策略,而非将所有信号过早坍缩为单一标量分数。 - 从诊断到修复的信用分配(Credit Assignment):当一次修复成功时,需确定该成功究竟源于正确的诊断、恰当的修复动作,还是仅仅是额外采样的结果。可进一步研究匹配轨迹对(matched trajectory pairs)与干预测试(intervention tests):在相同状态下,强制替换诊断或替换修复动作,观察结果是否按预期变化,从而隔离控制器决策的因果效应。 - 保持已接受状态的人机共创作:研究如何向用户暴露计划、掩码、时间线、布局、候选集与不确定性,使得人工反馈能够在不擦除已接受内容的前提下重定向后续生成。需建立修正努力度(edit effort)、先前决策保持率信任校准(trust calibration)的量化指标。 —- ### 3. L3→L4:跨任务经验的时序鲁棒性、遗忘与回滚 当前文献中 L4 占比极低,从任务内自适应到跨任务经验复用存在显著空白: - 经验过时与冲突检测:工具版本、API 价格、用户偏好与安全策略会随时间变化。需研究带时间戳、溯源与版本控制的记忆机制,以及选择性遗忘(selective forgetting)与冲突检测算法。评估应采用严格的时间顺序划分:经验获取阶段与 future-task 评估阶段必须隔离,避免信息泄漏。 - 负迁移与回滚机制:持久记忆可能保留错误策略。需系统研究在何种条件下存储的经验会导致负迁移(negative transfer),并设计低成本的回滚(rollback)机制。可执行的 workflow 与技能库(如 COMFYCLAW 的图结构)天然支持版本控制,而参数化记忆则难以撤销,值得比较不同载体的可逆性与审计性。 - 长程一致性 vs. 跨任务适应的界限:现有工作如 SPIRAL 与 VisAgent 可在长 episode 内保持叙事或世界状态,但这仍属于 L3。需要明确的判定准则与基准来检验:一个系统在原始任务结束后,其保留的经验是否真的改变了对后续独立目标的控制,而非仅仅是长上下文内的状态延续。 —- ### 4. 超越现有范式:Generator-as-Controller 论文提出了一种可能的下一代范式,即统一的视觉策略同时承担生成与控制,这方面存在大量待探索空间: - 共享的生成-控制状态表示:当前 LLM/VLM 控制器需将视觉状态反复序列化为语言,再转回生成条件,造成信息损失。可研究让策略直接在视觉 token、潜在区域、帧间隔或场景对象上操作,实现更细粒度的局部修正与更清晰的信用分配。 - 缩短反馈环路:统一模型可在不调用外部生成器的情况下,对未解决区域分配额外计算、重用中间生成状态并决定停止。这需要新的测试时计算分配(test-time compute allocation)机制,以及对应的训练目标,使得模型学会何时对何地进行自我修正。 - 持久世界状态的内生建模:在交互式世界生成中,若控制与生成共享同一状态表示,则动作、其视觉后果与世界更新可在同一表示空间内跨步骤保持链接。这要求生成器不仅能建模像素或视频帧,还需内生地维护可操作的世界状态图。 - 可审计性与安全控制:统一模型可能带来更不透明的动作轨迹与自我确认的评估偏差。需要研究混合架构:视觉策略负责细粒度生成与修正,外部控制器负责用户意图对齐、权限检查与回滚,并在相同生成能力与预算下与纯 LLM/VLM 控制基线进行严格对比。 —- ### 5. 评估协议与跨模态基准的落地 论文提出了 level-conditioned evaluation 的形式化框架,但其实际执行与标准化仍待完成: - 因果干预基准:需要构建支持反事实测试的公共环境。例如,在图像任务中强制改变一个区域约束并观察控制器行为;在视频任务中腐蚀一个时间参考;在界面任务中注入无效文件状态;在 3D 任务中破坏几何可达性。每个扰动都应配合匹配的开放环/闭环执行与预算控制。 - 分离内部评估器与外部评估器:为消除选择偏差(selection bias),基准应强制要求:用于指导修复的 critic、决定停止的 critic 与最终报告得分的 held-out evaluator 三者独立。这可以防止策略针对评估指标过拟合。 - 跨模态的统一评估维度:尽管不同模态(图像、视频、3D、幻灯片、界面)的内容检查各异,但可统一报告以下向量:硬性约束通过率诊断精确度修复成功率非目标保持率资源成本人类修正努力度,避免仅用终端质量分数掩盖控制器失败。 —- ### 6. 训练数据与强化学习机制的细化 当前训练 pipeline 在轨迹记录、奖励设计与跨任务优化方面仍有改进空间: - 失败与修复轨迹的系统化采集:大多数数据集仅保留成功案例。未来需建立包含错误前状态、责任动作、观察到的后果与可行替代方案的轨迹库,以便训练更具判别力的修复策略。 - 过程奖励的模态特化实例化:公式 r_t = α r
(goal,t) + β r(process,t) - λ c(a_t) 中的 r(process,t) 需在各自模态中具体化:图像编辑中保护已接受区域,视频中检查动作完成与时序状态,幻灯片中验证可编译性与可编辑性,3D 中验证隐藏视角的几何与物理有效性。 - 跨任务策略优化:现有 RL 方法大多优化单轨迹回报 $J(θ) = E(τ sim πθ)

(t=0)^(T) γ^t r_t
。L4 要求目标函数显式包含记忆更新 m
(n+1) = U(m_n, E_n) 对后续任务的影响,即需要元学习或终身学习形式的目标,使得策略不仅优化当前任务表现,还优化未来任务上的期望回报。如何稳定训练此类跨 episode 目标,仍是一个开放问题。 Q6: 总结一下论文的主要内容 这篇论文系统性地重新定义了视觉生成(visual generation)领域中“智能体性”(agenticity)的判定标准,并建立了一套与之匹配的分类框架与评估协议。其核心内容可概括如下: —- ### 1. 核心问题 现有视觉生成研究在声称“智能体”能力时缺乏一致标准。规划深度、工具使用、多角色协作、强化学习等常被直接视为智能体性的证据,但这些特征并不必然等同于控制器在生成过程中能够实际干预的决策范围。同时,生成器本身的性能提升(如更高分辨率、更好的文本对齐)与控制器的能力演进常被混为一谈,导致文献碎片化且难以横向比较。 —- ### 2. 核心贡献:基于最大因果范围的五级层级 论文提出以控制器决策的最大因果范围(maximum causal reach)为唯一组织原则,将系统分为五个层级。该框架与模型规模、架构复杂度、模态类型或训练方法解耦: - L0 Fixed Support(纳入边界):固定支撑组件,如生成器、编辑器、检索器、评估器与基准。它们执行预设路径,但不包含进行生成级决策的部署控制器。 - L1 Conditioning Control(条件控制):控制器将用户目标转化为输入规范(如提示词、空间布局、检索证据、时序结构),但仅面向预定的执行器,无法决定执行哪个视觉操作。 - L2 Execution Control(执行控制):控制器能够选择并调用实际的视觉操作(如生成、编辑、渲染、工作流节点),执行路线在开环中运行,生成结果不直接改变后续动作。 - L3 Outcome-Adaptive Control(结果自适应控制):控制器观察中间结果(渲染图、视频帧、程序状态、物理模拟、人工审查等),并在同一任务内据此修改后续动作,形成闭环。 - L4 Experience-Adaptive Control(经验自适应控制):控制器将已完成任务的经验持久化(如能力画像、情景记忆、可复用技能、工作流或策略更新),并用于改变后续独立任务的决策。 系统的层级由其控制器在生成轨迹上可达到的最晚决策点决定。若能力路径向量为 c(S) = (c_1, c_2, c_3, c_4)$,则层级为:

L(S) = maxi : c_i = 1
—- ### 3. 支撑体系 - **可复现的判定规则**:论文建立了一套从高到低依次检验的保守降级规则。若某级因果链路缺乏实证,则归入较低层级,防止标题术语(如“multi-agent”“self-reflective”)本身成为证据。 - **细粒度次级分类**:在每个主层级下,按“受控对象”设立第二轴。例如,L1 按规范类型(文本、空间、检索、时序、结构化内容)细分;L2 按可执行对象(工具路由、图像操作、视频操作、文档操作、3D/世界操作)细分;L3 按反馈来源(感知渲染、结构化状态、物理约束、人工审查)细分;L4 按经验载体(能力画像、情景记忆、抽象技能、可执行工作流、策略参数)细分。 - **结构化语料库分析**:作者构建并标注了大规模语料库,发现领域增长主要由 **L3**(任务内结果反馈)驱动,而 **L4**(跨任务经验复用)在所有模态中均极为稀少,揭示了持久化适应是当前关键瓶颈。 —- ### 4. 层级条件评估协议(Level-Conditioned Evaluation) 为解决“无法隔离控制器决策边际价值”的评估难题,论文提出在**固定生成器、工具、预算和评估器**的前提下,每次仅增加一类控制器决策,通过反事实(counterfactual)对比测量因果性增益: | 层级 | 核心对比 | 反事实基线 | |———|————-|—————-| | L1 | 控制器构建的规范 vs. 原始输入 | 固定规范规则或无重写 | | L2 | 控制器路由 vs. 固定路线 | 随机/频率/先知路由 | | L3 | 闭环(含中间观测)vs. 开环 | 移除中间结果访问的同等预算执行 | | L4 | 有经验记忆 vs. 无/打乱/过期经验 | 移除、打乱或注入无关的跨任务经验 | 该协议要求报告决策有效性、轨迹效用、鲁棒性恢复与忠实归因,避免将生成器强度、采样预算或评估器过拟合误认为是控制器能力的提升。 —- ### 5. 开放方向与关键过渡 论文最后识别了四个关键过渡,并讨论了未来“生成器即控制器”(generator-as-controller)的范式: - **L1→L2**:从声明式规范到可执行控制,需解决安全、溯源与预算约束下的选择性干预; - **L2→L3**:从开环执行到可靠反馈控制,需整合多源诊断、精确信用分配与人机协同中的状态保持; - **L3→L4**:从任务内状态到可复用经验,需验证时序鲁棒性、负迁移与回滚机制; - **超越 L4**:统一视觉策略同时承担生成与控制,在共享的生成-控制状态上直接操作,缩短反馈环路,实现更细粒度的局部修正,但仍需满足同样的最大因果范围检验。 —- 简言之,这篇论文将视觉生成研究从“生成器能产出什么”重新聚焦于**“控制器能在生成过程的何时、以何种证据改变未来的决策”**,提供了一个可复现、可评估且跨模态统一的智能体性分析框架。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yinming Huang,Shuyuan Tu,Xi Yan,Jiahao Zhan,Zihan Yang,Zhen Xing,Hui Zhang,Tiehua Zhang,Yu-Gang Jiang,Zuxuan Wu

Categories:

PDF URL: https://arxiv.org/pdf/2609.06758.pdf

Arxiv URL: https://arxiv.org/abs/2609.06758

Arxiv ID: 2609.06758

CoolPaper URL: https://papers.cool/arxiv/2609.06758

Published: 2026-09-10T01:27:06.539Z

Updated: 2026-09-10T01:27:06.539Z


19. Procedural Graphs: Self-Evolving Execution Structures for LLM Agents

Abstract:Large language models are increasingly deployed as agents that plan over long horizons and act through external tools. Most agents select actions through unconstrained generation over an accumulating history, leaving implicit the procedural knowledge of what to do, in what order, and under which conditions. As trajectories lengthen, agents can lose track of their objectives, invoke tools out of order, and repeat unproductive actions. We introduce the Procedural Graph: just as a knowledge graph organizes factual knowledge into (entity, relation, entity) triplets for what-is questions, a Procedural Graph organizes procedural knowledge into (procedure, relation, procedure) triplets for what-to-do questions. At each decision step, the framework localizes the agent’s active node, and a guidance model translates the surrounding subgraph into step-level situational guidance that biases the solver’s next action without dictating it. The graph is self-evolving: an LLM refiner contrasts failed trajectories with successful ones and edits the graph’s topology and attributes, committing edits that preserve or improve held-out validation performance while retaining rejected ones to discourage repetition. Starting from a minimal skeleton, the loop builds graphs that match or surpass hand-designed ones. It can also repair a flawed expert prior. Across multiple datasets, task types, and LLMs, the Procedural Graph delivers consistent gains over memory-based baselines, and self-evolution further improves performance without manual engineering.

中文摘要

摘要:大型语言模型越来越多地被部署为能够规划长远目标并通过外部工具执行操作的代理。大多数代理通过对累积历史的无限制生成来选择行动,这使得在做什么、按什么顺序以及在何种条件下执行的程序性知识隐含存在。随着轨迹的延长,代理可能会失去对其目标的追踪,错序调用工具,并重复无效操作。我们引入了程序图:正如知识图将事实知识组织成(实体,关系,实体)三元组以回答“是什么”的问题,程序图将程序性知识组织成(程序,关系,程序)三元组以回答“该做什么”的问题。在每个决策步骤中,该框架定位代理的活动节点,指导模型将周围的子图转化为步骤级的情境指导,以偏向解决器的下一步行动,但不直接规定其行动。该图具有自我演化能力:大型语言模型优化器将失败的轨迹与成功的轨迹进行对比,并编辑图的拓扑和属性,提交可以保持或改善验证集性能的编辑,同时保留被拒绝的内容以防止重复。从最小骨架开始,该循环构建出的图可与手工设计的图匹配或超越。它还可以修复有缺陷的专家先验。在多个数据集、任务类型和大型语言模型中,程序图在基于记忆的基线之上持续带来性能提升,而自我演化进一步无需人工工程即可提升性能。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*大型语言模型(LLM)智能体在长程任务执行中缺乏显式、结构化且可迭代的过程知识表示\*\*这一问题。具体而言,现有方法将动作选择的负担完全置于无约束的自由生成之上,导致智能体在复杂、多步骤任务中难以维持过程一致性。 核心问题可归纳为以下几个方面: - \*\*隐式过程知识的脆弱性\*\* 主流智能体通过基于累积历史日志的无约束生成来选择动作(如 ReAct 范式),这使得“下一步该做什么、以何种顺序、在什么条件下执行”等过程知识处于隐式状态。随着轨迹延长,智能体容易丢失目标、乱序调用工具,并陷入重复无效动作的循环。 - \*\*现有记忆与规划方法的结构性不足\*\* - \*\*文本记忆方法\*\*(如 MemoryBank、Reflexion)以自由形式保存经验,但智能体仍需在每一步自行推断这些经验如何适用于当前状态及后续约束。 - \*\*状态条件指南\*\*(如 AutoGuide)虽提供更具针对性的建议,但未显式连接连续步骤之间的转移关系。 - \*\*工作流与状态机\*\*(如 FlowBench、AWM)虽显式约束执行顺序,但往往依赖人工设计,缺乏基于执行反馈的灵活修订能力。 - \*\*自动化工作流搜索\*\*虽减少了人工设计负担,但仍未有效结合\*\*可编辑的过程表示\*\*与\*\*基于当前进度的动态指导\*\*。 - \*\*对显式、可编辑、自适应过程知识的需求\*\* 论文指出,智能体需要一种过程知识表示,该表示应同时满足: 1. \*\*足够结构化\*\*:能够引导智能体远离无效行为; 2. \*\*足够灵活\*\*:保留推理自由度,而非硬编码固定路径; 3. \*\*响应当前进度\*\*:根据已执行的轨迹动态提供情境化指导; 4. \*\*可从经验中改进\*\*:无需重新训练模型参数即可迭代优化。 为解决上述问题,论文提出了\*\*Procedural Graph(PG)\*\*框架——一种显式、可编辑的有向图结构,将过程知识组织为 \`(procedure, relation, procedure)\` 三元组,并通过“在线生成式指导”与“离线自进化”两个互补阶段,使图结构能够随执行反馈自动优化拓扑与边属性,从而在多样任务与模型上实现一致且显著的性能提升。 Q2: 有哪些相关研究? 根据论文第2节与附录A的综述,相关研究可归纳为以下三个主要方向: ### 1. LLM 智能体与动作选择(LLM Agents and Action Selection) 该方向关注智能体如何在交互循环中选择并执行动作,但通常将\*\*可容许的状态转移关系隐式地交由模型自行推断\*\*。 - \*\*ReAct\*\*(Yao et al., 2023b):确立了“推理—行动”交错执行的 dominant paradigm,后续工作在此基础上扩展了自我批判、分支搜索与更丰富的动作空间(Shinn et al., 2023; Qin et al., 2024; Wang et al., 2024a)。 - \*\*推理结构扩展\*\*:Tree-of-Thoughts 与 Graph-of-Thoughts(Yao et al., 2023a; Besta et al., 2024)将链式推理推广为对分支备选方案的搜索;Plan-and-Solve 与 ADaPT(Wang et al., 2023b; Prasad et al., 2024)则尝试将规划与执行分离。 - \*\*动作空间重塑\*\*:CodeAct(Wang et al., 2024a)将动作统一为可执行 Python 代码;HuggingGPT(Shen et al., 2023)将 Hugging Face 上的模型视为可调用工具。 - \*\*大规模工具调用\*\*:ToolLLM(Qin et al., 2024)、Gorilla(Patil et al., 2024)、AnyTool(Du et al., 2024)、ToolGen(Wang et al., 2025a)等聚焦于如何从数万 API 中检索并调用正确工具,但普遍\*\*未显式编码工具调用之间的时序与条件依赖\*\*。 这类方法的常见失效模式包括规划幻觉(planning hallucination)、轨迹漂移(drift)与重复循环(Xiao et al., 2024; Zhu et al., 2025)。 ### 2. 智能体规划的结构化先验(Structured Priors for Agent Planning) 该方向尝试为智能体提供显式结构以约束执行过程,但在\*\*转移条件的属性化、局部检索与可编辑性\*\*方面各有侧重。 - \*\*文本与流程化规则\*\*:KnowAgent(Zhu et al., 2025)维护文本形式的动作规则库;FlowBench(Xiao et al., 2024)将工作流知识表示为文本、代码或流程图,并证明流程图最能减少规划幻觉。 - \*\*工作流搜索与自动机\*\*:AFlow(Zhang et al., 2025)将工作流构建视为对代码表示图的蒙特卡洛树搜索;TOOLDEC(Zhang et al., 2023)利用有限状态自动机约束解码,仅保证语法有效,不保证语义可容许。 - \*\*工具图(Tool Graphs)\*\*:ToolNet(Liu et al., 2024a)从 LLM 生成的轨迹中挖掘有向工具转移图;ControlLLM(Liu et al., 2024b)预构建工具依赖图并执行 Thoughts-on-Graph 搜索;COLT(Qu et al., 2024)通过双视图查询-工具-场景图提升检索完备性;Graph RAG-Tool Fusion(Lumer et al., 2025)混合向量检索与图遍历;NaviAgent(Jiang et al., 2025)融合 API 模式与历史调用构建异构依赖图。 - \*\*多智能体与任务规划\*\*:SkillGraph(Nie et al., 2026)针对多模态多智能体协作,从技能库中检索并预测通信图;TaskBench(Shen et al., 2024)与 GNN4TaskPlan(Wu et al., 2024)则在图结构任务自动化基准上探索基于 GNN 的子任务选择。 ### 3. 基于轨迹的自改进智能体(Self-Improving Agents from Trajectories) 该方向关注如何从过往执行轨迹中蒸馏可复用知识,但在\*\*将经验显式组织为可局部检索、可结构编辑的过程知识\*\*方面存在差异。 - \*\*情节记忆与反思\*\*:Reflexion(Shinn et al., 2023)将自我批评写入情节缓冲区;Generative Agents(Park et al., 2023)维护按重要性排序的记忆流;MemoryBank(Zhong et al., 2024)引入基于艾宾浩斯遗忘曲线的长期经验摘要;RAP(Kagaya et al., 2024)直接检索完整历史轨迹作为上下文示例。 - \*\*洞察与规则蒸馏\*\*:ExpeL(Zhao et al., 2024)通过对比成功与失败轨迹提取自然语言洞察;AutoGuide(Fu et al., 2024)进一步将其锐化为状态条件指南(“在情境 X 下,执行动作 Y ”),是\*\*与 PG 最接近的基线\*\*,但其指南仍以文本池形式存储,未显式连接连续步骤。 - \*\*技能与工作流记忆\*\*:Voyager(Wang et al., 2023a)维护可嵌入检索的代码技能库;TroVE(Wang et al., 2024b)归纳可验证的 Python 工具箱;AWM(Wang et al., 2025b)诱导可复用的线性工作流;SkillWeaver 与 WebXSkill(Zheng et al., 2025; Wang et al., 2026)针对网页智能体进行技能发现。 - \*\*过程记忆生命周期\*\*:MemP(Fang et al., 2025)将轨迹蒸馏为细粒度步骤指令与高层脚本;EvolveR(Wu et al., 2025)结合离线自蒸馏与在线策略强化;SE-Agent(Sun et al., 2025)从自主收集的经验中学习计算机使用策略;A-Mem 与 Zep/Graphiti(Xu et al., 2026; Rasmussen et al., 2025)将知识图谱结构引入智能体记忆,但主要聚焦于情节与语义记忆,而非过程记忆。 ### 4. 认知架构视角:过程记忆的显式化 Sumers et al. (2023) 提出的 CoALA 框架将智能体记忆类比为 ACT-R/SOAR 的分类:工作记忆、情节记忆、语义记忆与\*\*过程记忆\*\*(procedural memory)。检索增强方法(如 GraphRAG)操作于语义记忆;轨迹反思方法操作于情节记忆;而\*\*过程记忆\*\*长期隐式地存储于模型权重或分散的提示模板中。PG 可视为对 CoALA 过程记忆模块的显式实现——将状态条件化的动作转移存储为可检索、可更新的图结构。 --- \*\*核心差异总结\*\*:现有方法或以自由文本保存经验(重建负担重),或以固定工作流/状态机约束执行(灵活性差、需人工设计),或仅提供孤立的状态条件规则(缺乏步骤间显式连接)。PG 的统一特征在于:以\*\*带属性的有向图\*\*显式编码 (procedure, relation, procedure) 转移关系,支持基于当前执行位置的\*\*局部子图检索\*\*,并通过\*\*拓扑与属性的联合编辑\*\*实现自进化。 Q3: 论文如何解决这个问题? 论文通过引入 \*\*Procedural Graph(PG)\*\* 框架解决上述问题。该框架将过程知识显式编码为可检索、可编辑的有向属性图,并通过“在线情境指导”与“离线自进化”两个互补阶段,实现对智能体执行的软约束与持续优化。具体解决路径如下: --- ### 1. 显式过程知识表示:从自由文本到属性化三元组图 不同于将经验隐式存入模型权重或自由文本的做法,论文将过程知识外化为显式图结构:

G = langle V, R, E, Phi rangle, quad E ⊂eq V × R × V
其中: - V 为抽象节点,对应工具调用、推理步骤或任务状态; - R 为转移关系词表; - 每条边 e = (u, r, v) ∈ E 表示在关系 r 下节点 v 可接在节点 u 之后执行; - Phi 为边属性映射,赋予每条边若干文本属性(如 `condition`、`guidance`、`pitfalls`),描述该转移的触发条件、执行方式与常见陷阱。 这种 `(procedure, relation, procedure)` 三元组结构使“下一步该做什么、在何种条件下、如何规避错误”等知识变得显式且可查询,避免了传统方法中智能体需在长程上下文中自行重建过程依赖的负担。 —- ### 2. 在线推理:局部子图驱动的生成式指导(Generative PG Guidance) 在推理阶段,图结构保持冻结。框架通过**定位—提取—生成**三步,将静态图与动态轨迹转化为每一步的软指导,而非硬编码动作: 1. **定位(Locate)**:根据上一步动作 a_(t-1) ,通过精确匹配确定当前激活节点 u_t ∈ V ; 2. **提取(Extract)**:提取 u_t 的 h 跳有向邻域子图 G_t = N_h(u_t) (若匹配失败则回退到全图); 3. **生成(Generate)**:由 Guidance LLM Psi 将子图 G_t 的拓扑结构与边属性 Phi(e) 翻译为当前步骤的情境化指导 g_t :

ut = Match(a(t-1), V), quad Gt = N_h(u_t), & u_t ≠ ∅ G, & otherwise , quad g_t = Psi(G_t, q, T(t-w:t))
其中 q 为用户查询, T(t-w:t) 为最近 w 步的轨迹窗口。 最终,指导 g_t 被追加至 solver 提示中,由 solver 自主决定下一步动作:
a_t sim P
(solver)(· mid q, Tt, g_t)
这一设计既保留了智能体的推理自由度,又通过局部子图的拓扑上下文(而非孤立的规则片段)将其引导至合法转移空间,有效缓解了长程轨迹中的漂移与循环问题。 —- ### 3. 离线自进化:基于执行反馈的图结构优化 为消除对人工设计工作流的依赖,论文设计了自动化反馈闭环,使图拓扑与边属性随经验迭代优化。每一轮 k 包含四个步骤: #### 步骤一:诊断性 rollout 使用保留图 G
(k-1) 在训练批次 B_k 上执行,记录轨迹与得分:

Ek = (q_i, T_i^((k)), S_i^((k)))(i=1)^(|B_k|)

步骤二:反馈驱动的图变异(Mutation) 离线 LLM Refiner 对比高分轨迹与低分轨迹,识别失败回路或成功捷径,生成结构化编辑集 Delta Gk ,包括: - **拓扑编辑**:增加缺失的验证节点/边(Add)、删除导致失败或阻碍进度的节点/边(Delete); - **属性编辑**:通过“删除后重加”的方式修订边的 `condition`、`guidance`、`pitfalls` 等属性。 候选图由 G_k^(cand) = G(k-1) oplus Delta Gk 得到,其中 oplus 在副本上应用编辑并执行必要的环修复。 #### 步骤三:验证门控(Validation Gating) 候选图需通过独立验证集 D(val) 的检验,计算平均任务得分:

S(val)(G) = (1) / (|D(textval))| ∑((q,y) ∈ D_val) S(f(solver)(q mid G), y)
仅当候选图得分不低于当前保留图时方可提交:
Gk = G_k^(cand), & if S(val)(Gk^(cand)) ≥ S(val)(G(k-1)) G(k-1), & otherwise
该门控过滤掉仅在训练集上表现优异但泛化性差的修改,防止结构过拟合。 #### 步骤四:拒绝记忆作为保障(Rejection Memory) 若候选图被拒,则将其编辑、轨迹与验证结果存入拒绝记忆 H_(rejected) 。在后续轮次中,Refiner 以该历史为负例证据:

Delta G(k+1) sim P(refiner)(· mid Gk, C(k+1), H(rejected))
这避免了重复提出等价的失败编辑,提升搜索效率。 —- ### 4. 灵活的初始化与修复能力 PG 支持两种初始化策略,分别解决“冷启动”与“专家先验缺陷”问题: - **从零构建(Scratch)**:初始骨架仅含 `Start → End`,通过自进化逐步生长出完整图结构。实验表明,该策略在 HotpotQA 等任务上可超越人工设计的专家图。 - **专家先验修复**:即使初始专家图存在缺陷(如在 MultiChallenge 中导致成功率从 87.5% 降至 58.93%),验证门控与迭代进化仍能逐步剪除错误边、重建正确控制流,最终恢复并超越原始性能。 —- ### 5. 效率与鲁棒性的协同优化 论文进一步通过**局部化**与**生成式指导**的联合设计,解决显式结构可能带来的额外开销问题: - 相比全图直接注入,局部 h 跳子图显著降低 token 消耗(如在 ALFWorld 上减少 70.9%); - 相比 raw 图注入,生成式指导将静态属性转化为情境化建议,减少冗余工具调用(如在 EnterpriseArena 上每月工具调用从 17.23 次降至 3.08 次),同时提升任务成功率。 综上,PG 框架通过**显式图表示**解决过程知识隐式化问题,通过**局部子图生成指导**兼顾结构约束与推理自由,通过**带验证门控的自进化**实现无需重训练的结构持续优化,从而系统性地克服了现有记忆基线与工作流方法的核心局限。 Q4: 论文做了哪些实验? 论文在多个任务类型、LLM 家族和配置模式下开展了系统性实验,可归纳为以下五个层面: —- ### 1. 跨基准与跨模型的主实验(Section 5.1) 在 **6 个基准** 上评估了 **4 种 LLM**,将 Procedural Graph(PG)与 **7 条基线** 进行对比。 **基准测试:** - **HotpotQA**:多跳开放域问答(检索工具) - **MultiChallenge**:多轮对话中的指令保持 - **GDPval**:开放式专业任务(按专家评分标准评估) - **ALFWorld**:具身家庭任务(严格动作顺序) - **𝜏-bench**:实时用户交互下的策略合规工具使用 - **BFCL v3**:多轮函数调用 **基线方法:** Vanilla ReAct、MemoryBank、RAP、ExpeL、AutoGuide、AWM、KnowAgent **LLM 家族:** Claude Sonnet 4.6、Gemini 3.1 Pro、Gemini 3.5 Flash、Grok 4.1 Fast **核心结果(Table 1):** PG 在 **24 个模型–基准设置中 21 次排名第一或并列第一**。相比各设置下的最强基线,PG 取得 19 胜、2 平、3 负(二项式符号检验 p = 4.3 × 10^(-4) )。代表性提升包括:BFCL v3 上 Gemini 3.5 Flash 的准确率从 58.00% 提升至 67.00%(+9.00 点),GDPval 上 Gemini 3.1 Pro 的评分从 71.37 提升至 78.78(+7.41 点)。 —- ### 2. 长程决策韧性与生存分析(Section 5.2, Appendix C) 在 **EnterpriseArena** 金融模拟器上进行长程决策实验。智能体需在最长 **132 个月** 的周期中管理流动性,面临三次预设的宏观经济危机(第 32、59、112 个月),且融资存在 1–6 个月的随机到账延迟。 **评估指标:** - 全周期生存率(Full Surv.) - 平均存活月数(Avg. Months) - 时间平均企业评分(Avg. Score) - 月均工具调用次数(Tools/Mo) - 累计融资额(Raised) **核心发现(Table 8, Figure 3):** PG 在 **全部四种 LLM 上均达到最高或并列最高的全周期生存率与最长平均寿命**。例如: - Gemini 3.1 Pro:生存率从 6.0%(基线)提升至 34.0% - Claude Sonnet 4.6:生存率从 44.0% 提升至 58.0% - Grok 4.1 Fast:生存率从 26.0% 提升至 40.0% PG 的关键行为改变是**提前发起融资**(anticipatory fundraising),而非单纯减少或增加工具调用次数。 **案例追踪(Appendix C.3):** 对同一随机种子下的基线、MemoryBank 摘要、PG 引导三种智能体进行逐步轨迹对比,揭示基线因违反“单请求待处理”约束而被拒绝、MemoryBank 因幻觉重复提交请求,而 PG 引导智能体则严格遵循时序规则并存活至模拟结束。 —- ### 3. PG 构建策略对比(Section 5.3, Appendix D) 在 HotpotQA 与 MultiChallenge 上对比了 **5 种 PG 构建模式**(Table 2, Table 9, Table 10): | 模式 | 说明 | |—-|—-| | Mode 1 | 手工专家图,零样本 | | Mode 2 | 专家图 + 单次离线静态更新 | | Mode 3 | 专家图 + 在线增量进化 | | Mode 4 | 从零骨架(Start→End)+ 单次离线静态构建 | | Mode 5 | 从零骨架 + 在线增量进化 | **核心发现:** - **从零进化可超越人工先验**:HotpotQA 上 Mode 5(Ans F1 78.79%)优于所有专家初始化模式。 - **修复有缺陷的专家先验**:MultiChallenge 上手工专家图(Mode 1)将成功率从 87.50% 降至 58.93%;单次静态更新(Mode 2)进一步降至 53.57%;而在线进化(Mode 3)通过剪枝与重建恢复至 92.86%。 - **资源与鲁棒性**:在线进化模式在减少解析失败(HotpotQA 上 Mode 2 降至 0.005 次/样本)与缩短推理步数(MultiChallenge 上 Mode 5 降至 5.05 步)之间取得平衡。 —- ### 4. 自进化过程的细粒度追踪(Section 5.4, Appendix E) 对 **EnterpriseArena 上 10 轮自进化** 进行了逐轮诊断(Table 11, Figure 4, Figure 5): - **Round 1**:发现核心骨架(月度开始 → 检查现金 → 预测跑道 → 保存笔记 → 市场检查 → 资本决策),验证生存率从 0% 跃升至 45%。 - **Round 2**:增加 `recall_notes` 节点,提供跨月度持久工作记忆,生存率提升至 80%,月均工具调用从 17.23 降至 3.08。 - **Rounds 3–6**:多轮候选因验证集性能下降或结构校验失败而被拒绝,保留图维持 Round 2 状态。 - **Round 7**:剪除 `pass_action`(“什么都不做”)分支。 - **Round 8**:引入管理绕行(fund_raising_request 直接连至 End 而非 book_closing),验证生存率达 90%。 - **Round 10**:因验证性能下降(-5.0%)被门控拒绝,循环终止。 此外,在 HotpotQA 与 MultiChallenge 上追踪了 Mode 3 与 Mode 5 的逐代验证曲线(Figure 6),显示从零进化可最终超越专家初始化,且迭代进化能修复不匹配的初始图。 —- ### 5. 指导机制的效率消融(Section 5.5) 在 Gemini 3.5 Flash 上固定底层图,对比了三种图使用方式(Table 3): | 配置 | MultiChallenge Acc. | GDPval Rubric | ALFWorld Success | 机制 | |—-|—-|—-|—-|—-| | 基线(无图) | 80.27 | 54.80 | 72.58 | — | | 全图 Raw 注入 | 86.60 | 57.17 | 70.34 | 直接序列化全图送入提示 | | 全图生成式指导 | 87.35 | 56.75 | 54.48 | 全图送入 Guidance LLM 生成建议 | | **局部子图生成式(本文)** | **89.31** | **63.99** | **81.53** | 仅提取 h=2 跳邻域再生成指导 | **核心结论:** - **局部化优于全图**:局部子图配置在所有三项任务上均取得最高性能,同时相比全图生成式指导显著降低 token 消耗(ALFWorld 降低 70.9%,GDPval 降低 18.1%)。 - **生成式指导优于 Raw 注入**:Raw 注入虽在部分任务有效,但在具身执行(ALFWorld)上损害性能;生成式指导通过情境化翻译缓解了这一问题。 - **步骤效率**:局部指导在 GDPval 和 ALFWorld 上分别将平均 solver 步数从 28.20 降至 18.57、从 21.84 降至 18.80。 —- ### 6. 附加执行案例(Appendix F) 提供了两个定性案例: - **BFCL 停止决策(F.1)**:PG 引导的智能体在用户仅询价时正确结束回合(`Finish`),而基线继续执行预订导致状态不匹配。 - **MultiChallenge 响应目标修正(F.2)**:展示 Mode 3 进化过程中,Refiner 如何通过删除错误边并修订 `guidance` 属性,将智能体行为从“评价对话”纠正为“回答用户问题”。 Q5: 有什么可以进一步探索的点? 基于论文结论与实验分析,以下方向值得进一步探索: —- ### 1. 降低指导生成的 Token 开销 尽管局部子图生成式指导能减少 solver 步数,但 Guidance LLM 的额外调用仍使总 token 消耗高于无图基线(GDPval 与 ALFWorld 上分别高出 33.4% 与 55.4%)。未来工作可探索: - **跨步骤复用指导**:当局部子图与激活节点未发生显著变化时,缓存或复用先前生成的指导 g_t ,避免重复调用。 - **选择性指导触发**:仅在不确定性高或历史失败频发的决策点生成指导,而非每一步均调用 Psi 。 —- ### 2. 跨求解器与跨工具接口的迁移性验证 当前实验在同一 LLM 家族内执行与进化(solver、guidance model、refiner 共享同一底层模型)。尚不清楚: - 在某一模型上进化得到的 Procedural Graph G^ ,迁移到另一模型或更新后的工具接口时,其结构有效性是否保持; - 边属性 Phi(e) 中的自然语言指导是否需要针对目标模型的指令跟随能力进行自适应重写。 系统性的跨模型、跨版本迁移实验将澄清过程知识的可复用边界。 —- ### 3. 更稳健的验证门控与统计检验 在 EnterpriseArena 的自进化中,每轮验证仅使用 20 个 episode(Section 5.4)。接受/拒绝决策常取决于一两个样本的表现差异,本质上属于\*基于小样本的搜索轨迹**,而非严格的显著性检验。未来可探索: - 引入重复采样或贝叶斯优化,降低随机性对 S
(val)(G^(cand)k) ≥ S(val)(G_(k-1)) 门控的噪声影响; - 采用渐进式验证(progressive validation),在训练过程中在线估计性能增益,减少独立验证集的资源消耗。 —- ### 4. 层次化与组合式图结构 当前使用的图规模较小(多数基准在 7–27 个 triplets,仅 BFCL v3 达 265 个)。对于更复杂的长程任务,可探索: - **层次化 PG**:高层子图刻画任务阶段(如“尽调→谈判→签约”),低层子图展开具体工具调用序列; - **子图组合与复用**:将跨任务通用的过程模式(如“验证→执行→确认”)抽象为可插拔的子图模块,通过图组合操作动态拼接。 —- ### 5. 在线实时图更新与持续学习 现有自进化循环为**离线批量**模式:图在训练批次间更新,但在单个 episode 内保持冻结。未来可研究: - **执行中在线更新**:允许智能体在检测到环境突变(如工具 API 变更、新约束出现)时即时触发局部图编辑; - **灾难性遗忘防护**:当图持续进化时,如何确保新编辑不破坏对已掌握任务的指导能力,即维护图层面的持续学习稳定性。 —- ### 6. 更丰富的边语义与自动模式发现 当前关系词汇 R 仅包含四种类型(LEADS_TO、TRIGGERS、PROVIDES_INPUT_FOR、CONVERGES_TO),边属性采用固定的 `condition`/`guidance`/`pitfalls` 三元组。可进一步: - 从大规模轨迹中自动归纳新的关系类型与属性模式,而非人工预设 schema; - 引入时序逻辑或概率化边权重,使图不仅能表达“可转移”,还能表达“转移的紧迫程度”或“成功概率”。 —- ### 7. 与强化学习或搜索算法的深度结合 当前编辑提议依赖 LLM Refiner 的对比推理,接受标准基于验证集得分阈值。可引入: - **基于策略梯度的图编辑**:将 Add/Delete/Update 操作建模为动作空间,以长期任务回报为目标直接优化; - **蒙特卡洛树搜索(MCTS)**:在图结构空间中进行前瞻式搜索,评估多步编辑的累积效果,而非当前的贪婪单步改进。 —- ### 8. 多智能体协作中的过程图 论文聚焦于单智能体的过程知识。SkillGraph 等工作已探索多智能体通信图,但尚未与显式过程转移属性结合。未来可研究: - **角色化子图分配**:为不同智能体维护互补或层级化的 PG,通过跨图接口定义协作协议; - **冲突检测与合并**:当多个智能体各自进化出局部过程图时,如何检测拓扑冲突并合并为一致的全局执行规范。 Q6: 总结一下论文的主要内容 这篇论文针对大型语言模型(LLM)智能体在长程任务执行中因缺乏显式过程知识而导致的规划漂移、工具乱序调用及重复无效动作等问题,提出了 **Procedural Graph(PG)** 框架。以下是主要内容总结: —- ### 1. 研究动机与核心问题 现有 LLM 智能体大多依赖无约束的自由生成进行动作选择,将“下一步该做什么、以何种顺序、在什么条件下执行”等过程知识隐式地埋藏在累积的历史上下文或模型参数中。随着轨迹延长,智能体容易: - 丢失长期目标; - 以错误顺序调用工具; - 陷入重复无效的循环。 现有方法(文本记忆、状态条件指南、人工设计工作流等)在**显式连接连续步骤**、**基于当前进度的动态指导**与**无需重训练的可迭代优化**之间存在不足。 —- ### 2. Procedural Graph 框架 论文将过程知识外化为一种显式、可编辑的有向属性图:

G = langle V, R, E, Phi rangle, quad E ⊂eq V × R × V

  • **节点** V :抽象表示工具调用、推理步骤或任务状态; - **关系** R :定义转移类型; - **边** e = (u, r, v) ∈ E :表示在关系 r 下,节点 v 可合法接在节点 u 之后; - **属性映射** Phi :为每条边附加 `condition`(何时触发)、`guidance`(如何执行)、`pitfalls`(需避免的错误)等文本属性。 该结构将任务域的过程知识置于模型权重之外,使其可被检查、检索和编辑。 —- ### 3. 在线推理:生成式图指导(Generative PG Guidance) 推理时图结构保持冻结。框架在每一步执行**定位—提取—生成**三步操作:

ut = Match(a(t-1), V), quad Gt = N_h(u_t), & u_t ≠ ∅ G, & otherwise , quad g_t = Psi(G_t, q, T(t-w:t))

  • **定位**:将上一步动作 a(t-1) 匹配至图中的激活节点 u_t ; - **提取**:获取 u_t 的 h 跳有向邻域子图 N_h(u_t) (匹配失败时回退到全图); - **生成**:由 Guidance LLM Psi 结合子图拓扑、边属性及最近 w 步轨迹,生成当前步骤的情境化指导 g_t 。 指导 g_t 以软约束形式追加至 solver 提示中,由 solver 自主选择下一步动作:
    a_t sim P
    (solver)(· mid q, Tt, g_t)
    这种设计既保留了智能体的推理自由度,又通过局部子图的拓扑上下文将其引导至合法转移空间。 —- ### 4. 离线自进化:基于反馈的图结构优化 为减少人工设计负担,论文提出自动化的闭环自进化机制,每一轮包含四步: 1. **诊断性 Rollout**:使用保留图 G
    (k-1) 在训练批次上执行,收集轨迹与得分 Ek ; 2. **反馈驱动的变异**:LLM Refiner 对比成功与失败轨迹,生成结构化编辑集 Delta G_k (增删节点/边、修订边属性),得到候选图 G_k^(cand) = G(k-1) oplus Delta Gk ; 3. **验证门控**:候选图在独立验证集 D(val) 上评估平均得分 S_(val) ,仅当性能不下降时方可提交:

Gk = G_k^(cand), & if S(val)(Gk^(cand)) ≥ S(val)(G(k-1)) G(k-1), & otherwise

  1. **拒绝记忆**:被拒候选及其诊断存入 H_(rejected) ,作为后续轮次的负例证据,避免重复失败编辑。 该循环支持从**最小骨架(Start→End)**从零构建,也能**修复有缺陷的专家先验**。 —- ### 5. 实验验证 论文在 **7 个基准**(涵盖多跳问答、多轮对话、专业交付、具身任务、客服工具使用、函数调用、长程金融模拟)和 **4 种 LLM**(Claude、Gemini 系列、Grok)上进行了系统实验: - **主实验**:PG 在 24 个模型–基准设置中 21 次排名第一或并列第一,相比最强基线取得 19 胜、2 平、3 负( p = 4.3 × 10^(-4) )。 - **长程韧性**:在 EnterpriseArena 金融模拟器(最长 132 个月、三次危机)中,PG 将 Gemini 3.1 Pro 的全周期生存率从 6.0% 提升至 34.0%,Claude Sonnet 从 44.0% 提升至 58.0%。关键行为改善是**提前发起融资**以应对资金到账延迟。 - **构建策略**:从零进化(Scratch + Online Evolution)在 HotpotQA 上超越人工专家图;在线进化可修复初始缺陷的专家先验,在 MultiChallenge 上将成功率从 58.93% 恢复至 92.86%。 - **效率消融**:局部子图生成式指导在性能上优于全图 Raw 注入与全图生成式指导,同时在 ALFWorld 等任务上将 token 消耗降低 70.9%。 —- ### 6. 主要贡献 - 提出了 **Procedural Graph**,一种显式、可编辑的过程知识图表示,以 `(procedure, relation, procedure)` 三元组回答“下一步该做什么”。 - 提出了 **Generative PG Guidance**,将静态图与动态轨迹转化为每一步的情境化软指导。 - 开发了 **自进化闭环**,基于执行反馈自动优化图拓扑与属性,支持从零构建与专家先验修复。 - 在多样化任务与模型上验证了 PG 相对于现有记忆基线的一致性能优势。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yuxing Lu,Yicheng Chen,Shanchan Wu,Sercan Ö. Arık

Categories:

PDF URL: https://arxiv.org/pdf/2609.09153.pdf

Arxiv URL: https://arxiv.org/abs/2609.09153

Arxiv ID: 2609.09153

CoolPaper URL: https://papers.cool/arxiv/2609.09153

Published: 2026-09-10T01:27:08.102Z

Updated: 2026-09-10T01:27:08.102Z


20. Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks

Abstract:Large Language Models demonstrate remarkable proficiency in static reasoning, yet training them as autonomous agents through Reinforcement Learning (RL) for long-horizon tasks is often hindered by severe reward sparsity. While conventional \textit{agent-side warming} up via supervised fine-tuning (SFT) can alleviate this, it is frequently limited by data scarcity and constrained exploration. To address this, we propose a paradigm shift to \textit{environment-side adaptation} by constructing \textbf{F}eedback-\textbf{E}nriched \textbf{E}nvironments (\textbf{FEEs}). Through a pilot study, we establish a feedback design strategy that reformulates environments by transitioning from action guidance to observation enrichment during the later stages of both intra-episode exploration and inter-episode evolution. Large-scale experiments on SciWorld and BFCL benchmarks using various Qwen3 model scales and RL algorithms such as GRPO, GSPO, and DAPO demonstrate that FEEs consistently yield performance improvements over standard settings. Furthermore, our analysis reveals that training with FEEs \textbf{(1)} stabilizes training dynamics by reducing entropy volatility, \textbf{(2)} facilitates proactive state-space exploration in difficult tasks, \textbf{(3) }ensures the internalization of environmental guidance into policy weights rather than acting as a mere inference-time prior, and \textbf{(4) }identifies intra-group feedback consistency as a critical boundary for stable optimization.

中文摘要

摘要:大型语言模型在静态推理方面表现出显著的能力,但通过强化学习(RL)将其训练为自主代理以完成长期任务,往往受到奖励稀疏的严重阻碍。虽然传统的\textit{代理端预热}(通过监督微调SFT)可以缓解这一问题,但它通常受到数据稀缺和探索受限的限制。为了解决这一问题,我们提出了一种向\textit{环境端适应}的范式转变,即构建\textbf{反馈增强环境(FEEs)}。通过一项试点研究,我们建立了一个反馈设计策略,在同一回合内的探索后期和回合间演化阶段,将环境从动作指导转变为观测丰富。使用不同Qwen3模型规模和诸如GRPO、GSPO及DAPO等RL算法,在SciWorld和BFCL基准上的大规模实验表明,FEEs在标准设置下持续提升性能。此外,我们的分析显示,使用FEEs训练\textbf{(1)}通过减少熵波动稳定训练动态,\textbf{(2)}促进在困难任务中主动探索状态空间,\textbf{(3)}确保环境指导内化到策略权重中,而非仅作为推理时的先验,\textbf{(4)}识别组内反馈一致性作为稳定优化的关键边界。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决**长程任务(long-horizon tasks)中基于强化学习(RL)训练大语言模型(LLM)智能体所面临的严重奖励稀疏(reward sparsity)与探索效率低下问题**。 具体而言,论文针对的核心挑战包括: - **奖励稀疏导致学习信号消失** 在长程交互任务(如科学实验模拟、多轮工具调用)中,智能体往往需要执行数十步交互才能获得最终奖励。由于成功轨迹极为罕见,智能体极易陷入零奖励轨迹,导致梯度消失,无法获得有效的学习信号。 - **传统智能体侧预热的瓶颈** 现有方法通常依赖监督微调(SFT)在专家轨迹上预热智能体,以提升获得初始正奖励的概率。然而,该方法存在显著局限:一方面,收集大规模 ground-truth 专家轨迹成本高昂且难以扩展;另一方面,过度优化 SFT 目标会过度约束智能体的行为空间,抑制后续 RL 阶段所必需的有效探索。 - **探索困境与策略崩溃** 在标准稀疏反馈环境下,智能体缺乏有效探索能力,难以发现高奖励状态;同时,训练过程中策略熵往往过早崩溃,导致训练动态不稳定。 为解决上述问题,论文提出了一种**范式转变**:不再专注于寻找更好的智能体初始化(agent-side warming up),而是转向**环境侧适应(environment-side adaptation)**,通过系统性地丰富和多样化环境反馈信号,构建**反馈增强环境(Feedback-Enriched Environments, FEEs)**。具体策略包括: - **反馈内容设计**:区分两种反馈类型—— - **动作引导(Action Guidance, AG)**:提供即时的下一步动作提示,压缩搜索空间; - **观察增强(Observation Enrichment, OE)**:补充额外的状态语义信息,缓解部分可观测性。 - **反馈时机设计**:在**单条轨迹内的探索(intra-episode)**和**跨训练周期的演化(inter-episode)**两个时间尺度上动态调整反馈策略——早期提供动作引导以启动探索,后期转向观察增强以促进策略精细化。 通过在 SciWorld 和 BFCL 基准上的大规模实验,论文验证了 FEEs 能够稳定训练动态、促进状态空间探索,并将环境指导内化为策略权重,从而系统性地提升长程任务中的 RL 训练效果。 Q2: 有哪些相关研究? 这篇论文的相关研究主要集中在以下两个维度: ## 1. 面向长程任务的强化学习(RL for Long-horizon Tasks) 当前研究致力于构建能够处理动态、复杂现实世界环境的自主智能体,这些任务通常具有长程特性,需要数十步交互才能完成目标。相关研究涵盖: - **多模态与交互式任务**:包括工具调用(Tool Manipulation)Lei et al., 2025; Trivedi et al., 2024; Wang et al., 2025b; Yao et al., 2024、网页导航(Web Navigation)Koh et al., 2024; Rawles et al., 2025; Xie et al., 2024; Yao et al., 2022; Zhou et al., 2024b 以及代码执行与终端操作(Code Execution)Merrill et al., 2026b; Ouyang et al., 2025; Yang et al., 2025b。 - **基于 RL 的智能体优化**:近年来,强化学习成为提升智能体能力的核心方向,包括 GRPO、DAPO、GSPO 等群体相对优化算法 Feng et al., 2025b; Hu et al., 2026; Jin et al., 2025a; Wang et al., 2025c; Zhang et al., 2025e,旨在通过迭代环境反馈优化策略。 - **监督微调(SFT)预热及其局限**:现有工作普遍采用专家轨迹上的 SFT 作为 RL 前的热身阶段,以提升初始正奖励概率 Jin et al., 2025b; Li et al., 2025b; Lu et al., 2025; Wei et al., 2025。然而,高质量轨迹数据稀缺且难以扩展,过度优化 SFT 目标还会约束行为空间、抑制探索潜力 Kang et al., 2025。 与上述研究不同,本文提出的 FEEs 是一种**与智能体侧优化算法正交**的互补框架,通过环境侧适配缓解数据稀缺与探索受限问题。 ## 2. 面向智能体演化的环境(Environments for Evolving Agents) 随着 LLM 向自主决策智能体演进,交互式、类 Gym 环境已成为标准训练基础设施: - **交互式环境基础设施**:近期工作致力于将各类软件转化为智能体环境,或构建统一的视觉/工具使用环境 Aggarwal et al., 2026; Li et al., 2026; Liu et al., 2025a; Meng et al., 2026; Stojanovski et al., 2025。 - **从数据扩展到环境扩展**:研究焦点正从静态数据集的规模扩展 Wang et al., 2023; Xu et al., 2024 转向交互环境的复杂度与多样性扩展 Fang et al., 2025; Gandhi et al., 2026; Song et al., 2026; Tu et al., 2026。 - **语言提示作为脚手架(Scaffolding)**:在数据扩展时代,大量研究通过引入语言提示或难度自适应提示来调节任务难度、缓解奖励稀疏问题 Huang et al., 2025; Li et al., 2025a; Zhang et al., 2025a,c,d。 本文指出,在**环境扩展**的新时代,如何系统性地重构多轮动态环境以促进智能体演化仍相对未被充分探索。不同于简单的提示工程,FEEs 通过系统化的反馈内容(动作引导 vs. 观察增强)与反馈时机(episode 内 vs. 训练周期内)设计,为环境侧适配提供了通用策略。 Q3: 论文如何解决这个问题? 论文通过**环境侧适应(environment-side adaptation)**范式解决长程任务中RL训练面临的奖励稀疏与探索低效问题,核心在于构建**反馈增强环境(Feedback-Enriched Environments, FEEs)**。具体解决方案可分为以下层面: ### 1. 核心范式转变:从预热智能体到重构环境 不同于传统方法通过监督微调(SFT)在专家轨迹上预热智能体,该研究提出直接干预环境反馈信号。通过富化函数 E 将标准观察 o_t 映射为增强观察 o_t^+ = E(o_t, h_t) ,形成新环境 e_φ^+ = (G, S, A, O^+, T, R) 。智能体在该环境中交互时,其动作分布被隐式重塑,从而在不修改智能体初始参数的前提下降低任务难度、鼓励轨迹多样性。 ### 2. 反馈设计的双维度策略 论文系统性地研究了反馈设计的两个关键维度: - **反馈内容(What)**: - **动作引导(Action Guidance, AG)**:在环境反馈中嵌入程序性提示,直接建议即时下一步有效动作。这作为一种软干预,能够剪枝庞大的搜索空间,防止智能体陷入冗余探索循环(例如提示“进入实验室”)。 - **观察增强(Observation Enrichment, OE)**:在原始观察中补充额外语义信息,缓解POMDP固有的部分可观测性。这使智能体能够识别隐藏状态并执行补救动作,而非盲目猜测(例如提示“阴极仍未通电”)。 - **反馈时机(When)**: - **单条轨迹内探索(Intra-episode)**:分析在轨迹的初始阶段还是后期步骤引入反馈更有效。 - **跨训练周期演化(Inter-episode)**:分析在训练生命周期的早期(能力有限时)还是后期(策略较熟练时)引入反馈更有效。 ### 3. 最优富化策略:AG-Early & OE-Late 通过试点实验,论文确立了一项通用反馈设计原则: - **早期使用动作引导(AG-Early)**:在轨迹初始步骤和训练早期提供动作引导。此阶段智能体尚未掌握基础导航能力,AG通过显式剪枝组合搜索空间有效启动探索。 - **后期切换至观察增强(OE-Late)**:在轨迹后期步骤和训练后期引入观察增强。此时智能体已具备基础策略,能够解释额外语义信息;OE在此阶段发挥更大效力,支持高级策略精细化。 实验表明,将两者结合的混合策略(如前100训练步使用AG-Early,后100步切换为OE-Late)显著优于单独使用任一种反馈方式。 ### 4. 跨基准与跨算法的系统验证 基于上述策略,研究在两大基准上系统化构建了FEEs: - **SciWorld**:AG实现为具体有效动作提示;OE实现为实时任务进度跟踪。 - **BFCL-v3 Multi-Turn**:AG实现为附加在用户查询后的建议动作;OE实现为扩展的工具返回内容(如增加当前绝对路径、执行状态指示器等)。 在训练设置上,采用Qwen3-4B/8B作为骨干,结合GRPO、DAPO、GSPO等代表性RL算法进行训练。FEEs在各类模型规模与算法组合下均带来一致的性能提升,平均提升达2.82%。 ### 5. 关键训练约束:组内反馈一致性 论文进一步发现,在基于群体采样的智能体RL中,**组内反馈一致性(intra-group feedback consistency)**是稳定优化的前提。若同一采样组内的不同轨迹被随机分配不同的富化反馈变体,会严重扭曲优势估计,导致训练剧烈波动。因此,FEEs要求组内所有智能体在针对同一状态时接收完全一致的反馈信号。 Q4: 论文做了哪些实验? 论文围绕**反馈增强环境(FEEs)**的有效性验证与机理分析,设计了四个层次的实验: --- ### 1. 试点研究:反馈设计策略验证 **目的**:确定最优的反馈内容与时机组合。 - **设置**:在 **SciWorld** 上构建多种富化变体,包括动作引导早期(AG-Early)、动作引导后期(AG-Late)、观察增强早期(OE-Early)、观察增强后期(OE-Late),以及混合策略(AG-Early & OE-Late)。 - **模型与算法**:Qwen3-4B-Thinking-2507,使用 **GRPO** 训练 200 步。 - **干预方式**:在轨迹的指定步骤区间(1–3 步为早期,6–10 步为后期)以 0.5 概率注入富化反馈。 - **评估**:每 5 步在**标准环境**上测试任务成功率,确保测试任务与训练任务严格不重叠。 **关键发现**:混合策略(先 AG-Early 后 OE-Late)显著优于单一策略,确立了“早期动作引导、后期观察增强”的通用设计原则。 --- ### 2. 主实验:大规模跨基准与跨算法验证 **目的**:检验 FEEs 在不同模型规模、RL 算法和基准上的普适性。 - **基准**: - **SciWorld**:科学实验文本交互环境; - **BFCL-v3 Multi-Turn**:多轮工具调用与对话环境(涵盖 Base、Long Context、Miss Func、Miss Param 等子任务)。 - **模型**:Qwen3-4B、Qwen3-8B。 - **RL 算法**:GRPO、DAPO、GSPO。 - **训练配置**:共 200 步;前 100 步使用 AG-Early,后 100 步切换为 OE-Late;富化概率为 0.5。 - **对照组**:与标准环境(Standard Env)训练对比,并引入 GPT-5.4、Kimi-K2-Thinking、Qwen3-235B-Thinking 等闭源模型作为性能上界。 **关键结果**(见 Table 1): - FEEs 在所有模型与算法组合上均带来一致的性能提升,平均绝对提升达 **2.82%**; - 例如,Qwen3-8B 配合 GSPO 在 SciWorld 上从 53.91% 提升至 60.94%;Qwen3-4B 配合 GRPO 在 BFCL-Base 上提升达 **10%**; - 同时也观察到在需要质疑输入缺失的场景(如 Miss Param、Miss Func)中,FEEs 可能导致轻微性能回退。 --- ### 3. 训练动态与稳定性分析(Exp 1) **目的**:探究 FEEs 对策略熵与训练稳定性的影响。 - **设置**:在 SciWorld 上跟踪 Qwen3-4B 训练过程中的**策略熵(policy entropy)**,对比标准环境与 FEEs,并在**有无显式熵正则化**两种条件下进行。 - **结果**(见图 3): - 无熵正则化时,标准环境约在 250 步发生熵崩溃(急剧降至零),而 FEEs 在 300 步内保持稳定; - 有熵正则化时,标准环境约在 130 步崩溃,FEEs 可维持稳定近 200 步。 - **结论**:FEEs 作为稳定器,能显著降低梯度波动与策略崩溃风险。 --- ### 4. 状态空间探索分析(Exp 2) **目的**:验证 FEEs 是否促进更有效且持久的状态探索。 - **训练视角**:在 BFCL 上监控 Qwen3-4B 训练过程中每个采样环境的平均成功率(avg@8),以热力图形式展示不同难度环境的探索动态。 - **评估视角**:将 400 个环境按标准环境模型的成功率划分为**困难**(

0, 0.33
)、**中等**(
0.33, 0.66
)、**简单**(
0.66, 1
)三档,评估 FEE 训练模型在**标准环境**上的泛化表现。 - **结果**(见图 4): - FEE 训练后期出现更多高成功率环境(绿色区域),而基线仍被大量失败环境(红色)主导; - 在困难环境上,FEE 训练模型比基线提升 **4.3%**,表明其学会了更主动的探索策略,且该能力可迁移至无富化反馈的标准环境。 —- ### 5. 反馈内化验证(Exp 3) **目的**:检验富化信息是被内化为策略权重,还是仅作为推理时的临时提示。 - **设置**:基于 BFCL 中的 GorillaFileSystem 环境,针对 `cd`、`mkdir`、`touch`、`rm`、`rmdir`、`mv`、`cp`、`echo` 等操作设计**多项选择探针问题**。每个问题要求模型在“原始工具输出”(选项 A)与“包含增强信息(如当前绝对路径)的输出”(选项 B)之间进行概率预测。 - **监控方式**:在 BFCL 训练后期每 10 步施加探针,跟踪 P(B) - P(A) 的演化。 - **结果**(见图 5): - 标准环境训练模型始终偏向原始输出(概率差接近零); - FEE 训练模型随训练进行,对增强选项的分配概率持续上升。 - **结论**:富化反馈被真正**内化到策略权重**中,而非仅作为推理时的先验提示。 —- ### 6. 组内反馈一致性边界分析(Exp 4) **目的**:探究采样组(rollout group)内部反馈应保持一致还是允许随机多样。 - **设置**:在 SciWorld 上使用 GRPO 训练 Qwen3-4B,对比两种配置: - **组内一致**:同组所有轨迹在相同状态下接收完全相同的富化反馈; - **组内随机**:同组内不同轨迹随机分配不同反馈变体。 - **结果**(见图 6): - 组内一致配置下,验证成功率稳步上升; - 组内随机配置导致训练剧烈震荡,出现多次性能骤降与尖峰。 - **结论**:**组内反馈一致性**是稳定优化的关键前提,过度的组内随机性会引入有害噪声,扭曲优势估计。 Q5: 有什么可以进一步探索的点? 基于论文的实验发现与局限性讨论,以下是可以进一步探索的研究方向: —- ### 1. 自动化与自适应的反馈调度策略 当前 FEEs 中从动作引导(AG)到观察增强(OE)的切换时机(如训练第 100 步)以及 episode 内早期/晚期的界定均为**手动预设**。未来可探索基于训练动态指标(如策略熵、当前成功率、梯度方差或有效探索率)的**自适应切换机制**,甚至将反馈调度建模为一个独立的元控制问题,从而消除对手动超参数的依赖。 —- ### 2. 在更具挑战性与多样化的环境中的验证 论文指出,FEEs 在 **AppWorld** 等极度稀疏奖励的长程环境中仍无法使模型摆脱零奖励轨迹。这提示需要: - 在更广泛的智能体基准(如 web 导航、复杂软件操作、具身智能任务)上验证策略的**泛化边界**; - 针对“极度稀疏 + 长程”场景设计**更强的环境适应机制**,例如多层级的课程式环境重构或基于世界模型的中间奖励生成。 —- ### 3. 反馈生成机制的自动化与智能化 目前 FEEs 的反馈内容依赖于规则或模板(如 SciWorld 的任务进度追踪、BFCL 的路径信息注入)。未来可研究如何利用**大语言模型自动生成**上下文相关的反馈信号,动态决定“在何时、以何种粒度、提供何种信息”,从而将环境工程从手工设计扩展到可扩展的自动化流水线。 —- ### 4. 富化反馈的逐步消退与迁移机制 论文观察到 FEEs 在部分任务(如 Miss Param、Miss Func)中导致智能体过度依赖环境提示、削弱质疑能力。这提示需要设计**反馈消退(scaffold fading)**机制:随着训练进行,逐步降低反馈的频次与信息量,或引入标准环境与富化环境的混合采样比例调度,以实现从“有辅助”到“无辅助”的平滑迁移,避免对增强反馈的过度拟合。 —- ### 5. 组间多样性与组内一致性的精细权衡 论文揭示了**组内反馈一致性(intra-group consistency)**对稳定优化的重要性,但组间(inter-group)反馈的多样性是否有助于提升泛化仍属未知。可进一步探索: - 在保持组内一致的前提下,通过组间多样化反馈来增强策略鲁棒性; - 从理论上分析组内噪声对群体相对优势估计 Ak 方差的影响,从而量化最优的反馈分布边界。 —- ### 6. 与智能体侧方法的深度融合 FEEs 作为环境侧方法与智能体侧的 SFT 预热、RL 算法是正交的。未来可系统研究: - **SFT + FEEs 的联合最优策略**:例如,在 FEEs 中进行 SFT 预热是否比在标准环境中更有效; - 将富化反馈的信号直接融入**策略网络架构**(如通过额外的反馈编码器)或**价值函数**设计,而非仅作为观测文本的修改。 —- ### 7. 理论分析:FEEs 对优化动态的影响 论文实证发现 FEEs 能稳定策略熵、减少梯度波动,但缺乏理论支撑。可进一步从理论上刻画: - FEEs 如何影响策略梯度估计的方差; - 富化观测空间 O^+ 对有效探索系数(如覆盖半径或状态访问熵)的定量改变; - 在群体相对优化框架下,反馈富化对优势函数 A_k 分布与收敛速率的数学影响。 —- ### 8. 反馈模态的扩展与最优信息结构 除动作引导与观察增强外,可探索其他反馈模态,例如: - **结果预判(outcome forecasting)**:在每一步提供对最终成功概率的隐式估计; - **对比性反馈(contrastive feedback)**:展示当前轨迹与成功轨迹的差异; - 从信息论角度研究,在部分可观测 POMDP 中,**最小充分统计量**形式的最优反馈应满足何种结构。 —- ### 9. 多智能体与协作场景下的环境富化 当前 FEEs 聚焦于单智能体环境。在多智能体协作或竞争任务中,反馈设计可能涉及通信信道的富化、对手建模信息的注入等。如何为多个智能体设计一致且不冲突的富化信号,是值得探索的方向。 —- ### 10. 反馈效应的因果归因与反事实分析 论文通过探针实验验证了反馈被内化,但未区分“哪些具体反馈信号对成功起到了决定性作用”。未来可采用**因果推断**或**反事实轨迹分析**,量化特定环境提示对策略改进的边际贡献,从而指导更精确的反馈投放。 Q6: 总结一下论文的主要内容 该论文针对**长程任务中基于强化学习(RL)训练大语言模型(LLM)智能体所面临的严重奖励稀疏与探索低效问题**,提出了一种从“智能体侧预热”到“环境侧适应”的范式转变,核心贡献与内容可概括如下: —- ### 1. 研究背景与动机 当前 LLM 在静态任务(如数学推理、代码生成)上表现卓越,但在作为自主智能体处理长程交互任务(如科学实验、多轮工具调用)时,RL 训练因**奖励稀疏**而举步维艰:智能体极易陷入零奖励轨迹,导致梯度消失、学习信号匮乏。传统方法依赖监督微调(SFT)在专家轨迹上预热智能体,但面临数据收集成本高昂与过度约束探索潜力的双重瓶颈。为此,论文提出不修改智能体初始化,而是**系统性地重构环境反馈信号**,构建更适宜训练的环境。 —- ### 2. 核心方法:反馈增强环境(FEEs) 论文将环境定义为目标驱动的部分可观测马尔可夫决策过程(POMDP),并通过富化函数 E 将标准观察 o_t 映射为增强观察 o_t^+ = E(o_t, h_t) ,形成新环境 eφ^+ 。 围绕“提供什么信息”与“何时提供”两个维度,论文设计了系统化的反馈策略: - **反馈内容**: - **动作引导(Action Guidance, AG)**:提供即时的下一步有效动作提示,直接剪枝搜索空间; - **观察增强(Observation Enrichment, OE)**:补充隐藏状态语义信息(如任务进度、执行上下文),缓解部分可观测性。 - **反馈时机**(涵盖单条轨迹内与跨训练周期两个尺度): - **AG-Early**:在轨迹早期步骤与训练早期阶段提供动作引导,以启动有效探索; - **OE-Late**:在轨迹后期与训练后期切换为观察增强,支持策略精细化与高级推理。 实证确立的最优策略为**混合调度**:先 AG-Early 后 OE-Late。 —- ### 3. 实验验证与主结果 论文在 **SciWorld**(科学实验文本环境)与 **BFCL-v3 Multi-Turn**(多轮工具调用基准)上开展了大规模实验,覆盖 **Qwen3-4B/8B** 模型与 **GRPO、DAPO、GSPO** 等多种 RL 算法。 - **性能提升**:FEEs 在所有模型规模、算法与基准组合上均带来一致的性能改进,平均绝对提升达 **2.82%**。例如,Qwen3-4B 配合 GRPO 在 BFCL-Base 上提升达 10%;Qwen3-8B 配合 GSPO 在 SciWorld 上从 53.91% 提升至 60.94%。 - **RL 的训练效果**:经 RL 训练的开源模型(4B/8B)能够逼近甚至超越部分闭源大模型(如 Qwen3-235B-Thinking),验证了 RL 在智能体任务中的有效性。 - **潜在副作用**:在需要质疑输入缺失(如 Miss Param、Miss Func)的任务中,过度依赖主动引导的 FEEs 可能导致智能体执行倾向过强、澄清能力略降。 —- ### 4. 深入分析:FEEs 的作用机制 除性能指标外,论文通过四项分析揭示了 FEEs 的内在影响: - **训练稳定性**:FEEs 显著延迟或避免了策略熵的过早崩溃。无论是否施加显式熵正则化,FEEs 均表现出更平滑的收敛动态。 - **状态空间探索**:FEEs 训练的智能体在困难环境(hard environments)上的成功率比基线提升 **4.3%**,且该探索能力在移除富化反馈的标准环境中依然有效,表明策略习得了主动的探索行为。 - **反馈内化**:通过 GorillaFileSystem 上的多项选择探针实验证实,FEEs 的增强信息被**真正内化为策略权重**,而非仅作为推理时的临时提示。 - **组内一致性边界**:在基于群体采样的 RL 中,同组(rollout group)内所有轨迹必须接收**一致的富化反馈**。组内随机多样性会严重扭曲优势估计,导致训练剧烈震荡。 —- ### 5. 主要贡献 - 提出了**环境侧适应**的新范式,开发了系统化的 FEE 构建策略,优化了反馈内容与时机; - 在多个基准、模型规模与 RL 算法上验证了 FEEs 的普适性与一致有效性; - 揭示了 FEEs 在稳定训练、促进探索、内化知识与约束优化边界方面的作用机理。 —- ### 6. 局限性与展望 - **超参数敏感性**:早期/晚期的切换点等关键参数仍为手动设定,其自适应调度机制有待研究; - **基准覆盖**:当前验证集中于 SciWorld 与 BFCL,在更具挑战性的环境(如 AppWorld)中 FEEs 仍未能突破零奖励困境; - **泛化边界**:在极度稀疏的长程设定中,需探索更丰富的环境适应策略以实现有效训练。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Hongbang Yuan,Zhuoran Jin,Yixin Cao

Categories:

PDF URL: https://arxiv.org/pdf/2609.08404.pdf

Arxiv URL: https://arxiv.org/abs/2609.08404

Arxiv ID: 2609.08404

CoolPaper URL: https://papers.cool/arxiv/2609.08404

Published: 2026-09-10T01:27:10.442Z

Updated: 2026-09-10T01:27:10.442Z