HuggingFace Papers 2026-09-16
数据来源:HuggingFace Papers
Latest Papers
1. Vidu S2: Real-Time Interactive, Editable, and Spatial Video Generation
Abstract:We present Vidu S2, which comprises Vidu S2-Avatar, a real-time interactive digital-character model, and Vidu S2-Editing, a real-time video editing model. Moreover, we explore the feasibility of real-time spatial video generation for both Vidu S2-Avatar and Vidu S2-Editing. Compared with Vidu S1, Vidu S2-Avatar supports real-time 720p video generation, generation with dynamic references that can be updated at any moment, and stronger instruction following, such as dancing. Vidu S2-Editing supports editing a video stream in real time, including style rendering, clothing replacement, character replacement, and background replacement. Experiments show that Vidu S2 outperforms all baselines. A playable online demo is available at this https URL.
中文摘要
摘要:我们提出了 Vidu S2,它包含 Vidu S2-Avatar,一个实时互动的数字角色模型,以及 Vidu S2-Editing,一个实时视频编辑模型。此外,我们探索了 Vidu S2-Avatar 和 Vidu S2-Editing 的实时空间视频生成的可行性。与 Vidu S1 相比,Vidu S2-Avatar 支持实时 720p 视频生成、可随时更新的动态参考生成,以及更强的指令执行能力,例如跳舞。Vidu S2-Editing 支持对视频流进行实时编辑,包括风格渲染、服装替换、角色替换和背景替换。实验表明,Vidu S2 优于所有基线模型。可在线体验的演示版本可通过此 https URL 获取。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文致力于解决\*\*实时交互式视频生成与编辑\*\*中的核心瓶颈问题。现有主流视频生成模型(如Sora、Veo、Wan、Seedance等)普遍采用离线扩散范式,需经过多步去噪才能输出完整视频,导致用户只能被动等待,无法主动交互。这种范式难以满足面对面交流、直播、游戏等需要即时视觉反馈的场景需求。 具体而言,论文围绕以下四个层面展开问题定义与求解: ### 1. 实时交互式数字人生成的质量与能力边界 论文指出,虽然前作Vidu S1已初步实现实时流式生成,但存在显著局限: - \*\*分辨率受限\*\*:仅支持540p实时输出,难以满足高清视觉体验; - \*\*参考图像静态\*\*:流一旦开始,定义角色外观的参考图即固定,用户无法在交互过程中更换角色、服装或手持物品; - \*\*动作范围狭窄\*\*:主要局限于说话头部(talking-head)场景,难以处理大幅度躯体运动(如跳舞); - \*\*长时序漂移\*\*:逐块自回归生成导致误差累积,引发身份漂移、背景畸变或视觉崩溃。 为此,Vidu S2-Avatar旨在实现\*\*720p实时生成\*\*、\*\*任意时刻动态参考更新\*\*、\*\*复杂指令跟随(如舞蹈)\*\*以及\*\*长时序稳定性\*\*。 ### 2. 实时视频流编辑的缺失 现有视频编辑模型多为离线处理,无法对持续输入的视频流进行即时修改。论文提出Vidu S2-Editing,以解决以下实时编辑需求: - 风格迁移(如将实拍视频转为动漫或水墨风格); - 虚拟试穿(实时更换衣物并保持布料物理合理性); - 角色替换(在不改变动作与镜头的前提下替换主体身份); - 背景替换(实时切换场景并保持前景一致性)。 关键难点在于\*\*保持与输入视频完全一致的时序与运动\*\*,同时让参考外观贯穿整个流式输出。 ### 3. 实时空间(立体)视频生成与编辑的可行性 为增强沉浸感,论文进一步探索将实时单目视频扩展为适配VR头显的空间视频: - \*\*生成侧\*\*:将Vidu S2-Avatar的单目流实时转换为同步的左右眼视图; - \*\*编辑侧\*\*:支持对单目输入先编辑再转换,或直接对立体输入进行联合编辑后再分离视图。 该场景对\*\*分辨率\*\*和\*\*端到端延迟\*\*提出了比单目视频更严苛的要求,因为头显视角下任何延迟或画质下降都会直接破坏沉浸体验。 ### 4. 低成本GPU上的实时推理效率 论文强调,上述能力必须在\*\*普通消费级GPU\*\*上满足实时帧率(25–42 FPS)。为此需要解决: - 注意力机制的高计算开销; - 线性层与内存访问的带宽瓶颈; - 多模块(VAE编码器、主干网络、Refiner、VAE解码器)在流式管线中的资源调度与延迟隐藏。 综上,该论文的核心学术与工程目标是:\*\*在严格满足实时性约束的前提下,将单目/立体视频生成与编辑的清晰度、交互自由度、动作复杂度及长时序一致性推向新的边界\*\*。 Q2: 有哪些相关研究? 与 Vidu S2 密切相关的研究工作可划分为以下七个方向,这些方向共同构成了实时交互式视频生成与编辑的技术背景: --- ### 1. 离线高保真视频生成 此类模型采用多步扩散范式,是 Vidu S2 试图超越的“离线、一次性”生成基线: - \*\*Sora\*\*
1
:OpenAI 的视频生成世界模拟器; - **Veo**
2
:Google DeepMind 的文本到视频生成系统; - **Wan**
3
与 **Seedance**
4
:大规模开源/商业视频生成模型。 —- ### 2. 实时、流式与交互式视频生成 该方向直接面向 Vidu S2-Avatar 的核心场景——低延迟、可交互、长时段的流式生成: - **Vidu S1**
5, 14
:Vidu S2 的直接前身,首次实现基于 TurboDiffusion
6
与 TurboServe
7
的 540p 实时交互生成; - **Self-Forcing**
8
:通过条件化模型自生成块来弥合训练-测试差距,但梯度不回传历史; - **Diffusion Forcing**
9
:向历史状态注入噪声以增强自回归鲁棒性; - **OmniForcing**
45
、**Odyssey-2**
46
、**LongLive**
47
、**SWIFT**
48
、**IAMFlow**
49
、**SoulX-FlashTalk**
50
、**AptAvatar**
51
、**Live Avatar**
52
、**AvatarForcing**
53
、**Hallo-Live**
54
:各类实时或长视频数字人生成系统; - **PixVerse R1**
43
与 **HappyOyster**
44
:商业化的实时世界模型产品。 —- ### 3. 指令引导与参考引导的视频编辑 此类工作为 Vidu S2-Editing 提供了任务定义与模型基线,涵盖离线模型与流式编辑尝试: - **Bernini**
30
、**SCAIL-2**
31
、**Wan2.1 VACE**
32
、**SAMA-14B**
33
、**CoinVE-Edit**
34
:开源视频编辑模型,用于生成训练数据或作为基线对比; - **Kiwi-Edit**
41
、**VInO**
56
、**OmniWeaving**
57
:支持指令与参考图引导的编辑; - **LiveEdit**
58
、**StreamDiffusionV2**
60
、**JoyAI-Video-Edit**
59
、**XMax-X2.0**
61
、**Decart-Lucy2.5**
62
:面向实时或流式视频编辑的系统; - **虚拟试穿**:**OOTDiffusion**
64
、**IDM-VTON**
65
、**StableVITON**
63
、**ViViD**
42
、**CatV2TON**
66
。 —- ### 4. 训练策略:分布蒸馏、强制学习与偏好优化 Vidu S2 的方法论建立在以下训练与对齐技术之上: - **Distribution Matching Distillation (DMD)**
10–13
:一步/少步扩散模型蒸馏框架; - **Diffusion DPO**
15
:基于直接偏好优化的扩散模型对齐; - **Streaming NFT**
16
(DiffusionNFT):面向流式生成的在线扩散强化学习; - **Teacher Forcing / Diffusion Forcing**
9
:混合使用真值历史与加噪历史进行自回归训练。 —- ### 5. 高效推理与注意力机制加速 为实现消费级 GPU 上的实时推理,Vidu S2 吸纳了以下硬件感知加速研究: - **SageAttention** 系列
18–22
:8-bit/4-bit/fp4 精度的高效注意力推理与训练; - **SpargeAttention**
23, 24
:训练无关及可训练稀疏注意力; - **Sparse-Linear Attention (SLA)**
25, 26
:面向 Diffusion Transformer 的线性稀疏注意力; - **低比特线性层加速**
27
:per-block W8A8 GEMM; - **上下文并行**
28
:DeepSpeed Ulysses 风格的多 GPU 序列并行。 —- ### 6. 空间(立体)视频生成 将单目视频 Q3: 论文如何解决这个问题? 论文通过 **Vidu S2** 统一框架解决上述问题,该框架包含两个核心模型——实时交互式数字人模型 **Vidu S2-Avatar** 与实时视频编辑模型 **Vidu S2-Editing**,并围绕训练策略、数据工程、模型架构、推理基础设施与智能体交互五个层面展开系统性设计。具体解决方案如下: —- ### 1. 核心训练策略:Self-Replay Forcing (SRF) 针对流式自回归生成中误差累积、训练-测试分布不匹配及跨块梯度截断问题,论文提出 **Self-Replay Forcing**: - **长程自回归 Rollout**:当前学生模型先执行一段Detached的流式自回归前向传播,生成完整轨迹 x(1:N)^0 ,该过程不参与梯度回传; - **独立重加噪**:对自生成轨迹的每个块按照 Diffusion Forcing 独立重新采样噪声,得到 x(1:N)^t ; - **梯度可贯通回放**:在单次因果前向传播中重放整个加噪轨迹,所有回放段保留于同一计算图内,使得后续段的损失可反向传播至前面段,从而学习跨块时序依赖,同时避免梯度穿过原始Rollout带来的内存与稳定性问题。 优化目标为:
L(SRF) = L(DMD)( fθ^(causal)(x(1:N)^t, t, r, c(1:N)) ) + L(perc)( fθ^(causal)(x(1:N)^t, t, r, c(1:N)) )
其中 L(DMD) 为分布匹配蒸馏损失, L_(perc) 为感知正则化,用于缓解模式崩溃。 —- ### 2. 混合强制与偏好优化 为提升流式生成的鲁棒性与指令跟随能力,论文采用分阶段的训练流程: - **双向预训练**:先训练双向模型建立强视觉与运动先验。Vidu S2-Avatar 联合训练图像到视频(I2V)与参考到视频(R2V),并对每段施加段级别条件监督:
x(1:N)^0 = fθ^(bi)(x(1:N)^t, t, r, c(1:N))
Vidu S2-Editing 则采用**帧对齐注意力**,使目标帧仅与对应时间步的源帧交互,参考图则全局可见,确保运动同步。 - **因果适配**:将双向时序注意力替换为分块因果注意力掩码,并混合 **Teacher Forcing**(使用干净真值历史)与 **Diffusion Forcing**(使用加噪历史)进行训练:
x0^i = fθ^(causal)(x(t_i)^i, t_i, r, c_i, x(τ_i)^(<i), τ_i)
- **偏好优化**:在双向阶段使用 **Diffusion DPO** 提升视觉保真度与音视频同步;在流式阶段使用 **Streaming NFT**,基于 SRF 构造自生成轨迹进行奖励优化,直接对齐推理时的自回归分布。 —- ### 3. 超分辨率 Refiner 与非对称缓存调度 为在维持实时帧率(25–42 FPS)的同时将分辨率从 540p 提升至 **720p**,论文引入轻量级单步潜在空间 Refiner: - **潜在空间上采样**:对低分辨率输出 x_(i,0)^(LR) 执行空间上采样 U(·) 并加噪:
zi^(t_r) = (1-t_r) U(x(i,0)^(LR)) + t_r ε_i, quad ε_i sim N(0, I)
- **非对称缓存噪声**:主干网络关注**高噪声缓存** x(τ_B)^(<i) 以传播粗粒度运动与长时结构;Refiner 关注**低噪声高分辨率缓存** x(τ_R,HR)^( τ_R ),以恢复空间细节而不干扰时序轨迹。 —- ### 4. 数据工程与标注体系 论文重构了数据准备管线,以支撑高分辨率、复杂动作与实时参考更新: - **高清晰度选择**:建立多维度混合评估框架,综合分辨率、帧率、码率、纹理细节、边缘锐度与压缩伪影等指标,选取真正清晰的视频,而非仅依赖标称分辨率。 - **背景稳定化**:对包含平滑相机运动的人物视频(如舞蹈),通过前景遮罩与背景特征匹配估计几何变换,进行几何校正与裁剪,保留运动多样性的同时消除背景漂移。 - **时序有序密集标注**:采用按事件边界分段的时序密集字幕,明确描述动作的时间区间、因果与先后关系,替代原先的结构化字段描述,以降低响应延迟并提升动作转换一致性。 —- ### 5. 实时推理基础设施 为满足消费级 GPU 上的严格延迟要求,论文构建了端到端加速框架: - **分层混合注意力**:按层敏感度动态选择 **SageAttention**、**SpargeAttention** 或 **Sparse-Linear Attention (SLA)**,在精度敏感层保留计算精度,在非敏感层启用激进近似。 - **低比特线性加速**:实现 per-block W8A8 GEMM,通过细粒度缩放限制离群值影响,降低显存与计算延迟。 - **内核融合与 CUDA Graph**:将相邻操作(如 RMSNorm 与逐元素操作)融合为自定义 Triton/CUDA 内核;对稳定执行序列使用 CUDA Graph 捕获与回放,减少内核启动与同步开销。 - **多 GPU 上下文并行**:采用 Ulysses 风格上下文切分,并对通信张量进行量化,降低跨设备传输量。 - **模块间细粒度调度**:VAE 编码器、主干网络、Refiner 与 VAE 解码器沿共享时间线分时复用 GPU,消除静态资源分配导致的空闲等待。 —- ### 6. 智能体交互系统(Agentic System) 为支持用户在流中**任意时刻更新参考图像**(如更换手持物品、服装或背景),论文构建 VLM 智能体: - **提示生成**:根据用户指令与参考图生成结构化提示,保留用户未要求改变的细节(如“拿起杯子后保持手持状态”)。 - **视觉反馈**:按时间顺序审查生成帧,判断动作完成度,并据此调整后续提示,避免动作重复或状态遗漏。 - **参考图分类与融合**:自动识别参考图为手持物体、场景或服饰,并生成相应的过渡描述(如人物离场进入新场景、脱下并重新戴上配饰)。 —- ### 7. 实时空间视频生成与编辑 论文进一步将单目实时流扩展为适配 VR 头显的空间视频: - **生成侧**:Vidu S2-Avatar 的单目输出经深度估计与水平视差映射,以单目帧为中心视图向左右反向形变,经空洞填补与时序稳定后输出同步左右眼流。 - **编辑侧**:支持两种工作流——对单目输入先由 Vidu S2-Editing 实时编辑再转换视差;或将立体输入左右拼接为宽视频流进行联合编辑后再分离视图。 通过上述设计,Vidu S2 在保持实时性的同时,将分辨率、交互自由度、动作复杂度、长时序一致性与沉浸体验推向更高水平。 Q4: 论文做了哪些实验? 论文在第 5 章通过公开基准测试、内部人工偏好评估与定性案例研究三个层面,系统验证了 Vidu S2-Avatar 与 Vidu S2-Editing 的性能。实验设计与结果可归纳如下。 —- ### 1. 实验设置 #### 1.1 任务与基准 | 任务 | 公开基准 | 内部基准 | |———|—————|—————| | 流式数字人生成 | StreamAV-Bench
38
| 覆盖流式质量、长时稳定性、运行时更新、中断恢复、音视频同步、响应延迟与成本 | | 流式视频编辑 | OpenVE-Bench
39
、Sparkle-Bench
40
、RefVIE-Bench
41
、ViViD 试穿测试集
42
| 覆盖风格迁移、虚拟试穿、主体替换、背景替换;含 10 分钟级长时序片段 | #### 1.2 对比基线 - **数字人生成**:PixVerse R1、HappyOyster、OmniForcing、Odyssey-2、Self-Forcing、LongLive、SWIFT、IAMFlow、SoulX-FlashTalk、AptAvatar、Live Avatar、AvatarForcing、Hallo-Live,以及 Vidu S1、Runway、HeyGen。 - **视频编辑**:Bernini-R (1.3B/14B)、Kiwi-Edit 5B、VInO、OmniWeaving、LiveEdit、VACE 1.3B、JoyAI-Video-Edit、StreamDiffusionV2、XMax-X2.0、Decart-Lucy2.5,以及专门用于虚拟试穿的 StableVITO/OOTDiffusion/IDM-VTON/ViViD/CatV2TON 等。 #### 1.3 评估指标 - **数字人生成**:视觉美学 (VA)、视觉质量 (VQ)、制作质量 (PQ)、音频质量 (AQ)、音视频语义对齐 (AVAlign)、音视频同步误差 (AVSync,越低越好)、音频指令完成度 (AIF)、主体一致性 (SC)、背景一致性 (BC)、FVD、FID。 - **视频编辑**:全局风格 (GS)、背景变化 (BC)、全局/前景指令遵循 (Ins./FgIn.)、前景运动保持 (FgMo.)、背景动态 (BgDy.)、背景视觉质量 (BgVi.)、RefVIE 综合分、Joint Overall、虚拟试穿 VFIDI(越低越好)。 - **人工评估**:Good / Same / Bad (GSB) 成对偏好比较,由 20 名经过校准的专业评估员执行。 —- ### 2. 公开基准结果 #### 2.1 数字人生成:StreamAV-Bench Vidu S2-Avatar 在所有报告指标上均取得最优值: | 指标 | Vidu S2-Avatar | |———|————————| | VA ↑ | **0.687** | | VQ ↑ | **3.370** | | PQ ↑ | **7.138** | | AQ ↑ | **3.286** | | AVAlign ↑ | **0.353** | | AVSync ↓ | **0.617** | | AIF ↑ | **2.985** | | SC ↑ | **0.998** | | BC ↑ | **0.993** | 结果表明,Vidu S2-Avatar 在视觉吸引力、保真度、音频自然度、音视频同步、长时序身份与场景稳定性等维度均优于所有开源基线。 #### 2.2 视频编辑 **Sparkle-Bench**:Vidu S2-Editing 在 Overall (3.74)、全局指令 (4.00)、全局视觉质量 (3.34)、前景指令 (3.98)、前景运动 (4.00)、背景动态 (3.37) 与背景视觉质量 (3.76) 七项指标上全部排名第一。 **OpenVE & RefVIE**:Vidu S2-Editing 的 Joint Overall 为 **4.26**,超越最强离线基线 Bernini-R 14B (3.92)。在 OpenVE 中,Global Style (4.71)、Background Change (4.14) 与 Overall (4.42) 均最优;在 RefVIE 中,Overall (3.78) 优于流式基线 Decart-Lucy2.5。 **ViViD 虚拟试穿**:Vidu S2-Editing 的 VFIDI 为 **9.9515**,显著低于 CatV2TON (19.5131) 与 ViViD (21.8032),表明生成视频与参考分布的对齐程度更高。 —- ### 3. 补充人类偏好评估 (GSB) #### 3.1 数字人生成 - **持续时间分层评分**(10 s–90 s):Vidu S2-Avatar 在整体质量、一致性、视频质量、动作质量与情感表达五个维度上均保持最高评分,且随时间延长无明显衰减,表明长时序稳定性优势。 - **成对 GSB 对比**: - 与 Runway Character GWM-1 相比,整体质量偏好率达 85.7%,一致性优势达 85.7%(含 Same)。 - 与 PixVerse Image Avatar 和 HeyGen 相比,整体质量均获得 **100%** 偏好。 - 在动作质量、表情质量、语义遵循、音视频同步等维度上均呈现一致优势。 #### 3.2 视频编辑 在 150 组内部案例上与 Decart-Lucy2.5 和 XMax-X2.0 对比: - 整体质量、视频质量、时序一致性、语义遵循四项准则均优于两个商业基线。 - 平均时序一致性得分:Vidu S2-Editing (3.56) > Decart-Lucy2.5 (2.59) > XMax-X2.0 (1.67)。 —- ### 4. 定性案例研究 #### 4.1 Vidu S2-Avatar 长时序一致性 - **女性角色案例**:Vidu S2-Avatar 在化妆品展示与手部交互过程中保持了稳定的身份、发型、服饰、产品几何与手部结构;PixVerse 出现面部身份与身体比例漂移,Runway 出现头发与手指扭曲。 - **男性角色案例**:Vidu S2-Avatar 保持了眼色、发型、服装与面部结构;PixVerse 发生取景、发型与服饰漂移,Runway 出现眉毛扭曲。 #### 4.2 Vidu S2-Editing 四项编辑任务 - **风格迁移**(水彩/工笔画):Vidu S2-Editing 在改变笔触与色调的同时保留了面部布局、主体轮廓与姿态;XMax-X2.0 出现身份丢失或背景风格化失败,Decart-Lucy2.5 产生严重模糊与重影。 - **虚拟试穿**(白衬衫/牛仔装):Vidu S2-Editing 准确迁移参考服装并保留手部-衣物遮挡关系;基线出现伪影文字、图案错位、额外人物或服装替换失败。 - **主体替换**(真人/和服卡通角色):Vidu S2-Editing Q5: 有什么可以进一步探索的点? 基于论文的局限性与未来展望,以下方向值得进一步探索: —- ### 1. 全景空间视频与自由视角生成 论文第 4.3 节指出,当前实时空间视频为固定视角(fixed-view),用户无法自由转动头部探索场景。未来可将系统扩展为**全景空间视频(panoramic spatial video)**,支持 6-DoF 头部追踪与任意视角切换。这要求模型具备实时 3D 场景表征能力,而非仅依赖单目深度估计与视差映射。该能力可为实时生成的元宇宙(metaverse)提供支撑,使场景、角色与事件随用户交互即时变化,从而减少对传统 3D 建模、材质制作与动画调度的依赖。 —- ### 2. 极限分辨率与端到端延迟的联合优化 论文强调,VR 头显场景下空间视频需覆盖更大视场角,因而对**分辨率**和**延迟**的要求远高于普通单目实时生成。未来工作可探索: - 原生高分辨率流式生成,替代现有的低分辨率主干 + Refiner 级联架构; - 针对头显透传(camera-based passthrough)模式的毫秒级延迟约束,研究模型-系统协同设计,如自适应令牌剪枝、早期退出(early exiting)或神经渲染加速。 —- ### 3. 深度估计与立体合成的质量提升 当前空间视频生成采用轻量级的单目深度估计 + 水平视差 warping 策略(第 4.1 节),在深度不连续区域易产生空洞(holes)与伪影。未来可研究: - **原生双目/多目联合生成**:让模型直接输出同步的左右眼视图,而非事后转换,从根本上避免几何扭曲; - **实时深度补全与修复**:结合轻量生成式 inpainting 网络,在流式管线中填补遮挡暴露区域,提升立体舒适度。 —- ### 4. 物理交互与世界模型能力 现有系统主要支持音频、文本与参考图像作为交互模态。未来可引入**物理一致性约束**与**环境交互反馈**,例如: - 角色与生成场景中的物体进行物理 plausible 的接触、碰撞与操作; - 将 Vidu S2-Avatar 与实时物理引擎或 3D 场景图结合,使角色运动受环境几何约束,而非纯视觉驱动。 —- ### 5. 小时级长时序一致性与复杂叙事管理 尽管 Vidu S2-Avatar 在 90 秒级片段中展现了优异的一致性(第 5.3 节),但**小时级**直播、连续剧式生成仍面临身份漂移、背景退化与叙事逻辑断裂风险。未来可探索: - **显式记忆机制**:引入外部记忆库存储角色状态、场景历史与关键事件,超越当前有限长度的滑动窗口 KV cache; - **高层叙事规划**:让 VLM Agent 不仅生成单帧提示,而是维护长期故事线与场景转换脚本。 —- ### 6. Agentic 系统的自主优化闭环 当前 Agent 主要执行提示生成与视觉反馈(第 2.4 节)。未来可构建**自我改进(self-improving)的 Agentic 框架**: - 自动检测生成失败模式(如手势畸变、参考物未出现)并触发模型在线适配或 prompt 微调; - 结合用户长期偏好学习,实现个性化角色行为与风格。 —- ### 7. 训练策略的进一步扩展 Self-Replay Forcing(SRF)将 on-policy rollout 与梯度可贯通回放结合,但仍存在设计空间: - **更长程 Rollout 与信用分配**:探索跨数十个 segment 的梯度传播策略,或采用层次化强化学习处理长程依赖; - **多任务联合蒸馏**:将 SRF 同时应用于生成与编辑任务,研究跨任务知识迁移; - **更低步数甚至单步生成**:在保持质量的前提下,将当前多步(或 Refiner 增强)管线推向单步扩散极限。 —- ### 8. 端侧与边缘设备部署 论文已在低成本 GPU 上实现实时推理,但向**VR 一体机、移动端或浏览器**的进一步下沉仍需: - 超轻量级模型架构(如针对神经视频解码的专用硬件友好设计); - 云-端协同流式传输策略,在带宽受限环境下维持高分辨率空间视频的低延迟交互。 Q6: 总结一下论文的主要内容 该论文提出了 **Vidu S2**,一个面向实时交互、可编辑与空间视频生成的统一框架,包含 **Vidu S2-Avatar**(实时交互式数字人模型)与 **Vidu S2-Editing**(实时视频编辑模型),并首次探索了实时空间视频生成与编辑的可行性。以下是论文主要内容的分层总结。 —- ### 1. 研究动机与核心问题 现有主流视频生成模型(如 Sora、Veo、Wan 等)采用离线扩散范式,需多步去噪后输出完整视频,导致用户只能被动等待,无法满足直播、游戏、面对面交互等需要**即时视觉反馈**的场景。论文指出,实时交互视频生成的潜在需求远大于离线视频。 针对该瓶颈,论文致力于解决: - 如何在消费级 GPU 上实现**高分辨率(720p)、低延迟(25–42 FPS)**的流式视频生成; - 如何在长时序自回归生成中抑制误差累积与身份漂移; - 如何在流中**动态更新参考**(角色、服装、物体、背景)并遵循复杂指令(如舞蹈); - 如何对输入视频流进行**实时风格迁移、试穿、替换**等编辑; - 如何将单目实时流扩展为适配 VR 头显的**空间(立体)视频**。 —- ### 2. Vidu S2-Avatar:实时交互数字人 #### 2.1 训练策略创新 论文提出 **Self-Replay Forcing (SRF)**,核心流程为: 1. 学生模型执行长程自回归 rollout,生成完整轨迹 x(1:N)^0 并 **detach**; 2. 对自生成轨迹独立重加噪得到 x(1:N)^t ; 3. 在单次因果前向传播中**回放**该轨迹,所有段保留于同一计算图,使后续段损失可反向传播至前面段,从而学习跨块时序依赖,同时避免梯度穿过原始 rollout。 优化目标为:
L(SRF) = L(DMD)( fθ^(causal)(x(1:N)^t, t, r, c(1:N)) ) + L(perc)( fθ^(causal)(x(1:N)^t, t, r, c(1:N)) )
训练流程采用分阶段设计: - **双向预训练**:联合图像到视频(I2V)与参考到视频(R2V),使用段级别条件监督; - **因果适配**:替换双向注意力为分块因果注意力,混合 **Teacher Forcing** 与 **Diffusion Forcing**; - **偏好优化**:双向阶段使用 Diffusion DPO,流式阶段使用 Streaming NFT。 #### 2.2 分辨率提升 引入轻量级**单步超分辨率 Refiner**,在潜在空间执行上采样。采用**非对称缓存调度**:主干网络关注高噪声缓存 x(τB)^(<i) 以传播粗粒度运动,Refiner 关注低噪声高分辨率缓存 x(τ_R,HR)^( τ_R ),从而在实时帧率下将分辨率从 540p 提升至 **720p**。 #### 2.3 数据工程 - **高清晰度选择**:综合评估码率、纹理、边缘、压缩伪影等,而非仅看标称分辨率; - **背景稳定化**:对含平滑相机运动的视频(如舞蹈)进行前景遮罩与几何校正,保留运动多样性的同时消除背景漂移; - **时序有序密集标注**:按事件边界分段,描述动作的时间区间与因果先后,降低响应延迟。 #### 2.4 Agentic 交互系统 构建 VLM Agent,支持用户在流中**任意时刻**上传新参考图(物体、场景、服装)。Agent 负责: - 生成结构化提示,保留未要求改变的细节; - 视觉反馈:审查生成帧,判断动作完成度并调整后续提示; - 参考图分类与融合,支持配饰穿脱、场景过渡等复杂交互。 —- ### 3. Vidu S2-Editing:实时视频流编辑 该模型支持对输入视频流进行**风格迁移、虚拟试穿、角色替换、背景替换**四项任务。 #### 3.1 模型设计 - **帧对齐注意力**:目标帧仅与对应时间步的源帧交互,参考图则全局可见。这确保了编辑后视频与输入视频的**运动与时序完全一致**; - **双向视频编辑训练** to **因果流式训练**:沿用 SRF 框架,先训练双向模型建立强视觉先验,再适配为因果流式架构。 #### 3.2 数据构建 从 Vidu S2-Avatar 的过滤数据中采样 80 万视频,构建四个互不重叠的子集(各 20 万)。风格迁移数据通过 **NormalCrafter** 估计表面法线视频,训练条件重建模型后替换参考图生成;其他任务通过微调专用编辑模型并结合多模型对比筛选获得高质量配对数据。 —- ### 4. 实时空间视频生成与编辑 为增强 VR 沉浸感,论文探索了实时空间视频: - **生成侧**:Vidu S2-Avatar 的单目流通过深度估计与水平视差映射,以单目帧为中心视图反向形变,经空洞填补与时序稳定后输出同步左右眼视图; - **编辑侧**:支持两种工作流——单目输入先编辑后转换视差,或立体输入拼接为宽视频联合编辑后再分离视图。 论文指出,该场景对**分辨率与端到端延迟**的要求比单目视频更严苛,是实现真正沉浸体验的关键挑战。 —- ### 5. 推理基础设施 为支撑消费级 GPU 实时推理,论文构建了端到端加速框架: - **分层混合注意力**:按层敏感度选择 SageAttention、SpargeAttention 或 Sparse-Linear Attention; - **per-block W8A8 GEMM**:细粒度量化线性层,抑制离群值; - **内核融合与 CUDA Graph**:减少内核启动与全局内存流量; - **多 GPU 上下文并行**:Ulysses 风格切分,通信张量量化; - **模块间细粒度调度**:VAE 编码器、主干、Refiner、VAE 解码器沿共享时间线**分时复用 GPU**,消除静态资源空闲。 —- ### 6. 实验结果 #### 6.1 公开基准 - **StreamAV-Bench**(数字人):Vidu S2-Avatar 在 **VA、VQ、PQ、AQ、AVAlign、AVSync、AIF、SC、BC** 所有指标上均获最优; - **Sparkle-Bench / OpenVE / RefVIE**(编辑):Vidu S2-Editing 在所有七项及联合综合分上排名第一,超越离线模型 Bernini-R 14B 与流式模型 Decart-Lucy2.5; - **ViViD 试穿**:VFIDI 为 **9.9515**,显著低于 CatV2TON (19.5131) 与 ViViD (21.8032)。 #### 6.2 人类偏好评估 (GSB) - **数字人**:与 Runway、HeyGen、PixVerse 对比,Vidu S2-Avatar 在整体质量、动作、表情、一致性、语义遵循等维度均获压倒性偏好;90 秒长时序测试中评分无衰减; - **视频编辑**:与 Decart-Lucy2.5 和 XMax-X2.0 对比,在整体质量、视频质量、时序一致性、语义遵循上均占优。 #### 6.3 定性研究 案例显示,Vidu S2-Avatar 在长时序流中保持身份、发型、服饰、手部结构稳定;Vidu S2-Editing 在四项编辑任务中准确迁移参考外观,同时保持源视频运动、遮挡关系与场景几何,基线则出现身份丢失、风格化失败、伪影与背景替换错误。 —- ### 7. 结论 Vidu S2 通过 Self-Replay Forcing、非对称超分辨率、帧对齐注意力、VLM Agentic 系统与面向空间视频的流式管线,在实时交互数字人生成、实时视频编辑与实时空间视频三个层面实现了技术突破。实验表明,该系统在公开基准与人工评估中均优于所有对比基线,同时满足消费级 GPU 上的实时推理约束。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Jintao Zhang,Kai Jiang,Jintao Chen,Xu Wang,Deyuan Liu,Jungang Li,Dechuang Chen,Ming Lin,Jingjiang Zhou,Haopeng Jin,Qi Jia,Xiaohang Wang,Yaole Wang,Zhanqiang Zhang,Ran Li,Zhengkun Huang,Shuyue Xiong,Yuji Wang,Zikun Dai,Hui He,Yang Luo,Mang Ning,Weiqi Feng,Chengyang Ye,Xinyue Lin,Min Zhao,Hongzhou Zhu,Hengkai Tan,Zeyuan Wang,Chendong Xiang,Kaiwen Zheng,Zhijie Deng,Fan Bao,Jianfei Chen,Jun Zhu
Categories:
PDF URL: https://arxiv.org/pdf/2609.11638.pdf
Arxiv URL: https://arxiv.org/abs/2609.11638
Arxiv ID: 2609.11638
CoolPaper URL: https://papers.cool/arxiv/2609.11638
Published: 2026-09-16T01:38:42.595Z
Updated: 2026-09-16T01:38:42.595Z
2. Atria Dawn: The Dawn of Agentic Superintelligence
Abstract:As AI agents become participants in the development of their successors, they reshape both the production of intelligence and the role of human researchers. We introduce Atria Dawn Preview, a foundation agentic language model designed for scientific research and engineering workflows, with the goal of expanding the frontier of agent productivity in the real world. This model is trained via a Verifiable Experience Pipeline that connects tool-mediated interactions to executable environments and externally verified outcomes. Across 16 benchmarks spanning real-world research, engineering, and digital work, Atria Dawn Preview is competitive with frontier agents and achieves the highest reported score on five of them. Beyond standalone performance, we examine the real research-and-development process behind this model as a case study of human—AI collaboration, analyzing 769 task records from 56 participants together with agent logs. When asked to evaluate completed tasks under comparable conditions, participants rated about one-third of completed AI-assisted tasks as infeasible without AI. More strikingly, agents frequently propose methods and implement revisions, while humans retain most final decisions and guide exploration through judgment and feedback. These observations indicate a shift from task-level execution to project-level partnership, with human effort concentrating on what is worth pursuing and how evidence should guide research. Progress toward more autonomous AI research must therefore advance both the capacity for discovery and the capacity for meaningful human oversight, preserving accountable human authority over the risks and direction of continued development.
中文摘要
摘要:随着人工智能代理成为其继任者开发的参与者,它们正在重新塑造智能的生成方式以及人类研究人员的角色。我们介绍了Atria Dawn Preview,这是一种面向科学研究和工程工作流程的基础代理语言模型,旨在扩展现实世界中代理生产力的前沿。该模型通过可验证体验管道进行训练,该管道将工具介导的交互与可执行环境和外部验证的结果连接起来。在涵盖现实世界研究、工程和数字工作共16个基准测试中,Atria Dawn Preview在前沿代理中具有竞争力,并在其中五个基准中获得了报告的最高评分。除了独立性能之外,我们还将该模型背后的实际研发过程作为人类与人工智能协作的案例进行了研究,分析了56名参与者的769条任务记录及代理日志。在要求参与者在可比条件下评估已完成任务时,大约三分之一的AI辅助完成的任务被评为在没有AI的情况下无法完成。更引人注目的是,代理经常提出方法并实施修订,而人类仍保留大部分最终决策,并通过判断和反馈引导探索。这些观察表明,任务层级的执行正在向项目层级的合作转变,人类的努力集中在值得追求的目标以及证据应如何指导研究上。因此,实现更自主的人工智能研究的进展必须同时提高发现能力和有意义的人类监督能力,维护人类对持续开发风险和方向的可问责权威。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文试图解决的核心问题可分为三个相互关联的层面: ### 1. 构建能够提升现实世界生产力的基础智能体模型 论文指出,现有评估往往聚焦于孤立的任务性能,而缺乏对\*\*持续工具使用、环境交互与外部验证\*\*的系统化训练。为此,论文提出了 \*\*Atria Dawn Preview\*\*——一个基于 7440 亿参数混合专家(MoE)架构的基础智能体语言模型,并通过\*\*可验证经验管道(Verifiable Experience Pipeline)\*\*进行训练。该管道将工具介导的交互与真实可执行环境及外部验证信号(如测试、指标、文件状态等)相连接,旨在学习能够跨任务泛化的智能体行为,从而扩展智能体在科研与工程工作流中的生产力前沿。 ### 2. 理解真实 AI 研发中人类与 AI 的责任分工与协作演变 论文强调,单纯的基准测试分数无法回答一个关键问题:\*\*在真实的模型开发项目中,谁负责识别有价值的问题、在候选方法中做出选择、解释不确定的结果,并决定下一步方向?\*\* 为回答这一问题,论文以 Atria Dawn 自身的开发过程作为案例研究,分析了 56 名参与者完成的 769 项任务记录及智能体日志。研究发现: - 约 \*\*33.2%\*\* 的已完成 AI 辅助任务被参与者评定为:在同等范围与资源约束下,\*\*没有 AI 则不可行\*\*; - 在方法与参数决策中,\*\*55.4%\*\* 由 AI 提出方案,但 \*\*85.5%\*\* 的最终选择权仍由人类掌握; - 当遇到困难时,\*\*76.0%\*\* 的情况通过人类干预(提供上下文、诊断问题或调整方法)得以推进,而人类直接接管工作的比例极低(仅 0.7%)。 这些观察揭示了从\*\*任务级执行\*\*向\*\*项目级伙伴关系\*\*的转变:AI 承担更多方案提出、执行与修订的工作,而人类将精力集中于\*\*判断何为值得追求的目标\*\*,以及\*\*证据应如何指导研究\*\*。 ### 3. 探索通向递归自我改进(RSI)的路径与开放挑战 论文进一步探讨了从“AI 参与研发”到“持续递归自我改进”之间尚存的技术与治理鸿沟。具体包括: - \*\*研究方向生成与价值预判\*\*:AI 目前多局限于人类既定方向内的方法变体,难以自主提出并评估全新的、高价值的研究方向; - \*\*经验转化为内在能力\*\*:当前 AI 主要从单次会话或记录中检索经验,而难以像人类研究者那样将跨项目的试错教训内化为持续改进的研究能力; - \*\*人类监督的维持\*\*:随着每个决策背后 agent 动作链的延长,人类如何在不陷入“仅能说 yes/no”的被动角色前提下,保持对研究目标与风险的有效管控。 综上,该论文不仅试图展示一个具有竞争力的 agentic 基础模型,更试图\*\* empirically grounded(基于实证地)厘清在 AI 能力日益增强的背景下,人类研究者与 AI 智能体之间 evolving(不断演化的)分工\*\*,并为未来更加自主且负责任的 AI 研发提供可操作的观察与挑战框架。 Q2: 有哪些相关研究? 论文中与 Atria Dawn 相关的研究工作可依据主题归纳为以下几个方向: ### 1. AI 智能体与工具使用(Agentic Tool Use) 这些研究为语言模型接入外部工具、在真实环境中持续交互奠定了基础,也是 Atria Dawn 训练范式的直接上下文。 - \*\*Schick et al. (2023)\*\*:提出 Toolformer,展示语言模型可通过自监督学习自行决定调用外部工具(如搜索引擎、计算器),是早期将工具使用纳入语言模型推理的代表性工作。 - \*\*Xi et al. (2025, 2026)\*\*:构建 AgentGym 与 AgentGym2,提供跨多种环境的智能体训练与评估基准,支持在真实、非理想化环境中评测基于大语言模型的智能体。 - \*\*Shen et al. (2026)\*\*:提出 SETA,聚焦终端智能体(terminal agents)环境的规模化构建,与本文关注的工程化工作流紧密相关。 ### 2. 软件工程与代码智能体(Coding & Software Engineering Agents) Atria Dawn 在 SWE-bench Pro、Terminal-Bench 等基准上的评估直接依托于这一研究脉络。 - \*\*Jimenez et al. (2024)\*\*:提出 SWE-bench,首次系统评估语言模型解决真实 GitHub 问题的能力,成为后续软件工程智能体的事实标准。 - \*\*Deng et al. (2025)\*\*:推出 SWE-bench Pro,将评测从短程问题修复扩展到长程软件工程任务。 - \*\*Chen et al. (2021)\*\*:OpenAI 对 Codex 的早期评估,验证了大语言模型在代码生成与指令遵循上的潜力,是“任务级执行者”阶段的典型代表。 - \*\*Yang et al. (2026a)\*\*:提出 ABC-Bench,针对真实后端开发场景评测智能体能力。 - \*\*Merrill et al. (2026)\*\*:发布 Terminal-Bench,专注于命令行界面下的困难现实任务。 - \*\*Chan et al. (2025)\*\*:提出 MLE-bench,用于评估机器学习工程智能体,本文在 MLE-bench Lite 上的评测直接引用其协议。 ### 3. 自动化 AI 研究与科学发现(Automated Research & Discovery) 这些工作探索了智能体在算法发现、实验设计和科研自动化中的上限,是本文讨论“递归自我改进(RSI)”可能性的重要参照。 - \*\*AlphaEvolve Team (2025) / Novikov et al. (2025)\*\*:展示基于 Gemini 的编码智能体可提出高级算法候选方案并在反馈中迭代优化。 - \*\*Lu et al. (2026)\*\*:在《Nature》发文探讨端到端自动化 AI 研究,表明智能体能够在限定范围内自主提出实验计划并根据实验反馈迭代修订。 - \*\*Gottweis & Natarajan (2025)\*\*:提出“AI co-scientist”框架,用于加速科学突破,涉及假设生成与实验设计。 - \*\*Feng et al. (2026b)\*\*:探索自主数学研究,展示智能体在形式化数学推理中的自动化潜力。 ### 4. 人类–AI 协作与角色演变(Human–AI Collaboration) 这些研究为本文分析“人类从任务执行者转向项目级伙伴”提供了理论与实证支撑。 - \*\*Hitzig et al. (2026)\*\*:Anthropic 关于 agentic coding 与 expertise 回报的研究,指出智能体编码需要持续的人类专家干预。 - \*\*OpenAI (2026)\*\*:OpenAI 内部关于研究加速的报告,观察到智能体在研发中承担更多责任的趋势,与本文观察一致。 - \*\*Hao et al. (2026)\*\*:发表在《Nature》的研究指出,AI 工具虽扩大了科学家的产出规模,却可能收缩科学探索的焦点,警示了智能体“同质化”风险。 - \*\*Jiang et al. (2025)\*\*:提出“Artificial Hivemind”概念,分析语言模型在开放 ended 任务中表现出的同质化倾向,解释了为何增加智能体数量未必拓宽探索范围。 ### 5. 递归自我改进与经验积累(Recursive Self-Improvement & Experience Accumulation) 这些工作涉及如何将试错经验转化为模型内在能力,是本文开放挑战部分的核心对话对象。 - \*\*Zhang et al. (2026)\*\*:提出 Darwin Gödel Machine,探讨自改进智能体的开放式演化。 - \*\*Shinn et al. (2023)\*\*:提出 Reflexion,通过语言化的强化学习让智能体从失败中总结 verbal reinforcement,实现跨Episode的经验复用。 - \*\*Wang et al. (2024)\*\*:Voyager 框架通过技能库与终身学习机制,支持开放域具身智能体的持续能力增长。 - \*\*Feng et al. (2026a)\*\*:提出 in-place test-time training,为在测试阶段动态吸收经验、更新模型行为提供了技术路径。 ### 6. 对齐、监督与安全(Alignment & Oversight) 本文在讨论人类权威与风险管控时,直接引用了该领域的近期研究。 - \*\*Burns et al. (2024)\*\*:研究 weak-to-strong generalization,指出当 AI 展现出超越人类理解的能力时,监督将变得困难。 - \*\*Greenblatt et al. (2024)\*\*:提出 AI control 框架,讨论如何在存在故意破坏风险的情况下提升安全性,强调与能力进步相匹配的对齐投入。 - \*\*Pachocki (2026)\*\*:OpenAI 关于“alien mind”的讨论,反思在 AI 能力跨越重大阈值后人类如何继续有效参与决策。 ### 7. 基础模型与训练基础设施(Foundation Models & Training) - \*\*Z.ai (2026)\*\*:Atria Dawn 所基于的 744B 参数 MoE 基础模型 GLM-5.2 的发布方。 - \*\*Dosovitskiy et al. (2021)\*\*:Vision Transformer(ViT)的原始工作,被 Atria Dawn 在天气预测案例中直接用于构建超过 4 亿参数的视觉网络。 - \*\*Tillet et al. (2019)\*\*:Triton 编译器与中间语言,是本文 Gated Delta Network 优化案例中从 Triton 切换到原生 CUDA 的技术背景。 - \*\*Ouyang et al. (2022)\*\*:InstructGPT 工作,代表利用人类反馈进行指令微调(RLHF)的经典范式,是理解人类反馈在模型训练中作用的基石。 Q3: 论文如何解决这个问题? 论文通过\*\*模型构建、系统评测、实证案例与理论框架\*\*四个相互支撑的层次来解决上述问题,具体路径如下。 --- ### 1. 构建面向真实科研与工程环境的智能体基础模型 为突破传统语言模型在孤立任务上的局限,论文提出了 \*\*Atria Dawn Preview\*\*,并设计了一套\*\*可验证经验管道(Verifiable Experience Pipeline)\*\*来训练其 sustained reasoning、tool use 与环境交互能力。 - \*\*模型架构\*\*:基于 7440 亿参数的混合专家(MoE)基础模型(Z.ai, 2026)。 - \*\*环境绑定\*\*:每一个训练任务都连接至真实的可执行环境,模型需观察环境状态、调用工具、生成中间产物,并根据环境反馈持续修正行为。 - \*\*外部验证\*\*:最终结果必须通过可外部检验的信号进行确认,包括可执行测试、实验指标、文件/应用状态、几何结构检查、来源证据或人工定义的标准。 - \*\*轨迹筛选与失败分析\*\*:训练流程会剔除不完整、矛盾、重复或行为无效的轨迹,仅保留任务–轨迹–产物–验证证据之间的完整链路;同时通过失败分析指导后续任务构造与环境优化,形成迭代闭环。 - \*\*长程工作流支持\*\*:对于需要多步执行的复杂流程,训练经验还包括启动作业、检查日志与产物、修订执行计划等行为,以培养可复用的状态检查、反馈解释与错误恢复能力。 --- ### 2. 建立覆盖多领域的大规模评测体系 为验证模型在真实世界生产力边界上的扩展,论文在 \*\*16 个基准测试\*\*上进行了系统评估,涵盖工具使用、深度搜索、工作空间生产力、专业交付、软件工程、终端任务、机器学习工程与网络安全等领域。 - \*\*整体表现\*\*:Atria Dawn Preview 在其中 \*\*5 个基准\*\*上取得了当时最高的 reported score(AutomationBench、BFCL v4、DeepSearchQA、BrowseComp、CyberGym),在另外 \*\*3 个基准\*\*上位列第二。 - \*\*领域分析\*\*: - \*\*通用智能体能力\*\*:在工具调用、深度搜索与工作空间执行上保持前沿领先; - \*\*代码与安全\*\*:在 CyberGym(漏洞分析与安全任务)上达到 86.5 分,显著领先竞品;在 MLE-bench Lite 与 SWE-bench Pro 上也维持第一梯队水平。 - \*\*案例补充\*\*:除聚合指标外,论文还提供了 Discovery(科学计算与 ML 工程)、Creation(软件与 CAD)、Delivery(专业报告)与 Cybersecurity(漏洞修复)四个方向的详细案例,展示模型如何在具体环境中利用工具链、响应实验反馈并生成可验证产物。 --- ### 3. 以模型自身的研发过程作为人类–AI 协作的实证案例研究 为回答“在真实研发中谁决定方向、谁执行、谁负责”这一问题,论文将 Atria Dawn 的开发过程本身作为研究对象,分析了 \*\*56 名参与者\*\*完成的 \*\*769 条任务记录\*\*及配套的智能体日志。 - \*\*AI 使用渗透率\*\*:在 739 条有明确记录的任务中,713 条使用了 AI(占比 96.5%)。 - \*\*任务可行性\*\*:在 455 条已完成且反馈有效的 AI 辅助任务中,\*\*33.2%\*\* 被参与者评定为在同等范围与资源约束下\*\*没有 AI 则不可行\*\*,说明 AI 不仅压缩时间,更拓展了可执行工作的边界。 - \*\*角色分工——提议与选择的分离\*\*(图 8): - 在\*\*方法与参数\*\*决策中,AI 提出方案的比例为 \*\*55.4%\*\*,但最终由人类拍板的比例高达 \*\*85.5%\*\*; - 在\*\*目标与范围\*\*决策中,人类最终选择占比达 \*\*93.4%\*\*; - 即使在那些“无 AI 不可行”的任务中,人类对最终目标的选择比例仍高达 \*\*95.4%\*\*。 - \*\*困难恢复机制\*\*(图 9):在记录到困难的 588 个任务中,\*\*76.0%\*\* 因人类干预而推进,主要形式是“补充上下文/澄清需求”(35.2%)和“诊断问题/改变方法”(34.7%);人类直接接管工作的仅占 \*\*0.7%\*\*。人类的作用更多是\*\*改变智能体所知\*\*,而非\*\*替代智能体执行\*\*。 - \*\*输出去向与修订模式\*\*(图 10):627 个任务中,95.9% 的 AI 输出以某种形式进入最终交付物;在 354 个经历实质性修订的任务中,\*\*75.4%\*\* 由 AI 在人类反馈后自行完成修订,人类直接编辑的仅占 \*\*19.2%\*\*。 - \*\*人机动作比例演化\*\*(图 6):在 22 名参与者的纵向观察中,agent actions per human prompt 的日度中位数从 11.0 上升至 28.5,表明\*\*单次人类判断所驱动的 agent 执行链条显著延长\*\*,但人类仍保留决策节点。 --- ### 4. 提出从“AI 参与研发”到“递归自我改进(RSI)”的开放挑战框架 基于上述模型性能与研发经验,论文进一步提炼出四个尚未解决的开放挑战,为后续研究提供路径图: - \*\*开放挑战 1(技术)\*\*:如何让 AI 持续生成\*\*多样化且有潜在价值\*\*的研究方向,并在实验结果尚未产生前就预判其价值?当前 agent 多数是在人类已锁定的方向内做方法变体,缺乏跨领域的自主探索与优先级判断能力。 - \*\*开放挑战 2(技术)\*\*:如何将长程探索中积累的\*\*经验递归转化为内在研究能力\*\*,而非仅停留在单次会话的记录与检索?当前模型往往重复遭遇同类失败,而人类研究者则能将教训跨项目迁移。 - \*\*开放挑战 3(人类角色)\*\*:当 AI 开始揭示超出人类想象的可能性时,人类如何继续制定\*\*有意义的目标\*\*并保持\*\*有效监督\*\*?随着每个决策背后 agent 动作链的延长,人类面临从“决策者”退化为“仅能说 yes/no 的审查者”的风险。 - \*\*开放挑战 4(安全与对齐)\*\*:当 AI 主导大部分研发时,需要建立怎样的\*\*权威分配协议与对齐标准\*\*?论文强调, convenience-driven 的权限放宽(如自动执行模式)不应等同于安全授权,能力的每一次跃升都必须匹配对等的对齐与监管投入。 --- 综上,论文的解决思路并非仅停留在发布一个性能更强的模型,而是通过\*\*“可验证训练 + 多域评测 + 自我案例研究 + 开放挑战定义”\*\*的完整链条,同时推进 agentic 能力的工程边界与对人类–AI 协作演化的理论理解。 Q4: 论文做了哪些实验? 论文中的实验与评估工作可分为\*\*模型性能基准评测\*\*、\*\*具体能力案例验证\*\*与\*\*人类–AI 协作的实证分析\*\*三大板块,具体如下。 --- ### 一、模型性能基准评测 研究团队在 \*\*16 个跨领域基准测试\*\* 上对 Atria Dawn Preview 进行了系统评估,并与同期前沿模型(DeepSeek V4 Pro、KIMI K3、Qwen 3.8 Max、GLM 5.3、GPT 5.6 sol、Claude Opus 5 等)进行横向对比。评测领域覆盖工具使用、深度搜索与科研、工作空间生产力、专业任务、软件工程、终端操作、机器学习工程及网络安全。 16 个基准及 Atria Dawn Preview 的核心表现如下(详见论文 Table 1): | 类别 | 基准测试 | 关键结果 | |:---|:---|:---| | \*\*通用智能体能力\*\* | AutomationBench | \*\*53.8\*\*(最高,领先第二名 4.1 分) | | | BFCL v4 | \*\*77.0\*\*(最高,领先第二名 2.9 分) | | | DeepSearchQA | \*\*96.0\*\*(最高) | | | BrowseComp | \*\*92.5\*\*(最高) | | | SkillsBench | 66.4(第二,差距 0.3 分) | | | Workspace-Bench-Lite | 68.2(第二,差距 1.9 分) | | | Workspace-Bench | 65.0(第二,差距 0.8 分) | | | WideSearch | 81.9(并列第二梯队) | | | DeepResearch Bench II | 51.1(处于前沿区间) | | | τ 3-Bench Banking | 41.2(处于前沿区间) | | \*\*专业交付\*\* | GDPval | 1583(处于前沿区间) | | | JobBench | 50.3(处于前沿区间) | | \*\*代码与工程\*\* | CyberGym | \*\*86.5\*\*(最高,领先第二名 2.0 分) | | | MLE-bench Lite | 86.2(第一梯队) | | | SWE-bench Pro | 59.6(与 DeepSeek V4 Pro 相当) | | | Terminal-Bench 2.1 | 78.3(与 DeepSeek V4 Pro 相当) | 综上,Atria Dawn Preview 在 \*\*5 个基准\*\*上取得了当时最高的 reported score,在 \*\*3 个基准\*\*上位列第二,且在代码安全(CyberGym)与通用工具调用(AutomationBench、BFCL v4)上展现出显著优势。 --- ### 二、具体能力案例验证 为补充聚合指标的不足,论文在四个应用方向上展开了详细的\*\*单案例追踪与产物验证\*\*,重点展示工具链衔接、实验反馈循环与可验证产物。这些案例均配有执行记录或生成产物截图(图 2–图 4)。 #### 1. Discovery(科学发现与机器学习工程) - \*\*天气预测工作流\*\*:在禁用网络搜索的条件下,模型处理超过 100 GB 气象数据,基于 Vision Transformer(Dosovitskiy et al., 2021)实现并训练参数量超过 4 亿的神经网络,建模 69 个气象变量,最终生成交互式全球天气预报可视化界面(图 2a)。 - \*\*Gated Delta Network(GDN)解码优化\*\*:模型在 Triton 与原生 CUDA 之间迭代切换实现方案,依据实测性能回归调整配置,在 7 个代表性 batch size 上实现基线与候选延迟总和之比为 1.46× ;最终 54 个形式化负载中 52 个通过验证。 - \*\*文献分析\*\*:针对低温保存与蛋白质泄漏主题,模型生成带来源标注的综述报告,区分染色读数与因果解释,并提议对照实验与后续研究。 #### 2. Creation(软件、交互应用与 CAD) - \*\*MiniOS 系统构建\*\*:从空工作区出发,模型在约 20 分钟内构建包含串口 shell、磁盘访问、持久文件系统与解释器的迷你操作系统。通过两次 QEMU 会话验证跨重启的持久状态与自动运行(autorun)行为(图 2b)。 - \*\*交互式应用\*\*:生成可导航的“大观园”场景、叙事游戏与消防逃生游戏。 - \*\*CAD 装配\*\*:生成四缸发动机、人形机器人、机器人关节模块与火箭的 CAD 装配体,展示几何结构与组件层级(图 3)。 #### 3. Delivery(报告与演示文稿) - \*\*专业报告生成\*\*:针对清洁能源选址、医疗投资、半导体资本配置等主题,组织来源材料与定量数据,生成包含证据、计算、表格与图表的专业报告。图 4 展示了清洁能源选址的基础得分与半导体企业投资强度(R&D / Revenue、CapEx / Revenue)分析示例。 - \*\*演示文稿制作\*\*:将研究论文与开放话题转化为包含叙事结构与支撑材料的演示文稿。 #### 4. Cybersecurity(漏洞分析与修复) - \*\*端到端安全工程\*\*:在授权隔离环境中,模型对目标网站进行审查、测试候选漏洞、验证注入缺陷、修复底层问题,并通过重新测试受影响路径来外部验证修复效果。 --- ### 三、人类–AI 协作的实证分析 论文将 Atria Dawn 自身的研发过程作为\*\*案例研究对象\*\*,基于 \*\*769 条任务记录\*\*与配套智能体日志,对 \*\*56 名参与者\*\*的人机协作模式进行了定量分析。 #### 1. AI 使用渗透率与动作密度演化 - \*\*使用率\*\*:在 739 条有明确回答的任务中,713 条使用了 AI,占比 \*\*96.5%\*\*。 - \*\*人机动作比纵向追踪\*\*:对 22 名参与者的固定队列进行每日追踪(8 月 7 日至 9 月 4 日),agent actions per human prompt 的日度中位数从 \*\*11.0\*\* 上升至 \*\*28.5\*\*(图 6),四分位距同步扩大,表明单次人类判断所驱动的智能体执行链显著延长,但个体差异增大。 #### 2. 任务可行性评估 - 对 455 条已完成且反馈有效的 AI 辅助任务,要求参与者评估在无 AI 且保持同等范围与资源约束下是否可完成。 - 结果:\*\*33.2%\*\*(151 条)被评定为 \*\*infeasible without AI\*\*(无 AI 不可行),且这些任务来自 27 名不同参与者(约占半数),排除了少数重度用户的偏倚(图 7)。 #### 3. 决策归因:提议与选择的分离 - 对三类决策要素进行“谁提议 / 谁拍板”的归因分析(图 8): - \*\*目标/范围\*\*( n=603 ):人类最终选择占比 \*\*93.4%\*\*;AI 提议仅占 16.9%。 - \*\*方法/参数\*\*( n=567 ):AI 提议方案占比 \*\*55.4%\*\*,但人类最终选择仍占 \*\*85.5%\*\*;AI 独立决定仅占 9.2%。 - \*\*验收标准\*\*( n=542 ):人类最终选择占比 \*\*81.9%\*\*。 - 在 151 条“无 AI 不可行”的任务子集中,人类对最终目标的选择比例进一步升至 \*\*95.4%\*\*,表明即便深度依赖 AI,人类仍保留最终决策权威。 #### 4. 困难恢复模式 - 对 588 条记录到困难的 Task,分析其恢复方式(图 9): - \*\*76.0%\*\* 通过人类干预推进; - \*\*23.0%\*\* 由 AI 自主恢复; - \*\*1.0%\*\* 未解决。 - 人类干预的主要形式为“补充上下文/澄清需求”(35.2%)与“诊断问题/改变方法”(34.7%);人类直接接管(takeover)仅占 \*\*0.7%\*\*,局部编辑仅占 \*\*3.2%\*\*。人类作用侧重于\*\*改变智能体所知\*\*,而非\*\*替代智能体执行\*\*。 #### 5. 输出去向与修订模式 - 对 627 条任务的主要 AI 输出去向进行追踪(图 10): - \*\*95.9%\*\* 的输出以某种形式进入最终交付物(直接使用 56.5%、经实质性修订后使用 38.4%、仅作思路参考 3.2%、未被采用 1.0%)。 - 在 354 条经历实质性修订的任务中,\*\*75.4%\*\* 由 AI 在人类反馈后自行完成修订,人类直接编辑仅占 \*\*19.2%\*\*。 --- ### 实验总结 上述三类实验共同构成了论文的实证基础:基准评测确立模型的\*\*绝对能力边界\*\*,案例研究验证其在\*\*真实工具链与执行环境\*\*中的行为逻辑,而人机协作分析则提供了\*\*人类判断与智能体执行如何分工\*\*的经验数据。三者结合,支撑了论文关于“从任务级执行迈向项目级伙伴关系”的核心论断。 Q5: 有什么可以进一步探索的点? 基于论文的实验发现与开放讨论,以下几个方向值得进一步深入探索: --- ### 1. 递归自我改进(RSI)的技术基础 \*\*研究方向生成与预评估\*\* 论文指出,当前智能体提出的方案多局限于人类既定方向内的方法变体(agent 在方法/参数决策中提议占比 55.4%,但在目标/范围决策中仅占 16.9%)。未来可探索: - 如何让智能体在\*\*无先验人类锚定\*\*的情况下自主生成跨领域的、多样化的研究假设; - 如何在实验结果产生之前,建立对研究方向\*\*潜在价值的预判机制\*\*,特别是在计算资源受限条件下进行优先级排序,而非仅优化单个实验的性能表现。 \*\*经验内化与架构革新\*\* 论文观察到,智能体在单次失败中获得的教训往往停留在该会话或记录中,难以像人类研究者那样跨项目迁移。可进一步探索: - \*\*测试时训练(test-time training)\*\*与\*\*即时能力更新\*\*:如何使模型在探索过程中不仅检索历史经验,而是真正将其转化为参数层面或结构层面的能力增长; - \*\*记忆–能力解耦架构的重设计\*\*:当前架构将记忆与核心能力分离,未来可能需要根本性的新型架构,使“积累经验”与“提升研究能力”形成闭环。 --- ### 2. 评估体系与专用基准的构建 \*\*研究能力的直接衡量\*\* 现有基准多衡量任务级成功率(如 SWE-bench、MLE-bench),但难以反映“驱动进一步研究的能力”。论文明确呼吁设计\*\*专门评估研究能力\*\*的任务,例如: - 衡量模型从失败实验中\*\*提取教训、修正后续探索方向\*\*的能力; - 衡量模型在\*\*多轮迭代后提出更有价值问题\*\*的能力,而非仅衡量最终答案的正确性; - 建立\*\*长程、跨项目\*\*的评估协议,追踪智能体在连续多个相关任务中的知识迁移与策略进化。 \*\*人机协作效率的量化指标\*\* 论文采用“agent actions per human prompt”作为代理指标,但该指标的上升并不等同于自主性提升。未来可发展更精细的度量框架: - 区分“人类判断的杠杆效应”(单点决策驱动的 agent 执行链长度)与“人类干预的不可替代性”; - 量化不同干预类型(上下文补充、方法诊断、直接接管)对最终产出的边际贡献,以优化人机分工界面。 --- ### 3. 人类–AI 协作机制的深化 \*\*人类判断的认知机制与可扩展性\*\* 论文发现人类的核心价值在于“预判何种尝试值得进行”和“将过往经验应用于新情境”。未来研究可: - 解构人类研究者\*\*压缩搜索空间\*\*的具体认知策略,尝试将其形式化为可教给智能体的启发式规则或元策略; - 探索人类反馈的\*\*最优时机与粒度\*\*:在 agent 动作链显著延长(从 11.0 升至 28.5)的背景下,如何在保持人类权威的同时减少认知负荷。 \*\*防范智能体同质化与扩大探索边界\*\* 论文引用研究指出,多个智能体可能因共享先验而产生\*\*相关性盲区(correlated blind spots)\*\*。可探索: - 建立\*\*异构智能体通信机制\*\*:让不同训练背景或目标函数的智能体相互挑战假设、引入对抗性视角; - 设计\*\*人类专家多样性注入\*\*的协议,利用跨学科背景的研究者主动打破智能体的共同框架局限。 --- ### 4. 安全、对齐与动态治理框架 \*\*权威分配与问责机制\*\* 论文警示,当前实践中权限边界往往由便利性(如自动执行模式)而非审慎设计决定。未来亟需: - 构建\*\*随能力演进而动态调整\*\*的权限框架,明确在哪些决策节点上必须保留人类否决权; - 研究当智能体揭示超出人类理解范围的可能性时(weak-to-strong generalization 情境),如何维持\*\*有意义的监督(meaningful oversight)\*\*,避免人类沦为仅能表示同意/拒绝的仪式性节点。 \*\*对齐标准的递归更新\*\* 随着 AI 逐渐主导自身研发,对齐目标本身可能也需要迭代。可探索: - 如何在递归改进循环中确保\*\*对齐约束的稳定性\*\*,防止优化过程偏离初始安全规范; - 建立由谁、以何种程序来定义和修订对齐目标的\*\*元治理协议\*\*。 --- ### 5. 领域拓展与多智能体协同 \*\*可验证经验管道的跨领域迁移\*\* 论文的 Verifiable Experience Pipeline 主要围绕代码、数学与工程环境构建。可将其扩展至: - \*\*实验科学\*\*(如化学合成、生物实验),其中验证信号可能来自仪器读数或物理观测,而非仅编译器或单元测试; - \*\*开放式创意工作\*\*(如产品设计、政策分析),其中“验证”涉及更模糊的人类标准与社会反馈。 \*\*多智能体研发系统\*\* 论文在讨论方向同质化时建议建立“不同工作智能体之间的通信渠道”。未来可系统研究: - \*\*角色分化的多智能体团队\*\*:例如“生成者–批评者–验证者”三角结构在 AI 研发中的最优配置; - \*\*去中心化的探索–利用权衡\*\*:如何让多个智能体在共享目标下保持探索的独立性,避免过早收敛到局部最优。 --- ### 6. 个体差异与组织层面的实证研究 论文发现人机动作比的\*\*四分位距随时间扩大\*\*,表明不同参与者对 AI 的依赖模式存在显著差异。未来可: - 开展更大规模的纵向研究,识别影响人机协作效率的\*\*个体与组织因素\*\*(如专业背景、任务类型、管理结构); - 探索 AI 辅助研发中“\*\*不可行任务\*\*”(infeasible without AI)的涌现规律:这类任务在何种条件下出现,其对科研产出的边际价值如何量化。 Q6: 总结一下论文的主要内容 该论文围绕\*\*智能体超级智能的黎明(The Dawn of Agentic Superintelligence)\*\*这一主题,系统探讨了人工智能智能体在科学研究与工程研发中的能力边界,以及人类研究者与 AI 之间不断演化的分工关系。以下为主要内容的结构化总结。 --- ### 一、研究背景与核心问题 随着大语言模型智能体逐步具备持续工具使用、环境交互与自主迭代能力,其已开始参与 AI 系统自身的研发过程(如算法发现、实验自动化与代码生成)。然而,单纯的任务性能指标无法回答一个关键问题:\*\*在真实的模型开发项目中,谁负责识别有价值的问题、在多种方案中做出选择、解释不确定的结果,并决定下一步的探索方向?\*\* 理解这一责任分工,对于评估智能体的真实贡献、预测递归自我改进(Recursive Self-Improvement, RSI)的可行性,以及确保人类对研发风险的最终权威,均具有必要性。 --- ### 二、模型构建:Atria Dawn Preview 论文推出了 \*\*Atria Dawn Preview\*\*,一个面向科学研究与工程工作流的基础智能体语言模型,其核心设计包括: - \*\*基础架构\*\*:基于 7440 亿参数的混合专家(MoE)模型(Z.ai, 2026)。 - \*\*可验证经验管道(Verifiable Experience Pipeline)\*\*:训练中的每一个任务均绑定真实可执行环境。模型通过观察状态、调用工具、生成中间产物并适应反馈来完成任务。 - \*\*外部信号验证\*\*:最终结果须经由测试、指标、文件状态、几何结构、来源证据或人工标准等外部信号检验,确保任务–轨迹–产物–验证证据的完整链路被纳入模型的可复用能力中。 - \*\*轨迹筛选与失败驱动迭代\*\*:剔除无效轨迹,并通过失败分析指导后续任务构造与环境优化,支持长程工作流中的状态检查、日志解读与错误恢复。 --- ### 三、基准评测与性能表现 Atria Dawn Preview 在 \*\*16 个跨领域基准\*\*上接受评估,涵盖工具使用、深度搜索、工作空间生产力、专业交付、软件工程、终端任务、机器学习工程及网络安全。主要结果如下: - \*\*最高分记录\*\*:在 \*\*5 个基准\*\*上取得当时最高 reported score,分别为 AutomationBench(53.8)、BFCL v4(77.0)、DeepSearchQA(96.0)、BrowseComp(92.5)与 CyberGym(86.5)。 - \*\*前沿竞争力\*\*:在 SkillsBench、Workspace-Bench、WideSearch、MLE-bench Lite 等 \*\*3 个基准\*\*上位列第二或第一梯队。 - \*\*领域特征\*\*:在通用智能体任务上表现全面领先,在网络安全(CyberGym)上优势显著(领先第二名 2.0 分),在软件工程(SWE-bench Pro、Terminal-Bench)与机器学习工程(MLE-bench Lite)上保持前沿水平。 --- ### 四、案例验证:真实环境中的能力展示 论文通过四个应用方向的详细案例,补充了聚合指标无法反映的行为细节: | 方向 | 典型案例 | 关键验证 | |:---|:---|:---| | \*\*Discovery\*\* | 天气预测(处理 100 GB+ 数据,训练 4 亿参数 ViT 模型)、Gated Delta Network 解码优化 | 性能回归测试、形式化负载通过 | | \*\*Creation\*\* | MiniOS(20 分钟构建含持久文件系统与解释器的迷你 OS)、CAD 装配体 | QEMU 跨重启状态持久性验证、几何结构可视化 | | \*\*Delivery\*\* | 清洁能源选址、半导体投资强度分析报告 | 来源证据、计算、图表的组织与叙事 | | \*\*Cybersecurity\*\* | 网站漏洞诊断与修复 | 注入漏洞验证、修复后重新测试 | 这些案例展示了模型如何在工具链中衔接多阶段工作、依据实验反馈调整行动,并生成可外部检验的产物。 --- ### 五、人机协作的实证研究 论文将 Atria Dawn 自身的研发过程作为案例研究对象,分析了 \*\*56 名参与者\*\*的 \*\*769 条任务记录\*\*及智能体日志,核心发现包括: #### 1. AI 渗透与任务可行性 - \*\*96.5%\*\* 的明确记录任务使用了 AI。 - 在 455 条已完成任务中,\*\*33.2%\*\* 被评定为在同等范围与资源约束下\*\*无 AI 不可行\*\*(infeasible without AI),表明 AI 不仅压缩时间,更拓展了可执行工作的边界。 #### 2. 决策权的分布:提议与选择的分离 - \*\*目标与范围\*\*( n=603 ):人类做出最终选择的比例为 \*\*93.4%\*\*。 - \*\*方法与参数\*\*( n=567 ):AI 提出方案的比例为 \*\*55.4%\*\*,但人类最终拍板的比例仍高达 \*\*85.5%\*\*;AI 独立决定仅占 9.2%。 - 即使在“无 AI 不可行”的 151 条任务中,人类对最终目标的选择率仍达 \*\*95.4%\*\*。 #### 3. 执行密度的演变 - 对固定队列的纵向追踪显示,\*\*agent actions per human prompt\*\* 的日度中位数从 \*\*11.0\*\*(8 月初)上升至 \*\*28.5\*\*(9 月初),表明单次人类判断所驱动的智能体执行链显著延长,但个体差异同时扩大。 #### 4. 困难恢复与修订模式 - 在 588 条记录到困难的任务中,\*\*76.0%\*\* 因人类干预而推进,主要形式是“补充上下文/澄清需求”(35.2%)和“诊断问题/改变方法”(34.7%);人类直接接管仅占 \*\*0.7%\*\*。 - 在 627 条任务中,\*\*95.9%\*\* 的 AI 输出最终进入交付物;在 354 条经历实质性修订的任务中,\*\*75.4%\*\* 由 AI 在人类反馈后自行完成修订,人类直接编辑仅占 19.2%。 这些结果共同描绘了一种\*\*“项目级伙伴关系”\*\*:人类集中于判断“何为值得追求”与“证据如何指导研究”,而智能体负责生成方案、执行实验与产出修订。 --- ### 六、开放挑战 基于上述经验,论文提出了从“AI 参与研发”迈向“递归自我改进”需面对的四个核心挑战: 1. \*\*多样化研究方向的价值预判\*\*:如何让 AI 自主提出跨领域的新颖假设,并在实验前评估其潜在价值,而非仅在既定方向内做方法变体。 2. \*\*经验的递归内化\*\*:如何将长程探索中的失败与成功转化为模型的内在研究能力,而非单次会话的临时记录;可能需要架构层面的根本重设计(如测试时训练)。 3. \*\*人类监督的可持续性\*\*:当每个决策背后的智能体动作链超出人类详细审查能力时,如何防止人类退化为仅能表示同意/拒绝的仪式性节点,维持有意义的目标设定与纠错能力。 4. \*\*权威分配与对齐协议\*\*:随着 AI 主导更多研发,需建立动态的权限边界、对齐标准与问责机制,确保自主性不以牺牲可控性为代价。 --- ### 七、结论 Atria Dawn Preview 通过可验证经验管道训练,在 16 个基准上展示了具有竞争力的智能体能力。更重要的是,论文基于真实研发记录表明:\*\*智能体正从“任务级执行者”转变为“项目级合作者”,但人类的最终决策权与研究判断力仍不可替代。\*\* 迈向更自主的 AI 研发,必须同时推进智能体的发现能力与人类有意义监督的能力,在效率与安全之间保持动态平衡。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [**这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是Atria%20Dawn%3A%20The%20Dawn%20of%20Agentic%20Superintelligence,链接是https://arxiv.org/pdf/2609.15818,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.15818。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Honglin Guo,Tao Gui,Yicheng Chen,Guanting Dong,Qiming Ge,Yuyang Hu,Zixian Huang,Jiajie Jin,Alexander Lam,Yining Li,Jiahang Lin,Yanjiang Liu,Xinyu Lu,Haijun Lv,Junlin Shang,Qisheng Su,Guoqiang Wang,Rui Wang,Zhecan Wang,Hao Xiang,Xinchen Xie,Shuhao Xing,Xiaoyu Xing,Wanghan Xu,Xinyu Yang,Yajie Yang,Chengfeng Zhao,Haoran Zhao,Ruojun Zhou,Yunhua Zhou,Yicheng Zou,Kun Cai,Qiye Cai,Xinmeng Che,Haodong Chen,Jiabei Chen,Jiahao Chen,Jiayi Chen,Yujia Chen,Lizhi Cui,Youheng Dai,Xin Deng,Yi Dong,Shihan Dou,Chenya Gu,Xu Guo,Ding Han,Feiyang Hao,Haotan He,Jie Hou,Binze Hu,Zijian Hu,Junhao Huang,Huicheng Jiang,Jiazhen Jiang,Shufan Jiang,Jiahao Kuang,Bowen Lai,Bo Li,Jiaqiang Li,Peng Li,Qilong Li,Zhuoqun Li,Jiaxiang Liu,Shuainan Liu,Tong Liu,Yi Liu,Zhonghang Lu,Jianwen Luo,Yanyi Luo,Huijie Lv,Ningsheng Ma,Zerun Ma,Houcheng Min,Chengjun Pan,Qiyuan Peng,Xiaoxuan Peng,Jianmin Qian,Jiantao Qiu,Wanying Ren,Huayu Sha,Jifei Shan,Zixin Shang,Bing Shao,Zhuohui Sheng,Jiayang Shi,Yang Shu,Aierpanjiang Simayi,Sirui Song,Yuxiao Song,Zhe Sun,Zhichao Sun,Wenzhe Tan,Wenhui Tian,Zhongbo Tian,Hanchen Wang,Pengbo Wang,Rui Wang,Yiding Wang,Yuhui Wang,Zhiheng Xi,Caijun Xu,Chao Xu,Yongfeng Xu,Xiaolei Yang,Zhixiong Yang,Qian Yao,Shihong Yi,Yuankai Ying,Jia Yu,Dingbo Yuan,Hao Yuan,Junjie Yuan,Bo Zhang,Caixian Zhang,Qiuyinzhe Zhang,Jiyuan Zhao,Penghao Zhao,Ying Zhao,Pujun Zheng,Xiaoxue Zhong,Xiaohao Zhou,Xinyu Zhou,Dongsheng Zhu,Guanru Zhu,Yulun Zhu,Yaojie Lu,Tao Ji,Hongyu Lin,Yutao Zhu,Pengfei Cao,Guoxiu He,Xianpei Han,Ben He,Zhicheng Dou,Kang Liu,Qi Zhang,Le Sun,Jun Zhao,Ji-Rong Wen,Xuanjing Huang,Yu-Gang Jiang,Bowen Zhou,et al. (43 additional authors not shown)
Categories:
PDF URL: https://arxiv.org/pdf/2609.15818.pdf
Arxiv URL: https://arxiv.org/abs/2609.15818
Arxiv ID: 2609.15818
CoolPaper URL: https://papers.cool/arxiv/2609.15818
Published: 2026-09-16T01:38:42.624Z
Updated: 2026-09-16T01:38:42.624Z
3. ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search
Abstract:In this work, we present ZGCM-1, a fully open 7B dense foundation model trained from scratch with extreme data, system, and algorithmic efficiency. ZGCM-1 is founded on a core premise: compact models cannot passively memorize the open web, but can overcome parametric capacity limits by coupling deliberate internal thinking with active external tool use. To support this paradigm across a 256K context, we develop an end-to-end, high-efficiency open training recipe: Architecture & System Co-design: interleaved gated sliding-window and full attention, and a stable FP8 Muon optimizer; Progressive Curriculum & MDP Mid-Training: context scaling across 16K, 64K, and 256K, and the reformulation of interaction traces into Markov Decision Processes. Furthermore, we establish an AI-native R&D workflow where agent swarms autonomously manage cluster operations, data curation, and rapid diagnostic evaluation. Extensive evaluations show that ZGCM-1-7B is competitive across 7B model family on general benchmarks. On several challenging mathematical reasoning and agentic search suites, it remains competitive with frontier models orders of magnitude larger, such as Qwen3-235B-A22B and GLM-5.1. We also show that our pre-training design offers a ~4.2x efficiency improvement in 16K pre-training time-to-loss. Across the full development lifecycle, we distill eight actionable empirical findings-spanning architectural scaling, SFT quality pruning, long-context generalization, and agentic co-training dynamics. To facilitate community research, we open-source model weights from the pre-training, mid-training, and post-training stages, intermediate checkpoints, training code, per-stage data and data recipes, and W&B logs.
中文摘要
摘要:在本工作中,我们提出了 ZGCM-1,这是一种完全开源的 7B 密集基础模型,从零开始训练,具备极高的数据、系统和算法效率。ZGCM-1 基于一个核心前提:紧凑型模型无法被动地记忆开放网络,但可以通过将有意识的内部思考与主动的外部工具使用相结合,克服参数容量的限制。为了在 256K 上下文中支持这一范式,我们开发了一套端到端、高效的开放训练方案:架构与系统协同设计:交替门控滑动窗口与全注意力机制,以及稳定的 FP8 Muon 优化器;渐进课程与中期 MDP 训练:上下文扩展涵盖 16K、64K 和 256K,并将交互轨迹重新表述为马尔可夫决策过程。此外,我们建立了一个 AI 原生的研发工作流,其中智能体群体自主管理集群操作、数据整理和快速诊断评估。大量评估表明,ZGCM-1-7B 在 7B 模型家族中在通用基准上具有竞争力。在若干具有挑战性的数学推理和智能体搜索套件中,它仍与规模大几个数量级的前沿模型(如 Qwen3-235B-A22B 和 GLM-5.1)保持竞争力。我们还展示了我们的预训练设计在 16K 预训练时间到损失上提供了约 4.2 倍的效率提升。在整个开发生命周期中,我们提炼了八个可操作的经验结论——涵盖架构扩展、SFT 质量剪枝、长上下文泛化以及智能体联合训练动态。为了促进社区研究,我们开源了预训练、中期训练和后期训练阶段的模型权重、中间检查点、训练代码、各阶段数据及数据方案,以及 W&B 日志。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文试图解决基础模型领域中的两个核心瓶颈: \*\*1. 规模壁垒(The Scale Barrier)\*\* 前沿的数学推理与深度智能体搜索能力长期被视为数百亿乃至千亿参数模型的专属领地,极高的计算需求将资源受限的学术社区排斥在训练与探索之外。论文质疑了“先进智能必须依赖巨大参数量”这一普遍假设,提出并验证了一个核心命题:紧凑型模型(7B规模)虽受限于静态参数容量,但能够通过\*\*审慎的内部长链思考(deliberate internal thinking)\*\*与\*\*主动的外部工具使用(active external tool use)\*\*的结合,突破参数边界,在极具挑战的推理与智能体任务上达到甚至超越数量级更大的前沿模型表现。 \*\*2. 透明度壁垒(The Opacity Barrier)\*\* 当前多数具有竞争力的模型仅以“开放权重”形式发布,而非完全开源。上游的数据过滤配方、中期训练课程、长上下文扩展策略以及多轮智能体交互轨迹等关键训练细节仍属专有黑箱。这阻碍了对训练动态、能力涌现机制以及模型容量极限的系统性学术研究。为消除这一障碍,论文提供了ZGCM-1的端到端完全开放方案,包括: - 预训练、中期训练和后训练各阶段的模型权重 - 中间检查点与训练代码 - 每阶段的数据配方与处理流水线 - 详细的W&B训练日志与评估工具 简言之,该工作旨在\*\*在学术可负担的计算预算下,通过系统级的效率优化与“思考+工具”的范式耦合,构建一个完全透明、高性能的7B基础模型\*\*,使广泛的研究社区能够参与并复现前沿级的数学推理与智能体搜索研究。 Q2: 有哪些相关研究? 根据论文的文献综述与引用,相关研究可归纳为以下几个方向: ### 1. 大语言模型与推理前沿 - \*\*长程推理模型\*\*:DeepSeek-AI(2026)、Kimi Team(2026)等通过扩展推理链推动了长程思维链(Chain-of-Thought)的边界。 - \*\*工具增强的智能体\*\*:GLM-5-Team(2026)、Qwen Team(2026)、OpenAI(2026)、Anthropic(2026)等探索了在真实环境中利用工具进行深度代理搜索(agentic search)。 - \*\*开放权重模型\*\*:Qwen3系列、MiniCPM4.1、Olmo-3、MiMo等7B–8B规模模型构成了该文直接对比的基线。 ### 2. 高效架构与注意力机制 - \*\*混合与稀疏注意力\*\*:Longformer(Beltagy et al., 2020)、Sparse Transformers(Child et al., 2019)以及 Gemma 3(Gemma Team, 2025)采用的交错局部-全局注意力策略,为本文的 \*\*5:1 门控滑动窗口注意力(Gated SWA)\*\* 提供了基础。 - \*\*注意力变体\*\*:MLA(DeepSeek-AI, 2024)、FlashAttention-2(Dao, 2023)、GQA(Ainslie et al., 2023)以及门控注意力机制(Qiu et al., 2025)。 - \*\*归一化与位置编码\*\*:RMSNorm(Zhang and Sennrich, 2019)、SwiGLU(Shazeer, 2020)、RoPE(Su et al., 2024)及 QK-Norm(Dehghani et al., 2023)。 ### 3. 训练效率与优化 - \*\*低精度训练\*\*:FP8 格式与混合精度训练(Micikevicius et al., 2022)。 - \*\*优化器\*\*:Muon 优化器(Jordan et al., 2024; Liu et al., 2025)在隐藏层参数上的可扩展应用。 - \*\*激活正则化\*\*:TWEO(Liang et al., 2025)用于抑制极端异常值,支撑稳定的 FP8 预训练。 - \*\*开放训练基线\*\*:OLMo 3(Team Olmo, 2025)作为 BF16/AdamW 的效率对比基准。 ### 4. 数据筛选、课程学习与预训练 - \*\*数据混合优化\*\*:RegMix(Liu et al., 2024)、SmolLM2 的数学数据配方(Allal et al., 2025)以及代理模型驱动的混合搜索。 - \*\*课程学习\*\*:Zhang et al.(2026)展示了按难度排序训练样本可提升预训练效率;本文进一步发现\*\*词汇复杂度\*\*对通用语言有效,但对代码与数学不可靠。 - \*\*数学与科学语料\*\*:Llemma / Proof-Pile-2(Azerbayev et al., 2023)、RedPajama(Together Computer, 2023)、olmOCR(Poznanski et al., 2025)、FinePDFs(Kydlíček et al., 2025)及 Nemotron 专用推理数据(NVIDIA, 2025c)。 ### 5. 长上下文建模 - \*\*渐进式上下文扩展\*\*:Qwen2.5-1M(Yang et al., 2025b)采用多阶段长度扩展;本文在此基础上推进至 \*\*16K → 64K → 256K\*\* 的渐进课程。 - \*\*单阶段扩展\*\*:其他技术报告(如 Xiaomi MiMo、Qwen3)选择在单一最终预训练阶段完成扩展。 ### 6. 智能体数据与交互建模 - \*\*智能体持续预训练\*\*:Su et al.(2025)将交互轨迹用于持续预训练;本文进一步将其重构为 \*\*马尔可夫决策过程(MDP)状态-动作监督\*\*。 - \*\*交互范式\*\*:ReAct(Yao et al., 2023)的推理-行动循环被用于深度研究评估。 - \*\*智能体数据治理\*\*:WebDancer(Wu et al., 2025a)等专注于网络信息检索代理。 ### 7. 后训练与强化学习 - \*\*监督微调\*\*:Tulu 3(Lambert et al., 2024)、FLAN(Wei et al., 2022)为指令数据构建提供基础。 - \*\*强化学习算法\*\*:GRPO(Shao et al., 2024)及其带有参考策略 KL 正则化的变体。 - \*\*训练稳定性技术\*\*:动态采样过滤零方差组(Yu et al., 2025)与长度惩罚被用于稳定长程优化。 ### 8. 评估基准 - \*\*数学推理\*\*:MATH-500、AIME 2024/2025/2026、HMMT 2025/2026、AGIEval SAT Math、AQuA-RAT、HARDMath-mini、IMO-AnswerBench、MATH-P-Hard、OlympiadBench、miniF2F。 - \*\*代码生成\*\*:HumanEval+、MBPP+、LiveCodeBench v6。 - \*\*知识与指令\*\*:MMLU、GPQA-Diamond、IFEval。 - \*\*智能体与工具使用\*\*:WebWalkerQA、BrowseComp、GAIA、Binary Function Search(本文自建)、SWE-bench、Terminal-Bench 2.0。 - \*\*抽象推理\*\*:ARC-AGI-1(Chollet, 2019)。 Q3: 论文如何解决这个问题? 论文通过\*\*端到端的高效开放训练配方\*\*与\*\*“内部思考+外部工具”的能力范式\*\*,系统性解决了前述的双瓶颈。具体而言,解决方案可归纳为以下四个层面: --- ### 1. 架构与系统协同设计:以极端效率压缩训练成本 为在学术级计算预算下完成 7B 模型的全周期训练,论文采用了多层级的效率优化,将预训练时间-损失(time-to-loss)提升约 4.2 倍: | 技术组件 | 具体方案 | 效率收益 | |---------|---------|---------| | \*\*混合注意力\*\* | 以 5:1 比例交错\*\*门控滑动窗口注意力(SWA)\*\*与全局注意力,27 层 SWA(128-token 窗口)+ 5 层全局注意力 | 256K 上下文下吞吐量提升 \*\*3.94×\*\*,KV 缓存减少 \*\*6.4×\*\* | | \*\*低精度训练\*\* | 矩阵乘法采用 FP8(E4M3 前向 / E5M2 后向)配合延迟缩放 | 约 \*\*1.5×\*\* 速度提升 | | \*\*优化器\*\* | 矩阵参数使用 \*\*Muon\*\*(谱缩放 + Newton–Schulz 迭代),标量参数使用 Adam | 约 \*\*1.8×\*\* 步级效率提升 | | \*\*激活正则化\*\* | \*\*TWEO\*\* 抑制中间激活异常值,防止 FP8 数值发散 | 支撑稳定训练,维持约 \*\*60% BF16 等效 MFU\*\* | | \*\*预层归一化\*\* | Pre-LN 架构 | 约 \*\*1.1×\*\* 数据效率提升 | 上述因素的累积效应为:
1.4 × 1.5 × 1.8 × 1.1 ≈ 4.2
—- ### 2. 渐进课程与 MDP 中期训练:激活长上下文与智能体能力 为在 256K 长上下文上支持深度推理与工具交互,论文设计了三阶段中期训练(Mid-Training),在 **600B token** 上逐步扩展上下文长度,并重构监督信号: - **上下文渐进扩展**: 16K arrow 64K arrow 256K ,每阶段保留更短序列的回放数据,避免长上下文覆盖导致的常规任务退化。 - **MDP 状态-动作监督**:将多轮智能体交互轨迹重新建模为**马尔可夫决策过程(MDP)**的单步状态-动作转移,使模型在完整轨迹上下文之外,获得密集的局部决策监督。 - **能力导向的数据混合**:代码与数学各占约 20%,随长度增长逐步提升知识(10.5% → 14.2%)与智能体数据(1.5% → 3.3%)的比重。 —- ### 3. 后训练校准:以数据质量与双模式监督释放模型潜力 后训练阶段通过精细的数据工程进一步弥补参数规模的局限: - **分层质量筛选(SFT)**:对候选 SFT 数据执行规则过滤与模型质量评分,**剪枝约 50% 的低质量样本**。实验表明,质量优先策略将六基准均值从 67.78 提升至 68.83,证明数据质量优于数量。 - **联合 think/no-think 训练**:故意混合同权重下的显式推理轨迹(think)与直接回答(no-think)样本,使单一模型能根据系统指令动态切换深度思考与高效应答。该联合训练还产生了正向跨模态迁移:结构化推理监督直接提升了直接应答模式下的数学与代码准确率。 - **混合强化学习(RL)**:采用 GRPO 与基于结果的二元/测试通过率奖励,辅以 KL 正则化与长度惩罚,在数学与代码等单领域任务上进一步获得能力增益。 —- ### 4. AI 原生研发与完全开源:消除透明度壁垒 论文不仅发布最终模型,而是开放整个研发周期的全部资产,以消除“黑箱”障碍: - **全阶段权重开放**:预训练、中期训练、后训练各阶段权重及中间检查点。 - **训练基础设施开放**:训练代码、配置、每阶段数据配方与处理流水线、W&B 日志。 - **AI 原生 R&D 工作流**:将智能体集群(Agent Swarms)嵌入数据清洗、集群管理、自动实验与原子能力评估(ACE)中,形成可复现、可诊断的迭代闭环。 —- ### 5. 核心范式:用“思考+工具”突破参数容量边界 针对规模壁垒的根本解在于**能力范式**的转换:ZGCM-1 不试图被动记忆整个开放网络,而是将自身定位为**具备长程内部推理与主动外部寻求能力的紧凑系统**。在评估中,该 7B 模型通过审慎的 CoT 推理与自主工具调用(网络搜索、终端交互、Ghidra 二进制分析),在 AIME 2026(75.0%)、WebWalkerQA(63.1%)和 Binary Function Search(62.0%)等任务上,达到了数量级更大的前沿模型(如 Qwen3-235B-A22B、GLM-5.1)的同等水平。 Q4: 论文做了哪些实验? 论文围绕**架构效率**、**训练动态**、**数据策展**、**能力评估**与**AI原生研发**五个维度展开系统性实验,具体如下: —- ### 1. 架构设计与效率实验 为选定生产级注意力方案,论文在固定算力预算下训练多种 7B 规模配置 10B token,对比了全注意力、Flash-GQA、MLA 以及三种滑动窗口注意力(SWA)比例(1:1、3:1、5:1): - **优化质量 vs 吞吐量权衡**:以最后 50 步平均损失(tail loss)与每 GPU 每秒处理 token 数(tokens/s/GPU)为指标。SWA 5:1 达到最高吞吐量(9,566 tokens/s/GPU),同时 tail loss(1.93)与全注意力基线持平;SWA 3:1 tail loss 最低(1.92)但吞吐量略低;MLA 吞吐量显著下降(7,645)且未改善损失。生产模型最终采用 **SWA 5:1**。 - **长上下文吞吐量扩展**:在 4K 至 256K 序列长度上比较全注意力、SWA 3:1 与 SWA 5:1。SWA 5:1 的加速比随长度增长而扩大,从 4K 的 **1.13×** 提升至 256K 的 **3.94×**。 - **KV 缓存内存分析**:在 256K 上下文、batch=1、bf16 条件下,全注意力需 32.0 GiB,线性注意力基线(GDN 3:1)需 7.0 GiB,而混合 SWA 5:1 仅需 **5.0 GiB**,较全注意力减少 **6.4×**。 —- ### 2. 预训练与中期训练实验 #### 2.1 课程预训练(Curriculum Pre-training) 使用 7B 探针模型训练 10B token,对比随机采样与基于**词汇复杂度**的课程排序: - 对非代码、非数学的通用语言文档按词汇复杂度由低到高排序,代码与数学独立交错。 - 结果:代码 BPB 从 1.99 降至 **0.81**,数学 BPB 从 0.97 降至 **0.94**;通用基准(MMLU、ARC、HellaSwag)BPB 上升 0.03–0.09。 - **Finding 1**:词汇复杂度是通用语言数据的有效排序信号,但对代码与数学不可靠,因其表面统计难以反映算法或推理深度。 #### 2.2 数据混合探索 使用 **0.3B 参数代理模型**在约 30B token 上迭代搜索最优数据配比,以训练损失与领域评估信号为指导,最终将配方迁移至 7B 目标模型。 #### 2.3 中期训练上下文扩展 对比两种达到 256K 的路径: - **直接路径**:在 256K 上下文上训练 30B token,最终损失 1.19。 - **分阶段路径**:先在 64K 上训练 10B token,再在 256K 上训练 20B token,最终损失 **1.16**(略优),故被选为生产方案。 #### 2.4 训练动态监控 - **基础检查点直接评估**:在通用预训练期间保存 54 个检查点(0.04T–4.19T token),直接以基座模型形式评估知识、问答、数学、代码、推理等能力。结果显示各领域能力发展**异质**且非单调,代码与较难数学基准在训练后期仍有提升,而通用知识在 2.5T 后边际收益递减。 - **短 SFT 探针**(Short-SFT Probe):对中期训练里程碑进行轻量 SFT 后评估。从通用预训练结束到中期训练结束,MATH-500 从 35.83% 升至 **74.12%**,HumanEval+ 从 43.29% 升至 **73.78%**,验证中期训练对下游潜力的显著提升。 —- ### 3. 后训练与数据策展实验 #### 3.1 SFT 数据质量消融 从同一基座检查点出发,使用三种过滤强度的数据快速微调: - 最小处理(~2.08M 样本):六基准均值 **67.78** - 广泛过滤(~1.833M 样本):均值 67.98 - 质量聚焦过滤(~1.145M 样本,剪枝约 50%):均值 **68.83** **Finding 4**:在受控比较中,激进的分层过滤(剪枝约半数候选)优于未经筛选的完整语料,表明后训练中**数据质量优于数量**。 #### 3.2 长 CoT 比例校准 通过网格搜索与候选运行评估,发现过度增加长链思维(CoT)轨迹比例会引入**冗长偏见**并损害指令遵循。通过动态校准长推理、直接回答与格式指令的比例,找到帕累托最优混合。 **Finding 5**:长 CoT 监督呈现**非单调效用**;过饱和会降解通用指令遵循性能,需动态校准以兼顾推理增益与指令遵循。 #### 3.3 Think/No-Think 联合训练 对比仅使用直接回答数据的检查点与混合理性轨迹后的检查点,在 **no-think 模式**下评估: - AIME 2025 从 10.00% 提升至 **43.33%**(+33.33) - AIME 2024 从 6.67% 提升至 **33.33%**(+26.66) - MBPP+ 从 55.03% 提升至 **75.93%**(+20.90) **Finding 7**:中期训练建立的长上下文基础使得在 SFT 阶段**无需昂贵的 256K 长推理轨迹**,即可在 256K 尺度上激活长序列能力。 #### 3.4 通用与智能体数据调度对比 对比两种 SFT 调度: - **顺序调度**:先通用数据,后智能体数据。 - **联合调度**:全程交错通用与智能体样本。 候选运行评估显示**联合调度**下游性能更优,被用于最终训练。 **Finding 6**:仅使用智能体数据微调会导致交互保真度下降;与通用指令数据**联合训练**为逐步推理与精确约束遵循提供不可或缺的基础。 #### 3.5 混合强化学习实验 在数学、代码与通用能力任务上执行 GRPO: - 探索两种采样规模:(a)24 问题 × 16 回复 = 384 轨迹/步;(b)384 问题 × 8 回复 = 3,072 轨迹/步。 - 最大生成长度 65,536 token,总上下文预算 98,304 token。 - 结合结果奖励、KL 正则化与长度惩罚以稳定长程优化。 —- ### 4. 模型评估实验 #### 4.1 7B–8B 规模基准对比 在 20 个基准上与 6 个同规模推理模型对比(表 2),涵盖: - **数学与推理**:MATH-500(**97.13%**)、AIME 2024/2025/2026、HMMT 2025/2026、AGIEval SAT Math、AQuA-RAT、HARDMath-mini、IMO-AnswerBench、MATH-P-Hard、OlympiadBench、miniF2F、ARC-AGI-1。 - **代码**:HumanEval+(**90.24%**)、MBPP+、LiveCodeBench v6。 - **知识**:MMLU、GPQA-Diamond。 - **指令遵循**:IFEval。 ZGCM-1-7B 在 14 项推理基准的**平均排名**上位列 7B–8B 规模模型首位。 #### 4.2 智能体评估 - **网络环境深度研究**:在 WebWalkerQA(**63.09%**)、BrowseComp(**19.43%**)与 GAIA text-only(**42.52%**)上评估,使用思考启用的 ReAct 策略,最多 64 步搜索-阅读。 - **二进制函数搜索**(Binary Function Search):在自建的 50 任务基准上,使用 Ghidra 支持的交互协议。模型需根据行为描述在剥离符号的 ELF 二进制中定位目标函数入口地址。ZGCM-1-7B 达到 **62%** 准确率,远超同规模基线(Qwen3-8B 为 12%),并接近 GLM-5.1(66%)与 Kimi-K2(62%)。 #### 4.3 原子能力评估(ACE) 构建包含 **2,503 个探针**、**183 项原子能力**、**18 个类别**的诊断框架。对 ZGCM-7B 与多个参考模型进行对比: - ZGCM-7B 最强项:数学(98.18%)、规划(97.78%)、逻辑(96.08%)。 - 最弱项:指令遵循(49.74%)、真实性(68.91%)、代码(72.24%)。 - 相比同规模 Qwen3-8B-256K,在长上下文(+31.11pp)、算术(+20.74pp)与世界建模(+10.00pp)上优势最大。 —- ### 5. AI 原生研发与自主性评估 #### 5.1 训练系统监控实验 在训练过程中,通过持续监控发现:恢复训练后吞吐量在约 80 步内从 585 逐渐下降至 554 TFLOP/s/GPU。实验性诊断表明释放重叠缓冲区不足以消除衰退;最终通过**每 100 次迭代周期性清理 CUDA 分配器缓存与垃圾回收**,恢复并稳定了 585 TFLOP/s/GPU 的吞吐量。 #### 5.2 AI4AI 自主性评级实验 9 名核心贡献者依据 5 级自主性量表(L1–L5)对 11 个 R&D 任务类别进行评级(共 99 个评级),结果: - **L4(高自主性)**:实验与监控、部署工程。 - **L3(条件自主)**:数据清洗、数据获取、合成数据生成、算子设计、训练/推理框架设计、资源平台管理、模型评估。 - **L2(部分自动化)**:模型架构设计、学习算法设计(无任何评级超过 L3)。 **Finding 8**:AI 自主性具有**任务依赖性**;运营类任务可达 L4,而架构与算法设计停留在 L2,表明设计类任务仍高度依赖人类判断。 —- ### 6. 关键效率验证实验 论文将 16K 预训练的 time-to-loss 与 OLMo 3 风格的 BF16/AdamW 基线进行估算:
1.4 × 1.5 × 1.8 × 1.1 ≈ 4.2
其中 1.4× 来自 SWA 5:1,1.5× 来自 FP8,1.8× 来自 Muon,1.1× 来自 Pre-LN,验证了**系统-算法协同设计**带来的约 **4.2×** 端到 Q5: 有什么可以进一步探索的点? 基于论文的局限性分析与未来展望,可从以下几个层面展开进一步探索: —- ### 1. 架构与系统效率的延伸 - **向稀疏 MoE 架构扩展** 当前 ZGCM-1 采用 7.39B 参数的稠密架构。将混合 SWA、Muon 优化与 MDP 中期训练等配方迁移至稀疏混合专家(Mixture-of-Experts, MoE)主干,可在保持低推理 FLOPs 的前提下扩展参数容量与领域专精能力,验证该效率配方在更大激活参数空间下的可扩展性。 - **超长上下文(1M+)的注意力机制** 论文在 256K 上下文上验证了 SWA 5:1 的高效性。进一步探索在百万级甚至更长上下文中的注意力调度策略(如自适应窗口、动态全局层放置),以及如何维持 KV 缓存的次线性增长,是一个自然的延伸。 - **低精度训练的极限** TWEO + FP8 + 延迟缩放的组合在 7B 规模上实现了稳定训练。未来可探索 FP4/FP6 等更低精度格式,或将其与逐层/逐张量自适应精度策略结合,以进一步压缩训练与推理的显存和计算开销。 —- ### 2. 智能体与交互式学习 - **端到端交互式强化学习** 现有后训练仍主要依赖基于结果的奖励(answer correctness / test pass rate)与 token-level SFT。未来可转向在真实执行沙盒(终端、网页、编译器环境)中进行**多轮、交互式 RL**,使策略直接在环境反馈上优化长程工具调用序列,而非仅依赖离线轨迹监督。 - **自主动态知识检索的统一框架** 当前模型通过显式工具调用来补偿参数知识。下一步可探索将预训练表示与**动态检索子程序**深度融合:当模型检测到参数不确定性(如通过熵阈值或置信度估计)时,自主触发检索、验证与重推理的闭环,而非依赖硬编码的 ReAct 循环。 - **多智能体协作与任务分解** MDP 中期训练目前针对单智能体轨迹。将其扩展至多智能体协作场景(如分布式软件工程、多角色研究代理),建模状态-动作空间中的通信协议与角色分工,是提升复杂系统代理能力的重要方向。 —- ### 3. 数据与训练动态 - **课程学习信号的深化** 论文发现词汇复杂度对代码与数学并非可靠的难度代理。未来需开发**语义级或执行级难度度量**(如程序分支复杂度、证明长度、运行时资源消耗),以构建对技术领域更优的课程排序。 - **SFT 数据筛选的自动化** 当前质量筛选依赖规则与模型评分的混合管线。可探索基于**下游任务反馈的自适应数据选择**(如通过影响力函数或课程采样),使数据筛选本身成为一个可学习的优化问题,进一步压缩后训练成本。 - **智能体数据的规模与多样性** 智能体数据仅占中期训练的 1.5%–3.3%。系统性地扩大高质量交互轨迹的覆盖范围(如跨操作系统、跨编程语言、跨自然语言界面),并研究其对模型涌现长程规划能力的影响,具有显著潜力。 —- ### 4. AI 原生研发(AI4AI)的自主性提升 - **从 L2/L3 到 L4/L5 的设计任务自主化** 论文评估显示,模型架构设计与学习算法设计仍停留在 L2,且从未超过 L3。未来需探索如何让智能体具备**假设生成与算法发明**能力,例如通过自动化的符号回归、超参数搜索空间的形式化表示,以及跨阶段目标协调机制。 - **自我演进的合成环境设计** 将 AI 原生研发从“集群监控 + 数据清洗”扩展到**自动构建对抗性评估环境**与**生成合成训练任务**,形成闭环的自我改进系统。这包括自动发现模型弱点、针对性地生成增强数据、并验证修复效果。 - **可解释的失败模式诊断** Atomic Capability Evaluation(ACE)提供了细粒度诊断。下一步可让智能体基于 ACE 结果自主定位缺陷根因(如“注意力机制导致长上下文位置偏差”或“某类工具调用格式欠拟合”),并自动生成修复方案(数据重采样、架构微调或 RL 奖励重塑)。 —- ### 5. 评估与安全 - **闭卷知识与事实召回的极限** 7B 稠密模型在纯闭卷、高召回需求任务上仍受限于参数容量。未来需量化**参数知识边界**与**外部检索补偿**的精确权衡曲线,并开发更高效的参数-外部记忆混合架构。 - **推理冗长与指令遵循的帕累托前沿** 论文观察到重推理监督会轻微损害严格指令遵循。进一步探索**推理预算的动态分配机制**(如基于任务复杂度自适应思考深度),以及在 RL 阶段引入指令遵循与推理质量的多目标优化,可改善此权衡。 - **工具协议鲁棒性** 当前智能体对工具格式偏差与观察噪声较为脆弱。研究**格式容错推理**(如在不完美 JSON 或截断输出下恢复)与**延迟/噪声环境下的鲁棒决策**,对真实世界部署至关重要。 Q6: 总结一下论文的主要内容 该论文提出了 **ZGCM-1**,一个完全开源的 7.39B 稠密基础模型,专为数学推理与智能体搜索任务设计,支持长达 256K 的上下文。以下是论文的主要内容总结: —- ### 1. 研究动机与核心论题 论文针对基础模型发展的两大壁垒展开工作: - **规模壁垒**:前沿推理与深度智能体搜索长期被默认为百亿乃至千亿参数模型的专属领域,高昂计算成本将学术社区排除在外。 - **透明度壁垒**:主流开放权重模型并未公开训练配方、数据策展策略与中间过程,阻碍了系统性的基础研究。 论文的核心论题为:**紧凑型模型虽受限于静态参数容量,但可通过“审慎的内部长链思考”与“主动的外部工具使用”之耦合,突破参数边界**,在不依赖被动记忆开放网络的前提下,弥补知识缺口。 —- ### 2. 端到端高效训练配方 #### 2.1 架构与系统协同设计 - **混合注意力机制**:以 5:1 比例交错**门控滑动窗口注意力(SWA,128-token 窗口)**与全局注意力(27 层 SWA + 5 层全局)。在 256K 上下文下,KV 缓存较全注意力减少 **6.4×**,推理吞吐量提升 **3.94×**。 - **低精度与稳定训练**:采用 FP8(E4M3 前向 / E5M2 后向)混合精度,结合 **TWEO** 激活正则化抑制异常值,并配合 **Muon 优化器**(矩阵参数)与 Adam(标量参数)。 - **效率增益**:上述设计与 Pre-LN 架构协同,在 16K 预训练中实现相对 BF16/AdamW 基线约 **4.2×** 的 time-to-loss 加速:
1.4 × 1.5 × 1.8 × 1.1 ≈ 4.2
2.2 渐进课程与 MDP 中期训练 - **上下文扩展**:中期训练以 600B token 分三阶段扩展序列长度: 16K arrow 64K arrow 256K ,每阶段保留更短序列的回放数据。 - **MDP 监督**:将多轮智能体交互轨迹重构为**马尔可夫决策过程(MDP)**风格的状态-动作转移,提供密集的逐步决策监督,而非仅复现完整轨迹。 #### 2.3 后训练校准 - **分层 SFT 数据筛选**:通过规则过滤与模型质量评分对候选数据执行**约 50% 的激进剪枝**,实证表明质量优于数量。 - **联合 Think/No-Think 训练**:在 SFT 中混合同权重的显式推理轨迹(think)与直接回答(no-think),使模型能根据指令动态切换模式,且结构化推理监督对直接回答产生正向迁移。 - **混合强化学习**:采用 GRPO 结合结果奖励、KL 正则化与长度惩罚,在数学与代码等单领域任务上进一步增益。 —- ### 3. 实验与评估结果 #### 3.1 与同规模模型对比(7B–8B) 在 20 项标准基准的广泛评估中,ZGCM-1-7B 在 14 项推理基准上**平均排名第一**: - **数学推理**:MATH-500 **97.13%**,AIME 2026 **75.00%**,HMMT 2025 **70.42%** - **代码生成**:HumanEval+ **90.24%**,MBPP+ **63.23%** - **知识**:MMLU **73.88%**,GPQA-Diamond **47.87%** #### 3.2 与前沿大模型对比(智能体任务) 通过结合深度推理与自主工具调用,7B 模型在智能体任务上可与数量级更大的系统竞争: - **WebWalkerQA**:**63.09%** - **BrowseComp**:**19.43%** - **Binary Function Search**(自建基准):**62.00%** 后两项接近或持平 GLM-5.1、Kimi-K2、Claude 4 Sonnet 等大规模模型。 —- ### 4. AI 原生研发(AI-Native R&D) 论文构建了一套由研究者指导、智能体集群(Agent Swarms)执行的 R&D 工作流,覆盖数据清洗、集群管理、自动实验、原子能力评估(ACE)与部署。对 11 类 R&D 任务的自主性评估显示: - **L4(高自主)**:实验监控、部署工程 - **L3(条件自主)**:数据清洗、资源管理、模型评估等 - **L2(部分自动化)**:模型架构设计、学习算法设计(暂无评级超过 L3) —- ### 5. 八大经验发现(Findings) 论文在全生命周期中提炼了八条可操作的实证发现,涵盖: 1. 词汇复杂度课程对通用语言有效,但对代码与数学不可靠; 2. TWEO 对 FP8 训练稳定性至关重要; 3. 系统-算法协同设计带来约 4.2× 预训练效率提升; 4. 后训练中数据质量优于数据数量; 5. 长 CoT 监督存在非单调效用,需动态校准; 6. 智能体训练必须与通用指令数据联合进行; 7. 中期训练建立的长上下文基础可规避超长的后训练轨迹需求; 8. AI 自主性高度依赖任务类型,设计与运营任务差距显著。 —- ### 6. 开放科学贡献 为消除透明度壁垒,论文公开了: - 预训练、中期训练、后训练**全阶段模型权重**及中间检查点 - **训练代码**、配置与超参数 - **每阶段数据配方**、处理流水线与 W&B 日志 - 评估工具链与自建基准(Binary Function Search) Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Jiyan He,Guang Liang,Hao Liu,Haoxiang Guan,Jinbo Sun,Junyi Guo,Wenjun Feng,Yantai Xie,Yifei Shen,Bin Shao,Chuyang Wei,Kai Chen,Kexin Zhou,Minghang Zhu,Shuxin Zheng,Tie-Yan Liu,Taine Zhao,Wenhui Zhu,Xueyin Xu,Xiaoqing Zhang,Yatao Li,Yuxuan Ren
Categories:
PDF URL: https://arxiv.org/pdf/2609.13356.pdf
Arxiv URL: https://arxiv.org/abs/2609.13356
Arxiv ID: 2609.13356
CoolPaper URL: https://papers.cool/arxiv/2609.13356
Published: 2026-09-16T01:38:42.645Z
Updated: 2026-09-16T01:38:42.645Z
4. Dream-RSI: Recursive Self-Improvement through Evolving Worlds
Abstract:Recursive self-improvement is becoming increasingly vital for autonomous AI agents, where progress hinges on discovering high-value solutions across complex domains. The driver of this process is effective exploration, however, managing and improving exploration strategies remains a major bottleneck. Current systems face a fundamental dilemma: fixed strategies fail to adapt as search spaces scale, while online policy optimization requires navigating vast meta-search spaces under delayed and expensive feedback over long-horizon rollouts. We introduce \textsc{Dream-RSI}, a framework for scalable and recursively self-improving exploration. A lightweight orchestration layer makes exploration explicit and programmable while leaving the underlying coding agent unchanged. Our key insight is that accumulated discovery history can serve as a replay simulator over the realized search space. By performing dreaming in the replay simulator constructed from historical discovery trees, \textsc{Dream-RSI} secures immediate, low-cost off-policy feedback to evaluate and refine exploration policies without invoking repetitive, expensive online evaluations. The improved policy is subsequently redeployed online to drive further discovery, continuously expanding the simulator pool in a self-improving loop. Across algorithm engineering, mathematical optimization, and GPU kernel engineering, \textsc{Dream-RSI} achieves competitive or improved discovery quality while substantially reducing discovery cost in several settings.
中文摘要
摘要:递归自我改进在自主人工智能代理中变得日益重要,其中进展取决于在复杂领域中发现高价值解决方案。该过程的驱动因素是有效的探索,然而,管理和改进探索策略仍然是一个主要瓶颈。当前系统面临一个根本性难题:固定策略在搜索空间扩展时无法适应,而在线策略优化需要在延迟且高昂反馈下,在长时间范围的回滚中导航庞大的元搜索空间。我们提出了\textsc{Dream-RSI},一个用于可扩展且递归自我改进探索的框架。轻量级的调度层使探索变得显式且可编程,同时保持底层编码代理不变。我们的关键见解是,累积的发现历史可以作为已实现搜索空间上的重放模拟器。通过在由历史发现树构建的重放模拟器中进行“梦境”,\textsc{Dream-RSI}获得了即时、低成本的离策略反馈,用于评估和改进探索策略,而无需进行重复且昂贵的在线评估。改进后的策略随后在线部署,以推动进一步发现,并持续扩展模拟器池,形成自我改进的循环。在算法工程、数学优化和GPU内核工程等领域,\textsc{Dream-RSI}在多个应用场景中实现了有竞争力或更优的发现质量,同时大幅降低了发现成本。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文试图解决\*\*自主AI代理在递归自我改进(Recursive Self-Improvement, RSI)过程中面临的探索策略(exploration policy)优化瓶颈\*\*。 具体而言,论文针对现有方法的两个核心困境展开: 1. \*\*固定探索策略缺乏适应性\*\* 当前系统多依赖手动设计且保持固定的探索策略。这类策略无法从积累的发现经验中学习或随搜索空间扩展而自适应调整,容易反复将大量计算资源浪费于已被验证为低效的搜索方向,严重制约了RSI的扩展性。 2. \*\*在线元策略优化的反馈成本极高\*\* 近期研究尝试在发现过程中实时优化探索策略,但这面临双重根本性瓶颈: - \*\*反馈延迟且昂贵\*\*:评估一个探索策略的优劣需要观察其在长周期、多步提案–评估(proposal–evaluation)rollout 中如何塑造整个发现过程,单次评估代价巨大; - \*\*元搜索空间庞大\*\*:大量候选策略需要被尝试,而每个策略都需经过上述昂贵的在线 rollout 才能获得有效反馈,导致在元层面闭合自我改进循环的成本高到难以承受。 为破解上述困境,论文提出 \*\*Dream-RSI\*\* 框架,其核心在于\*\*将积累的发现历史(discovery history)结构化为可重播的模拟器(replay simulator)\*\*。通过在历史发现树上进行低成本的离线“dreaming”,框架能够以即时、零执行开销的离策略反馈评估并改进探索策略,再将优化后的策略重新部署到在线发现中,从而建立一个高效、可扩展的递归自我改进循环。 Q2: 有哪些相关研究? 该论文的相关研究主要分布在以下四个层面: ## 一、AI 驱动的科学与算法发现(AI-Driven Scientific and Algorithmic Discovery) - \*\*传统迭代发现系统\*\*:包括 AlphaEvolve(Novikov et al., 2025)、OpenEvolve(Sharma, 2025)、CodeEvolve(Assumpção et al., 2025)、ShinkaEvolve(Lange et al., 2026)、PACEvolve(Yan et al., 2026b)、DeltaEvolve(Jiang et al., 2026)以及 MLEvolve(Du et al., 2026)等。这类系统通常遵循“生成–评估– refine”的循环来发现算法或科学结论。 - \*\*探索本身的元优化\*\*:近期工作开始强调“探索”作为元层次优化问题的重要性。例如: - \*\*SkyDiscover\*\*(Liu et al., 2026b)提供自适应发现基础设施; - \*\*SwarmResearch\*\*(Virk et al., 2026)动态编排多个搜索分支; - \*\*EvoX\*\*(Liu et al., 2026a)显式优化搜索策略,而非仅优化候选解; - \*\*SimpleTES\*\*(Ye et al., 2026)是论文在算法工程任务中的主要强基线,使用大量生成预算进行发现。 ## 二、自我进化代理(Self-Evolving Agents) - \*\*对象层面的自我改进\*\*:大量工作聚焦于改进任务执行或推理过程中使用的具体组件,例如: - 模型权重(Huang et al., 2026a,c); - Agent harnesses(Lee et al., 2026; Zhang et al., 2026b); - 上下文(Zhang et al., 2026d); - 技能库(Ouyang et al., 2026a; Wu et al., 2026b; Zhang et al., 2026a); - 测试时学习(Wang et al., 2025; Wu et al., 2026a; Yan et al., 2026a; Yuksekgonul et al., 2026); - 评分标准(Xiong et al., 2026)与环境(Huang et al., 2026b)。 - \*\*元层次的机制优化\*\*:近期部分研究开始优化更高层的机制,包括搜索策略与自我改进过程本身(Kim et al., 2026; Liu et al., 2026a; Wang et al., 2026; Yan et al., 2026a; Zhang et al., 2026c)。然而,这类元策略的改进信号稀缺且延迟严重——往往需要昂贵且长程的在线 rollout 才能评估策略优劣。 ## 三、记忆、历史与经验重用(Memory, History, and Experience Reuse) - \*\*历史作为上下文或训练信号\*\*:此前的工作多将探索历史当作静态文本上下文(Hu et al., 2025; Ouyang et al., 2026b)或用于权重微调的 training data(Wang et al., 2025; Yuksekgonul et al., 2026)。 - \*\*结构化重用\*\*: - DeltaEvolve(Jiang et al., 2026)通过语义 delta 结构化进化历史; - SwarmResearch 与 MLEvolve(Du et al., 2026; Virk et al., 2026)利用跨分支或回顾性信息指导后续搜索; - 其他工作通过进化上下文、harness 状态、库或技能来改进经验访问与保留(Lee et al., 2026; Ouyang et al., 2026a; Xu et al., 2026; Zhang et al., 2026d)。 - \*\*Dream-RSI 的差异化视角\*\*:不同于将历史仅作为记忆或上下文,Dream-RSI 将已完成的发现历史组织成\*\*可重播的模拟器(replay simulator)\*\*,使得大量候选探索策略能够在其中被快速、离策略地评估,从而把累积经验转化为元层次优化的可重用反馈。 ## 四、实验评估中的具体任务基线 论文在三个领域与具体基线进行了对比: - \*\*算法工程(Lasso 正则化路径)\*\*:标准库 sklearn(Pedregosa et al., 2011)、glmnet(Friedman et al., 2010),以及基于大模型迭代的 \*\*SimpleTES\*\*(Ye et al., 2026)。 - \*\*数学优化\*\*:包括 AlphaEvolve、AlphaEvolveV2(Georgiev et al., 2025)、OpenEvolve、CodeEvolve、ShinkaEvolve、TTS-Discovery(Yuksekgonul et al., 2026)、ThetaEvolve(Wang et al., 2025)、EvoX 和 SimpleTES 等。 - \*\*GPU 内核工程\*\*:基于 \*\*KernelBench\*\*(Ouyang et al., 2025)中的代表性任务(VGG16、LayerNorm、ConvDiv、ConvMax)进行评估。 Q3: 论文如何解决这个问题? 该论文提出 \*\*Dream-RSI\*\* 框架,通过将积累的发现历史转化为可重放的模拟器(replay simulator),在元层次(meta-level)建立高效的递归自我改进循环。解决方案可分解为以下层面: ## 核心洞察:历史即模拟器 论文的关键观察在于,一次完整的发现过程天然记录了一棵结构化的\*\*发现树(discovery tree)\*\*,其中包含探索分支、决策点、计算开销与代码执行结果。与其将这段历史仅当作静态文本上下文或微调数据,不如将其组织为一个\*\*重放模拟器(replay simulator)\*\*——一个对已实现搜索空间的 grounded 模型。 在此模拟器中,候选探索策略无需调用底层编码代理或评估器,仅通过“重放”历史树中已记录的节点即可被评估。这使得单次昂贵的在线发现运行能够支撑数千次零执行成本的离策略(off-policy)策略评估。 ## 框架概览:三阶段递归循环 Dream-RSI 通过轻量级编排层将探索策略显式化、可编程化,并在以下三个阶段间循环迭代(见图 1): 1. \*\*在线探索(Online Explore)\*\* 当前探索策略 π_t 指导固定发现代理在真实环境中执行发现,生成一棵新的发现树 T_t 并记录完整执行轨迹。 2. \*\*构建重放模拟器(Construct Replay Simulator)\*\* 将新生成的发现树 T_t 转换为可重用的模拟器,加入模拟器池(Simulator Pool)。历史集合 H_t 随迭代不断扩展。 3. \*\*基于梦想的策略改进(Dreaming-based Policy Improvement)\*\* 策略开发代理在历史模拟器池中“梦想”(dreaming)——即让大量候选策略在重放树上虚拟执行,读取预存结果以获取即时反馈,进而迭代修订策略代码。最优版本被选中并重新部署到下一轮在线探索。 ## 关键技术机制 ### 发现树与统一决策接口 发现树以根节点 r 为起点,每个非根节点 v 有且仅有一个主父节点,继承其父节点保存的工作区与历史观测,并记录新一轮生成–评估尝试的结果(文件系统快照、生成产物、评估诊断、得分 s_v )。 探索策略的决策接口在在线与离线阶段完全一致:给定当前观测到的树 T ,策略从合法节点集 A(T) = r ∪ v ∈ T : v is a leaf 中选择一个批次 C ⊂eq A(T) 且 |C| ≤ W ( W 为并行工作者数),决定从哪些节点继续探索以及多少尝试并行执行。 ### 在线 rollout 在第 t 轮迭代中,策略 π_t 在空树上逐轮选择节点批次。每轮选中的节点被分配给工作者,发现代理基于该节点的保存工作区生成候选解,评估器打分。这些尝试并行执行,各自在父节点下产生一个新子节点,逐步扩展树 T_t^k 。 rollout 在策略选择空批次或达到最大轮数 K_1 时终止。最终树 T_t 被追加到历史 H_t = H_(t-1) ∪ T_t 。 ### 离线重放评估 离线阶段在历史 H_t 上评估 M 个策略版本 π_t^0, dots, π_t^(M-1) (其中 π_t^0 = π_t )。对每一对(策略版本 m ,历史树 i ),重放从根开始,策略仅基于当前已揭示的子树 T_i^(m,k) 做决策。与在线阶段的关键区别在于:当选中节点 v 后,模拟器\*\*确定性地返回该节点在历史树中已记录的子节点\*\*,而非重新运行发现代理。若选中根节点,则揭示该根尚未被打开过的最早分支。 重放允许最多 K_2 轮决策,在以下情形终止:策略选择空批次、达到轮数上限,或整棵历史树已被完全揭示。 ### 重放目标函数 重放评分平衡发现质量、执行开销与并行效率。对策略版本 m 在历史树 i 上的最终揭示子树,令 N_m^i = |T_i^(m,k_(m,star)^i)| - 1 为揭示的非根节点数(即代表的生成–评估调用次数), k_(m,star)^i 为实际完成的决策轮数,则重放得分为:
Vm^i = max(v ∈ Ti^(m,k_m,star)^i) s_v ;-; β_1 N_m^i ;+; β_2 (N_m^i) / (max1, k(m,star)^i)
其中: - 第一项衡量重放过程中达到的最佳解质量; - 第二项以系数 β1 惩罚尝试次数(代理调用开销); - 第三项以系数 β_2 奖励每轮决策中的平均尝试数,鼓励将独立且有前景的尝试批量化并行执行,而非串行探测。 策略版本 m 的综合评分为各历史树上的平均: V_m = (1) / (t)∑(i=1)^t V_m^i 。 ### 策略改进与选择 固定的 LLM-based 策略开发代理检视当前策略的重放轨迹与得分,结合先前修订的反馈,识别成功决策与反复失败的模式,进而修订可执行策略代码以生成 π_t^(m+1) 。经过 M 轮修订后,选择平均重放得分最高的版本部署至下一轮在线探索:
π(t+1) = π_t^(m^star), quad m^star ∈ argmax(m ∈ 0,dots,M-1) Vm
由于候选集包含当前策略 π_t^0 ,该选择保证 π(t+1) 在历史数据上不差于 πt 。 ## 与固定策略范式的本质区别 - **固定探索策略**(如 Recursive Fixed Exploration)在所有轮次中保持相同的手动设计策略,无法从历史经验中学习,随着搜索空间扩大易陷入局部最优或重复无效方向。 - **Dream-RSI** 通过重放模拟器将元策略优化转化为快速的离线“想象”过程,避免了为评估每个候选策略而反复执行昂贵且长程的在线发现 rollout,从而在保持甚至提升发现质量的同时,显著降低累积计算开销。 Q4: 论文做了哪些实验? 该论文在 **三个科学发现领域** 共 **8 项任务** 上开展了系统实验,并与领域内强基线及受控固定探索基线进行了对比。此外,论文还针对历史利用方式与探索策略演化规律进行了深度分析。 —- ## 一、算法工程(Algorithm Engineering) ### 任务 **Lasso 正则化路径求解(Lasso Regularization Path)**:要求发现高效且数值正确的完整 Lasso 正则化路径实现。使用 17 个合成实例进行搜索,并在 6 个 held-out 下游数据集(含生物学与非生物学领域)上测试泛化性能。 ### 基线与配置 - **外部基线**:标准库 `sklearn`、`glmnet`,以及基于 GPT-OSS-120B 的 **SimpleTES**(预算 51,200 次生成)。 - **受控基线**:**Recursive Fixed Exploration**——与 Dream-RSI 使用相同的底层发现代理、评估器与初始化,但探索策略在所有递归轮次中保持固定。 - **模型**:Gemini-3.1 Pro 与 Gemini-3.7 Flash。 - **轮次**:5 轮递归发现。每轮预算固定:Gemini-3.1 Pro 为 10 个并行 workspace × 11 轮 refine(共 110 次代理调用);Gemini-3.7 Flash 为 32 × 20(共 640 次调用)。 ### 主要结果 | 方法 | 模型 | 累计代理调用 | 下游平均运行时间 (ms) | |———|———|———————|———————————| | sklearn | – | – | 44180.3 | | glmnet | – | – | 13767.5 | | SimpleTES | gpt-oss-120b | 51,200 | 3804.8 | | Recursive Fixed Exploration | Gemini-3.1-Pro | 550 | 3587.1 | | **Dream-RSI** | Gemini-3.1-Pro | **317** | **2931.0** | | Recursive Fixed Exploration | Gemini-3.7-Flash | 3200 | 2516.7 | | **Dream-RSI** | Gemini-3.7-Flash | **1879** | **2350.6** | - Dream-RSI 在两项模型设置上均优于固定探索基线,且将发现代理调用次数分别减少至 **317/550** 和 **1879/3200**。 - 相比 SimpleTES 的 51,200 次生成,Dream-RSI 以约 **两个数量级** 更少的调用次数实现了更低的下游平均运行时间。 - 发现的求解器引入了自适应主动集优化机制,结合 strong-rule screening、Cauchy–Schwarz KKT pruning、惰性 Gram 矩阵构造与硬件感知实现。 —- ## 二、数学优化(Mathematics Optimization) ### 任务 三项数学发现任务: 1. **Sum–Difference Problem**:最大化比值 Gamma(A) = (log(|A+A|/|A|)) / (log(|A-A|/|A|)) 2. **Circle Packing**:在单位正方形内无重叠地放置 n 个圆,最大化半径之和 3. **Autocorrelation Inequalities**:最小化 / 最大化自卷积函数的相关泛函 ### 基线与配置 - **基线**:AlphaEvolve、AlphaEvolveV2、OpenEvolve、CodeEvolve、ShinkaEvolve、TTS-Discovery、ThetaEvolve、EvoX、SimpleTES 等。 - **模型**:Gemini-3.1 Pro。 - **轮次**:10 轮递归发现;总预算控制在 **1,000 次生成以内**。 ### 主要结果 | 任务 | 最优方向 | Dream-RSI | Recursive Fixed Exploration | 代表性强基线 | |———|—————|—————-|——————————————|——————-| | Sum Diff ( ↑ ) | 越高越好 | **1.145427** | 1.144047 | SimpleTES: 1.143975 | | Auto Correlation ( ↓ ) | 越低越好 | **1.456375** | 1.456001 | SimpleTES: 1.453675* | | Circle Packing ( ↑ ) | 越高越好 | **2.635983** | 2.635983 | 多项基线: 2.635983 | - Dream-RSI 在 Sum–Difference 上超越 SimpleTES 与固定探索基线。 - 在 Circle Packing 上达到与已知最强结果持平的表现。 - 在 Autocorrelation 上保持竞争力。值得注意的是,SimpleTES 虽在该任务上略优(1.453675),但消耗了 **51,200 代**,而 Dream-RSI 使用不足 **1,000 代**,实现超过 **50 倍** 的预算节省。 —- ## 三、GPU 内核工程(Kernel Engineering) ### 任务 选自 **KernelBench** 的四项代表性 GPU 内核优化任务:VGG16、LayerNorm、ConvDiv、ConvMax。评估指标为执行速度( 1/ms ),并需保证数值正确性。 ### 基线与配置 - **基线**:Recursive Fixed Exploration(受控基线)。 - **模型**:Gemini-3.1 Pro。 ### 主要结果 | 任务 | Dream-RSI 相对优势 | |———|—————————-| | VGG16 | 达到同等性能,使用 **2.43×** 更少的 generations | | LayerNorm | 达到同等性能,使用 **1.79×** 更少的 generations | | ConvDiv | 在相近预算下,性能提升 **2.09×** | | ConvMax | 在相近预算下,性能提升 **1.44×** | 结果表明,通过递归轮次自适应调整探索策略,可在长程发现中同时提升效率与最终发现质量。 —- ## 四、进一步分析实验 ### 4.1 历史归纳偏置的利用方式对比(§5.1) 在 **ConvDiv** 上对比两种历史利用方式: - **Dream-RSI**:将历史作为交互式重放模拟器进行离策略评估。 - **+ Guidance**:将历史抽象为高层语义提示(prompt-level semantic guidance)注入后续轮次。 实验显示,显式语义指导在两种范式下均**一致地劣于**无指导版本。这表明在长程、多线程并行探索中,强语义归纳偏置容易过度约束搜索空间,抑制多样性探索。 ### 4.2 探索行为的演化分析(§5.2) 在 **ConvDiv** 上追踪 8 轮递归执行中策略的行为模式: - **自适应计算分配**:当性能持续提升时,策略倾向于**减少**评估尝试(从 110 降至 50),节约发现成本;当进展停滞时,策略主动**增加**探索投入(回升至 80–92 次),随后伴随新一轮性能突破。 - 这验证了 Dream-RSI 学到的策略并非静态启发式,而是能够根据历史趋势动态调节探索宽度与深度。 Q5: 有什么可以进一步探索的点? 基于该论文的核心框架与实验观察,以下几个方面值得进一步深入探索: ## 1. 从 Replay Simulator 向生成式世界模型(Generative World Models)扩展 当前 Dream-RSI 的重放模拟器受限于**已实现的历史搜索空间**,仅能对已探索过的分支进行离策略评估。当探索策略需要评估那些可能导向全新、未记录区域的决策时,模拟器无法提供反馈。 - **可探索方向**:结合生成式模型(如扩散模型或 LLM-based 环境模型),在历史发现树的基础上学习一个**生成式世界模型**,使其能够外推(extrapolate)未探索节点的可能执行结果。这将允许候选策略在“想象的”新区域中进行 dreaming,而非仅限于历史重放。 - **挑战**:如何保证生成式模型对代码执行结果和评估反馈的预测足够准确,以避免策略在虚假的模拟收益上过度优化。 ## 2. 跨任务的通用发现模拟器与迁移学习 论文中的模拟器池是**任务特定**的,历史树仅服务于同一任务的后续策略改进。 - **可探索方向**:是否存在跨算法工程、数学优化与系统设计的**通用发现动态**?通过收集多领域、多任务的历史发现树,训练一个跨任务的元模拟器(meta-world model),使得在一个任务上学习到的探索偏置(如“何时应加宽分支”、“何时应修复实现错误”)能够迁移到全新任务。 - **潜在价值**:这将推动从“单任务 RSI”向“通用自主发现代理”的演进。 ## 3. 策略表示与元策略搜索空间的结构化优化 论文采用 LLM 直接生成可执行的策略代码(Python 类),这使得策略空间极度灵活但也**无结构**、难以系统搜索。 - **可探索方向**: - 引入模块化策略原语(primitives),如“分支原语”、“剪枝原语”、“并行调度原语”,将策略搜索从无约束的代码生成转化为组合优化或程序搜索问题; - 结合神经程序搜索(neural program search)或符号回归,系统性地枚举和组合策略模块,而非仅依赖 LLM 的文本推理。 - **潜在收益**:降低策略改进的方差,提升可解释性与可复现性。 ## 4. 动态与噪声环境下的模拟器可靠性 当前重放机制隐含假设历史记录是**静态且确定**的:给定父节点,子节点的结果是固定的。 - **可探索方向**:在底层发现代理(stochastic LLM)或评估器(含数值随机性、超时等非确定性因素)存在显著噪声的场景下,单一历史轨迹不足以刻画状态-动作转移。需要研究: - 如何在发现树中记录并建模**分布性结果**(distributional outcomes); - 如何构建支持概率性转移的模拟器,使 dreaming 过程能够进行蒙特卡洛或分布鲁棒的策略评估。 ## 5. 长期递归稳定性与收益递减 实验展示了 5–10 轮的递归改进,但 RSI 的长期行为仍属未知。 - **可探索方向**: - 在更多轮次(如数十轮)下,策略改进是否会出现**收益递减**甚至**策略崩溃**(例如过度拟合历史模拟器,导致在线部署时失效); - 是否需要引入显式的**探索多样性保持机制**或**正则化项**,防止元策略过早收敛到历史模拟器中的局部最优; - 模拟器池随时间线性增长,其存储与计算开销可能成为新瓶颈,需要研究**历史遗忘、压缩与选择性保留**机制(类似经验回放中的优先级采样)。 ## 6. 更丰富的探索动作空间 当前策略的动作空间局限于选择节点批次(继续哪个分支、并行度、何时停止)。 - **可探索方向**:将更复杂的元操作纳入策略空间,例如: - **跨分支知识重组**:主动将分支 A 中验证成功的代码片段迁移至分支 B; - **自适应查询生成**:策略不仅决定“何时探索”,还决定“提出何种性质的候选解”(如控制生成的随机温度、指令重措辞); - **早期终止与资源重分配**:根据中间信号动态 killed 低效工作者并将预算转移至更有前景的分支。 ## 7. 与其他历史利用机制的深度融合 论文表明,prompt-level 的语义指导(§5.1)会过度约束搜索空间,但完全抛弃高层语义信息也可能浪费宝贵的经验。 - **可探索方向**:在 dreaming 阶段,是否可以结合**结构化的历史摘要**(如自动归纳的成功/失败模式库)与低层的重放反馈,形成一个双通道的策略改进信号——高层提供方向性启发,底层重放提供精确的数值反馈。关键在于设计不损害多样性的信息注入方式。 Q6: 总结一下论文的主要内容 该论文针对**递归自我改进(Recursive Self-Improvement, RSI)**中探索策略(exploration policy)的优化瓶颈,提出了 **Dream-RSI** 框架。以下是论文主要内容的系统总结。 —- ### 1. 研究背景与核心问题 自主 AI 代理的递归自我改进通常依赖于迭代式发现循环:代理生成候选解、评估结果、吸收反馈并优化后续迭代。随着任务难度提升,发现过程需要在庞大搜索空间中进行**长程、多步探索**(数千次提案–评估循环)。此时,探索策略的效率成为 RSI 的关键瓶颈。 现有方法面临两难困境: - **固定策略**(如手动设计的启发式)无法从累积经验中学习,容易反复浪费计算资源于低效方向; - **在线策略优化**虽然可以自适应,但评估一个探索策略需要观察其在长程 rollout 中的表现,反馈**延迟且昂贵**,导致元层次的自我改进难以高效闭环。 —- ### 2. 核心洞察:历史即重放模拟器 论文的关键创新在于重新审视**发现历史(discovery history)**的价值。一次完整的在线发现过程天然记录了一棵结构化的**发现树(discovery tree)**,其中包含探索分支、决策点、计算开销与代码执行结果。论文提出,这段历史不应仅被当作静态文本上下文或微调数据,而应被组织为一个**重放模拟器(replay simulator)**。 在此模拟器中,候选探索策略通过遍历已记录的历史树来“重放”不同的搜索路径:选择不同的分支子集、调整探索顺序、改变并行分组或停止时机。由于所有节点的执行结果已预存,评估一个新策略**无需重新调用底层编码代理或评估器**,仅需读取历史记录即可。这使得单次昂贵的在线发现能够支撑数千次**零执行成本、即时反馈**的离策略(off-policy)策略评估。 —- ### 3. Dream-RSI 框架 Dream-RSI 通过轻量级编排层将探索策略显式化、可编程化(不改变底层编码代理),并在以下三个阶段间形成递归自我改进循环: 1. **在线探索(Online Explore)** 当前策略 π_t 指导发现代理在真实环境中执行,生成新的发现树 T_t 并记录完整轨迹。 2. **构建重放模拟器(Construct Replay Simulator)** 将 T_t 转换为可重用的模拟器,加入不断膨胀的模拟器池。历史集合 H_t 随迭代累积。 3. **基于梦想的策略改进(Dreaming-based Policy Improvement)** 固定的 LLM-based 策略开发代理让大量候选策略在模拟器池中“做梦”(虚拟执行),基于即时重放反馈迭代修订策略代码。最优版本被选中并重新部署到下一轮在线探索。 #### 统一决策接口 在在线与离线阶段,探索策略观察当前树 T ,从合法节点集 A(T) 中选择一个批次 C ( |C| ≤ W , W 为并行工作者数),决定从哪些节点继续探索以及多少尝试并行执行。 #### 离线重放与目标函数 在重放阶段,策略选中节点后,模拟器**确定性返回历史树中已记录的子节点**。令 N_m^i 为策略版本 m 在历史树 i 上揭示的非根节点数(代表代理调用开销), k(m,star)^i 为完成的决策轮数,重放得分为:
Vm^i = max(v ∈ Ti^(m,k_m,star)^i) s_v ;-; β_1 N_m^i ;+; β_2 (N_m^i) / (max1, k(m,star)^i)
该式平衡三项: - **发现质量**:重放中达到的最佳得分; - **执行成本**:代理调用次数的惩罚; - **并行奖励**:每轮平均尝试数,鼓励批量化并行探索。 最终选择平均得分最高的策略版本进入下一轮在线部署,保证不劣于当前策略。 —- ### 4. 实验验证 论文在 **三个领域、八项任务** 上进行了系统评估。 | 领域 | 任务 | 核心结果 | |———|———|—————| | **算法工程** | Lasso 正则化路径 | 相比 SimpleTES(51,200 代),Dream-RSI 以约 **162 倍** 更少的代理调用达到更优的下游运行时间;相比固定探索基线,在 Gemini-3.1 Pro 上将调用从 550 降至 317,在 Gemini-3.7-Flash 上从 3200 降至 1879,同时性能提升 | | **数学优化** | Sum–Difference、Autocorrelation、Circle Packing | 在不足 1,000 代的预算内达到或超过强基线(如 AlphaEvolve、SimpleTES),相比 SimpleTES 实现超过 **50 倍** 的预算节省 | | **GPU 内核工程** | VGG16、LayerNorm、ConvDiv、ConvMax | 在 VGG16 和 LayerNorm 上,以 **2.43×** 和 **1.79×** 更少的代达到同等性能;在 ConvDiv 和 ConvMax 上,于相近预算下分别实现 **2.09×** 和 **1.44×** 的性能提升 | #### 进一步分析 - **历史利用方式对比**:将历史抽象为高层语义提示(prompt guidance)注入后续轮次,会过度约束搜索空间、抑制多样性;而作为交互式重放模拟器则显著更优。 - **策略行为演化**:学到的探索策略表现出自适应计算分配——性能快速提升时主动节约预算,进展停滞时则增加探索投入以寻求突破。 —- ### 5. 主要贡献 - **历史作为重放模拟器**:提出将已完成的发现历史概念化为可重放模拟器,使延迟且昂贵的探索反馈转化为可重用的离策略优化信号。 - **元层次 RSI 循环(Dream-RSI)**:建立了一套在元探索层闭合递归自我改进循环的框架,通过“梦想”机制低成本地评估与改进探索策略。 - **跨领域实证**:在算法工程、数学优化与 GPU 内核工程上验证,Dream-RSI 在多个设定下同时提升了发现质量与计算效率。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Tong Zheng,Xidong Wu,Zheng Zhang,Zhankui He,Chaoyi Zhang,Benjamin Coleman,Ruoqiao Wei,Di Bai,Haolin Liu,Rui Liu,Xue Wang,Yue Zhuan,Wang-Cheng Kang,Renkai Xiang,Heng Huang,Xinwu Cheng,Yunsong Guo
Categories:
PDF URL: https://arxiv.org/pdf/2609.14858.pdf
Arxiv URL: https://arxiv.org/abs/2609.14858
Arxiv ID: 2609.14858
CoolPaper URL: https://papers.cool/arxiv/2609.14858
Published: 2026-09-16T01:38:42.666Z
Updated: 2026-09-16T01:38:42.666Z
5. PhysBrain 1.5: From Vision-Language Models to Physical Foundation Models
Abstract:We present PhysBrain 1.5, a unified model for understanding physical environments, generating actions, and predicting future states. Motivated by the physical loop of observation, interaction, and environmental change, we bring these capabilities into a common learning framework. Starting from a general vision—language model, we encode language responses, end-effector motion, and dense visual targets as discrete sequences and jointly optimize them with autoregressive next-token prediction. Pre-training draws its embodied supervision entirely from human interaction videos, using task-centered episodes to pair semantic and spatial context with recovered motion and subsequent observations. We then adapt the model through supervised fine-tuning on a mixture of human demonstrations, robot trajectories, and simulated experience. Across 28 embodied understanding benchmarks, our 8B model achieves an average score of 72.5, setting a new open-source state of the art and performing on par with leading proprietary models such as GPT-6-Astra and Gemini 3.6 Flash. It achieves the best open-source results on 14 benchmarks while retaining general multimodal capabilities. Beyond these understanding evaluations, qualitative examples show the model’s ability to produce end-effector trajectories and predict future scenes through spatially aligned RGB, depth, and robot-mask outputs.
中文摘要
摘要:我们提出了 PhysBrain 1.5,这是一个用于理解物理环境、生成动作及预测未来状态的统一模型。受观察、交互和环境变化的物理循环启发,我们将这些能力引入到一个通用的学习框架中。从一个通用的视觉-语言模型出发,我们将语言响应、末端执行器运动以及密集视觉目标编码为离散序列,并通过自回归的下一令牌预测进行联合优化。预训练完全依赖于人类交互视频提供的具身监督,使用以任务为中心的情节将语义和空间上下文与恢复的运动及后续观测配对。随后,我们通过在混合的人类演示、机器人轨迹和模拟经验上的监督微调对模型进行适配。在 28 个具身理解基准测试中,我们的 8B 模型获得了平均得分 72.5,创下新的开源领先水平,并与 GPT-6-Astra 及 Gemini 3.6 Flash 等领先专有模型表现相当。它在 14 个基准测试中取得了最佳开源结果,同时保持了通用的多模态能力。除了这些理解评估,定性示例显示了该模型生成末端执行器轨迹并通过空间对齐的 RGB、深度和机器人掩模输出预测未来场景的能力。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*物理智能(physical intelligence)中多能力统一学习\*\*的问题,具体可概括为以下几个方面: --- ### 1. 物理循环中的能力碎片化问题 物理智能的核心是一个连续的\*\*物理循环(physical loop)\*\*:智能体观察环境、理解空间关系与任务目标、预测动作结果、执行动作、并观察环境变化以指导后续行为。然而,现有工作将这些能力分散在不同的专门化系统中: - \*\*通用视觉-语言模型(VLMs)\*\*:负责视觉理解与语义推理 - \*\*专门模型\*\*:分别处理空间推理、可供性(affordance)理解、任务规划、执行评估等 - \*\*视觉-语言-动作模型(VLAs)\*\*:专注于机器人动作学习 - \*\*世界模型\*\*:专注于未来状态预测 这种碎片化导致缺乏一个能够同时支撑\*\*理解、行动与预测\*\*的统一框架。 --- ### 2. 联合学习中的监督信号异构性 论文指出,将上述能力联合学习面临根本性的监督差异: - \*\*具身理解任务\*\*输出语言、空间坐标或交互目标 - \*\*动作生成\*\*需要时间结构化的运动表示(如末端执行器轨迹) - \*\*未来状态预测\*\*涉及密集的视觉输出(RGB、深度图、掩码) 此外,训练数据在\*\*具身形态(embodiment)、标注规范与时间粒度\*\*上也存在显著差异,使得简单的多任务拼接难以扩展。 --- ### 3. 统一框架的构建挑战 为应对上述问题,论文提出 \*\*PhysBrain 1.5\*\*,其核心挑战在于: - 如何将\*\*语言响应、末端执行器运动、密集视觉目标\*\*表达为同一离散序列空间下的可学习目标 - 如何在\*\*自回归的 next-token 预测\*\*框架下,通过共享的主干网络、词嵌入与输出头,联合优化语义、运动与状态转移三种监督信号 - 如何利用\*\*人类交互视频\*\*作为预训练的统一监督来源,并在微调阶段融合真实机器人轨迹与仿真经验,实现跨具身的泛化 --- ### 总结 该论文试图解决的根本问题是:\*\*在物理循环的驱动下,如何将具身理解、动作生成与未来状态预测三种异构能力纳入一个统一的自回归学习框架,使其共享表征并相互增强,从而迈向真正的物理基础模型(Physical Foundation Model)\*\*。 Q2: 有哪些相关研究? 根据论文引言及相关章节的综述,与 PhysBrain 1.5 相关的研究工作可按照技术脉络与能力维度分为以下几类: --- ### 1. 通用视觉–语言模型(VLMs) 这类模型提供视觉理解、语义知识与指令遵循能力,是构建物理智能的基础: - \*\*Qwen3-VL\*\*
1
:PhysBrain 1.5 的基座模型 - **InternVL3**
2
- **Molmo / PixMo**
3
—- ### 2. 专门化的具身感知与推理模型 针对物理循环中特定环节(空间推理、 grounding、规划、执行评估)的专门模型: - **空间推理**:RoboSpatial
4
、SAT
5
、SpatialReasoner
6
、Cambrian-S
7
- **空间定位与可供性(Grounding & Affordance)**:RoboPoint
8
、RoboRefer / RoboRefit
9, 79
、MolmoPoint
10 - **任务规划**:RoboVQA
11
、EgoPlan-Bench
12 - **执行评估与奖励建模**:RoboReward
13
、Robometer
14
—- ### 3. 视觉–语言–动作模型(VLAs) 专注于将视觉和语言指令映射到机器人动作策略: - **π 系列**(π0
15
、π0.5
16
、π0.7
17
):基于流的机器人控制模型 - **GR00T N1**
18
:NVIDIA 推出的通用人形机器人基础模型 - **Qwen-VLA**
19
:统一跨任务、跨环境与跨具身形态的 VLA 模型 —- ### 4. 预测性世界模型 建模动作导致的未来状态变化: - **DreamZero**
20
:世界动作模型作为零样本策略 - **Qwen-RobotWorld**
21
:通过语言条件视频生成统一具身世界建模 —- ### 5. 系统级机器人框架 在系统层面将语言推理与机器人执行能力相连接: - **SayCan**
22
:将语言模型与机器人可供性结合 - **Code as Policies**
23
:用语言模型生成代码控制机器人 - **VoxPoser**
24
:利用语言模型生成可组合的 3D 值图进行操控 —- ### 6. 近期具身基础模型(向统一框架演进) 尝试将理解、决策、执行、预测等能力进行整合的近期工作: - **HY-Embodied / Hy-Embodied-VLM-1.0**
25, 26
:扩展空间理解与交互推理 - **RynnBrain 1.1**
27
- **MiMo-Embodied**
28 - **RoboBrain 2.5**
29
:整合 grounding、决策与执行 - **Embodied-R1.5**
30 - **ACE-Brain-0.5**
31 - **UniVLA**
32
与 **RynnVLA-002**
33
:探索理解、动作生成与视觉预测的联合学习 - **Cosmos 3**
34
:面向物理 AI 的多模态理解与生成框架 —- ### 7. 直接相关的先驱工作 - **PhysBrain 1.0**
36
:该团队前期工作,将第一人称视频转换为物理常识监督 - **Human-as-Humanoid**
38
:用于从人类视频恢复运动并迁移到机器人策略的流水线 - **ActionPiece**
35
:PhysBrain 1.5 采用的端到端轨迹分词器 - **PhysBrain-Ego360**
37
:全景人体交互视频数据集 —- 上述研究构成了从**通用多模态理解**到**专门化空间推理**、从**机器人动作学习**到**世界状态预测**的完整技术光谱。PhysBrain 1.5 正是在这些工作的基础上,进一步探索如何通过**共享的自回归离散 token 框架**将这三类异构能力(理解、动作、预测)统一到一个物理基础模型中。 Q3: 论文如何解决这个问题? 论文通过 **“统一离散 token 空间中的自回归学习框架”** 来解决物理智能中理解、行动与预测的整合问题。具体解决方案涵盖架构设计、动作与视觉的离散化表示、数据构建与训练策略四个层面: —- ## 1. 统一的架构与学习目标 ### 共享词汇表与输出头 论文将语言模型的词汇表扩展为三类离散 token 的并集:
V = V(lang) ∪ V(act) ∪ V(vis)
其中 V(lang) 为原始语言词表, V(act) 为动作 token, V(vis) 为视觉状态 token。三类 token 共享同一套 **token 嵌入表**与**语言模型输出头**,并通过统一的自回归目标进行优化:
pθ(y mid x) = prod(i=1)^(|y|) pθ(y_i mid x, y(<i)), quad L(AR) = -∑(i=1)^(|y|) mi log pθ(yi mid x, y(<i))
其中 mi 为任务特定的损失掩码,仅对当前任务对应的目标 token 计算监督。任务格式(文本、动作或视觉)通过模态分隔符与掩码控制,底层预测目标保持不变。 —- ## 2. 动作生成:离散轨迹 token ### 动作表示 每个动作片段(action chunk)包含未来 H=16 步的末端执行器轨迹。对于每一步,动作目标 a(t,k) ∈ R^(10) 包含: - 相对平移: p(t+k) - p_t ∈ R^3 - 相对旋转: rho_6(R_t^top R(t+k)) ∈ R^6 ,其中 $rho_6(R) = vec(R
:,1:2
) 为连续 6D 旋转表示 - 绝对夹爪开合度: g_(t+k) ∈
0,1
ActionPiece 分词 论文采用 ActionPiece 分词器 T_(AP)$ 将连续轨迹编码为离散 token。一个 16 步的手腕轨迹被编码为 32 个离散动作 token:
z^- = T(AP)(A^-), quad z^+ = T(AP)(A^+)
同质动作延续(Homogeneous Action Continuation) 为处理不同数据源在坐标系、物理单位与控制频率上的异质性,论文不显式强制全局规范化的坐标框架,而是将**前一动作片段** z^- 作为局部运动上下文输入模型:
pθ(z^+ mid I, u, e, f, z^-)
其中 I 为当前视觉观测, u 为任务指令, e 为具身形态, f 为动作频率。历史动作提供了隐式的系统辨识信号,使模型能够推断当前数据源的局部运动惯例并自然地延续轨迹,而非进行孤立的片段回归。 —- ## 3. 视觉基础生成:多模态未来状态预测 ### 状态表示 未来物理状态 S(t+Delta) 由空间对齐的三部分组成:
S(t+Delta) = (X(rgb)^(t+Delta), X(depth)^(t+Delta), X(mask)^(t+Delta))
共享 VQ-VAE 离散化 三种模态通过共享的 VQ-VAE T_(VQ) 在 128 × 128 分辨率下离散化,得到 16 × 16 的代码本索引网格( N=256 个 token per modality,代码本大小 K=16,384 ):
Q(t+Delta)^m = T(VQ)(X_(t+Delta)^m) ∈ 1,dots,K^(16 × 16), quad m ∈ rgb, depth, mask
空间对齐的联合序列化 为在自回归生成中提供局部跨模态上下文,论文将三个模态按空间位置交错排列:
y(vis) = [b(start), q1^(rgb), q_1^(depth), q_1^(mask), dots, q_N^(rgb), q_N^(depth), q_N^(mask), b(end)]
该序列共含 3N=768 个 VQ token 与 2 个边界 token。生成后通过反交错与冻结的 VQ 解码器重建为 RGB、深度图和机器人掩码。此过程**无需引入模态特定的预测头或像素级重建损失**。 —- ## 4. 数据工程:两阶段训练体系 ### 阶段一:物理感知预训练(Physical-Aware Pre-training) 该阶段的所有具身监督完全来源于**人类交互视频**,被组织为任务为中心的片段(task-centered episodes),将语义/空间上下文与恢复的运动及后续观测配对: | 监督类型 | 内容 | 规模 | |:—-|:—-|:—-| | 物理感知 | 结构化标注、图像/视频级标注、物理 VQA | 24.3M | | 人类动作 | 通过 Human-as-Humanoid 恢复的腕部末端执行器轨迹 | 31.2M | | 未来状态 | 成对观测的 RGB、深度、人体部位掩码 | 26.8M | | 通用指令 | 语言与视觉-语言指令跟随数据 | 14.9M | ### 阶段二:具身监督微调(Embodied SFT) 在预训练基础上,混入高质量的人工标注、真实机器人轨迹与仿真交互数据,扩展至更多具身形态与任务: | 监督类型 | 来源 | 规模 | |:—-|:—-|:—-| | 具身理解 | 28 个 benchmark 对应的 curated 数据 | 6.61M | | 动作 | 17 个真实机器人/仿真平台 + 高质量人体运动 | 5.4M | | 未来状态 | 真实机器人与仿真轨迹的后续帧 | 1.2M | | 通用指令 | 高质量多模态指令数据 | 1M | 动作数据在保留各源原生坐标轴的前提下统一物理单位与夹爪语义,并利用运动信息丰富度准则(FrameSkip)过滤静态片段。 —- ## 5. 训练配置 以 **Qwen3-VL-Instruct (8B)** 为基座,通过 ms-swift 与 Megatron-Core 后端训练。两阶段均采用分布式 Adam 优化器( β1=0.9, β_2=0.95 ),峰值学习率 2 × 10^(-5) ,余弦衰减,序列长度 32,768,bfloat16 精度。两个阶段各训练一个 epoch,按样本数比例混合各类数据,在统一的目标函数下联合优化文本生成、动作 token 生成与未来视觉状态生成。 —- 简言之,论文的解决路径是:**将异质的语言、动作轨迹与密集视觉输出转化为同一离散 token 空间中的序列,通过共享的自回归主干与掩码监督进行联合优化,并以人类交互视频为桥梁实现从物理感知到行动预测的统一学习**。 Q4: 论文做了哪些实验? 论文的实验评估围绕**物理循环**的完整链条展开,从多模态感知与具身理解,到动作生成,再到未来状态预测。具体实验可分为以下五个部分: —- ## 1. 具身理解评估(28 个基准测试) 在 **28 个 embodied understanding benchmarks** 上评估模型的感知、空间推理与决策能力,这些基准被组织为 5 个互补的能力组: - **基础视觉–空间感知**:BLINK, CV-Bench - **空间与多视角理解**:3DSRBench, EmbSpatial-Bench, MindCube, MMSI-Bench, Q-Spatial-Bench, RoboSpatial-Home, SAT, VSI-Bench, ViewSpatial-Bench - **具身认知、推理与规划**:COSMOS, EgoPlan-Bench2, ERQA, ERQA-PLUS, RoboVQA, VLABench - **空间定位、指向与可供性**:Part-Affordance-2K, PIOBench (S1 & S2), PixMo-Points, PointBench, RefSpatial-Bench, RoboAfford, RoboRefit, VABench-Point, Where2Place - **视觉轨迹与轨迹推理**:ShareRobot-Trajectory, VABench-Visual-Trace ### 对比模型 - **专有模型**:Gemini 3.6 Flash, GPT-6-Astra, Claude Opus 5 - **开源具身模型**:Hy-Embodied-VLM-1.0 (30A/3B), Embodied-R1.5 (8B), RynnBrain 1.1 (9B), RoboBrain 2.5 (8B), MiMo Embodied (7B), Cosmos 3 Nano (8B+8B), ACE-Brain-0.5 (8B) - **通用基线**:Qwen3-VL-Instruct (8B) ### 关键结果 - **8B 模型平均得分 72.5**,在**所有开源模型中排名第一**,并接近专有模型 GPT-6-Astra (73.3) 与 Gemini 3.6 Flash (73.0) - 在 **14 个基准上取得开源第一**,在 **24 个基准上进入前二** - 在全部 28 个基准上均超越基线模型 Qwen3-VL-Instruct - 在五个能力类别中均位列开源前二,展现出感知、空间推理、规划、定位与轨迹理解的全面性 —- ## 2. 通用多模态理解评估 为验证模型在专门具身能力之外是否保留广泛的视觉–语言理解能力,在 **12 个通用多模态基准** 上进行评估: - **图像理解**:MME, MMStar, RealWorldQA, AI2D, ChartQA, DocVQA, TextVQA, V*, ScreenSpot - **视频理解**:VideoMME, MVBench - **幻觉检测**:POPE 实验以 **Qwen3-VL-Instruct (8B)** 为参考基线,使用 lmms-eval 进行统一评测。结果显示,PhysBrain 1.5 的通用多模态性能与基线基本相当(例如 MME: 2330.07 vs 2392.70;MMStar: 65.60 vs 64.99;VideoMME: 68.22 vs 69.07),表明其在获得具身能力的同时未牺牲广泛的图像、视频、文本与图表理解能力。 —- ## 3. 动作轨迹 token 预测实验 验证模型在物理循环中“执行”环节的能力:给定当前 RGB 观测、任务指令与前 16 步的真实动作片段(作为运动上下文),模型自回归生成下一组 16 步的离散动作 token,并通过 ActionPiece 解码为末端执行器轨迹。 ### 图像平面可视化(Figure 4) 在测试集(训练未见的 episode)上,将预测与真实轨迹投影到图像平面。实验覆盖: - 单臂/双臂操作(如举瓶、组装积木、锤击) - 工具使用(如用叉子、锤子) - 双手协调(如传递物体、协作搬运) 预测轨迹(虚线)在方向上大体跟随真实轨迹(实线),展示了基于场景与指令的短程运动生成能力。 ### 3D 空间可视化(Figure 5) 在三维坐标系中对比预测与真实轨迹,包括: - **分布内(ID)**:测试集来源于训练数据同分布的平台,涵盖近似直线与曲线路径 - **分布外(OOD)**:使用训练集中完全未出现的 **RoboDojo** 数据 OOD 示例(如按类别分拣、螺丝装配)显示,模型能够复现参考轨迹的整体运动趋势,尽管存在可观测的位置偏差。所有坐标系保留各数据源的原始约定,未做跨源对齐。 ### 动作困惑度分析(Appendix B.3, Figure 7) 在预训练过程中监测动作 token 的困惑度(perplexity): - **ID 测试集**:从 17.12 降至 5.07 - **OOD (RoboDojo)**:从 12.39 降至 6.57 OOD 困惑度随预训练整体下降,表明模型对未见过数据源的轨迹预测能力也在持续提升。 —- ## 4. 未来视觉预测实验 验证模型对物理状态转移的预测能力:给定当前 RGB 观测与任务指令,预测未来 1 秒的物理状态(Figure 6)。 预测输出包含空间对齐的三种模态: - **RGB 图像**:未来场景外观 - **深度图**:工作空间几何结构 - **机器人掩码**:机器人本体占据区域 实验跨越多种机器人具身形态与视角,结果表明: - 模型保持了主导场景布局与物体身份 - 预测变化与任务进度一致(如双臂靠近锅具、碗叠放) - 三种模态在空间上保持一致,联合捕捉了环境演变与机器人位形变化 —- ## 5. 扩展定性可视化(Appendix B.4) 除上述量化与定性实验外,论文在附录中补充了更广泛的场景可视化,展示模型在**训练 benchmark 之外**的泛化能力: - **物体指向**(Figure 8):复杂场景中的多实例定位、透明容器、指定颜色物体等 - **轨迹点生成**(Figure 9):基于指令预测键盘拖拽、试管移动、机械臂擦拭等任务的二维路径点 - **空间关系问答**(Figure 10):计数、相对位置、视角推理、遮挡推理 - **多视图尺度估计**(Figure 11):基于多视角观测估计货架高度 - **空间想象与方位推理**(Figure 12):推断人在特定朝向时的相对方向 - **视频轨迹理解**(Figure 13):描述蓝球在视频中的运动轨迹及其与其他物体的空间关系演变 - **视频未来预测**(Figure 14):推断完成整理任务时最可能的下一步动作 这些定性案例共同说明,PhysBrain 1.5 通过统一的自回归接口,能够输出语言回答、空间坐标、动作轨迹与视觉预测,支撑从感知到行动的完整物理循环。 Q5: 有什么可以进一步探索的点? 基于论文的方法设计与实验局限,以下几个方向值得进一步探索: —- ### 1. 从开环预测到闭环机器人控制 论文目前的动作轨迹预测实验属于**离线开环评估**(offline trajectory prediction),未来视觉预测也停留在单帧生成层面。后续工作可将 PhysBrain 1.5 部署到真实机器人平台上,验证其在**闭环控制**(closed-loop control)中的实际执行成功率。关键问题包括:动作 chunk 的自回归生成能否满足实时控制频率?历史动作上下文在闭环反馈中的误差累积如何抑制?视觉预测能否作为内部模拟器用于模型预测控制(MPC)或动作重规划? —- ### 2. 长时程与多帧未来状态预测 当前视觉基础生成仅预测单帧未来状态( S(t+Delta) ,约 1 秒间隔)。可探索**视频级时序扩展**,即自回归地生成多帧未来 RGB–Depth–Mask 序列,建模完整的物理动态过程。这需要解决时序一致性、物理规律遵循(如刚体运动、遮挡关系)以及长序列生成的计算效率问题。此外,可引入视频生成领域的评估指标(如 FVD、PSNR)对预测质量进行量化。 —- ### 3. 显式跨具身迁移与适应机制 论文采用保留各数据源原生坐标轴、通过历史动作片段隐式适应异构具身的策略。未来可研究**显式的具身参数化或适配模块**,例如: - 为不同机器人形态学习低维具身嵌入(embodiment embedding) - 设计 few-shot 适配协议,使预训练模型能快速适应新机器人本体 - 探索从人类手腕轨迹到多指灵巧手(finger motion)的 zero-shot 迁移,弥补当前排除手指运动的局限 —- ### 4. 世界模型与动作规划的深度耦合 未来状态预测目前作为独立输出,尚未与动作生成形成双向闭环。可探索将视觉预测作为**内部世界模型**(world model)用于动作规划: - 利用预测的未来帧评估候选动作序列的物理可行性 - 结合蒙特卡洛树搜索(MCTS)或模型预测控制,在推理时进行”想象-评估-执行”的迭代优化 - 引入奖励建模或价值函数,使模型能在想象的空间中进行任务规划与纠错 —- ### 5. 动作表示与 tokenization 的精细化 当前使用 ActionPiece 将 16 步轨迹编码为 32 个离散 token,且未建模手指运动。后续可考虑: - **更连续或细粒度的动作表示**:如扩散模型(diffusion)与自回归 token 预测的混合架构,以提升动作精度 - **更长 horizon 的动作规划**:突破固定 16 步 chunk 限制,支持长程任务的分层动作生成 - **灵巧操作扩展**:将手指关节纳入统一动作空间,支持更精细的接触-rich 交互 —- ### 6. 模态间对齐与可解释性分析 虽然三种监督信号共享同一主干,但它们在表示空间中的交互机制尚不清晰。未来可通过**机制分析**回答: - 物理概念(如”左/右”、”接触”、”支撑”)是否在模型中形成跨模态的共享表征? - 视觉预测任务是否真正提升了空间推理 benchmark 的表现?需通过严格的消融实验(如去掉某类监督信号)量化各类任务的相互增益 - 可视化跨模态 attention pattern,分析语言指令如何影响动作 token 与视觉 token 的生成 —- ### 7. 数据合成与规模化的进一步扩展 预训练依赖约 3 万小时的人类交互视频。可探索: - **合成数据管道**:利用仿真环境或视频生成模型大规模合成物理一致的交互序列,降低对真实人类数据的依赖 - **互联网视频的高效利用**:将公开视频(非第一视角)通过逆运动学、物理推理等手段转化为具身监督信号 - **跨模态数据增强**:基于生成的未来帧构造反事实(counterfactual)训练样本,提升模型对物理扰动的鲁棒性 —- ### 8. 推理效率与边缘部署优化 8B 模型在生成长序列视觉 token 和动作 token 时的延迟与显存开销是实际部署的瓶颈。可研究: - 针对视觉 token( 768 个 VQ token 每帧)的投机解码(speculative decoding)或蒸馏压缩 - 动作 token 与视觉 token 的生成是否可以解耦或并行化 - 模型量化与边缘设备适配,使统一物理基础模型能运行在机器人本体计算单元上 Q6: 总结一下论文的主要内容 该论文提出了 **PhysBrain 1.5**,一个面向物理智能的统一基础模型,旨在将具身环境中的**观察理解、动作执行与状态预测**整合到共享的自回归学习框架中。以下是对论文主要内容的系统总结: —- ### 1. 研究动机与核心问题 物理智能的本质是一个连续的**物理循环(physical loop)**:智能体观察场景、理解空间与语义、规划并执行动作、观察环境变化,进而指导下一次决策。然而,现有研究将这些能力割裂在各自独立的系统中——视觉-语言模型(VLM)负责理解,视觉-语言-动作模型(VLA)负责控制,世界模型负责未来预测。论文试图解决的核心问题是:**如何在异构的监督信号(语言、机器人轨迹、密集像素)下,将理解、行动与预测统一到一个可扩展的物理基础模型中**。 —- ### 2. 统一架构与训练目标 PhysBrain 1.5 以 Qwen3-VL-Instruct (8B) 为基座,通过扩展词汇表与共享输出头实现三模态的统一表达: - **统一词汇表**:将语言词表扩展为三类离散 token 的并集
V = V(lang) ∪ V(act) ∪ V_(vis)
- **统一训练目标**:所有任务均采用掩码自回归 next-token 预测
L(AR) = -∑(i=1)^(|y|) mi log pθ(yi mid x, y(<i))
其中 mi 为任务特定的损失掩码,仅对当前任务对应的目标 token 进行监督。无论是生成语言答案、动作 token 序列还是视觉 token 序列,底层优化目标完全一致。 —- ### 3. 动作与视觉状态的离散化表达 #### 动作生成 模型预测未来 H=16 步的末端执行器轨迹。每步动作 a(t,k) ∈ R^(10) 包含相对平移(3D)、相对旋转(连续 6D 表示 rho_6 )与绝对夹爪开合度(1D):
a(t,k) = [p(t+k) - pt,; rho_6(R_t^top R(t+k)),; g(t+k)]
通过 ActionPiece 分词器,一段 16 步轨迹被编码为 32 个离散动作 token。为处理不同机器人数据源在坐标系、频率与单位上的异质性,模型不强制全局坐标规范,而是将**前一动作片段**作为局部运动上下文输入,利用自回归机制实现**同质动作延续(homogeneous action continuation)**。 #### 视觉基础生成(未来状态预测) 未来物理状态 S(t+Delta) 由空间对齐的 RGB 图像、深度图与机器人掩码组成。三种模态通过共享 VQ-VAE 离散化为代码本索引,并在空间上按 RGB–Depth–Mask 的顺序逐位置交错排列,形成 770 个 token 的序列(含边界符)。模型通过共享输出头自回归生成该序列,再经冻结的 VQ 解码器重建为像素空间输出,无需引入模态特定的生成头或像素级重建损失。 —- ### 4. 数据与训练策略 论文采用**两阶段训练**: - **物理感知预训练**:全部具身监督来源于人类交互视频( egocentric、exocentric 及全景视频),构建约 2400 万感知样本、3100 万动作样本与 2680 万未来状态样本,并混合通用多模态指令数据。 - **具身监督微调(SFT)**:在高质量人类交互数据基础上,引入 17 个真实机器人平台与仿真环境的轨迹、动作及未来帧数据,进一步扩展至多样化具身形态与任务。 训练使用 ms-swift 与 Megatron-Core 后端,采用分布式 Adam 优化器、bf16 精度与余弦学习率调度,两阶段各训练一个 epoch。 —- ### 5. 实验评估与核心结果 论文从四个互补维度进行评估: - **具身理解(28 个 benchmark)**:在涵盖视觉-空间感知、空间与多视角理解、具身推理与规划、空间定位与可供性、视觉轨迹推理的 28 个基准上,8B 模型取得**平均 72.5 分**,为**开源最优**,与闭源领先的 GPT-6-Astra (73.3) 和 Gemini 3.6 Flash (73.0) 性能相当,并在 14 个基准上排名第一。 - **通用多模态理解**:在 MME、MMStar、VideoMME、DocVQA 等 12 个通用基准上,性能与基线 Qwen3-VL-Instruct 基本持平,表明专门化具身训练未损害模型的通用视觉-语言能力。 - **动作轨迹预测**:定性验证了模型在分布内及分布外(OOD)场景中,基于历史动作上下文生成合理的末端执行器轨迹的能力;预训练过程中动作 token 困惑度在 ID 与 OOD 数据上均持续下降。 - **未来视觉预测**:模型能够基于当前观测与任务指令,生成空间一致的未来 RGB、深度与机器人掩码,预测与任务进度一致的场景演变。 —- ### 6. 核心贡献 PhysBrain 1.5 的核心贡献在于证明了:**通过将语言、动作轨迹与密集视觉状态统一为离散 token 并在共享的自回归框架下联合学习,物理循环中的异构能力可以相互增强,而非彼此割裂**。该工作以人类交互视频为桥梁,在仅 8B 参数规模下实现了开源物理基础模型的性能突破,为从“理解物理世界”到“与物理世界交互并预测其演变”提供了统一的模型范式。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: DeepCybo Team,Yu Bin,Haipeng Cao,Zheng Chang,Kai Chen,Youning Chen,Kailin Deng,Yichao Du,Xiaotong Fu,Haoyang Ge,Yunlong Guo,Chenliu Hao,Jiyan He,Xuguo He,Yakun Hou,Kai Hu,Cong Huang,Tuopusen Huang,Yu Huang,Hong Li,Peize Li,Shijie Lian,Xiaopeng Lin,Yun Lin,Haibao Liu,Haochen Liu,Qiuzhi Liu,Shengcai Liu,Zhiqiang Liu,Tao Luo,Peng Ren,Shuo Ren,Chaoyi Ruan,Zhaolong Shen,Yukun Shi,Qiyuan Su,Yuxuan Tian,Yining Wang,Changti Wu,Hao Wu,Xueyin Xu,Ruoqi Yang,Zhaoyang Yang,Hang Yuan,Zhaoyang Zeng,Hanwen Zhang,Ruimeng Zhang,Yao Zhang,Yibo Zhang,Yuxiang Zhang,Zhirui Zhang,Ziyi Zhang,Zubin Zheng,Zishen Zhuang
Categories:
PDF URL: https://arxiv.org/pdf/2609.14973.pdf
Arxiv URL: https://arxiv.org/abs/2609.14973
Arxiv ID: 2609.14973
CoolPaper URL: https://papers.cool/arxiv/2609.14973
Published: 2026-09-16T01:38:42.609Z
Updated: 2026-09-16T01:38:42.609Z
6. RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
Abstract:Digital agents must often adapt to new environments whose interfaces, tools, and failure modes are not fully captured by pretrained models. We introduce \textbf{RSIAgent}, a training-free multi-agent framework for recursive self-improvement through autonomous memory construction. RSIAgent coordinates curriculum, actor, and verifier agents to continually explore the environment, validate outcomes, and retain environment-specific knowledge, including reusable causal relationships between actions, conditions, and consequences. It further adopts a \textbf{broad-then-deep} exploration strategy, combining parallel broad recursive self-exploration for discovering diverse environment structures with focused deep self-exploration for uncovering hard cases, hidden constraints, boundary conditions, and previously unknown causal dependencies. The resulting memory is frozen and can be directly reused for downstream tasks without updating model parameters. Experiments on OSWorld-v2 and Agent’s Last Exam show that RSIAgent substantially improves strong open-source models, enabling Kimi-K3 and GLM-5.3 to outperform frontier closed-source models including GPT-6.
中文摘要
摘要:数字代理通常必须适应新的环境,而这些环境的界面、工具和故障模式并未被预训练模型完全捕捉到。我们提出了\textbf{RSIAgent},一个无需训练的多代理框架,通过自主构建记忆实现递归自我改进。RSIAgent 协调课程、执行者和验证者代理,持续探索环境、验证结果并保留特定环境知识,包括可重用的动作、条件与结果之间的因果关系。它进一步采用\textbf{先广后深}的探索策略,将平行广泛的递归自我探索用于发现多样化的环境结构,与针对难点、隐藏约束、边界条件及先前未知因果依赖的集中深入自我探索相结合。生成的记忆将被冻结,可直接在下游任务中重复使用而无需更新模型参数。在 OSWorld-v2 和 Agent’s Last Exam 的实验中,RSIAgent 显著提升了强大的开源模型,使 Kimi-K3 和 GLM-5.3 超越包括 GPT-6 在内的前沿闭源模型。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*数字代理(digital agents)在新环境中自主适应与递归自我改进\*\*的问题,具体可分解为以下几个层面: ### 1. 核心问题:预训练模型难以覆盖新环境的动态性 数字代理经常需要操作\*\*全新的软件环境\*\*,这些环境的界面、工具、惯例及失败模式往往未被预训练模型充分捕捉。论文指出,现有系统在面对这类环境时,缺乏有效的机制来自主获取并固化环境特定的知识。 ### 2. 现有范式的局限 当前主流的适应方法通常依赖: - 收集额外的交互数据进行进一步训练; - 人工辅助标注或演示。 这类范式存在明显不足: - \*\*成本高昂\*\*:需要大量人力与计算资源; - \*\*适用性差\*\*:难以应用于\*\*私有环境\*\*或\*\*持续变化的环境\*\*; - \*\*灵活性低\*\*:每次环境变化都需重新训练或微调模型参数。 ### 3. 关键科学问题 论文将问题形式化为一个\*\*无需更新模型参数\*\*的递归自我改进(Recursive Self-Improvement, RSI)框架设计问题: > 如何使代理能够自主地在新环境中发现\*\*行动、环境条件与结果之间的因果关联\*\*,并将这些关系组织成\*\*可重用的持久记忆(persistent memory)\*\*,从而在不修改模型权重的前提下持续提升下游任务表现? ### 4. 具体技术挑战 为实现上述目标,论文需解决三个子问题: - \*\*探索策略设计\*\*:如何高效地识别有价值的环境交互经验,而非盲目尝试; - \*\*验证与 grounding\*\*:如何基于环境反馈可靠地验证结果,避免错误经验被记忆; - \*\*记忆巩固与重用\*\*:如何将分散的探索经验整合为结构化的、可直接用于下游任务的因果知识。 简言之,RSIAgent 试图证明:\*\*通过纯测试时的多代理协作与记忆管理,开源模型可以仅借助自主探索就超越前沿闭源模型\*\*,从而摆脱对传统“收集数据-重新训练”范式的依赖。 Q2: 有哪些相关研究? 根据论文第5节(Related Work),相关研究可分为\*\*数字代理(Digital Agents)\*\*与\*\*代理的递归自我改进(Recursive Self-Improvement of Agents)\*\*两大主线。 ### 1. 数字代理(Digital Agents) 该方向关注如何在软件环境中利用语言模型推理与工具使用完成复杂任务,主要涵盖以下子领域: - \*\*基准测试与评估\*\*:针对桌面应用、工具环境及开放域任务的多模态代理基准,如 OSWorld
40, 47
、Agent’s Last Exam
24
、GameCraft-Bench
17
、ToolGym
38
等;同时也涉及对动态需求变化与执行质量的评估
6, 11, 18, 58
。 - **视觉定位与 GUI 交互**:提升代理在图形界面上的感知与操作能力,如 SeeClick
4
、WebVoyager
8
、GPT-4V(ision) as a generalist web agent
56
等。 - **从演示或合成经验中学习**:OpenCUA
30
利用人类演示进行学习;UI-TARS-2
27
采用多轮强化学习;EvoCUA
42
结合可扩展的合成经验与策略优化。 - **代码即策略(Code-as-Policy)**:CodeAct
29
将代理动作表示为可执行程序,允许通过执行反馈进行修订;Cradle
25
、OS-Copilot
37
与 Agent S2
1
则支持应用控制、可重用技能与协调执行。 - **规划、失败恢复与信息组织**:研究关注结构化数据推理、长程规划、失败恢复及信息组织,如 StructGPT
12
、VLA-GUI
7
、Learning from Failure
23
、Planner Matters
34
、StructAgent
35
等。 - **可靠性增强**:通过外部证据与反馈机制提升代理可信度,如可验证奖励
5
、基于语料的不确定性量化
19
、声誉惩罚设计
43
等。 **与本文的区别**:上述工作大多聚焦于代理能力的直接构建或训练,而 RSIAgent 关注在**新环境中无需更新模型参数**的自主适应与记忆重用。 —- ### 2. 代理的递归自我改进(Recursive Self-Improvement of Agents) 该方向研究代理如何通过自我反思、经验积累或程序进化来提升性能,主要涵盖: - **代理设计与提示进化**:包括自动化的代理系统设计
9, 21
、反思性提示进化
2
、以及执行策略的自我进化
45
。 - **自修改与元进化**:DGM
52
在编码基准上评估自修改代理;HGM
28
利用后代性能识别具有更大改进潜力的代理;Hyperagents
53
允许元代理同时修改自身与任务代理,使改进程序与任务求解能力共同进化。 - **从生成经验中学习**:AREX
16
、Agent0
39
等探索从零数据或少量数据出发,通过工具集成推理递归生成训练经验。 - **持久记忆与经验积累**:早期工作将经验积累为反思、技能、手册或持久记忆,如 Reflexion
22
、AutoManual
3
、Voyager
26
、Prime Agent
13
。近期研究进一步改进知识的组织、更新与检索机制,如 HyMEM
57
、GAM
36
、SelfMem
44
、Agentic Context Engineering
54
、Auto-scaling Continuous Memory
32
、General Continuous Memory
33
、MemSkill
51
等。 - **环境探索与技能协同进化**:EchoTrailGUI
14
与 ZhuLong
15
通过自主探索构建可重用记忆;CoEvoSkills
50
与 Recuris
46
利用验证反馈精炼技能与记忆;MetaSkill-Evolve
31
通过双时间尺度元技能进化实现递归改进。 **与本文的区别**:现有递归自我改进方法往往依赖**基准分数、标注参考数据或外部任务奖励**。RSIAgent 的核心差异在于,它在**全新的数字环境中**、**无外部任务奖励**、**无 gold label** 的条件下,通过多代理协作与**环境反馈**自主构建可重用的因果记忆,且**不更新模型参数**。 Q3: 论文如何解决这个问题? 该论文提出 **RSIAgent**,一个**无需训练(training-free)的多代理递归自我改进框架**,通过自主探索构建可重用的持久记忆,使代理能够适应全新环境。其解决方案可分解为以下三个层面: —- ### 1. 多代理协作框架(Multi-Agent Harness Framework) 论文将代理系统解耦为三个互补角色,通过递归的课程-行动-验证循环(recursive curriculum-action-verification loop)协同工作: - **课程代理(Curriculum Agent)**:作为高层协调者,根据当前目标、已积累记忆与历史探索结果,生成并调度练习任务。它决定下一步应探索哪些前置技能、变体场景或压力测试用例,以最大化信息增益。 - **执行代理(Actor Agent)**:作为核心策略模型,基于**持久记忆** M 与交互历史 h_t 生成可执行动作。论文采用**代码即策略(code-as-policy)**范式,将动作 a_t 表示为可执行程序(Python/Bash),以统一控制异构软件系统:
at sim πθ(· mid q, ht, M)
该代理的记忆是可进化的:在获得验证反馈后,它通过蒸馏(distillation)与调和(reconciliation)将新经验整合进 M ,并修正或删除过时、矛盾的知识。 - **验证代理(Verifier Agent)**:作为独立评估者,直接检查环境反馈(执行结果、界面状态等),对执行代理的输出作出基于证据的判决(PASS/FAIL/UNVERIFIED)。验证代理与执行代理隔离,避免关联错误,并确保只有经环境确证的经验才能进入记忆。 —- ### 2. 两阶段自主探索策略(Broad-Then-Deep Exploration) 为实现高效且全面的环境适应,论文设计了由粗到细的两阶段探索流程,类似于现代大模型开发中“预训练-后训练”的范式: - **广度递归自探索(Broad Recursive Self-exploration, BRS)** 目标是在新环境中快速建立**广度覆盖**。课程代理在每一轮迭代中**并行**生成多个面向不同方向的探索任务;执行代理在隔离环境中并行执行,验证代理独立评判。完成后,所有经验按顺序整合进记忆。通过递归多轮,BRS 逐步积累多样化的环境知识、可重用程序与失败模式。 - **深度递归自探索(Deep Recursive Self-exploration, DRS)** 在 BRS 构建的广义知识基础上,DRS 转向**深度精炼**。课程代理**串行**地提出更具挑战性的任务,专门暴露难点、隐藏约束、边界条件与先前未知的因果依赖。每完成一个任务并验证后,经验立即被巩固进记忆,再生成下一轮更难的任务。这种递进式压力测试确保记忆不仅广而且深。 —- ### 3. 持久记忆的构建、冻结与测试时重用(Memory Construction & Reuse) - **记忆内容**:记忆不仅存储成功的轨迹,更强调对环境特定的**因果结构**进行编码——即动作、环境条件与后果之间的稳定依赖关系。它包含可重用脚本、约束条件、失败教训及不确定性标注。 - **记忆更新与冲突解决**:执行代理在验证后执行两步学习流程:(1)**蒸馏**——从轨迹与验证报告中提取有用程序、约束与教训;(2)**调和**——检查新旧记忆间的冲突、过度泛化或陈旧假设,进行修订、限定或删除,而非简单追加。 - **冻结与零参数重用**:探索结束后,记忆被**冻结(frozen)**。在下游任务测试阶段,课程代理与记忆更新机制均被禁用,执行代理直接在上下文中加载冻结记忆 M 以指导行动。整个过程中**模型参数 πθ 始终固定不变**,仅通过上下文记忆实现性能提升。 —- ### 总结 RSIAgent 通过**多代理角色分离**确保探索的多样性与验证的可靠性,通过**广度-深度两阶段策略**实现环境知识的高效覆盖与精细打磨,最终将这些知识固化为**可重用的因果记忆**。该方法无需额外训练数据、无需人类监督、无需更新模型权重,即可使开源模型在新环境中实现递归自我改进,并在多项基准上超越前沿闭源模型。 Q4: 论文做了哪些实验? 论文在 **OSWorld 2.0**、**Agent’s Last Exam (ALE)** 以及 **GameCraft-Bench** 等多个基准上进行了系统评估,涵盖性能对比、消融分析、轮次效应、跨域泛化与失败模式审计。具体实验内容如下: —- ### 1. 基准测试与实验设置 - **评测基准** - **OSWorld 2.0 (0808 offline)**:包含 82 个离线任务,涉及文档编辑、媒体制作及专业工程/科学软件工作流
47
。 - **Agent’s Last Exam (ALE) Near-term**:包含 67 个近期任务,涵盖计算、金融、工程、科学分析及视觉媒体等专业工作流
24
。 - **GameCraft-Bench**:从该基准随机采样 40 个任务,用于验证在自主游戏开发这一交互式场景中的泛化能力
17
。 - 评价指标 - Partial score:归一化任务得分的均值($si ∈
0,1
$),反映渐进式完成度:
Partial = 100 · (1) / (N)∑(i=1)^(N) s_i
- **Binary accuracy**:获得满分的任务比例,要求完全正确:
Binary = 100 · (1) / (N)∑_(i=1)^(N) 1s_i = 1 - **模型配置** - 默认以 **GLM-5.3** 作为执行代理(actor agent),**Kimi-K3** 作为验证代理(verifier agent)与课程代理(curriculum agent)。 - 采用代码即策略(code-as-policy)框架,动作空间为可执行的 Python/Bash 程序。 - 整个递归自我改进(RSI)过程**不更新任何模型参数**,仅通过上下文记忆实现适应。 —- ### 2. 主要性能对比结果 在两项核心基准上,RSIAgent 通过自主探索与记忆重用显著提升了开源模型的表现: - **OSWorld 2.0**:Partial score 从基线的 71.97% 提升至 **78.98%**,Binary accuracy 从 37.80% 提升至 **42.68%**。 - **Agent’s Last Exam**:Partial score 从 83.75% 提升至 **84.82%**,Binary accuracy 从 49.25% 提升至 **50.75%**。 与前沿闭源模型的对比显示: - 基于 GLM-5.3 与 Kimi-K3 的 RSIAgent 在 OSWorld 2.0 上达到 78.98,超越 GPT-6 Astra(72.60)与 Claude Opus 5(70.19)。 - 在 ALE Near-term 上达到 84.82,同样高于 GPT-6 Astra(82.26)与 Claude Opus 5(79.54)。 这表明,通过有效的代理级自我改进,开源模型在不修改参数的情况下能够缩小甚至逆转与闭源前沿模型的能力差距。 —- ### 3. 消融实验:广度与深度探索的贡献 为验证两阶段探索策略的有效性,论文在 OSWorld 2.0 的四个任务(T080、T085、T089、T106)上进行了阶段消融: - **Full RSI**(BRS + DRS):平均 Partial score 为 **74.54%**。 - **w/o DRS**(仅广度探索):平均得分 **65.52%**。 - **w/o BRS**(仅深度探索,空记忆启动):平均得分 **56.50%**,且在 T085 与 T089 上低于基线。 - **w/o RSI**(无记忆基线):得分最低。 实验结果表明: - 仅广度探索即可一致地超越基线,建立基础环境覆盖。 - 但**结合广度与深度探索**才能取得最优表现,深度探索对挖掘边界条件与隐藏约束至关重要。 —- ### 4. RSI 轮次效应分析 论文追踪了三个代表性 OSWorld 2.0 任务(T044:视频编辑;T049:演示文稿修复;T065:铁路预订)在递归探索过程中的得分变化: - 随着 BRS 积累多样化程序、DRS 细化任务细节,任务得分呈现**阶梯式突破**。 - 到第 8 步时,T044 与 T065 的 Partial score 达到 **100%**,T049 达到 **80%**。 - 曲线显示,当记忆逐渐覆盖目标任务的关键需求后,解决剩余瓶颈可带来**离散的性能跃升**,而非仅边际增益。 —- ### 5. 泛化性验证:游戏开发环境 为检验 RSIAgent 在标准计算机使用任务之外的泛化能力,论文在 **GameCraft-Bench** 的 40 个游戏开发任务上进行了评估,并与 Play2Code
11
(基于迭代试玩与代码修订的持续改进基线)进行对比: - **RSIAgent 持续改进不同强度的基线生成器**:无论是基于 Codex + GPT-5.5 的高质量初始游戏,还是基于 Kimi-K2.6 或 GLM-5.3-Flash 的较弱基线,RSIAgent 均能一致提升游戏质量(Mechanics、Depth、Visuals、Art 与 Overall 指标)。 - **Play2Code 的局限性**:对较弱基线有效,但对已有较高质量的基线收益递减,甚至可能导致质量下降。 - **经验重用的价值**:积累的可重用记忆为诊断与编辑不同类型游戏提供了通用知识,进一步提升了开发质量。 —- ### 6. 失败模式分析 通过对审计案例的归纳,论文识别了限制递归自我改进的三类核心失败机制: 1. **探索指向性不足(Insufficiently Targeted Exploration)** 当课程代理生成的练习未能充分挑战导致失败的特定决策时,目标相关的弱点(如未测试的“缺失信息处理规则”)会持续残留于记忆中。 2. **验证不完整(Incomplete Verification)** 局部验证可能批准尚未满足全部任务要求的执行(如未检查的字段值或工件差异)。被错误接受的结果会成为后续记忆更新与探索决策的基础,导致错误传播。 3. **记忆巩固不可靠(Unreliable Memory Consolidation)** 未充分验证的决策可能被固化为通用规则(如将缺失数据标记视为有效答案),并在后续执行中被反复重用。有效记忆必须保留经验条件与不确定性,而非将局部接受等同于普遍有效性。 —- ### 7. 案例研究:从记忆增长到任务执行 附录 E 提供了多个任务的详细轨迹分析,展示了记忆如何在探索中积累并在测试时重用: - **T065(铁路预订)**:BRS 阶段通过动态座位表观察学习到“内容驱动的列宽变化”与状态重检测方法;DRS 阶段通过连续的目标尝试修正了中转规则与页面渲染完整性检查,最终记忆指导完成预订。 - **T049(演示文稿修复)**:DRS 第一阶段因错误解读“保留元素属性”约束而失败,记忆记录此失败;随后通过补充练习验证修正后的规则,第二阶段成功修复连接器锚点,使任务得分从 0.40 提升至 0.80。 - **T044(视频编辑)**:BRS 积累跨分辨率的裁剪与对称填充经验;DRS 通过多轮目标实践细化了对原生滤镜(native crop)与导出参数的检查流程,最终得分从 0.40 提升至 1.00。 - **T103(FreeCAD 建模)** 与 **T085(REAPER 音频制作)**:展示了如何从工程图纸解读与音频片段规划中提炼可重用程序,并通过冻结记忆在评估时实现更高的部分得分。 这些案例验证了 RSIAgent 能够将环境特定的因果知识(如界面动态、应用原生操作、隐藏约束)编码为持久记忆,并在下游任务中直接重用。 Q5: 有什么可以进一步探索的点? 基于论文的**局限(Limitations)**与**结论(Conclusion)**部分,结合方法论的设计空间,可进一步探索的方向包括: —- ### 1. 扩展至更广泛的交互领域 论文提出将递归自我改进从数字计算机使用环境拓展到: - **AI for Science**:代理需学习专业科学工具、实验流程与领域特定工作流,验证信号可能涉及长周期实验或数值模拟,而非即时的界面反馈。 - **复杂游戏环境**:开放世界或持续演化的游戏提供更长的探索 horizon,适合研究长程适应、在线学习与持续自我改进,且游戏状态通常具有更高随机性。 —- ### 2. 降低测试时计算成本 RSIAgent 依赖额外的探索与练习,引入了显著的测试时开销(test-time computation cost)。未来可探索: - **自适应预算分配**:根据任务复杂度或记忆覆盖率动态调整 BRS/DRS 的预算,而非固定预算或简单的课程停止规则。 - **高效经验采样**:利用不确定性估计或信息增益最大化,减少冗余探索,将计算资源集中于高价值经验。 - **记忆压缩与索引优化**:在保持因果信息的前提下,对记忆进行结构化压缩或层次化索引,降低推理时的上下文长度与检索开销。 —- ### 3. 提升验证代理的可靠性与错误控制 当前验证代理基于模型判断,可能产生错误判决并随探索递归传播,导致**错误记忆固化**。可探索: - **多验证器共识机制**:引入多个独立验证视角或基于规则的程序验证(programmatic verification),减少对单一模型判断的依赖。 - **反事实与对抗性验证**:主动构造边界案例或对抗性测试,检验已记忆规则的鲁棒性,防止过度泛化。 - **置信度感知的记忆更新**:将验证置信度或证据强度编码进记忆,区分高确定性规则与启发式假设,避免低置信度经验被无条件重用。 —- ### 4. 因果发现与知识表示的深度增强 论文强调记忆应编码可重用的**因果结构**,但当前记忆由执行代理以自由文本形式维护。未来可研究: - **符号化因果图表示**:将动作-条件-后果关系显式表示为因果图或程序规范,支持结构化的反事实推理与干预模拟。 - **跨环境知识迁移**:研究如何将一个环境中发现的因果模式(如通用 UI 原则、错误处理逻辑)迁移到结构相似的新环境,减少从零开始的探索。 - **动态记忆修订的形式化保证**:设计机制确保记忆更新满足一致性或单调性约束,避免新知识引入逻辑矛盾。 —- ### 5. 组件贡献的精细化解耦分析 论文指出当前实验**未完全隔离每个组件的独立贡献**。系统性的消融与机制研究可包括: - 分离课程代理、执行代理、验证代理各自对最终性能的贡献边界; - 量化 BRS 的广度覆盖与 DRS 的深度精炼在不同环境类型(如 GUI 密集型 vs. API 密集型)中的相对重要性; - 探索非对称模型配置(如更强的验证代理但较弱的执行代理)对整体 RSI 效率的影响。 —- ### 6. 安全性、对齐与伦理约束机制 RSIAgent 能够自主执行程序并保留可重用记忆,带来了意外操作与隐私风险。未来需探索: - **沙箱化与权限感知的探索**:在未知环境中,代理应在最小权限原则下启动探索,逐步申请更高权限,而非直接获得完整系统访问。 - **价值对齐的记忆过滤**:在记忆巩固阶段引入安全约束,防止将有害操作模式(如绕过身份验证、数据泄露脚本)编码为可重用知识。 - **可审计的记忆溯源**:为每条记忆条目记录其来源轨迹与验证证据,支持人类审计与事后追溯。 —- ### 7. 与参数更新方法的协同 论文采用纯上下文记忆、冻结参数的策略。可进一步探索: - **在线参数微调与记忆增强的混合范式**:在自主探索生成高质量环境特定数据后,选择性更新部分低秩适配器(LoRA)或模型层,与冻结的记忆库协同工作。 - **将探索记忆蒸馏为模型权重**:在隐私允许的场景下,将反复验证的因果知识通过持续预训练或后训练固化到模型参数中,实现跨会话的零上下文迁移。 Q6: 总结一下论文的主要内容 该论文提出 **RSIAgent**,一种面向全新数字环境的**无需训练(training-free)多代理递归自我改进框架**。其核心思想是通过自主探索构建可重用的持久记忆,在不更新模型参数的前提下,使开源模型能够适应未知环境并超越前沿闭源模型。 ### 1. 研究背景与问题 - 数字代理(digital agents)经常需要操作**训练时未见过的新环境**,这些环境的界面、工具、惯例及失败模式难以被预训练模型完全覆盖。 - 现有适应方法通常依赖**收集交互数据进行再训练**或**人类辅助标注**,成本高昂且难以应用于私有或持续变化的环境。 - 核心挑战:如何使代理仅通过**测试时的自主探索**,发现行动、环境条件与后果之间的**因果关联**,并将其固化为可重用的结构化记忆,以支持下游任务。 ### 2. 方法论:RSIAgent 框架 论文提出由三个互补代理组成的**多代理协作框架**,以及**广度-深度两阶段探索策略**: #### 2.1 多代理角色分离 - **课程代理(Curriculum Agent)**:决定下一步探索什么,基于当前记忆与历史结果生成练习任务(前置技能、变体、压力测试等)。 - **执行代理(Actor Agent)**:基于持久记忆 M 与交互历史 h_t 生成可执行动作。论文采用**代码即策略(code-as-policy)**,动作 a_t 表示为可执行程序:
at sim πθ(· mid q, ht, M)
执行代理的记忆是**可进化**的:在验证后,通过蒸馏(distillation)与调和(reconciliation)整合新知识、修正矛盾或删除过时信息。 - **验证代理(Verifier Agent)**:独立于执行代理,直接基于环境反馈(执行结果、界面状态等)作出 **PASS/FAIL/UNVERIFIED** 判决,防止关联错误,确保只有经环境确证的经验才能进入记忆。 #### 2.2 广度-深度两阶段探索 - **广度递归自探索(Broad Recursive Self-exploration, BRS)**:**并行**执行多个面向不同方向的探索任务,快速建立对环境的广泛覆盖,积累多样化的程序、约束与失败模式。 - **深度递归自探索(Deep Recursive Self-exploration, DRS)**:**串行**递进地提出挑战性任务,聚焦硬案例、隐藏约束、边界条件与未知因果依赖,逐步精炼记忆。 - **冻结与重用**:探索结束后记忆被**冻结**,测试时直接加载至上下文供执行代理重用,课程代理与记忆更新均被禁用,**模型参数 πθ 全程固定**。 ### 3. 实验与结果 论文在多个基准上验证了 RSIAgent 的有效性: - **OSWorld 2.0 (082 tasks)**:Partial score 从基线 71.97% 提升至 **78.98%**,Binary accuracy 从 37.80% 提升至 **42.68%**。 - **Agent’s Last Exam (67 tasks)**:Partial score 从 83.75% 提升至 **84.82%**,Binary accuracy 从 49.25% 提升至 **50.75%**。 - **模型对比**:基于开源模型 Kimi-K3 与 GLM-5.3 的 RSIAgent,在两项基准上均超越前沿闭源模型 **GPT-6 Astra** 与 **Claude Opus 5**。 - **GameCraft-Bench (40 tasks)**:在自主游戏开发场景中,RSIAgent 一致改进不同强度的基线游戏,优于基于迭代试玩的 **Play2Code** 基线。 #### 3.1 关键分析 - **消融实验**:在四项 OSWorld 任务上,Full RSI(BRS+DRS)平均得分 **74.54%**,优于仅 BRS(65.52%)与仅 DRS(56.50%),验证了两阶段结合的必要性。 - **轮次效应**:随着递归探索进行,任务得分呈**阶梯式突破**(如 T044、T065 最终达满分),表明关键瓶颈被逐步解决。 - **失败模式**:识别出三类限制机制——**探索指向性不足**、**验证不完整**、**记忆巩固不可靠**,并给出相应分析。 ### 4. 主要贡献 - 提出 **RSIAgent**,一种通用的多代理递归自我改进框架,无需更新模型参数即可自主获取、验证并重用在全新环境中发现的因果知识。 - 设计 **BRS 与 DRS** 两阶段探索策略,实现从环境广度覆盖到关键细节的深度精炼。 - 实证表明,有效的代理级自我改进能够显著缩小甚至逆转开源与闭源基础模型之间的能力差距。 ### 5. 局限与未来方向 - **测试时计算成本较高**:自主探索引入额外开销,未来可研究自适应预算分配与高效经验采样。 - **验证代理的可靠性**:模型级验证错误可能递归传播,需多验证器共识或置信度感知记忆更新。 - **记忆表示的深度**:当前为自由文本,未来可探索符号化因果图与跨环境知识迁移。 - **应用扩展**:可推广至 **AI for Science**、复杂开放游戏等更广泛的长程交互领域。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Sibo Zhu,Shicheng Fan,Xinyue Wang,Wenyi Wu,Kun Zhou,Biwei Huang
Categories:
PDF URL: https://arxiv.org/pdf/2609.15364.pdf
Arxiv URL: https://arxiv.org/abs/2609.15364
Arxiv ID: 2609.15364
CoolPaper URL: https://papers.cool/arxiv/2609.15364
Published: 2026-09-16T01:38:46.913Z
Updated: 2026-09-16T01:38:46.913Z
7. Grouped Value Attention: Efficient KV Caching via On-Demand Key Reconstruction
Abstract:The KV cache is a primary bottleneck for Transformer decoding: its memory footprint and cache-read traffic grow with sequence length. Grouped-query attention (GQA) reduces this cost by sharing key-value heads, but still stores both a key and a value at every step. We introduce Grouped Value Attention (GVA), which stores grouped values and reconstructs content keys with a learned linear map. At inference, the map can be absorbed into the query, eliminating the need to materialize content keys in the intended decode path. A small shared decoupled RoPE channel retains positional information through a separately cached positional key. For the configurations studied, this representation reduces persistent cache scalars by approximately 45-47% relative to matched GQA. At the 350M-parameter scale with 30B FineWeb-Edu tokens, the 16-dimensional positional variant reaches 44.18 average accuracy across five tasks, compared with 44.36 for GQA and 43.88 for MLA. These results demonstrate near-GQA benchmark accuracy with a more compact cache representation. To translate this compact representation into faster autoregressive inference, we have developed custom decoding kernels and are currently evaluating their end-to-end inference performance with an open-source release planned soon.
中文摘要
摘要:KV 缓存是 Transformer 解码的主要瓶颈:其内存占用和缓存读取流量会随着序列长度增长而增加。分组查询注意力(GQA)通过共享键值头来降低此成本,但仍然在每一步存储键和值。我们提出了分组值注意力(GVA),它存储分组值并通过学习的线性映射重建内容键。在推理阶段,该映射可以吸收到查询中,无需在预期的解码路径中具体化内容键。一个小型共享的解耦 RoPE 通道通过单独缓存的位置键保留位置信息。对于所研究的配置,这种表示相比匹配的 GQA,持续缓存标量减少了约 45-47%。在拥有 350M 参数、30B FineWeb-Edu 词元的规模下,16 维位置变体在五项任务中的平均准确率达到 44.18,相比之下 GQA 为 44.36,MLA 为 43.88。这些结果表明,通过更紧凑的缓存表示可以实现接近 GQA 的基准准确性。为了将这种紧凑表示转化为更快的自回归推理,我们开发了自定义解码内核,并且目前正在评估其端到端的推理性能,计划很快开源发布。
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决Transformer自回归解码中\*\*KV缓存的内存占用与带宽瓶颈\*\*问题。 在Transformer解码阶段,每次生成新token都需要读取此前所有token的key和value,导致KV缓存的存储量和访问流量随序列长度线性增长,成为长上下文服务中的主要容量与带宽开销。现有方法仍存在局限: - \*\*GQA(Grouped-Query Attention)\*\*:通过共享key–value头降低了缓存,但每一步仍需写入并存储独立的key和value两个流。 - \*\*MLA(Multi-head Latent Attention)\*\*:将key和value压缩为联合隐状态进一步缩小缓存,但引入了额外的上投影与更复杂的解码路径。 为此,论文提出\*\*Grouped Value Attention (GVA)\*\*,核心思路包括: - \*\*仅缓存value\*\*:放弃持久化存储content key,转而缓存分组后的value向量。 - \*\*按需线性重建key\*\*:通过固定的学习线性映射 K = VM 从value重建content key;由于映射在推理时固定,可将其吸收进query投影中,避免在解码路径上物化完整的content key张量。 - \*\*解耦RoPE通道\*\*:采用一个极短且共享的decoupled RoPE切片保留位置信息,避免因标准RoPE破坏上述吸收机制而被迫恢复完整key缓存。 对于所研究的配置,这种表示相比同等配置的GQA可将\*\*持久缓存的标量减少约45–47%\*\*,同时在350M参数规模下保持与GQA接近的下游任务精度(44.35 vs. 44.36)。 Q2: 有哪些相关研究? 论文中与Grouped Value Attention (GVA) 直接相关的研究可分为以下几类: ### 1. 标准多头注意力(Multi-Head Attention, MHA) Vaswani等人提出的原始Transformer为每个注意力头维护独立的query、key和value投影。其KV缓存大小为 N_(MHA) = 2THd_h ( T 为序列长度, H 为query头数, d_h 为头维度),是后续所有缓存优化工作的基准。尽管表达能力最强,但其缓存随头数线性增长,解码带宽压力最大。 ### 2. 多查询注意力(Multi-Query Attention, MQA) Shazeer提出MQA,让所有query头共享\*\*单一\*\*key–value头( G=1 ),将缓存降至 N_(MQA) = 2Td_h ,实现了最大的缓存压缩比之一。然而,过度共享会显著降低key和value的表达能力,带来质量下降与训练稳定性问题。 ### 3. 分组查询注意力(Grouped-Query Attention, GQA) Ainslie等人提出的GQA在MHA与MQA之间进行插值:将 H 个query头划分为 G 个组,每组共享一组key–value头,缓存为 N_(GQA) = 2TGd_h 。当 G=H 时退化为MHA, G=1 时退化为MQA。GQA在较小分组数下即可接近MHA的质量,同时获得接近MQA的解码速度,已被Llama 2 70B等开源模型采用。\*\*GVA直接以GQA的分组结构为基础,但进一步移除了独立的key缓存。\*\* ### 4. 多头潜在注意力(Multi-Head Latent Attention, MLA) DeepSeek-V2提出的MLA将key和value压缩到一个低秩联合隐向量(宽度 d_c )中,并配合一个共享的RoPE切片(宽度 d_r ),缓存大小为 N_(MLA) = T(d_c + d_r) 。解码时,key的上投影可被吸收进query投影,避免物化完整key张量。\*\*GVA与MLA的关键区别在于\*\*:MLA使用独立的联合隐状态作为持久缓存,而GVA直接以value本身作为持久状态,通过线性映射 K=VM 重建key,保留了更直接的value通路。 ### 5. 分组查询专家(Grouped Query Experts, GQE) Tripathi与Kumar提出的GQE在GQA框架内引入混合专家(Mixture-of-Experts)路由机制:对每组内的query头进行专家选择,而key–value头保持稠密共享。GQE减少了query头的激活计算量,但\*\*缓存结构仍与GQA相同\*\*,并未像GVA那样改变KV缓存的存储形式。 ### 6. 其他相关技术 - \*\*低比特KV缓存量化\*\*:如KIVI等方向通过非对称量化压缩缓存位宽,可与GVA等结构优化正交使用。 - \*\*缓存内存管理\*\*:如PagedAttention通过操作系统风格的内存分页提升 serving 效率,解决的是缓存的\*\*分配与调度\*\*问题,而非表示本身。 Q3: 论文如何解决这个问题? 论文通过以下技术路径解决KV缓存的内存与带宽瓶颈: ### 1. 仅缓存分组值向量(Value-Only Cache) 不同于GQA同时缓存key与value两个流,GVA只缓存分组后的value向量 V_(g(h)) 。每个query头 h 通过独立的学习线性映射 M_h ∈ R^(d_h × d_n) 从所属value组按需重建content key:
Kh = V(g(h)) M_h
其中 g(h) 为query头 h 对应的value组索引。value本身携带需聚合至输出的内容信息,映射 M_h 仅从中提取用于注意力评分的特征。 ### 2. 推理时的映射吸收(Absorption) 由于 M_h 在推理阶段固定,content key无需在解码路径上显式物化。对于query头 h 与缓存位置 j ,content分数可重写为:
q(h) k(j,h)^top = q(h) (v(j,g(h)) Mh)^top = (q(h) Mh^top) v(j,g(h))^top = q(h) v(j,g(h))^top
其中 q(h) = q(h) Mh^top 在每个query token上仅计算一次。此后attention计算直接以 q(h) 与缓存的value向量做内积,完全省去content key的存储与读取。 ### 3. 解耦RoPE(Decoupled RoPE) 标准RoPE会破坏上述吸收机制:若对重建后的key施加位置旋转 R_j ,则
q(t)^(rot) (k(j)^(rot))^top = qt R_t^top R_j M^top v_j^top
相对旋转 R(j-t) 依赖于缓存位置 j ,无法被折叠为单一变换query。为解决此问题,GVA采用解耦RoPE策略: - 将query与key划分为**content切片**(宽度 dn )与**positional切片**(宽度 d_r ); - Content key不做旋转,保持可吸收形式:
k(j,h)^(nope) = v_(j,g(h)) M_h
- Positional key通过共享投影 Wr 生成,并施加RoPE,且在所有头间共享:
k(j)^(rope) = (x_j W_r) R_j^top - 最终注意力分数为两项之和:
q kj^top = q^(nope) (k(j)^(nope))^top + q^(rope) (k_(j)^(rope))^top
content部分仍满足吸收条件,而共享的positional key每token仅需额外缓存 d_r 个标量(论文中 d_r ∈ 16, 24 )。 ### 4. Query–Key尺度匹配初始化 在初始实验中,默认初始化导致重建key的尺度远小于query,造成注意力分布近乎均匀,早期训练需花费大量步骤修复此失配。论文采用尺度匹配初始化:
M(ij) sim N(0, (σ_Q^2) / (σ_V^2 d(textin)))
其中 d_(∈) 为value宽度, σ_Q 与 σ_V 分别为query与value的初始标准差。该初始化使得 Var(K_j) ≈ σ_Q^2 ,保证key与query在训练起始阶段处于可比尺度。可选的query RMSNorm可进一步稳定query尺度。 ### 5. 缓存规模缩减 以标量计数衡量每层每序列的持久缓存: - GQA:
N_(GQA) = 2TGd_h
- GVA(解耦RoPE):
N(GVA) = TGd_h + Td_r
两者比值为:
N(GVA)N(GQA) = (1) / (2) + (d_r) / (2Gd_h)
在论文所研究的配置下,第二项仅为几个百分点,因此GVA的缓存规模相对GQA减少约45–47%。若完全省略positional切片(如普通RoPE变体),则可达到理想的50%缩减,但此时无法在解码时吸收映射,需按位置重建key。 Q4: 论文做了哪些实验? 论文在约 **350M 参数规模** 的 decoder-only Transformer 上,使用 **300 亿 FineWeb-Edu token** 从头预训练,对多种注意力机制进行了对照实验。所有对比模型采用相同的数据顺序、token 预算、优化器设置和上下文长度,并使用 ZClip 自适应梯度裁剪以抑制训练中的梯度尖峰。 ### 1. 实验变体(对比方法) | 变体 | 说明 | |———|———| | **Shared KV** | 最简化的初版尝试:令 K=V ,仅缓存分组 value,缓存为 GQA 的一半。论文将其作为负面对照,**并非最终推荐方案**。 | | **GQA** | 标准分组查询注意力,缓存分组 key 与 value,作为强基线。 | | **MLA** | DeepSeek 的多头潜在注意力,缓存联合隐向量 + 共享 RoPE 切片。 | | **GVA baseline** | 使用线性重建 K_h = V(g(h))Mh ,但采用标准初始化。 | | **GVA, scale-matched + Q-norm** | 对 M_h 做 query–key 尺度匹配初始化(附录 A),并施加 query RMSNorm。 | | **GVA, variance-fixed, no Q-norm** | 默认 GVA 配置(尺度匹配初始化,但无 query RMSNorm),**不含解耦 RoPE**。 | | **GVA + DRoPE ( d_r=16 )** | 默认 GVA + 解耦 RoPE,位置切片宽度为 16(论文推荐的推理设计)。 | | **GVA + DRoPE ( d_r=24 )** | 默认 GVA + 解耦 RoPE,位置切片宽度为 24。 | ### 2. 评估指标 - **语言模型训练损失**:监控预训练过程中 loss 随 step 的变化趋势。 - **零样本下游准确率**:在以下 5 个任务上评测: - HellaSwag - WinoGrande - OpenBookQA (OBQA) - ARC-Easy - ARC-Challenge - **统计处理**:每个配置使用 **3 个不同随机种子** 各跑一次,报告每个任务在三组种子上的算术平均准确率;最终 **Average** 为五个任务均值的未加权平均。 - **缓存规模**:按公式计算每层每序列的持久缓存标量数(GQA、MLA、GVA 的理论对比)。 ### 3. 主要实验结果 - **训练损失(图 2)**:经尺度匹配后的 GVA 与 GQA、MLA 的损失曲线基本重合;标准初始化的 GVA baseline 早期较差,后期逐渐追近。引入解耦 RoPE 后未观察到二次崩溃。 - **Shared KV 失败对照(图 3)**:令 K=V 虽将缓存减半,但训练损失始终高于 GQA,未能恢复,验证了“单一向量同时承担评分与聚合”的不足。 - **下游准确率(表 2)**: - GQA 平均:**44.36%** - MLA 平均:**43.88%** - **GVA + DRoPE ( d_r=16 )** 平均:**44.35%**(与 GQA 相差 0.01 个百分点) - **GVA + DRoPE ( d_r=24 )** 平均:**44.29%** - GVA scale-matched + Q-norm(无 DRoPE)平均:**44.41%**,为所有 GVA 变体中最高。 - **缓存缩减**:解耦 RoPE 的 GVA 相对 GQA 减少约 **45–47%** 的持久缓存标量( d_r=16 时约 47%, d_r=24 时约 45%)。 ### 4. 补充实验材料 - **附录 A**:通过可视化热力图验证了 query/key 尺度失配对注意力分布的影响(过小导致均匀分布,过大导致尖锐 one-hot),并给出尺度匹配初始化的推导。 - **附录 B(图 6–10)**:提供了五个下游任务各自随训练步数变化的准确率曲线,覆盖表 2 中的全部七种配置。 Q5: 有什么可以进一步探索的点? 基于论文的 **Limitations** 与 **Conclusion** 章节,以及方法设计中的开放问题,以下方向值得进一步探索: ### 1. 端到端推理性能的系统测量 论文已开发自定义解码内核,但尚未报告融合解码吞吐量、峰值服务内存及 batch 容量等系统级指标。未来需验证 GVA 的紧凑表示能否真正转化为: - 更高的 autoregressive decode 吞吐; - 在相同显存预算下支持更大的 batch size 或更长的上下文; - 与现有 serving 框架(如 PagedAttention)集成后的实际内存占用。 ### 2. 模型规模与数据规模的扩展验证 当前实验仅在 **约 350M 参数、30B FineWeb-Edu token** 的单一设定下完成。需在更大参数量级(如 1B、7B 乃至 70B)和更多数据上验证: - GVA 的精度–缓存权衡是否保持; - 尺度匹配初始化在大模型深度下的稳定性; - 训练收敛速度是否随规模变化。 ### 3. RoPE 宽度与分配策略的系统搜索 论文仅测试了 d_r ∈ 16, 24 两个位置切片宽度,且 d_r=24 的平均精度略低于 d_r=16 。更系统的探索包括: - 更宽或更窄的 d_r 扫描,寻找精度–缓存帕累托前沿; - **Additive vs. Carved allocation**:位置维度 d_r 是额外叠加在内容宽度 d_n 之上,还是从原有头维度 d_h 中切分出来,对模型容量的影响尚未隔离。 ### 4. 更长上下文与长度外推 实验未涉及长上下文(long-context)场景。需评估: - 解耦 RoPE 在数万乃至数十万 token 下的外推能力; - 共享位置缓存 k_j^(rope) 在长序列下的数值稳定性; - GVA 缓存缩减在高压缩比长文本 serving 中的边际收益是否递增。 ### 5. 与低比特量化和剪枝的正交结合 GVA 减少的是缓存的**结构维度**,而 KIVI 等工作通过**低比特量化**压缩标量位宽。两者可叠加: - 对 GVA 的 value-only 缓存进行非对称 2-bit/4-bit 量化; - 对共享的 k^(rope) 采用更高精度保留,以平衡位置精度与压缩率。 ### 6. 内容键重建的进一步参数化 当前 GVA 使用**线性映射** K = VM 。可探索: - 低秩或深度可分离的映射,以进一步降低参数开销; - 动态/输入自适应的映射(如 per-token 或 per-layer 的条件生成),在不解耦 RoPE 时缓解标准 RoPE 下的吸收失败问题; - 是否可通过更复杂的重建函数(如单层 MLP)在保持缓存优势的同时提升 key 多样性。 ### 7. 训练动态与初始化机制的深入分析 论文观察到尺度匹配初始化主要改善**早期 loss**,对最终下游平均精度的提升在部分变体中并不显著。未来可: - 量化初始 mismatch 对收敛路径的因果影响; - 研究 query RMSNorm 与 M_h 初始化的交互效应; - 探索无需显式尺度匹配的参数化方式(如直接对 q_h 做 Norm)。 ### 8. Shared KV 的失败机理剖析 论文中 K=V 的 Shared KV 变体始终无法恢复 GQA 精度,但并未深入分析其失败是否源于: - 表示空间的维度冲突(同一向量需同时满足评分内积与输出聚合); - 注意力熵的崩溃或梯度传播问题; - 特定任务(如需要细粒度位置感知的 ARC-Challenge)上的结构性缺陷。 Q6: 总结一下论文的主要内容 这篇论文围绕Transformer自回归解码中的KV缓存瓶颈,提出了Grouped Value Attention(GVA)机制,核心内容可概括如下: ### 1. 研究背景与问题 - Transformer解码阶段需缓存历史token的key与value,其内存占用与访问带宽随序列长度 T 线性增长,成为长上下文服务的主要成本。 - 现有方案如GQA(Grouped-Query Attention)通过共享key–value头降低了缓存,但仍需**同时存储key和value**两个流;MLA(Multi-head Latent Attention)进一步压缩为联合隐向量,但引入了额外地投影与更复杂的解码路径。 ### 2. 核心方法:Grouped Value Attention (GVA) GVA的核心思想是**仅缓存分组value,按需线性重建content key**: - 设 H 为query头数, G 为value组数, g(h) 为query头 h 对应的value组。只将分组value V(g(h)) 写入持久缓存。 - 每个query头通过独立的学习线性映射 M_h ∈ R^(d_h × d_n) 重建content key:
Kh = V(g(h)) M_h
- value本身承担注意力输出的聚合功能,映射 M_h 仅从中提取用于注意力评分的特征。 ### 3. 关键技术创新 - **映射吸收(Absorption)**:由于 M_h 在推理时固定,content key无需物化。注意力分数可改写为:
qh k(j,h)^top = (qh M_h^top) v(j,g(h))^top = qh v(j,g(h))^top
其中 qh 每token仅计算一次,后续解码直接以 q_h 与缓存的value做内积,省去content key的存储与读取。 - **解耦RoPE(Decoupled RoPE)**:标准RoPE会破坏上述吸收(因位置旋转依赖于缓存位置 j ,无法折叠进query)。GVA将query/key拆分为: - 不旋转的content slice k(j,h)^(nope) = v_(j,g(h)) M_h ,保持可吸收性; - 共享的旋转positional slice k_j^(rope) = (x_j W_r) R_j^top ,由所有头共享,每token仅需额外缓存 d_r 个标量。 注意力分数为两者之和:
q k_j^top = q^(nope) (k_j^(nope))^top + q^(rope) (k_j^(rope))^top
- **Query–Key尺度匹配初始化**:由于 K 是value经二次投影所得,默认初始化易导致key尺度远小于query,引发注意力崩溃。论文采用:
M(ij) sim N(0, (σ_Q^2) / (σ_V^2 d(textin)))
使key初始RMS与query匹配,稳定早期训练。 ### 4. 缓存规模 - GQA每层每序列缓存: N(GQA) = 2TGd_h - GVA(解耦RoPE)缓存: N(GVA) = TGd_h + Td_r - 两者比值为:
N(GVA)N(GQA) = (1) / (2) + (d_r) / (2Gd_h)
在论文配置下,相对GQA减少约 **45–47%** 的持久缓存标量。 ### 5. 实验与结果 - **设置**:在约 **350M参数** 的decoder-only模型上,使用 **30B FineWeb-Edu token** 从头预训练,对比GQA、MLA及多种GVA变体。每个配置使用3个随机种子,报告5个零样本任务(HellaSwag、WinoGrande、OpenBookQA、ARC-Easy、ARC-Challenge)的平均准确率。 - **训练损失**:经尺度匹配初始化的GVA与GQA、MLA收敛轨迹接近;直接共享KV( K=V )虽缓存减半,但损失始终无法恢复,验证了独立value与key重建的必要性。 - **下游精度**: - GQA:44.36% - MLA:43.88% - **GVA + DRoPE ( d_r=16 )**:**44.35%**(与GQA相差仅0.01个百分点) - **GVA + DRoPE ( d_r=24 )**:44.29% - 结论:GVA在大幅缩减缓存的同时,保持了与GQA相近的模型质量。 ### 6. 局限与未来方向 - 当前仅在350M参数规模验证,更大模型的扩展性待测; - 自定义解码内核的端到端推理吞吐与峰值内存尚未报告; - RoPE宽度 d_r 及content/position维度分配策略未做系统搜索; - 长上下文场景下的外推能力有待评估。 ### 7. 主要贡献 - 提出GVA机制,通过 K=VM 线性重建与映射吸收,将持久缓存从key–value双流缩减为value单流; - 引入解耦RoPE设计,以极小的共享位置切片( d_r=16 或 24 )兼容吸收机制,避免恢复完整key缓存; - 在350M规模上证明:相比GQA,GVA可减少约45–47%的缓存标量,同时保持近乎无损的下游任务精度。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Vishesh Tripathi,Abhay Kumar,Ramsha Khan
Categories:
PDF URL: https://arxiv.org/pdf/2609.13285.pdf
Arxiv URL: https://arxiv.org/abs/2609.13285
Arxiv ID: 2609.13285
CoolPaper URL: https://papers.cool/arxiv/2609.13285
Published: 2026-09-16T01:38:48.268Z
Updated: 2026-09-16T01:38:48.268Z
8. LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows
Abstract:Video diffusion models are stochastic and hard to control: precise content often requires repeated sampling without guaranteed success, and long-horizon scenes drift in appearance, interactions, and temporal coherence. Agentic visual creation provides explicit references, editable 3D scenes, or executable game states for stable control, but does not by itself guarantee high object or character fidelity. Combining the two can enable stable, high-quality generation. To realize this combination, we present LynnReal-Omni, a native multimodal video generation framework built on a 32B shared multimodal diffusion transformer that unifies text-to-video, image-conditioned generation, reference-guided generation, structural control, editing, degraded video restoration, and long-video generation. It accepts heterogeneous visual inputs, including appearance references, editable 3D renders, and game recordings, allowing agents to compose visual conditions within a unified model. We also train a dedicated 27B Flash shared multimodal diffusion transformer for real-time rendering. We build a systematic data pipeline for video cleaning, subject association, multimodal annotation, and aligned control construction, yielding a curated corpus of multi-shot audiovisual segments, and introduce MSAVP, a 100-prompt, 20-metric evaluation design that separates instruction following, generating plausibility, visual quality, temporal behavior, and audio coordination. LynnReal-Omni-Flash further reduces inference cost through model and decoding acceleration, including a lightweight VAE decoder; on one H100, warm generation and decoding of a 22-frame 540p video take 843 ms with LynnReal-Omni and 377 ms with Flash. These results provide a foundation for real-time streaming video generation, making LynnReal-Omni a unified, controllable, and efficient basis for agentic visual creation.
中文摘要
摘要:视频扩散模型是随机且难以控制的:精确内容通常需要反复采样且无保证成功,且长视野场景在外观、交互和时间一致性上存在漂移。代理视觉创作提供明确的参考、可编辑的3D场景或可执行的游戏状态以实现稳定控制,但仅凭此本身并不能保证高对象或角色的准确性。结合两者可以实现稳定且高质量的生成。为实现这一组合,我们介绍了LynnReal-Omni,一个基于32B共享多模态扩散变换器的原生多模态视频生成框架,统一了文本转视频、图像条件生成、参考引导生成、结构控制、编辑、退化视频修复和长视频生成。它接受异构视觉输入,包括外观参考、可编辑的3D渲染和游戏录制,使智能体能够在统一模型中组合视觉条件。我们还训练了专用的27B Flash共享多模扩散变换器以实现实时渲染。我们构建了系统化的数据流水线,用于视频清理、主题关联、多模注释和对齐控制构建,生成了精心策划的多镜头视听片段语料库,并引入了MSAVP,这是一种100个提示、20度量的评估设计,能够分离指令跟随、生成合理性、视觉质量、时间行为和音频协调。LynnReal-Omni-Flash通过模型和解码加速进一步降低推理成本,包括轻量化的VAE解码器;在一台H100上,使用LynnReal-Omni进行22帧540p视频的热生成和解码需843毫秒,使用Flash则为377毫秒。这些结果为实时流媒体视频生成奠定了基础,使LynnReal-Omni成为一个统一、可控且高效的智能视觉创作基础。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决视频扩散模型在可控性、一致性、评估与部署方面的多重局限,核心问题可归纳如下: \*\*1. 视频扩散模型的本质控制难题\*\* - \*\*随机性与不可控性\*\*:现有视频扩散模型生成过程具有高度随机性,精确内容往往需要反复采样且无法保证成功。 - \*\*长时程漂移\*\*:在长序列生成中,场景外观、物体交互及时间连贯性容易出现漂移(appearance, interactions, and temporal coherence drift),导致难以作为稳定可靠的渲染引擎。 \*\*2. Agentic视觉创作的互补缺口\*\* - Agentic视觉创作(如可编辑3D场景、可执行游戏状态、显式参考图像)能提供稳定的几何与运动控制,减少重复采样的需求。 - 然而,这类控制本身\*\*无法保证高保真度的物体或角色外观\*\*。因此,需要将Agentic控制与视频扩散模型结合,以实现既稳定又高保真的生成。 \*\*3. 现有方法的关键短板\*\* - \*\*碎片化流水线\*\*:文本生成视频、图像条件生成、参考引导生成、结构控制、编辑、长视频生成等任务各自独立,Agent必须拼凑多个模型和临时接口,工程成本高且跨任务行为不一致。 - \*\*长视频不一致性\*\*:长视频方法常遭遇外观漂移、身份变化和光度伪影。 - \*\*评估协议不完整\*\*:现有基准(如VBench、VideoPhy)未能同时在单一协议中覆盖多镜头连续性、动作绑定、物理合理性、可控性与音频质量,且指标常在不可比尺度上聚合,掩盖具体维度的失败。 - \*\*解码瓶颈\*\*:少步蒸馏显著降低了去噪Transformer的推理成本,使得VAE解码成为实际主导瓶颈,但解码加速必须与去噪过程联合评估,因其可能影响时间相位或重建质量。 \*\*4. 本文提出的统一解决方向\*\* 为弥合上述 gaps,论文提出 \*\*LynnReal-Omni\*\*:一个基于共享多模态扩散Transformer的原生多模态视频生成框架,目标是在单一模型内统一文本生成视频、图像条件生成、参考引导生成、结构控制、编辑、退化视频修复与长视频生成,并支持异构视觉输入(外观参考、可编辑3D渲染、游戏录像),从而为Agentic视觉工作流提供一个统一、可控且高效的基础。 Q2: 有哪些相关研究? 根据论文第2节,相关研究可归纳为以下四个方向: ### 2.1 原生多模态生成(Native multi-modal generation) - \*\*视频基础模型\*\*:CogVideoX、HunyuanVideo 与 Wan 等将时空潜在压缩与可扩展扩散 Transformer 相结合(Yang et al., 2024; Kong et al., 2024; Wan et al., 2025)。 - \*\*音视频联合生成\*\*:LTX-2 通过跨模态交互将生成扩展至同步音视频(HaCohen et al., 2026)。 - \*\*统一条件生成与编辑\*\*:VACE 通过共享条件接口统一参考条件生成与视频编辑(Jiang et al., 2025)。 - \*\*本文基础\*\*:该工作直接基于 MiniMax-H3(MiniMax, 2026),后者提供联合视频–音频 Transformer、模态特定编解码器以及原生关键帧和参考接口。本文在此基础上进一步整合图像参考、运动控制、编辑与长视频生成,同时保留任务特定的 token 排序、模态标签和时间位置,并联合少步推理对这些接口进行评估。 ### 2.2 分布匹配蒸馏(Distribution matching distillation) - \*\*DMD\*\*:通过匹配教师与学生输出分布训练单步生成器(Yin et al., 2024b)。 - \*\*DMD2\*\*:去除成对回归要求,通过双时间尺度更新、对抗监督与推理匹配多步训练实现改进(Yin et al., 2024a)。 - \*\*TDM\*\*:对齐中间轨迹分布,支持灵活的少步采样(Luo et al., 2025)。 - \*\*Self Forcing\*\*:在自回归学生 rollout 上训练以减少暴露偏差(Huang et al., 2025)。 - \*\*Reward Forcing\*\*:引入奖励分布匹配以改善运动动态(Lu et al., 2026a)。 - \*\*Salt\*\*:结合自一致去噪更新与缓存感知训练以改进低步数视频生成(Ge et al., 2026)。 - \*\*本文工作\*\*:将少步蒸馏同时应用于标准模型与 Flash 变体,重点评估多模态控制保持能力及其在各自部署配置下的端到端效率。论文进一步指出,参数减少、token 压缩、量化、算子融合与解码器替换对不同部分的成本影响各异,需通过独立消融实验加以区分。 ### 2.3 物理与视听评估(Physical and audiovisual evaluation) - \*\*VBench\*\*:分离视频质量的若干维度(Huang et al., 2024)。 - \*\*VideoPhy\*\*:显式测试标题遵循度与物理常识(Bansal et al., 2025)。 - \*\*MSAVP(本文提出)\*\*:与上述协议类似,保持语义、物理、视觉与时间判断的分离,并增加对多镜头动作、绑定、声音语义与事件时序的结构化考量。 - \*\*专家测量工具\*\*:TransNetV2(Soucek and Lokoc, 2024)与 MUSIQ(Ke et al., 2021)分别为剪辑位置与外观质量提供证据,但论文强调这些工具不能替代对交互行为的直接观察。 ### 2.4 Agentic 视觉创作(Agentic visual creation) - \*\*早期 LLM-based Agent\*\*:通过提示与工具调用编排图像生成与编辑(Wu et al., 2023)。 - \*\*多模态骨干模型\*\*:GPT-4o 与 Gemini 1.5 支持对参考图像与长视频上下文进行视觉检查与推理,从而支持更复杂的图像编辑与视频规划工作流(OpenAI, 2024; Reid et al., 2024)。 - \*\*Claude 4\*\*:强化持续编码与工具使用,将 Agentic 创作延伸至可执行游戏与交互应用(Anthropic, 2025)。 - \*\*GPT-6 Astra\*\*:支持结合推理、编码与计算机使用的复杂工作流(OpenAI, 2026)。 - \*\*现有局限\*\*:上述进展并未消除在几何、材质、绑定、动画与渲染方面的详细动画场景生产成本,也未建立实时、端到端的精细建模动画内容创作能力。因此,本文提出一种互补工作流——由 Agent 构建轻量级场景或可玩游戏原型,再由快速视频扩散模型补充详细的视觉外观。 Q3: 论文如何解决这个问题? 针对视频扩散模型可控性不足、长时程一致性差、任务流水线碎片化、评估协议不完整及推理解码瓶颈等问题,LynnReal-Omni 从模型架构、训练策略、推理加速、数据管线与评估基准五个层面提出系统性解决方案,具体如下: ### 1. 统一的原生多模态架构与任务表示 LynnReal-Omni 构建于一个 \*\*32B 参数的共享多模态扩散 Transformer(DiT)\*\*,将文本生成视频(T2V)、图像条件生成(I2V)、参考引导生成、结构控制、视频编辑、退化视频修复与长视频生成统一在单一去噪器内,取代碎片化的任务特定流水线。 - \*\*原生任务表示\*\*:通过显式编码模态身份(modality tags)、模态特定行索引、3D 旋转位置坐标(3D rotary coordinates)以及每行噪声时间(per-row noise time),使外观参考、帧对齐控制、可编辑 3D 渲染、游戏录像与因果历史在共享 Transformer 中保持各自语义角色。 - \*\*异构条件对齐\*\*:参考序列与目标序列共享相同的潜在几何与空间网格,其时间坐标满足恒定正偏移:
τ(target)^i - τ(control)^i = Delta, quad Delta > 0
该偏移确保参考 token 与生成 token 处于不同域,避免条件语义混淆。 ### 2. 多任务训练与少步蒸馏 在共享骨干上联合训练上述任务,并通过少步蒸馏显著降低推理计算量。 - **噪声调度**:采用干净时间(clean-time)约定,设 z 为干净潜在, ε sim N(0,I) ,则
zt = tz + (1-t)ε, quad v^ = z - ε
视频噪声水平由 g sim N(0,1) 经 logistic-normal 重参数化得到:
s_v = (3u) / (1+2u),quad t_v = 1-s_v,quad u = Sigmoid(g)
音频采用对齐但独立的噪声时钟,通过映射 s_b = s_v/(12-11s_v) 与 s_a = 3s_b/(1+2s_b) 实现音视频协同去噪。 - \*多模态速度预测损失**:
L = MSE_V(v_v, z_v - ε_v) + 0.1 · I(valid audio) , MSEA(v_a, z_a - ε_a)
同时采用引导感知拟合(guidance-aware fitting),利用无文本条件分支 v∅ 的 stop-gradient 预测,使条件分支在回归最优处逼近 w v^ - (w-1)v_∅ 。 - \*标准模型**:保留 50 个 Transformer 块,采用基于低秩轨迹分布匹配(TDM)的 4 步(4 NFE)推理。 - **Flash 变体**:为实时渲染设计,将深度降至 **42 块**,并引入**空间 token 压缩**(在空间维度上以 stride 2 下采样,中间块序列长度降至约 Nv/4 + N_t + N_a ),通过残差连接保留全分辨率特征:
H(out) = H + U!(F_(mid)(PH) - PH)
其中 P 为 token 选择算子, U 为最近邻上采样更新。Flash 进一步采用 **W4A8 量化**(INT4 权重 + FP8 激活)、算子融合与 FlashAttention 3,将 22 帧 540p 视频的温启动生成+解码延迟降至 **377 ms**(3 NFE)。 ### 3. 有界历史的长视频生成 为解决长时程外观漂移与交互不一致,采用**分块生成**与**固定预算时间上下文**: - **块级生成**:每次基于前文上下文生成 17 帧新视频。前一块的最后一帧 RGB 作为共享边界帧固定,模型预测 5 个未来潜在帧,联合解码后移除重复边界帧,保证相邻块过渡一致。 - **紧凑时间上下文**:严格限制历史 token 预算不超过 2 帧全分辨率等效量: - 最早 1 帧:全空间分辨率; - 最近 2 帧:空间 stride 2; - 至多 8 帧更早帧:空间 stride 4。 该设计使注意力成本与视频长度无关。存储亦有界:容量达到上限后仅保留初始帧与最新帧,丢弃中间帧。 ### 4. 轻量级解码器蒸馏 少步蒸馏使 DiT 不再是唯一瓶颈,VAE 解码成为延迟 Q4: 论文做了哪些实验? 论文在第 5 节组织了五组实验,分别验证生成质量、解码器保真度、端到端推理效率、长视频连续性以及可控编辑能力。以下是各实验的概要: —- ### 1. MSAVP:复杂视听与物理评估基准 这是论文引入的**核心综合评测**,用于检验模型在多镜头、物理常识与音频协调等方面的真实能力。 - **评测设计**:100 条提示词、6 大能力族(Prompt Fidelity、Event Execution、Visual Quality、Multi-shot Coherence、World Plausibility、Audio Alignment),共 **20 项报告指标**,输出格式统一为 1280×720、24 fps、15 秒。 - **横向对比模型**:在 T2V 与 I2V 两种模式下,对比了 Seedance 2.0、MiniMax-H3-FL2V、LynnReal-Omni、LTX-2.5 与 Cosmos3-Super。 - **关键结果**(整体得分,表 3): - **T2V**:Seedance 2.0 最高(79.39),MiniMax-H3(79.27)次之,LynnReal-Omni 为 77.76。 - **I2V**:MiniMax-H3 最高(80.65),LynnReal-Omni 为 79.20。 - **细项优势**:LynnReal-Omni 在 I2V 的 **Prompt Fidelity** 上领先,并在 **Entity Fidelity**、**World-state Consistency**、**Aesthetic Quality** 与 **Imaging Quality** 上表现突出;作为面向实时交互的模型,其在低延迟设计下仍保持了较高的指令遵循与世界一致性(表 4、图 6)。 —- ### 2. 轻量级 VAE 解码器评估 验证将 36 块教师解码器蒸馏为 **26 块学生解码器**后的重建质量,排除 DiT 差异干扰。 - **空间保真度**(图 7):在 768P 下,轻量解码器(native tiles)保留了场景布局、衣物图案与桌面纹理,但局部细节(如边缘锐度)略有软化;在部分输入上其 PSNR 甚至高于官方解码器,说明像素误差并未显著恶化。 - **时间保真度**(图 8):逐帧对比显示: - 在一段运动视频上,官方与轻量 native-tile 的 temporal-difference MAE 几乎一致(0.006015 vs 0.006012)。 - 在一段粘土风格视频上,官方解码器略优(0.005816 vs 0.005926)。 - 所有配置在序列后段均出现共享的质量波动,表明该现象并非单纯由解码器深度减少导致。 —- ### 3. 推理延迟与组件消融 系统测量单卡 H100 上的**温启动**延迟,从完整流水线中逐项剥离加速模块,明确各组件贡献。 - **累积组件消融**(表 6,540p、22 帧): - Standard(4 NFE)从基线 2345 ms(DiT+dec)逐步降至 **843 ms**;Flash(3 NFE)从 1592 ms 降至 **377 ms**。 - 关键增量优化包括:W8A8 量化、算子融合(operator fusion)、Triton INT8 GEMM、FlashAttention 3、时间调制缓存、GPU RGB 转换、轻量解码器、自适应 tile 与解码器编译。 - 单独验证:关闭 Flash 的 token 压缩后 DiT 时间从 263 ms 增至 453 ms;仅替换解码器(36→26 块)在相同 latent 与 tile 配置下将解码从 469 ms 降至 340 ms。 - **分辨率与时长扩展**(表 7): - 540p/22 帧:Standard 总生成墙钟时间约 0.96 s,Flash 约 0.48 s。 - 768p/15 s(360 帧):Standard 约 122.9 s,Flash 约 40.4 s。 - **打包部署验证**(表 8):在公开 INT8 配置与编译轻量解码器下,FA3 后端 Standard 为 857 ms(生成 957 ms),Flash 为 383 ms(生成 477 ms);FA2 与 cuDNN 路径略慢,作为部署一致性检查。 —- ### 4. 长视频连续性与历史有界生成 - **实验设置**:生成 720 帧新视频(43 个 chunk),每 chunk 4 次评估,使用固定存储历史与观测内存(表 2 中的 “Continuation”)。 - **机制验证**:通过固定长度的共享边界帧(shared boundary frame)与紧凑历史上下文(≤2 帧全分辨率等效 token)维持长程一致性;注意力成本与显存增长不随视频长度线性增加。 —- ### 5. 参考引导的天气与外观编辑 - **固定模型提示消融**(图 9):使用同一张 960×540 的湖泊参考照片,在固定种子、固定 4 步评估与 1344×768 画布下,仅改变文本指令: - 保守去雾(保留阴天光照); - 明确晴天+暖阳光(同时合成被雾气遮挡的远景细节); - 改变船体颜色为黄色+晴天。 - **结论**:模型能响应细粒度的外观状态编辑指令,且在不同时序帧中保持主体构图与编辑后的船体颜色,验证了其作为 **Agentic 视觉创作下游渲染器**的可控性。 —- ### 6. 时序修复(Temporal Repair) - 对一段含噪点、背景网格与渲染伪影的 120 帧蜡烛视频,采用逐帧独立编辑(每帧 4 次评估,共 480 次)。 - 结果显示背景网格与噪点显著减少,火焰时序变化得以保留;同时指出独立帧编辑在时序一致性上仍有局限(图 5)。 Q5: 有什么可以进一步探索的点? 基于论文结论与实验局限,以下几个方向值得进一步探索: ### 1. 评估协议的人工对齐与大规模验证 - **人类评判者与自动化指标的一致性**:当前 MSAVP 依赖 GPT-6 Astra 与专家模型进行自动评分,但尚未验证这些自动评分与人类感知之间的相关程度。需系统测量人类对物理合理性、视听协调性及跨镜头一致性的判断与自动评判者的吻合度。 - **跨模型独立复现**:论文指出需完成独立的跨模型 MSAVP 评分,以排除由单一团队评估可能引入的系统性偏差。 ### 2. 真正的实时交互延迟与动作到显示的时序 - **端到端 action-to-display 延迟**:当前 latency 测量为 warm inference(排除 conditioning、加载与文件编码),且未覆盖 cold-start 或 request-to-display 路径。对于 Agentic 工作流,需记录从用户输入/Agent 动作到视频帧实际显示的完整闭环时序,验证其是否满足实时交互阈值。 - **长交互轨迹的稳定性**:需测试更长程(远超 720 帧)的交互式生成,观察在持续反馈下是否仍能保持语义一致与视觉稳定。 ### 3. 强风格迁移下的时间稳定性与物理接触保持 - **风格迁移的时间一致性**:论文明确将“在强风格迁移条件下提升时间稳定性”(temporal stability under strong style transfer)列为中心挑战。 - **物理接触的精确保持**:World Plausibility 中的 Contact Response 与 Material Behavior 仍有提升空间。需探索如何在快速生成过程中更准确地维持碰撞方向、受力响应及穿透避免,避免因加速导致的物理合理性下降。 ### 4. 音频–视频联合生成的深度协调 - **音频感知的奖励机制**:当前蒸馏过程中视觉奖励(Reward Forcing)仅重加权视频项,音频项使用固定权重。引入音频感知的奖励模型,或设计跨模态联合分布匹配,有望改善动作–声音时序(Action–sound Timing)与跨剪辑音频连续性(Cross-cut Audio Continuity)。 - **细粒度音画同步**:在说话人唇音同步(Speaker–lip Sync)已较高的基础上,进一步探索复杂环境声、非言语发声与视觉事件的精确对齐。 ### 5. 更极端的模型压缩与解码器轻量化 - **解码器进一步压缩**:当前轻量解码器从 36 块压缩至 26 块,并配合自适应 tiling。可探索更深度的蒸馏(如 18 块或更少)或神经编解码器替代方案,测试在更高分辨率(如 1080p)下的重建质量与延迟权衡。 - **量化与精度的联合优化**:W4A8 量化已用于 Flash 变体,但可研究更低比特或混合精度方案对精细纹理与运动细节的影响。 ### 6. Agentic 工作流的闭环验证与工具集成 - **可执行 3D/游戏控制到视频生成的闭环评估**:当前工作流展示了 Agent 生成 3D 场景与游戏录像作为控制输入,但缺乏大规模任务级评估。可建立基准,衡量 Agent 迭代编辑场景后,视频模型在保持外观参考的同时对几何、运动与状态更新的遵循度。 - **多 Agent 协作与反馈**:探索 Agent 在生成视频后进行视觉检查并自动修正控制输入(如调整相机轨迹或材质参数)的循环机制。 ### 7. 时序修复的显式一致性约束 - **跨帧依赖的视频修复**:当前时序修复采用逐帧独立编辑(independent frame editing),导致帧间亮度与形状波动。可引入轻量级时间一致性模块或滑动窗口联合去噪,在不显著增加计算成本的前提下抑制跨帧伪影。 Q6: 总结一下论文的主要内容 本文介绍 **LynnReal-Omni**,一个面向 Agentic 视觉工作流的原生多模态视频生成框架,旨在统一视频扩散生成中的异构控制、稳定长时程生成并降低推理延迟。以下从问题背景、方法架构、数据工程、实验验证与局限展望五个方面进行总结。 —- ### 1. 研究背景与核心问题 视频扩散模型虽已实现高视觉保真度,但仍面临本质可控性不足: - **随机采样**:精确内容需反复生成且无法保证成功; - **长时程漂移**:外观、物体交互与时间连贯性随序列增长而退化; - **任务碎片化**:文本生成视频(T2V)、图像条件生成(I2V)、参考引导、结构控制、编辑与长视频生成各自为政,Agent 需拼凑多套模型; - **评估缺口**:现有基准未在单一协议内覆盖多镜头连续性、动作绑定、物理合理性与音频协调; - **解码瓶颈**:少步蒸馏降低去噪成本后,VAE 解码成为实际推理瓶颈。 Agentic 视觉创作(可编辑 3D 场景、可执行游戏状态、参考图像)能提供显式几何与运动控制,但单独使用无法保证高保真外观。将 Agentic 控制与视频扩散结合,是实现稳定、高质量生成的关键路径。 —- ### 2. 方法架构:LynnReal-Omni #### 2.1 统一的原生多模态主干 基于 **32B 共享多模态扩散 Transformer(DiT)**,在单一模型内统一 T2V、I2V、参考引导生成、结构控制、编辑、退化视频修复与长视频生成。通过原生任务表示显式编码: - 模态身份(modality tags) - 模态特定行索引(row indices) - 3D 旋转位置坐标(3D rotary coordinates) - 每行噪声时间(per-row noise time) 目标潜在与控制潜在保持恒定时域偏移:
τ(target)^i - τ(control)^i = Delta, quad Delta > 0
确保参考与生成 token 处于不同语义域。 #### 2.2 多任务训练与少步蒸馏 采用 clean-time 约定:
zt = tz + (1-t)ε, quad v^* = z - ε
视频噪声水平由 logistic-normal 重参数化得到 s_v = (3u) / (1+2u) ,音频采用对齐但独立的时钟。联合损失为:
L = MSE_V(v_v, z_v - ε_v) + 0.1 · I(valid audio) , MSE_A(v_a, z_a - ε_a)
- **标准模型**:50 块 Transformer,4 步(4 NFE)推理,采用低秩轨迹分布匹配蒸馏。 - **Flash 变体**:27B 参数,42 块 Transformer,3 步(3 NFE)推理。引入空间 token 压缩(空间 stride 2,中间序列长度降至约 Nv/4 + N_t + N_a ),通过残差连接保留全分辨率:
H(out) = H + U!(F_(mid)(PH) - PH)
并配合 **W4A8 量化**(INT4 权重 + FP8 激活)、算子融合与 FlashAttention 3,将单 H100 上 22 帧 540p 视频的温启动生成+解码延迟降至 **377 ms**。 #### 2.3 有界历史的长视频生成 采用分块生成策略:每步基于前文生成 17 帧新视频,前一块末帧作为固定共享边界帧,联合解码后去除重复帧。时间上下文受严格预算约束(≤2 帧全分辨率等效 token): - 最早 1 帧:全分辨率 - 最近 2 帧:stride 2 - 至多 8 帧更早:stride 4 注意力成本与存储开销均与视频长度解耦。 #### 2.4 轻量级 VAE 解码器蒸馏 将 36 块教师解码器蒸馏为 **26 块学生解码器**,保持潜在接口不变。训练目标综合: - 教师重建监督( L_1 + L_2 ) - 多尺度空间/时间正则化(梯度、小波、SSIM、时序差分) - 深层特征对齐与 DINOv2 感知损失 - 循环一致性(通过冻结编码器约束后验分布 q_T, q_S 的 KL 散度) #### 2.5 Agent 生成的 3D 场景与游戏控制 Agent 从参考图像与任务描述构建可执行 3D 场景(几何、材质、变换、光照、相机)或可玩游戏状态(显式状态更新与控制输入),将其渲染为结构化视觉条件输入 LynnReal-Omni,实现外观、运动与交互的显式可控。 —- ### 3. 数据工程 构建了系统化的数据流水线,将公开视频转化为高质量多镜头音视频语料: - **预处理**:TransNetV2 镜头分割、PP-OCR 文本与边框清洗、保守裁剪; - **粗粒度标注**:Qwen3.5-122B-A10B 进行场景分组、主题发现与跨镜头身份关联; - **检索与筛选**:基于动作、运动与故事完整性进行质量把关,去重并平衡领域分布; - **精修与资产**:提取主题/背景参考、Detectron2 姿态跟踪、MOSS-Transcribe-Diarize 语音转录与 Qwen3-Omni-Thinking 环境音分离; - **高质量多镜头数据**:输出带证据的密集视听描述,并通过自动格式与事实校验。 最终约 **0.6%** 的原始存储 footprint 保留为高质量数据,每段不超过 60 秒。 —- ### 4. 实验验证 #### 4.1 MSAVP 基准 引入 **MultiShot-AV-Physics Bench(MSAVP)**:100 提示词、20 指标、6 大能力族(Prompt Fidelity, Event Execution, Visual Quality, Multi-shot Coherence, World Plausibility, Audio Alignment),由 Agentic VLM 执行冻结清单评估。 - **T2V**:Seedance 2.0(79.39)与 MiniMax-H3(79.27)领先,LynnReal-Omni 为 **77.76**; - **I2V**:MiniMax-H3(80.65)领先,LynnReal-Omni 为 **79.20**; - **细项优势**:LynnReal-Omni 在 Entity Fidelity、World-state Consistency、Aesthetic Quality 与 Imaging Quality 上表现突出,验证了实时设计并未以牺牲核心质量为代价。 #### 4.2 轻量 VAE 评估 在 768P 重建中,26 块轻量解码器的 temporal-difference MAE 与官方解码器接近(如 0.006012 vs 0.006015),时间趋势一致,但局部细节略有软化。 #### 4.3 推理延迟 - 540p/22 帧:Standard 端到端约 **959 ms**,Flash 约 **479 ms**; - 768p/15 s(360 帧):Standard 约 122.9 s,Flash 约 40.4 s。 #### 4.4 可控编辑示例 通过固定参考图像与改变文本指令(去雾、晴天光照、改变船体颜色),模型在 4 步评估内实现语义一致的视觉状态编辑,保持构图与主体身份。 —- ### 5. 局限与未来方向 - **人工对齐**:MSAVP 自动评分需验证与人类判断的一致性; - **真实交互延迟**:当前测量为 warm inference,未覆盖端到端 action-to-display 闭环; - **时序一致性**:逐帧独立视频修复缺乏显式跨帧约束,长程风格迁移下的稳定性仍需提升; - **音频协调**:缺乏音频感知的奖励模型,动作–声音时序与跨剪辑音频连续性有改进空间; - **物理精确性**:复杂接触响应与材料行为在加速推理中易退化,需进一步保持。 —- 综上,LynnReal-Omni 通过**统一多模态 DiT**、**异构条件原生编码**、**有界历史长视频生成**、**轻量化解码器蒸馏**与**Agentic 控制集成**,为实时、可控、统一的视觉创作提供了基础框架,并通过 MSAVP 与系统性延迟测量建立了可审计的评估标准。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Xiaofeng Mao,Peijia Lin,Shaohao Rui,Yibo Zhang,Haibin Wan,Weijie Ma
Categories:
PDF URL: https://arxiv.org/pdf/2609.15863.pdf
Arxiv URL: https://arxiv.org/abs/2609.15863
Arxiv ID: 2609.15863
CoolPaper URL: https://papers.cool/arxiv/2609.15863
Published: 2026-09-16T01:38:48.359Z
Updated: 2026-09-16T01:38:48.359Z
9. How Lossless Is Lossless Speculative Decoding? The Role of Numerical Precision in Orthrus
Abstract:Orthrus is a hybrid autoregressive-diffusion architecture that accelerates autoregressive language-model inference by generating multiple tokens in parallel while using a frozen autoregressive backbone. Its central claim is that an intra-model consensus mechanism enables lossless speculative decoding, producing the same output sequence as the autoregressive model. We independently reproduce Orthrus and examine this claim under different numerical precisions. Under BF16 inference, exact trajectory matching occurs in only 45% of cases for the authors’ checkpoint and 43% for our independently trained model across 1,190 prompts from 12 domains. The probability of exact matching is also strongly associated with the response-conditional perplexity of the reference model. Despite this trajectory divergence, Orthrus does not show systematic degradation on downstream lm-eval-harness benchmarks. In contrast, repeating the trajectory evaluation with FP32 yields exact trajectory matching on all evaluated prompts. These results show that the practical losslessness of Orthrus depends on numerical precision and that exact trajectory equivalence should be evaluated separately from downstream task performance.
中文摘要
摘要:Orthrus 是一种混合自回归-扩散架构,通过并行生成多个标记,同时使用冻结的自回归主干,加速自回归语言模型的推理。其核心主张是,模型内部共识机制能够实现无损的推测性解码,生成与自回归模型相同的输出序列。我们独立复现了 Orthrus,并在不同数值精度下检验这一主张。在 BF16 推理下,对于作者提供的检查点,精确轨迹匹配仅出现在 45% 的情况下,而对于我们独立训练的模型,在来自 12 个领域的 1190 个提示中,精确匹配比例为 43%。精确匹配的概率还与参考模型的响应条件困惑度密切相关。尽管存在轨迹偏差,Orthrus 在下游 lm-eval-harness 基准测试中并未表现出系统性退化。相比之下,在 FP32 精度下重复轨迹评估时,所有被评估的提示都实现了精确轨迹匹配。这些结果表明,Orthrus 的实际无损性依赖于数值精度,并且精确轨迹等价性应独立于下游任务性能进行评估。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.15504 (HTTP 429)
Authors: Ilya Koziev,Leonid Sinev,Ivan Oseledets
Categories:
PDF URL: https://arxiv.org/pdf/2609.15504.pdf
Arxiv URL: https://arxiv.org/abs/2609.15504
Arxiv ID: 2609.15504
CoolPaper URL: https://papers.cool/arxiv/2609.15504
Published: 2026-09-16T01:38:49.199Z
Updated: 2026-09-16T01:38:49.199Z
10. Discovery Foundation Models: Toward Open-Ended Discovery Intelligence
Abstract:Foundation models have progressed from learning and reasoning over existing knowledge, to increasingly learning through action, tool use, and outcome feedback. We argue that the next frontier is a further transition: from solving and acting within problems specified by humans to participating in the process by which new problems, representations, explanations, and knowledge are created. We refer to this capability as Discovery Intelligence. We formulate Discovery Foundation Models (DFMs) as general-purpose model systems for open-ended discovery. A DFM operates over a revisable research state and supports seven coupled capabilities spanning problem discovery, formulation, representation construction, hypothesis formation, intervention, evidence-grounded revision, and continual discovery improvement. We instantiate this framework with Zetema, which couples explicit research-state dynamics, verification and experimental gating, external grounding, and cross-task Discovery Skill evolution. We further ground the framework with GALILEO, a real therapeutic-discovery system in which Dry-Lab reasoning, robotic and hands-on Wet-Lab experimentation, external biological evidence, and iterative hypothesis and design revision form a closed physical discovery loop. We then formulate a unified approach to capability formation and process-centered evaluation, enabling discovery behavior to be trained, improved, and measured beyond final-answer performance. Together, these components establish discovery as a learnable, executable, and evaluable capability of foundation-model systems. We view this shift as a broader progression in intelligence scaling: from learning over existing knowledge, to learning from action outcomes, and ultimately to participating in the construction, testing, and revision of the structures through which new knowledge is discovered. Code: this https URL
中文摘要
摘要:基础模型已经从对现有知识的学习和推理,发展到通过动作、工具使用和结果反馈进行日益增强的学习。我们认为,下一个前沿是进一步的转变:从在由人类指定的问题内求解和行动,转向参与新问题、表征、解释和知识产生的过程。我们将这种能力称为发现智能。我们将发现基础模型(DFMs)定义为用于开放式发现的通用模型系统。DFM在可修订的研究状态上运行,并支持七种耦合能力,涵盖问题发现、问题构建、表征构造、假设形成、干预、基于证据的修订以及持续的发现改进。我们用Zetema实例化该框架,该系统耦合了明确的研究状态动态、验证与实验门控、外部支撑以及跨任务的发现技能演变。我们进一步用GALILEO作为基础,该系统是一个真实的治疗性发现系统,其中干实验室推理、机器人和动手湿实验室实验、外部生物证据以及迭代的假设与设计修订形成一个封闭的物理发现循环。然后,我们提出了一种统一的方法来实现能力形成和以过程为中心的评估,使发现行为能够在最终答案性能之外进行训练、改进和测量。综合来看,这些组件将发现确立为基础模型系统可学习、可执行和可评估的能力。我们将这一转变视为智能扩展的更广泛进展:从对现有知识的学习,到从行动结果的学习,最终参与新知识发现的结构的构建、测试和修订。代码:此 https URL
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决的核心问题是:\*\*基础模型如何从“在人类给定的预定义任务结构内求解问题”,迈向“自主参与开放-ended的知识生产过程”\*\*。 具体而言,论文针对以下关键问题展开: ### 1. 当前基础模型的结构性天花板 现有基础模型(包括科学Agent、工具使用系统和推理模型)通常在固定的研究结构下运作。该结构可被抽象为:
Q = (P, R, G, T, V)
其中 P 为问题, R 为表示, G 为目标, T 为工具, V 为评估器。模型只能在预定义的搜索空间内优化,缺乏识别和修正研究结构本身缺陷的能力。例如,当问题设定过宽、表示遗漏关键变量、评估器存在捷径或观测非识别性时,单纯增加优化强度无法产生真正的科学进展。 ### 2. 开放-ended科学发现的独特挑战 真实科学发现中,研究结构往往是不完整或错误的: - 观测到的“异常”可能是测量伪影; - 多个机制在现有观测下可能保持观测等价; - 持续失败可能源于缺失变量而非优化不足; - 评估器本身可能与科学目标不对齐。 因此,系统必须能够自主决定**什么才是真正未知的**、**问题应如何被重新表述**、**何种表示能使竞争机制可被表达**,以及**何种干预能迫使它们产生分歧**。 ### 3. Discovery Intelligence 的形式化 论文提出将“发现智能”定义为一种可学习、可执行、可评估的能力,并形式化地定义为 **Discovery Foundation Models (DFMs)**。DFM 操作于一个可修订的研究状态,需支持七种耦合能力:
C(DFM) = C(find), C(form), C(repr), C(hyp), C(∫), C(rev), C(cont)
分别对应:问题发现、问题形式化、表示构建、假设形成、干预设计、基于证据的修订,以及跨任务持续改进。 ### 4. 发现过程的可操作化 论文将抽象的发现智能转化为具体的 **Discovery Process**,涵盖从“有价值的未知”到“可研究的问题”,再到表示、竞争解释、区分性干预、外部证据和验证知识的完整循环:
Phi(disc) : (W, K_0, B) longrightarrow (Delta K, Xi)
该过程强调:证据可以回退到早期的任何问题、表示或解释,而非固定的流水线;原始观测与解释分离,以便在表示变更后重新分析。 ### 5. 系统实现与物理 grounding 通过 **Zetema** 框架和 **GALILEO** 实证案例,论文解决了如何将上述发现过程实例化为真实系统的问题,特别是: - 如何维护显式、可分支、可回滚的研究状态 S_t ; - 如何通过 Research World Model 和实验门控筛选高后果动作; - 如何将 Dry-Lab 推理与 Wet-Lab 物理实验耦合,形成闭环; - 如何将验证后的跨任务经验转化为可迁移的 Discovery Skills。 ### 6. 能力形成与评估的缺失 论文进一步解决了如何**训练**和**评估**这些发现操作的问题。现有评估多关注最终答案性能,而本文提出以过程为中心的协议,衡量: - 外部验证的当前知识进展 Delta K(val) ; - 未来发现能力的可迁移改进 Delta C_(future) 。 评估需控制记忆、基准泄漏、提示重用和额外计算等混淆因素,确保改进源于发现操作本身的形成,而非领域事实的累积。 ### 总结 该论文试图建立一个新的基础模型范式,使模型系统不仅能在给定规则下求解,更能**参与构建、测试和修订发现新知识的过程本身**。通过形式化定义、系统架构(Zetema)、物理实证(GALILEO)以及训练与评估协议,论文将“发现”从一种隐喻转变为可学习、可验证、可问责的科学对象。 Q2: 有哪些相关研究? 根据论文内容,相关研究可划分为以下八个主要方向。各方向均列出了代表性工作,并说明其与 Discovery Foundation Models (DFMs) 的关系。 —- ### 1. 科学基础模型(Foundation Models for Science) 这类工作将基础模型能力拓展至特定科学领域,提供领域表示与先验知识,但通常不处理研究结构的自主构建与修正。 - **AlphaFold / AlphaFold 3**
2, 21
:高精度蛋白质结构预测。 - **材料发现**
27, 57
:如 GNoME 等深度学习方法用于无机材料设计。 - **天气预报**
22, 30
:基于机器学习的全球中期预报(如 GraphCast)。 - **化学工具增强**
6
:将大型语言模型与化学计算工具结合。 **与 DFM 的关系**:这些系统通常接受给定的问题与数据表示,在固定的搜索空间 Z 内优化候选解 z ∈ Z 。DFM 在此基础上要求系统能够**识别并修正**表示、评估器或问题设定本身的不足。 —- ### 2. 科学推理与验证(Scientific Reasoning & Verification) 聚焦于提升形式化推理、多步验证与工具使用能力。 - **DeepSeek-R1**
16
:通过强化学习激励大型语言模型进行深度推理。 - **逐步验证**
24
(Let’s Verify Step by Step):过程级监督以提高数学与逻辑推理可靠性。 - **ReAct / Toolformer**
33, 54
:将语言模型与工具使用、行动推理相结合。 **与 DFM 的关系**:推理与验证能力是 DFM 的必要基底,但 DFM 进一步要求这些操作作用于**可修订的研究状态**(如问题形式化、表示构建),而非仅在固定任务结构内求解。 —- ### 3. 科学 Agent 与 AI 科学家系统(Scientific Agents & AI Scientists) 这类系统协调工具、文献与实验工作流,实现自动化或半自动化科研。 - **ResearchAgent**
3
:基于文献迭代生成研究思路。 - **多 Agent 自动化科学发现**
14
:多智能体协作执行科研流程。 - **Co-Scientist**
15
:由 Google DeepMind 提出,用于加速科学发现。 - **端到端 AI 研究自动化**
25
:探索 AI 研究全流程的自动化。 - **虚拟实验室**
40
:AI Agent 设计 SARS-CoV-2 纳米抗体。 - **自主化学研究**
4
:将大语言模型与化学实验平台结合。 **与 DFM 的关系**:论文指出,许多 AI 科学家系统虽能执行长工作流,但在**证据整合、反证驱动的修订与长程可靠性**方面仍然脆弱
31
。DFM 与这类系统的关键区别在于:是否将**问题发现、表示构建、干预设计、证据驱动的修订**本身作为模型系统必须掌握且可迁移的核心能力。 —- ### 4. 搜索、评估与实验设计基准(Search, Evaluation & Benchmarks) 提供发现能力的评估环境与任务。 - **MLE-bench**
10
:评估机器学习 Agent 在 ML 工程上的表现。 - **MLAgentBench**
20
:评估语言模型在机器学习实验中的能力。 - **ScienceAgentBench**
11
:面向数据驱动科学发现的严格评估。 - **DiscoveryBench**
26
:支持从数据中自动发现模式。 - **PaperBench**
39
:评估 AI 复现 AI 研究论文的能力。 - **BoxingGym**
12
:自动化实验设计与模型发现的基准测试环境。 **与 DFM 的关系**:这些基准通常预设了任务结构。DFM 的评估协议(第 7 节)在此基础上强调**过程级评估**——即衡量问题发现、表示修订、干预选择等中间决策,以及**跨任务迁移** Delta_(transfer) ,而非仅看最终答案。 —- ### 5. 自主实验室与物理落地(Autonomous Laboratories & Physical Grounding) 将模型提议与物理实验测量闭环连接。 - **自动驾驶实验室**
1, 41
:机器人平台自动执行化学与材料合成。 - **安全自动驾驶实验室**
23
:讨论自驱动实验室的安全治理与人机协作。 - **GALILEO**(本文第 5.7 节):将 Dry-Lab 推理与机器人合成、多模态表型分析及正交湿实验结合,实现真实治疗性肽发现的物理闭环。 **与 DFM 的关系**:物理执行提供强外部证据,但单独的自动化实验不等于发现智能。DFM 要求物理证据能够**反向修订**研究状态(如目标信念、机制假设、干预策略),而不仅是作为最终验证。 —- ### 6. 记忆、反思与持续学习(Memory, Reflection & Continual Learning) 关注跨 episode 的经验积累与行为改进。 - **Reflexion**
35
:语言 Agent 通过言语强化学习从失败中反思。 - **Voyager**
45
:开放-ended 具身 Agent,通过技能库持续学习。 - **Buffer of Thoughts**
52
:提炼并复用跨任务的思维模板。 - **ReasonFlux**
53
:将思维模板组织为层次化推理轨迹。 - **Recuris**
56
:递归经验工作记忆进化,支持长程 Agent 控制。 **与 DFM 的关系**:DFM 将这些思想拓展为 **Discovery Skills**(第 5.3 节)。与简单检索成功轨迹不同,Discovery Skill 要求显式定义触发条件 c_i 、预期效果 e_i 及外部验证要求 v_i ,且必须经过跨任务验证方可写入长期记忆。 —- ### 7. 表示学习与因果发现(Representation Learning & Causal Discovery) 为 DFM 的表示构建与假设形成提供方法论基础。 - **SINDy**
8
:从数据中稀疏识别非线性动力学方程。 - **因果表示学习**
34
:从观测中学习支持因果推断的表示。 - **AI Feynman**
44
:受物理启发的符号回归方法。 - **贝叶斯实验设计**
9
:通过最大化期望信息增益选择实验。 **与 DFM 的关系**:这些工作提供了表示变更与干预设计的算法工具。DFM 将其整合为一个更广泛的发现过程,要求系统**自主决定何时需要改变表示**,并基于外部证据验证新表示的有效性。 —- ### 8. 协同训练、递归改进与开放-ended 学习(Co-Training & Recursive Improvement) 关注多组件联合优化与自我改进。 - **CURE**
48
:通过执行反馈协同训练代码生成器与单元测试生成器。 - **RLAnything**
49
:在完全动态强化学习系统中联合适应环境、策略与奖励模型。 - **GenEnv**
17
:难度对齐的 Agent–环境协同进化。 - **Gödel Agent / Darwin Gödel Machine**
55, 58
:递归自改进 Agent 框架。 - **AI 科学家的风险**
42
:讨论优先保障安全而非自主性的必要性。 **与 DFM 的关系**:DFM 的训练目标 L_(DFM) (第 6.2 节)同样采用多信号组合(模仿学习、偏好优化、过程验证、世界模型学习、RL 与技能学习)。与纯粹递归自改进不同,DFM 强调**验证门控**与**外部证据锚定**:任何对发现基础设施(技能、评估器、工具)的递归更新都必须通过独立任务与审计检验,防止自我确认循环。 —- ### capability 层级对比总结 论文表 1 从六个维度对比了 DFM 与上述范式: | 范式 | 问题来源 | 表示变更 | 干预设计 | 问题修订 | 外部 Grounding | 技能迁移 | |———|—————|—————|—————|—————|————————|—————| | 科学基础模型 | 给定 | 有限 | 非定义性 | 非定义性 | 外部数据 | 非定义性 | | 科学推理模型 | 给定 | 有限 | 有限 | 非定义性 | 任务或验证器 | 非定义性 | | 科学 Agent / AI 科学家 | 常给定 | 可选 | 常可选 | 可选 | 工具与环境 | 通常任务特定 | | 搜索与评估系统 | 给定 | 固定 | 领域依赖 | 非定义性 | 评估器 | 非定义性 | | 自主实验室 | 常给定 | 任务定义 | 必需 | 可选 | 物理实验 | 非定义性 | | **DFM** | **构建** | **必需** | **必需*** | **必需** | **必需** | **必需** | *注:干预设计在允许实验、计算或其他主动证据获取的研究设定中为必需。 综上,DFM 并非替代上述任一方向,而是将其整合为一个更一般的框架:要求模型系统**同时具备**问题构建、表示修订、假设竞争、信息性干预、 Q3: 论文如何解决这个问题? 论文通过**理论形式化、系统架构、物理实证、多信号训练与过程级评估**五个相互支撑的层面,将“发现智能”从概念转化为可操作、可学习、可验证的模型系统能力。具体解决路径如下: —- ### 1. 形式化定义:Discovery Foundation Models (DFMs) 为超越“在预定义任务内优化”的局限,论文首先将发现能力形式化为一个独立的模型系统范畴。 - **核心映射**:将发现过程定义为从部分已知世界到验证知识进展的映射:
Phi(disc) : (W, K_0, B) longrightarrow (Delta K, Xi)
其中 W 为部分理解的世界, K_0 为初始知识, B 为约束, Delta K 为外部验证的知识进展, Xi 为包含状态转移、失败尝试与修订路径的完整证据记录。 - **七种耦合能力**:DFM 的能力被分解为可独立评估、但必须协同运作的七个维度:
C(DFM) = C(find), C(form), C(repr), C(hyp), C(∫), C(rev), C(cont)
分别对应:问题发现、问题形式化、表示构建、假设形成、干预设计、基于证据的修订,以及跨任务持续改进。 - **系统边界**:明确 DFM 是包含策略、状态、记忆、工具、环境、验证机制与人类监督的集成系统:
D = (πθ, S, M, T, E, V, H)
这避免了将发现功劳错误归因于单一模型或人类干预,确保能力与责任的可追溯性。 —- ### 2. 可操作化的发现过程(Discovery Process) 论文将抽象的发现智能落地为对**可修订研究状态**的操作,而非固定流水线。 - **研究对象的形式化**: - 可研究问题 P = (O, Omega, ell, C, Y, Q) ,明确研究对象、范围、尺度、条件、观测与待解关系; - 科学表示 R = (O, V, R, A, L) ,包含对象、变量、关系、抽象与约束; - 竞争解释 H_i = (μ_i, A_i, D_i, Y_i, F_i) ,要求具备机制特异性、假设、有效性范围、预测与可证伪条件。 - **干预选择目标**:干预被选择以最大化对当前解释集的不确定性削减或重构:
x^* = argmax_x E[Delta I(H mid o_x)]
- **证据驱动的修订**:外部观察 o 触发对问题、表示、假设、干预计划与局部不确定性的联合修订:
(P’, R’, H’, X’, U’) = Revise(P, R, H, X, U; o)
关键要求是**失败归因**——区分理论失败、测量错误、实现错误、隐藏混杂、模拟器误设等不同来源,从而决定下一步动作。 —- ### 3. 系统架构:Zetema 为在计算层面实现上述过程,论文提出 Zetema 架构,其核心约束是:**任何科学上重要的操作必须留下可检查的状态转移**。 - **显式研究状态**:
St = (P_t, R_t, H_t, E_t, X_t, B_t, M_t)
该状态记录活跃问题、表示、假设、证据、干预计划、预算与可用记忆,并支持分支、合并、回滚与显式终止。 - **Research World Model 与实验门控**:
W_t : (S_t, a) longrightarrow p(o, Delta S, c, r mid S_t, a)
该模型预测观察、状态变化、成本与风险,用于筛选候选动作。动作通过多重验证门控方可执行:
a ∈ A(eligible) iff Vj(a) ≥ τ quad ∀ j ∈ J
门控标准根据动作风险自适应调整:推测性假设可在不确定性下进入状态,而高成本、不可逆或高风险的物理干预则需更强证据与授权。 - **Discovery Skill Memory**:跨任务改进依赖于可验证的、结构化的 reusable 操作:
m_i = (c_i, o_i, e_i, v_i)
包含触发条件 c_i 、操作 o_i 、预期效果 e_i 与验证要求 v_i 。技能仅在通过**反事实重放、影子模式部署与独立任务测试**后,才被允许影响未来决策。 —- ### 4. 物理闭环实证:GALILEO 论文通过一个真实的治疗性肽发现案例,证明 Dry-Lab/Wet-Lab 耦合不是概念蓝图,而是已被实现的、证据可修订研究状态的物理闭环。 - **闭环机制**:候选肽的 Dry-Lab 设计经机器人合成、质控、液体处理、成像与基于孔板的表型分析后,物理测量结果作为外部证据返回研究状态,修订后续的目标信念、分子设计策略、检测方法与机制假设。 - **双分支验证**: - **LRRC8C 分支**:通过全细胞电生理与患者来源类器官验证选择性电流阻断(IC (50) = 18.922 μ M); - **SLC25A1 分支**:通过线粒体定位与剂量反应实验验证(IC _(50) = 0.736 μ M)。 - **可迁移规则的涌现**:五轮湿实验反馈并非单调搜索,而是经历“弱分支剪枝—已放弃分支重新打开—有效模块整合”的动态过程,最终提炼为 **Amphiphilic Balance Grammar (ABG)**。该规则被验证可迁移至外部肽设计工作流,构成从 episode 经验到 portable discovery operation 的具体实例。 —- ### 5. 能力形成:多信号组合训练 发现能力被重构为对**研究状态转移**的学习问题,而非对最终答案的拟合。 - **组合训练目标**:
L(DFM) = λ(act)L(act) + λ(state)L(state) + λ(pref)L(pref) + λ(ver)L(ver) + λ(wm)L(wm) + λ(RL)L(RL) + λ(skill)L_(skill)
- **各分量功能**: - **状态条件模仿学习**( L(act), L(state) ):从轨迹中学习在特定研究状态下应采取何种研究操作,以及如何显式维护研究状态; - **偏好优化**( L(pref) ):在同一状态下比较两个动作,学习选择更具信息增益、可测试性或鲁棒性的决策; - **过程验证**( L(ver) ):训练多标准验证器,在昂贵交互前过滤结构无效或证据不足的转移; - **世界模型学习**( L(wm) ):预测环境返回的观察、成本与风险; - **科学反馈强化学习**( L(RL) ):使用分解的每步科学奖励:
r^(sci)t = w_K δ(Kt) + w_I IG_t + w_R q^(rev)_t + w_V q^(val)_t - w_C c_t - w_rho rho_t
其中包含外部支持的知识进展 δ(Kt) 、信息增益 IG_t 、修订质量 q^(rev)_t 、验证质量 q^(val)_t ,以及成本 c_t 与风险 rho_t ; - **验证后技能学习**( L(skill) ):通过对比学习,仅将经 hold-out 验证的技能作为正迁移目标,学习何时触发、何时抑制 reusable discovery operations。 - **资源分配的缩放**:训练不仅优化最终答案,还学习如何在问题构建、表示构造、假设搜索、干预设计、证伪与验证之间动态分配预算:
B = B_P + B_R + B_H + B_X + B_F + B_V
—- ### 6. 过程级评估协议 为发现能力提供严格的测量标准,避免将流畅叙事、高置信度解释或固定基准高分误判为发现智能。 - **双轴评估目标**:
P(disc) = (Delta K(val), Delta C(future))
分别衡量当前 episode 的**外部验证知识进展**与未来在未见任务上的**发现行为改进**。 - **阶段级过程评估**:对问题发现、形式化、表示构建、假设竞争、干预选择、证据整合与修订分别设计压力测试。例如: - 隐藏关键变量,检验表示是否能被修正; - 提供非识别性观测,检验系统是否停止无效搜索并修订测量接口; - 在承诺预测后提供反证,检验失败归因与状态转移的适当性。 - **效率与资源匹配**:发现效率定义为
eta(disc) = Delta K(val)C(total)
比较时严格控制计算、工具调用、实验成本、人类时间与风险预算,防止将额外资源误认为能力增益。 - **迁移的受控测量**:
Delta(transfer) Q4: 论文做了哪些实验? 该论文的实验布局不同于传统机器学习研究中的大规模基准对比。其核心实证贡献是一个深度物理落地的案例研究(GALILEO),辅以对系统组件与发现过程的方法论验证。以下是具体内容: —- ### 1. GALILEO:真实 Dry-Lab / Wet-Lab 闭环发现案例 论文以一个治疗性肽发现系统作为 DFM 框架的实证锚点,证明外部物理证据能够真正修订研究状态并产生可迁移的发现规则。 #### 实验环境与闭环设置 - 物理学习平台:将认知发现层与机器人合成、质量控制(QC)、液体处理、高内涵成像及基于孔板的表型分析耦合。 - 闭环逻辑:候选肽从临床先验知识中检索并经局部编辑后,由机器人平台物理执行;测量结果作为外部返回的观测(非模型自生成的预测)进入证据状态,用于修订后续科学决策。 #### 两个独立验证分支 案例包含两条经过正交湿实验验证的发现路径: | 分支 | 验证手段 | 关键结果 | 机制演进 | |———|—————|—————|—————| | LRRC8C (GALILEO-LRC) | 全细胞电生理 + 患者来源类器官 | 选择性抑制 LRRC8A/LRRC8C 电流;类器官 IC (50) = 18.922 μ M | 从泛化的膜毒性假设,经代谢组学、转录组学、扰动与免疫语境实验,转向 LRRC8C 相关的渗透压/氧化应激与先天信号机制 | | SLC25A1 (GALILEO-SLC) | 线粒体定位 + 患者来源类器官剂量反应 | 定位于 SLC25A1 所在的线粒体区室;类器官 IC (50) = 0.736 μ M | 经靶标沉默、乙酸盐拯救、线粒体测量、代谢组学与胞外酸化检测,逐步收敛到柠檬酸外排依赖的代谢崩塌机制 | #### 五轮迭代优化与涌现规则 - 非单调搜索轨迹: - 第 1 轮:保持异质性基线; - 第 2–3 轮:剪除弱支持分支,收缩活跃基序; - 第 4 轮:在修正的孔道结合假设下,重新打开此前放弃的酸性、极性与非极性组织; - 第 5 轮:将恢复的有效基序组织整合为共享活性模块。 - 可迁移规则的提取:上述物理反馈被蒸馏为 Amphiphilic Balance Grammar (ABG),该规则随后被验证可迁移至外部肽设计工作流,改善其输出几何与能量分布。 —- ### 2. 对 DFM 能力映射的方法论验证 论文使用该案例论证了 Zetema / DFM 框架中七种抽象能力在真实物理系统中的可操作性对应: - ** C(find) / C(form) :靶标提名与转化差距分析; - C(repr) / C(hyp) :靶标特异性阻断机制与序列组织的构建; - C(∫) :机器人与手工检测的执行; - C(rev) :基于物理结果更新靶标信念、基序策略、检测选择与机制假设; - C(cont) :将实验支持的基序结构整合为 ABG,体现跨任务发现行为的改进。 —- ### 3. 系统边界的实证说明 案例还用于澄清 DFM 的系统边界与归因原则: - 并非所有实验后果操作都由机器人自主完成:合成、QC、液体处理、成像与孔板表型分析集成在自动化循环内;而电生理、代谢谱分析、患者组织实验与体内验证仍由人类执行。 - 论文强调,这些人类执行的干预被显式记录在系统边界与溯源记录中,防止将发现功劳过度归因于模型本身。 —- ### 4. 未包含的实验类型(论文明确声明) 论文在第 5.7 节末尾明确界定了该案例的证明范围: - 并非证明通用的、跨领域的 DFM 问题已完全解决; - 并非传统意义上的大规模、多基准对比实验; - 并非对 Zetema 所有组件的独立消融实验。 其经验价值在于:证明了一个真实的物理发现循环已经存在,其中外部生成的生物证据不仅用于终端验证,而是改变了后续的科学行动、重开/终止研究分支、修改干预构造策略,并最终被提炼为可复用的发现规则。这为第 6 节(能力形成)和第 7 节(评估协议)中提出的训练与评估框架提供了实证动机与 grounding,但论文本身将大规模的训练实验与基准评估留给未来工作。 Q5: 有什么可以进一步探索的点? 基于论文内容,可进一步探索的研究点可从能力扩展、训练体系、评估方法、环境落地、治理安全五个维度展开。 —- ### 1. 跨领域通用发现能力的验证与扩展 论文明确指出现有实证仅覆盖特定领域: - 跨域转移仍属开放问题:GALILEO 仅验证了治疗性肽发现中的闭环 Dry-Lab/Wet-Lab 流程,更广泛的跨学科(如材料、气候、数学、天体物理)发现转移尚未建立(第 5.7 节)。 - Discovery Skill 的跨任务泛化**: C_(cont) 要求技能在控制领域事实、近重复检索与额外计算后仍表现出行为转移。需要系统性实验来验证:
Delta(transfer) = DiscPerf(D(unseen) mid M(1:k)) - DiscPerf(D(unseen) mid M_0)
在不同领域表面特征变化但结构挑战保留时的实际表现(第 7.4 节)。 —- ### 2. 大规模能力形成训练流程的实现 论文提出的训练框架(第 6 节)在模块层面有显著展开空间: - 参考算法的大规模实例化:Algorithm 1 是概念性参考流程,需在实际计算集群与物理平台上完成端到端实现,尤其是交互式科学强化学习阶段。 - 交互式研究环境建设:需要更多具有隐藏变量、观测等价机制、评估器捷径与表示缺陷的程序化生成环境(第 6.1 节)。难度对齐的 Agent–环境协同演化(如 GenEnv [17])可适配至发现设定,但需将隐藏机制与不确定性来源作为演化目标。 - 多信号损失的动态平衡:组合目标
L(DFM) = λ(act)L(act) + λ(state)L(state) + ·s + λ(skill)L(skill)
中各权重 λ 的在线调整、梯度冲突消解与课程学习策略尚待研究(第 6.3 节)。 - 资源分配策略学习:过程级扩展预算
B = B_P + B_R + B_H + B_X + B_F + B_V
的最优分配本身可作为元学习或双层优化问题加以训练(第 6.4 节)。 —- ### 3. 过程中心评估基准与协议的开发 现有基准多评估最终答案,而 DFM 需要评估中间研究决策: - 结构隐藏型基准:需构建刻意保留或破坏研究结构的测试集——如不完整问题、误导性表示、非识别性观测、隐藏混杂——以检验 C(find), C(repr), C(rev) (第 7.2、7.5 节)。 - 机制与结构 Hold-out:数据划分应基于潜在机制与研究结构,而非自然语言主题相似性,以减少污染与近重复检索(第 7.5 节)。 - 负面结果的信用分配:需设计能奖励“正确识别问题不可行”“拒绝虚假异常”“有效证伪机制”等负面但科学有价值的评估指标。 —- ### 4. 数字与模拟环境中的诊断性能力形成 论文将数字与模拟发现视为重要的能力形成环境,但其自身存在待解难题: - 数字发现中的自我确认陷阱:当模型同时负责代码生成、指标选择、测试构造与结果解释时,数字循环可能失去独立性。需要研究隐藏测试、独立执行、替代评估器的自动化部署机制(第 8.1 节)。 - 模拟器依赖与世界模型批评:模拟环境使潜在机制可知,但系统可能利用实现正则性或继承模拟器本体。需探索跨模拟器族转移与模拟器分歧作为发现触发器的方法(第 8.2 节)。 - 预测准确性与干预质量的分离:两个系统可能拟合相同观测,但只有一者选择能识别潜在机制的实验。需开发衡量干预识别力(intervention identifiability)的专门指标(第 8.2 节)。 —- ### 5. 物理与具身发现中的人机协作架构 物理环境引入了来源、噪声、稀缺性与不可逆性,带来独特的开放问题: - 混合自主架构的最优设计:GALILEO 中机器人执行与人工执行(如电生理、患者组织实验)的混合边界是临时设定的。需要研究如何根据风险、成本、仪器可用性与归因清晰度动态决定操作权限(第 8.3、9.3 节)。 - 物理失败归因的自动化:在存在校准漂移、批次效应、污染与操作偏差的场景中,自动区分
理论失败 quad vs. quad 测量错误 quad vs. quad 隐藏混杂 quad vs. quad 协议偏差
的算法仍不成熟(第 4.3、8.3 节)。 - 可审计来源图的自动化构建:将原始数据、仪器状态、试剂批次、人类编辑与协议偏差以机器可读形式完整链接到研究状态 St ,在计算上与制度上均面临挑战(第 9.2 节)。 —- ### 6. 递归发现系统的安全与受控演进 当发现能力的修订对象扩展到系统自身基础设施时,风险呈非线性增长: - 递归更新的半径效应:对 Discovery Skills、评估器、模拟器、基准生成器或检索策略的修改具有不同的影响半径。需要建立与影响半径成正比的验证门槛(第 8.4、9.4 节)。 - 评估器漂移与自我确认循环:系统可能通过修改评估标准使自身表现”改善”而实际发现能力收窄。需研究评估器的版本冻结、影子模式对比、金丝雀任务(canary tasks)与独立审计通道的自动化机制(第 9.4 节)。 - 不可变审计层的保护:审计记录、回滚机制与权限边界本身必须对常规自我修改具有免疫性,否则系统可削弱用于检验其改进的校验手段(第 9.4 节)。 —- ### 7. 表示构建与干预设计的自动化方法 虽然论文形式化了 C(repr) 与 C_(∫) ,但具体算法实现仍有大量空间: - 自动因果/符号表示发现:将因果表示学习、符号回归(如 SINDy、AI Feynman)与 DFM 的状态修订机制深度整合,使表示变更(添加潜变量、改变尺度、分离机制)成为可搜索的操作空间(第 3.2、4.2 节)。 - 非识别性条件下的信息性干预:当现有观测无法区分竞争假设时,如何自动设计最小成本、 Q6: 总结一下论文的主要内容 这篇论文提出了 Discovery Foundation Models (DFMs)** 这一新型基础模型系统范畴,旨在将人工智能的能力边界从“在预定义任务内求解问题”扩展至“自主参与开放-ended的知识生产过程”。以下是论文主要内容的结构化总结。 —- ### 1. 核心问题与动机 当前基础模型(包括科学Agent、推理模型与工具使用系统)通常在固定的研究结构下运作:
Q = (P, R, G, T, V)
即问题 P 、表示 R 、目标 G 、工具 T 与评估器 V 均由人类给定。模型仅能在该结构内优化,难以识别或修正结构本身的缺陷(如遗漏关键变量、评估器不匹配、观测非识别性)。论文指出,真正的科学发现要求系统能够自主发现问题、构建表示、设计干预、基于证据修订,并将验证后的经验迁移至未来任务。 —- ### 2. Discovery Intelligence 的形式化定义 论文将发现智能定义为一种可学习、可执行、可评估的能力,并提出 Discovery Foundation Model 的正式定义:一种通用模型系统,能够识别有价值的未知、构建研究问题、构建并修订表示、生成可检验的解释、设计干预、从外部证据中学习,并持续提升跨任务的发现能力。 系统被形式化为:
D = (πθ, S, M, T, E, V, H)
其中 πθ 为基础模型策略, S 为研究状态, M 为持久记忆, T 为工具, E 为环境, V 为验证机制, H 为人类监督。 —- ### 3. 七种耦合的发现能力 发现能力被分解为七个必须协同运作的维度:
C(DFM) = C(find), C(form), C(repr), C(hyp), C(∫), C(rev), C(cont)
| 能力 | 功能描述 | |———|—————| | C(find) | 从噪声与已有知识中识别值得投入资源的未知结构 | | C(form) | 将未知转化为边界清晰、可检验的研究问题 | | C(repr) | 构建使竞争机制可被表达的变量、关系与抽象 | | C(hyp) | 形成在机制、假设与干预响应上可区分 competing 解释 | | C(∫) | 选择能以期望方式改变研究状态的实验或计算干预 | | C(rev) | 将外部证据归因于适当的理论、测量或表示对象并修订之 | | C_(cont) | 将验证后的跨任务经验转化为可复用的发现技能 | —- ### 4. Discovery Process:可修订的研究状态操作 发现不是固定流水线,而是对显式研究状态 S_t 的循环修订: - 研究对象的形式化 - 问题: P = (O, Omega, ell, C, Y, Q) - 表示: R = (O, V, R, A, L) - 解释: H_i = (μ_i, A_i, D_i, Y_i, F_i) - 干预与修订 - 干预选择以最大化解释集的不确定性削减:
x^* = argmax_x E
Delta I(H mid o_x)
- 外部观察 o 触发联合修订:
(P’, R’, H’, X’, U’) = Revise(P, R, H, X, U; o)
关键要求是失败归因——区分理论失败、测量误差、协议偏差、隐藏混杂等,以避免过早放弃或特设性保护。 —- ### 5. Zetema 系统架构 Zetema 是 DFM 框架的具体系统实例,其核心约束是:任何科学上重要的操作必须留下可检查的状态转移。 主要组件: - 显式研究状态
S_t = (P_t, R_t, H_t, E_t, X_t, B_t, M_t)
支持分支、合并、回滚与显式终止,而非压缩为单一叙事。 - Research World Model 与实验门控
Wt : (S_t, a) longrightarrow p(o, Delta S, c, r mid S_t, a)
用于预测候选动作的后果;动作通过多重验证门控后方可执行,门控强度依风险自适应调整。 - Discovery Skill Memory 跨任务经验以结构化技能存储:
m_i = (c_i, o_i, e_i, v_i)
包含触发条件、操作、预期效果与验证要求。技能须通过反事实重放、影子模式与独立任务验证后才能影响未来决策。 —- ### 6. 物理闭环实证:GALILEO 论文以真实治疗性肽发现系统 GALILEO 作为 DFM 的物理 grounding: - 闭环设置:Dry-Lab 的候选设计与机制假设,经机器人合成、质量控制、成像与表型分析后,由 Wet-Lab 返回物理测量,这些测量作为外部证据修订后续目标信念、设计策略与机制假设。 - 双分支验证 - LRRC8C 分支:经全细胞电生理与患者来源类器官验证(IC (50) = 18.922 μ M),机制从膜毒性演进至 LRRC8C 相关的渗透压/氧化应激机制。 - SLC25A1 分支:经线粒体定位与剂量反应验证(IC _(50) = 0.736 μ M),机制收敛至柠檬酸外排依赖的代谢崩塌。 - 可迁移规则涌现:五轮迭代反馈经历了“剪枝—重开分支—整合”的非单调过程,最终提炼为 Amphiphilic Balance Grammar (ABG),并验证可迁移至外部肽设计工作流。 —- ### 7. 能力形成:多信号组合训练 发现能力被重构为对研究状态转移的学习,训练目标为:
L(DFM) = λ(act)L(act) + λ(state)L(state) + λ(pref)L(pref) + λ(ver)L(ver) + λ(wm)L(wm) + λ(RL)L(RL) + λ(skill)L(skill)
关键信号: - 状态条件模仿:从轨迹中学习在特定研究状态下采取适当研究操作; - 偏好优化:在同一状态下比较动作的科学质量; - 过程验证:在昂贵交互前过滤无效转移; - 科学反馈强化学习:使用分解奖励
r^(sci)_t = w_K δ(K_t) + w_I IG_t + w_R q^(rev)_t + w_V q^(val)_t - w_C c_t - w_rho rho_t
涵盖外部知识进展、信息增益、修订质量、验证质量、成本与风险; - 验证后技能学习:仅将经 hold-out 验证的技能作为正迁移目标。 —- ### 8. 过程中心评估协议 评估围绕双轴展开:
P(disc) = (Delta K(val), Delta C_(future))
- Delta K_(val) :当前调查的外部验证知识进展(如发现隐藏变量、证伪机制、获得可复现结果); - Delta C_(future) :在匹配资源与检索控制后,未来发现行为的可迁移改进。 评估强调阶段级过程指标(问题发现质量、表示有效性、假设区分度、干预信息增益、修订适当性)与资源匹配效率:
eta(disc) = Delta K(val)C_(total)$$ —- ### 9. 研究场景与治理分析 论文分析了 DFM 在四种场景下的落地要求: | 场景 | 核心特征 | 关键挑战 | |———|—————|—————| | 数字发现 | 快速执行、廉价分支、可复现证据 | 自我确认循环、评估器捷径、代码/指标/测试由同一系统控制 | | 模拟发现 | 潜在机制可知、支持反事实 | 模拟器依赖、模拟器本体继承、预测准确与干预质量分离 | | 物理发现 | 来源、噪声、稀缺性、不可逆性 | 失败归因、协议偏差、人类协作边界、审计溯源 | | 递归发现 | 修订对象扩展至发现基础设施 | 评估器漂移、自我修改削弱校验手段、影响半径与验证门槛匹配 | 最后,论文讨论了认知边界、独立验证、溯源审计、权限范围与递归更新风险,强调发现系统的能力必须与治理架构同步演进。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Ling Yang,Zhenfei Yin,Yingcheng Wu
Categories:
PDF URL: https://arxiv.org/pdf/2609.15973.pdf
Arxiv URL: https://arxiv.org/abs/2609.15973
Arxiv ID: 2609.15973
CoolPaper URL: https://papers.cool/arxiv/2609.15973
Published: 2026-09-16T01:38:50.202Z
Updated: 2026-09-16T01:38:50.202Z
11. BVB: Benchmarking Agentic Video Understanding via Programmatic Reconstruction in Blender
Abstract:Multimodal agents can create complex videos in software such as Blender by coding without relying on diffusion models. Yet video understanding benchmarks still evaluate models mainly through question answering. If an agent truly understands a video, it can reconstruct it programmatically. We introduce BVB, Blender-VideoBench, a benchmark that tests this ability by asking agents to reconstruct real-world videos as animated Blender scenes. To ensure fair comparison, each agent programs the reconstruction through a lightweight harness, Mini-BVB, in an identical sandbox under a shared cost limit. The benchmark renders each reconstruction from its animated camera and evaluates it on two axes: (1) Dual VQA measures how many spatiotemporal facts the reconstruction preserves. (2) Latent Similarity measures how closely the reconstruction matches the source video perceptually. Our overall score, a square-root mean, favors balanced performance. We evaluate 51 configurations from 10 model families and analyze semantic retention, perceptual similarity, reasoning effort, and cost. The best model reaches 88.6 Latent Similarity but retains only 53.7% of the source-correct spatiotemporal answers. Additional reasoning improves visual similarity but does not close this gap in factual accuracy. In a blind study with 15 raters and five configurations, Latent Similarity correlates strongly with human preference. These results show that programmatic reconstruction is a viable test of agentic video understanding, and that semantic retention remains the main challenge.
中文摘要
摘要:多模态代理可以通过编码在Blender等软件中创建复杂视频,而无需依赖扩散模型。然而,视频理解基准测试仍主要通过问答来评估模型。如果代理真正理解视频,它可以通过程序化重建。我们引入BVB,Blender-VideoBench,这是一个通过让代理将现实视频重建为动画Blender场景来测试这一能力的基准测试。为确保公平比较,每个代理通过轻量级线束Mini-BVB在相同的沙盒中编程重建,且成本限制是共享的。基准测试从动画摄像机渲染每个重建,并从两个方面评估:(1)双重VQA衡量重建保留了多少时空事实。(2)潜在相似度衡量重建在感知上与源视频的匹配程度。我们的总体得分采用平方根均值,倾向于性能平衡。我们评估了来自10个模型家族的51个配置,分析语义保持、感知相似度、推理努力和成本。最佳模型的潜在相似度达到88.6,但仅保留了53.7%的源正确时空答案。额外的推理能提升视觉相似度,但无法弥补事实准确性的差距。在一项包含15个评分者和5个配置的盲测研究中,潜在相似度与人类偏好高度相关。这些结果表明,程序化重建是对智能视频理解的有效测试,语义保留仍是主要挑战。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文试图解决\*\*视频理解评估标准不足\*\*的问题。具体而言,现有基准测试主要通过问答(QA)来评估模型,但一个正确的答案并不能证明模型真正理解了视频的时空结构——模型可能仅凭单帧画面或答案先验猜测正确选项,而无需真正跟踪场景布局、相机轨迹或事件顺序。 为应对这一局限,论文提出\*\*程序化重建\*\*作为更严格的视频理解测试:如果多模态智能体真正理解视频,它应当能够从纯二维观察中推断出完整的三维场景,并通过编写代码在 Blender 中重建出与源视频匹配的可编辑动画场景。 为此,论文构建了 \*\*BVB(Blender-VideoBench)\*\*,一个标准化的基准测试,其核心目标包括: - \*\*评估真实的时空理解能力\*\*:要求智能体在仅观察视频帧、无深度图、分割掩码或三维真值的前提下,重建物体的放置、相机轨迹和事件顺序; - \*\*消除外部变量干扰\*\*:通过轻量级的 \*\*Mini-BVB\*\* 工具链,为所有模型提供完全相同的沙盒环境(Docker + Blender)、系统提示词和每场景成本上限,且禁止调用外部资产库; - \*\*从语义与感知两个互补维度量化重建质量\*\*: - \*\*Dual VQA(DV)\*\*:测量重建保留了多少源视频中正确的时空事实(如物体数量、距离、路线规划、出现顺序等); - \*\*Latent Similarity(LS)\*\*:利用冻结的 V-JEPA 2.1 特征,测量重建视频与源视频在布局与运动上的感知相似度; - \*\*Overall\*\*:采用平方根均值
si = √(1) / (|A|)∑(a∈ A)(s_i^a)^2
(其中 A=DV, LS ),以惩罚两个维度上的不均衡表现,鼓励语义保留与视觉保真度的平衡。 论文最终揭示了一个关键问题:当前最先进的智能体虽然能达到较高的感知相似度(最高 LS 为 88.6),但在语义保留方面仍然存在显著差距(最高 DV 仅为 53.7),说明现有模型能够构建“看起来正确”的场景,却丢失了将近一半可验证的时空事实。 Q2: 有哪些相关研究? 该论文在第 5 节梳理了相关研究,主要涵盖两大脉络:**视频理解基准测试**与**程序作为视觉表征**。以下分点阐述。 —- ### 1. 视频理解基准测试(Benchmarking Video Understanding) 现有工作主要沿两个方向展开: #### (1) 基于问答(QA)的被动式评估 绝大多数基准通过问答衡量模型对视频的理解,代表工作包括: - **VSI-Bench**(Yang et al., 2025):探测真实室内视频中的视觉-空间智能; - **EgoSchema**(Mangalam et al., 2023):针对长时程视频语言理解; - **Eagle / MMPerspective**(Bi et al., 2024; Tang et al., 2025c):分别针对自我中心视频与视角理解。 然而,此类任务存在固有局限:正确答案未必反映真正的时空推理——单帧模型即可在多项任务上匹配多帧模型(Lei et al., 2023),模型可能依赖外观先验或静态画面“猜对”答案,而无需追踪场景布局与动态时序。 #### (2) 基于动作执行的交互式评估 近年出现了一批要求智能体“对视频采取行动”的基准: - **VideoGUI**(Lin et al., 2024):评估从教学视频进行 GUI 自动化的能力; - **VideoWebArena**(Jang et al., 2025):评估需要视频证据支持的网页任务; - **ScreenSpotPro / GUIXplore**(Li et al., 2025; Sun et al., 2025):测试跨应用的屏幕定位与探索。 这些基准在**二维屏幕环境**中评分任务完成度,与 BVB 的核心区别在于:BVB 要求智能体将视频内容**重建为可编辑的三维动画场景**,其渲染结果必须在布局与动态上与源视频保持一致。 —- ### 2. 程序作为视觉表征(Programs as Visual Representations) 将代码生成作为视觉推理的中间步骤日益受到关注,因其产出可执行、可迭代的持久化产物。相关研究可分为两类: #### (1) 程序组合感知模块以回答视觉问题 - **ViperGPT**(Surís et al., 2023)与 **VisProg**(Gupta & Kembhavi, 2023):将感知模块组合为生成的 Python 程序,并从执行轨迹中读取答案。 #### (2) 程序重建视觉内容 这一分支直接生成代码以重建或编辑所见内容,与 BVB 更为相关: - **VIGA**(Yin et al., 2026):通过迭代地编写、渲染和修订 Blender 代码实现视觉逆图形学; - **Kubrick**(He et al., 2025):协调多模态智能体协作编写 Blender 脚本以生成合成视频; - **BlenderGym**(Gu et al., 2025):针对基础模型系统的图形编辑基准,涵盖物体放置、光照与几何; - **EZBlender**(Wang et al., 2026):采用 Plan-and-ReAct 智能体分解编辑指令; - **BlenderMCP**(Ahuja, 2025):将 Blender 暴露为大语言模型的工具接口。 此外,近期工作还将程序生成扩展至空间变量推理、物理模拟器代码、矢量动画与俯视房间合成等场景: - **Chen et al., 2026**(VisPhyWorld):利用空间代码进行物理世界视频推理; - **Liang et al., 2026**:基于代码驱动的视频重建以探测物理推理; - **OmniLottie**(Yang et al., 2026b):生成参数化矢量动画; - **Code-as-room**(Yang et al., 2026a):通过智能体代码合成从俯视图生成三维房间。 #### (3) 与 SceneActBench 的关系 - **SceneActBench**(Zhao et al., 2026)同样在共享的 Blender 循环下评估布局、相机、关节、重建与动态,并依赖**隐藏的几何真值**进行任务分解与几何监督。 **BVB 与之的关键差异**在于:BVB 研究的是**未标定真实自我中心视频**的**整体重建**(holistic reconstruction),不提供外部资产,覆盖更广泛的模型家族,且在缺乏对齐隐藏几何的条件下,采用**源条件化**的语义保留(Dual VQA)与感知相似度(Latent Similarity)进行评估。 Q3: 论文如何解决这个问题? 论文通过引入**程序化重建(Programmatic Reconstruction)**这一范式,构建了 **BVB(Blender-VideoBench)**,从任务设计、评估协议与实验控制三个层面系统性地解决了传统视频理解基准难以验证真实时空推理的问题。具体方法如下: —- ### 1. 以可控的 Blender 编程任务替代问答 传统基准依赖问答,模型可通过猜测或单帧先验作弊。BVB 要求多模态智能体**仅依据视频帧**(无深度图、分割掩码或三维真值),通过编写 Python/`bpy` 代码,在受控的 Docker 沙盒中将观察到的室内场景重建为**可执行的动画 Blender 场景(`.blend`)**。为了标准化交互过程,论文设计了轻量级工具链 **Mini-BVB Harness**,仅向智能体暴露两种动作: - `bash`:在沙盒中执行命令(包括调用 Blender 运行 Python 脚本); - `frames`:按时间戳或均匀采样请求视频帧,供智能体观察细节。 智能体自主决定观察多少帧、迭代多少轮次,唯一的全局约束是**每场景成本上限**(默认 \ 3)。重建结果必须为可渲染的
.blend 文件,且要求从基本几何体(立方体、圆柱等)构建场景、以关键帧动画还原相机轨迹,从而确保模型必须真正推断空间布局与时序动态,而非生成静态画面或调用现成资产。 —- ### 2. 设计互补的双轴评估协议 由于单一指标无法同时捕捉“事实正确性”与“感知相似性”,BVB 从两个正交维度评估重建质量,并通过聚合得分鼓励均衡表现: #### (1) Dual VQA(DV):语义保留率 利用 VSI-Bench 的 5,130 道时空问题(涵盖物体计数、距离、尺寸、方向、路线规划、出现顺序等),让固定的 VLM 裁判(gpt-5.4-mini)分别在源视频与重建视频的渲染画面上作答。定义源视频上答对的问题集合为 C_s ,重建视频上答对的问题集合为 C_r$,则保留率为:
DV = (|C_s ∩ C_r|) / (|C_s|)
该指标**以源视频正确回答为条件**,仅测量重建“保留”了多少可验证的时空事实,排除了裁判自身在源视频上的失败。 #### (2) Latent Similarity(LS):感知相似度 使用**冻结的 V-JEPA 2.1 ViT-G 编码器**分别提取源视频与重建视频的潜在特征,计算布局(layout)与运动(motion)两个层面的余弦相似度,取平均得到 LS:
LS = (1) / (2)(layout_sim + motion_sim)
由于编码器未在 BVB 上微调,该指标反映通用的视觉感知对齐,而非针对特定基准模式的过拟合。 #### (3) Overall:平方根均值聚合 为避免算术平均中“一维高分补偿另一维低分”的弊端,论文采用平方根均值作为综合得分:
si = √(1) / (|A|)∑(a∈ A)(s_i^a)^2, quad A = DV, LS
该公式等价于算术平均减去跨轴离散惩罚,对两极分化性能施加更大惩罚,同时保证单一轴为零时总分仍非零。 —- ### 3. 建立完全标准化的比较框架 为确保评估公平且可复现,BVB 对所有被测模型实施统一约束: - **相同沙盒与提示词**:所有智能体运行在无网络访问的 Blender 4.2 Docker 容器中,接收完全一致的系统提示词; - **禁止外部资产**:不允许导入外部模型、图像纹理或几何节点,强制从零构建场景; - **共享成本预算**:每场景设置相同的 API 花费上限,避免无限计算资源带来的不公平优势; - **失败场景零分处理**:若智能体未产出可渲染文件,该场景在 DV 与 LS 上均记零分,防止模型通过跳过困难样本来抬高平均分。 —- ### 4. 大规模模型评估与人类验证 论文在 288 个真实室内视频上评估了 **51 个模型配置**(涵盖 10 个模型家族,包括专有 API 与开源权重模型),并系统分析了语义保留、感知相似度、推理努力程度与成本之间的关系。此外,论文通过一项包含 15 名评分者的**盲测研究**验证了自动指标与人类偏好的一致性:Latent Similarity 与人类排序的 Spearman 相关系数达 rho = 0.83 ,而 Overall 的五配置排序与人类排序完全一致( rho = 1.00 )。 综上,BVB 通过将“理解”操作化为“程序化重建能力”,结合严格的沙盒控制与双轴自动评估,建立了一个既能量化感知保真度、又能检验语义准确性的新型视频理解基准。 Q4: 论文做了哪些实验? 论文的实验围绕 **51 个模型配置的大规模重建评测** 与 **多维度的后续分析** 展开,具体可分为以下几个方面。 —- ### 1. 实验设置与基线模型 #### 数据集与场景 - 采用 **VSI-Bench** 的 288 个测试场景,源自 ARKitScenes、ScanNet 与 ScanNet++ 的真实室内自我中心视频。 - 每个场景附带来自 VSI-Bench 的 **5,130 道时空问题**,涵盖物体计数、绝对/相对距离、尺寸、房间大小、相对方向、路线规划与出现顺序。 #### 被测模型 - 共评估 **10 个模型家族**的 **51 个配置**,包括: - **专有模型**:OpenAI GPT-5.x / GPT-6 Astra、xAI Grok、Anthropic Claude、Google Gemini、Meta Muse Spark; - **开源权重模型**:Zhipu GLM、Alibaba Qwen、Moonshot Kimi、MiniMax、ByteDance Seed。 - 对支持可调推理努力的模型,测试了 `none`、`low`、`medium`、`high`、`xhigh` 等多档设置。 #### 环境约束 - 所有智能体通过统一的 **Mini-BVB Harness** 与 Docker 沙盒(Blender 4.2、Python、FFmpeg,无网络)交互。 - 仅暴露两个动作:`bash`(执行代码)与 `frames`(请求视频帧)。 - **每场景成本上限 $3**,无步数或帧数预算;禁止外部资产导入,几何必须从基本图元构建。 #### 评测协议 - **Dual VQA (DV)**:固定裁判模型 `gpt-5.4-mini` 在 16 帧上回答,以源视频正确子集为条件计算保留率。 - **Latent Similarity (LS)**:使用冻结的 **V-JEPA 2.1 ViT-G** 提取特征,分别计算 Layout 与 Motion 相似度后取平均;从重建中渲染 64 帧 EEVEE 画面与源视频对比。 - **Overall**:按平方根均值公式聚合 DV 与 LS。 —- ### 2. 主实验结果 #### 整体性能分布 - **Overall** 分布范围为 **47.50–70.07**。 - **Dual VQA** 分布范围为 **38.6–53.7**。 - **Latent Similarity** 分布范围为 **57.2–88.6**。 #### leaderboard 排名(代表配置) | 排名 | 模型配置 | Overall | DV | LS | | :—- | :—- | :—- | :—- | :—- | | 1 | GPT-6-Astra-high | **70.07** | 53.7 | **88.6** | | 2 | GPT-5.6-Sol-xhigh | 67.49 | 51.7 | 85.4 | | 3 | Grok-4.6-xhigh | 67.17 | 52.1 | 84.2 | | 4 | Qwen3.8-Max-high | 66.24 | 52.7 | 81.3 | | 5 | Claude-Opus-5-high | 66.21 | 52.6 | 81.4 | | 12 | GLM-5.3-Flash-xhigh(开源最佳) | 63.96 | 50.8 | 78.7 | - GPT-6-Astra-high 在 Overall 与 LS 上显著领先(通过 10,000 次场景级 bootstrap 验证,Overall 领先 2.58 分,95% 置信区间
0.72, 4.45
)。 - 然而,最佳 DV 仅 53.7%,说明即使最强模型也丢失了超过 46% 的可验证时空事实。 #### 成本-性能前沿 - 各配置平均每场景花费从 0.024 到 2.157 不等。 - GPT-5.6-Sol-xhigh 以约 Astra 62% 的成本( 0.778 vs 1.258)达到了后者 96% 的 Overall。 - GLM-5.3-Flash-xhigh 以仅 0.024 的成本达到 91% 的最佳 Overall,是成本效益最高的配置之一。 —- ### 3. 盲测人类排名验证 为验证自动指标与人类判断的对齐程度,论文开展了盲测实验: - 15 名人类评分者对 5 个匿名配置 在 9 个场景/人(共 24 场景池)上进行排名。 - 评分依据包括物体身份、空间布局、相机路径与出现顺序。 结果: - 人类平均排名与 Overall 的模型排序完全一致(Spearman rho = 1.00 )。 - 在场景-模型级别,Latent Similarity 与人类偏好强相关( rho = 0.83 )。 - Dual VQA 与人类偏好相关性弱( rho = 0.11 ),证实 LS 主要捕捉感知偏好,而 DV 承担语义保留的互补角色。 —- ### 4. 深入分析实验 #### (1) 语义-感知差距分析 - 最佳模型的 LS 可达 88.6,但 DV 仅 53.7。 - 在 1,827 道源视频正确问题中,最强模型仍丢失了 846 道题目的正确性。 - 结论:当前智能体善于构建“看起来正确”的场景,但在事实准确性上存在显著缺口。 #### (2) 任务层级与难度分解 通过按 VSI-Bench 任务拆解 DV,发现稳定的任务难度层级: - 保留率最高:物体尺寸(63.0%)、路线规划(58.5%); - 保留率最低:出现顺序(16.1%)、物体计数(29.3%)。 - 涉及整体场景推理的任务(计数、时序跟踪)显著难于单物体属性任务(尺寸)。 #### (3) 推理努力(Reasoning Effort)的影响 对 GPT-5.5、GPT-5.6 Sol / Luna / Terra 等家族进行不同推理档位对比: - Latent Similarity 随推理努力增加而稳定上升(平均 Spearman rho = 0.97 )。 - Dual VQA 对推理努力的响应不单调,甚至偶有下降(平均 rho = 0.57 )。 - Overall 虽总体随努力提升,但中间档位可能出现倒退;更长运行时间并不必然带来更高分数。 #### (4) 跨数据集域偏移 - 所有配置在 ARKitScenes 上的 DV 与 LS 均系统性地高于 ScanNet。 - 表明 BVB 对采集风格、场景构成与问题分布具有敏感度,而非单一数据集因子决定性能。 #### (5) 场景级成对比较 - 在场景级别,Top-2 模型(Astra vs Sol-xhigh)的 DV 胜负并不悬殊(场景级胜率约 0.55),且 DV 差异在统计上不显著;但 LS 差异更为稳定(81.9% 的场景为正)。 - 证明 Overall 的领先主要由感知相似度驱动,语义保留的竞争更为胶着。 —- ### 5. 关键发现总结 - Finding 1:程序化重建是可行的视频理解测试,但 BVB 尚未饱和,能在每个价格带区分模型。 - Finding 2:看起来正确不等于事实正确;最佳模型丢失近半语义内容。 - Finding 3:BVB 揭示了稳定的任务层级(尺寸 > 路线规划 > 方向 > 计数/时序),且不同模型在不同任务上各有优劣。 - Finding 4:DV 与 LS 互补但不可互换;LS 对齐人类偏好,DV 防止视觉相似但语义空洞的重建。 - Finding 5:额外推理努力更可靠地提升感知相似度,而非事实准确性。 - Finding 6:成本与质量非线性增长;存在极具成本效益的配置(如 GLM-5.3-Flash-xhigh)以极低价格达到接近前沿的性能。 Q5: 有什么可以进一步探索的点? 基于论文的实验发现与局限性声明,以下几个方向值得进一步探索: —- ### 1. 拓展环境与数据源 当前 BVB 仅覆盖三类室内自我中心视频。后续工作可将基准扩展至: - 户外场景(街道、自然环境)与非自我中心视角(固定监控、电影镜头、无人机航拍),检验模型在更大空间尺度与不同相机运动模式下的重建能力; - 动态场景(含移动的人、动物或刚体物理交互),超越以静态布局和相机轨迹为主的设定; - 交互式编辑任务:不仅从零重建,还要求模型根据视频内容对已有场景进行语义编辑(如“按照视频中的布局移动桌子”)。 —- ### 2. 引入底层三维几何监督 BVB 因缺乏对齐的三维真值,只能评估渲染后的二维视频。未来可探索: - 在部分子集上获取精确的三维几何标注(如 CAD 对齐或 NeRF/3DGS 重建的真值),直接度量 meshes、相机轨迹、物体位姿的数值误差; - 设计几何感知的评估指标,将 Dual VQA 的事实检查与三维空间一致性约束结合,减少对 VLM 裁判的依赖。 —- ### 3. 缩小“感知相似”与“事实准确”之间的鸿沟 实验显示当前智能体 LS 高而 DV 低,重建常“看起来对但细节错”。针对性改进包括: - 显式符号化库存管理:在重建流程中强制维护一份“场景图”或物体清单,在放置每个物体前与观察帧交叉验证数量、类别与位置,减少遗漏与幻觉; - 自验证与反思机制:让智能体在渲染后执行自检程序(如再次采样关键帧并用独立 VLM 核对关键空间关系),主动修正错误; - 模块化时序推理:将静态场景布局重建与动态相机轨迹/事件顺序解耦,分别优化以降低出现顺序(appearance order)等时序任务的 error rate。 —- ### 4. 评估范式的多样化与去偏 - 降低对 Blender 编程能力的耦合:当前结果部分反映模型的代码生成与 API 熟悉度。可对比研究以自然语言场景图、神经场景表示(如 3D Gaussian Splatting 代码)或交互式 GUI 操作作为输出形式的重建基准,分离“视频理解”与“编程能力”; - 更细粒度的成本-效益分析:论文揭示了极低成本配置(如 GLM-5.3-Flash-xhigh)可达到接近前沿的性能。系统性地研究预算缩放曲线(budget scaling law),分析在不同成本天花板下模型的推理策略与质量饱和点; - 扩展人类研究:将盲测从 5 个配置扩展到更多开源与闭源模型,并引入更细粒度的评分维度(如材质、光照、比例失真)。 —- ### 5. 多智能体协作与外部工具 - 多智能体分工:借鉴 Kubrick 等工作的思路,探索多个专家智能体分别负责相机估计、物体检测、材质设定与动画合成,通过协作提升整体重建的语义保留率; - 受控外部资产的使用:当前禁止外部资产以保证公平,但未来可设立“开放轨道”,允许智能体检索或生成与视频一致的 3D assets(如检索 ShapeNet 模型),检验先验知识库对事实准确性的增益。 —- ### 6. 面向特定困难任务的专项基准 论文发现物体计数与出现顺序的保留率极低(分别为约 29% 与 16%)。可围绕这些瓶颈任务设计专项挑战: - 长时程实例跟踪:要求模型在数百帧视频中始终维持对同一物体的唯一标识,防止重建中合并或重复实例; - 拓扑与路径推理:强化对相对方向、房间连通性与导航路线的显式验证,推动空间推理能力的发展。 Q6: 总结一下论文的主要内容 该论文提出 BVB(Blender-VideoBench),一个通过程序化三维重建来严格评估多模态智能体视频理解能力的新型基准。以下从研究动机、方法设计、评估体系与实验发现四个维度进行总结。 —- ### 1. 研究动机:超越问答式视频理解评估 现有视频理解基准主要依赖问题回答(VQA)评估模型,但正确回答并不能保证模型真正理解了视频的时空结构——模型可能仅凭单帧画面或答案先验猜测成功,而无需追踪场景布局、相机轨迹或事件时序。为此,论文提出一个更严格的测试原则:若智能体真正理解视频,则应当能够从纯二维观察中推断完整的三维场景,并通过编程将其重建为可执行的动画 Blender 场景。这种“程序化重建”要求模型在物体放置、相机运动与事件顺序上与源视频一致,显著提高了伪造理解的难度。 —- ### 2. BVB 基准框架:标准化的重建沙盒 为确保公平比较,论文构建了轻量级的 Mini-BVB Harness,对所有被测模型施加完全相同的约束: - 统一交互接口:仅提供两个动作——bash(在 Docker 沙盒中执行 Python/Blender 代码)与 frames(按时间戳或均匀采样请求视频帧)。 - 无外部资产:禁止导入外部模型、纹理或图像,几何必须由基本图元(立方体、圆柱等)从零构建。 - 成本上限控制:每场景设置共享的 API 花费上限(默认 3),无额外步数或帧数预算;若未能产出可渲染的 .blend 文件,该场景记零分。 - 数据源:基于 VSI-Bench 的 288 个真实室内自我中心视频(来自 ARKitScenes、ScanNet、ScanNet++),覆盖 5,130 道时空问答。 —- ### 3. 双轴评估体系:语义保留与感知相似 BVB 从两个互补维度评估重建质量,避免单一指标的片面性: #### (1) Dual VQA(DV):语义保留率 固定 VLM 裁判(gpt-5.4-mini)在 16 帧上回答 VSI-Bench 的时空问题。设源视频上答对的问题集合为 C_s ,重建视频上答对的问题集合为 C_r ,则保留率定义为:
DV = (|C_s ∩ C_r|) / (|C_s|)
该指标以源视频正确回答为条件,仅衡量重建“保留”了多少可验证的时空事实。 #### (2) Latent Similarity(LS):感知相似度 使用**冻结的 V-JEPA 2.1 ViT-G 编码器**分别提取源视频与重建视频的潜在特征,计算布局(layout)与运动(motion)的余弦相似度并取平均:
LS = (1) / (2)(layout_sim + motion_sim)
该编码器未在 BVB 上微调,反映通用的视觉对齐程度。 #### (3) Overall:平方根均值聚合 为避免算术平均中“一维高分抵消另一维低分”的问题,论文采用平方根均值作为综合排名指标:
si = √(1) / (|A|)∑(a∈ A)(s_i^a)^2, quad A = DV, LS
该公式对跨轴性能不均衡施加惩罚,鼓励模型在语义准确性与视觉保真度上均衡发展。 —- ### 4. 实验结果与核心发现 论文评估了 51 个配置(涵盖 10 个模型家族,包括 GPT-6 Astra、Grok、Claude、Gemini、Qwen、GLM 等),主要发现如下: - 前沿性能与差距:GPT-6-Astra-high 以 70.07 的 Overall 位列第一,LS 达到 88.6,但其 DV 仅为 53.7。这意味着即使最强模型也丢失了超过 46% 的可验证时空事实,表明当前智能体善于构建“看起来正确”但“事实不准确”的场景。 - 任务难度层级:BVB 揭示了稳定的任务难度谱系——物体尺寸(63.0%)与路线规划(58.5%)保留率最高,而出现顺序(16.1%)与物体计数(29.3%)最低。涉及全局场景推理的任务显著难于单物体属性判断。 - 推理努力的影响:提高模型的推理努力(reasoning effort)能更可靠地提升 LS(视觉相似度),但对 DV(语义保留)的改善不单调甚至时有下降。额外计算时间并不必然转化为更高的 Overall。 - 成本效益:成本与质量非线性增长。开源模型 GLM-5.3-Flash-xhigh 以仅 0.024 的每场景成本达到最佳 Overall 的 91%,而 GPT-5.6-Sol-xhigh 以 62% 的成本达到 Astra 96% 的 Overall。 - 人类对齐验证:在 15 名评分者的盲测中,Overall 的模型排序与人类排序完全一致(Spearman rho = 1.00 );在场景-模型级别,LS 与人类视觉偏好强相关( rho = 0.83$),而 DV 主要承担语义核查的互补角色。 —- ### 5. 结论与贡献 该论文的核心贡献在于: - 提出了基于程序化重建的视频理解评估范式,将“理解”操作化为“从零构建可执行三维动画场景”的能力; - 建立了公平、标准化、成本可控的 BVB 基准与 Mini-BVB 工具链; - 设计了语义保留与感知相似双轴互补的评估体系,并经人类研究验证; - 通过大规模实验揭示:当前前沿智能体在视觉重建上已取得显著进展,但时空语义保留仍是主要瓶颈,为未来视频理解研究指明了改进方向。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yolo Y. Tang,Daiki Shimada,Jiayue Meng,Jing Bi,Pinxin Liu,Yicheng Wang,Yunzhong Xiao,Zhangyun Tan,Zeliang Zhang,Chao Huang,Susan Liang,Qianxiang Shen,Luchuan Song,Ali Vosoughi,Mingqian Feng,Melika Filvantorkaman,Chenliang Xu
Categories:
PDF URL: https://arxiv.org/pdf/2609.15478.pdf
Arxiv URL: https://arxiv.org/abs/2609.15478
Arxiv ID: 2609.15478
CoolPaper URL: https://papers.cool/arxiv/2609.15478
Published: 2026-09-16T01:38:51.391Z
Updated: 2026-09-16T01:38:51.391Z
12. AlayaVista: Streaming World Modeling from Panoramic States to Perspective Video
Abstract:Interactive video world models must maintain broad scene context under camera motion while producing high-fidelity observations with low latency. Existing approaches face a representation trade-off: perspective models operate on local views and must preserve off-screen content over long rollouts, whereas broader spatial coverage is typically obtained by synthesizing full-sphere videos or constructing explicit 3D representations. Motivated by the complementary roles of global context and selective local acuity in visual perception, we present AlayaVista, a camera-controllable streaming video world model that decouples panoramic world evolution from perspective observation synthesis. Given a single perspective image, AlayaVista constructs a 360-degree scene prior using a pretrained panorama expansion model and then evolves the scene as a camera-conditioned panoramic latent state. A latent viewport renderer maps this state to the requested perspective video latents, while a perspective refiner restores details, suppresses artifacts, and performs super-resolution. To support efficient streaming, we adapt the panoramic generator to chunk-autoregressive generation and distill both panoramic generation and perspective refinement into few-step processes. To provide the supervision required by this design, we construct MUGEN, a large-scale real-world panoramic video dataset containing 1,318 hours of videos at resolutions of at least 4K, together with rich semantic and geometric annotations.
中文摘要
摘要:交互式视频世界模型必须在摄像机运动下维持广泛的场景上下文,同时生成低延迟的高保真观察结果。现有方法面临表示上的权衡:透视模型操作于局部视图,并且必须在长时间预测中保留屏幕外内容,而更广泛的空间覆盖通常通过合成全景视频或构建显式的三维表示来实现。受视觉感知中全局上下文与选择性局部敏锐度互补作用的启发,我们提出了AlayaVista,一种可控摄像机的流式视频世界模型,它将全景世界演化与透视观察合成解耦。给定单幅透视图像,AlayaVista使用预训练的全景扩展模型构建360度场景先验,然后将场景演化为摄像机条件的全景潜状态。潜视口渲染器将此状态映射到所请求的透视视频潜表示,而透视细化器用于恢复细节、抑制伪影并进行超分辨率处理。为了支持高效流式传输,我们将全景生成器改造为块自回归生成,并将全景生成和透视细化蒸馏为少步骤过程。为了提供该设计所需的监督,我们构建了MUGEN,一个大规模真实世界全景视频数据集,包含1318小时的视频,分辨率至少为4K,并附带丰富的语义和几何标注。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*交互式视频世界模型中“全局场景覆盖、高保真观察合成与计算效率”之间的根本性权衡\*\*。 具体而言,现有方法面临以下两难困境: - \*\*透视模型(Perspective models)\*\*直接生成用户视角帧,与最终输出格式天然匹配;然而每帧仅捕获局部视场,一旦内容离开当前视口,其外观与空间结构必须依赖长程注意力、有界缓存、地标库或显式空间记忆来保存。这导致\*\*世界动态演化、记忆维护与观察合成被紧密耦合\*\*,在长程展开(long rollouts)中难以高效保持屏幕外(off-screen)上下文的一致性。 - \*\*全景/显式3D方法\*\*通过合成全向(full-sphere)视频或构建高斯溅射、点云、网格等三维表示来获得广泛的空间覆盖;但这要求系统\*\*为整个球面或完整场景进行高保真生成与细化\*\*,而交互用户在同一时刻仅观察单一透视视口,造成巨大的计算冗余。同时,这类方法通常引入额外的几何提升、场景构建、记忆维护或渲染阶段,增加了系统复杂度与延迟。 针对上述矛盾,论文提出了一个核心问题: > 视频世界模型能否在\*\*不以显示质量合成每个方向\*\*、也\*\*不预先构建显式三维世界表示\*\*的前提下,仍然保留广泛的视觉上下文,并高效生成高保真的透视观察? 为回答该问题,论文提出了 \*\*AlayaVista\*\*,其关键思路是\*\*解耦全景世界演化与透视观察合成\*\*: - \*\*全局层面\*\*:将世界演化表示为相机条件化的\*\*全景视频潜状态(panoramic latent state)\*\*。该状态在每一时间步保持全向角覆盖,充当以相机为中心的动态场景表示,而非显式的度量三维地图,也不直接解码为最终显示输出。 - \*\*局部层面\*\*:通过学习的\*\*潜空间视口渲染器(latent viewport renderer)\*\*,仅将用户请求的视口从全景潜状态映射为低分辨率透视视频潜变量;随后由\*\*透视细化器(perspective refiner)\*\*在视图选择后进行细节恢复、伪影抑制与超分辨率。 通过这种“全局上下文维护 + 局部视口高保真合成”的非对称架构,AlayaVista 在不牺牲空间覆盖的前提下,将昂贵的计算集中于用户实际观察的透视区域,从而同时实现长程场景一致性、相机可控性、高保真输出与流式推理效率。 Q2: 有哪些相关研究? 根据论文第2节,相关研究可归纳为以下三个方向: --- ### 1. 全景视频数据集(Panoramic Video Datasets) 现有数据集大致分为三类,但均难以同时满足交互式世界模型对规模、时长、分辨率与标注的需求: - \*\*生成导向数据集\*\*:如 WEB360、PanoVid、360-1M、PanFlow 等,提供带字幕的全景片段或跨视图对应关系,用于文本条件视频合成或场景想象,但缺乏分钟级时长、高分辨率或显式相机轨迹。 - \*\*几何导向数据集\*\*:如 PanoGeo、World360、Holo360D 等,提供深度、点轨迹、LiDAR 几何或连续全景轨迹,但主要面向三维重建与几何任务。 - \*\*感知导向数据集\*\*:如 360VOT、360VOTS、PanoVOS、Leader360V 等,面向跟踪、分割与多任务场景理解,而非生成式世界模型。 - \*\*长程全景视频\*\*:Sekai2 提供了长程真实世界视频、相机轨迹、时序标注及包含环路和重访的全景序列。 上述资源很少同时提供\*\*大规模真实世界全景视频、分钟级时长、4K以上分辨率、自然场景动态、连续相机轨迹以及丰富的语义与几何标注\*\*。为此,论文构造了 \*\*MUGEN\*\* 数据集(1,318小时,4K+分辨率,含轨迹、深度、实例掩码及分层语义标注)以填补这一空白。 --- ### 2. 全景视频生成(Panoramic Video Generation) 该方向旨在从扩散先验或透视输入出发,生成360°全景视频,并逐步向可探索的视觉世界演进: - \*\*全景特定扩散方法\*\*:如 SphereDiff、SpheRoPE、VideoPanda、PanoWan 等,针对 ERP(等距圆柱投影)几何特性,引入球面潜在表示、多视图注意力、经纬度感知操作或球面位置编码,以处理畸变、经度周期性与接缝连续性。 - \*\*透视到全景提升\*\*:如 Imagine360(将透视锚点扩展为沉浸式全景视频)、CubeComposer(在立方体面与时间上进行自回归生成以产生原生4K全景视频)、ViewPoint(迁移透视视频先验到全景合成)以及 DynamicScaler(面向可扩展高分辨率全景生成)。 - \*\*可探索的全景世界\*\*:近年工作 increasingly 将全景生成视为世界探索的基质。例如: - \*\*Image as a World\*\*:在全景视频框架内集成单图世界初始化、视点探索与时序延续。 - \*\*PanoWorld-X\*\*:引入球面感知架构用于可探索全景世界。 - \*\*CamPVG\*\*:设计全景相机条件化以实现轨迹控制生成。 - \*\*OmniRoam\*\*:结合快速全景预览、时序扩展与空间细化,实现长程漫游。 - \*\*PanoWorld (Jiang et al.)\*\*:利用深度与点轨迹正则化全景生成。 - \*\*Pantheon360\*\*:将全景扩散与显式3D缓存耦合。 - \*\*PanoWorld (Li et al.)\*\*:引入密集全景射线条件化与几何感知记忆。 \*\*与 AlayaVista 的关键区别\*\*:上述大多数方法仍将\*\*全景 RGB 视频作为最终视觉输出\*\*(或后续用于探索/重建)。AlayaVista 则不同——它将\*\*全景视频潜状态作为内部动态世界状态\*\*,仅将请求的视口映射到透视潜空间,并在视图选择后才进行显示级质量的合成,从而避免为整个球面支付高保真计算成本。 --- ### 3. 透视世界模型(Perspective World Modeling) 该方向直接在透视空间操作,生成的帧即为呈现给用户的观察,可分为紧密耦合与解耦两类范式: #### 3.1 透视空间中的相机可控生成与交互系统 - \*\*相机可控方法\*\*:如 CameraCtrl、MotionCtrl、CamCo、Gen3C 等,通过运动特征、射线嵌入或几何感知条件注入相机轨迹。 - \*\*交互式/流式世界模型\*\*:如 AlayaWorld(分块生成+有界时序上下文与几何对齐空间记忆)、Wonder(将双向视频先验转化为因果流式生成器)、ReWorld(有界 KV 缓存+位姿索引地标库)等。为降低延迟,这些系统常结合\*\*分块自回归生成\*\*与\*\*少步蒸馏\*\*。 - \*\*共性局限\*\*:由于每帧仅覆盖局部视场,这些方法必须通过长程注意力、缓存压缩、检索或显式空间记忆来保存屏幕外内容,导致\*\*世界演化、记忆维护与观察合成被紧密耦合\*\*。 #### 3.2 世界表示与透视观察的解耦 - \*\*显式三维世界构建\*\*:如 HY-World 2.0(将单图扩展为全景并构建可导航的高斯与网格表示)、MoVerse(将全景提升为持久高斯脚手架并从中渲染透视视频)、SpatialCrafter(使用生成式三维代理)等。这类方法提供强几何持久性与重访一致性,但引入了额外的几何提升、场景构建、记忆维护或渲染阶段。 - \*\*生成式渲染\*\*:如 DiffusionRenderer、Generative World Renderer、RenderFlow 等,利用扩散或流模型将结构化几何、G-buffer 或粗糙渲染转换为真实感视频,但需要场景表示或渲染接口作为先决条件。 \*\*与 AlayaVista 的关键区别\*\*:AlayaVista 既不单纯通过局部透视帧演化世界,也不构建显式三维资产。它维护一个\*\*全景视频潜状态\*\*作为内部动态表示,通过学习的\*\*潜空间视口渲染器\*\*将请求的视口投影到透视潜空间,再在视图选择后执行高保真细化,从而在“纯透视生成”与“显式三维重建”之间取得了中间地带的平衡。 Q3: 论文如何解决这个问题? 论文通过 \*\*AlayaVista\*\* 框架解决该问题,其核心策略是将\*\*全局全景世界演化\*\*与\*\*局部透视观察合成\*\*在潜在空间中解耦,并通过渐进式训练与流式推理实现高效部署。具体而言,该方法包含以下四个功能模块与配套训练体系: --- ### 1. 整体推理管线 给定单张透视图像 I_0 、目标相机轨迹 Pi 、逐帧视口参数 kappa 及可选文本条件 c ,系统执行如下操作:
P_0 = O(I_0),
Z^(pan)(1:T) = Gθ(Z_(∈it), Pi, c),
Z^(view,LR)(1:T) = R_psi(Z^(pan)(1:T), kappa),
C(1:T) = Uω(Z^(view,LR)_(1:T)),
Z^(view,HR)(1:T) = Fφ(C_(1:T), c),
V^(HR) = D(Wan)(Z^(view,HR)(1:T)).
其中 O 为预训练全景扩展模型, Gθ 为全景状态生成器, R_psi 为潜在渲染模块, Uω 与 Fφ 分别为确定性上采样器与生成式细化器, D(Wan) 为固定 VAE 解码器。除初始全景编码与最终 RGB 解码外,其余流程均在潜在空间完成。 —- ### 2. 全景初始化(Panorama Initialization) 利用预训练模型(HY-World 2.0)将输入透视图像扩展为完整的 360^circ 等距圆柱投影(ERP)全景 P0 ,并编码为干净的初始化潜在块 Z(∈it) 。该模块固定不动,为后续动态演化提供完整的场景先验。 —- ### 3. ERP-Aware 全景状态生成器 该生成器基于 Wan2.2-TI2V-5B 初始化,在 48 通道潜在空间中演化相机条件化的全景状态轨迹 Z^(pan)_(1:T) ,而非显式三维地图。为适应 ERP 几何与流式需求,论文引入三项关键设计: **球面表示**。采用 SpheRoPE 替代原始宽度轴 RoPE:高频通道使用整数经度谐波以实现跨接缝周期性;低频通道使用连续球面坐标 cosφcosλ 与 cosφsinλ ( λ, φ 为经度与纬度),降低极点处的经度依赖。同时对 VAE 空间卷积与重采样算子施加经度循环填充,保持接缝连续性。 **全景相机条件化**。将 Unified Camera Positional Encoding(UCPE)改造为面向 ERP token 的并行注意力支路。对于维度为 d_h 的注意力头,定义
Gammai = I(d_h/4) otimes T_i,
其中 T_i ∈ R^(4× 4) 为第 i 个 token 的齐次世界到射线变换, otimes 为 Kronecker 积。查询、键、值按下式变换:
q_i = Gamma_i^top q_i, quad k_j = Gamma_j^(-1) k_j, quad v_j = Gamma_j^(-1) v_j.
注意力结果经 Gamma_i 映射回查询射线坐标系,再与原生自注意力残差融合。该路径利用相对射线帧变换 T_iT_j^(-1) 注入相机几何,且采用零初始化输出投影,保护预训练权重。 **分块因果状态演化**。为支持流式生成,模型在潜在块内使用双向注意力,跨块使用因果注意力;原生自注意力与 UCPE 注意力均维护对齐的 KV 缓存。每块对应约 16 帧 RGB(4 个潜在切片),实现连续块自回归展开。 —- ### 4. 几何引导的潜在渲染模块 该模块将全景潜在轨迹映射到请求的透视观察,而无需先解码完整 ERP 视频。其目标由以下参考算子定义:
Z^(view), = E(Wan)!( W_kappa!( D^(pan)(Z^(pan)) ) ),
其中 D^(pan) 为 ERP 感知解码器, W_kappa 为像素空间日晷投影, E(Wan) 为标准透视 VAE 编码器。 在推理时,一个可学习的潜在空间映射近似该 RGB 空间算子。模块结合分解式视频 Transformer 与紧凑局部重采样适配器:透视查询由几何对齐的 ERP 邻域、分数采样偏移及球面位置与畸变特征构成;Transformer 以软几何偏置交叉注意力至 ERP token,再进行透视时空自注意力;局部适配器从邻近 4× 4 ERP 潜在邻域学习几何条件修正。最终输出为:
Z^(view,LR) = Skappa(Z^(pan)) + DeltaZ(global) + DeltaZ_(local),
其中 S_kappa 为几何条件双线性潜在采样,两项残差分别由全局 Transformer 与局部适配器预测。 —- ### 5. 透视视频细化器 该模块将低分辨率透视潜在转换为高分辨率观察,包含两个子组件: \*潜在空间上采样**。确定性上采样器 U_ω 借鉴 LTX-2 的残差与空间 PixelShuffle 结构,并在 Wan 潜在空间中训练。其输出为结构载体 C ,携带布局、运动与粗糙外观,而非最终纹理。具体地:
DeltaZ(raw) = Aω!( μ + s odot Z^(view,LR) ),
C = NN(2×)(Z^(view,LR)) + DeltaZ(raw) oslash s.
此处 μ, s ∈ R^(48) 为 Wan VAE 的固定通道均值与标准差, NN(2×) 为最近邻上采样,将网格从 18× 32 提升至 36× 64 (对应 512× 288 to 1024× 576 )。 **载体条件因果细化**。细化器同样基于 Wan2.2-TI2V-5B 初始化,以四潜在切片为一块处理。对第 n 块,首先对载体重噪:
X(n,σ0) = (1-σ_0)C_n + σ_0ε_n,
并将清洁载体作为对齐参考(零扩散时间步)附加在噪声 token 之后。对于 n>1 ,将前一块细化结果作为清洁前缀前置:
[ Z(n-1),; X_(n,σ),; C_n ].
块内双向注意力,跨块因果注意力。经蒸馏后,每块仅需 **4 步**去噪即可输出 Z_n ,并复用为下一块前缀,实现长视频流式生成。 —- ### 6. 渐进式训练流程 为避免端到端联合优化的不稳定性,论文采用分阶段训练策略,各阶段冻结上游组件: **阶段一:全景生成器训练** - **双向适应**:以非因果时序注意力在 10 秒片段上训练,再扩展至 20 秒片段,保留一个双向长窗评分模型。 - **分块自回归训练**:转换为块因果注意力,每块 4 个潜在切片。训练历史从教师强制(teacher-forced)逐步过渡到含潜在损坏与自采样展开的部署式上下文,使模型适应不完美的历史信息。 - **少步蒸馏**:先通过一致性蒸馏从 50 步教师初始化 4 步学生;再应用 Self-Forcing++ 与分布匹配(DMD),利用冻结的 20 秒双向评分模型与可训练假评分模型,在自采样轨迹上优化。DMD 目标为:
g = hatZ(fake) - Z(real)mean( |Z(stu) - Z(real)| ) + varepsilon,
L(DMD) = (1) / (2) | Z(stu) - sg!( Z_(stu) - g ) |_F^2.
稀疏谱锚(sparse spectral anchor)复用早期缓存特征约束低频布局与颜色, Q4: 论文做了哪些实验? 论文在第5节中围绕**相机可控的透视视频合成**,从定量指标与定性可视化两个层面展开了系统实验,评估 AlayaVista 的透视视频质量、相机可控性、时序一致性及全景—透视对应关系。 —- ### 1. 定量评估(Quantitative Evaluation) #### 评估协议 - 从 **MUGEN-HQ** 中选取 **200 个**评估案例。 - 将原始 ERP 全景序列投影为透视参考视频,并以其**第一帧**作为输入图像。 - 目标相机轨迹由**源相机姿态**与对应**视口方向**组合得到。 - 所有方法接收相同的输入图像与目标轨迹;不将未来参考帧或完整全景作为视觉条件。 - 生成视频与参考视频在匹配时间戳上对比,每段 **81 帧**,统一分辨率为 1024 × 576 。 #### 对比基线 - **MoVerse**
69
:评估其最终合成的透视视频(而非中间高斯渲染结果)。 - **HY-World 2.0**
41
:沿目标相机轨迹渲染其最终 3D Gaussian Splatting 场景得到透视视频,不评估中间建图输出。 - **AlayaVista**:评估经潜在渲染、空间上采样与透视细化后的最终 RGB 视频。 #### 评估指标 | 维度 | 指标 | |———|———| | **重建质量** | FVD
42
、SSIM
47
、LPIPS
65
、PSNR | | **感知与时序质量** | VBench++
21
:Consistency、Quality、Dynamic | | **相机控制精度** | 使用 ViPE
19
估计输出视频相机轨迹,计算平移误差(TransErr)与旋转误差(RotErr) | #### 主要结果 - AlayaVista 在 **SSIM**(0.4616)、**LPIPS**(0.5321)、**PSNR**(14.108)上均优于两个基线,表明与参考视频的像素/感知相似度更高。 - **Consistency** 得分最高(0.9240),**Quality** 略有提升(0.5579),显示更好的时序一致性与感知质量。 - **相机控制**:**RotErr** 最低(2.132),表明对目标相机朝向的跟踪更精确;TransErr(0.03312)优于 HY-World 2.0,但略高于 MoVerse(后者借助显式 3D 高斯支架获得更强几何引导)。 - **Dynamic** 得分相对较低(0.9200),论文指出这可能源于潜在渲染与视频细化过程中对局部运动的衰减,暗示时序一致性与运动活性之间存在权衡。 —- ### 2. 定性评估(Qualitative Evaluation) #### (a) 相机控制的透视视频生成 - 如图 6 所示,论文展示了多组**输入图像**、**目标相机轨迹**(含 WASD 与方向键示意)以及 **0 s 至 30 s** 的生成帧序列。 - 通过观察画面取景变化、相对物体位置移动以及新揭示区域的一致性,验证了生成结果对请求相机运动的响应能力。 - 该可视化将相机条件与最终用户可见观察直接关联,补充了定量 TransErr/RotErr 的数值评估。 #### (b) 全景—透视对应关系 - 如图 7 所示,论文在匹配时间戳上并排展示了**全景状态解码帧**与**细化后的透视输出**,并在 ERP 帧上标记了**查询视口区域**(虚线框)。 - 说明透视输出并非直接裁剪自全景 RGB,而是经由**潜在渲染、空间上采样与生成式细化**得到。 - 该对应可视化允许同时检查: - 全景状态中的场景布局与视角覆盖; - 透视合成过程中恢复的高频外观细节; - 长程展开中全景状态与局部观察的时空一致性。 —- 综上,实验从**数值指标**(重建精度、感知质量、相机轨迹误差)与**视觉对比**(相机响应、全景—透视映射)两方面,验证了将全景潜在状态作为内部动态表示、并在视口选择后进行局部高保真合成的有效性。 Q5: 有什么可以进一步探索的点? 基于论文结论与系统设计的内在张力,以下几方面值得进一步探索: —- ### 1. 持久空间记忆与大幅度相机平移 当前的全景状态是**以相机为中心的潜在表示**,虽能维持全向角覆盖,但在**大幅度相机平移(large camera translations)** 时并不具备显式的度量三维记忆。这导致场景内容在远离原始位置后难以保持严格的距离与布局一致性。未来可探索: - 将全景潜在状态与**世界坐标系下的显式或隐式空间记忆**(如神经场景表示、分层哈希网格或稀疏高斯锚点)相结合; - 在相机大幅移动时引入**回环闭合(loop closure)**或**重访一致性(revisit consistency)**机制,避免漂移累积。 —- ### 2. 更紧密的端到端联合训练 AlayaVista 采用**分阶段冻结训练**(全景生成器 → 渲染模块 → 上采样器 → 细化器),以避免优化不稳定性。然而,这种解耦也可能导致各模块间的目标不匹配或误差级联。未来方向包括: - 设计**可微分的端到端训练策略**,在保持模块功能分工的同时允许梯度跨组件传播; - 引入**轻量级联合微调阶段**,在主要模块预训练后仅解冻少量接口层进行对齐,平衡训练稳定性与全局最优性。 —- ### 3. 更强的几何感知目标与显式几何约束 现有框架主要依赖学习的潜在渲染器与生成式细化器恢复细节,缺乏对**深度、法向、点轨迹**等几何信号的显式约束。这在高度动态或复杂遮挡场景中可能导致几何不一致。可进一步研究: - 在全景状态演化与透视细化中引入**基于深度或点轨迹的辅助损失**; - 将几何标注(如 MUGEN 提供的深度与实例掩码)直接纳入扩散/流匹配目标,而非仅作为训练数据侧信息。 —- ### 4. 动态场景中的运动活性与一致性权衡 实验表明,AlayaVista 的 **Dynamic 得分相对较低**(0.9200),暗示潜在渲染与细化过程在提升时序一致性的同时可能**衰减了局部运动幅度**。未来可探索: - 在细化阶段设计**运动保留的生成先验**,或在上采样器中引入显式的光流/运动特征条件; - 针对高频动态区域(如移动物体)进行**自适应计算分配**,在不牺牲全景状态稳定性的前提下增强局部运动保真度。 —- ### 5. 全景初始化的误差传播控制 系统的场景先验来自预训练的全景扩展模型(HY-World 2.0),其**合成内容中的伪影或几何错误会在后续生成阶段被继承并放大**。值得研究: - 开发**自校正的全景初始化机制**,在扩展未观测区域时提供不确定性估计; - 在全景状态生成器中引入**与初始化的解耦或修正模块**,允许模型在时序演化中逐步修正初始先验的缺陷。 —- ### 6. 开放式交互世界建模的扩展 当前系统主要面向**相机轨迹控制**的视频合成。若要支持更通用的交互式世界模型(如物体操作、物理干预、多智能体交互),需要: - 将全景状态从**被动环境表示**扩展为**支持外部动作输入**的动态世界接口; - 结合物理仿真或基于视频的下一状态预测,使全景潜在空间具备**因果推理与物理一致性**,从而支持开放式、长程的交互式探索。 —- ### 7. 数据集与标注的进一步丰富 MUGEN 提供了大规模真实世界全景视频及几何标注,但**交互式世界建模**还需要更丰富的监督信号: - 引入**细粒度的物体交互标注、物理属性标签及长程因果事件链**; - 构建包含**主动相机运动与被动环境动态解耦**的更复杂场景,以训练更鲁棒的条件生成模型。 Q6: 总结一下论文的主要内容 该论文提出了 **AlayaVista**,一种面向交互式应用的相机可控流式视频世界模型,通过解耦全局全景场景演化与局部透视观察合成,解决了现有方法在**空间覆盖范围、输出视觉质量与计算效率**之间的根本矛盾。 —- ### 1. 研究动机与问题 现有交互式视频世界模型主要基于两种范式,但均存在显著局限: - **透视模型**:逐帧生成本地视场图像,与最终用户观察直接对应,但每帧仅覆盖局部视野。屏幕外内容必须依赖长程注意力、有界缓存或显式空间记忆来维持,导致世界演化、记忆维护与观察合成三者紧密耦合,长程展开时难以保持一致性。 - **全景/显式三维方法**:通过生成全向视频或构建高斯溅射、点云等三维表示来获得广阔空间覆盖,但这要求系统为**整个球面**或**完整场景**进行高保真计算,而用户同一时刻仅观察单一视口,造成严重的计算冗余;同时引入了额外的几何提升、场景构建与渲染阶段。 论文提出一个核心问题:能否在不以显示质量合成每个方向、也不预先构建显式三维世界表示的前提下,仍保留广泛的视觉上下文,并高效生成高保真透视观察? —- ### 2. 方法框架:AlayaVista AlayaVista 的核心思想是**非对称的全局-局部分解**:在潜在空间中维护一个全向的动态世界状态,仅将用户请求的视口投影为透视观察后再进行高保真细化。整体推理管线为:
P_0 = O(I_0),
Z^(pan)(1:T) = Gθ(Z_(∈it), Pi, c),
Z^(view,LR)(1:T) = R_psi(Z^(pan)(1:T), kappa),
C(1:T) = Uω(Z^(view,LR)_(1:T)),
Z^(view,HR)(1:T) = Fφ(C_(1:T), c),
V^(HR) = D(Wan)(Z^(view,HR)(1:T)).
系统包含四个功能模块: **全景初始化**。利用预训练模型将单张透视图像 I0 扩展为完整的 360^circ 等距圆柱投影(ERP)全景 P_0 ,并编码为干净的初始化潜在块 Z(∈it) 。 **ERP-Aware 全景状态生成器**。基于 Wan2.2-TI2V-5B 初始化,在 48 通道潜在空间中演化相机条件化的全景状态轨迹 Z^(pan)(1:T) 。关键设计包括: - **球面表示**:采用 SpheRoPE 替换宽度轴 RoPE,高频通道使用整数经度谐波保证 ERP 接缝周期性,低频通道使用连续球面坐标 cosφcosλ 与 cosφsinλ 降低极点畸变;对 VAE 卷积施加经度循环填充。 - **全景相机条件化**:将 UCPE 改造为并行注意力支路,利用相对射线帧变换注入相机几何。 - **分块因果状态演化**:块内双向注意力,跨块因果注意力,配合对齐的 KV 缓存,支持流式块自回归生成。 **潜在渲染模块**。将全景潜在状态映射为请求的透视观察,避免完整 ERP 解码。其目标由参考算子定义:
Z^(view),* = E(Wan)!( Wkappa!( D^(pan)(Z^(pan)) ) ),
实际部署时,通过因子化视频 Transformer 与局部重采样适配器学习潜在空间映射,输出为几何引导的双线性采样与全局/局部残差之和:
Z^(view,LR) = S_kappa(Z^(pan)) + DeltaZ(global) + DeltaZ(local).
**透视视频细化器**。将低分辨率透视潜在转换为高分辨率输出,包含: - **确定性潜在空间上采样器** Uω :通过 PixelShuffle 与残差网络将空间分辨率翻倍,输出结构载体 C 。 - **载体条件因果细化网络** F_φ :以 C 为条件,对重噪后的潜在进行分块因果细化。经蒸馏后每块仅需 **4 步**去噪即可输出,并复用为下一块前缀,实现长视频流式生成。 —- ### 3. 渐进式训练策略 为避免端到端联合优化的不稳定性,训练分为三个阶段,上游模块冻结后训练下游: - **阶段一:全景生成器训练**。先进行双向非因果适应学习长窗动态,再转换为分块因果注意力进行自回归训练(历史从教师强制逐步过渡到自采样展开),最后通过一致性蒸馏与 Self-Forcing++ 蒸馏为 4 步学生模型。 - **阶段二:渲染模块训练**。使用冻结参考算子生成的全景-透视潜在对进行监督,学习几何引导的潜在映射。 - **阶段三:透视细化器训练**。先训练确定性上采样器(以 VAE 解码-双三次 resize-编码结果为目标),冻结后再训练并蒸馏多步质量模型为 4 步因果细化器。 —- ### 4. 训练数据:MUGEN 为支撑该框架,论文构建了 **MUGEN**,一个大规模真实世界全景视频数据集: - 包含 **1,318 小时** 标准化一分钟片段,分辨率不低于 **4K**,帧率不低于 30 FPS。 - 提供分层语义标注(视频级属性、片段级动态描述、相机路径标签)与几何标注(逐帧相机轨迹、深度图、实例掩码)。 - 通过质量过滤与分层抽样进一步得到 **MUGEN-HQ**(300 小时)用于模型开发与评估。 - 训练时结合 MUGEN 与 Sekai2 的全景子集,两者采用统一的 ERP 标注管线。 —- ### 5. 实验结果 在 **200 个 MUGEN-HQ 评估案例**上,与 **MoVerse** 和 **HY-World 2.0** 进行定量比较(统一以第一帧为输入,沿目标相机轨迹生成长度 81 帧、分辨率 1024 × 576 的透视视频): - **重建质量**:AlayaVista 在 **SSIM**(0.4616)、**LPIPS**(0.5321)、**PSNR**(14.108)上均优于基线,表明与参考视频的一致性更高。 - **感知与时序质量**:**Consistency** 得分最高(0.9240),**Quality** 略有提升(0.5579),时序稳定性显著。 - **相机控制精度**:**RotErr** 最低(2.132),平移误差(0.03312)优于 HY-World 2.0,验证了精确的相机轨迹跟随能力;Dynamic 得分(0.9200)略低,反映了运动活性与时序一致性之间的权衡。 定性实验展示了: - 相机控制下的透视视频生成(输入图像、轨迹控制与多时间戳输出帧); - 全景状态与透视观察的对应关系(ERP 状态上标记查询视口,显示透视输出并非简单裁剪,而是经潜在渲染与生成式细化的结果)。 —- ### 6. 主要贡献 - **AlayaVista**:首个将全景视频潜在状态作为内部动态世界表示、并解耦局部透视高保真合成的相机可控流式视频世界模型,在不以显示质量合成全向球面的前提下保持全向场景上下文。 - **MUGEN 数据集**:提供 1,318 小时 4K+ 真实世界全景视频及丰富的语义与几何标注,填补了世界模型训练数据在规模、时长、分辨率与可控性上的空白。 - **渐进式训练与加速流程**:结合长窗动态学习、分块自回归展开、独立潜在渲染与少步蒸馏,实现了端到端的高效流式推理。 —- ### 7. 局限与未来方向 - 相机中心的**全景潜在状态不保证持久度量空间记忆**,在大幅相机平移或严格动态场景几何一致性方面仍有提升空间。 - **分阶段冻结训练**虽保证稳定性,但可能引入模块间误差传播,未来可探索更紧密的端到端联合训练。 - 潜在渲染与细化过程对**局部运动活性**有一定衰减,需进一步平衡时序一致性与动态幅度。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Jiaming Tan,Mingliang Zhai,Zhen Li,Yuwei Wu,Chuanhao Li,Kaipeng Zhang
Categories:
PDF URL: https://arxiv.org/pdf/2609.14462.pdf
Arxiv URL: https://arxiv.org/abs/2609.14462
Arxiv ID: 2609.14462
CoolPaper URL: https://papers.cool/arxiv/2609.14462
Published: 2026-09-16T01:38:52.987Z
Updated: 2026-09-16T01:38:52.987Z
13. Omni-Streaming Thinking
Abstract:Streaming omni-modal models must decide what and when to answer from the video chunks and synchronized audio observed so far. Visual cues often support an interpretation before an utterance or sound event is complete. If that interpretation enters memory as a fact, later reasoning can keep relaying it even after audio contradicts it. We call this failure premature cross-modal commitment. We propose Omni-Streaming Thinking (OST), which generates structured outputs that include evidence observed so far, forecasts of future evidence, and claims based on this evidence. Each claim is initially marked as pending and linked to a future verification interval. Audio and visual evidence are stored separately, and OST checks a claim against the evidence from the specified modality at the end of the verification interval. When contradictory evidence is detected, a refutation process reduces the influence of the claim and its dependent states, and then guides a state update using the new evidence. An answer gate decides whether the answer-critical claims meet the conditions for giving a response. Using a frozen Qwen3-Omni-30B-A3B-Instruct backbone with lightweight adaptation, OST outperforms the strongest open baselines on five streaming and audio-visual benchmarks by more than 10% relative on average. We also introduce OST-DiagBench, which holds video fixed and edits audio to test agreement, absence, contradiction, coexistence, and subtitle-speech conflict. OST reaches d-prime = 2.95, compared with at most 1.38 for open baselines, while reducing vision-induced auditory hallucinations.
中文摘要
摘要:流式全模态模型必须决定从目前观察到的视频片段和同步音频中,何时以及回答什么。视觉线索通常可以在语音或声音事件完成之前支持一种解读。如果这种解读作为事实进入记忆,后续推理即使在音频与之矛盾时也可能继续传递该信息。我们称这种失败为过早跨模态承诺。我们提出了全流式思维(Omni-Streaming Thinking, OST),它生成结构化输出,包括已观察到的证据、未来证据的预测以及基于这些证据的主张。每个主张最初标记为待定,并关联至未来的验证时间段。音频和视觉证据分别存储,OST在验证时间段结束时会根据指定模态的证据检查主张。当检测到矛盾证据时,否定过程会降低该主张及其依赖状态的影响,然后利用新证据指导状态更新。一个答案门决定答案关键主张是否满足给出响应的条件。使用冻结的Qwen3-Omni-30B-A3B-Instruct骨干并进行轻量级适配,OST在五个流式和音视频基准上平均相对提升超过10%,优于最强的开放基线。我们还引入了OST-DiagBench,该基准在固定视频的情况下编辑音频,以测试一致性、缺失、矛盾、共存以及字幕-语音冲突。OST实现了d-prime = 2.95,而开放基线最多为1.38,同时减少了视觉引发的听觉幻觉。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*流式全模态(音频–视觉)推理中的过早跨模态承诺\*\*(premature cross-modal commitment)问题。 具体而言,核心问题可归纳为以下几个方面: --- ### 1. 模态不对称的证据成熟(Modality-Asymmetric Evidence Maturation) 在流式视频与同步音频输入中,不同模态提供决定性证据的时间往往不同步。视觉信号(如屏幕文字、物体画面)可能在极短时间内即可被识别,而音频信号(如人声 announcement、环境声事件)通常需要更长的完整区间才能被正确解读。这种时间差导致模型在音频证据尚未充分呈现之前,就已基于视觉线索做出了早期解释。 --- ### 2. 过早跨模态承诺与视觉偏差的持久化 当模型将早期视觉解释直接写入工作记忆并作为事实(fact)对待时,后续的推理链条会持续复用该条目。即使后续到达的音频证据与这一早期猜测相矛盾(例如屏幕显示 "Gate 6",但广播宣布改为 "Gate 12"),错误仍会从最初的视觉猜测传播到后续的摘要与最终答案。论文将这一失效模式称为\*\*过早跨模态承诺\*\*:在所需检验证据尚未到达之前,某一模态的解释已成为工作事实。流式记忆机制使得视觉偏差(visual bias)获得了持久的放大效应。 --- ### 3. 现有方法的局限性 现有的流式视频理解方法主要关注: - 视觉 token 的压缩与历史检索; - 何时触发回答(response timing); - 将输入块转换为文本化记忆。 然而,这些方法并未显式处理\*\*从早期猜测到持久错误\*\*的传播路径。在离线场景中,批判与附加推理可基于完整证据修正答案;但在流式场景中,验证必须等待未来观察,而修正必须追溯到基于早期解释构建的记忆状态。现有系统缺乏将“未来验证”与“记忆修正”显式关联的机制。 --- ### 4. 论文提出的解决方向 为应对上述问题,论文提出了 \*\*Omni-Streaming Thinking (OST)\*\*,其核心设计包括: - \*\*结构化声明(Claims)\*\*:将未解析的解释记录为待验证声明,明确标注其预期内容、验证模态、未来验证区间及依赖关系,而非直接写入记忆为事实。 - \*\*分离模态保留(Separated Retention)\*\*:音频与视觉证据分别存储,确保验证时仍有原始证据可用。 - \*\*声明–验证–反驳循环(Claim → Verify → Retract)\*\*:在验证区间结束时,由对应模态的验证器检验声明;若检测到矛盾证据,则启动反驳过程,通过记录的依赖图(lineage/provenance graph)衰减该声明及其所有派生状态的影响,并利用裁决条件解码(verdict-conditioned decoding)重写当前状态。 - \*\*回答门控(Answer Gate)\*\*:仅在所有回答关键性声明均已完成验证且证据充分时,才允许模型输出答案,从而同时控制\*\*回答内容\*\*与\*\*回答时机\*\*。 此外,论文还引入了诊断基准 \*\*OST-DiagBench\*\*,通过固定视频、编辑音频的方式,系统评估模型在跨模态一致、缺失、矛盾、共存及字幕–语音冲突场景下对听觉证据的真实利用能力。 Q2: 有哪些相关研究? 该论文的相关研究主要分布在\*\*音频–视觉理解\*\*与\*\*流式视频理解\*\*两大领域,具体可归纳如下: --- ## 1. 音频–视觉理解(Audio-Visual Understanding) ### 1.1 早期多模态大语言模型 早期系统致力于将冻结的视觉与音频编码器接入大语言模型(LLM),代表性工作包括: - \*\*Video-LLaMA\*\*
54
与 **PandaGPT**
36
:分别通过视频–音频编码器与多模态指令跟随架构,开启了对视频内容的统一语言建模。 ### 1.2 跨模态对齐与统一处理 后续研究聚焦于改善音频与视觉信号之间的 grounding 与对齐: - **CAT**
51
:引入线索聚合器(clue aggregator)与偏好优化,增强动态音频–视觉场景中的问答能力。 - **video-SALMONN**
37
:利用多分辨率因果 Q-Former,将语音、声音事件及音乐与视觉内容进行对齐。 - **VITA**
12
与 **Qwen2.5-Omni**
48
:将统一处理扩展至文本、图像、音频与视频,构建端到端的全模态模型。 ### 1.3 基准测试与视觉偏差分析 - 基准测试:**Daily-Omni**
62
、**OmniVideoBench**
22
与 **Video-Holmes**
9
用于评估音频–视觉推理能力。 - 冲突检测:部分研究考察模型在模态信息不一致时能否正确区分不同通道
52
。 - 视觉主导性(visual dominance):多项研究表明,简单增加音频输入并不能保证模型恰当利用听觉证据
2, 32, 61
;该论文进一步指出,在流式场景中,这种视觉偏差会通过记忆机制被放大并持续传播。 —- ## 2. 流式视频理解(Streaming Video Understanding) ### 2.1 流式记忆与历史压缩 流式模型必须因果地处理观测并维护紧凑的历史表示: - **VideoLLM-online**
7
:首次提出流式视频对话与“在视频流中学习”的范式。 - **Flash-VStream**
55
与 **MovieChat**
35
:在多个时间尺度上组织历史观测。 - Token 压缩与检索:部分方法通过剪枝视觉 token
43, 50, 57
或检索相关历史片段
45
来控制上下文长度。 ### 2.2 响应时机决策(When to Answer) - **Dispider**
29
:将感知、决策与反应解耦,支持主动实时交互。 - **StreamBridge**
41
:为离线视频大模型配备记忆与激活模型,使其具备流式推理能力。 - **StreamReady**
1
、**Progressive online video understanding**
58
:将回答时机与当前可用证据的充分性挂钩。 ### 2.3 Think-While-Watching 与文本状态演化 近期研究进一步强调在流式观看过程中维护持续演化的推理状态: - **Think-while-watching** 系列工作
5, 14, 42, 47
:将传入的视频块转换为文本化记忆或“思维”状态,作为持续推理的基础。 - 该论文指出,上述方法虽然改善了记忆与推理的连续性,但并未显式解决**早期视觉猜测如何通过记忆传播为持久错误**的问题,也缺乏将未来验证与记忆修正显式关联的机制。 —- ## 3. 与现有工作的核心区别 | 维度 | 现有研究 | OST 的改进 | |———|————-|—————-| | **记忆内容** | 压缩观测、文本摘要或 token 缓存 | 存储带验证条件的**未来可检验声明**(claims)及其依赖关系 | | **跨模态冲突** | 离线批判或端到端微调 | 流式场景下的**声明–验证–反驳**循环,支持等待未来证据并回溯修正 | | **回答时机** | 基于证据充分性或固定策略 | **回答门控**同时检查证据充分性与待审声明状态,确保回答关键性声明均已审定 | | **视觉偏差** | 静态偏好优化或事后诊断 | 通过分离模态保留、依赖传播衰减与裁决条件解码,**在推理过程中抑制**过早视觉承诺 | 简言之,现有工作为流式全模态模型提供了记忆架构与回答策略,而 OST 首次将**未来验证**与**记忆修正**显式耦合,以解决流式音频–视觉推理中的过早跨模态承诺问题。 Q3: 论文如何解决这个问题? 论文通过提出 **Omni-Streaming Thinking (OST)** 来解决流式音频–视觉推理中的过早跨模态承诺问题。该方法的核心思想是:**将早期不确定的跨模态解释显式注册为“待验证声明”(future-testable claims),而非直接写入记忆作为事实;随后在等待未来证据到达后进行验证,若发现矛盾则通过依赖图传播衰减并修正相关记忆状态,最终由回答门控决定何时输出答案**。 具体解决路径可分为以下五个相互联动的机制: —- ### 1. 结构化 Omni-State 与可验证声明(Claim) 在每个决策块(decision chunk) s (每 Delta_(chunk) = 4 秒),OST 将当前解释编码为六字段的 **Omni-State** z_s :
zs = visual_evidence, audio_state, audio_evidence, conflict, forecast, sufficiency
其中前四项构成状态主体 z_s^(body) 。当事件尚未完整展开时,OST 不显式断定事实,而是通过 **forecast** 字段生成一个或多个结构化声明 c_i :
c_i = (x_i, m_i, I_i, σ_i) sim pθ(· mid Cs, z_s^(body))
每个声明记录: - x_i :对未来证据的预测文本(例如“广播将确认登机口为 6”); - m_i :负责验证该声明的模态(音频、视觉或联合); - I_i = (t_s, t_s + δ_i] :未来证据窗口; - σ_i :支持范围(支持当前状态、支持另一声明、或支持最终答案)。 声明初始可靠性 rho_i = 1 ,状态为 **PENDING**。这避免了将早期视觉猜测直接固化为事实。 —- ### 2. 分离模态保留(Separated Modality Retention) 为确保声明在验证时仍有原始证据可供调用,OST 为音频与视觉分配**独立的保留预算** B^A 与 B^V ,并在各自模态内按策略驱逐 token。对于处于待审区间的证据,系统会**固定(pin)**相关窗口,直至对应声明被确认、反驳或过期。这解决了共享预算下密集视觉 token 排挤音频证据、导致验证失败的问题。 记忆组织采用四级金字塔:4 秒 Omni-State → 16 秒摘要 → 64 秒摘要 → 长期记忆根节点。合并时保留声明标识与可靠性分数,确保压缩不会丢失反驳传播所需的依赖信息。 —- ### 3. 模态专属验证与因果反驳(Verify & Retract) 当证据窗口 I_i 结束时,模态专属验证器 Vφ^(m_i) 对声明进行判定:
(nui, γ_i) = Vφ^(mi)(x_i, O(Ii)^(m_i)), quad γ_i ∈ [0,1]
verdict nu_i 可为 **CONFIRMED**、**REFUTED** 或 **UNRESOLVED**。若证据矛盾(REFUTED),反驳过程执行以下操作: **a. 可靠性衰减** 更新被反驳声明的可靠性,并沿记录的血统图(acyclic provenance graph)向其派生状态传播:
rho_i arrow minrho_i, α(γ_i), quad rho_j = rho_j min(k ∈ Anc)(j) rhok
其中 rho_j 为跨度 j 的有效可靠性。该机制保证被反驳前提及其所有后代(摘要、派生推理)在后续解码中的影响力同步下降。 **b. 注意力偏置注入** 在推理注意力层中,向属于低可靠性跨度的键添加偏置:
Attn(Q,K,V) = softmax((QK^top) / (√d) + B(causal) + B(ver)) V
其中 B(ver) 在跨度 g_j 的 token 上取值为 log rho_j 。这直接降低了错误传播路径的激活强度。 —- ### 4. 裁决条件解码(Verdict-Conditioned Rewriting) 反驳不仅衰减旧影响,还需利用新证据重写当前解释。OST 对每个被反驳的决策块构造两个解码分支: - ** C_s^+ **:应用反驳后的注册表与可靠性分数; - ** C_s^- **:回滚被反驳声明至反驳前的状态,并移除相关裁决。 在生成状态主体 z_s^(body) 及后续预测时,使用对比 logit 进行引导:
ells = ell_s^+ + λ_s (ell_s^+ - ell_s^-), quad λ_s = λ_0 (1) / (|X_s|)∑(i ∈ X_s) γ_i
其中 X_s 为当前块被反驳的声明集合。该规则在 token 级别增强那些被“修正后上下文”更支持的预测,从而使新生成的状态主体反映音频证据(如登机口改为 12),而非延续早期视觉错误(登机口 6)。随后,预测器在该重写状态上生成新的未来声明。 —- ### 5. 回答门控(Answer Gate)与最优停止 OST 通过回答门控同步控制**回答内容**与**回答时机**。门控检查两个条件: - **证据充分性**: Suff_s = 1 ,即当前 Omni-State 包含足够回答的事实; - **无待审关键声明**: A_s(q) = ∅ ,即所有直接 or 传递支持答案的声明均已完成审查(确认或反驳),没有处于 pending 状态的答案关键声明。 当且仅当两个条件同时满足时,模型才在最早满足条件的决策块输出答案:
T^star = ∈ft_s : Suff_s = 1 land A_s(q) = ∅
若流结束仍未满足,则在终止时输出答案,并对依赖未解决声明的答案附加**低置信标记**。这防止了模型在关键跨模态证据尚未到达时过早作答。 —- ### 6. 训练概要(轻量级适配) OST 以冻结的 Qwen3-Omni-30B-A3B-Instruct 为主干,仅通过 LoRA 与少量可学习头进行适配,训练分阶段进行: 1. **事实表构建**:利用离线索引工具与模态分离的标注流程,构建带时间戳的音频/视觉事实表; 2. **组件训练**:分别训练预测器(生成未来声明)、验证器(二分类打分头)与门控(充分性判断); 3. **监督微调(SFT)**:在观测状态与修正状态上进行策略微调,学习在配对音频示例中优先报告真实存在的声音; 4. **在线策略优化**:通过完整 Claim–Verify–Retract 循环的轨迹进行强化学习,优化回答准确性、响应时机与输出格式。 通过上述机制,OST 在五个流式与音频–视觉基准上取得最优开放结果,并在诊断基准 OST-DiagBench 上将跨模态听觉幻觉显著降低。 Q4: 论文做了哪些实验? 论文的实验围绕三个核心研究问题(RQ)展开,评估了所提出方法在标准流式音频–视觉任务、跨模态偏差诊断以及模块贡献分析上的性能。 —- ### 1. 实验设置与基准测试 实验基于**冻结的 Qwen3-Omni-30B-A3B-Instruct** 主干,仅通过轻量级适配(LoRA 与少量可学习头)训练 OST。评估涵盖以下基准: - **SOVBench**
46
:主要流式全模态理解测试,包含 SOVBench-O(在线问答准确率)与 SOVBench-T(响应触发 F1)。 - **StreamingBench**
24
:流式视频理解基准,含音频–视觉与纯视觉任务。 - **Video-Holmes**
9
:复杂视频推理基准(32 帧设置)。 - **Daily-Omni**
62
:音频–视觉时序对齐推理基准(1 FPS)。 - **OmniVideoBench**
22
:全模态大模型综合评估。 - **OST-DiagBench**(本文新提出):固定视频、编辑音频的诊断基准,包含 CLEAN、MUTE、SWAP、MIX 及 CLASH 五种条件,用于测量模型在音频–视觉一致、缺失、矛盾、共存及字幕–语音冲突场景下对听觉证据的真实利用能力。 —- ### 2. RQ1:流式与音频–视觉基准上的主性能(Section 4.1) **SOVBench 结果(Table 1):** - 在 **Audio–Visual Context** 下,OST 的 SOVBench-O 平均准确率达到 **87.8%**,相比最强开放基线 StreamOV(81.6%)提升显著;在 **Audio–Visual + QA Context** 下,从 83.8% 提升至 **88.4%**。 - 最大的单项增益出现在 **Recall** 类别(73.2 → 82.5),这直接测试了模型在跨决策块之间保持并利用早期证据的能力。 - 响应触发方面,SOVBench-T 的 F1 从 StreamOV 的 90.5 提升至 **92.4**,ANSWER 与 WAIT 的精确率/召回率均有所提高。 **跨基准结果(Figure 3 与附录表格):** - 在 **StreamingBench**(音频–视觉 QA 平均 74.7%)、**Video-Holmes**(平均 60.0%)、**Daily-Omni**(平均 74.2%)与 **OmniVideoBench**(平均 46.6%)上,OST 均超越所有测试的开放基线(包括 StreamOV、ROMA、Qwen3-Omni 等)。 - 在 Daily-Omni 上,OST 在 **CP(因果推理)** 类别取得 90.1% 的显著优势(StreamOV 为 71.0%)。 —- ### 3. RQ2:跨模态偏差诊断(Section 4.2) OST-DiagBench 通过固定视频、系统编辑音频,暴露出现有模型在音频–视觉冲突下的**视觉主导性幻觉**。 **核心量化结果(Table 2 与 Table 8):** | 指标 | OST | 最强开放基线 | 说明 | |———|——-|——————-|———| | **d′** | **2.95** | ≤ 1.38 | 综合区分“正确识别音源”与“幻觉缺失音源”的能力 | | CLEAN-SR ↑ | **95.49%** | 92.55% (Qwen3-Omni) | 音视频一致时源音识别率 | | MUTE-VHR ↓ | **10.39%** | 73.73% / 81.96% | 音源被移除后仍报告“看到的声音”(幻觉率) | | SWAP-AFR ↑ | **81.76%** | 60.00% (离线) / 28.43% (流式) | 音源被替换后正确归因新音源 | | MIX-JR ↑ | **51.37%** | ≤ 19.41% | 音源与干扰音共存时联合识别率 | | CLASH-Acc ↑ | **46.47%** | ≤ 4.90% | 字幕保留旧事实、语音播报新事实时的准确率 | **关键发现:** - **视觉偏差在音频一致时隐藏**:Qwen3-Omni 在 CLEAN 上达 92.55%,但在 MUTE(移除原音)后幻觉率高达 81.96%,说明强的一致性能掩盖了深层的视觉主导。 - **音频单独识别能力在加入视频后丧失**:Qwen3-Omni 在音频-only 的 SWAP 上 donor recall 为 79.80%,但加入视频后暴跌至 35.29%;CLASH 中,基线在音频-only 可接近 100% 识别新事实,加入冲突字幕后准确率跌至 0%–4.9%。 - OST 在保持最高 CLEAN 召回的同时,将 MUTE 幻觉率降至 10.39%,并在 SWAP、MIX、CLASH 上实现了数量级的提升。 —- ### 4. RQ3:模块消融实验(Section 4.3,Table 3) 为验证 Claim–Verify–Retract 循环各组件的必要性,论文进行了系统消融: **证据保留与状态表示:** - **共享 A/V 预算**(非分离保留):SOVBench-O Recall 从 82.5 降至 74.2。 - **自由格式 scratchpad**(替代 Omni-State):Video-Holmes TCI 从 53.1 降至 40.7。 **未来验证机制:** - **注册时立即验证**(非等待未来窗口):SOVBench-O Avg. 从 87.8 降至 83.6。 - **非预测性 issue + 验证**:降至 84.1。 - **无类型验证器**(untyped verifier):d′ 从 2.95 降至 1.95,SWAP-AFR 降至 63.73%。 - **移除无信息证据上限(AXIOM_CAP)**:多项指标下降。 **记忆修正机制:** - **仅声明反驳(无后代/摘要传播)**:SOVBench-O Recall 降至 73.2,Video-Holmes TCI 降至 47.6。 - **移除裁决条件重写(λ₀ = 0)**:Video-Holmes Avg. 降至 56.2。 - **硬支持门控**(替代可学习门控):SOVBench-O Avg. 降至 85.2。 **无循环对照:** - **仅延迟匹配的学习门控(无验证循环)**:SOVBench-O Avg. 83.3,d′ 2.65。 - **朴素流式思维对照**:SOVBench-O Avg. 80.6,d′ 2.58。 消融结果表明,**分离保留、未来窗口验证、类型化验证器、依赖传播衰减、裁决条件解码以及完整循环** 均对最终性能有独立且显著的贡献。 —- ### 5. 补充诊断与稳健性分析(Appendix B & C) - **CLASH 配对分析(Table 6)**:在 510 个样本中,Qwen3-Omni 等基线在音频-only 上几乎 100% 正确识别新事实,加入冲突视频后错误地转为旧事实的比例超过 93%;OST 仍保持 100% 音频-only 准确率,并在音视频冲突下达到 46.47%。 - **音频-only vs. 音视频对照(Table 7)**:量化“跨模态抑制差”(CMSG),显示基线在加入视频后 donor 识别率损失 15–45 个百分点,OST 显著缓解该现象。 - **条件化诊断面板**:包括证据强度(-10/0/+10 dB)、时间位置(早/中/晚 onset)与语义距离(NEAR-SWAP vs. FAR-SWAP),用于分离失败机制(附录 B.5)。 - **各基准分类别明细**:附录 C 提供了 StreamingBench(表 9–10)、Video-Holmes(表 11)、Daily-Omni(表 12)与 OmniVideoBench(表 13)的细粒度类别与时长拆分结果。 Q5: 有什么可以进一步探索的点? 基于该论文提出的 **Omni-Streaming Thinking (OST)** 框架与 **OST-DiagBench** 诊断基准,可从以下几个方向进行进一步探索: —- ### 1. 扩展至多模态与更复杂的语义冲突场景 当前 OST 主要针对音频–视觉双模态流。未来工作可将框架扩展至包含**文本流**(如实时字幕、弹幕)、**时序传感器数据**(如雷达、激光雷达)或**触觉反馈**的更多模态场景。相应地,声明的验证模态 mi 与证据窗口 I_i 需支持异构时间分辨率与采样率。此外,可探索**非二元冲突关系**(如部分一致、语义层级包含或蕴含冲突),而非当前单纯的 CONFIRMED / REFUTED / UNRESOLVED 三元判定,从而更精细地刻画跨模态证据的交互。 —- ### 2. 自适应与动态化的声明生命周期管理 现有实现中,未来证据窗口的持续时间 δ_i 选自固定集合 4, 8, 16 秒。可研究**自适应窗口选择机制**:让模型根据预测事件的语义类别与历史统计,动态决定 δ_i ,以在响应延迟与验证充分性之间取得更优权衡。同时,当前每个决策块最多生成 C(max)=2 个声明,且最大深度 D(max)=3 ;对于长时程、高密度的流式输入,可探索**可扩展的声明图压缩与近似传播算法**,避免随着流长度增长,血统图 Anc(j) 的维护开销呈多项式甚至指数级上升。 —- ### 3. 端到端学习与在线持续适应 OST 的训练目前采用分阶段流水线(组件拟合 → SFT → 在线策略优化)。一个开放问题是能否设计**完全端到端的可微分声明–验证–反驳循环**,使梯度从验证器的裁决信号 nu_i 直接回传至声明生成策略,从而省略显式的事实表标注。更进一步,在部署阶段引入**在线持续学习**:当用户或环境提供外部纠正信号(如“登机口并非 12”)时,模型能否在不解耦主干的情况下,通过局部 LoRA 更新或记忆写入,实时修正特定类别的声明生成偏好。 —- ### 4. 深化记忆修正的计算效率 裁决条件解码(Equation 6)要求对每个被反驳的决策块进行双分支评估( C_s^+ 与 C_s^- ),这在实时系统中带来额外推理开销。未来可探索: - **轻量级知识编辑技术**(如 ROME、MEMIT)对状态主体 z_s^(body) 进行局部、单分支修正; - **投机性验证**:利用小型验证器草稿提前预判可能的 refutation,仅在必要时触发主模型的完整重写; - **动态保留预算分配**:将分离的音频/视觉预算 B^A, B^V 的分配建模为强化学习子问题,而非基于启发式规则。 —- ### 5. 反向诊断基准:固定音频、篡改视频 OST-DiagBench 通过固定视频、编辑音频来诊断听觉证据的使用。对称地,可构建**固定音频、编辑视频**的反向诊断基准,检验模型在视觉证据被移除、替换或与音频矛盾时,是否会遭受“听觉主导性”或“音频诱发视觉幻觉”。这类双向基准将更完整地刻画模态偏见的非对称性,并推动设计更均衡的跨模态门控机制。 —- ### 6. 与世界模型及检索增强的融合 当前验证器 Vφ^(mi) 仅对比声明 x_i 与观测证据 O(Ii)^(m_i) 。若能引入**轻量级世界模型**,则模型可对物理或社会规则进行一致性检验(例如,“同一航班不能同时从 Gate 6 和 Gate 12 起飞”),即便观测证据暂时不完整,也可提前标记声明为高度可疑。此外,结合**流式检索增强(Streaming RAG)**:当感官证据不足以验证声明时,可主动查询外部数据库(如机场广播日志、实时时刻表),将检索结果作为第三模态证据引入验证。 —- ### 7. 认知可解释性与人类–AI 协同 OST 生成的声明注册表、血统图与依赖传播路径构成了结构化的推理痕迹。未来可研究如何将这些内部结构**可视化并交付给终端用户**,使用户能够理解模型为何选择 WAIT 而非立即回答,或为何在某一时刻突然修正先前结论。在关键任务领域(如医疗监护、自动驾驶),这种可解释性对于建立人机信任至关重要。此外,可探索**人在回路中的主动验证**:当模型将某个声明标记为 UNRESOLVED 时,能否向人类操作员发起针对性的证据请求。 —- ### 8. 对抗鲁棒性与安全关键部署 跨模态冲突场景也暴露了潜在的攻击面:对抗者可通过注入伪造音频或视觉补丁,诱导模型生成错误的声明,或在验证阶段触发错误的 refutation,进而通过依赖传播污染后续状态。未来需系统评估 OST 对**对抗性模态攻击**的脆弱性,并设计鲁棒的验证阈值校准与异常检测机制。在自动驾驶、工业监控等安全关键领域,还需研究如何在严格时延约束下保证 claim–verify–retract 循环的**最坏情况执行时间(WCET)**可预测性。 Q6: 总结一下论文的主要内容 该论文围绕流式音频–视觉理解中的**过早跨模态承诺**问题,提出了 **Omni-Streaming Thinking (OST)** 框架,并构建了诊断基准 **OST-DiagBench**。以下是主要内容总结: —- ### 1. 核心问题:过早跨模态承诺 - **模态不对称的证据成熟**:在流式音视频输入中,视觉线索(如屏幕文字、物体)通常可在极短时间内被识别,而音频事件(如人声 announcement、环境声)往往需要更长的时间窗口才能完整呈现。 - **持久化的视觉偏差**:流式模型倾向于将早期视觉解释直接写入工作记忆并作为事实使用。当后续音频证据与这一早期猜测矛盾时(例如屏幕显示 “Gate 6”,而广播随后宣布改为 “Gate 12”),错误会从初始猜测沿推理链条传播至后续摘要与最终答案,且难以被修正。 - **现有方法局限**:已有流式方法虽关注历史记忆压缩、检索与回答时机,但缺乏将**未来验证**与**记忆修正**显式关联的机制,无法有效阻断从早期猜测到持久错误的路径。 —- ### 2. 方法:Omni-Streaming Thinking (OST) OST 的核心思想是将未解析的解释显式注册为**未来可检验的声明(claims)**,而非直接固化为事实,并在后续证据到达时进行验证与记忆修正。主要机制包括: - **结构化 Omni-State 与声明生成** 每个决策块(4 秒)生成六字段状态 z_s ,包含视觉证据、音频状态、音频证据、冲突、预测(forecast)与充分性(sufficiency)。对不确定事件,模型生成声明 c_i = (x_i, m_i, I_i, σ_i) ,记录预测内容、验证模态、未来证据窗口与支持范围,初始标记为 **PENDING**。 - **分离模态保留** 音频与视觉证据分别存储于独立预算 B^A 与 B^V 中,避免密集视觉 token 排挤待验证的音频证据。处于审查区间的证据被固定保留,直至对应声明确认、反驳或过期。 - **声明–验证–反驳循环** 证据窗口 I_i 结束时,模态专属验证器 Vφ^(m_i) 进行判定。若证据矛盾(**REFUTED**),则: - 沿记录的血统图(acyclic provenance graph)传播可靠性衰减:
rhoi arrow minrho_i, α(γ_i), quad rho_j = rho_j min(k ∈ Anc)(j) rho_k
- 在注意力层注入偏置 B_(ver) ,降低被反驳声明及其后代在解码中的影响。 - 通过**裁决条件解码**(verdict-conditioned decoding)重写状态主体,利用新证据修正当前解释:
ell_s = ell_s^+ + λ_s (ell_s^+ - ell_s^-) - **回答门控(Answer Gate)** 仅当证据充分且所有直接/传递支持答案的声明均已完成审查(无待审关键声明)时,才允许模型输出答案:
T^star = ∈ft_s : Suff_s = 1 land A_s(q) = ∅
否则模型持续等待(**WAIT**),从而同时控制回答内容与回答时机。 —- ### 3. 实验与结果 - **标准基准性能(RQ1)** 在 **SOVBench**(在线平均 87.8%)、**StreamingBench**、**Video-Holmes**、**Daily-Omni** 与 **OmniVideoBench** 五个流式及音频–视觉基准上,OST 均取得最佳开放结果,平均相对提升超过 10%。特别是在 SOVBench 的 **Recall** 类别(82.5%)与响应触发 F1(92.4)上优势显著。 - **跨模态偏差诊断(RQ2)** 提出的 **OST-DiagBench** 固定视频、编辑音频,测试五种条件: - **CLEAN**(原音保留)、**MUTE**(原音移除)、**SWAP**(替换为干扰音)、**MIX**(原音+干扰音共存)、**CLASH**(字幕保留旧事实、语音播报新事实)。 - OST 达到 d’ = 2.95 (开放基线最多 1.38),CLEAN 召回 95.49%,MUTE 幻觉率仅 10.39%;在 SWAP、MIX 与 CLASH 上均大幅领先,显著减少了视觉诱导的听觉幻觉。 - **消融实验(RQ3)** 系统验证了各组件的必要性:共享保留预算、移除 Omni-State、注册时立即验证、无类型验证器、仅声明级反驳(无后代传播)、移除裁决条件解码以及去掉完整循环等变体,均导致性能显著下降,证明了分离保留、未来窗口验证、依赖传播与状态重写的独立贡献。 —- ### 4. 主要贡献 - **问题识别**:首次明确提出流式全模态推理中的**过早跨模态承诺**失效模式,指出视觉偏差通过流式记忆被放大并持久化的机制。 - **诊断基准**:引入 **OST-DiagBench**,通过固定视频、系统篡改音频,量化模型在跨模态一致、缺失、矛盾、共存及字幕–语音冲突场景下对听觉证据的真实使用能力。 - **方法框架**:提出 **OST**,通过结构化声明、模态专属验证、血统感知反驳与裁决条件解码,将未来证据检验与记忆修正显式耦合,实现“回答什么”与“何时回答”的联合优化。 - **性能突破**:在五个标准基准与一个诊断基准上,以冻结主干加轻量级适配的方式,取得最佳开放结果,显著抑制了跨模态幻觉。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Enjun Du,Siyi Liu,Ziyu Zheng,Jingyu Li,Yiwen Guo,Yongqi Zhang,Difan Zou
Categories:
PDF URL: https://arxiv.org/pdf/2609.15128.pdf
Arxiv URL: https://arxiv.org/abs/2609.15128
Arxiv ID: 2609.15128
CoolPaper URL: https://papers.cool/arxiv/2609.15128
Published: 2026-09-16T01:38:56.962Z
Updated: 2026-09-16T01:38:56.962Z
14. Kaininja: Extending Native 3D Generators to the Part Level
Abstract:Native 3D generators turn one image into a single mesh. TRELLIS.2 and its peers deliver high-fidelity non-watertight geometry with materials, but the output is one fused object, while downstream work such as editing, rigging and simulation operates on part-level assets. A naive idea is to run a 3D segmentation network on the fused mesh that TRELLIS.2 generates, but such pipelines are slow and bounded by the accuracy of the segmentation. We want a simple way to extend an existing native 3D generator to the part level. But we face a critical problem: the O-Voxel grid stores one sheet of surface per voxel, so a single volume cannot represent the interface where two parts touch, at any resolution. We introduce a dual-volume representation to solve this problem and put forward KaiNinja, a part-level extension of TRELLIS.2 built on a dual-volume form of its O-Voxel representation. KaiNinja keeps the generation speed and quality of TRELLIS.2 while extending it to the part level, with no mask or segmenter in the pipeline. Its training data come from sources of many kinds, including CAD models and assets authored by an LLM-driven agent; to our knowledge it is the first 3D generative model trained on agent-authored part data. Surprisingly, we also find that whole-object fidelity improves over the same backbone fine-tuned on the same dataset. Against part generation pipelines of different paradigms, it lowers whole-object Chamfer distance by 40% and raises strict part F-score by 16%.
中文摘要
摘要:原生 3D 生成器将一张图像转换为单一的网格。TRELLIS.2 及其同类产品可以生成带材质的高保真非封闭几何体,但其输出是一个融合的整体对象,而下游工作如编辑、绑定和模拟是针对部件级资产进行的。一种简单的想法是对 TRELLIS.2 生成的融合网格运行 3D 分割网络,但这样的流程既慢又受分割精度的限制。我们希望找到一种简单的方法,将现有的原生 3D 生成器扩展到部件级。然而我们面临一个关键问题:O-体素网格每个体素只能存储一层表面,因此单个体积无法表示两个部件接触的界面,不管分辨率多高。我们提出了一种双体积表示方法来解决这一问题,并推出 KaiNinja,这是一种基于 TRELLIS.2 O-体素表示的双体积形式的部件级扩展。KaiNinja 保持了 TRELLIS.2 的生成速度和质量,同时扩展到部件级,无需在流程中使用掩码或分割器。其训练数据来自多种来源,包括 CAD 模型以及由 LLM 驱动的代理生成的资产;据我们所知,它是首个在代理生成的部件数据上训练的 3D 生成模型。令人惊讶的是,我们还发现,相同骨干网络在同一数据集微调后,整体对象的保真度有所提升。与不同范式的部件生成流程相比,它将整体 Chamfer 距离降低了 40%,严格的部件 F 分数提高了 16%。
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决的核心问题是:\*\*如何将现有的原生单图像3D生成器从输出单一融合网格扩展到输出具有独立部件结构的3D资产\*\*,同时避免依赖外部分割网络或预定义掩码。 具体而言,论文针对以下三个层面的问题展开: \*\*1. 下游任务需求与生成器输出之间的结构性错配\*\* - 当前最先进的原生3D生成器(如 TRELLIS.2、Hunyuan3D 等)均输出一个\*\*完整融合的单一网格\*\*。 - 然而,实际下游应用(如部件编辑、重纹理、骨骼绑定、物理仿真、跨场景复用)要求每个部件都是\*\*独立、自包含的网格\*\*。 - 现有方案通常采用“先整体生成、后分割”的级联管线(如使用 P3-SAM 分割),但这不仅速度极慢,且部件边界完全受限于分割网络的精度,无法纠正生成阶段已经融合的结构。 \*\*2. 表示层面的根本性限制:单体积无法承载部件接触界面\*\* - TRELLIS.2 使用的 \*\*O-Voxel\*\* 表示在单个激活体素中至多存储\*\*一层表面\*\*(one sheet per voxel)。 - 当两个部件相互接触时,其外表面几乎平行且紧密贴合,在体素化后必然落入同一组体素,导致其中一层表面被覆盖或塌陷,形成无法恢复的界面。 - 这是一个\*\*容量极限\*\*而非分辨率极限:无论分辨率如何提高,只要使用单一整体体积,就无法表示部件之间的接触面。 \*\*3. 现有部件级生成范式的效率与扩展性瓶颈\*\* - \*\*基于掩码/边界框的方法\*\*(如 OmniPart)需要预先确定部件布局,固定了部件数量,缺乏灵活性。 - \*\*自回归逐部件生成\*\*(如 AutoPartGen)需要 N 次网络前向传播,随部件数量线性增加计算成本。 - \*\*每部件独立潜在体积\*\*(如 PAct)将计算量乘以 N ,且对最大部件数设有固定上限。 - 这些方法要么依赖外部分割,要么计算代价高昂,难以兼顾\*\*速度、质量与任意部件数\*\*的可扩展性。 为此,论文提出 \*\*KaiNinja\*\*,通过\*\*双体积 O-Voxel 表示(dual-volume packing)\*\*将任意数量的部件分配到两个互补的体积中,确保接触部件永不共享体积,从而在每个体积内可直接通过连通分量分析得到独立部件,无需任何分割器或掩码参与管线。 Q2: 有哪些相关研究? 该论文在第2节系统梳理了相关研究,可归纳为以下几条主线: ### 1. 原生单图像3D生成(Native Image-to-3D Generation) 此类方法将形状编码为紧凑潜在表示,并通过扩散或整流流(rectified flow)直接去噪3D潜在。代表性工作包括: - \*\*向量集/神经场潜在\*\*:3DShape2VecSet
61
、Michelangelo
64
;Dora
4
对其VAE进行了锐边采样改进。 - **高保真单图生成**:CLAY
62
、CraftsMan3D
20
、Direct3D
50
、TripoSG
21
、Hunyuan3D
63
、Hi3DGen
60
。 - **稀疏结构化网格潜在**:TRELLIS
52
将潜在表示移至稀疏结构化网格;TRELLIS.2
51
进一步引入无场的 **O-Voxel**,支持开放/非流形/封闭表面以及PBR材质。 上述模型的共同局限是**均输出单一融合网格,不包含部件结构**。 ### 2. 部件感知与组合式3D生成(Part-Aware & Compositional Generation) 这是与本文最直接相关的方向,论文将其细分为四类: #### (i) 先整体生成,再分割重建 - **PartGen**
2
:分割多视图渲染后分别补全各部件。 - **HoloPart**
57
:对外部分割器提供的片段进行补全。 - **X-Part**
56
:在其配套分割器 **P3-SAM**
35
的指导下,一次性重建所有部件。 此类方法的部件边界完全取决于分割器精度,且必须等整体网格生成完毕后才能进行部件推理。 #### (ii) 生成前引入掩码或边界框 - **OmniPart**
59
:对输入图像做2D分割,提升为3D边界框布局以指导生成。 - **Part123**
25
:利用2D掩码从单视图重建部件感知形状。 - **ComboVerse**
6
、**PhyCAGE**
55
:将图像分割为组件后分别生成再组合。 这类方法在3D推理发生前即固定了布局。 #### (iii) 自回归逐部件生成 - **AutoPartGen**
3
:顺序生成部件,每个部件以已生成部件为条件,并自行决定何时停止。 代价是每部件需一次网络前向传播,总成本随部件数线性增长。 #### (iv) 端到端无掩码/无边框生成(本文所属类别) - **PartPacker**
44
:将所有部件打包进两个互补体积,联合去噪;基于vecset潜在表示解码为SDF场。 - **PartCrafter**
23
:按部件分组潜在token,但需预先给定部件数量。 二者均基于vecset/SDF表示,要求部件水密且仅建模几何。 **本文(KaiNinja)** 属于第(iv)类,但区别于上述工作:它将双体积打包直接构建在 **TRELLIS.2 自身的稀疏O-Voxel网格**上,继承了其两级结构化潜在、开放表面支持与PBR材质能力,且无需重新训练先验。 ### 3. 原生网格生成与部件化(互补方向) - **MeshGPT**
41
、**MeshAnything**
5
:自回归token化面片。 - **Nexus**
47
:对顶点和拓扑进行扩散。 - **LATO.2**
32
:将生成分解为顶点流和拓扑流,支持基于部件边界框的部件模式。 - **Meshy T2**
54
:联合生成顶点与边,将重合顶点保留为独立token,使接触部件自然以连通分量形式存在。 这些模型目前尚未公开部件变体的权重,且显式连通性在密集接触和不可见内表面处仍具挑战。 ### 4. 3D部件分割(作为后处理工具) 这是第(i)类方法依赖的基础技术,包括: - **PartSLIP**
29
:利用图像-语言模型。 - **SAMPart3D**
58
、**Segment Any Mesh**
43
:将SAM/SAM 2
39
的2D掩码提升为3D。 - **P3-SAM**
35
:可提示的原生3D分割器。 - **PartField**
27
:学习用于分组特征场。 作为后处理手段,它们受限于分割质量,且无法恢复生成器已经融合的结构。 ### 5. 程序驱动与智能体资产生成(互补路线与数据来源) 这类方法通过编写程序而非几何去噪来产生部件结构化资产: - **Infinigen**
38
、**Infinite Mobility**
22
:基于手写程序化规则。 - **CAGE**
26
:从连通图生成部件框并检索几何。 - **Articulate-Anything**
19
:视觉-语言模型编写装配代码。 - **ArtiCraft**
65
:LLM驱动编码智能体以基元构建部件并通过物理关节连接;**本文首次将其作为训练数据**使用。 - **img2threejs**
14
:将参考图像重建为程序化Three.js代码。 这些路线的部件结构与关节参数在构造上正确,但几何表现力受限于基元和检索库。 ### 6. 早期结构感知生成 在扩散模型浪潮之前的工作: - **StructureNet**
36
:图网络生成部件层次。 - **SDM-NET**
10
:生成可变形部件网格。 - **SPAGHETTI**
12
:支持部件感知隐式编辑。 - **SALAD**
18
:级联扩散,从部件布局到部件几何。 这些工作证明了显式建模部件的价值,但主要在小型单类别集合上运行,而非开放域图像。 Q3: 论文如何解决这个问题? 论文通过提出 **KaiNinja** 系统性地解决了这一问题,核心在于**修改表示方式以保留部件接触面**、**重新设计双流架构以兼容任意数量部件**、以及**分阶段训练以继承预训练先验**。具体方案分为以下五个层面: —- ### 1. 表示层创新:双体积 O-Voxel 打包 现有原生生成器使用的单一体积表示无法承载部件界面,因此论文首先对表示进行扩展。 - **O-Voxel 基础**:TRELLIS.2 的 O-Voxel 在稀疏体素网格上存储几何,每个激活体素持有一个对偶顶点(dual vertex)和每轴边交叉标志,直接支持开放表面、非流形结构和 PBR 材质,无需全局有符号距离场。 - **单一体素的容量极限**:由于每个体素至多存储**一层表面**(one sheet per voxel),当两个部件接触时,其近乎平行的外表面在体素化后必然落入同一体素,导致其中一层塌陷丢失。这是一个表示容量问题,与分辨率无关。 - **双体积打包**:论文将任意对象的所有部件打包进**两个交错体积**(Stream A 与 Stream B),要求同一体积内的部件互不接触。具体通过构建**部件接触图** G (节点为部件,边按共享体素面的数量加权),然后对其进行**贪心奇环收缩**直至图变为二分图,最后用 BFS 二着色分配体积。这样,接触部件被强制分离到不同体积,每个体积内部恢复“一层表面 per 体素”原则,接触面得以完整保留。 —- ### 2. 架构层设计:双流两级级联 在双体积表示之上,论文将 TRELLIS.2 的单流两级级联(Layout Flow + Refinement Flow)扩展为**双流架构**,但两级采用不同的适应策略,因为它们的潜在分组方式不同。 - **图像条件**:冻结的 DINOv3 ViT-L/16 编码器提取图像 token,通过交叉注意力为两级提供条件,并采用**无分类器引导**(classifier-free guidance)。 #### Stage 1:布局流(Layout Flow)——决定部件结构 该阶段去噪两个体积的粗略占用布局( 16^3 稀疏结构潜在,每流 8 通道),是部件分配的关键。 - **双流权重**:每流均为预训练 Transformer(30 块、宽度 1536、12 头)的完整副本,拥有独立的输入/输出投影和时间步调制。流身份由权重本身携带,无需额外嵌入。 - **跨体积注意力**:在深度 6, 12, 18, 24, 29 处插入共享的**跨体积注意力块**(cross-volume attention block),并**零初始化**。这使得模型初始行为等价于两个独立去噪器,随后逐步学习两体积间的联合推理(例如决定接触边界位于何处)。 #### Stage 2:精化流(Refinement Flow)——保持先验不变 该阶段在已固定的占用布局上,对两流的结构化潜在(32 通道)进行细节与外观精化,任务更接近预训练目标。 - **骨干完全冻结**:直接加载 TRELLIS.2 的预训练权重,不做任何结构修改。 - **注意力范围分离**:在 30 个块中,20 个块的自注意力**仅在同一体积内**进行;剩余 10 个块(每 3 块一组)则对两体积所有 token 联合注意力。自注意力天然支持可变 token 数,因此无需改变层宽度或增加骨干参数。 - **体积嵌入**:在联合注意力块中,通过零初始化的可学习体积嵌入区分流身份。 —- ### 3. 训练策略:阶段性继承预训练先验 预训练先验仅见过整体对象,直接微调会因三个鸿沟(从未见过部件界面、从未见过半对象分布、两体积需交互)而崩溃。论文采用**分阶段、最小扰动**的训练策略。 #### 布局流的三阶段训练 1. **每体积拟合(Fit)**:从预训练单流去噪器出发,独立微调两个副本,分别仅在体积 A 和体积 B 的数据上训练。这使每流先适应“半对象+暴露接触面”的边缘分布。 2. **合并且无损(Merge)**:将两个拟合副本加载为双流 A/B。由于所有参数天然属于单流,权重可直接复用;加上零初始化的跨体积块后,合并模型初始行为精确等价于两个独立拟合去噪器。 3. **预热后联合微调(Warm up, then fine-tune)**: - **预热期**:冻结两流全部参数,仅训练跨体积注意力及其调制分支,让模型在不破坏单流先验的前提下学习协调。 - **联合微调**:解冻全部参数进行端到端训练。 此外,在联合微调中加入**不相交惩罚**(disjointness penalty):
L(ov) = E[ o_A odot o_B ], quad λ(ov) = 5
其中 $o_A, o_B ∈
0,1
$ 为解码后的软占用。该惩罚直接作用于部件结构决策层,防止两流争夺同一体素。 #### 精化流的两阶段训练 由于骨干未改动,无需每体积拟合: - **预热期**:冻结全部骨干权重,仅优化零初始化的体积嵌入。 - **完整微调**:解冻全部参数。注意力范围分离对预训练计算的扰动远小于修改流拓扑,因此该轻量策略已足够。 —- ### 4. 数据策管:多源语料与智能体数据 为训练双流,论文构建了一个包含 19,132 个对象的混合语料,来源包括: - **ArtiCraft-10K**
65
:由 LLM 驱动的 3D 创建智能体生成的资产,部件通过基元装配程序构造,标签在构造上精确无误。这是**首次将智能体生成的 3D 资产用于训练生成模型**。 - **Fusion 360**(CAD)、**PartNeXt**、**TRELLIS 数据集**(艺术家制作)。 所有对象均经过严格过滤:保留 2–32 个部件的对象,剔除严重穿插、剔除展示平面,并在打包后施加平衡过滤(防止某一流为空或接近空)。由于 O-Voxel 无场,无需水密修复或壳层膨胀,原始开放表面与材质得以保留。 —- ### 5. 推理与后处理:从体积到部件 推理时,布局流先采样两体积结构潜在,精化流填充细节,随后通过两个轻量后处理步骤得到最终部件,**全程无需分割器或掩码**。 1. **合并重复占用**:若两流在推理时仍产生重叠,比较解码后的占用。对来自不同体积的重叠连通分量,若共享体素比例超过一半且嵌入深度 ≥ 3 体素,则将较小分量移入较大分量所在体积,确保并集不变。 2. **部件提取**:冻结 VAE 将每体积解码为 O-Voxel 并提取网格。由于同一体积内部件互不接触,直接取**连通分量**即可作为独立部件。论文进一步处理解码器留下的小间隙:表面距离在 2 个体素以内的分量视为同一部件;面积小于体积总表面积 0.5% 的碎片则附加到最近部件。 —- ### 总结 简言之,论文的解决路径是:**通过双体积 O-Voxel 打包绕过单体积的部件界面表示瓶颈,通过双流两级架构实现一次前向传播生成任意数量部件,并通过分阶段训练策略将预训练的整体对象先验无损地迁移到部件级任务上**。这一方案在 Q4: 论文做了哪些实验? 论文在第4节开展了系统性的实验评估,涵盖**定量对比、效率分析、泛化测试、定性展示与消融验证**五个层面,具体如下: —- ### 1. 实验设置(Setup) **数据** - 训练集:从4个3D数据集(ArtiCraft-10K、PartNeXt、TRELLIS、Fusion 360)共采集 **19,132** 个对象,经统一打包与过滤后联合训练。 - 测试集:保留 **1,000** 个跨源对象(986个所有方法均能成功处理)。 **对比基线** 选取了部件生成各范式的代表性方法: - **TRELLIS.2@1024 + X-Part** / **Hunyuan3D-2.1 + X-Part**:先整体生成、后分割再重建的级联方案。 - **OmniPart**:基于2D掩码预规划3D边界框布局的生成方法。 - **AutoPartGen**:自回归逐部件生成。 - **PartPacker**:基于vecset潜在与SDF场的双体积打包方法。 **评价指标** - 整体对象(W)与匈牙利匹配后的部件(P)各测: - Chamfer Distance(CD,越低越好) - F-score(阈值 τ = 0.1 与 τ = 0.05 ) - 部件平均交并比(mIoU ^P ) - 失败率(Fail %):以 CDW > 0.1 定义。 —- ### 2. 与现有方法的全面对比 **部件级质量(Table 1)** 在986个共同完成的对象上,KaiNinja在**全部7项指标**上取得最优: - 相比最强的级联基线 Hunyuan3D-2.1 + X-Part,整体F-score( F(0.05)^W )提升约 **0.10**,部件F-score( F(0.05)^P )提升约 **0.09**。 - 整体Chamfer距离降低 **40%**,严格部件F-score提高 **16%**。 - 差距在严格阈值(0.05)处最大,说明优势主要体现在**精细几何与边界定位**。 **生成效率(Figure 4)** - KaiNinja在单张H100上约 **24秒/对象**(512分辨率)。 - 与PartPacker成本接近(仅高40%),但部件F-score高出 **0.20**( F(0.05)^P :0.692 vs 0.492)。 - AutoPartGen成本约为KaiNinja的 **3倍**(逐部件生成);X-Part级联因需等待整体生成并完成分割,**慢一个数量级**。 **整体对象质量(Table 2)** 一个意外发现是:KaiNinja在输出部件的同时,**整体对象 fidelity 也显著优于基线**。在相同预训练骨干与相同微调语料上: - TRELLIS.2@512 微调后 F(0.05)^W = 0.830 ; - KaiNinja 达到 **0.919**,且失败率仅 **0.7%**(对比微调骨干的1.8%及零样本的3.9%–6.8%)。 这表明双体积打包不仅是“容纳部件的容器”,更是对整体对象的一种**更优表示**。 **按数据来源细分(Table 3)** 在全部4个来源(ArtiCraft、PartNeXt、Fusion 360、TRELLIS)上,KaiNinja在所有整体/部件指标上均保持领先,未出现明显领域偏移。 **表示层的作用** 与同样采用双体积打包但基于vecset/SDF的 **PartPacker** 对比: - 整体CD( CD_W ):0.0186 vs 0.0389; - 部件CD( CD_P ):降低 **60%** 以上; - 严格部件F-score:0.692 vs 0.492。 论文将此归因于在**骨干自身的稀疏体素网格**上直接构建打包,保留了O-Voxel对开放表面、UV和PBR材质的原生支持。 —- ### 3. 泛化能力测试 **训练语料外的真实资产(Table 4)** 在95个来自 Sketchfab 与 GitHub、且**未参与任何训练/测试**的资产上: - 整体 F(0.05)^W 达到 **0.901**,领先次优方法 **0.075**。 - 部件级严格F-score( F(0.05)^P :0.753)与CD均领先,仅在宽松阈值( F(0.1)^P )下略低于带专用分割器的X-Part级联,说明外部分割器在粗容忍度下更保守,但在严格阈值下KaiNinja更优。 **外部基准 HY3D-Bench(Table 5)** 在完全独立的200对象基准上: - **整体对象**:KaiNinja在所有3项指标上第一( F(0.05)^W = 0.724 )。 - **部件级**:表现降至第四,论文归因于HY3D-Bench的部件标注**粒度更粗**。KaiNinja被训练为在接触面处精确切分,导致其部件数多于基准标签,匈牙利匹配对过度分割施加惩罚。这反映了“几何保真度最高,但分解粒度与基准惯例不完全对齐”的 trade-off。 —- ### 4. 定性结果(Figures 5–7) 论文展示了在三类对象上的视觉对比: - **测试集**(Figure 5):KaiNinja保持与Ground Truth接近的部件数量与结构;基线或出现融合(如X-Part将易拉罐拉环与罐体合并),或出现过度碎裂(如OmniPart将管束打散)。 - **训练集**(Figure 6):验证训练收敛性。 - **训练时未见的来源**(Figure 7):验证跨域泛化。 —- ### 5. 消融实验(Ablation) **双体积 vs. 三体积(Table 6 & Figure 8)** 在Stage 1占用预测层面测试: - **三体积**方案在部件F-score( F(0.05)^P :0.795 vs 0.779)上略优,连通分量数(4.73)更接近Ground Truth(5.05)。 - 但三体积存在**鲁棒性缺陷**:在1,000个对象中**13个完全失败**(双体积为0),且 **7.7%** 的对象出现某一流为空(双体积仅1.5%),每步计算量增加50%。 - 因此最终选择**双体积**以平衡保真度与鲁棒性。 **不相交惩罚 L(ov) 的作用(Table 7 & Figure 9)** - 对最终解码后的指标影响极小(各指标差异 <0.006 ),因为后处理会修正重叠。 - 但在**Stage 1布局层面**, L(ov) 将两流重叠率中位数从 **0.229降至0.184**,并将“一体积严重重复另一体积(重叠>0.5)”的对象比例从 **17.2%降至14.4%**。 - 可视化显示,无惩罚时体积B常重复体积A的表面(如整组管道、杯口边缘);有惩罚时体积B承载独立的部件。 **后处理步骤的贡献(Table 7)** - **合并重复占用(merge)**:对最终指标影响微弱,主要作为防止体积完全重复的保险。 - **重新标记与碎片附着(relabel)**:显著有效——将平均部件数从 **14.06** 降至 **5.43**(Ground Truth为5.85),mIoU ^P 从0.482提升至 **0.520**, F(0.05)^P 从0.675提升至 **0.692**。 **失败模式分析(Figure 10)** 论文诚实展示了三种典型失效: 1. **欠分割**:某一体积承载过多部件(如沙发主体全入A流,仅支脚入B流),导致接触部件融合。 2. **单体积塌陷**:B流完全为空,对象以整体输出(测试集中占0.9%)。 3. **体积重复**:两流各自生成完整对象,后处理未能完全消除薄壳重复。 —- ### 总结 实验表明,KaiNinja在**部件级精度、整体对象保真度、推理效率**三个维度上均达到或超越了现有最优水平,并通过系统的消融验证了“双体积+继承式训练”各组件的必要性与trade-off。 Q5: 有什么可以进一步探索的点? 基于论文结论与局限性部分,可进一步探索的方向包括: —- ### 1. 体积数量与表示形式的扩展 - **突破双体积限制**:当前方法受限于二分图假设,当部件密集交错时被迫合并。可探索**三体积或更多体积**的打包策略,或发展不依赖图着色收缩的替代表示。论文指出,3D接触图的色数在理论上无界,因此需研究更智能的近似算法或允许部件微小平移的” exploded layout “方式,再通过专用网络预测位移以重新组装。 - **理论层面的接触图处理**:附录B讨论了将接触图平面化以应用四色定理的不可能性。未来可探索**带权边收缩**的替代启发式,或在保持装配精度的前提下允许可控的部件间距。 —- ### 2. 显式结构与用户控制 - **部件数量与粒度的显式控制**:当前模型输出部件数由布局流隐式决定,用户无法指定。可引入**粒度条件**(如粗/中/细三级)或**指定部件数**的控制机制,使生成适应不同下游需求。 - **层次化部件结构**:现有方法输出扁平的部件集合。可扩展至**部件层次树**(如底盘→车轮→轮胎),支持更复杂的编辑与语义理解。 - **语义部件标签的联合生成**:当前模型仅做几何分离,可结合语言条件生成**带语义标签的部件**(如”车门”、”椅背”)。 —- ### 3. 训练范式与先验继承的深化 - **从头训练验证继承瓶颈**:论文推测当前某些失败模式(如体积塌陷、重复)源于预训练先验仅在未分割对象上形成。若**从头在打包体积上训练**,可能彻底消除这些限制,但需相应的计算资源与数据规模。 - **向其他骨干的迁移**:本文继承自 TRELLIS.2 的 O-Voxel 表示。未来可将相同的” fit-merge-warmup “继承配方应用于**其他原生3D生成器**(如 Hunyuan3D、TripoSG、Direct3D),验证其通用性。 —- ### 4. 动态与物理感知生成 - **可动部件与关节生成**:训练数据中的 ArtiCraft-10K 包含物理关节信息,但 KaiNinja 目前仅生成静态分离网格。未来可扩展为**预测部件间的关节类型与参数**(如铰链、滑轨),直接输出可仿真、可驱动的装配体。 - **物理合理性约束**:在流匹配目标中加入**碰撞避免**、**连接稳定性**或**运动学可行性**惩罚,使生成结果不仅几何正确,且满足物理规律。 —- ### 5. 鲁棒性提升与失败模式修复 论文识别了三种反复出现的失败模式,每类均可作为直接的研究点: - **欠分割(undersegmentation)**:当某一体积承载了过多部件时发生。可通过**体积容量正则化**或**平衡损失**强制两流分配更均衡的表面积/体积。 - **单体积塌陷**:某一流完全为空。可在布局流中引入**空体积惩罚**或**最小占用约束**。 - **体积重复(duplicated volumes)**:两流各自生成完整对象。除了当前的不相交损失 L(ov) ,可探索**显式对比损失**或**体积互信息最小化**,从表示层面鼓励两流互补而非冗余。 —- ### 6. 下游任务与交互式应用 - **部件级编辑与重纹理**:当前仅展示了几何分离,未来可在**保持其他部件不变**的条件下,对单一部件进行风格迁移、材质编辑或形状变形。 - **骨骼绑定与动画**:将生成的分离部件直接输入自动绑定管线,验证其**拓扑清洁度**与**关节轴预测**的便利性。 - **跨场景部件复用库**:建立由 KaiNinja 生成的部件资产库,支持组合式场景构建。 —- ### 7. 数据策略与自动化标注 - **智能体生成数据的规模化**:本文首次使用 ArtiCraft-10K 进行训练,未来可探索**更大规模的程序/智能体生成数据**,结合主动学习或课程学习策略。 - **多粒度标注对齐**:HY3D-Bench 实验显示,不同数据集对”部件”的粒度定义不同(如椅子座板与靠背是否合并)。可研究**自适应粒度对齐**或**多标准联合训练**,减少对特定标注约定的敏感。 —- ### 8. 多模态条件生成 - **文本/草图驱动的部件修改**:在图像条件之外,引入**局部文本提示**(如”把车轮换成越野轮胎”)或**部件级草图**,实现细粒度的可控生成。 - **多视角一致性下的部件推理**:当前依赖单张图像,可扩展为**稀疏多视图输入**,以更好恢复被遮挡的接触面与内部结构。 Q6: 总结一下论文的主要内容 这篇论文提出了 **KaiNinja**,一种将最先进的原生单图像3D生成器 **TRELLIS.2** 扩展到**部件级别**的方法,能够在无需任何2D掩码、3D分割器或逐对象优化的条件下,从单张RGB图像直接生成由独立、自包含子网格组成的3D资产。 ### 1. 研究背景与核心问题 当前主流的原生3D生成器(如 TRELLIS.2、Hunyuan3D 等)均输出**单一融合网格**,而下游应用(如部件编辑、骨骼绑定、物理仿真、跨场景复用)要求对象具有明确的部件结构。现有解决方案存在显著缺陷: - **先整体生成再分割**(如 X-Part 级联)速度极慢,且部件边界受限于外部分割网络的精度,无法纠正生成阶段已融合的结构; - **基于掩码/边界框预规划**(如 OmniPart)在3D推理前即固定布局,缺乏灵活性; - **自回归逐部件生成**(如 AutoPartGen)计算成本随部件数 N 线性增长; - **每部件独立潜在体积**(如 PAct)将计算量乘以 N ,且对最大部件数设限。 更根本的是**表示层瓶颈**:TRELLIS.2 采用的 **O-Voxel** 表示在每个激活体素中至多存储**一层表面**(one sheet per voxel)。当两个部件接触时,其近乎平行的外表面必然落入同一体素,导致其中一层塌陷——这是一个**容量极限**,与分辨率无关。因此,任何基于单一体积的架构都无法表示部件接触界面。 ### 2. 核心方法 #### 2.1 双体积 O-Voxel 表示 论文将对象的所有部件**打包进两个互补的体积**(Stream A 与 Stream B)。通过构建**部件接触图** G (节点为部件,边权重为共享体素面数量),对图进行贪心奇环收缩直至变为二分图,再用 BFS **二着色**分配体积。这保证了: - 同一体积内的部件**互不接触**; - 接触部件的界面被分离到不同体积,单个体素的“一层表面”限制不再构成问题; - 每个体积解码后可通过**连通分量分析**直接提取部件,无需分割器。 #### 2.2 双流两级架构 KaiNinja 继承 TRELLIS.2 的两级级联,但针对不同阶段的潜在分组特性采用不同适配策略: - **Stage 1(布局流)**:决定部件结构与体积分配。每流拥有独立的 Transformer 权重(30块、宽度1536),在深度 6,12,18,24,29 处插入**零初始化的跨体积注意力块**。初始时模型行为等价于两个独立去噪器,随后逐步学习联合推理。 - **Stage 2(精化流)**:在固定占用布局上进行几何与外观精化。**完全保留**预训练 TRELLIS.2 权重,仅通过**注意力范围分离**实现双流:20个块的自注意力仅在同一体积内进行,10个块(每3块一组)对两体积联合注意力。流身份由零初始化的可学习体积嵌入区分。此设计不增加骨干参数,不改动预训练计算图。 #### 2.3 分阶段训练策略 为弥合预训练先验(仅见过整体对象)与部件级任务之间的三个鸿沟(未见部件界面、未见半对象分布、两体积需交互),论文提出最小扰动的继承配方: - **布局流**:(i) 独立拟合——两流分别单独微调以适应各自边缘分布;(ii) 合并——直接加载为双流,跨体积块零初始化;(iii) 预热——冻结流参数,仅训练跨体积块;(iv) 联合微调——解冻全部参数,并附加不相交惩罚:
L(ov) = E[ o_A odot o_B ], quad λ(ov)=5
防止两流争夺同一体素。 - **精化流**:仅需两阶段——冻结预热(仅优化体积嵌入)后联合微调。注意力范围分离对预训练先验的扰动远小于修改流拓扑。 #### 2.4 数据 训练语料包含 19,132 个对象,来自四个数据源,其中包括 **ArtiCraft-10K**——由 LLM 驱动智能体生成的资产。这是**首次将智能体生成的3D资产用于训练生成模型**,其部件标签由构造程序精确给出,不含标注噪声。 ### 3. 实验结果 论文在 986 个跨源测试对象上进行了系统评估: - **部件级质量**:KaiNinja 在全部 7 项指标上达到最优。相比最强基线(Hunyuan3D-2.1 + X-Part),严格整体 F-score( F(0.05)^W )提升约 0.10,严格部件 F-score( F(0.05)^P )提升约 0.09;整体 Chamfer 距离降低 **40%**,严格部件 F-score 提高 **16%**。 - **生成效率**:在 H100 上约 **24 秒/对象**,成本接近 PartPacker(比它高40%),但部件质量大幅领先;比 AutoPartGen 快约 3 倍,比分割级联方法快一个数量级。 - **整体对象保真度的意外提升**:在相同预训练权重与相同微调语料上,KaiNinja 的整体 F_(0.05)^W (0.919)显著优于直接微调的 TRELLIS.2@512(0.830),失败率仅 0.7%。这表明双体积打包不仅容纳部件,更是对整体对象的**更优表示**。 - **泛化测试**:在训练语料外的 Sketchfab/GitHub 资产以及外部基准 HY3D-Bench 上,整体对象指标保持领先;在 HY3D-Bench 的部件指标上因粒度差异(模型切分更细)而略低于分割级联基线。 ### 4. 主要贡献 - **首个原生部件级扩展**:将 TRELLIS.2 无损扩展至部件级别,无需掩码、分割器或边界框,生成速度保持恒定且不随部件数增加。 - **表示层创新**:论证了单体积无法承载部件界面的必然性,并提出基于 O-Voxel 的**双体积打包**作为最小补救方案,完整保留开放表面、UV 与 PBR 材质支持。 - **训练方法论**:提出“拟合-合并-预热-微调”的分阶段继承配方,使预训练的整体对象先验有效迁移至部件级任务。 - **新型数据应用**:首次利用智能体生成的 3D 资产(ArtiCraft-10K)训练生成模型,其部件监督精确无噪声。 ### 5. 局限性与未来工作 - **双体积假设的边界**:当部件密集交错导致接触图远离二分图时,需强制合并部件,造成欠分割。论文指出 3D 接触图的色数理论上无界,固定体积数无法保证通用性。 - **残留失败模式**:包括单体积塌陷(某一流为空,约0.9%测试对象)、体积重复(两流各自生成完整对象)以及薄壳逃逸后处理合并的情况。 - **未来方向**:探索三体积或更多体积的鲁棒打包、显式控制部件数量与粒度、预测可动关节与物理参数、将继承配方迁移至其他生成骨干,以及探索从头在打包数据上训练以彻底消除继承带来的限制。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Ruihan Yu,Lian Fu,Muyao Niu,Zheng-hui Huang,Yu-Ju Tsai,Sho Kuno,Fengbo Lan,Yonghao Yu,Erwin Wu,Ming-Hsuan Yang,Kaipeng Zhang,Zhixiang Wang
Categories:
PDF URL: https://arxiv.org/pdf/2609.15659.pdf
Arxiv URL: https://arxiv.org/abs/2609.15659
Arxiv ID: 2609.15659
CoolPaper URL: https://papers.cool/arxiv/2609.15659
Published: 2026-09-16T01:38:57.229Z
Updated: 2026-09-16T01:38:57.229Z
15. HazardAuditor: From Executable Threats to Safer Computer-Use Agents
Abstract:Computer-use agents increasingly interact with browsers, terminals, file systems, and external services, introducing safety risks that emerge through runtime behavior rather than generated content alone. Existing guard models target static prompts and responses and are poorly suited to agent execution; existing executable safety platforms produce evaluation verdicts rather than the normalized supervision a guard model needs to learn across heterogeneous agent frameworks. We introduce HazardAuditor, an execution-grounded framework that closes both gaps. Its infrastructure runs heterogeneous agents (Claude Code, Codex, Hermes, and OpenClaw) in controlled environments and normalizes their interactions into a canonical event representation for cross-framework supervision. We further observe that token-level post-training objectives create a structural mismatch for generative guards, causing longer rationales to dominate gradient updates. Guard Policy Optimization (GuardPO) addresses this by converting deterministic safety outcomes into sequence-level advantages and normalizing rationale and verdict regions, making the safety decision the effective unit of optimization. Across multiple benchmarks and heterogeneous computer-use systems, HazardAuditor improves accuracy by up to 16.5 percentage points over the strongest prior guard. Code, models, and evaluation artifacts will be available at this https URL.
中文摘要
摘要:计算机使用代理越来越多地与浏览器、终端、文件系统和外部服务进行交互,这引入了通过运行时行为而非仅生成内容产生的安全风险。现有的防护模型针对静态提示和响应,且不太适用于代理执行;现有的可执行安全平台生成评估结论,而非防护模型在异构代理框架中学习所需的标准化监督。我们提出了 HazardAuditor,一种基于执行的框架,弥合了这两个差距。其基础设施在受控环境中运行异构代理(Claude Code、Codex、Hermes 和 OpenClaw),并将它们的交互标准化为规范事件表示,以实现跨框架监督。我们进一步观察到,基于 token 的后训练目标对生成型防护模型造成结构性不匹配,导致较长的推理在梯度更新中占主导地位。防护策略优化(Guard Policy Optimization,GuardPO)通过将确定性安全结果转换为序列级优势,并对推理和结论区域进行规范化,使安全决策成为有效的优化单元,从而解决了这一问题。在多个基准测试和异构计算机使用系统中,HazardAuditor 的准确率较最强的现有防护提升了最多 16.5 个百分点。代码、模型和评估资料将可在此 https URL 获取。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*计算机使用型智能体(computer-use agents)在运行时的安全防护问题\*\*,具体聚焦于现有方法在\*\*监督数据来源\*\*与\*\*训练目标设计\*\*两个层面的根本性缺陷。 --- ### 1. 执行行为监督的归一化缺口 现有的安全防护模型(guard models)主要针对静态的提示(prompt)与响应(response)进行内容审核,难以适应智能体在运行时的动态行为特征。智能体的安全风险往往通过多步骤的工具调用、环境交互与状态变迁 emergently 体现,而非仅体现在生成的文本内容中。 尽管已有可执行安全平台(executable safety platforms)能够评估智能体在真实环境中的行为,但这些平台仅输出离散的评估裁决(evaluation verdicts),其日志格式因框架而异(如 Claude Code、Codex、Hermes、OpenClaw 等),\*\*缺乏统一的、可用于训练的监督信号\*\*。这导致: - 无法将异构框架中的执行轨迹转化为单一防护模型可消费的跨框架监督数据; - 现有基于轨迹训练的防护模型(如 BraveGuard)仍局限于单一框架的数据管道,难以泛化。 论文通过构建可执行安全基础设施,将异构智能体的交互归一化为\*\*规范的事件表示(canonical event representation)\*\*,涵盖用户输入、智能体输出、工具调用及参数、环境观察等,从而把可执行安全测试转化为可跨框架复用的行为监督数据源。 --- ### 2. 生成式防护模型训练目标的结构性错配 当前主流的防护模型训练范式为监督微调(SFT),其优化目标为\*\*token 级别的模仿损失\*\*。然而,对于生成式防护模型(generative guards)而言,其操作单元是一个完整的\*\*序列级安全决策\*\*(即对整条轨迹给出安全/不安全的二元裁决)。这种设计导致了严重的结构性错配: - 在标准 token 级优化目标下,响应中包含的推理过程(rationale)越长,其在梯度更新中积累的权重越大; - 但每条响应本质上只对应一个确定性安全决策,不应因其解释长度不同而获得不同的优化权重。 为纠正这一错配,论文提出 \*\*Guard Policy Optimization (GuardPO)\*\*。该方法将确定性的安全结果转换为\*\*序列级优势(sequence-level advantages)\*\*,并在响应级别分别对推理区域(rationale)与裁决区域(verdict)进行归一化聚合,使得\*\*安全决策而非生成的解释 token 数量成为有效的优化单位\*\*。形式化地,GuardPO 最小化如下目标:
L(GuardPO) = (1) / (N) ∑(i ∈ B) [ Mi(R_i) + λ(ver) M_i(V_i) ]
其中 M_i(·) 表示区域内 token 损失的均值, R_i 与 V_i 分别对应第 i 条响应的推理 token 集合与裁决 token 集合。该设计具有**长度不变性(length invariance)**:复制推理区域 token 不会改变其损失贡献,从而消除了 rationale 长度对梯度更新的支配性影响。 —- ### 总结 论文将上述两个组件整合为 **HazardAuditor**,一个基于执行行为的运行时安全防护框架。其核心贡献在于: - 通过规范化的跨框架事件表示,解决了**“智能体实际做了什么”**的行为证据获取问题; - 通过 GuardPO,解决了**“如何让生成式防护模型以安全决策为单位进行优化”**的训练目标对齐问题。 实验表明,该框架在异构智能体系统与多个外部基准上,较最强基线提升最高达 **16.5 个百分点**的准确率。 Q2: 有哪些相关研究? 论文将相关研究划分为两大主线:**可执行智能体安全(Executable Agent Safety)**与**防护模型及安全后训练(Guard Models and Safety Post-Training)**。 —- ## A. 可执行智能体安全 该方向强调安全风险通过工具使用与环境交互动态表达,而非仅体现在静态文本中。 - **AgentDojo** 提供可扩展环境,用于评估智能体消费不可信工具输出时的提示注入攻击与防御。 - **AgentHarm** 研究工具使用智能体是否能够执行明确有害的多步目标。 - **SafeArena** 将可执行评估扩展至自主网络智能体,通过现实网站交互研究故意误用行为。 - **DTap** 构建大规模交互式红队平台,覆盖异构智能体框架与模拟服务。 - **Vera** 在隔离环境中实例化可执行安全案例,运行包括 OpenClaw、Hermes、Codex 与 Claude Code 在内的异构智能体,并利用工具调用证据与可观察环境状态验证行为。 - **ATBench** 构建包含异构工具池与延迟风险触发器的多样化智能体轨迹,强调扩展交互与环境依赖行为。 - **AgentHazard** 聚焦“组合风险”:单独合理的操作在特定上下文中组合成有害目标,揭示安全性依赖于动作组合、时间上下文与环境反馈。 **与 HazardAuditor 的关系**:上述工作确立了执行过程作为安全证据的核心来源,但现有平台仅输出评估裁决,其日志未归一化为通用模式。HazardAuditor 通过定义**规范事件模式(canonical event schema)**与框架适配器,将异构执行证据转化为单一防护模型可消费、可跨框架复用的监督接口。 —- ## B. 防护模型与安全后训练 ### 1. 通用内容审核防护模型 - **Llama Guard** 将内容审核形式化为基于可配置风险分类法的生成式安全分类任务。 - **WildGuard** 联合预测提示有害性、响应有害性及拒绝行为。 - **Qwen3Guard** 扩展生成式审核至多语言安全判断,并提供流式变体以支持增量检测。 - **YuFeng-XGuard** 生成结构化风险评估与自然语言解释,暴露更丰富的中间信号。 - **SingGuard-NSFA** 结合生成式推理与轻量级分类头,用于操作风险检测。 **局限性**:这些模型的监督主要围绕文本交互组织,而非基于工具介导的执行行为。 ### 2. 面向智能体的运行时护栏 - **GuardAgent** 将用户指定的安全需求翻译为对智能体动作的可执行检查。 - **ShieldAgent** 对动作历史进行显式安全策略推理,并执行可验证的策略检查。 - **AgentDoG** 将智能体安全形式化为对动作-观察轨迹的细粒度诊断。 - **BraveGuard** 从真实计算机使用轨迹中提取监督,使通用防护模型骨干适应智能体行为;但其训练仍基于单一框架数据管道与监督微调(SFT)。 **与 HazardAuditor 的关系**:现有轨迹感知护栏要么缺乏跨框架统一表示,要么仍依赖 token 级模仿目标。HazardAuditor 同时填补**跨框架行为监督**与**决策级优化目标**两个缺口。 ### 3. 安全后训练方法 - **Safe RLHF** 等 broader 方法 通过人类反馈优化底层语言模型的策略行为,直接调整模型生成内容。 **与 HazardAuditor 的区别**: Safe RLHF 类方法优化的是语言模型本身的行为策略;而 **Guard Policy Optimization (GuardPO)** 解决的是生成式防护模型的独特优化问题——其操作目标是**安全决策**,但标准 token 级目标按生成 token 数量分配优化权重,导致推理长度主导梯度更新。GuardPO 将确定性安全结果转换为序列级优势,并在响应级别归一化推理与裁决区域,使**安全决策而非解释 token 数量**成为有效优化单位。 Q3: 论文如何解决这个问题? 论文通过构建 **HazardAuditor** 框架系统性地解决上述问题,其核心由**可执行安全监督基础设施**、**生成式防护模型初始化**与**Guard Policy Optimization (GuardPO)** 三部分协同组成。整体流程如图 1 所示:首先在受控环境中执行异构智能体并归一化交互轨迹,随后通过两阶段后训练(SFT 冷启动 + GuardPO 优化)得到可直接部署的生成式运行时防护模型。 —- ### 1. 可执行安全监督基础设施 该基础设施旨在将异构智能体框架的执行日志转化为统一的、可用于训练监督的行为证据。 #### 规范事件表示(Canonical Event Representation) 对于在状态环境 E 中使用工具集 T 运行的智能体,论文定义**安全案例**为:
σ = langle g, s0, V_g rangle
其中 g 为任务与安全相关目标, s_0 为初始环境状态, V_g 为可选的可观察执行证据验证器。在观察点 m 处,可用的执行轨迹为:
τ(1:m) = (e_1, …, e_m)
每个事件 e_k 被归入以下四类之一:
e_k ∈ U(u_k),, A(a_k, r_k),, T(nu_k, α_k),, O(o_k)
- U(uk) :用户消息 - A(a_k, r_k) :智能体响应及框架暴露的推理 r_k (若不可获得则置 ∅ ) - T(nu_k, α_k) :工具调用及其参数 - O(o_k) :环境观察 #### 跨框架适配器 针对 Claude Code、Codex、Hermes 与 OpenClaw 四种异构框架,论文设计了**框架专属适配器**,将各框架的原生日志映射到上述共享模式中。该过程保留安全相关的执行语义(如工具调用名称、参数值、环境反馈),同时移除非语义元数据(如时间戳),从而使单一防护模型无需格式调整即可消费所有框架的轨迹。 #### 行为-内容区分的标注协议 标注标签 y ∈ 0, 1 ( 0 为安全, 1 为不安全)关注**智能体行为**而非仅观察到的风险内容。具体协议规定: - 仅观察恶意指令或敏感信息不构成不安全; - 若智能体实际尝试或执行未授权/有害动作、泄露敏感信息、产生可操作的恶意产物,或实质推进不安全目标,则标记为不安全。 该协议确保防护模型学习区分”流经观察的风险上下文”与”智能体主动发起的不安全动作”。 —- ### 2. 生成式防护模型学习(SFT 冷启动) 在获得归一化轨迹后,论文首先通过监督微调(SFT)使模型学习推理格式与安全策略。 #### 输入序列化 对于观察到的轨迹 τ(1:m) ,先进行序列化:
x = Serialize(τ(1:m))
序列化后的证据被置于显式分隔符内,标记为不可信输入,以防止轨迹中的指令被误解为对防护模型的命令。 #### 输出格式 防护模型 πθ 生成包含审计分析与确定性二元裁决的结构化响应:
z = [z(rat);, z(ver)] = langleanalysisrangle ·s langle/analysisrangle langlelabelranglesafe,|,unsafelangle/labelrangle
其中 z(rat) 为支持决策的证据分析, z(ver) 为终端裁决,为下游控制器提供可审计且确定性的接口。 #### 带权 Token 级损失 SFT 目标为对目标响应 z^star 的 assistant token 计算交叉熵。由于裁决部分仅占响应的极少 token,论文对最终 K_(ver) 个目标 token 进行上采样:
L(SFT) = -∑(t=1)^(L) wt log πθ(z^start mid x, z^star(<t))∑(t=1)^(L) w_t
其中 w_t = ω(SFT) (当 t 属于最后 K(ver) 个 token)否则 w_t = 1 。实验中取 K(ver) = 12 , ω_(SFT) = 4 。 —- ### 3. Guard Policy Optimization (GuardPO) SFT 使模型掌握格式与策略,但其 token 级模仿目标与防护模型的**操作单元(序列级安全决策)**之间存在结构性错配。GuardPO 专门纠正这一错配。 #### 问题:Token 级均值的结构性错配 在标准 token 均值优化下:
L(token) = ∑_i ∑(t=1)^(Li) ell(i,t)∑i L_i
响应中的推理 rationale 越长,其在批次损失中占据的聚合权重越大,然而每条响应本质上只对应**一个**安全决策。 #### 决策级结果与序列优势 对于输入 x_i ,从滚动策略 π(roll) 采样响应 z_i 。确定性解析器返回 y_i ∈ 0, 1, bot ( bot 为格式错误)。奖励定义为:
Ri = +1, & y_i = y_i -1, & y_i ∈ 0,1,; y_i ≠ y_i -γ, & y_i = bot
其中 γ = 1.25 。对于包含 N 条响应的全局批次 B ,计算平均奖励 R(B) = (1) / (N)∑(i ∈ B) R_i ,并分配序列优势:
A_i = R_i - R(B)
该优势被**广播**至响应 i 的所有有效 token。 #### 裁剪 Token 级更新 令 π(old) 为当前更新的锚定策略。对 token z(i,t) 计算重要性采样比:
rho(i,t) = πθ(z(i,t) mid x_i, z(i,<t))π(old)(z(i,t) mid xi, z(i,<t)), quad rho(i,t) = clip(rho(i,t), 1-ε, 1+ε)
参照 CISPO 的裁剪重要性加权原则,token 损失为:
ell(i,t) = -sg(rho(i,t)) , Ai log πθ(z(i,t) mid x_i, z(i,<t))
其中 ε = 0.1 , sg(·) 为停止梯度算子。 #### 响应级归一化(核心创新) GuardPO 的关键在于**如何在响应内部聚合 token 损失**。设 Vi 为响应 i 的最终 K(ver) 个有效 token, R_i 为前置的 rationale token。定义区域内平均损失:
Mi(S) = (1) / (|mathcalS)| ∑(t ∈ S) ell(i,t), quad M_i(∅) = 0
GuardPO 最小化:
L(GuardPO) = (1) / (N) ∑(i ∈ B) [ M_i(R_i) + λ(ver) Mi(V_i) ]
实验中取 K(ver) = 12 , λ(ver) = 2 。 该设计确保:**每条响应向总梯度贡献一个归一化的 rationale 项与一个归一化的 verdict 项**,与 rationale 的 token 长度无关。因此,优化的有效单位变为**安全决策**,而非生成的解释 token 数量。 #### 长度不变性(Length Invariance) 论文证明 GuardPO 具有可证明的长度不变性: **命题 1**:对于固定响应 i ,设 R_i^((q)) 为将其 rationale 中每个元素精确复制 q > 0 次得到的多重集(即 |R_i^((q))| = q|R_i| )。则该响应对 L(GuardPO) 的贡献不变:
Mi(R_i^((q))) + λ(ver) Mi(V_i) = M_i(R_i) + λ(ver) M_i(V_i)
而在标准 token 均值目标下,复制 rationale token 会增加 L_i 与响应 i 在批次中的权重。 —- ### 4. 整体训练与部署流程 HazardAuditor 的训练分为两个阶段: 1. **阶段 1:SFT 冷启动** 使用归一化的执行轨迹与现有智能体安全数据,通过上述带权 SFT 目标训练模型,使其掌握输出格式与基本安全策略。 2. **阶段 2:GuardPO 优化** 在 SFT 检查点基础上,通过 GuardPO 进行决策级对齐。利用确定性解析器获得二元结果,计算序列优势,并在响应级归一化 rationale 与 verdict 损失,实现以安全决策为单位的策略优化。 部署时,HazardAuditor 接收完整的标准化轨迹(或前缀保留截断后的轨迹),通过贪心解码生成可审计的分析与确定性二元裁决,**无需调用外部裁判模型**,可直接支持下游控制器的实时干预。 Q4: 论文做了哪些实验? 论文围绕**HazardAuditor** 开展了系统的实验验证,涵盖**跨异构智能体执行诊断**、**外部基准迁移**、**消融分析**以及**部署效率权衡**等多个维度。具体实验内容如下: —- ### 1. 实验设置 #### 训练配置 - **初始化模型**:Qwen3Guard-Gen-8B - **阶段 1(SFT)**:全参数监督微调 10 个 epoch,输入预算 16K token,全局批次大小 16,AdamW 优化器,学习率 5 × 10^(-6) ;超长轨迹采用**前缀保留截断**(prefix-preserving truncation)。 - **阶段 2(GuardPO)**:在选定 SFT 检查点上进行 1 个虚拟 epoch 的策略优化,学习率 2 × 10^(-7) ,每提示词 8 条采样响应,全局批次 32 个提示词/256 条响应。 #### 评估基准 实验在五个互补来源上进行: | 基准 | 核心特征 | |:—-|:—-| | **CUA-EXEC**(自建) | 跨框架平衡诊断集,含 Claude Code、Codex、Hermes、OpenClaw 各 200 条轨迹(安全/不安全各 100),用于评估跨异构智能体的运行时安全判断能力 | | **AgentHazard** | 关注单独合理的操作通过组合形成有害目标的风险 | | **ATBench** | 强调扩展交互、异构工具池、延迟风险触发及环境依赖行为 | | **R-Judge** | 覆盖多样化的智能体风险与交互模式 | | **ASSE-Safety** | 智能体安全与安全性评估的综合基准 | 此外,附录还补充了一个**非类别平衡的固定测试子集**(228 条轨迹)以及 **NSFA-Query-Multilingual** 的查询级迁移测试。 #### 对比方法 实验对比了三大类别的方法: - **前沿 LLM 裁判**:GPT-5.2、Claude-Sonnet-4.6、Gemini-3-Flash/Pro、Qwen3-235B-A22B 等; - **通用防护模型**:LlamaGuard3-8B、Qwen3Guard-Gen-8B、NemoGuard、YuFeng-XGuard 等; - **面向智能体的轨迹感知护栏**:AgentDoG(多种尺寸)、ShieldAgent、BraveGuard-Qwen3-Guard-8B 等。 —- ### 2. 主要实验结果 #### (a) 跨异构计算机使用智能体的执行诊断(CUA-EXEC) 在平衡 cross-agent 诊断集上,HazardAuditor 在所有四个框架上均取得最佳表现: | 框架 | 相比 BraveGuard 的准确率提升 | HazardAuditor 最终准确率 | |:—-|:—-|:—-| | Claude Code | +12.5 pp | **94.0%** | | Codex | +4.0 pp | **95.5%** | | Hermes | +9.5 pp | **86.5%** | | OpenClaw | +16.5 pp | **87.5%** | GuardPO 在 SFT 基础上进一步提升:在 Claude Code 上从 82.0% 提升至 94.0%,在 Hermes 上从 75.0% 提升至 86.5%,在 OpenClaw 上从 74.0% 提升至 87.5%。 #### (b) 外部轨迹分布上的迁移能力(AgentHazard) AgentHazard 使用四种不同的基础模型后端生成执行轨迹。HazardAuditor 在 **GPT-5.5、Claude Sonnet 4.6、Qwen3-235B-A22B** 后端上取得最高准确率;在 **Claude Sonnet 4.6、Gemini 3.1 Pro、Qwen3-235B-A22B** 上取得最高 F1。 GuardPO 在所有四个后端上均提升了 F1: - GPT-5.5:82.24% → 84.31% - Claude Sonnet 4.6:83.03% → 85.98% - Gemini 3.1 Pro:93.28% → 95.07% - Qwen3-235B-A22B:92.30% → 92.51% 值得注意的是,在 GPT-5.5 后端上,HazardAuditor 准确率最高,但 BraveGuard 保持更高的召回率与 F1,表明仍存在后端特定的校准空间。 #### (c) 跨基准迁移(附录扩展结果) | 基准 | HazardAuditor 表现 | 关键观察 | |:—-|:—-|:—-| | **ASSE-Safety** | 准确率 **91.5%**,F1 **91.5%** | 最佳表现 | | **ATBench** | 准确率 **88.4%**(最高),F1 **88.3%** | 准确率比最强基线高 0.8 pp,但 F1 略低于部分模型 | | **R-Judge** | 准确率 89.6%,F1 89.5% | SFT 初始化略高(准确率 90.4%,F1 90.4%) | 综合三个外部基准,HazardAuditor 的**最低 F1(worst-case F1)为 88.3%**,高于 HazardAuditor-SFT 的 86.2% 和最佳先前护栏的 80.7%。多个现有护栏呈现“高精度-低召回”极端分布(如 Qwen3-Guard 在 ATBench 上 100% 精度但仅 10.8% 召回),而 HazardAuditor 的精度-召回差距始终低于 **1.1 个百分点**。 —- ### 3. 消融与机制分析 #### GuardPO 来源效应分析(Appendix C) - GuardPO 在**执行密集型**的 CUA-EXEC 上提升最大(Macro-F1 **+10.68** 个百分点)。 - 在外部轨迹基准上提升幅度较小(AgentHazard +1.76,ASSE-Safety +0.80,ATBench +2.10),在 R-Judge 上则轻微下降(-0.90)。 - 这表明 GuardPO 的决策级优化在**行为证据最丰富的执行轨迹**上收益最显著。 #### 固定测试子集验证(Appendix F) 在 228 条非平衡跨框架固定测试集上: - GuardPO 将总体准确率从 76.75% 提升至 **88.16%**,Macro-F1 从 76.75% 提升至 **87.76%**。 - 提升主要来自 Claude Code(+12.82)、Hermes(+14.98)与 OpenClaw(+12.84);Codex 上则从 90.78% 微降至 88.86%,说明改进并非均匀分布。 #### 查询级迁移测试(Appendix D) 在 NSFA-Query-Multilingual 的 6,400 条平衡查询子集上: - 取得 **88.89%** 准确率与 **88.88%** Macro-F1。 - 按风险领域分析不安全召回率:恶意代码(96.54%)与危险操作(95.14%)表现强劲;敏感信息(69.22%)与资源滥用(42.95%)较低,暴露了当前模型的能力边界。 —- ### 4. 效率与部署权衡(Appendix G) 为降低生成式推理的延迟,论文冻结 HazardAuditor 主干并训练轻量级分类头: | 变体 | Macro-F1 | 安全召回 | 平均推理延迟 | 加速比 | |:—-|:—-|:—-|:—-|:—-| | Linear | 47.47% | 10.28% | ~306 ms | ~10.3× | | MLP-64 | 69.63% | 41.11% | ~304 ms | ~10.3× | | MLP-128 | 67.59% | 37.94% | ~304 ms | ~10.3× | | MLP-256 | 63.93% | 31.62% | ~304 ms | ~10.3× | | **生成式 HazardAuditor** | **88.12%** | **88.14%** | **~3138 ms** | **1×** | 轻量级头 Q5: 有什么可以进一步探索的点? 基于论文内容与实验观察,以下方向值得进一步探索: —- ### 1. 从二元决策到细粒度风险分类的 GuardPO 扩展 当前 GuardPO 的奖励函数 R_i 基于确定性二元结果 +1, -1, -γ 设计。未来可将其扩展至**连续或分层奖励结构**,支持多类风险等级(如 low / medium / critical)或连续安全评分。这要求重新设计序列优势的计算方式,例如将硬分类准确率替换为基于风险严重程度的加权损失,使防护模型输出更丰富的安全信号供下游控制器进行差异化干预。 —- ### 2. 在线与持续学习环境中的防护策略更新 HazardAuditor 当前依赖离线收集的执行轨迹进行训练。未来可探索**在线 GuardPO(Online GuardPO)**,使防护模型在智能体与新环境持续交互的过程中实时更新策略。这需要解决以下问题: - 如何处理非平稳的环境分布与新型工具调用模式; - 如何设计 replay buffer 或正则化项,防止在流式数据上优化时遗忘跨框架的泛化能力; - 如何控制在线更新过程中的策略漂移,确保二元裁决接口的稳定性。 —- ### 3. 多模态计算机使用智能体的安全监督 当前规范事件表示 e_k ∈ U, A, T, O 主要针对文本与结构化工具交互。随着计算机使用智能体扩展至图形界面(GUI)操作、视觉观察与音频反馈,需将事件模式拓展至多模态:
ek^(μlti) ∈ U(u_k), A(a_k, r_k), T(nu_k, α_k), O(img)(ok^(img)), O(audio)(ok^(audio))
这要求重新设计归一化模式与序列化协议,并研究视觉-语言证据在生成式防护模型中的注意力分配与推理格式。 —- ### 4. 针对防护模型本身的对抗鲁棒性研究 论文未深入探讨针对 guard model 的对抗攻击。攻击者可能通过**轨迹污染**、**提示注入**或**对抗性工具参数**操纵防护模型的推理过程 z(rat) ,使其产生错误的安全裁决。未来可: - 构建针对 HazardAuditor 的红队基准,评估其在对抗性轨迹下的脆弱性; - 在 GuardPO 中引入对抗训练目标,例如最小化最坏情况下的序列优势损失:
minθ max(δ ∈ Delta) L(GuardPO)(θ; x + δ)
其中 δ 为输入轨迹上的扰动; - 研究 rationale 区域的对抗检测与证据链验证机制。 —- ### 5. 长程时序依赖与分层推理 某些安全风险(如缓慢数据渗透、多阶段权限提升)仅在**长周期交互**后显现。当前 16K token 的上下文窗口与线性序列化可能不足以捕捉这类长程依赖。未来可引入: - **分层注意力机制**:在工具调用级别与原始 token 级别之间建立层次化表示; - **事件图网络(Event Graph Networks)**:将轨迹 τ(1:m) 建模为异构图,显式编码动作-观察之间的因果与依赖关系; - **状态记忆模块**:维护跨会话的环境状态摘要,辅助检测延迟触发的风险。 —- ### 6. 结合人类偏好的 GuardRLHF 当前 Ri 完全由确定性规则与解析器输出决定,难以处理需要微妙价值判断的边界案例。未来可引入**人类反馈或更强裁判模型的偏好信号**,构建 GuardRLHF: - 收集人类对 rationale 质量与裁决正确性的序数偏好; - 将偏好转化为 Bradley-Terry 模型或类似排序损失,替代或补充 A_i ; - 优化更 nuanced 的安全边界,特别是在“观察风险内容但未执行”与“执行了灰色地带操作”之间的模糊区域。 —- ### 7. 轻量级部署与概率质量校准 附录 G 显示,冻结主干的轻量级分类头(Linear / MLP)虽将延迟降低约 10 倍,但 Macro-F1 显著下降(最低至 47.47%)。未来可探索: - **知识蒸馏**:以完整生成式 HazardAuditor 为教师,将决策边界与 rationale 推理模式蒸馏至轻量级判别模型; - **投机解码(Speculative Decoding)**:利用小型 draft 模型加速生成式防护模型的自回归推理; - **概率校准**:当前 MLP 头的 AUROC 与 Brier 分数差异显著(如 MLP-256 AUROC 最高但 MLP-64 Brier 最低),需研究针对安全决策不对称成本的阈值选择与校准策略。 —- ### 8. 开放世界中的安全策略自动合成 当前安全案例 σ = langle g, s_0, V_g rangle 中,目标 g 与验证器 V_g 依赖人工设计。未来可探索利用大语言模型**自动从环境反馈与任务描述中合成安全策略与可执行验证器**,减少安全工程的人工开销。这涉及: - 从自然语言任务指令中自动抽取安全相关约束; - 生成与工具模式匹配的 V_g 验证代码; - 在 GuardPO 框架中联合优化策略生成器与防护模型。 —- ### 9. 跨框架泛化的理论分析 论文通过实验验证了跨框架迁移能力,但缺乏理论保证。未来可建立基于**领域适应(Domain Adaptation)**或**因果推断**的泛化界: - 量化异构适配器引入的分布偏移 P(Claude) 与 P(OpenClaw) 之间的差异; - 分析规范事件表示 Serialize(·) 在何种条件下足以消除框架特定的混杂因子; - 为 GuardPO 的序列级归一化目标推导收敛速率与样本复杂度。 —- ### 10. Rationale 的事实核查与可审计性增强 HazardAuditor 生成的 z(rat) 虽可解释,但可能出现**幻觉式证据引用**(如错误地声称工具调用了不存在的参数)。未来可引入: - **链式思维验证(Chain-of-Thought Verification)**:对 rationale 中引用的轨迹片段进行自动回溯与匹配; - **结构化证据提取**:要求模型以标准化格式(如 JSON Pointer 或轨迹索引)标注其引用的具体事件 e_k ,便于外部审计器自动核查; - **形式化保证**:对关键安全属性,探索将自然语言 rationale 转换为可形式化验证的逻辑断言。 Q6: 总结一下论文的主要内容 该论文针对**计算机使用型智能体(computer-use agents)**的运行时安全防护问题,提出了 **HazardAuditor** 框架。其核心内容可概括如下: —- ### 1. 研究背景与问题 大型语言模型正越来越多地作为智能体直接操作浏览器、终端、文件系统与外部服务。与传统语言模型不同,这类智能体的安全风险往往通过**运行时行为**(多步工具调用、环境交互与状态变迁)动态涌现,而非仅体现在生成的文本内容中。现有工作存在两个根本性缺口: - **监督缺口**:现有可执行安全评估平台(如 DTap、Vera)能够验证智能体行为,但仅输出离散评估裁决,其日志格式因框架而异,缺乏统一的跨框架监督表示,无法直接用于训练单一的防护模型。 - **优化缺口**:现有生成式防护模型主要依赖监督微调(SFT),其目标为 token 级模仿。然而防护模型的操作单元是**序列级安全决策**,导致推理过程(rationale)越长,在梯度更新中占据的权重越大,造成结构性错配。 —- ### 2. 核心贡献 论文提出 **HazardAuditor**,一个基于执行行为的统一框架,通过以下两个组件解决上述问题: #### (a) 可执行安全基础设施与规范事件表示 该基础设施在受控环境中运行 Claude Code、Codex、Hermes 与 OpenClaw 四种异构智能体,并通过框架专属适配器将其原生日志映射为统一的**规范事件表示(canonical event representation)**:
τ_(1:m) = (e_1, …, e_m), quad e_k ∈ U(u_k),, A(a_k, r_k),, T(nu_k, α_k),, O(o_k)
该表示涵盖用户输入、智能体响应与推理、工具调用及参数、环境观察,并明确区分“观察到风险内容”与“实际执行不安全行为”。由此,异构框架的执行轨迹被转化为单一防护模型可消费、可跨框架复用的行为监督数据。 #### (b) Guard Policy Optimization (GuardPO) GuardPO 是一种专为生成式防护模型设计的决策级后训练方法。它将确定性安全结果转换为**序列级优势(sequence-level advantages)**,并在响应内部对推理区域 R_i 与裁决区域 V_i 分别进行**归一化聚合**,目标函数为:
L(GuardPO) = (1) / (N) ∑(i ∈ B) [ Mi(R_i) + λ(ver) M_i(V_i) ]
其中 M_i(·) 为区域内平均 token 损失。该方法保证**长度不变性**(复制 rationale token 不改变其损失贡献),从而使**安全决策**而非解释 token 数量成为有效优化单位。 —- ### 3. 实验验证 论文在多个基准上进行了系统评估: - **自建跨框架诊断集 CUA-EXEC**:在 Claude Code、Codex、Hermes、OpenClaw 四个框架上,HazardAuditor 全面优于现有最佳护栏模型 BraveGuard,准确率提升最高达 **16.5 个百分点**,Macro-F1 提升最高达 **18.7 个百分点**。 - **外部基准迁移**:在 AgentHazard、ATBench、R-Judge、ASSE-Safety 上,HazardAuditor 保持强劲性能,跨基准**最低 F1 为 88.3%**,显著优于基线;其精度与召回差距始终低于 1.1 个百分点,避免了现有模型常见的“高精度-低召回”极端。 - **消融分析**:执行监督数据本身即可匹配最强基线,GuardPO 在跨智能体轨迹上进一步带来 **10.4 个百分点**的 Macro-F1 提升,且提升在执行密集型数据上最为显著。 —- ### 4. 结论 HazardAuditor 表明,有效的计算机使用智能体安全防护应当**以智能体实际执行的行为为监督基础**,并**以序列级安全决策为优化目标**。通过将异构执行证据归一化与决策级策略优化相结合,该框架在多样化智能体系统与外部基准上实现了鲁棒的运行时安全判断。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yunhao Feng,Ruixiao Lin,Ming Wen,Yanming Guo,Xingjun Ma,Yutao Wu,Xinhao Deng,Shouling Ji
Categories:
PDF URL: https://arxiv.org/pdf/2609.15134.pdf
Arxiv URL: https://arxiv.org/abs/2609.15134
Arxiv ID: 2609.15134
CoolPaper URL: https://papers.cool/arxiv/2609.15134
Published: 2026-09-16T01:38:58.604Z
Updated: 2026-09-16T01:38:58.604Z
16. LLaDA-UI: Bringing Block-wise Diffusion to Vision-Language GUI Agents
Abstract:Diffusion large language models (dLLMs) achieve high decoding efficiency through block-parallel, arbitrary-order generation, making them attractive for latency-sensitive applications. GUI agents represent a natural testbed for this paradigm, as they must repeatedly perceive screen states and emit structured, spatially grounded actions in real time. However, whether dLLMs can be extended into capable multimodal GUI agents while preserving their parallel decoding advantage remains an open question. We present LLaDA-UI, a 16.7B-parameter MoE-based, block-wise diffusion vision-language GUI agent. LLaDA-UI follows a two-stage training pipeline: general multimodal pre-training aligns a native-resolution vision encoder with the LLaDA2.0-mini-base diffusion language backbone, followed by GUI-agent supervised fine-tuning on diverse mobile, desktop, web, and grounding data. Across widely adopted grounding benchmarks and navigation benchmarks spanning multiple platforms, LLaDA-UI substantially outperforms Qwen2.5-VL-7B and surpasses Qwen3-VL-8B on four of six reported GUI benchmarks. These results establish block-wise diffusion as a practical generative paradigm for multimodal GUI agents.
中文摘要
摘要:扩散大语言模型(dLLMs)通过块并行、任意顺序生成实现了高解码效率,使其在对延迟敏感的应用中具有吸引力。GUI代理是这一范式的自然测试平台,因为它们必须反复感知屏幕状态并实时输出结构化、空间化的操作。然而,dLLMs能否在保持并行解码优势的同时扩展为有能力的多模态GUI代理仍然是一个悬而未决的问题。我们提出了LLaDA-UI,这是一个基于MoE、拥有167亿参数的块状扩散视觉-语言GUI代理。LLaDA-UI遵循两阶段训练流程:通用多模态预训练,将原生分辨率视觉编码器与LLaDA2.0-mini-base扩散语言骨干对齐,然后在多样的移动、桌面、网页和定位数据上进行GUI代理监督微调。在广泛采用的定位基准和跨多个平台的导航基准测试中,LLaDA-UI明显优于Qwen2.5-VL-7B,并在六项报告的GUI基准中,有四项超过Qwen3-VL-8B。这些结果确立了块状扩散作为多模态GUI代理实用生成范式的可行性。
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*如何将块级扩散生成范式有效扩展至多模态视觉-语言 GUI 代理任务\*\*这一核心问题。具体而言,其试图克服的挑战可归纳为以下几个方面: - \*\*自回归范式的固有瓶颈\*\* 现有主流的多模态大语言模型(MLLMs)及 GUI 代理普遍依赖自回归(AR)解码。该范式严格按顺序生成 token,限制了并行度,在需要实时感知屏幕并快速输出结构化、空间化动作的 GUI 场景中,往往带来较高的推理延迟。 - \*\*扩散语言模型在动态 GUI 代理中的能力空白\*\* 尽管离散扩散大语言模型(dLLMs)已在文本生成和静态视觉理解中展现出块并行、任意顺序解码的效率优势,但“扩散模型能否在保留并行解码优势的同时,胜任需要反复观察动态屏幕、执行长程交互、跨平台导航的 GUI 代理任务”此前仍是未解之题。已有工作仅探索了静态 GUI 定位或单步坐标预测,尚未形成实用的多模态扩散 GUI 代理。 - \*\*视觉-语言表示对齐与结构化动作生成\*\* 论文需解决如何将独立预训练的视觉编码器(支持原生动态分辨率)与扩散语言骨干(LLaDA2.0-mini-base)进行有效对齐,使扩散模型不仅能理解复杂 UI 截图,还能可靠地生成带严格格式(如 \`......\`)和空间坐标(如 \`Click(box=(x,y))\`)的可执行动作序列。 - \*\*交互式推理的配置与鲁棒性\*\* 针对扩散模型在交互场景下的特殊行为,论文还研究了块大小(block size)、去噪步数(denoising steps)以及 EOS 处理策略等推理超参数对任务成功率与延迟的敏感影响,以确立稳定的解码配置。 简言之,LLaDA-UI 试图证明:\*\*块级扩散解码不仅是一种高效的文本生成替代方案,更可成为能够在移动、桌面、网页等多平台环境中完成复杂长程任务的实用视觉-语言 GUI 代理范式\*\*。 Q2: 有哪些相关研究? 根据论文的论述,相关研究主要围绕以下六个维度展开: ### 1. 自回归视觉-语言模型与大语言模型 现有主流的多模态系统大多基于自回归(AR)范式: - \*\*通用 VLMs/MLLMs\*\*:GPT-4o(Hurst et al., 2024)、Gemini3 Pro(Google DeepMind, 2025)、Qwen2.5-VL(Bai et al., 2025)、Qwen3-VL(Qwen Team, 2025)等,构成了当前视觉-语言理解和 GUI 代理的基线。 - \*\*MoE 语言模型\*\*:Ling2.0(Ling Team, 2025)为 LLaDA2.0 系列提供了架构参考。 ### 2. 扩散语言模型(dLLMs) 这类模型通过从掩码状态重建完整序列,支持并行解码与双向上下文建模: - \*\*大规模扩散语言模型\*\*:Nie et al. (2025) 提出了通用扩散语言模型框架;Bie et al. (2025) 推出了 LLaDA2.0 并将扩散语言模型扩展至 100B 参数规模。 - \*\*统一多模态扩散模型\*\*:LLaDA2.0-Uni(Bie et al., 2026)尝试在单一扩散模型中统一多模态理解与生成。 - \*\*块级扩散机制\*\*:Arriola et al. (2025) 提出的 Block Diffusion 在自回归与扩散之间进行插值,支持块内并行生成,是 LLaDA-UI 解码范式的直接理论基础。 ### 3. 扩散视觉-语言模型 将扩散解码引入多模态领域的尝试: - \*\*LLaDA-V\*\*(You et al., 2025)与 \*\*SDAR-VL\*\*(Cheng et al., 2025a)验证了扩散解码可作为自回归多模态生成的替代方案。 - \*\*静态 GUI 扩散定位\*\*:Kumbhar et al. (2026) 探索了扩散模型在静态 GUI grounding 与单步坐标预测中的应用,但尚未涉及长程交互代理任务。 ### 4. GUI 代理与交互环境 论文与大量专注于 GUI 导航与操作的专门化代理进行了对比: - \*\*端到端 GUI 代理\*\*:UI-TARS(Qin et al., 2025)、UI-TARS-1.5(Seed, 2025)、UI-Venus 系列(Gu et al., 2025; Venus-Team et al., 2026)、GUI-G2(Tang et al., 2026)、GUI-Owl(Ye et al., 2025)、Holo2(Company, 2025)、Step-GUI(Yan et al., 2025)、MAI-UI(Zhou et al., 2025)。 - \*\*动态评估环境\*\*:AndroidWorld(Rawles et al., 2025)、MobileWorld(Kong et al., 2025, 2026)、OSWorld(Xie et al., 2024, 2026)、WebVoyager(He et al., 2024)提供了跨移动、桌面和网页平台的代理评测基准。 ### 5. 模型架构与训练技术 - \*\*视觉编码\*\*:采用 SigLIP(Bai et al., 2025)初始化 ViT,并引入 2D RoPE 进行原生动态分辨率编码。 - \*\*MoE 负载均衡\*\*:为避免路由崩溃,LLaDA-UI 借鉴了 DeepSeek-V3(Liu et al., 2024a)的辅助 loss-free 负载均衡机制,并参考 Su (2025) 对门控偏置更新进行了稳定性改进。 - \*\*训练基础设施\*\*:基于 VeOmni(Ma et al., 2025)构建的 dFactory(InclusionAI, 2025)用于分布式多模态训练。 ### 6. 评估基准 除 GUI 任务外,论文在预训练阶段还引用了广泛的通用多模态评测: - \*\*推理\*\*:MMMU / MMMU-Pro、MathVista、We-Math、MathVision、MathVerse - \*\*通用 VQA 与幻觉检测\*\*:SimpleVQA、HallusionBench、MMBench、MMStar、RealWorldQA - \*\*OCR 与文档理解\*\*:ChartVQA、DocVQA、InfoVQA、CharXiv、OCRBench、AI2D - \*\*其他\*\*:CountBench(计数)、VLRewardBench(视觉-语言偏好评估) Q3: 论文如何解决这个问题? LLaDA-UI 通过\*\*架构设计、分阶段训练、扩散特定的优化目标与推理配置\*\*四个层面的系统性方案,将块级扩散范式扩展为可落地的多模态 GUI 代理。具体解决路径如下。 --- ### 1. 模型架构:MoE 块级扩散视觉-语言主干 论文设计了一个总参数量 16.7B 的 MoE 架构,由三个互补模块组成,以支撑并行解码与细粒度视觉-语言对齐: - \*\*块级扩散语言模型\*\*:以 LLaDA2.0-mini-base 为骨干,采用 Block-wise Masked Diffusion 机制。该机制将输出序列划分为若干块(block),在每个去噪步骤内,同一块中的多个 token 可被\*\*并行地\*\* refine,而非逐 token 自回归生成。这使得模型在保持全局语义修正能力的同时,显著降低推理延迟。 - \*\*原生动态分辨率视觉编码器\*\*:基于预训练 SigLIP 初始化 ViT,支持原生分辨率输入,并引入 2D RoPE 以显式建模二维空间关系,从而精确捕获 GUI 截图中的布局与控件位置。 - \*\*视觉-语言投影器\*\*:借鉴 Qwen2.5-VL 设计,先将相邻 4 个图像特征沿空间维度拼接压缩,再通过两层 MLP 映射至语言模型的嵌入空间。该设计在降低长视觉序列计算开销的同时,保留了动态分辨率处理的灵活性。 --- ### 2. 分阶段训练策略:从通用对齐到 GUI 专业化 论文采用\*\*两阶段流水线\*\*,先建立扎实的视觉-语言基础,再注入可执行代理行为。 #### 2.1 多模态预训练(三阶段课程) 针对视觉编码器与扩散语言骨干独立预训练导致的表示空间差异,预训练按以下课程进行: | 阶段 | 目标 | 数据与规模 | 可训练参数 | | :--- | :--- | :--- | :--- | | \*\*S0\*\*:视觉-语言对齐 | 建立跨模态表示对齐 | 高质量图像-文本对、视觉知识(5B tokens) | 仅投影器 | | \*\*S1\*\*:感知增强 | 提升细粒度感知与 OCR/ grounding 能力 | 交错图文、OCR、视觉计数/定位、纯文本(70B tokens) | 全部参数 | | \*\*S2\*\*:多任务预训练 | 强化复杂推理与多模态联合理解 | 交错数据、多任务学习、VQA、数学、agent 任务(70B tokens) | 全部参数 | 通过序列打包(sequence packing)与全参数端到端训练,模型在仅 145B tokens 的规模上即获得了与数倍数据量的自回归基线相竞争的通用多模态能力。 #### 2.2 GUI-Agent 有监督微调(SFT) 在预训练基础上,论文使用 UI-Venus 项目积累的跨平台 GUI 轨迹进行全模型微调: - \*\*数据覆盖\*\*:涵盖 100+ 中文移动应用、70+ 英文移动应用,以及桌面和网页场景,经过去重与过滤后总计 \*\*6M+\*\* 样本。 - \*\*动作规范化\*\*:导航任务采用统一结构 \`......\`,其中 \`\` 包含可执行的空间化操作(如 \`Click(box=(x,y))\`);Grounding 任务直接输出坐标 \`
-1,-1
` 或 `
x,y
`。 - **训练配置**:3 个 epoch,峰值学习率 1× 10^(-5) ,余弦衰减,最大序列长度 16K,保留块扩散目标与 MoE 负载均衡机制。 —- ### 3. 扩散特定的优化目标与稳定训练技巧 为适应多模态数据长度差异大、MoE 路由易崩溃等挑战,论文在训练阶段引入了以下技术: - **块扩散语言模型损失(BDLM Loss)**: 模型通过标准交叉熵在掩码块上重建原始 token,损失函数为
L(BDLM)(θ) = -E(t,x0,x_t)[ (α’_t) / (1-α_t) ∑(k=1)^(K) ∑(i=1)^(L_B) 1[x(t,k)^i = [MASK]] log pθ(x(0,k)^i mid x(0,<k), x(t,k)) ]
其中 K = L(total)/L_B 为块数, L_B 为块大小,$1
·
仅对掩码 token 计算梯度, -α’_t/(1-α_t)$ 为扩散时间权重。 - 辅助 Loss-free 负载均衡: 为避免 MoE 路由崩溃,论文采用无辅助损失的负载均衡机制,并引入 RMSNorm 风格归一化平滑偏置更新:
b_i = b_i + u × (F_i - Q_i) / (√{frac{1)n∑(j=1)^(n)(Fj - Q_j)^2}}
其中 F 为当前专家负载分布,$Q =
1/n, dots, 1/n
$ 为理想均匀分布。 - **Mask-Token 重加权(MTRS)**: 为缓解长样本梯度主导与短样本过采样之间的失衡,对每个样本按掩码 token 数量的平方根倒数加权:
L(MTRS) = ∑j β_j L(BDLM)^((j))∑j β_j, quad β_j = (1) / (√{∑(k=1)^(K)∑i=1)^(L_B) 1[x(t,k)^((j),i) = [MASK]]}
- **互补掩码(Complementary Masking)**: 对同一样本构造两个逻辑互逆的掩码视图,确保每个 token 在两次前向中既被观测一次、也被预测一次,从而提升信息利用率并降低采样偏差。 —- ### 4. 推理配置:解码超参数与结构化输出控制 针对 GUI 代理对**动作格式严格性**与**低延迟**的双重需求,论文通过消融实验确定了关键推理设置: - **块大小与去噪步数的联合选择**: 在 AndroidWorld 上的消融表明,Block Size=32 搭配 32 步去噪可获得最佳任务成功率(42.7%)。若将块扩大至 64 并减少至 16 步,成功率显著下降至 33.0%,说明交互可靠性对块粒度与迭代轮次高度敏感。 - **EOS 处理策略**: 与常规语言模型不同,禁用 EOS 提前停止(No-EOS)在实验中比默认早停策略将成功率提升了 **9.9 个百分点**(达到 52.6%)。原因在于过早终止会中断完整可执行动作(如坐标括号)的形成,因此论文选择在扩散充分收敛后再截断输出。 - **结构化动作有效性**: 在 1,849 步交互诊断中,98.65% 的响应可被解析,98.59% 满足动作模式,且所有含坐标动作均落在合法范围 $
0, 999
内,验证了扩散模型对严格模板格式的遵循能力。 —- ### 5. 系统评估与延迟验证 论文不仅在 ScreenSpot-V2、AndroidWorld、MobileWorld、OSWorld-Verified、WebVoyager 等 6 项基准上验证了代理能力,还通过成对非缓存 API 延迟测试量化了扩散范式的效率优势:在 Web、桌面与移动输入上,LLaDA-UI 的平均延迟分别比同规模自回归模型 Qwen3-VL-8B 低 3.58×、6.83×、8.95×,证明块级扩散在实时 GUI 交互场景中的实用价值。 Q4: 论文做了哪些实验? 论文的实验验证分为预训练评估与GUI-Agent 评估两大阶段,涵盖基准测试、消融实验、延迟测量、失败模式诊断与跨平台轨迹可视化。具体实验内容如下: —- ### 1. 预训练评估(Pre-training Evaluation) 在 GUI-Agent SFT 之前,论文首先评估了多模态基础模型的通用视觉-语言能力,以确认跨模态对齐与感知推理基线是否成立。 - 评测基准 覆盖六大类任务: - 多模态推理:MMMU、MMMU-Pro、MathVista、We-Math、MathVision、MathVerse - 通用视觉问答与幻觉检测:SimpleVQA、HallusionBench、MMBench、MMStar、RealWorldQA - OCR 与文档理解:ChartVQA、DocVQA、InfoVQA、CharXiv(DQ/RQ)、OCRBench、AI2D - 计数:CountBench - 偏好评估:VLRewardBench - 对比基线 与自回归模型(Qwen2.5-VL 系列、Qwen3-VL 系列)及扩散模型(LLaDA-V、SDAR-VL)进行比较。 - 关键结果 在仅使用 145B tokens 预训练的情况下,该基础模型在多数推理与文本富集任务上超越了 SDAR-VL-8B,并在多个指标上接近或超过 Qwen2.5-VL-7B 与 Qwen3-VL-8B,确立了扩散 MLLM 的新基线(见原文 Table 2)。 —- ### 2. GUI-Agent 评估(GUI-Agent Evaluation) 在 GUI 监督微调后,论文对 LLaDA-UI 在 grounding 与动态导航任务上进行了系统评估。 #### 2.1 总体性能对比(Overall Results) - 评测基准 - 静态 Grounding:ScreenSpot-V2、ScreenSpot-Pro - 移动导航:AndroidWorld、MobileWorld - 桌面导航:OSWorld-Verified - 网页导航:WebVoyager - 对比基线 涵盖通用视觉-语言模型(GPT-4o、Qwen2.5-VL-7B、Qwen3-VL-8B、Qwen3.5-9B)与专门化 GUI 代理(UI-TARS-7B、GUI-G2-7B、GUI-Owl-7B、UI-TARS-1.5-7B、UI-Venus 系列、Holo2-8B、Step-GUI-4B、MAI-UI-2B)。 - 关键结果 LLaDA-UI 在全部 6 个报告基准上均超越 Qwen2.5-VL-7B;相对于同规模自回归模型 Qwen3-VL-8B,在 ScreenSpot-Pro、AndroidWorld、MobileWorld、WebVoyager 四个基准上取得更高分数(见原文 Table 3)。 #### 2.2 定性扩散解码可视化(Qualitative Diffusion Decoding) - 实验内容 在 AndroidWorld 上记录了两个完整的去噪序列,从初始掩码状态逐步还原为包含推理过程()与可执行动作()的最终输出。 - 目的 直观展示块级扩散解码如何在 GUI 场景中逐步生成结构化响应,而非逐 token 自回归输出(见原文 Figure 4)。 #### 2.3 消融实验(Ablation Studies) 在 AndroidWorld 上使用中间检查点,固定任务划分、提示模板与最大环境步数,系统研究解码超参数对交互可靠性的影响: | 实验维度 | 具体设置 | 核心发现 | | :—- | :—- | :—- | | EOS 策略 | Early stop / Two-stage decoding / No-EOS | 禁用 EOS 提前停止(No-EOS)将成功率从 42.7% 提升至 52.6%,表明过早终止会破坏可执行动作的完整性 | | 块大小与去噪步数 | Block 32 + 32 steps vs. Block 64 + 16 steps | 将块扩大至 64 并减少至 16 步后,成功率从 42.7% 骤降至 33.0%,说明块粒度与迭代轮次需联合优化 | (见原文 Table 4) #### 2.4 成对 API 延迟测量(Paired API Latency) - 实验设计 在 4 张 H100 GPU 上,与 Qwen3-VL-8B 进行对照,最大生成长度设为 2,048 tokens。排除环境重置与动作执行时间,仅测量模型 API 壁钟时间;通过使用不同 PNG 哈希的视觉上等价截图,确保 Qwen3-VL-8B 不命中其 exact-replay 缓存。 - 测量方式 在 Web、OSWorld、MobileWorld 三个域上各执行 5 次非缓存调用,报告均值、中位数与区间。 - 关键结果 LLaDA-UI 的平均延迟分别为 Qwen3-VL-8B 的 3.579×(Web)、6.826×(OSWorld)、8.951×(MobileWorld) 之快;中位数加速比分别为 3.428×、6.778×、8.814×(见原文 Table 5)。 #### 2.5 结构化动作有效性与长程失败分析(Structured Actions and Long-Horizon Failures) 在 AndroidWorld 的 116 个任务、1,849 个模型步骤上,对中间检查点进行细粒度诊断: - 结构化动作统计(见原文 Table 6) - 解析率:98.65% - 模式有效率:98.59% - 坐标合法率:100.00% - 精确重复动作率:18.82% - 多动作率:1.30% - 按最优任务长度分层(见原文 Table 7) | 最优步数 | 任务数 | 成功率 | | :—- | :—- | :—- | | 1–5 | 54 | 62.96% | | 6–10 | 35 | 48.57% | | 11–20 | 20 | 40.00% | | 20+ | 7 | 14.29% | - 失败模式结论 - 长程退化:成功轨迹中的精确重复率仅 5.41%,而失败轨迹中升至 26.70%。 - 高分辨率感知瓶颈:OSWorld 上表现较弱,主因是截图尺寸大、目标过小,导致小目标定位精度不足。 #### 2.6 跨平台交互轨迹可视化(Cross-Platform Interaction Traces) - 实验内容 选取三个完整的长程成功轨迹进行逐帧记录: - WebVoyager(20 步):带约束条件的航班搜索,展示长程约束跟踪能力 - OSWorld(10 步):在 Calc 与 Writer 之间进行格式化内容转移 - MobileWorld(12 步):从邮件读取事件时间并提前一小时设置闹钟,展示跨应用信息使用 - 展示方式 每帧配对当前 GUI 观察截图与模型逐字输出的 与 内容(见原文 Figures 5–7)。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与局限性分析,以下方向具有进一步探索的价值: —- ### 1. 长程任务中的错误恢复与循环规避机制 论文指出,LLaDA-UI 在超过 20 步的最优长度任务上成功率降至 14.29%,且失败轨迹中的精确重复动作率高达 26.70%。这揭示了扩散 GUI 代理在长程交互中易陷入无效循环。未来可探索: - 扩散特定的规划模块:在块级去噪过程中引入显式的计划-执行分层结构,例如先在高层语义空间生成任务阶段规划,再逐步解码为低层动作。 - 在线错误检测与回退:利用扩散模型的双向上下文特性,在解码中期评估动作置信度,对低置信度预测触发重采样或历史轨迹回溯。 —- ### 2. 高分辨率感知与细粒度 Grounding OSWorld-Verified 是当前性能的主要瓶颈,其桌面截图尺寸大、目标元素小,直接暴露了模型在高分辨率场景下的感知局限。后续工作可着力于: - 自适应多尺度视觉编码:在保持原生动态分辨率优势的同时,引入局部放大或裁剪分支,专门针对小目标区域进行精细化特征提取。 - 视觉-语言空间对齐的强化:在预训练阶段增加超高分辨率 UI 截图与像素级坐标的预训练数据密度,或采用更高容量的 vision projector 来减少下采样过程中的空间信息损失。 —- ### 3. 扩散解码超参数的自适应配置 实验表明,块大小 L_B 与去噪步数的联合选择对交互可靠性影响显著(Block 32/32 steps 的 42.7% vs. Block 64/16 steps 的 33.0%),且不同任务可能对应不同的最优配置。未来可研究: - 任务自适应解码预算:根据当前截图复杂度、历史步数或任务类型,动态调整块大小与去噪轮次,以在延迟与精度之间取得帕累托最优。 - Early Stopping 的智能化:论文发现禁用 EOS 提前停止可提升成功率,但可能增加延迟。可训练一个轻量化的停止判别器,在动作结构完整性得到满足时动态终止扩散过程。 —- ### 4. 推理效率与缓存机制优化 在延迟对比中,Qwen3-VL-8B 具备 exact-replay cache-hit 模式,而 LLaDA-UI 的 SGLang 服务栈尚未暴露 comparable 的缓存路径。对于扩散模型,可进一步探索: - 跨步视觉特征缓存:由于 GUI 代理通常仅需处理连续帧间的微小变化,可缓存并复用 vision encoder 与 projector 的中间特征,减少每步冗余计算。 - 扩散隐状态缓存:块级扩散在相邻环境步之间可能共享部分上下文,研究如何在不破坏双向依赖的前提下缓存并增量更新 KV 或扩散隐状态。 —- ### 5. 训练数据规模与课程学习的扩展 LLaDA-UI 的多模态预训练仅使用 145B tokens,远少于 Qwen2.5-VL 的 4.1T 与 Qwen3-VL 的 2.2T。这表明扩散视觉-语言模型可能在数据效率上具备优势,但其上限尚未探明: - Scaling Law 研究:系统性地扩大预训练与 SFT 数据规模,验证扩散 GUI 代理在 10 倍乃至 100 倍数据下的性能曲线是否持续优于同等规模的自回归模型。 - GUI 特定的课程学习:在 SFT 阶段引入更精细的难度渐进课程,从单步 grounding 到多步跨应用任务,模拟人类学习 UI 操作的过程。 —- ### 6. 与强化学习/拒绝采样的协同 论文引用的 UI-Venus 项目已验证了 RFT(Reinforcement Fine-Tuning)在 GUI 代理中的有效性。扩散模型天然支持在输出空间进行多次采样并筛选最优结果,这与 RL 或拒绝采样具有高度协同潜力: - 扩散采样作为探索机制:利用扩散模型的并行采样能力,在交互环境中同时生成多个候选动作,通过环境反馈选择最优轨迹进行在线学习。 - 针对结构化动作的策略优化:设计能够直接优化任务成功率而非仅 token 级交叉熵的强化学习目标,缓解长程任务中的重复动作问题。 —- ### 7. 多轮视觉历史的高效建模 当前评估采用 current-image-only protocol,历史信息仅以文本化动作序列保留,未利用历史截图的视觉内容。未来可探索: - 关键帧视觉记忆:在多轮交互中选取具有状态变化的关键帧作为视觉历史,与当前截图共同编码,以处理需要跨步视觉比对的任务(如验证操作结果)。 - 压缩视觉令牌缓存:研究如何在长上下文中高效存储历史图像的压缩视觉表示,避免超出扩散模型的最大序列长度限制。 —- ### 8. 统一多模态理解与生成向 GUI 的延伸 LLaDA2.0-Uni 已在通用多模态领域实现了理解与生成的统一。将其扩展至 GUI 代理场景,可探索: - 交互式 GUI 生成与编辑:不仅理解现有界面,还能生成或修改 UI 元素(如自动填充表单、生成代码),形成“感知-推理-生成”的闭环代理。 - 跨平台界面迁移:利用扩散模型的全局建模能力,将在某一平台(如 Web)习得的交互知识迁移至另一平台(如桌面或移动应用)。 Q6: 总结一下论文的主要内容 这篇论文提出了 LLaDA-UI,一种基于块级掩码扩散(block-wise masked diffusion)的视觉-语言 GUI 代理模型,系统验证了扩散生成范式在多模态交互代理任务中的可行性与效率优势。 —- ### 1. 研究背景与动机 现有的大型视觉-语言模型(VLMs)与 GUI 代理普遍依赖自回归(AR)解码,其严格顺序生成的特性限制了并行度,在需要实时感知动态屏幕并快速输出结构化、空间化动作的场景中,往往带来显著的推理延迟。相比之下,掩码离散扩散大语言模型(dLLMs) 支持块内并行预测与双向上下文建模,具有降低延迟的潜力,但此前尚未被扩展至需要长程交互、跨平台导航的实用 GUI 代理中。论文旨在弥合这一 gap,探索 dLLM 能否在保留并行解码优势的同时,胜任复杂的视觉-语言 GUI 代理任务。 —- ### 2. 方法 #### 2.1 模型架构 LLaDA-UI 是一个总参数量 16.7B 的 MoE 模型,由三个核心模块构成: - 块级扩散语言模型:以 LLaDA2.0-mini-base 为骨干,采用 Block-wise Masked Diffusion 机制。输出序列被划分为大小为 L_B 的块,在每个去噪步骤 t$ 中,同一块内的多个掩码 token 可被**并行地** refine,而非逐 token 生成。 - **原生动态分辨率视觉编码器**:基于预训练 SigLIP 初始化 ViT,支持原生分辨率输入,并采用 2D RoPE 显式建模二维空间关系。 - **视觉-语言投影器**:先将相邻 4 个图像特征沿空间维度拼接压缩,再通过两层 MLP 映射至语言模型的嵌入空间,以降低长视觉序列的计算开销。 #### 2.2 两阶段训练流程 **阶段一:多模态预训练** 通过三阶段课程将独立预训练的视觉编码器与扩散语言骨干进行对齐: - **S0(对齐)**:仅训练投影器,使用图像-文本对与视觉知识(5B tokens)。 - **S1(感知增强)**:全参数训练,引入 OCR、grounding、计数、交错图文等数据(70B tokens)。 - **S2(多任务预训练)**:全参数训练,加入多模态 VQA、数学推理与 agent 任务(70B tokens)。 总计 **145B tokens**。 **阶段二:GUI-Agent 有监督微调(SFT)** 在预训练基础上,使用覆盖 100+ 中文应用、70+ 英文应用及桌面、网页场景的 **6M+** GUI 轨迹进行全模型微调。动作输出采用统一结构化格式: - 导航任务:`推理过程Click(box=(x,y))` - Grounding 任务:直接输出坐标 `
x,y
` 或 `
-1,-1
` #### 2.3 训练优化技术 - **块扩散语言模型损失(BDLM)**:
L(BDLM)(θ) = -E(t,x0,x_t)[ (α’_t) / (1-α_t) ∑(k=1)^(K) ∑(i=1)^(L_B) 1[x(t,k)^i = [MASK]] log pθ(x(0,k)^i mid x(0,<k), x(t,k)) ]
- **辅助 Loss-free MoE 负载均衡**:通过 RMSNorm 风格归一化更新路由偏置,避免专家路由崩溃:
bi = b_i + u × (F_i - Q_i) / (√{frac{1)n∑(j=1)^(n)(F_j - Q_j)^2}} - **Mask-Token 重加权(MTRS)**:按掩码 token 数量的平方根倒数对样本损失加权,平衡长短样本的梯度贡献:
βj = (1) / (√{∑(k=1)^(K)∑i=1)^(L_B) 1[x(t,k)^((j),i) = [MASK]]} - **互补掩码(Complementary Masking)**:对同一样本构造两个逻辑互逆的掩码视图,提升信息利用率。 —- ### 3. 实验与结果 #### 3.1 预训练评估 在通用多模态基准上,LLaDA-UI 的基础模型(未经过 GUI SFT)在仅 145B tokens 训练量下,显著超越现有扩散 MLLM 基线(LLaDA-V、SDAR-VL),并在 MathVista、MathVision、MathVerse、CharXiv-DQ、OCRBench 等推理与文本富集任务上建立了扩散模型的新性能基准。 #### 3.2 GUI-Agent 评估 在 6 个广泛采用的 GUI 基准上进行了评估: | 基准 | 类型 | LLaDA-UI 表现 | | :—- | :—- | :—- | | ScreenSpot-V2 | Grounding | 90.7% | | ScreenSpot-Pro | Grounding | 52.9% | | AndroidWorld | 移动导航 | 53.5% | | MobileWorld | 移动导航 | 25.6% | | OSWorld-Verified | 桌面导航 | 29.4% | | WebVoyager | 网页导航 | 56.9% | LLaDA-UI **全面超越** Qwen2.5-VL-7B,并在 **4/6 个基准**(ScreenSpot-Pro、AndroidWorld、MobileWorld、WebVoyager)上**超越**了同规模自回归模型 Qwen3-VL-8B。 #### 3.3 消融实验 - **EOS 策略**:禁用 EOS 提前停止(No-EOS)相比默认早停策略,在 AndroidWorld 上将成功率提升 **9.9 个百分点**(42.7% → 52.6%),表明扩散模型需要充分收敛以生成完整的结构化动作。 - **块大小与去噪步数**:Block 32 搭配 32 步优于 Block 64 搭配 16 步(42.7% vs. 33.0%),说明交互可靠性对解码粒度敏感。 #### 3.4 推理延迟 在成对非缓存 API 延迟测试中,LLaDA-UI 相较于 Qwen3-VL-8B 实现了: - Web 场景:**3.58×** 加速(均值) - OSWorld 场景:**6.83×** 加速 - MobileWorld 场景:**8.95×** 加速 #### 3.5 失败模式分析 对 AndroidWorld 的细粒度诊断显示: - 结构化动作**解析率 98.65%**,**坐标合法率 100%**,证明扩散模型对严格格式的遵循能力。 - **长程退化**:最优步数 le 5 的任务成功率为 62.96%,而超过 20 步时降至 14.29%。 - 主要失败模式为**动作重复循环**(失败轨迹中精确重复率达 26.70%)与**高分辨率小目标定位困难**(在 OSWorld 上表现尤为明显)。 —- ### 4. 主要贡献 - **首个实用的扩散 GUI 代理**:通过大规模多模态预训练与 GUI SFT,成功将块级扩散范式扩展为能在移动、桌面、网页环境中执行任务的视觉-语言代理。 - **性能优势**:在多个 grounding 与导航基准上超越主流同规模自回归模型,同时保持显著更低的推理延迟。 - **系统性实证分析**:提供了扩散 GUI 代理在解码配置、延迟特性、成功与失败场景方面的详细经验数据,为后续研究奠定了基础。 —- ### 5. 局限性与未来方向 - **长程恢复能力**:在超过 20 步的长任务中易陷入重复动作循环,需更强的错误恢复与规划机制。 - **高分辨率感知**:对包含极小目标的大尺寸桌面截图定位精度不足,需改进视觉编码的多尺度处理能力。 - **解码超参数敏感性**:块大小与去噪步数的较小变化即可显著影响任务成功率与延迟,需研究自适应解码策略。 综上,LLaDA-UI 确立了块级扩散作为多模态 GUI 代理的一种可行且高效的生成范式,并为未来扩散语言模型在交互式视觉-语言系统中的应用开辟了新的研究方向。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Zhangxuan Gu,Haoxing Chen,Qi Qin,Yi Xin,Kai Gan,Lin Liu,Long Cui,Xiaomei Wang,Beitong Zhou,Yunzhu Zhang,Zhengwen Zeng,Changlong Gao,Weizhi Chen,Rongchao Zhang,Haoyuan Wu,Shuheng Shen,Changhua Meng,Weiqiang Wang,Jianguo Li,Zhenzhong Lan
Categories:
PDF URL: https://arxiv.org/pdf/2609.13287.pdf
Arxiv URL: https://arxiv.org/abs/2609.13287
Arxiv ID: 2609.13287
CoolPaper URL: https://papers.cool/arxiv/2609.13287
Published: 2026-09-16T01:38:59.334Z
Updated: 2026-09-16T01:38:59.334Z
17. When Agents Slow Down: Understanding LLM Agents’ Test-Time Strategies via Elo-per-token Analysis
Abstract:Large language model (LLM) agents allocate test-time compute adaptively as they revise solutions, use tools, explore alternatives, and decide when to stop. This test-time strategy makes it difficult to measure how agent performance scales. We study open-ended tasks that provide continuous scores for intermediate submissions, making progress observable throughout long trajectories. We propose Elo-per-token analysis, which tracks the best solution found at each token budget and uses a Bradley-Terry model to aggregate within-task orderings into Elo ratings across tasks with different score scales. We apply it to four general-purpose agents on four open-ended benchmarks, with sessions of up to 100M tokens, and to three feedback-driven LLM optimization harnesses in controlled single-task interventions. Independent sampling provides a theoretically characterized reference, for which Elo grows linearly with log compute. Against this reference, agents can initially convert tokens into Elo faster than independent sampling, but their marginal gains diminish and eventually fall below the reference. In contrast, the strongest historical human contestants improve superlinearly over contest time on shared AtCoder Heuristic Contest tasks, providing evidence of continual learning and substantial headroom after agents slow down. We define the scaling inflection point as the per-session budget where marginal Elo gains match the independent-sampling reference. Using this point as the per-session budget, we split 100M tokens across parallel sessions on FrontierCS Polyomino Packing, gaining +264 Elo over one long session and +355 over ten short sessions.
中文摘要
摘要:大型语言模型(LLM)代理在测试时会根据需要自适应分配计算资源,同时修改解决方案、使用工具、探索替代方案并决定何时停止。这种测试时策略使得衡量代理性能的扩展性变得困难。我们研究了提供中间提交连续评分的开放式任务,这使得在长轨迹中可以观察进展。我们提出了每令牌 Elo 分析(Elo-per-token analysis),该方法跟踪在每个令牌预算下找到的最佳解决方案,并使用 Bradley-Terry 模型将任务内的排序聚合为不同评分尺度任务间的 Elo 评分。我们将其应用于四个通用代理在四个开放式基准上的实验,单次会话最多达 1 亿令牌,并将其应用于三种基于反馈的 LLM 优化工具在单任务受控干预中的实验。独立采样提供理论上可表征的参考值,其 Elo 随计算量的对数线性增长。与该参考值相比,代理最初可以比独立采样更快地将令牌转化为 Elo,但其边际收益递减,最终低于参考值。相反,历史上最强的人类参赛者在共享的 AtCoder Heuristic Contest 任务中随比赛时间呈超线性提升,提供了持续学习的证据,并显示在代理速度减慢后仍有大量提升空间。我们将“扩展拐点”定义为每次会话的预算,边际 Elo 增益达到独立采样参考值的点。使用该点作为每次会话预算,我们将 1 亿令牌在 FrontierCS Polyomino Packing 上分配到并行会话中,在一次长会话中获得 +264 Elo,在十次短会话中获得 +355 Elo。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.15309 (HTTP 429)
Authors: Kaiyuan Liu,Qiuyang Mang,Bo Peng,Wenhao Chai,Hanchen Li,Shreyas Pimpalgaonkar,Luke Zettlemoyer,Alex Dimakis,Alvin Cheung
Categories:
PDF URL: https://arxiv.org/pdf/2609.15309.pdf
Arxiv URL: https://arxiv.org/abs/2609.15309
Arxiv ID: 2609.15309
CoolPaper URL: https://papers.cool/arxiv/2609.15309
Published: 2026-09-16T01:39:00.479Z
Updated: 2026-09-16T01:39:00.479Z
18. Agent as Policy for Robotic Manipulation
Abstract:We demonstrate that a general-purpose agent can directly drive a physical robot throughout task execution without any task-specific or environment-specific training. We introduce Agent as Policy (AGP), which places task planning and execution under the agent’s control. Given a task and a robot interface, the agent interprets visual evidence, writes executable programs, issues motion commands, and revises its actions in response to physical outcomes. This brings the agent’s reasoning and programming capabilities into continuous interaction with the physical world. We study AGP across multiple real-world manipulation tasks spanning precision manipulation, dynamic motions, and deformable objects. These include assembly from human videos, block construction from goal images, dice flipping, targeted throwing, and bimanual towel folding. Across assembly, block construction, and dice flipping, AGP succeeds in at least eight of ten trials for each evaluated task configuration. We further study efficiency through task experience accumulation and find that reusing saved procedures and programs shortens execution time across repeated trials. These findings support a path for general-purpose agents to act as robot policies, extending their autonomy to physical manipulation through runtime reasoning, programming, and interaction.
中文摘要
摘要:我们展示了通用智能体可以在没有任何特定任务或环境训练的情况下,直接驱动物理机器人完成任务执行。我们引入了“智能体作为策略(AGP)”,将任务规划和执行置于智能体的控制之下。给定一个任务和机器人接口,智能体可以解释视觉信息、编写可执行程序、发出运动指令,并根据物理结果修正其动作。这使智能体的推理和编程能力能够与物理世界持续互动。我们在多个现实世界操作任务中研究了AGP,这些任务涵盖精密操作、动态动作和可变形物体。这些任务包括从人类视频中进行组装、根据目标图像搭建积木、掷骰子、目标投掷以及双手折叠毛巾。在组装、积木搭建和掷骰子任务中,AGP在每个评估的任务配置中至少在十次试验中成功八次。我们进一步通过任务经验积累研究了效率,发现重复使用保存的程序和步骤可以缩短重复试验的执行时间。这些发现为通用智能体作为机器人策略提供了途径,通过运行时推理、编程和互动将其自主能力扩展到物理操作。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该研究试图解决\*\*如何将通用多模态智能体的推理与编程能力直接用于物理机器人操控\*\*,从而克服现有两类主流方法在灵活性和适应性上的局限。具体而言,论文针对以下核心问题展开: \*\*1. 预生成程序的刚性问题\*\* 现有通过智能体提前生成可执行程序(如代码或计算图)的方法,难以在运行时应对不确定的观测与意外的物理结果。程序必须以显式规则表达运行时的决策,无法根据实际执行中的反馈灵活调整。 \*\*2. 策略编排的运动能力受限\*\* 现有将智能体作为已有学习策略的“编排器”的方法,虽然能根据任务目标选择并排序策略,但运动生成能力完全受限于被选策略或基元(primitives)本身能执行的动作范围。当物理环境出现预期外变化时,系统缺乏调整动作生成的机制。 \*\*3. 物理任务对闭环适应的需求\*\* 真实操作任务(如精密装配、动态抛掷、可变形物体折叠)常要求在执行过程中\*\*联合推理\*\*当前场景、已尝试的动作及其结果。例如,一次失败的插入可能需要更近的观察、修正对齐估计或改变接近方向——这要求系统同时具备感知解释、运动生成和故障恢复的实时决策能力。 \*\*解决方案:Agent as Policy (AGP)\*\* 论文提出的核心思路是\*\*将通用智能体本身作为机器人策略(policy)\*\*,赋予其在任务执行全过程中的完全自主权: - 自主决定观察内容与时机; - 自主解释视觉与本体感受证据; - 自主编写、执行并修订局部程序以计算运动目标; - 根据物理反馈(如执行误差、新观测)动态调整后续动作。 通过连接一个通用编程智能体与标准化的机器人接口(提供校准观测、几何查询和运动命令),AGP 将智能体的推理、编程与物理交互能力整合为统一的闭环策略,无需任何针对特定任务或环境的训练即可直接驱动真实机器人。 Q2: 有哪些相关研究? 根据论文第2节(Related Work),相关研究可分为以下三个主要方向: ## 1. 智能体机器人系统(Agentic Robot Systems) 该方向主要探索如何利用语言模型进行推理、工具使用和基于执行反馈的适应,大致分为两类角色: ### 程序综合与精炼(Program Synthesis and Refinement) 这类方法通过感知与控制接口生成将观测映射到动作的可执行程序,并在仿真或物理机器人上通过验证支持执行。 - \*\*ProgPrompt\*\*(Singh et al., 2022):利用大语言模型生成情境化的机器人任务计划。 - \*\*Code as Policies\*\*(Liang et al., 2022):将语言模型程序用于具身控制。 - \*\*RoboScript\*\*(Chen et al., 2024):面向跨真实与仿真环境的自由形式操作任务生成代码。 - \*\*RoboCodeX\*\*(Mu et al., 2024):多模态代码生成用于机器人行为合成。 - \*\*ASPIRE\*\*(Lu et al., 2026):基于执行证据迭代精炼程序或计算图并保留可复用解决方案。 AGP 与此类工作的区别在于:\*\*在部署期间保持运行时智能体处于决策循环中\*\*,使其能够根据观测和执行反馈选择新方法、编写新程序并修订工作流。 ### 运行时策略编排(Runtime Policy Orchestration) 这类方法根据任务目标、 affordances 和环境反馈选择并排序已学习的技能。 - \*\*SayCan\*\*(Ahn et al., 2022):将语言模型与机器人 affordances 结合,实现"照我做,别照我说"的落地。 - \*\*Inner Monologue\*\*(Huang et al., 2022):通过语言模型进行规划与反思。 - \*\*RoboClaw\*\*(Li et al., 2026a):用于可扩展长程机器人任务的智能体框架。 - \*\*Harness VLA\*\*(Zhang et al., 2026):通过记忆引导智能体将冻结的 VLA 策略转化为可靠的操作基元。 - \*\*Galanti et al.\*\*(2026):通过物理智能体解决通才机器人的编排差距。 AGP 与此类工作的区别在于:\*\*使用运行时智能体本身作为策略\*\*,不依赖单独训练的动作策略,从而能够在未见过的环境中实现零样本任务执行。 ## 2. 机器人操作(Robot Manipulation) ### 经典方法 - \*\*集成任务与运动规划\*\*(Garrett et al., 2021):结合几何建模、任务与运动规划以及反馈控制。 ### 学习视觉运动策略 - \*\*Diffusion Policy\*\*(Chi et al., 2023):通过动作扩散学习视觉运动策略,从机器人轨迹数据中预测动作序列。 ### 视觉-语言-动作(VLA)模型 - \*\*RT-2\*\*(Brohan et al., 2023):将网络知识迁移到机器人控制的 VLA 模型。 - \*\*OpenVLA\*\*(Kim et al., 2024):开源视觉-语言-动作模型。 - \*\*π0\*\*(Black et al., 2024):用于通用机器人控制的视觉-语言-动作流模型。 ### 视频与世界动作模型 - \*\*统一视频动作模型\*\*(Li et al., 2025):将动作与未来视觉状态耦合以指导动作生成与评估。 - \*\*世界动作模型\*\*(Ye et al., 2026):作为零样本策略的世界动作模型。 AGP 引入了一种替代方案:\*\*直接使用通用基础多模态大语言模型(MLLM)作为机器人策略\*\*,而非专门训练用于动作生成的策略。 ## 3. 机器人之外的智能体工作流(Agentic Workflows Beyond Robotics) ### 语言智能体 结合推理、工具使用和交互反馈反思: - \*\*ReAct\*\*(Yao et al., 2022):在语言模型中协同推理与行动。 - \*\*Toolformer\*\*(Schick et al., 2023):语言模型自学使用工具。 - \*\*Reflexion\*\*(Shinn et al., 2023):基于语言反馈的智能体强化学习。 ### 编码智能体 - \*\*SWE-agent\*\*(Yang et al., 2024):通过智能体-计算机接口实现自动化软件工程。 - \*\*OpenHands\*\*(Wang et al., 2024):面向通用智能体的 AI 软件开发开放平台。 ### 计算机使用智能体 通过浏览器和桌面界面执行操作,适应界面变化: - \*\*WebArena\*\*(Zhou et al., 2023):用于构建自主智能体的真实 Web 环境。 - \*\*OSWorld\*\*(Xie et al., 2024):用于真实计算机环境中开放式任务的多模态智能体基准测试。 ### 多智能体框架 - \*\*AutoGen\*\*(Wu et al., 2023):通过多智能体对话启用下一代 LLM 应用。 - \*\*MetaGPT\*\*(Hong et al., 2023):面向多智能体协作框架的元编程。 AGP 的研究定位在于:\*\*探索这些已确立的工具使用、记忆、反馈与协调机制如何塑造机器人策略边界\*\*,即智能体如何通过感知、几何、规划和控制接口来管理物理任务执行。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*Agent as Policy (AGP)\*\* 框架,将通用多模态大语言模型(MLLM)智能体直接部署为机器人策略,使其在任务执行全周期内拥有对感知、推理与动作的完全 runtime 控制权。具体解决路径可分为以下四个层面: --- ### 1. 范式转变:从“离线生成”与“策略编排”到“智能体即策略” 现有方法通常将智能体限制在两种角色之一: - \*\*预生成程序\*\*:提前输出代码或计算图,运行时按固定逻辑执行; - \*\*策略编排器\*\*:在已训练好的技能库中选择并调度策略,但不直接生成动作。 AGP 的突破在于\*\*取消这两种角色之间的割裂\*\*,将智能体本身置于实时控制回路中。其决策过程可形式化为:
uk sim π(θ)(· mid g, I, H_k, W_k)
其中 u_k 为第 k 步的工具调用, g 为任务规范, I 为机器人接口文档, H_k 为历史对话与工具结果, W_k 为当前工作空间文件。模型参数 θ 在执行全程保持冻结,所有适应性均通过上下文推理与程序修订实现。 —- ### 2. 双阶段架构:任务准备与 runtime 执行 #### (1) 任务准备阶段(Task Preparation) 当某一任务类型首次被引入系统时,**准备智能体(preparation agent)**根据用户请求(视频/图像/语言)生成一份可复用的**任务定义(task definition)**。该文件明确: - 任务目标、参考材料与约束; - 允许的变体与完成标准; - 接口访问规则、预算与报告要求。 对于同一任务类型的后续实例,直接由启动程序载入该定义与当前实例细节,无需重新准备。 #### (2) 任务执行阶段(Task Execution) **执行智能体(execution agent)**在 runtime 读取任务定义与实例信息,通过持续迭代完成操作。其工作流如图 1(b) 所示,核心循环包括: - **观察**:请求相机图像、深度或机器人本体状态; - **推理**:解释视觉证据,判断当前进度与误差; - **编程**:现场编写 Python 脚本进行几何计算、视觉处理或机器人调用组合; - **动作**:通过接口提交末端执行器位姿、关节角或夹爪指令; - **验证**:利用执行反馈与新观测修正后续估计。 —- ### 3. Agent-Robot Bridge:双向信息接口 为实现智能体与物理世界的闭环交互,论文设计了一个轻量级桥接层(Agent-Robot Bridge),提供标准化、带几何 grounding 的双向数据流。 **机器人 → 智能体(观测侧)** - **视觉观测**:头顶 RGB 相机提供全局场景视图;腕部 RGB-D 相机提供带深度对齐的近距离Inspection,且具备相机标定参数,可将像素映射到共享机器人坐标系。 - **本体状态**:返回关节位置与通过正运动学计算的末端执行器位姿,用于比对指令目标与实际到达误差。 **智能体 → 机器人(动作侧)** - **观测请求**:按需捕获图像或读取状态; - **动作请求**: - `move_ee`:指定末端执行器在共享坐标系中的目标位置与四元数姿态; - `move_joints`:指定目标关节角; - `gripper`:控制夹爪开合比例。 - **安全与执行**:底层控制器通过 Mink 进行逆运动学求解,生成满足关节速度与加速度约束的轨迹,并独立运行;智能体可在机器人执行动作期间并行推理下一步。 —- ### 4. Runtime 编程与物理反馈自适应 AGP 的关键能力在于**任务执行过程中的现场编程(runtime programming)**: - **几何估计**:智能体编写脚本处理深度点云、射线求交、表面拟合(如利用 SVD 估计平面法向)或双目三角测量,以计算物体位置与抓取姿态; - **动作生成**:将计算出的位姿与夹爪指令组合为机器人接口调用; - **错误恢复**:当插入失败、物体滑脱或结构倾覆时,智能体利用反馈重新观察场景,修订几何估计或调整接近方向,而非依赖预设恢复策略。 例如,在一次装配失败导致螺母被碰落桌面后,智能体可重新捕获图像、更新螺母位姿估计、修正抓取姿态与插入角度,并继续完成剩余装配,同时保护已完成的配对不被破坏。 —- ### 5. 经验积累与跨智能体迁移 为解决执行时间与推理成本过高的问题,AGP 引入**基于文件的经验复用机制**: - **同智能体积累经验**:在多次执行同一任务后,智能体将测量值、成功程序、修正记录保存为工作空间文件。后续实例在全新上下文中读取这些文件,更新物体位姿后复用已验证的抓取与插入参数。实验显示,五次重复执行后,两配对装配任务时间缩短 29.3%,推理与编程延迟降低 47.0%。 - **强-弱智能体迁移**:由能力更强但成本更高的智能体(如 GPT-6 Astra)先完成任务并保存经验,再传递给更经济的智能体(如 GPT-5.6 Terra)。实验表明,接收经验后的弱智能体成功率从 1/5 提升至 4/5,成功试验的平均耗时与 token 用量分别下降 34.3% 与 11.4%。 —- 综上,AGP 通过赋予通用智能体对机器人接口的完全 runtime 控制权——使其能够自主决定何时观察、如何解释证据、生成何种运动指令、以及如何根据物理结果修订代码与策略——从而绕开了传统方法中“预生成程序缺乏适应性”与“策略编排受限于技能库”的双重瓶颈,实现了无需任务特定或环境特定训练的零样本物理操控。 Q4: 论文做了哪些实验? 该论文的实验围绕**真实机器人零样本操控**展开,涵盖长程推理、动作多样性与物体多样性三类核心能力,并进一步探究经验积累与跨智能体迁移对效率的影响。以下是实验的系统梳理: —- ## 1. 实验设置 ### 机器人平台与接口 - **硬件**:I2RT YAM 六自由度机械臂,配平行夹爪;双相机系统包括腕部 Intel RealSense D405(RGB-D, 640 × 360 )与固定头顶 Logitech BRIO(RGB, 1920 × 1080 ),均以 30,Hz 采集。 - **接口**:Agent-Robot Bridge 提供双向交互。机器人向智能体返回标定图像、深度、关节状态与末端位姿;智能体向机器人发送观察请求或动作指令(末端执行器位姿 `move_ee`、关节角 `move_joints`、夹爪 `gripper`)。 - **控制**:末端执行器目标经 Mink 求解逆运动学,底层轨迹满足速度/加速度约束;运动执行与智能体推理异步运行。 ### 模型与配置 - **默认模型**:GPT-6 Astra(高思考努力度,high thinking effort),模型权重全程冻结。 - **评估指标**:物理成功率(成功试验数/总试验数 s/N )、任务完成时间(分钟)、总 token 消耗(百万)、推理成本(USD)。所有主实验均从全新会话开始,无先验任务经验,无仿真预演。 —- ## 2. 主实验:多任务零样本操控 实验设计避开简单拾取-放置,转而评估四种任务组下的八个配置,每项任务在固定预算(时间、观察与动作请求次数)下执行。 ### 2.1 任务与配置 | 任务组 | 配置 | 核心能力 | 指令模态 | 试验数 | |————|———|—————|—————|————| | 四配对装配 | 八部件装为四对 | 长程推理 | 视频 | 10 | | 积木构建 | 金字塔 | 长程推理 | 图像 | 10 | | 积木构建 | 双塔 | 长程推理 | 图像 | 10 | | 积木构建 | 六块塔 | 长程推理 | 图像 | 10 | | 骰子翻转 | 六颗骰子全朝上 | 动作多样性 | 语言 | 10 | | 目标投掷 | 土豆抛入碗中 | 动作多样性 | 语言 | 2 | | 双手毛巾折叠 | 顺序折叠 | 物体多样性 | 视频 | 5 | | 双手毛巾折叠 | 同时折叠 | 物体多样性 | 视频 | 5 | ### 2.2 主要结果 - **四配对装配**:成功率 8/10 ,平均耗时 37.2 分钟,平均成本 16.62 。 - 积木构建:金字塔 10/10 ,双塔 10/10 ,六块塔 9/10 ;耗时与成本随结构复杂度递增(六块塔平均 28.2 分钟、 \ 14.93 )。 - **骰子翻转**:成功率 10/10 ,平均 37.9 分钟。 - **目标投掷**:成功率 2/2 ,实际抛掷动作平均在任务下发后 13.9 分钟完成,剩余时间用于轨迹分析与验证。 - **毛巾折叠**:顺序折叠 5/5 ,但平均耗时达 50.8 分钟;同时折叠成功率降至 3/5 ,凸显可变形物体协调操控的挑战。 ### 2.3 关键发现 - **强零样本性能**:八个配置中有七个成功率不低于 80% ,五个配置达 100% 。 - **复杂度与执行开销正相关**:六块塔的时间与 token 消耗显著高于金字塔与双塔;装配与毛巾折叠中,视觉观察与策略推理占据主要时间。 - **可变形物体仍是难点**:同时折叠的动态协调导致最低成功率,且顺序折叠虽成功但开销极高。 —- ## 3. 智能体与思考努力度对比实验 在**两配对装配**任务上,论文系统比较了不同模型与智能体框架(表 2)。 ### 对比配置 - **Codex 生态**:GPT-6 Astra(低/中/高努力度)、GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna(均高努力度)。 - **Claude Code 生态**:Claude Opus 5、Claude Fable 5.1(均高努力度)。 ### 结果 - GPT-6 Astra 在低、中、高三种努力度下均实现 5/5 成功,且时间稳定(约 9.2 分钟),表明该任务上额外思考努力度收益有限。 - GPT-5.6 Sol 同样 5/5 成功,但耗时更长( 14.2 分钟),推理成本更低。 - GPT-5.6 Terra 仅 1/5 成功,Luna 为 0/5 。 - Claude Opus 5 达 5/5 ,但耗时( 22.2 分钟)与成本显著高于 Astra;Claude Fable 5.1 仅 3/5 。 —- ## 4. 经验积累与迁移实验 为验证重复执行中经验复用对效率的提升,论文设计了两项研究: ### 4.1 同智能体经验积累 **协议**:选取两配对装配与环形拆卸-重装任务,各执行 5 个循环。第 1 次从零开始;每次执行后保存测量值、程序、修正记录;后续执行在全新上下文中读取并更新当前观测。 **结果**(图 2、表 7): - 两配对装配的任务执行时间从第 1 次到第 5 次下降 29.3% 。 - 推理与编程响应延迟下降 47.0% ,而工具执行时间仅微增 9.3% 。 - 环形任务在第 1 次后即趋于稳定。 - 日志分析显示:智能体复用了几何估计脚本、验证过的抓取/插入参数,并直接加载先前修正。 ### 4.2 强-弱智能体经验迁移 **协议**:先由能力更强、成本更高的 **GPT-6 Astra** 执行 5 次两配对装配并保存经验;随后将冻结的经验文件提供给更经济的 **GPT-5.6 Terra**。 **结果**(图 3): - Terra 无经验时成功率仅 1/5 ;加载 Astra 经验后提升至 4/5 。 - 在成功试验中,平均完成时间降低 34.3% (从 19.0 分钟降至 12.5 分钟),平均 token 消耗降低 11.4% (从 6.28 M 降至 5.56 M),推理成本同步下降。 —- ## 5. 补充实验与案例分析 ### 5.1 执行时间分解(附录 D.1) 对全部试验(含失败)进行时间拆解,分为:视觉循环(观察+模型响应)、剩余响应时间、本地工具、动作服务、检查与报告。结果显示,**视觉观察与策略决策**占总时间的主导部分,验证了降低推理延迟对实用化的重要性。 ### 5.2 跨本体执行(附录 G) 在**七自由度 P7 机械臂**配 **RealHand L6 灵巧手**(五根手指,六通道控制)上,测试 AGP 对异构硬件的适应性。实验展示了对瓶子的抓取与提升,表明 AGP 的接口驱动方式可迁移至不同臂形与末端执行器。 ### 5.3 错误与恢复案例(附录 H) 记录了一次**六块塔在撤臂过程中倒塌**的失败案例:智能体在检测到方块超出可达范围(径向限制 0.65,m )后终止尝试。该案例区分了可恢复的装配误差与导致任务不可继续的空间越界失败。 ### 5.4 附加编码智能体对比(附录 C) 在金字塔构建任务上补充对比 GPT-5.6 Sol 与 GPT-6 Astra(均高努力度)。Sol 为 7/10 ,Astra 为 10/10 ;尽管 Sol 单次成功成本更低,但其总成本(覆盖失败试验)与总 token 更高。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与讨论,以下方向值得进一步探索: —- ### 1. 推理效率与实时性优化 当前 AGP 的执行时间(数十分钟量级)与推理成本(单次数美元)仍是实用化的主要瓶颈。未来工作可围绕: - **模型轻量化与专用化**:探索针对机器人操控任务蒸馏专用模型,在保持视觉-语言-推理能力的同时降低 token 消耗与响应延迟; - **边缘部署**:将部分感知处理与几何计算从云端模型调用迁移至本地边缘节点,减少网络往返; - **自适应思考深度**:根据任务阶段与不确定性动态调节推理努力度(thinking effort),而非全程使用高努力度模式。 —- ### 2. 可变形物体与接触丰富型操作 双手毛巾折叠实验表明,**动态协调可变形材料**的成功率与稳定性显著低于刚性物体装配。关键问题包括: - **力/触觉感知集成**:当前接口主要依赖视觉与位姿反馈,引入腕部力矩或触觉传感器可能改善褶皱对齐、滑动检测与柔顺控制; - **显式物理建模**:在 runtime 程序中融入可变形体的简化物理模型(如质量-弹簧系统或数据驱动的形变先验),以预测折叠过程中的材料行为; - **双臂协调策略**:同时折叠的失败率高于顺序折叠,需研究双臂协同的时间同步与阻抗匹配机制。 —- ### 3. 经验积累的自动化与跨任务泛化 论文展示了通过文件保存实现同任务经验复用及强-弱智能体迁移,但机制相对初级: - **经验抽象与技能库构建**:将具体执行记录(如某一零件的抓取脚本)自动泛化为参数化技能模板(如“圆柱插入孔”原型),支持跨任务调用; - **检索增强型记忆**:引入向量数据库或程序摘要机制,使智能体在面临新场景时快速检索并组合历史经验,而非加载完整工作空间; - **持续学习**:研究如何在多次执行中自动识别并修正系统性误差(如相机标定漂移导致的重复定位偏差),实现无需人工干预的自校准。 —- ### 4. 鲁棒性与失败恢复 六块塔倒塌案例显示,当物体因失败超出工作空间限制时,AGP 缺乏有效的**场景重置与重规划**能力。可探索: - **分层恢复策略**:在高层设置“失败分类器”,区分可现场修正的误差(如位姿微调)、需局部重置的误差(如重新抓取)与需全局重置的误差(如人工干预); - **可达性预判**:在运动规划前评估潜在失败对后续操作的影响,避免将关键物体推入不可恢复区域; - **主动稳定性验证**:在撤臂、释放等关键转换点引入显式稳定性预测,而非仅依赖事后视觉检查。 —- ### 5. 跨本体迁移的系统化验证 附录 G 中 P7 臂与 L6 灵巧手的初步实验表明 AGP 可适配不同硬件,但尚未进行大规模量化评估: - **异构末端执行器**:系统研究平行夹爪、多指灵巧手、吸盘等不同抓取模态下的接口设计与动作生成策略; - **自由度差异**:六轴、七轴臂及冗余关节的运动学利用(如避障、姿态优化); - **即插即用本体**:建立统一的机器人能力描述语言,使 AGP 在未见过的机器人平台上通过阅读文档即可快速适配。 —- ### 6. 利用 AGP 生成训练数据以蒸馏专用策略 论文指出 AGP 收集的轨迹可用于训练视觉-语言-动作(VLA)策略。未来可研究: - **数据筛选与课程生成**:如何从 AGP 的成功与失败轨迹中自动筛选高质量演示,并设计课程学习序列以训练更高效的专用策略; - **策略蒸馏**:将 AGP 的推理能力蒸馏为端到端策略,实现毫秒级动作生成,同时保留部分 AGP 的语义理解与任务分解能力; - **负样本利用**:利用 AGP 的失败案例与恢复过程,训练鲁棒的故障检测与恢复策略。 —- ### 7. 感知系统的主动性与多模态扩展 当前 AGP 主要使用固定头顶与腕部 RGB-D 相机,未来可扩展: - **主动感知**:赋予智能体控制额外自由度(如相机云台、腕部多角度观察)的能力,以最小化遮挡并最大化信息增益; - **多模态融合**:整合触觉、力觉、音频(如插入成功的咔哒声)等模态,弥补纯视觉在透明/反光物体或接触状态判断上的不足; - **动态场景**:从静态桌面场景扩展至包含移动障碍物、非结构化堆叠的复杂环境。 —- ### 8. 安全机制与社会影响 附录 I 强调了物理交互的风险,需进一步建立: - **独立安全监控层**:与 AGP 决策并行的硬实时安全模块,对速度、力矩、工作空间进行约束,防止模型幻觉导致的危险动作; - **人机协作**:研究 AGP 在人类共享工作空间中的安全停障、意图预测与协作策略; - **可解释性**:增强 AGP 决策过程的透明度,使操作者能够理解并预判机器人的下一步动作,便于在关键节点进行监督。 —- ### 9. 长程任务中的错误传播控制 随着任务步数增加,早期微小误差(如积木塔的毫米级错位)可能通过接触链放大。未来可探索: - **累积误差估计**:在 runtime 中维护位姿不确定性的概率传播模型,当不确定性超过阈值时触发重新观测; - **中间目标验证**:在长程序列中插入显式的“稳定性检查点”,确保子装配满足局部几何约束后再继续后续操作。 —- ### 10. 多智能体分布式操控 当前双手操作由单一智能体集中控制两臂。对于更复杂的多机器人场景: - **分布式任务分配**:多个 AGP 实例各自控制独立机器人,通过通信协商分工; - **对抗单点故障**:当某一智能体或机器人失效时,系统如何动态重组任务计划。 Q6: 总结一下论文的主要内容 该论文提出 **Agent as Policy (AGP)** 框架,旨在将通用多模态大语言模型(MLLM)智能体的推理与编程能力直接扩展至物理机器人操控,实现无需任务特定或环境特定训练的零样本任务执行。 —- ### 1. 研究动机 现有基于智能体的机器人系统主要分为两类: - **预生成程序**:提前输出代码或计算图,运行时按固定逻辑执行,难以应对不确定的观测与意外的物理结果; - **策略编排**:在已训练的技能库中选择并调度策略,但运动生成能力受限于预训练策略本身。 物理操控任务往往要求在运行时刻**联合推理**当前场景、已尝试的动作及其结果(如插入失败后需重新估计对齐或改变接近方向)。为此,论文提出将通用智能体本身作为机器人策略,使其在任务执行全周期内自主控制感知、推理与动作生成。 —- ### 2. 核心方法 #### 2.1 智能体作为策略 AGP 将通用编码智能体直接部署为机器人策略,其决策过程可形式化为:
uk sim π(θ)(· mid g, I, H_k, W_k)
其中 u_k 为第 k 步的工具调用, g 为任务规范, I 为机器人接口, H_k 为历史交互, W_k 为工作空间文件。模型参数 θ 全程冻结,所有适应性均通过上下文推理与程序修订实现。 #### 2.2 双阶段架构 - **任务准备**:由准备智能体根据用户请求(视频/图像/语言)生成可复用的**任务定义**,明确目标、约束、完成标准与接口规则。 - **任务执行**:执行智能体读取任务定义,通过**Agent-Robot Bridge** 与机器人闭环交互。桥接层提供标定相机观测、几何查询、本体状态反馈,以及末端执行器位姿、关节角、夹爪控制等标准化动作接口。 #### 2.3 运行时编程与闭环适应 执行智能体在任务过程中现场编写 Python 程序,用于: - 视觉处理与几何计算(如深度点云处理、表面拟合、三角测量); - 运动目标生成与机器人调用组合; - 根据动作执行反馈与新观测修订后续策略。 机器人动作执行与智能体推理异步进行,允许智能体在机器人运动时并行规划下一步。 —- ### 3. 实验验证 #### 3.1 主实验:多任务零样本操控 在 I2RT YAM 六自由度机械臂(配平行夹爪与 RGB-D 相机)上,评估了覆盖长程推理、动作多样性与物体多样性的五项真实任务: | 任务 | 指令模态 | 核心挑战 | 成功率 | |———|—————|—————|————| | 四配对装配 | 视频 | 长程推理、精密插入 | 8/10 | | 积木构建(金字塔/双塔/六块塔) | 图像 | 长程推理、结构稳定性 | 10/10, 10/10, 9/10 | | 骰子翻转 | 语言 | 动作多样性、抓取依赖重定向 | 10/10 | | 目标投掷 | 语言 | 动态释放、定时控制 | 2/2 | | 双手毛巾折叠(顺序/同时) | 视频 | 可变形物体、双臂协调 | 5/5, 3/5 | #### 3.2 模型与配置对比 在双配对装配任务上对比了多种模型(GPT-6 Astra、GPT-5.6 Sol/Terra/Luna、Claude Opus 5、Claude Fable 5.1)及思考努力度。GPT-6 Astra 在各努力度下均实现 5/5 成功,且显著优于部分较弱模型(如 Terra 1/5,Luna 0/5)。 #### 3.3 经验积累与迁移 - **同智能体经验积累**:GPT-6 Astra 在双配对装配任务上重复执行 5 次,通过保存并复用几何估计、抓取参数与修正记录,任务执行时间降低 29.3%,推理与编程延迟降低 47.0%。 - **强-弱智能体迁移**:将 GPT-6 Astra 冻结的经验文件提供给 GPT-5.6 Terra,后者成功率从 1/5 提升至 4/5,成功试验平均耗时降低 34.3%,token 消耗降低 11.4%。 —- ### 4. 主要结论与局限 **主要结论**: - AGP 证明通用基础 MLLM 可直接作为真实机器人策略,通过运行时推理、编程与物理交互实现多样化的零样本操控。 - 任务经验的文件化积累与复用能显著提升执行效率,并支持跨智能体迁移。 **关键局限**: - **执行开销**:单任务耗时数十分钟、推理成本数美元,距离实时应用仍有差距; - **可变形物体操控**:双手同时折叠毛巾的成功率较低(3/5),动态协调与可变形材料建模仍是挑战; - **安全性**:物理交互存在因感知误差或程序错误导致设备损坏的风险,需独立的安全监控层。 该研究为利用通用智能体的推理与编程能力进行物理机器人控制提供了可行性证据,并为未来在效率、鲁棒性与多模态感知方面的优化指明了方向。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Mengzhao Jia,Yang Lin,Xixin Zhang,Zhihan Zhang,Xiaobai Liu,Meng Jiang
Categories:
PDF URL: https://arxiv.org/pdf/2609.12541.pdf
Arxiv URL: https://arxiv.org/abs/2609.12541
Arxiv ID: 2609.12541
CoolPaper URL: https://papers.cool/arxiv/2609.12541
Published: 2026-09-16T01:39:03.341Z
Updated: 2026-09-16T01:39:03.341Z
19. Not All Prompts Are Equal: Exploration-Guided Prompt Scaffolding for Multimodal Reinforcement Post-Training
Abstract:Training prompts in online reinforcement learning (RL) differ substantially in how informative they are for the current policy: some are already saturated while others are too difficult to yield reliable learning signals, yet both receive equal rollout budget under standard training. We propose an exploration-guided prompt scaffolding framework that adapts the training prompt distribution dynamically throughout RL post-training of multimodal large language models (MLLMs). Central to our approach is the $\textit{Exploration Potential Score} (EPS)$, a lightweight rollout-based proxy for prompt utility derived from KL-regularized policy improvement theory, computable directly from on-policy rollout statistics without additional overhead. Rather than discarding low-utility prompts, we use a teacher model to generate scaffolded rewrites that preserve the original task intent while making subsequent training more informative, reframing teacher supervision as training-data refinement rather than output imitation. Integrated with GRPO on Geo3K and MMK12, our method consistently outperforms the baseline on both in-domain and out-of-distribution benchmarks, achieving up to 9.7\% relative improvement in-domain and gains of 11.5\% on MathVision and 11.1\% on MMMU-Pro.
中文摘要
摘要:在线强化学习(RL)中的训练提示在对当前策略提供信息量方面差异显著:有些提示已经饱和,而有些又过于困难,难以产生可靠的学习信号,但在标准训练下两者都获得相同的展开预算。我们提出了一种探索引导的提示支架框架,该框架在多模态大语言模型(MLLMs)RL后训练过程中动态调整训练提示分布。我们方法的核心是$ extit{探索潜力评分}(EPS)$,这是一个轻量级的基于展开的提示效用代理,源自KL正则化策略改进理论,可以直接从策略内展开统计数据计算,无需额外开销。我们并不丢弃低效提示,而是使用教师模型生成支架化重写,这些重写在保持原始任务意图的同时,使后续训练更具信息性,将教师监督重新构想为训练数据改进,而非输出模仿。在Geo3K和MMK12上与GRPO结合使用时,我们的方法在域内和分布外基准测试中均持续优于基线,在域内实现了最高9.7%的相对提升,并在MathVision和MMMU-Pro中分别获得11.5%和11.1%的提升。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.15051 (HTTP 429)
Authors: Yuanhao Yue,Qianli Ma,Chengyu Wang,Haoting Wang,Lei Shen,Jun Huang
Categories:
PDF URL: https://arxiv.org/pdf/2609.15051.pdf
Arxiv URL: https://arxiv.org/abs/2609.15051
Arxiv ID: 2609.15051
CoolPaper URL: https://papers.cool/arxiv/2609.15051
Published: 2026-09-16T01:39:03.761Z
Updated: 2026-09-16T01:39:03.761Z
20. Pick Your Poison: Learning to Select Poison Sets for Stronger LLM Backdoor Attacks
Abstract:Backdoor poisoning attacks add poisoned examples to otherwise-clean finetuning data, pairing a trigger with a target behavior that the model learns to produce when the trigger appears. Existing evaluations typically fix the number of poisoned examples and sample them at random from a candidate pool. We show that this can severely underestimate worst-case vulnerability: across three LLaMA-3-8B backdoor settings, holding the model, clean data, and poison count fixed, attack success ranges from 3% to 80% depending only on which poison set is chosen. We formalize poison selection as oracle-budgeted set optimization and introduce SAILS (Set-level Audit-Informed Iterative Learned Selection), which learns a set scorer from a few hundred finetune-and-evaluate runs, ranks millions of candidate sets, and audits only a small shortlist. SAILS improves held-out attack success by 30 percentage points on average over the strongest influence baselines, transfers from small-scale to full-scale finetuning, and extends to code-generation, agentic, and API-only backdoors.
中文摘要
摘要:后门中毒攻击在原本干净的微调数据中加入被中毒的样本,将触发器与模型在触发器出现时会生成的目标行为配对。现有评估通常固定中毒样本数量并从候选池中随机抽取。我们表明,这可能严重低估最差情况下的脆弱性:在三种 LLaMA-3-8B 后门设置中,固定模型、干净数据和中毒数量时,攻击成功率仅根据选择的中毒集合不同而在 3% 到 80% 之间变化。我们将中毒选择形式化为具有神谕预算的集合优化,并引入 SAILS(基于集合审计的迭代学习选择),该方法从几百次微调与评估运行中学习集合评分器,对数百万候选集合进行排序,仅审核少量候选集。SAILS 相对于最强影响基线平均提升了 30 个百分点的未见攻击成功率,可从小规模迁移到全规模微调,并扩展到代码生成、智能体及仅 API 的后门场景。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.15029 (HTTP 429)
Authors: Aashiq Muhamed,Mona T. Diab,Virginia Smith,Andrew Ilyas,Matthew Jagielski
Categories:
PDF URL: https://arxiv.org/pdf/2609.15029.pdf
Arxiv URL: https://arxiv.org/abs/2609.15029
Arxiv ID: 2609.15029
CoolPaper URL: https://papers.cool/arxiv/2609.15029
Published: 2026-09-16T01:39:04.330Z
Updated: 2026-09-16T01:39:04.330Z