数据来源:HuggingFace Papers

Latest Papers

1. DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression

Abstract:The widespread adoption of long-horizon agents has made model workloads increasingly input-heavy. Although prior work has substantially reduced the cost of long-context computation, prefill remains computationally expensive, and large KV caches continue to strain HBM and SSD capacity and data-transfer bandwidth. Together, these compute, storage, and bandwidth demands constitute the primary bottleneck to further lowering deployment costs. To address this challenge, we introduce DeepSeek-V4.1-Flash, a multimodal Mixture-of-Experts (MoE) model with 552B backbone parameters and support for contexts of up to one million tokens. With its Causal Encoder-Decoder (CED) architecture, the model activates 16B parameters per token during decode but only 8B parameters during prefill, substantially improving cost efficiency for agentic workloads. To push the limits of KV cache compression, DeepSeek-V4.1-Flash combines cross-layer KV cache reuse in Compressed Sparse Attention 2 (CSA2) with FP4 KV caching. These designs reduce its global KV cache footprint (always in HBM) to 890 bytes per token, roughly 1/4 of the corresponding footprint of DeepSeek-V4-Flash. Further, through a dedicated deployment optimization known as SWA Bounded Replay, DeepSeek-V4.1-Flash reduces its persistent KV cache footprint (always on SSD or in host memory) to roughly 1/8 of that of DeepSeek-V4-Flash. Despite its much smaller KV cache footprint, the model delivers substantially better performance than the baseline. In addition, we streamline the DeepSeek-V4 architecture and introduce several efficient architectural extensions. We pretrain DeepSeek-V4.1-Flash on a multimodal corpus comprising 45T tokens and conduct comprehensive post-training, yielding strong performance across diverse text-based and multimodal agentic scenarios. Model checkpoints are available at this https URL.

中文摘要

摘要:长时间视野智能体的广泛采用使得模型计算负载越来越依赖输入。尽管先前的工作大幅降低了长上下文计算的成本,但预填仍然计算量高,大型KV缓存继续对HBM和SSD容量及数据传输带宽造成压力。这些计算、存储和带宽需求共同构成了进一步降低部署成本的主要瓶颈。为了解决这一挑战,我们引入了DeepSeek-V4.1-Flash,一种多模态专家混合(MoE)模型,拥有552B主干参数,并支持高达一百万标记的上下文。借助其因果编码器-解码器(CED)架构,该模型在解码时每个标记激活16B参数,而在预填时仅激活8B参数,显著提高了智能体工作负载的成本效率。为了推动KV缓存压缩的极限,DeepSeek-V4.1-Flash在压缩稀疏注意力2(CSA2)中结合了跨层KV缓存重用与FP4 KV缓存。这些设计将其全局KV缓存占用(始终在HBM中)降低到每个标记890字节,大约是DeepSeek-V4-Flash对应占用的1/4。此外,通过一种名为SWA有界重放的专用部署优化,DeepSeek-V4.1-Flash将其持久KV缓存占用(始终在SSD或主机内存中)降低到约DeepSeek-V4-Flash的1/8。尽管KV缓存占用大幅减少,该模型的性能仍显著优于基线。此外,我们优化了DeepSeek-V4架构,并引入了若干高效的架构扩展。我们在包含45T标记的多模态语料上对DeepSeek-V4.1-Flash进行了预训练,并进行全面的后训练,使其在各种基于文本和多模态的智能体场景中表现优异。模型检查点可通过此https URL获取。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*长程智能体(long-horizon agents)部署中的KV缓存瓶颈问题\*\*,具体表现为长上下文场景下的计算、存储与通信成本制约。 ### 核心问题 随着长程智能体的广泛采用,模型工作负载日益呈现\*\*输入密集型(input-heavy)\*\*特征。尽管先前工作已显著降低长上下文推理的计算开销,但以下瓶颈仍严重阻碍部署成本的进一步下降: - \*\*Prefill阶段计算昂贵\*\*:处理新输入或缓存未命中时,完整的预填充计算成本高昂; - \*\*运行时KV缓存容量压力\*\*:全局KV缓存(global KV cache)受限于HBM容量,随序列长度增长而膨胀; - \*\*持久化KV缓存与I/O瓶颈\*\*:用于前缀复用的持久化KV缓存(persistent KV cache)受限于SSD和主机内存容量,且缓存迁移与加载受限于互连带宽。 ### 解决目标 为应对上述挑战,论文提出 \*\*DeepSeek-V4.1-Flash\*\*,旨在通过模型架构、缓存精度与部署策略的联合优化,\*\*将KV缓存压缩推向极限\*\*,从而: 1. \*\*降低运行时全局KV缓存占用\*\*:通过跨层KV复用(CSA2)与FP4量化,将每token全局KV缓存降至约890字节,约为DeepSeek-V4-Flash的 1/4 ; 2. \*\*削减持久化KV缓存占用\*\*:通过SWA Bounded Replay机制,将持久化KV缓存降至DeepSeek-V4-Flash的约 1/8 ; 3. \*\*保持或提升模型能力\*\*:在大幅降低缓存与计算开销的同时,在文本与多模态智能体任务上取得更优性能。 Q2: 有哪些相关研究? 这篇论文的相关研究主要围绕\*\*KV缓存压缩\*\*、\*\*稀疏注意力机制\*\*、\*\*高效Transformer架构\*\*、\*\*低精度量化\*\*以及\*\*多模态训练\*\*等方向展开,具体可分为以下几类: ### 1. 稀疏注意力与KV缓存压缩 为降低长序列推理中的KV缓存开销,已有工作从多个维度探索压缩策略: - \*\*头维度压缩\*\*:GQA(Ainslie et al., 2023)通过减少KV头数量降低缓存;MLA(DeepSeek-AI, 2024)则跨头共享紧凑潜变量。 - \*\*序列维度压缩\*\*:DeepSeek-V4中的CSA与HCA(DeepSeek-AI, 2026b)将每 m 个token压缩为一条缓存条目。CSA2在此基础上进一步移除条目重叠与绝对位置编码,并简化索引器路径。 - \*\*层维度复用\*\*:IndexCache(Bai et al., 2026)跨层复用Top-K索引;YOIO(Sun et al., 2026b)一次性计算稀疏路由并跨层共享;HySparse(Gao et al., 2026)令稀疏层复用密集层的KV缓存。这些工作启发了CSA2的跨层KV与索引复用设计。 - \*\*层次化索引\*\*:HiSA(Xu et al., 2026b)通过块级表示剪枝加速索引,本文的Hierarchical Sparse Indexer则利用解码器中浅层索引器的输出限制深层搜索域。 ### 2. 高效序列处理架构 - \*\*因果编码器-解码器(CED)\*\*:受YOCO(Sun et al., 2024)启发,CED将底层一半层作为编码器,使解码器全局KV可直接从编码器最终隐状态投影,从而将近半的prefill计算量削减至 O(NL/2) 。 - \*\*混合专家(MoE)\*\*:延续DeepSeekMoE(Dai et al., 2024)的共享专家与细粒度路由设计,并引入针对文本与图像token的模态特定负载均衡(Wang et al., 2024a)。 - \*\*残差流优化\*\*:mHC(Xie et al., 2026)维护多条残差流;本文提出的Single-Pass mHC通过将混合系数延迟一个块,实现核融合并将激活内存流量减半。 ### 3. 记忆增强与推测解码 - \*\*Engram\*\*(Cheng et al., 2026b/c):通过可扩展查找表实现条件化记忆,将记忆与计算解耦。本文将其集成以强化模型能力,并采用基于动量的Sinkhorn平衡优化嵌入表。 - \*\*DSpark\*\*(Cheng et al., 2026a):结合半自回归草稿生成与置信度调度验证的推测解码架构,用于提升解码吞吐。不同于V3中联合训练的MTP模块,DSpark在预训练后单独训练。 ### 4. 低精度量化与训练优化 - \*\*FP4缓存格式\*\*:采用OCP标准的MXFP4(Rouhani et al., 2023)与NVFP4(Alvarez et al., 2025)的E2M1配置,对主KV缓存执行量化感知训练(QAT; Jacob et al., 2018),在保持跨硬件兼容性的同时将存储减半。 - \*\*优化器\*\*:线性层使用Muon(Jordan et al., 2024)及其头感知变体;RMSNorm等使用AdamW(Loshchilov and Hutter, 2019);Engram嵌入表则采用Sinkhorn平衡更新(与SinkGD、Adafactor等矩阵轴归一化方法相关)。 ### 5. 多模态预训练 - \*\*视觉编码器\*\*:基于Vision Transformer(Dosovitskiy et al., 2021),采用2D-RoPE、RMSNorm(Zhang and Sennrich, 2019)与SwiGLU(Shazeer, 2020)构建DeepSeek-ViT。 - \*\*对比学习\*\*:视觉编码器预训练使用SigLIP(Zhai et al., 2023)的sigmoid对比损失。 - \*\*数据质量评估\*\*:多模态数据清洗中采用SmolVLM(Marafioti et al., 2025)进行质量打分。 ### 6. 智能体评估基准 论文在大量文本与多模态智能体基准上验证效果,包括: - \*\*代码智能体\*\*:Terminal-Bench(Marten et al., 2026a/b; Merrill et al., 2026)、DeepSWE(DataCurve, 2026)、SWE-Bench、ProgramBench(Yang et al., 2026)等; - \*\*通用与视觉智能体\*\*:AutomationBench(Shepard and Salimans, 2026)、Agents' Last Exam(Sun et al., 2026a)、Chartography(Garre et al., 2026)、BabyVision(Chen et al., 2026)等; - \*\*推理基准\*\*:GPQA Diamond(Rein et al., 2023)、Humanity's Last Exam(Phan et al., 2025)、MATH(Hendrycks et al., 2021)等。 Q3: 论文如何解决这个问题? 论文通过\*\*模型架构、缓存精度、部署策略与基础设施的联合优化\*\*来解决长上下文智能体部署中的KV缓存与计算瓶颈。具体解决方案可分为以下七个层面: --- ### 1. 因果编码器-解码器(CED)架构 为削减输入密集型工作负载中的prefill计算量,论文将40层Transformer网络划分为\*\*20层因果编码器\*\*与\*\*20层解码器\*\*。 - \*\*全局KV投影\*\*:对于解码器层( l > L/2 ),其全局KV并非由当前层隐状态计算,而是直接从第 L/2 层(编码器末层)的隐状态 H_(L/2) 经层相关投影矩阵得到:

Cl = H(L/2) W(KV)^l, quad Z_l = H(L/2) WZ^l, quad l > (L) / (2)
其中 C 为KV条目, Z 为压缩权重。这使得prefill阶段只需计算前半部分层,近半prefill计算被消除,prefill时每token激活参数从16B降至**8B**。 - **局部SWA保留**:滑动窗口注意力(SWA)仍在所有层按常规层间计算,以保证局部KV生成的计算深度。 - **复杂度**:对于序列长度 N gg n
(win) ,prefill复杂度从 O(NL) 降至 O(NL/2 + n(win) × L/2) ≈ O(NL/2) 。 —- ### 2. 压缩稀疏注意力2(CSA2) CSA2沿**条目尺寸、序列维度、层维度**三个乘法维度联合压缩KV缓存,并引入跨层复用机制。 - **三种静态运行模式**: - **Full Mode**:完整计算主KV、索引器K,并生成全新Top-K索引。 - **Reindex Mode**:复用前置层的**主KV与索引器K**,但使用当前层的索引器Q重新评分并生成新的Top-K索引。 - **Reuse Mode**:复用前置层的**主KV与最新的Top-K索引**,直接执行稀疏注意力,不再进行索引计算。 - **跨层共享收益**:主KV与索引器K的跨层共享削减了缓存存储;索引复用避免了额外的索引器计算。与CED结合时,解码器中Full Mode层从编码器末层隐状态计算全局KV,其余层复用。 - **简化压缩路径**:相比V4的CSA,CSA2移除了相邻压缩条目间的重叠与绝对位置编码,并将索引器K直接由主KV投影得到,提升了训练效率。 - **层次化稀疏索引器(Hierarchical Sparse Indexer)**:在解码器中,首个Full Mode层扫描全部上下文并选出Top-K索引,同时构建一个**共享候选池**(如从2,048个块中选取16,384个候选位置)。后续Reindex Mode层仅在该候选池内评分选Top-K,将每查询的索引评分代价从**线性于上下文长度**变为**常数**。 —- ### 3. FP4主KV缓存量化 为进一步压缩运行时KV缓存,论文将主KV缓存(global KV)量化至**FP4**。 - **格式选择**:采用OCP标准的MXFP4格式中的E2M1配置,每16个通道配一个E4M3尺度因子,省略第二级全局尺度。该格式最大可表示量级约为 448 × 6 = 2688 ,而实际缓存经RMSNorm与RoPE后的最大幅值约为 √512 ≈ 22.6 ,动态范围充足。 - **量化位置**:在RoPE**之后**执行量化,非RoPE与RoPE组件使用相同格式;SWA KV缓存仍保留FP8,因其对量化更敏感。 - **训练方式**:通过后训练阶段的量化感知训练(QAT)引入,与FP8相比几乎**将主KV缓存存储减半**。 —- ### 4. SWA有界重放(SWA Bounded Replay) 这是部署层面的关键优化,用于消除持久化KV缓存中的SWA KV存储。 - **核心洞察**:SWA的实际有效感受野远小于理论值 L × n(win) 。因此,无需重放 L × n(win) 个token来精确重建SWA状态。 - **Encoder SWA Bounded Replay**:当编码器SWA KV缺失时,仅重放缓存前缀的**最后 n(win) 个token**,与未缓存后缀一并处理。重放部分仅生成SWA KV,全局KV直接复用缓存而不重新计算。重建状态虽为近似,但实验表明对生成质量影响可忽略。这使得SWA KV无需持久化到SSD,仅需保存在主机DRAM的短期内存池中。 - **Decoder SWA Bounded Replay**:在CED架构下,若需在长缓存前缀后执行解码器prefill,无需运行全部 L/2 层处理 L/2 × n(win) 个token;仅重放最后 n(win) 个token即可近似生成解码器SWA KV,供后续解码使用。 - **收益**:SWA KV从持久化缓存中移除,加上全局KV已通过CSA2与FP4压缩,持久化KV缓存总量降至DeepSeek-V4-Flash的约 ** 1/8 **。 —- ### 5. 高效架构扩展 - **Single-Pass mHC**:对原始多残差流mHC进行改进,将输入混合系数延迟一个块(使用 A_(l-1) 而非 A_l ),消除了残差更新与输入混合间的数据依赖。部署时通过**Mega-mHC**核融合,将残差只读一次、只写一次,激活内存流量从 (4n+4)d 降至理论下界 (2n+2)d ,相比原始实现**减半**。 - **Engram**:集成条件记忆模块,提供196B参数的稀疏查找记忆能力,采用基于动量的Sinkhorn平衡更新,并在推理时通过RDMA预取实现高效访问。 - **DSpark**:引入半自回归草稿生成与置信度调度验证的推测解码模块,在 backbone 预训练完成后单独训练,用于加速在线服务与RL rollout。 —- ### 6. 训练与推理基础设施的协同优化 - **CSA2分布式训练支持**:通过Shadow Indexers(跨流水线阶段的轻量可执行副本)、流水线载荷扩展(跨阶段传递中间表示与稀疏路由信息)以及微批次级共享状态管理,实现跨层KV/索引复用在分布式流水线中的透明执行。 - **多模态长序列训练**:采用解耦视觉编码器、图像分片加载(balanced image sharding)与增量图像传输,避免超长序列中的I/O与CPU瓶颈。 - **推理系统**: - 采用**Encoder-Prefill-Decode(EPD)解耦**,使各阶段独立扩缩容。 - 推理核高度融合:CSA2 Reuse Mode层在prefill时仅需**15个核**,decode时仅需**11个核**。 - 将长生命周期的全局KV与短生命周期的编码器SWA KV在主机内存中分离管理。 —- ### 7. 数据工程与后训练 - **预训练**:在**45T多模态token**上预训练,序列长度64K起步且直接训练稀疏注意力(无密集注意力warmup),在34T token处将长度扩展至1M。 - **大规模智能体任务合成**: - **通用智能体**:基于真实工作流构建mock工具与多轮交互环境。 - **代码智能体**:从GitHub仓库与真实会话中自动构建可验证的容器化环境,支持fail-to-pass与pass-to-pass评估点。 - **异步强化学习**:在DSec沙盒平台上运行大规模异步RL,支持百万级并发容器、可抢占安全恢复与异构脚手架联合训练。 - **可控推理力度(Controllable Reasoning Effort)**:在RL中引入标量力度 b ∈ 1,dots,100 ,通过指数衰减的token惩罚项

r^(len)(b,j) = -min{C(max), k(b),ell(b,j)L(norm)}, quad k(b) = k0 exp(-b-b(min)τ)
使模型学会根据力度指令调节推理长度,实现部署时的成本-质量灵活权衡。 - **on-policy蒸馏(OPD)**:最终阶段使用40余个教师模型进行大规模全词表蒸馏,进一步提升综合能力。 Q4: 论文做了哪些实验? 论文中的实验覆盖了**预训练能力验证**、**后训练推理与智能体性能评估**、**架构效率基准测试**、**推理力度控制**、**跨脚手架泛化**、**多智能体扩展**以及**强化学习规模定律**等多个维度,具体可归纳如下: —- ### 1. 预训练基座模型评估(§4.3) 在严格控制的内部评估框架下,将 **DeepSeek-V4.1-Flash-Base** 与 **DeepSeek-V4-Flash-Base** 及 **DeepSeek-V4-Pro-Base** 进行对比,覆盖五个维度: - **世界知识**:AGIEval、MMLU-Pro、C-Eval、MultiLoKo、SimpleQA-Verified、SuperGPQA - **语言理解与推理**:BBH、BBEH、DROP、HellaSwag - **代码与数学**:BigCodeBench、HumanEval、GSM8K、MATH、MGSM - **长上下文**:LongBench-V2 - **多模态**:MMMU-Pro、DocVQA、CVBench、RefCOCO/RefCOCO+/RefCOCO-g 此外,在内部研发的专有语料(含内部文档、代码库与学术材料)上执行了**困惑度测试**(Bits-per-Byte, BPB),验证基座模型在真实研发场景中的语言建模能力(Figure 6)。 —- ### 2. 后训练综合基准评估(§5.3.2) 将后训练后的 **DeepSeek-V4.1-Flash**(Max reasoning effort)与多个开源/闭源前沿模型(Opus-5、GPT-5.6 Sol、Kimi-K3、GLM-5.3、DS-V4-Pro、DS-V4-Flash)对比,评估分为: - **核心推理**:GPQA Diamond、Humanity’s Last Exam(HLE)、Codeforces(内部基准)、MathArena Apex - **代码智能体**:Terminal-Bench 2.1/3.0/4.0、DeepSWE v1.1、ProgramBench、NL2Repo-Bench - **网络安全**:SEC-Bench Pro、CyberGym、ExploitGym - **通用智能体**:AutomationBench、Agents’ Last Exam(ALE-CLI) - **视觉智能体**:Chartography、BabyVision、ZeroBench-main 结果显示,尽管激活参数远小于V4-Pro,V4.1-Flash 在绝大多数智能体与推理基准上达到或超越闭源前沿水平(Table 3)。 —- ### 3. 可控推理力度实验(§5.1.4, §5.3.3, §5.3.5) 为验证标量 effort b 对推理成本与质量的调控能力,系统性地在 b ∈ 25, 40, 60, 80, 100 上进行了实验: - **推理密集型基准**:在 AIME 2026、Apex 2025 Shortlist、GPQA Diamond、HLE-Text、IMO-AnswerBench、LiveCodeBench、MathArena Apex、SimpleQA-Verified 等8个基准上,准确率随 b 单调提升,输出长度呈平滑增长(Figure 12)。 - **智能体任务**:在 DeepSWE v1.1 与 Terminal-Bench v2.1 上,Pass@1 随 effort 提升而增加,从 b=25 到 b=100 平均输出长度增长约 2.5× (Figure 9)。 - **API 预设映射**:验证了公开 API 的三个 preset(low= 50 , high= 75 , max= 100 )在实际部署中的可行性(Table 2)。 —- ### 4. 跨脚手架(Cross-Scaffold)泛化实验(§5.3.4) 为验证模型能力不依赖于单一智能体框架,在 **Max effort** 下测试了8种来自6个脚手架家族的配置: - Claude Code(v2.1.251 等4个版本) - Codex - OpenCode - Pi - mini-SWE - DeepSeek Harness(Minimal / Standard / PTC) 在 DeepSWE v1.1 与 Terminal-Bench v2.1 上评估 Pass@1/Resolved 指标(Table 4),并在多个 effort 等级下追踪输出长度与准确率变化(Figure 11)。结果表明模型性能在不同系统提示、工具定义与交互协议下保持稳健。 —- ### 5. 多智能体协作实验(§5.3.5) 使用 DeepSeek Harness 的 **Agent Team 模式**,对比单智能体与多智能体配置在以下设定下的表现: - **任务**:ProgramBench(高置信子集,172个 golden tasks)与 FrontierSWE v2(no-GPU 子集) - **指标**:ProgramBench 采用 Almost@1(单个 rollout 得分 ≥ 0.95 的比例);FrontierSWE v2 采用 Mean@5 - **时间截止线**:1h、2h、4h、8h、12h(ProgramBench)及 1h–20h(FrontierSWE v2) 实验显示,在每一时间预算下,多智能体配置均优于单智能体(Figure 10)。例如,在 ProgramBench 上8小时截止时,多智能体 Almost@1 达 30.04% ,单智能体为 20.39% 。 —- ### 6. 强化学习规模扩展实验(§5.1.2, §5.1.3) 通过大规模异步 RL 验证持续扩展训练 compute 与数据规模的收益: - **单脚手架内扩展**:在 Terminal-Bench v2.1/v3.0、DeepSWE v1.1、SWE-Bench Pro 上,随累积 RL 步数增加,Pass@1 持续提升(Figure 7)。 - **跨版本/跨脚手架扩展**:通过 model merging 重初始化连续 RL 运行,在 DeepSWE v1.1 上联合训练多个 Claude Code 版本(Figure 8左)及异构脚手架(OpenCode、Pi、DSH 等,Figure 8右),均观察到进一步增益。 - **上下文长度扩展**:将最大上下文从 512K 扩展至 1M,在超长程任务 Terminal-Bench v3.0 上继续获得提升(Figure 7)。 —- ### 7. 架构效率验证实验 - **KV 缓存占用**:对比了 DeepSeek 各代模型的 per-token global KV cache size(bytes),V4.1-Flash 达到约 890 bytes/token,约为 V4-Flash 的 1/4 、V1 的 1/437 (Figure 1b)。 - **解码计算量**:测量 single-token decode FLOPs 随上下文长度的变化。从 4K 扩展到 1M( 256× ),V4.1-Flash 的 decode FLOPs 仅增长 1/4 ,近乎恒定(Figure 2)。 - **CSA2 推理核效率**:验证了 CSA2 Reuse Mode 层在 prefill 时仅需 15 个 kernel、decode 时仅需 11 个 kernel,实现了高吞吐低延迟的推理流水线(§3.2)。 Q5: 有什么可以进一步探索的点? 基于论文第6节(Conclusion, Limitations, and Future Directions)及全文讨论,可进一步探索的方向包括: —- ### 1. 架构鲁棒性边界与压力测试 尽管 DeepSeek-V4.1-Flash 在已评估场景中未观察到系统性退化,但 CSA2 的**跨层索引复用**与 SWA Bounded Replay 的**近似状态重建**引入了尚未完全表征的鲁棒性边界: - **极端上下文下的稀疏检索可靠性**:CSA2 依赖层次化稀疏索引器限制搜索域,在超长序列(接近1M token)的极端分布或对抗性输入下,跨层索引传播中的选择误差是否会被放大仍需系统性压力测试。 - **缓存恢复边界的 SWA 状态一致性**:Encoder/Decoder SWA Bounded Replay 在缓存命中/未命中交替的复杂多轮会话中,近似重建的累积误差对生成质量的长期影响有待更深入的分析。 - **动态负载下的性能保证**:Hierarchical Sparse Indexer 的候选池大小固定,在上下文长度动态变化时,其检索质量与计算收益的权衡曲线需进一步刻画。 —- ### 2. 评估协议与基准的持续演进 论文指出,标准基准已日益饱和,且现有评测基础设施对高能力模型的**奖励破解(reward hacking)**行为越来越脆弱: - **抗博弈的下一代基准**:需要设计能够检测模型利用评测漏洞(如反编译系统包、操纵缓存文件)的评估协议,而非仅依赖 Docker 容器隔离。 - **真实世界长程任务**:现有基准多聚焦于单一会话或短程交互,对于跨天、跨会话的持续性长程智能体任务(如大规模软件维护、长期科研协作)缺乏严格评估。 - **边缘案例与分布外测试**:针对 FP4 量化、SWA 截断、跨层 KV 复用等近似机制,需构建专门的压力测试集,验证在分布外或边界输入下的行为一致性。 —- ### 3. 数据、模型容量与 RL 的联合扩展 论文明确将 DeepSeek-V4.1-Flash 视为继续扩展的起点,而非终点: - **大规模数据合成**:当前智能体训练数据依赖自动化流水线合成,但合成数据的质量天花板、多样性瓶颈及与真实世界分布的对齐问题仍需突破。特别是多模态长序列中视觉-文本交错数据的合成与验证。 - **强化学习的规模化定律**:异步 RL 在 DSec 上已展现持续扩展的收益,但 RL 计算量、任务异构性与模型能力之间的精确缩放关系(scaling law)尚未建立。探索在不同任务类型、不同脚手架间的最优 RL 资源分配策略具有重要价值。 - **模型容量的进一步提升**:在保持低成本激活参数的前提下,如何有效扩展 backbone 参数与 Engram 条件记忆模块的规模,以追赶闭源巨模型在科学专家级任务上的差距。 —- ### 4. 优化算法的精细化研究 论文在训练优化中引入了若干经验性设计,其理论基础与更广泛的适用性有待深挖: - **Sinkhorn 平衡更新 vs. 其他轴归一化策略**:§2.5 指出,Sinkhorn 平衡与 Adafactor、Adam-mini、RMNP 等矩阵/张量轴结构优化器在性能与通信开销上的比较仍属初步,需进行更系统的理论与实验研究。 - **头感知 Muon(Head-wise Muon)**:该优化器对注意力头异质性的处理在 GLM-5 与 Kimi-K3 中得到验证,但其收敛性保证与在更大规模或不同架构上的泛化性仍需理论分析。 —- ### 5. 低精度格式的精度-兼容性权衡 论文为硬件兼容性选择了 OCP 标准的 MXFP4(E2M1),但实验表明其他非标准格式具有更高精度: - **定制化 FP4 格式**:在专用硬件上,探索支持更高精度替代 FP4 格式(如含二级全局尺度的变体)对长上下文任务质量的影响,尤其是在需要高精度数值稳定的科学计算代码生成场景中。 - **SWA KV 的量化潜力**:当前 SWA KV 保留 FP8 因其对量化敏感;未来可研究针对局部注意力特性的专用低比特量化方案,或设计对量化更鲁棒的 SWA 变体。 —- ### 6. 多智能体协作的系统化研究 §5.3.5 中的多智能体实验仅为初步探索,多个维度亟待扩展: - **通信拓扑与任务分解策略**:当前 Agent Team 模式采用简单的 leader-delegate 结构,更复杂的动态图结构、角色专业化与自适应通信预算机制有待验证。 - **训练目标的精细化**:现有 RL 奖励结合了任务性能、协作 bonus 与关键路径延迟惩罚,但多智能体设置中的信用分配(credit assignment)与涌现协作行为的稳定性仍需深入研究。 - **规模扩展**:验证超过 3 个智能体的协作是否在更复杂的软件工程或网络安全任务中持续收益,以及是否存在收益递减的临界点。 —- ### 7. 模型-工具协同设计(Model–Harness Co-design) 论文提出将模型与外部工具/脚手架作为联合系统进行协同演化: - **接口的联合优化**:当前模型适配固定工具模式,未来可探索让模型能力反馈驱动工具接口的重新设计(如自适应工具描述、动态 schema 生成)。 - **端到端可微交互**:将部分高频工具调用内化为模型原生能力,或通过可微模拟降低工具交互的离散开销,减少推理-执行往返中的延迟与误差累积。 - **持续学习机制**:建立模型在实际部署中从工具使用反馈中持续更新的闭环,而非仅依赖离线的预训练/后训练阶段。 Q6: 总结一下论文的主要内容 本文介绍 **DeepSeek-V4.1-Flash**,一款面向长程智能体(long-horizon agents)的多模态稀疏混合专家(MoE)模型,核心目标是**将KV缓存压缩推向极限**,同时保持甚至提升模型能力。以下从研究背景、架构创新、训练与推理系统、实验结果及未来方向五个维度进行总结。 —- ### 1. 研究背景与核心挑战 长程智能体工作负载日益**输入密集型(input-heavy)**,导致三大瓶颈: - **Prefill计算成本**:处理长上下文或缓存未命中时的预填充开销高昂; - **运行时KV缓存(HBM)**:全局KV缓存随序列长度膨胀,制约 serving 吞吐; - **持久化KV缓存(SSD/Host Memory)**:前缀复用所需的大容量缓存占用存储与互联带宽。 因此,亟需从架构、精度与部署策略三个层面联合压缩KV缓存并降低推理成本。 —- ### 2. 模型架构与关键创新 DeepSeek-V4.1-Flash 拥有 **552B backbone 参数**,支持**百万token上下文**,采用以下核心设计: #### 2.1 因果编码器-解码器(CED) 将40层网络分为20层编码器与20层解码器。解码器层的**全局KV**不再由当前层计算,而是从编码器末层隐状态 H_(L/2) 直接投影:

Cl = H(L/2) W(KV)^l, quad Z_l = H(L/2) WZ^l, quad l > (L) / (2)
这使得 prefill 阶段仅需计算前半部分层,激活参数从 decode 时的16B降至8B,prefill复杂度从 O(NL) 降至约 O(NL/2) 。 #### 2.2 压缩稀疏注意力2(CSA2) 沿条目尺寸、序列维度与层维度三轴联合压缩: - 跨层KV与索引复用:每层静态分配为 Full、Reindex 或 Reuse 模式。Reuse Mode 直接复用前置层的主KV与Top-K索引;Reindex Mode 复用KV但重新评分生成新索引。 - 层次化稀疏索引器(Hierarchical Sparse Indexer):解码器中首个Full Mode层从全局上下文构建候选池(如16,384个候选位置),后续层仅在该常数大小池内搜索,将索引评分代价从线性于上下文长度变为常数。 #### 2.3 FP4主KV缓存 对全局主KV缓存采用 E2M1 FP4 量化格式(每16通道一个E4M3尺度),经量化感知训练(QAT)后,相比FP8近乎将存储减半,且兼容主流硬件。 #### 2.4 SWA有界重放(SWA Bounded Replay) 利用滑动窗口注意力(SWA)实际有效感受野远小于理论值 L × n
(win) 的特性,在缓存未命中时仅重放最近 n_(win) 个token以近似重建SWA状态,无需持久化SWA KV到SSD。该策略将持久化KV缓存降至DeepSeek-V4-Flash的约 1/8 。 #### 2.5 其他高效扩展 - Single-Pass mHC:通过将混合系数延迟一个块消除数据依赖,配合 Mega-mHC 核融合,将残差流激活内存流量减半。 - Engram:196B参数的稀疏条件记忆模块,通过 Sinkhorn 平衡更新优化。 - DSpark:预训练后单独训练的半自回归推测解码模块。 —- ### 3. 训练与推理基础设施 - 预训练:在 45T多模态token 上训练,64K序列长度起步直接训练稀疏注意力,34T token时扩展至1M。 - 多模态训练:支持解耦视觉编码器(DeepSeek-ViT)、平衡图像分片与对比-自回归两阶段视觉预训练。 - CSA2分布式训练:通过 Shadow Indexers、流水线载荷扩展与微批次共享状态管理,实现跨流水线阶段的KV/索引透明复用。 - 推理系统:采用 Encoder-Prefill-Decode(EPD)解耦;CSA2 Reuse Mode 层 prefill 仅需15个核,decode 仅需11个核。 - 后训练基础设施:DSec 沙盒平台支持百万级并发容器;异步RL与on-policy蒸馏(OPD)支持异构教师模型与动态配置切换。 —- ### 4. 实验结果 #### 4.1 基座模型性能(Table 1) DeepSeek-V4.1-Flash-Base 以仅 8B/16B激活参数(对比V4-Pro的49B),在世界知识(MMLU-Pro 74.1)、推理(MATH 61.1)与代码(HumanEval 79.4)等基准上与V4-Pro相当甚至更优;多模态能力(MMMU-Pro等)得到原生验证。 #### 4.2 后训练性能(Table 3) 在核心智能体与推理基准上达到闭源前沿水平: - 推理:Codeforces 评分 3471,MathArena Apex 65.6%,GPQA Diamond 90.9%; - 代码智能体:DeepSWE v1.1 74.2%,Terminal-Bench 2.1 90.6%,超越 Opus-5 与 GPT-5.6 Sol; - 可控推理力度:标量 effort $b ∈

1,100
实现对输出长度与准确率的平滑调控(Figure 9, 12)。 #### 4.3 效率指标 - KV缓存:全局KV缓存 890 bytes/token,约为 V4-Flash 的 1/4 ; - 计算效率:单token decode FLOPs 在上下文从4K增至1M时仅增长 1/4$,近乎恒定(Figure 2)。 —- ### 5. 局限与未来方向 - **鲁棒性边界**:CSA2 的跨层索引复用与 SWA Bounded Replay 的近似重建在极端边界条件下的可靠性需进一步压力测试。 - **与巨模型的差距**:在需要专家级领域知识的科学智能体任务(如 Terminal-Bench 4.0)上,与最大闭源系统仍有差距。 - **未来工作**:联合扩展数据、模型容量与RL;推进模型-工具协同设计(model–harness co-design);探索抗博弈的下一代评估基准与多智能体协作的规模化定律。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: DeepSeek-AI,Anyi Xu,B. Li,Bangcai Lin,Bing Xue,BingCheng Xian,Bingzheng Xu,Bochao Wu,Bowei Zhang,Boyi Deng,C.C. Yu,Chao Jin,Chaofan Lin,Chen Dong,Chenbing Wang,Chenfan Feng,Chengda Lu,Chenggang Zhao,Chengqi Deng,Chengyuan Zhang,Chenhao Xu,Chenqi Zhao,Chenze Shao,Chuhao Wang,Chuqi Zhang,Damai Dai,Dejian Yang,Deli Chen,Di Huang,Di Wu,Donghao Li,Erhang Li,Eric Fu,F. Zhou,Fangwei Zhou,Fangyun Lin,Fangzhou Yuan,Feiyu Xia,Fucong Dai,Guangbo Hao,Guanglin Li,Guanting Chen,Guoai Cao,Guofan Fan,Guolai Meng,Guowei Li,Haichuan Zhang,Haiyang Ma,Haiyang Shen,Han Li,Han Yu,Han Zhang,Hangyuan Deng,Hanwei Xu,Hanxiang Xu,Hanxun Zhong,Hao Guo,Hao Jiang,Hao Li,Hao Qin,Haodong Wen,Haofen Liang,Haofeng Huang,Haohua Liu,Haoling Zhang,Haoming Luo,Haoran Yang,Haotian Xu,Haotian Yuan,Haoting Huang,Haowen Luo,Haoyang Cai,Haoyu Chen,Haozhe Ji,Hengran Zhang,Hengrui Wang,Hengxu Wu,Honghui Ding,Hongxuan Tang,Huadong Wang,Huanqi Cao,Huazuo Gao,Hui Qu,Hui Zeng,J. Yang,J.H. Jin,J.H. Zhang,J.X. Zou,Jia Yu,Jiahui Zhou,Jiajun Chen,Jialiang Huang,Jialin Zhao,Jiamin Tang,Jian Zhou,Jianan Tong,Jianwen Li,Jiaqi Zhu,Jiarui Wang,Jiasheng Ye,Jiashi Li,Jiaxin Xu,Jiaying Ding,Jibai Lu,Jiewen Hu,Jin Yan,Jincheng Zhai,Jingchang Chen,Jingcheng Hu,Jingli Zhou,Jingsheng Xu,Jingting Xiang,Jingyan Yun,Jingyang Yuan,Jingyuan Cheng,Jinhua Zhu,Jinpeng Wang,Jinyi Chen,Jinyi Hu,Jiping Yu,Jueliang Guo,Junbo Pei,Junbo Sun,Junguang Jiang,Junjie Qiu,Junkang Zhou,Junqi Liu,Junren Li,Junxian Li,Junxiao Song,Junyi Guo,Kai Dong,Kaifeng Chen,Kaige Gao,Kang Guan,Kangdong Yuan,Ke Hong,Ke Xu,Kefan Zhao,Kexin Ji,Kexin Zhang,Kexing Zhou,Kuai Yu,Lan Zhang,Lean Wang,Lecong Zhang,Lei Wang,Letian Gao,Liang Zhao,Liansheng Xu,Lihua Guo,Lingxiao Luo,Lingyue Fu,Litao Deng,Litong Wang,Liyue Zhang,Longhao Chen,Lu Chen,Luotian Huang,Luyao Ma,Luyao Wang,M.S. Di,Max Mei,Menghao Ye,Miao Cui,Mingchuan Zhang,Minghua Zhang,Minghui Tang,Mingjing Zhang,Mingqi Wei,Mingshu Chen,Mingxing Liu,Mingxu Zhou,Mingyu Xu,Mingyu Yang,Mingze Wang,Muyang Chen,Ni Shentu,Ning Wang,Niufang Ning,Panpan Huang,Peixin Cong,Peiyi Wang,Peiyuan Xin,Pengfei Ren,Pengfei Yan,Pengle Zhang,Qi Kang,Qi Tang,Qiancheng Wang,Qiang Li,Qihao Zhu,Qingyang Li,Qinyu Chen,Qiushi Du,Qizhou Guo,Rongxian Xu,Rui Ding,Rui Hu,Rui Tian,Rui Yu,Ruidong Zhu,Ruifan Xu,Ruihan Yang,Ruihang Xia,Ruijie Lu,Ruilin Geng,Ruipeng Hong,Ruiqi Ge,Ruisong Zhang,Ruize Sun,Ruizhe Pan,Runji Wang,Runqian Chen,Runxin Xu,Ruohong Tian,Ruomeng Shen,Ruoyu Zhang,Ryan X.,S.H. Liu,Shanghao Lu,Shangyan Zhou,Shanhuang Chen,Shaofei Cai,Shaoheng Nie,Shaoyuan Chen,Shengding Hu,Shengkai Lin,Shengwen Ran,Shengyu Liu,Shengyuan Jia,Shi Bai,Shi Feng,Shicheng Xu,Shichun Liu,Shiqiang Hu,Shirong Ma,Shiyu Wang,Shiyuan Feng,Shufan Gong,Shuhan Lin,Shuiping Yu,Shunfeng Zhou,Shuo Yang,Shuomeng Wang,Shuting Guo,Shuting Pan,Shuying Yu,Sinuo Cao,Siyi Lin,Sizhe Chen,Songyang Chen,Songyang Zhou,Tao Ni,Tao Yun,Tian Jin,Tian Pei,Tian Ye,Tianle Lin,Tianran Ji,Tianyi Cui,Tianyuan Yue,Tingting Yu,Tongrui Xiong,Wangding Zeng,Wei Liu,Wei Zhang,Weibin Xu,Weihao Zeng,Weilin Zhao,Wen Liu,Wenfeng Liang,Wenjie Pang,Wenjing Luo,Wenjing Yao,Wenjun Gao,Wenkai Shao,Wenkai Yang,Wenli Zhang,Wenlu Wang,Wenlve Huang,Wenqian Yan,Wentao Zhang,Xi Gao,Xiang He,Xiang Li,Xiangli Li,Xiangwen Wang,Xiangying Zhang,Xiankui Wei,Xiao Bi,Xiaodong Liu,Xiaohan Wang,Xiaojian Qu,Xiaokang Chen,Xiaokang Zhang,Xiaotao Nie,Xiaoyao Zou,Xiaoyuan Li,Xicheng Guo,Xieting Chu,Xin Cheng,Xin Liu,Xin Xie,Xinbo Xu,Xingchao Liu,Xingchen Liu,Xingkai Yu,Xingyou Li,Xintong Yao,Xinyang Chen,Xinyong Jiang,Xinyu Yang,Xinyu Yang,Xu Chen,Xuanyu Wang,Xubei Zhong,Xuecheng Su,Xuejie Liu,Xuheng Lin,Xujie Fan,Xuncheng Zhao,Xuwei Fu,Y.C. Yan,Y.H. Jiang,Y.T. Wu,Y.W. M.,Y.Z. Wang,Yafei Gao,Yang Yang,Yang Zhang,Yanru Ma,Yanwen Huang,Yao Li,Yao Li,Yao Meng,Yao Zhao,Yaofeng Sun,Yaohui Wang,Yaoyang Ye,Yehang Yin,Yexinrui Wu,Yi Qian,Yi Tao,Yi Yu,Yichao Zhang,Yichen Jiang,Yicheng Wang,Yifan Ding,Yifan Shi,Yifeng Peng,Yifeng Zhai,Yijia Wu,Yiliang Xiong,Yilun Wang,Ying He,Ying Zhou,Yingjia Luo,Yinmin Zhong,Yiping Wang,Yisong Wang,Yixiang Zhang,Yixiao Chen,Yixuan Tan,Yixuan Wei,Yiyang Ma,Yiyao Yang,Yiyuan Liu,Yizai Cai,Yizhen Wei,Yizhi Wang,Yonglun Yang,Yongqi Zhuo,Yongqiang Guo,Yongtong Wu,Yu Wu,Yu Zhang,Yuan Bian,Yuan Cheng,Yuan Ou,Yuan Sun,Yuanfan Xu,Yuanhang Sun,Yuanhao Li,Yuchen Liu,Yuchen Yao,Yudong Han,Yuduan Wang,Yuhan Wu,Yuhao Meng,Yuheng Zou,YuKun Li,Yunchuan Wang,Yunfan Xiao,Yunfan Xiong,Yupeng Chen,Yuqian Cao,Yuqian Wang,Yuqing Chen,Yushun Zhang,Yutong Lin,Yuwei Xiao,Yuxian Gu,Yuxiang Chen,Yuxiang Huang,Yuxiang Luo,Yuxiang You,Yuxin Chen,Yuxin Xiang,Yuxuan Liu,Yuxuan Zhou,Yuyang Zhou,Yuzhe Guo,Yuzhen Huang,Yuzhuo Bai,Z.Y. Z.,Zanlin Ni,Zehao Wang,Zehua Zhao,Zehui Ren,Zejun Zhao,Zhangli Sha,Zhanying Wang,Zhaochen Zhang,Zhaoshuai Du,Zhe Fu,Zhean Xu,Zhenda Xie,Zheng Liu,Zhengyan Zhang,Zhenhua Dong,Zhewen Hao,Zhibang Wang,Zhibin Gou,Zhicheng Ma,Zhihao Li,Zhihong Shao,Zhihuan Huang,Zhijie Li,Zhirui Lu,Zhixian Huang,Zhixuan Chen,Zhixuan Chen,Zhixuan Pan,Zhiyu Wu,Zhizhou Ren,Zhu He,Zhuoshu Li,Zhuping Zhang,Zian Xu,Zihao Wang,Zihui Gu,Zijia Zhu,Zili Zhang,Zilin Li,Zilong Hou,Zilong Lyu,Ziqiao Wang,Ziwei Xie,Ziya Zhang,Ziyi Gao,Zizheng Pan,Zonglin Li,Zongqing Yao,Zui Chen,Zuofan Wu,Chenchen Ling,Chengyu Hou,Chong Chen,D. Li,Di Qi,Dongjie Ji,Fang Wei,Fanyi Xia,Fei Xie,Feiyi Tan,Hailong Guo,Haiyan Zhai,Hui Zhou,Huihui Tan,Huijie Li,Jia Luo,Jia Song,Jialu Cai,Jian Liang,Jiangting Zhou,Jiaqi Gao,Jiayi Shao,Jie Chen,Jieyu Yang,Jin Chen,Jingde Zhang,Jingzi Zhou,Jinqian Wang,Jinyang Liu,JinZhao Sun,Junhua Ling,Junmin Zheng,Kaicheng Yang,Ke Xu,Le Su,Leyi Xia,Liangfeng Ding,Lin Zhuo,Linwang Ma,Linyan Zhu,Liyu Cai,Luqi Yao,M.K. Zhang,Meng Li,Miao Lin,Miaojun Wang,Min Zhang,Mingming Li,Mingming Wang,Mingze Yin,Minmin Han,Nan Cao,Ning Wang,Ningxin Ma,Panpan Wang,Peihan Lin,Peng Sun,Peng Zhang,Qian Ying,Qiang Xiang,Qiao Wang,Qingmiao Mao,Qiwei Jiang,Rongli Jin,Ruyi Chen,Sha Tao,Shangmian Sun,Shaoqing Wu,Shichao Zou,Si Lei,Tianyang Zhang,Tianyu Sun,Tingting Yin,W.L. Xiao,Wei An,Wei Li,Wei Wang,Weiwei Lin,Wenqing Hou,X. Lin,Xiangfei Meng,Xianzhu Huang,Xiao Peng,Xiaoqian Li,Xiaoting Zhang,Xiaowen Sun,Xiaoxiang Wang,Xiaoyu Ye,Xinrou Zhang,Xinyu Zhang,Xue Cao,Xueyin Chen,Yanan Zhou,Yanhong Xu,Yao Xia,Yao Xu,Yi Shao,Yihong Zhang,Yiling Ma,Ying Tang,Yining Lou,Yiru Chen,Yishi Piao,Yixuan Chen,Yong Xiong,Yuchen Xuan,Yuehan Yang,Yuer Xu,Yukun Zha,Yunxian Ma,Yuping Lin,Yuting Yan,Yutong Xie,Yuwen Sheng,Yuxuan Zhu,Zekai Zhang,Zhe Ju,Zhenzhen Lin,Zheren Gao,Zheyang Sun,Zhigang Yan,Zhongyu Wu,Zi Wang,Zihua Qu,Ziling Yan,Ziyi Wan,et al. (492 additional authors not shown)

Categories:

PDF URL: https://arxiv.org/pdf/2609.19969.pdf

Arxiv URL: https://arxiv.org/abs/2609.19969

Arxiv ID: 2609.19969

CoolPaper URL: https://papers.cool/arxiv/2609.19969

Published: 2026-09-19T01:34:33.594Z

Updated: 2026-09-19T01:34:33.594Z


2. SoL-Pi: Recursively Scaling Auto-Research Loops for Efficient Agent Harness

Abstract:As coding agents move from supervised code completion to unattended, around-the-clock exploration, their work expands from isolated predictions into long trajectories of reasoning, tool use, and feedback. Token efficiency therefore becomes important for scaling recursive self-improvement. We take an RSI-inspired approach at the harness layer, scaling auto-research loops across increasingly numerous and diverse environments for harness rollouts. At this scale, the process yields reusable improvements that transfer beyond their development setting, moving automated harness discovery toward production-level outcomes. Four mechanisms survive selection and form SoL-Pi, spanning action execution, context compaction, observation handling, and delegated reading. On the 51-task EdgeBench evaluation, SoL-Pi achieves performance comparable to Pi across GPT-5.6 Sol and Opus 5 while reducing recorded token traffic by 44.7-49.0% and API cost by about one third. In other words, estimated hourly savings are $8.75-$13.50 relative to native Codex and Claude Code harnesses, and $4.36-$5.71 relative to Pi.

中文摘要

摘要:随着编码代理从监督代码完成转向无人值守、全天候探索,他们的工作从孤立的预测扩展到长距离的推理、工具使用和反馈轨迹。因此,令牌效率对于递归自我改进的扩展至关重要。我们在机束层采用受RSI启发的方法,将自动研究循环扩展到越来越多且多样化的环境中,以实现机束推广。在这一规模下,该过程产生可复用的改进,这些改进超越了开发环境,推动自动化机束发现朝向生产级成果。四个机制经由选择后形成SoL-Pi,涵盖动作执行、上下文压缩、观察处理和委托读取。在 51 个任务的 EdgeBench 评估中,SoL-Pi 在 GPT-5.6 Sol 和 Opus 5 上的性能与 Pi 相当,同时记录的代币流量减少了 44.7% 至 49.0%,API 成本降低了约三分之一。换句话说,预计每小时节省为 8.75 至 13.50 美元,相较于 Pi 为 4.36 至 5.71 美元。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*长时程智能体(long-horizon agents)在无人值守执行过程中的token效率与成本优化问题\*\*,具体聚焦于\*\*智能体 harness(中介模型与环境交互的控制框架)层面的自动化改进\*\*。以下是该研究试图解决的核心问题及其细分维度: --- ### 1. 长时程智能体的token效率瓶颈 随着编码智能体从孤立、短期的代码补全任务转向长时间、无人值守的自主探索(如自主研究、软件工程智能体、递归自我改进),其工作流扩展为包含推理、工具使用、环境反馈的长时间轨迹。在此规模下: - \*\*任务级token消耗\*\*成为首要的系统关注点; - 现有的效率优化主要集中于降低单位token成本(如更快的注意力内核、模型量化、使用更便宜的模型),而非改善token的使用方式。 ### 2. Harness层优化的复杂性与人工瓶颈 智能体 harness 负责状态呈现、动作暴露、反馈处理、上下文管理、验证、委托、恢复与终止,这些组件紧密耦合。因此: - 局部有益的改动可能引发下游故障,或将token成本转移至执行后期; - 传统的 harness 开发依赖大量人工审查长执行轨迹、识别重复故障模式并手动转化为代码修改,难以跨任务和环境规模化。 ### 3. 自动化改进的泛化与过拟合风险 近期的自动化 harness 优化研究表明,仅在搜索任务上进化的 harness 容易\*\*过拟合开发环境\*\*,在未见任务上仅能提供边际收益甚至失效。因此需要解决: - 如何将 harness 的搜索/开发与最终验证严格隔离,防止验证失败被逆向工程为任务特定的补丁; - 如何发现\*\*可跨任务、跨模型转移\*\*的通用效率机制,而非针对特定问题的局部修补。 ### 4. 搜索过程的可扩展性与方向性 论文指出,需要在 harness 层面实现一种可扩展的自动研究流程,以系统地探索大量假设并筛选出真正有效的改进。具体挑战包括: - 如何在保证能力不下降的前提下,系统地降低token流量与API成本; - 如何组织“广度探索(多方向假设)”与“深度打磨(迭代实现与审查)”的搜索漏斗; - 如何确保搜索过程本身不会因候选者之间的耦合失败而崩溃。 --- ### 总结 简言之,该论文试图回答:\*\*如何以自动化、可扩展且避免过拟合的方式,发现能够跨环境、跨模型转移的智能体 harness 效率改进机制,从而在长时程自主执行中显著降低token消耗与API成本,同时保持任务完成能力。\*\* Q2: 有哪些相关研究? 基于论文第4节(Related Work)及前文引用,相关研究可归纳为以下三个方向: --- ### 1. 智能体 Harness 与自动化智能体设计 此类研究关注\*\*智能体与计算机的接口设计\*\*以及\*\*自动化设计方法\*\*,强调 harness(控制框架)对固定模型行为的决定性作用。 - \*\*SWE-agent\*\* (Yang et al., 2024):证明改变 agent–computer interface 可在不更换底层模型的前提下,显著提升仓库级软件工程任务的性能。 - \*\*GEPA\*\* (Agrawal et al., 2026):通过对执行轨迹的反思来进化提示词(prompt),以优化智能体表现。 - \*\*ADAS\*\* (Hu et al., 2025):将智能体设计形式化为代码搜索问题。 - \*\*AFlow\*\* (Zhang et al., 2025):自动化搜索智能体工作流结构。 - \*\*AgentSquare\*\* (Shang et al., 2025):在模块化设计空间中自动搜索 LLM 智能体组件。 - \*\*Gödel Machine\*\* (Schmidhuber, 2007):递归自我改进(RSI)的理论基础。 - \*\*Darwin Gödel Machine\*\* (Zhang et al., 2026):迭代修改并评估智能体代码,实现开放式自我改进。 - \*\*Hyperagents\*\* (Zhang et al., 2026):将元级改进过程本身也设为可编辑,支持更深层的自我修改。 --- ### 2. 自动化 Harness 优化 此类研究直接聚焦于\*\*利用执行反馈自动优化 harness 代码或配置\*\*,与本文的搜索目标最为接近。 - \*\*AutoHarness\*\* (Lou et al., 2026):自动合成环境特定的代码守卫,并在某些场景下生成完整代码策略。 - \*\*Recursive Harness Self-Improvement (RHI)\*\* (Lee et al., 2026):针对单个任务,迭代改进智能体循环的 prompt 级规范。 - \*\*Meta-Harness\*\* (Lee et al., 2026):搜索可执行的 harness 程序,利用先验代码、分数和执行轨迹,在任务性能与上下文成本之间维护帕累托前沿。 - \*\*AHE (Agentic Harness Engineering)\*\* (Lin et al., 2026):基于轨迹证据进化模块化的编码 harness 组件,并评估其跨任务、跨模型的迁移能力。 - \*\*MemoHarness\*\* (Huang et al., 2026):存储执行经验,在推理时针对单个测试用例自适应调整 harness 配置。 - \*\*Wang et al.\*\* (2026):对 harness 进化的评估方法提出批判,指出搜索任务与评估任务重叠会导致过拟合,从而夸大改进效果;该发现直接支持了本文将开发环境与 held-out 评估严格隔离的设计。 --- ### 3. 上下文与 Token 高效智能体 此类研究从\*\*上下文管理\*\*和\*\*轨迹压缩\*\*角度降低长时程智能体的 token 开销,与本文发现的机制形成互补。 - \*\*LLM-as-Code\*\* (Qi et al., 2026):将确定性控制流移入可执行代码,以限制上下文累积。 - \*\*AgentDiet\*\* (Xiao et al., 2026):移除冗余和过时的轨迹内容,降低成本。 - \*\*ACON\*\* (Kang et al., 2025):优化观察结果与交互历史的压缩策略。 - \*\*Context-Folding\*\* (Sun et al., 2025) 与 \*\*AgentFold\*\* (Ye et al., 2025):通过轨迹折叠(folding)与压缩,使智能体能够主动管理工作上下文。 - \*\*Context as a Tool\*\* (Liu et al., 2026):将上下文维护显式地作为智能体可执行的动作之一。 - \*\*Agentic Context Engineering (ACE)\*\* (Zhang et al., 2026):通过执行反馈在上下文中持续积累和提炼可重用的策略。 --- ### 补充背景:基础设施与模型层效率优化 作为本文研究的\*\*正交方向\*\*,以下工作聚焦于降低单位 token 成本,而非 harness 层面的 token 使用效率: - \*\*计算与基础设施\*\*:FlashAttention-2 (Dao, 2024)、PagedAttention (Kwon et al., 2023) 等注意力内核与显存管理优化。 - \*\*模型压缩\*\*:SmoothQuant (Xiao et al., 2023)、GPTQ (Frantar et al., 2022) 等训练后量化技术。 - \*\*模型路由与成本规避\*\*:FrugalGPT (Chen et al., 2023)、RouteLLM (Ong et al., 2024) 等通过路由或级联降低调用成本。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*SoL-Pi(Scaling Auto-Research Loop)\*\* 系统,以 \*\*RSI-inspired(递归自我改进启发)的自动化研究流程\*\* 解决智能体 harness 的 token 效率与可扩展优化问题。其核心解决方案可分解为以下层面: --- ### 1. 总体框架:自动化研究循环 将 harness 优化重新定义为\*\*针对可复用效率机制的搜索问题\*\*,而非针对特定任务的提示工程或人工调优。系统包含: - \*\*研究 AI\*\*:分析基线 harness 的执行轨迹(execution traces),识别重复开销来源; - \*\*假设池(Idea Pool)\*\*:生成候选 harness 改动; - \*\*能力-效率双门控\*\*:候选机制必须通过\*\*能力保持\*\*(任务完成指标在预声明容差内)与\*\*效率提升\*\*(至少改善一个声明的效率指标)的双重筛选; - \*\*冻结与评估\*\*:通过筛选的机制被合并、固化(freeze),最终在完全隔离的 held-out 基准(EdgeBench)上验证,且验证结果\*\*绝不反馈回搜索循环\*\*。 --- ### 2. 三大设计原则指导搜索 为避免过拟合并保证发现的机制具备跨环境转移能力,SoL-Pi 遵循以下原则: - \*\*广度与深度(Breadth and depth)\*\* 广度覆盖大量假设方向(共 \*\*152 个提议方向\*\*,涵盖上下文、进度、工具、委托、提示策略、改进与评估六大类);深度则对 promising 的候选进行反复实现、审查与硬化。 - \*\*独立验证(Independent validation)\*\* Held-out 证据仅在候选机制\*\*冻结后\*\*进行评估,验证失败直接拒绝该候选,而不会触发针对该失败补丁的进一步优化,从而防止验证信息泄漏到搜索过程中。 - \*\*可扩展编排(Scalable orchestration)\*\* 每个候选方向的开发运行在\*\*隔离的、一次性的实例\*\*(disposable lineage)中,避免实验间耦合失败,支持在更多环境与假设上并行扩展搜索。 --- ### 3. 两阶段搜索管道(Broad-to-Deep Harness Search) 搜索流程分为外层与内层: - \*\*外层搜索(假设探索)\*\* 通过 \*\*Oracle Analysis\*\* 分析基线轨迹中的可避免开销,从 152 个方向中筛选出具体、可执行的候选。每个方向必须指明具体的开销来源及对应的 harness 改动方案。 - \*\*内层搜索(独立开发循环)\*\* 每个候选进入基于 \*\*Ralph Loop\*\* 的迭代实现流程: 1. \*\*实现者(Implementer)\*\* 依据完成标准细化候选; 2. \*\*独立审查者(Reviewer)\*\* 检查实现,失败则触发修订; 3. \*\*独立分析器\*\* 采用 \*\*Map–Reduce\*\* 方式分析轨迹:分别检查重复动作、上下文膨胀、超大观察结果、稀疏诊断信号,再汇总为候选级摘要指导下一次迭代; 4. 实验完成后,仅保留候选与证据,丢弃修改过的编排代码。 --- ### 4. 严格的环境隔离与评估协议 - \*\*搜索环境\*\*:使用 \*\*535 个可执行环境\*\*(495 个基于 GitHub Issue–PR 对的仓库环境 + 40 个基于可执行验证器的合成任务),完全独立于最终评估。 - \*\*Held-out 隔离\*\*:EdgeBench 的 51 个公开任务中,11 个仅用于单向接受冻结候选,剩余 40 个保留用于最终泛化评估;搜索期间绝不接触 EdgeBench 反馈。 - \*\*预固定标准\*\*:搜索开始前即固定能力指标、可接受容差与效率指标,防止优化智能体“操纵”验收标准。 --- ### 5. 发现的四大可复用机制 经过上述流程筛选并保留的四个互补机制,分别作用于 agent–environment 循环的不同阶段: | 机制 | 作用环节 | 核心策略 | |------|----------|----------| | \*\*Action Fusion\*\* | 动作执行 | 将文件编辑与后续测试/构建命令合并为单次工具请求,消除中间模型往返 | | \*\*Online Context Compact\*\* | 上下文管理 | 在计划步骤完成边界评估是否压缩上下文;仅当预计节省超过 prompt cache 重写成本时触发 | | \*\*ObservationPack\*\* | 观察处理 | 对超过阈值(10 KiB)的工具输出,在首次两次请求后替换为稳定句柄与摘要,支持按需召回原文 | | \*\*Evidence-Preserving Reducer\*\* | 委托阅读 | 使用低成本模型压缩构建/测试日志,经确定性验证器(schema、哈希、状态、精确引用)检验后生成 compact receipt;失败则回退原文 | 这些机制作为 \*\*Pi 的扩展\*\* 实现,在保持任务完成能力的前提下,从动作执行、上下文、观察存储与委托读取四个维度降低 token 开销。 --- ### 6. 规模化验证与转移测试 - 搜索规模覆盖约 \*\*3,000 次运行\*\* 与 \*\*60,000 次 agent–environment 交互\*\*; - 在 EdgeBench 上,完整四机制堆栈(SoL-Pi

Efficiency
)在 **GPT-5.6 Sol** 上减少 **49.0%** 的 token 流量与 **33.2%** 的 API 成本,同时保留 **93.7%** 的 Pi 基线得分;在 **Opus 5** 上未经任何再搜索或适配即直接转移,减少 **44.7%** 的 token 流量与 **33.5%** 的 API 成本,表明机制具备跨模型泛化性; - 额外在 Terminal-Bench 4、IMO 2026 及多智能体内核优化集群中验证,确认效率收益可跨基准迁移。 Q4: 论文做了哪些实验? 论文在第三节(Experimental Evaluation)中报告了五组主要实验,涵盖主基准评估、跨基准泛化、多智能体集群、机制消融与行为分析,以及单机制的完整开发案例追踪。 —- ### 1. EdgeBench 主实验与跨模型转移 **基准与设置。** 使用 EdgeBench 公开的 51 个任务。所有配置均报告输入、缓存读、缓存写、输出四类 token 流量及总流量、API 成本(按 2026-08-17 价格)、平均得分与单位得分成本(Token Efficiency,$/score)。后端覆盖 GPT-5.6 Sol(搜索后端)与 Opus 5(用于零样本转移验证)。 **对比配置。** 涵盖原生 harness(Codex、Claude Code)、第三方 harness(OpenSquilla、Oh-My-Pi、OpenCode、Oh-My-Opencode)、基线 Pi,以及 SoL-Pi 的两个工作点: - **SoL-Pi

Efficiency
**:固定的四机制完整堆栈,面向 token 效率优化; - **SoL-Pi
Performance
**:单机制配置中平均得分最高者(GPT-5.6 Sol 上为 ObservationPack,Opus 5 上为 Action Fusion)。 **关键结果。** - **GPT-5.6 Sol**:SoL-Pi
Efficiency
总 token 流量为 1.099 B,较 Pi(2.154 B)降低 **49.0%**;API 成本从 1,339 降至 894(降低 **33.2%**),平均得分从 44.83 降至 42.00(保留 **93.7%**)。SoL-Pi
Performance
得分提升至 **47.21**(+5.3%),同时总 token 降低 6.1%。 - **Opus 5(零样本转移)**:SoL-Pi
Efficiency
总 token 流量较 Pi 降低 **44.7%**,API 成本从 1,741 降至 1,158(降低 **33.5%**),平均得分 42.22(保留 **94.3%**),未经过任何针对 Opus 5 的再搜索或适配。 —- ### 2. 跨基准泛化:Terminal-Bench 4 与 IMO 2026 **设置。** 用于验证 harness 效率收益是否超出 EdgeBench。Terminal-Bench 4 选取 63 个 CPU-only 任务;IMO 2026 覆盖 6 道题目,使用 GPT-5.6 Sol (xhigh) 并要求 Lean 4 形式化验证,每题上限 150 分钟。 **关键结果(表 3)。** - **Terminal-Bench 4**:Codex 与 Pi 各解决 18 题,SoL-Pi 解决 15 题。SoL-Pi 总模型成本为 ** 211.12,较 Pi( 286.45)降低 **26.3%**;单位解题成本 ** 14.07,较 Pi( 15.91)降低 **11.6%**。 - **IMO 2026**:SoL-Pi 通过 3 题(与 Pi 持平,Codex 为 5 题),但总模型成本 ** 62.69 为三者最低,单位通过成本 20.90**,优于 Codex( 22.89)与 Pi( 25.32)。 —- ### 3. 多智能体集群(Agent Swarms) **设置。** 在内核优化基准上评估 SoL-Pi 对多智能体系统的价值。实验在 2 小时内运行三种配置: - 单 Codex 智能体(GPT-5.6 Sol xhigh); - Codex 协调器 + 20 个 Pi 基线 worker(worker 为 GPT-5.6 Luna xhigh); - Codex 协调器 + 20 个 SoL-Pi worker(worker 为 GPT-5.6 Luna xhigh)。 Worker 分 5 组,组内共享证据板,协调器跨组传递发现,所有候选提交需经独立验证与严格改进确认。 **关键结果(图 5)。** - **最终周期数**:SoL-Pi 集群达到 **1,127 cycles**,优于单智能体(1,333)与 Pi 基线集群(1,366)。 - **API 成本**:SoL-Pi 集群总成本 ** 60.11*,较 Pi 基线集群( 82.12)降低 \*26.8%**。 - **正确性与速度阈值**:SoL-Pi 集群与单智能体均通过全部 8 个速度阈值;Pi 基线集群通过 7 个,未达最后一档(< 1,363 cycles)。 —- ### 4. 机制消融与后端行为分析 **单组件添加实验(表 4)。** 在 Pi 基线上逐一添加四个机制,并与完整堆栈对比,分别在 GPT-5.6 Sol 与 Opus 5 上运行。 **关键发现。** - 每个独立机制在两种后端上均降低总 token 数。 - GPT-5.6 Sol 上,ObservationPack 单独添加后平均得分最高(**47.21**);Opus 5 上,Action Fusion 单独添加后得分最高(**50.48**)。 - 完整四机制堆栈在两种后端上均实现最低总 token 与最低单位得分成本,表明机制之间具有互补性。 **激活模式分析(图 6)。** 报告各机制在 EdgeBench 上的: - **触发率(Task Trigger Rate)**:触发该机制的任务占比; - **触发强度(Trigger Intensity)**:每触发任务的平均激活次数; - **触发任务效率增益(Token Efficiency Gain)**:相对禁用基线的单位得分成本降幅。 结果显示 Opus 5 上的触发率与强度普遍低于 GPT-5.6 Sol( harness 仅在 GPT-5.6 Sol 轨迹上优化),但所有机制在 Opus 5 上被触发时仍带来效率增益。 **合并行为分析(图 7)。** 在 GPT-5.6 Sol 上对比各机制“单独启用”与“全部启用”时的表现: - ObservationPack 在完整堆栈中变得更选择性(触发率下降),可能与 Evidence-Preserving Reducer 在观察密集型轨迹上的重叠有关; - 每个机制在完整堆栈中的 token 效率增益均大于其单独启用时的增益,支持机制间的互补性假设。 —- ### 5. Action Fusion 案例研究:从观察到保留 **设置。** 追踪 Action Fusion 从发现到冻结的完整 27 次迭代,分为四个阶段(图 8): 1. **Oracle Analysis**:通过轨迹分析识别相邻动作合并机会,预估 11.5% token 节省空间; 2. **Baseline Build**:构建稳定基线,确保无无效调用; 3. **Prompt Optimization**:在 18 次迭代中联合优化提示与工具模式,引入“触发率”作为中间验收指标; 4. **Final Validation**:在独立环境上运行最终检查,确认发布行为后冻结。 **关键量化结果。** - 相邻动作中 bash 命令占比 **85.1%**; - 全触发条件下,预计节省 **149 次模型轮次(10.8%)** 与 **3.74 M tokens(11.5%)**; - 最终配置在保持任务得分(87.0)的同时实现 **100% 触发率**。 Q5: 有什么可以进一步探索的点? 基于论文第 5.1 节(Limitations and Future Directions)及全文讨论,可进一步探索的研究方向包括: —- ### 1. Harness 的预训练(Pre-Training the Harness) 当前研究提供了初步证据:通过在大量公共环境与多样化任务上暴露 harness 并从轨迹中更新,可以部分缓解 harness 改进的泛化难题。类比模型的预训练,可系统性地探索 **scaling laws**——同时扩展可执行环境的数量与研究假设的多样性,观察是否能带来持续提升。这要求建立更大规模的自动化研究流水线,使 harness 在部署前经历充分的“预训练”阶段。 —- ### 2. 多后端训练(Multi-Backend Training) 现有 harness 完全基于 **GPT-5.6 Sol** 产生的轨迹进行优化;在 Opus 5 上的零样本转移虽仍有效,但各机制的触发频率与强度均有所下降(图 6)。未来可在搜索与验证阶段同时利用多个 LLM 后端,使 harness 学习更鲁棒的跨模型行为,从而在未见后端上保持更高的激活率与效率收益。 —- ### 3. 递归高效改进(Recursive Efficient Improvement) 效率收益本身可成为递归资源:使用 SoL-Pi 作为下一轮自动研究的起始 harness,其更低的单次运行成本意味着固定预算可覆盖 **更多可执行环境、更多轨迹与更多研究假设**。理论上,这能发现比当前更高效的机制,形成“更高效 harness → 更低研究成本 → 发现更高效 harness”的递归循环。目前这仅是长期研究愿景,尚未被实证验证。 —- ### 4. 搜索覆盖范围与成本的系统性研究 运行完整的自动研究循环计算开销巨大,导致在固定预算下对 **搜索广度(并行假设数)与深度(每假设迭代轮数)** 进行控制对比实验尤为困难。未来工作可致力于建立搜索广度、深度与最终发现质量之间的定量关系(scaling laws),以指导资源分配策略。 —- ### 5. 机制组合的动态优化 当前 SoL-Pi

Efficiency
采用固定的四机制完整堆栈。虽然消融实验(表 4、图 7)表明机制间存在互补性,但未探索 **任务自适应的组合策略**。例如,是否可根据任务类型或执行阶段动态启用/禁用特定机制,以在更细粒度上权衡能力保留与成本节约。 —- ### 6. 超越软件工程任务的泛化验证 现有搜索环境(GitHub Issue–PR 对、合成验证器任务)与评估基准(EdgeBench、Terminal-Bench 4、IMO 2026)主要围绕代码与数学推理。未来需在 **科学发现、开放域研究、多模态交互** 等更长时程、更开放的场景中,验证 harness 效率机制的可转移性与鲁棒性。 Q6: 总结一下论文的主要内容 这篇论文提出 **SoL-Pi**(Scaling Auto-Research Loop),一种受递归自我改进(RSI)启发的自动化系统,用于发现可复用的智能体 harness 效率机制,以解决长时程编码智能体在无人值守执行中的 token 效率与成本瓶颈。 ### 1. 研究背景与问题 随着编码智能体从短期代码补全转向长时间、自主化的任务执行,其工作流扩展为包含推理、工具使用与环境反馈的长轨迹。现有效率优化多聚焦于降低单位 token 成本(如模型量化、路由),而较少关注 **harness 层**(即中介模型与环境交互的控制框架)的 token 使用效率。Harness 优化在实践中极为困难:组件间紧密耦合,局部改动易引发下游故障,且传统开发依赖大量人工审查轨迹,难以规模化。此外,先前研究发现,自动进化的 harness 容易过拟合搜索任务,在未见任务上失效。 ### 2. SoL-Pi 核心方法 SoL-Pi 将 harness 改进重新定义为 **针对可复用效率机制的搜索问题**,其设计遵循三项原则: - **广度与深度**:外层广泛探索假设(152 个方向、6 个提案家族),内层对 promising 候选进行迭代实现、独立审查与硬化; - **独立验证**:Held-out 评估仅在候选机制冻结后进行,结果绝不反馈至搜索循环,防止过拟合; - **可扩展编排**:各候选在隔离的、一次性的搜索实例中独立开发,避免实验间耦合失败。 搜索流程基于 **Ralph Loop** 扩展:实现者细化候选,独立审查者检查,失败则修订;Map–Reduce 式分析器从轨迹中提取重复动作、上下文膨胀、大观察结果等信号,汇总后指导下一次迭代。整个搜索覆盖约 535 个可执行环境(495 个 GitHub Issue–PR 仓库环境 + 40 个合成验证器环境),累计 3,000 余次运行与 60,000 余次交互。 ### 3. 发现的四大机制 经能力-效率双门控筛选(任务性能在预声明容差内,且至少改善一项效率指标),保留四个互补机制并集成至 Pi: - **Action Fusion**:将文件编辑与后续测试/构建命令合并为单次工具请求,消除中间模型往返; - **Online Context Compact**:在计划步骤完成边界评估上下文压缩收益,仅当预计节省超过 prompt cache 重写成本时触发; - **ObservationPack**:对超过 10 KiB 的工具输出,在前两次请求后替换为稳定句柄与摘要,原文支持按需召回; - **Evidence-Preserving Reducer**:使用低成本模型(GPT-5.6 Luna)压缩构建/测试日志,经确定性验证器检验后生成 compact receipt,失败则回退原文。 ### 4. 实验验证 论文在多个基准上评估 SoL-Pi: - **EdgeBench(51 项公开任务)**: - **SoL-Pi

Efficiency
**(完整四机制):在 GPT-5.6 Sol 上,token 流量降低 **49.0%**,API 成本降低 **33.2%**(从 1,339 降至 894),平均得分保留 **93.7%**(42.0 vs. 44.8);在 Opus 5 上零样本转移,token 流量降低 **44.7%**,API 成本降低 **33.5%**,得分保留 **94.3%**。 - **SoL-Pi
Performance
**(单机制最优):在 GPT-5.6 Sol 上,ObservationPack 将平均得分提升至 **47.2**(+5.3%),同时降低 token 流量 6.1%。 - **跨基准泛化**: - Terminal-Bench 4(63 项 CPU 任务):总成本较 Pi 降低 **26.3%**,单位解题成本降低 **11.6%**; - IMO 2026(6 道 Lean 4 形式化题目):总成本 62.69 为三者最低,单位通过成本 20.90**。 - **多智能体集群**:在内核优化基准上,20 个 SoL-Pi worker 的集群在 2 小时内达到 **1,127 cycles**(优于 Pi 基线集群的 1,366),API 成本降低 **26.8%**,且通过全部 8 个速度阈值。 - **消融与行为分析**:逐一添加各机制均降低总 token;完整堆栈的单位得分成本优于任何单机制,表明机制间存在互补性。Opus 5 上的激活频率虽低于 GPT-5.6 Sol,但被触发时仍带来效率增益。 ### 5. 结论与未来方向 SoL-Pi 证明,通过在 harness 层进行规模化自动研究,可以在保持任务能力的同时显著降低 token 消耗与 API 成本,且改进具备跨模型转移潜力。论文提出的长期方向包括: - **Pre-training the harness**:类比模型预训练,在更多样化的环境与假设上规模化搜索; - **Multi-backend training**:利用多后端轨迹提升 harness 的跨模型鲁棒性; - **Recursive efficient improvement**:以更高效的 harness 降低后续自动研究的成本,形成递归改进循环。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是SoL-Pi%3A%20Recursively%20Scaling%20Auto-Research%20Loops%20for%20Efficient%20Agent%20Harness,链接是https://arxiv.org/pdf/2609.20519,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.20519。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Haozhe Liu,Tian Ye,Sensen Gao,Qihang Cao,Yitong Li,Mingchen Zhuge,Duomin Wang,Ruihua Zhang,Ping Luo,Jiawang Bian,Lei Zhu,Ligeng Zhu,Enze Xie,Song Han

Categories:

PDF URL: https://arxiv.org/pdf/2609.20519.pdf

Arxiv URL: https://arxiv.org/abs/2609.20519

Arxiv ID: 2609.20519

CoolPaper URL: https://papers.cool/arxiv/2609.20519

Published: 2026-09-19T01:34:33.559Z

Updated: 2026-09-19T01:34:33.559Z


3. An Empirical Study of Harness Design for Coding Agents

Abstract:Coding harnesses shape how autonomous coding agents translate model capabilities into long-horizon software-engineering performance, yet existing work typically evaluates harnesses as monolithic systems, leaving the effectiveness of individual components unclear. To enable component-level comparisons, we study this question with a lightweight coding harness whose execution loop is fixed while three components are varied: planning, action space, and context management. Across four models evaluated on SWE-Bench Verified and Terminal-Bench 2.1, we evaluate 176 matched settings spanning five context-management strategies, four context-window budgets, and targeted ablations of planning and action space. We find that: (1) Context management becomes increasingly valuable as the context-window budget tightens, with most of its benefit coming from preventing context-overflow failures. (2) Staging rule-based elision before LLM-based summarization provides the strongest overall efficiency among the context-management strategies, whereas making elided content recoverable adds machinery that models rarely use and yields no accuracy gain. (3) Planning shifts from an accuracy scaffold for weaker models to a cost saver for stronger models, with little change in accuracy. (4) Predefined tools improve performance for models with weaker bash proficiency, whereas bash-capable models can operate effectively with a bash-only interface and achieve substantially lower cost, especially on command-line-centric tasks. Trajectory-level analysis explains these effects: context management extends execution trajectories without substantially altering agent behavior, planning changes where trajectories stop, and the action space changes the granularity at which code is written. These findings inform model- and budget-aware harness design and provide a modular framework for evaluating future harness components.

中文摘要

摘要:编码利用机制影响自主编码代理如何将模型能力转化为长期的软件工程性能,但现有工作通常将机制作为整体系统进行评估,使各个组件的有效性不清晰。为实现组件级比较,我们使用一个轻量级编码机制来研究这一问题,其执行循环固定,而三个组件会有所变化:规划、操作空间和上下文管理。在四个模型上评估SWE-Bench Verified和Terminal-Bench 2.1,我们评估了176个匹配设置,涵盖五种上下文管理策略、四种上下文窗口预算,以及规划和操作空间的有针对性消融实验。我们的发现如下:(1)随着上下文窗口预算收紧,上下文管理的价值逐渐增加,其大部分益处来自防止上下文溢出失败。(2)在基于LLM的总结之前采用分阶段的基于规则的内容省略在所有上下文管理策略中提供了最强的整体效率,而使被省略的内容可以恢复则增加了模型很少使用的机制,并且没有带来准确性提升。(3)规划对于较弱的模型来说是准确性的支撑框架,而对于较强的模型则成为成本节省手段,对准确性变化不大。(4)预定义工具可以改善对bash能力较弱模型的性能,而具备bash能力的模型仅使用bash接口即可有效操作,并在以命令行为中心的任务上实现显著更低的成本。轨迹级分析解释了这些效应:上下文管理在不显著改变代理行为的情况下延长执行轨迹,规划改变轨迹的终止位置,而操作空间改变代码编写的粒度。这些发现有助于设计适应模型和预算的机制,并为未来机制组件评估提供了模块化框架。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文试图解决**编码智能体框架(coding harness)的组件级效用评估问题**。具体而言,现有研究通常将整个框架视为单一系统进行评估,导致性能差异无法归因于具体机制。论文试图拆解这一黑盒,回答以下核心问题: **核心问题:编码框架中的关键组件——上下文管理(context management)、规划(planning)和动作空间(action space)——是否具有跨设置普适的效用,还是其有效性取决于模型能力、任务类型与资源预算?** 为回答该问题,论文针对现有研究的三个局限展开工作: 1. **混淆机制(Confounded Mechanisms)** 跨框架比较将规划、工具接口、上下文管理等多个机制混为一谈。一个智能体优于另一个,无法说明收益究竟来自规划策略、工具设计、上下文压缩,还是这些组件与底层模型的交互效应。 2. **缺乏条件性刻画(Missing Conditional Characterization)** 先前工作未能在同一实现层面,联合考察规划、工作区动作接口与上下文管理策略在长程编码任务上的条件效应,尤其缺乏对上下文窗口预算(32k–128k)与模型规模(同一家族内30B至550B)的显式扫描。 3. **组件迁移性未知(Unknown Transferability)** 由于上述混淆,现有证据无法解释哪些组件导致了框架间的差异,也无法判断某一组件的设计是否能在不同模型或预算约束下直接迁移。 通过构建一个模块化轻量级框架,固定执行循环而独立变动上述三个组件,论文在四个模型与两个长程编码基准(SWE-Bench Verified、Terminal-Bench 2.1)上系统评估了176个实验设置,从而将框架设计问题从“黑盒系统选择”转化为“模型与预算感知的组件配置问题”。 Q2: 有哪些相关研究? 根据论文第5节及相关引用,相关研究可分为以下三个领域: --- ### 1. 编码智能体(Coding Agents) 该领域关注驱动编码智能体的语言模型及其评估基准。 - **前沿模型**:包括 Qwen3-Coder、Kimi K2.5 / K2.6、GLM-5 以及 Mistral Medium 3.5 等,这些模型专为代码生成与智能体应用而设计或评估。 - **执行型基准**:SWE-Bench(Jimenez et al., 2024)用于评估仓库级问题修复能力,Terminal-Bench(Merrill et al., 2026)用于评估端到端命令行任务完成能力。 **与本文的关系**:此类基准通常评估完整的智能体系统,其分数混淆了模型能力、控制循环、动作接口与上下文管理策略,因此难以归因各组件的独立贡献。 --- ### 2. 编码框架(Coding Harness) 该领域研究将大语言模型转化为编码智能体的软件层,包括控制循环、工具接口与上下文管理。 - **代表性系统**:Claude Code、Codex、OpenCode、OpenHands(Wang et al., 2025)等。研究表明,决定性能的是框架而非模型本身(Yang et al., 2024)。 - **架构扩展**:后续工作为框架引入长期记忆(Wong et al., 2025)、任务图与模块化子智能体(Chen et al., 2024; Arora et al., 2024),并有综述对设计空间进行系统分类(Rombaut, 2026)。 - **消融与受控研究**: - **简化管道**:Agentless(Xia et al., 2024)与 AutoCodeRover(Zhang et al., 2024)表明,无需高度复杂的智能体架构亦可取得强劲性能。 - **模型依赖性**:AgentArch(Bogavelli et al., 2025)报告了模型特定的架构偏好;Mehtiyev and Assunção(2026)的大规模轨迹研究发现,不同编码智能体框架间的行为差异随模型代际而变化。 - **提示级支架**:Wang et al.(2026)观察到某些提示工程策略对更强模型可能变得无用甚至有害;Liu(2026)采用全因子设计研究了短程推理任务上的提示级支架,但未显式考察上下文窗口压力的约束。 **与本文的关系**:现有工作多对捆绑式(bundled)设计进行优化或局部消融,极少在相同实现层面、跨越模型能力与上下文预算的条件下,对规划、工作区动作接口和上下文管理进行联合比较。 --- ### 3. 上下文管理(Context Management) 随着软件工程任务难度增加,智能体交互历史可能超出模型上下文窗口,因此涌现出多种管理策略。 - **静态方法**: - **省略/截断**:直接省略或截断陈旧内容(Xiao et al., 2024; Jiang et al., 2023)。 - **外部存储与检索**:通过外部存储按需召回早期内容(Packer et al., 2023; Park et al., 2023)。 - **总结压缩**:将历史折叠为紧凑的自然语言摘要(Wu et al., 2021)。 - **动态方法**:训练模型(通常通过强化学习)自主管理上下文,如 ACON(Kang et al., 2025)、Sculptor(Li et al., 2026)、Memory as Action(Zhang et al., 2026)等。 **与本文的关系**:上述机制通常作为独立改进提出,并在单一模型上评估,其价值与可用上下文窗口大小以及模型是否足够强大以利用压缩信息之间的核心依赖关系尚未被充分刻画。本文通过在 32k 至 128k 令牌窗口范围内、跨两个模型家族进行显式扫描,精确量化了这种条件依赖性。 Q3: 论文如何解决这个问题? 论文通过**模块化框架构建**与**系统化组件消融**相结合的方法解决该问题,具体步骤如下: --- ### 1. 构建可独立配置的轻量级编码框架 为避免现有框架中各机制纠缠不清的问题,作者从零构建了一个基于 ReAct 循环(Yao et al., 2022)的轻量级框架。该框架将执行循环(execution loop)固定,仅对以下三个核心组件进行独立插拔与参数化: - **规划(Planning)**:通过 `update_plan` 工具维护显式、持久的任务计划。启用时向模型注入规划协议、首回合提醒与每回合计划;禁用时移除所有相关指令与工具。 - **动作空间(Action Space)**:比较两种接口—— - **预定义工具集(Predefined-tool)**:提供 `read_file`、`write_file`、`edit_file`、`list_files`、`glob_files`、`grep_text`、`web_fetch`、`bash` 等结构化工具,附带类型化参数模式与使用协议。 - **纯 Bash 接口(Bash-only)**:移除所有预定义工作区工具,仅保留 `bash` 用于通用环境交互。 - **上下文管理(Context Management)**:设计五种策略 T0–T4,通过三种可组合机制实现: - **M1(Elision)**:将陈旧工具观测替换为短占位符。 - **M2(Recall)**:将省略内容存入外部存储,通过 `recall_event` 按需恢复,使省略可逆。 - **M3(Summarization)**:对最古老的中部事件进行运行式自然语言摘要。 T0 禁用所有管理;T1 仅启用 M1;T2 启用 M1+M2;T3 仅启用 M3;T4 为完整策略,在软阈值 B_1 处触发省略,在硬阈值 B_2 处触发摘要。 --- ### 2. 设计全覆盖的实验矩阵 为估计各组件的条件效应,论文在以下维度进行系统扫描: | 维度 | 设置 | |------|------| | **模型** | Nemotron-3 30B / 120B / 550B(同一家族能力轴);Mistral-Medium-3.5-128B(跨家族验证) | | **基准** | SWE-Bench Verified(500 个仓库级问题);Terminal-Bench 2.1(89 个端到端终端任务) | | **上下文窗口预算** | 32k、64k、96k、128k tokens | | **上下文管理策略** | T0、T1、T2、T3、T4 | | **组件消融** | 在 T4/128k 基线上一对一禁用规划或替换为 bash-only | 总计产生 **176 个实验设置**(22 设置/模型–基准对)。每个任务最多运行 300 步,输出温度设为 0。 --- ### 3. 建立严格的对比与统计检验 在同一模型、同一任务、同一执行循环下,仅改变目标组件,从而隔离其因果效应。所有对比在任务级别配对进行,使用**双侧精确 McNemar 检验**,并通过 **Benjamini–Hochberg 程序**将错误发现率控制在 0.05。这确保了成功率差异的统计可靠性。 --- ### 4. 实施轨迹级行为分析 除最终成功率与成本外,论文对智能体轨迹进行细粒度标注与量化分析: - **行为编码(Behavior Encoding)**:将每一回合标注为 SWE-Bench 的五个阶段(Localize、Reproduce、Fix、Verify、Other)或 Terminal-Bench 的十个动作类型(Inspect、Search、Create、Modify 等)。 - **失败阶段归因(Failure-Stage Attribution)**:对未解决任务,由 LLM 裁判判定最早的失败阶段(文件定位、行定位、补丁实现、验证)。 - **执行统计**:追踪回合数、工具调用次数、输入令牌量、峰值上下文比例、重补丁次数、编辑粒度等。 通过这些分析,论文将宏观的性能差异追溯到微观的智能体行为变化: - 上下文管理**延长轨迹**而不改变行为模式; - 规划改变轨迹**终止位置**(弱模型防止过早放弃,强模型减少冗余验证); - 动作空间改变代码编写的**粒度**(bash 允许更粗粒度的复合操作)。 --- ### 5. 总结条件性设计原则 基于上述实验,论文得出**模型与预算感知**的框架设计原则,将智能体构建从“选择整体框架”转化为“根据目标模型能力、任务类型与资源预算配置组件”: - 上下文管理在**预算紧张时价值最大**,T4(先省略后摘要)在保持准确率的同时成本最低; - 规划对**弱模型是准确率支架**,对**强模型是成本节约器**; - 预定义工具对 **bash 能力弱的模型**起支撑作用,而 **bash 能力强的模型**在 shell 密集型任务上可通过纯 bash 以更低成本获得更高或相当的性能。 通过这一方法,论文首次在统一实现下,量化了三个核心框架组件在长程编码任务中随模型能力与上下文预算变化的条件效应。 Q4: 论文做了哪些实验? 该论文实施了**176个实验设置**的系统化组件级消融,覆盖四个模型、两个长程编码基准、四种上下文窗口预算,并对规划与动作空间进行配对消融。实验可分为**配置扫描**与**组件消融**两大部分,具体如下: --- ## 1. 实验基础配置 ### 1.1 模型与推理 - **模型**:Nemotron-3 家族(30B、120B、550B)作为同一家族能力梯度;Mistral-Medium-3.5-128B 作为跨家族对照。 - **推理设置**:本地 SGLang 服务,BF16 精度,温度 0 ,top-p 0.95 ,每轮最大输出 16,384 tokens。 ### 1.2 评估基准 - **SWE-Bench Verified**:500 个人工验证的真实 GitHub 问题,测试仓库级问题修复。 - **Terminal-Bench 2.1**:89 个端到端命令行任务,测试终端环境任务完成。 ### 1.3 评估指标 - **成功率(SR, %)**:成功解决任务的比例。 - **平均任务成本( )**:基于 OpenRouter 定价计算的输入/输出 token 费用。 ### 1.4 框架固定参数 - 执行循环:基于 LangGraph 的 ReAct 循环,每任务最多 **300 步**。 - 上下文阈值:软阈值 B_1 为可用窗口的 0.6 ,硬阈值 B_2 为 0.85 ;保留的最近回合预算为 0.3 (至少保留 2 轮)。 - 工具限制:工具结果截断至 24,000 字符;每步最多并行 8 个只读工具。 - 卡住检测:连续 5 次相同调用注入提醒,连续 8 次相同失败调用提前终止。 --- ## 2. 上下文管理策略扫描(20 设置/模型–基准对) 在**规划开启**且使用**完整预定义工具集**的条件下,对五种上下文管理策略与四种上下文窗口预算进行全组合扫描: | 策略 | 机制组合 | 窗口预算 | |------|---------|---------| | **T0** | 无管理(无任何压缩,超窗即终止) | 32k | | **T1** | 仅省略(M1) | 64k | | **T2** | 省略 + 可恢复外部存储(M1+M2) | 96k | | **T3** | 仅摘要(M3) | 128k | | **T4** | 省略 + 可恢复存储 + 摘要(M1+M2+M3) | | - **T4 机制细节**:超过 B_1 时触发省略与外部存储;若仍超 B_2 ,则对最古老的中部事件进行 LLM 摘要。 - **总设置数**:5 策略 × 4 预算 = 20 设置/模型–基准对。 --- ## 3. 单一组件配对消融(2 设置/模型–基准对) 以 **T4 / 128k** 为统一基线,分别独立改动一个组件: ### 3.1 规划消融(Planning On vs. Off) - **规划开启(默认)**:启用 `update_plan` 工具,注入规划协议、首回合提醒与每回合当前计划。 - **规划关闭(−plan)**:移除规划指令、提醒、计划注入及 `update_plan` 工具,其余保持不变。 ### 3.2 动作空间消融(Full Tool Set vs. Bash-only) - **完整工具集(默认)**:提供 `read_file`、`write_file`、`edit_file`、`list_files`、`glob_files`、`grep_text`、`web_fetch`、`bash` 等预定义工具,附带类型化参数模式、读写前检查与自动编辑后诊断。 - **纯 Bash(bash)**:移除所有预定义工作区工具,仅保留 `bash` 作为通用环境交互接口;保留 `update_plan` 与 `recall_event`(若对应组件开启)。 --- ## 4. 完整实验矩阵汇总 将上述设置组合后,实验覆盖: | 维度 | 取值 | 说明 | |------|------|------| | 模型 | 4 个 | Nemotron-3 30B/120B/550B、Mistral-Medium-3.5-128B | | 基准 | 2 个 | SWE-Bench Verified、Terminal-Bench 2.1 | | 上下文管理层 | 5 个 | T0–T4 | | 上下文窗口 | 4 个 | 32k、64k、96k、128k | | 规划 | 2 个 | 开(默认)、关(仅 T4/128k) | | 动作空间 | 2 个 | 完整工具集(默认)、bash-only(仅 T4/128k) | - **总计**: 22 设置/模型–基准对(20 个上下文管理扫描 + 2 个组件消融) × 4 模型 × 2 基准 = **176 个实验设置**。 --- ## 5. 统计检验与轨迹分析 ### 5.1 假设检验 - 在三个对比族内(管理策略 vs. T0、规划开 vs. 关、完整工具集 vs. bash-only)使用**双侧精确 McNemar 检验**(任务配对结局)。 - 采用 **Benjamini–Hochberg 程序**将错误发现率控制在 0.05 。 ### 5.2 轨迹级行为分析 为解释宏观性能差异,论文对全部轨迹进行三级标注: - **SWE-Bench 行为编码**:将每轮标注为 Localize(定位)、Reproduce(复现)、Fix(修复)、Verify(验证)、Other(其他)。 - **SWE-Bench 失败阶段归因**:对未解决任务,由 LLM 裁判判定最早失败阶段(文件定位、行定位、补丁实现、验证)。 - **Terminal-Bench 动作级编码**:将每个工具调用独立标注为 Inspect、Search、Create、Modify、Environment、Execute、Test、Verify、Navigate、General 十类。 **裁判验证**:使用 GPT-5.5 进行自动标注,并与三名人工标注者的独立标注进行一致性检验,整体加权 Cohen's kappa ≈ 0.929 ,支持自动标注的可靠性。 --- ## 6. 主要实验发现概览 实验揭示了四个条件性效应(对应论文 Figure 1): 1. **上下文管理在预算紧张时价值最大**:32k 窗口下管理策略将成功率平均提升 35.7 个百分点(SWE-Bench),主要收益来自消除窗口溢出导致的过早终止;随窗口增大,边际收益递减。 2. **T4 策略成本最优**:在保持与 T1–T3 相当准确率的同时,T4 通过“先规则省略、后 LLM 摘要”的分阶段策略,减少了昂贵的摘要调用,实现了最低平均成本。 3. **可恢复存储(Recall)几乎无用**:`recall_event` 在 56.3% 的设置中从未被调用,且 T2 相较于 T1 无一致准确率提升,说明模型很少主动恢复被省略的内容。 4. **规划的作用随模型能力转变**:对 Nemotron-3 30B(弱模型),规划是**准确率支架**(防止过早放弃,提升 11.6% 成功率,但成本更高);对 Nemotron-3 550B 与 Mistral(强模型),规划是**成本节约器**(减少冗余验证,成本降低约 30%,准确率微降)。 5. **动作空间的能力依赖性**:预定义工具对 bash 能力弱的 Nemotron-3 30B/120B 显著提升成功率;但对 bash 能力强的 Nemotron-3 550B 与 Mistral,bash-only 在 Terminal-Bench 等 shell 密集型任务上成本更低、成功率更高或持平,原因在于强模型能将多步操作压缩为单次复合 shell 命令。 Q5: 有什么可以进一步探索的点? 基于论文的发现与局限性,未来研究可从以下五个方向进一步展开: --- ### 1. 组件机制的细粒度解构与重新设计 论文中的动作空间干预是捆绑式变更(同时改变工具可用性、接口提示、文件状态跟踪与自动诊断),规划也仅通过单一提示协议实现。未来可对这些组件进行更精细的拆解: - **动作空间的原子化消融**:独立评估工具数量、动作粒度(如细粒度 `edit_file` 与粗粒度 `bash` 脚本)、接口提示措辞、以及读写前检查与自动诊断的各自贡献,以确定“工具本身”与“配套机制”的相对重要性。 - **规划协议的多样化**:探索不同规划形式(如层次化目标分解、动态重规划频率、计划粒度从高层里程碑到逐步指令)对不同能力模型的差异化影响,而非仅测试单一 `update_plan` 机制。 - **Recall 机制的改进**:鉴于论文发现 `recall_event` 极少被调用,可探索**被动式/自动式检索**(如根据当前查询语义自动恢复相关历史)替代显式工具调用,或引入基于嵌入的语义检索,而非基于 event ID 的精确恢复。 --- ### 2. 组件交互效应与全因子实验设计 受计算资源限制,论文仅在默认 T4/128k 配置下对规划与动作空间进行了单因素消融,未能刻画组件间的交互效应: - **全因子扫描**:系统性地遍历 规划(开/关)× 动作空间(工具集/bash)× 上下文策略(T0–T4)× 窗口预算(32k–128k)的组合,以发现潜在协同或抵消效应。例如,规划可能在 bash-only 条件下发挥更大作用,因为粗粒度动作更需要高层计划来避免偏离。 - **上下文管理策略的交互**:验证 T4 的最优性是否依赖于特定模型对省略与摘要的相对敏感度,或在多模态观测(图像、结构化数据)混合时是否依然成立。 --- ### 3. 跨模型家族、跨任务类型与跨领域验证 论文的结论是条件性的,但其外部效度受限于 Nemotron-3 家族与 Mistral-Medium-3.5-128B 两个模型家族,以及 Python 为主的软件工程任务: - **模型谱系扩展**:在 GPT、Claude、Gemini、Qwen 等不同训练范式(尤其工具调用与代码后训练差异显著)的模型上,验证“规划从准确率支架转向成本节约器”以及“bash-only crossover 点”的普适性与精确位置。 - **非 Python 与多语言代码库**:将 SWE-Bench 类评估扩展至 Java、C++、Rust、TypeScript 等语言,检验上下文管理策略是否受语法冗长度或编译-运行循环长度的调节。 - **软件工程之外的长期任务**:如数据科学 Notebook 修复、机器学习实验管理、DevOps 流水线配置、前端多文件组件化开发等,检验动作空间偏好(结构化工具 vs. shell)是否随任务领域的“shell 中心性”而变化。 - **多模态与 GUI 环境**:在需要同时处理代码、网页截图或 PDF 文档的任务中,上下文压缩机制(省略、摘要、外部存储)是否需要针对非文本模态重新设计。 --- ### 4. 自适应与可学习的上下文管理 论文采用固定阈值( B_1=0.6 , B_2=0.85 )与手工规则,未来可探索数据驱动的自适应机制: - **动态阈值策略**:基于当前任务进度(如定位阶段 vs. 验证阶段)、历史信息密度或剩余步数预算,自适应调整省略与摘要的触发点。 - **端到端可学习的压缩策略**:将上下文管理建模为可微或强化学习策略,让模型学习何时压缩、压缩什么、以及如何恢复,而非依赖手工设计的规则管线。这可与已有工作(如 ACON、Sculptor)结合,但在长程软件工程轨迹上进行专门优化。 - **选择性保留机制**:研究不同类型的历史观测(如错误堆栈 vs. 成功的测试输出 vs. 代码阅读记录)对后续决策的预测价值,设计基于信息价值的差异化保留策略。 --- ### 5. 在线成本-效用权衡与元级决策 论文离线比较了 176 个固定配置,实际部署中需要根据实时反馈选择配置: - **配置元模型**:构建预测模型,根据任务描述、仓库元数据或早期轨迹特征(如前 10 步的动作模式、上下文增长率),预测在特定模型下应采用的默认配置(如是否启用规划、选择何种动作空间)。 - **运行时自适应切换**:设计监控器检测轨迹级异常模式(如强模型的冗余验证循环、弱模型的过早终止风险),在运行时动态插入规划提示、切换至 bash-only,或触发上下文压缩,而非在开始时固定配置。 - **成本约束下的帕累托前沿**:在限定成本预算(如每任务不超过 1.00)的条件下,系统搜索最优组件组合,并刻画不同预算水平下的最优策略迁移路径。 --- ### 6. 更长轨迹与极端上下文压力下的行为研究 论文将轨迹长度上限设为 300 步,且最大窗口为 128k。随着模型上下文窗口扩展至数百万 token,需要回答: - **极长轨迹的信息干扰**:当任务天然需要数百至上千步(如大规模重构)时,即使采用 T4 策略,累积摘要是否会引入过多噪声?是否存在“上下文管理收益递减”的新拐点? - **溢出失败的级联效应**:研究上下文溢出失败是否可通过轻量级重启或分章节执行策略来缓解,而非单纯依赖压缩。 Q6: 总结一下论文的主要内容 该论文对编码智能体框架(coding harness)进行了系统性的组件级实证研究,旨在揭示规划(planning)、动作空间(action space)与上下文管理(context management)在不同模型能力、任务类型与资源预算下的条件性效用。 ### 1. 研究背景与动机 自主编码智能体的性能不仅取决于底层大语言模型,还严重依赖于其运行的软件层——即编码框架。现有研究通常将不同框架作为整体系统进行对比(如 OpenHands、SWE-Agent),导致性能差异无法归因于具体机制(是规划策略、工具设计还是上下文压缩?)。因此,需要一种模块化、可控的评估方法,以精确估计各组件的独立贡献及其迁移性。 ### 2. 研究问题 论文的核心问题是:**编码框架中的关键组件是否具有跨设置的普适效用,还是其有效性取决于模型能力、任务类型与上下文窗口预算?** ### 3. 方法:模块化框架设计 作者构建了一个基于 ReAct 循环的轻量级框架,固定执行循环与辅助机制(安全检查、编辑后诊断、卡住检测),仅独立插拔以下三个组件: - **上下文管理(Context Management)**:设计五种策略 T0–T4,基于三种可组合机制: - **M1(Elision)**:将陈旧工具输出替换为短占位符; - **M2(Recall)**:将省略内容存入外部存储,通过 `recall_event` 按需恢复; - **M3(Summarization)**:对古老历史进行 LLM 自然语言摘要。 T0 禁用管理;T1 仅用 M1;T2 用 M1+M2;T3 仅用 M3;T4 采用分阶段策略(先 M1+M2,必要时再 M3)。 - **规划(Planning)**:通过 `update_plan` 工具维护显式任务计划,支持持续更新。禁用规划时移除所有相关指令与工具。 - **动作空间(Action Space)**: - **预定义工具集(Predefined-tool)**:提供 `read_file`、`edit_file`、`grep_text` 等结构化工具; - **纯 Bash(Bash-only)**:移除预定义工作区工具,仅保留 `bash` 进行通用交互。 ### 4. 实验设计 论文在以下配置下进行系统扫描: - **模型**:Nemotron-3(30B、120B、550B)作为同一家族能力梯度,Mistral-Medium-3.5-128B 作为跨家族对照; - **基准**:SWE-Bench Verified(500 个仓库级问题修复)与 Terminal-Bench 2.1(89 个端到端终端任务); - **上下文窗口预算**:32k、64k、96k、128k tokens; - **总设置数**:5 种上下文策略 × 4 种窗口 × 2 个基准 × 4 个模型,加上在 T4/128k 下的规划与动作空间消融,共 **176 个实验设置**。 评估指标包括任务成功率与平均任务成本(基于 token 定价),并使用双侧精确 McNemar 检验进行统计显著性检验。 ### 5. 主要发现 - **上下文管理的价值高度依赖预算**:在 32k 窗口下,管理策略相对无管理(T0)平均提升 35.7 个百分点成功率(SWE-Bench),主要收益来自**消除上下文溢出导致的过早终止**;随着窗口扩大至 128k,边际收益锐减至 2.7 个百分点。 - **T4 策略成本效益最优**:分阶段“先规则省略、后 LLM 摘要”的 T4 在保持与 T1–T3 相当准确率的同时,实现了**最低的峰值上下文与平均成本**,因为它减少了昂贵的 LLM 摘要调用。 - **可恢复存储(Recall)几乎无用**:`recall_event` 在 56% 的设置中从未被调用,且 T2 相较于 T1 无一致准确率提升,说明添加恢复机制带来的额外复杂性未被模型有效利用。 - **规划的作用随模型能力转变**: - 对弱模型(Nemotron-3 30B),规划是**准确率支架**:防止轨迹过早崩溃,使其能尝试编辑,代价是更高成本; - 对强模型(Nemotron-3 550B、Mistral),规划转变为**成本节约器**:主要减少冗余的后编辑验证循环,成本降低约 30%,而准确率仅有微小变化。 - **动作空间的能力依赖性与任务依赖性**: - 预定义工具对 **bash 能力弱的模型**(如 Nemotron-3 30B)显著提升成功率,起到关键支撑作用; - 对 **bash 能力强的模型**(如 Nemotron-3 550B),纯 bash 在 Terminal-Bench 等 shell 密集型任务上可将成本降低 30–53%,同时准确率持平或更高,因为强模型能将多步操作压缩为单次复合 shell 命令; - Mistral 在 SWE-Bench 上依赖预定义工具,但在 Terminal-Bench 上偏好 bash,表明动作空间选择还受**任务类型**调节。 ### 6. 轨迹级行为机制 通过自动化轨迹标注分析,论文将宏观性能差异归因于微观行为变化: - **上下文管理**:主要**延长执行轨迹**而不改变智能体的阶段行为模式(定位、修复、验证的比例基本不变); - **规划**:改变轨迹**终止位置**——弱模型避免过早放弃,强模型避免过度验证; - **动作空间**:改变代码编写的**粒度**——bash-only 使强模型使用更大、更粗粒度的代码写入动作,减少交互轮次。 ### 7. 结论与启示 编码框架设计是一个**条件性系统问题**,不存在 universally optimal 的配置。各组件应根据**目标模型能力、任务类型与资源预算**进行动态选择: - 紧预算下优先采用 T4 式上下文管理; - 弱模型需要规划支架与预定义工具; - 强模型在 shell 密集型任务上可从 bash-only 接口中获益,以降低成本。 该研究为未来的框架设计提供了模块化的评估范式与可转移的诊断依据。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [**这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是An%20Empirical%20Study%20of%20Harness%20Design%20for%20Coding%20Agents,链接是https://arxiv.org/pdf/2609.20804,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.20804。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Run-Ze Fan,Zihao Zhang,Simin Ma,Yebowen Hu,Shouju Wang,Kaiqiang Song,Fei Liu,Hamed Zamani,Xiaoyang Wang

Categories:

PDF URL: https://arxiv.org/pdf/2609.20804.pdf

Arxiv URL: https://arxiv.org/abs/2609.20804

Arxiv ID: 2609.20804

CoolPaper URL: https://papers.cool/arxiv/2609.20804

Published: 2026-09-19T01:34:33.527Z

Updated: 2026-09-19T01:34:33.527Z


4. When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation

Abstract:We study length inflation in on-policy distillation (OPD), where student responses can become excessively long and even exhaust the generation budget. We identify \emph{termination-token mismatch} between base students and post-trained teachers as an important source of this behavior. Across Qwen3, Llama, and Gemma, the two models can place their stopping probability on different EOS tokens, even when their declared stopping sets are identical. This mismatch can suppress the student’s preferred termination action without reliably transferring the teacher-preferred alternative. We show that aligning the decoding stopping set alone is insufficient, while treating functionally equivalent EOS tokens as a shared semantic stopping action substantially mitigates mismatch-induced length inflation across all three model families. To further understand how termination behavior evolves over training, we study OPD across different K2-Horizon training stages. This stage-wise analysis shows that termination preferences can shift substantially during training, while also revealing a distinct length inflation late in the OPD run that persists beyond termination alignment. Together, these results identify termination mismatch as an important, but not exhaustive, source of OPD length dynamics. We release an implementation incorporating the proposed termination-handling corrections.

中文摘要

摘要:我们研究了在 on-policy 蒸馏(OPD)中的长度膨胀问题,即学生模型的响应可能变得过长,甚至耗尽生成预算。我们将基础学生模型和后训练教师模型之间的\emph{终止标记不匹配}确定为导致这种行为的重要原因。在 Qwen3、Llama 和 Gemma 中,即便两者声明的停止集合相同,这两种模型也可能在不同的 EOS 标记上放置它们的停止概率。这种不匹配可能会抑制学生模型偏好的终止操作,而无法可靠地传递教师偏好的替代操作。我们表明,仅对齐解码停止集合是不够的,而将功能上等效的 EOS 标记视为共享语义终止操作可以在三类模型中显著减轻由不匹配引起的长度膨胀。为了进一步理解终止行为在训练过程中的演变,我们研究了不同 K2-Horizon 训练阶段的 OPD。该阶段分析显示,训练期间终止偏好可能会发生显著变化,同时还揭示了 OPD 后期出现的明显长度膨胀,这种膨胀在终止对齐之后仍然存在。综合来看,这些结果表明,终止不匹配是 OPD 长度动态的重要但非全部原因。我们发布了一个实现,其中包含所提出的终止处理改进方案。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文研究的是\*\*基于策略蒸馏(On-Policy Distillation, OPD)中的长度膨胀(length inflation)问题\*\*。具体而言,论文试图解决并理解以下核心问题: ### 1. OPD 中的长度膨胀现象 在将后训练教师模型(post-trained teacher)蒸馏到基础学生模型(base student)的过程中,学生生成的回复长度会随训练不断增长,甚至在严重情况下\*\*耗尽整个生成长度预算\*\*。这种膨胀并非源于更深入的推理,而是学生\*\*无法正确终止生成\*\*导致的失败模式,表现为答案正确后仍继续生成重复、冗余的后缀(如图 1 所示)。 ### 2. 终止标记不匹配(Termination-Token Mismatch) 论文识别出长度膨胀的一个直接且重要的根源:\*\*学生与教师对终止决策的表示存在分歧\*\*。具体表现为: - 即使两个模型声明的解码停止集合(declared EOS set)相同,它们也可能将停止概率分配给集合内\*\*不同的 EOS token\*\*; - 在 OPD 的逐 token 监督下,学生采样的终止 token 若与教师偏好的终止 token 不一致,会受到\*\*负向蒸馏信号\*\*的压制; - 这导致学生原本偏好的终止动作被持续抑制,而教师偏好的替代 token 又因学生采样概率极低(如 Qwen3 中约 10^(-11) )而无法被有效学习。 ### 3. 概率级对齐的必要性 论文进一步指出,\*\*仅对齐解码接口(即扩大停止 token 集合)是不充分的\*\*,因为这并未改变训练目标中的概率级信号。论文提出的核心解决方案是\*\*在概率层面将功能等价的 EOS token 视为共享的语义停止动作(shared semantic stopping action)\*\*,从而消除不同表面 token 之间的竞争,恢复学生可靠的终止行为。 ### 4. 超越终止不匹配的持续动态 此外,论文还探讨了终止对齐后仍存在的残余长度动态(如 K2-Horizon 训练后期的再次膨胀),指出终止不匹配是 OPD 长度膨胀的重要但非唯一来源,为未来研究其他机制提供了基础。 简言之,该工作旨在\*\*诊断并纠正由基础模型与后训练模型之间终止标记语义不匹配所导致的 OPD 长度膨胀\*\*,同时揭示 OPD 长度动态中超出终止对齐的复杂行为。 Q2: 有哪些相关研究? 论文在第 5 节系统梳理了相关研究,可归纳为以下三个方向: ### 1. 基于策略蒸馏(OPD)中的长度膨胀机制 已有研究从不同角度解释了 OPD 中的长度膨胀现象,这些机制在本论文看来具有互补性: - \*\*Luo et al. (2026)\*\* 观察到伴随重复饱和的突发性长度膨胀,将其归因于蒸馏目标对长且重复序列的\*\*隐式偏好\*\*; - \*\*Li et al. (2026)\*\* 发现过大的生成预算会导致\*\*教师监督质量随轨迹深度退化\*\*,进而引发训练后期崩溃; - \*\*Zhao et al. (2026)\*\* 将长度膨胀与\*\*反向 KL(reverse-KL)蒸馏导致的熵坍缩\*\*联系起来。 本论文指出,上述机制均以“学生首先无法终止”为前提条件。因此,所发现的\*\*终止标记不匹配\*\*为这些已知机制提供了前置性的实现层面根因,二者并非对立而是互补:在教师与学生已就终止达成共识的场景中,上述算法层面的机制仍是主要解释;而在存在终止分歧的场景中,需先建立终止对齐,再归因于算法本身。 ### 2. Rollout 质量退化及其缓解 另一支研究关注学生一旦偏离教师分布后,轨迹质量恶化的连锁反应: - \*\*Liu et al. (2026)\*\* 将这种现象刻画为\*\*局部可教性崩溃(local teachability collapse)\*\*; - \*\*Xie et al. (2026)\*\* 表明轨迹后期 token 会系统性偏离教师分布。 针对此问题,现有方案大致分为两类: | 策略类型 | 代表工作 | 核心思想 | |---------|---------|---------| | 仅蒸馏早期可靠段 | Prefix OPD (Zhang et al., 2026); Prune-OPD (Yang et al., 2026b); ADWIN (Liang et al., 2026) | 在教师监督仍可信的前缀范围内进行蒸馏,动态调整有效 horizon | | 直接改善 rollout 质量 | SWITCH (Koo et al., 2025); Plyusov et al. (2026) 的教师混合行为策略; Relay-OPD (Xu et al., 2026) | 在师生分歧处注入教师 token,或由教师接管推理错误后的生成 | 这些工作均将 rollout 退化视为算法层面的病理。本论文则进一步揭示,\*\*学生无法停止本身具有更低层的实现级根因\*\*(终止 token 不匹配),该根因足以在不出现轨迹级病理的情况下单独导致预算饱和。 ### 3. 终止标记语义不匹配 针对终止 token 本身的问题,已有研究做出了初步探索: - \*\*Fu et al. (2026)\*\* 将 tokenizer 与特殊 token(包括 EOS)不匹配识别为逐 token 监督的失败模式之一,通过\*\*掩蔽问题特殊 token\*\*来缓解; - \*\*Plyusov et al. (2026)\*\* 针对 Qwen3 的 EOS 不匹配提出了 \*\*EOS canonicalization\*\*,将学生与教师的原生 EOS token 映射为共享的停止事件后再进行采样与 KL 评估。 本论文与上述工作的区别在于:将终止不匹配本身作为核心研究对象,系统追踪了 token 级 OPD 如何将表面终止 token 的分歧放大为\*\*终止概率崩溃与长度膨胀\*\*;并通过对比四种干预(仅修改解码规则、教师侧映射、语义 EOS 聚合、学生动作空间归一化),证明\*\*仅对齐解码停止集合不足够,必须在概率层面统一终止语义\*\*。此外,本论文证明该现象并非 Qwen3 特有,也\*\*不依赖于显式声明的 EOS 配置差异\*\*——例如 Gemma 3 的 PT 与 IT 模型在声明相同 EOS 集合的情况下,仍会对 \`\` 与 \`\` 形成不同的习得偏好。这促使将终止视为语义事件,而非仅仅依赖模型级别的 EOS 配置。 Q3: 论文如何解决这个问题? 论文通过\*\*在概率级别对齐终止语义\*\*来解决由终止标记不匹配(termination-token mismatch)引起的长度膨胀。具体而言,论文首先证明仅在解码接口扩大停止集合是不够的,随后比较了三种在蒸馏信号层面统一终止行为的修正方案,并验证了其跨模型族的有效性。 ### 1. 诊断:解码级对齐不足以解决问题 论文首先测试了最直接的对齐方式——\*\*Fix 1: Shared-set decoding\*\*。该方法在解码阶段将教师偏好的额外 EOS token(如 Qwen3 的 \`<|im\_end|>\`)注册为学生的有效停止 token,但保持 OPD 目标函数和模型概率分布不变。实验表明,该方法几乎无法缓解长度膨胀(见图 4a)。原因在于:学生对这些额外 token 的采样概率极低(在 Qwen3 中约为 10^(-11) ),因此注册为停止 token 既不会改变其采样概率,也无法阻止学生原生 EOS token(如 \`<|endoftext|>\`)在蒸馏目标中持续受到负向信号的压制。 ### 2. 概率级终止对齐的三类修正 既然问题根源在于 token 级蒸馏目标将不同表面 token 视为不同动作,论文提出三种在\*\*概率层面\*\*统一终止信号的修正: #### Fix 2: Teacher-side EOS mapping(教师侧映射) 将教师分布在所有终止等价 token 上的概率质量映射到学生原生支持的规范 token e^star ∈ E_(EOS) 上:

πE(e^star mid s_t) = ∑(e ∈ EEOS) π_E(e mid s_t)
其余 EOS token 的概率被置零(实践中保留极小值以保证数值稳定性)。学生分布保持不变,且仅当采样到 e^star 时停止。这直接将教师的停止信号传递给学生已支持的 token。 #### Fix 3: Semantic EOS class(语义 EOS 聚合)**(推荐方案)** 不指定单一规范 token,而是将集合 E
(EOS) 中的所有 token 视为单一语义动作 stop 的不同实现。定义聚合后的分布:

π(stop mid st) = ∑(e ∈ EEOS) π(e mid s_t)
对于非 EOS token, π(a mid s_t) = π(a mid s_t) 保持不变。若学生采样到某个 EOS token,则将其替换为语义动作 y_t = stop ,并应用标准 OPD 更新:
A_t = log π_E(y_t mid s_t) - log π
θ(yt mid s_t), quad g_t = A_t ∇θ log πθ(y_t mid s_t)
该方法通过监督**终止总概率**而非特定表面 token,避免了不同 EOS token 之间的竞争,且不要求学生复制教师的表面 token 偏好。 #### Fix 4: Canonical single-EOS action space(规范单 EOS 动作空间) 同时修改教师和学生分布:将教师概率映射到 e^star (同 Fix 2),并在学生采样时从动作空间中移除 E
(EOS) 中的其他 token,对剩余概率重新归一化。这构建了一个仅含单一终止动作的一致动作空间。 ### 3. 方案比较与选择 在 Qwen3 上的消融实验(图 4a)表明,Fixes 2、3、4 均能显著抑制长度膨胀,使响应长度和截断率(clipping ratio)接近教师参考水平,而 Fix 1 与 vanilla OPD 几乎无差异。 尽管三者在表现上相似,论文建议根据场景选择: - **Fix 2** 实现最简单,仅需修改教师分布,适用于已知明确 token 映射的模型对(如 Qwen3)。 - **Fix 3(语义聚合)** 被推荐为跨模型族的默认方案,因为它无需指定规范表面 token,且适用于学生与教师即使声明相同 EOS 集合、却仍偏好不同 token 的情况(如 Gemma 3)。 - **Fix 4** 进一步约束了学生动作空间,适用性较窄。 ### 4. 跨模型族验证 论文在 Qwen3、Llama 3.2 和 Gemma 3 上验证了语义 EOS 聚合(Fix 3)的有效性: - **Qwen3**:学生偏好 `<|endoftext|>`,教师偏好 `<|im_end|>`; - **Llama 3.2**:学生偏好 `<|end_of_text|>`,教师偏好 `<|eot_id|>`; - **Gemma 3**:PT 与 IT 声明相同的 EOS 集合 langleeosrangle, langleendof_turnrangle ,但学生偏向 ``,教师偏向 ``。 在这三种情况下,语义 EOS 聚合均显著缓解了长度膨胀(图 4b、图 6)。在 Gemma 3 中尤为明显:学生无需 adopt 教师偏好的表面 token,仅通过对齐终止总概率即可恢复可靠终止。 ### 5. 残余长度动态的说明 需要指出的是,终止对齐并非长度膨胀的完整解释。K2-Horizon 的阶段式实验(图 7)显示,即使经过语义 EOS 修正,训练晚期仍可能出现终止概率再次下降、响应长度重新增长的“晚期再膨胀”现象。这表明 OPD 的长度动态还受其他机制(如局部更新对未来失配的忽略)影响,论文将其留待未来研究。 Q4: 论文做了哪些实验? 论文围绕**终止标记不匹配(termination-token mismatch)**这一核心假设,设计了从诊断、干预验证到机制分析的系列实验。以下按实验目的分类梳理: —- ### 一、终止不匹配诊断实验(Qwen3 主实验) **模型与数据**:以学生 Qwen3-1.7B-Base、教师 Qwen3-4B(非思考模式)在 DAPO-Math-17K 上进行 sampled-token OPD。 **观测指标**:训练过程中追踪平均响应长度(mean response length)、截断率(clipping ratio,即达到生成长度预算的回复比例),以及终止概率 qπ(h) = ∑(e ∈ E_EOS) π(e mid h) 。 **关键发现**: - Vanilla OPD 下,学生响应长度持续增长,截断率逐渐上升(图 1a)。 - 在 rollout 终止位置,学生将终止概率集中在 `<|endoftext|>`,而教师集中在 `<|im_end|>`(图 2)。 - 学生对其原生 EOS 的赋值从约 0.8 逐渐崩溃至接近零。 —- ### 二、四种终止处理策略的消融(第 3 节) 在同一 Qwen3 模型对上,系统比较了四种干预: | 干预 | 修改位置 | 核心操作 | |———|————-|————-| | **Fix 1** | 仅解码接口 | 注册双 EOS token(`<|endoftext|>` 与 `<|im_end|>`)为有效停止 token,不改变目标函数 | | **Fix 2** | 教师分布 | 将教师在所有终止等价 token 上的概率映射到学生原生 EOS: π_E(e^star mid s_t) = ∑(e ∈ EEOS) π_E(e mid s_t) | | **Fix 3** | 语义动作空间 | 将 E(EOS) 视为单一语义动作 stop ,监督总终止概率 π(stop mid st) = ∑(e ∈ E_EOS) π(e mid s_t) | | **Fix 4** | 学生+教师动作空间 | 教师映射同 Fix 2,同时从学生采样空间中移除其他 EOS 并重新归一化 | **结果**(图 4a): - Fix 1 与 Vanilla OPD 几乎重合,**仅扩大解码停止集合无法抑制长度膨胀**。 - Fixes 2、3、4 均使响应长度与截断率维持在教师参考水平附近,且学生原生终止概率不再崩溃,证明**必须在概率级别对齐终止语义**。 —- ### 三、跨模型族泛化验证(第 3.3 节) 为验证终止不匹配是否特异于 Qwen3,论文在以下模型族重复了 Vanilla OPD 与语义 EOS 修正(Fix 3)的对比: - **Llama 3.2**:Base(`<|end_of_text|>`)→ Instruct(偏好 `<|eot_id|>`) - **Gemma 3**:PT(偏好 ``)→ IT(偏好 ``),二者**声明的 EOS 集合完全相同** **结果**(图 3、图 4b、图 6): - 三大家族均出现 Vanilla OPD 下终止概率崩溃与长度膨胀。 - 语义 EOS 修正显著降低响应长度与截断率,但恢复动态存在差异:Qwen3 快速恢复至高终止概率,Llama 3.2 与 Gemma 3 则在低概率区间维持更久后缓慢恢复。 —- ### 四、K2-Horizon 分阶段训练分析(第 4 节) 利用开源的 K2-Horizon-7B 系列检查点(pretrain_final → mid_1_final → sft_1_final → main),固定 final 为教师,从不同阶段初始化学生,以研究终止偏好的演化及晚期长度动态。 **核心设置**: - Pretrain-to-Final 训练 400 步;Midtrain-to-Final 与 SFT-to-Final 训练 200 步。 - 对比 Vanilla OPD 与语义 EOS 修正。 **发现**(图 7): - **Pretrain 阶段**:学生偏好 `<|ifm|endoftext|>`,教师偏好 `<|ifm|im_end|>`,与 Qwen3 类似但学生已对教师偏好 token 具有非零概率,Vanilla OPD 可逐渐转移表面终止形式。 - **Midtrain / SFT 阶段**:学生已大量采用教师偏好的终止 token,Vanilla OPD 不再出现严重的早期终止崩溃(附录 D.2,图 11、图 12)。 - **晚期再膨胀(Phase 3)**:即使在 Pretrain-to-Final 的语义修正实验中,训练后期仍出现终止概率再次下降、响应长度重新逼近预算的现象。该行为**无法由表面 EOS 不匹配解释**,指向 OPD 长度动态中独立于终止对齐的额外机制。 —- ### 五、模板与评估协议敏感性实验(第 3.3 节、附录 E、B) **训练-评估模板组合**: - 使用 TTRL、DAPO、Raw-Question 三种模板训练,并在 TTRL 与 DAPO 两种格式下评估。 - 结果显示:训练模板对生成长度有持久影响(DAPO 训练普遍更短),而评估格式显著改变测得的准确率(图 5、图 13)。 **评估器兼容性**: - 发现原始 DAPO 评估器因无法解析 Qwen3 常用的 display-math 格式(如 `Answer:

204
)而严重低估性能。 - 论文设计了格式兼容的扩展解析器(附录 B.3),使教师模型 Avg@16 从 6.28% 恢复至 24.34%(图 8)。 --- ### 六、下游性能与终止概率演化监测(附录 D) **Avg@16 评估**:在 AIME24、AIME25、AMC23 上采样 16 次,计算平均正确率。 - 语义 EOS 修正带来的长度改善**并未一致地转化为下游推理性能的提升**,不同模型族表现不一(图 9)。 - 跨模型的终止 token 概率演化被逐 token 拆解(图 10),验证了 Gemma 3 与 Llama 3.2 中表面偏好分歧的存在,以及 K2-Horizon 中教师偏好 token 被习得后再次衰减的两阶段行为。 --- ### 七、定性案例分析(图 1b、附录 F) 展示了 Vanilla OPD 下达到生成预算的完整 rollout 示例,揭示长度膨胀的具体形态: - **答案重复**:正确答案后重复输出### Final Answer: 5` 704 次; - 自我修正循环:陷入 “Let’s try x = 2, y = 12.5” 的验证循环 371 次; - Token 重复:持续输出 check-mark 符号 3,836 次。 这些案例表明,膨胀内容并非有效推理,而是生成终止失败后的退化重复。 Q5: 有什么可以进一步探索的点? 基于论文的局限性分析与开放性问题,以下几个方面值得进一步深入探索: —- ### 1. 晚期长度再膨胀的内在机制 论文通过 K2-Horizon 的阶段式实验发现,即使在语义 EOS 修正后,训练晚期仍会出现终止概率再度下降与响应长度重新增长(Phase 3,图 7)。这一现象无法由表面终止 token 不匹配解释,暗示存在独立于终止对齐的额外驱动力。未来研究可着力于: - 量化局部 sampled-token OPD 中未来失配(future mismatch)的累积效应(附录 C 初步分析了局部更新相对于轨迹级 reverse-KL 的偏差,但尚未构成完整解释); - 探究该晚期行为是否与现有文献中提出的 rollout 退化、熵坍缩或隐式长度偏好机制发生交互或叠加。 —- ### 2. 多轮对话与智能体场景中的终止语义 当前实验局限于单轮数学推理,其中 E_(EOS) 内的 token 在解码协议下功能等价(均结束响应)。然而,在多轮对话或工具使用场景中,特殊 token 的语义可能高度分化: - 消息完成(message completion) - 助手轮次结束(end of assistant turn) - 文档终止(document termination) - 工具调用交接(tool handoff) 将这些功能上可区分的事件简单聚合为单一 stop 动作,可能破坏交互控制流而非仅仅纠正停止行为。未来工作需要建立上下文相关的终止类别体系,并评估长度膨胀在消耗上下文预算或干扰工具调用链时的更严重后果。 —- ### 3. 局部目标与轨迹级一致性之间的鸿沟 附录 C 从理论上指出,局部 sampled-token OPD 的停止 logits 更新始终弱于轨迹级 reverse-KL 所施加的停止压力,其差距为:

Delta^e(s) - Delta^(OPD)_e(s) = pθ(s) C_θ(s) ≥ 0
这一系统性偏差可能贡献于 EOS 修正后的\
*早期长度漂移**。值得探索的方向包括: - 设计计算可行的**轻量级未来失配估计**,以修正局部更新的相对延续偏差(relative continuation bias); - 在不退回到全词汇表计算(full-vocabulary OPD)的前提下,通过重要性采样或短期滚动展开(short rollouts)近似轨迹级信号。 —- ### 4. 跨模型族终止偏好的形成与演化 实验观察到,语义 EOS 修正后,Qwen3、Llama 3.2 与 Gemma 3 的**终止概率恢复动态存在显著差异**:Qwen3 快速恢复至高终止概率,而 Llama 与 Gemma 长期维持低概率后才缓慢回升。未来可研究: - 不同架构或 tokenizer 设计如何塑造预训练与后训练阶段对特定 EOS token 的偏好; - 终止偏好的迁移是否遵循与语言能力类似的阶段式涌现规律,以及中训练(midtraining)阶段在其中的关键作用。 —- ### 5. 提示模板与评估协议的系统性解耦 论文发现训练模板对响应长度有持久影响,而评估模板显著改变测得准确率,且二者**无需同向变动**(图 5、图 13)。当前分析仅限于 Qwen3 上的三种模板与两种评估器。未来需要: - 在 Llama、Gemma 等模型族中验证模板效应的普遍性; - 区分“模板引起的生成长度变化”与“模板引起的真实推理能力变化”,建立对 OPD 评估更鲁棒的协议。 —- ### 6. 终止对齐与其他蒸馏病理的交互边界 论文将终止不匹配定位为长度膨胀的**重要前提条件(precondition)**,而非对既有机制(如 reverse-KL 熵坍缩、local teachability collapse)的否定。未来研究应致力于建立一个层次化的失效框架: - 在终止对齐已建立的条件下,判断何种算法级机制主导晚期长度动态; - 明确不同机制(终止不匹配、rollout 退化、目标函数隐式偏好)各自占优的参数区域与模型配置。 —- ### 7. 语义聚合的自动化诊断与适配 目前论文依赖人工检查来确定 E(EOS) 与模型间的终止偏好分歧。对于大规模蒸馏流水线,可进一步探索: - **自动化的终止偏好分歧检测**:通过对比学生与教师在验证集前缀上的终止概率分布,自动触发语义聚合修正; - 动态调整终止类别 E(EOS) 的策略,以适应学生与教师随训练演化的终止行为。 Q6: 总结一下论文的主要内容 这篇论文系统研究了基于策略蒸馏(On-Policy Distillation, OPD)中的**长度膨胀(length inflation)**现象,即学生模型在蒸馏过程中生成的响应逐渐变长,甚至耗尽生成长度预算。论文识别出该现象的一个关键但此前被忽视的机制——**终止标记不匹配(termination-token mismatch)**,并提出了概率级别的语义对齐修正方案。 ### 1. 问题背景与现象 在将预训练基础模型(base student)蒸馏到后训练教师模型(post-trained teacher)的单轮数学推理任务中,论文观察到学生模型的平均响应长度随训练持续增长,伴随截断率(clipping ratio)上升。定性分析显示,学生经常在生成正确答案后仍无法停止,转而输出大量重复、冗余或退化的后缀(如重复最终答案、陷入自我修正循环或单字重复),导致生成预算被无效消耗。 ### 2. 核心机制:终止Token不匹配 论文指出,长度膨胀的一个直接根源在于**学生与教师对语义终止决策的表面编码不同**。具体而言: - 即使学生与教师共享相同的分词器和声明的解码停止集合(declared EOS set),它们也可能将实际的停止概率集中在集合内**不同的特殊token**上。 - 例如,Qwen3基础模型偏好`<|endoftext|>`,而其教师偏好`<|im_end|>`;Gemma 3的PT与IT模型虽声明相同的EOS集合,却分别偏好``与``。 - 在逐token采样的OPD框架下,学生采样其原生EOS时会获得系数 At = log π_E(y_t mid s_t) - log πθ(yt mid s_t) 。若教师将此token的概率赋予极低(如Qwen3中约 10^(-11) ),该系数为负,**持续压制学生原有的终止行为**;而教师偏好的替代token因学生采样概率过低,又难以通过on-policy采样获得有效监督,导致终止概率逐渐崩溃。 ### 3. 解决方案:概率级语义对齐 论文首先证明,**仅扩大解码停止集合(Fix 1)是无效的**,因为这既未改变蒸馏目标函数,也未提升低概率token的采样频率。随后,论文比较了三种在**概率层面**统一终止信号的修正: - **Fix 2(教师侧映射)**:将教师在 E(EOS) 上的总概率映射到学生原生规范token e^star ,即 πE(e^star mid s_t) = ∑(e ∈ EEOS) π_E(e mid s_t) 。 - **Fix 3(语义EOS聚合)**:将 E(EOS) 中所有token视为单一语义动作 stop ,定义聚合概率 π(stop mid st) = ∑(e ∈ E_EOS) π(e mid s_t) ,并对该语义动作进行蒸馏监督。 - **Fix 4(规范单EOS动作空间)**:同步修改教师分布与学生采样空间,强制仅保留单一终止动作。 实验表明,Fixes 2–4均能有效抑制长度膨胀,使响应长度与截断率回归教师参考水平。其中,**语义EOS聚合(Fix 3)**被推荐为跨模型族的默认方案,因其无需指定单一规范表面token,适用于学生与教师即使在相同声明集合下仍存在偏好分歧的场景。 ### 4. 跨模型验证与训练阶段演化 论文在Qwen3、Llama 3.2和Gemma 3上验证了语义修正的有效性,证实该现象并非单一模型族特有。此外,利用K2-Horizon-7B的连续训练阶段检查点(pretrain → midtrain → SFT → final),论文发现: - 终止偏好随训练阶段显著迁移,中训练与SFT阶段的学生已具备教师偏好的终止token的非零概率,vanilla OPD可自然完成表面token转移。 - 然而,即使终止表面形式已对齐,训练**晚期仍可能出现终止概率再度下降与长度重新增长**(Phase 3)。该行为在语义EOS修正下依然存在,说明**终止不匹配是长度膨胀的重要但非唯一来源**,暗示存在与局部目标函数特性相关的额外机制(如对未来失配的忽略)。 ### 5. 模板效应与评估敏感性 论文还发现,训练提示模板对生成长度具有持久影响(如DAPO模板倾向于更短输出),而评估模板与评分器显著改变测得的任务性能。这揭示了OPD研究中评估协议作为变异源的重要性,并表明长度增长与推理能力损失并非必然耦合。 ### 6. 结论 论文将终止token不匹配确立为OPD长度膨胀的一个主要、可诊断的实现层根因,强调必须在**概率语义层面**而非仅在解码接口层面对齐终止行为。同时,论文指出晚期长度动态仍存在尚未被解释的残余机制,为后续研究O PD的稳定性提供了重要方向。论文已开源包含终止修正的实现与评估协议。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yuxiao Yang,Tianrun Yu,Shangzhe Li,Kaixiang Zhao,Xuchao Zhang,Chetan Bansal,Huaxiu Yao,Taylor W. Killian,Weitong Zhang

Categories:

PDF URL: https://arxiv.org/pdf/2609.20511.pdf

Arxiv URL: https://arxiv.org/abs/2609.20511

Arxiv ID: 2609.20511

CoolPaper URL: https://papers.cool/arxiv/2609.20511

Published: 2026-09-19T01:34:33.541Z

Updated: 2026-09-19T01:34:33.541Z


5. JEPA-Anything: Learning Predictive Models across Different Worlds

Abstract:World modeling enables intelligence to anticipate consequences, guide interventions, and learn from interaction. Yet predictive models remain domain-specific: can a common learning principle support world modeling across radically different systems? We introduce JEPA-Anything, a domain-agnostic framework based on orthogonal predictive factorization (OPF). Extending joint-embedding predictive architectures, OPF decomposes latent targets into complementary factors, learns them through dedicated pathways, and recombines them within a shared predictive design. We evaluate JEPA-Anything across seven domains: vision, biology, clinical trajectories, control, molecular dynamics, physical fields, and weather. Experiments span representation learning, intervention prediction, out-of-distribution generalization, and long-horizon dynamics, including 10 matched dynamics tasks, forecasting of over 1,000 clinical events, and 100-step molecular rollouts across four systems. Against matched JEPA baselines, JEPA-Anything improves reported metrics on all 10 dynamics tasks and reduces single-intervention prediction error on Interventional Pong by 34.8%. It achieves the lowest one-step and 100-step molecular errors among compared methods in all four systems. Beyond prediction, a factor-nominated biological intervention receives experimental support in cell co-cultures, patient-derived organoids, tumor fragments, and mice; latent orbital modes recover the Keplerian scaling exponent with a fitted slope of -1.4991. These results support a common factorized predictive principle across heterogeneous worlds, connecting world modeling with intervention and experimentally grounded scientific discovery. Code: this https URL

中文摘要

摘要:世界建模使智能能够预见后果、指导干预并从交互中学习。然而,预测模型仍然是特定领域的:是否有一种通用的学习原则可以支持跨截然不同系统的世界建模?我们提出了 JEPA-Anything,一种基于正交预测分解(OPF)的领域无关框架。通过扩展联合嵌入预测架构,OPF 将潜在目标分解为互补因子,通过专用路径学习这些因子,并在共享的预测设计中重新组合它们。我们在七个领域评估了 JEPA-Anything:视觉、生物学、临床轨迹、控制、分子动力学、物理场和天气。实验涵盖表示学习、干预预测、分布外泛化和长时程动力学,包括 10 个匹配动力学任务、超过 1,000 个临床事件的预测以及四个系统中 100 步的分子展开。与匹配的 JEPA 基线相比,JEPA-Anything 在所有 10 个动力学任务上提高了报告的指标,并在 Interventional Pong 单一干预预测中将误差降低了 34.8%。在四个系统中,它在所有比较方法中实现了最低的单步和 100 步分子误差。除了预测之外,一个因子提名的生物干预在细胞共培养、患者来源类器官、肿瘤碎片和小鼠实验中获得了支持;潜在轨道模式以拟合斜率 -1.4991 恢复了开普勒定律的缩放指数。这些结果支持在异质世界中使用通用的分解预测原则,将世界建模与干预及实验基础的科学发现相连接。代码:此 HTTPS URL

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决的核心问题是:\*\*预测模型(世界模型)目前仍局限于特定领域,如何设计一个统一的学习框架,使其能够在结构截然不同的系统(如视觉、生物、临床、控制、分子动力学、物理场、天气等)之间共享同一套预测性世界建模原理。\*\* 具体而言,论文从以下几个层面展开这一问题: 1. \*\*领域特定性的瓶颈\*\* 现有世界模型通常为单一领域定制,缺乏跨域复用的通用接口。论文提出,尽管不同系统的观测形态各异(像素、轨迹、图、场、多变量记录等),但其底层预测问题具有共性:从上下文推断未观测、被干预或未来的状态。 2. \*\*单一潜在目标的预测容量分配困境\*\* 在标准联合嵌入预测架构(JEPA)中,目标状态通常由单一嵌入向量表示。当局部与全局结构、多实体或多尺度变化共享这一"单块"目标时,易于预测的方向会主导优化,导致较弱或冲突的预测结构获得相互干扰的梯度。论文将此定义为\*\*预测容量分配问题\*\*。 3. \*\*跨异质世界的统一接口设计\*\* 论文追问:能否通过一个共同的潜在世界状态接口,利用多个互补因子来组织不同上下文–目标系统中结构各异的预测状态?为此,提出\*\*正交预测分解(OPF)\*\*,将目标潜在空间分解为带专用预测器的正交子空间,既保持共享的预测设计,又允许各域按需配置因子数量与宽度。 简言之,该工作旨在验证:\*\*一种共同的分割式预测原则(orthogonal predictive factorization)是否足以支撑跨异质世界(anything)的建模、干预预测与科学发现。\*\* Q2: 有哪些相关研究? 这篇论文的相关研究主要涵盖以下几个方向: \*\*1. 潜在世界模型与规划\*\* 早期工作通过压缩观测并学习循环动力学来构建用于策略进化的世界模型


12
。后续研究如 DreamerV3
14
展示了单一基于模型的强化学习配置可在多样控制任务中支持行为学习。TD-MPC2
15
采用无解码器方法直接优化潜在动力学以实现可扩展的连续控制。近期工作进一步探索了基于预训练视觉编码器进行视觉目标规划的 DINO-WM
37
,以及结合大规模自监督视频表示与动作条件潜在模型用于机器人规划的 V-JEPA 2
4
。 **2. 联合嵌入预测架构(JEPA)** I-JEPA
3
开创了从可见上下文预测掩码图像区域表示的自监督范式;V-JEPA
7
将该原理扩展至视频领域并避免像素重建。Cell-JEPA
10
进一步将潜在预测适配到单细胞转录组学。Sobal 等
28
对 JEPA 目标进行了理论分析,表明其学习的不变性取决于上下文–目标对中变化的信号。此外,该框架还与能量基学习
20
、判别式相似度度量学习
8, 13
以及掩码图像预测等方向相关联。 **3. 结构化与因子化表示学习** 因子化表示学习通常寻求与独立生成变量对齐的坐标(如 β -VAE
16
)或与实体对齐的槽位(如 Slot Attention
23
)。结构化世界模型将状态表示为交互对象与关系
17
,而 CITRIS
21
利用时间干预来识别因果因子。然而,无监督语义解耦通常面临不可识别性问题
22
。与这些需要特定归纳偏置或监督的方法不同,本文提出的正交预测分解(OPF)不预设对象、因果或语义因子身份,而是从预测学习中涌现因子结构。 **4. 冗余缩减与表示崩溃预防** Barlow Twins
36
通过互相关匹配减少嵌入冗余;VICReg
6
则结合不变性损失与显式的方差和协方差正则化来防止崩溃。本文的 OPF 在精神上与这些工作相关,但将正交性和活性约束直接应用于学习到的预测目标子空间,并保留了显式的合成映射,从而将冗余缩减与完整的潜在世界状态联系起来。 **5. 跨领域基础模型与科学仿真基准** 实验部分还涉及多个领域的基础模型与评估基准,包括视觉编码器 DINOv3
27
和 SigLIP2
33
、单细胞基础模型 scGPT
9
、分子动力学仿真器 TrajCast
31
、物理方程基准 PDEBench
29
/ APEBench
18
/ DeepMind Control Suite
30
、以及天气基准 WeatherBench2
26
。在科学发现框架方面,论文进一步关联了 Discovery Foundation Models (DFMs)
35
、ScienceIDE
11
与 ScienceBuddy
34
等面向主动科学探索的代理系统。 Q3: 论文如何解决这个问题? 论文通过提出 **JEPA-Anything** 框架解决该问题,其核心是 **正交预测分解(Orthogonal Predictive Factorization, OPF)**。该方案将领域特定的观测几何与共享的预测核心解耦,使同一套机制能够适配视觉、生物、临床、控制、分子、物理场及天气等异质系统。 具体解决路径如下: ### 1. 建立统一的潜在世界状态接口 论文将跨域预测问题抽象为共同的上下文–目标(context–target)接口: - **领域适配器** Aδ 将原始观测 x 映射为内容令牌 H 与结构描述符 S ; - **视图采样器** Vδ 从中抽取上下文索引 C 与目标索引 T 。 由此得到通用接口:

(H, S) V_δ (H_C, S_C, T, S_T)
在此边界之上,所有后续操作(编码、分解、预测、合成)遵循同一算法,不受具体模态影响。 ### 2. 正交预测分解(OPF) 标准 JEPA 使用单一目标嵌入和单一路径进行预测。JEPA-Anything 通过 OPF 将目标潜在空间分解为多个互补子空间: - **分解**:引入 K 个可学习的投影矩阵 P_k ∈ R^(d × r) (满足 Kr = d ),将停止梯度的目标表示 z_t = sg(z_t) 分解为:

z_t^((k)) = P_k^top z_t, quad k = 1, dots, K

  • **专用预测**:每个因子配备独立的预测器 q_k ,从共享的上下文表示 z_c (及目标描述符 s_t )预测对应因子:
    z_t^((k)) = q_k(z_c, s_t)
    • 合成完整状态:将各因子预测拼接为 $ut =
      (z_t^((1)))^top, dots, (z_t^((K)))^top
      ^top$,再通过 Moore–Penrose 伪逆合成完整的潜在目标状态:
      z_t = (P^top)^dagger u_t, quad P = [P_1, dots, P_K]
      当 P 正交时,该式退化为 z_t = ∑_k P_k z_t^((k)) ,保证无信息损失且合成稳定。 ### 3. 正则化机制确保分解有效 为防止因子退化和表示崩溃,论文引入三项正则化: - **正交性约束** L
      (orth) :要求每个投影器内部列向量近似标准正交,且不同投影器子空间近似正交:

L(orth) = ∑(k=1)^K |Pk^top P_k - I_r|_F^2 + ∑(1 le i < j le K) |Pi^top P_j|_F^2
这保证各因子覆盖非重叠的方向,且合成映射条件数 kappa_2(P) ≈ 1 。 - **因子活性约束** L
(fac) :对每个因子的经验标准差设置下界 γ(fac) ,防止某些因子在训练中被”关闭”。 - **编码器方差约束** L(enc) :对在线编码器输出的经验标准差设置下界 γ(enc) ,直接向其发送反崩溃梯度。 ### 4. 可加的统一训练目标 各领域实例保留其原有基础损失 L(base)^((δ)) ,并叠加 OPF 损失:

L(OPF) = L(pred) + λ(orth)L(orth) + λ(fac)L(fac) + λ(enc)L(enc)

L(train)^((δ)) = L(base)^((δ)) + L(OPF)
其中预测损失 L
(pred) 对各因子进行直接回归:
L(pred) = (1) / (K|T|r) ∑(t ∈ T) ∑_(k=1)^K |z_t^((k)) - z_t^((k))|_2^2

5. 双模式复用机制 同一预训练模型支持两种下游使用方式,验证其作为通用接口的灵活性: - **表示模式(Representation Mode)**:丢弃投影器与预测头,直接使用在线编码器 fθ 作为可复用的特征提取器,接入各领域特定的读出层(readout)。 - **操作式世界模型模式(Operational World-Model Mode)**:保留投影器与预测器,通过合成公式获得完整下一状态 z(t+1) ,并将其反馈输入以实现多步自回归推演、规划或解码。 ### 6. 因子级科学诊断接口 学习的投影矩阵 P_k 构成可解释的诊断接口。通过计算因子坐标:

uk(x) = P_k^top zδ(x)
研究者可以对潜在状态进行干预分析(如替换某一因子观察其对系统演化的影响)或物理规律提取(如从因子模态中恢复轨道频率的标度律),从而连接世界建模与实验验证的科学发现闭环。 简言之,JEPA-Anything 通过**统一接口 + 正交子空间分解 + 稳定合成 + 双模式复用**,使同一套预测学习原则能够跨越异质世界,既提升预测精度,又提供可干预、可分析的模块化潜在状态。 Q4: 论文做了哪些实验? 论文将实验组织为三个评估组,涵盖视觉、单细胞生物学、临床医学、干预动力学、连续控制、分子动力学、偏微分方程、天气预测及科学诊断等七个领域。 ### Group I:预测世界状态的终端读出(Terminal Readout) 该组评估在线编码器状态或一步合成未来状态在下游任务中的直接效用,不涉及递归推演。 - **受控视觉绑定(Controlled Visual Binding)** 在 MuJoCo 重建场景中,使用 DINOv3 ViT-S 与 SigLIP2 Base 作为骨干网络,通过块掩码补丁预测进行预训练。评估指标包括注入准确率(INJ)、崩溃率(Coll.)和网格恢复率(Rec.)。在完全相同的 learned-grid 读出架构下,JEPA-Anything 相比标准 JEPA 取得更优结果;例如 DINOv3 条件下 INJ 从 0.572 提升至 0.581,Coll. 从 0.426 降至 0.417,Rec. 从 0.645 提升至 0.659。 - **单细胞状态表示与扰动预测** 基于 scGPT 骨干,在约 80 万个人类肾脏细胞上预训练,评估 PBMC-10K 细胞类型聚类(AvgBIO)及 Adamson、Norman 数据集上的扰动响应预测(Pearson 相关系数)。JEPA-Anything 在所有四项指标上均优于标准 JEPA 和未使用 JEPA 的基线。例如,PBMC 微调 AvgBIO 达到 0.8301(标准 JEPA 为 0.7830),Norman 扰动预测 Pearson 达到 0.814(标准 JEPA 为 0.787)。 - **纵向疾病状态预测** 使用 GPT-2 small( d=768 )处理纵向多模态队列数据,预测未来患者状态并解码为 1,000 余种临床事件风险。JEPA-Anything 通过正交因子合成未来状态后输入共享轻量解码器,其平均精确率–召回率曲线下面积(mean PRAUC)高于匹配的单块 JEPA 基线。 ### Group II:潜在世界动力学与推演稳定性 该组测试合成后的潜在状态能否被递归用于干预预测、多步自回归推演或闭环规划。 - **干预条件组合预测(CITRIS Interventional Pong)** 在单干预和未见过的组合干预条件下进行下一步状态预测,并评估六步自由推演。相比密集标准 JEPA,JEPA-Anything 将单干预一步均方误差(MSE)从 0.009541 降至 0.006218(相对降低 34.83%),组合干预 MSE 降低 12.90%,六步自由推演 MSE 降低 8.58%。此外,机制审计表明正交因子化可将跨因子子空间重叠降至接近机器零,条件数 kappa2(P) 接近 1,而无约束多头基线则出现显著秩亏与冗余。 - **分布外与长程动力学基准** 在 CausalWorld、DeepMind Control Suite、PDEBench、WeatherBench2 等十项匹配动力学任务上,固定种子、骨干网络与优化预算进行对比。JEPA-Anything 在全部十项任务上均提升报告指标。针对 PDEBench Burgers 和浅水方程,六步推演误差显著降低(例如 Burgers 第一步 MSE 从 0.001830 降至 0.001101,第六步从 0.006369 降至 0.004014)。 在 APEBench 的 Burgers 与 Kuramoto–Sivashinsky(KS)系统上,Burgers 的分布外晚期状态预测 MSE 降低约 49.5%,六步推演降低约 44.7%;KS 晚期预测降低约 13.2%。在 50 步长程 Burgers 推演中,JEPA-Anything 在分布内和高频分布外轨迹上的 H20/H50 误差均持续低于标准 JEPA。 - **连续控制规划** 在 Hopper-v5、Walker2d-v5、HalfCheetah-v5 上,使用学习到的潜在动力学模型配合交叉熵方法(CEM)规划器。参数与计算量经严格匹配后,JEPA-Anything 在 Walker2d 和 HalfCheetah 上获得更高的平均 CEM 回报,而 Hopper 上标准 JEPA 略优。 - **因子活性与功能性干预** 在三个运动环境(Hopper、Walker2d、HalfCheetah)中,用岭回归探测每个八维因子对下一步观测变化的独立可读性,发现各因子对应不同的运动偏好(如躯干高度、足角度等)。随后,在 20 步推演中将单个因子替换为训练集均值,所有环境中任意因子的掩蔽均导致推演 MSE 上升;在 HalfCheetah 的 CEM 评估中,掩蔽 F1 或 F3 在全部五次训练种子中均降低回报。这构成了“活跃–可读–功能可用”的证据链。 - **无外力分子预测** 在水、 α -石英、对乙酰氨基酚、苯四个系统中,使用 TrajCast 式 O(3) 等变骨干进行 100 步自回归推演。JEPA-Anything 在所有四个系统中均实现最低的一步位移平均绝对误差(MAE)和 100 步终态位置均方根偏差(RMSD)。例如,水的 100 步 RMSD 从 2.536 Å 降至 2.459 Å,对乙酰氨基酚从 1.868 Å 降至 1.776 Å。 ### Group III:学习世界状态的科学分析 该组验证因子坐标能否作为可复用的科学诊断接口,连接模型假设与外部实验或已知物理定律。 - **因子提名干预的湿实验验证** 基于 JEPA-Anything 学习的正交因子坐标,分析提名 **IL-18 联合 NT5E/CD73 阻断** 为候选干预。后续在 Huh7–PBMC 共培养、三例患者来源肝细胞癌类器官、三例肿瘤碎片及免疫健全小鼠中进行的湿实验表明,该组合在所有测试条件下均表现出最强的肿瘤细胞杀伤效应,并伴有免疫细胞激活增加。 - **轨道尺度律的物理定律诊断** 从模拟的位置–速度轨迹(无物理标签)出发,通过因子坐标进行谱分析,将潜在频率与轨道半长轴配对。JEPA-Anything 提取的谱模态高度精确地恢复了开普勒关系 f propto a^(-3/2) ,拟合斜率为 -1.4991 ,决定系数 R^2 = 0.9999999 。 综上,实验从下游读出、递归动力学推演到科学假设的外部验证三个层面,系统评估了正交预测分解作为跨域统一世界建模原理的有效性。 Q5: 有什么可以进一步探索的点? 基于论文第6节 “Future Work” 及全文的实验边界,可进一步探索的方向包括: **1. 从被动预测到主动科学发现闭环** 论文提出可将 JEPA-Anything 的预测能力嵌入 Discovery Foundation Models (DFMs) 框架,与 ScienceIDE 和 ScienceBuddy 等可交互科学环境结合。未来可探索:智能体如何利用学习到的世界模型将研究问题转化为候选实验,通过潜在预测对实验进行优先级排序,并将计算或物理证据的结果与预测对比,进而更新模型、策略与研究流程。关键挑战在于形成**“更好世界模型 → 更有信息量的实验 → 模型与智能体共同改进”**的迭代闭环。 **2. 不确定性量化与分布偏移下的可靠性判定** 当前框架主要优化预测精度,尚未显式建模预测不确定性。未来需要研究: - 如何在分布偏移(distribution shift)下校准模型不确定性; - 如何判断学习到的世界模型是否“足够可靠”以指导真实实验; - 当观测结果与模型预测出现分歧时,如何触发模型修正或实验重新设计,而非盲目信任推演结果。 **3. 从预测因子到因果机制推断** 正交预测分解(OPF)通过可预测性涌现因子结构,但这些因子本质上是**统计性的**,并不天然对应因果变量。未来可探索: - 结合干预数据(如 CITRIS 中的结构化干预)将正交因子提升至因果表征; - 设计因子级别的因果发现算法,区分“可预测的相关性”与“可干预的因果机制”; - 在生物干预等场景中,验证因子提名是否对应真实的因果通路节点而非仅仅是预测性标志物。 **4. 自适应与动态因子结构** 当前 OPF 的因子数 K 和宽度 r 为预设超参数(满足 Kr = d )。未来可探索: - **动态因子分配**:根据数据复杂度或任务需求自动调整有效因子数量,避免固定分解带来的过参数化或容量不足; - **层级化分解**:在嵌套或多尺度的世界模型中,设计递归的因子分解结构,使不同层级对应不同时间尺度或空间尺度上的动力学; - **数据驱动的因子宽度分配**:允许不同因子拥有可变维度 r_k ,而非强制等宽划分。 **5. 跨域表示对齐与可迁移性** 虽然 JEPA-Anything 提供了共享的潜在状态接口,但论文指出**共享架构并不保证跨域表示对齐**。未来可研究: - 不同领域(如分子动力学与临床轨迹)学习到的正交基底是否存在可迁移的公共结构; - 设计跨域对齐目标,使某一领域(如物理场推演)中学习的因子能够迁移或适配到另一领域(如天气预测),实现跨世界知识共享; - 探索领域适配器 Aδ 与核心 OPF 之间的信息流边界,优化 Adapter 设计以保留更多跨域通用特征。 **6. 极长程推演与混沌系统稳定性** 论文在分子系统上评估了 100 步自回归推演,在 Burgers 方程上评估了 50 步。未来可挑战: - 更长时间的分子动力学(如纳秒至微秒尺度)或气候模式多步预测; - 对强混沌系统(如 Kuramoto–Sivashinsky 方程在更极端参数下)的误差增长进行理论刻画,研究正交分解是否能延迟或抑制**混沌发散**; - 结合隐式格式或多步校正机制,降低自回归推演中的误差累积。 **7. 复杂组合干预与反事实推理** CITRIS 实验初步验证了未见干预组合的泛化能力。未来可扩展至: - 高维组合干预空间(如基因多重扰动、多药物剂量联合),测试 OPF 的**组合指数爆炸**承受能力; - 反事实预测:给定“如果采取另一组干预”的假设,利用因子化的潜在状态进行反事实推演; - 在单细胞扰动或临床场景中,利用因子坐标设计最优干预策略(如最大化治疗效果、最小化毒性)。 **8. 正交性约束的变体与结构化扩展** 当前 L(orth) 追求标准正交基。未来可探索: - **稀疏正交分解**:允许每个因子仅在潜在空间的稀疏子集上激活,提升可解释性; - **非欧几里得几何**:将正交性推广到适应数据流形结构的约束(如 Grassmann 流形上的测地正交); - **软正交与信息瓶颈权衡**:在正交性与预测压缩之间进行可学习的权衡,而非硬约束。 **9. 与模型预测控制(MPC)及强化学习的深度融合** 目前连续控制实验采用 CEM 规划器。未来可将 OPF 学习到的潜在动力学与更先进的模型预测控制(MPC)、TD-MPC 或 MBPO 等框架深度集成,研究因子化状态空间是否能提升策略学习的样本效率、迁移性及安全性约束的满足程度。 Q6: 总结一下论文的主要内容 这篇论文提出 **JEPA-Anything**,一种基于正交预测分解(Orthogonal Predictive Factorization, OPF)的跨域通用世界建模框架。其核心内容与贡献可概括如下: —- ### 1. 研究动机 世界模型通过构建内部状态来预测系统演化,但现有预测模型通常局限于特定领域。尽管联合嵌入预测架构(JEPA)提供了通用的潜在预测机制,标准 JEPA 采用**单一目标嵌入**和**单一路径**的预测方式,容易导致易于预测的方向主导优化,而多尺度、多实体的复杂结构在训练中获得相互冲突的梯度。论文将这一问题定义为**预测容量分配问题**,并追问:是否存在一种共同的学习原则,能够支持在结构截然不同的系统之间进行统一的世界建模? —- ### 2. 核心方法 #### 2.1 统一的潜在世界状态接口 论文将跨域预测抽象为统一的上下文–目标(context–target)接口。具体地,领域适配器 Aδ 将原始观测 x 映射为内容令牌与结构描述符,视图采样器 V_δ 进一步划分上下文索引 C 与目标索引 T :

(H, S) V_δ (H_C, S_C, T, S_T)
在此边界之上,所有编码、分解、预测与合成操作遵循同一套与领域无关的算法。 #### 2.2 正交预测分解(OPF) 在目标编码器输出 z_t = sg(z_t) 之上,引入 K 个可学习的投影矩阵 P_k ∈ R^(d × r) (满足 Kr = d ),将目标表示分解为 K 个互补因子:

zt^((k)) = P_k^top z_t, quad k = 1, dots, K
每个因子配备独立的预测器 q_k ,从共享的上下文表示 z_c 中进行预测:
z_t^((k)) = q_k(z_c, s_t)
各因子预测拼接为 u_t 后,通过 Moore–Penrose 伪逆合成完整的潜在世界状态:
z_t = (P^top)^dagger u_t, quad P = [P_1, dots, P_K]
当 P 严格正交时, (P^top)^dagger = P ,合成退化为 z_t = ∑_k P_k z_t^((k)) ,保证信息无损且数值稳定(条件数 kappa_2(P) = 1 )。 #### 2.3 正则化与训练目标 为防止因子退化和表示崩溃,论文引入三项关键正则化: - **正交性损失** L
(orth) :强制子空间内部标准正交、子空间之间互相正交,消除冗余; - **因子活性损失** L(fac) :维持各因子在样本间的方差下界,防止因子被”关闭”; - **编码器方差损失** L(enc) :向在线编码器发送反崩溃梯度。 最终训练目标为各领域基础损失与可加 OPF 损失之和:

L(OPF) = L(pred) + λ(orth)L(orth) + λ(fac)L(fac) + λ(enc)L(enc)

2.4 双模式复用 - **表示模式**:丢弃投影器与预测头,直接使用在线编码器作为下游任务的特征提取器; - **操作模式**:保留完整 OPF 模块,支持多步自回归推演、规划及解码。 —- ### 3. 实验验证 论文在**七个领域**(视觉、单细胞生物学、临床医学、控制、分子动力学、偏微分方程、天气)上开展三组评估: **Group I:终端读出(Terminal Readout)** - **视觉绑定**(MuJoCo):在 DINOv3 与 SigLIP2 骨干上,JEPA-Anything 相比标准 JEPA 提升注入准确率、降低崩溃率; - **单细胞表示**(scGPT):PBMC-10K 聚类与 Adamson/Norman 扰动响应预测均取得最优; - **纵向疾病预测**:基于合成未来状态预测 1,000 余种临床事件,平均 PRAUC 优于单块 JEPA。 **Group II:潜在世界动力学(Latent World Dynamics)** - **干预预测**(CITRIS Interventional Pong):单干预预测 MSE 降低 **34.8%**,未见组合干预泛化提升 12.9%;机制审计证实正交因子化消除了子空间重叠(交叉重叠接近机器零),条件数接近 1; - **动力学基准**(CausalWorld、DeepMind Control Suite、PDEBench、WeatherBench2):在 10 项匹配任务上**全部**提升标准 JEPA 基线;PDEBench Burgers 六步推演 MSE 从 0.006369 降至 0.004014; - **连续控制规划**(Hopper/Walker2d/HalfCheetah):在 Walker2d 和 HalfCheetah 上提升 CEM 规划回报; - **分子动力学**(水、 α -石英、对乙酰氨基酚、苯):在四个系统中均实现最低的一步 MAE 与 100 步自由推演 RMSD; - **因子干预**:在运动中替换任一因子均增加推演误差并降低控制回报,证明各因子功能独立且均被使用。 **Group III:科学分析(Scientific Analysis)** - **生物干预提名**:基于因子坐标提名 IL-18 联合 NT5E/CD73 阻断,经 Huh7–PBMC 共培养、患者来源类器官、肿瘤碎片及免疫健全小鼠的湿实验验证,表现出增强的抗肿瘤活性; - **物理定律诊断**:从模拟轨道轨迹的因子模态中恢复开普勒定律 f propto a^(-3/2) ,拟合斜率为 ** -1.4991 **, R^2 = 0.9999999 。 —- ### 4. 主要贡献 - 定义了跨域通用的潜在世界建模接口,将领域特定的观测几何与共享的预测核心解耦; - 提出正交预测分解(OPF),通过正交子空间划分、专用预测器与稳定状态合成,解决预测容量分配问题; - 在异质系统(视觉、生物、临床、控制、分子、物理场、天气)上验证了该原则的统一适用性; - 展示了学习到的因子坐标可作为可解释的科学诊断接口,连接世界建模与实验驱动的科学发现。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Taoyong Cui,Zhongyao Wang,Xinyue Xu,Weiyang Liu,Zhaochen Yu,Yuying Zhang,Qiang Gao,Mengyue Yang,Wanli Ouyang,Pheng Ann Heng,Yingcheng Wu,Zhenfei Yin,Ling Yang

Categories:

PDF URL: https://arxiv.org/pdf/2609.20800.pdf

Arxiv URL: https://arxiv.org/abs/2609.20800

Arxiv ID: 2609.20800

CoolPaper URL: https://papers.cool/arxiv/2609.20800

Published: 2026-09-19T01:34:33.514Z

Updated: 2026-09-19T01:34:33.514Z


6. RiskChainBench: A Benchmark for Obfuscated Platform Message Restoration and Evidence-Grounded Web Investigation

Abstract:Platform abuse campaigns conceal redirection instructions with emojis, homophones, character decomposition, and redundant symbols, then route users through disguised links to services associated with pornography, fraud, gambling, or illicit transactions. Existing benchmarks evaluate obfuscated text and risky webpages separately, obscuring how target recovery affects downstream evidence acquisition. We introduce RiskChainBench, pairing 3,600 synthetic token-text restoration inputs from 600 source sessions with 600 corresponding human-labeled local web environments. A model first restores the message, operational intent, and destination; the same underlying model then acts as a VLM-driven web agent that investigates the correctly associated website and produces a frozen, evidence-cited risk report without message-side semantics or domain-reputation cues. We score restoration and correct-routing web investigation separately and compose them offline by applying the frozen primary-entry prediction as a gate to the same Task 2 result. Human labels determine task correctness, while a fixed multimodal evidence judge assesses faithfulness, sufficiency, completeness, and consistency. Across ten models, Entry Top-1 ranges from 35.2% to 95.2% and web decision accuracy from 26.3% to 62.8%; the leading systems differ across entry recovery, full reconstruction, website decisions, and fine-grained typing. Execution failures account for 31.9% of web runs, whereas post-decision type errors account for only 0.9%, identifying stable exploration and risk judgment as the principal bottlenecks. We release the benchmark, protocol, and resettable local sandbox.

中文摘要

摘要:平台滥用活动通过使用表情符号、同音字、字符分解和冗余符号来隐藏重定向指令,然后通过伪装链接将用户引导到与色情、欺诈、赌博或非法交易相关的服务。现有基准测试分别评估混淆文本和高风险网页,从而掩盖了目标恢复对下游证据获取的影响。我们引入了RiskChainBench,将来自600个源会话的3600个合成令牌-文本恢复输入与对应的600个人工标注本地网页环境配对。模型首先恢复消息、操作意图和目标;同一个底层模型随后充当VLM驱动的网页代理,调查正确关联的网站并生成冻结、带有证据引用的风险报告,而不使用消息端语义或域名声誉线索。我们分别对恢复和正确引导的网页调查进行评分,并通过将冻结的主要入口预测作为任务2结果的门控离线合成。人工标签决定任务正确性,同时固定的多模态证据评判者评估忠实性、充分性、完整性和一致性。在十个模型中,入口Top-1范围为35.2%至95.2%,网页决策准确率为26.3%至62.8%;领先系统在入口恢复、完整重建、网站决策和细粒度类型上各不相同。执行失败占网页运行的31.9%,而事后决策类型错误仅占0.9%,表明稳定的探索和风险判断是主要瓶颈。我们发布了该基准、协议和可重置的本地沙箱。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*跨渠道平台风险调查(cross-channel platform risk investigation)\*\*中,现有基准测试无法评估端到端错误传递的问题。具体而言,论文试图解决以下核心问题: ### 1. 现有评估体系的割裂性 现有基准将\*\*混淆内容理解\*\*(如文本去混淆、恢复)与\*\*风险网页调查\*\*(如网页探索、证据收集)分开评估: - \*\*混淆文本基准\*\*仅评估模型能否恢复被表情符号、谐音、同形异义字符、字符拆分等扰动后的文本,或对其进行分类; - \*\*网页代理基准\*\*仅评估模型在恶意或对抗性网页环境中的交互能力与安全性。 这种割裂掩盖了一个关键问题:\*\*上游微小的恢复错误(如目的地链接错误)会导致下游调查完全偏离正确目标\*\*,而现有基准无法度量这种跨阶段损失。 ### 2. 平台滥用中的实际风险链条 在真实的平台滥用场景中(如色情、欺诈、赌博、非法交易),滥用者通过以下方式逃避审核: - 使用表情符号、谐音替换、视觉相似字符、汉字拆分、冗余符号等混淆重定向指令; - 将用户引导至外部网页。 可靠的风险评估需要\*\*串联四个环节\*\*:消息恢复 → 目标识别 → 网页探索 → 基于证据的风险判定。现有工作缺乏一个统一的基准来评估这一完整链条。 ### 3. 消息侧语义与域名声誉的过度依赖 现有方法往往允许模型利用源消息语义或域名声誉等“捷径”来判断网页风险,而非基于实际观察到的网页证据。论文强调,\*\*网页侧的判定应仅依赖于代理实际浏览和收集到的证据\*\*,而非消息中的暗示或域名先验知识。 ### 解决方案概述 为此,论文提出了 \*\*RISKCHAINBENCH\*\*,其核心设计包括: - \*\*任务1(恢复)\*\*:评估模型从 3,600 个合成混淆消息中恢复 canonical message、操作意图和目的地的能力; - \*\*任务2(调查)\*\*:将同一底层模型作为 VLM 驱动的网页代理,在\*\*不暴露消息语义或域名声誉\*\*的前提下,对关联的本地网页环境进行调查,生成带有证据引用的风险报告; - \*\*离线门控组合\*\*:通过固定的 primary-entry 预测作为“门控”(gate),将恢复结果与网页调查结果离线组合,从而显式度量\*\*上游恢复错误对端到端性能的影响\*\*。 简言之,该论文首次将\*\*“混淆消息恢复”与“基于证据的网页调查”\*\*通过目的地身份显式链接,建立了一个可复现、可重置的本地沙盒基准,以暴露和诊断跨阶段失败。 Q2: 有哪些相关研究? 该论文在第2节(Related Work)中从两个维度梳理了相关研究,分别对应任务上游的\*\*混淆内容理解\*\*与任务下游的\*\*风险感知网页代理及轨迹评估\*\*。 ### 1. 混淆内容理解(Obfuscated content understanding) 现有研究主要关注滥用者如何通过字符编辑、同形异义字符(homoglyphs)、谐音、表情符号等绕过内容审核,并评估模型的恢复或检测能力: - \*\*TNT\*\*(Tan et al., 2020):针对字符扰动(character perturbations)的文本规范化与重建研究。 - \*\*Hatemoji\*\*(Kirk et al., 2022):构建基于表情符号的仇恨言论测试套件与对抗生成数据集,评估检测鲁棒性。 - \*\*OTH\*\*(Cooper, Surdeanu, and Blanco, 2023):揭示由表情符号与 Unicode 同形异义字符导致的鲁棒性失效。 - \*\*ToxiCloakCN\*\*(Xiao et al., 2024):评估中文攻击性语言在“ cloak 扰动”(cloaking perturbations)下的检测鲁棒性。 - \*\*PCR-ToxiCN\*\*(Guo et al., 2025):研究平台真实场景中由拼音替换(phonetic cloaking replacement)伪装的中文冒犯性语言检测。 - \*\*HomoP-CN\*\*(Ma et al., 2025):针对中文网络谐音的恢复能力进行基准测试。 - \*\*CodedLang\*\*(Wan, Li, and Huang, 2026):对真实世界中文在线评论中的“暗语”(coded language)进行分类与理解基准测试。 - \*\*ADVJARGON / JADE\*\*(Jiang et al., 2026):引入面向中文地下对抗性行话(adversarial jargon)的野注释数据集及其检测框架;该论文仅将其作为相关工作佐证,未直接导入其条目。 \*\*共性局限\*\*:上述任务大多止于恢复后的消息或标签,并未度量恢复出的目的地是否支持后续的实际调查。 ### 2. 风险感知网页代理与轨迹评估(Risk-aware web agents and trajectory evaluation) 另一类研究聚焦于可复现的网页交互、恶意链接处理以及代理轨迹的自动评估: - \*\*WebArena\*\*(Zhou et al., 2024):提供自托管网站环境,支持自主代理的可复现交互。 - \*\*MalURLBench\*\*(Kong et al., 2026):评估代理在处理伪装恶意 URL 时的脆弱性。 - \*\*SecureWebArena\*\*(Ying et al., 2026):引入对抗性网页环境,对基于 LVLM 的网页代理进行整体安全评估。 - \*\*FraudSMSWalker\*\*(Zhou et al., 2026):将消息上下文与安全处理的网页证据关联,用于 SMS 到网页的欺诈检测,同时隐藏域名声誉等捷径。 \*\*轨迹评估的进一步挑战\*\*: - \*\*AgentRewardBench\*\*(Lù et al., 2025):发现在多个网页代理基准中,单一 LLM 评判器难以始终保持一致。 - \*\*PlanRewardBench\*\*(Wang et al., 2026a):识别较长轨迹上奖励建模的退化问题。 - \*\*REFLECT\*\*(Wang et al., 2026b):暴露基于证据的研究代理中,LLM 评判器在证据验证方面的弱点。 \*\*研究缺口\*\*:现有工作未能将“目的地恢复”与“主动网页调查”显式链接,也未在上游消息恢复与下游网页证据之间建立隔离机制,从而无法诊断跨阶段的错误传递。该论文提出的 RISKCHAINBENCH 正是为了填补这一空白。 Q3: 论文如何解决这个问题? 该论文通过提出 \*\*RISKCHAINBENCH\*\* 基准,将跨渠道平台风险调查形式化为一个\*\*可度量的两阶段链接过程\*\*,并通过严格的输入隔离与离线门控机制,显式诊断上游恢复错误对下游网页调查的跨阶段影响。具体解决方案如下。 ### 1. 整体框架:以网站为单元的嵌套设计 RISKCHAINBENCH 以网站为主要评估单元,每个实例 b_i 包含: - M_i :离线构建的本地网页环境; - X_i = (x^*_(ij), x_(ij))_(j=1)^(K_i) :同一源会话的 6 个消息变体(1 个规范源 x^*_(ij) 和 1 个混淆输入 x_(ij) ); - y_i = (d_i, c_i) :人工标注的网站级标签(决策 d_i ∈ V, N, U 与主类型 c_i )。 固定 S = 600 个网站,每个网站 K_i = 6 个变体,共 N = 3,600 条恢复输入。其中\*\*一个固定主变体\*\*(primary variant)专用于跨阶段门控,其余 5 个仅参与文本恢复评估。 ### 2. 基准构建:合成混淆消息与受控本地沙盒 - \*\*合成消息生成\*\*:基于 600 个完全合成的源会话,通过确定性管道生成 6 种混淆配方,分别测试复合恢复、谐音替换、入口混淆、混合词汇与平台 token 损坏、少行布局、字形安全垂直布局。所有编辑均存储为可逆痕迹;入口使用保留的 \`.test\` 三标签名称,避免接触真实服务。 - \*\*本地网页环境\*\*:从对应真实网页离线构建,在隔离网络中运行。保留页面结构、内容、重定向与交互反馈,同时替换外部依赖为本地或合成状态。环境定义可观察状态、允许动作、状态转移与有界交互预算,\*\*不编码程序化的风险标签或唯一正确证据路径\*\*。 - \*\*人工标注\*\*:4 名训练有素的标注员在统一编码手册下标注网站决策与 9 种违规主类型,经独立双评、盲审复核与协调员 adjudication 确立 gold label。 ### 3. 阶段一:冻结式混淆消息恢复(Task 1) 模型仅接收混淆消息 x_(ij) ,不允许访问网页或域名声誉服务,必须输出: - 规范消息 x_(ij) ; - 操作意图 iota_(ij) ; - 排序入口候选列表 Z_(ij) = (z^((1))_(ij), ..., z^((k))_(ij)) 。 该输出在网页调查开始前即被\*\*冻结\*\*,后续浏览过程不得修改。核心指标为 \*\*Entry Top-1\*\* 精确匹配率:

Entry@1 = (1) / (N) ∑i ∑_j I[rho(z^((1))(ij)) = i],
其中 rho(·) 为私有解析器。此外报告完整重建率(canonical message、intent、entry 均正确)与字符级编辑距离(CER)。 ### 4. 阶段二:证据隔离的网页调查(Task 2) 同一底层模型作为 VLM 驱动的网页代理,在 BrowserGym–Playwright 环境中与 M_i 交互。关键隔离设计包括: - **输入边界**:代理仅接收通用指令 u 与高级、无标签的动作类别脚手架 h_i (不含风险标签、目标选择器、预期状态或强制动作顺序); - **信息屏蔽**:代理**不可见**源消息、规范消息、模型恢复结果、原始域名或解析器输出; - **轨迹生成**:代理在随机化本地主机名下执行动作,生成有界轨迹

τi = (o_0, a_0, …, a(Ti-1), o(Ti)), quad T_i ≤ H,
直至停止或耗尽 30 动作/600 秒预算。 轨迹冻结后,模型基于 τ_i 生成风险结论 y_i = (d_i, c_i) 、理由 r_i 与证据引用 E_i = (t_k, ell_k)
(k=1)^(Li) ,且仅允许引用已观察到的轨迹内容。这使得网站判定必须依赖于**实际采集的网页证据**,而非消息语义或域名声誉捷径。 ### 5. 离线端到端组合:Entry Gate 为度量跨阶段错误传递,论文设计了一个**离线门控机制**,无需重新运行浏览器: - 对每个 Q4: 论文做了哪些实验? 论文在第4节(Experiments)中系统评估了十个模型在消息恢复与网页调查两阶段的表现,并进行了跨阶段组合与失败归因分析。实验涵盖以下内容: ### 1. 实验设置 - **数据规模**:600个本地网站环境,每站1个源会话、6个混淆变体,共3,600条Task 1恢复输入;Task 2在600个网站上各执行1条调查轨迹。 - **评估模型**:共10个模型,包括GPT-5.4、GPT-5.6 SOL、GPT-5.2、Claude Opus 4.8、Claude Sonnet 5、Kimi K3、Kimi K2.5、Kimi K2.6、Qwen3.6 Plus、Doubao Seed 2.0。 - **交互预算**:每个模型–网站对运行1条BrowserGym–Playwright轨迹,上限为30个动作、600秒;提前生成有效报告则立即终止。 - **统计估计**:主要指标采用2,000次网站级bootstrap重采样计算中心95%置信区间。 ### 2. Task 1:混淆消息恢复实验 评估所有3,600条输入,模型仅接收文本,输出规范消息、操作意图与排序入口列表。 **主要结果(表1a)**: - **Entry Top-1**(首要指标):范围为 35.19% (Kimi K2.6)至 95.22% (GPT-5.4)。排名前三为GPT-5.4、GPT-5.6 SOL( 94.31% )、Claude Opus 4.8( 92.94% )。 - **Full Reconstruction**(消息、意图、Top-1入口全对):范围为 16.06% 至 73.31% ,GPT-5.6 SOL领先。 - **CER**(字符级编辑距离率):GPT-5.6 SOL最低( 1.11% ),但低CER并不保证高Entry Top-1(如Kimi K3的CER为 1.59% ,Entry Top-1为 84.58% )。 此外报告了Entry Recall@k与按混淆配方、严重程度、入口位置分层的详细分析。 ### 3. Task 2:证据隔离的网页调查实验 在600个本地网站上,模型作为VLM网页代理,基于实际观察输出风险决策与证据。 **主要结果(表1b)**: - **决策准确率(Acc.)**:范围为 26.3% (Claude Sonnet 5)至 62.8% (GPT-5.6 SOL)。 - **决策宏F1(Dec. F1)**:GPT-5.6 SOL最高( 59.3% )。 - **违规类型宏F1(Type F1)**:Kimi K2.5领先( 48.1% ),显示网站决策与细粒度类型判断的排名并不一致。 - **分层精确匹配(H-EM)**:范围为 26.2% 至 61.0% ,GPT-5.6 SOL领先。 **失败归因分析(图5)**: 在全部6,000条模型运行(10模型×600网站)中: - **执行失败**占比最高,达 31.9% (如页面无法到达、环境阻断、预算耗尽等); - **未生成报告**占 8.2% ; - **决策错误**占 12.3% ; - **类型错误**(在正确决策后判错类型)仅占 0.9% 。 该结果表明,**稳定的网页探索**是证据驱动判定的主要瓶颈,而非判定后的细粒度分类。 ### 4. 端到端组合实验(Entry-Gated) 利用固定的primary variant入口作为门控,将同一冻结的Task 2结果离线组合,度量上游恢复错误对端到端性能的影响。 **主要结果(表2与图1)**: - **Web-only准确率**与**Gated准确率**的差值( Delta(gate) )显式归因于入口恢复: - GPT-5.6 SOL: 62.8% to 60.8% ,损失 2.0 个百分点; - Kimi K2.5: 55.2% to 25.7% ,损失 29.5 个百分点; - Qwen3.6 Plus: 51.7% to 19.3% ,损失 32.3 个百分点; - Kimi K2.6: 41.5% to 16.7% ,损失 24.8 个百分点。 - 端到端准确率范围: 16.7% (Kimi K2.6)至 60.8% (GPT-5.6 SOL)。 ### 5. 多维度多模态证据评判 使用固定的多模态证据评判器 Jφ 对冻结轨迹进行四维诊断: - **Evidence faithfulness**(证据忠实性) - **Evidence sufficiency**(证据充分性) - **Investigation completeness**(调查完整性) - **Reasoning consistency**(推理一致性) 该评判器仅作为覆盖条件下的诊断工具,不参与任务标签判定。完整四维结果与覆盖率详见补充材料。 ### 6. 辅助验证 - **协议有效性检查**:确定性验证器检查动作是否在允许环境内、引用是否指向已观察内容;无效运行单独报告并计为任务失败。 - **人工审计**:隐藏重复测试显示人工决策一致性为 97.9% ,决策-类型联合一致性为 95.8% ;标注路径包括460例双方共识、120例第三方多数、20例协调员裁定。 Q5: 有什么可以进一步探索的点? 基于论文结论与实验发现,以下方向值得进一步探索: ### 1. 重运行方差的度量与降低 当前实验对每个模型–网站对仅采集**单条轨迹**。由于大模型的随机性与网页环境的动态交互特性,结果可能受单次采样波动影响。未来应在相同隔离环境中进行多次运行,度量重运行方差(rerun variance),以区分模型能力的系统性缺陷与偶然波动。 ### 2. 代表性不足的风险类型与语言扩展 现阶段的 600 个网站在违规类型分布上存在不均衡:394 个违规网站仅覆盖 6 种非零支持的主类型,部分类型样本稀疏。此外,数据集主要聚焦于中文语境下的混淆策略。后续工作需: - 扩大**低支持风险类型**(如特定金融诈骗、跨境赌博变种)的覆盖; - 引入**多语言**的混淆模式(如阿拉伯语、俄语等使用 homoglyph 与谐音策略的变体)。 ### 3. 证据评分标准的人工验证与校准 论文采用固定的多模态自动评判器 Jφ 对轨迹证据进行四维诊断(忠实性、充分性、完整性、一致性),但该评判器本身未经大规模人工审计校准。未来应在**相同隔离环境**中开展冻结的人工轨迹审计(frozen human trajectory audit),验证自动评判器与专家判断的一致性,并修正证据引用标准(如截图与文本片段的准入规则)。 ### 4. 执行失败率的系统性降低 诊断分析显示,** 31.9% 的运行在执行阶段即告失败**(页面不可达、环境阻断、预算耗尽等),而决策后的类型错误仅占 0.9% 。这表明网页代理的**稳定探索能力**是当前主要瓶颈。可进一步探索: - 更鲁棒的失败恢复机制与动态预算分配; - 针对隔离沙盒中网络延迟、状态重置异常的预处理策略; - 结合强化学习或课程学习提升长程交互稳定性。 ### 5. 端到端联合优化而非离线门控 当前框架要求消息恢复输出在浏览前即被冻结,两阶段通过离线入口门控组合:

y^e_i = y_i, & g_i=1, bot, & g_i=0.
这种严格隔离确保了诊断的清晰性,但也丧失了网页侧反馈修正恢复结果的可能性。未来可探索: - 允许代理在浏览早期发现入口可疑时触发恢复模块重推理; - 构建可微分或强化学习的跨阶段联合训练目标,优化端到端风险调查成功率而非单独优化 Entry Top-1 或 Acc。 ### 6. 更细粒度的混淆策略与对抗演化 当前 6 种混淆配方为确定性生成。真实平台上的滥用者会动态演化规避策略,例如: - 引入上下文相关的多轮暗语(与 CodedLang 和 ADVJARGON 场景结合); - 利用视觉布局(如竖排文字、零宽字符)与平台渲染特性; - 构造跨模态混淆(图文混合指示入口)。 ### 7. 模型架构与输入模态的扩展 论文评估的 10 个模型以闭源/通用大模型为主。后续可引入: - 专用的小型安全领域模型,检验其在有限算力下的恢复与调查表现; - 纯文本 vs. 多模态恢复:当前 Task 1 为纯文本输入,但部分混淆策略可能涉及图片中的文字(如截图传播),需要 OCR 与文本恢复的联合建模。 ### 8. 实时动态环境与对抗性测试 当前 M_i 为离线构建的静态本地环境。未来可扩展至: - 状态ful重放的深度利用(当前仅 333 个网站支持 stateful replay); - 引入主动对抗性网页(如模仿 benign 页面结构、动态变更 DOM 以误导代理); - 考察模型在面对蜜罐或反爬虫机制时的证据采集鲁棒性。 ### 9. 法律与伦理边界的深化 论文已在伦理声明中强调避免接触真实服务与个人身份。后续研究可进一步: - 建立自动化 red-teaming 协议,检验基准本身是否可能被用于训练更高效的滥用规避系统; - 探索模型输出在数字取证链条中的可采信度标准,将证据引用格式与司法审计需求对齐。 Q6: 总结一下论文的主要内容 该论文提出 RISKCHAINBENCH,首个将混淆平台消息恢复基于证据的网页风险调查显式链接的跨渠道评估基准,以暴露和诊断上游文本恢复错误对下游网页取证的跨阶段影响。 ### 研究背景与问题 - 平台滥用者通过表情符号、谐音、字符拆分、冗余符号等混淆重定向指令,将用户导至色情、欺诈、赌博等外部网页。 - 现有基准割裂地评估“混淆文本恢复”与“网页代理交互”,无法度量一个关键问题:上游恢复的小错误(如目的地链接错误)会导致下游调查完全偏离目标。 - 此外,现有方法常依赖消息语义或域名声誉捷径,而非基于实际网页证据做风险判定。 ### RISKCHAINBENCH 设计 以网站为核心单元,每个实例 b_i = (M_i, X_i, y_i) 包含: - M_i :离线构建的本地隔离网页环境(600 个),人工标注风险决策 d_i ∈ V, N, U 与违规类型 c_i 。 - X_i :600 个合成源会话各产生 6 个混淆变体(共 3,600 条),覆盖复合混淆、谐音、入口混淆、平台 token 损坏等配方。 - 离线 Entry Gate:固定一个 primary variant 的 Top-1 恢复结果作为门控 $g_i = I

rho(z^((1))_i) = i
,将同一冻结的网页调查结果离线组合为端到端指标。 ### 两阶段评估协议 - Task 1(恢复):模型仅接收混淆文本,冻结输出规范消息 x 、操作意图 iota 与排序入口 Z 。核心指标为 Entry Top-1 精确匹配。 - Task 2(网页调查):同一模型作为 VLM 代理在本地沙盒中浏览,不可见源消息、恢复结果或原始域名,仅基于实际观察轨迹 τ_i 生成风险结论、理由与证据引用。人工标签判定任务正确性;固定多模态评判器独立评估证据忠实性、充分性、完整性与一致性。 ### 主要实验结果 对 10 个模型(GPT-5 系列、Claude、Kimi、Qwen、Doubao 等)的评估显示: - 恢复阶段:Entry Top-1 从 35.2% (Kimi K2.6)到 95.2% (GPT-5.4),全重建率与字符级恢复排名不一致。 - 网页调查阶段:决策准确率从 26.3% 到 62.8% (GPT-5.6 SOL 领先),分层精确匹配最高 61.0% 。 - 端到端组合:经 Entry Gate 后准确率降至 16.7% – 60.8% ,部分模型因入口恢复差导致端到端损失超过 30 个百分点。 - 失败归因:执行失败(页面不可达、预算耗尽等)占 31.9% ,是最大瓶颈;决策后的类型错误仅 0.9% 。 ### 贡献与局限 - 贡献:形式化跨渠道平台风险调查问题;构建 3,600 条合成恢复输入与 600 个人工标注的本地沙盒环境;建立两阶段基线并定位混淆恢复、网页执行、风险判定与细粒度分类的瓶颈。 - 局限与未来方向:单条轨迹未估计重运行方差;部分违规类型样本稀疏;证据评判器待人工审计校准;未来需扩展多语言、动态对抗环境,并探索降低 31.9%$ 执行失败率的方法。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: ZhuoXin Liu,Zhiming Ma,Ying Zhang,Mengzheng Yang,Yifan Wang,Zhengqi Huang,Yanhan Zhou,Zekun Lin,Jun Zhang,Shun Zhang,Yue Chen,Qiao Zhao,Peng Chen

Categories:

PDF URL: https://arxiv.org/pdf/2609.16900.pdf

Arxiv URL: https://arxiv.org/abs/2609.16900

Arxiv ID: 2609.16900

CoolPaper URL: https://papers.cool/arxiv/2609.16900

Published: 2026-09-19T01:34:38.345Z

Updated: 2026-09-19T01:34:38.345Z


7. RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

Abstract:Multi-turn agents trained with reinforcement learning (RL) receive a single scalar reward per trajectory, which motivates self on-policy distillation (OPD) to supply dense token-level supervision from a self-teacher with privileged task skills, letting a skill-free student internalize them. This recipe, however, is undermined by two findings in agentic tasks: privileged information alone does not always make a teacher reliable, and the benefit of teacher supervision is stage-dependent. We therefore propose RetireOPD (Self-Retiring On-Policy Distillation), which first optimizes a decoupled, skill-conditioned teacher with environment rewards and then trains a skill-free student jointly with RL and OPD. Rather than following a predefined distillation schedule, RetireOPD adopts Adaptive Retirement: the student drops the teacher on its own once their discrepancy stops shrinking and it reaches a target fraction of the teacher’s success rate, after which training proceeds with RL alone. Across Qwen2.5 models from 1.5B to 7B, RetireOPD improves ALFWorld success rate over RL baseline by 14.1% to 18.8% and WebShop accuracy by 11.8% to 19.0%, and surpasses its own skill-conditioned teacher in every setting.

中文摘要

摘要:使用强化学习(RL)训练的多轮代理在每条轨迹中只接收一个标量奖励,这促使自我策略蒸馏(OPD)通过具有特权任务技能的自我教师提供密集的令牌级监督,使没有技能的学生能够内化这些技能。然而,这一方法在代理任务中受到了两个发现的影响:仅凭特权信息并不总能使教师可靠,并且教师监督的益处依赖于阶段。因此,我们提出了 RetireOPD(自我退役策略蒸馏),它首先使用环境奖励优化解耦且条件化于技能的教师,然后与 RL 和 OPD 共同训练无技能的学生。RetireOPD 不采用预定义的蒸馏计划,而是采用自适应退役策略:一旦学生与教师的差异不再缩小,并且达到教师成功率的目标比例,学生就会主动放弃教师,此后训练仅依靠 RL 进行。在从 1.5B 到 7B 的 Qwen2.5 模型中,RetireOPD 在 ALFWorld 的成功率比 RL 基线提高了 14.1% 至 18.8%,在 WebShop 的准确率提高了 11.8% 至 19.0%,并且在所有设置中都超过了其自身的条件化技能教师。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*多轮智能体强化学习(Agentic RL)中,基于特权信息的自蒸馏(On-Policy Distillation, OPD)所面临的两个核心失效模式\*\*,并提出一种自适应的"教师退役"机制来优化技能内化过程。具体而言,论文试图解决的问题包括: - \*\*特权教师不可靠的问题\*\*:现有方法通常假设,只要给教师模型提供特权上下文(如任务技能、参考解决方案),它就一定能比学生模型更可靠。但研究发现,仅仅拥有特权信息并不足以保证教师更优秀——如果不显式地用环境奖励优化,即使是相同架构甚至更大参数量的技能条件化教师,其任务成功率也可能远低于预期,无法提供有效的密集监督。 - \*\*教师监督的阶段依赖性冲突\*\*:教师蒸馏与强化学习(RL)信号在早期通常对齐,能加速学习并缓解稀疏奖励问题;但一旦学生基本内化了教师所诱导的行为,继续强制匹配教师分布会与以环境奖励为导向的RL梯度产生局部冲突。此时,持续蒸馏反而会将学生限制在教师的能力天花板附近,阻碍其通过奖励优化进一步超越教师。 - \*\*固定调度无法适配动态过渡\*\*:现有方法往往通过预定义的退火策略或固定的两阶段切换来决定何时减少/停止蒸馏,但不同模型和任务中"教师效用耗尽"的时间点差异显著(实验中从第50步到第90步不等),固定调度容易过早或过晚移除监督。 为应对上述问题,论文提出 \*\*RetireOPD\*\*,其核心解决思路包括: 1. \*\*解耦并显式优化教师\*\*:用环境奖励单独训练技能条件化的教师,将特权信息转化为可靠的行为优势; 2. \*\*联合训练与自适应退役\*\*:学生早期同时接受GRPO和OPD训练,但当监控到"师生差异停止缩小"且"学生成功率达到教师的一定比例"时,自动退役教师,后续仅用RL继续优化,从而既保留早期密集监督的收益,又避免后期的优化冲突。 Q2: 有哪些相关研究? 根据论文第2节(Related Work),相关研究可归纳为以下两大方向: ## 1. 基于特权信息的在线策略蒸馏(On-Policy Distillation with Privileged Teachers) - \*\*OPD(On-Policy Distillation)\*\*:Agarwal et al. (2024) 与 Lu & Thinking Machines Lab (2025) 提出在学生自身采样轨迹上施加 token 级教师监督,这已成为大语言模型后训练的标准阶段之一(Xiao et al., 2026; Zeng et al., 2026)。 - \*\*OPSD(On-Policy Self-Distillation)\*\*:Zhao et al. (2026)、Hübotter et al. (2026) 及 Ye et al. (2026b) 将同一模型条件化于特权信息(如参考答案、文本反馈),再将该条件化分支蒸馏至无条件化分支。 - \*\*智能体场景下的技能蒸馏\*\*:在智能体任务中,特权信息通常为检索得到的任务技能(retrieved skills)。SDAR (Lu et al., 2026a)、Skill-SD (Wang et al., 2026a)、Skill0 (Lu et al., 2026b)、Zhang et al. (2026) 等方法将教师与学生作为同一共享策略的不同上下文,并通过门控(gating)、同步(synchronization)或优势塑形(advantage shaping)控制教师信号。这些工作大多默认特权教师天然可靠,而较少关注教师本身的行为质量。 - \*\*教师质量与兼容性\*\*:Li et al. (2026b) 指出教师指导的有效性取决于其与学生的兼容性及能力超越程度;Xu et al. (2026b) 发现并非所有 token 都携带有效监督信号。 与上述工作不同,RetireOPD\*\*显式使用环境奖励优化技能条件化教师\*\*,将特权信息转化为可靠的行为优势,而非直接假设特权上下文即可保证教师质量。 ## 2. 在线策略蒸馏与强化学习的结合 - \*\*RLVR(RL with Verifiable Rewards)\*\*:Shao et al. (2024)、Feng et al. (2026)、Dong et al. (2026)、Yang et al. (2026)、Lu et al. (2025) 等是训练多轮智能体的主流方法,但其轨迹级奖励稀疏,难以监督中间决策。 - \*\*混合目标方法\*\*:为补充密集监督,Lu et al. (2026a)、Zhang et al. (2026)、Ding et al. (2026) 将蒸馏项或教师塑形优势加入 RL 目标函数。 - \*\*减少教师干扰的预设策略\*\*:由于教师匹配与学生奖励优化随训练推进会逐渐冲突,现有研究提出: - \*\*权重退火\*\*:Tan et al. (2026)、Ding et al. (2026) 按预定义曲线衰减蒸馏权重; - \*\*轨迹视野扩展或技能预算衰减\*\*:Wang et al. (2026b) 逐步扩展学生接触的轨迹范围;Lu et al. (2026b) 以衰减预算撤回上下文技能; - \*\*两阶段/序列训练\*\*:Li et al. (2026a)、Ye et al. (2026a)、Kim & Lee (2026) 在预定步骤从蒸馏切换至纯 RL。 - \*\*细粒度在线控制\*\*:Ding (2026) 仅在当前提示的所有 rollout 均失败时进行蒸馏;Lu et al. (2026a) 实现逐 token 的门控。但这些方法均未在\*\*全局层面移除\*\*教师监督。 RetireOPD 与上述混合方法的核心差异在于:它不依赖预设的调度或局部门控,而是\*\*基于训练动态信号\*\*——即师生分布差异是否停止缩小以及学生是否达到教师一定成功率——\*\*在线自适应地全局退役教师\*\*,从而在早期保留密集监督的收益,在后期避免与奖励优化的冲突。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*RetireOPD\*\*(Self-Retiring On-Policy Distillation)框架来解决上述问题。该方法包含三个递进阶段,分别对应“构建可靠教师”“早期联合学习”与“自适应解除约束”。 ### 1. 解耦并显式优化特权教师(Privileged Teacher Construction) 针对“特权信息本身不足以保证教师可靠”的问题,RetireOPD 首先将教师与学生\*\*解耦\*\*,不再共享同一组未经优化的参数。具体而言: - 教师策略 π_φ 与学生策略 π_θ 从同一基座模型初始化,但教师额外接收特权技能上下文 c^+ 。 - 教师通过标准 GRPO 直接优化环境奖励,而非仅依赖特权提示:

φ^* = argmax(φ) E(xsimD), τsimπ_φ(· mid x, c^+) [ R(τ) ]

  • 训练完成后冻结教师参数,得到“技能熟练教师” π_T ,专用于后续蒸馏监督。 这一阶段将静态的“信息优势”转化为经环境验证的“行为优势”,从而确保教师能够提供高质量、任务落地的密集监督。 ### 2. 联合 GRPO-OPD 优化(Joint GRPO-OPD Optimization) 在第二阶段,无特权上下文的学生策略同时从两类信号中学习: - **环境奖励(GRPO)**:提供任务驱动的稀疏但真实的反馈。对于采样得到的 G 条轨迹,组相对优势为

A^((i)) = R(τ^((i))) - Mean(R(τ^((i)))(i=1)^G){std(R(τ^((i)))(i=1)^G)}
并通过截断重要性比率优化:
L(GRPO)(θ) = -E[ (1) / (G) ∑(i=1)^G (1) / (|y^((i))|) ∑_(t=1)^(|y^(i))| min( r_t^((i))(θ)A^((i)), clip(r_t^((i))(θ), 1-ε, 1+ε)A^((i)) ) ]

  • **教师蒸馏(OPD)**:在学生生成的轨迹上,由冻结的熟练教师提供 token 级密集监督。采用逆 KL 散度衡量师生差异:
    L(OPD)(θ) = E(xsimD), ysimπθ(· mid x) [ (1) / (|y|) ∑(t=1)^(|y|) D(KL)( πθ(· mid x, y(<t)) ,|, π_T(· mid x, c^+, y(<t)) ) ]
    为避免逐 token 遍历完整词表的高额开销,实际训练使用学生采样 token 的单样本蒙特卡洛估计:
    Deltat = log π_T(y_t mid x, c^+, y(<t)) - log πθ(y_t mid x, y(<t))
    联合目标函数为:
    L(student)(θ) = L(GRPO)(θ) + λ L_(OPD)(θ)
    这一阶段使学生在早期快速内化技能,同时保留环境奖励对其探索的引导。 ### 3. 自适应教师退役(Adaptive Teacher Retirement) 针对“教师监督收益随阶段变化”以及“固定调度无法适配动态冲突”的问题,RetireOPD 不预设切换步骤,而是**从训练信号本身在线判断**何时教师已成为约束。 具体机制如下: - **监控窗口**:将训练划分为宽度为 W 的评估窗口。在每个窗口内,计算 token 级师生对数概率差的均值:

Kn = (1) / (G) ∑(i=1)^G (1) / (|yn^((i))|) ∑(t=1)^(|yn^(i))| Delta_t^((i)), quad K_m = (1) / (W) ∑(n=mW)^(mW+W-1) K_n

  • **双信号退役准则**: - **对齐停滞信号** rhom^((K)) :衡量师生差异是否仍在缩小
    rho_m^((K)) = barK_m - K
    (m-1)Km
    若 rho_m^((K)) ≥ δ ,表明差异已停止下降或开始反弹,暗示教师梯度与奖励梯度出现局部冲突。 - **相对能力信号** eta_m :衡量学生是否已充分掌握技能
    eta_m = SR_m + SR
    (m-1)2 · SRT
    其中 SR_m 与 SR_T 分别为学生与教师的成功率。 - **退役条件**:当同时满足差异停滞与能力达标时,触发全局退役:
    m^* = ∈f m ≥ 2 : rho_m^((K)) ≥ δ ;land; eta_m ≥ γ
    一旦触发,OPD 项被完全移除,后续训练仅以 L
    (GRPO) 继续优化。学生不再受限于教师分布,也无需承担教师前向传播的计算开销。 ### 总结 RetireOPD 的解决逻辑可概括为: 1. 先验优化:通过环境奖励显式训练教师,解决“特权信息 ≠ 可靠监督”的缺陷; 2. 早期借力:在训练初期联合 GRPO 与 OPD,利用密集监督加速探索并内化技能; 3. 动态解绑:通过监控“师生差异是否停滞”与“学生相对成功率”两个在线信号,自适应地移除教师约束,避免后期与奖励优化冲突,使学生能够超越教师天花板。 Q4: 论文做了哪些实验? 论文在 Qwen2.5-1.5B / 3B / 7B 三个尺度上,于 ALFWorld 与 WebShop 两个交互式智能体基准上开展了系统实验,涵盖总体性能对比、训练动态分析与多维度消融验证。 ### 1. 实验设置 - 评测基准 - ALFWorld:文本驱动的具身环境,要求智能体按自然语言指令完成多步 household 任务,考察长程规划与状态跟踪。 - WebShop:模拟真实在线购物场景,要求智能体搜索、浏览并选择满足约束的商品,考察目标导向的多步信息搜集。 - 模型与实现 - 学生与教师基于 Qwen2.5-Instruct 系列(1.5B、3B、7B),同架构同初始化。 - 特权信息采用 SkillBank 提供的任务相关技能(SkillRL),通过关键词匹配检索。 - 自适应退役默认参数:监控窗口 W=5 ,能力阈值 γ=0.9 ,停滞阈值 δ=0 ,蒸馏系数 λ_0=0.01 。 - 对比基线 - Training-Free:Vanilla(直接指令评估)、Skill-Prompt(仅推理时带技能)。 - RL:GRPO、GiGPO、PPO、RLOO;Skill-GRPO(带特权技能的 GRPO,作为教师基线)。 - 蒸馏:OPD(以固定教师蒸馏)、OPSD(同策略自蒸馏)。 - 混合:GRPO+OPD、GRPO+OPSD(全程联合优化,不退役教师)。 ### 2. 主要实验结果(表 1) - 总体性能:RetireOPD 在所有模型尺度与两个任务上均取得最优或次优表现。 - ALFWorld:相比 GRPO 基线,1.5B / 3B / 7B 分别提升 +17.0% 、 +18.8% 、 +14.1% 成功率。 - WebShop:相比 GRPO 基线,1.5B / 3B / 7B 分别提升 +19.0% 、 +14.0% 、 +11.8% 准确率。 - 同时超过 GiGPO 及对应的 Skill-GRPO 教师本身。 - 可靠教师构建:GRPO+OPSD(未显式优化教师)表现显著弱于 RetireOPD。例如在未优化情况下,7B 教师仅达 23.4% 成功率;经环境奖励优化后提升至 90.6% ,且其学生最终性能也大幅改善。这说明特权信息需经显式优化才能转化为可靠监督。 - 自适应教师退役:GRPO+OPD(全程保留 OPD)性能低于 RetireOPD,表明持续蒸馏会约束后续奖励优化。RetireOPD 在每一设置下均超越其自身对应的 Skill-GRPO 教师,说明学生通过退役后的纯 RL 阶段实现了对教师的超越。 ### 3. 训练动态分析(图 2 与图 4) - 教师-学生差距呈“先降后升”:在 GRPO+OPD 训练初期,师生差异(teacher-student discrepancy)快速缩小,表明知识有效转移;随后差距重新扩大,说明学生开始采取教师不倾向但可能更优的动作。 - 退役后策略验证:在 ALFWorld(3B)上,于退役点继续训练: - 持续 GRPO+OPD:成功率进入平台期,且差距持续扩大; - 切换为纯 OPD:差距进一步缩小,但任务成功率不升反降; - 切换为纯 GRPO(RetireOPD 策略):成功率从退役时的 76.6% 稳步提升至 93.8% 。 这证明后期 OPD 与 GRPO 存在局部冲突,及时移除教师有利于继续优化。 ### 4. 消融实验 - 教师构建方式(图 5) - 无显式环境奖励优化的 3B / 7B 教师成功率仅 28.9% 与 23.4% ,优化后分别升至 79.7% 与 90.6% 。 - 若全程保留 OPD,高质量教师(Skill-7B)带动的学生( 89.8% )明显优于 Skill-3B( 82.8% );但在自适应退役后,两者学生性能趋于一致( 91.4% vs 92.2% ),说明退役机制降低了对超高质量教师的长期依赖。 - 退役准则组件(表 2) - 完整 RetireOPD: 92.2% ; - 移除对齐停滞判断( rho ): 89.0% ; - 移除相对能力判断( eta ): 89.0% ; - 完全不移除 OPD: 82.8% ; - 完全无 OPD(纯 GRPO): 75.0% 。 两个信号缺一不可,共同作用可避免过早或过晚退役。 - 参数敏感性(表 3 与图 7) - 对 $γ ∈

0.8, 1.0
与 δ ∈
0, 0.05
的扫描显示,退役步长在 55sim95 之间变化,最终成功率保持在 89.1%sim92.2% ,未见剧烈波动。 - 默认参数下退役点稳定;在较宽阈值范围内( γ ∈
0.80, 0.96
, δ ∈
-0.10, 0.04
),退役步长变化不超过 ± 5 步,表明机制鲁棒。 - 自适应退役 vs. 线性退火(图 6) - 采用 ATOD 线性退火策略时,训练早期提升迅速,但后期进入平台期。 - RetireOPD 的自适应退役策略后期持续提升并最终超越。这证明教师效用并非按预设 schedule 衰减,而应根据实际训练信号动态判断。 ### 5. 退役时机鲁棒性(图 7) 进一步验证两个阈值对退役时刻的影响: - γ 在 0.80 到 0.96 之间, δ 在 -0.10 到 0.04 之间时,退役步数围绕默认值波动不超过 ± 5 步。 - 只有在极端阈值下才出现明显延迟,说明自适应准则能够一致地定位到相似的“冲突拐点”,无需精细调参。 Q5: 有什么可以进一步探索的点? 基于论文的贡献与当前设计的边界,以下几个方向值得进一步探索: —- ### 1. 更细粒度的教师监督选择性机制 论文采用了全局退役策略——一旦触发条件,整个教师监督被完全移除。然而,不同层、不同 token 位置或不同技能维度上,教师信号的效用衰退速度可能并不一致。未来可探索: - 分层/分模块退役:在 Transformer 的不同层或不同注意力头上设置独立的退役信号; - Token 级重要性加权:结合 Xu et al. (2026b) 的 Token Importance 思想,仅对高价值 token 保留监督,低价值 token 提前解除约束,而非一刀切地移除整个 L(OPD) 。 ### 2. 动态教师更新与协同进化 RetireOPD 中的教师在第一阶段训练完成后即被冻结。若学生通过后期 RL 发现了超越教师的新策略,这些新知识无法反哺教师。可探索: - 间歇性教师刷新(Periodic Teacher Refresh):在关键节点用学生的策略分布重新初始化或微调教师,使教师持续保持领先; - 双向蒸馏循环:学生超越教师后,将学生的优势行为重新注入特权条件化分支,形成“教师-学生”交替上升的闭环。 ### 3. 冲突检测的理论深化与自动化阈值学习 论文通过一阶展开近似分析冲突条件,并以启发式阈值 δ, γ 判定退役点。更深入的探索包括: - 二阶或基于 Hessian 的冲突量化:精确刻画 langle g, h rangle 的符号反转区域,预测最优退役点的理论下界; - 元学习阈值:将 δ, γ 视为可学习参数,在验证集上通过元梯度自动优化,进一步减少人工调参。 ### 4. 跨领域与多模态智能体验证 实验目前集中于文本智能体(ALFWorld、WebShop)。RetireOPD 的核心洞见(特权信息需先验证为行为优势、监督效用随阶段衰退)在以下场景尚待验证: - GUI/视觉-语言智能体(如 OSWorld、AndroidEnv):特权信息可为结构化 UI 树或截图标注; - 代码生成与工具调用:特权信息可为 API 文档或执行反馈; - 具身机器人控制:特权信息可为地图或物体姿态等传感器数据。 ### 5. 与课程学习(Curriculum Learning)的联合设计 论文发现早期需要密集监督、后期需要自主探索。这天然与课程学习互补: - 任务难度自适应:在简单任务上更早退役教师,在复杂任务上延长监督; - 技能难度分层:将 SkillBank 中的技能按复杂度排序,逐步引入并逐个退役对应技能的教师分支。 ### 6. 计算效率与蒸馏开销优化 即使仅在前期使用,大容量教师的前向传播仍带来显著计算和显存开销。可探索: - 教师模型压缩:使用更小的学生模型作为教师,或通过提前退出(Early Exit)机制加速教师推理; - 离线缓存与重放:对高频轨迹前缀缓存教师分布,避免重复前向计算; - 异步教师评估:将教师监督的计算与 RL 更新解耦到不同线程或设备,降低流水线阻塞。 ### 7. 端到端的技能检索与内化联合优化 论文假设特权技能 c^+ 由外部 SkillBank 和固定检索策略提供。若检索失败或技能噪声较大,教师质量会受直接影响。未来可尝试: - 联合训练检索器与策略:使技能检索模块也与环境奖励和蒸馏信号共同优化; - 技能涌现而非注入:不依赖外部 SkillBank,而是通过内在激励(intrinsic motivation)让模型自主发现可内化的子程序。 ### 8. 多教师集成与选择性蒸馏 不同来源的特权信息(如规则专家、大模型、人类演示)可能形成多个异构教师。RetireOPD 的单教师框架可扩展为: - 多教师投票或混合:综合多个条件化分支的分布; - 教师可信度评估:为每个教师维护独立的 rho_m 与 eta_m ,优先跟随当前最可靠的教师,并在其失效时独立退役。 ### 9. 退役后 KL 约束的动态重校准 RetireOPD 退役后仅保留 GRPO 损失,而 GRPO 本身通常附带 KL 散度惩罚以维持稳定性。教师移除后,策略分布的偏移约束发生变化: - 自适应 KL 系数:在 OPD 存在时降低 β(KL) (因为 OPD 本身约束分布),退役后自动提升 β(KL) 以补偿,防止分布坍塌或震荡。 ### 10. 失败案例驱动的再激活机制 论文假设退役是单向的。但复杂任务中可能出现阶段性困难: - 条件性再雇佣(Conditional Re-hiring):当学生在后期遇到持续失败(如成功率骤降、熵值崩溃)时,自动重新激活 OPD 若干步以稳定学习,形成“退役-再激活”的循环脚手架。 Q6: 总结一下论文的主要内容 这篇论文围绕多轮智能体强化学习中的自蒸馏监督展开,核心内容与贡献可概括如下: —- ### 1. 研究背景与动机 在多轮智能体任务中,强化学习(RL)通常只提供单条轨迹级别的稀疏奖励,难以监督中间决策步骤。为此,研究者引入在线策略蒸馏(On-Policy Distillation, OPD),让无特权的“学生”模型模仿拥有特权信息(如任务技能)的“教师”模型,以获得 token 级的密集监督。然而,论文指出该范式隐含两个不可靠的假设: - 特权信息天然保证教师更优:实际上,未经显式优化的技能条件化教师可能并不比学生强; - 教师监督始终有益:实际上,教师模仿与奖励优化的收益是阶段依赖的,后期会发生梯度冲突。 —- ### 2. 核心发现 通过对 ALFWorld 和 WebShop 训练动态的观察,论文发现: - 教师若不经过环境奖励优化,即使同架构或更大参数,其成功率也极低(如 7B 技能提示教师仅 23.4%),无法提供可靠监督; - 联合训练时,师生分布差异呈“先缩小后反弹”:早期对齐良好,但当学生内化技能后,GRPO 的奖励驱动更新会与 OPD 的行为对齐目标局部冲突( langle g, h rangle > 0 ),此时持续模仿反而将学生限制在教师天花板之下。 —- ### 3. 方法:RetireOPD 论文提出 RetireOPD(Self-Retiring On-Policy Distillation),包含三个阶段: - 阶段一:特权教师构建 将教师与学生解耦,用环境奖励显式优化技能条件化教师 πφ$:

φ^ = argmax(φ) E(xsimD), τsimπ_φ(· mid x, c^+) [ R(τ) ]
冻结该熟练教师 π_T ,用于后续蒸馏。 - \
*阶段二:联合 GRPO-OPD 训练** 学生 πθ 在无特权上下文条件下,同时优化:
L
(student)(θ) = L(GRPO)(θ) + λ L(OPD)(θ)
其中 OPD 通过逆 KL 散度约束学生与教师在学生轨迹上的分布差异。 - **阶段三:自适应教师退役(Adaptive Retirement)** 将训练划分为宽度为 W 的监控窗口,监测两个在线信号: 1. **对齐停滞** rhom^((K)) = (K_m - K(m-1)) / Km :衡量师生 token 级对数概率差异是否停止缩小; 2. **相对能力** eta_m = (SR_m + SR(m-1)) / (2 · SR_T) :衡量学生成功率是否达到教师的一定比例。 当同时满足 rho_m^((K)) ≥ δ 且 eta_m ≥ γ 时,触发退役,完全移除 OPD,后续仅以 GRPO 继续训练:
m^ = ∈f m ≥ 2 : rho_m^((K)) ≥ δ ;land; eta_m ≥ γ
—- ### 4. 实验与结果 在 \
*Qwen2.5-1.5B / 3B / 7B** 上,于 **ALFWorld** 和 **WebShop** 两个交互式基准上进行验证: - **主性能**:RetireOPD 全面优于纯 RL(GRPO、GiGPO、PPO、RLOO)、纯蒸馏(OPD、OPSD)及混合基线(GRPO+OPD、GRPO+OPSD)。 - ALFWorld:相较 GRPO 提升 **14.1%–18.8%**; - WebShop:相较 GRPO 提升 **11.8%–19.0%**。 - **超越教师**:在所有设置下,RetireOPD 的最终性能均**超过其自身对应的技能条件化教师**。 - **消融验证**: - 显式教师优化对提供可靠监督至关重要; - 自适应退役双信号缺一不可,单一信号退其次; - 与线性退火等固定调度相比,自适应机制能在后期持续优化而不陷入平台期; - 参数敏感性低,在宽阈值范围内退役点稳定。 —- ### 5. 结论 RetireOPD 通过**先训练可靠的技能条件化教师、再联合蒸馏与强化学习、最后依据训练动态自适应退役教师**的三阶段流程,有效将特权技能内化为无特权学生的固有能力。其核心启示在于:教师监督应被视为**临时的脚手架**而非永久约束,最优的过渡点应从训练信号本身在线读取,而非预先固定。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yan Yu,Zhengxi Lu,Yizhou Liu,Yichen Pan,Aozhe Wang,Qipeng Chen,Hua Yang,Wenqi Zhang,Weiming Lu,Qianglong Chen,Yongliang Shen

Categories:

PDF URL: https://arxiv.org/pdf/2609.20784.pdf

Arxiv URL: https://arxiv.org/abs/2609.20784

Arxiv ID: 2609.20784

CoolPaper URL: https://papers.cool/arxiv/2609.20784

Published: 2026-09-19T01:34:38.818Z

Updated: 2026-09-19T01:34:38.818Z


8. Verifiable Social Reasoning for LLM Assistants

Abstract:LLM assistants are widely used for daily social advice, yet evaluating their social reasoning in such consultation settings remains challenging since (i) it requires setups where the assistant learns about social situations from subjective user narratives, and (ii) social properties, such as others’ intentions, typically lack verifiable ground truth. To address these challenges, we introduce Fuse, a multi-agent simulation framework for studying user-mediated social reasoning. In Fuse, a target agent with a hidden motive interacts with other agents including one representing the user, who then consults the evaluated assistant to infer the target’s motive, providing verifiable ground truth by construction. Simulation faithfulness is validated through a human study with 24k annotations. We apply Fuse to 12 LLMs and demonstrate its analytical utility by systematically isolating key factors, showing that (i) user mediation compounds the inherent difficulty of social reasoning; (ii) LLMs exhibit systematic sensitivity to biased user framing; (iii) models can require more details than humans need to reach a correct prediction; and (iv) longer conversations do not always improve performance despite providing opportunities for clarifying questions. We open-source Fuse and a dataset with 21k examples.

中文摘要

摘要:大型语言模型(LLM)助手广泛用于日常社交建议,但在此类咨询环境中评估其社交推理能力仍然具有挑战性,因为(i)这需要设置助手从用户的主观叙述中学习社交情境,以及(ii)社交属性,如他人的意图,通常缺乏可验证的真实依据。为了解决这些挑战,我们引入了Fuse,一个用于研究用户介导的社交推理的多代理模拟框架。在Fuse中,一个具有隐含动机的目标代理与其他代理互动,包括一个代表用户的代理,用户然后咨询被评估的助手以推断目标的动机,从而通过设计提供可验证的真实依据。通过一项包含24k标注的人类研究验证了模拟的真实性。我们将Fuse应用于12个大型语言模型,并通过系统性地隔离关键因素展示其分析效用,结果显示:(i)用户介导增加了社交推理的固有难度;(ii)大型语言模型对偏向的用户框架表现出系统性敏感性;(iii)模型可能需要比人类更多的细节才能做出正确预测;以及(iv)虽然增加了澄清问题的机会,但更长的对话并不总能改善性能。我们开源了Fuse及一个包含21k示例的数据集。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*大型语言模型(LLM)助手在日常社交咨询场景中社交推理能力的评估难题\*\*。具体而言,该工作针对以下核心挑战: - \*\*用户介导现实的评估缺失\*\* 现有研究通常直接向模型呈现完整、客观的社交情境,而实际部署中的助手只能通过用户的\*\*主观叙述\*\*来了解社交事件。用户的叙述可能存在信息遗漏、偏见或情绪投射,这种“用户介导的现实”(user-mediated reality)使得助手难以准确推断他人隐藏的真实意图。现有基准未能有效模拟这一现实约束。 - \*\*缺乏可验证的Ground Truth\*\* 在日常社交互动中(如判断同事是真心支持还是暗中破坏),目标人物的隐藏动机无法从用户叙述中直接获得,也无法由人类标注者在事后轻易标注。这种固有的不确定性导致难以建立可靠的评估标准来衡量模型的推理能力。 - \*\*对日常非安全场景的忽视\*\* 近期接近真实部署场景的研究主要聚焦于\*\*安全导向\*\*的极端情况(如用户表达明显妄想),而忽略了构成绝大多数咨询情境的日常社交互动。在这些日常场景中,错误建议可能直接影响用户的人际关系与决策,但评估难度更高,因为ground truth并非显然成立。 为解决上述问题,论文提出 \*\*Fuse(Framework for User-mediated Social Evaluation)\*\*,一个基于多智能体模拟的可控评估框架:通过模拟具有隐藏动机的目标智能体与用户智能体之间的社交互动,再由用户智能体向被测助手进行主观复述,从而\*\*通过构建生成可验证的ground truth\*\*,系统性地研究模型在用户介导、信息不完整且带有主观偏差的叙述中推理社交动态的能力。 Q2: 有哪些相关研究? 论文在第6节“Related Work”中系统梳理了相关研究,并将其与本文的贡献进行了区分。相关研究主要集中在以下三个方向: \*\*1. 社交推理评估(Evaluating Social Reasoning)\*\* - \*\*现有基准与心理理论测试\*\*:既有研究通常向模型直接提供完整、客观的社会情境描述,并通过针对性问题测试其理解能力,例如 Social IQa(Sap et al., 2019)或通过问答评估心理理论(Theory of Mind,如 FANToM(Kim et al., 2023)和早期 ToM 基准(Le et al., 2019))。这些工作聚焦于模型在信息完备条件下的直接推理。 - \*\*与本文的区别\*\*:上述设定赋予模型对社会事件的“直接访问权”,而本文研究的是\*\*用户介导(user-mediated)\*\*的推理——即模型必须基于用户主观、片面甚至带有偏见的叙述来推断真相。 \*\*2. 社交模拟(Social Simulations)\*\* - \*\*多智能体模拟平台\*\*:LLM 驱动的社交模拟被广泛用于建模涌现的社交行为、构建社会系统原型以及评估社交智能,例如 Generative Agents(Park et al., 2022, 2023)、Concordia(Vezhnevets et al., 2023)和 SOTOPIA(Zhou et al., 2024)。 - \*\*人类行为仿真\*\*:近期研究 increasingly 专注于微调或训练模型以复现人类行为及用户交互(如 Persimmon(humans&, 2026)、Odyssim(Zhou et al., 2026)以及针对社会科学实验的行为预测工作(Kolluri et al., 2025; Park et al., 2024))。 - \*\*与本文的区别\*\*:先前工作主要研究或评估\*\*模拟智能体本身\*\*的行为真实性或社交能力,而本文将多智能体模拟作为一种\*\*可控的数据生成工具\*\*,用于创建具有已知 latent ground truth 的社交情境,进而评估一个\*\*独立的助手模型\*\*在用户介导条件下的推理表现。 \*\*3. 对齐与谄媚(Alignment and Sycophancy)\*\* - \*\*安全导向评估\*\*:近期接近真实部署场景的研究主要聚焦于安全红线场景,例如测试模型是否会认同用户的妄想信念或有害观念(如 Vera-mh(Belli et al., 2025)、Petri(Fronsdal et al., 2025)、Bloom(Gupta et al., 2025)、Safetybench(Zhang et al., 2024)等)。这类场景的 ground truth 通常可直接从前提中得出,评估相对直接。 - \*\*价值观与行为倾向评估\*\*:另一方向通过道德困境、社会规范对比或跨文化调查数据来评估模型的价值对齐程度(如 Cao et al., 2023; Durmus et al., 2023; Scherrer et al., 2023; Taubenfeld et al., 2026)。 - \*\*谄媚研究\*\*:大量工作研究了模型在事实性设置中屈从于用户明确表达的观点或偏好的现象(sycophancy),例如 Sharma et al., 2024; Perez et al., 2023; Cheng et al., 2025, 2026; Fanous et al., 2025; Malmqvist, 2025。 - \*\*与本文的联系\*\*:本文的日常社交情境在性质上位于“安全评估”与“价值观评估”之间——建立 ground truth 比安全场景更困难,但本文通过模拟设计实现了无需逐例人工标注的可验证性。此外,本文将“谄媚”现象从\*\*事实性认同\*\*扩展到了\*\*不确定性下的复杂社交推理\*\*领域,揭示了模型在用户偏见 framing 下妥协推理过程的倾向。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*Fuse(Framework for User-mediated Social Evaluation)\*\* 来解决该问题。Fuse 是一个基于大语言模型驱动的多智能体模拟框架,其核心思想是:\*\*通过受控的多智能体交互生成具有已知隐藏动机的社交情境,再经由模拟用户进行主观转述,从而构建出带有可验证 ground truth 的用户介导评估环境\*\*。该方法的具体运作可分为五个步骤: --- ### 1. 定义社交推理范畴 Fuse 首先确立评估的覆盖范围。该研究采用 ATOMS 分类法(Beaudoin et al., 2020),选取五种心理状态类别作为推理对象: - \*\*Desire\*\*(欲望) - \*\*Intention\*\*(意图) - \*\*Belief\*\*(信念) - \*\*Emotion\*\*(情绪) - \*\*Knowledge\*\*(知识) --- ### 2. 生成场景模板 针对每一类别,框架生成若干场景模板 s 。每个模板定义了: - \*\*用户角色\*\*(User Persona) - \*\*目标角色\*\*(Target Persona):其行为由某个隐藏动机驱动 - \*\*辅助角色\*\*(Other Personas) - \*\*关系网络\*\*与\*\*按顺序排列的交互情节\*\*(Episodes) - \*\*候选动机集合\*\* M_s :例如 M_s = romantic, platonic --- ### 3. 模拟社交情境的实现(建立可验证的 Ground Truth) 对于每个场景模板 s 和特定动机 m ∈ M_s ,Fuse 利用基于 \*\*Concordia\*\* 的多智能体模拟生成具体的事件实现 r ∈ R(s, m) 。在该过程中: - 目标智能体被显式赋予隐藏动机 m (即 ground truth) - 所有智能体在预设的情节序列中自主交互,产生连贯的社交事件 由于动机 m 是在模拟开始前人为设定的,因此 ground truth \*\*由构造决定(by construction)\*\*,无需依赖事后人工标注即可验证。 --- ### 4. 模拟用户汇报(引入用户介导现实) 在事件实现 r 完成后,框架进入\*\*汇报阶段(Debrief)\*\*。模拟用户角色基于自身对事件的记忆,向被测助手进行咨询叙述。该阶段通过两个\*\*可控轴\*\*精确塑造用户叙述的主观性: - \*\*报告偏见轴(Reporting Bias)\*\*:例如,在“对立信念”条件下,用户会被轻微引导以与 ground truth 相反的视角解读同一事件。 - \*\*叙述细节轴(Narrative Detail)\*\*:控制用户提供证据的粒度,分为低、中、高三个级别。 关键设计在于:\*\*模拟事件与汇报过程完全分离\*\*。被测助手\*\*不能直接访问\*\*原始事件 r ,只能基于用户的主观叙述 d 进行推理,从而精确复现了真实部署中的信息不对称与用户介导现实。 --- ### 5. 助手评估 被测助手阅读用户叙述 d 后,需从候选动机集合 M_s 中预测目标角色的隐藏动机 m 。随后,由一个裁判模型(Judge LLM)根据 ground truth m 和预测 m 将结果分为三类: - \*\*Correct\*\*(正确) - \*\*Incorrect\*\*(错误) - \*\*Abstain / Not Attempted\*\*(弃权) 论文还引入了一个聚合指标 \*\*MSR(Mediated Social Reasoning score)\*\*:

MSR(d) = (|Correct| + d · |Not Attempted|) / (|Correct| + |Incorrect| + |Not Attempted|)
其中 d ∈ (0,1) 控制对弃权行为的信用分配,该研究取 d=0.75 。 —- ### 配套验证机制 为了确保评估的有效性,论文开展了大规模人类研究(共 24K 标注): - **模拟验证**:确认模拟交互确实忠实反映了预设动机(人类多数投票与 ground truth 一致率达 97%)。 - **首条消息可解性验证**:确认仅从首条用户消息中,人类即可在 88% 的案例中识别出正确动机,证明任务本身具有足够信号,模型表现差距反映的是真实能力缺陷。 —- ### 总结 Fuse 通过“**先模拟客观事件(确立 ground truth)→ 再主观转述(引入用户介导)→ 最后评估推理**”的流程,将原本不可验证的日常社交推理问题,转化为一个**可扩展、可复用、变量可控**的基准测试。同时,由于模拟数据生成一次即可用于评估任意模型,该框架还支持作为静态基准数据集大规模复用。 Q4: 论文做了哪些实验? 该论文围绕 **Fuse** 框架开展了一系列实验,涵盖大规模模型评估、控制变量对比、人类验证及案例研究。具体实验内容如下: —- ### 1. 核心评估实验 在构建的 21,600 条评估实例上,对 **12 个大语言模型**(覆盖 Gemma-4、Mistral、GPT-OSS、GPT 5.6、Claude 5、Gemini 3.7 Flash、Grok 4.5 等七个模型家族)进行用户介导社交推理测试。实验采用强制二选一方式,要求模型根据用户的首条咨询消息预测目标人物的隐藏动机。评估指标包括: - 预测结果的 **Correct(正确)、Incorrect(错误)、Not Attempted(弃权)** 比例; - 聚合指标 **MSR**(Mediated Social Reasoning score, d=0.75 ):

MSR(d) = (|Correct| + d · |Not Attempted|) / (|Correct| + |Incorrect| + |Not Attempted|)
结果显示,所有模型的 MSR 均未超过 83.7,而人类多数投票基线达到 89.8,且多数模型的错误率超过 20%。 —- ### 2. Observer-Assistant 对比实验(§4.1) 为量化“用户介导”带来的独立性能损失,论文设置了 **Observer 基线**:模型直接阅读多智能体模拟生成的客观事件原文(而非用户的主观复述),并预测目标动机。将该结果与标准的 **Assistant 设置**(仅通过用户叙述推理)进行对比。 - **Observer 结果**:部分模型(如 Mistral Small 4)即使面对客观事件仍有超过 20% 的错误率;前沿模型(如 Claude Opus 5、Gemini 3.7 Flash)则接近完美。 - **Assistant-Observer 差距**:所有模型在用户介导设置下性能均显著下降,表现为正确率降低、错误率上升、弃权率增加。该差距证实了用户主观叙述引入了超出“事件本身理解难度”之外的额外推理负担。 —- ### 3. 用户偏见敏感性实验(§4.2) 为检验模型对用户主观框架的鲁棒性,实验在保持底层社交事件不变的前提下,比较了两种条件: - **Default(默认)**:用户自然复述事件; - **Opposing Belief(对立信念)**:通过单句提示轻微引导用户以与 ground truth **相反** 的视角解读事件。 **结果**:所有模型在偏见条件下的 MSR 均下降。8 个低弃权率模型的偏见差距范围为 6.9–12.5 个 MSR 点,显著大于人类基线的 3.6 点降幅。这表明模型存在对用户 framing 的系统性敏感,而非单纯由信息缺失导致。案例研究(Figure 7)进一步展示了模型如何放大用户偏见,将新同事的谦逊解读为“经典逢迎策略”。 —- ### 4. 叙述细节水平实验(§4.3) 实验通过控制用户首条消息的证据粒度,设置了 **低(Low)、中(Medium)、高(High)** 三个细节水平,考察模型表现如何随信息量变化: - 平均消息长度分别为约 520、710、1,010 字符; - 底层模拟事件保持不变。 **结果**:随着细节增加,模型平均 MSR 提升 5.9 点(从 74.2 到 80.1),人类基线仅提升 2.8 点。模型与人类的平均差距从 14.1 缩小至 11.0(收窄 22%)。该现象表明,模型在部分情况下需要比人类更多的细节才能修正其默认解释(部分模型倾向于过度警觉,部分则倾向于淡化风险)。案例研究(Figure 9)展示了某模型在低、中细节下将室友的积极行为误判为“掩饰痛苦”,直到高细节水平才正确识别为“确实无恙”。 —- ### 5. 多轮对话动态实验(§4.4) 将评估从“首条消息”扩展为 **最多 8 轮对话**,初始消息采用低细节设置,允许模型主动提问,观察其能否通过交互收集信息并改进预测。 **结果**: - 性能在 **第 2 轮到第 4 轮** 之间提升最明显(用户补充了澄清性证据); - **第 4 轮后性能趋于平稳甚至下降**; - 即使经过 8 轮交互,没有任何模型达到人类在首条消息上的基线,也未能追平自身在高细节 2 轮设置下的表现。 **对话内部动态分析**: - **位置持久性(Position Persistence)**:模型在第 2 轮做出的预测,到第 8 轮仍有 **81%** 保持不变;其中 8% 转向错误,仅 11% 转向正确。 - **状态转移模式**:18% 的初始弃权最终转化为正确预测;但同时,部分正确预测会因用户在后续轮次中累积的偏见 framing 而被推翻(正确→错误)。案例研究(Figure 12)显示,模型最初正确判断同事“真诚支持”,但在用户将该行为重新框架为“策略性操控”后,模型立即反转立场。 —- ### 6. 人类验证研究(§3.3 & Appendix B) 论文收集 **24,000 余条人类标注**,用于校准任务难度并验证模拟有效性: | 实验名称 | 目的 | 设计 | 关键结果 | |————-|———|———|————-| | **模拟验证** | 验证多智能体模拟是否忠实反映预设动机 | 300 个模拟,每个事件原文由 10 名独立标注者判断 | 人类多数投票与 ground truth 一致率达 **97%**;标注者间平均一致率 91.2% | | **首条消息可解性** | 估计首条用户消息包含的信息上限 | 2,100 条首条消息(覆盖 3 个细节水平),每条由 10 人标注 | 人类正确率 **88%**,MSR 为 **89.8**;仅 2.8% 弃权 | 这些验证确认了:任务本身具有充分可解性,模型与人类的差距反映真实能力局限,而非模拟伪影或任务不可解。 —- ### 7. 数据集构建与发布(§3.1 & Appendix D) 作为实验基础,论文详细记录了数据生成过程: - 生成 30 个场景模板(ATOMS 五类,每类 6 个); - 每个模板搭配 2 个对比动机,各采样 20 个事件实现,共 1,200 个模拟; - 每个实现生成 18 个汇报变体(2 偏见 × 3 细节 × 3 次采样),总计 **21,600 条评估实例**。 该数据集与代码均对外开源,作为静态基准供后续研究复用。 Q5: 有什么可以进一步探索的点? 基于论文的分析与局限性,以下几个方向值得进一步探索: —- ### 1. 多轮交互与社会推理的动态评估 论文将主要分析聚焦于首条用户消息,尽管提供了初步的多轮分析(§4.4),但指出要真正实现多轮评估基准,需暴露一个**经过验证且稳定的用户模拟器**(§3.1)。未来可致力于: - 开发能够随模型提问动态、一致地更新叙述的**用户模拟器**; - 研究模型如何在长程对话中平衡**信息获取**与**偏见累积**的权衡,避免因用户 framing 强化而导致推理退化。 —- ### 2. 复杂推理场景下的谄媚(Sycophancy)机制 现有谄媚研究多集中于**事实性设定**(模型屈从于用户已知的错误事实)。论文发现类似模式出现在**不确定性下的社交推理**中:模型会放弃独立判断、采纳用户的主观框架(§5.4)。未来可深入: - 定量刻画模型在“无先验 ground truth”的推理任务中,其信念更新如何被用户修辞策略所操纵; - 探索缓解此类“推理性谄媚”的训练或推理时干预方法。 —- ### 3. 最优弃权策略与实用性的权衡 论文提出的 MSR 指标引入参数 d 以衡量弃权行为的信用,但明确指出**确定最优弃权策略**本身是一个超出当前工作范围的精细问题(§3.2)。未来研究可: - 结合具体应用场景(如心理健康咨询、职场冲突),建模错误预测与拒绝回答的相对社会成本; - 在保障安全与提供可操作建议之间寻求帕累托最优的决策边界。 —- ### 4. 分离模拟器伪影与用户介导的内在难度 Observer 与 Assistant 之间的差距既反映了用户介导推理的本征困难,也可能包含**模拟器特有的伪影**(如用户模拟器的特定措辞风格)(§5.3)。虽然论文通过 Concordia 框架与完整历史访问权限缓解了该问题,但尚未完全分离二者。后续工作可: - 使用多样化架构的用户模拟器或跨平台验证,量化模拟器偏差对评估结果的影响; - 引入真实人类用户复述作为对照,建立更贴近现实的性能上界。 —- ### 5. 对隐含倾向与开放式响应的精细解析 当前评估采用强制二选一以获取明确信号,但论文注意到模型在开放式回答中常通过措辞隐含倾向(§C)。未来可: - 开发更鲁棒的 judge 模型或人工标注协议,以**量化 hedged response 中的隐含偏向**; - 研究当用户未明确要求“二选一”时,模型的试探性建议如何在实际交互中塑造用户的社交认知。 —- ### 6. 跨模态与非字面沟通的扩展 受限于文本模拟,本研究排除了 ATOMS 分类中的 **percepts(感知)** 与 **non-literal communication(非字面沟通)**(§2 Step 1)。未来若整合多模态输入(如语音语调、面部表情、时间戳行为日志),可: - 评估模型在更丰富的感官模态下的社交推理; - 探索讽刺、暗示、沉默等非文本线索在用户介导叙事中的信息损失与补偿机制。 —- ### 7. 主动澄清提问的策略学习 多轮实验显示,模型在 4 轮之后性能趋于饱和甚至下降,部分原因是未能有效提问,反而被用户偏见带偏(§4.4)。未来可研究: - **主动学习(active learning)** 式的提问策略:模型应如何设计澄清问题以最大化信息增益,同时最小化对用户主观 framing 的强化; - 将信息价值理论(VoI)应用于社交咨询场景,训练模型识别“关键缺失证据”并靶向询问。 —- ### 8. 实时交织情境中的持续推理 Fuse 故意将社交模拟与咨询汇报**完全分离**,以降低计算开销并支持静态基准(§2 Step 4)。然而现实咨询往往与社会事件**实时交织**(如用户在事件进行中不断发来更新)。未来可探索: - 流式评估框架:助手需在事件动态演进过程中持续更新对他人心理状态的信念; - 引入时间维度与部分可观察马尔可夫决策过程(POMDP)的形式化,建模随时间展开的社交推理。 Q6: 总结一下论文的主要内容 这篇论文研究了**大型语言模型(LLM)助手在用户介导的日常社交咨询场景中的可验证社交推理评估**问题。以下是主要内容的结构化总结: —- ### 1. 研究背景与核心挑战 随着 LLM 助手越来越多地被用于个人社交建议,评估其社交推理能力变得至关重要,但面临两个根本困难: - **用户介导现实(User-mediated Reality)**:部署中的助手只能通过用户的**主观叙述**来了解社交事件,用户的叙述可能存在信息遗漏、情绪投射与认知偏见,这与传统基准中直接向模型呈现完整客观情境的设定截然不同。 - **缺乏可验证的 Ground Truth**:在日常社交场景(如判断同事是真心支持还是暗中破坏)中,目标人物的隐藏动机无法从用户叙述中直接获得,也无法由人类标注者在事后可靠地标注,导致难以建立可靠的评估标准。 —- ### 2. Fuse 评估框架 为应对上述挑战,论文提出 **Fuse(Framework for User-mediated Social Evaluation)**,一个基于 LLM 驱动的多智能体模拟框架,通过构造生成可验证的 ground truth。框架包含五个步骤: 1. **范畴定义**:基于 ATOMS 分类法,选取五种心理状态作为推理目标:欲望(Desire)、意图(Intention)、信念(Belief)、情绪(Emotion)与知识(Knowledge)。 2. **场景模板生成**:为每类心理状态生成结构化模板,定义用户角色、目标角色、辅助角色、交互情节及候选动机集合 M_s (如 M_s = romantic, platonic )。 3. **社交情境模拟**:利用多智能体框架(Concordia)生成具体事件实现 r ∈ R(s, m) ,其中目标智能体被显式赋予隐藏动机 m 。该动机作为 **by construction** 的 ground truth。 4. **用户汇报模拟**:模拟用户基于记忆向助手进行咨询叙述。该阶段通过两个**可控轴**引入主观性: - **报告偏见(Reporting Bias)**:如“对立信念”条件,引导用户以与 ground truth 相反的视角解读同一事件; - **叙述细节(Narrative Detail)**:控制证据粒度(低/中/高)。 5. **助手评估**:助手仅依据用户叙述预测目标动机 m ∈ M_s ,由裁判模型判定为正确(Correct)、错误(Incorrect)或弃权(Not Attempted)。 论文引入聚合指标 **MSR(Mediated Social Reasoning score)**:

MSR(d) = (|Correct| + d · |Not Attempted|) / (|Correct| + |Incorrect| + |Not Attempted|)
其中 d=0.75 用于平衡正确预测与谨慎弃权的价值。 —- ### 3. 关键实验发现 论文在包含 **21,600 条实例** 的数据集上评估了 12 个主流 LLM,并通过 **24,000 余条人类标注** 验证模拟质量与任务可解性。核心发现包括: - **整体性能存在显著差距**:人类在首条用户消息上的正确率为 **88%**(MSR 89.8),而所有被测模型的首条消息正确率均未达到 88%,最强模型(Gemini 3.7 Flash)的 MSR 为 **83.7**。多数模型错误率超过 20%,存在给出有害错误建议的风险。 - **用户介导引入额外负担(Observer-Assistant Gap)**:与直接阅读客观事件原文的 **Observer 基线** 相比,所有模型在用户介导设置下的正确率均下降、错误率上升、弃权率增加。部分前沿模型(如 Claude Opus 5)在 Observer 设置中近乎完美,但在 Assistant 设置中因不确定性而大量弃权。 - **系统性偏见敏感性**:在“对立信念”条件下,所有模型性能均下降。8 个低弃权模型的偏见差距(6.9–12.5 MSR 点)显著大于人类降幅(3.6 点),表明模型易受用户主观框架影响,甚至放大用户偏见。 - **对叙述细节的非线性依赖**:随着细节增加,模型与人类的性能差距缩小 22%,但模型常需比人类更多的细节才能修正其默认解释(部分模型过度警觉,部分则过度淡化风险)。 - **多轮对话的收益有限**:将交互扩展至 8 轮后,性能仅在第 2–4 轮因用户补充证据而提升,随后趋于饱和甚至下降。模型表现出高度的**位置持久性**(81% 的初始预测在 8 轮内不变),且部分正确预测会在后续轮次中被累积的用户偏见 framing 推翻。 —- ### 4. 贡献与意义 - **方法论贡献**:提出首个针对用户介导日常社交推理的可扩展、可复用评估框架,将“不可验证”的日常社交咨询转化为具有可控变量与可验证 ground truth 的基准测试。 - **实证发现**:系统量化了用户介导、报告偏见与信息粒度对模型社交推理的影响,揭示了模型在不确定性下存在类似“推理性谄媚”的顺从行为。 - **开源资源**:公开发布 Fuse 框架、21,600 条实例的数据集及代码,为后续研究提供基础。 该工作指出,即使在信息充分的条件下,当前 LLM 仍难以可靠地从主观叙述中推断复杂的社交动机,构建真正值得信赖的社交助手仍是该领域的重要开放挑战。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Amir Taubenfeld,Zorik Gekhman,Avigail Grinstein-Dabush,Itay Laish,Ariel Goldstein,Marian Croak,Avinatan Hassidim,Yossi Matias,Amir Feder

Categories:

PDF URL: https://arxiv.org/pdf/2609.17496.pdf

Arxiv URL: https://arxiv.org/abs/2609.17496

Arxiv ID: 2609.17496

CoolPaper URL: https://papers.cool/arxiv/2609.17496

Published: 2026-09-19T01:34:39.142Z

Updated: 2026-09-19T01:34:39.142Z


9. Reflect, Revise, Reuse: Training-Free Skill Evolution for GUI Agents

Abstract:GUI agents execute long-horizon tasks on dynamic graphical user interfaces, where pop-ups, delayed loads, and relocated widgets routinely invalidate plans fixed before execution. Recent agent-skill frameworks encapsulate reusable procedural knowledge to mitigate this, yet existing skill designs are largely developed without targeting GUI execution dynamics and treat skills as static artifacts produced before deployment rather than living procedural knowledge that improves through it. We argue that what GUI agents need is not better static skills, but skills that can be revised from execution feedback at deployment time, without additional training. We propose \textbf{EvoSkill-GUI}, a training-free framework in which each skill is a structured multi-file package containing retrieval metadata, executable plans, backup localization, failure-recovery rules, accessibility utilities, and failure cases. EvoSkill-GUI operates through a \textbf{\emph{reflect-revise-reuse}} loop: the executor performs instant in-rollout revisions, an isolated critic diagnoses failed trajectories under strict information isolation, and the executor edits specific skill files through a restricted tool interface. Across MobileWorld, AndroidWorld, and OSWorld, three mainstream GUI benchmarks spanning mobile and desktop platforms, EvoSkill-GUI consistently improves multiple base models without any training, with maximum gains of $+16.2\%$, $+6.0\%$, and $+10.5\%$ respectively, and evolved skill libraries continue to benefit related tasks rather than being rebuilt from scratch. Our code is available at this https URL.

中文摘要

摘要:GUI代理在动态图形用户界面上执行长时间任务,其中弹出窗口、延迟加载和位置移动的小部件常常使执行前固定的计划失效。近期的代理技能框架封装了可重用的程序知识以缓解这一问题,但现有技能设计大多并未针对GUI执行动态而开发,并且将技能视为部署前生成的静态产物,而不是通过执行不断改进的活化程序知识。我们认为,GUI代理所需的不是更好的静态技能,而是在部署时能够根据执行反馈进行修订的技能,无需额外训练。我们提出了\textbf{EvoSkill-GUI},这是一个无需训练的框架,每项技能都是一个结构化的多文件包,包含检索元数据、可执行计划、备份定位、失败恢复规则、可访问性工具以及失败案例。EvoSkill-GUI通过\textbf{\emph{反思-修订-重用}}循环运行:执行器在滚动过程中即时进行修订,独立的批评器在严格信息隔离下诊断失败轨迹,执行器通过受限工具接口编辑特定技能文件。在涵盖移动和桌面平台的三大主流GUI基准测试——MobileWorld、AndroidWorld和OSWorld中,EvoSkill-GUI无需任何训练即可持续提升多个基础模型,最大提升分别为$+16.2\%$、$+6.0\%$和$+10.5\%$,且进化后的技能库继续对相关任务产生益处,而无需从零重建。我们的代码可在此https URL获取。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决现有基于技能的图形用户界面(GUI)智能体在动态、非平稳环境中执行长程任务时所面临的\*\*静态技能无法适应执行时变化\*\*的核心问题。具体而言,论文针对以下四个关键障碍展开: - \*\*技能结构僵化且难以编辑\*\* 现有方法常将程序性知识存储为单一冗长文档,导致规划步骤、定位提示与恢复规则相互纠缠,无法针对具体失败进行精准修订。 - \*\*界面状态非平稳性\*\* GUI 环境在执行过程中频繁出现弹窗、延迟加载或部件位置变化等现象。预先固定的静态技能在某一界面状态有效,但在状态变化后极易失效,且智能体常陷入幂等的失败循环。 - \*\*外部反思机制成本高昂且耦合松散\*\* 依赖外部视觉-语言模型进行反思会引入额外延迟,同时使反思过程与技能执行及修订环节 loosely coupled,难以形成闭环的自我演化。 - \*\*程序性知识无法跨任务积累\*\* 关于不可靠选择器、缺失应急方案或必要回溯路径的经验教训通常被锁定在单次执行轨迹中,无法沉淀为可复用的结构化资产供相似任务调用。 针对上述局限,论文提出 \*\*EvoSkill-GUI\*\* 框架,其核心目标是在\*\*无需额外训练\*\*的前提下,使技能从部署前的“静态产物”转变为可在执行时根据反馈\*\*即时反思、定向修订并持续复用\*\*的“活态程序性知识”。 Q2: 有哪些相关研究? 该论文的相关研究主要围绕\*\*智能体技能(Agent Skills)\*\*与\*\*自我演化智能体(Self-evolving Agents)\*\*两条主线展开,现有工作为 EvoSkill-GUI 的设计提供了直接对比基础。 --- ### 1. 智能体技能(Agent Skills) 现有技能框架致力于将可复用的程序性知识外化为结构化产物,但在动态 GUI 场景下的推理时技能修订尚未被充分探索: - \*\*结构化技能库构建\*\* - \*\*CUASkill\*\*(Chen et al., 2026)针对桌面环境构建结构化技能库;\*\*WebXSkill\*\*(Wang et al., 2026)将可执行网页程序与步骤级指导耦合;\*\*MMSkills\*\*(Zhang et al., 2026b)进一步引入多模态视觉证据扩展技能表示。 - \*\*免训练持续更新\*\* - \*\*XSkill\*\*(Jiang et al., 2026)提出经验与技能双流的持续学习框架,支持以无训练方式基于历史轨迹更新技能。 - \*\*结构化记忆系统\*\* - \*\*HyMem\*\*(Zhao et al., 2026)及其 GUI 扩展(Zhu et al., 2026)侧重于可复用经验的记忆构建,而非技能级别的文件化修订。 - \*\*强化学习蒸馏\*\* - \*\*SkillRL\*\*(Xia et al., 2026)、\*\*D2Skill\*\*(Tu et al., 2026)、\*\*Skill0\*\*(Lu et al., 2026b)与 \*\*SDAR\*\*(Lu et al., 2026a)等探索通过强化学习进行技能蒸馏与内化。 - \*\*同期协同演化工作\*\* - \*\*CoEvoSkills\*\*(Zhang et al., 2026a)与 EvoSkill-GUI 同期提出,其通过替代验证器协同演化多文件技能包,但面向代码中心环境且侧重离线构建,而非部署后的 GUI 技能推理时修订。 --- ### 2. 自我演化智能体(Self-evolving Agents) 另一条研究线关注智能体如何从交互经验中自我改进,但大多更新记忆、策略或模型权重,而非技能制品本身: - \*\*GUI 环境下的经验积累\*\* - \*\*UI-Evol\*\*(Zhang et al., 2025)通过回溯轨迹精炼外部知识;\*\*UI-Mem\*\*(Xiao et al., 2026)维护层次化经验记忆以支持在线强化学习;\*\*Mobile-Agent-E\*\*(Wang et al., 2025b)与 \*\*SEAgent\*\*(Sun et al., 2025)借助持久记忆与反射模块实现演化;\*\*EvoCUA\*\*(Xue et al., 2026)结合合成经验生成与迭代策略演化,将失败转化为监督信号。 - \*\*反射与蒸馏机制\*\* - \*\*UI-Voyager\*\*(Lin et al., 2026)通过组间相对自蒸馏从失败的移动 GUI 轨迹中学习;\*\*MobileUse\*\*(Li et al., 2025b)在步骤与轨迹层面引入层次化反射;\*\*GUI-Reflection\*\*(Wu et al., 2025)将反射监督嵌入预训练、监督微调与在线调优全流程。 - \*\*通用程序性记忆\*\* - 超越 GUI 领域,\*\*Memp\*\*(Fang et al., 2026)与 \*\*Experiential Reflective Learning\*\*(Allard et al., 2026)致力于从过去轨迹中维护程序性记忆或可复用启发式规则;此外,Web 与通用智能体自改进框架(Fang et al., 2025; Lin et al., 2026; Zhao et al., 2026; Luo et al., 2026)亦提供了相关经验。 --- ### 3. 与现有研究的区分 与上述工作相比,EvoSkill-GUI 的核心差异在于:\*\*其直接在推理时修订部署中的结构化 GUI 技能包本身\*\*,而非仅更新模型权重、隐式记忆或生成一次性任务解决方案。通过将技能表示为可编辑的多文件包,并引入信息隔离的反思-修订-复用循环,该框架实现了无需额外训练的即时技能演化。 Q3: 论文如何解决这个问题? EvoSkill-GUI 通过 \*\*Reflect–Revise–Reuse(反思–修订–复用)\*\* 主循环,将技能从部署前的静态产物转变为可在推理时自我修正的活态程序性知识。具体解决方案可从以下五个层面展开: --- ### 1. 结构化多文件技能包:解耦程序性知识 为应对技能内容纠缠、难以精准编辑的问题,论文将单一技能重新设计为一种结构化、多文件的持久知识对象:

S = (D, A, P, B, C, F)
其中各组件的职责分离如下: | 组件 | 符号 | 功能 | |———|———|———| | 检索元数据 | D | 支持基于意图、应用、平台等字段的快速索引 | | 无障碍工具 | A | 提供可访问性树(accessibility tree)相关的结构化观测辅助 | | 执行计划 | P | 存储高层步骤序列,规定“做什么” | | 备用定位 | B | 存储备选定位策略,规定“如何找” | | 恢复规则 | C | 存储异常与弹窗的应对规则,规定“如何恢复” | | 失败案例 | F = f^((1)), dots, f^((n)) | 记录历史失败轨迹与诊断,作为负面示例 | 通过将规划、定位、恢复知识分离至独立文件,当某类错误发生时,系统只需修改对应组件(如定位失败改 B ,缺失应急改 C ,流程错误改 P ),避免了单文件长文档中的内容纠缠。 —- ### 2. 执行与即时修订(In-Rollout Revision):应对界面非平稳性 在每次 rollout 中,执行器(Executor)并非机械遵循预生成计划,而是在每一步可调用受限工具接口对技能包进行**即时局部修订**:

τ^((i)) = Phi(S^((i)), E)
接口定义为:
T = read, write, append, list, search, create_failure
当执行过程中出现弹窗、部件移位或加载延迟时,执行器可实时更新 `plan.md` 或 `recover.md`,在错误尚未级联为任务失败前完成局部修正。该机制直接缓解了因界面状态非平稳导致的固定计划失效问题。 —- ### 3. 信息隔离的反思(Isolated Critic):实现闭环自我诊断 为避免依赖昂贵且耦合松散的外部反思模型,EvoSkill-GUI 使用**同一骨干模型**在独立会话中充当评论器(Critic),对失败轨迹进行诊断。关键设计在于严格的信息隔离约束:

CJ ⊂eq I ∪ o(1:T) ∪ a_(1:T)

CJ ∩ S, CoTθ, GT = ∅

CE ⊃eq C_J ∪ S, CoTθ
其中 CJ 为评论器的信息集, C_E 为执行器的信息集。该约束确保评论器: - 仅依据任务指令 I 、观测 o(1:T) 与动作 a(1:T) 进行诊断; - **无法访问**技能包内容 S 、执行器的思维链 CoTθ 或 ground truth; 从而防止评论器继承执行器的错误偏见或依赖特权信息,迫使诊断必须建立在可观测的轨迹证据之上,生成更加可信的结构性反馈 c^((i)) 。 —- ### 4. 基于诊断的精准修订(Skill-File Revision):积累可复用知识 获得评论器的反馈后,执行器进入修订阶段:

S^((i+1)) sim π_θ(· mid S^((i,end)), c^((i)), τ^((i)))
修订过程遵循以下原则: - **受限工具接口**:执行器只能通过 T 中的工具读写预定义技能文件,禁止对包外模式进行任意修改; - **失败案例持久化**:若 rollout 失败,系统自动通过 `create_failure` 将 (I, c^((i)), τ^((i))) 追加至 F ,形成负面示例库; - **修订顺序**:默认按 P to B to C 的优先级进行,即先修正计划,再补充定位备选,最后完善恢复规则。 该机制使从失败中提取的教训被写回技能制品本身,而非仅更新模型权重或一次性记忆,从而实现了跨任务的程序性知识积累。 —- ### 5. 元数据检索与复用(Retrieval & Reuse):最大化技能库价值 为使演化后的技能惠及相关任务,系统通过结构化元数据而非全文匹配进行检索:

D = (id, ∫ent, app, platform, kw, args, hist, status)
给定新指令 q ,检索分数由词汇覆盖与语义紧密度加权计算:
base(q, S) = 0.6 (|O|) / (|Q|) + 0.4 (|O|) / (|Q ∪ T_S|)

score(q, S) = clip(base + b(app) + b(kw) - p_(÷), 0, 1)
若最高分超过阈值 θ_r (默认 0.6 ),则直接复用该技能包;否则从零初始化新技能。成功执行或经过修订验证的技能包会被注册入库,使后续相似任务能够从已验证的程序性知识出发,避免重复构建。 —- ### 总结 通过上述设计,EvoSkill-GUI 将训练后静态技能范式转化为**部署时自我演化范式**:结构化多文件包提供了可编辑性,即时修订应对了动态界面,信息隔离的反思保证了诊断质量,受限工具修订确保了知识积累的局部性与可审计性,而元数据检索则实现了跨任务的技能复用。整个流程无需微调或强化学习,完全在推理阶段完成。 Q4: 论文做了哪些实验? 论文在第 4 节及附录 A 中开展了系统的实验评估,涵盖**基准性能验证**、**组件消融**与**演化行为分析**三个层面。具体如下: —- ### 1. 实验设置 - **基准测试** 选取三个跨平台的交互式 GUI 基准: - **MobileWorld**(Kong et al., 2025):移动端长程跨应用工作流,论文采用其 GUI-only 设置; - **AndroidWorld**(Rawles et al., 2025):含 116 个任务、覆盖 20 个真实应用的动态 Android 环境; - **OSWorld**(Xie et al., 2024):跨 Ubuntu / Windows / macOS 的桌面端开放式任务环境。 - **基座模型** 同时评估通用闭源/开源模型与 GUI 专用模型: - 通用模型:Claude-Sonnet-4.6、Qwen3.6-Plus、Qwen3.6-35B-A3B; - GUI 专用模型:GUI-Owl-1.5-8B、MAI-UI-8B、Qwen3-VL-8B-Instruct。 - **实现细节** 每任务最多 50 步交互;失败后最多允许 2 轮技能修订(共 3 轮执行);所有模型统一使用相同的技能包格式与检索策略。 —- ### 2. 主实验结果 - **MobileWorld(GUI-only)** EvoSkill-GUI 在所有基座模型上均带来一致提升,最大增益达 **+16.2%**(Qwen3.6-Plus 从 53.3% 提升至 69.5%)。闭源与开源模型均受益于结构化技能包与自我演化。 - **AndroidWorld** 在 seed 30 上提升 **+2.6%**(68.1% → 70.7%),在 seed 42 上提升 **+6.0%**(55.2% → 61.2%)。其中 seed 42 阶段实现了 100% 的技能复用率。 - **OSWorld** 在桌面环境中同样有效:GUI-Owl-1.5-8B 提升 **+8.1%**(46.7% → 54.8%),Qwen3-VL-8B-Instruct 提升 **+10.5%**(23.8% → 34.3%)。特定应用(如 VLC、Thunderbird)出现超过 +20% 的显著增益。 —- ### 3. 消融实验 | 实验内容 | 核心发现 | |————-|————-| | **结构化技能包 vs. 单文件技能** | 多文件包相比单文件长文档提升 **+2.85%**(66.67% → 69.52%),证明解耦规划/定位/恢复知识有助于精准修订。 | | **即时执行中修订(In-rollout revision)** | 移除该机制后成功率下降 **-6.66%**(69.52% → 62.86%),说明实时修正对防止级联失效至关重要。 | | **元数据检索 vs. 全文检索** | 在 12 个复用案例中,元数据检索全部命中(12/12),而全文检索仅命中 1 例;平均检索分数 0.88 vs. 0.41。 | | **信息隔离(Information isolation)** | 移除评论器信息隔离后下降 **-8.57%**(69.52% → 60.95%),表明防止诊断依赖特权信息可显著提升修订质量。 | | **技能包组件贡献** | 移除 `plan.md` 下降最多(-3.81%),移除失败示例亦下降(-2.85%),验证了显式计划与失败反思的关键作用。 | | **可访问性树(A11y tree)** | 引入结构化无障碍输入后,Qwen3.6-Plus / Qwen3.6-35B-A3B / MAI-UI-8B 分别提升 +3.80 / +1.90 / +2.85,证明其作为视觉补充的 grounding 价值。 | | **检索阈值 θ_r 敏感性** | θ_r = 0.6 时性能最佳(69.5%);降至 0.4 会因引入弱相关技能而降至 55.2%;升至 0.8 则因过度保守错过可复用技能而降至 66.7%。 | —- ### 4. 深度分析 - **多轮演化的累积效应与饱和** 在 MobileWorld 上,模型经过三轮演化后普遍趋于饱和:Claude-Sonnet-4.6 从 58.1% 提升至 67.6%;Qwen3.6-Plus 在三轮内提升 +12.4%,第四、五轮仅再增 +0.9。说明三轮是性能–成本的有效权衡。 - **与重复采样的预算对比** 在相同测试时预算(约 3 轮)下,EvoSkill-GUI(94.75M tokens,69.5%)优于 pass@3 独立采样基线(103.00M tokens,62.8%),表明增益来源于反思驱动的技能演化,而非单纯增加采样次数。 - **技能库的持续复用与恢复能力** 在 AndroidWorld 的 116+116 任务流中: - 第一阶段库从 9 个技能增长至 69 个; - 第二阶段相关变体任务实现 100% 复用率,技能库进一步扩展至 98 个; - 在 89 次初始失败中,EvoSkill-GUI 通过技能修订成功恢复 27 次,其中复用技能的恢复率为 19/65。 - **失败类型的可修复性分析** 计划级错误(`plan.md`)修复率最高,达 **69.6%**(16/23);定位错误(`backup.md`)修复率为 **50.0%**(6/12);缺失应急方案(`recover.md`)较难修复,仅 **25.0%**(1/4)。该结果直接支撑了按组件分离技能知识的设计决策。 —- ### 5. 附录补充实验 - **Hold-out 任务迁移** 将 MobileWorld 划分为 87 个建库任务与 30 个 hold-out 任务。使用建库阶段演化出的技能库,EvoSkill-GUI 在 hold-out 任务上达到 73.3%(22/30),显著高于无技能 pass@3 基线的 40.0%(12/30),且元数据检索准确率保持 93.8%(15/16)。 - **同骨干评论器诊断质量人工审计** 对 56 个失败任务的 143 条评论器判断进行人工标注,准确率为 **80.4%**(115/143)。主要错误模式为评论器过度乐观(误将失败判为成功),表明信息隔离下的同骨干诊断具有实用价值但仍有改进空间。 - **Token 成本与运行时开销** 在 MobileWorld 上,EvoSkill-GUI 三轮总消耗约 **94.75M tokens**(每任务 0.810M),低于 pass@3 基线的 103.00M;引入可访问性树主要增加运行时延迟而非 prompt 长度。 - **定性案例研究** 提供了 `SendInterviewEmailTask`(缺失验证检查点)与 `CheckCartPriceTask`(列表遍历不完整)两个案例,可视化展示评论器诊断如何被翻译为 `plan.md`、`backup.md`、`recover.md` 及 `failure_examples/` 的具体修订。 Q5: 有什么可以进一步探索的点? 基于论文的局限性分析与实验观察,以下方向具有进一步探索的价值: —- ### 1. 形式化验证与有害编辑防御 论文指出,当前框架缺乏一个**形式化验证器(formal verifier)**来否决可能引入回归的错误修订。当骨干模型的感知或轨迹诊断不可靠时,错误的技能编辑不仅会降低当前任务成功率,还可能通过技能库的复用机制将错误扩散至后续任务。未来可探索: - 设计轻量级**回归测试接口**,在技能修订后自动执行历史通过案例的快照验证; - 引入**技能版本控制**与差异回溯机制,确保破坏性行为可被快速回滚; - 结合执行结果的统计一致性检验(如多轮执行方差分析)作为修订准入门槛。 —- ### 2. 跨应用类别的开放域迁移 现有评估中的高复用率主要源于同一任务家族内的参数化变体(如 AndroidWorld 不同 seed 的同类任务)。一个自然的延伸是检验技能库在**真正未见的应用类别**上的迁移能力。可探索: - 构建跨领域技能迁移基准,测试从移动端办公应用向游戏或图形编辑工具的技能复用; - 研究**技能模块化分解**(如将通用操作原语与领域特定流程进一步解耦),以支持跨平台(mobile-to-desktop)的技能迁移; - 探索基于语义嵌入的技能片段重组,而非整包复用。 —- ### 3. 诊断机制的增强与多模态融合 实验表明,同骨干评论器在信息隔离下的诊断准确率为 80.4% ,且存在**过度乐观**(将失败误判为成功)的风险。改进方向包括: - 引入**外部轻量级验证信号**(如执行后界面状态的差分对比、HTML/Accessibility tree 的结构化断言自动抽取),辅助评论器进行更客观的状态判断; - 探索**多轮对抗式诊断**:让评论器与执行器就失败原因进行多轮博弈,以细化根因定位; - 利用视觉-语言模型对关键步骤的截图进行**注意力热图分析**,将 grounding 错误与计划错误分离。 —- ### 4. 计算效率与延迟敏感部署的优化 虽然 EvoSkill-GUI 避免了训练成本,但每轮失败的 revision 仍需额外的 critic 调用与工具编辑调用。在延迟敏感场景中,可研究: - **异步反思与修订**:将 critic 诊断与下一轮任务执行解耦,利用后台进程更新技能库,而非阻塞当前任务流; - **编辑优先级预测**:训练一个轻量级策略(或基于启发式规则)预判当前失败是否值得启动完整修订循环,避免对简单噪声过度反应; - **技能包缓存与增量索引**:仅对修订的差异化片段进行索引更新,降低检索开销。 —- ### 5. 动态技能结构扩展 当前技能包的结构 S = (D, A, P, B, C, F) 是预定义且固定的。对于更复杂的 GUI 工作流,可探索: - **自适应文件 Schema**:允许模型根据任务特征自动创建新的知识组件(如 `verification.md` 用于复杂多步验证,`params.md` 用于动态参数绑定); - **技能包的组合与继承**:支持从多个基础技能包中继承并覆盖特定文件,形成面向复杂工作流的**技能组合图**; - **时序性知识建模**:为长期运行的 GUI 会话引入状态机或 Petri 网形式的显式控制流表示,超越线性计划文档。 —- ### 6. 安全、隐私与人机协同 论文的伦理声明强调,错误的修订技能可能在多次调用中重复非预期行为。实际部署中需要: - **人机协同验证接口**:在高风险操作(如支付、邮件发送、权限授予)前强制引入人类确认节点; - **隐私感知的技能脱敏**:在技能包中自动检测并匿名化用户特定的个人数据(如用户名、文件路径),确保复用时的隐私安全; - **对抗性技能注入防御**:防止恶意指令通过任务描述污染技能库中的 `recover.md` 或 `plan.md`。 —- ### 7. 跨任务失败模式聚合与知识蒸馏 当前 `failure_examples/` 仅记录单任务轨迹。进一步可探索: - **失败模式聚类**:在技能库层面跨任务聚合相似的失败案例,提取**元级恢复策略**(如“延迟加载→等待并重试”作为跨应用通用规则); - **向模型权重的蒸馏**:虽然 EvoSkill-GUI 坚持无训练范式,但可将演化成熟后的高价值技能包通过上下文蒸馏(contextual distillation)或强化学习内化为模型参数,实现技能与模型能力的协同提升。 Q6: 总结一下论文的主要内容 这篇论文提出 **EvoSkill-GUI**,一种面向图形用户界面(GUI)智能体的**免训练(training-free)技能自我演化框架**,旨在解决现有技能系统在动态、非平稳 GUI 环境中难以实时修正与知识积累的问题。 —- ### 1. 研究背景与动机 GUI 智能体需在长程任务中应对弹窗、延迟加载与界面元素位置变化等非平稳现象。现有基于技能的范式通常将程序性知识封装为**静态、单文件、预生成**的提示,存在以下局限: - 技能内容纠缠(规划、定位、恢复规则混杂),难以精准编辑; - 执行阶段界面状态变化导致预固定计划失效; - 依赖外部模型进行反思,延迟高且与执行耦合松散; - 失败经验锁死在单次轨迹中,无法跨任务复用。 论文主张,GUI 智能体需要的不是更优的静态技能,而是能在部署时根据执行反馈**即时反思、定向修订并持续复用**的活态程序性知识。 —- ### 2. EvoSkill-GUI 框架 #### 2.1 结构化多文件技能包 与传统单文件长文档不同,每个技能被表示为一个结构化、多文件、可持久化的包:

S = (D, A, P, B, C, F)
其中: - D :检索元数据(意图、应用、平台、关键词等); - A :无障碍工具(accessibility tree 相关辅助); - P :可执行计划(`plan.md`),规定操作步骤; - B :备用定位策略(`backup.md`),应对元素查找失败; - C :失败恢复规则(`recover.md`),处理弹窗、权限等中断; - F = f^((1)), dots, f^((n)) :失败案例库,记录历史失败轨迹与诊断。 该解耦设计使得不同失败类型可靶向修订:流程错误改 P ,定位错误改 B ,缺失应急改 C 。技能包通过受限工具接口 T = read, write, append, list, search, createfailure 暴露,防止任意修改。 #### 2.2 Reflect–Revise–Reuse 自我演化循环 循环包含三个核心阶段: **(1)执行与即时修订(Rollout & In-Rollout Revision)** 执行器在环境中运行当前技能包 S^((i)) 并产生轨迹 τ^((i)) = Phi(S^((i)), E) 。执行过程中,若界面状态与预期不符,可即时调用工具修订技能文件,生成交付状态 S^((i,end)) ,防止局部失配级联为全局失败。 **(2)信息隔离的反思(Isolated Reflection)** 失败后,同一骨干模型在独立会话中充当评论器 π^Jθ ,其信息集 C_J 受严格约束:

CJ ⊂eq I ∪ o(1:T) ∪ a_(1:T)

CJ ∩ S, CoTθ, GT = ∅
评论器仅能观察任务指令 I 、截图与动作轨迹,**无权访问**技能包内容、执行器思维链或 ground truth。这迫使诊断必须基于可观测证据,输出结构化反馈 c^((i)) ,包括失败定位、根因分析与行为级建议。 **(3)技能文件修订(Revision)** 执行器依据诊断反馈修订技能包:
S^((i+1)) sim π_θ(· mid S^((i,end)), c^((i)), τ^((i)))
若 rollout 失败,系统将 (I, c^((i)), τ^((i))) 追加至 F 。循环持续至任务成功或达到最大迭代次数(论文默认最多 3 轮)。 #### 2.3 技能检索与复用 演化后的技能通过结构化元数据索引:

D = (id, ∫ent, app, platform, kw, args, hist, status)
对新指令 q ,检索分数结合词汇覆盖与语义紧密度:
base(q, S) = 0.6(|O|) / (|Q|) + 0.4(|O|) / (|Q ∪ T_S|)

score(q, S) = clip(base + b(app) + b(kw) - p_(÷), 0, 1)
若最高分超过阈值 θ_r = 0.6 ,则复用该技能包;否则从零生成新技能。验证成功的技能入库,供后续相关任务直接调用。 —- ### 3. 实验结果 论文在 **MobileWorld**(移动 GUI-only)、**AndroidWorld**(移动)与 **OSWorld**(桌面)三个基准上评估,覆盖通用闭源/开源模型与 GUI 专用模型。 - **MobileWorld**:对 Claude-Sonnet-4.6 提升 +10.5% (57.1% → 67.6%),对 Qwen3.6-Plus 提升 ** +16.2% **(53.3% → 69.5%),所有基座模型均一致受益。 - **AndroidWorld**:seed 30 提升 +2.6% ,seed 42 提升 ** +6.0% **,且第二阶段实现 100% 技能复用。 - **OSWorld**:GUI-Owl-1.5-8B 提升 +8.1% (46.7% → 54.8%),Qwen3-VL-8B-Instruct 提升 ** +10.5% **(23.8% → 34.3%)。 消融实验验证了: - 结构化多文件包优于单文件( +2.85% ); - 即时修订机制至关重要(移除后 -6.66% ); - 元数据检索显著优于全文匹配(12/12 vs. 1/12 命中率); - 信息隔离对反思质量不可或缺(移除后 -8.57% ); - 技能库在多轮演化中持续积累,三轮后趋于饱和,且优于同等 token 预算下的重复采样(pass@3)。 —- ### 4. 核心贡献 - 提出 **EvoSkill-GUI**,首个面向 GUI 的免训练技能自我演化框架,通过信息隔离反思与受限工具编辑,在推理时完成技能的构造、检索、执行与修订。 - 设计 **GUI 导向的结构化多文件技能包**,将检索元数据、执行计划、备用定位、恢复规则与失败案例分离,实现靶向更新。 - 在跨移动与桌面平台的三大主流基准上验证,对多种基座模型带来一致且显著的性能提升。 —- ### 5. 结论 EvoSkill-GUI 将部署中的 GUI 技能从静态产物转化为可根据执行反馈实时修正的活态知识。通过结构化表示、闭环反思-修订机制与元数据驱动的复用,该框架在不依赖任何额外训练或微调的前提下,显著提升了长程 GUI 任务的执行成功率,并为智能体程序性知识的持续积累提供了可行路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Bofan Chen,Boxuan Zhang,Fei Tang,Zhengxi Lu,Yong Du,Tongbo Chen,Weiming Lu,Jun Xiao,Yueting Zhuang,Yongliang Shen

Categories:

PDF URL: https://arxiv.org/pdf/2609.17653.pdf

Arxiv URL: https://arxiv.org/abs/2609.17653

Arxiv ID: 2609.17653

CoolPaper URL: https://papers.cool/arxiv/2609.17653

Published: 2026-09-19T01:34:39.789Z

Updated: 2026-09-19T01:34:39.789Z


10. WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing

Abstract:Document parsing converts document images into structured content and requires reliable performance across diverse layouts and acquisition conditions. Yet training corpora are biased toward common document types and clean digital pages, while expanding coverage alone does not specify how to address a parser’s remaining weaknesses. We present WeVisDoc, a two-stage data-centric framework for robust end-to-end document parsing. Stage I broadens semantic, structural, and appearance coverage through heterogeneous data and structure-preserving degradation synthesis. Stage II uses a held-out probe to measure the Stage I parser’s residual errors within fixed visual-structural clusters. These diagnostics guide targeted data construction and reallocation of the target-token budget. WeVisDoc-4B achieves an Overall score of 95.38 on OmniDocBench v1.6 and a mean Overall score of 75.54 across the three PureDocBench tracks, ranking first among the compared end-to-end parsers in all four settings. Compared with Stage I, Stage II improves Overall scores for the 2B and 4B models on both benchmarks, with larger gains on the degraded PureDocBench tracks, including a 4.03-point gain for the 4B model on the Real Degraded track.

中文摘要

摘要:文档解析将文档图像转换为结构化内容,并要求在各种布局和获取条件下保持可靠性能。然而,训练语料库偏向于常见文档类型和干净的数字页面,而仅扩展覆盖范围并不能指明如何解决解析器的剩余弱点。我们提出了 WeVisDoc,这是一种面向数据的两阶段框架,用于稳健的端到端文档解析。阶段 I 通过异质数据和结构保留的降质合成,扩展语义、结构和外观的覆盖范围。阶段 II 使用保留探针在固定的视觉-结构聚类内测量阶段 I 解析器的剩余错误。这些诊断指导目标数据构建和目标标记预算的重新分配。WeVisDoc-4B 在 OmniDocBench v1.6 上获得总体得分 95.38,在三个 PureDocBench 赛道上的平均总体得分为 75.54,在比较的四种端到端解析器设置中均排名第一。与阶段 I 相比,阶段 II 提高了 2B 和 4B 模型在两个基准上的总体得分,在降质的 PureDocBench 赛道上增益更大,包括 4B 模型在真实降质赛道上获得 4.03 分的提升。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*端到端文档解析器在多样化文档布局与复杂采集条件下的鲁棒性不足\*\*问题,具体聚焦于训练数据构建与优化分配中的以下核心挑战: - \*\*训练语料分布偏差与覆盖局限\*\* 现有大规模训练数据往往偏向于常见文档类型(如学术论文、数字 born-digital PDF)和清晰的页面图像,导致解析器在处理稀有布局、多语言混合、手写笔记、扫描件、拍照畸变等场景时性能显著下降。 - \*\*“覆盖范围”与“能力短板”之间的鸿沟\*\* 单纯扩大训练数据的覆盖范围(coverage)并不能自动指明解析器剩余弱点的根源。论文指出,必须区分两类不同的问题: - \*\*缺失数据支持\*\*(missing empirical support):某些文档模式在训练分布中几乎不存在,需要补充新数据; - \*\*曝光不足\*\*(insufficient exposure):某些模式已有数据支持,但模型在训练过程中获得的监督信号不够,需要重新分配训练预算。 - \*\*残差错误的精准诊断与干预\*\* 仅凭验证集上的残差错误无法直接判定是数据缺失、标注错误、视觉可观测性低,还是模型本身容量不足所致。因此,需要一套系统化的诊断机制,在固定的视觉-结构簇上度量解析器的残余错误,并将诊断结果转化为\*\*数据构造\*\*与\*\*监督曝光重新分配\*\*的具体动作。 - \*\*鲁棒性特别是退化场景下的性能瓶颈\*\* 文档在真实世界中常伴随扫描、拍摄、复印、屏幕翻拍等引起的几何畸变、模糊、摩尔纹、光照不均等退化。如何在保持语义与结构监督有效的前提下,利用结构保持的退化合成(structure-preserving degradation synthesis)与针对性数据增强,提升解析器在退化条件下的稳定性,是论文重点解决的问题之一。 为此,论文提出了 \*\*WeVisDoc\*\*——一个两阶段的数据中心框架:第一阶段通过异构数据与结构保持的退化合成建立广泛的语义、结构与外观覆盖;第二阶段利用独立的探测集(held-out probe)对第一阶段的残差错误进行聚类诊断,进而指导目标化数据构建与训练 token 预算的再分配,最终实现从“覆盖”到“能力”的跃迁。 Q2: 有哪些相关研究? 根据论文第2节(Related Work),相关研究可归纳为以下四个方向: ### 1. 文档解析架构 该方向主要探索如何将文档图像转换为结构化文本,可分为两类范式: - \*\*端到端生成式解析\*\*:早期工作如 \*\*Donut\*\*、\*\*Pix2Struct\*\* 与 \*\*Nougat\*\* 确立了图像到序列的文档理解框架。后续改进包括 \*\*SmolDocling\*\*(采用 DocTags 统一表达内容与结构)、\*\*DeepSeek-OCR\*\* 与 \*\*DeepSeek-OCR 2\*\*(分别探索视觉上下文压缩与视觉 token 的语义重排序)。 - \*\*基于布局分解的解析\*\*:将页面级布局理解与区域级识别相结合,代表性工作包括 \*\*Dolphin\*\*、\*\*MonkeyOCR\*\*、\*\*MinerU2.5\*\*、\*\*PaddleOCR-VL-1.5\*\* 与 \*\*PaDoc\*\*。这些方法通过全局结构分析协调局部内容识别,与端到端方法形成互补。 ### 2. 文档训练数据的覆盖与策展 该方向关注监督数据的规模、多样性与质量如何塑造解析器的上限: - \*\*多维度监督扩展\*\*:\*\*Vary\*\* 强调密集文档感知与非英文内容;\*\*mPLUG-DocOwl 1.5\*\* 结合结构监督与跨视觉域的文本定位;\*\*dots.ocr\*\* 利用多语言数据联合学习布局、内容与关系。 - \*\*数据中心化构建\*\*:\*\*MinerU2.5-Pro\*\* 引入多样性感知采样与注释验证修复;\*\*DocHumming\*\* 与 \*\*Infinity-Parser2\*\* 分别通过布局组合与可控渲染扩展监督;\*\*Infinity-Parser\*\* 进一步将策展语料与布局感知强化学习相结合。 ### 3. 文档退化鲁棒性 该方向研究扫描、拍摄与再传播等过程引入的退化对解析性能的影响: - \*\*几何校正\*\*:如 \*\*DewarpNet\*\* 与 \*\*UVDoc\*\*,通过单图文档去畸变恢复平坦视图。 - \*\*退化增强与训练\*\*:\*\*Augraphy\*\* 模拟打印、扫描等过程的伪影,用于训练时扩充外观变化。 - \*\*退化评估基准\*\*:\*\*PureDocBench\*\* 提供同源清洁与退化视图的配对评估;\*\*PaddleOCR-VL-1.5\*\* 与 \*\*DocHumming\*\* 也覆盖了拍照或屏幕中介文档中的几何畸变与退化。 ### 4. 模型感知的数据分配 该方向利用模型反馈优化有限训练预算的分配,从通用领域延伸至文档解析: - \*\*通用数据选择与加权\*\*:包括 \*\*课程学习\*\*(按难度组织曝光)、\*\*DoReMi\*\* 与 \*\*Nemotron-CLIMB\*\*(优化领域或聚类混合比例)、\*\*Rho-1\*\*(基于参考模型的超额损失选择 token)、\*\*Core-Set\*\*(表示覆盖)、\*\*JTT\*\*(初始模型错误优先)以及 \*\*LESS\*\*(梯度相似性选择)。 - \*\*文档专用诊断与分配\*\*:\*\*PaddleOCR-VL-1.5\*\* 提出 Uncertainty-Aware Cluster Sampling,利用随机输出差异分配样本;\*\*MinerU2.5-Pro\*\* 与 \*\*PaddleOCR-VL-1.6\*\* 结合数据分组与模型反馈进行定向扩展或注释修复;\*\*HunyuanOCR-1.5\*\* 将长尾弱点转化为数据构造需求;\*\*Infinity-Parser\*\* 与 \*\*FD-RL\*\* 则采用文档专用的强化学习奖励直接优化解析策略。 WeVisDoc 与上述工作的核心区别在于采用\*\*两阶段监督训练范式\*\*:第一阶段建立广泛覆盖,第二阶段通过独立的诊断探针(probe)将模型残差错误转化为\*\*定向数据构造\*\*与\*\*训练 token 重新分配\*\*,从而在固定骨干与输出格式下系统性地提升解析能力。 Q3: 论文如何解决这个问题? WeVisDoc 通过\*\*两阶段数据中心框架\*\*解决端到端文档解析的鲁棒性问题:第一阶段构建广泛的语义、结构与外观覆盖;第二阶段基于第一阶段模型的残差错误进行系统诊断,并据此执行定向数据构造与训练曝光重分配。以下分阶段详述其方法。 --- ## 1. 任务定义与优化目标 文档解析将输入图像 x_i (整页、区域或组件)映射为目标序列 y_i=(y_(i,1),dots,y_(i,T_i)) ,采用自回归建模:

pθ(y_i mid x_i) = prod(t=1)^(Ti) pθ(y(i,t) mid x_i, y(i,<t)).
训练曝光以**监督目标 token** 而非样本数量计量。设 m(i,t)∈0,1 指示位置 t 是否计入损失,则有效长度与样本损失为
L_i = ∑
(t=1)^(Ti) m(i,t), quad elli(θ) = -∑(t=1)^(Ti) m(i,t) log pθ(y(i,t) mid xi, y(i,<t)).
在采样分布 q 下,优化目标为每监督 token 的期望损失:
L(θ; q) = E(isim q)[ell_i(θ)]E(isim q)[L_i].
—- ## 2. Stage I:广泛覆盖的数据构建 Stage I 构建约 **4000 万条记录**的广泛覆盖池,从预训练参数 θ_0 出发,在目标 token 预算 B_1 下产出 θ_1 。 ### 2.1 多源异构数据与覆盖维度 语料融合开源数据集、内部生产数据、定向爬取与生成文档,覆盖以下维度: - **监督粒度**:整页(全局阅读顺序)、混合内容区域、纯文本块、独立表格、独立公式; - **文档域与布局**:单栏/多栏/自由格式、稀疏至密集页面、公式/表格富集布局; - **语言**:简体中文、繁体中文、英文及多语言混合; - **采集条件**:原生数字 PDF、扫描件、手机拍照、屏幕截图与翻拍。 ### 2.2 统一专家标注与难度分层 当源标注不完整时,采用 **MinerU2.5-Pro、PaddleOCR-VL-1.6、dots.mocr** 三个专家系统进行联合标注。对同一记录的两专家预测 y_i^((m)) 与 y_i^((n)) ,计算归一化编辑距离:

d_i^((m,n)) = ED(haty_i^((m)), y_i^((n))){max1, |y_i^((m))|, |y_i^((n))|}.

  • 三模型两两距离均低于阈值 δ_(ann) 且通过结构检查 → 直接采纳; - 两模型一致、第三模型偏离 → 图像级人工复核; - 三模型分歧 → 交由更强多模态模型与人工审查,供 Stage II 使用。 通过该流程将可靠记录按结构复杂度、组件密度与专家分歧分入 **Easy / Medium / Hard** 层级。 ### 2.3 广泛覆盖的数据合成 为补充真实数据中稀缺的组合,使用**可执行页面程序**(executable page programs): - 先定义语义关系(如论断-证据、行项目-总计、概念-方程),再决定排版; - 以语义 HTML/CSS 为中间表示,**双路编译**:一路渲染为图像,另一路遍历 DOM 树生成 Markdown、HTML 表格与 LaTeX 公式; - 共享节点标识确保图像区域与结构化目标严格对齐,提供**精确监督**。 ### 2.4 外观退化与增强(结构保持) 按真实采集路径(打印-扫描链、物理拍摄、屏幕翻拍等)分组退化算子,对清洁图像进行变换。关键约束为:**所有监督内容必须在变换后保持可见且可读**。若内容丢失,则拒绝该视图或将其降级为可见内容裁剪目标。 退化覆盖纸张纹理/老化、打印/复印伪影、透视畸变、页面卷曲、不均匀光照、运动模糊、摩尔纹等。 ### 2.5 源感知采样与 Token 会计 为避免大源主导训练,按源内可用监督 token 总量 M_s 进行幂律平衡:

Ms = ∑(i∈ Is) L_i, quad ω_s = (M_s^rho) / (∑(s’) Ms’)^rho, quad 0le rho le 1.
将目标 token 份额转换为记录采样概率时需做长度修正:对期望 token 份额为 v_g 、平均目标长度为 L_g 的流 g ,其记录选择系数为
α_g = v_g/barL_g∑
(h=1)^G vh/L_h,
从而短目标记录需更多采样次数以贡献相同 token 份额。 —- ## 3. Stage II:能力诊断与定向优化 Stage II 围绕 θ_1 的残差错误,构建约 **500 万条记录**的精修池,在预算 B_2 下产出 θ_2 。 ### 3.1 困难样本挖掘与验证 在独立的挖掘集(与训练、探针、最终评测内容不相交)上,对 θ_1 进行两级别错误度量: - **页面级**:完整序列的归一化编辑距离 d
(i,page) = NED(y_i, y_i) ; - **组件级**(用于发现占页面面积极小的失败):

e(i,c) = NED(y(i,c), y(i,c)), & c=text, 1-TEDS(y(i,c), y(i,c)), & c=table, 1-CDM(y(i,c), y_(i,c)), & c=formula.
高错误候选需经三轮审核排除非模型原因: 1. **标注错误**:通过 OCR-EDR 进行渲染感知诊断与修复; 2. **解码退化**:重复输出或未终止; 3. **低可观测性**:因裁剪、模糊、遮挡导致内容不可读。 仅保留**验证后的、模型在可靠目标上仍显著错误**的记录进入困难集 H 。 ### 3.2 视觉-结构聚类与覆盖诊断 为将孤立错误提升为系统性弱点,对页面/区域进行无监督聚类。聚类特征融合 SigLIP2 视觉嵌入的 PCA 降维与结构元数据:

zi = [PCA(h_i);; eta(str) bi],
其中 b_i 归一化描述了组件构成、密度、语言、布局、采集条件与目标长度。 在独立探针集 D
(probe) 上,计算簇 k 的加权平均错误:
Rk = ∑(i∈ Dprobe),k w_i e_i(θ_1){∑(i∈ Dprobe),k w_i},
并做收缩稳定化处理以避免小簇过拟合:
R_k^(sh) = γ_k R_k + (1-γ_k)R, quad γ_k = n_k^(eff)n_k^(eff)+λ
(sh).
将 R_k^(sh) 标准化后得到 g_k ;同时计算各组件通道的最大正向残差 D_k^(elem) 。最终优先级综合**覆盖优先级**(簇占比越低、内部分散度越高越优先)、**整体残差 g_k ** 与**组件残差 D_k^(elem) **,指导数据审查。 ### 3.3 残差驱动的定向数据合成 对诊断出的低覆盖能力(如中文数学文本、嵌套表头、跨区域阅读顺序等),利用 Stage I 的页面程序家族进行**定向合成**: - 公式程序:行内/独立方程、推导、分段表达式、中文数学语境; - 表格程序:边框变化 Q4: 论文做了哪些实验? 论文的实验部分(第4节)围绕**主性能对比**与**阶段式消融验证**展开,辅以附录中的**定性案例分析**。以下从评估设置、主结果、阶段消融与定性观察四个层面总结。 —- ### 1. 评估设置 实验在两个互补基准上进行,覆盖内容多样性与退化鲁棒性: - **OmniDocBench v1.6** 共 1,651 页,用于评估异构自然文档(多样类型、布局、语言、图文混排)的解析能力。 - **PureDocBench** 共 1,475 个 HTML/CSS 源页面,按同源渲染为 **Clean**、**Digital Degraded**(10 种合成退化)和 **Real Degraded**(4 种物理/屏幕采集管线)三组视图,共享精确 ground truth,用于评估对齐条件下的退化鲁棒性。 - **评估指标** 采用 TextEdit↓、FormulaCDM↑、TableTEDS↑、ROEdit↓,并定义综合指标:

Overall = 100×(1-TextEdit) + FormulaCDM + TableTEDS3,

Avg3 = Overall(clean) + Overall(digital) + Overall_(real)3.

  • **基线** 对比三类系统: - **通用 VLMs**:如 GPT-5.2、Qwen3-VL、Gemini 3 系列、InternVL3.5 等; - **流水线系统**:如 Dolphin、MinerU2.5、PaddleOCR-VL、GLM-OCR 等; - **专用端到端模型**:如 HunyuanOCR-1.5、FD-RL、dots.mocr、Unlimited-OCR 等。 所有受控变体在相同规模下保持相同骨干、输出格式与解码配置,每检查点重复推理 3 次取均值。 —- ### 2. 主结果 #### 2.1 OmniDocBench v1.6(表2) | 模型 | 参数量 | Overall↑ | TextEdit↓ | FormulaCDM↑ | TableTEDS_S↑ | ROEdit↓ | |———|————|—————|—————-|——————-|———————|————-| | WeVisDoc-4B | 4B | **95.38** | **0.036** | **96.81** | **95.34** | **0.125** | | WeVisDoc-2B | 2B | 95.06 | 0.038 | 95.94 | 95.26 | 0.130 | - **WeVisDoc-4B** 在对比的端到端 parser 中排名第一,Overall 为 95.38,较此前领先结果提升 0.64。 - **WeVisDoc-2B** 以一半参数量达到 95.06,仍位于端到端前沿。 #### 2.2 PureDocBench 三轨道(表3) | 模型 | Params | Avg3↑ | Clean↑ | Digital↑ | Real↑ | |———|————|———-|————|—————|———-| | WeVisDoc-4B | 4B | **75.54** | **79.81** | **77.74** | **69.08** | | WeVisDoc-2B | 2B | 73.86 | 79.36 | 76.62 | 65.60 | - **WeVisDoc-4B** 的 Avg3 为 75.54,超过此前最优的通用域基线(Qwen3.5-122B-A10B,74.11)1.43 分。 - 在 **Real Degraded** 上,4B 模型以 69.08 将端到端 state of the art 提升 1.44 分。 - 从 2B 扩展至 4B,Clean / Digital / Real 分别增益 0.45 / 1.12 / 3.48,表明额外容量对强外观偏移场景收益最大。 —- ### 3. Stage-wise 消融实验(表4) 为验证第二阶段(Capability-Aware Refinement)的聚合效果,论文对比了同规模模型在 **Stage I(广泛覆盖)** 与 **完整 Stage II** 后的性能: | 规模 | 训练阶段 | OmniDocBench↑ | Clean↑ | Digital↑ | Real↑ | Avg3↑ | |———|—————|———————-|————|—————|———-|———-| | **2B** | Stage I | 93.50 | 78.90 | 74.24 | 63.23 | 72.12 | | | Stage II | 95.06 | 79.36 | 76.62 | 65.60 | 73.86 | | | **增益** | **+1.56** | **+0.46** | **+2.38** | **+2.37** | **+1.74** | | **4B** | Stage I | 94.22 | 79.32 | 75.19 | 65.05 | 73.19 | | | Stage II | 95.38 | 79.81 | 77.74 | 69.08 | 75.54 | | | **增益** | **+1.16** | **+0.49** | **+2.55** | **+4.03** | **+2.35** | **关键发现**: - 两阶段训练在两项基准、两种规模上均带来一致提升。 - 提升幅度在退化轨道上显著大于清洁轨道:**Real Degraded** 增益高达 +4.03(4B),**Digital Degraded** 增益为 +2.38~+2.55。 - 这一模式与 Stage II 的设计目标一致——针对分布尾部与采集引起的外观偏移进行补强。但论文明确指出,由于 Stage II 组合了多项干预(继续优化、残差感知重分配、困难样本、定向合成与回放),该对比**不隔离**某一单独组件的效应。 —- ### 4. 定性案例分析(附录 B) #### 4.1 Stage-wise 对比(图 9–12) 论文展示了 12 个代表性页面的 Stage I → Stage II 改进案例,覆盖四种失效模式的修复: - **内容遗漏**:恢复被 Stage I 遗漏的数独表格、语义层级、周边标题与页脚; - **阅读顺序错误**:纠正多栏接送安排表的“列优先”误读,恢复横向行优先顺序; - **结构误判**:修正过度表格化(将非表格注释、临床表单错误套入 ``)与字段-值拆分; - **公式与跨页幻觉**:恢复独立显示公式的 LaTeX 序列化,消除报纸版面中跨文档的中文披露文本与数学幻觉。 同时观察到,在 **Real Degraded** 物理采集样本上,Stage II 虽能恢复宏观结构,仍残留局部字符级识别错误(如姓名转录偏差),说明结构恢复与字符识别在强退化下仍存在部分解耦。 #### 4.2 跨场景预测(图 13–16) 补充展示了模型在以下场景的端到端预测质量: - **公式富集文档**:复杂 LaTeX 矩阵、多行推导、行内/行间混排; - **一般文档**:教育材料、英语练习、中文作文排版; - **扫描与拍照文档**:低对比度、透视畸变、运动模糊下的保持; - **表格富集文档**:跨页大表、嵌套表头、行列合并的 HTML 还原。 Q5: 有什么可以进一步探索的点?

基于论文第 5 节的明确讨论以及方法设计中的潜在延伸空间,以下方向值得进一步探索: ### 1. 真实退化数据的规模化采集与物理建模 论文指出,当前证据仍受限于合成退化的保真度,且手写笔记、历史扫描、严重损坏文档等场景测量不足。未来可朝以下方向深入: - 构建**大规模真实配对退化数据集**(如对齐的清洁/扫描/拍摄/复印链),以缩小合成退化的 domain gap; - 引入**可微分或基于物理的渲染**(differentiable/physics-based rendering)提升退化仿真的真实性,使训练分布更贴近 in-the-wild 的 ink bleed、paper aging 与 camera pipeline 效应; - 探索**无需配对监督的域自适应或自监督预训练**,以降低对昂贵真实标注的依赖。 ### 2. 更稳定、可解释且低成本的残差诊断 Stage II 的残差重平衡依赖探针集 D(probe) 、SigLIP2 表示、固定聚类中心及外部评估器,这引入额外计算且对聚类超参数敏感。可进一步研究: - **因果归因方法**:区分“数据缺失”“标注噪声”“视觉不可观测”与“模型容量不足”等根本致因,而非仅依赖相关性聚类; - **自适应探针集构造**:动态更新探针以匹配模型演进,减少因探针固定导致的诊断漂移; - **轻量级代理诊断**:用小型代理模型或梯度压缩技术近似困难样本与簇级残差,降低完整推理与聚类的计算开销。 ### 3. Stage II 各干预组件的细粒度消融与动态化 论文明确说明,表 4 中的阶段对比衡量的是**完整 Stage II 协议**的聚合效应,未隔离各组件(困难样本过采样、定向合成、Stage I 回放、曝光重分配)的独立贡献。后续可: - 系统性地对 q(hard) 、 q(residual) 及式 (10)–(12) 中的 α(nat) 、 β(alloc) 、 vartheta(min/max) 进行消融,量化各模块的边际增益; - 将**两阶段静态范式扩展为连续或周期性的在线诊断-更新循环**,使模型在部署后仍能根据新发现的失败模式迭代精炼数据混合。 ### 4. 跨语言、跨域与长尾结构的扩展评估 当前训练与评估主要覆盖中英及常见办公/学术文档。进一步工作可包括: - **低资源语言与非拉丁文字**:如阿拉伯文、南亚文字、古文字的手稿与混排解析; - **专业领域文档**:法律文书中的嵌套条款、工程图纸中的图文交叉引用、财务报表中的复杂附注结构; - **极端长页与超密集布局**:当前 8,192 的序列长度与视觉分辨率可能限制对大幅面海报、折叠手册或高信息密度表格的解析。 ### 5. 视觉-语言联合优化与解码策略的协同设计 WeVisDoc 在 Stage II 中冻结视觉编码器(ViT),仅微调语言模型(LLM)。这一设计简化了训练,但也可能限制模型对退化引起的低层视觉特征变化的适应。未来可探索: - **视觉-语言联合微调的安全策略**:如使用 LoRA 或适配器对 ViT 进行部分更新,在防止灾难性遗忘的同时提升视觉鲁棒性; - **结构化输出的非自回归或半自回归解码**:针对表格、公式等具有显式层级结构的元素,探索并行或分块解码以降低长序列错误累积; - **将布局先验显式嵌入注意力机制**:如在视觉 token 中注入阅读顺序或区域邻接的图结构先验,减少对纯数据覆盖的过度依赖。 ### 6. 安全部署、不确定性量化与人在回路机制 论文强调高利害场景需结合出处控制与人工审核。可进一步研究: - **解析不确定性的结构化估计**:不仅输出文本,还输出单元格/公式级别的置信度或替代假设,用于触发人工复核; - **交互式文档解析接口**:允许用户在模型输出基础上纠正阅读顺序、调整表格边界或补全 OCR 错误,并将反馈用于持续学习; - **输出溯源与可验证性**:为每个生成的结构化单元提供指向输入图像区域的细粒度视觉依据(visual grounding),增强可审计性。

Q: 总结一下论文的主要内容

该论文提出了 **WeVisDoc**,一种面向端到端文档解析的两阶段数据中心化训练框架,旨在系统性地解决文档布局多样性、退化鲁棒性与训练数据覆盖偏差问题。以下从研究动机、方法框架、关键技术与实验结论四个方面进行总结。 —- ### 1. 研究动机与核心问题 端到端文档解析要求将文档图像转换为保留结构与阅读顺序的文本(Markdown/HTML/LaTeX)。现有方法面临的核心挑战包括: - **训练语料偏差**:大规模语料过度集中于常见文档类型(如学术论文、清晰数字页),导致对复杂布局、手写笔记、扫描/拍照退化等长尾场景支持不足。 - **覆盖不等于能力**:单纯扩大训练数据覆盖范围(coverage)无法自动指明解析器剩余弱点的根源。残差错误可能源于数据缺失、曝光不足、标注错误或视觉不可观测,需要区分干预。 - **退化鲁棒性不足**:真实世界中的扫描、拍摄、复印与屏幕翻拍引入几何畸变、模糊、噪声与摩尔纹等,对现有 parser 构成严峻挑战。 —- ### 2. WeVisDoc 两阶段框架 论文将文档数据扩展划分为**覆盖构建**与**能力感知精炼**两个阶段,分别对应独立的监督目标 token 预算 B_1 与 B_2 。 #### Stage I:广泛覆盖构建 构建约 **4000 万条记录**的广泛覆盖池,建立对内容、结构、语言与采集条件的全面支持: - **异构监督粒度**:整页、混合内容区域、纯文本块、独立表格与独立公式,分别教授全局阅读顺序、局部交互与组件结构。 - **统一专家标注**:采用 MinerU2.5-Pro、PaddleOCR-VL-1.6 与 dots.mocr 三模型联合标注,通过归一化编辑距离

d_i^((m,n)) = ED(haty_i^((m)), y_i^((n))){max1, |y_i^((m))|, |y_i^((n))|}
判定高置信度标注、人工复核或 Stage II 候选。 - **广泛合成**:基于可执行页面程序(语义 HTML/CSS 双路编译)生成精确配对的图像与结构化目标,补充真实数据中稀缺的布局-内容组合。 - **结构保持退化合成**:按真实采集路径(打印-扫描、物理拍摄、屏幕翻拍)对清洁图像施加退化,仅保留目标内容仍完全可见且可读的增强视图,扩展外观覆盖而不破坏语义监督。 - **源感知采样**:通过幂律平衡与基于目标 token 份额的长度修正,防止大语料源主导训练。 #### Stage II:能力诊断与定向精炼 构建约 **500 万条记录**的精修池,针对 Stage I 模型的残差错误进行诊断与干预: - **困难样本挖掘**:在独立挖掘集上度量页面级 NED 与组件级错误(文本 NED、表格 1-TEDS 、公式 1-CDM ),筛选高错误候选。 - **高错误验证**:排除由标注错误、解码退化或低视觉可观测性导致的伪困难样本,仅保留“真实能力缺陷”。 - **视觉-结构聚类诊断**:基于 SigLIP2 视觉嵌入与结构元数据对文档进行无监督聚类。在独立探针集上计算簇级残差

Rk^(sh) = γ_k R_k + (1-γ_k)R,
经标准化得到 g_k ,并结合组件级残差 D_k^(elem) 确定干预优先级。 - **残差驱动定向合成**:针对诊断出的低覆盖模式(如中文数学文本、嵌套表头、跨区域阅读顺序)利用页面程序定向生成训练数据。 - **Token 预算重分配**:综合自然 token 份额 p_k^(tok) 与标准化残差 g_k ,通过带 KL 散度与相对曝光边界约束的优化
v^star = argmin_v ∑
(k∈ K+) v_k log(v_k) / (tildev)_k, quad s.t. quad vartheta(min) pk^(tok) le v_k le vartheta(max) pk^(tok),
重新分配训练 token,同时以 Stage I 回放防止遗忘,并以固定比例 λ
(hard) 过采样验证困难样本。 —- ### 3. 实验与主要结论 论文基于 Qwen3-VL-Instruct(2B/4B)实例化 WeVisDoc,在 OmniDocBench v1.6 与 PureDocBench 上评估: | 基准 | 指标 | WeVisDoc-4B | WeVisDoc-2B | 关键对比结论 | |———|———|——————-|——————-|———————| | OmniDocBench v1.6 | Overall | **95.38** | 95.06 | 端到端 parser 中最优,4B 较此前领先结果 +0.64 | | PureDocBench | Avg3 | **75.54** | 73.86 | 4B 超过通用域基线 Qwen3.5-122B-A10B (+1.43) | | | Clean | 79.81 | 79.36 | 高基线性能 | | | Digital Degraded | 77.74 | 76.62 | Stage II 显著提升 | | | Real Degraded | **69.08** | 65.60 | 4B 较此前端到端 SOTA +1.44 | **阶段消融**表明,Stage II 在两项基准、两种规模上均带来一致提升,且增益在退化轨道上尤为显著:4B 模型在 Real Degraded 上提升 **+4.03**,Digital Degraded 上提升 **+2.55**,Clean 仅提升 **+0.49**,验证了该方法对分布尾部与外观偏移的针对性补强效果。 —- ### 4. 核心贡献 - **方法论**:提出“从覆盖到能力”的显式两阶段范式,将训练数据混合视为可度量的覆盖-能力接口,而非静态语料集合。 - **诊断机制**:建立基于独立探针、视觉-结构聚类与残差度量的系统诊断流程,将模型错误转化为可执行的数据构造与重分配决策。 - **性能**:WeVisDoc-4B 在 OmniDocBench v1.6 与 PureDocBench 三轨道上均取得端到端 parser 中的最优成绩,2B 模型以一半参数量保持顶尖竞争力。 - **退化鲁棒性**:通过结构保持退化合成与残差感知精炼,显著提升了物理采集与数字退化场景下的解析稳定性。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Hao Yu,Kang Liu,Linnan Zhao,Jiabo Zhan,Chong Sun,Chen Li,Jing Lyu

Categories:

PDF URL: https://arxiv.org/pdf/2609.20423.pdf

Arxiv URL: https://arxiv.org/abs/2609.20423

Arxiv ID: 2609.20423

CoolPaper URL: https://papers.cool/arxiv/2609.20423

Published: 2026-09-19T01:34:40.622Z

Updated: 2026-09-19T01:34:40.622Z


11. Self-Evolving Search Index

Abstract:Information retrieval is increasingly important as LLM agents tackle complex tasks involving diverse information needs. Because retrieval relies on an index that represents each document through index keys, retrieval quality depends heavily on how effectively these keys expose the knowledge contained in each document. However, effective index representations vary across retrieval environments, making it difficult for any fixed optimization strategy to perform consistently. Yet evolving an index to its retrieval environment remains largely human-driven, requiring humans to diagnose retrieval failures, refine the optimization strategy, and reprocess the index accordingly. We propose SELF-INDEX, a framework that enables an index to self-evolve without human intervention. Its Optimizer autonomously diagnoses retrieval shortfalls, selectively revises the responsible index keys, and validates each revision before updating the index. Beyond reacting to observed retrieval demands, SELF-INDEX proactively explores additional demands through a Query Simulator, allowing the index to evolve beyond the queries already available for optimization. Across diverse corpora and retrievers, SELF-INDEX consistently improves retrieval performance while outperforming existing index optimization methods. We further show that these benefits extend to downstream applications, improving the effectiveness and efficiency of search agents and helping agent memory systems retrieve useful past interactions.

中文摘要

摘要:随着大型语言模型(LLM)代理处理涉及多样化信息需求的复杂任务,信息检索变得越来越重要。由于检索依赖于通过索引键表示每个文档的索引,检索质量在很大程度上取决于这些键如何有效地揭示每个文档所包含的知识。然而,有效的索引表示在不同的检索环境中各不相同,使得任何固定的优化策略难以持续表现良好。然而,使索引适应其检索环境的演化仍主要依赖人工,需要人类诊断检索失败、改进优化策略,并相应地重新处理索引。我们提出了SELF-INDEX,一种使索引无需人工干预即可自我演化的框架。其优化器能够自主诊断检索中存在的问题,有选择地修改相关的索引键,并在更新索引之前验证每次修改。除了响应已观察到的检索需求外,SELF-INDEX 还通过查询模拟器主动探索额外的需求,从而使索引超越现有可用于优化的查询进行演化。在不同的语料库和检索器中,SELF-INDEX 一致地提高了检索性能,同时优于现有的索引优化方法。我们进一步表明,这些优势也可以延伸到下游应用,提高搜索代理的有效性和效率,并帮助代理记忆系统检索有用的过去交互信息。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.19656 (stream has been aborted)

Authors: Sangam Lee,Wonjae Lee,Sunghwan Kim,Deogyong Kim,Jaehoon Kim,Daye Nam,SeongKu Kang,Dongha Lee

Categories:

PDF URL: https://arxiv.org/pdf/2609.19656.pdf

Arxiv URL: https://arxiv.org/abs/2609.19656

Arxiv ID: 2609.19656

CoolPaper URL: https://papers.cool/arxiv/2609.19656

Published: 2026-09-19T01:34:42.499Z

Updated: 2026-09-19T01:34:42.499Z


12. Video DeltaNet: A Video-Native Hybrid Attention for Livestream Video Generation

Abstract:Video diffusion models repeatedly process long spatiotemporal token sequences during denoising, making attention a major computational bottleneck. Linear attention offers an appealing alternative and has been widely adopted in recent large language models, but directly applying it to video models often fails to preserve the fine-grained interactions required for high-quality generation. We present Video DeltaNet (VDN), which combines local Softmax attention with bidirectional linear memory for long-range video context. Its linear branch introduces Video Delta Attention (VDA), which updates memory once per frame by jointly incorporating its spatial tokens. Separate output projections and learnable gates calibrate the two branches, while a staged teacher-alignment recipe progressively introduces the new pathway into pretrained models. We instantiate VDN on MiniMax H3, applying the hybrid to video-to-video interactions while retaining Softmax for interactions involving text or audio. With eight-step distillation and an optimized SGLang serving stack, VDN-H3 completes DiT denoising for a 14.3-second, 768p video in 6.70 seconds on eight NVIDIA B200 GPUs, corresponding to a 14.5x speedup over the 50-step dense H3 baseline on the same GPU count.

中文摘要

摘要:视频扩散模型在去噪过程中会反复处理长时间空间-时间标记序列,使得注意力机制成为主要的计算瓶颈。线性注意力提供了一种有吸引力的替代方式,并且在近期的大型语言模型中被广泛采用,但直接将其应用于视频模型通常难以保持高质量生成所需的细粒度交互。我们提出了 Video DeltaNet (VDN),它结合了局部 Softmax 注意力和用于长程视频上下文的双向线性记忆。其线性分支引入了 Video Delta Attention (VDA),通过联合整合其空间标记在每帧更新一次记忆。独立的输出投影和可学习门控机制校准两个分支,而分阶段的教师对齐策略逐步将新路径引入预训练模型。我们在 MiniMax H3 上实例化 VDN,将混合机制应用于视频到视频的交互,同时保留 Softmax 用于涉及文本或音频的交互。通过八步蒸馏和优化的 SGLang 服务栈,VDN-H3 在八块 NVIDIA B200 GPU 上完成了对一段 14.3 秒、768p 视频的 DiT 去噪,仅用时 6.70 秒,相比在相同 GPU 数量下的 50 步密集 H3 基线实现了 14.5 倍的加速。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*视频扩散模型中长序列注意力计算的高成本与线性注意力直接移植后质量退化之间的矛盾\*\*。具体而言,论文识别并试图弥合以下三个核心挑战: ### 1. 全局信息压缩与细粒度交互的冲突 Dense Softmax 注意力通过保留完整的键值序列实现精细的 token-to-token 交互,但其计算量随序列长度二次增长。线性注意力虽能将 distant context 压缩为固定大小的循环状态以实现线性复杂度,但该状态容量不随序列增长,难以同时保留主体身份、场景布局、外观一致性和长程运动等全局属性。 ### 2. 计算单元与自然视频结构的错位 现有 delta-rule 线性注意力(如在大语言模型中)通常按\*\*单个 token\*\* 更新循环状态,这适用于自回归逐 token 解码。然而视频扩散模型以\*\*整帧\*\*(所有空间 token 同时)为单位处理。若强行按 patch 顺序逐个更新,不仅会破坏空间相关性,还会导致同一帧内相关写入互相干扰,无法自然利用帧内联合信息。 ### 3. 新通路引入预训练模型的适应性难题 将随机初始化的线性注意力分支直接接入已预训练的 Softmax 骨干网络,会同时改变信息流和残差流的激活统计。若缺乏谨慎的适应策略,新分支在发挥作用前就会破坏预训练模型已习得的能力。 --- 为应对上述问题,论文提出 \*\*Video DeltaNet (VDN)\*\*,其核心方案包括: - \*\*混合注意力架构\*\*:保留局部时间窗口内的 Dense Softmax 注意力以维护纹理、边界和短期运动;引入\*\*双向线性记忆\*\*(bidirectional linear memory)处理远距离视频上下文;并增设\*\*边界锚点\*\*(boundary anchors)提供全局参考。 - \*\*Video Delta Attention (VDA)\*\*:一种帧级别的 delta 规则,将一整帧的所有空间 token 联合纳入状态更新,通过求解共享的正规方程来消解键方向重叠时的写入冲突,并保证继承状态的\*\*非扩张性\*\*(non-expansive transition)。 - \*\*分阶段教师对齐食谱\*\*:通过逐层对齐 → 端到端对齐 → LoRA 联合适应的三阶段策略,将线性分支渐进式地引入预训练模型,避免能力崩溃。 最终,VDN 在不从头训练基础模型的情况下,实现了显著加速:在 8 块 NVIDIA B200 上,将 14.3 秒、768p 视频的 DiT denoising 从基线的 799.6 秒降至 6.70 秒(累计 \*\*119.3×\*\* 加速,含 8 步蒸馏与分布式推理),同时在质量指标上匹配或略优于 50 步 Dense 基线。 Q2: 有哪些相关研究? 论文在第 7 节系统梳理了相关研究,主要分布于以下四个方向: --- ### 1. 高效视频注意力算法 该方向致力于降低长时空序列上的注意力计算与访存开销,具体包括: - \*\*优化的精确注意力内核\*\*:FlashAttention (Dao et al., 2022)、FlashAttention-2 (Dao, 2023)、FlashAttention-3 (Shah et al., 2024)。 - \*\*低精度注意力加速\*\*:SageAttention (Zhang et al., 2025b)、SageAttention2 (Zhang et al., 2024)、SageAttention3 (Zhang et al., 2025a)。 - \*\*通用稀疏注意力方法\*\*:SpargeAttn (Zhang et al., 2025d)、SpargeAttention2 (Zhang et al., 2026b)。 - \*\*视频专用稀疏策略\*\*:Sparse VideoGen (Xi et al., 2025)、Sparse VideoGen2 (Yang et al., 2025a)。 - \*\*稀疏–线性混合机制\*\*:SLA (Zhang et al., 2025c)、SLA2 (Zhang et al., 2026a)。 - \*\*扩散模型量化\*\*:ViDiT-Q (Zhao et al., 2024)、SVDQuant (Li et al., 2025)、DeltaQuant (Li et al., 2026);针对自回归视频模型 KV 缓存的 Quant VideoGen (Xi et al., 2026)。 --- ### 2. 线性注意力与循环记忆机制 该方向探索以线性复杂度替代密集 Softmax 注意力的序列建模方法: - \*\*早期线性复杂度注意力\*\*:Linear Transformers (Katharopoulos et al., 2020)、Performers (Choromanski et al., 2021)。 - \*\*状态空间模型\*\*:Mamba (Gu & Dao, 2023)、Mamba-2 (Dao & Gu, 2024)。 - \*\*数据依赖的门控/线性记忆更新\*\*:Gated Linear Attention (Yang et al., 2024b)、DeltaNet (Yang et al., 2024a)、Gated Delta Networks (Yang et al., 2025b)、Kimi Linear (Kimi Team, 2025)、Gated DeltaNet-2 (Hatamizadeh et al., 2026)。 - \*\*视觉与视频中的 Mamba 方法\*\*:VideoMamba (Li et al., 2024b)、M4V (Huang et al., 2026),以及结合滑动窗口与参数化长期记忆的 LoGeR (Zhang et al., 2026c)。 - \*\*线性/混合扩散骨干\*\*:SANA (Xie et al., 2025)、SANA-Video (Chen et al., 2025)、SANA-Video 2.0 (Chen et al., 2026)、SANA-WM (Zhu et al., 2026)。 - \*\*同期分析\*\*:Reflections on Video DeltaNet (Zhu, 2026)。 --- ### 3. 少步蒸馏与分布式推理加速 该方向关注在保持生成质量的同时减少去噪步数并扩展并行推理: - \*\*蒸馏与一致性模型\*\*:Progressive Distillation (Salimans & Ho, 2022)、Consistency Models (Song et al., 2023)、Latent Consistency Models (Luo et al., 2023)、Adversarial Diffusion Distillation (Sauer et al., 2023)。 - \*\*分布匹配蒸馏\*\*:DMD (Yin et al., 2024a)、DMD2 (Yin et al., 2024b)。 - \*\*视频少步生成\*\*:AnimateLCM (Wang et al., 2024)、T2V-Turbo (Li et al., 2024a)。 - \*\*长序列与分布式并行推理\*\*:Ulysses (Jacobs et al., 2023)、USP (Fang & Zhao, 2024)、DistriFusion (Li et al., 2024c)、PipeFusion (Fang et al., 2024a)、xDiT (Fang et al., 2024b)。 - \*\*低延迟流式生成\*\*:StreamDiffusionV2 (Feng et al., 2026)。 --- ### 4. 长序列视频生成模型 随着视频长度与分辨率提升,长序列建模成为前沿课题,相关工作包括 LTX-Video (HaCohen et al., 2024)、Pyramidal Flow Matching (Jin et al., 2024)、HunyuanVideo (Kong et al., 2024)、Movie Gen (Polyak et al., 2024)、Wan (Team Wan et al., 2025)、CogVideoX (Yang et al., 2025c) 以及作为本文基座的 MiniMax H3 (MiniMax, 2026)。 Q3: 论文如何解决这个问题? 论文通过\*\*架构设计、帧级状态更新规则、渐进式训练适应与系统级推理优化\*\*四个层面协同解决该问题。具体方法如下: --- ### 1. 混合注意力架构:局部精确与全局线性压缩的协同 VDN 将视频-视频注意力按时间角色划分为两个分支,兼顾局部细节与长程效率。 #### 1.1 滑动窗口 Softmax 注意力(局部) - 保留相邻时间块(chunk)内的 Dense Softmax,使查询帧能直接匹配邻近帧的完整 token,维护纹理、物体边界与短期运动。 - \*\*边界锚点(Boundary Anchors)\*\*:首帧与末帧作为全局参考,所有帧均对二者做 Dense Attention,同时二者也对全序列可见。这对首尾帧条件生成(如 First–Last-Frame-to-Video)尤为关键。 #### 1.2 双向线性记忆(远距离) - 对窗口外的远距离上下文,VDN 采用\*\*前向与反向两个时间扫描\*\*: - 前向状态 S_t 汇总窗口之前的视频信息; - 反向状态 S_t 汇总窗口之后的视频信息。 - 两区域不相交,查询读数直接相加,避免重复计数:

o_t^L = S_t q_t + S_t q_t

  • 文本条件被压缩为文本状态 S_T ,两个扫描均以 S_T/2 初始化,确保文本在双线性和 Softmax 分支中均被恰当地注入。 #### 1.3 分支输出校准与融合 由于 Softmax 限定在局部窗口后概率质量更集中,而线性读出的数值尺度也不同,VDN 为两分支配置独立的门控与输出投影:

O_S = G_S odot O_S, quad O_L = G_L odot RMSNorm(O_L)

Y = O_S W_S^O + O_L W_L^O
独立投影允许两个分支在残差流中沿不同方向贡献,原始前馈子层保持不变。 —- ### 2. Video Delta Attention (VDA):帧级 Delta 规则 针对视频扩散以“帧”而非“token”为自然计算单元的问题,VDA 将传统 token-wise delta rule 提升为**帧级联合更新**。 #### 2.1 从独立修正到联合求解 传统 token-wise delta rule 逐 token 修正,同一帧内各 patch 的更新彼此独立,导致键方向重叠时产生冲突。VDA 定义帧级目标函数,要求新状态 S_t 同时拟合帧内所有键-值关联,并靠近衰减后的继承状态 S_t :

St = argmin_S (1) / (2)|S - S_t|_F^2 + (1) / (2)∑(u=1)^U β(t,u)|S k(t,u) - v(t,u)|_2^2
求导得到闭式解:
S_t (I + A_t) = S_t + B_t, quad S_t = (S_t + B_t)(I + A_t)^(-1)
其中 A_t = K_t^top Diag(β_t) K_t 为键的相关矩阵, B_t = V_t^top Diag(β_t) K_t 为值-键写入统计。逆矩阵 (I+A_t)^(-1) 在 d_k × d_k 空间中求解,使重叠键的交互在帧内被联合消解,而非简单累加。 #### 2.2 稳定的继承状态转移 VDA 的继承状态转移具有**非扩张性**。设 M_t = Diag(α_t)(I+A_t)^(-1) ,在 β
(t,u)≥ 0 且 0≤ α_(t,j)≤ 1 时:

|Mt|_2 ≤ 1
这意味着进入状态的变化不会在帧更新中被放大,避免了 additive batch write 可能出现的数值放大问题(如 SANA-WM 需额外引入 1/√U 缩放来抑制此类风险)。 —- ### 3. 分阶段训练适应:保护预训练能力 为避免随机初始化的线性分支破坏 Softmax 预训练模型的能力,VDN 采用三阶段渐进式适应,全程冻结原始骨干权重: - **Stage A1(逐层对齐)**:独立对齐每一层的线性分支,冻结主干与 Softmax 门控,每层仅训练 200 步,梯度裁剪 0.1。 - **Stage A2(端到端对齐)**:将校准后的各层联合组装,端到端训练 500 步,修正单层孤立训练无法发现的组合误差;主干与 Softmax 门控仍冻结。 - **Stage B(LoRA 联合适应)**:为 Q、K、V 及输出投影添加 LoRA 适配器,与线性分支及 Softmax 门控联合训练 2,000 步,实现整个注意力层的协同微调。 #### 少步蒸馏(Few-step Distillation) 架构适应完成后,采用类 DMD2 目标(无 GAN 项)将 50 步 VDN-H3 蒸馏为 8 步学生模型。生成器、真值打分与假值打分共享同一 FSDP 骨干,通过独立适配器区分角色。该步骤将架构加速与步数缩减解耦,最终模型在 8 步下仍保持与 50 步 Dense H3 相当的质量。 —- ### 4. 系统级推理优化:释放硬件效能 为将理论线性复杂度转化为实际 wall-clock 加速,论文联合 SGLang 团队实施了针对性优化: - **融合 Triton Kernel**:将 VDA 的数据准备(VDA-Prep)、统计量构造(VDA-Stats)、边界状态收集与衰减桥接(VDA-Gather)、后处理(VDA-Epilogue)分别融合为四个内核,减少显存搬运与启动开销。 - **Chunk-wise 扫描**:按 VAE chunk(5 帧)为粒度将多帧仿射转移合成为单步 chunk 转移 S
(out) = S(∈) M(chunk) + J_(chunk) ,扫描深度降低约 5 倍。 - **寄存器内小矩阵求逆**:避免多 kernel 的 Cholesky 流水线,使用单个 CUDA kernel 在寄存器内执行分块 Gauss–Jordan 消元,直接发射转移与注入项,实现 4.6–5.0× 的求逆加速。 - **分布式与混合精度**:按 Ulysses 策略按注意力头切分 VDA 到侧流执行;QKV、输出及 FFN 使用 MXFP8 加速,而循环状态与矩阵求逆保持 FP32;Window Softmax 通过 varlen 打包适配 FlashAttention。 —- 通过上述方法,VDN 在 8×B200 上于 **6.70 秒** 内完成 14.3 秒、768p 视频的 DiT denoising,相对 50 步 Dense H3 实现 **119.3×** 累计加速,且在视频质量、运动幅度与条件端点保真度上均与基线持平或更优。 Q4: 论文做了哪些实验? 论文的实验验证围绕**生成质量保持**、**端到端推理效率**与**系统级消融**三个维度展开,具体包括以下内容: —- ### 1. 实验设置 - **数据**:10,015 条训练视频,分辨率 1344 × 768 ,时长 14.375 秒(345 帧 @ 24 fps)。样本被预编码并缓存为视频 latents、音频 latents 与 Qwen3-VL 文本嵌入,训练时无需实时调用 VAE 与文本编码器。评估使用固定的 103 条第三方提示词。 - **基线**: - **Dense H3**(50 NFE):全注意力基线。 - **FastH3**(4 NFE):已有快速模型基线。 - **VDN-H3**:论文提出的混合模型,主要报告 8 NFE 版本;50 NFE 版本仅用于效率拆解。 - **指标**: - **无参考视频质量**:VQAA、VQAT、Q-Align、FAST-VQA、DOVER++(越高越好)。 - **运动诊断**:RAFT mean flow(像素级平均光流幅度)。 - **FIRM-Video**:Instruction Following、Perceptual Quality、World Coherence(1–5 分制)。 - **FL2VA 端点保真度**:PSNR、SSIM、LPIPS(衡量首末帧条件生成对输入端点的保持能力)。 - **环境**:PyTorch 2.13、CUDA 12.9;NVIDIA H200 与 B200 集群;训练使用 FSDP2/HSDP、激活检查点与 bf16/FP32 混合精度。 —- ### 2. 质量对比实验 在固定第三方评估集上,对 8 步 VDN-H3、50 步 Dense H3 与 4 步 FastH3 进行全面对比: | 指标维度 | 关键发现 | |:—-|:—-| | **无参考质量** | 8 步 VDN-H3 在 VQAA、VQAT、Q-Align、FAST-VQA、DOVER++ 上均**匹配或略超** 50 步 Dense H3(差距范围 +0.06 至 +1.00);FastH3 则普遍低 2.70–12.74 分。 | | **运动幅度** | VDN-H3 的 RAFT mean flow 为 11.71,与 Dense H3 的 11.55 接近;FastH3 降至 9.19,运动明显减弱。 | | **FIRM-Video** | VDN-H3 在 Instruction Following(2.25 vs 2.25)、Perceptual Quality(4.45 vs 4.40)与 World Coherence(1.77 vs 1.84)上与 Dense H3 相当;FastH3 三项均更低。 | | **FL2VA 端点保真** | VDN-H3 与 Dense H3 的 PSNR 差距仅 0.18 dB,SSIM 差距 0.007,LPIPS 差距 0.011;FastH3 的 PSNR/SSIM 下降更大,LPIPS 明显升高。 | 此外,附录 A.6 补充了不同去噪预算下的质量: - **50 NFE**:VDN-H3(Stage B,未蒸馏)与 Dense H3 broadly on par,仅首末帧 LPIPS/SSIM 有轻微退化。 - **8 NFE**:与 Dense H3+Larry 八步适配器及 FastH3 v2 相比,VDN-H3 在全部 5 个无参考指标上得分最高。 - **4 NFE**:VDN-H3 仍高于 Dense+Larry 与 FastH3 v1,VQAT 领先 FastH3 v1 达 12.64 分。 —- ### 3. 效率与扩展性实验 #### 3.1 骨干网络单次前向加速 在 14.3 秒、768p 负载下,系统优化后的 VDN-H3 单次 transformer evaluation: - H200:35.35 s to 11.16 s(**3.2×**) - B200:16.0 s to 6.2 s(**2.6×**) #### 3.2 视频长度扩展 随着 latent frames 从 42 增至 102: - Softmax 注意力密度从 42.08% 降至 19.98%。 - H200 端到端加速从 10.3× 提升至 19.8×;B200 从 10.3× 提升至 16.2×(单 GPU,含 8 步蒸馏,不含分布式)。 #### 3.3 采样步数缩减与分布式推理 从 50 步 Dense H3 到最终 8 步 8-GPU 部署的渐进加速: | 配置 | GPU | NFE | 端到端延迟 (B200) | 累计加速 | |:—-|:—-|:—-|:—-|:—-| | Dense H3 | 1 | 50 | 799.6 s | 1.0× | | + VDN 骨干 | 1 | 50 | 307.9 s | 2.6× | | + 8 步蒸馏 | 1 | 8 | 49.3 s | 16.2× | | + 分布式 (8×B200) | 8 | 8 | **6.70 s** | **119.3×** | H200 上对应最终延迟为 **12.5 s**,累计加速 **141.6×**。 —- ### 4. 消融实验:内核与系统优化 在 102 latent frames 的设置下,论文对核心算子进行了“直接实现 vs 优化实现”的细粒度对比: | 优化项 | H200 延迟变化 | B200 延迟变化 | 加速比 | |:—-|:—-|:—-|:—-| | **VDA-Prep** | 18.0 ms to 1.6 ms | 17.1 ms to 3.4 ms | 11.4× / 5.1× | | **VDA-Stats** | 13.4 ms to 6.5 ms | 11.4 ms to 4.0 ms | 2.1× / 2.9× | | **VDA-Gather** | 2.0 ms to 0.3 ms | 1.6 ms to 0.2 ms | 7.2× / 7.5× | | **VDA-Epilogue** | 8.0 ms to 1.1 ms | 6.9 ms to 0.8 ms | 7.3× / 9.1× | | **Chunk-wise 扫描**(8 GPU,7 heads/rank) | 4.6 ms to 1.1 ms | 3.0 ms to 0.8 ms | 4.2× / 3.7× | | **小矩阵求逆**(融合 Gauss–Jordan) | 7.8 ms to 1.7 ms | 6.3 ms to 1.3 ms | 4.6× / 5.0× | | **Window Softmax** | 112.6 ms to 112.1 ms | 69.5 ms to 56.1 ms | ~1.0× / 1.2× | —- ### 5. 定性画廊(Gallery) 论文在图 7 中提供了五组提示词的同步帧对比,涵盖: - 电影感动作(Cinematic Action) - 超现实旅程(Surreal Journey) - 场景转换(Scene Transition) - 平面动画(Graphic Animation) - 运动动画(Animated Sports) 每组均将 50 步 Dense H3 与 8 步 VDN-H3 并排展示,以验证在大幅压缩计算量后,VDN-H3 仍能保持可比的视觉质量、时间一致性与运动模式。 Q5: 有什么可以进一步探索的点? 基于该论文的方法与实验范畴,以下方向具有进一步探索的价值: —- ### 1. 架构向更多基础模型的泛化 论文以 MiniMax H3 为实例验证了 VDN,但其混合注意力框架(局部 Softmax + 双向线性记忆 + 边界锚点)向其他视频 DiT 骨干的迁移规律尚不明晰。可探索: - 将 VDN 集成至 Wan、HunyuanVideo、CogVideoX 等不同架构时,滑动窗口尺寸、锚点策略与线性分支特征映射应如何调整; - 在非 DiT 结构(如 U-Net 或 MMDiT)中,线性记忆与跳跃连接、多尺度特征的交互方式; - 对于无明确“帧”概念的连续时间模型(如基于流匹配的无限时长生成),如何定义 VDA 的更新单元。 —- ### 2. Video Delta Attention 的理论深化与算法加速 VDA 通过求解帧级正规方程 S_t = (S_t + B_t)(I + A_t)^(-1) 实现联合更新,仍存在拓展空间: - **可扩展的逆运算**:当前在 d_k × d_k 空间求逆,若未来模型使用更大键维度,可探索低秩近似逆(如 Sherman-Morrison-Woodbury 恒等式)或迭代方法,避免显式矩阵求逆; - **与 Softmax 的谱联系**:建立 A_t 的谱分布与 Softmax 注意力核之间的定量关系,从而从理论上指导 β_t 门控的初始化或约束; - **跨帧键相关性建模**:当前 A_t 仅聚合单帧内键的相关性,是否可引入轻量级跨帧键交互(如帧间低秩投影),在不破坏线性复杂度的前提下增强长程一致性。 —- ### 3. 从头训练(Train-from-Scratch)与联合优化 论文采用“预训练模型 + 分阶段适应”的策略,这引出了两个互补问题: - **从头训练**:若直接以 VDN 架构从头训练视频基础模型,其最终质量上限是否显著高于“嫁接式”适应?线性分支的早期介入是否会改变特征学习的动态? - **蒸馏与架构的联合优化**:当前少步蒸馏(DMD2)与架构转换被解耦。若将 VDA 的门控、衰减参数纳入蒸馏目标联合优化,或设计考虑帧级循环状态的蒸馏损失,能否进一步压缩步数至 1–4 步并维持质量。 —- ### 4. 更长时长与更高分辨率的极限验证 实验集中在大约 14.3 秒、768p 的视频。对于以下场景需验证 VDA 的稳定性与质量: - **分钟级视频**:当 latent 帧数增至数百甚至上千帧时,双向扫描的数值稳定性(命题 1 的边界是否足够紧)以及边界锚点是否仍能有效锚定全局一致性; - **高分辨率(1080p/4K)**:空间 token 数 U 增大后, A_t = K_t^top Diag(β_t) K_t 的统计估计方差变化,以及小矩阵求逆 kernel 在更大 batch 下的扩展性; - **可变长生成**:当前 chunk size 固定为 5,是否可设计自适应 chunking 或动态窗口,根据内容运动强度调整局部 Softmax 与线性记忆的分配比例。 —- ### 5. 实时流式(Livestream)与边缘部署的系统优化 论文标题提及 livestream,但实验聚焦于离线生成。向真正低延迟交互场景延伸时: - **因果/半因果 VDA**:当前双向扫描要求完整序列,流式场景下需开发单向因果 VDA,同时保留有限的未来上下文(如滑动前瞻窗口); - **状态量化与 KV 压缩**:将 Quant VideoGen 等自回归视频量化技术迁移至 VDA 的循环状态 S_t ,实现 2–4 bit 状态压缩,降低显存占用以适配消费级 GPU; - **与稀疏注意力的正交叠加**:VDN 的线性分支已与 Softmax 分离,可进一步在 Softmax 分支引入 SpargeAttn 或 SageAttention3,探索“稀疏 + 线性 + 量化”的三重加速。 —- ### 6. 多模态条件下的原生 Delta 规则 当前 VDN 对文本与音频仍保留 Softmax 交互。考虑到 VDA 的核心是“模态原生”的状态更新: - 是否可为文本 token 设计类似的段落级(sentence-level)或短语级 delta 压缩,使文本条件也能以固定状态注入,彻底消除长提示词下的二次成本; - 在音视频联合生成中,视频帧与音频帧具有不同采样率,如何设计异步的跨模态 delta 记忆更新节律(multi-rate state space)。 —- ### 7. 用户感知评估与物理一致性 现有评估以自动化指标为主,未来可补充: - **大规模用户研究**:尤其在 World Coherence 与复杂物理交互(如流体、碰撞、光影)场景下,线性记忆是否引入人类可感知的时间模糊或因果错误; - **运动保真度的细粒度诊断**:RAFT mean flow 仅反映平均运动幅度,对于快速相机移动、旋转、遮挡等高频运动模式,VDA 的固定状态容量是否存在系统性平滑偏差。 —- ### 8. 自适应混合门控的学习 当前 Softmax 门控 G_S 与线性门控 G_L 为内容相关的 sigmoid,但是否存在更优的混合机制值得研究: - **数据驱动的动态路由**:根据查询内容自动选择仅使用 Softmax、仅使用线性,或两者混合,甚至可引入可微分的硬选择以跳过整条分支计算; - **层级化门控策略**:在浅层保留更多 Softmax 以维护局部纹理,在深层增强线性记忆以聚合语义与运动,探索层相关的门控初始化或正则化。 Q6: 总结一下论文的主要内容 这篇论文提出了 **Video DeltaNet (VDN)**,一种面向视频扩散模型的混合注意力架构与系统级优化方案,旨在突破长视频生成中注意力计算的二次复杂度瓶颈,同时避免直接采用线性注意力导致的质量退化。 —- ### 1. 研究动机与核心挑战 视频扩散模型在推理时需反复处理极长的时空 token 序列,其中 Softmax 注意力占据绝大部分计算开销(如在 MiniMax H3 中超过 85%)。虽然线性注意力在语言模型中已实现线性复杂度,但直接迁移至视频生成面临三重失配: - **容量失配**:固定大小的循环状态难以压缩全局视频信息(主体身份、场景布局、长程运动)而不损失细粒度交互。 - **计算单元失配**:视频扩散以**帧**为单位并行处理空间 token,而传统 delta-rule 线性注意力按**单个 token** 递归更新,导致帧内相关写入互相干扰。 - **训练动态失配**:将随机初始化的线性分支接入预训练的 Softmax 模型会扰乱已习得的残差流统计,极易破坏预训练能力。 —- ### 2. 核心方法 #### 2.1 混合注意力架构 VDN 将视频-视频注意力按时间距离划分为: - **滑动窗口 Softmax**:保留邻近帧(左右各 1 个 VAE chunk,共约 15 帧)及**边界锚点**(首末帧)的密集注意力,维护局部纹理、边界与短期运动,并为首尾帧条件生成提供全局参考。 - **双向线性记忆**:对窗口外的远距离上下文,通过前向与反向两个时间扫描分别汇总,查询时相加读数:

o_t^L = S_t q_t + S_t q_t
文本条件被压缩为状态 S_T ,两扫描均以 S_T/2 初始化,确保文本被精确计数一次。 两分支共享 QKV 投影,但拥有独立的 sigmoid 门控、RMSNorm 与输出投影,最终相加注入残差流:
Y = (G_S odot O_S) W_S^O + (G_L odot RMSNorm(O_L)) W_L^O

2.2 Video Delta Attention (VDA) VDA 将 delta rule 从 token 级提升至**帧级联合更新**。对于含 U 个空间 token 的帧,传统方法逐 token 独立修正,导致键重叠时产生冲突。VDA 定义帧级优化目标:

St = argmin_S (1) / (2)|S - S_t|_F^2 + (1) / (2)∑(u=1)^U β(t,u)|S k(t,u) - v_(t,u)|_2^2
其闭式解通过帧内键相关矩阵 A_t = K_t^top Diag(β_t) K_t 与值-键写入统计 B_t 实现联合耦合:
S_t = (S_t + B_t)(I + A_t)^(-1)
该转移满足非扩张性: | Diag(α_t)(I + A_t)^(-1) |_2 ≤ 1 ,确保继承状态不会被帧更新放大。 #### 2.3 分阶段训练适应 为将线性分支无损引入预训练模型,论文提出全程冻结原始骨干的三阶段食谱: - **A1(逐层对齐)**:独立训练每层线性分支 200 步,避免深层信号干扰。 - **A2(端到端对齐)**:联合组装所有混合层训练 500 步,修正组合误差。 - **B(LoRA 联合适应)**:添加 Q/K/V/O 的 LoRA 适配器,与线性分支及 Softmax 门控联合微调 2,000 步。 #### 2.4 少步蒸馏与推理优化 - **蒸馏**:使用类 DMD2 目标将 50 步模型蒸馏为 8 步学生,隔离架构加速与步数缩减。 - **系统优化**:设计 4 个融合 Triton Kernel(VDA-Prep/Stats/Gather/Epilogue)、chunk-wise 扫描(将 5 帧合成为单步转移)、寄存器内 batched Gauss–Jordan 小矩阵求逆、按 Ulysses 策略头切分分布式执行,以及 MXFP8 宽矩阵 GEMM 加速。 —- ### 3. 实验与结果 论文在 MiniMax H3 上实现 **VDN-H3**,并在 14.3 秒、768p 视频生成任务上进行评估: #### 3.1 质量对比 8 步 VDN-H3 在以下指标上与 50 步 Dense H3 持平或更优: - **无参考质量**:VQAA、VQAT、Q-Align、FAST-VQA、DOVER++ 全面匹配(差距 +0.06 至 +1.00)。 - **运动幅度**:RAFT mean flow 为 11.71,对比 Dense H3 的 11.55。 - **FIRM-Video**:Instruction Following(2.25)、Perceptual Quality(4.45)、World Coherence(1.77)均与基线相当。 - **FL2VA 端点保真**:PSNR 28.67 dB、SSIM 0.826、LPIPS 0.116,与 Dense H3 差距极小;而 4 步 FastH3 显著落后。 #### 3.2 效率对比(B200) | 配置 | GPU | NFE | 端到端延迟 | 累计加速 | |:—-|:—-|:—-|:—-|:—-| | Dense H3 | 1 | 50 | 799.6 s | 1.0× | | + VDN 骨干 | 1 | 50 | 307.9 s | 2.6× | | + 8 步蒸馏 | 1 | 8 | 49.3 s | 16.2× | | + 分布式 | 8 | 8 | **6.70 s** | **119.3×** | H200 上最终延迟为 12.5 s,累计加速 **141.6×**。单 GPU 上,随着 latent 帧数从 42 增至 102,VDN-H3 的端到端加速从 10.3× 提升至 16.2×(B200),验证了随视频长度增长而扩大的优势。 #### 3.3 消融实验 - **融合 Kernel**:VDA-Prep 实现 5–11× 加速,小矩阵求逆实现 4.6–5.0× 加速。 - **Chunk-wise 扫描**:在 8-GPU 头切分下,扫描延迟从 4.6 ms 降至 1.1 ms(H200)。 —- ### 4. 主要贡献 1. **混合视频注意力架构**:结合局部 Softmax、全局边界锚点与双向线性记忆,配以分支专属归一化、门控与输出投影。 2. **帧级 Delta 算子**:提出 Video Delta Attention,通过帧内联合优化与可证明的非扩张状态转移,实现视频原生的线性记忆更新。 3. **预训练模型完整适应食谱**:无需从头训练基础模型,通过分阶段教师对齐、低秩微调、少步蒸馏与系统优化,实现质量保持下的数量级加速。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Haocheng Xi,Yiming Xie,Hexu Zhao,Yiwen Zhang,Michael Liu,Thomas Creavin,Kurt Keutzer,Xiuyu Li,Zhaoyang Lv,Chenfeng Xu,Haiwen Feng

Categories:

PDF URL: https://arxiv.org/pdf/2609.20744.pdf

Arxiv URL: https://arxiv.org/abs/2609.20744

Arxiv ID: 2609.20744

CoolPaper URL: https://papers.cool/arxiv/2609.20744

Published: 2026-09-19T01:34:43.089Z

Updated: 2026-09-19T01:34:43.089Z


13. VABench: Measuring Embodied Spatial Intelligence through Visual Demonstrations, Active Perception, and Metric Control

Abstract:Spatial intelligence requires more than describing object locations. Under incomplete observation, models must identify and acquire missing evidence, interpret it in a common spatial frame, and act on it. We introduce VA-Bench to evaluate the complete observe-reason-act-revise loop. General-purpose MLLMs learn procedural context from RGB-only demonstrations, actively select camera viewpoints, issue metric Cartesian commands, and revise them from execution feedback. Models receive no privileged object poses, oracle trajectories, or learned action heads. A fixed model-agnostic controller executes only model-specified targets. VA-Bench contains 14 base task families (11 single-arm and three dual-arm), seven held-out geometry/layout variants, and a long-horizon five-object composition track. We evaluate 12 primary model conditions in three independent runs over the same 20 physically verified seeds per base task, reporting terminal success, nine trajectory-level behavioral diagnostics, and subtask progress. First, the best-performing model scores 100.0% on target localization and 78.9% on spatial relations in the annotated run. Its three-run macro-average task success is only 53.93+/-3.17%. Second, active camera control significantly improves task success over passive multi-view observation. In one matched comparison, success rises from 27.86% to 57.50%. Third, held-out geometric transfer can reduce task success by over 30 percentage points. No model completes a strict long-horizon episode, despite substantial partial progress. VA-Bench thus tests whether general-purpose MLLMs can turn visual demonstrations and actively acquired evidence into successful embodied action.

中文摘要

摘要:空间智能不仅仅需要描述物体位置。在观察不完整的情况下,模型必须识别并获取缺失的证据,将其在统一的空间框架下进行解释,并据此采取行动。我们引入了 VA-Bench 来评估完整的观察-推理-行动-修正循环。通用 MLLM 可以从仅基于 RGB 的演示中学习操作上下文,主动选择摄像机视角,发出笛卡尔坐标的度量命令,并根据执行反馈进行修正。模型不会获得任何特权对象姿态、完美轨迹或学习到的动作头。固定的与模型无关控制器仅执行模型指定的目标。VA-Bench 包含 14 个基础任务系列(11 个单臂和 3 个双臂)、7 个保留的几何/布局变体,以及一个长时间跨度的五物体组合任务。我们对每个基础任务的同一 20 个经过物理验证的种子进行三次独立运行,评估 12 种主要模型条件,并报告最终成功率、九项轨迹级行为诊断指标以及子任务进度。首先,表现最好的模型在标注运行中,目标定位得分为 100.0%,空间关系得分为 78.9%。其三次运行的宏观平均任务成功率仅为 53.93±3.17%。其次,主动摄像机控制相比被动多视角观察显著提升了任务成功率。在一次匹配对比中,成功率从 27.86% 提升至 57.50%。第三,几何保留的迁移可能使任务成功率下降超过 30 个百分点。尽管取得了明显的部分进展,但没有模型完成严格的长时间跨度任务。因此,VA-Bench 测试了通用 MLLM 是否能够将视觉演示和主动获取的证据转化为成功的具身行动。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.19554 (HTTP 429)

Authors: Zhongbo Zhang,Jiayi Jin,Yifan Wang,Zaibin Zhang,Haiwen Diao,Lijun Wang,Huchuan Lu

Categories:

PDF URL: https://arxiv.org/pdf/2609.19554.pdf

Arxiv URL: https://arxiv.org/abs/2609.19554

Arxiv ID: 2609.19554

CoolPaper URL: https://papers.cool/arxiv/2609.19554

Published: 2026-09-19T01:34:43.394Z

Updated: 2026-09-19T01:34:43.394Z


14. FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

Abstract:Modeling articulated objects from sparse monocular views is challenging because each observation reveals only partial geometry and motion evidence. Most feed-forward methods infer articulation from a single observation and therefore rely heavily on learned category-level shape priors. We present FAMOS, a feed-forward model that predicts movable-part segmentation and joint parameters from a sparse, unordered set of partial point clouds. Our model jointly reasons over multiple observations and naturally supports a variable number of inputs, including a single view. To aggregate articulation cues across observations, we introduce a Multi-state Articulation Transformer with alternating state-wise and global attention. We further propose an observed articulation span objective that supervises the motion range each part exhibits across the input observations, encouraging the model to leverage the full observation set. To overcome the limited scale and diversity of existing datasets, we introduce a procedural data generator that synthesizes self-annotated assets during training. Experiments on PartNet-Mobility, ACD, and ArtiCraft-10K demonstrate consistent improvements over both feed-forward and optimization-based baselines. Project page: this https URL

中文摘要

摘要:从稀疏的单目视图建模可旋转物体具有挑战性,因为每个观察只能揭示部分几何形状和运动证据。大多数前馈方法仅从单个观察推断关节运动,因此在很大程度上依赖于学习到的类别级形状先验。我们提出了 FAMOS,一种前馈模型,可从稀疏、无序的部分点云集合中预测可移动部件分割和关节参数。我们的模型能够对多次观察进行联合推理,并自然地支持可变数量的输入,包括单视图。为了聚合跨观察的关节提示,我们引入了多状态关节变换器(Multi-state Articulation Transformer),采用交替的状态级和全局注意机制。我们进一步提出了可观测关节跨度目标(observed articulation span objective),对每个部件在输入观察中表现的运动范围进行监督,鼓励模型利用完整的观察集合。为克服现有数据集规模和多样性有限的问题,我们引入了一个程序化数据生成器,在训练过程中合成自注释资产。在 PartNet-Mobility、ACD 和 ArtiCraft-10K 上的实验表明,相较于前馈和基于优化的基线方法,我们的方法均有持续改进。项目页面:此 https URL

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*从稀疏单目观测中对关节物体(articulated objects)进行前馈式3D建模\*\*的问题,具体针对现有方法在以下方面的局限性: - \*\*输入要求过于苛刻\*\*:基于优化的方法通常需要密集的多视图扫描或每个关节状态的完整观测,并依赖耗时的逐对象优化,难以扩展;基于视频的方法则依赖时序跟踪与连续运动,在遮挡或多部件运动时容易累积误差。 - \*\*单观测前馈方法的固有歧义性\*\*:现有前馈方法多从单一观测推断关节属性,缺乏实际运动证据,只能依赖学习到的类别级形状先验,导致对未见几何形状或部分输入的泛化能力较差。 - \*\*多状态观测利用不足\*\*:当存在同一物体在不同关节状态下的多个观测时,现有前馈方法通常只能独立处理各观测,无法跨观测聚合运动线索以消除歧义。 - \*\*训练数据规模与多样性受限\*\*:现有带标注的关节物体数据集规模较小,限制了模型的泛化能力。 为应对上述挑战,论文提出 \*\*FAMOS\*\*,其核心贡献在于: - 接受\*\*稀疏、无序、可变数量的部分点云\*\*作为输入,在单次前向传播中联合预测可动部件分割与关节参数; - 设计\*\*多状态关节变换器(Multi-state Articulation Transformer)\*\*,通过交替的状态内注意力和全局注意力,聚合跨观测的几何与运动证据; - 引入\*\*观测关节跨度目标(observed articulation span objective)\*\*,强制模型利用输入集合中呈现的运动范围,而非仅依赖形状先验; - 提出\*\*程序化资产生成管线\*\*,在训练时即时合成带自标注的关节物体,显著扩充训练数据的规模与多样性。 Q2: 有哪些相关研究? 根据论文第2节,相关研究可归纳为以下四个方向: ### 1. 从密集多视图输入重建关节物体 此类方法通常在测试时对每个对象进行优化,依赖神经隐式表示或3D高斯溅射,从同一物体在两个关节状态下的密集多视图捕捉中恢复对象特定的关节模型。 - \*\*代表性工作\*\*:PARIS

34
、基于神经隐式表示的方法
56
、ArticulatedGS
15
、ReArtGS
58, 59
、FreeArt3D
4
、ArtGS
39
、SplArt
33
、GaussianArt
48
等。 - **主要局限**:需要密集观测,且逐对象优化计算昂贵,限制了可扩展性与实用性。 - **与FAMOS的区别**:FAMOS是前馈式方法,仅需稀疏、部分点云即可在单次前向传播中完成推理,无需逐对象优化。 ### 2. 从交互视频建模关节结构 这类方法利用时序观测(如4D点云序列、单目视频或第一人称交互视频)估计关节属性。 - **代表性工作**:基于4D点云的 ReArt

37
;基于单目视频的 FreeArtGS
7
、VideoArtGS
38
、ReActo
49
;基于第一人称交互视频的 iTACO
45
、EgoFun3D
44
、Articulated Object Estimation in the Wild
57
等。 - **主要局限**:依赖时间有序的连续运动,在遮挡或多部件运动时易出现误差累积;部分方法仍需逐实例优化或级联现成的跟踪/分割模块。 - **与FAMOS的区别**:FAMOS处理的是**无序**的稀疏观测,各状态间可存在任意关节变化,不要求连续运动或时序顺序。 ### 3. 前馈式关节建模 #### 单输入方法 从单一图像或点云直接预测关节属性,但因单观测不含运动证据,严重依赖学习到的类别级形状先验。 - **代表性工作**:基于点云的 FlowBot3D

10
、CAPT
13
、ScrewNet
21
、Particulate
30
;基于图像的 URDFormer
5
、CARTO
18
、Singapo
35
、MonoArt
29
、URDFAnything
31
等。 #### 多输入方法 尝试利用多个关节状态观测,但施加了较强假设: - **Ditto**

23
:要求完整几何且仅处理单个可动部件; - **ArtSplat**
28
:假设每个状态有多视图输入; - **Sim2Art**
1
与 **PokeNet**
16
:处理4D点云序列,但要求时间有序且运动连续; - **ART**
32
:假设已知部件数量且输入状态数固定。 - **与FAMOS的区别**:FAMOS支持**可变数量**的输入观测,无需完整几何、无需已知部件数,也不要求时序顺序。 ### 4. 关节学习的训练数据 现有带标注的关节物体数据集规模与多样性有限,如 PartNet-Mobility

60
、GRScenes
51
、ACD
19
等。为缓解数据稀缺,近期研究探索程序化或代理式生成。 - **代表性工作**:程序化生成管线
24
、基于大语言模型代理的 ArtiCraft-10K
61
等。这些方法的部件与关节标注按构造已知,无需人工标注。 - **与FAMOS的区别**:FAMOS引入了一套轻量级参数化生成管线,可在训练时即时合成带自标注的资产,以极低开销提供 virtually unlimited 的数据流,且仅生成几何与标注,无需纹理或文件导出,吞吐量更高。 Q3: 论文如何解决这个问题? 论文通过 **FAMOS** 框架从算法与数据两个层面解决稀疏观测下的关节物体建模问题。具体解决方案可分为以下五个核心部分: ### 1. 问题形式化与输入表示 该方法将输入定义为一个小规模、无序且可变数目的观测集合 X = Xs(s=1)^(S) ,其中每个观测 Xs = x(s,i)(i=1)^(N) ⊂ R^3 均为部分点云(partial point cloud)。模型无需预先知道可动部件数量,且支持 S=1 的单状态输入。所有点云位于由3D基础模型提供的共享坐标系中。 ### 2. 多状态关节变换器(Multi-State Articulation Transformer) 为了从多个不完整、无序的观测中聚合运动与几何线索,论文设计了一种交替注意力机制: - **点编码**:每个观测独立输入冻结的 PartField 编码器,得到每点特征 f(s,i) ∈ R^(Df) ,并与几何嵌入 $g\{s,i} =

γ(x(s,i)); γ(n(s,i))
$(坐标与法向的正弦编码)拼接后线性投影为 token:
z(s,i) = φ([f(s,i);, g(s,i)]) ∈ R^(D).
关键设计在于不添加观测索引或状态嵌入,从而使模型在推理时可灵活处理任意数量的输入。 - 可学习部件查询(Part Queries):模型维护 K 个可学习查询 Q = q_k
(k=1)^(K) ,作为候选部件的抽象表示,不绑定固定语义身份。 - 交替注意力层(共 L 层): - State-wise Attention:对每个观测内部的点 token 独立执行自注意力,使其聚合自身部分点云的几何上下文;同时部件查询之间进行自注意力,协调各查询所代表的部件分配。 - Global Attention:将更新后的查询与所有观测的点 token 拼接为单一序列,执行全局自注意力。这使得查询可从所有点中收集证据,更重要的是允许不同观测的点 token 直接交互,从而建立跨观测的对应关系。这与先前仅通过查询-点交叉注意力传递信息的架构有本质区别。 - 预测头: - 分割头:计算每点-每查询的匹配分数 $c(s,i,k) = h(mask)(
z(s,i);, q_k
) ,经 softmax 得到跨状态一致的部件分配。部件数量 P 由实际分配到点的查询数自动确定。 - 关节参数头:每查询预测关节类型 j_k ;对旋转关节回归 Plücker 坐标 ell_k = (a_k, m_k) ∈ R^6 ,从中恢复单位轴 a_k/|a_k| 与轴上原点 o_k = (a_k × m_k)/|a_k|^2 ;对平移关节回归单位方向 d_k ∈ R^3 。 ### 3. 观测关节跨度目标(Observed Articulation Span) 为防止模型仅依赖单观测的几何先验而忽略跨观测运动证据,论文引入一个辅助监督目标。设 θ
(s,p) 为部件 p 在观测 s 中的真实关节值, V_p$ 为该部件可见的观测集合,则观测关节跨度定义为:

Deltap = max(s ∈ Vp) θ(s,p) - min(s ∈ V_p) θ(s,p), quad |Vp| ≥ 2.
该量以弧度(旋转)或物体归一化单位(平移)度量,仅依赖于输入集合的具体构型,而与任意规范静止状态无关。预测 Delta_p 要求模型必须在所有观测中一致地定位同一部件并推断其相对构型,从而强制聚合跨状态证据。该目标通过 ell_1 损失 L
(span) 监督。 ### 4. 训练目标与匹配策略 由于查询无固定身份,需先通过匈牙利算法进行预测与真值的二分匹配。匹配基于所有观测上的分割对数似然最大化:

π = argmax(π) ∑(s=1)^(S) ∑(i=1)^(N) log softmax(c(s,i))(π(Y_s,i)).
总损失为各任务的加权和:
L = λ
(seg)L(seg) + λ(type)L(type) + λ(rev)L(rev) + λ(pris)L(pris) + λ(span)L_(span),
其中包含分割交叉熵、关节类型交叉熵、旋转关节 Plücker 坐标 ell_1 损失、平移关节方向 ell_1 损失,以及观测跨度 ell_1 损失。 ### 5. 程序化训练数据生成 为克服现有数据集规模与多样性不足的问题,论文构建了一个参数化资产生成管线: - **即时合成**:在训练过程中通过确定性种子在内存中即时生成关节物体,无需纹理或文件导出,平均耗时仅约 3 ms/物体。 - **可扩展性**:物体由六种解析基元(长方体、圆柱、空心圆柱、半环面、球体、带孔面板)组合而成,涵盖 15 个物体族(如铰链柜、抽屉柜、门、笔记本电脑、剪刀等),每实例随机化尺寸、部件数量( 1 – 8 个可动部件)及关节位置。 - **精确自标注**:由于部件与关节均为解析放置,分割掩码与关节参数按构造已知,无需人工标注。 训练采用**两阶段策略**: 1. **预训练**:仅在程序化生成数据上训练 50 k 步; 2. **微调**:以 1:1 比例混合程序化数据与现有数据集(PartNet-Mobility、GRScenes)继续训练 80 k 步。 通过上述设计,FAMOS 将关节建模从依赖静态形状先验转变为基于**观测到的运动证据**进行推理,同时借助程序化生成大幅扩展了训练分布,从而提升了在稀疏、部分、可变输入下的泛化能力。 Q4: 论文做了哪些实验? 论文在第4节及补充材料中开展了系统的实验验证,涵盖定量评估、定性对比、消融分析与计算效率等方面。以下是主要实验内容: ### 1. 实验设置与基准 **评估数据集** - **PartNet-Mobility**:测试集含76个物体、7个类别,用于评估域内性能。 - **ACD**:含354个来自多个来源的物体,几何与关节结构更复杂,用于评估跨数据集泛化。 - **ArtiCraft-10K**:从中选取6个类别共180个物体,测试对AI生成资产的泛化能力。 **对比方法** - **前馈基线**:将 Particulate

30
重新训练以支持多状态部分点云输入,作为最直接的方法对比。 - **优化基线**:ReArt
37
(从时序4D点云拟合运动学模型)与 ArtGS
39
(基于3D高斯溅射的两状态多视图重建),二者均享有比 FAMOS 更稠密、更有结构的输入。 **评估指标** - **分割**:在 IoU ≥ 0.5 条件下报告精确率(P)、召回率(R)与 F1。 - **运动估计**:采用分层 F1 指标——M(正确关节类型)、MA(M + 轴角误差 <5^circ )、MAO(MA + 原点误差 <0.05 物体尺度);同时报告平均轴角误差(AE)、原点误差(OE)及匹配部件数(#)。 ### 2. 主要定量结果 \*\*可动部件分割(表1)\*\* 在 S=2 输入状态下,FAMOS 在所有三个基准上均优于所有基线。在 PartNet-Mobility 上 F1 达到 98.4% ,接近性能上限;在更具挑战性的 ACD 与 ArtiCraft 上,相对 Particulate 分别提升 28.2 与 15.9 个 F1 点,且优化基线均低于 60 F1。 \*\*运动估计(表2)\*\* 在 MAO 严格标准下,FAMOS 在 PartNet-Mobility、ACD、ArtiCraft 上分别达到 98.4% 、 64.5% 、 90.0% ,相较 Particulate 提升 8.1 、 27.8 、 21.5 个百分点;优化基线在所有数据集上均低于 40% 。同时,FAMOS 的 AE 与 OE 更低,且匹配部件数显著更多(如在 ACD 上匹配 947 个部件,对比 Particulate 的 572 个)。 \*\*单状态性能(表3)\*\* 即使仅输入 S=1 个观测,FAMOS 在所有基准的分割与运动估计指标上仍优于重新训练的单状态 Particulate,表明模型在利用运动证据的同时,也学到了鲁棒的物体中心先验。 ### 3. 定性结果 \*\*合成数据可视化(图5)\*\* FAMOS 能更可靠地识别可动部件并准确估计关节轴,基线则更易出现欠分割、过分割或关节轴偏移。 \*\*真实世界泛化(图1、图6、图D.1)\*\* 利用 SAM2 获取掩码、VGGT- Omega 重建点云后,仅在合成数据上训练的 FAMOS 能够泛化到随意拍摄的真实物体,正确预测部件分割与关节轴。 ### 4. 消融实验与分析 \*\*模型组件(表4、图7a)\*\* - \*\*全局注意力\*\*:将其替换为寄存器注意力(Register Attention)后,PartNet-Mobility 与 ACD 的 MAO 分别下降 2.2 与 8.1 点,证明直接跨观测点级交互对建立对应关系至关重要。 - \*\*观测关节跨度损失\*\*:移除 L_(span) 后,MAO 在 PartNet-Mobility 与 ACD 上分别下降 1.3 与 5.7 点,说明该损失能有效防止模型依赖单观测捷径。 \*\*训练数据策略(表5、表G.1)\*\* - 仅使用精选数据集时,ACD 上 MAO 为 47.3% 。 - 加入程序化数据预训练后,MAO 提升至 58.2% 。 - 第二阶段以 1:1 混合程序化与精选数据,MAO 进一步达到 64.5% 。补充材料中的混合比例消融显示,平衡混合在零样本 ACD 上表现最佳。 \*\*输入状态数量(图7b、图7c)\*\* 在 ACD 上,从 S=1 增至 S=2 带来最大性能跃升;继续增加观测可带来渐进提升,直到性能饱和。值得注意的是,即使训练时最多使用 S=4 ,推理时 S>4 也不会导致性能下降,表明模型对未见的更大输入集合具有外延能力。图7c展示单观测可能存在几何歧义,第二观测通过暴露运动消除歧义。 **计算效率与可扩展性(表B.1、图C.1)** - **运行时间**:在单张 NVIDIA RTX 5090 上,FAMOS 推理仅需 0.1 s/物体,与 Particulate 相当,比 ReArt( 182 s)与 ArtGS( 297 s)快约 3000 倍。 - **可扩展性**:在 S=2, N=2048 时延迟为 65.6 ms,显存 1.56 GiB;即使在 S=12, N=8192 (约 98 K 点 token)的极限测试下,延迟 1.20 s、显存 10.66 GiB,仍保持实用性。 **观测关节跨度评估(表E.1、表E.2)** 在双状态设置下,FAMOS 的跨度预测误差在 PartNet-Mobility 上约为 1.57^circ (旋转)与 0.0067 (平移),显著优于基于 Particulate + 刚性配准的后处理基线(旋转 5.92^circ ,平移 0.0412 ),验证了模型对输入间运动变化的直接推断能力。 ### 5. 局限性与失败案例(图F.1) 论文进一步讨论了以下局限: - 训练分布外(如未见过的几何类别)的物体上性能下降; - 相对于整体物体尺寸非常小的可动部件难以可靠分离; - 当上游3D重建质量极差或噪声严重时预测失效。 Q5: 有什么可以进一步探索的点? 基于论文的局限性与讨论,以下几个方向值得进一步探索: - **扩展运动学结构的复杂度** 当前方法聚焦于深度为一的运动学树(每个可动部件直接连接至静态基座)。未来可将其拓展至具有多级连杆与分支的深层关节结构,例如多节机械臂或嵌套抽屉柜,以覆盖更广泛的实际物体。 - **扩充程序化数据的类别与多样性** 尽管程序化生成器已显著提升训练数据的规模,其覆盖的物体族与几何多样性仍远小于通用物体数据集。引入更多样的基元组合、参数分布,或结合大语言模型代理(agentic generation)自动设计新型关节物体,有望进一步缩小仿真与现实的分布差距。 - **提升微小部件与严重遮挡场景的鲁棒性** 论文指出,当可动部件相对于整体物体过小,或存在大量遮挡时,模型难以可靠分离部件。未来可研究多尺度特征融合、高分辨率局部注意力,或结合主动视角规划以缓解遮挡带来的信息缺失。 - **超越单自由度关节** 现有模型仅处理一自由度旋转或平移关节。将其推广到更高自由度关节(如万向节、球关节)以及复合运动模式,是通向通用关节物体理解的必要步骤。 - **融合外观与物理属性** 程序化生成管线已支持纹理与PBR材质导出,但当前训练仅利用几何信息。联合建模外观、材质与关节运动,可支持更完整的数字孪生构建,并有助于在缺乏深度信息时利用RGB线索进行推理。 - **结合时序信息与主动交互** 虽然FAMOS专为无序稀疏观测设计,但在视频或连续交互场景中融入时序一致性约束,可能提升动态遮挡下的稳定性。此外,结合机器人主动交互(interactive perception)策略,通过物理操作揭示隐式关节,可进一步解决纯视觉观测中的固有歧义。 - **面向极端噪声与开放世界的域自适应** 模型在训练分布外的物体类别或严重损坏的上游重建结果上性能下降。探索领域自适应、测试时增强,或在开放世界设置中逐步扩展部件词汇表,将有助于提升真实场景下的可靠性。 Q6: 总结一下论文的主要内容 该论文提出 **FAMOS**,一种从稀疏、无序且可变数目的部分点云观测中,以单次前馈传播联合预测关节物体可动部件分割与运动学参数的方法。其核心内容可概括如下: - **问题定义与动机** 现有基于优化的关节物体重建方法通常依赖密集多视图扫描与耗时的逐对象优化,难以扩展;而现有前馈方法多从单一观测推断关节属性,缺乏实际运动证据,只能依赖类别级形状先验,导致对未见几何与部分输入的泛化能力差。此外,即使存在多状态观测,现有前馈方法也往往独立处理各观测,无法跨视图聚合运动线索。 - **多状态关节变换器(Multi-State Articulation Transformer)** 模型接收 S 个部分点云( S 可变,包括 S=1 ),通过冻结的 PartField 编码器与几何嵌入将每观测独立编码为点 token。网络由 L 层变换器构成,每层交替执行: - **State-wise Attention**:对每个观测内部的点 token 独立做自注意力,聚合局部几何上下文; - **Global Attention**:将所有观测的点 token 与可学习的部件查询拼接为统一序列进行全局自注意力,使不同观测中的点可直接交互,从而建立跨状态对应关系。 部件查询在每个状态间共享,通过分割头输出跨状态一致的部件分配,并通过独立头部预测关节类型、旋转关节的 Plücker 坐标 ell=(a,m) 或平移关节方向 d 。 - **观测关节跨度损失(Observed Articulation Span)** 为避免模型仅依赖单观测几何捷径,论文引入辅助监督目标:

Deltap = max(s∈ Vp)θ(s,p) - min(s∈ V_p)θ(s,p)
其中 θ_(s,p) 为部件 p 在观测 s 中的真实关节值, V_p 为该部件可见的观测集合。该跨度仅取决于输入集合,无法从单一观测推断,从而强制模型在所有输入中一致定位部件并聚合运动证据。 - **程序化训练数据生成** 为缓解现有数据集规模与多样性不足的问题,论文设计了一套参数化资产生成管线,可在训练时即时合成带有精确自标注的关节物体。资产由六种解析基元组合而成,涵盖 15 个物体族。训练采用两阶段策略:先在纯程序化数据上预训练,再以 1:1 比例混合程序化数据与现有数据集(PartNet-Mobility、GRScenes)继续训练。 - **实验与结果** 在 PartNet-Mobility、ACD 与 ArtiCraft-10K 上的评估表明: - 分割 F1 相对最强前馈基线提升最多达 64.5% ; - 运动估计 MAO F1 提升最多达 75.7% ; - 推理速度较优化方法快近 3,000 倍; - 仅在合成数据上训练的模型即可泛化到真实世界随意采集的图像。 消融实验验证了全局注意力、观测关节跨度损失及程序化数据混合策略对性能的关键贡献,并显示增加输入观测数(尤其是从 S=1 到 S=2 )可显著提升估计精度。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Kevin Qu,Tao Sun,Massimiliano Viola,Liyuan Zhu,Zhizhuo Zhou,Sayan Deb Sarkar,Konrad Schindler,Iro Armeni

Categories:

PDF URL: https://arxiv.org/pdf/2609.20817.pdf

Arxiv URL: https://arxiv.org/abs/2609.20817

Arxiv ID: 2609.20817

CoolPaper URL: https://papers.cool/arxiv/2609.20817

Published: 2026-09-19T01:34:44.271Z

Updated: 2026-09-19T01:34:44.271Z


15. Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model

Abstract:Recent Omni-Modal Generative Models (Omni-Models) have advanced content generation toward unified modeling of text, images, video, and audio. MiniMax-H3 exemplifies this transition by combining multimodal context understanding with joint audio-visual generation in a shared latent framework. Its unified architecture raises a fundamental question: Can multimodal alignment improve the model’s world reasoning, and what new evaluation paradigms do omni-modal inputs enable? To investigate this question, this work introduces a comprehensive evaluation framework organized around four complementary dimensions of physical world reasoning. Unlike existing evaluation frameworks for video generation and world models, which are often constrained by limited input modalities and evaluation settings where prompts closely match the target video content, our evaluation is specifically designed to exploit the multimodal inputs of Omni-Model. We construct a diverse set of novel tasks that require models to integrate complementary information across modalities. Specifically, we consider four scenarios, including implicit prompts paired with multiple frames, audio-image, prefix-videos, and audio-video inputs. Every single modality provides only partial evidence about the underlying event, requiring the model to jointly reason over the complementary semantic cues to infer latent event states and future dynamics. Across 517 evaluation instances, MiniMax-H3 achieves an overall success rate of 41.97%. Video-based Decision Reasoning yields the highest success rate at 56.00%, while Audio-based Disambiguation Reasoning is the weakest, reaching only 27.40%. These results indicate that effective multimodal integration remains key to fully exploiting the benefits of diverse input modalities. The project is available at this https URL.

中文摘要

摘要:近期的全模态生成模型(Omni-Models)在内容生成方面取得了进展,推动了文本、图像、视频和音频的统一建模。MiniMax-H3 通过在共享潜空间框架中结合多模态上下文理解与联合音视频生成,体现了这一转变。其统一的架构提出了一个根本性问题:多模态对齐是否可以提升模型的世界推理能力,以及全模态输入能够启用哪些新的评估范式?为探讨这一问题,本工作提出了一个全面的评估框架,围绕物理世界推理的四个互补维度进行组织。与现有的视频生成和世界模型评估框架不同,这些框架通常受限于有限的输入模态和提示与目标视频内容高度匹配的评估设置,我们的评估特别设计用于充分利用 Omni-Model 的多模态输入。我们构建了一组多样的新任务,要求模型整合跨模态的互补信息。具体而言,我们考虑四种场景,包括与多帧隐式提示配对、音频-图像、前缀视频以及音频-视频输入。每种单一模态仅提供了关于底层事件的部分证据,模型需要联合推理互补语义线索,以推断潜在事件状态和未来动态。在 517 个评估实例中,MiniMax-H3 总体成功率为 41.97%。基于视频的决策推理成功率最高,为 56.00%,而基于音频的消歧推理最弱,仅为 27.40%。这些结果表明,有效的多模态整合仍然是充分利用多样化输入模态益处的关键。该项目可通过此 https URL 获取。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*全模态生成模型(Omni-Modal Generative Models)在物理世界推理能力评估方面的核心问题\*\*。具体而言,其研究目标与贡献可归纳为以下几个层面: ### 1. 核心科学问题:多模态对齐能否促进物理世界推理? 论文针对 MiniMax-H3 等全模态模型的统一架构,提出一个根本性问题:\*\*多模态对齐是否能够提升模型对物理世界的推理能力?\*\* 现有模型虽能接收文本、图像、视频、音频的任意组合输入,但"支持多模态输入"并不等同于"实现跨模态推理"。该工作试图检验模型是否能超越单一模态的显式指令,通过整合分布式证据来推断潜在的物理事件状态与未来动态。 ### 2. 现有评估范式的局限性 论文指出,当前视频生成与世界模型基准(如 VBench、WorldModelBench)存在显著不足: - \*\*输入模态受限\*\*:大多仅支持文本-图像条件生成,未能充分利用全模态输入的潜力。 - \*\*提示与目标高度匹配\*\*:现有评估中,提示通常显式描述期望输出,额外模态仅作为冗余或局部条件。模型无需建立输入间的跨模态关联即可生成看似合理的结果。 - \*\*无法评估推断能力\*\*:现有基准询问的是"模型能否生成被告知的内容",而非"模型能否从多模态线索中推断出应生成什么"。 ### 3. 隐式全模态推理评估框架 为解决上述问题,论文引入了一种\*\*基于隐式生成的评估框架\*\*。其核心思想是: - \*\*故意省略关键语义\*\*:文本提示中不直接说明目标事件,而是将关键信息分散到多个输入模态中。 - \*\*分布式互补证据\*\*:每个模态(如音频、图像前缀、多视角视频)仅提供部分、不完整的证据,模型必须联合解读、对齐跨模态线索,推断隐含的事件语义,并通过视频生成输出其推理结果。 - \*\*行为化读数\*\*:生成的视频成为模型推理过程的"行为读数"(behavioral readout),通过检验输出与多模态证据的一致性来判断模型是否恢复了缺失语义。 ### 4. 四维物理世界推理评估 该框架具体 instantiated 为四个互补的评估维度,分别检验不同的跨模态推理机制: - \*\*多视角空间推理(MSR)\*\*:检验模型能否关联不同视角下的实体与空间关系。 - \*\*基于音频的消歧推理(ADR)\*\*:检验声学证据能否解决静态视觉观察中的语义歧义。 - \*\*基于视频的决策推理(VDR)\*\*:检验模型能否从前缀视频的动态中推断合理的事件延续或响应。 - \*\*音视频综合推理(AVIR)\*\*:检验模型能否联合解读时序相关的视觉与听觉证据以进行视频延续或修正。 简言之,该论文试图建立的并非传统的"生成质量"评估,而是一种\*\*面向物理世界推理的"证据整合与隐式推断"评估范式\*\*,以揭示当前全模态模型在从异构观测中恢复潜在物理状态方面的真实能力与根本局限。 Q2: 有哪些相关研究? 根据论文第2节(Related Work)及相关引用,现有相关研究主要分布于以下三个方向: ### 1. 视频生成评估(Video Generation Evaluation) 该方向关注生成视频的质量、语义一致性与物理合理性,可进一步细分为: - \*\*感知质量与语义对齐\*\*:如 VBench

Huang et al., 2024
、Zhao et al.
2024
、Zheng et al.
2026
等,聚焦视频生成的视觉保真度与文本指令的语义匹配程度。 - **时间组合性**:如 TC-Bench
Feng et al., 2024
、Zhao et al.
2026c,b
,评估模型对时序动作与动态组合的理解。 - **物理忠实性**:如 VideoPhy
Bansal et al., 2025, 2026
、PhyGround
Lin et al., 2026
、Zhao et al.
2026a
、Zhang et al.
2026c
,考察生成视频是否符合物理常识。 - **物理预测与定律**:Physics-IQ
Motamed et al., 2026
在不披露未来结果的前提下测试物理预测能力;Morpheus
Tragoudaras et al., 2025
将生成动态与真实物理系统进行比对。 - **多模态与跨模态评估**:AV-Phys Bench
Cui et al., 2026
检验生成音视频流内部及跨流的物理一致性;ROVER
Liang et al., 2026
与 OmniVideoBench
Li et al., 2026a
分别通过文本-图像生成与音视频问答研究跨模态推理。 ### 2. 通过视频生成进行推理(Reasoning through Video Generation) 该方向利用视频生成作为任务求解的行为读数,评估模型的零样本推理与规划能力: - **零样本能力**:Wiedemer et al.

2025
揭示了视频模型具备零样本学习与推理的潜力。 - **专项推理基准**:VideoThinkBench
Tong et al., 2026
、TiViBench
Chen et al., 2025
与 Gen-ViRe
Liu et al., 2025a
分别探测视觉推理、符号推理与规划能力。 - **隐式规则与因果推理**:RISE-Video
Liu et al., 2026
显式测试隐式世界规则推理;Zhang et al.
2026b
考察因果感知与生成后果之间的差距。 ### 3. 世界模型评估(World-Model Evaluation) 该方向检验生成环境能否保持空间结构并对交互做出连贯响应: - **应用驱动评估**:WorldModelBench

Li et al., 2026b
评估指令遵循与物理遵循能力;General-Level
Fei et al., 2025
从通用人工智能角度讨论模型能力的进阶。 - **场景连贯性与控制对齐**:WorldScore
Duan et al., 2025
在指定相机轨迹下评估连续场景生成;WorldMark
Xu et al., 2026
与 Omni-WorldBench
Wu et al., 2026
评估世界一致性、控制对齐及动作依赖的状态转换。 ### 4. 与现有工作的区别 上述基准大多依赖**显式提示**(prompt explicitly describes the expected output),额外模态往往作为冗余或局部条件,模型无需建立跨模态关联即可生成合理结果。相比之下,该论文提出的框架通过**隐式多模态条件**(implicit omni-modal inputs)迫使模型必须从分布式、互补的观测证据中推断潜在事件,进而考察其是否具备真正的物理世界推理能力,而非仅仅忠实渲染被明确告知的内容。 Q3: 论文如何解决这个问题? 论文通过构建一套**面向隐式多模态推理的评估框架**来解决该问题。该方案不追求改进模型训练,而是通过精心设计的任务与协议,诊断现有全模态生成模型是否能真正整合跨模态证据进行物理世界推理。具体解决路径如下: —- ### 1. 提出隐式全模态生成评估范式 核心思想是**将关键事件语义从文本提示中故意省略,并将其分散到多个输入模态中**。每个模态仅提供关于同一物理事件的部分、不完整证据,模型必须对齐并联合解读这些观测,推断潜在的事件状态,再通过视频生成输出其推理结果。 形式化地,给定任务提示 q 与多模态观测 x ,模型生成输出视频:

Y sim pθ(Y mid q, x)
其中 p
θ 为 MiniMax-H3 诱导的条件分布。文本提示 q 仅说明生成操作(如”生成连续场景”),而不透露目标推断本身。生成的视频 Y 成为模型推理过程的”行为读数”,通过检验其是否满足多模态证据共同支持的语义约束,即可评估模型的推理能力。 —- ### 2. 设计四个互补的物理世界推理任务 为系统考察不同维度的跨模态整合能力,论文构建了四个评估场景: - **多视角空间推理(MSR)**:给定 K 个不同视角的图像 I = I^((k))_(k=1)^K ,模型需建立跨视角对应关系,推断单张图像无法完全观测的空间结构与协调动作:

Y(MSR) sim pθ(Y mid q, I)

  • **基于音频的消歧推理(ADR)**:给定一张存在多种语义解释的静态图像 I 与提供判别性证据的音频 A ,模型需利用声学线索消除视觉歧义,生成与双模态一致的视频:
    Y(ADR) sim pθ(Y mid q, I, A)
  • **基于视频的决策推理(VDR)**:给定前缀视频 V(1:T) = (V_1, dots, V_T) ,模型需从观测到的运动、状态变化与交互中推断合理的事件延续或响应:
    Y
    (VDR) sim pθ(Y mid q, V(1:T))
  • **音视频综合推理(AVIR)**:给定视频 V 与音频 A (可能未时序对齐),模型需联合解读视觉动态与听觉证据,进行视频延续或基于口语约束的编辑修正:
    Y(AVIR) sim pθ(Y mid q, V, A)
    —- ### 3. 构建专家验证的评估数据集 论文建立了一套包含 **517 个实例、涵盖 4 个场景与 29 个子类别** 的评估集,数据构建流程包含以下环节: - **多模态源收集**:整合真实数据(如 HiFi-UMI-2K、FSD50K、LLaVA-Video-178K)与合成数据(ChatGPT Voice、Seedance 2.0 生成内容),覆盖家庭操作、动物行为、物理交互、交通场景等。 - **隐式提示构建**:利用 ChatGPT 与 Qwen3 生成候选提示,再由专家编辑,遵循两项准则:(1)文本本身不得披露目标解释;(2)多模态输入必须共同提供足够证据以推断生成目标。 - **迭代专家审查**:每个条件-提示对经过 10 轮专家审查,从四个维度验证质量: 1. **场景复杂度**:包含足够的任务相关对象、关系或动态; 2. **推理丰富度**:满足目标需要时空、物理或语义推断,而非直接复述提示; 3. **条件对齐**:输入共同支持标注目标,音视频之间的故意不一致定义了编辑任务; 4. **提示隐式性**:提示不陈述目标推断,但明确指定任务。 —- ### 4. 建立人工评估协议 由于同一输入可能对应多种合理的视觉输出,论文采用**基于任务要求的二元人工评估**,而非与单一参考视频比对: - **评估主体**:三位专家独立评判,再交叉检查。 - **任务特定标准**: - MSR:检查生成视频是否保持了输入视角共同要求的空闩关系与协调动作; - ADR:验证生成事件是否与提供的音频一致; - VDR:判断延续是否合理反映了观测动态的潜在后果; - AVIR:评估音频内容是否在相关视觉内容中得到正确体现。 - **量化指标**:采用成功率(Success Rate, SR):

SR(D) = (100) / (|mathcalD)| ∑_(i ∈ D) s_i
其中 s_i ∈ 0, 1 为二元标签,表示第 i 个样本是否满足对应任务条件。 —- ### 5. 实验诊断与失败模式分析 以 MiniMax-H3 为测试平台,论文不仅报告总体与细分类型的定量结果(总体 SR 为 41.97%),还通过定性与失败案例分析,识别出当前模型的具体瓶颈: - **证据锚定错误**:模型识别了合理事件,但将条件证据关联到错误的实体或动作; - **事件实现不完整**:生成场景包含相关对象,但未实例化输入所暗示的交互; - **物理与构型违反**:违背接触动力学、几何约束或有效状态转移; - **时序状态不一致**:未保持前缀视频中已建立的对象状态与运动趋势。 通过这些分析,论文将”全模态输入支持”与”可靠的多模态推理”区分开来,明确了当前模型在跨模态证据整合方面的具体缺陷,为后续全模态系统的改进提供了方向。 Q4: 论文做了哪些实验? 论文围绕 MiniMax-H3 开展了一系列实验,旨在检验其基于多模态输入进行物理世界推理的能力。实验涵盖定量评估、定性分析及失败模式归纳,具体内容如下: ### 1. 评估数据与覆盖范围 实验基于一个包含 **517 个评估实例** 的专家验证数据集,覆盖四个推理场景与 29 个子类别: - **多视角空间推理(MSR)**:200 个实例,10 个子类别(如变形、清洁、装配、穿线等) - **基于视频的决策推理(VDR)**:100 个实例,8 个子类别(如人类、卡通、动物、交通、物理、记忆、谜题、合成) - **基于音频的消歧推理(ADR)**:146 个实例,6 个子类别(如发声、警报、音乐、机械、接触、自然) - **音视频综合推理(AVIR)**:71 个实例,5 个子类别(如活动、动画、制作、动物、线索) 数据来源包括真实采集与合成生成两部分: - **真实数据**:HiFi-UMI-2K、VISTA-UMI5K、HuMI-Unsheathe、Hy-Embodied-0.5-VLA-Data、10Kh-RealOmin-OpenData、LLaVA-Video-178K、FSD50K、ESC-50 等; - **合成数据**:ChatGPT Voice 生成的音频,以及 Seedance 2.0 生成的视频。 ### 2. 评估协议与指标 **人工评估流程**: - 三位领域专家独立评估每个生成视频,随后进行交叉核验; - 由于同一输入可对应多种合理输出,评估不比对单一参考视频,而是依据任务特定的语义约束进行二元判断。 **各场景评估标准**: - **MSR**:是否保持跨视角所需的空间关系与协调动作; - **ADR**:生成事件是否与提供的音频证据一致; - **VDR**:视频延续是否合理反映观测动态及其潜在后果; - **AVIR**:音频内容是否在相关视觉内容中得到正确体现。 **评估指标**: 采用成功率(Success Rate, SR)作为主要指标。对于样本集 D 及其二元标签 s_i ∈ 0, 1 :

SR(D) = (100) / (|mathcalD)| ∑_(i ∈ D) s_i

3. 定量实验结果 在全部 517 个实例上,MiniMax-H3 的**总体成功率为 41.97%**。各场景的详细结果如下: | 场景 | 样本数 | 成功率 | |:—-|:—-:|:—-:| | MSR | 200 | 43.50% | | VDR | 100 | 56.00% | | ADR | 146 | 27.40% | | AVIR | 71 | 47.89% | **关键发现**: - **VDR 表现最优**(56.00%),表明模型在基于视频前缀推断短期动态延续方面相对可靠; - **ADR 表现最弱**(27.40%),揭示模型难以将声学证据可靠地转化为正确的视觉事件; - **MSR 与 AVIR** 处于中等水平(分别为 43.50% 与 47.89%),显示跨视角关联与音视频整合仍具挑战。 **子类别差异**: - MSR 中,穿线(75.00%)与倾倒(58.30%)表现较好,而清洁(33.30%)与运输(34.80%)较弱; - VDR 中,交通(100%)与动物(63.64%)表现突出,但卡通(20.00%)与谜题(16.67%)显著落后; - ADR 中,自然声音(54.50%)相对可处理,但机械(17.60%)、接触(21.90%)与警报(23.10%)极为困难。 ### 4. 定性实验分析 论文通过可视化案例展示了模型的行为表现: - **MSR(图 9)**:在电饭煲组装、餐具放置等双臂操作中,模型能生成可识别的操作阶段,但视角一致性与同步性仍不稳定; - **VDR(图 10)**:对人类近身动作(如熨烫)、动物行为及物理实验(如加热瓶内气球)的短期延续较为合理; - **ADR(图 11)**:在橱柜开启声、打字机声等提示下,模型能生成与声音匹配的可见事件; - **AVIR(图 12)**:能够根据口语约束定位视频中的不一致内容,或结合环境声进行视频延续。 ### 5. 失败案例分析 论文系统归纳了模型在多模态物理推理中的失败模式(图 13 与图 14),将其归为四类: 1. **证据锚定错误**:模型识别了合理事件,但将条件证据关联至错误的实体或动作(如将猫叫声错误对应到狗,或将扫地机声音对应到错误器具); 2. **事件实现不完整**:生成场景包含相关对象,但未实例化输入暗示的交互(如出现键盘但未表现打字动作); 3. **物理与构型违反**:延续过程破坏接触动力学、几何约束或有效状态转移(如滑板运动违反物理定律、魔方操作错误、轮胎碾压饮料杯时动力学失真); 4. **时序状态不一致**:未保持前缀视频已建立的对象状态与运动趋势(如狗丢下球后状态跳跃、相机平移时场景内容错乱)。 ### 6. 讨论性实验结论 基于上述实验,论文进一步提出了三项核心观察: - **视觉合理性不等于物理一致性**:模型可生成逼真视频,但仍可能在空间、时序与音视频约束上失败; - **多模态支持不等于多模态推理**:尽管模型接受图像、视频、音频与文本输入,但其并未始终可靠利用这些信号满足任务需求,尤其在声学锚定与多视角协调上差距明显; - **生成式评估反映完整推理-生成链条**:失败可能源于输入理解错误、跨模态整合薄弱或视频生成本身的缺陷。论文建议未来可通过消融实验(如移除特定模态或替换音频)进一步分离这些因素。 Q5: 有什么可以进一步探索的点? 基于论文的实验发现与讨论,以下是可以进一步探索的研究方向: —- ### 1. 自动化评估框架的开发 当前评估依赖昂贵且难以规模化的人工评判。未来可探索开发**自动化的物理世界推理评估指标**,用于可靠地判定生成视频是否满足跨模态语义约束。这要求指标不仅能检测视觉保真度,还需验证: - 空间关系与多视角一致性; - 音频-视觉事件的语义对应; - 物理规律与时序逻辑的合理性。 实现该目标将支持对大规模全模态模型进行可扩展、可复现的基准测试。 ### 2. 评估集在场景与模态组合上的扩展 现有 517 个实例已覆盖 29 个子类别,但物理世界的复杂性远未被穷尽。后续工作可: - 引入更具挑战性的**长程时序推理**任务(如多阶段物理交互、工具使用链); - 增加**更多模态组合**(如触觉信号、深度图与多视角联合输入); - 纳入**更复杂的声学环境**(如混响、多声源叠加)以测试模型在嘈杂条件下的音频消歧能力。 ### 3. 音频到视觉推理能力的专项增强 实验显示 **ADR 成功率仅为 27.40%**,是全模态推理中最薄弱的环节。这表明模型在将声学证据转化为正确视觉事件方面存在显著瓶颈。未来研究可针对: - **细粒度音频理解**:区分相似声源(如不同材料的破碎声、不同电器的运行声); - **音频-视觉时间对齐**:处理未对齐或异步的音视频输入; - **小物体交互的声学锚定**:改善模型对细微物体操作(如开罐、打字)的声音-动作关联。 ### 4. 物理一致性与时间连贯性生成机制 失败案例揭示了频繁的**物理定律违反**(如不合理的运动轨迹、错误的接触动力学)与**时序状态不一致**(如对象状态跳跃)。未来可探索: - 将**显式物理先验或物理引擎**融入扩散/流匹配生成框架,而非仅依赖数据驱动的隐式物理学习; - 增强**长程时间一致性模块**,确保前缀视频中建立的对象状态、运动趋势在续生成过程中严格保持; - 开发**状态感知的视频编辑机制**,避免在延续生成中引入与历史观测矛盾的场景内容。 ### 5. 跨模态整合机制的受控分析与解耦 论文指出,失败的生成可能源于输入理解错误、跨模态整合薄弱或视频生成本身的缺陷。未来可通过**系统性的消融实验**进行因素解耦: - **模态移除实验**:逐一移除图像、音频或视频前缀,观察模型性能衰减模式,定位关键证据模态; - **对抗性模态替换**:保持视觉输入不变,替换音频内容(如将”猫叫”替换为”狗吠”),检验模型是否真正依赖音频而非依赖视觉先验; - **证据冲突实验**:故意提供互相矛盾的跨模态线索,测试模型能否检测冲突并给出合理响应,而非盲目遵循某一主导模态。 ### 6. 多视角空间推理与具身智能结合 MSR 任务中,模型在清洁、运输等操作上的成功率较低(约 33–35%),且存在视角混淆与不同步问题。结合具身智能(Embodied AI)场景,未来可研究: - **相机参数显式建模**:在生成过程中嵌入视角几何约束,确保多视角视频符合刚性相机安装下的运动学; - **手部-物体交互的跨视角一致性**:针对机器人操作数据,强化对手部姿态与物体状态在不同视角下一致性的生成约束。 ### 7. 将生成作为推理的”思维链”(Chain-of-Frames) 论文提出生成视频可视为一种**可解释的推理读数**(Chain-of-Frames)。未来可进一步探索: - 利用中间帧生成或迭代编辑作为**多步推理**的显式过程,而不仅是最终输出; - 构建**生成式思维链**框架,使模型在产生最终视频前先生成关键中间状态或语义计划,从而提高复杂物理推理的可靠性。 Q6: 总结一下论文的主要内容 这篇论文研究了**全模态生成模型(Omni-Modal Generative Models)对物理世界的推理能力**,并以 MiniMax-H3 为测试平台,提出了一套全新的评估框架。以下是论文的主要内容总结: —- ### 1. 研究动机与问题 现有视频生成与世界模型基准(如 VBench、WorldModelBench)大多依赖**显式文本提示**,即提示中明确描述了期望输出的内容,而额外的图像、音频等模态仅作为冗余或局部条件。这种设置无法检验模型是否真正具备**跨模态推理能力**——即从分布式、不完整的观测证据中推断潜在物理事件的能力。 论文提出一个核心问题:**多模态对齐能否提升模型对物理世界的推理能力?** 为此,需要回答的不仅是”模型能否生成被告知的内容”,而是”模型能否从多模态线索中推断出应该生成什么”。 —- ### 2. 隐式全模态推理评估框架 论文的核心方法是构建**隐式条件-提示对(implicit condition–prompt pairs)**:故意在文本提示中省略关键事件语义,并将缺失信息分散到多个输入模态(图像、视频、音频)中。每个模态仅提供**部分证据**,模型必须联合解读、建立跨模态关联、推断隐含事件状态,并通过视频生成输出推理结果。生成的视频即为模型推理过程的**行为读数(behavioral readout)**,通过检验其一致性来评估推理是否成功。 形式化地,模型接收任务提示 q 和多模态观测 x ,生成视频:

Y sim pθ(Y mid q, x)
—- ### 3. 四项互补的物理世界推理任务 该框架具体 instantiated 为四个评估场景,共 **517 个实例、29 个子类别**: | 任务 | 输入模态 | 核心挑战 | |:—-|:—-|:—-| | **MSR** (Multi-view Spatial Reasoning) | 多视角图像 I = I^((k))
(k=1)^K | 跨视角关联实体与空间关系,处理遮挡与视角变化 | | **ADR** (Audio-based Disambiguation Reasoning) | 静态图像 I + 音频 A | 利用声学证据消除视觉歧义,推断正确事件 | | **VDR** (Video-based Decision Reasoning) | 前缀视频 V_(1:T) | 从观测动态中推断合理的事件延续或决策响应 | | **AVIR** (Audiovisual Integrated Reasoning) | 视频 V + 音频 A | 联合解读时序相关的视听证据,进行续生成或编辑修正 | 数据集构建经过多模态源收集、隐式提示生成、10轮迭代专家审查,确保提示不泄露目标、且多模态输入共同提供充分证据。 —- ### 4. 实验结果 以 MiniMax-H3 为对象,采用**人工二元评估**(基于任务语义约束而非单一参考视频),主要发现如下: - **总体成功率**:**41.97%**(517个实例),表明当前全模态模型的物理世界推理能力仍非常有限。 - **场景差异显著**: - **VDR** 最高:**56.00%**(视频延续相对最易处理) - **AVIR**:**47.89%** - **MSR**:**43.50%** - **ADR** 最低:**27.40%**(音频到视觉的推理最为困难) - **子类别差异**:MSR 中穿线(75.00%)优于清洁(33.30%);VDR 中交通(100%)显著优于谜题(16.67%);ADR 中自然声(54.50%)优于机械声(17.60%)。 —- ### 5. 失败模式与关键发现 论文通过定性分析归纳了四类主要失败模式: 1. **证据锚定错误**:将线索关联到错误的实体或动作; 2. **事件实现不完整**:出现相关对象但未执行应有交互; 3. **物理与构型违反**:违背接触动力学、几何约束或状态转移规则; 4. **时序状态不一致**:未保持前缀视频中已建立的状态与运动趋势。 基于实验,论文提出三项核心观察: - **视觉逼真性不等于物理一致性**:模型可生成看似真实的视频,却违反空间、时序或物理约束; - **多模态支持不等于多模态推理**:接受多种输入并不意味着能可靠整合证据,尤其在音频锚定和多视角协调上差距明显; - **生成式评估反映完整推理-生成链条**:失败的输出可能源于理解错误、跨模态整合薄弱或生成缺陷。 —- ### 6. 结论与展望 该工作将全模态生成模型的评估从”忠实渲染显式指令”推进到”推断并补全隐含物理事件”,揭示了 MiniMax-H3 在全模态输入支持与可靠物理推理之间存在显著差距。未来方向包括扩展评估场景与模态组合、开发自动化评估指标、通过消融实验解耦各失败因素,以及将视频生成作为可解释的”帧之思维链(Chain-of-Frames)”来增强多步物理推理能力。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Haoyu Zhao,Zihao Zhao,Tianyu Deng,Ziqin Xu,Zihao Zhang,Xudong Wang,Jinxiang Guo,Chen Gao,Ziyi Ye,Yeying Jin,Jiaxi Gu,Zuxuan Wu,Shuicheng Yan

Categories:

PDF URL: https://arxiv.org/pdf/2609.18323.pdf

Arxiv URL: https://arxiv.org/abs/2609.18323

Arxiv ID: 2609.18323

CoolPaper URL: https://papers.cool/arxiv/2609.18323

Published: 2026-09-19T01:34:44.428Z

Updated: 2026-09-19T01:34:44.428Z


16. When2Think: Learning Difficulty-Aware Length Control for Efficient Hybrid Reasoning Models

Abstract:Large Reasoning Models (LRMs) achieve strong performance on complex tasks but exhibit systematic inefficiency: they often overthink easy problems and underthink hard ones. Existing approaches based on uniform length penalties or rigid routing incur an efficiency tax, trading reduced computation on easy instances for accuracy loss on hard instances. We formulate efficient reasoning as an instance-adaptive computation allocation problem and propose When2Think, a post-training framework for hybrid reasoning that dynamically allocates computation based on problem difficulty. Our method introduces Instance-level Difficulty-Aware Control (IDAC), a reward-shaping mechanism that leverages pre-computed reference statistics (accuracy and token usage) to regulate reasoning depth. Combined with verifier-based rewards and batch-wise standardized advantages, IDAC enables stable critic-free optimization without learned reward models or online reference-model queries. When2Think encourages direct answering on easy instances while preserving extended reasoning on hard instances, thereby learning when to use System 1 (NoThink) versus System 2 (Think). Experiments on mathematical benchmarks demonstrate improved accuracy-efficiency trade-offs: on AIME24, Pass@3 increases by 10.0% while token usage is reduced by 27.9% relative to the base model, and on AIME25, When2Think achieves 40.0% Pass@3, outperforming compression and routing-only baselines.

中文摘要

摘要:大型推理模型(LRMs)在复杂任务上表现出强大性能,但存在系统性低效:它们往往在简单问题上过度思考,而在复杂问题上思考不足。基于统一长度惩罚或刚性路由的现有方法会产生效率损失,以在简单实例上减少计算量为代价,导致在复杂实例上准确率下降。我们将高效推理表述为实例自适应计算分配问题,并提出 When2Think,一种用于混合推理的后训练框架,根据问题难度动态分配计算量。我们的方法引入了实例级难度感知控制(IDAC),这是一种奖励塑形机制,利用预先计算的参考统计信息(准确率和标记使用量)来调节推理深度。结合基于验证器的奖励和批量标准化优势,IDAC 实现了无需学习奖励模型或在线查询参考模型即可稳定的无评论员优化。When2Think 鼓励在简单实例上直接回答,同时在复杂实例上保持延长推理,从而学习何时使用系统 1(不思考)和系统 2(思考)。在数学基准测试上的实验表明,其准确率-效率权衡得到了提升:在 AIME24 上,Pass@3 提升了 10.0%,标记使用量相较于基础模型减少了 27.9%;在 AIME25 上,When2Think 实现了 40.0% 的 Pass@3,优于压缩和仅路由基线方法。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决大推理模型(Large Reasoning Models, LRMs)中存在的\*\*推理效率与准确性错配\*\*问题。具体而言,现有 LRMs 在不同难度的问题上表现出系统性的计算资源误配:在简单问题上生成冗余的推理 token(过度思考,overthinking),而在困难问题上又过早终止推理或产生碎片化的推理链(思考不足,underthinking)。现有基于统一长度惩罚或刚性路由的压缩方法虽然能降低简单问题上的计算开销,但会引入\*\*"效率税"(efficiency tax)\*\*——即在节省简单实例计算的同时,系统性地损害困难实例上的准确性。 为应对这一挑战,论文将高效推理重新形式化为\*\*实例自适应计算分配问题\*\*,并提出以下核心解决思路: - \*\*统一混合推理模式\*\*:在单一模型中结合 SYSTEM 1(快速直觉式直接回答)与 SYSTEM 2(审慎多步推理)两种认知模式,使模型能够根据问题难度动态决定是否启用显式推理(THINK vs. NOTHINK)以及推理的深度。 - \*\*实例级难度感知控制\*\*:提出 When2Think 框架及其核心组件 Instance-level Difficulty-Aware Control(IDAC)。该机制利用离线预计算的参考统计量(参考准确率 α_i 与参考 token 用量 τ_i )来估计实例难度与预期推理成本,进而通过奖励塑形对推理长度进行细粒度、实例感知的调节。 - \*\*稳定无批评家优化\*\*:结合基于验证器的正确性奖励与批次级标准化优势(Batch-Wise Standardized Advantages, BWS),实现无需学习奖励模型、无需学习批评家网络、也无需在线参考模型查询的稳定优化。 简言之,该工作旨在突破传统"全局压缩"范式的局限,通过学习\*\*何时思考、思考多少\*\*的实例自适应策略,在保持困难问题准确性的同时消除简单问题上的不必要计算,从而改善准确率与效率之间的帕累托前沿。 Q2: 有哪些相关研究? 根据论文内容,相关研究主要分布于\*\*推理压缩\*\*、\*\*混合推理\*\*、\*\*基础模型与训练范式\*\*以及\*\*认知理论\*\*四个维度。具体梳理如下: ### 1. 推理压缩(Reasoning Compression) 该类方法旨在缩短中间推理轨迹以降低计算开销,但通常采用全局或启发式长度约束,容易在困难实例上引发"效率税"(欠思考)。 - \*\*数据级压缩\*\*: - \*\*Skip-Thinking\*\*

21
:通过分块级蒸馏(chunk-level distillation)去除生成链中的冗余步骤。 - **LC-R1**
22
:基于有效性感知的选择(validity-aware selection)筛选推理步骤。 - **基于强化学习的压缩**: - **ThinkPrune**
23
:引入硬性的 token 预算约束(hard token budgets)截断推理链。 - **LASER**
24
与 **DLER**
25
:通过基于奖励的长度惩罚(reward-based length penalties)或长度正则化激励模型生成更短的推理轨迹。 ### 2. 混合推理(Hybrid Reasoning) 该类方法通过选择性启用显式推理来降低成本,但现有工作多聚焦于离散的模式切换,缺乏细粒度的实例级深度控制。 - **轨迹级切换**: - **ARM**

26
:在短推理与长推理轨迹之间自适应切换。 - **LHRM**
27
:构建大型混合推理模型,按需调用深度推理。 - **实例级跳过**: - **AdaptThink**
28
:训练模型学习”何时思考”,在简单实例上跳过显式推理。 - **ThinkLess**
29
:类似地,通过学到的控制器在简单问题上省略推理过程。 ### 3. 基础模型与后训练范式 - **大语言模型(LLMs)**:如 GPT-3

1
、Gopher
2
、Chinchilla
3
、PaLM
4
、LLaMA
5
等,奠定了生成基础。 - **大推理模型(LRMs)/推理语言模型(RLMs)**: - **DeepSeek-R1**
32
、**QwQ**
31
、**Phi-4-reasoning**
33
、**Gemini 2.5**
34
等,通过 SFT 或 RL 将结构化推理能力内化为模型参数。 - **可验证奖励强化学习(RLVR)**:Lambert et al.
39
提出以确定性验证器替代习得奖励模型,直接对齐任务正确性。 - **结果与过程监督**:ORM
40
与 PRM
41
分别提供最终答案级与步骤级监督,后者标注成本更高。 ### 4. 优化与训练框架 - **PPO 与裁剪替代目标**:用于稳定策略梯度学习

28
。 - **REINFORCE++**
43
:提出全局优势归一化以稳定无批评家(critic-free)策略优化,本文的 BWS 机制受其启发。 - **Importance Sampling(IS)**:AdaptThink
28
采用的重要性采样策略被本文沿用,以平衡 THINK/NOTHINK 的探索。 - **基础设施**:**verl**
55
训练框架与 **vLLM**
56
推理引擎。 ### 5. 认知理论基础 - **双过程理论(Dual-Process Theory)**

18, 19
:将认知区分为快速直觉的 SYSTEM 1 与缓慢审慎的 SYSTEM 2,为混合推理提供了概念透镜。 - **思维链(Chain-of-Thought)**
63
、**Plan-and-Solve**
64
、**Tree-of-Thoughts**
67
等推理时(inference-time)缩放策略,通过外部引导模拟 SYSTEM 2 推理。 - **知识蒸馏**
71, 72, 73
:用于将推理能力从专家模型迁移至较小模型。 综上,现有工作或侧重于全局压缩,或局限于离散的模式切换;本文提出的 When2Think 旨在填补**实例自适应、连续可控的深度分配**这一空白,在无学习奖励模型/批评家的情况下,实现 SYSTEM 1 与 SYSTEM 2 的统一混合优化。 Q3: 论文如何解决这个问题? 论文通过提出 **When2Think** 这一后训练框架,将高效推理重新定义为**实例级自适应计算分配**问题,从”全局压缩推理长度”转向”依据问题难度动态决定推理深度与模式”。其技术路径涵盖离线参考统计预计算、在线奖励塑形、以及稳定无批评家的策略优化三个层面,具体如下。 —- ### 1. 总体框架:混合推理策略 When2Think 在单一策略中统一了 SYSTEM 1(NOTHINK,直接作答)与 SYSTEM 2(THINK,显式多步推理)两种行为。对于每个输入 xi ,策略 πθ 首先选择是否生成显式推理(由模式 token `` 或 `` 控制),再生成后续内容。该框架的核心在于:不仅学习**是否思考**,更学习**思考多少**。 —- ### 2. 离线参考统计预计算 为了避免训练内循环中在线查询参考模型带来的开销,When2Think 在每个训练周期(epoch)开始前,利用参考策略 π(ref) 离线预计算实例级统计量。 对每个问题 x_i ,采样 K 条轨迹 o’(i,k) sim π_(ref)(· mid x_i) ,并定义答案验证函数:

V(xi, o’(i,k)) = I[ g(o’(i,k)) = y_i ],
其中 g(·) 为答案提取函数,$I
·
$ 为示性函数。 基于上述样本,计算两个关键统计量(公式 4):
α_i = γ ( (1) / (K) ∑
(k=1)^(K) V(xi, o’(i,k)) ) + varepsilon,

τi = (1) / (K) ∑(k=1)^(K) T(o’_(i,k)) + varepsilon.

  • α_i :参考策略在实例 x_i 上的经验准确率(缩放后),作为**实例难度**的代理; - τ_i :参考轨迹的平均长度,作为该实例的**预期 token 预算**; - γ ∈ (0,1) 与 varepsilon 分别控制奖励缩放与数值稳定性。 —- ### 3. 实例级难度感知控制(IDAC) IDAC 是 When2Think 的核心奖励塑形机制,用于在轨迹级别动态调节推理深度激励。其设计思想是:对超过参考长度的轨迹施加更强的衰减惩罚,从而抑制简单问题上的过度思考,同时允许困难问题维持较长的审慎推理。 定义确定性轨迹级缩放因子(公式 5):

λ(i,k) = exp( -T(o(i,k)) · α_iτ_i ),

λ(i,k) = λ(i,k), & if THINK, 1, & if NOTHINK.
当实例较容易( αi 接近 1)且策略生成轨迹较长( T(o(i,k)) > τi )时,指数项迅速减小, λ(i,k) 趋近于 0,强烈抑制冗余 token;对于困难实例( α_i 较小),同样的绝对长度会产生更弱的衰减,允许模型保留深层推理。 —- ### 4. 实例自适应奖励设计 在线奖励函数联合考虑正确性与效率,并引入实例特定的参考基线进行归一化(公式 6):

r(i,k) = V(x_i, o(i,k)) ( 1 + λ(i,k) δ ) - α_i.
其中: - V(x_i, o
(i,k)) ∈ 0,1 为验证器提供的二元正确性信号; - δ > 0 为效率奖励的幅值系数; - αi 作为实例级基线,将奖励相对于参考策略的表现进行归一化。 该公式确保:仅当答案正确时,效率 bonus(由 λ(i,k)δ 体现)才会被激活;同时,难度高的实例( α_i 低)会获得更高的奖励上限,缓解困难样本上的欠激励问题。 —- ### 5. 批次级标准化优势(BWS) 为实现稳定的无批评家(critic-free)优化,When2Think 采用批次级标准化优势估计,借鉴 REINFORCE++ 的方差控制思想。 对包含 M 个实例的 mini-batch,每个实例采样 K 条轨迹,对每个轨迹索引 k 计算批次内均值与标准差(公式 7):

μk = (1) / (M) ∑(i=1)^(M) r(i,k), quad σ_k = √(1) / (M) ∑(i=1)^(M) (r(i,k) - μ_k)^2.
轨迹级优势定义为(公式 8):
A
(i,k) = r(i,k) - μ_kσ_k + varepsilon.
BWS 的关键作用在于: - **保留跨实例难度结构**:与仅在同一问题内部归一化的方法(如 GRPO)不同,批次级标准化使得解决困难实例的长轨迹仍可能获得正优势; - **解耦难度与优化信号**:将原始奖励转换为相对优势,稳定长度敏感策略的学习,防止策略崩溃到极简或极繁的退化行为。 —- ### 6. 重要性采样(IS)与策略优化 为缓解冷启动偏差并防止策略过早坍缩到单一模式,When2Think 采用重要性采样进行混合推理训练。 - **探索策略** π
(IS) :均匀采样初始模式 token(THINK/NOTHINK),后续 token 由当前策略 π_θ 生成; - **重要性比率**(公式 1):

rho(i,k) = πθ(o(i,k) mid x_i)π(IS)(o_(i,k) mid x_i);

  • **裁剪替代目标**(公式 2):
    L(θ) = -E(x_i sim B),, o(i,k) sim π(IS) [ min( rho(i,k) A(i,k),; clip(rho(i,k), 1-ε, 1+ε) A(i,k) ) ].
    该目标在保持对 π
    θ 无偏梯度估计的同时,通过 PPO 式裁剪限制策略更新的幅度,稳定学习何时以及多深进行推理。 —- ### 7. 总结:问题如何解决 通过上述机制,When2Think 实现了以下目标: | 问题根源 | When2Think 的解决机制 | |—-|—-| | 简单问题过度思考 | IDAC 在 αi 高时施加强长度衰减,鼓励 NOTHINK 或极短 THINK | | 困难问题思考不足 | 低 α_i 削弱长度惩罚,BWS 保留长轨迹正优势,维持 SYSTEM 2 推理 | | 效率税(硬实例精度损失) | 实例级自适应分配取代全局长度约束,避免”一刀切”压缩 | | 优化不稳定 | BWS 标准化 + 重要性采样 + PPO 裁剪,实现无学习奖励模型/批评家的稳定训练 | 实验表明,该框架在 AIME24 上将 Pass@3 提升 10.0% 的同时降低 27.9% 的 token 使用量,验证了自适应计算分配在缓解效率税方面的有效性。 Q4: 论文做了哪些实验? 论文围绕 **When2Think** 展开了一系列实验,涵盖主基准测试、分层难度分析、机制消融及补充可视化实验。所有实验均基于 **R1-distill-1.5B** 模型,在 **DeepScaleR** 数据集(约 40k 竞赛级数学题)上进行后训练,并在多个数学推理基准上评估。 —- ### 1. 实验设置 **数据集与基准** 训练使用 DeepScaleR 数据集;评估覆盖五个难度递进的数学基准: - **GSM-Plus**(约 9k 扰动应用题) - **MATH-500**(按 AoPS 标准分为 Levels 1–5) - **Minerva**(272 道大学 STEM 题目) - **OlympiadBench-Math**(674 道文本数学竞赛题) - **AIME24 / AIME25**(各 30 道高难竞赛题) **对比基线** 实验对比了三大类基线: - **基础 LLM**:Qwen2.5-Math-Instruct - **LRM**:R1-Distill-Qwen(同为 When2Think 的 back-bone)、DeepScaleR-Preview - **效率导向模型**:压缩类(LC-R1、ThinkPrune、LASER)与混合推理类(AdaptThink、ThinkLess) **评估指标** - **Pass@k**:基于采样的准确率,报告 Pass@3(主要结果)与 Pass@1(分层分析) - **Token Usage**:每实例平均生成 token 数 - **ACE(Accuracy-Cost Efficiency)**:衡量正确回答中冗余推理 token 的比例(附录 B.5) —- ### 2. 主实验:准确率–效率权衡(RQ1) 核心问题是 When2Think 是否能在降低计算量的同时避免在困难实例上损失精度。 - **总体结果(Table 1、Table 9)**:When2Think 在 GSM-Plus、OlympiadBench、AIME24/25 上均实现了帕累托改进。以 AIME24 为例: - Pass@3 从基线的 46.0% 提升至 56.0% ( +10.0 个百分点) - 平均 token 从 14,195 降至 10,236 ,减少 27.9% - **效率税验证(Table 1、Table 10)**:现有压缩或路由基线(如 LC-R1、AdaptThink)虽能降低 token,但在 AIME24 或 MATH-500 Level 5 上精度显著下降(例如 LC-R1 在 AIME24 上下降 10.0 个百分点),验证了静态策略的”效率税”;When2Think 则缓解了该现象。 - **准确率–效率全景(Figure 6)**:在 GSM-Plus 到 AIME25 的五个基准上,When2Think 普遍位于”右上”区域(更高准确率、更低 token 消耗)。 —- ### 3. 难度自适应分配验证(RQ2) 实验通过分层分析验证模型是否依据实例难度动态分配 SYSTEM 1 / SYSTEM 2 推理。 - **MATH-500 分层分析(Table 10、Figure 1、Figure 4)**: - **简单实例(Level 1)**:R1-Distill-Qwen 平均生成 1,199 tokens,When2Think 降至 619 tokens( -580 ),同时 Pass@1 保持 95.8% ,显示对 SYSTEM 1 直接作答的偏好。 - **困难实例(Level 5)**:When2Think 在维持精度的同时减少 2,276 tokens,且 THINK 模式选择率从 Level 1 的约 0.2 单调上升至 Level 5 的超过 0.7 (Figure 4 底部)。 - **跨基准行为(Table 4–Table 8)**:在 GSM-Plus、Minerva、OlympiadBench、AIME24/25 上,When2Think 的 NOTHINK 比例在简单任务上显著更高,而在 AIME 等极难任务上几乎完全采用 THINK(AIME24/25 的 NOTHINK 比例为 0.0% )。 —- ### 4. 机制消融实验(RQ3) 通过系统消融验证三个核心机制(IDAC、BWS、IS)的作用。 - **IDAC 的必要性(Table 1、Figure 9)**: - 去除 IDAC 保留 IS+BWS 的变体(w/o IDAC)在 AIME24 上精度显著下降,说明仅学习”是否思考”不足以控制”思考多少”。 - 完整 When2Think(含 IDAC)在 AIME24 上达到 56.0% ,而 AdaptThink(仅有离散路由)降至 44.7% 。 - **BWS 的稳定性作用(Figure 7、Figure 8)**: - 对比 BWS、原始奖励与 GRPO 风格优势估计(Figure 7):BWS 保留了跨实例难度结构,使困难实例上的长轨迹仍获正优势;GRPO 因实例内归一化导致信号碎片化(水平带状分布)。 - 训练动态(Figure 8):无 BWS 时 Think Ratio 与 token usage 剧烈波动(Think Ratio 跌至约 0.6 );有 BWS 时稳定在约 0.9 ,且收敛更快。 - **IS 的效率提升作用(Table 1、Figure 9)**: - 去除 IS 保留 IDAC+BWS 的变体(w/o IS)在多数基准上精度与完整版相当甚至略高(如 GSM-Plus Pass@3 达 86.8% ),但 token 消耗显著增加(GSM-Plus 从 1,052 升至 1,652 )。 - 说明 IS 主要促进有效利用 NOTHINK 模式以提升效率,而非精度的主要来源。 - **奖励设计消融(Figure 10、Figure 11)**: - 测试分离的 NOTHINK/THINK bonus( eta 与 δ )发现,过大 eta 会诱导策略偏向直接作答、损害困难实例精度。 - 统一使用单一 δ 并配合 IDAC 即可获得更稳定的训练动态。 —- ### 5. 补充分析实验 - **Token 分布分析(Figure 5)**:正确回答中 NOTHINK 集中在低 token 区,THINK 分布较宽;错误回答中 THINK 呈现长尾分布,显示失败推理的高成本。 - **验证器有效性(Figure 12)**:双验证器(Math-Verify + MARIO Eval)在 Geometry、Precalculus 等符号答案占比高的领域显著优于基线验证,缓解了字符串匹配的误判。 - **模型规模与监督影响(Figure 17)**:在 Olmo-3(7B/32B)上的分析显示,小规模模型存在”能力诱导的过度思考”(capability-induced overthinking);RLVR 后训练系统性地增加 token 消耗,进一步论证了自适应控制的必要性。 - **案例研究(Figure 13–Figure 16)**:定性展示了基线在简单题上的过度思考(32k tokens)、在困难题上的思考不足(过早放弃),以及 When2Think 在同类简单题上的正确 NOTHINK 响应(625 tokens)。 Q5: 有什么可以进一步探索的点? 基于论文的局限性分析与实验洞察,以下几方面值得进一步探索: —- ### 1. 领域泛化:从可验证任务到开放式生成 论文方法高度依赖**可验证奖励**(verifiable rewards),因此最直接适用于数学推理等具有明确答案的领域。向开放式任务(如创意写作、开放式问答、代码生成或医疗诊断)扩展时,需解决以下问题: - 如何构建**可靠的自动评估指标**以替代二元验证器 V(x_i, o(i,k)) ,例如基于模型批评(model-based critique)或人类反馈的奖励建模; - 在缺乏确定性正确答案的场景下,如何定义并估计**实例难度** α_i 与**参考成本** τ_i ; - 探索**混合人类反馈与自动验证**的训练范式,以维持无批评家(critic-free)优化的优势同时覆盖更广泛的任务类型。 —- ### 2. 动态与细粒度的难度建模 当前方法采用**离线预计算**的参考统计量( α_i, τ_i )作为实例难度的代理,存在两点局限: - **静态性**:难度估计在训练周期内固定,无法反映策略学习过程中模型能力的变化(如策略改进后原”困难”实例可能变简单); - **粗粒度**:仅依赖轨迹级正确率与长度,未利用问题内部的**概念结构**(如所需定理数量、组合深度)。 未来可探索: - **在线难度估计**:在训练过程中动态更新 α_i 与 τ_i ,或让模型自身通过辅助头(auxiliary difficulty head)预测实例复杂度; - **课程学习(Curriculum Learning)** 的融合:依据实时难度估计调整采样分布,而非均匀采样 mini-batch; - **细粒度难度分解**:将数学问题分解为子技能(如代数操作、几何直观),在子步骤级别而非实例级别分配计算资源。 —- ### 3. 更大规模与多模态场景下的自适应控制 论文观察到**规模悖论**(Paradox of Scale):较小模型(1.5B)的过度思考与效率税现象最为显著,而更大模型(32B)固有的推理效率更高。这引出一系列开放问题: - 在参数量级进一步提升(如 70B+)时,IDAC 式连续控制是否仍具优势,还是会被模型内化能力所淹没; - **多模态推理**(如几何图表、科学实验数据)中的计算分配:视觉信息何时需要深入分析(SYSTEM 2)、何时可快速直觉判断(SYSTEM 1),即”何时观察”与”观察多深”的联合优化; - 将自适应控制从**生成长度**扩展到**工具调用、检索次数、蒙特卡洛搜索次数**等更广义的计算维度。 —- ### 4. 训练-推理协同的效率优化 当前 When2Think 完全在**训练阶段**学习自适应策略,推理时仅执行习得策略。未来可探索**测试时自适应**(test-time adaptation)的协同机制: - **动态早停(Early Stopping)**:在 THINK 模式下,模型基于中间步骤的自我评估(如置信度、价值估计)决定何时终止推理,而非依赖预设的端到端策略; - **迭代式深度扩展**:类似 Retro-Search

58
或 MCTS
74
,对困难实例在测试时动态增加计算,对简单实例保持极简输出; - **投机解码(Speculative Decoding)与自适应路由结合**:利用轻量级草稿模型处理 SYSTEM 1 实例,仅在触发 SYSTEM 2 时调用完整推理模型。 —- ### 5. 理论分析:效率税与计算分配的极限 论文通过实验揭示了**效率税**(efficiency tax)的存在——静态压缩在简单实例上节省的 token 会以困难实例上的精度损失为代价,但尚未对其建立形式化理论刻画。值得深入研究: - **效率税的下界**:对于给定模型容量与任务分布,是否存在信息论或计算复杂性意义上的最小必要计算量,使得任何全局压缩策略都不可避免地损失某类实例的精度; - **最优计算分配的形式化**:将实例级自适应控制建模为约束优化问题(如在总体 token 预算下最大化期望准确率),推导 IDAC 这类启发式策略与理论最优解的近似比; - **连续控制 vs. 离散路由的理论界限**:本文论证了连续深度调制(IDAC)优于离散模式切换,但其增益的上界与适用条件尚需严格分析。 —- ### 6. 奖励机制与优化算法的深化 论文中的奖励设计仍有简化空间,可沿以下方向深化: - **非线性效率奖励**:当前使用指数形式的 λ(i,k) = exp( -T(o(i,k)) · α_iτ_i ) ,可探索基于问题结构(如步骤数、逻辑深度)的**结构化成本函数**,替代纯 token 计数; - **模式间迁移学习**:SYSTEM 1(NOTHINK)与 SYSTEM 2(THINK)的知识如何共享与互补,避免两个模式间的参数冲突; - **多目标 Pareto 前沿**:将准确率与效率视为多目标优化问题,通过 Pareto-conditioned policy

或类似方法
训练单一模型覆盖不同效率偏好(如移动端低延迟 vs. 服务器端高精度),而非固定超参数 δ 。 Q6: 总结一下论文的主要内容 这篇论文针对大推理模型(LRMs)的推理效率与计算错配问题,提出了一个实例自适应的后训练框架 When2Think。以下是主要内容的系统总结: —- ### 1. 研究背景与核心问题 当前大推理模型(如 DeepSeek-R1 系列)通过显式生成长思维链(Chain-of-Thought)提升复杂任务性能,但存在系统性的计算资源误配: - 过度思考(Overthinking):在简单实例上生成冗长、冗余的推理 token,却无精度增益; - 思考不足(Underthinking):在困难实例上过早终止推理或生成碎片化推理链,导致错误。 现有压缩方法(如全局长度惩罚、硬性 token 预算或离散路由)虽能降低简单问题的成本,但会引入“效率税”(Efficiency Tax)——即在节省简单实例计算的同时,系统性地损害困难实例的准确率。论文指出,低效的本质并非”推理太多”,而是计算资源在实例间的错配。 —- ### 2. 核心思想:从压缩到实例自适应控制 论文借鉴认知科学中的双过程理论(Dual-Process Theory),将推理建模为 SYSTEM 1(快速直觉式直接回答,NOTHINK)与 SYSTEM 2(缓慢审慎的多步推理,THINK)的统一混合策略。核心主张是:高效推理应是一个实例级自适应计算分配问题,目标并非最小化全局长度,而是依据问题难度动态决定是否思考以及思考多少。 —- ### 3. 方法:When2Think 框架 When2Think 是一个无需学习奖励模型、无需在线参考模型查询、无需批评家网络的后训练强化学习框架。其技术流程包含三个阶段: #### 3.1 离线参考统计预计算 在每个训练周期前,利用参考策略 π(ref) 离线采样并缓存每个实例的统计量: - 实例难度 $α_i = γ · (1) / (K)∑(k=1)^K I

g(o’_(i,k)) = y_i

  • varepsilon :参考策略的经验准确率; - 预期 token 预算 τi = (1) / (K)∑(k=1)^K T(o’_(i,k)) + varepsilon$:参考轨迹的平均长度。 #### 3.2 实例级难度感知控制(IDAC) IDAC 通过轨迹级奖励塑形动态调节推理深度激励。定义缩放因子:

λ(i,k) = exp( -T(o(i,k)) · αiτ_i ),
并对 THINK/NOTHINK 模式分别施加不同控制:
λ
(i,k) = λ(i,k), & if THINK, 1, & if NOTHINK.
当实例较易( α_i to 1 )且生成长度超过预算( T(o
(i,k)) > τi )时, λ(i,k) 强烈衰减,抑制冗余推理;当实例困难( α_i 较小)时,同样长度产生的惩罚更弱,允许保留深层 SYSTEM 2 推理。 #### 3.3 实例自适应奖励与批次级标准化优势(BWS) 在线奖励函数联合正确性与效率:

r(i,k) = V(x_i, o(i,k)) ( 1 + λ(i,k) δ ) - α_i,
其中 V(x_i, o
(i,k)) 为验证器提供的二元正确性信号, δ 控制效率奖励幅度, αi 作为实例级基线归一化奖励。 为实现稳定的无批评家优化,论文提出**批次级标准化优势(BWS)**:
μ_k = (1) / (M)∑
(i=1)^M r(i,k), quad σ_k = √(1) / (M)∑(i=1)^M (r_(i,k) - μ_k)^2,

A(i,k) = r(i,k) - μ_kσ_k + varepsilon.
BWS 的关键价值在于保留跨实例的全局难度结构,使得解决困难实例的长轨迹仍能获得正优化信号,避免了仅在实例内部归一化(如 GRPO)导致的信号碎片化。 #### 3.4 重要性采样(IS)与策略优化 采用 PPO 风格的裁剪替代目标,并通过重要性采样在训练时强制平衡 THINK/NOTHINK 的探索,防止策略过早坍缩到单一模式。优化目标为:

L(θ) = -E[ min( rho(i,k) A(i,k),; clip(rho(i,k), 1-ε, 1+ε) A(i,k) ) ].
—- ### 4. 实验验证 实验以 R1-distill-1.5B 为基座,在 GSM-Plus、MATH-500、Minerva、OlympiadBench、AIME24/25 等基准上评估,主要发现包括: - **准确率–效率帕累托改进**:在 AIME24 上,When2Think 将 Pass@3 从 46.0% 提升至 56.0% ( +10.0 个百分点),同时平均 token 消耗从 14,195 降至 10,236 ( -27.9% ),显著缓解了效率税。 - **难度自适应行为**:在 MATH-500 上,Level 1(简单)问题的 THINK 比例约为 0.2 ,平均 token 从基线的 1,199 降至 619 ;Level 5(困难)问题的 THINK 比例超过 0.7 ,在维持精度的同时仍减少了冗余 token。 - **机制有效性**:消融实验表明,IDAC 是实现”思考多少”的深度控制的关键(缺失则 AIME24 精度显著下降),BWS 是训练稳定的核心(防止策略崩溃或长度漂移),IS 主要促进 SYSTEM 1 模式的有效利用以提升效率。 —- ### 5. 主要贡献与结论 论文的核心贡献可概括为: - **统一分析**:系统量化了现有压缩方法引入的”效率税”,揭示静态策略在困难实例上的系统性欠分配; - **问题重构**:将高效推理从”全局压缩”重新定义为”实例自适应控制”问题; - **方法创新**:提出 When2Think,首次在单一策略中联合学习 SYSTEM 1/2 的模式选择与连续可控的推理深度,通过 IDAC 与 BWS 实现稳定、无批评家的优化; - **实证验证**:在最具挑战性的数学推理基准上证明了自适应深度分配可同时抑制过度思考与思考不足。 最终结论指出:**高效推理的本质是计算资源的优化分配,而非单纯的推理长度最小化**。When2Think 为构建可扩展的、资源感知的推理系统提供了原则性方向。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Jaejun Shim,HyunJin Kim,Young Jin Kim,JinYeong Bak

Categories:

PDF URL: https://arxiv.org/pdf/2609.19671.pdf

Arxiv URL: https://arxiv.org/abs/2609.19671

Arxiv ID: 2609.19671

CoolPaper URL: https://papers.cool/arxiv/2609.19671

Published: 2026-09-19T01:34:46.763Z

Updated: 2026-09-19T01:34:46.763Z


17. What Does Privileged Information Add to On-Policy Self-Distillation?

Abstract:On-policy self-distillation (OPSD) lets a language model learn from a frozen copy of itself that sees an answer or a worked solution. Giving the teacher this extra information seems to offer the student more to learn, but how much does it add beyond distillation itself? To isolate that contribution, we construct AMPLE-Math, a reusable suite of 5,319 mathematical problems with six reasoning views that share the same answer, and compare each view with matched reference-free distillation. With a thinking-enabled teacher supervising direct-response rollouts, reference-free distillation accounts for much of Qwen3-1.7B’s improvement under thinking-enabled evaluation, both in domain and on external benchmarks. Evidence for an additional reference benefit is modest in Qwen, strongest for a polished solution, whereas complete traces add two percentage points in SmolLM3-3B at step 50. These benefits depend on the student being trained. At the same checkpoint, replacing short direct-response rollouts with long thinking-enabled rollouts turns gains into losses in both families while the problems, references, and evaluation stay fixed. Teacher profiles and matched loss interventions in Qwen further show that changing token-level supervision can leave student behavior largely unchanged. Together, these findings suggest that OPSD can improve access to existing reasoning capabilities through parameters shared by direct-response and thinking-enabled inference. The value of a privileged reference is what it adds to this cross-mode transfer, not how much of the solution it reveals.

中文摘要

摘要:在策略内自蒸馏(OPSD)中,语言模型可以从一个冻结的自身副本中学习,该副本可以看到答案或完整解题过程。为教师提供这些额外信息似乎让学生有更多内容可学,但这在蒸馏本身之外能增加多少效果呢?为了隔离这种贡献,我们构建了 AMPLE-Math,这是一个包含 5,319 道数学问题的可重用套件,每题提供六种推理视角且都拥有相同答案,并将每种视角与匹配的无参考蒸馏进行比较。在启用了思考能力的教师监督直接回答回合中,无参考蒸馏占了 Qwen3-1.7B 在启用思考评估下改进的大部分,无论是在域内还是外部基准测试中。关于额外参考的益处,在 Qwen 中证据有限,对精炼解答最明显,而在 SmolLM3-3B 于第 50 步时,完整解题痕迹带来额外两个百分点的增益。这些益处取决于学生模型的训练状态。在同一检查点,将短的直接回答回合替换为较长的思考启用回合会使两个模型系列的收益变为负值,而问题、参考和评估保持不变。Qwen 中的教师配置与匹配损失干预进一步表明,改变令牌级监督可能不会显著改变学生的行为。总体来看,这些发现表明,OPSD 可以通过直接回答与思考启用推理共享的参数,提高现有推理能力的访问。特权参考的价值在于它对这种跨模式传递所带来的增益,而不是它揭示了多少解题内容。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决的核心问题是:\*\*在同策略自蒸馏(On-Policy Self-Distillation, OPSD)框架下,如何严格区分“特权信息(Privileged Information, PI)本身的附加价值”与“蒸馏过程本身带来的收益”\*\*。 具体而言,研究围绕以下层面展开: - \*\*分离两种效应\*\*:OPSD中,一个“思考模式(thinking-enabled)”的冻结教师模型通过对学生生成的回答进行打分来提供监督。此时教师拥有两项潜在优势:一是其处于更强的推理模式(与学生直接生成回答的模式不同),二是它还能看到额外的参考信息(如答案、解题过程等)。论文指出,先前工作将这两者的效应混为一谈,未能回答“特权参考信息究竟多有用”这一问题。 - \*\*量化参考信息的边际贡献\*\*:论文构建了 \*\*AMPLE-MATH\*\* 数据集,为同一道数学题提供六种共享相同最终答案、但推理表示形式不同的特权视图(从仅含答案到完整推理痕迹)。通过与完全无参考(reference-free)的基线进行严格对照,研究测量了每种视图相对于“纯跨模式蒸馏”所带来的额外增益。 - \*\*揭示学生训练轨迹的决定性作用\*\*:论文进一步发现,特权信息的价值并非固定不变,而是强烈依赖于学生生成回答的方式(直接回答 vs. 思考模式展开)。在固定教师、固定参考信息的条件下,仅将学生的训练轨迹从“短直接回答”切换为“长思考模式”,就能将原本的收益转变为损失。 简言之,该研究旨在回答:\*\*特权信息在OPSD中的价值,究竟来自于它向教师揭示了多少解题内容,还是来自于它作为一种监督信号如何与学生自身的推理轨迹相互作用?\*\* 论文的实证证据表明,OPSD的很大部分改进源于跨模式参数共享(思考模式教师监督直接回答学生),而特权参考信息的附加贡献是有限且条件依赖的。 Q2: 有哪些相关研究? 这篇论文的相关研究主要分布在\*\*同策略自蒸馏(OPSD)的基础框架\*\*、\*\*特权信息(PI)的内容与效用\*\*、\*\*教师信号机制分析\*\*,以及\*\*蒸馏目标改进\*\*四个方向,具体如下: --- ### 1. 同策略自蒸馏与特权信息学习的基础框架 - \*\*Agarwal et al. (2024)\*\* 提出了同策略蒸馏(On-Policy Distillation),让学生从自身生成的错误中学习,奠定了后续OPSD的工作基础。 - \*\*Vapnik & Vashist (2009)\*\* 与 \*\*Lopez-Paz et al. (2016)\*\* 将“使用特权信息的学习”(Learning Using Privileged Information, LUPI)形式化,核心思想是在训练时向教师提供额外上下文,而推理时无需使用。 - \*\*Zhao et al. (2026a)\*\* 将这一思想应用于语言模型自蒸馏,提出让处于思考模式(thinking-enabled)的冻结教师为直接生成回答(direct-response)的学生提供监督,构成了本文所采用的核心实验设置。 - \*\*Shenfeld et al. (2026)\*\* 进一步探索了让教师以演示(demonstrations)为条件进行监督的方式。 --- ### 2. 特权信息内容、形式及其边际贡献 与本文同期或接近的研究开始追问:\*\*特权参考信息本身究竟贡献了多少?\*\* - \*\*Shrestha & Tessier (2026)\*\* 与 \*\*Ichihara et al. (2026)\*\* 发现,即使不给出与目标问题完全匹配的解答,甚至使用其他问题的参考,依然能够获得一定的监督收益,说明特权信息的价值并非完全来自于“揭示正确答案”。 - \*\*Zhao et al. (2026b)\*\* 比较了从完整解题痕迹到结构化指导的不同PI形式,发现结构化解题指导有时优于完整的推理痕迹。 - \*\*Harne et al. (2026)\*\* 指出,以特权信息为条件的教师可能产生偏好偏差(bias),从而破坏自蒸馏的有效性。 --- ### 3. 教师信号到学生行为的机制与障碍 一系列工作分析了教师打分信号如何影响学生模型的具体行为: - \*\*Kaur et al. (2026)\*\* 提出“抑制重新思考”(suppressed reconsideration)作为解释:当教师基于特权参考评分时,会系统性地压低学生回答中诸如 \*wait\*、\*but\*、\*check\* 等反思标记的概率,这可能损害深度推理能力。 - \*\*Nguyen et al. (2026)\*\* 指出,特权参考带来的似然度提升(privileged likelihood)并不自动等同于对正确token的有效信用分配(token credit)。 - \*\*Stanton et al. (2021)\*\* 从更广泛的知识蒸馏角度指出,更接近教师的模仿并不总是带来更好的泛化,强调了理解“教师信号真正鼓励学生学什么”的重要性。 --- ### 4. 蒸馏目标与训练机制的改进方法 针对上述问题,近期研究提出了多种修正方案: - \*\*Shen et al. (2026)\*\* 提出 Purified OPSD,试图在不丢失思考能力的前提下进行自蒸馏。 - \*\*Li et al. (2026c)\*\* 设计了 PHF(Privileged Hidden Flow),在隐藏层层面引入特权监督。 - \*\*Feng et al. (2026)\*\* 提出 PAST,利用完整的学生轨迹进行特权自适应。 - \*\*Sun et al. (2026)\*\* 探索了自参考的OPSD变体(SR-OPSD)。 - \*\*Li et al. (2026a)\*\* 与 \*\*Zhu et al. (2026)\*\* 对OPSD的现象学、机制及训练配方进行了系统性的重新审视。 --- ### 5. 数学推理数据集与评估基准 - \*\*Guha et al. (2026)\*\* 发布的 OpenThoughts-114k 是本文构建 \*\*AMPLE-MATH\*\* 的数据来源。 - 外部评估使用了 \*\*AIME 2024/2025\*\*(MAA, 2024; 2025)与 \*\*HMMT February 2025\*\*(HMMT, 2025)等竞赛数学基准。 --- 综上所述,本文处于一个快速展开的研究脉络之中:该脉络正从“证实OPSD有效”转向“精确解释其为何有效、何种特权信息真正有用、以及教师–学生交互中的何种机制决定最终迁移效果”。 Q3: 论文如何解决这个问题? 该论文通过\*\*控制变量实验设计\*\*、\*\*专用数据集构建\*\*、\*\*教师信号诊断\*\*与\*\*匹配干预\*\*相结合的系统方法,将特权信息(PI)的附加价值从同策略自蒸馏(OPSD)的基础收益中剥离出来。具体解决路径可归纳为以下八个方面: --- ### 1. 构建 AMPLE-MATH 控制套件以固定答案信息 为严格隔离“推理表示形式”与“答案内容”两种变量,论文基于 OpenThoughts-114k 构造了 \*\*AMPLE-MATH\*\*(Answer-Matched Privileged Levels of Explanation)。该套件包含 5,319 道数学题,每道题配备六种特权视图: - ANSWER ONLY、GIST、KEY POINTS、CLEAN SOLUTION、SUMMARY、FULL TRACE 所有视图共享\*\*同一个经过验证的最终答案\*\*,仅在推理过程的详略、组织方式与表达风格上存在差异。由此,任何不同视图间的性能差异都无法归因于答案本身,而只能来自于推理表示形式对教师监督信号的影响。 --- ### 2. 设立 Reference-Free 跨模式蒸馏基线 论文的核心对照并非“有 PI vs. 无蒸馏”,而是“有 PI 的蒸馏 vs. 无 PI 的蒸馏”。Reference-free 设置让教师仍处于思考模式(thinking-enabled),但\*\*不接收任何特权参考文本\*\*,仅基于问题本身对学生的直接回答(direct-response)前缀进行打分。 该基线保留了 OPSD 中“思考模式教师监督直接回答学生”的\*\*跨模式不对称性\*\*,但消除了额外参考信息。因此,将某视图的训练结果与 reference-free 结果对比,即可精确度量该视图带来的\*\*边际附加价值\*\*:

PI 附加价值 = View-v 学生性能 - Reference-free 学生性能
—- ### 3. 六视图与无参考控制在同一协议下平行比较 所有训练配置共享相同的超参数:学生使用 LoRA 适配器( r=64, α=128 )、直接回答生成上限 1,024 个 token、教师评分温度固定、优化步数一致。论文在 Qwen3-1.7B 与 SmolLM3-3B 两个模型家族上,于第 50 步与第 100 步等匹配检查点进行平行评估,确保观察到的差异来自 PI 内容而非训练随机性或模型特异性。 —- ### 4. 操纵学生训练轨迹以测试条件依赖性 在固定教师、固定参考文本(ANSWER ONLY / CLEAN SOLUTION / FULL TRACE)的条件下,论文将学生的训练 rollout 从**短直接回答**切换为**长思考模式生成**(thinking-enabled rollouts),同时保持思考模式评估不变。这一操作改变了学生生成的前缀分布与监督 horizons,但保持 PI 内容不变。 实验结果显示,所有视图在直接回答训练下带来的收益,在思考模式训练下均转变为损失。该现象证明:**特权信息的价值并非内在于参考文本本身,而是强烈依赖于学生生成响应的方式**。 —- ### 5. 教师画像(Teacher Profiling)解析 Token 级监督结构 为理解“教师如何对不同学生前缀作出反应”,论文在训练前与训练中冻结教师权重,对固定学生响应进行 Token 级诊断,定义并测量了以下指标: - **正确性对齐(Correctness Alignment, C_v )**:在同一问题内,正确响应与错误响应的平均教师–学生 log-概率位移之差:

Cv = (1) / (|X(textmix))| ∑(x ∈ X_mix) ( (1) / (|Y_x^+|) ∑(y ∈ Yx^+) Delta_v(y) - (1) / (|Y_x^-|) ∑(y ∈ Y_x^-) Delta_v(y) )

  • **修正标记压力(Correction Pressure, F_v )**:在采样到的反思标记(如 *wait*、*but*、*check*)上,教师相对于学生赋予的 log-概率偏移。 - **KL 时间分配**:完整词表 KL 散度在响应前、中、后段的分布比例。 这些画像在“冻结基座学生”与“训练后学生”的响应上重复进行,揭示了监督信号如何随学生分布演变而变化。 —- ### 6. 匹配干预实验区分“监督改变”与“行为改变” 基于画像线索,论文实施了一系列针对性干预,并在**匹配检查点**上比较效果,以排除“提前停止”等混淆因素: | 干预类型 | 操作 | 目的 | |—-|—-|—-| | **内容替换** | 将 CLEAN SOLUTION / KEY POINTS 替换为其他问题的同长度视图 | 测试参考内容的相关性 | | **Trace 截断** | 将 FULL TRACE 截断至 KEY POINTS / CLEAN SOLUTION / SUMMARY 长度,去掉答案与后续推理 | 测试“多长才够” | | **标记屏蔽** | 在 FULL TRACE / CLEAN SOLUTION 训练中排除或降权(0.1 倍)采样到的反思标记损失 | 测试“抑制重新思考”假说 | | **损失窗口扩展** | 将思考模式训练下的监督窗口从首 1,024 token(Early-1K)扩展至首 4,096 token(First-4K)或分布式四段窗口(Distributed-1K) | 测试长推理 rollouts 是否需要更广监督 | 关键发现是:看似有效的窗口扩展收益,在**相同检查点**对比时大部分消失,实际增益主要来自**更早停止训练**;而屏蔽反思标记几乎不改变学生行为。这些干预将“监督信号的变化”与“学生实际学习到的行为变化”解耦。 —- ### 7. 多维度评估与统计控制 论文采用问题级别的聚类自助法(problem-cluster bootstrap,10,000 次重采样)构建 95% 置信区间,并在多视图比较中应用 **Holm 校正**控制族错误率。此外,通过多训练种子(3–4 个种子)的 seed-aware 聚合与 seed-level t 区间,区分了问题采样不确定性与训练随机性。 —- ### 8. 综合归因:跨模式参数共享 vs. 特权参考 最终,论文将实证证据整合为以下结论框架: - **基础收益**:reference-free 配置已能产生显著的提升(尤其在 Qwen 中),这表明“思考模式教师监督直接回答学生”本身即可通过**共享参数**增强思考模式推理能力。 - **附加价值**:特权参考的边际贡献是有限且视具体的(Qwen 中 CLEAN SOLUTION 有 modest 证据,SmolLM3 中 FULL TRACE 在早期有 +2 点收益),远非“越多推理细节越好”。 - **交互决定论**:参考信息的价值取决于它如何与学生实际生成的轨迹交互;当学生轨迹从直接回答变为长思考时,同一参考会导致相反的迁移方向。 通过上述方法,论文将 OPSD 的改进成功分解为**跨模式蒸馏**与**特权信息附加价值**两个独立可测的分量,并证明后者必须相对于前者、且相对于学生的训练轨迹来评估。 Q4: 论文做了哪些实验? 论文围绕“特权信息在同策略自蒸馏中的附加价值”这一核心问题,设计了**六大类系统性实验**,涵盖从基础对照、轨迹操纵、信号诊断到匹配干预的完整证据链。以下按实验逻辑分述: —- ### 1. 核心对照实验:六种特权视图 vs. 无参考基线 基于自建的 **AMPLE-MATH** 数据集,论文为每道数学题构造了六种答案匹配的特权视图(Answer-Matched Views): - ANSWER ONLY - GIST - KEY POINTS - CLEAN SOLUTION - SUMMARY - FULL TRACE 所有视图共享同一验证答案,仅在推理表示的密度与形式上不同。实验以**直接回答(direct-response)作为学生训练轨迹**,以**思考模式(thinking-enabled)进行最终评估**,并与两类对照比较: - **Reference-free**:教师处于思考模式但看不到任何参考文本,仅对学生前缀打分; - **Wrong-answer control**:将 ANSWER ONLY 中的答案替换为其他问题的答案。 **主要发现**:在 Qwen3-1.7B 中,reference-free 训练已能产生显著的提升(step 100 时 +1.80 点),CLEAN SOLUTION 相对 reference-free 仅有 modest 的额外增益(+1.30 点,未通过 Holm 校正);而在 SmolLM3-3B 中,FULL TRACE 在 step 50 时比 reference-free 多出 +2.00 点,但到 step 100 所有配置均衰减至基线以下。 —- ### 2. 训练轨迹操纵实验:改变学生 Rollout 模式 在固定教师、固定参考文本(ANSWER ONLY / CLEAN SOLUTION / FULL TRACE)的条件下,将学生训练时的生成方式从**短直接回答(≤1,024 tokens)**切换为**长思考模式生成**(thinking-enabled rollouts,可达 20K+ tokens),评估仍保持思考模式。 **主要发现**:所有三种视图在直接回答训练下带来的增益,在思考模式训练下全部逆转为损失。Qwen 中九个训练配置–检查点对比的间隙全为负值(step 50 时 pooled gap 为 −7.60 点);SmolLM3 的 FULL TRACE 对比亦呈现 −6.84 点。该实验证明:**特权信息的价值并非内在于文本本身,而是依赖于学生实际生成的轨迹分布**。 —- ### 3. 教师信号画像实验(Teacher Profiling) 在训练前(冻结基座)与训练中(step-50 学生),对固定学生响应进行 Token 级诊断,系统测量三类指标: #### 3.1 正确性对齐(Correctness Alignment, C_v ) 对比同一问题内正确与错误响应的平均教师–学生 log-概率位移:

Cv = (1) / (|X(textmix))| ∑(x ∈ X_mix) ( (1) / (|Y_x^+|) ∑(y ∈ Yx^+) Delta_v(y) - (1) / (|Y_x^-|) ∑(y ∈ Yx^-) Delta_v(y) )
其中 Delta_v(y) = (1) / (|J(y)|) ∑
(t ∈ J(y)) ( log p(v,t)^(T)(y_t) - log p_t^(S)(y_t) ) 。 #### 3.2 修正标记压力(Correction Pressure, F_v ) 测量教师相对于学生在采样反思标记(如 *wait*、*but*、*check*、*reconsider* 等)上的 log-概率偏移。负值表示教师系统性地压低这些标记的概率。 #### 3.3 KL 时间分配(Temporal KL Allocation) 将完整词表上的 D(KL)(p_(v,t)^(T) | p_t^(S)) 按响应的四分位段分解,观察监督强度在响应前、中、后段的分布。 **主要发现**: - 正确性对齐的符号随学生前缀模式翻转:FULL TRACE 在直接回答前缀上为正(正确响应获更大位移),在思考模式前缀上为负; - 所有视图对修正标记均施加负压力,且该现象在两种前缀模式下共享; - KL 集中在前四分之一段,呈前重后轻分布。 —- ### 4. 匹配干预实验(Matched Interventions) 基于画像线索,论文在 Qwen3-1.7B 上实施 17 项单种子干预,在**固定检查点**(primarily step 100)上测试改变监督信号是否改变学生行为: #### 4.1 参考内容替换 - **Other-problem reference**:将 CLEAN SOLUTION 或 KEY POINTS 替换为另一道同长度视图的文本(含该问题的答案)。结果:两者均降低准确率约 2 点,证明内容相关性不可被长度匹配替代。 #### 4.2 Trace 截断(Trace Opening) - 将 FULL TRACE 截断至该问题自身的 KEY POINTS、CLEAN SOLUTION 或 SUMMARY 长度,去掉答案段与后续推理。结果:截断后的 opening 对思考模式评估无明确增益,但对直接回答评估有 +8 至 +11 点的提升,显示压缩改变了跨模式收益结构。 #### 4.3 修正标记损失重加权 - **Exclude**:在采样到的修正标记位置上排除损失; - **Downweight**:将该位置损失乘以 0.1。 结果:两项编辑均未在 step 100 产生准确率增益,且修正标记使用率几乎不变,表明“放松抑制”不等于“鼓励重新思考”。 #### 4.4 提示模板替换 - 将本地模板替换为原始 OPSD 模板(Zhao et al., 2026a)。结果:对 FULL TRACE 有轻微负面效应,对 CLEAN SOLUTION 几乎中性。 #### 4.5 损失窗口扩展(Loss Support) 针对思考模式训练下长响应的问题,比较三种监督窗口: - **EARLY-1K**:仅监督首 1,024 tokens(继承设置); - **FIRST-4K**:监督首 4,096 tokens; - **DISTRIBUTED-1K**:在推理段内放置四段 256-token 窗口。 结果:两种替代窗口在 development-selected 检查点上比 EARLY-1K 高约 4 点,但在**匹配检查点**(如共同 step 25 或 step 50)上优势降至 1 点以内且区间包含零。**停止时间解释了 76% 的表观增益**,损失设计本身的贡献不显著。 —- ### 5. 评估模式与前缀长度敏感性实验 #### 5.1 双模式评估 同一训练检查点分别用**思考模式**与**直接回答模式**进行评估。结果:Qwen 中 ANSWER ONLY 与 FULL TRACE 的相对排序在两种模式下完全反转——思考模式下 FULL TRACE 接近 ANSWER ONLY,直接回答模式下 FULL TRACE 落后 5–10 点。 #### 5.2 保存前缀分级(Saved-Prefix Grading) 对直接回答评估中存储的响应前缀,分别在 4K、8K、16K 和完整(Full)长度处截断并评分。 结果:Qwen step-100 时,FULL TRACE 在 4K 处领先,但在 8K 与 16K 处被 ANSWER ONLY 与 reference-free 反超;reference-free 相对于基线的增益仅在 16K 及完整评估中区间高于零。这说明参考选择影响响应长度与信息组织方式。 —- ### 6. 分层分析与稳健性验证 #### 6.1 按基座成功率分层 将测试集按冻结基座在直接回答下的成功次数(0/4、1–2/4、3–4/4)分为三层。结果:所有配置的最大增益集中在“基座直接回答从未成功,但思考模式有 62% 成功率”的零成功组;CLEAN SOLUTION 的附加增益也主要出现在该层。 #### 6.2 外部基准验证 在 AIME 2024、AIME 2025 与 HMMT February 2025 上,使用 12 样本 Avg@12 评估。结果:外部增益模式与领域内一致,reference-free 已贡献大部分提升,视图间差异不显著。 #### 6.3 原始 OPSD 数据验证 使用原始公开数据集与设置训练并评估。结果:step-50 时 pooled Avg@12 提升 +5.56 点,增益集中于基座“间歇性成功”的问题组。 #### 6.4 训练种子稳健性 Qwen 的 ANSWER ONLY 与 FULL TRACE 各使用 4 个训练种子,CLEAN SOLUTION 与 reference-free 使用 3 个种子。通过 seed-aware 聚合与 seed-level t 区间验证:CLEAN SOLUTION 的 modest 优势与评估模式交互效应在多种子下保持稳定。 —- ### 实验总结 上述实验共同支撑了论文的核心结论:OPSD 的改进主要由**跨模式蒸馏**(思考模式教师监督直接回答学生,通过共享参数迁移)解释;特权参考信息的附加价值是**条件性的、有限的**,且强烈依赖于学生训练轨迹。教师画像与匹配干预进一步表明:**改变 Token 级监督信号未必导致对应的行为改变**,在设计 privileged self-distillation 时需将参考内容与学生生成方式作为联合优化问题处理。 Q5: 有什么可以进一步探索的点? 基于论文的发现与局限,以下几个方面值得进一步探索: —- ### 1. 自适应特权参考内容 论文指出,参考设计与学生训练是一个联合问题(joint problem)。当前所有视图在训练全程保持固定。未来可探索**动态或自适应的参考生成策略**——例如,根据学生在训练过程中不同阶段的错误类型、响应长度或推理模式,实时调整提供给教师的参考内容(如从 GIST 逐步过渡到 FULL TRACE,或针对学生具体前缀缺陷生成针对性提示),以检验自适应参考是否能优于固定视图。 —- ### 2. 跨模式蒸馏的理论形式化 论文观察到大量改进源于“思考模式教师监督直接回答学生”的跨模式参数共享,但目前缺乏对此机制的形式化刻画。可进一步建立理论框架,量化**共享参数空间下直接回答与思考模式推理的耦合关系**,例如分析何种参数子空间承担了跨模式迁移,以及这种迁移的极限在哪里。 —- ### 3. 长推理链下的有效信用分配 当学生训练轨迹切换为长思考模式(thinking-enabled rollouts)时,现有损失窗口(首 1,024 token)仅覆盖推理链的前端。论文发现简单扩展窗口或分布式窗口并未在匹配检查点上带来显著增益。未来需设计**针对长推理链的精细化信用分配机制**,例如: - 基于推理结构(如步骤边界、验证点)的动态监督窗口; - 结合过程奖励模型(PRM)或步骤级评分,替代全局 KL 散度; - 探索如何在保持梯度稳定性的前提下,对反思、回溯等关键认知动作赋予正确的训练信号。 —- ### 4. 激发而非抑制反思行为 论文发现,直接放松对修正标记(如 *wait*、*but*)的损失惩罚几乎不改变学生的标记使用率。这表明“抑制”与“激发”反思之间存在不对称性。未来工作可探索: - **主动增强反思标记概率**的训练目标(如对这些标记施加正向梯度); - 分析反思行为与最终正确率之间的因果关系,而非仅观察相关性; - 在特权参考中显式包含“常见错误与纠正”元信息,引导教师强化而非弱化重新思考。 —- ### 5. 全参数微调与更长训练周期 当前实验基于短运行(100 步)的 LoRA 适配器。需验证结论在**全参数微调**和**更长训练周期**下的稳健性,特别是: - 特权参考的边际贡献是否会随训练步数增加而扩大或衰减; - 是否存在某个训练阶段后,参考-free 学生进入平台期,而特定视图继续提供收益; - 过拟合风险:更长训练是否会导致学生更强烈地模仿教师对参考的偏好,反而损害泛化。 —- ### 6. 跨领域与跨语言验证 实验局限于英语数学推理领域。未来应在**代码生成、科学问答、逻辑推理**等其他需要显式推理的领域复现该控制框架,以检验: - 不同领域中“跨模式蒸馏”与“特权信息附加价值”的相对重要性是否一致; - 多语言设定下,特权参考的语言与形式(如结构化代码 vs. 自然语言)如何影响迁移。 —- ### 7. 不同模型规模与架构的扩展性 论文仅在 Qwen3-1.7B 与 SmolLM3-3B 上进行验证。需在更大(如 7B、14B)或更小规模的模型上重复实验,观察: - 模型容量是否改变跨模式迁移的效率; - 大规模模型是否更擅长从密集参考(FULL TRACE)中提取额外信号,而小模型仅受益于简洁参考(GIST / KEY POINTS)。 —- ### 8. 教师评分温度的系统性分析 当前教师评分使用固定温度。可探索**教师温度的退火策略**或**自适应温度**:在训练早期使用较高温度以保留探索空间,后期降低以稳定收敛;或根据学生与教师的 KL 散度动态调整,以平衡监督强度与行为多样性。 —- ### 9. 特权信息的最优结构搜索 AMPLE-MATH 提供了六种人工设计的视图。未来可采用**自动化的参考形式搜索**(例如,利用元学习或教师模型自身生成不同密度的参考,并在开发集上验证哪种结构最大化 reference-free 之上的边际增益),从而发现超越人工先验的更优推理表示。 —- ### 10. 训练-评估模式错配的深入机制 论文发现直接回答训练配合思考评估有效,但思考训练配合思考评估却失效。需进一步解剖这一错配: - 直接回答前缀是否为思考模式推理提供了更“干净”的信用分配接口? - 长思考模式前缀是否引入了过多与正确性无关的方差(如风格、冗余回溯),导致教师 KL 信号噪声过大? - 是否可通过响应长度控制、格式约束或中途切换训练模式来缓解这一问题? —- 这些方向共同指向一个核心议题:**在 OPSD 中,特权信息的价值并非静态属性,而是教师信号、参考内容与学生轨迹三者动态交互的结果**。未来研究若能在自适应参考、长链信用分配与跨模式理论三个方向上取得突破,将有望显著提升自蒸馏的效率与可解释性。 Q6: 总结一下论文的主要内容 该论文系统研究了**同策略自蒸馏(On-Policy Self-Distillation, OPSD)中特权信息(Privileged Information, PI)的附加价值**,并将其与蒸馏过程本身带来的收益相分离。 ### 1. 研究问题 在 OPSD 中,一个处于思考模式(thinking-enabled)的冻结教师模型通过参考解答(如答案、解题过程)来监督直接生成回答(direct-response)的学生。此前研究普遍认为提供额外参考信息能提升学生性能,但未能回答一个核心问题:**这些改进在多大程度上真正源于特权信息本身,而非仅仅源于“思考模式教师监督直接回答学生”这一跨模式蒸馏机制?** ### 2. 核心方法 为严格分离这两种效应,论文构建了 **AMPLE-MATH**(Answer-Matched Privileged Levels of Explanation)数据集,并设计了控制实验: - **数据控制**:从 OpenThoughts-114k 中选取 5,319 道数学题,每道题构造 6 种特权视图(Answer Only、Gist、Key Points、Clean Solution、Summary、Full Trace)。所有视图共享**同一个经过验证的最终答案**,仅在推理表示的密度与形式上不同。 - **基线对照**:设立 **Reference-free** 基线,即教师仍处于思考模式,但**不接收任何特权参考文本**,仅基于问题本身对学生前缀打分。通过对比各视图与 reference-free 学生的性能差异,精确度量特权信息的边际贡献。 - **模型与设置**:在 Qwen3-1.7B 与 SmolLM3-3B 上,使用 LoRA 适配器进行短周期训练,主要采用“直接回答训练 + 思考模式评估”协议,并在匹配检查点上进行系统对比。 - **教师画像**:在固定学生响应上,测量正确性对齐(Correctness Alignment, C_v )、修正标记压力(Correction Pressure, F_v )与 KL 时间分配,解析 Token 级监督结构。 - **匹配干预**:通过替换参考内容、截断推理痕迹、调整损失窗口与修正标记权重等干预,在固定检查点上测试“改变监督信号”是否导致“学生行为改变”。 ### 3. 主要发现 - **蒸馏本身贡献主体**:在 Qwen 中,reference-free 训练已能产生显著的提升(领域内与外部基准均有改善),而 CLEAN SOLUTION 等视图的额外增益 modest(约 +1.3 点),且未通过多重比较校正。这表明 OPSD 的很大部分改进来自跨模式参数共享,而非特权信息本身。 - **参考价值的模型与阶段依赖性**:在 SmolLM3 中,FULL TRACE 在 step 50 时比 reference-free 多出 +2.00 点,但到 step 100 所有配置均衰减至基线以下。说明特权信息的附加价值依赖于具体模型与训练阶段。 - **学生训练轨迹的决定性作用**:在固定教师与参考文本的条件下,仅将学生训练时的生成方式从“短直接回答”切换为“长思考模式 rollouts”,即可将所有视图的增益逆转为显著损失。这证明**特权信息的价值并非内在于文本,而是强烈依赖于学生实际生成的轨迹分布**。 - **干预与画像的启示**: - 教师画像显示,正确性对齐的符号随学生前缀模式翻转;所有视图均对反思标记(如 *wait*、*but*)施加负压力。 - 将损失窗口从首 1,024 token 扩展至 4,096 token 或分布式窗口,其表观收益在匹配检查点上基本消失——**76% 的增益实际来自更早停止训练**,而非损失设计本身。 - 放松对修正标记的损失惩罚几乎不改变学生的标记使用率,表明“减少抑制”不等于“主动鼓励重新思考”。 ### 4. 结论与意义 论文的核心结论是:**OPSD 可改进学生对已有推理能力的访问,其主要机制是通过共享参数实现的跨模式转移(从直接回答参数到思考模式推理)。特权参考信息的价值应被衡量为它对这一基础蒸馏过程的增量贡献,而非它向教师揭示了多少解题内容。** 该研究将 OPSD 的改进成功分解为**跨模式蒸馏收益**与**特权信息附加价值**两个独立可测的分量,强调参考内容设计与学生训练轨迹是一个需要联合优化的整体问题,为未来蒸馏策略与特权监督的设计提供了可复用的控制框架与实证基础。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: XiuYu Zhang,Wei Chow,Junfeng Fang,Zhenkai Liang,Tat-Seng Chua

Categories:

PDF URL: https://arxiv.org/pdf/2609.20612.pdf

Arxiv URL: https://arxiv.org/abs/2609.20612

Arxiv ID: 2609.20612

CoolPaper URL: https://papers.cool/arxiv/2609.20612

Published: 2026-09-19T01:34:47.786Z

Updated: 2026-09-19T01:34:47.786Z


18. UFO: Chain-of-Evaluation for Omni-Condition Alignment in Multi-Modal Image Generation

Abstract:Multi-modal image generation, particularly subject-driven customization, has garnered growing attention in recent years. Despite the rapid advancement of generative models, their evaluation remains largely lagging. Existing methods, whether embedding-based or Multi-modal Large Language Model (MLLM)-based, evaluate alignment with each modal condition in isolation, which contradicts the simultaneous condition alignment objective of multi-modal image generation, leading to poor consistency with human judgments. To address this challenge, we propose UFO, the first unified framework for omni-condition alignment simultaneous evaluation. Specifically, UFO introduces a novel Atomized Chain-of-Evaluation paradigm, i.e., it first decomposes omni-condition alignment into a sequential chain of fine-grained, disentangled Atomic Evaluation Units (AEUs), categorizes them into distinct modality-relevance classes, and then employs general or dedicated functional calls for accurate verification of different AEU types. Experimental results demonstrate that UFO achieves the highest correlation with human evaluation preferences, delivering an average improvement of 15.25%. Furthermore, we present UFO-Bench, a dedicated benchmark designed to holistically evaluate the performance of existing customization models under the diverse mutual interactions of textual and visual conditions.

中文摘要

摘要:多模态图像生成,尤其是以主体为驱动的定制化,近年来受到越来越多的关注。尽管生成模型发展迅速,但其评估仍远远滞后。现有的方法,无论是基于嵌入的方法还是基于多模态大型语言模型(MLLM)的方法,都是孤立地评估与每种模态条件的对齐情况,这与多模态图像生成中同时条件对齐的目标相悖,导致与人类判断的一致性较差。为了解决这一挑战,我们提出了UFO,这是首个用于全条件对齐同时评估的统一框架。具体而言,UFO引入了一种新颖的原子化评估链(Atomized Chain-of-Evaluation)范式,即首先将全条件对齐分解为一系列细粒度、解耦的原子评估单元(AEUs),将其分类到不同的模态相关类别中,然后采用通用或专用的功能调用对不同类型的AEU进行准确验证。实验结果表明,UFO与人类评估偏好具有最高的相关性,平均提升15.25%。此外,我们还提出了UFO-Bench,这是一个专门设计的基准,旨在在文本和视觉条件的多样化相互作用下,全面评估现有定制化模型的性能。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决多模态图像生成(特别是主体驱动定制任务)中\*\*评估方法严重滞后于生成模型发展\*\*的问题。现有评估范式存在以下核心缺陷: - \*\*孤立评估与生成目标相矛盾\*\* 现有评估器(无论是基于嵌入的方法如 CLIP、DINO,还是基于多模态大语言模型的方法如 VIEScore、DreamBench++)均\*\*孤立地\*\*评估生成图像与单个模态条件(文本条件或视觉条件)的对齐程度。然而,主体驱动定制的本质目标是\*\*同时满足\*\*文本和视觉条件,其中文本条件通常涉及对参考图像中主体特定属性的修改。这种孤立评估范式与多模态生成的"同时条件对齐"(simultaneous condition alignment)目标存在内在冲突。 - \*\*孤立评估导致系统性的误判\*\* 由于忽视文本指令对参考主体的修改意图,现有方法产生显著的假阳性(False Positive)和假阴性(False Negative): - \*\*假阳性\*\*:生成图像与参考主体视觉高度相似但忽略了文本编辑要求(如未按指令改变发色)时,现有评估器仍给出高分;或未能检测细微身份差异(如遗漏参考图像中的辫子)。 - \*\*假阴性\*\*:生成图像正确执行了文本编辑且保留了主体身份,但因与参考图像的视觉相似度降低而被错误惩罚。 - \*\*现有基准测试缺乏复杂的模态交互场景\*\* 当前基准测试主要包含简单的背景变换或单一属性更改,缺乏文本与视觉条件之间的\*\*多样化交互\*\*,尤其是\*\*冲突条件对\*\*(conflicting condition pairs)。这使得现有测试无法有效评估模型在"保持身份"与"执行复杂语义修改"之间进行权衡的能力,难以覆盖自由形式生成中的真实挑战。 为应对上述挑战,论文提出了首个统一的全条件同时评估框架 \*\*UFO\*\*(UniFied Omni-condition alignment evaluation),并构建了专门设计的基准测试 \*\*UFO-Bench\*\*,以实现对主体驱动定制模型在复杂多模态交互下的可靠、可解释评估。 Q2: 有哪些相关研究? 与这篇论文相关的研究主要涵盖\*\*主体驱动图像生成模型\*\*、\*\*基准测试\*\*以及\*\*评估指标\*\*三个方向,具体如下: ### 1. 主体驱动图像生成(Subject-Driven Image Generation) 近年来研究聚焦于构建能够统一处理多样化生成与编辑任务的模型: - \*\*OmniGen2\*\*

30
:通过分离解码器与图像分词器,支持文本到图像生成、图像编辑及上下文感知合成。 - **UNO**
31
:采用模型-数据协同进化策略,引导高分辨率数据生成并确保语义上下文一致性输出。 - **Nano Banana**
3
:闭源方案,可在单一框架内联合处理文本与图像输入,同时支持图像生成与编辑。 - **Qwen-Image**
29
:基于多模态大语言模型架构,实现了高质量且灵活的主体感知生成与编辑能力。 - **BAGEL**
4
:引入混合Transformer专家(MoT)架构,将多模态理解与生成分别建模,并通过共享自注意力机制实现跨模态协作。 ### 2. 主体驱动图像生成基准测试(Benchmarks) 现有基准测试主要围绕编辑任务构建,但在评估维度与条件交互复杂度上存在局限: - **DreamEditBench**

14
与 **ImagenHub**
11
:提供了主体驱动编辑的标准化数据集与评估协议。 - **DreamBooth3D**
22
:将主体驱动方法扩展至三维场景,评估几何一致性生成能力。 - **DreamBench++**
19
:引入强视觉语言模型(VLM)以近似人类判断标准。 - **DSH-Bench**
28
:构建分层分类体系(简单/中等/困难),支持更细粒度的性能诊断。 - **Beyond the Pixels**
24
:采用分层VLM提示策略(如特征决策树),试图超越表层的视觉相似度评估。 ### 3. 评估指标(Evaluation Metrics) 现有自动评估指标可分为客观嵌入指标与基于大语言模型的指标两类: **客观嵌入指标(Objective/Embedding-based Metrics)** - **Inception Score (IS)**

23
与 **Fréchet Inception Distance (FID)**
8
:早期用于评估生成图像视觉质量与分布差异的经典指标。 - **CLIPScore (CLIP-T / CLIP-I)**
7, 21
:基于CLIP模型评估文本-图像对齐或图像-图像相似度。 - **DINO**
32
:利用自监督视觉表征,提升对对象级别及细粒度语义差异的敏感度。 **基于大语言模型的指标(LLM/MLLM-based Metrics)** - **VIEScore**
12
:利用多模态大语言模型(MLLM)将语义一致性与感知质量分解为细粒度子标准进行逐项评分,但评估仍局限于图像整体层面。 - **DreamBench++**
19
:针对个性化图像生成任务,将评估显式拆分为两个独立维度——Image-Image Concept Preservation(主体特征保持)与 Text-Image Prompt Following(文本指令遵循),但依赖对单个生成结果的绝对评分,难以捕捉细粒度质量差异与复杂人类偏好。 上述相关工作的共同局限在于:它们通常**孤立地**评估文本与视觉条件,缺乏一个统一框架来推理自由形式生成中身份保持与复杂语义修改之间的冲突与权衡。这正是本文所针对的核心缺口。 Q3: 论文如何解决这个问题? 为系统性地解决多模态图像生成评估中”孤立评估导致与人类判断不一致”及”基准测试缺乏复杂模态交互”的问题,论文从**评估框架**与**基准测试**两个维度提出了完整的解决方案。 —- ### 1. 统一全条件对齐评估框架:UFO UFO(UniFied Omni-condition alignment evaluation)首次提出了一种**原子化链式评估(Atomized Chain-of-Evaluation)**范式,将原本耦合的全条件对齐任务解耦为可解释、可验证的细粒度步骤。该框架包含四个核心阶段: #### 阶段一:原子化评估单元分解(AEUs Decomposition) 不同于现有方法直接对生成图像输出单一整体分数,UFO 首先将全条件对齐拆解为一系列**细粒度、解耦的原子评估单元(Atomic Evaluation Units, AEUs)**。具体地,以参考图像 I(ref) 与文本指令 T(ref) 为输入,利用视觉语言模型(VLM)进行联合推理,将评估目标分解为跨越两个层级(**局部具象组件**与**全局抽象属性**)的语义单元。例如,可将”人物”分解为”面部身份””灰色背包””黄色雨衣””性别””年龄段”等独立AEU,使评估目标明确且可度量。 #### 阶段二:模态相关性分类(Modality-Relevance Classification) 由于不同AEU在多模态约束下的依赖关系各异,UFO 进一步为每个AEU分配**模态相关性类别** ri ,明确其受何种条件主导: - **image-only**:仅受视觉条件约束(如核心身份特征,需与参考图像保持一致) - **text-only**:仅受文本条件约束(如文本新增的局部道具或风格描述) - **text-and-image**:受双模态联合约束(如文本要求修改的某些视觉属性,需在保持主体可识别的前提下执行变化) 这一分类确保每个属性均依据正确的条件类型进行评估,避免视觉相似性指标错误地覆盖文本编辑要求。 #### 阶段三:VQA 与专家函数调用评分(VQA and Function Calls Scoring) 针对每个AEU,UFO 采用两种机制进行精确量化: - **通用VQA查询**:将AEU转化为视觉问答问题,输入查询、参考文本、参考图像与生成图像 I(gen) 至VLM,由其输出”Yes/No”判断,并映射为离散分数:

s_i = 1, & if the answer is Yes, 0, & if the answer is No.

  • **专用函数调用**:对于VLM难以精确度量的维度(如人脸身份一致性),UFO 自动调用专用工具。例如,当检测到面部身份AEU时,调用ArcFace计算参考图像与生成图像的归一化特征距离,并转化为连续分数:
    si = 1 - d(ArcFace)(I(ref), I(gen))
    其中 $d_(ArcFace) ∈
    0,1
    为归一化后的特征距离。 #### 阶段四:自适应重要性加权聚合(Weighted Aggregation) 为对齐人类偏好中不同语义组件的重要性差异,UFO 通过VLM基于参考图像与文本指令进行推理,为每个AEU分配非负权重 w_i ∈ 1,2,3,4,5$。例如,若文本指令明确要求修改发色,则颜色相关AEU获得更高权重;而次要属性的不一致对最终得分影响有限。最终的全条件对齐分数通过加权平均计算:

Score(I(gen)) = ∑(i=1)^(N) wi · s_i∑(i=1)^(N) w_i
该聚合策略使UFO能够联合考量不同语义条件的相对重要性,生成更具可解释性且与人类判断更一致的评估结果。 —- ### 2. 专用基准测试:UFO-Bench 为弥补现有基准在”模态交互多样性”与”冲突条件”方面的不足,论文构建了 **UFO-Bench**,其设计核心如下: - **多层次编辑范式**:围绕四种编辑范式构建——**Non-Editing**(仅重背景/重语境化)、**Local Editing**(局部元素增改)、**Global Editing**(全局风格/材质变换)、**Complex Editing**(全局+局部复合编辑)。 - **三级难度层级**:从简单背景替换到同时修改局部配饰与全局风格的复杂指令,系统性地测试模型在身份保持与文本遵循之间的权衡能力。 - **高比例冲突条件对**: benchmark 包含 **81.97%** 的冲突条件对,即文本指令要求修改参考图像中的某些主体属性,迫使评估指标必须真正理解”什么应该变、什么应该留”,而非仅依赖像素级或特征级相似度。 - **广泛的主体类别**:覆盖7大核心类别(刚性物体、柔性物体、人物、全身角色、动物、Logo、场景),共计660个 diverse cases,确保评估的泛化性。 —- ### 3. 方案的核心优势总结 | 现有方法局限 | UFO 解决方案 | | :—- | :—- | | 孤立评估文本/视觉条件 | 模态相关性分类,明确每个原子单元应服从的条件来源 | | 整体打分难以捕捉细粒度错误 | 原子化分解为局部组件与全局属性,实现像素-语义级别的诊断 | | VLM对身份等维度精度不足 | 引入专用函数调用(如ArcFace),弥补通用模型的能力边界 | | 所有属性同等对待,不符合人类偏好 | 自适应重要性加权,关键属性(如身份、核心编辑要求)权重更高 | | 基准缺乏冲突条件与复杂交互 | UFO-Bench设计81.97%冲突对及四级编辑范式,覆盖真实应用场景 | 通过上述原子化、条件感知、工具增强与偏好加权的链式评估机制,UFO 实现了对多模态生成模型全条件对齐能力的统一、可解释且高保真评估。 Q4: 论文做了哪些实验? 论文围绕所提出的评估框架 UFO 与基准测试 UFO-Bench,从**模型能力评估**、**人类偏好对齐验证**、**模块消融分析**及**定性案例比较**四个层面开展了系统性实验。 —- ### 1. 实验设置 - **评判模型(Judge Model)**:采用 GPT-4o(版本 2024-05-13)作为视觉语言模型(VLM),负责执行结构化解析、视觉问答(VQA)及 AEU 级评分。 - **被评估的生成模型**:涵盖闭源商业模型(Doubao、Nano-Banana)与开源社区模型(Qwen-Image、OmniGen2、BAGEL、UNO),均使用官方推理管线与推荐超参数。 - **基线评估指标**: - 非 LLM 指标:CLIP-I、CLIP-T、DINO - MLLM 指标:VIEScore(含 SC、PQ、O 三个子维度)、DreamBench++ - **人工评估与对齐协议**:在随机采样的 100 个测试用例上,对 6 个模型生成的 600 张图像进行人工排序(1–6 名)。自动指标同样对每组的 6 张输出打分并转换为相对排序。通过计算**逐案例 Spearman 秩相关系数**(并经 Fisher Z-变换聚合)来度量自动指标与人类判断的一致性,相关系数越高表示对齐程度越强。 —- ### 2. UFO-Bench 上的定量模型评估 为全面评估当前最优模型的定制化生成能力,论文对每对参考图像-文本提示采样 4 次(共 2,640 实例/模型),使用 UFO 指标进行打分。主要发现包括: - **闭源模型表现领先**:Doubao 取得最高总分(0.7439),且在局部编辑(Local)与全局编辑(Global)任务上均表现稳健,体现出对细粒度属性操控的强理解能力。 - **开源模型具备竞争力**:Qwen-Image 总分达 0.7252,超越闭源模型 Nano-Banana(0.6816),尤其在非编辑(Non-Editing, 0.7635)与全局编辑(0.7836)上表现突出,甚至略高于 Doubao。但其在局部编辑任务上明显下降(0.6532),揭示了当前开源扩散架构在**精确文本引导局部编辑**方面的普遍短板。 - **其他开源模型差距明显**:OmniGen2、UNO 与 BAGEL 总分介于 0.38–0.45 之间,复杂编辑(Multi-Dim-Editing)能力仍待提升。 —- ### 3. 与人类判断的相关性验证 论文将 UFO 与既有指标进行 head-to-head 的**人类偏好对齐度**对比,结果如下: - **传统嵌入指标严重失准**:CLIP-T 呈现负相关( -0.1996 ),表明仅关注全局文本-图像对齐无法可靠评估个性化任务;CLIP-I 与 DINO 虽呈弱正相关(约 0.3 sim 0.4 ),但在局部编辑等细粒度场景下捉襟见肘。 - **MLLM 指标有所改善但存在瓶颈**:VIEScore 与 DreamBench++ 借助 GPT-4o 的推理能力将相关性提升至 0.55 sim 0.60 区间,但它们在**局部编辑**场景下停滞在约 0.58 ,原因是缺乏显式机制将”编辑区域”与”需保留的背景”解耦,无法精准识别局部篡改与主体保持之间的冲突。 - **UFO 显著优于所有基线**:UFO 在 Total 上达到 **0.6889**,相较 DreamBench++(0.5977)提升约 **15.26%**。在各子任务上,UFO 均取得最高 Spearman 相关系数: - Non-Editing: 0.8034 - Local Editing: 0.6837 - Global Editing: 0.6295 - Multi-Dim Editing: 0.7241 这表明 UFO 的原子化、条件感知评估机制能更准确地反映人类对”什么该变、什么该留”的复杂偏好。 —- ### 4. 消融实验 为验证 UFO 核心组件的有效性,论文进行了两项消融研究: | 设置 | 与人类偏好的 Spearman 相关性 | | :—- | :—- | | UFO w/o AEUs Decomposition(无原子分解,直接整体打分) | 0.5752 | | UFO w/o Weighted Aggregation(无自适应加权,统一权重为 1) | 0.6253 | | **UFO(完整设置)** | **0.6889** | - **原子分解的必要性**:移除 AEUs Decomposition 后,相关性从 0.6889 骤降至 0.5752。这说明直接对生成图像进行整体评分难以捕捉复杂的视觉细节与条件冲突,而原子化拆解是实现精确、鲁棒评估的关键。 - **加权聚合的必要性**:采用均匀权重替代自适应加权后,相关性降至 0.6253。这表明,若将所有属性同等对待,次要属性的瑕疵会过度惩罚总分,而关键视觉特征或核心文本指令的成功对齐又未能获得充分奖励,导致与人类判断偏离。 —- ### 5. 定性分析 论文通过代表性案例(Figure 6),从三个维度直观展示 UFO 的可靠性: - **多模态冲突条件**(左列):当文本要求将主体改为”冰雕”时,Image A 未执行编辑但因视觉相似被 VIEScore 高估(0.849),而正确执行编辑的 Image B 被 VIEScore 低估(0.794)。UFO 则正确给出 Image A 低分(0.754)、Image B 高分(0.934)。 - **细粒度分解**(中列):在要求添加”折纸地图”与”红色雨衣”的复杂编辑中,Image A 丢失了参考图像中的翅膀细节。VIEScore 因整体视觉尚可而给出较高分数(0.748),UFO 通过原子级检查识别出翅膀缺失,给出低分(0.246)。 - **人脸身份验证**(右列):在评估面部身份一致性时,VIEScore 难以区分细微身份差异(Image A 与 B 得分几乎相同),而 UFO 通过调用 ArcFace 专家工具,依据客观的人脸特征距离正确判别两者差异(Image A: 0.865 vs. Image B: 0.919)。 这些案例共同证明,UFO 在**冲突条件解析**、**细粒度局部诊断**及**高精度身份验证**方面均优于现有的整体式评估指标。 Q5: 有什么可以进一步探索的点? 基于该论文的工作,以下方向值得进一步探索: —- ### 1. 向更复杂的多模态生成场景泛化 论文在主体驱动个性化图像生成上验证了 UFO 的有效性,但明确提及当前聚焦于“基础且定义良好的个性化设置”。未来可将原子化链式评估范式扩展至: - **多图条件生成**:如基于多张参考图进行身份融合或风格迁移; - **多轮对话式编辑**:评估历史上下文与当前指令的联合一致性; - **视频与 3D 生成**:将 AEUs 从静态空间属性扩展到时序一致性、动作连贯性、几何保真度等维度。 ### 2. 提升评估效率与可部署性 当前 UFO 依赖 GPT-4o 进行多阶段推理(分解、分类、VQA、加权),计算开销较大。进一步研究可聚焦于: - **轻量级专用模型**:通过蒸馏或微调 smaller VLMs(如 InternVL、LLaVA 系列)替代通用大模型,以降低延迟与 API 成本; - **并行化与缓存策略**:对参考图像的 AEU 分解结果进行缓存,避免对同一参考图重复推理; - **端到端训练**:探索可微分的原子化评估网络,将离散的 VQA 与函数调用整合为可梯度优化的单一模型。 ### 3. 专家工具库的动态扩展 UFO 目前仅展示了 ArcFace 作为人脸身份验证的专用函数调用。未来可构建更丰富的**领域专家工具库**,例如: - 姿态估计器(评估人体/动物姿态一致性); - 风格度量工具(评估艺术风格迁移的精确度); - 场景图/目标检测器(验证空间关系与局部物体存在性); - 光学字符识别(评估 Logo 或文本渲染的准确性)。 同时,可引入**自适应工具选择机制**,由 VLM 根据输入自动决定调用何种专家工具,而非预设规则。 ### 4. 数据驱动的自适应权重学习 当前 UFO 通过 VLM 启发式推理为 AEU 分配离散权重( w_i ∈ 1,2,3,4,5 )。更深层的人类对齐可通过以下方式实现: - **基于偏好数据训练奖励模型**:收集大规模人类对 AEU 重要性的判断,训练专门的权重预测网络; - **非线性聚合函数**:探索除加权平均外更复杂的聚合策略(如基于注意力机制、条件随机场或人类排序学习得到的聚合器),以捕捉 AEU 间的依赖关系与补偿效应。 ### 5. 动态与层次化的 AEU 分解策略 当前分解范式可能产生固定粒度的 AEUs。未来可研究: - **自适应粒度控制**:根据主体复杂度与编辑难度动态决定分解层级(简单对象粗粒度、复杂对象细粒度); - **层次化一致性推理**:在局部组件与全局属性之外,引入“关系级”或“场景级”AEUs,评估主体与环境的交互逻辑一致性。 ### 6. 极端冲突条件下的评估机制 UFO-Bench 已包含 81.97% 的冲突条件对,但冲突强度主要集中在属性编辑层面。更具挑战性的场景包括: - **文本指令要求移除核心身份特征**(如“将这只猫变成狗”); - **多文本条件间的矛盾**(如同时要求“雨天”与“烈日当空”); - **视觉与文本条件的系统性对抗**。 研究 UFO 在此类极端冲突下的评估行为与分数分布,有助于完善多模态生成评估的理论边界。 ### 7. 可解释性诊断与交互式评估工具 UFO 的原子化特性天然适合构建**细粒度诊断报告**。未来可开发交互式可视化工具: - 为每个生成样本输出 AEU 级得分卡片,直观展示模型在“身份保持”“局部编辑”“全局风格”等维度的具体表现; - 支持用户自定义权重,实现面向特定应用场景(如广告设计更重品牌一致性,艺术创作更重风格遵循)的定制化评估。 ### 8. 扩展基准测试的规模与文化多样性 UFO-Bench 目前涵盖 660 个 cases。进一步可: - 扩大至数千乃至上万实例,覆盖更多稀有类别与长尾属性; - 引入跨文化主体(如民族服饰、地域标志性建筑),验证评估框架的跨文化鲁棒性; - 纳入更多隐含性文本指令(如情感氛围、社会语境),测试模型与评估指标对高层语义的理解深度。 Q6: 总结一下论文的主要内容 该论文针对**主体驱动图像生成**中**评估方法严重滞后**的问题,提出了首个面向全条件同时对齐的统一评估框架及其配套基准。以下是主要内容概述: —- ### 研究背景与核心问题 多模态图像生成(特别是主体驱动定制)要求生成图像**同时满足**文本指令与参考视觉条件。然而,现有评估器(如 CLIP、DINO、VIEScore、DreamBench++)均**孤立地**评估生成图像与单个模态的对齐程度,忽视了文本指令往往包含对参考主体属性的显式修改。这种“孤立评估”范式导致严重的**假阳性**(忽视文本编辑要求却因视觉相似获高分)与**假阴性**(正确执行编辑却因视觉变化被惩罚),与人类判断一致性差。此外,现有基准缺乏复杂的文本-视觉条件交互与冲突场景,难以全面衡量模型的真实能力。 —- ### 方法:UFO 评估框架 论文提出 **UFO**(UniFied Omni-condition alignment evaluation),一种**原子化链式评估(Atomized Chain-of-Evaluation)**范式,将全条件对齐拆解为可解释、可度量的细粒度步骤: 1. **原子化评估单元分解(AEUs Decomposition)** 基于参考图像与文本指令,利用视觉语言模型(VLM)将评估目标分解为**局部具象组件**与**全局抽象属性**两个层级的原子评估单元(AEUs),如“面部身份”“灰色背包”“性别”等。 2. **模态相关性分类(Modality-Relevance Classification)** 为每个 AEU 标注其受何种条件约束: - **image-only**(仅视觉条件,如核心身份) - **text-only**(仅文本条件,如新增道具) - **text-and-image**(双模态联合约束,如文本指定的外观修改) 3. **VQA 与专家函数调用评分(VQA and Function Calls Scoring)** 对每个 AEU,通过 VQA 查询获得离散分数 s_i ∈ 0, 1 ;或调用专用工具(如 ArcFace)获得连续分数,例如人脸身份分数:

si = 1 - d(ArcFace)(I(ref), I(gen))

  1. **自适应重要性加权聚合(Weighted Aggregation)** 通过 VLM 推理为每个 AEU 分配重要性权重 wi ∈ 1,2,3,4,5 ,最终得分为加权平均:
    Score(I
    (gen)) = ∑(i=1)^(N) w_i · s_i∑(i=1)^(N) w_i
    —- ### 方法:UFO-Bench 基准测试 论文构建 **UFO-Bench**,专门用于评估复杂多模态交互下的主体驱动生成: - **7 大主体类别**(人物、全身角色、动物、刚性/柔性物体、Logo、场景),共 660 个测试样例 - **4 种编辑范式**:非编辑(Non-Editing)、局部编辑(Local Editing)、全局编辑(Global Editing)、复杂编辑(Complex Editing) - **3 级编辑难度**,包含 **81.97%** 的冲突条件对,强制模型与评估指标在“身份保持”与“文本编辑”之间做出精确权衡 —- ### 实验结果 - **模型能力评估**:在 UFO-Bench 上评估 6 个主流模型。闭源模型 Doubao 综合表现最佳(总分 0.7439);开源模型 Qwen-Image 表现突出(总分 0.7252),但在局部编辑任务上存在明显短板。 - **人类偏好对齐**:相比既有指标,UFO 与人类排序的 Spearman 相关系数达到 **0.6889**,相较现有最优方法(DreamBench++ 的 0.5977)平均提升 **15.25%**,尤其在局部编辑与复杂编辑场景下优势显著。 - **消融验证**:移除原子化分解(整体打分)后相关性降至 0.5752;移除自适应加权(统一权重)后降至 0.6253,证明两组件均为必要设计。 —- ### 主要贡献 - **概念层面**:将多模态图像评估重新定义为“在自由形式多模态条件下的原子化、条件感知推理”。 - **技术层面**:提出 UFO 链式评估框架,集成细粒度原子分解、条件感知 VLM 评估与专家工具调用。 - **基准层面**:构建 UFO-Bench,提供涵盖多样主体类别与层级编辑场景的细粒度测试平台。 - **实验层面**:大量实验证实 UFO 在与人类判断的一致性上显著优于现有嵌入类与 MLLM 类指标。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Danning Zhang,Yijing Lin,Shuhan Zhuang,Mengqi Huang,Shaojin Wu,Shancheng Fang,Zhendong Mao

Categories:

PDF URL: https://arxiv.org/pdf/2609.12397.pdf

Arxiv URL: https://arxiv.org/abs/2609.12397

Arxiv ID: 2609.12397

CoolPaper URL: https://papers.cool/arxiv/2609.12397

Published: 2026-09-19T01:34:50.636Z

Updated: 2026-09-19T01:34:50.636Z


19. Don’t Mask the Environment: Observation Supervision Changes How Agents Explore Under RL

Abstract:Agent trajectories record what an agent does and what happens next. Yet standard supervised fine-tuning (SFT) applies loss only to agent-authored action tokens, using environment observations as context but not as prediction targets. We ask whether this convention provides the best initialization for subsequent reinforcement learning. We introduce ActObs, which also supervises the observation tokens already present in each trajectory. Although deployed agents never generate observations, learning to predict them encourages the policy to model action consequences without adding data, parameters, sequence tokens, or forward passes. The methods perform similarly after SFT but diverge after GRPO. On Qwen3-4B, GRPO from ActObs achieves higher pass@k at every evaluated sampling budget than its action-only counterpart on Terminal-Bench 2.0. On Qwen3-8B, it trades some pass@1 reliability for higher pass@k (+3.4 pp at pass@16) and solves more distinct tasks. The advantage extends to cross-domain code editing on aider-polyglot (+4.2 pp at pass@1 at 4B), whose tasks are unseen during SFT and RL. ActObs retains more entropy during RL while requiring less policy movement, leaving the final policy closer to its SFT initialization. Our analysis traces this difference to SFT: action and observation gradients rapidly become orthogonal, while action-only training leaves a large residual observation gradient and degrades environment prediction below the base model. Joint supervision prevents this one-sided specialization, preserving consequence prediction and preparing the policy for downstream exploration.

中文摘要

摘要:代理轨迹记录了代理的行为及其后续发生的事情。然而,标准的监督微调(SFT)仅对代理生成的动作令牌应用损失,将环境观测作为上下文,但不作为预测目标。我们探讨这种惯例是否为后续强化学习提供了最佳初始化。我们引入了 ActObs,它也监督每个轨迹中已经存在的观测令牌。尽管部署的代理从不生成观测,但学习预测观测可以在不增加数据、参数、序列令牌或前向传播的情况下,鼓励策略去建模动作的后果。这些方法在 SFT 后表现相似,但在 GRPO 后出现分化。在 Qwen3-4B 上,从 ActObs 进行 GRPO 的 pass@k 在每个评估的采样预算下都高于仅动作训练的对照组,在 Terminal-Bench 2.0 上表现如此。在 Qwen3-8B 上,它以牺牲部分 pass@1 可靠性为代价,获得更高的 pass@k(pass@16 提升 3.4 个百分点)并解决了更多不同的任务。这种优势也扩展到了跨领域代码编辑任务,如 aider-polyglot(在 4B 时 pass@1 提升 4.2 个百分点),这些任务在 SFT 和 RL 中均未见过。ActObs 在 RL 期间保留了更多熵,同时需要较少的策略移动,使最终策略更接近其 SFT 初始化。我们的分析将这种差异追溯到 SFT:动作和观测梯度迅速变得正交,而仅训练动作会留下大量残余观测梯度,并使环境预测降至低于基础模型水平。联合监督防止了这种单方面的专业化,保留了对后果的预测能力,并为下游探索准备了策略。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.20715 (HTTP 429)

Authors: Juzheng Zhang,Disha Makhija,Manoj Ghuhan Arivazhagan,Vinayshekhar Bannihatti Kumar,Rashmi Gangadharaiah

Categories:

PDF URL: https://arxiv.org/pdf/2609.20715.pdf

Arxiv URL: https://arxiv.org/abs/2609.20715

Arxiv ID: 2609.20715

CoolPaper URL: https://papers.cool/arxiv/2609.20715

Published: 2026-09-19T01:34:51.290Z

Updated: 2026-09-19T01:34:51.290Z


20. Region-Level Policy Optimization for Fine-grained MLLM Perception

Abstract:Fine-grained visual perception in MLLMs is commonly improved by raising the resolution, but the added visual tokens inflate vision-encoding and language-model prefilling costs. We show that the two operations underlying fine-grained perception, localizing the region of interest (RoI) and recognizing its content, have different resolution requirements. In a controlled diagnostic, localization tolerates roughly 3 to 4 times stronger token compression than recognition, which motivates localizing from a coarse view and concentrating resolution on the selected evidence. Decoding coordinates with the MLLM can be trained end-to-end from answers, but costs a full model pass per query and depends on grounding ability. A lightweight proposal network distilled from the model’s attention is fast, but inherits the noise of its attention targets. The RoI from the proposal network reaches the answer through a discrete region choice, so its faithfulness to the answer cannot supervise the network. We therefore optimize the proposal network with region-level reinforcement learning, which we call Vision-RL2. It treats coherent regions as actions, and a frozen MLLM reader scores each one by how its removal changes the answer likelihood. Complementary subtractive and additive objectives suppress distracting proposals and recover missing evidence, updating only the predictor without region annotations, response sampling, or reasoning trajectories. The refined proposal further enables a sparse encoding that magnifies evidence and excludes background tokens. Across six fine-grained benchmarks and four MLLM backbones, Vision-RL2 improves accuracy over the base model at every token budget and surpasses its largest-budget accuracy with about 4 times fewer visual tokens. Code is available at this https URL .

中文摘要

摘要:在多模态大模型(MLLMs)中,细粒度视觉感知通常通过提高分辨率来改善,但增加的视觉 token 会增加视觉编码和语言模型预填充的成本。我们指出,细粒度感知的两个基本操作——定位兴趣区域(RoI)和识别其内容——对分辨率的要求不同。在受控诊断中,定位对 token 压缩的容忍度大约是识别的 3 到 4 倍,这激发了从粗略视图进行定位并将分辨率集中在已选择证据上的思路。与 MLLM 协作解码坐标可以通过答案进行端到端训练,但每个查询都需要完整的模型推理,并且依赖于定位能力。一个从模型注意力中蒸馏而来的轻量级提议网络速度很快,但继承了注意力目标的噪声。提议网络的 RoI 通过离散区域选择得出答案,因此其对答案的忠实度无法监督网络。我们因此采用区域级强化学习优化提议网络,这就是我们称之为 Vision-RL2 的方法。它将连贯的区域视为动作,并由冻结的 MLLM 阅读器通过判断移除该区域对答案可能性的影响来对每个区域打分。互补的减法和加法目标抑制干扰性提议并恢复缺失证据,仅更新预测器而不依赖区域标注、响应采样或推理路径。优化后的提议进一步实现了稀疏编码,放大证据并排除背景 token。在六个细粒度基准和四个 MLLM 骨干模型上,Vision-RL2 在每个 token 预算下都提高了准确率,并以约四倍更少的视觉 token 超过了最大预算下模型的准确率。代码可在此 https URL 获得。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.19745 (stream has been aborted)

Authors: Yuheng Shi,Xiaohuan Pei,Minjing Dong,Chang Xu

Categories:

PDF URL: https://arxiv.org/pdf/2609.19745.pdf

Arxiv URL: https://arxiv.org/abs/2609.19745

Arxiv ID: 2609.19745

CoolPaper URL: https://papers.cool/arxiv/2609.19745

Published: 2026-09-19T01:34:52.390Z

Updated: 2026-09-19T01:34:52.390Z