数据来源:HuggingFace Papers

Latest Papers

1. PlanBench-XL: Evaluating Long-Horizon Planning of LLM Tool-Use Agents in Large-Scale Tool Ecosystems

Abstract:LLM agents increasingly operate in large tool ecosystems, where real-world tasks require discovering relevant tools, inferring implicit sub-goals, and adapting to dynamic environments over long horizons. However, existing benchmarks rarely evaluate planning under retrieval-limited tool visibility. To address this gap, we introduce PlanBench-XL, an interactive benchmark of 327 retail tasks over 1,665 tools that tests whether agents can iteratively retrieve usable tools, invoke them to uncover intermediate evidence for subsequent calls toward the final goal. PlanBench-XL further features an optional blocking mechanism that simulates real-world unpredictability through missing, failing, or distracting tool functions, forcing agents to detect disrupted paths and adapt at runtime. Experiments on ten leading LLMs show that massive-tool planning remains challenging: while GPT-5.4 achieves 51.90% accuracy in block-free settings, it collapses to 11.36% under the most severe blocking condition. Further analysis shows that agents are especially vulnerable when failures lack explicit error signals or when recovery requires longer alternative tool-use paths. These results establish PlanBench-XL as a testbed for diagnosing agentic planning failures and highlight the need for robust adaptive planning in long-horizon tasks with large, imperfect tool environments.

中文摘要

摘要:大型语言模型(LLM)代理越来越多地在大型工具生态系统中运行,其中现实世界任务需要发现相关工具、推断隐含的子目标,并在长时间跨度内适应动态环境。然而,现有基准很少评估在受限工具可见性下的规划能力。为了解决这一空白,我们引入了 PlanBench-XL,这是一个涵盖 1,665 个工具的 327 个零售任务的交互式基准,用于测试代理是否能够迭代检索可用工具、调用它们以发现用于后续调用达到最终目标的中间证据。PlanBench-XL 还提供了可选的阻塞机制,通过缺失、失败或干扰的工具功能模拟现实世界的不确定性,迫使代理检测中断路径并在运行时进行适应。在十个领先的 LLM 上的实验表明,大规模工具规划仍然具有挑战性:在无阻塞设置下,GPT-5.4 的准确率为 51.90%,但在最严重的阻塞条件下骤降至 11.36%。进一步分析显示,当失败缺乏明确的错误信号或恢复需要更长的替代工具使用路径时,代理尤其容易受到影响。这些结果确立了 PlanBench-XL 作为诊断代理规划失败的测试平台,并强调了在具有大规模、不完美工具环境的长时间任务中实现稳健自适应规划的必要性。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文试图解决现有基准测试在评估LLM代理于大规模、检索受限且不可靠的工具生态系统中进行长程规划能力方面的不足

具体而言,论文针对以下核心挑战:

  1. 部分工具可见性(Partial Tool Visibility)
    现有基准通常假设代理可以访问完整的工具集,而现实中由于上下文长度限制,代理只能通过检索访问相关工具的子集。论文评估代理在仅能迭代发现部分工具的情况下,如何推断隐式子目标并完成任务。

  2. 不可靠与噪声工具(Unreliable Tools)
    现实世界的工具检索常返回缺失、损坏、过时或误导性的工具。论文设计了阻塞机制(blocking mechanism),模拟工具返回显式错误、隐式错误(返回看似合理但实际错误的值)或语义误导(功能相似但不同)的情况,测试代理能否检测失败信号并重新规划。

  3. 长程规划与双向探索(Long-Horizon & Bi-directional Exploration)
    任务需要平均约25步交互和至少5次工具调用,代理必须结合前向探索(从已有证据出发)和后向探索(从目标结果倒推)来发现中间信息,而非依赖预设的明确步骤。

  4. 动态适应与重新规划(Adaptive Re-planning)
    当关键工具路径被阻塞时,代理必须识别中断、放弃无效分支,并通过替代路径恢复。现有基准缺乏对这种在不确定性中动态调整规划能力的系统评估。

论文通过引入 PlanBench-XL 基准(包含327个零售任务、1,665个工具)来填补这一空白,测试代理能否在工具检索受限、环境动态变化的条件下,完成需要多步推理和自适应恢复的长程任务。

Q: 有哪些相关研究?

该论文的相关研究主要分为两个领域:大规模工具集上的代理规划评估,以及面向大规模工具规划的代理设计

1. 大规模工具集上的代理规划评估

现有基准测试从多个角度考察了这一挑战,但均存在局限性:

大规模工具使用与检索基准

  • ToolBench (Qin et al., 2023a)、APIBench (Patil et al., 2023)、ToolRet (Shi et al., 2025)、MCPBench (Wang et al., 2025d) 等评估了广泛工具集合上的工具选择能力,但主要关注相对明确的任务目标
  • 这些基准通常假设工具可通过检索访问,但未充分考察检索介导的部分可观察性下的长程规划。

长程规划基准

Authors: Jiayu Liu,Qihan Lin,Cheng Qian,Rui Wang,Emre Can Acikgoz,Xiaocheng Yang,Jiateng Liu,Zhenhailong Wang,Xiusi Chen,Heng Ji,Dilek Hakkani-Tür

PDF URL: https://arxiv.org/pdf/2606.22388.pdf

Arxiv URL: https://arxiv.org/abs/2606.22388

Arxiv ID: 2606.22388

CoolPaper URL: https://papers.cool/arxiv/2606.22388

Published: 2026-06-24T01:29:40.215Z

Updated: 2026-06-24T01:29:40.215Z


2. OpenRath: Session-Centered Runtime State for Agent Systems

Abstract:Modern agent systems often suffer from fragmented runtime state: transcripts, tool effects, memory events, workspace placement, branch provenance, and replay evidence are recorded separately and become difficult to inspect or reproduce. OpenRath addresses this issue with a PyTorch-like programming model for multi-agent, multi-session systems. The analogy concerns the role of a central first-class runtime abstraction, not tensor computation. Its core abstraction is Session, the runtime value passed between agents and workflows. A Session is branchable, inspectable, replayable, backend-aware, and composable. It records conversation chunks, sandbox placement, lineage metadata, token usage, pending work, and tool evidence, while defining where memory interactions enter the runtime record. Since this state is carried by the same value used in program execution, fork, merge, and replay become explicit runtime operations rather than states reconstructed from external traces. OpenRath further defines Sandbox, Tool, Agent, Memory, Workflow, and Selector, with Selector turning control flow into runtime-routed decisions. This report presents the programming model, architecture, audited milestones, and evidence protocol. Its claims are limited to controlled runtime properties, while broad quantitative comparisons, live-provider quality, optional-backend availability, and memory quality are left for follow-on evaluation. The central thesis is that Session provides agent systems with a first-class runtime value for auditable composition.

中文摘要

摘要:现代代理系统通常面临运行时状态分散的问题:对话记录、工具效果、内存事件、工作区布局、分支来源和重放证据各自独立记录,从而难以检查或复现。OpenRath 通过类似 PyTorch 的编程模型解决了多代理、多会话系统中的这一问题。这里的类比涉及中央一流运行时抽象的作用,而非张量计算。其核心抽象是 Session,即在代理和工作流程之间传递的运行时值。Session 可分支、可检查、可重放、后台感知且可组合。它记录对话片段、沙箱布局、血统元数据、令牌使用情况、待处理工作和工具证据,同时定义内存交互进入运行时记录的位置。由于该状态由程序执行中使用的同一个值携带,分叉、合并和重放成为显式的运行时操作,而非从外部轨迹重建的状态。OpenRath 进一步定义了 Sandbox、Tool、Agent、Memory、Workflow 和 Selector,其中 Selector 将控制流转化为运行时路由决策。本文报告展示了编程模型、架构、经过审计的里程碑以及证据协议。其主张仅限于受控的运行时属性,而广泛的定量比较、实时提供者质量、可选后端可用性以及内存质量则留待后续评估。核心论点是,Session 为代理系统提供了可审计组合的一流运行时值。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Fukang Wen,Zhijie Wang,Ruilin Xu

PDF URL: https://arxiv.org/pdf/2606.19409.pdf

Arxiv URL: https://arxiv.org/abs/2606.19409

Arxiv ID: 2606.19409

CoolPaper URL: https://papers.cool/arxiv/2606.19409

Published: 2026-06-24T01:31:03.389Z

Updated: 2026-06-24T01:31:03.389Z


3. DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

Abstract:Massive unstructured multimodal streams suffer from high “data entropy,” impeding both efficient human knowledge acquisition and high-quality AI post-training. Existing passive annotation paradigms, heavily reliant on heuristic rules or general VLMs, are costly, monotonous, and fail to unlock the deep procedural logic embedded in raw data. We elevate data processing to a learnable capability, proposing a paradigm shift towards Agentic Data Tailoring, which actively refining and structuring data to align with diverse user and downstream intents. To overcome the data scarcity bottleneck in training such high-order capabilities, we design a two-stage pipeline grounding generative semantic synthesis in deterministic Factual Anchors, yielding a large-scale dataset spanning five core physical and digital domains. Building upon this, $\text{DataClaw}_0$-9B model synergizes Supervised Fine-Tuning (SFT) with Group Relative Policy Optimization (GRPO), achieving robust alignment with complex refinement and tailoring intents. To systematically quantify this capability, we construct $\text{DataClaw}_0$-val, the first benchmark dedicated to data refinement. Crucially, we adopt downstream post-training as the ultimate validation touchstone. Evaluations on video generation, real-world VQA, and GUI navigation confirm that $\text{DataClaw}_0$ delivers high-information-density tailored data, facilitating efficient model adaptation to new tasks under limited training data regimes. Project page: this https URL

中文摘要

摘要:大规模非结构化多模态数据流存在高“数据熵”问题,阻碍了高效的人类知识获取和高质量的人工智能后训练。现有的被动注释范式,严重依赖启发式规则或通用视觉语言模型(VLMs),成本高、单调乏味,且无法挖掘原始数据中深层的流程逻辑。我们将数据处理提升为可学习的能力,提出向“智能数据定制”(Agentic Data Tailoring)的范式转变,通过主动精炼和结构化数据,使其与多样化的用户和下游意图对齐。为克服训练此类高阶能力的数据稀缺瓶颈,我们设计了一个两阶段流水线,将生成语义合成建立在确定性的事实锚(Factual Anchors)基础上,从而生成覆盖五大核心物理和数字领域的大规模数据集。在此基础上,$ ext{DataClaw}_0$-9B 模型将监督微调(SFT)与组相对策略优化(GRPO)相结合,实现了与复杂精炼和定制意图的稳健对齐。为了系统量化这一能力,我们构建了 $ ext{DataClaw}_0$-val,这是第一个专注于数据精炼的基准。关键的是,我们将下游的后训练作为最终验证标准。在视频生成、真实世界问答(VQA)以及 GUI 导航上的评测结果表明,$ ext{DataClaw}_0$ 能够提供高信息密度的定制数据,从而在有限训练数据的情况下高效地适应新任务。项目页面:此 https URL

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文旨在解决大规模非结构化多模态数据流的高效精炼与结构化问题,具体可归纳为以下几个核心层面:

1. 原始多模态数据的”高熵”困境 物理与数字世界产生的原始多模态流(如数小时长的教学视频、具身智能体轨迹、复杂的Web与GUI操作日志)具有极端的”数据熵”——数据本身嘈杂、高度冗余且结构薄弱。这类数据包含密集的物理动态、程序性知识和隐式决策逻辑,但缺乏显式的监督信号,导致人类难以高效获取知识,AI也难以进行高质量的后训练(post-training)。

2. 现有被动式标注范式的局限性 当前主流的数据处理流程主要依赖启发式采样、粗略标注或直接调用通用视觉语言模型(VLM)生成字幕与问答对。这类被动式方法存在以下缺陷:

  • 成本高昂且单调重复;
  • 难以处理需要时序推理、时空一致性和隐式物理理解的长序列数据;
  • 容易产生幻觉、碎片化或低信息密度的输出,无法解锁原始数据中潜藏的价值。

3. 缺乏可学习的主动数据精炼能力 论文指出,高质量数据生产应被视为一种可学习的高阶能力(learnable high-order capability),而非简单的预处理步骤。具体而言,需要构建能够执行**“智能体化数据裁剪”(Agentic Data Tailoring)**的系统——即给定高级用户意图或下游训练目标后,智能体能够主动过滤冗余信息、识别任务关键证据,并将其重组为密集、可验证且面向特定应用的监督数据。现有研究缺乏对此类能力的形式化定义、严格评估及有效学习机制。

4. 数据稀缺与领域异质性悖论 训练具备上述能力的模型本身需要大量高质量的数据精炼样本,但此类数据本身稀缺。此外,多模态数据横跨日常生活、教育、具身智能、世界模型与GUI代理等多个异构领域,单一模型难以同时处理这些分布差异巨大的数据类型,导致严重的任务干扰(task interference)。

简言之,该论文试图将多模态数据处理从被动的、基于规则的或通用描述性的范式,转变为主动的、意图驱动的、可学习的智能体能力,从而将高熵的原始数据流转化为结构化、高密度、与下游任务对齐的训练资产。

Q: 有哪些相关研究?

根据论文第2-4页及相关章节,该研究主要与以下四个研究方向密切相关:

1. 多模态大语言模型(Multimodal Large Language Models, MLLMs)

该领域构成了DataClaw0的技术基础,涉及将视觉编码器与语言模型结合以实现多模态感知与推理:

  • 基础架构:包括LLaVA
    3
    、GPT-

Authors: Cong Wan,Zeyu Guo,Zijian Cai,Jiangyang Li,SongLin Dong,Lin Peng,Xiangyang Luo,Zhiheng Ma,Yihong Gong

PDF URL: https://arxiv.org/pdf/2606.21337.pdf

Arxiv URL: https://arxiv.org/abs/2606.21337

Arxiv ID: 2606.21337

CoolPaper URL: https://papers.cool/arxiv/2606.21337

Published: 2026-06-24T01:32:44.023Z

Updated: 2026-06-24T01:32:44.023Z


4. EnterpriseClawBench: Benchmarking Agents from Real Workplace Sessions

Abstract:Enterprise agents increasingly operate inside workspaces: they read heterogeneous files, invoke tools, and deliver business artifacts. We introduce EnterpriseClawBench, an enterprise agent benchmark constructed from proprietary, real-world agent sessions. Starting from a large archive of workplace sessions, the EnterpriseClawBench produces 852 reproducible tasks, each paired with recovered fixtures, rewritten prompts, role classes, skill subclasses, hard rules, and semantic rubrics. Because the sessions contain internal enterprise content, we do not release the benchmark data; instead, our reusable contribution is the construction and evaluation protocol. On EnterpriseClawBench, the best configuration reaches only 0.663 (Codex with GPT-5.5). These results show that enterprise agent evaluation must report harness—model combinations, artifact delivery, visual quality, cost, runtime, and skill-transfer behavior, rather than collapsing performance into a single score. Code: this https URL

中文摘要

摘要:企业代理越来越多地在工作空间中运行:它们阅读异构文件、调用工具并交付业务产物。我们介绍了 EnterpriseClawBench,这是一个由专有的真实世界代理会话构建的企业代理基准。从大量的工作场所会话档案开始,EnterpriseClawBench 生成了 852 个可复现任务,每个任务都配有恢复的夹具、重写的提示、角色类别、技能子类、硬规则和语义评分标准。由于这些会话包含企业内部内容,我们不会发布基准数据;相反,我们可重复使用的贡献是构建和评估协议。在 EnterpriseClawBench 上,最佳配置仅达到 0.663(Codex 与 GPT-5.5)。这些结果表明,企业代理评估必须报告测试平台-模型组合、产物交付、视觉质量、成本、运行时间和技能迁移行为,而不能将性能压缩为单一分数。代码:该 https URL

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决企业级智能体(enterprise agents)评估中的三个核心缺口

1. 企业真实性与可扩展任务构建之间的张力

现有基准测试(如 Workspace-Bench、WorkArena、TheAgentCompany 等)虽将评估场景迁入工作空间或企业级环境,但多数任务仍依赖人工编写、模拟环境或公共数据源构建,导致基准任务与实际企业需求之间存在显著差距。论文试图通过从真实企业内部会话档案中自动提取并构建可复现任务,弥合这一”自然发生的企业需求”与”可扩展评估”之间的鸿沟。

2. 多维度评估体系的缺失

传统评估往往将性能简化为单一分数,而企业级智能体的实际表现受多重因素耦合影响:

  • Harness–模型交互效应:智能体脚手架(harness)与基础模型的组合方式显著影响最终性能(如论文发现 Claude 系列模型在 Hermes harness 下性能骤降)
  • 产物交付质量:需同时评估文件交付、文本/视觉语义质量、状态保持等
  • 效率维度:成本与运行时约束是企业部署的关键考量

论文提出需将 harness–模型组合、多模态评判、产物交付、成本、运行时等指标作为耦合结果联合报告,而非孤立呈现模型能力。

3. 任务类别级别的技能转移评估

可复用技能正成为企业智能体系统的运营资产,但现有基准要么未设计技能评估,要么仅在单个任务项层面评估。论文强调企业技能应作为**转移单元(transfer units)**进行测试:从某一任务类别(task class)中提取的技能应能改善同一类别中保留任务(held-out tasks)的表现。为此,论文构建了包含角色类别(role classes)和技能子类别(skill subclasses)的分类体系,支持在任务类别层面评估技能泛化能力。

简言之,该论文通过构建 EnterpriseClawBench 基准协议,试图建立一个从真实企业会话衍生、支持多维评估(性能–成本–时延联合优化)、且具备任务类别级技能评估能力的企业智能体评估框架。

Q: 有哪些相关研究?

该论文的相关研究可分为以下几类:

1. 企业与工作空间智能体基准测试

  • Workspace-Bench
    9
    :专注于具有大规模文件依赖的工作空间任务,覆盖真实工作场景中的文件操作需求。
  • WorkArena
    3
    :评估网络代理在常见知识工作任务中的能力,基于网络环境构建。
  • TheAgentCompany
    11
    :针对具有重要后果的真实世界任务评估 LLM 代理,强调

Authors: Jincheng Zhong,Weizhi Wang,Che Jiang,Kai Tian,Zhenzhao Yuan,Junlin Yang,Dianqiao Lei,Kaiyan Zhang

PDF URL: https://arxiv.org/pdf/2606.23654.pdf

Arxiv URL: https://arxiv.org/abs/2606.23654

Arxiv ID: 2606.23654

CoolPaper URL: https://papers.cool/arxiv/2606.23654

Published: 2026-06-24T01:34:22.676Z

Updated: 2026-06-24T01:34:22.676Z


5. Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention

Abstract:Self-attention is central to Transformer performance and is often the most expensive part of the Transformer at long context lengths because its pairwise token interactions scale quadratically with sequence length. Standard dense attention also applies the same set of attention heads to every token regardless of token difficulty or information content. This uniform activation can waste compute, especially as sequences grow longer and attention cost increases rapidly. We propose Grouped Query Experts (GQE), a mixture-of-experts layer on top of grouped-query attention (GQA). Within each GQA group, a router selects k query-head experts per token while all key-value (KV) heads remain dense and unchanged. Thus, GQE keeps the KV cache benefits of GQA and reduces only the active query-head computation. On a fixed 30B token budget at the 250M parameter scale, GQE matches the all-active GQA baseline in downstream accuracy while activating half the query heads per token.

中文摘要

摘要:自注意力机制对于Transformer的性能至关重要,并且在长上下文长度时通常是Transformer中最昂贵的部分,因为其成对的token交互随着序列长度呈平方增长。标准的稠密注意力也会将相同的一组注意力头应用于每个token,而不考虑token的难度或信息含量。这种统一的激活可能会浪费计算资源,尤其是当序列变长且注意力开销迅速增加时。我们提出了分组查询专家(Grouped Query Experts, GQE),这是基于分组查询注意力(Grouped-Query Attention, GQA)之上的一种专家混合层。在每个GQA组内,路由器为每个token选择k个查询头专家,而所有键值(KV)头保持稠密且不变。因此,GQE保留了GQA的KV缓存优势,并仅减少活跃查询头的计算。在250M参数规模、固定30B token预算下,GQE在下游准确性上与全激活GQA基线相匹配,同时每个token仅激活一半的查询头。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决标准Transformer自注意力机制中的计算效率低下问题,特别是在长序列场景下的二次方计算复杂度与 uniform activation(统一激活)造成的资源浪费。具体而言,论文针对以下核心痛点:

1. 自注意力的计算瓶颈

自注意力机制中,token 之间的两两交互随序列长度呈二次方增长( O(n^2) ),使其成为长上下文 Transformer 的主要计算瓶颈。随着序列长度增加,注意力计算成本迅速上升。

2. 统一激活造成的计算浪费

标准密集注意力对所有 token 应用相同的注意力头集合,无论 token 的语义复杂度或信息含量如何:

  • 高信息 token(如内容词、罕见术语、长距离依赖)可能需要专门的注意力头
  • 低信息 token(如标点符号、停用词)往往不需要完整的注意力计算

这种”一刀切”的 uniform activation 导致在低信息 token 上浪费大量计算资源。

3. 解决方案:条件计算与稀疏激活

论文提出 Grouped Query Experts (GQE),将混合专家(Mixture-of-Experts, MoE)的思想从 MLP 块迁移到 GQA(Grouped-Query Attention)注意力块:

  • 保留 GQA 优势:保持 KV 缓存密集且不变,维持内存带宽效率
  • 稀疏查询头激活:在每个 GQA 组内,通过路由器为每个 token 动态选择 k 个查询头专家(query-head experts),而非激活所有查询头
  • 计算节省:通过跳过不必要的查询头计算,显著降低长序列场景下的活跃计算量(在 250M 参数规模下实现约 56% 的查询注意力计算激活,即 9/16 的头)

简言之,该工作试图在不损失下游任务精度的前提下,通过条件化稀疏激活查询头专家来降低自注意力的计算开销,特别针对长上下文场景下的效率优化。

Q: 有哪些相关研究?

根据论文第2节(Background and Related Work)及引用文献,相关研究可分为以下四个主要方向:

1. 混合专家模型(Mixture of Experts, MoE)

MoE 层最初主要应用于 Transformer 的 MLP/前馈模块,通过路由机制使每个 token 仅激活部分专家,从而在扩大模型容量的同时控制计算量:

  • Outrageously Large Neural Networks
    2
    :提出稀疏门控 MoE 层,奠定 MoE 在深度学习中的应用基础
  • GShard
    3
    :实现 giant 模型的条件计算与自动分片
  • Switch Transformers
    4
    :简化 MoE 路由策略,实现万亿参数模型的可扩展稀疏性

2. 高效注意力机制:GQA 与 MQA

针对自注意力中 KV 缓存的内存带宽瓶颈,研究者们提出了共享 KV 头的方案:

  • Multi-Query Attention (MQA)
    5
    :所有查询头共享同一组 KV 头,显著减少解码时缓存需求
  • Grouped-Query Attention (GQA)
    6
    :在 MHA(每个查询头独立 KV)和 MQA(全局共享 KV)之间取得平衡,将查询头分组,组内共享 KV 头

3. 条件化与稀疏注意力头

将条件计算引入注意力块的研究可分为以下几类:

头剪枝(Head Pruning)

  • Are Sixteen Heads Really Better than One?
    7
    :发现部分注意力头可被剪枝而不显著影响性能
  • Analyzing Multi-Head Self-Attention
    8
    :识别出”重载头”(specialized heads)与可剪枝头

注意力混合(Mixture-of-Attention)

  • A Mixture of h-1 Heads is Better than h Heads
    9
    :提出每 token 选择部分注意力头
  • Mixture of Attention Heads
    10
    :进一步探索每 token 选择注意力头的方法

MoE 风格注意力模块

  • SwitchHead
    13
    :将 MoE 应用于注意力模块,但保留完整的每头 KV 缓存
  • MoH (Mixture-of-Head Attention)
    14
    :将多头注意力本身视为混合专家

分组路由变体

  • MoMHA (Mixture of Multi-head Attention)
    11
    :将专家构建为带共享 KV 投影的头组
  • LLaMA-MoE v2
    12
    :在转换稠密模型后激活 top-K 注意力头组

4. 基础 Transformer 架构

  • Attention Is All You Need
    1
    :提出原始 Transformer 架构与缩放点积注意力机制,构成所有后续工作的基础

与现有工作的区别

论文明确指出,与上述工作相比,GQE 的设计具有以下特点:

  • 路由粒度:在固定 GQA 组内路由(而非从全部头中选择),确保每个组都贡献专家
  • KV 处理:保持 GQA 的 KV 缓存密集不变(不稀疏化 KV 路径)
  • 训练方式:从头联合训练路由器和专家(而非剪枝或转换预训练模型)

Q: 论文如何解决这个问题?

论文通过提出 Grouped Query Experts (GQE) 架构,将混合专家(MoE)的条件计算机制引入分组查询注意力(GQA),在保持 KV 缓存密集的前提下,实现查询头的稀疏激活。具体解决方案包含以下核心机制:

1. 组内查询专家路由

在标准 GQA 将 H 个查询头划分为 G 个组(每组共享一个 KV 头)的基础上,GQE 将每组内的 M = N/G 个查询头构建为专家池 E(g,1), …, E(g,M) 。

对于第 i 个 token 的表示 xi 和第 g 个组,路由器生成分布:
p
(i,g) = softmax(r_g(x_i)) ∈ R^M

通过 top- k 选择激活专家:
Kg(x_i) = TopK_m(p(i,g,m), k)

关键约束:所有 KV 头保持密集计算且完全复用底层 GQA 的 KV 缓存,仅对查询头进行条件化稀疏选择。

2. 输出构造:硬拼接、加权求和与共享头

为解决离散 top- k 选择不可微分的问题并维持训练稳定性,GQE 采用三层输出结构:

  • 硬拼接专家槽(Hard-Concatenated Slots):直接拼接选中专家的原始输出,保留专家特化能力
    Oi = {o(i,g,m) : g ∈ 1,…,G, m ∈ K_g(x_i)}

  • 重归一化加权求和槽(Renormalized Weighted-Sum Slot):为路由器提供可微梯度路径
    oi = ∑(g=1)^G ∑(m ∈ K)_g(x_i) w(i,g,m) o(i,g,m), quad w(i,g,m) = p(i,g,m)∑(g’=1)^G ∑(m’ ∈ K)(g’)(xi) p(i,g’,m’)

  • 始终激活共享头(Always-On Shared Head): s(x_i) 为所有 token 提供稳定的注意力路径,锚定训练过程

最终输出投影:
y_i = Concat(O_i, o_i, s(x_i)) W_O

3. 负载均衡辅助损失

引入标准 MoE 负载均衡损失,基于路由器概率和选中专家分布,防止路由器坍缩到少数专家,确保训练过程中专家利用率均匀。

4. 计算效率量化

活跃查询注意力计算比例降至:
(kG + 1) / (N)

其中 N = MG 为路由专家总数。在主要实验配置(16 查询头/8 KV 头, k=1 )中:

  • 路由专家激活率: kG/N = 8/16 = 50%
  • 总查询注意力激活率(含共享头): (8+1)/16 = 9/16 ≈ 56%

5. 长上下文加速特性

由于仅跳过查询侧计算而保持 KV 路径密集,计算节省随序列长度增加而放大。在 prefill 阶段,当序列长度超过 4k tokens 时,该方法实现 1.7–1.8× 的实际加速(见图 1),因为注意力计算中的序列相关部分(与查询头激活相关)占主导,而固定路由开销占比相对减小。

通过上述设计,GQE 在不改变 KV 缓存内存占用、不永久剪枝头的前提下,通过条件激活查询专家,使模型在固定 30B token 训练预算下达到与稠密 GQA 基线相当的下游任务精度,同时显著降低长序列场景下的活跃计算量。

Q: 论文做了哪些实验?

论文在 250M 参数规模和固定 30B token训练预算下开展实验,主要包含以下三方面:

1. 实验设置与配置

  • 模型架构:对比 GQA 基线(8 KV heads,16 查询头)与 GQE 变体
  • 数据集:FineWeb-Edu(FineWeb2 的子集)的 30B token 样本
  • 训练超参数
  • 优化器:Fused AdamW( β_1=0.9, β_2=0.95 )
  • 学习率调度:WSD(Warmup-Stable-Decay),最大学习率 1× 10^(-5) 至 5× 10^(-4)
  • 全局批次大小:105 万 tokens,序列长度 2048
  • 精度:混合精度 BFloat16,使用 ZClip
    15
    缓解损失尖峰
  • 路由配置: k=1 (每组激活 1 个专家),总共 16 个查询头分 8 组,每组 2 个专家候选

2. 下游任务准确率评估(4.2 节)

在三个常识推理基准上评估零样本性能:

  • HellaSwag
    17

  • PIQA
    18

  • ARC-Easy
    19

主要结果(表 2)

  • GQA 基线(16 头全激活):平均 55.86 分
  • GQE(完整方法):平均 56.04 分,与基线持平(差距 <0.2 分),但仅激活 9/16(56%)的查询注意力计算(8 个路由专家 + 1 个共享头)

消融实验(验证路由设计的必要性):

  • Weighted concat(无重归一化槽):平均 55.18 分(比基线低 0.68 分)
  • Hard concat only:平均 55.43 分(比基线低 0.43 分)
  • 结论:仅当同时包含重归一化加权求和槽(提供可微梯度)和始终激活共享头(稳定训练)时,稀疏路由才能恢复稠密基线性能。

3. 吞吐量与长上下文性能(4.3 节)

测量不同序列长度下的 prefill 阶段加速比(GQA 基线延迟 / GQE 延迟):

  • 测试范围:2k 至 1024k tokens
  • 结果
  • 2k tokens:1.15× 加速(路由开销占比较高)
  • 4k–1024k tokens:稳定达到 1.67×–1.80× 加速
  • 趋势:随着序列长度增加,查询侧注意力计算占比提升,固定路由开销被摊薄,加速比趋于稳定。

4. 附录补充实验

  • 训练损失曲线(附录 A,图 4):展示四种变体(基线、两种消融、完整 GQE)在 30B token 训练过程中的损失下降轨迹。
  • 下游任务准确率曲线(附录 B,图 5–7):展示 HellaSwag、ARC-Easy 和 PIQA 在训练过程中的准确率变化趋势,验证 GQE 与基线的收敛行为一致性。

实验结论:在固定计算预算下,GQE 通过仅激活 50% 的路由查询专家(含共享头共 56% 计算量),可在长上下文场景实现 1.7× 以上的实际加速,同时保持与稠密 GQA 基线相当的下游任务准确率。

Q: 有什么可以进一步探索的点?

根据论文第5节(Limitations & Future Work)及研究设计,可进一步探索的方向包括:

1. 规模扩展与稳健性验证

  • 更大规模训练:当前实验局限于250M参数和30B token预算,需在标准大语言模型规模(如7B、13B或更大)及更长训练周期(100B+ tokens)上验证GQE的有效性
  • 多种子稳健性:现有精度差距(<0.2分)较小,需通过多随机种子实验确认该结果具有统计稳健性,而非随机波动

2. 与替代长上下文架构的比较

  • 非Transformer架构:将GQE与Mamba、RWKV、RetNet等线性注意力或状态空间模型在长上下文任务上的效率-精度权衡进行系统对比
  • 混合架构:探索GQE与滑动窗口注意力、稀疏注意力(如BigBird、Longformer)或层次化注意力的结合可能性

3. 专家池规模与专业化

  • 扩大专家候选池:当前设置中每组专家池较小( M=2 ),增加 M (如每组4-8个专家)可能提升专业化程度,但需重新平衡 k 值以维持计算预算
  • 分层路由:探索跨组路由或层次化专家选择机制,而非局限于组内top- k

4. 动态稀疏度与自适应计算

  • 可变 k 机制:根据token复杂度或序列长度动态调整每组激活专家数 k ,而非固定 k=1
  • 提前退出机制:结合查询头 early-exit 策略,对低信息量token进一步减少计算

5. 路由机制优化

  • 替代路由策略:探索专家选择网络(expert choice routing)取代token choice,或引入噪声专家(noisy experts)提升探索性
  • 辅助损失设计:改进负载均衡损失函数,考虑专家间协同或语义相似性约束

6. KV路径的联合优化

  • 条件化KV计算:在保持GQE查询稀疏的同时,探索轻量级KV压缩或缓存驱逐策略,进一步降低内存带宽
  • 跨层KV共享:结合GQE与跨层KV共享机制,测试二者兼容性

7. 任务特异性评估

  • 专业领域验证:当前仅在通用常识推理(HellaSwag、PIQA、ARC-E)上测试,需在代码生成、数学推理、多语言等需要特定注意力模式的任务上评估
  • 长上下文基准:在Needle-in-Haystack、Passkey Retrieval等显式长上下文依赖任务上量化精度损失

8. 硬件感知优化

  • 内核融合:开发针对稀疏查询路由的定制CUDA内核,减少dispatch开销,提升实际wall-clock时间加速比
  • 量化兼容性:研究GQE与INT8/INT4量化的交互影响,特别是路由器与共享头的量化敏感度差异

9. 理论分析

  • 表达能力边界:形式化分析在固定KV约束下,稀疏查询路由相对于全密集注意力的表达能力差距
  • 动态路由的可解释性:分析路由器学习到的token-专家分配模式,验证是否确实形成语义专业化(如语法头、实体头、长程依赖头)

Q: 总结一下论文的主要内容

论文题目:Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention

1. 研究背景与动机

标准 Transformer 自注意力的计算复杂度随序列长度呈二次方增长( O(n^2) ),且对所有 token 统一激活全部注意力头,导致在处理标点、停用词等低信息 token 时产生计算浪费。现有分组查询注意力(GQA)虽通过共享 KV 头降低了内存带宽压力,但仍保持所有查询头密集激活。

2. 核心方法:Grouped Query Experts (GQE)

GQE 将混合专家(MoE)机制引入 GQA 注意力块,实现查询头的条件化稀疏激活:

  • 架构基础:保持 GQA 的 KV 路径密集不变(所有 KV 头始终计算且共享),仅在查询侧引入稀疏性。
  • 组内路由:将 N 个查询头划分为 G 组(每组 M=N/G 个专家),对每组的查询专家进行独立路由。对第 i 个 token 和第 g 组,计算路由概率:
    p_(i,g) = softmax(r_g(x_i)) ∈ R^M
    并选择 top- k 专家 K_g(x_i) 。
  • 输出构造:采用三槽设计解决梯度传播与训练稳定性问题:
  1. 硬拼接槽:直接拼接选中专家输出 Oi = o(i,g,m) ,保留专家特化能力;
  2. 重归一化加权求和槽:提供可微梯度路径给路由器:
    oi = ∑(g=1)^G ∑(m ∈ K)_g(x_i) w(i,g,m) o(i,g,m), quad w(i,g,m) = p(i,g,m)∑(g’,m’) p_(i,g’,m’)

  3. 共享头槽:始终激活的共享注意力头 s(x_i) ,为训练提供稳定锚点。

  • 最终输出
    y_i = Concat(O_i, o_i, s(x_i)) W_O

3. 计算效率

  • 活跃计算比例:对于 N 个路由专家,每 token 激活 kG 个专家加 1 个共享头,活跃比例为 (kG+1) / (N) 。
  • 主要设置:在 16 查询头/8 KV 头配置( G=8, M=2, k=1 )下,总查询注意力计算量降至 9/16(约 56%),其中路由专家激活率为 50%。
  • 长上下文加速:随着序列长度增加,固定路由开销被摊薄,在 4k–1024k tokens 范围内实现 1.7–1.8× 的 prefill 阶段加速。

4. 实验验证

250M 参数规模和固定 30B token训练预算下进行控制实验:

  • 下游任务:在 HellaSwag、PIQA、ARC-Easy 三个常识推理基准上,GQE(56.04 分)与稠密 GQA 基线(55.86 分)表现相当,差距小于 0.2 分。
  • 消融实验:验证了重归一化加权求和槽(提供路由器梯度)与共享头(稳定训练)的必要性;移除任一组件均会导致精度下降(分别降至 55.18 和 55.43 分)。
  • 训练稳定性:采用 ZClip 技术与负载均衡辅助损失防止路由坍缩。

5. 局限与展望

当前结果限于中小规模(250M 参数)和较短训练预算(30B tokens),未来需在更大规模模型、更长上下文基准(如 Mamba 对比)以及更大专家池( M>2 )配置下验证方法的有效性与扩展性。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Vishesh Tripathi,Abhay Kumar

PDF URL: https://arxiv.org/pdf/2606.20945.pdf

Arxiv URL: https://arxiv.org/abs/2606.20945

Arxiv ID: 2606.20945

CoolPaper URL: https://papers.cool/arxiv/2606.20945

Published: 2026-06-24T01:35:54.920Z

Updated: 2026-06-24T01:35:54.920Z


6. KaLM-Reranker-V1: Fast but Not Late Interaction for Compressed Document Reranking

Abstract:As retrieval systems scale, high-quality reranking becomes increasingly important. However, most existing rerankers, whether encoder-based or decoder-based, jointly encode the query and passage, tightly coupling their computation and limiting deployment efficiency as well as flexibility. We present KaLM-Reranker-V1, a fast but not late-interaction (FBNL) reranker that decouples query and passage computation while retaining expressive relevance modeling. Built on an encoder-decoder architecture, KaLM-Reranker-V1 uses the encoder to pre-encode passages with Matryoshka embedding pooling, while the decoder models the system instruction, user instruction, and query intent; cross-attention then captures relevance between the query context and passage representations. This design makes KaLM-Reranker-V1 efficient through decoupled passage encoding, yet not late interaction, by preserving rich relevance modeling through cross-attention. We instantiate KaLM-Reranker-V1 in three sizes, Nano, Small, and Large, with 0.27B, 1B, and 4B activated parameters, respectively. Extensive experiments on BEIR, MIRACL, and LMEB demonstrate that KaLM-Reranker-V1 achieves strong reranking performance with superior efficiency. On BEIR, KaLM-Reranker-V1 achieves state-of-the-art performance, on par with strong industrial models such as the Qwen3-Reranker series; on MIRACL, despite not being extensively trained on multilingual data, KaLM-Reranker-V1 still shows excellent reranking performance. Moreover, on LMEB, reranking models demonstrate a clear advantage, with even the 0.27B Nano model remaining competitive with 7-12B embedding models.

中文摘要

摘要:随着检索系统的规模扩大,高质量的重排序变得越来越重要。然而,大多数现有的重排序器,无论是基于编码器还是解码器的,都将查询和段落联合编码,将计算紧密绑定,从而限制了部署效率和灵活性。我们提出了 KaLM-Reranker-V1,一种快速但非后期交互(FBNL)的重排序器,它在保持表达相关性建模能力的同时,实现了查询和段落计算的解耦。KaLM-Reranker-V1 基于编码器-解码器架构,使用编码器通过套娃嵌入池化(Matryoshka embedding pooling)预编码段落,而解码器则建模系统指令、用户指令和查询意图;随后通过交叉注意力捕捉查询上下文与段落表示之间的相关性。此设计使 KaLM-Reranker-V1 通过解耦的段落编码实现高效,同时不属于后期交互,通过交叉注意力保留了丰富的相关性建模。我们将 KaLM-Reranker-V1 实例化为三种规格:Nano、Small 和 Large,分别具有 0.27B、1B 和 4B 激活参数。在 BEIR、MIRACL 和 LMEB 上的大量实验表明,KaLM-Reranker-V1 在高效性方面具有优越的重排序性能。在 BEIR 上,KaLM-Reranker-V1 实现了最先进的性能,与强大的工业模型如 Qwen3-Reranker 系列相当;在 MIRACL 上,尽管没有经过大量多语言数据训练,KaLM-Reranker-V1 仍显示出优异的重排序性能。此外,在 LMEB 上,重排序模型展示了明显优势,即使是 0.27B 的 Nano 模型也仍能与 7-12B 的嵌入模型保持竞争力。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Xinping Zhao,Jiaxin Xu,Ziqi Dai,Xin Zhang,Shouzheng Huang,Danyu Tang,Xinshuo Hu,Meishan Zhang,Baotian Hu,Min Zhang

PDF URL: https://arxiv.org/pdf/2606.22807.pdf

Arxiv URL: https://arxiv.org/abs/2606.22807

Arxiv ID: 2606.22807

CoolPaper URL: https://papers.cool/arxiv/2606.22807

Published: 2026-06-24T01:36:02.096Z

Updated: 2026-06-24T01:36:02.096Z


7. World Action Models: A Survey

Abstract:World Action Models (WAMs) are embodied predictive-action models that make a forecast of the future available to action. Recent WAMs repurpose large video generation models, and a parallel line relies on language or vision-language backbones without a video-generation core. This rapid expansion has blurred the boundary among broad world models, video generation models, action-grounded video world models, Vision-Language-Action policies, and WAMs. This survey gives the field a common account. It first clarifies these boundaries, then organizes existing works through two complementary views. The first view asks what each method is required to generate, spanning rendered futures, latent futures, and video-generation-free action reasoning. The second view decomposes each method by predictive substrate, backbone, action coupling, and deployment regime. This anatomy supports a unified discussion of interactability, causality, persistence, physical plausibility, and generalization, followed by data, evaluation, and open challenges. Across these axes, a consistent design pattern emerges: WAMs are not simply video generators with action heads, but predictive-action methods whose design choices trade representational richness against compute, memory, latency, and action-label cost. The field is moving toward methods that generate less of the future while preserving what control requires. The survey homepage is available at this https URL.

中文摘要

摘要:世界动作模型(WAMs)是具身预测-动作模型,它们可以将对未来的预测用于指导行动。近期的WAMs重新利用了大型视频生成模型,同时还有一条平行路径依赖于语言或视觉-语言主干,但没有视频生成核心。这种快速扩展模糊了广义世界模型、视频生成模型、以动作为基础的视频世界模型、视觉-语言-动作策略以及WAMs之间的界限。本综述为该领域提供了统一的说明。它首先澄清这些界限,然后通过两个互补的视角组织现有工作。第一个视角关注每种方法需要生成的内容,包括渲染的未来、潜在的未来,以及无需视频生成的动作推理。第二个视角根据预测基质、主干、动作耦合和部署机制分解每种方法。这种分析支持对交互性、因果性、持续性、物理合理性和泛化能力的统一讨论,随后讨论数据、评估和尚待解决的挑战。在这些维度上,一种一致的设计模式浮现出来:WAMs不仅仅是带有动作头的视频生成器,而是预测-动作方法,其设计选择在表示丰富性与计算、内存、延迟及动作标签成本之间进行权衡。该领域正朝着生成更少未来内容但保留控制所需内容的方法发展。本综述主页可通过此https URL访问。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文试图解决的核心问题是:在世界动作模型(World Action Models, WAMs)领域迅速扩张的背景下,不同方法之间的概念界限变得模糊,导致领域缺乏统一的定义、分类框架和系统性的理解

具体而言,论文针对以下几个关键问题:

  1. 概念界限混淆:随着视频生成模型、视觉-语言-动作(VLA)策略、世界模型和WAM的快速发展,这些方法之间的边界变得不清晰。不同社区(视频生成、机器人学习、语言模型)的工作可能自称或被归类为WAM,但实现细节差异巨大,导致”同名异实”或”异名同实”的混乱。

  2. VLA的根本局限:标准的VLA模型(如RT-2、OpenVLA)虽然能将视觉-语言预训练知识 grounded 到机器人行为,但它们只学习从当前观察到动作的映射,不显式建模环境在自身干预下的动态变化(物理、接触、视角变化等),这限制了策略在行动前推理后果的能力。

  3. 缺乏系统的设计空间理解:现有WAM方法在”生成多少未来信息”、”在哪里解码动作”、”使用何种架构”等关键设计选择上差异巨大,但缺乏一个统一的框架来理解和比较这些权衡(如计算成本、内存、延迟与动作标签成本之间的 trade-off)。

  4. 实践中的权衡不清:WAM设计涉及预测丰富性(representational richness)与计算资源(compute, memory, latency)之间的 fundamental trade-off,但领域缺乏对这些约束条件的系统性分析。

解决方案: 论文通过提供一个统一的概念框架和双重视角分类法来解决这些问题:

  • 设计哲学视角:将WAM分为”渲染-解码(Render-and-Decode)”、”潜空间-only(Latent-Only)”和”无视频生成(Video-Generation-Free)”三类,根据动作解码前需要生成多少未来信息来区分。
  • 组件解剖视角:通过四个轴线(预测基底、架构主干、动作耦合、部署模式)精确描述每个WAM的实现方式。

最终目标是帮助领域从”生成更多未来(Dream More)”转向”在保留控制所需信息的同时生成更少未来(Act More)”,使WAM设计更加系统化和可比较。

Q: 有哪些相关研究?

根据论文内容,相关研究主要分布在以下几个核心领域:

1. Vision-Language-Action (VLA) 模型

作为 WAM 的近邻基础,这类方法将视觉-语言预训练知识 grounded 到机器人控制,但不显式建模环境动态:

  • RT-2
    12
    :通过联合微调 VLM 输出动作 token,建立 web-to-robot 迁移范式
  • OpenVLA
    78
    :开源可扩展的 VLA 实现,支持跨机器人数据混合
  • π 系列
    11, 71, 72
    :包括 π0、π0.5 和 π0.7,采用流匹配(flow matching)和视觉子目标生成,扩展至多体机器人控制

2. 广义世界模型 (World Models)

提供预测动态的基础框架,但未必与动作控制直接耦合:

  • 潜空间想象模型:PlaNet
    55
    、DreamerV3
    57
    、Dreamer 4
    58
    、TransDreamer
    18

  • 特征预测架构:V-JEPA
    7
    、V-JEPA 2
    4
    (联合嵌入预测架构)

  • Token 化世界模型:iVideoGPT
    174
    、RoboDreamer
    210
    、InteractiveWorldSimulator
    166

3. 大规模视频生成模型

为 WAM 提供视觉动态先验的”原子能力”:

  • 扩散架构:Wan
    156
    、CogVideoX
    185
    、Cosmos-Predict2
    128
    、Latte
    114

  • 自回归架构:NOVA
    26
    、VideoPoet
    82

  • 其他:Sora
    130, 131
    、AnimateDiff
    53

4. World Action Models (WAMs)

论文综述的核心,按三个设计哲学分类:

4.1 Render-and-Decode(渲染-解码型)

将视频生成进行到底层像素,再解码动作:

  • 早期工作:UniPi
    29
    (文本条件视频+逆动力学)、VLP
    30
    (语言级规划搜索)、AVDC
    81
    (密集对应关系)
  • 联合生成:GR-1
    172
    、GR-2
    16
    (自回归图像-动作 token)、WorldVLA
    14
    、PAD
    52
    (联合去噪)
  • 基础模型扩展:DreamZero
    188
    (Wan 级骨干在线控制)、DreamGen
    73
    (生成伪动作轨迹)

4.2 Latent-Only(潜空间型)

在像素解码前停止,从中间表示提取动作:

  • 特征提取:VPP
    62
    (SVD 特征条件策略)、Genie Envisioner
    102
    (一步去噪潜空间)、Fast-WAM
    193
    (编码器-only 特征)
  • 结构化运动:Im2Flow2Act
    177
    、3DFlowAction
    207
    (光流/3D 流)、TraceGen
    86
    (3D 轨迹)
  • 高效推理:UWM
    213
    (独立扩散时间步)、CosmosPolicy
    79
    、mimic-video
    132

4.3 Video-Generation-Free(无视频生成型)

完全移除视频生成骨干,在紧凑表示空间预测:

  • 特征预测:FLARE
    204
    (对齐教师嵌入)、LDA-1B
    112
    (DINO 潜空间)、FRAPPE
    200
    (多基础模型特征对齐)
  • 几何/ affordance 表示:PointWorld
    68
    (3D 点流)、PALM
    107
    (affordance 图)、HiF-VLA
    103
    (运动向量 token)
  • VLM 骨干:DUST
    171
    (双扩散流)、CoT-VLA
    201
    (视觉思维链)、ALAM
    149
    (代数一致潜动作)

5. 数据集与评估基准

支撑 WAM 训练与验证的数据源:

  • 机器人遥操作:Open X-Embodiment
    21
    、RoboMIND
    175
    、RoboSet
    8
    、Human2Robot
    176

  • 便携式人体演示:EgoMimic
    77
    、EgoVerse
    135
    、EgoDex
    60

  • 互联网规模视频:Ego4D
    45
    、Ego-Exo4D
    46
    、EPIC-KITCHENS
    23
    、EgoScale
    205

  • 仿真环境:LIBERO
    105
    、ManiSkill 2/3
    47, 150
    、MetaWorld
    190
    、RoboCasa
    123
    、IsaacSim
    127

6. 评估方法

  • 视觉保真度:FVD
    154
    、FID、LPIPS
    196
    、DreamSim
    39

  • 闭环基准:LIBERO-X
    159
    、RoboMME
    22
    、RoboArena
    5
    、DWorldEval
    97

  • 物理合理性:WorldScore
    31
    、PhysWorld
    117
    、RoboScape
    139

这些研究共同构成了从”纯反应式策略”到”显式预测未来以指导动作”的演进谱系,WAM 处于世界模型与机器人策略的交汇点。

Q: 论文如何解决这个问题?

论文通过构建双重视角的统一框架来解决概念混淆和缺乏系统性理解的问题,具体方法如下:

1. 设计哲学层面的三分法(Taxonomy by Generation Requirement)

论文首先根据”需要生成多少未来信息才能解码动作“这一关键标准,将所有WAM划分为三个互斥的哲学流派,澄清了”未来预测”与”动作控制”的耦合位置:

  • Render-and-Decode(渲染-解码型):将视频生成进行到底层像素(RGB/RGB-D),再从渲染出的视觉未来解码动作(如UniPi、GR-2、DreamZero)
  • Latent-Only(潜空间型):保留视频动态先验,但在像素解码前停止,从中间潜空间、流场或特征直接提取动作(如VPP、Genie Envisioner、Fast-WAM)
  • Video-Generation-Free(无视频生成型):完全移除视频生成骨干,在语言token、音频潜空间、几何基元或affordance图等紧凑表示中预测未来(如FLARE、PointWorld、DUST)

这种划分解决了”同名异实”问题——例如,同样称为”world model”的方法,有的生成像素(Render-and-Decode),有的只预测特征(Video-Generation-Free),其计算成本、延迟和适用场景完全不同。

2. 组件级四轴解剖(Four-Axis Anatomy)

为进一步精确描述每个WAM的实现细节,论文提出了形式化的4元组表示:
WAM cong langle Phi, F, B, D rangle

(1) 预测基底(Predictive Substrate, Phi )

定义未来预测所处的表示空间:

  • Pixel-grounded:解码后的视频帧或可解码的VAE潜空间
  • Feature:无固定解码器的隐藏状态、教师模型嵌入或VLM token
  • Geometric:光流、点云、深度、位姿等物理坐标张量
  • Affordance:价值图、语义掩码、热力图等任务相关映射

(2) 动作耦合(Action Coupling, F )

描述动作如何进入预测流程或从预测中提取:

  • Action-conditioned rollout:先提出动作候选,再预测其后果(用于规划/搜索)
  • Joint generation:动作与未来在同一生成过程中联合产生(如联合去噪)
  • Post-prediction head:先完整预测未来,再用独立模块解码动作(如逆动力学)

(3) 架构主干(Architectural Backbone, B )

实现预测的具体函数族:

  • Iterative-denoising(视频扩散):如Wan、Cosmos-Predict2
  • Autoregressive:如GR-1/2的next-token预测
  • Joint-embedding-predictive(JEPA):如V-JEPA 2的确定性特征预测
  • Hybrid:共享主干+多专家头(如Motus、F1)
  • LLM/VLM:利用大语言模型作为预测骨干

(4) 部署模式(Deployment Regime, D )

模型在控制循环中的调用方式:

  • Open-loop:一次性生成长程未来( H ≈ T )
  • Chunked closed-loop:每 K 步重新规划( H=K )
  • Single-step closed-loop:每控制步调用( H=1 )
  • Interactive:通过KV缓存或持久潜空间支持连续交互

3. 核心属性分析(Five Core Properties)

除分类框架外,论文还系统分析了 embodiment 对WAM提出的五个关键属性要求,建立了评估设计优劣的维度:

属性 关键问题 设计启示
Interactability 控制信号能否在生成过程中干预未来? 动作越早绑定预测(如joint generation),可控性越强
Causality 未来信息是否泄露到当前动作? 需因果掩码(causal masking)防止双向注意力导致的”预知”
Persistence 长程预测如何保持状态一致性? 通过观测替换(observation replacement)或有界记忆机制
Physical Plausibility 预测的未来是否可被机器人实际执行? 需结合触觉、力反馈、运动学约束,超越视觉真实感
Generalization 如何跨任务/物体/机器人本体迁移? 在适当抽象层级(流、特征而非像素)预测不变量

4. 统一符号系统(Unified Notation)

论文引入了统一的数学符号:
pTheta(s(t+1:t+H), a(t:t+H-1) mid o(≤ t), a_(<t), l)

其中 s 为预测基底(未来表示), a 为动作, c 为上下文。这一形式化使不同方法可在同一数学框架下比较,明确区分了:

  • 纯VLA(无 s ): p(a|o,l)
  • 纯世界模型(无 a 输出): p(o’|o,a,l)
  • WAM( s 与 a 耦合):上述联合分布

总结

通过**“哲学分类+组件解剖+属性分析”的三层架构,论文将原本混乱的WAM领域转化为可定位、可比较的设计空间。研究者可将任何新工作放入Tables 1&2的4元组表格中,立即明确其与现有方法在”预测什么、如何耦合、用什么主干、如何部署”上的差异,从而系统性地权衡表示丰富性计算/延迟/内存成本**之间的trade-off。

Q: 论文做了哪些实验?

作为一篇综述论文(Survey),本文没有进行新的实验或训练新的模型。相反,作者通过系统性的理论框架和分类分析来整合现有研究成果。具体而言,论文提供的”实验替代”内容包括:

1. 系统性分类表格(Census Tables)

论文在Tables 1和2中提供了对现有WAM方法的全面普查,每个方法被标记为4元组 langle Phi, F, B, D rangle :

  • Table 1:涵盖Render-and-Decode和Latent-Only两类哲学,包含约60个方法(如UniPi、GR-2、VPP、Fast-WAM等),按arXiv提交日期排序,标注其基底类型(Pixel/Feature/Geometric)、主干架构(Diffusion/AR/Hybrid)、耦合方式(Joint/Post-head/Cond. rollout)和部署模式(Open/Chunked/Single)
  • Table 2:涵盖Video-Generation-Free哲学,包含约15个方法(如FLARE、DUST、PointWorld等)

这些表格本质上是对现有实验工作的元分析(meta-analysis)

2. 核心属性的对比分析

在Section 5(Core Properties)中,论文通过引用已有实验结果来验证设计权衡:

  • Interactability:对比了UniPi(后预测)与AdaWorld(每步注入潜动作)的控制粒度差异
  • Causality:引用了WorldVLA的因果掩码实验和DreamZero的7Hz闭环控制实现
  • Persistence:分析了DexWM的有界内存设计和DreamZero的KV缓存替换机制
  • Physical Plausibility:对比了MWM(掩码预测)与OmniVTA(触觉预测)的模态选择实验
  • Generalization:引用了GR-2的跨场景实验、Im2Flow2Act的跨本体迁移实验和LDA-1B的规模化实验

3. 数据与评估的元研究(Section 6)

论文系统分析了现有实验设置:

  • 数据来源对比:分析了Open X-Embodiment、Ego4D、RoboMIND等数据集在动作标签保真度与规模之间的权衡
  • 评估协议:讨论了FVD等视频指标与闭环任务成功率之间的相关性缺失问题(如MotuBrain发现世界模型分数与下游成功率仅弱相关)

4. 设计权衡的定性”实验”

论文通过思想实验(thought experiments)复杂性分析来比较不同设计选择:

  • 延迟计算:对比了不同部署模式的计算成本
  • Open-loop: C(open)(T) = N(fwd)(T)
  • Chunked closed-loop: C(chunk)(T,K) = lceil T/K rceil N(fwd)(K)
  • Single-step: C(single)(T) = T · N(fwd)(1)
  • 消融分析总结:综合了已有工作中关于”是否需要在推理时生成视频”的对比(如Fast-WAM、GigaWorld-Policy显示可以跳过视频生成而保留控制能力)

总结

本文的贡献在于建立分类学和设计空间地图,而非提供新的实验数据。其价值在于帮助研究者理解:当现有工作报告”成功率提升”时,这些提升是在何种计算预算、延迟约束和物理一致性条件下获得的,从而避免在不同设计哲学之间进行不公平的比较。

Q: 有什么可以进一步探索的点?

基于论文第7节”Open Challenges”及全文分析,以下是7个关键的进一步探索方向

1. Dream More or Act More?(预测深度与计算成本的自适应权衡)

核心问题:当前WAM在”生成详细未来”(高计算成本)与”快速动作响应”(低延迟)之间面临根本张力。

具体探索点

  • 自适应计算预算:开发能根据任务不确定性动态调整想象深度的机制(如DreamAvoid仅在关键阶段触发视频生成,NoiseGate学习每潜空间时间步的调度策略)
  • 运行时决策:建立”何时信任想象”的元控制器(如FFDC-WAM的因果注意力验证器),在常规动作执行与完整世界模型重规划之间智能切换
  • 可控的保真度-延迟曲线:设计单一骨干网络,允许在推理时选择”生成完整视频”、”生成紧凑特征”或”仅生成动作”三种模式,而非固定架构

2. What Data Should Each Stage Learn From?(多阶段数据分配策略)

核心问题:互联网视频、人类演示、机器人遥操作和仿真数据具有不同偏置,当前缺乏系统的数据阶段分配理论。

具体探索点

  • 预训练视频选择:明确何种视频预训练(通用人类视频 vs 机器人域视频)对特定下游任务最有益(现有结果矛盾:VidMan显示域内视频更好,而V-JEPA显示通用视频有效)
  • 对齐阶段的最小数据需求:确定桥接人类演示与机器人控制所需的最小硬件配置、视角匹配度和数据质量(EgoMimic与EgoVerse的 wearable 数据采集策略优化)
  • 动作-free学习的极限:探索从纯视频(无动作标签)学习潜动作表示的边界(如DUST、ALAM),以及如何减少机器人动作标注需求而不损失物理 groundedness

3. Can Memory Keep Up?(长程持久性与有界记忆)

核心问题:长程任务中,预测漂移、记忆成本增长与上下文遗忘构成”不可能三角”。

具体探索点

  • 空间索引记忆:结合场景图或3D语义地图,将记忆成本与场景复杂度而非时间长度挂钩(超越简单的KV缓存)
  • 双重时间尺度架构:分离”慢速”环境状态(物体位置)与”快速”动态(接触力),采用不同更新频率(如HarmoWAM的慢-快双循环)
  • 测试时记忆训练:如CLWM的Dual-State Test-Time Training,在部署时在线优化记忆表示以适应新场景

4. How Can WAMs Generalize?(针对性泛化设计)

核心问题:泛化不是单一属性,需明确针对何种偏移(物体、场景、本体、相机)设计。

具体探索点

  • 基底选择的理论指导:建立选择光流(跨外观)、特征(跨语义)或像素(跨几何)的决策框架,针对特定域偏移优化
  • 跨本体动作抽象:开发通用的”手-物体”交互原语(如LDA-1B的手中心动作空间),使同一潜动作空间适配不同机器人形态
  • 组合性泛化:利用ALAM的代数一致性约束,确保学到的潜动作满足组合律(如”推开”=”推”后接”移开”),实现零样本长程任务组合

5. What Grounds Abstract Action?(抽象动作的物理接地)

核心问题:潜动作(latent actions)虽减少标注需求,但可能失去物理可解释性和精确控制。

具体探索点

  • 物理可解释的潜空间:设计具有显式物理维度(力、接触、动量)的潜动作表示,而非纯数据驱动的黑盒编码
  • 估计器鲁棒性:解决基于光流/点云的方法对跟踪器、深度估计器的依赖(如3PoinTr的跟踪误差传播问题),开发端到端鲁棒的几何预测
  • 动作-物理一致性损失:在潜动作学习中加入刚体动力学、摩擦力约束的可微损失函数,确保抽象动作对应可行物理轨迹

6. When Is a Future Physical?(物理合理性的判定与约束)

核心问题:视觉真实(FVD分数高)不等于物理可执行(机器人能实际完成)。

具体探索点

  • 多模态物理基底:扩展预测目标至触觉(OmniVTA)、力-力矩(AdaWorldPolicy)、声音(Audio-WM),建立接触丰富的动态模型
  • 运动学闭环约束:在生成阶段即施加机器人运动学限制(如DexWM的手部一致性损失),而非后验投影
  • 物理可证的安全性:开发能证明未来预测不会导致碰撞或关节超限的验证机制(超越统计安全性)

7. What Should Evaluation Report?(统一评估协议)

核心问题:当前评估分散在视频质量、仿真成功率、真实机器人任务,缺乏统一标准。

具体探索点

  • 准确性-预算报告:建立”成功率 vs 推理延迟 vs 峰值内存”的三维评估标准(如Fast-WAM的消融实验模式)
  • 物理合理性指标:开发超越FVD的物理一致性分数(如RoboScape的几何约束检查、PhysWorld的物理参数估计)
  • 长程一致性测试:设计小时级、千步以上的闭环控制基准,测试漂移累积(当前基准多为短程)

8. 新兴交叉方向(论文暗示的延伸)

  • 世界模型作为数据生成器:系统性研究IRASim、DreamGen等”神经仿真器”生成数据的质量边界,以及合成数据与真实数据的最优混合比例
  • 因果推理与反事实规划:利用WAM的预测能力进行反事实推理(”如果我没推那个物体会怎样?”),支持更高级的决策
  • 人机协同的可解释性:利用Render-and-Decode方法的像素级可解释性,或Latent-Only方法的注意力可视化,增强人类对机器人意图的理解

这些挑战的共同主题是:WAM设计是一个耦合的权衡空间,在基底选择、计算预算、数据成本和物理约束之间需要系统性的 co-design,而非孤立优化单一指标。

Q: 总结一下论文的主要内容

这篇综述论文系统地界定了**世界动作模型(World Action Models, WAMs)**这一新兴领域,提供了统一的概念框架和全面的文献普查。以下是主要内容概述:

1. 核心问题与动机

论文指出,随着视觉-语言-动作(VLA)模型、视频生成模型和世界模型的快速发展,这些领域之间的界限日益模糊。具体而言:

  • VLA的局限:标准VLA(如RT-2、OpenVLA)仅学习从当前观察 o 和指令 l 到动作 a 的映射 p(a|o,l) ,不显式建模环境在自身干预下的动态变化(物理、接触、视角变化),限制了行动前的后果推理能力。
  • 概念混淆:不同社区(视频生成、机器人学习、语言模型)的工作自称或被归类为”World Action Models”,但实现细节差异巨大——有的生成像素,有的预测特征,有的完全移除视频生成,导致领域缺乏统一的定义和比较基准。

2. 核心贡献:双重视角框架

论文提出了两个互补的分类视角来系统化WAM设计空间:

视角一:设计哲学(What to Generate)

根据”在解码动作前需要生成多少未来信息“,将WAM分为三个互斥的哲学流派:

  • Render-and-Decode(渲染-解码型):将视频生成进行到底层像素(RGB/RGB-D),再从渲染的视觉未来解码动作(如UniPi、GR-2、DreamZero)。
  • Latent-Only(潜空间型):保留视频动态先验,但在像素解码前停止,从中间潜空间、流场或特征直接提取动作(如VPP、Fast-WAM、Genie Envisioner)。
  • Video-Generation-Free(无视频生成型):完全移除视频生成骨干,在语言token、音频潜空间、几何基元或affordance图等紧凑表示中预测未来(如FLARE、PointWorld、DUST)。

视角二:组件解剖(How to Build)

通过4元组 langle Phi, F, B, D rangle 精确描述每个WAM的实现细节:

维度 选项 含义
Phi :预测基底 Pixel-grounded / Feature / Geometric / Affordance 未来预测所处的表示空间(像素/特征/几何/任务图)
F :动作耦合 Action-conditioned rollout / Joint generation / Post-prediction head 动作如何进入预测流程或从预测中提取
B :架构主干 Diffusion / Autoregressive / JEPA / Hybrid / LLM-VLM 实现预测的具体函数族
D :部署模式 Open-loop / Chunked closed-loop / Single-step / Interactive 模型在控制循环中的调用方式(开环/分块闭环/单步/交互)

论文通过Tables 1和2对现有WAM方法进行了全面普查,每个方法都被定位在此4维空间中。

3. 核心属性分析(Five Core Properties)

论文系统分析了embodiment对WAM提出的五个关键要求:

  • Interactability(可交互性):控制信号能否在生成过程中干预未来,而非仅在生成后解码。
  • Causality(因果性):确保未来信息不会通过双向注意力泄露到当前动作(如通过因果掩码)。
  • Persistence(持久性):长程预测中保持状态一致性,解决漂移、记忆增长和遗忘问题(如通过观测替换或有界记忆)。
  • Physical Plausibility(物理合理性):预测的未来必须可被机器人实际执行,而非仅视觉真实(需结合触觉、力反馈、运动学约束)。
  • Generalization(泛化性):跨任务、物体、场景、相机和机器人本体的迁移能力,通过在适当抽象层级(流、特征而非像素)预测不变量实现。

4. 关键洞察:”Dream Less, Act More”

论文的核心观察是:WAM设计涉及表示丰富性与计算成本之间的根本权衡。领域的发展趋势是:

生成更少的未来信息,同时保留控制所需的关键信息。

例如,Fast-WAM和GigaWorld-Policy通过跳过测试时的视频生成显著降低延迟,同时保留视频预训练提供的动态先验;S-VAM将多步去噪蒸馏为单步几何-语义预见。

5. 开放挑战

论文指出了7个关键研究方向:

  1. 自适应计算预算:根据任务不确定性动态调整想象深度(何时”多做梦”,何时”多行动”)。
  2. 多阶段数据分配:明确互联网视频、人类演示、机器人遥操作和仿真数据在预训练、对齐和动作学习各阶段的最优配置。
  3. 有界长程记忆:开发空间索引记忆和双重时间尺度架构,使记忆成本与场景复杂度而非时间长度挂钩。
  4. 针对性泛化设计:针对特定域偏移(外观、本体、几何)选择最优预测基底。
  5. 抽象动作的物理接地:确保潜动作(latent actions)具有物理可解释性和精确控制能力。
  6. 物理合理性评估:建立超越视觉真实度(FVD)的物理一致性指标。
  7. 统一评估协议:建立”准确性-延迟-内存”三维评估标准。

6. 结论

论文通过建立”预测-动作契约“的统一符号 pTheta(s(t+1:t+H), a_(t:t+H-1) | c) ,将WAM与纯VLA(无未来预测)和纯世界模型(无动作耦合)明确区分。该框架使研究者能够系统性地比较不同方法在计算、内存、延迟和动作标签成本之间的权衡,推动领域从孤立的技术报告转向系统化的设计科学。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Qiuhong Shen,Shihua Zhang,Yue Liao,Qi Li,Zhenxiong Tan,Shizun Wang,Shuicheng Yan,Xinchao Wang

PDF URL: https://arxiv.org/pdf/2606.20781.pdf

Arxiv URL: https://arxiv.org/abs/2606.20781

Arxiv ID: 2606.20781

CoolPaper URL: https://papers.cool/arxiv/2606.20781

Published: 2026-06-24T01:37:42.787Z

Updated: 2026-06-24T01:37:42.787Z


8. CLI-Universe: Towards Verifiable Task Synthesis Engine for Terminal Agents

Abstract:While recent LLM-based terminal agents have demonstrated promising capabilities, the scarcity of high-quality, executable training data remains a critical bottleneck. Existing synthesis pipelines typically scale by retrofitting surface-level artifacts into tasks, frequently yielding ambiguous instructions, shallow execution paths, and brittle tests that provide weak learning signals. To overcome this, we introduce CLI-Universe, a principled synthesis engine that constructs terminal-agent tasks. CLI-Universe generates candidate tasks by sampling combinations across a multi-dimensional capability taxonomy (domain, skill type, capability, and engineering pillar), then grounds each candidate through evidence-guided deep research over real-world technical materials. To ensure rigorous supervision, validated blueprints are instantiated into Dockerized environments and subjected to a multi-stage executable verification pipeline featuring rubric-gated test construction, hint-conditional filtering, and strict fail-to-pass checking. Across the full pipeline, from candidate generation to verification, approximately two-thirds of candidates are discarded, retaining only those that are genuine, verifiable, and non-trivially challenging. To validate our framework, we instantiate a highly distilled dataset of 6,000 trajectories called CLI-Universe-6K. Remarkably, fine-tuning Qwen3-32B on CLI-Universe-6K achieves 33.4% on Terminal-Bench 2.0. This sets a new state-of-the-art for models trained on open-source data at or below 32B parameters, and outperforms several models an order of magnitude larger, demonstrating the profound data efficiency of structured, high-fidelity synthesis.

中文摘要

摘要:虽然最近基于大型语言模型(LLM)的终端代理展示了令人期待的能力,但高质量、可执行的训练数据的稀缺仍然是一个关键瓶颈。现有的合成流程通常通过将表面层的工件套用到任务中来扩展,这往往导致指令模糊、执行路径浅显以及脆弱的测试,只提供微弱的学习信号。为了解决这一问题,我们引入了CLI-Universe,一个构建终端代理任务的原理性合成引擎。CLI-Universe通过在多维能力分类(领域、技能类型、能力和工程支柱)中采样组合来生成候选任务,然后通过基于证据的深入研究现实技术资料来验证每个候选任务。为了确保严格的监督,经验证的蓝图会被实例化到Docker化环境中,并经过多阶段可执行验证流程,流程包括基于评分标准的测试构建、条件提示过滤以及严格的失败转成功检查。在整个流程中,从候选生成到验证,约有三分之二的候选被舍弃,仅保留那些真实、可验证且具有非平凡挑战性的任务。为了验证我们的框架,我们实例化了一个高度精炼的数据集——CLI-Universe-6K,包含6,000条轨迹。值得注意的是,在CLI-Universe-6K上对Qwen3-32B进行微调,在Terminal-Bench 2.0上取得了33.4%的成绩。这为基于开源数据训练且参数不超过32B的模型设定了新的最先进水平,并超越了几个大一个数量级的模型,展示了结构化、高保真合成数据的深远数据效率。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Zhanbo Hua,Yifan Yao,Weihao Xie,Yongchi Zhao,Minghao Liu,Ruizhi Qiu,Zhewei Huang,Zun Wang,Yiyan Ji,Yunhai Ye,Letian Zhu,Xinping Lei,Han Li,Zhiyuan Ma,Zili Wang,Zhaoxiang Zhang,Jiaheng Liu

PDF URL: https://arxiv.org/pdf/2606.22883.pdf

Arxiv URL: https://arxiv.org/abs/2606.22883

Arxiv ID: 2606.22883

CoolPaper URL: https://papers.cool/arxiv/2606.22883

Published: 2026-06-24T01:37:50.672Z

Updated: 2026-06-24T01:37:50.672Z


9. EvoEmbedding: Evolvable Representations for Long-Context Retrieval and Agentic Memory

Abstract:Existing embedding models are inherently static: they encode text segments in isolation, ignoring their surrounding context and temporal order. This paper introduces EvoEmbedding, a novel embedding model that generates evolvable representations for retrieval. It is tailored for long-context scenarios, where information is dynamic, sequential, and requires continuous state tracking. Our design is simple: EvoEmbedding maintains a continuously updated latent memory as it sequentially processes inputs, and uses it alongside the raw content to jointly generate evolvable embeddings. Consequently, for the same query, our model adapts its representation to retrieve distinct targets based on the evolving context, going beyond static semantic search. To equip the model with this capability, we construct EvoTrain-180K, a diverse dataset for the joint optimization of latent memory and retrieval. Furthermore, we introduce a memory queue to prevent representation collapse during recurrent encoding, alongside segment-batching techniques that tackle significant length variance and accelerate training by 3.8$\times$. Extensive experiments show that our model not only outperforms larger-scale specialists (e.g., Qwen3-Embedding-8B and KaLM-Embedding-Gemma3-12B) across a range of long-context retrieval benchmarks, but also generalizes well to downstream tasks (e.g., personalization) with contexts 10$\times$ longer than its training window. Notably, EvoEmbedding seamlessly integrates into agentic workflows to boost performance. For instance, a naive RAG pipeline equipped with our model surpasses dedicated agentic memory systems. Project Page: this https URL.

中文摘要

摘要:现有的嵌入模型本质上是静态的:它们孤立地编码文本片段,忽略其周围的上下文和时间顺序。本文介绍了EvoEmbedding,一种用于检索的新型嵌入模型,可生成可进化表示。它专为长上下文场景设计,在这些场景中信息是动态的、连续的,并且需要持续的状态跟踪。我们的设计很简单:EvoEmbedding在顺序处理输入时保持持续更新的潜在记忆,并将其与原始内容一起用于联合生成可进化嵌入。因此,对于相同的查询,我们的模型能够根据不断变化的上下文调整其表示,以检索不同的目标,超越静态语义搜索。为了赋予模型这一能力,我们构建了EvoTrain-180K,这是一个用于潜在记忆和检索联合优化的多样化数据集。此外,我们引入了记忆队列以防止循环编码期间表示坍塌,并采用片段批处理技术来应对显著的长度差异,并将训练加速了3.8倍。大量实验表明,我们的模型不仅在一系列长上下文检索基准测试中超越了更大规模的专业模型(如Qwen3-Embedding-8B和KaLM-Embedding-Gemma3-12B),而且在下游任务(如个性化)中也具有良好的泛化能力,其上下文长度是训练窗口的10倍。值得注意的是,EvoEmbedding能够无缝集成到具有智能代理的工作流程中以提升性能。例如,配备我们模型的基础RAG流水线就能超越专门的智能代理记忆系统。项目页面:这个 https URL。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文旨在解决现有嵌入模型在长上下文检索场景中的静态性局限。具体而言,现有方法面临以下核心问题:

1. 静态表示的根本缺陷

现有嵌入模型本质上是静态的:它们孤立地编码文本片段,忽略其周围的上下文和时间顺序。这种设计导致两个关键缺陷:

  • 上下文断裂:标准做法将长输入分割为固定大小的块并独立编码,严重破坏了段之间的时间连续性和上下文关联(如指代消解和时序推理)。
  • 语义静态性:模型仅基于短静态样本通过对比学习优化,仅限于区分语义相关性,无法捕捉信息的动态演化(例如,同一查询在不同历史上下文中应检索到不同目标)。

2. 长上下文与代理记忆的挑战

在信息动态、顺序且需要连续状态跟踪的长上下文场景(如长期对话、个性化代理)中,静态表示频繁失败:

  • 时序信息丢失:无法区分同一实体在不同时间点的状态变化(如会议时间从”10:00 AM”推迟到”1:00 PM”)。
  • 检索噪声:现有RAG系统检索到过时的信息,将噪声引入生成过程。

3. 现有缓解方案的不足

虽然近期的代理式RAG(Agentic RAG)和记忆系统通过复杂的工作流编排(如查询重写、多步迭代检索、结构化记忆构建)试图补偿静态嵌入的局限,但这些方法:

  • 产生大量计算开销和推理延迟
  • 仍无法从根本上解决表示层面的上下文缺失问题
  • 需要显式的记忆构建阶段,增加token消耗

解决方案方向

论文提出EvoEmbedding,通过生成**可演化表示(evolvable representations)**从根本上克服上述局限:

  • 维护一个固定容量的潜在记忆队列(latent memory queue),在顺序处理输入时持续更新
  • 将历史潜在记忆与当前输入联合编码,生成随上下文演化的动态嵌入
  • 使同一查询能够根据演化上下文自适应地检索不同目标,超越静态语义搜索

Q: 有哪些相关研究?

该论文的相关研究主要围绕以下三个方向展开:

1. 文本嵌入模型(Text Embedding Models)

  • 早期里程碑:Sentence-BERT (Reimers and Gurevych, 2019) 开创了将可变长度文本编码为密集语义向量的范式,通过相似度评估文本相关性。
  • 基于LLM的表示学习:近期研究倾向于将生成式LLM重新用于表示学习,代表性模型包括E5 (Wang et al., 2024)、Qwen3-Embedding (Zhang et al., 2025)和KaLM-Embedding (Zhao et al., 2025),在多项检索基准上取得显著性能。
  • 长上下文处理的局限:现有标准做法将长输入分割为固定大小的块并独立编码,这种静态且碎片化的表示严重破坏了段之间的时间连续性和上下文关联(如指代消解和时序推理),导致后续检索过程中的不精确和冗余。

2. 长上下文的代理式RAG(Agentic RAG for Long-Context)

为克服静态嵌入的局限,现有研究从信息存储和查询执行两个维度优化检索管道:

  • 索引阶段优化:包括执行核心指代消解 (Liu et al., 2026)、构建结构化记忆库 (Chhikara et al., 2025),以及通过生成式元数据(如摘要、关键词)增强原始文本 (Nie et al., 2026)。
  • 检索阶段优化:通过查询重写 (Ma et al., 2023)优化查询表示,并引入重排序模型(rerankers)精化候选列表 (Li et al., 2026)。
  • 代理式RAG范式:利用自主代理编排动态查询路由和多步迭代检索 (Singh et al., 2025; Nie et al., 2026; Liu et al., 2026),试图通过复杂的工作流编排补偿静态嵌入的固有缺陷。
  • 固有局限:尽管上述方法缓解了部分问题,但仍因全局上下文丢失而表现次优,且产生高昂的计算开销和推理延迟,阻碍其在实时响应场景中的应用。

3. 潜在记忆与检索(Latent Memory and Retrieval)

  • 循环记忆Transformer (RMT):Bulatov et al. (2022, 2024)提出通过持续更新潜在记忆(latent memory)将上下文窗口扩展到超过100万token,同时保持线性计算复杂度。
  • 记忆规模化方法:M+ (Wang et al., 2025)采用协同训练的检索器,在生成过程中动态召回压缩的隐藏状态以扩展潜在记忆。
  • 潜在空间集成范式:LatentRAG (Zheng and Worring, 2026)和LAnR (Nguyen et al., 2026)探索在模型潜在空间内联合执行推理、检索和生成的集成范式。
  • 架构限制:现有机制与LLM的自回归生成过程深度耦合,需要完全白盒访问内部隐藏状态,无法兼容通过API访问的闭源商业模型;且强制单一模型同时管理潜在记忆和token生成而无显式隔离,可能导致幻觉等不可预测行为 (Xu et al., 2026b)。

Q: 论文如何解决这个问题?

该论文通过提出 EvoEmbedding 框架,从表示学习的根本层面解决静态嵌入的局限性。其核心解决方案包含以下关键组件:

1. 核心架构:潜在记忆驱动的可演化表示

EvoEmbedding 摒弃了孤立编码文本片段的传统方式,采用顺序处理状态维护相结合的设计:

  • 潜在记忆队列(Latent Memory Queue):维护一个固定容量为 C = L × K 的 FIFO(先进先出)队列矩阵 M_t ∈ R^(C × D) ,用于存储最近 L 个步骤生成的潜在表征。
  • 双任务并行机制:对于每个输入段 xt 和历史记忆 M(t-1) ,模型同时执行:
    Mt = πm)(x_t, M(t-1)), quad vt = πr)(x_t, M(t-1))
    其中 θm 和 θ_r 分别对应记忆演化与表示生成的参数, M_t ∈ R^(K × D) 为新产生的潜在 token, v_t ∈ R^(D(emb)) 为当前段的动态嵌入。

2. 记忆队列机制:防止表示崩塌

为解决循环编码导致的**表示崩塌(representation collapse)**问题,论文设计了严格的队列更新策略:
Mt = Queue(M(t-1), f_m(M_t))
该机制提供双重约束:

  • 有界循环(Bounded Loop):确保单个历史记忆最多被循环编码 L 次,避免梯度消失或表征退化,从而无需课程学习(curriculum learning)即可直接训练长上下文样本。
  • 有界容量(Bounded Capacity):严格限制记忆大小(如 C=512 个 token),强制模型在每一步学习将新知识融合到历史状态中,而非简单缓存原始文本。

3. 动态分段批处理(Dynamic Segment-Batching)

针对训练与推理中的长度方差问题,提出将 k 个连续段拼接后并行处理:
M(t:t+k) = πm)(x(t:t+k), M_(t-1))
通过动态调整 k 确保总长度不超过阈值(如 2048 tokens),该技术实现了 3.8× 的训练加速,同时提升模型性能。

4. 联合优化训练策略

4.1 多 LoRA 能力解耦

采用多 LoRA(Low-Rank Adaptation)设计,将记忆演化 ( θ_m ) 与表示生成 ( θ_r ) 能力解耦:

  • 查询阶段仅激活检索 LoRA,实现高效推理。
  • 避免在生成任务中发生灾难性遗忘,保持基础 LLM 的原始能力。

4.2 复合损失函数

模型通过联合损失进行端到端优化:
L = L(mem) + L(con)

  • 记忆生成损失 L(mem) :利用冻结的基础 LLM 和生成的潜在记忆 M_t 预测目标答案 y ,通过标准交叉熵强制记忆模块生成与基础模型语义空间兼容的潜在状态:
    L
    (mem) = -∑(j=1)^(|y|) log P(y_j | y(<j), q, M_t)

  • 对比表示损失 L(con) :采用长度加权的多正样本对比损失,适应动态变化的负样本数量 N :
    L
    (con) = log(N+1) ∑(i=1)^(P) [ -log (exp(v_q^top v_i^+ / τ)) / (exp(v_q^top v_i^+ / τ) + ∑(j=1)^(N) exp(vq^top v_j^- / τ)) ]
    其中 log(N+1) 作为长度加权因子,自适应校准不同上下文长度下的损失尺度, v_q = π
    (θ_r)(q, M_T) 为基于最终记忆状态编码的查询向量。

5. EvoTrain-180K 数据集构建

为训练可演化表示,构建包含 184,137 个样本的专门数据集,特征包括:

  • 多样化上下文:涵盖网页文本、多轮对话和记忆提取,长度分布从 25 到 10,270 个 token。
  • 动态 QA 生成:利用 40+ 模板生成简单(语义匹配)与复杂(时序推理、指代消解)的查询。
  • 严格验证:通过 Gemini-3.1-Pro 进行检索标注和幻觉过滤,确保查询严格依赖历史上下文而非世界知识。

6. 推理效率与部署优势

  • 零 Token 开销:潜在记忆在编码阶段构建,无需像 Agentic 记忆系统那样调用生成模型进行显式记忆构建。
  • 即插即用:作为轻量级检索模块,可无缝集成到现有 A-MEM、LightMem 等记忆系统中,通过替换嵌入层即可提升检索精度(如在 LoCoMo 上为 A-MEM 带来 +19.2% 的增益)。
  • 低内存占用:固定容量的潜在记忆(相当于一张编码图像的内存 footprint)远低于传统方法的 KV 缓存或完整上下文重编码。

Q: 论文做了哪些实验?

该论文进行了系统性的实验验证,涵盖检索性能下游生成任务消融研究效率分析四个维度,具体实验内容如下:

1. 实验设置

1.1 评估基准(Benchmarks)

实验覆盖 10 个基准测试,分为两大类:

  • 检索任务(Retrieval Tasks)
  • 长文档检索:ESG-Reports、MLDR、CovidQA、PeerQA、QASPER
  • 对话记忆检索:REALTALK、LoCoMo、LongMemEval
  • 生成任务(Generation Tasks)
  • 长期个性化与记忆:LoCoMo、LongMemEval、PersonaMem-32K、PersonaMME-32K/128K

1.2 对比基线(Baselines)

  • 通用嵌入模型:Qwen3-Embedding 系列(0.6B/4B/8B)、KaLM-Embedding-Gemma3-12B、BGE-M3、Multilingual-e5-large、Jina-v5-text-small、All-MiniLM-L6-v2、BM25
  • 代理记忆系统:Mem0、A-MEM、LightMem、MemoryOS
  • 检索优化策略:Qwen3-Reranker-4B、多轮推理检索(Reasoning-based retrieval)

1.3 实现细节

  • 潜在记忆队列容量 C = 512 tokens,每步生成 K = 16 个潜在 token
  • 嵌入投影维度 D_(emb) = 1024
  • 使用 Qwen3-30B-A3B 作为生成模型,GPT-4o-mini 作为评估裁判

2. 主要实验结果

2.1 检索性能(Retrieval Performance)

在 8 个长上下文检索基准上,EvoEmbedding 家族(0.8B/2B/4B)取得最佳整体表现:

  • EvoEmbedding-4B 达到 Overall Recall@10 80.5 和 NDCG@10 65.2,超越次优的 KaLM-Embedding-Gemma3-12B(+7.8% Recall@10)和 Qwen3-Embedding-8B(+11.1% Recall@10)
  • 小模型优势:0.8B 版本在多数基准上超越 8B 规模的静态嵌入模型

2.2 下游生成任务(Generation Tasks)

采用朴素 RAG 管道(Naive RAG),在 5 个生成基准上评估不同 Top-k(1/2/4/8/16/32)检索预算下的准确率:

  • 整体最优:EvoEmbedding-4B 在所有 Top-k 设置下均取得最佳整体准确率
  • 长上下文泛化:在 128K 长度的 PersonaMME-128K 上表现稳健,尽管训练时最大长度仅为 12K(10× 长度泛化

2.3 与代理记忆系统对比

在对话记忆基准 LoCoMo 和 LongMemEval 上:

  • LongMemEval:EvoEmbedding-4B(77.6%)显著超越最佳代理记忆系统 LightMem(70.2%)和 A-MEM(65.2%),甚至超越 Full-Context 基线(54.8%)
  • LoCoMo:在 Single-hop 和 Multi-hop 任务上接近 Full-Context 上限(74.3% vs 74.9%),在 Temporal 和 Open-domain 任务上略逊于专门优化的 LightMem

2.4 即插即用增强实验(Plug-and-Play Integration)

将 EvoEmbedding 作为重排序模块集成到现有记忆系统(A-MEM、LightMem、MemoryOS)中:

  • 性能提升:为 A-MEM 带来 +19.2% 的绝对增益,为 MemoryOS 带来 +20.5% 的增益
  • 优势对比: consistently 优于 Qwen3-Reranker-4B 和基于推理的检索策略,且 GPU 内存开销与重排序器相当

2.5 时序检索能力分析(Temporal Retrieval)

设计探针实验验证模型对时序语义的敏感性:

  • 实验设计:使用包含时序关键词(”firstly”、”lastly”、”in the middle”)的查询,在 256 段的上下文中检索
  • 结果
  • 相似度曲线:对 “firstly” 查询,相似度在初始段尖锐峰值;对 “lastly” 查询,相似度随时间递增并在末尾峰值
  • t-SNE 可视化:EvoEmbedding 的潜在空间按时间顺序形成清晰分离的簇,而基线模型(Qwen3/KaLM)的表示完全纠缠

3. 消融研究(Ablation Studies)

在 5 个下游生成基准上验证关键设计的必要性:

策略 训练时间(h) LoCoMo LongMemEval PersonaMem-32K PersonaMME-32K PersonaMME-128K Overall
EvoEmbedding-4B 26.6 69.9 76.6 56.2 72.0 72.8 69.5
w/o Memory Queue 91.3 17.0 (↓52.9) 10.0 (↓66.6) 46.9 64.8 64.3 40.6 (↓28.9)
w/o Memory Loss 27.7 15.2 (↓54.7) 11.4 (↓65.2) 48.9 65.5 64.3 41.1 (↓28.4)
w/o Length-Weighting 26.5 68.4 (↓1.5) 73.8 (↓2.8) 54.5 71.6 73.2 68.3 (↓1.2)
w/o Segment-Batching 101.4 66.0 (↓3.9) 75.0 (↓1.6) 54.3 71.2 71.6 67.6 (↓1.9)

关键发现

  • 记忆队列不可或缺:移除记忆队列或记忆损失导致灾难性性能崩塌(在 LoCoMo 和 LongMemEval 上下降超过 50%),验证了其防止循环编码崩塌的核心作用
  • 分段批处理效率:移除后边长训练时间增加 3.8 倍(101.4h vs 26.6h),且性能下降 1.9%
  • 长度加权稳定训练:带来 1.2% 的整体性能提升,有效平衡不同长度样本的学习难度

4. 效率分析(Efficiency Analysis)

在 LongMemEval 上对比 EvoEmbedding-4B 与静态嵌入模型的推理开销:

模型 参数量 上下文编码时间(s) 查询编码时间(s) 峰值显存(GB) 最佳 Top-k 准确率(%)
Qwen3-Embedding-4B 4B 3.80 0.026 32.3 16 70.0
Qwen3-Embedding-8B 8B 5.52 0.027 43.1 16 73.2
KaLM-Embedding-Gemma3 12B 9.89 0.034 69.3 4 72.8
EvoEmbedding-4B 4B 22.08 0.065 20.9 8 77.6

权衡特性

  • 速度-精度权衡:上下文编码时间较高(因顺序处理),但查询编码时间仍保持毫秒级
  • 内存效率:峰值显存显著低于同规模静态模型(20.9GB vs 32.3GB),因只需维护固定大小的潜在记忆队列而非长序列 KV 缓存
  • 检索预算优化:仅需 Top-8 即可达到最佳性能,而静态模型通常需要 Top-16

5. 补充分析实验

  • 记忆容量敏感性:验证记忆队列容量 C 从 16 到 512 的性能变化,发现 C=512 时性能饱和,平衡了历史覆盖与计算开销
  • LoRA 秩影响:测试秩 r ∈ 16, 32, 64, 128 ,发现即使 r=16 也能保持性能稳定,验证表征学习的参数高效性
  • 不同检索预算下的完整性能表:提供 Top-1/2/4/8/16 所有设置下的详细数值结果(见论文附录 Table 9)

Q: 有什么可以进一步探索的点?

基于论文第5节的讨论与整体研究框架,以下是可以进一步探索的研究方向:

1. 领域泛化与数据规模化

  • 问题:当前模型受限于计算资源和训练数据规模(EvoTrain-180K仅含18万样本,远低于 contemporaneous 模型的1亿+样本),在**域外场景(out-of-domain scenarios)**可能出现性能衰减。
  • 探索方向
  • 构建更大规模、覆盖更大多样性领域的训练数据集
  • 研究零样本/少样本域自适应技术,使潜在记忆能快速适应新领域知识
  • 探索持续学习(continual learning)策略,避免在新领域训练时的灾难性遗忘

2. 多模态可演化表示(Multimodal EvoEmbedding)

  • 问题:当前架构缺乏对视觉、音频等模态的原生支持。
  • 探索方向
  • 架构扩展:将潜在记忆队列机制扩展到基于 Qwen-VL、GPT-4V 等多模态基座模型,处理图像序列、视频时序数据
  • 跨模态对齐:解决不同模态(文本-图像-音频)潜在记忆的维度对齐和语义空间统一问题
  • 容量扩展:多模态场景下需要更大的记忆队列容量( C > 512 )和更高效的记忆压缩机制
  • 应用场景:长视频理解、多模态对话代理(如 PersonaVLM 的增强版)

3. 自适应记忆管理机制

  • 问题:当前采用固定的 FIFO(先进先出)队列和均匀分段策略,可能无法区分信息重要性。
  • 探索方向
  • 注意力驱动的记忆写入:引入可学习的门控机制,根据信息 saliency 动态决定记忆更新强度,而非简单的 FIFO
  • 分层记忆架构:结合短期工作记忆(高分辨率)与长期压缩记忆(低分辨率),模仿人类记忆层次
  • 记忆检索增强:在记忆更新阶段引入类似 M^+ (Wang et al., 2025) 的检索机制,允许模型从更长的历史中选择性召回

4. 理论分析与可解释性

  • 问题:论文主要关注实证性能,缺乏对”为何潜在记忆能防止表示崩塌”的深层理论分析。
  • 探索方向
  • 信息瓶颈理论:分析潜在记忆队列如何平衡历史信息的保留与压缩,量化其信息容量边界
  • 动态系统视角:将记忆演化建模为动态系统,研究其稳定性条件(如 L 次循环编码的收敛性)
  • 记忆可视化:通过探针技术(probing)分析潜在记忆具体编码了哪些类型的信息(实体状态、时序关系、情感倾向等)

5. 与先进LLM架构的融合

  • 问题:当前基于标准 Transformer 和 LoRA 适配,未充分利用最新架构创新。
  • 探索方向
  • MoE(混合专家)架构:将记忆演化与专家路由结合,不同专家处理不同类型的历史上下文(如事实记忆 vs. 程序记忆)
  • 原生长上下文模型:结合 Mamba、RWKV 等线性复杂度架构,进一步扩展记忆队列的有效长度
  • 测试时计算扩展:借鉴 o1 类模型的慢思考机制,允许在检索前进行多步记忆反思(memory deliberation)

6. 复杂Agentic Workflow的集成

  • 问题:当前主要验证在朴素 RAG 和简单记忆系统中的效果。
  • 探索方向
  • 多智能体协作:在多智能体系统中,EvoEmbedding 可作为共享的记忆编码器,实现跨智能体的知识传递
  • 工具使用场景:结合工具调用历史(API 调用序列)进行检索,支持复杂任务的多步规划
  • 个性化长期陪伴:在数月甚至数年的超长对话中(>1M tokens),研究记忆的定期 consolidation(固化)与遗忘机制

7. 训练效率与推理优化

  • 问题:尽管提出了 Segment-Batching,顺序编码仍比并行编码慢。
  • 探索方向
  • 推测性记忆解码:使用小型模型预测潜在记忆更新,仅在大模型不确定时触发完整前向传播
  • 记忆缓存共享:在批量查询场景中,预计算并共享上下文前缀的记忆状态,减少重复计算
  • 蒸馏到静态模型:将 EvoEmbedding 的动态知识蒸馏到标准静态嵌入模型,实现零开销的近似推理

这些方向既回应了论文自陈的局限性,也延伸了其核心思想(潜在记忆 + 可演化表示)到更广阔的技术前沿。

Q: 总结一下论文的主要内容

这篇论文提出了 EvoEmbedding,一种用于长上下文检索和代理记忆的新型可演化嵌入模型,核心内容可概括如下:

1. 核心问题

现有嵌入模型是静态的:它们孤立编码文本片段,忽略时序连续性和上下文关联,导致在长上下文场景(如长期对话、状态追踪)中无法检索动态变化的信息(例如无法区分”会议被改期到1:00 PM”与初始的”10:00 AM”)。

2. 核心方法

EvoEmbedding 通过维护**持续更新的潜在记忆(latent memory)**生成上下文感知的动态表示:

  • 双任务并行架构:对输入段 xt 和历史记忆 M(t-1) ,同步执行:
  • 记忆演化:生成新的潜在记忆令牌 Mt = πm)(x_t, M(t-1))
  • 表示生成:产生上下文感知的嵌入 vt = πr)(x_t, M(t-1))
  • 潜在记忆队列:采用固定容量的 FIFO 队列( C=512 tokens),防止循环编码导致的表示崩塌,实现无需课程学习的长上下文训练。
  • 动态分段批处理:并行处理连续多段,训练加速 3.8×

  • 联合优化:通过记忆生成损失(确保与基础LLM语义兼容)和长度加权对比损失(适应变长负样本)端到端训练。

3. 关键实验结果

  • 检索性能:在8个长上下文基准上,4B模型(Recall@10: 80.5%)超越Qwen3-Embedding-8B(+11.1%)和KaLM-12B(+6.4%)。
  • 下游生成:朴素RAG配合EvoEmbedding-4B在LongMemEval上达到77.6%,超越专用代理记忆系统LightMem(70.2%)和A-MEM(65.2%)。
  • 时序感知:对”firstly”/“lastly”等时间关键词,相似度曲线在目标历史段呈现尖锐峰值,而静态模型完全无法区分。
  • 泛化能力:在128K上下文(训练仅12K)上稳健表现,实现10倍长度泛化
  • 即插即用:集成到现有记忆系统可带来显著提升(如A-MEM +19.2%)。

4. 主要贡献

  • 架构创新:将潜在记忆机制与嵌入生成解耦,实现可演化表示。
  • 训练技术:记忆队列与分段批处理解决长上下文训练的效率与稳定性问题。
  • 数据构建:EvoTrain-180K数据集支持记忆与检索的联合优化。
  • 实用价值:零token开销、低内存占用,可无缝集成到现有RAG和代理工作流。

5. 局限与展望

当前局限包括域外泛化能力有限、暂不支持多模态;未来可探索自适应记忆管理、更大规模训练、以及向视觉/音频模态的扩展。

简而言之,EvoEmbedding 实现了从静态语义匹配动态上下文感知检索的范式转变,为下一代长上下文嵌入模型提供了可扩展的解决方案。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Chang Nie,Chaoyou Fu,Junlan Feng,Caifeng Shan

PDF URL: https://arxiv.org/pdf/2606.21649.pdf

Arxiv URL: https://arxiv.org/abs/2606.21649

Arxiv ID: 2606.21649

CoolPaper URL: https://papers.cool/arxiv/2606.21649

Published: 2026-06-24T01:39:32.408Z

Updated: 2026-06-24T01:39:32.408Z


10. BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

Abstract:We present BioMatrix, the first multimodal foundation model that natively integrates sequences, structures, and natural language for both molecules and proteins within a single decoder-only architecture. Existing biological foundation models pursue native multimodality and broad entity coverage separately: those that fuse multiple modalities under a shared objective remain confined to a single entity type, while those spanning multiple entity types either omit explicit structural modeling or rely on adapter-based designs in which the model cannot natively generate the very modalities it can read. BioMatrix closes this gap by mapping molecular sequences (supporting both SMILES and SELFIES notations), molecular structures, protein sequences, protein structures, and natural language into a shared discrete token space through a unified tokenization scheme, so that all modalities are consumed and produced uniformly under a single next-token prediction objective — without external encoders, projection adapters, or modality-specific output heads. Built upon the Qwen3 language model (1.7B and 4B), BioMatrix is continually pretrained on 304.4 billion tokens spanning general and domain-specific text, sequence and structure views of molecules and proteins, and cross-modal corpora that interleave biomolecular entities with scientific text and link distinct entities through molecule-protein and protein-protein interaction data. After tuning on a comprehensive suite of downstream applications covering 80 tasks across 6 categories — encompassing single-entity and multi-entity understanding and generation tasks across and within modalities — BioMatrix achieves state-of-the-art or competitive performance on 77 out of 80 tasks, demonstrating that a single, natively multimodal generalist model can effectively match or surpass specialized approaches across a wide range of biological tasks.

中文摘要

摘要:我们提出了 BioMatrix,这是首个原生整合分子和蛋白质序列、结构及自然语言的多模态基础模型,采用单一的仅解码器架构。现有的生物基础模型在追求原生多模态和广泛实体覆盖方面是分开的:那些在共享目标下融合多种模态的模型仍局限于单一实体类型,而跨多实体类型的模型则要么省略显式结构建模,要么依赖于适配器设计,在这种设计中模型无法原生生成其能够读取的模态。BioMatrix通过统一的分词方案,将分子序列(支持 SMILES 和 SELFIES 表示法)、分子结构、蛋白质序列、蛋白质结构以及自然语言映射到共享的离散符号空间,从而在单一的下一个符号预测目标下统一地消费和生成所有模态——无需外部编码器、投影适配器或特定模态的输出头。BioMatrix 基于 Qwen3 语言模型(1.7B 和 4B),在覆盖一般文本和领域特定文本、分子及蛋白质的序列和结构视图,以及交叉模态语料库(将生物分子实体与科学文本交织,并通过分子-蛋白和蛋白-蛋白互作数据关联不同实体)的 3044 亿符号上进行持续预训练。经过在覆盖 6 类共 80 个任务的综合下游应用套件上的微调——涵盖跨模态和模态内的单实体和多实体理解与生成任务——BioMatrix 在 80 个任务中有 77 个达到最先进或具有竞争力的性能,证明单一的原生多模态通用模型可以在广泛的生物任务中有效匹配或超过专业方法。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Waiting failed: 30000ms exceeded

Authors: Qizhi Pei,Zhimeng Zhou,Yi Duan,Yiyang Zhao,Wei Li,Han Guo,Liang He,Chengping Li,Chang-Yu Hsieh,Conghui He,Rui Yan,Lijun Wu

PDF URL: https://arxiv.org/pdf/2606.22138.pdf

Arxiv URL: https://arxiv.org/abs/2606.22138

Arxiv ID: 2606.22138

CoolPaper URL: https://papers.cool/arxiv/2606.22138

Published: 2026-06-24T01:39:40.024Z

Updated: 2026-06-24T01:39:40.024Z


11. HydraHead: From Head-Level Functional Heterogeneity to Specialized Attention Hybridization

Abstract:The quadratic complexity of attention poses a critical bottleneck for long-context processing, spurring interest in hybrid attention designs. Most open-source hybrid models adopt a layer-wise strategy. Yet, prior work has noted the inherent difficulty of integrating Linear Attention (LA) with Full Attention (FA), suggesting that the design space of attention hybridization remains underexplored. To probe this space, we conduct interpretability analysis and observe that layers exhibit block-wise functional similarity, while individual heads within the same layer display distinct functional specialization despite sharing input features. This head-level heterogeneity suggests that the head dimension provides a natural and principled granularity for fusing heterogeneous attention signals. Building on this insight, we introduce HydraHead, a novel architecture that hybridizes FA and LA along the head axis. HydraHead features two key innovations: (1) an interpretability-driven selection strategy that identifies retrieval-critical heads and preserves FA only for them, and (2) a scale-normalized fusion module that reconciles the distributional gap between FA and LA head outputs. By leveraging a three-stage transfer pipeline with parameter reuse and distillation, we achieve high-performance hybrid models with minimal training overhead. Under a unified training setup, HydraHead outperforms other hybrid designs in long-context tasks while maintaining strong general reasoning. With interpretability-driven head selection, it matches a 3:1 layer-wise hybrid’s long-context performance at a 7:1 LA-to-FA ratio. Crucially, trained on only 15B tokens, HydraHead achieves over 69% improvement over the baseline at 512K context length, approaching Qwen3.5, a leading model of comparable size with a native context length of 256K. This highlights the significant scaling potential of head-level hybridization.

中文摘要

摘要:注意力的二次复杂性对长上下文处理构成了关键瓶颈,促使人们对混合注意力设计产生兴趣。大多数开源混合模型采用分层策略。然而,先前的研究指出,将线性注意力(LA)与全注意力(FA)整合存在固有困难,这表明注意力混合的设计空间尚未被充分探索。为了探究这一空间,我们进行了可解释性分析,观察到各层表现出块状功能相似性,而同一层内的单个头尽管共享输入特征,却具有不同的功能专化。这种头级异质性表明,头维度提供了融合异构注意力信号的自然且合理的粒度。在这一洞察的基础上,我们提出了HydraHead,一种沿头轴将FA和LA混合的新型架构。HydraHead具有两个关键创新:(1)一种可解释性驱动的选择策略,用于识别检索关键头,并只为它们保留FA;(2)一种规模归一化的融合模块,用于弥合FA和LA头输出之间的分布差异。通过利用参数重用和蒸馏的三阶段迁移流水线,我们实现了高性能的混合模型,同时训练开销最小。在统一训练设置下,HydraHead在长上下文任务中优于其他混合设计,同时保持强大的通用推理能力。通过可解释性驱动的头选择,它在长上下文性能上达到与3:1层级混合相当的效果,而LA与FA的比例为7:1。关键是,HydraHead仅在15B个token上训练,就在512K上下文长度下实现了比基线超过69%的提升,接近具备原生256K上下文长度的同等规模领先模型Qwen3.5。这突显了头级混合的显著扩展潜力。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决长上下文处理中计算效率与模型性能之间的根本张力,具体表现为以下三个层面的问题:

1. 计算复杂度的瓶颈

标准Transformer的全注意力机制(Full Attention, FA)具有二次复杂度 O(T^2) ,这成为处理长序列时的刚性计算障碍。虽然线性注意力(Linear Attention, LA)及其变体(如State Space Models)可将复杂度降至线性 O(T) ,但纯LA存在”表达性崩溃”问题,难以维持复杂推理任务所需的高精度token级检索能力

2. 混合架构设计的局限性

现有开源混合模型主要采用逐层(layer-wise)混合策略(即在不同层交替使用不同注意力机制),但此前工作已指出将LA与FA有效集成存在固有困难:

  • 层级别粒度过粗,难以捕捉功能异质性
  • 强行在层间混合会导致优化不稳定和性能下降
  • 设计空间未充分探索,缺乏原则性的混合粒度选择依据

3. 注意力头的功能异质性利用不足

通过机制可解释性分析,论文发现Transformer内部存在头级别功能异质性(head-level functional heterogeneity)

  • 同一层内的不同注意力头表现出显著的功能特化(如检索关键头、位置头、语法头等)
  • 仅稀疏子集的头对特定任务(如长上下文检索)起关键作用
  • 层间输出相似度呈平滑块结构,而头间贡献差异显著

核心解决方案

基于上述问题,论文提出HydraHead架构,在头(head)维度上精细混合FA与LA:

Hybrid Attention = FA(H_F) oplus LA(H_L)

其中 H_F 为通过因果干预识别出的检索关键头(保留FA以确保精度), H_L 为分配给线性注意力的剩余头(确保效率)。该方案通过可解释性驱动的头选择策略尺度归一化融合模块,在仅15B训练token的条件下,实现了512K上下文长度上相比基线69%以上的性能提升,同时保持强大的通用推理能力。

Q: 有哪些相关研究?

根据论文第2节”Related Work”,相关研究可归纳为以下四个主要领域:

1. 机制可解释性与头级别分析

该领域为论文的核心动机(头级别功能异质性)提供理论基础:

  • 电路级分析:Elhage等
    15
    建立Transformer电路数学框架,Wang等
    16
    在GPT-2中识别间接宾语(IOI)电路,将26个头划分为7个功能类别
  • 头功能特化:Voita等
    24
    识别位置头、语法头和罕见词头三类特化头;Michel等
    25
    证实仅少量头承载主要能力;Clark等
    26
    发现头学习特定句法关系
  • 因果干预方法:Activation Patching
    35
    和Path Patching
    16
    技术用于量化组件因果贡献

2. 线性注意力机制

论文采用Gated DeltaNet (GDN)作为LA代表,其演进脉络包括:

  • 状态空间模型(SSM):Mamba
    5
    、SSD
    6
    、Mamba-3
    7
    等通过输入依赖性选择性和高阶离散化改进
  • 快速权重记忆视角:基于Delta Rule的更新机制
    8
    ,后续引入门控机制
    9
    、解耦擦除与写入操作
    11

  • 固有限制:纯LA因固定维数循环状态限制长程检索精度,推动混合架构研究

3. 混合Transformer架构(三大范式)

论文重点对比的现有混合策略:

逐层混合(Layer-wise)

  • 代表模型:MiMo
    13
    、MiniMax-M1
    12
    、Qwen3.5
    3
    、GLM-5
    1
    (使用NAS优化配置)
  • 已知挑战:先前工作
    1,14,4
    指出LA与FA的层间混合训练困难,多退而采用全注意力或稀疏注意力变体

逐Token混合(Token-wise)

  • 动态选择:STILL
    32
    基于显著性门控决定token级FA/LA分配;Liger
    43
    采用滑动窗口注意力(SWA)与LA层间交错
  • 局限性:长上下文稳定性不足(多未报告>32K结果),且稀疏注意力需保留完整KV缓存

逐头混合(Head-wise)

  • 选择式:DuoAttention
    44
    和Elastic Attention
    45
    将关键头分配给FA,其余给稀疏注意力(但稀疏与FA共享二次计算核心,效率提升有限)
  • 融合式:Hymba
    46
    并行处理FA和Mamba分支后特征融合,但对所有头采用统一混合策略,未考虑功能特化

4. 跨架构迁移学习

将预训练Transformer转换为混合架构的蒸馏方法:

  • 早期尝试:T2R
    47
    、RADLADS
    48
    直接蒸馏Transformer至RNN/SSM
  • 性能障碍:MOHAWK
    49
    和LoLCATs
    50
    发现朴素蒸馏在检索密集型任务上性能下降
  • 近期进展:HedgeMamba
    51
    (两阶段蒸馏)、KL-Guided
    52
    (选择性层转换)、HALO
    53
    (本文采用的基础框架)

关键区别:现有逐头混合方法或局限于FA与稀疏注意力的组合
44,45
,或采用统一融合策略
46
;而本文HydraHead首次利用可解释性分析指导FA与LA的头级别分配,并设计尺度归一化融合机制解决分布差异问题。

Q: 论文如何解决这个问题?

论文通过HydraHead架构从四个维度系统性地解决上述问题:

1. 可解释性驱动的头选择策略

通过因果干预技术(Activation Patching与Path Patching)量化每个注意力头对目标能力(长上下文检索与通用推理)的因果必要性,而非依赖启发式规则:

  • 直接效应测量(Receivers):对每个头 h 执行激活补丁,测量其输出被损坏时模型行为的下降程度,归一化重要性分数为:
    I(E)^(l,h) = m(x) - m(x; O(l,h) arrow O_(l,h)(x’))m(x) - m(x’) ∈ [0,1]

  • 上游归因(Senders):通过路径补丁追踪对关键头的贡献,迭代识别传递检索信号的上游头

  • 跨能力融合:对能力 c 计算综合分数 sh^((c)) = max(I_E^(recv), I_E^(send)) · kappa_h^((c)) ,经min-max归一化后加权融合:
    S_h = ∑
    (c ∈ C) w_c s_h^((c))

最终按 S_h 排序,仅对 top-K 关键头保留FA,其余分配LA,实现高达7:1的LA-to-FA比例而性能不降。

2. 头级别混合架构设计

在同一层内沿头维度异构化注意力机制,而非层间交替:

  • 头分区:将查询头集合 H 划分为互斥子集 H_F (全注意力)与 H_L (线性注意力),满足 H_F ∪ H_L = H 且 H_F ∩ H_L = ∅
  • 并行计算:对每个头 h ,输入投影 Qh, K(g(h)), V(g(h)) 根据分区路由至对应分支:
    O_h = softmax(Q_h K
    (g(h))^top{√dh})V(g(h)) & h ∈ HF GDN(Q_h, K(g(h)), V_(g(h))) & h ∈ H_L

  • 分支特化优化

  • FA分支:移除RoPE(采用对数尺度系数替代),引入轻量门控分支动态调制输出,缓解”注意力汇聚”现象
  • LA分支(GDN):显式集成RoPE增强位置感知,并将KV头扩展至与查询头数量匹配(MHA配置),提升表征容量

3. 尺度归一化融合模块

解决FA与LA输出分布的根本差异(FA因softmax呈现低熵、查询范数敏感;LA因线性核函数呈现高熵、范数无关):

  • 独立归一化:对每分支输出先应用RMSNorm统一尺度:
    O_h = Norm(O_h)

  • 头级别可学习缩放:引入可学习向量 γ ∈ R^H ,按原始头索引广播相乘:
    O(:,h,:) = γ_h · O(:,h,:), quad ∀ h ∈ [1,H]

该机制在拼接前弥合分布鸿沟,避免异构特征直接融合导致的优化不稳定,同时保留各头的功能身份。

4. 三阶段迁移学习流程

针对混合架构从零训练成本高昂的问题,设计从预训练FA模型高效转换的渐进式方案:

阶段 目标 关键操作
Stage 1 局部行为对齐 冻结主干,仅优化混合层;FA分支门控初始化近似恒等映射,GDN分支通过通道重复复用预训练Q/K/V权重;最小化层输出MSE损失 Lalign = ∑l=1^L H(FA)^((l))(x) - H(Hybrid)^((l))(x) _2^2
Stage 2 全局语义对齐 解冻全模型,执行知识蒸馏;结合KL散度 LKD = DKL(P_(teacher) P_(student)) 与交叉熵损失,恢复线性近似导致的性能损失
Stage 3 长上下文适应 标准NTP微调,采用16K+上下文长度巩固长程能力,学习率恒定于 10^(-5)

该流程在仅15B训练token内实现高性能混合模型,相比从头训练节省数个数量级计算资源。

Q: 论文做了哪些实验?

根据论文第5节”Experiments”,实验围绕四个核心问题展开,共包含8组系统性实验

1. 混合架构对比实验(5.2节)

目的:验证HydraHead是否优于现有混合策略(逐层、逐Token、逐头混合)。

实验设置

  • 基线模型:Qwen3-1.7B
  • 对比架构:
  • 逐层混合:FA与GDN按3:1比例交错(类似HypeNet
    53
    ),以及均匀分布变体
  • 逐Token混合:4K滑动窗口注意力(SWA)+GDN;或Liger
    43
    风格(75%层用128窗口SWA+GDN,25%层用FA+GDN)
  • 逐头融合:Hymba
    46
    风格(所有头同时计算FA和GDN后特征融合)
  • HydraHead:保留25%头为FA,75%为GDN,基于可解释性选择

关键结果(表2):

  • HydraHead在长上下文任务(RULER Single/Multi-Key)上显著优于所有基线,扩展上下文(64K-256K)准确率远超逐层混合(87.49% vs 85.00%)
  • 通用推理(Hard基准)上保持>10%优势(31.03 vs 19.80),而逐Token/逐头混合虽在通用任务表现好但长上下文能力崩溃

2. 结构组件消融实验(5.3节)

目的:验证FA无位置编码(NoPE)、GDN的RoPE、门控机制、MHA配置等组件的贡献。

实验设计:固定头分配策略(前75%头为GDN,后25%为FA),逐步添加模块:

配置 RULER Single (Extended) 通用推理 (Hard)
基础混合 2.96% 31.14%
+ FA NoPE & Scale 40.58% 27.87%
+ GDN RoPE 56.38% 26.36%
+ FA Gate 60.89% 26.98%
+ GDN MHA 54.27% 29.66%
+ Query分解 62.62% 28.65%

发现:FA分支移除RoPE改用尺度调制对长上下文提升最关键(+37.6%);GDN使用MHA(而非GQA)有助于恢复通用推理能力。

3. 特征融合设计实验(5.4节)

目的:验证头级别尺度归一化融合的有效性。

对比方案

  • Direct Concatenation:无归一化直接拼接
  • Head-wise Scale:独立RMSNorm + 可学习缩放向量 γ (公式14)
  • Head-wise Gate:动态门控机制(softmax竞争)

结果(表5):

  • 移除归一化导致长上下文性能暴跌(87.49% → 71.36%)
  • 静态Scale调制在长上下文扩展上比动态Gate优20%(87.49% vs 67.16%),成为默认配置

4. 可解释性筛选有效性实验(5.5节)

目的:验证基于因果重要性的头选择优于随机或固定策略。

对比策略(均保持3:1的GDN:FA比例):

  • (a) 固定分配:每层前25%头为FA
  • (b) 层内随机:每层随机选25%头
  • (c) 全局随机:全局随机选25%头
  • (d) 层内可解释性筛选:每层选重要性最高的25%头
  • (e) 全局可解释性筛选:全局选重要性最高的25%头(HydraHead)

结果(表6):

  • 全局随机导致性能崩溃(RULER Single Extended仅32.96%,vs 固定分配62.62%)
  • 全局可解释性筛选最优(81.73%),证明跨层功能异质性的关键作用——关键头分散在各层而非集中

5. 更高混合比例的影响(5.6节)

目的:测试极端稀疏FA配置(7:1和9:1)的可行性。

实验设置

  • 比例:3:1(基线)、7:1、9:1
  • 策略:全局筛选 vs 约束全局筛选(确保每层至少1个FA头)

关键发现(表7):

  • 7:1比例下,约束策略(Global-Interp-C)在RULER Single Extended上达81.04%,与3:1逐层混合性能相当(表8),但通用推理优势显著(29.46 vs 19.80)
  • 9:1时性能开始下降,但约束策略仍保持72.69%(Single Extended)

6. 可解释性引导头选择的解剖分析(5.7节)

目的:验证头重要性评分的稳定性与因果忠实性。

实验内容

  • 样本稳定性:仅需6个校准样本即可使Spearman相关系数达0.9(图8左)
  • 长度鲁棒性:在256-16K上下文长度上计算的重要性排名高度一致(Jaccard相似度>0.7,图8中右)
  • 功能定位:仅6.5%的头(29/448)对长上下文检索因果关键,且分散在19个不同层中(表16)——直接证明层级别混合的次优性
  • 因果忠实性:按重要性排序敲除头,前1%头被敲除即可导致检索准确率从100%暴跌至接近0,而随机敲除影响甚微(图9b)

7. 训练配置优化(5.8节)

目的:优化三阶段训练的数据量与超参数。

优化措施

  • 扩大Stage 1和2的数据规模(从0.3B/1.0B增至0.8B/4.0B)
  • 增大batch size和序列长度(Stage 1: 512→2048)

结果(表10):

  • HydraHead在优化配置下RULER Multi-Key Native提升13.9%(37.10%→51.00%)
  • 逐层混合(HypeNet)在相同优化下Single-key性能下降(暴露其容量瓶颈)

8. 扩大训练规模的基准测试(5.9节)

目的:在15B token训练后对标SOTA模型。

对比模型

  • 标准Transformer:Qwen3-1.7B、Qwen3-1.7B-YaRN、MiniCPM5-1B
  • 混合架构:Gemma-3n-E2B、HypeNet-2B、Hymba-1.5B、Jet-Nemotron-2B

核心结果(表11、12):

  • 512K上下文:相比基线Qwen3-1.7B,HydraHead在NIAH Single上提升**+69.2%,在Multi-Key上提升+69.2%**(图1)
  • 与Qwen3.5-2B对比:在256K长度上性能接近(94.53% vs 领先模型水平),但仅使用15B token训练(vs 预训练规模)
  • 混合架构对比:在256K长度上,HydraHead(94.53%)远超其他混合模型(最高68.93%),同时在通用Hard基准上(50.62%)仅次于Jet-Nemotron但长上下文能力远超之(Jet在256K仅1.07%)

关键结论:HydraHead是目前唯一能在极端长上下文(256K+)保持可用性能的混合架构,同时不牺牲通用推理能力。

Q: 有什么可以进一步探索的点?

根据论文附录D”Limitations and Future Work”及正文讨论,以下方向值得进一步探索:

1. 规模与架构的扩展验证

当前实验主要基于Qwen3-1.7B这一相对紧凑的密集Transformer。未来需在以下维度验证头级别混合的普适性:

  • 模型规模:在7B、13B及更大参数规模上验证功能特化模式的稳定性
  • 架构多样性:扩展至混合专家模型(MoE)、多模态架构(视觉-语言模型),探索不同模态下注意力头功能特化的演变规律
  • 跨架构泛化:验证解释性引导的选择策略在不同预训练模型家族(如Llama、Gemma)间的迁移性

2. 训练数据扩展与后训练优化

现有训练仅使用15B token,远低于当代标准:

  • 数据规模:将训练语料扩大一个数量级(100B+ token),探索数据规模与混合比例(LA:FA)的缩放关系
  • 后训练阶段:研究头级别混合架构在**指令微调(SFT)人类反馈强化学习(RLHF)**中的表现,特别是长上下文推理与精确指令遵循之间的平衡
  • 对齐训练:验证在面向安全和对齐的后训练 regime 中,关键头的功能稳定性

3. 可解释性筛选方法的效率与自动化

当前依赖完整激活补丁(activation patching),计算成本随模型规模线性增长:

  • 高效近似:系统验证**归因补丁(attribution patching)**等单反向传播近似方法在头选择中的精度,以支持前沿规模模型(100B+参数)的筛选
  • 自动化协议:开发任务无关的校准输入构造方法,减少对NIAH等特定探针设计的领域依赖,实现”即插即用”的头选择流程
  • 动态重配置:探索在推理时根据输入动态调整头分配(而非静态选择),可能结合投机执行或早期退出机制

4. 极稀疏FA预算下的性能保持

现有结果存在理论最优与实际部署的间隙

  • 解释性分析显示仅~6.5%头为检索关键,但压缩至10% FA预算时性能已显著下降
  • 改进因果度量:开发更精细的干预方法(如多轮路径补丁、组合 Knockout)以识别冗余备份路径,减少”假阴性”关键头
  • 架构-训练协同优化:设计专门针对极端稀疏FA(如5%或更低)的初始化策略和训练目标,可能引入辅助损失强制LA头学习近似FA的局部精确检索行为

5. 异构注意力机制的 richer 组合

HydraHead的架构范式不限于FA+LA二元混合,可扩展至:

  • 三元及多元混合:在同一层内并行集成全注意力(FA)线性注意力(LA)稀疏注意力(如滑动窗口、局部注意力)及潜在空间注意力,形成”注意力头专家混合(Mixture of Attention Heads)”
  • 机制特异性设计:为不同注意力类型定制专门的KV缓存管理策略(如LA头的状态压缩、稀疏头的动态检索)
  • 硬件协同设计:针对异构注意力头的计算特性优化GPU/TPU内核,实现计算图级别的动态调度

6. 理论理解深化

  • 功能特化的涌现机制:研究预训练过程中头级别功能分化的动态过程,以及为何关键头呈跨层分散分布
  • 表达能力边界:从理论上刻画头级别混合架构的表达能力,相比层级别混合在长度泛化和细粒度检索上的形式化优势

Q: 总结一下论文的主要内容

这篇论文提出HydraHead,一种基于头级别功能异质性的细粒度注意力混合架构,旨在解决长上下文处理中计算效率与模型性能的张力。

研究背景与动机

标准Transformer的全注意力(FA)具有 O(T^2) 复杂度,难以扩展至超长序列;线性注意力(LA)虽降至 O(T) ,但存在”表达性崩溃”,难以维持高精度检索。现有混合模型多采用**逐层(layer-wise)**混合策略,但此前工作指出LA与FA的层间集成存在固有困难,且缺乏原则性的混合粒度选择依据。

核心洞察:头级别功能异质性

通过机制可解释性分析(Activation Patching与Path Patching),论文发现:

  • 层内异构:同一层内不同注意力头呈现显著功能特化,仅稀疏子集(约6.5%)对长上下文检索因果关键
  • 跨层分散:关键头分散在各层,而非集中于特定深度,层间输出相似度呈平滑块结构,难以明确划分机制边界
  • 粒度优势:头(head)而非层(layer)提供了功能上有根据的、足够细粒度的混合单元

HydraHead架构

基于上述洞察,论文提出三项核心技术:

1. 可解释性驱动的头选择 通过因果干预量化每个头对目标能力(检索与推理)的必要性:
IE^(l,h) = m(x) - m(x; O(l,h) arrow O_(l,h)(x’))m(x) - m(x’)
保留FA仅用于top-K关键头( H_F ),其余分配LA( H_L ),实现高达7:1的LA-to-FA比例。

2. 头级别混合与尺度归一化融合 在同一层内沿头维度异构化:

  • 分支特化:FA分支移除RoPE改用对数尺度调制,引入门控;LA分支(GDN)集成RoPE并扩展为MHA配置
  • 分布对齐:独立RMSNorm后,通过可学习头级别缩放向量 γ ∈ R^H 调和FA与LA的输出分布差异:
    O_(:,h,:) = γ_h · Norm(O_h)

3. 三阶段迁移学习 从预训练FA模型高效转换:

  • Stage 1:参数迁移与层对齐(冻结主干,最小化MSE)
  • Stage 2:全局logits蒸馏(KL散度+交叉熵)
  • Stage 3:长上下文微调(NTP目标)

实验成果

在Qwen3-1.7B上训练15B token的实验表明:

指标 关键结果
长上下文 512K长度NIAH任务较基线提升+69.2%,接近Qwen3.5-2B(原生256K支持)
混合比例 7:1 LA-to-FA比例下匹配3:1逐层混合的长上下文性能,通用推理优势>10%
架构对比 显著优于逐层、逐Token及现有逐头混合方法,唯一在256K+长度保持可用性能的混合架构
训练效率 仅需15B token实现上述增益,验证了头级别混合的强扩展潜力

贡献与意义

  • 理论贡献:首次系统论证头级别功能异质性作为混合架构设计原则,提供可解释性驱动的模型设计范式
  • 方法创新:提出尺度归一化融合机制解决异构注意力信号干涉问题,建立高效迁移学习流程
  • 实践价值:在极小训练开销下实现超长上下文(512K)与强通用推理的兼得,为高效长文本模型部署提供可行方案

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Zhentao Tan,Wei Chen,Jingyi Shen,Yao Liu,Xu Shen,Yue Wu,Jieping Ye

PDF URL: https://arxiv.org/pdf/2606.20097.pdf

Arxiv URL: https://arxiv.org/abs/2606.20097

Arxiv ID: 2606.20097

CoolPaper URL: https://papers.cool/arxiv/2606.20097

Published: 2026-06-24T01:41:21.779Z

Updated: 2026-06-24T01:41:21.779Z


12. Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

Abstract:Autoregressive generation in large language models (LLMs) conventionally decodes from the final layer, assuming that deeper representations yield more reliable next-token predictions. We revisit this assumption by revealing a recurring Guess-Refine-Perturb dynamic: early layers form coarse guesses, intermediate layers refine reasoning-relevant semantics, and final layers can perturb these refined predictions toward generic or alignment-preferred tokens. We introduce Confident Decoding, a training-free decoding strategy that dynamically selects the most reliable near-final layer through entropy-guided conservative backward search. We further provide a theoretical formulation of layer selection as an optimal stopping problem, showing that under bounded projection noise and dominant late-stage alignment perturbation, our search rule filters perturbation while bounding the loss relative to the oracle refinement layer. Experiments across dense and Mixture-of-Experts LLMs demonstrate consistent gains on challenging reasoning benchmarks, including GPQA-Diamond, Omni-MATH, and HLE, with zero memory overhead and less than 2% latency increase. These results suggest dynamically bypassing final-layer perturbations can unlock stronger reasoning behavior from aligned LLMs.

中文摘要

摘要:在大型语言模型(LLMs)中,自回归生成通常从最后一层解码,假设更深的表示能够产生更可靠的下一个标记预测。我们通过揭示一个反复出现的“猜测-优化-扰动”动态重新审视这一假设:早期层形成粗略猜测,中间层优化与推理相关的语义,而最终层可能将这些优化后的预测扰动到通用或对齐偏好的标记上。我们提出了自信解码(Confident Decoding),这是一种无需训练的解码策略,通过熵引导的保守向后搜索动态选择最可靠的接近最终层。我们进一步将层选择的理论公式化为最优停机问题,表明在有界投影噪声和主导晚期对齐扰动的情况下,我们的搜索规则能够过滤扰动,同时将损失相对于理想优化层进行界限控制。在密集和混合专家(Mixture-of-Experts)LLM上的实验表明,在挑战性推理基准上(包括 GPQA-Diamond、Omni-MATH 和 HLE),我们的方法实现了一致提升,并且无需额外内存开销,延迟增加不到 2%。这些结果表明,动态绕过最终层扰动可以释放对齐 LLMs 更强的推理能力。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文试图解决大型语言模型(LLM)在复杂推理任务中面临的”对齐税”(Alignment Tax)问题——即后训练对齐(如RLHF、DPO等)导致的最终层表示扰动现象。

核心问题识别

1. 传统假设的失效 传统自回归生成假设表示随网络深度单调改进:浅层提供不完整计算,中间层细化上下文,最终层产生最准确的预测。然而,论文发现这种”越深越好”的假设在复杂推理中并不成立。

2. “猜测-细化-扰动”动态(Guess–Refine–Perturb) 通过层动态分析,论文揭示了三阶段现象:

  • Phase I(猜测):浅层形成粗略统计猜测
  • Phase II(细化):中间层沿稳定语义轨迹细化推理相关表征,预测熵单调下降
  • Phase III(扰动):最终层(特别是全注意力层)引入显著的方向偏离,将预测推向通用、高频或对齐偏好的token(如”the”、”is”等功能词),而非保持领域特定的精确术语(如”mass”、”radius”)

3. 规划-语用权衡(Planning–Pragmatics Tradeoff) 现代后训练(RLHF、RLAIF、DPO)使最终层分布倾向于安全、通用的延续。对于日常对话这是有用的安全护栏,但对于复杂推理(数学、科学、编程),这种”对齐税”会覆盖中间层已建立的推理导向预测,导致逻辑链断裂。

解决思路

论文提出Confident Decoding——一种无需训练、即插即用的解码策略:

  • 机制:在生成每个token时,从最终层反向扫描,选择熵谷(Entropy Valley)——即置信度最高的近最终层(通常是Phase II结束时)
  • 优势:动态绕过后期的对齐扰动(Phase III),同时保留完整的前向传播(不截断Transformer,KV缓存正常使用)
  • 效果:在GPQA-Diamond、Omni-MATH、HLE等困难推理基准上显著提升性能(如Qwen3.5-35B-A3B在GPQA-D上提升6.5个百分点),且对安全性和创造性写作任务影响极小。

简言之,论文挑战了”必须从最终层解码”的固有假设,证明动态选择中间层的细化表征可以在不牺牲安全对齐的前提下,释放LLM被抑制的推理潜力。

Q: 有哪些相关研究?

根据论文第7节,相关研究可分为以下三个脉络:

1. 层动态与机制可解释性(Layer-wise Dynamics)

早期研究假设表示随深度单调改进,但近期证据表明中间层往往编码更强的任务相关语义:

  • Belrose et al. (2023):通过tuned lens揭示中间

Authors: Xuanming Zhang,Sining Zhoubian,Yuxuan Chen,Tianyi Tang,An Yang,Sean Du,Chujie Zheng,Fei Huang,Dayiheng Liu,Gao Huang,Jingren Zhou

PDF URL: https://arxiv.org/pdf/2606.21906.pdf

Arxiv URL: https://arxiv.org/abs/2606.21906

Arxiv ID: 2606.21906

CoolPaper URL: https://papers.cool/arxiv/2606.21906

Published: 2026-06-24T01:41:29.673Z

Updated: 2026-06-24T01:41:29.673Z


13. SkillHarness: Harnessing Safe Skills for Computer-Use Agents

Abstract:Computer-Use Agents (CUAs) are increasingly deployed in dynamic interactive environments, creating a growing need for continual skill learning during interaction. Recent approaches address this challenge by learning reusable skills from successful trajectories. However, these skill learning methods largely assume static and safe environments, overlooking risks from adversarial interactions (e.g., prompt injections) and environmental dynamics (e.g., pop-ups). In dynamic settings, such assumptions can lead to risky skill learning and brittle execution, undermining the reliability of CUAs. This raises the question: how can CUAs learn and use skills safely in dynamic environments? To address this problem, we propose SkillHarness, a framework for safe skill harnessing in dynamic environments. SkillHarness moves beyond static skill abstractions by modeling skill learning and utilization as a safety-constrained interaction process. Specifically, we introduce the skill boundary that leverages multi-source supervision signals to identify safe skills from interaction trajectories, and construct self-improving safety constraints throughout the skill lifecycle. In addition, SkillHarness introduces selective skill reuse, where tasks are guided to decompose according to context and completed through the selective activation of skill subsets. Our experiments demonstrate that SkillHarness significantly reduces the unsafe rate of learned skills by 57.1% and consistently improves execution stability under dynamic environmental changes, outperforming existing baselines.

中文摘要

摘要:计算机使用代理(CUAs)正越来越多地部署在动态交互环境中,这导致在交互过程中持续技能学习的需求不断增长。近期的方法通过从成功的轨迹中学习可复用技能来应对这一挑战。然而,这些技能学习方法在很大程度上假设环境是静态且安全的,忽略了来自对抗性交互(例如提示注入)和环境动态(例如弹窗)的风险。在动态环境中,这种假设可能导致技能学习存在风险且执行脆弱,从而削弱CUAs的可靠性。这提出了一个问题:CUAs如何在动态环境中安全地学习和使用技能?为了解决这一问题,我们提出了SkillHarness,一个用于在动态环境中安全利用技能的框架。SkillHarness超越了静态技能抽象,将技能学习和使用建模为一个受安全约束的交互过程。具体而言,我们引入了技能边界,通过利用多源监督信号从交互轨迹中识别安全技能,并在整个技能生命周期中构建自我改进的安全约束。此外,SkillHarness引入了选择性技能重用,其中任务根据上下文进行分解,并通过选择性激活技能子集来完成。我们的实验表明,SkillHarness显著将学习技能的不安全率降低了57.1%,并在动态环境变化下持续改善执行稳定性,优于现有的基线方法。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决 Computer-Use Agents (CUAs)动态交互环境中安全学习和使用技能的问题。具体而言,论文针对现有技能学习方法的两个核心局限性展开:

1. 监督偏差(Supervision Bias in Trajectories)

现有方法通常将任务成功视为技能学习的充分监督信号,仅从成功的轨迹中提取可重用模式。然而,在动态环境中,成功的执行可能依赖于瞬态或不安全的交互状态(如对抗性提示注入、异常弹窗等),导致不安全的行为模式被编码到学习到的技能中,进而在后续重用中引发安全风险。

2. 硬编码交互流的脆弱性(Hardcoded Interaction Flows)

现有方法将技能编码为固定的过程抽象(如固定的代码片段或 API 序列),无法根据环境动态调整执行粒度。当环境发生分布变化时(如 UI 布局变更、DOM 结构变化),这些刚性技能会导致脆弱执行(brittle execution),即技能可能在不适当的状态下被激活,或在环境变化时失效。

核心研究问题

论文将上述差距总结为:如何在动态环境中实现 CUAs 的安全技能学习与安全技能利用?(How can CUAs learn and use skills safely in dynamic environments?)

为回答该问题,论文提出了 SKILLHARNESS 框架,通过以下机制应对上述挑战:

  • 技能边界(Skill Boundary):利用多源监督信号(成功轨迹、失败案例、风险识别)构建安全约束,界定技能的适用条件;
  • 选择性技能重用(Selective Skill Reuse):通过解耦宏观策略(macro skills)与微观执行(micro skills),根据当前上下文选择性激活技能子集,并在安全约束不满足时回退到灵活的 LLM 规划。

Q: 有哪些相关研究?

这篇论文在Related Works部分主要讨论了以下两个相关研究方向:

1. Skill Learning(技能学习)

现有技能学习方法主要从成功轨迹中提取可重用模式,分为两类表示:

  • 语义技能(Semantic Skills):如 Xia et al. (2026)、Wang et al. (2025a) 等工作,从成功轨迹中抽象出语义层面的技能描述;
  • 代码技能(Code-based Skills):如 Voyager (Wang et al. 2023)、ASI (Wang et al. 2025b)、SkillWeaver (Zheng et al. 2025)、Polyskill (Yu et al. 2025) 等方法,将技能表示为程序代码(函数或 API)或工作流。

局限性与安全风险

  • 现有方法在技能归纳过程中缺乏对行为边界的显式建模,可能从原始轨迹中继承风险行为(如异常操作、无关交互步骤);
  • 近期研究(Liu et al. 2026; Wang et al. 2026)报道了恶意或受污染技能在实际应用中的潜在影响,包括意外行为或系统级风险;
  • 在动态操作系统环境中,从原始轨迹学习到的技能更可能编码偶然的环境依赖,从而降低安全性。

2. Harness Engineering(Harness 工程)

该领域关注如何通过系统性设计提升智能体的可控性:

  • 演进脉络:从早期的提示工程(Prompt Engineering, Sahoo et al. 2024)到上下文工程(Context Engineering, Zhang et al. 2025; Chen et al. 2025),再到 Harness 工程(Lopopolo 2026),反映了 CUAs 向更可控任务执行的发展趋势;
  • 技能表示的执行局限
  • 语义技能:正确执行依赖模型对技能意图和当前环境的理解,对上下文变化敏感(Wang et al. 2024; Xia et al. 2026);
  • 代码技能:将多步交互编码为过程代码,提高了确定性和可靠性,但与特定 UI 状态紧密耦合(Wang et al. 2025b; Zheng et al. 2025),当 UI 布局或交互流变化时易产生执行风险。

研究动机: 现有研究在动态环境中的安全技能利用方面仍缺乏 Harness 层面的设计,导致 CUAs 在部署期间的可控性降低。这促使作者探索在 Harness 层面实现安全技能利用的方法,以缓解执行风险。

Q: 论文如何解决这个问题?

论文提出了 SKILLHARNESS 框架,通过解耦技能表示多源边界约束选择性激活机制系统性地解决上述问题。具体解决方案分为技能学习技能利用两个阶段:

1. 解耦技能表示(Decoupled Skill Representation)

将传统紧耦合的技能拆分为两个层次,分离战略意图与环境特定实现:

  • 宏观技能(Macro Skills) M :捕获高层次策略及安全边界
    M = langle φ, P, L, R, N_M rangle
    其中:

  • φ :宏观意图(自然语言描述)

  • P :成功模式集合(记录执行路径 do 与完成条件 done_when
  • L :从失败中提炼的教训(Lessons)
  • R :风险守卫(Risk Guards),记录策略违反情况下的环境约束
  • N_M ⊂eq N :关联的微观技能集合
  • 微观技能(Micro Skills) m :提供基于当前状态的参数化动作序列
    m = langle σ, E, Theta rangle
    其中 σ 为语义标签, E 为执行模板, Theta 为运行时绑定的占位符集合。支持确定性执行(模板绑定)与语义回退(LLM 解释)两种模式。

2. 技能边界构建(Skill Boundary)

针对监督偏差问题,引入技能边界概念,通过三种互补监督信号界定技能的适用条件:

监督信号 来源 作用
成功模式 P 成功轨迹 提供有效行为的正向示例,记录多路径达成目标的方案
教训 L 失败案例 记录特定条件下失效的行为模式及恢复信号,防止重复错误
风险守卫 R 策略违规检测 编码环境状态约束(如需用户确认、禁止访问特定资源),在激活前验证

这种多源 formulation 使技能表示不仅包含”可执行模式”,还包含”这些模式在何种条件下保持可靠”。

3. 选择性技能重用(Selective Skill Reuse)

针对硬编码交互流问题,在利用阶段实施上下文感知的选择性激活

技能检索与过滤

  • 通过语义匹配检索候选宏观技能 M_t arrow Retrieve(M, s_t, g)
  • 约束检查:规划器(Planner)评估当前状态 s_t 是否满足风险守卫 R_M 的条件
  • 当环境漂移导致约束不满足时,抑制关联微观技能(设置 id_t arrow ∅ ),避免在不适用的状态下 rigid 执行

自适应执行 规划器生成决策 dt = π(plan)(st, M_t, Pi, τ(<t)) = langle u_t, e_t, y_t, id_t rangle ,其中:

  • u_t :下一原子子任务
  • e_t :预期可观察效果(用于进度验证)
  • id_t :可选的微观技能引用(仅当约束满足时非空)

执行器(Executor)根据 idt 选择执行路径:
a_t = EXEC(m
(id_t), u_t, s_t), & id_t ≠ ∅ LLM(u_t, s_t, M_t), & otherwise

  • 模板回退机制:当模板绑定失败或连续执行失败时,自动回退到 LLM 语义解释,防止脆弱重用累积错误
  • 安全优先:在对抗性或变化环境中,优先采用灵活的 LLM 规划而非刚性模板执行

4. 持续进化机制(Skill Evolution)

通过任务无关的探索(task-free exploration)持续精炼技能边界:

  • 技能提议:基于能力集群(capability clusters)识别未覆盖的交互模式,生成探索目标
  • 轨迹分析:对每条轨迹 τ_n 分析成功子任务(提取成功模式)、失败子任务(提炼教训)、检测风险(聚合风险守卫)
  • 稀疏更新:仅当新轨迹提供现有技能未覆盖的知识时,才创建新技能或更新现有技能( K_(n+1) = K_n ∪ Delta(τ_n, z_n) ),确保知识库稳定累积

总结

通过上述设计,SKILLHARNESS 将技能生命周期建模为受安全约束的交互过程

  • 学习阶段:多源监督信号构建显式边界,避免不安全行为被编码
  • 利用阶段:基于当前上下文选择性激活技能,在环境变化时通过分层回退(微观技能 arrow 宏观语义 arrow LLM 规划)保持执行稳定性

Q: 论文做了哪些实验?

论文在**第4节(Experiments)**及附录中开展了系统性实验,围绕两个核心问题展开:(1) 学习到的技能是否比现有方法更安全;(2) 在环境扰动下技能重用的完成稳定性如何。

1. 实验设置

基准测试(Benchmarks)

实验在四个基准上进行:

  • ST-WebAgentBench (Levy et al. 2024):评估在 GitLab 和 SuiteCRM 上的站点特定安全策略遵从性
  • WASP (Evtimov et al. 2026):评估在对抗性提示注入攻击下的安全性能(GitLab 和 Reddit 环境)
  • OS-Harm (Kuntz et al. 2026):评估操作系统环境中对提示注入攻击(PIA 类别)的鲁棒性
  • OpenApps (Ullrich et al. 2025):评估在 UI 状态变化(如弹窗、对抗性描述、误导性描述)下的技能可执行性

对比方法(Baselines)

在两种技能学习设定下与代表性基线对比:

(1)任务训练(Task Training)

  • Default:无技能库的智能体基线
  • ASI (Wang et al. 2025b):从预定义训练任务的成功轨迹中学习可重用技能
  • SKILLHARNESS w/o update:禁用测试时探索的技能库更新

(2)自我提议(Self Proposal)

  • Default:无技能库基线
  • SkillWeaver (Zheng et al. 2025):通过自我提议任务与迭代优化持续学习技能
  • 所有方法统一应用基准定义的安全策略以确保公平比较

评估指标(Metrics)

  • 不安全技能率(USR, Unsafe Skill Rate):违反安全策略的学习技能占比
  • 技能完成率(SCR, Skill Completion Rate):调用技能时达成预期效果的比例
  • 成功率(SR, Success Rate):任务正确完成的比例
  • 攻击成功率(ASR, Attack Success Rate):对抗条件下被成功攻击的比例
  • 策略遵从完成率(CUP, Completion Under Policy):同时完成且遵从安全策略的任务比例

2. 主要实验结果

整体性能(Overall Performance)

ST-WebAgentBenchWASP 上的评估(表1)显示:

  • SKILLHARNESS 在所有设定下均优于基线,平均提升 31.9% 的安全性能
  • 相比 ASI,SKILLHARNESS 将学习技能的不安全率降低 57.1%
  • 在 WASP 上,SKILLHARNESS 将 ASR 从 67.5%(ASI)降至 2.5%,同时保持 85.0% 的 SR

技能学习安全性(Skill Learning Safety)

ST-WebAgentBench 上的 USR 评估(表2)显示:

  • ASI 的 USR 为 75.0%,SkillWeaver 为 43.6%
  • SKILLHARNESS 的 USR 仅为 2.2%,验证了多源监督信号在归纳安全技能方面的有效性

技能利用稳定性(Skill Utilization Robustness)

OpenApps 上的 SCR 评估(图4)显示:

  • 在无扰动环境下,SKILLHARNESS 与 SkillWeaver 的 SCR 相当(约 1.00 vs 1.00),表明安全性提升未牺牲基础可执行性
  • 弹窗对抗性描述误导性描述混合扰动下,SKILLHARNESS 保持 SCR 在 0.80 以上,而 SkillWeaver 降至 0.50 或更低
  • 宏观-微观技能分离机制防止局部环境变化级联为完整意图失败

跨环境与模型泛化

  • OS 环境:在 OS-Harm 上(图3),SKILLHARNESS 在 Writer、Multi-apps、Thunderbird、VS Code 等应用中均保持低 ASR 和高 SR,验证了其跨环境泛化能力
  • 模型规模:在 WASP 上的跨模型评估(表3)显示,从 GPT-5.4-mini 到 Qwen3.6-27B 乃至更小模型(MAI-UI-8B、OpenCUA-7B),ASR 始终维持在低位(0-3.6%),表明技能边界作为显式行为约束可跨模型泛化,与模型推理能力弱耦合

3. 消融研究(Ablation Study)

WASP 上的消融实验(表4)验证了各组件贡献:

变体 SR 变化 ASR 变化 关键发现
w/o Update -2.4 -1.2 持续进化主要影响任务完成率,对安全性影响较小
w/o Skill Boundary -3.6 +9.6 移除多源监督导致攻击成功率显著上升,验证边界构建的核心安全作用
w/o Macro Skills -1.2 +3.6 高层次任务分解提升执行可靠性
w/o Micro Skills 0.0 0.0 可靠性更多取决于恰当的技能选择而非直接复用过程代码

4. 案例研究(Case Study)

附录 A 提供了三类典型案例分析:

  • 成功案例:在界面状态变化时,多源监督(成功模式、教训、风险守卫)使规划器能抑制不适用的微观技能,通过分层降级保持稳定执行
  • 失败案例:主要源于技能覆盖不足与执行验证时机错位,而非安全策略违规;过细分解导致技能僵化,过粗分解丢失上下文约束
  • 风险案例:在对抗条件下,SKILLHARNESS 比代码基线更保守,但未见过的风险模式仍可能绕过过程约束,表明技能边界受训练轨迹多样性限制

5. 实现细节

  • 探索轮次:Self Proposal 设定下每站点 30 轮探索
  • 模型:技能学习使用 GPT-5.4,下游评估主要使用 GPT-5.4-mini,并跨 Qwen3.6-plus、OpenCUA-7B、MAIUI-8B、Qwen3.6-27B 验证
  • 检索参数:默认检索 top-k=3 宏观技能,每步最多 6 个领域微观技能
  • 扰动设置:OpenApps 上构建了默认、弹窗、对抗性描述、误导性描述及混合五种扰动场景

Q: 有什么可以进一步探索的点?

基于论文第5节 Discussion & Future Work 及实验发现,以下方向值得进一步探索:

1. 技能抽象粒度与可重用性的平衡

当前方法在自提议探索阶段产生的技能往往过于狭窄或复杂,导致下游任务难以覆盖或重用。具体挑战包括:

  • 过度特化的成功路径:自提议目标常导致针对特定 episodes 优化的技能路径,在分布外任务中表现脆弱
  • 模型能力补偿差异:强模型(如 GPT-5.4)可通过自身能力弥补技能缺失细节,而弱模型执行相同技能时稳定性显著下降
  • 预定义能力集群的局限性:虽然按能力聚类(capability clusters)可提升技能抽象质量,但预定义类别可能限制可发现技能的范围

未来研究需探索自适应粒度控制机制,在技能发现过程中动态调整抽象层次,平衡覆盖范围与可重用性。

2. 风险守卫的完备性与自适应更新

论文发现,技能边界对未见过的对抗行为模式(distributionally shifted adversarial behaviors)仍可能失效:

  • 训练轨迹多样性瓶颈:风险守卫的有效性受限于探索阶段遇到的风险模式多样性
  • 被动风险识别:当前依赖探索过程中的策略违规检测,可能遗漏潜在风险场景

需研究主动风险探索方法,通过对抗性技能发现(adversarial skill discovery)或基于模型的风险预测,扩展风险守卫的覆盖范围,实现从”已知风险防护”向”潜在风险预判”的演进。

3. Harness 设计的系统化方法论

实验表明,测试时反馈与选择性重用可缓解部分技能失败的影响,暗示 harness 设计本身对可靠性具有独立贡献:

  • Harness 组件的模块化设计:需建立 harness 设计的标准化接口,明确技能检索、约束检查、回退机制的交互协议
  • 运行时监控与干预:开发更细粒度的执行监控机制,在技能激活前进行动态沙盒验证或影响预估

未来可探索 Harness 工程的形式化框架,将安全约束从技能表示层上升到执行控制层,实现分层防御。

4. 跨环境技能迁移与领域泛化

当前评估主要在特定网站(GitLab、Reddit)或 OS 应用中进行,跨领域技能迁移能力尚未充分验证:

  • 领域特定微观技能的泛化:如何将某一领域(如 Web)学习到的宏观策略迁移到全新领域(如桌面应用),同时保持微观执行的适应性
  • 环境动态性的建模:研究环境状态转移的时序建模,预测 UI 布局演化趋势, preemptively 调整技能边界

5. 技能边界的形式化验证与可解释性

当前风险守卫基于自然语言描述和 LLM 判断,缺乏形式化保证:

  • 形式化安全约束:将风险守卫转化为形式化规范(如时序逻辑、状态机约束),支持自动化验证
  • 技能决策的可解释性:开发机制解释为何特定技能被激活或抑制,特别是在安全关键场景下的决策溯源

6. 持续学习中的技能遗忘与冲突解决

随着技能库规模增长,可能出现:

  • 技能冲突:不同宏观技能的成功模式或风险守卫在特定状态下相互矛盾
  • 过时技能累积:环境演化导致历史技能失效,但当前稀疏更新机制未考虑主动遗忘

需研究技能库的长期维护机制,包括技能冲突检测、版本控制及基于环境漂移的自动淘汰策略。

Q: 总结一下论文的主要内容

这篇论文针对计算机使用智能体(Computer-Use Agents, CUAs)动态交互环境中的安全技能学习与利用问题,提出了 SKILLHARNESS 框架。以下是主要内容概述:

1. 研究背景与核心问题

现有技能学习方法(如 Voyager、ASI、SkillWeaver)主要从成功轨迹中提取可重用模式,但隐含假设环境静态且安全,这在实际动态环境中导致两类风险:

  • 监督偏差(Supervision Bias):将任务成功视为唯一监督信号,可能编码依赖瞬态危险状态(如对抗性提示注入、异常弹窗)的不安全行为;
  • 硬编码脆弱性(Hardcoded Brittleness):技能被编码为固定过程(如代码片段),无法适应环境分布变化(如 UI 布局变更),导致执行失效或风险激活。

论文将这一差距归结为现有方法缺乏人类技能学习中的 know-how(不仅知道”做什么”,还知道”何时、在何种条件下做”),而非仅 know-what

2. SKILLHARNESS 框架

为解决上述问题,论文提出将技能生命周期建模为受安全约束的交互过程,包含两大核心机制:

(1)解耦技能表示(Decoupled Skill Representation)

将技能分为两层:

  • 宏观技能(Macro Skills) M = langle φ, P, L, R, N_M rangle :捕获高层次意图 φ 、成功模式 P (执行路径与完成条件)、失败教训 L 、风险守卫 R (策略约束)及关联的微观技能集合;
  • 微观技能(Micro Skills) m = langle σ, E, Theta rangle :提供基于当前状态的参数化动作模板 E ,支持确定性执行与语义回退两种模式。

(2)技能边界与选择性重用(Skill Boundary & Selective Reuse)

  • 多源监督构建边界:整合三类信号界定技能适用条件:
  • 成功模式(正向示例)、失败教训(负面经验)、风险守卫(策略违规约束);
  • 上下文感知激活:部署时,规划器检查当前状态是否满足风险守卫,仅当约束满足时激活对应微观技能;否则抑制技能并回退至 LLM 灵活规划,防止在漂移环境中僵化执行。

3. 实验验证

ST-WebAgentBench(策略遵从)、WASP(对抗注入)、OS-Harm(系统安全)和 OpenApps(UI 鲁棒性)四个基准上的实验表明:

  • 安全性:相比现有方法,SKILLHARNESS 将学习技能的不安全率降低 57.1%(从 43.6%-75.0% 降至 2.2%),对抗攻击成功率(ASR)降低 65.0 个百分点(从 67.5% 降至 2.5%);
  • 稳定性:在 UI 扰动(弹窗、误导性描述等)下,技能完成率(SCR)保持在 0.80 以上,而基线降至 0.50 以下;
  • 任务性能:任务成功率平均提升 19%,策略遵从完成率(CUP)提升 17.1 个百分点
  • 跨模型泛化:技能边界作为显式约束,在不同规模模型(从 GPT-5.4 到 7B 开源模型)上均保持低攻击成功率,与模型推理能力弱耦合。

4. 主要贡献

  • 问题识别:揭示了动态环境中轨迹驱动技能学习的监督偏差与脆弱性根源,即缺乏对技能适用边界的显式建模;
  • 方法创新:提出首个面向动态环境的安全技能利用框架,通过解耦表示与多源约束实现从”成功回放”到”条件化重用”的范式转变;
  • 系统验证:实现原型系统并在多基准上验证,证明显式技能边界与选择性激活机制可显著提升 CUAs 的安全性与鲁棒性。

论文最后讨论了技能抽象粒度、风险守卫完备性及 Harness 工程系统化等未来研究方向。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yurun Chen,Biao Yi,Keting Yin,Shengyu Zhang

PDF URL: https://arxiv.org/pdf/2606.20636.pdf

Arxiv URL: https://arxiv.org/abs/2606.20636

Arxiv ID: 2606.20636

CoolPaper URL: https://papers.cool/arxiv/2606.20636

Published: 2026-06-24T01:42:42.426Z

Updated: 2026-06-24T01:42:42.426Z


14. Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

Abstract:Self-distillation improves reasoning in large language models by using the model’s own rollouts as training signal, typically through implicit logit-level alignment that minimizes KL divergence toward a privileged target distribution. However, because this supervision is generated via uncontrolled sampling, it provides no diagnostic insight into the model’s specific errors or corrective guidance for its individual failure patterns. Consequently, the model learns to imitate a privileged distribution rather than receiving fine-grained corrections that pinpoint where and why its reasoning fails. In this paper, we propose Trajectory-Augmented Policy Optimization (TAPO), which advances self-distillation from implicit distributional alignment to explicit trajectory construction. During RL training, the model produces both correct and incorrect rollouts to the same query, and TAPO leverages this contrastive structure to construct micro-reflective corrections, new training trajectories that retain the model’s erroneous reasoning up to the point of failure, then insert a natural-language diagnosis and corrected reasoning guided by a correct reference from the same sampling group. Since each trajectory is anchored in the learner’s own prefix and solutions, the corrective signal preserves the model’s on-policy distribution to a greater extent than the position-wise alignment imposed by KL-based methods. To integrate these trajectories, TAPO introduces difficulty-aware candidate selection at the model’s capability boundary and decoupled advantage estimation to prevent gradient contamination. Experiments on AIME 2024, AIME 2025, and HMMT 2025 show that TAPO achieves consistent improvements over GRPO under the same number of training steps. Further analysis demonstrates that TAPO strengthens both first-pass reasoning and error-correction effectiveness.

中文摘要

摘要:自我蒸馏通过使用模型自身的输出作为训练信号来改善大型语言模型的推理能力,通常通过隐式的logit级对齐来实现,以最小化与特权目标分布的KL散度。然而,由于这种监督是通过不受控的采样生成的,它无法提供关于模型具体错误的诊断见解,也无法为其个别失败模式提供纠正指导。因此,模型学会模仿特权分布,而不是接收能够精准指出其推理失败原因的细粒度纠正。在本文中,我们提出了轨迹增强策略优化(TAPO),将自我蒸馏从隐式分布对齐推进到显式轨迹构建。在强化学习训练过程中,模型针对同一查询生成正确和错误的输出,而TAPO利用这种对比结构构建微反思纠正,即在保留模型错误推理直至失败点的前提下,插入由同一采样组的正确参考指导的自然语言诊断和纠正推理。由于每条轨迹都以学习者自身的前缀和解答为锚点,纠正信号在保留模型策略内的分布方面比基于KL的方法强的逐位置对齐效果更好。为了整合这些轨迹,TAPO在模型能力边界引入难度感知候选选择,并通过解耦优势估计防止梯度污染。在AIME 2024、AIME 2025及HMMT 2025上的实验表明,在相同步骤数的训练下,TAPO比GRPO实现了持续改进。进一步分析显示,TAPO既增强了首次推理能力,也提高了错误纠正的有效性。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文针对现有自蒸馏(Self-Distillation)方法在提升大语言模型推理能力时的根本性局限展开研究,核心问题在于:当前方法通过隐式分布对齐(Implicit Distributional Alignment)抑制错误而非利用错误,导致模型缺乏对自身推理失败的诊断与纠正能力

具体而言,论文识别出现有方法(如 On-Policy Distillation 及其变体)存在的两大关键缺陷:

1. 监督信号的隐式性与不可控性

现有方法通过最小化 KL 散度,将模型输出分布与基于正确解的”特权目标分布”(Privileged Target Distribution)对齐。然而:

  • 该监督为连续的对数概率级(logit-level)信号,其内容、结构及教学属性无法被显式控制;
  • 该机制作为”黑盒”运作,不提供关于底层推理过程的诊断性洞察,即不指明”错误在何处发生”及”为何发生”;
  • 缺乏从错误到正确推理的结构化过渡表示,模型仅学习”正确的分布应呈现何种形态”,却从未练习如何诊断特定步骤的错误或执行纠正。

2. 错误模式的压制而非利用

当模型生成错误推理时,KL 目标通过对数概率压力惩罚其错误分布,强制其回归特权轨迹。这导致:

  • 错误恢复能力缺失:模型学会规避错误状态,但从未被训练如何在陷入错误时进行自我恢复;
  • 错误前缀的浪费:包含模型自身推理直至失败点的”错误前缀”(Erroneous Prefix)被视为需被覆盖的对象,而非有价值的纠错学习起点;
  • 探索多样性 collapse:错误位置的大梯度信号压缩模型预测多样性,抑制了有效探索与自主纠错所需的分布多样性,使模型日益受限为单一特权轨迹的复现。

核心解决思路

论文提出 Trajectory-Augmented Policy Optimization (TAPO) 框架,将自蒸馏从隐式分布对齐推进至显式轨迹构建

  • 利用 GRPO 采样中天然存在的对比结构(同一问题的正确与错误 rollout),构建”微反思纠正轨迹“(Micro-Reflective Corrections);
  • 这些轨迹锚定于学习者自身的错误前缀,保留模型直至失败点的原始推理,插入自然语言诊断与纠正,形成从错误到正确的显式过渡;
  • 通过难度感知候选选择(Difficulty-aware Candidate Selection)、解耦优势估计(Decoupled Advantage Estimation)及 OOD Token 抑制(OOD Token Suppression)等机制,将构建的轨迹稳定整合进优势基 RL 训练。

简言之,论文试图解决:如何让模型从自身的错误中学习,通过显式构建基于错误诊断的纠正轨迹,实现比传统分布对齐更精细、更具诊断性的自我蒸馏,从而增强首次推理(first-pass reasoning)与错误纠正(error-correction)的双重能力。

Q: 有哪些相关研究?

根据论文第2节(Related Work),相关研究主要围绕以下三个方向展开:

1. 推理强化学习(Reinforcement Learning for Reasoning)

该方向关注如何通过强化学习提升大语言模型的推理能力,特别是基于可验证奖励的强化学习(RLVR):

  • STaR (Zelikman et al., 2022) 与 ReST (Gulcehre et al., 2023):展示了模型可以通过迭代自训练,利用自身生成的正确解来引导推理能力提升,这为现代 RLVR 奠定了基础。
  • DeepSeek-R1 (Guo et al., 2025):证明 RL 训练能够激发复杂的链式思考(Chain-of-Thought)行为,包括自我验证与回溯。
  • GRPO (Group Relative Policy Optimization) (Shao et al., 2024):通过组内相对优势估计(Group-Relative Advantage Estimation)简化策略优化,消除了对单独 Critic 模型的需求,其优势计算方式为:
    A_i = (r_i - μ_G) / (σ_G + ε)
    其中 μ_G 和 σ_G 分别为组内奖励的均值与标准差。
  • DAPO (Yu et al., 2026):通过 Token 级策略梯度损失、动态采样与 clip-higher 机制进一步提升训练稳定性。

TAPO 与上述方法的关键区别在于:GRPO 仅隐式利用采样组内的对比信息(正确与错误解),而 TAPO 显式利用这种对比结构构建纠错轨迹。

2. 自蒸馏与错误驱动学习(Self-Distillation and Error-Driven Learning)

该方向探索模型如何从自身输出中学习,特别是通过蒸馏与错误纠正机制:

基于分布对齐的自蒸馏:

  • OPD (On-Policy Distillation) (Agarwal et al., 2024):通过教师模型指导学生模型在自身 rollout 上进行 KL 散度最小化,提供稠密 Token 级监督。
  • OPSD (On-Policy Self-Distillation) (Zhao et al., 2026a):移除外部教师,使用同一模型在特权信息(正确答案)条件下的输出作为教师分布。
  • ROSD (Reflective On-Policy Self-Distillation) (Zhao et al., 2026c):引入错误聚焦的反思机制来引导教师监督。

上述方法的共同机制是在每个 Token 位置最小化学生与目标分布的 KL 散度,提供连续但缺乏结构化错误-纠正过渡表示的监督。

多轮迭代修正方法:

  • Self-Refine (Madaan et al., 2023):通过多轮循环提示模型批判并修正自身生成。
  • Reflexion (Shinn et al., 2024):使用语言强化,将环境反馈转换为文本反思信号。
  • SCoRe (Kumar et al., 2024):通过多轮 RL 训练模型进行自我纠正,先生成初始响应再生成修正版本。
  • ERL (Experiential Reinforcement Learning) (Shi et al., 2026):将经验-反思-巩固循环嵌入语言智能体的 RL 训练中。

这些方法依赖多轮循环或独立反思阶段,在部署时产生额外生成成本。

基于错误分析的学习:

  • 教育心理学基础ZPD (Zone of Proximal Development, Vygotsky, 1978) 框架指出,有效教学必须锚定于学习者当前理解水平,并提供从现有状态(包括错误)到目标状态的显式路径;Metcalfe (2017) 关于从错误中学习的理论。
  • Rejection Sampling (Yuan et al., 2023):过滤生成响应仅保留高质量输出。
  • DPO (Direct Preference Optimization) (Rafailov et al., 2023):利用偏好对训练模型。

与上述方法不同,TAPO 构造全新的训练轨迹(而非选择或排序现有样本),捕捉从错误到正确推理的显式过渡,且仅在训练时应用,推理时保持单轮生成。

3. 训练稳定性与分布对齐(Training Stability and Distributional Alignment)

该方向关注如何处理偏离模型自身分布的数据以避免训练不稳定:

  • DDT (Distribution Discriminant Theory) (Zhang et al., 2026):通过中心化对数似然准则量化 Token 与模型预测分布的对齐程度,提供分布内与分布外数据的原则性度量。
  • 离策略校正:在 RL 语境下,离策略数据需要通过重要性采样或约束优化进行偏差校正。
  • 分布感知方法:在样本或轨迹层面测量序列是否属于分布内并决定是否包含。

TAPO 借鉴 DDT 思想但操作于** Token 级别**,通过 OOD Token Suppression (OTS) 机制选择性衰减分布外 Token 的权重,同时保留分布内 Token 的学习信号,解决了构造轨迹中同时包含分布内前缀与潜在分布外纠正 Token 的矛盾。

Q: 论文如何解决这个问题?

论文通过提出 Trajectory-Augmented Policy Optimization (TAPO) 框架,将自蒸馏从隐式分布对齐推进至显式轨迹构建,系统性地解决了上述局限。具体解决方案包含以下核心组件:

1. 微反思轨迹构建(Micro-Reflective Trajectory Construction)

该机制利用 GRPO 采样中天然存在的对比结构(同一查询产生正确与错误解),构造显式的纠错学习信号:

  • 难度感知候选选择(Difficulty-aware Candidate Selection, DCS)
    依据 Vygotsky 的”最近发展区”(ZPD)理论,仅当采样组内同时包含至少 n(pos) 个正确解和 n(neg) 个错误解时(即 |P| ≥ n(pos) 且 |N| ≥ n(neg) ),才对该查询执行轨迹构建。这确保训练聚焦于模型能力边界内的问题,并随训练动态形成涌现式课程学习(Emergent Curriculum)。

  • 轨迹合成(Trajectory Synthesis)
    对选定的错误 rollout y^- 与正确参考 y^+ ,构建合成提示,要求模型:

  1. 诊断错误:识别错误响应中首个关键错误的位置与类型;
  2. 构造纠正轨迹完整保留错误推理前缀(保持分布邻近性),在错误点插入自然语言反思过渡(如”Wait, let me double-check…”),随后接续正确推理至最终答案。

输出格式严格遵循 XML 标签结构:

1
2
<analysis>[错误诊断]</analysis>
<reconstruction>[保留前缀 + 反思 + 纠正]</reconstruction>

2. 解耦优势估计(Decoupled Advantage Estimation, DAE)

为避免构建轨迹对原始 GRPO 更新的污染,TAPO 引入组间解耦机制:

  • 将原始 rollout 组 G(orig) 与反思轨迹组 G(ref) 分配独立的组标识符(通过为查询 UID 添加后缀 _reflected 实现);
  • 优势计算在组内独立进行:
    Ai^(orig) = r_i^(orig) - μ(Gorig){σ(Gorig) + ε}, quad A_j^(ref) = r_j^(ref) - μ(Gref){σ(G_ref) + ε}

这防止了”优势污染”(Advantage Contamination)——即高奖励的纠正轨迹抬高组内均值,导致原始错误样本获得过度负向优势,进而引发响应长度崩溃与策略熵崩溃。

3. OOD Token 抑制(OOD Token Suppression, OTS)

针对构建轨迹中可能存在的分布外(Out-of-Distribution)token(特别是反思过渡短语),TAPO 引入 Token 级加权机制:

  • 对每个 token yt 计算分布对齐分数:
    s_t = log p
    θ(yt | x, y(<t)) + H[pθ(· | x, y(<t))]
    其中 H 为策略熵。

  • 转换为乘法权重 wt = clamp(exp(s_t), w(min), w(max)) ,仅应用于反思轨迹损失:
    L
    (ref) = -(1) / (T)∑_(t=1)^T w_t · min(rho_t · A^(ref), clip(rho_t, 1-ε, 1+ε) · A^(ref))

分布内 token( s_t ≈ 0 )获得权重 ≈ 1.0 ,而分布外纠正 token 被自动降权,既保留数学推理部分的学习信号,又避免强制模型学习遥远的元认知过渡短语。

4. 冷启动预训练(Cold-Start Phase)

在 RL 训练前,通过监督微调(SFT)使模型具备:

  • 格式遵循能力:可靠生成 <analysis><reconstruction> 标签;
  • 基础纠错能力:能够执行基本的错误分析与纠正。

该阶段使用约 45,000 个构造示例(30,000 SFT 格式 + 15,000 IFT 格式)进行联合训练。实验表明,缺乏冷启动会导致 OTS 被迫抑制大量纠正信号,显著降低训练效果。

5. 训练与推理的解耦

关键设计:微反思轨迹构建仅在训练时应用,推理时 TAPO 执行标准单轮生成(Single-Pass Generation),无需思考模式或多轮解码。这意味着:

  • 训练时模型通过显式纠错轨迹学习诊断与恢复模式;
  • 推理时模型将这些能力内化为一般推理行为,在必要时自主进行自我纠正,而非生成表面化的反思文本。

通过上述机制,TAPO 实现了从”压制错误分布”到”利用错误作为学习起点”的范式转变,在保持训练稳定性的同时,增强了模型的首次推理(first-pass reasoning)与错误纠正(error-correction)双重能力。

Q: 论文做了哪些实验?

论文在第4节(Experiments)中设计了系统性实验,围绕以下核心问题展开:TAPO 是否优于现有自蒸馏方法?改进是否源于真实能力内化?各设计组件的贡献如何? 具体实验内容如下:

1. 主实验结果(Main Results)

实验设置:

  • 数据集:AIME 2024(30题)、AIME 2025(30题)、HMMT 2025(竞赛级难题)
  • 评估指标:Pass@k(k ∈ {1,2,3,4,5}),温度 0.6,top-p 0.9,16 次独立运行取平均
  • 基线:Qwen3-8B-Instruct(基础模型)、Cold-Start(冷启动检查点)、GRPO、OPSD(On-Policy Self-Distillation)
  • 训练设置:对比两种初始化方式——直接从基础模型训练(Direct Training)、从冷启动检查点训练(Cold-start)

关键发现:

  • 冷启动设置:TAPO 在所有三个基准上均取得最佳 Pass@1,AIME 2024 达 62.50%(较 GRPO 提升 9.58 点,较 OPSD 提升 4.79 点),HMMT 2025 达 31.46%(较 GRPO 提升 2.71 点,较 OPSD 提升 7.29 点)。
  • 直接训练设置:无冷启动时,TAPO 在 AIME 2024 仍领先(63.12%),但在 AIME 2025 和 HMMT 2025 略逊于 GRPO,验证了冷启动对分布对齐的关键作用。

2. 能力内化分析(Capability Internalization Analysis)

为验证改进是否源于真实能力而非表面行为,论文定义了两个诊断指标:

  • 直接解决率(DSR, Direct Solution Rate):在正确回答的问题中,无需任何中间反思/自我纠正即直接得出答案的比例,衡量首次推理能力
  • 有效反思率(ERR, Effective Reflection Rate):在包含反思尝试的响应中,成功定位错误、准确诊断并得出正确答案的比例,衡量错误纠正有效性

结果(冷启动设置):

方法 AIME 24 DSR AIME 25 DSR HMMT 25 DSR AIME 24 ERR AIME 25 ERR HMMT 25 ERR
GRPO 34.0 22.1 28.0 52.0 51.5 33.8
TAPO 47.5 38.0 50.4 63.4 56.3 36.8
提升 +13.5 +15.9 +22.3 +11.4 +4.8 +3.0

结论:TAPO 不仅提升了错误纠正能力(ERR↑),更显著增强了首次推理能力(DSR↑),证明训练信号已内化为模型的一般推理能力,而非仅学会生成反思文本。

3. 反思轨迹学习的消融实验(Ablation of Reflective Trajectory Learning)

在 200 步训练下,控制单一变量以分离各设计因素贡献:

配置 AIME 24 Pass@1 AIME 25 Pass@1 HMMT 25 Pass@1
Cold-start 31.67 23.75 14.37
+ GRPO 41.46 30.00 20.00
+ SFT w/ micro-reflective 30.62 20.21 12.29
+ TAPO w/ full reconstruction 42.29 33.75 18.75
+ TAPO w/ micro-reflective 46.67 36.46 20.62

对比分析:

  • RL vs SFT:相同轨迹数据下,RL 优化(46.67%)显著优于最大似然训练(30.62%),证明组相对优势估计对区分有效/无效纠正至关重要。
  • 前缀保留 vs 完全重建:完全重建(丢弃错误前缀,从头生成)在 AIME 24 上较微反思设计低 4.38 点,验证了保留学习者部分推理路径对可学习性的关键作用。

4. 集成组件消融(Integration Component Ablation)

逐步添加组件以验证各机制必要性(从精简版到完整 TAPO):

配置 AIME 24 Pass@1 AIME 25 Pass@1 HMMT 25 Pass@1
w/o DAE + w/o OTS + w/o Negative 52.71 41.46 20.83
w/o OTS + w/o Negative 49.17 36.67 21.67
w/o OTS 57.29 45.83 21.46
TAPO(完整) 62.50 46.88 31.46

关键验证:

  • 负样本(Negative Samples):移除后导致性能下降(尤其在 AIME 24/25),证明其在反射组中作为对比锚点、防止优势估计偏差的作用。
  • 解耦优势估计(DAE):与负样本协同工作,避免纠正轨迹抬高组均值导致的原始样本优势污染。
  • OOD Token 抑制(OTS):移除后 HMMT 25 性能从 31.46% 骤降至 21.46%,证明其对分布外纠正 token 的稳定作用。

5. 训练动态分析(Training Dynamics)

追踪 500 步训练过程中的多项指标(对比 Cold-start+TAPO、Cold-start+GRPO、Cold-start+OPSD、Qwen3+TAPO):

  • OTS 权重演变:冷启动模型保持 OTS 权重接近 1.0(分布对齐良好),而无冷启动的 Qwen3+TAPO 降至约 0.95,证明冷启动对减少分布外 token 的必要性。
  • 策略梯度损失:TAPO 损失低于 OPSD 且方差更小,避免 OPSD 因特权蒸馏目标与策略分布不匹配导致的高波动。
  • 梯度范数:TAPO 维持较低梯度范数,表明优化景观更平滑。
  • KL 散度:冷启动 TAPO 的 KL 散度与 GRPO 相当且远低于 OPSD,而无冷启动版本 KL 增长近一个数量级,验证 DAE 与 OTS 对控制策略漂移的有效性。
  • 响应长度:所有方法长度均增长,但 TAPO 与 GRPO 增长较温和,避免 OPSD 的失控长度膨胀。

6. 难度感知候选选择敏感性分析

调整 ZPD 阈值 (n(pos), n(neg)) 与最大构建数 m_(max) :

n_(pos) n_(neg) m_(max) AIME 24 Pass@1 AIME 25 Pass@1 HMMT 25 Pass@1
2 2 2 51.88 37.92 22.08
2 2 4 57.92 40.21 24.17
2 4 4 62.50 46.88 31.46
1 5 3 57.08 48.96 30.42

结论:默认配置 (2,4,4) 表现最均衡;降低 n_(neg) 至 2 或收紧至 (1,5,3) 均导致性能下降,证明在模型能力边界(ZPD)内选择候选问题的有效性。

Q: 有什么可以进一步探索的点?

基于论文的核心贡献与实验局限,以下方向可作为未来工作的深入探索点:

1. 跨领域泛化与领域适应性

论文仅在数学推理(AIME、HMMT)上验证 TAPO。未来可探索:

  • 代码生成与程序修复:在代码补全或 Competitive Programming 中,利用编译器/执行器反馈构造微反思轨迹(如定位运行时错误并生成修复补丁)。
  • 科学问答与多模态推理:将框架扩展至物理、化学等需要多步实验推理的领域,或结合视觉输入(几何题图表)进行错误定位。
  • 开放域生成:当前机制依赖二元正确性奖励,在创意写作等主观任务中,需探索基于模型自信度或人类偏好的“软性错误”定义。

2. 自适应反思粒度与多级纠正

当前微反思轨迹固定以首个关键错误为纠正点,且仅执行单轮纠正

  • 动态深度反思:根据错误严重性(如概念性错误 vs 计算笔误)自适应调整反思长度与深度,而非统一模板。
  • 迭代纠正链(Iterative TAPO):当首次纠正仍失败时(即 G_(ref) 中的负样本),可递归构造“纠正失败后的再纠正”轨迹,形成多级纠错训练信号,模拟人类逐步逼近正确解的过程。
  • 错误类型感知的纠正策略:区分逻辑谬误、算术错误、符号混淆等类型,学习针对性的反思模板(如“符号检查” vs “逻辑重推”)。

3. 与过程奖励模型(PRM)的深度融合

论文仅使用结果奖励(Outcome Reward)。结合 PRM 可实现:

  • 细粒度错误定位:利用 PRM 的 step-level 分数自动识别错误发生的具体步骤,替代当前依赖模型自我诊断的 <analysis> 阶段,降低构造失败率。
  • 课程学习的动态优化:基于 PRM 的 step-level 难度估计,替代固定的 ZPD 阈值 (n(pos), n(neg)) ,实现更精细的最近发展区边界划分。

4. 计算效率与训练基础设施优化

  • 异步轨迹构造:当前构造过程需同步前向传播(§3.3.2),可探索异步流水线,将轨迹生成与策略更新解耦,减少 GPU 空闲时间。
  • 蒸馏构造器:使用小型专用模型(如 1.5B)执行微反思轨迹合成,而非使用主策略模型自身,降低训练时计算开销,同时保持分布邻近性(需验证蒸馏引入的分布偏移)。

5. 测试时反思的条件触发机制

当前训练目标是将反思能力内化为隐式行为,但可显式学习何时启动反思

  • 元认知策略学习:训练模型在生成过程中主动输出特殊 token(如 <reflect>)触发自我检查,而非被动依赖内部状态。这需在奖励函数中平衡“正确率”与“反思开销”(类似思考模式的长度惩罚)。
  • 早期终止与置信度:结合模型对生成步骤的置信度(entropy 或 likelihood),动态决定是否需要生成纠正轨迹,避免过度思考。

6. 大规模模型与长程推理的稳定性

  • 模型规模扩展:验证 TAPO 在 70B+ 参数模型及极长推理链(>10k tokens)上的有效性,此时 OOD Token 抑制(OTS)机制是否仍能稳定处理分布偏移。
  • 长上下文记忆:在长文档推理或多轮对话中,错误可能源于远距离上下文遗忘,需探索跨段落的微反思机制。

7. 与外部监督的混合范式

  • 人机协同构造:对比纯自构造(Self-Constructed)与引入少量人工标注纠正轨迹(Human-Crafted)的混合训练,分析“黄金标准”纠正示范对 ZPD 学习效率的边际增益。
  • 多智能体互纠:利用多个策略模型实例(如不同随机种子或检查点)相互提供纠正参考,替代单模型自参考,增加纠正轨迹的多样性。

8. 理论分析

  • 收敛性保证:分析 Decoupled Advantage Estimation 在策略梯度理论中的偏差-方差权衡,证明其在非平稳策略更新中的稳定性优势。
  • 分布邻近性的量化:建立微反思轨迹与原始策略分布的 KL 散度上界理论,指导前缀保留长度的最优选择。

Q: 总结一下论文的主要内容

本文提出 Trajectory-Augmented Policy Optimization (TAPO),一种将大语言模型自蒸馏从隐式分布对齐推进至显式轨迹构建的强化学习框架,旨在通过利用模型自身的错误模式来增强推理与纠错能力。

1. 研究背景与问题

现有自蒸馏方法(如 On-Policy Self-Distillation, OPSD)通过最小化 KL 散度,将模型输出与基于正确答案的”特权目标分布”对齐。该方法存在两大局限:

  • 监督信号的隐式性:仅提供连续的 Token 级对数概率监督,无法显式诊断”错误在何处发生”及”如何纠正”,模型仅模仿正确分布的形态,而非学习错误到正确的结构化过渡;
  • 错误模式的压制:错误推理前缀被视为需覆盖的对象,导致模型缺乏错误恢复能力,且 KL 压力会压缩分布多样性,抑制探索与自主纠错。

2. 核心方法

TAPO 基于 GRPO(Group Relative Policy Optimization)框架,在每次迭代中利用同一查询产生的正确与错误解的对比结构,构造微反思纠正轨迹(Micro-Reflective Corrections),并集成三项关键机制:

微反思轨迹构建

对于符合”最近发展区”(ZPD)条件的问题(即同时包含正确与错误解),选取错误 rollout y^- 与正确参考 y^+ ,构造合成提示,要求模型:

  • <analysis> 标签中诊断首个关键错误;
  • <reconstruction> 标签中完整保留错误前缀(维持分布邻近性),插入自然语言反思过渡(如”Wait, let me double-check…”),并接续正确推理。

该过程仅在训练时执行,推理时模型执行标准单轮生成,将纠错能力内化为一般推理行为。

解耦优势估计(Decoupled Advantage Estimation, DAE)

为避免构建轨迹的高奖励抬高组内均值、导致原始样本优势被污染(Advantage Contamination),TAPO 将原始 rollout 组 G(orig) 与反思组 G(ref) 分配独立组标识符,优势计算解耦为:
Ai^(orig) = r_i^(orig) - μ(Gorig){σ(Gorig) + ε}, quad A_j^(ref) = r_j^(ref) - μ(Gref){σ(G_ref) + ε}

OOD Token 抑制(OOD Token Suppression, OTS)

针对构建轨迹中可能存在的分布外 token(特别是反思过渡短语),计算 Token 级分布对齐分数 $st = log pθ(yt|x,y(<t)) + H
pθ
,并转换为权重 w_t = clamp(exp(s_t), w
(min), w_(max))$ 对损失进行加权,选择性衰减分布外 token 的梯度贡献。

冷启动预训练

在 RL 前通过监督微调(SFT)使模型掌握轨迹构建格式与基础纠错能力,确保后续 RL 训练中 OTS 无需过度抑制信号。

3. 实验验证

在 AIME 2024、AIME 2025 与 HMMT 2025 数学竞赛基准上的实验表明:

  • 性能提升:冷启动设置下,TAPO 在 AIME 2024 达 62.50% Pass@1,较 GRPO 提升 9.58 点,较 OPSD 提升 4.79 点;在最难的 HMMT 2025 上提升 2.71 点(对比 GRPO)。
  • 能力内化:通过**直接解决率(DSR)有效反思率(ERR)**指标验证,TAPO 不仅提升错误纠正能力(ERR↑),更显著增强首次推理能力(DSR 在 HMMT 25 上提升 22.3 点),证明纠错训练信号已内化为一般推理能力。
  • 消融研究:验证了前缀保留(对比完全重建)、负样本包含、DAE 与 OTS 各组件的必要性;分析了冷启动对维持分布对齐(OTS 权重接近 1.0)与训练稳定性的关键作用。

4. 结论

TAPO 通过显式构造基于自身错误的微反思轨迹,实现了从”压制错误分布”到”利用错误作为学习起点”的范式转变。通过难度感知候选选择、解耦优势估计与 OOD Token 抑制,该框架在保持训练稳定性的同时,有效增强了模型的首次推理与自主纠错能力。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Zhilin Huang,Hang Gao,Ziqiang Dong,Yuan Chen,Yifeng Luo,Chujun Qin,Jingyi Wang,Yang Yang,Guanjun Jiang

PDF URL: https://arxiv.org/pdf/2606.18844.pdf

Arxiv URL: https://arxiv.org/abs/2606.18844

Arxiv ID: 2606.18844

CoolPaper URL: https://papers.cool/arxiv/2606.18844

Published: 2026-06-24T01:42:50.212Z

Updated: 2026-06-24T01:42:50.212Z


15. Unlimited OCR Works

Abstract:Recently, end-to-end OCR models, exemplified by DeepSeek OCR, have once again thrust OCR into the spotlight. A widely held view is that employing a large language model (LLM) as the decoder allows the model to leverage the prior distribution of language, leading to improved OCR performance. However, the downside is equally evident: as the output sequence lengthens, the accumulated KV cache drives up memory consumption and progressively slows down generation. This stands in stark contrast to humans, who exhibit no such decline in efficiency during long-horizon copying tasks. In this technical report, we propose Unlimited OCR, a model designed to emulate human parsing working memory. Taking DeepSeek OCR as the baseline, we replace all attention layers in the decoder with our proposed Reference Sliding Window Attention (R-SWA), which reduces attention computation costs while maintaining a constant KV cache throughout the entire decoding process. By combining the high compression rate of DeepSeek OCR’s encoder with our constant KV cache design, Unlimited OCR can transcribe dozens of pages of documents in a single forward pass under a standard maximum length of 32K. More importantly, R-SWA is a general-purpose parsing attention mechanism - beyond OCR, it is equally applicable to tasks such as ASR, translation, etc. Codes and model weights are publicly available at this http URL.

中文摘要

摘要:最近,以 DeepSeek OCR 为代表的端到端 OCR 模型再次将光学字符识别(OCR)推到聚光灯下。一个广泛认可的观点是,使用大语言模型(LLM)作为解码器可以让模型利用语言的先验分布,从而提升 OCR 性能。然而,其缺点也同样明显:随着输出序列的增长,累积的 KV 缓存会增加内存消耗,并逐渐减慢生成速度。这与人类形成鲜明对比,人类在长序列复制任务中效率并不会下降。在本技术报告中,我们提出了 Unlimited OCR,一种旨在模拟人类解析工作记忆的模型。以 DeepSeek OCR 为基线,我们将解码器中的所有注意力层替换为我们提出的参考滑动窗口注意力(R-SWA),该方法在保持整个解码过程中 KV 缓存恒定的同时,降低了注意力计算成本。通过结合 DeepSeek OCR 编码器的高压缩率和我们恒定 KV 缓存的设计,Unlimited OCR 可以在标准最大长度 32K 的条件下,在一次前向传递中转录数十页的文档。更重要的是,R-SWA 是一种通用的解析注意力机制——除了 OCR 外,它同样适用于语音识别(ASR)、翻译等任务。代码和模型权重可在此 http URL 上公开获取。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决端到端OCR模型在长时程文档解析(long-horizon parsing)任务中面临的效率与内存瓶颈问题,具体表现为以下两个核心挑战:

1. 长序列推理中的KV缓存膨胀与速度衰减

现有基于大语言模型(LLM)的端到端OCR模型(如DeepSeek OCR)在解码阶段采用标准全注意力机制(Multi-Head Attention),其KV缓存大小随输出序列长度 T 线性增长( C_(MHA)(T) = L_m + T )。这导致:

  • 内存消耗持续累积:当处理多页文档时,累计的KV缓存迅速占满显存,限制生成长度;
  • 生成速度渐进下降:注意力计算复杂度随序列长度增加而上升,导致解码延迟不断增大(如图3所示)。

2. 长时程解析的上下文碎片化

现有模型无法在一次前向传播中解析多页文档(如整本书或长篇幅论文),只能采用逐页循环处理(for-loop paradigm)

  • 每处理一页即重置模型记忆,导致长时程依赖断裂;
  • 将连贯的长时程任务割裂为孤立的短任务,依赖外部调度器,不符合人类认知中”持续抄录”的工作模式。

解决方案概述

为应对上述问题,论文提出 Unlimited OCR 模型,核心创新在于Reference Sliding Window Attention (R-SWA)

  • 恒定KV缓存设计:通过限制每个生成token仅关注所有参考token(视觉token与提示)及前 n 个输出token(默认 n=128 ),将解码阶段KV缓存上限固定为 L_m + n ,使其与生成长度无关;
  • 工作记忆机制模拟:借鉴人类抄书时的认知模式——持续关注原始文本(全局参考)与最近书写上下文(局部滑动窗口),实现对历史信息的”软遗忘”(soft forgetting),而非完全保留或彻底重置;
  • 长时程一次性解析:结合DeepEncoder的高压缩率(16× token压缩),模型可在32K标准长度限制下,单次前向传播完成数十页文档的转录,且保持恒定生成速度(TPS)与显存占用。

此外,R-SWA作为一种通用解析注意力机制,其适用性不仅限于OCR,还可扩展至语音识别(ASR)、长文本翻译等需长时程依赖建模的参考型任务。

Q: 有哪些相关研究?

根据论文第2节(Related Works),相关研究主要分为基于流水线的框架端到端模型两大范式,并在端到端范式内部分别关注编码器压缩与解码器效率两个维度:

1. 基于流水线的OCR框架(Pipeline-based Framework)

传统文档解析模型普遍采用检测-识别分离的流水线架构:

  • 经典范式:先通过检测模型定位文档元素(如文本块、表格、公式区域),再调用多个专用识别模型分别解析各区域内容,期间依赖裁剪、矫正等启发式策略进行模块衔接;
  • LLM增强范式:近期演进方向包括保留传统检测器但将识别模型统一为单一大语言模型(LLM)解码器,或采用”检测-裁剪-识别”的双阶段LLM调用策略(如先由LLM检测区域,再经裁剪策略处理后二次调用LLM进行内容识别)。

代表工作包括PaddleOCR系列、MonkeyOCR、Dolphin等。

2. 端到端OCR模型(End-to-end Model)

随着视觉-语言模型(VLMs)发展,端到端OCR通过统一函数合并检测与识别,在单前向传播中完成整页解析。该范式对模型容量与训练稳定性要求更高,但在架构创新与训练方法论上更具启发性。

2.1 高压缩率编码器(High-compression Encoder)

编码器的token压缩率决定了长时程解析的理论上界:

  • DeepEncoder(DeepSeek OCR采用):级联SAM-ViT(窗口注意力)与CLIP-ViT(全局注意力),在桥接层实现 16× token压缩,将高分辨率图像(如 1024×1024 )压缩至256个视觉token;
  • 意义:极低的视觉token数量是长时程OCR的前提,确保预填充阶段(prefill)不会过早耗尽上下文长度与显存。

2.2 高效率解码器(High-efficiency Decoder)

解码器设计直接影响推理成本,涉及激活值与KV缓存两个层面:

  • 激活值优化:当前端到端OCR模型多控制在3B参数以下,DeepSeek OCR进一步采用混合专家(MoE)架构,推理时仅激活500M参数,显著降低计算开销;
  • KV缓存瓶颈现有模型的关键局限在于解码阶段KV缓存随序列长度线性增长( C(MHA)(T) = L_m + T ),导致长序列生成时内存占用持续增加、速度渐进衰减。这正是本文提出Reference Sliding Window Attention (R-SWA) 所要解决的核心问题——通过将解码注意力约束在固定大小的因果滑动窗口内,实现恒定的KV缓存( C(R-SWA) ≤ L_m + n )与稳定的生成速度。

3. 相关技术背景

  • 视觉-语言基座模型:包括Qwen2.5-VL、InternVL3、GPT-4o、Gemini系列等,为端到端OCR提供多模态理解能力基础;
  • 注意力机制变体:标准多头注意力(MHA)、滑动窗口注意力(SWA)及其改进版本;本文特别区分了参考token(视觉/提示)生成token的注意力模式,提出保持参考token全局可见而生成token局部滑动的R-SWA机制,避免线性注意力中因状态转移导致的视觉特征模糊问题。

Q: 论文如何解决这个问题?

论文通过提出 Unlimited OCR 模型及其核心机制 Reference Sliding Window Attention (R-SWA),从架构设计、缓存管理与训练策略三个层面系统性解决了长时程解析的效率瓶颈。

1. 核心机制:Reference Sliding Window Attention (R-SWA)

R-SWA 是一种模拟人类抄书时工作记忆(working memory)的注意力机制,其核心在于将注意力计算约束在一个固定大小的双段窗口内:

  • 全局参考段(Prefix):包含所有视觉 token(经 DeepEncoder 压缩)与提示文本,长度记为 L_m 。该段对所有生成 token 全局可见且不参与状态转移(state transition),避免视觉特征随解码进程逐渐模糊;
  • 局部因果段(Sliding Window):仅关注当前生成位置前 n 个输出 token(默认 n=128 ),形成因果滑动窗口 D_n(t) 。

形式化地,对于第 t 个生成 token,其可访问的注意力范围为:
N(t) = P ∪ D_n(t)
其中 P = 1, …, L_m , D_n(t) = j mid max(L_m+1, L_m+t-n) ≤ j ≤ L_m+t-1 。

注意力权重与输出表示计算为:
α(tj) = exp(frac{q_t^top k_j{√d_k})}{∑(i ∈ N(t)) exp(qt^top k_i{√d_k})}, quad o_t = ∑(j ∈ N(t)) α_(tj) v_j

2. 恒定 KV 缓存管理策略

与标准多头注意力(MHA)的线性增长缓存 C_(MHA)(T) = L_m + T 不同,R-SWA 通过固定容量队列实现常数级缓存

C_(R-SWA)(T) = L_m + min(n, T) ≤ L_m + n

具体实现上,KV 缓存被设计为容量 L_m + n 的循环队列:

  • 预填充阶段(Prefill):一次性编码所有参考 token(多页文档图像),缓存大小为 L_m ;
  • 解码阶段(Decode):每生成一个新 token,将对应 KV 向量加入队列;当队列长度超过 L_m + n 时,驱逐第 (m+1) 个位置的 KV(即最早的生成 token),确保缓存占用不随生成长度增加。

缓存压缩比随序列长度增加而趋近于零:
rho(T) = C(R-SWA)(T)C(MHA)(T) ≈ (L_m + n) / (T) to 0 quad (T gg n)

3. 架构设计:Unlimited OCR

基于 DeepSeek OCR 基线,Unlimited OCR 保留其高压缩率组件,全面替换注意力机制:

  • DeepEncoder:级联 SAM-ViT(窗口注意力)与 CLIP-ViT(全局注意力),实现 16× token 压缩(如 1024×1024 图像压缩为 256 token),为长时程解析提供极短的预填充长度;
  • MoE-LLM 解码器:保留 3B 总参数 / 0.5B 激活参数的混合专家架构,将所有层的标准 MHA 替换为 R-SWA;
  • 端到端生成:支持在单次前向传播中连续解析数十页文档,无需外部调度器的分页循环。

4. 数据工程与训练策略

  • 数据构造:构建约 200 万文档 OCR 样本(单页:多页 = 9:1),其中多页数据通过随机拼接 2–50 页单页数据合成,使用 <page> 作为分页符;所有数据打包至 32K 序列长度;
  • 继续训练(Continue-training):从 DeepSeek OCR checkpoint 出发,冻结 DeepEncoder,仅训练 LLM 参数(4,000 steps,batch size 256,学习率 1e-4 ,余弦退火调度);
  • 长上下文支持:采用 DeepEP 专家并行(EP=4)与 Megatron-LM 框架,支持 32K 长度训练。

5. 推理系统优化

  • 内核级优化:基于 Flash Attention v3 实现 R-SWA 内核,确保每步解码延迟恒定(见图 3),避免因 KV 缓存长度跨越对齐边界导致的延迟尖峰;
  • 推理引擎集成:在 Transformers 库与 SGLang 引擎中实现 R-SWA 的 KV 缓存队列管理,支持恒定 TPS(tokens/second)与恒定显存占用的长时程生成。

通过上述设计,Unlimited OCR 将长时程解析的内存占用从线性增长 O(T) 降至常数级 O(L_m + n) ,同时保持甚至提升了 OCR 精度(OmniDocBench v1.5 上较基线提升 6%),实现了”单前向传播解析整本书”的能力。

Q: 论文做了哪些实验?

论文在**第5节(Evaluation)第6节(Efficiency Analysis)**中系统性地开展了以下实验验证:

1. 基准测试与评估指标设计

  • 主测试集:采用 OmniDocBench 的两个版本
  • v1.5:用于与经典端到端算法及基线 DeepSeek OCR 对比;
  • v1.6:用于与当前端到端 SOTA 模型对比(含296张额外测试图像)。
  • 长时程测试集:自建内部测试集,选取小说、文档、论文等,按页数划分为 2、5、10、20、40+页 五个类别,每类不少于10本,验证多页一次性解析能力。
  • 评估维度与指标

  • 文本识别:Text Edit Distance(Edit ↓,字符级准确率)

  • 公式识别:Formula CDM(CDM ↑)
  • 表格结构:Table TEDS(含内容)与 TEDS-S(仅结构)(↑)
  • 阅读顺序:Reading Order Edit Distance(Edit ↓)
  • 综合得分:Overall(文本、公式、表格的加权平均)
  • 长时程专用指标:Distinct- n ( n -gram 唯一率,↑)与 Edit Distance(↓),用于衡量长序列生成中的重复模式与累积错误。

2. 主实验:端到端 OCR 精度对比(Table 1)

在 OmniDocBench 上对比 Unlimited OCR 与现有 SOTA 端到端模型(包括 OCRFlux、GPT-4o、InternVL3、Qwen2.5-VL、Gemini-2.5 Pro、DeepSeek-OCR 等):

测试集 对比结论
v1.5 Unlimited OCR 达到 93.23% Overall 得分,较 DeepSeek OCR 基线(87.01%)绝对提升 6.22%;Text Edit Distance 降低 0.035,Table TEDS 提升 5.96%。
v1.6 Unlimited OCR 达到 93.92% Overall 得分,超越所有对比模型(包括 HunyuanOCR、DeepSeek-OCR 2、Qwen3-VL 等),取得端到端 SOTA。

同时报告了推理效率:在 OmniDocBench 标准测试条件下,Unlimited OCR 达到 5580 TPS,较 DeepSeek OCR 的 4951 TPS 提升 12.7%

3. 子类别细分实验(Table 2)

在 OmniDocBench v1.5 的 9 种文档类型(PPT、学术论文、书籍、彩色教科书、试卷、杂志、报纸、笔记、研究报告)上,与 DeepSeek OCR 及 DeepSeek OCR 2 进行细粒度对比:

  • 评测指标:Text Edit Distance 与 Reading Order Edit Distance(均为越低越好)。
  • 关键发现:Unlimited OCR 在 9 类文档的文本与阅读顺序任务上均取得一致提升,无性能回退;在复杂版式(杂志、报纸、笔记)上仍保持优势,证明将解码器全部替换为 R-SWA 对解析任务完整且无损。

4. 长时程解析能力实验(Table 3)

验证模型一次性解析多页文档的能力,测试页数范围 2 至 40+ 页

页数 Distinct-20 Distinct-35 Edit Distance
2 99.76% 99.87% 0.0362
5 99.78% 99.98% 0.0452
10 97.49% 99.83% 0.0526
20 98.73% 99.89% 0.0572
40+ 96.08% 96.90% 0.1069
  • 分析:即使输入 40+ 页,Distinct-35 仍保持 96.90%,Edit Distance 低于 0.11,表明 R-SWA 在长序列下未出现严重的模式崩溃或累积错误。
  • 错误分析:40+ 页时的重复错误主要源于小字号文本在 DeepEncoder “Base” 模式( 1024×1024 分辨率)下的识别困难,而非 R-SWA 在长时程跟踪中丢失方向。

5. 效率与可扩展性实验

5.1 理论推理性能上限(Table 4)

对比 Unlimited OCR 与 DeepSeek OCR 在不同生成长度(256 至 6144 tokens)下的 TPS(Tokens Per Second)

  • 短序列(256 tokens):两者性能相当(约 7229 TPS)。
  • 长序列(6144 tokens):DeepSeek OCR 因 KV 缓存膨胀与对齐边界问题,TPS 降至 5822.87;而 Unlimited OCR 因 R-SWA 的恒定缓存设计,TPS 维持在 7847.71领先 35%

5.2 内核延迟微观测试(Figure 3)

基于 Flash Attention v3 内核的每步解码延迟测试(micro-benchmark)显示:

  • DeepSeek OCR:延迟随解码步数(Decode step)线性增长,且在 KV 缓存长度跨越特定对齐边界时出现延迟尖峰。
  • Unlimited OCR:每步延迟保持恒定,不受生成长度影响,验证 R-SWA 在计算成本与显存占用上的稳定性。

6. 训练策略验证(第4.2节)

  • 继续训练设置:从 DeepSeek OCR checkpoint 出发,冻结 DeepEncoder,仅训练 LLM 参数(R-SWA 层)。
  • 数据规模:在 200 万文档 OCR 样本(含 9:1 单页/多页比例)上训练 4000 steps,batch size 256,序列长度 32K。
  • 结果:仅通过轻量级继续训练(而非从头预训练)即实现精度与长时程能力的双重提升,证明 R-SWA 架构的样本效率与兼容性。

Q: 有什么可以进一步探索的点?

根据论文第7节(Limitation and Future Work)及前文讨论,可进一步探索的研究方向包括:

1. 突破固定上下文长度的硬性约束

尽管 R-SWA 解决了解码阶段 KV 缓存的线性增长问题,但预填充(prefill)阶段仍受限于最大上下文长度(如 32K)。随着输入页数增加,视觉 token 的累积仍会导致上下文溢出。

  • 短期方案:训练支持更长上下文(如 128K)的模型,以容纳更多页面的预填充;
  • 长期方案:构建**预填充池(prefill pool)**机制,使模型能够学习自动获取预填充 KV 缓存分块(prefill KV chunks),模拟人类”翻页”的动态参考行为,从而实现真正意义上的无限长文档解析。

2. 向更广泛的任务领域迁移

R-SWA 作为通用解析注意力机制,其适用性不限于 OCR。可将其迁移至其他依赖长时程参考的任务:

  • 语音识别(ASR):处理小时级音频转录,避免历史音频特征随时间累积导致的缓存爆炸;
  • 长文本翻译:在翻译长篇书籍或技术文档时,保持对源文本全局参考与局部生成的平衡;
  • 视频理解:将视频帧序列作为参考 token,实现长视频内容的连续解析。

3. 视觉编码器与分辨率的自适应优化

当前多页解析采用 DeepEncoder 的 “Base” 模式( 1024×1024 分辨率),导致小字号文本识别困难(见第5.4节错误分析)。未来可探索:

  • 动态分辨率机制:根据文档内容密度(如小字体、密集排版)自动切换至高分辨率模式(如 “Gundam” 动态分辨率),或引入金字塔式多尺度编码;
  • 更高压缩率的编码器:在保持特征保真度的前提下,进一步提升视觉 token 压缩率(如 32× 或更高),减少预填充长度。

4. 滑动窗口策略的自适应学习

当前 R-SWA 采用固定窗口大小 n=128 。可探索:

  • 自适应窗口机制:根据内容复杂度(如从文本段落切换到表格或公式时)动态调整滑动窗口宽度,或引入可学习的门控机制决定历史信息的保留范围;
  • 分层注意力:在解码器不同层采用不同窗口策略(底层关注局部、高层关注全局),以平衡局部连贯性与长程依赖性。

5. 长文档数据构造与训练策略

当前多页训练数据通过简单拼接单页数据合成(第4.1节),缺乏真实长文档中的跨页依赖(如章节连贯性、页眉页脚关联)。未来可:

  • 构建真实长文档数据集:包含跨页表格、连续段落、引用关系等复杂依赖结构;
  • 课程学习(Curriculum Learning):从短文档逐步过渡至超长文档,训练模型更稳定地利用 R-SWA 的状态转移能力。

Q: 总结一下论文的主要内容

本文提出 Unlimited OCR,一种面向长时程文档解析的高效端到端 OCR 模型,核心贡献与内容总结如下:

1. 研究背景与问题

现有基于大语言模型(LLM)的端到端 OCR(如 DeepSeek OCR)虽借助语言先验提升识别精度,但采用标准多头注意力(MHA)导致 KV 缓存随输出长度 T 线性增长( C_(MHA)(T) = L_m + T )。这造成:

  • 长序列推理时内存急剧膨胀、生成速度渐进衰减;
  • 无法一次性解析多页文档(如整本书),只能逐页循环处理,破坏长时程连贯性。

2. 核心方法:Reference Sliding Window Attention (R-SWA)

受人类抄书时”工作记忆”机制启发,提出 R-SWA 机制,将注意力约束在固定双段窗口内:

  • 全局参考段(Prefix):包含所有视觉 token(经高压缩编码)与提示,长度 L_m 固定,全局可见且不参与状态转移,避免视觉特征模糊;
  • 局部因果段(Sliding Window):仅关注当前位置前 n 个输出 token(默认 n=128 ),形成因果滑动窗口 D_n(t) 。

注意力范围定义为 N(t) = P ∪ D_n(t) ,其中:
D_n(t) = j mid max(L_m+1, L_m+t-n) ≤ j ≤ L_m+t-1

关键特性:KV 缓存被限制为恒定容量 Lm + n ,与生成长度 T 无关,实现:
C
(R-SWA)(T) = L_m + min(n, T) ≤ L_m + n

3. 模型架构:Unlimited OCR

以 DeepSeek OCR 为基线,保留其 DeepEncoder(级联 SAM-ViT 与 CLIP-ViT,实现 16× token 压缩,如 1024×1024 图像压缩为 256 token),将解码器所有层替换为 R-SWA,形成 3B 总参数 / 0.5B 激活参数的 MoE-LLM 架构。

4. 实验结果

  • 精度提升:在 OmniDocBench v1.5 上达 93.23%(较基线提升 6.22%),v1.6 上达 93.92%(端到端 SOTA),9 类文档子任务全面领先;
  • 长时程能力:支持单次前向传播解析 40+ 页文档,Distinct-35 保持 96.90%,Edit Distance <0.11 ,无严重模式崩溃;
  • 效率优势:生成长度 6144 tokens 时,TPS 较基线提升 35%,每步延迟恒定,显存占用不随序列增长。

5. 贡献与意义

  • 架构创新:R-SWA 是通用长时程解析注意力机制,通过”软遗忘”策略实现恒定 KV 缓存,适用于 OCR、ASR、翻译等参考型任务;
  • 工程价值:首次实现标准 32K 长度限制下的”单前向传播整书转录”,突破传统分页循环范式;
  • 理论验证:证明在解析任务中,将解码器全部替换为因果滑动窗口注意力不会造成性能损失,为高效长序列建模提供新范式。

6. 局限与未来方向

  • 预填充长度限制:当前仍受限于上下文长度(32K),需通过更长上下文训练(128K)或预填充池机制实现真正无限解析;
  • 跨领域迁移:计划将 R-SWA 应用于语音识别、长文本翻译等任务;
  • 视觉编码器优化:需提升小字号文本识别精度(如动态分辨率或多尺度编码)。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Youyang Yin,Huanhuan Liu,Qunyi Xie,Chaorun Liu,Shiqi Yang,Shaohua Wang,Zhanlong Liu,Hao Zou,Jinyue Chen,Shu Wei,Jingjing Wu,Mingxin Huang,Zhen Wu,Guibin Wang,Tengyu Du,Lei Jia

PDF URL: https://arxiv.org/pdf/2606.23050.pdf

Arxiv URL: https://arxiv.org/abs/2606.23050

Arxiv ID: 2606.23050

CoolPaper URL: https://papers.cool/arxiv/2606.23050

Published: 2026-06-24T01:42:58.592Z

Updated: 2026-06-24T01:42:58.592Z


16. Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents

Abstract:Long-horizon tasks are common in real-world robotic deployments, yet failure detection for such tasks remains underexplored. Detecting failures in long-horizon robotic tasks is particularly challenging because failure onset is often ambiguous and dense temporal annotations are typically unavailable. We present Foresight, a failure detection framework that monitors manipulation trajectories using latent representations from an action-conditioned world model. Foresight is trained using only final task-level success or failure labels. By leveraging predictive world-model embeddings, our method provides a unified framework for failure detection across different policies. We further use functional conformal prediction (FCP) to calibrate detection thresholds adaptively. We evaluate Foresight with state-of-the-art vision-language-action policies in simulation on LIBERO-Long, ManiSkill-Long, and BEHAVIOR-1K, compare it against state-of-the-artfailure detection methods, and validate it on real robots with three long-horizon tasks on a ReactorX-200 arm and one task on a Franka arm. Our results suggest that action-conditioned world-model embeddings provide a scalable representation for reliable failure monitoring in long-horizon manipulation.

中文摘要

摘要:长时程任务在现实世界的机器人部署中很常见,但此类任务的故障检测仍未得到充分研究。在长时程机器人任务中检测故障尤其具有挑战性,因为故障的发生往往模糊不清,而且通常无法获得密集的时间标注。我们提出了Foresight,一种故障检测框架,它利用基于动作条件的世界模型的潜在表示监控操作轨迹。Foresight 仅使用最终任务级别的成功或失败标签进行训练。通过利用预测性世界模型嵌入,我们的方法为不同策略的故障检测提供了统一的框架。我们进一步使用功能性保形预测(FCP)自适应校准检测阈值。我们在模拟环境中使用最先进的视觉-语言-动作策略,对LIBERO-Long、ManiSkill-Long和BEHAVIOR-1K进行了Foresight评估,并将其与最先进的故障检测方法进行了比较,同时在实际机器人上对ReactorX-200机械臂执行的三个长时程任务和Franka机械臂的一个任务进行了验证。我们的结果表明,基于动作条件的世界模型嵌入为长时程操作中的可靠故障监控提供了一种可扩展的表示。

LLM Analysis

LLM Analysis Failed: Error: 抓取失败(已重试2次): Navigation timeout of 10000 ms exceeded

Authors: Haoran Zhang,Yifu Lu,Boyang Wang,Xuhui Kang,Yen-Ling Kuo,Zezhou Cheng,Mengdi Wang,Odest Chadwicke Jenkins

PDF URL: https://arxiv.org/pdf/2606.23085.pdf

Arxiv URL: https://arxiv.org/abs/2606.23085

Arxiv ID: 2606.23085

CoolPaper URL: https://papers.cool/arxiv/2606.23085

Published: 2026-06-24T01:43:05.467Z

Updated: 2026-06-24T01:43:05.467Z


17. Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

Abstract:Deep research agents are Large Language Model (LLM)-based systems designed for autonomous, multi-step scientific reasoning, and they hold immense potential for accelerating research in the physical sciences. However, comprehensive and in-depth evaluations of their capabilities within this domain remain lacking. To address this gap, we introduce PhySciBench, a benchmark highly relevant to physical science research, comprising 200 expert-curated questions, balanced between physics and chemistry, across six task categories that reflect real-world scientific workflows. Evaluations of state-of-the-art models and agent systems on PhySciBench reveal limited performance; even the strongest baseline, Gemini Deep Research, achieves an accuracy of only 33.5%. Analysis of failure cases identifies three recurrent deficiencies: fragility in extended reasoning chains, limited knowledge transfer across steps, and a lack of physics-grounded self-verification. Motivated by these findings, we develop DelveAgent, a modular multi-agent framework equipped with an adaptive planning loop, dual-granularity memory, and a hierarchical physics-grounded reflection mechanism. Across four scientific benchmarks, DelveAgent improves accuracy by up to 7.5 percentage points while reducing inference costs to approximately one-third of the strongest baseline. These results establish the significance of PhySciBench as a critical benchmark for evaluating AI systems in the physical sciences and demonstrate that architectural specialization can effectively enhance the reliability of autonomous scientific research. Our data and code are publicly available at this https URL.

中文摘要

摘要:深度研究代理是基于大型语言模型(LLM)的系统,旨在实现自主的、多步骤的科学推理,它们在加速物理科学研究方面具有巨大潜力。然而,目前尚缺乏对其在该领域能力的全面且深入的评估。为填补这一空白,我们推出了PhySciBench,一个与物理科学研究高度相关的基准测试,包含200个专家策划的问题,在物理和化学之间均衡分布,涵盖六类任务类别,反映真实的科学工作流程。在PhySciBench上对最先进模型和代理系统的评估显示,其表现有限;即使是最强的基线模型Gemini Deep Research,其准确率也仅为33.5%。对失败案例的分析发现了三个反复出现的缺陷:长链推理的脆弱性、跨步骤的知识迁移有限以及缺乏基于物理的自我验证。基于这些发现,我们开发了DelveAgent,一个模块化的多代理框架,配备自适应规划循环、双粒度记忆以及分层的基于物理的反思机制。在四个科学基准测试中,DelveAgent将准确率提高了最多7.5个百分点,同时将推理成本降低到最强基线的约三分之一。这些结果确立了PhySciBench作为评估物理科学中AI系统的关键基准的重要性,并表明体系结构的专门化可以有效提升自主科学研究的可靠性。我们的数据和代码可通过此https链接公开获取。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文试图解决以下核心问题:

1. 物理科学领域缺乏全面的深度研究能力评估基准

现有基准测试存在明显局限:

  • 领域特定基准稀缺:化学和物理科学领域的基准测试不仅稀少,且很少涉及真实的核心研究场景,通常只评估孤立任务,缺乏对外部工具集成的扩展工作流的评估
  • 通用基准能力不足:如HLE、SGI-Bench和FrontierScience等通用科学评估标准,未能涵盖真实科学探究所必需的多模态解析、结构化数据提取和代码执行能力
  • 评估维度单一:现有测试无法覆盖物理科学研究的端到端工作流,包括信息提取、科学理解和应用创造三个认知阶段

2. 现有AI系统在物理科学深度研究中的性能瓶颈

通过构建PhySciBench(包含200个专家策划问题的基准测试),论文揭示了当前最先进模型的系统性缺陷:

  • 性能低下:即使是最强的基线模型Gemini Deep Research,在PhySciBench上的准确率也仅为33.5%,所有基础模型得分均低于30%
  • 扩展推理链脆弱:46%的失败案例源于长程推理轨迹不稳定,早期错误(任务解释、证据检索或中间综合)会传播到后续步骤
  • 跨步骤知识迁移弱:23%的错误反映出领域知识和先前问题解决经验的重用限制,包括科学不准确的陈述、幻觉机制或参数,以及未忠实实现物理/数学模型的代码
  • 缺乏物理基础的自验证:31%的失败源于任务执行和答案交付的崩溃,而非单纯的科学推理,包括工具链超时、文档或多模态处理失败,以及违反要求的输出格式

3. 自主科学推理的架构性局限

论文指出,当前深度研究系统在物理科学中的性能天花板是架构性的而非单纯的规模问题:

  • 现有系统缺乏在接收中间结果后重新规划的能力
  • 无法有效重用任务相关策略和领域知识
  • 不能针对物理约束验证中间输出

为解决上述问题,论文提出了DelveAgent,这是一个模块化多代理框架,通过自适应规划循环、双粒度记忆和分层物理基础反思机制,将准确率提升7.5个百分点,同时将推理成本降低至最强基线的约三分之一。

Q: 有哪些相关研究?

该论文的相关研究可归纳为以下几个主要领域:

1. AI for Science 与自主科学发现代理

  • 蛋白质结构预测:AlphaFold 在蛋白质结构预测方面的高度准确方法(Jumper et al., 2021)
  • 材料发现:使用深度学习进行材料发现的扩展研究(Merchant et al., 2023)及自主实验室加速新材料合成(Szymanski et al., 2023)
  • 自主化学研究:利用大语言模型实现自主化学研究的系统(Boiko et al., 2023; Bran et al., 2024)
  • 自动化科学发现:包括完全自动化的开放式科学发现框架(Lu et al., 2024)、AI共同科学家(Gottweis et al., 2025)以及针对理论物理和计算物理的自主AI物理学家(Miao et al., 2025)
  • 物理问题求解:在国际物理奥林匹克竞赛中达到金牌水平的AI代理(Qiu et al., 2025)以及用于多阶段物理实验的代理AI(Hellert et al., 2025)

2. 深度研究代理架构

  • 推理与行动协同:ReAct框架,在语言模型中协同推理和行动(Yao et al., 2023)
  • 思维链提示:通过思维链提示激发语言模型的推理能力(Wei et al., 2022)
  • 商业深度研究系统:OpenAI的Deep Research(OpenAI, 2026)和Google的Gemini Deep Research(Google, 2025),这些是用于自主多步科学推理的LLM基础系统

3. 科学领域基准测试

化学与物理特定基准:

  • 评估大语言模型化学知识和推理能力的框架(Mirza et al., 2025)
  • 凝聚态物理评估基准:CMPhysBench(Wang et al., 2026)和CMT-Benchmark(Pan et al., 2026)
  • 物理感知和推理整体评估:PHYBench(Qiu et al., 2025)

编程与数据驱动发现:

  • SciCode:由科学家策划的研究编程基准(Tian et al., 2024)
  • ScienceAgentBench:针对数据驱动科学发现的语言代理严格评估(Chen et al., 2024)

通用科学评估:

  • Humanity’s Last Exam (HLE):旨在抵抗检索策略的封闭式专家级评估(Phan et al., 2025)
  • SGI-Bench:与科学家工作流程对齐的深度研究基准(Shanghai AI Lab, 2025)
  • FrontierScience:评估AI执行专家级科学任务能力的基准(Wang et al., 2026)
  • LAB-Bench:测量语言模型在生物学研究中能力的基准(Laurent et al., 2024)

4. 多模态科学与工具集成

  • 多模态限制:针对化学和材料研究中多模态语言模型限制的探测(Alampara et al., 2025)
  • 物理单位集成:将物理单位集成到高性能AI驱动的科学计算中(Wang et al., 2025)
  • 材料数据库:材料项目(Materials Project),采用材料基因组方法加速材料创新(Jain et al., 2013)

5. 评估方法论

  • LLM作为评判者:关于LLM-as-a-judge在专家知识任务中局限性的研究(Krumdick et al., 2025; Szymanski et al., 2025)
  • AI伦理:自主人工智能、科学研究和人类价值相关的伦理考量(Resnik et al., 2025, 2026)

Q: 论文如何解决这个问题?

该论文通过构建专门基准测试设计领域特定架构两条路径解决上述问题:

1. 构建 PhySciBench:物理科学深度研究综合基准

为填补评估缺口,研究者们开发了包含200道专家策划问题的基准测试,其设计特点包括:

  • 跨学科平衡:物理与化学各100题,涵盖凝聚态物理、合成有机化学与催化等活跃子领域
  • 三阶段认知覆盖
  • 信息提取(多模态QA、结构化信息提取):评估科学图表感知与非结构化数据解析
  • 科学理解(长上下文QA、科学推理):评估跨文档证据整合与原理推导
  • 应用与创造(实验设计、代码生成):评估合成新科学产物的能力
  • 真实世界来源:题目源自近五年高影响力论文及权威教科书改编,由领域专家原创以确保科学真实性
  • 复合评估协议:结合精确匹配、基于规则的语法检查、评分标准引导的LLM评判与沙盒代码执行,与专家评分达到斯皮尔曼相关系数 rho = 0.80

2. 开发 DelveAgent:模块化多代理框架

针对识别的三大系统性缺陷(长程推理脆弱、知识迁移不足、缺乏物理验证),论文提出DelveAgent架构,包含三个核心组件:

自适应规划循环(Adaptive Planning Loop)

解决:扩展推理链的脆弱性(占失败案例46%)

  • 采用动态重规划机制:系统执行”初始规划→子任务执行→中间结果观察→计划优化”的迭代循环
  • 当检测到中间结果与预期不符(如工具执行失败、意外结果或评判器拒绝)时,自动调整后续行动策略,而非僵化执行初始分解方案
  • 配备摘要器模块每三步压缩执行历史,防止长程推理中的上下文退化

双粒度记忆(Dual-Granularity Memory)

解决:跨步骤领域经验迁移不足(占失败案例23%)

  • 经验记忆(Experience Memory):存储成功规划轨迹、恢复策略与规划模式,动态检索最相似的历史策略指导当前任务分解
  • 知识记忆(Knowledge Memory):存储方程、程序、物理常数等结构化科学知识,由学习者模块从验证成功的轨迹中蒸馏更新
  • 两种记忆在规划与执行阶段共享,支持可复用的科学知识与可迁移的解题策略

分层物理基础反思(Hierarchical Physics-Grounded Reflection)

解决:缺乏物理基础自验证(执行失败占31%)

  • 局部验证器(Step-level):检查中间输出的单位一致性、量纲正确性、公式假设有效性、代码执行结果与工具输出合理性
  • 全局评判器(Trajectory-level):评估最终答案的源依据充分性、科学逻辑一致性与格式合规性
  • 发现物理不一致(如质量不平衡或量纲错误)时触发局部修正循环,严重错误则上报至规划器重新规划

3. 性能验证与成本优化

该解决方案在四个科学基准上验证效果:

指标 结果
准确率提升 在PhySciBench上达到41.0%,较最强基线Gemini Deep Research(33.5%)提升7.5个百分点
成本降低 推理成本降至最强基线的约三分之一
消融验证 移除任一核心组件均导致性能下降(记忆-3.0%,反思-3.0%,规划-2.5%),证明三者协同作用
泛化能力 在HLE、SGI-DR、FrontierScience等公开基准上均取得最优平均准确率(23.62%)

通过将认知架构专业化,DelveAgent将错误模式从”粗粒度的代理不稳定性”(如级联规划失败、工具超时)转变为”细粒度的科学基础挑战”,为可靠自主科学研究奠定了架构基础。

Q: 论文做了哪些实验?

该论文开展了以下六类核心实验,系统验证了基准测试的有效性、所提出架构的优越性及其跨领域泛化能力:

1. PhySciBench 基准性能评估

实验设置:在包含200道专家策划问题的PhySciBench上,对比了DelveAgent与7个基础模型(Gemini-3-Flash/Pro、GPT-5.2、Claude-Opus-4.5、Grok-4.1-Fast、Kimi-K2.5、Intern-S1-Pro)及3个通用代理系统(Gemini Deep Research、OpenAI Deep Research、ODR-smolagents)。

关键结果

  • 整体准确率:DelveAgent达到41.0%,较最强基线Gemini Deep Research(33.5%)提升7.5个百分点
  • 分类别表现
  • 结构化信息提取提升最大(+15.0个百分点
  • 代码生成提升**+15.0个百分点**
  • 长上下文QA提升**+10.0个百分点**
  • 多模态QA提升**+7.7个百分点**
  • 科学推理与最强基线持平(58.3%)
  • 实验设计与最强基线持平(17.1%)

2. 失败模式分析(Error Analysis)

实验设计:对Gemini Deep Research的326个验证错误案例进行系统分类,识别三大系统性缺陷:

失败类别 占比 具体表现 对应DelveAgent组件
规划与推理失败 46% 长程推理轨迹不稳定,早期错误传播至下游步骤 自适应规划循环
知识与实现失败 23% 科学陈述不准确、幻觉机制、代码未忠实实现物理模型 双粒度记忆
执行与响应失败 31% 工具链超时、文档处理失败、输出格式违规 分层物理基础反思

3. 消融研究(Ablation Studies)

方法:逐一移除DelveAgent的三个核心组件,量化各模块贡献。

结果

  • 移除双粒度记忆:准确率下降3.0个百分点
  • 移除分层物理基础反思:准确率下降3.0个百分点
  • 移除自适应规划循环:准确率下降2.5个百分点
  • 同时移除所有三个组件:准确率下降6.5个百分点(小于单独移除之和8.5个百分点,表明模块间存在功能重叠与互补)

消融研究证实,架构专业化(三个组件的协同)而非底层基础模型本身,构成了DelveAgent优势的主要来源。

4. 跨基准泛化性验证

数据集:在三个公开科学基准上评估,均取物理/化学子集:

  • HLE(Humanity’s Last Exam):395道封闭式问题(物理230道,化学165道)
  • SGI-DR(Scientific General Intelligence - Deep Research):43道需要迭代推理的问题(物理32道,化学11道)
  • FS-Research(FrontierScience-Research):40道开放式研究任务(物理/化学各20道)

结果

  • DelveAgent平均准确率23.62%,优于Gemini Deep Research(20.87%)
  • 在SGI-DR上提升最大(+6.98个百分点),体现自适应规划与记忆模块对迭代证据收集的支持
  • 在HLE上 modest 提升(34.94% vs 33.67%),符合该基准侧重封闭式事实回忆的特点
  • 在FS-Research上与最强基线持平,证明在开放式研究任务中的竞争力

5. 真实世界科学任务评估(User Study)

任务设计:三位物理科学领域专家各自设计一个开放式研究任务,模拟真实工作流:

  1. Study 1:温度依赖ARPES数据解读(定量带隙提取与可复现代码)
  2. Study 2:一维Floquet Majorana α -链数值复现(严格参数约束下的核心结果重现)
  3. Study 3:应变调控kagome金属机制合成(三竞争解释排序)

评估协议

  • 评分维度:任务完成度(0-10)、科学有效性(0-10)、幻觉评分(0-10,越低越好)
  • 评分方式:三位独立领域专家盲评,取均值

关键发现

  • 任务完成度:DelveAgent 8.39 vs Gemini Deep Research 7.50
  • 科学有效性:DelveAgent 8.05 vs Gemini Deep Research 6.39
  • 幻觉评分:DelveAgent 3.02 vs Gemini Deep Research 6.05(显著降低)

在Study 1和Study 3等证据稀疏、易引发推测性补全的任务中,DelveAgent表现出更强的证据锚定能力,避免了 Gemini Deep Research 中常见的”建议额外测量”或”引入未提供数据”等幻觉行为。

6. 评估协议验证(Validation of Evaluation Protocol)

目的:验证自动评估流程与专家人工评分的一致性。

方法

  • 样本:196个配对项目(排除4个结构化信息提取项目)
  • 人工基准:两位领域专家(物理、化学各一位)使用0-1连续量表盲评
  • 对比指标:复合评估协议 vs 单一LLM评判、词汇指标(ROUGE、BLEU)、嵌入指标(BERTScore)

结果

  • 复合协议:斯皮尔曼相关系数 rho = 0.80 (95% CI $
    0.75, 0.85
    , p < 10^{-10}$)
  • 单一LLM评判: rho = 0.57 (95% CI $
    0.47, 0.66
    $)
  • 词汇指标:ROUGE-2 rho = 0.31 ,BLEU rho = 0.21
  • BERTScore-F1: rho = 0.15 (95% CI $
    0.01, 0.28
    $)

该验证确立了复合评估协议作为专家评估实用代理的有效性。

Q: 有什么可以进一步探索的点?

基于论文的讨论与局限性部分,以下方向值得进一步探索:

1. 基准测试的规模化与多元化扩展

  • 社区驱动扩展:当前PhySciBench包含200道题目,虽足以揭示统计显著的性能差异,但受限于专家策划的高成本。未来需通过社区贡献扩展题目数量,以拓宽领域覆盖与难度层次
  • 子领域覆盖均衡化:现有覆盖采取”深度优先”策略,集中于凝聚态物理、合成有机化学与催化等当代最活跃子领域,对相邻子领域采样较稀疏。需扩展至更多物理与化学分支,确保聚合得分真正反映学科广度而非仅核心领域表现

2. 多模态基础模型的能力突破

  • 专门科学可视化理解:当前视觉语言模型在专门科学图表解释与跨文档合成方面仍是瓶颈(多模态QA错误率达32%)。需针对科学成像(如ARPES、晶体结构图、光谱数据)开发更强大的视觉编码器
  • 跨模态证据绑定:解决证据绑定错误(将数据归因于错误实验条件)与源消歧困难(处理多文档冲突信息)等问题,需改进多模态对齐与跨文档推理机制

3. 领域知识库的完整性与覆盖范围

  • 动态知识库构建:当前知识库仅从解决问题过程中检索的论文渐进构建,无法保证完备性。需扩展至更多子学科(如高能物理、生物物理)和实验模式(如中子散射、扫描探针技术)
  • 结构化知识表示:将非结构化科学文献转化为可计算、可验证的结构化知识表示,以支持更可靠的物理基础验证

4. 评估协议的专家级精细化

  • 领域细微差别捕捉:尽管当前复合评估协议与专家评判达到斯皮尔曼相关系数 rho = 0.80 ,但LLM-as-judge方法可能仍遗漏特定领域细微差别。需开发更细粒度的评估标准,特别是在不确定性量化与误差传播处理方面
  • 强化验证门机制:针对约束满足失败与形式规范保真度问题(如模式不匹配、数值精度损失),引入更强的类型化编排(typed orchestration)与验证门,减少可避免的架构性错误

5. 实验设计能力的专项提升

  • 实验协议生成优化:DelveAgent在实验设计类别(17.1%)未超越基线,表明当前架构在生成完整合成或表征协议方面存在局限。需开发专门的实验设计模块,整合实验室安全约束、设备可行性与统计功效分析
  • 闭环实验验证:将虚拟实验设计与实际机器人实验平台结合,验证生成协议的可执行性与可重复性

6. 人机协作与可信AI

  • 批判性监督机制:随着自主系统能力增强,需开发更高效的人机协作界面,使领域专家能在关键决策点进行有效干预,特别是在敏感科学应用中错误可能带来现实世界后果的场景
  • 可解释性增强:提升代理决策过程的可解释性,使研究人员能理解为何选择特定推理路径或实验方案

7. 跨学科迁移与泛化

  • 评估框架移植:将PhySciBench的三阶段认知分层(信息提取、科学理解、应用创造)方法论迁移至生物学、材料科学、地球科学等其他学科,建立统一的科学通用智能评估体系
  • 跨领域知识迁移:研究物理科学知识如何迁移至化学或材料科学问题,开发更通用的跨域科学推理架构

8. 计算效率与实时研究支持

  • 推理成本进一步优化:尽管DelveAgent已将成本降至基线的约三分之一,但在处理大规模数值模拟或高通量数据分析时,仍需优化计算资源分配策略
  • 实时研究辅助:开发低延迟版本的深度研究代理,支持实验室环境下的实时决策辅助(如实验参数调整建议)

Q: 总结一下论文的主要内容

该论文围绕物理科学领域的自主深度研究代理展开,主要内容包括:

核心问题识别

物理科学研究高度依赖多样化科学证据的整合(实验测量、科学图表、结构化数据与文献),但现有AI系统评估存在显著缺口:

  • 基准测试局限:现有领域特定基准稀缺且孤立评估单任务;通用基准(如HLE、SGI-Bench)缺乏多模态解析、结构化数据提取与代码执行等真实科研必需能力
  • 系统性能瓶颈:当前最先进系统(如Gemini Deep Research)在物理科学任务上准确率仅33.5%,暴露出长程推理链脆弱跨步骤知识迁移弱缺乏物理基础自验证三大系统性缺陷

主要贡献

1. PhySciBench:物理科学深度研究综合基准

  • 规模与构成:200道专家策划问题,物理与化学各100题,涵盖六个任务类别(多模态QA、长上下文QA、结构化信息提取、科学推理、实验设计、代码生成)
  • 认知阶段覆盖:系统映射三个递进认知阶段——信息提取、科学理解、应用与创造
  • 来源与质量:题目源自近五年高影响力论文及权威教科书改编,经多阶段专家审核与防泄漏筛选
  • 评估协议:复合评分机制(精确匹配、规则检查、评分标准引导的LLM评判、沙盒代码执行),与专家评判斯皮尔曼相关系数达 rho = 0.80

2. DelveAgent:模块化多代理架构

针对识别的缺陷,提出三组件协同架构:

组件 功能机制 解决的缺陷
自适应规划循环 执行”初始规划→子任务执行→中间观察→计划优化”迭代,支持动态重规划与历史摘要 长程推理链脆弱(46%失败案例)
双粒度记忆 经验记忆(存储成功轨迹与策略)+ 知识记忆(存储方程、常数与程序),支持检索与蒸馏更新 知识迁移不足(23%失败案例)
分层物理基础反思 局部验证器(检查单位、量纲、代码执行)+ 全局评判器(验证源依据、科学一致性、格式合规) 缺乏物理验证(31%失败案例)

实验验证与关键发现

性能提升

  • PhySciBench:DelveAgent准确率达41.0%,较最强基线Gemini Deep Research(33.5%)提升7.5个百分点,其中结构化信息提取与代码生成类别提升最大(各+15.0个百分点)
  • 成本效率:推理成本降至最强基线的约三分之一

消融验证

移除任一核心组件均导致性能显著下降(记忆-3.0%,反思-3.0%,规划-2.5%),证实架构专业化而非基础模型规模是性能提升的主因

泛化能力

在HLE、SGI-DR、FrontierScience三个公开科学基准上均取得最优平均准确率(23.62%),在SGI-DR上提升最大(+6.98个百分点)

真实世界验证

在三个专家设计的开放式研究任务(ARPES数据解读、Floquet Majorana链数值复现、Kagome金属机制合成)中,DelveAgent在科学有效性(8.05 vs 6.39)与幻觉控制(3.02 vs 6.05,越低越好)上显著优于基线,展现出更强的证据锚定能力

局限与未来方向

  • 基准扩展:需通过社区贡献扩大题目规模与学科覆盖(当前集中于凝聚态物理与合成有机化学)
  • 多模态瓶颈:专门科学图表理解与跨文档合成仍是当前视觉语言模型的能力边界
  • 知识完整性:动态构建的知识库无法保证完备性,需扩展至更多实验模式与学科
  • 架构优化:针对实验设计类别的性能瓶颈,需开发更强的类型化编排与验证机制

该研究确立了PhySciBench作为物理科学AI系统关键基准的地位,并证明通过领域特定的认知架构设计(规划-记忆-反思的闭环协同),可有效提升自主科学研究的可靠性,推动错误模式从”粗粒度代理不稳定性”向”细粒度科学基础挑战”转变。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Yigeng Jiang,Tengchao Yang,Taoyong Cui,Jiaxing Wan,Yuan Wang,Weida Wang,Zhiyu Liu,Chuyi Peng,Binzhao Luo,Maoli Gao,Huaihai Huang,Yuqianer Zeng,Ziyang Zheng,Dongchen Huang,Chao Chen,Zichao Liu,Weiping Shen,Shuchen Pu,Siyu Zhou,Runmin Ma,Yusong Hu,Fei Chao,Bo Zhang,Xiawu Zheng,Zifu Wang,Lei Bai,Yunqi Cai,Shufei Zhang

PDF URL: https://arxiv.org/pdf/2606.18648.pdf

Arxiv URL: https://arxiv.org/abs/2606.18648

Arxiv ID: 2606.18648

CoolPaper URL: https://papers.cool/arxiv/2606.18648

Published: 2026-06-24T01:44:24.790Z

Updated: 2026-06-24T01:44:24.790Z


18. Self-Compacting Language Model Agents

Abstract:Long agent traces composed of chains of thought and tool calls accumulate stale content that anchor subsequent generations, and eventually outgrow the context window. Existing scaffolds mitigate it with fixed-interval compaction triggered at a token threshold. Such triggers pay no heed to trajectory structure, risking discard of partial results mid-derivation or mid-search. We propose SelfCompact, a scaffold that allows the model itself to decide when and how to compact. Specifically, it pairs two inference-time elements: (i) a compaction tool the model invokes to summarize the accumulated context, and (ii) a lightweight rubric specifying when to fire (a sub-task has resolved, or the trajectory is converging) and when to suppress (mid-derivation, or when stuck). Both are needed. The tool alone is unevenly used across open-weight models, often invoked at unhelpful moments or not at all; the rubric alone cannot act. Together, they elicit effective adaptive compaction without any fine-tuning or external supervision. We present empirical results on six benchmarks (competitive math and agentic search) and seven models. Our results show that SelfCompact matches or exceeds fixed-interval summarization at a fraction of the token cost, improving over a no-summarization baseline by up to 18.1 points on math and 5-9 points on agentic search at 30-70% lower per-question cost. Our results expose a meta-cognitive gap: although unprompted models cannot reliably tell when their own context is rotting, a lightweight rubric closes this gap, reframing when to compact as a capability that scaffolds can supply without training.

中文摘要

摘要:由思路链和工具调用组成的长代理痕迹会积累陈旧内容,这些内容会影响后续生成,并最终超过上下文窗口。现有的支架通过在达到令牌阈值时触发固定间隔压缩来缓解这个问题。这类触发不考虑轨迹结构,可能导致在推导中或搜索中中途丢弃部分结果。我们提出了 SelfCompact,一种允许模型自行决定何时以及如何进行压缩的支架。具体而言,它配对了两个推理时元素:(i)一个压缩工具,模型调用它来总结已积累的上下文;(ii)一个轻量级规范,用于指定何时触发(子任务已解决或轨迹正在收敛)以及何时抑制(在推导中,或停滞时)。两者都是必需的。单独的工具在开放权重模型中使用不均,往往在无帮助的时刻调用,或者根本不调用;单独的规范无法行动。两者结合,可以在无需任何微调或外部监督的情况下引导有效的自适应压缩。我们在六个基准(有竞争力的数学和代理搜索)及七个模型上展示了实证结果。我们的结果显示,SelfCompact 在令牌成本仅为固定间隔总结一小部分的情况下表现匹配或优于固定间隔总结,相较于不进行总结的基线,在数学任务上提升最多 18.1 分,在代理搜索上提升 5-9 分,每题成本降低 30-70%。我们的结果揭示了一个元认知差距:虽然未提示的模型无法可靠判断自身上下文何时开始腐败,但轻量级规范能够弥补这一差距,将何时压缩重新框定为支架可以在无训练情况下提供的能力。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文试图解决长程语言模型智能体(long-horizon LM agents)中的上下文管理问题,具体包括以下三个层面:

1. 上下文腐烂(Context Rot)

随着智能体轨迹(由思维链和工具调用组成)的增长,早期产生的错误假设、已放弃的推理路径或无关的搜索结果等”陈旧内容”会不断累积。这些内容不仅占用上下文窗口,还会”锚定”后续生成(anchor subsequent generations),导致模型被自己的历史错误推理所困扰,性能随序列长度增加而显著下降。

2. 固定间隔压缩的结构性缺陷

现有系统普遍采用固定间隔压缩策略(如每达到30%的上下文窗口或固定令牌阈值时触发),这种”内容无关”的启发式方法存在根本缺陷:

  • 时机不当:无法区分模型是处于”推导中途”(mid-derivation)还是”刚完成子任务”,可能在关键推理步骤完成前强制压缩,导致已验证的事实或部分结果被擦除
  • 延迟污染:反应式压缩(仅在接近上下文上限时触发)会让陈旧 token 在触发前持续污染多轮生成
  • 资源浪费:在不必要时进行压缩,或保留本应丢弃的冗余内容

3. 元认知差距(Meta-Cognitive Gap)

未经专门训练的模型无法可靠地识别自身上下文何时正在”腐烂”(即何时积累的内容已开始损害推理),因此无法自主决定最佳的压缩时机。

核心解决方案:SELFCOMPACT

为弥合上述差距,论文提出 SELFCOMPACT 框架,通过两个推理时(inference-time)组件实现自适应压缩

  • 压缩工具:作为内联工具(inline tool)暴露给模型,由模型自主调用以总结累积的上下文
  • 轻量级评分标准(Rubric):指定具体的触发条件(子任务已解决、轨迹正在收敛)和抑制条件(推导中途、陷入循环),指导模型判断何时安全压缩

该方法无需微调或外部监督,仅通过提示工程(prompting)即可让模型获得”何时压缩”的元认知能力,在数学推理和智能体搜索任务上实现相比固定间隔压缩更高的准确率(提升可达18.1个百分点)和更低的令牌成本(降低30-70%)。

Q: 有哪些相关研究?

根据论文第5节(Related Work)及全文引用,相关研究主要分布于以下四个维度:

1. 固定间隔与反应式上下文压缩

现有系统普遍采用内容无关的启发式策略管理长程上下文:

  • 工业部署系统:Claude Code
    Anthropic, 2025
    提供 /compact 命令供用户手动触发;Cursor
    Cursor Research et al., 2026
    在固定令牌阈值触发压缩。
  • 学术框架:ReasoningCache
    Wu et al., 2026a
    、InfThink
    Yan et al., 2026
    、IterResearch
    Chen et al., 2026
    等均依赖固定令牌阈值(如上下文窗口的30%)触发总结。这类方法的结构性缺陷在于无法区分”推导中途”(mid-derivation)与”子任务完成”状态,常导致已验证事实被意外擦除。

2. 基于训练的学习型压缩

一类研究通过**监督微调(SFT)或强化学习(RL)**将压缩能力内化为模型权重:

  • 显式训练:Memento
    Kontonis et al., 2026
    、Accordion-thinking
    Yang et al., 2026
    、Composer
    Cassano and Rush, 2026
    、Lightthinker++
    Zhu et al., 2026b
    、Agentfold
    Ye et al., 2025
    、FoldAct
    Shao et al., 2025
    等通过训练教授模型何时及如何压缩。
  • 上下文折叠(Context-folding):Sun et al.
    2025
    提出通过短程RL实现长程智能体的持续改进,仍需训练阶段。

与上述方法不同,SELFCOMPACT 完全在**推理时(inference-time)**通过提示工程实现,无需参数更新。

3. 无训练的自适应压缩

极少数研究探索无需训练的压缩策略:

  • Re-trac
    Zhu et al., 2026a
    :使用前沿模型作为外部总结器,但仍按固定轨迹间隔(post-trajectory intervals)触发,未解决时机选择问题。
  • 并发工作
    LangChain, 2026
    :同样引入总结工具,但缺乏评分标准(rubric)指导触发时机。

4. KV缓存压缩(技术互补)

与上下文压缩目标不同但技术相关的研究线,关注降低推理内存与计算成本:

  • 静态策略:基于最近性(如 Attention Sinks
    Xiao et al., 2023
    )或注意力分数(如 SnapKV
    Li et al., 2024
    )驱逐缓存条目。
  • 学习策略:通过重要性度量(如 KeyDiff
    Park et al., 2025
    、Cartridges
    Eyuboglu et al., 2025
    、Breadcrumbs
    Monea et al., 2025
    、Neural Garbage Collection
    Li et al., 2026
    )或权重更新
    Zuo et al., 2026
    优化缓存。

关键区别在于:KV缓存压缩追求注意力效率,允许黑盒表示;而上下文压缩(本文范畴) prioritizes 可解释的自然语言总结,保留人类可读的推理痕迹。

5. 长程智能体与上下文腐烂现象

  • 长思维链模型:Qwen3.5
    Qwen Team, 2026
    、Kimi-K2.5
    Kimi Team et al., 2026
    等生成数十万令牌的推理轨迹,加剧了上下文腐烂(context rot)问题
    Hong et al., 2025, Cheng et al., 2026, Laban et al., 2026
  • 智能体基准:BrowseComp
    Wei et al., 2025
    、BrowseComp-Plus
    Chen et al., 2025
    、DeepSearchQA
    Gupta et al., 2026
    、SWE-bench
    Jimenez et al., 2024
    等长程任务推动了上下文管理需求。

6. 元认知与自我反思

  • 涌现内省:Lindsey
    2025
    等研究探讨大型语言模型的元认知能力,为本文”模型可自主识别上下文腐烂”的假设提供理论基础。

Q: 论文如何解决这个问题?

论文通过提出 SELFCOMPACT 框架解决长程智能体的上下文管理问题。该方法将压缩决策权交还模型自身,通过以下两个**推理时(inference-time)**组件实现自适应压缩:

1. 核心架构:工具与评分标准的协同

SELFCOMPACT 配对两个必需元素:

(i) 内联压缩工具(Inline Compaction Tool)

将总结功能暴露为模型可调用的工具 S: (x, y(1:t)) arrow y ,其中 x 为原始提示, y(1:t) 为累积轨迹, y 为压缩后的摘要。模型通过生成特定停止标记(如 <summarize>)自主触发该工具,随后支架(scaffold)执行总结并将生成从 (x, y) 恢复,而非完整历史 (x, y_(1:t)) 。

(ii) 轻量级评分标准(Lightweight Rubric)

定义明确的触发条件(fire)与抑制条件(suppress),将元认知判断转化为模型可验证的结构化查询:

  • 触发条件:子任务已解决(closed reasoning unit)、轨迹正在收敛(converging)
  • 抑制条件:推导中途(mid-derivation)、陷入停滞(stuck)

2. 算法实现

SELFCOMPACT 的推理流程遵循算法 1,关键步骤包括:

定期探测(Probe Interval):每隔 N 个令牌(数学推理)或工具调用(智能体搜索),支架将评分标准提示 P_R 追加至当前上下文 C 。

二元裁决:模型采样得到裁决 r_t ∈ COMPRESS, CONTINUE ,依据评分标准对轨迹结构的本地验证:

r_t sim π(· mid C circ P_R)

条件压缩:仅在 r_t = COMPRESS 时,追加总结器提示 P_S 并生成摘要 y ,随后硬重置上下文:
C arrow x circ y
若 r_t = CONTINUE ,则弹出探测消息,轨迹保持不变。

3. 任务特定的评分标准设计

数学推理(Competition Math)

评分标准通过三问式结构验证状态(附录 A):

  • Q1 (ANSWER):是否已声明具体最终答案(如 boxed{} 表达式)
  • Q2 (STUCK):最近两轮是否未添加非平凡事实(仅重复或放弃尝试)
  • Q3 (HAS-NEXT):是否能写出确切的下一步(如情况分割、替换、验证)

触发规则为:
COMPRESS iff (Q1 = Y) lor (Q2 = Y land Q3 = Y)

智能体搜索(Agentic Search)

采用四重门控(附录 B):

  • C1 (CLOSED-UNIT):最近消息是否为完成的工具调用或子分析,而非中途推理(如”Let me now check…”)
  • C2 (SUMMARIZABLE):信息是否可归纳为 3-5 个可引用的事实而不损失关键约束
  • C3 (PROGRESS):自上次压缩后是否获得新的事实或细化了子问题
  • N1 (STUCK):最近 4 次搜索中是否至少 3 次返回无新信息(重复或已知内容)

触发需同时满足:
COMPRESS iff (C1 land C2 land C3 land neg N1)

4. 技术优化:KV 缓存重用

为最小化探测开销,SELFCOMPACT 利用 vLLM 的缓存机制:

  • 前缀保留:评分标准探测与总结器提示均追加至现有前缀,而非替换,因此 y_(1:t) 的 KV 缓存在探测期间被重用,避免 O(L^2) 的重新预填充(re-prefill)开销。
  • 成本结构:评分标准探测几乎零成本(仅生成短裁决 r_t 的约 60 个令牌),实际开销仅在于总结生成 O(L · ell) (其中 ell = |y| )及一次性新前缀预填充 O(ell^2) 。

5. 关键创新

与固定间隔方法不同,SELFCOMPACT 实现状态感知压缩

  • 早期逃逸:允许上下文增长超过固定阈值(如 30%),当模型仍在探索时避免破坏性压缩
  • 关键时刻固化:在验证事实后立即压缩(如搜索确认某日期后),将其结晶(crystallize)在摘要中,防止后续推导丢失关键证据
  • 无需训练:通过提示工程(prompting)提供”何时压缩”的元认知能力,弥合模型在识别上下文腐烂方面的能力差距(meta-cognitive gap)

Q: 论文做了哪些实验?

论文在六个基准测试(三个数学竞赛、三个智能体搜索)和七个模型上进行了系统评估,实验设计涵盖定量性能对比、成本分析、消融研究和定性案例分析。

1. 实验设计概览

维度 数学推理实验 智能体搜索实验
模型 4个Qwen系列模型:• Qwen3-4B-Instruct-2507• Qwen3-30B-A3B-Instruct-2507• Qwen3.5-4B (Thinking Disabled)• Qwen3.5-9B (Thinking Disabled) 3个部署的智能体:• GLM-4.7-Flash• MiniMax-M2.5• MiMo-V2-Flash
基准 • IMO-Answerbench• HMMT Nov 2025• HMMT Feb 2026 • BrowseComp• BrowseComp-Plus• DeepSearchQA
对比方法 • No Compaction(无压缩基线)• Fixed-interval Summary(每16k令牌触发)• SELFCOMPACT • No Compaction• Fixed-interval(30%上下文窗口触发)• Delete-all(删除全部历史)• Keep-last-N(保留最近3轮)• SELFCOMPACT

2. 数学推理实验(§4.1)

评估协议

  • 每个问题生成16个并行响应,报告均值和标准差
  • 使用vLLM进行推理,math_verify包进行答案解析和评估
  • 每轮生成预算16,384令牌,最多12轮,总结输出截断至512令牌

核心结果(表1)

  • SELFCOMPACT在11/12个模型-基准组合中表现最佳
  • 相比无压缩基线,Qwen3.5-9B上提升最显著:
  • IMO-Answerbench: +16.4
  • HMMT Nov: +10.0
  • HMMT Feb: +18.1
  • 相比固定间隔总结,在匹配令牌预算下仍保持优势(除Qwen3-30B-A3B在HMMT Feb上略低1.1点外)

Oracle分析(表3)

  • 分析固定间隔总结的失效模式:40.4%的转换导致性能退化(正确→错误)
  • 假设存在”Oracle”策略(仅当当前答案正确时跳过总结),可达到52.9%准确率,较固定间隔提升11.5点
  • 这表明自适应策略仍有 substantial headroom

3. 智能体搜索实验(§4.2)

评估协议

  • 通过OpenRouter访问模型,每基准采样150个问题
  • 温度1.0,top-p 0.95,每调用最大10,000输出令牌,每轨迹上限100次LLM调用
  • 成本计算采用双费率模型(首次预填充 p(in) vs 缓存读取 p(cache) )

核心结果(表4)

准确率表现

  • SELFCOMPACT在所有三个模型上均为最佳方法
  • BrowseComp-Plus上相比无压缩基线的绝对提升:
  • GLM-4.7-Flash: +8.5
  • MiniMax-M2.5: +9.2
  • MiMo-V2-Flash: +5.3

成本效益

  • 相比无压缩基线,每问题成本降低:
  • BrowseComp-Plus: 67% (GLM), 63% (MiniMax), 33% (MiMo)
  • 整体平均降低 46-58%

4. 消融实验

Rubric的必要性(表5、表6)

  • 实验:移除rubric,让模型自主决定何时总结(Tool-only)
  • 结果:性能显著下降至与固定间隔相当或更低
  • GLM-4.7-Flash平均准确率从46.4%降至41.0%(-5.4点)
  • Qwen3-4B在IMO-Answerbench上从45.5%降至40.9%
  • 结论:仅提供工具导致不均匀使用(有的模型在无益时刻反射性调用,有的从不调用),rubric是可靠自适应压缩的关键

5. 深度分析实验

压缩触发分布(图2)

  • 对比固定间隔(硬阈值30%)与SELFCOMPACT的触发时机
  • 固定间隔在30%阈值处形成尖峰;SELFCOMPACT分布左偏,表明rubric通常在轨迹消耗30%上下文前即判定”子任务已解决”
  • 说明固定阈值通常触发过晚,保留了本应丢弃的陈旧令牌

难度分层分析(图3)

  • 按无压缩基线的输出令牌量(问题难度代理)分5个分位数
  • 在简单问题上各方法差异不大;在最难的两个分位数上,SELFCOMPACT较固定间隔提升5-20个百分点
  • 表明rubric驱动的压缩对需要深度搜索、累积大上下文的复杂问题帮助最大

令牌消耗分析(表9、表10)

  • 详细记录每问题的预填充令牌、缓存读取令牌和输出令牌
  • 显示SELFCOMPACT通过减少后续调用的提示长度(从50-100k压缩至1-3k)实现成本节省,尽管增加了rubric探测和总结的开销

6. 定性案例分析(附录E)

对MiniMax-M2.5在BrowseComp-Plus上的三个问题(Whitesnake、Majida El Roumi、Raheem Sterling)进行轨迹分析:

发现模式

  • 固定间隔:在约60k令牌处机械性压缩,常将错误线索(如错误的乐队名称、错误识别的古典乐曲)固化到摘要中,导致智能体在剩余100+轮中重复探索死胡同
  • SELFCOMPACT:允许上下文增长至70-118k,仅在确认关键事实(如正确识别David Coverdale、Albinoni’s Adagio、Tottenham-Chelsea比赛)后才压缩,使智能体能够”逃脱”错误路径并最终正确回答

这些案例直观展示了时机选择(when to compact)比是否压缩(whether to compact)更为关键。

Q: 有什么可以进一步探索的点?

基于论文第6节(Limitations)及全文讨论,以下方向值得进一步探索:

1. 前沿闭源模型的元认知能力验证

论文仅在开源权重模型(Qwen、GLM、MiniMax、MiMo)上验证 SELFCOMPACT。前沿系统(如 GPT-5.5、Claude Opus 4.7、Gemini 3 Pro) reportedly 具备更强的内省能力
Lindsey, 2025
,可能无需显式 rubric 即可自主识别 context rot。验证这些模型是否仍能从 rubric-gated 压缩中受益,或是否存在”能力过剩”(over-capability)现象,将明确 SELFCOMPACT 的适用边界。

2. 与强化学习(RL)的深度融合

当前工作严格限定为免训练(training-free)干预以隔离 rubric 的独立贡献。未来可将 rubric 作为行为目标(behavioral target),通过 RL 将其蒸馏至模型参数中:

  • 训练模型直接输出压缩决策,消除周期性探测开销
  • 学习超越人工设计启发式的最优压缩策略
  • 探索在线 RL,使模型在特定任务分布上自适应优化压缩时机

3. Rubric 的自动优化与元学习

当前 rubric 为手工设计的任务特定启发式规则(附录 A、B)。可探索:

  • 自动提示优化:使用自动化的提示工程方法(如 APE、OPRO)优化 rubric 的措辞与条件阈值
  • 元学习 rubric:在多样化任务上学习可迁移的压缩时机判断标准
  • 动态 rubric:根据当前任务难度、模型置信度或已消耗令牌数动态调整触发条件

4. 层次化与多粒度压缩机制

当前采用单一层次的扁平摘要(flat summarization)。可探索更复杂的记忆结构:

  • 分层压缩:维护工作记忆(短期、详细)与参考记忆(长期、摘要)的双层结构,支持递归压缩
  • 选择性保留:结合 KV cache eviction 方法(如 SnapKV、KeyDiff),在 token 级别识别并保留关键注意力头,而非仅依赖文本摘要
  • 结构化摘要:以知识图谱或键值对形式存储中间结果,替代自然语言段落

5. 跨模态与代码智能体扩展

当前评估限于文本推理与网络搜索。可扩展至:

  • 代码执行轨迹:在 SWE-bench 等多轮代码生成任务中,压缩策略需保留关键变量状态与执行错误信息
  • 多模态上下文:处理包含图像、图表的长程轨迹时,rubric 需判断是否保留视觉细节的文本描述或图像 token

6. Context Rot 的理论建模与量化

论文经验性描述了 context rot 现象,但缺乏形式化定义。可建立:

  • 数学模型:量化”锚定效应”(anchoring)随轨迹长度的衰减函数
  • 信息论分析:度量摘要前后关于原始问题条件互信息(conditional mutual information)的保持程度
  • 最优停止理论:将压缩时机选择建模为最优停止问题(optimal stopping problem),推导理论最优策略

7. 与推理阶段其他优化的协同

探索 SELFCOMPACT 与以下技术的正交性:

  • 推测解码(Speculative Decoding):压缩后的短前缀可降低 draft model 的验证开销
  • 早停机制:结合自我反思(self-reflection)在压缩前识别并终止无望的推理分支
  • 工具使用优化:在压缩决策中显式建模工具调用成本(如 API 费用),实现总成本(LLM 令牌 + 工具调用)最小化

8. 用户可控的压缩粒度

当前 rubric 为全局策略。可引入用户偏好接口

  • 允许用户指定”不可压缩”的关键中间结果(如特定定理证明步骤)
  • 支持交互式压缩:系统在触发压缩前请求用户确认,适用于高风险决策场景

Q: 总结一下论文的主要内容

本文研究了长程语言模型智能体(long-horizon LM agents)中的上下文管理问题,提出了 SELFCOMPACT,一种通过轻量级评分标准(rubric)调控的自适应上下文压缩框架。

1. 问题背景与动机

长程智能体在解决复杂任务时生成极长的推理轨迹(可达数十万令牌),导致两个核心问题:

  • 上下文腐烂(Context Rot):累积的陈旧内容(错误假设、废弃搜索结果)会”锚定”后续生成,导致模型被自身历史错误困扰,性能随序列长度下降
    Hong et al., 2025, Cheng et al., 2026
  • 固定间隔压缩的结构性缺陷:现有系统普遍在固定令牌阈值(如上下文窗口的30%)触发压缩,这种”内容无关”策略无法区分”推导中途”(mid-derivation)与”子任务完成”,常导致已验证的关键事实被过早擦除(见图1)。

2. 方法:SELFCOMPACT

本文提出一种**免训练(training-free)**的推理时(inference-time)框架,包含两个协同组件:

(i) 内联压缩工具(Inline Compaction Tool) 将总结功能暴露为模型可调用的工具 S: (x, y_(1:t)) arrow y 。模型通过生成特定标记触发该工具,支架(scaffold)执行总结后,生成从压缩状态 (x, y) 恢复。

(ii) 轻量级评分标准(Rubric) 定义明确的触发条件(fire)与抑制条件(suppress),将”何时压缩”的元认知判断转化为结构化验证:

  • 触发:子任务已解决(closed unit)、轨迹正在收敛
  • 抑制:推导中途(mid-derivation)、陷入停滞(stuck)

算法流程为:每隔 N 个令牌/工具调用,支架追加 rubric 提示,模型采样二元裁决 r_t ∈ COMPRESS, CONTINUE ;仅在 COMPRESS verdict 时执行总结并重置上下文 C arrow x circ y 。

技术实现上,通过KV缓存重用(rubric与总结器提示均追加至现有前缀而非替换)确保探测开销极低:rubric 仅增加约60个输出令牌,总结器一次性生成 y ,后续所有调用均从短前缀继续。

3. 实验验证

六个基准(IMO-Answerbench、HMMT Nov/Feb 2025、BrowseComp、BrowseComp-Plus、DeepSearchQA)和七个模型(4个Qwen推理模型、3个部署的智能体)上评估:

  • 数学推理:相比无压缩基线,准确率提升最高达 18.1 个百分点;在11/12个设置中优于固定间隔总结。
  • 智能体搜索:相比无压缩基线,BrowseComp-Plus上准确率提升 5–9 点,同时每问题成本降低 30–70%(GLM-4.7-Flash降低67%,MiniMax-M2.5降低63%)。
  • 消融研究:移除 rubric 仅保留工具时,性能回落至固定间隔水平(-5.4点),证明知道何时压缩(when)与知道如何压缩(what)同等重要

4. 核心发现

  • 自适应时机:固定阈值通常触发过晚(保留陈旧令牌),而 rubric 允许上下文增长至70-100k+ 令牌,仅在验证关键事实后才压缩(图2)。
  • 难度分层效应:在最难的问题分位数上,SELFCOMPACT较固定间隔提升 5–20 个百分点(图3)。
  • 元认知差距:未经提示的模型无法可靠识别上下文腐烂,但轻量级 rubric 可在推理时提供该能力,无需训练。

5. 贡献

本文贡献可总结为:

  1. 提出首个基于评分标准的自适应上下文压缩框架,通过推理时提示工程实现,无需微调或外部验证器。
  2. 在多样基准和模型上验证,证明其匹配或超越固定间隔方法,且成本显著降低。
  3. 揭示**“何时压缩”可作为支架提供的元认知能力**,为长程智能体的上下文管理开辟新路径。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Tianjian Li,Jingyu Zhang,William Jurayj,Xi Wang,Chuanyang Jin,Mehrdad Farajtabar,Eric Nalisnick,Daniel Khashabi

PDF URL: https://arxiv.org/pdf/2606.23525.pdf

Arxiv URL: https://arxiv.org/abs/2606.23525

Arxiv ID: 2606.23525

CoolPaper URL: https://papers.cool/arxiv/2606.23525

Published: 2026-06-24T01:44:43.749Z

Updated: 2026-06-24T01:44:43.749Z


19. Training Open Models for Agentic Phone Use

Abstract:Phones are becoming an important execution surface for general-purpose agents, but training open models for reliable phone use remains difficult because the environment that matters at deployment, real devices running real apps, is slow, stateful, side-effectful, and hard to reset or verify, while scalable mock environments only approximate real behavior. We present PhoneBuddy, a training recipe and open-model line for agentic phone use that combines a real-app environment with a mock-app environment, PhoneWorld, which reconstructs runnable mock apps from real GUI usage structure. PhoneBuddy first builds a shared supervised fine-tuning stage from trajectories collected in both environments, then compares real-app RL against mixed RL across both environments. Across a 150-task human evaluation on real phones spanning apps, mini-apps, and cross-app workflows, task success rate improves from 36.67\% after supervised fine-tuning to 40.67\% after real-app RL and 45.33\% after mixed RL. On AndroidWorld, the same progression rises from 60.3\% to 77.2\% to 83.2\%. These results show that mock-app training is not a replacement for real-app RL, but a complementary source of scalable, resettable, and automatically checked interaction. The gains are strongest on app and mini-app tasks, while long-horizontal cross-app workflows remain an important open challenge.

中文摘要

摘要:手机正成为通用智能体的重要执行平台,但为可靠的手机使用训练开放模型仍然困难,因为部署时的重要环境——运行真实应用的真实设备——速度慢、状态复杂、具有副作用,并且难以重置或验证,而可扩展的模拟环境只能近似真实行为。我们提出了PhoneBuddy,一个用于智能手机使用的训练流程和开放模型系列,它结合了真实应用环境和模拟应用环境PhoneWorld,后者能够从真实GUI使用结构重建可运行的模拟应用。PhoneBuddy首先通过在这两种环境中收集的轨迹建立共享的监督微调阶段,然后比较真实应用强化学习(RL)与跨两种环境的混合RL。在对真实手机进行的150任务人类评估中,涵盖应用、迷你应用和跨应用工作流,任务成功率从监督微调后的36.67%提高到真实应用RL后的40.67%,再到混合RL后的45.33%。在AndroidWorld上,这一进展同样从60.3%提升到77.2%,再到83.2%。这些结果表明,模拟应用训练并不能替代真实应用RL,但它是可扩展、可重置并可自动检查交互的重要补充。增益在应用和迷你应用任务上最为显著,而长横向跨应用工作流仍然是一个重要的未解决挑战。

LLM Analysis

Q: 这篇论文试图解决什么问题?

该论文试图解决如何有效训练开放模型以在真实手机环境中实现可靠的智能体任务执行这一问题。具体而言,其核心关切在于调和训练过程中的真实性与可扩展性之间的根本张力

核心问题分解

1. 真实环境训练的局限性 真实手机环境(运行真实应用的物理设备)虽能提供 authentic 的应用行为、设备状态转换和用户可见的副作用,但存在以下制约:

  • 状态重置困难:任务执行具有状态性和副作用,难以在失败后快速恢复初始状态
  • 验证成本高昂:自动验证任务完成度困难,常需人工判断或复杂的模型评判
  • 探索风险:交互可能产生不可逆的副作用(如发送消息、完成支付),限制了强化学习中的广泛探索
  • 扩展性瓶颈: rollout 收集速度慢,难以支撑大规模在线优化

2. 纯模拟环境训练的不足 可扩展的模拟环境(mock environment)虽能支持可重置、可重复、可自动验证的交互,但存在仿真-现实差距(sim-to-real gap)

  • 模拟应用仅能近似真实应用行为,无法完全复现账户依赖行为、特定应用的不稳定性、权限流程等真实动态
  • 单独在模拟环境训练的模型可能无法迁移到真实设备执行

3. 特定任务类型的挑战 论文识别出不同复杂度任务对训练环境的不同需求:

  • 单应用任务:相对结构稳定,可从混合训练中显著受益
  • 跨应用工作流:需要长程状态跟踪、应用间信息传递和运行时协调,当前环境覆盖和训练方法仍难以有效解决

解决方案框架

为解决上述问题,论文提出 PhoneBuddy 训练范式,其核心主张是不选择单一环境,而是将真实应用 RL 与模拟应用 RL 相结合

  • 通过 PhoneWorld(基于真实 GUI 使用结构重建的可运行模拟应用)提供可扩展、可验证的训练信号
  • 保留真实应用 RL 以锚定模型对真实设备行为和副作用的理解
  • 采用共享 SFT 阶段后分阶段 RL 训练(仅真实环境 RL vs. 混合环境 RL),验证混合训练对任务成功率的提升效果

简言之,该论文致力于建立一个兼顾真实执行保真度与训练可扩展性的开放模型训练配方,以推动手机智能体从简单的 GUI 理解迈向可靠的任务完成。

Q: 有哪些相关研究?

根据论文第2节”Background”及全文引用,相关研究可分为以下三个主要方向:

1. 移动与GUI智能体(Mobile and GUI Agents)

Web与桌面环境

  • WebArena (Zhou et al., 2023)、VisualWebArena (Koh et al., 2024):建立开放式网络任务评估基准,强调端到端任务完成而非孤立感知
  • OSWorld (Xie et al., 2024)、Windows Agent Arena (Bonatti et al., 2024)、macOSWorld (Yang et al.,

Authors: Zhengyang Tang,Xin Lai,Pengyuan Lyu,Xinyuan Wang,Tianyi Bai,Chenxin Li,Yiduo Guo,Huawen Shen,Yuxuan Liu,Junyi Li,Zhengyao Fang,Yang Ding,Yi Zhang,Weinong Wang,Xingran Zhou,Liang Wu,Fei Tang,Sunqi Fan,Shangpin Peng,Zheng Ruan,Anran Zhang,Benyou Wang,Ji-Rong Wen,Rui Yan,Chengquan Zhang,Han Hu

PDF URL: https://arxiv.org/pdf/2606.23049.pdf

Arxiv URL: https://arxiv.org/abs/2606.23049

Arxiv ID: 2606.23049

CoolPaper URL: https://papers.cool/arxiv/2606.23049

Published: 2026-06-24T01:44:51.740Z

Updated: 2026-06-24T01:44:51.740Z


20. Notes2Skills: From Lab Notebooks to Certainty-Aware Scientific Agent Skills

Abstract:Scientific discovery workflows usually contain and rely heavily on lab notes, where researchers record observations, interpret uncertain results, and plan follow-up experiments. Such informative lab notes preserve evolving scientific reasoning and author uncertainty, rather than polished final results exhibited in publications, providing a valuable opportunity for AI to engage in scientific exploration at a more comprehensive and deeper level. However, most prior work on scientific text focuses on papers, protocols, or structured databases, leaving informal laboratory notes underexplored as inputs to AI agents for science. This gap matters because lab notes often intermingle validated observations, tentative judgments, and possible experimental next steps within the same passage. If these signals are conflated, an AI agent may mistake uncertain scientific judgments for confirmed conclusions or executable actions. To this end, we present Notes2Skills, a two-stage framework for turning lab notebooks into verifiable skills for scientific AI agents while preserving the author’s certainty. Across seven conditions and three wet-lab sessions, Notes2Skills is the only configuration that neither mistakes uncertain notes for firm instructions nor discards firm ones. We show that certainty preservation is the missing piece between lab notebooks and reliable agent skills, opening a path toward safer AI co-scientist systems.

中文摘要

摘要:科学发现工作流程通常包含并高度依赖实验记录,研究人员在其中记录观察结果、解释不确定的结果,并计划后续实验。这些信息丰富的实验记录保存了不断发展的科学推理和作者的不确定性,而不是发表论文中展示的精炼最终结果,为 AI 在更全面、更深入的层面上参与科学探索提供了宝贵的机会。然而,以往大多数关于科学文本的研究都集中于论文、实验方案或结构化数据库,很少关注作为 AI 科学代理输入的非正式实验记录。这一空白很重要,因为实验记录通常在同一段落中交织了已验证的观察、初步判断和可能的实验下一步。如果这些信号混淆,AI 代理可能会将不确定的科学判断误认为已确认的结论或可执行的操作。为此,我们提出了 Notes2Skills,这是一个将实验笔记转化为可验证的科学 AI 代理技能的两阶段框架,同时保留作者的确定性。在七种条件和三次湿实验过程中,Notes2Skills 是唯一既不将不确定的笔记误认为坚定指令,也不丢弃坚定指令的配置。我们证明,确定性的保留是实验笔记与可靠代理技能之间缺失的环节,为更安全的 AI 合作科学家系统开辟了路径。

LLM Analysis

Q: 这篇论文试图解决什么问题?

这篇论文旨在解决如何将非正式、充满作者不确定性信号的实验笔记本(lab notebooks)转换为可用于科学AI Agent的可靠操作技能(skills),同时避免在转换过程中丢失或扭曲作者原有的确定性层级

具体而言,论文识别并针对以下核心问题:

1. 现有科学文本处理范式的局限性

当前面向科学发现的AI系统主要处理**指令性(prescriptive)**文本——如已发表的实验方案(wet-lab protocols)、标准操作程序或烹饪食谱。这些文本在撰写时,作者已解决了不确定性,只包含明确的执行指令。然而,实验笔记本是一种截然不同的文体:它混杂了观察记录、对不确定结果的解释、以及后续实验计划,包含第一人称反思、回顾性犹豫和不平滑的指令密度。

2. 确定性信号混淆导致的双重失败模式

当AI系统未能区分笔记本中不同确定性层级的陈述时,会产生两种对立的失败:

  • 不确定性洗白(Uncertainty Laundering):将作者明确标记为不确定的试探性判断(如”我不太确定第二次读数是否可靠”)编译为坚定决策,导致Agent基于未解决的判断丢弃底层数据。
  • 指令丢失(Directive Loss):将坚定的指令性陈述(如”这部分无效,截断它”)与谨慎的笔记混为一谈,仅将其视为另一种意见,导致Agent保留了作者意图排除的数据。

3. 缺乏保留作者认知状态的技能编译框架

现有将程序文本编译为Agent技能的工作(如SYNTACT、Flow-of-Action)将模糊性视为需要消除的缺陷。但实验笔记本中的”模糊性”往往编码了作者的认知立场(epistemic stance),应当被保留而非消解。论文提出,作者的确定性(FACT/JUDGMENT/SUGGESTION)应作为约束Agent行为的安全边界——事实(FACT)可支持强处理动作,判断(JUDGMENT)默认采用保守的、保留审查的处理,建议(SUGGESTION)仅作为咨询性意见。

解决方案框架

为此,论文提出Notes2Skills(N2S)——一个两阶段框架:

  • 阶段一(EDE):从笔记本中提取指令并标注其认知状态(事实/判断/建议)
  • 阶段二(MetaSkill编译):将标注后的指令编译为MetaSkill——一种保留确定性标签、密码学链接到原文的Markdown技能文档,并引入基于双重证据(作者确定性+信号证据)的执行器(Executor),确保只有当 capsule 的承诺层级与文件信号证据一致时才授权不可逆操作。

该框架的核心贡献在于证明了确定性保留是连接实验笔记本与可靠Agent技能的关键缺失环节,从而在不确定性重的会话和事实主导的会话中均避免了上述两种失败模式。

Q: 有哪些相关研究?

根据论文第2节及相关引用,相关研究可分为以下三个脉络:

1. 科学流程提取(Scientific Procedure Extraction)

该领域早期聚焦于从受限领域提取结构化流程,如从烹饪食谱构建流程图(Mori et al., 2014)。随着神经网络发展,研究转向从**已发布的湿实验方案(wet-lab protocols)**中识别和组织动作序列:

  • Wet Lab Protocols语料库(Kulkarni et al., 2018)及其可执行扩展X-WLP(Tamari et al., 2021)建立了从标准化实验方案中提取动作的基础
  • BioPlanner(O’Donoghue et al., 2023)将这一方向扩展至基于大语言模型(LLM)的协议规划
  • NERRE(Dagdelen et al., 2024)进一步拓展到灵活模式的材料科学场景

与本文的区别:这些工作均针对已最终确定的指令性文本(prescriptive text),假设作者已完成不确定性消解,因此将作者确定性排除在提取目标之外。

2. 程序文本到Agent技能的编译

近期研究致力于将程序文本转换为Agent可执行的技能或工作流:

  • SYNTACT(Giroh et al., 2025)通过”澄清者-规划者-实现者”(Clarifier–Planner–Implementor)对话处理企业标准操作程序中的歧义
  • Flow-of-Action(Pei et al., 2025)遵循类似的”先消解再执行”(resolve-then-act)范式
  • Protocol-to-DSL系统(Shi et al., 2024; Jiang et al., 2024; Mehr et al., 2020)将已发布程序编译为可执行表示,但未将作者确定性作为显式控制信号携带
  • Anthropic SKILL.md标准(Anthropic, 2025)提供了本文目标格式的实用规范

技能归纳与自主科学系统则通过轨迹、演示、文献或工具构建Agent能力(Wang et al., 2024; Majumder et al., 2023; Wang et al., 2025; Boiko et al., 2023; Bran et al., 2024; Szymanski et al., 2023),包括AI co-scientist系统(Gottweis et al., 2026)。

与本文的区别:上述系统要么假设输入为指令性文本,要么评估生成产物而非必须保留不确定性以约束后续行动的笔记本;它们将文本中的歧义视为需要消除的缺陷,而非需要保留的作者认知立场(epistemic stance)。

3. 文本不确定性与事实性检测

NLP领域对作者不确定性和事实性有长期研究:

  • 跨度级对冲检测:BioScope语料库(Vincze et al., 2008)和CoNLL-2010共享任务(Farkas et al., 2010)专注于识别对冲(hedge)及其范围
  • 多轴事实性模式:包括Thompson et al. (2008)、Saurí and Pustejovsky (2009)以及de Waard and Schneider (2012)提出的模态和归因模式
  • 临床NLP中的断言分类:Uzuner et al. (2011)和CMED模式(Mahajan et al., 2023)将事件与捕捉不确定性、时间性等多维标签关联

与本文的区别:这些工作主要服务于信息提取的准确性,而本文将确定性标签视为操作信号(operational signal),直接约束下游Agent的行为边界(如 FACT 可授权强动作, JUDGMENT 默认保留审查)。

Q: 论文如何解决这个问题?

论文通过提出 Notes2Skills(N2S) 这一两阶段框架解决该问题,核心在于将作者的确定性(certainty)作为结构性约束从笔记本文本传递到Agent决策边界。具体解决方案如下:

1. 两阶段整体架构

框架包含从原始笔记到Agent可执行技能的完整流水线:

Lab Notebook Stage 1: EDE Structured Directives Stage 2: Compile MetaSkill Runtime Agent Decision

其中确定性标签 c_i ∈ Fact, Judgment, Suggestion 贯穿始终,作为动作授权的上界。

2. Stage 1:认知指令提取(Epistemic Directive Extraction, EDE)

该阶段将非正式笔记转换为带有认知状态标注的结构化指令:

  • 指令检测:识别是否包含可指导下游流程的指令(has_directive 二进制判断)
  • 指令类型分类:划分为五类动作意图(directive_type):
  • FLAG_DATA (标记数据问题)
  • CONDITION_CHANGE (条件变更)
  • ANALYSIS_SUGGESTION (分析建议)
  • PROTOCOL_CHANGE (协议变更)
  • PARAMETER_SHIFT (参数调整)
  • 认知状态标注:基于语言学线索(如”uncertain”、”looks like”、”recommend”)为每条指令分配确定性等级:
  • FACT :无对冲标记的确定性陈述
  • JUDGMENT :含犹豫、定性评估或试探性解释(如”seems”、”may”)
  • SUGGESTION :可选或推荐性行动(如”should consider”)

输出形式化为三元组集合:
D = (si, t_i, c_i)(i=1)^(|D|)
其中 s_i 为原文片段, t_i 为指令类型, c_i 为确定性标签。

3. Stage 2:MetaSkill 编译

Stage 2 通过确定性映射将结构化指令编译为 MetaSkill(符合 Anthropic SKILL.md 标准的 Markdown 文档),遵循四项原则:忠实性(faithfulness)、可操作性(actionability)、可审计性(auditability)和保守性(conservatism)。

关键机制

  • 胶囊化(Capsule):每条指令被封装为 JSON 胶囊,包含:
  • 确定性标签(epistemic_status
  • 默认动作(default_action)与动作层级(default_action_tier:strong/mid/conservative)
  • 显式授权标记(explicit_authorization
  • 源文本密码学链接(SHA-256 锚定)
  • 动作承诺层级映射:确定性标签转换为动作授权上界:
  • FACT → 可授权强动作(如 TRUNCATE_AT 、 SKIP_FILE )
  • JUDGMENT → 仅默认保守动作(如 FLAG_FOR_REVIEW )
  • SUGGESTION → 仅咨询性,无文件级承诺

编译过程为确定性函数:
M = Compile(D, Pi)
其中 Pi 为领域动作词汇表, M 为技能胶囊集合。

4. 下游执行:双重证据门控(Dual-Evidence Gate)

在 Agent 运行时,执行器(Executor) 实施贝叶斯式的保守决策逻辑:仅当胶囊的承诺层级与文件信号证据一致时,才授权不可逆操作。

执行器规则(四层输出):

  1. Authorize:当 LLM 提议的强动作与胶囊显式授权匹配,且信号证据支持参数时,予以通过
  2. Veto:当提议的强动作缺乏确定性支持或信号证据不符时,降级为审查保留动作
  3. Substitute:当 LLM 默认保守动作,但胶囊包含与信号证据对齐的 FACT 级候选动作时,升级执行
  4. Abstain:保持默认保守动作

数学上,执行器为确定性函数:
Executor: (Proposal, Capsule, SignalFindings) to Authorize, Veto, Substitute, Abstain

关键约束:强动作( RAISE_THRESHOLD 、 TRUNCATE_AT 、 SKIP_FILE )仅在以下条件下通过:
Capsule.commitment_level = strong land SignalEvidence models Parameter

5. 与基线方法的差异验证

论文通过消融实验验证该方案的必要性:

  • Action-only 技能:丢弃确定性信息,导致执行器退化为 blanket 过滤器,在 Step-drop 会话中准确率从 88.9% 暴跌至 44.4%
  • Raw notes:缺乏结构化确定性标签,在 Saturation-A 会话中 FLAG_FOR_REVIEW 召回率为 50% ,而 Notes2Skills 达到 85.7%

该框架是唯一在七种测试配置中同时避免两种失败模式的方案:既不会在不确定性重的会话中将犹豫判断( JUDGMENT )洗白为坚定动作,也不会在事实主导的会话中丢失作者明确的截断指令( FACT )。

Q: 论文做了哪些实验?

论文通过三个相互关联的实验验证 Notes2Skills 框架的有效性,涵盖从指令提取、技能编译到下游决策的完整流水线。

1. 实验一(Exp 1):Stage 1 认知指令提取评估

该实验评估大语言模型从实验笔记中提取指令并标注认知状态的能力。

实验设置

  • 语料库:三个跨越形式化谱系的语料库(表2)
  • FreeNotes( n=201 ):非正式双语实验笔记(用于下游评估)
  • ONS( n=155 ):半正式开放科学笔记
  • WLP( n=105 ):正式湿实验方案(对照组)
  • 模型:GPT-4o、Claude Sonnet 4.5、Qwen-Max
  • 条件:零样本(zero-shot)与少样本(few-shot, k=5 或 6 )
  • 分割:文档层面 80/20 分层分割

评估指标

  • F_1^(hd) :二分类 F_1 (是否包含指令,has_directive
  • F1^(dt) 与 F1^(ep) :宏平均 F_1 (指令类型与认知状态,仅在双正例子集计算)
  • QWK_(ep) :认知状态的二次加权 Kappa(考虑 FACT arrow SUGGESTION 比 FACT arrow JUDGMENT 更严重)
  • Joint :三标签(是否指令、类型、确定性)完全匹配率

关键结果(表4)

  • 少样本提示显著提升指令类型分类性能(Claude 的 F_1^(dt)* 从 0.320 提升至 0.500 )
  • 综合表现最优配置为 Claude Sonnet 4.5 few-shot: F1^(hd) = 0.737 , F_1^(dt)* = 0.500 , QWK(ep) = 0.761
  • 认知状态标注的主要误差集中在 FACT – JUDGMENT 边界

2. 实验二(Exp 2):Stage 2 保留审计

由于 Stage 2(MetaSkill 编译)为确定性过程,该实验审计编译器是否正确保留 Stage 1 输出,而非预测性能。

审计对象

  • 跨三个语料库共 149 个固定指令(FreeNotes 48 个,WLP 70 个,ONS 31 个)

审计维度(表5)

  1. 指令保留(Preservation):1:1 映射,无合并或丢失
  2. 确定性一致性(Certainty Agreement):胶囊的 epistemic_status 与源 EDE 一致
  3. 来源完整性(Provenance):SHA-256 锚定的源文本链接链完整
  4. 模式有效性(Schema Validity):JSON 解析有效,字段符合封闭词汇表
  5. 动作策略层(Policy):(仅 FreeNotes)检查默认动作与授权标记

结果

  • 100% 通过率:所有 149 个指令均完整保留为技能胶囊,确定性标签、源链接与模式字段均符合规范(表5中所有单元格为 x/x 形式,如 48/48 )

3. 实验三(Exp 3):下游技能加载与决策验证

该实验评估编译后的 MetaSkill 在实际湿实验数据处理的文件级决策中是否保持作者意图,是端到端验证。

实验场景 三个具有不同不确定性制度的 FreeNotes 纳米孔电生理会话(表6):

  • Saturation-A( n=17 ):不确定性主导的模糊场景(14/17 文件需审查)
  • Saturation-B( n=22 ):终端饱和场景(20/22 文件需审查)
  • Step-drop( n=9 ):事实主导的步降截断场景

评估配置(表3 共七种)

  • External LLM:原始笔记 + 信号发现,无编译技能(诊断基线)
  • Action-only skill:仅动作字段,无确定性标签
  • Action-only + executor:上述技能启用执行器(测试执行器对无确定性信息的退化行为)
  • Raw notes:结构化摘录,无胶囊化确定性标签
  • Notes2Skills skill:完整 MetaSkill,无执行器
  • Notes2Skills + verify:启用 Authorize 与 Veto 规则
  • Notes2Skills + verify + elevate:额外启用 Substitute 规则(提出的完整配置)
  • Stress test:用 Claude few-shot 预测的 EDE 替代人工标注 EDE

评估指标

  • Acc :文件级多数投票准确率
  • bAcc :平衡准确率(类别召回率均值)
  • Macro-F_1 :五类动作( KEEP_FULL 、 FLAG_FOR_REVIEW 、 RAISE_THRESHOLD 、 TRUNCATE_AT 、 SKIP_FILE )的宏平均 F_1
  • kappa :未加权 Cohen’s Kappa(考虑为离散管道分派而非序数量表)
  • FR : FLAG_FOR_REVIEW 召回率(最易受不确定性洗白影响的类别)

关键发现(表6)

不确定性洗白(Laundering)的避免

  • 在 Saturation-A 和 Saturation-B 中,External LLMAction-only skill 的 FLAG_FOR_REVIEW 召回率分别为 0% – 21.4% , kappa 接近随机( -0.05 至 0.14 ),表明不确定判断被错误执行为强动作
  • Notes2Skills + verify 将召回率提升至 85.7% (Sat-A)和 100% (Sat-B), kappa 达 0.71 和 1.00

指令丢失(Directive Loss)的避免

  • 在 Step-drop(事实主导)中,Action-only + executor 因缺乏确定性信息而退化,准确率从 88.9% 暴跌至 44.4% ( kappa=0.00 ),表现为 blanket 降级过滤器
  • Notes2Skills + verify + elevate 达到 77.8% 准确率( kappa=0.63 ),通过 Substitute 机制在信号证据支持时升级保守提议,恢复作者意图

鲁棒性验证

  • 压力测试(使用预测 EDE):在 Saturation-A 上 kappa 从 0.71 降至 0.51 (仍优于基线),在 Saturation-B 上仍比原始 LLM 提议提升 54.6 个百分点,证明即使 Stage 1 存在误差,安全属性(不支持的动作不被执行)仍保持

结论Notes2Skills + verify + elevate 是唯一在七种配置中同时避免两种失败模式(不确定性洗白与指令丢失)的方案。

Q: 有什么可以进一步探索的点?

基于论文的局限性与实验结果,以下方向值得进一步探索:

1. 多作者与协作式笔记处理

当前框架假设单作者实验笔记(single-author notebooks),其中作者的确定性直接对应决策责任。然而,现代科学研究常涉及多作者协作笔记或继承性实验记录(如博士后接手前任的笔记本)。未来工作需处理:

  • 不同作者间相互冲突的确定性标注
  • 时间维度上的认知状态演化(早期假设 vs. 后期确认)
  • 责任归属与权限层级的显式建模

2. 跨领域泛化与领域自适应

论文验证集中于纳米孔电生理(nanopore electrophysiology)领域。向其他实验科学(如有机合成、材料表征、细胞培养)扩展时面临:

  • 领域特定对冲词汇的迁移(如化学中的”yield seems low” vs. 物理学中的”signal possibly saturated”)
  • 动作词汇表的差异(不同学科的处理动作集合 Pi 显著不同)
  • 信号证据类型的多样化(从电生理时间序列扩展到质谱、显微图像、色谱等多模态数据)

3. Stage 1 认知状态分类的精度提升

实验显示,当前 Stage 1 的主要误差集中在 FACT – JUDGMENT 边界(§6.1)。改进方向包括:

  • 引入显式的语言学对冲检测(linguistic hedge detection)作为前置特征
  • 利用多任务学习联合建模指令类型与认知状态,而非顺序标注
  • 开发主动学习(active learning)机制,当模型对确定性标签置信度低时触发人工澄清(类似 SYNTACT 的 Clarifier 模块,但保留不确定性而非消解它)

4. 内部矛盾与冲突消解机制

当前执行器假设笔记呈现单一、自洽的认知状态(§K.3)。实际笔记本常包含:

  • 同一文件的多个相互冲突的指令(如早期建议截断,后期建议保留)
  • 信号发现(SignalFindings)与笔记指令的冲突(如笔记标记为 JUDGMENT 但信号证据强烈支持干预) 需开发元推理层(meta-reasoning layer)处理这些冲突,例如通过显式的冲突检测标记触发强制人工审查,而非默认保守动作。

5. 跨会话的技能累积与版本控制

当前 MetaSkill 针对单个实验会话编译。长期科学项目中需要:

  • 技能版本控制:追踪实验方案随时间的演化(如 PROTOCOL_CHANGE 的历史链条)
  • 跨会话知识迁移:识别不同会话中相似的确定性模式(如某类噪声反复导致 JUDGMENT 级标记),自动提升为新领域的 FACT 级知识
  • 技能组合:将多个会话的 MetaSkills 合并为实验室级的标准操作知识库

6. 多模态笔记本处理

当前框架仅处理文本笔记数值信号。实验笔记本常包含:

  • 手写批注(handwritten annotations)与草图
  • 图像证据(凝胶电泳图、显微镜照片、实验装置照片)
  • 语音记录(实验过程中的口头备注) 需扩展 EDE 以处理这些模态,特别是图像中的视觉不确定性线索(如模糊的条带标记为”unclear”)。

7. 隐私保护与联邦化编译

实验笔记本包含敏感的预发表数据与未验证假设。未来需探索:

  • 差分隐私(differential privacy)下的技能提取,保护原始笔记细节的同时共享确定性模式
  • 联邦学习(federated learning)架构:多实验室本地训练 Stage 1 模型,共享聚合后的技能模式而非原始笔记

8. 实时(Online)技能更新

当前框架为离线后处理(post-hoc)。探索实时笔记到技能的流式处理:

  • 实验进行中动态更新 MetaSkill(如根据实时观测插入 SUGGESTION )
  • 自驱动实验室(self-driving labs)集成,使 Agent 能在实验进行中根据笔记不确定性调整采样策略(如对 JUDGMENT 标记区域增加重复测量)

9. 认知状态的细粒度建模

当前三分类( FACT / JUDGMENT / SUGGESTION )可能过于粗粒度。可探索:

  • 连续确定性度量(如概率化的 p(certainty) )替代离散标签
  • 多维度认知建模:区分”证据不确定性”(epistemic uncertainty)与”本体不确定性”(ontological uncertainty)
  • 作者特异性校准:学习特定科学家的对冲语言习惯(如某作者常用”maybe”实际表示高确定性)

10. 可解释性与审计工具

虽然 MetaSkill 提供了来源链接(provenance),但需进一步开发:

  • 可视化工具:展示从原始笔记片段到最终 Agent 决策的完整证据链
  • 反事实分析:支持科学家询问”如果我将此笔记的确定性从 JUDGMENT 改为 FACT ,Agent 决策会如何变化”
  • 合规性检查:自动验证 Agent 行为是否符合实验室的伦理与安全规范(特别是在 SKIP_FILE 等不可逆操作上)

Q: 总结一下论文的主要内容

这篇论文探讨了如何将非正式的实验笔记本(lab notebooks)转换为可供科学AI Agent使用的可靠操作技能(skills),同时严格保留作者原有的确定性层级(certainty levels),以避免在自动化过程中丢失关键的认知边界信息。

研究背景与核心问题

实验笔记本是科学发现的核心载体,记录了观察结果、对不确定数据的解释以及后续实验计划。与已发表的实验方案(protocols)不同,笔记本混杂了已验证的事实(facts)、试探性的判断(judgments)和前瞻性的建议(suggestions)。现有AI系统通常假设输入文本为指令性(prescriptive)内容,导致两种对立的失败模式:

  • 不确定性洗白(Uncertainty Laundering):将作者明确标记为不确定的笔记(如”我不太确定第二次读数是否可靠”)错误编译为坚定决策,导致Agent基于未解决的判断丢弃数据。
  • 指令丢失(Directive Loss):将坚定的指令(如”这部分无效,截断它”)与谨慎笔记混为一谈,仅视为另一种意见,导致Agent保留了本应排除的数据。

Notes2Skills 框架

论文提出Notes2Skills(N2S),一个两阶段框架,将作者的认知状态(epistemic status)作为安全边界从笔记传递至Agent决策:

Stage 1: 认知指令提取(EDE) 从笔记本文本中提取可能指导后续分析的陈述(directives),并标注其确定性标签 c_i ∈ FACT, JUDGMENT, SUGGESTION 。其中:

  • FACT :无对冲标记的确定性陈述,可支持强处理动作
  • JUDGMENT :含犹豫或试探性解释的陈述,默认采用保守、保留审查的处理
  • SUGGESTION :可选性建议,仅作为咨询意见,不授权文件级操作

Stage 2: MetaSkill 编译 将标注后的指令编译为MetaSkill——一种符合Anthropic SKILL.md标准的Markdown技能文档。每个指令被封装为JSON胶囊(capsule),包含:

  • 确定性标签(epistemic_status)与动作承诺层级(default_action_tier
  • 密码学锚定的源文本链接(SHA-256)
  • 显式授权标记(explicit_authorization

运行时执行器(Executor) 实现基于双重证据的门控机制:只有当胶囊的认知状态与文件信号证据(SignalFindings)一致时,才授权不可逆操作(如 TRUNCATE_AT 或 SKIP_FILE )。执行器遵循贝叶斯决策理论的保守逻辑:
Authorize iff Commitment Level = strong land Signal Evidence models Action

实验验证

论文通过三个相互关联的实验验证框架有效性:

  1. Stage 1 提取评估(Exp 1):在覆盖形式化谱系的三个语料库(非正式双语笔记FreeNotes、半正式开放笔记ONS、正式实验方案WLP)上测试。最佳配置(Claude Sonnet 4.5 few-shot)达到 F_1=0.737 (指令检测)和 QWK=0.761 (确定性标注一致性)。

  2. Stage 2 保留审计(Exp 2):验证编译器确定性映射的正确性。全部149个固定指令均完整保留为技能胶囊,确定性标签、源链接与模式字段100%符合规范。

  3. 下游决策验证(Exp 3):在三个真实湿实验会话(涵盖不确定性主导与事实主导场景)上评估文件级数据处理决策。结果表明,Notes2Skills是唯一同时避免两种失败模式的配置:在不确定性重的会话中防止了将 JUDGMENT 洗白为强动作( FLAG_FOR_REVIEW 召回率从 0% 提升至 100% ),在事实主导的会话中避免了将 FACT 级截断指令丢失(准确率达 77.8% )。

主要结论

论文证明,确定性保留(certainty preservation)是连接实验笔记本与可靠Agent技能的关键缺失环节。通过将作者的认知状态显式编码为动作授权的上界,并引入基于双重证据的执行器门控,Notes2Skills使非正式的实验笔记能够安全地转化为可验证、可审计的Agent技能,为构建更安全的AI协同科学家系统(AI co-scientist systems)提供了路径。

Q: 想要进一步了解论文

以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Shi Liu,Jiayao Chen,Chengwei Qin,Yanqing Hu,Jufan Zhang,Linyi Yang

PDF URL: https://arxiv.org/pdf/2606.11897.pdf

Arxiv URL: https://arxiv.org/abs/2606.11897

Arxiv ID: 2606.11897

CoolPaper URL: https://papers.cool/arxiv/2606.11897

Published: 2026-06-24T01:45:50.282Z

Updated: 2026-06-24T01:45:50.282Z