数据来源:ArXiv Domain

LLM Domain Papers

1. Where Does Harness-Optimization Value Live? Localized Gains and the Budget-Splitting Trap in Self-Evolving LLM Agents

Abstract:A growing body of work improves frozen large language models (LLMs) as agents by evolving their harness: the textual scaffolding around the model, including persona, strategy, format rules, and control heuristics. Existing reflective prompt-evolution methods usually optimize this harness as one flat string. We instead ask where the optimization value actually resides. We introduce HARNESSEVO, which decomposes the harness into four separately evolvable slots: role, task-strategy, tool/format-rules, and reflection/control. Using the same reflective optimizer under an iso-budget setting, we pair this decomposition with leave-one-in and leave-one-out attribution to measure the contribution of each slot. On ALFWorld with a frozen 7B backbone, HARNESSEVO does not significantly improve the overall binary success rate over either the stock harness or flat-string evolution: 0.657 versus 0.642 and 0.642, respectively. However, the slot-level analysis reveals that nearly all useful optimization value is localized in the reflection/control slot, which achieves a leave-one-in gain of +0.119. The other slots are individually null. We further show that uniform budget splitting is harmful: allocating 64 rollouts across four slots leaves only 16 per slot, below the optimizer’s effective search floor, causing every slot to freeze at its empty seed. Concentrating the budget on the high-credit control slot recovers the lost gain, reaching 0.761 with half the split budget. The effect is task-contingent. On WebShop, all slots freeze empty and all methods tie, indicating a genuine absence of recurrent, verbalizable control failures rather than budget starvation. Overall, our results suggest that harness value is localized, uniform budget splitting can be actively harmful, and credit assignment should precede structured agent-evolution.

中文摘要

摘要:越来越多的研究通过改进冻结的大型语言模型(LLMs)作为智能体的方式,提升了它们的表现:这种改进表现为模型周围的文本支架,包括角色设定、策略、格式规则以及控制启发式方法。现有的反思型提示进化方法通常将这一支架作为一个单一的字符串进行优化。而我们则探讨优化价值究竟存在于何处。我们提出了HARNESSEVO,将支架拆分为四个可单独进化的槽位:角色、任务策略、工具/格式规则以及反思/控制。在相同预算条件下,使用同样的反思优化器,我们结合’保留一个’和’排除一个’归因方法来衡量每个槽位的贡献。在ALFWorld上使用冻结的7B基础模型,HARNESSEVO在整体二元成功率上并未显著优于原始支架或平面字符串进化:分别为0.657、0.642和0.642。然而,槽位级别分析显示,几乎所有有用的优化价值都集中在反思/控制槽位,该槽在保留一个测试中增益达+0.119。其他槽位单独看则无效。我们进一步证明,均匀分配预算是有害的:在四个槽位之间分配64次尝试,每个槽位仅有16次,这低于优化器的有效搜索下限,导致每个槽位都停留在空白初始状态。将预算集中在高价值的控制槽能够恢复失去的增益,在使用一半分配预算的情况下,成功率达到0.761。该效应依赖于任务。在WebShop任务中,所有槽位都停留为空白,所有方法表现一致,表明真实地不存在可复现的、可言语化的控制失败,而不是预算不足导致的结果。总体而言,我们的结果表明支架的价值是局部化的,均匀预算分配可能会产生负面效果,归因分配应在结构化智能体进化之前进行。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*冻结式大型语言模型(LLM)Agent的harness(文本脚手架)优化中,价值定位与预算分配\*\*的核心问题。 具体而言,该研究聚焦于以下三个相互关联的子问题: \*\*1. Harness内部的价值定位(Credit Assignment)\*\* 现有主流方法(如反射式提示进化)将Agent的harness视为一个扁平、无差别的单一字符串进行整体优化。尽管这种做法能够提升Agent表现,但其隐含的前提是将所有组件(角色定义、任务策略、格式规则、控制启发式)混为一谈。论文质疑:优化产生的价值究竟集中于harness的哪一个具体组件?若不回答此问题,则无法知晓下一次优化努力应投向何处。 \*\*2. 预算分割陷阱(Budget-Splitting Trap)\*\* 当在固定rollout预算下将harness分解为多个独立进化的组件(如按坐标上升逐槽优化)时,均匀分配预算可能导致每个组件获得的资源低于优化器的最低工作门槛(accept-and-rescore floor)。论文识别出这一结构性风险:分解本身并非总是有益;若预算被稀释至各组件均无法触及优化器的接受 floor,则所有组件将冻结于空种子状态,导致真正承载价值的组件(如反射/控制槽)无法被捕获,从而产生强烈的\*\*子可加性\*\*(sub-additivity)——整体增益远小于各组件单独增益之和。 \*\*3. 任务依赖的边界(Task-Contingency)\*\* 论文进一步探究上述价值局部化现象是否具有跨任务普适性。通过对比ALFWorld与WebShop,研究试图明确:何种任务特性使得harness优化能够捕获真实价值(即存在反复出现、可被语言化的控制失败,如重复无效动作、前置条件未满足、过早停止),以及在何种情况下优化应当保持为空,从而避免在缺乏可泛化控制模式的任务上进行无效搜索或奖励操纵。 简言之,该研究并非提出一种追求排行榜刷新的新优化算法,而是将结构化分解作为\*\*显微镜\*\*,以回答“价值在何处”与“预算应如何分配”这两个先决问题,并据此得出\*\*信用分配优先于均匀优化、预算应集中于高价值组件\*\*的处方。 Q2: 有哪些相关研究? 根据论文第2节(Related Work),相关研究可归纳为以下五个主要方向: --- ### 1. 提示与Agent自进化(Prompt and Agent Self-Evolution) 该方向将冻结LLM的harness(提示文本、上下文或策略)视为可优化对象,但通常以\*\*单一整体字符串\*\*为单位进行搜索,不区分内部组件。 - \*\*自动提示搜索\*\*:APE(Zhou et al., 2023)通过LLM自身生成并排序指令;OPRO(Yang et al., 2024)将LLM迭代式地作为优化器;Promptbreeder(Fernando et al., 2023)同时进化任务提示与变异提示。 - \*\*提示程序框架\*\*:DSP/DSPy(Khattab et al., 2024)将LLM调用编译为声明式程序并优化其指令与示例。 - \*\*反射式提示进化\*\*:GEPA(Agrawal et al., 2025)是本文的\*\*主要对比方法(principal foil)\*\*,通过反射轨迹、变异单一字符串并在实例帕累托前沿上选优。本文直接复用其优化器,但将其作用于分槽(slot-by-slot)结构而非扁平字符串。 - \*\*动态上下文与记忆\*\*:Agent Workflow Memory(Wang et al., 2024)、Agentic Context Engineering(Zhang et al., 2025)、MemGPT(Packer et al., 2023)、MemoryBank(Zhong et al., 2024)等通过积累可复用经验或管理长程状态来提升Agent。 - \*\*技能与经验积累\*\*:Voyager(Wang et al., 2023)构建技能库;ExpeL(Zhao et al., 2024)从经验中学习;以及STaR、自我改进等自举方法。 - \*\*自我奖励与元奖励\*\*:Self-Rewarding(Yuan et al., 2024)与Meta-Rewarding(Wu et al., 2024)利用LLM自身作为评判信号。 - \*\*工具使用优化\*\*:EvoTool(Yang et al., 2026)在工具调用粒度进行归因感知变异,与本文在harness组件粒度进行信用分配的精神相近,但操作层面不同。 \*\*与本文关系\*\*:上述工作将优化单元视为单一整体(字符串、上下文或技能集),\*\*未提出“harness内部哪一部分承载价值”的问题\*\*。本文继承其优化机制,但通过结构化分解回答这一问题。 --- ### 2. LLM-Agent框架与交互式基准(LLM-Agent Frameworks and Interactive Benchmarks) - \*\*推理-行动循环\*\*:ReAct(Yao et al., 2023)交错推理与环境行动,是本文Agent的底层循环;Reflexion(Shinn et al., 2023)引入跨尝试的口头自我反思;Tree-of-Thoughts(Yao et al., 2023)与Self-Consistency(Wang et al., 2023)结构化推理过程。 - \*\*自我修正\*\*:Self-Refine(Madaan et al., 2023)、CRITIC(Gou et al., 2023)等让模型批判并修正自身输出;但Huang et al.(2024)指出无外部反馈时LLM难以可靠自我纠正。 - \*\*工具与检索\*\*:ToolLLM(Qin et al., 2024)扩展至外部API;RAG(Lewis et al., 2020; Guu et al., 2020; Asai et al., 2024)通过检索增强知识。 - \*\*交互基准\*\*: - \*\*ALFWorld\*\*(Shridhar et al., 2021):家务任务,需要多步操作与部分可观察性——本文发现其存在反复出现的、可被语言化的控制失败。 - \*\*WebShop\*\*(Yao et al., 2022):基于属性匹配的网购任务——本文发现其缺乏此类控制失败,导致harness优化为空。 - 其他:WebArena(Zhou et al., 2024)、GAIA(Mialon et al., 2024)、AgentBench(Liu et al., 2024)、τ-bench(Yao et al., 2024)、SWE-bench(Jimenez et al., 2024)。 \*\*与本文关系\*\*:这些框架提供了harness的“注射点”(injection point)与评估环境;本文的分解直接作用于ReAct策略前言,并通过ALFWorld与WebShop的对比确立任务依赖性边界。 --- ### 3. 信用分配、消融与组件分析(Credit Assignment, Ablation, and Component Analysis) - \*\*网络单元重要性\*\*:Morcos et al.(2018)发现单个方向或单元可承载不成比例的功能权重——这与本文发现“四个harness槽中一个承载几乎全部价值”形成结构类比。 - \*\*分解-重组策略\*\*:Branch-Solve-Merge(Saha et al., 2023)与Generate-then-Rank等将LLM计算重构为多个部分,但未在共享预算下测量各部分的边际价值。 - \*\*上下文学习作为隐式优化\*\*:von Oswald et al.(2023)与Akyürek et al.(2023)的研究有助于解释为何复述模型已有能力的槽(如角色、格式)不增加价值,而补充缺失控制结构的槽则有效。 \*\*与本文关系\*\*:本文的LOI/LOO协议是最简的信用分配设计,用于隔离各槽的边际贡献;其\*\*子可加性结果\*\*(整体增益远小于单槽增益之和)量化了预算分割下的组合失效。 --- ### 4. 奖励过度优化、古德哈特定律与Grounded Value - \*\*古德哈特与奖励黑客\*\*:Goodhart(1984)的经典现象;Gao et al.(2023)的奖励模型过度优化尺度律;Skalse et al.(2022)对奖励黑客的定义;Pan et al.(2022)对奖励误设效应的映射;Amodei et al.(2016)对AI安全具体问题的讨论。 - \*\*基于偏好的对齐\*\*:从人类反馈学习摘要(Stiennon et al., 2020)到DPO(Rafailov et al., 2023)与RLAIF(Lee et al., 2024)。 - \*\*Agent misalignment\*\*:Yang et al.(2026)综述了针对环境奖励优化的Agent的规约博弈(specification gaming)行为。 - \*\*LLM-as-Judge\*\*:MT-Bench与Chatbot Arena(Zheng et al., 2023)、G-Eval(Liu et al., 2023)、Prometheus(Kim et al., 2024)等,以及对其偏差的分析(Gu et al., 2024; Panickssery et al., 2024)。 \*\*与本文关系\*\*:本文将这些讨论作为建设性对照。其在ALFWorld上捕获的是\*\*环境落地的自我纠正\*\*(避免重复无效动作、验证前置条件),而非利用二元成功检查器的奖励黑客;在WebShop(具有更易博弈的稠密奖励)上,优化器选择不填充任何槽,表现为“真实空值”而非过拟合。 --- ### 5. 递归自进化(Recursive Self-Evolution) - \*\*递归多Agent系统\*\*:Yang et al.(2026)与Zou et al.(2025)研究Agent修订自身改进程序,而非仅优化提示或上下文。 \*\*与本文关系\*\*:递归与本文所研究的问题正交。本文固定优化器,探究单次非递归传递中价值在harness内部的落点;其预算分割分析适用于任何在达到接受floor前将固定rollout预算分配到各命名组件的方案,无论递归与否。 --- \*\*总结\*\*:本文的核心定位在于,上述提示优化与Agent自进化文献普遍将harness视为单一整体进行优化,而本文首次通过结构化分解与信用分配协议,系统性地回答了\*\*“价值在内部何处”\*\*以及\*\*“固定预算应如何分配”\*\*的问题。 Q3: 论文如何解决这个问题? 论文通过构建一个名为 \*\*HARNESSEVO\*\* 的结构化显微镜框架来解决 harness 优化中的价值定位与预算分配问题。该方法不追求单一性能指标的提升,而是通过显式分解、受控优化与系统归因,回答“价值在何处”以及“预算应如何花”。具体解决路径可分为以下五个层面: --- ### 1. 结构化四槽分解:将不可见的文本脚手架变为可定位的组件 论文首先将传统上作为单一扁平字符串处理的 harness 分解为四个互斥、语义独立的可进化槽(slot),按固定顺序渲染:

H = (c_1, c_2, c_3, c_4), quad render(H) = c_1 parallel c_2 parallel c_3 parallel c_4
四个槽的语义边界严格区分: | 槽位 | 组件 | 语义范围 | |—-|—-|—-| | c_1 | role / persona | 角色与人格设定(如“你是一个谨慎的家务助手”),不含动作模板或停止规则 | | c_2 | task-strategy | 高层任务分解策略(如“先在常见容器中寻找目标”),不含句法或循环启发式 | | c_3 | tool / format-rules | 动作模板与输出格式规则,可机械复制,不含策略或控制逻辑 | | c_4 | reflection / control-heuristics | 循环纪律与自我纠正规则(如“绝不重复返回‘Nothing happens’的动作;先打开再拿取;确认持有再放置;达成目标后停止”) | 这种分解使原本混为一体的文本脚手架具备了**组件级可解释性**,为后续的信用分配提供了物理基础。 —- ### 2. 坐标上升与 iso-budget 优化:在严格预算控制下逐槽进化 论文采用**坐标上升(coordinate ascent)**策略,复用现有的反射式提示优化器(GEPA),但每次仅优化一个槽,其余槽保持冻结或空种子状态: - 进化 c_k 时,所有前置槽冻结于已优化文本,后置槽固定为空种子; - 优化器内部仅对当前槽进行反射变异,其他槽作为固定上下文写入元提示,防止内容重复或冲突; - 总 rollout 预算 B 被严格限定为与扁平单字符串进化相同(iso-budget),即结构化方法的各槽预算之和等于扁平方法的单一预算。 算法流程可概括为:

for k=1 to 4: quad ck^* arrow GEPAl(train, val; budget b_k, context c(k)=∅r)
其中 ∑_k b_k = B 。这种设计确保任何观测到的差异均源于**文本内容与结构**,而非预算优势或代码路径变化。 —- ### 3. LOI/LOO 信用分配协议:隔离单槽的边际贡献 为精确定位价值来源,论文设计了**leave-one-in (LOI)** 与 **leave-one-out (LOO)** 两种消融探针: **Leave-One-In (LOI)** —— 检验单槽的充分性: 仅进化目标槽 c_k ,其余三槽保持空种子,测量其单独相对 stock harness 的边际增益:

Delta(LOI)^k = rhol(LOI_kr) - rho(H_0)
**Leave-One-Out (LOO)** —— 检验单槽的必要性: 进化除 c_k 外的所有槽,测量从完整 harness 中移除该槽所造成的损失:
Delta
(LOO)^k = rhol(LOOkr) - rho(H(full))
两个探针均在**独立测试集**上通过成对 McNemar 检验评估统计显著性,从而构建出二维信用分配地图(sufficiency vs. necessity)。 —- ### 4. 识别并规避预算分割陷阱:从均匀分配到预算集中 通过上述协议,论文识别出一个关键机制性障碍——**预算分割陷阱(budget-splitting trap)**: 反射式优化器存在**接受-重评分门槛(accept-and-rescore floor)**:每次迭代需消耗 2 × |minibatch| + |validation| 个 rollout 来完成父代/子代对比与验证集重评分。当 iso-budget B=64 被四等分为每槽 16 个 rollout 时,该数值恰好处于或低于门槛,导致**所有槽均无法完成一次有效突变接受**,最终全部冻结于空种子状态。 因此,论文提出**预算集中(budget concentration)**处方: 1. 先通过廉价的 LOI 探针识别高信用槽(在 ALFWorld 上为 c_4 ); 2. 将总预算集中投放到该高价值单槽,而非均匀分散。 实验验证: - 四等分预算:每槽 16 ,结果 0.657 (与 stock 无显著差异); - 半预算单槽( B/2=32 全投 c_4 ): 0.761 , +0.119 ( p=0.0046 ); - 全预算单槽( 64 全投 c_4 ): 0.724 , +0.082 (方向稳健,但 p=0.0725 为边缘显著)。 这表明**预算去向比预算总量更为关键**。 —- ### 5. 跨基准任务依赖性验证:区分“真实空值”与“预算饥饿” 为验证现象是否普适,论文在 **WebShop** 上重复相同协议。结果发现: - 四等分预算下所有槽冻结为空; - **关键检验**:将全预算 64 集中投入控制槽 c_4 (排除预算饥饿假说),该槽依然冻结为空,性能与 stock 无差异( 0.535 vs 0.518 ,ns)。 由此确立**任务依赖性边界**:harness 优化仅在存在**反复出现、可被语言化的控制失败**(如重复死胡同动作、容器未开、过早停止)时才能捕获价值;若任务本身缺乏此类失败模式(如 WebShop 的稠密属性匹配奖励),则优化器 correctly abstains(正确弃权),返回真实空值而非奖励黑客策略。 —- ### 总结 论文通过 **HARNESSEVO** 框架解决了 harness 优化中的价值黑箱问题: - **分解**:将扁平字符串拆分为四个语义隔离的槽,使价值定位成为可能; - **协议**:以 LOI/LOO 在 iso-budget 下进行成对消融,量化每槽的边际贡献; - **诊断**:发现预算分割导致的子可加性失效机制(accept-and-rescore floor); - **处方**:提出“先定位、后集中”的预算分配策略,将资源投向高信用组件; - **边界**:通过跨基准对比确立 harness 优化有效的任务条件(环境落地的自我纠正需求)。 Q4: 论文做了哪些实验? 论文的实验体系围绕 **结构化分解**、**信用分配** 与 **预算分配** 三个核心问题展开,在 ALFWorld 与 WebShop 两个交互式基准上完成。所有实验共享同一冻结主干(Qwen2.5-7B)与完全一致的 rollout 路径,仅通过注入文本内容施加干预。 —- ### 1. 实验设置与配置 - **冻结主干**:Qwen2.5-7B,既作为任务策略模型,也作为反射变异模型;推理时温度设为 0(确定性),反射变异时温度 0.9。 - **基准与数据划分**: - **ALFWorld**

8
:训练集 |T|=30 (平衡覆盖各任务类型),验证集约 10 条(B64 配置),独立测试集 n=134 ;最大步长 40 步;指标为环境验证的**二元成功率**。 - **WebShop**
9
:独立训练/验证/测试划分,测试集 n=80 ;指标为**稠密属性匹配分数**($
0,1
)。 - 预算(Rollout Budget): - 主实验臂: B=64 (iso-budget)。扁平单字符串进化将所有 64 次 rollout 用于一个字符串;HARNESSEVO-full 将其四等分为每槽 16 次。 - 验证臂: B=120 (较小验证集与 minibatch,用于方向稳健性检验)。 - 预算分配臂:单槽 LOI 取 B/2=32 ;全预算集中(all-to- c_4 )分别测试 32 与 64。 —- ### 2. 对比方法 实验共包含以下方法变体: | 方法 | 说明 | |:—-|:—-| | Stock | 空种子 harness H_0 ,所有槽为空,字节级等价于无 preamble 的 ReAct。 | | GEPA-flat | 扁平单字符串反射式进化,预算 B$,直接复用

5
的优化器。 | | **HARNESSEVO-full** | 四槽坐标上升全进化,iso-budget B 均分为 B/4 每槽。 | | **LOI(Leave-One-In)** | 仅进化单槽 ck ,其余为空;分别对 c_1, c_2, c_3, c_4 各跑一次。 | | **LOO(Leave-One-Out)** | 进化除 c_k 外所有槽,分别对四槽各跑一次。 | | **all-to- c_4 @32** | 将 32 次 rollout 全部投入控制槽 c_4 (半预算单槽)。 | | **all-to- c_4 @64** | 将 64 次 rollout 全部投入控制槽 c_4 (全预算单槽)。 | —- ### 3. 主实验一:完整方法是否优于基线(主比较) **目的**:检验在 iso-budget 下,四槽结构化坐标上升是否能打败 stock harness 与扁平单字符串进化。 **结果(ALFWorld, B=64, n=134 )**: - Stock: 0.642 - GEPA-flat: 0.642 ( Delta=0.000 ,McNemar p=0.617 ,ns) - HARNESSEVO-full: 0.657 (vs Stock Delta=+0.015 , p=0.617 ,ns;vs GEPA-flat Delta=+0.015 , p=0.480 ,ns) 三者统计上无法区分,呈现**三向平局**。若仅看此表,会得出“结构化进化无效”的结论。 **结果(WebShop, n=80 )**: - Stock: 0.518 - GEPA-flat: 0.539 (ns) - HARNESSEVO-full: 0.545 (vs Stock Delta=+0.027 ,paired-bootstrap p=0.054 ,ns) 同样无显著差异,且所有槽冻结为空。 —- ### 4. 主实验二:逐槽信用分配图(LOI / LOO) **目的**:定位 harness 优化价值究竟 resides in 哪个组件。 **ALFWorld LOI 结果( B=64 , 每槽 16 rollouts,但 LOI 单槽实际使用 32)**: | 槽位 | Delta(LOI) vs Stock | McNemar p | |:—-|:—-|:—-| | c1 role/persona | +0.030 | 0.221 ns | | c_2 task-strategy | +0.007 | 1.000 ns | | c_3 tool/format-rules | +0.007 | 1.000 ns | | c_4 reflection/control | +0.119 | 0.0046 ** | **结论**:价值**完全局部化**于控制槽 c_4 ;其余三槽单独进化均无显著增益。 **ALFWorld LOO 结果**: - 从完整 harness 中移除任意一槽,变化均不显著( Delta(LOO) 在 -0.067 到 -0.007 之间,全部 ns)。 - 这与 LOI 一致:因为全方法在四等分预算下几乎所有槽冻结为空,故移除也无损失。 **子可加性量化**:

rho(H(full)) - rho(H_0) = +0.015 ll ∑_k Delta(LOI)^k = +0.164
完整方法仅捕获了约十分之一的单槽潜在增益。 —- ### 5. 主实验三:预算分配与预算分割陷阱 **目的**:验证“预算均匀分割导致每槽低于优化器 accept-and-rescore floor”这一机制性假说,并检验集中预算能否恢复被丢弃的增益。 **ALFWorld 预算分配结果**: | 配置 | 预算 | 成功率 | Delta vs Stock | McNemar p | |:—-|:—-|:—-|:—-|:—-| | 4-way split | 64 (16/槽) | 0.657 | +0.015 | ns | | all-to- c4 @32 | 32 | 0.761 | +0.119 | 0.0046 ** | | all-to- c_4 @64 | 64 | 0.724 | +0.082 | 0.0725 ns(边缘) | - **四等分陷阱**:每槽 16 rollouts 恰好处于或低于 GEPA 的 accept-and-rescore floor(约 16),导致**零槽接受突变**,所有槽冻结为空(表 5)。 - **半预算集中**:仅 32 rollouts 全投 c_4 ,成功率反而最高( 0.761 ),证明**预算去向比总量更重要**。 - **全预算集中**: 0.724 方向稳健(显著优于四等分),但统计上仅边缘显著;论文诚实地并列报告,不夸大。 **accept-and-rescore floor 诊断**(表 5): | 每槽预算 | 实验臂 | 接受突变的槽数 | 冻结非空文本的槽数 | |:—-|:—-|:—-:|:—-:| | 16 | B64 四等分 | 0 | 0 | | 32 | B64 单槽 LOI | 3 | 1 | | 30 | B120 四等分 | 3 | 1 | | 60 | B120 单槽 LOI | 4 | 4 | —- ### 6. 主实验四:跨基准任务依赖性(WebShop 验证) **目的**:区分 WebShop 的 null 结果是“预算饥饿”还是“任务本身无控制失败可修”。 **设计**:在 WebShop 上运行 all-to- c_4 @64,将全预算集中于控制槽。 **结果**: - all-to- c_4 @64: 0.535 vs Stock 0.518 ( Delta=+0.017 ,paired-bootstrap p=0.36 ,ns)。 - 控制槽仍**冻结为空**(0 字符)。 **结论**:即使预算充足且无分割,优化器也找不到可接受的控制规则。WebShop 的网购任务缺乏反复出现、可被语言化的控制失败(如循环死胡同、前置条件缺失),因此 harness 优化 correctly abstains。 —- ### 7. 辅助实验:任务级分解与文本审计 **目的**:检验控制槽 c_4 的增益是否与其规则内容在机制上对应。 **ALFWorld 按任务类型分解**(控制槽 LOI @32): - **look_at_obj_in_light**: Delta = +0.444 ( n=18 )——最大增益;该类型易过早放弃,控制规则直接要求“达成目标前不停止”。 - **clean_then_place**: Delta = +0.226 ( n=31 )——多步骤、需先打开容器,与“open before taking”直接对应。 - **heat_then_place**: Delta = +0.087 ( n=23 )。 - **pick_and_place**: Delta = +0.042 ( n=24 )。 - **cool_then_place**: Delta = -0.048 ( n=21 )。 - **pick_two_obj_and_place**: Delta = -0.059 ( n=17 )——规则偶尔过火。 22 个净胜任务中,一半集中于 closed-receptacle / 多步骤类型,与审计出的控制文本内容一致。 **审计文本**(B=32 控制槽冻结文本,401 字符): > *think: Before performing any action, ensure the previous step succeeded. if action returned “Nothing happens” and is identical to the last action, skip it and try another location. open any closed receptacle before taking from it. confirm the object is held before attempting to place it. stop the sequence once the task is completed successfully or all relevant locations are checked without success.* —- ### 8. 统计检验规范 所有实验报告: - 10,000 次重采样的 bootstrap 95% 置信区间; - 成对 McNemar 检验(ALFWorld 二元指标)或成对 bootstrap(WebShop 稠密指标); - 非显著结果明确标注 “ns”; - 每列真实最优值加粗,即使其为基线(遵循“诚实规则”)。 —- 综上,论文的实验设计从**系统比较**、**组件归因**、**机制诊断**、**预算处方**到**跨基准边界验证**形成完整链条,核心发现并非来自于单一性能数字,而是来自于对“为何打平”与“价值在何处”的结构性解剖。 Q5: 有什么可以进一步探索的点? 基于论文的核心发现与自陈局限,以下从**直接延伸**、**方法扩展**与**理论深化**三个层面,梳理可进一步探索的研究方向。 —- ### 一、直接延伸(论文明确提出的未来工作) 1. **主干模型规模扩展(Backbone Scaling)** 全部实验基于单一冻结的 Qwen2.5-7B。一个关键未解问题是:控制槽( c_4 )的价值局部化现象在更大参数量模型(如 32B、70B 乃至 GPT-4 级别)上是否依然成立?随着模型规模增长,其内化的角色扮演、格式遵循与策略分解能力可能增强,从而进一步压缩 c_1 – c_3 的边际价值;但另一方面,大模型的控制失败模式可能更隐蔽,需要更精细的 c_4 规则,甚至可能产生价值向其他槽迁移的情况。该方向是论文明确标记为“最自然的下一步研究”。 2. **自动化槽信用估计器(Automatic Slot-Credit Estimator)** 当前处方是先运行一次廉价的单槽 LOI 探针以定位高信用槽,再集中预算。可探索**单 pass 预算分配器**:在总预算 B 内,先用极少 rollouts(如每槽 4–8 次)快速估计各槽的预期边际增益 Delta(LOI)^k ,随后按估计比例分配剩余预算,而非人工指定“全投 c4 ”。这涉及探索-利用权衡的小预算最优分配问题。 3. **任务控制失败轮廓分类法(Task Control-Failure Taxonomy)** 论文发现 harness 优化仅在存在“反复出现、可被语言化的控制失败”时有效。未来可建立**先验预测框架**:通过分析环境的动作空间、奖励稀疏性、状态转移结构或少量预跑轨迹,自动判定某任务是否属于“控制失败丰富型”(如 ALFWorld)或“策略匹配型”(如 WebShop),从而在投入优化预算前预测 harness 优化的期望收益。 —- ### 二、方法扩展(超越当前实验设计) 4. **不同分解粒度与槽分类法** 本文采用四槽分解(角色/策略/格式/控制),但 slot 的粒度与语义边界是人为设定的。可探索: - **更细粒度**:例如将控制槽拆分为“前置条件检查”“循环检测”“终止条件”等子槽,检验价值是否进一步局部化到子组件; - **动态分类**:利用聚类或自动提示工程,从数据中发现最优的槽划分,而非预设固定分类; - **不同渲染顺序**:验证槽的拼接顺序是否影响信用分配结果。 5. **联合优化与坐标上升的对比** 当前使用坐标上升(sequential、冻结前置槽),天然引入预算分割陷阱。可对比: - **联合进化**:同时变异多个槽,但保留可解释的归因标签; - **迭代式冻结-解冻**:类似模拟退火,允许已冻结槽在后续阶段被重新扰动; - **层次化预算**:外层循环分配跨槽预算,内层循环优化槽内文本,形成双层优化。 6. **替代优化器与预算地板的普适性** 本文的预算分割陷阱根植于 GEPA 的 accept-and-rescore floor。需检验: - 其他优化器(如 OPRO、Promptbreeder、基于梯度的软提示方法)是否在不同 floor 机制下表现类似; - 若优化器为“无接受门槛”的纯评分选择(如 APE 式的生成-排序),均匀预算分割是否仍具破坏性; - 设计**地板感知预算分配器**:将优化器的最小工作预算作为约束纳入调度。 7. **动态 harness 与在线适应** 当前 harness 在验证集上离线进化后固定。可探索: - **测试时 harness 自适应**:Agent 在 episode 中根据实时轨迹动态加载或切换控制规则; - **上下文级 harness 检索**:将进化出的控制规则存入记忆库,按当前任务类型检索最相关的规则子集,而非注入完整 c_4 文本。 —- ### 三、理论深化与边界拓展 8. **多槽交互效应:互补、替代与冗余** 本文发现强子可加性(full gain ll sum of LOI gains),但未深入分析槽之间的交互结构。可系统研究: - 是否存在**互补性**(如 c_2 策略与 c_4 控制协同才能生效,单独均无效); - 是否存在**冗余**(如 c_1 角色与 c_2 策略内容重叠); - 利用**夏普利值(Shapley values)**或**多因子方差分析**量化交互项,超越简单的 LOI/LOO 二元框架。 9. **跨任务控制规则迁移** ALFWorld 上进化出的控制规则(“open before taking”“skip repeated Nothing happens”)具有家务任务共性。可验证: - 这些规则是否可**零样本迁移**到同类 TextWorld 环境(如 Jericho、BabyAI Text); - 是否存在**通用控制原语**(如“验证动作效果”“避免重复状态”)可跨领域复用,从而减少每任务优化成本。 10. **与权重更新方法的正交结合** 本文坚持冻结权重。未来可探索 harness 优化与轻量参数更新的协同: - 将高信用槽的文本蒸馏为软提示或 LoRA 适配器,降低推理时 prompt 长度; - 比较“冻结模型 + 优化 c_4 ”与“全量微调/RL”在样本效率与泛化上的帕累托前沿。 11. **安全性与过度优化的长期监测** 本文初步观察到优化器在 WebShop 上 correctly abstains,但未建立系统诊断工具。未来需: - 在更复杂的稀疏奖励环境中(如 WebArena、GAIA),监测控制规则是否随时间退化为奖励黑客; - 引入**形式化验证**或**对抗性轨迹检查**,确保控制规则始终绑定于环境落地的真实约束,而非统计巧合。 12. **更大规模与多样化的交互基准** 仅有两个基准且样本量有限( n=134 与 n=80 )。需在以下环境复现: - 长程网页交互(WebArena、VisualWebArena); - 代码生成与软件工程(SWE-bench); - 多模态具身环境(具身 AI 的 visual-language 任务),检验控制失败是否仍主要集中于 c_4 类循环纪律问题。 Q6: 总结一下论文的主要内容 这篇论文围绕冻结式大型语言模型(LLM)Agent的 **harness(文本脚手架)优化** 展开,核心目标是回答:**优化产生的价值究竟存在于 harness 的哪个具体组件?** 现有方法通常将 harness 视为一个扁平字符串整体优化,虽能提升性能,却无法定位价值来源,也无法指导预算应如何分配。论文通过构建一个结构化显微镜框架 **HARNESSEVO**,系统性地解决了这一问题。 —- ### 1. 研究问题与动机 将冻结 LLM 转化为更强 Agent 的主流路径是优化其 harness——即注入在模型周围的系统提示、角色设定、任务策略、格式规则与控制启发式。然而,现有工作(如反射式提示进化 GEPA)普遍将 harness 作为**单一无差别字符串**进行变异与选择。这种做法导致一个根本盲区:当优化有效时,无法知晓是 persona、strategy、format 还是 control 在起作用;当优化无效时,也无法判断是价值不存在,还是预算分配失当。 —- ### 2. 方法:HARNESSEVO 与四槽分解 论文提出 **HARNESSEVO**,将 harness 显式分解为四个语义互斥、可独立进化的槽(slot),按固定顺序渲染为单一注入字符串: - c_1 :**role / persona**(角色与人格) - c_2 :**task-strategy**(任务分解策略) - c_3 :**tool / format-rules**(动作模板与格式规则) - c_4 :**reflection / control-heuristics**(循环纪律与自我纠正规则) 在严格的 **iso-budget**(等预算)约束下,论文使用坐标上升逐槽进化,每次仅优化一个槽,其余槽保持冻结或空种子。为定位价值,设计了两种消融探针: - **Leave-One-In (LOI)**:仅进化单槽 c_k ,测量其相对空种子 stock harness 的边际增益 Delta(LOI)^k = rho(LOIk) - rho(H_0) ; - **Leave-One-Out (LOO)**:进化除 c_k 外所有槽,测量从完整 harness 中移除该槽的损失 Delta(LOO)^k = rho(LOOk) - rho(H(full)) 。 —- ### 3. 核心发现:价值局部化于控制槽 在 **ALFWorld**(家务任务, n=134 测试集,冻结 Qwen2.5-7B)上的实验揭示出强烈的不对称性: - **LOI 信用图**显示,价值几乎**完全局部化**于 c_4 (reflection/control): - c_4 单独进化: Delta = +0.119 ( p = 0.0046 ,**显著**); - c_1, c_2, c_3 单独进化: Delta 分别为 +0.030, +0.007, +0.007 ,均不显著。 - 然而,**完整四槽方法** HARNESSEVO-full 的成功率为 0.657 ,与 stock( 0.642 )和扁平单字符串进化 GEPA-flat( 0.642 )**统计无差异**(三向平局)。 这意味着:**价值并非不存在,而是被预算分配方式埋没了。** —- ### 4. 机制诊断:预算分割陷阱(Budget-Splitting Trap) 论文识别出结构化方法失败的根本原因——**子可加性(sub-additivity)**:

rho(H(full)) - rho(H_0) = +0.015 ll ∑_k Delta(LOI)^k = +0.164
完整方法仅捕获了约十分之一的单槽潜在增益。其机制在于反射式优化器 GEPA 存在一个 **accept-and-rescore floor**:每次接受突变需要消耗约 2 × |minibatch| + |validation| 个 rollouts 进行父代/子代对比与验证集重评分。当 iso-budget B=64 被**四等分**为每槽 16 次 rollout 时,该数值恰好处于或低于工作门槛,导致**零槽完成有效接受**,所有槽冻结为空种子。论文将这一现象命名为 **预算分割陷阱**。 —- ### 5. 预算处方:集中优于均分 验证预算集中可恢复被丢弃的增益: | 配置 | 预算 | 成功率 | vs Stock | 显著性 | |:—-|:—-|:—-|:—-|:—-| | 4-way split | 64 (16/槽) | 0.657 | +0.015 | ns | | all-to- c_4 @32 | 32 | **0.761** | **+0.119** | p=0.0046 ** | | all-to- c_4 @64 | 64 | 0.724 | +0.082 | p=0.0725 (边缘) | 关键启示:**预算去向比预算总量更重要**。半预算(32)集中投入控制槽的效果,远胜全预算(64)的四等分。论文据此提出实用处方:先用廉价 LOI 探针定位高信用槽,再将预算集中投入该槽,而非均匀分散。 —- ### 6. 任务依赖性边界:WebShop 的 genuine null 为检验现象是否普适,论文在 **WebShop**(网购任务, n=80 )上重复实验: - 四等分预算下所有槽冻结为空,方法无增益(0.545 vs stock 0.518,ns); - **关键检验**:将全预算 64 集中投入 c_4 ,控制槽依然冻结为空,结果仍无差异(0.535,ns)。 这排除了“预算饥饿”假说,证明 WebShop 的 null 是**任务本身的 genuine 属性**:其稠密属性匹配奖励机制下,不存在可被通用启发式修复的反复控制失败(如循环死胡同、前置条件缺失)。由此确立 harness 优化的有效边界:**仅在任务具有反复出现、可被语言化的控制失败时,优化控制槽才能捕获价值。** —- ### 7. 优化内容的本质:环境落地的自我纠正 对冻结文本的审计显示,ALFWorld 上进化出的 c_4 规则为: > “若动作返回 ‘Nothing happens’ 且与上次相同,则跳过;拿取前打开关闭的容器;放置前确认已持有物体;目标达成后停止。” 这些内容属于**环境落地的自我纠正(environment-grounded self-correction)**,而非利用二元成功检查器的奖励黑客策略。其增益集中在多步骤、易循环失败的子任务类型(如 look_at_obj_in_light、clean_then_place)。在奖励更易博弈的 WebShop 上,优化器选择 correctly abstain(正确弃权),这一行为是期望中的安全信号。 —- ### 8. 结论与贡献 论文作出四项贡献: 1. **信用分配协议**:首次通过结构化分解与 LOI/LOO 协议,将 harness 优化价值定位到具体组件(ALFWorld 上为 c_4 )。 2. **预算分割陷阱的识别**:揭示 iso-budget 下坐标上升的子可加性失效机制——均匀分割使每槽预算低于优化器工作门槛。 3. **预算分配处方**:证明集中预算于高信用槽可恢复被丢弃的增益(+0.119 显著)。 4. **任务依赖性边界**:通过 WebShop 的 genuine null,明确 harness 优化仅在存在反复、可语言化控制失败的任务上有效。 最终结论:**在进行任何结构化 Agent 进化之前,应先执行信用分配以定位高价值组件,再集中预算于该组件;均匀预算分割不仅浪费资源,而且可能主动有害。** Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Michael Nguyen, Wei Chen Tan, Nurul Aisyah Hassan, Arvind Raman, Li Hua Lim, Ahmad Faiz Razak

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02889.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02889

Published: 2026-09-06T01:19:49.635Z


2. Bounded Personas Match Retrieval on Classification but Not Regression for a Frozen Agent

Abstract:A personalized language agent must convert a user’s interaction history into behavior on each new request at inference time. Two strategies dominate. Retrieval pulls a few of the user’s most relevant past items into the prompt, which is accurate but pays a per-query selection and context cost that grows with the history. Distillation instead compresses the history once into a compact natural-language persona, which is bounded, query-independent, and interpretable, but is widely assumed to sacrifice accuracy. Whether, and on which tasks, a distilled persona can match retrieval has not been characterized cleanly. We introduce PersonaLink, a training-free method that distills a user’s history into a bounded three-field persona and recursively refines it: each pass self-evaluates the frozen agent on a held-out slice of the user’s own labeled history, rewrites the persona from its errors, and keeps the result only when it does not regress on that slice. Because every comparison shares one frozen 7B backbone and differs only in what is placed in context, the design isolates the effect of representation from that of the model. The result is a clear task-type asymmetry. On 200 users of LaMP-2 (15-way news categorization), PersonaLink reaches 0.745-0.755 accuracy, statistically indistinguishable from BM25 retrieval (0.760-0.765).

中文摘要

摘要:个性化语言代理必须在推理时将用户的交互历史转换为每个新请求的行为。有两种主导策略。检索策略会将用户最相关的一些历史项目拉入提示中,这很准确,但对每次查询都要付出选择和上下文成本,并且成本会随着历史增长而增加。蒸馏策略则将历史压缩为紧凑的自然语言人格,这种方式是有限的、与查询无关且可解释的,但普遍认为会牺牲准确性。蒸馏人格是否能够匹配检索,以及在何种任务上能匹配,还没有被清晰地定义。我们提出了PersonaLink,一种无需训练的方法,它将用户历史蒸馏为有限的三字段人格并递归改进:每一轮都会在用户自己的标注历史的保留部分上对冻结代理进行自我评估,从其错误中重写人格,并且仅在该保留部分没有退化时才保留结果。由于每次比较都使用相同的冻结7B主干模型,只在上下文中放置不同内容,这一设计将表示效果与模型效果区分开来。结果显示出明显的任务类型不对称。在LaMP-2的200名用户(15类新闻分类)上,PersonaLink达到0.745-0.755的准确率,与BM25检索(0.760-0.765)在统计上没有显著差异。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02890 (HTTP 429)

Authors: JaeHa Yoon, Minjun Park, Seoyeon Kim, Jiwoo Lee, Hyunwoo Choi, Dohyun Kang

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02890.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02890

Published: 2026-09-06T01:19:49.635Z


3. Counterexamples as Feedback for Agent Self-Correction

Abstract:Single-turn code-generation metrics understate a central property of deployed agents: whether they can repair a wrong artifact after receiving concrete feedback. This paper presents A-CEGIS, a lightweight framework that uses counterexamples as feedback for evaluating multi-turn refinement in natural-language-to-regex synthesis. An agent proposes a regex, a deterministic oracle checks it under full-match semantics, and compact false-positive or false-negative witnesses guide the next turn. On 30 NL-RX-Turk tasks, diagnostic counterexample feedback solves 90\% of tasks within a four-turn ablation budget, compared with 17% for zero-shot generation, 27% for generic self-correction, and 23% for error-only feedback. In a full diagnostic run with hardening, all tasks are solved on the hidden set by the final turn, with mean time-to-success of 2.7 turns and robust success of 77% after targeted probing. These results show that A-CEGIS measures how efficiently an agent improves across turns while adding a practical robustness check beyond the original held-out cases.

中文摘要

摘要:单轮代码生成指标低估了部署代理的一个核心特性:在收到具体反馈后是否能够修复错误的产物。本文提出了 A-CEGIS,这是一种轻量级框架,使用反例作为反馈来评估自然语言到正则表达式合成中的多轮优化。代理提出一个正则表达式,确定性判定器在全匹配语义下进行检查,并由简明的假阳性或假阴性证据引导下一轮。在 30 个 NL-RX-Turk 任务中,诊断反例反馈在四轮消融预算内解决了 90% 的任务,而零样本生成、通用自我修正和仅错误反馈分别解决了 17%、27% 和 23% 的任务。在完整的诊断运行和加固过程中,最终轮在隐藏集上解决了所有任务,平均成功所需轮次为 2.7 轮,在针对性探测后实现了 77% 的稳健成功率。这些结果表明,A-CEGIS 能够衡量代理在多轮改进中的效率,同时为原始保留案例之外提供了实用的鲁棒性检验。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02892 (HTTP 429)

Authors: Sidhesh Badrinarayan, Adithya Parthasarathy

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02892.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02892

Published: 2026-09-06T01:19:49.635Z


4. Probe Generalization as Subspace Selection for OOD Deception Detection

Abstract:Linear probes can be used to detect behaviors and concepts inside language model activations, but may fail to transfer to out-of-distribution examples. When studying the generalization performance of Llama-3.1-8B-Instruct probes over 3 held-out deception detection datasets, we find that projecting inputs onto a small subset of principal components (PCs) from the training distribution of activations enables cross-domain transfer that nearly matches the performance of probes trained directly on the test distribution. Furthermore, we find that PC interpretations can be used to find a subset of those transferable PCs. By using an LLM judge to score each PC on whether its most/ least activating examples imply a transferable deception direction, then probing on the highest-scoring PCs, we close the baseline-to-oracle gap by 78% on Insider Trading Report and by 25% on Sandbagging. The directions a source probe weights heavily appear to encode source-specific surface features, while the directions that actually transfer appear to encode the same contrast more abstractly, in a way natural language descriptions can capture. Broadly, our results suggest that the OOD robustness of probes is largely determined by subspace selection.

中文摘要

摘要:线性探针可以用于检测语言模型激活中的行为和概念,但可能无法很好地迁移到分布外(OOD)的示例。当研究 Llama-3.1-8B-Instruct 探针在 3 个未使用的欺骗检测数据集上的泛化性能时,我们发现,将输入投射到训练分布激活的一小部分主成分(PCs)上,可以实现跨领域迁移,其性能几乎与在测试分布上直接训练的探针相当。此外,我们发现 PC 解释可以用于找到这部分可迁移 PCs 的子集。通过使用大型语言模型(LLM)评估每个 PC,其最强/最弱激活的示例是否暗示可迁移的欺骗方向,然后在得分最高的 PCs 上进行探测,我们在 Insider Trading Report 上将基线到最优的差距缩小了 78%,在 Sandbagging 上缩小了 25%。源探针权重大方向似乎编码了源特定的表面特征,而实际可迁移的方向则以更抽象的方式编码相同的对比,这种方式可以通过自然语言描述捕捉。总体而言,我们的结果表明,探针的 OOD 鲁棒性在很大程度上取决于子空间选择。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02893 (HTTP 429)

Authors: Daniel Yoo, Adrians Skapars

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02893.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02893

Published: 2026-09-06T01:19:49.635Z


5. R$^{2}$Adapter: A Routing and Rewriting Adapter for Efficient Hybrid RAG

Abstract:Retrieval-Augmented Generation (RAG) has become a prevailing paradigm for enhancing Large Language Models (LLMs) with non-parametric knowledge. Vanilla RAG efficiently handles simple queries but struggles with relational or multi-hop reasoning. Graph-based RAG alleviates this issue but incurs higher inference complexity and latency. In practice, user queries can differ significantly in their complexity, rendering a fixed RAG strategy suboptimal. However, existing hybrid text-graph RAG methods typically rely on heuristic and LLM-based routing, resulting in unnecessary overhead and strong dependence on the underlying LLM. To address these challenges, we propose R$^{2}$Adapter, a lightweight plug-in Routing and Rewriting Adapter designed to allocate queries between vanilla and graph-based RAG dynamically. By routing only the queries that genuinely benefit from graph-based reasoning, R$^{2}$Adapter reduces unnecessary graph retrieval overhead. Additionally, uncertain graph-routed queries are rewritten to better expose their multi-hop reasoning requirements, improving retrieval quality without additional supervision. Extensive experiments on three multi-hop QA benchmarks demonstrate that R$^{2}$Adapter reduces graph-based RAG usage by up to 59% while maintaining comparable answer accuracy. This adapter is model-agnostic and can be seamlessly integrated into diverse vanilla and graph-based RAG pipelines, providing an efficient and adaptive solution for hybrid RAG systems.

中文摘要

摘要:检索增强生成(RAG)已成为增强大型语言模型(LLMs)非参数知识的主要范式。普通 RAG 能够高效处理简单查询,但在关系型或多跳推理方面表现不佳。基于图的 RAG 可以缓解这一问题,但会带来更高的推理复杂度和延迟。在实践中,用户查询的复杂性可能差异很大,使得固定的 RAG 策略并非最优。然而,现有的混合文本-图 RAG 方法通常依赖启发式和基于 LLM 的路由,导致不必要的开销并对底层 LLM 具有较强依赖性。为了解决这些挑战,我们提出了 R$^{2}$Adapter,一种轻量级的插入式路由与重写适配器,旨在动态分配普通 RAG 与基于图的 RAG 查询。通过仅对真正能从图推理中受益的查询进行路由,R$^{2}$Adapter 减少了不必要的图检索开销。此外,对于不确定的图路由查询,R$^{2}$Adapter 会对其进行重写,以更好地展现其多跳推理需求,从而在无需额外监督的情况下提高检索质量。在三个多跳问答基准上的大量实验表明,R$^{2}$Adapter 在保持相似答案准确率的同时,可将基于图的 RAG 使用量减少多达 59%。该适配器与模型无关,可无缝集成到多种普通与基于图的 RAG 流水线中,为混合 RAG 系统提供高效且自适应的解决方案。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02894 (HTTP 429)

Authors: Yucan Guo, Miao Su, Saiping Guan, Long Bai, Zhongni Hou, Zixuan Li, Xiaolong Jin, Jiafeng Guo, Xueqi Cheng

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02894.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02894

Published: 2026-09-06T01:19:49.635Z


6. BharatGather: A Culturally-Informed Benchmark Dataset for Misinformation and Fake News Detection in Indian Public Events

Abstract:Large-scale public events, such as religious festivals, political rallies, and cultural gatherings, are increasingly vulnerable to the rapid dissemination of misinformation, posing substantial risks to public safety and social cohesion. While automated fake news detection has seen significant methodological progress, existing benchmarks frequently fail to capture the socio-cultural nuances and event-specific dynamics characteristic of the Indian context. This paper introduces BharatGather, a curated, multi-source dataset specifically engineered for binary misinformation classification within the ecosystem of Indian mass gatherings. The corpus comprises 14,646 records constructed through a hybrid pipeline involving systematic web scraping of prominent fact-checking platforms, multimedia transcript extraction, and Large Language Model (LLM)-mediated synthetic augmentation to ensure narrative diversity. By providing a resource tailored to the unique complexities of event-aware misinformation in India, this work facilitates the development of culturally informed detection systems and establishes a rigorous benchmark for evaluating their performance in high-stakes public environments.

中文摘要

摘要:大规模公共活动,如宗教节日、政治集会和文化聚会,越来越容易受到错误信息快速传播的影响,对公共安全和社会凝聚力构成重大风险。尽管自动化假新闻检测在方法上取得了显著进展,但现有基准往往未能捕捉印度背景下的社会文化细微差别和事件特定动态。本文提出了BharatGather,这是一个精心策划的多源数据集,专门用于印度大型集会生态系统中的二元错误信息分类。该语料库包含14,646条记录,通过结合系统性网页抓取主要事实核查平台、多媒体文本提取以及大语言模型(LLM)媒介的合成增强的混合流程构建,以确保叙事的多样性。通过提供针对印度事件感知错误信息独特复杂性的资源,本研究有助于开发文化知情的检测系统,并为在高风险公共环境中评估其性能建立了严格的基准。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02895 (HTTP 429)

Authors: Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale, Adwait Borate, Raviraj Joshi

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02895.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02895

Published: 2026-09-06T01:19:49.635Z


7. PiPMRE: A Pipeline Based on Language Model for Medical Relation Extraction

Abstract:Medical relation extraction (MRE) is commonly known for extracting entities and their relations jointly from a medical text, which has attracted considerable attention in recent years. Previous studies treat MRE as a sequence tagging task, which results in either a challenging design of the tagging schema or a failed extraction of multiple relations, due to intricate relationships among medical entities. In this work, we review the task from the linguistic perspective and propose a novel pipeline framework, PiPMRE, developed on language models to enhance MRE performance. Specifically, PiPMRE consists of a relation generator and a relation filter. Given a text, the generator first yields multiple relational triplets, and then the filter scores each triplet and retains only those that pass the borderline as the final results. Implementing PiPMRE requires no tagging schema; instead, we use a simple template to reformulate the input text, ensuring that entities and relations are generated in a contextual order. Extensive experimental results on two public datasets demonstrate the advancement of PiPMRE. It surpasses the previous state-of-the-art by an average of 5.6 recall points and 4.4 accuracy points. PiPMRE’s superiority is also demonstrated in few-shot settings.

中文摘要

摘要:医疗关系提取(MRE)通常指从医疗文本中联合提取实体及其关系,近年来引起了广泛关注。以往的研究将MRE视为序列标注任务,由于医疗实体之间关系复杂,这导致标注方案设计困难或多重关系提取失败。在本工作中,我们从语言学角度回顾了该任务,并提出了一种新颖的流水线框架PiPMRE,该框架基于语言模型以提升MRE性能。具体而言,PiPMRE由关系生成器和关系过滤器组成。给定文本时,生成器首先生成多个关系三元组,然后过滤器对每个三元组进行评分,仅保留通过阈值的三元组作为最终结果。实施PiPMRE无需标注方案;相反,我们使用一个简单的模板来重新构造输入文本,以确保实体和关系按上下文顺序生成。在两个公开数据集上的大量实验结果表明了PiPMRE的进展。其在召回率上平均提升5.6个百分点,精确率提升4.4个百分点,超过了之前的最先进水平。PiPMRE在少量样本设置下的优越性也得到了验证。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02896 (HTTP 429)

Authors: Jiaxin Duan, Fengyu Lu, Junfei Liu

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02896.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02896

Published: 2026-09-06T01:19:49.635Z


8. Margins, Not Windows: Training-Free Per-Step Lossy Speculative Decoding

Abstract:Speculative decoding accelerates LLM inference by drafting candidate tokens and verifying them in parallel. Tree-attention drafters such as EAGLE-3 are widely adopted, yet typically hold two decisions fixed: (1) a strict token-match verification rule and (2) a static draft-tree shape. Prior work relaxes each in isolation under limiting assumptions: long draft chains for training-free lossy verification, and adaptive tree shaping under a fixed token budget. We introduce AdaptiveSpec, a training-free per-step speculative decoding method that adapts both decisions from internal signals already produced during decoding. A per-step margin rule promotes a mismatched draft-proposed token when the ratio of the target’s probability on the drafted token to its top-1 probability exceeds a threshold with no dependence on draft length or underlying drafter architecture. A per-step tree policy adjusts the draft tree’s depth, width, and node count directly from a fused signal of draft top-1 confidence and a rolling acceptance history capturing recent draft-target agreement, allowing the total draft count to vary rather than only be redistributed. The two adaptations operate on orthogonal axes and compound in effect. Implemented on the SGLang production-grade serving engine, AdaptiveSpec improves throughput over the state-of-the-art autoregressive speculative decoding method EAGLE-3 by up to 56%, recovering 93% to fully lossless task accuracy across GSM8K, MATH-500, and HumanEval on three target models (DeepSeek-R1-Distill-Llama-8B, Llama-3.1-8B-Instruct, Qwen3-8B).

中文摘要

摘要:投机性解码通过并行生成候选标记并验证它们来加速大型语言模型(LLM)的推理流程。诸如 EAGLE-3 的树形注意力草稿器被广泛采用,但通常保持两个决策不变:(1) 严格的标记匹配验证规则,(2) 静态的草稿树形结构。以往的研究在有限假设下分别放宽了这两个条件:用于无训练的有损验证的长草稿链,以及在固定标记预算下的自适应树形调整。我们提出了 AdaptiveSpec,一种无训练的逐步投机性解码方法,可以根据解码过程中已产生的内部信号自适应调整这两个决策。逐步边际规则在目标标记在草稿标记上的概率与其 top-1 概率的比值超过阈值时,促进不匹配的草稿提议标记,而不依赖于草稿长度或底层草稿器架构。逐步树策略根据草稿 top-1 置信度和捕获最近草稿-目标一致性的滚动接受历史的融合信号,直接调整草稿树的深度、宽度和节点数,从而允许总草稿数变化,而不仅仅是重新分配。这两种自适应在正交轴上操作并产生叠加效果。在 SGLang 生产级服务引擎上实现后,AdaptiveSpec 在吞吐量上比最先进的自回归投机性解码方法 EAGLE-3 提高了最多 56%,并在三个目标模型(DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct、Qwen3-8B)上的 GSM8K、MATH-500 和 HumanEval 数据集上恢复了 93% 的完全无损任务准确率。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*推测解码(Speculative Decoding)中两个关键决策固定不变所导致的效率瓶颈\*\*问题。具体而言,现有方法通常将以下两个方面固定: - \*\*严格的Token匹配验证规则\*\*:仅当草稿token与目标模型输出完全一致时才接受,丢弃了大量语义等价但表面不同的候选,导致接受率不必要地降低。 - \*\*静态的草稿树形状\*\*:草稿树的深度、宽度及节点总数在部署时固定,无法适应不同解码步骤的难易变化,造成计算资源分配僵化。 现有工作在放宽上述限制时存在明显局限: - \*\*验证器层面\*\*:训练无关的方法(如FLy)依赖前向查找窗口(lookahead window)判断语义等价性,其假设前提是草稿链足够长(15–25个token)。然而,对于广泛采用的树注意力草稿器(如EAGLE-3),平均接受长度通常不足3个token,导致FLy的窗口规则难以适用,加速效果微弱甚至低于静态基线。 - \*\*草稿树形状层面\*\*:自适应方法(如TALON)虽能动态调整树形,但仅在\*\*固定的全局token预算\*\*内重新分配节点数(深度与宽度),无法直接根据步骤难度收缩或扩展总草稿计算量。 为此,论文提出 \*\*AdaptiveSpec\*\*,一个无需额外训练、仅利用解码过程中已有内部信号的逐步骤自适应推测解码框架,通过两个正交的自适应轴解决上述问题: - \*\*基于边界的损失验证(Margin-based Lossy Verification)\*\*:在首个不匹配位置,利用目标模型对该草稿token的概率与其自身top-1概率之比(即 margin(j) = p_(target)(draft_j) / p_(target)(top1_j) )作为判据。若比值超过阈值 kappa 即接受该token,无需前向窗口、不依赖草稿长度,且适用于任意草稿器。 - \*\*动态草稿树塑形(Dynamic Draft Tree-Shaping)\*\*:通过草稿置信度分数(Draft Confidence Score, DCS)——融合草稿模型top-1概率与滚动接受率——直接调整控制树形的三个超参数(深度 n_(steps) 、分支数top-k、验证预算 n_(dt) )。该策略允许总节点数在不同步骤间\*\*真正变化\*\*,而非仅在固定预算内重新分配。 两个轴分别作用于解码的“草稿”与“验证”阶段,效果可叠加。实验表明,AdaptiveSpec在SGLang生产级推理引擎上,相比当前最优的自回归推测解码方法EAGLE-3,吞吐量平均提升18–44%(最高达56%),同时保持93%至完全无损的下游任务准确率。 Q2: 有哪些相关研究? 根据论文第2节内容,相关研究可分为以下三个类别: ### 1. 推测解码(Speculative Decoding)基础 - \*\*Leviathan et al., 2023; Chen et al., 2023\*\*:提出经典的 draft-then-verify 范式,利用轻量级草稿模型并行提议候选 token,由目标模型一次性验证,以突破自回归解码的串行瓶颈。 - \*\*树形草稿器(Tree-shaped Drafters)\*\*:后续工作将线性草稿链扩展为树形结构,以暴露更多候选续写路径,从而提高期望接受长度。代表性工作包括 \*\*Miao et al., 2024\*\*(SpecInfer)、\*\*Cai et al., 2024\*\*(Medusa)、\*\*Ankner et al., 2024\*\*(Hydra)、\*\*Du et al., 2024\*\*(GLIDE)与 \*\*Xiao et al., 2024\*\*(ParallelSpec)。 - \*\*EAGLE-3 (Li et al., 2025)\*\*:当前最先进的自回归树注意力草稿器,本文将其作为基线草稿器。其解码步骤交替执行:(i) \*\*Draft\*\*:草稿模型执行 n_(steps) 次前向传播,每层按 top-k 分支并剪枝至验证预算 n_(dt) ;(ii) \*\*Verify\*\*:目标模型按自身分布接受提议 token。三元组 (n_(steps), top-k, n_(dt)) 同时控制树形与每步计算量。 ### 2. 自适应草稿树(Adaptive Draft Trees) - \*\*EAGLE-2 (Li et al., 2024)\*\*:在固定大小的树预算内对填充 token 进行重排序,而非改变树的整体形状。 - \*\*OPT-Tree (Wang et al., 2025a)\*\*:每步重新求解树拓扑,以在固定节点预算下最大化期望接受长度。 - \*\*Sequoia (Chen et al., 2024)\*\*:针对特定草稿-目标模型对及硬件配置,离线通过动态规划优化树结构。 - \*\*TALON (Liu et al., 2026)\*\*:与本文动态树塑形轴最接近的工作。它基于置信度门控规则在线调整树形:在根节点固定 top-K 初始化后,仅保留那些草稿概率与层内最置信 token 之比高于阈值 μ 的候选,并在固定全局 token 预算 n_(dt) 内生长树。其局限在于仅能在总预算内重新分配深度与宽度,无法直接调整总草稿计算量。 ### 3. 有损验证(Lossy Verification) - \*\*Judge Decoding (Bachmann et al., 2025)\*\* 与 \*\*SemanticSpec (Dong et al., 2026)\*\*:引入外部验证模块(如 judge 分类器或语义探针)来判断不匹配 token 是否语义等价,从而放宽严格的精确匹配规则。主要局限是需额外训练,迁移性受限。 - \*\*FLy (Li et al., 2026)\*\*:训练无关的有损验证方法。它在不匹配位置设置熵门控,并检查后续 W 个 token(通常 W=6 )的前向窗口内是否出现进一步不匹配;若无,则认定该 token 语义等价。该方法基于 LLM 在 conditioned on 错误 token 时倾向于后续自我纠正的假设(即 "erroneous token pattern")。然而,其前向窗口机制对草稿链较短的草稿器(如 EAGLE-3,其平均接受长度常低于 3)结构性不兼容,因为窗口长度可能超过整段被接受的草稿前缀。 - \*\*其他相关\*\*:\*\*Sun et al., 2025; Garipov et al., 2025; Wang et al., 2025b\*\* 亦探讨了放宽接受准则以提升吞吐量的方法。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*AdaptiveSpec\*\* 框架解决上述问题。该框架是一个\*\*无需训练(training-free)\*\*、\*\*逐步(per-step)自适应\*\*的推测解码系统,完全依赖解码循环内部已产生的信号驱动,从两个正交维度分别重新设计验证规则与草稿树构建策略,并通过复合效应叠加吞吐收益。 --- ### 1. 整体框架:双轴自适应 AdaptiveSpec 将 EAGLE-3 的单次解码步骤拆解为两个自适应轴: - \*\*验证轴(Verify Phase)\*\*:放宽严格的 token 精确匹配准则,允许在语义等价的不匹配位置接受草稿 token; - \*\*草稿轴(Draft Phase)\*\*:根据当前步骤的难度动态调整草稿树的三维超参数(深度、宽度、验证预算),使总草稿计算量能够真正伸缩,而非仅在固定预算内重新分配。 两轴作用于解码循环的不同子阶段,相互独立且增益可叠加。 --- ### 2. 验证轴:基于概率边界的损失验证(Margin-based Lossy Verification) 现有方法仅在草稿 token 与目标模型 top-1 输出完全一致时才接受。AdaptiveSpec 提出一种\*\*单位置、无窗、无训练\*\*的松弛规则: 在首个不匹配位置 j ,定义\*\*边界(margin)\*\*为目标模型对草稿 token 的归一化概率:

margin(j) = p(target)(draft_j)p(target)(top1_j) ∈ [0, 1]
当该比率满足 margin(j) ≥ kappa ( kappa 为可调阈值)时,直接接受该草稿 token,无需继续检查后续序列。其核心优势在于: - **与草稿长度脱钩**:不需要 FLy 式的前向查找窗口(lookahead window),因此适用于 EAGLE-3 这类平均接受长度较短(通常低于 3 个 token)的草稿器; - **与架构无关**:仅读取目标模型在验证阶段已计算的概率分布,无需外部分类器或语义探针; - **可调控**:通过阈值 kappa 在吞吐与准确率之间连续权衡。 —- ### 3. 草稿轴:动态草稿树塑形(Dynamic Draft Tree-Shaping) 固定树形无法适应不同解码步骤的不确定性差异。AdaptiveSpec 引入**草稿置信度分数(Draft Confidence Score, DCS)**直接驱动树形选择:

DCSt = p(draft)(top1t) · RAR_t
其中 p
(draft)(top1t) 为草稿模型当前步的 top-1 softmax 概率, RAR_t 为滚动接受率(指数移动平均, α=0.3 ),反映近期草稿与目标模型的一致性。该分数经除数 d 缩放饱和至 $
0,1
区间后,通过线性插值直接选择树形三元组: - 高置信度( DCS to 1 ):选择深而窄的树,如 (n
(steps), top-k, n(dt)) = (7, 1, 8) ,以最大化接受链长; - 低置信度( DCS to 0 ):选择浅而宽的树,如 (3, 4, 4) ,以覆盖更多候选分支。 关键设计要点: - 总计算量真正可变:候选范围 (3, 4, 4) arrow (7, 1, 8) 跨越不同的总节点数,因此系统在低置信度步骤上收缩草稿计算,而非仅在固定预算内重分配深度与宽度; - 断路机制:若连续五步接受量为零,则回退至默认配置,防止持续低效采样; - 生产兼容性:针对 SGLang 等依赖 CUDA Graph 的引擎,预先捕获所有可能树形对应的静态计算图,在运行时根据 DCS 即时切换,保持硬件加速效率。 —- ### 4. 整合:AdaptiveSpec 的协同效应 在每一步解码中,AdaptiveSpec 的执行流程如下: 1. 草稿阶段:依据 DCS_t 选择当前步的树形三元组 (n(steps), top-k, n_(dt)) ,构建对应草稿树; 2. 验证阶段:目标模型并行验证;在首个不匹配位置,利用 margin(j) 与阈值 kappa 决定是否松弛接受; 3. 提交与状态更新:接受前缀被提交, RAR_t 按实际接受比例滚动更新,供下一步 DCS 计算使用。 由于树塑形与边界验证分别作用于解码步骤的两个互不重叠的子阶段,二者的吞吐增益相互独立并产生复合效应。实验表明,相比静态 EAGLE-3 基线,动态树塑形单轴可带来显著加速,边界验证单轴可在极小精度损失下进一步提升接受长度,而双轴结合后实现最高 56% 的端到端吞吐提升。 Q4: 论文做了哪些实验? 论文在第4节进行了系统性的实验评估,涵盖主实验、消融分析、超参数搜索以及对现有方法局限性的诊断分析。具体实验内容如下: ### 1. 实验设置(§4.1) - 目标模型与草稿器:选用三个目标模型,均配备对应的 EAGLE-3 草稿模型: - Llama-3.1-8B-Instruct - DeepSeek-R1-Distill-Llama-8B - Qwen3-8B - 评估基准: - 数学推理:GSM8K、MATH-500 - 代码生成:HumanEval - 评价指标: - 吞吐量加速比(Speedup):相对于标准自回归解码 - 平均接受 token 长度(MAT, τ ) - 任务准确率恢复率(Rec.%):有损方法相对于无损 EAGLE-3 基线的准确率保留比例 - 基线方法: - EAGLE-3:静态无损推测解码(树形固定为 (3,1,4) ) - TALON:动态草稿树无损解码(在 SGLang 上重新实现) - FLy:基于前向窗口的有损解码(在 SGLang 上重新实现,针对 EAGLE-3 的平均接受长度将窗口调整为 w=3 ) - 环境配置:所有实验在单张 NVIDIA A100 上执行,batch size 为 1,使用贪婪解码(temperature = 0),基于 SGLang 推理引擎与 SpecForge 基准框架。 ### 2. 主实验对比(§4.2,表1) 在全部三个模型与三个基准的组合上,对比了六种配置: | 方法 | 说明 | |———|———| | EAGLE-3 | 静态无损基线 | | TALON | 动态树(固定预算重分配) | | AdaptiveSpec (Dynamic-only) | 仅启用动态树塑形 | | FLy | 基于前向窗口的有损验证 | | AdaptiveSpec (Lossy-only) | 仅启用边际规则有损验证 | | AdaptiveSpec (Combined) | 动态树 + 有损验证联合 | 关键发现: - AdaptiveSpec (Combined) 在全部 9 个(模型, 基准)单元格中均取得最高加速比,相比 EAGLE-3 提升 17%–56%。 - 平均来看,Combined 配置分别比 EAGLE-3 提升 +44%(Llama-3.1-8B)、+18%(Qwen3-8B)与 +38%(DeepSeek-R1-8B)。 - 任务准确率恢复率介于 91%–109% 之间,部分单元格(如 Llama-3.1-8B HumanEval)甚至超过无损基线。 ### 3. 消融实验(§4.3,表2) 采用 2×2 因子设计,系统分离两个自适应轴的独立贡献: | 草稿树 验证规则 | 严格(Strict) | 有损(Lossy) | |—————————|———————-|———————| | 静态(Static) | EAGLE-3 基线 | 静态树 + 边际规则 | | 动态(Dynamic) | 动态树 + 严格匹配 | AdaptiveSpec (Combined) | 结果: - 仅启用动态树塑形(Dynamic + Strict)即可将平均加速比从 1.82× 提升至 2.21× (+21.4%),且无精度损失。 - 仅启用有损验证(Static + Lossy)可将加速比提升至 2.20× (+20.9%),但伴随约 8% 的准确率成本。 - 两者联合(Dynamic + Lossy)达到 2.44× ,为所有配置中最高,且准确率恢复率提升至 98%。 ### 4. 超参数搜索(§4.3) #### (1) DCS 除数 d 搜索(表3) 在 AdaptiveSpec (Dynamic-only) 配置下,搜索 d ∈ 0.2, 0.3, 0.4, 0.5 。该参数控制 Draft Confidence Score 的饱和速度: - 较小的 d 使策略更快偏向深而窄的树形; - 较大的 d 使策略停留在浅而宽的树形。 实验表明 d=0.5 在绝大多数单元格中表现最优,故后续 Combined 实验固定此值。 #### (2) 边际阈值 kappa 搜索(表4) 分两组进行: - (a) Lossy-only:固定树形为 (7,1,8) ,搜索 kappa ∈ 0.05, 0.10, 0.20, 0.30 。 - (b) Combined:固定 d=0.5 ,在动态树范围 (3,4,4)arrow(7,1,8) 上搜索相同 kappa 集合。 搜索揭示了明确的吞吐-恢复权衡:较低的 kappa 提高吞吐量但降低准确率恢复,较高的 kappa 则相反。论文按各(模型, 基准)单元格的表现选取最优 kappa (详见附录表8)。 ### 5. FLy 验证器的结构限制诊断(§4.4,表5) 为论证所提边际规则取代 FLy 前向窗口的必要性,论文测量了静态 EAGLE-3 基线在各设置下的平均接受 token 长度 τ : | 模型 | GSM8K | MATH-500 | HumanEval | |———|———-|—————|—————-| | Llama-3.1-8B | 2.83 | 2.08 | 2.55 | | Qwen3-8B | 2.39 | 2.21 | 2.10 | | DeepSeek-R1-8B | 3.27 | 3.02 | 2.86 | 结果显示 τ 范围为 2.08–3.27,显著小于 FLy 原始设计的窗口长度 w=6 。该实验直接证明了 FLy 的前向窗口假设(要求窗口可容纳于典型接受前缀内)在 EAGLE-3 上结构性失效,从而支持 AdaptiveSpec 采用不依赖草稿长度的单位置边际规则。 Q5: 有什么可以进一步探索的点? 根据论文第6节“Future Work”与第7节“Limitations”,可进一步探索的方向包括: - 将推测解码范式扩展至非语言领域 自回归架构的顺序依赖瓶颈并非语言模型独有。在物理世界交互领域(如机器人学的视觉-语言-动作模型),推理延迟直接影响实时控制能力。AdaptiveSpec“根据每步难度动态调整草稿与验证”的核心思想,可作为基础向Token以外的动作单元(如机器人控制指令)延伸,以支持具身智能等低延迟场景。 - 结合检索式草稿器以优化智能体(Agentic)工作负载 智能体任务往往产生大量跨请求重复的序列。已有研究尝试以检索(如后缀树缓存)替代自回归草稿模型来生成候选Token(如SuffixDecoding)。未来可将AdaptiveSpec的每步自适应信号机制(DCS与边际规则)与检索式草稿源相结合,在保持动态树形与损失验证能力的同时,利用历史缓存进一步提升重复性Agentic任务的推理效率。 - 在更大批次(Multi-Batch)设置下验证方法有效性 论文当前仅在batch size = 1的条件下进行评估,该场景下延迟受内存带宽约束,每步推测的收益最为显著。未来需在更高批次的生产环境中评估AdaptiveSpec,以确认其在吞吐量与延迟权衡下的表现边界。 - 将自适应机制迁移至扩散型树草稿器(Diffusion-based Tree Drafters) 论文目前仅基于自回归草稿器EAGLE-3进行实现与验证。近期出现了基于扩散模型的树形草稿器(如DDTree)。AdaptiveSpec的动态树塑形原则与损失验证规则理论上可迁移至此类非自回归草稿器,但其实际兼容性与加速效果尚需实证研究。 - 探索具有形式化分布保持保证的有损验证 当前边际规则并不在理论上严格保持目标模型的输出分布(不同于原始无损推测解码的理论保证),其准确率保留仅通过下游任务经验评估。未来工作可致力于设计既能放宽精确匹配约束、又能在数学上保持(或以可控偏差逼近)目标分布的新型验证规则。 Q6: 总结一下论文的主要内容 这篇论文针对大型语言模型自回归解码的串行瓶颈,提出了一种名为 AdaptiveSpec 的无需训练、逐步自适应推测解码框架。以下是主要内容的系统总结: —- ### 1. 研究动机与问题 推测解码通过“草稿-验证”范式加速推理,但现有方法通常固定两个关键决策: - 严格的验证规则:仅接受与目标模型 top-1 输出完全一致的草稿 token, discard 了大量语义等价候选; - 静态的草稿树形状:深度、宽度及验证预算固定,无法适应不同解码步骤的难易差异。 现有工作在放松上述限制时存在结构性局限: - FLy 等训练无关的有损验证依赖前向查找窗口(lookahead window),假设草稿链足够长(15–25 tokens),这与 EAGLE-3 等广泛采用的树注意力草稿器不兼容(其平均接受长度常低于 3); - TALON 等动态树方法仅在固定全局 token 预算内重分配节点数,无法真正根据步骤难度收缩或扩展总草稿计算量。 —- ### 2. 核心方法:AdaptiveSpec AdaptiveSpec 在每一步解码中沿两个正交轴进行自适应,且仅利用解码循环内部已产生的概率信号,无需任何辅助训练。 #### (1)基于概率边界的损失验证(Margin-based Lossy Verification) 在验证阶段的首个不匹配位置 j$,定义目标模型对草稿 token 的归一化概率为:

margin(j) = p(target)(draft_j)p(target)(top1j) ∈ [0, 1]
当 margin(j) ≥ kappa ( kappa 为可调阈值)时,直接接受该不匹配的草稿 token。该规则: - 完全**无需前向查找窗口**,因而与草稿链长度和底层草稿器架构解耦; - 仅读取验证阶段已计算的目标概率分布,无需外部分类器或语义探针; - 通过 kappa 在吞吐量与准确率之间提供显式权衡。 #### (2)动态草稿树塑形(Dynamic Draft Tree-Shaping) 在草稿阶段,通过**草稿置信度分数(Draft Confidence Score, DCS)**直接选择树形三元组 (n
(steps), top-k, n_(dt)) :

DCSt = p(draft)(top1t) · RAR_t
其中 p
(draft)(top1_t) 为草稿模型当前步的 top-1 概率, RAR_t 为滚动接受率(指数移动平均, α=0.3 )。 DCS_t 经除数 d 缩放后,在浅宽树 (3, 4, 4) 与深窄树 (7, 1, 8) 之间线性插值: - 高置信度步骤分配深而窄的树,以最大化接受链长; - 低置信度步骤分配浅而宽的树,以覆盖更多候选分支。 由于候选范围跨越不同的总节点数,该策略能在弱草稿步骤上**真正收缩**草稿计算,而非仅在固定预算内重分配深度与宽度。为保障生产级引擎(如 SGLang)的 CUDA Graph 加速,系统预先捕获所有候选树形的静态计算图并在运行时按需切换。 —- ### 3. 实验与结果 论文在 SGLang 生产级引擎上,基于三个目标模型(Llama-3.1-8B-Instruct、DeepSeek-R1-Distill-Llama-8B、Qwen3-8B)及其 EAGLE-3 草稿器,在 GSM8K、MATH-500 和 HumanEval 上进行了评估。 - **主实验**:AdaptiveSpec(Combined)在全部 9 个(模型, 基准)设置中均取得最高吞吐量,相比静态 EAGLE-3 基线平均提升 **18%–44%**,最高达 **56%**;任务准确率恢复率在 **93% 至完全无损**之间,部分单元格甚至超过 100%。 - **消融实验**( 2×2 因子设计): - 仅动态树塑形即可将平均加速比从 1.82× 提升至 2.21× (+21.4%),且无精度损失; - 仅边际规则有损验证可将加速比提升至 2.20× (+20.9%); - **两者联合达到 2.44× **,证实双轴增益可叠加。 - **超参数搜索**:DCS 除数 d=0.5 在绝大多数设置中最优;边际阈值 kappa 的搜索显示了明确的吞吐-恢复权衡。 - **诊断分析**:通过测量 EAGLE-3 的平均接受长度(2.08–3.27),论文证明了 FLy 的前向窗口假设在此类草稿器上结构性失效,从而支撑了所提无窗验证规则的必要性。 —- ### 4. 局限与未来方向 - **理论保证**:边际规则不严格保持目标模型的输出分布(与原始无损推测解码不同),准确率保留仅为经验性结果; - **批次规模**:当前实验仅在 batch size = 1 下验证,多批次场景下的表现有待探索; - **草稿器类型**:目前仅基于 EAGLE-3 自回归草稿器实现,尚未在扩散型树草稿器(如 DDTree)上验证; - **跨领域扩展**:将“按步难度自适应”的思想扩展至非语言领域(如机器人视觉-语言-动作模型)以及结合检索式草稿器(如 SuffixDecoding)以优化智能体重复性工作负载,是潜在的未来方向。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Oszkár Urbán, Young D. Kwon, Stylianos I. Venieris, Cecilia Mascolo

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02897.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02897

Published: 2026-09-06T01:19:49.635Z


9. Distilled Rapid Embedding Transfer (DRET): Parameter-Efficient Biomedical Domain Adaptation via Priority-Based Embedding Transfer

Abstract:Large domain-specific language models such as BioBERT and ClinicalBERT achieve strong performance on biomedical NLP tasks, but their computational demands make them impractical for many real-world deployments. General-purpose, parameter-efficient models such as DistilBERT are lightweight yet lack the domain knowledge required for specialized tasks such as PICO (Population, Intervention, Comparison, Outcome) classification. We introduce Distilled Rapid Embedding Transfer (DRET), a knowledge-transfer paradigm that injects biomedical domain knowledge from large specialized models into a smaller general-purpose model without retraining on the original specialized corpora. DRET is developed as an iterative family of strategies: a unified tokenizer-merge strategy (DRET 1.x), hybrid embedding averaging (DRET 2.0), and a priority-based embedding-transfer mechanism (DRET 3.x) that hierarchically selects embeddings from the most authoritative source models, further combined with embedding-layer freezing, differential learning rates, label propagation, and imbalance-aware loss functions (DRET 4.x). We evaluate DRET on token-level PICO classification using the EBM-NLP corpus under severe class imbalance, across a twelve-metric battery. DRET-enhanced DistilBERT (66M parameters) attains balanced accuracy, recall, and ROC-AUC competitive with, and on several class-wise metrics exceeding, models an order of magnitude larger, while retaining DistilBERT’s efficiency. We further show that transfer occurs at the embedding level through cosine-similarity, semantic-shift, and t-SNE analyses. DRET offers a scalable, resource-efficient route to near-domain-expert performance for biomedical text mining, with direct application to automated systematic literature reviews and clinical decision support.

中文摘要

摘要:大型特定领域语言模型如 BioBERT 和 ClinicalBERT 在生物医学自然语言处理任务中表现出色,但其计算需求使其在许多实际部署中不切实际。通用、高参数效率的模型如 DistilBERT 虽然轻量化,但缺乏完成 PICO(人群、干预、比较、结果)分类等专门任务所需的领域知识。我们提出了蒸馏快速嵌入迁移(Distilled Rapid Embedding Transfer,DRET),一种知识迁移范式,可将大型专用模型中的生物医学领域知识注入较小的通用模型中,而无需在原始专用语料上重新训练。DRET 被开发为一组迭代策略:统一分词器合并策略(DRET 1.x)、混合嵌入平均(DRET 2.0)、以及基于优先级的嵌入迁移机制(DRET 3.x),该机制从最权威的源模型中分层选择嵌入,并进一步结合嵌入层冻结、差异化学习率、标签传播和不平衡感知损失函数(DRET 4.x)。我们在 EBM-NLP 语料库上,在严重类别不平衡情况下,对 token 级 PICO 分类进行了十二项指标评估。经过 DRET 增强的 DistilBERT(66M 参数)在平衡准确率、召回率和 ROC-AUC 上与大十倍规模的模型竞争,并在若干类别指标上超过这些模型,同时保持了 DistilBERT 的高效性。我们进一步通过余弦相似度、语义漂移和 t-SNE 分析展示了迁移在嵌入层的发生情况。DRET 为生物医学文本挖掘提供了一条可扩展且资源高效的途径,使模型性能接近领域专家水平,并可直接应用于自动化系统文献综述和临床决策支持。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02898 (HTTP 429)

Authors: Girish Sundaram, Daniel Berleant

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02898.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02898

Published: 2026-09-06T01:19:49.635Z


10. Contamination Inflates Scores but Rarely Reorders Large Language Model Leaderboards

Abstract:Benchmark contamination, the leakage of test items into training data, is widely described as a threat to the reliability of large language model (LLM) leaderboards. We argue that this concern conflates two distinct questions: whether contamination inflates absolute scores, and whether it reorders the ranking of models. We recast contamination as a violation of anchor-item invariance and measure it through the differential functioning of original versus semantically equivalent paraphrased items, a within-item contrast that holds the measured skill fixed and isolates memorization from capability. Using per-instance responses from 47 publicly released models and 74 models finetuned with a known dose of contamination, across four benchmarks (ARC, GSM8K, HellaSwag, MMLU), we first calibrate the measure against ground truth: it recovers injected contamination dose-responsively (a corrected effect of +0.187 accuracy points for test-set leakage) and never flags a negative-control model trained only on the legitimate training split (-0.012). We then quantify leaderboard impact: the rank correlation between a standard leaderboard and a paraphrase-controlled leaderboard is 0.997, and a sensitivity analysis shows that the observed differential contamination is far below the level needed to move rankings, with only 3 of 188 model-by-benchmark cases showing differential contamination corroborated across two references. Contamination among these public models is therefore largely uniform: it inflates absolute scores without reordering the leaderboard, and ranking distortion requires the rare case of differential contamination. We provide a calibrated invariance audit, released as a reference implementation, and recommend that leaderboards report paraphrase-controlled rankings alongside confidence intervals.

中文摘要

摘要:基准污染,即测试项目泄漏到训练数据中,被广泛认为是大型语言模型(LLM)排行榜可靠性的威胁。我们认为,这一担忧混淆了两个不同的问题:污染是否会抬高绝对分数,以及它是否会重新排序模型排名。我们将污染重新定义为锚点项不变性的违反,并通过原始项目与语义等价的改写项目的差异功能来测量,这种项内对比固定了测量技能,并将记忆与能力区分开来。利用47个公开发布模型和74个已知受污染微调模型的每实例响应数据,跨四个基准(ARC、GSM8K、HellaSwag、MMLU),我们首先将该测量方法与真实情况校准:它能够响应注入的污染剂量(测试集泄漏修正效果为+0.187准确率点),并且从未标记仅在合法训练集上训练的负控制模型(-0.012)。然后我们量化排行榜的影响:标准排行榜与改写控制排行榜的排名相关系数为0.997,敏感性分析显示,观察到的差异污染远低于改变排名所需的水平,仅在188个模型-基准案例中有3个显示出跨两个参考验证的差异污染。因此,这些公开模型中的污染大多是均匀的:它会抬高绝对分数而不会重新排序排行榜,而排名偏差需要极少数差异污染的情况。我们提供了一个校准的不变性审计,并以参考实现形式发布,建议排行榜报告改写控制排名及其置信区间。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02899 (HTTP 429)

Authors: Xingyao Xiao, Yihong Cheng

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.02899.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02899

Published: 2026-09-06T01:19:49.635Z


Agent Domain Papers

1. Structure and Implementation of New Practical English Textbooks Driven by Artificial Intelligence

Abstract:Artificial intelligence is changing the form of applied English materials from fixed paper sequences to adaptive learning systems that can diagnose learners, recommend tasks, and provide formative feedback. This paper studies the structure and application of a new practical English textbook driven by artificial intelligence. A five-layer architecture is proposed: knowledge mapping, learner profiling, task generation, feedback orchestration, and teacher-side governance. A prototype was tested on 186 non-English-major undergraduates for eight weeks of teaching. Compared with a static digital textbook, the proposed system increased the unit completion accuracy from 72.4% to 84.9%, raised the average score for speaking tasks by 10.8 points, and reduced the teacher’s correction time by 31.6%. Therefore, an AI-driven textbook can maintain the stability of the curriculum while providing personalised learning paths, rich practice materials and traceable classroom data.

中文摘要

摘要:人工智能正在将应用型英语教材的形式从固定的纸质序列转变为能够诊断学习者、推荐任务并提供形成性反馈的自适应学习系统。本文研究了由人工智能驱动的新型实用英语教材的结构与应用。提出了五层架构:知识映射、学习者画像、任务生成、反馈协调和教师端管理。对186名非英语专业本科生进行了为期八周的教学原型测试。与静态数字教材相比,该系统使单元完成准确率从72.4%提高至84.9%,口语任务平均分提高10.8分,并将教师批改时间减少了31.6%。因此,人工智能驱动的教材可以在保持课程稳定性的同时,提供个性化学习路径、丰富的练习材料和可追踪的课堂数据。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02981 (HTTP 429)

Authors: Ya Wang, Lei Zhang, Xueguang Yang, Bo Chen

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.02981.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02981

Published: 2026-09-06T01:20:32.388Z


2. MasterControl Seventeen Every Time

Abstract:We study a governed approach to enterprise analytics: a language model interprets the question, while deterministic policy selects and runs a pre-approved analytical program that returns both results and evidence. We show that this restriction can remain expressive within a defined analytical class, using relational operations plus aggregation, comparison, windows, ranking, and similarity. Fixed meaning, policy, data, and execution rules also make results replayable. Across 440 runs, three 8B models generated SQL and selected tools at runtime, while Qwen3-8B interpreted intent only and policy executed the approved program. None of 330 runtime-planning episodes matched the full answer-and-evidence contract across all test datasets; the policy-executed analyzer matched 110 of 110. This is a configuration-specific result, not evidence that runtime agents cannot succeed under other designs.

中文摘要

摘要:我们研究了一种受控的企业分析方法:语言模型解释问题,而确定性策略选择并运行预先批准的分析程序,该程序返回结果和证据。我们展示了这种限制在定义的分析类别内仍然可以保持表达能力,使用关系操作加上聚合、比较、窗口、排序和相似性。固定的意义、策略、数据和执行规则还使结果可重放。在440次运行中,三种8B模型在运行时生成SQL并选择工具,而Qwen3-8B仅解释意图,策略执行批准的程序。在330个运行时规划的实例中,没有一个完全匹配所有测试数据集的完整答案与证据合同;策略执行的分析器匹配了110/110次。这是特定配置下的结果,不是证明运行时代理在其他设计下无法成功的证据。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03209 (HTTP 429)

Authors: MasterControl AI Lab

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03209.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03209

Published: 2026-09-06T01:20:32.388Z


3. Speculative Macro Commit for Faster Tool-Using Agents

Abstract:Tool-using LLM agents spend wall-clock time not only on model inference but also in serial action—observation turns, where each tool call, environment transition, and observation can delay subsequent decisions. We introduce \textbf{Speculative Macro Commit} (SMC), a runtime mechanism for a two-tier agent system: a large authoritative actor model produces the official trajectory, while a faster speculative drafter model continuously predicts and executes future action chains on an isolated environment snapshot. SMC mines recurring multi-action skeletons from training traces and stores them in a macro library used to match against action chains predicted by the drafter at runtime. When the actor’s next tool call matches the first drafted action, SMC commits the remaining pre-executed draft steps, together with their observations, to the official trajectory. Using Qwen3.5-27B INT4 as the authoritative actor model and Qwen3.5-4B as the speculative drafter model, SMC matches the sequential agent’s overall accuracy while reducing latency by 10.23\% over the Speculative Actions (SA) baseline and 18.59\% over sequential execution on the $\tau^2$-Bench Telecom subset. On AppWorld, SMC reduces wall time by 7.7\% over SA baseline and 44.9\% over sequential execution, with a small reduction in task completion. Overall, SMC provides a practical way to reuse multi-step speculative execution and reduce agent latency beyond single-step speculative actions. Our code is publicly available \href{this https URL}{\textcolor{magenta}{here}}.

中文摘要

摘要:使用工具的LLM代理不仅花费大量时间在模型推理上,还在串行操作中——观察回合,每个工具调用、环境切换和观察都可能延迟后续决策。我们引入了\textbf{Speculative Macro Commit}(SMC),这是一种两层代理系统的运行时机制:大型权威演员模型生成官方轨迹,而更快的推测起草模型则持续预测并执行隔离环境快照中的未来动作链。SMC从训练轨迹中挖掘重复的多动作骨架,并将其存储在宏库中,用于与生成器在运行时预测的动作链匹配。当actor的下一个工具调用与第一个草拟动作匹配时,SMC将剩余的预执行草稿步骤及其观察数据提交到官方轨迹中。以Qwen3.5-27B INT4为权威行为者模型,Qwen3.5-4B作为推测性设计模型,SMC在$\tau^2$-Bench电信子集上,匹配顺序行动(SA)基线的延迟10.23\%,在$\tau^2$-Bench电信子集的顺序执行中降低18.59%。在AppWorld上,SMC较SA基线减少7.7%的墙壁时间,较顺序执行减少44.9%,任务完成度略有下降。总体而言,SMC提供了一种实用方式,可重用多步推测执行,并降低代理延迟,超越单步推测操作。我们的代码公开发布 \href{this https URL}{\textcolor{magenta}{here}}。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03236 (HTTP 429)

Authors: Zeyu Liu, Souvik Kundu, Peter A. Beerel

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03236.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03236

Published: 2026-09-06T01:20:32.388Z


4. Fresh Memory, Stale Plans: Dependency-Scoped Validation for Distributed LLM-Agent Memory

Abstract:Distributed LLM-agent teams can read the latest shared facts and still act on an obsolete plan. A planner may derive an action from requirement $r_3$, another agent may commit $r_4$, and an executor may receive $r_4$ without replacing the plan derived from $r_3$. We call this \emph{stale-plan execution}: state freshness does not establish that the plan authorizing an action remains valid. We introduce PlanFence, a dependency-scoped action-validation protocol. Plans cite the exact public records they used, and an executor validates only the records that can affect the pending external action, replanning once or blocking when validation is incomplete. In 30 controlled live workflows with a post-plan revision, a freshness-only executor acts on the obsolete plan in every task, whereas PlanFence completes all tasks without an invalid action. Controlled replay reveals two conditional boundaries: proactive synchronization yields lower coordination stall at low churn, while PlanFence avoids repeated update-path coordination as churn grows and avoids validating unrelated state as the shared keyspace grows. These are controlled safety and systems-cost results, not general task-accuracy gains.

中文摘要

摘要:分布式大型语言模型代理团队可以读取最新的共享事实,但仍可能在一个过时的计划上采取行动。一个计划者可能会从需求 $r_3$ 推导出一个动作,另一个代理可能执行 $r_4$,而执行者可能收到 $r_4$ 时并未替换从 $r_3$ 推导的计划。我们称之为\emph{陈旧计划执行}:状态的新鲜度并不能保证授权某个动作的计划仍然有效。我们提出了 PlanFence,一种依赖范围限定的动作验证协议。计划引用它们使用的确切公共记录,执行者仅验证可能影响待处理外部动作的记录,验证不完整时会重新规划一次或阻塞。在 30 个经过后期计划修订的受控实时工作流中,仅依赖新鲜度的执行者在每个任务中都在过时计划上执行,而 PlanFence 完成了所有任务而没有执行无效动作。受控回放揭示了两个条件边界:在低变动环境下,主动同步可降低协调停滞,而随着变动增加,PlanFence 避免了重复的更新路径协调,并且随着共享键空间增大,也避免了验证无关状态。这些都是受控的安全性和系统成本结果,而非一般任务准确度的提升。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文针对分布式大语言模型(LLM)智能体系统中的 \*\*stale-plan execution(过时计划执行)\*\* 问题,提出了一种依赖范围限定的动作验证机制。具体而言,论文试图解决的核心问题可归纳如下: --- ### 1. 核心问题:状态新鲜度与计划有效性之间的脱节 在分布式多智能体环境中,公共任务状态通常被复制到各智能体的本地内存中。即使执行者(executor)读取到了最新的共享事实(例如一条已被修订的需求 r_4 ),它仍可能依据一个基于旧版本(例如 r_3 )生成的过时计划 p(r_3) 去调用外部工具。论文将此类故障定义为 \*\*stale-plan execution\*\*: - 规划者(planner)基于需求 r_3 推导出计划 p(r_3) ; - 在计划执行前,另一智能体提交了修订版本 r_4 ; - 执行者虽通过背景传播收到了 r_4 ,但并未替换本地缓存的计划 p(r_3) ; - 结果,执行者使用源自旧需求的参数调用外部工具(例如预订已取消的订单、部署已废弃的构建版本)。 关键洞察在于:\*\*执行者本地状态的“新鲜”并不足以保证待执行计划的授权仍然有效\*\*。即

Fresh local state nRightarrow Valid plan lineage.
—- ### 2. 形式化目标:血统有效性(Lineage Validity) 论文将安全不变量形式化为 **lineage validity**。对于受保护的外部动作 a ,设: - L(a) 为授权该动作的计划根节点; - D(a) ⊂eq X 为工具包装器声明的、可能影响该动作的公共键集合; - F_a(x) 为计划实际使用的、键 x 的记录版本; - H(x) 为键 x 的当前所有者授权版本(head)。 则动作 a 在验证点有效的充要条件为:

Valid(a) iff Fa(x) = H(x),quad ∀ x ∈ D(a).
论文指出,若无精确的父级链接(exact parent IDs)和动作时的依赖验证,执行者无法仅凭本地副本判断待执行计划是否仍被当前公共记录授权。 —- ### 3. 系统层面的权衡问题 在识别上述安全缺口后,论文进一步探讨了实现该不变量时的系统代价权衡,对应三个研究问题: - **RQ1**:智能体是否可能在读取最新状态后,仍执行过时计划? ——答案是肯定的,仅靠状态新鲜度无法防止。 - **RQ2**:当公共状态频繁变更时,是在每次更新时主动同步(proactive synchronization)代价更低,还是在动作即将执行前按需验证代价更低? ——论文发现低变更率下主动同步的协调阻塞更低,高变更率下动作时验证更优。 - **RQ3**:当共享状态空间增长时,仅检查动作相关的依赖集 D(a) 是否比检查全部共享键 X 更能降低协调成本? ——依赖范围限定能避免序列化无关状态,在稀疏依赖场景下显著降低延迟与流量。 —- ### 4. 提出的解决方案:PLANFENCE 为在动作边界上建立血统有效性,论文设计了 **PLANFENCE** 协议: - **精确衍生记录**:每个计划引用其生成时所使用的精确公共记录版本(不可变记录 ID); - **依赖声明**:工具包装器显式声明 D(a) ,即哪些公共键可能影响该动作; - **动作边界门控**:执行者在调用外部工具前,仅针对 D(a) 中的键向权威所有者查询当前 head H(x) ,并与计划中的依赖前沿 F_a(x) 比对; - **一次重规划后失败闭合**:若发现不匹配,允许拉取最新记录并执行一次重规划;若再次不匹配或验证不完整,则阻塞动作(fail closed)。 综上,该论文旨在解决分布式 LLM 智能体内存中 **“读了最新事实,却执行了过时计划”** 的安全漏洞,并在确保血统有效性的同时,探索依赖范围限定验证相对于全局同步和全键验证的系统代价边界。 Q2: 有哪些相关研究? 论文在第2节“Related Work”中系统梳理了相关研究,并将其归纳为三大领域。以下按研究脉络分类概述: —- ### 1. 数据来源与乐观并发控制(Provenance and Validation) 该领域关注如何记录衍生对象的输入来源,并在操作提交前验证读集合是否仍然有效。 - **数据溯源(Data Provenance)**:Buneman、Khanna 与 Wang-Chiew(2001)提出了数据来源的特征化方法,用于记录哪些输入产生了一个衍生对象。 - **乐观并发控制(Optimistic Concurrency Control)**:Kung 与 Robinson(1981)提出在事务提交前验证其读集合是否仍保持当前状态。 **与 PLANFENCE 的区别**:上述工作针对的是数据库事务提交的边界。PLANFENCE 将同样的底层思想应用于**智能体工具边界**——LLM 生成的计划可能跨角色调用、副本和状态刷新长期存在,除非运行时记录精确的父级版本,否则执行者在动作边界将没有读集合可供验证。 —- ### 2. 分布式一致性与内存模型(Distributed Consistency) 该领域提供了多种暴露当前副本状态的方式,或在一致性与延迟之间做应用级权衡。 - **强一致性、主动复制与 CRDTs**:包括 CAP 定理的形式化(Gilbert & Lynch, 2002)、现代分布式数据库中的一致性权衡(Abadi, 2012)、消息传递系统中的健壮共享内存(Attiya et al., 1995)、流行病式复制算法(Demers et al., 1987),以及无冲突复制数据类型(Shapiro et al., 2011)。 - **一致性分级与云存储 SLA**:Kraska 等(2009)提出一致性配给;Li 等(2012)提出“必要时一致”;Terry 等(2013)提出基于一致性的服务等级协议;Bailis 等(2012)提出概率有界陈旧性。 **与 PLANFENCE 的区别**:PLANFENCE 并未引入新的一致性模型,而是**指定了哪些记录版本必须授权待执行动作**;它可以建立在主动传播或动作时所有者查询之上,但不依赖于某一种特定的副本一致性机制。 —- ### 3. LLM 多智能体协作与记忆(LLM-Agent Coordination and Memory) 该领域涵盖智能体角色协作结构、记忆检索与共享、以及持久世界中的可执行制品。 #### 3.1 多智能体协作框架 - **角色化多智能体系统**:AutoGen(Wu et al., 2023)、MetaGPT(Hong et al., 2024)、CAMEL(Li et al., 2023)、ChatDev(Qian et al., 2024)等框架将任务划分为不同角色并在独立进程或设备上运行。 - **交互优化与架构搜索**:包括通过多智能体辩论提升事实性(Du et al., 2024)、将语言智能体视为可优化图的 GPTSwarm(Zhuge et al., 2024)、经济型通信管道(Zhang et al., ICLR 2025)以及多智能体架构搜索(Zhang et al., ICML 2025)。 - **交互协议**:Anthropic 的模型上下文协议 MCP(2024)与 Google 的 Agent2Agent(A2A)协议(2025)提供了工具与智能体交互的标准接口。 #### 3.2 智能体记忆系统 - **记忆管理**:MemGPT(Packer et al., 2023)将 LLM 视为操作系统管理记忆;A-MEM(Xu et al., 2025)提出智能体记忆;Mem0(Chhikara et al., 2025)关注可扩展长期记忆;Reflexion(Shinn et al., 2023)利用语言反馈进行强化学习;Voyager(Wang et al., 2023)关注开放式具身智能体。 - **共享与架构视角**:Yu 等(2026)从计算机体系结构视角审视多智能体记忆;Rezazadeh 等(2025)研究多用户动态访问控制下的记忆共享;Wang 与 Chen(2025)提出 MIRIX 多智能体记忆系统。 #### 3.3 持久世界与智能体生成制品 - **SwarmWorld**(Pal et al., 2026):研究了语言模型智能体社会中的持久世界,记录内容寻址的父子程序血统,允许后续智能体继承和修改持久程序,并在共享世界持续演化的同时提交模型生成的计划。 **与 PLANFENCE 的区别**:现有工作主要关注“智能体应通信、检索或保留什么内容”,或支持程序继承与归属的技术血统。PLANFENCE 则利用**精确的衍生血统(exact derivation lineage)**来确定:一个待执行动作是否仍被其**动作相关的公共输入**的当前版本所授权。这是一种面向动作边界的、依赖范围限定的验证机制,而非全局内存 freshness 或持久制品的演化机制。 Q3: 论文如何解决这个问题? 论文通过 **PLANFENCE**(Dependency-Scoped Action-Validation Protocol)解决 stale-plan execution 问题。其核心思路是将**安全不变量**(动作的血统必须有效)与**建立该不变量的系统机制**(何时、以何种范围进行检查)分离,并在**外部动作边界**实施依赖范围限定的验证。具体解决路径可分为以下层面: —- ### 1. 精确衍生记录:绑定计划与不可变输入版本 PLANFENCE 要求每个公共记录都是不可变的,并通过**语义键**(semantic key) x ∈ X 标识逻辑项,通过**不可变记录 ID** 标识具体版本。任何衍生记录(包括智能体生成的计划)在写入时必须附加**精确的父级 ID**(exact parent IDs),记录它是从哪些确切版本的公共输入推导而来。 - 若计划 p 由需求 r_3 推导,则 p 必须显式引用 r_3 的记录 ID(如 id_3 ),而非仅引用语义键 x
(req) 。 - 这意味着,即使后续修订版 r_4 已提交,计划 p 携带的仍是 id_3 的血统证据;执行者不会仅因本地已安装 r_4 就误以为 p 仍然有效。 —- ### 2. 动作依赖声明:限定验证范围 PLANFENCE 不要求在每次状态更新时验证全部共享状态,也不要求执行前检查整个键空间。相反,它要求**工具包装器**(tool wrapper)在应用代码层面显式声明一个依赖集合:

D(a) ⊂eq X
表示哪些公共键的值可能影响该受保护动作 a 。例如,一次预订动作可能只依赖于需求键和可用性键,而与无关的目录记录或其他工作流状态无关。 —- ### 3. 血统有效性的形式化条件 在动作执行前的验证点,PLANFENCE 检查**血统有效性**(lineage validity)。设: - L(a) 为授权动作 a 的计划根节点; - F_a(x) 为从 L(a) 沿精确父级链追溯到的、键 x 的记录版本(依赖前沿); - H(x) 为键 x 的权威所有者 o(x) 当前授权的版本(head)。 则动作 a 有效的充要条件为:

Valid(a) iff F_a(x) = H(x),quad ∀ x ∈ D(a).
该条件直接回答 RQ1:执行者读取最新状态 local_head=H(x) 并不足够;必须验证计划实际使用的版本 F_a(x) 是否与 H(x) 一致。 —- ### 4. 动作边界门控:Algorithm 1 的执行流程 PLANFENCE 在执行外部调用前运行**依赖范围限定的验证门控**,其算法流程如下: 1. **血统遍历**:从计划根 L(a) 出发,沿本地精确父级链遍历,直至到达 D(a) 中各语义键的边界。若任何父级链不完整、依赖边界缺失或所有者映射缺失,则**阻塞**(blocked)。 2. **并发查询所有者**:对 D(a) 中的每个键 x ,并发向其所有者 o(x) 查询当前授权版本 H(x) 。若响应不可用、损坏、冲突或键不匹配,则**阻塞**。 3. **增量内容获取**:仅对那些 H(x) ≠ F(x) 的键,获取并验证其最新记录内容;其余键仅比对元数据(记录 ID)。 4. **比对与决策**: - 若 F = H 且计划根确实衍生自这些前沿版本,则**授权**(authorized)。 - 若发现不匹配: - 若这是首次检测到变更(`replanned = false`),则允许**一次重规划**(replan-required):执行者拉取最新记录,用相同的角色和隔离上下文重新生成计划,然后带着新计划再次进入门控。 - 若已重规划过一次仍不匹配,或任何依赖再次变更,则**失败闭合**(blocked),禁止动作执行。 此机制确保: - 不会无限重试(最多一次 replan); - 任何验证不完整的情况均导向阻塞,而非放行。 —- ### 5. 协调成本的优化策略 PLANFENCE 通过**按需验证**与**依赖范围限定**降低系统协调成本,具体体现为: - **动作时验证 vs. 每次更新同步**:不强制在每次公共状态变更时同步所有副本(metadata sync),而是在动作即将执行时才支付验证成本。论文实验表明,当更新率 rho 较低时主动同步更优,但当 rho ≥ 4 时,PLANFENCE 的阻塞时间显著低于安全基线(图3、图4)。 - **依赖范围限定 vs. 全键验证**:不检查整个共享键空间 |X| ,仅检查 |D(a)| 个动作相关键。实验显示,当共享键从 8 增长到 128 时,PLANFENCE 的流量保持在约 8.1,KiB/action ,而批量全键验证从 16.4 增长至 81.7,KiB/action ;延迟亦显著降低(图5、表8)。 —- ### 6. 可信边界与失败闭合 PLANFENCE 的安全保证依赖于以下系统设计: - **可信计算基**:工具包装器对 D(a) 的声明必须完整;若无法静态确定,则需保守地声明更广集合。 - **良性所有者**:所有者 o(x) 必须如实返回其当前授权版本 H(x) 。 - **不可变性与认证**:公共记录不可变,传输经认证,父级链接不可篡改。 - **失败闭合**:任何父级链缺失、所有者无响应、依赖声明不完整或重规划后再次变更,均导致动作被阻塞,而非基于不完整证据执行。 综上,PLANFENCE 通过**在动作边界精确比对“计划实际使用的输入版本”与“所有者当前授权的输入版本”**,并**仅针对动作相关的依赖子集**进行该验证,解决了分布式 LLM 智能体中“读了最新事实,却执行了过时计划”的 stale-plan execution 问题。 Q4: 论文做了哪些实验? 论文的实验设计围绕三个研究问题(RQ1–RQ3)展开,结合**实时五智能体工作流**与**受控重放(controlled replay)**两种模式,辅以传输微基准测试和大量的消融实验。以下分层次梳理: —- ### 1. 实验总体设计与设置 **环境与负载** - **实时系统**:五个独立的 Qwen3.5 智能体进程,运行在预订(reservation)、履行(fulfillment)和部署(deployment)三类工作流上,每类 10 个随机种子,共 30 组任务。 - **受控重放**:固定 30 个工作流模板,通过替换模型重规划为预录制的公共决策,使不同内存策略在**相同的决策序列、更新时序和网络条件**下执行,从而将无效动作、等待时间和流量归因于策略本身而非模型输出差异。 - **网络条件**:Loopback,以及基于历史 AT&T、T-Mobile、Verizon LTE 链路的固定回放迹线(含丢包、延迟)。 - **默认参数**: N=5 个智能体, |X|=8 个共享语义键,每个动作依赖 d=1 个键, H=64 个工作单元,名义更新目标 rho ∈ 0.25, 1, 4, 16 。 **基线方法** - **不安全策略**:Local replica(直接执行本地状态)、Owner-head freshness(读取当前依赖但无血统绑定)、Metadata sync(延迟同步, K>1 )。 - **安全策略**:Centralized lineage(集中式血统服务)、Metadata sync( K=1 ,每更新即同步)、Per-key / Batched all-key validation(全键验证)、Majority-replica / All-replica validation(副本表决)、PLANFENCE。 **核心指标** - **安全性**:无效发出动作数(计划未到达当前声明输入的动作)。 - **可用性**:可用/已完成动作数。 - **协调阻塞(Coordination stall)**:等待同步或验证的时间(ms/action)。 - **分布式流量(Traffic)**:副本间及中央服务的字节数(KiB/action)。 —- ### 2. 针对三个研究问题的核心实验 #### RQ1:智能体读取最新状态后是否仍会执行过时计划? - **Table 1(受控重放,高更新负载 rho=4 )**:在 330 次调度的动作中,Local replica 和 Owner-head freshness 均发出 330/330 次无效动作;而所有强制精确血统绑定的安全策略(包括 PLANFENCE)无效动作为 0/330。 - **Table 2(实时五智能体工作流)**:在 30 个交互式任务中,Owner-head freshness 在每次任务中都发出了过时的主要动作,任务成功率为 0/30;Centralized lineage 和 PLANFENCE 均检测到变更,触发一次重规划,30/30 任务完成且无无效主要动作。 - **Appendix A.6**:对齐的策略审计覆盖 32,700 次调度动作,任何强制精确血统的方法均未出现无效动作;所有 4,143 次无效动作均来自陈旧或延迟同步的控制组。 #### RQ2:状态频繁变更时,每次更新同步与动作前验证哪个阻塞更低? - **Figure 3(跨网络与更新率的策略边界图)**:在 loopback 和三条蜂窝迹线上,比较 PLANFENCE 与 Metadata sync( K=1 )/Centralized lineage 的阻塞。低变更率( rho ≤ 1 )下,主动同步的阻塞更低;高变更率( rho ≥ 4 )下,PLANFENCE 的阻塞更低,领先优势为 1.5× 至 7.1× 。 - **Figure 4(AT&T 迹线上的同步节奏权衡)**:展示 Metadata sync 在不同 K (同步屏障间隔)下的安全-成本曲线。 K=1 时最安全但阻塞高;增大 K 降低阻塞但以牺牲安全为代价(出现无效动作);PLANFENCE 在 rho=4,16 时以零无效动作取得更低的阻塞。 - **Table 4(同步节奏消融)**:在 rho ∈ 0.25,1,4,16 下系统性地展示 K=1,2,4,8,16 的安全与成本。随着 K 增大,阻塞下降,但无效动作增加;PLANFENCE 在所有 rho 下保持 0 无效动作,且在 rho ≥ 4 时阻塞显著低于 K=1 。 - **Table 5(团队规模敏感性)**: N ∈ 3,5,8 ,高更新率下 PLANFENCE 的阻塞和流量均低于 Centralized lineage 和 Metadata sync( K=1 )。 - **Table 7(剧集长度敏感性)**: H ∈ 16,64,256 ,高更新率下的策略排序保持稳定。 #### RQ3:共享状态增长时,仅检查动作相关依赖是否比检查全部键更优? - **Table 1(八键紧凑状态)**:PLANFENCE 的阻塞为 230.8 ms/action、流量 8.1 KiB/action;Centralized lineage 为 508.6 ms/15.6 KiB;Metadata sync( K=1 )为 403.4 ms/23.5 KiB。 - **Figure 5(键空间 8–128 的比较)**:在 loopback 和 AT&T 迹线上对比 PLANFENCE 与 Batched all-key validation(同样允许一次重规划、两次验证)。随着共享键从 8 增至 128: - Loopback 阻塞:PLANFENCE 从 67.8 ms 降至 66.0 ms(基本持平),Batched all-key 从 115.5 ms 升至 199.2 ms。 - AT&T 阻塞:PLANFENCE 从 295.3 ms 升至 345.2 ms;Batched all-key 从 365.7 ms 升至 428.7 ms。 - 流量:PLANFENCE 恒定在约 8.1 KiB/action;Batched all-key 从 16.4 KiB 线性增长至 81.7 KiB/action。 - **Table 6(依赖集大小敏感性)**:固定 |X|=8 ,变化 d ∈ 1,2,8 。当 d=1 时 PLANFENCE 阻塞低 14.9%、流量低 50.6%;当 d=2 时阻塞接近打平、流量仍低 32.0%;当 d=8=|X| 时两者阻塞与流量均趋于一致(依赖范围限定失效的边界)。 - **Table 8 与 Table 9(完整键空间与独立迹线相位)**:覆盖 loopback(30 模板聚合)与 AT&T(三个独立迹线偏移 0/5/15 秒),共 13,200 次调度动作,PLANFENCE 与 Batched all-key 均完成全部有效动作,但 PLANFENCE 在几乎在所有子集中阻塞和流量更低。 —- ### 3. 附录中的补充实验 **B. 受控重放消融实验** - **学习策略选择(Table 10)**:训练神经网络(决策树、MLP、DeBERTa)在集中式 lineage、Metadata sync( K=1 )和 PLANFENCE 之间做策略选择。在分布内(ID)样本上学习器可达 95–96.7% 的安全近优选择,但在四个分布外(OOD)偏移块(Verizon 迹线、插值更新率、端点键数、复合偏移)中,没有学习器能在推理成本计入后全面超越简单的透明规则( rho ≤ 1 选同步,否则选 PLANFENCE)。 **C. 验证假设与组件敏感性** - **血统证明深度(Table 11)**:验证必须跟随**完整的传递闭包**。仅检查直接父级在链深 ell=1 时可行,但在 ell ≥ 2 时会导致错误放行;缺失中间记录时必须阻塞。 - **重规划机制(Table 11)**:仅验证不重规划会导致 3,000 次检测到的竞争全部阻塞;验证+一次重规划将其全部转为有效动作。 - **无血统/任意副本头(Table 11)**:读取新鲜需求但不检查计划血统,或信任任意副本的头,在每次竞争中都会发出无效动作。 - **依赖契约完整性(Figure 6)**:在 30 模板×100 竞争种子上,随真实依赖被遗漏的概率增加,无效动作率上升(遗漏 50% 时达 37.4%);过度声明依赖虽保持安全,但会增加所有者头检查次数。 - **失败闭合(Fail-closed)验证**:在所有者中断、血统缺失、畸形头、第二次版本变更四种情况下,失败闭合策略全部阻塞且无无效动作;对应的失败开放(fail-open)策略在四种情况下全部发出无效动作。 —- ### 4. 传输微基准测试 - **Figure 2**:测量单次认证 TCP 同步的阻塞时间随公共状态大小(2 KiB 至 8 MiB)和丢包率(0–10%)的变化。该实验说明单次同步在有利路径上开销低,但随着内容增长或链路恶化会显著增加,从而为“每次更新同步”的代价提供微观依据。 Q5: 有什么可以进一步探索的点? 基于论文的局限性陈述与系统设计边界,以下方向值得进一步探索: —- ### 1. 拜占庭与半诚实所有者环境下的安全验证 论文假设所有者是**良性**(benign)且诚实的。后续工作可探索: - 当所有者可能返回错误、过时或冲突的 H(x) 时,如何建立**拜占庭容错**的血统验证?例如,通过跨多个副本的密码学承诺或阈值签名来确认公共记录头的权威性,而非信任单一所有者。 - 在**所有者迁移**(owner migration)场景下,如何保持依赖链的可验证性与连续性,避免验证因所有权变更而中断。 —- ### 2. 自动化依赖声明推断 当前 PLANFENCE 要求工具包装器显式声明 D(a) ,且 Figure 6 表明遗漏真实依赖会直接破坏安全。可探索: - **静态或动态程序分析**:从工具包装器代码中自动提取其读取的公共键集合,生成 D(a) ,降低人工声明负担。 - **学习式依赖推断**:基于历史动作轨迹与输入输出关联,学习预测动作实际依赖的语义键子集,并在安全关键场景下保守地过度声明(over-declare)以确保不遗漏。 —- ### 3. 私有推理与公共血统的桥接 论文明确将私有提示(private prompts)、本地 scratchpads 和隐藏推理排除在血统模型之外。这引出了: - 当计划的推导过程部分依赖于**未写入公共状态的私有推理**时,如何在不泄露私有内容的前提下,证明该推理步骤不会改变动作对公共输入的依赖关系? - 是否可通过**零知识证明**或**差分隐私摘要**,将私有推理的“影响范围”压缩为对公共键的声明,从而纳入 D(a) 的验证框架? —- ### 4. 跨外部服务的事务原子性 PLANFENCE 的验证点与后续外部工具调用**不构成原子事务**。这意味着: - 即使验证通过,外部服务在调用瞬间仍可能因并发修改而失效。可研究如何将血统验证与外部服务调用封装为**两阶段提交**或**基于补偿事务**(Saga)的分布式事务,尤其当动作涉及多个外部 API 时。 - 探索与现有 LLM 智能体协议(如 MCP、A2A)的集成,将 PLANFENCE 作为事务协调器嵌入标准调用链。 —- ### 5. 动态策略选择与运行时自适应 附录 B.2 显示,学习式策略选择器在分布外(OOD)偏移下难以稳定超越透明规则( rho ≤ 1 选同步,否则选验证)。可进一步探索: - **在线 bandit 或元学习**:基于实时观测到的更新率、网络延迟和依赖稀疏度,动态切换 proactive sync 与 PLANFENCE,并给出竞争比下界。 - **分层记忆架构**:设计混合策略,对高频变更键使用 proactive sync,对稀疏依赖键使用 PLANFENCE 按需验证,并在运行时根据工作负载重分区。 —- ### 6. 超大规模键空间与复杂血统图优化 论文评估的键空间上限为 |X| = 128 。在更大规模场景下: - 当公共状态包含数万级语义键,且计划血统为**多源合并图**(multi-parent merge)而非简单链式结构时,如何设计高效的依赖前沿索引,使 F_a(x) 的遍历避免线性扫描? - 研究**内容寻址存储**(如 Merkle DAG)与增量校验和,将血统验证的通信量从 O(|D(a)|) 进一步压缩到 O(log |X|) 或更小。 —- ### 7. 大工件与多模态内容的高效血统追踪 论文的工件控制实验涉及 256 – 320,KiB 的制品,但主要关注安全路径而非成本比较。后续可探索: - 当公共记录包含大型二进制工件(如模型权重、图像、视频)时,如何在保持**精确父级链接**的同时,避免在每次验证时传输完整内容?可结合**内容寻址**与**范围哈希**(range hashing),仅校验受影响片段。 - 多模态输入(图像、音频、传感器数据)引入的**非结构化依赖**如何被显式声明并纳入 D(a) ? —- ### 8. 语义等价性与计划合并 论文假设记录版本是**不可变**且通过精确 ID 比对的。在实际 LLM 智能体系统中: - 修订记录 r_4 可能与 r_3 **语义等价**(例如仅修改了注释或格式),此时强制重规划可能造成不必要的协调成本。可探索**语义差异检测**或**松散血统等价**(loose lineage equivalence),允许在不影响动作授权的前提下跳过验证。 - 当多个智能体并发修订同一语义键时,如何基于 CRDT 或操作变换(OT)在验证层之前合并公共状态,而非简单阻塞或失败闭合? —- ### 9. 扩展至层级化与嵌套工作流 当前实验主要覆盖扁平的“规划-修订-执行”模式。更复杂的场景涉及: - **嵌套子工作流**:上层计划的 L(a) 可能派生自下层子计划的输出,形成层级血统。需要递归验证机制确保每一层的依赖前沿均保持有效。 - **长周期持久计划**:当计划的生命周期跨越小时甚至天级(如 SwarmWorld 中的持久程序),如何在执行者离线或休眠期间管理血统验证与状态租约? —- 这些方向既回应了论文 Section 6 中列出的明确限制(拜占庭容错、所有者迁移、推断依赖、语义合并、私有推理、事务边界),也将其系统权衡分析扩展到了更大规模、更动态和更异构的智能体部署环境。 Q6: 总结一下论文的主要内容 这篇论文研究分布式大语言模型(LLM)智能体系统中的 **stale-plan execution(过时计划执行)** 问题,提出并评估了名为 **PLANFENCE** 的依赖范围限定动作验证协议。以下从问题、概念、方法与实验四个方面总结主要内容。 —- ### 1. 核心问题:状态新鲜度不等于计划有效性 在分布式多智能体架构中,不同角色(如规划者、执行者)通过复制共享公共状态进行协作。一个规划者可能基于公共需求 r_3 生成计划 p(r_3) ;在动作执行前,另一智能体提交了修订版 r_4 。即使执行者的本地内存已通过背景传播更新为 r_4 ,它仍可能因未替换缓存的计划而基于 p(r_3) 调用外部工具(例如预订已取消的订单、部署已废弃的构建)。 论文将此故障定义为 **stale-plan execution**,并指出其根源在于:

Fresh local state nRightarrow Valid plan authorization.
即,执行者读取了最新事实,并不意味着授权该动作的**计划推导血统**仍然有效。 —- ### 2. 安全不变量:血统有效性(Lineage Validity) 论文将动作的安全条件形式化为 **lineage validity**。对于受保护的外部动作 a ,设: - L(a) 为授权动作的计划根节点; - D(a) ⊂eq X 为工具声明的、可能影响该动作的公共语义键集合; - F_a(x) 为从 L(a) 沿精确父级链追溯到的键 x 的记录版本(依赖前沿); - H(x) 为键 x 的权威所有者当前授权的版本(head)。 则动作有效的充要条件为:

Valid(a) iff F_a(x) = H(x),quad ∀ x ∈ D(a).
该条件表明:必须验证计划**实际使用的精确输入版本**与所有者**当前授权的输入版本**是否一致,而非仅检查执行者本地是否持有最新状态。 —- ### 3. PLANFENCE:依赖范围限定的动作验证协议 为实现上述不变量,论文设计了放置于**外部动作边界**的 PLANFENCE 门控,包含三个核心机制: - **精确衍生记录**:任何公共记录(包括计划)写入时必须附加不可变的精确父级 ID,从而建立完整的血统链。 - **依赖声明**:工具包装器显式声明 D(a) ,限定动作的相关公共键集合,避免检查无关状态。 - **动作时验证与一次重规划**:执行前,执行者并发查询 D(a) 中各键的所有者,比对 F_a(x) 与 H(x) 。若不一致,允许拉取最新记录并**重规划一次**;若再次不一致或验证不完整,则**阻塞动作**(fail closed)。 PLANFENCE 的关键设计在于将**安全不变量**(血统有效)与**系统机制**(何时、以何种范围检查)分离:它仅在动作即将执行时,对动作相关的依赖子集进行验证。 —- ### 4. 实验发现 论文通过 30 组实时五智能体工作流(Qwen3.5)与大规模受控重放(32,700 次调度动作)回答三个研究问题: - **RQ1(状态新鲜度是否足够?)**:仅检查本地状态新鲜度的方法在 30/30 任务中均发出无效动作;而强制精确血统的 PLANFENCE 与集中式血统服务均完成 30/30 任务且无无效动作。 - **RQ2(同步策略边界)**:在 rho ≤ 1 (低变更率)时,每次更新主动同步(metadata sync, K=1 )的协调阻塞更低;在 rho ≥ 4 (高变更率)时,PLANFENCE 的阻塞显著更低(领先 1.5× 至 7.1× ),因为它避免了为每次更新支付全局协调成本。 - **RQ3(依赖范围 vs. 全键验证)**:当共享键空间从 8 增至 128 时,PLANFENCE 的流量稳定在约 8.1,KiB/action ,而批量全键验证从 16.4 增至 81.7,KiB/action ;延迟亦显著降低。当依赖集 D(a) 接近完整键空间时,两者的优势边界自然收敛。 —- ### 5. 主要贡献 - **问题识别与形式化**:首次明确区分分布式智能体内存中的“状态新鲜”与“计划血统有效”,定义 stale-plan execution 与 lineage validity。 - **协议设计与实现**:提出 PLANFENCE,一种在动作边界绑定精确公共输入、验证依赖子集并支持一次重规划后失败闭合的协议。 - **系统代价边界刻画**:在相同的调度与网络迹线下,比较多种安全协调策略,量化了“主动同步”与“动作时验证”、“依赖范围”与“全键验证”之间的协调阻塞与流量交叉边界。 论文明确其结论为**受控安全性与系统代价结果**,而非对一般任务准确性的普遍提升。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Evan Chen, Shiqiang Wang, Christopher G. Brinton

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03340.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03340

Published: 2026-09-06T01:20:32.388Z


5. A Prompt-Engineering Approach to Develop Scalable, Flexible, and Real-Time Hybrid Micro-Level Personalization in a General Purpose AI Teaching Assistant

Abstract:Artificial intelligence (AI) teaching assistants powered by large language models (LLMs) offer scalable educational support but often provide limited personalization. This study presents a prompt-engineering-based framework for personalizing general-purpose LLM/RAG-based AI teaching assistants such as Jill Watson across academic disciplines and courses. The framework adapts responses using six learner-specific dimensions: self-assessment, abstraction preference, verbosity preference, perceptual orientation, information processing style, and level of understanding, yielding 96 distinct learner profiles. Student queries are additionally analyzed using Bloom’s Taxonomy to estimate cognitive complexity at the interaction level. Learner attributes and cognitive assessments are encoded in structured prompts that condition the LLM without requiring model retraining. The framework is evaluated through experiments using NLP metrics and a human study with five participants. Results show perceived differences in response style and structure across personalization conditions, with statistical analyses identifying learner attributes associated with measurable response changes. These findings provide preliminary evidence that prompt-based personalization can support adaptive behavior in LLM-powered educational agents.

中文摘要

摘要:由大型语言模型(LLM)驱动的人工智能(AI)教学助手能够提供可扩展的教育支持,但通常个性化程度有限。本研究提出了一种基于提示工程的框架,用于在各学科和课程中个性化通用的LLM/RAG AI教学助手,如Jill Watson。该框架通过六个学习者特定维度来调整响应:自我评估、抽象偏好、啰嗦程度偏好、感知取向、信息处理风格和理解水平,从而生成96个不同的学习者档案。此外,学生的问题还使用布鲁姆认知分类法进行分析,以估算互动层面的认知复杂度。学习者属性和认知评估被编码为结构化提示,以条件化LLM,而无需重新训练模型。该框架通过使用NLP指标的实验和与五名参与者的人类研究进行评估。结果显示,在不同个性化条件下,响应风格和结构存在感知差异,统计分析识别出与可测量响应变化相关的学习者属性。这些发现提供了初步证据,表明基于提示的个性化可以支持由LLM驱动的教育代理的自适应行为。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03402 (HTTP 429)

Authors: Saptarshi Basu, Sandeep Kakar, Ashok Goel

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03402.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03402

Published: 2026-09-06T01:20:32.388Z


6. Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

Abstract:People increasingly turn to large language models (LLMs) for everyday advice, making ethically charged interpersonal problems a practical moral-advisory context. Most prior work has studied this context through single-turn judgments or pressure-laden rebuttals, assumptions that poorly match how guidance is sought in real-world contexts. These assumptions leave unclear whether narration alone, without an explicit opposing position, can shift model judgments during multi-turn moral consultation. Yet real-world moral-conflict conversation often elicits one party’s self-justifying account, which can unfold over multiple turns and create information asymmetry. We introduce \textbf{narrative captivity}, a failure mode in which a model treats an unopposed one-sided account as complete and aligns with the narrator’s interpretation without seeking missing perspectives. To measure this phenomenon, we build a benchmark of $5{,}078$ interpersonal-conflict scenarios spanning six moral dimensions. Across 17 LLMs, narrative captivity is widespread: end-state judgments under multi-turn narration shift by 25 percentage points on average beyond the matched single-turn baseline. Stage-level analysis identifies preference optimization as a major contributor, while four inference-time strategies provide only partial mitigation. We hope our project fosters LLM advisors that preserve independent judgment in real-world consultation.

中文摘要

摘要:人们越来越多地依赖大型语言模型(LLM)来获取日常建议,使得带有伦理色彩的人际问题成为实际的道德咨询场景。以往的大多数研究都是通过单轮判断或压力驱动的反驳来研究这一场景,这些假设与现实世界中获取指导的方式不完全匹配。这些假设让我们不清楚单纯叙述——即没有明确对立立场的情况下——是否能够在多轮道德咨询中改变模型的判断。然而,现实世界中的道德冲突对话通常会引发一方的自我辩解,这种过程可能跨越多轮并造成信息不对称。我们引入了\textbf{叙事俘获}概念,这是模型将未受挑战的单方面叙述视为完整,并在未经寻求缺失视角的情况下与叙述者的解释保持一致的一种失效模式。为了测量这一现象,我们构建了一个包含 $5{,}078$ 个跨越六个道德维度的人际冲突场景的基准数据集。在17个LLM中,叙事俘获现象普遍存在:在多轮叙述下的最终判断,相较于匹配的单轮基线平均偏移了25个百分点。阶段级分析表明,偏好优化是主要原因,而四种推理时策略仅能部分缓解这一问题。我们希望本项目能够推动LLM顾问在现实咨询中保持独立判断。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03407 (HTTP 429)

Authors: Yuhe Wu, Guangyu Wang, Yujie Chen, Jiatong Zhang, Yuran Chen, Yutong Zhang, Xiyin Cheng, Wenpeng Cao, Zhuang Liu, Guang Zhang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03407.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03407

Published: 2026-09-06T01:20:32.388Z


7. Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy Detection

Abstract:LLM-empowered paper-code discrepancy detection has received growing concern since the scaling of research submissions exceeds the manual review capability. However, the limited context capacity and one-sided discrepancy detection of existing single-agent LLM paradigms lead to an inferior recall performance in detecting discrepancies. In this paper, we propose Dude, the first Dual-Detection Multi-Agent System for paper-code discrepancy detection. We discover that the granularity asymmetry of the paper-language and code-language introduces over-interpretation and over-reporting challenges in a multi-agent system design for discrepancy detection, resulting in increasing false positives. To address this, we propose a granularity-aligned negotiation and a two-stage salience-filtering mechanism in Dude, which effectively prevents agents from falsely reporting discrepancies. Experimental results in real-world paper-code discrepancy datasets showcase Dude’s significant recall and precision improvement by up to 22.8%, increasing F1 score by up to 18.7% compared to baseline methods.

中文摘要

摘要:随着研究提交量超过人工审查能力,利用大型语言模型(LLM)进行论文-代码不一致检测越来越受到关注。然而,现有单代理 LLM 范式的有限上下文容量和片面不一致检测导致在检测不一致时召回率表现较差。在本文中,我们提出了 Dude,这是第一个用于论文-代码不一致检测的双重检测多代理系统。我们发现,论文语言与代码语言的粒度不对称在多代理系统设计中引入了过度解释和过度报告的挑战,导致假阳性增加。为了解决这一问题,我们在 Dude 中提出了粒度对齐协商和两阶段显著性过滤机制,有效防止代理错误报告不一致。在真实世界论文-代码不一致数据集上的实验结果显示,Dude 在召回率和精确率上相较于基线方法显著提升,提升幅度最高可达 22.8%,F1 分数最高提升 18.7%.

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*论文-代码差异检测(paper-code discrepancy detection)\*\*中,现有基于大语言模型(LLM)的方法在召回率(recall)与精确率(precision)上的双重不足,具体可归纳为以下两个层面: ### 1. 单智能体范式的固有局限 现有单智能体LLM方法在检测论文与其开源代码之间的不一致性时,存在两个根本性缺陷: - \*\*上下文容量受限\*\*:单智能体难以在有限的上下文窗口内同时对冗长的论文手稿与大型代码库进行联合推理。 - \*\*单向检测偏差\*\*:现有方法通常仅执行\*\*论文导向检测(paper-oriented detection)\*\*,即从论文中提取研究声明后在代码中搜寻对应实现。这种单向策略虽然能发现“论文-代码冲突”与“代码遗漏”等显式差异,却\*\*无法有效识别仅从代码侧才能观察到的“论文遗漏(paper-omission)”差异\*\*(如图1所示),导致整体召回率低下。 ### 2. 多智能体双向检测中的粒度不对称挑战 为弥补单向检测的不足,论文进一步指出,简单地采用多智能体进行\*\*双向检测(dual-detection)\*\*(即同时执行论文导向与代码导向检测)会因论文自然语言与代码语言之间的\*\*粒度不对称(granularity asymmetry)\*\*而引入新的误报风险: - \*\*过度解释(Over-interpretation)\*\*:在论文导向检测中,论文描述往往高度凝练、抽象,代码智能体容易对其实现方式做出无依据的推断,将自身臆测的“应有实现”当作论文声明,从而在代码实际采用了另一种合理实现时错误地报告差异。 - \*\*过度报告(Over-reporting)\*\*:在代码导向检测中,代码实现过于具体、细粒度,代码智能体容易将环境配置、辅助函数等非核心、非科研贡献相关的工程实现也提取为“研究声明”,导致论文智能体在后续验证中产生大量假阳性差异。 ### 核心目标 为应对上述问题,论文提出了 \*\*Dude(Dual-Detection Multi-Agent System)\*\*,旨在通过专门设计的\*\*粒度对齐协商机制(granularity-aligned negotiation)\*\*与\*\*两阶段显著性过滤机制(two-stage salience-filtering)\*\*,在缓解单智能体上下文压力与单向检测局限的同时,抑制多智能体系统中的过度解释与过度报告,从而\*\*在提升召回率的同时保持高精确率\*\*,实现更为全面、可靠的自动化论文-代码差异检测。 Q2: 有哪些相关研究? 该论文的相关研究可归纳为以下三个主要方向: ### 1. 论文与代码中的错误检测 现有工作通常将论文错误检测与代码错误检测视为两个独立领域。 - \*\*论文错误检测\*\*:涵盖逻辑问题识别、数据计算错误核查、无效论证检测,以及有缺陷的证明或实验设计分析等方面。 - \*\*代码错误检测\*\*:包括代码-注释不一致检测、程序缺陷修复、代码可复现性评估,以及代码质量评价等任务。 这些工作仅聚焦于单一模态(仅论文或仅代码),未能处理论文描述与代码实现之间的跨模态一致性问题。 ### 2. 论文-代码差异检测 近期研究开始关注论文与关联代码库之间的不一致性,代表性工作包括: - \*\*SciCoQA\*\*:构建了真实的论文-代码差异数据集,并揭示了当前最先进的单智能体LLM在此任务上表现欠佳(最佳模型召回率仅为46%)。 - \*\*BioCon\*\*:针对生物信息学领域,研究论文与软件设计之间的不一致性。 然而,上述工作均局限于\*\*单智能体范式\*\*,受限于上下文容量与单向检测偏差,难以全面发现所有潜在差异(尤其是仅从代码侧可见的“论文遗漏”)。 ### 3. 多智能体LLM协作 为应对复杂的长程任务,研究者们从单智能体推理拓展至多智能体协作,主要进展包括: - \*\*任务分解\*\*:将复杂任务拆解为细粒度子任务,并分配给多个专门化智能体,以缓解单个智能体的上下文负担。 - \*\*领域定制化框架\*\*:针对特定任务属性设计的协作框架(如医疗推理、软件开发)。 - \*\*类人类协作范式\*\*:借鉴人类协作流程(如多智能体辩论),通过智能体间的讨论与聚合提升决策质量。 该论文指出,尽管多智能体协作在复杂任务中展现出潜力,但将其直接应用于论文-代码差异检测时,会因论文语言与代码语言的\*\*粒度不对称\*\*而引入过度解释与过度报告问题,需要专门机制加以约束。 Q3: 论文如何解决这个问题? 该论文提出 \*\*Dude(Dual-Detection Multi-Agent System)\*\*,通过任务分解、专用智能体协作,以及两个核心机制——\*\*粒度对齐协商\*\*与\*\*两阶段显著性过滤\*\*——来系统性地解决上述问题。具体解决方案如下: ### 1. 系统架构:双检测多智能体设计 Dude 将差异检测任务形式化为:

Y = M(P, C)
其中 P 表示论文手稿, C 表示关联代码库, Y 为最终差异报告。系统包含四类专用智能体,并将检测流程划分为三个阶段: - **专用智能体**:论文声明提取器(Paper Claimer)、代码验证器(Code Verifier)、代码声明提取器(Code Claimer)、论文验证器(Paper Verifier)、论文协商器(Paper Negotiator)、代码协商器(Code Negotiator),以及协调器(Orchestrator)。 - **三阶段流程**: 1. **论文导向检测(Paper-oriented Detection)**:从论文提取研究声明,在代码中验证。 2. **代码导向检测(Code-oriented Detection)**:从代码提取显著实现,在论文中验证。 3. **报告生成(Report Generation)**:整合双向检测结果,分类差异类型。 通过双向检测,Dude 能够同时发现“论文-代码冲突”“代码遗漏”以及单智能体难以发现的“论文遗漏”。 —- ### 2. 缓解过度解释:粒度对齐协商机制 在论文导向检测中,论文描述 Di 通常高度凝练,而代码实现 I_i 具体且低层。为避免代码验证器对高层描述进行无依据推断,Dude 引入了**多轮粒度对齐协商**。 **流程如下**: 1. **声明初始化**:论文声明提取器从 P 中提取研究声明的论文描述 D_i ;若涉及外部工作,利用网络工具 T_w 获取外部知识 K(ext)^i 对 D_i 进行细化:

Di = A(pc)(P, K_(ext)^i)

  1. **代码定位与验证**:代码验证器利用代码搜索工具 T_c 在代码库 C 中定位对应实现 I_i ,并给出匹配结果 M_i 与解释 E_i :
    I_i = T_c(D_i, C)

Mi, E_i = A(cv)(D_i, I_i)

  1. **迭代协商精炼**:协调器维护一份检查清单 L = Li(i=1)^(Np) ,记录每条声明解释的有效性。在第 j 轮协商中: - **论文协商器**审查解释 E_i^j 是否存在过度解释(unsupported extrapolation)。若存在,则基于原始论文 P 对描述进行细化:
    D_i^(j+1) = A
    (pn)(D_i^j, E_i^j, P)
  • **代码协商器**基于细化后的描述 Di^(j+1) 重新定位代码 I_i^(j+1) ,更新匹配结果与解释:
    M_i^(j+1), E_i^(j+1) = A
    (cn)(Di^(j+1), I_i^(j+1))
    整体协商过程可形式化为:
    D_i^(j+1), M_i^(j+1), E_i^(j+1) = f
    (neg)(D_i^j, M_i^j, E_i^j, A), quad ∀ i
  1. **终止条件**:当所有声明状态均为有效( Li = valid, ∀ i ),或达到预设最大协商轮数 r 时,协调器终止协商,输出经核查的论文导向声明集合 R_p = R_i mid O_i = p 。 该机制通过论文侧逐步提供越来越具体、有文本依据的描述,约束代码侧的推断空间,从而抑制过度解释导致的假阳性。 —- ### 3. 缓解过度报告:两阶段显著性过滤机制 在代码导向检测中,代码库包含大量与科研贡献无关的辅助实现。为避免将这些非显著代码报告为差异,Dude 设计了**两阶段显著性过滤**。 **第一阶段:锚点引导过滤(Anchor-guided Filtering)** 代码声明提取器 A(cc) 在提取代码实现 I_i 时,首先检查已有论文导向声明 R_p 以避免重复生成。随后,利用**类别级领域知识** K_a 作为锚点(涵盖 Algorithm、Model、Loss、Evaluation、Data、Training 六类),引导智能体识别真正值得审计的显著实现(如核心逻辑、架构细节、损失定义、评估协议等),从而过滤掉大量琐碎的辅助代码:

Ii = A(cc)(Rp, C, K_a)
**第二阶段:相关性过滤(Relevance-based Filtering)** 代码显著性并非代码的内在属性,而是依赖于论文语境。同一实现(如 INT8 量化模块)在模型压缩论文中至关重要,但在注意力架构论文中可能无关紧要。因此,论文验证器 A
(pv) 执行相关性过滤 f(filter)(·) ,评估代码实现 I_i 与论文 P 的相关性,仅保留与论文贡献高度相关的声明,剔除无关实现:
D_i = f
(filter)(A(pv), P, I_i)
随后,论文验证器对保留下来的声明进行一致性验证:
M_i, E_i = A
(pv)(D_i, I_i)
最终输出代码导向声明集合 R_c = R_i mid O_i = c 。该两阶段过滤有效抑制了代码智能体对非核心工程实现的过度报告。 —- ### 4. 差异分类与报告生成 协调器将论文导向声明 R_p 与代码导向声明 R_c 合并,根据匹配结果 M_i 与声明来源 O_i 判定差异类型 t_i :

t_i = Conflict, & M_i ∈ ∂, mismatch Paper-omission, & M_i = unfound, O_i = c Code-omission, & M_i = unfound, O_i = p
其中,匹配(matched)的声明被排除,不一致(partial/mismatch)的声明归为论文-代码冲突,未找到(unfound)的声明则根据来源分别归类为论文遗漏或代码遗漏。 通过上述架构与机制,Dude 在缓解单智能体上下文瓶颈与单向检测局限的同时,有效桥接了论文语言与代码语言之间的粒度不对称,实现了高召回率与高精确率的论文-代码差异检测。 Q4: 论文做了哪些实验? 该论文围绕所提框架 **Dude** 开展了一系列系统性实验,涵盖标准数据集基准测试、真实世界论文验证、消融实验、参数敏感性分析及补充评估。具体实验内容如下: ## 1. 实验设置 ### 数据集与模型 - **数据集**:在公开数据集 **SciCoQA**(Baumgärtner and Gurevych, 2026)上进行主要评估;此外,额外选取了 **20 篇**来自 ICML 2025 与 ICLR 2026 的已发表论文及其公开代码库,用于验证在最新真实世界研究上的检测能力。 - **骨干模型**:评估了四种闭源与开源大语言模型,包括 **GPT-5.4**、**DeepSeek-V4-Pro**、**Kimi** 与 **Claude-4.6**。补充实验还报告了 **GPT-5.5** 的结果。 ### 对比基线 实验对比了单智能体与多智能体两类基线: - **Single-LM**:单智能体直接生成差异报告(SciCoQA 默认方法)。 - **Prompt-LM**:单智能体,但通过提示工程要求其执行论文导向与代码导向的双向检测。 - **Vanilla-MA**:多智能体执行双向检测,但**不含**论文中的协商与两阶段过滤机制。 - **MAD(Multi-Agent Debate)**:基于多智能体辩论的验证方法。 ### 评估指标与实现 - 采用 **LLM-as-a-Judge** 协议(使用 Gemini-3.1 Pro 作为裁判)评估报告差异与 SciCoQA 标注的一致性。 - 主要指标为 **Recall(召回率)**、**Precision(精确率)** 与 **F1 分数**,同时统计 **Token 消耗量**。 - Dude 默认协商轮数设置为 r = 2 。 —- ## 2. 主要实验结果 ### 整体性能对比 如论文表 2 所示,在 SciCoQA 数据集上: - Dude 在 GPT-5.4 与 DeepSeek-V4 两种设置下均显著优于所有基线。 - 相较于单智能体最佳基线,Dude 的**召回率**提升最高达 **22.8%**,**精确率**提升最高达 **9.0%**,**F1 分数**提升最高达 **18.7%**。 - Vanilla-MA 虽然通过多智能体双向检测获得了较高的召回率提升,但精确率大幅下降(相比 Single-LM 下降超过 17%);而 Dude 在获得相近召回增益的同时,保持了高精确率(93.67% on GPT-5.4),验证了协商与过滤机制的有效性。 - 在 Token 开销方面,Dude 在所有多智能体方法中额外消耗最低(相较于 Single-LM 仅增加约 7%–22%)。 ### 按差异类型的细粒度召回分析 论文图 3 展示了在三种差异类型(论文-代码冲突、代码遗漏、论文遗漏)上的召回率对比: - Dude 在全部三种差异类型以及全部四种 LLM 骨干上均一致优于 Single-LM。 - 尤其在 **论文遗漏(Paper Omission)** 类别上,Dude 的平均召回率提升最为显著(最高达 **28.5%**),证实了双向检测机制对发现“仅能从代码侧观测的差异”至关重要。 ### 异构 LLM 分配的鲁棒性 论文表 3 测试了论文侧与代码侧使用不同 LLM(GPT-5.4 与 DeepSeek-V4)组合时的性能: - 即使在混合分配配置下,Dude 仍保持了稳健的 F1 性能(0.9114–0.9367)。 - 实验发现,**替换论文侧智能体对整体性能的影响大于替换代码侧智能体**,表明论文侧智能体的能力在差异检测中起更关键作用。 —- ## 3. 消融实验 如论文表 4 所示,通过在 SciCoQA 上移除关键模块进行消融: - **移除粒度对齐协商机制(w/o Negotiation)**:导致召回率与精确率双降(GPT-5.4 上 F1 下降 5.85%),说明协商对弥合论文与代码的粒度不对称不可或缺。 - **移除两阶段显著性过滤(w/o Saliency-Filtering)**:精确率出现灾难性下降(GPT-5.4 上下降 **19.41%**,F1 下降 8.83%),证实了过滤机制对抑制代码侧过度报告、减少假阳性的核心作用。 —- ## 4. 参数敏感性分析 论文图 4 分析了协商轮数 r 对性能的影响: - 随着 r 从 0 增加到 2,召回率、精确率与 F1 均单调提升。 - 当 r = 2 时性能达到饱和,继续增加轮数不再带来显著提升。这表明绝大多数研究声明可在两轮协商内解决,因此默认设置 r = 2 在效果与成本间取得了平衡。 —- ## 5. 最新真实世界研究验证 针对 20 篇最新顶级会议论文的实验结果(论文表 5 与附录表 6)显示: - Dude 报告了 **45 个**有效差异,仅次于 Vanilla-MA(46 个),但仅产生 **3 个**无效差异,**精确率达到 93.75%**,为所有方法中最高。 - Vanilla-MA 虽然检出最多有效差异,但同时产生了 21 个无效差异,精确率仅为 68.66%。 - 在完整的 Recall / Precision / F1 对比中(附录表 6),Dude 的 F1(87.38%)显著优于所有基线。 —- ## 6. 补充实验与分析 ### 在 GPT-5.5 上的评估 附录表 7 显示,所有方法均从更强的 GPT-5.5 骨干中获益,但 Single-LM 的召回率仍仅为 64.13%。Dude 在 GPT-5.5 上达到 **82.61% 召回率**与 **88.89% F1**,相较于 Single-LM 提升召回率 18.48%,证明了 Dude 的设计在更先进的模型上依然有效。 ### LLM-as-a-Judge 的可靠性验证 - 在 50 个抽样案例上,Gemini-3.1 Pro 与人工专家判断的一致率达到 **94%**。 - Gemini-3.1 Pro 与另一裁判模型 Qwen-3.6 的一致率为 **88%**,表明所采用的自动评估协议具有合理可靠性。 ### Token 消耗细粒度分析 附录图 5 与图 6 按智能体与按检测阶段分解了 Token 开销: - **论文声明提取器(Paper Claimer)** 消耗最高(约 25%),主要源于外部材料检索。 - **论文导向检测阶段** 占总 Token 消耗的 **73%** 以上,是两阶段过滤与多轮协商的主要成本来源。 ### 代表性失败案例分析 附录 D.4 展示了 Dude 的局限: - **假阳性示例**:将未明确标注为“演示”的 `.ipynb` 笔记本中的非官方设置误认为权威实现。 - **假阴性示例**:遗漏了隐式差异——代码使用 Sigmoid 将输出限制在 (0,1) ,而论文公式描述为标准无界 MLP,此类不一致需要深层数值推理而非表面匹配。 Q5: 有什么可以进一步探索的点? 基于该论文的工作内容与局限性分析,以下是若干值得进一步探索的研究方向: ### 1. 提升 Token 效率与降低推理成本 论文明确指出,尽管 Dude 在所有多智能体方法中 token 开销最低,但其消耗仍高于单智能体基线。未来可探索: - 设计更轻量级的智能体协作协议,减少多轮协商中的上下文冗余; - 引入上下文压缩、记忆机制或层级化摘要技术,降低论文侧外部材料检索与代码侧长程依赖分析的成本; - 采用小模型 specialist 与大模型 orchestrator 混合架构,将高频子任务卸载至高效轻量模型。 ### 2. 增强隐式差异(Implicit Discrepancies)的检测能力 论文的失败案例分析表明,Dude 的假阴性主要源于隐式差异——如代码通过激活函数隐式限制数值范围,而论文公式描述为无界输出。此类差异无法通过表面文本匹配发现。未来可研究: - 结合静态程序分析(如抽象解释、符号执行)或动态执行追踪,捕获代码深层语义行为; - 设计针对数值一致性、张量形状推导、控制流等价性验证的专门推理模块,弥补纯 LLM 在精确语义推理上的不足。 ### 3. 扩展至更先进的异构 LLM 与模型配置 受限于推理成本,论文未能全面评估 GPT-5.5、Claude-Opus-4.7 等最新骨干模型。此外,消融实验暗示论文侧智能体对整体性能影响更大。未来可深入探索: - 在更多前沿 LLM 上验证 Dude 的鲁棒性与泛化性; - 系统研究论文侧与代码侧智能体的能力不对称性,开发自适应模型分配策略(如为论文侧分配更强的推理模型)。 ### 4. 从检测走向自动修复与建议生成 当前 Dude 仅聚焦于不一致的识别与分类。下一步可探索自动生成修复建议或补丁: - 针对检测到的冲突,生成代码修改建议或论文描述改写方案; - 构建人机协同的修复工作流,使研究者能够基于智能体报告快速对齐论文与代码。 ### 5. 支持多模态论文内容的一致性校验 现有工作主要处理自然语言文本与源代码。然而,研究论文包含大量数学公式、算法伪代码、表格配置与架构图,这些模态同样可能存在与代码实现的不一致。未来可扩展 Dude 以支持: - 跨模态对齐(如图表结构与代码实现的比对); - 公式级别的语义解析与等价性验证,而非仅依赖文本描述。 ### 6. 跨学科与跨编程语言的泛化 SciCoQA 及论文的验证集集中于 AI/计算机科学领域。未来可探索: - 将框架适配至生物信息学、物理学、化学等需要开源代码复现的学科,注入领域特定的锚点知识 K_a ; - 支持多语言代码库(如 C++、CUDA、Julia),处理跨语言实现或高性能计算代码中的差异。 ### 7. 动态执行与复现性验证的融合 当前检测基于静态代码与论文文本的比对。引入动态分析可进一步提升可靠性: - 实际执行代码并进行单元测试、数值结果比对,验证论文声明的超参数、收敛行为或评估指标; - 构建“静态检测 + 动态复现”的混合验证管线,捕捉仅在运行时暴露的差异(如随机种子处理、环境依赖导致的不可复现性)。 ### 8. 更细粒度的差异分类与结构化解释 当前差异被粗粒度地划分为 Conflict、Paper-omission 与 Code-omission。未来可建立更精细的本体分类体系: - 区分算法逻辑不一致、超参数不匹配、损失函数系数差异、评估协议偏差等; - 输出结构化、可解释的报告,直接映射到论文章节与代码文件的具体位置,降低人工复核成本。 ### 9. 集成至学术评审与科研 CI/CD 管线 可将差异检测工具化,嵌入学术出版与开源研发的常规流程: - 在论文投稿时自动触发论文-代码一致性检查,作为 reproducibility checklist 的一部分; - 在代码仓库的持续集成(CI)流程中设置增量检测,监控后续代码更新与已发表论文的偏离。 Q6: 总结一下论文的主要内容 本文提出 **Dude(Dual-Detection Multi-Agent System)**,首个面向论文-代码差异检测的双检测多智能体系统,旨在解决现有大语言模型(LLM)方法在召回率与精确率上的双重瓶颈。以下从研究动机、核心挑战、方法设计与实验验证四个维度总结论文主要内容。 —- ### 1. 研究背景与动机 论文-代码差异检测旨在识别研究论文中的学术声明与开源代码实现之间的不一致,对维护科研成果的可信度与可复现性至关重要。随着投稿量激增,人工审查已难以覆盖。现有基于**单智能体 LLM** 的自动化方法存在两大局限: - **上下文容量受限**:单智能体难以在有限上下文窗口内联合推理冗长论文与大型代码库。 - **单向检测偏差**:现有方法多仅执行**论文导向检测**(从论文提取声明后在代码中验证),虽能发现“论文-代码冲突”与“代码遗漏”,却 inherently 无法识别仅从代码侧可观测的**论文遗漏(paper omission)**,导致召回率低下(最佳模型在 SciCoQA 数据集上仅达 46% 召回率)。 —- ### 2. 核心挑战:粒度不对称 为克服单向检测局限,论文指出需引入**代码导向检测**以形成双向检测。然而,论文自然语言与代码语言之间存在固有的**粒度不对称(granularity asymmetry)**,直接部署多智能体将引发两类假阳性问题: - **过度解释(Over-interpretation)**:在论文导向检测中,论文声明通常高度凝练抽象,代码智能体易对其实现方式进行无文本依据的推断,将臆测的实现当作论文声明,从而在实际代码采用另一合理实现时误报差异。 - **过度报告(Over-reporting)**:在代码导向检测中,代码智能体易将环境配置、辅助函数等非核心工程实现也提取为“研究声明”,导致大量琐碎差异被误报。 实验表明,简单的多智能体双向检测(Vanilla-MA)虽能提升召回率(+16.30%),却会导致精确率大幅下降(-17.34%)。 —- ### 3. 方法设计:Dude 框架 Dude 将差异检测任务形式化为 Y = M(P, C) ,其中 P 为论文, C 为代码库, Y 为差异报告。系统由四类专用智能体(声明提取器、验证器、协商器、协调器)与三阶段流程构成: #### 3.1 双检测架构 - **论文导向检测**:论文声明提取器从 P 提取研究声明描述 D_i ,经外部知识检索细化后,由代码验证器在 C 中定位实现 I_i 并验证一致性,输出匹配结果 M_i 与解释 E_i 。 - **代码导向检测**:代码声明提取器从 C 提取显著代码实现 I_i ,由论文验证器在 P 中检索对应描述 D_i 并验证一致性。 #### 3.2 粒度对齐协商机制 针对论文导向检测中的过度解释,Dude 引入**多轮迭代协商**: - **论文协商器**审查代码验证器提供的解释 E_i ,识别其中无依据的推断;若存在过度解释,则基于原始论文 P 对声明描述 D_i 进行细化,使其更加具体、有文本支撑。 - **代码协商器**基于细化后的 D_i^(j+1) 重新定位代码并更新匹配结果 M_i^(j+1) 与解释 E_i^(j+1) 。 - 协调器维护检查清单,驱动协商循环直至所有声明解释均有效或达到最大轮数 r (默认 r=2 )。 #### 3.3 两阶段显著性过滤机制 针对代码导向检测中的过度报告,Dude 引入: - **锚点引导过滤(Anchor-guided Filtering)**:利用类别级领域知识 K_a (涵盖 Algorithm、Model、Loss 等六类)作为锚点,引导代码声明提取器识别真正显著的实现,剔除环境配置等琐碎代码。 - **相关性过滤(Relevance-based Filtering)**:由论文验证器评估代码实现 I_i 与论文 P 的相关性,仅保留与论文贡献高度相关的声明进行后续验证,抑制语境无关差异的误报。 #### 3.4 差异分类与报告生成 协调器合并双向检测结果,并基于匹配结果 M_i 与声明来源 O_i ∈ p, c 将差异分类为:

t_i = Conflict, & M_i ∈ ∂, mismatch Paper-omission, & M_i = unfound, O_i = c Code-omission, & M_i = unfound, O_i = p
—- ### 4. 实验验证 论文在 **SciCoQA** 数据集及 **20 篇** ICML 2025 / ICLR 2026 最新发表论文上进行了系统评估,使用 GPT-5.4、DeepSeek-V4-Pro、Kimi、Claude-4.6 等模型。 - **整体性能**:Dude 相比单智能体最佳基线,在 SciCoQA 上实现召回率提升最高达 **22.8%**,精确率提升最高达 **9.0%**,F1 提升最高达 **18.7%**,且在多智能体方法中 token 额外消耗最低。 - **细粒度分析**:Dude 在“论文遗漏”类别上召回率提升最为显著(最高 **28.5%**),证实了双向检测对发现隐式遗漏的有效性。 - **消融实验**:移除协商机制导致 F1 显著下降;移除显著性过滤则导致精确率灾难性下降(GPT-5.4 上下降 19.41%),验证了两类模块的必要性。 - **真实世界验证**:在 20 篇最新论文中,Dude 以 **93.75%** 的精确率报告了 45 个有效差异,在检出能力与可靠性间达到最佳平衡。 —- ### 5. 主要贡献 - **揭示单智能体局限**:系统分析了单智能体 LLM 在论文-代码差异检测中召回率低下的根源——单向检测偏差。 - **提出 Dude 框架**:设计了首个双检测多智能体系统,通过粒度对齐协商与两阶段显著性过滤,有效桥接论文与代码的粒度不对称。 - **实证显著增益**:在真实世界数据集与最新发表论文上验证了 Dude 在召回率与精确率上的双重提升,为自动化科研可复现性保障提供了坚实基础。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Weijie Liu, Running Zhao, Wenhao Yuan, Jinfeng Xu, Zhanfeng Xu, Xiaoxi Zhang, Edith Cheuk-Han Ngai

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03416.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03416

Published: 2026-09-06T01:20:32.388Z


8. DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

Abstract:Full-duplex voice agents must continuously decide when to listen, backchannel, interrupt, handle speech overlaps, take the floor, and yield. Existing benchmarks largely test these behaviors through explicit turn-management instructions, while deployed agents are often configured through roles or personas from which the appropriate conversational behavior must be inferred. We introduce DuplexSpeechBench-IFEval (DSB-IFEval) for evaluating implicit instruction-following in real-time spoken interaction. (DSB-IFEval) comprises 1,038 test cases spanning eight diverse assistant roles and evaluates five conditioning protocols for instruction-following: default behavior, explicit behavioral instructions, persona-implied behavior, combined persona—rule conditioning, and instruction conflict. We measure real-time floor management using a deterministic Instruction Adherence Score (IAS) and persona-consistent content using LLM-judged Persona Adherence Score (PAS). Across six real-time speech systems, we find architecture-dependent trade-offs. Full duplex models like F-Actor and PersonaPlex are more sensitive to whether conversational behavior is stated explicitly or must be inferred from a persona, with adherence dropping by 9.7% and 4.5%, respectively, under persona-only conditioning. In contrast, GPT-Realtime, MiniCPM-o, and Fun-Audio-Chat strongly adhere to persona-consistent content, but their floor behavior does not adapt across explicit and persona-only instructions and remains constrained on several proactive actions. We further find that even if systems reliably follow conflicting directives to their prescribed persona, they still struggle to override them under safety conflict. These results show that inferring the behavior implied by a role, executing it at the appropriate conversational moment, and resolving competing instructions remain distinct challenges for full-duplex voice agents.

中文摘要

摘要:全双工语音代理必须不断决定何时聆听、回应、打断、处理语音重叠、取得发言权以及让出话语权。现有的基准测试大多通过明确的轮次管理指令来检验这些行为,而实际部署的代理通常通过角色或人格进行配置,从中必须推断出适当的会话行为。我们提出了 DuplexSpeechBench-IFEval(DSB-IFEval)用于评估实时语音互动中隐式指令的遵循情况。DSB-IFEval 包含 1,038 个测试案例,涵盖八种多样的助手角色,并评估五种指令遵循条件:默认行为、明确行为指令、人格隐含行为、人格与规则结合的条件以及指令冲突。我们使用确定性指令遵循分(Instruction Adherence Score, IAS)来衡量实时轮次管理,并使用大型语言模型评估的人格遵循分(Persona Adherence Score, PAS)衡量人格一致内容。在六种实时语音系统中,我们发现存在依赖于架构的权衡。全双工模型如 F-Actor 和 PersonaPlex 对会话行为是否明确说明或必须从人格中推断非常敏感,在仅凭人格条件下,遵循率分别下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 对人格一致的内容有很强的遵循性,但其轮次行为在明确指令与仅人格指令之间没有适应变化,且在若干主动行为上仍受限。我们进一步发现,即使系统可靠地遵循与其人格规定的相冲突指令,它们在安全冲突下仍难以覆盖这些指令。这些结果表明,为全双工语音代理推断角色所隐含的行为、在适当的会话时刻执行该行为以及解决竞争指令仍然是独立的挑战。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03423 (HTTP 429)

Authors: Puneet Mathur, Dinesh Manocha

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03423.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03423

Published: 2026-09-06T01:20:32.388Z


9. Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUI Agents

Abstract:Graphical user interface (GUI) agents are increasingly used to execute natural-language instructions on user interfaces, yet real users may issue infeasible instructions due to benign mistakes. A reliable agent should not only know how to act, but also when not to act. In this work, we introduce CONFLICTGUI, a benchmark covering instruction-internal conflicts and instruction-GUI context conflicts to study conflict-aware termination. Our evaluation reveals severe execution-biased overcompliance: agents that perform well on feasible tasks often continue to execute blindly under conflicting instructions. To mitigate this behavior, we propose CONFLICTGUARD, an inference-time framework that aligns an agent’s feasibility awareness with its action generation. CONFLICTGUARD contains two coupled components: a feasibility verification protocol that guides the agent to assess instruction logic and GUI-side evidence before acting, and a conditional action modulation mechanism that steers agents from over-compliant execution into termination-oriented behavior. Experiments across five widely-used agents demonstrate that CONFLICTGUARD improves average conflict task success rate significantly, while preserving normal GUI-task performance. These results validate that a lightweight inference-time intervention can substantially boost GUI Agent’s competence to identify inappropriate execution scenarios and refrain from unnecessary actions.

中文摘要

摘要:图形用户界面(GUI)代理越来越多地用于在用户界面上执行自然语言指令,但真实用户可能会由于无意的错误而发出不可行的指令。一个可靠的代理不仅应该知道如何采取行动,还应该知道何时不采取行动。在本工作中,我们提出了CONFLICTGUI,这是一个涵盖指令内部冲突和指令与GUI上下文冲突的基准,用于研究冲突感知的终止行为。我们的评估显示了严重的执行偏向过度遵从:在可行任务上表现良好的代理在面对冲突指令时仍常盲目执行。为了缓解这种行为,我们提出了CONFLICTGUARD,这是一个推理时框架,用于将代理的可行性意识与其动作生成对齐。CONFLICTGUARD包含两个耦合组成部分:一个可行性验证协议,引导代理在行动前评估指令逻辑和GUI端证据,以及一个条件动作调节机制,将代理从过度遵从的执行引导向以终止为导向的行为。在五种广泛使用的代理上的实验表明,CONFLICTGUARD显著提高了冲突任务的平均成功率,同时保持了正常GUI任务的性能。这些结果验证了轻量级推理时干预可以显著增强GUI代理识别不适当执行场景并避免不必要动作的能力。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03438 (HTTP 429)

Authors: Zhaoyuan Huang, Tianjie Ju, Pengzhou Cheng, Zheng Wu, Yansi Li, Chuanbiao Song, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03438.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03438

Published: 2026-09-06T01:20:32.388Z


10. Beyond “Made with AI”: Visualizing Provenance Density to Mitigate the Transparency Penalty

Abstract:As generative AI makes polished prose cheap to produce, users can no longer rely on fluency as a proxy for truth. We call this failure mode the Fluency Trap: users trust fluent hallucinations while also discounting accurate content once it is disclosed as AI-generated. Binary ``Made with AI’’ labels respond with authorship disclosure, but they do not show what supports a claim. We propose Provenance Density, an evidence-visualization interface that shows the density of verified claims in a text. In a user study with 81 participants, an idealized Provenance Density interface produced a large discernment gap between truth and fabrication ($+4.15$ points, $d=1.82$), whereas participants given no signal showed no detectable discrimination. A technical audit with 200 samples shows that retrieval density alone is insufficient; unexpectedly, the Consistency Veto carries most of the discriminative signal on dynamic queries. As AI-generated content becomes indistinguishable from human writing, effective transparency must move from authorship disclosure toward evidence visualization.

中文摘要

摘要:随着生成式人工智能让精炼的文字变得廉价,用户不再能依赖流畅性来判断真实性。我们将这种失效模式称为“流畅性陷阱”:用户会信任流畅的幻觉内容,同时在内容被披露为 AI 生成后会贬低其准确性。“AI 创作”二元标签虽然提供了作者身份披露,但并未显示支持某一论断的依据。我们提出了来源密度(Provenance Density),一种证据可视化界面,用于显示文本中经过验证的论断密度。在一项涉及 81 名参与者的用户研究中,理想化的来源密度界面在真实与虚构内容之间产生了较大的鉴别差距(+4.15 分,d=1.82),而没有信号提示的参与者则未显示出可察觉的辨别能力。对 200 个样本的技术审计显示,仅凭检索密度是不够的;出乎意料的是,一致性否决(Consistency Veto)在动态查询上提供了大部分区分信号。随着 AI 生成内容与人类写作难以区分,有效的透明度必须从作者身份披露转向证据可视化。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03460 (HTTP 429)

Authors: Qing Zhang, Yifei Huang, Juyoung Lee, Thad Starner, Jun Rekimoto

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03460.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03460

Published: 2026-09-06T01:20:32.388Z


Evaluation Domain Papers

1. Structure and Implementation of New Practical English Textbooks Driven by Artificial Intelligence

Abstract:Artificial intelligence is changing the form of applied English materials from fixed paper sequences to adaptive learning systems that can diagnose learners, recommend tasks, and provide formative feedback. This paper studies the structure and application of a new practical English textbook driven by artificial intelligence. A five-layer architecture is proposed: knowledge mapping, learner profiling, task generation, feedback orchestration, and teacher-side governance. A prototype was tested on 186 non-English-major undergraduates for eight weeks of teaching. Compared with a static digital textbook, the proposed system increased the unit completion accuracy from 72.4% to 84.9%, raised the average score for speaking tasks by 10.8 points, and reduced the teacher’s correction time by 31.6%. Therefore, an AI-driven textbook can maintain the stability of the curriculum while providing personalised learning paths, rich practice materials and traceable classroom data.

中文摘要

摘要:人工智能正在将应用型英语教材的形式从固定的纸质序列转变为能够诊断学习者、推荐任务并提供形成性反馈的自适应学习系统。本文研究了由人工智能驱动的新型实用英语教材的结构与应用。提出了五层架构:知识映射、学习者画像、任务生成、反馈协调和教师端管理。对186名非英语专业本科生进行了为期八周的教学原型测试。与静态数字教材相比,该系统使单元完成准确率从72.4%提高至84.9%,口语任务平均分提高10.8分,并将教师批改时间减少了31.6%。因此,人工智能驱动的教材可以在保持课程稳定性的同时,提供个性化学习路径、丰富的练习材料和可追踪的课堂数据。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.02981 (HTTP 429)

Authors: Ya Wang, Lei Zhang, Xueguang Yang, Bo Chen

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.02981.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.02981

Published: 2026-09-06T01:20:51.292Z


2. MasterControl Seventeen Every Time

Abstract:We study a governed approach to enterprise analytics: a language model interprets the question, while deterministic policy selects and runs a pre-approved analytical program that returns both results and evidence. We show that this restriction can remain expressive within a defined analytical class, using relational operations plus aggregation, comparison, windows, ranking, and similarity. Fixed meaning, policy, data, and execution rules also make results replayable. Across 440 runs, three 8B models generated SQL and selected tools at runtime, while Qwen3-8B interpreted intent only and policy executed the approved program. None of 330 runtime-planning episodes matched the full answer-and-evidence contract across all test datasets; the policy-executed analyzer matched 110 of 110. This is a configuration-specific result, not evidence that runtime agents cannot succeed under other designs.

中文摘要

摘要:我们研究了一种受控的企业分析方法:语言模型解释问题,而确定性策略选择并运行预先批准的分析程序,该程序返回结果和证据。我们展示了这种限制在定义的分析类别内仍然可以保持表达能力,使用关系操作加上聚合、比较、窗口、排序和相似性。固定的意义、策略、数据和执行规则还使结果可重放。在440次运行中,三种8B模型在运行时生成SQL并选择工具,而Qwen3-8B仅解释意图,策略执行批准的程序。在330个运行时规划的实例中,没有一个完全匹配所有测试数据集的完整答案与证据合同;策略执行的分析器匹配了110/110次。这是特定配置的结果,而不是证明运行时代理在其他设计下无法成功。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03209 (HTTP 429)

Authors: MasterControl AI Lab

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03209.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03209

Published: 2026-09-06T01:20:51.292Z


3. Speculative Macro Commit for Faster Tool-Using Agents

Abstract:Tool-using LLM agents spend wall-clock time not only on model inference but also in serial action—observation turns, where each tool call, environment transition, and observation can delay subsequent decisions. We introduce \textbf{Speculative Macro Commit} (SMC), a runtime mechanism for a two-tier agent system: a large authoritative actor model produces the official trajectory, while a faster speculative drafter model continuously predicts and executes future action chains on an isolated environment snapshot. SMC mines recurring multi-action skeletons from training traces and stores them in a macro library used to match against action chains predicted by the drafter at runtime. When the actor’s next tool call matches the first drafted action, SMC commits the remaining pre-executed draft steps, together with their observations, to the official trajectory. Using Qwen3.5-27B INT4 as the authoritative actor model and Qwen3.5-4B as the speculative drafter model, SMC matches the sequential agent’s overall accuracy while reducing latency by 10.23\% over the Speculative Actions (SA) baseline and 18.59\% over sequential execution on the $\tau^2$-Bench Telecom subset. On AppWorld, SMC reduces wall time by 7.7\% over SA baseline and 44.9\% over sequential execution, with a small reduction in task completion. Overall, SMC provides a practical way to reuse multi-step speculative execution and reduce agent latency beyond single-step speculative actions. Our code is publicly available \href{this https URL}{\textcolor{magenta}{here}}.

中文摘要

摘要:使用工具的LLM代理不仅花费大量时间在模型推理上,还在串行操作中——观察回合,每个工具调用、环境切换和观察都可能延迟后续决策。我们引入了\textbf{Speculative Macro Commit}(SMC),这是一种两层代理系统的运行时机制:大型权威演员模型生成官方轨迹,而更快的推测起草模型则持续预测并执行隔离环境快照中的未来动作链。SMC从训练轨迹中挖掘重复的多动作骨架,并将其存储在宏库中,用于与生成器在运行时预测的动作链匹配。当actor的下一个工具调用与第一个草拟动作匹配时,SMC将剩余的预执行草稿步骤及其观察数据提交到官方轨迹中。以Qwen3.5-27B INT4为权威行为者模型,Qwen3.5-4B作为推测性设计模型,SMC在$\tau^2$-Bench电信子集上,匹配顺序行动(SA)基线的延迟10.23\%,在$\tau^2$-Bench电信子集的顺序执行中降低18.59%。在AppWorld上,SMC较SA基线减少7.7%的墙壁时间,较顺序执行减少44.9%,任务完成度略有下降。总体而言,SMC提供了一种实用方式,可重用多步推测执行,并降低代理延迟,超越单步推测操作。我们的代码公开发布 \href{this https URL}{\textcolor{magenta}{here}}。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03236 (HTTP 429)

Authors: Zeyu Liu, Souvik Kundu, Peter A. Beerel

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03236.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03236

Published: 2026-09-06T01:20:51.292Z


4. Fresh Memory, Stale Plans: Dependency-Scoped Validation for Distributed LLM-Agent Memory

Abstract:Distributed LLM-agent teams can read the latest shared facts and still act on an obsolete plan. A planner may derive an action from requirement $r_3$, another agent may commit $r_4$, and an executor may receive $r_4$ without replacing the plan derived from $r_3$. We call this \emph{stale-plan execution}: state freshness does not establish that the plan authorizing an action remains valid. We introduce PlanFence, a dependency-scoped action-validation protocol. Plans cite the exact public records they used, and an executor validates only the records that can affect the pending external action, replanning once or blocking when validation is incomplete. In 30 controlled live workflows with a post-plan revision, a freshness-only executor acts on the obsolete plan in every task, whereas PlanFence completes all tasks without an invalid action. Controlled replay reveals two conditional boundaries: proactive synchronization yields lower coordination stall at low churn, while PlanFence avoids repeated update-path coordination as churn grows and avoids validating unrelated state as the shared keyspace grows. These are controlled safety and systems-cost results, not general task-accuracy gains.

中文摘要

摘要:分布式大型语言模型代理团队可以读取最新的共享事实,但仍可能在一个过时的计划上采取行动。一个计划者可能会从需求 $r_3$ 推导出一个动作,另一个代理可能执行 $r_4$,而执行者可能收到 $r_4$ 时并未替换从 $r_3$ 推导的计划。我们称之为\emph{陈旧计划执行}:状态的新鲜度并不能保证授权某个动作的计划仍然有效。我们提出了 PlanFence,一种依赖范围限定的动作验证协议。计划引用它们使用的确切公共记录,执行者仅验证可能影响待处理外部动作的记录,验证不完整时会重新规划一次或阻塞。在 30 个经过后期计划修订的受控实时工作流中,仅依赖新鲜度的执行者在每个任务中都按过时计划行动,而 PlanFence 完成了所有任务且没有发生无效动作。受控重放揭示了两个条件边界:主动同步在低变动时降低了协调阻塞,而 PlanFence 随着变动增加避免了重复的更新路径协调,并且随着共享关键空间的增长避免验证无关状态。这些是受控的安全性和系统成本结果,并非一般任务准确性提升。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文针对分布式大语言模型(LLM)智能体系统中的 \*\*stale-plan execution(过时计划执行)\*\* 问题,提出了一种依赖范围限定的动作验证机制。具体而言,论文试图解决的核心问题可归纳如下: --- ### 1. 核心问题:状态新鲜度与计划有效性之间的脱节 在分布式多智能体环境中,公共任务状态通常被复制到各智能体的本地内存中。即使执行者(executor)读取到了最新的共享事实(例如一条已被修订的需求 r_4 ),它仍可能依据一个基于旧版本(例如 r_3 )生成的过时计划 p(r_3) 去调用外部工具。论文将此类故障定义为 \*\*stale-plan execution\*\*: - 规划者(planner)基于需求 r_3 推导出计划 p(r_3) ; - 在计划执行前,另一智能体提交了修订版本 r_4 ; - 执行者虽通过背景传播收到了 r_4 ,但并未替换本地缓存的计划 p(r_3) ; - 结果,执行者使用源自旧需求的参数调用外部工具(例如预订已取消的订单、部署已废弃的构建版本)。 关键洞察在于:\*\*执行者本地状态的“新鲜”并不足以保证待执行计划的授权仍然有效\*\*。即

Fresh local state nRightarrow Valid plan lineage.
—- ### 2. 形式化目标:血统有效性(Lineage Validity) 论文将安全不变量形式化为 **lineage validity**。对于受保护的外部动作 a ,设: - L(a) 为授权该动作的计划根节点; - D(a) ⊂eq X 为工具包装器声明的、可能影响该动作的公共键集合; - F_a(x) 为计划实际使用的、键 x 的记录版本; - H(x) 为键 x 的当前所有者授权版本(head)。 则动作 a 在验证点有效的充要条件为:

Valid(a) iff Fa(x) = H(x),quad ∀ x ∈ D(a).
论文指出,若无精确的父级链接(exact parent IDs)和动作时的依赖验证,执行者无法仅凭本地副本判断待执行计划是否仍被当前公共记录授权。 —- ### 3. 系统层面的权衡问题 在识别上述安全缺口后,论文进一步探讨了实现该不变量时的系统代价权衡,对应三个研究问题: - **RQ1**:智能体是否可能在读取最新状态后,仍执行过时计划? ——答案是肯定的,仅靠状态新鲜度无法防止。 - **RQ2**:当公共状态频繁变更时,是在每次更新时主动同步(proactive synchronization)代价更低,还是在动作即将执行前按需验证代价更低? ——论文发现低变更率下主动同步的协调阻塞更低,高变更率下动作时验证更优。 - **RQ3**:当共享状态空间增长时,仅检查动作相关的依赖集 D(a) 是否比检查全部共享键 X 更能降低协调成本? ——依赖范围限定能避免序列化无关状态,在稀疏依赖场景下显著降低延迟与流量。 —- ### 4. 提出的解决方案:PLANFENCE 为在动作边界上建立血统有效性,论文设计了 **PLANFENCE** 协议: - **精确衍生记录**:每个计划引用其生成时所使用的精确公共记录版本(不可变记录 ID); - **依赖声明**:工具包装器显式声明 D(a) ,即哪些公共键可能影响该动作; - **动作边界门控**:执行者在调用外部工具前,仅针对 D(a) 中的键向权威所有者查询当前 head H(x) ,并与计划中的依赖前沿 F_a(x) 比对; - **一次重规划后失败闭合**:若发现不匹配,允许拉取最新记录并执行一次重规划;若再次不匹配或验证不完整,则阻塞动作(fail closed)。 综上,该论文旨在解决分布式 LLM 智能体内存中 **“读了最新事实,却执行了过时计划”** 的安全漏洞,并在确保血统有效性的同时,探索依赖范围限定验证相对于全局同步和全键验证的系统代价边界。 Q2: 有哪些相关研究? 论文在第2节“Related Work”中系统梳理了相关研究,并将其归纳为三大领域。以下按研究脉络分类概述: —- ### 1. 数据来源与乐观并发控制(Provenance and Validation) 该领域关注如何记录衍生对象的输入来源,并在操作提交前验证读集合是否仍然有效。 - **数据溯源(Data Provenance)**:Buneman、Khanna 与 Wang-Chiew(2001)提出了数据来源的特征化方法,用于记录哪些输入产生了一个衍生对象。 - **乐观并发控制(Optimistic Concurrency Control)**:Kung 与 Robinson(1981)提出在事务提交前验证其读集合是否仍保持当前状态。 **与 PLANFENCE 的区别**:上述工作针对的是数据库事务提交的边界。PLANFENCE 将同样的底层思想应用于**智能体工具边界**——LLM 生成的计划可能跨角色调用、副本和状态刷新长期存在,除非运行时记录精确的父级版本,否则执行者在动作边界将没有读集合可供验证。 —- ### 2. 分布式一致性与内存模型(Distributed Consistency) 该领域提供了多种暴露当前副本状态的方式,或在一致性与延迟之间做应用级权衡。 - **强一致性、主动复制与 CRDTs**:包括 CAP 定理的形式化(Gilbert & Lynch, 2002)、现代分布式数据库中的一致性权衡(Abadi, 2012)、消息传递系统中的健壮共享内存(Attiya et al., 1995)、流行病式复制算法(Demers et al., 1987),以及无冲突复制数据类型(Shapiro et al., 2011)。 - **一致性分级与云存储 SLA**:Kraska 等(2009)提出一致性配给;Li 等(2012)提出“必要时一致”;Terry 等(2013)提出基于一致性的服务等级协议;Bailis 等(2012)提出概率有界陈旧性。 **与 PLANFENCE 的区别**:PLANFENCE 并未引入新的一致性模型,而是**指定了哪些记录版本必须授权待执行动作**;它可以建立在主动传播或动作时所有者查询之上,但不依赖于某一种特定的副本一致性机制。 —- ### 3. LLM 多智能体协作与记忆(LLM-Agent Coordination and Memory) 该领域涵盖智能体角色协作结构、记忆检索与共享、以及持久世界中的可执行制品。 #### 3.1 多智能体协作框架 - **角色化多智能体系统**:AutoGen(Wu et al., 2023)、MetaGPT(Hong et al., 2024)、CAMEL(Li et al., 2023)、ChatDev(Qian et al., 2024)等框架将任务划分为不同角色并在独立进程或设备上运行。 - **交互优化与架构搜索**:包括通过多智能体辩论提升事实性(Du et al., 2024)、将语言智能体视为可优化图的 GPTSwarm(Zhuge et al., 2024)、经济型通信管道(Zhang et al., ICLR 2025)以及多智能体架构搜索(Zhang et al., ICML 2025)。 - **交互协议**:Anthropic 的模型上下文协议 MCP(2024)与 Google 的 Agent2Agent(A2A)协议(2025)提供了工具与智能体交互的标准接口。 #### 3.2 智能体记忆系统 - **记忆管理**:MemGPT(Packer et al., 2023)将 LLM 视为操作系统管理记忆;A-MEM(Xu et al., 2025)提出智能体记忆;Mem0(Chhikara et al., 2025)关注可扩展长期记忆;Reflexion(Shinn et al., 2023)利用语言反馈进行强化学习;Voyager(Wang et al., 2023)关注开放式具身智能体。 - **共享与架构视角**:Yu 等(2026)从计算机体系结构视角审视多智能体记忆;Rezazadeh 等(2025)研究多用户动态访问控制下的记忆共享;Wang 与 Chen(2025)提出 MIRIX 多智能体记忆系统。 #### 3.3 持久世界与智能体生成制品 - **SwarmWorld**(Pal et al., 2026):研究了语言模型智能体社会中的持久世界,记录内容寻址的父子程序血统,允许后续智能体继承和修改持久程序,并在共享世界持续演化的同时提交模型生成的计划。 **与 PLANFENCE 的区别**:现有工作主要关注“智能体应通信、检索或保留什么内容”,或支持程序继承与归属的技术血统。PLANFENCE 则利用**精确的衍生血统(exact derivation lineage)**来确定:一个待执行动作是否仍被其**动作相关的公共输入**的当前版本所授权。这是一种面向动作边界的、依赖范围限定的验证机制,而非全局内存 freshness 或持久制品的演化机制。 Q3: 论文如何解决这个问题? 论文通过 **PLANFENCE**(Dependency-Scoped Action-Validation Protocol)解决 stale-plan execution 问题。其核心思路是将**安全不变量**(动作的血统必须有效)与**建立该不变量的系统机制**(何时、以何种范围进行检查)分离,并在**外部动作边界**实施依赖范围限定的验证。具体解决路径可分为以下层面: —- ### 1. 精确衍生记录:绑定计划与不可变输入版本 PLANFENCE 要求每个公共记录都是不可变的,并通过**语义键**(semantic key) x ∈ X 标识逻辑项,通过**不可变记录 ID** 标识具体版本。任何衍生记录(包括智能体生成的计划)在写入时必须附加**精确的父级 ID**(exact parent IDs),记录它是从哪些确切版本的公共输入推导而来。 - 若计划 p 由需求 r_3 推导,则 p 必须显式引用 r_3 的记录 ID(如 id_3 ),而非仅引用语义键 x
(req) 。 - 这意味着,即使后续修订版 r_4 已提交,计划 p 携带的仍是 id_3 的血统证据;执行者不会仅因本地已安装 r_4 就误以为 p 仍然有效。 —- ### 2. 动作依赖声明:限定验证范围 PLANFENCE 不要求在每次状态更新时验证全部共享状态,也不要求执行前检查整个键空间。相反,它要求**工具包装器**(tool wrapper)在应用代码层面显式声明一个依赖集合:

D(a) ⊂eq X
表示哪些公共键的值可能影响该受保护动作 a 。例如,一次预订动作可能只依赖于需求键和可用性键,而与无关的目录记录或其他工作流状态无关。 —- ### 3. 血统有效性的形式化条件 在动作执行前的验证点,PLANFENCE 检查**血统有效性**(lineage validity)。设: - L(a) 为授权动作 a 的计划根节点; - F_a(x) 为从 L(a) 沿精确父级链追溯到的、键 x 的记录版本(依赖前沿); - H(x) 为键 x 的权威所有者 o(x) 当前授权的版本(head)。 则动作 a 有效的充要条件为:

Valid(a) iff F_a(x) = H(x),quad ∀ x ∈ D(a).
该条件直接回答 RQ1:执行者读取最新状态 local_head=H(x) 并不足够;必须验证计划实际使用的版本 F_a(x) 是否与 H(x) 一致。 —- ### 4. 动作边界门控:Algorithm 1 的执行流程 PLANFENCE 在执行外部调用前运行**依赖范围限定的验证门控**,其算法流程如下: 1. **血统遍历**:从计划根 L(a) 出发,沿本地精确父级链遍历,直至到达 D(a) 中各语义键的边界。若任何父级链不完整、依赖边界缺失或所有者映射缺失,则**阻塞**(blocked)。 2. **并发查询所有者**:对 D(a) 中的每个键 x ,并发向其所有者 o(x) 查询当前授权版本 H(x) 。若响应不可用、损坏、冲突或键不匹配,则**阻塞**。 3. **增量内容获取**:仅对那些 H(x) ≠ F(x) 的键,获取并验证其最新记录内容;其余键仅比对元数据(记录 ID)。 4. **比对与决策**: - 若 F = H 且计划根确实衍生自这些前沿版本,则**授权**(authorized)。 - 若发现不匹配: - 若这是首次检测到变更(`replanned = false`),则允许**一次重规划**(replan-required):执行者拉取最新记录,用相同的角色和隔离上下文重新生成计划,然后带着新计划再次进入门控。 - 若已重规划过一次仍不匹配,或任何依赖再次变更,则**失败闭合**(blocked),禁止动作执行。 此机制确保: - 不会无限重试(最多一次 replan); - 任何验证不完整的情况均导向阻塞,而非放行。 —- ### 5. 协调成本的优化策略 PLANFENCE 通过**按需验证**与**依赖范围限定**降低系统协调成本,具体体现为: - **动作时验证 vs. 每次更新同步**:不强制在每次公共状态变更时同步所有副本(metadata sync),而是在动作即将执行时才支付验证成本。论文实验表明,当更新率 rho 较低时主动同步更优,但当 rho ≥ 4 时,PLANFENCE 的阻塞时间显著低于安全基线(图3、图4)。 - **依赖范围限定 vs. 全键验证**:不检查整个共享键空间 |X| ,仅检查 |D(a)| 个动作相关键。实验显示,当共享键从 8 增长到 128 时,PLANFENCE 的流量保持在约 8.1,KiB/action ,而批量全键验证从 16.4 增长至 81.7,KiB/action ;延迟亦显著降低(图5、表8)。 —- ### 6. 可信边界与失败闭合 PLANFENCE 的安全保证依赖于以下系统设计: - **可信计算基**:工具包装器对 D(a) 的声明必须完整;若无法静态确定,则需保守地声明更广集合。 - **良性所有者**:所有者 o(x) 必须如实返回其当前授权版本 H(x) 。 - **不可变性与认证**:公共记录不可变,传输经认证,父级链接不可篡改。 - **失败闭合**:任何父级链缺失、所有者无响应、依赖声明不完整或重规划后再次变更,均导致动作被阻塞,而非基于不完整证据执行。 综上,PLANFENCE 通过**在动作边界精确比对“计划实际使用的输入版本”与“所有者当前授权的输入版本”**,并**仅针对动作相关的依赖子集**进行该验证,解决了分布式 LLM 智能体中“读了最新事实,却执行了过时计划”的 stale-plan execution 问题。 Q4: 论文做了哪些实验? 论文的实验设计围绕三个研究问题(RQ1–RQ3)展开,结合**实时五智能体工作流**与**受控重放(controlled replay)**两种模式,辅以传输微基准测试和大量的消融实验。以下分层次梳理: —- ### 1. 实验总体设计与设置 **环境与负载** - **实时系统**:五个独立的 Qwen3.5 智能体进程,运行在预订(reservation)、履行(fulfillment)和部署(deployment)三类工作流上,每类 10 个随机种子,共 30 组任务。 - **受控重放**:固定 30 个工作流模板,通过替换模型重规划为预录制的公共决策,使不同内存策略在**相同的决策序列、更新时序和网络条件**下执行,从而将无效动作、等待时间和流量归因于策略本身而非模型输出差异。 - **网络条件**:Loopback,以及基于历史 AT&T、T-Mobile、Verizon LTE 链路的固定回放迹线(含丢包、延迟)。 - **默认参数**: N=5 个智能体, |X|=8 个共享语义键,每个动作依赖 d=1 个键, H=64 个工作单元,名义更新目标 rho ∈ 0.25, 1, 4, 16 。 **基线方法** - **不安全策略**:Local replica(直接执行本地状态)、Owner-head freshness(读取当前依赖但无血统绑定)、Metadata sync(延迟同步, K>1 )。 - **安全策略**:Centralized lineage(集中式血统服务)、Metadata sync( K=1 ,每更新即同步)、Per-key / Batched all-key validation(全键验证)、Majority-replica / All-replica validation(副本表决)、PLANFENCE。 **核心指标** - **安全性**:无效发出动作数(计划未到达当前声明输入的动作)。 - **可用性**:可用/已完成动作数。 - **协调阻塞(Coordination stall)**:等待同步或验证的时间(ms/action)。 - **分布式流量(Traffic)**:副本间及中央服务的字节数(KiB/action)。 —- ### 2. 针对三个研究问题的核心实验 #### RQ1:智能体读取最新状态后是否仍会执行过时计划? - **Table 1(受控重放,高更新负载 rho=4 )**:在 330 次调度的动作中,Local replica 和 Owner-head freshness 均发出 330/330 次无效动作;而所有强制精确血统绑定的安全策略(包括 PLANFENCE)无效动作为 0/330。 - **Table 2(实时五智能体工作流)**:在 30 个交互式任务中,Owner-head freshness 在每次任务中都发出了过时的主要动作,任务成功率为 0/30;Centralized lineage 和 PLANFENCE 均检测到变更,触发一次重规划,30/30 任务完成且无无效主要动作。 - **Appendix A.6**:对齐的策略审计覆盖 32,700 次调度动作,任何强制精确血统的方法均未出现无效动作;所有 4,143 次无效动作均来自陈旧或延迟同步的控制组。 #### RQ2:状态频繁变更时,每次更新同步与动作前验证哪个阻塞更低? - **Figure 3(跨网络与更新率的策略边界图)**:在 loopback 和三条蜂窝迹线上,比较 PLANFENCE 与 Metadata sync( K=1 )/Centralized lineage 的阻塞。低变更率( rho ≤ 1 )下,主动同步的阻塞更低;高变更率( rho ≥ 4 )下,PLANFENCE 的阻塞更低,领先优势为 1.5× 至 7.1× 。 - **Figure 4(AT&T 迹线上的同步节奏权衡)**:展示 Metadata sync 在不同 K (同步屏障间隔)下的安全-成本曲线。 K=1 时最安全但阻塞高;增大 K 降低阻塞但以牺牲安全为代价(出现无效动作);PLANFENCE 在 rho=4,16 时以零无效动作取得更低的阻塞。 - **Table 4(同步节奏消融)**:在 rho ∈ 0.25,1,4,16 下系统性地展示 K=1,2,4,8,16 的安全与成本。随着 K 增大,阻塞下降,但无效动作增加;PLANFENCE 在所有 rho 下保持 0 无效动作,且在 rho ≥ 4 时阻塞显著低于 K=1 。 - **Table 5(团队规模敏感性)**: N ∈ 3,5,8 ,高更新率下 PLANFENCE 的阻塞和流量均低于 Centralized lineage 和 Metadata sync( K=1 )。 - **Table 7(剧集长度敏感性)**: H ∈ 16,64,256 ,高更新率下的策略排序保持稳定。 #### RQ3:共享状态增长时,仅检查动作相关依赖是否比检查全部键更优? - **Table 1(八键紧凑状态)**:PLANFENCE 的阻塞为 230.8 ms/action、流量 8.1 KiB/action;Centralized lineage 为 508.6 ms/15.6 KiB;Metadata sync( K=1 )为 403.4 ms/23.5 KiB。 - **Figure 5(键空间 8–128 的比较)**:在 loopback 和 AT&T 迹线上对比 PLANFENCE 与 Batched all-key validation(同样允许一次重规划、两次验证)。随着共享键从 8 增至 128: - Loopback 阻塞:PLANFENCE 从 67.8 ms 降至 66.0 ms(基本持平),Batched all-key 从 115.5 ms 升至 199.2 ms。 - AT&T 阻塞:PLANFENCE 从 295.3 ms 升至 345.2 ms;Batched all-key 从 365.7 ms 升至 428.7 ms。 - 流量:PLANFENCE 恒定在约 8.1 KiB/action;Batched all-key 从 16.4 KiB 线性增长至 81.7 KiB/action。 - **Table 6(依赖集大小敏感性)**:固定 |X|=8 ,变化 d ∈ 1,2,8 。当 d=1 时 PLANFENCE 阻塞低 14.9%、流量低 50.6%;当 d=2 时阻塞接近打平、流量仍低 32.0%;当 d=8=|X| 时两者阻塞与流量均趋于一致(依赖范围限定失效的边界)。 - **Table 8 与 Table 9(完整键空间与独立迹线相位)**:覆盖 loopback(30 模板聚合)与 AT&T(三个独立迹线偏移 0/5/15 秒),共 13,200 次调度动作,PLANFENCE 与 Batched all-key 均完成全部有效动作,但 PLANFENCE 在几乎在所有子集中阻塞和流量更低。 —- ### 3. 附录中的补充实验 **B. 受控重放消融实验** - **学习策略选择(Table 10)**:训练神经网络(决策树、MLP、DeBERTa)在集中式 lineage、Metadata sync( K=1 )和 PLANFENCE 之间做策略选择。在分布内(ID)样本上学习器可达 95–96.7% 的安全近优选择,但在四个分布外(OOD)偏移块(Verizon 迹线、插值更新率、端点键数、复合偏移)中,没有学习器能在推理成本计入后全面超越简单的透明规则( rho ≤ 1 选同步,否则选 PLANFENCE)。 **C. 验证假设与组件敏感性** - **血统证明深度(Table 11)**:验证必须跟随**完整的传递闭包**。仅检查直接父级在链深 ell=1 时可行,但在 ell ≥ 2 时会导致错误放行;缺失中间记录时必须阻塞。 - **重规划机制(Table 11)**:仅验证不重规划会导致 3,000 次检测到的竞争全部阻塞;验证+一次重规划将其全部转为有效动作。 - **无血统/任意副本头(Table 11)**:读取新鲜需求但不检查计划血统,或信任任意副本的头,在每次竞争中都会发出无效动作。 - **依赖契约完整性(Figure 6)**:在 30 模板×100 竞争种子上,随真实依赖被遗漏的概率增加,无效动作率上升(遗漏 50% 时达 37.4%);过度声明依赖虽保持安全,但会增加所有者头检查次数。 - **失败闭合(Fail-closed)验证**:在所有者中断、血统缺失、畸形头、第二次版本变更四种情况下,失败闭合策略全部阻塞且无无效动作;对应的失败开放(fail-open)策略在四种情况下全部发出无效动作。 —- ### 4. 传输微基准测试 - **Figure 2**:测量单次认证 TCP 同步的阻塞时间随公共状态大小(2 KiB 至 8 MiB)和丢包率(0–10%)的变化。该实验说明单次同步在有利路径上开销低,但随着内容增长或链路恶化会显著增加,从而为“每次更新同步”的代价提供微观依据。 Q5: 有什么可以进一步探索的点? 基于论文的局限性陈述与系统设计边界,以下方向值得进一步探索: —- ### 1. 拜占庭与半诚实所有者环境下的安全验证 论文假设所有者是**良性**(benign)且诚实的。后续工作可探索: - 当所有者可能返回错误、过时或冲突的 H(x) 时,如何建立**拜占庭容错**的血统验证?例如,通过跨多个副本的密码学承诺或阈值签名来确认公共记录头的权威性,而非信任单一所有者。 - 在**所有者迁移**(owner migration)场景下,如何保持依赖链的可验证性与连续性,避免验证因所有权变更而中断。 —- ### 2. 自动化依赖声明推断 当前 PLANFENCE 要求工具包装器显式声明 D(a) ,且 Figure 6 表明遗漏真实依赖会直接破坏安全。可探索: - **静态或动态程序分析**:从工具包装器代码中自动提取其读取的公共键集合,生成 D(a) ,降低人工声明负担。 - **学习式依赖推断**:基于历史动作轨迹与输入输出关联,学习预测动作实际依赖的语义键子集,并在安全关键场景下保守地过度声明(over-declare)以确保不遗漏。 —- ### 3. 私有推理与公共血统的桥接 论文明确将私有提示(private prompts)、本地 scratchpads 和隐藏推理排除在血统模型之外。这引出了: - 当计划的推导过程部分依赖于**未写入公共状态的私有推理**时,如何在不泄露私有内容的前提下,证明该推理步骤不会改变动作对公共输入的依赖关系? - 是否可通过**零知识证明**或**差分隐私摘要**,将私有推理的“影响范围”压缩为对公共键的声明,从而纳入 D(a) 的验证框架? —- ### 4. 跨外部服务的事务原子性 PLANFENCE 的验证点与后续外部工具调用**不构成原子事务**。这意味着: - 即使验证通过,外部服务在调用瞬间仍可能因并发修改而失效。可研究如何将血统验证与外部服务调用封装为**两阶段提交**或**基于补偿事务**(Saga)的分布式事务,尤其当动作涉及多个外部 API 时。 - 探索与现有 LLM 智能体协议(如 MCP、A2A)的集成,将 PLANFENCE 作为事务协调器嵌入标准调用链。 —- ### 5. 动态策略选择与运行时自适应 附录 B.2 显示,学习式策略选择器在分布外(OOD)偏移下难以稳定超越透明规则( rho ≤ 1 选同步,否则选验证)。可进一步探索: - **在线 bandit 或元学习**:基于实时观测到的更新率、网络延迟和依赖稀疏度,动态切换 proactive sync 与 PLANFENCE,并给出竞争比下界。 - **分层记忆架构**:设计混合策略,对高频变更键使用 proactive sync,对稀疏依赖键使用 PLANFENCE 按需验证,并在运行时根据工作负载重分区。 —- ### 6. 超大规模键空间与复杂血统图优化 论文评估的键空间上限为 |X| = 128 。在更大规模场景下: - 当公共状态包含数万级语义键,且计划血统为**多源合并图**(multi-parent merge)而非简单链式结构时,如何设计高效的依赖前沿索引,使 F_a(x) 的遍历避免线性扫描? - 研究**内容寻址存储**(如 Merkle DAG)与增量校验和,将血统验证的通信量从 O(|D(a)|) 进一步压缩到 O(log |X|) 或更小。 —- ### 7. 大工件与多模态内容的高效血统追踪 论文的工件控制实验涉及 256 – 320,KiB 的制品,但主要关注安全路径而非成本比较。后续可探索: - 当公共记录包含大型二进制工件(如模型权重、图像、视频)时,如何在保持**精确父级链接**的同时,避免在每次验证时传输完整内容?可结合**内容寻址**与**范围哈希**(range hashing),仅校验受影响片段。 - 多模态输入(图像、音频、传感器数据)引入的**非结构化依赖**如何被显式声明并纳入 D(a) ? —- ### 8. 语义等价性与计划合并 论文假设记录版本是**不可变**且通过精确 ID 比对的。在实际 LLM 智能体系统中: - 修订记录 r_4 可能与 r_3 **语义等价**(例如仅修改了注释或格式),此时强制重规划可能造成不必要的协调成本。可探索**语义差异检测**或**松散血统等价**(loose lineage equivalence),允许在不影响动作授权的前提下跳过验证。 - 当多个智能体并发修订同一语义键时,如何基于 CRDT 或操作变换(OT)在验证层之前合并公共状态,而非简单阻塞或失败闭合? —- ### 9. 扩展至层级化与嵌套工作流 当前实验主要覆盖扁平的“规划-修订-执行”模式。更复杂的场景涉及: - **嵌套子工作流**:上层计划的 L(a) 可能派生自下层子计划的输出,形成层级血统。需要递归验证机制确保每一层的依赖前沿均保持有效。 - **长周期持久计划**:当计划的生命周期跨越小时甚至天级(如 SwarmWorld 中的持久程序),如何在执行者离线或休眠期间管理血统验证与状态租约? —- 这些方向既回应了论文 Section 6 中列出的明确限制(拜占庭容错、所有者迁移、推断依赖、语义合并、私有推理、事务边界),也将其系统权衡分析扩展到了更大规模、更动态和更异构的智能体部署环境。 Q6: 总结一下论文的主要内容 这篇论文研究分布式大语言模型(LLM)智能体系统中的 **stale-plan execution(过时计划执行)** 问题,提出并评估了名为 **PLANFENCE** 的依赖范围限定动作验证协议。以下从问题、概念、方法与实验四个方面总结主要内容。 —- ### 1. 核心问题:状态新鲜度不等于计划有效性 在分布式多智能体架构中,不同角色(如规划者、执行者)通过复制共享公共状态进行协作。一个规划者可能基于公共需求 r_3 生成计划 p(r_3) ;在动作执行前,另一智能体提交了修订版 r_4 。即使执行者的本地内存已通过背景传播更新为 r_4 ,它仍可能因未替换缓存的计划而基于 p(r_3) 调用外部工具(例如预订已取消的订单、部署已废弃的构建)。 论文将此故障定义为 **stale-plan execution**,并指出其根源在于:

Fresh local state nRightarrow Valid plan authorization.
即,执行者读取了最新事实,并不意味着授权该动作的**计划推导血统**仍然有效。 —- ### 2. 安全不变量:血统有效性(Lineage Validity) 论文将动作的安全条件形式化为 **lineage validity**。对于受保护的外部动作 a ,设: - L(a) 为授权动作的计划根节点; - D(a) ⊂eq X 为工具声明的、可能影响该动作的公共语义键集合; - F_a(x) 为从 L(a) 沿精确父级链追溯到的键 x 的记录版本(依赖前沿); - H(x) 为键 x 的权威所有者当前授权的版本(head)。 则动作有效的充要条件为:

Valid(a) iff F_a(x) = H(x),quad ∀ x ∈ D(a).
该条件表明:必须验证计划**实际使用的精确输入版本**与所有者**当前授权的输入版本**是否一致,而非仅检查执行者本地是否持有最新状态。 —- ### 3. PLANFENCE:依赖范围限定的动作验证协议 为实现上述不变量,论文设计了放置于**外部动作边界**的 PLANFENCE 门控,包含三个核心机制: - **精确衍生记录**:任何公共记录(包括计划)写入时必须附加不可变的精确父级 ID,从而建立完整的血统链。 - **依赖声明**:工具包装器显式声明 D(a) ,限定动作的相关公共键集合,避免检查无关状态。 - **动作时验证与一次重规划**:执行前,执行者并发查询 D(a) 中各键的所有者,比对 F_a(x) 与 H(x) 。若不一致,允许拉取最新记录并**重规划一次**;若再次不一致或验证不完整,则**阻塞动作**(fail closed)。 PLANFENCE 的关键设计在于将**安全不变量**(血统有效)与**系统机制**(何时、以何种范围检查)分离:它仅在动作即将执行时,对动作相关的依赖子集进行验证。 —- ### 4. 实验发现 论文通过 30 组实时五智能体工作流(Qwen3.5)与大规模受控重放(32,700 次调度动作)回答三个研究问题: - **RQ1(状态新鲜度是否足够?)**:仅检查本地状态新鲜度的方法在 30/30 任务中均发出无效动作;而强制精确血统的 PLANFENCE 与集中式血统服务均完成 30/30 任务且无无效动作。 - **RQ2(同步策略边界)**:在 rho ≤ 1 (低变更率)时,每次更新主动同步(metadata sync, K=1 )的协调阻塞更低;在 rho ≥ 4 (高变更率)时,PLANFENCE 的阻塞显著更低(领先 1.5× 至 7.1× ),因为它避免了为每次更新支付全局协调成本。 - **RQ3(依赖范围 vs. 全键验证)**:当共享键空间从 8 增至 128 时,PLANFENCE 的流量稳定在约 8.1,KiB/action ,而批量全键验证从 16.4 增至 81.7,KiB/action ;延迟亦显著降低。当依赖集 D(a) 接近完整键空间时,两者的优势边界自然收敛。 —- ### 5. 主要贡献 - **问题识别与形式化**:首次明确区分分布式智能体内存中的“状态新鲜”与“计划血统有效”,定义 stale-plan execution 与 lineage validity。 - **协议设计与实现**:提出 PLANFENCE,一种在动作边界绑定精确公共输入、验证依赖子集并支持一次重规划后失败闭合的协议。 - **系统代价边界刻画**:在相同的调度与网络迹线下,比较多种安全协调策略,量化了“主动同步”与“动作时验证”、“依赖范围”与“全键验证”之间的协调阻塞与流量交叉边界。 论文明确其结论为**受控安全性与系统代价结果**,而非对一般任务准确性的普遍提升。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Evan Chen, Shiqiang Wang, Christopher G. Brinton

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03340.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03340

Published: 2026-09-06T01:20:51.292Z


5. A Prompt-Engineering Approach to Develop Scalable, Flexible, and Real-Time Hybrid Micro-Level Personalization in a General Purpose AI Teaching Assistant

Abstract:Artificial intelligence (AI) teaching assistants powered by large language models (LLMs) offer scalable educational support but often provide limited personalization. This study presents a prompt-engineering-based framework for personalizing general-purpose LLM/RAG-based AI teaching assistants such as Jill Watson across academic disciplines and courses. The framework adapts responses using six learner-specific dimensions: self-assessment, abstraction preference, verbosity preference, perceptual orientation, information processing style, and level of understanding, yielding 96 distinct learner profiles. Student queries are additionally analyzed using Bloom’s Taxonomy to estimate cognitive complexity at the interaction level. Learner attributes and cognitive assessments are encoded in structured prompts that condition the LLM without requiring model retraining. The framework is evaluated through experiments using NLP metrics and a human study with five participants. Results show perceived differences in response style and structure across personalization conditions, with statistical analyses identifying learner attributes associated with measurable response changes. These findings provide preliminary evidence that prompt-based personalization can support adaptive behavior in LLM-powered educational agents.

中文摘要

摘要:由大型语言模型(LLM)驱动的人工智能(AI)教学助手能够提供可扩展的教育支持,但通常个性化程度有限。本研究提出了一种基于提示工程的框架,用于在各学科和课程中个性化通用的LLM/RAG AI教学助手,如Jill Watson。该框架通过六个学习者特定维度来调整回应:自我评估、抽象偏好、啰嗦程度偏好、感知取向、信息处理风格和理解水平,从而产生96个不同的学习者档案。此外,学生的问题还使用布鲁姆认知分类法进行分析,以估算互动层面的认知复杂度。学习者属性和认知评估被编码为结构化提示,以条件化LLM,而无需重新训练模型。该框架通过使用NLP指标的实验和与五名参与者的人类研究进行评估。结果显示,在不同个性化条件下,回应的风格和结构存在感知上的差异,统计分析发现了与可测量回应变化相关的学习者属性。这些发现初步表明,基于提示的个性化可以支持由LLM驱动的教育代理的自适应行为。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03402 (HTTP 429)

Authors: Saptarshi Basu, Sandeep Kakar, Ashok Goel

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03402.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03402

Published: 2026-09-06T01:20:51.292Z


6. Caught in the Story: Narrative Captivity in Multi-turn LLMs Conversation

Abstract:People increasingly turn to large language models (LLMs) for everyday advice, making ethically charged interpersonal problems a practical moral-advisory context. Most prior work has studied this context through single-turn judgments or pressure-laden rebuttals, assumptions that poorly match how guidance is sought in real-world contexts. These assumptions leave unclear whether narration alone, without an explicit opposing position, can shift model judgments during multi-turn moral consultation. Yet real-world moral-conflict conversation often elicits one party’s self-justifying account, which can unfold over multiple turns and create information asymmetry. We introduce \textbf{narrative captivity}, a failure mode in which a model treats an unopposed one-sided account as complete and aligns with the narrator’s interpretation without seeking missing perspectives. To measure this phenomenon, we build a benchmark of $5{,}078$ interpersonal-conflict scenarios spanning six moral dimensions. Across 17 LLMs, narrative captivity is widespread: end-state judgments under multi-turn narration shift by 25 percentage points on average beyond the matched single-turn baseline. Stage-level analysis identifies preference optimization as a major contributor, while four inference-time strategies provide only partial mitigation. We hope our project fosters LLM advisors that preserve independent judgment in real-world consultation.

中文摘要

摘要:人们越来越多地依赖大型语言模型(LLM)来获取日常建议,这使得涉及伦理问题的人际问题成为一种实际的道德咨询场景。以往的大多数研究都是通过单轮判断或压力导向的反驳来研究这一场景,这些假设与现实世界中获取指导的方式不完全匹配。这些假设让我们不清楚单纯叙述——即没有明确对立立场的情况下——是否能够在多轮道德咨询中改变模型的判断。然而,现实世界中的道德冲突对话通常会引发一方的自我辩解,这种过程可能持续多轮并产生信息不对称。我们提出了“叙事囚禁”(narrative captivity)概念,这是模型将未受挑战的单方面叙述视为完整,并依照叙述者的解释进行调整而不寻求缺失视角的一种失败模式。为了衡量这一现象,我们构建了一个包含 5,078 个跨越六个道德维度的人际冲突场景的基准测试。在 17 种 LLM 中,叙事囚禁现象普遍存在:在多轮叙述下的最终判断平均相较于匹配的单轮基线变化达 25 个百分点。分阶段分析显示,偏好优化是主要原因,而四种推理时策略只能部分缓解这一问题。我们希望本项目能够促进 LLM 顾问在现实咨询中保持独立判断。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03407 (HTTP 429)

Authors: Yuhe Wu, Guangyu Wang, Yujie Chen, Jiatong Zhang, Yuran Chen, Yutong Zhang, Xiyin Cheng, Wenpeng Cao, Zhuang Liu, Guang Zhang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03407.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03407

Published: 2026-09-06T01:20:51.292Z


7. Dude: A Dual-Detection Multi-Agent System for Paper-Code Discrepancy Detection

Abstract:LLM-empowered paper-code discrepancy detection has received growing concern since the scaling of research submissions exceeds the manual review capability. However, the limited context capacity and one-sided discrepancy detection of existing single-agent LLM paradigms lead to an inferior recall performance in detecting discrepancies. In this paper, we propose Dude, the first Dual-Detection Multi-Agent System for paper-code discrepancy detection. We discover that the granularity asymmetry of the paper-language and code-language introduces over-interpretation and over-reporting challenges in a multi-agent system design for discrepancy detection, resulting in increasing false positives. To address this, we propose a granularity-aligned negotiation and a two-stage salience-filtering mechanism in Dude, which effectively prevents agents from falsely reporting discrepancies. Experimental results in real-world paper-code discrepancy datasets showcase Dude’s significant recall and precision improvement by up to 22.8%, increasing F1 score by up to 18.7% compared to baseline methods.

中文摘要

摘要:随着研究提交量超过人工审查能力,利用大型语言模型(LLM)进行论文-代码不一致检测越来越受到关注。然而,现有单代理 LLM 范式的有限上下文容量和片面不一致检测导致在检测不一致时召回率表现较差。在本文中,我们提出了 Dude,这是第一个用于论文-代码不一致检测的双重检测多代理系统。我们发现,论文语言与代码语言的粒度不对称在多代理系统设计中引入了过度解释和过度报告的挑战,导致假阳性增加。为此,我们在 Dude 中提出了粒度对齐协商和两阶段显著性过滤机制,有效防止代理错误报告不一致。现实世界的论文-代码不一致数据集实验结果显示,与基线方法相比,Dude 在召回率和精确度上显著提升,最高提高 22.8%,F1 分数提高最高达 18.7%。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*论文-代码差异检测(paper-code discrepancy detection)\*\*中,现有基于大语言模型(LLM)的方法在召回率(recall)与精确率(precision)上的双重不足,具体可归纳为以下两个层面: ### 1. 单智能体范式的固有局限 现有单智能体LLM方法在检测论文与其开源代码之间的不一致性时,存在两个根本性缺陷: - \*\*上下文容量受限\*\*:单智能体难以在有限的上下文窗口内同时对冗长的论文手稿与大型代码库进行联合推理。 - \*\*单向检测偏差\*\*:现有方法通常仅执行\*\*论文导向检测(paper-oriented detection)\*\*,即从论文中提取研究声明后在代码中搜寻对应实现。这种单向策略虽然能发现“论文-代码冲突”与“代码遗漏”等显式差异,却\*\*无法有效识别仅从代码侧才能观察到的“论文遗漏(paper-omission)”差异\*\*(如图1所示),导致整体召回率低下。 ### 2. 多智能体双向检测中的粒度不对称挑战 为弥补单向检测的不足,论文进一步指出,简单地采用多智能体进行\*\*双向检测(dual-detection)\*\*(即同时执行论文导向与代码导向检测)会因论文自然语言与代码语言之间的\*\*粒度不对称(granularity asymmetry)\*\*而引入新的误报风险: - \*\*过度解释(Over-interpretation)\*\*:在论文导向检测中,论文描述往往高度凝练、抽象,代码智能体容易对其实现方式做出无依据的推断,将自身臆测的“应有实现”当作论文声明,从而在代码实际采用了另一种合理实现时错误地报告差异。 - \*\*过度报告(Over-reporting)\*\*:在代码导向检测中,代码实现过于具体、细粒度,代码智能体容易将环境配置、辅助函数等非核心、非科研贡献相关的工程实现也提取为“研究声明”,导致论文智能体在后续验证中产生大量假阳性差异。 ### 核心目标 为应对上述问题,论文提出了 \*\*Dude(Dual-Detection Multi-Agent System)\*\*,旨在通过专门设计的\*\*粒度对齐协商机制(granularity-aligned negotiation)\*\*与\*\*两阶段显著性过滤机制(two-stage salience-filtering)\*\*,在缓解单智能体上下文压力与单向检测局限的同时,抑制多智能体系统中的过度解释与过度报告,从而\*\*在提升召回率的同时保持高精确率\*\*,实现更为全面、可靠的自动化论文-代码差异检测。 Q2: 有哪些相关研究? 该论文的相关研究可归纳为以下三个主要方向: ### 1. 论文与代码中的错误检测 现有工作通常将论文错误检测与代码错误检测视为两个独立领域。 - \*\*论文错误检测\*\*:涵盖逻辑问题识别、数据计算错误核查、无效论证检测,以及有缺陷的证明或实验设计分析等方面。 - \*\*代码错误检测\*\*:包括代码-注释不一致检测、程序缺陷修复、代码可复现性评估,以及代码质量评价等任务。 这些工作仅聚焦于单一模态(仅论文或仅代码),未能处理论文描述与代码实现之间的跨模态一致性问题。 ### 2. 论文-代码差异检测 近期研究开始关注论文与关联代码库之间的不一致性,代表性工作包括: - \*\*SciCoQA\*\*:构建了真实的论文-代码差异数据集,并揭示了当前最先进的单智能体LLM在此任务上表现欠佳(最佳模型召回率仅为46%)。 - \*\*BioCon\*\*:针对生物信息学领域,研究论文与软件设计之间的不一致性。 然而,上述工作均局限于\*\*单智能体范式\*\*,受限于上下文容量与单向检测偏差,难以全面发现所有潜在差异(尤其是仅从代码侧可见的“论文遗漏”)。 ### 3. 多智能体LLM协作 为应对复杂的长程任务,研究者们从单智能体推理拓展至多智能体协作,主要进展包括: - \*\*任务分解\*\*:将复杂任务拆解为细粒度子任务,并分配给多个专门化智能体,以缓解单个智能体的上下文负担。 - \*\*领域定制化框架\*\*:针对特定任务属性设计的协作框架(如医疗推理、软件开发)。 - \*\*类人类协作范式\*\*:借鉴人类协作流程(如多智能体辩论),通过智能体间的讨论与聚合提升决策质量。 该论文指出,尽管多智能体协作在复杂任务中展现出潜力,但将其直接应用于论文-代码差异检测时,会因论文语言与代码语言的\*\*粒度不对称\*\*而引入过度解释与过度报告问题,需要专门机制加以约束。 Q3: 论文如何解决这个问题? 该论文提出 \*\*Dude(Dual-Detection Multi-Agent System)\*\*,通过任务分解、专用智能体协作,以及两个核心机制——\*\*粒度对齐协商\*\*与\*\*两阶段显著性过滤\*\*——来系统性地解决上述问题。具体解决方案如下: ### 1. 系统架构:双检测多智能体设计 Dude 将差异检测任务形式化为:

Y = M(P, C)
其中 P 表示论文手稿, C 表示关联代码库, Y 为最终差异报告。系统包含四类专用智能体,并将检测流程划分为三个阶段: - **专用智能体**:论文声明提取器(Paper Claimer)、代码验证器(Code Verifier)、代码声明提取器(Code Claimer)、论文验证器(Paper Verifier)、论文协商器(Paper Negotiator)、代码协商器(Code Negotiator),以及协调器(Orchestrator)。 - **三阶段流程**: 1. **论文导向检测(Paper-oriented Detection)**:从论文提取研究声明,在代码中验证。 2. **代码导向检测(Code-oriented Detection)**:从代码提取显著实现,在论文中验证。 3. **报告生成(Report Generation)**:整合双向检测结果,分类差异类型。 通过双向检测,Dude 能够同时发现“论文-代码冲突”“代码遗漏”以及单智能体难以发现的“论文遗漏”。 —- ### 2. 缓解过度解释:粒度对齐协商机制 在论文导向检测中,论文描述 Di 通常高度凝练,而代码实现 I_i 具体且低层。为避免代码验证器对高层描述进行无依据推断,Dude 引入了**多轮粒度对齐协商**。 **流程如下**: 1. **声明初始化**:论文声明提取器从 P 中提取研究声明的论文描述 D_i ;若涉及外部工作,利用网络工具 T_w 获取外部知识 K(ext)^i 对 D_i 进行细化:

Di = A(pc)(P, K_(ext)^i)

  1. **代码定位与验证**:代码验证器利用代码搜索工具 T_c 在代码库 C 中定位对应实现 I_i ,并给出匹配结果 M_i 与解释 E_i :
    I_i = T_c(D_i, C)

Mi, E_i = A(cv)(D_i, I_i)

  1. **迭代协商精炼**:协调器维护一份检查清单 L = Li(i=1)^(Np) ,记录每条声明解释的有效性。在第 j 轮协商中: - **论文协商器**审查解释 E_i^j 是否存在过度解释(unsupported extrapolation)。若存在,则基于原始论文 P 对描述进行细化:
    D_i^(j+1) = A
    (pn)(D_i^j, E_i^j, P)
  • **代码协商器**基于细化后的描述 Di^(j+1) 重新定位代码 I_i^(j+1) ,更新匹配结果与解释:
    M_i^(j+1), E_i^(j+1) = A
    (cn)(Di^(j+1), I_i^(j+1))
    整体协商过程可形式化为:
    D_i^(j+1), M_i^(j+1), E_i^(j+1) = f
    (neg)(D_i^j, M_i^j, E_i^j, A), quad ∀ i
  1. **终止条件**:当所有声明状态均为有效( Li = valid, ∀ i ),或达到预设最大协商轮数 r 时,协调器终止协商,输出经核查的论文导向声明集合 R_p = R_i mid O_i = p 。 该机制通过论文侧逐步提供越来越具体、有文本依据的描述,约束代码侧的推断空间,从而抑制过度解释导致的假阳性。 —- ### 3. 缓解过度报告:两阶段显著性过滤机制 在代码导向检测中,代码库包含大量与科研贡献无关的辅助实现。为避免将这些非显著代码报告为差异,Dude 设计了**两阶段显著性过滤**。 **第一阶段:锚点引导过滤(Anchor-guided Filtering)** 代码声明提取器 A(cc) 在提取代码实现 I_i 时,首先检查已有论文导向声明 R_p 以避免重复生成。随后,利用**类别级领域知识** K_a 作为锚点(涵盖 Algorithm、Model、Loss、Evaluation、Data、Training 六类),引导智能体识别真正值得审计的显著实现(如核心逻辑、架构细节、损失定义、评估协议等),从而过滤掉大量琐碎的辅助代码:

Ii = A(cc)(Rp, C, K_a)
**第二阶段:相关性过滤(Relevance-based Filtering)** 代码显著性并非代码的内在属性,而是依赖于论文语境。同一实现(如 INT8 量化模块)在模型压缩论文中至关重要,但在注意力架构论文中可能无关紧要。因此,论文验证器 A
(pv) 执行相关性过滤 f(filter)(·) ,评估代码实现 I_i 与论文 P 的相关性,仅保留与论文贡献高度相关的声明,剔除无关实现:
D_i = f
(filter)(A(pv), P, I_i)
随后,论文验证器对保留下来的声明进行一致性验证:
M_i, E_i = A
(pv)(D_i, I_i)
最终输出代码导向声明集合 R_c = R_i mid O_i = c 。该两阶段过滤有效抑制了代码智能体对非核心工程实现的过度报告。 —- ### 4. 差异分类与报告生成 协调器将论文导向声明 R_p 与代码导向声明 R_c 合并,根据匹配结果 M_i 与声明来源 O_i 判定差异类型 t_i :

t_i = Conflict, & M_i ∈ ∂, mismatch Paper-omission, & M_i = unfound, O_i = c Code-omission, & M_i = unfound, O_i = p
其中,匹配(matched)的声明被排除,不一致(partial/mismatch)的声明归为论文-代码冲突,未找到(unfound)的声明则根据来源分别归类为论文遗漏或代码遗漏。 通过上述架构与机制,Dude 在缓解单智能体上下文瓶颈与单向检测局限的同时,有效桥接了论文语言与代码语言之间的粒度不对称,实现了高召回率与高精确率的论文-代码差异检测。 Q4: 论文做了哪些实验? 该论文围绕所提框架 **Dude** 开展了一系列系统性实验,涵盖标准数据集基准测试、真实世界论文验证、消融实验、参数敏感性分析及补充评估。具体实验内容如下: ## 1. 实验设置 ### 数据集与模型 - **数据集**:在公开数据集 **SciCoQA**(Baumgärtner and Gurevych, 2026)上进行主要评估;此外,额外选取了 **20 篇**来自 ICML 2025 与 ICLR 2026 的已发表论文及其公开代码库,用于验证在最新真实世界研究上的检测能力。 - **骨干模型**:评估了四种闭源与开源大语言模型,包括 **GPT-5.4**、**DeepSeek-V4-Pro**、**Kimi** 与 **Claude-4.6**。补充实验还报告了 **GPT-5.5** 的结果。 ### 对比基线 实验对比了单智能体与多智能体两类基线: - **Single-LM**:单智能体直接生成差异报告(SciCoQA 默认方法)。 - **Prompt-LM**:单智能体,但通过提示工程要求其执行论文导向与代码导向的双向检测。 - **Vanilla-MA**:多智能体执行双向检测,但**不含**论文中的协商与两阶段过滤机制。 - **MAD(Multi-Agent Debate)**:基于多智能体辩论的验证方法。 ### 评估指标与实现 - 采用 **LLM-as-a-Judge** 协议(使用 Gemini-3.1 Pro 作为裁判)评估报告差异与 SciCoQA 标注的一致性。 - 主要指标为 **Recall(召回率)**、**Precision(精确率)** 与 **F1 分数**,同时统计 **Token 消耗量**。 - Dude 默认协商轮数设置为 r = 2 。 —- ## 2. 主要实验结果 ### 整体性能对比 如论文表 2 所示,在 SciCoQA 数据集上: - Dude 在 GPT-5.4 与 DeepSeek-V4 两种设置下均显著优于所有基线。 - 相较于单智能体最佳基线,Dude 的**召回率**提升最高达 **22.8%**,**精确率**提升最高达 **9.0%**,**F1 分数**提升最高达 **18.7%**。 - Vanilla-MA 虽然通过多智能体双向检测获得了较高的召回率提升,但精确率大幅下降(相比 Single-LM 下降超过 17%);而 Dude 在获得相近召回增益的同时,保持了高精确率(93.67% on GPT-5.4),验证了协商与过滤机制的有效性。 - 在 Token 开销方面,Dude 在所有多智能体方法中额外消耗最低(相较于 Single-LM 仅增加约 7%–22%)。 ### 按差异类型的细粒度召回分析 论文图 3 展示了在三种差异类型(论文-代码冲突、代码遗漏、论文遗漏)上的召回率对比: - Dude 在全部三种差异类型以及全部四种 LLM 骨干上均一致优于 Single-LM。 - 尤其在 **论文遗漏(Paper Omission)** 类别上,Dude 的平均召回率提升最为显著(最高达 **28.5%**),证实了双向检测机制对发现“仅能从代码侧观测的差异”至关重要。 ### 异构 LLM 分配的鲁棒性 论文表 3 测试了论文侧与代码侧使用不同 LLM(GPT-5.4 与 DeepSeek-V4)组合时的性能: - 即使在混合分配配置下,Dude 仍保持了稳健的 F1 性能(0.9114–0.9367)。 - 实验发现,**替换论文侧智能体对整体性能的影响大于替换代码侧智能体**,表明论文侧智能体的能力在差异检测中起更关键作用。 —- ## 3. 消融实验 如论文表 4 所示,通过在 SciCoQA 上移除关键模块进行消融: - **移除粒度对齐协商机制(w/o Negotiation)**:导致召回率与精确率双降(GPT-5.4 上 F1 下降 5.85%),说明协商对弥合论文与代码的粒度不对称不可或缺。 - **移除两阶段显著性过滤(w/o Saliency-Filtering)**:精确率出现灾难性下降(GPT-5.4 上下降 **19.41%**,F1 下降 8.83%),证实了过滤机制对抑制代码侧过度报告、减少假阳性的核心作用。 —- ## 4. 参数敏感性分析 论文图 4 分析了协商轮数 r 对性能的影响: - 随着 r 从 0 增加到 2,召回率、精确率与 F1 均单调提升。 - 当 r = 2 时性能达到饱和,继续增加轮数不再带来显著提升。这表明绝大多数研究声明可在两轮协商内解决,因此默认设置 r = 2 在效果与成本间取得了平衡。 —- ## 5. 最新真实世界研究验证 针对 20 篇最新顶级会议论文的实验结果(论文表 5 与附录表 6)显示: - Dude 报告了 **45 个**有效差异,仅次于 Vanilla-MA(46 个),但仅产生 **3 个**无效差异,**精确率达到 93.75%**,为所有方法中最高。 - Vanilla-MA 虽然检出最多有效差异,但同时产生了 21 个无效差异,精确率仅为 68.66%。 - 在完整的 Recall / Precision / F1 对比中(附录表 6),Dude 的 F1(87.38%)显著优于所有基线。 —- ## 6. 补充实验与分析 ### 在 GPT-5.5 上的评估 附录表 7 显示,所有方法均从更强的 GPT-5.5 骨干中获益,但 Single-LM 的召回率仍仅为 64.13%。Dude 在 GPT-5.5 上达到 **82.61% 召回率**与 **88.89% F1**,相较于 Single-LM 提升召回率 18.48%,证明了 Dude 的设计在更先进的模型上依然有效。 ### LLM-as-a-Judge 的可靠性验证 - 在 50 个抽样案例上,Gemini-3.1 Pro 与人工专家判断的一致率达到 **94%**。 - Gemini-3.1 Pro 与另一裁判模型 Qwen-3.6 的一致率为 **88%**,表明所采用的自动评估协议具有合理可靠性。 ### Token 消耗细粒度分析 附录图 5 与图 6 按智能体与按检测阶段分解了 Token 开销: - **论文声明提取器(Paper Claimer)** 消耗最高(约 25%),主要源于外部材料检索。 - **论文导向检测阶段** 占总 Token 消耗的 **73%** 以上,是两阶段过滤与多轮协商的主要成本来源。 ### 代表性失败案例分析 附录 D.4 展示了 Dude 的局限: - **假阳性示例**:将未明确标注为“演示”的 `.ipynb` 笔记本中的非官方设置误认为权威实现。 - **假阴性示例**:遗漏了隐式差异——代码使用 Sigmoid 将输出限制在 (0,1) ,而论文公式描述为标准无界 MLP,此类不一致需要深层数值推理而非表面匹配。 Q5: 有什么可以进一步探索的点? 基于该论文的工作内容与局限性分析,以下是若干值得进一步探索的研究方向: ### 1. 提升 Token 效率与降低推理成本 论文明确指出,尽管 Dude 在所有多智能体方法中 token 开销最低,但其消耗仍高于单智能体基线。未来可探索: - 设计更轻量级的智能体协作协议,减少多轮协商中的上下文冗余; - 引入上下文压缩、记忆机制或层级化摘要技术,降低论文侧外部材料检索与代码侧长程依赖分析的成本; - 采用小模型 specialist 与大模型 orchestrator 混合架构,将高频子任务卸载至高效轻量模型。 ### 2. 增强隐式差异(Implicit Discrepancies)的检测能力 论文的失败案例分析表明,Dude 的假阴性主要源于隐式差异——如代码通过激活函数隐式限制数值范围,而论文公式描述为无界输出。此类差异无法通过表面文本匹配发现。未来可研究: - 结合静态程序分析(如抽象解释、符号执行)或动态执行追踪,捕获代码深层语义行为; - 设计针对数值一致性、张量形状推导、控制流等价性验证的专门推理模块,弥补纯 LLM 在精确语义推理上的不足。 ### 3. 扩展至更先进的异构 LLM 与模型配置 受限于推理成本,论文未能全面评估 GPT-5.5、Claude-Opus-4.7 等最新骨干模型。此外,消融实验暗示论文侧智能体对整体性能影响更大。未来可深入探索: - 在更多前沿 LLM 上验证 Dude 的鲁棒性与泛化性; - 系统研究论文侧与代码侧智能体的能力不对称性,开发自适应模型分配策略(如为论文侧分配更强的推理模型)。 ### 4. 从检测走向自动修复与建议生成 当前 Dude 仅聚焦于不一致的识别与分类。下一步可探索自动生成修复建议或补丁: - 针对检测到的冲突,生成代码修改建议或论文描述改写方案; - 构建人机协同的修复工作流,使研究者能够基于智能体报告快速对齐论文与代码。 ### 5. 支持多模态论文内容的一致性校验 现有工作主要处理自然语言文本与源代码。然而,研究论文包含大量数学公式、算法伪代码、表格配置与架构图,这些模态同样可能存在与代码实现的不一致。未来可扩展 Dude 以支持: - 跨模态对齐(如图表结构与代码实现的比对); - 公式级别的语义解析与等价性验证,而非仅依赖文本描述。 ### 6. 跨学科与跨编程语言的泛化 SciCoQA 及论文的验证集集中于 AI/计算机科学领域。未来可探索: - 将框架适配至生物信息学、物理学、化学等需要开源代码复现的学科,注入领域特定的锚点知识 K_a ; - 支持多语言代码库(如 C++、CUDA、Julia),处理跨语言实现或高性能计算代码中的差异。 ### 7. 动态执行与复现性验证的融合 当前检测基于静态代码与论文文本的比对。引入动态分析可进一步提升可靠性: - 实际执行代码并进行单元测试、数值结果比对,验证论文声明的超参数、收敛行为或评估指标; - 构建“静态检测 + 动态复现”的混合验证管线,捕捉仅在运行时暴露的差异(如随机种子处理、环境依赖导致的不可复现性)。 ### 8. 更细粒度的差异分类与结构化解释 当前差异被粗粒度地划分为 Conflict、Paper-omission 与 Code-omission。未来可建立更精细的本体分类体系: - 区分算法逻辑不一致、超参数不匹配、损失函数系数差异、评估协议偏差等; - 输出结构化、可解释的报告,直接映射到论文章节与代码文件的具体位置,降低人工复核成本。 ### 9. 集成至学术评审与科研 CI/CD 管线 可将差异检测工具化,嵌入学术出版与开源研发的常规流程: - 在论文投稿时自动触发论文-代码一致性检查,作为 reproducibility checklist 的一部分; - 在代码仓库的持续集成(CI)流程中设置增量检测,监控后续代码更新与已发表论文的偏离。 Q6: 总结一下论文的主要内容 本文提出 **Dude(Dual-Detection Multi-Agent System)**,首个面向论文-代码差异检测的双检测多智能体系统,旨在解决现有大语言模型(LLM)方法在召回率与精确率上的双重瓶颈。以下从研究动机、核心挑战、方法设计与实验验证四个维度总结论文主要内容。 —- ### 1. 研究背景与动机 论文-代码差异检测旨在识别研究论文中的学术声明与开源代码实现之间的不一致,对维护科研成果的可信度与可复现性至关重要。随着投稿量激增,人工审查已难以覆盖。现有基于**单智能体 LLM** 的自动化方法存在两大局限: - **上下文容量受限**:单智能体难以在有限上下文窗口内联合推理冗长论文与大型代码库。 - **单向检测偏差**:现有方法多仅执行**论文导向检测**(从论文提取声明后在代码中验证),虽能发现“论文-代码冲突”与“代码遗漏”,却 inherently 无法识别仅从代码侧可观测的**论文遗漏(paper omission)**,导致召回率低下(最佳模型在 SciCoQA 数据集上仅达 46% 召回率)。 —- ### 2. 核心挑战:粒度不对称 为克服单向检测局限,论文指出需引入**代码导向检测**以形成双向检测。然而,论文自然语言与代码语言之间存在固有的**粒度不对称(granularity asymmetry)**,直接部署多智能体将引发两类假阳性问题: - **过度解释(Over-interpretation)**:在论文导向检测中,论文声明通常高度凝练抽象,代码智能体易对其实现方式进行无文本依据的推断,将臆测的实现当作论文声明,从而在实际代码采用另一合理实现时误报差异。 - **过度报告(Over-reporting)**:在代码导向检测中,代码智能体易将环境配置、辅助函数等非核心工程实现也提取为“研究声明”,导致大量琐碎差异被误报。 实验表明,简单的多智能体双向检测(Vanilla-MA)虽能提升召回率(+16.30%),却会导致精确率大幅下降(-17.34%)。 —- ### 3. 方法设计:Dude 框架 Dude 将差异检测任务形式化为 Y = M(P, C) ,其中 P 为论文, C 为代码库, Y 为差异报告。系统由四类专用智能体(声明提取器、验证器、协商器、协调器)与三阶段流程构成: #### 3.1 双检测架构 - **论文导向检测**:论文声明提取器从 P 提取研究声明描述 D_i ,经外部知识检索细化后,由代码验证器在 C 中定位实现 I_i 并验证一致性,输出匹配结果 M_i 与解释 E_i 。 - **代码导向检测**:代码声明提取器从 C 提取显著代码实现 I_i ,由论文验证器在 P 中检索对应描述 D_i 并验证一致性。 #### 3.2 粒度对齐协商机制 针对论文导向检测中的过度解释,Dude 引入**多轮迭代协商**: - **论文协商器**审查代码验证器提供的解释 E_i ,识别其中无依据的推断;若存在过度解释,则基于原始论文 P 对声明描述 D_i 进行细化,使其更加具体、有文本支撑。 - **代码协商器**基于细化后的 D_i^(j+1) 重新定位代码并更新匹配结果 M_i^(j+1) 与解释 E_i^(j+1) 。 - 协调器维护检查清单,驱动协商循环直至所有声明解释均有效或达到最大轮数 r (默认 r=2 )。 #### 3.3 两阶段显著性过滤机制 针对代码导向检测中的过度报告,Dude 引入: - **锚点引导过滤(Anchor-guided Filtering)**:利用类别级领域知识 K_a (涵盖 Algorithm、Model、Loss 等六类)作为锚点,引导代码声明提取器识别真正显著的实现,剔除环境配置等琐碎代码。 - **相关性过滤(Relevance-based Filtering)**:由论文验证器评估代码实现 I_i 与论文 P 的相关性,仅保留与论文贡献高度相关的声明进行后续验证,抑制语境无关差异的误报。 #### 3.4 差异分类与报告生成 协调器合并双向检测结果,并基于匹配结果 M_i 与声明来源 O_i ∈ p, c 将差异分类为:

t_i = Conflict, & M_i ∈ ∂, mismatch Paper-omission, & M_i = unfound, O_i = c Code-omission, & M_i = unfound, O_i = p
—- ### 4. 实验验证 论文在 **SciCoQA** 数据集及 **20 篇** ICML 2025 / ICLR 2026 最新发表论文上进行了系统评估,使用 GPT-5.4、DeepSeek-V4-Pro、Kimi、Claude-4.6 等模型。 - **整体性能**:Dude 相比单智能体最佳基线,在 SciCoQA 上实现召回率提升最高达 **22.8%**,精确率提升最高达 **9.0%**,F1 提升最高达 **18.7%**,且在多智能体方法中 token 额外消耗最低。 - **细粒度分析**:Dude 在“论文遗漏”类别上召回率提升最为显著(最高 **28.5%**),证实了双向检测对发现隐式遗漏的有效性。 - **消融实验**:移除协商机制导致 F1 显著下降;移除显著性过滤则导致精确率灾难性下降(GPT-5.4 上下降 19.41%),验证了两类模块的必要性。 - **真实世界验证**:在 20 篇最新论文中,Dude 以 **93.75%** 的精确率报告了 45 个有效差异,在检出能力与可靠性间达到最佳平衡。 —- ### 5. 主要贡献 - **揭示单智能体局限**:系统分析了单智能体 LLM 在论文-代码差异检测中召回率低下的根源——单向检测偏差。 - **提出 Dude 框架**:设计了首个双检测多智能体系统,通过粒度对齐协商与两阶段显著性过滤,有效桥接论文与代码的粒度不对称。 - **实证显著增益**:在真实世界数据集与最新发表论文上验证了 Dude 在召回率与精确率上的双重提升,为自动化科研可复现性保障提供了坚实基础。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Weijie Liu, Running Zhao, Wenhao Yuan, Jinfeng Xu, Zhanfeng Xu, Xiaoxi Zhang, Edith Cheuk-Han Ngai

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03416.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03416

Published: 2026-09-06T01:20:51.292Z


8. DuplexSpeechBench-IFEval: Evaluating Implicit Instruction Following in Full-Duplex Voice Agents

Abstract:Full-duplex voice agents must continuously decide when to listen, backchannel, interrupt, handle speech overlaps, take the floor, and yield. Existing benchmarks largely test these behaviors through explicit turn-management instructions, while deployed agents are often configured through roles or personas from which the appropriate conversational behavior must be inferred. We introduce DuplexSpeechBench-IFEval (DSB-IFEval) for evaluating implicit instruction-following in real-time spoken interaction. (DSB-IFEval) comprises 1,038 test cases spanning eight diverse assistant roles and evaluates five conditioning protocols for instruction-following: default behavior, explicit behavioral instructions, persona-implied behavior, combined persona—rule conditioning, and instruction conflict. We measure real-time floor management using a deterministic Instruction Adherence Score (IAS) and persona-consistent content using LLM-judged Persona Adherence Score (PAS). Across six real-time speech systems, we find architecture-dependent trade-offs. Full duplex models like F-Actor and PersonaPlex are more sensitive to whether conversational behavior is stated explicitly or must be inferred from a persona, with adherence dropping by 9.7% and 4.5%, respectively, under persona-only conditioning. In contrast, GPT-Realtime, MiniCPM-o, and Fun-Audio-Chat strongly adhere to persona-consistent content, but their floor behavior does not adapt across explicit and persona-only instructions and remains constrained on several proactive actions. We further find that even if systems reliably follow conflicting directives to their prescribed persona, they still struggle to override them under safety conflict. These results show that inferring the behavior implied by a role, executing it at the appropriate conversational moment, and resolving competing instructions remain distinct challenges for full-duplex voice agents.

中文摘要

摘要:全双工语音代理必须不断决定何时聆听、回应、打断、处理语音重叠、取得发言权以及让出话语权。现有的基准测试大多通过明确的轮次管理指令来检验这些行为,而实际部署的代理通常通过角色或人格进行配置,从中必须推断出适当的会话行为。我们提出了 DuplexSpeechBench-IFEval(DSB-IFEval)用于评估实时语音互动中隐式指令的遵循情况。DSB-IFEval 包含 1,038 个测试案例,涵盖八种多样的助手角色,并评估五种指令遵循条件:默认行为、明确行为指令、人格隐含行为、人格与规则结合的条件以及指令冲突。我们使用确定性指令遵循分(Instruction Adherence Score, IAS)来衡量实时轮次管理,并使用大型语言模型评估的人格遵循分(Persona Adherence Score, PAS)衡量人格一致内容。在六种实时语音系统中,我们发现存在依赖于架构的权衡。全双工模型如 F-Actor 和 PersonaPlex 对会话行为是否明确说明或必须从人格中推断非常敏感,在仅凭人格条件下,遵循率分别下降 9.7% 和 4.5%。相比之下,GPT-Realtime、MiniCPM-o 和 Fun-Audio-Chat 对人格一致内容的遵循性很强,但其轮次行为在明确指令与仅有人格指令之间不发生调整,并且在若干主动行动上仍受到限制。我们进一步发现,即使系统能够可靠地遵循与其指定人格冲突的指令,它们在安全冲突情况下仍难以覆盖这些指令。这些结果表明,推断角色隐含的行为、在适当的会话时刻执行该行为,以及解决竞争指令,仍然是全双工语音代理面临的独立挑战。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03423 (timeout of 15000ms exceeded)

Authors: Puneet Mathur, Dinesh Manocha

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03423.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03423

Published: 2026-09-06T01:20:51.292Z


9. Do GUI Agents Know When Not to Act? Enabling Conflict-Aware Termination for Multimodal GUI Agents

Abstract:Graphical user interface (GUI) agents are increasingly used to execute natural-language instructions on user interfaces, yet real users may issue infeasible instructions due to benign mistakes. A reliable agent should not only know how to act, but also when not to act. In this work, we introduce CONFLICTGUI, a benchmark covering instruction-internal conflicts and instruction-GUI context conflicts to study conflict-aware termination. Our evaluation reveals severe execution-biased overcompliance: agents that perform well on feasible tasks often continue to execute blindly under conflicting instructions. To mitigate this behavior, we propose CONFLICTGUARD, an inference-time framework that aligns an agent’s feasibility awareness with its action generation. CONFLICTGUARD contains two coupled components: a feasibility verification protocol that guides the agent to assess instruction logic and GUI-side evidence before acting, and a conditional action modulation mechanism that steers agents from over-compliant execution into termination-oriented behavior. Experiments across five widely-used agents demonstrate that CONFLICTGUARD improves average conflict task success rate significantly, while preserving normal GUI-task performance. These results validate that a lightweight inference-time intervention can substantially boost GUI Agent’s competence to identify inappropriate execution scenarios and refrain from unnecessary actions.

中文摘要

摘要:图形用户界面(GUI)代理越来越多地用于在用户界面上执行自然语言指令,但真实用户可能会由于无意的错误而发出不可行的指令。一个可靠的代理不仅应该知道如何采取行动,还应该知道何时不采取行动。在本工作中,我们提出了 CONFLICTGUI,这是一个涵盖指令内部冲突和指令与 GUI 上下文冲突的基准,以研究冲突感知的终止行为。我们的评估显示了严重的执行偏向过度遵从:在可行任务上表现良好的代理在面对冲突指令时仍常盲目执行。为了缓解这种行为,我们提出了 CONFLICTGUARD,这是一个推理时框架,用于将代理的可行性意识与其动作生成对齐。CONFLICTGUARD 包含两个耦合的组件:一是可行性验证协议,引导代理在行动前评估指令逻辑与 GUI 端的证据;二是条件动作调制机制,将代理从过度遵从的执行引导到以终止为导向的行为。跨五种广泛使用的代理的实验表明,CONFLICTGUARD 显著提高了冲突任务的平均成功率,同时保持正常 GUI 任务的性能。这些结果验证了轻量级的推理时干预能够显著增强 GUI 代理识别不适当执行场景并避免不必要操作的能力。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03438 (HTTP 429)

Authors: Zhaoyuan Huang, Tianjie Ju, Pengzhou Cheng, Zheng Wu, Yansi Li, Chuanbiao Song, Jun Lan, Huijia Zhu, Weiqiang Wang, Zhuosheng Zhang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03438.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03438

Published: 2026-09-06T01:20:51.292Z


10. Beyond “Made with AI”: Visualizing Provenance Density to Mitigate the Transparency Penalty

Abstract:As generative AI makes polished prose cheap to produce, users can no longer rely on fluency as a proxy for truth. We call this failure mode the Fluency Trap: users trust fluent hallucinations while also discounting accurate content once it is disclosed as AI-generated. Binary ``Made with AI’’ labels respond with authorship disclosure, but they do not show what supports a claim. We propose Provenance Density, an evidence-visualization interface that shows the density of verified claims in a text. In a user study with 81 participants, an idealized Provenance Density interface produced a large discernment gap between truth and fabrication ($+4.15$ points, $d=1.82$), whereas participants given no signal showed no detectable discrimination. A technical audit with 200 samples shows that retrieval density alone is insufficient; unexpectedly, the Consistency Veto carries most of the discriminative signal on dynamic queries. As AI-generated content becomes indistinguishable from human writing, effective transparency must move from authorship disclosure toward evidence visualization.

中文摘要

摘要:随着生成式人工智能让精炼的文字变得廉价,用户不再能依赖流畅性来判断真实性。我们将这种失效模式称为“流畅性陷阱”:用户会信任流畅的幻觉内容,同时在内容被披露为 AI 生成后会贬低其准确性。“AI 创作”二元标签虽然提供了作者身份披露,但并未显示支持某一论断的依据。我们提出了来源密度(Provenance Density),一种证据可视化界面,用于显示文本中经过验证的论断密度。在一项涉及 81 名参与者的用户研究中,理想化的来源密度界面在真实与虚构内容之间产生了较大的鉴别差距(+4.15 分,d=1.82),而没有信号提示的参与者则未显示出可检测的区分能力。对 200 个样本进行的技术审计显示,仅凭检索密度并不足以区分;出乎意料的是,一致性否决在动态查询中提供了大部分区分信号。随着 AI 生成内容与人类写作越来越难以区分,有效的透明度必须从作者身份披露转向证据可视化。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03460 (timeout of 15000ms exceeded)

Authors: Qing Zhang, Yifei Huang, Juyoung Lee, Thad Starner, Jun Rekimoto

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.03460.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03460

Published: 2026-09-06T01:20:51.292Z


VLM Domain Papers

1. IDSPACE: A Novel Document Generator for Reliable Evaluation of Digital Identity Verification Systems [Extended Technical Report]

Abstract:As services move online, trust institutions such as banks, lenders, and governments must verify the identity of remote users. Fraud detection tools are widely available, but evaluating and fine-tuning them remains difficult because identity documents are sensitive and therefore scarce. Synthetic data generation offers a path forward, and demand is clear: our prior work in this area has been downloaded over $11{,}000$ times (aggregated from eight parts). We introduce IDSpace, extending this line of research in three directions. First, we propose model-guided Bayesian optimization, which tunes generation parameters to maximize both visual similarity and prediction consistency with target-domain models given only a few samples from a target domain. Second, we decouple user-specified metadata (demographics, fraud patterns, capture device) from automatically tuned control parameters (font styles, noise levels, image quality), allowing users to configure evaluations without low-level expertise. Third, we expand beyond template images to support scanned and mobile-captured documents. Experiments show IDSpace improves evaluation consistency by $15-45\%$ over baselines including CycleGAN, diffusion inpainting, and non-guided optimization, using only a few real samples, while improving training accuracy by up to $9\%$ and SSIM similarity with the target domain by $10\%$. We also released a new dataset consisting of $359{,}240$ high-quality synthetic documents across ten European ID types.

中文摘要

摘要:随着服务迁移到线上,银行、贷款机构和政府等信任机构必须验证远程用户的身份。欺诈检测工具广泛可用,但评估和微调仍然困难,因为身份证明文件是敏感的,因此数量有限。合成数据生成提供了一条前进的道路,需求也很明确:我们在该领域的先前工作已被下载超过 11,000 次(来自八个部分的总和)。我们介绍了 IDSpace,在三方面扩展了这项研究。首先,我们提出了模型指导的贝叶斯优化,它通过仅使用目标域的少量样本来调整生成参数,以最大化与目标域模型的视觉相似性和预测一致性。其次,我们将用户指定的元数据(人口统计、欺诈模式、捕获设备)与自动调优的控制参数(字体样式、噪声水平、图像质量)分离,使用户无需低级专业知识即可配置评估。第三,我们超越模板图像,支持扫描和移动设备拍摄的文档。实验表明,IDSpace 在使用少量真实样本的情况下,相比包括 CycleGAN、扩散修复和非指导优化在内的基线方法,评估一致性提高了 15-45%,同时训练准确率提高了最多 9%,与目标域的 SSIM 相似度提高了 10%。我们还发布了一个新数据集,包含 359,240 份高质量合成文档,涵盖十种欧洲身份证类型。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03052 (HTTP 429)

Authors: Lulu Xie, Yancheng Wang, Kanchan Chowdhury, Rolando Garcia, Yingzhen Yang, Jia Zou

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03052.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03052

Published: 2026-09-06T01:21:26.502Z


2. Position: Unlabeled IS NOT Equal to No Human Supervision in Visual Learning

Abstract:This position paper argues that the absence of labels does not imply the absence of human supervision in visual learning, and urges the research community to identify sources of supervision more explicitly. Many recent methods in computer vision build upon representations learned from large-scale unlabeled data, and are therefore grouped under the same umbrella term unsupervised.'' However, different data curation schemes and training objectives embed substantially different human priors on which models rely, and we argue that oneunsupervised’’ umbrella term is no longer capturing these distinctions. This ambiguity makes it harder to compare unsupervised learning research conducted under different assumptions, coinciding with a sharp decline in papers titled with ``unsupervised’’ in flagship computer vision conferences since 2021, despite continued growth of the field. While we fully embrace pre-training as a strong foundation for modern computer vision, we advocate for a community-level effort toward greater conceptual clarity: authors are encouraged to disclose priors in data selection and learning objectives, and to specify which components of a learning pipeline depend on which assumptions. Standardized disclosure practices can improve academic communication, ensure fairer comparisons, and preserve methodological diversity in unsupervised learning.

中文摘要

摘要:本文立场性论文认为,标签的缺失并不意味着视觉学习中缺乏人为监督,并敦促研究社区更明确地识别监督来源。计算机视觉中的许多最新方法都建立在从大规模无标签数据中学到的表示之上,因此被归入同一个“无监督”总称。然而,不同的数据整理方案和训练目标会嵌入模型所依赖的截然不同的人类先验,我们认为一个“无监督”的总称已无法捕捉这些差异。这种模糊性使得在不同假设下进行的无监督学习研究难以进行比较,同时,自2021年以来,尽管该领域持续增长,旗舰计算机视觉会议上标题中带有“无监督”的论文数量却急剧下降。虽然我们完全认同预训练作为现代计算机视觉的坚实基础,但我们倡导社区层面的努力,以实现更清晰的概念理解:鼓励作者披露数据选择和学习目标中的先验,并明确学习流程的哪些组成部分依赖于哪些假设。标准化的披露实践可以改善学术交流,确保更公平的比较,并保留无监督学习中的方法多样性。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03077 (HTTP 429)

Authors: Dong Lao

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03077.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03077

Published: 2026-09-06T01:21:26.502Z


3. Exemplar: Classical Priors Complement Frozen Features for Few-Shot Microscopy Segmentation at Native Resolution

Abstract:Segmenting a new biomedical dataset usually means a domain-specific model trained on substantial annotation, or a foundation model steered at inference time. We present Exemplar, a few-shot segmenter that fuses a frozen DINOv3 backbone with a fixed bank of classical native-resolution filter responses in one lightweight head, fitted from the support masks alone. In the few-mask, native-resolution regime, classical priors and frozen self-supervised features are complementary: fused in one head, a single fixed configuration spans eleven biomedical imaging datasets. Under the same head, the classical bank alone reaches 0.693 on the eleven-dataset panel, scored by foreground intersection-over-union or centreline Dice, and the frozen features alone 0.672; the bank leads on seven of the eleven and the features on the rest, and fused they reach 0.782. Against five forward-pass few-shot methods, Exemplar leads in 54 of 55 method-dataset comparisons, 52 of them significant after Holm correction. From a single annotated mask it reaches 0.703 on the same panel, against 0.682 for a from-scratch nnU-Net trained on that same mask. At eight masks nnU-Net overtakes it on the panel mean, chiefly on centreline agreement, but takes 16-77x longer to fit.

中文摘要

摘要:对一个新的生物医学数据集进行分割通常意味着需要一个在大量标注数据上训练的特定领域模型,或一个在推理时进行引导的基础模型。我们提出了 Exemplar,一种少样本分割器,它将冻结的 DINOv3 主干与固定的经典原生分辨率滤波器响应库融合在一个轻量级的头部中,仅通过支持掩码进行拟合。在少掩码、原生分辨率的情况下,经典先验和冻结的自监督特征是互补的:融合在一个头部中,一个固定配置可以覆盖十一种生物医学成像数据集。在相同的头部下,仅使用经典库在十一数据集组合上通过前景交并比或中心线 Dice 得分为 0.693,而仅使用冻结特征为 0.672;经典库在十一数据集中的七个领先,冻结特征在其余数据集领先,融合后得分为 0.782。与五种前向传递少样本方法相比,Exemplar 在 55 个方法-数据集比较中领先 54 次,其中 52 次在 Holm 校正后显著。仅使用一个标注掩码,它在同一组合上达到 0.703,而从零训练的 nnU-Net 在同一掩码上得分为 0.682。在八个掩码下,nnU-Net 超过了其组合均值,主要体现在中心线一致性上,但拟合时间比 Exemplar 长 16-77 倍。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03080 (HTTP 429)

Authors: Michal Průšek, Adam Novozámský, Filip Šroubek

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03080.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03080

Published: 2026-09-06T01:21:26.502Z


4. Solving the Needle-in-a-Haystack Problem in Mammography Vision-Language Model with Differentiable Subset Sampling

Abstract:There is growing interest in adopting CLIP-style vision—language model (VLM) pretraining for mammography. However, models that directly employ the standard CLIP architecture and training objective exhibit limited zero-shot performance in clinically important tasks such as cancer, finding-type, and BI-RADS predictions. We argue that this underwhelming performance is due to neglecting two characteristics of mammography data: (1) its high-res nature, and (2) homogeneity of radiology reports, largely driven by a predominance of negative/benign findings on examinations. We propose TopKSigLIP, a VLM designed to address these two limitations through a novel architecture and learning objectives. Instead of downscaling high-res mammography images to satisfy GPU memory constraints, TopKSigLIP introduces TopK-Patch module that learns to sample a sparse set of high-res patches likely to contain lesions, sidestepping the resolution—batch size tradeoff of VLM training. The sampled patch locations additionally serve as a built-in localization tool. To address report homogeneity, we replace the contrastive loss, which falsely repels semantically similar pairs, with a Sup-sigmoid loss. Sup-sigmoid loss extends the sigmoid loss from SigLIP with soft labels derived from structured data. TopKSigLIP outperforms existing open-source mammography and general medical VLMs on both internal and external benchmarks on density assessment, BI-RADS classification, finding subtyping, and cancer prediction under zero-shot evaluation. TopKSigLIP remains competitive under linear probing despite using a significantly smaller vision encoder and smaller training batches than baselines. The TopK-Patch module additionally achieves superior lesion localization over post-hoc Grad-CAM. Code and weights are made public:this https URL.

中文摘要

摘要:对于乳腺X线影像,采用CLIP风格的视觉-语言模型(VLM)预训练的兴趣日益增加。然而,直接使用标准CLIP架构和训练目标的模型,在诸如癌症、发现类型和BI-RADS预测等临床重要任务中的零样本性能有限。我们认为,这种不理想的性能是由于忽视了乳腺X线影像数据的两个特征:(1)其高分辨率特性;(2)放射学报告的同质性,这主要是由于检查中阴性/良性发现占多数。我们提出了TopKSigLIP,一种旨在通过新型架构和学习目标解决这两个限制的VLM。TopKSigLIP并不将高分辨率乳腺X线图像降采样以满足GPU内存限制,而是引入了TopK-Patch模块,学习采样可能包含病变的稀疏高分辨率图像块,从而规避了VLM训练中的分辨率与批量大小之间的权衡。采样的图像块位置还可作为内置定位工具。为了解决报告同质性问题,我们用Sup-sigmoid损失替代了错误地排斥语义相似对的对比损失。Sup-sigmoid损失将SigLIP中的sigmoid损失扩展为使用结构化数据导出的软标签。TopKSigLIP在零样本评估下,在密度评估、BI-RADS分类、发现分型和癌症预测方面,均超过现有的开源乳腺X线影像和通用医疗VLM,并在内部与外部基准上表现优异。尽管TopKSigLIP使用的视觉编码器和训练批次显著小于基线模型,但在线性探测下仍保持竞争力。TopK-Patch模块在病变定位上也优于后处理的Grad-CAM。代码和权重已公开:https URL。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03085 (HTTP 429)

Authors: Young Seok Jeon, Beatrice Brown-Mulry, Rohan Satya Isaac, Anjana Dissanayaka, Theo Dapamede, Mohammadreza Chavoshi, Judy Gichoya, Hari Trivedi

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03085.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03085

Published: 2026-09-06T01:21:26.502Z


5. WireSeg-32K: A Physics-Grounded Synthetic Dataset for Wire Instance Segmentation

Abstract:Deformable linear objects such as wires and cables are difficult to segment because they are thin, highly deformable, and frequently self-occluded, while large-scale instance-level annotations are expensive to obtain in real scenes. Existing resources either focus on cable tracing or semantic segmentation under constrained settings, or generate visually plausible images without physically grounded wire deformation. We present WireSeg-32k, a synthetic dataset for wire instance segmentation with 32,000 RGB images, instance masks, depth maps, and a complementary real-world test set with annotations. To generate this dataset, we develop DeformX, a co-simulation pipeline that couples Cosserat-rod dynamics with photorealistic Isaac Sim rendering, enabling physically plausible, contact-consistent wire shapes, CAD-based wire assets, and diverse visually grounded scenes. As a simple baseline, LoRA fine-tuning SAM3 on WireSeg-32k alone improves real-world mAP@75 by 10.2% over the off-the-shelf model, showing that physically grounded synthetic data can transfer to real wire perception.

中文摘要

摘要:可变形线性物体,如电线和电缆,由于它们细长、高度可变形且经常自我遮挡,因此很难进行分割,同时在真实场景中获取大规模实例级标注也成本高昂。现有资源要么专注于在受限条件下进行电缆追踪或语义分割,要么生成视觉上合理但没有物理基础的电线形变的图像。我们提出了 WireSeg-32k,这是一个用于电线实例分割的合成数据集,包括 32,000 张 RGB 图像、实例遮罩、深度图以及一个带有标注的真实世界测试集。为了生成该数据集,我们开发了 DeformX,一种将 Cosserat 杆动力学与逼真 Isaac Sim 渲染相结合的协同仿真管道,使电线形状在物理上合理、接触一致,使用基于 CAD 的电线资产,并呈现多样化的视觉真实场景。作为一个简单的基线,在 WireSeg-32k 上单独对 LoRA 调优 SAM3,可使真实世界的 mAP@75 相比现成模型提高 10.2%,表明具有物理基础的合成数据能够迁移到真实电线感知任务中。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03102 (HTTP 429)

Authors: Zilin Dai, Lehong Wang, Yi Yang, Xiang Fei

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03102.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03102

Published: 2026-09-06T01:21:26.502Z


6. SLIDEFORGE: An LLM Agent for Controllable Editing of Slides as Structured Artifacts

Abstract:Current AI agents compellingly describe slides. However, AI-assisted slide editing requires more than understanding: the output must retain layout, style, component structure, and native editability. Towards, AI-assisted slide editing, existing agents operate on screenshots or weak document representations and often fragment coherent visual units, rasterize editable content, or break layout. In contrast, for controllable slide editing, we introduce an agentic framework, SLIDEFORGE, which builds a Deck State Graph, an executable slide state that links visual decomposition, native pptx object structure, and perceptual organization. By recovering human-referable components while retaining fine-grained editable structure, SLIDEFORGE supports theme-preserving reconstruction through slide-native operations and rendered-state verification. We further introduce an evaluation paradigm for controllable slide transformation that jointly measures component recovery, preservation, restyling consistency, visual quality, and native editability. Experiments show that SLIDEFORGE outperforms direct prompting, screenshot-based agents, and generic code-agent baselines across these dimensions. Code is available at this https URL.

中文摘要

摘要:当前的人工智能(AI)代理能够令人信服地描述幻灯片。然而,AI辅助的幻灯片编辑不仅需要理解,还需要输出内容保持布局、样式、组件结构和原生可编辑性。针对AI辅助的幻灯片编辑,现有的代理通常基于截图或较弱的文档表示操作,且常常会破坏连贯的视觉单元、光栅化可编辑内容,或破坏布局。相比之下,为了实现可控的幻灯片编辑,我们提出了一个代理框架SLIDEFORGE,它构建了Deck State Graph(幻灯片状态图),这是一个可执行的幻灯片状态,连接了视觉分解、原生pptx对象结构和感知组织。通过恢复可供人类参考的组件,同时保持细粒度的可编辑结构,SLIDEFORGE支持通过幻灯片原生操作和渲染状态验证实现主题保留的重建。我们进一步提出了一种可控幻灯片变换的评估范式,联合衡量组件恢复、保持、重排样式一致性、视觉质量和原生可编辑性。实验表明,SLIDEFORGE在这些维度上优于直接提示、基于截图的代理和通用代码代理基线。代码可在此 https URL 获得。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03109 (HTTP 429)

Authors: Haozhen Zheng, Fulin Wang, Tianhu Xiong, Yingjie Yu, Shengyi Qian, Hanchao Yu, Alex Schwing, Klara Nahrstedt, Mingyuan Wu

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03109.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03109

Published: 2026-09-06T01:21:26.502Z


7. Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers

Abstract:Deep neural networks (DNNs) are increasingly deployed in real-world vision systems, yet their predictions can be covertly manipulated by backdoor attacks, in which malicious triggers cause targeted misclassification while preserving high clean accuracy. Existing defenses often rely on model internals, training data, or clean validation samples, making them difficult to deploy when only black-box access to a trained model is available. We propose TRIM (Trigger Removal by Identifying Manipulated Regions), a deployment-oriented black-box defense that detects and selectively removes backdoor triggers at inference time without requiring model internals, training data, or clean samples. The key insight behind TRIM is to identify image regions that are responsible for anomalous model behavior and purify only those regions while preserving benign content. TRIM innovates via three key components: (i) region-based segmentation with deep feature representations, (ii) adaptive trigger discovery through inpainting and diffusion-based reconstruction to isolate regions responsible for misclassification—-without assumptions about trigger type, shape, or location, and (iii) selective region purification that cleans poisoned regions while retaining benign content. To support practical deployment, TRIM further caches feature embeddings of previously identified triggers, enabling efficient recognition and avoiding redundant detection and purification. Extensive experiments across diverse datasets and backdoor types, including blended, sparse, varying-size, and multiple triggers, show that TRIM consistently outperforms existing black-box defenses, reducing attack success rates (ASR) to as low as 1.16% while preserving clean accuracy of up to 87.87%. These results demonstrate that effective backdoor mitigation is possible at inference time even when the defender has no access to any auxiliary data.

中文摘要

摘要:深度神经网络(DNNs)正日益部署于现实世界的视觉系统中,但其预测可能会被后门攻击隐秘操纵,在这种攻击中,恶意触发器会导致特定的错误分类,同时保持高的干净准确率。现有防御方法通常依赖于模型内部、训练数据或干净的验证样本,当仅能黑箱访问已训练模型时,这些方法难以部署。我们提出了TRIM(通过识别被操控的区域移除触发器),一种面向部署的黑箱防御方法,可在推理时检测并选择性地移除后门触发器,而无需模型内部信息、训练数据或干净样本。TRIM的核心理念是识别导致异常模型行为的图像区域,仅净化这些区域,同时保留正常内容。TRIM通过三个关键组成部分实现创新:(i)基于区域的分割与深度特征表示,(ii)通过修复和基于扩散的重建进行自适应触发器发现,从而隔离导致错误分类的区域——无需对触发器类型、形状或位置作任何假设,以及(iii)选择性区域净化,清理受污染区域的同时保留正常内容。为了支持实际部署,TRIM进一步缓存先前识别触发器的特征嵌入,实现高效识别,避免重复检测和净化。在多种数据集和后门类型(包括混合型、稀疏型、不同尺寸及多触发器)上的大量实验证明,TRIM始终优于现有黑箱防御方法,将攻击成功率(ASR)降至低至1.16%,同时保持高达87.87%的干净准确率。这些结果表明,即使防御方无法获取任何辅助数据,仍可在推理阶段实现有效的后门缓解。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03139 (HTTP 429)

Authors: Ahmed Abdelnaby, Mohamed Elmahallawy

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03139.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03139

Published: 2026-09-06T01:21:26.502Z


8. VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

Abstract:Visual fluency in generated video does not imply physical reliability, and a scalar quality score alone is incapable of indicating the obligation a clip violates or the moment it fails. We present VeriPhy, an auditable physical-verification system in which a text-only planner compiles the prompt into typed physical obligations and a statically validated execution plan before any frame is observed. During execution, observations gate and scope only declared calls to frozen low-level experts (e.g., segmentation and tracking, counting, eleven typed physical measurements over the resulting tracks, depth, OCR, and audio-event detection). Each action returns a provenance-carrying evidence record whose payload, when usable, is either a typed measurement or an explicitly tagged learned state. Typed resolvers and fixed composition map usable records to a three-valued state (supported, contradicted, or unknown, surfaced as plausible, implausible, or abstain) with full provenance, so that every verdict is traceable to the evidence that produced it. We anchor evaluation in a 1,500-clip corpus of human-annotated flaw records that localize real generation failures in prompt reference, space, and time. On a 149-clip core carrying 304 such records, VeriPhy accounts for 228, against 164 for a published question-decomposition evaluator given the same clips and the same claims. Recall alone does not separate it from prompting the same backbone monolithically, which reaches 222; what separates them is that each decision retains its evidence record and provenance, making the traces auditable one verdict at a time and usable as the interface through which a critic verdict could be written back into generation.

中文摘要

摘要:生成视频中的视觉流畅性并不意味着物理可靠性,而且单靠标量质量评分无法指示片段违反的义务或其失败的时刻。我们提出了 VeriPhy,这是一种可审计的物理验证系统,其中文本规划器在观察任何帧之前,将提示编译为类型化的物理义务和静态验证的执行计划。在执行期间,观测结果只对声明的调用、冻结的低级专家(如分割和跟踪、计数、对生成轨迹的十一种类型化物理测量、深度、OCR 以及音频事件检测)进行门控和范围限制。每个动作都会返回携带溯源的证据记录,其有效载荷在可用时要么是类型化测量,要么是明确标记的学习状态。类型化解析器和固定组合将可用记录映射为三值状态(支持、反驳或未知,呈现为合理、不合理或弃权),并且提供完整溯源,因此每个裁决都可以追溯到生成它的证据。我们在一个包含 1,500 个片段的人类注释的缺陷记录语料库中进行评估,该语料库定位了提示参考、空间和时间上的实际生成失败。在一个含 304 条此类记录的 149 个片段的核心集合上,VeriPhy 能解释 228 条,而在相同片段和相同声明下,已发布的问题分解评估器仅解释 164 条。单靠召回率无法将其与直接提示同一骨干整体方法区分开(后者达到 222 条);真正的区别在于每个决策都保留其证据记录和溯源,使得每个裁决的轨迹可逐条审计,并可作为将批评裁决写回生成过程的接口。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文针对的是\*\*生成视频在物理可靠性评估与诊断方面的系统性缺失\*\*,具体可从以下三个层面理解: --- ### 1. 视觉流畅性与物理有效性之间的鸿沟 当代视频生成模型能够合成视觉流畅、时序连贯且音画同步的片段,但\*\*视觉上的可信度并不等同于物理上的正确性\*\*。论文指出,生成视频中可能出现多种物理失效: - \*\*视觉流\*\*:物体在重力下悬空、轨迹与受力不一致、刚体穿透、碰撞缺失或因果错乱; - \*\*声学流\*\*:预期声音缺失、错位或归因错误; - \*\*跨模态流\*\*:视觉与声学事件在时序或因果上相互矛盾。 这些失效在视频被用于具身智能系统的训练与评估循环时尤为危险。 --- ### 2. 现有评估方法的结构性局限 论文指出,当前物理诊断能力分散在不同基准和协议中,缺乏一个\*\*可审计的(auditable)统一证据链\*\*: - 多数评估器输出\*\*标量质量分\*\*或\*\*规则级判断\*\*,无法说明视频具体违反了提示中的哪一条物理义务,也无法定位失效发生的时刻与空间区域; - 虽有工作涉足时序定位、声学-物理一致性、测量驱动测试等,但通常围绕\*\*人工编纂的评分标准、 curated 数据集或特定现象\*\*组织,难以泛化到开放式提示; - 即使采用问题分解(question decomposition)或视觉问答,其支持证据仍由评判模型自身产生,缺乏独立的测量溯源。 --- ### 3. 缺乏“提示编译 + 静态规划 + 专家测量”的闭环验证 论文强调,一个可辩护的物理裁决必须能够: - 在\*\*读取任何帧之前\*\*,将自然语言提示编译为\*\*类型化的物理义务(typed physical obligations)\*\*; - 通过\*\*静态验证的执行计划\*\*明确需要检验什么、如何检验; - 在运行时让\*\*观测结果门控(gate)和限定(scope)\*\*已声明的低级专家调用(分割追踪、计数、深度、OCR、音频事件检测等); - 将每条专家返回的\*\*带溯源的证据记录(provenance-carrying evidence record)\*\*通过固定规则组合为\*\*三值决策\*\*(supported / contradicted / unknown,对应 plausible / implausible / abstain),使得\*\*每一个裁决都可追溯到具体的提示片段、计划节点、时间窗口和测量数值\*\*。 --- ### 总结 简言之,论文试图解决的核心问题是: > \*\*如何在无预设评分标准的前提下,对开放式提示生成的视频进行可审计、可定位、基于独立专家测量的物理一致性验证,并建立从“文本义务”到“时空证据”再到“可推翻裁决”的完整链条。\*\* 为此,作者提出了 \*\*VeriPhy\*\* 系统,并配套构建了一个包含 1,500 个片段、2,582 条人工标注缺陷记录的语料库,以及一个基于 MuJoCo 模拟控制的条件生成测试平台,以分别对批评器(critic)和生成器进行可分离的评估与改进。 Q2: 有哪些相关研究? 这篇论文的相关研究可归纳为三大主线,分别对应生成控制、评估诊断与执行框架三个层面。 --- ### 1. 物理感知生成与优化(Physics-aware Generation and Refinement) 该领域关注如何将物理约束注入视频生成过程,或利用物理反馈改进生成结果。 - \*\*可控视频生成\*\*:通过深度、分割、参考帧、掩码、运动场及组合时空信号对扩散模型进行结构引导,实现外观与结构的分离合成

33, 71, 74, 87
。 - **仿真驱动的生成控制**:从物理推理或仿真中推导控制信号,包括场景属性推断与重建、仿真轨迹/流场引导合成、文本物理上下文细化提示,以及将语言编译为粗略运动计划
2, 19, 45, 54, 56, 80, 83, 86
。 - **评估反馈优化**:利用评估信号进行偏好优化、验证引导的候选搜索与局部再生
20, 37, 44
。 **与本文的关系**:VeriPhy 明确将生成与评估解耦——MuJoCo 仿真的几何控制驱动冻结的 Wan 2.2-VACE 生成器
33, 70, 71
,而 VeriPhy 作为独立批评器(critic)对生成结果进行物理验证,从而区分“对控制信号的遵循”与“合成输出的物理有效性”。 —- ### 2. 模型判断、问题分解与物理评估(Model Judgments, Decomposition, and Physical Evaluation) 该领域研究如何自动评判视频质量,并逐步从标量评分转向结构化、可解释的物理诊断。 - **通用视频评估协议**:从聚合的感知质量、时序一致性扩展到提示对齐度等多维评分

26, 27, 31, 46, 47, 68
。 - **提示分解方法**:将自然语言提示翻译为命题、问题或查询链,通过细粒度的小规模检查回访视觉输入
10, 25, 28, 43
;这类方法使检查显式化,但支持证据通常仍由评判模型自身产生。 - **物理导向基准**:引入现象级、规则级、轨迹级与提示特定的评估标准,涵盖准则级推理、失效定位、受控测量及视听一致性
3, 4, 8, 9, 14, 22, 42, 49, 51, 55, 73, 77, 88, 92
。 - **AV-Phys Agent**
14
:作为近邻对比点,该系统结合推理–动作循环与确定性声学工具,但其发布协议仍绑定于提示特定的人工评分标准与多模态模型的二元判断。 **与本文的关系**:VeriPhy 并非引入某一孤立能力(如规则判断、时序定位或声学测量),而是将这些能力整合进**单一的、可审计的证据链**——在读取任何帧之前将提示编译为类型化物理义务,并通过固定规则组合专家测量,输出带完整溯源的三值决策。 —- ### 3. 执行框架、上下文工程与持久状态(Execution Harnesses, Context Engineering, and Persistent State) 该领域关注如何将编排逻辑与模型判断分离,并管理代理在跨 episode 中的记忆与上下文。 - **执行框架(Execution Harnesses)**:显式化规划、依赖管理、专家路由、观测范围限定、验证、终止与追踪日志

35, 60, 65, 78, 82
。 - **模块化视觉/视频推理**:引入专门感知、选择性观测与自适应时间采样
13, 17, 23, 39, 52, 53, 67, 69, 75, 76
。 - **视频评估流水线**:组合提示结构化、时序工具、形式化规范与模型检测、局部修复、确定性声学测量或提示特定评分标准
12, 14, 64, 84
。 - **持久状态与记忆**:跨 episode 构建上下文,将轨迹蒸馏为反思经验、可复用策略或结构化知识,并区分记录证据与推导信念以减少上下文污染
30, 36, 57, 66, 81, 90
。 **与本文的关系**:VeriPhy 在这些组件之上建立了一个统一的**验证契约**(verification contract): - 开放提示被编译为类型化义务与经验证的静态计划; - 观测仅门控或限定已声明的调用; - 测量值与习得状态显式区分; - 固定规则生成初始三值主张,任何复核覆盖单独留存在溯源记录中。 此外,VeriPhy 的上下文训练自进化(Section 5.4)以无权重更新的方式,将从经验池中蒸馏的教训加载为可读状态,属于上述记忆与上下文工程脉络的延伸。 Q3: 论文如何解决这个问题? 论文通过提出 **VeriPhy** 这一集成化的物理验证系统,辅以物理引导的生成测试平台与细粒度缺陷基准,从“评估工具链”和“验证方法论”两个层面解决了生成视频的物理可靠性审计难题。具体解决路径如下。 —- ### 1. 系统架构:四个角色的约束式推理–执行–观察循环 VeriPhy 将物理批评器(critic)组织为四个严格分离的角色,核心不变式为:**工具输出驱动执行,但执行范围被限定在计划预先声明的义务之内**。 | 角色 | 职责 | 输入/时机 | |———|———|—————-| | **文本规划器(Text-only Planner)** | 将提示编译为精确引用的类型化物理义务与可执行测量计划 | 仅读取提示,**在观察任何视频帧之前**完成 | | **视频感知语义验证器(Semantic Verifier)** | 对带时间戳的帧进行稠密读取,判断存在性与事件 occurrence | 仅在需要时读取已声明的帧区间 | | **冻结专家算子(Specialist Operators)** | 返回定向测量:分割/追踪、计数、11 类物理量、深度、OCR、音频事件 | 被观察结果门控(gate)与限定(scope)后调用 | | **固定组合器(Fixed Composition)** | 以确定性规则将可用证据记录映射为三值裁决 | 不引入新的学习判断 | —- ### 2. 计划先行:提示编译与静态验证(Plan-before-Act) 在接触视频前,规划器执行全局命名与静态验证,解决“开放式提示无预设评分标准”的问题。 - **共享命名空间(Shared Namespace)**:对提示进行第一遍扫描,为每个独立实体与每个独立事件出现分配稳定标识符,防止不同检查片段对同一对象使用不同名称,或对不同出现使用同一名称。 - **表面语言(Surface Language)**:规划器使用受限词汇编写检查程序,包括: - `judge(“assertion”)`:语义验证 - `exists(“object”)`:存在性检查 - `eq(count(“phrase”), N)`:基数检查 - `before(window(A), window(B))` / `during(…)`:时序关系 - `rel(“A||B”, relation)`:空间关系 - `traj(“phrase”, relation, target)`:轨迹谓词 - `sound(“description”)`:音频事件 - `text(“STRING”, carrier=…)`:渲染文本 - **编译为类型化有向图**:表面程序被编译为 G_Pi = (A, Q, E, b) ,其中 A 为证据产生动作, Q 为类型化检查, E 为依赖边, b 将检查绑定到主张。静态验证器确保:

Valid(G_Pi) = Parse land Refs land Typed land Acyclic land [∀ i, ∃ q ∈ Q: b(q)=i]
任何无效行回退到通用语义验证器,且该回退被计费并记录,而非静默丢弃。 —- ### 3. 时间线条件化的多工具执行 执行遵循拓扑序,每个动作 a_j 的已编译范围函数 g_j 将前置证据记录映射到帧索引子集,再调用对应后端:

Omegaj = g_j(R_k : (a_k, a_j) ∈ E, T_V), quad R_j = F(oj)(V|(Omega_j), α_j)
关键机制包括: - **门控(Gating)**:时序检查的前提事件必须先通过语义验证器或音频检测确认为“发生”,其返回的时间窗口才能进入时序谓词;若事件未发生或不可用,相关主张保持为 `unknown`。 - **作用域限定(Scoping)**:专家调用仅在被声明的局部帧区间执行,避免全片盲目处理。 - **公共子表达式消除**:仅当完整实现签名(操作、参数、引用、实现作用域)完全匹配时,两个动作才共享一次执行,防止因自然语言查询相似而错误合并。 - **时序谓词**:采用带容差的 Allen 区间代数变体。对于窗口 $W_X =
s_X, e_X
$,定义松弛量:
δ(A,B) = (1) / (4)min(e_A-s_A, e_B-s_B)
顺序判定为 `supported` 仅当 e_A ≤ s_B + δ(A,B) ;否则若 e_B ≤ s_A + δ(A,B) 则为 `contradicted`;否则为 `unknown`。该规则保证互斥性。 —- ### 4. 物理测量与证据记录:溯源链的构建 针对物理主张,系统通过 **SAM 3** 分割命名主体并跨帧追踪身份,在此基础上执行 11 类共享追踪的测量操作,直接对应人类投诉类别: - **位移**(displacement):以主体自身半径为倍数报告,消除场景标定需求;方向取最大偏移而非净偏移;通过稠密光流剔除相机运动。 - **接触**(contact):两追踪掩膜的最小接近距离。 - **形状变化**(shape change):相对于背景流的表面运动(用于检测原地滚动等零净位移情形)。 - **路径形状**(path shape):区分圆形与八字形等。 - **持续性**(permanence)、**弹跳计数**(hop counting)、**阻尼**(damping)、**起始顺序**(onset ordering)、**片段时长**(clip timing)、**视角运动**(viewpoint motion)。 每个动作返回一条**主张绑定的证据记录**:

R_(j,i) = langle id(V), p, s_i, o_j, Omega_j, σ_j, μ_j, h_j, kappa_j rangle
其中 σ_j ∈ measured, abstained, errored ; μ_j 承载类型化测量或显式标记的习得基态; h_j 包含制品哈希; kappa_j 记录成本。测量与仪器失败被严格区分:有效负测量(完整追踪但无请求运动)记为 `measured` 并可反驳主张;而追踪失败(模糊、遮挡、低质量)记为 `abstained`,避免将仪器失败转化为对视频的指控。 —- ### 5. 裁决聚合与诊断:三值决策与可审计性 通过确定性汇总将子检查状态 z_q ∈ S, C, U (supported / contradicted / unknown)逐层上卷: - **主张级**:

y_i = C, & ∃ q ∈ K_i: z_q = C S, & ∀ q ∈ K_i: z_q = S U, & otherwise

  • **片段级**:
    Y = bot(infra), & 基础设施错误 Implausible, & ∃ i: y_i = C Plausible, & N_p ≥ 1 land ∀ i: y_i = S Abstain, & otherwise
    两项习得精炼作用于上述确定性骨架之上: 1. **复核验证器**:更强的模型仅复核语义验证器通过的项,若推翻则记为 `contradicted` 而非 `unknown`,两项裁决均保留。 2. **识别引擎**:对文本主张使用 OCR 识别头而非生成模型,返回字形直译,通过确定性字符串比较捕获拼写错误。 最终输出的**局部化矛盾包**(localized contradiction packet)为:
    F(p, V) = { langle c_i, R
    (j,i)j, Omega_i, B_i rangle : y_i = C }
    其明确包含:哪条义务失败、基于哪些证据记录、失败发生的时域 Omega_i 与空域 B_i (掩膜或包围盒)。这使每个裁决都可逐条追溯至提示片段、计划调用、时间窗口与测量数值。 —- ### 6. 物理引导的生成测试平台(独立但互补) 为将“对控制信号的遵循”与“合成输出的物理有效性”分离,论文构建了一个**基于可信物理求解器的生成测试床**: 1. **从事件描述到注册控制**: - 语言模型将事件描述 p
    (ev) 编译为结构化场景规范 S (刚体、初始状态、碰撞器、静态表面、相机)。 - MuJoCo 求解器运行仿真得到轨迹 τ ,经事件特定谓词 Phi(ev) 验证(最多 3 次修订/4 次仿真)。 - 渲染器将验证后的轨迹转为深度控制视频 C = (C_t)(t=0)^(T-1) ,其中:

Ct(u) = 1 - clip((D_t(u) - d-) / (d+ - d-), 0, 1)
基于全片非背景深度的 1% 与 97% 分位数归一化,保证同一场景中同一距离对应同一强度。 2. **条件化视频生成**: - 使用 Wan 2.2-VACE 在潜空间视频扩散 transformer 中,通过控制分支将深度/轮廓控制 C 以残差形式注入每层:
hi^((ell)) arrow h_i^((ell)) + s , W^((ell)) z(ctrl)
其中 s 为条件强度,掩膜全白以确保控制仅通过分支影响生成,而非直接复制外观。 3. **控制撤回分析(机制探针)**: - 在替代主干上研究控制可在何种噪声水平 σ(rel) 撤除。发现轨迹在 σ ≈ 0.94 – 0.96 的窄带内即对控制移除不敏感,处于采样高噪声段,说明运动在扩散早期即被“锁定”。 —- ### 7. 基准与评估协议:以人类缺陷记录为真值 论文构建了 **1,500 片段、2,582 条人工标注缺陷记录**的语料库,每条记录包含: - 违反的提示原文片段(verbatim span) - 自由文本理由、严重程度、置信度 - 可选时间跨度与包围盒轨迹 通过**缺陷级匹配协议**(而非仅片段级标量)评估系统:将批评器的发现与人类记录按语义整体匹配、部分匹配或未匹配进行最大二分匹配,从而精确度量召回率与定位能力。在此协议上,VeriPhy 在 149 片段核心集(304 条缺陷)上达到 **75.0%** 的召回率(228/304),相对于同类问题分解评估器的 53.9%(164/304)具有显著优势,且每个发现都附带可审计的证据链。 —- ### 总结 论文的解决方案可概括为:**在观看视频之前,先将开放式自然语言提示“编译”为类型化、可静态验证的物理义务与测量程序;在运行时让视频观察结果严格门控和限定对已声明的冻结专家的调用;通过确定性规则将专家返回的带溯源测量记录组合为三值裁决;最终以人类可读的溯源链形式输出“哪里、何时、基于何种证据”失效。** 这一设计将物理验证从黑箱标量评分转变为可审计、可定位、可改进的结构化过程。 Q4: 论文做了哪些实验? 论文的实验围绕**物理引导的生成控制**与**VeriPhy 批评器(critic)的评估能力**两条主线展开,分布在第 5 节。以下按实验模块系统梳理。 —- ## 1. 共享实验设置(Section 5.1) ### 1.1 模型与后端 - **规划器与语义验证器**:Qwen3-VL-30B-A3B-Instruct(BF16,无量化),文本规划与视频验证分两次调用。 - **冻结专家栈**:SAM 3(分割/追踪/计数)、TAPNext++(11 类物理测量)、深度排序模型、PaddleOCR(文本)、FlexSED(音频事件检测),以及一个闭源复核模型(gpt-5.6-sol)。全部冻结在指定版本。 ### 1.2 人工标注缺陷基准 - **规模**:1,500 个生成片段,2,582 条人工书写的缺陷记录。 - **核心评估集**:通过“仅视觉可见”筛选与分层随机抽样,得到 **150 片段 / 306 条缺陷**的冻结核心;其中 149 片段 / 304 条缺陷用于召回计算(1 个片段无测量数据)。 - **匹配协议**:缺陷级(而非片段级)评估。将批评器发现与人类记录按语义做最大二分匹配,判定为**整体匹配(whole)**、**部分匹配(partial)**或**遗漏(missed)**。 —- ## 2. 物理引导生成器实验(Section 5.2) ### 2.1 控制保真度与提示对抗(Section 5.2.2) **目的**:验证几何控制能否覆盖提示隐含的运动描述。 - **设置**:固定同一深度控制视频,仅变化运动描述子句: - 强水平穿越(与控制一致) - 中性描述 - 对抗性描述(几乎垂直下落,与控制矛盾) - **控制模式**:无控制、仅前 10/50 步控制、全部 50 步控制。 - **关键结果**: - 无控制时,提示主导运动,种子间水平位移差异达 **0.875**(帧宽比例)。 - 全程控制时,提示可解释的运动范围降至 **0.001**。 - **前 10 步控制即可锁定飞行轨迹**,但着陆后的滚动行为在控制撤除后偏离(控制球滚至 0.99 帧宽,生成球停在 0.77)。 ### 2.2 轨迹承诺点:控制撤回分析(Section 5.2.3) **目的**:定位扩散采样中轨迹对控制信号“锁定”的噪声水平。 - **设置**:在替代主干(Wan2.2 衍生,支持直接移除源 token)上,于不同噪声水平 σ(rel) 撤除控制;场景包括抛球、落球、斜坡滚球。 - **度量**:生成轨迹与仿真轨迹的逐轴 Pearson 相关系数(retention),分**空中(airborne)**与**接触后(after-contact)**两个窗口。 - **关键结果**: - 空中飞行在很早撤除( σ = 0.952 )时仍保持 Rx = 1.00 。 - 接触后行为对撤除敏感:抛球在 σ = 0.952 时水平相关降至 **-0.63**(与仿真反向),需到 σ ≈ 0.94 – 0.96 之后才恢复至 0.98+ 。 - **两轴锁定不同步**:水平先恢复,垂直后恢复,说明需分别监测。 ### 2.3 场景库广度与失效边界(Section 5.2.4) **目的**:测试流水线在复杂场景下的可扩展性。 - **设置**:构建 66 类共 1,314 个场景,通过预渲染检查 591 个;涵盖单刚体、多体接触、布料/绳索/颗粒/浮力等。 - **关键结果**: - 单物体场景轨迹复现良好(如跨帧相关性达 1.0000/0.9998)。 - **多体交互失效**:如台球开球,无法使每个刚体都按仿真指定运动;可变形体/颗粒体的控制渲染在深度图中可能与背景融合,导致追踪困难。 —- ## 3. VeriPhy 批评器实验(Section 5.3) ### 3.1 核心集缺陷召回率(Section 5.3.1) **目的**:在精确的人工缺陷标注上度量批评器定位真实物理/语义失效的能力。 - **设置**:149 片段 / 304 条缺陷;与问题分解评估器、同模型单轮自由文本提示、场景图方法对比。 - **结果**: - **VeriPhy**:**228/304(75.0%)**,其中 191 整体匹配,37 部分匹配。 - **问题分解基线**:164/304(53.9%)。 - **同模型单轮提示(Single-pass VLM)**:222/304(73.0%),但输出为自由文本列表,**无逐条证据与溯源**。 - **成本**:VeriPhy 平均每片段 14.1 次模型/工具调用;问题分解 21.9 次;单轮提示 1.0 次。 ### 3.2 按类别与片段属性的召回分解(Section 5.3.1) - **按注释类别**(表 3): - 相机与风格:**90%** - 屏幕文本:**84%** - 动作或事件发生:**83%** - 计数(how many):**49%**(最低,因模式化降采样导致间歇检测失败) - 物理运动(变形等):57%(样本仅 7 条,描述性) - **按片段属性**(严重性、时长、缺陷数、难度层):子组召回率与总体(75%)相差约 10 个百分点以内,无显著预测因子。 ### 3.3 专家测量轨迹展示(Section 5.3.2) **目的**:展示测量驱动发现与“印象式”判断的差异。 - **案例**(图 10):海豚跳跃(垂直位移 0.00 半径)、水瓶滚动(表面运动与背景流一致,实为相机运动)、太阳静止(峰值位移不足)、婴儿计数(精确模式 5 vs 7)、F-22 计数(4 vs 3)、毕业横幅 OCR(识别头直译为乱码而非生成式修复)。 - **统计**:物理专家调用 227 次,**166 次弃权**(如无法通过语义守卫定位对象),**61 次反驳**。 ### 3.4 与人类片段级评分的一致性(Section 5.3.3) **目的**:将 VeriPhy 与现有片段级评分器在 1–5 分人类评分上对比。 - **设置**:VideoPhy-2 的 200 片段样本(含 55 个困难片段),使用 VideoScore2 的评估脚本。 - **结果**(表 4): - 精确一致率与相邻一致率:VeriPhy 低于 VideoScore2。 - **PLCC / SRCC**:VeriPhy 领先; Q5: 有什么可以进一步探索的点? 基于论文的**结论(Conclusion)**、**局限性(Limitations)**与**路线图(Section C)**,可将未来探索方向归纳为以下六个层面。 —- ### 1. 跨模态物理验证:从视觉到视听一致性 当前所有测量主张均为视觉。论文已架构但未充分执行的,是将音频事件检测与视觉接触窗口置于**共享 A/V 时钟**上的能力: - **声-时同步验证**:建立视觉接触窗口 W(contact) 与音频起始窗口 W(sound) 之间的类型化时序关系(如 rho(before)(W(sound), W(contact)) 检测“先闻其声后见碰撞”); - **跨模态因果诊断**:当视觉与声学对同一事件的编码在时序或因果上冲突时,利用跨模态证据链定位错误源; - **物理基准扩展**:构建同时标注视听故障的语料库,将当前仅针对视觉缺陷的局部化协议扩展至跨模态场景。 —- ### 2. 生成-评估闭环:从文本重写转向几何控制编辑 论文在 Section 5.5 中通过提示重写 rho(p, F) 关闭了端到端循环,但独立评分器(VideoPhy-2 AutoRater)未检测到物理改善。这揭示了一个核心开放问题: - **控制信号局部修正映射 δ(F) **:将矛盾包 F (含时空定位 Omegai 与掩膜 B_i )映射为对 MuJoCo 仿真控制 C 的局部编辑 Delta(ctrl) ,再经 V’ = Gen(p, C + Delta(ctrl)) 重生成,而非仅修改文本提示 p ; - **承诺点自适应调度**:当前控制撤回分析(Section 5.2.3)表明不同物理阶段(空中/接触后)对控制强度 s 的敏感度不同,可探索**阶段性自适应条件强度**而非全局固定 s=1.0 ; - **接触先验强化**:针对视频生成器在接触/碰撞阶段的系统性失效(Section 5.2.3),研究如何在扩散采样的后接触阶段保持控制残差注入。 —- ### 3. 操作符库扩展:覆盖更广泛的物理现象 当前 11 项轨迹测量主要针对刚体运动,对复杂物质形态覆盖不足: - **可变形体与颗粒材料测量**:Section 5.3.1 显示“物理运动”类缺陷(布料折叠错误、非刚性形变)召回率仅 57%,需引入基于粒子追踪或网格形变的测量操作符; - **流体与烟雾仿真**:Section 5.2.4 指出场景库排除了流体、烟雾与有限元软体求解,扩展这些物理域需要新的渲染控制表示(超越深度/轮廓)及对应的专家验证器; - **多体交互验证**:台球开球等多体散射场景当前无法保证每个物体按仿真运动,需要实例级多目标追踪与交互力一致性测量; - **负事件与不存在性验证**:当前系统缺乏稳健的“某事**未**发生”验证能力(如“球不穿过墙壁”),需发展受控的反事实测量框架。 —- ### 4. 系统自进化:从上下文训练到严格门控 Section 5.4 展示了从经验中蒸馏可读教训 Delta M 可提升召回率,但若干关键机制尚未执行: - **接受门控的形式化**:论文提及的代理评分函数 U(val) (Equation 23)在实验中被省略,需建立针对未运行规则的**反事实验证**机制,防止有害先验污染 M ; - **在线累积 vs. 离线蒸馏**:当前教训从固定经验池一次性诱导,未来需测量**部署时持续累积**的效果及其饱和曲线; - **外部知识通道 K 的开启**:为防止内部循环(CoT → 反馈 → 上下文)放大偏见,需实现对外部物理事实/人类修正的检索,并通过与 U(val) 相同的候选-剪枝纪律准入(Section B.6); - **成本约束下的操作符提升**:Phase 2 提出将高频子程序提升为命名操作符并赋予成本节点 c(o) ,在预算 c(G) 约束下优化义务覆盖率。 —- ### 5. 评估协议与基准的完善 当前基准存在结构性限制,需从以下方面补强: - **精度度量(Precision)**:现有语料全为含缺陷片段,无法测量误报。需引入经人工验证的“干净”负样本,建立完整的混淆矩阵与 Youden 统计量 J ; - **跨标注者一致性**:当前为单标注者标注,需引入冗余标注与多数决议以估计标注方差; - **缺陷因果层级**:将缺陷从“现象描述”推进到“物理量违反”(如动量不守恒、穿透深度量化),使测量值可直接与物理定律比对; - ** held-out 泛化验证**:当前核心集为开发集,需冻结 held-out 测试集以报告无偏泛化性能。 —- ### 6. 物理引导生成器的深层机制 - **轨迹承诺的解析理论**:Section 5.2.3 发现运动在 σ ≈ 0.94 – 0.96 锁定,需建立该临界窗口与流匹配调度(Equation 14)及数据层级结构的解析联系; - **多步求解器缓存策略**:清除/保留 UniPC 历史导数对撤回后轨迹的影响(Section 5.2.3)仅初步测量,需系统分析多步求解器的记忆效应; - **控制-外观解耦极限**:当提示强烈对抗控制信号时(Section 5.2.2),生成器在何种条件下会“背叛”几何控制而服从文本,这一相变边界尚未量化。 —- 这些方向共同指向论文的最终目标:构建一个**权重冻结、状态可读、人机可审计、视听融合、生成-评估双向闭环**的物理世界模型评估与精炼体系。 Q6: 总结一下论文的主要内容 这篇论文提出了 **VeriPhy**,一个用于评估和精炼视频世界模型的、可审计的物理推理系统。以下从问题动机、系统架构、生成测试平台、实验发现与开放方向五个层面总结其核心内容。 —- ### 1. 研究动机:视觉流畅性不等于物理有效性 当代文本到视频生成模型能合成视觉上令人信服、时序连贯的片段,但**视觉上的可信度并不保证物理上的正确性**。生成视频可能存在以下失效: - **空间-物理失效**:物体在重力下无支撑、轨迹与受力不一致、刚体相互穿透、碰撞缺失; - **声学-物理失效**:预期声音缺失、错位或归因错误; - **跨模态失效**:视觉与声学事件在时序或因果上相互矛盾。 现有评估方法多输出标量质量分或规则级判断,无法定位**具体哪条提示义务被违反、何时发生、基于何种证据**。因此,亟需一种能在开放式提示下,将自然语言义务编译为可检查、可测量、可溯源的物理验证系统。 —- ### 2. VeriPhy:可审计的物理验证系统 论文的核心贡献是 **VeriPhy**,一个由四个角色构成的约束式推理–执行–观察系统: - **文本规划器(Text-only Planner)**:在**读取任何视频帧之前**,将自然语言提示 p 编译为精确引用的类型化物理义务集合 C(p) = c_i = (s_i, φ_i)(i=1)^(N_p) (其中 s_i sqsubseteq p 为提示原文片段)以及一个**静态验证的执行计划** Pi 。计划使用受限表面词汇(存在性、计数、时序顺序、空间关系、轨迹、音频、文本等),并被编译为类型化有向无环图 G_Pi = (A, Q, E, b) ,通过语法、引用、类型与无环性检验:

Valid(G_Pi) = Parse land Refs land Typed land Acyclic land [∀ i, ∃ q ∈ Q: b(q)=i]

  • **视频感知语义验证器(Semantic Verifier)**:对带时间戳的帧进行稠密读取,判断实体存在性与事件 occurrence,其结果作为门控信号。 - **冻结专家算子(Specialist Operators)**:仅当计划声明且被观测结果门控/限定时才调用,包括 SAM 3(分割与追踪)、TAPNext++(11 类基于轨迹的物理测量)、单目深度、OCR(PaddleOCR)与音频事件检测(FlexSED)。所有算子返回**带溯源的证据记录**。 - **固定组合器(Fixed Composition)**:以确定性规则将可用证据记录映射为三值决策:
    yi ∈ S, C, U quad (supported, contradicted, unknown)
    进而得到片段级裁决:
    Y ∈ Plausible, Implausible, Abstain
    **关键设计**:所有推理前置(计划先行),所有测量可溯源(每个裁决追溯到提示片段、计划节点、时间窗口、工具输出与组合规则),并且**测量值与习得状态被显式区分**,避免将仪器失败转化为对视频的指控。 —- ### 3. 物理引导的生成测试平台 为将“对控制信号的遵循”与“合成输出的物理有效性”解耦,论文构建了一个**基于 MuJoCo 仿真的条件生成管道**: 1. **仿真到控制**:将事件描述 p
    (ev) 经语言模型编译为场景规范 S ,由 MuJoCo 求解器生成轨迹 τ ,经物理谓词 Phi(ev) 验证(最多 3 次修订),再渲染为注册深度图控制 C = (C_t)(t=0)^(T-1) :

Ct(u) = 1 - clip((D_t(u) - d-) / (d+ - d-), 0, 1)

  1. **条件化生成**:使用 Wan 2.2-VACE,将深度控制 C 通过残差分支注入扩散 transformer:
    hi^((ell)) arrow h_i^((ell)) + s , W^((ell)) z(ctrl)
    其中强度 s 全局固定,掩膜全白以确保控制仅通过分支影响生成,而非直接复制像素。 3. **控制撤回分析**:在替代主干上研究发现,运动轨迹在噪声水平 σ(rel) ≈ 0.94 – 0.96 的窄带内即对控制移除不敏感,表明**物理运动在扩散采样的早期高噪声阶段即被锁定**;但接触后行为(如落地滚动)对早期撤回更敏感。 —- ### 4. 实验发现 #### 4.1 批评器召回率(核心评估集) 在 149 片段 / 304 条人工标注缺陷的冻结核心上: - **VeriPhy**:**228/304(75.0%)** 缺陷召回(191 整体匹配,37 部分匹配); - **问题分解基线**(同模型,同片段):164/304(53.9%); - **单轮 VLM 提示**(同模型):222/304(73.0%),但输出为无结构的自由文本列表,**无逐条证据与溯源**。 召回率差异并非唯一区分标准:VeriPhy 的每个发现都附带可审计的证据链,而单轮模型仅返回分数或结论。 #### 4.2 按类别的召回表现 - 屏幕文本(84%)、相机与风格(90%)、动作/事件(83%)表现最佳; - 计数(49%)因模式化降采样导致间歇检测失败,表现最低; - 物理运动(变形等)召回 57%,但样本量小(7 条),仅作描述性参考。 #### 4.3 上下文训练自进化(无权重更新) 将遗漏缺陷的经验蒸馏为 33 条人类可读的教训,加载为规划器的上下文状态( S = (O, M, K) 中的 M ),在 306 片段 / 502 条缺陷的 held-out 集上: - 无教训:340/502(67.7%); - 33 条教训:**375/502(74.7%)**,净提升 +35( p = 3× 10^(-4) )。 - 增益在仅 25 个经验片段时即已饱和,表明少量结构化文本经验即可改善规划,无需微调权重。 #### 4.4 生成-评估闭环 将批评器的矛盾包 F 通过文本重写 rho 反馈至提示并重新生成: - 在 589 个 Cosmos3-Nano 片段上,闭环对 14.8% 的被标记片段有效,其中 72.4% 提升了物理可信度分数,且 1.6% 的未标记片段出现退化; - 然而,**独立评分器(VideoPhy-2 AutoRater)在语义 adherence 与物理常识维度均未检测到显著改善**,表明当前仅通过文本重写难以独立验证地提升物理保真度。 —- ### 5. 局限与未来方向 - **跨模态扩展**:系统架构已集成音频事件检测与共享 A/V 时钟,但当前所有测量主张均为视觉;未来需扩展至视听同步与跨模态因果验证。 - **控制闭环深化**:当前反馈仅通过提示文本 p 实现,需发展将矛盾包 F 映射为几何控制局部编辑 Delta(ctrl) 的机制,直接修正 MuJoCo/VACE 控制信号。 - **操作符库扩展**:当前 11 项测量主要针对刚体运动;需引入可变形体、颗粒材料、流体及多体交互的测量算子。 - **评估协议完善**:当前语料全为含缺陷片段,缺乏“干净”负样本,无法直接测量精度(precision)与误报率。 - **外部知识通道**:为防止内部循环(CoT → 反馈 → 上下文)放大偏见,需开启对外部物理事实的检索,并通过 held-out 代理门控准入。 —- ### 6. 总结性贡献 论文的核心贡献可概括为三方面: 1. **VeriPhy**:首个将开放式提示编译为类型化物理义务、以冻结专家测量和固定规则组合实现**可审计、可定位、三值化**物理验证的集成系统; 2. **1,500 片段缺陷语料库**:提供 2,582 条带时间跨度与包围盒的人工标注缺陷记录,支持缺陷级匹配评估; 3. **仿真-生成解耦测试平台**:以 MuJoCo 深度控制驱动 Wan 2.2-VACE,使物理目标与外观生成分离,为生成与评估的独立基准测试提供基础设施。 该工作将视频世界模型的物理验证从黑箱标量评分,推进到了**逐条义务可追踪、逐条证据可审查、逐条裁决可推翻**的结构化新阶段。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03153.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03153

Published: 2026-09-06T01:21:26.502Z


9. Who Speaks for the Pruned? Visual Token Pruning as Coverage Optimization

Abstract:Visual token pruning reduces the inference cost of vision-language models (VLMs), but most methods only ask which tokens to keep. This retained-token view can keep redundant high-scoring tokens while leaving discarded evidence without a close representative. We propose CoverPruner, a training-free pruner that asks the complementary demand-side question: after a token is removed, which surviving original token represents it for the target VLM? CoverPruner formulates pruning as Representational Coverage Maximization (RCM), covering the full projected visual-token set with query-weighted demand. It instantiates RCM with projector-space coverage and a lightweight first-layer attention probe. Across multiple VLM architectures and compression rates, CoverPruner achieves the best average accuracy among all compared methods, with the largest gains usually appearing under aggressive compression.

中文摘要

摘要:视觉令牌剪枝可以降低视觉-语言模型(VLM)的推理成本,但大多数方法仅关注保留哪些令牌。这种保留令牌的视角可能会保留冗余的高分令牌,同时使被舍弃的证据没有接近的代表。我们提出了 CoverPruner,这是一种无需训练的剪枝方法,它提出了互补的需求侧问题:在移除了一个令牌之后,哪一个保留下来的原始令牌可以代表它以适应目标 VLM?CoverPruner 将剪枝问题表述为表征覆盖最大化(RCM),通过查询加权的需求覆盖完整的投影视觉令牌集合。它通过投影空间覆盖和轻量的第一层注意力探针实现了 RCM。在多种 VLM 架构和压缩率下,CoverPruner 在所有比较的方法中取得了最高的平均准确率,并且在高压缩率下通常获得最大的提升。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.03158 (HTTP 429)

Authors: Qingchan Zhu, Weihang You, Hanqi Jiang, Changdi Yang, Tianming Liu, Geng Yuan

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03158.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03158

Published: 2026-09-06T01:21:26.502Z


10. RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning

Abstract:Robot learning increasingly depends on broad and diverse demonstrations, yet collecting robot data remains expensive and poorly suited to covering the long tail of real-world tasks. To address this bottleneck, we introduce RoboTok, an internet-scale data engine that, given a query human manipulation video, retrieves manipulation-relevant human demonstrations from web videos for training dexterous robot policies. Specifically, we learn a latent motion space from 3D hand trajectories expressed in estimated actor-centered reference frames. This representation enables manipulation behaviors to be compared across variations in camera viewpoint, scene appearance, and actor occlusions, while remaining compact enough for efficient search and continual indexing over internet-scale video collections. We evaluate RoboTok against existing robot-data retrieval approaches on retrieval benchmarks and downstream robot policy performance. Our results show that RoboTok retrieves more relevant manipulation demonstrations and improves downstream task success, establishing hand-pose trajectory-aware retrieval as a way to make web video a scalable and continuously growing source of supervision for robot learning.

中文摘要

摘要:机器人学习越来越依赖广泛而多样的示范,但收集机器人数据仍然成本高昂,且难以覆盖现实世界任务的长尾部分。为了解决这一瓶颈,我们引入了RoboTok,一个互联网规模的数据引擎。给定一个查询的人类操作视频,它可以从网络视频中检索与操作相关的人类示范,用于训练灵巧的机器人策略。具体来说,我们从以估计的以演员为中心的参考系表示的3D手部轨迹中学习潜在的运动空间。这种表示能够跨摄像机视角、场景外观和演员遮挡的变化对操作行为进行比较,同时仍然足够紧凑,使得在互联网规模的视频集合上进行高效搜索和持续索引成为可能。我们在检索基准和下游机器人策略性能上评估了RoboTok与现有机器人数据检索方法的对比。结果表明,RoboTok能够检索到更多相关的操作示范,并提高下游任务的成功率,从而确立了基于手势轨迹的检索作为使网络视频成为机器人学习可扩展且持续增长的监督来源的方法。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决机器人学习领域中\*\*演示数据采集成本高、覆盖范围有限\*\*的核心瓶颈,具体而言: - \*\*数据规模与多样性的瓶颈\*\* 机器人学习(尤其是灵巧操作学习)依赖广泛而多样的人类演示数据,但传统的机器人数据采集或人工遥操作成本高昂,难以覆盖现实世界中长尾分布的任务、物体和环境。 - \*\*互联网视频的利用难题\*\* 互联网视频包含海量且持续增长的人类操作行为,是机器人演示数据的潜在宝库。然而,这些视频本质上是无结构的:相机视角任意、场景外观差异大、存在遮挡,且视觉或语义相似性\*\*并不等同于\*\*底层操作行为的相似性。因此,直接从互联网视频中检索与目标操作相关的人类演示面临巨大挑战。 - \*\*行为级检索的缺失\*\* 现有的检索方法多依赖语义标签、视觉外观或图像空间的运动特征,缺乏对\*\*三维手部操作轨迹\*\*本身的显式建模,难以在跨视角、跨场景、跨遮挡的条件下准确比对灵巧操作行为。 为此,论文提出 \*\*RoboTok\*\* —— 一个互联网规模的数据引擎,其核心思路是: > 将三维手部轨迹表示在估计的以动作者为中心的参考系(actor-centered reference frame)中,通过学习时空轨迹对齐的隐式运动嵌入空间,实现基于操作行为相似性而非外观相似性的高效检索,从而使互联网视频成为灵巧机器人学习可扩展且持续增长的监督来源。 Q2: 有哪些相关研究? 根据论文第2节(Related Works),相关研究可归纳为以下三个方向: ### 1. 大规模机器人演示数据与基础模型 该方向关注通过大规模数据集和基础模型来推动机器人学习,但仍受限于数据采集成本或生成管线的人工配置: - \*\*机器人基础模型\*\*:包括视觉-语言-动作模型(VLA)与机器人通用模型,如 Octo (Ghosh et al., 2024)、OpenVLA (Kim et al., 2025)、SpatialVLA (Qu et al., 2025) 与 CLIP-RT (Kang et al., 2025) 等,通常在海量异构数据集(如 Open X-Embodiment (O’Neill et al., 2024))上训练。 - \*\*大规模机器人演示数据集\*\*:如 BridgeData V2 (Walke et al., 2023)、DROID (Khazatsky et al., 2024),以及基于低成本遥操作的 ALOHA (Zhao et al., 2023)。 - \*\*数据生成与重定向\*\*:通过自动化或程序化方式扩充有限演示,代表工作包括 MimicGen (Mandlekar et al., 2023; Garrett et al., 2024) 与 GRAIL (Xie et al., 2026a)。 ### 2. 人类视频用于灵巧操作学习 该方向利用人类演示视频(尤其是互联网视频)为类人/灵巧机器人提供监督信号: - \*\*专门构建的人类演示数据集\*\*:如 HO-Cap (Wang et al., 2025a)、EgoVerse (Punamiya et al., 2026),提供结构化的人类操作数据。 - \*\*从视频中提取运动/接触/形态感知表征\*\*:VideoDex (Shaw et al., 2024)、EgoMimic (Kareer et al., 2025)、K-VIL (Gao et al., 2023)、YODO (Wen et al., 2022)、SPOT (Hsu et al., 2025) 与 CHORD (Zhu et al., 2026) 等,从人类视频中提取运动、接触或形态信息以监督灵巧操作。 - \*\*大规模互联网视频语料\*\*:如 HowTo100M (Miech et al., 2019)、Action100M (Chen et al., 2026),包含自然发生、覆盖极广的人类活动。 - \*\*无约束视频的 3D/4D 重建\*\*:EgoInfinity (Wang et al., 2026) 与 CARI4D (Xie et al., 2026b) 展示了如何从野外视频中恢复丰富的人体-物体交互表示。 ### 3. 面向机器人学习的演示检索方法 该方向致力于从已有数据中检索相关演示,以降低重复采集成本: - \*\*基于状态-动作或视觉相似性的检索\*\*:通过匹配状态-动作对 (Du et al., 2023)、运动片段 (Nasiriany et al., 2022) 或视觉相似的对象交互 (Di Palo & Johns, 2024) 来检索机器人经验。 - \*\*基于语言语义的检索\*\*:利用视觉-语言模型根据语言指令从无标注人类视频中检索行为 (Papagiannis et al., 2025);RfV (Zhu & Feng, 2025) 通过语言相似性检索任务相关的第一人称视频;SiMDex (Lin et al., 2026) 以机器人演示为查询,基于语义与运动相似性挖掘第一人称人类数据。 - \*\*融入时间或运动信息的检索\*\*:FlowRetrieval (Lin et al., 2024) 利用光流检索与目标任务运动相似的演示;STRAP (Memmel et al., 2025) 通过子序列动态时间规整(DTW)对视觉基础模型特征进行时序对齐,以检索匹配的机器人子轨迹;HAND (Hong et al., 2026) 先按视觉相似性过滤机器人 play 数据,再匹配 2D 手部与机器人末端执行器的相对路径。 上述方法通常局限于固定机器人语料库、图像空间运动表征或基于语义的检索。论文通过表1将这些方法与 RoboTok 进行了系统对比,指出 RoboTok 是首个针对互联网人类视频、以三维手部轨迹为核心的灵巧操作检索框架。 Q3: 论文如何解决这个问题? 该论文通过提出 \*\*RoboTok\*\* 这一互联网规模的数据引擎,系统性地解决了从海量非结构化互联网视频中检索灵巧操作演示的问题。其核心方法论可拆解为以下几个层面: --- ### 1. 核心思想:行为相似性而非外观相似性 不同于依赖语义标签、场景外观或相机配置的现有方法,RoboTok 的核心 insight 在于: > \*\*灵巧手部运动只有在相对于动作者(actor)或操作物体的参考系下表达时,才最具备操作意义。\*\* 因此,RoboTok 将三维手部轨迹表示在估计的\*\*以躯干为中心(torso-centered)的参考系\*\*中。这种表示使得操作行为能够在不同相机视角、场景外观和遮挡条件下进行公平比较,同时保持足够的紧凑性以支持互联网规模的向量检索。 --- ### 2. 问题形式化:基于动态时间规整(DTW)的相似度监督 为了定义“操作行为相似性”,论文将每条视频片段表示为规范化的三维手部轨迹,并引入 DTW 作为运动学上的相似度度量。 对于两条包含 21 个关节的手部轨迹 x_i 与 x_j ,其长度分别为 L_i 与 L_j ,DTW 寻找最优对齐路径 π 以最小化累积姿态距离:

DTW(xi, x_j) = min(π ∈ Pi) ∑_((t,u) ∈ π) d(x_i^t, x_j^u)
其中 d(x_i^t, x_j^u) = |x_i^t - x_j^u|_2 。轨迹相似度定义为长度归一化的负对齐成本:
s(i, j) = -DTW(x_i, x_j)(1) / (2)(L_i + L_j)
直接基于 DTW 在百万级视频库中逐对检索计算量过大,因此 RoboTok 学习一个嵌入函数 Gamma: X to S^(d-1) ,使得嵌入空间中的内积相似度能够保留下述 DTW 诱导的排序:
s(i, j) > s(i, k) implies langle Gamma(x_i), Gamma(x_j) rangle > langle Gamma(x_i), Gamma(x_k) rangle
检索时,只需通过向量内积进行近似最近邻搜索,无需在线计算 DTW。 —- ### 3. 数据引擎流程:从互联网视频到运动嵌入 RoboTok 的运行分为**离线连续索引**与**在线查询检索**两个阶段,中间通过轻量级编码器桥接。 #### 3.1 离线数据预处理与归一化 训练数据来源为大规模互联网视频语料 Action100M,经以下步骤处理: - **片段筛选**:自动保留 4–8 秒长度、相机近乎静止、且手部可见的片段; - **三维手部重建**:使用 WiLoR 估计 3D 手部关键点,并利用 MoGe-2 进行度量深度估计,将手部姿态转换到度量相机坐标系;缺失姿态通过 HaWoR 填补; - **自我中心(Egocentric)轨迹表示**:将相机坐标系下的手部轨迹转换到以动作者躯干为中心的坐标系。 关键点在于,躯干坐标系的估计通过一个**轻量级模型**完成,该模型**仅输入手部腕关节轨迹**,即可预测演示者的静态躯干坐标系。这意味着即使躯干不可见(这在大量演示视频中很常见),只要手部可见,即可完成归一化。 #### 3.2 轻量级轨迹编码器 由于输入已经是规范化的时空手部姿态,编码器无需再学习视角或外观不变性。其结构为一个基于位置编码与轻量交叉注意力网络的轨迹编码器,输出 ell_2 归一化的 d 维向量,直接用于余弦相似度检索。 #### 3.3 面向检索的训练目标 为了在训练时获得有信息量的正负样本,RoboTok 采用以锚点(anchor)为中心的组采样: - 对每个锚点轨迹 a ,定义其相关集合 R(a) 为 DTW 度量下的前 K=20 个最近邻; - 从 R(a) 中采样两条正例 p_1, p_2 ,并从紧邻相关集合边界的区域采样一条“边界负例” n ; - 每批包含 49 个这样的组,共 196 条轨迹。 训练目标由两部分组成:

L = L(set) + λ , L(rank)

  • **集合损失(Set Loss)**:鼓励 DTW 下的 Top-K 邻居在嵌入空间中的得分高于边界负例与普通负例; - **排序损失(Rank Loss)**:鼓励采样正例的相对排序与 DTW 诱导的排序一致。 这使得嵌入空间在训练时就针对“哪些轨迹应进入检索邻域”以及“邻域内如何排序”进行了直接优化。 —- ### 4. 在线检索与下游策略学习 完成训练后,RoboTok 的使用方式如下: - **离线**:将所有归一化轨迹通过 Gamma 编码一次,存入内积索引; - **在线**:给定一条查询视频,提取其 3D 手部轨迹并编码,通过余弦相似度快速检索最近邻。 新采集的视频片段也只需一次前向传播即可加入索引,无需重新训练模型,从而支持**持续扩展的互联网视频索引**。 在下游机器人策略学习中,检索到的演示用于引导强化学习(PPO)策略。具体而言,策略被奖励以跟踪重定向后的演示手部姿态,奖励项 Phi(s) 定义为当前手部状态到演示状态库的负加权 k-NN 距离,并通过势函数塑形(potential-based shaping)引导策略向演示流形靠近。实验表明,基于 RoboTok 检索结果训练的 PPO 策略,在 VTDexManip 灵巧操作基准上显著优于基于现有检索方法的策略。 Q4: 论文做了哪些实验? 论文的实验验证围绕两大核心目标展开:**检索质量**与**下游机器人策略性能**。具体实验设置与结果如下: —- ### 1. 检索质量评估 #### 1.1 评估语料与协议 实验在两个不同语料库上进行,以分别验证大规模检索能力与跨域泛化能力: - **RoboTok 训练语料库**:从 Action100M 中处理的 N=100,000 条互联网视频片段,其中 10,000 条作为 held-out 查询,其余 N-1 条作为候选库。以 DTW 计算结果作为**伪地面真值(pseudo-GT)**。 - **AssemblyHands**:外部数据集,包含 N=831 条双手装配片段,具备传感器级 3D 手部标注。采用 leave-one-out 方式,每条片段依次作为查询,其余作为候选。此处 DTW 基于真值标注计算。 对每条查询,其相关集合(relevant set)定义为 DTW 度量下的最近邻:在 RoboTok 语料库中 R=20 ,在 AssemblyHands 中 R=5 。 #### 1.2 对比基线 与以下现有检索方法对比: - **Random**:随机检索 - **FlowRetrieval (Flow)**:基于光流的运动检索 - **HAND**:基于 2D 手部与机器人末端执行器路径匹配 - **STRAP**:基于视觉基础模型特征与动态时间规整的子轨迹检索 #### 1.3 评估指标 采用信息检索与度量学习中的标准指标: - mAP@ k , nDCG@ k , CKNNA@ k , MRR@ k - Kendall τ (排序相关性) - DTW cost@ k (以米为单位,越低越好) #### 1.4 主要结果 **RoboTok 语料库(表 2, k=20 )**: - RoboTok 在全部指标上大幅领先所有基线。例如: - mAP@20 达到 **0.3531**,而最强基线 STRAP 仅为 0.0071; - Recall@20 达到 **0.996**,意味着几乎所有查询都能在 Top-20 内找回真邻居; - Kendall τ 为 **0.4867**,表明检索结果不仅命中率高,而且相对排序与 DTW 真值高度一致; - 平均 DTW cost@20 为 **1.333 m**,接近 GT 的 1.145 m,而 Random 为 4.776 m。 - 图 5 展示了不同 k (1, 5, 20, 100, 500)下的 Recall@ k 、DTW cost@ k 与 CKNNA@ k 曲线,表明即使模型仅针对局部 k=20 优化,其嵌入空间仍呈现出良好的**全局结构性**。 **AssemblyHands 跨域迁移(表 3, k=5 )**: - 在完全未见过的双手装配数据上,RoboTok 依然领先: - mAP@5 为 **0.2614**,STRAP 为 0.1330; - DTW cost@5 为 **1.095 m**,接近 GT 的 0.966 m,而 Random 为 1.911 m。 - 这验证了基于 torso-centered 三维手部轨迹的表示具有跨数据集的迁移能力。 **定性结果(图 4)**: - 以“刀切割”为查询时,RoboTok 检索到的 Top-3 视频在手部运动轨迹上与查询高度相关,而基线方法返回的片段在操作行为层面明显不相关。 —- ### 2. 下游灵巧操作策略评估 实验进一步验证:检索到的演示是否真正有助于提升机器人策略的学习效果。评估在模拟环境 **VTDexManip** (Liu et al., 2025) 上进行。 #### 2.1 协议与任务设置 - **策略架构**:从零开始训练 PPO 策略,输入为本体感受(proprioception)与指尖力数据,观测窗口为 3 步。 - **演示使用方式**:检索到的视频片段**不直接提供动作标签**,而是通过奖励函数引导策略。定义 Phi(s) 为当前手部状态到重定向后演示状态库的负加权 k-NN 距离,并加入势函数塑形(potential-based shaping)项 $w

γ Phi(s’) - Phi(s)
以鼓励策略向演示流形靠近。 - 每个环境固定配对一条检索片段, K 条片段并行提供 K 个不同的引导目标。 #### 2.2 原始 VTDexManip 基准(表 4) 在原始任务设定下,评估 6 项任务(BottleCap Turning、Faucet Screwing、Lever Sliding、Table Reorientation、In-hand Reorientation、Bimanual Hand-over),每项分为 Seen 与 Unseen 对象拆分。 - RoboTok 在 6 项任务中的 5 项上超过了当前最佳预训练基线 VT-JointPretrain。 - 平均而言,RoboTok 相比最佳基线提升 7.45%(Seen)与 5.83%(Unseen)。 - 与检索基线(Random、Flow、HAND、STRAP)相比,RoboTok 在所有任务上均取得最高成功率。 #### 2.3 修改后的更难任务设定(表 5、图 7) 为了消除原始设定可能存在的饱和问题,作者对其中 3 项任务(BottleCap Turning、Faucet Screwing、Lever Sliding)提高了难度: - 恢复机器人手部完整的 3D 运动控制(不再固定手腕位置); - 移除手工设计的密集奖励塑形(dense reward shaping)。 在此更具挑战性的设定下,检索质量差异被显著放大: | 任务 | RoboTok (Seen) | 次优基线 (Seen) | 优势幅度 | |———|————————|————————-|—————| | BottleCap Turning | 77.3% | 59.5% (HAND) | +17.8% | | Faucet Screwing | 44.8% | 6.8% (HAND) | +38.0% | | Lever Sliding | 79.3% | 19.5% (HAND) | +59.8% | - 在 Unseen 对象上,RoboTok 同样保持领先(例如 Lever Sliding Unseen 达到 58.3%,而次优基线为 25.2%)。 - 图 7 的训练曲线显示,RoboTok 不仅在最终性能上领先,其学习速度也显著快于其他方法。 —- ### 实验结论 上述实验共同表明: 1. RoboTok 学习的运动嵌入空间在互联网规模与跨数据集条件下,均能高精度地检索出与查询操作行为相似的人类演示; 2. 这些检索到的演示能够为下游灵巧机器人策略提供有效的监督信号,且在任务难度增加时优势更加显著; 3. 基于三维手部轨迹与 torso-centered 归一化的检索,明显优于基于外观、语义或 2D 图像空间运动的传统检索方法。 Q5: 有什么可以进一步探索的点? 基于论文的局限性与展望,可进一步探索的方向包括: —- ### 1. 扩展至非静态相机与更广泛的视角类型 当前 RoboTok 在预处理阶段过滤保留了近静态相机(near-static camera)拍摄的片段。未来可探索将检索框架扩展至移动相机(包括动态第三人称与第一人称 egocentric 视频),这要求更鲁棒的即时躯干坐标系估计与动态视角补偿机制。 —- ### 2. 融入物体状态与接触信息 现有表示主要依赖三维手部轨迹,尚未显式编码被操作物体的状态(如位姿、类别、几何)以及手-物接触信息。将物体感知与接触力信息纳入检索度量,有望提升对操作语义的理解,并支持需要精确物理交互的下游策略。 —- ### 3. 子轨迹与细粒度操作阶段检索 当前检索以整条视频片段为单元。未来可探索子轨迹检索(sub-trajectory retrieval),即定位长视频中与查询操作最匹配的局部段落或操作阶段。这需要在编码器中显式建模时序层次结构,或采用窗口化/分层嵌入策略。 —- ### 4. 跨形态迁移与更广泛的机器人本体 论文聚焦于人形灵巧手(dexterous anthropomorphic hands)。未来可研究如何将 torso-centered 手部轨迹空间映射到非人形机器人本体(如平行夹爪、多臂系统),通过跨形态重定向(cross-embodiment retargeting)使检索结果服务于更广泛的机器人平台。 —- ### 5. 与视觉-语言-动作(VLA)模型的深度集成 当前查询方式为视频-视频检索。可探索结合自然语言指令进行多模态检索,或利用 RoboTok 的运动嵌入空间为大规模 VLA 模型(如 OpenVLA、Octo)提供连续的互联网视频后训练(post-training)数据源,而不仅限于策略奖励塑形。 —- ### 6. 从仿真到真实系统的迁移验证 现有策略评估基于 VTDexManip 模拟环境。后续需在真实机器人平台上验证检索所得人类演示对灵巧操作的实际引导效果,并研究 sim-to-real 差距、重定向噪声与传感器延迟对检索质量与策略性能的联合影响。 —- ### 7. 持续学习与索引的自适应更新 RoboTok 支持增量式索引扩展,但未涉及检索模型的持续学习(continual learning)。随着视频分布随时间漂移(如新兴操作方式、新工具出现),需要探索如何在避免灾难性遗忘的前提下,定期微调或更新嵌入空间。 —- ### 8. 检索多样性与任务覆盖的显式优化 当前目标以 DTW 相似度为监督,倾向于返回与查询运动高度同质的片段。可在训练目标中引入多样性正则化子模态覆盖约束,确保返回的 K 个演示覆盖同一操作的不同变体(如不同握姿、速度或对象实例),从而提升下游策略的泛化性。 —- ### 9. 更复杂的双手/全身协作操作 论文已涵盖部分双手任务(Bimanual Hand-over),但真实场景中存在更复杂的双手协调手-臂-躯干协同以及多人协作操作。将参考系从 torso-centered 扩展至全身运动链,并检索多智能体交互演示,是一个值得深入的方向。 —- ### 10. 替代或改进相似度监督信号 DTW 作为伪标签虽具备良好物理可解释性,但对噪声敏感且计算代价高。可探索可学习的时序对齐度量(如基于最优传输或对比学习得到的软对齐),或结合人工反馈(RLHF)直接优化对下游策略收益更高的检索排序。 Q6: 总结一下论文的主要内容 这篇论文介绍了 RoboTok,一个面向互联网规模视频数据的灵巧操作演示检索引擎,旨在缓解机器人学习中高质量演示数据稀缺且采集成本高昂的问题。以下是论文的主要内容总结: —- ### 1. 研究动机与核心问题 - 数据瓶颈:机器人学习(特别是灵巧操作)依赖大量多样化的人类演示,但传统的机器人数据采集或遥操作成本极高,难以覆盖真实世界中的长尾任务与场景。 - 互联网视频的潜力与挑战:互联网视频包含海量且持续增长的人类操作行为,但这些视频无结构化,视角任意、外观各异、遮挡频繁。更关键的是,视觉或语义相似性不等于操作行为相似性,导致传统基于外观或语义的检索方法难以挖掘真正有用的操纵演示。 —- ### 2. RoboTok 方法框架 论文的核心思想是:将三维手部运动表示在估计的以动作者为中心(torso-centered)的参考系中,从而剥离视角与外观的干扰,聚焦于底层的操作行为相似性。 #### 2.1 轨迹表示与相似度定义 - 每条视频被转换为规范化的 21 关节 3D 手部轨迹,并通过度量深度估计转换到真实尺度。 - 采用 Dynamic Time Warping (DTW) 作为轨迹相似度的监督信号。对于轨迹 x_i 与 x_j$,定义相似度为:

s(i, j) = -DTW(x_i, x_j)(1) / (2)(L_i + Lj)
其中 L_i, L_j 为轨迹长度。该度量允许在局部速度变化的情况下对齐两段轨迹。 #### 2.2 运动嵌入空间学习 为避免在百万级语料上实时计算代价高昂的 DTW,论文学习一个嵌入函数:

Gamma: X to S^(d-1)
使得嵌入空间中的余弦相似度能够保留下述 DTW 诱导的排序:
s(i, j) > s(i, k) implies langle Gamma(x_i), Gamma(x_j) rangle > langle Gamma(x_i), Gamma(x_k) rangle

2.3 数据预处理流程 - **视频筛选**:从 Action100M 中筛选出相机近静态、手部可见的 4–8 秒片段。 - **3D 重建**:使用 WiLoR 提取 3D 手部关键点,MoGe-2 估计度量深度,HaWoR 填补缺失帧。 - **自我中心化(Egocentric Canonicalization)**:训练一个轻量级模型,**仅输入手部腕关节轨迹**即可估计演示者的静态躯干坐标系。这使得即使躯干被遮挡,只要手部可见,即可完成视角不变性归一化。 #### 2.4 检索模型训练 - **编码器**:轻量级交叉注意力网络,直接作用于归一化后的 3D 手部轨迹,输出 ell_2 归一化的 d 维向量。 - **批次构建**:以锚点为中心,从其 DTW Top-20 近邻中采样正例,从边界区域采样困难负例。 - **训练目标**:结合集合损失(决定哪些轨迹进入检索邻域)与排序损失(优化邻域内的相对顺序):

L = L(set) + λ , L(rank)
—- ### 3. 实验验证 实验从**检索质量**与**下游策略性能**两个维度展开。 #### 3.1 检索质量评估 - **RoboTok 语料库**( N=100,000 ,held-out 查询):RoboTok 显著优于 FlowRetrieval、HAND 与 STRAP 等基线。例如,mAP@20 达到 **0.3531**(STRAP 仅为 0.0071),Recall@20 接近 **1.0**,平均 DTW cost 为 **1.333 m**(接近理论最优的 1.145 m)。 - **AssemblyHands 跨域迁移**:在完全未见过的双手装配数据集上,RoboTok 的 mAP@5 为 **0.2614**,DTW cost 为 **1.095 m**,依然大幅领先基线,验证了跨域泛化能力。 #### 3.2 下游灵巧操作策略评估 在 **VTDexManip** 模拟基准上,使用检索到的演示通过 PPO 训练策略(以 k-NN 距离作为奖励塑形): - **原始设定**:RoboTok 在 6 项任务中的 5 项上超过最佳预训练基线,平均提升约 **7%**(Seen)与 **6%**(Unseen)。 - **更难设定**(恢复完整 3D 手腕运动、移除密集奖励):优势显著放大: - BottleCap Turning:**77.3%**(次优基线 59.5%) - Faucet Screwing:**44.8%**(次优基线 6.8%) - Lever Sliding:**79.3%**(次优基线 19.5%) —- ### 4. 主要贡献与结论 - RoboTok 是首个专门针对**互联网人类视频**、以**三维手部轨迹**为核心的灵巧操作检索框架。 - 通过 **torso-centered 归一化**与 **DTW 监督的嵌入学习**,实现了对视角、外观与遮挡鲁棒的**行为级检索**。 - 检索结果能够为下游灵巧机器人策略提供有效的训练监督,表明**互联网视频可以作为可扩展且持续增长的操作数据来源**。 - 该框架支持增量式索引扩展,为构建持续增长的互联网规模机器人演示数据库提供了可行路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul, Gaotian Wang, Bowen Wen, Chen Wei, Kaiyu Hang

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.03199.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.03199

Published: 2026-09-06T01:21:26.502Z