ArXiv Domain 2026-09-11
数据来源:ArXiv Domain
LLM Domain Papers
1. X-CoSD: Communication-Efficient Cross-Vocabulary Collaborative Speculative Decoding
Abstract:This paper investigates collaborative speculative decoding (CoSD), a distributed large language model (LLM) inference framework in which an on-device small language model (SLM) drafts candidate tokens and a server LLM verifies them. Existing CoSD methods assume a shared vocabulary between the SLM and the LLM and incur substantial communication load because residual resampling requires token distribution exchange between the user device and the edge server. To address these limitations, we propose cross-vocabulary CoSD (X-CoSD), a lossless and communication-efficient CoSD framework for heterogeneous SLM-LLM vocabularies. X-CoSD is built on hybrid resampling (HR), which splits residual resampling across the common-vocabulary region on the device and the LLM-only region on the server, so that distribution transmission is required only for the common-vocabulary region. We further propose X-CoSD-E, an enhanced variant based on server resampling with device verification (SR-DV), in which the server sends only replacement candidates sampled from the server LLM and their corresponding probabilities for local verification at the device. We prove that both X-CoSD and X-CoSD-E preserve the server LLM distribution, and experiments show that they significantly improve token generation speed while maintaining generation quality comparable to that of the server LLM.
中文摘要
摘要:本文研究了协作投机解码(CoSD),这是一种分布式大语言模型(LLM)推理框架,其中设备端的小语言模型(SLM)负责草拟候选标记,服务器端的LLM负责验证它们。现有的CoSD方法假设SLM和LLM之间有共享词汇表,并且由于剩余重采样需要用户设备与边缘服务器之间交换标记分布,因此会产生大量通信负载。为了解决这些限制,我们提出了跨词汇表CoSD(X-CoSD),这是一种针对异构SLM-LLM词汇表的无损且高效通信的CoSD框架。X-CoSD基于混合重采样(HR),将剩余重采样拆分到设备上的共词汇区域和服务器上的LLM专有区域,从而仅对共词汇区域进行分布传输。我们进一步提出了X-CoSD-E,这是一个基于服务器重采样和设备验证(SR-DV)的增强变体,其中服务器仅发送从服务器LLM采样的替换候选及其相应概率,供设备端进行本地验证。我们证明X-CoSD和X-CoSD-E都能保留服务器LLM分布,实验表明,它们在保持生成质量与服务器LLM相当的同时显著提高了标记生成速度。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09166 (HTTP 429)
Authors: Jaeduk Lee, Wan Choi
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09166.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09166
Published: 2026-09-11T01:27:30.987Z
2. StochBench: A Domain-Specific Benchmark for Stochastic Processes in Lean
Abstract:Leading benchmarks for formal theorem proving with large language models are small collections drawn from competition math, such as the IMO and Putnam, that poorly represent field-specific applications. We introduce StochBench, a Lean 4 benchmark of 450 graduate stochastic-processes problems at varying abstraction levels, each paired with its natural-language source. Addressing a field underrepresented in Mathlib, it covers finite and countable Markov chains, renewal processes, random walks, martingales, stopping times, queues, Brownian motion, stochastic calculus, weak convergence, and Poisson and continuous-time Markov processes. Our Opus 4.8-based agent achieves a 34.9% proof rate (157/450) under a 15-minute per-problem limit. StochBench better represents domain-specific applied mathematics while remaining challenging for advanced provers.
中文摘要
摘要:使用大型语言模型进行形式定理证明的主要基准测试是从竞赛数学中提取的小型集合,如IMO和Putnam,但这些集合无法很好地代表特定领域的应用。我们引入了StochBench,这是一个基于Lean 4的基准测试,包含450道不同抽象层次的研究生随机过程问题,每道题都配有其自然语言来源。针对Mathlib中代表性不足的领域,它涵盖有限和可数马尔可夫链、更新过程、随机游走、鞅、停止时间、排队、布朗运动、随机微积分、弱收敛,以及泊松过程和连续时间马尔可夫过程。我们基于Opus 4.8的代理在每道题限制15分钟的情况下达到34.9%的证明成功率(157/450)。StochBench在保持对高级证明者的挑战性的同时,更好地代表了特定领域的应用数学。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决形式化数学定理证明基准测试在领域覆盖与数学实践代表性方面的显著不足,具体聚焦于\*\*随机过程\*\*这一在统计学与机器学习中心重要但形式化程度相对滞后的数学分支。 核心问题与解决思路可概括如下: - \*\*现有基准的局限性\*\* - 当前主流基准(如 MINIF2F、PutnamBench 等)多源自竞赛数学(IMO、Putnam 等),规模有限且集中于奥林匹克风格的初等数学问题。 - 这类基准虽能测试通用推理能力,但\*\*无法反映特定应用数学领域的重复性论证模式与专门知识需求\*\*,容易掩盖自动证明器在领域具体任务上的优势与缺陷。 - \*\*随机过程领域的形式化缺口\*\* - 随机过程(包括马尔可夫链、鞅、布朗运动、随机微积分、排队论等)是概率论与机器学习理论的核心基础,但在 Mathlib 等主流形式化库中\*\*代表性严重不足\*\*。 - 缺乏针对该领域的、成规模的、与自然语言陈述严格配对的形式化基准,阻碍了针对领域特定证明器的开发与评估。 - \*\*STOCHBENCH 的构建与贡献\*\* - 论文发布了 \*\*STOCHBENCH\*\*:包含 \*\*450 条\*\* Lean 4 定理目标,覆盖离散与连续时间马尔可夫链、更新过程、随机游走、鞅与停时、布朗运动与 Itô 积分、弱收敛与泛函极限、泊松过程等八大主题。 - 每条定理均附带原始自然语言表述,形成形式化与非形式化对齐的语料,支持自动形式化(autoformalization)训练与语义忠实度评估。 - 针对 Mathlib 基础设施尚未覆盖的部分内容,论文设计了\*\*直接形式化(direct)\*\*与\*\*抽象形式化(abstracted)\*\*两类目标:前者可直接使用 Mathlib 对象,后者将所需性质显式列为假设,从而在不依赖缺失库组件的情况下仍可评估证明能力。 - \*\*基线评估与领域深度优先策略\*\* - 论文强调\*\*领域深度优先于跨领域广度\*\*:通过集中考察随机过程内部相关联的问题族,评估自动证明器处理该学科典型论证的一致性。 - 基于 Opus 4.8 的多轮工具调用智能体在 15 分钟/题的预算下取得 \*\*34.9%(157/450)\*\* 的清洁证明率,结果按主题与形式化类型细分,揭示了当前先进证明器在 graduate-level 应用数学上的真实水平与薄弱环节。 简言之,该工作试图建立一个\*\*更忠实于研究生级别应用数学实践、聚焦随机过程领域深度\*\*的形式化基准,以弥补竞赛数学基准与真实数学工作流之间的鸿沟,并推动该领域在 Lean/Mathlib 生态中的持续形式化。 Q2: 有哪些相关研究? 相关研究可从以下三个维度进行梳理: ### 1. 形式化数学推理的基准测试 现有基准沿竞赛难度、课程覆盖与研究语境等互补轴线发展,但普遍缺乏对研究生级别应用数学的深度覆盖: - \*\*MINIF2F\*\*(Zheng et al., 2021)以奥林匹克风格数学为中心,建立了跨系统的形式化竞赛题基准。 - \*\*PROOFNET\*\*(Azerbayev et al., 2023)将非形式化的本科数学陈述与证明同 Lean 形式化定理配对。 - \*\*PUTNAMBENCH\*\*(Tsoukalas et al., 2024)将竞赛类评估扩展至具有挑战性的本科 Putnam 竞赛问题。 - \*\*FORMALMATH\*\*(Yu et al., 2025)在规模与学科覆盖面上扩展了 Lean 4 基准。 - \*\*FORMALPROOFBENCH\*\*(Ravi et al., 2026)针对教材与资格考试中的高年级本科及研究生难度问题。 - \*\*RLMEVAL\*\*(Poiroux et al., 2025)转向数学实践,评估研究级别 Lean 形式化项目中的定理证明。 - \*\*FORMALML\*\*(Yang et al., 2025)研究机器学习理论中的子目标完成,涵盖优化与概率不等式。 相较之下,STOCHBENCH 聚焦于\*\*随机过程这一特定领域\*\*,强调领域内的深度关联问题族,而非跨领域广度。 ### 2. 证明自动化、表示与语义忠实度 该方向关注证明构造技术、形式化表示选择以及非形式化与形式化陈述间的语义对应: - \*\*Lean 4\*\*(Moura and Ullrich, 2021)与 \*\*Mathlib\*\*(The mathlib Community, 2020)提供了可扩展的证明环境与可复用的数学抽象。 - \*\*LEANDOJO\*\*(Yang et al., 2023)结合程序化证明交互与检索增强的前提选择。 - \*\*LEAN COPILOT\*\*(Song et al., 2024)将战术建议与证明搜索集成到交互式形式化工作流中。 - \*\*LEAN-STAR\*\*(Lin et al., 2024)在非形式化推理与战术生成之间进行交错。 - \*\*DEEPSEEKPROVER-V1.5\*\*(Xin et al., 2024)融合证明助手反馈、强化学习与蒙特卡洛树搜索。 - \*\*DEEPSEEK-PROVER-V2\*\*(Ren et al., 2025)围绕子目标分解开展强化学习。 在语义忠实度方面: - \*\*FORMALALIGN\*\*(Lu et al., 2024)显式评估非形式化–形式化语义对齐。 - \*\*MATHATLAS\*\*(Patel et al., 2026)考察研究生级别自动形式化中的定义与依赖结构。 - \*\*TAOBENCH\*\*(Taylor et al., 2026)通过使用自定义定义与 Mathlib 定义分别表述、但数学上等价的配对陈述,隔离了表示层面的问题。 STOCHBENCH 继承了上述关于表示与对齐的讨论,其所有定义与假设均由人工撰写并接受源代码审查,以确保与原始问题的对应关系。 ### 3. 形式化概率论与随机过程基础设施 已有大量 Lean 开发工作为 STOCHBENCH 的数学内容提供了基础: - \*\*Ying and Degenne\*\*(2022)形式化了 Doob 鞅收敛定理,并建立了条件期望、停时与鞅理论的基础框架。 - \*\*Marion\*\*(2025)通过 Ionescu–Tulcea 定理在轨迹空间上构造概率测度。 - \*\*Degenne\*\*(2025)发展了马尔可夫核与概率分解理论。 - \*\*Degenne et al.\*\*(2025)形式化了布朗运动及其扩展与路径连续性机制。 - \*\*Coelho\*\*(2026a)发展了关于布朗运动的 L^2 Itô 积分与 C^3 函数的 Itô 公式。 - \*\*Deng and Shum\*\*(2026)将教材概率论与 Mathlib 接口对接。 - \*\*Zhang\*\*(2025)验证了强化学习收敛性的形式化证明。 - \*\*Coelho\*\*(2026b)构建了数学金融库,并包含显式的忠实度审计。 STOCHBENCH 直接依托这些已有形式化成果,同时针对其中尚未覆盖的内容(如特定更新过程、排队论与某些弱收敛结果)采用抽象化假设或补充共享定义的方式完成定理陈述。 Q3: 论文如何解决这个问题? 该论文通过\*\*构建专门化的基准数据集、设计分层形式化策略、建立领域共享定义,并配合严格的基线评估协议\*\*,系统性地解决了随机过程领域缺乏高质量形式化基准与评估手段的问题。具体解决路径如下: --- ### 1. 构建领域聚焦的大规模基准语料 论文发布了 \*\*STOCHBENCH\*\*,包含 \*\*450 条\*\* Lean 4 定理目标,这是目前针对研究生级别随机过程的专用形式化基准。语料覆盖八个核心主题: - 有限与可数马尔可夫链 - 更新过程 - 随机游走与大偏差 - 连续时间马尔可夫链与排队论 - 鞅与停时 - 布朗运动与随机微积分 - 弱收敛与泛函极限 - 泊松过程 每条定理目标均与原始\*\*自然语言陈述\*\*配对(源自教材与研究生课程笔记),形成可用于自动形式化训练与语义对齐评估的平行语料。 --- ### 2. 采用分层形式化策略应对基础设施不完备 针对 Mathlib 中随机过程基础设施尚不完善的现状,论文设计了两类互补的形式化目标,避免因库缺失导致评估无法开展: - \*\*直接目标(Direct / Literal)\*\*:共 114 条。使用 Mathlib 已有对象或团队构建的共享定义直接陈述定理,要求证明器在现有库框架内完成推导。 - \*\*抽象目标(Abstracted)\*\*:共 336 条。将定理所需但 Mathlib 尚未形式化的对象或中间性质(如击中时间的第一步方程、布朗运动的二次变差、连续时间链的无记忆性等)显式列为\*\*假设(hypotheses)\*\*。Lean 验证结论仅从所述假设推出即可,证明器无需从头构造缺失的理论基础设施。 例如,对于击中时间上界问题,论文直接提供满足第一步方程的函数 g(x,y) 作为假设 \`IsHittingSolution P g\`,而非要求证明器在 Lean 中先构造路径意义上的随机变量 τ_x 并证明其期望满足该方程。 --- ### 3. 建立共享数学定义以统一领域表示 为保证相关目标在共同数学语言下可复用,论文人工构建了针对随机过程重复概念的共享抽象,关键定义包括: - \*\*有限状态链\*\*:统一的矩阵表示及随机性 \`IsStochastic\`、不可约性 \`IsIrreducible\`、平稳性 \`IsStationary\`、细致平衡、时间反转、全变差距离等。 - \*\*过程分布\*\*:\`HasMatrixMarginals\` 描述单时刻边际分布与转移矩阵幂的关系;\`HasChainLaw\` 显式给出有限维联合概率的乘积形式:
Pnu(X_0=x_0,dots,X_n=x_n) = nu(x_0)prod(i=0)^(n-1)P(xi,x(i+1))
- **停时与击中时间**:`IsHittingSolution`、`returnTime`、`natStop` 等将自然数停时转换为 `WithTop`、表达运行最大值等。 - **布朗运动局部性质**:`IsBM` 封装高斯增量、独立增量与几乎必然路径连续性等假设包。 这些共享定义使分散的目标在逻辑上形成网络,降低了跨问题重复开发基础引理的成本。 —- ### 4. 显式规范路径性质与收敛形式 论文在形式化中精确规定了各种收敛与过程律所需的具体数学形式,避免语义模糊: - **布朗运动**:通过高斯增量律、独立性与几乎必然路径连续性表达,而非仅依赖名称。 - **二次变差**:要求均方误差随分割网眼趋于零而收敛。 - **Donsker 定理**:要求对 $C(
0,T
,R)$ 上每个有界连续泛函的期望收敛,而非仅有限维分布收敛。 - Wiener 测度:单独要求在连续路径空间上存在且唯一。 这种显式规范确保了形式化目标与原始数学问题的严格对应。 —- ### 5. 设计严格的基线评估协议 为衡量当前自动证明器在该领域的能力边界,论文实施了受控的基线实验: - 评估对象:基于 Opus 4.8 的多轮工具调用智能体,配合 lean4skills 与 Lean LSP MCP server。 - 交互能力:智能体可在证明过程中调用 Lean 错误检查、库搜索、共享定义检索、loogle / leansearch 查询,并进行证明修订。 - 资源限制:每题单次运行,时间上限 15 分钟。 - 成功标准:Lean 内核接受证明且不含 sorry、sorryAx 或额外承认的事实。 实验结果按主题与形式化类型(直接/抽象)细分。该智能体在 450 题中完成 157 条清洁证明,总体成功率 34.9%。细分显示鞅与停时主题成功率最高(61.7%),而更新过程(4.9%)与布朗运动(17.8%)等领域仍极具挑战性。 —- ### 6. 发布结构化数据以支持后续研究 论文以 JSON 格式发布全部记录,每条包含: - 唯一标识符与问题名称 - 原始非形式化陈述 - Lean 4 定理目标 - 形式化范围标签(literal 或 abstract) 同时公开发布共享定义文件与基线证明尝试。这些资源可直接用于: - 自动形式化(autoformalization)模型的训练与测试; - 证明生成模型的监督学习(已成功检查的基线证明作为正例); - 领域特定证明器的开发,推动 Mathlib 中随机过程理论的持续形式化。 Q4: 论文做了哪些实验? 论文在第四部分及附录中报告了针对基准所设计的自动证明评估实验,涵盖实验协议、定量结果与定性分析。具体内容如下: —- ### 1. 实验设置与评估协议 - 评估对象:采用基于 Opus 4.8 的多轮工具调用智能体(multi-turn tool-using agent)。 - 交互环境:集成 lean4skills 与 Lean LSP MCP server,允许智能体在证明过程中动态调用 Lean 错误检查、库检索、共享定义搜索、loogle / leansearch 查询,并进行多轮证明修订。 - 运行预算:对 450 条定理目标中的每一条执行单次运行,严格限制每题 15 分钟(900 秒)。该设置旨在模拟单次尝试场景,而非多轮采样或模型对比。 - 成功判定(Clean Proof):一条证明被计为成功,当且仅当 Lean 内核接受该证明,且其中不含 sorry、sorryAx 或任何额外承认的未证明事实。所有成功证明均经 Lean 比较器核验。 - 形式化分类:实验结果按主题(topic)与形式化范围(直接形式化 / 抽象形式化)分别统计。 —- ### 2. 主要实验结果 #### 2.1 总体成功率 在 15 分钟/题的预算下,智能体于 450 条目标中完成了 157 条清洁证明,总体成功率为:
34.9% quad (157/450)
2.2 按主题分解 各主题的成功率呈现显著差异,数据源自表 1(b): | 主题 | 题目总数 | 直接目标数 | 抽象目标数 | 成功数 | 成功率 | |:—-|:—-:|:—-:|:—-:|:—-:|:—-:| | 泊松过程 | 40 | 5 | 35 | 7 | 17.5% | | 马尔可夫链(有限与可数) | 96 | 23 | 73 | 37 | 38.5% | | 更新过程 | 41 | 0 | 41 | 2 | 4.9% | | 连续时间马尔可夫链与排队 | 55 | 1 | 54 | 23 | 41.8% | | 随机游走与大偏差 | 62 | 9 | 53 | 16 | 25.8% | | 鞅与停时 | 94 | 67 | 27 | 58 | 61.7% | | 布朗运动与随机微积分 | 45 | 0 | 45 | 8 | 17.8% | | 弱收敛与泛函极限 | 17 | 9 | 8 | 6 | 35.3% | 鞅与停时主题的成功率最高(61.7%),而更新过程(4.9%)与布朗运动(17.8%)最具挑战性。 #### 2.3 按形式化范围分解 根据表 1(c),直接形式化目标与抽象形式化目标的成功率存在明显差距: - **直接目标(Direct / Literal)**:成功率 **69.3%**(79/114) - **抽象目标(Abstracted)**:成功率 **23.2%**(78/336) 论文明确指出,该对比为描述性统计,并非受控因果实验,因为两类目标在问题难度与库支持程度上亦存在差异。 —- ### 3. 定性错误分析 实验后对失败案例进行了定性检查,识别出以下主要障碍: - **证明搜索失败**:部分目标在数学上是可证的,但智能体未能在 15 分钟内找到有效证明路径。 - **缺失引理或库接口困难**:现有 Mathlib 接口不足以直接支持某些推理步骤,或相关引理缺失,导致证明卡壳。 - **形式化缺陷**:少量目标存在形式化层面的问题,例如缺少可测性(measurability)、可积性(integrability)或非空性(non-emptiness)假设,使得严格形式化证明难以完成。 —- ### 4. 附录中的典型案例展示 除受控基线实验外,论文在附录 A 中展示了三个具有代表性的智能体生成证明,用于说明不同难度与形式化策略下的证明结构: - **Q361(抽象目标,>30 分钟运行)**:有限状态不可约马尔可夫链的击中时间上界。证明构建了 9 个辅助定理,涵盖矩阵幂非负性、Kemeny 常数性、击中时间三角不等式与最大值原理传播引理,体现了抽象目标仍需大量中间数学构造。 - **Q222(直接目标,<15 分钟)**:有限不可约链正平稳分布的存在性。通过 Cesàro 平均、紧性提取收敛子列,并结合不可约性证明严格正性。 - **Q128(抽象目标,<15 分钟)**:漂移布朗运动的鞅刻画。利用独立增量的高斯条件期望与条件二阶矩,验证 Bμ(t)-μ t 与 (Bμ(t)-μ t)^2-σ^2 t 的鞅性质。 这些案例展示了智能体在处理直接形式化与抽象形式化目标时的不同行为模式,以及领域特定证明中模块化引理复用的重要性。 Q5: 有什么可以进一步探索的点? 基于该论文的局限性与基准特性,以下研究方向具有进一步探索价值: —- ### 1. 基准语料的扩展与严格化 - **规模与主题扩充**:当前 450 题覆盖八大主题,但研究生级别的随机过程还包含 Lévy 过程、鞅表示定理、Feller 过程、随机微分方程数值逼近等深层内容。系统性地将这些主题纳入基准,可更全面地测试证明器的领域泛化能力。 - **分类体系的形式化**:论文指出,当前的“直接/抽象”分类及主题划分依赖人工判断且术语未严格定义。可发展**形式化的元数据标准**,依据 Mathlib 依赖闭包、假设复杂度、所需前置引理数量等客观指标,建立可复现的难度与形式化范围标定方法。 - **完备证明库的构建**:当前发布的是“定理目标集合”,而非所有目标均配有已知完整证明。组织社区力量为剩余目标补充经过验证的人类证明,可为监督学习提供更高质量的正例。 —- ### 2. 抽象目标向直接目标的转化 - **缺失基础设施的形式化**:336 道抽象目标的核心瓶颈在于 Mathlib 尚未涵盖相应对象(如特定更新过程、排队论的显式构造、某些弱收敛的度量化等)。将这些对象从假设还原为 Mathlib 中的正式定义,既可直接提升此类目标的“直接率”,也能反哺数学库建设。 - **自动化假设消减**:研究如何从抽象目标中识别并剥离那些**可在现有库中推导**的冗余假设,逐步降低对显式假设的依赖,使更多目标转化为直接目标。 —- ### 3. 证明搜索与自动化策略 - **分层与模块化证明搜索**:Q361 的案例表明,复杂领域证明往往需要先建立 5–10 个中间引理(如最大值原理、Kemeny 常数性、击中时间三角不等式),再组合为最终结论。现有单轮/浅层搜索难以自动识别这些**跨抽象层次的依赖结构**。开发能自动提出中间猜想、分配子证明并复用模块的层级搜索算法,是提升更新过程、布朗运动等低成功率领域表现的关键。 - **领域特定的检索增强与前提选择**:当前通用检索器(如 Loogle)对随机过程的专门符号(如 `IsHittingSolution`、`HasChainLaw`、`IsBM`)缺乏先验。在 STOCHBENCH 的共享定义与证明语料上训练**领域特定的嵌入模型或检索器**,可能显著改善前提选择精度。 - **缺陷假设的自动诊断与修复**:定性分析发现部分失败源于缺失可测性、可积性或非空性假设。可探索自动形式化审查工具,通过模式匹配或轻量级 SMT 查询,在证明尝试前检测陈述的“形式化完备性”。 —- ### 4. 语义忠实度与自动形式化 - **自动化忠实度审计**:论文依赖人工审查确保定义与假设忠实于源问题。可引入 **FORMALALIGN** 风格的自动化对齐评估,通过神经或符号方法度量形式化陈述与原始自然语言之间的语义距离,尤其关注抽象目标中显式假设是否过度强化或弱化了原意。 - **非形式化到形式化的端到端训练**:450 对高质量的非形式化–形式化平行语料可用于微调大语言模型,使其直接从教材或课程笔记段落生成 Lean 代码。评估指标不仅包括语法正确性(elaboration),还应包含**语义等价性**(即生成的形式化是否与原问题逻辑等价)。 - **抽象水平的自动决策**:给定一道自然语言问题,模型需自动判断——哪些概念应使用现有 Mathlib 定义(直接形式化),哪些因基础设施缺失而需被替换为显式假设(抽象形式化)。这要求模型具备对形式化库覆盖范围的元认知能力。 —- ### 5. 评估方法论与模型训练 - **受控的因果实验**:当前直接目标与抽象目标的成功率差异(69.3% vs 23.2%)是描述性统计,混杂了问题难度与库支持因素。可设计**配对实验**:将同一数学结论分别以直接和抽象两种方式形式化,在固定模型与计算预算下隔离“形式化范围”对证明成功率的因果效应。 - **强化学习在领域基准上的应用**:借鉴 **DeepSeek-Prover-V2** 的子目标分解与强化学习框架,以 STOCHBENCH 作为环境奖励信号,训练专门的随机过程证明器。由于领域问题具有重复的论证模式(如鞅方法、首步方程、耦合论证),该领域可能比通用数学更适合强化学习的信用分配。 - **人机协同形式化**:基于该基准开发交互式 Copilot,不仅生成战术建议,还能在抽象目标与直接目标之间自动切换策略,向人类用户解释为何某些假设被显式引入(如 Mathlib 缺失某引理),从而降低研究生级别形式化的门槛。 —- ### 6. 跨领域迁移与数学实践整合 - **从随机过程到其他应用数学领域**:STOCHBENCH 证明了“领域深度优先”的基准构建策略的有效性。类似方法论可迁移至偏微分方程、调和分析、数理统计等研究生级别领域,形成一系列垂直基准,进而评估通用证明器在科学计算与机器学习理论等真实工作流中的可靠性。 - **与机器学习理论的衔接**:随机过程是分析随机算法、强化学习与扩散模型的基础。可将此基准与 **FormalML** 等机器学习理论基准结合,探索证明器在连接概率论基础与其算法推论之间的连贯性。 Q6: 总结一下论文的主要内容 该论文针对现有形式化定理证明基准过度集中于竞赛数学、缺乏领域特定应用代表性的问题,提出了 **STOCHBENCH**——一个面向研究生级别随机过程的 Lean 4 专用基准。 ### 1. 背景与动机 当前主流基准(如 MINIF2F、PutnamBench)多源于奥林匹克竞赛,规模有限且难以反映应用数学领域的典型论证模式。随机过程作为概率论、统计学与机器学习的核心基础,在 Mathlib 中形式化程度相对滞后,亟需专门化的评估语料。 ### 2. 基准构建 **语料规模与来源**:STOCHBENCH 包含 **450 条** Lean 4 定理目标,配对原始自然语言陈述。题目选自概率论教材(Siegrist, 2022)及 MIT 研究生课程笔记,覆盖八大主题: - 有限与可数马尔可夫链 - 更新过程 - 随机游走与大偏差 - 连续时间马尔可夫链与排队论 - 鞅与停时 - 布朗运动与随机微积分 - 弱收敛与泛函极限 - 泊松过程 **分层形式化策略**:鉴于 Mathlib 基础设施尚不完备,论文采用两类目标: - **直接目标(114 条)**:使用 Mathlib 现有对象或团队构建的共享定义直接陈述定理。 - **抽象目标(336 条)**:将所需但 Mathlib 缺失的对象或中间性质(如击中时间的第一步行方程、布朗运动的二次变差等)显式列为假设,Lean 仅验证结论从假设推出的逻辑有效性,不要求从头构建缺失理论。 **共享数学定义**:为统一领域表示,论文人工构建了针对有限状态链、矩阵边际分布 `HasMatrixMarginals`、联合过程律 `HasChainLaw`、停时与击中时间 `IsHittingSolution`、布朗运动局部性质 `IsBM` 等共享抽象,使相关目标具备可复用的数学语言。 ### 3. 基线评估 论文以基于 **Opus 4.8** 的多轮工具调用智能体为基线,集成 `lean4skills` 与 Lean LSP MCP server,允许动态错误检查、库检索与证明修订。在严格的 **15 分钟/题、单次运行** 协议下,该智能体完成 **157 条**清洁证明(无 `sorry` 或承认事实),总体成功率:
34.9% quad (157/450)
按主题细分的结果显示显著差异: - 鞅与停时主题成功率最高,达 **61.7%**; - 更新过程最具挑战性,仅 **4.9%**; - 按形式化范围比较,直接目标成功率 **69.3%**,抽象目标 **23.2%**(描述性统计)。 定性分析表明,失败原因包括证明搜索失败、库接口困难或缺失引理,以及少量形式化缺陷(如缺失可测性、可积性假设)。 ### 4. 贡献与意义 - **领域聚焦的基准**:STOCHBENCH 以“领域深度优先于跨领域广度”为原则,为随机过程这一在 Mathlib 中欠代表的领域提供了成规模的形式化评估语料。 - **非形式化–形式化对齐资源**:450 对平行语料可支持自动形式化(autoformalization)模型的训练与语义忠实度研究。 - **监督信号与基础设施**:已验证的基线证明为证明生成模型提供正例,共享定义与抽象化策略则为该领域在 Lean 中的持续形式化提供了可扩展路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Idan Davidovich, Debargha Ganguly, Vikash Singh, Vipin Chaudhary
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09264.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09264
Published: 2026-09-11T01:27:30.987Z
3. Osprey: Target-agnostic Pre-training Makes Stronger Drafters in Speculative Decoding
Abstract:Speculative decoding is critical for accelerating LLM inference. However, the speedup is fragile: drafters are typically trained against a narrow distribution for a single target model, and their acceptance rate collapses under workload shifts. This is a striking inversion of modern LLM development, where target models are valued precisely for the broad generalization they acquire through large-scale pretraining. We argue that the natural remedy, pretraining, has been hard to apply to drafters because existing recipes are target-specific: the drafter consumes the target’s hidden states and is distilled on the target’s logits, so pretraining must be repeated for each target. We introduce Osprey, which instead bootstraps drafters from off-the-shelf pretrained small language models, treating broad pretraining as a reusable, target-agnostic asset and reducing per-target work to a lightweight adaptation step. Realizing this requires overcoming two challenges: small LMs are far deeper than a latency-bound drafter can afford, and their pretrained computation must remain intact while the drafter learns to ingest target hidden states and emit tokens in the target’s vocabulary. Osprey addresses both by pruning to a shallow backbone, restoring its language-modeling capability with target-agnostic next-token pretraining, and adapting it to each target through vocabulary alignment, zero-initialized QKV expansion, and distillation from the target model’s output distribution. Empirically, a single pretrained Osprey backbone transfers across targets and improves mean acceptance length by 16.1% for Qwen3-8B, 21.2% for Llama-3.3-70B-Instruct, and 22.7% for the 229B MiniMax-M2.5 (with 17.5% higher tokens per second), with the largest gains on out-of-domain and multilingual data. Our code is available at this https URL.
中文摘要
摘要:推测解码对于加速大型语言模型(LLM)推理至关重要。然而,速度提升往往不稳定:起草器通常针对单一目标模型的狭窄分布进行训练,当工作负载发生变化时,其接受率会骤然下降。这与现代大型语言模型的发展趋势形成显著对比——目标模型恰恰因其通过大规模预训练获得的广泛泛化能力而被重视。我们认为,自然的解决方法是预训练,但由于现有方法针对特定目标而难以应用于起草器:起草器会消耗目标的隐藏状态,并在目标的 logits 上进行蒸馏,因此每个目标都必须重复预训练。我们提出了 Osprey,它通过现成的预训练小型语言模型来引导起草器,将广泛的预训练视为可重复使用的、与目标无关的资产,并将每个目标的工作简化为轻量级的适应步骤。实现这一点需要克服两个挑战:小型语言模型的深度远超延迟受限的起草器所能负担,同时必须在保持预训练计算不变的情况下,让起草器学习接收目标隐藏状态并生成目标词汇表中的词元。Osprey 通过剪枝为浅层骨干网络、使用与目标无关的下一词预测预训练恢复其语言建模能力,并通过词汇对齐、零初始化的 QKV 扩展以及从目标模型的输出分布进行蒸馏来适应每个目标,从而解决了上述两个问题。在实证上,单一预训练的 Osprey 骨干能够跨目标迁移,并将 Qwen3-8B 的平均接受长度提高16.1%,Llama-3.3-70B-Instruct 提高21.2%,229B MiniMax-M2.5 提高22.7%(每秒生成词元数提升17.5%),在域外与多语言数据上的增益最大。我们的代码可在此 https URL 获取。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09338 (HTTP 429)
Authors: Fengxiang Bie, Yuqing Jian, Yifan Yu, Zhongzhu Zhou, Zelei Shao, Ben Athiwaratkun, Shuaiwen Leon Song, Chenfeng Xu, Xiaoxia Wu, Tianyi Zhang
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09338.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09338
Published: 2026-09-11T01:27:30.987Z
4. SWORD: Wikidata-based Distortions Reveal Hidden Cross-Lingual Inconsistencies in LLM Factual Error Rejection
Abstract:Modern LLMs demonstrate impressive multilingual performance, yet standard benchmarks primarily reward selecting correct answers rather than evaluating genuine factual understanding. We introduce Systematic Wikidata-based Object-Relation Distortion (SWORD), a benchmark that evaluates whether models consistently reject factual errors across languages. SWORD generates syntactically well-formed but factually incorrect statements in eight widely spoken languages through controlled perturbations of Wikidata triples, ranging from random entity substitutions to semantically plausible property-based selections. Our distortion-based evaluation surfaces two critical insights that remain entirely obscured by conventional benchmarks. First, models counterintuitively achieve higher accuracy on semantically plausible distortions than on nonsensical random substitutions, suggesting reliance on distributional familiarity rather than genuine factual verification. Second, models exhibiting comparable baseline accuracy across languages show substantial performance degradation specifically on (East) Asian languages when presented with distorted statements, with cross-lingual performance gaps reaching up to 28 percentage points (49\% relative reduction) in some models. These findings demonstrate that multilingual factual reasoning involves asymmetric capabilities that aggregate accuracy metrics systematically obscure.
中文摘要
摘要:现代大型语言模型展现了令人印象深刻的多语言表现,但标准基准主要奖励选择正确答案,而非评估真实的事实理解。我们引入系统维基数据对象关系扭曲(SWORD),这是一个评估模型是否一致拒绝跨语言事实错误的基准测试。SWORD通过对维基数据三元组的受控扰动,生成八种广泛使用的语言中句法结构良好但事实错误的陈述,范围从随机实体替换到语义合理的基于属性的选择。我们的基于扭曲的评估揭示了两个关键洞见,这些见解仍被传统基准完全掩盖。首先,模型在语义上合理的扭曲上反而比无意义的随机替换获得更高的准确率,表明模型依赖分布熟悉度而非真正的事实验证。其次,跨语言表现出相当基线准确率的模型,在面对扭曲陈述时,在(东)亚语言上表现显著下降,某些模型中跨语言性能差距可达28个百分点(49%相对缩小)。这些发现表明,多语言事实推理涉及非对称能力,这些能力汇总准确度指标系统性地被忽视。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09349 (HTTP 429)
Authors: Sanghyeok Park, Minji Kang, Hosung Kwak, Jinhyuk Yun
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09349.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09349
Published: 2026-09-11T01:27:30.987Z
5. Auditable Emergency Triage for Maternal and Newborn Care in India
Abstract:At Noora Health, our nurses answer more than 50,000 medical queries per month on our WhatsApp-based service that provides caregivers with on-demand support. Their most time-critical task is emergency triage: deciding which queries need immediate in-person attention. To support them, we built a system that uses a large language model (LLM) to classify whether a message is an emergency and provide a rationale for interpretability. But the system was opaque: analyzing mistakes meant reading reasoning chains for each message, which is infeasible at our scale. Prompt changes meant re-running a full evaluation to prevent regressions, which was both costly and operationally challenging. Clinicians follow a decision tree to make this call, but it was never documented or passed to the model, which relied on a flat list of danger signs. To address these issues, we decomposed triage into two steps: an LLM extracts canonical symptoms and patient context from the query using a clinician-authored vocabulary, and a deterministic rule engine captures the scenarios that indicate an emergency. We show that the new system raised recall from 0.565 to 0.810 and F1 from 0.606 to 0.702, with structured rules driving most of the accuracy gains while the decomposition provides auditability: clinical experts can inspect each stage of the new system to see whether the query was mistranslated, symptoms were incorrectly extracted, patient context was wrongly inferred, or the necessary rules were missing. They can add new rules independently without causing regressions and avoid running costly evaluations. Since deployment, the new system has triaged 152,421 patient queries and flagged 28,535 (18.7%) as emergencies. The over-escalation rate has been 17.8%, without any increase in missed emergencies. Clinicians have also added 48 new rules since deployment, evidence of the faster correction loop we set out to build.
中文摘要
摘要:在Noora Health,我们的护士每月通过基于WhatsApp的服务回答超过50,000个医疗问题,该服务为护理人员提供按需支持。他们最紧迫的任务是紧急分诊:决定哪些问题需要立即面对面处理。为了支持他们,我们建立了一个使用大型语言模型(LLM)的系统,以分类消息是否为紧急情况,并提供可解释性的理由。但该系统不透明:分析错误意味着需要查看每条消息的推理链,而在我们的规模下这是不可行的。提示的更改意味着必须重新运行完整评估以防止回归,这既昂贵又在操作上具有挑战性。临床医生遵循决策树来做出这种判断,但它从未被记录或传递给模型,模型依赖的是一个平面的危险信号列表。为了解决这些问题,我们将分诊分解为两步:LLM使用临床医生编写的词汇表从查询中提取标准症状和患者背景信息,确定性规则引擎捕获指示紧急情况的场景。我们显示新系统将召回率从0.565提高到0.810,F1分数从0.606提高到0.702,通过结构化规则推动了大部分准确率的提升,同时分解提供了审计性:临床专家可以检查新系统的每个阶段,以查看查询是否被误译、症状是否提取错误、患者背景是否判断错误或必要规则是否缺失。他们可以独立添加新规则,而不会导致回归,并避免运行昂贵的评估。自部署以来,新系统已对152,421条患者查询进行了分诊,并标记了28,535条(18.7%)为紧急情况。过度升级率为17.8%,紧急情况遗漏率未增加。自部署以来,临床医生还增加了48条新规则,这证明了我们旨在建立的更快的纠正循环的有效性。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09356 (HTTP 429)
Authors: Shobhit Jagga, Aman Dalmia, Niharika Priyadarshini, Neelima Devadas, Amrita K Prasen, Nikhil Nalin, Santhosh SJ, Sreeram Nurani Ramasubramanian, Muhammed Afeer K, Anubhav Arora
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09356.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09356
Published: 2026-09-11T01:27:30.987Z
6. Do LLMs Make More Mistakes If They Do Not Believe the Input Data?
Abstract:Large language models (LLMs) are prone to hallucinating or misinterpreting facts, which impairs their usability in retrieval-augmented generation or data-to-text systems. We analyse how faithfulness of LLMs to provided context depends on how plausible they perceive the context to be (context-memory conflict). To better identify error patterns, we make use of the increased difficulty of non-English and low-resource language text generation and input data based on local knowledge, only partially captured in models’ parametric knowledge. We let the models generate text in English, Czech, Slovak and Upper Sorbian from factual (FA), counterfactual (CFA) and fictional (FI) RDF triples containing local Czech and Slovak data. Contrary to our expectations, we observe only a weak context-memory conflict on the human-annotated sample. For Kimi K3 as an LLM judge, which agrees well with human annotations on the sample, counterfactual inputs receive only slightly lower faithfulness scores than factual ones (-0.05 on a 1-5 scale). We also find that a suboptimal choice of LLM judge would lead to overestimating the strength of the context-memory conflict.
中文摘要
摘要:大型语言模型(LLMs)容易产生幻觉或误解事实,这削弱了它们在检索增强生成或数据到文本系统中的可用性。我们分析了LLMs对提供上下文的忠实度如何依赖于它们对上下文合理性的感知(上下文-记忆冲突)。为了更好地识别错误模式,我们利用非英语和低资源语言文本生成的难度增加,以及基于局部知识的输入数据,这些数据只部分被模型的参数知识捕获。我们让模型基于包含本地捷克和斯洛伐克数据的事实(FA)、反事实(CFA)和虚构(FI)RDF三元组生成英文、捷克语、斯洛伐克语和上索布语文本。与我们的预期相反,我们在人工标注样本上仅观察到较弱的上下文-记忆冲突。对于作为LLM评判器的Kimi K3,它在样本上与人工标注一致性良好,反事实输入的忠实度得分仅略低于事实输入(在1-5评分尺度上为-0.05)。我们还发现,选择一个次优的LLM评判器会导致高估上下文-记忆冲突的强度。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09363 (HTTP 429)
Authors: Peter Kochelka, Aleš Manuel Papáček, Vojtěch Dvořák, Ondřej Dušek
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09363.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09363
Published: 2026-09-11T01:27:30.987Z
7. Benchmarking Hybrid Deep Research Across Database Querying and Web Search
Abstract:While autonomous agents have made significant strides in “deep research” by iteratively navigating the open web to synthesize information, real-world problem-solving is rarely confined to a single environment. Complex analytical tasks inherently require agents to weave together evidence from both ambiguous unstructured text (e.g., the open web) and highly precise structured data (e.g., relational databases). However, existing benchmarks evaluate these modalities in isolation, failing to capture the critical “handoff” - the ability to preserve constraints when moving evidence between systems. We introduce HybridDeepResearch, to our knowledge the first deep-research benchmark that requires both web search and SQL to form a complete, verifiable answer. The benchmark contains 380 tool-dependent tasks grounded in LiveSQLBench-Base-Lite databases and public web corpora, validated through automated checks and human review, and covering three reasoning patterns: SQL2S, S2SQL, and Parallel. Evaluations across proprietary and open-weight models under various agentic scaffolds reveal that even state-of-the-art models like GLM-5.2, Claude-Sonnet-4.6 and GPT-5 achieve only about 50-54% Pass@8 on the hard subset. Notably, results show that directional reasoning is substantially more difficult than parallel intersection, highlighting that bridging structured and unstructured information spaces without losing constraints remains a major open challenge for agentic systems. Code and datasets are publicly available at GitHub (this https URL) and Hugging Face (this https URL).
中文摘要
摘要:虽然自主代理在“深度研究”方面已经取得了显著进展,通过迭代地在开放网络中导航以综合信息,但现实世界的问题解决很少局限于单一环境。复杂的分析任务本质上要求代理将来自模糊的非结构化文本(例如开放网络)和高度精确的结构化数据(例如关系数据库)的证据结合起来。然而,现有的基准测试通常孤立地评估这些模态,未能捕捉关键的“交接”——在系统之间移动证据时保持约束的能力。我们引入了 HybridDeepResearch,据我们所知,这是第一个需要同时使用网页搜索和 SQL 来形成完整、可验证答案的深度研究基准。该基准包含 380 个基于工具的任务,这些任务基于 LiveSQLBench-Base-Lite 数据库和公共网络资料库,通过自动检查和人工审查进行验证,涵盖三种推理模式:SQL2S、S2SQL 和 Parallel。在不同的代理框架下,对专有和开放权重模型的评估显示,即使是最先进的模型如 GLM-5.2、Claude-Sonnet-4.6 和 GPT-5,在困难子集上的 Pass@8 也仅约为 50-54%。值得注意的是,结果显示方向性推理显著比并行交集更困难,这凸显了在不丢失约束的情况下弥合结构化和非结构化信息空间仍然是代理系统的一大未解决挑战。代码和数据集在 GitHub(此 https URL)和 Hugging Face(此 https URL)上公开提供。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09410 (HTTP 429)
Authors: Ruofan Wu, Peiran Xu, Xiaolong Li, Fan Shu, Soyoung Yoon, Yite Wang, Xiaodong Yu, Boyi Liu, Feng Yan, Debiao Li, Yuxiong He, Zhewei Yao
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09410.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09410
Published: 2026-09-11T01:27:30.987Z
8. Edu-QuRating: Multi-Dimensional Educational Data Curation with Distilled Pairwise Judgements
Abstract:Educational data filters have become a practical way to improve language-model pre-training, but most filters treat educational value as a single scalar property. This may be too broad for some applications, especially if the data set already features a high density of educational material. Useful learning material needs to be accurate, engaging, well structured, and appropriate for the intended audience and application (e.g. learner- vs teacher-facing). Following QuRating (Wettig et al. 2024), we introduce Edu-QuRating: a pipeline for multi-dimensional educational data scoring and curation. Edu-QuRating defines education-specific rubrics, uses an LLM judge to label sampled document pairs and distills those pairwise preferences into reusable Edu-QuRaters, which can score individual text chunks on a set of educational criteria. Across two sequence-classification base models and six educational criteria, the best Edu-QuRater recovers held-out GPT-4.1-mini pairwise judgements with mean accuracy 0.917. We then apply the resulting scorers in two applications. First, we investigate the potential of Edu-QuRaters for corpus filtering to improve pretraining of small language models. We scored 322.25M FineWeb-Edu-Fortified documents to obtain a filtered pre-training mixture. In matched single-run pre-training comparisons, models trained with Edu-QuRating-based mixtures reached higher observed aggregate accuracy across nine benchmarks than the FineWeb-Edu baseline, with gains concentrated in particular tasks. Second, we used Edu-QuRater scores as reward terms for GRPO post-training. In held-out pairwise judge evaluations, combining Edu-QuRater and answer-structure rewards produced responses preferred to the Qwen3-4B base model on both pedagogical quality and instruction following.
中文摘要
摘要:教育数据过滤器已经成为提高语言模型预训练效果的实用方法,但大多数过滤器将教育价值视为单一的标量属性。这对于某些应用来说可能过于宽泛,尤其是当数据集中已经包含大量教育材料时。有效的学习材料需要准确、引人入胜、结构良好,并且适合预期的受众和应用场景(例如面向学习者或教师)。继QuRating(Wettig等,2024)之后,我们引入了Edu-QuRating:一个用于多维教育数据评分和整理的流程。Edu-QuRating定义了特定于教育的评价标准,使用大语言模型(LLM)判断对采样的文档对进行标注,并将这些成对偏好信息提炼成可复用的Edu-QuRaters,可在一组教育标准上对单个文本块进行评分。在两个序列分类基础模型和六个教育标准下,表现最好的Edu-QuRater以平均准确率0.917恢复了GPT-4.1-mini的保留成对判断。随后,我们在两个应用中使用了生成的评分器。首先,我们研究了Edu-QuRaters在语料过滤中改善小型语言模型预训练效果的潜力。我们对322.25百万份FineWeb-Edu-Fortified文档进行了评分,以获得一个经过过滤的预训练混合数据。在单次预训练比较中,使用Edu-QuRating生成的混合数据训练的模型在九个基准测试中的总体观察准确率高于FineWeb-Edu基线,且提升集中在特定任务上。其次,我们将Edu-QuRater评分作为GRPO后训练的奖励项。在保留的成对判断评估中,将Edu-QuRater评分与答案结构奖励结合使用,使生成的回答在教学质量和指令遵从方面均优于Qwen3-4B基础模型。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09425 (HTTP 429)
Authors: Oliver G. B. Garrod, Robin A. A. Ince, Meng Liu, Mohamed Huti, Moritz Boos, Amy Waldock, Dominic Andrews, Paul Atherton
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09425.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09425
Published: 2026-09-11T01:27:30.987Z
9. The Mutations of Machine Speech
Abstract:Algorithmic outputs now populate the digital environments through which contemporary life is organized. The role of law in facilitating and constituting (rather than merely responding to) these processes is gaining increasing traction across scholarly accounts. This inquiry traces the evolution of algorithmic outputs attending to their legal underpinnings and social implications, surfacing the mutations of machine speech. The first mutation redefined speech as data to be queried: search engines transformed the web from a space of information retrieval into an economic regime of algorithmic visibility. The second mutation reframed speech as engagement: social media platforms fused moderation with amplification, turning expression into a metric of attention, governed by corporate architectures. The third mutation emerges in conversational systems and interfaces, where generative text displaces information retrieval, bringing with it dense technolegal entanglements and profound epistemic consequences. Scholars of freedom of expression, informational privacy, and communication studies have long grappled with these dynamics, yet their implications for broader legal thought have also become urgent. This piece seeks to organize and clarify the evolving debate around algorithmic speech, making this critical but often fragmented discourse more accessible to wider legal and interdisciplinary audiences. In doing so, it bridges the gap between observing technological transformation and critically assessing the constitutive role of law within it, offering a conceptual resource for researchers, students, policymakers, and practitioners navigating and contesting this evolving landscape.
中文摘要
摘要:算法生成的输出现在充斥于组织当代生活的数字环境中。法治在促进和构成(而不仅仅是回应)这些过程中的作用,正在学术界获得越来越多的关注。本研究追踪了算法输出的发展,关注其法律基础和社会影响,揭示了机器语言的变异。第一次变异将言论重新定义为可查询的数据:搜索引擎将网络从信息检索空间转变为算法可见性的经济体系。第二次变异将言论重新框定为参与:社交媒体平台将内容审核与放大功能融合,将表达转化为注意力度量,由企业架构所治理。第三次变异出现在对话系统和界面中,生成式文本取代了信息检索,带来了复杂的技术法律纠葛和深远的认知后果。言论自由、信息隐私和传播学领域的学者长期以来一直在努力应对这些动态,但其对更广泛法律思想的影响也变得迫切。本文旨在组织和澄清围绕算法言论演变的辩论,使这一关键但常常分散的讨论更易于为更广泛的法律和跨学科受众理解。在此过程中,它弥合了观察技术变革与批判性评估法律在其中构成性作用之间的差距,为研究人员、学生、政策制定者和从业者提供了一个概念资源,以导航和应对这一不断演变的领域。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09496 (HTTP 429)
Authors: Mauricio Figueroa
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09496.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09496
Published: 2026-09-11T01:27:30.987Z
10. TEFM: Token-Efficient Faithful Modeling for Structured Data
Abstract:In this paper, we solve two fundamental obstacles in applying LLMs to critical domains: token efficiency and faithfulness. To address both constraints jointly, we present TEFM (Token-Efficient Faithful Modeling), a framework designed for structured data analysis in critical domains. TEFM achieves token efficiency by compressing lengthy structured observations into compact Behavioral Code tokens, dramatically reducing token consumption with minimal information loss. Moreover, TEFM enables faithful rationalization through a dual-fidelity objective that jointly optimizes code-level reconstruction and prediction-level fidelity, identifying minimal sufficient feature subsets grounded in input data. Comprehensive experiments across various domain datasets and model backbones (Qwen3, Gemma-2, Phi-4) show that TEFM achieves competitive classification accuracy with dramatic token reduction (approximately 1\% token retention in clinical and 2\% in security domains) while producing faithful rationales.
中文摘要
摘要:在本文中,我们解决了将大型语言模型(LLMs)应用于关键领域的两个根本性障碍:令牌效率和准确性。为同时应对这两个限制,我们提出了TEFM(Token-Efficient Faithful Modeling,令牌高效且可信的建模),该框架专为关键领域的结构化数据分析而设计。TEFM 通过将冗长的结构化观察压缩为紧凑的行为代码令牌来实现令牌效率,从而大幅减少令牌消耗且信息损失最小。此外,TEFM 通过双重保真目标实现可信的推理,该目标联合优化代码级重建和预测级保真,从输入数据中识别最小充分的特征子集。在各种领域的数据集和模型骨干(Qwen3、Gemma-2、Phi-4)上的综合实验表明,TEFM 在显著减少令牌(临床领域约保留1%令牌,安全领域约保留2%)的情况下,实现了具有竞争力的分类准确率,并生成了可信的推理。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09552 (HTTP 429)
Authors: Zhichao Hou, Lingdao Sha, Xueyu Mao, Yang Liu, Peijie Qiu, Rui Song
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2609.09552.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09552
Published: 2026-09-11T01:27:30.987Z
Agent Domain Papers
1. OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows
Abstract:Existing benchmarks for autonomous AI scientists evaluate only final outputs—-generated code, hypotheses, or papers—-yet discard the reasoning process by which those outputs were obtained. This makes it impossible to audit scientific methodology, diagnose failure modes, or distinguish systematic reasoning from fortunate guessing. We present \textbf{OpenDiscoveryTrace}, a public dataset of 558 complete AI scientific agent trajectories that captures how models reason, not just what they produce. Each trajectory records a structured 9-field-per-step trace—-including thoughts, tool calls, observations, errors, revision triggers, and self-reported confidence—-as models execute 124 scientific tasks spanning drug discovery, materials science, genomics, and scientific literature analysis. The dataset covers seven models: three frontier models (GPT-5.4, Claude Opus 4.6, and Gemini 3.1 Pro; 124 trajectories each, fully balanced across domains and difficulty levels) and four open-weight models (Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, and Qwen2.5-1.5B; 30 each), plus 60 live-retrieval variant trajectories. Pilot analysis on 363 LLM-judged trajectories reveals that process traces expose behavioral differences invisible to output-only evaluation: all three frontier models achieve comparable success rates (84—89%), yet Claude Opus 4.6 produces 30$\times$ more errors than GPT-5.4 (2.5 vs. 0.08 per trajectory, $p < 0.0001$, Cliff’s $\delta = 0.613$), with qualitatively different error profiles—-66.7% tool misuse for Claude versus 83.6% reasoning errors for GPT-5.4. We define five benchmark tasks with baselines from logistic regression, random forests, LSTMs, and Transformer models. The dataset, trace schema, agent harness, and benchmark definitions are publicly available under CC BY 4.0 to support research on process-level evaluation, scientific agent auditing, and AI governance.
中文摘要
摘要:现有的自主人工智能科学家基准仅评估最终输出—-生成代码、假设或论文—-却忽略了这些输出的推理过程。这使得无法审计科学方法论、诊断失败模式,或区分系统推理与幸运猜测。我们呈现 \textbf{OpenDiscoveryTrace},这是一个包含558条完整人工智能科学代理轨迹的公开数据集,捕捉模型如何推理,而不仅仅是它们的产出。每个轨迹记录一个结构化的每步9字段痕迹—-包括思想、工具调用、观察、错误、修订触发和自我报告的信心—-模型执行涵盖药物发现、材料科学、基因组学和科学文献分析的124项科学任务。数据集涵盖七个模型:三个前沿模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro;各124条轨迹,跨域和难度水平完全平衡)和四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B;各30个),以及60条活检取变体轨迹。对363个LLM判定轨迹的试点分析显示,过程痕迹暴露了仅用输出评估看不到的行为差异:三个前沿模型的成功率相当(84-89%),但Claude Opus 4.6比GPT-5.4多出30$\times$错误(每轨迹2.5对0.08,$p <0.0001$,Cliff’s $\delta = 0.613$),错误分布质量不同—-Claude工具滥用率为66.7%,GPT-5.4为83.6%。我们定义了五个基准任务,基线来自逻辑回归、随机森林、LSTMs和Transformer模型。数据集、跟踪模式、代理工具和基准定义均在CC BY 4.0下公开,支持流程级评估、科学代理审计和人工智能治理的研究。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09203 (HTTP 429)
Authors: Aayam Bansal, Keertan Balaji
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09203.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09203
Published: 2026-09-11T01:28:56.555Z
2. Adaptive Entangled Game Modules in Artificial General Intelligence
Abstract:We introduce a probability-wave framework for modeling the collective behavior of interacting adaptive agents, deriving testable eigenmodes through a generalized behavioral intelligence (GBI) nonlocal probability-wave equation. This framework captures a broad range of human intelligence behaviors with analytical mechanisms and offers an indirect method to examine the Liu-Chen-Ao (LCA) hypothesis of nonlocal entangled nerve fibers in the brain through collective trader behaviors. Our empirical analysis of Chinese intraday stock market data demonstrates that adaptive entangled game modes explain 82-94% (89% overall) of observed decision patterns, a sharp contrast to the predictions of neoclassical finance based on independent rational agents. Moreover, 2-12% of behaviors show adaption to intraday news, events, and environments, characterized by dual equilibrium states and abrupt reference point shifts, while purely independent modes occur in less than 5% of cases. These findings empirically support the LCA hypothesis, as observable trading behaviors reflect underlying brain mechanisms and internal intelligence decision-making in behavioral psychology. Our results highlight the necessity of incorporating adaptive entangled game modules into artificial general intelligence (AGI) architectures, addressing the limitations of conventional artificial neural network (ANN)-based AI, which relies on trillions of opaque parameters. By integrating ANN-based AI with probability-wave-based entangled-brain simulations, machine learning can enrich AGI foundation models (FMs) and facilitate the development of human-like processing units (HPUs) that leverage brain-inspired mechanisms. Such HPUs may ultimately create more compact, efficient, and robust AGI systems, particularly for embodied intelligence and robotics.
中文摘要
摘要:我们提出了一个概率波框架,用于模拟相互作用的自适应代理的集体行为,通过广义行为智能(GBI)非局域概率波方程推导可测试的本征模态。该框架通过分析机制捕捉了广泛的人类智力行为,并提供了一种间接方法,通过集体交易者行为来检验脑中非局域纠缠神经纤维的刘-陈-傲(LCA)假说。我们对中国盘中股票市场数据的实证分析表明,自适应纠缠博弈模式解释了观察到的决策模式的82%-94%(整体为89%),这与基于独立理性代理的新古典金融预测形成了鲜明对比。此外,2%-12%的行为表现出对盘中新闻、事件和环境的适应,特点是双重平衡状态和突然的参考点转变,而纯独立模式的情况不到5%。这些发现实证支持了LCA假说,因为可观察到的交易行为反映了行为心理学中潜在的大脑机制和内部智力决策。我们的结果强调了将自适应纠缠博弈模块纳入人工通用智能(AGI)架构的必要性,以应对依赖于数万亿不透明参数的传统人工神经网络(ANN)驱动的AI的局限性。通过将基于ANN的AI与基于概率波的纠缠大脑模拟结合,机器学习可以丰富AGI基础模型(FMs)并促进开发利用脑启发机制的人类类处理单元(HPUs)。此类HPUs最终可能创造出更紧凑、高效且稳健的AGI系统,尤其是用于具身智能和机器人领域。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09226 (HTTP 429)
Authors: Haochen Li, Xinshuai Guo, Jingdong Ouyang, Wei Zhang, Leilei Shi
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09226.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09226
Published: 2026-09-11T01:28:56.555Z
3. Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks
Abstract:How can language model agents effectively leverage libraries of reusable knowledge to solve long-horizon tasks? Recent work has increasingly focused on agent skills: reusable capabilities represented as skill packages, i.e., multi-file bundles containing instructions, scripts, and other resources that help agents perform specific tasks. Agent skills are typically executed by loading their skill instructions into an agent’s context and relying on the agent to follow them. As task horizons grow, however, this approach becomes increasingly brittle, because reasoning quality degrades as more information accumulates in the context window. We investigate an alternative approach in which skill packages are instead invoked as subagents. Rather than loading skill instructions into the main context, subagent execution spawns fresh context windows dedicated to solving individual subtasks. We show that subagent execution outperforms agent-skill execution when skill packages expose clear input-output contracts and their instructions encode the procedural knowledge needed to fulfill those contracts. The tradeoff is additional communication overhead, as extra tokens are required to coordinate between the main agent and its subagents. Our results show that the benefit of reusable knowledge depends not only on its content, but also on how it is organized and invoked.
中文摘要
摘要:语言模型代理如何有效利用可重复使用的知识库来解决长时间跨度的任务?近期的研究越来越关注代理技能:以技能包形式表示的可重复使用的能力,即包含指令、脚本和其他资源的多文件捆绑包,帮助代理执行特定任务。代理技能通常通过将其技能指令加载到代理的上下文中,并依赖代理遵循这些指令来执行。然而,随着任务跨度的增长,这种方法变得越来越脆弱,因为随着更多信息在上下文窗口中积累,推理质量会下降。我们研究了一种替代方法,其中技能包作为子代理被调用。子代理执行不是将技能指令加载到主上下文中,而是生成专门解决各个子任务的新上下文窗口。我们展示了当技能包具有明确的输入-输出契约,并且其指令编码了完成这些契约所需的程序性知识时,子代理执行优于代理技能执行。其权衡是额外的通信开销,因为需要额外的令牌来协调主代理与其子代理之间的操作。我们的结果表明,可重复使用知识的收益不仅取决于其内容,还取决于其组织和调用方式。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09233 (HTTP 429)
Authors: Wasu Top Piriyakulkij, Rachel Lawrence, Alicia Curth, Sushrut Karmalkar, Niranjani Prasad
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09233.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09233
Published: 2026-09-11T01:28:56.555Z
4. Gradland: On Phenomenal Experience, Differentiated Across Many Dimensions
Abstract:This paper investigates the hypothesis that the first-order structure of physical interactions, i.e. gradients or Jacobians, characterizes the structure of phenomenal experience. It does so in an idealized world inhabited by neural networks, Gradland, where the physics are known and the functions are (mostly) differentiable. The paper introduces two measures of Jacobian structure: effective rank and cohesion, based on Kirchhoff complexity. Applying the measures to a series of worked examples shows the hypothesis accounts for: (1) the duration of experience, that it can prolong over hundreds of milliseconds; (2) the difference between what is experienced vividly and obscurely; (3) the experience of texture; (4) the blooming buzzing confusion presumably experienced by newborns; (5) the difference between ideas that are held distinctly in mind and ideas that are confused; (6) what learning is like; and finally (7) the paper explains the function of rich, dense experience.
中文摘要
摘要:本文研究了一个假设,即物理相互作用的一阶结构,即梯度或雅可比矩阵,刻画了现象体验的结构。本文在一个由神经网络组成的理想化世界——Gradland中进行研究,该世界的物理规律已知,且大多数函数是可微的。本文引入了两种雅可比结构的度量方法:基于Kirchhoff复杂度的有效秩和凝聚力。将这些度量方法应用于一系列实例分析表明,该假设能够解释:(1)体验的持续时间,可以延续数百毫秒;(2)生动体验与模糊体验之间的差异;(3)纹理的体验;(4)新生儿可能经历的“花团锦簇”的混乱感;(5)脑中区分清晰的思想与混乱的思想之间的差异;(6)学习的体验;最后,(7)本文解释了丰富而密集的体验的功能。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09306 (HTTP 429)
Authors: David Balduzzi
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09306.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09306
Published: 2026-09-11T01:28:56.555Z
5. An Autonomous GeoAI Agent for Arctic Eco-Navigation
Abstract:Arctic maritime navigation is becoming increasingly important as changing sea-ice conditions expand seasonal accessibility while simultaneously introducing substantial operational, environmental, and community risks. Arctic route planning is inherently a multi-criteria problem: routes that improve vessel safety or efficiency may increase exposure to sea ice, sensitive ecosystems, or nearby communities. Existing routing methods prioritize travel time, fuel use, and navigational risk, often overlooking ecological and community impacts. We introduce a human-in-the-loop, multi-agent GeoAI system for Arctic eco-navigation that integrates operational, physical, ecological, and community-related criteria within a unified routing framework. Multiple specialized agents coordinate geospatial data acquisition and preparation, multi-objective route generation, and skyline-based decision support. The ecological criteria explicitly account for exposure to sensitive areas, including Essential Fish Habitat and seal critical habitat. By considering these ecosystem impacts and potential community burdens while keeping consequential value judgments under human control, the framework supports safer, more transparent, and socially responsible Arctic navigation. Project page and code are publicly available. this https URL, this https URL
中文摘要
摘要:随着海冰状况的变化扩大了季节性通航的可能性,同时也带来了重大操作、环境和社区风险,北极海上航行变得越来越重要。北极航线规划本质上是一个多标准问题:提高船舶安全性或效率的航线可能会增加暴露于海冰、敏感生态系统或附近社区的风险。现有的航线规划方法优先考虑行驶时间、燃料消耗和航行风险,往往忽略了对生态和社区的影响。我们引入了一种“人机交互”多智能体GeoAI北极生态导航系统,将操作、物理、生态和社区相关标准整合在一个统一的航线规划框架中。多个专业智能体协调地理空间数据的获取与准备、多目标航线生成以及基于天际线的决策支持。生态标准明确考虑了对敏感区域的暴露,包括重要鱼类栖息地和海豹关键栖息地。通过在保持重大价值判断由人为控制的同时考虑这些生态系统影响和潜在社区负担,该框架支持更安全、更透明且具有社会责任感的北极航行。项目页面和代码公开可用。该HTTPS网址,该HTTPS网址。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09374 (HTTP 429)
Authors: Samira Alkaee Taleghan, Younghyun Koo, Farnoush Banaei-Kashani
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09374.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09374
Published: 2026-09-11T01:28:56.555Z
6. The Menu Is an Execution Prior: State-Path Tool Menus for Online Agents
Abstract:Language models act through tools, yet practical agents face libraries containing thousands of interfaces. We introduce the tool menu as the short, ordered subset of available tools shown to an agent before execution. The agent can call only tools in this menu. Multi-step tasks require the final action and the prerequisite tools that create its inputs in a usable order. Current constructors rank tools by request relevance, which can surface the final action while omitting or delaying less obvious producers. We introduce the state path, a pre-execution route from the observable request state to the desired outcome, and propose State-Path Tool Menu to learn it. Our framework treats the menu as an execution prior over these routes. Its encoder represents which tools can run from the current state, how their outputs satisfy later inputs, and which orders recur in training paths. A retriever covers an executable entry, the missing-input producers, and the final action. A reranker then places producers before consumers. On ToolBench, our menu raises online success from 0.737 to 0.898 and outperforms retrieval, reranking, generation, and routing baselines without changing the agent. The State-Path menu also covers more complete chains with 32 tools than the official list covers with 128, and its success gain persists across executor families with different model capacities. Our code is at this https URL.
中文摘要
摘要:语言模型通过工具进行操作,但实际的智能体面临包含数千个接口的库。我们引入了工具菜单,作为在执行前显示给智能体的可用工具的简短、有序子集。智能体只能调用菜单中的工具。多步骤任务需要按照可用的顺序执行最终操作以及创建其输入所需的前置工具。当前的构建器通过请求相关性对工具进行排序,这可以凸显最终操作,但可能遗漏或延迟不太明显的生成器。我们引入了状态路径,这是从可观察请求状态到所需结果的预执行路线,并提出了状态路径工具菜单来学习它。我们的框架将菜单视为这些路线的执行先验。其编码器表示当前状态下可以运行哪些工具,它们的输出如何满足后续输入,以及哪些顺序在训练路径中重复出现。检索器涵盖可执行入口、缺失输入的生成器以及最终操作。然后重新排序器将生成器放在消费者之前。在ToolBench上,我们的菜单将在线成功率从0.737提升至0.898,并且在不更改智能体的情况下,性能优于检索、重排序、生成和路由基线。状态路径菜单在使用32个工具时覆盖的完整链条比官方列表使用128个工具覆盖的更多,并且其成功率提升在不同模型容量的执行器家族间仍然保持。我们的代码可在此 https URL 获取。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09395 (HTTP 429)
Authors: Bo Yan, Weikai Lin, Song Wang
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09395.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09395
Published: 2026-09-11T01:28:56.555Z
7. Decision-Focused Active Learning for Scale-Aware Critical-Materials Recovery
Abstract:Choosing a recovery process for scale-up requires connecting laboratory results with product requirements, process costs, and scale effects. We analyze records from Pacific Northwest National Laboratory’s Computer Intelligence for Critical Element Recovery and Optimization (CICERO) workflow for autonomous selective precipitation. Active learning uses prior results to choose experiments. In a conditional retrospective benchmark with fitted models and recycled neodymium-iron-boron (NdFeB) magnet records, active learning finds the best recorded result with fewer experiments than nonadaptive space filling. Enrichment is the selected rare-earth-to-iron ratio relative to that in the feed. Adaptive policies reach the recorded enrichment maximum by 16 to 24 wells (individual experiments), versus 48. Our two-stage reconstruction ties two adaptive alternatives at 16 wells. Conditional analyses of recycled samarium-cobalt (SmCo) magnets show a Round 2 tradeoff between purity and nominal yield, the recovery fraction calculated from an assumed starting amount - NdFeB Round 1 routes differ in enrichment. Rankings for produced water from oil and gas extraction depend on phase and dilution assumptions requiring confirmation. We propose choosing batches by their expected reduction in downstream Bayes risk: the minimum expected loss among available process decisions under current beliefs. In exploratory simulations, a hybrid that filters candidates has lower estimated loss than the implemented joint search across routes and conditions. Differences involving the synthetic two-stage policy are small relative to estimation uncertainty. We outline a pre-registered prospective test under a shared loss and logging standard, requiring clarified measurements and records, a defined process decision and relevant outputs, credible economic inputs, and validation at the intended scale.
中文摘要
摘要:选择放大规模的回收工艺需要将实验室结果与产品要求、工艺成本以及规模效应相结合。我们分析了来自美国西北太平洋国家实验室的关键元素回收与优化计算智能(CICERO)工作流的自主选择沉淀记录。主动学习利用先前结果来选择实验。在使用拟合模型和回收的钕-铁-硼(NdFeB)磁铁记录的条件性回顾性基准中,主动学习比非自适应的空间充填方法用更少的实验找到最佳记录结果。富集是相对于原料中稀土与铁的比率所选择的稀土-铁比。自适应策略通过16至24口井(单个实验)达到记录的富集最大值,而非自适应策略需48口井。我们的两阶段重建在16口井时将两种自适应选择绑定。回收钐-钴(SmCo)磁铁的条件分析显示Round 2在纯度和名义产率之间存在权衡,产率是从假定起始量计算的——NdFeB Round 1路线在富集上有所不同。油气开采产生的水的排名依赖于需要确认的相位和稀释假设。我们提出通过期望下游贝叶斯风险的减少来选择批次:即在现有信念下可用工艺决策中最小的期望损失。在探索性模拟中,筛选候选的混合方法比已实施的跨路线和条件的联合搜索具有更低的估计损失。涉及合成两阶段策略的差异相较于估计不确定性而言较小。我们概述了一项在共享损失和记录标准下的预注册前瞻性测试,要求明确的测量与记录、定义的工艺决策及相关输出、可靠的经济输入,并在预期规模上进行验证。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09413 (HTTP 429)
Authors: Niranjan Srinivas, Debajyoti Ray, Elias Nakouzi
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09413.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09413
Published: 2026-09-11T01:28:56.555Z
8. Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration
Abstract:World Action Models (WAMs) couple predictive world modeling with action generation, allowing anticipated future states to guide agent behavior. Although WAMs are rapidly advancing embodied AI, general-purpose counterparts remain largely unexplored in games. Existing game-oriented approaches often combine action-conditioned world models with external policies and reward functions to realize WAM-like decision-making, yet they operate mainly in 2D visual observation space and do not instantiate persistent 3D geometry. Extending this paradigm to 3D games introduces a distinct challenge. In autonomous driving and robotics, the physical environment exists independently of the model, providing a persistent 3D world in which selected actions can be executed. Games have no such external substrate; the virtual world itself must be instantiated. Most playable games require a persistent and navigable space, while 3D games additionally require explicit geometry that supports movement and interaction. Action-conditioned video rollouts provide visual observations but not this spatial representation. We present \textsc{Valerant}, a training-free framework that transforms a pretrained action-conditioned world model into a WAM for exploring and constructing 3D game maps. By coupling predictive visual rollouts with SLAM-based spatial reconstruction and exploration-driven action selection, \textsc{Valerant} progressively transforms a single image into a persistent 3D game map. This framework extends WAM-based interaction beyond 2D visual simulation and offers a new approach to reducing manual effort in 3D game-map creation.
中文摘要
摘要:世界动作模型(WAMs)将预测性世界建模与动作生成相结合,使预期的未来状态能够指导智能体行为。尽管WAMs在推动具身人工智能方面进展迅速,但其通用型对应物在游戏中仍 largely 未被探索。现有的面向游戏的方法通常将基于动作的世界模型与外部策略和奖励函数结合,以实现类似WAM的决策机制,但它们主要在二维视觉观察空间中运行,并未实例化持久的三维几何结构。将这一范式扩展到三维游戏会带来特定的挑战。在自动驾驶和机器人领域,物理环境独立于模型存在,提供了一个持久的三维世界,在其中可以执行选择的动作。游戏则没有这样的外部基础;虚拟世界本身必须被实例化。大多数可玩游戏需要一个持久且可导航的空间,而三维游戏则还需要支持移动和交互的明确几何结构。基于动作的视频模拟提供视觉观察,但无法提供这种空间表示。我们提出了\textsc{Valerant},一个无需训练的框架,将预训练的基于动作的世界模型转化为用于探索和构建三维游戏地图的WAM。通过将预测性的视觉模拟与基于SLAM的空间重建和探索驱动的动作选择相结合,\textsc{Valerant}能够逐步将单张图像转化为持久的三维游戏地图。该框架将基于WAM的交互扩展到二维视觉模拟之外,并为降低三维游戏地图创建中的人工工作提供了一种新方法。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09418 (HTTP 429)
Authors: Yiran Qiao, Feng Wang, Jing Ma
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09418.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09418
Published: 2026-09-11T01:28:56.555Z
9. XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?
Abstract:Evaluating the quality of explanations produced by explainable AI (XAI) methods remains challenging because existing approaches often rely on subjective human judgment, limiting reproducibility, scalability, and comparability between studies. We examine whether LLMs can serve as a reproducible and scalable mechanism to make comparative assessments of the quality of XAI explanations. We introduce XAI-Arena, an LLM-as-a-judge framework for scalable, reproducible, multidimensional, and stakeholder-sensitive evaluation of XAI explanation quality. XAI-Arena then allows us to compare XAI explanations along various dimensions, namely, perceived simplicity, clarity, task adequacy, trust calibration, actionability, transparency, faithfulness, and overall interpretability. We then benchmark XAI explanation methods across various datasets, machine learning models, and stakeholder personas. Human validation shows a strong positive association between LLM-generated and human ratings (Spearman’s rho=.693, p<.001). Together, LLM-based evaluations can capture systematic differences in XAI explanation quality and provide a scalable and reproducible framework for comparative assessment of XAI explanations.
中文摘要
摘要:评估可解释人工智能(XAI)方法生成的解释质量仍然具有挑战性,因为现有方法往往依赖主观的人类判断,这限制了研究之间的可重复性、可扩展性和可比性。我们探讨了大语言模型(LLM)是否可以作为一种可重复且可扩展的机制,用于对XAI解释质量进行比较评估。我们提出了XAI-Arena,一种将LLM作为评审的框架,用于可扩展、可重复、多维度且考虑利益相关者的XAI解释质量评估。XAI-Arena随后使我们能够沿多个维度对XAI解释进行比较,即感知简洁性、清晰度、任务适宜性、信任校准、可操作性、透明度、忠实性以及整体可解释性。然后,我们对不同数据集、机器学习模型和利益相关者角色的XAI解释方法进行了基准测试。人工验证显示,LLM生成的评分与人类评分之间存在强正相关(Spearman’s rho=.693, p<.001)。总的来说,基于LLM的评估能够捕捉XAI解释质量的系统差异,并为XAI解释的比较评估提供一个可扩展且可重复的框架。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09428 (HTTP 429)
Authors: Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein, Stefan Feuerriegel
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09428.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09428
Published: 2026-09-11T01:28:56.555Z
10. Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations
Abstract:As agentic systems getting adopted rapidly in safety critical applications, it is vital to measure the confidence associated with the agentic actions. In comparison to the traditional machine learning systems, agentic workflows have complex failure modes with planning, tool invocation and dynamic environment interactions. In this paper, we investigate whether model’s internal representations provide stronger signals of eventual task success in multi-turn agentic setups. We introduce two complementary methods: Latent Trajectory Dynamics (LTD), which summarizes changes in residual-stream representations across an an interaction trajectory, and the Action Representation Probe (ARP), which predicts success from representations formed at action decisions. Across three interactive benchmarks (Bash, SQL, Python) and three model families (Qwen14B, Qwen7B, DeepSeek6.7B), our methods consistently outperform surface level generation and sequence-based calibration baselines providing a zero-overhead reliability monitor that requires neither prompt alterations nor multi-sample rollouts.
中文摘要
摘要:随着自主系统在安全关键应用中被快速采用,衡量与自主行为相关的置信度变得至关重要。与传统机器学习系统相比,自主工作流在规划、工具调用和动态环境交互方面具有复杂的故障模式。在本文中,我们研究了模型的内部表征是否能在多轮自主设置中提供更强的最终任务成功信号。我们提出了两种互补方法:潜在轨迹动力学(LTD),它总结了交互轨迹中残差流表征的变化;以及动作表征探针(ARP),它从动作决策中形成的表征预测成功。在三个交互基准(Bash、SQL、Python)和三类模型(Qwen14B、Qwen7B、DeepSeek6.7B)上,我们的方法始终优于表层生成和基于序列的校准基线,提供了无需修改提示或多样本展开的零开销可靠性监控。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09448 (HTTP 429)
Authors: Priyanka Mary Mammen, Emil Joswin, Srujananjali Medicherla
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09448.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09448
Published: 2026-09-11T01:28:56.555Z
Evaluation Domain Papers
1. OpenDiscoveryTrace: Process Traces for Evaluating AI Scientist Workflows
Abstract:Existing benchmarks for autonomous AI scientists evaluate only final outputs—-generated code, hypotheses, or papers—-yet discard the reasoning process by which those outputs were obtained. This makes it impossible to audit scientific methodology, diagnose failure modes, or distinguish systematic reasoning from fortunate guessing. We present \textbf{OpenDiscoveryTrace}, a public dataset of 558 complete AI scientific agent trajectories that captures how models reason, not just what they produce. Each trajectory records a structured 9-field-per-step trace—-including thoughts, tool calls, observations, errors, revision triggers, and self-reported confidence—-as models execute 124 scientific tasks spanning drug discovery, materials science, genomics, and scientific literature analysis. The dataset covers seven models: three frontier models (GPT-5.4, Claude Opus 4.6, and Gemini 3.1 Pro; 124 trajectories each, fully balanced across domains and difficulty levels) and four open-weight models (Qwen2.5-7B, Mistral-7B-v0.3, Phi-3.5-mini, and Qwen2.5-1.5B; 30 each), plus 60 live-retrieval variant trajectories. Pilot analysis on 363 LLM-judged trajectories reveals that process traces expose behavioral differences invisible to output-only evaluation: all three frontier models achieve comparable success rates (84—89%), yet Claude Opus 4.6 produces 30$\times$ more errors than GPT-5.4 (2.5 vs. 0.08 per trajectory, $p < 0.0001$, Cliff’s $\delta = 0.613$), with qualitatively different error profiles—-66.7% tool misuse for Claude versus 83.6% reasoning errors for GPT-5.4. We define five benchmark tasks with baselines from logistic regression, random forests, LSTMs, and Transformer models. The dataset, trace schema, agent harness, and benchmark definitions are publicly available under CC BY 4.0 to support research on process-level evaluation, scientific agent auditing, and AI governance.
中文摘要
摘要:现有的自主人工智能科学家基准仅评估最终输出—-生成代码、假设或论文—-却忽略了这些输出的推理过程。这使得无法审计科学方法论、诊断失败模式,或区分系统推理与幸运猜测。我们呈现 \textbf{OpenDiscoveryTrace},这是一个包含558条完整人工智能科学代理轨迹的公开数据集,捕捉模型如何推理,而不仅仅是它们的产出。每个轨迹记录一个结构化的每步9字段痕迹—-包括思想、工具调用、观察、错误、修订触发和自我报告的信心—-模型执行涵盖药物发现、材料科学、基因组学和科学文献分析的124项科学任务。数据集涵盖七个模型:三个前沿模型(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro;各124条轨迹,跨域和难度水平完全平衡)和四个开放权重模型(Qwen2.5-7B、Mistral-7B-v0.3、Phi-3.5-mini 和 Qwen2.5-1.5B;各30个),以及60条活检取变体轨迹。对363个LLM判定轨迹的试点分析显示,过程痕迹暴露了仅用输出评估看不到的行为差异:三个前沿模型的成功率相当(84-89%),但Claude Opus 4.6比GPT-5.4多出30$\times$错误(每轨迹2.5对0.08,$p <0.0001$,Cliff’s $\delta = 0.613$),错误分布质量不同—-Claude工具滥用率为66.7%,GPT-5.4为83.6%。我们定义了五个基准任务,基线来自逻辑回归、随机森林、LSTMs和Transformer模型。数据集、跟踪模式、代理工具和基准定义均在CC BY 4.0下公开,支持流程级评估、科学代理审计和人工智能治理的研究。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09203 (HTTP 429)
Authors: Aayam Bansal, Keertan Balaji
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09203.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09203
Published: 2026-09-11T01:29:16.101Z
2. Adaptive Entangled Game Modules in Artificial General Intelligence
Abstract:We introduce a probability-wave framework for modeling the collective behavior of interacting adaptive agents, deriving testable eigenmodes through a generalized behavioral intelligence (GBI) nonlocal probability-wave equation. This framework captures a broad range of human intelligence behaviors with analytical mechanisms and offers an indirect method to examine the Liu-Chen-Ao (LCA) hypothesis of nonlocal entangled nerve fibers in the brain through collective trader behaviors. Our empirical analysis of Chinese intraday stock market data demonstrates that adaptive entangled game modes explain 82-94% (89% overall) of observed decision patterns, a sharp contrast to the predictions of neoclassical finance based on independent rational agents. Moreover, 2-12% of behaviors show adaption to intraday news, events, and environments, characterized by dual equilibrium states and abrupt reference point shifts, while purely independent modes occur in less than 5% of cases. These findings empirically support the LCA hypothesis, as observable trading behaviors reflect underlying brain mechanisms and internal intelligence decision-making in behavioral psychology. Our results highlight the necessity of incorporating adaptive entangled game modules into artificial general intelligence (AGI) architectures, addressing the limitations of conventional artificial neural network (ANN)-based AI, which relies on trillions of opaque parameters. By integrating ANN-based AI with probability-wave-based entangled-brain simulations, machine learning can enrich AGI foundation models (FMs) and facilitate the development of human-like processing units (HPUs) that leverage brain-inspired mechanisms. Such HPUs may ultimately create more compact, efficient, and robust AGI systems, particularly for embodied intelligence and robotics.
中文摘要
摘要:我们提出了一个概率波框架,用于模拟相互作用的自适应代理的集体行为,通过广义行为智能(GBI)非局域概率波方程推导可测试的本征模态。该框架通过分析机制捕捉了广泛的人类智力行为,并提供了一种间接方法,通过集体交易者行为来检验脑中非局域纠缠神经纤维的刘-陈-傲(LCA)假说。我们对中国盘中股票市场数据的实证分析表明,自适应纠缠博弈模式解释了观察到的决策模式的82%-94%(整体为89%),这与基于独立理性代理的新古典金融预测形成了鲜明对比。此外,2%-12%的行为表现出对盘中新闻、事件和环境的适应,特点是双重平衡状态和突然的参考点转变,而纯独立模式的情况不到5%。这些发现实证支持了LCA假说,因为可观察到的交易行为反映了行为心理学中潜在的大脑机制和内部智力决策。我们的结果强调了将自适应纠缠博弈模块纳入人工通用智能(AGI)架构的必要性,以应对依赖于数万亿不透明参数的传统人工神经网络(ANN)驱动AI的局限性。通过将基于ANN的AI与基于概率波的纠缠脑模拟相结合,机器学习可以丰富AGI基础模型(FMs),并促进利用脑启发机制的人类类处理单元(HPUs)的开发。这类HPUs最终可能创造出更紧凑、高效和稳健的AGI系统,尤其适用于具身智能和机器人领域。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09226 (HTTP 429)
Authors: Haochen Li, Xinshuai Guo, Jingdong Ouyang, Wei Zhang, Leilei Shi
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09226.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09226
Published: 2026-09-11T01:29:16.101Z
3. Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks
Abstract:How can language model agents effectively leverage libraries of reusable knowledge to solve long-horizon tasks? Recent work has increasingly focused on agent skills: reusable capabilities represented as skill packages, i.e., multi-file bundles containing instructions, scripts, and other resources that help agents perform specific tasks. Agent skills are typically executed by loading their skill instructions into an agent’s context and relying on the agent to follow them. As task horizons grow, however, this approach becomes increasingly brittle, because reasoning quality degrades as more information accumulates in the context window. We investigate an alternative approach in which skill packages are instead invoked as subagents. Rather than loading skill instructions into the main context, subagent execution spawns fresh context windows dedicated to solving individual subtasks. We show that subagent execution outperforms agent-skill execution when skill packages expose clear input-output contracts and their instructions encode the procedural knowledge needed to fulfill those contracts. The tradeoff is additional communication overhead, as extra tokens are required to coordinate between the main agent and its subagents. Our results show that the benefit of reusable knowledge depends not only on its content, but also on how it is organized and invoked.
中文摘要
摘要:语言模型代理如何有效利用可重复使用的知识库来解决长时间跨度的任务?近期的研究越来越关注代理技能:以技能包形式表示的可重复使用的能力,即包含指令、脚本和其他资源的多文件捆绑包,帮助代理执行特定任务。代理技能通常通过将其技能指令加载到代理的上下文中,并依赖代理遵循这些指令来执行。然而,随着任务跨度的增长,这种方法变得越来越脆弱,因为随着更多信息在上下文窗口中积累,推理质量会下降。我们研究了一种替代方法,其中技能包作为子代理被调用。子代理执行不是将技能指令加载到主上下文中,而是生成专门解决各个子任务的新上下文窗口。我们展示了当技能包具有明确的输入-输出契约,并且其指令编码了完成这些契约所需的程序性知识时,子代理执行优于代理技能执行。其权衡是额外的通信开销,因为需要额外的令牌来协调主代理与其子代理之间的操作。我们的结果表明,可重复使用知识的收益不仅取决于其内容,还取决于其组织和调用方式。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09233 (HTTP 429)
Authors: Wasu Top Piriyakulkij, Rachel Lawrence, Alicia Curth, Sushrut Karmalkar, Niranjani Prasad
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09233.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09233
Published: 2026-09-11T01:29:16.101Z
4. Gradland: On Phenomenal Experience, Differentiated Across Many Dimensions
Abstract:This paper investigates the hypothesis that the first-order structure of physical interactions, i.e. gradients or Jacobians, characterizes the structure of phenomenal experience. It does so in an idealized world inhabited by neural networks, Gradland, where the physics are known and the functions are (mostly) differentiable. The paper introduces two measures of Jacobian structure: effective rank and cohesion, based on Kirchhoff complexity. Applying the measures to a series of worked examples shows the hypothesis accounts for: (1) the duration of experience, that it can prolong over hundreds of milliseconds; (2) the difference between what is experienced vividly and obscurely; (3) the experience of texture; (4) the blooming buzzing confusion presumably experienced by newborns; (5) the difference between ideas that are held distinctly in mind and ideas that are confused; (6) what learning is like; and finally (7) the paper explains the function of rich, dense experience.
中文摘要
摘要:本文研究了一个假设,即物理相互作用的一阶结构,即梯度或雅可比矩阵,刻画了现象体验的结构。本文在一个由神经网络组成的理想化世界——Gradland中进行研究,该世界的物理规律已知,且大多数函数是可微的。本文引入了两种雅可比结构的度量方法:有效秩和凝聚力,基于柯希霍夫复杂性。将这些度量方法应用于一系列实例表明,该假设可以解释:(1) 体验的持续时间,即其可以延长至数百毫秒;(2) 生动体验与模糊体验之间的差异;(3) 纹理的体验;(4) 新生儿可能体验到的“绽放嗡嗡混乱”;(5) 心中明确保持的想法与混乱想法之间的差异;(6) 学习的体验;以及最后 (7) 论文解释了丰富、密集体验的功能。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09306 (HTTP 429)
Authors: David Balduzzi
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09306.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09306
Published: 2026-09-11T01:29:16.101Z
5. An Autonomous GeoAI Agent for Arctic Eco-Navigation
Abstract:Arctic maritime navigation is becoming increasingly important as changing sea-ice conditions expand seasonal accessibility while simultaneously introducing substantial operational, environmental, and community risks. Arctic route planning is inherently a multi-criteria problem: routes that improve vessel safety or efficiency may increase exposure to sea ice, sensitive ecosystems, or nearby communities. Existing routing methods prioritize travel time, fuel use, and navigational risk, often overlooking ecological and community impacts. We introduce a human-in-the-loop, multi-agent GeoAI system for Arctic eco-navigation that integrates operational, physical, ecological, and community-related criteria within a unified routing framework. Multiple specialized agents coordinate geospatial data acquisition and preparation, multi-objective route generation, and skyline-based decision support. The ecological criteria explicitly account for exposure to sensitive areas, including Essential Fish Habitat and seal critical habitat. By considering these ecosystem impacts and potential community burdens while keeping consequential value judgments under human control, the framework supports safer, more transparent, and socially responsible Arctic navigation. Project page and code are publicly available. this https URL, this https URL
中文摘要
摘要:随着海冰状况的变化扩大了季节性通航的可达性,同时也带来了显著的操作、环境和社区风险,北极海上航行变得越来越重要。北极航线规划本质上是一个多标准问题:提高船舶安全性或效率的航线可能会增加暴露于海冰、敏感生态系统或附近社区的风险。现有的航线规划方法优先考虑旅行时间、燃料消耗和航行风险,往往忽视生态和社区影响。我们提出了一种人机协作、多智能体的北极生态航行GeoAI系统,该系统在统一的航线规划框架内整合了操作、物理、生态和社区相关标准。多个专业智能体协调地理空间数据的获取和准备、多目标航线生成以及基于天际线的决策支持。生态标准明确考虑了对敏感区域的暴露,包括关键鱼类栖息地和海豹核心栖息地。在考虑这些生态系统影响和潜在社区负担的同时,将重要价值判断保留在人工控制下,该框架支持更安全、更透明和更具社会责任感的北极航行。项目页面和代码公开可用。此 https URL, 此 https URL
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09374 (HTTP 429)
Authors: Samira Alkaee Taleghan, Younghyun Koo, Farnoush Banaei-Kashani
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09374.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09374
Published: 2026-09-11T01:29:16.101Z
6. The Menu Is an Execution Prior: State-Path Tool Menus for Online Agents
Abstract:Language models act through tools, yet practical agents face libraries containing thousands of interfaces. We introduce the tool menu as the short, ordered subset of available tools shown to an agent before execution. The agent can call only tools in this menu. Multi-step tasks require the final action and the prerequisite tools that create its inputs in a usable order. Current constructors rank tools by request relevance, which can surface the final action while omitting or delaying less obvious producers. We introduce the state path, a pre-execution route from the observable request state to the desired outcome, and propose State-Path Tool Menu to learn it. Our framework treats the menu as an execution prior over these routes. Its encoder represents which tools can run from the current state, how their outputs satisfy later inputs, and which orders recur in training paths. A retriever covers an executable entry, the missing-input producers, and the final action. A reranker then places producers before consumers. On ToolBench, our menu raises online success from 0.737 to 0.898 and outperforms retrieval, reranking, generation, and routing baselines without changing the agent. The State-Path menu also covers more complete chains with 32 tools than the official list covers with 128, and its success gain persists across executor families with different model capacities. Our code is at this https URL.
中文摘要
摘要:语言模型通过工具进行操作,但实际的智能体面临包含数千个接口的库。我们引入了工具菜单,作为在执行前显示给智能体的可用工具的简短、有序子集。智能体只能调用菜单中的工具。多步骤任务需要按照可用的顺序执行最终操作以及创建其输入所需的前置工具。当前的构建器通过请求相关性对工具进行排序,这可以凸显最终操作,但可能遗漏或延迟不太明显的生成器。我们引入了状态路径,这是从可观察请求状态到所需结果的预执行路线,并提出了状态路径工具菜单来学习它。我们的框架将菜单视为这些路线的执行先验。其编码器表示当前状态下可以运行哪些工具,这些工具的输出如何满足后续输入,以及训练路径中哪些顺序会重复出现。检索器涵盖可执行入口、缺失输入的生成器和最终操作。然后,重排序器将生成器放在使用者之前。在ToolBench上,我们的菜单将在线成功率从0.737提升到0.898,并且在不改变智能体的情况下,优于检索、重排序、生成和路由基线。状态路径菜单在32个工具上覆盖的完整链条比官方列表在128个工具上覆盖的更多,其成功率提升在具有不同模型容量的执行器系列中也得以保持。我们的代码可以在此 https URL 获取。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09395 (HTTP 429)
Authors: Bo Yan, Weikai Lin, Song Wang
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09395.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09395
Published: 2026-09-11T01:29:16.101Z
7. Decision-Focused Active Learning for Scale-Aware Critical-Materials Recovery
Abstract:Choosing a recovery process for scale-up requires connecting laboratory results with product requirements, process costs, and scale effects. We analyze records from Pacific Northwest National Laboratory’s Computer Intelligence for Critical Element Recovery and Optimization (CICERO) workflow for autonomous selective precipitation. Active learning uses prior results to choose experiments. In a conditional retrospective benchmark with fitted models and recycled neodymium-iron-boron (NdFeB) magnet records, active learning finds the best recorded result with fewer experiments than nonadaptive space filling. Enrichment is the selected rare-earth-to-iron ratio relative to that in the feed. Adaptive policies reach the recorded enrichment maximum by 16 to 24 wells (individual experiments), versus 48. Our two-stage reconstruction ties two adaptive alternatives at 16 wells. Conditional analyses of recycled samarium-cobalt (SmCo) magnets show a Round 2 tradeoff between purity and nominal yield, the recovery fraction calculated from an assumed starting amount - NdFeB Round 1 routes differ in enrichment. Rankings for produced water from oil and gas extraction depend on phase and dilution assumptions requiring confirmation. We propose choosing batches by their expected reduction in downstream Bayes risk: the minimum expected loss among available process decisions under current beliefs. In exploratory simulations, a hybrid that filters candidates has lower estimated loss than the implemented joint search across routes and conditions. Differences involving the synthetic two-stage policy are small relative to estimation uncertainty. We outline a pre-registered prospective test under a shared loss and logging standard, requiring clarified measurements and records, a defined process decision and relevant outputs, credible economic inputs, and validation at the intended scale.
中文摘要
摘要:选择放大规模的回收工艺需要将实验室结果与产品要求、工艺成本以及规模效应相结合。我们分析了来自美国西北太平洋国家实验室的关键元素回收与优化计算智能(CICERO)工作流的自主选择沉淀记录。主动学习利用先前结果来选择实验。在使用拟合模型和回收的钕-铁-硼(NdFeB)磁铁记录的条件性回顾性基准中,主动学习比非自适应的空间充填方法用更少的实验找到最佳记录结果。富集是相对于原料中稀土与铁的比率所选择的稀土-铁比。自适应策略通过16至24口井(单个实验)达到记录的富集最大值,而非自适应策略需48口井。我们的两阶段重建在16口井时将两种自适应选择绑定。回收钐-钴(SmCo)磁铁的条件分析显示Round 2在纯度和名义产率之间存在权衡,产率是从假定起始量计算的——NdFeB Round 1路线在富集上有所不同。油气开采产生的水的排名依赖于需要确认的相态和稀释假设。我们提出通过预期下游贝叶斯风险的减少来选择批次:即在现有信念下可用工艺决策中最小的预期损失。在探索性模拟中,筛选候选的混合方法比已实施的跨路线和条件的联合搜索具有更低的预估损失。涉及合成两阶段策略的差异相较于估计不确定性而言较小。我们概述了一项在共享损失和记录标准下的预注册前瞻性测试,要求明确的测量与记录、定义的工艺决策及相关输出、可靠的经济输入,并在预期规模上进行验证。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09413 (HTTP 429)
Authors: Niranjan Srinivas, Debajyoti Ray, Elias Nakouzi
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09413.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09413
Published: 2026-09-11T01:29:16.101Z
8. Valerant: An Automatic Navigable Game Map Generator via Action-Conditioned World Model Exploration
Abstract:World Action Models (WAMs) couple predictive world modeling with action generation, allowing anticipated future states to guide agent behavior. Although WAMs are rapidly advancing embodied AI, general-purpose counterparts remain largely unexplored in games. Existing game-oriented approaches often combine action-conditioned world models with external policies and reward functions to realize WAM-like decision-making, yet they operate mainly in 2D visual observation space and do not instantiate persistent 3D geometry. Extending this paradigm to 3D games introduces a distinct challenge. In autonomous driving and robotics, the physical environment exists independently of the model, providing a persistent 3D world in which selected actions can be executed. Games have no such external substrate; the virtual world itself must be instantiated. Most playable games require a persistent and navigable space, while 3D games additionally require explicit geometry that supports movement and interaction. Action-conditioned video rollouts provide visual observations but not this spatial representation. We present \textsc{Valerant}, a training-free framework that transforms a pretrained action-conditioned world model into a WAM for exploring and constructing 3D game maps. By coupling predictive visual rollouts with SLAM-based spatial reconstruction and exploration-driven action selection, \textsc{Valerant} progressively transforms a single image into a persistent 3D game map. This framework extends WAM-based interaction beyond 2D visual simulation and offers a new approach to reducing manual effort in 3D game-map creation.
中文摘要
摘要:世界动作模型(WAMs)将预测性世界建模与动作生成相结合,使预期的未来状态能够指导智能体行为。尽管WAMs在推动具身人工智能方面进展迅速,但其通用型对应物在游戏中仍 largely 未被探索。现有的面向游戏的方法通常将基于动作的世界模型与外部策略和奖励函数结合,以实现类似WAM的决策机制,但它们主要在二维视觉观察空间中运作,并未实例化持久的三维几何体。将这一范式扩展到三维游戏带来了特有的挑战。在自动驾驶和机器人领域,物理环境独立于模型存在,提供了一个可执行选定动作的持久三维世界。而游戏则没有这样的外部基础;虚拟世界本身必须被实例化。大多数可玩游戏需要一个持久且可导航的空间,而三维游戏 additionally 还需要支持移动和互动的明确几何结构。基于动作的视频滚动提供了视觉观察,但无法提供这种空间表示。我们提出了 \textsc{Valerant},一个无需训练的框架,将预训练的基于动作的世界模型转化为用于探索和构建三维游戏地图的WAM。通过将预测性的视觉滚动与基于SLAM的空间重建及探索驱动的动作选择相结合,\textsc{Valerant}逐步将单张图像转化为持久的三维游戏地图。该框架将基于WAM的交互扩展到二维视觉模拟之外,并为降低三维游戏地图创建中的人工工作提供了一种新方法。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09418 (HTTP 429)
Authors: Yiran Qiao, Feng Wang, Jing Ma
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09418.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09418
Published: 2026-09-11T01:29:16.101Z
9. XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?
Abstract:Evaluating the quality of explanations produced by explainable AI (XAI) methods remains challenging because existing approaches often rely on subjective human judgment, limiting reproducibility, scalability, and comparability between studies. We examine whether LLMs can serve as a reproducible and scalable mechanism to make comparative assessments of the quality of XAI explanations. We introduce XAI-Arena, an LLM-as-a-judge framework for scalable, reproducible, multidimensional, and stakeholder-sensitive evaluation of XAI explanation quality. XAI-Arena then allows us to compare XAI explanations along various dimensions, namely, perceived simplicity, clarity, task adequacy, trust calibration, actionability, transparency, faithfulness, and overall interpretability. We then benchmark XAI explanation methods across various datasets, machine learning models, and stakeholder personas. Human validation shows a strong positive association between LLM-generated and human ratings (Spearman’s rho=.693, p<.001). Together, LLM-based evaluations can capture systematic differences in XAI explanation quality and provide a scalable and reproducible framework for comparative assessment of XAI explanations.
中文摘要
摘要:评估可解释人工智能(XAI)方法生成的解释质量仍然具有挑战性,因为现有方法往往依赖主观的人类判断,这限制了研究之间的可重复性、可扩展性和可比性。我们探讨了大语言模型(LLM)是否可以作为一种可重复且可扩展的机制,用于对XAI解释质量进行比较评估。我们提出了XAI-Arena,一种将LLM作为评审的框架,用于可扩展、可重复、多维度且考虑利益相关者的XAI解释质量评估。XAI-Arena随后使我们能够沿多个维度比较XAI解释,即感知简单性、清晰度、任务适用性、信任校准、可操作性、透明性、可信度以及总体可解释性。然后,我们在各类数据集、机器学习模型和利益相关者角色上对XAI解释方法进行基准测试。人工验证显示,LLM生成的评分与人工评分之间存在强正相关(Spearman rho=.693,p<.001)。总体而言,基于LLM的评估能够捕捉XAI解释质量的系统性差异,并为XAI解释的比较评估提供可扩展且可重复的框架。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09428 (HTTP 429)
Authors: Yanfei Hu Fleischhauer, Alona Zharova, Nadja Klein, Stefan Feuerriegel
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09428.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09428
Published: 2026-09-11T01:29:16.101Z
10. Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations
Abstract:As agentic systems getting adopted rapidly in safety critical applications, it is vital to measure the confidence associated with the agentic actions. In comparison to the traditional machine learning systems, agentic workflows have complex failure modes with planning, tool invocation and dynamic environment interactions. In this paper, we investigate whether model’s internal representations provide stronger signals of eventual task success in multi-turn agentic setups. We introduce two complementary methods: Latent Trajectory Dynamics (LTD), which summarizes changes in residual-stream representations across an an interaction trajectory, and the Action Representation Probe (ARP), which predicts success from representations formed at action decisions. Across three interactive benchmarks (Bash, SQL, Python) and three model families (Qwen14B, Qwen7B, DeepSeek6.7B), our methods consistently outperform surface level generation and sequence-based calibration baselines providing a zero-overhead reliability monitor that requires neither prompt alterations nor multi-sample rollouts.
中文摘要
摘要:随着自主系统在安全关键应用中被快速采用,衡量与自主行为相关的置信度变得至关重要。与传统机器学习系统相比,自主工作流在规划、工具调用和动态环境交互方面具有复杂的故障模式。在本文中,我们研究了模型的内部表征是否能够在多轮自主设置中提供更强的最终任务成功信号。我们提出了两种互补方法:潜在轨迹动力学(LTD),它总结了交互轨迹中残差流表征的变化;以及动作表征探针(ARP),它从动作决策中形成的表征预测成功。在三个交互基准(Bash、SQL、Python)以及三类模型(Qwen14B、Qwen7B、DeepSeek6.7B)上,我们的方法始终优于表层生成和基于序列的校准基线,提供了无需修改提示或多样本展开的零开销可靠性监控。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09448 (HTTP 429)
Authors: Priyanka Mary Mammen, Emil Joswin, Srujananjali Medicherla
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2609.09448.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09448
Published: 2026-09-11T01:29:16.101Z
VLM Domain Papers
1. Evidence-Order Calibration for Selective Visual Reasoning under Progressive Loss of Question-Critical Evidence
Abstract:Vision-language model (VLM) confidence may change in aggregate when visual evidence is degraded while remaining structurally inconsistent within individual examples. We study answer-level reliability along five-step, question-conditioned evidence-loss trajectories. Using a frozen Qwen2.5-VL-3B-Instruct model, we construct 176 accepted GQA-derived trajectories (880 masking conditions) by progressively masking scene-graph-localized question-critical regions. Native sequence confidence has an evidence monotonicity violation rate (EMVR) of 0.436, and 92.0% of trajectories contain at least one adjacent violation. A matched non-critical-region control shows that full critical masking reduces accuracy by 28.2 percentage points, compared with 0.6 points for equally sized non-critical masks; the paired difference is 27.6 points (95% CI [20.0, 34.7]). We train a lightweight post-hoc reliability head on frozen hidden states, sequence confidence, and entropy. Adding evidence-order supervision to binary cross-entropy (BCE) reduces masking EMVR from 0.330 to 0.303 (paired difference -0.027, 95% CI [-0.044, -0.010]). The same mask-trained objective reduces EMVR from 0.449 to 0.402 on held-out question IDs under unseen local Gaussian blur (difference -0.0468, 95% CI [-0.0739, -0.0199]). AUROC, Brier, and AURC differences between the two learned heads are statistically inconclusive, and native confidence remains stronger for selective-risk ranking. The results separate evidence-order consistency from conventional correctness discrimination rather than establishing generic confidence superiority.
中文摘要
摘要:当视觉证据被削弱时,视觉-语言模型(VLM)的信心可能在整体上发生变化,同时在单个示例中保持结构性不一致。我们研究了沿五步、基于问题的证据损失轨迹的答案级可靠性。使用被冻结的 Qwen2.5-VL-3B-Instruct 模型,我们通过逐步掩蔽场景图定位的与问题相关的关键区域,构建了 176 条经过接受的基于 GQA 的轨迹(880 种掩蔽条件)。原始序列信心的证据单调性违规率(EMVR)为 0.436,92.0% 的轨迹至少包含一次相邻违规。匹配的非关键区域对照显示,完全关键掩蔽将准确率降低了 28.2 个百分点,而同等大小的非关键掩蔽仅降低 0.6 个百分点;配对差异为 27.6 个百分点(95% 置信区间 [20.0, 34.7])。我们在冻结的隐藏状态、序列信心和熵上训练了一个轻量级的事后可靠性头。将证据顺序监督添加到二元交叉熵(BCE)中,将掩蔽 EMVR 从 0.330 降至 0.303(配对差异 -0.027,95% 置信区间 [-0.044, -0.010])。相同的掩蔽训练目标在未见本地高斯模糊下,对持出问题 ID 的 EMVR 从 0.449 降至 0.402(差异 -0.0468,95% 置信区间 [-0.0739, -0.0199])。两个学习得到的可靠性头在 AUROC、Brier 和 AURC 指标上的差异在统计学上不显著,原始信心在选择性风险排序上仍然更强。结果将证据顺序一致性与传统正确性判别分离,而不是建立通用的信心优越性。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09184 (HTTP 429)
Authors: Muhamathu Ameer Ali Aacaas Muhamath
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09184.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09184
Published: 2026-09-11T01:29:35.700Z
2. Integrating Unimodal and Vision-Language Representations in Latent Space for Multi-Label Chest X-Ray Classification
Abstract:Multi-label chest X-ray classification has attracted considerable attention in recent years, with the effective use of visual representations and clinical semantic knowledge playing an important role. This study proposes a framework that combines unimodal representations from RAD-DINO with vision—language representations from BioViL-T for the classification of 14 labels in the MIMIC-CXR-JPG dataset. The RAD-DINO and BioViL-T embeddings and their combined representation are refined separately in latent space before being normalized and fused across the three branches. In addition to improving classification performance, the study aims to clarify the role of each embedding source and the degree to which they complement one another. Experiments show that RAD-DINO outperforms BioViL-T when used independently, whereas early fusion further improves the results, indicating that the two embedding sources contain complementary information. The best-performing model achieves a mean AUROC of 0.840 and an mAP of 0.467. Ablation analysis shows that hybrid fusion provides consistent and statistically significant improvements over early fusion when each embedding source is refined in latent space, suggesting that fusion effectiveness depends on the quality of the representation supplied by each branch. However, the study has only been evaluated internally on MIMIC-CXR-JPG; its generalizability to data from other healthcare institutions therefore remains to be validated. The source code is available at: this https URL.
中文摘要
摘要:近年来,多标签胸部X光分类引起了广泛关注,其中视觉表示和临床语义知识的有效利用起到了重要作用。本研究提出了一个框架,将来自RAD-DINO的单模态表示与来自BioViL-T的视觉-语言表示相结合,用于MIMIC-CXR-JPG数据集中14个标签的分类。RAD-DINO和BioViL-T的嵌入及其组合表示在潜在空间中分别进行优化,然后在三个分支之间进行归一化和融合。除了提高分类性能外,本研究还旨在阐明每种嵌入源的作用及其互补程度。实验结果表明,单独使用时RAD-DINO优于BioViL-T,而早期融合进一步改善了结果,这表明两种嵌入源包含互补信息。表现最佳的模型实现了平均AUROC为0.840,mAP为0.467。消融分析显示,当每个嵌入源在潜在空间中得到优化时,混合融合相较于早期融合提供了持续且具有统计学显著性的改进,这表明融合效果取决于每个分支提供表示的质量。然而,本研究仅在MIMIC-CXR-JPG上进行了内部评估;其对其他医疗机构数据的泛化能力仍需验证。源代码可通过以下URL获取:this https URL。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09185 (HTTP 429)
Authors: Quang-Huy Tran, Duc-Tuan Ngo, Minh-Khoi Nguyen-Bui, Dang-Khoa Bui, Thanh-Trong Tran, Tuan-Khoi Nguyen, Hoang-Anh Ngo
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09185.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09185
Published: 2026-09-11T01:29:35.700Z
3. M2LG-DG: A Multi-modal Local-Global Domain Generalization Framework for Cross-site Major Depressive Disorder Classification
Abstract:Classification models based on resting-state functional magnetic resonance imaging (rs-fMRI) often show lower performance at imaging sites not included during model development, which can limit their use in clinical settings. Domain generalization (DG) addresses this issue by learning representations from source sites that remain effective for unseen target sites. However, existing DG approaches for psychiatric disorder classification commonly rely on a single imaging modality and may not fully account for site-specific acquisition effects on the learned representation space. Subjects scanned at the same site share scanner hardware, acquisition settings, and preprocessing characteristics, which can cause representations to reflect acquisition conditions rather than diagnostic information. In this work, we present M2LG-DG, a source-only multimodal local-global framework for cross-site major depressive disorder (MDD) classification. The framework employs a dual-stream rs-fMRI encoder, where the global pathway models inter-regional dependencies through self-attention and the local pathway performs graph-constrained aggregation over functional connectivity-derived brain graphs. Imaging and non-imaging representations are decomposed into shared and private components and integrated through bidirectional cross-attention with a learned modality gate. A cross-site supervised contrastive objective forms positive pairs from same-class subjects acquired at different source sites, encouraging the fused representation to preserve diagnostic information across acquisition domains. On four held-out REST-meta-MDD sites, M2LG-DG achieves an AUC of 69.48% and exceeds the closest comparison method by 2.18 percentage points. Experiments on the Autism Brain Imaging Data Exchange (ABIDE) dataset further support its applicability to other psychiatric neuroimaging classification tasks.
中文摘要
摘要:基于静息态功能磁共振成像(rs-fMRI)的分类模型在未包含在模型开发中的成像站点上性能通常较低,这可能限制其在临床环境中的应用。领域泛化(DG)通过从源站点学习可在未见目标站点上仍然有效的表示来解决这一问题。然而,现有用于精神障碍分类的DG方法通常依赖单一成像模态,可能无法充分考虑特定站点的采集对学习表示空间的影响。在同一站点扫描的受试者共享扫描仪硬件、采集设置和预处理特征,这可能导致表示反映采集条件而非诊断信息。在这项工作中,我们提出了M2LG-DG,一种用于跨站点重度抑郁障碍(MDD)分类的仅源多模态局部-全局框架。该框架采用双流rs-fMRI编码器,其中全局通路通过自注意力建模区域间依赖,局部通路则在功能连接导出的脑图上执行图约束聚合。成像和非成像表示被分解为共享和私有组件,并通过带有学习模态门的双向交叉注意力进行整合。跨站点监督对比目标从不同源站点采集的同类受试者形成正样本对,鼓励融合表示在不同采集域中保留诊断信息。在四个保留的REST-meta-MDD站点上,M2LG-DG实现了69.48%的AUC,超过最接近的比较方法2.18个百分点。在自闭症脑影像数据交换(ABIDE)数据集上的实验进一步支持了其在其他精神障碍神经影像分类任务中的适用性。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09186 (HTTP 429)
Authors: Muhammad Asif Hasan, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09186.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09186
Published: 2026-09-11T01:29:35.700Z
4. AgenticGen: Reward-Guided Agentic Video Generation for Advertising
Abstract:Advertising video generation is not only a video synthesis task, but also a product-conditioned reasoning problem whose success is measured by online business metrics. Recent video foundation models can generate realistic clips from multimodal conditions, yet they do not optimize how a product should be transformed into an effective advertisement or how future generation should be improved from online business feedback. To close this loop, we propose AgenticGen, a reward-guided agentic framework that decomposes advertising video generation into two trainable reasoning stages, strategy selection and draft generation, thereby exposing optimization targets that online business feedback can supervise. AgenticGen learns a performance-based reward from accumulated online feedback and a complementary rubric-based reward aligned with human quality standards, then uses them to supervise policy optimization. DPO first moves the agentic policies toward online preferences, and GRPO further refines both stages with process and outcome rewards. Offline experiments validate the reward models and successive policy optimization. Online A/B experiments in the TikTok advertising system show that AgenticGen after DPO and GRPO improves CTR by 2.72%, CVR by 2.63%, and Advv by 9.61% over the SFT baseline.
中文摘要
摘要:广告视频生成不仅是一个视频合成任务,也是一个以产品为条件的推理问题,其成功取决于在线业务指标。近期的视频基础模型可以根据多模态条件生成逼真的片段,但它们并未优化产品如何转化为高效广告,也未优化如何根据在线业务反馈改进未来生成。为闭环这一过程,我们提出了AgenticGen,一种奖励引导的智能框架,将广告视频生成分解为两个可训练的推理阶段:策略选择和草稿生成,从而暴露出在线业务反馈可以监督的优化目标。AgenticGen从累积的在线反馈中学习基于绩效的奖励,并结合符合人类质量标准的补充评分奖励,然后用它们来监督策略优化。DPO首先将智能策略向在线偏好调整,而GRPO则进一步使用过程和结果奖励优化两个阶段。离线实验验证了奖励模型和连续策略优化。TikTok广告系统中的在线A/B实验显示,经过DPO和GRPO优化后的AgenticGen相比SFT基线,CTR提升2.72%,CVR提升2.63%,Advv提升9.61%.
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文试图解决\*\*广告视频生成中的在线业务反馈闭环优化问题\*\*。具体而言,其针对的核心挑战可归纳如下: - \*\*广告视频生成的本质不仅是视频合成,更是产品条件化的推理问题\*\* 有效的广告视频需要结合产品素材、先验广告经验以及预期的在线投放效果进行决策,而现有视频基础模型(如 Seedance 2.0、Sora 等)仅侧重于从多模态提示生成逼真的视频片段,缺乏对“如何将产品素材转化为高转化广告”这一推理过程的显式建模。 - \*\*现有系统未能利用在线业务反馈来持续改进生成策略\*\* 广告投放后产生的点击、转化等真实业务指标构成了天然的反馈闭环,但现有模型并未将这些在线反馈整合到生成决策的优化中。论文指出,必须建立一套可学习的框架,将累积的在线业务反馈映射为对生成策略的明确监督信号。 - \*\*在线反馈信号 noisy 且存在系统偏差,难以直接用于强化学习\*\* 广告系统的冷启动效应、流量构成差异以及用户行为的随机性使得原始的点击率(CTR)等指标混杂了诸多混淆因素;若直接对这些绝对指标做回归,会导致奖励估计不稳定。因此,需要构建可靠的相对偏好信号(如基于匹配投放环境的成对比较)以及互补的人工质量标准(如基于 rubric 的奖励),以指导策略优化。 - \*\*需要显式分解可优化的推理阶段\*\* 为了将业务反馈有效注入生成过程,论文提出将广告视频生成分解为两个可训练推理阶段:\*\*策略选择(strategy selection)\*\*与\*\*草稿生成(draft generation)\*\*。通过这种分解,在线反馈能够对“选择何种创意策略”以及“如何生成可执行的视频草案”分别提供优化目标。 综上,论文提出的 \*\*AgenticGen\*\* 框架旨在通过奖励引导的智能体(agentic)方法,将广告视频生成分解为显式推理阶段,并基于在线业务反馈训练性能奖励模型与基于人工标准的评分奖励模型,进而通过 DPO 与 GRPO 对两阶段策略进行优化,最终在 TikTok 广告系统中实现 CTR、CVR 与广告主价值(Advv)的显著提升。 Q2: 有哪些相关研究? 根据论文第2节及相关内容,相关研究可归纳为以下两大方向: ## 1. 智能体视频生成(Agentic Video Generation) 视频基础模型(如 Seedance 2.0
35
、Sora
31
、Veo 3
11
、Wan
39
)已在多模态高保真视频合成方面取得显著进展,但这些模型本质上是**反应式生成器**,缺乏对创作目标的自主分解、参考素材与工具的选择能力,以及长周期生成过程中的自我修正能力。 为弥补这一差距,研究者提出了智能体生成范式: - **早期系统**利用大语言模型(LLM)进行规划,并通过专业智能体协调多场景视频创作与叙事,代表性工作包括 VideoDirectorGPT
26
、Mora
50
、StoryAgent
17
与 Camera Artist
16
等。 - **近期视频智能体**进一步引入了自优化机制与可复用技能,例如 Vista
29
、VQQA
38
、Co-Director
37
、TempAct
41
与 VideoWeaver
46
等。 - **图像智能体**则通过工具增强的多模态推理改进图像合成,如 Unify-Agent
7
、GenAgent
23
与 Genevolve
8
等。 **与现有研究的区别**:上述工作的优化目标主要集中于离线感知质量或叙事连贯性,而 AgenticGen 首次将优化目标锚定于**工业规模的在线业务反馈**,直接以投放后的点击、转化等商业指标指导视频生成策略的改进。 —- ## 2. 奖励引导生成(Reward-guided Generation) ### 2.1 反馈驱动的优化方法 现有研究发展了多种从反馈中优化策略的方法: - **离线(Off-policy)方法**:利用固定偏好数据优化策略,代表目标包括 DPO
33
、IPO
2
与 KTO
12
。 - **在线(On-policy)方法**:从当前策略采样并进行策略更新,代表性算法包括 PPO
34
、REINFORCE
1
、GRPO
36
与 Pref-GRPO
44
。 ### 2.2 奖励信号的构建方式 为了提供优化所需的监督信号,现有工作探索了多种奖励建模途径: - **成对比较模型**:基于 Bradley-Terry 模型
4
从偏好数据中学习相对奖励。 - **基于推理的评估器**:如 VideoScore
15
、VBench
19
等,通过细粒度推理模拟人类反馈。 - **基于评分标准(Rubric)的判断**:如 CDRRM
27
等,依据结构化评分标准评估生成内容质量。 ### 2.3 基于在线业务反馈的工业生成系统 部分工业系统开始利用在线商业指标(如点击率)作为监督信号: - **AdLlama**
22
:Meta 的工作,使用历史 CTR 作为性能反馈。 - **GenCO**
14
:将点击衍生的奖励分配给创意组合。 - **广告文本与图像生成**:近期研究亦利用 CTR 监督信号生成或优化广告文本与图像,如
9, 10, 30, 40, 47
等。 **与现有研究的区别**:上述工业系统主要针对文本或图像广告创意,而 AgenticGen 将在线业务反馈应用于**智能体视频生成**,并辅以与人工质量标准对齐的**评分奖励模型**,形成互补的奖励信号体系。 Q3: 论文如何解决这个问题? 论文通过提出 **AgenticGen** 框架,从问题分解、奖励建模、数据收集与策略优化四个层面系统性地解决了广告视频生成与在线业务反馈闭环的挑战。具体方案如下: —- ### 1. 将生成任务分解为两阶段可训练推理 不同于将广告视频生成视为单次视频合成,AgenticGen 将其重新定义为**产品条件化推理问题**,并显式分解为两个可独立优化的智能体阶段,使在线反馈能够针对性地监督中间决策: - **策略选择(Strategy Selection)** 给定产品上下文 P (名称、描述、卖点)与素材包 M (源视频、图像、历史表现及多模态特征),策略选择策略 F_(sel) 从预定义策略目录 G 中选取满足有效性约束 C 的策略组 S :
S = F(sel)(P, M; G, C)
策略涵盖素材编辑、参考引导生成与跨素材混剪三大族类。该阶段决定了如何将异构产品素材转化为平台原生广告的**高层创意路线**。 - **草稿生成(Draft Generation)** 在策略组 S 确定后,草稿生成策略 F(draft) 将其转化为包含工具调用与生成指令的结构化可执行草稿 D :
D = F(draft)(P, M, S)
草稿字段因策略而异,例如指定音乐、贴纸、卖点文案、CTA(行动号召)内容,或生成故事板脚本与镜头编排。 - **执行渲染(Execution)** 草稿 D 通过视频生成模型(如 Seedance 2.0)与内部渲染工具(如 CapCut)执行,产出最终广告视频 V = F(gen)(D) 。该层不参与推理,仅作为连接智能体推理与最终视频产物的接口。 —- ### 2. 构建互补的双奖励信号体系 在线业务反馈本身存在噪声大、偏差多、获取周期长的问题,无法直接作为强化学习的可靠奖励。论文因此构建了两个互补的奖励模型: - **性能奖励模型(Performance-Based Reward Model)** 为避免绝对 CTR 受流量构成与系统偏差混淆,模型采用 **Bradley-Terry 成对比较目标**,在印象平衡投放下比较同一产品上下文内的视频对,学习相对偏好:
LR = -E(D)R [ log σ ( rθ(P, V^+) - r_θ(P, V^-) ) ]
其中 V^+ 与 V^- 分别为同一投放组内表现最优与最差的视频。模型输入包含视频帧、音频/语音特征、密集字幕与结构化故事线,以及广告专用特征(Hook、卖点、CTA 等),从而捕捉叙事吸引力与商业显著性。 - **评分奖励模型(Rubric-Based Reward Model)** 仅依赖在线反馈可能导致视觉瑕疵或标题党(clickbait)等问题被忽视。该模型基于 TikTok 广告专家总结的质量标准训练,覆盖视频脚本、内容、装饰与音频四个维度,以及平台原生风格、吸睛强度、逻辑连贯性、产品一致性与美学和谐五个层面。通过成对提示让模型判断候选视频相对于参考视频的质量优劣,确保生成内容符合人工质量底线。 —- ### 3. 建立印象平衡投放管道以收集可靠反馈 直接将生成视频投入标准广告系统会引入冷启动、召回排序等混淆因素,导致不同视频的曝光机会不均。论文设计了**印象平衡投放管道(Impression-balanced Delivery Pipeline)**: - 为每个产品预留独立流量池,将 N=12 个生成视频直接绕过召回与排序阶段,以随机均等方式曝光给用户; - 仅当视频获得至少 1000 次展示后,才将其 CTR 视为可靠反馈; - 记录完整智能体轨迹(产品上下文、素材包、策略组、草稿、渲染视频、在线指标),用于后续的奖励建模与强化学习。 该设计确保了比较对象在匹配的产品上下文与均衡的曝光机会下获得业务反馈,从而将观察到的 CTR 差异更直接地归因于视频本身质量。 —- ### 4. 两阶段奖励引导策略优化 在数据与奖励模型就绪后,论文采用**先离线热身、后在线精调**的两阶段优化管道,并针对策略选择与草稿生成分别设计监督信号: #### 4.1 DPO 离线热身(Off-policy Warm-up) 利用印象平衡投放积累的成对偏好数据,对两个阶段的策略分别进行直接偏好优化(DPO)。具体地: - **策略选择 DPO**:固定草稿生成策略,让选择策略采样 N 个策略组,经投放后取表现最优/最差的策略组构成偏好对 (S^+, S^-) ; - **草稿生成 DPO**:固定策略组,让草稿策略采样 N 个草稿,经投放后取表现最优/最差的草稿构成偏好对 (D^+, D^-) 。 优化目标为标准 DPO 损失加 NLL 正则项,以防止格式崩溃:
L(DPO)^(reg) = L(DPO) + λ(nll) E(D)_(DPO) [ -log π_psi(Y^+ mid X) ]
两个阶段的策略被**交替优化**,使智能体初步对齐商业偏好。 #### 4.2 GRPO 在线精调(On-policy Refinement) 在 DPO 策略基础上,GRPO 进一步通过当前策略采样新轨迹并进行策略更新。针对两阶段的不同特性,论文分别设计了过程奖励与结果奖励: - **策略选择阶段:过程奖励** 由于策略选择发生在视频生成之前,无法直接获得最终视频奖励,因此设计了两项统计过程奖励与一项规则指示器:
R(sel) = λ(sel) R(glob) + (1-λ(sel)) R(loc), & I(sel) = 1 0, & I(sel) = 0
其中 R(glob) 为全局策略先验(跨产品聚合的各策略平均表现), R(loc) 为局部偏好(与当前产品内最优策略组的 Jaccard 重叠), I(sel) 为格式与约束校验指示器。该设计引导策略既学习普适有效的策略组合,又适应具体产品的局部最优。 - **草稿生成阶段:结果奖励** 草稿必须经执行后才能评分,因此使用模型-based 结果奖励:
R(draft) = λ(draft) R(perf) + (1-λ(draft)) R(rub), & I(draft) = 1 0, & I(draft) = 0
其中 R(perf) 来自性能奖励模型, R(rub) 为候选视频在同组内相比其他视频的评分胜率, I(draft) 校验草稿格式与可执行性。 - **GRPO 目标** 对每组 G 个采样输出,先计算组相对优势:
Ai = R_i - mean(R_1, dots, R_G){std(R_1, dots, R_G)}
再最大化裁剪后的策略梯度目标,并附加 KL 散度约束:
J(GRPO)(psi) = E(D)(GRPO) [ (1) / (G) ∑(i=1)^(G) min( r_i A_i, clip(r_i, 1-ε, 1+ε) A_i ) - β D(KL)(πpsi | π(ref)) ]
其中 ri = (π_psi(Y_i mid X)) / (π(psi{textold))(Y_i mid X)} 。 策略选择与草稿生成策略在 GRPO 阶段同样被**交替优化**。 —- ### 5. 系统验证 论文通过离线实验与在线 A/B 实验验证方案有效性: - **离线实验**:验证了成对奖励建模优于点式预测,多模态特征逐步提升奖励精度,DPO 显著提升偏好对齐准确率,以及 GRPO 融合双奖励可在商业表现与人工标准间取得最佳平衡。 - **在线实验**:在 TikTok 广告系统中,经过 DPO 与 GRPO 优化的 AgenticGen 相比 SFT 基线,CTR 提升 **2.72%**,CVR 提升 **2.63%**,广告主价值(Advv)提升 **9.61%**,证实了将在线业务反馈闭环引入智能体视频生成的有效性。 Q4: 论文做了哪些实验? 论文的实验验证分为**离线实验**与**在线 A/B 实验**两大部分,涵盖奖励模型、策略优化与端到端商业效果。以下是详细梳理: —- ### 1. 实验设置 #### 1.1 数据集构建 - **SFT 数据**:基于 50K 在线产品请求,使用 Qwen3-VL-235B-A22B-Thinking 作为教师模型生成策略选择轨迹;基于 100K 策略选择输出生成草稿轨迹。最终用于训练 Qwen3-VL-8B-Thinking 作为基座策略。 - **性能奖励数据**:通过印象平衡投放管道在一个月内收集 **100 万**视频对,按时间窗采样以减少投放周期偏差,其中 10K 对作为验证集。 - **评分奖励数据**:收集人工标注视频对,每对由 3 名标注员独立标注,仅保留三人一致同意的样本,共 **10K** 对,按 9:1 划分训练/验证集。另使用 Qwen3-Omni-30B-A3B-Thinking 进行拒绝采样以构建 SFT 数据。 - **RL 数据**:DPO 使用 50K 印象平衡策略选择偏好对与 50K 草稿生成偏好对;GRPO 使用相同的输入提示进行在线策略采样。 #### 1.2 实现细节 - **奖励模型**:性能奖励模型与评分奖励模型均基于 Qwen2.5-Omni-7B 实现,学习率分别为 5 × 10^(-6) 与 1 × 10^(-5) 。 - **RL 训练**:DPO 的 KL 系数 β = 0.1 ,学习率 5 × 10^(-6) ,NLL 损失权重 λ(nll) = 0.2 ;GRPO 学习率 1 × 10^(-6) ,采样组大小 G=8 ,裁剪参数 ε=0.2 ,KL 系数 β=0.001 。策略选择阶段 λ(sel)=0.5 ,草稿生成阶段 λ(draft)=0.6 。 —- ### 2. 离线评估 #### 2.1 性能奖励模型评估 - **成对建模 vs. 点式建模**(Table 1):在印象平衡验证集上,成对 Bradley-Terry 模型达到 **60.85%** 准确率,较点式预测(52.92%)提升 **7.93%**,验证了将噪声在线反馈转化为产品内相对偏好标签的有效性。 - **多模态特征消融**(Table 2):仅使用视频特征时准确率为 56.55%;依次加入音频特征(+1.88%)、故事线特征(+0.93%)与广告专用特征(+1.49%)后,最终达到 **60.85%**。其中音频特征增益最大,表明音乐节奏与视觉剪辑的同步性对在线表现具有显著影响。 #### 2.2 评分奖励模型评估 - **人工标准对齐与业务偏好迁移**(Table 3):在人工标注验证集(HL)上,经过 SFT 的评分模型准确率从 55.40% 提升至 **69.50%**;在印象平衡验证集(IB)上从 49.20% 提升至 **53.30%**。结果表明该模型与人工质量标准高度对齐,但与在线业务偏好仅有中等程度关联,支持将其作为性能奖励的互补信号。 #### 2.3 DPO 优化评估 - **偏好准确率**(Table 4):通过计算策略/参考模型的隐式奖励排序能力,DPO 将策略选择准确率从 49.72% 提升至 **56.48%**,草稿生成准确率从 50.64% 提升至 **58.34%**,平均准确率从 50.18% 提升至 **57.41%**,证实印象平衡偏好训练对两个推理阶段均有效。 #### 2.4 GRPO 草稿生成奖励消融 - **双奖励融合效果**(Table 5):以 SFT 策略生成视频为基准,通过奖励模型评估不同 GRPO 变体的胜率: - 仅使用性能奖励:性能胜率 61.04%,评分胜率 51.74%; - 仅使用评分奖励:评分胜率 60.24%,但性能胜率降至 50.78%; - **加权融合**:性能胜率 **60.52%**,评分胜率 **55.86%**,平均胜率 **58.19%**,为所有变体中最高,成功在商业表现与人工质量标准间取得平衡。 —- ### 3. 在线评估 #### 3.1 TikTok 广告系统 A/B 实验 通过印象平衡投放管道进行两阶段在线对比(Table 6): | 优化阶段 | CTR ↑ | CVR ↑ | Advv ↑ | |————-|———-|———-|————| | Pre-Agent → SFT | +3.48% | +2.30% | +9.83% | | SFT → RL (DPO+GRPO) | +2.72% | +2.63% | +9.61% | - **Pre-Agent → SFT**:将非智能体的人工配置流程替换为 AgenticGen SFT 智能体工作流后,CTR 提升 3.48%,CVR 提升 2.30%,广告主价值(Advv)提升 9.83%。这验证了智能体框架本身在系统集成与决策统一上的系统级收益。 - **SFT → RL**:在 AgenticGen 框架基础上,经过 DPO 与 GRPO 优化后,CTR 进一步提升 **2.72%**,CVR 提升 **2.63%**,Advv 提升 **9.61%**。该结果直接证明,基于在线业务反馈的奖励引导强化学习能够持续改进广告视频生成策略。论文同时指出,Advv 的提升幅度高于 CTR 与 CVR 的乘积效应,部分原因是高价值流量通常携带更优质素材,使 AgenticGen 拥有更可靠的视觉参考。 Q5: 有什么可以进一步探索的点? 基于论文的方法设计与实验验证,以下方向可作为有价值的进一步探索: —- ### 1. 多目标与长期价值导向的奖励建模 当前框架主要以 CTR 与 CVR 为优化目标,通过标量奖励引导策略。然而,广告生态中存在多重甚至相互冲突的目标: - **短期转化与长期品牌价值**的权衡:过度优化即时点击可能损害用户体验或品牌认知,需引入用户留存、复购率、品牌搜索量等长期指标; - **多目标 Pareto 前沿学习**:将单标量奖励扩展为向量奖励,通过多目标强化学习或约束策略优化(Constrained RL)学习 Pareto 最优策略,供平台或广告主根据 campaign 目标灵活选择; - **广告主生命周期价值(LTV)建模**:将奖励信号从单次转化拓展至用户全生命周期价值,探索序列决策中的长期信用分配。 —- ### 2. 因果推断驱动的归因与反事实评估 论文通过印象平衡投放与成对比较来缓解系统偏差,但在线反馈本质上仍受以下因素混淆: - **用户时序行为与广告疲劳**:同一用户多次看到不同广告视频后,其点击行为存在复杂的时序依赖,简单的成对比较难以完全消除; - **反事实视频生成**:利用因果推断框架(如反事实回归或工具变量法)估计“若投放视频 A 而非视频 B”的**因果效应**(ITE),而非仅关联性比较; - **无偏离线评估器**:构建基于历史投放数据的反事实模拟器(counterfactual simulator),在不上线真实流量的情况下预估新视频表现,降低在线探索成本。 —- ### 3. 更高效在线探索与小样本策略适应 当前印象平衡投放要求每视频至少 1000 次展示,且需累积足够时间才能稳定估计 CTR,导致**反馈获取成本高、策略迭代周期长**: - **离线策略评估与迁移**:利用已有海量历史投放数据训练离线世界模型(world model),在虚拟环境中预筛选策略,仅将最有潜力的视频送入真实投放; - **元学习(Meta-learning)快速适应**:对于新产品或冷启动广告主,利用跨产品学到的先验策略,通过少量在线样本快速适配,减少 N=12 的固定分组规模; - **主动学习式探索**:根据当前策略不确定性动态调整探索样本量,将更多流量分配给信息增益高的策略组,而非均匀随机。 —- ### 4. 用户个性化与上下文感知的视频生成 当前 AgenticGen 主要基于**产品上下文**进行条件化生成,但同一产品面对不同用户群体(如新客 vs. 老客、不同兴趣圈层)时,最优广告视频可能存在差异: - **用户侧特征注入**:将用户画像、实时上下文(时段、设备、场景)纳入策略选择与草稿生成的输入,实现“千人千面”的创意生成; - **分层策略优化**:在策略选择阶段引入用户分群机制,为不同流量桶自动选择差异化的策略组; - **隐私保护下的联邦优化**:在不暴露用户原始行为数据的前提下,通过联邦学习或差分隐私机制优化个性化奖励模型。 —- ### 5. 更深层次的 Agentic 推理与自我进化 当前框架为两阶段流水线(策略选择 → 草稿生成),智能体的推理深度与自主性仍有拓展空间: - **多轮自我修正与 A/B 测试设计**:让智能体不仅生成视频,还能自主设计小规模对照实验、分析结果并迭代策略,形成“生成-投放-分析-再生成”的完整闭环; - **动态工具学习**:当前策略目录 G 为预定义集合,未来可探索让智能体自主发现或组合新的编辑/生成工具,甚至提出对现有工具的功能改进需求; - **跨模态一致性推理**:加强对“视觉-音频-文本”叙事一致性的显式推理,例如确保 BGM 情绪与产品卖点、视觉节奏精确对齐,而非仅依赖奖励模型的隐式反馈。 —- ### 6. 安全性、公平性与可解释性 随着生成策略直接参与商业投放,其社会影响与平台责任不容忽视: - **细粒度内容安全护栏**:在评分标准(Rubric)中引入更严格的事实一致性、虚假宣传检测与版权合规检查,避免优化过程为了 CTR 生成误导性内容; - **创意公平性**:确保小型广告主或低预算产品不会因为初始素材质量较差而被策略选择系统系统性忽视,探索对素材贫瘠广告主的生成补偿机制; - **可解释创意洞察(XAI for Creative)**:从优化后的策略分布中提取可解释规则(例如“美妆品类在晚间流量中搭配快节奏 BGM 的胜率更高”),以人类可读形式反哺广告运营团队,实现人机协同创意。 Q6: 总结一下论文的主要内容 这篇论文提出 **AgenticGen**,一种面向广告视频生成的奖励引导智能体框架,旨在将在线商业反馈(如点击率、转化率)有效整合到视频生成决策中。以下为主要内容的系统总结: —- ### 1. 核心问题 广告视频生成的成功标准不仅是视觉真实感,更是其在真实投放环境中的商业表现(CTR、CVR、广告主价值)。现有视频基础模型(如 Seedance、Sora)擅长从多模态条件合成视频,但缺乏以下能力: - 将**产品素材**与**平台原生创意经验**转化为可执行的生成策略的显式推理; - 利用**在线业务反馈**持续优化生成决策的闭环机制。 该任务本质上是一个**产品条件化的推理问题**,而非单纯的视频合成问题。 —- ### 2. AgenticGen 框架 论文将广告视频生成分解为两个可训练的智能体推理阶段,由强推理视觉-语言模型(VLM)驱动: - **策略选择(Strategy Selection)** 输入产品上下文 P 与素材包 M ,从预定义策略目录 G 中选取满足有效性约束 C 的策略组 S :
S = F(sel)(P, M; G, C)
策略涵盖素材编辑、参考引导生成与跨素材混剪三大类。 - **草稿生成(Draft Generation)** 将策略组 S 转化为包含工具调用、生成指令与渲染参数的结构化可执行草稿 D :
D = F(draft)(P, M, S)
随后通过视频生成模型(如 Seedance 2.0)与渲染工具(如 CapCut)执行,得到最终视频 V = F_(gen)(D) 。 这种分解使得在线反馈能够对“选择何种创意路线”与“如何生成具体草案”分别施加监督。 —- ### 3. 互补的奖励建模 为应对在线反馈噪声大、存在系统偏差的问题,论文构建了两种互补的奖励信号: - **性能奖励模型(Performance-Based Reward)** 基于**印象平衡投放**收集的数据,采用 **Bradley-Terry 成对比较目标**学习相对偏好,避免绝对 CTR 受流量构成与系统偏差混淆:
LR = -E(D)R [ log σ( rθ(P, V^+) - rθ(P, V^-) ) ]
模型输入融合视频帧、音频/语音、密集字幕、结构化故事线与广告专用特征(Hook、卖点、CTA)。 - **评分奖励模型(Rubric-Based Reward)** 基于 TikTok 广告专家总结的人工质量标准训练,覆盖视频脚本、内容、装饰与音频四个维度,以及平台原生风格、吸睛强度、逻辑连贯性、产品一致性与美学和谐五个层面,用于捕捉在线反馈难以识别的视觉瑕疵与标题党问题。 —- ### 4. 两阶段奖励引导优化 #### 4.1 印象平衡投放管道(Impression-balanced Delivery) 为获取可靠的在线反馈,论文设计了专用投放管道:为每个产品预留流量池,将 N=12 个生成视频绕过召回与排序,以随机均等方式曝光,确保各视频在相同产品上下文与均衡曝光下竞争。仅当视频获得至少 1000 次展示后,才将其 CTR 作为可靠反馈用于训练。 #### 4.2 DPO 离线热身 利用印象平衡投放积累的成对偏好数据,对策略选择与草稿生成策略分别进行直接偏好优化(DPO),使策略初步对齐商业偏好。训练时加入 NLL 正则项以维持输出格式稳定。 #### 4.3 GRPO 在线精调 在 DPO 基础上,通过 GRPO 进行在线策略优化,针对两阶段设计不同的奖励信号: - **策略选择阶段:过程奖励** 结合全局策略先验 R(glob) (跨产品聚合的平均策略表现)、局部偏好 R(loc) (与当前产品最优策略组的 Jaccard 重叠)以及格式/约束校验指示器 I(sel) :
R(sel) = λ(sel) R(glob) + (1-λ(sel)) R(loc), & I(sel) = 1 0, & I_(sel) = 0
- **草稿生成阶段:结果奖励** 结合性能奖励模型评分 R(perf) 、评分奖励模型胜率 R(rub) 与格式校验指示器 I(draft) :
R(draft) = λ(draft) R(perf) + (1-λ(draft)) R(rub), & I(draft) = 1 0, & I(draft) = 0
GRPO 通过组相对优势与裁剪后的策略梯度目标进行更新,两个阶段交替优化。 —- ### 5. 实验结果 论文通过离线实验与 TikTok 在线 A/B 实验进行验证: - **离线实验**: - 成对性能奖励模型准确率(60.85%)显著优于点式预测(+7.93%); - 多模态特征逐步提升奖励精度,音频特征贡献最大; - DPO 将策略选择与草稿生成的偏好准确率分别从约 50% 提升至 **56.48%** 与 **58.34%**; - GRPO 消融表明,融合性能与评分奖励可在商业表现与人工标准间取得最佳平衡(平均胜率 58.19%)。 - **在线 A/B 实验**(TikTok 广告系统): - AgenticGen SFT 相比前智能体系统(Pre-Agent)已带来显著提升; - 经 DPO 与 GRPO 优化后,相比 SFT 基线: - **CTR 提升 2.72%** - **CVR 提升 2.63%** - **广告主价值(Advv)提升 9.61%** —- ### 6. 主要贡献 - 首次将广告视频生成为**奖励引导的智能体框架**,显式分解为策略选择与草稿生成两个阶段,使在线业务反馈可直接监督中间推理决策; - 构建**性能奖励**与**评分奖励**互补的奖励体系,兼顾商业表现与人工质量标准; - 提出基于 DPO 离线热身与 GRPO 在线精调的**两阶段优化管道**,分别利用过程奖励与结果奖励优化智能体策略; - 在工业级 TikTok 广告系统中完成在线验证,证实该框架可显著提升广告视频的商业效果。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Xingyuan Bu, Chengru Song, Hao Zhou, Tao Zhou, Dong Li, Wei Li, Shilong Li, Hao Shi, Yongxin Guo, Donghao Zhou, Qiangpeng Yang, Shilei Wen
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09187.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09187
Published: 2026-09-11T01:29:35.700Z
5. Lensless Gaze Is Not Private by Default: Auditing Identity Leakage Across Disclosure Surfaces
Abstract:Lensless near-eye sensing is often described as privacy-friendly because its coded measurements are visually unintelligible. Yet visual unintelligibility reflects human interpretation, not what a learned adversary can recover. We therefore treat identity privacy as a systems property of disclosure surfaces: representations crossing sensing, storage, computation, and output boundaries. We audit a simulated lensless gaze pipeline under a 36-subject known-gallery closed-set identification protocol with a fixed, known PSF; privacy from an unknown or varying optical key is outside our scope. Reported accuracies are empirical attack success rates under matched linear and MLP probes and do not upper-bound stronger adversaries. Simulated lensless measurements yield 96.7% top-1 identification versus 97.7% for matched original eye crops, while an MAE embedding retains 94.3%. Compression alone offers little protection: 8-D PCA and a matched 8-D bottleneck retain 93.2% and 91.8%, whereas separately trained 8-D GSPL bottlenecks yield 77.5% mean recovery across three seeds. A released 128-way gaze token lowers single-frame recovery to 38.1%, while its residual and continuous gaze output expose 62.1% and 72.6%, respectively. Under a source-frame-disjoint tiled protocol, token summaries reach 39.9% at T=25, showing that repeated-output risk depends on representation and aggregation. These rates reflect all subject-correlated information in the evaluated dataset, including acquisition and behavioral cues, rather than isolating intrinsic ocular biometrics. Ordinary least squares residualization against a six-dimensional crop geometry and intensity summary still leaves lensless recovery at 95.1%. Our results show that privacy claims for lensless sensing must be tested at disclosure boundaries rather than inferred from appearance.
中文摘要
摘要:无镜头近眼传感通常被描述为隐私友好,因为其编码测量在视觉上不可理解。然而,视觉上的不可理解性反映的是人类的解读能力,而不是受过训练的攻击者能够恢复的内容。因此,我们将身份隐私视为披露界面的系统属性:跨越传感、存储、计算和输出边界的表示。我们在一项36名受试者的已知图谱闭集识别协议下,使用固定已知的点扩散函数(PSF)对模拟的无镜头注视管线进行了审计;来自未知或可变光学密钥的隐私保护不在我们的研究范围内。报告的准确率为在匹配的线性和多层感知机(MLP)探针下的经验攻击成功率,并不对更强的攻击者构成上界。模拟的无镜头测量在Top-1识别率上达到96.7%,而匹配的原始眼部裁剪为97.7%,使用MAE嵌入则仍保留94.3%。单独压缩几乎无法提供保护:8维PCA和匹配的8维瓶颈分别保留了93.2%和91.8%,而单独训练的8维GSPL瓶颈在三个随机种子下的平均恢复率为77.5%。发布的128路注视令牌将单帧恢复率降低至38.1%,而其残差和连续注视输出分别泄露62.1%和72.6%。在源帧不重叠的平铺协议下,令牌摘要在T=25时达到39.9%,显示重复输出的风险取决于表示和聚合方式。这些比率反映了评估数据集中所有与受试者相关的信息,包括采集和行为提示,而非仅限于内在眼部生物特征。针对六维裁剪几何和强度摘要进行普通最小二乘残差化后,无镜头恢复率仍为95.1%。我们的结果表明,无镜头传感的隐私声明必须在披露边界进行测试,而不可仅根据外观推断。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09188 (HTTP 429)
Authors: Rahul Vimalkanth, Kaushik Mitra
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09188.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09188
Published: 2026-09-11T01:29:35.700Z
6. MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads
Abstract:Multimodal Large Language Models (MLLMs) often struggle with hallucinations, thus hindering their reliable practical applications. Existing attention-based mitigation methods mainly rely on indirect signals (e.g., attention weights) that fail to accurately reflect the actual information shift underlying hallucination generation. In this paper, we propose HEAL, Head-lEvel information disentAnglement and caLibration for identifying and mitigating hallucinations. HEAL first employs causal noise intervention on multi-head outputs to filter out causally redundant heads. Subsequently, it disentangles information distribution within the remaining heads via the counterfactual Difference-in-Differences, categorizing heads into four types. Through analysis, we observe: hallucinations happen when information distribution drifts away from a healthy equilibrium in synergy heads, not strongly correlated with the quantity or strength of modality-specific heads. Motivated by this insight, HEAL injects dynamic information calibration factors into the value vectors of synergy heads, and actively regulates visual-language dependencies, steering the output distribution towards factual evidence. Extensive experiments demonstrate that HEAL effectively reduces hallucinations across multiple MLLMs, offering a simple and interpretable pathway to enhance model trustworthiness.
中文摘要
摘要:多模态大语言模型(MLLMs)常常面临幻觉问题,这限制了它们在实际应用中的可靠性。现有基于注意力的缓解方法主要依赖间接信号(例如注意力权重),这些信号无法准确反映幻觉生成背后的实际信息转移。在本文中,我们提出了HEAL,一种用于识别和缓解幻觉的头部级信息解缠与校准方法。HEAL首先对多头输出进行因果噪声干预,以过滤因果冗余的头。随后,它通过反事实差分方法解缠剩余头中的信息分布,将头分为四类。通过分析,我们观察到:幻觉发生在协同头的信息分布偏离健康平衡时,与模态特定头的数量或强度相关性不大。基于这一认知,HEAL将动态信息校准因子注入协同头的值向量,并主动调控视觉-语言依赖关系,将输出分布引导向事实证据。大量实验表明,HEAL能够有效降低多种MLLMs的幻觉,为提升模型可信性提供了一条简单且可解释的途径。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文致力于解决\*\*多模态大语言模型(MLLMs)中的幻觉(hallucination)问题\*\*,即模型生成看似合理但与视觉上下文事实不一致的响应。具体而言,论文从以下三个层面展开对该问题的界定与攻克: ### 1. 核心问题:幻觉生成的内部机制缺乏可解释性 现有幻觉缓解方法多从宏观(如重新训练、强化学习)或微观(如解码优化、注意力增强)入手,但存在明显局限: - \*\*依赖间接信号\*\*:多数基于注意力的方法仅利用注意力权重或前馈网络激活等间接代理,无法准确捕捉注意力头内部实际的信息分布与因果协同效应。 - \*\*"跷跷板"困境\*\*:单模态注意力增强(如单纯强化视觉注意力)往往导致视觉-语言信息失衡,造成响应截断、创造性下降或视觉幻觉加剧。 ### 2. 关键发现:协同头(Synergy Heads)内的信息分布漂移是幻觉根源 论文提出了一种头级信息解耦框架(HEAL),并揭示: - 幻觉的发生与\*\*模态专属头\*\*(纯视觉或纯语言头)的数量或强度无显著关联; - 幻觉的关键诱因在于\*\*协同头内部视觉-语言信息分布偏离健康均衡\*\*(healthy equilibrium),即信息分布向语言先验漂移。 ### 3. 目标:动态校准内部信息分布以实现可信生成 基于上述因果洞察,论文旨在: - \*\*识别并分类\*\*注意力头为冗余头、视觉头、语言头和协同头四类; - \*\*动态注入信息校准因子\*\*至协同头的值向量(value vectors),在推理阶段主动调节视觉-语言依赖关系; - \*\*将输出分布重新导向事实证据\*\*,从而在不过度牺牲语言连贯性的前提下,提升MLLMs的事实性与可信度。 简言之,该论文不仅试图缓解MLLMs的幻觉现象,更致力于提供一条\*\*简单且可解释的头级干预路径\*\*,直接修正注意力头内部的信息结构失衡,而非仅对输出结果进行后处理。 Q2: 有哪些相关研究? 该论文在第2节及实验部分系统梳理了相关研究,可归纳为\*\*多模态大模型基础\*\*、\*\*幻觉缓解的宏观策略\*\*、\*\*基于注意力的微观干预\*\*三个层面: ### 1. 多模态大语言模型(MLLMs)基础 - \*\*模态对齐与架构演进\*\*:早期工作如 \*\*BLIP-2\*\*
20
通过轻量级查询变换器桥接冻结图像编码器与大型语言模型;**LLaVA**
21
系列(含 LLaVA-1.5
2
、LLaVA-NeXT
3
)验证了视觉指令微调的有效性;**MiniGPT-4**
22
、**mPLUG-Owl2**
23
、**Qwen3-VL**
1
、**InternVL-2.5**
24
等进一步扩展了多模态理解、视觉 grounding 与文档解析能力。 - **幻觉现象界定**:现有研究将 MLLM 幻觉细分为对象幻觉
25
、属性幻觉、关系幻觉与语义幻觉
5, 6, 25–28
,并指出其在医疗成像等高精度领域带来的可靠性风险
29
。 ### 2. 幻觉缓解的宏观与数据策略 论文从四个视角归纳了现有工作: - **数据为中心**:通过构造负样本、反事实样本或更干净的监督数据来减少伪相关
30, 31
。 - **训练与模型层面**:改进对齐目标、引入辅助监督、偏好学习(RLHF/DPO)及设计更强的多模态架构
7–9, 12, 32
。 - **推理时解码优化**:在输出层面进行干预,包括视觉对比解码(**VCD**
13
、**ConVis**
14
、**IBD**
15
)与过度信任惩罚(**OPERA**
33
)。 - **检测与事后修正**:定位幻觉内容并修正不可靠输出
31
。 ### 3. 基于注意力的幻觉缓解(与本文最直接相关) 这类方法的核心直觉是 MLLM 在生成后期逐渐减少对图像提示的依赖,导致语言先验主导。代表性工作包括: - **全局-局部注意力增强**:**AGLA**
34
结合全局与局部注意力以强调查询相关区域。 - **注意力头直接干预**:**PAI**
35
、**EAH**
36
、**VHR**
16
对特定注意力头进行增强,使解码更以图像为中心,缓解视觉注意力汇聚(attention sinks)
37, 38
。 - **双路径对比解码**:**Owl**
17
提出双路径策略,一条路径强化视觉基础注意力,另一条放大幻觉注意力以形成对比。 - **结构因果建模**:**CausalMM**
39
将模态先验视为注意力与输出之间的混杂因素(confounder),通过因果图干预缓解幻觉。 - **因果掩码优化**:**FarSight**
40
仅通过优化因果掩码来减少异常值 token 的注意力干扰。 ### 4. 实验对比涉及的其他基线 论文在实验中还与以下推理时或训练无关的方法进行了比较: **DoLa**
53
、**DOPRA**
54
、**HALC**
55
、**SID**
56
、**VISTA**
57
、**TAME**
58
、**VAR**
37
、**CausalLLM**
39
、**MemVR**
59
、**ONLY**
60
、**LocoRE**
61
。 ### 现有研究的局限与本文定位 论文指出,上述注意力相关方法主要依赖**注意力权重**或 **FFN 激活**等间接代理信号,无法准确反映注意力头内部实际的信息分布与因果协同效应;同时,单模态注意力增强(如仅强化视觉)易引发“跷跷板”困境(see-saw dilemma)
17
——增强视觉可能导致响应截断或语言流畅性下降,而过度依赖语言又会加剧视觉幻觉。本文提出的 **HEAL** 则通过头级信息解耦(causal noise intervention 与 counterfactual Difference-in-Differences)与动态校准,直接干预协同头(synergy heads)内部的视觉-语言信息比例,从而规避了上述局限。 Q3: 论文如何解决这个问题? 该论文提出 **HEAL(Head-lEvel information disentAnglement and caLibration)**,一种在推理阶段(inference-time)对注意力头内部信息分布进行解耦与动态校准的方法。其解决路径可分为四个递进阶段: —- ### 1. 过滤因果冗余头:基于噪声干预的因果贡献估计 首先,为了排除对最终输出无实质影响的注意力头,HEAL 通过**分布匹配的因果噪声干预**直接替换每个头的输出,并测量层表示的变化。 对于第 l 层第 i 个头在生成步 t 的输出 o^((t,l,i)) ,将其替换为高斯噪声 o^((t,l,i)) sim N(μ(t,l,i), Sigma(t,l,i)) :
y^((t,l))((-i)) = x^((t,l)) + W_O^((l)) [ o^((t,l,1)); ·s; o^((t,l,i)); ·s; o^((t,l,H)) ]
定义余弦相似度度量:
Sim(a, b) = (1) / (2)(1 + (a^top b) / (|a|_2 |b|_2))
头的信息贡献为:
I^((t,l,i)) = 1 - Sim(y^((t,l)), y^((t,l))((-i)))
若 I^((t,l,i)) < μ(I^((t,l,:))) - 3σ(I^((t,l,:))) ,则该头被归类为**因果冗余头**(causally redundant),在后续分析中剔除。 —- ### 2. 头级信息解耦:反事实双重差分(Counterfactual DiD) 对于剩余的头,HEAL 借鉴**部分信息分解(Partial Information Decomposition, PID)**理论,通过构造四种反事实输入来解耦其内部信息成分:
H(11) = H(t,l,i)(V, T), quad H(01) = H(t,l,i)(V, T), quad H(10) = H(t,l,i)(V, T), quad H(00) = H(t,l,i)(V, T)
其中 V 和 T 分别表示用高斯噪声掩码后的视觉与语言 token。基于表示差异 D(a,b) = 1 - Sim(a,b) ,计算: - **总信息**:
I(total) = 1 - Sim(H(11), H_(00))
- **语言信息**(含语言先验):
I(lang) = Sim(H(11), H(01)) - Sim(H(11), H_(00)) - **视觉信息**(含视觉先验):
I(vis) = Sim(H(11), H(10)) - Sim(H(11), H_(00)) - **协同信息**(交互效应扣除先验重叠):
I(syn) = I(total) - I(vis) - I(lang) = 1 + Sim(H(11), H(00)) - Sim(H(11), H(01)) - Sim(H(11), H(10))
—- ### 3. 头类型分类:识别协同头(Synergy Heads) 基于上述信息分数,HEAL 将注意力头划分为四类: - **信息冗余头**: I(total) < μ(total) - 3σ(total) ,内部几乎无模态信息。 - **视觉头**: I(vis) > 0 且 I(lang) ≤ 0 。 - **语言头**: I(vis) ≤ 0 且 I(lang) > 0 。 - **协同头**: I(vis) > 0 且 I(lang) > 0 ,且其模态比 α(vis) = I(vis)I(vis)+I_(lang) 不偏向极端阈值(通过 Logit 变换与稳健 MAD 阈值判定)。 关键发现:**幻觉并非由视觉头或语言头的数量/强度不足导致,而是协同头内部视觉-语言信息分布偏离均衡所致**。 —- ### 4. 动态信息校准:均衡因子引导的纠偏 HEAL 的核心干预在于对协同头的值向量(value vectors)进行动态重加权。引入**均衡因子** α ∈ (0,1) 表征生成正确 token 时期望的视觉-语言信息均衡比例。 为使校准后的信息比例满足:
β I(vis)β I(vis) + γ I(lang) = α
取校准因子:
β = (α) / (α(textvis)), quad γ = (1-α) / (α(textlang))
在推理时,对协同头的视觉与语言值向量施加动态缩放(在 KV-cache 更新后、注意力核函数前执行,不影响 FlashAttention 等内部实现):
o^((t,l,i)) = Softmax(q^((t,l,i)) (K^((t,l,i)))^top{√d}) [ β V^((t,l,i))(vis), γ V^((t,l,i))(lang) ]
这一操作等价于将协同头的内部信息分布重新导向目标均衡,从而抑制语言先验过度主导导致的幻觉。 —- ### 5. 理论保证与因果验证 论文进一步提供了两项理论支撑: - **定理 1(值空间与信息分布校准的等价性)**:在满足局部可加性与正齐次性的信息度量下,对 value 向量的 β, γ 缩放等价于将模态信息比例校准至目标 α 。 - **定理 2(均衡因子的单调方向性效应)**:设 z(α) 为 RMSNorm 后的多头注意力输出,则 z(α) 与视觉信息的内积对齐度随 α 单调递增,证明校准具有可预测的几何效应。 此外,论文通过**双向因果干预**验证了解决方案的有效性: - 对原本正确的响应**降低**视觉信息比例,可**诱导**幻觉; - 对原本幻觉的响应**提升**视觉信息比例,可**缓解**幻觉。 这证明协同头内的信息失衡与幻觉之间存在因果性,而非单纯相关。 —- ### 6. 工程实现优化 为保证推理效率,HEAL 采用三项工程策略: - **周期更新**:利用头分布的时间局部性,每 S 步(如 10 步)全局更新一次头类型,而非逐 token 重计算。 - **并行因果干预**:通过张量并行一次性计算所有头的反事实输出差异。 - **批处理 DiD**:将四种反事实状态批量化,统一执行注意力运算,显著降低每次更新的计算开销。 综上,HEAL 通过“**先解耦、再识别、后校准**”的三阶段路径,在不重新训练模型、不破坏语言流畅性的前提下,直接在注意力头内部修正视觉-语言信息漂移,从而有效缓解多模态大模型的幻觉问题。 Q4: 论文做了哪些实验? 该论文在第4节及附录C中开展了系统的实验验证,涵盖**模型泛化性测试**、**幻觉基准评估**、**综合能力评估**、**消融分析**、**双向因果干预**、**鲁棒性检验**以及**推理效率分析**等多个维度。具体实验内容如下: ### 1. 实验设置 - **基线模型**:在多个代表性MLLM家族上验证,包括LLaVA系列(LLaVA-1.5-7B、LLaVA-NeXT-7B)、Qwen系列(Qwen2-VL-7B、Qwen2.5-VL-7B、Qwen3-VL-8B)以及InternVL系列(InternVL-7B、InternVL3.5-8B)。 - **评估基准**: - **幻觉专用基准**:POPE(对象存在性判断)、CHAIR(细粒度图像描述幻觉率)、MMHal-Bench(复杂动作与空间关系幻觉)。 - **综合能力基准**:LLaVA-Bench(视觉指令跟随)、MME(多模态全面评估)、BLINK-Twice(视觉感知与推理)。 - **对比方法**:与两类现有方法对比,包括解码优化类(OPERA、VCD、DoLa、DOPRA、HALC等)和注意力头干预类(EAH、AGLA、TAME、VAR、VHR、FarSight、CausalLLM等)。 ### 2. 幻觉缓解性能评估 论文在表1中报告了LLaVA-1.5-7B上各类方法的对比结果: - **POPE**:HEAL取得最高的F1分数(87.7)和准确率(88.3)。 - **CHAIR**:HEAL显著降低对象幻觉率(CHAIRS降至36.7)和实例幻觉率(CHAIRI降至10.7),同时保持较高的召回率和生成长度。 - **MME**:在存在性(Exist.)、计数(Count)、位置(Pos.)、颜色(Color)及总分上均达到最优或接近最优。 在表2中,论文展示了HEAL作为即插即用模块在LLaVA-NeXT-7B、Qwen2.5-VL-7B、Qwen2-VL-7B和InternVL-7B上的效果,一致地降低了CHAIR指标并提升了POPE各项指标。 ### 3. 综合与前沿基准评估 - **MME与LLaVA-Bench**(表1、表2):HEAL在提升幻觉指标的同时,未损害模型的基础多模态理解与推理能力,LLaVA-Bench得分均有提升。 - **最新模型与困难基准**(表16):在Qwen3-VL-8B和InternVL3.5-8B上,HEAL在MMHal-Bench中将幻觉率分别降低0.9和1.1个百分点,并提升综合得分;在BLINK-Twice的各子项(No-Acc、Yes-Acc、Q-Acc、I-Acc、G-Acc)上均取得一致增益。 ### 4. 消融实验 - **更新间隔的影响**(图4a):将头类型更新间隔从2步变化至20步,发现10–15步可在几乎不损失性能(POPE F1)的前提下显著降低计算开销。 - **均衡因子α的影响**(图4b、表3、图5): - 在CHAIR上,幻觉指标随α呈现U型趋势,α过大或过小均会导致性能下降。 - 在LLaVA-Bench上,LLaVA-1.5的最优α约为0.6,Qwen2.5-VL约为0.5,表明不同视觉能力的模型需要不同程度的视觉校准。 - 定性案例(图5b)显示,α过小无法抑制幻觉,α过大则会导致语法退化或重复生成。 ### 5. 双向因果干预验证 为证明信息分布失衡与幻觉之间的因果关系而非仅相关关系,论文设计了双向干预实验(图6、表7): - **正向干预**:对原本生成幻觉的样本提升视觉信息比例(增大α),可使其恢复为正确描述。 - **反向干预**:对原本生成正确描述的样本人为降低视觉信息比例(减小α),可诱导出幻觉。 这一结果在LLaVA-1.5-7B和Qwen2.5-VL-7B上均得到验证。 ### 6. 鲁棒性分析 论文系统检验了HEAL在不同设计选择下的稳定性: - **掩码策略**(表4、表5):将高斯噪声替换为零点掩码、均匀掩码或跨样本token交换后,头类型分配一致率仍达92.13%–95.36%,且协同头内的视觉-语言漂移现象保持稳定,POPE性能波动很小。 - **阈值选择**(表6a、6b):改变冗余头判定阈值(σ_total系数1–∞)和模态比阈值(MAD系数λ)后,幻觉token与正确token在协同头内的信息比例差异始终显著,POPE F1稳定在86.95–87.84之间。 - **相似度度量**(附录表8):将余弦相似度替换为L2范数或混合度量,头分类一致率高于95%,表明分类不依赖于特定度量。 - **替换分布**(附录表9):将因果干预中的高斯噪声替换为均匀分布、柯西分布(重尾极端异常值)或实际其他样本的激活值,冗余头识别与最终POPE性能均保持稳定,证明干预本身的因果性质优于特定分布假设。 ### 7. 推理效率与计算开销 附录表12对比了HEAL与其他推理时方法的实际开销(基于2×NVIDIA RTX 4090): - **吞吐量**:HEAL达到5.02 tokens/s,是EAH的1.58倍。 - **延迟**:端到端wall-clock延迟为70.74秒,低于EAH(100.92秒)和OPERA(26.54秒但性能较弱)。 - **显存**:相比基线模型仅增加约0.26 GB峰值GPU显存。 论文还说明了周期更新与并行张量运算如何缓解额外计算负担。 ### 8. 头分布动态可视化 - **图2a、2b**:展示自回归生成过程中头类型的动态演化,揭示视觉头数量几乎恒定,而语言头与协同头之间存在任务驱动的相位转移。 - **图2c**:在三维空间中可视化视觉、语言、协同信息轴下的头分布。 - **图7(附录C.3)**:验证在10步更新窗口内,头的宏观类型分布变化极小,为周期更新策略提供经验依据。 ### 9. 定性案例 图5a提供了一个具体的幻觉消除案例:LLaVA-NeXT-7B在描述网球运动员时遗漏了球拍细节并产生不连贯描述,经HEAL校准后输出与图像事实一致且细节丰富的内容。 综上,实验从**定量指标**、**因果机制**、**鲁棒边界**、**计算效率**和**可视化证据**五个层面全面验证了HEAL的有效性与可解释性。 Q5: 有什么可以进一步探索的点? 基于论文结论与附录中的讨论,可从以下几个方向开展进一步探索: ### 1. 自适应超参数确定机制 当前均衡因子 α 与更新间隔 S 依赖经验设定,虽在 0.4 – 0.6 和 5 – 15 步范围内具有较好的迁移性,但仍需针对不同模型与任务进行微调。未来可探索: - **在线自适应 α **:根据生成过程中协同头内 α(vis) 的实时偏离程度动态调整校准强度,无需手动指定单一 α 。 - **任务感知间隔调度**:依据当前解码内容(如视觉描述 vs. 语言推理)自动触发头类型重估计,替代固定周期更新。 ### 2. 异质协同头的细粒度校准 论文在附录 D 中指出,不同协同头的注意力模式与模态偏好存在显著异质性,而 HEAL 目前对所有协同头施加**单一全局**均衡因子。更精细的方向包括: - **头级个性化校准**:为每个协同头 i 分配独立的 αi ,或按层深度分组设定(如浅层融合层与深层语义层采用不同均衡策略)。 - **分层干预**:当前在所有注意力层执行反事实分析,未来可识别对幻觉最关键的少数层进行重点校准,以降低计算开销并提升干预精准度。 ### 3. 视觉编码器层面的联合优化 HEAL 仅作用于语言骨干内部的注意力表示,无法修复因**早期视觉编码失败**或输入图像本身缺乏视觉证据而导致的幻觉。后续研究可考虑: - **跨模态前向干预**:在视觉编码器输出或投影层引入类似的因果诊断机制,判断视觉特征是否在输入早期已丢失关键信息。 - **视觉-语言联合校准**:将 HEAL 的头级校准与视觉侧的特征增强或对比学习相结合,形成从编码到解码的全链路事实性保障。 ### 4. 与模型训练的深度融合 HEAL 目前是完全推理时(training-free)的方法。将其思想融入训练阶段可能产生更根本的改进: - **均衡正则化目标**:在预训练或微调损失中增加协同头信息分布的均衡约束,例如最小化 |α(vis) - α(target)| ,使模型内在地倾向于健康的信息平衡。 - **反事实数据增强**:利用 HEAL 揭示的幻觉模式,构造视觉-语言信息比例漂移的对抗样本进行训练,提升模型对分布偏移的鲁棒性。 ### 5. 完整部分信息分解(PID)的理论完善 HEAL 的协同项满足 I(syn) ≈ S - R ,其中冗余 R 与协同 S 未被显式分离。未来工作可: - **显式冗余估计器**:引入可学习的冗余函数 R^ (如基于 BROJA 或 CCS 框架),将 HEAL 的分解从 I(vis), I(lang), I_(syn) 推进到完整的 U_V^, UL^, R^, S^ ,提供更精确的信息几何解释。 ### 6. 向更多模态与复杂推理场景扩展 - \*多模态扩展**:将视觉-语言二元校准推广至视频、音频、三维点云等更多模态,研究多模态协同头的高维信息均衡问题。 - **复杂推理任务**:在需要频繁切换视觉 grounding 与语言逻辑的任务(如图表推理、数学问题求解、医疗影像报告生成)中,验证 HEAL 对突发性任务转换的适应能力,并设计相应的快速响应机制。 ### 7. 稀疏激活架构(MoE)中的专家级分析 虽然 HEAL 可直接应用于 MoE 模型的注意力模块,但尚未考虑专家路由的动态性。后续可探索: - **专家-头联合分析**:不同专家激活模式下,协同头的信息漂移模式是否存在差异,进而为不同专家组合动态选择最优 α 。 Q6: 总结一下论文的主要内容 该论文围绕多模态大语言模型(MLLMs)的幻觉问题,提出了一种从注意力头内部信息分布视角进行诊断与干预的新方法。以下是主要内容的系统总结: —- ### 1. 研究背景与核心问题 MLLMs 在生成过程中常出现**幻觉**(hallucination),即产生与视觉上下文事实不一致的响应。现有缓解方法主要存在两方面局限: - **宏观层面**(重训练、强化学习等)将模型视为黑盒,缺乏对内部机制的可解释性; - **微观层面**(如注意力权重增强、对比解码等)多依赖**间接信号**(如注意力权重或 FFN 激活),无法准确捕捉注意力头内部的真实信息分布与因果协同效应,且易陷入**“跷跷板”困境**(see-saw dilemma)——单纯增强视觉注意力可能损害语言流畅性,反之则加剧视觉幻觉。 —- ### 2. 关键发现:协同头内的信息分布漂移 通过对 LLaVA-NeXT、Qwen3-VL 等模型的深入分析,论文揭示了一个核心结论: > **幻觉的发生并非由视觉头或语言头的数量或强度不足导致,而是源于协同头(synergy heads)内部视觉-语言信息分布偏离健康均衡(healthy equilibrium)。** 具体而言: - 在生成幻觉 token 时,协同头内的视觉信息比例显著下降,语言先验主导; - 注意力头在自回归生成过程中呈现**任务驱动的相位转移**(task-driven phase transition):生成语言中心 token 时协同头趋向语言头,生成视觉中心 token 时部分语言头转向协同头; - 在视觉基础 token 生成阶段,视觉头数量几乎保持不变,幻觉的关键诱因是协同头内部的**信息漂移**而非模态缺失。 —- ### 3. 方法:HEAL(Head-lEvel information disentAnglement and caLibration) HEAL 是一个完全在推理阶段(training-free)执行的动态干预框架,包含三个递进步骤: #### (1)因果噪声干预:过滤冗余头 对每个注意力头的输出 o^((t,l,i)) ,用分布匹配的高斯噪声 o^((t,l,i)) sim N(μ(t,l,i), Sigma_(t,l,i)) 进行替换,测量层表示变化:
I^((t,l,i)) = 1 - Sim(y^((t,l)), y^((t,l))((-i)))
若 I^((t,l,i)) < μ - 3σ ,则判定为**因果冗余头**并剔除,避免干扰后续分析。 #### (2)反事实双重差分(Counterfactual DiD):信息解耦 对剩余的头,构造四种反事实输入(保留/掩码视觉与语言 token),通过表示差异解耦信息成分: - 总信息: I(total) = 1 - Sim(H(11), H(00)) - 视觉信息: I(vis) = Sim(H(11), H(10)) - Sim(H(11), H(00)) - 语言信息: I(lang) = Sim(H(11), H(01)) - Sim(H(11), H(00)) - 协同信息: I(syn) = I(total) - I(vis) - I(lang) 基于上述分数,将头分类为**冗余头、视觉头、语言头、协同头**四类。 #### (3)动态信息校准:均衡因子 α 引入均衡因子 α ∈ (0,1) 表征期望的视觉-语言信息比例。计算校准因子:
β = (α) / (α(textvis)), quad γ = (1-α) / (α(textlang))
在推理时对协同头的 value vectors 进行动态缩放:
o^((t,l,i)) = Softmax(q^((t,l,i))(K^((t,l,i)))^top{√d}) [ β V^((t,l,i))(vis), γ V^((t,l,i))(lang) ]
此操作在 KV-cache 更新后、注意力核函数前执行,将协同头内部的信息分布重新导向均衡状态,抑制语言先验过度主导。 —- ### 4. 理论支撑 论文提供了两项理论保证: - **定理 1(值空间与信息分布校准的等价性)**:在局部线性近似下,对 value vectors 施加 β, γ 等价于将模态信息比例校准至目标 α 。 - **定理 2(均衡因子的单调方向性效应)**:RMSNorm 后的输出 z(α) 与视觉参考方向的对齐度随 α 单调递增,证明校准具有可预测的几何效应。 —- ### 5. 实验与验证 #### 主要基准与模型 在 LLaVA-1.5/NeXT、Qwen2/2.5/3-VL、InternVL/InternVL3.5 等模型上,于 POPE、CHAIR、MMHal-Bench、LLaVA-Bench、MME、BLINK-Twice 等基准进行评估。 #### 核心结果 - **幻觉缓解**:HEAL 在 POPE 上取得最优的 F1 与准确率,在 CHAIR 上显著降低对象与实例幻觉率,同时保持较高的召回率与生成长度。 - **综合能力**:在 MME、LLaVA-Bench 等综合基准上,HEAL 在提升事实性的同时未损害语言连贯性与推理能力。 - **双向因果干预**:人为降低视觉信息比例可诱导幻觉,提升该比例则可缓解幻觉,验证了信息失衡与幻觉之间的**因果关系**。 - **鲁棒性**:在多种掩码策略、替换分布、阈值选择下,协同头的信息漂移现象与下游性能保持稳定。 - **效率**:通过周期更新(每 10 步)与并行张量运算,HEAL 在引入有限计算开销(约 0.26 GB 额外显存)的前提下实现有效干预。 —- ### 6. 主要贡献 - **新的可解释视角**:利用因果噪声干预与反事实双重差分,首次在注意力头级别解耦视觉-语言信息结构,将 MLLM 内部机制从黑盒转化为可分析的信息拓扑。 - **揭示幻觉病理**:识别出协同头内的视觉-语言信息失衡是幻觉的因果可干预因素,而非传统认为的模态专属头不足。 - **轻量即插即用方案**:提出基于均衡因子 α 的动态校准策略,无需重新训练即可适配多种 MLLM 架构,为构建可信多模态系统提供了简单且可解释的技术路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Meng’en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09206.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09206
Published: 2026-09-11T01:29:35.700Z
7. Video-MOPD: Multi-Teacher On-Policy Distillation for Video Understanding
Abstract:Video understanding demands a convergence of complementary capabilities across perception, temporal understanding, and complex reasoning, which are difficult to jointly optimize within a single model. We introduce Video-MOPD-8B, an open-weight model dedicated to video understanding tasks. To fundamentally enhance its capabilities, we conduct targeted reinforcement learning (RL) optimization across three core domains: video temporal grounding (VTG), general video comprehension, and video STEM reasoning. We then unify their complementary capabilities via Multi-Teacher On-Policy Distillation (MOPD), which consolidates expert knowledge by supervising student-generated trajectories with routed teacher feedback. We further introduce Reliability-Aware Informative Sampling (RAIS), which selects examples with consistently reliable teacher supervision and large teacher-student performance gaps. Together, these components enable Video-MOPD-8B to achieve coordinated and comprehensive performance gains across diverse video understanding tasks. Extensive experiments on comprehensive benchmarks covering general video understanding, temporal grounding, video reasoning, and video STEM tasks demonstrate that Video-MOPD-8B achieves state-of-the-art performance among existing models at a comparable scale. The trained model weights are available at this https URL.
中文摘要
摘要:视频理解要求感知、时间理解和复杂推理等互补能力的融合,而在单一模型中联合优化这些能力非常困难。我们推出了 Video-MOPD-8B,一款专注于视频理解任务的开源权重模型。为了从根本上增强其能力,我们在三个核心领域进行了针对性的强化学习(RL)优化:视频时间定位(VTG)、通用视频理解及视频 STEM 推理。随后,我们通过多教师策略蒸馏(MOPD)将这些互补能力统一起来,该方法通过教师反馈监督学生生成的轨迹,从而整合专家知识。我们进一步引入了可靠性感知信息采样(RAIS),该方法选择具有持续可靠教师监督且教师与学生性能差距大的样本。结合这些组件,Video-MOPD-8B 能够在多样的视频理解任务中实现协同和全面的性能提升。在覆盖通用视频理解、时间定位、视频推理和视频 STEM 任务的综合基准测试中的大量实验表明,Video-MOPD-8B 在相当规模的现有模型中实现了最先进的性能。训练好的模型权重可通过此 https URL 获取。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文致力于解决\*\*视频理解模型中互补能力的专门化增强与统一整合问题\*\*。具体而言,论文针对以下核心挑战: ### 1. 视频理解的多维互补性难以在单一模型内联合优化 视频理解任务要求模型同时具备多种不同性质的能力: - \*\*通用视频理解\*\*:跨帧语义理解、动作识别、事件解释与因果推理 - \*\*视频时序定位(VTG)\*\*:细粒度时序感知与语言-视频时间对齐 - \*\*视频STEM推理\*\*:结合科学知识的细粒度感知、OCR、空间理解与多步推理 这些能力强调视频智能的不同侧面,从宽泛语义理解到精确时序对齐,再到知识密集型推理。由于训练目标与数据分布存在差异,直接在单一模型上同时优化往往导致相互冲突或次优收敛。 ### 2. 领域特定强化学习产生专家模型,但部署多个模型不切实际 通过针对性的强化学习(RL)后训练,可以在上述每个领域分别训练出性能卓越的专家模型(General Video Expert、VTG Expert、STEM Expert)。然而,为不同任务部署独立的专门模型在实际应用中不可取——一个通用视频模型应当在一套参数内保留所有这些互补改进,而非在推理时依赖多个模型或路由模块。 ### 3. 现有能力整合方法存在明显局限 论文指出,现有的能力整合范式面临不同权衡: - \*\*混合RL或顺序RL\*\*:将能力整合与跨领域优化耦合,易导致领域间干扰 - \*\*离线模仿学习\*\*:依赖教师生成的轨迹,与学生推理时的分布存在差异 - \*\*参数空间平均(Parameter Averaging)\*\*:直接对专家参数取平均,可能遭遇任务特定参数更新的相互干扰,导致性能损失 ### 解决方案概述 为应对上述问题,论文提出 \*\*Video-MOPD-8B\*\*,通过一个“先专门化、后统一”(specialize-then-unify)的后训练流程: - \*\*专门化阶段\*\*:从共享基模型出发,分别通过领域特定RL训练三个互补专家 - \*\*统一阶段\*\*:采用\*\*多教师在线策略蒸馏(Multi-Teacher On-Policy Distillation, MOPD)\*\*,将学生自身生成的轨迹交由对应领域的专家教师进行稠密token级监督,从而把多专家能力整合进单一学生策略 - \*\*可靠性感知信息采样(RAIS)\*\*:进一步筛选教师监督一致可靠且教师-学生性能差距大的样本,以提升知识迁移效率 最终目标是得到一个\*\*单一、统一、可独立部署\*\*的视频理解模型,在通用视频理解、时序定位和STEM推理等多样任务上同时达到领先水平。 Q2: 有哪些相关研究? 根据论文第2节,相关研究主要围绕以下三个方向展开: ### 1. 视频多模态大语言模型(Video Multimodal Large Language Models) 该方向关注如何将基于图像的视觉-语言模型扩展至时序结构化的视频输入,代表性工作包括: - \*\*LLaVA-OneVision\*\*、\*\*VideoLLaMA3\*\*、\*\*InternVideo2.5\*\* 与 \*\*Apollo\*\* 等模型,分别从统一图像-视频表示、时序编码、细粒度视觉感知、视频采样策略以及大规模多模态指令微调等角度推进视频建模。 - 基准测试方面,\*\*MMVU\*\* 评估跨多学科的专家级视频理解能力,\*\*Video-MMMU\*\* 则聚焦于从专业视频中获取与应用知识。这些工作共同凸显了全面视频理解所需的多样化能力——涵盖通用语义理解、细粒度时序定位与知识密集型推理,从而催生了针对性的后训练策略需求。 ### 2. 视频理解中的强化学习(Reinforcement Learning for Video Understanding) 近年来,强化学习(RL)作为一种有效的后训练范式被广泛用于提升视频模型的推理与任务特定能力: - \*\*Video-R1\*\* 将 R1 风格的强化学习扩展至视频推理领域,证明奖励驱动的优化可改善动态视觉内容上的推理。 - \*\*VideoChat-R1\*\* 进一步探究针对时空感知的强化微调,为视频问答、时序定位与跟踪等任务设计了特定奖励。 - \*\*MUSEG\*\* 通过时间戳感知的多段定位与定制化 RL 改进时序推理。 - \*\*Tempo-R0\*\* 将 RL 应用于时间视频定位,引入显式的时间感知机制。 - \*\*OneThinker\*\* 探索跨异构图像与视频任务(包括问答、字幕生成、定位、跟踪与分割)的统一 RL 框架。 Video-MOPD 将上述进展组织为“先专门化、后统一”(specialize-then-unify)的流水线:先通过领域特定 RL 最大化互补能力,再通过多教师蒸馏将其整合为统一模型。 ### 3. 能力整合与在线策略蒸馏(Capability Integration and On-Policy Distillation) 该方向关注如何将多种专门化能力整合进单一模型,现有范式及其权衡包括: - \*\*混合 RL(mixed RL)\*\* 与 \*\*顺序领域 RL(sequential domain-wise RL)\*\*:将多领域优化与能力整合耦合在一起。 - \*\*离线模仿学习(offline imitation)\*\*:基于专门化教师生成的轨迹进行训练,但其分布与学生推理时的分布存在差异。 - \*\*参数空间模型合并(parameter-space merging)\*\*:如 Model Soups 与 Task Arithmetic,直接对多个微调模型的参数进行平均或编辑,但可能遭遇任务特定参数更新间的相互干扰(interference)。 相比之下,\*\*多教师在线策略蒸馏(MOPD)\*\* 采用领域专门化教师对学生自身生成的轨迹进行监督,直接在策略空间(policy space)中实现能力整合,避免了上述范式的局限性。在视频领域,\*\*Video-OPD\*\* 将在线策略蒸馏应用于时间视频定位任务,而 Video-MOPD 则将这一策略推广至多专家、跨领域的能力统一场景,把通用视频理解、时序定位与 STEM 推理三种异构能力整合进单一模型。 Q3: 论文如何解决这个问题? 论文通过 \*\*"先专门化、后统一"(specialize-then-unify)\*\* 的两阶段后训练流水线解决视频理解中互补能力的增强与整合问题。具体方法如下: --- ### 1. 专门化阶段:构建领域特定的教师专家 从共享的基座模型(Qwen3-VL-8B-Instruct)出发,论文针对视频理解的三个互补维度,分别训练独立的专家模型: #### 1.1 通用视频理解专家(General Video Expert) - \*\*目标\*\*:提升整体语义理解、跨帧视觉证据聚合、动作识别与事件解释能力。 - \*\*数据\*\*:整合 NeXT-QA、LongVideoReason、STAR、LLaVA-Video-178K、Holmes-train、PerceptionTest、CLEVRER、SR-91k 等多个开源数据集,经过去污、难度过滤与来源重加权。 - \*\*优化\*\*:采用 \*\*GRPO\*\*(Group Relative Policy Optimization)进行强化学习,奖励函数由\*\*答案准确性奖励\*\*与\*\*回复格式合规奖励\*\*组合而成,驱动模型生成可验证的推理轨迹。 #### 1.2 视频时序定位专家(VTG Expert) - \*\*目标\*\*:获得细粒度事件定位与精确的语言-视频时序对齐能力。 - \*\*数据与方法\*\*:完整复现 TimeLens2 的两阶段训练流程。监督微调(SFT)阶段使用 TimeLens2-93K、TimeLens-100K 与 Ego4D-NLQ 数据集,学习可变基数区间预测;强化学习阶段采用 \*\*GRPO\*\* 配合推出引导的困难样本挖掘(rollout-guided hard-sample mining)。 - \*\*奖励设计\*\*:复合奖励包含集合级时序 IoU 与\*\*时序 Wasserstein 奖励\*\* R_(TW) ,后者在预测区间与真值无重叠时仍能提供几何感知反馈,同时惩罚不可解析的输出。 #### 1.3 视频 STEM 推理专家(STEM Expert) - \*\*目标\*\*:强化知识密集型推理所需的帧级能力,包括 OCR、图表解析、几何分析与多步数学推理。 - \*\*关键洞察\*\*:尽管目标为视频任务,该专家完全在\*\*静态图像\*\*的 STEM 数据上训练(利用 Orsta47K 与 virl39K 数据集),因为文本/图像级别的 STEM 能力可自然迁移至视频单帧分析。 - \*\*优化\*\*:采用 \*\*DAPO\*\*(an advanced variant of GRPO)进行训练,专注于学科导向的理解与复杂视觉推理。 --- ### 2. 可靠性感知信息采样(RAIS) 在蒸馏前,论文提出 \*\*RAIS\*\* 以筛选高质量训练样本,避免教师监督不可靠或学生已充分掌握的样本浪费计算。 对每个候选样本 x ,从其对应领域教师 π_T^(d(x)) 与初始学生 π_S 各自独立采样 K 个回复 y_T^k_(k=1)^K 与 y_S^k_(k=1)^K 。记 V_(d(x))(x, y) ∈ 0,1 为领域特定的正确性验证器,则经验成功率为:
AccT(x) = (1) / (K)∑(k=1)^(K) V(d(x))(x, y_T^k), quad Acc_S(x) = (1) / (K)∑(k=1)^(K) V_(d(x))(x, y_S^k)
- **可靠性过滤**:仅保留满足 AccT(x) = 1 的样本,确保教师在所有 K 次推出中均回答正确,从而保证监督的一致性。 - **信息性优先**:对保留样本,计算教师-学生性能差距:
Delta(x) = Acc_T(x) - Acc_S(x) = 1 - Acc_S(x)
优先选择 Delta(x) 更大的样本,即学生表现显著落后于教师的困难样本,以最大化知识迁移效率。 —- ### 3. 统一阶段:路由式多教师在线策略蒸馏(MOPD) 这是将互补能力整合进单一模型的核心机制。设混合训练集 D = ∪(d ∈ v,i,t) Dd 分别对应视频、图像与时序定位样本,每个领域 d 配有专门化教师 π_T^d ,统一学生记为 πθ 。 - **确定性路由**:每个样本 x 通过其领域标签 d(x) 被确定性地路由至匹配教师 π_T^(r(x)) ,训练完成后路由即被移除,推理时无需任何路由开销。 - **在线策略生成**:对于输入 x sim D ,学生首先生成一条**在线轨迹**(on-policy trajectory):
y = (y1, dots, y(|y|)) sim π_θ(· mid x)
- **Token 级反向 KL 蒸馏**:将学生生成的轨迹交由对应领域教师评估,在相同上下文条件下计算教师分布,优化目标为 token 级的反向 KL 散度:
L(Video-MOPD)(θ) = ∑(d ∈ v,i,t) pd E(x sim D)d,, y sim πθ(· mid x) [ (1) / (|y|) ∑(t=1)^(|y|) D(KL)( πθ(· mid x, y(<t)) ,|, πT^d(· mid x, y(<t)) ) ]
其中 p_d 为领域采样比例(论文采用近似均衡的域级采样), |y| 为学生回复的 token 数。 **关键优势**:由于监督施加在学生自身策略所访问的状态(即学生自己生成的轨迹)上,MOPD 避免了离线蒸馏中教师轨迹与学生推理分布不匹配的问题,并直接在策略空间完成能力整合,而非在参数空间进行简单平均。 —- ### 4. 统一推理部署 经过上述流程得到的 **Video-MOPD-8B** 在推理时**仅使用单一参数集**,无需专家模型、路由模块或任何额外开销,即可在通用视频理解、时序定位与 STEM 推理等多类任务上复现专家级行为。 Q4: 论文做了哪些实验? 论文在**7个互补的视频基准**上开展了系统性实验,涵盖定量对比、消融研究与定性分析三个层面。具体实验内容如下: —- ### 1. 实验设置 #### 评估基准 实验选用覆盖 STEM 推理、通用视频理解与时序理解的 **7 个基准**: - **MVBench**:通用视频理解的多选题测试 - **MMVU**:知识密集型开放式多模态推理(GPT-5 评判总分) - **Video-MME**:广泛视频感知与推理 - **VideoMMMU**:学科级视频理解(GPT-5 评判准确率) - **Video-Holmes**:复杂视频推理与证据整合 - **TimeLens**:时序定位性能(Charades、ActivityNet、QVHighlights 的时序 IoU 算术均值) - **TempCompass**:细粒度时序感知 #### 对比模型 - **基线**:Qwen3-VL-8B-Instruct(共享初始化点)、Qwen3-VL-8B-Thinking - **先进方法**:CRPO、VideoKR、OneThinker、VideoSSR - **内部专家**:General Video Expert、STEM Expert、VTG Expert - **参数空间整合基线**:Param-Merge (Avg.),即直接对三个专家检查点做参数平均 - **消融变体**:Teacher Top-16、Student Top-16、Teacher∩Student Top-16 等 token 支持策略 —- ### 2. 主要结果(与基线对比) 如图 2 与表 1 所示,Video-MOPD-8B 在所有 7 个基准上均实现提升,关键增益包括: - **Video-Holmes**: +10.2 分 - **TimeLens**: +9.2 分 - **MMVU**: +5.9 分 相比初始化基线 Qwen3-VL-8B-Instruct(平均 63.68),Video-MOPD-8B 将**总体平均分提升至 69.12**,绝对增益达 **5.4 分**。这表明通过专门化后统一,单一模型能够同时吸收多领域改进,且超越任何单一训练域的局限。 —- ### 3. 综合模型比较(表 1) 在同期同规模模型中,Video-MOPD-8B 取得最高总体平均分(69.12)。具体发现如下: - **对非专家基线的优势**:在 7 个基准中的 6 个上领先或持平,包括 MMVU 与 Video-Holmes 的最佳表现,以及 Video-MME 的并列最佳。 - **对参数平均的优势**:相比 Param-Merge (Avg.) 的 67.28 分,Video-MOPD-8B 高出 **1.84 分**,验证了策略空间蒸馏相比参数空间合并能更有效地整合互补能力、缓解参数干扰。 - **专家的互补性验证**: - General Video Expert 在通用理解(如 MVBench、Video-Holmes)上最强; - STEM Expert 在 VideoMMMU 与 TempCompass 上表现突出,证明基于静态图像的 STEM 训练可迁移至视频帧级分析; - VTG Expert 在 TimeLens 上具备高度专门化的时序定位能力。 Video-MOPD-8B 成功将这些分散的专长整合为单一可部署模型。 —- ### 4. 蒸馏支持策略消融实验(表 2) 为验证 MOPD 中 token 级监督的具体实现,论文在单 epoch 蒸馏设置下比较了不同**支持集(support)**策略: | 支持策略 | MVBench | MMVU | Video-MME | VideoMMMU | Video-Holmes | TimeLens | |—-|—-|—-|—-|—-|—-|—-| | Sampled token (默认) | 72.45 | 66.50 | 72.8 | 73.67 | 50.57 | 61.42 | | Teacher Top-16 | 72.20 | 68.00 | 73.0 | 71.44 | 50.41 | 60.92 | | Student Top-16 | 72.32 | 66.70 | 73.4 | 72.11 | 50.35 | 60.43 | | Teacher∩Student Top-16 | 72.88 | 66.70 | 72.7 | 71.89 | 50.30 | 60.69 | 实验表明,不同 token 支持策略会强调教师与学生分布的不同区域,导致跨能力维度的迁移模式各异。Sampled token 策略在整体能力协调上表现均衡,因此被采纳为默认方案。 —- ### 5. 定性分析(图 3) 论文从三个专家对齐的能力域各选取典型案例,对比 **Qwen3-VL-8B-Instruct**、**对应领域专家**与 **Video-MOPD-8B**: - **通用视频理解**:在视频推理任务中,Video-MOPD-8B 与 General Video Expert 均能正确推断出“调整怀表是为了重置时间掩盖罪行”,而基线模型错误理解为“确认晚餐时间”。 - **视频 STEM 推理**:在电路分析视频中,Video-MOPD-8B 与 STEM Expert 均正确判断仅灯泡 #1 变亮,基线则错误选择全部灯泡。 - **时序定位**:在“与不同人握手”查询中,VTG Expert 预测区间 $
99, 109
(IoU 0.909),而 Video-MOPD-8B 精确命中真值
98, 109
(IoU 1.000),基线则完全偏离至
140, 150
。 这些案例表明,Video-MOPD-8B 在单一模型内部成功复现了跨帧证据整合、知识密集型 STEM 推理与精确时序定位等专家级行为。 Q5: 有什么可以进一步探索的点? 根据论文第 6 节(Future Work),可进一步探索的方向包括: - 长视频扩展:将 Video-MOPD 拓展至长视频场景,其中相关证据稀疏且分散在远距离的时间片段中。需探索高效的帧选择策略、层次化时序表征,以及记忆增强的长上下文推理机制。 - 强化学习专家的进一步增强:通过更广泛多样化的训练数据、更精确的特定任务验证器与奖励函数,以及更优的优化算法,持续提升各领域专家的能力上限。 - 迭代式专家升级与蒸馏:研究是否可以迭代地升级专家模型并反复执行 MOPD,从而在不断引入新能力的同时,避免对已有能力的灾难性遗忘。 - 长上下文处理机制:针对超长视频序列,设计高效的上下文压缩与证据检索方案,以降低计算开销并提升远距离时序依赖的建模效果。 Q6: 总结一下论文的主要内容 该论文提出了 Video-MOPD-8B,一个面向全面视频理解的开放权重模型,核心贡献在于通过 “先专门化、后统一”(specialize-then-unify) 的后训练范式,将视频理解的多种互补能力整合进单一可部署模型。 ### 1. 研究动机 视频理解要求模型同时具备多种难以在单一优化目标下联合训练的互补能力: - 通用视频理解:跨帧语义理解、动作识别与事件推理 - 视频时序定位(VTG):细粒度事件定位与语言-视频时间对齐 - 视频 STEM 推理:结合科学知识的细粒度感知、OCR、空间分析与多步推理 直接在单一模型上优化这些异构目标易产生冲突,而分别部署多个专家模型又不切实际。 ### 2. 方法框架 论文采用两阶段后训练流水线: 阶段一:构建互补领域专家 从共享基座模型 Qwen3-VL-8B-Instruct 出发,独立训练三个专家: - 通用视频理解专家:利用多源开源视频数据,通过 GRPO 强化学习优化答案准确性与格式合规性 - VTG 专家:复现 TimeLens2 的两阶段训练,采用时序 IoU 与时序 Wasserstein 奖励 R(TW) 的复合奖励进行 RL 微调,强化细粒度时序定位 - STEM 专家:仅在静态图像的 STEM 数据上通过 DAPO(GRPO 的改进变体)训练,获得的 OCR、图表解析与数学推理能力可迁移至视频帧级分析 阶段二:多教师在线策略蒸馏(MOPD) 将三位专家的能力统一蒸馏进单一学生模型 πθ 。每个训练样本按其领域标签被确定性路由至对应教师 πT^d ,由学生在当前策略下生成在线轨迹 y sim πθ(·|x)$,随后通过 token 级反向 KL 散度进行监督:
L(Video-MOPD)(θ) = ∑(d) pd E(x,y) [ (1) / (|y|) ∑(t=1)^(|y|) D(KL)( πθ(·|x,y(<t)) ,|, πT^d(·|x,y(<t)) ) ]
**可靠性感知信息采样(RAIS)** 为提升蒸馏效率,论文提出 RAIS 筛选训练样本: - **可靠性过滤**:仅保留教师在 K 次独立采样中全部正确的样本( Acc_T(x)=1 ) - **信息性优先**:优先选择教师-学生差距大的样本,即 Delta(x) = 1 - Acc_S(x) 较大的困难样本 ### 3. 实验结果 在涵盖 STEM 推理、通用视频理解与时序定位的 **7 个基准**(VideoMMMU、MMVU、MVBench、Video-MME、Video-Holmes、TimeLens、TempCompass)上: - Video-MOPD-8B 在 **7/7** 基准上均超越初始化基线,平均提升 **5.4** 分(从 63.68 至 69.12) - 相比直接参数平均(Param-Merge),平均分高出 **1.84** 分,验证了策略空间蒸馏优于参数空间合并 - 在同期同规模模型中达到最优总体表现,且在 6/7 基准上领先或持平 ### 4. 主要贡献 - 提出首个融合通用视频理解、时序定位与 STEM 推理的统一开源视频模型 Video-MOPD-8B - 构建三领域专家并引入 **RAIS**,实现可靠且高效的教师监督筛选 - 通过**路由式多教师在线策略蒸馏**(MOPD)将异构专家能力整合进单一策略,推理时无需任何专家或路由开销 - 在多样化视频理解基准上达到同规模模型的最优性能,并开源模型权重 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Zhenxin Qin, Peng Shi, Cong Han, Yinlong Qian, Zequn Jie, Lin Ma
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09300.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09300
Published: 2026-09-11T01:29:35.700Z
8. DensePol: Dense-Angle Polarization Dataset for Learning-Based Polarimetric Vision
Abstract:Polarimetric vision is gaining increasing attention because it provides physical cues about scene shape, material, and reflection that are difficult to recover from RGB alone. Recent work has therefore explored predicting polarization directly from conventional RGB images; however, the fidelity of these methods strongly depends on the polarization supervision used for training. Most existing datasets rely on Division-of-Focal-Plane (DoFP) cameras with four spatially interleaved analyzer orientations, which provide limited angular redundancy and introduce interpolation and instantaneous-field-of-view errors. We introduce DensePol, a high-redundancy RGB—polarization dataset based on Division-of-Time (DoT) acquisition, capturing 180 full-resolution analyzer orientations at $1^\circ$ intervals. DensePol contains 2,018 paired RGB—polarization images with the angular measurements and fitting residuals retained. Dense angular sampling substantially improves polarization stability, reducing AoLP deviation from $13.36^\circ$ to $2.21^\circ$. We further introduce a deterministic diffusion-based RGB-to-polarization framework with cyclic AoLP representation and a local DoLP refiner. Experiments demonstrate improved polarization prediction and downstream surface-normal estimation. The dataset and code will be publicly available.
中文摘要
摘要:偏振测量视觉正受到越来越多的关注,因为它提供了关于场景形状、材料和反射的物理线索,这些线索难以仅靠RGB还原。因此,近期研究探索了直接从传统RGB图像预测偏振;然而,这些方法的保真度很大程度上取决于训练时所用的偏振监督。大多数现有数据集依赖于具有四个空间交错分析器方向的焦平面分割(DoFP)相机,这种相机提供了有限的角度冗余,并引入插值和瞬时视场误差。我们介绍了DensePol,这是一个基于时间分割(DoT)采集的高冗余RGB偏振数据集,捕捉180个全分辨率分析仪的方向,间隔为$1^\circ$。DensePol包含2018张成对的RGB偏振图像,保留了角度测量和拟合残差。密集角度采样显著提升偏振稳定性,将AoLP偏差从$13.36^\circ$降至$2.21^\circ$。我们进一步引入了基于确定性扩散的RGB转偏振框架,支持循环AoLP表示和局部DoLP精炼器。实验展示了更优的偏振预测和下游表面法线估计。数据集和代码将公开。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09359 (HTTP 429)
Authors: Param Sangani, Ahmad Moori, Erik Blasch, Guna Seetharaman, Hadi Aliakbarpour
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09359.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09359
Published: 2026-09-11T01:29:35.700Z
9. The Living Library: Transforming Archival Collections into Conversational Knowledge Systems — Lessons from the Theodore Roosevelt Presidential Library
Abstract:We present the Living Library, an end-to-end framework for transforming fragmented digital archives into governed, conversational, in-person exhibit experiences. Developed and deployed at the Theodore Roosevelt Presidential Library, the framework comprises four layers: digitization and corpus creation, AI-powered processing, retrieval and reasoning, and an optional embodied conversational interface. The first three layers aggregate a 300,000-record collection, apply OCR and structured metadata enrichment for expert curatorial review, and publish records to a hybrid dense/semantic index. Expert review is conducted through the Archivist App, a curator-facing interface that supports correction of AI-generated transcriptions and metadata. The governed corpus powers both a researcher-facing interface and Talk to TR, a continuously operating exhibit that embodies Theodore Roosevelt as a full-scale digital human within a museum environment. To support live, face-to-face interactions, Cross-Era Analogical Grounding reframes contemporary questions through documented historical parallels, allowing Roosevelt to address present-day topics without inventing facts. Dual-path retrieval and end-to-end streaming keep responses grounded and responsive. Layered watchdogs, visitor-session isolation, automated conversation management, and independently restartable services enable reliable unattended operation for hundreds of visitors. Avatar realism, spatial audio, lighting, staging, and conversational design are developed and evaluated as an integrated experience. Rather than report a controlled benchmark, we describe lessons from operating Talk to TR as a public exhibit and offer a transferable model for transforming archival collections into believable, in-person conversational experiences.
中文摘要
摘要:我们提出了“活图书馆”(Living Library),这是一个端到端的框架,用于将分散的数字档案转化为有规章管理的、可对话的、面对面的展览体验。该框架在西奥多·罗斯福总统图书馆开发和部署,包含四个层次:数字化与语料创建、AI驱动处理、检索与推理,以及一个可选的具身对话界面。前三个层次汇总了30万个记录的收藏,应用OCR和结构化元数据增强以供专家策展审核,并将记录发布到混合密集/语义索引中。专家审核通过“档案管理员应用”(Archivist App)进行,这是一个面向策展人的界面,支持对AI生成的转录和元数据进行修正。受控语料库支持研究者接口以及“与TR对话”(Talk to TR),这是一个持续运行的展览,使西奥多·罗斯福以全尺寸数字人形象在博物馆环境中出现。为了支持实时的面对面互动,“跨时代类比基础”(Cross-Era Analogical Grounding)通过已记录的历史类比重新框定当代问题,使罗斯福能够讨论当下话题而不虚构事实。双路径检索和端到端流式处理确保了回答的基础性与响应性。分层监管、访客会话隔离、自动对话管理以及独立可重启的服务使数百名访客能够可靠地无人值守操作。化身的逼真度、空间音频、灯光、布景和对话设计作为一个整体体验开发与评估。我们没有报告受控基准,而是描述了运营“与TR对话”公共展览的经验教训,并提供了将档案收藏转化为真实可感的面对面对话体验的可移植模型。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09368 (HTTP 429)
Authors: Pengce Wang, Lucia Ronchi Darre, Matt Briney, Michaell Bakalars, Dan Rutkowski, Ursula Hardy, David Wolf, Laura Hoffman, Allen Kim, Shawn Wright, Juan Lavista Ferres
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09368.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09368
Published: 2026-09-11T01:29:35.700Z
10. OmniPoint: Universal Monocular Metric Pointcloud from Any Camera
Abstract:Recovering metric 3D geometry from monocular images is a fundamental computer vision task, yet current methods remain heavily fragmented by fixed camera model assumptions and inflexible input schemes. We present OmniPoint, a unified framework designed to generalize metric reconstruction across diverse imaging sensors, including pinhole, fisheye, and equirectangular projections, while accommodating varying geometric priors. To overcome projection rigidity, OmniPoint abandons conventional planar depth regression. It instead adopts a decoupled ray and distance representation alongside a decoupled training objective, explicitly separating the camera projection model from the scene structure. To address the severe scarcity of training data for alternative cameras, we introduce a bidirectional augmentation strategy that explicitly bridges labeled perspective data and unlabeled omnidirectional domains in 3D space. Furthermore, to seamlessly integrate optional inputs like camera intrinsics or sparse depth without destabilizing the network through feature distribution shifts, we propose a robust information injection mechanism. This mechanism utilizes learnable input state embeddings to resolve architectural ambiguity and applies vectorized Gaussian smoothing to densify irregular measurements. Extensive experiments demonstrate that OmniPoint achieves state-of-the-art zero-shot performance across multiple benchmarks, establishing a robust new standard for unified monocular 3D reconstruction.
中文摘要
摘要:从单目图像恢复度量 3D 几何是计算机视觉的一个基本任务,但现有方法仍然受到固定相机模型假设和不灵活输入方案的严重限制。我们提出了 OmniPoint,这是一种统一的框架,旨在在包括针孔、鱼眼和等矩形投影在内的多种成像传感器之间推广度量重建,同时适应不同的几何先验。为了克服投影的僵化性,OmniPoint 放弃了传统的平面深度回归方法。它采用了去耦的光线和距离表示以及去耦的训练目标,明确地将相机投影模型与场景结构分离开。为了应对替代相机训练数据的严重短缺,我们引入了一种双向增强策略,在 3D 空间中明确连接带标签的透视数据和无标签的全向域。此外,为了无缝集成相机内参或稀疏深度等可选输入,同时避免网络因特征分布变化而不稳定,我们提出了一种稳健的信息注入机制。该机制利用可学习的输入状态嵌入来解决架构歧义,并应用向量化高斯平滑来稠密化不规则测量。大量实验表明,OmniPoint 在多个基准测试中实现了最先进的零样本性能,为统一的单目 3D 重建建立了稳健的新标准。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.09394 (HTTP 429)
Authors: Botao Ye, Marc Pollefeys, Ming-Hsuan Yang, Abhijit Kundu
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2609.09394.pdf
CoolPaper URL: https://papers.cool/arxiv/2609.09394
Published: 2026-09-11T01:29:35.700Z