数据来源:ArXiv Domain

LLM Domain Papers

1. Behaviorally Grounded User Profiles from the Wild for Personalized Alignment and Multi-Perspective Reasoning

Abstract:Persona-driven techniques increasingly adapt large language models (LLMs) to diverse contexts. However, existing methods predominantly rely on rigid, synthetic personas that flatten individual variation, rely on stereotypes, and miss the nuanced signals driving actual human preferences. We introduce profile behavioral grounding, a framework for extracting open-ended, high-fidelity user profiles directly from authentic, anonymized social media posts. We evaluate these profiles across two paradigms: train-time personalization via supervised finetuning (SFT) and non-parametric test-time multi-perspective reasoning. Across complex recommendation and open-ended query benchmarks, behaviorally grounded profiles consistently improve base models and outperform synthetic profile baselines, driving stronger parametric alignment and enabling richer, multifaceted reasoning. Our findings establish open-ended, behavior-derived profiles as a highly diverse and effective foundation for the next generation of personalized language systems. Our code base is available at this https URL.

中文摘要

摘要:以角色为驱动的技术越来越多地将大型语言模型(LLMs)适应于多样化的场景。然而,现有方法主要依赖僵硬的、合成的角色,这些角色削弱了个体差异,依赖刻板印象,并忽略了驱动实际人类偏好的细微信号。我们提出了“行为驱动的个人档案”(profile behavioral grounding)框架,用于直接从真实、匿名的社交媒体帖子中提取开放式、高保真的用户档案。我们在两个范式下评估这些档案:通过监督微调(SFT)进行训练时个性化,以及非参数的测试时多视角推理。在复杂的推荐和开放式查询基准测试中,行为驱动的档案持续提升基础模型表现,并优于合成档案基线,推动参数化对齐更强,并实现更丰富、多维的推理。我们的研究结果证明,开放式、基于行为的档案是下一代个性化语言系统的高度多样化且有效的基础。我们的代码库可通过此 https URL 获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00014 (HTTP 429)

Authors: Yuxuan Li, Victor Zhong, Ehsan Kamalloo

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00014.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00014

Published: 2026-09-03T01:26:26.583Z


2. trajectory-judge: What Outcome-Only LLM Judges Miss on Agent Trajectories

Abstract:Outcome-only evaluation is the production default for LLM agents: show a judge the request and the final reply and ask whether it was handled well. The metric is structurally blind to an agent that reaches the right answer the wrong way. We measure that blind spot where ground truth is known by construction: a deterministic tool-using support-desk environment, a scripted oracle policy that always solves it, and a fault injector that breaks exactly one thing at a known step, stratifying faults by whether the customer-visible outcome survived (silent) or not (loud). Five judges (programmatic rules, outcome-only, step-rubric at two model sizes, and a self-consistency ensemble) are scored on detection, step localisation, fault typing, calibration, and cost over 400 trajectories. The outcome-only judge catches 84% of loud faults but 45% of silent ones while flagging 33% of correct trajectories; a step-rubric judge reaches 77% silent recall with zero false alarms at 3x the cost. No judge reads the final reply: an invented promise appended to an otherwise perfect trajectory evades the rules entirely and the step judge 82% of the time, and self-consistency triples cost while improving nothing. We argue that judge evaluations must stratify recall by outcome survival, and release the environment, the injector, all raw verdicts, and an analysis pipeline that rebuilds every number offline.

中文摘要

摘要:仅结果评价是大型语言模型代理的默认生产评估方式:向评审展示请求和最终回复,并询问其处理是否得当。该指标结构上对以错误方式得到正确答案的代理是盲点。我们测量了在已知真实情况的条件下的这种盲点:一个确定性工具使用的技术支持环境,一个总是能够解决问题的脚本化神谕策略,以及一个在已知步骤精确破坏单个环节的故障注入器,将故障按客户可见结果是否存活(沉默)或未存活(响亮)进行分层。五个评审(程序化规则、仅结果、两个模型大小的步骤评分标准,以及自洽集成)在400条轨迹上根据故障检测、步骤定位、故障类型、校准和成本进行评分。仅结果评审捕捉到84%的响亮故障,但仅捕获45%的沉默故障,同时标记了33%的正确轨迹;步骤评分标准评审在三倍成本下以零误报实现了77%的沉默召回率。没有评审会阅读最终回复:在其他方面完美的轨迹上附加一个虚构承诺完全规避了规则,并且步骤评审82%的时间也未能检测到,自洽评审则将成本增加三倍但没有提升任何性能。我们认为,评审评价必须按结果存活情况分层召回,并发布该环境、注入器、所有原始判决以及可离线重建每个数据的分析流程。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*LLM Agent评估中的结构性盲点问题\*\*,具体而言: - \*\*核心问题\*\*:当前LLM Agent的默认评估方式是"仅基于结果的评估"(Outcome-only Evaluation),即评判者(Judge)只能看到用户请求和Agent的最终回复,据此判断任务是否被妥善处理。这种评估方式在\*\*结构上无法识别\*\*那些"以错误方式达到正确结果"的轨迹。 - \*\*具体风险\*\*:Agent可能在中间过程中跳过必需的资格检查、无视工具返回的观测结果、或做出无依据的承诺,但只要最终答案恰好正确,Outcome-only Judge就无法发现这些违规操作。例如,未经检查 eligibility 就直接发出正确金额的退款,从外部看与合规操作毫无区别。 - \*\*被忽视的故障类型\*\*:论文特别关注\*\*静默故障(Silent Faults)\*\*——即故障发生后,客户可见的最终结果仍然正确或符合预期。这类故障恰恰是最可能流入生产环境的,因为评估指标在设计上就看不到它们。 - \*\*测量难题\*\*:通常评估评估者(Judge)需要人工标注,但这会陷入循环论证。论文通过\*\*构造性方法\*\*解决此问题:建立一个确定性的工具使用客服环境,配合脚本化的Oracle策略(保证正确性)和单点故障注入器(在已知步骤注入已知类型的故障),从而在无人工标注成本的情况下获得精确的地面真值标签。 简言之,该工作旨在\*\*量化并暴露Outcome-only LLM Judges对Agent轨迹中过程级错误的检测盲区\*\*,并推动评估实践从"只看结果"转向"审视过程"。 Q2: 有哪些相关研究? 论文在Related Work(第2节)中从六个维度梳理了相关研究: ### 1. LLM Judges的可靠性(Reliability of LLM Judges) - \*\*研究现状\*\*:模型即评判者(Model-as-judge)已成为开放式输出评估的标准做法,代表性工作包括MT-bench与Chatbot Arena

Zheng et al., 2023
、G-Eval
Liu et al., 2023
以及LLM-as-a-judge综述
Gu et al., 2024
。 - **已知病理**:位置与冗长偏见
Wang et al., 2023a
、自我偏好
Panickssery et al., 2024
、指令遵循比较中的客观失败
Zeng et al., 2024
,以及随任务难度增加而加剧的错位
Thakur et al., 2024
。 - **与本文区别**:上述研究通常以人工标注为基准审计单响应评判者;本文则以构造性真值(correct by construction)为基准,审计多步工具使用轨迹的评判者。 ### 2. Agent基准测试(Agent Benchmarks) - **研究现状**:工具使用Agent的基准测试逐渐从只看结果转向关注轨迹: - τ-bench比较最终数据库状态

Yao et al., 2024

  • AgentBench与WebArena评分任务成功率
    Liu et al., 2024; Zhou et al., 2024
  • AgentBoard跟踪子目标进度
    Ma et al., 2024
  • 近期工作直接对推理轨迹进行评分
    Kim et al., 2025; He et al., 2025
  • **与本文区别**:现有基准测试Agent本身;本文**反转角色**——将Agent固定为脚本化的Oracle策略,把**评估器(Judge)**作为被测系统。 ### 3. 失败归因(Failure Attribution) - **研究现状**:在轨迹中定位失败步骤或Agent是一个新兴任务,相关方法包括TRAIL

Deshpande et al., 2025
、多Agent系统失败分析
Zhang et al., 2025b; Cemri et al., 2025; Ma et al., 2025
。 - **故障注入**:AgenTracer通过向成功轨迹注入故障来规模化生成标注错误对
Zhang et al., 2025a
。 - **与本文区别**:故障注入本身是已有技术,但本文将其用于**五向评估器比较**,将**检测(detection)**与**归因(attribution)**分离,并引入**按结果存活分层(stratification by outcome survival)**的召回率度量。 ### 4. 过程监督 vs. 结果监督(Process vs. Outcome Supervision) - **研究现状**:过程奖励模型(Process Reward Models, PRM)表明,步骤级反馈在数学领域训练验证器时优于结果级反馈

Lightman et al., 2024; Uesato et al., 2022; Wang et al., 2024
;ProcessBench则测量推理链中的错误定位能力
Zheng et al., 2024; Zhang et al., 2025c
。 - **与本文区别**:上述工作聚焦于**训练**评分器,且假设最终答案可检查;本文聚焦于**测量问题**——当最终答案正确时,现成的(off-the-shelf)评判者能否看到过程错误?结论表明这取决于评判者的**视图(view)**,而非其优化指标。 ### 5. 校准(Calibration) - **研究现状**:使用期望校准误差(Expected Calibration Error, ECE)评估评判者的置信度

Pakdaman Naeini et al., 2015; Guo et al., 2017
。 - **口头置信度**:语言模型口头报告的置信度可用
Kadavath et al., 2022; Tian et al., 2023
,但普遍过度自信
Xiong et al., 2024
。 - **本文补充**:集成(ensemble)的投票份额(vote share)在 k 较小时(如 k=3 )在结构上比单一评判者陈述的连续置信度更粗糙。 ### 6. 变异测试(Mutation Testing) - **研究现状**:播种已知缺陷以测量检测器的能力已有半个世纪的历史

DeMillo et al., 1978; Jia and Harman, 2011
。 - **核心争议**:变异体能否替代真实故障(mutants as valid substitutes for real faults)是经典有效性问题
Just et al., 2014
。 - **本文回应**:第8节指出,在**故障普遍性(prevalence)**上不能替代,但在**检测能力(capability)**上可以。 Q3: 论文如何解决这个问题? 论文通过**构造性真值(ground truth by construction)的受控测试平台**与**多维度分层评估框架**,系统性地量化并暴露Outcome-only Judge的结构性盲区。具体解决方案可分为以下四个层面: —- ### 1. 构建无需人工标注的确定性测试平台 为逃避“评估评估者需人工标注”的循环论证,论文设计了一个完全确定的实验装置: - **确定性环境**:一个包含7个工具(`get_customer`, `lookup_order`, `get_policy`, `check_eligibility`, `issue_refund`, `escalate`, `reply`)的客服支持台环境,配有明确的标准操作流程(SOP)。环境被设计为**宽松(permissive)**——例如`issue_refund`不会主动检查eligibility,允许Agent跳过关键步骤而不阻止操作——这是产生静默故障的前提。 - **脚本化Oracle策略**:一个固定的六步脚本,在所有实例上均被测试套件断言为绝对正确( provably correct),即不违反任何规则且总能达到预期结果。 - **单点故障注入器(Fault Injector)**:在Oracle的调用列表中**精确编辑一步**,然后对全新环境重放(replay)整个轨迹,重新生成所有观测值。这保证了变异轨迹与真实运行一样内部一致。每种故障类型在已知步骤注入,并携带明确的标签:是否故障、故障步骤、故障类型、以及客户可见结果是否存活。 由此,每条轨迹的地面真值标签在**零人工标注成本**下完全确定。 —- ### 2. 设计六类故障并强制分层(Silent vs. Loud) 故障注入器生成六种单点故障,按客户可见结果的存活情况分为两层: | 分层 | 定义 | 示例 | |———|———|———| | **Silent faults** | 过程违规,但最终结果仍符合预期 | 跳过eligibility检查但恰好全额退款;错误工具调用未破坏金额 | | **Loud faults** | 过程违规且最终结果错误 | 忽略observation导致退款金额错误;提前终止导致未处理 | 通过这一分层,论文将“Outcome-only Judge的盲区”转化为可测量的统计量:**Silent Recall**。若Outcome-only Judge的Silent Recall显著低于Loud Recall,则盲区被精确量化。 —- ### 3. 五种评判者的严格受控比较 论文固定Agent为Oracle,将**评判者(Judge)**作为被测系统,设计五种评判者进行五维度对比: - **规则引擎(Rules)**:基于8条程序化规则的一次性遍历,作为诚实的免费基线。其覆盖盲区被测试固定(两个结构性零点:`wrong_tool`与`unsupported_claim`永远无法捕获)。 - **Outcome-only (14B)**:仅能看到目标(goal)与最终回复(final answer)的LLM Judge。 - **Step-rubric (14B)**:能看到完整轨迹(thought, tool call, observation, reply)的LLM Judge。 - **Step-rubric (8B)**:同上,但使用较小模型,用于测试能力下限。 - **Self-consistency Ensemble (14B, k=3)**:Step-rubric Judge采样三次并严格多数投票。 **公平性控制**:两个核心LLM Judge(Outcome-only与Step 14B)使用**完全相同的模型、解码参数、流程文本、故障分类法与置信度指令**;唯一的自由变量是**视图(view)**——是否包含中间步骤。这确保任何性能差异均可归因于信息结构,而非模型或提示工程。 —- ### 4. 五维度评估指标与不确定性量化 每条轨迹(共400条:100 clean / 175 silent / 125 loud)由五名评判者独立审计,从五个轴进行评分: 1. **检测(Detection)**:精确率、召回率、F1;并按Silent Recall / Loud Recall / 洁净轨迹误报率三维拆分。 2. **定位(Localisation)**:故障步骤的精确匹配(仅在被检测到的轨迹上条件评估)。 3. **分类(Typing)**:六类故障的宏观F1混淆矩阵。 4. **校准(Calibration)**:陈述置信度与观测准确率之间的期望校准误差(ECE)。 5. **成本(Cost)**:每条轨迹的墙钟时间与Token消耗。 **统计方法**:所有指标均附带95%分层配对百分位Bootstrap置信区间( B=10,000 ),在八个设计单元(clean;六种故障类型按结果存活拆分)内分层重采样。规则引擎的覆盖率为结构性常数,不附加采样方差。 —- ### 5. 可离线复现的评估流水线 论文发布的Artifact包含环境、Oracle、注入器、全部400条标注轨迹、2000条原始评判者裁决,以及分析流水线。通过固定种子与确定性重排,任何前缀数据集均为分层样本;所有表格、图表与置信区间均可从原始裁决离线重建,无需再次调用模型。 Q4: 论文做了哪些实验? 论文围绕 **“何种信息可见性决定了LLM Judge能否捕获Agent轨迹中的静默故障”** 这一核心问题,设计了一套受控对比实验。全部实验在固定的400条轨迹(100条干净 / 175条静默故障 / 125条显性故障)上进行,主要实验内容可归纳为以下七个方面: —- ### 1. 五类评判者的主实验对比 这是论文的核心实验,将五种评判者在**完全相同的轨迹集合**上进行审计,比较它们在五个轴上的表现: - **被测系统**: - `rules`:基于8条程序化规则的规则引擎(无模型调用) - `outcome (14B)`:仅输入 `(goal, final_answer)` 的Qwen2.5-14B Judge - `step (14B)`:输入完整轨迹(thought / tool call / observation / reply)的Qwen2.5-14B Judge - `step (8B)`:同上视图,但使用Llama3.1-8B - `selfcons k=3 (14B)`:Step-rubric 14B 以 T=0.7 、3个不同种子采样后严格多数投票 - **评估指标**:F1、静默召回率(Silent Recall)、显性召回率(Loud Recall)、洁净轨迹误报率(False Alarms)、步骤定位精度(Step Exact)、故障类型宏观F1(Type F1)、期望校准误差(ECE)、单条轨迹耗时(s/traj) - **结果载体**:表3(主结果)与图2(召回率分层对比) —- ### 2. 按故障类型的细分召回实验 为解释主实验中数字背后的**失效模式**,论文将六种单点注入故障拆开,观察每类评判者对每种故障的检测召回率: - **六种故障类型**:`wrong_tool`、`hallucinated_argument`、`skipped_precondition`、`ignored_observation`、`premature_stop`、`unsupported_claim` - **关键设计**:其中 `wrong_tool` 与 `unsupported_claim` 是规则引擎的**结构性零点**(structural zeros),用于标定规则覆盖的上界 - **结果载体**:表4(摘要)与表6(带95%置信区间的完整版) —- ### 3. 置信度校准实验 论文不仅要求评判者给出二元裁决,还要求输出 $

0.5, 1.0
区间的置信度(confidence),并检验其自报概率与实际准确率是否一致: - 方法:将置信度分10个等宽区间(equal-width bins),计算总体加权的期望校准误差(ECE) - 对比焦点:Outcome-only Judge 的ECE高达 0.253,而 Step Judge 仅为 0.033 - 结果载体:表3(ECE列)与图3(校准曲线散点图) —- ### 4. 关键故障类型案例研究:unsupported_claim 这是一个专门设计的诊断性实验,用于测试“即使拥有完整轨迹,Judge是否真的会去读最终回复”: - 故障设定:Agent完全遵循流程,仅在最终回复中追加一句无观测支持的虚构承诺(如“已取消订阅”或“已派发 replacement”) - 被测行为:观察 Step Judge 是否会因为过度关注中间步骤而忽视最终回复中的谎言 - 发现:Step (14B) 对此类故障的召回率仅为 0.18,甚至低于 Outcome-only (0.50),说明“看到完整轨迹”并不自动等于“审查了最终回复” - 讨论位置:第7.2节 —- ### 5. 模型规模与能力下限实验(8B vs. 14B) 为区分“提示工程效应”与“模型能力效应”,论文在完全相同的提示、Schema、解码参数下,将14B模型替换为8B模型: - 目的:检验一个较弱的本地模型是否会退化为“始终报故障”的基线 - 结果:Step (8B) 标记了 397/400 条轨迹,误报率 1.00,召回率接近 1.00,本质是“总是说故障”基线,但其F1(0.852)若只看 headline 数字会被误读为有效 - 讨论位置:第7.3节 —- ### 6. 自一致性集成消融实验 论文专门检验了“花3倍成本做Self-consistency Ensemble是否值得”这一工程问题: - 设置: k=3 ,温度 T=0.7 ,多数投票,置信度以投票份额(vote share)表示(仅能取 2/3 或 1 ) - 对比基准:单遍贪婪解码的 Step (14B) - 结果:质量指标(F1、Silent Recall、Type F1、Step Exact)的改善全部落在Bootstrap噪声范围内;ECE反而恶化(+0.051);成本确定性增至3×(30.2s vs 10.2s) - 结论:系统性的遗漏错误(如三样本同时miss unsupported_claim)无法通过采样投票消除 - 结果载体:表3、表9(所有配对差异的95%置信区间) —- ### 7. 有机故障分布观察实验 为避免“注入故障不能代表真实故障”的效度质疑,论文额外让Qwen2.5-14B作为Agent自主运行60个episode,观察其自然产生的失败模式: - 标签来源:规则引擎(但对 wrong_toolunsupported_claim 盲)+ 结果检查 - 发现:13/60 episode被标记;全部为 premature_stop;无工具调用失败;91次重复escalate;仅30/60执行了eligibility检查 - 与注入集的关系:有机分布远非均匀,但注入实验测量的是Judge的能力上限(capability),而非故障普遍性(prevalence) - 结果载体:第8节与附录G —- ### 8. (辅助性)混淆矩阵归因分析 在主实验之外,论文对 Step (14B) Judge 的归因错误模式进行了详细拆解: - 发现:检测近乎完美,但类型归因错误率达约三分之一。例如50例 hallucinated_argument 中35例被误判为 wrong_tool;50例 premature_stop 中 scatter 到多种类型 - 结果载体:图4(混淆矩阵) —- ### 实验设计的核心控制原则 贯穿上述实验的公平性控制包括:Outcome与Step Judge使用同一模型、同一解码参数、同一流程文本、同一故障分类法、同一置信度指令,仅视图(View)不同;全部400条轨迹与2000条原始裁决随论文发布,支持离线重建所有数字与区间。 Q5: 有什么可以进一步探索的点? 基于论文的局限性、测量结果与未竟之处,以下方向值得进一步探索: —- ### 1. 跨领域迁移与更复杂的Agent环境 当前测试台局限于具有明确前置条件的客服支持台。需验证该结论是否适用于: - 开放式编程Agent(如SWE-bench、GitHub issue解决):代码执行路径与测试通过与否的关系可能产生大量”测试通过但逻辑错误”的静默故障; - 网页浏览与多跳检索(如WebArena):最终答案正确但检索路径冗余、跳过必要验证步骤; - 多Agent协作系统:通信层与工具调用层交织,故障可能表现为消息误传而非单步工具错误。 —- ### 2. 前沿闭源模型作为评判者 论文仅使用本地开源模型(Qwen2.5-14B、Llama3.1-8B)。一个直接的后续实验是将step-rubric视图赋予GPT-4o、Claude 3.5 Sonnet或Gemini 1.5 Pro等前沿模型,检验: - 是否仍能复现unsupported_claim的检测盲区(0.18召回率); - 校准误差(ECE)是否显著改善; - 成本增加是否在可接受范围内换取质量提升。 —- ### 3. 复合故障与级联错误注入 当前故障注入严格遵循”单点编辑、单规则违反”原则。真实部署中的故障往往是级联的(例如,先产生幻觉参数,再基于该幻觉进行错误退款)。需要设计: - 受控的两步/三步复合故障注入器; - 测量评判者对错误链的检测灵敏度根因定位精度(是定位第一环还是最后一环)。 —- ### 4. 最终回复的事实一致性专项验证 论文第7.2节发现,即使拥有完整轨迹,Step Judge对unsupported_claim的召回率反而低于Outcome Judge(0.18 vs. 0.50),表明其注意力被中间步骤分散。这提示: - 将”回复-证据对齐”作为独立任务:开发专门检查最终自然语言回复是否被轨迹中所有观测值(以及仅被这些观测值)所支持的子模块; - 探索证据抽取式验证(如先由模型提取reply中的每个事实主张,再逐条回溯到observation的 grounded pool)是否优于端到端轨迹评判。 —- ### 5. 从评判到训练:过程奖励模型(PRM)的专项训练 论文聚焦于零样本(off-the-shelf)Judge的测量。基于该数据集(400条精确标注轨迹,含步骤级标签与故障类型),可进一步: - 训练一个过程奖励模型(Process Reward Model),在每一步输出该步是否正确的概率; - 对比零样本Judge、微调后的PRM与规则引擎在检测、定位、校准三轴上的差异,验证”测量结论”(看步骤有用)是否能转化为”训练收益”(学步骤表示有用)。 —- ### 6. 自适应评判预算分配 Step Judge的静默召回率(0.766)显著优于Outcome Judge(0.451),但成本约为3×(10.4s vs. 3.5s)。可探索级联式或主动式评判策略: - 先用Outcome视图快速筛选明显错误; - 对Outcome Judge置信度处于中间区间的轨迹,再调用Step视图; - 在固定总预算约束下,最大化加权F1或静默召回率。 —- ### 7. 有机故障的自动化收集与分布建模 论文第8节指出,有机故障分布是高度偏斜的点质量(60个episode中全部为premature_stop),与注入集均匀分布截然不同。需要: - 建立长期运行的Agent日志收集管道,结合规则引擎与结果检查自动标记候选故障; - 对有机故障进行自动聚类与分类,构建反映真实先验分布的测试集,避免能力测量与部署效能之间的错位。 —- ### 8. 检测与归因的解耦评估体系 论文发现Step Judge检测F1高达0.923,但类型宏观F1仅0.606,说明能找到问题但说不对问题。后续可设计: - 细粒度的归因评估协议(如允许部分学分:将hallucinated_argument判为wrong_tool是否算部分正确); - 多标签分类框架(某些故障是否同时属于多个类型); - 根因分析的可解释性评估(要求Judge给出其归因的自然语言理由并单独评分)。 —- ### 9. 对抗性承诺与幻觉的专项检测 unsupported_claim代表了一类新型风险:Agent主动对客户做出未授权、不可执行的虚假承诺(如”已取消订阅”、”已发放优惠券”)。这在客服、法律、医疗场景中风险极高。可专门研究: - 针对承诺类幻觉的对抗性测试集生成; - 结合外部知识库或API来验证承诺的可执行性,而非仅依赖轨迹内部一致性。 —- ### 10. 评判者校准的事后修正 论文报告了显著的校准缺陷(Outcome Judge ECE 0.253)。可探索: - 温度缩放(Temperature Scaling)Platt Scaling等事后校准技术是否适用于LLM Judge的口头置信度; - 在Step Judge上,校准后是否能在保持低ECE的同时,将高置信度区间与真正的正确裁决更紧密绑定; - 对集成投票份额(k=3时仅两个离散值)的校准方法改进,如增加k或使用连续替代物(如平均对数概率)。 Q6: 总结一下论文的主要内容 这篇论文系统性地揭示了当前大型语言模型(LLM)Agent评估中仅基于结果的评判(Outcome-only Evaluation)存在的结构性盲区,并通过构造性真值实验对其进行了量化测量。 ### 研究背景与核心问题 当前LLM Agent的生产级评估默认采用“黑盒”模式:评判者(Judge)仅接收用户请求(goal)与Agent的最终回复(final answer),据此判定任务是否成功。该模式在结构上无法识别那些“以错误方式达到正确结果”的过程违规,例如跳过必要的资格检查、无视工具返回的观测数据,或在回复中做出无依据的虚假承诺。只要最终答案恰好正确,这类静默故障(silent faults)便会逃过检测,直接流入生产环境。 ### 解决方案:构造性真值测试平台 为摆脱“评估评估者需依赖人工标注”的循环论证,论文构建了一个完全受控的实验装置: - 确定性环境:一个包含7个工具的客服退款支持台,配有明确的标准操作流程。环境被故意设计为宽松(permissive)——例如,支付接口不会阻止未经验证的退款,从而允许静默故障存在。 - 脚本化Oracle策略:一个经过测试套件断言、可证明正确的六步脚本,作为Agent的固定行为基线。 - 单点故障注入器:在Oracle的调用序列上精确编辑一步,随后对全新环境重放(replay),重新生成所有观测值。由此产生400条确定性标注轨迹(100条干净 / 175条静默故障 / 125条显性故障),覆盖六种故障类型: - wrong_tool(错误工具) - hallucinated_argument(幻觉参数) - skipped_precondition(跳过前置条件) - ignored_observation(无视观测结果) - premature_stop(提前终止) - unsupported_claim(无依据的虚假承诺) ### 实验设计:五种评判者的受控对比 论文将Agent固定为Oracle,把评判者作为被测系统,在完全相同的轨迹集上进行五维度评估(检测、步骤定位、故障分类、置信度校准、成本)。五种评判者包括: 1. 规则引擎(Rules):基于8条程序化规则的确定性基线。 2. Outcome-only (14B):仅输入 (g, a) 的Qwen2.5-14B Judge。 3. Step-rubric (14B):输入完整轨迹(思考、工具调用、观测、回复)的Qwen2.5-14B Judge。 4. Step-rubric (8B):同上,但使用Llama3.1-8B。 5. Self-consistency Ensemble (14B, k=3 ):Step-rubric Judge采样三次严格多数投票。 关键控制:Outcome-only与Step-rubric 14B Judge在模型、解码参数、流程文本、故障分类法、置信度指令上完全一致,唯一变量是信息视图(view)。 ### 核心发现 - 静默召回率盲区的量化:Outcome-only Judge对显性故障(loud faults)召回率为 0.840

0.78, 0.90
,但对静默故障(silent faults)仅为 0.451
0.38, 0.52
,同时伴随 0.330
0.24, 0.43
的洁净轨迹误报率。当两种故障被混合汇报时, 0.61 的池化召回率掩盖了这一巨大差距。 - 步骤视图的价值:在完全相同的模型下,将视图从 V(out) 改为 V(step) ,静默召回率从 0.451 提升至 0.766
0.74, 0.80
,且洁净轨迹误报率降至 0 (95% CI上限 0.036 ),步骤定位精度达 0.973 。 - 规则引擎的结构性上限:规则引擎零成本、零误报、完美定位,但对 wrong_toolunsupported_claim 的召回率结构性为 0 ——前者不违反任何参数或顺序规则,后者因规则不读取自然语言回复而无法检测。 - 最终回复的验证盲区unsupported_claim(在完美流程的末尾追加一句虚构承诺)是所有人的盲区。Step Judge的召回率仅 0.18
0.08, 0.30
,甚至低于Outcome Judge( 0.50 ),说明“拥有完整轨迹”不等于“会仔细审查最终回复”。 - 小模型基线陷阱:8B Step Judge实质上是“始终报故障”基线——标记了 397/400 条轨迹,误报率 1.00 ,若只看F1( 0.852 )会被误认为有效。 - 自一致性集成的负结果: k=3 的集成使成本确定性增至 3× ( 30.2 s vs 10.4 s),但所有质量指标与单遍贪婪解码的差异均落在Bootstrap噪声内;其投票份额置信度(仅可取 2/3 或 1 )导致校准更差(ECE增加 0.051 )。 ### 主要贡献与启示 - 测量方法论:提出并实践了按结果存活(outcome survival)分层汇报召回率的评估范式。论文主张,任何Agent评判者的召回率若未区分静默与显性故障,将掩盖其结构性盲区。 - 可完全复现的工件:发布环境、注入器、全部400条标注轨迹、2000条原始裁决及分析流水线。所有表格、图表与置信区间均可离线重建,无需再次调用模型。 - 部署建议: - 评估报告必须包含 Recall(silent) 、 Recall(loud)$ 与洁净误报率三项; - 最终回复的事实一致性应作为独立任务运行,不能假设轨迹Judge会覆盖; - 任何候选Judge须先与“总是报故障”基线对比,防止对高召回率的误读; - 在集成Judge之前,需验证其错误是否为随机噪声而非系统性遗漏。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Hadi Mohammadi

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00038.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00038

Published: 2026-09-03T01:26:26.583Z


3. GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments

Abstract:GUI world models are increasingly evaluated as one-step next-screen predictors, yet their intended use is often as multi-step environments for GUI agents. This mismatch leaves a key requirement under-tested: generated states must remain contextually consistent when they are repeatedly reused for future interaction. We introduce GUI-CC, a benchmark that evaluates contextual consistency of GUI world models as agent environments rather than isolated next-screen predictors. GUI-CC contains two complementary tracks: an offline reference-action track that rolls models along real mobile GUI trajectories, and an online agent-loop track that lets fixed probing agents interact with model-generated UIs. We construct 500 offline trajectory tasks from GUIOdyssey and 200 emulator-verified online tasks across 30 mobile apps. GUI-CC evaluates transition fidelity, transition plausibility, contextual consistency, and task progress. Experiments show that plausible single-step generation does not guarantee reliable environment simulation: current models often produce usable-looking screens while failing to preserve task-relevant context or support executable multi-step rollouts.

中文摘要

摘要:GUI 世界模型越来越多地被评估为一步的下一屏预测器,但它们的预期用途往往是作为 GUI 代理的多步环境。这种不匹配导致一个关键需求未被充分测试:生成的状态在被反复用于未来交互时必须保持上下文一致性。我们引入了 GUI-CC,一个评估 GUI 世界模型作为代理环境而非孤立的下一屏预测器的上下文一致性的基准。GUI-CC 包含两个互补的轨道:一个离线参考动作轨道,将模型沿实际移动 GUI 轨迹进行滚动;一个在线代理循环轨道,使固定测试代理与模型生成的 UI 进行交互。我们从 GUIOdyssey 构建了 500 个离线轨迹任务,并在 30 个移动应用中构建了 200 个经模拟器验证的在线任务。GUI-CC 评估转换保真度、转换合理性、上下文一致性和任务进度。实验表明,合理的一步生成并不能保证可靠的环境模拟:当前模型往往生成看起来可用的屏幕,但未能保持与任务相关的上下文或支持可执行的多步滚动操作。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00048 (HTTP 429)

Authors: Lin Fu, Zheyuan Yang, Tianhui Zhang, Jinbiao Wei, Guo Gan, Boxu Liu, Yilun Zhao, Yu Rong

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00048.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00048

Published: 2026-09-03T01:26:26.583Z


4. From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling

Abstract:Despite extensive alignment efforts, Large Language Models (LLMs) remain vulnerable to generating unsafe content under adversarial prompting, yet the internal mechanisms by which safety behaviors are implemented remain poorly understood. We study LLM safety from a mechanistic interpretability perspective and characterize a multi-stage safety circuit that organizes refusal behavior, consisting of (i) $\textbf{Harmful Detection Heads}$ that respond to harmful inputs, (ii) $\textbf{Safety Neurons}$ that mediate and stabilize safety signals in the residual stream, and (iii) $\textbf{Refusal Heads}$ that translate these signals into safe response generation. Using targeted attention-head and neuron-level interventions, we provide causal evidence consistent with this circuit organization, showing that suppressing upstream Harmful Detection Heads disrupts downstream refusal behavior and that safety neurons mediate this interaction. We validate that this decomposition recurs across multiple LLM architectures and adversarial attack settings, and use simple, architecture-preserving weight scaling as a mechanistic probe to test its functional relevance. Across six LLMs, circuit-guided scaling improves safety rates under attacks by 26.5%, while incurring only a 1.7% accuracy drop across four standard benchmarks. Overall, our results support a circuit-level interpretation of LLM safety and suggest that mechanistic abstractions can reveal stable and transferable patterns underlying aligned behavior.

中文摘要

摘要:尽管进行了广泛的对齐努力,大型语言模型(LLM)在面对对抗性提示时仍然容易生成不安全内容,但安全行为的内部实现机制仍然很少被理解。我们从机制可解释性视角研究LLM的安全性,并描述了一个多阶段的安全回路来组织拒绝行为,该回路包括:(i) $ extbf{有害检测头}$,对有害输入作出响应;(ii) $ extbf{安全神经元}$,在残差流中调节并稳定安全信号;以及 (iii) $ extbf{拒绝头}$,将这些信号转化为安全的响应生成。通过针对性的注意力头和神经元级干预,我们提供了与该回路组织一致的因果证据,表明抑制上游有害检测头会破坏下游的拒绝行为,而安全神经元调节这种交互。我们验证了这种分解在多种LLM架构和对抗攻击设置中都是重复出现的,并使用简单的、保持架构的权重缩放作为机制探针来测试其功能相关性。在六个LLM中,基于回路的缩放在攻击下将安全率提高了26.5%,而在四个标准基准测试中仅导致1.7%的准确率下降。总体而言,我们的结果支持从回路层面解释LLM的安全性,并表明机制抽象可以揭示稳定且可迁移的对齐行为模式。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00051 (HTTP 429)

Authors: Kuan-Lin Chu, Chung-En Sun, Tsui-Wei Weng

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00051.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00051

Published: 2026-09-03T01:26:26.583Z


5. Zero-Shot Respiratory Sound Classification through LLM-Augmented Audio-Text Alignment

Abstract:Self-supervised respiratory encoders lack semantic grounding in clinical domain needed for zero-shot inference, limiting their utility without task-specific labeled data. We propose a framework that aligns these encoders with medical terminology in a shared latent space turning them into a zero-shot-capable foundation model. To address paired data scarcity, we use a medical LLM to synthesize structured reports from metadata, creating dense semantic anchors for contrastive learning. Our training combines a sigmoid-based contrastive loss with encoder’s native SSL objective and similarity-aware negative sampling to sharpen pathological boundaries. Across 9 tasks on 6 datasets, our method achieves a 61.3% mean zero-shot AUC, surpassing CLAP (51.4%) and Qwen2-Audio (54.9%) while reaching the highest linear probing AUC (71.6%) with only 43% of data used by full-scale baselines, showing that structured semantic alignment outperforms large-scale, general-purpose models in clinical diagnostics.

中文摘要

摘要:自监督呼吸编码器缺乏临床领域所需的语义基础,无法进行零样本推理,这限制了它们在没有任务特定标注数据的情况下的实用性。我们提出一个框架,将这些编码器与医疗术语在共享的潜在空间中对齐,使其成为支持零样本能力的基础模型。为了解决配对数据稀缺的问题,我们使用医疗大语言模型(LLM)根据元数据生成结构化报告,为对比学习创建密集的语义锚点。我们的训练结合了基于 Sigmoid 的对比损失、编码器的原生自监督学习目标以及考虑相似性的负样本采样,以强化病理边界。在6个数据集的9个任务中,我们的方法实现了61.3%的平均零样本AUC,超过了CLAP(51.4%)和Qwen2-Audio(54.9%),同时以仅使用基线模型43%数据的情况下达到最高线性探测AUC(71.6%),显示结构化语义对齐在临床诊断中优于大规模通用模型。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00055 (HTTP 429)

Authors: Mustafa Talha İlerisoy, Hung Manh Pham, Mathias Funk, Mykola Pechenizkiy, Aaqib Saeed

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00055.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00055

Published: 2026-09-03T01:26:26.583Z


6. ValueGraph: Value-Signal Guided Graph Pre-training for Contextualized User Representation

Abstract:Value signals are aggregated user-level moral representations that capture users’ inferred value-related tendencies from their online discourse. User behavior on social media is shaped not only by what users say or whom they interact with, but also by the value signal through which they express attitudes. Existing user representation methods largely miss this value-relevant dimension. We propose ValueGraph, a graph pre-training framework that uses automatically inferred moral-value signals as noisy auxiliary signals for contextualized user representation. From post-reply graphs, ValueGraph learns semantic and structural representations and further aligns users through relative value similarity with contrastive and clustering objectives. Rather than treating inferred values as gold psychological labels, ValueGraph uses them as soft constraints for representation learning. Experiments on stance detection and twitter bot detection show consistent gains over strong text-based, graph-based, and text-only LLM baselines, highlighting value-signal guidance as a useful inductive bias for socially informed user modeling.

中文摘要

摘要:价值信号是汇总的用户层面道德表征,用于捕捉用户从其在线交流中推断出的与价值相关的倾向。社交媒体上的用户行为不仅受用户所说内容或互动对象的影响,还受用户通过价值信号表达态度的方式影响。现有的用户表征方法在很大程度上忽略了这一价值相关维度。我们提出了ValueGraph,一种图预训练框架,使用自动推断出的道德-价值信号作为上下文用户表征的噪声辅助信号。通过帖子-回复图,ValueGraph 学习语义和结构表征,并通过对比和聚类目标进一步通过相对价值相似性使用户对齐。ValueGraph 并不将推断出的价值视为心理学上的黄金标签,而是将其作为表示学习的软约束。在立场检测和推特机器人检测的实验中,ValueGraph 相比强大的基于文本、基于图以及仅文本的大语言模型基线均显示出稳定的提升,突出了价值信号引导作为社会化用户建模的有用归纳偏置。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00057 (HTTP 429)

Authors: Yitong Han, Wei Gao, Yi Zhao, Prasanta Bhattacharya, Fengzhu Zeng, Mohammad Amanlou

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00057.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00057

Published: 2026-09-03T01:26:26.583Z


7. CUDA-Harness: Harnessing Agentic CUDA Kernel Generation and Optimization from Natural Language

Abstract:Developing high-performance CUDA kernels demands specialized knowledge in algorithm implementation, correctness validation, and hardware-aware parallel optimization, creating a substantial expertise barrier and making generating CUDA kernels directly from natural language (Text2CUDA) essential. Meanwhile, the general-purpose code generation capability of Large Language Models (LLMs) prompts a series of works exploring LLM-based CUDA kernel generation. They mainly focus on transpilation from high-level frameworks such as PyTorch to CUDA (Torch2CUDA) rather than Text2CUDA, where models must understand the high-level input semantics and handle low-level kernel implementation and validation. Additionally, these methods are vulnerable to reward hacking due to reliance on predefined test inputs. In this paper, we propose CUDA-Harness, a framework for harnessing agentic CUDA kernel generation and optimization from natural language. Specifically, we introduce Intermediate-Structured Generation to connect high-level semantic understanding with low-level kernel generation. To dilute reward hacking in Text2CUDA, we construct Synthesis-Based Verification to provide isolated test data and progressive validation. Furthermore, we propose Feedback-Adaptive Evolution, a kernel evolution strategy that prioritizes correctness while optimizing performance. Finally, through extensive experiments, we demonstrate the effectiveness of CUDA-Harness, with further evaluations illustrating generalization across LLMs, hardware platforms, and to C-to-CUDA transpilation.

中文摘要

摘要:开发高性能 CUDA 内核需要在算法实现、正确性验证以及面向硬件的并行优化方面具备专业知识,这构成了显著的专业门槛,使得从自然语言直接生成 CUDA 内核(Text2CUDA)成为必要。同时,大型语言模型(LLMs)在通用代码生成上的能力推动了一系列基于 LLM 的 CUDA 内核生成研究。这些研究主要集中在从高层框架(如 PyTorch)到 CUDA 的转换(Torch2CUDA),而非 Text2CUDA,在后者中,模型必须理解高层输入语义并处理低层内核实现与验证。此外,由于依赖预定义测试输入,这些方法容易受到奖励操纵的影响。在本文中,我们提出了 CUDA-Harness,一个用于从自然语言驱动 CUDA 内核生成与优化的框架。具体而言,我们引入了中间结构化生成(Intermediate-Structured Generation),以连接高层语义理解与低层内核生成。为缓解 Text2CUDA 中的奖励操纵问题,我们构建了基于合成的验证(Synthesis-Based Verification),提供独立测试数据和渐进式验证。此外,我们提出了反馈自适应进化(Feedback-Adaptive Evolution),这是一种以正确性为优先,同时优化性能的内核进化策略。最后,通过大量实验,我们展示了 CUDA-Harness 的有效性,并进一步评估了其在不同 LLM、硬件平台及 C 到 CUDA 转换中的泛化能力。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*直接从自然语言生成并优化高性能 CUDA 内核(Text2CUDA)\*\*所面临的若干核心挑战,区别于现有主要关注从 PyTorch 等高级框架转译(Torch2CUDA)的工作。具体而言,论文试图解决以下关键问题: ### 1. Text2CUDA 中高级语义理解与低级内核实现之间的鸿沟 现有方法多集中于 Torch2CUDA,其输入是已明确算法细节和测试数据的高层级代码。相比之下,Text2CUDA 以自然语言为输入,这些描述往往\*\*不完整(incomplete)\*\*且\*\*未充分指定(underspecified)\*\*。这要求模型必须同时完成: - 对高层意图的深层语义理解与细节补全; - 底层的内核实现、内存管理、线程配置及硬件相关的并行优化。 这种双重负担使得直接生成正确且高效的自包含 CUDA 程序极为困难。 ### 2. 测试数据缺失与验证可靠性不足 Text2CUDA 任务没有现成的测试输入可供验证。现有基于智能体(agent-based)的方法往往依赖\*\*预定义的测试输入\*\*来构建反馈信号,这容易导致: - \*\*奖励黑客(reward hacking)\*\*:模型可能针对特定测试输入过拟合,生成在预设数据上通过但在一般情况下错误的内核; - \*\*无法验证正确性\*\*:缺乏与算法意图一致的可信测试数据,使得迭代优化缺乏可靠的正确性信号。 ### 3. 性能优化过程中的正确性保持困境 在基于反馈的内核进化过程中,智能体倾向于在正确性尚未完全保证时就引入激进的优化策略。一旦初始实现存在功能性缺陷,后续的迭代优化往往会\*\*在错误的基础上累积错误\*\*,导致最终内核看似高性能实则功能不正确,且难以修复。 ### 4. 对昂贵训练数据的依赖 基于训练的方法(如 SFT 或 RL)需要大量高质量的内核实现与优化轨迹作为训练数据,这类数据在实践中稀缺且获取成本高昂,限制了其可扩展性。 为应对上述问题,论文提出了 \*\*CUDA-Harness\*\* 框架,通过\*\*中间结构化生成(Intermediate-Structured Generation)\*\*、\*\*基于合成的验证(Synthesis-Based Verification)\*\*与\*\*反馈自适应进化(Feedback-Adaptive Evolution)\*\*三个核心组件,系统性桥接自然语言意图与高性能 CUDA 内核实现之间的断层。 Q2: 有哪些相关研究? 根据论文第2节及相关内容,与本文相关的研究工作主要围绕 \*\*LLM 驱动的 CUDA 内核生成\*\* 展开,可归纳为以下几类: ### 1. 基于训练(Training-based)的方法 这类方法通过后训练(监督微调或强化学习)提升模型生成高性能 CUDA 内核的能力,但通常依赖稀缺且昂贵的高质量内核实现与优化轨迹数据。 - \*\*CUDA-L1\*\* (Li et al., 2025):提出对比式强化学习,以加速比(speedup)作为奖励信号优化生成质量。 - \*\*ConCuR\*\* (Kong et al., 2025):生成并筛选高质量内核及其简洁推理轨迹,用于监督微调。 - \*\*QiMeng-Kernel\*\* (Zhu et al., 2026b):利用强化学习使轻量级大语言模型提供高效的 CUDA 优化策略。 - \*\*CUDA-Agent\*\* (Dai et al., 2026):通过大规模数据合成与基于智能体的强化学习增强模型能力。 - \*\*KernelSmith\*\* (Du et al., 2026):将进化轨迹作为后训练信号,优化模型使其成为局部改进器。 ### 2. 基于智能体(Agent-based)的方法 这类方法在测试时通过多智能体协作与迭代细化实现无需训练的 CUDA 内核生成与优化,但大多依赖预定义测试输入进行验证,容易受到奖励黑客(reward hacking)影响。 - \*\*cuPilot\*\* (Chen et al., 2025a):利用屋顶线模型(roofline)引导的多智能体框架进行内核优化。 - \*\*STARK\*\* (Dong et al., 2025):将 CUDA 专家工程经验抽象为协作智能体,以探索内核设计空间。 - \*\*ReGraphT\*\* (Gong et al., 2025):将历史 CUDA 优化轨迹组织为图结构,实现高效搜索。 - \*\*CudaForge\*\* (Zhang et al., 2025):采用双智能体循环,结合性能分析工具迭代细化生成内核。 ### 3. Text2CUDA 的专门研究 现有工作多聚焦于 Torch2CUDA(从 PyTorch 转译),而直接面向自然语言生成 CUDA(Text2CUDA)的研究相对较少。 - \*\*CUDA-LLM\*\* (Chen et al., 2025b):提出一个基于智能体的框架,在验证机制下迭代改进内核实现。 - \*\*CUDABench\*\* (Zhu et al., 2026a):构建跨多个领域的评测基准,用于系统评估大语言模型的 Text2CUDA 能力。 ### 4. 本文借鉴或回应的基础技术 - \*\*通用代码生成\*\*:大语言模型在通用代码生成方面展现出的能力 (Zheng et al., 2025)。 - \*\*自我反思与优化\*\*:Self-refine (Madaan et al., 2023)、ReAct 范式 (Yao et al., 2022)。 - \*\*奖励黑客问题\*\*:LLM 中奖励篡改与谄媚行为的研究 (Denison et al., 2024)。 - \*\*可验证奖励的强化学习\*\*:RLVR (Lambert et al., 2024),用于基于可信信号驱动优化。 - \*\*模型上下文协议\*\*:MCP (Anthropic, 2024),本文用于构建硬件可扩展的验证工具包。 Q3: 论文如何解决这个问题? 论文提出 \*\*CUDA-Harness\*\* 框架,通过三个协同设计的核心组件系统性解决 Text2CUDA 中的语义鸿沟、验证缺失与优化失稳问题。具体解决路径如下: ### 1. Intermediate-Structured Generation:弥合高层意图与底层实现的断层 为应对自然语言输入\*\*不完整、未充分指定\*\*且与底层 CUDA 实现差距过大的挑战,该组件引入了两层中间蓝图,将语义理解与代码实现解耦。 - \*\*Kernel Implementation Manifest(内核实现清单)\*\* 要求智能体在生成具体代码之前,先输出一份结构化的、按内核划分的规格说明。每个条目独立记录内核名称、输入输出描述、功能描述(揭示算法细节)、语言无关的参考代码片段,以及详细的测试信息(形状与数据类型)。此举迫使智能体先专注于\*\*补全缺失语义\*\*与\*\*规划实现\*\*,而非立即陷入底层编码。 - \*\*Self-Contained CUDA Scaffold(自包含 CUDA 脚手架)\*\* 提供一个代码模板,将自包含 CUDA 程序拆分为固定部分(头文件、二进制读写辅助函数、\`main\` 函数骨架)与可变部分(内核与启动器)。特别地,框架将内存管理、数据传输与启动配置聚合到独立的 \*\*launcher\*\* 函数中,使智能体只需关注内核逻辑与启动配置。为避免隐式内存访问模式与显式启动配置冲突导致的错误,脚手架允许智能体在生成 launcher 后\*\*回溯修正\*\*已生成的内核。此外,脚手架禁止在代码中使用虚拟输入,测试数据路径通过命令行参数传入,并在编译时通过 \`#pragma message\` 暴露调用约定,从而在源头削弱针对测试数据的过拟合。 ### 2. Synthesis-Based Verification:提供可信的隔离验证信号 针对 Text2CUDA 中\*\*测试数据不可用\*\*以及\*\*奖励黑客\*\*风险,该组件通过数据合成与多阶段验证建立可信反馈。 - \*\*解耦的测试数据合成(Decoupled Test Data Synthesis)\*\* 测试输入与参考输出在\*\*完全隔离的环境\*\*中通过标准数值库(如 NumPy、PyTorch)生成,确保数据合成与内核生成的上下文互不污染,防止智能体自适应地调整测试输入与参考输出以迎合错误内核。 - \*\*宽数值范围要求\*\* 为防止测试输入集中在小数值区域导致验证阈值 ε_(atol) + ε_(rtol)|y| 过于宽松(从而放过数值错误的内核),框架要求测试输入覆盖较广的数值范围(例如均值 5.0、标准差 10.0 的高斯分布)。此举以牺牲部分假阴性(可能拒绝少量受浮点累积误差影响的正确内核)为代价,显著降低假阳性(接受错误内核),为后续优化提供可靠的正确性信号。 - \*\*渐进式多阶段验证(Progressive Multi-Stage Validation)\*\* 验证遵循\*\*快速失败(fail-fast)\*\*顺序: 1. \*\*编译检查\*\*: C(K; φ) = IK compiles under φ 2. \*\*功能正确性验证\*\*: V(K, x, y) = I |K(x) - y| ≤ ε_(atol) + ε_(rtol)|y| 3. \*\*运行时性能分析\*\*: P_(latency)(K, x) = 1 / Latency(K, x) 仅当内核通过前一阶段后才进入下一阶段,避免在已编译失败或功能错误的内核上浪费硬件资源。基于 Model Context Protocol (MCP) 的验证工具包提供统一接口,使验证逻辑可在不同硬件环境中无缝部署。 ### 3. Feedback-Adaptive Evolution:在优先保证正确性的前提下驱动性能优化 为避免优化过程中\*\*在错误基础上累积错误\*\*,该组件将正确性作为优化的先决条件,并通过可验证奖励驱动迭代。 - \*\*Correctness-First Refinement(正确性优先的细化)\*\* 根据失败阶段采取不同策略: - 若\*\*编译失败\*\*,智能体依据编译器报错进行定向修复; - 若\*\*功能验证失败\*\*,智能体被强制\*\*回退到更保守的实现\*\*,以牺牲短期性能为代价换取正确性,确保后续优化拥有一个可信的基线。 - \*\*Reward-Driven Optimization(基于奖励的优化)\*\* 在正确性基线确立后,利用 \*\*Reinforcement Learning with Verifiable Reward (RLVR)\*\* 进行测试时进化。奖励函数定义为:

r(K) = -1 + C(K) + C(K)V(K)P(K)
具体而言,编译失败时获得惩罚( -1 );仅当编译且功能均通过时,性能 P(K) 才决定最终奖励。优化目标为最大化每轮迭代中生成内核的奖励增量:
J(Ei) = max(E{Ki+1,j)(j=1)^G sim M(·|Ki, E(1:i))} [Delta r_(i,j)]

  • **Optimization Insight Summarization(优化经验总结)** 由于测试时优化不存在可更新参数,智能体通过分析优化前后内核的差异( Diff(K(post), K(pre)) )与奖励变化( r(K(post)) - r(K(pre)) ),显式提炼出优化经验 e (如何种策略有效或无效)。这些经验 E(1:i) 在后续轮次中作为上下文指导生成,形成持续改进的进化闭环。 ### 总结 通过上述设计,CUDA-Harness 将 Text2CUDA 拆解为**语义补全→清单化规划→隔离验证→正确性优先进化**的管线,系统性解决了自然语言到高性能 CUDA 内核映射过程中的语义鸿沟、数据缺失、奖励黑客与错误累积问题。 Q4: 论文做了哪些实验? 论文在第5节中展开了系统的实验评估,涵盖主实验、消融研究、验证机制分析及跨维度泛化测试,具体如下: ## 1. 实验设置 - **评测基准**:CUDABench(Zhu et al., 2026a),包含三个难度级别(Level 1/2/3),提示信息逐级递减。 - **基础模型**:默认使用 Seed2.0 Lite(doubao-seed-2-0-lite-260215),thinking mode 关闭,以隔离框架效应与模型差异。 - **硬件平台**:主实验在 NVIDIA A40(Ampere 架构,sm_80)上进行。 - **CUDA-Harness 配置**:采用 ReAct 范式;优化轮数 N=3 ,每轮生成内核数 G=3 ;性能工具使用 Nsight Systems,以平均延迟计算 P(·)=P(latency)(·) 。 - **评价指标**: - **Comp.**:编译成功率 - **Func.**:功能正确率 - **RScore**:运行时性能得分,定义为 1/execution time (ms) ,未通过正确性验证者得 0 分 ## 2. 主实验结果 ### 2.1 与基线方法对比 将 CUDA-Harness 与以下方法对比: - **Baseline**:CUDABench 官方评测流程 - **通用框架**:OpenCode(anomalyco, 2026)、Codex(openai, 2026) - **Torch2CUDA 系统**:KernelSkill(Sun et al., 2026)、CudaForge(Zhang et al., 2025) 实验结果表明,CUDA-Harness 在全部难度级别上的编译成功率、功能正确率及 RScore 均显著优于基线。随着提示信息减少(Level 1 to Level 3),基线性能下降明显,而 CUDA-Harness 依然保持竞争力,验证了 Intermediate-Structured Generation 对补全未指定语义的有效性。 ### 2.2 消融实验 通过逐步启用组件验证各模块贡献: | 方法 | 说明 | |———|———| | **CUDA-ISG** | 仅保留 Intermediate-Structured Generation | | **CUDA-Harness\*** | 保留 ISG + Synthesis-Based Verification + Reward-Driven Optimization,但移除 Correctness-First Refinement | | **CUDA-Harness** | 完整框架 | 结果分析: - CUDA-ISG 已优于 Baseline,证明中间蓝图结构的必要性。 - CUDA-Harness\* 相比 CUDA-ISG 在编译修复与性能提升上表现更好,说明 Reward-Driven Optimization 有效。 - 完整 CUDA-Harness 的功能正确率显著高于 CUDA-Harness\*,证明 **Correctness-First Refinement 是防止优化过程中错误累积的关键**。 ### 2.3 Synthesis-Based Verification 的有效性验证 由于测试时无法使用基准数据,需验证合成数据能否提供可信的正确性信号: | | 基准验证通过 | 基准验证失败 | |—|——————|——————| | **合成验证通过** | 73.6% | 8.7%(假阳性) | | **合成验证失败** | 6.9%(假阴性) | 10.8% | 以基准验证为参照,合成验证的准确率为 **84.4%**,精确率 **89.4%**,召回率 **91.4%**。进一步的人工分析表明,假阳性主要来源于: - 提示误解(38.1%) - 遗漏基准特定的后处理步骤(30.5%) - CUDABench 模板中数据类型加载缺陷(31.4%) ## 3. 泛化分析 ### 3.1 跨大语言模型泛化(Cross-LLMs) 在固定硬件(A40)上,将基础模型替换为: - DeepSeek-V3.2(Liu et al., 2025) - GLM-5.1(Zeng et al., 2026) CUDA-Harness 在三个模型上均稳定优于对应 Baseline,证明其设计具有 **LLM 无关性**。 ### 3.2 跨硬件平台泛化(Cross-Hardware) 使用 Seed2.0 Lite,在以下三种不同架构与计算能力的 GPU 上测试: - NVIDIA A40 - NVIDIA GeForce GTX 1660 SUPER - NVIDIA Jetson AGX Orin 尽管不同平台的软件版本与计算能力导致绝对性能得分差异,CUDA-Harness 在编译与功能正确率上保持稳定,且在各平台上均优于 Baseline,说明框架 **不依赖于特定硬件环境**。 ### 3.3 C-to-CUDA 转译泛化 将输入从自然语言替换为 C 代码,在 **BabelTower**(Wen et al., 2022; Ke et al., 2025)上评估。此时 CUDA-Harness 的进化预算缩减为 N=1, G=1 。 | 方法 | Comp. | Func. | Score | |———|———-|———-|———-| | Baseline | 94.8 | 90.1 | 451.6 | | CUDA-Harness | 98.7 | 97.1 | 514.8 | 即使在较小进化预算下,CUDA-Harness 仍显著优于基线,表明 Intermediate-Structured Generation 不局限于自然语言输入,能够 **有效推广至 C-to-CUDA 转译场景**。 Q5: 有什么可以进一步探索的点? 基于论文所呈现的框架与实验结果,以下方向值得进一步探索: ### 1. 更强形式化保证的验证机制 论文中的 Synthesis-Based Verification 仍依赖数值容忍度验证,存在 8.7% 的假阳性。未来可探索: - **符号执行与 SMT 求解器**:针对内核逻辑引入轻量级形式化方法,以在特定数据范围内证明功能等价性,而非仅依赖采样测试。 - **浮点精度可证明优化**:对于科学计算等精度敏感场景,结合区间算术或误差传播分析,确保优化后的内核在浮点语义下仍满足精度合约。 ### 2. 更细粒度的正确性-性能权衡策略 当前 Correctness-First Refinement 在功能验证失败时采取**回退到保守实现**的策略,可能丢弃部分有价值的优化尝试。未来可研究: - **细粒度错误定位与手术式修复**:利用程序分析或差异调试(delta debugging)定位导致功能失效的具体优化变换,仅回退或修正相关代码区域,而非整体重构。 - **错误恢复的历史利用**:建立“错误模式-修复策略”的记忆库,使智能体在后续进化中主动规避已知的错误优化路径。 ### 3. 面向多内核与复杂流水线的设计空间扩展 论文主要以单内核生成为基本单元。实际高性能计算负载通常涉及**多内核协同**与复杂数据流。未来可扩展: - **内核图(Kernel Graph)级别的中间表示**:将 Intermediate-Structured Generation 从单内核清单扩展为表征多内核依赖、数据排布与流水线并发的计算图。 - **全局内存与通信优化**:在 manifest 中显式建模跨内核的内存复用、流水线隐藏延迟及集体通信模式(如 MPI/NCCL 协同)。 ### 4. 与训练范式的协同:从 Test-Time 到 Train-Time 的数据飞轮 CUDA-Harness 作为无训练(training-free)框架,在测试时产生了大量高质量的优化轨迹。这些轨迹可作为**自动数据合成**的来源: - **蒸馏为 SFT/RL 数据集**:将成功的进化路径(包括失败的尝试与对应的修复)整理为带有推理过程的训练数据,用于提升基础模型的先验能力,减少对测试时迭代的依赖。 - **课程学习(Curriculum Learning)**:根据进化难度对合成数据进行分级,训练更擅长初始猜测与快速收敛的专用模型。 ### 5. 跨架构与异构硬件的深度自适应 虽然论文验证了跨 GPU 世代的泛化性,但不同架构(如 Ampere、Hopper、Blackwell 乃至 AMD ROCm)的指令集、内存层次与 Tensor Core 特性差异显著。未来可探索: - **硬件描述感知的生成**:在 manifest 中引入目标硬件的微架构参数(如共享内存容量、warp 调度策略),使生成过程具备**原生架构感知**能力。 - **自适应搜索空间剪枝**:针对不同硬件特性,动态调整优化原语(如是否启用异步拷贝 TMA、warp-specialized 内核)的候选集合。 ### 6. 多模态与交互式 Text2CUDA 当前输入以纯文本自然语言为主。对于算法描述,多模态信息往往更精确: - **伪代码、流程图与数学公式的融合理解**:扩展 Intermediate-Structured Generation,使其能从 LaTeX 公式、计算图或手绘草图中提取语义并填入 manifest。 - **人在回路中的协同编辑(Human-in-the-Loop)**:允许用户在 manifest 阶段介入修正对意图的理解,或在验证阶段提供额外的领域约束(如内存上限、数值稳定性要求),形成双向交互式生成。 ### 7. 动态与自适应内核生成 现有框架针对静态输入规模进行优化,但实际应用常面临**动态形状(dynamic shapes)**与运行时变化的负载特征: - **元内核(Meta-Kernel)与 JIT 编译策略**:生成参数化内核模板,在运行时根据实际输入维度自动选择最优的启动配置与分块策略。 - **在线进化(Online Evolution)**:部署后持续收集性能遥测,在运行时不中断服务地微调内核实现,以适配输入分布的漂移。 ### 8. 基准测试与评估体系的完善 - **更大规模与工业级负载**:在 CUTLASS、FlashAttention 级别的复杂算子上评估框架极限,考察长上下文、大规模内核的可扩展性。 - **能耗与编译延迟指标**:除执行时间外,将 GPU 能耗(Joules/op)与编译-优化总耗时纳入评估,以反映实际部署成本。 Q6: 总结一下论文的主要内容 这篇论文针对**从自然语言直接生成并优化高性能 CUDA 内核(Text2CUDA)**的核心挑战,提出了 **CUDA-Harness** 框架,实现了无需大量训练数据、具备可信验证与正确性优先进化的智能体内核生成管线。以下是主要内容的系统总结: —- ### 1. 研究背景与核心挑战 - **Text2CUDA 的必要性**:CUDA 内核开发需要算法实现、正确性验证与硬件感知优化的复合专家知识,门槛极高。将自然语言直接翻译为正确且高效的 CUDA 内核,能够显著降低 GPU 编程门槛。 - **与 Torch2CUDA 的本质区别**:现有工作多从已明确算法细节和测试输入的 PyTorch 代码转译;而 Text2CUDA 从**未充分指定(underspecified)**的自然语言出发,模型必须同时完成高层语义补全与底层内核实现,且**缺乏现成测试数据**。 - **现有方法局限**: - 基于训练的方法依赖稀缺且昂贵的高质量内核实现与优化轨迹; - 基于智能体的方法依赖预定义测试输入,易引发 **reward hacking**(针对固定输入过拟合); - 迭代优化中常在错误内核上累积性能优化,导致最终输出看似高效实则功能失效。 —- ### 2. CUDA-Harness 框架 为系统性解决上述问题,论文提出包含三个协同组件的框架: #### (1)Intermediate-Structured Generation:桥接语义鸿沟 通过两层中间蓝图将“理解意图”与“编写代码”解耦: - **Kernel Implementation Manifest**:在写代码之前,先输出结构化的内核实现清单。每个条目包含内核名称、输入输出规格、功能描述、语言无关参考代码及测试信息,迫使智能体先**补全缺失语义**与**规划实现**,再进入底层编码。 - **Self-Contained CUDA Scaffold**:提供自包含 CUDA 程序模板,将内存管理、数据传输与启动配置封装为独立的 **launcher** 函数,使智能体专注内核逻辑。脚手架禁止嵌入虚拟输入,测试数据路径通过命令行参数传入,并在编译时通过 `#pragma message` 暴露调用约定,从而**在源头削弱对测试数据的过拟合**。 #### (2)Synthesis-Based Verification:构建可信验证信号 针对 Text2CUDA 中测试数据缺失与 reward hacking 风险: - **解耦测试数据合成**:测试输入与参考输出在**完全隔离的环境**中通过 NumPy/PyTorch 等标准库生成,确保数据合成与内核生成无上下文交叉污染。 - **宽数值范围要求**:强制测试输入覆盖较广数值范围(如均值 5.0、标准差 10.0 的高斯分布),避免小数值导致验证阈值 ε(atol) + ε(rtol)|y| 过松而放过错误内核。 - **渐进式多阶段验证**:遵循**快速失败(fail-fast)**顺序:

C(K;φ) arrow V(K,x,y) arrow P(K,x)
即先验证编译、再验证功能正确性、最后分析性能。基于 Model Context Protocol (MCP) 的验证工具包支持硬件可扩展部署。 #### (3)Feedback-Adaptive Evolution:正确性优先的内核进化 将性能优化建立在可靠的正确性基线之上: - **Correctness-First Refinement**:若编译失败,依据编译器报错定向修复;若功能验证失败,则**强制回退到更保守的实现**,确保后续优化从一个功能正确的基线出发,避免错误累积。 - **Reward-Driven Optimization**:采用 Reinforcement Learning with Verifiable Reward (RLVR),奖励函数定义为:

r(K) = -1 + C(K) + C(K)V(K)P(K)
编译失败受惩罚;仅当编译与功能均通过时,性能 P(K) 才决定奖励高低。 - **Optimization Insight Summarization**:在测试时无参数可更新的约束下,智能体通过分析优化前后实现差异与奖励变化,显式提炼优化经验 e ,并在后续轮次中复用,形成持续改进的进化闭环。 —- ### 3. 实验与评估 论文在 **CUDABench**(含 Level 1/2/3 三级难度)上开展系统评估,主要发现如下: - **主实验**:CUDA-Harness 在编译成功率、功能正确率及运行时性能得分(RScore)上**全面超越**官方 Baseline 以及 OpenCode、Codex、KernelSkill、CudaForge 等方法,且在提示信息最稀缺的 Level 3 上优势最为显著。 - **消融实验**: - 仅保留 Intermediate-Structured Generation(CUDA-ISG)已优于 Baseline; - 加入验证与奖励驱动优化(CUDA-Harness\*)后编译修复与性能进一步提升; - 完整加入 Correctness-First Refinement 后功能正确率显著提高,证实该机制对维持正确性的关键作用。 - **验证一致性**:合成验证与基准验证的一致性达 **84.4%**(精确率 89.4%,召回率 91.4%),证明其能为测试时进化提供可信信号。 - **泛化性**: - **跨 LLM**:在 Seed2.0 Lite、DeepSeek-V3.2、GLM-5.1 上均一致有效,体现 LLM 无关设计; - **跨硬件**:在 NVIDIA A40、GTX 1660 SUPER 及 Jetson AGX Orin 上均保持高编译/正确率,且持续优于 Baseline; - **C-to-CUDA**:在 BabelTower 转译任务上,即使缩减进化预算( N=1, G=1 ),仍显著优于基线。 —- ### 4. 核心贡献 - 提出 **Intermediate-Structured Generation**,通过中间清单与脚手架桥接高层自然语言意图与底层 CUDA 实现。 - 提出 **Synthesis-Based Verification**,以隔离数据合成与渐进多阶段验证稀释 reward hacking,提供可信的正确性信号。 - 提出 **Feedback-Adaptive Evolution**,通过正确性优先细化与可验证奖励驱动,实现测试时内核的安全进化。 - 通过大规模实验验证框架有效性,并展示其在**不同大语言模型、不同硬件平台及 C-to-CUDA 转译任务**上的广泛泛化能力。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Qi Fan, An Zou, Yehan Ma

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00058.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00058

Published: 2026-09-03T01:26:26.583Z


8. RePro: Proof-Verified Benchmark Rewriting for Reliable Evaluation of LLM Mathematical Problem Solving

Abstract:Data contamination undermines the reliable evaluation of large language models (LLMs) on mathematical problem solving. While rewriting-based evaluation mitigates memorization, existing methods lack guarantees of problem validity and answer correctness. We propose Proof-Verified Benchmark Rewriting (RePro), the first framework to integrate Lean-oriented neural automated theorem provers (ATPs) into benchmark rewriting, which rewrites problems and regenerates answers with correctness ensured by Lean-verified proofs. Experiments on GSM8K and MATH show that RePro’s retained rewritten instances achieve 100% well-definedness, feasibility, and answer correctness, while existing methods still produce invalid or incorrect instances. Moreover, several models exhibit accuracy drops on proof-verified rewritten benchmarks, suggesting that their performance is sensitive to surface-level and structural variations and may partly reflect memorization effects. Our source code and data are available at this https URL.

中文摘要

摘要:数据污染破坏了对大型语言模型(LLMs)在数学问题解决方面进行可靠评估的能力。虽然基于重写的评估可以减轻记忆效应,但现有方法缺乏问题有效性和答案正确性的保证。我们提出了Proof-Verified Benchmark Rewriting(RePro),这是第一个将面向Lean的神经自动定理证明器(ATP)整合到基准重写中的框架,该框架通过Lean验证的证明保证问题重写和答案再生成的正确性。在GSM8K和MATH上的实验表明,RePro保留的重写实例在定义明确性、可行性和答案正确性上均达到100%,而现有方法仍会产生无效或错误的实例。此外,一些模型在经过证明验证的重写基准上表现出准确率下降,表明其性能对表面和结构变化敏感,并可能部分反映记忆效应。我们的源代码和数据可在此 https URL 获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00062 (HTTP 429)

Authors: Xiyuan Zhou, Zhuoqi Li, Xinlei Wang, Yirui He, Yuhao Wu, Yuheng Cheng, Yan Xu, Junhua Zhao, Jinjin Gu

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00062.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00062

Published: 2026-09-03T01:26:26.583Z


9. Medical Causal Hypothesis Verification with Large Language Models

Abstract:The growing use of large language models (LLMs) for search and information retrieval underscores the need to evaluate their reliability in high-stakes domains such as healthcare. Although LLMs can effectively answer questions about diseases, symptoms, and treatments, their ability to accurately assess causal relationships and ground their conclusions in verified scientific evidence remains unclear. Here, we present a preliminary, small-scale study that investigates the accuracy of LLMs in evaluating causal medical claims and supporting them with peer-reviewed research. We propose an evaluation framework for causal hypothesis verification that can be used to systematically track the performance of existing and future LLMs. We assess the performance of eight LLMs on 17 medical causal hypotheses to evaluate whether they can reliably verify these hypotheses using scientific evidence from the literature. We systematically annotate the scientific evidence they provide according to six criteria (a total of 1,067 annotation points) and assess them with nine evaluation metrics. Our analysis shows that while LLMs exhibit strong recall, they often perform poorly at providing valid scientific articles and evidence for support and at rejecting unsupported hypotheses. These findings highlight a critical limitation of current LLMs, as they cannot yet be trusted fully to verify causal relationships from the biomedical literature. This work underscores the need for rigorous evaluation before using LLMs for search and retrieval in healthcare settings.

中文摘要

摘要:大型语言模型(LLMs)在搜索和信息检索中的日益广泛使用凸显了在高风险领域(如医疗保健)评估其可靠性的必要性。尽管 LLMs 能有效回答关于疾病、症状和治疗的问题,但它们准确评估因果关系并将结论建立在经过验证的科学证据上的能力仍不明确。在此,我们提出了一项初步的小规模研究,调查 LLMs 在评估因果医学主张并用同行评审研究支持这些主张方面的准确性。我们提出了一个因果假设验证的评估框架,可用于系统跟踪现有和未来 LLMs 的性能。我们评估了八个 LLMs 对 17 个医学因果假设的表现,以评估它们是否能够可靠地使用文献中的科学证据验证这些假设。我们根据六个标准系统地标注它们提供的科学证据(共 1,067 个标注点),并用九个评估指标进行评估。我们的分析显示,尽管 LLMs 展现出较强的召回能力,但它们在提供有效的科学文章和支持证据以及拒绝无支持假设方面往往表现不佳。这些发现突显了当前 LLMs 的一项关键局限:它们尚不能完全被信赖以从生物医学文献中验证因果关系。这项工作强调了在医疗保健环境中使用 LLMs 进行搜索和检索前进行严格评估的必要性。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00063 (HTTP 429)

Authors: Safiyyah Ahmed, Abrar Ansari, Md Aminul Islam, Elena Zheleva

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00063.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00063

Published: 2026-09-03T01:26:26.583Z


10. Scientific Agent Skills: A Library of Procedural Knowledge for Research Agents

Abstract:A language-model agent asked to analyse an experiment will usually return working code. Whether the analysis is defensible is a different question. A defensible analysis depends on procedural choices: which test the field accepts, which identifier namespace is authoritative, and which caveats must accompany a result. We present Scientific Agent Skills, an open library of 163 such procedures in 16 areas of practice, including genomics, cheminformatics, medical imaging, study design and scientific communication. Each skill is a directory built around a versioned, human-readable instruction file. An agent loads the file only when a task calls for it; the directory often also contains reference material and runnable scripts. We report no task-level evaluation and no host selection rate. Openly licensed and available at this https URL.

中文摘要

摘要:一个语言模型代理在被要求分析实验时通常会返回可运行的代码。分析是否站得住脚是另一个问题。站得住脚的分析依赖于程序选择:该领域接受哪些测试、哪个标识符命名空间是权威的,以及结果必须附带哪些注意事项。我们提出了科学代理技能(Scientific Agent Skills),这是一个开放的库,包含16个实践领域中的163个此类程序,包括基因组学、化学信息学、医学影像、研究设计和科学交流。每个技能都是围绕一个版本化、可读的指令文件构建的目录。代理仅在任务需要时加载此文件;目录中通常还包含参考资料和可运行的脚本。我们没有进行任务级评估,也没有提供主机选择率。该资源采用开放许可,可通过此 https URL 获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00065 (HTTP 429)

Authors: Timothy Kassis, Vinayak Agarwal, Yuhuan He, Darshil Patel, Aubrey M. Brueckner

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.00065.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00065

Published: 2026-09-03T01:26:26.583Z


Agent Domain Papers

1. HyperWorld: Hypergraph-Structured State Serialization Improves Learned Textual World Models

Abstract:World models enable language-model agents to predict environment dynamics and plan before acting. In text environments, the model must learn symbolic action effects from serialized state descriptions, but the role of serialization structure remains underexplored. We present HyperWorld, a controlled study of state serialization for learned textual world models. We compare raw observations with three symbolic serializations of the same ground-truth state: independent sentences, pairwise triples, and entity-centered hyperedge units that group multiple related facts around entities and relations. All variants use the same training objective: given a state and an action, predict symbolic effects or judge the action infeasible. Across model scales, data budgets, and in-distribution and out-of-distribution test worlds, hyperedge serialization gives the clearest gains for 0.5B—1.5B models and under distribution shift. Larger models reduce the gap, and pairwise triples can match or slightly exceed hyperedges on in-distribution exact match, but hyperedges achieve the strongest out-of-distribution fact F1 and the best small-to-medium scale trade-off between feasibility detection and effect prediction. In downstream greedy planning, the hyperedge world model also attains the highest success rate among the tested representations. These results show that higher-order state organization is a simple but effective inductive bias for learned symbolic world models, especially when model capacity is limited or test environments differ from training.

中文摘要

摘要:世界模型使语言模型代理能够预测环境动态并在行动前进行规划。在文本环境中,模型必须从序列化状态描述中学习符号动作效果,但序列化结构的作用仍未充分研究。我们提出了 HyperWorld,这是一个关于学习型文本世界模型的状态序列化的受控研究。我们将原始观测与同一真实状态的三种符号序列化方法进行比较:独立句子、成对三元组以及围绕实体和关系将多个相关事实分组的以实体为中心的超边单元。所有变体使用相同的训练目标:给定一个状态和动作,预测符号效果或判断该动作不可行。在模型规模、数据预算以及分布内和分布外的测试世界中,超边序列化在 0.5B-1.5B 模型以及分布变化下带来了最明显的提升。更大规模的模型缩小了差距,成对三元组在分布内精确匹配上可以匹配或略微超越超边,但超边在分布外事实 F1 上表现最强,并且在可行性检测与效果预测之间实现了最佳的小型至中型规模权衡。在下游贪心规划中,超边世界模型在测试的表示中也达到了最高的成功率。这些结果表明,更高阶的状态组织是学习符号世界模型的一个简单但有效的归纳偏置,尤其是在模型容量有限或测试环境与训练环境不同的情况下。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00002 (HTTP 429)

Authors: Yun-Jian Zhang, Chen-Wei Liang, Tian-Yi Zhang, Jian Ding, Yi-Lun Wu, Ao-Bo Li, Wei-Cong Su, Saifullah, Hong-Yu An, Mu-Jiang-Shan Wang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00002.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00002

Published: 2026-09-03T01:26:49.045Z


Abstract:Machine unlearning studies the removal of knowledge from an AI model, making the system forget a concept it previously learned. Despite rapid progress in generative machine unlearning, the unintended degradation of semantically related concepts that should have been retained (henceforth, interference) remains poorly characterized and inconsistently evaluated. This paper introduces I-CARE, a methodology that formalizes interference as a first-class object of study in generative unlearning. Rather than proposing a new benchmark or unlearning algorithm, I-CARE provides formal definitions for tasks, metrics, and templates for reporting results, enabling the systematic and reproducible study of interference across unlearning settings. While our methodology is designed to remain valid as models and unlearning algorithms evolve, decoupling long-term scientific insight from transient empirical results, we present a feasibility demonstration with state-of-the-art algorithms and frequently used datasets. The results demonstrate that I-CARE enables meaningful analysis of interference patterns across multiple unlearning settings, establishing the practical applicability of the framework. The software implementation of the methodology is provided in an open-source framework, together with a web-based graphical interface that enables exploration of the outcomes of this study without requiring direct interaction with the codebase or specialized data analysis tools.

中文摘要

摘要:机器遗忘研究从人工智能模型中移除知识,使系统忘记其先前学到的某个概念。尽管生成式机器遗忘取得了快速进展,但对本应保留的语义相关概念的意外退化(以下简称干扰)仍缺乏明确的描述,并且评估不一致。本文介绍了 I-CARE,一种将干扰形式化为生成性遗忘研究中一级对象的方法。I-CARE 并非提出新的基准或遗忘算法,而是为任务、指标和结果报告模板提供了形式化定义,从而能够在各种遗忘设置中系统、可重复地研究干扰模式。虽然我们的方法设计旨在随着模型和遗忘算法的发展保持有效,将长期科学洞见与短期经验结果分离,但我们展示了使用最先进算法和常用数据集的可行性演示。结果表明,I-CARE 能够对多种遗忘设置下的干扰模式进行有意义的分析,证实了框架的实际可应用性。该方法的软件实现提供在开源框架中,同时提供基于网页的图形界面,使得无需直接与代码库或专门的数据分析工具交互即可探索本研究的结果。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00003 (HTTP 429)

Authors: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00003.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00003

Published: 2026-09-03T01:26:49.045Z


3. Discrete-Time MDP Modeling for Multi-Item Capacitated Lot Sizing with Stochastic Demand Timing

Abstract:This paper studies a finite-horizon multi-item capacitated lot-sizing problem in which demand quantities are deterministic, while demand-arrival periods are stochastic. Each demand occurs once within a known time window and must be satisfied no later than its deadline. The proposed model makes production and allocation decisions at the demand level, allowing it to represent capacity competition, demand-specific backlog, and allocation-dependent inventory dynamics. The stochastic problem is formulated as a discrete-time Markov decision process (DTMDP), including the state space, feasible actions, transition kernel, and one-period cost function. To isolate the computational effect of stochastic timing, each stochastic instance is first compared with a deterministic counterpart in which each arrival distribution is replaced by its most likely arrival period. This comparison shows that stochastic timing substantially increases the number of states, the number of transitions, solution time, and memory pressure. A genetic algorithm (GA) is then proposed for the stochastic-timing problem. The GA searches over feasible state-feedback policies and evaluates each policy exactly under the DTMDP transition model. Computational experiments on 330 benchmark instances show that the GA remains close to the exact stochastic solution whenever the latter is available, with an average optimality gap of about $3.44\%$. On the difficult benchmark instances, comprising 90 test cases, the GA remains below the $5\%$ optimality-gap threshold and achieves an average optimization speedup of $6.89 \pm 1.41$ at the $95\%$ confidence level. For instances that cannot be solved exactly on the available hardware, an empirical Bellman-time regression is used to estimate the missing exact resolution time and extrapolate the expected GA speedup.

中文摘要

摘要:本文研究了一个有限时间范围的多品种产能批量生产问题,其中需求数量是确定的,而需求到达时间是随机的。每个需求在已知的时间窗口内仅发生一次,且必须在其截止日期前满足。所提出的模型在需求层面上做出生产和分配决策,从而能够表示产能竞争、特定需求的积压以及依赖分配的库存动态。随机问题被表述为离散时间马尔可夫决策过程(DTMDP),包括状态空间、可行动作、转移核和单期成本函数。为了隔离随机时间对计算的影响,每个随机实例首先与其确定性对应实例进行比较,其中每个到达分布被其最可能的到达时间替代。比较结果显示,随机时间显著增加了状态数量、转移数量、求解时间和内存压力。随后,针对随机时间问题提出了一种遗传算法(GA)。该GA在可行的状态反馈策略上进行搜索,并在DTMDP转移模型下精确评估每个策略。在330个基准实例上的计算实验表明,只要可获得精确的随机解,GA的结果都接近该随机解,平均最优差约为3.44%。在包含90个测试用例的困难基准实例中,GA始终低于5%的最优差阈值,并在95%置信水平下实现平均优化加速为6.89 ± 1.41。对于在可用硬件上无法精确求解的实例,使用经验Bellman时间回归来估算缺失的精确求解时间,并推算预期的GA加速效果。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00004 (HTTP 429)

Authors: Léa Bayati, Mohamed Dahmoune, Melek Rodoplu

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00004.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00004

Published: 2026-09-03T01:26:49.045Z


4. Incremental Risk Assessment of Progressive Elder Financial Scams via Instruction-Tuned Small Language Models

Abstract:Financial scams targeting older adults increasingly occur through text and voice channels such as email, SMS, and phone calls, unfolding over multiple conversational turns that begin with impersonation or casual contact, escalate through trust building and urgency, and culminate in requests for sensitive information or financial transfers. Because risk signals emerge incrementally across turns, effective detection requires models that continuously update risk estimates under resource-constrained deployment settings. We propose a cumulative turn-based risk assessment framework that incrementally aggregates conversational turns and re-estimates risk at each step, enabling dynamic scam monitoring across progressively evolving conversations. A multi-turn dialogue dataset is constructed to cover investment, charity, and tech support scam scenarios, with each dialogue containing two to eight turns and annotated at every cumulative stage with a qualitative risk level, a continuous risk score, an explanatory rationale, and a safety recommendation. Four small language models (Phi-4, LLaMA-3.2, DeepSeek-R1, and Qwen3) are fine-tuned and evaluated under a unified training framework. Fine-tuned small models capture fraud-related linguistic cues and cross-turn escalation patterns while maintaining compact architectures suitable for mobile and resource-constrained deployment settings. Among the evaluated models, Phi-4 and LLaMA-3.2 achieve stronger turn-aware risk estimation performance relative to their parameter scale. These results suggest that structured cumulative modeling can support incremental scam risk assessment in deployment-oriented settings while highlighting the potential of compact language models for privacy-aware and on-device fraud protection.

中文摘要

摘要:针对老年人的金融诈骗越来越多地通过电子邮件、短信和电话等文本和语音渠道发生,通常经过多轮对话展开,从冒充或随意联系开始,通过建立信任和制造紧迫感逐步升级,最终以索要敏感信息或资金转账告终。由于风险信号在多轮对话中逐步显现,有效的检测需要能够在资源受限的部署环境中持续更新风险估计的模型。我们提出了一种基于累计对话轮次的风险评估框架,该框架逐步聚合对话轮次,并在每一步重新评估风险,从而实现对逐渐发展的对话的动态诈骗监控。构建了一个多轮对话数据集,涵盖投资、慈善和技术支持等诈骗场景,每个对话包含两到八轮,并在每一累计阶段标注定性风险等级、连续风险分数、解释性理由及安全建议。对四个小型语言模型(Phi-4、LLaMA-3.2、DeepSeek-R1 和 Qwen3)在统一训练框架下进行了微调和评估。微调后的小型模型能够捕捉与欺诈相关的语言线索和跨轮升级模式,同时保持适合移动端和资源受限部署的紧凑架构。在评估的模型中,Phi-4 和 LLaMA-3.2 在轮次感知风险评估性能上,相对于其参数规模表现更出色。这些结果表明,结构化的累计建模可以支持面向部署的逐步诈骗风险评估,同时凸显了紧凑型语言模型在隐私保护和设备端防欺诈中的潜力。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00005 (HTTP 429)

Authors: Parviz Ghafariasl, Weimin Fu, Xiaolong Guo, Shing I. Chang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00005.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00005

Published: 2026-09-03T01:26:49.045Z


5. Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls

Abstract:Long-horizon tasks remain uncommon in large language model (LLM) evaluation, and for a reason: when each step depends on the last, per-step accuracy that looks excellent in isolation decays catastrophically, as errors cascade and the end-to-end failure probability grows sharply with length. Existing agentic benchmarks report end-to-end success but confound this state-tracking difficulty with instruction interpretation, give no control group that isolates it, and are vulnerable to shortcuts such as a hallucinated final answer, so they cannot say why a long run fails. Whether an LLM can carry exact intermediate state across many tool calls at all is itself not well established. We test this cleanly by having the model compute a cryptographic hash, MD5, step by step: a sequence of $196$ dependent tool calls over $64$ rounds while it carries four $32$-bit words $(a,b,c,d)$ in its own context from one call to the next. Interpretation is trivial and, because we implement MD5 from scratch (RFC~1321), we align every call to the ground-truth trace and check the digest to the bit, so any failure is pure bookkeeping. gpt-oss-120b, a mixture-of-experts model with only $\sim$5.5B active parameters per token, at temperature $0$ with a short fixed prompt, carries the full state across all $196$ calls and returns the correct digest on a majority of completed runs. In the strongest setting we replace every primitive tool with a second LLM, so a driver and a worker compute the whole hash from scratch with no exact-arithmetic oracle in the loop. Two ingredients decide success and neither changes the weights: keeping the model’s own reasoning in its context each turn, and voting over a thinking-enabled worker to remove its modular-arithmetic slips. We localize the residual failures by origin, separating state-carrying from arithmetic and from serving.

中文摘要

摘要:长周期任务在大型语言模型(LLM)评估中仍不常见,这是有原因的:当每一步依赖于上一步时,单步准确率在孤立看起来可能非常高,但会灾难性地下降,因为错误会级联,端到端的失败概率会随着长度急剧增加。现有的自主型基准测试报告端到端成功率,但将这种状态跟踪的难度与指令理解混为一谈,没有提供能够单独隔离该因素的对照组,并且容易受到诸如伪造最终答案的捷径影响,因此它们无法说明长运行失败的原因。一个LLM是否能够在多次工具调用中准确携带中间状态,本身也尚未得到很好验证。我们通过让模型逐步计算一个加密哈希MD5来清晰地测试这一点:在64轮中进行一系列196次相互依赖的工具调用,同时模型在自己的上下文中从一次调用到下一次调用携带四个32位字(a,b,c,d)。解释非常简单,并且由于我们从零实现了MD5(RFC~1321),我们将每次调用与真实轨迹对齐,并逐位检查摘要,因此任何失败都是纯粹的记录错误。gpt-oss-120b,一个每个令牌仅有约5.5B活跃参数的专家混合模型,在温度为0且提示固定的情况下,能够在全部196次调用中携带完整状态,并在大多数完成的运行中返回正确的摘要。在最强的设置中,我们用第二个LLM替换每一个基础工具,因此驱动器和工人从头计算整个哈希,而循环中没有精确算术的参考。决定成功的两个因素都不改变权重:每次将模型自身的推理保存在上下文中,以及对激活思考能力的工人进行投票以消除其模算术错误。我们按来源定位剩余的失败,将状态携带、算术错误和服务错误区分开来。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00012 (HTTP 429)

Authors: Dheeraj Mohandas Pai, Lu Xian

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00012.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00012

Published: 2026-09-03T01:26:49.045Z


6. OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets

Abstract:AI agents powered by large language models are evolving from isolated assistants into heterogeneous systems in which multiple agents, planners, tools, and execution backends operate over shared environments. In such settings, safety becomes a system-level action-governance problem: deciding whether a pending action should be committed given policy-relevant state accumulated across a session. Existing safeguards operate at fragmented boundaries, making it difficult to enforce shared policies over composed action flows across heterogeneous execution paths. We present OpenAgentFlow, a control-plane/action-plane architecture that establishes the action-commit boundary as a shared enforcement interface. GUI, API, tool, and LLM-generated actions are normalized into a common AgentEvent stream and mediated by a shared pre-execution Policy Enforcement Point, while provenance, session state, audit evidence, and updatable policies are maintained outside individual agents. This provides a common governance layer across incompatible executors and allows new policies to take effect without modifying agents, prompts, models, or execution paths. We evaluate OpenAgentFlow through complementary system evaluations spanning controlled action-flow tests, a public external benchmark, policy updates, and real Android execution. On a 300-case controlled suite, OpenAgentFlow achieves 94.00% accuracy and a 95.35% attack-block rate. On the complete 1,220-case AgentDojo-Traj split of TS-Bench, it achieves 97.62% accuracy, 96.59% unsafe-action recall, and a 1.96% safe false-intervention rate. New control-plane rules take effect without modifying protected agents, and the same enforcement path operates across live GUI, API/tool, and LLM-planned Android execution. These results show that a shared action-commit boundary provides a practical basis for system-wide governance across heterogeneous agent execution paths.

中文摘要

摘要:由大型语言模型驱动的AI代理正在从孤立的助手演变为异构系统,其中多个代理、规划器、工具和执行后端在共享环境中运行。在这种环境下,安全性成为系统级的动作治理问题:基于跨会话累积的与政策相关的状态决定是否提交待执行的动作。现有的安全防护措施在分散的边界上运行,使得难以在跨异构执行路径的组合动作流程中实施共享政策。我们提出了OpenAgentFlow,一种控制平面/动作平面架构,它将动作提交边界作为共享执行接口。GUI、API、工具和LLM生成的动作会被规范化为统一的AgentEvent流,并通过共享的预执行政策执行点进行调解,而溯源信息、会话状态、审计证据和可更新政策则维护在各个个体代理之外。这为不兼容的执行器提供了统一的治理层,并允许新政策生效而无需修改代理、提示、模型或执行路径。我们通过多种系统评估来验证OpenAgentFlow,其中包括受控动作流程测试、公共外部基准、政策更新以及真实的Android执行。在一个包含300个案例的受控测试套件上,OpenAgentFlow实现了94.00%的准确率和95.35%的攻击阻止率。在TS-Bench的完整1,220个案例的AgentDojo-Traj拆分上,它达到了97.62%的准确率、96.59%的不安全动作召回率,以及1.96%的安全误干预率。新的控制平面规则无需修改受保护的代理即可生效,并且相同的执行路径能够覆盖实时GUI、API/工具及LLM规划的Android执行。这些结果表明,共享的动作提交边界为跨异构代理执行路径的系统级治理提供了可行基础。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00015 (HTTP 429)

Authors: Dongsheng Chen, Xiangyu Zhao, Xin Yao, Xuetao Wei

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00015.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00015

Published: 2026-09-03T01:26:49.045Z


7. SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces

Abstract:Computer science papers rely heavily on diagrams: architecture drawings, system flowcharts, and pipeline schematics that often carry more information than the text around them. There is currently no public dataset that pairs this specific kind of figure with captions, context, questions, answers, and step-by-step reasoning, which is exactly what is needed to train a vision-language model to understand them. We present \textbf{SCAFFOLD}\footnote{this https URL}, a large-scale structured dataset of computer science research figures with diagram QA and Chain-of-Thought reasoning traces. This dataset consists of (image, caption, context, question-answer, chain-of-thought) tuples from arXiv computer science papers prepared using layout detection and PDF parsing, with an AI-assisted question-generation step. The resulting large-sized SCAFFOLD-157K dataset spans 3,058 papers with 29,887 figures (157,387 pairs), a medium-sized SCAFFOLD-37K dataset (36,797 pairs), and a small-sized SCAFFOLD-12K dataset (12,000 pairs). We used SCAFFOLD-12K for baseline experiments on Qwen2.5-VL-3B-Instruct.

中文摘要

摘要:计算机科学论文在很大程度上依赖图表:架构图、系统流程图以及管道示意图,这些图表通常承载的信息比周围的文字更多。目前尚无公开数据集将这种特定类型的图表与标题、上下文、问题、答案以及逐步推理配对,而这恰恰是训练视觉-语言模型以理解它们所需的。我们提出了\textbf{SCAFFOLD}\footnote{this https URL},一个大型结构化计算机科学研究图表数据集,包含图表问答和思维链推理轨迹。该数据集由来自arXiv计算机科学论文的(image, caption, context, question-answer, chain-of-thought)元组组成,通过布局检测和PDF解析准备,并附有AI辅助的问题生成步骤。得到的大型SCAFFOLD-157K数据集覆盖3,058篇论文,含29,887幅图表(共157,387对);中型SCAFFOLD-37K数据集(36,797对);小型SCAFFOLD-12K数据集(12,000对)。我们使用SCAFFOLD-12K在Qwen2.5-VL-3B-Instruct上进行了基线实验。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00018 (HTTP 429)

Authors: Ranjit Raut, Aarav Subedi, Sagun Rai, Sudan Jha

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00018.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00018

Published: 2026-09-03T01:26:49.045Z


8. UI-Venus-2 Technical Report

Abstract:Multimodal GUI agents have emerged as a promising paradigm for digital task automation, yet transitioning from benchmark-oriented models to dependable real-world applications remains challenging due to limited environment coverage, brittle task construction, and unreliable reward verification. In this work, we present UI-Venus-2, a general-purpose foundation GUI agent designed to operate across mobile, web, and desktop environments through a unified closed-loop reasoning-action framework. To bridge the gap toward practical deployment, we jointly scale three critical dimensions: (1) Environments, expanding coverage to more than 170 multilingual mobile apps and native desktop operating systems; (2) Tasks, employing a deep-research pipeline for function-grounded instruction generation; and (3) Verification, adopting trace-level and sample-level evaluators with visual keypoints and multi-model voting to ensure reliable RL signals for training. Furthermore, we integrate safety-aware mechanisms to ensure controlled execution of consequential actions. By offering a capable, efficient, and open-source foundation, UI-Venus-2 advances the field toward more generalizable, verifiable, and self-reflective agents for real-world applications.

中文摘要

摘要:多模态 GUI 代理已成为数字任务自动化的有前景的范式,但由于环境覆盖有限、任务构建脆弱以及奖励验证不可靠,从面向基准的模型过渡到可依赖的现实应用仍然具有挑战性。在本工作中,我们提出了 UI-Venus-2,一种通用基础 GUI 代理,旨在通过统一的闭环推理-动作框架在移动、网页和桌面环境中运行。为了弥合朝向实际部署的差距,我们在三个关键维度上同步扩展:(1)环境,将覆盖范围扩展到 170 多个多语言移动应用程序和原生桌面操作系统;(2)任务,采用功能驱动的深度研究指令生成管线;(3)验证,采用基于轨迹级和样本级的评估器,结合视觉关键点和多模型投票,以确保训练中的 RL 信号可靠。此外,我们集成了安全感知机制,以确保关键操作的可控执行。通过提供一个功能强大、高效且开源的基础,UI-Venus-2 推动该领域向更通用、可验证和自我反思的现实应用代理发展。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决多模态 GUI 智能体(Multimodal GUI agents)从\*\*面向基准的模型\*\*向\*\*可靠的现实世界应用\*\*过渡时面临的根本性挑战。具体而言,论文识别出以下三个紧密耦合的核心瓶颈: - \*\*环境覆盖不足(Limited Environment Coverage)\*\* 现有工作往往局限于小规模、单一领域的应用集合(如少量英文应用或特定网站),难以覆盖真实场景中多语言移动生态、动态网页及完整桌面操作系统的多样性。 - \*\*任务构建脆弱且难以扩展(Brittle Task Construction)\*\* 生成的大规模任务查询常与实际应用功能脱节,导致指令在动态变化的界面状态下不可执行,缺乏对真实功能 grounding 的可扩展任务合成机制。 - \*\*奖励验证不可靠(Unreliable Reward Verification)\*\* 用于强化学习的验证信号过于粗糙(如仅依赖最终状态的二元成功/失败标签),容易将部分进展误判为完成、忽略任务关键视觉证据,或产生可被策略利用的脆弱奖励信号,从而影响 RL 训练的可靠性。 为系统性克服上述障碍,论文提出 \*\*UI-Venus-2\*\*,通过统一的闭环推理-行动框架,\*\*联合扩展\*\*环境(覆盖 170+ 多语言移动应用及原生桌面 OS)、任务(基于深度研究的功能 grounding 指令生成)与验证(引入轨迹级和样本级评估器,结合视觉关键点和多模型投票)三个维度,并集成安全感知机制,以构建更具通用性、可验证性和自我反思能力的 GUI 智能体基础模型。 Q2: 有哪些相关研究? 根据论文第5节,相关研究围绕以下六个核心方向展开: ### 1. Mobile Use(移动设备使用) 早期研究主要依赖静态截图、记录轨迹或固定基准进行可复现的测量,但仅部分反映实际交互。近期工作转向在真实应用和动态设备环境中评估智能体,其中界面状态、应用版本、语言、账户及中断因素均可能影响执行。代表性研究包括: - \*\*UI-TARS\*\* (Qin et al., 2025) - \*\*UItron\*\* (Zeng et al., 2025) - \*\*GUI-Xplore\*\* (Sun et al., 2025b) - \*\*Aria-UI\*\* (Yang et al., 2024) - \*\*OS-Genesis\*\* (Sun et al., 2025a) - \*\*AutoGLM\*\* (Liu et al., 2024) - \*\*Step-GUI\*\* (Yan et al., 2025) - \*\*Xiaomi-GUI-0\*\* (Cao et al., 2026) - \*\*HyMobileAgent\*\* (Team et al., 2026b) ### 2. Computer Use(计算机使用/桌面环境) 桌面系统与专业软件通常比移动应用具有更密集的界面和更丰富的动作空间,任务可能涉及键盘快捷键、文件操作、文本选择、拖拽、窗口管理及跨应用协调,需要全面的状态理解、规划、记忆与错误恢复能力。代表性研究包括: - \*\*OpenCUA\*\* (Wang et al., 2025b) - \*\*UltraCUA\*\* (Yang et al., 2026) - \*\*EvoCUA\*\* (Xue et al., 2026) - \*\*Qwen-UI-Agent\*\* (Zhou et al., 2026) - \*\*GUI-Owl-1.5 / Mobile-Agent-v3.5\*\* (Xu et al., 2026) - \*\*多轮RL优化工作\*\* (Li et al., 2025b) ### 3. Web Navigation(网页导航) 实时网页环境具有固有不确定性:网络故障可能中断执行、内容实时更新、认证流程、弹窗、广告或区域差异均可能改变交互路径。跨站点任务进一步增加了不确定性。代表性研究包括: - \*\*MolmoWeb\*\* (Gupta et al., 2026) - \*\*FARA-7B / FARA-1.5\*\* (Awadallah et al., 2025, 2026) - \*\*BrowserAgent\*\* (Yu et al., 2025) - \*\*Wuying-browser-agent\*\* (Team et al., 2026a) - \*\*Browser-use\*\* (Müller & Žuniˇc, 2024) - \*\*Web Agents 综述\*\* (Ning et al., 2025) ### 4. GUI Grounding(GUI 视觉定位) 在高分辨率屏幕和专业软件中,精确的元素定位与领域知识对于区分密集或视觉相似的控件至关重要。目标可能具有歧义、与描述不符或不存在于当前屏幕。代表性研究包括: - \*\*UI-R1\*\* (Lu et al., 2025) - \*\*GUI-R1\*\* (Luo et al., 2025a) - \*\*InfiGUI-R1\*\* (Liu et al., 2025) - \*\*GUI-G1 / GUI-G2\*\* (Zhou et al., 2025c; Tang et al., 2025a) - \*\*LPO\*\* (Tang et al., 2025b) - \*\*OmegaUse\*\* (Zhang et al., 2026a) - \*\*MAI-UI / VenusBench-GD\*\* (Zhou et al., 2025b) - \*\*Autofocus\*\* (Yao et al., 2026) - \*\*Holo2\*\* (H-Company, 2025) - \*\*GTA1\*\* (Yang et al., 2025a) - \*\*MVP\*\* (Zhang et al., 2026b) - \*\*Vista\*\* (Qiu et al., 2026b) ### 5. CAPTCHA Solving(验证码解决) 现代验证码已从扭曲文本识别扩展到有序点击、旋转、滑块、拖拽及空间推理。视觉-语言模型通过共享的视觉理解与 GUI 动作应对多种格式,但基准性能未必反映实际部署中的交互模式。代表性工作涉及: - \*\*Seed2.0 / Seed2.1\*\* (Seed, 2026; ByteDance Seed, 2026) - \*\*Qwen3.8-max\*\* (Qwen Team, 2026d) - \*\*Kimi K2.6\*\* (Moonshot AI, 2026a) - \*\*Claude 4\*\* (Anthropic, 2025) ### 6. GUI Agent Safety(GUI 智能体安全) 现实部署中,尤其是计算机使用智能体,其动作可能对用户造成昂贵后果,因此安全评估至关重要。早期评估主要考察智能体在显式风险或对抗性场景中避免有害动作的能力;近期工作进一步揭示,看似良性的指令在环境潜藏风险下也可能导致有害后果。代表性研究包括: - \*\*AgentHarm\*\* (Andriushchenko et al., 2025) - \*\*InjecAgent\*\* (Zhan et al., 2024) - \*\*OS-Harm\*\* (Kuntz et al., 2026) - \*\*OSBlind\*\* (Ding et al., 2026) - \*\*SafeAgentBench\*\* (Yin et al., 2024) Q3: 论文如何解决这个问题? 为解决多模态 GUI 智能体从基准测试走向实际应用中的环境覆盖不足、任务构建脆弱与验证不可靠三大瓶颈,论文提出了 \*\*UI-Venus-2\*\*,其解决方案可概括为以下核心方面: ### 1. 统一闭环推理–行动框架 UI-Venus-2 采用统一的闭环范式:智能体观察当前界面截图,进行状态推理,执行结构化动作,并将环境反馈纳入下一步决策。该框架覆盖移动应用、网页浏览器和桌面操作系统三大平台,通过共享的视觉感知与动作空间实现跨平台通用性。 ### 2. 三阶段统一训练流水线 模型训练遵循从基础能力注入到领域特化、再到能力融合的三阶段策略: - \*\*Stage I:多模态中期训练(Multimodal Mid-Training)\*\* 在大规模异构的合成与交互数据上进行监督微调,以移动、网页和 OS 导航任务为主导。通过模拟广泛的交互环境,结合基于种子查询与功能 grounding 的任务构造,并利用人机协同的轨迹验证过滤低质量交互,注入基础的 GUI 理解与长程规划能力。 - \*\*Stage II:离线强化学习(Offline Reinforcement Learning)\*\* 针对移动、OS 和网页环境,构建大规模\*\*步骤级\*\* RL 轨迹,优化状态感知的动作选择、多步导航一致性与执行可靠性。对于 CAPTCHA 和 Grounding 任务,则利用程序化合成框架,将经过验证的验证码实例与定位目标嵌入真实背景界面中,提供可密集采样的可靠动作级监督。 - \*\*Stage III:多教师在线策略蒸馏(Multi-teacher On-policy Distillation, MOPD)\*\* 为融合来自不同任务分布与训练阶段的能力,同时避免直接合并独立专家导致的干扰,UI-Venus-2 采用学生自采样、教师评分的在线蒸馏范式。针对 GUI 智能体的特殊性,论文进一步引入两项关键设计: \*\*(a) 结构化动作感知蒸馏(Structured Action-Aware Distillation)\*\* 由于动作是改变环境的唯一接口,而动作 token 在响应中占比极小,论文对动作片段施加自适应权重: - 若完整动作正确,则抑制其蒸馏信号; - 若动作类型正确但参数错误,则加强对动作跨度的监督; - 若动作类型错误,则强调类型 token 并屏蔽下游参数(因其语义依赖于类型)。 这确保监督信号集中于需要修正的可执行行为,而非均匀分散在整个响应上。 \*\*(b) 教师侧动作类型条件化(Teacher-Side Action-Type Conditioning)\*\* 在教师评分时,向教师提示追加正确的动作类型提示 h(z^*) ,但该提示\*\*不出现在学生输入中\*\*。蒸馏优势计算为:

At^(hint) = sg[ log π(Td)(y_t mid P_T(x, z^*), y(<t)) - log πθ(y_t mid P_S(x), y(<t)) ],
其中 Td 为领域 d 的冻结教师, πθ 为学生策略, P_T(x, z^) 为带提示的教师输入, P_S(x) 为原始学生输入,$sg
·
$ 表示阻断梯度。该设计使教师能够提供更精确的结构化动作监督。 ### 3. 联合扩展三大关键维度 - \
*环境(Environments)** 将可执行环境池大幅扩展至 **170+ 个多语言移动应用**(100+ 中文、70+ 英文)及**原生桌面操作系统**,覆盖日常和专业软件的复杂交互场景。 - **任务(Tasks)** 提出基于**深度研究(deep-research)**的查询生成策略:聚合官方文档、帮助页面、用户讨论与历史任务证据,构建动态更新的应用功能目录(capability catalog)。任务生成以可用功能为 grounding,确保指令与真实应用能力对齐;同时通过有效性门控(validity gate)拦截包含不支持功能、模糊目标或缺失依赖的不可执行任务。 - **验证(Verification)** 建立两级验证框架以提供可靠的 RL 奖励信号: **(a) 轨迹级验证:语义引导验证(Semantic Guided Verification, SGV)** 不依赖智能体自我报告的成功状态,而是从任务目标中提取可验证的关键点(keypoints),将轨迹分割为固定窗口,利用多模态模型并行判断各窗口满足哪些关键点,并结合硬规则与多模态终局判断,将轨迹分类为完成/部分完成/不可行/失败。该机制不仅用于数据筛选,还通过反馈闭环动态更新功能目录与任务生成策略。 **(b) 样本级验证(Sample-level Verification)** 在动作执行前进行先验判断,基于当前截图、声明的动作类型与目标、推理过程和任务目标,将每一步分类为:正确(Correct)、探索性(Exploratory)、无效(Ineffective)或错误(Incorrect)。通过区分通用操作(如启动应用、滚动)与任务特定操作,确保“部分信用”仅反映真实的任务相关进展,避免粗糙的二元标签误导强化学习。 ### 4. 安全感知执行机制 针对现实部署中的潜在风险,UI-Venus-2 集成了**安全感知机制**,对具有重大后果的动作实施更可靠的控制。在 OSHarm 和 OSBlind 等安全基准上的评估表明,该机制在抵御显式攻击(如提示注入)和识别良性指令中的安全盲点方面均显著优于基线模型。 ### 5. 系统化数据生成与迭代闭环 论文设计了一个三阶段数据生成框架: 1. **功能目录构建**:冷启动阶段聚合异构来源的应用证据,运行时动态更新页面状态、UI 控件约束与失败案例; 2. **任务构造**:基于当前目录采样生成单能力、复合、查询式、批处理和场景式任务,并通过严格约束保证可执行性; 3. **轨迹采集**:在真实环境中执行,成功与失败均产生结构化反馈回写至目录,驱动下一轮采样向未充分探索的能力与先前失败场景倾斜。 针对桌面环境的特殊复杂性,还引入了任务规格序列化(TaskSpec)、确定性环境设置、分层子目标分割与跨会话依赖管理;针对 CAPTCHA,则通过类型特定的规则引擎与渲染器合成可验证谜题,确保可解性与坐标标注的确定性。 综上,UI-Venus-2 通过**统一框架**、**三阶段训练**、**三维联合扩展**与**精细化验证**,系统性解决了 GUI 智能体在环境覆盖、任务质量与奖励可靠性方面的关键障碍,推动其向可部署的通用计算机使用智能体迈进。 Q4: 论文做了哪些实验? 论文在 **6 大核心领域** 上开展了系统性实验,涵盖 **移动设备使用、桌面计算机使用、网页导航、GUI 视觉定位、验证码求解** 以及 **智能体安全性**。实验将 UI-Venus-2(9B 与 27B 两个规模)与当前主流通用多模态大模型(General VLMs)及专用 GUI 模型(GUI-specific Models)进行了全面对比。 —- ### 1. 实验设置 #### 1.1 实现细节 - 推理温度:通用智能体任务设为 **1.0**, grounding 任务设为 **0** 以保证确定性输出; - 推理模式:通用任务默认启用深度推理模式(`think`),完整推理历史保留并反馈至上下文;grounding 与 CAPTCHA 任务按需关闭推理或启用多动作解析; - 视觉分辨率:采用 Qwen3.5 默认配置。 #### 1.2 评测基准 实验共涉及 **21 个公开或自研基准**,具体包括: - **移动使用(Mobile Use)**:MobileGym、VenusBench-Mobile、AndroidWorld、MobileWorld、KnowUBench、MemGUI - **计算机使用(Computer Use)**:OSWorld-Verified、DeskCraft、OSWorld 2.0 - **网页导航(Web Navigation)**:WebVoyager、Online-Mind2Web、REAL、Odysseys - **GUI 定位(GUI Grounding)**:VenusBench-GD、ScreenSpot-Pro、OSWorld-G-R、UI-Vision - **验证码求解(CAPTCHA Solving)**:VenusBench-CAPTCHA(自研)、MCA-Bench、Spatial-CAPTCHA-Bench、NextGen-CAPTCHAs、Open CaptchaWorld - **智能体安全(GUI Agent Safety)**:OSHarm、OSBlind —- ### 2. 主要实验结果 #### 2.1 移动设备使用(Mobile Use) | 基准 | UI-Venus-2-27B 表现 | 关键对比 | |———|——————————-|—————| | **MobileGym** | **60.5%** | 超越 Seed-2.0-Pro(52.0%)8.5 个百分点,领先此前最优 GUI 专用模型(21.5%)近 39 个百分点 | | **VenusBench-Mobile** | **48.7%** | 超越 Claude-Opus-4.6(36.5%)与 Kimi-K2.6(31.2%) | | **AndroidWorld** | **84.0%** | 在接近饱和的基准上仍较前最优(77.6%)提升 6.4 个百分点 | | **MobileWorld** (50步/100步) | **76.1% / 82.9%** | 27B 模型领先 GPT-5.6-Sol(70.1%)等通用模型;9B 模型达 65.8% / 75.2% | | **KnowUBench** | **59.7%** | 超越 Seed-2.0-Pro(51.6%),显示个性化辅助能力优势 | | **MemGUI** | **70.3%** | 显著领先 Seed-2.0-Pro(65.6%)及 Kimi-K2.6(39.1%),在记忆密集型场景中优势突出 | #### 2.2 计算机使用(Computer Use) - **OSWorld-Verified**:UI-Venus-2-27B 达到 **80.5%**,超越 Qwen-UI-Agent-27B(79.5%)、Seed-2.1-Pro(78.8%)与 GPT-5.5(78.7%),仅次于 Claude-Opus-4.8(83.4%)。 - **DeskCraft**:UI-Venus-2-27B 取得 **55.5%**,大幅领先 Kimi-K2.6(41.4%)与 Seed-2.0-Pro(40.0%),创该基准最优成绩。 - **OSWorld 2.0**:在 150 步预算下,27B 模型的 Partial Score 为 **13.2%**,Binary Accuracy 为 **2.8%**。Partial Score 超越多数基线(如 Claude-Sonnet-4.6 为 20.0%,但 UI-Venus-2 优于 Qwen 与 Seed 系列),显示在长程复杂桌面工作流中仍有提升空间。 #### 2.3 网页导航(Web Navigation) - **WebVoyager**:UI-Venus-2-27B 达到 **93.4%**,刷新最优纪录,超越 Fara1.5-27B(89.3%)与 GPT-5-SoM(90.6%);9B 模型亦达 **90.8%**。 - **Online-Mind2Web**:27B 模型取得 **78.3%**,9B 模型为 **74.0%**,均超越同规模或更大规模的专用模型。 - **REAL**:27B 模型以 **80.2%** 创纪录,超越此前最优(74.4%)5.8 个百分点。 - **Odysseys**:27B 模型在 Averaged Rubric Score 上达 **80.4**,Perfect Score 达 **66.3**,分别领先此前最优(68.9 / 44.5)11.5 与 21.8 个百分点,展现极强的长程跨站导航能力。 #### 2.4 GUI 视觉定位(GUI Grounding) | 基准 | UI-Venus-2-27B | 关键对比 | |———|————————|—————| | **VenusBench-GD** | **80.1%** | 超越 UI-Venus-1.5-30B-A3B(75.0%)与 Qwen-UI-Agent-27B(76.6%) | | **ScreenSpot-Pro** | **74.1%** | 仅次于 Qwen-UI-Agent-27B(76.6%),但超越 Qwen-3.7-Plus(68.9%)与 Seed-2.1-Pro(65.3%) | | **OSWorld-G-R** | **79.1%** | 在 GUI 专用模型中最高 | | **UI-Vision** | **66.9%** | 仅次于 Qwen-UI-Agent-27B(70.0%),较 UI-Venus-1.5-30B-A3B 提升 12.2 个百分点 | #### 2.5 验证码求解(CAPTCHA Solving) 所有结果均以 **Pass@1 (%)** 报告: - **VenusBench-CAPTCHA**:27B 与 9B 分别达 **79.9%** 与 **78.1%**,远超 Qwen3.6-27B(53.0%)与 Seed-2.0-Pro(47.9%)。 - **MCA-Bench**:27B 达 **79.6%**,9B 达 **75.7%**,较最优通用模型(51.7%)分别领先 27.9 与 24.0 个百分点。 - **Spatial-CAPTCHA-Bench**:27B 为 **48.6%**,超越 Seed-2.0-Pro(43.8%);9B 为 **42.8%**,显著优于同规模 Qwen3.5-9B(4.9%)。 - **NextGen-CAPTCHAs**:27B 达 **54.5%**,9B 达 **47.6%**,而最强通用基线 Seed-2.0-Pro 仅 20.4%,9B 模型已超越基线一倍以上。 - **Open CaptchaWorld**:27B 为 **56.3%**,与 Seed-2.0-Pro(55.6%)接近,但仍保持领先。 #### 2.6 智能体安全性(GUI Agent Safety) 以 **攻击成功率(ASR, 越低越好)** 评估: | 基准 | UI-Venus-2-27B | UI-Venus-2-9B | 关键对比 | |———|————————|———————-|—————| | **OSHarm** | **15.3%** | **11.3%** | 显著优于 Qwen3.5-27B(18.0%)、EvoCUA-32B(33.3%)等 | | **OSBlind** | **47.9%** | **48.8%** | 将基线模型普遍 80%-93% 的 ASR 降低近一半,展现对”安全盲点”的识别能力 | —- ### 3. 实验结论 实验结果表明,通过在**环境覆盖、任务分布与验证机制**三个维度上的联合扩展,UI-Venus-2 在几乎所有评测基准上均达到或接近当前最优水平,尤其在以下方面表现突出: - **跨平台通用性**:在移动、桌面、网页三大领域同时保持领先; - **高效率**:9B 小规模模型在多数任务上即可媲美甚至超越更大规模的通用模型; - **长程复杂任务**:在 MobileWorld、Odysseys、DeskCraft 等长程基准上优势显著; - **细粒度定位与验证码**:通过合成数据与专用 RL 训练,实现了高精度的空间定位与端到端验证码操作; - **安全性**:在显式攻击与隐式安全盲点场景下均实现了更低的攻击成功率。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与讨论,以下若干方向值得学术界与工业界进一步深入探索: ### 1. 长程复杂桌面任务的规划与执行能力 OSWorld 2.0 的结果表明,UI-Venus-2-27B 的 Binary Accuracy 仅为 **2.8%**,Partial Score 为 **13.2%**,与 GPT-5.5(13.0% / 46.7%)及 Claude-Opus-4.7(4.6% / 20.3%)相比仍存在显著差距。这揭示出在需要协调数百步动作、跨多个桌面应用、处理动态环境与流式更新的长程真实工作流中,智能体的**全局规划、状态记忆、进度评估与错误恢复**能力仍是核心瓶颈。未来可探索分层规划架构、显式记忆机制或基于模型的树搜索来增强长程稳定性。 ### 2. 空间推理与视觉-几何理解 在 Spatial-CAPTCHA-Bench 上,即使最优模型也仅达到 **48.6%** 的 Pass@1。论文明确指出,**参考系变换、视角选取与多步空间变换**仍是所有模型的主要错误来源。这暗示当前视觉编码器在深度空间关系与几何推理方面存在固有局限。后续研究可尝试引入显式的 3D 视觉理解模块、几何辅助训练目标,或针对空间变换的专用数据增强与课程学习策略。 ### 3. 安全对齐与有害行为识别 尽管 UI-Venus-2 在 OSHarm 与 OSBlind 上将攻击成功率(ASR)大幅降低,但在 **OSBlind**(良性指令触发有害结果)上 ASR 仍高达 **47.9%–48.8%**。这说明智能体在识别**嵌入正常执行上下文中的潜在风险**方面远未达到可部署标准。未来需探索更强健的安全对齐训练、环境风险预检测机制,以及如何在保持任务完成率的同时,对高后果动作实施更严格的约束与人工确认。 ### 4. 验证机制的自动化、可扩展性与泛化 当前工作依赖 **VLM-as-a-Judge** 与多模型投票进行轨迹级和样本级验证,虽显著优于粗粒度验证,但仍面临成本高昂、延迟较大以及在未见任务类型上泛化能力有限的问题。可进一步探索: - 基于规则与神经网络混合的轻量级验证器; - 验证器自身的在线学习与领域自适应; - 将验证信号从离线的数据筛选阶段扩展为**在线执行时的实时干预与纠错**机制。 ### 5. 跨平台统一表征与知识迁移 UI-Venus-2 通过统一的动作空间与训练框架覆盖移动、网页和桌面环境,但三类平台在交互范式、控件密度与状态空间上差异巨大。当前方案主要依赖大规模数据混合与多教师蒸馏实现能力聚合,不同域间的知识可能仍存在干扰。未来可研究**跨平台共享的 UI 中间表征**(如统一的控件语义图或交互原语嵌入),以促进正向迁移并减少对单一平台数据的过度依赖。 ### 6. 人机协作与交互式自主性 DeskCraft 基准已涉及人机协作场景(如寻求澄清、处理中断、整合反馈),但论文主要聚焦于自主端到端执行。实际部署中,智能体不可能也不应完全无人监督。进一步探索**可中断、可引导、可回滚**的交互式执行策略,以及如何在推理过程中显式建模用户意图的不确定性,是提升实用性的关键。 ### 7. 强化学习的奖励设计与稳定性 论文指出,粗糙或脆弱的验证器易混淆部分进展与真正完成,且奖励信号可能被利用(reward hacking)。尽管 UI-Venus-2 通过结构化动作感知蒸馏与视觉关键点缓解了该问题,但**细粒度、密集型过程奖励(process reward)** 的设计仍不成熟。后续可研究基于界面状态差异的 dense reward、动作结果预测的自监督信号,或验证器与策略模型的联合对抗训练。 ### 8. 动态环境与持续学习 当前的数据生成与能力目录更新以批量迭代方式进行。然而真实世界的应用版本、网页内容与桌面环境持续演化。构建支持**在线适应、增量学习与灾难性遗忘抑制**的持续学习框架,使智能体能够随环境变化自我更新,是从“静态基准智能体”迈向“终身可用助手”的必经之路。 ### 9. 模型效率与端侧部署 UI-Venus-2-9B 已展现出与更大规模通用模型相媲美的竞争力,但在移动设备或边缘计算节点上部署仍面临延迟与显存挑战。探索面向 GUI 任务的专用轻量架构、动态分辨率感知推理、或面向动作预测的高效解码策略,将有助于实现真正的端侧自主智能体。 ### 10. CAPTCHA 与通用导航能力的深度耦合 论文将 CAPTCHA 解决能力定位为“最后一公里”支撑,但当前训练仍将其作为独立任务族处理。未来可探索将验证码理解融入常规导航的**统一推理流程**,使智能体在面对登录、注册等验证门时无需切换模式,而是以统一的视觉-推理-行动连续体自然完成过渡,进一步提升端到端工作流的流畅性。 Q6: 总结一下论文的主要内容 论文提出了 **UI-Venus-2**,一个面向移动、网页和桌面三大平台的通用基础 GUI 智能体,旨在弥合当前多模态 GUI 智能体从基准测试走向真实应用时存在的核心差距。以下是论文的主要内容总结: ### 1. 研究背景与核心问题 当前多模态 GUI 智能体面临三大紧密耦合的瓶颈: - **环境覆盖不足**:现有工作多局限于小规模、单一语言或单一平台的应用集合; - **任务构建脆弱**:生成的大规模指令与实际应用功能脱节,在动态界面下难以执行; - **验证不可靠**:粗粒度的二元成功/失败标签易混淆部分进展与真正完成,导致强化学习(RL)的奖励信号不准确,甚至可被利用。 ### 2. 核心方法:UI-Venus-2 论文提出一个统一的**闭环推理–行动框架**,并采用三阶段训练流水线: - **Stage I:多模态中期训练** 在大规模异构交互数据(移动、网页、OS 导航为主)上进行监督微调,注入 GUI 理解、长程规划与动作定位能力。 - **Stage II:离线强化学习** 针对不同域构造步骤级 RL 轨迹(移动/网页/OS),或利用程序化合成框架生成带可靠动作级监督的 CAPTCHA 与 Grounding 数据,以优化状态感知的动作选择与执行一致性。 - **Stage III:多教师在线策略蒸馏(MOPD)** 为融合异构任务能力,引入两项 GUI 自适应设计: - **结构化动作感知蒸馏**:根据动作正确性(类型/参数)对蒸馏信号进行自适应加权,将监督集中于关键的可执行行为; - **教师侧动作类型条件化**:仅在教师评分时提供正确动作类型提示,使学生模型在不改变推理流程的前提下获得更精确的结构化动作监督。 ### 3. 关键扩展维度 论文采用**环境、任务、验证联合扩展**的策略: - **环境**:覆盖 **170+ 个多语言移动应用**(100+ 中文、70+ 英文)及**原生桌面操作系统**; - **任务**:基于 **deep-research** 构建动态更新的应用功能目录,生成功能接地的可执行任务,并设置有效性门控保证可执行性; - **验证**: - **轨迹级验证(SGV)**:基于视觉关键点和 VLM-as-a-Judge,将轨迹分类为完成/部分完成/不可行/失败,用于数据筛选与闭环反馈; - **样本级验证**:在动作执行前进行先验判断,区分正确/探索性/无效/错误动作,提供细粒度的步骤级监督。 此外,模型集成了**安全感知机制**,以控制高后果动作的执行风险。 ### 4. 实验与结果 论文在 **21 个基准**上开展实验,涵盖移动使用、计算机使用、网页导航、GUI 定位、验证码求解与智能体安全性: - **移动使用**:在 MobileGym(60.5%)、VenusBench-Mobile(48.7%)、AndroidWorld(84.0%)、MobileWorld(76.1%)等基准上取得最优或次优成绩; - **计算机使用**:OSWorld-Verified 达 80.5%,DeskCraft 达 55.5%(最优),但 OSWorld 2.0 的长程复杂任务仍有较大提升空间; - **网页导航**:WebVoyager(93.4%)、REAL(80.2%)、Odysseys(80.4)均刷新纪录; - **GUI 定位**:VenusBench-GD(80.1%)与 OSWorld-G-R(79.1%)表现领先; - **验证码求解**:在 VenusBench-CAPTCHA(79.9%)、MCA-Bench(79.6%)等基准上显著超越通用多模态模型; - **安全性**:在 OSHarm 与 OSBlind 上将攻击成功率(ASR)较基线降低近一半。 ### 5. 主要贡献 - **规模化多语言移动环境**:大幅扩展可执行应用范围,并引入基于深度研究的高质量保证任务生成; - **从头构建的桌面使用能力**:将 UI-Venus 家族从移动/网页扩展至桌面 OS,实现三平台统一端到端交互; - **精细化的两级验证机制**:通过视觉关键点与多模型投票,提供可靠的 RL 训练信号并抑制奖励作弊; - **开源基础模型**:公开发布 9B 与 27B 全参数权重及评估基础设施,推动 GUI 智能体领域的可复现研究与社区创新。 综上,UI-Venus-2 通过统一框架与三维联合扩展,显著推进了通用、可验证、可自反思的 GUI 智能体基础模型的发展。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Venus Team, Zhuohan Cai, Haoxing Chen, Jiaxuan Chen, Weizhi Chen, Changlong Gao, Zhangxuan Gu, Yuan Guo, Yusong Hu, Jianrong Jiang, Jianguo Li, Runze Li, Jinzhen Lin, Zhenyu Ma, Changhua Meng, Han Peng, Xinyu Qiu, Shuheng Shen, Zhongyi Shui, Weiqiang Wang, Ming Wen, Zhuoer Xu, Hang Yan, Kaiwen Yang, Ruilin Yao, Nanjun Yu, Zhengwen Zeng, Lianrui Zhang, Yunzhu Zhang, Zhe Zhao, Beitong Zhou

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00028.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00028

Published: 2026-09-03T01:26:49.045Z


Abstract:Mathematical communities work with different objects, invariants, and tools, so transferring a problem across them is expensive and often skipped. We present EULER, a multi-agent system that takes such a transfer—a bridge—as its unit of search. Around a fixed conjecture, EULER runs direct, adjacent-domain, and distant-domain routes in competition; a bridge keeps its budget only if it supplies an operation the source representation cannot execute and its target-side evidence returns to the original statement along a checked implication. Six ordered stress tests reject invalid bridges before expensive search begins. We evaluate EULER on 120 recent conjectures. The conjectures were frozen before search and screened for contamination, and are drawn from public papers by authors who had recently published in the Journal of Combinatorial Theory, Series A, a leading journal in combinatorics. EULER produced 10 proofs and 3 refutations, plus 45 scoped partial results. Two mechanisms held up under ablation: bridge-specific stress tests cut incorrect conclusions from 9 to 3, and bridge material combined with a target-native operation yielded a positive interaction of +4.2 resolved tasks that neither factor produced alone. Domain distance did not reliably predict success; executable operation gain and valid return did.

中文摘要

摘要:数学社区处理不同的对象、不变量和工具,因此在它们之间转移问题的成本很高,经常被忽略。我们提出了 EULER,一个以这种转移——一个桥梁——为搜索单位的多智能体系统。在固定的猜想周围,EULER 运行直接、相邻领域和远距离领域的路线进行竞争;只有当桥梁提供源表示无法执行的操作,并且其目标端的证据沿检查过的蕴含关系返回到原始陈述时,它才保留预算。六个有序的压力测试在昂贵的搜索开始前拒绝无效桥梁。我们在 120 个近期猜想上评估了 EULER。这些猜想在搜索之前被冻结并进行了污染筛选,取自最近在组合理论杂志 A 系列(Journal of Combinatorial Theory, Series A),组合学的顶级期刊上发表论文的作者公开论文。EULER 生成了 10 个证明和 3 个反驳,以及 45 个范围内的部分结果。在消融实验中有两个机制得到验证:桥梁特定的压力测试将错误结论从 9 个减少到 3 个,桥梁材料与目标本地操作结合产生了 +4.2 个解决任务的正向交互,这是任何单独因素都未产生的。领域距离不能可靠地预测成功;可执行操作增益和有效返回能。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00032 (HTTP 429)

Authors: Ren Zhenzhuo

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00032.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00032

Published: 2026-09-03T01:26:49.045Z


10. When Prediction Error Is Not Enough: Evaluating Nuisance-Function Prediction for Causal Estimation

Abstract:Prediction error is widely used to evaluate nuisance-function estimators in causal inference, but its relationship with causal estimator performance may differ across performance measures. We studied this question in a partially linear model using Monte Carlo simulations. We compared ordinary least squares (OLS), generalized additive models (GAMs), XGBoost, and Double Machine Learning with XGBoost (DML-XGBoost), evaluating nuisance-function prediction error, bias, RMSE, and 95\% confidence interval coverage. We also examined a simple joint-error measure based on the absolute cross-product of estimation errors from the exposure and outcome nuisance functions. Across the simulated settings, XGBoost had the lowest RMSE among the non-oracle methods, while DML-XGBoost generally provided better confidence interval coverage. Prediction error did not consistently track causal bias across methods and settings, and the method with the best point-estimation performance did not necessarily have the best confidence interval coverage. The joint-error measure was only weakly associated with causal bias and did not provide a useful standalone measure of causal performance. These results suggest that prediction error is useful for assessing nuisance-function estimation, but it should not be treated as a direct measure of the quality of the resulting causal estimator.

中文摘要

摘要:在因果推断中,预测误差被广泛用于评估干扰函数估计器,但它与因果估计器性能之间的关系可能会因性能指标的不同而有所差异。我们在部分线性模型中使用蒙特卡洛模拟研究了这个问题。我们比较了普通最小二乘法(OLS)、广义加法模型(GAMs)、XGBoost 和双重机器学习结合 XGBoost(DML-XGBoost),评估了干扰函数预测误差、偏差、均方根误差(RMSE)和 95% 置信区间覆盖率。我们还考察了一个基于暴露和结果干扰函数估计误差绝对交叉乘积的简单联合误差度量。在模拟设定中,XGBoost 在非先验(non-oracle)方法中具有最低的 RMSE,而 DML-XGBoost 通常提供了更好的置信区间覆盖率。预测误差在方法和设定之间并未始终与因果偏差保持一致,并且具有最佳点估计性能的方法不一定具有最佳的置信区间覆盖率。联合误差度量仅与因果偏差弱相关,且不能作为独立的有效因果性能衡量指标。这些结果表明,预测误差对于评估干扰函数估计是有用的,但不应被视为衡量最终因果估计器质量的直接指标。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00071 (HTTP 429)

Authors: Cong Cao

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00071.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00071

Published: 2026-09-03T01:26:49.045Z


Evaluation Domain Papers

1. HyperWorld: Hypergraph-Structured State Serialization Improves Learned Textual World Models

Abstract:World models enable language-model agents to predict environment dynamics and plan before acting. In text environments, the model must learn symbolic action effects from serialized state descriptions, but the role of serialization structure remains underexplored. We present HyperWorld, a controlled study of state serialization for learned textual world models. We compare raw observations with three symbolic serializations of the same ground-truth state: independent sentences, pairwise triples, and entity-centered hyperedge units that group multiple related facts around entities and relations. All variants use the same training objective: given a state and an action, predict symbolic effects or judge the action infeasible. Across model scales, data budgets, and in-distribution and out-of-distribution test worlds, hyperedge serialization gives the clearest gains for 0.5B—1.5B models and under distribution shift. Larger models reduce the gap, and pairwise triples can match or slightly exceed hyperedges on in-distribution exact match, but hyperedges achieve the strongest out-of-distribution fact F1 and the best small-to-medium scale trade-off between feasibility detection and effect prediction. In downstream greedy planning, the hyperedge world model also attains the highest success rate among the tested representations. These results show that higher-order state organization is a simple but effective inductive bias for learned symbolic world models, especially when model capacity is limited or test environments differ from training.

中文摘要

摘要:世界模型使语言模型代理能够预测环境动态并在行动前进行规划。在文本环境中,模型必须从序列化状态描述中学习符号动作效果,但序列化结构的作用仍未充分研究。我们提出了 HyperWorld,这是一个关于学习型文本世界模型的状态序列化的受控研究。我们将原始观测与同一真实状态的三种符号序列化方法进行比较:独立句子、成对三元组以及围绕实体和关系将多个相关事实分组的以实体为中心的超边单元。所有变体使用相同的训练目标:给定一个状态和动作,预测符号效果或判断该动作不可行。在模型规模、数据预算以及分布内和分布外的测试世界中,超边序列化在 0.5B-1.5B 模型以及分布变化下带来了最明显的提升。更大规模的模型缩小了差距,成对三元组在分布内精确匹配上可以匹配或略微超越超边,但超边在分布外事实 F1 上表现最强,并且在可行性检测与效果预测之间实现了最佳的小型至中型规模权衡。在下游贪心规划中,超边世界模型在测试的表示中也达到了最高的成功率。这些结果表明,更高阶的状态组织是学习符号世界模型的一个简单但有效的归纳偏置,尤其是在模型容量有限或测试环境与训练环境不同的情况下。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00002 (HTTP 429)

Authors: Yun-Jian Zhang, Chen-Wei Liang, Tian-Yi Zhang, Jian Ding, Yi-Lun Wu, Ao-Bo Li, Wei-Cong Su, Saifullah, Hong-Yu An, Mu-Jiang-Shan Wang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00002.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00002

Published: 2026-09-03T01:27:10.830Z


Abstract:Machine unlearning studies the removal of knowledge from an AI model, making the system forget a concept it previously learned. Despite rapid progress in generative machine unlearning, the unintended degradation of semantically related concepts that should have been retained (henceforth, interference) remains poorly characterized and inconsistently evaluated. This paper introduces I-CARE, a methodology that formalizes interference as a first-class object of study in generative unlearning. Rather than proposing a new benchmark or unlearning algorithm, I-CARE provides formal definitions for tasks, metrics, and templates for reporting results, enabling the systematic and reproducible study of interference across unlearning settings. While our methodology is designed to remain valid as models and unlearning algorithms evolve, decoupling long-term scientific insight from transient empirical results, we present a feasibility demonstration with state-of-the-art algorithms and frequently used datasets. The results demonstrate that I-CARE enables meaningful analysis of interference patterns across multiple unlearning settings, establishing the practical applicability of the framework. The software implementation of the methodology is provided in an open-source framework, together with a web-based graphical interface that enables exploration of the outcomes of this study without requiring direct interaction with the codebase or specialized data analysis tools.

中文摘要

摘要:机器遗忘研究从人工智能模型中移除知识,使系统忘记其先前学到的某个概念。尽管生成式机器遗忘取得了快速进展,但对本应保留的语义相关概念的意外退化(以下简称干扰)仍缺乏明确的描述,并且评估不一致。本文介绍了 I-CARE,一种将干扰形式化为生成性遗忘研究中一级对象的方法。I-CARE 并非提出新的基准或遗忘算法,而是为任务、指标和结果报告模板提供了形式化定义,从而能够在各种遗忘设置中系统、可重复地研究干扰模式。虽然我们的方法设计旨在随着模型和遗忘算法的发展保持有效,将长期科学洞见与短期经验结果分离,但我们展示了使用最先进算法和常用数据集的可行性演示。结果表明,I-CARE 能够对多种遗忘设置下的干扰模式进行有意义的分析,证实了框架的实际可应用性。该方法的软件实现提供在开源框架中,同时提供基于网页的图形界面,使得无需直接与代码库或专门的数据分析工具交互即可探索本研究的结果。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00003 (HTTP 429)

Authors: Leonardo Santiago Benitez Pereira, Marcos Escudero Viñolo, Luis Herranz Arribas

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00003.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00003

Published: 2026-09-03T01:27:10.830Z


3. Discrete-Time MDP Modeling for Multi-Item Capacitated Lot Sizing with Stochastic Demand Timing

Abstract:This paper studies a finite-horizon multi-item capacitated lot-sizing problem in which demand quantities are deterministic, while demand-arrival periods are stochastic. Each demand occurs once within a known time window and must be satisfied no later than its deadline. The proposed model makes production and allocation decisions at the demand level, allowing it to represent capacity competition, demand-specific backlog, and allocation-dependent inventory dynamics. The stochastic problem is formulated as a discrete-time Markov decision process (DTMDP), including the state space, feasible actions, transition kernel, and one-period cost function. To isolate the computational effect of stochastic timing, each stochastic instance is first compared with a deterministic counterpart in which each arrival distribution is replaced by its most likely arrival period. This comparison shows that stochastic timing substantially increases the number of states, the number of transitions, solution time, and memory pressure. A genetic algorithm (GA) is then proposed for the stochastic-timing problem. The GA searches over feasible state-feedback policies and evaluates each policy exactly under the DTMDP transition model. Computational experiments on 330 benchmark instances show that the GA remains close to the exact stochastic solution whenever the latter is available, with an average optimality gap of about $3.44\%$. On the difficult benchmark instances, comprising 90 test cases, the GA remains below the $5\%$ optimality-gap threshold and achieves an average optimization speedup of $6.89 \pm 1.41$ at the $95\%$ confidence level. For instances that cannot be solved exactly on the available hardware, an empirical Bellman-time regression is used to estimate the missing exact resolution time and extrapolate the expected GA speedup.

中文摘要

摘要:本文研究了一个有限视野多项目容量批次大小问题,其中需求数量是确定性的,而需求-到达周期是随机的。每个需求在已知时间窗口内出现一次,且必须不晚于其截止时间内满足。所提出模型在需求层面做出生产和分配决策,使其能够表示产能竞争、需求特定积压以及依赖分配的库存动态。随机问题被表述为离散时间马尔可夫决策过程(DTMDP),包括状态空间、可行行动、过渡核和单周期成本函数。为隔离随机时序的计算效应,首先将每个随机实例与确定性对应实例进行比较,后者将每个到达分布替换为其最可能的到达周期。比较显示随机时序显著增加了状态数量、转移次数、解时间和记忆压力。随后提出了一个遗传算法(GA)用于随机时序问题。GA搜索可行的状态反馈策略,并精确地根据DTMDP转换模型评估每个策略。对330个基准实例的计算实验表明,只要随机解可用,GA仍接近精确随机解,平均最优差距约为3.44%美元。在包含90个测试案例的复杂基准实例中,GA保持在5%%的最优差距阈值以下,在95%%%置信水平下实现平均优化加速6.89 \ 1.41美元。对于无法在现有硬件上精确求解的实例,采用经验贝尔曼时间回归来估算缺失的精确解析时间并外推预期的GA加速。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00004 (HTTP 429)

Authors: Léa Bayati, Mohamed Dahmoune, Melek Rodoplu

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00004.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00004

Published: 2026-09-03T01:27:10.830Z


4. Incremental Risk Assessment of Progressive Elder Financial Scams via Instruction-Tuned Small Language Models

Abstract:Financial scams targeting older adults increasingly occur through text and voice channels such as email, SMS, and phone calls, unfolding over multiple conversational turns that begin with impersonation or casual contact, escalate through trust building and urgency, and culminate in requests for sensitive information or financial transfers. Because risk signals emerge incrementally across turns, effective detection requires models that continuously update risk estimates under resource-constrained deployment settings. We propose a cumulative turn-based risk assessment framework that incrementally aggregates conversational turns and re-estimates risk at each step, enabling dynamic scam monitoring across progressively evolving conversations. A multi-turn dialogue dataset is constructed to cover investment, charity, and tech support scam scenarios, with each dialogue containing two to eight turns and annotated at every cumulative stage with a qualitative risk level, a continuous risk score, an explanatory rationale, and a safety recommendation. Four small language models (Phi-4, LLaMA-3.2, DeepSeek-R1, and Qwen3) are fine-tuned and evaluated under a unified training framework. Fine-tuned small models capture fraud-related linguistic cues and cross-turn escalation patterns while maintaining compact architectures suitable for mobile and resource-constrained deployment settings. Among the evaluated models, Phi-4 and LLaMA-3.2 achieve stronger turn-aware risk estimation performance relative to their parameter scale. These results suggest that structured cumulative modeling can support incremental scam risk assessment in deployment-oriented settings while highlighting the potential of compact language models for privacy-aware and on-device fraud protection.

中文摘要

摘要:针对老年人的金融诈骗越来越多地通过电子邮件、短信和电话等文本和语音渠道发生,通常经过多轮对话展开,从冒充或随意联系开始,通过建立信任和制造紧迫感逐步升级,最终以索取敏感信息或进行财务转账告终。由于风险信号是在多轮对话中逐步显现的,因此有效的检测需要在资源受限的部署环境中持续更新风险估计的模型。我们提出了一种基于累计回合的风险评估框架,该框架逐步聚合对话回合,并在每一步重新评估风险,从而实现对逐渐发展的对话的动态诈骗监控。构建了一个多轮对话数据集,涵盖投资、慈善和技术支持等诈骗场景,每个对话包含两到八轮回合,并在每个累积阶段标注定性风险等级、连续风险评分、解释性理由和安全建议。对四个小型语言模型(Phi-4、LLaMA-3.2、DeepSeek-R1 和 Qwen3)在统一训练框架下进行了微调和评估。微调后的小模型能够捕捉与诈骗相关的语言线索和跨轮升级模式,同时保持适合移动端和资源受限部署环境的紧凑架构。在评估的模型中,Phi-4 和 LLaMA-3.2 在多轮风险估计性能上相对于其参数规模表现更强。这些结果表明,结构化的累计建模可以支持面向部署环境的增量诈骗风险评估,同时凸显了紧凑语言模型在隐私保护和设备端防诈骗方面的潜力。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00005 (HTTP 429)

Authors: Parviz Ghafariasl, Weimin Fu, Xiaolong Guo, Shing I. Chang

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00005.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00005

Published: 2026-09-03T01:27:10.830Z


5. Long-Horizon State Tracking in LLMs: Executing MD5 through a Deep Sequence of Dependent Tool Calls

Abstract:Long-horizon tasks remain uncommon in large language model (LLM) evaluation, and for a reason: when each step depends on the last, per-step accuracy that looks excellent in isolation decays catastrophically, as errors cascade and the end-to-end failure probability grows sharply with length. Existing agentic benchmarks report end-to-end success but confound this state-tracking difficulty with instruction interpretation, give no control group that isolates it, and are vulnerable to shortcuts such as a hallucinated final answer, so they cannot say why a long run fails. Whether an LLM can carry exact intermediate state across many tool calls at all is itself not well established. We test this cleanly by having the model compute a cryptographic hash, MD5, step by step: a sequence of $196$ dependent tool calls over $64$ rounds while it carries four $32$-bit words $(a,b,c,d)$ in its own context from one call to the next. Interpretation is trivial and, because we implement MD5 from scratch (RFC~1321), we align every call to the ground-truth trace and check the digest to the bit, so any failure is pure bookkeeping. gpt-oss-120b, a mixture-of-experts model with only $\sim$5.5B active parameters per token, at temperature $0$ with a short fixed prompt, carries the full state across all $196$ calls and returns the correct digest on a majority of completed runs. In the strongest setting we replace every primitive tool with a second LLM, so a driver and a worker compute the whole hash from scratch with no exact-arithmetic oracle in the loop. Two ingredients decide success and neither changes the weights: keeping the model’s own reasoning in its context each turn, and voting over a thinking-enabled worker to remove its modular-arithmetic slips. We localize the residual failures by origin, separating state-carrying from arithmetic and from serving.

中文摘要

摘要:长周期任务在大型语言模型(LLM)评估中仍然不常见,这是有原因的:当每一步都依赖于上一步时,单步准确率在孤立情况下看起来非常好,但会出现灾难性衰减,因为错误会级联,并且端到端的失败概率随着任务长度急剧增加。现有的代理基准报告了端到端的成功率,但将这种状态跟踪难度与指令理解混淆在一起,没有提供能够隔离这种难度的对照组,并且容易受诸如虚构的最终答案等捷径影响,因此它们无法说明长程运行为什么会失败。LLM是否可以在多次工具调用中保持精确的中间状态本身尚未得到充分验证。我们通过让模型逐步计算加密哈希MD5来进行干净的测试:在$64$轮中进行$196$次相关联的工具调用,同时让模型在自己的上下文中从一次调用到下一次调用携带四个$32$位字($a,b,c,d$)。解释非常简单,因为我们从头实现了MD5(RFC~1321),所以我们将每次调用与真实轨迹对齐,并精确检查摘要的每一位,因此任何失败都是纯粹的记账问题。gpt-oss-120b是一个专家混合模型,每个令牌只有约$5.5$B的活跃参数,在温度$0$且固定短提示下,它可以在全部$196$次调用中携带完整状态,并在大多数完成的运行中返回正确的摘要。在最强的设置中,我们将每个原始工具替换为第二个LLM,因此驱动器和工作器从零开始计算整个哈希,不在循环中使用精确算术的预言机。成功的两个关键因素都不会改变模型权重:每轮将模型自身的推理保留在其上下文中,以及对启用思考的工作器进行投票以消除其模运算错误。我们按来源定位残留失败,将状态传递问题与算术错误及服务不同开来。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00012 (HTTP 429)

Authors: Dheeraj Mohandas Pai, Lu Xian

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00012.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00012

Published: 2026-09-03T01:27:10.830Z


6. OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets

Abstract:AI agents powered by large language models are evolving from isolated assistants into heterogeneous systems in which multiple agents, planners, tools, and execution backends operate over shared environments. In such settings, safety becomes a system-level action-governance problem: deciding whether a pending action should be committed given policy-relevant state accumulated across a session. Existing safeguards operate at fragmented boundaries, making it difficult to enforce shared policies over composed action flows across heterogeneous execution paths. We present OpenAgentFlow, a control-plane/action-plane architecture that establishes the action-commit boundary as a shared enforcement interface. GUI, API, tool, and LLM-generated actions are normalized into a common AgentEvent stream and mediated by a shared pre-execution Policy Enforcement Point, while provenance, session state, audit evidence, and updatable policies are maintained outside individual agents. This provides a common governance layer across incompatible executors and allows new policies to take effect without modifying agents, prompts, models, or execution paths. We evaluate OpenAgentFlow through complementary system evaluations spanning controlled action-flow tests, a public external benchmark, policy updates, and real Android execution. On a 300-case controlled suite, OpenAgentFlow achieves 94.00% accuracy and a 95.35% attack-block rate. On the complete 1,220-case AgentDojo-Traj split of TS-Bench, it achieves 97.62% accuracy, 96.59% unsafe-action recall, and a 1.96% safe false-intervention rate. New control-plane rules take effect without modifying protected agents, and the same enforcement path operates across live GUI, API/tool, and LLM-planned Android execution. These results show that a shared action-commit boundary provides a practical basis for system-wide governance across heterogeneous agent execution paths.

中文摘要

摘要:由大型语言模型驱动的AI代理正在从孤立的助手演变为异构系统,其中多个代理、规划器、工具和执行后端在共享环境中运行。在这种环境下,安全性成为系统级的动作治理问题:基于跨会话累积的与政策相关的状态决定是否提交待执行的动作。现有的安全防护措施在分散的边界上运作,使得在异构执行路径中对组合动作流程强制实施共享政策变得困难。我们提出了OpenAgentFlow,一种控制平面/动作平面架构,将动作提交边界建立为共享的执行接口。GUI、API、工具和LLM生成的动作被规范化为一个通用的AgentEvent流,并通过共享的预执行政策执行点进行调节,同时来源、会话状态、审计证据和可更新政策维持在个体代理之外。这提供了跨不兼容执行器的通用治理层,并允许新政策在不修改代理、提示、模型或执行路径的情况下生效。我们通过互补的系统评估对OpenAgentFlow进行了评测,包括受控动作流程测试、公开外部基准、政策更新以及实际Android执行。在300案例的受控测试套件上,OpenAgentFlow实现了94.00%的准确率和95.35%的攻击阻止率。在TS-Bench的完整1,220案例AgentDojo-Traj拆分上,它实现了97.62%的准确率、96.59%的不安全动作召回率,以及1.96%的安全误干预率。新的控制平面规则在不修改受保护代理的情况下生效,并且相同的执行路径适用于实时GUI、API/工具和LLM规划的Android执行。这些结果表明,共享动作提交边界为异构代理执行路径的系统级治理提供了可行的基础。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00015 (HTTP 429)

Authors: Dongsheng Chen, Xiangyu Zhao, Xin Yao, Xuetao Wei

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00015.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00015

Published: 2026-09-03T01:27:10.830Z


7. SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces

Abstract:Computer science papers rely heavily on diagrams: architecture drawings, system flowcharts, and pipeline schematics that often carry more information than the text around them. There is currently no public dataset that pairs this specific kind of figure with captions, context, questions, answers, and step-by-step reasoning, which is exactly what is needed to train a vision-language model to understand them. We present \textbf{SCAFFOLD}\footnote{this https URL}, a large-scale structured dataset of computer science research figures with diagram QA and Chain-of-Thought reasoning traces. This dataset consists of (image, caption, context, question-answer, chain-of-thought) tuples from arXiv computer science papers prepared using layout detection and PDF parsing, with an AI-assisted question-generation step. The resulting large-sized SCAFFOLD-157K dataset spans 3,058 papers with 29,887 figures (157,387 pairs), a medium-sized SCAFFOLD-37K dataset (36,797 pairs), and a small-sized SCAFFOLD-12K dataset (12,000 pairs). We used SCAFFOLD-12K for baseline experiments on Qwen2.5-VL-3B-Instruct.

中文摘要

摘要:计算机科学论文在很大程度上依赖图表:架构图、系统流程图以及管道示意图,这些图表通常承载的信息比周围的文本更多。目前尚无公开数据集将这种特定类型的图形与标题、上下文、问题、答案以及逐步推理配对,而这恰恰是训练视觉-语言模型以理解它们所需的。我们提出了\textbf{SCAFFOLD}\footnote{this https URL},一个大型结构化计算机科学研究图形数据集,包含图表问答和思维链推理轨迹。该数据集由来自arXiv计算机科学论文的(image, caption, context, question-answer, chain-of-thought)元组组成,通过布局检测和PDF解析准备,并附有AI辅助的问题生成步骤。得到的大型SCAFFOLD-157K数据集覆盖3,058篇论文,共29,887幅图(157,387对),中型SCAFFOLD-37K数据集(36,797对),以及小型SCAFFOLD-12K数据集(12,000对)。我们使用SCAFFOLD-12K对Qwen2.5-VL-3B-Instruct进行了基线实验。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00018 (HTTP 429)

Authors: Ranjit Raut, Aarav Subedi, Sagun Rai, Sudan Jha

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00018.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00018

Published: 2026-09-03T01:27:10.830Z


8. UI-Venus-2 Technical Report

Abstract:Multimodal GUI agents have emerged as a promising paradigm for digital task automation, yet transitioning from benchmark-oriented models to dependable real-world applications remains challenging due to limited environment coverage, brittle task construction, and unreliable reward verification. In this work, we present UI-Venus-2, a general-purpose foundation GUI agent designed to operate across mobile, web, and desktop environments through a unified closed-loop reasoning-action framework. To bridge the gap toward practical deployment, we jointly scale three critical dimensions: (1) Environments, expanding coverage to more than 170 multilingual mobile apps and native desktop operating systems; (2) Tasks, employing a deep-research pipeline for function-grounded instruction generation; and (3) Verification, adopting trace-level and sample-level evaluators with visual keypoints and multi-model voting to ensure reliable RL signals for training. Furthermore, we integrate safety-aware mechanisms to ensure controlled execution of consequential actions. By offering a capable, efficient, and open-source foundation, UI-Venus-2 advances the field toward more generalizable, verifiable, and self-reflective agents for real-world applications.

中文摘要

摘要:多模态 GUI 代理已成为数字任务自动化的有前景的范式,但由于环境覆盖有限、任务构建脆弱以及奖励验证不可靠,从面向基准的模型过渡到可依赖的现实应用仍然具有挑战性。在本工作中,我们提出了 UI-Venus-2,一种通用基础 GUI 代理,旨在通过统一的闭环推理-动作框架在移动、网页和桌面环境中运行。为了弥合朝向实际部署的差距,我们在三个关键维度上同步扩展:(1)环境,将覆盖范围扩展到 170 多个多语言移动应用程序和原生桌面操作系统;(2)任务,采用功能为基础的深度研究指令生成管线;(3)验证,采用基于轨迹和样本的评估器,通过视觉关键点和多模型投票确保训练所需的可靠 RL 信号。此外,我们还整合了安全感知机制,以确保关键操作的受控执行。通过提供一个功能强大、高效且开源的基础,UI-Venus-2 推动该领域向更通用、可验证和自我反思的适用于现实应用的代理发展。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文旨在解决多模态 GUI 智能体(Multimodal GUI agents)从\*\*面向基准的模型\*\*向\*\*可靠的现实世界应用\*\*过渡时面临的根本性挑战。具体而言,论文识别出以下三个紧密耦合的核心瓶颈: - \*\*环境覆盖不足(Limited Environment Coverage)\*\* 现有工作往往局限于小规模、单一领域的应用集合(如少量英文应用或特定网站),难以覆盖真实场景中多语言移动生态、动态网页及完整桌面操作系统的多样性。 - \*\*任务构建脆弱且难以扩展(Brittle Task Construction)\*\* 生成的大规模任务查询常与实际应用功能脱节,导致指令在动态变化的界面状态下不可执行,缺乏对真实功能 grounding 的可扩展任务合成机制。 - \*\*奖励验证不可靠(Unreliable Reward Verification)\*\* 用于强化学习的验证信号过于粗糙(如仅依赖最终状态的二元成功/失败标签),容易将部分进展误判为完成、忽略任务关键视觉证据,或产生可被策略利用的脆弱奖励信号,从而影响 RL 训练的可靠性。 为系统性克服上述障碍,论文提出 \*\*UI-Venus-2\*\*,通过统一的闭环推理-行动框架,\*\*联合扩展\*\*环境(覆盖 170+ 多语言移动应用及原生桌面 OS)、任务(基于深度研究的功能 grounding 指令生成)与验证(引入轨迹级和样本级评估器,结合视觉关键点和多模型投票)三个维度,并集成安全感知机制,以构建更具通用性、可验证性和自我反思能力的 GUI 智能体基础模型。 Q2: 有哪些相关研究? 根据论文第5节,相关研究围绕以下六个核心方向展开: ### 1. Mobile Use(移动设备使用) 早期研究主要依赖静态截图、记录轨迹或固定基准进行可复现的测量,但仅部分反映实际交互。近期工作转向在真实应用和动态设备环境中评估智能体,其中界面状态、应用版本、语言、账户及中断因素均可能影响执行。代表性研究包括: - \*\*UI-TARS\*\* (Qin et al., 2025) - \*\*UItron\*\* (Zeng et al., 2025) - \*\*GUI-Xplore\*\* (Sun et al., 2025b) - \*\*Aria-UI\*\* (Yang et al., 2024) - \*\*OS-Genesis\*\* (Sun et al., 2025a) - \*\*AutoGLM\*\* (Liu et al., 2024) - \*\*Step-GUI\*\* (Yan et al., 2025) - \*\*Xiaomi-GUI-0\*\* (Cao et al., 2026) - \*\*HyMobileAgent\*\* (Team et al., 2026b) ### 2. Computer Use(计算机使用/桌面环境) 桌面系统与专业软件通常比移动应用具有更密集的界面和更丰富的动作空间,任务可能涉及键盘快捷键、文件操作、文本选择、拖拽、窗口管理及跨应用协调,需要全面的状态理解、规划、记忆与错误恢复能力。代表性研究包括: - \*\*OpenCUA\*\* (Wang et al., 2025b) - \*\*UltraCUA\*\* (Yang et al., 2026) - \*\*EvoCUA\*\* (Xue et al., 2026) - \*\*Qwen-UI-Agent\*\* (Zhou et al., 2026) - \*\*GUI-Owl-1.5 / Mobile-Agent-v3.5\*\* (Xu et al., 2026) - \*\*多轮RL优化工作\*\* (Li et al., 2025b) ### 3. Web Navigation(网页导航) 实时网页环境具有固有不确定性:网络故障可能中断执行、内容实时更新、认证流程、弹窗、广告或区域差异均可能改变交互路径。跨站点任务进一步增加了不确定性。代表性研究包括: - \*\*MolmoWeb\*\* (Gupta et al., 2026) - \*\*FARA-7B / FARA-1.5\*\* (Awadallah et al., 2025, 2026) - \*\*BrowserAgent\*\* (Yu et al., 2025) - \*\*Wuying-browser-agent\*\* (Team et al., 2026a) - \*\*Browser-use\*\* (Müller & Žuniˇc, 2024) - \*\*Web Agents 综述\*\* (Ning et al., 2025) ### 4. GUI Grounding(GUI 视觉定位) 在高分辨率屏幕和专业软件中,精确的元素定位与领域知识对于区分密集或视觉相似的控件至关重要。目标可能具有歧义、与描述不符或不存在于当前屏幕。代表性研究包括: - \*\*UI-R1\*\* (Lu et al., 2025) - \*\*GUI-R1\*\* (Luo et al., 2025a) - \*\*InfiGUI-R1\*\* (Liu et al., 2025) - \*\*GUI-G1 / GUI-G2\*\* (Zhou et al., 2025c; Tang et al., 2025a) - \*\*LPO\*\* (Tang et al., 2025b) - \*\*OmegaUse\*\* (Zhang et al., 2026a) - \*\*MAI-UI / VenusBench-GD\*\* (Zhou et al., 2025b) - \*\*Autofocus\*\* (Yao et al., 2026) - \*\*Holo2\*\* (H-Company, 2025) - \*\*GTA1\*\* (Yang et al., 2025a) - \*\*MVP\*\* (Zhang et al., 2026b) - \*\*Vista\*\* (Qiu et al., 2026b) ### 5. CAPTCHA Solving(验证码解决) 现代验证码已从扭曲文本识别扩展到有序点击、旋转、滑块、拖拽及空间推理。视觉-语言模型通过共享的视觉理解与 GUI 动作应对多种格式,但基准性能未必反映实际部署中的交互模式。代表性工作涉及: - \*\*Seed2.0 / Seed2.1\*\* (Seed, 2026; ByteDance Seed, 2026) - \*\*Qwen3.8-max\*\* (Qwen Team, 2026d) - \*\*Kimi K2.6\*\* (Moonshot AI, 2026a) - \*\*Claude 4\*\* (Anthropic, 2025) ### 6. GUI Agent Safety(GUI 智能体安全) 现实部署中,尤其是计算机使用智能体,其动作可能对用户造成昂贵后果,因此安全评估至关重要。早期评估主要考察智能体在显式风险或对抗性场景中避免有害动作的能力;近期工作进一步揭示,看似良性的指令在环境潜藏风险下也可能导致有害后果。代表性研究包括: - \*\*AgentHarm\*\* (Andriushchenko et al., 2025) - \*\*InjecAgent\*\* (Zhan et al., 2024) - \*\*OS-Harm\*\* (Kuntz et al., 2026) - \*\*OSBlind\*\* (Ding et al., 2026) - \*\*SafeAgentBench\*\* (Yin et al., 2024) Q3: 论文如何解决这个问题? 为解决多模态 GUI 智能体从基准测试走向实际应用中的环境覆盖不足、任务构建脆弱与验证不可靠三大瓶颈,论文提出了 \*\*UI-Venus-2\*\*,其解决方案可概括为以下核心方面: ### 1. 统一闭环推理–行动框架 UI-Venus-2 采用统一的闭环范式:智能体观察当前界面截图,进行状态推理,执行结构化动作,并将环境反馈纳入下一步决策。该框架覆盖移动应用、网页浏览器和桌面操作系统三大平台,通过共享的视觉感知与动作空间实现跨平台通用性。 ### 2. 三阶段统一训练流水线 模型训练遵循从基础能力注入到领域特化、再到能力融合的三阶段策略: - \*\*Stage I:多模态中期训练(Multimodal Mid-Training)\*\* 在大规模异构的合成与交互数据上进行监督微调,以移动、网页和 OS 导航任务为主导。通过模拟广泛的交互环境,结合基于种子查询与功能 grounding 的任务构造,并利用人机协同的轨迹验证过滤低质量交互,注入基础的 GUI 理解与长程规划能力。 - \*\*Stage II:离线强化学习(Offline Reinforcement Learning)\*\* 针对移动、OS 和网页环境,构建大规模\*\*步骤级\*\* RL 轨迹,优化状态感知的动作选择、多步导航一致性与执行可靠性。对于 CAPTCHA 和 Grounding 任务,则利用程序化合成框架,将经过验证的验证码实例与定位目标嵌入真实背景界面中,提供可密集采样的可靠动作级监督。 - \*\*Stage III:多教师在线策略蒸馏(Multi-teacher On-policy Distillation, MOPD)\*\* 为融合来自不同任务分布与训练阶段的能力,同时避免直接合并独立专家导致的干扰,UI-Venus-2 采用学生自采样、教师评分的在线蒸馏范式。针对 GUI 智能体的特殊性,论文进一步引入两项关键设计: \*\*(a) 结构化动作感知蒸馏(Structured Action-Aware Distillation)\*\* 由于动作是改变环境的唯一接口,而动作 token 在响应中占比极小,论文对动作片段施加自适应权重: - 若完整动作正确,则抑制其蒸馏信号; - 若动作类型正确但参数错误,则加强对动作跨度的监督; - 若动作类型错误,则强调类型 token 并屏蔽下游参数(因其语义依赖于类型)。 这确保监督信号集中于需要修正的可执行行为,而非均匀分散在整个响应上。 \*\*(b) 教师侧动作类型条件化(Teacher-Side Action-Type Conditioning)\*\* 在教师评分时,向教师提示追加正确的动作类型提示 h(z^*) ,但该提示\*\*不出现在学生输入中\*\*。蒸馏优势计算为:

At^(hint) = sg[ log π(Td)(y_t mid P_T(x, z^*), y(<t)) - log πθ(y_t mid P_S(x), y(<t)) ],
其中 Td 为领域 d 的冻结教师, πθ 为学生策略, P_T(x, z^) 为带提示的教师输入, P_S(x) 为原始学生输入,$sg
·
$ 表示阻断梯度。该设计使教师能够提供更精确的结构化动作监督。 ### 3. 联合扩展三大关键维度 - \
*环境(Environments)** 将可执行环境池大幅扩展至 **170+ 个多语言移动应用**(100+ 中文、70+ 英文)及**原生桌面操作系统**,覆盖日常和专业软件的复杂交互场景。 - **任务(Tasks)** 提出基于**深度研究(deep-research)**的查询生成策略:聚合官方文档、帮助页面、用户讨论与历史任务证据,构建动态更新的应用功能目录(capability catalog)。任务生成以可用功能为 grounding,确保指令与真实应用能力对齐;同时通过有效性门控(validity gate)拦截包含不支持功能、模糊目标或缺失依赖的不可执行任务。 - **验证(Verification)** 建立两级验证框架以提供可靠的 RL 奖励信号: **(a) 轨迹级验证:语义引导验证(Semantic Guided Verification, SGV)** 不依赖智能体自我报告的成功状态,而是从任务目标中提取可验证的关键点(keypoints),将轨迹分割为固定窗口,利用多模态模型并行判断各窗口满足哪些关键点,并结合硬规则与多模态终局判断,将轨迹分类为完成/部分完成/不可行/失败。该机制不仅用于数据筛选,还通过反馈闭环动态更新功能目录与任务生成策略。 **(b) 样本级验证(Sample-level Verification)** 在动作执行前进行先验判断,基于当前截图、声明的动作类型与目标、推理过程和任务目标,将每一步分类为:正确(Correct)、探索性(Exploratory)、无效(Ineffective)或错误(Incorrect)。通过区分通用操作(如启动应用、滚动)与任务特定操作,确保“部分信用”仅反映真实的任务相关进展,避免粗糙的二元标签误导强化学习。 ### 4. 安全感知执行机制 针对现实部署中的潜在风险,UI-Venus-2 集成了**安全感知机制**,对具有重大后果的动作实施更可靠的控制。在 OSHarm 和 OSBlind 等安全基准上的评估表明,该机制在抵御显式攻击(如提示注入)和识别良性指令中的安全盲点方面均显著优于基线模型。 ### 5. 系统化数据生成与迭代闭环 论文设计了一个三阶段数据生成框架: 1. **功能目录构建**:冷启动阶段聚合异构来源的应用证据,运行时动态更新页面状态、UI 控件约束与失败案例; 2. **任务构造**:基于当前目录采样生成单能力、复合、查询式、批处理和场景式任务,并通过严格约束保证可执行性; 3. **轨迹采集**:在真实环境中执行,成功与失败均产生结构化反馈回写至目录,驱动下一轮采样向未充分探索的能力与先前失败场景倾斜。 针对桌面环境的特殊复杂性,还引入了任务规格序列化(TaskSpec)、确定性环境设置、分层子目标分割与跨会话依赖管理;针对 CAPTCHA,则通过类型特定的规则引擎与渲染器合成可验证谜题,确保可解性与坐标标注的确定性。 综上,UI-Venus-2 通过**统一框架**、**三阶段训练**、**三维联合扩展**与**精细化验证**,系统性解决了 GUI 智能体在环境覆盖、任务质量与奖励可靠性方面的关键障碍,推动其向可部署的通用计算机使用智能体迈进。 Q4: 论文做了哪些实验? 论文在 **6 大核心领域** 上开展了系统性实验,涵盖 **移动设备使用、桌面计算机使用、网页导航、GUI 视觉定位、验证码求解** 以及 **智能体安全性**。实验将 UI-Venus-2(9B 与 27B 两个规模)与当前主流通用多模态大模型(General VLMs)及专用 GUI 模型(GUI-specific Models)进行了全面对比。 —- ### 1. 实验设置 #### 1.1 实现细节 - 推理温度:通用智能体任务设为 **1.0**, grounding 任务设为 **0** 以保证确定性输出; - 推理模式:通用任务默认启用深度推理模式(`think`),完整推理历史保留并反馈至上下文;grounding 与 CAPTCHA 任务按需关闭推理或启用多动作解析; - 视觉分辨率:采用 Qwen3.5 默认配置。 #### 1.2 评测基准 实验共涉及 **21 个公开或自研基准**,具体包括: - **移动使用(Mobile Use)**:MobileGym、VenusBench-Mobile、AndroidWorld、MobileWorld、KnowUBench、MemGUI - **计算机使用(Computer Use)**:OSWorld-Verified、DeskCraft、OSWorld 2.0 - **网页导航(Web Navigation)**:WebVoyager、Online-Mind2Web、REAL、Odysseys - **GUI 定位(GUI Grounding)**:VenusBench-GD、ScreenSpot-Pro、OSWorld-G-R、UI-Vision - **验证码求解(CAPTCHA Solving)**:VenusBench-CAPTCHA(自研)、MCA-Bench、Spatial-CAPTCHA-Bench、NextGen-CAPTCHAs、Open CaptchaWorld - **智能体安全(GUI Agent Safety)**:OSHarm、OSBlind —- ### 2. 主要实验结果 #### 2.1 移动设备使用(Mobile Use) | 基准 | UI-Venus-2-27B 表现 | 关键对比 | |———|——————————-|—————| | **MobileGym** | **60.5%** | 超越 Seed-2.0-Pro(52.0%)8.5 个百分点,领先此前最优 GUI 专用模型(21.5%)近 39 个百分点 | | **VenusBench-Mobile** | **48.7%** | 超越 Claude-Opus-4.6(36.5%)与 Kimi-K2.6(31.2%) | | **AndroidWorld** | **84.0%** | 在接近饱和的基准上仍较前最优(77.6%)提升 6.4 个百分点 | | **MobileWorld** (50步/100步) | **76.1% / 82.9%** | 27B 模型领先 GPT-5.6-Sol(70.1%)等通用模型;9B 模型达 65.8% / 75.2% | | **KnowUBench** | **59.7%** | 超越 Seed-2.0-Pro(51.6%),显示个性化辅助能力优势 | | **MemGUI** | **70.3%** | 显著领先 Seed-2.0-Pro(65.6%)及 Kimi-K2.6(39.1%),在记忆密集型场景中优势突出 | #### 2.2 计算机使用(Computer Use) - **OSWorld-Verified**:UI-Venus-2-27B 达到 **80.5%**,超越 Qwen-UI-Agent-27B(79.5%)、Seed-2.1-Pro(78.8%)与 GPT-5.5(78.7%),仅次于 Claude-Opus-4.8(83.4%)。 - **DeskCraft**:UI-Venus-2-27B 取得 **55.5%**,大幅领先 Kimi-K2.6(41.4%)与 Seed-2.0-Pro(40.0%),创该基准最优成绩。 - **OSWorld 2.0**:在 150 步预算下,27B 模型的 Partial Score 为 **13.2%**,Binary Accuracy 为 **2.8%**。Partial Score 超越多数基线(如 Claude-Sonnet-4.6 为 20.0%,但 UI-Venus-2 优于 Qwen 与 Seed 系列),显示在长程复杂桌面工作流中仍有提升空间。 #### 2.3 网页导航(Web Navigation) - **WebVoyager**:UI-Venus-2-27B 达到 **93.4%**,刷新最优纪录,超越 Fara1.5-27B(89.3%)与 GPT-5-SoM(90.6%);9B 模型亦达 **90.8%**。 - **Online-Mind2Web**:27B 模型取得 **78.3%**,9B 模型为 **74.0%**,均超越同规模或更大规模的专用模型。 - **REAL**:27B 模型以 **80.2%** 创纪录,超越此前最优(74.4%)5.8 个百分点。 - **Odysseys**:27B 模型在 Averaged Rubric Score 上达 **80.4**,Perfect Score 达 **66.3**,分别领先此前最优(68.9 / 44.5)11.5 与 21.8 个百分点,展现极强的长程跨站导航能力。 #### 2.4 GUI 视觉定位(GUI Grounding) | 基准 | UI-Venus-2-27B | 关键对比 | |———|————————|—————| | **VenusBench-GD** | **80.1%** | 超越 UI-Venus-1.5-30B-A3B(75.0%)与 Qwen-UI-Agent-27B(76.6%) | | **ScreenSpot-Pro** | **74.1%** | 仅次于 Qwen-UI-Agent-27B(76.6%),但超越 Qwen-3.7-Plus(68.9%)与 Seed-2.1-Pro(65.3%) | | **OSWorld-G-R** | **79.1%** | 在 GUI 专用模型中最高 | | **UI-Vision** | **66.9%** | 仅次于 Qwen-UI-Agent-27B(70.0%),较 UI-Venus-1.5-30B-A3B 提升 12.2 个百分点 | #### 2.5 验证码求解(CAPTCHA Solving) 所有结果均以 **Pass@1 (%)** 报告: - **VenusBench-CAPTCHA**:27B 与 9B 分别达 **79.9%** 与 **78.1%**,远超 Qwen3.6-27B(53.0%)与 Seed-2.0-Pro(47.9%)。 - **MCA-Bench**:27B 达 **79.6%**,9B 达 **75.7%**,较最优通用模型(51.7%)分别领先 27.9 与 24.0 个百分点。 - **Spatial-CAPTCHA-Bench**:27B 为 **48.6%**,超越 Seed-2.0-Pro(43.8%);9B 为 **42.8%**,显著优于同规模 Qwen3.5-9B(4.9%)。 - **NextGen-CAPTCHAs**:27B 达 **54.5%**,9B 达 **47.6%**,而最强通用基线 Seed-2.0-Pro 仅 20.4%,9B 模型已超越基线一倍以上。 - **Open CaptchaWorld**:27B 为 **56.3%**,与 Seed-2.0-Pro(55.6%)接近,但仍保持领先。 #### 2.6 智能体安全性(GUI Agent Safety) 以 **攻击成功率(ASR, 越低越好)** 评估: | 基准 | UI-Venus-2-27B | UI-Venus-2-9B | 关键对比 | |———|————————|———————-|—————| | **OSHarm** | **15.3%** | **11.3%** | 显著优于 Qwen3.5-27B(18.0%)、EvoCUA-32B(33.3%)等 | | **OSBlind** | **47.9%** | **48.8%** | 将基线模型普遍 80%-93% 的 ASR 降低近一半,展现对”安全盲点”的识别能力 | —- ### 3. 实验结论 实验结果表明,通过在**环境覆盖、任务分布与验证机制**三个维度上的联合扩展,UI-Venus-2 在几乎所有评测基准上均达到或接近当前最优水平,尤其在以下方面表现突出: - **跨平台通用性**:在移动、桌面、网页三大领域同时保持领先; - **高效率**:9B 小规模模型在多数任务上即可媲美甚至超越更大规模的通用模型; - **长程复杂任务**:在 MobileWorld、Odysseys、DeskCraft 等长程基准上优势显著; - **细粒度定位与验证码**:通过合成数据与专用 RL 训练,实现了高精度的空间定位与端到端验证码操作; - **安全性**:在显式攻击与隐式安全盲点场景下均实现了更低的攻击成功率。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与讨论,以下若干方向值得学术界与工业界进一步深入探索: ### 1. 长程复杂桌面任务的规划与执行能力 OSWorld 2.0 的结果表明,UI-Venus-2-27B 的 Binary Accuracy 仅为 **2.8%**,Partial Score 为 **13.2%**,与 GPT-5.5(13.0% / 46.7%)及 Claude-Opus-4.7(4.6% / 20.3%)相比仍存在显著差距。这揭示出在需要协调数百步动作、跨多个桌面应用、处理动态环境与流式更新的长程真实工作流中,智能体的**全局规划、状态记忆、进度评估与错误恢复**能力仍是核心瓶颈。未来可探索分层规划架构、显式记忆机制或基于模型的树搜索来增强长程稳定性。 ### 2. 空间推理与视觉-几何理解 在 Spatial-CAPTCHA-Bench 上,即使最优模型也仅达到 **48.6%** 的 Pass@1。论文明确指出,**参考系变换、视角选取与多步空间变换**仍是所有模型的主要错误来源。这暗示当前视觉编码器在深度空间关系与几何推理方面存在固有局限。后续研究可尝试引入显式的 3D 视觉理解模块、几何辅助训练目标,或针对空间变换的专用数据增强与课程学习策略。 ### 3. 安全对齐与有害行为识别 尽管 UI-Venus-2 在 OSHarm 与 OSBlind 上将攻击成功率(ASR)大幅降低,但在 **OSBlind**(良性指令触发有害结果)上 ASR 仍高达 **47.9%–48.8%**。这说明智能体在识别**嵌入正常执行上下文中的潜在风险**方面远未达到可部署标准。未来需探索更强健的安全对齐训练、环境风险预检测机制,以及如何在保持任务完成率的同时,对高后果动作实施更严格的约束与人工确认。 ### 4. 验证机制的自动化、可扩展性与泛化 当前工作依赖 **VLM-as-a-Judge** 与多模型投票进行轨迹级和样本级验证,虽显著优于粗粒度验证,但仍面临成本高昂、延迟较大以及在未见任务类型上泛化能力有限的问题。可进一步探索: - 基于规则与神经网络混合的轻量级验证器; - 验证器自身的在线学习与领域自适应; - 将验证信号从离线的数据筛选阶段扩展为**在线执行时的实时干预与纠错**机制。 ### 5. 跨平台统一表征与知识迁移 UI-Venus-2 通过统一的动作空间与训练框架覆盖移动、网页和桌面环境,但三类平台在交互范式、控件密度与状态空间上差异巨大。当前方案主要依赖大规模数据混合与多教师蒸馏实现能力聚合,不同域间的知识可能仍存在干扰。未来可研究**跨平台共享的 UI 中间表征**(如统一的控件语义图或交互原语嵌入),以促进正向迁移并减少对单一平台数据的过度依赖。 ### 6. 人机协作与交互式自主性 DeskCraft 基准已涉及人机协作场景(如寻求澄清、处理中断、整合反馈),但论文主要聚焦于自主端到端执行。实际部署中,智能体不可能也不应完全无人监督。进一步探索**可中断、可引导、可回滚**的交互式执行策略,以及如何在推理过程中显式建模用户意图的不确定性,是提升实用性的关键。 ### 7. 强化学习的奖励设计与稳定性 论文指出,粗糙或脆弱的验证器易混淆部分进展与真正完成,且奖励信号可能被利用(reward hacking)。尽管 UI-Venus-2 通过结构化动作感知蒸馏与视觉关键点缓解了该问题,但**细粒度、密集型过程奖励(process reward)** 的设计仍不成熟。后续可研究基于界面状态差异的 dense reward、动作结果预测的自监督信号,或验证器与策略模型的联合对抗训练。 ### 8. 动态环境与持续学习 当前的数据生成与能力目录更新以批量迭代方式进行。然而真实世界的应用版本、网页内容与桌面环境持续演化。构建支持**在线适应、增量学习与灾难性遗忘抑制**的持续学习框架,使智能体能够随环境变化自我更新,是从“静态基准智能体”迈向“终身可用助手”的必经之路。 ### 9. 模型效率与端侧部署 UI-Venus-2-9B 已展现出与更大规模通用模型相媲美的竞争力,但在移动设备或边缘计算节点上部署仍面临延迟与显存挑战。探索面向 GUI 任务的专用轻量架构、动态分辨率感知推理、或面向动作预测的高效解码策略,将有助于实现真正的端侧自主智能体。 ### 10. CAPTCHA 与通用导航能力的深度耦合 论文将 CAPTCHA 解决能力定位为“最后一公里”支撑,但当前训练仍将其作为独立任务族处理。未来可探索将验证码理解融入常规导航的**统一推理流程**,使智能体在面对登录、注册等验证门时无需切换模式,而是以统一的视觉-推理-行动连续体自然完成过渡,进一步提升端到端工作流的流畅性。 Q6: 总结一下论文的主要内容 论文提出了 **UI-Venus-2**,一个面向移动、网页和桌面三大平台的通用基础 GUI 智能体,旨在弥合当前多模态 GUI 智能体从基准测试走向真实应用时存在的核心差距。以下是论文的主要内容总结: ### 1. 研究背景与核心问题 当前多模态 GUI 智能体面临三大紧密耦合的瓶颈: - **环境覆盖不足**:现有工作多局限于小规模、单一语言或单一平台的应用集合; - **任务构建脆弱**:生成的大规模指令与实际应用功能脱节,在动态界面下难以执行; - **验证不可靠**:粗粒度的二元成功/失败标签易混淆部分进展与真正完成,导致强化学习(RL)的奖励信号不准确,甚至可被利用。 ### 2. 核心方法:UI-Venus-2 论文提出一个统一的**闭环推理–行动框架**,并采用三阶段训练流水线: - **Stage I:多模态中期训练** 在大规模异构交互数据(移动、网页、OS 导航为主)上进行监督微调,注入 GUI 理解、长程规划与动作定位能力。 - **Stage II:离线强化学习** 针对不同域构造步骤级 RL 轨迹(移动/网页/OS),或利用程序化合成框架生成带可靠动作级监督的 CAPTCHA 与 Grounding 数据,以优化状态感知的动作选择与执行一致性。 - **Stage III:多教师在线策略蒸馏(MOPD)** 为融合异构任务能力,引入两项 GUI 自适应设计: - **结构化动作感知蒸馏**:根据动作正确性(类型/参数)对蒸馏信号进行自适应加权,将监督集中于关键的可执行行为; - **教师侧动作类型条件化**:仅在教师评分时提供正确动作类型提示,使学生模型在不改变推理流程的前提下获得更精确的结构化动作监督。 ### 3. 关键扩展维度 论文采用**环境、任务、验证联合扩展**的策略: - **环境**:覆盖 **170+ 个多语言移动应用**(100+ 中文、70+ 英文)及**原生桌面操作系统**; - **任务**:基于 **deep-research** 构建动态更新的应用功能目录,生成功能接地的可执行任务,并设置有效性门控保证可执行性; - **验证**: - **轨迹级验证(SGV)**:基于视觉关键点和 VLM-as-a-Judge,将轨迹分类为完成/部分完成/不可行/失败,用于数据筛选与闭环反馈; - **样本级验证**:在动作执行前进行先验判断,区分正确/探索性/无效/错误动作,提供细粒度的步骤级监督。 此外,模型集成了**安全感知机制**,以控制高后果动作的执行风险。 ### 4. 实验与结果 论文在 **21 个基准**上开展实验,涵盖移动使用、计算机使用、网页导航、GUI 定位、验证码求解与智能体安全性: - **移动使用**:在 MobileGym(60.5%)、VenusBench-Mobile(48.7%)、AndroidWorld(84.0%)、MobileWorld(76.1%)等基准上取得最优或次优成绩; - **计算机使用**:OSWorld-Verified 达 80.5%,DeskCraft 达 55.5%(最优),但 OSWorld 2.0 的长程复杂任务仍有较大提升空间; - **网页导航**:WebVoyager(93.4%)、REAL(80.2%)、Odysseys(80.4)均刷新纪录; - **GUI 定位**:VenusBench-GD(80.1%)与 OSWorld-G-R(79.1%)表现领先; - **验证码求解**:在 VenusBench-CAPTCHA(79.9%)、MCA-Bench(79.6%)等基准上显著超越通用多模态模型; - **安全性**:在 OSHarm 与 OSBlind 上将攻击成功率(ASR)较基线降低近一半。 ### 5. 主要贡献 - **规模化多语言移动环境**:大幅扩展可执行应用范围,并引入基于深度研究的高质量保证任务生成; - **从头构建的桌面使用能力**:将 UI-Venus 家族从移动/网页扩展至桌面 OS,实现三平台统一端到端交互; - **精细化的两级验证机制**:通过视觉关键点与多模型投票,提供可靠的 RL 训练信号并抑制奖励作弊; - **开源基础模型**:公开发布 9B 与 27B 全参数权重及评估基础设施,推动 GUI 智能体领域的可复现研究与社区创新。 综上,UI-Venus-2 通过统一框架与三维联合扩展,显著推进了通用、可验证、可自反思的 GUI 智能体基础模型的发展。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Venus Team, Zhuohan Cai, Haoxing Chen, Jiaxuan Chen, Weizhi Chen, Changlong Gao, Zhangxuan Gu, Yuan Guo, Yusong Hu, Jianrong Jiang, Jianguo Li, Runze Li, Jinzhen Lin, Zhenyu Ma, Changhua Meng, Han Peng, Xinyu Qiu, Shuheng Shen, Zhongyi Shui, Weiqiang Wang, Ming Wen, Zhuoer Xu, Hang Yan, Kaiwen Yang, Ruilin Yao, Nanjun Yu, Zhengwen Zeng, Lianrui Zhang, Yunzhu Zhang, Zhe Zhao, Beitong Zhou

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00028.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00028

Published: 2026-09-03T01:27:10.830Z


Abstract:Mathematical communities work with different objects, invariants, and tools, so transferring a problem across them is expensive and often skipped. We present EULER, a multi-agent system that takes such a transfer—a bridge—as its unit of search. Around a fixed conjecture, EULER runs direct, adjacent-domain, and distant-domain routes in competition; a bridge keeps its budget only if it supplies an operation the source representation cannot execute and its target-side evidence returns to the original statement along a checked implication. Six ordered stress tests reject invalid bridges before expensive search begins. We evaluate EULER on 120 recent conjectures. The conjectures were frozen before search and screened for contamination, and are drawn from public papers by authors who had recently published in the Journal of Combinatorial Theory, Series A, a leading journal in combinatorics. EULER produced 10 proofs and 3 refutations, plus 45 scoped partial results. Two mechanisms held up under ablation: bridge-specific stress tests cut incorrect conclusions from 9 to 3, and bridge material combined with a target-native operation yielded a positive interaction of +4.2 resolved tasks that neither factor produced alone. Domain distance did not reliably predict success; executable operation gain and valid return did.

中文摘要

摘要:数学社区处理不同的对象、不变量和工具,因此在它们之间转移问题的成本很高,且经常被忽略。我们提出了EULER,一个多智能体系统,将此类转移——即“桥接”——作为其搜索单位。在一个固定的猜想周围,EULER 运行直接、相邻域和远域路线进行竞争;只有当桥接提供了源表示无法执行的操作,并且其目标端的证据沿经过校验的蕴涵返回到原始命题时,桥接才能保留其预算。六项有序的压力测试会在昂贵的搜索开始之前排除无效的桥接。我们在120个近期猜想上评估了EULER。这些猜想在搜索之前被冻结并筛查以防污染,抽取自近期在《组合理论杂志 A 系列》上发表论文的作者,这是一份组合数学领域的顶级期刊。EULER 产生了10个证明和3个反例,以及45个范围内的部分结果。在消融实验中有两个机制得到验证:桥接特定的压力测试将错误结论从9个减少到3个,桥接材料与目标本地操作结合产生了+4.2 的任务解决结果,这是单独任一因素无法产生的。领域距离未能可靠地预测成功;可执行操作增益和有效返回则能够。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00032 (HTTP 429)

Authors: Ren Zhenzhuo

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00032.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00032

Published: 2026-09-03T01:27:10.830Z


10. When Prediction Error Is Not Enough: Evaluating Nuisance-Function Prediction for Causal Estimation

Abstract:Prediction error is widely used to evaluate nuisance-function estimators in causal inference, but its relationship with causal estimator performance may differ across performance measures. We studied this question in a partially linear model using Monte Carlo simulations. We compared ordinary least squares (OLS), generalized additive models (GAMs), XGBoost, and Double Machine Learning with XGBoost (DML-XGBoost), evaluating nuisance-function prediction error, bias, RMSE, and 95\% confidence interval coverage. We also examined a simple joint-error measure based on the absolute cross-product of estimation errors from the exposure and outcome nuisance functions. Across the simulated settings, XGBoost had the lowest RMSE among the non-oracle methods, while DML-XGBoost generally provided better confidence interval coverage. Prediction error did not consistently track causal bias across methods and settings, and the method with the best point-estimation performance did not necessarily have the best confidence interval coverage. The joint-error measure was only weakly associated with causal bias and did not provide a useful standalone measure of causal performance. These results suggest that prediction error is useful for assessing nuisance-function estimation, but it should not be treated as a direct measure of the quality of the resulting causal estimator.

中文摘要

摘要:在因果推断中,预测误差被广泛用于评估干扰函数估计器,但它与因果估计器性能之间的关系可能会因性能指标的不同而有所差异。我们在部分线性模型中使用蒙特卡洛模拟研究了这个问题。我们比较了普通最小二乘法(OLS)、广义加法模型(GAMs)、XGBoost 和双重机器学习结合 XGBoost(DML-XGBoost),评估了干扰函数预测误差、偏差、均方根误差(RMSE)和 95% 置信区间覆盖率。我们还考察了一个基于暴露和结果干扰函数估计误差绝对交叉乘积的简单联合误差度量。在模拟设定中,XGBoost 在非先验(non-oracle)方法中具有最低的 RMSE,而 DML-XGBoost 通常提供了更好的置信区间覆盖率。预测误差在方法和设定之间并未始终与因果偏差保持一致,并且具有最佳点估计性能的方法不一定具有最佳的置信区间覆盖率。联合误差度量仅与因果偏差弱相关,且不能作为独立的有效因果性能衡量指标。这些结果表明,预测误差对于评估干扰函数估计是有用的,但不应被视为衡量最终因果估计器质量的直接指标。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00071 (HTTP 429)

Authors: Cong Cao

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.00071.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00071

Published: 2026-09-03T01:27:10.830Z


VLM Domain Papers

1. A Cone-Constrained Bilinear Decomposition for Total Scaled-Gradient Variation Models

Abstract:The total scaled-gradient variation (TSGV) regularizer, derived from sparse modeling of piecewise-linear structures, has been shown to preserve edges and corners in image restoration. However, its highly nonconvex and nonlinear nature poses severe computational challenges, as existing methods often suffer from parameter sensitivity or lack convergence guarantees. To overcome this, we propose a tailored bilinear decomposition that decouples the nonlinear weighted gradient in the TSGV regularizer. This approach yields an equivalent optimization problem governed by cone or sphere constraints, depending on the chosen scaling function. In particular, the cone constraint plays a central role in characterizing edge- and corner-preserving behavior. We solve this reformulation using the alternating minimization method (AMM) equipped with a majorization—minimization strategy, ensuring a monotonic decrease in energy without step-size tuning. Furthermore, we provide a geometric interpretation of the edge-preserving properties of these constraints by analyzing their asymptotic behavior near image singularities. We establish the global convergence of the proposed method to a critical point within the Kurdyka—Łojasiewicz framework. Extensive numerical experiments on Gaussian denoising and non-line-of-sight (NLOS) imaging show that the proposed method achieves PSNR and SSIM competitive with or superior to representative variational methods, especially at high noise levels, and improves the structural reconstruction under dense and sparse scanning.

中文摘要

摘要:总尺度梯度变化(TSGV)正则化器源自分段线性结构的稀疏建模,已被证明能够在图像恢复中保留边缘和角点。然而,其高度非凸和非线性的特性带来了严峻的计算挑战,因为现有方法通常存在参数敏感性或缺乏收敛性保证。为克服这一问题,我们提出了一种定制的双线性分解方法,该方法将TSGV正则化器中的非线性加权梯度解耦。这种方法生成了一个等效的优化问题,其受锥体或球体约束控制,具体取决于所选的缩放函数。特别地,锥体约束在表征边缘和角点保留行为中起到核心作用。我们使用配备主-最小化策略的交替最小化方法(AMM)来求解此重构问题,从而保证能量单调下降而无需步长调节。此外,我们通过分析图像奇异点附近的渐近行为,对这些约束的边缘保持特性提供了几何解释。我们在Kurdyka–Łojasiewicz框架下建立了所提方法收敛到临界点的全局收敛性。在高斯去噪和非视距(NLOS)成像的大量数值实验中,结果表明所提方法在峰值信噪比(PSNR)和结构相似性指数(SSIM)方面与代表性变分方法具有竞争力或更优,尤其在高噪声水平下表现突出,并且在密集和稀疏扫描下改善了结构重建。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00036 (HTTP 429)

Authors: Haibin Su, Chunlin Wu, Huibin Chang, Zhifang Liu

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00036.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00036

Published: 2026-09-03T01:27:30.952Z


2. Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

Abstract:We present Qwen-Drive-1.0, an initial step towards a vision-language foundation model for autonomous driving. Qwen-Drive-1.0 retains the architecture of the pretrained vision-language model (VLM) and integrates 3D perception, visual question answering, and motion planning within a unified framework. An external bird’s-eye-view (BEV) perception head jointly performs 3D object detection, semantic occupancy prediction, and BEV map segmentation. It serves as a probe of the 3D information accessible from the shared representations and provides an explicit, inspectable interface to 3D scene structure. A Planning Expert conditions on shared VLM representations to generate future ego trajectories. A staged training recipe combines driving supervision with general-purpose vision-language data to acquire driving-specific competence while helping preserve broad visual understanding and instruction-following capabilities. Experiments demonstrate strong 3D perception and driving scene understanding while largely preserving general vision-language capability. Comprehensive evaluations across open-loop, pseudo-closed-loop, and closed-loop settings further show highly competitive motion-planning performance.

中文摘要

摘要:我们提出了 Qwen-Drive-1.0,这是朝着自主驾驶视觉-语言基础模型迈出的初步步骤。Qwen-Drive-1.0 保留了预训练视觉-语言模型(VLM)的架构,并在统一框架下整合了 3D 感知、视觉问答和运动规划。一个外部鸟瞰图(BEV)感知头联合执行 3D 目标检测、语义占用预测和 BEV 地图分割。它作为共享表示中可获取 3D 信息的探针,并提供了对 3D 场景结构明确、可检查的接口。规划专家以共享的 VLM 表示为条件生成未来的自车轨迹。分阶段训练方案将驾驶监督与通用视觉-语言数据结合,在获取驾驶特定能力的同时,有助于保持广泛的视觉理解和指令执行能力。实验表明,模型在 3D 感知和驾驶场景理解方面表现出强大能力,同时在很大程度上保留了通用视觉-语言能力。在开放循环、伪闭环和闭环设置下的全面评估进一步显示了高度竞争力的运动规划性能。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文针对自动驾驶领域中视觉-语言模型(VLM)的应用,主要试图解决以下核心问题: ## 1. 现有驾驶VLA范式的局限性 当前多数驾驶视觉-语言-动作(VLA)方法仅通过对预训练VLM进行驾驶相关的视觉问答(VQA)监督来适配领域,这带来两个关键缺陷: - \*\*缺乏显式3D约束\*\*:文本形式的VQA目标无法直接约束3D空间布局、深度或占用信息。即使预训练表征中隐含了空间线索,纯文本监督既不要求显式3D预测,也无法对其进行直接评估,导致模型可能在3D空间中保持不精确。 - \*\*灾难性遗忘\*\*:过度的领域适应会导致预训练阶段获得的通用视觉与世界知识被遗忘,而有限驾驶数据集无法穷尽部署中遇到的罕见和分布外(OOD)场景,因此通用知识对于OOD推理至关重要。 ## 2. 实际部署中的双重能力需求 论文指出,量产车辆正走向\*\*座舱-驾驶一体化\*\*架构,要求单一模型在有限算力下同时服务智能座舱(需要多轮对话、开放式视觉理解等通用能力)和自动驾驶系统(需要3D感知与规划能力)。现有方法若牺牲通用能力换取驾驶性能,则无法满足这一部署需求。 ## 3. 提出的解决方案:Qwen-Drive-1.0 为应对上述问题,论文提出了三项设计原则并在Qwen-Drive-1.0中实现: - \*\*架构不变性\*\*:完全保留预训练VLM(Qwen3.5-4B)的架构,确保易用性与通用能力基线。 - \*\*显式3D感知探针\*\*:引入外部鸟瞰图(BEV)感知头,联合执行3D目标检测、语义占用预测和BEV地图分割,作为共享表征的3D探针,提供可显式检验的3D场景接口。 - \*\*分阶段训练与数据配方\*\*:通过感知、语言、规划的分阶段训练策略,将驾驶监督与通用视觉-语言数据结合,在获取驾驶特定能力的同时缓解灾难性遗忘。 综上,该论文试图解决的核心问题是:\*\*如何在保持预训练VLM架构和通用视觉-语言能力的前提下,将显式3D感知、驾驶场景理解与运动规划统一到一个可实际部署的端到端框架中。\*\* Q2: 有哪些相关研究? 根据论文内容,相关研究可分为以下几个方向: ### 1. 驾驶视觉-语言模型与VLA框架 这类研究将预训练的视觉-语言模型(VLM)通过持续训练适配到自动驾驶领域,主要依赖视觉问答(VQA)形式的监督: - \*\*DriveLM\*\* (Sima et al., 2024)、\*\*DriveGPT4\*\* (Xu et al., 2024)、\*\*OmniDrive\*\* (Wang et al., 2025b):通过驾驶场景描述、周围智能体推理和驾驶决策解释等文本目标进行领域适配。 - \*\*Orion\*\* (Fu et al., 2025)、\*\*MindDrive\*\* (Fu et al., 2026):探索VLA模型在自动驾驶中的应用,连接场景理解与动作生成。 - \*\*Hermes / Hermes++\*\* (Zhou et al., 2025b; 2026a):统一的自动驾驶世界模型,用于3D场景理解与生成。 - \*\*Alpamayo-R1 / 1.5\*\* (Wang et al., 2025d):基于思维链因果推理(Chain-of-Causation)的驾驶推理模型。 ### 2. 端到端自动驾驶与运动规划 这类工作专注于从传感器输入直接生成未来自车轨迹,涵盖模仿学习与生成式方法: - \*\*UniAD\*\* (Hu et al., 2023):面向规划的端到端自动驾驶框架,将感知、预测与规划集成。 - \*\*VAD\*\* (Jiang et al., 2023):基于向量化场景表征的高效自动驾驶方法。 - \*\*DiffusionDrive\*\* (Liao et al., 2025)、\*\*RAP-DINO\*\* (Feng et al., 2026):使用扩散模型或3D光栅化增强进行端到端规划。 - \*\*MindVLA-U1\*\* (Huang et al., 2026):采用统一流式架构的VLA规划方法。 - \*\*AutoVLA / SpanVLA / ExploreVLA\*\* (Zhou et al., 2025c; 2026b; Sheng et al., 2026):结合自适应推理、强化微调与世界模型的VLA规划方法。 - \*\*NAVSIM\*\* (Dauner et al., 2024)、\*\*WOD-E2E\*\* (Xu et al., 2026b):提供伪闭环与开环评估基准的数据集。 ### 3. 鸟瞰图(BEV)感知与3D检测 这类研究为显式3D场景理解提供基础架构,与本文提出的BEV感知头密切相关: - \*\*BEVFormer / BEVFormer-V2\*\* (Li et al., 2024b; Yang et al., 2023):基于时空Transformer学习BEV表征。 - \*\*PETR / PETRv2\*\* (Liu et al., 2022; 2023):通过位置嵌入变换进行多视图3D检测。 - \*\*Lift-Splat-Shoot\*\* (Philion & Fidler, 2020):基于深度分布将图像特征提升到3D体素。 - \*\*FlashOcc\*\* (Yu et al., 2023):快速且内存高效的语义占用预测方法。 - \*\*MonoScene\*\* (Cao & De Charette, 2022):单目3D语义场景补全。 ### 4. 基础视觉-语言模型 本文的基座模型与对比方法涉及以下通用VLM: - \*\*Qwen3.5-4B\*\* (Qwen Team, 2026a;b):本文采用的预训练多模态模型。 - \*\*SigLIP\*\* (Zhai et al., 2023):用于视觉-语言预训练的sigmoid损失方法。 - \*\*InternVL3.5\*\* (Wang et al., 2025c)、\*\*LLaVA-OneVision-2\*\* (An et al., 2026)、\*\*Gemma4\*\* (Team et al., 2026):作为通用能力对比的基线模型。 - \*\*Cosmos-Reason1/2 / Cosmos3-nano\*\* (Azzolini et al., 2025; NVIDIA, 2025a; Agarwal et al., 2026):针对物理AI与具身推理的模型系列。 - \*\*MiMo-Embodied\*\* (Hao et al., 2025a):跨具身的基础模型,涵盖自动驾驶与机器人数据。 ### 5. 训练方法与优化技术 本文采用或对比了多种训练与损失技术: - \*\*Flow Matching\*\* (Lipman et al., 2023):用于轨迹生成的连续归一化流方法。 - \*\*Focal Loss\*\* (Lin et al., 2017):用于密集目标检测的分类损失。 - \*\*Lovász-softmax\*\* (Berman et al., 2018):用于地图分割与占用预测的IoU替代损失。 - \*\*Group-Relative Advantage / 策略梯度\*\* (Shao et al., 2024):强化学习中的组内相对优势估计。 ### 6. 灾难性遗忘与持续学习 - \*\*Zhai et al., 2024\*\*:对多模态大语言模型微调中灾难性遗忘的研究。 - \*\*Luo et al., 2025\*\*:大语言模型持续微调中灾难性遗忘的实证分析。 ### 7. 数据集与评估基准 - \*\*nuScenes\*\* (Caesar et al., 2020)、\*\*OpenScene\*\* (OpenScene Contributors, 2023):3D感知训练与评测数据。 - \*\*LingoQA\*\* (Marcu et al., 2024)、\*\*Ego3D-Bench\*\* (Gholami et al., 2026)、\*\*VLADBench\*\* (Li et al., 2025)、\*\*SURDS\*\* (Guo et al., 2025)、\*\*WaymoQA\*\* (Yu et al., 2025):驾驶视觉问答与空间理解基准。 - \*\*PAI-AV\*\* (NVIDIA, 2025b):大规模物理AI自动驾驶数据集。 Q3: 论文如何解决这个问题? 论文通过\*\*Qwen-Drive-1.0\*\*框架,在保留预训练视觉-语言模型(VLM)架构的前提下,引入外部任务模块并设计分阶段训练与数据配方,系统性地解决了显式3D感知缺失、灾难性遗忘及能力统一等问题。具体方案如下: --- ### 1. 统一架构:VLM + 外部专用模块 论文以 \*\*Qwen3.5-4B\*\* 作为共享的VLM基座,\*\*不修改其内部架构\*\*。所有多模态输入(单视图/多视图驾驶图像、时序序列、通用图像)均通过共享的视觉编码器与VLM处理。在此基础上,外挂两个专用模块: - \*\*BEV感知头(BEV Perception Head)\*\*:从共享表征中构建显式鸟瞰图表征,输出可检验的3D场景结构。 - \*\*规划专家(Planning Expert)\*\*:基于VLM缓存的键值(keys/values)生成未来自车轨迹。 --- ### 2. 显式3D感知探针:BEV感知头 为弥补纯文本VQA无法约束3D空间的缺陷,论文设计了一个联合多任务的BEV感知头,作为共享VLM表征的\*\*3D探针\*\*。其流程如下: - \*\*双特征流输入\*\*:对每个视角 i ,融合视觉编码器低层特征 F_i^v (外观细节)与VLM输出的高层语义特征 F_i^m (场景上下文)。 - \*\*深度视角变换\*\*:通过轻量深度网络预测像素级深度分布 D_i ,将 F_i^v 沿相机射线提升到3D体素 V :

V(p) = ∑_(i ∈ Omega(p)) D_i(u_i, v_i, d_i) F_i^v(u_i, v_i)

  • **BEV Transformer**:以高度压缩的体素特征 V 初始化查询,通过可变形交叉注意力将多尺度VLM特征聚合到BEV平面,得到融合几何与语义的BEV特征 B 。 - **多任务解码**: - **3D检测**:DETR风格解码器; - **语义占用**:沿高度维度展开 B 并与 V 融合后,经3D UNet预测体素语义; - **BEV地图分割**:UNet风格头在BEV平面进行栅格化分割。 三个分支通过联合感知损失优化:
    L(perc) = L(det) + L(occ) + L(map)
    —- ### 3. 运动规划生成:Planning Expert 论文将轨迹预测建模为条件生成问题 τ sim p(τ mid s, ell, τ(hist), n, e, r) ,其中轨迹 τ = (x_k, y_k, θ_k)(k=1)^(50) 表示未来5秒、10 Hz的50个航点。 - **架构**:32层扩散Transformer(约1.1B参数),通过AdaLN注入流匹配时间、导航指令 n 与自车状态 e 。 - **条件机制**:缓存VLM中8层分组查询注意力(GQA)的RoPE键值,每4层Planning Expert复用一组缓存,实现轨迹token与VLM表征的联合注意力。 - **流匹配训练**:采用**端点预测(x-prediction)**参数化。设干净轨迹为 τ_1 ,噪声为 τ_0 sim N(0, I) ,线性插值路径为:

τt = (1-t)τ_0 + tτ_1
模型直接预测干净端点 τ_1 ,进而诱导流速度场。训练目标为:
L
(plan) = L(fm) + 2 × 10^(-4) L(Delta 1) + 2 × 10^(-5) L(Delta 2)
其中 L
(Delta 1), L_(Delta 2) 为时序差分的Huber正则项,抑制轨迹抖动。 - **推理**:从高斯噪声初始化,使用10步Euler积分器求解。 —- ### 4. 分阶段训练策略 论文设计四阶段训练流程,将3D感知、语言理解与规划能力解耦并逐步融合: | 阶段 | 训练内容 | 优化模块 | 关键设计 | |———|————-|————-|————-| | **Stage 1** | 感知头预训练 | 仅BEV感知头 | 固定VLM与视觉编码器,初始化3D表征构建能力 | | **Stage 2** | 感知与VQA联合训练 | BEV感知头、视觉编码器、VLM | 混合感知与视觉-语言数据;感知头学习率为VLM的20倍;引入通用数据缓解灾难性遗忘 | | **Stage 3** | 规划专家预训练 | 仅Planning Expert | 固定VLM与视觉编码器,通过流匹配模仿学习生成轨迹 | | **Stage 4** | 强化学习优化 | 仅Planning Expert | 固定VLM,使用任务级奖励(PDMS、Rater Score、ADE)进行策略梯度优化 | **Stage 4的强化学习细节**: - 仅在最后3步Euler积分引入随机性,构造可微策略。 - 在余弦基函数构成的低维子空间施加扰动,保证轨迹平滑性:

τ^((k+1)) = μ^((k)) + σ_k Phi Z_k

  • 引入近似恢复分数(restoring score)稳定偏离预训练流的中间状态:
    s_θ(τ^((k)), t_k) = -τ^((k)) - t_k hatτ_1^((k))(1-t_k)^2
  • 使用组内相对优势(group-relative advantage)进行无价值函数的折扣策略梯度更新。 —- ### 5. 跨数据集统一的数据配方 为实现异构数据上的联合训练,论文在数据层面进行了系统对齐: #### 5.1 感知数据统一 - **标签空间统一**:将nuScenes与OpenScene的标注映射到共享的粗粒度空间(7类检测、10类占用、6类地图)。对缺失类别通过离线补全(如从3D框生成占用伪标签、栅格化矢量地图赋予可行驶区域标签)。 - **空间对齐**:两数据集占用网格的原点、分辨率、坐标系不同。论文保留各自原生网格,在模型前向过程中通过可微三线性采样将预测体素特征映射到对应数据集的目标网格,实现统一头下的跨数据集训练。 #### 5.2 视觉-语言数据 - 聚合24个开源驾驶VQA数据集,使用 **Qwen3.5-Plus** 重写为统一对话格式,并用 **Qwen3.5-Flash** 进行语义一致性过滤(保留率55.9%)。 - 自建三类补充数据: 1. **规划推理数据**:基于NAVSIM/WOD-E2E/PAI-AV轨迹,使用CoC(Chain-of-Causation)格式生成因果决策推理链,经多阶段审核。 2. **相机排序任务**:打乱环视图像,要求模型仅凭视觉线索恢复顺时针相机顺序。 3. **中文感知QA**:3万条例内交通灯 grounding 与3D检测问答。 #### 5.3 规划数据统一 整合NAVSIM、OpenScene、WOD-E2E、PAI-AV四个来源,将所有未来轨迹转换为当前自车坐标系下的50航点统一表示( x,y 缩放到 $

-1,1
, θ 缩放到
-1,1
)。其中24.2%的样本附加了通过审核的文本规划推理作为条件 r 。 —- ### 6. 输入序列化策略 为在不修改VLM词表的前提下区分多视图与时序信息,论文采用普通词元标签: - 视角标签, 等8个方位。 - 帧标签frame: k。 根据不同任务采用两种序列化顺序: - Frame-major:QA任务优先按时序排列,每时刻包含全部视角。 - View-major:规划任务优先按视角排列,同一视角的连续帧相邻,以显式暴露单视角时序变化,利于动态控制。 —- 通过上述设计,论文在不改变预训练VLM架构的情况下,为VLM增加了显式、可检验的3D感知接口运动规划能力,同时通过分阶段训练与通用数据的持续混合,显著缓解了领域适应中的灾难性遗忘,使单一模型能够同时服务驾驶与座舱场景。 Q4: 论文做了哪些实验? 论文在 3D 感知驾驶/通用视觉-语言理解运动规划 以及 消融分析 四个维度开展了系统实验,具体总结如下。 —- ### 1. 3D 感知实验 (Sec. 3.1) 在 nuScenesOpenScene 两个数据集的验证集上,评估统一 BEV 感知头的三项任务: - 3D 目标检测:mAP、NDS(修改版,因统一标签无属性,故 mAAE 置零) - 语义占用预测:Occ mIoU(语义类均值,不含 empty)、RayIoU - BEV 地图分割:前景 map 类的 mIoU 对比方法:复现了单帧版本的 BEVFormer-V2、PETR、PETRv2,以及统一多任务变体 BEVFormerV2;分别使用 ResNet-50 与 SigLIP-Qwen(与本文相同的预训练视觉编码器)作为 backbone。此外还做了 Head-only 消融(仅训练感知头,冻结 VLM 与视觉编码器)以验证预训练特征是否直接具备 3D 结构信息。 关键发现: - 完整的 Stage 2 联合训练(更新 VLM 与视觉编码器)相比 Head-only,在 nuScenes 上 mAP 提升 10.46、map mIoU 提升 9.84,证明预训练 VLM 特征需经联合适配才能释放 3D 感知能力。 - 跨数据集迁移实验中,OpenScene 的机占标签存在语义与构建伪影,导致联合训练后占用指标改善有限,但检测与地图分割显著提升。 —- ### 2. 驾驶与通用视觉-语言理解 (Sec. 3.2) #### 2.1 驾驶视觉问答 (Sec. 3.2.1) 在 5 个公共基准与 2 个自建/内部基准上评估: | 基准 | 评估重点 | 协议 | |———|————-|———| | LingoQA | 开放式驾驶问答 | LLM 裁判打分 | | Ego3D-Bench | 自我中心空间推理 | 多选准确率 + 距离估计 RMSE | | VLADBench | 细粒度驾驶能力层级 | 多选 | | SURDS | 驾驶场景空间理解与推理 | 多选/开放 | | WaymoQA | 安全关键多视图情境 | 总分 + 安全专项分 | | PAI-AV-CoC (自建) | 因果推理链(CoC) | 关键目标准确率 / 决策准确率 / 综合准确率 | | In-house (内部) | 中文城市驾驶决策 | 专家标注 | 对比方法:涵盖通用 VLM(InternVL3.5-8B、LLaVA-OV2-8B、Gemma4-12B、Qwen3.5-4B)与专用驾驶/具身模型(Cosmos-Reason1/2/3-nano、MiMo-Embodied-7B、UniDriveVLA-8B、Alpamayo-1.5-10B)。 关键结果:Qwen-Drive-1.0-SFT 的驾驶 QA 均值达到 69.43,较 Qwen3.5-4B 提升 5.91 分;在因果推理(PAI-AV-CoC 综合准确率 41.26)上大幅领先所有对比方法(次优仅 5.73),且显著缩小了 Ego3D 距离估计 RMSE(降至 7.78)。 #### 2.2 通用视觉-语言理解 (Sec. 3.2.2) 在 14 个公共基准 上验证领域适应后的通用能力保留情况: - 知识、推理与识别:MMBench、MMStar、MMMU、MMMU-Pro(标准/视觉)、CharXiv、OCRBench、RealWorldQA、SimpleVQA、CountQA - 空间理解与 Grounding:EmbSpatial-Bench、ERQA、RefSpatial-Bench、Omni3D-Bench、ODinW13 关键结果:Qwen-Drive-1.0-SFT 在知识/推理组平均 66.41,较 Qwen3.5-4B(67.40)仅下降不到 1 分;在空间/grounding 组平均 53.96,反而超过 Qwen3.5-4B(52.99)。证明大规模驾驶数据适应后,通用能力基本保持,空间能力甚至增强。 —- ### 3. 运动规划实验 (Sec. 3.3) 从开环到闭环分四个层级评估: #### 3.1 开环规划 (Open-loop) - WOD-E2E: - 验证集与测试集上报告 ADE(3 s / 5 s)与 Rater Feedback Score (RFS)。 - Qwen-Drive-1.0-SFT 在测试集达到 RFS 7.78;经 RL 后(Qwen-Drive-1.0-RL)提升至 7.91,优于同设置下的 MindVLA-U1-RL。 - 验证集上 RL 后 RFS 从 7.95 提升至 8.45,超过人类驾驶员参考值 8.13。 - PAI-AV: - 在标准 644 例分割与无泄漏 700 帧子集上,报告六条候选轨迹的 Avg. ADEminADE(3 s / 5 s)。 - 带推理条件的 SFT 模型在无泄漏子集上 3 s Avg. ADE 为 0.42 m,minADE 0.39 m;RL 后略有上升(0.47 / 0.43),但换取了闭环安全性。 #### 3.2 伪闭环规划 (Pseudo-closed-loop) - NAVSIM v1.1 navtest: - 报告 PDMS 及其五项组件:NC(无碰撞)、DAC(可行驶区域合规)、EP(自车前进)、TTC(碰撞时间)、Comf.(舒适性)。 - SFT 模型达到 PDMS 88.2(带推理);RL 后提升至 90.7,为对比方法中最高。 - Best-of-6 采样下,RL 模型可达 91.4。 #### 3.3 闭环规划 (Closed-loop) - AlpaSim(916 场景,使用 PAI-AV-NuRec 26.02 版本): - 指标:Close Encounter Rate(全事件 / 自车责任)、Off-Road Rate(全事件 / 自车责任)、Progress、AlpaSim Score。 - RL 将 off-road rate 从 24.0% 降至 12.0%,at-fault close encounter 保持 11.0%;at-fault AlpaSim score 从 0.27 提升至 0.37。 - 代价是 progress 从 54.0% 降至 48.0%,表现为更安全但略保守的策略。 #### 3.4 定性结果 论文提供了 WOD-E2E、PAI-AV、NAVSIM 及 AlpaSim 的轨迹与 BEV 可视化,展示模型在动物穿行、信号灯、施工区、交叉口等场景下的规划与推理行为,以及 RL 前后在相同场景下的轨迹修正。 —- ### 4. 消融实验与分析 (Sec. 3.4) | 实验 | 内容 | 关键结论 | |———|———|————-| | Stage 2 训练混合 (Tab. 8) | 对比:I) 原始 Qwen3.5-4B;II) 加入 VL 训练;III) 再加入 3D 感知监督。每种设置后续训练 Planning Expert 并测 WOD-E2E RFS。 | 加入 VL 训练显著提升驾驶 QA 与 CoC 推理;再加入 3D 感知后各项 VL 指标保持在一分以内,且 Stage 3 后 RFS 最高(7.96)。 | | RL 奖励设计 (Fig. 11) | 对比 NAVSIM 单源 RL vs. NAVSIM+WOD-E2E+PAI-AV 多源 RL;以及是否加入共享 ADE 位移项。 | 多源训练未产生明显负面干扰;共享 ADE 项在 WOD-E2E 上降低 5 s ADE(2.24→1.27),但 RFS 略降(8.68→8.45),用于锚定记录轨迹。 | | 规划数据规模 (Fig. 12) | 仅用 PAI-AV,从 0.17M 增至 1.38M 样本训练 Planning Expert。 | 5 s Avg. ADE 与 Avg. FDE 随数据量单调下降,1.38M 时仍未饱和。 | | 跨相机 Rig 迁移 (Fig. 13) | 直接在未参与感知训练的 WOD-E2E(8 相机)与 PAI-AV(6 相机)rig 上运行感知头。 | 无需数据集专属适配即可输出视觉上合理的 3D 框、占用与地图,表明感知通路对未见过相机配置具备一定泛化能力。 | Q5: 有什么可以进一步探索的点? 基于论文第5节”Limitations and Future Work”及实验分析,可进一步探索的方向包括: —- ### 1. 多时间尺度的因果推理建模 当前规划推理(Chain-of-Causation)难以稳定处理不同时间尺度上共存的原因。例如,远处红灯需要提前、平缓减速,而近处突然出现的行人需要立即响应。当此类原因共存时,模型在识别主导原因及其有效时间范围方面仍不稳定。未来可探索: - 显式建模因果链的时间层级结构 - 引入时间注意力机制或分层因果图,使模型能根据紧迫性动态选择决策依据 —- ### 2. 文本推理与轨迹生成的显式一致性约束 尽管加入文本推理条件能提升规划性能(如NAVSIM PDMS提升0.4,WOD-E2E RFS提升0.02),但生成的轨迹并不总是严格遵循文本理由。部分性能增益可能源于推理链作为额外上下文提供的隐式信息,而非显式的因果遵循。未来工作可探索: - 在训练目标中加入推理-轨迹对齐损失,强制轨迹与文本理由在逻辑上一致 - 设计可微或基于采样的一致性检验机制,使模型对”为何选择此轨迹”负责 —- ### 3. 跨任务表征的更深层次对齐 当前3D感知、视觉问答与运动规划三项任务在输入格式上存在差异: - 感知使用单帧环视图像 - VQA使用帧优先(frame-major)序列化 - 规划使用视角优先(view-major)序列化,且图像分辨率不同(历史帧320p,当前帧720p) 这种配置差异可能限制共享表征的迁移效率。未来可探索: - 统一的时空输入表示与分辨率策略 - 更紧密的联合优化目标,使感知特征直接服务于规划需求,反之亦然 —- ### 4. 强化学习策略的进一步精细化 闭环仿真(AlpaSim)显示,RL在显著降低off-road率(24.0% → 12.0%)的同时,progress从54.0%下降至48.0%,表现为更安全但更保守的策略。此外,at-fault AlpaSim得分(0.37)仍低于Alpamayo-1.5(0.45)。可探索: - 在奖励函数中更精细地平衡安全性通行效率 - 探索除PDMS、RFS、ADE外的更多闭环优化目标(如社会合规性、乘客舒适度) - 缩短视觉历史采样间隔(当前为0.5s × 4帧),提升对快速动态场景的响应能力 —- ### 5. 数据规模与跨数据集泛化 图12表明,在PAI-AV上从0.17M增至1.38M样本时,5s ADE与FDE持续下降且未饱和。同时,跨数据集占用预测(OpenScene)受限于机器生成标签的伪影,联合训练改善有限。未来可探索: - 继续扩展规划数据的训练规模 - 开发更鲁棒的跨数据集标签对齐与去噪方法,尤其是占用预测的体素级语义一致性 —- ### 6. 未见相机配置的定量迁移 定性实验(图13)表明,BEV感知头在未参与训练的相机rig(WOD-E2E的8相机环视、PAI-AV的6相机rig)上仍能输出视觉上合理的3D框、占用与地图。然而,由于缺乏统一真值,未能建立可靠的定量评估。未来可探索: - 构建跨rig的基准测试协议 - 开发轻量级的域自适应或相机几何编码方法,提升跨平台部署时的3D精度 —- ### 7. 感知-规划-推理的端到端联合强化 当前Stage 4强化学习仅优化Planning Expert,而VLM与视觉编码器保持固定。未来可探索: - 在保障通用能力的前提下,部分解锁VLM参数进行端到端驾驶强化学习 - 将BEV感知头的输出(如碰撞风险、可行驶区域)作为RL的状态输入或奖励塑造(reward shaping)来源,实现感知-规划的闭环优化 Q6: 总结一下论文的主要内容 这篇论文提出了 Qwen-Drive-1.0,一个面向自动驾驶的视觉-语言基础模型,旨在将 3D 感知、驾驶场景理解与运动规划统一到单个预训练视觉-语言模型(VLM)中,同时保留其通用视觉-语言能力。 ### 1. 研究动机与问题 当前驾驶视觉-语言-动作(VLA)模型主要通过驾驶场景的视觉问答(VQA)对预训练 VLM 进行领域适配,但存在两个关键局限: - 缺乏显式 3D 约束:文本监督无法直接要求或评估 3D 空间布局、深度与占用预测,导致模型在 3D 空间中可能不精确。 - 灾难性遗忘:过度领域适应会损害预训练获得的通用视觉与世界知识,而这些知识对罕见和分布外(OOD)场景至关重要。 此外,量产车辆趋向座舱-驾驶一体化部署,要求单一模型同时服务驾驶任务与通用座舱交互,因此必须在获得驾驶能力的同时保留通用视觉-语言理解。 ### 2. 方法框架 Qwen-Drive-1.0 以 Qwen3.5-4B 为共享 VLM 基座,不修改其内部架构,并引入两个外部模块: #### 2.1 BEV 感知头(3D 探针) 作为显式 3D 探针,联合执行: - 3D 目标检测 - 语义占用预测 - *BEV 地图分割 该头融合视觉编码器的低层特征 F_i^v 与 VLM 的高层语义特征 F_i^m ,通过深度视角变换构建 3D 体素,再经 BEV Transformer 聚合为鸟瞰图表征 B$:

V(p) = ∑_(i ∈ Omega(p)) D_i(u_i, v_i, d_i) F_i^v(u_i, v_i)

2.2 规划专家(Planning Expert) 基于 VLM 缓存的键值(keys/values),通过 **32 层扩散 Transformer** 与 **流匹配(flow matching)**生成未来自车轨迹。采用端点预测参数化,直接估计干净轨迹 τ_1 :

τt = (1-t)τ_0 + tτ_1
训练目标结合流匹配损失与时序正则项:
L
(plan) = L(fm) + 2 × 10^(-4) L(Delta 1) + 2 × 10^(-5) L_(Delta 2)

2.3 分阶段训练策略 - **Stage 1**:冻结 VLM,预训练 BEV 感知头。 - **Stage 2**:联合训练感知头、视觉编码器与 VLM,混合 3D 感知、驾驶 VQA 与通用视觉-语言数据(感知头学习率为 VLM 的 20 倍)。 - **Stage 3**:冻结 VLM,通过流匹配预训练 Planning Expert。 - **Stage 4**:基于任务级奖励(PDMS、Rater Score、ADE)对 Planning Expert 进行强化学习优化,引入低维子空间随机探索与恢复分数稳定训练。 #### 2.4 跨数据集数据统一 - **标签统一**:将 nuScenes 与 OpenScene 的异构标注映射到共享的 7 类检测、10 类占用、6 类地图空间,并通过离线补全处理缺失类别。 - **空间统一**:保留各数据集原生体素网格,通过可微三线性采样实现模型前向过程中的空间对齐。 - **规划数据统一**:将 NAVSIM、OpenScene、WOD-E2E、PAI-AV 的未来轨迹转换为当前自车坐标系下的 50 航点(5 秒,10 Hz)标准表示。 ### 3. 实验结果 #### 3.1 3D 感知 在 nuScenes 与 OpenScene 上,Qwen-Drive-1.0-SFT 达到: - nuScenes:**43.95 mAP**,**60.99 map mIoU** - OpenScene:**43.45 mAP**,**71.27 map mIoU** 相比仅训练感知头的基线,联合适配 VLM 后 nuScenes mAP 提升超过 10 点,证明预训练特征需经适配才能释放 3D 感知能力。 #### 3.2 驾驶视觉-语言理解 在 LingoQA、Ego3D-Bench、VLADBench、SURDS、WaymoQA 及自建的 PAI-AV-CoC 基准上: - 驾驶 QA 平均达 **69.43**,较 Qwen3.5-4B 提升 5.91 分。 - 因果推理(CoC)综合准确率达 **41.26**,远超对比方法(次优仅 5.73)。 - Ego3D 距离估计 RMSE 降至 **7.78**。 #### 3.3 通用视觉-语言能力 在 14 个通用基准上,知识/推理组平均 **66.41**(较基线下降不到 1 分),空间理解/grounding 组平均 **53.96**(反超基线),表明驾驶适应后通用能力基本保持。 #### 3.4 运动规划 - **WOD-E2E**(开环):测试集 RFS 达 **7.91**(RL 后),为对比方法最优。 - **NAVSIM**(伪闭环):PDMS 达 **90.7**(RL 后),Best-of-6 采样可达 **91.4**。 - **AlpaSim**(闭环):RL 将 off-road 率从 24.0% 降至 **12.0%**,at-fault close encounter 保持 **11.0%**。 ### 4. 局限与未来方向 - **多时间尺度因果推理**:当前 CoC 推理对共存原因的时间紧迫性区分不稳定。 - **推理-轨迹一致性**:文本理由与生成轨迹之间缺乏显式约束。 - **跨任务输入对齐**:感知、VQA、规划在时序、分辨率上的差异可能限制表征迁移。 - **数据规模**:规划性能随数据量增加仍未饱和,可继续扩展。 - **闭环效率与安全平衡**:RL 后策略更安全但也更保守,progress 有所下降。 ### 5. 核心贡献 - 首次在不修改预训练 VLM 架构的前提下,将 **3D 感知、驾驶 VQA 与运动规划**统一于单一视觉-语言基础模型。 - 引入**外部 BEV 感知头**作为显式 3D 探针,使 VLM 具备可检验的 3D 场景输出。 - 提出**分阶段训练与数据配方**,在获得驾驶能力的同时显著缓解灾难性遗忘。 - 设计基于**流匹配与强化学习**的 Planning Expert,在开放/伪闭环/闭环评估中均取得竞争力表现。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Xin Zhou, Zongchuang Zhao, Zhibo Yang, Mingsheng Li, Humen Zhong, Shuai Bai, Du Chu, Ruizhe Chen, Zhaohai Li, Jun Tang, Qiuyue Wang, Mingkun Yang, Jiazhao Zhang, Dayiheng Liu, Dingkang Liang, Xiang Bai

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00111.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00111

Published: 2026-09-03T01:27:30.952Z


3. ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

Abstract:Robotic manipulation faces a fundamental scaling challenge: robust generalization demands broad physical experience, yet action-labeled robot trajectories are expensive to collect and inherently limited in diversity. Egocentric videos offer a far more scalable source of embodied experience, capturing object interactions, contact dynamics, tool use, and long-horizon behaviors across diverse environments. The central challenge is how to convert this abundant but action-free experience into effective robot control. We introduce ZimaBlue, a scalable framework for learning generalizable World Action Models (WAMs) from large-scale video. ZimaBlue follows a three-stage training curriculum: it first performs causal embodied video pre-training on large-scale human and robot egocentric videos, then grounds the learned visual dynamics in heterogeneous robot trajectories through video-action mid-training with a unified action representation, and finally specializes the model to a target robot for deployment. To make generative WAMs practical for real-time control, ZimaBluefurther adopts an asynchronous Slow-Fast dual-system architecture, where a high-capacity Slow world model provides generalizable spatiotemporal representations and a lightweight Fast branch enables 30 Hz action prediction on NVIDIA RTX 4090. On real-robot zero-shot evaluations, scaling from target-robot data alone to over 120,000 hours of embodied video improves success from 36.1% to 77.8%. ZimaBlue further delivers strong performance across multiple benchmarks, with particularly pronounced gains on unseen tasks.

中文摘要

摘要:机器人操作面临一个根本的规模化挑战:稳健的泛化能力需要广泛的物理经验,但带动作标注的机器人轨迹收集成本高且多样性本质上受限。自我视角视频提供了一个更具可扩展性的具身经验来源,能够捕捉物体交互、接触动力学、工具使用以及跨多样环境的长时间行为。核心挑战在于如何将这种丰富但无动作标注的经验转化为有效的机器人控制。我们提出了ZimaBlue,一个可扩展的框架,用于从大规模视频中学习可泛化的世界动作模型(World Action Models, WAMs)。ZimaBlue遵循三阶段训练课程:首先在大规模人类和机器人自我视角视频上进行因果具身视频预训练,其次通过具有统一动作表示的视频-动作中期训练,将学到的视觉动力学在异构机器人轨迹中落地,最后将模型专门化到目标机器人以进行部署。为了让生成式WAMs在实时控制中变得可行,ZimaBlue进一步采用异步慢-快双系统架构,其中高容量的慢世界模型提供可泛化的时空表示,而轻量级的快分支实现了在NVIDIA RTX 4090上的30 Hz动作预测。在真实机器人零样本评估中,仅从目标机器人数据扩展到超过120,000小时的具身视频,将成功率从36.1%提升至77.8%。ZimaBlue在多个基准测试中也表现出强劲性能,尤其在未见过的任务上提升尤为显著。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文试图解决机器人操作领域中\*\*数据可扩展性与实时可控性\*\*之间的核心矛盾,具体可归纳为以下三个层面: --- ### 1. 动作标注数据的稀缺性与泛化瓶颈 通用机器人策略需要广泛的物理经验来实现鲁棒泛化,但带有动作标签(action-labeled)的机器人轨迹数据收集成本高昂,且在场景、物体和机器人形态上的多样性天然受限。相比之下,第一人称(egocentric)视频数据规模庞大、易于扩展,蕴含丰富的物体交互、接触动力学和工具使用等物理先验,但\*\*缺乏动作标注\*\*,难以被标准的视觉-语言-动作(VLA)模型直接利用。 ### 2. 将无动作视频转化为有效控制信号的表征难题 论文指出,简单地将通用视频生成模型(如视频扩散模型)迁移到机器人控制存在多重不匹配: - \*\*目标函数不匹配\*\*:通用视频模型优化的是视觉重建与文本描述的一致性,而机器人需要\*\*指令条件下的、与动作干预后果强相关\*\*的未来状态预测; - \*\*因果结构缺失\*\*:通用模型往往在整段视频上计算注意力或一次性生成长视频,而闭环控制器只能基于\*\*已观测到的历史\*\*进行因果预测; - \*\*物理先验污染\*\*:网络视频包含动画、特效、剪辑过渡等非物理内容,会削弱接触密集型操作所需的物理先验。 因此,论文提出需要\*\*面向具身交互的因果视频预训练\*\*,而非直接微调通用视频生成器。 ### 3. 生成式世界-动作模型的实时部署延迟 世界-动作模型(WAM)通过联合预测未来视频与动作来建立视觉理解与物理控制的联系,但生成式推理(如迭代去噪)计算开销大,导致闭环延迟高。在接触密集型任务中,机器人需要快速修正失败抓取或意外碰撞,过高的延迟会造成\*\*反应性差距(reactivity gap)\*\*,使模型难以在真实硬件上实时运行。 --- ### 总结 ZimaBlue 旨在通过\*\*大规模具身视频预训练\*\*(利用超过12万小时的无动作视频)联合学习视觉、物理与因果动态,再通过\*\*跨具身动作对齐\*\*和\*\*目标机器人专精\*\*将视频先验 grounded 到可执行控制,并最终通过\*\*异步 Slow-Fast 双系统架构\*\*将大容量世界模型的高频推理与轻量级实时动作生成解耦,从而在 30,Hz 的闭环频率下实现强泛化的机器人操作。 Q2: 有哪些相关研究? 论文在第2节(Related Work)中系统梳理了三个密切相关的前沿方向,现将其核心脉络与代表性研究总结如下。 --- ### 1. 视觉-语言-动作模型(Vision-Language-Action Models, VLA) 该方向通过扩展预训练的视觉-语言模型(VLM)直接实现端到端的运动控制,主要特点是\*\*以动作监督为核心\*\*。 - \*\*早期大规模策略\*\*:RT-1 与 RT-2 首次展示了将异构机器人演示数据吸收到统一语言条件策略中的可行性。 - \*\*近期代表性系统\*\*:OpenVLA、 π 0 、 π 0.5 、GR00T 以及 Gemini Robotics 等进一步引入预训练 VLM 骨干、基于扩散或流匹配(flow-based)的动作头,以及更广泛的跨具身数据,从而在指令跟随与物体级泛化上取得显著进展。 - \*\*模块化规划路线\*\*:另一支互补工作将基础模型仅用作高层语义规划器,再调用预设技能库或低级控制器完成物理交互,代表性工作包括 SayCan、PaLM-E、VoxPoser 与 ProgPrompt 等。 \*\*局限与缺口\*\*:VLA 的泛化能力仍受限于动作标注的机器人轨迹规模。它们往往继承了丰富的语义先验(“做什么”),却缺乏对物理场景在动作干预下如何演变的显式建模(“怎么做”的时空与接触动力学),这在长程操作、新物理技能及接触密集型交互中尤为突出。 --- ### 2. 世界-动作模型(World Action Models, WAM) 该方向主张\*\*联合建模视觉动态与动作生成\*\*,使控制依赖于对世界演变的理解,而非仅仅记忆标注轨迹。 - \*\*技术谱系\*\*:世界模型按状态表示可分为隐空间方法(latent dynamics)、3D 几何方法(点云/粒子预测)以及像素/视频空间方法(直接预测未来视觉观测)。视频空间方法因能提供每帧迁移的密集监督,且便于利用大规模预训练,被认为是通用操作的理想选择。 - \*\*“先想象再行动”(imagine-then-act)\*\*:先由模型生成未来视觉状态,再通过逆动力学或独立策略恢复动作,代表性工作包括 Video Prediction Policy、RoboDreamer 等。其固有缺陷在于开环漂移、生成观测与真实环境不匹配,以及测试时视频生成带来的额外延迟。 - \*\*端到端联合建模(WAMs)\*\*:在单一生成架构内同时输出未来帧与动作。代表性研究包括: - \*\*DreamZero\*\*:将预训练视频扩散模型适配为联合预测未来视频与动作,验证视频物理先验可提升零样本迁移能力; - \*\*LingBot-VA\*\*:以自回归视频-动作扩散形式交错视频与动作 token,配合因果注意力与 KV 缓存维持长程上下文; - \*\*LingBot-VA 2.0 / Cosmos Policy\*\*:倡导原生视频-动作预训练,引入面向具身的视觉-动作分词器、因果预训练与稀疏专家容量,而非简单 retrofit 通用视频生成器。 \*\*局限与缺口\*\*:现有 WAM 面临两大部署挑战:一是高质量视频生成计算昂贵,若每一步闭环控制都依赖完整视频去噪,将严重降低控制频率;二是多数架构将视频预测与动作执行绑定在相同短时域内,忽略了视觉推理与低级运动校正天然应运行在不同时间尺度上的事实。 --- ### 3. 异步双系统策略(Asynchronous Dual-System Policies) 该方向通过\*\*解耦慢速 deliberative 推理与快速反应性执行\*\*,缓解大模型推理延迟与实时控制需求之间的矛盾。 - \*\*分层与技能级规划\*\*:HiVLA、SkillDiffuser 等将长程任务分解为可执行子目标或技能,由扩散规划器生成中间里程碑。 - \*\*双策略/快慢系统\*\*:RoboDual、Galaxea G0、Fast-in-Slow 等结合通用大模型与轻量级专家控制器;Reactive Diffusion Policy 则引入快速触觉-视觉反馈通道以完成接触丰富的精细校正。 - \*\*异步 VLA 与动作分块\*\*:AsyncVLA 与 RTC(Real-Time Chunking)等通过将昂贵推理移出控制关键路径,实现高频闭环。 - \*\*面向 WAM 的异步设计\*\*:AHAWAM 将 WAM 显式重组为低频 video-DiT 世界规划器与高频 action-DiT 执行器,通过异步 horizon 自适应与观察引导的上下文路由,复用慢速规划器上下文并适配最新观测。 \*\*与本文的关系\*\*:上述工作为 ZimaBlue 的 Slow-Fast 双系统架构提供了直接铺垫,但 ZimaBlue 进一步将这一原则与\*\*大规模因果具身视频预训练\*\*相结合,使慢速分支不仅承担语义规划,更提供经过海量视频学习的、可泛化的物理动态表征,再由轻量快速分支以 30,Hz 频率执行闭环动作预测。 Q3: 论文如何解决这个问题? ZimaBlue 通过\*\*三阶段可扩展训练课程\*\*结合\*\*异步 Slow-Fast 双系统架构\*\*,从数据利用与实时部署两个维度系统性地解决了上述挑战。以下从训练范式、统一表征、模型架构与推理加速四个层面展开说明。 --- ### 1. 三阶段训练课程(数据金字塔) 该课程将“视频知识”与“动作控制”解耦,使各数据源承担其自然角色: #### Stage I:大规模因果具身视频预训练 在无任何动作标注的条件下,将通用文本到视频扩散 Transformer(Wan2.2-TI2V-5B)适配为因果视觉动力学模型。训练数据涵盖超过 120,000 小时的第一人称人类视频(EPIC-KITCHENS、EgoDex 等)、仿真操作轨迹与真实机器人演示。 - \*\*统一视觉接口\*\*:采用三行垂直画布表示多视角观测,缺失视角以掩码填充,统一单/多视角输入格式。 - \*\*块因果注意力(Block-Causal Attention)\*\*:将视频 latent 划分为时序块,每块内 clean 上下文作为因果历史,noisy 块作为并行去噪目标。该设计既保持了自回归 rollout 的因果依赖,又允许多个未来块并行训练。 - \*\*目标\*\*:仅优化视频流匹配损失,鼓励模型在干预条件下学习物体 affordance、接触事件与长程任务结构的物理因果规律。 视频流匹配形式化为:

L(vid) = E(z,ε,t)[ | m(vid) odot ( v(θ)^(vid)(zt, c(≤ t), ell) - v^(vid) ) |2^2 ]
其中 z_t = (1-σ_t^(vid))z + σ_t^(vid)ε , v^(vid) = ε - z , c
(≤ t) 为因果视觉上下文, ell 为语言指令。 #### Stage II:多具身视频-动作中间训练 引入 DROID、AgiBot、Galaxea、RoboMIND2-Franka 等异构机器人轨迹,将预训练视觉动态接地到可执行控制。 - **统一动作表征**:将不同机器人的原生控制接口映射到 100 维语义状态-动作空间(见第 2 节),通过 chunk 锚点相对化与 6D 旋转表示实现跨平台兼容。 - **联合视频-动作目标**:Slow 分支同时预测未来视频 latent 与动作块,迫使动作与视频 token 在共享骨干内交互。损失为

L^(sup) = λ(vid)L(vid) + λ(act)L(act)
其中动作损失
L(act) = E(a,eta,t)[ | m(act) odot ( v(θ)^(act)(at, z_t, c(≤ t), st, ell) - v^(act) ) |_2^2 ]
且 a_t = (1-σ_t^(act))a + σ_t^(act)eta , s_t 为 proprioceptive 状态。噪声级别在视频与动作间耦合,使视觉不确定性对齐于运动指令不确定性。 #### Stage III:目标具身后训练与 Fast 分支训练 - **Slow 专精**:在目标机器人或仿真基准数据上微调全部 DiT 参数,对未见仿真环境附加轻量具身专用编解码器,保留预训练动态与跨具身 grounding。 - **Fast 训练**:冻结 Slow,仅训练轻量级 Fast DiT(0.5B)。为复现异步闭环,采样执行偏移 δ ∈ 0,dots,H-1 ,令 Fast 基于最新观测 (c
δ, s_δ) 预测剩余动作后缀;同时引入已提交动作前缀(prefix)的 teacher-forcing,训练时模拟 RTC(Real-Time Chunking)机制以保持动作连续性。 —- ### 2. 统一 100 维状态-动作表征 为处理异构机器人(单臂、双臂、移动底座、灵巧手等),论文提出跨具身的 100 维语义槽位布局: | 槽位区间 | 维度 | 语义 | |—-|—-|—-| | [0,9) | 9 | 左末端执行器位姿(3D 平移 + 6D 旋转) | | [9,10) | 1 | 左夹爪 | | [10,19) | 9 | 右末端执行器位姿 | | [19,20) | 1 | 右夹爪 | | [20,27) | 7 | 左臂关节 | | [27,34) | 7 | 右臂关节 | | [34,38) | 4 | 躯干 | | [38,54) | 16 | 移动底座及辅助通道 | | [54,77) | 23 | 左手关节 | | [77,100) | 23 | 右手关节 | - **相对几何**:末端执行器动作相对于动作块首帧锚点 (p_0, R_0) 计算:

Delta p_h = R_0^(-1)(p_h - p_0), quad Delta R_h = R_0^(-1)R_h

  • **有效性掩码**:未激活槽位零填充并在损失中屏蔽,确保不同具身可在同一模型内协同训练。 —- ### 3. 异步 Slow-Fast 双系统架构 该架构将“高容量世界推理”与“高频动作执行”解耦: - **Slow DiT(5B)**:作为视频中心世界模型,处理观测、状态与语言条件,预测未来视频 latent,并在每层自注意力中缓存视频 K/V 特征 K_(slow) 。其辅助动作监督仅用于训练时强化视频-动作语义对齐,推理时 Slow 低频运行。 - **Fast DiT(0.5B)**:专用动作生成模块。其动作 query 在自注意力层中除关注自身观测、状态与动作 token 外,通过**交叉注意力**注入 Slow 缓存的视频 K/V,从而直接利用慢速分支的时空物理先验,无需显式生成完整未来视频。 - **推理模式**:Slow 以较低频率异步更新长程视觉指导;Fast 以最新观测和可用 Slow K/V 高频生成动作块,二者并发执行,避免 Fast 等待 Slow 完成。 —- ### 4. 实时部署加速 为使生成式 WAM 满足物理闭环的实时性要求,论文采用三级加速: - **异步推理**:Slow 与 Fast 分属不同线程/进程,Fast 持续使用最新可用 Slow K/V,已提交动作前缀保持执行连续性。 - **扩散步蒸馏(DMD)**:对 Slow 与 Fast 依次应用 Distribution Matching Distillation,将每分支的 DiT 评估次数从 8 步压缩至 2 步。学生生成器保留原始流匹配监督,并通过分布匹配方向

g(DMD)^b = hatx(0,f)^b - x(0,r)^bmean(valid)(|xg^b - x(0,r)^b|) + ε_(num)
对齐教师分布,其中 b ∈ S,F 分别对应 Slow 与 Fast 分支。 - **Torch 编译与 CUDA Graph**:进一步降低系统开销。 综合上述技术,系统在 NVIDIA RTX 4090 上将闭环延迟从基线 450 ms 逐步压缩至 **33 ms**,实现 **30 Hz** 的物理机器人控制,同时保持 75.0% 的零样本任务成功率(对比未蒸馏双系统的 77.8%)。 Q4: 论文做了哪些实验? 论文在第 6 节及附录中展开了系统的实验验证,涵盖**真实机器人零样本评估**、**双系统架构消融**以及**三大仿真基准测试**。以下是详细梳理: —- ### 1. 真实机器人零样本评估(Zero-Shot Real-Robot Evaluation) #### 1.1 实验设置 - **硬件平台**:7-DoF Franka 机械臂,配备两个外部 RGB 相机与一个腕部相机。 - **评估协议**:所有策略仅在 DROID 数据集上进行后训练(post-training),在**训练数据中未出现过**的 12 个任务上测试。 - **任务套件**: - **Standard(8 项)**:碗碟堆叠、杯子选择、面包转移、积木堆叠、空气炸锅抽屉开启、玩具收集、微波炉关门、烤面包机开关按下。 - **Perturbed(4 项)**:在 Standard 基础上引入受控视觉扰动,包括动态眩光/闪烁光照、背景干扰物、未见桌布与新物体。 - **对比方法**: - **四个 ZimaBlue 变体**(数据缩放消融): 1. Baseline(仅 DROID 后训练,初始化自 Wan2.2-TI2V-5B) 2. + 6K 小时多具身视频-动作数据 3. + 6K 多具身 + 60K 小时第一人称视频预训练 4. + 6K 多具身 + 120K 小时第一人称视频预训练 - **外部基线**: π 0.5 (使用 >10K 小时机器人数据及网络多模态数据)与 DreamZero(14B 参数 WAM,官方 DROID 后训练检查点)。 - **评估指标**:每项任务 10 次 rollout(Toys 任务含 30 个放置子单元),先计算任务级成功率,再对任务做宏平均。 #### 1.2 核心结果 | 配置 | Standard | Perturbed | 平均 | |—-|—-|—-|—-| | Baseline | 46.7% | 15.0% | 36.1% | | + 多具身 | 57.9% | 22.5% | 46.1% | | + 60K 视频 | 82.9% | 35.0% | 66.9% | | + 120K 视频 | **87.9%** | **57.5%** | **77.8%** | | π 0.5 | 65.4% | 32.5% | 54.4% | | DreamZero | 61.7% | 37.5% | 53.6% | - **缩放趋势**:从仅 300 小时目标机器人数据到 120,000 小时具身视频,零样本平均成功率单调提升至 **77.8%**。 - **多具身数据**主要提升可执行控制(如微波炉关门从 0/10 提升至 9/10)。 - **大规模视频预训练**主要增强视觉泛化与对观测变化的鲁棒性;将视频从 60K 增至 120K 小时,Perturbed 套件提升 **22.5 个百分点**,所有扰动任务均显著改善。 —- ### 2. 双系统架构消融(Dual-System Ablation) #### 2.1 实验设计 保持所有训练配置一致,仅改变推理架构: - **Slow**:仅使用 Slow DiT(5B)以较低频率生成 24 步动作块。 - **Slow-Fast**:Slow 异步提供视频 K/V 缓存,Fast DiT(0.5B)以实时频率基于最新观测生成动作。 #### 2.2 性能与延迟结果 | 架构 | Standard | Perturbed | 平均 | 延迟 | |—-|—-|—-|—-|—-| | Slow | 80.8% | 30.0% | 63.9% | 449.6 ms | | Slow-Fast | **87.9%** | **57.5%** | **77.8%** | 145.6 ms | | DMD 蒸馏 + 编译 | 85.0% | 55.0% | 75.0% | **33.0 ms** | - **Slow-Fast** 在 Standard 上提升 7.1 pp,在 Perturbed 上提升 **27.5 pp**,表明其在需要快速视觉反馈与状态修正的任务上优势显著。 - **加速**:异步执行带来 3.1× 加速(145.6 ms);结合 DMD 步数蒸馏(8 步 → 2 步)与 Torch 编译,总加速达 **13.6×**,闭环延迟降至 **33 ms**(约 30 Hz),且性能仅轻微下降(-2.8 pp)。 —- ### 3. 仿真基准测试(Benchmark Results) #### 3.1 LIBERO-Plus(鲁棒性评估) 评估在 7 种扰动(相机视角、机器人初始状态、语言指令、光照、背景、传感器噪声、物体布局)下的表现。 | 设置 | 方法 | 平均成功率 | |—-|—-|—-| | **零样本迁移** | ZimaBlue (Ours) | **86.7%** | | | InternVLA-A1.5 | 85.8% | | | π 0.5 | 85.2% | | **监督微调 (SFT)** | ZimaBlue (Ours) | **92.0%** | | | CAC-VLA | 90.1% | | | ACoT-VLA | 88.5% | - ZimaBlue 在零样本与 SFT 设置下均取得最优或次优表现,尤其擅长初始状态与光照变化。 - 相机视角变化是零样本瓶颈(58.1% → SFT 后 95.4%),表明视角多样性是未来数据缩放的关键目标。 #### 3.2 RoboTwin 2.0(双臂操作与域随机化) 在 50 项双臂任务上评估,对比 VLA 与 WAM 方法。 | 方法 | Clean | Randomized | 平均 | |—-|—-|—-|—-| | ZimaBlue (Ours) | **94.7%** | **94.3%** | **94.5%** | | ABot-M0.5 | 94.0% | 94.2% | 94.1% | | Qwen-RobotManip | 93.7% | 94.0% | 93.9% | - ZimaBlue 在 Clean 与 Randomized 设置下均排名第一,且两者差距仅 0.4 pp,证明其在视觉域随机化下的强稳定性。 #### 3.3 RoboCasa365(大规模日常操作与零样本泛化) 在 365 项任务上预训练,评估 50 项任务(18 项 Atomic-Seen、16 项 Composite-Seen、16 项 Composite-Unseen)。 | 方法 | Atomic-Seen | Composite-Seen | Composite-Unseen | 平均 | |—-|—-|—-|—-|—-| | Xiaomi-Robotics-1 | **80.2%** | **57.1%** | **32.1%** | **57.4%** | | ZimaBlue (Ours) | 78.1% | 50.4% | **16.5%** | 49.5% | | ABot-M0.6 | 79.4% | 48.3% | 7.9% | 46.6% | | ABot-M0.5 | 75.6% | 37.7% | 3.3% | 40.3% | - 在所有 WAM 方法中,ZimaBlue 的 Average、Composite-Seen 与 Composite-Unseen 均为最高。 - **关键发现**:在 Composite-Unseen(未见长程复合任务)上,ZimaBlue(16.5%)**超过 doubling** 此前的 WAM 最优结果 ABot-M0.6(7.9%)。论文将此归因于 120K 小时视频预训练带来的物理与因果先验。 - 定性对比(图 8)显示,去掉预训练与中间训练的模型在长程任务中会出现指代错误(抓取目标物体而非容器)与阶段错误(失败抓取后提前进入下一阶段)。 —- ### 4. 附录补充实验 - **A.1–A.5**:提供了 12 项真实机器人任务的详细定义、成功标准、逐任务成功率表格,以及扰动控制与失败分析。 - **B.1**:LIBERO-Plus 的逐套件(Spatial / Object / Goal / LIBERO-10)细分、SFT 与零样本的差距分析,以及每种扰动的可视化。 - **B.2**:RoboTwin 2.0 全部 50 项任务的逐项成功率。 - **B.3**:RoboCasa365 全部 50 项评估任务的逐项成功率。 Q5: 有什么可以进一步探索的点? 基于论文第7节(Conclusion and Future Work)及实验分析中暴露的瓶颈,可进一步探索的方向包括: —- ### 1. 多样化、多具身的评估基准建设 现有评估虽覆盖真实机器人与多个仿真环境,但任务分布与具身形态仍相对集中。未来亟需构建: - **跨形态、跨场景的综合性基准**:涵盖轮式、人形、灵巧手等更多具身类型,以及户外、工业等非桌面环境; - **长程复合任务与开放世界协议**:超越当前 50–365 项任务的封闭集合,引入动态人类干扰、不可预期物体状态变化等开放世界变量,以量化视频预训练带来的真实泛化边界。 —- ### 2. 数据与模型规模的同步扩展 论文当前使用 120,000 小时视频,但明确指出这“仅是冰山一角”: - **数据维度**:进一步整合更大规模、更多样的第一人称人类视频(如 Ego-Exo4D、EgoScale 等),并探索**视频-动作-语言**三模态的联合 scaling law; - **模型维度**:扩大 DiT 骨干网络容量(如从 5B 迈向 20B+ 参数),研究世界动作模型在参数量与数据量同时增长时的涌现能力,尤其是在物理因果推理与长程预测上的质变。 —- ### 3. 高层认知推理与层次化规划 当前 ZimaBlue 的推理主要嵌入在视频-动作联合生成中,缺乏显式的高层符号规划。未来可探索: - **推理模块的显式注入**:在大规模 WAM 之上集成链式思考(Chain-of-Thought)或视觉-语言推理模块,使机器人能够进行**任务分解、子目标生成与动态自校正**; - **世界模型驱动的树搜索 / MCTS**:利用 Slow 分支的未来想象能力,在推理时进行多步 rollout 与代价评估,实现从“单步反应”到“多步规划”的跃迁,解锁复杂长程操作。 —- ### 4. 上下文学习(In-Context Learning)与即时技能获取 论文提出将物理演示直接作为推理时的 prompt,无需梯度更新即可执行新行为: - **演示作为视频-动作 prompt**:在推理阶段向模型输入少量同任务的人类或机器人视频片段,利用 WAM 的因果视频先验实现**单次或少次示范迁移**; - **在线情境适应**:结合实时观测历史作为动态上下文,使模型在部署过程中即时适应环境变化(如物体材质、光照突变),突破当前预训练-微调范式的局限。 —- ### 5. 观察视角泛化与多模态感知融合 LIBERO-Plus 实验揭示:**相机视角变化**是零样本迁移的显著瓶颈(58.1% → SFT 后 95.4%)。这提示: - **视角不变性表征学习**:在预训练中引入更强的几何增强、显式 3D 位姿编码或神经辐射场(NeRF)先验,降低对特定相机配置的依赖; - **触觉与力反馈的融合**:当前系统仅依赖 RGB 与本体感知。将触觉传感器、力/力矩信号统一编码进视频-动作 tokenizer,可显著提升接触密集型任务(如抓取打滑检测、装配)的鲁棒性。 —- ### 6. 实时性与动作连续性的进一步优化 尽管已通过 Slow-Fast 双系统与 DMD 蒸馏实现 30 Hz 控制,但仍有提升空间: - **单步或零步扩散生成**:探索 consistency model、流匹配直接蒸馏(distilled flow matching)或自回归动作生成,将 Fast 分支压缩至单次前向传播; - **自适应重规划(Adaptive Replanning)**:当前 RTC 机制使用固定前缀长度。可引入基于状态估计不确定性的**动态重规划触发器**,仅在必要时激活 Fast 推理,进一步降低平均计算开销并减少动作抖动。 —- ### 7. 失败恢复与进度感知控制 真实机器人实验显示,即使在强基线配置下,扰动场景成功率仍受限(57.5%)。剩余失败多源于: - **局部交互错误后的恢复不足**:如目标位移、接触丢失; - **缺乏显式任务进度监控**。 未来可探索: - **进度感知的世界模型**:在 Slow 分支中显式预测任务完成度或子目标里程碑,指导 Fast 分支在失败时触发恢复行为; - **逆向动力学与重抓取策略库**:利用视频预训练学到的“如何纠正”先验(如从失败视频中学习恢复模式),实现闭环错误修正。 Q6: 总结一下论文的主要内容 该论文围绕机器人操作的**数据可扩展性**与**实时可控性**两大核心挑战,提出了 **ZimaBlue**,一个基于大规模视频预训练的通用世界-动作模型(World Action Model, WAM)框架。以下是主要内容概括: —- ### 1. 研究背景与核心问题 通用机器人策略需要广泛的物理经验以实现鲁棒泛化,但带有动作标签的机器人轨迹数据收集成本高昂且多样性有限。与此同时,第一人称(egocentric)视频数据规模庞大、易于获取,蕴含丰富的物体交互、接触动力学与长程任务结构,却**缺乏动作标注**,难以被标准视觉-语言-动作(VLA)模型直接利用。 此外,生成式世界-动作模型通常依赖迭代去噪,推理延迟高,难以满足接触密集型任务的实时闭环控制需求。因此,核心问题在于: - 如何将海量**无动作视频**转化为有效的机器人控制能力; - 如何在保持世界模型强泛化能力的同时,实现**高频实时动作生成**。 —- ### 2. ZimaBlue 方法框架 论文提出了一套三阶段训练课程与异步双系统推理架构。 #### 2.1 三阶段数据金字塔训练 - **Stage I:因果具身视频预训练** 在大规模人类与机器人第一人称视频(最多 120,000 小时)上进行无动作标注的预训练。模型基于过去观测与语言指令预测未来视觉状态,学习因果物理动态、物体 affordance 与长程任务结构。采用**块因果注意力**(block-causal attention)机制,在并行训练效率与自回归推理一致性之间取得平衡。 - **Stage II:多具身视频-动作中间训练** 引入异构机器人轨迹(DROID、AgiBot、Galaxea、RoboMIND2-Franka 等),通过**统一的 100 维语义状态-动作表征**将不同具身映射到共享空间。Slow 分支联合预测未来视频 latent 与动作块,迫使视觉动态与运动指令在共享表征中深度耦合。动作采用相对于 chunk 锚点的相对位姿表示:

Delta p_h = R_0^(-1)(p_h - p_0), quad Delta R_h = R_0^(-1)R_h

  • **Stage III:目标具身后训练与 Fast 分支训练** 将模型专精到目标部署环境。随后冻结 Slow 分支,训练轻量级的 **Fast DiT(0.5B)**。为模拟异步闭环执行,Fast 在训练中采样随机执行偏移与动作前缀,通过 Real-Time Chunking(RTC)机制学习基于最新观测的高频动作修正。 #### 2.2 异步 Slow-Fast 双系统架构 - **Slow DiT(5B)**:作为低频世界模型,生成长程视觉预测的层间 K/V 缓存,提供可泛化的时空物理表征。 - **Fast DiT(0.5B)**:作为高频动作执行器,其动作 query 在自注意力层中**交叉关注** Slow 分支缓存的视频 K/V,无需显式生成完整未来视频即可直接输出动作。 - 两分支并发运行:Slow 异步更新视觉指导,Fast 基于最新观测与可用缓存持续闭环控制。 #### 2.3 实时加速方案 通过异步推理、Distribution Matching Distillation(DMD,将扩散步数从 8 步蒸馏至 2 步)以及 Torch 编译优化,系统在 NVIDIA RTX 4090 上将闭环延迟从 450 ms 逐步压缩至 **33 ms**,实现约 **30 Hz** 的物理控制频率。 —- ### 3. 实验验证 #### 3.1 真实机器人零样本评估 在 7-DoF Franka 机械臂上评估 12 项训练时未见的零样本任务(含 8 项标准任务与 4 项视觉扰动任务)。数据显示单调的扩展趋势: - 仅目标机器人数据(300 小时):成功率 **36.1%**; - 加入 6K 小时多具身数据:**46.1%**; - 进一步加入 120K 小时视频预训练:**77.8%**(Standard 套件 87.9%,Perturbed 套件 57.5%),显著优于 π 0.5 (54.4%)与 DreamZero(53.6%)。 #### 3.2 双系统消融 引入 Fast 分支后,Perturbed 套件成功率从 30.0% 跃升至 **57.5%**,证明异步高频修正在视觉偏移与接触密集型场景中的关键价值。 #### 3.3 仿真基准测试 - **LIBERO-Plus**:零样本平均成功率 **86.7%**,监督微调后达 **92.0%**,在多种扰动下优于现有 VLA 与 WAM 方法。 - **RoboTwin 2.0**:在 50 项双臂任务上取得 **94.5%** 的平均成功率,且 Clean 与 Randomized 设置差距仅 0.4 pp,展现出色的域随机化鲁棒性。 - **RoboCasa365**:在 WAM 类方法中排名第一,尤其在 **Composite-Unseen**(未见长程复合任务)上达到 **16.5%**,较此前最优 WAM 基线(7.9%)提升超过一倍,验证了大规模视频预训练对零样本泛化的决定性作用。 —- ### 4. 结论与贡献 论文的核心贡献包括: - 论证了**大规模具身视频预训练**作为机器人学习独立扩展轴的有效性,提供了从 36.1% 到 77.8% 的系统性数据扩展证据; - 提出了**三阶段训练框架**(视频预训练 → 多具身动作对齐 → 目标专精)与**跨具身统一动作表征**; - 设计了**Slow-Fast 双系统架构**,首次将大容量生成式 WAM 推向 30 Hz 的实时物理闭环控制。 该工作表明:机器人智能可以通过“从视频中广泛学习世界动态,再通过解耦的慢速推理与快速控制高效执行”这一范式实现 scalable 的泛化与部署。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Xionghao Wu, Yijun Yang, Shiyang Zhou, Haoze Sun, Jianhui Liu, Songsong Yu, Jiyao Zhang, Wenbo Li, Bo Wang, Guoqing Ma, Lin Song, Renjie Liao, Shenghe Zheng, Wei Tang, Xiaojuan Qi, Yanwei Li, Yuan Zhang, Zhuotao Tian, Haoyang Huang, Nan Duan

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00188.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00188

Published: 2026-09-03T01:27:30.952Z


4. A Lagrangian View of Flow Matching

Abstract:Modern explicit-time generative models, such as Flow Matching [Lipman et al., 2023] and Rectified Flow [Liu et al., 2023], are typically derived top-down via Optimal Transport and the continuity equation. This standard Eulerian approach focuses on the macroscopic transport of probability mass. In this paper, we present an alternative, bottom-up mechanical derivation grounded in a Lagrangian (particle-centric) perspective. By analyzing the local Taylor expansion of a continuous denoiser, we motivate a strict invariance condition required for optimal, singlestep generation: the conservation of target identity. Enforcing this condition yields a governing quasi-linear advection Partial Differential Equation (PDE). We demonstrate that solving this PDE via the Method of Characteristics analytically yields the straight-line trajectories of Flow Matching. This geometric perspective isolates the Jacobian of the denoiser as the primary source of trajectory curvature, providing a direct mathematical explanation for why straight-line flows enable massive step sizes, and why empirical models require distillation to flatten intersecting characteristics.

中文摘要

摘要:现代显式时间生成模型,如流匹配(Flow Matching)[Lipman 等, 2023] 和修正流(Rectified Flow)[Liu 等, 2023],通常是通过最优传输(Optimal Transport)和连续性方程自上而下推导出来的。这种标准的欧拉方法关注概率质量的宏观传输。在本文中,我们提出了一种替代方案,即基于拉格朗日(以粒子为中心)视角的自下而上的机械推导。通过分析连续去噪器的局部泰勒展开,我们提出了单步生成所需的严格不变性条件:目标身份的守恒。强制执行该条件得到一个准线性对流偏微分方程(PDE)。我们展示了通过特征线方法(Method of Characteristics)解析地求解该 PDE 可以得到流匹配的直线轨迹。这一几何视角将去噪器的雅可比矩阵(Jacobian)孤立为轨迹曲率的主要来源,为直线流能够实现大步长,以及为什么经验模型需要蒸馏以抹平相交特征线提供了直接的数学解释。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00198 (HTTP 429)

Authors: Peyman Milanfar

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00198.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00198

Published: 2026-09-03T01:27:30.952Z


5. Distributed Implicit Harm: A Compositional Safety Blind Spot in MLLM-Based Video Moderation

Abstract:Despite their growing use in video moderation, multimodal large language models (MLLMs) exhibit a compositional safety blind spot: videos composed of seemingly benign components can convey harmful meaning when interpreted as a whole. We refer to this phenomenon as Distributed Implicit Harm (DIH), where harm arises from relations among components distributed along a decomposition axis of the video, rather than from any single explicit cue. Among many possible axes, we study two representative cases: temporally distributed harm across visual segments (DIH-T) and cross-modal harm between audio and visual streams (DIH-M). Studying and mitigating DIH at scale requires data that is difficult to collect: such videos lack compositional harm annotations, evade retrieval based on local visual cues, keywords, or single-modality signals, and are consequently absent from existing safety datasets. To bridge this gap, we develop a multi-agent synthesis framework that composes individually benign components into harmful scenarios and generates diverse DIH videos with explicit reasoning annotations, yielding a dataset of over 9,000 videos spanning visual-only and audio-visual settings. Benchmarking over 30 MLLMs spanning frontier proprietary models and leading open-source systems reveals substantial and consistent deficits in detecting both DIH-T and DIH-M. Notably, this failure persists even among the strongest frontier models: they often correctly assess individual components in isolation but fail to recognize the harmful meaning that emerges from their composition. We further evaluate these models on a manually collected set of real-world DIH videos from social media and observe the same failure mode, highlighting DIH as a practical and underexplored challenge for video moderation.

中文摘要

摘要:尽管多模态大型语言模型(MLLMs)在视频审核中的使用日益增长,但它们表现出组合安全盲点:由看似无害的组件组成的视频在整体解读时可能传达有害含义。我们将这种现象称为分布式隐性危害(DIH),即危害源自沿视频分解轴分布的组件之间的关系,而非来自任何单一显性线索。在众多可能的轴中,我们研究了两个代表性案例:跨视觉片段的时间分布危害(DIH-T)和音频与视觉流之间的跨模态危害(DIH-M)。在大规模研究和缓解DIH需要难以收集的数据:这类视频缺乏组合性危害标注,基于局部视觉线索、关键词或单模态信号难以检索,因此在现有安全数据集中缺失。为填补这一空白,我们开发了一个多代理合成框架,将单个无害组件组合成有害场景,并生成带有显式推理标注的多样化DIH视频,生成了超过9,000个跨视觉单模态和音视频场景的视频数据集。在超过30个MLLMs的基准测试中,包括前沿专有模型和领先开源系统,结果显示在检测DIH-T和DIH-M方面存在显著且一致的不足。值得注意的是,即使在最强的前沿模型中,这种失败仍然存在:它们通常能正确评估单个组件的孤立状态,但无法识别从其组合中产生的有害含义。我们进一步在手工收集的真实社交媒体DIH视频集上对这些模型进行评估,观察到同样的失败模式,凸显了DIH作为视频审核中的一个实际且尚未充分研究的挑战。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00206 (HTTP 429)

Authors: Ruotong Wang, Zihao Zhu, Siwei Lyu, Xin Tao, Baoyuan Wu

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00206.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00206

Published: 2026-09-03T01:27:30.952Z


6. Beyond Language Priors: Diagnosing and Fixing Visual-Origin Hallucinations in Multimodal LLM

Abstract:Existing research on object hallucination in multimodal large language models (MLLMs) predominantly attributes the problem to language priors such as over-reliance on textual co-occurrence statistics. We challenge this view by presenting quantitative evidence for a complementary, under-explored cause: visual-origin hallucination, where hallucinations arise from incorrect visual feature extraction and misalignment between image and text embeddings. Through cosine similarity analysis and Smooth Grad-CAM entropy measurements, we show that hallucinated samples exhibit systematically lower image-text similarity (average 0.158 vs. -0.122) and inverted attention patterns, where attention is dispersed when the target object is present but wrongly concentrated when it is absent. Guided by this diagnosis, we propose Adversarial Contrastive Fine-Tuning (ACFT). ACFT uses an Adversarial Hallucination Attribute Flipping (AHAF) procedure, involving minimal, targeted adversarial perturbations that flip an image’s hallucination attribute, to construct perfectly aligned positive-negative pairs, which are then used for contrastive fine-tuning. AHAF simultaneously serves as a diagnostic probe, revealing that MLLM visual representations lie dangerously close to hallucination decision boundaries. Requiring only 0.9% of the COCO dataset and adding zero inference overhead, ACFT achieves state-of-the-art performance on POPE, MME, and four description-level hallucination benchmarks across LLaVA, MiniGPT-4, and Qwen2.5-VL. Code is available at this https URL

中文摘要

摘要:现有关于多模态大语言模型(MLLMs)中物体幻想的研究主要将该问题归因于语言先验,例如过度依赖文本共现统计。我们通过定量证据提出了一种互补且尚未充分探索的原因:视觉来源的幻想,即幻想来源于错误的视觉特征提取以及图像与文本嵌入之间的不对齐。通过余弦相似度分析和Smooth Grad-CAM熵测量,我们发现幻想样本表现出系统性较低的图像-文本相似度(平均0.158 对比 -0.122)以及相反的注意力模式:当目标物体存在时注意力分散,而当其不存在时注意力错误集中。基于这一诊断,我们提出了对抗对比微调(Adversarial Contrastive Fine-Tuning, ACFT)。ACFT使用对抗幻想属性翻转(Adversarial Hallucination Attribute Flipping, AHAF)过程,通过最小的、有针对性的对抗扰动翻转图像的幻想属性,从而构建完美对齐的正负样本对,再用于对比微调。AHAF同时也作为诊断探针,揭示出MLLM的视觉表示危险地接近幻想决策边界。ACFT只需使用COCO数据集的0.9%,并且不增加任何推理开销,即可在LLaVA、MiniGPT-4和Qwen2.5-VL上实现POPE、MME及四个描述级幻想基准的最先进性能。代码可通过此https URL获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00231 (HTTP 429)

Authors: Peiyang Xu, Xiaopei Zhu, Jun Zhu, Xiaolin Hu

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00231.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00231

Published: 2026-09-03T01:27:30.952Z


7. Beyond Blind Compliance: Benchmarking Task Verification in OCR Reasoning

Abstract:Multimodal Large Language Models (MLLMs) have achieved strong performance on OCR-centric document understanding and text-rich visual reasoning benchmarks. Yet existing evaluations largely assume that every task is valid and answerable. In real-world OCR scenarios, this assumption often fails: questions may rely on illegible text, occluded evidence, nonexistent visual targets, contradictory premises, or missing variables. We study this reliability gap as OCR-grounded Task Verification: before answering, a model should determine whether the Image Premise (IP), Textual Premise (TP), and Question (Q) jointly define an executable task. We introduce VeriOCRBench, a 1,800-sample human-verified benchmark built from source images drawn from 8 OCR-related datasets and spanning 8 real-world image domains, with controlled, image-grounded diagnostic tasks. It contains 1,600 trap-injected invalid tasks across 8 trap types and four verification dimensions—-Visual, Contextual, Factual, and Logical—-plus 200 trap-free controls for measuring over-refusal. Built with a Visual Atomic Fact (VAF)-anchored pipeline and full human auditing, VeriOCRBench enables decoupled evaluation of task verification, root-cause diagnosis, and over-refusal. Evaluating 15 leading MLLMs reveals persistent blind compliance, diagnosis failures, and prompt-induced over-refusal, exposing a critical reliability gap in current OCR reasoning systems. The code is available at: this https URL.

中文摘要

摘要:多模态大语言模型(MLLMs)在以OCR为中心的文档理解和文本丰富的视觉推理基准上表现出强大的性能。然而,现有评估在很大程度上假设每个任务都是有效且可回答的。在现实的OCR场景中,这一假设往往不成立:问题可能依赖难以识别的文本、被遮挡的证据、不存在的视觉目标、自相矛盾的前提或缺失的变量。我们将这一可靠性差距研究为基于OCR的任务验证:在回答之前,模型应确定图像前提(IP)、文本前提(TP)和问题(Q)是否共同定义了一个可执行的任务。我们引入VeriOCRBench,这是一个由1,800个样本组成的人类验证基准,来源于8个OCR相关数据集的原始图像,涵盖8个真实世界图像领域,并具有受控、基于图像的诊断任务。它包含1,600个注入陷阱的无效任务,分为8种陷阱类型和四个验证维度——视觉、上下文、事实和逻辑——以及200个无陷阱对照用于衡量过度拒绝。VeriOCRBench通过以视觉原子事实(VAF)为锚的管道构建并经过完整的人类审核,使任务验证、根因诊断和过度拒绝的评估可以解耦进行。对15个领先的MLLMs的评估显示了持续的盲目遵从、诊断失败及提示引起的过度拒绝,揭示了当前OCR推理系统中的关键可靠性差距。代码可在以下网址获取:此https URL。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00232 (HTTP 429)

Authors: Yue Zhou, Yuan Wu, Yi Chang

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00232.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00232

Published: 2026-09-03T01:27:30.952Z


8. CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction

Abstract:Long-tail autonomous driving failures are often framed as rare-object recognition errors. We argue that this view is incomplete: the decision-critical question is not only whether a model recognizes an unusual object, but whether it infers how that object changes the ego vehicle’s feasible high-level actions. We formalize this problem as decision-level driving affordance prediction, where a model maps a front-view image, ego-motion history, and navigation command to a structured longitudinal—lateral meta-action. To evaluate this capability, we introduce CoLT-Drive, a 3,536-sample counterfactual long-tail benchmark that inserts rare objects into otherwise fixed driving scenes and measures whether models predict acceptable action pairs. To improve deployable small VLMs, we propose KPA, a knowledge-preserving adaptation framework that combines structured perception-to-decision prompting, SLERP-based expert merging, and RegMoE, a regime-aware LoRA mixture-of-experts module. KPA preserves the pretrained model’s open-world knowledge while allocating lightweight adaptation capacity to different driving decision regimes. Experiments on an in-domain driving split and CoLT-Drive show that KPA achieves 60.8\% pair accuracy on CoLT-Drive, outperforming the pretrained Qwen3-VL-2B baseline (50.3\%) and LoRA SFT (32.4\%) while maintaining competitive in-domain accuracy. Our benchmark and code are available at this https URL and this https URL.

中文摘要

摘要:长尾自动驾驶失败通常被描述为稀有物体识别错误。我们认为这种观点是不完整的:决策关键的问题不仅在于模型是否能识别异常物体,还在于它是否能推断该物体如何改变自车可行的高层次动作。我们将这一问题形式化为决策级驾驶可行性预测,其中模型将前视图像、自车运动历史和导航指令映射到结构化的纵向-横向元动作。为了评估这一能力,我们引入了CoLT-Drive,一个包含3,536个样本的反事实长尾基准,它将稀有物体插入原本固定的驾驶场景,并测量模型是否能预测可接受的动作对。为了改进可部署的小型VLMs,我们提出了KPA,一种知识保留适应框架,结合了结构化感知到决策提示、基于SLERP的专家融合,以及RegMoE,一种感知驾驶决策状态的LoRA专家混合模块。KPA在保留预训练模型开放世界知识的同时,将轻量级适应能力分配到不同驾驶决策状态。对域内驾驶数据分割和CoLT-Drive的实验表明,KPA在CoLT-Drive上实现了60.8%的动作对准确率,优于预训练的Qwen3-VL-2B基线(50.3%)和LoRA SFT(32.4%),同时保持了具有竞争力的域内准确率。我们的基准和代码可在此https URL和此https URL获得。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00242 (HTTP 429)

Authors: Zhengxu Tang, Guofeng Cui, Ziyu Gong, Xiaozhou Zhang, Ruifeng Deng, Chengzhi Qi, Ke Chen, Sachin Patil, Tianjun Xiao, Langechuan Liu, Pichao Wang

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00242.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00242

Published: 2026-09-03T01:27:30.952Z


9. CrossFeat: Bridging Imaging Modalities in Feature Descriptor Space

Abstract:Most advances in keypoint descriptions address monomodal settings, where image variations arise from viewpoint, illumination, or contrast changes. Multimodal scenarios involve images produced by fundamentally different sensing processes, such as multispectral imaging, RGB-depth, satellite imagery, or medical imaging, causing the same structures to appear differently. A common solution to cross-modal description is to train descriptors for each modality pair, which requires retraining whenever the modalities change, or to train large models, which incur a significant increase in runtime. Instead, we propose CrossFeat, a framework that enables an existing monomodal descriptor to operate across modalities. Our method learns a crossing function in descriptor space that maps features from one modality to a representation compatible with another. To preserve the structural information captured by the original descriptor, CrossFeat introduces a geometry-appearance disentanglement such that only appearance is altered while the geometric properties are preserved. Experiments across multiple domains and datasets demonstrate improved performance in multimodal matching.

中文摘要

摘要:大多数关键点描述的进展集中在单模态环境中,其中图像变化源于视角、光照或对比度的变化。多模态场景涉及由根本不同的感测过程产生的图像,如多光谱成像、RGB-深度、卫星影像或医学成像,使得相同的结构呈现不同的外观。跨模态描述的常见解决方案是为每对模态训练描述符,这在模态变化时需要重新训练,或者训练大型模型,这会显著增加运行时间。相反,我们提出了CrossFeat,一个使现有单模态描述符能够在不同模态之间工作的框架。我们的方法在描述符空间中学习一个交叉函数,将一种模态的特征映射到与另一模态兼容的表示。为了保留原始描述符捕捉到的结构信息,CrossFeat引入几何-外观的解耦,使得仅改变外观,而几何属性得以保持。在多个领域和数据集上的实验表明,该方法在多模态匹配中提高了性能。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00272 (HTTP 429)

Authors: Paul Schneider, Nazim Haouchine

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00272.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00272

Published: 2026-09-03T01:27:30.952Z


10. StreamScout: Learning When to Look Deeper for Streaming Video Understanding

Abstract:Streaming video understanding requires answering questions that arrive at arbitrary moments over an unbounded video stream. Existing systems primarily focus on what to retain in a bounded memory, yet access that memory using the same fixed-cost procedure for every query, despite substantial variation in the evidence required. We argue that deciding how deeply to access memory for each query is as important as deciding what the memory should store. To this end, we introduce StreamScout, an adaptive inference framework that maintains only a lightweight textual timeline in context as the stream unfolds. At query time, StreamScout progressively augments the timeline with up to three increasingly informative visual views: a glance at recent frames, a uniform look-back over the past stream, and query-salient retrieval. At each stage, the model answers immediately if the available evidence is sufficient; otherwise, it escalates to the next view. To improve this stop-or-escalate policy, we probe the cascade on an auxiliary set and distill the model’s empirical competence boundary into supervision for a lightweight LoRA adaptation, yielding StreamScout-S. We further refine the policy through reinforcement learning, allowing the model to explore stopping behaviors beyond imitation of the distilled decisions, yielding StreamScout-R. Across three backbones and three streaming benchmarks, StreamScout and its variants consistently outperform prior streaming methods while substantially reducing inference cost and token consumption; on OVO-Bench, for instance, StreamScout-S improves Qwen3-VL-8B by 14.65 points while using 59% fewer tokens than uniform sampling and answering in 1.04 s on average.

中文摘要

摘要:流媒体视频理解需要对在无限制的视频流中任意时间出现的问题作出回答。现有系统主要关注在有限内存中保留什么内容,但对于每个查询都使用相同的固定成本程序访问这些内存,尽管所需证据存在显著差异。我们认为,决定为每个查询访问内存的深度与决定内存应存储什么同样重要。为此,我们引入了 StreamScout,一种自适应推理框架,在流媒体展开过程中,仅在上下文中维护轻量级的文本时间线。在查询时,StreamScout 会逐步通过最多三种越来越具信息性的视觉视图增强时间线:快速浏览最近帧、对过去流的均匀回顾,以及查询相关检索。在每个阶段,如果可用证据足够,模型立即回答;否则,它会升级到下一种视图。为了改进这种停止或升级的策略,我们在辅助数据集上对级联进行探查,并将模型的经验能力边界蒸馏为轻量级 LoRA 适应的监督,从而得出 StreamScout-S。我们进一步通过强化学习优化该策略,使模型能够探索超越蒸馏决策模仿的停止行为,从而得到 StreamScout-R。在三个主干网络和三个流媒体基准测试中,StreamScout 及其变体在显著降低推理成本和 token 消耗的同时,一直优于之前的流媒体方法;例如,在 OVO-Bench 上,StreamScout-S 提升了 Qwen3-VL-8B 14.65 个点,同时比均匀采样使用的 token 少 59%,平均回答时间为 1.04 秒。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.00291 (HTTP 429)

Authors: Ce Zhang, Jing Bi, Jinxi He, Jianshu Zhang, Jingyang Lin, Yunzhong Xiao, Minghao Fu, Yaqi Xie, Zhentao Xie, Weicong Chen, Katia Sycara, Ming Zhou

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.00291.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.00291

Published: 2026-09-03T01:27:30.952Z