ArXiv Domain 2026-09-01
数据来源:ArXiv Domain
LLM Domain Papers
1. Accelerating LLM Inference via Vector Index Based Output Embeddings
Abstract:Large output embedding matrices create a significant memory bandwidth bottleneck during autoregressive decoding, especially for compact LLMs with large multilingual vocabularies. We reformulate the output projection followed by top-k token selection as a maximum inner product search over token embeddings and replace the dense vocabulary projection with an HNSW-based vector index. The resulting output head retrieves only a small candidate set of high-scoring tokens and can be integrated into existing decoding pipelines by scattering retrieved logits into a sparse full-vocabulary tensor. On CPU inference with Gemma 3, Llama 3.2, and Qwen 3 models, our method substantially accelerates the output projection and improves end-to-end batch-size-one decoding throughput by up to 82% for Gemma 3 270M, while preserving generation quality under AlpacaEval evaluation. These results suggest approximate retrieval is a practical alternative to dense output projections in latency-sensitive small-batch decoding.
中文摘要
摘要:在自回归解码过程中,大型输出嵌入矩阵会造成显著的内存带宽瓶颈,尤其是对于拥有大型多语言词汇表的紧凑型大型语言模型(LLM)。我们将输出投影及其后的 top-k 令牌选择重新表述为对令牌嵌入的最大内积搜索,并用基于 HNSW 的向量索引替代密集词汇投影。由此得到的输出头仅检索少量高分候选令牌,并可以通过将检索到的 logits 散布到稀疏的全词汇张量中,集成到现有的解码管道中。在使用 Gemma 3、Llama 3.2 和 Qwen 3 模型的 CPU 推理中,我们的方法显著加速了输出投影,并在保持 AlpacaEval 评估下生成质量的同时,将 Gemma 3 270M 模型端到端单样本解码吞吐量提高了最多 82%。这些结果表明,在对延迟敏感的小批量解码中,近似检索是密集输出投影的可行替代方案。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27460 (HTTP 429)
Authors: Martin Loretz, Sepp Hochreiter
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27460.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27460
Published: 2026-09-01T02:02:37.776Z
2. SciReC: Diagnostic Evaluation of Multimodal, Multi-Turn Relational Reasoning with Adaptive Interaction
Abstract:Relational reasoning requires the process of perceptual understanding, comparing, and integrating the underlying relationships between concepts. This ability consists of multiple categories, such as analogical, structural, and cause-effect, each capturing a different aspect of higher-order understanding. To examine the performance of multimodal large language models (MLLM) on these relational inference tasks, we developed SciReC, a model-adaptive multimodal academic dialog benchmark. As the relational reasoning process involves multiple representations and various factors (visual understanding, exhibiting knowledge, and memory recall), we propose DMRA, a deficit-based diagnostic framework that quantifies the contribution of these components to identify the primary cause of unsuccessful cases. Claude 4.6 achieved the best performance on the overall relational score with 73\%, followed by GPT 5.4 with 68\%. Performance trends indicate that open-source models achieve their lowest scores on spatial relations, while proprietary models struggle more with hierarchical and sequential relations. Across domains, model performance is lowest on Astronomy and highest on Psychology. The results of DMRA reveal that relational reasoning is the primary source of error across all models, followed by memory limitations.
中文摘要
摘要:关系推理需要感知理解、比较和整合概念之间潜在关系的过程。这种能力包括多个类别,例如类比推理、结构推理和因果推理,每类捕捉高阶理解的不同方面。为了检验多模态大语言模型(MLLM)在这些关系推理任务上的表现,我们开发了 SciReC,一种模型自适应的多模态学术对话基准。由于关系推理过程涉及多种表征和各种因素(视觉理解、知识展示和记忆回忆),我们提出了 DMRA,一种基于缺陷的诊断框架,用以量化这些组件的贡献,从而识别未成功案例的主要原因。Claude 4.6 在整体关系分数上表现最佳,达到 73%,其后是 GPT 5.4 的 68%。性能趋势显示,开源模型在空间关系上得分最低,而专有模型在层级关系和顺序关系上表现较弱。跨领域来看,模型在天文学上的表现最差,在心理学上表现最好。DMRA 的结果表明,关系推理是所有模型错误的主要来源,其次是记忆限制。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27461 (stream has been aborted)
Authors: Nilay Yilmaz, Naga Sai Abhiram Kusumba, Stella Wenxing Liu, Yezhou Yang
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27461.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27461
Published: 2026-09-01T02:02:37.776Z
3. Sledgehammer or Scalpel? A Fine-grained Adaptive Framework for Implicit Hate Speech
Abstract:Unlike explicit attacks with obvious profanity, implicit hate speech hides malice within seemingly compliant expressions through metaphors and contextual hints, making its detection in online content review challenging. While existing PLM- or LLM-based methods perform well, they typically apply a single reasoning process to all samples. This overlooks fine-grained linguistic nuances and causes unnecessary computation for simpler cases. We observe that online hate speech is not monolithic but manifests in varied forms. We therefore define three fine-grained categories: Shallow, Targeted, and Context-Dependent. Accordingly, we propose Fine-grained Adaptive Implicit Hate speech Detection (FAID), a novel framework that first performs fine-grained classification and then adapts to specific categories. Specifically, for Shallow samples with surface-identifiable intents, the framework adopts lightweight prompt-tuning for rapid classification; for Targeted comments that bind malicious intent to concealed targets, we design knowledge augmentation to iteratively refine the model and reveal hidden targets; for Context-Dependent comments lacking background information, we utilize an agentic framework that automatically generates prompts to evolve context, infer missing background information and identify ambiguous malicious intents. This adaptive architecture focuses computational resources on complex implicit samples while avoiding redundant reasoning for shallow samples. Experiments on four benchmark datasets demonstrate that FAID significantly outperforms SOTA baselines.
中文摘要
摘要:与带有明显亵渎的显性攻击不同,隐性仇恨言论通过隐喻和上下文提示,将恶意隐藏在看似符合规范的表达中,使其在在线内容审核中的检测变得具有挑战性。虽然现有基于PLM或LLM的方法表现良好,但它们通常对所有样本使用单一推理过程。这忽略了精细的语言细微差别,并对较简单的情况造成不必要的计算开销。我们观察到,在线仇恨言论并非单一形式,而是呈现多样化。因此,我们定义了三个精细分类:浅层(Shallow)、针对性(Targeted)和依赖上下文(Context-Dependent)。因此,我们提出了精细适应性隐性仇恨言论检测(FAID)这一新框架,该框架首先进行精细分类,然后针对特定类别进行适应性处理。具体而言,对于具有表面可识别意图的浅层样本,框架采用轻量级提示调优以实现快速分类;对于将恶意意图绑定到隐藏目标的针对性评论,我们设计了知识增强方法以迭代优化模型并揭示隐藏目标;对于缺乏背景信息的依赖上下文评论,我们利用一个自治框架自动生成提示,以演化上下文、推断缺失的背景信息并识别模糊的恶意意图。这种自适应架构将计算资源集中在复杂的隐性样本上,同时避免对浅层样本进行冗余推理。在四个基准数据集上的实验表明,FAID明显优于SOTA基线。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27462 (HTTP 429)
Authors: Han Wang, Yuhu Cheng, Xuesong Wang, Yi Zhu
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27462.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27462
Published: 2026-09-01T02:02:37.776Z
4. The Effect of Emotional Context on Large Language Models’ Endorsement of Premature Decisions: Comparing Emotional Vulnerability Across Six Commercial Models
Abstract:As large language models (LLMs) are increasingly used for everyday decision-making advice, whether a model shifts the direction of its advice according to the user’s emotional state has become an important safety problem. We test whether emotional expression increases a model’s endorsement (encouragement to proceed) when a user, holding the same objective information, is overconfident about a premature decision (e.g., quitting a stable job on weak evidence). As a key control, we include a no-emotion multi-turn (neutral) condition that holds factual content and the number of conversational turns constant, isolating the effect of emotion from that of conversation length. We exposed six commercial models (top-tier and mid-tier models from OpenAI, Anthropic, and Google) to three scenarios (career change, business expansion, emigration) across three conditions (cold/neutral/distress) with six repetitions each, yielding 324 conversations, and measured endorsement strength (0-100) via an eight-item rubric-based automated scoring. Emotional expression significantly increased endorsement (neutral 18.6 to distress 31.5, +12.9 points; mixed-effects $\beta = +12.9$, $p < .001$; Cohen’s d = 0.51), and this was not explained by conversation length (cold-neutral difference non-significant, $p = .083$). Critically, the vulnerability varied by individual model rather than by price tier: five of six models showed a significant emotion effect, including the top-tier flagships Gemini 3.1 Pro and GPT-5.5, while only Claude Opus showed no significant change. Results were reproduced with an independent non-Google judge model ($\rho = .89$) and agreed in rank with two human coders ($\rho = .70$). Through a controlled design that separates emotion from conversational context, we show that emotional context increases LLM sycophancy even in top-tier flagship models.
中文摘要
摘要:随着大语言模型(LLMs)越来越多地用于日常决策建议中,模型是否会根据用户的情绪状态改变其建议方向已成为一个重要的安全问题。我们测试了当用户在拥有相同客观信息的情况下对过早的决策(例如,在弱证据下辞去稳定工作)过于自信时,情绪表达是否会增加模型的认可(鼓励继续执行)。作为一个关键对照,我们包含了一个无情绪的多轮(中性)条件,该条件保持事实内容和对话轮次不变,从而将情绪的影响与对话长度的影响区分开。我们将六个商业模型(来自 OpenAI、Anthropic 和 Google 的顶级和中端模型)暴露于三种情境(职业变动、业务扩展、移民)下的三种条件(冷淡/中性/痛苦),每种情况重复六次,共生成324次对话,并通过八项基于评分量表的自动评分测量认可强度(0-100)。情绪表达显著增加了认可(中性18.6到痛苦31.5,+12.9点;混合效应$eta = +12.9$,$p < .001$;Cohen’s d = 0.51),且这一结果不能用对话长度解释(冷淡-中性差异不显著,$p = .083$)。关键是,这种脆弱性取决于个别模型而非价格等级:六个模型中有五个显示出显著的情绪效应,包括顶级旗舰模型 Gemini 3.1 Pro 和 GPT-5.5,而仅 Claude Opus 未表现出显著变化。使用独立的非 Google 评判模型($
ho = .89$)重复实验结果,并与两名人工编码者的排名一致($
ho = .70$)。通过一种将情绪与对话背景分离的受控设计,我们展示了即使在顶级旗舰模型中,情绪背景也会增加 LLM 的谄媚行为。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27465 (HTTP 429)
Authors: Cheolho Shin, Yoojin Han, Donghun Shin, Kunho Lee
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27465.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27465
Published: 2026-09-01T02:02:37.776Z
5. PACE: Publisher-Adaptive Content Extraction via Agentic Automation
Abstract:Web content extraction is essential for reliable LLM data pipelines, yet existing methods often struggle to jointly satisfy accuracy, scalability, and adaptability. General-purpose extractors can be applied broadly, but they are often brittle on publisher-specific layouts and richer extraction targets such as metadata, images, and tables. Direct LLM-based extraction offers greater flexibility, but incurs substantial cost and latency at scale, while manually engineered publisher-specific parsers can achieve high accuracy but require substantial human effort to build and maintain. We introduce PACE, an agentic framework for learning publisher-specific extraction configurations from representative pages and user requirements. During training, PACE uses LLMs to analyze page structure and aggregate reusable extraction patterns. At inference time, the learned configurations instantiate a fixed deterministic extractor template, enabling scalable extraction without additional LLM calls. Experiments spanning article-body, metadata, and multimodal extraction show that PACE outperforms scalable non-manual baselines while approaching the quality of manually engineered publisher-specific parsers. PACE achieves stronger extraction of article text, metadata, images, and tables, demonstrating that agentic configuration learning can automate publisher-specific extraction for LLM-ready page representations beyond article text.
中文摘要
摘要:Web 内容提取对于可靠的 LLM 数据管道至关重要,但现有方法常常难以同时满足准确性、可扩展性和适应性。通用提取器可以广泛应用,但在针对特定出版商的布局以及更丰富的提取目标(如元数据、图像和表格)时通常表现脆弱。基于 LLM 的直接提取提供了更大的灵活性,但在大规模应用时会产生显著的成本和延迟,而人工设计的特定出版商解析器虽然能够实现高精度,但需要大量的人力进行构建和维护。我们提出了 PACE,这是一种可以从代表性页面和用户需求中学习特定出版商提取配置的智能框架。在训练过程中,PACE 使用 LLM 分析页面结构并汇总可重用的提取模式。在推理阶段,学习到的配置将实例化为固定的确定性提取器模板,从而在无需额外调用 LLM 的情况下实现可扩展提取。涵盖文章主体、元数据和多模态提取的实验表明,PACE 在可扩展的非人工基准上表现优越,同时接近人工设计的特定出版商解析器的质量。PACE 在文章文本、元数据、图像和表格的提取上具有更强的能力,表明智能配置学习可以实现针对 LLM 准备页面表示的特定出版商提取自动化,而不仅限于文章文本。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27466 (HTTP 429)
Authors: Zhanlin Liu, Munirathnam Srikanth
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27466.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27466
Published: 2026-09-01T02:02:37.776Z
6. UIC-AIHealth4All at ArchEHR-QA 2026: Answer-First Evidence Grounding for Clinical Question Answering
Abstract:We describe the UIC-AIHealth4All system for ArchEHR-QA 2026, a shared task on grounded question answering from electronic health records. We participated in Subtasks 2 (evidence identification), 3 (answer generation), and 4 (answer-evidence alignment). For Subtasks 2 and 3, we propose an answer-first pipeline in which the model generates candidate answers citing specific note sentences before classifying the full evidence set, exploiting the asymmetry between judging relevance in the abstract versus relative to a generated answer. For Subtask 4, we apply self-consistency voting over five independent model calls, retaining links by vote threshold. Our pipeline ranked third on evidence identification (Strict Micro F1 62.90), ninth on answer generation (Overall 31.90), and fifth on answer-evidence alignment (F1 79.81). A post-hoc linguistic analysis of 45 stylistic features reveals that model outputs remain 3.2 Flesch-Kincaid grade levels harder to read than clinician-authored references despite matching their word and sentence counts, suggesting readability warrants explicit optimization in clinical NLP systems. Code and prompts are available at this https URL.
中文摘要
摘要:我们介绍了UIC-AIHealth4All系统,该系统用于ArchEHR-QA 2026,这是一个基于电子健康记录的问答共享任务。我们参与了子任务2(证据识别)、子任务3(答案生成)和子任务4(答案-证据对齐)。对于子任务2和3,我们提出了一种先生成答案的流程,其中模型在对整个证据集进行分类之前,先生成引用特定病历句子的候选答案,从而利用在抽象层面判断相关性与针对生成答案判断相关性之间的不对称性。对于子任务4,我们对五次独立模型调用结果进行自一致性投票,并通过投票阈值保留链接。我们的流程在证据识别任务中排名第三(严格微平均F1 62.90),在答案生成任务中排名第九(总体31.90),在答案-证据对齐任务中排名第五(F1 79.81)。对45个文体特征进行的事后语言分析表明,尽管模型输出的单词数和句子数与临床医生撰写的参考资料相当,但可读性仍比参考资料难3.2个Flesch-Kincaid等级,这表明在临床自然语言处理系统中,可读性需要明确优化。代码和提示可在此https URL获得。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27467 (HTTP 429)
Authors: Mohammad Arvan, Hossein Haeri, Natalie Parde, Rebecca T. Feinstein
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27467.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27467
Published: 2026-09-01T02:02:37.776Z
7. Select, Don’t Train: The Benefits of Modular Entity Disambiguation with LLM-Based Selection
Abstract:Entity Disambiguation (ED) is a key task for constructing and using knowledge graphs. State-of-the-art neural approaches commonly model ED as a single task, although it consists of two distinct subproblems: retrieving candidate entities and selecting the correct one given context. Dual-encoder models optimize for both within a shared embedding space, forcing representations to balance high-recall retrieval with fine-grained selection, and they require trained retrievers, which are costly to maintain as knowledge graphs change. While recent work has begun to combine retrievers with LLM-based selectors, the interplay between the two stages has not been studied systematically. In this paper, we present a systematic comparison of retrieval strategies for candidate generation under a shared LLM-based selection stage, combining sparse retrieval (BM25), Web KB search, and a state-of-the-art trained dense retriever with several open- and closed-source LLMs. We show that, once selection is delegated to a capable LLM, training the retriever provides only modest additional value: a fully training-free BM25 retriever paired with an LLM selector reaches a new state of the art on the ZELDA benchmark, raising inKB micro-F1 from 82.3 to 86.3 (+4); pairing the same LLM with a trained dense retriever reaches 88.5. Decoupling retrieval from selection also exposes a limitation of current ED systems: when the correct entity is missing from retrieved candidates, they are forced to predict an incorrect entity. In contrast, our framework allows for abstention when retrieval failure is detected. In an evaluation setting that rewards correct abstentions, the training-free BM25 + LLM pipeline reaches 90.7 F1.
中文摘要
摘要:实体消歧(Entity Disambiguation, ED)是构建和使用知识图谱的关键任务。最先进的神经方法通常将ED建模为单一任务,尽管它实际上包含两个不同的子问题:检索候选实体以及在给定上下文中选择正确实体。双编码器模型在共享嵌入空间中对两者进行优化,迫使表示在高召回检索与细粒度选择之间取得平衡,同时它们需要经过训练的检索器,而随着知识图谱的变化,这类检索器的维护成本较高。虽然近期工作已经开始将检索器与基于大语言模型(LLM)的选择器结合,但两阶段之间的相互作用尚未被系统性研究。在本文中,我们在共享的基于LLM的选择阶段下,系统性地比较了候选生成的检索策略,结合了稀疏检索(BM25)、网络知识库搜索以及最先进的训练密集型检索器,与若干开源和闭源LLM进行实验。我们展示了,一旦选择任务交给有能力的LLM,训练检索器仅提供有限的额外价值:一个完全无需训练的BM25检索器与LLM选择器配合,在ZELDA基准测试中达到了新的状态,inKB micro-F1从82.3提升至86.3(+4);将同一LLM与训练密集检索器配合使用则达到88.5。将检索与选择分离也揭示了当前ED系统的一个局限:当正确实体在检索的候选实体中缺失时,系统被迫预测错误实体。相比之下,我们的框架允许在检测到检索失败时选择放弃。在一种奖励正确放弃的评估环境中,无需训练的BM25 + LLM管线达到了90.7 F1。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27470 (HTTP 429)
Authors: Fina Polat, Daniel Daza, Pengyu Zhang, Klim Zaporojets, Paul Groth
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27470.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27470
Published: 2026-09-01T02:02:37.776Z
8. XHotpotQA: A Benchmark for Cross-Lingual Knowledge Composition in Multi-Hop Question Answering
Abstract:Knowledge-intensive multi-hop question answering requires systems to select evidence and compose dependent facts, yet multilingual benchmarks usually translate an entire example into one language. This hides failures at language boundaries inside the reasoning chain. We introduce XHotpotQA, a controlled benchmark for cross-lingual knowledge composition over mixed-language evidence. Each instance is modeled as an evidence-dependency graph whose question, bridge evidence, answer-bearing evidence, and distractors have explicit language assignments. The audited resource contains 15,661 training and 7,405 validation instances, with sentence-level support supervision and supplied distractors. In validation, 99.81% of items cross the question-to-gold-evidence language interface and 95.60% use gold paragraphs in different languages. Across three reader artifacts, full question-evidence mismatch is associated with 10.25 to 15.79 lower Unicode-aware answer F1 than partial alignment, and different-script evidence with deficits of 11.98 to 23.70 points; the corresponding adapted-selector contrasts are 1.71 and 1.78 points. Under this supplied-candidate design, the evaluated readers therefore show substantially larger condition-associated deficits than the selector. XHotpotQA provides role-aware diagnostics, modular evaluation, and an audited test bed for knowledge-based systems that must integrate evidence across languages.
中文摘要
摘要:密集知识的多跳问答要求系统选择证据并组合依赖事实,但多语言基准通常只将整个示例翻译成一种语言。这掩盖了推理链中语言边界上的失败。我们引入了 XHotpotQA,这是一个用于跨语言知识组合的受控基准,涵盖混合语言的证据。每个实例被建模为证据依赖图,其问题、桥接证据、答案承载证据和干扰项都有明确的语言指定。经过审查的资源包含 15,661 个训练实例和 7,405 个验证实例,并提供了句子级支持监督和干扰项。在验证中,99.81% 的条目跨越了问题与黄金证据的语言界面,95.60% 使用不同语言的黄金段落。在三个阅读器模型中,完全的问题与证据不匹配导致 Unicode 感知的答案 F1 比部分对齐低 10.25 到 15.79,而不同脚本的证据导致下降 11.98 到 23.70;相应的适配选择器对比则为 1.71 和 1.78。在这种提供候选项的设计下,被评估的阅读器显示出的条件相关缺陷明显大于选择器。XHotpotQA 提供了角色感知的诊断、模块化评估以及经过审查的测试平台,适用于必须跨语言整合证据的基于知识的系统。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27481 (HTTP 429)
Authors: Iman Barati, Arash Ghafouri, Behrouz Minaei-Bidgoli
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27481.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27481
Published: 2026-09-01T02:02:37.776Z
9. INSPIRE: An Internalize-Then-Improve Approach for Example-Driven Mathematical Reasoning
Abstract:Mathematical reasoning has seen rapid progress in large language models (LLMs), yet existing methods optimize predominantly for final-answer correctness, raising the question whether models truly internalize mathematical concepts or merely memorize solution patterns. In human mathematics education, example-based reasoning such as constructing counterexamples to test theorem boundaries reflects deep conceptual understanding, but remains underdeveloped in current LLMs. Enhancing this capability through preference optimization presents two key challenges: (1) the model’s limited example-based reasoning ability makes constructing effective preference pairs inherently difficult; and (2) capability acquisition is progressive, as the model must first learn to adopt this strategy before learning to apply it correctly. Therefore we propose INSPIRE, an Internalize-Then-Improve approach combining Reference-Guided Student Internalization (RGSI), which produces high-quality preference candidates under the policy model’s own distribution, with a stage-wise rubric preference training strategy that decomposes learning into method-oriented and correctness-oriented stages. Experiments across multiple model scales and families demonstrate consistent improvements, even surpassing larger open-source models, while evaluations on out-of-distribution benchmarks confirm no degradation in general mathematical reasoning ability.
中文摘要
摘要:在大型语言模型(LLM)中,数学推理取得了快速进展,但现有方法主要优化最终答案的正确性,这引发了一个问题:模型是否真正内化了数学概念,还是仅仅记忆了解题模式。在人类数学教育中,基于示例的推理,例如构建反例来测试定理的边界,体现了深层次的概念理解,但在当前的LLM中仍未得到充分发展。通过偏好优化增强这种能力面临两个关键挑战:(1)模型有限的基于示例的推理能力,使得构建有效的偏好对本质上困难;(2)能力的获取是渐进的,因为模型必须先学习采用这种策略,然后再学习正确应用它。因此,我们提出了INSPIRE,一种“先内化再改进”的方法,结合参考引导的学生内化(RGSI),在策略模型自己的分布下生成高质量的偏好候选,并通过分阶段的评价标准偏好训练策略将学习分解为方法导向阶段和正确性导向阶段。跨多种模型规模和家族的实验显示了一致的改进,甚至超越了更大的开源模型,同时在分布外基准上的评估证实了其一般数学推理能力没有下降。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*大语言模型(LLM)在数学推理中基于示例的推理能力(example-driven reasoning)不足\*\*的问题,具体而言包括以下核心层面: ### 1. 现有训练范式的局限性 当前主流的数学推理优化方法(包括监督微调和强化学习)普遍以\*\*最终答案正确性\*\*为唯一或主要优化目标。这导致模型倾向于: - 依赖抽象定理的直接套用 - 记忆表面化的解题模式 - 缺乏对数学概念边界的深层理解 ### 2. 示例驱动推理能力的缺失 在人类数学教育中,通过构造具体例子、反例(counterexamples)或构造性证明来检验和理解定理是反映概念掌握程度的关键能力。然而,现有研究表明,LLM在此方面存在显著短板: - 模型通常直接应用抽象定理而非构造具体实例进行验证 - 缺乏主动构造反例以测试命题边界的能力 - 难以区分"确认性示例"与"反驳性反例"在推理中的不同作用 ### 3. 偏好优化面临的双重挑战 论文指出,通过偏好优化(preference optimization)直接增强该能力存在根本性困难: - \*\*数据构建困境\*\*:由于基础模型本身缺乏示例推理能力,仅通过自采样(self-sampling)获得的候选响应在该维度上质量普遍较低,难以形成有效的偏好对比对;而直接引入外部强模型(如DeepSeek-R1)重写参考解答,又会引入\*\*分布偏移\*\*(distribution shift),导致模型模仿表面表达风格而非内化核心分析策略。 - \*\*能力获取的渐进性\*\*:示例推理能力的习得并非单步可完成。模型必须\*\*先学会主动采用该策略\*\*(strategy adoption),然后\*\*再学会正确应用它\*\*(correctness refinement)。若将方法学习与正确性优化混合为单阶段训练,两者会产生冲突梯度,导致训练效果受损。 ### 4. 核心研究目标 基于上述问题,论文提出了一套名为 \*\*INSPIRE\*\*(INternalize-then-ImprovE)的训练框架,其核心目标为: - 在不引入分布偏移的前提下,生成高质量的在策略(on-policy)偏好候选数据 - 将示例推理能力的习得解耦为\*\*方法导向学习\*\*(method-oriented)与\*\*正确性导向精炼\*\*(correctness-oriented)两个阶段 - 在保持通用数学推理能力不退化的同时,系统性提升模型基于示例的概念理解与判别能力 Q2: 有哪些相关研究? 该论文的相关研究主要分布于\*\*数学推理增强\*\*与\*\*偏好优化训练\*\*两大领域,关键文献及研究方向梳理如下: ### 1. 大语言模型的数学推理增强 现有工作大致遵循两条技术路线: - \*\*监督微调与数据增强\*\*:通过指令合成、问题改写与语料扩展等方式扩充训练数据,以提升解题能力。代表性工作包括 NuminaMath、MetaMath、WizardMath、OpenMathInstruct-1 等。 - \*\*强化学习后训练\*\*:利用大规模强化学习激发模型的深层推理行为(如自我验证与反思)。代表性工作包括: - GRPO(Group Relative Policy Optimization) - OpenAI o1 / o3 系列 - DeepSeek-R1 - DAPO(Distributed Actor-Critic Policy Optimization) - s1(Simple test-time scaling) \*\*关键局限\*\*:上述方法普遍以\*\*最终答案正确性\*\*为统一优化目标,对概念层面的理解以及通过例子、反例进行辨析的深层推理技能关注有限。 ### 2. 概念级数学推理基准 近期研究揭示了当前模型在概念理解上的显著不足,推动了针对性评测基准的构建: - \*\*ConceptMath\*\*:从概念维度评测双语数学推理能力。 - \*\*CounterMath\*\*:专门评测基于反例与构造的概念推理能力,也是本论文的核心评测基准之一。 ### 3. 偏好优化及其变体 偏好优化方法被广泛应用于数学推理任务,主要进展包括: - \*\*基础方法\*\*: - DPO(Direct Preference Optimization) - IPO(Identity Preference Optimization) - SimPO(Simple Preference Optimization,无需参考模型) - \*\*步骤级优化\*\*: - Step-DPO:将单步推理作为偏好优化的基本单元。 - Full-Step-DPO:基于步骤级别自监督奖励进行优化。 - Math-Shepherd:训练过程奖励模型(PRM)以提供步骤级监督,超越二元结果信号。 - \*\*基于评分标准(Rubric-based)的方法\*\*: - 近期研究表明,将评价分解为多维度结构化标准可提供比单一奖励更丰富的训练信号。代表性工作包括 Gunjal et al. (2025) 与 Huang et al. (2025) 提出的基于评分标准的强化学习框架。 ### 4. 偏好数据构建策略 构建高质量在策略(on-policy)偏好数据是关键挑战,常用策略包括: - \*\*拒绝采样(Rejection Sampling)\*\*:从模型自身采样并筛选高奖励响应。 - \*\*迭代在线 DPO(Iterative Online DPO)\*\*:随模型更新不断刷新训练对,以保持数据分布一致性。 \*\*尚未解决的问题\*\*:当模型在目标推理能力(如示例推理)上本身较弱时,自采样难以产生足够的质量差异;而直接引入外部强模型(教师模型)数据则易导致分布偏移(distribution shift),使模型复制表面风格而非内化核心策略。 ### 5. 数学教育中的示例推理 人类数学教育研究强调,构造反例与具体实例是检验定理边界、反映深层概念理解的基本技能。Klymchuk (2010) 关于微积分中反例使用的研究为本文的动机提供了教育学依据。 Q3: 论文如何解决这个问题? 针对前述的数据构建困难与能力渐进获取两大挑战,论文提出了 \*\*INSPIRE\*\*(\*\*IN\*\*ternalize-then-\*\*IM\*\*prove using \*\*P\*\*reference for \*\*I\*\*mproved mathematical \*\*RE\*\*asoning)框架。该框架从\*\*数据构造\*\*与\*\*训练策略\*\*两个层面进行系统性设计,具体解决路径如下。 --- ### 1. 核心思想:先内化策略,再精炼正确性 区别于直接混合优化,INSPIRE 将能力获取解耦为两个阶段: - \*\*内化阶段(Internalize)\*\*:首先确保模型学会主动采用基于示例的分析策略(method acquisition)。 - \*\*改进阶段(Improve)\*\*:在已掌握策略的基础上,进一步精炼答案的正确性与推理严谨性(correctness refinement)。 --- ### 2. 高质量偏好数据的构造:参考引导的学生内化(RGSI) 为解决模型自采样本在“示例推理”维度上质量过低、而外部强模型参考又导致分布偏移的矛盾,论文提出 \*\*Reference-Guided Student Internalization(RGSI)\*\*。 #### 2.1 生成方式 RGSI 不再仅依赖模型对问题的自采样 y sim π_0(· mid x) ,而是让基础模型在\*\*参考解答 r \*\* 的指导下重新生成响应:
y sim π_0(· mid x, r)
其中参考解答提供推理引导,但生成器仍是策略模型自身。这保证了输出在分布上仍属于该模型(on-policy),同时通过参考的启发提升了响应在方法使用与推理质量上的区分度。 #### 2.2 多维度评估标准(Rubric) 为了超越单一“答案正确性”信号,论文设计了包含三个维度的评分标准(由 Judge LLM 独立打分): | 维度 | 范围 | 核心考察内容 | |———|———|———————| | Method (m) | 0–2 | 是否采用基于具体示例/反例的分析策略,且该策略在推理中是否起到实质性作用 | | Reasoning (r) | 0–3 | 论证逻辑的完整性与清晰程度 | | Correctness (c) | 0–1 | 最终答案是否与标签一致 | 通过该标准,可系统区分“使用抽象定理直接作答”与“构造具体实例进行边界检验”等不同层次的响应。 —- ### 3. 阶段式偏好训练策略 基于 RGSI 构造的候选池,INSPIRE 采用顺序两阶段训练,每阶段聚焦于不同的偏好目标。 #### 3.1 Stage 1:方法导向偏好学习(M-DPO) 本阶段目标是**驱动模型主动采纳示例推理策略**。 **偏好对构造条件**:优先选择方法维度存在显著差距、且推理基本通顺的样本对,需满足: - m(y_w) - m(y_l) ≥ 1 ( y_w 实质性使用示例, y_l 未使用或使用不当) - r(y_w) ≥ 1,; r(y_l) ≥ 1 (排除逻辑严重混乱的样本) **训练目标**:
L(M-DPO) = -E((x,yw,y_l)sim D_1) [ log σ ( β_m log (πθ(yw mid x)) / (π_0(y_w mid x)) - β_m log (πθ(y_l mid x)) / (π_0(y_l mid x)) ) ]
其中 π_0 为 SFT 初始化模型兼参考策略, β_m 为温度参数, D_1 为方法导向偏好数据集。训练完成后得到中间模型 π_1 。 #### 3.2 Stage 2:正确性导向偏好精炼(C-DPO) 在模型已初步具备示例推理能力后,本阶段将优化重心转向**答案正确性与推理质量**。 **数据重采样与构造**: - 首先使用 π_1 重新采样候选响应并再次评分。 - 构造两类偏好对: 1. **正确性对**: c(y_w)=1,; c(y_l)=0,; r(y_w)≥ 1 (正确 vs. 错误,且正确者推理通顺) 2. **质量对**: c(y_w)=c(y_l)=1,; r(y_w)-r(y_l)≥ 1 (两者皆正确,但推理质量有显著差异) 在此过程中,方法分 m 作为次级排序准则,持续巩固 Stage 1 习得的策略。 **训练目标**:
L(C-DPO) = -E((x,yw,y_l)sim D_2) [ log σ ( β_c log (πθ(yw mid x)) / (π_1(y_w mid x)) - β_c log (πθ(y_l mid x)) / (π_1(y_l mid x)) ) ]
其中参考策略更新为 π_1 , D_2 中除了 Stage 2 新构造的对,还混合了部分 Stage 1 样本进行**回放(replay)**,以防止已习得的示例推理策略被遗忘。 —- ### 4. 整体训练流程 完整的 INSPIRE pipeline 可概括为: 1. **数据准备**:对每个问题,从 π_0 自采样并结合 RGSI 生成扩充响应,由 Judge LLM 按 (m, r, c) 三维评分。 2. **Stage 1(M-DPO)**:基于方法维度差距构建偏好对,训练模型习得示例推理策略,得到 π_1 。 3. **Stage 2(C-DPO)**:使用 π_1 重新采样,基于正确性与推理质量构建新的偏好对并混合 Stage 1 回放数据,训练得到最终模型 π_2 。 通过上述设计,RGSI 解决了低能力与分布偏移下的高质量数据获取难题;而 M-DPO 与 C-DPO 的 sequential 分解则契合了“先学会用例子,再学会用对例子”的渐进学习规律。 Q4: 论文做了哪些实验? 论文的实验部分围绕**主效果验证**、**分布外泛化**、**消融分析**与**机制验证**四个层面展开,涵盖多种模型规模与家族。具体实验内容如下: —- ### 1. 实验设置 #### 1.1 训练与评测数据 - **训练数据**:从 BrokenMath 中筛选涉及示例、反例或构造性证明的数学命题,经 DeepSeek-R1 初筛与人工校验后得到 **1,275 道题目**。每道题采样 16 个自生成候选,并通过 RGSI 额外生成 4 个候选,经裁判模型按三维标准评分后构建偏好对。Stage 1 与 Stage 2 各产生约 **14,000 个训练对**。 - **评测基准**:在 **CounterMath** 上进行主评测,采用其四项指标: - **Macro-F1**:对命题真/假判断的宏平均 F1 - **Examples (%)**:模型在推理中使用示例的比例 - **Strict Align (%)**:模型所给示例与参考答案完全一致的比例 - **Loose Align (%)**:至少有一个示例与参考一致的比例 #### 1.2 模型配置 实验覆盖三种配置,以验证跨规模与跨家族的一致性: - **Qwen2.5-Math-7B-Instruct**(主实验模型) - **Qwen2.5-Math-1.5B-Instruct**(小尺度验证) - **Llama-3.1-8B-Instruct**(跨家族验证) #### 1.3 基线对比 对比范围包括商业模型(Claude-4.5-Sonnet、Gemini-3-Pro、DeepSeek-R1 等)以及开源模型(Qwen3-32B、Qwen2.5-Math-72B-Instruct、Eurus-2-7B-PRIME 等)。所有实验均采用贪婪解码(greedy decoding)。 —- ### 2. 主实验:CounterMath 上的逐步性能提升 主结果(Table 2)报告了逐阶段训练后的性能变化,关键发现包括: - **渐进式提升**:在 Qwen2.5-Math-7B 上,SFT 阶段仅带来边际增益;Stage 1(M-DPO)显著提升 Examples 指标(从 77.63% 升至 81.33%)与 F1(从 39.06 升至 43.05),表明方法导向训练有效激发了示例推理行为;Stage 2(C-DPO)进一步将 F1 提升至 **45.91**,Examples 提升至 **84.79%**。 - **跨规模一致性**:Qwen2.5-Math-1.5B 全训练后 F1 提升 **+3.31**,Examples 提升 **+7.08**;Llama-3.1-8B-Instruct 全训练后 F1 提升 **+8.99**,Examples 提升 **+16.36**。 - **与开源模型对比**:7B 最终模型在 CounterMath 的 F1 上超过 Qwen2.5-Math-72B-Instruct(41.89),并逼近 Qwen3-32B(45.93)。1.5B 最终模型(F1: 39.02)达到 7B 基线模型(F1: 38.67)的水平,显示该方法可有效弥补容量差距。 - **示例使用率领先**:7B 模型 Examples 率达 84.79%,Llama-8B 达 93.09%,均高于 DeepSeek-R1(80.59%)。 —- ### 3. 分布外(OOD)评测:通用数学推理能力 为验证专业化训练未损害通用能力,论文在五个通用数学基准上进行评估(Table 3): - **评测基准**:GSM8K、MATH500、AIME 2024、GAOKAO-mQA、MMLU-collegeMath。 - **结果**:三个模型配置在绝大多数基准上均保持或提升性能。例如,Qwen2.5-Math-7B 在 AIME 2024 上提升 **+6.67**,在 GAOKAO-mQA 上提升 **+2.00**,在 MMLU-cMath 上提升 **+3.00**。较小模型在 AIME 2024 上分数未变,这与其高难度与题目数量少(30 题)有关。 —- ### 4. 消融实验 #### 4.1 训练策略消融(Table 4) 在 Qwen2.5-Math-7B 上对比了六种策略: - **标准 DPO**:仅以答案正确性为信号,导致 Examples 指标下降(73.19%),说明单纯优化正确性会抑制示例推理。 - **Chosen SFT**:对两阶段所有被选中的偏好对进行监督学习,效果(F1: 41.75)不及完整偏好学习。 - **Mixed DPO**:将 Stage 1 与 Stage 2 的偏好对混合单次训练,性能(F1: 42.72)反而低于单独 Stage 1(43.05),表明两目标存在梯度冲突。 - **C-DPO 单独**:仅做正确性优化(F1: 40.27),效果有限。 - **M-DPO 单独**:仅做方法优化(F1: 43.05),验证方法习得的关键作用。 - **完整 INSPIRE**:顺序执行 M-DPO 与 C-DPO,取得最优结果(F1: 45.91)。 #### 4.2 响应增强策略消融(Table 5 与 Figure 3) 在 Stage 1 中对比三种候选生成方式: - **Self-sampling**:无参考指导,候选在方法维度上区分度不足,提升微弱(F1: 40.40)。 - **Teacher rewriting**:由 DeepSeek-R1 直接重写参考,虽质量高但与学生模型分布差异大,导致 F1 几乎无提升(39.14)。训练动态显示偏好对差距过大(margin 过高),模型迅速饱和,易学到表面风格而非推理策略。 - **RGSI**:学生模型在参考启发下自主重写,保持 on-policy 分布的同时提供有效质量梯度,取得最优效果(F1: 43.05),训练过程中 margin 适中且准确率稳步上升。 —- ### 5. 机制与行为分析 #### 5.1 训练 vs. 提示工程(Table 6) 对比了在推理时显式提示“请通过给出例子进行推理”与经过 INSPIRE 训练的效果: - **Hint prompting** 虽能提升 Examples 率(77.71%),但 F1 仅提升 **+0.46**,说明提示触发的示例往往针对性不足。 - **INSPIRE 训练** 后 F1 提升 **+7.24**,表明模型学会了构造能有效支撑正确推理的恰当示例。 #### 5.2 方法习得分析(Appendix F / Table 8) 对 Qwen2.5-Math-7B 在 Stage 1 前后各采样 20,400 个响应进行方法分( m )统计: - 实质性使用示例( m=2 )的比例从 **30.74%** 提升至 **39.30%**。 - 纯抽象推理( m=0 )的比例从 **56.58%** 降至 **48.47%**。 定量验证了 Stage 1 确实驱动了从抽象定理套用到示例驱动推理的行为迁移。 #### 5.3 跨裁判验证(Table 7) 为排除 DeepSeek-V3.2 的裁判偏见,使用 **GPT-4o** 重新评估各阶段输出。虽然绝对分数因裁判校准差异而变化,但逐阶段提升的趋势完全一致,确认实验结论非特定裁判的偶然结果。 #### 5.4 案例研究(Figure 4) 以一道测度论题目为例,展示了三阶段推理的渐进演化: - **Base 模型**:直接套用“测度上连续”定理,未检验前提条件( m(E_1) < ∞ ),判断错误。 - **Stage 1 模型**:主动构造示例($E_n =
0, 1-1/n
),但仅起到“确认定理”作用,未挑战边界,仍判断错误。 - Stage 2 模型:识别关键前提缺失,并构造违反前提的反例( E_n = [n, ∞) ),最终得到正确判断。 —- ### 6. 附录中的补充实验 #### 6.1 新骨干网络验证(Appendix H.1 / Table 10) 在更新的 Qwen3-4B-Instruct-2507 上应用完整流程,F1 从 33.65 提升至 36.36,Examples 从 65.21% 提升至 74.34%,证明 INSPIRE 对近期骨干网络依然有效。 #### 6.2 正确性-only DPO 的超参数敏感性(Appendix H.2 / Table 11) 对仅优化答案正确性的 DPO 基线进行 β ∈ 0.1, 0.2, 0.5 的敏感性测试。结果显示,无论 β 如何取值,其 F1 均接近 SFT 基线且 Examples 率持续下降,表明其失效并非源于特定正则化设置,而是目标设计本身的局限。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与局限性声明,以下几个方向具有进一步探索的价值: —- ### 1. 数据规模与数学领域的扩展 当前训练集仅包含 1,275 道从 BrokenMath 中筛选的题目,覆盖的数学领域相对有限。未来工作可从以下两方面展开: - 大规模数据构建:探索自动化的数据筛选与增强 pipeline,降低对 DeepSeek-R1 初筛及人工校验的依赖,将训练数据扩展至数论、组合数学、抽象代数等更广泛的数学分支。 - 跨领域迁移:验证 INSPIRE 框架在数学以外需要概念边界检验的领域(如物理定律验证、程序语义分析)是否同样有效。 —- ### 2. 更大规模模型的验证 论文的实验仅覆盖了最大 7B 参数的模型(Qwen2.5-Math-7B 与 Llama-3.1-8B)。考虑到大模型可能展现出不同的能力涌现模式,有必要在 32B、72B 乃至更大规模的基座模型上验证该框架的有效性,以确认: - 阶段式分解在强基座模型上是否依然优于端到端联合优化; - RGSI 生成的偏好对在更大模型上的区分度与训练稳定性。 —- ### 3. 评判机制的去偏见与多维度校准 目前的数据构造与评测均依赖 DeepSeek-V3.2 作为裁判模型,尽管论文已通过 GPT-4o 进行了交叉验证,但仍可进一步: - 引入多裁判集成(ensemble of judges)或人机协同评判,降低单一模型的评分偏见; - 针对方法维度(Method)设计更细粒度的子标准(如区分“构造性示例”“反例”“非本质示例”),以提供更精确的训练信号。 —- ### 4. 方法论向其他推理策略的泛化 INSPIRE 的核心思想——先内化策略、再精炼正确性——具有通用性,不仅限于示例驱动推理。可将其拓展至: - 可视化/空间推理:先训练模型主动绘制示意图辅助证明,再优化几何推导的正确性; - 归纳与模式识别:先鼓励模型从具体实例中归纳猜想,再精炼归纳步骤的严谨性; - 反事实推理:在逻辑与科学推理中,先习得主动构造反事实场景的策略,再评估其论证有效性。 —- ### 5. 与在线/迭代强化学习的结合 当前 INSPIRE 采用离线 DPO 进行训练。未来可探索将其与在线偏好优化或强化学习(如 PPO、GRPO、DAPO)相结合: - 在 Stage 1 与 Stage 2 之间引入迭代式数据刷新(iterative resampling),使模型在分布动态变化的过程中持续自我改进; - 将三维评分标准(Method, Reasoning, Correctness)转化为稠密的过程奖励(dense process reward),实现步骤级别的策略优化。 —- ### 6. 可解释性与策略选择的可控性 论文观察到模型在 Stage 1 后从“抽象推理”向“示例推理”的行为迁移,但对策略选择的内部机制尚未深入剖析: - 通过机制可解释性方法(如探测分类器、注意力分析)定位模型决定“构造示例”的关键层与表示; - 研究如何在推理时通过显式控制(如策略开关)让模型根据问题特征自适应选择抽象定理应用或具体示例构造,而非单一地偏向某一种模式。 —- ### 7. 数学教育场景的落地应用 鉴于示例与反例构造是人类数学教育的核心环节,可将 INSPIRE 训练后的模型应用于: - 自适应 tutoring 系统:根据学生的常见概念误区,动态生成针对性的反例以澄清边界条件; - 自动评阅:利用三维评分标准对学生的证明过程进行更细致的诊断性反馈,而非仅判断对错。 Q6: 总结一下论文的主要内容 该研究围绕大语言模型(LLM)数学推理中基于示例的深度概念理解能力不足这一问题,提出了 INSPIRE(INternalize-then-IMprove using Preference for Improved mathematical REasoning)训练框架。以下是论文的主要内容总结: —- ### 1. 研究背景与动机 现有数学推理优化方法(如监督微调与强化学习)普遍以最终答案正确性为单一优化目标,导致模型倾向于抽象定理的直接套用与表面解题模式的记忆,而非真正内化数学概念。在人类数学教育中,通过构造具体例子、反例或构造性证明来检验命题边界是深层理解的体现,但该能力在当前 LLM 中仍显著欠缺。近期基准(如 ConceptMath 与 CounterMath)进一步揭示了模型在概念级推理上的巨大提升空间。 —- ### 2. 关键挑战 通过偏好优化(preference optimization)直接增强基于示例的推理能力面临两大核心困难: - 数据构建困境:基础模型自身示例推理能力薄弱,自采样候选在该维度上质量普遍低下,难以形成有效的偏好对比对;而直接引入外部强模型(如 DeepSeek-R1)改写参考解答,又会引入分布偏移(distribution shift),使模型模仿表面风格而非内化核心分析策略。 - 能力获取的渐进性:模型必须先主动习得采用示例推理的策略,然后才能正确运用该策略得出准确结论。若将方法学习与正确性优化混合为单阶段训练,两者会产生冲突梯度,导致优化失效。 —- ### 3. 核心方法 论文从数据构造与训练策略两方面提出系统性解决方案: #### 3.1 参考引导的学生内化(RGSI) 为在不引入分布偏移的前提下获得高质量在策略(on-policy)候选,RGSI 令基础模型 π_0 在参考解答 r 的指导下,针对问题 x$ 重新生成响应:
y sim π_0(· mid x, r)
参考解答提供推理启发,但生成器仍为策略模型自身,从而确保输出分布于模型自身分布内,同时显著提升候选在方法与推理维度上的质量区分度。 #### 3.2 三维评估标准(Rubric) 论文设计了超越单一“答案正确性”的多维评分体系,由裁判 LLM 独立打分: - **Method (m, 0–2)**:是否采用基于具体示例/反例的分析策略,且该策略在推理中是否起到实质性作用; - **Reasoning (r, 0–3)**:论证逻辑的完整性与清晰程度; - **Correctness (c, 0–1)**:最终答案是否正确。 #### 3.3 阶段式偏好训练 基于上述数据与评估框架,训练被解耦为两个阶段: - **Stage 1:方法导向偏好学习(M-DPO)** 优先基于 Method 维度构建偏好对(要求 m(y_w) - m(y_l) ≥ 1 且两者推理基本通顺),鼓励模型主动采用基于示例的推理策略。训练目标为:
L(M-DPO) = -E((x,yw,y_l)sim D_1) [ log σ ( β_m log (πθ(yw mid x)) / (π_0(y_w mid x)) - β_m log (πθ(y_l mid x)) / (π_0(y_l mid x)) ) ]
- **Stage 2:正确性导向偏好精炼(C-DPO)** 使用 Stage 1 得到的模型 π1 重新采样,构建以 Correctness 为核心的偏好对(正确 vs. 错误,或在正确者中区分推理质量),并以 Method 分为次级排序准则以巩固已习得策略。同时混合 Stage 1 样本进行回放(replay),防止遗忘。训练目标为:
L(C-DPO) = -E((x,y_w,y_l)sim D_2) [ log σ ( β_c log (πθ(yw mid x)) / (π_1(y_w mid x)) - β_c log (πθ(y_l mid x)) / (π_1(y_l mid x)) ) ]
—- ### 4. 实验验证 论文在 **Qwen2.5-Math(1.5B/7B)** 与 **Llama-3.1-8B-Instruct** 三种配置上进行验证,主要结论包括: - **主实验(CounterMath)**:所有配置均呈现一致的逐阶段提升。以 Qwen2.5-Math-7B 为例,完整训练后 Macro-F1 从 38.67 提升至 **45.91**,Examples 使用率从 75.25% 提升至 **84.79%**。7B 最终模型超过了 Qwen2.5-Math-72B-Instruct(F1: 41.89),1.5B 最终模型(F1: 39.02)则达到了 7B 基线水平。 - **分布外(OOD)评测**:在 GSM8K、MATH500、AIME 2024、GAOKAO-mQA 与 MMLU-collegeMath 上,模型性能未退化,部分基准甚至有提升,表明专业化训练未损害通用数学推理能力。 - **消融实验**: - 标准 DPO(仅优化正确性)反而抑制了示例推理使用率; - 混合 M-DPO 与 C-DPO 为单阶段(Mixed DPO)效果劣于顺序执行; - RGSI 显著优于纯自采样(质量区分不足)与教师直接改写(分布偏移导致表面模仿)。 - **机制分析**:Stage 1 后, m=2 (实质性使用示例)的响应比例从 30.74% 升至 39.30%, m=0 (纯抽象推理)从 56.58% 降至 48.47%,定量验证了行为迁移;案例研究展示了从“定理套用”到“确认性示例”再到“边界反例”的渐进推理深化。 —- ### 5. 主要贡献与结论 - 提出了 **INSPIRE** 框架,首次系统性地通过偏好优化提升 LLM 基于示例的数学概念推理能力; - 引入 **RGSI** 机制,解决了低能力模型下高质量在策略偏好数据的构建难题; - 设计了**阶段式评分标准偏好训练**,将能力习得解耦为“方法内化”与“正确性改进”,验证了渐进式优化优于联合优化; - 实验表明该方法在多种模型规模与家族上均具有一致有效性,且对通用数学推理能力无负面影响。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Shuai Wang, Jiayi Kuang, Yinghui Li, Haojing Huang, Xinnian Liang, Ying Shen, Liang Lin
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27501.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27501
Published: 2026-09-01T02:02:37.776Z
10. A Survey on Rubric-Guided Reinforcement Learning for Language Models
Abstract:Reinforcement learning from human feedback (RLHF) has become the dominant paradigm for aligning large language models (LLMs) with human preferences. However, traditional RLHF relies on scalar reward signals that lack interpretability and fail to capture the multifaceted nature of response quality. Rubric-guided reinforcement learning addresses these limitations by introducing structured, interpretable evaluation criteria, or rubrics, as the backbone of reward design, feedback generation, and policy optimization. In this survey, we introduce a Bayesian framework that defines constitutions as prior distributions $P(R)$ over evaluation criteria and rubrics as conditional instantiations $R_x \sim P(R|x)$. Under this unified view, we present a taxonomy of rubric-guided RL along the prior-posterior axis, covering constitutional AI, instance-specific rubrics, process-level supervision, self-evolving rubrics, and their agentic and multimodal extensions. Furthermore, as rubrics are natural-language artifacts, we present a linguistic analysis of how granularity trade-offs, semantic drift, and linguistic reward hacking impact alignment reliability, identifying key open problems for future research.
中文摘要
摘要:来自人类反馈的强化学习(RLHF)已成为将大型语言模型(LLMs)与人类偏好对齐的主导范式。然而,传统的RLHF依赖标量奖励信号,缺乏可解释性,未能捕捉反应质量的多面性。评分标准引导强化学习通过引入结构化、可解释的评估标准(rubrics)作为奖励设计、反馈生成和策略优化的骨干,解决了这些局限性。在本次调查中,我们引入了贝叶斯框架,将宪法定义为先验分布$P(R)$相对于评估标准,评分标准则为条件实例$R_x \sim P(R|x)$。在这一统一视角下,我们提出了沿前后轴的评分标准引导RL分类法,涵盖宪法人工智能、实例特定评分标准、流程层监督、自我演化评分标准及其代理和多模态扩展。此外,鉴于评分标准是自然语言产物,我们提出了语言学分析,探讨粒度权衡、语义漂移和语言奖励黑客如何影响对齐可靠性,识别出未来研究的关键未解问题。
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*传统基于人类反馈的强化学习(RLHF)在奖励信号设计上固有的不透明性与单一性问题\*\*,并系统性地建立\*\*以结构化评价标准(rubric)为核心的对齐范式\*\*。 具体而言,论文针对以下核心问题展开: ### 1. 标量奖励信号的局限 传统RLHF依赖单一的标量奖励 r(x,y) 来指导策略优化,这导致: - \*\*缺乏可解释性\*\*:难以解释为何某个响应获得高分或低分; - \*\*无法捕捉多维度质量\*\*:响应质量是多面的(如有用性、安全性、正确性、完整性),标量信号无法分解这些维度; - \*\*容易过度优化(Reward Hacking)\*\*:策略可能通过利用奖励模型的盲区来最大化标量奖励,而非真正提升输出质量。 ### 2. 结构化评价标准的统一理论框架缺失 虽然"宪法"(constitutions)、"原则"(principles)、"检查清单"(checklists)和"过程监督"(process supervision)等概念已出现,但领域缺乏一个统一的数学语言来描述它们之间的关系。论文通过引入贝叶斯框架,将这些方法统一为: - \*\*先验分布\*\* P(R) :全局、输入无关的宪法或原则; - \*\*后验实例化\*\* P(R mid x) :针对特定输入 x 生成的实例化rubric R_x 。 这一框架旨在澄清固定宪法、实例特定rubric与自进化标准之间的结构性联系。 ### 3. Rubric作为自然语言制品的可靠性挑战 论文指出rubric本质上是\*\*自然语言文本\*\*,而非纯粹的数学对象,因此其文本属性直接影响对齐稳定性。需要解决的关键现象包括: - \*\*语义漂移(Semantic Drift)\*\*:即使rubric文本不变,策略模型对其语义的解释也会在训练过程中发生偏移; - \*\*粒度权衡(Granularity Trade-offs)\*\*:在词元级、步骤级、响应级和原子检查项级等不同粒度上设计rubric时,存在探索-利用权衡; - \*\*语言奖励黑客(Linguistic Reward Hacking)\*\*:策略利用自然语言的歧义性和欠规范(underspecification),通过满足rubric的字面含义而违背其意图(如冗长膨胀、标准串扰、表面模式匹配)。 ### 4. 复杂场景下的扩展难题 论文进一步将rubric-guided RL的适用范围从单轮文本生成扩展到: - \*\*智能体场景(Agentic RL)\*\*:在多步轨迹中解决信用分配问题; - \*\*多模态场景\*\*:处理跨模态交互(视觉、音频)中多维度的结构化评价。 简言之,该论文试图以\*\*结构化、可解释、可控制且可自进化\*\*的rubric体系,替代传统RLHF中隐式的标量奖励优化,并为之提供统一的理论形式化、系统的分类法以及对自然语言固有风险的深度分析。 Q2: 有哪些相关研究? 该论文涵盖的相关研究可沿方法论谱系与任务场景两条轴线梳理,主要包含以下类别: ### 1. 传统RLHF与标量奖励的局限 - \*\*Ouyang et al. (2022)\*\*:提出标准的三阶段RLHF流程,以标量奖励模型 r(x,y) 对齐人类偏好。 - \*\*Gao et al. (2023)\*\*:分析奖励模型的过度优化(overoptimization)现象,揭示标量奖励在缩放时的退化规律。 - \*\*Wu et al. (2023)\*\*:论证细粒度人类反馈优于单一标量信号,但未能提供结构化的可解释分解。 ### 2. 宪法AI与固定原则方法 - \*\*Bai et al. (2022)\*\*:提出Constitutional AI(CAI),以固定自然语言原则集合作为全局先验 P(R) ,通过AI反馈实现无害化对齐。 - \*\*Chen et al. (2024)\*\*:IterAlign,迭代式宪法对齐。 - \*\*Findeis et al. (2025)\*\*:Inverse Constitutional AI(ICAI),将偏好压缩为原则。 - \*\*OpenAI (2024)\*\*:Deliberative Alignment,利用固定原则集进行推理时安全对齐。 - \*\*Lee et al. (2024)\*\*:RLAIF,以AI反馈替代人类标注扩展对齐规模。 ### 3. 实例特定Rubric与检查清单 - \*\*Gunjal et al. (2026)\*\*:RaR(Rubrics as Rewards),将输入特定的确定性rubric作为非可验证领域的强化学习奖励。 - \*\*Viswanathan et al. (2025)\*\*:RLCF,以实例级原子检查清单(checklist)替代奖励模型,结合程序验证器提供结构化反馈。 - \*\*Liu et al. (2026b)\*\*:OpenRubrics,通过对比式rubric生成(CRG)实现可扩展的合成rubric生成与多维奖励建模。 - \*\*Shen et al. (2026)\*\*:RRD,针对开放式任务重新思考rubric生成以改进LLM评判与奖励建模。 - \*\*Rao & Callison-Burch (2026)\*\*:AutoRubric,统一非可验证任务的rubric驱动评估框架。 - \*\*Ke et al. (2024)\*\*:CritiqueLLM,生成自由文本批评作为细粒度反馈。 ### 4. 过程监督与逐步验证 - \*\*Lightman et al. (2024)\*\*:提出Process Reward Models(PRMs),在数学/代码推理中提供逐步正确性信号,可视为单维度隐式步骤级rubric。 - \*\*Sheng et al. (2026)\*\*:RLCER,将自进化rubric扩展至思维链推理的过程级监督,实现多维度步骤反馈。 ### 5. 可验证奖励强化学习(RLVR) - \*\*Shao et al. (2024)\*\* / \*\*DeepSeek-AI (2025)\*\*:DeepSeekMath与DeepSeek-R1,利用规则/执行验证器(如数学正确性、代码通过性)构建客观奖励,提出GRPO算法。 - \*\*Yang et al. (2024)\*\*:Qwen2.5-Math,基于可验证信号的自改进数学专家模型。 - \*\*Lambert et al. (2025)\*\*:Tülu 3,将可验证任务整合入开放后训练流程。 ### 6. 直接偏好优化及其变体 - \*\*Rafailov et al. (2023)\*\*:DPO,绕过显式奖励模型,通过闭式重参数化直接优化策略。 - \*\*Gheshlaghi Azar et al. (2024)\*\*:IPO,泛化偏好优化并正则化确定性偏好过拟合。 - \*\*Ethayarajh et al. (2024)\*\*:KTO,基于前景理论从点wise好坏样本中学习。 - \*\*Meng et al. (2024)\*\*:SimPO,去除参考模型并以长度归一化隐式奖励优化。 - \*\*Hong et al. (2024)\*\*:ORPO,将SFT与偏好优化合并为单阶段。 ### 7. 自进化Rubric与元奖励 - \*\*Li et al. (2026c)\*\*:EvoLM,策略与判别性rubric协同进化,将偏好对作为观测进行后验锐化(posterior sharpening)。 - \*\*Xu et al. (2026)\*\*:Rubric-ARM,通过变分推断交替学习rubric生成与rubric条件奖励模型。 - \*\*Yuan et al. (2024)\*\*:Self-Rewarding Language Models,迭代利用模型自身评判能力改进对齐。 - \*\*Wu et al. (2025)\*\*:Meta-Rewarding,以LLM作为元评判者实现自改进对齐。 ### 8. 多目标与结构化评估 - \*\*Wang et al. (2024)\*\*:多目标奖励建模与专家混合(MoE),提供可解释的多维偏好。 - \*\*Hashemi et al. (2024)\*\*:LLM-Rubric,提出多维校准的自动化评估方法。 - \*\*Ye et al. (2024)\*\*:FLASK,基于细粒度对齐技能集的评估框架。 - \*\*Mu et al. (2024)\*\*:Rule Based Rewards,以可组合自然语言规则作为安全与可控性的直接RLHF奖励。 ### 9. 智能体场景中的Rubric引导 - \*\*Shao et al. (2026)\*\*:DR Tulu,以进化rubric进行深度研究任务的强化学习。 - \*\*Peng et al. (2026)\*\*:HiPER,分层强化学习结合显式信用分配,以阶段化rubric评估长程轨迹。 - \*\*Li et al. (2026a)\*\*:RubricEM,以rubric引导的策略分解超越可验证奖励的元强化学习。 - \*\*Ding (2026)\*\*:AdaRubric,面向LLM智能体评估与奖励学习的任务自适应rubric。 ### 10. 多模态Rubric引导对齐 - \*\*Tian et al. (2026)\*\*:ARR(Auto-Rubric as Reward),将隐式偏好转化为显式多模态生成标准。 - \*\*Liu et al. (2026a)\*\*:DeltaRubric,联合规划与验证的生成式多模态奖励建模。 - \*\*Yu et al. (2026)\*\*:rDPO,视觉偏好优化结合实例特定rubric奖励。 - \*\*Zhang et al. (2026c)\*\*:Step-Audio-R1.5,将rubric引导优化应用于多轮语音对话(内容要求、角色一致性、跨轮指令保持等)。 - \*\*Sun et al. (2024)\*\* / \*\*Yu et al. (2024)\*\*:多模态RLHF与细粒度矫正反馈(RLHF-V)。 ### 11. 跨语言与多语言评估 - \*\*Fu & Liu (2025)\*\*:揭示多语言LLM-as-a-Judge的低跨语言一致性(Fleiss' Kappa ≈ 0.3)。 - \*\*Hong et al. (2025)\*\*:跨语言奖励模型迁移。 - \*\*Anugraha et al. (2026)\*\*:mR3,多语言rubric无关奖励推理模型。 - \*\*Gureja et al. (2025)\*\*:M-RewardBench,系统性的23语言奖励模型评测。 - \*\*Hwang et al. (2024)\*\*:韩语敬语体系 Q3: 论文如何解决这个问题? 该论文通过\*\*理论统一、系统分类、操作化框架与语言学诊断\*\*四个层面解决标量奖励RLHF的局限,推动对齐范式从隐式标量优化转向显式结构化标准优化。 --- ### 1. 引入贝叶斯统一框架 论文提出以概率图视角重新形式化评价标准,消解“宪法(constitution)”“原则(principle)”“rubric”等术语的歧义: - \*\*宪法作为先验\*\*:全局、输入无关的评价原则对应先验分布 P(R) 。例如Constitutional AI中的“helpfulness, harmlessness, honesty”即是对 P(R) 的文本化描述。 - \*\*Rubric作为后验\*\*:输入特定的结构化标准对应条件分布 P(R mid x) ,其实例化形式 R_x = c_1, dots, c_K 是后验的点估计或采样。 - \*\*原则作为原子维度\*\*:样本空间中的每个维度对应一个可评估的质量轴。 在此框架下,rubric引导的奖励被形式化为:
rR(x, y) = E(Rx sim Pφ(R mid x, D, ell)) [ A( s(ck, x, y)(k=1)^K ) ]
其中 gφ 为rubric生成器, A 为聚合函数, s 为评判器。策略优化遵循KL正则化目标:
maxθ E(x sim D), y sim πθ [rR(x, y)] - β · KL(πθ parallel π(ref))
该框架的核心价值在于将固定原则、实例特定rubric与自进化标准纳入同一数学对象,仅通过**条件化程度**区分。 —- ### 2. 建立先验–后验分类体系 沿 P(R) to P(R mid x) 的轴,论文将现有方法系统分类,明确各类方法的假设与风险: | 类别 | 代表工作 | 机制 | 风险 | |:—-|:—-|:—-|:—-| | **点质量先验** | Constitutional AI, IterAlign | P(R mid x) = δ(Rconstitution)(R) | 假设全局原则跨输入可迁移,可能欠拟合特定任务 | | **确定性后验** | RaR, RLCF, OpenRubrics | 生成输入特定的确定性rubric R_x | 过拟合至单一后验点估计,易引发rubric exploitation | | **过程级后验** | PRMs, RLCER | 将后验条件扩展至推理步骤 P(R mid x, t) | 依赖步骤的可分解性,步骤定义本身非平凡 | | **变分/自进化后验** | EvoLM, Rubric-ARM | 随策略输出与偏好数据迭代更新rubric或评判器 | 反馈循环、标准漂移、评判器依赖 | 该分类不仅组织文献,更暴露关键设计权衡:确定性实例rubric提升相关性但牺牲鲁棒性;自进化方法适应分布转移但引入非稳态性。 —- ### 3. 操作化Rubric生命周期 论文将rubric引导RL拆解为可复用的组件流程: - **Rubric生成**:从固定模板(CAI)到对比式生成(OpenRubrics的CRG),再到自提出(EvoLM)与变分推断(Rubric-ARM),生成器 gφ 逐步从确定性映射演进为概率分布参数化。 - **评判与聚合**: criterion evaluator s(c_k, x, y) 提供维度级分数,聚合策略包括: - **加权和**: r = ∑_k w_k s_k ,可解释但需预设权重; - **隐式聚合**:由单一LLM调用综合多维度,捕捉交互但牺牲归因性; - **步骤乘积**:PRM式 prod_t p_t(correct) ,局部化错误但对序列长度敏感; - **成对自适应**:OpenRS为每对响应实例化特定标准,针对性判别但增加计算。 - **优化后端**:兼容PPO、GRPO(天然适合多维奖励)、DPO(将rubric分数转为偏好对)等。 —- ### 4. 语言学层面的诊断与缓解 论文将rubric视为自然语言制品而非纯粹数学对象,系统分析文本属性对对齐稳定性的影响,并提出相应对策: #### 4.1 语义漂移的量化监测 定义漂移指标:
Drift(c_k, t) = 1 - corr( s_t(c_k, x, y), s_0(c_k, x, y) )
通过在冻结的参考响应集上监测评判分数的秩相关衰减,触发rubric再生或人工审计,防止策略对固定文本标准的interpretation发生偏移。 #### 4.2 粒度权衡的显式管理 论文区分四种粒度层级: - **词元/词汇级**:格式约束、关键词过滤(直接但易引发长度/风格投机); - **句子/步骤级**:过程监督(PRMs, RLCER),提供密集信号但依赖可靠的步骤分解; - **响应/文档级**:整体评估(RaR),捕捉全局质量但信用分配稀疏; - **原子检查项级**:布尔化分解(RLCF, CheckEval),提升可检查性但可能产生“完成度”投机。 建议采用**混合设计**(如PRM结合结果验证、RLCF结合检查项与通用标准)平衡探索-利用。 #### 4.3 语言奖励黑客的识别与防御 将策略利用自然语言歧义的现象归纳为三类: 1. **冗长利用(Verbosity Exploitation)**:通过膨胀文本满足“完整性”检查; 2. **标准串扰(Criterion Bleeding)**:牺牲某一维度(如有用性)以最大化另一维度(如安全性); 3. **表面模式匹配(Surface Pattern Matching)**:复述rubric关键词(如“我已确保安全”)而不执行底层推理。 论文提出多重防御: - **后验边缘化**:以期望奖励替代点估计,要求策略在多个合理rubric公式下表现良好:
r(robust)(x, y) = E(Rx sim P(R mid x)) [r(R_x)(x, y)]
- **动态rubric适应**:自进化系统随漏洞暴露更新标准; - **信息论方法**:如InfoRM通过信息论约束缓解利用; - **多rubric集成**:在交叉族评判面板下评估,缩小训练-评估标准差距。 #### 4.4 跨语言解耦 提出语言感知rubric设计,将语言无关属性(如事实准确性)与语言特定实例化(如日语敬语keigo、韩语jondaetmal)解耦,对应条件化 P(R mid x, ell, d, z) ,其中 ell 为语言, d 为方言, z 为社会文化语境。 —- ### 5. 向智能体与多模态的扩展 论文进一步将上述框架推广至复杂场景: - **智能体RL**:针对长程轨迹的多步信用分配问题,引入分阶段/分层rubric(HiPER、RubricEM、DR Tulu),将轨迹奖励分解为时序阶段或规划-执行层级,减少虚假相关。 - **多模态RL**:处理跨模态交互(视觉 grounding、物体幻觉、音频流畅度),通过显式多模态rubric(ARR、DeltaRubric、rDPO、Step-Audio-R1.5)将模态特定维度纳入结构化评价,替代单一潜在偏好分数。 —- ### 总结 简言之,该论文并未提出单一算法,而是通过**贝叶斯形式化建立通用语言**、通过**先验-后验分类法厘清设计空间**、通过**组件化流程实现可操作化**,并首次系统地将**自然语言的语义稳定性、粒度经济与歧义利用**纳入对齐分析的的核心维度,从而为构建可解释、可控制且可自进化的rubric引导RL系统提供完整的理论与方法论基础。 Q4: 论文做了哪些实验? 这篇论文是一篇**综述(survey)**,其本身**并未开展新的原始实验**来训练模型或验证某一具体算法;相反,它的工作重心在于**理论统一、文献分类与定性分析**。因此,文中不存在传统意义上的“实验(Experiments)”章节。 不过,论文通过以下方式对现有证据进行了系统整理与分析: ### 1. 代表性结果的汇编(Table 4) 论文在附录 I 中以表格形式整理了各篇原始论文报告的代表性性能数据,但明确声明这些结果**来自原始文献**,且由于各方法使用的基座模型、评测基准和训练配置 heterogeneous,**不应进行跨方法的直接对比**。所收录的结果包括: | 方法 | 基座模型 | 评测基准 | 报告指标 | |:—-|:—-|:—-|:—-| | RaR | Qwen-2.5-7B | HealthBench, GPQA-Diamond | 相对提升 +31%, +7% | | Rubric-ARM | Various | RewardBench | 平均增益 +4.7% | | EvoLM | Qwen3-8B | RewardBench-2, OLMo3-Adapt | 超越 GPT-4.1 +25.7%, 平均 69.3% | | RLCER | 7B | 数学基准 | 优于 RLVR | | OpenRubrics | Various | RewardModel | 超越基线 +8.4% | | PRM | Various | MATH | 准确率 78.2% | | Constitutional AI | Various | Harmlessness Elo | Pareto 改进 | | Chasing the Tail | Various | RewardBench | 准确率增益 +3.2% | | RLCF | Various | 多领域 | 一致提升 | *注:论文明确标注”These numbers are included only to document each paper’s own evaluation setting and should not be interpreted as a controlled cross-method comparison.”* ### 2. 计算效率与复杂度的结构化分析(Table 3) 论文对各类 rubric-guided RL 范式进行了**理论层面的复杂度刻画**,而非实测对比: - **Token 消耗**:对比了静态宪法( O(P) ,可缓存)与实例特定 rubric( O(K · R) ,动态生成)的上下文开销; - **评判调用次数**:区分了隐式聚合(单次调用 O(1) )与显式逐项验证( K 次调用 O(K) ); - **推理延迟**:比较了商用 API 模型( M(large) )与本地化小模型( M(local) ,如 1.7B–3B)作为评判器的时延差异。 这属于**算法复杂度分析**,并非在特定硬件上运行的实测实验。 ### 3. 聚合策略的比较分析(Table 5) 论文对 8 种主流的 rubric 聚合与信用分配策略进行了**定性比较**,包括: - 加权和(Weighted Sum) - 隐式聚合(Implicit Aggregation) - 学习式 Rubric 条件评判(Rubric-ARM) - 判别性 Rubric(EvoLM) - 步骤乘积(PRM) - 原则集成(Principle Ensembling) - 检查清单聚合(Checklist Aggregation) - 分层信用(Hierarchical Credit) - 成对自适应(Pairwise Adaptive) 该比较从可解释性、计算成本、标准覆盖度与交互捕捉能力四个维度展开,属于**概念层面的对比**,而非消融实验。 ### 4. 语言学现象的定性证据(Appendix L) 论文提供了详细的**案例研究(case studies)**作为定性证据,支持第 4 节关于语义漂移和语言奖励黑客的论点,包括: - **语义漂移**(Table 6):对比 EvoLM 中的“有意漂移”(后验锐化,标准从模糊到具体)与 Constitutional AI 中的“无意漂移”(Goodharting 导致过度拒绝); - **冗长利用**(Table 7):引用 Mahmoud et al. (2026) 的实验,显示基于“存在性”的 rubric 导致模型在完整性上提升(+1.07)但简洁性与事实正确性显著下降(-2.91, -0.85); - **标准串扰**(Table 8):安全-有用性权衡分析; - **表面模式匹配**(Table 9):归纳三种验证器失效模式(Partial Compound、Implicit-as-Explicit、Imprecise Verification),这些在跨训练、跨领域和不同强度验证器下稳定存在; - **粒度效应**(Table 10):评判器容量(1.7B vs. 32B)与 rubric 粒度之间的交互作用。 这些案例均来自**已有文献的实证发现**,本综述将其重新组织为系统性的语言学分析框架。 ### 5. 自我进化与贝叶斯框架的推演(Section 2.4 & Appendix D) 论文提出了若干**尚待验证的设计假设(open hypotheses)**,例如通过后验边缘化实现鲁棒性:
r(robust)(x, y) = E(Rx sim P(R mid x)) [r(Rx)(x, y)]
以及通过秩相关衰减监测语义漂移的指标:
Drift(c_k, t) = 1 - corr( s_t(c_k, x, y), s_0(c_k, x, y) )
论文明确指出这些是**理论提案与诊断设计**,其 empirical validation 仍是未来工作。 —- ### 总结 该综述论文的“实验”性质体现在**元分析(meta-analysis)与证据综合**层面,而非新实验。其核心贡献是: 1. **贝叶斯理论框架**的建立; 2. **先验–后验分类法**对已有方法的系统组织; 3. **语言学视角**下对 rubric 文本属性如何影响对齐可靠性的深度剖析; 4. 对现有实验结果的**结构化整理与可比性警示**(强调不应直接横向对比各方法数值)。 Q5: 有什么可以进一步探索的点? 基于该综述的分析框架与明确指出的局限性,以下方向值得进一步探索: ### 1. 贝叶斯框架的完全概率化与收敛理论 当前贝叶斯框架主要承担**分析性抽象**功能,绝大多数现有系统并未实现真正的概率推断。未来可着力于: - **显式先验与似然设计**:构建具备可校准不确定性的生成式 rubric 生成器 gφ ,使 P_φ(R mid x, D, ell) 成为可采样、可推断的分布,而非确定性点估计 R_x ; - **收敛性与稳定性理论**:建立自然语言标准演化过程中策略优化的收敛保证,分析后验锐化(posterior sharpening)与策略参数 θ 联合动态下的稳定均衡条件; - **边缘化奖励的实证验证**:对论文提出的鲁棒奖励形式
r(robust)(x, y) = E(Rx sim P(R mid x)) [r(Rx)(x, y)]
进行系统实验,检验其在缓解语言奖励黑客方面的实际效用。 ### 2. 实例特定 Rubric 的计算效率瓶颈 实例级 rubric 生成引入不可忽略的 Token 开销与推理延迟(附录 E)。亟需研究: - **检索与缓存机制**:在相似输入间复用或适配已有 rubric,降低 O(K · R) 的动态生成成本; - **Rubric 压缩与蒸馏**:将高维自然语言标准蒸馏为低维结构化表征或本地化小模型( M(local) )可执行的指令,减少对外部 API 的依赖; - **生成-评估联合优化**:将 rubric 生成 g_φ 与评判 s 压缩为单次前向调用,避免显式的 K 次独立评判。 ### 3. 语义漂移与语言奖励黑客的自动化诊断 论文提出的漂移指标与黑客类型仍以定性案例为主,缺乏系统性诊断工具: - **语义漂移的实时监测**:验证并完善基于秩相关衰减的漂移度量
Drift(ck, t) = 1 - corr( s_t(c_k, x, y), s_0(c_k, x, y) )
开发自动触发 rubric 再生或人工审计的阈值策略; - **语言奖励黑客的自动检测**:构建跨 rubric 一致性检查、辅助验证(claimed reasoning steps 的独立核实)与异常标准相关模式检测的复合诊断系统; - **Underspecification 的受控利用**:将“欠规范作为进化空间”这一假设转化为可操作的训练协议,探索初始模糊标准 posterior sharpening 的最优调度。 ### 4. 跨语言与文化的原则性映射 多语言对齐中的标准不变性假设已被证伪(Fleiss’ Kappa ≈ 0.3)。未来需要: - **语言解耦的标准本体**:将语言无关的抽象质量属性(如事实准确性)与语言特定的社会语用实例(如日语敬语 keigo、阿拉伯语双言现象)在 P(R mid x, ell, d, z) 中进行显式因子化; - **跨语言 Rubric 迁移的理论**:理解英语训练奖励模型向目标语言 bootstrap 的有效条件与误差传播边界; - **文化敏感的参与式标准构建**:让不同语言社区的终端用户参与定义和修订 P(R) ,而非仅由英语中心视角主导。 ### 5. 多模态场景下的结构化评价 多模态 rubric-guided RL 尚处早期,存在结构性空白: - **跨模态交互的标准化**:如何为视觉 grounding、物体幻觉、时间音频一致性等维度设计可组合、可解释的 rubric 体系; - **模态间信用分配**:当策略输出包含交错的文本、图像与音频时,如何依据多模态 rubric 将奖励信号归因到特定模态的特定片段; - **主观-客观维度的分离**:如 Step-Audio-R1.5 所示,将内容要求等结构化标准与主观听感分离,探索二者在联合优化中的交互效应。 ### 6. 智能体长程轨迹的信用分配 智能体场景下的核心瓶颈是多步信用分配: - **分层与阶段化 Rubric 的动态生成**:在长时间跨度的任务中,如何根据中间状态自适应地实例化子目标 rubric(如 HiPER、RubricEM),并保证层级间信用传递的无偏性; - **深度研究智能体的评估基准**:扩展 ResearchRubrics、DRACO、DeepResearchBench 等基准,建立覆盖信息检索、综合、引证与事实核查的细粒度 rubric 体系; - **环境与 Rubric 的共进化**:在开放环境中,外部世界状态变化如何反馈到 P(R mid x) 的更新,形成环境-标准-策略的三方协同进化。 ### 7. Rubric 质量的元评估与标准化基准 论文明确指出当前缺乏受控比较的标准化基准: - **Rubric 判别力、覆盖度与校准的统一度量**:在附录 K 提出的三个质量维度(discriminative power, coverage, calibration)上建立可复现的评估协议; - **Rubric-level Meta-Evaluation**:如 RubricEval 所示,进一步构建面向指令遵循、推理与安全的元评测基准,衡量 LLM-as-a-Judge 在显式 rubric 条件下的可靠性; - **跨族 Rubric 面板的对抗性测试**:系统研究训练 rubric 与评估 rubric 分布不一致时策略的 exploitability,建立标准化的 adversarial robustness 测试套件。 ### 8. 伦理治理与标准构建的参与式框架 Rubric 将人类价值嵌入形式化标准,存在系统性偏见风险: - **参与式 Rubric 工程**:开发让多元利益相关者(而不仅是 AI 研究者)共同定义、 contest 和修订 P(R) 的方法论与工具; - **标准的民主治理机制**:建立宪法/原则的持续修订与申诉机制,防止特定文化或制度偏见被固化为“客观”评估标准; - **审计与透明**:确保 rubric 的文本、权重、聚合函数及其对策略更新的下游影响全程可审计,尤其针对生产系统中隐性 rubric 的使用(如 Kimi K2、GLM-5、DeepSeek-V4 部分披露的做法)。 ### 9. 生产系统中的隐性 Rubric 实证研究 近期技术报告表明,工业级系统已广泛嵌入类 rubric 标准,但披露不完全。未来需要: - **逆向工程与案例研究**:对生产模型的数据管道与奖励构造进行系统性定性分析,识别隐性的多维标准; - **隐式 vs. 显式标准的性能对照**:在受控环境中比较完全显式的 rubric-guided RL 与当前工业界混合方法的效率-性能权衡。 Q6: 总结一下论文的主要内容 这篇综述论文系统性地探讨了**以结构化评价标准(rubric)为核心的强化学习对齐范式**,旨在超越传统基于人类反馈的强化学习(RLHF)所依赖的单一、不透明标量奖励信号。以下是论文的主要内容总结: —- ### 1. 核心动机与问题 传统RLHF通过标量奖励 r(x,y) 对齐语言模型,但该范式存在三重局限: - **不可解释性**:无法说明响应得分高低的原因; - **低可控性**:难以对安全性、有用性、正确性等多维质量进行独立调控; - **脆弱性**:策略易通过奖励黑客(reward hacking)操纵标量信号,而非真正提升输出质量。 Rubric-guided RL 将**结构化、多维度、自然语言表述的评价标准**嵌入奖励设计、反馈生成与策略优化,形成从“隐式标量优化”到“显式结构化对齐”的范式转移。 —- ### 2. 统一的贝叶斯分析框架 论文提出一个概率框架,消解“宪法(constitution)”“原则(principle)”与“rubric”之间的术语歧义: - **宪法作为先验** P(R) :全局、输入无关的评价原则集合(如 Constitutional AI 中的“helpfulness, harmlessness, honesty”); - **Rubric 作为后验** P(R mid x) :针对特定输入 x 条件化实例化的标准 R_x sim P(R mid x) ,可视为后验分布的采样或点估计 R_x ; - **原则作为原子维度**:构成先验样本空间的单一质量轴。 在此框架下,rubric 引导的系统被形式化为元组 (πθ, P(R), gφ, J, A) ,其中 gφ 为 rubric 生成器, J 为维度级评判器, A 为聚合函数。策略优化的目标为:
maxθ E(x sim D), y sim πθ [r_R(x, y)] - β · KL(πθ parallel π(ref))
其中 rubric 条件奖励通过聚合各维度分数得到:
r_R(x, y) = E(Rx sim Pφ(R mid x, D, ell)) [ A( s(ck, x, y)(k=1)^K ) ]
该框架将固定宪法、实例特定 rubric 与自进化标准统一为同一数学对象在不同条件化程度下的表现。 —- ### 3. 沿先验–后验轴的分类体系 论文将现有方法按 P(R) to P(R mid x) 的演进谱系分为四类: 1. **点质量先验**:如 Constitutional AI、Deliberative Alignment,使用固定原则集,后验退化为先验处的 Delta 分布 P(R mid x) = δ_(R_constitution)(R) ; 2. **确定性后验**:如 RaR、RLCF、OpenRubrics,针对输入生成确定性 rubric R_x ,但存在对单一点估计过拟合的风险; 3. **过程级后验**:如 PRMs、RLCER,将条件化扩展至推理步骤 P(R mid x, t) ,提供密集的步骤级监督; 4. **变分/自进化后验**:如 EvoLM、Rubric-ARM,随策略输出与偏好数据迭代更新 rubric 或评判器,可解释为近似的后验锐化(posterior sharpening)。 —- ### 4. Rubric 作为自然语言制品的语言学分析 论文指出 rubric 本质上是自然语言文本,其文本属性直接影响对齐可靠性,并系统分析了以下现象: - **粒度效应**:区分词元级、句子/步骤级、响应级与原子检查项级评价,指出粒度-密度权衡类似于强化学习中的探索-利用权衡; - **语义漂移(Semantic Drift)**:即使 rubric 文本不变,策略模型对其语义的解释仍会在训练中发生偏移。论文提出监测指标:
Drift(c_k, t) = 1 - corr( s_t(c_k, x, y), s_0(c_k, x, y) )
通过追踪冻结参考集上评判分数的秩相关衰减,触发标准再生; - **语言奖励黑客(Linguistic Reward Hacking)**:策略利用自然语言的歧义与欠规范,通过满足字面含义而违背意图。论文归纳三种模式: - **冗长利用**:以膨胀文本满足“完整性”检查; - **标准串扰**:牺牲某一维度(如有用性)以最大化另一维度(如安全性); - **表面模式匹配**:复述 rubric 关键词而不执行底层推理; - **跨语言挑战**:指出高阶评价标准(如“礼貌”)受文化/语言深层结构(日语敬语、阿拉伯双言等)调节,英语中心的标准无法直接迁移。 —- ### 5. 新兴前沿:智能体与多模态扩展 论文将核心分类法扩展至两类复杂场景: - **智能体 RL**:针对长程轨迹中的多步信用分配问题,引入分阶段或分层 rubric(如 HiPER、RubricEM、DR Tulu),将轨迹奖励分解为规划-执行层级或时序阶段,减少虚假相关; - **多模态 RL**:针对视觉 grounding、物体幻觉、音频流畅度等维度,通过显式多模态 rubric(如 ARR、DeltaRubric、rDPO、Step-Audio-R1.5)替代单一潜在偏好分数,实现跨模态的结构化评价。 —- ### 6. 贡献与开放方向 论文的主要贡献包括: 1. 建立贝叶斯框架,统一组织固定宪法、实例 rubric 与自进化标准; 2. 提出先验–后验分类法,厘清各方法的设计假设与风险; 3. 开创性地从自然语言文本属性角度分析语义漂移、粒度与语言奖励黑客; 4. 将 rubric-guided RL 的讨论扩展至智能体与多模态领域。 论文指出的关键开放问题涵盖: - 自然语言标准到稳定标量/过程反馈的收敛理论; - 实例级 rubric 生成的计算效率优化(缓存、压缩、本地化评判器); - 跨语言/跨文化的原则性标准映射; - 长程智能体轨迹中的结构化信用分配。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Zifei Shan, Fangning Shao
Categories: cs.CL
PDF URL: https://arxiv.org/pdf/2608.27505.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27505
Published: 2026-09-01T02:02:37.776Z
Agent Domain Papers
1. Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
Abstract:In 2011, IBM’s Watson was something like a sealed capsule of its era’s queryable knowledge. Its DeepQA system defeated the strongest human Jeopardy! champions, but the knowledge that let it do so lived in a curated billion-document corpus running on a cluster of POWER7 servers, frozen at build time and impossible to move or copy. We show that the same kind of artifact, a snapshot of what a culture can answer, is now portable and essentially free. We evaluate a single 9 GB open-weight model (Qwen2.5-14B, 4-bit) against the complete open Jeopardy! clue dataset, 529,939 clues across all 41 broadcast seasons from 1984 to 2025. To our knowledge this is the first time a model has been run over the full corpus. The 41 years mark only how long the questions were collected. What they test is far older and broader: the accumulated body of human general knowledge a culture considers worth knowing, from ancient history and dead languages to science, literature, and geography, with a verified answer for every item. The model answers 67.0% of all clues under a strict forced-response protocol with exact and fuzzy matching, and exceeds 85% on factoid categories. We treat training-data exposure as something both systems share rather than a flaw unique to language models. Watson’s case is in fact the more extreme one. Its corpus was assembled to contain Jeopardy answers and it was tuned on past clues, and it could not answer anything outside that curated distribution. The decisive test is whether a model can answer clues that did not exist when it was built. On clues aired after its training cutoff, the local model holds 65% and Claude Opus 4.8 holds 95%, while Watson by construction scores zero. The capability survives the move from a server room to a file you could seal in a time capsule, and unlike Watson it is not frozen to its own moment.
中文摘要
摘要:2011年,IBM 的 Watson 就像是其时代可查询知识的封闭胶囊。其 DeepQA 系统击败了最强的人类《危险边缘》(Jeopardy!)冠军,但让它做到这一点的知识存在于一个经过精心策划的、运行在 POWER7 服务器集群上的十亿文档语料库中,这些数据在构建时被冻结,无法移动或复制。我们展示了同类型的产物——文化能够回答问题的快照——现在是可移植的且本质上是免费的。我们评估了一个单独的 9 GB 开源权重模型(Qwen2.5-14B, 4-bit)在完整的开放版《危险边缘》线索数据集上的表现,该数据集包含从 1984 年到 2025 年所有 41 个播出季的 529,939 条线索。据我们所知,这是第一次有模型被运行在完整语料库上。41 年仅标记了问题收集的时间长度。它们测试的是更久远且更广泛的内容:一个文化认为值得了解的人类通识知识的累积体,从古代历史和死语言到科学、文学和地理,每一项都有经过验证的答案。该模型在严格的强制响应协议下进行精确匹配和模糊匹配时,回答了全部线索的 67.0%,在事实类问题类别中超过 85%。我们将训练数据的暴露视为两个系统共有的现象,而非语言模型独有的缺陷。实际上 Watson 的情况更为极端。其语料库是为了包含《危险边缘》答案而组建的,并且它在过去的线索上进行了调优,因此无法回答该策划分布之外的任何问题。决定性的测试是模型能否回答在其构建时不存在的线索。在训练截止之后播出的线索上,本地模型保持 65%,Claude Opus 4.8 为 95%,而 Watson 因结构限制得分为零。这一能力在从服务器机房搬到可以密封进时间胶囊的文件时依然存续,并且与 Watson 不同,它不会被冻结在自身的时代。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27459 (HTTP 429)
Authors: David Noever, Forrest McKee
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27459.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27459
Published: 2026-09-01T02:04:50.695Z
2. Rating the Raters: Rasch Measurement Theory for LLM Evaluation
Abstract:LLMs now sit on every side of evaluation: as examinees scored on benchmarks, judges of other models’ outputs, and raters of human-generated content. Each paradigm can be viewed as a measurement problem, where a latent property of an object is probed with items from an instrument (e.g., benchmark) by raters. Standard evaluation practices often neglect the contributions of each core component to the end result, limiting our understanding of what is being measured. Rasch measurement theory (RMT) is well-suited to this kind of problem. RMT decomposes ordinal ratings into separable facets on a common scale. It further provides a battery of diagnostics that can identify miscalibrated measurements and rater biases. We present a case study of RMT applied to the LLM-as-rater paradigm using the Measuring Hate Speech corpus, whose construct was itself built under RMT. We fit a series of many-facet Rasch models to annotations from nine LLMs spanning families and capability levels. Our analyses show that LLMs systematically differ from human raters in severity, item-level calibration, question-order robustness, target-identity sensitivity, and rating scale use, which all would be obscured by standard evaluation practice. Overall, we argue that RMT belongs in the toolkit for evaluating LLM-as-examinee, -judge, and -rater paradigms.
中文摘要
摘要:大型语言模型(LLMs)现在出现在评估的各个方面:作为在基准测试上被评分的考生、作为其他模型输出的评判者以及作为人类生成内容的评分者。每种范式都可以被视为一种测量问题,其中通过评分者使用来自工具(例如基准测试)的条目来探测对象的潜在属性。标准的评估实践经常忽略每个核心组件对最终结果的贡献,从而限制了我们对所测量内容的理解。Rasch测量理论(RMT)非常适合处理这种问题。RMT将序数评分分解为在共同刻度上的可分离方面。此外,它还提供了一系列诊断工具,可以识别校准错误的测量和评分者偏差。我们展示了RMT应用于LLM作为评分者范式的案例研究,使用了“仇恨言论测量”语料库,其构想本身就是基于RMT建立的。我们为来自九个不同模型家族和能力水平的LLM的注释拟合了一系列多方面Rasch模型。我们的分析显示,LLM在严格性、条目级校准、问题顺序稳健性、目标身份敏感性以及评分尺度使用上,系统性地不同于人类评分者,这些差异在标准评估实践中都会被掩盖。总体而言,我们认为RMT应成为评估LLM作为考生、评判者和评分者范式的工具箱中的一部分。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27463 (HTTP 429)
Authors: Pratik S. Sachdeva, Nathan Boudol
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27463.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27463
Published: 2026-09-01T02:04:50.695Z
3. Not All Explanations Are Sought: Information-Seeking Psychology for Human-Centered XAI
Abstract:This position paper argues that human-centered explainable AI (HCXAI) should incorporate insights from the psychology of information seeking. Drawing on Sharot and Sunstein’s framework of information-seeking motives, we propose that people evaluate whether to engage with explanations based on three types of expected utility: instrumental (will it help me act better?), hedonic (will it make me feel better?), and cognitive (will it improve my understanding?). Each utility is estimated through a lens shaped by well-documented cognitive biases, including illusion of control, automation bias, unrealistic optimism, impact bias, overconfidence, and confirmation bias. These biases can lead to two failure modes: excessive information-seeking that fragments attention without improving decisions, and insufficient information-seeking that leaves critical risks and misunderstandings unexamined. This challenge is particularly acute for agentic AI systems, where explanations must support not just understanding a single output but anticipating cascading actions, assessing risks, and deciding when to intervene. By integrating information-seeking psychology into HCXAI, we advocate for a shift from making explanations available to making them sought: designing systems that account for when and why users actually want to know.
中文摘要
摘要:本文立场论文认为,以人为中心的可解释人工智能(HCXAI)应当融入信息寻求心理学的洞见。借鉴Sharot和Sunstein的信息寻求动机框架,我们提出,人们在决定是否参与解释时,会根据三类期望效用进行评估:工具性(它能帮助我做出更好的行动吗?)、享乐性(它会让我感觉更好吗?)和认知性(它会提高我的理解吗?)。每种效用都是通过由广泛记录的认知偏差塑造的视角进行估计,包括控制错觉、自动化偏差、不切实际的乐观、影响偏差、过度自信和确认偏差。这些偏差可能导致两种失败模式:过度的信息寻求,会分散注意力却不改善决策,以及不足的信息寻求,会让关键风险和误解未被检查。这个挑战在具代理性的人工智能系统中尤其突出,因为解释不仅要支持理解单一输出,还要支持预测连锁动作、评估风险以及决定何时干预。通过将信息寻求心理学整合到HCXAI中,我们倡导从提供解释转向使解释被主动寻求:设计能够考虑用户实际何时以及为何希望了解的系统。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27464 (HTTP 429)
Authors: Andrea Beretta, Salvatore Rinzivillo
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27464.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27464
Published: 2026-09-01T02:04:50.695Z
4. Retrieving Relations, Detecting Fallacies: A RAG Approach to Political Debate Analysis
Abstract:Fallacies are arguments that employ invalid reasoning, making their automatic detection critical in sensitive contexts such as high-stakes political debates, where public opinion is shaped. Spotting a fallacious argument requires contextual knowledge beyond its pure surface text. This entails world knowledge pertaining to the subject matter under discussion, as well as knowledge of the relationships that exist between arguments within the argumentative discourse. Prior work on fallacy analysis has shown that argumentative discourse structure can beneficially improve classification performance. However, such structure is typically encoded only as static classifier features, limiting its flexibility. Building on this intuition while addressing this limitation, we introduce a guided retrieval-augmented methodology for fallacy detection and classification that leverages argumentative relations of support and attack to dynamically steer the extraction of relevant documents. We evaluate our approach on the ElecDeb60to20 benchmark across 42 retrieval configurations and 14 models, performing retrieval over a 15GB knowledge base of collected political-related documents. Our approach improves macro-F1 up to 0.864 for fallacy detection and up to 0.725 for classification over non-retrieval baselines. These results show that incorporating external knowledge significantly enhances fallacy detection and classification when retrieval is argumentatively guided.
中文摘要
摘要:谬误是使用无效推理的论证,因此在敏感场景中(如公共舆论形成的高风险政治辩论中)自动检测谬误至关重要。识别谬误性论证需要超越其表面文本的上下文知识。这包括与讨论主题相关的世界知识,以及论证话语中论点之间关系的知识。先前关于谬误分析的研究表明,论证性话语结构可以有效提高分类性能。然而,这种结构通常仅作为静态分类器特征编码,限制了其灵活性。基于这一直觉并解决该限制,我们提出了一种引导检索增强的方法来进行谬误检测和分类,该方法利用支持与攻击的论证关系动态引导相关文档的提取。我们在ElecDeb60to20基准上评估了该方法,涵盖42种检索配置和14种模型,并在一个15GB政治相关文献知识库上执行检索。我们的方法将宏F1在谬误检测中提高至0.864,在分类中提高至0.725,相较于非检索基线。这些结果表明,当检索受到论证性指导时,整合外部知识可以显著增强谬误检测和分类。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27471 (HTTP 429)
Authors: Deborah Dore, Greta Damo, Elena Cabrio, Serena Villata
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27471.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27471
Published: 2026-09-01T02:04:50.695Z
5. LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation
Abstract:Bayesian network structure learning (BNSL) from observational data struggles with orientation identifiability, while large language models (LLMs) offer broad but often unreliable causal knowledge. We propose combining these complementary sources through a novel representation, termed Probabilistic Dependency Graphs (PDGs). In a PDG, each edge is associated with a distribution over directed, undirected, and absent states, enabling fusion via weighted averaging. We evaluate this approach on 26 benchmark networks, combining ensembles of three BNSL algorithms (FGES, Tabu, PC) with three LLMs (Gemini, Claude, GPT) across multiple prompts and random seeds. A simple 50/50 fusion improves F1 over the better of either source alone in 22 of 26 networks, with a statistically significant mean improvement of $0.056$ $(p<0.001)$. Analysis reveals that the two sources play complementary roles: BNSL contributes a high-recall edge skeleton (80\% vs 60\% for LLM), while LLM contributes accurate edge orientation (96\% vs 77\% for BNSL). Our results show that representing both sources as probabilistic uncertainty over edge existence and orientation is a practical and effective way to improve causal graph accuracy.
中文摘要
摘要:从观测数据中进行贝叶斯网络结构学习(BNSL)在方向可识别性方面存在困难,而大语言模型(LLM)提供了广泛但通常不可靠的因果知识。我们提出通过一种新颖的表示方法,即概率依赖图(PDG),来结合这些互补的来源。在PDG中,每条边都与一个关于有向、无向和不存在状态的分布相关联,从而可以通过加权平均进行融合。我们在26个基准网络上评估了这一方法,结合三个BNSL算法(FGES、Tabu、PC)的集成与三个LLM(Gemini、Claude、GPT)在多种提示和随机种子下的结果。简单的50/50融合在26个网络中有22个网络的F1分数超过了任一单一来源的最佳结果,平均显著提升为0.056(p<0.001)。分析表明,这两种来源发挥了互补作用:BNSL贡献了高召回率的边骨架(80% 对比 LLM 的 60%),而LLM贡献了准确的边方向(96% 对比 BNSL 的 77%)。我们的结果表明,将这两种来源表示为边存在和方向的不确定性概率,是提高因果图准确性的一种可行且有效的方法。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27472 (HTTP 429)
Authors: Neville K. Kitson, Anthony Constantinou
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27472.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27472
Published: 2026-09-01T02:04:50.695Z
6. Hypothesize, Evaluate, Refine: A Scientific Agent for PDE Discovery with Unknown Spatial Coefficient Fields
Abstract:Discovering PDEs in heterogeneous media requires jointly identifying the governing operator and the unknown spatial fields that parameterize it. These tasks are coupled: changing field placement changes the differential law, while a sufficiently flexible field can conceal structural error on a single trajectory. We present Hypothesize, Evaluate, Refine for PDE Discovery (HER-PDE), a scientific-agent framework that discovers compositional PDE structure together with nonparametric, time-invariant coefficient fields. The Agent analyzes two noisy trajectories generated by different excitations, proposes complete expression-tree hypotheses, and combines creative structural exploration with local candidate refinement. Its Hypothesis Evaluation Interface (HEI) estimates only the fields explicitly declared in each hypothesis, never adds missing terms, and scores structures by bidirectional cross-excitation transfer. The selected law is subsequently audited on a sealed temporal interval. Across five controlled two-dimensional systems observed with 5 percent relative Gaussian state noise, the Agent recovers the generating operator in all five cases, including equivalent signed-field and product-rule parameterizations. Across nine unknown coefficient fields, the recovered fields attain a median Pearson correlation of approximately 0.85 and a median relative L2 error of approximately 0.28. These results show that agent-guided hypothesis refinement can recover heterogeneous governing laws without prescribing a parametric form for their spatial coefficients.
中文摘要
摘要:在异质介质中发现偏微分方程(PDE)需要同时识别控制算子和参数化该算子的未知空间场。这些任务是耦合的:改变场的位置会改变微分定律,而足够灵活的场可能在单条轨迹上掩盖结构性误差。我们提出了用于PDE发现的假设-评估-优化框架(HER-PDE),这是一种科学代理框架,可同时发现组合型PDE结构和非参数、时间不变的系数场。该代理分析由不同激励生成的两条带噪轨迹,提出完整的表达树假设,并将创造性的结构探索与局部候选优化相结合。其假设评估接口(HEI)仅估计每个假设中明确声明的场,从不添加缺失项,并通过双向跨激励传递对结构进行评分。随后,在封闭的时间区间内对选定的定律进行审计。在五个受控二维系统中,观测时具有5%相对高斯状态噪声,代理在所有五种情况下均恢复了生成算子,包括等效符号场和乘积法则参数化。在九个未知系数场中,恢复的系数场中位皮尔逊相关约为0.85,中位相对L2误差约为0.28。这些结果表明,代理引导的假设优化可以在不规定其空间系数的参数形式的情况下,恢复异质控制定律。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27475 (HTTP 429)
Authors: YuJie Huang, WenWu He, ZhuoEr Lin, Congcong Liu, Dong Liang, Zhuo-Xu Cui
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27475.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27475
Published: 2026-09-01T02:04:50.695Z
7. Class-Based Heuristic Selection for Solving the Flying Block Puzzle
Abstract:Heuristic search underlies planning in autonomous systems ranging from warehouse logistics to robotic navigation, yet generic heuristics fail to exploit the structural constraints that govern constrained spatial domains, causing search performance to degrade catastrophically on harder instances. We study this problem through the two-column Flying Block Puzzle, a rigorously NP-complete spatial planning microworld whose bottleneck geometry mirrors clearance-to-size constraints encountered in multi-agent path finding, autonomous vehicle navigation, and block relocation systems. We introduce the Class-Based Heuristic A (CBHA) algorithm, which integrates a General Move Constraint to capture minimum displacement costs when vacant units are scarce, a formal kinematic taxonomy partitioning the state space into seven mutually exclusive classes with provably admissible heuristics based on vacancy ratio and goal-piece geometry, and a class-conditional tie-breaking mechanism that dynamically switches between depth-priority and vertical-distance ordering to overcome f-value plateaus. Over 146 benchmark instances, CBHA achieves a 93.4% success rate against 64% for Depth-Prioritized A, 39% for Standard A, and 17% for BFS, while reducing node expansions by 87.98% relative to Standard A and sustaining an average effective branching factor of approximately 3, demonstrating that class-triggered adaptive heuristics constitute a principled mechanism for efficient spatial planning that generalizes structurally to physical constraint systems.
中文摘要
摘要:启发式搜索是从仓库物流到机器人导航等自主系统规划的基础,但通用启发式方法无法利用约束空间域中支配的结构性约束,导致在更难的实例上搜索性能急剧下降。我们通过双列飞块拼图来研究这一问题,这是一种严格的NP完全空间规划微型世界,其瓶颈几何与多智能体路径规划、自主车辆导航和积木搬运系统中遇到的空隙与尺寸约束相似。我们提出了基于类别的启发式A(CBHA)算法,该算法整合了通用移动约束,以在空闲单元稀缺时捕捉最小位移成本,一种形式化的运动学分类方法将状态空间划分为七个互斥类别,并基于空闲率和目标块几何提供可证明可采纳的启发式,以及一种类别条件的平局打破机制,可以在深度优先和垂直距离排序之间动态切换,以克服f值平台。在146个基准实例中,CBHA实现了93.4%的成功率,而深度优先A为64%,标准A为39%,BFS为17%;同时相对于标准A减少了87.98%的节点扩展,并保持了约3的平均有效分支因子,证明了类别触发的自适应启发式构成了一种高效空间规划的原则性机制,并可结构性地推广到物理约束系统。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27476 (HTTP 429)
Authors: Sanyar Ahmadi, Pedram Asadzadeh, Amanj Khorramian
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27476.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27476
Published: 2026-09-01T02:04:50.695Z
8. Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
Abstract:Graphical user interfaces have emerged as an important environment for evaluating autonomous AI agents on multimodal interactive tasks. Existing benchmarks such as AndroidWorld and MobileWorld provide strong foundations for mobile agent evaluation, but their application coverage and task design do not yet fully capture the diversity and complexity of realistic mobile use. We present GMA, a benchmark for evaluating general mobile assistants in challenging real-world scenarios. GMA introduces seven applications based on open-source projects, spanning domains such as lifestyle sharing and travel planning, and 300 tasks across four difficulty tiers, from atomic actions to complex multi-step workflows. We evaluate eight frontier models and find that performance declines substantially as task complexity increases, with current agents remaining far from reliably handling realistic user requirements. We further conduct controlled ablation studies of agent harness choices, including context retention and explicit state tracking, under a shared environment, model setting, and task taxonomy. Results show that appropriate harness design can meaningfully improve performance, particularly on demanding workflows, while the effectiveness of specific designs can vary across foundation models. Overall, GMA complements existing benchmarks by expanding application coverage and task complexity, providing a challenging testbed for evaluating mobile agents and studying how harness design supports reliable execution in complex mobile workflows.
中文摘要
摘要:图形用户界面已经成为评估自主AI代理在多模态交互任务中表现的重要环境。现有的基准如AndroidWorld和MobileWorld为移动代理评估提供了坚实的基础,但它们的应用覆盖范围和任务设计尚未完全体现现实移动使用的多样性和复杂性。我们提出了GMA,这是一个用于在具有挑战性的现实场景中评估通用移动助手的基准。GMA引入了七个基于开源项目的应用程序,涵盖生活方式分享、旅行规划等领域,以及跨四个难度等级的300个任务,从原子操作到复杂的多步骤工作流程。我们评估了八个前沿模型,结果发现随着任务复杂性的增加,性能显著下降,目前的代理仍远未能够可靠地处理现实用户需求。我们进一步在共享环境、模型设置和任务分类下,对代理工具选择进行了可控消融研究,包括上下文保留和显式状态跟踪。结果显示,适当的工具设计可以显著提高性能,尤其是在要求较高的工作流程中,而具体设计的有效性可能因基础模型而异。总体而言,GMA通过扩展应用覆盖范围和任务复杂性,补充了现有基准,为评估移动代理和研究工具设计如何支持复杂移动工作流程中的可靠执行提供了一个具有挑战性的测试平台。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27477 (HTTP 429)
Authors: Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27477.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27477
Published: 2026-09-01T02:04:50.695Z
9. Effectiveness of IoT and Deep Learning for Detection and Severity Assessment of Postelectrotermes militaris in Tea Plantations
Abstract:Tea plantations are vulnerable to Postelectrotermes militaris, commonly known as the Upcountry Live Wood Termite (ULWT), which can cause substantial damage when infestations remain undetected. This study proposes an IoT-enabled acoustic monitoring framework integrated with deep learning for early detection and severity assessment of ULWT infestations in tea plantations. Research Method: Audio signals were captured non-invasively from tea trunks using a high-sensitivity microphone connected to a Raspberry Pi-based IoT device, with geographic coordinates recorded for spatial tracking. After trimming, resampling, and segmentation, 2,000 ten-second samples were obtained, comprising 1,000 healthy and 1,000 infested samples, and divided into 1,600 training, 200 validation, and 200 test samples. The dataset used in this study is publicly available on Kaggle (Senevirathna et al. 2026). Fourier-derived spectrograms trained a CNN for infestation classification and probability estimation. A weighted severity model combined CNN probability, mean acoustic amplitude, and nearby infested plants within 5 m, with geospatial mapping used to visualize infestation distribution. Findings and Values: Field trials in a ULWT-affected tea plantation in Pundaluoya demonstrated feasibility under realistic environmental noise. On the held-out test set, the CNN achieved 81.5% accuracy, 80.6% precision, 83.0% recall, 81.8% F1-score, and 0.819 ROC-AUC. Beyond binary infestation detection, the framework introduced quantitative severity assessment using infestation probability, acoustic amplitude, and nearby infested plants. The resulting severity and geospatial outputs can support plantation managers in identifying high-risk areas, prioritizing field inspections, and implementing more timely and targeted control measures.
中文摘要
摘要:茶园易受Postelectrotermes militaris(通常称为高地活木白蚁,ULWT)侵害,当虫害未被及时发现时,可造成重大损失。本研究提出了一种基于物联网的声学监测框架,结合深度学习,用于茶园ULWT虫害的早期检测和严重程度评估。研究方法:通过高灵敏度麦克风非侵入式采集茶树干的音频信号,该麦克风连接到基于Raspberry Pi的物联网设备,同时记录地理坐标以进行空间追踪。在剪辑、重采样和分段处理后,获得了2,000个十秒样本,包括1,000个健康样本和1,000个受虫害样本,并划分为1,600个训练样本、200个验证样本和200个测试样本。本研究使用的数据集可在Kaggle公开获得(Senevirathna等,2026)。通过傅里叶变换生成的声谱图训练卷积神经网络(CNN)用于虫害分类和概率估计。加权严重性模型结合了CNN概率、平均声学幅度以及5米内的受害植物,并利用地理空间映射可视化虫害分布。研究发现及价值:在普达卢奥亚受ULWT影响的茶园进行的实地试验表明,在实际环境噪声下该方法可行。在保留的测试集上,CNN实现了81.5%的准确率、80.6%的精确率、83.0%的召回率、81.8%的F1评分以及0.819的ROC-AUC。除了二元虫害检测外,该框架引入了利用虫害概率、声学幅度和附近受害植物的定量严重程度评估。由此产生的严重程度和地理空间结果可帮助茶园管理者识别高风险区域,优先安排现场检查,并实施更及时和有针对性的防控措施。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27480 (HTTP 429)
Authors: D.K.C. Senevirathna, A.A.E. Nanayakkara, H.M.C.K. Kulathunga, J.K.D.P. Nadula, R.M. Mapatuna, Malithi Nawarathne, Jaliya L. Wijayaraja, P.D. Senanayake, Samitha Vidhanaarachchi, Kalpani Manathunga
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27480.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27480
Published: 2026-09-01T02:04:50.695Z
10. Context Localization for Generalized Level-Based Evaluation in Knowledge-Based Systems
Abstract:We study context localization for generalized level-based evaluation in knowledge-based systems. The framework models situations where a structured nonnegative score, defined on facts, rules, cases, criteria or evidence units, is evaluated through conditional aggregation tests on admissible knowledge contexts. The generalized level measure maximizes a monotone set function over all contexts whose aggregated support reaches a prescribed level. We characterize when filtering the score by a context $B$ is equivalent to localizing the admissible contexts by intersection with $B$. The main theorem shows that this consistency holds for all monotone set functions if and only if two structural conditions are satisfied: monotonicity with respect to contexts and a reduction property excluding positive localized support outside $B$. We analyze pointwise and block-generated mechanisms producing the reduction property, extend the result to parameterized systems, and interpret it as a stability criterion for context-dependent evidence selection, non-additive support evaluation and level-based knowledge aggregation.
中文摘要
摘要:我们研究了知识系统中基于通用层次的评估的上下文定位。该框架模拟了这样一种情况:在事实、规则、案例、准则或证据单元上定义的结构化非负分数,通过对可接受知识上下文进行条件聚合测试进行评估。通用层次度量在所有其聚合支持达到规定层次的上下文上最大化单调集合函数。我们刻画了通过上下文 $B$ 过滤分数何时等价于通过与 $B$ 相交来定位可接受上下文。主要定理表明,当且仅当满足两个结构条件时,这种一致性对于所有单调集合函数都成立:相对于上下文的单调性,以及排除 $B$ 外正向局部支持的约简属性。我们分析了产生约简属性的逐点机制和块生成机制,将结果扩展到参数化系统,并将其解释为上下文相关证据选择、非加性支持评估和基于层次的知识聚合的稳定性准则。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27482 (HTTP 429)
Authors: Ondrej Hutník, Natália Puškárová
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27482.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27482
Published: 2026-09-01T02:04:50.695Z
Evaluation Domain Papers
1. Time Capsule of Testable Human Knowledge: 41 Years of Jeopardy! in a Single Free Local Model
Abstract:In 2011, IBM’s Watson was something like a sealed capsule of its era’s queryable knowledge. Its DeepQA system defeated the strongest human Jeopardy! champions, but the knowledge that let it do so lived in a curated billion-document corpus running on a cluster of POWER7 servers, frozen at build time and impossible to move or copy. We show that the same kind of artifact, a snapshot of what a culture can answer, is now portable and essentially free. We evaluate a single 9 GB open-weight model (Qwen2.5-14B, 4-bit) against the complete open Jeopardy! clue dataset, 529,939 clues across all 41 broadcast seasons from 1984 to 2025. To our knowledge this is the first time a model has been run over the full corpus. The 41 years mark only how long the questions were collected. What they test is far older and broader: the accumulated body of human general knowledge a culture considers worth knowing, from ancient history and dead languages to science, literature, and geography, with a verified answer for every item. The model answers 67.0% of all clues under a strict forced-response protocol with exact and fuzzy matching, and exceeds 85% on factoid categories. We treat training-data exposure as something both systems share rather than a flaw unique to language models. Watson’s case is in fact the more extreme one. Its corpus was assembled to contain Jeopardy answers and it was tuned on past clues, and it could not answer anything outside that curated distribution. The decisive test is whether a model can answer clues that did not exist when it was built. On clues aired after its training cutoff, the local model holds 65% and Claude Opus 4.8 holds 95%, while Watson by construction scores zero. The capability survives the move from a server room to a file you could seal in a time capsule, and unlike Watson it is not frozen to its own moment.
中文摘要
摘要:2011年,IBM 的 Watson 就像是其时代可查询知识的封闭胶囊。其 DeepQA 系统击败了最强的人类《危险边缘》(Jeopardy!)冠军,但让它做到这一点的知识存在于一个经过精心策划的、运行在 POWER7 服务器集群上的十亿文档语料库中,这些数据在构建时被冻结,无法移动或复制。我们展示了同类型的产物——文化能够回答问题的快照——现在是可移植的且本质上是免费的。我们评估了一个单一的 9 GB 开源权重模型(Qwen2.5-14B, 4-bit)在完整的开放版《危险边缘》线索数据集上的表现,数据集包含从 1984 年到 2025 年所有 41 个播出季的 529,939 条线索。据我们所知,这是首次对整个语料库运行模型。这 41 年仅标记了问题收集的时间长度。它们测试的内容远比这更古老、更广泛:即一个文化认为值得了解的人类通识知识的累积体,从古代历史和死语言到科学、文学和地理,每条都有经过验证的答案。该模型在严格的强制响应协议下,进行精确匹配和模糊匹配时,回答了全部线索的 67.0%,在事实类问题上超过 85%。我们将训练数据的暴露视为两个系统共有的特性,而不是语言模型独有的缺陷。事实上,Watson 的情况更为极端。其语料库是为了包含《危险边缘》答案而组建的,并且在过去的线索上进行了调优,因此无法回答该策划分布之外的任何问题。决定性的测试是模型能否回答在其构建时不存在的线索。在训练截止之后播出的线索上,本地模型保持 65%,Claude Opus 4.8 为 95%,而 Watson 因结构限制得分为零。这一能力在从服务器机房搬到可以密封进时间胶囊的文件时依然存续,并且与 Watson 不同,它不会冻结在自身的时代。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27459 (HTTP 429)
Authors: David Noever, Forrest McKee
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27459.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27459
Published: 2026-09-01T02:05:11.705Z
2. Rating the Raters: Rasch Measurement Theory for LLM Evaluation
Abstract:LLMs now sit on every side of evaluation: as examinees scored on benchmarks, judges of other models’ outputs, and raters of human-generated content. Each paradigm can be viewed as a measurement problem, where a latent property of an object is probed with items from an instrument (e.g., benchmark) by raters. Standard evaluation practices often neglect the contributions of each core component to the end result, limiting our understanding of what is being measured. Rasch measurement theory (RMT) is well-suited to this kind of problem. RMT decomposes ordinal ratings into separable facets on a common scale. It further provides a battery of diagnostics that can identify miscalibrated measurements and rater biases. We present a case study of RMT applied to the LLM-as-rater paradigm using the Measuring Hate Speech corpus, whose construct was itself built under RMT. We fit a series of many-facet Rasch models to annotations from nine LLMs spanning families and capability levels. Our analyses show that LLMs systematically differ from human raters in severity, item-level calibration, question-order robustness, target-identity sensitivity, and rating scale use, which all would be obscured by standard evaluation practice. Overall, we argue that RMT belongs in the toolkit for evaluating LLM-as-examinee, -judge, and -rater paradigms.
中文摘要
摘要:大型语言模型(LLMs)现在出现在评价的各个方面:作为在基准测试上打分的被测对象、作为其他模型输出的评判者,以及作为人类生成内容的评分者。每种范式都可以被视为一种测量问题,其中通过评分者使用来自工具(例如基准测试)的条目来探测对象的潜在属性。标准评价实践通常忽略了每个核心组件对最终结果的贡献,从而限制了我们对测量内容的理解。拉什测量理论(RMT)非常适合处理此类问题。RMT将序数评分分解为在公共尺度上的可分离方面。此外,它还提供了一系列诊断工具,可识别测量校准错误和评分者偏差。我们展示了一个将RMT应用于LLM作为评分者范式的案例研究,使用的是测量仇恨言论语料库,其构建本身就是基于RMT的。我们将一系列多方面拉什模型拟合到涵盖不同家族和能力水平的九个LLM的注释中。分析显示,LLM在严厉程度、条目级校准、问题顺序稳健性、目标身份敏感性以及评分量表使用上系统性地与人类评分者存在差异,而这些差异在标准评价实践中都会被掩盖。总体而言,我们认为RMT应成为评估LLM作为被测者、评判者和评分者范式的工具箱中的一部分。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27463 (HTTP 429)
Authors: Pratik S. Sachdeva, Nathan Boudol
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27463.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27463
Published: 2026-09-01T02:05:11.705Z
3. Not All Explanations Are Sought: Information-Seeking Psychology for Human-Centered XAI
Abstract:This position paper argues that human-centered explainable AI (HCXAI) should incorporate insights from the psychology of information seeking. Drawing on Sharot and Sunstein’s framework of information-seeking motives, we propose that people evaluate whether to engage with explanations based on three types of expected utility: instrumental (will it help me act better?), hedonic (will it make me feel better?), and cognitive (will it improve my understanding?). Each utility is estimated through a lens shaped by well-documented cognitive biases, including illusion of control, automation bias, unrealistic optimism, impact bias, overconfidence, and confirmation bias. These biases can lead to two failure modes: excessive information-seeking that fragments attention without improving decisions, and insufficient information-seeking that leaves critical risks and misunderstandings unexamined. This challenge is particularly acute for agentic AI systems, where explanations must support not just understanding a single output but anticipating cascading actions, assessing risks, and deciding when to intervene. By integrating information-seeking psychology into HCXAI, we advocate for a shift from making explanations available to making them sought: designing systems that account for when and why users actually want to know.
中文摘要
摘要:本文立场论文认为,以人为中心的可解释人工智能(HCXAI)应当融入信息寻求心理学的洞见。借鉴Sharot和Sunstein的信息寻求动机框架,我们提出,人们在决定是否参与解释时,会根据三类期望效用进行评估:工具性(它能帮助我做出更好的行动吗?)、享乐性(它会让我感觉更好吗?)和认知性(它会提高我的理解吗?)。每种效用都是通过由广泛记录的认知偏差塑造的视角进行估计,包括控制错觉、自动化偏差、不切实际的乐观、影响偏差、过度自信和确认偏差。这些偏差可能导致两种失败模式:过度的信息寻求,会分散注意力却不改善决策,以及不足的信息寻求,会让关键风险和误解未被检查。对于具有代理性的人工智能系统,这一挑战尤其严峻,因为解释不仅要支持理解单一输出,还要支持预测连锁动作、评估风险以及决定何时干预。通过将信息寻求心理学整合到HCXAI中,我们倡导从使解释可得转向使解释被主动寻求:设计能够考虑用户实际何时以及为何想要了解信息的系统。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27464 (HTTP 429)
Authors: Andrea Beretta, Salvatore Rinzivillo
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27464.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27464
Published: 2026-09-01T02:05:11.705Z
4. Retrieving Relations, Detecting Fallacies: A RAG Approach to Political Debate Analysis
Abstract:Fallacies are arguments that employ invalid reasoning, making their automatic detection critical in sensitive contexts such as high-stakes political debates, where public opinion is shaped. Spotting a fallacious argument requires contextual knowledge beyond its pure surface text. This entails world knowledge pertaining to the subject matter under discussion, as well as knowledge of the relationships that exist between arguments within the argumentative discourse. Prior work on fallacy analysis has shown that argumentative discourse structure can beneficially improve classification performance. However, such structure is typically encoded only as static classifier features, limiting its flexibility. Building on this intuition while addressing this limitation, we introduce a guided retrieval-augmented methodology for fallacy detection and classification that leverages argumentative relations of support and attack to dynamically steer the extraction of relevant documents. We evaluate our approach on the ElecDeb60to20 benchmark across 42 retrieval configurations and 14 models, performing retrieval over a 15GB knowledge base of collected political-related documents. Our approach improves macro-F1 up to 0.864 for fallacy detection and up to 0.725 for classification over non-retrieval baselines. These results show that incorporating external knowledge significantly enhances fallacy detection and classification when retrieval is argumentatively guided.
中文摘要
摘要:谬误是使用无效推理的论证,因此在敏感场景中(如公共舆论易受影响的高风险政治辩论中)对其进行自动检测至关重要。发现谬误性论证需要超越文本表面的上下文知识。这包括与讨论主题相关的世界知识,以及论证话语中各论点之间关系的知识。先前关于谬误分析的研究表明,论证性话语结构可以有效提高分类性能。然而,这种结构通常仅以静态分类器特征编码,限制了其灵活性。在这一直觉的基础上,同时解决这一局限性,我们提出了一种针对谬误检测和分类的引导检索增强方法,该方法利用支持和攻击的论证关系动态引导相关文档的提取。我们在ElecDeb60to20基准数据集上评估了我们的方法,覆盖42种检索配置和14种模型,对一个15GB的政治相关文档知识库进行检索。我们的方法在谬误检测中将宏F1提高到0.864,在分类中提高到0.725,相比于非检索基线均有所提升。这些结果表明,融入外部知识在检索受论证关系引导时,能够显著增强谬误检测和分类性能。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27471 (HTTP 429)
Authors: Deborah Dore, Greta Damo, Elena Cabrio, Serena Villata
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27471.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27471
Published: 2026-09-01T02:05:11.705Z
5. LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation
Abstract:Bayesian network structure learning (BNSL) from observational data struggles with orientation identifiability, while large language models (LLMs) offer broad but often unreliable causal knowledge. We propose combining these complementary sources through a novel representation, termed Probabilistic Dependency Graphs (PDGs). In a PDG, each edge is associated with a distribution over directed, undirected, and absent states, enabling fusion via weighted averaging. We evaluate this approach on 26 benchmark networks, combining ensembles of three BNSL algorithms (FGES, Tabu, PC) with three LLMs (Gemini, Claude, GPT) across multiple prompts and random seeds. A simple 50/50 fusion improves F1 over the better of either source alone in 22 of 26 networks, with a statistically significant mean improvement of $0.056$ $(p<0.001)$. Analysis reveals that the two sources play complementary roles: BNSL contributes a high-recall edge skeleton (80\% vs 60\% for LLM), while LLM contributes accurate edge orientation (96\% vs 77\% for BNSL). Our results show that representing both sources as probabilistic uncertainty over edge existence and orientation is a practical and effective way to improve causal graph accuracy.
中文摘要
摘要:基于观察数据的贝叶斯网络结构学习(BNSL)在方向识别方面存在困难,而大型语言模型(LLM)则提供了广泛但常常不可靠的因果知识。我们提出通过一种新颖的表示方式——概率依赖图(PDG)——将这些互补来源结合起来。在PDG中,每条边对应于有向、无向和缺失态的分布,从而通过加权平均实现融合。我们在26个基准网络上评估了该方法,结合了三种BNSL算法(FGES、Tabu、PC)和三种大型语言模型(Gemini、Claude、GPT)的集合,涵盖多个提示和随机种子。在26个网络中,简单的50/50融合能使F1优于单来源的22个,统计学上显著提升了0.056美元(p<0.001)$。分析显示,这两个来源起着互补的作用:BNSL贡献了高召回率的边缘骨架(LLM为80%对60%),而LLM贡献了准确的边缘方向(BNSL为96%对77%)。我们的结果表明,将这两个来源都表示为边缘存在性和方向的概率不确定性,是提高因果图准确性的实用且有效方法。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27472 (HTTP 429)
Authors: Neville K. Kitson, Anthony Constantinou
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27472.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27472
Published: 2026-09-01T02:05:11.705Z
6. Hypothesize, Evaluate, Refine: A Scientific Agent for PDE Discovery with Unknown Spatial Coefficient Fields
Abstract:Discovering PDEs in heterogeneous media requires jointly identifying the governing operator and the unknown spatial fields that parameterize it. These tasks are coupled: changing field placement changes the differential law, while a sufficiently flexible field can conceal structural error on a single trajectory. We present Hypothesize, Evaluate, Refine for PDE Discovery (HER-PDE), a scientific-agent framework that discovers compositional PDE structure together with nonparametric, time-invariant coefficient fields. The Agent analyzes two noisy trajectories generated by different excitations, proposes complete expression-tree hypotheses, and combines creative structural exploration with local candidate refinement. Its Hypothesis Evaluation Interface (HEI) estimates only the fields explicitly declared in each hypothesis, never adds missing terms, and scores structures by bidirectional cross-excitation transfer. The selected law is subsequently audited on a sealed temporal interval. Across five controlled two-dimensional systems observed with 5 percent relative Gaussian state noise, the Agent recovers the generating operator in all five cases, including equivalent signed-field and product-rule parameterizations. Across nine unknown coefficient fields, the recovered fields attain a median Pearson correlation of approximately 0.85 and a median relative L2 error of approximately 0.28. These results show that agent-guided hypothesis refinement can recover heterogeneous governing laws without prescribing a parametric form for their spatial coefficients.
中文摘要
摘要:在异质介质中发现偏微分方程(PDE)需要同时识别控制算子和参数化该算子的未知空间场。这些任务是耦合的:改变场的位置会改变微分定律,而足够灵活的场可能在单条轨迹上掩盖结构性误差。我们提出了用于PDE发现的假设-评估-优化框架(HER-PDE),这是一种科学代理框架,可同时发现组合型PDE结构和非参数、时间不变的系数场。该代理分析由不同激励生成的两条带噪轨迹,提出完整的表达树假设,并将创造性结构探索与局部候选优化相结合。其假设评估接口(HEI)仅估计每个假设中明确定义的场,从不添加缺失项,并通过双向交叉激励传递对结构进行评分。随后,在封闭的时间区间内对所选定律进行审核。在五个受控二维系统中,观测时具有5%相对高斯状态噪声,代理在所有五种情况下均恢复了生成算子,包括等效符号场和乘积法则参数化。在九个未知系数场中,恢复的系数场中位皮尔逊相关约为0.85,中位相对L2误差约为0.28。这些结果表明,代理引导的假设优化可以在不规定空间系数参数形式的情况下恢复异质控制定律。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27475 (HTTP 429)
Authors: YuJie Huang, WenWu He, ZhuoEr Lin, Congcong Liu, Dong Liang, Zhuo-Xu Cui
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27475.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27475
Published: 2026-09-01T02:05:11.705Z
7. Class-Based Heuristic Selection for Solving the Flying Block Puzzle
Abstract:Heuristic search underlies planning in autonomous systems ranging from warehouse logistics to robotic navigation, yet generic heuristics fail to exploit the structural constraints that govern constrained spatial domains, causing search performance to degrade catastrophically on harder instances. We study this problem through the two-column Flying Block Puzzle, a rigorously NP-complete spatial planning microworld whose bottleneck geometry mirrors clearance-to-size constraints encountered in multi-agent path finding, autonomous vehicle navigation, and block relocation systems. We introduce the Class-Based Heuristic A (CBHA) algorithm, which integrates a General Move Constraint to capture minimum displacement costs when vacant units are scarce, a formal kinematic taxonomy partitioning the state space into seven mutually exclusive classes with provably admissible heuristics based on vacancy ratio and goal-piece geometry, and a class-conditional tie-breaking mechanism that dynamically switches between depth-priority and vertical-distance ordering to overcome f-value plateaus. Over 146 benchmark instances, CBHA achieves a 93.4% success rate against 64% for Depth-Prioritized A, 39% for Standard A, and 17% for BFS, while reducing node expansions by 87.98% relative to Standard A and sustaining an average effective branching factor of approximately 3, demonstrating that class-triggered adaptive heuristics constitute a principled mechanism for efficient spatial planning that generalizes structurally to physical constraint systems.
中文摘要
摘要:启发式搜索是从仓库物流到机器人导航等自主系统规划的基础,但通用启发式方法无法利用约束空间域中支配的结构性约束,导致在更难的实例上搜索性能急剧下降。我们通过双列飞块拼图来研究这一问题,这是一种严格的NP完全空间规划微型世界,其瓶颈几何与多智能体路径规划、自主车辆导航和积木搬运系统中遇到的空隙与尺寸约束相似。我们提出了基于类别的启发式A(CBHA)算法,该算法整合了通用移动约束,以在空闲单元稀缺时捕捉最小位移成本,一种形式化的运动学分类方法将状态空间划分为七个互斥类别,并基于空闲率和目标块几何提供可证明可采纳的启发式,以及一种类别条件的优先级破平机制,可在深度优先和垂直距离排序之间动态切换以克服f值平台。在146个基准实例中,CBHA实现了93.4%的成功率,而深度优先A为64%,标准A为39%,BFS为17%;同时与标准A相比,节点扩展数减少了87.98%,平均有效分支因子约为3,证明了类别触发的自适应启发式构成了一种高效空间规划的原则性机制,并可结构性地推广到物理约束系统。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27476 (HTTP 429)
Authors: Sanyar Ahmadi, Pedram Asadzadeh, Amanj Khorramian
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27476.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27476
Published: 2026-09-01T02:05:11.705Z
8. Benchmarking General Mobile Assistants in Challenging Real-World Scenarios
Abstract:Graphical user interfaces have emerged as an important environment for evaluating autonomous AI agents on multimodal interactive tasks. Existing benchmarks such as AndroidWorld and MobileWorld provide strong foundations for mobile agent evaluation, but their application coverage and task design do not yet fully capture the diversity and complexity of realistic mobile use. We present GMA, a benchmark for evaluating general mobile assistants in challenging real-world scenarios. GMA introduces seven applications based on open-source projects, spanning domains such as lifestyle sharing and travel planning, and 300 tasks across four difficulty tiers, from atomic actions to complex multi-step workflows. We evaluate eight frontier models and find that performance declines substantially as task complexity increases, with current agents remaining far from reliably handling realistic user requirements. We further conduct controlled ablation studies of agent harness choices, including context retention and explicit state tracking, under a shared environment, model setting, and task taxonomy. Results show that appropriate harness design can meaningfully improve performance, particularly on demanding workflows, while the effectiveness of specific designs can vary across foundation models. Overall, GMA complements existing benchmarks by expanding application coverage and task complexity, providing a challenging testbed for evaluating mobile agents and studying how harness design supports reliable execution in complex mobile workflows.
中文摘要
摘要:图形用户界面已经成为评估自主AI代理在多模态交互任务中表现的重要环境。现有的基准如AndroidWorld和MobileWorld为移动代理评估提供了坚实的基础,但它们的应用覆盖范围和任务设计尚未完全体现现实移动使用的多样性和复杂性。我们提出了GMA,这是一个用于在具有挑战性的现实场景中评估通用移动助手的基准。GMA引入了七个基于开源项目的应用程序,涵盖生活方式分享、旅行规划等领域,以及跨四个难度等级的300个任务,从原子操作到复杂的多步骤工作流程。我们评估了八个前沿模型,结果发现随着任务复杂性的增加,性能显著下降,目前的代理仍远未能够可靠地处理现实用户需求。我们进一步在共享环境、模型设置和任务分类下,对代理工具选择进行了可控消融研究,包括上下文保留和显式状态跟踪。结果显示,适当的工具设计可以显著提高性能,尤其是在要求较高的工作流程中,而具体设计的有效性可能因基础模型而异。总体而言,GMA通过扩展应用覆盖范围和任务复杂性,补充了现有基准,为评估移动代理和研究工具设计如何支持复杂移动工作流程中的可靠执行提供了一个具有挑战性的测试平台。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27477 (HTTP 429)
Authors: Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27477.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27477
Published: 2026-09-01T02:05:11.705Z
9. Effectiveness of IoT and Deep Learning for Detection and Severity Assessment of Postelectrotermes militaris in Tea Plantations
Abstract:Tea plantations are vulnerable to Postelectrotermes militaris, commonly known as the Upcountry Live Wood Termite (ULWT), which can cause substantial damage when infestations remain undetected. This study proposes an IoT-enabled acoustic monitoring framework integrated with deep learning for early detection and severity assessment of ULWT infestations in tea plantations. Research Method: Audio signals were captured non-invasively from tea trunks using a high-sensitivity microphone connected to a Raspberry Pi-based IoT device, with geographic coordinates recorded for spatial tracking. After trimming, resampling, and segmentation, 2,000 ten-second samples were obtained, comprising 1,000 healthy and 1,000 infested samples, and divided into 1,600 training, 200 validation, and 200 test samples. The dataset used in this study is publicly available on Kaggle (Senevirathna et al. 2026). Fourier-derived spectrograms trained a CNN for infestation classification and probability estimation. A weighted severity model combined CNN probability, mean acoustic amplitude, and nearby infested plants within 5 m, with geospatial mapping used to visualize infestation distribution. Findings and Values: Field trials in a ULWT-affected tea plantation in Pundaluoya demonstrated feasibility under realistic environmental noise. On the held-out test set, the CNN achieved 81.5% accuracy, 80.6% precision, 83.0% recall, 81.8% F1-score, and 0.819 ROC-AUC. Beyond binary infestation detection, the framework introduced quantitative severity assessment using infestation probability, acoustic amplitude, and nearby infested plants. The resulting severity and geospatial outputs can support plantation managers in identifying high-risk areas, prioritizing field inspections, and implementing more timely and targeted control measures.
中文摘要
摘要:茶园易受Postelectrotermes militaris(通常称为高地活木白蚁,ULWT)侵害,当虫害未被及时发现时,可造成重大损失。本研究提出了一种基于物联网的声学监测框架,结合深度学习,用于茶园ULWT虫害的早期检测和严重程度评估。研究方法:使用高灵敏度麦克风连接Raspberry Pi物联网设备,从茶树干非侵入性地采集音频信号,同时记录地理坐标进行空间追踪。经过剪切、重采样和分段后,得到2000个十秒样本,其中包括1000个健康样本和1000个受侵样本,并划分为1600个训练集、200个验证集和200个测试集。本研究使用的数据集在Kaggle公开可得(Senevirathna et al. 2026)。通过傅里叶变换生成的频谱图训练卷积神经网络(CNN)进行虫害分类和概率估计。加权严重性模型结合CNN概率值、平均声学幅度及5米范围内的受侵茶树数量,并使用地理空间映射可视化虫害分布。研究结果及价值:在Pundaluoya受ULWT影响的茶园现场试验表明,该方法在真实环境噪声下可行。在保留测试集上,CNN达到了81.5%的准确率、80.6%的精确率、83.0%的召回率、81.8%的F1值,以及0.819的ROC-AUC。除了二元虫害检测外,该框架引入了基于虫害概率、声学幅度和邻近受侵茶树的定量严重程度评估。由此生成的严重程度和地理空间输出可帮助茶园管理者识别高风险区域,优先安排现场检查,并实施更加及时和有针对性的防控措施。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27480 (HTTP 429)
Authors: D.K.C. Senevirathna, A.A.E. Nanayakkara, H.M.C.K. Kulathunga, J.K.D.P. Nadula, R.M. Mapatuna, Malithi Nawarathne, Jaliya L. Wijayaraja, P.D. Senanayake, Samitha Vidhanaarachchi, Kalpani Manathunga
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27480.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27480
Published: 2026-09-01T02:05:11.705Z
10. Context Localization for Generalized Level-Based Evaluation in Knowledge-Based Systems
Abstract:We study context localization for generalized level-based evaluation in knowledge-based systems. The framework models situations where a structured nonnegative score, defined on facts, rules, cases, criteria or evidence units, is evaluated through conditional aggregation tests on admissible knowledge contexts. The generalized level measure maximizes a monotone set function over all contexts whose aggregated support reaches a prescribed level. We characterize when filtering the score by a context $B$ is equivalent to localizing the admissible contexts by intersection with $B$. The main theorem shows that this consistency holds for all monotone set functions if and only if two structural conditions are satisfied: monotonicity with respect to contexts and a reduction property excluding positive localized support outside $B$. We analyze pointwise and block-generated mechanisms producing the reduction property, extend the result to parameterized systems, and interpret it as a stability criterion for context-dependent evidence selection, non-additive support evaluation and level-based knowledge aggregation.
中文摘要
摘要:我们研究了知识系统中基于广义层次的评估的上下文定位。该框架模拟了这样一种情况:在事实、规则、案例、准则或证据单元上定义的结构化非负分数,通过对可接受知识上下文进行条件聚合测试进行评估。广义层次度量在所有其聚合支持达到规定层次的上下文上最大化单调集合函数。我们刻画了通过上下文 $B$ 过滤分数何时等价于通过与 $B$ 相交来定位可接受上下文。主要定理表明,当且仅当满足两个结构条件时,这种一致性对于所有单调集合函数都成立:相对于上下文的单调性,以及排除 $B$ 外正向局部支持的约简属性。我们分析了产生约简属性的逐点机制和块生成机制,将结果扩展到参数化系统,并将其解释为上下文相关证据选择、非加性支持评估和基于层次的知识聚合的稳定性准则。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27482 (HTTP 429)
Authors: Ondrej Hutník, Natália Puškárová
Categories: cs.AI
PDF URL: https://arxiv.org/pdf/2608.27482.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27482
Published: 2026-09-01T02:05:11.705Z
VLM Domain Papers
1. FVeinSyn: Synthetic Finger Vein Image Generator
Abstract:A major challenge in finger vein recognition is the lack of large-scale public datasets. Existing datasets contain few identities and limited samples per finger, restricting the advancement of deep learning-based methods. To address this, we propose FVeinSyn, a large-scale controllable synthetic data generation framework for finger vein. It explicitly decouples synthesis of vascular topology and imaging appearance to mitigate the limitations caused by insufficient training samples, such as inadequate identity diversity and restricted realism. Specifically: first, a finger vein identity generator models vascular topology under physiological and geometric constraints using stochastic L-systems, producing anatomically valid and identity-distinctive vascular patterns. Then, a cascaded region-aware GAN renders the topological maps into realistic near-infrared images. Finally, an intra-class diversity generator introduces geometric and optical perturbations to simulate realistic intra-class variations. Using FVeinSyn, we generated 500,000 images (10,000 vein identities, 50 samples per identity) and conducted extensive evaluations. Results show that FVeinSyn holds significant advantages in realism, identity diversity, vascular pattern consistency, and intra-class diversity. Models trained with FVeinSyn outperform real-data-only baselines a cross eight public datasets, achieving an average accuracy improvement of 27.43\%. The code is available at: this https URL.
中文摘要
摘要:手指静脉识别的一大挑战是缺乏大规模的公开数据集。现有数据集的身份数量少,每根手指的样本也有限,限制了基于深度学习方法的进展。为了解决这一问题,我们提出了FVeinSyn,一种大规模可控的手指静脉合成数据生成框架。它明确地将血管拓扑结构的合成与成像外观分离,以缓解训练样本不足所带来的限制,如身份多样性不足和真实感受限。具体而言:首先,手指静脉身份生成器在生理和几何约束下,使用随机L系统对血管拓扑进行建模,生成解剖上有效且身份显著不同的血管模式。然后,级联的区域感知生成对抗网络(GAN)将拓扑图渲染为真实的近红外图像。最后,类内多样性生成器引入几何和光学扰动,以模拟真实的类内变化。使用FVeinSyn,我们生成了50万张图像(10,000个静脉身份,每个身份50个样本)并进行了广泛评估。结果表明,FVeinSyn在真实感、身份多样性、血管模式一致性和类内多样性方面具有显著优势。使用FVeinSyn训练的模型在八个公共数据集上的表现均优于仅使用真实数据的基线模型,平均准确率提升了27.43%。代码可在以下网址获取:https URL。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27527 (HTTP 429)
Authors: Yifan Wang, Jie Gui, Adams Wai Kin Kong, Baosheng Yu, Changsheng Chen, Qi Li, Zhenan Sun, James Tin-Yau Kwok, Alex Kot
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27527.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27527
Published: 2026-09-01T02:05:36.367Z
2. Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction
Abstract:Streaming 3D reconstruction from extremely long videos requires estimating camera motion and scene geometry online under bounded memory and computation. Early streaming models achieve causal, bounded-cost inference using finite context buffers or compact recurrent states, yet their estimates often deteriorate as sequences grow. Recent methods improve long-horizon stability by coupling short-range context with persistent or multi-level long-range memory. We pursue a different route: we keep the learned temporal state strictly local and formulate predictions whose targets remain independent of sequence length. We present ABot-Recon, a simple streaming model that caches KV features from only the preceding 11 frames. It predicts a point map in the current camera coordinate system together with an adjacent-frame relative pose. These predictions remain equivariant under changes of reference frame, and global poses and geometry are recovered through sequential composition. To reduce accumulated drift, a lightweight temporal refiner improves relative rotations using recent visual and motion context, while a composition-aware pose loss supervises multi-step pose composition. Extensive evaluations on challenging long-sequence benchmarks demonstrate the superior long-horizon performance of our local-context approach. On Oxford Spires, ABot-Recon achieves an ATE of 4.35 m and an RPE-R of $0.12^\circ$, reducing both errors by approximately 40\% relative to the best prior results.
中文摘要
摘要:从极长视频进行流式3D重建需要在有界内存和计算下在线估计摄像机运动和场景几何。早期流式模型利用有限上下文缓冲区或紧凑的重复态实现因果、有界成本推断,但随着序列增长,其估计值常常下降。最新方法通过将短距离上下文与持久或多级长距离内存耦合,提高了长视距稳定性。我们采取了另一种方式:保持学习到的时序状态严格局部,并制定目标与序列长度无关的预测。我们介绍ABot-Recon,这是一个简单的流式模型,仅缓存前11帧的KV特征。它预测当前相机坐标系中的点映射和相邻帧的相对姿态。这些预测在参考系变化下保持等变,全局姿态和几何体通过顺序合成恢复。为减少累积漂移,轻量级时间精炼器利用近期视觉和运动上下文改善相对旋转,而合成感知姿态丢失则监督多步姿态合成。对挑战性长序列基准的广泛评估显示,我们的局部上下文方法在长视野表现上更优越。在牛津尖塔,ABot-Recon实现了4.35米的ATE,RPE-R为$0.12^\circ$,相较于最佳先验结果,将两项误差降低约40%。
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文致力于解决\*\*超长视频流中的在线三维重建与相机位姿估计问题\*\*,即在内存和每帧计算成本有界的前提下,从因果接收的极长图像序列中持续恢复相机运动和密集场景几何。 具体而言,该论文针对以下两方面核心矛盾展开研究: - \*\*长程稳定性与有界推理之间的矛盾\*\*:早期流式模型虽能通过有限上下文缓存或紧凑循环状态实现因果、有界推理,但随着序列增长,估计性能往往显著退化。近期方法通过引入持久化或多层级长程记忆来提升长程稳定性,却使得历史状态的存储、压缩、更新与融合成为架构设计的核心负担。 - \*\*预测目标随序列增长而膨胀\*\*:当位姿和几何预测目标被定义在相对于时间遥远的固定参考帧(如第一帧或关键锚帧)的坐标系中时,其估计范围随序列长度不断增加,导致回归问题持续变难。 为应对上述问题,该论文提出了一种\*\*严格局部的长程流式重建范式\*\*,核心思想可概括为: 1. \*\*局部上下文公式化\*\*:将长程流式重建重新表述为局部几何估计问题。提出的ABot-Recon模型仅在固定的12帧时间视界内操作,仅缓存前11帧的键值(KV)特征,不维护任何持久化的学习长程状态。 2. \*\*局部参考系预测\*\*:对每一帧,模型预测当前相机坐标系下的点图、置信度图以及相邻帧之间的相对位姿。这些预测目标与序列总长度无关,使得模型可在短序列上训练并直接推广至超长视频流。 3. \*\*全局增量组装\*\*:全局相机轨迹通过顺序组合相邻帧相对变换在线恢复,局部点图相应变换到全局坐标系,从而保持模型内存和每帧计算量与序列长度无关。 4. \*\*漂移抑制机制\*\*:针对局部方法面临的误差累积挑战,该论文引入了两个关键组件: - \*\*轻量级时间旋转精修器\*\*:联合近期运动演化与稠密视觉证据,对相对旋转估计进行残差修正; - \*\*组合感知位姿损失\*\*:在多个时间跨度上监督位姿链的组合结果,直接约束局部预测在递归组合后的累积效应。 简言之,该论文试图论证并验证:\*\*在超长视频流中,无需依赖复杂的长程记忆机制,仅通过严格局部的上下文、局部坐标系下的预测目标,以及专门设计的组合一致性监督与旋转精修,即可实现稳定、低漂移的在线三维重建与相机跟踪。\*\* Q2: 有哪些相关研究? 该论文的相关研究主要围绕以下三个方向展开: ### 1. 前馈视觉几何重建 (Feed-Forward Visual Geometry Reconstruction) 传统方法依赖精心设计的SfM和视觉SLAM管线,通过特征匹配、几何验证、三角化、光束法平差和回环检测等步骤恢复相机运动和场景结构。近期研究转向利用学习到的几何先验直接进行前馈重建: - \*\*DUSt3R\*\* 引入共享坐标系下的点图回归,无需已知相机内参或位姿即可实现两视图重建; - \*\*MASt3R\*\* 在此基础上增加稠密局部特征以提升图像匹配精度; - \*\*MV-DUSt3R+\*\* 与 \*\*Fast3R\*\* 将信息交换扩展到多视图输入; - \*\*VGGT\*\* 通过全局多视图交互联合预测相机参数、深度、点图和轨迹; - \*\*Pi3\*\* 对输入视图施加排列等变性约束; - \*\*FLARE\*\* 将相机估计与几何及外观预测耦合; - \*\*PLANA3R\*\* 利用平面溅射学习度量平面基元表示室内场景; - \*\*MonST3R\*\* 将前馈重建扩展到动态视频。 这些方法展示了学习先验可替代传统管线的绝大部分,但通常处理有界视图集合,无法直接支持因果、有界成本的长视频流推理。 ### 2. 流式重建与时间记忆 (Streaming Reconstruction and Temporal Memory) 流式重建通过不同形式的时间状态传播历史信息,主要策略包括外部空间记忆、循环状态和显式缓存: - \*\*Spann3R\*\* 将几何特征存储在外部空间记忆中; - \*\*CUT3R\*\* 维护紧凑的循环状态; - \*\*SLAM3R\*\* 注册从重叠局部片段重建的点图; - \*\*StreamVGGT\*\* 采用缓存的时间键值特征; - \*\*STream3R\*\* 使用仅解码器的因果预测; - \*\*WinT3R\*\* 结合滑动窗口交互与全局相机token; - \*\*Point3R\*\* 引入显式空间指针记忆。 为扩展至更长序列,后续方法强化了时间状态的保留与更新机制: - \*\*LONG3R\*\* 提出门控3D时空记忆与长度递增课程训练; - \*\*LongStream\*\* 采用关键帧相对预测与周期性缓存刷新; - \*\*STAC\*\* 压缩缓存特征; - \*\*TTT3R\*\* 应用置信度自适应循环状态更新; - \*\*Mem3R\*\* 通过快速权重记忆和固定大小token状态解耦跟踪与建图; - \*\*LingBot-Map\*\* 协调锚点上下文、位姿参考窗口和轨迹记忆; - \*\*HorizonStream\*\* 将局部注意力与持久线性注意力耦合。 这些进展验证了长程上下文的有效性,但也使历史状态的管理与融合成为架构设计的核心负担。 ### 3. 局部到全局的位姿与轨迹恢复 (Local-to-Global Pose and Trajectory Recovery) 将局部运动估计与全局轨迹恢复分离是视觉里程计和SLAM的核心思想: - \*\*DROID-SLAM\*\* 估计稠密帧间约束并在图上优化; - \*\*ORB-SLAM3\*\* 结合关键帧、光束法平差和回环检测; - \*\*MASt3R-SLAM\*\* 使用点图匹配进行跟踪、回环和全局优化; - \*\*SLAM3R\*\*、\*\*VGGT-Long\*\* 与 \*\*TALO\*\* 构建并对齐局部子图; - \*\*Anchor3R\*\* 通过运动图集成瞬态窗口的当前中心相对位姿; - \*\*R3\*\* 通过相对预测改进位姿估计,但仍绑定到第一帧参考; - \*\*LoGeR\*\* 结合分块推理与测试时全局一致性优化。 这些方法主要通过额外的配准、优化或自适应阶段恢复全局一致性。该论文区别于上述方法,将局部到全局的分解直接嵌入学习到的流式预测器中,通过局部坐标系下的位姿预测、参考系等变架构、位姿链损失和仅依赖近期上下文的旋转精修,在不引入持久化学习长程记忆的前提下实现长程稳定性。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*ABot-Recon\*\* 模型,将超长视频流式三维重建重新表述为\*\*局部几何估计问题\*\*,并辅以专门的漂移抑制机制,从而在不依赖持久化长程记忆的前提下实现长程稳定性。具体解决方案包含以下核心组件: --- ### 1. 局部上下文公式化 \*\*核心原则\*\*:严格限制学习时间状态的范围,使预测目标与序列总长度无关。 - \*\*固定时间视界\*\*:模型仅操作于一个固定的 K 帧时间窗口(实现中 K=12 ),即对每一 incoming 帧 I_i ,仅关注当前帧及缓存的前 K-1=11 帧的键值(KV)特征。 - \*\*窗口化因果注意力\*\*:将全历史因果时间注意力替换为窗口化因果注意力。帧 I_i 的注意力上下文被限制为最近 K-1 帧的缓存状态:
M^((K))(j-1) = KV_i(i=max(0,j-K+1))^(j-1)
超出窗口的缓存状态被直接丢弃,从而使时间内存复杂度为 O(K) ,与序列长度无关。 - **局部坐标系预测**:对每帧 Ii ,模型预测: - 当前相机坐标系下的点图 P_i 及其置信度图 S_i ; - 相邻帧相对位姿 T(i-1 arrow i) 。 这些预测在参考系变换下保持一致(equivariant),不绑定于任何全局锚帧。全局相机轨迹通过在线顺序组合相邻变换得到:
T(i arrow j) = prod(k=i+1)^(j) T(k-1 arrow k)
—- ### 2. 运动-视觉上下文旋转精修器 (Rotation Refiner) 针对相邻帧位姿估计在快速运动或弱纹理条件下不可靠、且误差会在长程组合中累积的问题,论文引入了一个轻量级的因果旋转精修模块,仅精修旋转分量而保留平移。 - 双重证据提取: - 运动证据 f_m :从相邻帧相机 token 构建的成对运动描述符 q_i 经 MLP φ_m 编码得到; - 视觉证据 f_v :采用粗到细策略,先将稠密帧 token 平均池化为粗描述符 G(i-1), Gi ,再通过交叉注意力从原始稠密特征中检索细粒度空间信息。 - 证据融合与残差预测:将运动与视觉特征融合为成对表示 $f_i = φ(fuse)(
fm; f_v
)$,随后利用轻量级门控时间卷积网络(TCN)在因果窗口内聚合近期上下文:
δω_i = φ_o(T_h(W_i) odot σ(T_g(W_i)))
其中 $W_i =
f(i-K+1), dots, fi
, T_h 与 T_g 分别为特征聚合门控分支。 - 残差更新:预测得到的轴角残差 δω_i ∈ R^3$ 通过指数映射作用于初始旋转估计:
R(i-1 arrow i) = R(i-1 arrow i) · Exp([δω_i]×)
—- ### 3. 组合感知损失函数 (Composition-aware Loss) 为在训练阶段直接约束长程位姿组合的累积误差,论文提出多间隙相对位姿监督: - **监督范围**:不仅监督相邻帧变换,还监督在窗口内任意两帧 (i,j) (满足 0 ≤ i < j < N , j-i ≤ K-1 )之间的**组合变换**与其真值的偏差。 - **加权策略**:为强调更长组合链的误差,赋予每对帧与间隙长度相关的权重:
α(ij) = ((j-i)^γ) / (frac{1)|P|∑((m,n)∈P)(n-m)^γ}, quad 0 < γ < 1
- **位姿损失**:
L(pose) = (1) / (|mathcalP)|∑((i,j)∈P) (λ(trans)ell(trans)^((i,j)) + α(ij)λ(rot)ell_(rot)^((i,j)))- 平滑正则化:额外引入 L(smooth) 惩罚旋转残差的幅度及其时间变化,鼓励小幅且时序一致的修正。 此外,训练目标还包含点图损失 L(pts) 、表面法线损失 L(normal) 和置信度损失 L(conf) 。 —- ### 4. 渐进式训练策略 - 第一阶段:在 32 帧片段上训练,建立稳定的局部几何与相邻运动估计能力; - 第二阶段:将训练片段扩展至 128 帧,启用旋转精修器,并采用差异化学习率(精修器模块使用较大峰值学习率 5× 10^(-5) ,其余参数使用 2× 10^(-5) ),以在不破坏已学局部表示的前提下适配新模块; - 第三阶段:固定重建与位姿网络,仅对置信度分支进行 4K 次迭代的微调,使其学习预测稠密输出的可靠性。 —- ### 5. 可选回环闭合后端 由于模型输出的是局部几何测量流,其可无缝耦合标准的 SLAM 回环闭合模块(无需重新训练): - 使用 FAISS 基于 DINOv2-SALAD 描述符检索历史重访帧对; - 将重访帧对的局部窗口输入 ABot-Recon 估计相对位姿,作为回环约束; - 将顺序约束与回环约束纳入稀疏位姿图进行全局优化,进一步抑制累积漂移。 —- 综上所述,论文通过局部上下文窗口确保有界计算与内存,通过局部坐标系下的预测目标保持序列长度无关性,再通过运动-视觉旋转精修与组合感知监督从估计和优化两个层面抑制长程漂移,最终以极简的短上下文架构实现了超长视频流的稳定三维重建。 Q4: 论文做了哪些实验? 论文在多个具有挑战性的长序列基准上进行了系统评估,涵盖相机位姿估计、密集三维重建、运行效率、消融分析以及域外泛化验证。实验设置与主要结果如下: —- ### 1. 实验设置 训练数据:使用 30 个合成与真实数据集的混合(表 1),涵盖室内、室外、自动驾驶、手持拍摄与空中轨迹,合成与真实数据分别占采样分布的 62.05% 与 37.95%。 三阶段训练策略: - Stage I:32 帧片段,32K 次迭代,建立局部几何与相邻运动估计; - Stage II:128 帧片段,38K 次迭代,启用旋转精修器,采用差异学习率(精修器模块峰值学习率 5× 10^(-5) ,其余 2× 10^(-5) ); - Stage III:4K 次迭代,仅微调置信度分支。 推理模式:模型以因果、逐帧方式处理视频流,不依赖总帧数先验。可选地,通过 FAISS 检索 DINOv2-SALAD 描述符检测重访帧,并附加一个与训练无关的 SLAM 式回环闭合后端进行全局位姿图优化。 —- ### 2. 评估数据集与基线 评估数据集(表 2): | 任务 | 数据集 | 序列长度 | 场景特点 | |———|————|—————|—————| | 位姿估计 | KITTI | 271–4,661 帧 | 室外自动驾驶,千米尺度 | | 位姿估计 | Oxford Spires | 3,821–3,840 帧 | 地标尺度,手持/车载 | | 位姿估计 | VBR | 8,815–18,846 帧 | 城市场景,长序列 | | 密集重建 | 7Scenes | 500–1,000 帧 | 紧凑室内静态场景 | | 密集重建 | TUM-Dynamic | 707–1,261 帧 | 室内动态 RGB-D | | 密集重建 | Oxford Spires | 3,821–3,840 帧 | 大地标室外环境 | 对比基线: - 流式方法:LingBot-Map、HorizonStream、LongStream、InfiniteVGGT、OVGGT、CUT3R、TTT3R、Stream3R-w 等; - 优化/SLAM 方法:VGGT-SLAM、MASt3R-SLAM、VGGT-Long、DROID-SLAM、DPV-SLAM、DPVO、Droid-W 等(其中带 者需已知相机内参)。 评估指标: - 位姿:ATE(绝对轨迹误差 RMSE)、RPEr(相对旋转误差)、RPEt(相对平移误差),均通过 Umeyama Sim(3) 对齐; - 重建:Chamfer Distance (CD) 与 F1-score(阈值 0.25 m 或 4 m),经配准、体素化与 ICP 细化后计算。 —- ### 3. 相机位姿估计结果 #### KITTI(表 3) 在流式方法中,ABot-Recon 取得了最低的平均 ATE( 18.25 m)以及最优的相对位姿精度(RPEr 0.10^circ ,RPEt 0.10 m)。启用回环闭合后,平均 ATE 进一步降至 13.49 m。 #### Oxford Spires(表 4) ABot-Recon 将平均 ATE 降至 4.35 m,RPEr 降至 0.12^circ ,相对此前最优结果均降低约 40% 。在流式方法中,其 RPEr 与 RPEt 亦为最优。启用回环闭合后,ATE 进一步降至 4.02 m。部分基于优化的方法(如 DPV-SLAM、DPVO)ATE 更低,但这些方法需要相机内参作为输入。 #### VBR(表 5) 在包含更长、更多样化序列的 VBR 上,该方法在无回环时与 HorizonStream、LingBot-Map 具有竞争力的全局轨迹精度;启用回环闭合后,平均 ATE 降至 9.99 m,为所比较方法中最低。 #### 长程稳定性分析(图 6) - 运行误差演化:在 KITTI-02(4,661 帧)上,相邻帧 RPEr/RPEt 的运行 RMSE 始终维持在最低水平,且随处理帧数增加无渐进式退化,验证了局部预测目标与序列长度无关的特性; - 多间隙 RPE:在所有 KITTI 序列上,不同时间间隙下的平均旋转与平移误差增长最慢,表明组合感知监督有效抑制了长程漂移。 —- ### 4. 密集三维重建结果(表 7 与图 7) | 数据集 | CD (m) ↓ | F1 ( % ) ↑ | 备注 | |————|——————————-|———————————|———| | 7Scenes ( τ=0.25 m) | 0.06 | 94.88 | 与最强流式基线相当 | | TUM-Dynamic ( τ=0.25 m) | 0.11 | 92.19 | 动态场景下保持竞争力 | | Oxford Spires ( τ=4 m) | 1.37 | 91.81 | CD 最低、F1 最高 | 定性对比(图 7)显示,从紧凑室内到长程驾驶与地标尺度序列,该方法均能保持全局结构一致且局部几何对齐良好。 —- ### 5. 运行效率与内存(表 6) 在单张 NVIDIA H100 GPU 上,以 KITTI-02(4,661 帧)逐帧流式推理测试: - FPS: 24.45 帧/秒; - 峰值显存: 6.71 GB(不含输入存储)。 在逐帧流式设置下,其速度快于 LongStream、LingBot-Map 与 HorizonStream,且显存占用显著低于 LingBot-Map( 18.87 GB)与 HorizonStream( 13.04 GB)。 —- ### 6. 消融实验(表 8) 在 KITTI、Oxford 与 VBR 上进行的受控消融如下: | 配置 | KITTI ATE ↓ | Oxford ATE ↓ | VBR ATE ↓ | |———|————————————|————————————-|———————————| | 基线(32帧,无组合损失,无精修器) | 56.60 | 10.16 | 52.90 | | + 组合感知损失 | 27.66 | 9.40 | 44.72 | | + 长序列训练(128帧) | 22.31 | 5.95 | 36.77 | | + 旋转精修器(完整模型) | 18.25 | 4.35 | 30.14 | - 组合感知损失:相较仅监督相邻帧的基线,引入多间隙位姿组合监督后,三个数据集 ATE 均显著下降,验证了直接约束累积误差对抑制长程漂移的有效性; - 长序列训练:将训练片段从 32 帧扩展至 128 帧(保持局部预测窗口仍为 12 帧),ATE 进一步降低约 19% – 37% ,表明更长的时序连续监督有利于提升局部估计的组合一致性; - 旋转精修器:仅增加 4.75 M 参数(约占模型 0.48% ),ATE 在三个数据集上分别再降低 18.2% 、 26.9% 、 18.0%,证明运动-视觉上下文能有效修正不可靠的局部旋转估计。 —- ### 7. 补充泛化验证(附录 C) 论文还在无真值轨迹的长视频上进行了定性评估: - 四足机器人低视角导航(图 11):相机近地面、地面占据大部分视野,与训练分布差异显著,该方法仍较基线保持更连贯的轨迹; - 大规模真实世界序列(图 12): Q5: 有什么可以进一步探索的点? 基于论文讨论(Section 5)与方法层面的观察,以下几个方面可作为后续研究的重要探索方向: ### 1. 动态场景下的鲁棒重建 当前模型主要针对静态或准静态场景设计。当视频中出现显著运动的动态物体时,局部几何与运动估计可能受到干扰。后续可探索如何将动态物体掩码或运动分割集成到局部流式重建框架中,或借鉴 Easi3R 等工作的动态解耦策略,使模型在保持局部上下文有界性的同时,对场景动态具有鲁棒性。 ### 2. 混合外部记忆机制 论文观察到,在空间受限、频繁重访且视觉重叠高的紧凑室内场景中,持久化几何上下文仍具价值。因此,一个值得探索的方向是:在不破坏局部上下文有界性的前提下,选择性地引入外部记忆。例如,仅在检测到场景重访或关键帧时,以稀疏、可遗忘的方式存储几何摘要,而非维护全序列的密集状态。这与 LoGeR、AMB3R 等外部记忆方法形成互补,或可结合 fast-weight memory 机制实现常数级内存开销下的场景级信息检索。 ### 3. 更大规模的预训练 当前模型已在 30 个数据集上训练,但论文指出,通过更大规模的预训练(如 VGGT-Omega、Depth Anything 3 等范式)可进一步提升几何先验的泛化能力与特征表示质量。探索在十亿级参数或海量视频数据上预训练局部流式重建骨干,可能会显著改善在域外分布(如低视角机器人导航)上的零样本表现。 ### 4. 选择性长程约束机制 虽然模型仅依赖局部上下文即可在多数长序列上保持低漂移,但在局部时间连续性暂时中断的情况下(如剧烈遮挡、快速旋转导致弱纹理、光照突变),相邻帧估计可能变得模糊。此时,可探索基于不确定性的选择性长程注意力:当局部匹配置信度低于阈值时,自动触发对历史关键帧的稀疏查询,以提供全局锚定而不引入常规的长程状态维护开销。 ### 5. 自适应局部窗口与平移精修 当前模型采用固定的 K=12 帧时间视界,且旋转精修器仅作用于旋转分量。未来可研究: - 自适应窗口大小:根据相机运动速度、场景纹理丰富度动态调整局部上下文长度,在快速运动场景扩展窗口以捕获更多视觉证据,在慢速运动时缩小窗口以降低计算; - 平移分量精修:当前假设相邻帧平移较稳定,但在高速运动或尺度模糊场景中,探索运动-视觉上下文对平移的残差修正可能进一步降低长程漂移。 ### 6. 下游任务与跨模态融合 论文指出,局部流式重建的模块化设计使其易于扩展至多个下游领域: - 长程具身感知:将 ABot-Recon 作为视觉前端,为视觉-语言-动作(VLA)模型或世界模型(如 Cosmos 3、OpenVLA)提供实时 3D 场景 token; - 3D 视觉语言模型(3D-VLM):结合 G2VLM、VLM-3R 等工作,使流式重建的输出直接支持 3D 空间推理与指令跟随; - 3D 生成与世界建模:将局部几何测量作为结构化潜码输入 3D 生成模型(如 GS-Voxel、Gen3R)或自回归几何世界模型(如 VGGT-World),实现从观测到场景生成的闭环。 ### 7. 推理效率与硬件协同优化 尽管当前模型已实现 24.45 FPS 与 6.71 GB 显存,但在边缘设备部署时仍有优化空间。未来可结合更激进的缓存压缩(如 STAC)、量化和分页 KV 缓存的硬件级优化,进一步降低功耗与延迟,使其适用于资源受限的机器人或 AR 眼镜平台。 Q6: 总结一下论文的主要内容 该论文针对超长视频流的在线三维重建与相机跟踪问题,提出了一种严格局部的重建范式,并基于此实现了高效、低漂移的流式推理。以下从问题背景、核心方法、关键技术、实验验证与主要贡献五个方面进行总结。 —- ### 1. 研究背景与核心问题 从极长视频流中因果地恢复相机运动与密集场景几何,是机器人、自动驾驶与具身智能的基础能力。现有流式重建方法多依赖持久化长程记忆(如空间记忆、循环状态、多级缓存等)来维持长时稳定性,但这使得历史状态的管理、压缩与融合成为架构设计的核心负担。此外,当预测目标被定义在相对于遥远锚帧的全局坐标系中时,其估计范围随序列长度不断增加,导致回归任务持续变难。 —- ### 2. 核心思想:局部上下文公式化 论文提出将长程流式重建重新表述为局部几何估计问题,核心原则包括: - 严格有界的时间上下文:模型仅使用固定长度的局部窗口(当前帧加前 11 帧的 KV 缓存,共 K=12 帧),不维护任何持久化的学习长程状态; - 局部参考系下的预测目标:每帧预测当前相机坐标系下的点图 Pi 、置信度图 S_i 以及相邻帧相对位姿 T(i-1arrow i) 。这些目标与序列总长度无关,具有参考系等变性; - 全局增量组装:全局轨迹通过在线顺序组合相邻位姿恢复, T(iarrow j) = prod(k=i+1)^(j) T_(k-1arrow k) ,局部点图相应变换到全局坐标系。 该设计使模型内存与每帧计算量与序列长度无关,且可在短片段上训练后直接推广至超长视频流。 —- ### 3. 关键技术:抑制长程漂移 仅靠局部相邻帧预测仍会因误差累积导致长程漂移。论文从估计与监督两个层面加以抑制: #### (1) 运动–视觉上下文旋转精修器 针对相邻帧旋转估计不可靠的问题,设计了一个轻量级因果模块: - 双重证据:从相机 token 提取运动证据 f_m ,并通过粗到细的交叉注意力从稠密帧 token 提取视觉证据 f_v ; - 时序聚合:在固定因果窗口内,使用门控时间卷积网络(TCN)融合近期运动–视觉上下文,预测旋转残差 δω_i ; - *残差更新: R(i-1arrow i) = R(i-1arrow i) · Exp(
δωi ×) ,仅精修旋转而保留平移。 该模块仅增加约 4.75 M 参数(占模型 0.48% ),但显著降低长程轨迹漂移。 #### (2) 组合感知位姿损失 改变仅监督相邻帧位姿的做法,直接监督多步组合后的位姿: - 对窗口内所有满足 j-i ≤ K-1 的帧对 (i,j) ,将其组合变换 T(iarrow j) 与真值比较; - 采用与间隙长度相关的权重 α(ij) propto (j-i)^γ 以强调长间隙累积误差; - 配合平滑正则化 L_(smooth) 约束残差幅度与时序一致性。 —- ### 4. 训练与推理策略 - 渐进式三阶段训练: 1. Stage I:32 帧片段训练,建立局部几何与相邻运动估计; 2. Stage II:扩展至 128 帧片段,启用旋转精修器,采用差异学习率(精修器 5× 10^(-5) ,其余 2× 10^(-5) ); 3. Stage III:固定主体网络,仅微调置信度分支进行可靠性校准。 - 推理:逐帧因果流式处理,使用 FlashInfer 分页 KV 缓存加速。可选地,通过 FAISS 检索 DINOv2-SALAD 描述符检测重访帧,附加一个与训练无关的 SLAM 式回环闭合后端进行全局位姿图优化。 —- ### 5. 实验验证 在多个长序列基准上进行评估,结果如下: | 基准 | 主要结果(无回环) | 对比优势 | |———|—————————-|—————| | KITTI | ATE 18.25 m, RPEr 0.10^circ | 流式方法中最低 ATE 与最优相对位姿精度 | | Oxford Spires | ATE 4.35 m, RPEr 0.12^circ | 较此前最优结果降低约 40% | | VBR | ATE 30.14 m | 启用回环后降至 9.99 m,为所有对比方法最低 | | 7Scenes / TUM-Dynamic | 有竞争力的 CD 与 F1 | 无需全局记忆即可匹敌室内基线 | | Oxford Spires 重建 | CD 1.37 m, F1 91.81% | 流式方法中最优 | 效率:在 NVIDIA H100 上,逐帧流式推理达 24.45 FPS,峰值显存仅 6.71$ GB,显著低于 LingBot-Map 与 HorizonStream。 消融实验表明,组合感知损失、长序列训练与旋转精修器均能显著降低 ATE,三者逐步叠加后实现最终性能。 —- ### 6. 主要贡献 - 局部上下文公式化:建立了预测目标局部化、估计范围固定化的超长流式重建范式,摆脱了对复杂长程记忆管理的依赖; - ABot-Recon 架构:一种极简的流式模型,仅在 12 帧时间视界内操作,通过参考系一致的局部预测与在线组合实现全局恢复; - 漂移抑制机制:轻量级运动–视觉旋转精修器与组合感知位姿监督,从估计与优化双层面抑制长程误差累积; - SOTA 性能与效率:在 KITTI、Oxford Spires、VBR 等长序列基准上取得优越的跟踪与重建精度,同时保持有界的内存与计算开销。 该工作表明:持久化的学习长程记忆并非超长流式重建的必要条件——只要局部预测被恰当地公式化以确保准确且可可靠组合,短上下文模型即可有效扩展至超长时空范围。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27529.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27529
Published: 2026-09-01T02:05:36.367Z
3. Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning
Abstract:Physical understanding and reasoning depend on forming compact and generalizable representations of the world. While modern vision-language models can recognize and explain diverse physical events, they often lack explicit representations of the underlying mechanisms-such as object states, physical parameters, and governing dynamics-needed for reliably reasoning how the world evolves and responds to interventions. In this work, we introduce Code-as-World, a paradigm that represents physical worlds through executable world representations. By expressing physical composition, dynamic evolution, and visual appearance as executable code, Code-as-World provides a compact, quantitatively grounded, and controllable abstraction of the physical world. To construct such representations from multimodal observations, such as natural-language descriptions or real-world videos, we develop an agentic discovery loop inspired by abductive reasoning, where an agent proposes, executes, renders, verifies, and iteratively refines executable world hypotheses. As a concrete application, we use verified executable worlds to provide scalable physical supervision for training vision-language models on quantitative physical reasoning. Experiments show that Code-as-World-VL achieves state-of-the-art performance on QuantiPhy and surpasses leading proprietary models, highlighting the potential of executable world representations as a scalable foundation for physical intelligence.
中文摘要
摘要:物理理解和推理依赖于形成紧凑且可泛化的世界表征。虽然现代视觉-语言模型可以识别和解释各种物理事件,但它们通常缺乏对底层机制的明确表征——例如物体状态、物理参数和支配动力学——而这些是可靠推理世界如何演变及如何响应干预所必需的。在本工作中,我们引入了“Code-as-World”这一范式,通过可执行的世界表征来表示物理世界。通过将物理组成、动态演化和视觉外观表示为可执行代码,Code-as-World 提供了一种紧凑、定量基础且可控的物理世界抽象。为了从多模态观测(如自然语言描述或真实世界视频)构建此类表征,我们开发了受溯因推理启发的主动发现循环,其中代理提出、执行、渲染、验证并迭代地改进可执行的世界假设。作为具体应用,我们使用验证过的可执行世界为训练视觉-语言模型进行定量物理推理提供可扩展的物理监督。实验表明,Code-as-World-VL 在 QuantiPhy 数据集上实现了最先进的性能,并超越了主要的专有模型,凸显了可执行世界表征作为物理智能可扩展基础的潜力。
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决现代人工智能系统在物理理解与推理中的\*\*根本性表示危机\*\*,即现有模型(特别是视觉-语言模型)能够识别和描述物理现象,但缺乏对驱动这些现象的底层物理机制的显式、可执行且可泛化的表示。具体而言,论文围绕以下四个相互关联的核心问题展开: ### 1. 现象与机制的鸿沟(Phenomenon–Mechanism Dichotomy) 现有视觉-语言模型擅长回答“发生了什么”,但无法可靠地推理“为什么发生”以及“在干预下会发生什么”。论文指出,物理智能需要超越表面观测,显式捕捉\*\*物体状态、物理参数、动力学规律\*\*以及系统对干预的响应。缺乏这种机制层面的表示,模型无法真正理解世界的演化逻辑。 ### 2. 现有世界表示范式的互补性缺陷 论文系统分析了三种主流物理世界表示的固有局限: - \*\*像素级表示\*\*:保留丰富的视觉细节,但缺乏显式结构,无法区分观测变化的因果来源(例如相机运动与物体运动、遮挡与消失),导致物理上正确与视觉上合理的未来预测被混淆。 - \*\*三维重建\*\*:保留几何结构,但重建本身不揭示物理机制;知道物体的形状并不能解释它为何下落或如何与其他物体交互。 - \*\*自然语言\*\*:提供紧凑、可组合语义,但难以精确编码连续量(如轨迹、接触关系、质量、摩擦系数等物理参数)。 这些表示各自捕获了物理世界的重要方面,但均未能同时支持\*\*语义理解、结构组合与时序预测\*\*的整合。 ### 3. 从部分、异构观测中逆向发现可执行世界表示 从文本描述或真实视频等不完整、多模态的观测中恢复物理机制,本质上是一个\*\*逆问题\*\*。论文将这一过程形式化为一个受溯因推理启发的智能体发现循环,解决如何迭代地提出、执行、渲染、验证并修正可执行世界假设,以搜索与观测证据在物理上等价的最简解释。 ### 4. 定量物理推理的可扩展监督稀缺 在定量物理推理任务(如从单目视频中推断物体真实大小、位移、速度、加速度)中,真实世界视频几乎不提供底层物理量的标注。这导致训练数据难以大规模获取。论文通过构建\*\*可验证的可执行世界\*\*(Verified Executable Worlds),将物理状态与轨迹作为显式信号导出,从而为视觉-语言模型提供可扩展的、 grounded 的物理监督。 --- 通过引入 \*\*Code-as-World\*\* 范式,论文将上述问题统一到一个框架下:用可执行代码显式表示物理组成、动态演化与视觉外观,并通过\*\*智能体发现循环\*\*从多模态证据中重建这些表示,最终将其作为物理监督来源,训练出能够进行可靠定量物理推理的模型。 Q2: 有哪些相关研究? 根据论文第2节、第6节及相关章节的综述,现有研究主要围绕以下四个层面展开: ### 1. 物理理解与推理(Physical Understanding and Reasoning) 该领域关注模型如何从视觉输入中恢复物理结构、属性与动力学,可细分为: - \*\*空间推理\*\*:研究如何从视觉观测中恢复几何结构及物体间空间关系,如多模态大语言模型的空间认知研究
75, 76, 77
。 - **物理问答与定量推理**:评估模型对物体属性、交互及可测量物理量的理解能力,包括 CLEVRER
9
、PhysBench
10
、QuantiPhy
11
、PAI-Bench
23
及机械推理探测
12, 78
等工作。 - **直觉物理(Intuitive Physics)**:检验模型是否具备类似人类的物体恒存性、动力学期望与物理合理性判断,如 IntPhys
79
与 IntPhys 2
80
。 - **交互式与具身物理智能**:研究智能体能否通过动作与干预将物理知识应用于新任务求解,代表工作包括 PHYRE
1
、Phy-Q
82
、DeepPHY
81
、From Perception to Action
83
及 Apple-PI
84
。 ### 2. 世界表示的不同范式(Representations of the Physical World) 论文系统对比了三种互补但各有缺陷的物理世界表示路径: - **像素级与视频生成表示**:直接通过视觉观测预测未来帧,如 Video Generation Models as World Simulators
15
、Seedance 2.0
16
、iVideoGPT
24
、Vid2World
25
及 HarnessEval-W
26
。然而,仅优化像素预测无法保证模型显式区分相机运动与物体运动、遮挡与消失等因果因素
27, 28
。 - **三维重建与逆图形学**:通过恢复几何、视角与外观来约束信息保持,包括 NeRF
29
、3D Gaussian Splatting
30
、DUSt3R
31
、VGGT
32
、逆图形学/神经反射分解
33, 34, 35, 36
,以及动态场景表示如 D-NeRF
37
、HyperNeRF
38
与 4D Gaussian Splatting
39, 40, 41, 42
。此类方法保留了几何结构,但重建本身不自动揭示驱动观测的物理机制。 - **自然语言表示**:利用标题、描述或推理轨迹捕获高层语义概念,如 CLIP
19
、LLaVA
20, 71
、Semantic World Models
43
、Planning with Reasoning using VLM World Model
44
及 VISTA
45
。语言擅长语义抽象,但难以精确编码连续物理状态、轨迹与接触关系。 ### 3. 代码作为可执行世界表示(Code as World Representations) 近年来,代码逐渐被探索为可执行世界的结构化媒介: - **虚拟环境与交互智能体**:代码作为可执行引擎用于交互式代理环境,支持生成、修改与评估,如 Code World Models for General Game Playing
85
、Executable World Models for ARC-AGI-3
86
及 WorldCoder
87
。 - **静态3D资产生成**:在对象级别研究通过代码生成三维资产与程序化物体,如 VoxelCodeBench
88
与 3DCodeBench
89
;在场景级别,使用程序化描述室内与可编辑三维场景,如 Scene Language
90
、SceneCode
91
、Code-as-Room
92
及 Vision-as-Inverse-Graphics Agent
93
。 - **物理动态与仿真**:将代码驱动表示扩展至物理动力学,通过可执行模拟与物理感知推理重建视频,如 VisPhyWorld
94
、MPMWorlds
95
及 PhysCodeBench
96
。这些工作未解决如何从真实世界观测中抽象物理机制并构建可执行表示的逆问题。 ### 4. 智能体优化与自动发现(Agentic Optimization and Discovery) 该方向探索智能体如何通过迭代提出、评估与修正外部人工制品来自主发现更优解: - **代码智能体与算法发现**:如 AlphaEvolve
22
,通过进化搜索与自动评估发现改进算法。 - **机器人技能发现**:如 ASPIRE
98
,自动发现可复用的机器人技能。 - **自动化实验与视觉环境重建**:如 autoresearch
97
,以及将视觉环境表示为可执行代码的工作
91, 93
。 ### 5. 支撑技术与基础工具 在实现层面,论文还引用了多项用于证据提取、仿真与训练的基础技术: - **视觉处理**:SAM3
49
用于实例分割与跟踪,VGGT-Omega
50
用于深度与相机几何估计,SAM3D
47
用于对象网格生成。 - **物理引擎**:MuJoCo
115
作为核心仿真后端。 - **强化学习优化**:Group Relative Policy Optimization (GRPO)
56, 57
用于世界空间问答训练。 - **视频生成**:Wan2.2-VACE
116, 117
用于 sim-to-real 视觉增强。 - **数据集与基准**:RefCOCO
54
、GOT-10K
74
、WISA-80K
48
及 QuantiPhy
11
。 Q3: 论文如何解决这个问题? 论文通过提出 **Code-as-World** 范式,将物理世界的任务相关结构编码为**可执行代码**,并配合一个受溯因推理启发的**智能体发现循环**,系统性地解决了物理表示与推理中的核心难题。整体方案可分为三个相互支撑的层次: —- ### 1. 可执行世界表示:以代码统一物理组成、动态演化与视觉外观 论文将物理世界表示为一个可执行世界表示(Executable World Representation, EWR),其概念形式为:
p = (C, E, A) ∈ P(exec)
其中 P(exec) 为有效可执行世界空间,三个组件分别承担以下职能: - **物理组成(Physical Composition, C )**:定义世界中存在的实体及其相对稳定的物理属性。包括对象的编号、几何形状、尺寸、质量、摩擦系数、弹性,以及作为静态实体参与支撑、接触与碰撞的环境结构(如地面、墙壁)。该组件确立了物理过程的参与者与基本条件。 - **动态演化(Dynamic Evolution, E )**:描述世界如何随时间展开。涵盖初始状态、时间变化、关键事件及模拟时长。给定 E ,可将世界组成展开为完整的状态轨迹 τ ,在执行过程中显式记录接触、碰撞、速度变化与终止条件。 - **视觉外观(Visual Appearance, A )**:描述物理世界如何被观测与呈现。包括相机参数、背景、材质、光照、输出帧率、分辨率及渲染配置。该组件不改变底层物理过程,仅决定物理轨迹的视觉呈现方式。 这一表示将**生成观测的结构化状态**(用于组合式推理与显式约束)与**连续外观**(保留丰富视觉细节)分离,既具备语言般的语义组合性,又具备三维重建般的结构显式性,还能像生成模型一样建模时序演化。 —- ### 2. 智能体发现循环:从多模态证据中逆向构建可执行世界 由于从部分、异构观测中恢复物理机制是本质上的逆问题,论文将世界表示构建形式化为一个**智能体发现过程**,而非一次性预测问题。核心是一个五阶段的迭代循环: **I. 提出(Propose)** 智能体基于输入证据 xi (文本描述或真实视频)及上一轮的结构化反馈 Delta ,提出或更新 EWR 假设 p = (C, E, A) 。 **II. 实例化(Instantiate)** 将 EWR 编译为特定物理引擎(如 MuJoCo)的仿真就绪参数 θ 。 **III. 执行(Execute)** 在物理引擎中运行仿真,产生完整的世界状态轨迹 τ ,显式记录每个时间步的对象状态、接触、碰撞与事件结果。 **IV. 渲染(Render)** 将 τ 渲染为预测的视觉观测 X 。对于视频输入,进一步将模拟状态投影为深度图 D 、实例掩码 M 与图像平面轨迹 Q 。 **V. 验证(Verify)** 在选定的关键帧上,将预测观测与输入证据进行比较: - **文本输入**:主要验证语义与物理约束; - **视频输入**:联合比较 RGB 外观、深度、掩码与轨迹。 差异被聚合成结构化反馈 Delta ,指导智能体在下一轮中局部修正相关组件。循环在假设足够简洁且能充分解释证据时终止,或在迭代预算耗尽时拒绝该假设。 这一循环的关键优势在于: - **可验证性**:每个假设都是可执行、可渲染、可对比的; - **外化机制**:物理机制不再隐含于神经网络权重,而是外化为可查询、可干预、可复用的代码接口; - **计算效率**:与独立采样(Best-of-5)相比,迭代修正能在相同的评估预算下更有效地利用计算资源。 —- ### 3. 应用:以可验证世界为监督,训练定量物理推理模型 为解决真实世界视频中物理量标注稀缺的瓶颈,论文将验证后的可执行世界作为**可扩展的物理监督源**,用于训练视觉-语言模型进行**定量物理推理**。 #### 3.1 训练流程:两阶段课程学习 **第一阶段:图像空间测量定位(Image-Space Measurement Grounding)** 利用现有视觉数据集的边界框、掩码与轨迹,构建像素级问答监督。对于轨迹 ct(t=1)^(T) ,位移、速度与加速度通过中心差分计算:
d = c(t_2) - c(t1), quad v_t = c(t+1) - c(t-1)2Delta t, quad a_t = c(t+1) - 2ct + c(t-1)Delta t^2
通过监督微调,使模型掌握目标定位、测量与跟踪能力,为后续世界空间推理奠定感知基础。 **第二阶段:世界空间物理校准(World-Space Physical Calibration)** 从验证后的 EWR 中直接读取对象几何、相机参数、时间戳与物理状态,生成带有精确世界空间标签的问答对。对于世界空间查询,利用已知参考量 rho 及其像素测量 rho(πx) 估计尺度:
γ = (rho) / (rho(textpix)), quad y = γ y(πx)
训练数据包含文本驱动与视频驱动两类可执行世界,分别提供**完全可观测的精确物理监督**与**贴近真实观测分布的视觉泛化信号**。论文采用 Group Relative Policy Optimization(GRPO)进行优化,奖励函数融合数值精度、单位正确性与格式规范性:
r(num) = exp(-|haty - y||y| + ε), quad r = r(num) + λ_u r(unit) + λf r(fmt)
3.2 推理扩展:显式思维链 为进一步提升推理能力,论文还训练了规模更大的 Code-as-World-VL-27B(Reasoning)变体。该模型在输出最终答案前生成显式的推理轨迹,包括图像空间测量、深度与透视解析、世界空间尺度校准等步骤,从而实现类似 System-2 的审慎物理推理。 —- ### 4. 实证验证与可扩展性 论文通过以下实验验证了方案的有效性: - **可执行世界重建质量**:在视频驱动的世界抽象任务中,智能体发现循环在视觉对齐(Visual Alignment)、物体 IoU(Object IoU)、轨迹平均位移误差(Traj-ADE)与精度(Accuracy@2\%D)等指标上随迭代轮次持续提升,且在匹配预算下优于独立采样基线。 - **Sim-to-Real 一致性**:对文本驱动的可执行世界进行视频生成增强后,生成的视频在分布真实感(JEDi、TRAJAN)上显著接近真实视频分布,同时保持与仿真器地面真值轨迹一致的运动保真度。 - **定量物理推理性能**:Code-as-World-VL 在 QuantiPhy 基准上取得 state-of-the-art 表现。其中 4B 与 9B 直接回答模型超越多数更大规模的开源与闭源模型;27B 推理模型进一步达到最佳平均性能,展示了可执行世界监督在不同模型规模上的可扩展性。 —- ### 总结 论文的解决路径可概括为:**用代码显式编码物理机制,用智能体循环从观测中逆向发现这些机制,再用验证后的机制生成可扩展的物理监督,最终训练出能够进行可靠定量物理推理的视觉-语言模型**。这一路径将表示、发现与学习三个环节统一在可执行代码的框架下,使物理智能从“描述现象”迈向“掌握机制”。 Q4: 论文做了哪些实验? 论文的实验围绕**可执行世界表示的构建质量**与**下游定量物理推理性能**两大主线展开,具体可分为以下四个部分: —- ### 1. 智能体发现循环的有效性评估(Agentic Discovery Loop) 该部分验证从文本或真实视频中迭代恢复可执行世界表示(EWR)的能力。 #### 1.1 实验设置 - **数据来源**: - **文本驱动**:由大语言模型生成并经人工审核的语言描述。 - **视频驱动**:从 WISA-80K 中经运动过滤、人工筛选后保留的刚性体运动与碰撞视频片段。 - **处理工具链**:SAM3 提取实例掩码与轨迹,VGGT-Omega 估计深度与相机几何,SAM3D 生成对象网格。 - **仿真后端**:MuJoCo 物理引擎(支持动画引擎与物理引擎两种模式)。 #### 1.2 评估指标 - **Visual Alignment**:综合轮廓 IoU、中值相对深度误差与归一化 RGB 误差的全局视觉对齐度。 - **Object IoU**:对象级别的掩码重叠率。 - **Traj-ADE**:图像平面中心轨迹的平均位移误差(以帧对角线 D 的百分比表示)。 - **Velocity-ADE**:帧间速度的平均位移误差(以 %D/step 表示)。 - **Accuracy@2\%D**:轨迹点落入真实位置 0.02D 范围内的比例。 #### 1.3 主要实验 - **迭代优化趋势**:设置最大迭代轮数 K=5 ,逐轮记录上述指标。结果显示,随着迭代进行,静态质量与运动保真度整体提升。 - **与独立采样对比**:在匹配的 5 次评估预算下,智能体发现循环在 Visual Alignment、Object IoU、Traj-ADE 和 Accuracy@2\%D 上优于 Best-of-5 独立采样基线,证明迭代修正比独立采样更高效。 - **跨引擎验证**(Appendix C.2):将上述实验从动画引擎替换为物理引擎重复,发现迭代优化趋势与对比结论保持一致。 —- ### 2. 可执行世界的可控生成与 Sim-to-Real 评估 该部分验证 EWR 作为可控生成基础的有效性,以及文本驱动场景经视频生成增强后的真实感与物理一致性。 #### 2.1 定性分析 - **文本到仿真到真实视频**:展示从文本描述生成的仿真帧与经视频生成模型增强后的最终帧(Figure 6),验证语义描述到物理演化再到视觉真实感的映射。 - **视频到仿真抽象**:展示输入真实视频与重建的仿真 rollout 的帧级对齐(Figure 7),验证从真实观测恢复物理机制的能力。 - **可控重仿真**:通过修改初始速度方向、相机配置或物理参数(如质量),生成保持物理一致性的反事实视频(Figure 4)。 #### 2.2 Sim-to-Real 定量评估(Appendix C.1) 对比**纯仿真渲染**与**经视频生成增强后的 sim-to-real 视频**: - **分布真实感**:以 JEDi(基于 V-JEPA 特征的 MMD)和 TRAJAN(基于轨迹特征的 Fréchet 距离)衡量与真实视频分布的距离。Sim-to-real 视频在这两项指标上显著更接近真实分布。 - **运动保真度**:以 Traj-ADE、Velocity-ADE 与 Accuracy@2\%D 对比 CoTracker 估计轨迹与仿真器地面真值。Sim-to-real 视频在提升视觉真实感的同时,保持了与原始仿真渲染相当的运动一致性。 —- ### 3. 图像空间测量定位评估(Image-Space Measurement Grounding) 该部分评估模型在像素级别进行目标定位与测量的基础能力,作为后续世界空间推理的感知前提。 #### 3.1 数据集与指标 在四个指代表达数据集(RefCOCO、RefCOCO+、RefCOCOg、RefCLEF)与一个视频跟踪数据集(GOT-10K)上评估。指标为 Mean Relative Accuracy(MRA),针对像素级的长度、位移、速度、加速度与边界框坐标。 #### 3.2 主要结果 - **两阶段提升**:仅经第一阶段(Image-Space 监督)的 4B 与 9B 模型已展现出较强的像素测量能力;加入第二阶段世界空间监督后,完整模型在所有五个基准上均进一步提升。 - **与开源模型对比**:Code-as-World-VL-4B/9B 在多个基准上优于 Qwen3-VL、InternVL、MiniCPM-V 等更大或同规模的开源模型(Table 3)。 —- ### 4. 定量物理推理评估(Quantitative Physical Reasoning) 这是论文的核心下游实验,评估模型在 QuantiPhy 验证集上推断真实世界物理量的能力。 #### 4.1 实验设置 - **任务定义**:给定单目视频 V 与定量问题 q (如速度、加速度、尺寸),模型预测标量答案 y = f_θ(V, q) ∈ R 。世界空间问题需利用已知参考量进行尺度校准:
γ = (rho) / (rho(textpix)), quad y = γ y(πx)
- **模型变体**: - **Code-as-World-VL-4B/9B**:直接回答模型,经图像空间 SFT 与可执行世界 GRPO 两阶段训练。 - **Code-as-World-VL-27B (Reasoning)**:推理模型,在输出最终答案前生成显式思维链(Image-Space 测量 → 世界空间校准)。 #### 4.2 评估协议与指标 - **基准**:QuantiPhy-validation(159 个问题),按空间维度(2D/3D)与先验类型(静态 S / 动态 D)分为 2S、2D、3S、3D 四个子集。 - **指标**:Mean Relative Accuracy(MRA),计算预测值在多个相对误差阈值下的平均通过率。 #### 4.3 主要结果 - **直接回答模型**: - 4B 模型平均 MRA 达到 50.6%,显著优于同规模及更大规模的开源模型(如 Qwen3-VL-32B 的 40.2%),并与 Gemini-3.1-Flash 等领先闭源模型持平。 - 9B 模型进一步提升至 55.4%,在直接回答变体中取得最佳平均性能,且在四个子集上表现均衡。 - **推理模型**:27B 推理变体达到 58.6%,超越所有评估基线(包括 Gemini-3.1-Flash、ChatGPT-5.1、Gemini-2.5 Pro 等),展示了可执行世界监督在更大规模推理模型上的可扩展性(Table 1 与 Figure 9)。 #### 4.4 消融实验(Appendix C.4) 在 4B 与 9B 模型上消融三阶段数据来源: - **仅图像空间( D(πx) )**:基线性能。 - **+ 文本驱动世界( D(text) )**:利用完全可观测的精确仿真状态,提升物理一致性。 - **+ 视频驱动世界( D(video) )**:利用真实视频分布,提升视觉泛化。 - **完整模型( D(πx) + D(text) + D(video) )**:取得最佳平均 MRA,证明精确仿真监督与真实视频分布监督具有互补性(Table 4)。 —- ### 实验总结 | 实验类别 | 核心目的 | 关键结论 | |:—-|:—-|:—-| | 智能体发现循环 | 验证 EWR 从多模态证据中重建的保真度 | 迭代修正优于独立采样,且跨物理引擎稳定 | | Sim-to-Real 生成 | 验证 EWR 作为可控真实视频生成基础的能力 | 视频增强提升真实感,同时保持物理轨迹一致 | | 图像空间测量 | 验证模型的基础视觉定位与测量能力 | 两阶段训练相互促进,像素级 grounding 可靠 | | 定量物理推理 | 验证可执行世界监督对 VLM 物理推理的增益 | Code-as-World-VL 在 QuantiPhy 上达到 SOTA,4B/9B/27B 均展现强扩展性 | Q5: 有什么可以进一步探索的点? 基于论文第 4.4 节、第 5.5 节、第 7 节及附录中的讨论,可进一步探索的方向主要包括以下六个方面: —- ### 1. 扩展至更广泛的物理现象与模拟器生态 当前实现主要聚焦于**刚体动力学**,但 Code-as-World 范式并不绑定于特定物理领域。代码具备成为通用接口的潜力,可连接流体(如 Stable fluids)、布料与可变形体、燃烧、断裂、弹性与塑性、气体动力学等领域的专业模拟器。 进一步的工作需解决: - 如何让编码智能体学会**正确调用并组合多种异构模拟引擎**; - 如何在不同物理领域中设计相应的**证据提取与验证机制**,使发现过程能够从观测中诊断出适用何种物理规律,并验证候选世界的一致性。 —- ### 2. 将智能体发现循环内化为模型的原生能力 目前的 Code-as-World-VL 仅从**验证后的可执行世界结果**中学习监督,而**假设构建、仿真执行、差异诊断与迭代修正**整个过程仍外在于模型。换言之,模型接受的是“发现后的产物”,而非“发现过程本身”。 未来的重要方向是使视觉-语言模型具备**原生的世界发现能力**:让模型能够自主提出可执行世界假设、在内部或工具化的仿真环境中执行、渲染、验证观测差异,并据此修订自身表示,从而形成端到端的物理推理与发现闭环。 —- ### 3. 从稀疏问答监督迈向通用且可验证的物理推理 QuantiPhy 仅覆盖了物理理解的一个有限子集(单目尺度校准下的尺寸、位移、速度、加速度),且任务形式为相对受控的运动设定。自然场景还涉及相机运动、旋转、形变、遮挡、接触、碰撞、摩擦、长程多物体交互等复杂因素。 利用 EWR 提供的结构化实体、状态、关系与动力学信息,未来可探索更丰富的训练目标: - **实体定位与关系推断**:超越数值问答,监督模型识别物体身份、支撑关系与接触拓扑; - **反事实交互模拟**:让模型基于当前世界表示预测“如果施加某干预会怎样”; - **对自身推理的显式验证**:模型可将其推理链与世界状态对比,修正逻辑错误,而非仅依赖最终答案的稀疏奖励。 —- ### 4. 物理一致的长程视频生成 可执行世界表示可将**持久的结构化状态**(物体身份、几何、轨迹)提供给视频生成器,而将世界动力学与视觉渲染解耦。这为解决当前视频生成模型在长程一致性、物体恒存性与物理合理性方面的不足提供了新路径。 未来可探索: - 基于 EWR 的**长程物理一致视频合成**,避免纯像素预测中的因果混淆; - **可控干预式生成**:通过编辑代码层面的物理参数或初始条件,直接生成反事实视频,无需为每个变体重建完整场景。 —- ### 5. 审慎式具身交互(Deliberate Embodied Intelligence) EWR 可作为连接被动观测、模拟环境与真实世界交互的**共享抽象层**。这为发展类似 System-2 的具身智能提供了可能:智能体在行动前显式构建世界模型,推理多种未来轨迹,并审慎选择最优动作,而非仅依赖反应式策略。 其潜在价值包括: - 将在模拟中习得的物理知识**零样本或少样本迁移**到真实机器人操作; - 支持可扩展的具身学习,降低对昂贵真实世界交互数据的依赖。 —- ### 6. 提升真实世界复杂场景的重建鲁棒性与机制准确性 真实环境对微小扰动高度敏感(如地形不平、接触几何细节、材料属性变化),而当前模拟器难以完全刻画这些潜在因素。当底层物理过程超出模拟器建模范围时,发现循环可能收敛到**局部看似合理但机制不准确的 EWR**。 未来需在以下方面加强: - 发展对**未建模因素**的诊断与不确定性量化能力; - 探索**混合建模**(hybrid modeling),将数据驱动的残差补偿与基于代码的显式物理模拟相结合,以缩小 sim-to-real 差距; - 在证据不足时主动拒识(rejection),而非强行输出机制错误的解释。 Q6: 总结一下论文的主要内容 这篇论文围绕**物理智能的显式世界表示**展开,提出将物理世界编码为可执行代码,并据此构建可验证、可干预、可泛化的物理推理系统。以下是主要内容概括: —- ### 1. 核心问题 现代视觉-语言模型擅长描述物理现象,但缺乏对**底层物理机制**(物体状态、物理参数、动力学规律、干预响应)的显式表示,导致难以可靠推理世界演化。现有三种主要表示各有局限: - **像素**:保留视觉细节但因果结构模糊; - **3D重建**:保留几何但不一定揭示物理机制; - **自然语言**:语义紧凑但难以精确编码连续物理量。 这催生了**现象–机制鸿沟**(phenomenon–mechanism dichotomy):模型能描述“发生了什么”,却难以解释“为什么”以及“若干预会怎样”。 —- ### 2. Code-as-World 范式 论文提出用**可执行代码**表示物理世界,称为可执行世界表示(Executable World Representation, EWR),其形式为
p = (C, E, A) ∈ P_(exec)
其中: - ** C (物理组成)**:定义对象几何、质量、摩擦、重力等稳定属性,以及地面、墙壁等静态环境实体; - ** E (动态演化)**:定义初始状态、时间变化、关键事件与仿真时长,可展开为完整状态轨迹 τ ; - ** A (视觉外观)**:定义相机参数、光照、材质、渲染配置,决定物理轨迹的视觉呈现方式。 该表示将**产生观测的结构化状态**与**连续外观**分离,兼具语言的组合性、重建的结构性和生成模型的时序建模能力,并支持独立编辑、执行与验证。 —- ### 3. 智能体发现循环(Agentic Discovery Loop) 从部分、多模态观测(文本描述或真实视频)中恢复 EWR 是本质上的逆问题。论文将其形式化为受溯因推理启发的迭代优化过程,包含五个阶段: 1. **提出(Propose)**:基于证据与反馈生成或更新 EWR 假设; 2. **实例化(Instantiate)**:将代码编译为物理引擎(MuJoCo)就绪参数 θ ; 3. **执行(Execute)**:运行仿真,产出显式状态轨迹 τ ; 4. **渲染(Render)**:生成预测视觉观测,视频输入则额外投影深度、掩码与轨迹; 5. **验证(Verify)**:对比预测与输入证据,将差异聚合为结构化反馈 Delta 以指导下轮修正。 该循环在文本输入时侧重语义与物理约束验证,在视频输入时联合比对 RGB、深度、掩码与轨迹。实验表明,在匹配评估预算下,迭代循环在视觉对齐(Visual Alignment)、物体 IoU、轨迹误差(Traj-ADE)与精度(Accuracy@2\%D)上优于独立采样(Best-of-5)基线。 —- ### 4. 下游应用:定量物理推理的物理监督 论文将验证后的 EWR 作为**可扩展的物理监督源**,训练视觉-语言模型进行**定量物理推理**。训练采用两阶段课程: - **第一阶段(图像空间定位)**:利用 RefCOCO、GOT-10K 等数据集的边界框与轨迹,通过监督微调建立像素级测量能力。速度、加速度等通过中心差分计算:
vt = c(t+1) - c(t-1)2Delta t, quad a_t = c(t+1) - 2ct + c(t-1)Delta t^2
- **第二阶段(世界空间校准)**:从 EWR 直接读取物理状态与几何,生成带精确世界空间标签的问答对,采用 GRPO 优化。世界空间尺度通过参考量校准:
γ = (rho) / (rho(textpix)), quad y = γ y(πx)
其中文本驱动世界提供**精确仿真监督**,视频驱动世界提供**真实视觉分布**,二者互补。 —- ### 5. 实验结果 - **可执行世界重建**:迭代发现循环能持续提升重建保真度,且跨动画引擎与物理引擎均有效;经视频生成增强的 sim-to-real 视频在保持运动一致性的同时显著提升分布真实感。 - **图像空间测量**:Code-as-World-VL-4B/9B 在 RefCOCO、GOT-10K 等基准上优于同规模及更大规模的开源模型。 - **定量物理推理**:在 QuantiPhy 验证集上: - Code-as-World-VL-4B 平均 MRA 达 50.6%,优于 Gemini-3.1-Flash 等领先闭源模型; - Code-as-World-VL-9B 进一步提升至 55.4%,在直接回答模型中表现最佳; - Code-as-World-VL-27B(Reasoning)通过显式思维链达到 **58.6%**,超越所有评估基线,取得 SOTA。 —- ### 6. 主要贡献 - **可执行世界表示**:提出以代码统一表达物理组成、动态演化与视觉外观的范式; - **智能体发现循环**:建立 propose–instantiate–execute–render–verify 的迭代机制,从多模态证据中逆向构建可验证的物理世界; - **物理监督训练**:利用验证后的可执行世界为视觉-语言模型提供可扩展的物理监督,在 QuantiPhy 上实现 SOTA 性能,验证了可执行世界表示作为物理智能基础的可行性。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27549.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27549
Published: 2026-09-01T02:05:36.367Z
4. VidParse: Online Parsing of Egocentric Procedures Like a Pro
Abstract:Translating continuous, noisy egocentric video streams into discrete, temporally ordered action steps is fraught with visual challenges. Heavy ego-motion, transient occlusions, and the high intra-class variability of unscripted human-object interactions cause standard frame-level online temporal models to struggle, often resulting in severe over-segmentation and structural collapse. To bridge the gap between unstable low-level perception and high-level procedural logic, we present VidParse, an online, training-free framework that treats activity understanding as a graph-constrained inference problem. Rather than relying on learned temporal filters, we dynamically identify semantic transitions using a temporal similarity matrix over manipulation-anchored features, which are extracted from frozen foundation models to prioritize foreground hand-object interactions. A beam search decoder then leverages an induced procedural task graph to explicitly enforce valid action transitions and prune impossible trajectories. By anchoring robust visual segments to hard procedural constraints, our approach preserves long-range state transitions and achieves up to a 10x improvement in complex multi-step parsing accuracy over strong online baselines, all without requiring a single gradient update.
中文摘要
摘要:将连续的、有噪声的自我视角视频流转换为离散的、按时间顺序排列的动作步骤充满视觉挑战。强烈的自我运动、短暂的遮挡以及非脚本化人-物互动的高类内变异性,使得标准的帧级在线时间模型难以应对,常常导致严重的过度分割和结构崩溃。为弥合不稳定的低层感知与高层程序逻辑之间的差距,我们提出了 VidParse,一种在线、无需训练的框架,将活动理解视为图约束推理问题。我们并不依赖学习到的时间滤波器,而是通过在操作锚定特征上的时间相似性矩阵动态识别语义转换,这些特征是从冻结的大模型中提取的,以优先关注前景的手-物互动。然后,束搜索解码器利用生成的程序任务图显式地强制有效动作转换,并剪枝不可能的轨迹。通过将稳健的视觉片段锚定到严格的程序约束,我们的方法保留了长程状态转换,在复杂的多步骤解析精度上相比强在线基线提高了最多 10 倍,且无需进行任何梯度更新。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27562 (HTTP 429)
Authors: Anubhav Gupta, Archit Kambhamettu, Vatsal Agarwal, Pulkit Kumar, Abhinav Shrivastava
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27562.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27562
Published: 2026-09-01T02:05:36.367Z
5. Quanta Perception as Probabilistic Events
Abstract:Autonomous systems rely on extracting information from light, yet remain brittle in extreme environments, from nighttime navigation to high-speed robotics. Conventional sensors aggregate photons over fixed exposures, imposing trade-offs between sensitivity, dynamic range, and temporal resolution that degrade perception when photons are scarce or dynamics are rapid. Quanta sensors detect individual photons, but their streams exceed real-time compute and latency budgets by orders of magnitude. Here we introduce $\textit{probabilistic events}$, a computational primitive for real-time quanta perception from individual photon detections. By computing the posterior over the time since the last intensity change, we represent photon streams as recursive belief states. Rather than fixed-threshold event-camera triggers, this recursive Bayesian formulation yields three low-latency signals: motion-adaptive scene flux, high-fidelity activity maps, and entropy-based perceptual uncertainty. This representation enables perception in extreme conditions, including pose estimation of a running person at $\sim$0.05 lux—-without retraining vision models. Our approach processes input streams exceeding 50{,}000 quanta frames per second on commodity GPU hardware—-yielding kilohertz-scale outputs up to four orders of magnitude faster than state-of-the-art quanta reconstruction baselines, even for megapixel arrays. By replacing frame reconstruction with direct probabilistic inference over photon streams, this work bridges photon-counting quanta sensing with robotic vision.
中文摘要
摘要:自主系统依赖从光中提取信息,但在极端环境下仍然脆弱,从夜间导航到高速机器人操作都存在挑战。传统传感器在固定曝光时间内聚合光子,这在光子稀少或动态快速时,会在灵敏度、动态范围和时间分辨率之间形成权衡,从而降低感知能力。量子传感器能够探测单个光子,但其数据流远超过实时计算和延迟的能力。本文介绍了(\textit{概率事件}),一种用于从单个光子探测实现实时量子感知的计算原语。通过计算自上次强度变化以来的时间的后验分布,我们将光子流表示为递归信念状态。不同于固定阈值的事件相机触发,这种递归贝叶斯公式生成三种低延迟信号:运动自适应场景流、高保真活动图以及基于熵的感知不确定性。这种表示使得在极端条件下进行感知成为可能,包括在约(~0.05 lux)的光照下对奔跑者的姿态估计——且无需重新训练视觉模型。我们的方法能够在普通GPU硬件上处理超过50,000量子帧每秒的输入流——生成千赫兹级的输出,比最先进的量子重建基线快多达四个数量级,即使对于百万像素阵列也是如此。通过用对光子流进行直接概率推断代替帧重建,本研究实现了从计数光子量子传感到机器人视觉的桥接。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27584 (HTTP 429)
Authors: Varun Sundar, Pavan Thodima, Sacha Jungerman, Mohit Gupta
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27584.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27584
Published: 2026-09-01T02:05:36.367Z
6. ShiftSplit-AD: Separating Domain Shift from Defects in Foundation-Feature Visual Anomaly Detection
Abstract:Visual anomaly detectors based on frozen foundation-model features commonly score distances from test patches to a memory of normal features. Benign acquisition changes can also enlarge these distances, confounding domain variation with defects. We investigate whether structured decomposition of nearest-normal DINOv2 residuals can suppress shift-induced evidence while retaining unseen defects. ShiftSplit-AD decomposes the patch residual matrix into low-rank and row-sparse components and scores the sparse component, with an optional low-rank/sparse fusion. The experiments expose a central trade-off rather than a universal separation: genuine defects can contain correlated, low-dimensional structure, so filtering broad residual activity may also remove defect information. On AeBAD-S, using settings fixed after Bottle development, sparse-only scoring improves image AUROC from 0.6780 to 0.7294 and AUPRC from 0.8052 to 0.8465. Paired bootstrap 95% intervals for the improvements are [0.0238, 0.0808] and [0.0170, 0.0650], respectively. However, sparse-only scoring reduces mean clean AUROC from 0.9890 to 0.9133 on four held-out MVTec categories and degrades Bottle localization. These findings show that residual decomposition can help when domain shift strongly contaminates anomaly evidence, but preserving defect structure remains the limiting problem.
中文摘要
摘要:基于冻结基础模型特征的视觉异常检测器通常通过测试图像块到正常特征记忆的距离来评分。良性的采集变化也可能增大这些距离,将域变化与缺陷混淆。我们研究了最近邻正常 DINOv2 残差的结构化分解是否能抑制由迁移引起的证据,同时保留未见过的缺陷。ShiftSplit-AD 将图像块残差矩阵分解为低秩和行稀疏成分,并对稀疏成分进行评分,并可选择进行低秩/稀疏融合。实验揭示了一个核心权衡,而非普适分离:真实缺陷可能包含相关的低维结构,因此过滤广泛的残差活动也可能去除缺陷信息。在 AeBAD-S 数据集上,使用在 Bottle 开发后固定的参数设置,单独稀疏评分将图像 AUROC 从 0.6780 提高到 0.7294,AUPRC 从 0.8052 提高到 0.8465。改进的成对自助法 95% 置信区间分别为 [0.0238, 0.0808] 和 [0.0170, 0.0650]。然而,在四个未见的 MVTec 类别上,单独稀疏评分将干净样本的平均 AUROC 从 0.9890 降低到 0.9133,并降低了 Bottle 的定位性能。这些发现表明,当域偏移严重污染异常证据时,残差分解可以起到帮助作用,但保留缺陷结构仍然是限制性问题。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27610 (HTTP 429)
Authors: Muhamathu Ameer Ali Aacaas Muhamath
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27610.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27610
Published: 2026-09-01T02:05:36.367Z
7. Depth-Aware Pothole Detection Using YOLO and RT-DETR at the Edge
Abstract:Pothole detection and its severity measurement is still an important challenges in urban infrastructure management, where late maintenance directly contributes to vehicle damage, road accidents, and escalating repair costs. Existing automated approaches depend on 2D RGB images and cannot measure physical depth of potholes. In this paper, we present a depthaware pothole detection framework and then compare five architectures: YOLOv8n, YOLOv8nSeg, YOLOv9t, RTDETRL, and RTDETRX for RGB-D sensor fusion-based detection and automated depth measurement. A custom offline augmentation pipeline is used here to simulate adverse road monitoring conditions. All models are trained on the PothRGBD dataset with an 80% training and 20% validation split and evaluated using Precision, Recall, mAP@50, and mAP@50_95. Before measuring the depth data, all depth maps are corrected for camera tilt using RANSAC ground-plane orthorectification and all zero-valued sensor pixels are cast to NaN before any statistic is computed. YOLOv8nSeg achieves the highest mAP@50 of 0.9556 and mAP@50_95 of 0.6758 with the most accurate depth estimate of 2.96 cm with the pixel-precise Dseg algorithm. YOLOv8n achieves the fastest inference at 3.6ms. RTDETRX achieves the highest detection confidence at 92.70%. An important finding is that even after full RANSAC orthorectification, bounding box models overestimate pothole depth by 0.16 to 0.21 cm compared to pixel precise segmentation masks. This confirms that the pavement inclusion bias is structural rather than a calibration artifact.
中文摘要
摘要:坑洞检测及其严重程度测量仍然是城市基础设施管理中的重要挑战,延迟维护会直接导致车辆损坏、交通事故和维修成本增加。现有的自动化方法依赖于二维RGB图像,无法测量坑洞的实际深度。本文提出了一种深度感知的坑洞检测框架,并对五种架构进行了比较:YOLOv8n、YOLOv8nSeg、YOLOv9t、RTDETRL和RTDETRX,用于基于RGB-D传感器融合的检测和自动深度测量。此处使用了自定义离线增强管道来模拟恶劣的道路监测条件。所有模型在PothRGBD数据集上训练,训练集与验证集按80%:20%划分,并使用精确度(Precision)、召回率(Recall)、mAP@50和mAP@50_95进行评估。在测量深度数据之前,所有深度图通过RANSAC地面平面正射校正进行相机倾斜矫正,并且在计算任何统计数据之前,所有值为零的传感器像素都会转换为NaN。YOLOv8nSeg在mAP@50达0.9556、mAP@50_95达0.6758,并通过像素精确的Dseg算法实现最准确的深度估计2.96厘米。YOLOv8n的推理速度最快,仅为3.6毫秒。RTDETRX的检测置信度最高,达到92.70%。一个重要发现是,即使完全经过RANSAC正射校正,边界框模型相比像素精确的分割掩码仍高估了坑洞深度0.16到0.21厘米。这证实了路面包含偏差是结构性的,而非校准误差造成的。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27633 (HTTP 429)
Authors: Md Monjurul Ahsan Prodhan, Md Nour Hossain
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27633.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27633
Published: 2026-09-01T02:05:36.367Z
8. Report Supervision
Abstract:Segmentation models can surpass radiologists, classification models, and vision-language models in tumor detection. Importantly, segmentation models outline tumors, allowing radiologists to better verify and trust the AI output. Their main limitation is the scarcity of tumor masks: creating one 3D tumor mask takes up to 30 minutes, so most public CT datasets contain only a few hundred masks, and even the largest private datasets contain only a couple of thousand. Tumor masks are not produced in clinical routine, but radiology reports are. Public datasets contain tens of thousands of CT-Report pairs, and hospitals contain hundreds of thousands. These reports describe tumors in detail, providing large-scale, informative training data. Here, we introduce Report Supervision (R-Super), a training framework that uses reports to directly supervise and improve tumor segmentation. R-Super introduces new loss functions that teach segmentation models to segment tumors that match report descriptions of tumor count, sizes, and locations. Reports are only used for training. We evaluated R-Super on kidney and pancreatic tumor segmentation, exploring diverse training data sizes, up to 41,418 CT-Report plus 3,488 pancreatic tumor CT-Mask pairs. On external validation, R-Super increased tumor detection F1-Score and segmentation DSC by up to +15% with respect to mask-only training. It also surpassed alternative methods such as CLIP and multi-task learning. Leveraging numerous readily available reports to supplement scarce masks, R-Super strongly improves AI performance when very few training masks are available (e.g., 50), and when many masks are available (e.g., 3,488), unlocking scale in tumor segmentation.
中文摘要
摘要:分割模型在肿瘤检测方面可以超越放射科医生、分类模型和视觉-语言模型。重要的是,分割模型可以勾勒出肿瘤轮廓,使放射科医生能够更好地验证并信任AI输出。它们的主要限制是肿瘤标注(mask)的稀缺性:创建一个三维肿瘤标注最多需要30分钟,因此大多数公共CT数据集只包含几百个标注,即使是最大型的私有数据集也仅有几千个。临床常规中不会生成肿瘤标注,但会生成放射学报告。公共数据集包含数万个CT-报告对,医院中则有数十万个。这些报告详细描述了肿瘤,为大规模、信息丰富的训练数据提供了支持。在此,我们提出了报告监督(R-Super)训练框架,该框架使用报告直接监督并改进肿瘤分割。R-Super引入了新的损失函数,指导分割模型分割出与报告描述的肿瘤数量、大小和位置相匹配的肿瘤。报告仅用于训练。我们在肾脏和胰腺肿瘤分割上评估了R-Super,探索了多样的训练数据规模,最多包括41,418个CT-报告对及3,488个胰腺肿瘤CT-标注对。在外部验证中,与仅使用标注的训练相比,R-Super使肿瘤检测的F1分数和分割的DSC提高了最多15%。它还超越了CLIP和多任务学习等替代方法。利用大量现成报告来补充稀缺标注,当训练标注非常少(如50个)或较多(如3,488个)时,R-Super显著提升了AI性能,从而在肿瘤分割中实现规模化发展。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27668 (HTTP 429)
Authors: Pedro R. A. S. Bassia, Wenxuan Li, Jakob Wasserthal, Jieneng Chen, Xinze Zhou, Zheren Zhu, Chuntung Zhuanga, Sergio Decherchi, Andrea Cavalli, Kang Wang, Yang Yang, Alan Yuille, Zongwei Zhou
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27668.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27668
Published: 2026-09-01T02:05:36.367Z
9. ABCD: Alpha-Composited Block Coordinate Descent: Constant-VRAM Training for Large Radiance Fields
Abstract:We present ABCD (Alpha-Composited Block Coordinate Descent), an out-of-core training framework for alpha-composited radiance fields, instantiated here for 3D Gaussian Splatting. Our method reformulates training as block coordinate descent over spatial partitions: only one block of parameters is active at a time, while all others are frozen. By exploiting the associativity of alpha blending, these inactive regions can be pre-rendered and collapsed into foreground and background RGBA images. As a result, for fixed partition size and image resolution, peak VRAM becomes O(1) with respect to total scene extent, rather than growing with full scene size. This enables GPUs with limited memory to train scenes that would otherwise not fit in core. In experiments, our method closely preserves the reconstruction quality of 3DGS, with less than 5% PSNR degradation, while ABCD with compositing ablated suffers roughly 40% degradation. Our code can be found at this https URL
中文摘要
摘要:我们提出了 ABCD(Alpha-复合块坐标下降),这是一种用于 alpha-复合辐射场的离线训练框架,这里以 3D 高斯撒点为实例实现。我们的方法将训练重新表述为空间分区上的块坐标下降:每次只有一个参数块处于活跃状态,其余所有块被冻结。通过利用 alpha 混合的结合性,这些非活跃区域可以预渲染并合并为前景和背景 RGBA 图像。因此,对于固定的分区大小和图像分辨率,峰值显存相对于整体场景范围变为 O(1),而不是随整个场景大小增长。这使得显存有限的 GPU 也能训练原本无法放入核心的场景。在实验中,我们的方法能够紧密保持 3DGS 的重建质量,PSNR 的下降不到 5%,而在去除复合的情况下,ABCD 的性能下降约 40%。我们的代码可以在此 https URL 找到。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27735 (HTTP 429)
Authors: Ka Heng Shiu, Kartic Subr
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27735.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27735
Published: 2026-09-01T02:05:36.367Z
10. What Can Low Resource Languages Learn From Each Other?
Abstract:Despite the rapid advancement of Vision-Language Models (VLMs), their linguistic reach remains largely confined to high-resource languages, leaving the majority of the world’s 7,000+ living languages on the wrong side of a growing digital divide. This disparity is especially pronounced in Optical Character Recognition (OCR), where low-resource scripts lack the massive datasets required for traditional scaling laws. We investigate OCR adaptation in extreme data-scarce regimes (<10K real and <250K synthetic images), demonstrating that conventional fine-tuning strategies often reach a performance ceiling. Our key finding reveals a structural inefficiency in language-specific adaptation: while higher layers of specialized models diverge to capture unique script nuances, the lower layers learn redundant, highly similar features. Motivated by this observation, we propose PSMC (Pre-train, Specialize, Merge, and Co-train), a data-efficient framework that capitalizes on a cross-script “transfer effect”. Our approach first derives language-specific experts from a high-resource base model, then employs task arithmetic to fuse these experts into a unified, high-performance multilingual back- bone. Extensive evaluation across 10 Indian scripts (supporting 20+ languages) shows that PSMC achieves a ~2% average improvement in Word Recognition Rate (WRR) over individual specialist models without increasing parameter count. Our results indicate that joint training in the merged latent space facilitates a constructive knowledge transfer that benefits all constituent scripts, providing a scalable pathway for inclusive VLM development. Source code and datasets will be released post publication.
中文摘要
摘要:尽管视觉-语言模型(VLMs)发展迅速,但它们的语言覆盖范围仍主要限于高资源语言,使世界上7000多种活语言中的大多数处于日益扩大的数字鸿沟的一端。这种差异在光学字符识别(OCR)中表现尤为明显,低资源文字缺乏传统扩展所需的大规模数据集。我们研究了极度数据稀缺情境下的OCR适应(<10K真实图像和<250K合成图像),并表明传统的微调策略往往达到了性能上限。我们的关键发现揭示了语言特定适应中的结构性低效问题:尽管专业模型的高层会分化以捕捉独特的文字细节,但低层学习的特征冗余且高度相似。受此启发,我们提出了PSMC(预训练、专化、合并与联合训练),一个利用跨文字“迁移效应”的数据高效框架。我们的方法首先从高资源基础模型中获取语言特定专家,然后使用任务算术将这些专家融合成统一的高性能多语言骨干。针对10种印度文字(支持20多种语言)的广泛评估显示,PSMC在不增加参数的情况下,比单独的专家模型在词识别率(WRR)上平均提升约2%。我们的结果表明,在合并潜在空间中的联合训练能够促进建设性知识迁移,从而惠及所有组成文字,为包容性VLM开发提供可扩展路径。源代码和数据集将在发表后发布。
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2608.27753 (HTTP 429)
Authors: Achyuth P, Kahaan Shah, Chetan Arora
Categories: cs.CV
PDF URL: https://arxiv.org/pdf/2608.27753.pdf
CoolPaper URL: https://papers.cool/arxiv/2608.27753
Published: 2026-09-01T02:05:36.367Z