数据来源:ArXiv Domain

LLM Domain Papers

1. Data-Efficient Language Modeling: From Frontier Advancement to Principle-Guided Model Improvement

Abstract:Learning from limited text requires models to use context, generalize to new inputs, and retain useful capabilities. Qiushi Engine conducted a long-horizon, end-to-end autonomous research program on BabyLM 2026 Strict-Small, within 10 million corpus words and 100 million cumulative word presentations. Three stages connected frontier advancement, principle discovery, and principle-guided model improvement. Stage I combined compact restatements, budget reinvestment, and residual incremental learning to build a frontier model. Stage II found that exact repetition and aligned restatement produce different patterns of context use, depending on target relations and prediction windows. In controlled tasks, recovering familiar performance did not ensure that unseen inputs could still use learned computations. These findings support a testable data-efficient learning principle: organize experience around the contextual dependencies needed for prediction; separately design visible information, supervision, and preservation; test learning, generalization, and retention. Stage III retained source text, masked more local clues, supervised selected targets, and preserved predictions on ordinarily masked inputs. Two continuation seeds from the same parent outperformed ordinary continuation on the complete nine-metric aggregate. Overall rose from 42.02 to 42.25 across two generations; the second achieved the highest Overall in the public Strict-Small snapshot of 8 September 2026. Further studies addressed compression, relational anchors, shared representations, and measurement. Models are available on Hugging Face; code and research records accompany the GitHub repository. Together, these stages illustrate Research RSI: recursive self-improvement of the research process. Scientific understanding and method innovations change subsequent questions and designs; new experiments test and refine them.

中文摘要

摘要:从有限文本中学习要求模型使用上下文、对新输入进行泛化,并保留有用的能力。求是引擎在 BabyLM 2026 Strict-Small 上开展了一个长周期、端到端的自主研究计划,使用语料库总词数为 1000 万,累积词呈现次数为 1 亿。三个阶段连接了前沿推进、原理发现和原理指导的模型改进。第一阶段结合了紧凑重述、预算再投资和残差增量学习来构建前沿模型。第二阶段发现,根据目标关系和预测窗口,精确重复和对齐重述会产生不同的上下文使用模式。在受控任务中,恢复熟悉的性能并不保证未见输入仍能使用所学计算。这些发现支持一个可检验的数据高效学习原理:围绕预测所需的上下文依赖组织经验;分别设计可见信息、监督和保留;测试学习、泛化和保持。第三阶段保留源文本、屏蔽更多局部线索、监督选定目标,并保留对通常被屏蔽输入的预测。同一母体的两个延续种子在完整的九指标总分上表现优于普通延续。总体分数在两代中从42.02提升至42.25;第二代在2026年9月8日公开的 Strict-Small 快照中取得了最高的总体分数。进一步研究涉及压缩、关系锚点、共享表示和测量。模型已在 Hugging Face 上可用;代码和研究记录随 GitHub 仓库提供。总体而言,这些阶段展示了研究 RSI:研究过程的递归自我改进。科学理解和方法创新会改变后续问题和设计;新的实验则测试并优化它们。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文试图解决的核心问题是:\*\*在严格受限的数据预算下(1000万词语料库、1亿词累计曝光),如何使语言模型更有效地从有限文本中学习,并同时满足信息利用、泛化与能力保留三方面要求。\*\* 具体而言,研究围绕以下三个相互关联的科学子问题展开: ### 1. 上下文依赖关系的有效习得 论文指出,模型仅暴露于文本并不等同于学会利用文本中的信息关系。在数据稀缺场景下,模型可能依赖局部共现或表面线索完成预测,而非真正使用远处上下文中的状态更新或语义关系。因此,研究试图回答:\*\*何种训练经验能够教会模型使用预测所需的上下文信息与关系?\*\* ### 2. 习得能力的组合泛化 即使模型在熟悉样本上表现良好,也不意味着它形成了可复用的计算或推理规则。论文通过控制实验考察模型在面临新名称、新表达或未见输入时,是否仍能调用已学到的关系或运算。核心问题是:\*\*模型学到的能力能否泛化到新的输入组合,而不仅是对训练内容的记忆?\*\* ### 3. 持续学习中的能力保留 在固定预算下进行增量训练或继续训练时,新能力的习得往往伴随旧能力的退化。论文试图解决:\*\*如何在进一步学习新知识的同时,保留模型已有的语言功能与预测行为,实现新旧能力的共存?\*\* ### 总体研究路径 为回答上述问题,论文采用三阶段端到端自主研究: - \*\*第一阶段(前沿推进)\*\*:通过紧凑重述(compact restatements)、预算再投资(budget reinvestment)与残差增量学习(residual incremental learning),在严格约束下构建前沿基线模型。 - \*\*第二阶段(原理发现)\*\*:系统探究经验组织方式(如精确重复 vs. 对齐重述)、监督分配(supervision allocation)、功能复用与保留条件,揭示关系类型与预测窗口如何塑造上下文使用模式,并提出可检验的数据高效学习原则。 - \*\*第三阶段(原理驱动的模型改进)\*\*:将发现转化为具体的训练决策——保留源文本、增加局部掩码、稀疏监督目标、以及在普通输入上约束预测漂移——从而在不增加额外词曝光预算的前提下,提升完整九指标评估表现。 最终,论文将上述洞察凝练为一条可检验的数据高效学习原则: > \*\*围绕预测所需的上下文依赖关系组织有限经验;将可见信息、监督目标与功能保留分开设计;并检验目标能力是否被习得、能否泛化到新输入、以及能否在后续训练中保留。\*\* Q2: 有哪些相关研究? 该论文的相关研究可按照主题领域梳理如下。 ## 1. 数据受限语言建模与 BabyLM 挑战 这一系列工作直接构成了本研究的实验背景与比较基准: - \*\*Muennighoff et al. (2025)\*\*

1
:*Scaling Data-Constrained Language Models*,系统研究了在数据受限场景下重复曝光与非重复数据、训练配置之间的缩放关系。 - **Warstadt et al. (2023)**
2
;**Charpentier et al. (2025)**
4
;**Choshen et al. (2026)**
5
:BabyLM 2023、2025 及 2026 年的官方报告与征稿说明,定义了发展合理语料上的样本高效预训练任务。 - **BabyLM Organizing Team (2026)**
3
;**BabyLM Community (2026)**
15
:官方挑战网站与公共排行榜。 ## 2. 语言能力的多维评估基准 论文的九项顶级指标建立在以下专门基准之上: - **句法与形态**:**Warstadt et al. (2020)**

6
提出的 BLiMP(最小对立对基准),用于测试语法偏好。 - **世界知识与语境**:**Ivanova et al. (2025)**
7
的 EWoK(世界知识要素框架),评估语境对基本常识判断的影响。 - **概念继承与干扰**:**Misra et al. (2023)**
8
的 COMPS,检验属性知识能否迁移到新概念。 - **实体追踪**:**Kim & Schuster (2023)**
9
的实体追踪任务,要求模型在状态更新后恢复对象属性。 - **物理常识**:**Chang et al. (2025)**
10
的 GlobalPIQA,跨语言文化评估日常物理推理。 - **迁移学习**:**Wang et al. (2018, 2019)**
12

13
的 (Super)GLUE,测试预训练表示在下游微调中的效用。 - **阅读行为与词汇习得**:**de Varda et al. (2024)**
14
提供阅读时间对齐数据;**Chang & Bergen (2022)**
16
研究神经网络中的词汇习得顺序(AoA)。 ## 3. 上下文学习与数据分布组织 论文在探讨“经验组织如何塑造上下文使用”时,引用了以下关于上下文内学习(in-context learning)与数据分布关系的工作: - **Shi et al. (2024)**

21
:*In-context Pretraining*,将语言建模扩展到跨文档边界。 - **Chan et al. (2022)**
22
:指出数据分布特性驱动 Transformer 中上下文学习的涌现。 - **Chen et al. (2024)**
24
:发现预训练数据中的平行结构会促成上下文学习。 - **Zucchet et al. (2025)**
25
:研究稀疏注意力的涌现,以及数据重复对其的影响。 - **Haga et al. (2024)**
23
:在 BabyLM 框架下探索“变体集”(variation sets)对训练效率的影响。 ## 4. 模型架构与参数高效学习 Stage I 的模型设计与增量学习策略参考了: - **He et al. (2021)**

17
;**Microsoft (2021)**
18
:DeBERTa 与 DeBERTa-v2,论文采用的基线架构。 - **Bachlechner et al. (2021)**
19
:ReZero,残差连接快速收敛的相关工作。 - **Houlsby et al. (2019)**
20
:*Parameter-Efficient Transfer Learning for NLP*,与本文的残差分支增量学习思想相关。 ## 5. 持续学习与能力保留 论文在 Stage III 设计输出保持(preservation)机制时,关联了以下文献: - **Li & Hoiem (2016)**

31
:*Learning without Forgetting*,通过知识蒸馏约束旧任务输出,直接启发了本文的 KL 散度保持项。 - **Singh et al. (2023)**
28
:指出上下文学习具有瞬态特性,可能在训练过程中丧失。 - **Anand et al. (2025)**
29
:*Dual Process Learning*,研究上下文策略与权重策略的共存与遗忘控制。 ## 6. 掩码策略与监督分配 论文对掩码粒度与监督目标选择的实验,与以下研究对话: - **Wettig et al. (2023)**

30
:*Should you mask 15% in masked language modeling?*,探讨掩码率与训练目标设计。 ## 7. 机制可解释性与因果抽象 Stage II 的内部干预实验(如信号置零、旋转、重定位)植根于: - **Geiger et al. (2021)**

26
:*Causal Abstractions of Neural Networks*,提供因果抽象的框架。 - **Zhang & Nanda (2024)**
27
:关于语言模型中激活修补(activation patching)的最佳实践。 ## 8. 实体绑定与关系推理 独立研究分支(Section 5)涉及实体记忆与关系结构,引用包括: - **Feng & Steinhardt (2024)**

32
:探究语言模型如何在上下文中绑定实体。 - **Dai et al. (2024)**
33
:对语言模型中绑定机制的表示分析。 ## 9. 自主 AI 研究与递归自我改进 论文在讨论 **Research RSI**(研究过程的递归自我改进)时,将自身工作与以下系统并置: - **Yang et al. (2026)**

34
:团队在真实光学平台上的端到端自主科学发现工作。 - **Lu et al. (2026)**
35
:*Towards end-to-end automation of AI research*。 - **Zelikman et al. (2024)**
36
:STOP(Self-Taught Optimizer),递归自我改进代码生成。 - **Zhang et al. (2026)**
37
:Darwin Gödel Machine,开放式演化自我改进智能体。 - **Shinn et al. (2023)**
38
:Reflexion,语言智能体的言语强化学习。 - **Gottweis et al. (2026)**
39
:CoScientist,结合假设生成、辩论与持久记忆的自改进循环。 - **Chen et al. (2026)**
40
:对 AI 中递归自我改进从有界自精炼到自主研究循环的综述。 Q3: 论文如何解决这个问题? 该研究通过**三阶段端到端自主研究程序**解决数据受限条件下的高效语言建模问题:先构建前沿基线模型并积累可控材料,再通过机制实验发现学习原理,最终将原理转化为可验证的训练设计。具体方法如下。 —- ### 1. Stage I:前沿推进——紧凑表达、预算再投资与残差增量学习 在严格预算(1000万词语料、1亿词累计曝光)下,该阶段首先建立一个可继续训练的前沿基线模型,并为后续控制实验提供可复用的文本与模型工具。 - **紧凑重述与预算再投资** 将源文本与其对齐重述配对,但通过压缩重述长度减少冗余。在固定的替换块预算(423,520词)内,核心配对从10,094对增加到12,155对(+20.42%),释放的预算用于扩展覆盖范围。训练早期与晚期的表现排序发生反转,说明数据价值取决于学习阶段。 - **残差架构与参数冻结** 采用DeBERTa-v2风格的掩码语言模型(8层、隐藏维度480、8头注意力、词汇量16,384),并引入零初始化的残差分支:

h’ = h + s, Uσ(D,Norm(h)),
其中上投影初始化为零,使新增分支在训练开始时保持恒等映射。联合训练至8,201万词后,冻结主干参数(35,463,008个),仅训练新增的增量分支(995,584个参数,共48个张量),在增量阶段同时优化预测损失与KL散度保持项。 —- ### 2. Stage II:原理发现——关系组织、泛化条件与监督分配 该阶段将第一阶段获得的模型与数据作为研究对象,通过控制实验分离“信息可见性”“监督目标”与“功能保留”三个变量,提出可检验的数据高效学习原则。 - **关系类型塑造上下文使用** 对比**精确重复**与**对齐重述**两种配对方式。通过将源文本替换为等长无关文本,定义真源优势 A_T = N - T 与无关源优势 A_U = N - U ( T 、 U 、 N 分别为真源、无关源、中性上下文下的平均交叉熵)。实验发现: - 精确重复使真源优势降低约 -0.8138 nats; - 对齐重述使真源优势提升约 +0.7970 nats。 进一步通过**同窗口**与**分窗口**控制实验发现:将配对文本拆分到不同预测窗口会显著削弱上述效应。这表明,仅仅包含相关文本不足以促进关系学习,文本必须在同一预测窗口内形成可访问的上下文依赖。 - **熟悉表现与未见输入的功能复用** 在四选一关系任务中,模型对熟悉符号准确率可达100%,但对未见符号的推理能力在继续训练后可能衰退。通过内部干预(对查询属性位置的隐藏状态进行置零、中心化、旋转移位)发现: - 置零使未见符号准确率从87.5%降至25.0%; - 旋转信号后,答案跟随被移位的信号(重定位目标选择率达67.6%)。 这说明模型内部存在决定答案选择的具体功能信号,且**恢复熟悉表现不等于恢复了未见输入对该计算的可及性**。 - **监督分配的作用** 比较全序列监督、静态关系权重与交错监督(交替优化关系答案与全序列目标)。交错监督在保持100%熟悉符号准确率的同时,将未见符号准确率从40.2%(全序列继续训练)提升至83.3%。此外,在紧凑重述上删除“源缺失目标”与删除“复制目标”的对比表明,监督目标的选择会改变后续任务表现,即使输入文本完全相同。 基于以上发现,研究提炼出设计原则: > 围绕预测所需的上下文依赖组织经验;将**可见信息**、**监督目标**与**功能保留**分开设计;并通过习得、泛化与保留三重测试验证能力。 —- ### 3. Stage III:原理驱动的模型改进——掩码-监督分离与普通输入保持 该阶段将上述原理转化为具体的继续训练方案,以第一阶段模型为共同起点,通过改变输入掩码、监督位置与保持约束,在不增加额外词曝光预算的前提下提升综合表现。 - **分离可见输入与监督目标** 保留源文本,在重述侧实施**稠密掩码**(覆盖更多内容组),但仅在稀疏选定的目标位置计算关系预测损失。定义三种条件: - (S,S) :稀疏掩码 + 稀疏监督; - (M,S) :稠密掩码 + 稀疏监督; - (M,M) :稠密掩码 + 稠密监督。 其中 (M,S) 在固定曝光预算下优于普通连续训练,而 (M,M) 并未进一步提升表现,说明增加监督目标数量本身并非关键,**扩大模型必须依赖的上下文窗口缺口**才是核心。 - **普通输入上的功能保持** 为防止新任务学习破坏既有语言能力,研究引入输出保持机制:对相同的Qwen配对行应用普通15%整词掩码,以第一阶段冻结模型为教师,通过KL散度约束新模型在普通输入上的输出漂移:

L(pres) = (1) / (|Q_p|)∑((x,i)∈ Qp) KL(p(Frontier)(·mid x,i) ,|, p_θ(·mid x,i)),

L = L(acq) + λ L(pres), quad λ=1,; T=1.
其中
L(acq) = 0.15,CE(focus) + 0.85,CE_(ordinary).
关键控制在于保持输入为**普通掩码条件**而非稠密掩码条件:实验显示,在稠密输入上施加相同系数的保持约束,梯度范数约为普通输入的11.8倍,会严重抑制新能力习得;而普通输入保持可在保留大部分习得增益的同时,将普通行为漂移从0.02449 nats降至0.00941 nats。 - **梯度与随机性控制** 通过保存并恢复PyTorch与CUDA随机数状态,确保保持分支的额外前向传播不会引入dropout等前向随机性差异,从而将预测变化归因于参数更新而非比较过程本身。 - **评估结果** 从同一父模型出发,两个连续种子(62064、62065)的完整九指标评估显示: - 普通连续训练:42.0926 / 42.1159 - (M,S) 无保持:42.2025 / 42.1789 - 完整方法( (M,S) + 普通输入保持):42.2464 / 42.2317 完整方法在GlobalPIQA与Entity Tracking上贡献主要增益,且下游(Super)GLUE微调在不同种子下均优于父模型与无保持版本。 —- ### 4. 方法论总结 论文的核心解决路径可概括为:**通过“构建—分析—再设计”的闭环,将训练现象转化为机制问题,再将机制发现转化为独立的训练操作变量。** | 科学问题 | 对应技术干预 | |————-|——————| | 上下文依赖如何习得 | 源-重述配对、同窗口组织、稠密掩码扩大信息缺口 | | 习得能力能否泛化 | 未见符号测试、内部信号干预、监督目标稀疏化 | | 新旧能力如何共存 | 冻结主干+残差增量、普通输入KL保持、梯度与随机性控制 | | 数据价值如何最大化 | 紧凑压缩释放预算、预算再投资扩展覆盖、学习阶段敏感的评估 | 最终,该研究不仅提交了两个公开模型(Frontier 42.02 与 Principle-guided 42.25),还提供了一套可复用的原理、控制实验工具与开放研究材料,以支持后续对数据高效学习机制的进一步检验。 Q4: 论文做了哪些实验? 该论文的实验体系横跨三个完整研究阶段,涵盖自然文本控制、受控机制任务、训练设计比较及补充性的独立研究。以下是系统梳理。 —- ## 一、Stage I:前沿推进实验 ### 1. 紧凑重述与预算再投资 在固定词预算的子块(replacement block,423,520词)内,对比原始核心配对(10,094对)与压缩后扩展配对(12,155对,+20.42%)的训练效果。观测到早期与晚期表现排序反转:紧凑重述在20M累积词时落后参考方法约0.83分,但在70M–80M时反超约1.29–1.35分(七指标筛选均值),证明数据价值依赖于学习阶段。 ### 2. 数据组织与连贯性控制 以冻结主干后的残差增量学习为实验平台,保持起始模型、增量分支、曝光量与更新次数不变,比较: - **连贯训练**(coherent segments within each training row) - **分段打乱**(within-row segment shuffling) 在残差尺度 s=1.0 下,连贯组织达到44.1064,分段打乱为43.1214(七指标均值),差异约0.9850,验证组织方式本身即可改变相同文本的学习产出。 ### 3. 残差结构与增量学习验证 - 联合训练主干与零初始化残差分支(上投影初始化为零,初始恒等映射):

h’ = h + s, Uσ(D,Norm(h))

  • 冻结35,463,008个主干参数,仅训练995,584个增量参数(48个张量),在82M词基础上继续训练至86M词,结合预测损失与KL保持项。 - 通过禁用/启用增量分支,验证分支对基线输出的恢复能力与保留时的修正效应。 ### 4. 推断尺度选择 在训练后评估替代推断尺度,最终选择 s=0.75 作为发布模型的推理缩放系数。 —- ## 二、Stage II:原理发现实验 ### 1. 关系类型与上下文使用(自然文本) 对比三种配对条件对源信息使用的影响,定义真源优势 A_T = N - T 与无关源优势 A_U = N - U ,其中 T 、 U 、 N 分别为真源、无关源、中性上下文下的平均交叉熵(nats)。 - **精确重复**(exact repetition):真源优势变化约 -0.8138 nats。 - **对齐重述**(aligned restatement):真源优势变化约 +0.7970 nats。 同时测量无关源优势变化极小(分别约 +0.0679 与 -0.0085 nats),支持效应具有内容特异性。 ### 2. 窗口布局控制 在同窗口(same-window)与分窗口(split-window)条件下保留相同文本但改变可访问性: - 精确重复的同窗口效应为 -0.683 / -1.010 (两种子),分窗口后衰减至 +0.009 / -0.134 。 - 对齐重述的同窗口效应为 +0.712 / +0.824 ,分窗口后衰减至 +0.116 / +0.028 。 证明文本共存于同一预测窗口是关系效应进入学习的必要条件。 ### 3. 自然重述迁移 使用英语与简明英语维基百科的1,200对自然重述,按目标词 tokenizer ID 是否出现在源中分组: - 目标token存在于源中时,对齐重述提升真源优势 +0.238 ± 0.071 nats。 - 目标token不存在于源中时,对齐重述效应接近参考( +0.032 ± 0.040 nats),而精确重复产生负效应。 ### 4. 功能复用与未见输入(受控四选一任务) 在查询-属性绑定任务中,测试熟悉符号与未见符号的推理能力: - **初始习得**:熟悉符号准确率100.0%,未见符号87.5%。 - **全序列继续训练**:熟悉符号降至87.2%,未见符号骤降至40.2%。 - **静态关系权重**:熟悉100.0%,未见75.5%。 - **交错监督**(interleaved supervision):熟悉100.0%,未见83.3%。 ### 5. 内部信号干预 对第一层中查询属性位置与其他属性位置的平均隐藏状态归一化差值(选择相关方向)进行干预: - **置零**(zeroing):初始未见准确率从87.5%降至25.0%;交错监督条件下从83.3%降至38.7%。 - **旋转**(rotation):答案跟随被移位信号的比例(relocated target selection)在初始习得时为67.6%,交错监督时为63.9%,全序列继续训练仅31.4%。 - **重新拟合方向**:即使从熟悉符号、单个或两个未见符号重新拟合新的线性方向,全序列继续训练后的未见查询重定向仍弱于交错监督。 ### 6. 监督分配与目标删除 在紧凑重述上保持输入不变,删除特定监督目标类别: - 删除源缺失目标(source-absent targets)后,100M词时七指标均值43.437。 - 删除匹配复制目标(matched copied targets)后,均值42.792。 - 完整监督为43.896。 在20M词时对训练未使用的710对、974个目标事件进行测量:删除源缺失监督相较于删除匹配复制监督,使源缺失内容词损失升高0.0796 nats(配对不重复条件下95%区间为 $

0.031, 0.125
)。 ### 7. 经验价值与固定预算替换 在80M–100M词、五个指标(BLiMP, Supplement, EWoK, COMPS, Reading)下比较: - 紧凑重述:相对参考 +0.3853 - 同范围不同句子: +0.3350 - 近似精确重复: +0.0343 在另一RoBERTa配置中,重述虽改善自身训练损失,但晚期五指标变化为 -0.6873 ,揭示经验价值依赖于架构与学习阶段。 ### 8. 初始化对照 显式复制共享张量参数,修正因层插入导致相同种子下53/140个张量初始值不同的混杂因素。修正后,紧凑视图相对于重复的数据-架构交互估计从 -0.6908 变为 +0.0679$(区间跨零)。 —- ## 三、Stage III:原理驱动改进实验 ### 1. 可见输入与监督目标分离 从共同父模型(Frontier,86,005,295词)出发,固定继续训练词曝光,比较: - **普通继续训练**(ordinary continuation) - **(S,S)**:稀疏掩码 + 稀疏监督(机制测量用) - **(M,S)**:稠密掩码 + 稀疏监督(dense masking, sparse supervision) - **(M,M)**:稠密掩码 + 稠密监督 在相同累积词曝光(89,168,037词)下,两继续种子(62064、62065)的Overall分别为: - 普通继续:42.0926 / 42.1159 - (M,S):42.2025 / 42.1789 - (M,M):42.1491 / 42.1684 (M,S) 持续优于普通继续与 (M,M),支持将掩码密度与监督稀疏性分离控制。 ### 2. 普通输入保持(ordinary-input preservation) 在 (M,S) 基础上,对相同的Qwen配对行施加普通15%整词掩码,以冻结的Frontier模型为教师,通过KL散度约束新模型输出:

L(pres) = (1) / (|Q_p|)∑((x,i)∈ Qp) KL(p(Frontier)(·mid x,i) ,|, pθ(·mid x,i))
总目标为:
L = L
(acq) + λ L(pres), quad L(acq) = 0.15,CE(focus) + 0.85,CE(ordinary), quad λ=1.
两种子Overall分别为42.2464与42.2317(含额外517,332词保持 Q5: 有什么可以进一步探索的点? 基于论文的发现与开放性问题,以下方向可供进一步探索: —- ### 1. 规模、预算与跨领域泛化 当前实验均在 **Strict-Small**(语料1000万词、累计曝光1亿词)约束下完成。核心方法——紧凑重述、稠密掩码稀疏监督、普通输入保持——在更大规模的 **Strict** 赛道(语料1亿词、曝光10亿词)或 **Multilingual** 赛道(含荷兰语、中文)中的有效性尚未验证。此外,这些方法在低资源语言、科学文献或特定领域文本中的迁移价值,需要独立的跨领域实验支撑。 —- ### 2. 保持机制的有效强度与动态调度 论文发现,在相同损失系数 λ=1 下,稠密输入上的保持梯度范数约为普通输入的 **11.8倍**:

|∇(trainable) L(pres)^(dense)||∇(trainable) L(pres)^(ordinary)| ≈ 11.835
这表明固定系数难以对不同输入条件施加均衡约束。未来可探索: - **自适应保持强度**:根据输入掩码密度或当前模型熵动态调整 λ ; - **保持系数的课程学习**:在增量训练初期允许较大漂移,后期逐步收紧约束; - **分层保持**:对不同网络层或不同功能模块施加差异化的保持目标。 —- ### 3. 关系习得的神经机制与表征几何 Stage II 识别出关系类型(精确重复 vs. 对齐重述)与预测窗口布局对上下文使用的选择性影响,但以下问题仍开放: - **注意力模式**:模型在利用源-重述关系时,注意力权重如何在源位置与目标位置之间重新分配?是否形成可解释的“跨句子”注意力头? - **表征子空间**:功能复用实验表明存在决定答案选择的特定线性方向,但这些方向在深层网络中如何被非线性变换组合、如何在不同关系类型间共享或分离,仍需更系统的表示分析。 —- ### 4. 从控制任务到自然语言的泛化桥梁 论文在四选一符号任务中发现:**熟悉表现恢复 ≠ 未见输入的功能复用**。然而,这一结论向自然文本的迁移存在鸿沟: - 自然语言中的“未见输入”涉及新词、新句法结构、新实体名称的组合,其复杂度远超符号替换; - 需要设计介于微型世界与自然文本之间的**中间复杂度基准**,以量化“功能可达性”(functional reach)随任务复杂度、词汇开放度的变化规律。 —- ### 5. 实体记忆、语义寻址与时间推理 Section 5.4 的显式记忆实验显示,即使提供正确的读写地址(gold-address),模型在**时间状态选择**(判断应检索原始状态还是更新后状态)上仍表现困难(准确率约0.511)。未来可深入: - **时间指针机制**:设计显式的时间戳或版本控制接口,辅助模型追踪状态更新序列; - **语义寻址的端到端学习**:当前自然文本的寻址存在瓶颈(高token准确率但关键查询召回率为零),需改进从文本含义到存储槽位的映射机制; - **记忆-读取协同训练**:探索读写模块与语言预测主干的联合优化,而非分阶段冻结训练。 —- ### 6. 数据构造与经验压缩的自动化 紧凑重述目前依赖外部大模型(Qwen/Qwen3.5-9B)生成,质量控制依赖人工规则与过滤。进一步探索包括: - **保留关系的自动压缩指标**:除了词汇覆盖度,如何自动评估压缩后文本是否保留了源文本中的关键推理线索(如状态转移、属性继承); - **生成式数据扩充与预算优化的联合优化**:将文本生成、质量评估与预算再投资整合为一个可微分的或基于搜索的联合决策过程。 —- ### 7. Research RSI 的量化评估与纵向追踪 论文提出 **Research RSI**(研究过程的递归自我改进)概念,但其证据局限于单一 BabyLM 项目内的三阶段递进。要建立更普遍的认知,需要: - **跨任务纵向研究**:追踪同一自主系统在不同科学问题(如视觉推理、定理证明)上的研究成本、假说质量与实验效率是否随经验累积而系统性提升; - **知识重用的度量**:量化先前阶段的方法、控制实验与失败解释,对后续阶段问题选择与设计空间的缩减贡献; - **与人类研究过程的对比**:在相同问题设置下,比较自主系统与人类团队在探索效率、假说新颖性与错误修正速度上的差异。 —- ### 8. 测量方法论与细粒度分析 论文多次强调宏观平均(macro-average)与项目级变化(item-level changes)可能给出不同信号。未来研究可开发: - **动态评估协议**:在训练过程中实时追踪同一项目在不同检查点上的正确性转换(gain/loss),以识别能力涌现、退化或振荡的具体时点; - **组件分数的因果归因**:当前 Overall 分数由九项指标等权平均,但各项任务间可能存在冗余或因果依赖,需探索更结构化的能力分解框架。 —- ### 9. 架构与优化的联合设计 论文中的残差增量学习仅更新了约 **2.73%** 的参数(995,584 / 36,458,592)。可进一步探索: - **多层增量结构**:当前仅使用单一瓶颈分支,若在不同层引入多个可独立启用/禁用的增量模块,是否能实现更精细的能力模块化与保留? - **参数效率与计算效率的分离**:论文指出可训练参数比例不等于计算节省,未来可设计梯度检查点与增量模块的联合优化策略,降低冻结主干上的前向-反向传播开销。 —- ### 10. 监督分配的动态与理论最优 Stage III 的 (M,S) 与 (M,M) 比较表明,在固定总监督权重(0.15)下,稀疏监督优于稠密监督。但以下问题仍开放: - **最优稀疏比率**:28,590 个聚焦token(稀疏监督)相对于 176,607 个掩码token(稠密掩码)的比率是否已最优?是否存在任务依赖的最优监督密度; - **目标选择策略**:当前采用随机抽样与保底机制,若基于模型当前不确定性或源-重述对齐度主动选择监督位置,能否进一步提升数据效率。 Q6: 总结一下论文的主要内容 该论文围绕 **BabyLM 2026 Strict-Small** 赛道(语料上限 1000 万词、累计曝光上限 1 亿词)展开端到端自主研究,系统探索了在严格数据预算下提升语言模型学习效率的路径。论文核心内容可概括如下。 —- ### 一、研究背景与科学问题 大规模训练展示了资源充沛时的能力增长,而有限数据场景提出一个互补问题:**模型如何从已有经验中学到更多?** 这要求模型不仅拟合文本,还需学会: - **使用上下文信息关系**(contextual dependencies)进行预测; - **将习得的能力泛化到新输入**(组合泛化); - **在继续学习中保留已有能力**(持续学习)。 BabyLM 的 Strict-Small 赛道为这一问题提供了共享的实验约束。论文聚焦于一个核心科学问题:**何种训练经验能教会模型利用上下文中的信息关系,并让这些能力在后续学习中得以保留?** —- ### 二、三阶段研究架构 整个研究由 Qiushi Engine 自主完成,分为三个相互衔接的完整阶段: | 阶段 | 目标 | 关键产出 | |———|———|—————| | **Stage I:前沿推进** | 在预算内构建前沿基线模型 | 紧凑重述、预算再投资、残差增量学习;公开模型 Frontier(Overall 42.02) | | **Stage II:原理发现** | 解释 Stage I 现象,发现数据高效学习原理 | 关系类型与窗口组织对上下文使用的选择性影响;熟悉表现与未见输入功能复用的分离;可检验的设计原则 | | **Stage III:原理驱动改进** | 将原理转化为新的训练设计并验证 | 稠密掩码稀疏监督 + 普通输入保持;公开模型 Principle-guided(Overall 42.25) | 三个阶段形成 **Research RSI**(研究过程的递归自我改进):前期研究的科学理解、方法创新与实验经验被继承并用于改进后续研究的问题选择、控制实验设计与方法构建。 —- ### 三、关键科学发现 #### 1. 关系类型塑造上下文使用 通过对比**精确重复**(exact repetition)与**对齐重述**(aligned restatement)发现: - 精确重复使模型对源信息的依赖显著下降(真源优势变化约 -0.8138 nats); - 对齐重述则显著提升源信息使用(真源优势变化约 +0.7970 nats)。 将配对文本拆分到**不同预测窗口**后,上述效应大幅衰减,证明:**文本共存于同一预测窗口是关系学习生效的必要条件**。 #### 2. 熟悉表现 ≠ 功能复用 在受控四选一关系任务中,模型对**熟悉符号**的准确率可在继续训练后恢复(100.0%),但对**未见符号**的推理能力却可能丧失(从 87.5% 降至 40.2%)。通过内部信号干预(置零、旋转隐藏状态中的选择方向)证实: - 置零使未见符号准确率从 87.5% 跌至 25.0%; - 旋转信号后,答案跟随被移位信号的比例达 67.6%。 这表明模型内部存在决定答案的**具体功能信号**,且恢复熟悉表现并不保证该计算对新输入仍然可及。 #### 3. 可见信息、监督目标与功能保留应分离设计 - **输入掩码**决定模型能看到什么; - **监督目标**决定哪些预测误差驱动参数更新; - **保持约束**决定旧行为在何种输入条件下不应漂移。 三者是独立的可控变量。例如,在固定曝光预算下,**稠密掩码 + 稀疏监督**( (M,S) )优于**稠密掩码 + 稠密监督**( (M,M) ),说明增加监督目标数量本身并非关键,**扩大模型必须依赖的上下文信息缺口**才是核心。 —- ### 四、核心方法创新 #### 1. 紧凑重述与预算再投资 压缩源-重述配对中的重述长度,在固定词预算内将配对数量从 10,094 对扩充至 12,155 对(+20.42%),释放的预算用于扩大覆盖范围。 #### 2. 残差增量学习 采用零初始化残差分支:

h’ = h + s, Uσ(D,Norm(h))
训练至成熟后冻结主干(35,463,008 参数),仅训练增量分支(995,584 参数,占比约 2.73%),使后续实验能在固定表示基础上比较目标与输入条件。 #### 3. 原理驱动的继续训练(Stage III) 从 Frontier 模型出发,仅通过改变训练任务设计实现提升: - **保留源文本**,在重述侧施加**稠密掩码**(扩大信息缺口); - 仅在**稀疏选定的目标位置**计算关系预测损失( (M,S) 配置); - 对相同文本施加**普通整词掩码**,以冻结的 Frontier 为教师,通过 KL 散度约束新模型在普通输入上的输出漂移:

L(pres) = (1) / (|Q_p|)∑((x,i)∈ Qp) KL(p(Frontier)(· mid x, i) ,|, p_θ(· mid x, i))

  • 总目标:
    L = L(acq) + λ L(pres), quad L(acq) = 0.15,CE(focus) + 0.85,CE_(ordinary), quad λ=1
    关键控制在于**保持输入必须为普通掩码条件**:若在稠密掩码输入上施加相同保持系数,梯度范数会放大至约 11.8 倍,严重抑制新能力习得。 —- ### 五、主要实验结果 #### 1. 公开排行榜表现 在 2026 年 9 月 8 日的 Strict-Small 公开快照中: - **Frontier**:Overall **42.02** - **Principle-guided**:Overall **42.25**(公开榜最高) - 外部前八名最高:41.80(go76dof / WWM curriculum) #### 2. 同父模型对照实验 从同一父模型(86,005,295 词检查点)出发,两继续种子(62064、62065)的 Overall 如下: | 策略 | Seed 62064 | Seed 62065 | |———|——————|——————| | 普通继续训练 | 42.0926 | 42.1159 | | 稠密掩码 + 稀疏监督( (M,S) ) | 42.2025 | 42.1789 | | 完整方法( (M,S) + 普通输入保持) | **42.2464** | **42.2317** | (M,S) 在相同曝光下稳定优于普通继续训练;增加保持机制后进一步提升,且 **(Super)GLUE** 在不同微调种子下也优于父模型与无保持版本。 #### 3. 增益分解 相对于父模型,完整方法的主要 Overall 增益来自 **GlobalPIQA**(贡献约 74%–79%);相对于普通继续训练,**Entity Tracking** 是最大正贡献来源。这表明改进是**可识别行为变化的结果**,而非随机波动。 —- ### 六、独立研究发现 除主线的模型改进外,论文还报告了多项具有独立科学价值的并行研究: - **经验压缩与替换**:固定预算下,不同 displaced 材料的机会成本差异显著; - **关系锚点**(relational anchors):稀疏绝对标签可通过共享表示传播,解决相对关系中的方向歧义; - **身份接口**(identity interface):字符级监督可支撑新名称组合的关系推理; - **实体存储与语义寻址**:显式记忆模块中,正确寻址与内容读取仍是瓶颈,时间状态选择尤其困难; - **测量控制**:共享参数显式复制、项目级变化追踪等,为机制研究提供更可靠的比较工具。 —- ### 七、贡献与意义 1. **实践层面**:在严格数据限制下,通过经验组织、监督设计与保持约束的协调,将 Overall 从 42.02 提升至 42.25,并提供了可复用的训练与评估实现。 2. **科学层面**:将“数据高效学习”从经验性技巧提升为可检验的设计原则——围绕上下文依赖组织经验,分离可见信息、监督目标与功能保留,并联合评估习得、泛化与保留。 3. **方法论层面**:展示了 **Research RSI** 的具体实例——自主系统如何通过积累科学理解、技术方法与实验经验,递归改进后续研究的问题选择、控制实验设计与方法构建。 4. **开放资源**:模型权重、代码、数据构造流程、完整评估记录与研究日志均已公开,支持后续验证与扩展。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Shuxing Yang, Kaihao Zhu, Junjie Yang, Rui Zhao, Junyao Wu, Yize Wang, Wenhao Li, Fujia Chen, Taowen Deng, Shenzhan Hong, Yaqi Li, Zichen Li, Jincheng Mi, Yuang Pan, Hongsheng Chen, Yihao Yang

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10702.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10702

Published: 2026-09-13T01:24:45.019Z


2. NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction

Abstract:We introduce NCP-ArchPreview, a latent-space language model that pushes autoregressive pretraining beyond standard next-token prediction (NTP). Alongside NTP, the model learns through Next Concept Prediction (NCP) to predict discrete concepts that span multiple tokens, introducing an explicit and more challenging concept-level objective while preserving standard token-level autoregressive generation. NCP-ArchPreview builds a latent space by constructing a product-quantized concept vocabulary directly from its hidden states, and subsequently learns to predict future concepts via a dedicated Concept Module. These predicted concepts are then fed back to the token level to guide subsequent generation, with NTP and NCP trained jointly end-to-end. We scale this architecture to 8.9B parameters and train it on 5.73T tokens from the Dolma-3 dataset, marking the largest demonstration of a latent-space language model to date. Remarkably, by consuming only 51.3% of the total training tokens, NCP-ArchPreview achieves the final pretraining loss of OLMo-3-7B. Following full pretraining, it outperforms OLMo-3-7B by 2.45 points on the downstream macro-average, including a notable 5.99-point gain on GSM8K. Controlled experiments isolate a clear progression of performance gains stemming from both the latent architecture and the NCP objective. Furthermore, utilizing only 85% of the standard computation, NCP-ArchPreview approaches the training loss of a strictly parameter-aligned 8.9B baseline. The learned latent space remains highly valuable after the pretraining stage: updating just the 17M-parameter VQ module yields a novel, lightweight interface for domain adaptation, while a simple injection of concept representations into a DFlash2 drafter improves the mean accepted length by 4.17% with negligible overhead.

中文摘要

摘要:我们介绍了 NCP-ArchPreview,一种潜空间语言模型,将自回归预训练推进到标准下一个标记预测(NTP)之外。除了 NTP,该模型还通过“下一个概念预测”(NCP)进行学习,以预测跨多个标记的离散概念,引入了明确且更具挑战性的概念级目标,同时保留标准的标记级自回归生成。NCP-ArchPreview 通过直接从隐藏状态构建产品量化概念词汇来建立潜空间,并随后通过专门的概念模块学习预测未来概念。这些预测的概念随后被反馈到标记级以指导后续生成,同时 NTP 和 NCP 端到端联合训练。我们将该架构扩展到 89 亿参数,并在 Dolma-3 数据集的 5.73 万亿标记上进行训练,标志着迄今为止潜空间语言模型的最大示范。值得注意的是,NCP-ArchPreview 仅消耗了总训练标记的 51.3%,便达到了 OLMo-3-7B 的最终预训练损失。在完整预训练之后,它在下游宏平均指标上比 OLMo-3-7B 高 2.45 点,其中在 GSM8K 上尤其增加了 5.99 点。受控实验明确显示性能提升来自潜空间架构和 NCP 目标的双重贡献。此外,利用仅 85% 的标准计算量,NCP-ArchPreview 接近严格参数对齐的 89 亿基线的训练损失。学习到的潜空间在预训练阶段之后仍然极具价值:仅更新 1700 万参数的 VQ 模块即可提供一种新颖轻量的领域适应接口,而将概念表示简单注入 DFlash2 草稿生成器可在几乎不增加额外开销的情况下,将平均接受长度提升 4.17%。

LLM Analysis

Q: 这篇论文试图解决什么问题? 该论文试图解决标准\*\*下一词预测(Next Token Prediction, NTP)\*\*在语言模型预训练中的固有局限性,即监督信号严格局限于细粒度token级别,缺乏对跨越多token的\*\*高层语义概念结构\*\*进行显式建模与预测的能力。具体而言,标准NTP只能间接地通过逐词预测来诱导模型学习语义抽象,而无法直接指导模型理解多token跨度上的概念级依赖关系,这在一定程度上限制了模型的学习效率与表示能力。 为此,论文提出了 \*\*NCP-ArchPreview\*\*,核心思路是将潜在空间建模引入自回归预训练框架,通过联合优化以下两个目标来解决上述问题: - \*\*下一词预测(NTP)\*\*:保留传统的token级自回归生成,确保模型维持标准的逐词解码能力; - \*\*下一概念预测(Next Concept Prediction, NCP)\*\*:显式地预测跨越多个token的离散概念(discrete concepts),将监督信号提升到更高层次的语义抽象空间。 在技术实现上,模型通过以下机制达成这一目标: 1. \*\*构建离散概念词汇表\*\*:利用Token Encoder的隐状态,通过乘积量化(Product Quantization)构建一个离散的概念空间(concept vocabulary); 2. \*\*概念模块预测\*\*:在Token Encoder与Token Decoder之间插入Concept Module,以自回归方式在学到的概念空间中预测未来概念; 3. \*\*概念反馈注入\*\*:将预测的概念表示经过因果移位后重复扩展回token级别,通过残差连接注入Token Decoder,从而指导后续token生成; 4. \*\*层级残差连接\*\*:引入模块内(IRC)与跨模块(CRC)动态残差路由,促进不同抽象层级间的信息流动。 通过这一架构,论文在保持标准自回归生成接口的同时,将显式的概念级目标内嵌于预训练过程中,旨在提升模型的优化效率、收敛速度与下游任务性能,并为大规模语言模型提供一种可扩展的潜在空间建模蓝图。 Q2: 有哪些相关研究? 论文在第6节及相关段落中系统回顾了相关研究,主要涵盖以下四个方向: ### 1. 抽象层级预测(Abstract-Level Prediction) 该方向关注在比原始输入单元更高的抽象层级上进行预测,而非直接重建细粒度信号: - \*\*Joint-Embedding Predictive Architectures (JEPA)\*\*:通过预测保留语义结构但丢弃难以预测的细节的潜在目标来学习表示,已在图像(I-JEPA)和视频(V-JEPA、V-JEPA 2)中取得突破。 - \*\*Large Concept Models\*\*:将完整句子映射到共享的连续句子嵌入空间,并在该空间中进行抽象层级自回归建模。 - \*\*与本文的区别\*\*:上述方法通常依赖连续预测空间或由独立编码器定义的目标;而 NCP-ArchPreview 在语言模型内部学习离散概念空间,并保留标准的 token 级生成接口。 ### 2. 层级与潜在空间语言建模(Hierarchical and Latent-Space Language Modeling) 该方向从两个维度展开:一是潜在表示的构建方式,二是预测目标或训练目标的设定。 \*\*基于固定或动态层级结构的压缩方法:\*\* - \*\*Hourglass Transformer\*\*:通过预定义的多尺度分辨率对 token 序列进行压缩与上采样。 - \*\*MegaByte\*\*:在固定字节块(byte patches)上进行全局建模,并在每个块内进行局部建模。 - \*\*ContextLM\*\*:学习预测性上下文嵌入。 - \*\*Byte Latent Transformer (BLT)、DLCM、H-Net\*\*:采用动态或输入自适应的分块策略,使潜在边界或块大小随输入变化。 \*\*改变预测目标或引入潜在状态的方法:\*\* - \*\*Multi-Token Prediction (MTP)\*\*:增加辅助头来预测多个未来 token,但监督信号仍锚定在单个表面 token 上。 - \*\*基于潜在推理或连续概念的方法\*\*:在生成过程中交错或预测连续隐状态。 - \*\*ConceptLM\*\*:本文的直接基础工作,首次提出离散概念级目标 NCP,联合学习乘积量化概念词汇表,并以预测概念条件化 token 生成。ConceptLM 验证了从零开始训练至 1.5B 参数以及对现有 8B 模型进行持续预训练的可行性;NCP-ArchPreview 则在此基础上,将 NCP 应用于从头开始的 8.9B 模型、历经数万亿 token 的完整预训练阶段及后续阶段。 ### 3. 深度 Transformer 中的残差连接(Residual Connections in Deep Transformers) 该方向致力于缓解标准残差连接在深度累积过程中的信息瓶颈,实现跨层表示的选择性复用: - \*\*DenseFormer\*\*:使用与输入无关的学得权重,对先前各块的输出进行深度加权平均。 - \*\*DeepCrossAttention\*\*:使用输入相关权重聚合层输出,并引入深度方向的交叉注意力。 - \*\*MUDDFormer\*\*:为查询、键、值和残差流分别预测基于 token 条件的密集连接权重;本文的 \*\*Intra-Module Residual Connections (IRC)\*\* 即源于此。 - \*\*Attention Residuals / Block AttnRes\*\*:通过 softmax 注意力机制聚合先前层输出,并提供块级变体以支持可扩展训练。 - \*\*Depth-Attention\*\*:将跨层选择嵌入自注意力内部,通过现有 QKV 路径混合早期值状态。 NCP-ArchPreview 采用 MUDDFormer 的单流动态密集连接作为 IRC,实现模块内的全历史复用;并进一步提出 \*\*Cross-Module Residual Connections (CRC)\*\*,支持在 Token Encoder、Concept Module 与 Token Decoder 之间进行目标条件化的深度选择。 ### 4. 潜在扩散与语言模型中的高级抽象(背景动机) - \*\*视觉合成中的潜在扩散\*\*:将生成过程从原始像素转移到紧凑连续表示,显著提升了建模效率与可扩展性。 - \*\*语言模型中的高级抽象\*\*:近期研究表明,语言模型在其隐藏状态中会诱导出语义概念和潜在世界表征等高层抽象,但在标准 NTP 下,这些抽象仅是间接副产品。NCP-ArchPreview 通过显式的概念预测目标,将这一潜在能力转化为有监督的学习信号。 Q3: 论文如何解决这个问题? 该论文通过将\*\*下一概念预测(Next Concept Prediction, NCP)\*\*嵌入标准的\*\*下一词预测(Next Token Prediction, NTP)\*\*框架,构建了一种端到端的潜在空间自回归架构。具体解决方案可从以下七个方面展开: --- ### 1. 三模块层级架构 模型将传统 Transformer 分解为三个功能模块,在 token 级表示流中插入显式的概念级通路: - \*\*Token Encoder\*\*(16层):将输入序列映射为 token 级隐状态 h_(1:T) ; - \*\*Concept Module\*\*(8层):在压缩后的概念序列上进行自回归预测; - \*\*Token Decoder\*\*(16层):接收融合了概念信号的 token 表示,执行标准的下一词生成。 该设计保证了输入输出接口与标准自回归模型完全一致,同时在中层引入了抽象层级。 --- ### 2. 从隐状态构建离散概念词汇表(VQ) 为了获得结构化的概念监督目标,论文不依赖外部编码器,而是直接从 Token Encoder 的隐状态学习离散概念空间: 1. \*\*连续概念提取\*\*:对每 k 个连续 token 隐状态做均值池化,得到连续概念序列:

cm = (1) / (k)∑(i=1)^(k) h_((m-1)k+i), quad c_m ∈ R^d

  1. **乘积量化(Product Quantization)**:将每个概念向量切分为 S 段,每段独立匹配一个包含 N 个码字的码本:
    nm^s = argmin(n) |cm^s - e_n^s|_2^2, quad d_m^s = e(nm^s)^s
    最终量化概念通过拼接各段得到:
    d_m = concat(d_m^1, dots, d_m^S)
    乘积量化以较小的码本规模(每段仅 N 个条目)获得了极大的组合容量(共 N^S 种可能),从而构建了丰富且离散的潜在目标空间。 —- ### 3. 自回归下一概念预测 在学到的离散概念空间上,Concept Module 以自回归方式预测未来概念: - 给定历史概念序列 c
    (<m) ,Concept Module 输出隐状态:

um = ConceptModulec)(c(<m))

  • 对每个量化段 s ,使用预测头输出码本上的概率分布:
    π_m^s = softmax(PredictionHead_c^s(u_m))
  • 为避免不可微的 argmax/采样操作,采用**分布的期望**作为可微分预测:
    cm^s = ∑(n=1)^(N) π_(m,n)^s e_n^s, quad c_m = concat(c_m^1, dots, c_m^S)
    这种加权码字构造既保持了端到端可微性,又将预测严格约束在学到的概念空间内,避免了连续回归目标的无界漂移问题。 —- ### 4. 将预测概念注入 Token 流以指导生成 为了让概念预测真正影响词级生成,论文设计了从概念粒度到 token 粒度的对齐与注入机制: - **重复与因果移位**:将每个预测概念 c 重复 k 次,并施加因果移位 Delta=k ,确保概念信号仅在生成后续 token 时介入,防止信息泄露:

bt = 0, & 1 le t < Delta c(lfloor(t-Delta)/krfloor+2), & Delta le t < T

  • **残差融合**:概念嵌入与 token 隐状态直接相加:
    h_t = h_t + b_t
  • **解码**:Token Decoder 基于融合后的表示进行标准自回归解码:
    p(x(t+1)|x(le t)) = P(θ_d)(h(le t))
    —- ### 5. 层级残差连接(Hierarchical Residuals) 为缓解三个模块在深度与序列粒度上的差异,论文引入了动态层级残差路由: - **模块内残差连接(IRC)**:在每个模块内部,不再使用固定深度的残差相加,而是允许每一层动态加权组合该模块内所有先前层的状态:

X_ell^s = H_1^s, H_1^s+R_1^s, dots, H_ell^s+R_ell^s

H(ell+1)^s = ∑(j=1)^(ell+1) w(ell,j)^s X(ell,j)^s

  • **跨模块残差连接(CRC)**:在模块间建立动态信息通路,包括 - Token Encoder to Concept Module - Token Encoder to Token Decoder - Concept Module to Token Decoder 源模块表示经粒度对齐后,由目标模块状态生成加权系数,并以学得的对角缩放进行残差注入:
    α(s arrow u)^ell = softmax(MLP(s arrow u)^ell(T_ell^s))

M(s arrow u)^ell = ∑(j=1)^(K) α_(s arrow u,j)^ell LN(S_j^u)

Tell^(s,out) = T_ell^s + D(s arrow u)^ell odot M_(s arrow u)^ell
—- ### 6. 联合端到端训练目标 三个组成部分通过单一损失函数联合优化:

L(total) = L(NTP) + α L(NCP) + β L(VQ)
其中: - **下一词损失** L(NTP) :标准因果语言建模交叉熵,确保 token 级生成能力;
L
(NTP) = -(1) / (T-1)∑(t=1)^(T-1) log pd)(x(t+1)|h_(le t))

  • **下一概念损失** L(NCP) :均方误差,监督 Concept Module 预测下一连续概念(目标梯度截断):
    L
    (NCP) = (1) / (M-1)∑_(m=2)^(M) |c_m - sg(c_m)|_2^2
  • **矢量量化损失** L(VQ) :仅更新码本条目,使其逼近连续概念分布:
    L
    (VQ) = (1) / (MS)∑(m=1)^(M)∑(s=1)^(S) |sg(cm^s) - d_m^s|_2^2
    通过梯度截断(stop-gradient)设计, L
    (VQ) 不直接改变 Token Encoder, L(NCP) 的目标不反向传播至当前概念编码,从而稳定地解耦各子目标的学习。 —- ### 7. 保留标准自回归生成接口 尽管引入了潜在空间预测,NCP-ArchPreview 在推理时仍然保持标准的逐词自回归解码流程。Concept Module 预测的离散概念被实时反馈回 token 流,无需任何外部编码器或复杂的后处理,因此兼容现有的投机解码、领域自适应等下游技术。 —- **总结**:该论文通过**显式构建离散概念空间**、**在潜在空间上施加自回归监督**、**将概念预测残差注入词级表示**,并辅以**层级动态残差连接与联合优化**,系统性地解决了标准 NTP 缺乏多 token 语义跨度显式监督的问题,在保持标准生成接口的同时显著提升了训练效率与模型性能。 Q4: 论文做了哪些实验? 论文围绕 **NCP-ArchPreview** 的架构设计、训练效率、下游性能及潜在空间应用,开展了一系列系统实验,主要包括以下九个方面: —- ### 1. 主训练与下游基准评估 在与 **OLMo-3-7B** 完全相同的 **5.73T** token 数据上,对比了 Stage-1 与 Stage-2 两个训练阶段的完整表现: - **训练损失动态**:NCP-ArchPreview 仅用 OLMo-3-7B **51.3%** 的训练 token 即达到其最终 Stage-1 损失,收敛速度提升 **1.95×**;Stage-2 亦保持 **1.51×** 收敛优势(图 1)。 - **下游宏观平均**:覆盖 30 余个基准家族(涵盖 MMLU、GSM8K、MATH-500、HumanEval、MBPP、ARC、HellaSwag 等)。Stage-1 宏观平均提升 **2.45** 个百分点,其中 GSM8K 提升 **5.99** 个百分点;Stage-2 宏观平均提升 **0.59** 个百分点(表 1)。 - **损失与能力的关系**:追踪了 Stage-1 不同检查点的下游得分轨迹,验证了训练损失的持续下降与模型能力的持续提升基本对应。 —- ### 2. 参数量与计算量对齐的受控消融 为排除性能增益来自简单增加参数或计算量,构建了严格对齐的基线(表 2): - **Vanilla**(32 层,与 OLMo-3-7B 同规模) - **Vanilla size-aligned**(40 层,参数量与 NCP-ArchPreview 对齐) - **Vanilla computation-aligned**(34 层,计算量与 NCP-ArchPreview 对齐) 结果显示,NCP-ArchPreview 显著优于 Vanilla 及 Vanilla computation-aligned,且以仅 **85%** 的计算量逼近 Vanilla size-aligned 的性能(图 3)。 —- ### 3. 渐进式模块消融 在同一训练设置下,从标准 OLMo-3-7B 出发逐步叠加组件,验证各部分的独立贡献: - **Vanilla + CM**(仅加 Concept Module) - **Vanilla + CM + Residual**(再加层级残差连接) - **Vanilla + CM + Residual + NCP**(完整 NCP-ArchPreview) 损失曲线表明:Concept Module、Residual 与 NCP 目标依次带来单调递减的训练损失,确认性能提升源于架构与目标的本质设计,而非表层容量膨胀(图 3)。 —- ### 4. 层级残差连接变体对比 在 **1B** 规模模型上,对比了多种跨层/跨模块连接方案(表 3): - **IRC only**(仅模块内动态残差) - **IRC + CRC**(完整层级残差,含跨模块路由) - **IRC + Input-Level Cross-Module Connections** - **IRC + All-Stage Softmax** - **Block AttnRes + Cross-Module Connections** 实验表明 **IRC + CRC** 组合在仅增加 **0.051%** 分析训练 FLOPs 的情况下,获得最大损失降幅( -0.0323 )。 —- ### 5. Scaling Law(扩展法则) 在多个固定 FLOPs 预算( 10^(19) 至 10^(20) )下,通过搜索最优超参数与模型/数据配比,绘制了 IsoFLOP 曲线(图 4)。NCP-ArchPreview 相较于 OLMo-3 展现出 **1.74×** 的计算帕累托效率提升。 —- ### 6. 训练数值稳定性分析 针对使用 **Muon** 优化器与层-wise Q/K 归一化时出现的注意力 logit 爆炸问题,进行了系统诊断: - 观测到注意力 logit 持续增长、Q/K 范数出现离群头、梯度范数尖峰(图 5)。 - 通过对比 AdamW 与 Muon 基线,以及替换为 **per-head Q/K 归一化**,定位到不稳定性主要源于全矩阵 Muon 更新与层-wise 归一化之间的耦合(图 6)。该发现作为训练干预的消融报告,主实验仍保持与 OLMo-3-7B 一致的层-wise 配置以确保可比性。 —- ### 7. 概念空间的轻量级领域自适应(VQ Training) 验证了冻结主干、仅更新 **17M** 参数的 VQ 模块(码本与预测头)即可实现高效的领域迁移: - **代码自适应**(Magicoder):在 HumanEval、HumanEval+、MBPP、MBPP+ 上,VQ 训练提升代码平均 **+2.65**,且是唯一能避免 MBPP+ 灾难性遗忘的设定(表 5)。 - **数学自适应**(Orca-Math):VQ 在数学平均上提升 **+4.27**,且在通用能力保留上优于 LoRA 与全参数微调(表 6)。 - **知识自适应**(TriviaQA-RC):VQ 将 TriviaQA 精确匹配提升 **+9.19**,同时通用平均几乎无损(**+0.03**)(表 7)。 - **效率**:相较于全参数微调,VQ 训练吞吐提升 **2.02×**,显存占用降低 **64%**;相较于同参数量的 LoRA,吞吐仍提升 **1.50×**(图 7)。 —- ### 8. 与多词预测(MTP)的协同效应 在 **3B** 规模上构建了 NCP-ArchPreview 与残差对齐的 OLMo-3-3B 基线,验证 NCP 与 MTP 的兼容性: - NCP-ArchPreview 本身即优于残差对齐基线( Delta loss = -0.0098 )。 - 在 NCP-ArchPreview 上叠加 MTP 可获得进一步增益( Delta loss = -0.0141 ),且以略低的 FLOPs 优于 OLMo-3 + Residual + MTP(表 8、图 8)。 —- ### 9. 概念表示加速投机解码 探索了概念空间在推理阶段的实用价值:将 Concept Module 产生的块级概念表示注入 **DFlash2** 块并行投机解码的草稿模型(Drafter): - 在 GSM8K、MATH、HumanEval、MBPP 上,平均接受长度(MAL)的宏观平均提升 **4.17%**(从 5.933 提升至 6.180),其中 HumanEval 提升达 **7.59%**(表 9)。 - 该注入仅增加 **0.04M** 参数,几乎无额外计算开销。 —- ### 10. 中期训练数据筛选的代理指标(附录) 为减少完整下游评估的开销,在 Stage-2 阶段构造了包含 177,202 条专家轨迹的代理评测集,验证了基于 **能力感知负对数似然(capability-specific NLL)** 的配方筛选与下游排名高度一致(Spearman/Rank agreement),并给出了线性拟合的 R^2 分析(附录 C、图 9、表 11)。 —- ### 11. 扩展实验细节与检查点轨迹(附录) - 提供了 Scaling Ladder 的完整实验配置与验证损失(附录 D、图 10、表 12)。 - 公开了 Stage-1 每 100K 步检查点的完整下游性能轨迹,涵盖 30 余项基准的变化过程(附录 E、表 14)。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与讨论,以下是可以进一步探索的研究方向: —- ### 1. 长上下文训练与扩展 论文明确指出当前架构预览未包含长上下文训练,但概念级通路天然地在序列压缩上具备优势: - **更长依赖的概念一致性**:Concept Module 以 k=4 的压缩因子操作,若扩展至数万甚至数十万 token 的上下文,概念预测能否更有效地捕获长程语义结构? - **上下文长度与压缩因子的联合缩放**:当上下文从 8K 扩展至 128K 或 1M 时,最优的概念压缩因子 k 、Concept Module 深度与码本容量如何重新配置? —- ### 2. 训练后阶段(Mid-training / Post-training)的策略优化 论文观察到 Stage-2 后训练损失的持续降低并未如 Stage-1 般线性转化为下游宏观平均的显著提升: - **能力感知的数据筛选(Capability-Aware Data Curation)**:附录 C 展示了基于代理集的 NLL 可预测代码与数学能力,但如何将这种感知机制融入动态数据混合比例调整,以针对性强化特定领域? - **检查点选择准则**:结合语言模型损失、下游任务性能与代理评测指标,建立更鲁棒的早停与检查点筛选策略,避免过拟合于训练分布而偏离评测分布。 - **领域自适应的深层机制**:第 5.1 节发现 VQ 训练在事实知识(TriviaQA)上的增益弱于全参数微调,因其无法直接改写 Backbone MLP 中的事实关联。如何设计概念空间与 FFN 键值记忆的协同更新机制,以实现轻量级且有效的知识编辑? —- ### 3. 概念空间的结构、可解释性与应用 论文初步验证了概念表示在投机解码(第 5.3 节)与领域自适应(第 5.1 节)中的价值,但概念空间的潜力远未充分挖掘: - **概念层级与多粒度**:当前使用单一压缩因子 k=4 与单一层级概念。引入**多尺度概念层级**(如短语级、句子级概念)是否能进一步提升对多层次语义结构的建模? - **概念空间的可解释性**:乘积量化码本 E^s 中的条目是否对应可解释的语义单元(如句法角色、实体类型、推理步骤)?通过可视化与探测实验分析概念激活模式,可为语言模型的内部表征提供新的理解视角。 - **概念驱动的推理与规划**:若概念序列可视为高层思维链,能否显式地利用概念预测进行**多步规划**或**自我修正**,而非仅作为辅助信号? —- ### 4. 架构与目标函数的联合扩展 - **NCP 与多词预测(MTP)的深度融合**:第 5.2 节显示二者可协同,但当前仅采用浅层 MTP 头。将概念预测与更多未来 token 位置或块级扩散目标结合,可能进一步缩小潜在空间与表面生成之间的粒度差距。 - **连续-离散混合概念空间**:论文采用离散 VQ 空间以保证结构化目标。探索**连续概念嵌入**与**离散码本**的混合训练(如部分段连续回归、部分段离散预测),或采用有限标量量化(FSQ)等替代方案,可能提升表示效率。 - **动态概念边界**:当前概念边界固定为 k=4 个 token。引入输入自适应的动态分块(类似 BLT 或 H-Net 的思想),让概念边界依据语义完整性自动调整,或能更精确地对齐多 token 语义单元。 —- ### 5. 计算效率与系统级优化 - **概念模块的推理开销权衡**:Concept Module 在训练时以压缩序列运行,但推理阶段仍需维护双路前向传播。研究 Concept Module 的**深度/宽度剪枝**或**早期退出**机制,可在保留概念指导的同时降低延迟。 - **投机解码的深度整合**:第 5.3 节仅通过简单残差注入概念信号。将概念表示作为 Drafter 的**跨层注意力源**或**块级生成条件**,可能带来更大的接受长度提升。 —- ### 6. 理论分析 - **为什么 NCP 加速收敛?** 论文展示了 1.95× 的收敛速度,但其理论机制尚不清楚:是因为概念预测提供了**去噪后的高层梯度信号**,还是因为多 token 跨度监督增加了有效批次中的独立信息量? - **潜在空间预测的泛化界**:在标准 NTP 的泛化分析框架下,引入潜在空间目标如何改变模型的 Rademacher 复杂度或 PAC-Bayes 界? —- ### 7. 跨模态迁移 JEPA 范式在视觉与视频中的成功启发了一个更宏大的问题:NCP-ArchPreview 中学到的离散概念词汇表能否作为**跨模态共享的抽象接口**,例如用于图像-文本对齐或多模态推理中的概念级对齐? Q6: 总结一下论文的主要内容 这篇论文介绍了 **NCP-ArchPreview**,一种通过在潜在空间中联合建模离散概念与标准词元,将自回归预训练从纯下一词预测(NTP)扩展到下一概念预测(NCP)的新型语言模型架构。以下是主要内容的结构化总结: —- ### 1. 核心问题与动机 - **标准NTP的局限**:现有语言模型的预训练监督严格局限于细粒度词元级别,模型只能间接地学习跨越多词元的语义概念结构,缺乏对高层抽象依赖关系的显式建模。 - **潜在空间建模的启示**:视觉领域的潜在扩散模型已证明,在紧凑的潜在空间中生成可极大提升效率;语言模型虽在隐状态中诱导出高层抽象,但标准NTP未将其作为显式预测目标。 —- ### 2. 架构设计 NCP-ArchPreview 基于 OLMo-3-7B 骨干,采用**三模块层级架构**: - **Token Encoder**(16层):产生词元级隐状态 h(1:T) 。 - **Concept Module**(8层):通过自回归预测下一概念,在压缩后的潜在序列上操作。 - **Token Decoder**(16层):接收融合了概念信号的词元表示,执行标准下一词生成。 **关键技术组件:** - **离散概念词汇表构建**:对每 k=4 个词元的隐状态进行均值池化得到连续概念,再通过**乘积量化(Product Quantization)**映射到结构化离散码本。共 S=32 个码本段,每段 N=128 个码字,组合容量达 128^(32) 。 - **可微概念预测**:Concept Module 输出各码本段上的概率分布,以**码字期望**(而非不可微的 argmax)作为预测概念 c_m ,保持端到端梯度传播。 - **因果注入机制**:预测概念经重复与因果移位后,以残差方式注入 Token Decoder:

h_t = h_t + b_t

  • **层级残差连接**:包括模块内动态残差(IRC)与跨模块残差(CRC),支持不同深度与抽象层级间的信息流。 —- ### 3. 训练目标 模型通过单一损失函数联合优化三个目标:

L(total) = L(NTP) + α L(NCP) + β L(VQ)

  • ** L(NTP) **:标准下一词交叉熵损失。 - ** L(NCP) **:下一概念预测的均方误差,目标梯度截断,监督 Concept Module 与 Token Encoder。 - ** L_(VQ) **:矢量量化损失,仅更新码本条目以拟合连续概念分布。 —- ### 4. 主要实验结果 在 5.73T tokens 的 Dolma-3 数据集上训练 8.9B 参数模型,主要发现包括: - **训练效率**:NCP-ArchPreview 仅用 OLMo-3-7B **51.3%** 的训练 token 即达到其 Stage-1 最终损失,收敛速度提升 **1.95×**;Stage-2 提升 **1.51×**。 - **下游性能**:Stage-1 下游宏观平均超越 OLMo-3-7B **2.45** 个百分点,其中 GSM8K 提升 **5.99** 分;Stage-2 宏观平均提升 **0.59** 分。 - **受控消融**: - 与计算量对齐的基线相比,NCP-ArchPreview 表现显著更优,证明提升并非来自额外计算。 - 以参数量对齐的 40 层 Transformer 为参照,NCP-ArchPreview 仅用 **85%** 的计算量即逼近其性能。 - **Scaling Law**:在 10^(19) 至 10^(20) FLOPs 范围内,计算帕累托效率较 OLMo-3 提升 **1.74×**。 - **数值稳定性**:发现 Muon 优化器与层 wise Q/K 归一化存在耦合导致的不稳定性,per-head 归一化可有效抑制。 —- ### 5. 潜在空间的后续应用 论文进一步验证了所学概念空间在预训练后的实用价值: - **轻量级领域自适应(VQ Training)**:冻结 8.9B 主干,仅更新 **17M** 参数的 VQ 码本与预测头,即可实现高效的领域迁移。在代码、数学与知识自适应中,VQ 训练在吞吐量上较全参数微调提升 **2.02×**,较同规模 LoRA 提升 **1.50×**,且显著缓解灾难性遗忘。 - **加速投机解码**:将概念表示注入 DFlash2 块并行投机解码的草稿模型,仅增加 0.04M 参数,即将平均接受长度(MAL)提升 **4.17%**(HumanEval 上达 7.59%)。 —- ### 6. 结论与意义 NCP-ArchPreview 提供了迄今为止**最大规模的潜在空间语言模型验证**(8.9B 参数、5.73T tokens),证明联合词元与概念建模不仅是有效的辅助目标,更是一种**高效且可扩展的下一代基础模型架构蓝图**。通过显式预测离散概念,模型在优化效率、下游推理能力与后续轻量化适配方面均展现出显著优势,为自回归语言模型向潜在空间演进提供了系统的技术路径与开源基础。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Intern-NCP Team, Jiaqi Cao, Chiyu Chen, Shuang Cheng, Xu Cheng, Beiya Dai, Yufan Feng, Kewen Ge, Ruijun Ge, Jiayi Huang, Yang Jiao, Dahua Lin, Zhouhan Lin, Yifan Liu, Yuliang Liu, Biqing Qi, Mowen Ruan, Junzhe Shen, Yunchong Song, Hao Sun, Zhongbo Tian, Yixuan Wang, Rubin Wei, Jiaxin Xiong, Kangyu Yang, Qian Yao, Qi Zhang, Bowen Zhou

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10715.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10715

Published: 2026-09-13T01:24:45.019Z


3. CMNIE: An Information Extraction Benchmark for Chinese Military News

Abstract:Structured extraction from Chinese military news supports intelligence analysis, decision-making, and knowledge base construction. However, existing resources provide limited support for joint informa?tion extraction in this domain, especially when events, event arguments, entities, and relations must be modeled together. We present CMNIE, an information extraction benchmark for Chinese military news. Extend?ing military-domain resources beyond document-level event annotations, CMNIE jointly annotates event triggers, event arguments, named enti?ties, and entity relations under a unified domain schema. The dataset contains 13,000 instances collected from public Chinese military news, with manual annotations for 7 event types, 10 argument roles, 7 entity types, and 8 relation types. We evaluate supervised IE models, zero-shot large language models, and fine-tuned LLM-based extraction methods on a shared test set. Experimental results show that CMNIE remains chal?lenging, especially for relation extraction and exact matching of event?argument spans; zero-shot LLMs often identify relevant semantic units but fail to match gold span boundaries exactly. CMNIE provides a stan?dardized benchmark for studying schema adherence, exact span match?ing, and joint structured extraction in specialized Chinese news.

中文摘要

摘要:从中国军事新闻进行结构化信息抽取有助于情报分析、决策制定和知识库建设。然而,现有资源在该领域的联合信息抽取方面支持有限,尤其是在需要同时建模事件、事件论元、实体和关系时。我们提出了 CMNIE,这是一个针对中国军事新闻的信息抽取基准。CMNIE 在文档级事件标注之外扩展了军事领域资源,统一标注事件触发词、事件论元、命名实体和实体关系。该数据集包含 13,000 个实例,数据来自公开的中国军事新闻,并对 7 种事件类型、10 个论元角色、7 种实体类型和 8 种关系类型进行了人工标注。我们在共享测试集上评估了监督信息抽取模型、零样本大型语言模型和微调 LLM 的抽取方法。实验结果显示 CMNIE 仍具有挑战性,尤其是在关系抽取和事件论元区间的精确匹配方面;零样本 LLM 通常能够识别相关语义单元,但无法精确匹配标准区间边界。CMNIE 为研究模式遵循、精确区间匹配以及专业中文新闻的联合结构化抽取提供了一个标准化基准。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10722 (HTTP 429)

Authors: Yan Yu, Mengna Zhu, Zhenyu Song, Hao Yang, Haiwen Chen, Mao Wang

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10722.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10722

Published: 2026-09-13T01:24:45.019Z


Abstract:Multimodal entity linking grounds entity mentions in text and images to knowledge-base entries. These systems degrade on rare entities, but prior work measures rarity primarily through popularity-based metrics such as pageviews. We broaden this view using knowledge-graph structural metrics that capture how well an entity is documented and connected. These metrics identify many rare entities that popularity metrics miss. Across the resulting rare-entity slices, state-of-the-art accuracy drops by 15.4-39.9%, showing that different rarity definitions expose different failure modes. To address these failures, we introduce a simple, training-free framework in which a reasoning-capable vision-language model iteratively searches and reasons over Wikipedia, gathering evidence dynamically. Controlled experiments show that reasoning and retrieval are complementary. Reasoning alone does not significantly improve accuracy on rare entities. Retrieval without reasoning improves rare-entity accuracy but can hurt overall accuracy. Their combination performs best. On MERLIN, a multilingual multimodal entity linking benchmark over five languages (Hindi, Indonesian, Japanese, Tamil, Vietnamese), our best system improves over the state of the art by 6.9% overall and by up to 23.3% on rare-entity slices. We release MERLIN-Rare, rare-entity test slices for targeted evaluation, with our framework.

中文摘要

摘要:多模态实体链接将文本和图像中的实体提及与知识库条目相连接。这些系统在处理罕见实体时性能下降,但以往工作主要通过基于流行度的指标(如页面浏览量)来衡量罕见性。我们利用知识图谱结构指标扩展了这一视角,该指标可以捕捉实体被记录和连接的程度。这些指标识别出了许多流行度指标未能发现的罕见实体。在这些罕见实体切片中,最先进的准确率下降了15.4%至39.9%,表明不同的罕见性定义揭示了不同的失败模式。为应对这些失败,我们引入了一个简单的、无需训练的框架,其中具备推理能力的视觉-语言模型在维基百科上迭代地搜索和推理,动态收集证据。对照实验表明,推理与检索是互补的。单独依靠推理并不能显著提高罕见实体的准确率。仅进行检索能够提高罕见实体的准确率,但可能会影响整体准确率。两者结合效果最佳。在MERLIN——一个覆盖五种语言(印地语、印尼语、日语、泰米尔语、越南语)的多语言多模态实体链接基准——上,我们的最佳系统在整体上较最先进技术提高了6.9%,在罕见实体切片上提升最多达23.3%。我们发布了MERLIN-Rare,其中包含用于针对性评估的罕见实体测试切片,以及我们的框架。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10745 (timeout of 15000ms exceeded)

Authors: Parinthapat Pengpun, Simran Khanuja, Graham Neubig

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10745.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10745

Published: 2026-09-13T01:24:45.019Z


5. Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu

Abstract:Multilingual large language models (LLMs) are increasingly used for open-ended text generation, yet their behaviour in low-resource languages remains poorly understood. In this work, we question how correct and reliable is the generation of multilingual LLMs when used for the task of story generation. We consider Urdu language as a representative low-resource language. We generate Urdu-Stories, a corpus of 93 stories generated using three contemporary LLMs (GPT-5.1, Qwen-3-Max, DeepSeek-3.1). We manually annotate the errors present in them under a nine-label linguistic, semantic, and cultural taxonomy. Our notable findings suggest that LLMs often make basic errors of grammar and semantics. The stories lack coherence, have unnatural repetition and show pervasive cultural shallowness. We further show using few-shot prompting that the cultural and context errors largely remain unresolved. Our findings highlight the limitations of current LLMs as a reliable source of content generation and information retrieval for low-resource languages.

中文摘要

摘要:多语言大型语言模型(LLM)在开放式文本生成中应用越来越多,但其在低资源语言中的表现仍然知之甚少。在本工作中,我们探讨了多语言LLM在用于故事生成任务时,其生成内容的正确性和可靠性。我们将乌尔都语作为代表性的低资源语言进行研究。我们生成了乌尔都语故事(Urdu-Stories),该语料库包含使用三种当代LLM(GPT-5.1、Qwen-3-Max、DeepSeek-3.1)生成的93个故事。我们根据九类语言学、语义和文化分类,对其中存在的错误进行了人工标注。我们的显著发现表明,LLM经常出现基本的语法和语义错误。故事缺乏连贯性,存在不自然的重复,并表现出普遍的文化浅薄性。我们进一步通过少样本提示展示了文化和上下文错误在很大程度上仍未解决。我们的研究结果凸显了当前LLM作为低资源语言内容生成和信息检索可靠来源的局限性。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10758 (HTTP 429)

Authors: Farah Adeeba, Abdul Rafae Khan, Rajesh Bhatt, Hassan Sajjad

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10758.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10758

Published: 2026-09-13T01:24:45.019Z


6. Analyzing Traditional and Neural Approaches to Multilingual Readability Assessment

Abstract:Transformer-based models excel at Automatic Readability Assessment (ARA), yet feature-based models remain in active use because their predictions tie back to linguistic properties. This matters because readability labels are subjective and rater-dependent, so high accuracy on noisy ground truth may reflect surface patterns rather than the linguistic structure that defines difficulty. We test whether transformers internalize the same features as traditional models across Arabic, English, French, Hindi, and Russian using the ReadMe++ dataset. Shapley Additive Explanations (SHAP) identify the features driving traditional classifiers, which we then use as TCAV concept sets to probe multilingual XLM-R and language-specific encoders. Transformers recover surface-length, syntactic, and lexical-diversity signals, and reflect the ordinal CEFR structure of the traditional models. Alignment varies by model family, language, and layer, with language-specific encoders tracking traditional models more clearly than XLM-R. High linear separability does not always imply directional influence, limiting linear probing for count-based readability features.

中文摘要

摘要:基于Transformer的模型在自动可读性评估(ARA)中表现出色,但基于特征的模型仍在广泛使用,因为它们的预测可以追溯到语言学属性。这一点很重要,因为可读性标签具有主观性且依赖评分者,因此在噪声真实数据上高精度可能反映的是表层模式,而非定义难度的语言结构。我们使用ReadMe++数据集测试Transformer模型是否在阿拉伯语、英语、法语、印地语和俄语中内化了与传统模型相同的特征。Shapley加法解释(SHAP)识别出驱动传统分类器的特征,然后我们将这些特征用作TCAV概念集来探测多语言XLM-R和语言特定编码器。Transformer能够捕捉表面长度、句法和词汇多样性信号,并反映传统模型的序数CEFR结构。对齐程度因模型家族、语言和层而异,语言特定编码器比XLM-R更清楚地跟踪传统模型。高线性可分性并不总意味着方向性影响,从而限制了基于计数的可读性特征的线性探测。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10792 (HTTP 429)

Authors: Joshua Wong, Chris Tanner

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10792.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10792

Published: 2026-09-13T01:24:45.019Z


7. Larger Context Window, Fewer Overcorrections: Optimizing Prompts and Batching for Minimal-Edit Grammatical Error Correction

Abstract:Minimal-edit Grammatical Error Correction (GEC) is a challenging task for zero- and few-shot prompted Large Language Models (LLMs), which systematically overcorrect and degrade $F{0.5}$ by rewriting well-formed spans. While fine-tuning provides an effective solution, it imposes substantial infrastructure demands. We introduce a prompt-based approach that closes the gap to fine-tuned models through three advances in GEC prompting methodology. First, we introduce taxonomy-based instructions to enforce minimal-edit constraints with a comprehensive list of grammatical error rules, equipping the LLM with a bounded, metric-aligned scope of correctable edits, which benefits the strongest models while remaining model-dependent overall. Second, we show that batching multiple uncorrected sentences into a single input context acts as a targeted regularizer against overcorrection, systematically reducing the edit rate across diverse LLM families; we hypothesize this arises from attention dilution effect induced by the bounded capacity of self-attention scores. Finally, LLM-assisted Prompt Optimization refines these instructions. Powered by Gemini 3.1-Pro, our prompt achieves $F{0.5}=78.32$ on the BEA-2019 test set - establishing a new prompt-based SOTA while shrinking the gap to the fine-tuned single-model SOTA (Staruch et al., 2025) to a mere $0.38$ points. Code, prompts, and outputs are publicly available.

中文摘要

摘要:最小编辑语法错误纠正(Minimal-edit Grammatical Error Correction, GEC)对于零样本和少样本提示的大型语言模型(LLM)来说是一项具有挑战性的任务,这些模型往往会系统性地过度纠正,并通过重写良构片段而降低 $F{0.5}$。虽然微调提供了一种有效的解决方案,但它对基础设施提出了较高要求。我们提出了一种基于提示的方法,通过在GEC提示方法上的三项进展缩小了与微调模型的差距。首先,我们引入了基于分类法的指令,通过全面的语法错误规则清单来强制最小编辑约束,为LLM提供了有界、与评测指标对齐的可纠正编辑范围,这不仅有利于最强模型,同时整体上仍依赖于具体模型。其次,我们展示了将多个未纠正的句子批量输入到单一上下文中,能够作为针对过度纠正的有针对性的正则化手段,系统性地降低了各类LLM的编辑率;我们推测这源于自注意力分数的有界容量引起的注意力稀释效应。最后,LLM辅助提示优化(LLM-assisted Prompt Optimization)进一步精炼了这些指令。在Gemini 3.1-Pro的支持下,我们的提示在BEA-2019测试集上实现了 $F{0.5}=78.32$,建立了新的基于提示的SOTA,同时将与微调单模型SOTA(Staruch 等, 2025)的差距缩小至仅 $0.38$ 点。代码、提示和输出均已公开。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10810 (HTTP 429)

Authors: Kateryna Karpo, Artem Chernodub

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10810.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10810

Published: 2026-09-13T01:24:45.019Z


8. Detectable Only Where It Is Confounded: What Verified Duplication Counts Say About Membership Evidence in Language Models

Abstract:When a language model finds a sentence unusually cheap to predict, it is tempting to conclude that the sentence was in its training data. Almost every published test of that inference has had to guess which sentences were in the training data, the members, and which were not. This paper removes the guessing. Two model families, OLMo-2 and Pythia, publish their pretraining corpora, and a public index over those corpora returns the exact number of times any sentence appeared in each. Those counts make three questions answerable directly. The answers form a pincer, closing from two sides. At the duplication levels ordinary text actually has, five models from 1B to 13B parameters carry at most a faint trace of their own exposure. We measure that trace with a design that reads the same sentence through two models, which cancels fluency and quality by construction, and it comes to a rank correlation near -0.08, where -1 would be a perfect relation and 0 none. Where the trace does become strong, above roughly a thousand copies, the two corpora agree on which sentences those are, because they are the famous ones, so exposure can no longer be told apart from fame. Two further measurements show how apparent membership signal gets manufactured. A common way to build a non-member is to change one word of a member. The model does prefer the original, but the gap is the same whether the original appeared once or a hundred times, so what the model is rewarding is the author’s word choice, not memory. Above a thousand copies the gap grows with model size on the twelve sentences we can test there, at the same boundary where the pincer closes. And swapping the controls for sentences that differ from the members in register moves a detector from 0.83 to 0.94 AUC, on a scale where 0.5 is a coin flip and 1.0 is perfect separation. We release the sentence banks, counts, and code.

中文摘要

摘要:当语言模型发现一个句子异常容易预测时,很容易得出结论认为该句子出现在其训练数据中。几乎每一项已发表的相关推断测试都必须猜测哪些句子在训练数据中,哪些不在。本文消除了这种猜测。两个模型系列,OLMo-2 和 Pythia,公开了它们的预训练语料库,并且一个公共索引能够返回任意句子在每个语料库中出现的准确次数。这些计数使得三个问题可以直接回答。答案形成一个夹击,从两侧收拢。在普通文本实际存在的重复水平上,参数从 1B 到 13B 的五个模型最多只能携带其自身暴露的微弱痕迹。我们通过一个设计来测量这种痕迹,该设计通过两个模型读取相同的句子,从而在构造上抵消流畅性和质量,结果得出的秩相关接近 -0.08,其中 -1 表示完全相关,0 表示没有相关性。当痕迹确实变强时,大约在一千次复制以上,这两个语料库在确定这些句子方面一致,因为它们是著名句子,所以暴露无法再与知名度区分开。另有两项测量显示了显而易见的成员信号是如何被制造的。一种常见的构建非成员的方法是将成员的一个单词改变。模型确实更倾向于原句,但这种差距无论原句出现一次还是一百次都相同,因此模型奖励的实际上是作者的措辞,而不是记忆。在一千次复制以上,这种差距在我们可以测试的十二个句子上随模型规模增长达到更大,在夹击收紧的同一边界。此外,将控制组替换成在语域上与成员不同的句子,会使检测器的 AUC 从 0.83 提升到 0.94,该量表中 0.5 表示抛硬币,1.0 表示完全分离。我们发布了句子库、计数数据和代码。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10830 (HTTP 429)

Authors: Arman Nik Khah

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10830.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10830

Published: 2026-09-13T01:24:45.019Z


9. Does Linguistic Structure Enrichment Enhance Coherence Assessment? Not With Current Architectures

Abstract:Recent advances in large language models have transformed human-computer interaction. Despite their fluency, these models often produce texts that are grammatically correct but semantically incoherent, containing contradictions or disruptions in logical flow. This work investigates whether enriching text with syntactic and rhetorical information can improve incoherence prediction. Our experiments and analysis show that plain texts achieved higher accuracy because the added information was structurally and syntactically incompatible with the language model’s architecture. Additionally, to demonstrate the practical importance of coherence assessment, we performed zero-shot experiments on a Brazilian disinformation dataset, suggesting that textual coherence can serve as a proxy for detecting misleading content. Code and models are available at this https URL.

中文摘要

摘要:近期大型语言模型的进展已经改变了人机交互。尽管这些模型语言流畅,但它们经常生成语法正确但语义不连贯的文本,包含矛盾或逻辑流程中断。本研究探讨通过丰富文本的句法和修辞信息是否可以改善不连贯预测。我们的实验和分析表明,普通文本取得了更高的准确率,因为所添加的信息在结构和句法上与语言模型的架构不兼容。此外,为了展示连贯性评估的实际重要性,我们对一个巴西虚假信息数据集进行了零样本实验,结果表明文本连贯性可以作为检测误导性内容的代理。代码和模型可在该 https URL 获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10893 (HTTP 429)

Authors: Victor Mazzotti, Luiz Pereira, Marina Bitencourt dos Santos, Helena Maia, Carlos Caetano, Nádia Felix, Sandra Avila

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10893.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10893

Published: 2026-09-13T01:24:45.019Z


10. LLM-Anchored Paralinguistic Enrichment for Alzheimer’s Disease Detection

Abstract:Speech-based automatic detection of Alzheimer’s disease (AD) provides a non-invasive and scalable approach to early cognitive screening. AD affects both lexical-semantic organization and speech production, including atypical pauses and word elongations. However, existing methods have yet to fully integrate these paralinguistic cues with linguistic content. We propose LLM-Anchored Paralinguistic Enrichment (LAPE), which enriches LLM-derived linguistic representations with paralinguistic cues through three coordinated innovations. The first is prosodic event textualization, which enables the LLM to model pauses and elongations jointly with lexical content by encoding them as explicit markers with bounded duration-aware repetition. The second is lexico-prosodic unitization and chunking, which preserves event identity and magnitude in both modalities by pooling only consecutive word units. The third is text-anchored paralinguistic fusion, which integrates local and utterance-level speech features by using NormGate to normalize and dynamically scale them relative to text. We evaluate LAPE on ADReSS and ADReSSo using participant-level cross-validation and leave-one-subject-out evaluation. LAPE achieves state-of-the-art performance across all four primary settings. Code will be released upon acceptance.

中文摘要

摘要:基于语音的阿尔茨海默病(AD)自动检测提供了一种无创且可扩展的早期认知筛查方法。AD 影响词汇-语义组织和语言生成,包括异常停顿和词语拉长。然而,现有方法尚未完全将这些副语言线索与语言内容整合。我们提出了基于大语言模型(LLM)的副语言增强方法(LAPE),通过三个协调创新,将LLM生成的语言表示与副语言线索相结合。第一是韵律事件文本化,它通过将停顿和拉长编码为具有时长感知的显式标记,使LLM能够与词汇内容共同建模这些特征。第二是词汇-韵律单元化与切分,它通过仅汇总连续词单元来保留两种模态中的事件身份和强度。第三是文本锚定的副语言融合,它通过使用NormGate对局部和句子级语音特征进行归一化并根据文本动态缩放,实现两者的整合。我们在ADReSS和ADReSSo数据集上使用逐参与者交叉验证和逐受试者离开法评估LAPE。LAPE在所有四个主要设置中均达到了最先进的性能。代码将在论文接收后发布。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10896 (HTTP 429)

Authors: Xiao Wei, Yuqin Lin, Yaru Cao, Jinyu Li, Bin Wen, Kai Li, Yueying Chen, Longbiao Wang, Jianwu Dang

Categories: cs.CL

PDF URL: https://arxiv.org/pdf/2609.10896.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10896

Published: 2026-09-13T01:24:45.019Z


Agent Domain Papers

1. Probabilistic Focal Search: Accelerating Bounded-Suboptimal Search via Lower-Bound Advancement

Abstract:Bounded-suboptimal search seeks a solution within a factor $w$ of optimal while reducing search effort. Focal Search (FS) uses heuristic guidance within FOCAL, the frontier nodes eligible under the threshold $w f{\min}$, but its deterministic policy may leave $f{\min}$ unchanged for many expansions. We introduce Probabilistic Focal Search (PFS), which follows the FS guided choice with probability $p$ and expands a minimum-$f$ OPEN node with probability $1-p$. The latter branch encourages the lower bound to advance, enlarging FOCAL and admitting nodes that may lead to feasible solutions. By balancing guidance and lower-bound advancement, this mechanism can reduce time to a bounded solution when progress is limited by delayed FOCAL admission. As a secondary transfer experiment, we apply the same scheduler to Dynamic Potential Search, yielding Probabilistic Dynamic Potential Search (PDPS). We benchmark PFS against FS on N-Puzzle, Pancake Sorting, and the Traveling Salesperson Problem (TSP), and evaluate its anytime extension on the Generalized Covering TSP (GCTSP), using multiple $w$ and $p$ values. Across these benchmarks, the largest gains occur when long $f_{\min}$ plateaus delay useful FOCAL admissions; in such settings, the probabilistic factor may reduce node expansions by about 90\% or more (e.g., on N-Puzzle and TSP). For the anytime algorithm family, Anytime Probabilistic Focal Search (APFS) outperforms all tested algorithms in evaluating anytime methods on GCTSP. We also observe that the benefit is smaller when the deterministic search already advances efficiently (e.g., Pancake Sorting), indicating that the probabilistic factor is most useful when FOCAL admission is a search bottleneck. The PDPS transfer shows that the mechanism also transfers to potential guidance, although its common-success effects remain domain- and bound-dependent.

中文摘要

摘要:有界次最优搜索寻求在最优$w$因子内的解,同时减少搜索工作量。焦点搜索(FS)在FOCAL中使用启发式指导,FOCAL是符合阈值$w f{\min}$的前沿节点,但其确定性策略可能使许多扩展中$f{\min}$保持不变。我们引入概率焦点搜索(PFS),它以概率$p$跟随FS引导选择,并以概率$1-p$扩展最小$f$的开放节点。后者鼓励下界推进,扩大FOCAL并允许可能引出可行解的节点。通过平衡指导与下限推进,该机制可在FOCAL采纳延迟限制进展时缩短到有界解的时间。作为次级转移实验,我们将同一调度器应用于动态势能搜索,得到概率动态势能搜索(PDPS)。我们将PFS与F-Puzzle、煎饼排序和旅行销售员问题(TSP)的FS进行基准测试,并利用多个$w$和$p$值评估其在广义覆盖TSP(GCTSP)上的任意扩展。在这些基准测试中,当长期$f_{\min}$平台期延迟有用的FOCAL录入时,最大的收益会出现;在这种情况下,概率因子可能将节点扩展减少约90%或更多(例如N-Puzzle和TSP)。在任意时间算法家族中,随时概率焦点搜索(APFS)在GCTSP上评估任意方法时表现优于所有测试算法。我们还观察到,当确定性搜索已经高效推进(如煎饼排序)时,优势较小,表明当FOCAL允许成为搜索瓶颈时,概率因子最为有用。PDPS转移表明该机制也可转移至潜在引导,尽管其共同成功效应仍依赖于域和界限。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10584 (HTTP 429)

Authors: Minh Vu Duc, Trung Le Huu, Hà Minh Hoàng, Trung Thanh Nguyen, Phuong Khanh Nguyen, Huynh Thi Thanh Binh

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10584.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10584

Published: 2026-09-13T01:25:39.826Z


2. Automating Quadratic Unconstrained Binary Optimization (QUBO) Formulation Generation from Natural Language

Abstract:Quadratic Unconstrained Binary Optimization (QUBO) is a central formulation for combinatorial optimization and has gained increasing attention due to its compatibility with quantum, hybrid quantum-classical, and quantum-inspired solvers. However, translating natural-language problem descriptions into correct QUBO formulations remains difficult, requiring the identification of binary variables, constraints, objective functions, penalty terms, and suitable penalty weights. This process is time-consuming and often demands substantial domain expertise. To address this challenge, we propose an end-to-end multi-agent framework that automatically generates QUBO formulations from natural-language problem descriptions, supported by structured or unstructured test cases. To evaluate its performance, We also introduce QUBOBench, a benchmark containing 100 combinatorial optimization problems across 12 application domains, curated from peer-reviewed literature, competitions, and canonical NP-hard problems. Experimental results show that our framework achieves 68% accuracy on QUBOBench, outperforming a direct single-call baseline by 22%. Further analysis identifies iterative self-repair as the most important component contributing to improved performance. The data and code are open-sourced at this https URL.

中文摘要

摘要:二次无约束二进制优化(QUBO)是组合优化的核心形式,由于其与量子、量子-经典混合以及量子启发式求解器的兼容性,受到了越来越多的关注。然而,将自然语言问题描述转化为正确的QUBO形式仍然十分困难,这需要识别二进制变量、约束、目标函数、惩罚项及合适的惩罚权重。这个过程耗时且通常需要大量领域专业知识。为应对这一挑战,我们提出了一个端到端的多智能体框架,可以从自然语言问题描述(支持结构化或非结构化测试用例)自动生成QUBO形式。为了评估其性能,我们还引入了QUBOBench,这是一个包含来自12个应用领域的100个组合优化问题的基准集,问题来源于同行评审文献、竞赛及典型NP难问题。实验结果表明,我们的框架在QUBOBench上的准确率达到68%,比直接单次调用的基线方法高出22%。进一步分析表明,迭代自我修复是提升性能的最重要组成部分。数据和代码在此https URL开源提供。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10629 (HTTP 429)

Authors: Niloy Kumar Mondal, Md Rizwan Parvez

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10629.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10629

Published: 2026-09-13T01:25:39.826Z


3. A Multi-Stage Rule-Chaining Framework for Compositional and Interpretable Cognitive Reasoning

Abstract:The Abstraction and Reasoning Corpus (ARC) benchmarks cognitive generalization, the ability to infer and apply abstract rules from limited examples. This paper presents a multi-stage rule-chaining framework that performs compositional reasoning across symbolic, structural, and conceptual levels. The framework integrates three complementary solvers: (1) a deterministic rule discovery module that induces atomic transformations through geometric, color, and object-based analysis; (2) a pattern-composition engine that reconstructs outputs via block merging, repetition, and spatial heuristics; and (3) a structural abstraction layer that infers hierarchical and nested relationships across grids. These solvers operate sequentially within a progressive fallback hierarchy, where each stage reuses prior reasoning traces to enhance interpretability and generalization. Training passed for 995 tasks out of 1000, further evaluated on 105 tasks out of 120 and solved 230 test tasks out of 240 ARC-AGI-2 tasks. The system achieved strong coverage across deterministic, compositional, and abstract categories, demonstrating an overall accuracy exceeding 95 percent. The proposed architecture bridges symbolic reasoning and pattern synthesis, providing interpretable insight into cognitive generalization. The results suggest that rule chaining and hierarchical composition can advance machine reasoning toward transparent, human-aligned abstraction without relying on task-specific tuning.

中文摘要

摘要:抽象与推理语料库(ARC)衡量认知泛化能力,即从有限示例中推断并应用抽象规则的能力。本文提出了一个多阶段规则链框架,在符号、结构和概念层面上执行组合推理。该框架整合了三种互补求解器:(1)确定性规则发现模块,通过几何、颜色和基于对象的分析诱导原子变换;(2)模式组合引擎,通过块合并、重复和空间启发式重建输出;(3)结构抽象层,推断网格间的层次和嵌套关系。这些求解器在渐进回退层级中按顺序操作,每个阶段重用先前的推理轨迹以增强可解释性和泛化能力。在1000个任务中,训练通过了995个任务,进一步在120个任务中的105个任务上进行评估,并在240个ARC-AGI-2测试任务中解决了230个任务。该系统在确定性、组合性和抽象类别中覆盖率强,整体准确率超过95%。所提出的架构桥接了符号推理与模式合成,为认知泛化提供可解释的洞察结果。结果表明,规则链和分层组合能够推动机器推理走向透明、与人类一致的抽象,而无需依赖任务特定的调优。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10654 (HTTP 429)

Authors: Deblina Kar

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10654.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10654

Published: 2026-09-13T01:25:39.826Z


4. Understanding LoRA Rank Trade-offs in Diffusion Model Fine-Tuning

Abstract:Selecting LoRA rank for diffusion fine-tuning requires balancing quality and compute cost. We present a controlled study on CIFAR-10 using a DDPM U-Net with ranks {2,4,8,16,32}, fixed optimization settings, and a reproducible local-folder pytorch-fid protocol. We report FID, trainable parameters, runtime, and GPU memory, then validate trends with extended-budget DDPM runs (20 epochs; ranks 4/8/16) and a Tiny DiT backbone (10 epochs; ranks 4/8/16). Results show moderate ranks are most efficient: rank 4 achieves the best DDPM FID (124.1380), rank 8 is close (124.2136), and higher ranks provide limited gains despite larger adaptation cost. These findings support small-to-moderate ranks as practical defaults under fixed training budgets.

中文摘要

摘要:为扩散微调选择 LoRA 秩需要在质量和计算成本之间取得平衡。我们在 CIFAR-10 上进行了受控研究,使用 DDPM U-Net 并设置秩为 {2,4,8,16,32},固定优化设置,以及可重复的本地文件夹 pytorch-fid 协议。我们报告了 FID、可训练参数、运行时间和 GPU 内存,然后通过扩展预算的 DDPM 运行(20 个 epoch;秩 4/8/16)和 Tiny DiT 骨干网络(10 个 epoch;秩 4/8/16)验证趋势。结果显示,中等秩最为高效:秩 4 达到最佳 DDPM FID(124.1380),秩 8 接近(124.2136),而更高秩尽管适配成本更大,收益有限。这些发现支持在固定训练预算下,将小到中等秩作为实际默认值。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10656 (HTTP 429)

Authors: Iman Khazrak, Narges Nejad, Mostafa M. Rezaee, Robert C. Green II

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10656.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10656

Published: 2026-09-13T01:25:39.826Z


5. Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking

Abstract:Neural networks trained past memorization frequently undergo a delayed transition to generalization, a phenomenon known as grokking. Despite theoretical progress on \emph{why} this transition occurs, the quantitative structure of \emph{when} it occurs in hyperparameter space remains uncharacterized. We map the memorization-to-generalization boundary across 384 configurations of two-hidden-layer MLPs on modular arithmetic, fitting a power-law scaling relation for generalization onset time: $T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$ ($R^2 = 0.732$; $0.821$ with interactions). The exponent hierarchy reveals that data complexity ($D^{-2.04}$) is the dominant driver of regime transition, not model capacity ($H^{-0.27}$): doubling data accelerates generalization by ${\sim}4\times$, while doubling width yields only ${\sim}1.2\times$. A sharp phase boundary at weight decay $\lambda \gtrsim 1.0$ separates grokking from non-grokking configurations, and weight norm trajectories show monotonic compression during the transition, consistent with implicit regularization selecting low-complexity solutions. These results provide a quantitative foundation for predicting and controlling regime transitions in overparameterized networks.

中文摘要

摘要:经过记忆训练的神经网络常常经历延迟向泛化的转变,这种现象称为“格罗克”(grokking)。尽管关于该转变发生的 \emph{why} 理论已有进展,但其在超参数空间中发生的 \emph{when} 的定量结构仍未被表征。我们在模算术上映射了384种双隐藏层MLP配置中的记忆到推广边界,拟合推广起始时间的幂律尺度关系:$T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$ ($R^2 = 0.732$;含交互作用为$0.821$)。指数层级表明,数据复杂度($D^{-2.04}$)是控制政区转变的主要驱动因素,而非模型容量($H^{-0.27}$):数据加倍会使泛化加速 ${\sim}4\times$,而宽度加倍仅得 ${\sim}1.2\times$。在权重衰变 $\lambda \gtrsim 1.0$ 处的明显相位边界区分了 grokking 与非 grokking 配置,权范数轨迹在转变过程中表现出单调压缩,这与隐式正则化选择低复杂度解相符。这些结果为预测和控制超参数网络中的 regime 转移提供了定量基础。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10657 (HTTP 429)

Authors: Anish Kataria

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10657.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10657

Published: 2026-09-13T01:25:39.826Z


6. An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

Abstract:We study how model post-training and test-time inference design affect natural-language proof generation for hard olympiad mathematics. Starting from Nemotron 3 Ultra, we train two specialist checkpoints using supervised fine-tuning and reinforcement learning, and evaluate checkpoint choice, verification, and refinement. Based on these findings, we present an open-model test-time-compute pipeline. The system operates entirely in natural language, with no formal prover, external tools, or internet access. Three Nemotron 3 Ultra checkpoints - the general-availability model and two post-trained specialists - power an iterative search that generates, verifies, and refines candidate proofs; a separate high-compute stage then selects each final submission. The system scored 30 out of 42 points at IMO 2026, reaching the gold-medal threshold. We release the two post-trained checkpoints as well as the training data, the training and inference code, the submitted solutions, and Nemotron-IMO-Bench, a new benchmark of 200 novel olympiad-level problems.

中文摘要

摘要:我们研究了模型后训练和测试时推理设计如何影响困难奥林匹克数学的自然语言证明生成。从 Nemotron 3 Ultra 开始,我们使用监督微调和强化学习训练了两个专项检查点,并评估了检查点选择、验证和改进。基于这些发现,我们提出了一个开放模型的测试时计算管道。该系统完全以自然语言操作,不使用形式化定理证明器、外部工具或互联网访问。三个 Nemotron 3 Ultra 检查点——通用可用模型和两个后训练专家——支持一个迭代搜索,用于生成、验证和改进候选证明;随后单独的高计算阶段选择每次最终提交。该系统在 IMO 2026 中获得了 42 分中的 30 分,达到了金牌标准。我们发布了两个后训练检查点以及训练数据、训练与推理代码、提交的解答,以及 Nemotron-IMO-Bench,这是一个包含 200 个新颖奥林匹克级问题的新基准测试。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文致力于解决\*\*如何通过后训练(post-training)与测试时计算(test-time compute)设计,使大语言模型在自然语言形式下生成严格数学证明,从而在国际数学奥林匹克(IMO)级别竞赛中达到金牌水平\*\*的问题。 具体而言,论文围绕以下核心子问题展开: - \*\*专项能力构建\*\*:如何基于通用基础模型(Nemotron 3 Ultra)训练出专门用于证明生成、验证、评分与精炼的模型,以处理高难度的奥林匹克数学问题。 - \*\*迭代生成-验证-精炼(generate-verify-refine)\*\*:如何设计高效的搜索流程,使模型能够提出候选证明、由验证器评判正确性并给出自然语言反馈、再基于反馈迭代改进,最终在没有形式化证明器、外部工具或网络访问的条件下输出可靠解答。 - \*\*多模型协同与计算分配\*\*:如何利用多个经不同后训练(监督微调与强化学习)得到的专家模型,在生成、验证与最终选择阶段合理分配测试时计算资源,以最大化解题覆盖率与正确率。 - \*\*开放与可复现\*\*:如何在达到竞赛金牌阈值(IMO 2026 得分 30/42,金牌线 29 分)的同时,完整开源模型权重、训练数据、推理代码与评估基准(Nemotron-IMO-Bench),为后续研究提供可复现的参考系统。 简言之,该工作旨在提供一条\*\*开放的、完全基于自然语言的 IMO 金牌级数学推理系统\*\*的工程化路径,并系统性地评估模型选择、验证机制与多模型集成等关键设计决策对最终性能的影响。 Q2: 有哪些相关研究? 根据论文第3节,相关工作可分为以下四个主要方向: ### 1. 神经符号与形式化方法(Neuro-symbolic and formal methods) 该方向将神经网络与符号推理或形式化验证相结合,是早期AI冲击IMO的主要路径。 - \*\*AlphaGeometry\*\*(Trinh et al., 2024):利用神经语言模型引导符号引擎完成几何证明。 - \*\*AlphaProof 与 AlphaGeometry 2\*\*(Hubert et al., 2026):在IMO 2024中联合取得接近人类金牌线的成绩(差1分)。 - \*\*基于Lean的神经定理证明器\*\*:包括 \*\*DeepSeek-Prover\*\*(Ren et al., 2025)、\*\*GoedelProver\*\*(Lin et al., 2025)与 \*\*SeedProver\*\*(Chen et al., 2025),持续推动形式化证明在 miniF2F、PutnamBench 等基准上的开源前沿(Zheng et al., 2022; Tsoukalas et al., 2024)。 - 此类系统的可扩展性高度依赖Lean等形式化工具提供的可靠符号验证,用于生成大规模训练语料并搜索高分支率的证明空间。 ### 2. 自然语言证明突破(Natural-language breakthroughs for proofs) 2025年标志着纯自然语言系统首次在IMO达到金牌水平,证明了端到端自然语言推理的可行性。 - \*\*Gemini Deep Think\*\*(Luong & Lockhart, 2025)与 \*\*OpenAI实验模型\*\*(OpenAI, 2025):在IMO 2025中各自解决了五道题目并获得满分,展示了前沿大语言模型的证明生成能力。 - 这些结果同时凸显了\*\*验证与最终方案选择\*\*的重要性(Mahdavi et al., 2025; Guo et al., 2025),即生成正确证明只是系统的一部分,如何判别并挑选出正确提交同样关键。 ### 3. 反馈驱动的精炼循环与数学智能体(Feedback-driven refinement loops and math agents) 该方向关注模型如何通过自我或外部反馈迭代改进输出,而不仅限于一次性生成。 - \*\*Huang & Yang (2025)\*\*:证明了一个模型无关的“验证-精炼”流水线,基于当时公开可用的模型即可达到IMO金牌水平。 - \*\*Self-Refine\*\*(Madaan et al., 2023)与 \*\*RLEF\*\*(Gehring et al., 2025):在代码执行领域展示了类似的迭代自我反馈与强化学习框架。 - \*\*Nomos\*\*(Jin et al., 2025):在Putnam 2025中取得顶尖成绩,采用后训练模型配合并行生成、评分与整合的推理架构,但不依赖基于反馈的迭代精炼。 ### 4. 证明搜索系统与测试时计算扩展(Proof-search systems and test-time scaling) 该方向研究如何在测试阶段通过增加计算资源(如多次采样、验证与搜索)提升推理性能。 - \*\*DeepSeekMath-V2\*\*(Shao et al., 2025):分别训练生成器、验证器与元验证器模型,并在高计算量的搜索设置中按比例扩展验证计算。 - \*\*Aletheia\*\*(Feng et al., 2026):以Gemini Deep Think为基座的数学研究智能体,采用显式的生成器(Generator)、验证器(Verifier)、修订器(Reviser)子智能体进行迭代,将前沿从奥林匹克竞赛推向研究级数学。 - \*\*Nemotron-Cascade 2\*\*(Yang et al., 2026):通过级联后训练与蒸馏,证明紧凑型模型也能在证明生成领域接近大型前沿开放模型的能力。 Q3: 论文如何解决这个问题? 论文通过\*\*模型后训练\*\*与\*\*测试时推理架构\*\*的协同设计,构建了一套完全基于自然语言的 IMO 金牌级数学证明系统。其解决方案可从以下层面展开: --- ### 1. 基础模型与后训练专家化 系统以 \*\*Nemotron-3-Ultra-550B-A55B\*\* 为基座,保留了通用可用版本(GA)不变,并衍生出两个专项后训练模型: - \*\*监督微调模型(Nemotron-3-Ultra-SFT)\*\*:在最长 425,984 token 的上下文窗口下,使用 414,890 条高质量合成数据微调。数据覆盖证明生成、验证、精炼与元验证四种轨迹,旨在教授模型构建证明、诊断逻辑漏洞、修正错误路径并评估证明有效性。 - \*\*强化学习模型(Nemotron-3-Ultra-RL)\*\*:从相同基座出发,采用异步 RL 框架(类似 PipeLineRL),在 9,597 道难题上优化证明生成能力,使用 DeepSeekMath-V2 风格的奖励设计,并通过动态采样与截断重要性采样稳定训练。 --- ### 2. 两阶段测试时推理架构 整个推理流程分为\*\*搜索阶段\*\*与\*\*最终选择阶段\*\*,均以高计算预算运行: #### 阶段一:高计算迭代搜索(Generate–Verify–Refine) 对每道题目独立运行最多 8 轮迭代: - \*\*生成(Generate)\*\*:第 1 轮由三个 checkpoint(GA、SFT、RL)各自在 8 种互补的生成提示下采样,共产生 384 份初始候选证明。多种提示策略(如引理优先、路线比较、反例防护、不变量/极值法等)旨在解耦采样相关性并覆盖 diverse 解题路径。 - \*\*验证(Verify)\*\*:使用 RL 与 SFT 两个验证器,对每个候选证明各产生 8 条独立判断(共 16 条)。验证器采用无参考(reference-free)评分:1 分(完全正确)、0.5 分(大体正确但有minor遗漏)、0 分(存在致命错误)。仅当全部 16 条有效判断均为 1 分时,该证明才被\*\*内部接受(accepted)\*\*,触发该生成器的提前停止。 - \*\*精炼(Refine)\*\*:若未找到被接受的证明,系统从全局证明池中选取最多 16 个高排名候选,构造包含最多 8 条验证器批评的精炼提示,并交由全部三个生成器各采样 4 次,每轮产生 192 份精炼尝试。精炼后的证明重新进入验证流程与证明池。 #### 阶段二:高计算最终选择 搜索结束后,系统可能持有最多 3 名决赛选手(每个生成器一名被接受证明,或无人被接受时的最高排名证明)。为确定最终提交: - 三名 checkpoint 以\*\*无参考 IMO 风格评委提示\*\*对每名决赛选手各产生 16 次独立评分,共 48 次判断。 - 评分采用 0–7 的整数制,依据证明实际建立的里程碑(milestones)进行判定,模仿官方 IMO 评卷逻辑。 - 最终按 48 次评分的均值排名,平局时优先选择更短的证明文本。 --- ### 3. 多模型角色分配与互补性 三个 checkpoint 在流程中承担不同角色,形成能力互补: - \*\*生成端\*\*:GA、RL、SFT 同时参与,因为实验表明不同 checkpoint 能解决彼此无法独立解决的问题( doubling 单一模型的采样数收益甚微)。 - \*\*验证端\*\*:仅使用 RL 与 SFT(两者选择性更高),排除较为宽松的 GA,以降低误接受率。 - \*\*最终评判端\*\*:三者共同作为 IMO 风格评委,利用多样性提升最终排名的可靠性。 --- ### 4. 验证器机制与精度控制 搜索阶段的核心目标是\*\*避免过早终止于错误证明\*\*。因此验证器设计极度偏向\*\*精度(precision)\*\*而非召回: - \*\*全票通过制(unanimity)\*\*:16/16 张票均为 1 分才接受。 - 实验表明,SFT 单独验证的误接受率约为 4.5%,加入 RL 的否决后降至 1.1%;而引入 GA 无法进一步降低误接受率,反而增加误拒。 - 这种高门槛确保了进入决赛圈的证明具有极高的内部一致性,而误拒仅会延迟搜索,不会导致不可逆的提交错误。 --- ### 5. 完全自然语言的约束 与依赖 Lean 等形式化证明器的系统不同,该方案严格限定于\*\*自然语言\*\*: - 无形式化证明器、无外部计算工具、无网络访问。 - 输入为赛会提供的 LaTeX 题目陈述,输出为自然语言解答文本,直接符合 IMO 提交格式。 - 验证与评分同样通过自然语言推理完成,而非依赖编译器或符号引擎的布尔判定。 --- ### 6. 开源与资源透明 为确保可复现性与未来可扩展性,论文完整开源了系统全部关键组件: - 两个后训练模型权重(SFT 与 RL)。 - 训练数据(SFT 语料与 RL 问题集)。 - 训练与推理代码(NeMo-Skills、NeMo-RL)。 - IMO 2026 官方提交的全部解答。 - 新的评估基准 \*\*Nemotron-IMO-Bench\*\*(200 道全新奥林匹克难度题目)及 30 题开发集。 - 竞赛运行的详细资源账目:最终提交在约 7.07 亿生成 token 与 1,464 GB200 GPU 小时内完成;完整搜索消耗约 23.1 亿 token 与 4,800 GPU 小时。 --- 通过上述设计,该系统在 IMO 2026 上以 \*\*30/42 分\*\*达到金牌阈值(29 分),并在赛后持续搜索中于 Problem 6 发现了一道经独立人工评卷获 4/7 分的非官方解答。 Q4: 论文做了哪些实验? 论文通过系统性消融实验评估了系统设计中的关键决策,所有实验均在自建的 30 题开发集(含 20 题 Nemotron-IMO-Bench 新题与 10 题近期竞赛题)上进行。主要实验内容如下: --- ### 1. 单检查点管道性能(Section 7.1) 为比较各后训练检查点在完整生成-验证-精炼流程中的端到端表现,论文独立运行了 \*\*Nemotron-3-Ultra-GA\*\*、\*\*Nemotron-3-Ultra-RL\*\* 与 \*\*Nemotron-3-Ultra-SFT\*\* 三种单检查点基线。每个检查点同时承担生成、验证与精炼职能,采用 128 份首轮候选、64 次验证判断与多轮精炼的固定预算。实验追踪了每轮搜索后被内部接受的证明数量,以及经独立模型评审团(GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8)按 IMO 0–7 分制评分后的累积得分。结果表明,两个后训练检查点均显著优于基座 GA 模型,其中 SFT 在首轮接受率上领先,而 RL 在八轮后的最终总分上最优(见 Table 2)。 --- ### 2. 检查点验证性能与面板规则(Section 7.2) 为验证搜索阶段采用 \*\*RL + SFT 双模型全票通过(16/16)\*\* 规则的合理性,论文在 300 份证明的审计集上(含 25 份被接受证明与 275 份分层采样的未接受证明)系统测量了不同验证规则的操作点: - \*\*单检查点规则\*\*:分别测试 GA、RL、SFT 以 8/8 全票通过时的误接受率(false accept)与误拒绝率(false reject)。结果显示三者主要在选择性上存在差异:GA 过于宽松(误接受 31.6%),SFT 最严格(误接受 4.5%),RL 居中(误接受 12.4%)。 - \*\*混合面板规则\*\*:测试了 GA+SFT(16/16)、RL+SFT(16/16,即提交系统配置)与 GA+RL+SFT(24/24)三种全票通过面板。RL+SFT 将误接受率降至 1.1%,显著优于单模型,且加入 GA 几乎无法进一步降低误接受率,反而增加误拒。 - \*\*放松阈值\*\*:测试 14/16 与 12/16 的多数通过规则,发现误接受率分别跃升至 17.0% 与 25.4%,表明放松 unanimity 门槛会显著损害精度。 该实验确立了搜索阶段验证器应选用高选择性的 RL 与 SFT,并坚持全票通过机制,以避免过早终止于错误证明(见 Table 3)。 --- ### 3. 完整集成管道与首轮预算分配(Section 7.3) 论文在开发集上复现了提交的多模型集成管道,并将其与单检查点结果对比。集成系统在三轮内即达到最终接受分数,且八轮后总分(含未接受问题的 fallback 评分)领先最优单检查点 RL 达 8 分。 为隔离“增加单模型采样数”与“引入多模型多样性”之间的效益,论文进行了\*\*首轮生成预算分配实验\*\*(Table 4)。在固定 RL 验证器评分的条件下,对比了以下配置: - 将 RL 采样从 128 倍增至 256; - 将部分预算替换为 64 或 128 次 SFT 采样; - 引入 GA 采样。 实验表明,单纯加倍 RL 采样仅多解决 1 道题;而将同等 token 预算分配给 64 次 SFT 尝试则显著更优,因为 SFT 能解决 RL 未覆盖的问题(128 RL + 128 SFT 的 18 道被接受证明中,5 道仅来自 SFT)。GA 在首轮未能带来额外接受问题,但仍被保留用于后续轮次以增加精炼多样性。 --- ### 4. 未改进最终系统的替代方案(Section 7.4 & Appendix A) 论文还探索了若干未纳入最终提交的替代设计,以证明其保留策略的合理性: - \*\*交叉证明上下文(Cross-proof context)\*\*:在精炼阶段引入问题级全局上下文,汇总此前所有尝试的经验教训。结果显示该方法虽加速早期搜索,但最终接受数(42 题)低于基线(44 题)。 - \*\*零优先排名(Zero-first ranking)\*\*:改变候选排名规则,优先选择获得 0 分判断更少的证明(而非单纯按均值排名)。该变体同样改善了早期进度,但最终与基线持平。 - \*\*多证明综合精炼(Refinement from diverse proofs)\*\*:同时选取 4 份低文本重叠的候选证明,要求模型综合其有效部分生成新解。该策略改变了哪些题目最终被解决,但总覆盖率与单父代精炼相同(22/47),未提升聚合性能。 - \*\*分诊路由(Triage-based refinement routing)\*\*:为降低验证成本,先用 3 次初步判断筛选候选,仅前 32 名进入精炼。回放分析表明,该策略在 44% 的案例中丢弃了基线管道最终成功接受的正确证明的“祖先”候选,因此未被采用。 这些消融实验共同说明,更复杂的路由、排名与上下文策略虽可能改变搜索动态,但未能提升最终覆盖率,而激进过滤反而有丢弃正确证明谱系的风险。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与系统设计取舍,以下几个方向值得进一步探索: --- ### 1. 验证器盲 spot 的识别与消除 论文指出,在 IMO 2026 的 Problem 3 与 Problem 6 上,内部验证器与独立模型评审团均一致地高估了证明质量(内部预估约 32 分,官方实际仅 30 分),反映出验证器存在\*\*共享盲 spot\*\*(shared blind spot)。未来工作可探索: - \*\*异构验证器集成\*\*:引入架构或训练范式差异更大的验证模型(如基于形式化背景或不同基础模型家族),打破自然语言验证中的系统性偏差。 - \*\*对抗性验证训练\*\*:在验证器的后训练阶段显式注入针对常见盲 spot 的对抗样本(如对称性误用、隐藏量词疏漏),提升其对边界错误的敏感度。 - \*\*元验证机制的外推\*\*:当前元验证(meta-verification)仅用于 SFT 数据合成,未在测试时推理中部署。将其纳入搜索流程,对验证器判断进行二次审视,可能降低一致性误判风险。 --- ### 2. 自然语言推理与形式化验证的混合架构 该系统严格限定于自然语言,不使用 Lean 等形式化工具。虽然这保证了开放性,但也放弃了形式化系统提供的\*\*硬性正确性保证\*\*。未来可研究: - \*\*自然语言生成 + 形式化回填\*\*:让模型以自然语言进行高层证明构造与搜索,随后对关键引理或核心步骤自动转换为 Lean/Isabelle 进行快速核验,仅在形式化失败时触发精炼。 - \*\*形式化信号作为验证器训练目标\*\*:利用形式化引擎产生的布尔反馈作为辅助监督信号,训练更精确的自然语言验证器,而非仅依赖模型自举评分。 --- ### 3. 测试时计算的自适应分配策略 当前系统在 4.5 小时竞赛截止后搜索即进入平台期(plateau),但在赛后继续运行至 8 小时 25 分时于 Problem 6 发现了更高质量的解(非官方 4/7 分)。这表明\*\*固定轮次与均匀预算分配可能非最优\*\*。可进一步研究: - \*\*基于问题难度的动态预算分配\*\*:利用轻量级分类器在首轮生成后估计问题难度,对高置信度接近解决的问题提前终止,对困难问题保留更多精炼轮次与验证判断数。 - \*\*在线学习式搜索控制\*\*:在搜索过程中根据验证器分数的收敛速率或证明池的多样性指标,实时调整后续轮的采样数与模型选择策略。 --- ### 4. 跨证明信息聚合的再设计 附录 A 中的实验表明,\*\*交叉证明上下文(cross-proof context)\*\*与\*\*多证明综合精炼(diverse-proof refinement)\*\*虽改变了搜索动态,却未提升最终覆盖率。这可能源于: - 当前的问题级上下文提示过于保守,为避免误导而限制了跨证明知识迁移的强度; - 多证明综合时要求模型“从零写新证明”的认知负荷过高,导致有效组件丢失。 未来可探索更结构化的聚合方式,例如: - \*\*证明图(proof graph)构建\*\*:将多个候选证明解析为依赖图(引理-结论链),通过图算法识别最大公共正确子图与互补缺口,再定向生成修补证明。 - \*\*专门化综合模型\*\*:训练一个独立的“证明综合器”(proof synthesizer),其唯一任务是从多个带评分的候选中提取并重组有效论证,而非让通用生成器兼任。 --- ### 5. 特定数学领域的专项化与失败分析 开发集包含 6 道代数、8 道组合、8 道几何与 8 道数论题,且 Problem 3 与 Problem 6 恰好是系统表现最弱的问题。未来可: - 对验证器与生成器的错误进行\*\*按领域归因\*\*,识别几何证明中的图示/构型隐含假设、组合证明中的计数边界疏漏、或数论证明中的模运算方向错误等模式化弱点; - 针对特定领域设计\*\*领域专用提示模板与验证标准\*\*(如几何问题强制要求坐标/复数法与综合法的双向验证),而非沿用统一评分 rubric。 --- ### 6. 强化学习奖励设计与过程监督 当前 RL 训练移除了 self-analysis reward(设 α=1, β=0 ),且仅使用结果奖励(outcome reward)。未来可探索: - \*\*自然语言过程奖励模型(Natural-Language Process Reward Model, NL-PRM)\*\*:在证明的每一步或每一段落后提供细粒度反馈,使 RL 训练不仅关注最终正确性,也关注推理链的局部有效性。 - \*\*基于验证器置信度的课程学习\*\*:根据验证器对生成证明的评分分布(如方差或熵)动态调整训练样本权重,优先学习那些验证器“高置信度认为接近正确”的边缘案例。 --- ### 7. 计算效率与模型压缩 完整竞赛运行消耗约 2.31 × 10^9 生成 token 与 4,800 GB200 GPU 小时,成本高昂。结合 \*\*Nemotron-Cascade 2\*\*(Yang et al., 2026)的启示,未来可研究: - \*\*级联蒸馏\*\*:将最终集成系统的验证与生成能力蒸馏到更小规模的模型中,以极低的推理预算保留大部分性能。 - \*\*投机式验证(speculative verification)\*\*:使用轻量级模型进行快速预筛选,仅将高潜力候选提交给重型验证器(RL/SFT),在保持精度的同时降低验证阶段的 16 × 重复判断开销。 Q6: 总结一下论文的主要内容 这篇论文提出了一套完全基于自然语言、无需形式化证明器或外部工具的 IMO(国际数学奥林匹克)金牌级数学推理系统,并对其设计决策进行了系统性的实证研究。 ### 研究背景与目标 近年来,AI 系统在数学奥林匹克竞赛中的能力迅速提升:2024 年神经符号系统达到银牌水平,2025 年自然语言模型首次达到金牌线。本文旨在研究\*\*模型后训练(post-training)与测试时计算(test-time compute)设计\*\*如何影响自然语言证明生成,并基于 \*\*Nemotron 3 Ultra\*\* 构建一个可复现、全开放的 IMO 竞赛系统。 ### 核心方法 系统采用“两阶段”测试时推理架构,由三个 Nemotron-3-Ultra 检查点协同驱动: - \*\*模型后训练\*\*:在通用基座(GA)之外,训练了两个专家模型: - \*\*SFT 模型\*\*:通过长上下文监督微调(最长 425,984 tokens),在包含证明生成、验证、精炼与元验证的 41 万余条合成轨迹上学习; - \*\*RL 模型\*\*:采用异步强化学习框架优化证明生成,使用结果奖励并支持长序列生成。 - \*\*高计算搜索阶段(Generate–Verify–Refine)\*\*:对每道题独立运行最多 8 轮迭代搜索。 - \*\*生成\*\*:GA、RL、SFT 三个检查点在 8 种互补策略提示下并行采样,首轮共产生 384 份候选证明; - \*\*验证\*\*:RL 与 SFT 作为验证器,对每个候选各输出 8 次独立判断(共 16 次),仅在 \*\*16/16 全票通过(unanimity)\*\* 且均为满分(1 分)时才内部接受该证明; - \*\*精炼\*\*:若未被接受,系统从证明池选取高排名候选,结合验证器批评进行多模型精炼,迭代进入下一轮。 - \*\*最终选择阶段\*\*:搜索结束后,对最多 3 名决赛选手,由三个检查点以 IMO 0–7 分制进行高计算量的独立评审(共 48 次判断),按均值排名选出最终提交。 ### 实验与发现 论文在自建的 30 题开发集上进行了大量消融实验,主要发现包括: - \*\*单检查点性能\*\*:两个后训练专家均显著优于基座 GA;SFT 首轮接受率最高,RL 八轮后总分最优。 - \*\*验证器设计\*\*:SFT 选择性最高(误接受率 4.5%),RL+SFT 的 16/16 全票通过面板可将误接受率降至 1.1%;放松阈值(如 14/16)会导致误接受率大幅上升至 17% 以上。 - \*\*集成与预算分配\*\*:将首轮预算分配给多模型(如 RL + SFT)比单纯加倍单模型采样更有效,因为不同检查点能解决彼此无法覆盖的问题;GA 虽未增加首轮接受数,但为后续精炼提供多样性。 - \*\*替代策略\*\*:交叉证明上下文、零优先排名、多证明综合精炼与分诊路由等变体虽改变了搜索动态,但均未提升最终覆盖率,部分策略还会丢弃正确证明的“祖先”候选。 ### 竞赛结果与开源贡献 - \*\*IMO 2026 成绩\*\*:系统以 \*\*30/42 分\*\* 达到金牌阈值(29 分),在 Problems 1、2、4、5 获满分,Problems 3 与 6 各获 1 分。赛后持续搜索在 Problem 6 上发现了一道非官方评卷为 4/7 的改进解。 - \*\*资源透明\*\*:最终提交消耗约 7.07 亿生成 token 与 1,464 GB200 GPU 小时;完整搜索约 23.1 亿 token 与 4,800 GPU 小时。 - \*\*完全开源\*\*:论文发布了两个后训练模型权重、训练数据、训练与推理代码、全部提交解答,以及包含 200 道全新奥赛级问题的 \*\*Nemotron-IMO-Bench\*\* 基准(含 30 题开发集),为后续研究提供了可复现的完整参考系统。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [**这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是An%20Open%20Recipe%20for%20IMO%20Gold%3A%20Training%20Nemotron%20for%20Olympiad%20Mathematics,链接是https://arxiv.org/pdf/2609.10712,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.10712。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Ivan Moshkov, Stephen Ge, George Armstrong, Wei Du, Sadegh Mahdavi, Igor Gitman

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10712.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10712

Published: 2026-09-13T01:25:39.826Z


7. Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge

Abstract:Sustained deployment of generative AI agents requires more than isolated task success. Agents must remain useful across repeated interactions, changing conditions, and dependencies on people within shared workflows, especially as technical, human, and operational disruptions accumulate over time. We propose operational resilience and considerate participation as two complementary aspects of evaluating such agents: the former captures how agents recover from blocked work while preserving progress and communicating their limits, and the latter captures how their adaptation accounts for affected people, role boundaries, and the surrounding workflow. Yet both remain underexplored under accumulating challenge. We study 120 simulated healthcare trajectories across two generative AI models and twelve stakeholder-derived tasks under light, medium, and heavy challenge. We compare textual action plans, prompted internal assessments, and quantitative structured workload and affect reports to examine how agent behavior and reported state change as challenge accumulates. Regarding operational resilience, agents shift from self-directed recovery toward greater human dependence, while reporting increasing workload and negative affect in structured reports but seldom expressing strain in textual responses. Regarding considerate participation, agents broaden from task-focused adaptation toward task reframing, attention to others, role-boundary adjustment, and wider coordination, with distinct patterns across actions and internal assessments. From these findings, we derive five deployment dilemmas involving persistence, attention, role boundaries, state disclosure, and escalation that require stakeholder specification, further informing technical implications for learning, situated evaluation, and embodied adaptation.

中文摘要

摘要:持续部署生成式人工智能代理需要的不仅仅是单一任务的成功。代理必须在多次互动、变化的环境以及依赖共享工作流中的人员的情况下保持有用性,尤其是在技术、人力和操作中断随时间累积的情况下。我们提出将“操作弹性”和“体贴参与”作为评估此类代理的两个互补方面:前者反映代理在工作受阻时如何恢复,同时保持进展并沟通其限制;后者则反映其适应行为如何考虑受影响的人、角色边界以及周围工作流。然而,这两方面在累积挑战下仍未得到充分探索。我们研究了两种生成式AI模型在120个模拟医疗轨迹和十二个由利益相关者提出的任务下,在轻、中、重挑战条件下的表现。我们通过文本行动计划、提示性内部评估以及定量结构化工作量和情绪报告来比较,以检验在挑战累积时代理行为和报告状态的变化。在操作弹性方面,随着挑战增加,代理从自我导向的恢复转向更依赖人类,同时在结构化报告中显示出增加的工作量和负面情绪,但在文本响应中很少表达压力。在体贴参与方面,代理从以任务为中心的适应扩展到任务重新定义、关注他人、角色边界调整以及更广泛的协调,且在行动和内部评估中表现出不同模式。基于这些发现,我们提出了五个部署困境,涉及持续性、注意力、角色边界、状态披露和升级,这些问题需要由利益相关者进行明确规定,同时进一步为学习、情境评估和具身适应的技术实现提供参考。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10724 (HTTP 429)

Authors: Yuanchen Bai, Zijian Ding, Angelique Taylor

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10724.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10724

Published: 2026-09-13T01:25:39.826Z


8. Towards a Deterministic Math Solver for Clinical Language Models

Abstract:Large language models are unreliable at arithmetic, which is a problem for clinical calculators where a single numerical error changes the recommendation. The standard response is to hardcode each calculator as a validated function, one at a time. We test an alternative: the model does not calculate. Instead, it writes case-specific Python that a restricted local executor runs as a deterministic solver, and the model’s task reduces to deciding how to use it. We evaluate this Program-Solve interface on MedCalc-Bench Verified (1,100 cases, 55 calculators) against direct model arithmetic and a hand-written 22-calculator library, using Qwen2.5-7B and Qwen2.5-32B-AWQ, after auditing the benchmark’s formulas against current clinical guidelines and flagging 16 of 55 with version, use or coefficient concerns. With formulas and gold variables supplied and both routes reading the whole note, handing off to the solver is not a reliable advantage at 7B (75.31% against 72.02%, a paired +3.29 points with a 95% calculator-cluster interval of [-3.49, 10.38]) but is one at 32B (90.53% against 83.47%, +7.05 [0.47, 14.60], clear of zero). The hand-written library is exact on its 440 supported cases but abstains elsewhere (40.0% overall). Adding an executor thus helps some open-weight models more than others even under matched formula, variable and note access, and is not a substitute for verified formulas or reliable variable extraction either way.

中文摘要

摘要:大型语言模型在算术方面不可靠,这对于临床计算器而言是一个问题,因为一次数值错误就可能改变推荐结果。标准的应对方法是将每个计算器逐个硬编码为已验证的函数。我们测试一种替代方法:模型不进行计算。相反,它编写特定病例的 Python,由受限的本地执行器作为确定性求解器运行,而模型的任务简化为决定如何使用它。我们在 MedCalc-Bench Verified(1,100 个病例,55 个计算器)上评估这一程序求解接口,并与直接模型算术及手写 22 个计算器库进行比较,使用 Qwen2.5-7B 和 Qwen2.5-32B-AWQ,同时对基准测试的公式与现行临床指南进行了审计,对 55 个计算器中的 16 个标记了版本、使用或系数方面的关注。在提供公式和黄金变量并且两种方法均可读取整个病历的情况下,将任务交给求解器在 7B 时(75.31% 对 72.02%,配对增加 3.29 点,95% 计算器簇区间 [-3.49, 10.38])并不构成可靠优势,但在 32B 时(90.53% 对 83.47%,+7.05 [0.47, 14.60],明显高于零)则是优势。手写库在其支持的 440 个病例上是精确的,但在其他病例上弃选(整体 40.0%)。因此,即使在公式、变量和病历访问匹配的情况下,增加执行器也使某些开放权重模型受益更多,同时无论如何也不能替代已验证的公式或可靠的变量提取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10728 (HTTP 429)

Authors: Felipe Ocampo Osorio, Sebastián Andrés Cajas Ordoñez, Maximin Lange, Rafi Al Attrach, Sahil Kapadia, Zakaria Laouabdia Sellami, Angelo Antonio Talio, Leo Anthony Celi

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10728.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10728

Published: 2026-09-13T01:25:39.826Z


9. Studying Without a Syllabus: Task-Agnostic Environment Preprocessing

Abstract:Before an LLM agent tackles tasks in a new environment, it can inspect available corpora and tools and construct reusable resources such as indices, scripts, or procedural guidance. Most automated adaptation methods, however, rely on task examples, trajectories, or evaluation feedback to decide what to build. Existing task-agnostic approaches avoid this supervision but commit in advance to a preparation strategy for a particular type of environment. We study a more open-ended setting: can an agent study an unfamiliar environment without a syllabus, i.e. before test time and without knowledge of the downstream task distribution, and choose how to prepare it? We formalize task-agnostic environment preprocessing, in which a studying system explores an environment under a budget and produces artifacts for a frozen solver. We compare unaided and archive-equipped meta-agents with fixed synthetic-practice and corpus-processing methods across six heterogeneous benchmarks. A meta-agent variant achieves the highest Avg@3 reward on five benchmarks, while fixed corpus processing remains best on the largest corpus benchmark. Larger study budgets do not reliably improve downstream reward. Nevertheless, studied artifacts reduce the test-time sampling needed to reach a given score, demonstrating how reusable preparation can shift computation from repeated test-time attempts to a pre-task study phase.

中文摘要

摘要:在大型语言模型(LLM)代理在新环境中处理任务之前,它可以检查可用的语料库和工具,并构建可重用的资源,例如索引、脚本或操作指南。然而,大多数自动化适应方法依赖于任务示例、轨迹或评估反馈来决定构建内容。现有的任务无关方法避免了这种监督,但会提前为特定类型的环境确定准备策略。我们研究一种更开放的情境:代理是否可以在没有教学大纲的情况下研究一个陌生环境,即在测试前并且不了解下游任务分布的情况下,选择如何准备环境?我们形式化了任务无关的环境预处理,其中学习系统在预算限制下探索环境,并为被冻结的求解器生成工件。我们在六个异质基准上比较了无辅助和配备档案的元代理与固定的合成练习和语料处理方法。一个元代理变体在五个基准上实现了最高的Avg@3奖励,而在最大的语料基准上,固定语料处理仍然表现最好。更大的研究预算并不能可靠地提高下游奖励。然而,研究得到的工件减少了达到给定分数所需的测试采样次数,展示了可重用准备如何将计算从重复的测试阶段转移到任务前的学习阶段。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10824 (HTTP 429)

Authors: Vinay Samuel, Varun Ursekar, Vijay S. Kalmath, Apaar Shanker, Veronica Chatrath, Yuan Xue

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10824.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10824

Published: 2026-09-13T01:25:39.826Z


10. When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents

Abstract:Independent evaluation can reject harmful policy updates yet also prevent useful continual learning. We argue that update admission must be assessed through both error control and retained learning opportunities at a stated interaction budget. We identify a concrete failure: a range-based confidence gate cannot certify unchanged old-task behavior within otherwise substantial budgets. A standard paired-binomial construction reduces this burden when outcome disagreements are rare. We also specify certified historical-reference promotion and a round-level missed-opportunity metric. In a constructed one-step pushing diagnostic with 32 seeds, fresh paired checks admit 31.6% of a common update stream at 2,000 episodes per stage, versus zero for the range-based gate; unconditional replay nevertheless learns better in closed-loop runs. A separate learned-dynamics stress test distinguishes model bias from feedback-selection error. The contribution is an admission-audit protocol with analytical and synthetic evidence; physical-robot and VLA validation remain open.

中文摘要

摘要:独立评估可以拒绝有害的策略更新,但也可能阻止有用的连续学习。我们认为,更新的准入必须通过错误控制和在特定交互预算下保留的学习机会来评估。我们确定了一个具体的失败:基于范围的置信门在其他情况下有相当预算时,无法证明旧任务行为保持不变。标准的成对二项式构造在结果分歧很少时可以减轻这一负担。我们还明确了经过认证的历史参考提升和回合级错失机会指标。在一个构建的一步推动诊断中使用32个随机种子进行测试时,新鲜的成对检查在每个阶段2000个回合下允许常见更新流的31.6%,而基于范围的门为零;然而,无条件回放在闭环运行中表现更好。另一个学习动态的压力测试可以区分模型偏差与反馈选择错误。该贡献是一个具有分析和合成证据的准入审核协议;物理机器人和VLA验证仍然是开放的。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10873 (HTTP 429)

Authors: Qinzhen Ma, Ruihai Wu

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10873.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10873

Published: 2026-09-13T01:25:39.826Z


Evaluation Domain Papers

1. Probabilistic Focal Search: Accelerating Bounded-Suboptimal Search via Lower-Bound Advancement

Abstract:Bounded-suboptimal search seeks a solution within a factor $w$ of optimal while reducing search effort. Focal Search (FS) uses heuristic guidance within FOCAL, the frontier nodes eligible under the threshold $w f{\min}$, but its deterministic policy may leave $f{\min}$ unchanged for many expansions. We introduce Probabilistic Focal Search (PFS), which follows the FS guided choice with probability $p$ and expands a minimum-$f$ OPEN node with probability $1-p$. The latter branch encourages the lower bound to advance, enlarging FOCAL and admitting nodes that may lead to feasible solutions. By balancing guidance and lower-bound advancement, this mechanism can reduce time to a bounded solution when progress is limited by delayed FOCAL admission. As a secondary transfer experiment, we apply the same scheduler to Dynamic Potential Search, yielding Probabilistic Dynamic Potential Search (PDPS). We benchmark PFS against FS on N-Puzzle, Pancake Sorting, and the Traveling Salesperson Problem (TSP), and evaluate its anytime extension on the Generalized Covering TSP (GCTSP), using multiple $w$ and $p$ values. Across these benchmarks, the largest gains occur when long $f_{\min}$ plateaus delay useful FOCAL admissions; in such settings, the probabilistic factor may reduce node expansions by about 90\% or more (e.g., on N-Puzzle and TSP). For the anytime algorithm family, Anytime Probabilistic Focal Search (APFS) outperforms all tested algorithms in evaluating anytime methods on GCTSP. We also observe that the benefit is smaller when the deterministic search already advances efficiently (e.g., Pancake Sorting), indicating that the probabilistic factor is most useful when FOCAL admission is a search bottleneck. The PDPS transfer shows that the mechanism also transfers to potential guidance, although its common-success effects remain domain- and bound-dependent.

中文摘要

摘要:有界次最优搜索寻求在最优$w$因子内的解,同时减少搜索工作量。焦点搜索(FS)在FOCAL中使用启发式指导,FOCAL是符合阈值$w f{\min}$的前沿节点,但其确定性策略可能使许多扩展中$f{\min}$保持不变。我们引入概率焦点搜索(PFS),它以概率$p$跟随FS引导选择,并以概率$1-p$扩展最小$f$的开放节点。后者鼓励下界推进,扩大FOCAL并允许可能引出可行解的节点。通过平衡指导与下限推进,该机制可在FOCAL采纳延迟限制进展时缩短到有界解的时间。作为次级转移实验,我们将同一调度器应用于动态势能搜索,得到概率动态势能搜索(PDPS)。我们将PFS与F-Puzzle、煎饼排序和旅行销售员问题(TSP)的FS进行基准测试,并利用多个$w$和$p$值评估其在广义覆盖TSP(GCTSP)上的任意扩展。在这些基准测试中,当长期$f_{\min}$平台期延迟有用的FOCAL录入时,最大的收益会出现;在这种情况下,概率因子可能将节点扩展减少约90%或更多(例如N-Puzzle和TSP)。在任意时间算法家族中,随时概率焦点搜索(APFS)在GCTSP上评估任意方法时表现优于所有测试算法。我们还观察到,当确定性搜索已经高效推进(如煎饼排序)时,优势较小,表明当FOCAL允许成为搜索瓶颈时,概率因子最为有用。PDPS转移表明该机制也可转移至潜在引导,尽管其共同成功效应仍依赖于域和界限。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10584 (HTTP 429)

Authors: Minh Vu Duc, Trung Le Huu, Hà Minh Hoàng, Trung Thanh Nguyen, Phuong Khanh Nguyen, Huynh Thi Thanh Binh

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10584.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10584

Published: 2026-09-13T01:26:01.655Z


2. Automating Quadratic Unconstrained Binary Optimization (QUBO) Formulation Generation from Natural Language

Abstract:Quadratic Unconstrained Binary Optimization (QUBO) is a central formulation for combinatorial optimization and has gained increasing attention due to its compatibility with quantum, hybrid quantum-classical, and quantum-inspired solvers. However, translating natural-language problem descriptions into correct QUBO formulations remains difficult, requiring the identification of binary variables, constraints, objective functions, penalty terms, and suitable penalty weights. This process is time-consuming and often demands substantial domain expertise. To address this challenge, we propose an end-to-end multi-agent framework that automatically generates QUBO formulations from natural-language problem descriptions, supported by structured or unstructured test cases. To evaluate its performance, We also introduce QUBOBench, a benchmark containing 100 combinatorial optimization problems across 12 application domains, curated from peer-reviewed literature, competitions, and canonical NP-hard problems. Experimental results show that our framework achieves 68% accuracy on QUBOBench, outperforming a direct single-call baseline by 22%. Further analysis identifies iterative self-repair as the most important component contributing to improved performance. The data and code are open-sourced at this https URL.

中文摘要

摘要:二次无约束二进制优化(QUBO)是组合优化的核心形式,由于其与量子、量子-经典混合以及量子启发求解器的兼容性而受到越来越多关注。然而,将自然语言的问题描述正确地转化为QUBO公式仍然十分困难,这需要识别二进制变量、约束、目标函数、惩罚项以及合适的惩罚权重。这个过程耗时且通常需要大量领域专业知识。为了解决这一挑战,我们提出了一个端到端多智能体框架,能够从自然语言问题描述自动生成QUBO公式,并支持结构化或非结构化的测试用例。为了评估其性能,我们还引入了QUBOBench,这是一个基准测试,包含来自12个应用领域、共100个组合优化问题,问题来源包括同行评议文献、竞赛以及典型的NP难问题。实验结果显示,我们的框架在QUBOBench上达到了68%的准确率,比直接单次调用的基线提升了22%。进一步分析表明,迭代自我修复是提升性能的重要组成部分。数据和代码已在此https URL开源。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10629 (HTTP 429)

Authors: Niloy Kumar Mondal, Md Rizwan Parvez

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10629.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10629

Published: 2026-09-13T01:26:01.655Z


3. A Multi-Stage Rule-Chaining Framework for Compositional and Interpretable Cognitive Reasoning

Abstract:The Abstraction and Reasoning Corpus (ARC) benchmarks cognitive generalization, the ability to infer and apply abstract rules from limited examples. This paper presents a multi-stage rule-chaining framework that performs compositional reasoning across symbolic, structural, and conceptual levels. The framework integrates three complementary solvers: (1) a deterministic rule discovery module that induces atomic transformations through geometric, color, and object-based analysis; (2) a pattern-composition engine that reconstructs outputs via block merging, repetition, and spatial heuristics; and (3) a structural abstraction layer that infers hierarchical and nested relationships across grids. These solvers operate sequentially within a progressive fallback hierarchy, where each stage reuses prior reasoning traces to enhance interpretability and generalization. Training passed for 995 tasks out of 1000, further evaluated on 105 tasks out of 120 and solved 230 test tasks out of 240 ARC-AGI-2 tasks. The system achieved strong coverage across deterministic, compositional, and abstract categories, demonstrating an overall accuracy exceeding 95 percent. The proposed architecture bridges symbolic reasoning and pattern synthesis, providing interpretable insight into cognitive generalization. The results suggest that rule chaining and hierarchical composition can advance machine reasoning toward transparent, human-aligned abstraction without relying on task-specific tuning.

中文摘要

摘要:抽象与推理语料库(ARC)衡量认知泛化能力,即从有限示例中推断并应用抽象规则的能力。本文提出了一个多阶段规则链框架,在符号、结构和概念层面上执行组合推理。该框架整合了三种互补求解器:(1)确定性规则发现模块,通过几何、颜色和基于对象的分析诱导原子变换;(2)模式组合引擎,通过块合并、重复和空间启发重建输出;以及(3)结构抽象层,推断网格间的层次和嵌套关系。这些求解器在渐进回退层级中按顺序操作,每个阶段重用先前的推理轨迹以增强可解释性和泛化能力。在1000个任务中,训练通过了995个任务,进一步在120个任务中的105个任务上进行评估,并在240个ARC-AGI-2测试任务中解决了230个任务。该系统在确定性、组合性和抽象类别中覆盖率强,表现出总体准确率超过95%。所提出的架构在符号推理与模式合成之间架桥,提供了对认知泛化的可解释见解。结果表明,规则链和层次组合可以推动机器推理向透明、与人类一致的抽象发展,而无需依赖任务特定的调优。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10654 (HTTP 429)

Authors: Deblina Kar

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10654.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10654

Published: 2026-09-13T01:26:01.655Z


4. Understanding LoRA Rank Trade-offs in Diffusion Model Fine-Tuning

Abstract:Selecting LoRA rank for diffusion fine-tuning requires balancing quality and compute cost. We present a controlled study on CIFAR-10 using a DDPM U-Net with ranks {2,4,8,16,32}, fixed optimization settings, and a reproducible local-folder pytorch-fid protocol. We report FID, trainable parameters, runtime, and GPU memory, then validate trends with extended-budget DDPM runs (20 epochs; ranks 4/8/16) and a Tiny DiT backbone (10 epochs; ranks 4/8/16). Results show moderate ranks are most efficient: rank 4 achieves the best DDPM FID (124.1380), rank 8 is close (124.2136), and higher ranks provide limited gains despite larger adaptation cost. These findings support small-to-moderate ranks as practical defaults under fixed training budgets.

中文摘要

摘要:为扩散微调选择 LoRA 秩需要在质量和计算成本之间取得平衡。我们在 CIFAR-10 上进行了受控研究,使用 DDPM U-Net 并设置秩为 {2,4,8,16,32},固定优化设置,以及可重复的本地文件夹 pytorch-fid 协议。我们报告了 FID、可训练参数、运行时间和 GPU 内存,然后通过扩展预算的 DDPM 运行(20 个 epoch;秩 4/8/16)和 Tiny DiT 主干(10 个 epoch;秩 4/8/16)验证趋势。结果显示中等秩最为高效:秩 4 达到最佳 DDPM FID(124.1380),秩 8 接近(124.2136),而更高秩尽管适应成本更大,但提升有限。这些发现支持在固定训练预算下,将小到中等秩作为实际默认值。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10656 (HTTP 429)

Authors: Iman Khazrak, Narges Nejad, Mostafa M. Rezaee, Robert C. Green II

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10656.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10656

Published: 2026-09-13T01:26:01.655Z


5. Quantifying the Memorization-to-Generalization Transition: Scaling Laws and Phase Structure in Grokking

Abstract:Neural networks trained past memorization frequently undergo a delayed transition to generalization, a phenomenon known as grokking. Despite theoretical progress on \emph{why} this transition occurs, the quantitative structure of \emph{when} it occurs in hyperparameter space remains uncharacterized. We map the memorization-to-generalization boundary across 384 configurations of two-hidden-layer MLPs on modular arithmetic, fitting a power-law scaling relation for generalization onset time: $T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$ ($R^2 = 0.732$; $0.821$ with interactions). The exponent hierarchy reveals that data complexity ($D^{-2.04}$) is the dominant driver of regime transition, not model capacity ($H^{-0.27}$): doubling data accelerates generalization by ${\sim}4\times$, while doubling width yields only ${\sim}1.2\times$. A sharp phase boundary at weight decay $\lambda \gtrsim 1.0$ separates grokking from non-grokking configurations, and weight norm trajectories show monotonic compression during the transition, consistent with implicit regularization selecting low-complexity solutions. These results provide a quantitative foundation for predicting and controlling regime transitions in overparameterized networks.

中文摘要

摘要:经过记忆训练的神经网络常常经历延迟向泛化的转变,这种现象称为“格罗克”(grokking)。尽管关于该转变发生的 \emph{why} 理论已有进展,但其在超参数空间中发生的 \emph{when} 的定量结构仍未被表征。我们在模算术上映射了384种双隐藏层MLP配置中的记忆到推广边界,拟合推广起始时间的幂律尺度关系:$T_{\mathrm{grok}} \propto H^{-0.27}\, D^{-2.04}\, \eta^{-0.50}\, \lambda^{-0.64}$ ($R^2 = 0.732$;含交互作用为$0.821$)。指数层级表明,数据复杂度($D^{-2.04}$)是控制政区转变的主要驱动因素,而非模型容量($H^{-0.27}$):数据加倍会使泛化加速 ${\sim}4\times$,而宽度加倍仅得 ${\sim}1.2\times$。在权重衰变 $\lambda \gtrsim 1.0$ 处的明显相位边界区分了 grokking 与非 grokking 配置,权范数轨迹在转变过程中表现出单调压缩,这与隐式正则化选择低复杂度解相符。这些结果为预测和控制超参数网络中的 regime 转移提供了定量基础。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10657 (HTTP 429)

Authors: Anish Kataria

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10657.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10657

Published: 2026-09-13T01:26:01.655Z


6. An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

Abstract:We study how model post-training and test-time inference design affect natural-language proof generation for hard olympiad mathematics. Starting from Nemotron 3 Ultra, we train two specialist checkpoints using supervised fine-tuning and reinforcement learning, and evaluate checkpoint choice, verification, and refinement. Based on these findings, we present an open-model test-time-compute pipeline. The system operates entirely in natural language, with no formal prover, external tools, or internet access. Three Nemotron 3 Ultra checkpoints - the general-availability model and two post-trained specialists - power an iterative search that generates, verifies, and refines candidate proofs; a separate high-compute stage then selects each final submission. The system scored 30 out of 42 points at IMO 2026, reaching the gold-medal threshold. We release the two post-trained checkpoints as well as the training data, the training and inference code, the submitted solutions, and Nemotron-IMO-Bench, a new benchmark of 200 novel olympiad-level problems.

中文摘要

摘要:我们研究了模型后训练和测试时推理设计如何影响困难奥林匹克数学的自然语言证明生成。从 Nemotron 3 Ultra 开始,我们使用监督微调和强化学习训练了两个专项检查点,并评估了检查点选择、验证和改进。基于这些发现,我们提出了一个开放模型的测试时计算管道。该系统完全以自然语言操作,不使用形式化定理证明器、外部工具或互联网访问。三个 Nemotron 3 Ultra 检查点——通用可用模型和两个后训练专家——支持一个迭代搜索,用于生成、验证和改进候选证明;随后单独的高计算阶段选择每次最终提交。该系统在 IMO 2026 中获得了 42 分中的 30 分,达到了金牌标准。我们发布了两个后训练检查点以及训练数据、训练与推理代码、提交的解答,以及 Nemotron-IMO-Bench,这是一个包含 200 道新颖奥林匹克水平问题的新基准。

LLM Analysis

Q: 这篇论文试图解决什么问题? 这篇论文致力于解决\*\*如何通过后训练(post-training)与测试时计算(test-time compute)设计,使大语言模型在自然语言形式下生成严格数学证明,从而在国际数学奥林匹克(IMO)级别竞赛中达到金牌水平\*\*的问题。 具体而言,论文围绕以下核心子问题展开: - \*\*专项能力构建\*\*:如何基于通用基础模型(Nemotron 3 Ultra)训练出专门用于证明生成、验证、评分与精炼的模型,以处理高难度的奥林匹克数学问题。 - \*\*迭代生成-验证-精炼(generate-verify-refine)\*\*:如何设计高效的搜索流程,使模型能够提出候选证明、由验证器评判正确性并给出自然语言反馈、再基于反馈迭代改进,最终在没有形式化证明器、外部工具或网络访问的条件下输出可靠解答。 - \*\*多模型协同与计算分配\*\*:如何利用多个经不同后训练(监督微调与强化学习)得到的专家模型,在生成、验证与最终选择阶段合理分配测试时计算资源,以最大化解题覆盖率与正确率。 - \*\*开放与可复现\*\*:如何在达到竞赛金牌阈值(IMO 2026 得分 30/42,金牌线 29 分)的同时,完整开源模型权重、训练数据、推理代码与评估基准(Nemotron-IMO-Bench),为后续研究提供可复现的参考系统。 简言之,该工作旨在提供一条\*\*开放的、完全基于自然语言的 IMO 金牌级数学推理系统\*\*的工程化路径,并系统性地评估模型选择、验证机制与多模型集成等关键设计决策对最终性能的影响。 Q2: 有哪些相关研究? 根据论文第3节,相关工作可分为以下四个主要方向: ### 1. 神经符号与形式化方法(Neuro-symbolic and formal methods) 该方向将神经网络与符号推理或形式化验证相结合,是早期AI冲击IMO的主要路径。 - \*\*AlphaGeometry\*\*(Trinh et al., 2024):利用神经语言模型引导符号引擎完成几何证明。 - \*\*AlphaProof 与 AlphaGeometry 2\*\*(Hubert et al., 2026):在IMO 2024中联合取得接近人类金牌线的成绩(差1分)。 - \*\*基于Lean的神经定理证明器\*\*:包括 \*\*DeepSeek-Prover\*\*(Ren et al., 2025)、\*\*GoedelProver\*\*(Lin et al., 2025)与 \*\*SeedProver\*\*(Chen et al., 2025),持续推动形式化证明在 miniF2F、PutnamBench 等基准上的开源前沿(Zheng et al., 2022; Tsoukalas et al., 2024)。 - 此类系统的可扩展性高度依赖Lean等形式化工具提供的可靠符号验证,用于生成大规模训练语料并搜索高分支率的证明空间。 ### 2. 自然语言证明突破(Natural-language breakthroughs for proofs) 2025年标志着纯自然语言系统首次在IMO达到金牌水平,证明了端到端自然语言推理的可行性。 - \*\*Gemini Deep Think\*\*(Luong & Lockhart, 2025)与 \*\*OpenAI实验模型\*\*(OpenAI, 2025):在IMO 2025中各自解决了五道题目并获得满分,展示了前沿大语言模型的证明生成能力。 - 这些结果同时凸显了\*\*验证与最终方案选择\*\*的重要性(Mahdavi et al., 2025; Guo et al., 2025),即生成正确证明只是系统的一部分,如何判别并挑选出正确提交同样关键。 ### 3. 反馈驱动的精炼循环与数学智能体(Feedback-driven refinement loops and math agents) 该方向关注模型如何通过自我或外部反馈迭代改进输出,而不仅限于一次性生成。 - \*\*Huang & Yang (2025)\*\*:证明了一个模型无关的“验证-精炼”流水线,基于当时公开可用的模型即可达到IMO金牌水平。 - \*\*Self-Refine\*\*(Madaan et al., 2023)与 \*\*RLEF\*\*(Gehring et al., 2025):在代码执行领域展示了类似的迭代自我反馈与强化学习框架。 - \*\*Nomos\*\*(Jin et al., 2025):在Putnam 2025中取得顶尖成绩,采用后训练模型配合并行生成、评分与整合的推理架构,但不依赖基于反馈的迭代精炼。 ### 4. 证明搜索系统与测试时计算扩展(Proof-search systems and test-time scaling) 该方向研究如何在测试阶段通过增加计算资源(如多次采样、验证与搜索)提升推理性能。 - \*\*DeepSeekMath-V2\*\*(Shao et al., 2025):分别训练生成器、验证器与元验证器模型,并在高计算量的搜索设置中按比例扩展验证计算。 - \*\*Aletheia\*\*(Feng et al., 2026):以Gemini Deep Think为基座的数学研究智能体,采用显式的生成器(Generator)、验证器(Verifier)、修订器(Reviser)子智能体进行迭代,将前沿从奥林匹克竞赛推向研究级数学。 - \*\*Nemotron-Cascade 2\*\*(Yang et al., 2026):通过级联后训练与蒸馏,证明紧凑型模型也能在证明生成领域接近大型前沿开放模型的能力。 Q3: 论文如何解决这个问题? 论文通过\*\*模型后训练\*\*与\*\*测试时推理架构\*\*的协同设计,构建了一套完全基于自然语言的 IMO 金牌级数学证明系统。其解决方案可从以下层面展开: --- ### 1. 基础模型与后训练专家化 系统以 \*\*Nemotron-3-Ultra-550B-A55B\*\* 为基座,保留了通用可用版本(GA)不变,并衍生出两个专项后训练模型: - \*\*监督微调模型(Nemotron-3-Ultra-SFT)\*\*:在最长 425,984 token 的上下文窗口下,使用 414,890 条高质量合成数据微调。数据覆盖证明生成、验证、精炼与元验证四种轨迹,旨在教授模型构建证明、诊断逻辑漏洞、修正错误路径并评估证明有效性。 - \*\*强化学习模型(Nemotron-3-Ultra-RL)\*\*:从相同基座出发,采用异步 RL 框架(类似 PipeLineRL),在 9,597 道难题上优化证明生成能力,使用 DeepSeekMath-V2 风格的奖励设计,并通过动态采样与截断重要性采样稳定训练。 --- ### 2. 两阶段测试时推理架构 整个推理流程分为\*\*搜索阶段\*\*与\*\*最终选择阶段\*\*,均以高计算预算运行: #### 阶段一:高计算迭代搜索(Generate–Verify–Refine) 对每道题目独立运行最多 8 轮迭代: - \*\*生成(Generate)\*\*:第 1 轮由三个 checkpoint(GA、SFT、RL)各自在 8 种互补的生成提示下采样,共产生 384 份初始候选证明。多种提示策略(如引理优先、路线比较、反例防护、不变量/极值法等)旨在解耦采样相关性并覆盖 diverse 解题路径。 - \*\*验证(Verify)\*\*:使用 RL 与 SFT 两个验证器,对每个候选证明各产生 8 条独立判断(共 16 条)。验证器采用无参考(reference-free)评分:1 分(完全正确)、0.5 分(大体正确但有minor遗漏)、0 分(存在致命错误)。仅当全部 16 条有效判断均为 1 分时,该证明才被\*\*内部接受(accepted)\*\*,触发该生成器的提前停止。 - \*\*精炼(Refine)\*\*:若未找到被接受的证明,系统从全局证明池中选取最多 16 个高排名候选,构造包含最多 8 条验证器批评的精炼提示,并交由全部三个生成器各采样 4 次,每轮产生 192 份精炼尝试。精炼后的证明重新进入验证流程与证明池。 #### 阶段二:高计算最终选择 搜索结束后,系统可能持有最多 3 名决赛选手(每个生成器一名被接受证明,或无人被接受时的最高排名证明)。为确定最终提交: - 三名 checkpoint 以\*\*无参考 IMO 风格评委提示\*\*对每名决赛选手各产生 16 次独立评分,共 48 次判断。 - 评分采用 0–7 的整数制,依据证明实际建立的里程碑(milestones)进行判定,模仿官方 IMO 评卷逻辑。 - 最终按 48 次评分的均值排名,平局时优先选择更短的证明文本。 --- ### 3. 多模型角色分配与互补性 三个 checkpoint 在流程中承担不同角色,形成能力互补: - \*\*生成端\*\*:GA、RL、SFT 同时参与,因为实验表明不同 checkpoint 能解决彼此无法独立解决的问题( doubling 单一模型的采样数收益甚微)。 - \*\*验证端\*\*:仅使用 RL 与 SFT(两者选择性更高),排除较为宽松的 GA,以降低误接受率。 - \*\*最终评判端\*\*:三者共同作为 IMO 风格评委,利用多样性提升最终排名的可靠性。 --- ### 4. 验证器机制与精度控制 搜索阶段的核心目标是\*\*避免过早终止于错误证明\*\*。因此验证器设计极度偏向\*\*精度(precision)\*\*而非召回: - \*\*全票通过制(unanimity)\*\*:16/16 张票均为 1 分才接受。 - 实验表明,SFT 单独验证的误接受率约为 4.5%,加入 RL 的否决后降至 1.1%;而引入 GA 无法进一步降低误接受率,反而增加误拒。 - 这种高门槛确保了进入决赛圈的证明具有极高的内部一致性,而误拒仅会延迟搜索,不会导致不可逆的提交错误。 --- ### 5. 完全自然语言的约束 与依赖 Lean 等形式化证明器的系统不同,该方案严格限定于\*\*自然语言\*\*: - 无形式化证明器、无外部计算工具、无网络访问。 - 输入为赛会提供的 LaTeX 题目陈述,输出为自然语言解答文本,直接符合 IMO 提交格式。 - 验证与评分同样通过自然语言推理完成,而非依赖编译器或符号引擎的布尔判定。 --- ### 6. 开源与资源透明 为确保可复现性与未来可扩展性,论文完整开源了系统全部关键组件: - 两个后训练模型权重(SFT 与 RL)。 - 训练数据(SFT 语料与 RL 问题集)。 - 训练与推理代码(NeMo-Skills、NeMo-RL)。 - IMO 2026 官方提交的全部解答。 - 新的评估基准 \*\*Nemotron-IMO-Bench\*\*(200 道全新奥林匹克难度题目)及 30 题开发集。 - 竞赛运行的详细资源账目:最终提交在约 7.07 亿生成 token 与 1,464 GB200 GPU 小时内完成;完整搜索消耗约 23.1 亿 token 与 4,800 GPU 小时。 --- 通过上述设计,该系统在 IMO 2026 上以 \*\*30/42 分\*\*达到金牌阈值(29 分),并在赛后持续搜索中于 Problem 6 发现了一道经独立人工评卷获 4/7 分的非官方解答。 Q4: 论文做了哪些实验? 论文通过系统性消融实验评估了系统设计中的关键决策,所有实验均在自建的 30 题开发集(含 20 题 Nemotron-IMO-Bench 新题与 10 题近期竞赛题)上进行。主要实验内容如下: --- ### 1. 单检查点管道性能(Section 7.1) 为比较各后训练检查点在完整生成-验证-精炼流程中的端到端表现,论文独立运行了 \*\*Nemotron-3-Ultra-GA\*\*、\*\*Nemotron-3-Ultra-RL\*\* 与 \*\*Nemotron-3-Ultra-SFT\*\* 三种单检查点基线。每个检查点同时承担生成、验证与精炼职能,采用 128 份首轮候选、64 次验证判断与多轮精炼的固定预算。实验追踪了每轮搜索后被内部接受的证明数量,以及经独立模型评审团(GPT-5.5、Gemini 3.1 Pro、Claude Opus 4.8)按 IMO 0–7 分制评分后的累积得分。结果表明,两个后训练检查点均显著优于基座 GA 模型,其中 SFT 在首轮接受率上领先,而 RL 在八轮后的最终总分上最优(见 Table 2)。 --- ### 2. 检查点验证性能与面板规则(Section 7.2) 为验证搜索阶段采用 \*\*RL + SFT 双模型全票通过(16/16)\*\* 规则的合理性,论文在 300 份证明的审计集上(含 25 份被接受证明与 275 份分层采样的未接受证明)系统测量了不同验证规则的操作点: - \*\*单检查点规则\*\*:分别测试 GA、RL、SFT 以 8/8 全票通过时的误接受率(false accept)与误拒绝率(false reject)。结果显示三者主要在选择性上存在差异:GA 过于宽松(误接受 31.6%),SFT 最严格(误接受 4.5%),RL 居中(误接受 12.4%)。 - \*\*混合面板规则\*\*:测试了 GA+SFT(16/16)、RL+SFT(16/16,即提交系统配置)与 GA+RL+SFT(24/24)三种全票通过面板。RL+SFT 将误接受率降至 1.1%,显著优于单模型,且加入 GA 几乎无法进一步降低误接受率,反而增加误拒。 - \*\*放松阈值\*\*:测试 14/16 与 12/16 的多数通过规则,发现误接受率分别跃升至 17.0% 与 25.4%,表明放松 unanimity 门槛会显著损害精度。 该实验确立了搜索阶段验证器应选用高选择性的 RL 与 SFT,并坚持全票通过机制,以避免过早终止于错误证明(见 Table 3)。 --- ### 3. 完整集成管道与首轮预算分配(Section 7.3) 论文在开发集上复现了提交的多模型集成管道,并将其与单检查点结果对比。集成系统在三轮内即达到最终接受分数,且八轮后总分(含未接受问题的 fallback 评分)领先最优单检查点 RL 达 8 分。 为隔离“增加单模型采样数”与“引入多模型多样性”之间的效益,论文进行了\*\*首轮生成预算分配实验\*\*(Table 4)。在固定 RL 验证器评分的条件下,对比了以下配置: - 将 RL 采样从 128 倍增至 256; - 将部分预算替换为 64 或 128 次 SFT 采样; - 引入 GA 采样。 实验表明,单纯加倍 RL 采样仅多解决 1 道题;而将同等 token 预算分配给 64 次 SFT 尝试则显著更优,因为 SFT 能解决 RL 未覆盖的问题(128 RL + 128 SFT 的 18 道被接受证明中,5 道仅来自 SFT)。GA 在首轮未能带来额外接受问题,但仍被保留用于后续轮次以增加精炼多样性。 --- ### 4. 未改进最终系统的替代方案(Section 7.4 & Appendix A) 论文还探索了若干未纳入最终提交的替代设计,以证明其保留策略的合理性: - \*\*交叉证明上下文(Cross-proof context)\*\*:在精炼阶段引入问题级全局上下文,汇总此前所有尝试的经验教训。结果显示该方法虽加速早期搜索,但最终接受数(42 题)低于基线(44 题)。 - \*\*零优先排名(Zero-first ranking)\*\*:改变候选排名规则,优先选择获得 0 分判断更少的证明(而非单纯按均值排名)。该变体同样改善了早期进度,但最终与基线持平。 - \*\*多证明综合精炼(Refinement from diverse proofs)\*\*:同时选取 4 份低文本重叠的候选证明,要求模型综合其有效部分生成新解。该策略改变了哪些题目最终被解决,但总覆盖率与单父代精炼相同(22/47),未提升聚合性能。 - \*\*分诊路由(Triage-based refinement routing)\*\*:为降低验证成本,先用 3 次初步判断筛选候选,仅前 32 名进入精炼。回放分析表明,该策略在 44% 的案例中丢弃了基线管道最终成功接受的正确证明的“祖先”候选,因此未被采用。 这些消融实验共同说明,更复杂的路由、排名与上下文策略虽可能改变搜索动态,但未能提升最终覆盖率,而激进过滤反而有丢弃正确证明谱系的风险。 Q5: 有什么可以进一步探索的点? 基于论文的实验结果与系统设计取舍,以下几个方向值得进一步探索: --- ### 1. 验证器盲 spot 的识别与消除 论文指出,在 IMO 2026 的 Problem 3 与 Problem 6 上,内部验证器与独立模型评审团均一致地高估了证明质量(内部预估约 32 分,官方实际仅 30 分),反映出验证器存在\*\*共享盲 spot\*\*(shared blind spot)。未来工作可探索: - \*\*异构验证器集成\*\*:引入架构或训练范式差异更大的验证模型(如基于形式化背景或不同基础模型家族),打破自然语言验证中的系统性偏差。 - \*\*对抗性验证训练\*\*:在验证器的后训练阶段显式注入针对常见盲 spot 的对抗样本(如对称性误用、隐藏量词疏漏),提升其对边界错误的敏感度。 - \*\*元验证机制的外推\*\*:当前元验证(meta-verification)仅用于 SFT 数据合成,未在测试时推理中部署。将其纳入搜索流程,对验证器判断进行二次审视,可能降低一致性误判风险。 --- ### 2. 自然语言推理与形式化验证的混合架构 该系统严格限定于自然语言,不使用 Lean 等形式化工具。虽然这保证了开放性,但也放弃了形式化系统提供的\*\*硬性正确性保证\*\*。未来可研究: - \*\*自然语言生成 + 形式化回填\*\*:让模型以自然语言进行高层证明构造与搜索,随后对关键引理或核心步骤自动转换为 Lean/Isabelle 进行快速核验,仅在形式化失败时触发精炼。 - \*\*形式化信号作为验证器训练目标\*\*:利用形式化引擎产生的布尔反馈作为辅助监督信号,训练更精确的自然语言验证器,而非仅依赖模型自举评分。 --- ### 3. 测试时计算的自适应分配策略 当前系统在 4.5 小时竞赛截止后搜索即进入平台期(plateau),但在赛后继续运行至 8 小时 25 分时于 Problem 6 发现了更高质量的解(非官方 4/7 分)。这表明\*\*固定轮次与均匀预算分配可能非最优\*\*。可进一步研究: - \*\*基于问题难度的动态预算分配\*\*:利用轻量级分类器在首轮生成后估计问题难度,对高置信度接近解决的问题提前终止,对困难问题保留更多精炼轮次与验证判断数。 - \*\*在线学习式搜索控制\*\*:在搜索过程中根据验证器分数的收敛速率或证明池的多样性指标,实时调整后续轮的采样数与模型选择策略。 --- ### 4. 跨证明信息聚合的再设计 附录 A 中的实验表明,\*\*交叉证明上下文(cross-proof context)\*\*与\*\*多证明综合精炼(diverse-proof refinement)\*\*虽改变了搜索动态,却未提升最终覆盖率。这可能源于: - 当前的问题级上下文提示过于保守,为避免误导而限制了跨证明知识迁移的强度; - 多证明综合时要求模型“从零写新证明”的认知负荷过高,导致有效组件丢失。 未来可探索更结构化的聚合方式,例如: - \*\*证明图(proof graph)构建\*\*:将多个候选证明解析为依赖图(引理-结论链),通过图算法识别最大公共正确子图与互补缺口,再定向生成修补证明。 - \*\*专门化综合模型\*\*:训练一个独立的“证明综合器”(proof synthesizer),其唯一任务是从多个带评分的候选中提取并重组有效论证,而非让通用生成器兼任。 --- ### 5. 特定数学领域的专项化与失败分析 开发集包含 6 道代数、8 道组合、8 道几何与 8 道数论题,且 Problem 3 与 Problem 6 恰好是系统表现最弱的问题。未来可: - 对验证器与生成器的错误进行\*\*按领域归因\*\*,识别几何证明中的图示/构型隐含假设、组合证明中的计数边界疏漏、或数论证明中的模运算方向错误等模式化弱点; - 针对特定领域设计\*\*领域专用提示模板与验证标准\*\*(如几何问题强制要求坐标/复数法与综合法的双向验证),而非沿用统一评分 rubric。 --- ### 6. 强化学习奖励设计与过程监督 当前 RL 训练移除了 self-analysis reward(设 α=1, β=0 ),且仅使用结果奖励(outcome reward)。未来可探索: - \*\*自然语言过程奖励模型(Natural-Language Process Reward Model, NL-PRM)\*\*:在证明的每一步或每一段落后提供细粒度反馈,使 RL 训练不仅关注最终正确性,也关注推理链的局部有效性。 - \*\*基于验证器置信度的课程学习\*\*:根据验证器对生成证明的评分分布(如方差或熵)动态调整训练样本权重,优先学习那些验证器“高置信度认为接近正确”的边缘案例。 --- ### 7. 计算效率与模型压缩 完整竞赛运行消耗约 2.31 × 10^9 生成 token 与 4,800 GB200 GPU 小时,成本高昂。结合 \*\*Nemotron-Cascade 2\*\*(Yang et al., 2026)的启示,未来可研究: - \*\*级联蒸馏\*\*:将最终集成系统的验证与生成能力蒸馏到更小规模的模型中,以极低的推理预算保留大部分性能。 - \*\*投机式验证(speculative verification)\*\*:使用轻量级模型进行快速预筛选,仅将高潜力候选提交给重型验证器(RL/SFT),在保持精度的同时降低验证阶段的 16 × 重复判断开销。 Q6: 总结一下论文的主要内容 这篇论文提出了一套完全基于自然语言、无需形式化证明器或外部工具的 IMO(国际数学奥林匹克)金牌级数学推理系统,并对其设计决策进行了系统性的实证研究。 ### 研究背景与目标 近年来,AI 系统在数学奥林匹克竞赛中的能力迅速提升:2024 年神经符号系统达到银牌水平,2025 年自然语言模型首次达到金牌线。本文旨在研究\*\*模型后训练(post-training)与测试时计算(test-time compute)设计\*\*如何影响自然语言证明生成,并基于 \*\*Nemotron 3 Ultra\*\* 构建一个可复现、全开放的 IMO 竞赛系统。 ### 核心方法 系统采用“两阶段”测试时推理架构,由三个 Nemotron-3-Ultra 检查点协同驱动: - \*\*模型后训练\*\*:在通用基座(GA)之外,训练了两个专家模型: - \*\*SFT 模型\*\*:通过长上下文监督微调(最长 425,984 tokens),在包含证明生成、验证、精炼与元验证的 41 万余条合成轨迹上学习; - \*\*RL 模型\*\*:采用异步强化学习框架优化证明生成,使用结果奖励并支持长序列生成。 - \*\*高计算搜索阶段(Generate–Verify–Refine)\*\*:对每道题独立运行最多 8 轮迭代搜索。 - \*\*生成\*\*:GA、RL、SFT 三个检查点在 8 种互补策略提示下并行采样,首轮共产生 384 份候选证明; - \*\*验证\*\*:RL 与 SFT 作为验证器,对每个候选各输出 8 次独立判断(共 16 次),仅在 \*\*16/16 全票通过(unanimity)\*\* 且均为满分(1 分)时才内部接受该证明; - \*\*精炼\*\*:若未被接受,系统从证明池选取高排名候选,结合验证器批评进行多模型精炼,迭代进入下一轮。 - \*\*最终选择阶段\*\*:搜索结束后,对最多 3 名决赛选手,由三个检查点以 IMO 0–7 分制进行高计算量的独立评审(共 48 次判断),按均值排名选出最终提交。 ### 实验与发现 论文在自建的 30 题开发集上进行了大量消融实验,主要发现包括: - \*\*单检查点性能\*\*:两个后训练专家均显著优于基座 GA;SFT 首轮接受率最高,RL 八轮后总分最优。 - \*\*验证器设计\*\*:SFT 选择性最高(误接受率 4.5%),RL+SFT 的 16/16 全票通过面板可将误接受率降至 1.1%;放松阈值(如 14/16)会导致误接受率大幅上升至 17% 以上。 - \*\*集成与预算分配\*\*:将首轮预算分配给多模型(如 RL + SFT)比单纯加倍单模型采样更有效,因为不同检查点能解决彼此无法覆盖的问题;GA 虽未增加首轮接受数,但为后续精炼提供多样性。 - \*\*替代策略\*\*:交叉证明上下文、零优先排名、多证明综合精炼与分诊路由等变体虽改变了搜索动态,但均未提升最终覆盖率,部分策略还会丢弃正确证明的“祖先”候选。 ### 竞赛结果与开源贡献 - \*\*IMO 2026 成绩\*\*:系统以 \*\*30/42 分\*\* 达到金牌阈值(29 分),在 Problems 1、2、4、5 获满分,Problems 3 与 6 各获 1 分。赛后持续搜索在 Problem 6 上发现了一道非官方评卷为 4/7 的改进解。 - \*\*资源透明\*\*:最终提交消耗约 7.07 亿生成 token 与 1,464 GB200 GPU 小时;完整搜索约 23.1 亿 token 与 4,800 GPU 小时。 - \*\*完全开源\*\*:论文发布了两个后训练模型权重、训练数据、训练与推理代码、全部提交解答,以及包含 200 道全新奥赛级问题的 \*\*Nemotron-IMO-Bench\*\* 基准(含 30 题开发集),为后续研究提供了可复现的完整参考系统。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [**这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是An%20Open%20Recipe%20for%20IMO%20Gold%3A%20Training%20Nemotron%20for%20Olympiad%20Mathematics,链接是https://arxiv.org/pdf/2609.10712,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.10712。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。

Authors: Ivan Moshkov, Stephen Ge, George Armstrong, Wei Du, Sadegh Mahdavi, Igor Gitman

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10712.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10712

Published: 2026-09-13T01:26:01.655Z


7. Finishing the Task Is Not Enough: Evaluating Agent Resilience and Considerate Participation under Accumulating Challenge

Abstract:Sustained deployment of generative AI agents requires more than isolated task success. Agents must remain useful across repeated interactions, changing conditions, and dependencies on people within shared workflows, especially as technical, human, and operational disruptions accumulate over time. We propose operational resilience and considerate participation as two complementary aspects of evaluating such agents: the former captures how agents recover from blocked work while preserving progress and communicating their limits, and the latter captures how their adaptation accounts for affected people, role boundaries, and the surrounding workflow. Yet both remain underexplored under accumulating challenge. We study 120 simulated healthcare trajectories across two generative AI models and twelve stakeholder-derived tasks under light, medium, and heavy challenge. We compare textual action plans, prompted internal assessments, and quantitative structured workload and affect reports to examine how agent behavior and reported state change as challenge accumulates. Regarding operational resilience, agents shift from self-directed recovery toward greater human dependence, while reporting increasing workload and negative affect in structured reports but seldom expressing strain in textual responses. Regarding considerate participation, agents broaden from task-focused adaptation toward task reframing, attention to others, role-boundary adjustment, and wider coordination, with distinct patterns across actions and internal assessments. From these findings, we derive five deployment dilemmas involving persistence, attention, role boundaries, state disclosure, and escalation that require stakeholder specification, further informing technical implications for learning, situated evaluation, and embodied adaptation.

中文摘要

摘要:持续部署生成式人工智能代理需要的不仅仅是单一任务的成功。代理必须在多次互动、变化的环境以及依赖共享工作流中的人员的情况下保持有用性,尤其是在技术、人力和操作中断随时间累积的情况下。我们提出将“操作弹性”和“体贴参与”作为评估此类代理的两个互补方面:前者反映代理在工作受阻时如何恢复,同时保持进展并沟通其限制;后者则反映其适应行为如何考虑受影响的人、角色边界以及周围的工作流。然而,在累积挑战下,这两方面仍然研究不足。我们研究了两种生成式AI模型在120个模拟医疗轨迹和十二个由利益相关者提出的任务下,在轻、中、重挑战下的表现。我们比较了文本行动计划、提示性内部评估以及定量结构化工作量和情感报告,以检验随着挑战累积,代理行为和报告状态的变化。关于操作弹性,代理从自我引导的恢复逐渐转向更多依赖人类,同时在结构化报告中报告增加的工作量和负面情绪,但在文本回应中很少表达压力。关于体贴参与,代理从以任务为中心的适应扩展到任务重新定义、关注他人、角色边界调整以及更广泛的协调,在行动和内部评估中呈现出不同的模式。根据这些发现,我们总结出涉及持久性、注意力、角色边界、状态披露和升级的五个部署困境,需由利益相关者规定,从而进一步为学习、情境化评估和具身适应的技术实施提供参考。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10724 (HTTP 429)

Authors: Yuanchen Bai, Zijian Ding, Angelique Taylor

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10724.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10724

Published: 2026-09-13T01:26:01.655Z


8. Towards a Deterministic Math Solver for Clinical Language Models

Abstract:Large language models are unreliable at arithmetic, which is a problem for clinical calculators where a single numerical error changes the recommendation. The standard response is to hardcode each calculator as a validated function, one at a time. We test an alternative: the model does not calculate. Instead, it writes case-specific Python that a restricted local executor runs as a deterministic solver, and the model’s task reduces to deciding how to use it. We evaluate this Program-Solve interface on MedCalc-Bench Verified (1,100 cases, 55 calculators) against direct model arithmetic and a hand-written 22-calculator library, using Qwen2.5-7B and Qwen2.5-32B-AWQ, after auditing the benchmark’s formulas against current clinical guidelines and flagging 16 of 55 with version, use or coefficient concerns. With formulas and gold variables supplied and both routes reading the whole note, handing off to the solver is not a reliable advantage at 7B (75.31% against 72.02%, a paired +3.29 points with a 95% calculator-cluster interval of [-3.49, 10.38]) but is one at 32B (90.53% against 83.47%, +7.05 [0.47, 14.60], clear of zero). The hand-written library is exact on its 440 supported cases but abstains elsewhere (40.0% overall). Adding an executor thus helps some open-weight models more than others even under matched formula, variable and note access, and is not a substitute for verified formulas or reliable variable extraction either way.

中文摘要

摘要:大型语言模型在算术方面不可靠,这对于临床计算器而言是一个问题,因为一次数值错误就会改变推荐结果。标准的应对方法是将每个计算器逐个硬编码为已验证的函数。我们测试一种替代方法:模型不进行计算。相反,它编写特定病例的 Python,由受限的本地执行器作为确定性求解器运行,而模型的任务简化为决定如何使用它。我们在 MedCalc-Bench Verified(1,100 个病例,55 个计算器)上评估这一程序求解接口,并与直接模型算术和手写 22 个计算器库进行比较,使用 Qwen2.5-7B 和 Qwen2.5-32B-AWQ,同时对基准的公式与当前临床指南进行审查,并在 55 个计算器中标记了 16 个存在版本、使用或系数方面的疑虑。在提供公式和黄金变量且两种方法均可读取整个病历的情况下,将任务交给求解器在 7B 时并不是可靠优势(75.31% 对 72.02%,配对 +3.29 分,95% 计算器簇区间 [-3.49, 10.38]),但在 32B 时则是优势(90.53% 对 83.47%,+7.05 [0.47, 14.60],明显高于零)。手写库在其支持的 440 个病例上是精确的,但在其他情况则放弃(总体 40.0%)。因此,即使在公式、变量和病历访问匹配的情况下,增加执行器也会对某些开权重模型有更多帮助,但无论如何都不能替代已验证的公式或可靠的变量提取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10728 (HTTP 429)

Authors: Felipe Ocampo Osorio, Sebastián Andrés Cajas Ordoñez, Maximin Lange, Rafi Al Attrach, Sahil Kapadia, Zakaria Laouabdia Sellami, Angelo Antonio Talio, Leo Anthony Celi

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10728.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10728

Published: 2026-09-13T01:26:01.655Z


9. Studying Without a Syllabus: Task-Agnostic Environment Preprocessing

Abstract:Before an LLM agent tackles tasks in a new environment, it can inspect available corpora and tools and construct reusable resources such as indices, scripts, or procedural guidance. Most automated adaptation methods, however, rely on task examples, trajectories, or evaluation feedback to decide what to build. Existing task-agnostic approaches avoid this supervision but commit in advance to a preparation strategy for a particular type of environment. We study a more open-ended setting: can an agent study an unfamiliar environment without a syllabus, i.e. before test time and without knowledge of the downstream task distribution, and choose how to prepare it? We formalize task-agnostic environment preprocessing, in which a studying system explores an environment under a budget and produces artifacts for a frozen solver. We compare unaided and archive-equipped meta-agents with fixed synthetic-practice and corpus-processing methods across six heterogeneous benchmarks. A meta-agent variant achieves the highest Avg@3 reward on five benchmarks, while fixed corpus processing remains best on the largest corpus benchmark. Larger study budgets do not reliably improve downstream reward. Nevertheless, studied artifacts reduce the test-time sampling needed to reach a given score, demonstrating how reusable preparation can shift computation from repeated test-time attempts to a pre-task study phase.

中文摘要

摘要:在大型语言模型(LLM)代理在新环境中处理任务之前,它可以检查可用的语料库和工具,并构建可重用的资源,例如索引、脚本或操作指南。然而,大多数自动化适应方法依赖于任务示例、轨迹或评估反馈来决定构建内容。现有的任务无关方法避免了这种监督,但会提前为特定类型的环境确定准备策略。我们研究一种更开放的情境:代理是否可以在没有教学大纲的情况下研究一个陌生环境,即在测试前并且不了解下游任务分布的情况下,选择如何准备环境?我们形式化了任务无关的环境预处理,其中学习系统在预算限制下探索环境,并为被冻结的求解器生成工件。我们在六个异质基准上比较了无辅助和配备档案的元代理与固定的合成练习和语料处理方法。一个元代理变体在五个基准上实现了最高的Avg@3奖励,而在最大的语料基准上,固定语料处理仍然表现最好。更大的研究预算并不能可靠地提高下游奖励。然而,研究得到的工件减少了达到给定分数所需的测试时采样次数,证明了可重用的准备工作如何将计算从重复的测试时尝试转移到任务前的学习阶段。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10824 (HTTP 429)

Authors: Vinay Samuel, Varun Ursekar, Vijay S. Kalmath, Apaar Shanker, Veronica Chatrath, Yuan Xue

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10824.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10824

Published: 2026-09-13T01:26:01.655Z


10. When Validation Stops Learning: Auditing Update Admission for Continual Embodied Agents

Abstract:Independent evaluation can reject harmful policy updates yet also prevent useful continual learning. We argue that update admission must be assessed through both error control and retained learning opportunities at a stated interaction budget. We identify a concrete failure: a range-based confidence gate cannot certify unchanged old-task behavior within otherwise substantial budgets. A standard paired-binomial construction reduces this burden when outcome disagreements are rare. We also specify certified historical-reference promotion and a round-level missed-opportunity metric. In a constructed one-step pushing diagnostic with 32 seeds, fresh paired checks admit 31.6% of a common update stream at 2,000 episodes per stage, versus zero for the range-based gate; unconditional replay nevertheless learns better in closed-loop runs. A separate learned-dynamics stress test distinguishes model bias from feedback-selection error. The contribution is an admission-audit protocol with analytical and synthetic evidence; physical-robot and VLA validation remain open.

中文摘要

摘要:独立评估可以拒绝有害的策略更新,但也可能阻止有用的连续学习。我们认为,更新的准入必须通过错误控制和在特定交互预算下保留的学习机会来评估。我们确定了一个具体的失败:基于范围的置信门在其他情况下有相当预算时,无法证明旧任务行为保持不变。当结果分歧很少时,标准的成对二项构造可以减轻这一负担。我们还指定了经认证的历史参考提升和轮次级的错失机会指标。在一个构建的一步推动诊断中使用32个随机种子进行测试时,新鲜的成对检查在每个阶段2000个回合下允许常见更新流的31.6%,而基于范围的门为零;然而,无条件回放在闭环运行中表现更好。一个单独的学习动力学压力测试可以区分模型偏差与反馈选择错误。我们的贡献是一个带有分析和合成证据的准入审计协议;物理机器人和VLA验证仍然是未解决的问题。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10873 (HTTP 429)

Authors: Qinzhen Ma, Ruihai Wu

Categories: cs.AI

PDF URL: https://arxiv.org/pdf/2609.10873.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10873

Published: 2026-09-13T01:26:01.655Z


VLM Domain Papers

1. Rethinking Handwritten Character Recognition

Abstract:Non-Latin handwritten character recognition (HCR) remains understudied. Dominant methods consider it as generic image classification, which uses model scale to implicitly learn stroke structure. Structural-prior efficiency—-the principle that explicitly encoding script-geometric regularities as architectural inductive biases can be both more accurate and require fewer parameters. We introduce GraphemeNet, a unified multi-script architecture, governed by two orthogonal binary axes. Axis 1 operationalises stroke-level geometric regularity via Persistent Scaffold Injection (PSI): a script-specific asymmetric convolution injects a stroke scaffold as a weighted residual at every encoder stage, continuously anchoring learned features to script geometry—-distinct from skip connections, auxiliary losses, or attention reweighting. Axis 2 selects between global average pooling with gated fusion and cross-scale attention with a Stroke Topology Module (STM), depending on whether glyph discrimination requires spatial relational reasoning. A Linear Capsule Routing (LCR) with $O(n)$ routing is shared universally. On fourteen benchmarks across eight writing systems, the architecture generalises with only scaffold and decoder topology varying per script, consistently challenging, outperforming published baselines, and establishing structural-prior efficiency as a broadly applicable principle for multi-script HCR.

中文摘要

摘要:非拉丁手写字符识别(HCR)仍未得到充分研究。主流方法将其视为通用图像分类,通过模型规模隐式学习笔画结构。结构先验效率——即明确将书写几何规律编码为架构归纳偏置的原则,可以既提高准确性,又减少参数需求。我们提出了GraphemeNet,一种统一的多书写系统架构,由两个正交的二进制轴控制。轴1通过持久支架注入(Persistent Scaffold Injection, PSI)实现笔画级几何规律:特定书写系统的非对称卷积在每个编码器阶段将笔画支架作为加权残差注入,持续将学习特征锚定于书写几何——区别于跳跃连接、辅助损失或注意力重加权。轴2在全局平均池化与门控融合以及带笔画拓扑模块(Stroke Topology Module, STM)的跨尺度注意力之间选择,具体取决于字形辨识是否需要空间关系推理。线性胶囊路由(Linear Capsule Routing, LCR)具有$O(n)$路由,并普遍共享。在覆盖八种书写系统的十四个基准测试中,该架构实现了良好的泛化,其中每种书写系统仅改变支架和解码器拓扑,一直表现出挑战性,超越已发表的基线,并将结构先验效率确立为适用于多书写系统HCR的广泛原则。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10572 (HTTP 429)

Authors: Ranjit Raut, Aarav Subedi, Ashim Shrestha

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10572.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10572

Published: 2026-09-13T01:26:21.119Z


2. AcFlow: Controlling Text-to-Image Diffusion Transformers via Learned Conditional Activation Flow

Abstract:Text-to-image diffusion transformers (DiTs) are powerful generators, yet direct prompting provides limited control interface for style intensity and can fail to suppress unwanted concepts. To enable these controls, we introduce AcFlow, an inference-time controller that transports intermediate layer image-token activations through a learned concept-conditioned velocity field while keeping the base DiT frozen. A textual concept description specifies the desired intervention, while the integration horizon provides a continuous control parameter. The field produces token-varying, activation-dependent updates. With parameters shared across concepts within each task family, the field supports fine-grained descriptions and generalizes to concepts unseen during training without per-concept fitting. On style control, AcFlow achieves the best style—content trade-off among the evaluated baselines in the high-style-alignment regime. At a fixed operating point, AcFlow attains style—content alignment of 0.5365/0.2860, compared with 0.4397/0.2684 for the baseline with the highest style alignment. Qualitative results demonstrate suppression of diverse concepts, including cases where direct prompting fails. Our analyses support the learned velocity field as an adaptive control mechanism, with update directions varying across tokens and depend on their activation states. Our code is available at this https URL.

中文摘要

摘要:文本到图像的扩散变换器(DiTs)是强大的生成器,但直接提示提供的风格强度控制界面有限,且可能无法抑制不需要的概念。为实现这些控制,我们提出了AcFlow,一种推理时控制器,它在保持基础DiT冻结的情况下,通过学习的概念条件速度场传递中间层图像令牌的激活。文本概念描述指定期望的干预,而积分视野提供连续的控制参数。该速度场产生基于令牌且依赖激活的更新。在每个任务族内跨概念共享参数,该速度场支持精细描述并能推广到训练中未见过的概念,无需每个概念单独拟合。在风格控制方面,AcFlow在高风格一致性情况下,在评估的基线中获得最佳的风格-内容折衷。在固定操作点,AcFlow实现的风格-内容一致性为0.5365/0.2860,而拥有最高风格一致性的基线为0.4397/0.2684。定性结果展示了对各种概念的抑制,包括直接提示失败的情况。我们的分析支持学习得到的速度场是自适应控制机制,其更新方向随令牌变化且依赖于其激活状态。我们的代码可通过此https URL获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10723 (HTTP 429)

Authors: Junran Wang, Zehao Jin, Tianyu Luan, Xinjie Shen

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10723.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10723

Published: 2026-09-13T01:26:21.119Z


3. MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery

Abstract:Monocular 3D hand and body mesh recovery often suffers from severe occlusion and ambiguity. Traditional deterministic methods typically regress a single optimal solution, leading to overconfident predictions. In this paper, we introduce an exploration—exploitation paradigm for ambiguous mesh recovery with multi-hypothesis learning and selection. Specifically, during exploration, based on our probabilistic formulation and entropy maximization, we propose a novel multi-hypothesis method referred to as MHE-Former. It is a Transformer-based multi-hypothesis framework, ensuring high training efficiency and label friendliness while generating plausible and diverse hypotheses. During exploitation, we propose Hypothesis Selection, a context-aware process for multiple predictions. Especially leveraging VLM’s powerful visual understanding and reasoning capabilities, it allows users to choose the most plausible and desired estimate with additional evidence and natural language intent. Extensive experiments demonstrate that our framework achieves state-of-the-art performance in accuracy and diversity across multiple datasets. The user preference study further shows the practicality of our hypothesis selection process.

中文摘要

摘要:单目三维手部和身体网格恢复通常会受到严重遮挡和歧义的影响。传统的确定性方法通常回归单一的最优解,导致预测过于自信。在本文中,我们提出了一种针对模糊网格恢复的探索-利用范式,结合多假设学习与选择。具体而言,在探索阶段,基于我们的概率公式和熵最大化方法,我们提出了一种新型多假设方法,称为 MHE-Former。它是一个基于 Transformer 的多假设框架,确保高训练效率和标签友好性,同时生成合理且多样化的假设。在利用阶段,我们提出了假设选择,这是一个针对多重预测的上下文感知过程。特别是利用 VLM 强大的视觉理解和推理能力,它允许用户在附加证据和自然语言意图的辅助下,选择最合理且期望的估计结果。大量实验表明,我们的框架在多个数据集上实现了准确性和多样性方面的最先进性能。用户偏好研究进一步展示了我们的假设选择过程的实用性。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10743 (HTTP 429)

Authors: Boshu Jia, Rongyu Chen, Linlin Yang, Zihao Liu, Yingjie Chen, Zhongqun Zhang, Zhulin Tao, Shaohui Lin, Xiaoyu Wu, Libiao Jin, Baochang Zhang, Angela Yao

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10743.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10743

Published: 2026-09-13T01:26:21.119Z


4. Meta-Learning for Data-Efficient Plant Growth Estimation via Vision Transformers and Fuzzy Clustering

Abstract:Accurate plant growth estimation is essential for greenhouse monitoring, yet obtaining labeled data remains costly and time-consuming. To address this, we propose a few-shot regression framework that combines Vision Transformer (ViT) feature embeddings, clustering-based task construction, and gradient-based meta-learning, and show that task construction in embedding space is a primary driver of performance. The approach leverages an unlabeled image pool to organize data into structured tasks using fuzzy c-means clustering, enabling efficient learning from a small number of labeled samples. We systematically evaluate meta-learning methods and show that second-order methods (e.g., Model-Agnostic Meta-Learning variants such as MAML++) outperform classical baselines in the few-shot regime. Furthermore, intra-cluster support selection has a limited and dataset-dependent impact. Experiments on two plant datasets show that structured task design combined with meta-learning enables reliable plant growth estimation under severe label scarcity.

中文摘要

摘要:准确的植物生长估计对于温室监控至关重要,但获取标注数据仍然成本高且耗时。为了解决这一问题,我们提出了一种少样本回归框架,该框架结合了视觉变换器(ViT)特征嵌入、基于聚类的任务构建和基于梯度的元学习,并表明在嵌入空间中的任务构建是性能的主要驱动因素。该方法利用未标注的图像池,通过模糊C均值聚类将数据组织成结构化任务,从而能够从少量标注样本中高效学习。我们系统地评估了元学习方法,并表明二阶方法(如模型无关元学习(MAML++)变体)在少样本场景下优于经典基线。此外,簇内支持选择对性能的影响有限且依赖于数据集。在两个植物数据集上的实验表明,结构化任务设计结合元学习能够在严重标签缺乏的情况下实现可靠的植物生长估计。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10749 (HTTP 429)

Authors: Sheikh Hasan Elahi, Rusith Chamara Hathurusinghe Dewage, Habib Ullah, Muhammad Salman Siddiqui, Rakibul Islam, Fadi Al Machot

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10749.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10749

Published: 2026-09-13T01:26:21.119Z


5. GRADE: Single-Frame Generative Radar Depth Estimation Under Visual Degradation

Abstract:Dense 3D depth perception fails under smoke, fog, and darkness because optical sensors cannot penetrate airborne particulates. mmWave radar remains usable and measures range accurately under these conditions, but its small aperture limits angular resolution. We present GRADE, which grounds a pretrained generative prior in single-frame radar geometry to estimate high-fidelity metric depth. GRADE first maps raw 4D radar spectra to coarse metric depth. A latent diffusion backbone then recovers structural detail while conditioning every denoising step on this estimate. A pixel-space adapter uses residual camera cues when available and is trained across clear, smoke-degraded, and occluded inputs so the full output approaches the radar-conditioned path as visibility degrades. Trained and evaluated on ~95K frames across 12 buildings with real smoke, GRADE achieves an MAE of 0.303 m in clear scenes and 0.313 m under smoke, outperforming existing baselines. Code and datasets are available at this https URL.

中文摘要

摘要:在烟雾、雾霾和黑暗环境下,密集的三维深度感知会失效,因为光学传感器无法穿透空气中的颗粒物。毫米波雷达在这些条件下仍然可用并能准确测量距离,但其小孔径限制了角分辨率。我们提出了GRADE,它将预训练的生成先验结合单帧雷达几何结构来估计高保真度的度量深度。GRADE首先将原始的4D雷达频谱映射到粗略的度量深度。然后,一个潜在扩散主干网络在每一步去噪过程中以该估计为条件,恢复结构细节。像素空间适配器在可用时使用残余摄像头信息,并在清晰、烟雾降解和遮挡输入条件下进行训练,从而随着能见度降低,完整输出趋近于雷达条件路径。在覆盖12栋建筑的约95K帧真实烟雾数据上训练和评估后,GRADE在清晰场景下实现了0.303米的平均绝对误差(MAE),在烟雾环境下为0.313米,优于现有基线方法。代码和数据集可通过该HTTPS链接获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10756 (HTTP 429)

Authors: Bin Zhao, Patrick Chiou, Nakul Garg

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10756.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10756

Published: 2026-09-13T01:26:21.119Z


6. Shedding Light: A Benchmark for Evaluating Lighting Understanding in Generative Image Models

Abstract:Accurate modelling of illumination is central to realistic image synthesis and scene understanding. Yet, there is little exploration into whether image generative models are good at this task or whether physical plausibility remains a key challenge for them. Clearly, significant progress has been made in realistic image synthesis, but do models truly understand lighting in a physically accurate manner? To answer this question, this work proposes a benchmark to assess the lighting understanding and harmonisation capabilities of generative models. Our key insight is that evaluating lighting understanding for such models only requires testing how well they insert novel objects into real photographs whilst maintaining consistent illumination. To do so, we use a multi-illumination dataset with images containing simple objects serving as ``light probes’’, and prompt models to inpaint the same object onto the original image, then compare the generated results against the ground-truth light probes. We then estimate the lighting direction, colour and radiance distribution from the inpainted probes, providing a quantitative measure of illumination accuracy and photometric realism. Our work establishes a scalable evaluation protocol to systematically assess how well generative models capture and reproduce real-world lighting, offering a foundation for benchmarking the photometric accuracy of any future models. All code and data are available at this https URL .

中文摘要

摘要:准确的光照建模对于逼真的图像合成和场景理解至关重要。然而,目前对于图像生成模型是否擅长这一任务,或者物理合理性是否仍然是它们面临的关键挑战,研究甚少。显然,在逼真图像合成方面已经取得了显著进展,但模型是否真的以物理准确的方式理解光照仍然存疑。为了回答这一问题,本研究提出了一个基准,用于评估生成模型的光照理解和协调能力。我们的关键见解是,评估此类模型的光照理解,仅需测试它们在将新对象插入真实照片时是否能够保持光照一致性。为此,我们使用了一个多光照数据集,其中包含作为“光照探针”的简单对象图像,并提示模型在原始图像上进行同一对象的修补填充,然后将生成的结果与真实的光照探针进行对比。接着,我们从修补后的探针中估计光照方向、颜色和辐射分布,从而提供光照准确性和光度真实感的量化指标。本研究建立了一个可扩展的评估协议,系统地评估生成模型捕捉和再现真实世界光照的能力,为衡量未来模型的光度准确性提供了基础。所有代码和数据可通过此 https URL 获取。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10787 (HTTP 429)

Authors: Justine Giroux, Jack Oliver Hilliard, Yannick Hold-Geoffroy, Javier Vazquez-Corral, Jean-François Lalonde

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10787.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10787

Published: 2026-09-13T01:26:21.119Z


7. Two-Parameter Flow Map Learning for Continuous-Time Diffeomorphic Image Registration

Abstract:Diffeomorphic image registration is central to medical image analysis, enabling anatomically consistent alignment across subjects. Most learning-based diffeomorphic methods model autonomous ODEs(ordinary differential equations) by parameterizing a stationary velocity field and recovering deformations via scaling-and-squaring. While non-autonomous ODEs with time-dependent velocities increase expressiveness, existing approaches rely on numerical integration to implicitly enforce flow structure that entangles model expressiveness with discretization accuracy. We propose a framework to directly learn the continuous-time solution of a non-autonomous ODE formulated as a two-parameterflow map. By enforcing cocycle consistency, a fundamental structural property of time-varying flows, we learn the flow maps without time discretization and velocity integration during training. The framework recovers diffeomorphic mappings at inference using a small number of compositions. Our proposed framework seamlessly incorporates standard registration backbones and improves alignment accuracy consistently across nine datasets while preserving diffeomorphic structure. Notably, the proposed method achieves an average Dice improvement of 2.1% on brain MRI benchmarks, a 12% TRE reduction on lung CT, and a 2.6% Dice gain on cardiac MRI and ultrasound datasets.

中文摘要

摘要:微分同胚图像配准在医学图像分析中至关重要,它能够实现跨被试的解剖一致对齐。大多数基于学习的微分同胚方法通过参数化静态速度场并通过缩放与平方恢复变形,来建模自治常微分方程(ODE)。虽然具有时间依赖速度的非自治ODE能够增强表达能力,但现有方法依赖数值积分来隐式地强制流结构,这将模型表达能力与离散精度交织在一起。我们提出了一个框架,直接学习以两参数流映射形式表达的非自治ODE的连续时间解。通过强制遵循时间变化流的基本结构属性——协循环一致性(cocycle consistency),我们在训练中无需时间离散或速度积分即可学习流映射。该框架在推理时通过少量组合即可恢复微分同胚映射。我们提出的框架能够无缝整合标准配准骨干,并在九个数据集上持续提高对齐精度,同时保持微分同胚结构。值得注意的是,该方法在脑MRI基准上的平均Dice提升为2.1%,肺部CT的TRE降低了12%,以及心脏MRI和超声数据集上的Dice提升为2.6%.

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10789 (HTTP 429)

Authors: Mohammadjavad Matinkia, Nilanjan Ray

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10789.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10789

Published: 2026-09-13T01:26:21.119Z


8. How Much Velocity Does Off-Ball Space Value Need? A Broadcast-Viewport Benchmark

Abstract:Velocity-aware pitch control is standard, but under a broadcast viewport half the players are off screen and on-screen velocities come from a drifting calibration. We ask at which layer of broadcast off-ball analysis velocity changes the answer. Inheriting our off-screen imputation protocol (three Metrica matches, 44 m viewport, block-bootstrap CIs), we score four velocity regimes — none, viewport-legal observed, true-for-visible, true-for-all — against a velocity-aware ground truth at three layers: imputation, the control surface, and team verdicts. Velocity is nearly useless for imputation (-0.2 pp against a 12—14 pp velocity-free surface MAE), first-order for the surface (-1.5 to -1.8 pp, 11—15% of that MAE), and ten times smaller for verdicts (-0.12 to -0.19 pp). The velocity that matters is the visible channel: perfect occluded-player velocity adds 2—6% of the visible gain, and no last-seen decay policy we tested exceeds that. Omitting velocity blurs the surface (per-frame |e| 2.2—2.6 pp) with small time-averaged bias (per cell <=0.4 pp), whereas imputation error is a structured bias against the defending team’s deep zone (5—9 pp). At a fixed velocity window, a noise ladder of eleven jitter settings, including sigma_v-matched pairs, is ordered to first order by one velocity-noise axis sigma_v with break-even ~1 m/s; eleven SoccerNet-GSR clips from one match through our pipeline measure sigma_v=1.65 m/s yet recover 24—36% of the benefit: 43% of the variance is frame-common, which the surface tolerates, and the residual is heavy-tailed and clustered, which Gaussian controls matched on component RMS do not reproduce (+0.03 vs. +0.36). The share of velocity-free error that velocity removes grows with viewport width (7% at 36 m, 21% at 60 m): fix imputation on tight shots, velocity on wide ones. Code and logs are released.

中文摘要

摘要:速度感知的传球控制是标准做法,但在广播视口下,一半的球员在屏幕之外,屏幕上的速度来自漂移校准。我们探讨了在广播的无球分析中,速度在哪一层改变了结果。继承我们的屏幕外填充协议(三场Metrica比赛,44米视口,块自助法置信区间),我们将四种速度状态——无速度、视口允许的观测速度、对可见球员的真实速度、对所有球员的真实速度——在三层(填充、控制面、球队判定)相对于速度感知的真实值进行评分。对于填充,速度几乎无用(-0.2个百分点,相对12—14个百分点的无速度表面平均绝对误差),对于控制面是一级因素(-1.5至-1.8个百分点,占该平均绝对误差的11—15%),而对于判定而言则小十倍(-0.12至-0.19个百分点)。重要的速度是可见通道的速度:完美的被遮挡球员速度仅增加可见增益的2—6%,而我们测试的任何最后一次被看到的衰减策略都未超过此增益。省略速度会使控制面模糊(每帧|e| 2.2—2.6个百分点),时间平均偏差很小(每单元格 <=0.4个百分点),而填充误差在防守方的深区呈结构性偏差(5—9个百分点)。在固定速度窗口下,包含十一种抖动设置的噪声阶梯(包括匹配σ_v的对照)按一级速度噪声轴σ_v排序,盈亏平衡约为1米/秒;通过我们的流程处理来自一场比赛的十一段SoccerNet-GSR片段测得σ_v=1.65米/秒,但仅恢复了24—36%的增益:43% 的方差是帧共通的,控制面可以容忍,剩余部分呈重尾和聚类分布,高斯控制匹配分量均方根无法再现(+0.03相比+0.36)。速度去除的无速度误差比例随视口宽度增加而增长(36米时为7%,60米时为21%):在紧拍镜头上固定填充,在宽镜头上使用速度。代码和日志已发布。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10801 (HTTP 429)

Authors: Seongjin Choi

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10801.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10801

Published: 2026-09-13T01:26:21.119Z


9. TrajFusionNet+: Transformer-Based Prediction of Pedestrian Crossing Intention via Fusion of Trajectory Representations and Scene Graphs

Abstract:The pedestrian crossing intention task involves predicting whether pedestrians are likely to cross the road from the point of view of an autonomous vehicle. We introduce TrajFusionNet+, a novel transformer-based model for pedestrian crossing intention prediction. TrajFusionNet+ combines sequential and visual representations of pedestrian trajectory with a graph-based representation of the scene context in order to predict pedestrian crossing intention. The proposed architecture builds upon our previous model, TrajFusionNet, and comprises three branches: a Sequence Attention Module (SAM), which processes a sequential representation of past and predicted pedestrian trajectories; a Visual Attention Module (VAM), which utilizes a visual representation of the pedestrian trajectories by overlaying observed and predicted bounding boxes onto scene images; and a Graph Attention Module (GAM), which extracts pedestrian-centric graphs from segmented scene images and captures the relational dependencies between pedestrians and traffic elements. TrajFusionNet+ achieves improved state-of-the-art performance on the two most widely used pedestrian crossing intention datasets, PIE and JAAD. Furthermore, we introduce a new evaluation protocol in which models are trained jointly on the PIE and JAAD datasets but evaluated separately on each. Under this setting, TrajFusionNet+ demonstrates superior generalization compared to existing approaches.

中文摘要

摘要:行人过街意图任务涉及从自动驾驶车辆的角度预测行人是否可能过马路。我们提出了 TrajFusionNet+,一种用于行人过街意图预测的新型基于 Transformer 的模型。TrajFusionNet+ 将行人轨迹的序列和视觉表示与场景上下文的图表示相结合,以预测行人过街意图。所提出的架构基于我们之前的模型 TrajFusionNet,并由三条分支组成:序列注意力模块(SAM),处理过去和预测行人轨迹的序列表示;视觉注意力模块(VAM),通过将观测和预测的边界框叠加到场景图像上来利用行人轨迹的视觉表示;以及图注意力模块(GAM),从分割的场景图像中提取以行人为中心的图,并捕捉行人与交通元素之间的关系依赖。TrajFusionNet+ 在两个最广泛使用的行人过街意图数据集 PIE 和 JAAD 上实现了改进的最新性能。此外,我们提出了一种新的评估协议,在该协议中,模型在 PIE 和 JAAD 数据集上联合训练,但分别在每个数据集上进行评估。在这种设置下,TrajFusionNet+ 显示出相比现有方法更优越的泛化能力。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10806 (HTTP 429)

Authors: François G. Landry, Moulay A. Akhloufi

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10806.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10806

Published: 2026-09-13T01:26:21.119Z


10. Overpainting: Localized Context-aware Diffusion Image Editing

Abstract:We present “overpainting”, an image editing operation which offers both control over the location of the edit and awareness of the previous content in that location. The overpainted area is given by a trimap, where white-annotated pixels must be edited, gray-annotated pixels may be edited, and black-annotated pixels must not be edited. This enables both precise and loose control, depending on user intent. We implement overpainting by adapting a pretrained image editing diffusion model using a combination of joint attention and low-rank adaption across input images with attention-dropout to balance the information flow between noise, source and mask images. We present a novel, automated, training data generation pipeline that (1) generates a set of candidate image pairs leveraging existing language-based editing models, (2) carefully curates those pairs, and (3) extracts a trimap from each usable pair. We demonstrate the versatility of our overpainting model on a wide range of editing tasks.

中文摘要

摘要:我们提出了“覆盖绘制”(overpainting),这是一种图像编辑操作,它不仅可以控制编辑的具体位置,还能考虑该位置的原有内容。覆盖绘制的区域由三值图(trimap)表示,其中白色标注的像素必须被编辑,灰色标注的像素可以被编辑,黑色标注的像素不能被编辑。这使用户可以根据意图实现既精确又灵活的控制。我们通过改造预训练的图像编辑扩散模型来实现覆盖绘制,该方法结合了联合注意力和跨输入图像的低秩适配,并使用注意力丢弃(attention-dropout)来平衡噪声源、源图像和掩码图像之间的信息流。我们提出了一种新颖的自动化训练数据生成流程,该流程(1)利用现有的基于语言的编辑模型生成候选图像对,(2)对这些图像对进行精心筛选,及(3)从每个可用图像对中提取三值图。我们在各种编辑任务上展示了覆盖绘制模型的多功能性。

LLM Analysis

LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.10811 (HTTP 429)

Authors: Sam Sartor, Iliyan Georgiev, Michael Fischer, Valentin Deschaintre, Pieter Peers

Categories: cs.CV

PDF URL: https://arxiv.org/pdf/2609.10811.pdf

CoolPaper URL: https://papers.cool/arxiv/2609.10811

Published: 2026-09-13T01:26:21.119Z