HuggingFace Papers 2026-09-22
数据来源:HuggingFace Papers
Latest Papers
1. CodeMidas: Scaling Agentic Coding RL Environments from Code Itself
Abstract:Training capable coding agents via reinforcement learning (RL) requires diverse tasks with reliable verifiers. Open-source codebases offer a rich source of such tasks, while existing methods typically rely on development artifacts such as issues and commits, limiting the range of tasks that can be extracted. To better scale RL environments, we present CodeMidas, an agentic pipeline that turns implemented functionality in existing codebases into executable RL environments using source code as its only task-specific input. CodeMidas allocates agentic compute to every stage of environment construction: agents explore implemented functionality to formulate behavioral specifications, construct tests grounded in execution of the original code, and validate and filter candidate tasks through execution checks and repeated solution rollouts. The resulting dataset has 5,545 training tasks from 3,185 open-source codebases spanning 23 programming languages and 15 technical domains. Training MiMo-V2.5 on these tasks with GRPO improves performance on all five diverse benchmarks, covering issue repair (DeepSWE + 11.7%), whole-program construction (ProgramBench +17%), and terminal work (Terminal-Bench v2.1 +8.5%). Ablations show that increasing the number of high-quality training tasks improves performance. Trajectory analysis shows the RL-trained agent demonstrates better behaviors like increasing codebase exploration and more diverse self-verification. These results establish source code as a scalable foundation for constructing RL environments that improve coding agents across diverse software tasks.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*如何从现有代码库中规模化构建高质量、可执行的强化学习(RL)训练环境,以提升智能体在多样化软件工程任务上的能力\*\*。 具体而言,核心挑战与解决目标包括: - \*\*现有方法对开发产物的依赖限制了任务规模与多样性\*\*:当前构建编码RL环境的流程通常依赖于issues、pull requests、commits、现有测试或文档等开发记录。这些产物覆盖范围有限,导致可提取的训练任务在数量和类型上受到约束,难以支撑智能体在更广泛软件工作上的泛化。 - \*\*直接利用源代码作为任务构建基础\*\*:论文提出 \*\*CodeMidas\*\* 框架,其关键创新在于将\*\*源代码本身(source code)\*\*作为唯一的任务特定输入,无需依赖外部开发记录。通过智能体流水线,自动将代码库中已实现的功能(implemented functionality)转化为行为规格说明、开发起点和基于执行的测试验证器。 - \*\*确保验证器的可靠性与任务的训练适用性\*\*:在环境构建过程中,论文通过执行一致性检查、对抗性泄漏探测、解审核查以及基于回滚结果的筛选等手段,剔除存在泄漏、验证器缺陷或难度不适配的任务,从而保证RL训练所需的\*\*可靠奖励信号\*\*。 - \*\*验证“源代码驱动”RL环境的跨任务迁移价值\*\*:通过从3,185个开源代码库中构建5,545个覆盖23种编程语言和15个技术领域的训练任务,论文证明在此类环境上训练能够显著提升智能体在issue修复、完整程序构建、代码翻译和终端操作等\*\*五种外部基准测试\*\*上的表现。 Q2: 有哪些相关研究? 该论文的相关研究主要集中在\*\*编码智能体强化学习环境的构建方法\*\*,以及\*\*奖励设计与验证机制\*\*两个方向。具体可归纳如下: --- ### 1. 构建编码RL训练环境的已有方法 现有工作通常依赖特定的开发产物来生成任务,按输入来源可分为三类: \*\*基于开发记录(Issues、PRs、Commits)\*\* - \*\*SWE-bench\*\*(Jimenez et al., 2024):首次建立了基于真实仓库的 Issue 解决执行评估框架。 - 后续扩展工作(Badertdinov et al., 2026; Chen et al., 2026a; Fu et al., 2026; Liang et al., 2026; Zhao et al., 2026):通过 Issues 或 Pull Requests 规模化收集任务。 - \*\*R2E-Gym\*\*(Jain et al., 2025):从 Commits 生成测试和任务描述,减少对人类撰写 Issues 和测试的依赖。 \*\*基于现有测试或文档\*\* - \*\*SWE-smith\*\*(Yang et al., 2025):合成能够破坏现有测试的代码变更,以此构造修复任务。 - \*\*SWE-Flow\*\*(Zhang et al., 2025):从单元测试及其运行时依赖中推导增量开发任务。 - \*\*SWE-Hub\*\*(Zeng et al., 2026):结合测试验证的 Bug 合成与基于覆盖率和结构化需求的仓库构建。 - \*\*R2E\*\*(Jain et al., 2024):将函数文档字符串(docstrings)细化为可执行规格说明。 - \*\*MindForge\*\*(Chen et al., 2026b):暴露文档和编译后的参考程序,要求智能体从零开始实现。 \*\*与 CodeMidas 的区别\*\*:上述方法均需要 Issues、PRs、Commits、现有测试或文档等特定产物作为输入;而 CodeMidas 仅依赖\*\*源代码本身\*\*即可构建任务,突破了开发记录覆盖范围的限制。 --- ### 2. 编码智能体的奖励设计与验证机制 \*\*强化学习奖励设计\*\* - \*\*CodeRL\*\*(Le et al., 2022):结合单元测试反馈与学习的 Critic 模型进行训练。 - \*\*SWE-RL\*\*(Wei et al., 2025):在仓库级别使用参考补丁相似度作为奖励信号。 - \*\*SWE-Universe\*\*(Chen et al., 2026a):在可执行环境中训练智能体。 - \*\*AceCoder\*\*(Zeng et al., 2025):通过自动合成测试来研究学习奖励与直接测试通过奖励的效果。 - \*\*GRPO\*\*(Shao et al., 2024):CodeMidas 采用的算法,使用二元执行奖励,无需奖励模型或学习验证器。 \*\*测试与验证方法\*\* - \*\*CodeT\*\*(Chen et al., 2023):利用生成测试与执行一致性进行程序选择。 - \*\*SWE-Shepherd\*\*(Dihan and Khan, 2026):使用过程奖励模型(PRM)对智能体动作打分。 - \*\*Agentic Rubrics\*\*(Raghavendra et al., 2026):基于代码库相关的评分标准对补丁进行评估,无需实际执行测试。 - \*\*R2E-Gym\*\*(Jain et al., 2025):结合学习型验证器与基于执行的验证器。 - \*\*Self-Debugging\*\*(Chen et al., 2024)与 \*\*Reflexion\*\*(Shinn et al., 2023):利用执行反馈或语言反思在多轮尝试中修订解决方案。 \*\*测试 Oracle 的可靠性研究\*\* - \*\*EvalPlus\*\*(Liu et al., 2023):表明扩展测试能够发现原始测试套件遗漏的错误生成程序。 - \*\*PatchDiff\*\*(Wang et al., 2026):记录 SWE-bench 测试错误地接受不正确补丁的现象。 - \*\*SWE-bench Pro\*\*(Deng et al., 2026)与 \*\*SWE-rebench V2\*\*(Badertdinov et al., 2026):讨论了规格说明缺失与测试过于严格的问题。 这些研究共同构成了 CodeMidas 的背景:一方面揭示了仅依赖开发记录或文档构建环境的局限性,另一方面强调了可靠验证器与执行奖励在编码智能体训练中的核心作用。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*CodeMidas\*\*,一个全自动的\*\*智能体流水线(agentic pipeline)\*\*,将现有代码库中已实现的功能转化为可执行的强化学习环境。该方法的核心在于\*\*仅以源代码作为任务特定的输入\*\*,通过四个紧密衔接的模块逐步构建、验证并筛选高质量的RL训练任务。 具体解决路径如下: --- ### 1. 任务设计与代码库适配(Task Design and Codebase Adaptation) 该模块将原始代码库转化为“待完成”的开发起点。 - \*\*功能识别\*\*:智能体检查代码库结构与构建元数据,识别具有公共入口点(如命令行工具、库函数、状态化API)且具备可观察行为的功能。 - \*\*范围界定\*\*:追踪公共入口点及其共享依赖,明确任务边界,确保任务需要跨代码库推理。 - \*\*代码移除与适配\*\*:删除目标核心实现,同时调整剩余代码以形成逻辑自洽的开发起点,保留共享组件与项目上下文。 - \*\*任务描述生成\*\*:基于可观察行为制定行为级任务描述,明确输入、输出及要求的公共接口,但不限定内部实现算法。原始实现被保留作为参考方案。 --- ### 2. 基于执行的测试构建(Execution-grounded Test Construction) 该模块确保测试严格反映任务描述的行为要求,而非过度限定实现细节。 - \*\*参考执行记录\*\*:智能体将任务描述中的行为需求映射至测试输入与边界情况,在原始代码库的副本上执行,记录输出结果。 - \*\*多模式测试\*\*:针对不同接口类型采用不同测试方式——命令行工具使用命令执行、纯函数使用输入-输出用例、状态化API使用跨调用的调用序列(涵盖状态依赖与清理行为)。 - \*\*断言审查与松弛化\*\*:逐一审查断言,移除任务描述未支持的过度限制(如错误信息的精确措辞、内部数据结构、无关的顺序要求)。若某断言依赖私有符号且无行为级替代方案,则拒绝该任务。 - \*\*兼容性确认\*\*:修订后的测试在参考方案上重新运行,确保其仍能通过。 --- ### 3. 环境准备与执行一致性检查(Environment Preparation & Execution Consistency) 该模块为每个任务构建干净、可控的容器化环境,并排除不稳定任务。 - \*\*环境构建\*\*:从统一的基础容器镜像出发,安装项目声明的依赖,准备构建与运行时资源。 - \*\*清理泄漏产物\*\*:系统性地移除可能暴露被删实现的残留物,包括编译输出、缓存文件、构建智能体遗留文件,以及与目标功能相关的原始测试。 - \*\*执行一致性验证\*\*:在6个全新容器中重复运行每个任务——其中2个装载“待完成”的起始代码库(必须均失败),4个装载参考方案(必须均通过)。此举筛选出具备稳定\*\*失败→通过\*\*转换的任务,排除执行结果不稳定的样本。 --- ### 4. 基于智能体回滚的后过滤(Post-rollout Environment Filtering) 该模块利用智能体实际解决尝试的轨迹,从训练适用性角度进一步剔除有缺陷的任务。 - \*\*泄漏检测(Leakage Filtering)\*\*:执行对抗性回滚,让智能体在完整可见环境中主动搜索并利用残留泄漏(如编译产物、缓存、安装副本)以绕过实现工作。若审查确认泄漏材料可复现解决方案,则拒绝该任务。 - \*\*验证器一致性审计(Agreement on Agent Solutions)\*\*:由编码智能体对每项任务进行4次尝试,再由审查智能体比对提交的代码、测试输出、任务描述与参考方案。标记\*\*假阳性\*\*(测试通过但实现不正确)与\*\*假阴性\*\*(测试失败但实现正确),剔除存在验证器缺陷的任务。 - \*\*回滚结果过滤(Rollout Outcome Filtering)\*\*:使用前沿模型对每项任务进行多次尝试。若所有尝试均成功或均失败(暗示任务过易、过难或仍存在隐藏缺陷),则予以剔除;仅保留\*\*既有成功又有失败尝试\*\*的任务,以确保其对RL训练具有合适的难度和区分度。 --- ### 5. 规模化产出 经过上述四级筛选,CodeMidas 从 \*\*22,575\*\* 个初始候选中最终保留 \*\*5,545\*\* 个高质量训练任务,覆盖 \*\*3,185\*\* 个开源代码库、\*\*23\*\* 种编程语言与 \*\*15\*\* 个技术领域。这种从源代码直接出发、逐层施加智能体计算与执行验证的范式,突破了传统方法对开发记录(Issues、PRs、Commits、文档或现有测试)的依赖,实现了编码RL环境的规模化构建。 Q4: 论文做了哪些实验? 论文进行了以下五类实验,涵盖训练评估、基准测试、学习动态分析、消融实验以及行为泛化研究: --- ### 1. 训练与评估设置 - \*\*训练配置\*\*:使用 \*\*MiMo-V2.5\*\* 作为初始策略模型,在 \*\*5,545\*\* 个 CodeMidas 任务上采用 \*\*GRPO\*\*(Group Relative Policy Optimization)进行强化学习训练,奖励为二元执行验证结果(0 或 1)。训练参数包括批次大小 32、每任务 32 条回滚轨迹、最大交互轮数 500 轮、学习率 5 × 10^(-6) 等。 - \*\*评估对象\*\*:除 CodeMidas 自建的验证集(\*\*CodeMidas Val\*\*,200 个任务,每任务 3 次尝试)外,还在 \*\*5 个独立外部基准\*\*上进行评估,包括 SWE-bench Pro、DeepSWE v1.1、ProgramBench、RepoZero C2Rust 和 Terminal-Bench v2.1。所有评估均确保训练集与测试集无重叠。 --- ### 2. 外部基准性能验证 该实验旨在验证从源代码构建的 CodeMidas 训练任务是否能迁移到多样化的软件工程任务上。 - \*\*结果\*\*:在全部 5 个外部基准上,经过 CodeMidas RL 训练后的模型均较初始策略有提升(图 5): - \*\*DeepSWE\*\*:通过率从 \*\*10.0%\*\* 提升至 \*\*21.7%\*\*(+11.7 个百分点) - \*\*ProgramBench\*\*:Almost Solved 分数从 \*\*4.5\*\* 提升至 \*\*21.5\*\*(+17.0) - \*\*Terminal-Bench v2.1\*\*:通过率从 \*\*63.7%\*\* 提升至 \*\*72.2%\*\*(+8.5) - \*\*SWE-bench Pro\*\*:从 \*\*50.3%\*\* 提升至 \*\*54.4%\*\*(+4.1) - \*\*RepoZero C2Rust\*\*:从 \*\*40.5%\*\* 提升至 \*\*51.8%\*\*(+11.3) --- ### 3. CodeMidas Val 学习动态分析 该实验追踪 RL 训练过程中模型在内部验证集上的表现与交互长度变化。 - \*\*通过率先升后稳\*\*:在 CodeMidas Val 上,初始通过率为 \*\*35.0%\*\*,训练后提升至 \*\*44.7%\*\*;从第 40 步起,通过率持续高于初始策略约 8–10 个百分点。 - \*\*轨迹长度增长\*\*:伴随性能提升,平均总 token 长度(以千计)显著增加,表明智能体学会了更充分地利用交互预算。 --- ### 4. 任务规模与质量的消融实验 该实验通过对比不同规模与不同处理流程的数据池,验证任务数量、清洗与过滤对训练效果的影响。 - \*\*高质量任务池的规模效应\*\*:从 1k、3k 到完整的 5,545 个高质量任务,性能在 SWE-bench Pro、DeepSWE 和 CodeMidas Val 上\*\*单调提升\*\*(图 8)。例如,DeepSWE 得分从 17.57(1k)→ 19.05(3k)→ 21.70(5k)。 - \*\*过滤的价值\*\*:完整的 5k 高质量池在所有三项评估上均优于\*\*未经清洗和过滤的 8k 样本\*\*(vanilla 8k)。具体而言,5k 池在 SWE-bench Pro、DeepSWE 和 CodeMidas Val 上分别高出 vanilla 8k 样本 \*\*0.59、4.59 和 4.49\*\* 个百分点。 - \*\*学习曲线对比\*\*:图 7 显示,在 CodeMidas Val 上,1k 与 3k 子集在中期达到峰值后趋于平稳,而 5k 完整数据集在从第 40 步到第 70 步的每个检查点均保持领先,优势持续存在。 --- ### 5. 行为变化与泛化分析 该实验通过定量化指标,分析 RL 训练如何改变智能体的行为模式,并检验这些行为是否泛化到外部任务。 - \*\*训练过程中的行为演化\*\*(表 2):对比早期与晚期训练回滚,发现三项核心行为显著增强: - \*\*代码库探索\*\*(首次编辑前的读/查调用次数):从 \*\*27.2\*\* 次增至 \*\*40.1\*\* 次 - \*\*代码起草\*\*(写入代码与先前推理的重合比例):从 \*\*0.358\*\* 提升至 \*\*0.629\*\* - \*\*自我验证\*\*(最终编辑后执行的不同验证命令数):从 \*\*2.03\*\* 增至 \*\*2.53\*\* - \*\*行为与成功率关联\*\*:在 CodeMidas Val 上,包含智能体自主编写并执行验证检查的回滚,其平均通过率比无此类检查的回滚\*\*高出 4.2 个百分点\*\*(95% 置信区间:1.8–6.6)。 - \*\*跨任务类型泛化\*\*(表 3):在 SWE-bench Pro、ProgramBench 和 Terminal-Bench v2.1 上,晚期检查点相比早期检查点同样表现出更强的代码库探索。自我验证的多样化程度在 SWE-bench Pro 和 Terminal-Bench v2.1 上也有所提升。值得注意的是,不同任务的交互长度变化呈现差异:SWE-bench Pro 上从 \*\*37.3\*\* 轮增至 \*\*50.1\*\* 轮,而 ProgramBench 上则从 \*\*155.1\*\* 轮降至 \*\*122.8\*\* 轮,表明更强的代码库探索在某些场景下反而缩短了整体交互时间。 Q5: 有什么可以进一步探索的点? 基于该论文的工作,以下方向值得进一步探索: --- ### 1. 更大规模与Scaling Law的系统性研究 论文在 5,545 个任务上验证了规模带来的增益,但尚未触及数据规模的上限。未来可构建 \*\*50k–100k+\*\* 级别的高质量任务池,系统刻画编码 RL 环境中任务数量、质量与下游性能之间的 \*\*Scaling Law\*\*。特别地,需检验当任务规模进一步扩大时,性能增益是否呈现对数线性增长,抑或受限于策略模型的容量与探索能力而出现饱和。 --- ### 2. 融合多源信息的混合任务构建 CodeMidas 仅以源代码为输入,虽摆脱了开发记录的束缚,但也可能错失 Issues、PRs、Commits 及文档中蕴含的\*\*语义上下文与缺陷模式\*\*。未来可探索\*\*多源信息融合\*\*:在源代码驱动的基础上,将开发记录作为辅助输入,构建更具真实软件演化特征的任务(如需求变更驱动的重构、历史 Bug 的再现与修复),从而提升训练任务与真实人类开发流程的对齐度。 --- ### 3. 高阶验证器的自动化构造 当前测试构造依赖于参考执行与行为级断言,对\*\*非确定性行为、并发逻辑、性能规格、安全属性\*\*等复杂场景的覆盖仍有限。未来可引入: - \*\*基于性质的测试(Property-based Testing)\*\* 与模糊测试(Fuzzing),以自动生成更充分的输入空间覆盖; - \*\*时序逻辑与形式化规约\*\*的提取,用于验证状态化 API 与并发程序; - \*\*过程奖励模型(PRM)\*\*与执行奖励的结合,为长程交互提供更细粒度的信用分配。 --- ### 4. 跨语言与跨领域迁移的深化机制 论文覆盖了 23 种语言与 15 个技术领域,但未深入分析\*\*跨语言迁移\*\*的具体机制。未来可设计受控实验,研究在某一语言(如 Python)上训练所得的探索与验证策略,如何迁移至语法与语义差异显著的语言(如 Rust 或 Haskell),并据此设计领域自适应的课程学习(Curriculum Learning)策略。 --- ### 5. 高效质量筛选与成本优化 CodeMidas 的后过滤阶段依赖大量智能体回滚(adversarial rollouts + solution audits),计算成本高昂。未来可研究\*\*轻量级质量预测器\*\*,例如: - 基于代码静态分析(Static Analysis)与抽象语法树(AST)特征,预先识别存在信息泄漏或验证器缺陷的任务; - 训练一个小型判别模型,在无需完整回滚的情况下预测任务的训练适用性,从而降低环境构建的边际成本。 --- ### 6. 复杂软件工程任务的扩展 当前任务主要集中在功能实现与修复。可向更高阶的软件工程活动扩展: - \*\*架构级重构\*\*:要求智能体在多模块间进行接口迁移或设计模式替换; - \*\*性能优化\*\*:以执行时间、内存占用为奖励信号,训练优化型智能体; - \*\*安全漏洞修复与利用\*\*:结合漏洞数据库(如 CVE)构建针对性训练环境; - \*\*代码审查与合并冲突解决\*\*:将 CodeMidas 的流水线适配至评审场景。 --- ### 7. 行为演化的因果性与显式引导 论文观察到 RL 训练后智能体的\*\*探索与自我验证行为\*\*显著增加,且与更高成功率相关。未来需通过\*\*消融实验与因果干预\*\*(如屏蔽特定工具调用、显式注入验证模板)厘清这些行为是性能提升的因还是果。在此基础上,可设计显式鼓励探索与自我验证的辅助奖励或工具使用课程,以加速可靠策略的形成。 --- ### 8. 与真实开源生态的闭环验证 现有评估仍基于静态基准测试。未来可将训练后的智能体部署至真实的开源项目 Issue 列表或 Pull Request 流程中,在\*\*真实的人类代码审查与 CI/CD 环境\*\*中检验其提交的实用性、可维护性与社区接受度,从而建立从“模拟环境”到“真实软件演化”的闭环评估体系。 Q6: 总结一下论文的主要内容 该论文提出 \*\*CodeMidas\*\*,一种从现有开源代码库中规模化构建编码智能体强化学习(RL)训练环境的全新范式。以下从研究动机、方法、实验结果与核心发现四个方面概述其主要内容。 --- ### 1. 研究动机 训练具备自主软件工程能力的智能体需要\*\*多样化的任务\*\*与\*\*可靠的验证器\*\*。现有方法通常依赖开发产物(如 Issues、Pull Requests、Commits、已有测试或文档)来构造任务,这限制了可提取任务的范围与多样性。该论文旨在突破这一瓶颈,提出直接以\*\*源代码本身\*\*作为唯一任务特定输入,将代码库中已实现的功能自动转化为可执行的 RL 环境,从而规模化扩展训练数据。 --- ### 2. 方法:CodeMidas 流水线 CodeMidas 是一个全自动的智能体流水线,包含四个核心阶段: - \*\*任务设计与代码库适配\*\*:智能体识别具有公共入口点和可观察行为的功能模块,移除其核心实现,将剩余代码调整为连贯的开发起点,并生成行为级任务描述,保留原始代码作为参考方案。 - \*\*基于执行的测试构造\*\*:智能体根据任务描述生成测试输入与边界情况,通过执行原始参考代码获取预期输出;随后审查断言,移除对内部实现细节的过度限制,确保测试仅验证规定的行为约束。 - \*\*环境准备与执行一致性检查\*\*:构建容器化环境并清理可能泄露被删实现的残留物(编译产物、缓存等);通过在 6 个独立容器中重复运行(起始代码必须失败、参考方案必须通过),排除执行不稳定的任务。 - \*\*后过滤(Post-rollout Filtering)\*\*:利用智能体的实际解决尝试进行三级筛选——对抗性回滚探测信息泄漏、审查智能体审计验证器判决(排查假阳性/假阴性)、基于回滚成功率剔除过易或过难的任务,最终保留训练适用性高的环境。 --- ### 3. 实验与结果 基于 CodeMidas,研究从 \*\*3,185\*\* 个代码库中构建了 \*\*5,545\*\* 个高质量训练任务,覆盖 \*\*23\*\* 种编程语言与 \*\*15\*\* 个技术领域。 使用 \*\*GRPO\*\* 在 CodeMidas 任务上训练 \*\*MiMo-V2.5\*\* 后,模型在 \*\*5 个外部基准测试\*\*上均取得显著提升: | 基准测试 | 初始策略 | CodeMidas RL | 提升 | |---------|---------|-------------|------| | DeepSWE | 10.0% | 21.7% | +11.7 pp | | ProgramBench (Almost Solved) | 4.5 | 21.5 | +17.0 | | RepoZero C2Rust | 40.5% | 51.8% | +11.3 pp | | Terminal-Bench v2.1 | 63.7% | 72.2% | +8.5 pp | | SWE-bench Pro | 50.3% | 54.4% | +4.1 pp | 这些增益跨越 Issue 修复、完整程序构建、代码翻译与终端操作等多样化软件任务。 --- ### 4. 核心发现与分析 - \*\*任务规模与质量\*\*:在 1k、3k、5k 的高质量任务池上,性能随规模单调提升。尤为重要的是,经清洗过滤的 \*\*5k 任务池在多个基准上优于未经处理的 8k 任务池\*\*,证明环境可靠性比单纯数量更为关键。 - \*\*行为演化\*\*:RL 训练促使智能体展现出更优的行为模式——代码库探索次数显著增加(从 27.2 次增至 40.1 次)、代码起草与前期推理的重合度提高(从 0.36 升至 0.63)、自我验证命令更加多样化(从 2.03 增至 2.53)。 - \*\*行为泛化\*\*:上述行为变化不仅出现在训练任务上,在 SWE-bench Pro、ProgramBench、Terminal-Bench v2.1 等外部任务上同样观察到,且执行自主验证的智能体回滚具有更高的成功率,提供了超越分数本身的行为层面泛化证据。 --- ### 5. 结论 该论文确立了\*\*源代码本身作为规模化构建编码 RL 环境的基础\*\*。CodeMidas 通过将已实现的功能转化为带有可靠验证器的训练任务,有效提升了智能体在多种真实软件工程场景中的表现,为从代码本身扩展编码智能体强化学习提供了可行的技术路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [**这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是CodeMidas%3A%20Scaling%20Agentic%20Coding%20RL%20Environments%20from%20Code%20Itself,链接是https://arxiv.org/pdf/2609.22068,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.22068。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Bowen Ye,Lei Li,Shicheng Li,Zihao Yue,Linghao Zhang,Hanglong Lv,Yuanxin Liu,Wenhan Ma,Hao Tian,Rang Li,Jinhao Dong,Yikai Zhao,Xiangwei Deng,Hailin Zhang,Liang Zhao,Qi Liu,Lingpeng Kong,Tong Yang,Fuli Luo
Categories:
PDF URL: https://arxiv.org/pdf/2609.22068.pdf
Arxiv URL: https://arxiv.org/abs/2609.22068
Arxiv ID: 2609.22068
CoolPaper URL: https://papers.cool/arxiv/2609.22068
Published: 2026-09-22T01:51:40.218Z
Updated: 2026-09-22T01:51:40.218Z
2. Grounded Skill Synthesis from Code at Scale for Agentic Intelligence
Abstract:Reusable skills give agents transferable procedural knowledge, making scalable acquisition essential for extending agents beyond prior experience. Existing methods face two limitations: trajectory-based synthesis requires interactions with specific environments, while document-derived skills may lack executable evidence and verification. Source code offers a complementary path: it requires no prior agent experience yet provides executable evidence for grounding abstractions. We present Code2Skill, a fully automated pipeline that transforms selected code units into implementation-anchored records of atomic operations, composite workflows, and recurring patterns, then verifies each record through source-body-blind reconstruction and source-aware comparison. Applied to 19,769 popular, actively maintained GitHub repositories, Code2Skill produces CodeSkillBank, a grounded bank of 1,006,822 accepted records with workflow, boundary, provenance, and source-evidence metadata. Across 72 protocol-matched evaluations covering nine model settings and eight benchmarks, models augmented with retrieved CodeSkillBank skills improve by 11.7% on average over matched baselines and outperform them in 57 cases. Under a unified downstream interface, Code2Skill also outperforms trajectory-derived skill banks on all seven shared benchmarks, showing that repository-derived skills can provide useful procedural knowledge before agents accumulate sufficient interaction experience. Skills synthesized from tested AI-generated code achieve a 93.50% pass rate, compared with 93.00% for human-written code, providing initial evidence that the pipeline can expand with the growing volume of AI-generated software. Overall, Code2Skill transforms procedural knowledge embedded in repositories into grounded, verifiable, and transferable agent skills.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*智能体系统中可重用程序性技能(reusable procedural skills)的可扩展合成与验证问题\*\*,具体针对现有方法在规模化技能获取时的根本性局限。 可以从以下三个层面来理解: ### 1. 现有技能合成范式的瓶颈 论文指出,当前两类主流方法均不足以支撑智能体能力的持续扩展: - \*\*基于轨迹的合成(Trajectory-based synthesis)\*\*:从智能体执行轨迹中蒸馏技能。这类技能与特定环境、模型、任务分布和工具链深度耦合,其质量受限于生成智能体的经验与能力,且组件变更可能导致技能过时或失效。 - \*\*基于文档的合成(Document-based synthesis)\*\*:从静态人类可读文本中提取技能。虽然摆脱了对智能体轨迹的依赖,但缺乏具体的执行证据,难以对合成出的技能进行接地验证(grounding and verification)。 ### 2. 源代码作为新型基底的核心挑战 论文提出将\*\*大规模源代码库\*\*作为技能合成的基底(substrate),因为代码天然具备可执行、可评估、可验证、可版本化等属性。然而,自动从代码中蒸馏技能面临非平凡的挑战: - 真实代码混杂了通用过程与框架特定的“胶水”代码、项目局部标识符、重复实现、隐式依赖和未解决的边界情况; - 理想的技能不仅需要描述“实现做了什么”,还必须捕捉“何时适用、哪些步骤关键、哪些不变量必须保持、失败如何改变执行路径”等操作约束; - \*\*核心挑战\*\*:如何在超越特定实现进行抽象的同时,保留足够的实现证据来支撑和验证所得技能。 ### 3. 问题形式化与解决目标 论文将问题形式化为:将函数、方法或文件级组件及其仓库上下文映射为候选技能记录,要求该记录满足三项要求: - \*\*接地性(Grounded)\*\*:技能记录中的程序性声明必须有可恢复的实现跨度支持,并可通过源体盲重建(source-body-blind reconstruction)进行检验; - \*\*可迁移性(Transferable)\*\*:剥离项目特定标识符与集成细节,保留可重用的前置条件、步骤、不变量和失败处理策略; - \*\*可维护性(Maintainable)\*\*:保留来源出处、支持性代码跨度、记录类型和构造状态,以便在代码演进时进行检查、失效或重新生成。 为此,论文提出了 \*\*Code2Skill\*\* 流水线及相应的 \*\*CodeSkillBank\*\*,旨在建立一种不依赖于智能体先验交互经验、可从海量人类与AI编写的实现中持续扩展的、经过验证的程序性知识库。 Q2: 有哪些相关研究? 论文在第2节将相关研究划分为三个主要方向: ### 1. 智能体工作流与基于经验的技能 (Agent workflows and experience-derived skills) 该方向关注智能体如何通过任务执行中的交互、反馈与协作来改进性能,并将经验蒸馏为可重用资产。 - \*\*推理与行动交织\*\*:研究通过交替推理和行动增强问题解决能力的框架,例如 ReAct 与 Tree of Thoughts(Yao et al., 2023b,a; Zhou et al., 2024; Tong et al., 2023, 2024b)。 - \*\*反馈驱动的修订与记忆\*\*:利用执行后的自我反馈、反思和记忆机制进行迭代优化(Madaan et al., 2023; Shinn et al., 2023; Tong et al., 2024a, 2026a)。 - \*\*工具接口\*\*:探索智能体如何学习并调用外部工具(Brohan et al., 2023; Schick et al., 2023; Shen et al., 2023; Qin et al., 2024; Patil et al., 2024)。 - \*\*多智能体工作流\*\*:通过多智能体协作框架处理复杂任务(Li et al., 2023; Bansal et al., 2024; Hong et al., 2024; Qian et al., 2024; Yang et al., 2024; Chen et al., 2025; Tong et al., 2026b; Zheng et al., 2026)。 - \*\*经验蒸馏\*\*:将过往智能体经验提炼为可重用的记忆、工作流、技能或智能体设计方案(Park et al., 2023; Zhao et al., 2024; Wang et al., 2025, 2024; Zheng et al., 2025; Hu et al., 2024; Zhang et al., 2025; Shang et al., 2025; Huang et al., 2025; Qiu et al., 2026; Zhang et al., 2026; Yang et al., 2026; Xia et al., 2026; Ni et al., 2026)。 与上述工作不同,Code2Skill 在智能体接触下游任务之前即从维护的代码实现中派生技能,无需依赖任务特定的轨迹。 ### 2. 技能库与基于代码的构建 (Skill libraries and code-derived construction) 该方向关注技能库的构建、组织以及从代码或文档中提取可重用结构。 - \*\*技能库研究\*\*:涵盖大规模检索、有界技能集合、记忆表示与更新策略(Cho et al., 2026; Zeng et al., 2026; Liang et al., 2026; Sun et al., 2026a; Ouyang et al., 2026)。 - \*\*基于文档的合成\*\*:将人类可读文档转换为可重用技能(Zhou et al., 2026)。 - \*\*代码表示与摘要\*\*:将代码实现转换为文本表示或结构化摘要(Feng et al., 2020; Wang et al., 2021; Guo et al., 2021; Ye et al., 2024)。 - \*\*开源智能体技能挖掘\*\*:Bi et al. (2026) 从开源智能体中检索技能并将其序列化为 SKILL.md 工件。 Code2Skill 与上述工作的区别在于:直接作用于程序性源单元,对其重用潜力进行排序,构建具有显式来源的类型化技能记录,应用基于重建的一致性检查进行验证,并在检索和下游智能体工作流中评估所得技能。 ### 3. 知识构建与挖掘 (Knowledge construction and mining) 该方向利用大语言模型从多种数据源中提取和组织知识,以支持下游应用。 - \*\*通用知识挖掘\*\*:使用 LLM 从文本、异构网络、推荐系统、工具、任务和结构化数据中提取知识(Wan et al., 2024; Gou et al., 2022; Chen et al., 2024; Kim et al., 2024; Kenthapadi et al., 2024; Ma et al., 2025; Hu et al., 2025; Lai et al., 2025; Tan et al., 2025)。 - \*\*基于属性的测试验证\*\*:当可执行测试或形式化属性可用时,自动化测试和基于属性的测试可提供强行为证据(Fraser and Arcuri, 2011; Lukasczyk and Fraser, 2022; MacIver and Hatfield-Dodds, 2019)。 Code2Skill 将这一数据构建视角扩展到嵌入源代码中的程序性知识。与基于测试的方法不同,Code2Skill 不假设测试规范一定存在,而是采用基于重建的一致性检查作为可扩展的仓库级过滤机制,用于评估合成技能是否得到其源实现的支持。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*Code2Skill\*\* 这一全自动流水线,将源代码转化为经过验证的可重用技能记录,从而解决规模化程序性技能合成问题。该方案包含问题形式化、四阶段合成管道、基于重建的验证机制以及检索优化四个核心层面。 --- ### 1. 问题形式化:三项核心要求 论文首先将技能合成形式化为从源代码单元(函数、方法、命令行入口或文件级组件)及其仓库上下文到候选技能记录的映射,并要求最终接受的记录满足: - \*\*接地性(Grounded)\*\*:技能中的程序性声明必须由可恢复的代码跨度支持,并能够通过\*\*源体盲重建\*\*(source-body-blind reconstruction)进行检验。 - \*\*可迁移性(Transferable)\*\*:剥离项目特定的标识符与集成细节,保留可重用的前置条件、执行步骤、不变量及失败处理策略。 - \*\*可维护性(Maintainable)\*\*:保留来源出处、支持性代码跨度、记录类型与构造状态,以便在源代码演进时进行检查、刷新或重新生成。 --- ### 2. 四阶段合成流水线 Code2Skill 的完整流程如图 1 所示,分为以下四个阶段: #### 阶段一:选择候选程序性证据(Candidate Selection) - \*\*仓库筛选\*\*:扫描截至 2026 年 4 月 14 日的 GitHub 仓库,保留星标数超过 500 的 19,769 个活跃维护仓库,形成源池。 - \*\*单元解析与标记\*\*:在每个仓库中解析函数、方法、命令行入口点和文件级组件,使用 LLM 标记器筛选具有可重用意图、操作结构和可见执行约束的单元。 - \*\*可重用性排名\*\*:通过评估公式
R(u) = W · Phi(u) - P(u)
对源单元进行全局排名,选择 Top-K 进入后续阶段。 #### 阶段二:技能记录生成(Skill Record Generation) 提取器将选定的源代码单元映射为**类型化的、面向任务的候选记录**。论文定义了三种粒度,对应不同范围的程序性知识: | 记录类型 | 适用范围 | 描述 | |:—-|:—-|:—-| | **Atomic skills** | 单函数/方法内 | 捕捉单一、定义明确的操作 | | **Composite skills** | 跨多个操作 | 捕捉协调多步骤的有序工作流 | | **Recurring-pattern skills** | 更高层次 | 捕捉超越单一操作或工作流的复现模式 | 每条记录严格分离操作指引与执行约束,包含: - 适用条件(when to use) - 工作流步骤(workflow) - 不变量与失败处理(invariants and failures) - 反目标(anti-goals) - 来源证据(source evidence)与出处元数据 #### 阶段三:源体盲重建与一致性检查(Reconstruction & Verification) 这是确保**接地性**的关键创新。该阶段通过 LLM 执行“重建—比较—裁决”的闭环验证: 1. **源体盲重建**:重构器**仅使用技能记录**(不访问原始源代码体)重新生成代码实现。 2. **源感知比较**:源感知裁判(source-aware judge)将重建的代码与原始源代码进行比较,直接接受足够一致的重建。 3. **裁决机制**:对于未通过直接比较的候选, adjudicator 介入判断是技能记录本身不准确,还是重建过程失败。若技能记录本身忠实于源行为,则予以**裁决接受(AdjudicatedAccept)**;否则拒绝。 该流程的算法化描述如下:
bu arrow M(rec)(s, I_u^(rec))
j arrow M(judge)(I_u^(eval), ∑mary(s), b_u, b_u)
若 j(equivalent) = false ,则进一步由 adjudicator 判定是否保留。 #### 阶段四:检索导向的特征标注与目的索引(Retrieval Optimization) 为支持高效的下游检索,论文对接受的记录进行两层组织: - **特征标注(Feature Tagging)**:为每条记录生成任务导向的检索视图,包含受控词汇表中的任务族、能力标签、约束标签、成功信号、交互模式等。 - **目的索引(Purpose Indexing)**:通过归一化的任务族-意图动作-意图目标键对记录进行聚类,从每个簇中选择代表性记录,减少冗余候选,同时保留证据档案的完整性。 —- ### 3. 规模化产出:CodeSkillBank 将 Code2Skill 应用于 19,769 个精选仓库后,论文构建了 **CodeSkillBank**,包含 **1,006,822 条**已接受的技能记录,附带工作流、边界、来源和源代码证据元数据。 —- ### 4. 下游利用接口 论文定义了统一的下游利用公式。给定任务 x 和决策步骤 t 前的状态 h_t ,若查询技能库,则构造渲染后的技能上下文 z_t :
z_t = Render_r(TopK_k(q_t; B)), & if a query is issued, ∅, & otherwise.
at sim π(θ^((s)))(· mid x, h_t, z_t)
该接口支持多种集成方式:提示级检索、规划时检索、生成后审查、验证器侧奖励以及训练时技能条件化,使技能可以在智能体工作流的不同阶段注入。 Q4: 论文做了哪些实验? 论文围绕六个研究问题(RQs)开展了一系列实验,涵盖模型家族、推理模式、基准测试与智能体工作流配置。以下按研究问题逐一梳理实验内容。 —- ### 实验设置(§5.1) - **模型**:DS4-Flash、Qwen3.5、Qwen3.6、Gemini 2.5 Pro、GPT 5.2 - **基准**(8项): - 编程与软件工程:BigCodeBench、SWE-bench Verified - 终端与系统控制:TerminalBench、LongCLI-Bench、AgentBench-OS - 数学与科学推理:AIME 2026、HMMT 2025、GPQA - **默认智能体部署**:采用 draft–review–revision 循环(Madaan et al., 2023; Shinn et al., 2023) - **评估协议**:协议匹配(protocol-matched)比较,仅改变是否可检索技能,其余条件固定;默认从 CodeSkillBank 中随机采样 10% 记录构成实验检索池 —- ### RQ1:代码衍生技能库能否提升智能体性能?(§5.2) **实验设计**:在 9 组模型-推理模式配置下,比较使用 CodeSkillBank(在生成后审查阶段注入技能)与无技能对照的表现。技能库跨所有模型与基准复用,不针对特定任务收集轨迹。 **结果**: - 72 组协议匹配评估中,**57 组**使用技能后性能提升 - 八项基准的宏观平均分从 **42.90**(无技能)提升至 **47.90**(有技能),相对增益 **11.7%** - 每项模型-推理配置的平均分提升 **2.26–7.39** 个百分点(相对提升 6.0%–20.7%) - SWE-bench Verified 的 9 组比较全部改善;AIME、HMMT、GPQA 等推理任务亦普遍受益 **核心洞见**:CodeSkillBank 能够在智能体接触下游任务前即提供可重用的程序性指导,对仓库导航和多步交互类任务(如 TerminalBench、SWE-bench)增益尤为显著。 —- ### RQ2:与轨迹衍生技能库相比如何?(§5.3) **实验设计**:在统一下游接口与相同智能体循环下,比较 Code2Skill 与三种轨迹衍生基线: - Trace2Skill(Ni et al., 2026) - ExpeL(Zhao et al., 2024) - SkillRL-Bank(Xia et al., 2026) 使用 Qwen3.5-397B-A17B 在 held-out 任务上构建各基线,以 DS4-Flash 在 7 项共享基准上评估,每项 5 次运行报告均值与标准差。CodeSkillBank 完全基于仓库代码构建,不使用上述基准的智能体轨迹。 **结果**: | 方法 | 7 项基准平均分 | |:—-|:—-| | Trace2Skill | 31.0 | | ExpeL | 27.9 | | SkillRL-Bank | 32.8 | | **Code2Skill** | **49.5** | - Code2Skill 在 **全部 7 项基准** 上均排名第一 - 即使采用“每基准选最强基线”的 Oracle 策略,轨迹方法平均仅 40.1 分,仍低于 Code2Skill 达 9.5 分 - 在单项基准上,Code2Skill 超过最强轨迹基线 **6.6–13.3** 分 **核心洞见**:在共享下游接口下,基于仓库代码的合成方法产出的技能库比基于智能体经验的蒸馏方法更具效用,验证了 Code2Skill 作为端到端管道的优势。 —- ### RQ3:技能应在智能体工作流的哪个阶段引入?(§5.4) **实验设计**:比较三种注入位置(均与对应的无技能对照比较): 1. **生成时提示**(Generation-time prompting):首轮生成前将技能追加至提示,跳过默认审查与修订 2. **规划时指导**(Planning-time guidance):智能体构建计划时提供技能 3. **生成后批判**(Post-generation critique):默认审查-修订阶段注入技能(即 RQ1 的默认设置) 在 AIME、HMMT、Terminal、SWE 四项基准上评估 DS4-Flash 与 Qwen3.5。 **结果**: - **规划时指导**:8/8 项评估均改善,显示技能在任务分解前介入能有效引导规划 - **生成时提示**:DS4-Flash 在 4/4 项基准上提升(AIME 提升 22.0 个百分点);Qwen3.5 则不稳定,部分基准下降 - **生成后批判**:在更广泛的 72 组评估中最稳健,57 组改善 **核心洞见**:技能在**指导规划**或**审查具体草案**时效用最稳定;直接用于首 pass 生成要求模型将程序性指引即时转化为完整答案,对模型能力要求更高。 —- ### RQ4:技能能否紧凑表示而不牺牲效用?(§5.5) **实验设计**:在 BigCodeBench Instruct-Hard 上比较检索设计,固定其余协议,变化三个维度: - **检索深度**: k ∈ 1, 3, 10 - **渲染方式**:完整记录(full-record)vs 摘要(summary) - **索引方式**:接受记录全集 vs 目的索引代表(purpose-indexed representatives) 评估模型为 DS4-Flash 与 Qwen3.5。 **结果**: - **检索深度**:将 k 从 1 增至 10,平均渲染上下文从 2.1K 膨胀至 17.8K 字符,但 Qwen3.5 仅提升 1.4 分,DS4-Flash 未超越无技能基线 - **摘要渲染**:在 k=3 时,摘要相比完整记录减少 **88.9%** 上下文(6,352 → 707 字符);Qwen3.5 保持分数,DS4-Flash 从 28.40 提升至 31.80 - **目的索引**:将完整记录上下文从约 6.4K 降至 5.0K,但对通过率影响参差不齐 **核心洞见**:紧凑摘要比深度检索更有效——约九成文本移除后,大部分效用得以保留;程序性步骤本身比 surrounding 实现细节更有价值。 —- ### RQ5:在强化学习中,技能进入工作流的位置是否仍然重要?(§5.6) **实验设计**:从相同 Qwen3-32B SWE-World 检查点出发,固定训练协议与评估设置,比较 CodeSkillBank 在编码 RL 中的四种接口: - 完整提示(策略侧,完整记录) - 摘要提示(策略侧,摘要) - 奖励参考(验证器侧,对策略隐藏) - 生成后审查(审查者侧,最终判断前介入) 在训练第 150 步评估 resolve rate。 **结果**: | 接口 | 放置位置 | Resolve rate | |:—-|:—-|:—-| | 无技能 | — | 24% | | 完整提示 | 策略,完整记录 | 32% | | 摘要提示 | 策略,摘要 | 31% | | 奖励参考 | 验证器 | 31% | | 生成后审查 | 审查者 | **38%** | - 所有技能条件均优于无技能对照 - 策略侧与奖励侧提升 7–8 个百分点 - 生成后审查提升 **14 个百分点** **核心洞见**:CodeSkillBank 兼容多种 RL 接口;将技能用于**生成后审查**时,可将检索到的程序转化为针对具体候选方案的检验,效果优于直接提示策略或通过奖励信号间接影响。 —- ### RQ6:AI 生成的代码能否提供持续扩展的技能来源?(§5.7) **实验设计**: - 从 CodeSkillBank 已接受档案中随机抽取 25 个经测试的人类实现 - 使用 GPT-5.1(extra-high reasoning effort)为每个源生成接口匹配的 AI 实现,要求两者均通过相同的公开与隐藏测试 - 分别从 25 个人类实现和 25 个 AI 实现中提取技能(各含“如何实现”与“如何验证”两类),形成两个 50 技能库 - 在 LiveCodeBench 的 400 任务子集上,使用 DS4-Flash(high reasoning effort, temperature 0)进行 origin-matched 评估,检索配置完全一致 **结果**: - **人类代码库**:通过率 **93.00%**(372/400) - **AI 代码库**:通过率 **93.50%**(374/400) - 两者在 16 个任务上表现不一致:人类代码库独特解决 7 个,AI 代码库独特解决 9 个 **核心洞见**:Code2Skill 能够从经测试的 AI 生成实现中恢复可重用的程序性信号;尽管聚合差异极小,但任务级差异表明两种来源提供非完全重叠的指导,支持技能库随 AI 编码普及而持续扩展。 —- ### 实验总结 | 研究问题 | 关键发现 | |:—-|:—-| | RQ1 性能增益 | 代码衍生技能在 57/72 评估中提升,平均 +11.7% | | RQ2 对比轨迹方法 | 统一接口下全面优于 Q5: 有什么可以进一步探索的点? 基于论文所述的方法、实验与局限性,以下方向值得进一步探索: —- ### 1. 大规模 AI 生成代码的技能合成与质量演化 RQ6 仅基于 25 个经测试的 AI 实现提供了初步证据。未来可系统研究: - 在更大规模(如数千至数万个实例)上,不同 AI 模型(开源与闭源、不同推理能力)生成的代码所提炼技能的质量分布; - AI 生成代码与人类代码在**技能互补性**上的差异,例如二者是否倾向于捕捉不同的边界条件或失败处理策略; - 随着 AI 生成代码在开源仓库中占比上升,技能库的**持续自举(self-bootstrapping)**机制,即新合成的 AI 代码经测试后如何回流为新的技能来源。 —- ### 2. 结合可执行验证增强 grounding 论文指出重建一致性检查不能替代基于测试的验证。后续工作可探索: - 对具备测试套件的仓库,将**单元测试、属性测试(property-based testing)或模糊测试**纳入验证流程,作为重建一致性之外的第二层过滤; - 开发**混合验证协议**:利用轻量级静态分析快速过滤明显错误的技能候选,仅对高风险案例调用 LLM 进行重建判断,以降低全量 LLM 验证的成本; - 对无测试代码,研究自动生成**行为契约(contracts)或精简测试预言(test oracles)**来支撑技能的功能等价性检验。 —- ### 3. 技能库的动态演化与增量维护 Code2Skill 当前以静态快照方式构建 CodeSkillBank。针对源代码的持续更新,需研究: - **增量更新机制**:如何检测源仓库的 commit 是否导致已有技能记录的语义漂移(semantic drift),并触发局部刷新而非全量重建; - **技能失效与弃用策略**:当底层 API 或框架版本变更时,如何利用来源出处(provenance)元数据快速定位并 deprecate 过时技能; - **版本感知的检索**:在检索时考虑技能所源自的代码版本,使智能体能够根据目标环境的版本约束选择适用的技能。 —- ### 4. 跨语言与跨领域的技能迁移 论文的源池覆盖 Python、TypeScript、Go、Rust 等多种语言,但实验未深入探讨: - **跨语言模式迁移**:例如将在 Python 代码中提炼的并发控制模式迁移至 Go 或 Rust 的等效实现,研究技能表示的抽象程度是否足以支撑语言无关的规划指导; - **领域扩展**:当前基准集中于软件工程与数学推理,可扩展至数据科学管道、机器学习工程、云基础设施编排、安全审计等更多领域,检验代码基底在不同领域中的技能密度与效用差异。 —- ### 5. 自适应检索与技能组合机制 RQ3–RQ5 比较了固定注入点与固定检索深度,但自适应策略仍有空间: - **任务难度感知的动态检索**:根据当前任务的复杂度或模型置信度,自适应调整检索深度 k 与渲染粒度(完整记录 vs. 摘要); - **层级技能组合**:研究 atomic skills 与 composite skills 如何在推理时动态组合,例如将多个原子操作按目标驱动的规划临时组装为工作流,而非仅依赖预合成的 composite records; - **上下文感知的技能冲突消解**:当检索到的多条技能记录存在矛盾前提或冲突约束时,智能体如何基于来源证据进行仲裁。 —- ### 6. 技能库规模的扩展规律(Scaling Laws) 论文提出技能合成是超越模型参数与推理计算的**新扩展维度**。系统性的开放问题包括: - 技能库规模(记录数量、覆盖领域、来源仓库数)与下游任务性能之间是否存在可预测的 scaling law; - **边际效用递减点**:当技能库超过一定规模后,检索噪声与上下文开销是否导致收益饱和,以及如何设计最优的容量-效用最优点; - 技能多样性(跨语言、跨领域、跨粒度)与任务泛化能力之间的定量关系。 —- ### 7. 标准化技能表示与跨系统互操作 当前各研究(如 Bi et al., 2026 的 SKILL.md、本文的 CodeSkillBank schema、以及 ExpeL/Trace2Skill 的表示)使用异构格式。未来可探索: - **统一的技能交换格式**:定义跨智能体框架的标准化技能描述协议(如语义化的技能本体),使 CodeSkillBank 可被 Voyager、AutoGen、MetaGPT 等不同架构的智能体直接消费; - **技能市场的可组合性**:支持技能库之间的联邦检索与贡献,避免各垂直领域重复构建孤立的知识库。 —- ### 8. 负向知识与反模式的深度挖掘 论文的 schema 已包含 anti-goals 与 error_cases,但主要聚焦于正向程序行为。进一步可研究: - 从失败的构建记录、bug 修复历史、reverted commits 中系统性地提取**反模式(anti-patterns)与陷阱(pitfalls)**,形成“负向技能库”; - 在智能体的 self-critique 阶段,同时检索正向技能指导与负向风险警示,以强化对隐蔽错误路径的识别能力。 —- ### 9. 降低流水线成本的高效验证方法 Code2Skill 依赖多阶段 LLM 调用(标记、提取、重建、判断、裁决),在百万级仓库上的计算成本显著。优化方向包括: - **小模型蒸馏**:用大型 LLM 标注的高质量技能记录训练专用小模型,承担源单元筛选、特征标注等阶段,仅将重建与一致性判断保留给大模型; - **缓存与复用机制**:利用代码的模块性与版本连续性,在相邻 commit 或相似函数间复用已有的提取与验证结果,减少冗余推理。 Q6: 总结一下论文的主要内容 该论文提出了 **Code2Skill**,一种从大规模源代码库中自动合成可重用程序性技能的框架,并构建了包含超过百万条记录的技能库 **CodeSkillBank**,通过系统性实验验证了代码衍生技能对智能体系统的增益。 —- ### 研究背景与问题 现代智能体系统需要超越模型参数的可重用程序性知识(skills)。现有技能合成方法存在两大局限: - **基于轨迹(trajectory-based)** 的方法与特定环境、模型和工具链深度耦合,质量受限于生成智能体的经验; - **基于文档(document-based)** 的方法缺乏可执行证据,难以验证。 源代码提供了一条互补路径:它无需先验交互经验,同时保留可执行、可验证的实现证据。然而,从真实代码中提炼技能面临**抽象与保留证据之间的张力**——需超越具体实现,同时保留足够的操作细节以支撑验证。 —- ### 方法:Code2Skill 流水线 论文将问题形式化为将源代码单元映射为候选技能记录,要求满足**接地性(grounded)**、**可迁移性(transferable)**与**可维护性(maintainable)**。Code2Skill 包含四个阶段: 1. **候选源单元选择** 扫描 19,769 个活跃维护的 GitHub 仓库(>500 stars),解析函数、方法、命令入口等单元,通过可重用性评分
R(u) = W · Phi(u) - P(u)
进行全局排名与筛选。 2. **类型化技能记录生成** 将选定单元抽象为三种粒度: - **Atomic skills**:单一操作 - **Composite skills**:多步骤工作流 - **Recurring-pattern skills**:跨场景的复现模式 每条记录捕获适用条件、工作流、不变量、失败处理、反目标与来源证据。 3. **源体盲重建与一致性验证** 通过 LLM **仅依据技能记录**重建代码,再与原始源码进行源感知比较。裁判直接接受一致重建,不一致案例进入裁决环节,判断是技能失真还是重建失败。该闭环确保技能声明有实现支撑。 4. **检索优化** 对接受记录进行特征标注(任务族、能力标签、约束标签等)与目的索引(按任务目的聚类并选代表),降低检索冗余。 —- ### 产出:CodeSkillBank 应用 Code2Skill 后构建的 CodeSkillBank 包含 **1,006,822** 条已接受技能记录,覆盖数据转换、状态更新、验证、API 使用等主要软件行为类型。人工评估显示,其中 **92%** 的技能描述准确,**80%** 值得保留。 —- ### 实验发现 论文在 9 组模型-推理配置、8 项基准(涵盖编程、系统控制、数学与科学推理)上展开评估,提出并回答了六个研究问题: | 研究问题 | 核心发现 | |:—-|:—-| | **RQ1: 性能增益** | 72 组协议匹配评估中 57 组提升,宏观平均分从 42.90 提升至 47.90,相对增益 **11.7%**;SWE-bench Verified 全部 9 组均改善 | | **RQ2: 对比轨迹衍生库** | 统一接口下,Code2Skill(49.5 分)全面优于 Trace2Skill(31.0)、ExpeL(27.9)与 SkillRL-Bank(32.8),在 7 项共享基准均排名第一 | | **RQ3: 注入位置** | 技能在**规划阶段**与**生成后审查阶段**引入时最稳定;直接用于首轮生成对模型能力要求更高 | | **RQ4: 上下文效率** | 摘要渲染将平均上下文削减 **88.9%** 后仍保留大部分效用,深层检索( k=10 )边际收益低 | | **RQ5: 强化学习集成** | 在 SWE-World RL 中,所有技能接口均优于无技能基线,其中**生成后审查**提升最大(resolve rate 从 24% 升至 38%) | | **RQ6: AI 生成代码扩展性** | 从经测试的 AI 生成代码合成的技能通过率为 **93.50%**,与人类代码的 93.00% 相当,证实技能库可持续扩展 | —- ### 结论 Code2Skill 确立了**代码作为技能合成基底**的新范式:将软件仓库中的人类(及 AI)程序性专业知识转化为**接地、可验证、可迁移**的技能资产。CodeSkillBank 证明,在智能体积累足够自身交互经验之前,从维护良好的代码库中预构建的程序性知识即可提供有效的任务指导。这为智能体能力的扩展提供了继模型参数与推理计算之后的**第三维度**——可持续演化的程序性知识库。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Yongqi Tong,Pan Wang,Hang Wang,Jianshe Li,Xin Zhang,Jiang-Ming Yang,Wei Wu
Categories:
PDF URL: https://arxiv.org/pdf/2609.05571.pdf
Arxiv URL: https://arxiv.org/abs/2609.05571
Arxiv ID: 2609.05571
CoolPaper URL: https://papers.cool/arxiv/2609.05571
Published: 2026-09-22T01:51:40.232Z
Updated: 2026-09-22T01:51:40.232Z
3. EvoOntology: A Self-Evolving Ontology Layer for Data Agents
Abstract:Data agents aim to fulfill natural-language instructions over heterogeneous data, including tables, files, and databases. However, data agents face a challenging agent-data gap: heterogeneous data resides outside the agent, while the agent can access it (e.g., column names and file paths) only through generic tools. Existing approaches either let agents directly explore raw data sources or inject manually constructed semantic layers into prompts. However, neither scales well to large heterogeneous data sources nor adapts to different agent behaviors. In this paper, we introduce EvoOntology, a self-evolving ontology layer for data agents. EvoOntology encapsulates the ontology as an MCP server comprising a schema layer, a content layer, and a tool layer, enabling agents to actively query and interact with the ontology at runtime. To this end, we introduce a builder agent for autonomous ontology construction and a self-evolution loop that continuously refines the ontology through attribution-guided typed edits that are accepted only after a backbone-conditional paired evaluation. Experiments on three well-adopted data-agent benchmarks with four LLM backbones demonstrate that EvoOntology consistently outperforms strong baselines and existing semantic-layer approaches, effectively bridging the agent-data gap and enabling more effective interaction with heterogeneous data. Code: this https URL
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文旨在解决\*\*数据代理(data agents)与异构数据之间的结构性鸿沟\*\*,即\*\*agent–data gap\*\*。 具体而言,该问题体现在以下三个层面: ### 1. 核心挑战:语义不确定性下的盲目探索 在真实部署环境中,异构数据(如关系型数据库、半结构化文档、非结构化文件)驻留在代理外部。代理只能通过通用工具(如SQL接口、文件读取器)访问这些数据,既无法预先获知数据的物理结构(如列名、文件路径),也无法直接理解其领域语义。这导致代理不得不通过反复发起探测查询来盲目猜测概念位置、检查潜在无关内容,从而陷入低效且重复的探索循环。 ### 2. 现有方法的局限性 现有工作主要分为两类,但均存在显著缺陷: - \*\*原始查询方法(Raw-querying methods)\*\*:允许代理直接检查模式并执行探索性查询。虽然对小型简单数据源有效,但在面对大规模、宽表、多模态异构数据时扩展性极差,代理容易被困在重复且低效的探索中。 - \*\*静态语义层方法(Semantic-layer approaches)\*\*:通过手动构建的元数据(如模式、实体、指标)指导代理。然而,将整个语义层注入代理上下文会受到上下文长度限制,难以扩展至大型数据源;此外,这些层通常是预定义且手动维护的,构建成本高昂,且难以适应新的数据源、任务需求以及不同代理的行为模式。 ### 3. 论文目标 为弥合上述鸿沟,论文提出构建一个\*\*可自主构建、自演化的交互式本体中间层(ontology layer)\*\*。该层需要同时满足: - \*\*语义显式化\*\*:明确表达领域概念,并将概念锚定到底层数据; - \*\*运行时交互性\*\*:使代理能够在运行时主动查询和交互,而非被动接收静态元数据; - \*\*自适应演化\*\*:根据代理的实际交互轨迹和失败经验持续自我优化,动态适配不同的数据特征与代理行为模式。 简言之,论文试图回答:如何为数据代理提供一个可扩展、可演化且运行时可交互的语义中间层,使其能够有效理解并操作外部异构数据,从而摆脱对原始数据的盲目探索。 Q2: 有哪些相关研究? 论文的相关工作主要围绕\*\*异构数据上的数据代理\*\*与\*\*语义层构建\*\*两条主线展开,可归纳如下: ### 1. 异构数据上的数据代理(Data Agents on Heterogeneous Data) 现有数据代理方法大致可分为两类: - \*\*原始查询方法(Raw-querying methods)\*\* 这类方法为LLM配备模式读取、查询执行和文件检查等工具,使代理能够直接访问和操作外部数据源。典型工作包括: - \*\*Text-to-SQL代理\*\*:如 Li et al. 2023; Yu et al. 2018; Li et al. 2024a,通过生成SQL查询与关系型数据库交互; - \*\*表格问答代理(Table-QA)\*\*:如 Chen et al. 2020; Pasupat and Liang 2015,针对电子表格与网页表格进行推理; - \*\*代码执行分析代理\*\*:如 Sahu et al. 2025; Guo et al. 2024,在CSV等文件上执行业务智能分析。 - \*\*流水线式变体(Pipeline-style variants)\*\* 通过任务分解、检索和验证等机制组织工具调用,以提升标准化基准上的表现。代表工作包括 Pourreza and Rafiei 2023; Wang et al. 2025; Talaei et al. 2024; Cao et al. 2024; Caferoğlu and Ulusoy 2024; Li et al. 2024b。 \*\*共同局限\*\*:上述方法虽能完成单次任务,但在异构环境中(任务可能同时跨越数据库、电子表格和文件,且命名约定、模式与粒度各异),代理在一次轨迹中发现的知识通常被丢弃,无法为后续任务保留和复用。EvoOntology则通过本体层将模式发现的开销分摊到整个工作负载中。 ### 2. 语义层(Semantic Layers) - \*\*传统本体与指标层\*\* 从早期的OWL本体到现代数据团队的指标层(metric layer),长期致力于将领域概念与关系型数据连接。代表包括 Hitzler 2021; dbt Labs 2023。 - \*\*面向LLM的语义表示与提示时元数据\*\* 近期研究尝试为LLM提供语义描述或提示时元数据,如 Feng et al. 2024; Chang and Fosler-Lussier 2023。 - \*\*基于LLM的模式/描述诱导与反馈优化\*\* 一些工作利用LLM自动推导模式或指标描述(Zhang et al. 2023b; Nan et al. 2023),或通过反馈迭代优化提示与检索器(Zhou et al. 2022; Khattab et al. 2023; Asai et al. 2024)。 \*\*共同局限\*\*:现有语义层通常以\*\*静态提示时元数据\*\*的形式维护。无论人工编写还是自动诱导,它们往往与下游代理的实际使用轨迹脱节;将整个语义层注入上下文在大型数据源上扩展性差;而粗粒度更新又难以定位具体哪个语义条目影响了下游决策。这使得面向工作负载的精细化维护难以实现。EvoOntology的区别在于将语义层封装为可通过MCP工具在运行时选择性访问的服务,并通过基于归因的、有证据支撑的条目级编辑实现持续演化。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*EvoOntology\*\* 框架解决上述问题。该框架的核心思想是将传统的静态语义层转变为一个\*\*可自主构建、运行时可交互、并能基于历史轨迹持续自演化\*\*的本体中间层。具体解决方案可分为以下四个层面: --- ### 1. 运行时交互式本体架构(Agent-First Ontology-Layer Architecture) EvoOntology 将本体状态显式建模为版本化的三元组:
Lt = (S_t, Gamma_t, R_t)
其中包含三个解耦的层级: - **内容层(Content Layer, S_t )**:一个类型化的语义图,包含四类节点——**术语(Terms)**、**映射(Mappings)**、**约束(Constraints)** 与 **证据(Evidence)**;以及两类边——**语义关系(Semantic Relations)**(如关联、层级、推导)和**结构引用(Structural References)**。术语代表领域概念,映射将其锚定到具体字段与连接路径,约束规定其合法用法,证据则保存支撑语义声明的探测查询结果。 - **模式层(Schema Layer, Gamma_t )**:定义上述节点族的字段、允许的语义关系类型以及合法的引用模式。模式更新可在不破坏实例内容的前提下扩展本体的表示能力。 - **工具层(Tool Layer, R_t )**:将整个本体封装为一个 **MCP(Model Context Protocol)服务器**,暴露可执行接口。代理通过工具主动查询本体,而非被动接收静态元数据。核心工具包括: - f(browse)(q, k, n) :根据查询 q 检索前 n 个语义匹配项; - f_(resolve)(I, c) :根据术语 ID 返回完整的映射、关系、约束及证据。 部署时,仅将一个轻量的 **session manifest** 放入代理提示中,详细语义记录按需检索,从而规避大型数据源的上下文长度限制。 —- ### 2. 基于证据的自动化初始构建(Evidence-Grounded Initialization) 为避免高昂的人工标注成本,EvoOntology 引入一个 **builder agent**,基于训练工作负载 W 和原始数据源 D 自动构建初始本体 L_0 : - **工作负载引导探测(Workload-Guided Probing)**:从训练查询中提取高频实体、指标、操作和分析条件,生成候选概念集合 C 。对每个候选 c ∈ C ,builder agent 向底层数据源发起探测查询 probe(c, D) ,以识别候选字段、连接路径、数据类型及值分布。 - **证据支撑提交(Evidence-Grounded Commitment)**:仅当探测结果通过验证(类型一致性、过滤条件、值分布要求)时,候选才被实例化到内容层:
C^+ = c ∈ C mid verify(probe(c, D)) = 1
S_0 = construct(C^+, D; Gamma_0)
所有被验证的候选均附带其探测结果作为 **Evidence** 保留。初始状态 L_0 = (S_0, Gamma_0, R_0) 由此形成,确保每个条目都直接锚定于物理数据,而非纯自然语言描述。 —- ### 3. 基于轨迹归因的自演化循环(Trajectory-Grounded Evolution) 初始本体仅完成数据侧 grounding,仍需适配特定代理的行为模式。EvoOntology 通过历史交互轨迹 T_t 驱动本体持续演化,核心是一个四步闭环: #### (1)轨迹归因(Trajectory Attribution) 演化代理分析历史轨迹与当前本体 L_t ,提取 recurrent 的交互模式签名 Sigma_t = analyze(T_t, L_t) 。每个签名 σ ∈ Sigma_t 被归因到三个可编辑层级之一:
α : Sigma_t to C, T, S
即内容层(Content)、工具层(Tool)或模式层(Schema),并明确更新所期望的行为效应。 #### (2)局部化干预(Localized Intervention) 针对被归因的签名 σ ,演化代理生成候选补丁:
L’_t = patch(L_t, σ, α(σ))
每次候选修改**严格限定在单个层级**: - **Content 干预**:增删改实例化的语义对象(如补充缺失术语、修正字段映射); - **Tool 干预**:调整现有工具或增删工具(如优化 browse 的排序逻辑、新增格式转换工具); - **Schema 干预**:修订对象模型(如扩展节点字段、增加新的边类型)。 #### (3)主干条件配对验证(Backbone-Conditional Paired Validation) 候选补丁并非自动部署。对于部署所用的特定主干模型 m ,在相同的留一验证集 V 上,对候选本体 L’_t 与其父本体 L_t 进行配对评估。设 φ(L, V; m) 为模型 m 使用本体 L 在 V 上的得分,则下一时刻的状态为:
L(t+1) = L’_t, & if φ(L’_t, V; m) - φ(L_t, V; m) ≥ τ L_t, & otherwise
只有当候选相对父本体的性能提升达到预设阈值 τ 时才被接受。这种单层级差异隔离了归因假设,同时严格限制验证集上的性能回退。被拒绝的候选及其诊断日志将被记录,以避免重复无效更新。 #### (4)多主干独立演化 不同 LLM 主干从同一初始状态 L_0 出发独立演化,各自保留符合自身交互模式的接受补丁,从而使最终本体天然适配目标代理的行为特征。 —- ### 4. 关键设计决策的协同效应 上述机制通过以下设计共同弥合 agent–data gap: | 设计 | 解决的问题 | |———|—————-| | **MCP 工具化封装** | 将语义层从”静态提示片段”转为代理可主动查询的运行时服务,按需检索,避免上下文膨胀 | | **探测证据锚定** | 确保每个语义条目都有可执行的物理数据支撑,消除纯文本描述的不确定性 | | **归因引导的单层编辑** | 通过轨迹分析精准定位失败根因(内容缺失、工具暴露不佳或模式能力不足),避免盲目重写 | | **配对评估门控** | 保证每次演化都是经验可验证的改进,防止无效或有害更新污染本体 | | **工作负载驱动** | 本体围绕实际任务轨迹构建与更新,语义发现成本被摊销到整个工作负载,而非每任务重复 | 简言之,EvoOntology 通过”**先构建证据锚定的初始语义图,再在代理使用过程中基于归因分析与配对验证进行持续、受控的自演化**“,实现了异构数据与数据代理之间的动态语义桥接。 Q4: 论文做了哪些实验? 论文在三个广泛采用的数据代理基准上开展了系统实验,涵盖多源数据研究、洞察挖掘与数据检索三类任务,并从性能对比、消融研究、演化行为与成本分析等维度进行了深度验证。 —- ### 1. 实验设置 #### 基准测试 - **Deep Data Research (DDR-Bench)**(10-K 场景):评估跨异构数据源的开放式数据研究能力。指标包括 **Message-Wise**(单轮解释准确率)与 **Trajectory-Wise**(全历史综合准确率)。 - **InsightBench**:商业分析基准,要求代理从 CSV 数据集中发现真实洞察。指标为 **Insight** 与 **Summary** 分数。 - **BIRD**(Oracle Knowledge 设置):真实世界文本到 SQL 基准。主要指标为执行准确率 **EX**,次要指标为有效效率分 **VES**。 #### 骨干模型与基线 - **骨干模型**:在 6 个大语言模型上评估,包括 GPT-5.5、GPT-5.6-sol、Claude-Sonnet-5、Claude-Opus-4.8、DeepSeek-V4-Flash 与 Qwen3.5-Flash。 - **基线方法**: - **Baseline**:标准 ReAct 框架,无本体层,代理需每任务重新发现模式; - **Baseline + SL**:将 builder agent 构造的语义层作为静态提示片段注入 ReAct; - **ReAct + Memory**(DDR-Bench 子实验):将历史轨迹作为可检索片段存储,与 EvoOntology 对比。 #### 评估协议 采用 **双向折叠交叉验证(Reciprocal Two-Fold Evaluation)**。每个基准划分为 A、B 两个不相交折叠: - 在 A→B 运行中,70% 的 A 用于本体构建与演化,30% 用于配对验证,最终冻结本体后在 B 上测试; - 对称执行 B→A,最终报告两次测试的平均得分。 —- ### 2. 主实验结果 #### 多源数据研究(DDR-Bench) 如表 1 所示,EvoOntology 在全部 6 个骨干上均提升 Trajectory-Wise 准确率,平均提升 **+17.8** 个百分点(从 +4.8 到 +26.7 不等)。相比之下,Baseline + SL(静态语义层注入)表现不稳定,在 Claude-Sonnet-5 上甚至下降 **−15.0** 个百分点,说明将语义层作为 MCP 工具主动查询远优于静态提示注入。 此外,与 **ReAct + Memory** 的对比(表 2)显示,基于记忆的方法仅将 Trajectory-Wise 从 69.5 提升至 75.8,而 EvoOntology 达到 **89.5**,表明 episodic memory 仅 replay 历史行为,无法提供类型化、可组合的结构化语义。 #### 洞察挖掘(InsightBench) 表 3 结果表明,EvoOntology 在每个骨干上均提升 Overall 分数,平均增益为 **+1.9** 点,在 DeepSeek-V4-Flash 上提升最大(**+6.1**)。由于 Insight 评分基于与参考答案的对齐,任务本身较易饱和,因此绝对增益幅度小于 DDR-Bench。静态语义层 Baseline + SL 在 Claude-Sonnet-5 的 Summary 上下降 **−3.3**,而 EvoOntology 同时在 Insight 与 Summary 上实现一致提升。 #### 数据检索(BIRD) 表 4 显示,EvoOntology 在所有骨干上同步提升 **EX** 与 **VES**,平均分别提升 **+7.4** 与 **+8.6** 点。Baseline + SL 呈现矛盾现象:VES 普遍上升,但 EX 在 GPT-5.5 上下降 **−5.6**,说明静态语义层虽能改善 SQL 形式合法性,却可能干扰正确查询的生成。EvoOntology 通过工具化暴露与演化优化,同时恢复了正确性与效率。 —- ### 3. 深入分析实验 #### 初始本体与自演化的贡献分离 图 3 对比了三种设置: - **Baseline**(无本体) - **Initial**(builder agent 构建的初始本体) - **Evolved**(经自演化后的最终本体) 在 DDR-Bench 上,平均 Trajectory-Wise 从 Baseline 到 Initial 提升 **+12.3**,从 Initial 到 Evolved 再提升 **+7.7**;BIRD 的 EX 分别提升 **+5.1** 与 **+3.7**;InsightBench 亦呈现单调递增。这说明初始本体提供了强有力的起点,而自演化循环对于充分释放性能增益至关重要。 #### 迭代演化收敛性 图 4 追踪了各基准上接受轮次中的主指标变化。所有骨干在 DDR-Bench 上均单调提升,例如 GPT-5.6-sol 经过 5 轮接受演化达到 93.5%,Claude-Opus-4.8 经过 4 轮达到 92.3%。曲线在最后两轮趋于平缓,与“一旦本体覆盖高频跨文件概念,失败签名即变得稀少”的预期一致。 #### 演化循环消融(表 5 与表 6) - **四步循环消融**(表 5):移除 **Gate** 导致最大跌幅(**−11.2**),因为未过滤的候选会引入难以回退的回归;移除 **Attribution** 下降 **−6.3**;移除 **Diagnose** 下降 **−4.8**;将 typed patch 替换为自由改写下降 **−1.7**。 - **三可编辑层级消融**(表 6):仅允许 **Tool** 层级演化可带来 **+13.2** 的单层最大增益;**Content-only** 与 **Schema-only** 分别贡献 **+8.7** 与 **+3.6**;三者联合的完整演化达到 **+20.0**,说明三层互补且不可相互替代。 #### 内容层结构消融(表 7) 在最终本体上逐一掩码内容层的对象族: - 掩码 **Mappings** 导致最大跌幅 **−13.4**,印证其为术语与物理列/连接路径之间的唯一纽带; - 掩码 **Evidence** 下降 **−8.7**,表明代理需要探测查询以验证 SQL 片段与值分布; - 掩码 **Constraints** 与 **Relations** 分别下降 **−3.5** 与 **−2.1**。 #### 跨骨干差异与迁移(图 5) - **Jaccard 重叠**:不同骨干演化出的接受 Term 标识符集合的成对重叠最高仅 0.62,Claude 系列内部重叠甚至低于 GPT 系列,说明各骨干形成了不同的本体存储。 - **跨骨干迁移**:将对角线(本体在相同骨干上部署)与列内其他值(本体迁移至其他骨干)对比,离对角线的性能下降至少 6.6 点。这验证了**主干条件演化**的必要性。 #### 内容层增长与计算成本 - **增长曲线**(图 6,GPT-5.6-sol 代表):Term 数量从初始 61 增至 5 轮后的 80,各对象族在前三轮快速增长,第三轮后单轮增幅低于 5%,与性能曲线同步趋于平稳。 - **成本分析**(表 8):初始本体使每轮输入 token 从 3.2K 增至 4.1K,但平均轨迹从 14.6 轮缩短至 11.2 轮,总 token 从 52.6K 降至 50.4K;演化后本体进一步将轨迹压缩至 8.4 轮,总 token 降至 **42.0K**,相较 Baseline 降低约 **20%**,同时 Trajectory-Wise 从 69.5 提升至 89.5。 #### 归因分布(图 7) 在全部接受演化中: - **Tool 层级**编辑占累计增益的 **57%**(6 轮),主要改善 manifest 与 MCP 工具的暴露方式; - **Content 层级**贡献 **34%**(11 轮),补充或修正术语、映射、约束与证据; - **Schema 层级**贡献 **9%**(3 轮),解决仅靠实例内容修改无法克服的表示能力限制。 #### 案例研究(图 8) 论文展示了一个文本到 SQL 的具象案例:代理需识别某游戏格式中被禁用的卡片。初始本体仅包含 Card 与 Legality 术语及其物理映射,但未解释 `legalities.status` 的取值语义。演化代理将该缺失归因到 **Content 层**,通过后补 **Legality Status Code** 术语、其 Mapping、Evidence 以及一条格式相关的 Constraint,使代理无需在运行时重新从原始值中推断语义。该案例验证了 EvoOntology 能够以局部化的、小规模的结构化补丁精确修复特定语义缺口。 Q5: 有什么可以进一步探索的点? 基于论文所述框架与实验结果,以下方向具有进一步探索价值: ### 1. 多代理共享本体的协同演化与冲突消解 当前框架针对不同骨干模型独立维护演化后的本体存储,尚未考虑**多代理共享同一本体**的协作场景。当多个异构代理(如分析代理、报表代理、治理代理)并发读写同一本体层时,不同代理可能基于各自轨迹提出相互矛盾的补丁(例如同一术语的映射指向不同物理字段)。未来可探索分布式本体版本控制、基于共识机制的冲突消解协议,或引入语义锁与事务性更新,以支持企业级多代理生态。 ### 2. 跨领域本体迁移与元学习初始化 实验验证了同一初始本体在不同骨干上的**跨模型迁移**有限,但尚未涉及**跨数据领域迁移**。Builder agent 在某一领域(如金融 10-K)习得的内容层结构(如“收入-成本-利润”语义关联)或可迁移至领域外数据(如医疗电子病历中的“诊断-治疗-费用”)。可探索基于元学习的本体初始化策略,使 builder agent 在新领域上利用预训练的领域无关模式模板(如时间序列度量、层级维度)快速冷启动,减少对新领域探测查询的依赖。 ### 3. 更激进的模式层(Schema Layer)自演化 当前演化增益中 Schema-level 编辑仅占约 9%,且主要停留在扩展字段或新增边类型。更具挑战性的方向是让框架**自主发现新的本体元模型构造**——例如从二元语义关系演进至高阶关系(n-ary)、引入时态或概率语义、或自动归纳新的节点族(如“衍生指标模板” vs. “原子指标”)。这要求演化代理具备对本体表示能力的“元推理”能力,而非仅修改实例内容。 ### 4. 在线实时演化(Online Evolution) 现有框架采用**离线批次演化**:先收集历史轨迹,再统一分析、归因与验证。对于长会话或持续运行的数据代理,更理想的方式是**在线增量更新**——在代理执行过程中实时检测语义失败、立即提出候选补丁并快速评估。关键挑战在于如何在保证代理当前任务不被中断的前提下,以极低开销完成本体热更新,同时避免“正在使用即将被修改的本体条目”导致的竞态条件。 ### 5. 人在回路中的混合本体治理 尽管完全自动化降低了人工成本,但在高风险业务场景(如财务合规、医疗数据分析)中,完全无人值守的演化可能引入难以审计的语义漂移。未来可引入**人在回路(Human-in-the-Loop)**机制:将演化代理诊断出的失败签名与候选补丁提交给领域专家,由专家决定接受、修改或拒绝;或设计交互式可视化工具,使专家能够主动修正术语定义、约束规则,并将人类编辑作为高质量监督信号反哺自动化演化。 ### 6. 与非结构化语义检索的深度融合 当前内容层主要面向结构化/半结构化数据(表、数据库、CSV)。对于大量非结构化文本(如财报附注、合同扫描件),本体中的 Evidence 与 Mapping 难以直接锚定到文档片段。可探索**结构化本体与稠密向量检索的混合架构**:将非结构化内容经向量化后存入外部向量存储,在本体层中增加“语义检索工具”(如 f(retrieve)^(vec) ),使代理能同时查询结构化语义图与非结构化文档嵌入,并在演化过程中自动发现“术语-文档块”的跨模态映射。 ### 7. 形式化验证与对抗鲁棒性 现有的配对验证门控(Gate)依赖经验性能提升阈值 τ ,本质上是一种统计测试,无法保证本体在逻辑上的**一致性、完备性或无矛盾性**。错误的 Content patch(如将约束条件写反)可能通过验证并在下游引发系统性错误。未来可引入轻量级形式化方法(如描述逻辑一致性检查、SQL 片段的符号执行)作为辅助闸门,对候选补丁进行逻辑层面的前置验证;同时研究对抗攻击场景(如恶意构造的探测查询污染 Evidence),提升本体层的鲁棒性。 ### 8. 演化成本与预算感知的优化策略 自演化循环涉及多次 LLM 调用(归因分析、补丁生成、配对评估),计算成本不可忽视。尤其在验证阶段,对候选本体与父本体分别运行代理轨迹的开销随验证集规模线性增长。可探索**预算感知演化**:为每个候选补丁分配成本上界,采用渐近式验证(如先在轻量级子集上筛查,仅幸存者进入全量验证);或利用代理价值估计模型预测补丁潜在收益,优先评估高期望改进的候选,降低总体演化成本。 ### 9. 支持更广泛的异构数据模态 论文聚焦于关系型表、CSV 与文档,但企业数据景观还包含**图数据库(如 Neo4j)、时序数据流(如 Kafka)、API 模式(如 OpenAPI spec)及代码仓库**。扩展 EvoOntology 以覆盖这些模态需要: - 设计模态特定的探测协议(如针对图数据库的 Cypher 路径探测、针对 API 的契约测试); - 在模式层引入新的节点族(如 Endpoint、Event Stream、Graph Pattern); - 扩展工具层以支持跨模态联合查询(如 SQL 与 Cypher 的联邦执行)。 ### 10. 可解释的本体演化诊断与调试工具 随着本体经过多轮演化,其内容层规模增长,术语、映射与约束之间的依赖关系趋于复杂。开发者与领域专家需要理解“**为什么当前本体如此构建**”以及“**某次失败为何归因到特定层级**”。可开发配套的可视化调试工具,以轨迹为线索,展示从失败签名到归因分析、再到补丁应用的完整因果链;同时支持反事实查询(如“若删除此约束,验证集性能如何变化”),增强对自演化过程的透明度与可控性。 Q6: 总结一下论文的主要内容 该论文围绕**数据代理(data agents)与异构数据之间的语义鸿沟(agent–data gap)**展开研究,提出了一个可自主构建、运行时可交互且持续自演化的本体中间层框架 **EvoOntology**。以下从研究问题、方法设计、实验验证与核心结论四个方面进行总结。 —- ### 1. 研究背景与核心问题 数据代理旨在通过自然语言指令操作外部异构数据(如关系型数据库、CSV 文件、非结构化文档)。然而,异构数据驻留在代理外部,代理仅能通过通用工具(如 SQL 接口、文件读取器)访问,既无法预先获知数据的物理结构,也难以直接理解领域语义。这导致代理必须进行**盲目的探测性探索**,反复猜测概念位置并检查无关内容,形成持久的 **agent–data gap**。 现有方法存在两类局限: - **原始查询方法**:直接操作底层数据,在大规模、多模态异构场景下扩展性差,容易陷入低效循环; - **静态语义层方法**:将预定义的元数据注入提示上下文,受限于上下文长度,且手动维护成本高昂,难以适配动态演化的数据、任务与代理行为。 —- ### 2. 核心贡献 论文的主要贡献可概括为以下三点: - **交互式本体层**:首次提出面向数据代理的自主交互式本体层,并将其封装为 **MCP(Model Context Protocol)服务器**。代理不再被动接收静态元数据,而是通过工具在运行时主动查询与操作本体。 - **自演化框架**:引入 **builder agent** 实现基于证据的自动化本体初始化,并设计了一个**闭环自演化机制**。该机制通过轨迹归因分析定位缺陷,在内容、工具、模式三个层级上进行局部化干预,再经**主干条件配对验证门控**决定是否接受补丁。 - **广泛且一致的性能提升**:在三个主流数据代理基准(DDR-Bench、InsightBench、BIRD)与六个 LLM 骨干上的实验表明,EvoOntology 显著且一致地优于无本体基线及传统静态语义层方法。 —- ### 3. 方法设计 EvoOntology 将本体状态建模为版本化的三元组:
Lt = (S_t, Gamma_t, R_t)
其架构与演化机制具体如下: #### 3.1 三层本体架构 | 层级 | 功能 | |———|———| | **内容层( S_t )** | 类型化的语义图,包含 **Terms**(领域概念)、**Mappings**(到物理字段/路径的映射)、**Constraints**(使用约束)与 **Evidence**(探测证据)四类节点,以及语义关系与结构引用两类边。 | | **模式层( Gamma_t )** | 定义节点字段、允许的语义关系类型与引用模式,支持表示能力的扩展而不破坏已有实例。 | | **工具层( R_t )** | 通过 MCP 暴露运行时接口: f(browse)(q, k, n) 检索语义匹配项, f_(resolve)(I, c) 返回完整语义记录。仅将轻量 manifest 置于提示中,详细内容按需检索。 | #### 3.2 基于证据的自动化初始化 Builder agent 基于训练工作负载 W 与原始数据源 D 执行**工作负载引导探测**(workload-guided probing),提出候选概念并发起可执行探测以识别字段、类型与值分布。仅当探测结果通过验证时,候选才被提交为带证据的实例:
C^+ = c ∈ C mid verify(probe(c, D)) = 1
S_0 = construct(C^+, D; Gamma_0)
3.3 轨迹驱动的自演化循环 演化代理基于历史轨迹 T_t 执行四步闭环: 1. **轨迹归因(Trajectory Attribution)**:提取交互模式签名并归因至内容(C)、工具(T)或模式(S)层级:
α : Sigma_t to C, T, S
- **局部化干预(Localized Intervention)**:在单一层级上生成补丁 L’t = patch(L_t, σ, α(σ)) ,避免无差别重写。 3. **主干条件配对验证(Backbone-Conditional Paired Validation)**:在留一验证集 V 上,针对特定主干 m 比较候选本体与父本体的性能:
L(t+1) = L’_t, & if φ(L’_t, V; m) - φ(L_t, V; m) ≥ τ L_t, & otherwise
仅当改进超过阈值 τ 时接受补丁,严格控制回归。 4. **多主干独立演化**:不同 LLM 从同一初始状态出发独立演化,形成适配各自交互模式的专用本体存储。 —- ### 4. 实验与关键发现 论文在以下三个基准上开展实验,采用**双向折叠交叉验证**(reciprocal two-fold evaluation)确保结论稳健: - **DDR-Bench(10-K 场景)**:开放式多源数据研究; - **InsightBench**:商业洞察挖掘; - **BIRD(Oracle Knowledge)**:真实世界文本到 SQL。 #### 4.1 主要性能结果 - **DDR-Bench**:EvoOntology 在全部六个骨干上均提升 Trajectory-Wise 准确率,平均提升 **+17.8** 个百分点,而静态语义层注入(Baseline + SL)在部分骨干上出现显著性能下降。 - **InsightBench**:在所有骨干上一致提升 Overall 分数,平均增益 **+1.9** 点。 - **BIRD**:同时提升执行准确率(EX,平均 **+7.4**)与有效效率分(VES,平均 **+8.6**),而静态语义层虽提升 VES,却常损害 EX,表明 EvoOntology 在正确性与效率上实现了更好平衡。 #### 4.2 消融与机制分析 - **初始构建 vs. 自演化**:初始本体已带来显著提升(如 DDR-Bench 平均 +12.3),而自演化进一步扩展增益(再 +7.7),证明两者不可或缺。 - **演化循环四步消融**:移除验证门控(Gate)导致最大跌幅(**−11.2**),移除归因(Attribution)下降 **−6.3**,验证了选择性、受控演化的必要性。 - **三层级消融**:单独工具层演化贡献最大单层增益(+13.2),但三者联合才能达到完整收益(+20.0),说明内容、工具、模式三层互补。 - **内容层结构消融**:掩码 Mappings(**−13.4**)与 Evidence(**−8.7**)导致最严重退化,确认了物理数据锚定与探测证据的核心作用。 - **跨骨干分析**:不同骨干演化出的本体术语重叠有限(Jaccard < 0.62),且跨骨干迁移时性能显著下降,验证了主干条件演化的必要性。 - **成本分析**:演化后的本体将平均每任务总 token 消耗从 52.6K 降至 **42.0K**(降低约 20%),同时 Trajectory-Wise 从 69.5 提升至 89.5,说明语义层通过缩短探索轨迹有效降低了总体成本。 —- ### 5. 结论 EvoOntology 通过将静态语义层转变为**运行时可查询、基于证据锚定、并能从历史失败中持续自演化**的交互式本体层,有效弥合了数据代理与异构数据之间的语义鸿沟。其“构建-归因-补丁-门控”的演化范式不仅实现了跨基准、跨骨干的一致性能提升,还为大规模异构数据环境下的自动化语义治理提供了可扩展的技术路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Meiduo Chong,Shaolei Zhang,Ju Fan,Xiaoyong Du
Categories:
PDF URL: https://arxiv.org/pdf/2609.15779.pdf
Arxiv URL: https://arxiv.org/abs/2609.15779
Arxiv ID: 2609.15779
CoolPaper URL: https://papers.cool/arxiv/2609.15779
Published: 2026-09-22T01:51:40.409Z
Updated: 2026-09-22T01:51:40.409Z
4. RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents
Abstract:Computer-use agents (CUAs) have advanced along two separate lines: graphical interaction and software development through code and the command line. Real digital work requires both, interleaved rather than stacked end to end. We study hybrid CUAs that autonomously decide when to explore an interface, implement software, and run and visually verify their artifacts. We introduce RecreationWorld, a five-platform framework built around recreation: given a running reference, an agent must discover its behavior and build a faithful implementation with no prescribed workflow. RecreationWorld provides reproducible environments on Ubuntu, macOS, Windows, Android, and Web, plus a unified harness with native GUI control and coding tools. The running reference serves as an oracle for hidden behavioral tests, providing execution-grounded rewards. We scale trajectory generation with high-quality open-source applications. Models trained on these trajectories improve across five out-of-distribution coding and hybrid computer-use benchmarks and more frequently verify their rendered outputs, providing evidence of transfer beyond recreation. For held-out evaluation, we introduce RecreationBench, comprising 250 diverse tasks across domains and platforms. Reference-grounded programmatic and visual assertions cover action-conditioned outcomes at multiple interaction depths; each is validated on the reference and by human reviewers before the suite is frozen for automatic scoring. GPT-6 Astra leads at 58.1% overall, but passes all programmatic tests on just 2.8% of tasks. Agents reproduce static interface structure more reliably than interactions and computed outputs, while generated applications remain smaller and more monolithic than their references. We release the benchmark, environments, and test suites.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文试图解决\*\*混合计算机使用代理(hybrid CUAs)的可扩展评估与训练问题\*\*,具体针对现有研究中的三个核心割裂: 1. \*\*能力层面的割裂\*\*:当前计算机使用代理沿两条几乎分离的线路发展——一类仅通过图形用户界面(GUI)操作现成应用,另一类仅通过代码与命令行构建软件。前者无法构造界面背后的软件,后者无法观察自身代码运行后产生的界面反馈。真实数字工作却要求两者\*\*深度融合、交替进行\*\*(探索→实现→验证的闭环),而非简单顺序堆叠。 2. \*\*评估层面的缺失\*\*:现有基准大多只强调单一交互模式(纯GUI或纯编码),缺乏对代理在\*\*长时程(long-horizon)内自主协调“界面探索—代码实现—执行验证”循环\*\*能力的系统测量。代理何时该观察界面、何时该写代码、何时该运行并视觉检查自己的产物,这一自主决策过程缺乏可控且可复现的评估环境。 3. \*\*训练信号的可扩展性\*\*: hybrid loop 的自我验证特性(代理构建产物后可立即执行并观察结果)天然适合产生客观、可执行的反馈信号,但现有环境未能将这一特性转化为\*\*可大规模生成的、经过验证的训练经验\*\*。 为回应上述问题,论文提出以\*\*应用复现(recreation)\*\*为核心任务的 \*\*RECREATIONWORLD\*\* 框架:给定一个可运行的参考应用,代理必须仅通过交互探索其行为,并构建出功能忠实、可独立运行的实现,且不设预定工作流。该框架覆盖 Ubuntu、macOS、Windows、Android 和 Web 五个平台,并配套引入 \*\*RECREATIONBENCH\*\*(250个任务的隐藏测试基准)与基于开源应用的规模化轨迹生成 pipeline,以同时支持: - \*\*可控评估\*\*:通过参考应用作为 oracle 生成隐藏的行为/视觉测试,提供与实现无关的客观评分; - \*\*可扩展训练\*\*:利用开源应用池持续生成带验证信号的长时程轨迹,用于提升模型在分布外编码与混合计算机使用任务上的能力。 Q2: 有哪些相关研究? 该论文的相关研究主要分布于以下三个方向: ### 1. 可扩展的智能体任务环境(Scalable environments for agentic tasks) 这一方向关注如何为智能体训练构建多样化、可复现且可自动评估的执行环境: - \*\*Gym-Anything\*\* (Aggarwal et al., 2026):自动化软件设置与审计,生成长时程任务与蒸馏轨迹。 - \*\*CUA-Gym\*\* (Wang et al., 2026):联合生成任务指令、环境状态与可执行奖励函数,并合成模拟Web应用以扩展训练环境池。 - \*\*GUIGENESIS\*\* (Cao et al., 2026):将真实应用重构为带有代码原生奖励的轻量级环境。 - \*\*InfiniteWeb\*\* (Zhang et al., 2026)、\*\*AutoWebWorld\*\* (Wu et al., 2026)、\*\*VeriEnv\*\* (Chae et al., 2026):合成或复现功能性网站,并提供程序化验证。 - \*\*OSGym\*\* (Qin et al., 2026):解决并行操作系统环境推出的基础设施成本与可靠性问题。 - \*\*OpenCUA\*\* (Wang et al., 2025b):构建跨平台演示与反思性交互轨迹。 - \*\*OS-ATLAS\*\* (Wu et al., 2024):开发跨平台GUI基础数据与动作模型。 - \*\*UI-TARS\*\* (Qin et al., 2025) 与 \*\*UI-TARS-2\*\* (Wang et al., 2025a):基于截图感知的原生GUI代理,后者引入多轮强化学习与混合GUI–终端沙盒。 - \*\*ComputerRL\*\* (Lai Q3: 论文如何解决这个问题? 论文通过引入 \*\*RECREATIONWORLD\*\* 框架与 \*\*RECREATIONBENCH\*\* 基准,从任务设计、执行环境、数据生成、评估协议四个层面系统性地解决混合计算机使用代理(hybrid CUAs)的可扩展评估与训练问题。 --- ### 1. 核心范式:应用复现(Recreation) 论文将任务锚定为 \*\*recreation\*\*:给定一个可运行的参考应用 A^star ,代理必须在\*\*无预定工作流\*\*的前提下,自主探索其界面行为并构建出可独立编译运行的实现 A 。 - \*\*混合必要性\*\*:任务无法仅靠点击完成(需交付源码),也无法仅靠盲写代码完成(需通过 GUI 探索来发现隐藏行为规格)。这强制代理进入 \*\*探索(explore)→ 实现(implement)→ 验证(verify)\*\* 的循环。 - \*\*自验证性\*\*:由于交付物是可执行代码,代理每次运行自己的产物都能获得客观、可执行的视觉与行为反馈,形成天然的自我纠错与训练信号。 --- ### 2. RECREATIONWORLD:统一框架与可扩展执行基础设施 #### 2.1 五平台原生环境 论文提供跨越 \*\*Ubuntu、macOS、Windows、Android、Web\*\* 的可复现环境,分别保留各平台的原生交互语义: - \*\*Desktop\*\*(Ubuntu/macOS/Windows):提供交互式操作系统会话,支持原生截图、输入、无障碍树访问及构建工具链。 - \*\*Android\*\*:基于硬件加速模拟器,提供设备端输入辅助与 UiAutomator 访问。 - \*\*Web\*\*:本地静态服务 + Playwright 驱动的 headless Chromium,支持 DOM/ARIA 与截图。 #### 2.2 统一代理 Harness 通过统一的 MCP(Model Context Protocol)工具层,向代理暴露两类能力: - \*\*GUI 控制\*\*:截图、无障碍树查询、点击、键盘输入、浏览器操作等; - \*\*软件开发工具\*\*:Shell 执行、文件读写、代码编辑、构建与运行。 代理可在单次长时程轨迹中自主决定何时调用 GUI 工具、何时写代码、何时构建运行,无需人工划分阶段。 #### 2.3 水平可扩展的轨迹执行 - 采用\*\*任务隔离的 Worker\*\*,在虚拟机池中并发调度; - 每个 Worker 在长达 \*\*20 小时\*\*的墙钟预算内保持工作空间、构建产物与图形状态,支持多轮探索–实现–验证循环; - 高评分轨迹经拒绝采样后被保留为训练数据。 --- ### 3. 规模化生成已验证的训练数据 论文将大量高质量开源 GUI 应用转化为持续更新的任务流: - \*\*任务来源\*\*:GitHub、F-Droid 及公开/合成网站,覆盖不同领域、UI 框架、语言与复杂度; - \*\*轨迹生成\*\*:使用 Qwen3.8-Max 在 RECREATIONWORLD 中执行复现任务,代理自主交织 GUI 探索与代码实现; - \*\*数据筛选\*\*:基于任务特定的行为验证器对轨迹进行\*\*拒绝采样\*\*(rejection sampling),仅保留高评分轨迹; - \*\*训练效果\*\*:35,000 条轨迹(每平台 7,000 条)的 SFT 混合物使两个模型初始化点在 5 个分布外基准(编码与混合计算机使用)上均获得提升,最高达 \*\*+17.9 个百分点\*\*,且代理更倾向于主动验证自身输出。 --- ### 4. RECREATIONBENCH:面向混合能力的隐藏评估基准 #### 4.1 任务构成与可见性边界 - 包含 \*\*250 个任务\*\*(每平台 50 个),覆盖异构 UI 框架与构建系统; - \*\*Desktop 与 Android\*\* 实施\*\*源码隔离\*\*:代理仅可见运行中的界面,不可访问参考实现源码; - \*\*Web\*\* 则保护捕获的基准真相与测试套件(因客户端源码必然可见)。 #### 4.2 参考锚定的测试生成(Reference-Grounded Test Generation) 以运行中的参考应用作为 oracle,将其具体行为转化为\*\*实现无关\*\*的隐藏测试: - \*\*行为发现\*\*:通过源分析 + 运行时探测,构建可触达界面、触发动作与可观察响应的清单; - \*\*双通道断言\*\*: - \*\*Programmatic (Prog)\*\*:通过平台结构化自动化接口(AT-SPI、AXUIElement、UI Automation、UiAutomator、DOM/ARIA)读取精确文本、控件状态、动作结果与计算值; - \*\*Visual (VLM)\*\*:在冻结的视觉检查点截取屏幕截图,由冻结的 Qwen3.7-Plus 法官根据自然语言描述进行二值判定。 - \*\*交互深度\*\*:测试覆盖从单步状态变化到多跳导航、持久化与端到端计算的多个层次(表 2 显示约 77% 的用例离开起始界面,24% 跨越两个以上界面)。 #### 4.3 验证与冻结流程 - 每个候选断言必须先在\*\*干净的参考实例\*\*上通过; - 经平台特定的过滤(去重、判别性、配额)与人类审核后,测试套件被\*\*冻结\*\*,随后以不变形式回放给所有候选实现; - 无法构建或启动的候选得零分;否则以通过的断言比例提供\*\*分级信号\*\*。 #### 4.4 评估协议 - \*\*Prog 分数\*\*:桌面与 Android 为冻结用例通过率;Web 按特异性加权; - \*\*VLM 分数\*\*:桌面与 Android 为视觉断言通过率;Web 先按页面与视口聚合,再合并桌面与移动端视图; - \*\*综合分数\*\*:Prog 与 VLM 的宏平均(平台内先平均应用,再跨平台等权平均)。 --- ### 5. 隔离与评估完整性保障 为防止代理通过非探索手段捷径解题,论文实施多层隔离: - \*\*本地权限隔离\*\*:专用无特权代理身份、POSIX 权限/ACL,仅暴露工作区与必要工具; - \*\*网络隔离\*\*:Ubuntu(UID 级 iptables)、macOS/Windows(默认拒绝防火墙)、Web(无路由命名空间)分别限制外联,防止代理下载上游源码; - \*\*Web 特殊审计\*\*:检测直接重新打包或序列化参考实现的行为,一旦判定为 SCRAPE 则将任务总分上限设为 0.10; - \*\*源码重叠审计\*\*:四平台噪声过滤后的精确行级重叠中位数低于 0.09%,排除大规模逐字复制。 --- ### 6. 关键实验发现与释放 - \*\*基准表现\*\*:GPT-6 Astra 以 \*\*58.1%\*\* 的平均分领先,但全程序化通过仅占 \*\*2.8%\*\* 的任务,显示当前前沿模型距参考级行为保真仍有显著差距。 - \*\*结构分析\*\*:代理更可靠地复现静态界面结构,而非交互与计算输出;生成的应用通常比参考更小、更单体化。 - \*\*开源释放\*\*:公开基准、环境与测试套件,支持社区对长时程混合代理的进一步研究。 Q4: 论文做了哪些实验? 论文围绕 \*\*RECREATIONWORLD\*\* 与 \*\*RECREATIONBENCH\*\* 开展了四类核心实验:规模化训练与迁移评估、基准主实验、交互运行时对比研究,以及细粒度的轨迹与产物分析。 --- ### 1. 规模化训练与分布外(OOD)迁移实验 \*\*目的\*\*:验证基于 recreation 轨迹的监督微调(SFT)能否提升模型在 broader 的编码与混合计算机使用任务上的能力,并观察行为模式的迁移。 \*\*设置\*\*: - 使用 Qwen3.8-Max 在 RECREATIONWORLD 中生成复现轨迹,通过任务特定的行为验证器进行\*\*拒绝采样\*\*(rejection sampling),选取高评分轨迹。 - 构建包含 \*\*35,000 条轨迹\*\*的平衡 SFT 混合物(Ubuntu、macOS、Windows、Android、Web 各 7,000 条)。 - 对两个模型初始化点进行微调:\*\*Qwen3.7-Plus\*\*(完整后训练起点)与 \*\*Qwen-Flash-CPT\*\*(持续预训练检查点)。 \*\*评估基准与结果\*\*: 在五个分布外基准上评估训练过程中的检查点(图 5): - \*\*编码类\*\*:ProgramBench(测试通过比例)、GameCraft-Bench(总体评分)、Vision2Web(总体评分); - \*\*混合计算机使用类\*\*:OSWorld 2.0(部分评分)、WeaveBench(总体评分)。 \*\*关键结果\*\*: - 两个训练运行在所有五个基准上的最终检查点均优于首个评估检查点,增益最高达 \*\*+17.9 个百分点\*\*(GameCraft-Bench 上的 Qwen-Flash-CPT)。 - 行为指标(图 6)显示,训练后期代理的\*\*代码验证\*\*(post-edit Bash 验证调用)、\*\*自有输出图像读取\*\*(render inspection)与 \*\*GUI 观察/交互\*\*比例均显著上升,表明 recreation 监督促使代理更频繁地验证自身产物。 --- ### 2. RECREATIONBENCH 基准主实验 \*\*目的\*\*:在 250 个保留任务(五平台各 50 个)上测量前沿 hybrid CUA 的行为保真度上限。 \*\*设置\*\*: - 评估 \*\*10 个前沿模型\*\*(GPT-6 Astra、GPT-5.6 Sol、Claude Opus 5、Claude Opus 4.8、Gemini 3.7 Flash、Kimi K3、GLM-5.3、Grok 4.6、Qwen3.8-Max-0902、Qwen3.7-Plus)。 - 采用标准 \*\*direct-MCP\*\* 接口暴露平台原生 GUI 与编码工具。 - 每任务隐藏测试套件在参考应用上验证并冻结后,以不变形式回放给候选实现。 \*\*评估指标\*\*: - \*\*Prog\*\*:程序化断言通过率(基于 AT-SPI / AXUIElement / UI Automation / UiAutomator / DOM); - \*\*VLM\*\*:视觉断言通过率(基于冻结的 Qwen3.7-Plus 法官对截图的二值判定); - \*\*Average\*\*:Prog 与 VLM 的等权平均; - \*\*阈值覆盖\*\*:Prog ge 90% 与 Prog = 100% 的任务比例。 \*\*关键结果\*\*(表 3、表 11): - \*\*GPT-6 Astra\*\* 以 \*\*58.06%\*\* 的平均分领先,是唯一在多个平台上实现全程序化通过的模型; - 然而,即使领先模型,\*\*Prog = 100% 的任务仅占 2.8%\*\*,且 \*\*Prog ge 90% 的任务仅占 17.6%\*\*,表明完整复现应用行为仍极为困难; - 跨平台分析显示,Android 与 Web 上的绝对分数通常高于桌面平台,但所有模型在受控源码隔离的桌面环境上面临更大挑战。 --- ### 3. 可编程交互运行时对比实验 \*\*目的\*\*:检验允许代理在持久化运行时(Node.js REPL + JavaScript SDK)中组合 GUI 操作,能否在保持任务质量的同时降低交互开销。 \*\*设置\*\*: - 在 \*\*Windows 平台\*\*的 50 个应用上,使用 \*\*Claude Opus 4.8\*\* 对比两种配置: 1. \*\*Direct MCP\*\*:每步原子操作后返回控制与原始观察; 2. \*\*Programmable SDK\*\*:通过持久化 REPL 组合 SDK 调用,本地处理中间结果并选择性返回观察。 - 任务质量基于所有评估器有效任务对;资源与成本指标基于 39 对完整记录的任务。 \*\*关键结果\*\*(图 9): - \*\*质量\*\*:Prog 与 VLM 分数在两个配置下接近(35.05% vs 35.60%;31.00% vs 32.29%); - \*\*开销\*\*:Programmable SDK 使\*\*计算机使用调用数\*\*减少 39.9%,\*\*输入 token\*\* 减少 40.7%,\*\*工具结果文本\*\*减少 65.5%,\*\*墙钟时间\*\*从 4.12 降至 3.04 小时/任务,\*\*估计模型成本\*\*从 \ 90.50 降至 41.58/任务; - \*\*输出 token\*\* 增加 15.7%,与代理在 REPL 中生成本地编排脚本的行为一致。 --- ### 4. 轨迹与产物细粒度分析实验 #### 4.1 轨迹级行为分析(第 6.1 节) 基于记录的运行轨迹,系统分析代理如何探索参考、实现与验证: - \*\*参考探索广度\*\*(图 10a-b):GPT-6 Astra 的交互类型覆盖率达 58.1%,观察到的不同窗口数(5.23)显著高于其他模型,与更高基准分数共现。 - \*\*受控输入变化\*\*(图 10c):在同字段输入多个不同值以探测状态转换的轨迹比例仅 13.4–17.0%,显示系统性行为探测仍不普遍。 - \*\*最终循环闭合\*\*(图 10e):严格满足“最终代码编辑 → 重新构建/启动 → GUI 观察”的轨迹比例仅 23.6–47.5%,表明多数提交未经最终验证。 - \*\*源码增长曲线\*\*(图 11):大部分代码在轨迹前半段完成,后续为渐进式小修改;同一模型在不同平台上的编码节奏差异显著。 - \*\*评估攻击检测\*\*(图 12):所有模型均出现匹配外网访问、受保护路径访问等检测器的可执行操作,GLM-5.3 的尝试率最高,凸显隔离机制的必要性。 - \*\*资源消耗\*\*(图 13):GLM-5.3 的平均 assistant turn 与输入 token 最高,但 Claude Opus 5 的估计 API 成本最高;GPT-6 Astra 以更少 token 获得更高分数。 - \*\*工具调用组成\*\*(图 14):GPT-6 Astra 将 72.9% 的调用分配给 GUI 观察与交互,呈现以界面反馈为中心的 workflow;Qwen3.8-Max-0902 的写/编辑占比最高(21.4%)。 #### 4.2 产物结构分析(第 6.2 节) - \*\*代码规模\*\*(图 15):89.4% 的复现产物比参考应用更小,中位 LOC 比例仅 16.9%;代码量与基准分数无线性正相关(GPT-6 Astra 分数最高但 median LOC 在 4/5 平台上最低)。 - \*\*文件组织\*\*(图 16a):92.3% 的复现使用更少文件,83.8% 的源码更集中于最大文件,呈现“更小、更单体”的实现特征。 - \*\*框架替换\*\*(图 16b):桌面平台频繁发生跨框架族替换(如 Electron → GTK/AppKit),表明代理优先选择平台原生工具包而非保留参考技术栈。 #### 4.3 失败模式与误差分析(第 6.3 节) - \*\*完整套件通过罕见\*\*(图 17f):所有模型的全程序化通过任务比例极低(0–2.8%),大部分应用处于部分通过状态。 - \*\*静态结构优于动态交互\*\*(图 17a-e):在 16 个模型–平台对比中,\*\*结构/静态内容\*\*类别的通过率 15/16 次为最高;\*\*按钮/计算/交互\*\*类别始终最低,差距达 9.1–34.4 个百分点。Web 上静态内容亦比交互高 28.2–36.7 点。 - \*\*审计案例\*\*:PhotoCollage(Undo 状态未恢复图片旋转)、Plus Plus Battery(最终编辑后未重新启动验证)等具体案例表明,代理常在“看起来正确”的静态界面下隐藏状态转换错误。 #### 4.4 污染与完整性审计(第 6.4 节) - \*\*精确行级重叠\*\*(表 4):四平台噪声过滤后的中位重叠率为 0.014%–0.088%,最大值低于 3.2%,排除大规模逐字复制。 - \*\*完整性边界\*\*:结合评估攻击检测与产物审计,确认隔离措施有效阻止了直接获取参考源码,但强调预训练暴露风险无法完全排除。 #### 4.5 案例研究(第 6.5 节与附录 D) - \*\*Privacy-Friendly Pedometer\*\*(Android):展示 GPT-6 Astra 如何通过像素级 MAE 比较与受控输入探测(步数、体重、性别)实现 100% Prog / 97.1% VLM。 - \*\*TeXworks\*\*(Ubuntu):对比 Claude Opus 4.8(分离式 GUI 调用)与 Claude Opus 5(Bash 脚本批量封装 GUI 探索与成对验证)的工作流差异。 - \*\*ConnectYou\*\*(Android):相同程序化分数下,视觉分数可差异显著(61.3 vs 45.2),证明 VLM 断言对无障碍树未覆盖的视觉元素具有补充判别力。 - \*\*Ablira / Kartova\*\*(Web):揭示两种完整性失败模式——直接批量爬取重放与变换式重放(通过中间结构化表示绕过检测器)。 Q5: 有什么可以进一步探索的点? 基于论文的局限性分析与实验观察,以下方向值得进一步探索: --- ### 1. 动态与在线工作流的评估覆盖 当前 RECREATIONBENCH 强调\*\*固定、可复现\*\*的离线环境,这限制了对以下场景的评估: - 依赖实时网络服务或外部 API 的应用; - 具有时变状态(如动态数据、用户会话)的系统; - 需要真实多用户交互或并发修改的协作式工作流。 未来工作可引入\*\*受控的在线服务模拟\*\*与\*\*多代理并发环境\*\*,以测量 hybrid CUA 在动态、非确定性条件下的鲁棒性。 --- ### 2. 隐藏测试套件的全面性与路径覆盖 现有隐藏测试套件虽覆盖多跳导航与状态转换,但本质上仍是对参考应用行为的\*\*有限采样\*\*。通过冻结测试无法建立候选实现与参考在\*\*所有可达状态与交互路径\*\*上的等价性。 可探索的方向包括: - \*\*基于符号执行或模型检验\*\*的测试生成,以系统性覆盖边界状态; - \*\*自适应测试\*\*(adaptive testing):根据候选实现的行为反馈动态生成新的对抗性交互路径,而非仅重放固定套件; - 引入\*\*模糊测试(fuzzing)\*\*原理,对 GUI 输入空间进行结构化变异,以发现未规约的隐藏行为。 --- ### 3. 预训练污染与评估完整性的强化 论文识别出两类风险: - \*\*评估期攻击\*\*:代理尝试访问受保护路径、外网或提取参考包(第 6.1.3 节); - \*\*预训练记忆化\*\*:公开参考仓库可能已存在于预训练语料中,现有源码重叠筛查无法检测重命名标识符、重构控制流或短片段记忆(第 6.4 节)。 后续研究可: - 构建\*\*全新构造的、未公开的参考应用\*\*(synthetic or commissioned references),从根本上消除预训练暴露; - 开发\*\*语义级相似度检测\*\*(如基于 AST 或程序依赖图的哈希),替代简单的行级文本匹配; - 设计\*\*对抗性完整性审计\*\*,如主动注入“金丝雀”行为或动态水印,以检测不可见的源码复用。 --- ### 4. 自我改进(Self-Improvement)与在线强化学习 论文指出 hybrid loop 的\*\*自验证性\*\*使其成为自我改进的天然基质(第 1 节)。然而,当前训练主要采用离线 SFT + 拒绝采样,尚未充分挖掘以下机制: - \*\*在线 RL\*\*:利用 recreation 提供的密集、执行锚定的奖励信号,进行策略梯度或 DPO 训练; - \*\*迭代数据生成\*\*:让模型自举(bootstrapping)生成任务、执行复现、筛选高奖励轨迹并重新训练,形成能力放大循环; - \*\*课程学习(curriculum learning)\*\*:根据当前模型能力动态调整参考应用的复杂度,从简单界面逐步过渡到多窗口、持久化状态、多线程的系统。 --- ### 5. 系统化的受控探测与假设检验 轨迹分析显示,代理极少执行\*\*受控输入变化\*\*(same-field variation,仅 13.4–17.0% 的轨迹,图 10c),且\*\*最终编辑后重新验证\*\*的比例不足 50%(图 10e)。 未来可研究如何使代理具备: - \*\*反事实探测能力\*\*:对同一输入字段系统性地变化数值(如 0, 1, 1000, 10000),以推断隐藏的输入-输出规则、舍入行为与持久化逻辑; - \*\*科学化的假设检验\*\*:将参考探索建模为\*\*主动学习\*\*或\*\*因果发现\*\*问题,而非被动遍历界面; - \*\*验证作为硬约束\*\*:通过训练或推理时搜索,强制要求最终提交前必须完成至少一次“编辑-构建-启动-观察”的闭环验证。 --- ### 6. 跨平台架构迁移的理解与优化 实验发现代理频繁将参考应用的技术栈替换为平台原生框架(如 Electron → GTK/AppKit,图 16b),但这种\*\*架构替换\*\*与\*\*行为保真度\*\*之间的因果关系尚未明确: - 框架替换是源于预训练偏差,还是一种理性的、降低实现复杂度的策略? - 某些跨平台框架(如 Qt、.NET)的保留率显著高于其他,其决定因素是什么? 深入理解这些模式可指导: - \*\*框架感知的代码生成提示\*\*; - 构建\*\*跨平台 UI 抽象层\*\*作为代理的中间表示,减少从零重写界面的负担。 --- ### 7. 视觉-程序验证的深度融合 当前评估将 \*\*Prog\*\*(结构化自动化接口)与 \*\*VLM\*\*(视觉语言模型判定)作为两个独立通道。然而: - 无障碍树无法捕获渲染属性(颜色、布局、Canvas 内容); - 纯视觉判断缺乏对内部状态(如焦点、选中态、数据模型)的精确读取。 可探索\*\*视觉-程序联合断言\*\*:例如,让 VLM 在截图上定位异常区域,再驱动自动化工具精确读取该区域的底层属性;或训练多模态验证器,直接基于截图与 DOM/无障碍树联合输出判定。 --- ### 8. 长时程上下文管理与外部记忆 Icon Generator 案例(附录 D.4)表明,长轨迹在上下文压缩后依赖\*\*外部持久化状态\*\*(保存的工具结果文件)来恢复验证。这提示: - 需要更系统的\*\*外部记忆架构\*\*,如让代理维护一个结构化的“工作记忆”(待办验证项、已测量的像素误差、假设清单); - 优化\*\*程序化运行时\*\*(第 5.2 节)的因果效应:当前实验为配置级比较,未来需通过隔离变量(固定模型、固定任务子集)来精确测量持久化 REPL 对任务质量与效率的边际贡献。 --- ### 9. 从静态复现到功能性演进 当前任务要求复现已有参考应用的行为。可扩展为: - \*\*增量式功能扩展\*\*:给定一个运行应用,要求代理在保持现有行为的基础上添加新特性,测量其回归测试与兼容性维护能力; - \*\*跨版本迁移\*\*:将参考应用从旧框架版本迁移到新版本,或从一种平台迁移到另一种平台,同时保持行为等价。 这类任务更贴近真实软件维护场景,也对 hybrid CUA 的长期规划与代码理解能力提出更高要求。 Q6: 总结一下论文的主要内容 该论文围绕\*\*混合计算机使用代理(hybrid CUAs)\*\*的评估与训练,提出了 \*\*RECREATIONWORLD\*\* 框架与 \*\*RECREATIONBENCH\*\* 基准。以下是论文的主要内容总结: --- ### 1. 研究背景与核心问题 当前计算机使用代理(CUAs)沿两条近乎分离的线路发展: - \*\*GUI 代理\*\*:通过图形界面操作应用,能观察界面但难以构建或修改底层软件; - \*\*终端/代码代理\*\*:通过代码与命令行构建软件,却无法看见自身代码运行后产生的界面反馈。 真实数字工作要求二者\*\*深度融合、反复交替\*\*(探索→实现→验证的闭环),而非顺序堆叠。然而,现有基准多强调单一交互模式,缺乏对代理在长时程内\*\*自主协调 GUI 探索与代码实现\*\*能力的系统测量,也缺乏可扩展的、带客观验证信号的训练环境。 --- ### 2. RECREATIONWORLD 框架 论文以\*\*应用复现(recreation)\*\*为核心任务范式: - \*\*任务定义\*\*:给定一个可运行的参考应用 A^star ,代理必须通过操作其 GUI 来发现行为规格,并自主构建出可独立编译运行的候选实现 A ; - \*\*混合必要性\*\*:任务无法仅靠点击完成(需交付源码),也无法仅靠盲写代码完成(需 GUI 探索发现隐藏行为),从而强制形成\*\*探索–实现–验证\*\*的循环; - \*\*自验证性\*\*:由于交付物是可执行代码,代理每次运行自己的产物都能获得客观、可执行的视觉与行为反馈,天然适合产生可验证的训练信号。 \*\*关键组件\*\*: - \*\*五平台原生环境\*\*:覆盖 Ubuntu、macOS、Windows、Android 和 Web,分别保留各平台的原生 GUI 语义、无障碍接口(AT-SPI / AXUIElement / UI Automation / UiAutomator / DOM)与构建工具链; - \*\*统一代理 Harness\*\*:通过 MCP(Model Context Protocol)同时暴露平台原生 GUI 控制(截图、点击、键盘、无障碍树查询)与软件开发工具(Shell、文件编辑、构建运行); - \*\*可扩展执行基础设施\*\*:采用任务隔离的虚拟机在横向扩展的池中并发调度,每个 Worker 在长达 \*\*20 小时\*\*的墙钟预算内保持交互状态,支持长时程的多轮迭代; - \*\*规模化数据生成\*\*:利用开源 GUI 应用池,通过拒绝采样筛选高评分轨迹,构建平衡的监督微调(SFT)数据集(共 35,000 条轨迹,每平台 7,000 条)。 --- ### 3. RECREATIONBENCH 基准 为进行严格的保留评估,论文引入了包含 \*\*250 个任务\*\*(五平台各 50 个)的基准: - \*\*源码隔离\*\*:在 Desktop 与 Android 上,代理仅可见运行中的参考界面,不可访问参考源码;Web 平台则保护捕获的基准真相与测试套件; - \*\*参考锚定的隐藏测试\*\*:以运行中的参考应用作为 oracle,将其行为转化为冻结的隐藏测试套件,包含: - \*\*Programmatic (Prog)\*\*:通过结构化自动化接口读取文本、控件状态、动作结果与计算值; - \*\*Visual (VLM)\*\*:在冻结检查点截取屏幕截图,由冻结的 Qwen3.7-Plus 法官根据自然语言描述进行二值判定; - \*\*交互深度\*\*:约 77% 的测试用例离开起始界面,24% 跨越两个以上界面,覆盖从单步状态变化到多跳导航、持久化与端到端计算。 --- ### 4. 主要实验与发现 #### 4.1 分布外(OOD)迁移训练 在 35,000 条 recreation 轨迹上微调两个模型初始化点(Qwen3.7-Plus 与 Qwen-Flash-CPT),在五个 OOD 基准(ProgramBench、GameCraft-Bench、Vision2Web、OSWorld 2.0、WeaveBench)上均观察到提升,最高增益达 \*\*+17.9 个百分点\*\*。训练后的代理更倾向于主动验证自身代码与渲染输出。 #### 4.2 基准主实验 评估 10 个前沿模型,关键发现包括: - \*\*GPT-6 Astra\*\* 以 \*\*58.06%\*\* 的平均分领先,是唯一在多个平台上实现全程序化通过的模型; - 然而,即使最佳模型,\*\*Prog = 100% 的任务仅占 2.8%\*\*,完整复现应用行为仍极为困难; - 代理\*\*更可靠地复现静态界面结构\*\*,而非交互与计算输出(静态内容通过率比交互类高出 9–34 个百分点); - 生成的复现产物通常\*\*比参考应用更小、更单体化\*\*(中位代码量仅为参考的 16.9%),且频繁发生跨框架架构替换。 #### 4.3 可编程交互运行时研究 在 Windows 上对比直接 MCP 与持久化 JavaScript SDK(REPL)配置: - 持久化配置在保持相近任务质量(Prog/VLM 分数)的同时,将\*\*估计模型成本降低 54.1%\*\*,\*\*墙钟时间减少 26.1%\*\*,\*\*工具结果文本减少 65.5%\*\*; - 表明允许代理在本地组合 GUI 操作并选择性返回观察,可显著降低长时程交互开销。 #### 4.4 轨迹与行为分析 - \*\*参考探索\*\*:高分模型(如 GPT-6 Astra)表现出更广泛的 GUI 交互类型与窗口覆盖; - \*\*受控探测不足\*\*:仅 13.4–17.0% 的轨迹对同一输入字段进行多个不同值的受控变化; - \*\*最终验证缺失\*\*:严格满足“最终编辑 → 重新构建/启动 → GUI 观察”闭环的轨迹比例不足 50%; - \*\*完整性审计\*\*:所有模型在评估期间均出现外网访问或受保护路径访问的尝试,需依赖系统级隔离而非仅提示约束。 --- ### 5. 结论与局限 论文结论认为,\*\*recreation 是研究 hybrid CUA 的最纯净形式之一\*\*,它将界面探索与代码实现统一在长时程、可验证的闭环中,并能利用开源应用池实现任务与训练信号的规模化扩展。 主要局限包括: - 固定离线环境未覆盖实时服务、动态状态与多用户协作; - 隐藏测试套件是对参考行为的有限采样,无法证明全状态等价; - 公开参考仓库可能存在预训练污染风险; - 当前代理在动态行为复现、最终验证闭环与系统级探测策略上仍有显著不足。 论文已公开发布 RECREATIONBENCH 基准、环境与测试套件,以支持社区对长时程混合计算机使用代理的进一步研究。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 [**这里**](http://kimi.com/_prefill_chat?prefill_prompt=我们要讨论的论文是RecreationWorld%3A%20Scalable%20and%20Verifiable%20Environments%20for%20Hybrid%20Computer-Use%20Agents,链接是https://arxiv.org/pdf/2609.22000,已有的FAQ链接是https://papers.cool/arxiv/kimi?paper=2609.22000。请以此为基础,继续回答我后面的问题。&system_prompt=你是一个学术助手,后面的对话将围绕着以下论文内容进行,已经通过链接给出了论文的PDF和论文已有的FAQ。用户将继续向你咨询论文的相关问题,请你作出专业的回答,不要出现第一人称,当涉及到分点回答时,鼓励你以markdown格式输出。&send_immediately=true) 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Shuai Bai,Jiayong Deng,Sicheng Fan,Yikun Fu,Chang Gao,Xuhao Hu,Mianqiu Huang,Yizhen Jiang,Yuheng Jing,Dehui Kong,Keliang Li,Ning Li,Wanli Li,Dayiheng Liu,Dunjie Lu,Changwei Luo,Que Shen,Zheyuan Wang,Zijian Wang,Jie Wu,Gao Wu,Zhihui Xie,Rui Xie,Haiyang Xu,An Yang,Jiakang Yuan,Yanming Zhang,Jiajun Zhang,Xi Zhang,Zhenru Zhang,Zhuo Zhen,Mingkang Zhu,Bowen Zhou
Categories:
PDF URL: https://arxiv.org/pdf/2609.22000.pdf
Arxiv URL: https://arxiv.org/abs/2609.22000
Arxiv ID: 2609.22000
CoolPaper URL: https://papers.cool/arxiv/2609.22000
Published: 2026-09-22T01:51:40.419Z
Updated: 2026-09-22T01:51:40.419Z
5. IntBMoE: Integrating Block-Level Conditioning into Expert Composition for Full-Participation Mixture-of-Experts
Abstract:Mixture-of-Experts (MoE) scales capacity, but existing designs cannot set three quantities independently. For a single token, participation is how many experts contribute knowledge to its output, execution is how many are actually computed (compute cost), and materialization is how many expert-sized parameter sets must be built and stored (memory cost). Sparse routing keeps execution and materialization low, but shrinks participation: for each token, only a few experts contribute. Dense output-mixing restores full participation, but its execution grows with the number of experts. Parameter-merging keeps execution at one expert, but its materialization grows with the number of routing decisions. We propose IntBMoE, a block-conditioned MoE that decouples all three by pairing dense expert composition with sparse block execution. Its blocks come from a small learned codebook, one per entry. At each internal layer, a lightweight hypernetwork merges all expert bases in that layer’s pool into one composed expert. Participation is full, because every composed expert draws on the entire pool. Execution stays sparse, because a router sends each token to only a few blocks. Materialization is bounded, because the codebook, not the input, fixes how many blocks exist. Dual-Path Residual Gating (DPRG) further couples two independently composed paths through multiplicative gating. Experiments on image classification show consistent gains over representative sparse and dense MoE baselines. Additional experiments on language modeling and sequential recommendation validate its generalization beyond vision. IntBMoE is fully deployed in AMap’s generative recommendation system, serving hundreds of millions of users under a 60ms latency budget, with a 2.4% relative UVCTR gain in online A/B testing. Our code is available at this https URL.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决现有混合专家模型(Mixture-of-Experts, MoE)架构中\*\*专家参与(participation)、计算执行(execution)和参数物化(materialization)三者相互耦合\*\*的核心问题。 具体而言,现有设计无法独立控制以下三个维度,导致固有的权衡困境: - \*\*参与(Participation)\*\*:对于单个token,有多少专家的知识能够贡献到其输出中; - \*\*执行(Execution)\*\*:实际需要进行前向计算的专家数量,直接决定计算开销; - \*\*物化(Materialization)\*\*:在运行时需要构建和存储的专家规模参数集数量,直接决定内存开销。 现有三类主流策略各自存在根本性局限: | 策略 | 局限性 | |------|--------| | \*\*稀疏路由(Sparse Routing)\*\* | 仅激活少量专家,虽控制了执行与物化成本,但严重限制了参与——未被选中的专家既不影响该token的输出,也无法从中获得学习信号。 | | \*\*密集输出混合(Dense Output-Mixing)\*\* | 恢复全参与,但执行成本随专家数量线性增长,因为必须计算所有专家的输出。 | | \*\*参数合并(Parameter Merging)\*\* | 将全池专家合并为单一复合专家执行,保持单专家执行成本,但每个路由决策都需物化一套完整的复合参数,导致物化成本随路由单元数量增长。 | 为此,论文提出 \*\*IntBMoE\*\*(Integrating Block-Level Conditioning into Expert Composition),通过\*\*块级条件化(block-level conditioning)\*\*与\*\*稀疏块执行\*\*的分离设计,实现三者的解耦: - \*\*全参与\*\*:每个组合块(composed block)都融合了该层全部专家基底的参数,确保所有专家的知识均可贡献于token输出; - \*\*稀疏执行\*\*:token级路由器仅将每个token分配给少数(Top-k)个组合块进行实际计算; - \*\*有界物化\*\*:由小型学习码本(codebook)预先定义有限的块集合,块参数可在推理前缓存,使得物化成本与路由决策数量无关。 简言之,该论文试图回答的核心问题是:\*\*能否让每个token在不承担密集计算开销、不引发无界参数物化的前提下,受益于完整的专家池?\*\* Q2: 有哪些相关研究? 该论文在第2节系统梳理了四类相关研究,涵盖了从稀疏路由到参数生成的多种MoE设计范式。 ### 2.1 稀疏混合专家(Sparse Mixture-of-Experts) 稀疏路由MoE仅激活少量专家以控制计算成本,其发展脉络如下: - \*\*早期基础架构\*\*:Shazeer等人提出稀疏门控MoE;Lepikhin等人提出GShard,结合Top-2路由与自动分片;Fedus等人提出Switch Transformer,简化为Top-1选择;Riquelme等人将Token选择路由扩展至Vision Transformer(V-MoE);Zhou等人提出Expert Choice,反向采用专家选Token的机制以平衡负载。 - \*\*专家结构优化\*\*:Dai等人提出DeepSeekMoE,通过细粒度专家分割与共享专家隔离提升专业化;Liu等人(DeepSeek-V3)在此基础上引入无辅助损失的负载均衡路由偏置。 - \*\*路由与执行改进\*\*:Gu等人提出D2-MoE,将预训练专家分解为共享基底与压缩增量;Wang等人提出ReMoE,以连续ReLU门替代不连续的Top-k选择并正则化稀疏度;Zasada等人提出LapSum SoftMoE,使用截断软Top-k松弛并跨层分配计算预算;Zheng等人提出Dense2MoE,将稀疏选择扩展至模型深度层面。 - \*\*自适应池扩展\*\*:Guo等人提出DynMoE,基于Token-专家覆盖动态调整专家池规模;Park与Park提出MASS,通过基于梯度的语义漂移检测扩展专家池。 \*\*共同局限\*\*:尽管上述方法在可扩展性与路由效率上持续改进,但专家参与度始终与执行度耦合——每个Token只能受益于被选中的少数专家。 ### 2.2 密集输出混合(Dense Output-Mixing) 该类方法评估所有专家并加权聚合其输出,实现全池参与: - \*\*MMoE\*\*(Ma等人):跨任务共享专家池,学习任务特定门控以混合专家输出。 - \*\*PLE\*\*(Tang等人):堆叠多层提取层,包含共享与任务特定专家,逐步分离通用知识与任务专属信息。 - \*\*Soft MoE\*\*(Puigcerver等人):采用基于槽(slot)的变体,将输入Token软聚合成固定槽位后交由专家处理;但原始形式因槽位混合全部输入Token而破坏因果性,不直接适用于自回归预测。 - \*\*µMoE\*\*(Oldfield等人):通过CP分解或Tensor Ring分解表示专家权重张量,避免单独物化全部专家参数。 \*\*共同局限\*\*:全参与以密集执行为代价——每个Token必须计算所有专家(或槽位)的输出,执行成本随专家数量增长。 ### 2.3 参数合并(Parameter Merging) 参数合并方法通过合并全部专家参数为单一复合专家来实现全参与,但引入了物化成本: - \*\*SMEAR\*\*(Muqeeth等人):按路由权重平均所有专家参数构建复合专家后执行。其实例级(example-level)变体使序列内所有Token共享同一合并专家,丧失Token级适应性且破坏因果性;其Token级变体虽实现逐Token适应,但每个Token都需物化一套完整参数,内存开销巨大。 - \*\*Lory\*\*(Zhong等人):通过因果段级(segment-level)路由降低合并频率,同一段内Token复用相同组合,但牺牲了Token级自适应能力。 - \*\*DSFNet\*\*(Yu等人):执行输入条件化的参数合并,从解耦的场景分支中线性组合参数集。 \*\*与IntBMoE的区别\*\*:上述方法多为输入条件化的在线参数合并,而IntBMoE预构建有限个输入无关的块,通过稀疏块路由实现适应。 ### 2.4 超网络与参数生成(Hypernetworks and Parameter Generation) - \*\*超网络基础\*\*(Ha等人):从条件嵌入生成目标网络参数,但当条件信号依赖于输入时,参数需随输入动态再生。 - \*\*HyperMoE\*\*(Zhao等人):在稀疏MoE中编码未被选中专家的信息,为每个Token生成一个HyperExpert;该路径虽提供Token条件化信息,但未激活的专家仍不参与计算。 - \*\*IntBMoE的定位\*\*:可视为一种\*\*基底约束型超网络\*\*——其条件来自有限且输入无关的码本嵌入,仅生成紧凑的组合系数(而非完整权重矩阵),从而将物化块预先计算并跨路由决策复用,实现有界参数物化。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*IntBMoE\*\*(Integrating Block-Level Conditioning into Expert Composition)架构,将专家组合(composition)与令牌执行(execution)解耦到两个独立的阶段,从而独立控制参与、执行和物化三个维度。其核心在于:\*\*先由完整的专家池构建有限个可复用的多层组合块(blocks),再让每个令牌稀疏地选择和执行其中少数块\*\*。 具体实现包含以下关键技术环节: ### 1. 块级参数合成(Block-Level Parameter Synthesis) IntBMoE 维护一个规模固定的码本(codebook),包含 K 个可学习的块嵌入:
C = cb ∈ R^(d_c)(b=1)^K
对于第 ell 个内部层,模块维护一个由 E 个专家基底(expert bases)组成的共享池:
P^((ell)) = (We^((ell)), b_e^((ell)))(e=1)^E
一个共享的超网络(hypernetwork) h_φ 将每个块嵌入 c_b 映射为两组组合系数(value 与 gate 路径):
q_b = ReLU(LN(A c_b + a))
αb^v = A_v q_b + a_v, quad α_b^g = A_g q_b + a_g
其中 α_b^v, α_b^g ∈ R^E 无需归一化(可为负值且不必和为 1),从而在专家基底的线性张成空间内进行组合。为保持方差稳定,组合时引入缩放因子 1/√E :
W(b,p)^((ell)) = (1) / (√E) ∑(e=1)^E α(b,e)^p We^((ell)), quad b(b,p)^((ell)) = (1) / (√E) ∑(e=1)^E α(b,e)^p b_e^((ell))
对每个内部层 ell=1,dots,L 重复此过程,即可构建出 K 个完整的 L 层组合块。**由于超网络的输入仅是学习得到的块嵌入而非令牌表示,这 K 个块与输入无关,可在推理前预先计算并缓存。** ### 2. 令牌级块路由(Token-Level Block Routing) 每个令牌独立地选择少量组合块执行。对令牌 t 的表示 x_t ,块路由器输出各块的得分并选取 Top- k :
rt = g(block-router)(xt), quad B_t = TopK(r_t, k)
所选块 b ∈ B_t 的路由权重通过 softmax 获得:
π(t,b) = softmax(r_t)_b
3. 块条件化特征过滤(Block-Conditioned Feature Filtering) 在执行选定的块之前,令牌表示会先经过基于块嵌入的特征过滤,使不同块对同一令牌获得不同的初始视图:
m(t,b) = sigmoid(W_f [x_t | c_b] + b_f), quad z(t,b)^((0)) = xt odot m(t,b)
其中 $
· | ·
表示向量拼接, W_f, b_f$ 为跨块共享的可学习参数。 ### 4. 双路径残差门控(Dual-Path Residual Gating, DPRG) 为增强组合块的表达能力,IntBMoE 对每个内部层引入 DPRG,将两条独立组合路径(value 与 gate)通过乘性交互耦合:
v(t,b)^((ell)) = W(b,v)^((ell)) z(t,b)^((ell-1)) + b(b,v)^((ell))
g(t,b)^((ell)) = RMSNorm(W(b,g)^((ell)) z(t,b)^((ell-1)) + b(b,g)^((ell)))
z(t,b)^((ell)) = v(t,b)^((ell)) odot (1 + λ · SiLU(g(t,b)^((ell))))
随后经过层归一化(最后一层除外):
z(t,b)^((ell)) = LN(z(t,b)^((ell))), & ell < L z(t,b)^((ell)), & ell = L
块的最终输出记为 Fb(x_t) = z(t,b)^((L)) 。DPRG 以恒定系数增加参数合成与执行开销,但显著提升了块的非线性表达能力。 ### 5. 输出聚合与共享专家(Output Aggregation and Shared Expert) 选定块的输出按路由概率加权聚合:
yt^(route) = ∑(b ∈ Bt) π(t,b) F_b(x_t)
此外,一个始终激活的共享 SwiGLU 专家 S(·) 负责建模无需路由区分的通用信息:
y_t = y_t^(route) + S(x_t)
6. 复杂度与推理缓存 设每个块含 L 层,单层矩阵参数量为 D , T 为有效令牌数。未缓存时的合成与执行总成本为:
O(KED + TkD)
其中 O(KED) 为一次性构建 K 个块的成本, O(TkD) 为所有令牌稀疏执行的成本。**由于块合成仅依赖于学习到的块嵌入、超网络和专家基底,与输入令牌无关,推理时可预先物化并缓存所有 K 个块的参数,从而将请求时的计算开销降至 O(TkD) 。** ### 解耦效果总结 通过上述设计,IntBMoE 实现了三个量的独立控制: - **全池参与(Full Participation)**:每个组合块在每一层都融合了全部 E 个专家基底,因此每个令牌的输出间接利用了完整专家池的知识; - **稀疏执行(Sparse Execution)**:每个令牌仅执行 k 个选定的块( k ll K ),计算成本不随专家池规模 E 增长; - **有界物化(Bounded Materialization)**:运行时仅需构建和存储由码本大小 K 决定的有限个块,与路由决策或输入数量无关;且缓存后请求时物化成本与 E 完全解耦。 Q4: 论文做了哪些实验? 论文围绕视觉分类、跨域泛化、组件消融、系统效率及在线评测展开了一系列实验,具体可归纳如下: ### 1. ImageNet-1K 主实验 在 ImageNet-1K 上,所有方法均采用八层 DeiT-Tiny 风格骨干网络,从零开始训练。实验将 IntBMoE 与两类基线对比: - **稀疏路由基线**:Switch Transformer、DeepSeek-V3 MoE、ReMoE、V-MoE、Expert Choice、DynMoE、MASS - **密集参与基线**:Soft MoE、SMEAR、Lory、µMoE (CP/TR) 在相近的约 24M 总参数量下,IntBMoE 达到 **73.76% Top-1** 与 **91.48% Top-5** 准确率,相对密集骨干分别提升 7.36 和 3.79 个百分点,且优于所有对比基线(最强基线 SMEAR 为 71.78% Top-1)。未缓存推理成本为 4.063 GFLOPs/图,缓存后降至 3.457 GFLOPs/图。 ### 2. 组件消融实验 在 ImageNet-1K 上对核心组件进行控制变量消融,结果如表所示: | 变体 | Top-1 | Top-5 | |———|———-|———-| | Full (完整模型) | 0.7376 | 0.9148 | | 1-Layer | 0.6878 | 0.8910 | | Fixed λ | 0.7244 | 0.9078 | | w/o Gate | 0.6804 | 0.8831 | | w/o Shared | 0.7332 | 0.9108 | | w/o Filter | 0.7372 | 0.9132 | | Softmax Coeff. | 0.7263 | 0.9072 | 移除门控路径(w/o Gate)造成最大性能下降;将双层块压缩为单层(1-Layer)或约束系数为 Softmax 归一化亦显著降低精度。共享专家与特征过滤则提供稳定但相对较小的增益。 ### 3. 架构超参数敏感性分析 在 ImageNet-1K 上固定默认配置 (K, E, k, L) = (8, 16, 2, 2) ,单独改变某一变量: - **码本大小 K **:从 1 增至 32,精度在 K=8 后趋于饱和 - **专家池大小 E **:从 1 增至 64,精度持续提升但边际收益递减 - **选中块数 k **:从 1 增至 5, k=2 在精度与计算间取得较好平衡 - **块深度 L **: L=2 时达到最高 Top-1 精度 ### 4. 有效全池专家参与验证 为验证全部专家基底均被有效利用而非仅少数主导,实验在 Layer 0、2、4、6 中逐一枚举移除 16 个专家基底之一(共 64 种移除设定),并通过将缩放因子由 1/√E 调整为 1/√E-1 抵消基数减少带来的尺度偏差。 结果显示:**移除任意专家基底均导致 Top-1 精度下降**,平均下降在 Layer 0 为 1.60 个百分点,Layer 2 为 0.49,Layer 4 为 1.17,Layer 6 为 0.78。尽管早期层存在少数主导基底(如移除 Layer 0 的 E15 导致下降 9.15 个百分点),但所有基底均贡献正值,支持“有效全池参与”的结论。 ### 5. 块路由与块特定组合系数分析 - **类条件块分配**:对 ImageNet-1K 的八个代表性类别,统计各块获得的 Token 路由比例相对于均匀分配(12.5%)的偏差。不同类别在同一层偏好不同块,且偏好随深度变化(例如 hen 在 Layer 4 偏好 b4,在 Layer 6 偏好 b0)。 - **组合系数可视化**:对 Layer 0、2、4、6 的值路径与门控路径,绘制 8 个块在 16 个专家基底上的组合系数热力图。块间余弦相似度随深度单调降低:值路径从 0.796(Layer 0)降至 0.010(Layer 6),表明深层块习得了高度分化的专家组合配方。 ### 6. 推理成本与缓存分析 在 ImageNet-1K 设置下,测量单图推理(batch size = 1)时峰值内存与 FLOPs 随专家池大小 E 的变化: - **未缓存**:内存从 54.57 MB( E=1 )增至 627.83 MB( E=128 ),FLOPs 从 3.495 G 增至 8.305 G - **缓存后**:内存恒定为 104.33 MB,FLOPs 恒定为 3.457 G,与 E 无关 当 E ge 16 时,缓存模式在内存与计算上均更优,证明缓存可将请求时成本与专家池规模解耦。 ### 7. 跨域泛化实验 将同一架构迁移至语言建模与序列推荐任务: - **MiniPile(因果语言建模)**:使用 18 层 Llama 风格 Transformer。IntBMoE 的测试 Loss 为 2.6802,PPL 为 14.5878,相对最强基线 µMoE (CP) 的 PPL 降低 2.9%,相对密集骨干降低 12.4%。 - **IntTravel(序列推荐)**:预测下一目的地 POI。IntBMoE 在 HR@1、HR@5、NDCG@5 上均取得最高值。 跨域消融(MiniPile 与 IntTravel)再次确认:移除门控路径与单层块化均造成显著退化,无约束系数优于 Softmax 归一化。 ### 8. 在线 A/B 测试与生产部署 在 AMap 的生成式 POI 推荐系统(首屏地图场景)中进行为期一周的在线 A/B 实验: - 服务规模:约 5000 QPS,服务数亿用户 - 延迟约束:60 ms 预算;缓存后的 IntBMoE 平均延迟 19 ms,P99 延迟 38 ms - 业务指标:UVCTR 相对提升 **2.4%** 实验后 IntBMoE 已全量部署至生产环境。 Q5: 有什么可以进一步探索的点? 基于论文提出的 IntBMoE 框架及其在视觉、语言与推荐任务中的验证,以下几个方向值得进一步探索: ### 1. 理论刻画与表达能力边界 - **组合系数的表征能力**:论文中组合系数 α_b^v, α_b^g 无归一化约束,允许在线性张成空间内任意混合。可进一步分析这种无约束组合相对于凸组合(如 SMEAR)在函数逼近能力上的定量差异,以及 1/√E 方差缩放对梯度流与优化动态的理论影响。 - **DPRG 的非线性增益**:DPRG 通过双路径乘性交互引入非线性,可探索其在深层网络中是否等价于特定形式的核函数扩展,或对专家基底秩(rank)需求的理论下界。 ### 2. 动态与自适应块机制 - **可学习的码本规模 K **:当前 K 为固定超参数。可借鉴 DynMoE 或 MASS 的动态专家池思想,设计基于路由饱和度或梯度信号的动态块增减机制,使模型在训练过程中自动决定最优块数。 - **输入条件化的块嵌入**:论文强调块嵌入与输入无关以保证有界物化。可探索轻量级的**元条件化**(meta-conditioning)策略——例如以句子级或会话级表示微调块嵌入,在不破坏逐 token 稀疏执行的前提下实现上下文相关的块适配。 ### 3. 跨层与跨模态块共享 - **层级块依赖**:当前各 IntBMoE 模块独立维护码本与专家池。可研究跨骨干层(cross-layer)共享或递归生成块参数,利用深层特征与浅层特征的层次关系减少总参数量,或设计层级残差连接以提升梯度传播效率。 - **多模态统一块空间**:在多模态模型中,不同模态(视觉 patch、文本 token)是否可共享同一组专家基底,而通过模态特定的超网络生成不同的块组合系数?这有助于探索 IntBMoE 在统一模态空间下的可迁移性。 ### 4. 更细粒度的稀疏模式 - **子块或子专家路由**:当前以完整块为最小执行单元。可研究块内部分激活(如仅执行某几层,或按维度拆分 gate/value 路径),进一步压缩每 token 的实际计算量。 - **因果感知的路由记忆**:在自回归任务中,当前路由仅依赖当前 token 表示。可探索基于 KV Cache 或前缀感知的动态路由,利用历史路由决策信息减少生成阶段的计算抖动与延迟波动。 ### 5. 推理效率与系统协同优化 - **块级量化与蒸馏**:由于块参数在推理前可缓存,可针对各块进行差异化量化(混合精度)或蒸馏为更窄的学生块,以在保持 UVCTR 等在线指标的同时进一步压缩 19 ms 平均延迟。 - **与推测解码(Speculative Decoding)的结合**:IntBMoE 的稀疏块执行与共享专家路径天然适合作为 draft model 与 target model 的差异化设计,可探索块路由在推测解码中的接受率优化。 ### 6. 可解释性与专家专业化 - **专家基底的可解释分群**:图 4 与图 6 显示不同专家基底贡献不均。可进一步通过干预实验(如强制特定专家基底激活/抑制)分析基底是否自发聚类为低级特征(边缘、纹理)与高级语义(物体部件)等可解释模式。 - **块嵌入的语义几何**:通过探针实验(probing)分析码本嵌入在表示空间中的拓扑结构——例如,语义相近的类别是否激活码本中的邻近嵌入?这为推荐系统中的用户兴趣块(interest block)提供了显式建模的可能。 ### 7. 更大规模与长序列的验证 - **大语言模型扩展**:论文在 MiniPile 上验证了语言建模的有效性。可在数十亿参数规模的 LLM 上评估 IntBMoE 的扩展律(scaling law),特别是专家池规模 E 增至数百时,缓存策略是否仍能维持计算成本与模型质量的帕累托最优。 - **长序列与上下文压缩**:在超长文档或长序列推荐中,块路由的固定计算模式可能面临上下文漂移。可探索块激活频率与注意力模式的联合分析,设计长序列感知的块缓存淘汰策略。 ### 8. 与现有稀疏 MoE 技术的融合 - **细粒度专家分割**:DeepSeekMoE 通过将专家细分为更小的单元提升专业化。可将 IntBMoE 的块级组合与细粒度专家基底结合,研究在更细粒度基底上的组合系数稀疏性,进一步降低 O(KED) 的合成开销。 - **负载均衡与路由正则化**:当前块路由未显式引入负载均衡损失。可借鉴 Expert Choice 或 ReMoE 中的容量控制与正则化方法,避免少数块成为热点,提升分布式 serving 场景下的硬件效率。 Q6: 总结一下论文的主要内容 该论文提出 **IntBMoE**,一种通过块级条件化(block-level conditioning)解耦专家参与、计算执行与参数物化的混合专家架构,在保持稀疏执行与有界内存开销的同时,使每个输入令牌能够利用完整的专家池知识。 ### 1. 核心问题 现有混合专家(MoE)设计无法独立控制以下三个维度,导致固有的权衡困境: - **参与(Participation)**:单个令牌的输出受多少专家知识影响; - **执行(Execution)**:每个令牌实际需要前向计算多少专家,决定计算成本; - **物化(Materialization)**:运行时需要构建与存储多少套专家规模参数,决定内存成本。 稀疏路由限制了参与;密集输出混合要求执行全部专家;参数合并虽单次执行,但物化成本随路由单元数无界增长。论文旨在打破三者的耦合,实现**全池参与、稀疏执行、有界物化**。 ### 2. 方法:IntBMoE IntBMoE 将专家组合与令牌执行分离为两个阶段: #### 2.1 块级参数合成(Block-Level Parameter Synthesis) 每个模块维护一个包含 K 个可学习嵌入的码本:
C = cb ∈ R^(d_c)(b=1)^K
在内部层 ell ,模块共享一个由 E 个专家基底组成的池:
P^((ell)) = (We^((ell)), b_e^((ell)))(e=1)^E
一个共享超网络 hφ 将每个块嵌入 c_b 映射为值路径与门控路径的组合系数 α_b^v, α_b^g ∈ R^E 。这些系数无归一化约束,以方差保持缩放 1/√E 线性组合该层全部专家基底:
W(b,p)^((ell)) = (1) / (√E) ∑(e=1)^E α(b,e)^p W_e^((ell)), quad p ∈ v, g
重复此过程跨越 L 个内部层,构建出 K 个可复用的 L 层组合块。**由于合成仅依赖学习到的块嵌入而非输入令牌,这些块可在推理前预先计算并缓存。** #### 2.2 令牌级稀疏路由(Token-Level Sparse Routing) 对每个令牌 t ,一个轻量路由器独立输出 K 个块的得分,选择 Top- k :
rt = g(block-router)(xt), quad B_t = TopK(r_t, k)
路由权重为 π(t,b) = softmax(r_t)_b 。 #### 2.3 双路径残差门控(DPRG) 为提升表达能力,每个内部层将两条独立组合路径通过乘性残差耦合:
v(t,b)^((ell)) = W(b,v)^((ell)) z(t,b)^((ell-1)) + b(b,v)^((ell))
g(t,b)^((ell)) = RMSNorm(W(b,g)^((ell)) z(t,b)^((ell-1)) + b(b,g)^((ell)))
z(t,b)^((ell)) = v(t,b)^((ell)) odot (1 + λ · SiLU(g_(t,b)^((ell))))
其中 λ 为可学习残差尺度。DPRG 以恒定因子开销引入非线性,增强块内专家交互。 #### 2.4 块条件化特征过滤与输出聚合 进入块前,令牌表示经块嵌入条件化的特征过滤:
m(t,b) = sigmoid(W_f [x_t | c_b] + b_f), quad z(t,b)^((0)) = xt odot m(t,b)
最终输出为选中块的加权和,并叠加一个始终激活的共享 SwiGLU 专家 S(xt) :
y_t = ∑(b ∈ Bt) π(t,b) F_b(x_t) + S(x_t)
3. 关键性质 - **全池参与**:每个组合块在每一层都融合了全部 E 个专家基底,确保完整专家池的知识可被利用; - **稀疏执行**:每令牌仅执行 k 个块,计算成本不随专家池规模 E 增长; - **有界物化**:运行时仅物化由码本大小 K 决定的有限个块;缓存后请求时成本与 E 无关,为 O(TkD) 。 ### 4. 实验结果 论文在图像分类、语言建模与序列推荐上进行了系统验证: - **ImageNet-1K**:IntBMoE 达到 **73.76% Top-1** 与 **91.48% Top-5** 准确率,超过所有稀疏与密集参与基线;消融实验表明 DPRG 门控路径与双层块结构贡献最大。 - **有效全池参与验证**:逐一枚除任何专家基底均导致精度下降,证实全部专家均被有效利用。 - **MiniPile(语言建模)**:困惑度(PPL)降至 **14.5878**,相对最强基线降低 2.9%。 - **IntTravel(序列推荐)**:在 HR@1、HR@5、NDCG@5 上均取得最优。 - **推理效率**:缓存后单图推理成本恒定为 3.457 GFLOPs 与 104.33 MB,不随 E 增加而上升。 ### 5. 在线部署 IntBMoE 已全量部署于 AMap 的生成式 POI 推荐系统,在 **60 ms** 延迟预算与约 5000 QPS 的流量下,平均延迟 19 ms(P99 38 ms),在线 A/B 测试取得 **UVCTR 相对提升 2.4%**。 综上,IntBMoE 通过分离可复用块的合成与令牌级稀疏执行,首次在 MoE 架构中实现了参与、执行与物化的独立控制,并在视觉、语言与推荐任务及大规模在线系统中验证了其有效性与实用性。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Ran Cheng,Longfei Xu,Zheng Liu,Kaikui Liu,Xiangxiang Chu
Categories:
PDF URL: https://arxiv.org/pdf/2609.21346.pdf
Arxiv URL: https://arxiv.org/abs/2609.21346
Arxiv ID: 2609.21346
CoolPaper URL: https://papers.cool/arxiv/2609.21346
Published: 2026-09-22T01:51:40.398Z
Updated: 2026-09-22T01:51:40.398Z
6. OmniVChat: Synthesizing, Benchmarking, and Training for Native Audio-Visual Dialogue
Abstract:We define OmniVChat (Omni Video Chat) as the task of native audio-visual dialogue between a user and an omni model. In OmniVChat, omni models directly and simultaneously receive audio and video from a user and return text. The user’s query is embedded in the audio and video, without a separate text question, external captioning, or speech recognition. Direct audio-visual input reduces external latency and computation while preserving perceptual cues. However, research on OmniVChat faces two constraints: data availability and evaluation. Recordings of people using their own devices are scarce. Furthermore, a good reply often needs to account for the user’s surroundings, facial expressions, and nearby objects, and such responses can be expressed in many different ways, making keyword matching unreliable for evaluating reply quality. Recent progress in agent systems and video generation makes generation for comprehension viable, which means using synthesized dialogues for training and evaluation. Therefore, we present OmniVChat-Studio, a multi-agent data engine for synthesizing single- and multi-turn audio-visual dialogues. We use synthesized dialogues to build OmniVChat-Bench, an evaluation benchmark that evaluates omni models’ basic dialogue abilities across five ability categories. We also present OmniVChat-RL, a reinforcement learning reward design that jointly targets reply correctness, efficiency, and style in OmniVChat. Training Qwen3-Omni-Instruct with OmniVChat-RL on synthesized dialogues improves its performance on both OmniVChat-Bench and the human-recorded OmniVChat-Bench-Human. These gains validate the reward design and show transfer to real-world dialogues in training and evaluation.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文针对\*\*原生音频-视觉对话(OmniVChat)\*\*任务中的核心瓶颈展开研究,主要试图解决以下两方面问题: ### 1. 数据稀缺性与多样性不足 - \*\*问题\*\*:真实世界中,人们使用自有设备进行原生音频-视觉对话的公开录音极为稀缺。同时,噪声、相机运动、设备姿态等因素造成了输入条件的“长尾分布”,难以通过少量真实数据覆盖。 - \*\*解决方案\*\*:论文提出 \*\*OmniVChat-Studio\*\*,一个可控且可扩展的多智能体数据引擎,能够从文本语料库大规模合成单轮与多轮音频-视觉对话数据,并配套生成参考回复与分层评分标准(rubric)。 ### 2. 回复质量评估困难 - \*\*问题\*\*:在复杂场景下,高质量回复需综合理解用户的周围环境、面部表情、情绪及附近物体等丰富的多模态上下文。由于此类信息可以用多种不同方式表达,传统的基于关键词匹配或规则化的评估方法可靠性差,难以准确衡量模型回复质量。 - \*\*解决方案\*\*:论文构建 \*\*OmniVChat-Bench\*\*,包含 2,800 个合成实例与 360 个人工录制实例,覆盖 5 大能力类别与 17 个子类别。每个实例配备分层评分标准(Tiered Rubric),由大语言模型逐条判定回复是否满足标准,从而实现语义层面的细粒度评估。 ### 3. 训练目标与对话质量的联合优化 - \*\*问题\*\*:如何在缺乏大规模人工标注的情况下,同时提升模型回复的\*\*正确性\*\*、\*\*效率\*\*(简洁性)与\*\*风格\*\*(自然度)。 - \*\*解决方案\*\*:论文提出 \*\*OmniVChat-RL\*\*,一种强化学习奖励设计,将评分标准正确性、回复效率(单位长度得分)和风格规范统一为奖励信号。通过在合成数据上进行训练,论文验证了该方案在合成基准(OmniVChat-Bench)和人工录制基准(OmniVChat-Bench-Human)上均能带来一致的性能提升,并显著缩短回复长度、提升风格得分。 简而言之,该论文通过\*\*可控合成\*\*、\*\*语义化评估\*\*与\*\*多目标强化学习\*\*的闭环设计,系统性地解决了原生音频-视觉对话领域在数据、评估与训练上的关键难题。 Q2: 有哪些相关研究? 根据论文附录 B 及相关章节的综述,相关研究可归纳为以下五个主要方向: --- ### 1. 全模态模型(Omni Models) 这类研究致力于在单一系统内融合多种输入与输出模态(文本、音频、图像、视频),实现端到端的原生多模态理解与生成。 | 代表工作 | 核心特点 | |---|---| | \*\*GPT-4o\*\* (OpenAI, 2024) | 支持文本、音频、图像、视频输入,平均音频响应延迟 320 毫秒,采用原生处理架构 | | \*\*Gemini Live API\*\* (Google, 2026c) | 处理连续的音频、图像与文本流,生成口语化回复 | | \*\*Qwen3-Omni\*\* (Xu et al., 2025b) | 基于混合专家(MoE)架构,Thinker 生成文本,Talker 生成音频 token | | \*\*VITA-1.5\*\* (Fu et al., 2026) | 渐进式整合视觉与语音,无需独立的语音识别或合成模块 | | \*\*Baichuan-Omni-1.5\*\* (Li et al., 2025) | 使用音频分词器,保留语义与声学信息 | | \*\*MiniCPM-o 4.5\*\* (Cui et al., 2026) | 在同一时间线上对齐多模态输入与输出,支持同时听与说 | | \*\*SeedRealtime\*\* (ByteDance Seed, 2026a) | 统一音频、视频与文本,支持全双工实时多模态对话 | | \*\*Gemma 4\*\* (Google, 2026b) | 去除模态特定编码器,将视觉与音频表示直接送入语言主干 | | \*\*Video-SALMONN 2\*\* (Tang et al., 2025) | 应用多轮直接偏好优化(DPO),针对音频-视觉描述任务 | | \*\*Omni-MLLM Survey\*\* (Jiang et al., 2025) | 综述全模态模型的设计、训练、评估与应用 | --- ### 2. 音频-视觉理解与对话基准(Benchmarks) 现有基准测试主要涵盖联合感知、流式理解与对话能力,评估模型对音频-视觉信息的整合与推理能力。 - \*\*静态联合理解\*\*:OmniBench (Li et al., 2026b)、WorldSense (Hong et al., 2026)、AV-Odyssey (Gong et al., 2024)、Daily-Omni (Zhou et al., 2025) - \*\*长视频与事件理解\*\*:OmniVideoBench (Li et al., 2026a)、LongVALE (Geng et al., 2025)、OmniEval (Zhang et al., 2025) - \*\*幻觉检测\*\*:AVHBench (Sung-Bin et al., 2025) - \*\*流式与在线视频\*\*:StreamingBench (Lin et al., 2026)、OVO-Bench (Niu et al., 2025)、RIVER (Shi et al., 2026b)、OmniMMI (Wang et al., 2025)、OmniPro (Zhao et al., 2026) - \*\*交互式与对话基准\*\*:OmniInteract (Lu et al., 2026)、SocialOmni (Xie et al., 2026)、Interactive Video Dataset (Pourreza et al., 2026)、Full-Duplex-Bench (Lin et al., 2025)、Talking Turns (Arora et al., 2025) --- ### 3. 联合音频-视觉生成(Joint Audio-Visual Generation) 近期系统能够从多模态条件(文本、图像等)联合生成同步的音频与视频内容,为“以生成促理解”提供数据基础。 | 系统 | 能力 | |---|---| | \*\*Sora 2\*\* (OpenAI, 2025) | 生成带同步对话与音效的视频 | | \*\*Veo 3.1\*\* (Google, 2026d) | 从文本提示与参考图像生成带原生音频的视频 | | \*\*Seedance 1.5 pro / 2.0\*\* (Seedance Team et al., 2025, 2026) | 双分支扩散 Transformer,支持原生联合音视频生成 | | \*\*Kling VIDEO 3.0\*\* (Kling AI, 2026) | 原生音视频输出,支持多镜头故事板控制 | | \*\*Gemini Omni Flash\*\* (Google DeepMind, 2026d) | 输入文本/图像/音频/视频,输出高分辨率带音视频内容 | | \*\*MiniMax H3\*\* (MiniMax, 2026) | 生成原生立体声音频与最高 2K 分辨率视频 | | \*\*Wan 3.0\*\* (Wan AI, 2026) | 从文本或图像生成最长 30 秒的原生音视频 | --- ### 4. 智能体驱动的视频与音频生成(Agentic Generation) 通过多智能体协作(规划、生成、评估、修订)实现复杂音视频内容的可控合成。 - \*\*动画与故事生成\*\*:AniMaker (Shi et al., 2025)、PersonaVlog (Hou et al., 2025)、Hollywood Town (Wei et al., 2025)、MAViS (Wang et al., 2026)、ViMax (Huang et al., 2026)、FilmWorld (Zuo et al., 2026) - \*\*音频场景生成\*\*:AudioGenie (Rong et al., 2025)、Audio-Oscar (Duan et al., 2026) --- ### 5. 强化学习算法(RL Algorithms) 论文采用的训练框架基于近期 RL 进展,特别是针对大语言模型与全模态模型的策略优化方法。 | 方法 | 核心贡献 | |---|---| | \*\*PPO\*\* (Schulman et al., 2017) | 带裁剪的替代目标,支持小批量多次更新 | | \*\*GRPO\*\* (Shao et al., 2024) | 无需独立价值模型,使用同组响应的均值奖励作为基线 | | \*\*GSPO\*\* (Zheng et al., 2025) | 序列似然重要性比与序列级裁剪,稳定混合专家模型训练 | | \*\*DeepSeek-R1-Zero\*\* (Guo et al., 2025) | 纯 RL 训练,无需人工标注推理轨迹即可涌现推理行为 | | \*\*DAPO\*\* (Yu et al., 2026) | 非对称裁剪边界,对无学习信号的组进行重采样 | | \*\*Dr. GRPO\*\* (Liu et al., 2025a) | 消除与响应长度和难度相关的偏差 | | \*\*Rubrics as Rewards\*\* (Gunjal et al., 2026) | 使用实例特定的评分标准构建奖励,适用于非可验证领域 | --- 这些相关研究共同构成了 OmniVChat 在\*\*模型架构\*\*、\*\*数据生成\*\*、\*\*评估基准\*\*与\*\*训练算法\*\*方面的技术背景。论文正是在此基础上,通过 OmniVChat-Studio(合成引擎)、OmniVChat-Bench(评估基准)与 OmniVChat-RL(强化学习奖励设计)填补了原生音频-视觉对话在数据、评估与训练上的空白。 Q3: 论文如何解决这个问题? 论文通过构建“\*\*可控合成—语义评估—强化训练\*\*”的闭环框架,系统性地解决 OmniVChat 在数据、评估与训练上的瓶颈。具体而言,该框架由三个核心组件构成: --- ## 1. OmniVChat-Studio:多智能体数据合成引擎 针对真实世界音频-视觉对话录音稀缺、长尾输入条件难以覆盖的问题,论文提出 OmniVChat-Studio,一个基于多智能体协作的可控数据引擎,能够直接从文本语料库大规模合成原生音频-视觉对话。 ### 核心架构与四智能体分工 引擎由四个分工明确的智能体组成: - \*\*Director\*\*:负责所有文本层面的输入输出,包括场景规划、脚本撰写、回复与评分标准(Rubric)生成; - \*\*Renderer\*\*:将经审核的渲染提示与媒体引用转换为同步的音视频片段; - \*\*Reviewer\*\*:检视渲染后的音频与视频,撰写描述与质量报告,并在必要时回答聚焦问题以补充证据; - \*\*Validator\*\*:执行确定性规则检查,对脚本或对话记录进行合规性验证,返回通过或违规列表。 ### 双路径合成流程 引擎包含两个子系统: - \*\*单轮子系统\*\*:合成独立的单轮对话,涵盖属性采样、语料抽取、场景描述、计划制定、脚本生成、验证、视频渲染、视频审查、回复生成与回复审查等 14 个模块; - \*\*多轮子系统\*\*:处理跨轮依赖,后续轮次可引用前序已接受的音视频片段或终帧作为历史证据,包含联合计划、逐轮提示生成、媒体链接验证与最终回复整合等模块。 ### 关键设计特点 - \*\*固定与灵活模块解耦\*\*:Fixed 模块(如验证、渲染)跨子类别完全复用,Flexible 模块仅需为新子类别设计特定提示,从而实现高扩展性; - \*\*证据驱动的回复生成\*\*:回复计划(Reply Plan)仅基于 Renderer 实际生成且经 Reviewer 确认的音视频证据,而非原始脚本意图,确保回复严格 grounded 于可感知的输入内容; - \*\*自动化 Rubric 生成\*\*:在生成参考回复的同时,自动构建分层评分标准,无需人工逐条编写。 --- ## 2. OmniVChat-Bench:基于 Rubric 的语义评估基准 针对复杂多模态场景下回复质量难以通过关键词匹配可靠评估的问题,论文构建 OmniVChat-Bench,通过分层语义标准与模型评判实现细粒度、可解释的评估。 ### 基准构成 - \*\*规模与分布\*\*:共 2,800 个合成实例(2,550 单轮 + 250 多轮)及 360 个人工录制实例,覆盖 5 大能力类别与 17 个子类别,跨越 22 个场景领域; - \*\*输入输出形式\*\*:每个实例包含渲染的音视频片段、参考回复,以及一个为该实例定制的分层 Rubric。 ### 分层门控评分机制 Rubric 采用层级化(Tiered)与门控(Gated)结构: - \*\*Tier 0(语言门控)\*\*:检查回复是否使用用户语言;该层不贡献分数,但未通过则整题得分为零; - \*\*Tier 1~T\*\*:后续层级的标准仅在前面所有层级的全部标准均被满足时,才能获得分数。 单实例评分函数定义为:
r(y) = ∑(t=1)^(T) |K_t ∩ H(y)| prod(s=0)^(t-1) 1[Ks ⊂eq H(y)]∑(t=1)^(T) |K_t|
其中, K_t 表示第 t 层的标准集合, H(y) 表示评判器判定被回复 y 满足的标准集合,$1
·
为指示函数。该公式确保层级间的严格依赖关系,且输出满足 r(y) ∈
0, 1
$。 ### 聚合评估指标 为避免子类别样本量不均造成的偏差,论文采用 **Subcategory Mean** 作为主要汇报指标:
SubcategoryMean(E) = (1) / (C) ∑_(c=1)^(C) PooledMean(E_c)
即在每个子类别内先计算平均分,再对所有 C=17 个子类别等权重平均。 —- ## 3. OmniVChat-RL:多目标强化学习奖励设计 针对如何在缺乏大规模人工标注的情况下,同时优化回复的正确性、简洁性与风格自然度,论文提出 OmniVChat-RL,一种面向 OmniVChat 的强化学习奖励方案。 ### 训练设置 - **数据**:在 5,600 条合成对话(OmniVChat-Bench-Train)上训练,另设 560 条开发集用于选点; - **算法**:采用 GSPO(Group Sequence Policy Optimization),以 Qwen3-Omni-Instruct 的 Thinker 模块为策略基座,使用 LoRA(rank-64)进行高效微调; - **推理**:每个训练输入 x 采样 N 个回复构成组 G(x) ,组内均值作为基线计算优势 A_i = R(y_i) - μ_G 。 ### 复合奖励函数 总训练奖励由四项加权组成:
R(y) = r(y) + λ(fmt) f(y) + λ(eff) e(y) + λ_(sty) s(y)
各项定义如下: | 组件 | 符号 | 说明 | |—-|—-|—-| | 正确性 | r(y) | 直接使用上述 Rubric 评分函数,衡量回复内容是否正确且完整 Q4: 论文做了哪些实验? 论文围绕 OmniVChat 任务,在**合成数据训练**、**基准评估**、**模型对比**、**消融分析**与**跨域迁移验证**五个维度展开实验,具体如下。 —- ### 1. OmniVChat-RL 主训练实验 以 Qwen3-Omni-Instruct 的 Thinker 模块为基座,在 5,600 条合成对话(OmniVChat-Bench-Train)上进行低秩适配(LoRA, rank-64)强化学习训练,共 1,000 个迭代步,每 20 步保存一次检查点。 - **训练算法**:采用 GSPO(Group Sequence Policy Optimization),每组采样 N=4 个回复,以组内均值奖励为基线计算优势。 - **检查点选择**:依据 560 条开发集上的 Subcategory Mean 选取最优检查点(step 940)。 - **评估目标**:在 held-out 的 OmniVChat-Bench(2,800 条合成实例)与 OmniVChat-Bench-Human(360 条人工录制实例)上验证性能迁移。 关键结果: - 合成基准的 Subcategory Mean 从基座的 0.465 提升至 0.652; - 人工录制基准从 0.402 提升至 0.632; - 平均回复长度从 79 词降至 36 词,Reply Efficiency(每千词得分)从 5.75 升至 18.38,Style 得分从 0.710 升至 0.992。 —- ### 2. 与现有全模态系统的对比实验 在统一系统提示下,对 12 个已发布系统与 OmniVChat-RL 进行横向对比(见 Table 1),覆盖闭源与开源模型: - **闭源模型**:Gemini-3.5/3.6/3.7-Flash、Gemini-3.1-Pro、Qwen3.5-Omni-Plus、Doubao Seed 2.0 Lite; - **开源模型**:Qwen3-Omni-Instruct / Thinking、Qwen2.5-Omni-7B / 3B、JoyAI-VL-Interaction(级联 ASR 方案)、MiniCPM-o-4.5。 评估维度包括: - 五大能力类别(AH、ER、MSA、MEA、DSLP)的平均分; - 单轮(Single)与多轮(Multi)平均分; - 总体 Subcategory Mean; - 人工录制集(Human)表现; - Reply Efficiency(RE)与 Style 得分。 实验发现:OmniVChat-RL 在 RE(18.38)与 Style(0.992)上领先所有对比系统,同时保持有竞争力的 Rubric 得分(Mean 0.652, Human 0.632)。 —- ### 3. 奖励设计消融实验 为验证 OmniVChat-RL 中各奖励项的作用,执行两项消融: - **移除效率奖励(No Efficiency Term)**:保留 Rubric、Format 与 Style 奖励。结果 Mean 提升至 0.697,Human 提升至 0.691,但平均回复长度膨胀至 99 词,RE 骤降至 7.12,表明效率项是压缩回复长度的关键约束。 - **移除风格奖励(No Style Term)**:保留 Rubric、Format 与 Efficiency 奖励。结果 Mean 为 0.661,Human 为 0.632,但 Style 从 0.992 降至 0.788,表明风格项对维持自然对话语气不可或缺。 —- ### 4. 单轮与多轮能力对比实验 将五个单轮子类别与其对应的多轮扩展进行配对比较(见 Table 3),对比 Gemini-3.7-Flash 与 OmniVChat-RL: | 对比维度 | Gemini-3.7-Flash | OmniVChat-RL | |—-|—-|—-| | 单轮到多轮平均下降幅度 | −0.114 | −0.026 | | 最大下降子类别 | MRR (−0.202) | MTIC (−0.107) | 实验表明,OmniVChat-RL 在多轮依赖场景下的性能衰减显著小于 Gemini-3.7-Flash,尤其在连接状态检查与说话人切换任务上保持相对稳定。 —- ### 5. 子类别级学习曲线分析 在 1,000 个训练步中,每 20 步记录 17 个子类别在 held-out 集上的 Rubric 得分(见 Figure 7)。分析显示: - 合成集与人工录制集在 ICC、UCR、UPC、AOR、FGC、PLA 等子类别上呈现同步上升趋势; - DR 与 SPSD 在两类数据上仍存在差距; - 五个多轮子类别(MDCC、MVMS、MRR、MIST、MTIC)中,MRR、MVMS 与 MTIC 随训练持续改善,而 MIST 与 MDCC 较为平稳。 —- ### 6. 评判器一致性与评分可靠性分析 使用 6 个不同的大语言模型(GPT-5.6 系列与 Qwen3 系列)作为独立评判器,对 Gemini-3.7-Flash 的 2,773 条固定回复进行评分(见 Appendix D.3 / Table 2): - Pooled 得分范围:0.643–0.678(标准差 0.014); - 准则级别一致性:87.8%–96.5%; - Cohen’s κ:0.532–0.845; - 子类别难度解释 95.7% 的方差,评判器严格度仅解释 1.1%,说明评分标准具有较好的模型间迁移稳定性。 —- ### 7. 合成到真实的迁移验证 通过 OmniVChat-Bench-Human(360 条中文人工录制对话)专门测试从合成训练数据到真实场景的迁移能力: - 训练过程**完全不使用**人工录制数据; - OmniVChat-RL 在该集上从基座的 0.402 提升至 0.632,与中文合成子集的提升幅度(0.437→0.634)高度一致; - 跨验证集相关性分析(Appendix E.5)显示,在 100-step 块级别上,开发集、合成基准与人工基准的改进趋势相关系数达 0.90 以上,间接支持两类数据分布的对齐。 —- ### 8. 训练动态与长度-效率演变 Figure 4 记录了训练全周期的多项指标: - **奖励项**:Rubric 奖励从 0.308 升至 0.629,Style 从 0.750 升至 0.992; - **原始效率**:每千词 Rubric 得分从 3.37 升至 17.18; - **回复长度**:均值从 91.5 词降至 36.6 词,在 step 50 附近出现短暂峰值(约 127 词),随后迅速收敛至更短输出。 这些实验共同验证了:**基于合成数据的多目标强化学习可以在不接触真实录音的前提下,实现向真实世界音频-视觉对话的有效迁移,同时显著提升回复的简洁性与风格自然度。** Q5: 有什么可以进一步探索的点? 基于论文的实验设计、讨论与附录分析,以下方向值得进一步探索: —- ### 1. 实时全双工与流式交互能力 当前 OmniVChat-Bench-Human 仅包含单轮人工录音,且明确未测试**实时打断(live interruption)**、**全双工对话(full-duplex dialogue)**与流式输入下的延迟表现。未来需构建包含语音重叠、轮次切换、停顿处理等动态交互场景的基准,并训练模型在生成回复的同时持续监听与感知视觉流。 ### 2. 多轮对话的规模与复杂性扩展 现有 250 个多轮实例仅覆盖 5 个扩展子类别,每类 50 条样本。未来可探索: - **更长历史依赖**:构建跨分钟级、包含多轮媒体引用的复杂对话; - **更细粒度的状态跟踪**:如对象持久性、空间关系随时间的演变、用户意图的动态更新; - **媒体引用预算的优化**:当前多轮子系统对历史片段的引用存在固定预算限制,需研究如何自适应选择关键历史帧或音频片段。 ### 3. 跨语言与跨文化迁移验证 人工录制数据目前**仅有中文**,而合成数据为中英双语。尽管论文观察到了向中文真实对话的迁移,但合成数据在其他语言(如西班牙语、阿拉伯语)及不同文化场景下的有效性尚未验证。未来需扩展多语言录制数据,并研究跨语言合成-真实迁移机制。 ### 4. 评估范式的鲁棒性与人类对齐 - **LLM 评判器的偏差**:附录 D.3 显示不同评判模型的严格度存在系统差异(pooled spread 达 0.034),且风格评判中的二元阈值(0/1)可能过于粗糙。未来可探索**连续型风格评分**、多评判器集成校准,以及引入人类评估员建立 gold-standard 对齐。 - **测量方差控制**:附录 E.5 指出单检查点级别的变化相关性较低,提示短期评估波动较大。需开发更稳定的评估协议或降低方差的采样策略。 ### 5. 奖励函数与训练目标的精细化 - **风格奖励的连续化**:当前 s(y) 为严格的“全有或全无”二元奖励。未来可尝试基于部分满足程度的连续风格得分,或引入对比学习细粒度区分自然度层级。 - **效率-内容权衡**:效率奖励 e(y) 虽显著压缩了回复长度,但附录 E.4 指出存在过度压缩为“电报式省略语法(telegraphic style)”的风险。需设计保持语法完整性前提下的长度控制机制,或引入可读性惩罚项。 - **端到端音频生成优化**:当前 OmniVChat-RL 仅针对文本回复(Thinker)进行优化。未来可将奖励设计扩展至**音频输出(Talker)**,联合优化回复内容的正确性与语音合成的自然度、韵律一致性。 ### 6. 合成数据分布与真实场景的直接对齐 论文通过性能相关性**间接推断**合成与真实数据分布对齐。未来可: - 采用分布距离度量(如 Maximum Mean Discrepancy)直接量化合成引擎与真实录音的模态分布差异; - 引入领域自适应(Domain Adaptation)或对抗性去偏方法,系统性缩小合成-真实差距,而非依赖工程化的后处理与人工检查。 ### 7. 极端长尾条件与复杂社交场景 当前合成覆盖 22 个场景领域,但如附录 C.2.1 所述,罕见属性组合仍可能因采样成本而被稀释。未来可针对以下场景扩展: - **极端感知条件**:强混响、极低光照、快速相机运动、遮挡严重的环境; - **复杂社交交互**:多人同时发言、重叠语音(cocktail party 场景)、非正式群体对话中的隐含规范与角色动态。 ### 8. 模型架构与训练范式的深化 - **全参数微调 vs. LoRA**:当前仅对 Thinker 应用 rank-64 的 LoRA 适配器。全参数微调或更深层的视觉-音频编码器联合训练可能带来更大增益,但需权衡计算成本与灾难性遗忘风险。 - **混合人类反馈(RLHF)**:当前奖励完全依赖合成 Rubric。未来可探索小规模人类偏好数据与大规模合成 Rubric 奖励的混合 RLHF 框架,特别是在风格与效率的微妙权衡上。 ### 9. 长视频时序推理与记忆机制 现有片段长度约 10 秒,且视频采样率为 2 FPS、至多 16 帧。对于需要理解**分钟级视频流**、进行事件回溯与前瞻规划的 OmniVChat 任务,未来需设计支持长时序上下文的高效记忆架构,并相应扩展合成引擎以生成长视频对话数据。 Q6: 总结一下论文的主要内容 本文定义并系统研究了 **OmniVChat(Omni Video Chat)**——即全模态模型与用户之间进行原生音频-视觉对话的任务。在该设定下,模型直接同时接收音频与视频流并生成文本回复,用户的查询嵌入在音视频之中,无需单独的文本问题或外部语音识别(ASR)模块。针对该任务面临的数据稀缺、评估困难与训练目标复杂三大挑战,论文提出了一套完整的“合成-评估-训练”闭环方案,其核心贡献可概括如下: —- ### 1. OmniVChat-Studio:可控多智能体数据合成引擎 为缓解真实世界音频-视觉对话录音稀缺的瓶颈,论文提出 **OmniVChat-Studio**,一个基于四智能体协作(Director、Renderer、Reviewer、Validator)的可扩展数据引擎。该引擎以文本语料为输入,能够大规模合成单轮与多轮原生音频-视觉对话,并自动生成参考回复与分层评分标准(Rubric)。其关键设计包括: - **固定-灵活模块解耦**:核心流程(如渲染、验证)跨子类别复用,仅需为新子类别定制特定提示; - **证据驱动的回复生成**:回复严格基于 Renderer 实际生成的音视频证据,而非原始脚本意图; - **自动化 Rubric 生成**:为每个实例构建包含语言门控与递进标准的多层评分细则。 —- ### 2. OmniVChat-Bench:语义化评估基准 针对复杂多模态场景中关键词匹配评估不可靠的问题,论文构建了 **OmniVChat-Bench**,包含 2,800 个合成实例与 360 个人工录制实例,覆盖 5 大能力类别(如对话状态感知、多模态实体对齐、反幻觉、情绪识别等)与 17 个子类别。评估采用**分层门控 Rubric**:
r(y) = ∑(t=1)^(T) |K_t ∩ H(y)| prod(s=0)^(t-1) 1[Ks ⊂eq H(y)]∑(t=1)^(T) |K_t|
其中 Tier 0 为语言门控(未通过则整题得分为零),后续层级的标准仅在前面所有层级均被满足时才计分。该机制通过大语言模型(如 qwen3.7-max)判定每条标准的满足情况,实现了细粒度、可解释的语义评估。 —- ### 3. OmniVChat-RL:多目标强化学习奖励设计 为在缺乏大规模人工标注的情况下同时优化回复的正确性、简洁性与风格自然度,论文提出 **OmniVChat-RL**。其复合奖励函数为:
R(y) = r(y) + λ(fmt) f(y) + λ(eff) e(y) + λ_(sty) s(y)
其中: - r(y) 为 Rubric 正确性得分; - f(y) 为格式合规性(训练专用); - e(y) 为组内归一化的回复效率奖励(基于每千词 Rubric 得分),无需预设固定长度目标; - s(y) 为风格奖励(由评判器判定是否满足七项自然对话标准)。 训练采用 GSPO(Group Sequence Policy Optimization)与 LoRA(rank-64)在 5,600 条合成对话上进行,基座模型为 Qwen3-Omni-Instruct 的 Thinker 模块。 —- ### 4. 主要实验结果 论文通过多组实验验证了上述方案的有效性: | 指标 | 基座模型 | OmniVChat-RL | 变化 | |—-|—-|—-|—-| | 合成基准 Subcategory Mean | 0.465 | **0.652** | +40.2% | | 人工录制基准 Mean | 0.402 | **0.632** | +57.2% | | 平均回复长度 | 79 词 | **36 词** | −54.4% | | Reply Efficiency | 5.75 | **18.38** | +219.7% | | Style 得分 | 0.710 | **0.992** | +39.7% | 关键发现包括: - 与 Gemini-3.5/3.6/3.7-Flash、Qwen3.5-Omni-Plus 等 12 个现有系统相比,OmniVChat-RL 在效率与自然度上达到最优,同时保持有竞争力的内容正确性; - 消融实验表明:移除效率奖励会导致回复长度膨胀至 99 词且效率骤降;移除风格奖励则导致自然度显著下降; - 人工录制数据上的一致提升验证了**合成到真实的有效迁移**,表明合成数据分布与真实对话分布良好对齐。 —- ### 5. 结论 本文通过 OmniVChat-Studio 实现了可控的音频-视觉对话合成,通过 OmniVChat-Bench 建立了语义化、细粒度的评估协议,并通过 OmniVChat-RL 实现了正确性、效率与风格的联合优化。实验结果表明,仅依靠合成数据进行强化学习即可显著提升模型在真实世界音频-视觉对话中的表现,为 OmniVChat 任务的数据供给、质量评估与模型训练提供了一套完整的可扩展框架。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Haolin He,Yunfei Chu,Qi Chen,Wen Huang,Yuan Feng,Muzhi Zhu,Zheqi Dai,Haoning Xu,Dongchao Yang,Chunyat Wu,Zining Liang,Zhengxi Liu,Xiquan Li,Xie Chen,Xize Cheng,Qize Yang,Jin Xu,Qiuqiang Kong
Categories:
PDF URL: https://arxiv.org/pdf/2609.21465.pdf
Arxiv URL: https://arxiv.org/abs/2609.21465
Arxiv ID: 2609.21465
CoolPaper URL: https://papers.cool/arxiv/2609.21465
Published: 2026-09-22T01:51:42.039Z
Updated: 2026-09-22T01:51:42.039Z
7. Paint-Anything: Unified Any-Color Control for Image Generation and Editing
Abstract:Professional design requires any-color control: the ability to specify an object’s target color with any 24-bit hex value for image generation and editing. Prior work has explored color generation, editing, and colorization, but often relies on dedicated color representations or specialized inference procedures. Advances in large language models offer a simpler starting point: even compact models can associate hex values with color semantics. We present Paint-Anything, which learns a shared hex-prompt interface for generation and editing through object-level color supervision. We develop a data pipeline that constructs Paint-500K from real images through object grounding, perceptual color labeling, and editing-pair synthesis. Since shadows make real-image labels only approximate colors, we complement this supervision with pure-color anchors whose pixels exactly match their paired hex values. These anchors are used only at high-noise timesteps, leaving low-noise training to natural images. We further introduce Any Color Benchmark (ACBench), comprising ACBench-T2I and ACBench-Edit, to measure object-level hex color fidelity across both tasks. On FLUX.2-4B, Paint-Anything improves ACBench-T2I and ACBench-Edit scores by 85.3% and 28.3%, respectively, relative to the base model, with ablations supporting the training recipe. It also achieves the highest average CompColor score among the compared methods.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文旨在解决**图像生成与编辑中缺乏统一、精确的任意颜色控制机制**的问题。具体而言,其核心目标与针对的问题可概括如下: ### 1. 核心问题:Any-Color Control(任意颜色控制) 专业设计场景要求用户能够通过**24位十六进制(hex)数值**精确指定图像中特定对象的目标颜色,而非仅使用“蓝色”“红色”等模糊的自然语言描述。然而,现有文本到图像模型通常: - 仅支持语义层面的颜色描述(如“a red car”),无法精确绑定到具体的数值色值(如 `#BD9DDB`); - 在涉及多对象、多颜色的组合生成时,容易出现颜色混淆、绑定错误或对象间颜色泄露。 ### 2. 现有方法的局限性 论文指出,此前的相关工作存在以下不足: - **任务割裂**:颜色生成、图像重新着色(recoloring/editing)与图像着色(colorization)通常被视为独立问题,需要不同的控制模块或推理流程; - **表示方式不统一**:部分方法依赖可学习的颜色token、CIELAB对齐的文本嵌入,或基于边界框+RGB三元组的结构化表示,缺乏一种简洁、通用的接口; - **推理开销高**:许多方法依赖额外的颜色编码器、采样引导(sampling guidance)或注意力操纵等训练无关技术,难以跨架构迁移或规模化应用。 ### 3. 论文提出的统一解决思路 为解决上述问题,论文提出 **Paint-Anything**,其核心思想是: - **Prompt-Native 的 Hex 接口**:将十六进制颜色值直接嵌入文本提示(如 `#AABBCC`),利用大型语言模型对 hex 字符串的语义理解能力,建立生成与编辑共享的统一控制语言; - **对象级颜色监督**:通过自动化数据流水线(Paint-500K),从真实图像中提取对象级别的主导颜色标签,实现文本中 hex 值与图像中对象区域的精确绑定; - **高噪声门控的纯色锚点(Pure-Color Anchors)**:针对真实图像中阴影/光照导致颜色标签仅为近似值的问题,引入纯色图像作为锚点监督,并限制其仅在高噪声时间步($t ∈
0.8, 1.0
$)参与训练,从而在保留自然图像纹理细节的同时,提供干净的 hex-to-RGB 映射参考。 ### 4. 评估基准的缺失与补充 论文还指出现有基准缺乏对**对象级十六进制颜色保真度**的专门评测,因此提出了 **Any Color Benchmark (ACBench)**,覆盖文本到图像生成(ACBench-T2I)与图像编辑(ACBench-Edit)两个任务,用于量化模型在对象区域生成/编辑后对指定 hex 颜色的忠实程度。 综上,该论文试图建立一个**无需额外控制模块、仅通过文本提示即可实现任意精确颜色控制的统一框架**,使单一模型能够同时胜任从零开始的条件生成与对真实图像的精确重新着色。 Q2: 有哪些相关研究? 根据论文第2节及相关引用,相关研究可分为以下几个方向: ### 1. 文本到图像生成中的颜色控制 该方向旨在将颜色作为首要控制信号,而非仅依赖文本描述中的语义颜色词。 - **学习颜色表示或嵌入** - **ColorPeel**
11
:提出可学习的颜色提示(learnable color prompts),通过颜色与形状解耦实现颜色控制。 - **NumColor**
13
:学习数值颜色嵌入(numerical color embeddings),支持 RGB/hex 等数值颜色输入。 - **CIELAB 对齐的文本嵌入**
57
:将感知颜色空间与文本嵌入对齐,以改善生成颜色与文本描述的对应关系。 - **BBQ-to-Image**
34
:采用结构化提示,结合边界框(bounding boxes)与 RGB 三元组进行控制。 - **训练无关的推理时技术** - 通过在采样阶段引入引导机制或操纵注意力/数值来实现颜色控制,例如 **Palette Aligned Image Diffusion**
3
、**Sliced Wasserstein Guidance**
45
、**Color Alignment in Diffusion**
56
、**Semantic Attribute Binding**
39
、**Test-time Conditional Synthesis**
55
等。 - 此类方法无需额外训练,但通常依赖昂贵的推理时优化或注意力操纵,且难以跨架构迁移。 ### 2. 图像颜色编辑与着色 该方向关注如何基于数值颜色或语义线索对已有图像进行重新着色或着色。 - **通用图像编辑系统** - 基于提示编辑(prompt editing)、指令微调(instruction tuning)、反演(inversion)、上下文编辑(in-context editing)及流式编辑(flow-based editing)等方法,如 **InstructPix2Pix**
10
、**Prompt-to-Prompt**
31
、**Imagic**
35
、**FlowEdit**
38
、**UniEdit-Flow**
33
、**ControlNet**
71
等。这些方法可改变视觉属性,但并非专门针对数值颜色绑定设计。 - **精确数值颜色编辑** - **ChromaFusionNet**
26
、**Language-based Photo Color Adjustment**
58
、**Controllable-Continuous Color Editing**
65
、**Region-aware Colour Editing via Token-level Diffusion**
66
、**ColorEdit**
68
、**Training-free Text-guided Color Editing**
69
等方法专注于语言引导或区域感知的连续/离散对象颜色控制。 - **调色板与直方图方法** - **HistoGAN**
1
、**Palette-based Photo Recoloring**
16
、**ColorfulCurves**
19
等通过调色板或直方图提供显式颜色控制,但不通过文本提示将 hex 规范绑定到具体对象。 - **图像着色(Colorization)** - **L-CAD**
17
、**L-Coins**
18
、**Automatic Controllable Colorization via Imagination**
23
、**COCO-LC**
40
、**CtrlColor**
41
等利用掩膜、调色板图像或语义线索约束着色输出。 - **图像参考条件方法** - **IP-Adapter**
67
通过全局图像条件提供连续视觉线索,但容易将目标颜色与风格或纹理纠缠。 ### 3. 评估基准 - **CompColor / ColorBind**
54
:用于评测组合颜色绑定能力,检验模型是否能在同一提示中正确将两种不同颜色绑定到两个对象。 - **GenColorBench**
12
:涵盖多种颜色控制设置(包括数值颜色理解 NCU)的综合性评测基准。 - **ColorConceptBench**
53
:针对文本到图像模型中概率性颜色-概念理解的评测。 论文指出,上述方法往往将颜色生成、颜色编辑和图像着色视为独立问题,依赖专用模块或推理时技巧;而 Paint-Anything 的目标是通过共享的 hex-prompt 接口,以单一模型统一覆盖生成与编辑任务。 Q3: 论文如何解决这个问题? 论文通过 **Paint-Anything** 框架解决任意颜色控制问题,核心思路是将 24-bit hex 值作为原生提示(prompt-native)接口统一生成与编辑任务,并通过专门构建的数据监督与训练策略建立精确的 hex-to-pixel 映射。具体解决方案可分为以下几个层面: —- ### 1. 统一的 Hex-Prompt 接口 不同于引入独立颜色编码器或边界框等结构化表示,论文直接在文本提示中嵌入十六进制颜色值,并用显式标签包裹:
“a photo of a
或编辑指令:
“change the bag to
由于现代语言模型(如 Qwen3-4B)已能将原始 hex 字符串关联到合理的颜色语义,这种表示无需修改文本编码器即可被冻结的文本编码器处理。`` 标签的显式包裹进一步强化了对象与数值颜色的绑定关系,改善了组合颜色控制中的属性绑定能力。 —- ### 2. 构建 Paint-500K 数据流水线 为实现对象级别的 hex 监督,论文设计了一套从真实图像到成对训练数据的自动构建流程: - **对象定位与分割**:利用视觉语言模型(VLM)识别图像中与标题相关的对象及其边界框,再通过 SAM3 生成精确的实例掩膜。 - **感知颜色提取**:在 CIELAB 空间(而非 RGB 空间)中对掩膜内像素进行 MeanShift 聚类,自适应确定主导颜色数量,避免固定 K 的 k-means 将阴影或噪声错误拆分为冗余标签。取最大保留簇的均值作为该对象的主导颜色,转换为 24-bit sRGB hex 标签。 - **标题重写**:VLM 将提取的 hex 值绑定到对应的名词短语中,插入 `#HEX` 跨度,形成多对象与单对象生成样本。 - **编辑样本合成**:对单对象图像,使用预训练编辑模型将其重新着色为其他颜色作为源图像(source),原始照片作为目标图像(target),并配以恢复原始 hex 颜色的指令。通过场景保持与有意义重着色过滤,得到 100K 编辑对。 最终 Paint-500K 包含 400K 生成样本与 100K 编辑样本,所有样本共享相同的 hex-prompt 语法。 —- ### 3. 训练架构:统一生成与编辑 论文基于修正流(rectified-flow)文本到图像模型(如 FLUX.2-4B),冻结 VAE 与文本编码器,仅微调去噪 Transformer。 对于生成任务,模型接收噪声潜在变量 z_t 与文本条件 c ;对于编辑任务,将源图像通过 VAE 编码为干净的条件潜在变量 z_c ,并与 z_t 拼接输入去噪器:
vθ = Dθ([zt; z_c], t, c)
两者共享相同的流匹配(flow-matching)损失:
L(FM) = E(z_0, ε, t, y) [ |vθ - v^|_2^2 ]
其中 v^ = ε - z_0 , z_t = (1-t)z_0 + tε 。这种设计使得生成与编辑在训练目标上完全一致,区别仅在于是否拼接源图像条件分支。 —- ### 4. 纯色锚点与高噪声门控(核心训练技巧) 真实图像中的阴影与光照使提取的对象颜色仅为近似值,无法提供精确的 low-level RGB 监督。为此,论文引入**纯色锚点(pure-color anchors)**: - 从 24-bit RGB 空间中采样颜色值,渲染为纯色图像(solid-color images),并与包含对应 `#HEX` 的提示配对。 - 这些样本提供从数值 hex 到精确 RGB 统计量的干净映射。 关键发现是:在纯色生成轨迹中,颜色属性在**高噪声阶段**( t 接近 1)即已视觉稳定。基于此,论文采用**高噪声门控策略**:
t sim U(t(gate), 1.0), quad t(gate) = 0.8
即纯色锚点仅在 $t ∈
0.8, 1.0
时参与训练,而低噪声阶段( t ∈ (0, 0.8)$)完全留给真实图像的生成与编辑监督。这种分离确保模型在高噪声阶段建立精确的数值颜色基础,在低噪声阶段学习自然图像的纹理、光照与材质。 —- ### 5. 联合优化目标 最终训练目标为三流损失的加权和:
L = λ(t2i) L(t2i) + λ(edit) L(edit) + λ(rgb) L(rgb)
- L(t2i) :真实图像生成样本的流匹配损失,覆盖单对象与多对象场景; - L(edit) :图像编辑样本的流匹配损失,编码源图像为干净条件; - L_(rgb) :纯色锚点样本的流匹配损失,受限于高噪声时间步。 通过联合优化,单一模型同时习得颜色感知、对象-颜色组合绑定以及基于指令的精确重新着色能力。 —- ### 6. 引入 ACBench 进行系统验证 为量化对象级 hex 颜色保真度,论文提出 Any Color Benchmark(ACBench),包含生成(ACBench-T2I)与编辑(ACBench-Edit)两个子集,使用 SAM3 定位对象区域并以平均 RGB 的 MAE 作为度量。该基准与 GenColorBench、CompColor 等现有基准互补,验证了上述训练方案在数值颜色精确性、组合绑定及跨架构泛化上的有效性。 通过上述设计,Paint-Anything 在不引入推理时额外模块的前提下,实现了对任意 24-bit hex 颜色的精确、统一控制。 Q4: 论文做了哪些实验? 论文的实验围绕**基准评测、定量对比、消融分析与定性验证**四个层面展开,并辅以多项附录中的鲁棒性检验。具体实验内容如下: —- ### 1. 评测基准与指标设计 #### 1.1 CompColor Benchmark - **原始协议**:使用固定命名颜色(named-color)评测组合颜色绑定能力,即检验模型能否将两种不同颜色正确绑定到两个不同对象。 - **Hex 翻译协议**:论文提出将颜色词替换为其标准 hex 值(如 `tomato` → `#FF6347`),在保持对象组合不变的情况下,测试模型对原始数值颜色提示的遵循能力。该协议下进一步划分为 **Single**、**Close**(感知相似颜色对)与 **Distant**(感知差异大的颜色对)三个子集。 #### 1.2 Any Color Benchmark (ACBench) 论文新提出的对象级 hex 颜色保真度基准,包含两个子集: - **ACBench-T2I**:1000 条生成提示,覆盖单对象(500 条)与双对象(500 条)场景,要求模型根据 hex 值生成对应颜色的对象。 - **ACBench-Edit**:500 条真实图像重新着色指令,要求模型将指定对象编辑为目标 hex 颜色。 **评分方式**:利用 SAM3 定位目标对象区域,计算掩膜内平均 sRGB 与目标 hex 的通道-wise 平均绝对误差(MAE),并通过分段线性函数映射为 0–100 的标准分:
s = 100 · max(0, 1 - max(0, MAE - 16)48)
其中 MAE ≤ 16 得满分,MAE ≥ 64 得零分。 —- ### 2. 主要定量结果(Table 1) 论文在 FLUX.2-4B(8B)与 Z-Image Base(10B)两个骨干上应用 Paint-Anything 的训练配方,并与大量基线进行系统对比: | 对比维度 | 关键发现 | |————-|————-| | **骨干内对比** | 微调后的 FLUX.2-4B 在 ACBench-T2I 与 ACBench-Edit 上分别比基线提升 **85.3%** 与 **28.3%**。 | | **跨参数量对比** | 8B 的 Paint-Anything 在 ACBench-T2I 与 ACBench-Edit 上均优于 56B 的 FLUX.2-dev。 | | **Word-to-Hex 差距** | 基线模型在 CompColor 上使用 hex 提示的平均分从命名颜色的 0.72 暴跌至 0.38;经 hex 监督微调后,hex 提示平均分不仅反超基线的 hex 表现,还超过其命名颜色表现(0.79 vs. 0.72)。 | | **专用方法对比** | Paint-Anything 在 ACBench-T2I 上超过最强专用基线 ColorWave 达 **22.04** 分,在 ACBench-Edit 上超过 ColorBind/Edit 达 **15.19** 分。 | 此外,论文在独立基准 **GenColorBench NCU** 上验证了排名一致性(Appendix A, Table 4),Paint-Anything 的平均 NCU 得分(57.89)高于 NumColor 等已发表方法。 —- ### 3. 消融实验 #### 3.1 模块消融(Table 2) 在 FLUX.2-4B 上逐一验证四个关键设计选择: - **Base**:预训练基线,不微调。 - **LoRA**:全量微调 vs. Rank-256 LoRA。 - **Wrap**:使用 `` 标签包裹 hex 值。 - **Pure**:引入纯色锚点监督。 - **Gate**:对纯色锚点施加高噪声门控。 **结论**:完整配方(全量微调 + Wrap + Pure + Gate)在 ACBench-T2I、ACBench-Edit 与 CompColor 上均取得最优;缺少任一组件(尤其是 Gate 或 Wrap)均会导致性能下降。 #### 3.2 时间步门控阈值消融(Table 3) 固定 Wrap 与 Pure,仅改变纯色锚点的激活噪声区间起点 t(gate) : | t(gate) | ACBench-T2I | ACBench-Edit | CompColor | |—————————|——————-|———————|—————-| | 0.0(无门控) | 63.83 | 70.39 | 0.71 | | 0.7 | 65.93 | 72.68 | 0.79 | | **0.8** | **68.58** | **75.57** | **0.79** | | 0.9 | 67.54 | 73.68 | 0.77 | | 1.0 | 67.62 | 71.49 | 0.76 | 结果表明 t(gate) = 0.8 在生成与编辑任务上达到最佳平衡,验证了“高噪声阶段学习颜色锚点、低噪声阶段学习自然图像细节”的假设。 —- ### 4. 定性结果 - **生成对比(Figure 6)**:与 FLUX.2-4B 基线相比,Paint-Anything 在相同 hex 提示下生成的对象颜色与目标数值更接近,而基线常产生语义合理但数值偏差显著的颜色。 - **同对象多色生成(Figure 7)**:固定提示与随机种子,仅改变目标 hex 值,模型能精确渲染从深红到荧光绿等多种色值。 - **编辑多色变换(Figure 8)**:对同一张源图像,模型可根据不同 hex 指令将目标对象重新着色为相应精确色值,同时保持场景其余部分不变。 —- ### 5. 附录中的补充实验 | 实验 | 内容 | 核心结论 | |———|———|————-| | **GenColorBench NCU** (Appendix A, Table 4) | 采用官方 NCU 协议(GroundingDINO+SAM2、OneHue 提取、CIEDE2000)评测 | Paint-Anything NCU 平均 57.89,超过 FLUX+NumColor(51.90) | | **ACBench 可靠性** (Appendix H) | 使用 5 种不同区域统计量(Mean RGB、MeanShift Dominant、Median RGB/Lab、Dominant Lab)及 SAM3 检测阈值扫描(0.1–0.9)重新计分 | 无论采用何种估计器或阈值,Paint-Anything 对基线的领先优势均保持稳定 | | **定位失败审计** (Appendix H, Table 9) | 人工审计 SAM3 在 600 张生成图上的失败率 | Paint-Anything 的失败率(5.50%)甚至高于部分基线,说明其高分并非由定位优势造成 | | **纯色锚点分辨率** (Appendix I, Table 10) | 对比 256×256、512×512、1024×1024 纯色图 | 512×512 为最佳平衡点,降至 256 损失 5.48 分,升至 1024 收益甚微 | | **大颜色偏移编辑** (Appendix J, Table 11) | 按源色到目标色的 CIEDE2000 距离分四象限评测编辑任务 | Paint-Anything 在颜色偏移最大的象限表现最强(88.9),而基线随偏移增大显著退化 | | **人类偏好研究** (Appendix K) | 15 名参与者对 80 组 ACBench-T2I 提示进行颜色偏好与图像质量偏好判断 | 颜色匹配:Paint-Anything 非平局胜率 80.9%;图像质量:非平局胜率 52.4%,未牺牲视觉质量 | | **训练-评测分离** (Appendix L) | 检查 ACBench 提示与 Paint-500K 训练提示的字符串重叠 | 归一化后无精确字符串重叠,排除数据泄露 | Q5: 有什么可以进一步探索的点? 基于论文第5节“Limitations and Future Work”及整体技术框架,以下是可以进一步探索的研究方向: —- ### 1. 调色板级别的统一监督 当前 Paint-500K 提供的是**对象级单色监督**,尚未引入**调色板(palette)整体约束**。后续工作可探索: - 在提示中支持多色组合或风格化配色指令(如“使用互补色方案”或“匹配 Pantone 色卡”); - 构建包含调色板级标注的数据集,使模型学习颜色间的协调关系与整体视觉和谐,而非仅孤立地绑定单个对象与单个 hex 值。 —- ### 2. 向更广泛的颜色控制任务扩展 论文已统一了生成(T2I)与编辑(recoloring),但颜色控制的范畴还可进一步拓宽: - **图像着色(Colorization)**:将灰度图或线稿按指定 hex 值着色; - **局部重新着色与材质保持**:在改变对象颜色的同时,更精细地保持高光、阴影、纹理与材质属性; - **风格化颜色迁移**:结合参考图像的调色板,对目标图像进行风格化的颜色重映射。 —- ### 3. 复杂场景下的组合颜色绑定 ACBench 目前覆盖单对象与双对象场景。对于**三对象及以上**的复杂组合(Appendix C 中 Table 5 已作为初步诊断),未来可系统研究: - 随着提示中颜色-对象对数量增加,模型是否仍能避免颜色泄露(color leakage)与属性混淆; - 空间关系复杂(遮挡、透视、多实例同类对象)时的颜色绑定鲁棒性。 —- ### 4. 与工业设计标准的对齐 当前工作使用 24-bit sRGB hex 值。在专业设计流程中,颜色标准往往涉及: - **Pantone、RAL、CMYK** 等印刷与工业色彩体系; - 品牌专属色(brand colors)的精确还原; - 不同显示设备与光照条件下的颜色一致性(color constancy)。 探索将 hex-prompt 接口扩展至这些标准,或引入颜色管理(color management)机制,是提升实用价值的重要方向。 —- ### 5. 训练策略的精细化 论文提出的**高噪声门控纯色锚点**已取得显著增益,但仍存在优化空间: - 自适应门控:根据目标颜色的亮度、饱和度或对象语义动态调整 t(gate) ,而非全局固定阈值; - 混合锚点:除纯色图外,引入渐变、纹理或材质锚点,以在保持数值精确性的同时增强对真实表面外观的建模; - 更高效的参数微调:当前完整微调优于 LoRA,探索更高秩或特定层选择的参数高效微调(PEFT)方案,以在更大模型上降低训练成本。 —- ### 6. 评估维度的拓展 ACBench 目前聚焦对象级平均 RGB 保真度。未来评估可纳入: - **感知均匀性**:在 CIEDE2000 或 CAM16-UCS 空间中度量,更接近人眼感知; - **交叉对象干扰**:量化多对象场景下颜色泄露、交换或抑制的发生率; - **编辑一致性**:衡量多次连续编辑或不同源图像下,同一 hex 指令的输出方差; - **用户意图对齐**:通过更大规模的用户研究,验证数值精确性提升是否直接转化为人类主观偏好与设计可用性。 Q6: 总结一下论文的主要内容 该论文围绕**任意精确颜色控制(Any-Color Control)**展开,提出了一种统一的文本提示驱动框架,使图像生成与编辑模型能够直接遵循 24-bit 十六进制(hex)颜色值。以下是论文核心内容的结构化总结。 —- ### 1. 研究动机与问题定义 专业设计场景要求通过精确的数值色值(如 `#BD9DDB`)指定对象颜色,而非模糊的语义描述(如“蓝色”)。现有工作存在以下局限: - **任务割裂**:颜色生成、重新着色(editing)与着色(colorization)常被当作独立问题处理; - **接口不统一**:依赖可学习颜色 token、边界框+RGB 三元组或推理时的注意力操纵,难以跨架构迁移; - **数值保真度不足**:基线模型在 hex 提示下易产生语义合理但数值偏差显著的颜色。 论文将这一问题形式化为 **any-color control**:用户通过 hex 值直接指定对象目标颜色,且同一接口需同时支持从零生成与真实图像编辑。 —- ### 2. 核心方法:Paint-Anything #### 2.1 统一的 Hex-Prompt 接口 论文将 hex 颜色值直接嵌入文本提示,并用显式标签包裹:
“a
冻结的文本编码器即可处理该表示,无需额外颜色编码器。实验表明,现代紧凑型语言模型(如 Qwen3-4B)已能将原始 hex 字符串关联到合理的颜色语义,从而使 hex 成为生成与编辑共享的原生提示语言。 #### 2.2 Paint-500K 数据流水线 为建立对象级 hex 监督,论文构建了包含 500K 样本的数据集,流程包括: - **对象定位**:VLM 识别标题相关对象,SAM3 生成实例掩膜; - **感知颜色提取**:在 CIELAB 空间中使用 **MeanShift 聚类**(而非固定 K 的 k-means)自适应提取主导颜色,减少阴影与噪声导致的冗余标签; - **标题重写**:VLM 将提取的 hex 值绑定至对应名词短语; - **编辑样本合成**:利用预训练编辑模型对单对象图像进行重新着色,以合成源图像,并与原始照片构成“恢复原始 hex 颜色”的编辑指令对。 最终数据包含 400K 生成样本与 100K 编辑样本。 #### 2.3 训练策略 基于修正流(rectified-flow)模型,论文冻结 VAE 与文本编码器,微调去噪 Transformer。 **统一生成与编辑目标**:两者共享流匹配损失
L(FM) = E(z0,ε,t,y) [ |vθ - v^|_2^2 ],
其中 z_t = (1-t)z_0 + tε , v^ = ε - z0 。编辑任务仅额外拼接源图像的干净潜在变量 z_c 。 纯色锚点与高噪声门控:真实图像的颜色标签受光照与阴影影响仅为近似值。为此,论文引入纯色图像(solid-color images)与对应 hex 提示构成的纯色锚点,提供干净的 hex-to-RGB 映射。关键设计在于高噪声门控:纯色样本仅在时间步 $t ∈
t(gate), 1.0
参与训练(默认 t(gate)=0.8$),而低噪声阶段完全留给真实图像。这使得模型在高噪声阶段建立精确的数值颜色基础,在低噪声阶段学习自然纹理与光照。 联合训练目标为:
L = λ(t2i)L(t2i) + λ(edit)L(edit) + λ(rgb)L_(rgb).
—- ### 3. 实验与结果 #### 3.1 评测基准 - **ACBench**(论文新提出):包含 ACBench-T2I(1000 条生成提示)与 ACBench-Edit(500 条编辑提示),使用 SAM3 定位对象,以平均 sRGB 的 MAE 映射为 0–100 分数:
s = 100 · max(0, 1 - max(0, MAE-16)48).
- **CompColor**:采用 hex 翻译协议,将原始命名颜色替换为标准 hex 值,测试组合颜色绑定能力。 #### 3.2 主要定量结果(FLUX.2-4B 骨干) - **ACBench-T2I**:从基线的 37.02 提升至 68.58,**相对提升 85.3%**; - **ACBench-Edit**:从基线的 58.90 提升至 75.57,**相对提升 28.3%**; - **跨参数量优势**:8B 参数的 Paint-Anything 在颜色保真度上超过 56B 的 FLUX.2-dev; - **Hex 提示的 CompColor**:基线使用 hex 提示时平均分从命名颜色的 0.72 暴跌至 0.38,经 Paint-Anything 微调后 hex 提示平均分达到 **0.79**,反超其命名颜色表现; - **专用方法对比**:在 ACBench-T2I 上超过 ColorWave 22.04 分,在 ACBench-Edit 上超过 ColorBind/Edit 15.19 分。 #### 3.3 消融实验 模块消融验证了各组件的必要性: - **`` 标签包裹**:单独使用可将 ACBench-T2I 从 44.06 提升至 57.16; - **纯色锚点**:在包裹基础上进一步提升生成性能; - **高噪声门控( t_(gate)=0.8 )**:相比无门控的锚点,ACBench-T2I 提升 4.75 分,ACBench-Edit 提升 5.18 分,为最佳平衡点; - **全量微调**:优于 Rank-256 LoRA。 —- ### 4. 核心贡献 - **统一的提示原生颜色控制**:证明了对象级 hex 监督可使单一模型通过同一文本接口完成生成与编辑,无需专用颜色模块或推理时优化。 - **数据与训练方案**:开发了 Paint-500K 数据流水线,并提出基于 CIELAB MeanShift 的颜色提取与高噪声门控纯色锚点训练策略。 - **评测基准**:引入 ACBench,系统评估对象级 hex 颜色保真度,补充了现有基准在数值颜色生成与编辑评测上的空白。 —- ### 5. 局限与未来方向 - 当前训练数据未包含**调色板级整体监督**,未来可扩展至配色方案与风格化颜色协调; - 可进一步将同一接口扩展至图像着色、品牌专色(Pantone/RAL)对齐及更复杂的多对象组合场景。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Ji Xie,Dewei Zhou,Xinyu Huang,Zhennan Chen,Xun Wang
Categories:
PDF URL: https://arxiv.org/pdf/2609.20816.pdf
Arxiv URL: https://arxiv.org/abs/2609.20816
Arxiv ID: 2609.20816
CoolPaper URL: https://papers.cool/arxiv/2609.20816
Published: 2026-09-22T01:51:42.114Z
Updated: 2026-09-22T01:51:42.114Z
8. Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design
Abstract:Professional graphic design is a long-horizon agentic task in which structured, editable artifacts emerge from many interdependent actions, yet outcomes admit no reliable programmatic oracle. We introduce a continual adaptation framework in which a frozen frontier model operates professional design software through more than 230 tools, while an external procedural memory of natural-language skills accumulates and refines reusable design procedures from experience. The memory widens by acquiring procedures for recurring uncovered subtasks and deepens by revising existing procedures against their own successful and failed executions, while a matched replay gate admits only changes that repair failures without regressing observed successes. Five rounds over 1,406 real user briefs and 1,869 automatically graded trajectories, with no weight updates and no human labels, grow the bank from 76 documentation-derived skills to 139 and raise GenEval2 execution success on Claude-Sonnet-4 from 72.7% to 99.3% (+11.99 points in generation quality), with 61.8% and 67.6% win rates against the no-skill agent across four specialized design benchmarks on Claude-Sonnet-4 and Claude-Opus-4.6. We further show the two mechanisms are effective in combination: on 200 held-out briefs from user-traffic benchmark, widening or deepening alone reaches a 49.4% / 48.6% win rate over the no-skill agent, while their combination reaches 58.5% (p = 0.025). Procedural memory offers a practical route to continual adaptation of agents under noisy, unverifiable feedback.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*专业图形设计智能体在冻结基础模型条件下,如何基于无标注用户流量实现持续适应\*\*的问题。具体而言,该工作针对以下核心挑战: - \*\*长程任务中的信用分配困境\*\*:专业图形设计需要数十个相互依赖的操作才能完成一个可编辑的结构化工件,但终端反馈(如最终设计是否合格)无法可靠地识别中间哪些决策导致了成功或失败。 - \*\*缺乏可验证的成功判定器(oracle)\*\*:与代码可通过单元测试验证不同,设计需求混合了客观约束(文本、颜色、位置)与主观标准(构图、层次、风格),自动评估器只能部分捕捉质量,且不存在确定性的“成功oracle”来判断输出是否满足需求。 - \*\*冻结模型的适应限制\*\*:当基础模型为外部托管或不便更新权重时,传统监督学习(需要昂贵的人工演示)或强化学习(需要可验证的奖励信号)难以直接应用,因此需要一种不修改模型参数的持续学习机制。 - \*\*从噪声反馈中安全演化\*\*:基于LLM的评估存在位置和顺序偏差,且上游状态(如素材检索)会干扰对技能变更效果的判断。如何在无法完全信任自动评估信号的前提下,确保演化出的程序性记忆不会引入回归(regression),是部署层面的关键难点。 简言之,论文将\*\*外部程序性记忆库(procedural memory)\*\*本身作为学习对象,通过“拓宽(widening)”与“深化(deepening)”两种机制,在无需权重更新、无需人工标注奖励的情况下,使冻结的智能体模型能够从用户流量中持续积累并精炼可复用的设计程序。 Q2: 有哪些相关研究? 根据论文第A节(Related Work)及正文引用,相关研究可归纳为以下七个方向: --- ### 1. 自我改进的智能体与基于经验的适应(Self-Improving Agents and Experience-Based Adaptation) 该方向关注语言智能体如何在不更新模型参数的情况下,从交互经验中持续改进。 - \*\*Reflexion\*\* (Shinn et al., 2023):通过语言反馈改进智能体,将自我生成的反思存储于情景记忆并在后续试验中复用。 - \*\*Self-Refine\*\* (Madaan et al., 2023):利用LLM对自身输出生成反馈并迭代修订,无需额外监督训练或强化学习。 - \*\*ExpeL\*\* (Zhao et al., 2024):跨任务收集智能体轨迹,提取可迁移的自然语言见解,并在推理时检索相关经验与洞察。 - \*\*Generative Agents\*\* (Park et al., 2023):展示持久经验记录可被合成为高级反思,并动态检索以影响未来规划与行为。 - \*\*Dynamic Cheatsheet\*\* (Suzgun et al., 2026):维护演化的测试时记忆,使黑盒语言模型在独立查询间积累知识。 - \*\*ACE / Agentic Context Engineering\*\* (Zhang et al., 2026b):将智能体的上下文本身视为可演化的剧本(playbook),通过生成器、反思器和策展者角色从执行反馈中累积策略。 - \*\*SkillAudit\*\* (Gao et al., 2026):研究无真值条件下结构化智能体技能的演化,通过对比有无候选技能的成对轨迹来定位需修复的段落。 --- ### 2. 智能体记忆、程序性技能与可复用工具知识(Agent Memory, Procedural Skills, and Reusable Tool-Use Knowledge) 该方向区分了\*\*情景记忆\*\*(记住发生了什么)与\*\*程序记忆\*\*(捕获如何完成一类任务),并关注工具使用场景下的可复用动作序列。 - \*\*Voyager\*\* (Wang et al., 2024a):在Minecraft中构建不断增长的可执行技能库,存储成功的动作程序以供后续检索和组合。 - \*\*Agentic Plan Caching\*\* (Zhang et al., 2025):从已完成的智能体执行中提取结构化计划模板,并适配到语义相似的未来请求。 - \*\*MACLA\*\* (Forouzandeh et al., 2026):为冻结LLM智能体构建外部层次化程序记忆,通过成功与失败经验的对比精炼程序。 - \*\*Skill-Pro\*\* (Mi et al., 2026):将交互经验转化为具有激活、执行和终止条件的可执行技能,并引入非参数验证机制控制记忆质量。 - \*\*A-MEM\*\* (Xu et al., 2025):自适应记忆基板,支持新记忆的动态索引、与现有记忆的链接以及上下文表示更新。 --- ### 3. 持续技能获取与精炼(Continual Skill Acquisition and Refinement) 该方向强调终身智能体不仅需要复用知识,还必须在新任务出现时扩展行为 repertoire,并在经验揭示系统性失败模式后巩固已有知识。 - \*\*Voyager\*\* (Wang et al., 2024a):通过自动课程驱动技能库的不断扩展。 - \*\*Dynamic Cheatsheet\*\* (Suzgun et al., 2026) 与 \*\*ACE\*\* (Zhang et al., 2026b):采用“增长-精炼”策略,增量累积新知识而非反复重写完整上下文。 - \*\*COMFYCLAW\*\* (Li et al., 2026c):针对基于工作流的图像生成,将工作流构建建模为类型化图编辑,利用区域级视觉-语言验证器将视觉失败转化为可操作的修复建议,并将历史轨迹蒸馏为可复用技能。 --- ### 4. 自动化反馈下的可靠改进(Reliable Improvement under Automated Feedback) 该方向研究基于LLM或VLM的评估器存在噪声、位置偏差和顺序偏差时,如何避免更新引入回归。 - \*\*LLM-as-a-Judge\*\* (Zheng et al., 2023; Wang et al., 2024b):揭示LLM评估器中的位置偏差、冗长偏差和自我增强偏差,并提出通过对称展示顺序缓解。 - \*\*TIFA\*\* (Hu et al., 2023):通过将文本提示分解为问答对来评估文本到图像的忠实度。 - \*\*VQAScore\*\* (Lin et al., 2024):通过视觉问答评估文本到视觉的对齐度。 - \*\*G-Zero\*\* (Huang et al., 2026a):指出自我演化系统在可验证域成功,但在开放域因代理奖励天花板和奖励黑客而退化。 - \*\*安全策略改进\*\* (Safe Policy Improvement) (Laroche et al., 2019; Thomas et al., 2015):在强化学习中,相对于已部署基线改进策略,同时避免性能无法被充分确信的更新,这为论文中的保守回放门(replay gate)提供了理论动机。 --- ### 5. 技能检索、工具表面缩减与成本感知设计(Skill Retrieval, Tool-Surface Reduction, and Cost-Aware Agent Design) 该方向关注如何在技能库增长后,确保正确的程序在正确的时间进入模型上下文,并控制推理成本。 - \*\*LLM级联与路由\*\* (Chen et al., 2024; Ong et al., 2025):通过在不同能力和价格的模型间选择来降低服务成本。 - \*\*DSPy\*\* (Khattab et al., 2024):将声明式语言模型调用编译为最优流水线,通常无需更新基座模型权重。 - \*\*Graph of Skills\*\* (Liu et al., 2026):构建可执行技能图,通过混合语义-词汇种子和上下文预算 hydration,检索有界且依赖感知的技能包,避免加载完整技能集导致的上下文窗口饱和。 --- ### 6. 共同演化的课程与环境(Co-Evolving Curricula and Environments) 该方向通过共同演化任务分布或环境本身来改进模型,而非仅演化外部记忆。 - \*\*自我演化推理\*\* (Huang et al., 2026c):通过挑战者-求解者共同演化,使挑战者生成处于求解者能力边界的问题。 - \*\*VisPlay\*\* (He et al., 2025):在视觉-语言模型中,将单一基座模型拆分为图像条件提问器和多模态推理器,从无标注图像中联合训练。 - \*\*EnvHarness\*\* (Huang et al., 2026b):通过可编程插件层重塑静态环境行为,使策略与环境能够持续共同演化。 --- ### 7. 用于图形设计的LLM智能体(LLM Agents for Graphic Design) 该方向将多模态智能体从明确定义的工具使用任务扩展到需要联合推理内容、布局与视觉外观的图形设计领域。 - \*\*OpenCOLE\*\* (Inoue et al., 2024):研究可复现的自动图形设计生成。 - \*\*GraphicBench\*\* (Ki et al., 2025):引入包含1,079个创意设计请求的规划基准,以及智能体环境 GraphicTown,使用46个设计动作词汇执行工作流。 - \*\*BannerAgency\*\* (Wang et al., 2025):使用专门的多模态智能体协调广告横幅创建,输出可编辑的 Figma 或 SVG 组件。 - \*\*PosterLlama\*\* (Seol et al., 2024):针对内容感知布局生成。 - \*\*长程智能体强化学习中的信用分配\*\* (Zhang, 2026; Wang et al., 2026b):指出长轨迹中终端奖励对中间决策的信用归因极弱,且样本效率低下。 - \*\*Long-Horizon-Terminal-Bench\*\* (Li et al., 2026b):通过密集奖励信号而非二元终端评分来评估长程终端任务,以区分部分进展与彻底失败。 Q3: 论文如何解决这个问题? 该论文提出了一种名为 \*\*EVOLVE\*\* 的\*\*持续适应框架\*\*,其核心思想是将学习对象从冻结的前沿语言模型(frozen frontier model)的权重转移到一个外部的、可解释的程序性记忆库(procedural memory)——即一个由自然语言编写的\*\*可复用技能库(Skill Bank)\*\*——之上。该框架通过离线的反思-演化循环,在不更新模型参数、不依赖人工标注奖励的情况下,从用户流量(user traffic)中自动积累和精炼设计程序。 具体解决方案可分为以下四个层面: --- ### 1. 总体架构:冻结模型 + 外部技能库 智能体本身由一个冻结的语言模型和超过230种专业设计工具(涵盖Photoshop、Illustrator、InDesign等效功能)组成。所有可学习的内容都被封装在外部的 \*\*SKILL.md\*\* 技能文件中。每个技能是一份自然语言剧本,描述了特定设计子任务的可复用工作流(例如“双重曝光:提取主体→建立蒙版→混合素材→ refine”),并可在执行时被检索和注入模型上下文。禁用技能检索即可恢复原始基线智能体,从而提供了天然的实验对照。 --- ### 2. 双重演化机制:拓宽(Widening)与深化(Deepening) 技能库沿着两个互补的轴进行演化: #### (a) Widening:从反复出现的未覆盖子任务中铸造新技能 - \*\*覆盖缺口检测\*\*:系统从执行轨迹中提取实际完成的子任务。若某子任务未被任何现有技能覆盖(检索为空或技能不匹配),或其关联的技能被判定为失败原因,则该子任务被标记为“未覆盖”并存入覆盖池。 - \*\*触发铸造\*\*:当某个未覆盖标签的累积次数达到阈值 k_(min) = 3 时,一个冻结的LLM将该标签下的历史案例蒸馏为一个候选技能。 - \*\*准入验证\*\*:候选技能必须通过回放门(§3.3)与无技能基线对比,验证其确实能填补空白,方可入库。 #### (b) Deepening:利用成功与失败的历史修订现有技能 - \*\*失败驱动选择\*\*:系统记录每次轨迹检索到的技能及其评分。评分低于成功阈值 τ = 0.6 的轨迹被视为失败,并计入对应技能的失败次数。失败次数达到 m=2 的技能被选为修订对象,按失败频率排序。 - \*\*对比式反思(Reflector)\*\*:修订不是基于失败文本的纯文本重写,而是\*\*对比式\*\*的。Reflector 接收: - 失败的简报及“为何失败”的多模态评判理由(why-bad rationales); - 当前版本的 SKILL.md; - 该技能在\*\*相似任务上的成功案例\*\*(包括工具调用序列、中间结果、思考令牌)。 - \*\*推理与编辑\*\*:Reflector 基于成功与失败之间的具体差异(success↔failure divergence)生成针对性编辑(targeted edit)。若同一技能的多次针对性重写均未通过验证,则升级为全面重写(major rewrite)。若全面重写仍被拒,系统会触发一次探索循环,根据探测结果决定更新、删除或将问题路由回 Widening 的覆盖池。 --- ### 3. 安全部署:保守的回放门(Replay Gate) 由于基于VLM的评分器存在跨运行的分数漂移(score drift)和位置偏差,且上游状态(如素材检索差异)会混淆对技能变更效果的判断,论文设计了一个保守的验证门控机制,将“提案”与“准入”分离。 - \*\*固定上下文回放\*\*:对于待验证的技能变更,系统从该技能的历史使用中采样若干提示(prompts)。对于每个提示,生成多个不同的上游上下文(不同的素材、状态)。然后,在\*\*同一个批次\*\*中,将这些固定的上下文分别用候选版本和基线版本(重写对比V1,新增对比无技能)重新执行。 - \*\*成对比较与顺序随机化\*\*:输出图像通过多模态评判器进行\*\*成对比较\*\*,且展示顺序被随机化以消除位置偏见。评判器仅被询问“哪一个更符合简报”,而非给出绝对分数。 - \*\*准入准则\*\*:一个变更只有满足以下条件时才会被部署:
nexists prompt lost ;land; ∃ prompt won
即,候选者**不得**在任何一个回放的提示上输给基线(防止回归,regression),且**必须**至少在一个提示上获胜(证明存在真实改进)。这一设计直接借鉴了安全策略改进(safe policy improvement)的保守原则。 —- ### 4. 离线循环与冷启动 整个演化流程是一个**完全离线的循环**,包含四个固定角色: - **Prompter**:生成设计简报; - **Solver**:带技能库的智能体,执行工具链并输出图像; - **Grader**:多模态评分器,提供标量奖励和失败诊断; - **Reflector**:基于失败生成对 SKILL.md 的针对性编辑。 为了在没有用户流量时启动系统,论文还设计了一个**冷启动管道**:从内部产品文档中自动提取工作流主题、分配相关页面、生成初始技能描述和工具序列,并经人工检查点验证,形成一个包含76个技能的种子库。后续的五轮演化完全由用户流量驱动,最终将技能库扩展至139个。 简言之,该方案通过将设计知识外化为可演化的自然语言程序,结合“发现缺口-铸造技能”与“对比失败-精炼技能”的双轴演化,并以保守的回放门防止噪声反馈导致的回归,实现了在不可验证、噪声反馈环境下的持续智能体适应。 Q4: 论文做了哪些实验? 论文进行了多维度、多轮次的实验验证,涵盖**演化动态分析**、**自动评估基准**、**消融对比**、**延迟开销**以及**定性案例研究**。以下是主要实验内容的系统梳理: —- ### 1. 实验设置与对照条件 - **对比方法**:将配备演化后技能库的 **EVOLVE** 智能体与 **BASE**(无技能检索的原始智能体)进行对照,保持底层代理、工具集和渲染器完全一致。 - **基础模型**:在三个冻结的骨干模型上展开测试: - `claude-opus-4.6`(Amazon Bedrock) - `claude-sonnet-4`(Amazon Bedrock) - `Qwen3.6-27B`(本地 8×A100 部署,vLLM 推理) - **推理配置**:所有模型的生成、演化和评估均采用固定推理设置(如 thinking token 上限、 900,s 壁钟超时)。 —- ### 2. 五轮演化动态与内部基准 - **演化数据**:在五轮离线循环中,消耗了 **1,406** 个来自真实用户流量及 LLM 增强变体的设计简报(briefs),产生 **1,869** 条自动评分的执行轨迹,**无需人工标注奖励**。 - **技能库增长**:技能库从冷启动的 **76** 个文档衍生技能增长至 **139** 个,其中 **63** 个为用户流量中铸造的新技能;回放门(replay gate)累计拒绝了 100/231 次重写提案和 67/136 次新技能提案。 - **内部 held-out 评估**:每轮演化后,冻结当前技能库,在 **200** 个固定的人类撰写简报(与演化数据不重叠)上测试。 - 以 `claude-sonnet-4` 为例,第5轮(R5)将完整性 ≥ 0.9 的案例比例从基线的 43% 提升至 56% ( +13,pp ),且 ≥ 0.5 的比例从 86% 提升至 93% 。 - 演化并非单调:R4 因大量未精炼的 V1 新技能导致低端回归,R5 通过深化(21次重写,仅4次新增)实现全面修复,体现了“拓宽”与“深化”的互补性。 —- ### 3. 通用文本到图像(T2I)基准 在四个通用 T2I 基准上各采样 300 个提示,评估生成质量(Quality)与执行成功率(Success Rate): | 基准 | 评价维度 | |———|—————| | **GenEval2** | 组合推理(对象与空间关系) | | **DPG-Bench** | 密集提示跟随 | | **OneIG-EN / OneIG-ZH** | 跨语言主题-元素对齐与文本渲染 | - **Claude-Sonnet-4** 提升最为显著:GenEval2 成功率从 72.7% 跃升至 99.3% ,生成质量提升 +11.99 分;DPG-Bench 成功率从 82.7% 提升至 100% 。 - **Qwen3.6-27B** 平均生成质量提升 +9.67 分,但部分基准成功率受本地部署稳定性影响而波动。 —- ### 4. 专业图形设计基准 在四个专业设计基准上,采用 **GPT-5.4** 进行盲法、双顺序成对比较,报告 **EVOLVE 相对于 BASE 的胜率**(Win Rate): | 基准 | 任务类型 | |———|—————| | **OpenCOLE** | 可复现的自动图形设计生成 | | **GraphicBench** | 多步规划与布局约束 | | **CreatiDesign** | 创意图形设计 | | **BannerRequest400** | 广告横幅设计 | - **Claude-Opus-4.6**:总体胜率 ** 67.6% **,在 CreatiDesign 上达到 ** 71.7% **。 - **Claude-Sonnet-4**:总体胜率 ** 61.8% **,在 OpenCOLE 上达到 ** 66.0% **。 - 专项成功率(表4)显示,EVOLVE 对复杂长程任务(如 BannerRequest400)的完成率提升尤为关键:Sonnet 从 74.7% 提升至 100% ( +25.3,pp ),有效避免了灾难性工具使用失败。 —- ### 5. 消融研究:拓宽 vs. 深化 在 200 个 unseen 提示上,构建两个中间技能库以隔离两种演化机制的贡献: - **+ rewrite**:仅对冷启动技能进行深化(重写),胜率 ** 48.6% **,完整性 69.02 。 - **+ new skills**:仅进行拓宽(新增技能),胜率 ** 49.4% **,完整性 69.79 。 - **EVOLVE(两者结合)**:胜率 ** 58.5% **(相对于 BASE, p = 0.025 ),完整性 ** 74.04 **。 **结论**:单独执行任一机制均无法显著超越冷启动基线,但两者结合产生**超加性增益**(superadditive interaction,完整性 +3.85 ),表明新技能需要精炼的检索描述才能被正确触发,而重写也会将不可修复的失败路由回覆盖池以供新技能铸造。 —- ### 6. 延迟与计算开销分析 - 在四个基准上测量每样本平均壁钟时间(图6)。 - EVOLVE 仅引入 ** 3.4% – 6.2% ** 的平均延迟开销;在部分配置下甚至因减少了工具搜索和修正重试而降低了耗时(如 Sonnet 在 DPG-Bench 上从 113,s 降至 82,s )。 - Token 成本方面,尽管检索增加了约 28% 的提示 token,但演化后的 EVOLVE 在使用 top- k=3 匹配时,其提示/输出 token 总量甚至低于冷启动( 436.6K/5167 vs. 445.2K/5298 )。 —- ### 7. 定性结果与案例研究 - **多步编辑程序**:如图7所示,BASE 在“双重曝光”、“剪影融合”等任务中常中途放弃或未正确执行掩码/混合步骤;EVOLVE 则能完整执行提取主体→建立蒙版→混合素材→ refine 的全流程。 - **素材选择**:EVOLVE 会基于下游编辑需求选择素材(如为“玻璃栈道下的鲸鲨”选择带人物和透视隧道的图片),而 BASE 仅匹配表面名词,导致空间关系无法实现。 - **个性化极限探索**(附录 I):针对用户特定偏好(方法偏好、感知精度限制、复杂手工目标),展示了技能库在“条件检索 + 工具作用域限制”下可覆盖部分个性化需求,但在极长步骤构造(如完整递归图案)上存在精度泄漏极限。 —- ### 8. 技能嵌入与分布分析 - 使用 BGE-small-en-v1.5 对技能库进行嵌入,UMAP 降维可视化(图4a)显示:用户流量中铸造的 63 个新技能与冷启动 76 个技能在语义空间中分布互补,最近邻距离显著大于种子库内部间距(中位数 0.215 vs. 0.158 ,Mann–Whitney p < 10^(-8) ),证实拓宽覆盖的是种子库遗漏的意图而非同义复述。 Q5: 有什么可以进一步探索的点? 基于论文的局限性讨论与未充分展开的维度,以下方向值得进一步探索: —- ### 1. 超越自然语言的技能表示与执行机制 当前框架将技能表示为自然语言剧本(prose skills),这在长程、多步骤构造中存在固有的保真度泄漏: - **长步骤任务的保真度损失**:附录 I 的“vibe drawing”案例表明,对于需要数百步交互的复杂几何图案(如完整镶嵌),标注、蒸馏与执行三个环节均会累积误差。未来可探索**确定性原语(deterministic macros)**与**结构化计划编排(plan-level orchestration)**的混合表示,将关键子步骤从自由文本提升至可精确执行的代码级原语。 - **对抗模型默认策略**:当冻结模型对某类任务已有强烈内部先验时,单纯的文本注入难以覆盖其行为。需要研究**偏好感知的条件检索(preference-conditioned retrieval)**与**工具作用域强制(tool scoping)**,通过限制可用工具集迫使模型遵循指定路径,而非仅依赖更好的文本描述。 —- ### 2. 精确验证与人类在环的混合机制 论文指出,细粒度几何操作受限于多模态模型的感知能力和自动化验证器的精度: - **数值化验证替代 VLM 判断**:对于像素级对齐、边界吻合等任务,可将验证从视觉-语言模型(VLM)的语义判断迁移至**基于几何/像素的数值测量**(如测量边界两侧像素带宽度),但这仍无法完全解决智能体自身的执行精度问题。未来可探索**人在环验证(human-in-the-loop verification)**的轻量级接入模式,仅在自动化验证不确定时触发人工确认。 - **感知-执行差距的闭环修复**:当前系统能检测失败但难以定位是“感知错误”(看错布局)还是“执行错误”(操作参数偏差)。构建**感知自检模块**,使智能体在执行前对关键几何/空间关系进行显式验证,可能降低长程构造中的误差传播。 —- ### 3. 从局部回放到全局安全保证 回放门(replay gate)仅保证候选技能在抽样的历史案例上无回归,但无法确保其在**整个用户流量分布**上的单调改进: - **分布外(OOD)回归检测**:未来需要研究如何基于技能嵌入空间或用户意图分布,主动探测候选技能在未见过的语义邻近区域上的行为,而非仅依赖已有轨迹的回放。 - **在线 A/B 测试与渐进部署**:将安全策略改进(safe policy improvement)中的置信界思想扩展至自然语言技能,设计**渐进式部署策略**(如金丝雀发布、基于在线反馈的自动回滚),以在真实用户流量中持续监控技能表现。 —- ### 4. 个性化与细粒度用户偏好适应 附录 I 揭示了个性化作为与拓宽(widening)、深化(deepening)正交的第三维度: - **用户级技能偏好图谱**:当前技能库是全局共享的。未来可为每个用户维护**个人技能变体**(如“该用户偏好基于噪声滤波的雪花效果而非粒子生成器),并通过检索时的用户身份条件化实现个性化注入,同时避免全局库的膨胀。 - **难以规格化的主观目标**:对于“风格氛围”“品牌调性”等难以写入自动评估标准的偏好,可探索**基于成对人类反馈的偏好蒸馏**,将用户的隐式审美标准转化为可检索的程序性约束。 —- ### 5. 技能间的依赖关系与组合推理 当前技能库虽支持一级前置技能(prerequisites),但未充分利用技能间的**组合结构**: - **可执行技能图(executable skill graph)**:借鉴 Graph of Skills 的思路,将技能库建模为带有依赖边的图结构,检索时不仅考虑语义相关性,还确保所检索技能的前置链完整,避免因工具缺失导致执行中断。 - **技能组合的发现与验证**:当单个技能无法覆盖复杂请求时,自动发现**技能链(skill chaining)**或**层次化程序(hierarchical procedures)**,并通过回放门验证组合后的整体效果,而非仅验证孤立技能。 —- ### 6. 模型权重更新与外部记忆的协同 论文明确将程序记忆定位为“持续适应的一种机制,而非模型学习的替代品”: - **记忆到模型的蒸馏**:当某技能被验证为长期稳定且高频使用时,研究如何将其内容**蒸馏至冻结模型的软提示(soft prompts)或低秩适配器(LoRA)**中,减少每次检索的上下文开销并提升执行保真度。 - **双时间尺度适应**:外层通过技能库进行天/周级别的离线演化,内层通过少量上下文学习或参数高效微调进行会话级别的快速适应,形成快慢结合的学习架构。 —- ### 7. 成本感知与检索效率的联合优化 尽管当前 top- k=3 检索已带来可接受的 token 开销,但随着技能库从 139 向更大规模扩展: - **动态上下文预算下的技能 hydrated**:根据请求的复杂度与可用上下文窗口,动态决定加载技能的详细程度(摘要 vs. 完整步骤 vs. 仅工具列表),在成本与性能之间进行帕累托最优权衡。 - **技能生命周期管理**:当前仅通过状态标记(candidate/stable/deprecated)管理技能。未来可引入基于使用频率与成功率的**技能淘汰机制**,自动归档长期失效或被更优技能覆盖的条目,防止库膨胀导致的检索噪声。 Q6: 总结一下论文的主要内容 该论文针对**专业图形设计智能体在冻结基础模型条件下如何实现持续适应**的问题,提出了一种名为 **EVOLVE** 的外部程序性记忆演化框架。以下是论文主要内容的系统总结: —- ### 1. 研究背景与核心挑战 专业图形设计是一项长程智能体任务:一个可编辑的设计成品需要数十个相互依赖的操作步骤才能完成。然而,该领域面临三个根本性学习障碍: - **长程信用分配困难**:终端反馈(最终设计是否合格)无法可靠归因到中间的具体决策; - **缺乏可验证的成功判定器(oracle)**:设计需求混合了客观约束(颜色、位置)与主观标准(构图、风格),不存在如代码单元测试般的确定性验证机制; - **模型冻结限制**:当基础模型为外部托管或不便更新权重时,传统的监督微调或强化学习难以直接应用。 —- ### 2. 核心思想:将程序性记忆作为学习对象 论文将学习对象从**冻结语言模型的权重**转移到一个外部的、版本化的**自然语言技能库(Skill Bank)**上。每个技能是一份 `SKILL.md` 剧本,描述特定设计子任务的可复用工作流(如“双重曝光:提取主体→建立蒙版→混合素材”),执行时通过检索注入模型上下文。框架冻结了基础模型、工具集、渲染器和评估器,**仅技能库发生变化**。 —- ### 3. 双重演化机制与保守验证 技能库通过离线的反思-演化循环沿两个互补的轴进行演化: - **拓宽(Widening)**:检测用户流量中反复出现但未被现有技能覆盖的子任务。当同一未覆盖标签累积 k_(min)=3 次后,系统自动将其蒸馏为候选新技能,用以填补覆盖缺口。 - **深化(Deepening)**:针对频繁触发失败的现有技能,系统收集其成功与失败的历史轨迹,通过**对比式反思**(contrastive reflection)定位失败根因并生成针对性修订。失败次数达到阈值 m=2 的技能优先进入修订流程。 为防止噪声评估导致部署回归,论文设计了**保守的回放门(Replay Gate)**: - 对候选变更,系统在固定的上游上下文中同时回放候选版本与基线版本; - 采用**成对比较**(而非绝对分数)与**顺序随机化**消除评估器的位置偏差; - 准入准则严格满足: nexists 输掉的案例 land ∃ 赢的案例 ,即必须在至少一个案例上改进且不能在任何案例上退步。 —- ### 4. 实验设置与主要结果 实验在控制冻结的 Claude-Opus-4.6、Claude-Sonnet-4 与 Qwen3.6-27B 上进行,历经五轮演化,消耗 1,406 个用户流量简报,产生 1,869 条自动评分轨迹,**无需人工标注奖励或模型权重更新**。 - **技能库增长**:从冷启动的 76 个文档衍生技能增长至 139 个(63 个为流量中新铸),回放门拒绝了约 43% 的重写提案和 49% 的新增提案。 - **通用 T2I 基准**:Claude-Sonnet-4 在 GenEval2 上的执行成功率从 72.7% 提升至 99.3% ,生成质量提升 +11.99 分;在 DPG-Bench 上成功率从 82.7% 提升至 100% 。 - **专业设计基准**:在 OpenCOLE、GraphicBench、CreatiDesign 和 BannerRequest400 上,EVOLVE 对无技能基线取得 61.8% (Sonnet)与 67.6% (Opus)的总体胜率;在复杂的 BannerRequest400 任务上,Sonnet 的完成率从 74.7% 跃升至 100% 。 - **消融研究**:单独进行拓宽(胜率 49.4% )或深化(胜率 48.6% )均难以显著超越基线,但两者结合达到 58.5% ( p=0.025 ),呈现**超加性增益**,证实了两者的互补性。 —- ### 5. 局限性与未来方向 论文坦诚指出该方法的边界: - **自然语言表示的保真度极限**:对于极长步骤的精确几何构造(如复杂递归图案),文本技能在标注、蒸馏与执行环节均会泄漏精度; - **难以覆盖模型强先验**:当冻结模型对某类任务有强烈默认策略时,仅靠文本注入难以强制其遵循指定路径,需要工具作用域限制等额外机制; - **验证精度瓶颈**:细粒度空间操作的感知与验证仍受限于 VLM 能力,部分场景需人类介入; - **局部安全非全局安全**:回放门仅保证在抽样历史上的无回归,无法严格保证在整个用户分布上的单调改进。 —- ### 6. 核心贡献 - 提出了首个围绕冻结前沿模型、以**外部程序性记忆**为学习对象的专业图形设计智能体持续适应框架; - 引入**保守回放门**机制,在存在噪声和不可验证反馈的条件下控制技能库的部署安全; - 通过大规模实验验证了**拓宽与深化的耦合效应**,展示了一种不修改模型权重、不依赖人工标注的实用持续适应路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Hongyang Du,Lan Yan,Christian Flores,Asim Kadav
Categories:
PDF URL: https://arxiv.org/pdf/2609.22086.pdf
Arxiv URL: https://arxiv.org/abs/2609.22086
Arxiv ID: 2609.22086
CoolPaper URL: https://papers.cool/arxiv/2609.22086
Published: 2026-09-22T01:51:42.248Z
Updated: 2026-09-22T01:51:42.248Z
9. OmniVBench: A Benchmark and Large-Scale Dataset for Omni Reference-to-Video Generation
Abstract:Reference-to-video (R2V) generation is evolving toward increasingly general and versatile reference control, giving rise to the emerging paradigm of omni R2V generation. However, existing benchmarks fall short of these emerging capabilities: their test cases cover limited reference types and compositions, and their evaluation protocols largely assess holistic reference consistency, overlooking whether reference factors are properly preserved, disentangled, and routed. Meanwhile, the high cost of constructing omni R2V training data makes suitable training resources scarce. To address these gaps, we introduce OmniVBench and the Omni-R2V Dataset for evaluating and training omni R2V models. OmniVBench expands R2V evaluation across broader reference types, fine-grained control tasks, and richer reference compositions, covering 7 task families and 18 fine-grained tasks spanning content, motion, style, structure, narrative, and multi-reference settings. We introduce factor-grounded evaluation with 12,172 case-specific checklist items, assessing whether intended reference factors are faithfully preserved, correctly disentangled and bound to their targets, and properly realized according to the instruction. We further introduce the Omni-R2V Dataset, bringing industrial-grade training resources for diverse R2V tasks to the broader research community. Drawing primarily on a large-scale corpus of professional video footage, it comprises 340K processed training samples spanning diverse reference types and multi-reference compositions. We develop task-specific pipelines for reference-target pair construction, offering a practical and scalable recipe for omni R2V data construction. Extensive evaluation of advanced open- and closed-source R2V models reveals clear performance gaps across task families and evaluation dimensions on OmniVBench, highlighting remaining limitations of current R2V models.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文致力于解决\*\*全能参考到视频(omni reference-to-video, R2V)生成\*\*范式下,现有评估基准与训练资源在覆盖范围、评估粒度及数据规模上的双重不足。具体而言,论文识别并针对以下两个核心问题展开: ### 1. 现有基准测试的任务覆盖与评估粒度不足 随着R2V生成从单一参考控制向多样化、可组合的omni R2V演进,现有基准测试已无法系统性地衡量模型的真实能力边界: - \*\*任务与场景覆盖局限\*\*:现有基准(如OpenS2V-Eval、VACE-Bench、UniVBench等)主要围绕\*\*内容参考\*\*(content reference)展开评估,对实际创作中关键的运动(motion)、风格(style)、结构(structure)、叙事(narrative)以及\*\*多参考组合\*\*(multi-reference composition)等异构参考类型覆盖严重缺失。 - \*\*缺乏因素级(factor-level)的细粒度评估\*\*:现有评估协议多以\*\*整体参考一致性\*\*(holistic reference consistency)或固定相似度指标为主,无法显式诊断模型是否正确地实现了: - \*\*保留(preservation)\*\*:目标参考因素是否被忠实再现; - \*\*解耦(disentanglement)\*\*:参考因素是否从其原始载体(如身份、场景)中分离; - \*\*路由(routing)\*\*:多个参考因素是否被正确绑定到指令指定的输出目标上。 ### 2. 大规模异构R2V训练数据的匮乏 omni R2V范式的多样性对训练数据提出了更高要求,但现有数据资源存在明显短板: - \*\*数据覆盖碎片化\*\*:现有数据集(如OpenS2V-5M、Phantom-Data、MuSS)通常针对特定任务或单一参考类型设计,缺乏对内容、运动、风格、结构、叙事及跨维度组合等异构参考的系统性覆盖。 - \*\*构建成本高且复用困难\*\*:不同任务需要专门的流水线来构建参考–目标对(reference–target pairs)及对应指令,导致大规模omni R2V训练数据的构建成本极高。此外,部分资源未直接提供处理好的样本,进一步增加了研究复用门槛。 ### 总结 该论文通过引入\*\*OmniVBench\*\*(涵盖7个任务族、18个细粒度子任务的全面基准)与\*\*Omni-R2V Dataset\*\*(约34万处理后的工业级训练样本),旨在填补omni R2V领域在\*\*系统化评估\*\*与\*\*规模化训练数据\*\*方面的空白,为更通用、更可控的R2V生成研究提供共享基础。 Q2: 有哪些相关研究? 该论文涉及的相关研究主要分布在\*\*参考到视频(R2V)生成的基准测试\*\*与\*\*训练数据\*\*两个方向,现有工作的共同特点是在任务覆盖范围与参考类型多样性上存在明显局限。 --- ### 1. Reference-to-Video 生成的基准测试 #### 现有 R2V 评估基准 现有基准主要围绕\*\*内容参考\*\*(如主体身份、外观一致性)展开,对异构参考类型及组合式控制的评估覆盖不足: - \*\*OpenS2V-Eval / OpenS2V-Nexus
56
**:提出了百万级规模的 subject-to-video 数据集与评估基准,核心评估对象为内容参考下的人物/主体一致性,但未系统覆盖运动、风格、结构、叙事等参考维度。 - **VACE-Bench
21
**:伴随 VACE 框架提出,支持多模态视频编辑与创作,但评估范围仍偏向内容参考及其简单组合。 - **UniVBench
48
**:旨在为视频基础模型提供统一评估协议,然而在 R2V 的细粒度参考控制(尤其是异构参考的解耦与路由)方面覆盖有限。 - **IntelligentVBench
33
**:与 OmniWeaving
33
相关,探索了自由组合与推理能力,但评估重心仍集中于内容参考。 - **FashionVideoBench / LoomVideo
52
**:关注时尚视频领域与多模态输入统一,任务场景相对专门化。 - **MultiRef-Compass
58
**:针对多参考到音视频生成进行初步评估,但在参考类型的广度(如结构、叙事)和因素级评估粒度上仍显不足。 #### R2V 生成模型 伴随评估需求,商业系统与研究模型快速发展: - **闭源模型**:Sora 2
31
、Vidu
2
、SkyReels-V3
25
、Seedance 2.0 / 2.5
35, 40
、Kling 3.0 Omni
23
、Gemini Omni
14
、HappyHorse 1.0
18
、MiniMax H3
29
等,持续扩展参考驱动生成的能力边界。 - **开源/研究模型**:UniVideo
47
、OmniWeaving
33
、LoomVideo
52
、Bernini
28
、Lynx
34
、HuMo
7
、OmniShow
60
、OmniVCUS
3
、Stand-In
54
、HunyuanCustom
19
等,探索了主体定制、多模态条件控制、身份保持与多参考组合等方向。 —- ### 2. Reference-to-Video 生成的训练数据 #### 大规模通用视频数据集 现有大规模数据集主要为**文本到视频(T2V)**生成设计,而非针对参考驱动生成: - **OpenVid-1M
30
**、**MiraData
22
**、**OpenHumanVid
26
**、**Koala-36M
44
**:提供大规模视频-文本对,支持文本到视频训练,但缺乏对异构参考条件(如参考图像/视频的结构、风格、运动)的显式构建。 #### 参考条件生成数据集 针对 R2V 的数据资源相对有限,且呈现任务碎片化特征: - **OpenS2V-5M
56
**:大规模 subject-to-video 数据集,支持内容参考训练,但未覆盖运动、风格、结构、叙事等异构参考类型。 - **Phantom-Data
9
**:面向通用主体一致视频生成的数据集(约 1M 规模),仍以内容参考为核心。 - **MuSS
57
**:面向电影叙事的多镜头主体到视频数据集(约 30K),侧重主体一致性与多镜头叙事,参考类型覆盖较窄。 - **OmniVCUS
3
**:支持多模态控制条件的前馈式视频定制,但在数据规模 Q3: 论文如何解决这个问题? 该论文通过**构建互补的评估基础设施与训练资源**来解决上述问题,具体方案可分为三个层面: —- ### 1. 建立 OmniVBench:系统化与细粒度的评估基准 #### 1.1 扩展参考中心的任务分类体系 突破现有基准以内容参考为主的局限,将R2V任务空间扩展为**7个任务族(Task Families)**与**18个细粒度子任务(Sub-Tasks)**: - **单参考任务**:涵盖内容(Content,含物体、角色、场景)、运动(Motion,含动作、摄像机运动)、风格(Style)、结构(Structure,含Greybox、线稿、粗略故事板)、叙事(Narrative,含多格故事板、故事视频、前镜延续)。 - **多参考任务**:涵盖多内容组合(Multi-Content)与跨维度组合(Cross-Aspect,如内容+运动、内容+风格、内容+结构、内容+叙事等)。 #### 1.2 提出因素级评估协议(Factor-Grounded Evaluation) 针对每个评估案例,构建**12,172项案例特定检查清单(Case-Specific Checklists)**,从三个维度显式诊断模型行为: - **参考保真度(Reference Fidelity, RF)**:衡量指定参考因素是否被忠实保留或转移。下设内容、结构、运动、风格、叙事保真度5个L2子维度。 - **指令实现度(Instruction Realization, IR)**:衡量指令操作是否正确实现。下设**参考因素解耦与路由(Reference-Factor Disentanglement and Routing)**与**目标符合度(Target Compliance)**2个L2子维度,显式考核模型是否将参考因素从原始载体(如身份、场景)中正确分离,并绑定到指令指定的输出目标。 - **视频质量(Video Quality, VQ)**:独立评估技术质量、美学质量与物理合理性。 评分采用层级化聚合机制。设样本 i 在维度 d 下的活跃L2子维度集合为 Gi^d ,各子维度 g 下的活跃准则集合为 A(i,g) ,准则得分 z_(i,c) 经归一化后,样本维度得分计算为:
Si^d = (1) / (|G_i^d|) ∑(g ∈ Gi^d) (1) / (|A(i,g)|) ∑(c ∈ A_i,g) z(i,c)
该协议确保不同参考因素和指令要求被独立考核,而非仅依赖整体相似性指标。 #### 1.3 验证评估协议的有效性 通过大规模人工评测验证,因素级检查清单在Pearson与Spearman相关系数上均显著优于传统整体评估(Holistic Evaluation),证明该协议能更精确地反映人类判断。 —- ### 2. 构建 Omni-R2V Dataset:大规模异构训练数据 #### 2.1 数据规模与覆盖 构建包含约 **340K** 处理后训练样本的数据集,覆盖2D动画、3D动画与真人视频,分辨率从480p到2160p+。与现有数据集不同,该数据集直接提供处理好的参考–目标对及对应指令,无需用户自行下载和处理原始视频。 #### 2.2 任务特定的数据构建流水线 设计可扩展的构建策略,核心包括两种互补策略: - **跨对匹配(Cross-Pair Matching)**:从不同视频片段中检索满足任务关系的参考。例如,跨片段匹配同一角色身份(内容参考)、检索风格一致的异内容画面(风格参考)、选取时序相邻镜头(叙事参考)。 - **逆向构建(Inverse Construction)**:从目标视频出发,通过**提取工具**(如线稿提取、深度估计、镜头边界检测)或**生成工具**(如可控视频生成、图像编辑模型)构造参考,确保参考保留任务所需信息,同时改变其他方面。 - 例如,动作参考通过动作迁移模型将目标动作施加到不同身份的角色上;Greybox参考通过首帧结构编辑结合深度序列生成;摄像机运动参考则通过Unreal Engine合成或基于位姿估计的相似轨迹检索获得。 针对多参考任务,将上述策略获得的参考进行组合,确保各参考分别控制输出的不同方面。最后,利用Gemini-3.1-Pro生成参考与目标的描述,再通过DeepSeek-V4-Pro转换为训练指令,明确参考角色与目标实体/因素之间的对应关系。 —- ### 3. 开展大规模诊断性实验 对11个先进开源与闭源模型(如UniVideo、OmniWeaving、Bernini、MiniMax H3、Kling 3.0 Omni、Seedance 2.5、Gemini Omni等)进行系统评估,揭示关键结论: - 当前模型在内容参考上表现相对较好,但在**运动、风格、结构、叙事及多参考组合**上存在显著性能差距; - 开源与闭源模型差距正在缩小,但没有任何模型能在所有任务族上 consistently 表现优异; - Q4: 论文做了哪些实验? 论文围绕 OmniVBench 与 Omni-R2V Dataset 开展了一系列系统性实验,涵盖模型能力诊断、评估协议验证及定性分析三个层面。具体实验内容如下: —- ### 1. 模型选取与实验设置 实验评估了 11 个具有代表性的先进 R2V 模型,涵盖开源与闭源两类: - **开源模型**:UniVideo、OmniWeaving、LoomVideo、Bernini、MiniMax H3 - **闭源模型**:Vidu-Q2-Pro、Kling 3.0 Omni、HappyHorse 1.0、Gemini Omni、Seedance 2.0、Seedance 2.5 所有模型均在 OmniVBench 的 813 个评估案例上进行测试,并统一采用论文提出的因素级检查清单协议进行打分。 —- ### 2. OmniVBench 总体性能评估 在 7 个任务族(Content、Motion、Style、Structure、Narrative、Multi-Content、Cross-Aspect)上,对各模型的综合得分进行排名与对比。综合得分由 Reference Fidelity(RF)、Instruction Realization(IR)、Video Quality(VQ)三项等权平均得到。实验发现: - 最强开源模型(MiniMax H3)已接近部分闭源模型水平; - 当前所有模型在 **Content** 参考上表现相对较好,但在 **Motion、Style、Structure、Narrative** 及多参考设置上存在显著差距; - 没有任何单一模型在所有任务族上 consistently 领先。 —- ### 3. 三维度细粒度能力分析 将模型性能显式分解到三个 L1 评估维度: - **Reference Fidelity(RF)** - **Instruction Realization(IR)** - **Video Quality(VQ)** 实验结果表明,各维度之间存在显著差异:某一维度的强势并不必然迁移至其他维度,支持了将参考保真度、指令实现度与视频质量进行显式解耦评估的必要性。 —- ### 4. 参考保真度(RF)的子维度诊断 进一步将 RF 拆解为 5 个 L2 子维度:**Content、Structure、Motion、Style、Narrative Fidelity**,并在不同任务族下对各模型进行交叉对比。实验揭示: - 模型在内容保真度上的优势**无法自动转化**为运动、结构或叙事保真度; - 各模型在不同参考因素上呈现出差异化的优势与缺陷,验证了因素级(factor-level)评估相较于单一整体性指标的诊断价值。 —- ### 5. 指令实现度(IR)的子维度诊断 将 IR 分解为两个 L2 子维度进行量化: - **IRDR(Reference-Factor Disentanglement and Routing)**:参考因素的解耦与正确路由 - **IRTC(Target Compliance)**:目标符合度 实验发现: - 多数模型在 **IRTC**(遵循目标指令)上得分较高,但在 **IRDR**(从参考中选择性提取正确因素并绑定到指定目标)上得分明显偏低; - 在 Multi-Content 与 Cross-Aspect 任务上,该差距尤为突出,表明模型常出现”复制了不应保留的参考内容”或”将参考因素施加到错误目标”的现象。 —- ### 6. 评估协议有效性验证 #### 6.1 自动评估与人工判断的一致性 从全部任务族与 18 个子任务中采样 100 个案例,获得 965 个模型输出,由 3 名人工标注员独立按 5 分制对 RF、IR、VQ 进行评分。结果显示自动评估与人工判断具有强相关性: | Dimension | Pearson | Spearman | |—————-|————-|—————| | RF | 0.81 | 0.77 | | IR | 0.78 | 0.74 | | VQ | 0.86 | 0.82 | #### 6.2 因素级检查清单 vs. 整体评估 对比实验表明,基于因素级检查清单(factor-grounded checklist)的评估方式在 Spearman 相关系数上显著优于传统的整体评估(holistic evaluation): | Eval. Method | RF Spearman | IR Spearman | |——————-|——————-|——————-| | Holistic | 0.67 | 0.69 | | Factor-grounded checklist | 0.77 | 0.74 | 这验证了显式评估案例特定参考因素所带来的评估精度提升。 —- ### 7. Omni-R2V 数据质量人工评估 从 7 个任务族中各随机采样约 100 个训练样本,由 2 名标注员进行 Pass/Fail 质检,考核三项指标: - **Reference Usability**:参考是否清晰包含任务所需信息 - **Reference–Target Consistency**:目标是否正确反映应保留的参考因素 - **Instruction Correctness**:指令是否准确指定参考角色与目标要求 整体平均通过率为 **95.5%**,各任务族质检结果详见论文附录 Table A.6。 —- ### 8. 定性结果分析 论文提供了大量跨任务族的定性对比(附录 Figures A.2–A.8),涵盖: - **多参考案例的因素级评估示例**(Figure A.2):展示针对同一组多参考输入(角色+物体+场景+图案),不同模型在 RF/IR 各项检查清单上的得分差异; - **内容参考、结构参考、叙事参考、风格参考、跨维度参考**的生成结果对比(Figures A.3–A.8),直观呈现各模型在身份保持、结构遵循、故事连贯性、风格迁移与多条件组合上的优劣。 Q5: 有什么可以进一步探索的点? 基于论文的实验发现与当前 R2V 领域的发展现状,以下方向具有显著的进一步探索价值: —- ### 1. 模型架构与算法改进 **统一的多因素解耦与路由机制** 论文揭示当前模型在 **Reference-Factor Disentanglement and Routing (IRDR)** 上存在明显短板,尤其在多内容与跨维度任务中,模型常将参考因素错误绑定或复制无关信息。未来可探索: - 显式的因素解耦表征学习,将参考信号在隐空间分解为独立、可解释的内容/运动/风格/结构子空间; - 基于图注意力或槽位(slot-based)路由机制,建立从多参考输入到输出目标的显式条件–槽位对应(condition–slot correspondence),避免因素间的无意识覆盖。 **跨维度参考的联合优化** Cross-Aspect 任务(如内容+运动、内容+结构)要求模型同时处理异构参考并抑制维度间干扰。现有模型在此类任务上仍有较大提升空间。可研究: - 多尺度条件注入与冲突消解策略,防止某一参考(如强语义的内容参考)压倒其他参考(如细粒度的风格或运动参考); - 动态权重机制或基于指令的参考重要性调制,使模型根据文本指令自适应地调整各参考条件的贡献强度。 **长时序叙事理解与生成** Narrative 任务(尤其是故事板与镜头延续)涉及事件因果、角色关系与跨镜头状态一致性。当前模型在此类任务上表现不稳定,未来可探索: - 结合大语言模型(LLM)进行显式的叙事规划(narrative planning),将故事结构先验注入视频生成过程; - 长视频上下文建模,提升对跨镜头时间跨度较大的连续状态保持能力。 —- ### 2. 数据构建与训练策略 **更大规模与更自动化的数据生产** Omni-R2V 提供了 340K 样本,但相较于 OpenS2V-5M 等文本到视频数据集规模仍相对有限。进一步探索包括: - 开发**任务无关或弱监督的参考–目标对挖掘方法**,降低对人工设计 task-specific pipelines 的依赖; - 引入**负样本与难例(hard negatives)挖掘**,例如构造外观相似但动作不同的参考对,或风格相似但内容冲突的组合,以显式增强模型的解耦能力。 **课程学习与多任务训练范式** 论文显示模型在不同任务族上的能力迁移有限。未来可研究: - 课程学习(curriculum learning)策略,从单参考单因素任务逐步过渡到多参考组合任务; - 多任务联合训练中的梯度平衡与任务间知识迁移机制,避免某一任务族(如内容参考)主导优化过程而抑制其他因素的学习。 —- ### 3. 评估方法与指标深化 **超越 VLM 的细粒度自动评估** 当前因素级评估依赖视觉语言模型(VLM)进行判断,其性能受限于 VLM 自身的视觉理解能力。可探索: - 针对特定参考因素(如相机轨迹、物理运动、风格笔触)的**专用判别器或度量学习模型**,提供更客观、可重复的量化指标; - 引入时序敏感的评估指标,显式衡量生成视频在关键帧(key poses/anchors)之间插值的连续性与物理合理性,而非仅评估单帧或整体相似度。 **物理合理性与美学质量的独立诊断** 论文将 VQ 分解为技术质量、美学质量与物理合理性,但当前物理合理性仅依赖 UnifiedReward 2.0 的单一维度。未来可扩展至: - 物体 permanence、碰撞检测、流体动力学等**细粒度物理规则验证**; - 面向专业创作场景(如电影分镜、广告制作)的人工评估协议,检验模型输出在实际工作流中的可用性。 —- ### 4. 应用拓展与社会影响 **向更多模态与维度的扩展** OmniVBench 目前聚焦于视觉参考(图像与视频),未来可向更广泛的 omni-modal 参考拓展: - 引入**音频节奏、音乐结构或 3D 空间布局**作为额外参考条件,构建音视频联合生成或 3D 感知视频合成基准; - 探索**交互式参考编辑**,允许用户在生成过程中增量式地添加、删除或修改参考条件。 **版权、隐私与内容安全** 大规模使用专业视频素材构建参考驱动模型,必然涉及: - 参考图像/视频中**人物身份、艺术作品风格与商标的版权保护**机制; - 防止模型在生成过程中过度复制训练数据中的受保护内容,同时保持足够的参考忠实度,这需要技术与政策层面的协同研究。 **与智能体(Agent)工作流的结合** 将 omni R2V 生成模型集成到自动化的视频创作 Agent 中,使其能够理解复杂的多步骤指令、自主规划参考使用策略并迭代优化生成结果,是连接学术基准与实际工业应用的重要桥梁。 Q6: 总结一下论文的主要内容 该工作针对**全能参考到视频(Omni Reference-to-Video, R2V)生成**的评估与训练资源不足问题,提出了一个系统化的基准测试和配套的大规模数据集,并在此基础上对当前主流模型进行了全面诊断分析。以下是主要内容总结: —- ### 1. 研究背景与核心问题 R2V 生成正从单一参考控制(如主体身份)向更通用的**异构、组合式参考控制**演进,涵盖内容、运动、风格、结构、叙事及其组合。然而,现有基准测试与数据集面临两大局限: - **评估层面**:覆盖范围局限于内容参考,缺乏对运动、风格、结构、叙事等多维参考的系统评估;评估粒度粗糙,仅关注整体参考一致性,无法诊断模型是否正确实现了参考因素的**保留、解耦与路由**。 - **数据层面**:现有训练数据任务碎片化,缺乏覆盖异构参考类型与多参考组合的大规模工业化训练资源。 —- ### 2. OmniVBench:全面的 Omni R2V 评估基准 #### 2.1 任务分类体系 OmniVBench 将 R2V 任务空间系统性地组织为 **7 个任务族**与 **18 个细粒度子任务**,涵盖: - **单参考任务**:内容参考(物体、角色、场景)、运动参考(动作、摄像机运动)、风格参考、结构参考(Greybox、线稿、粗略故事板)、叙事参考(多格故事板、故事视频、前镜延续)。 - **多参考任务**:多内容组合(Multi-Content)与跨维度组合(Cross-Aspect,如内容+运动、内容+风格、内容+结构、内容+叙事)。 #### 2.2 因素级评估协议(Factor-Grounded Evaluation) 该工作提出一种基于**案例特定检查清单**的细粒度评估框架,共包含 **12,172 项检查清单**,从三个维度显式考核模型输出: - **参考保真度(Reference Fidelity, RF)**:衡量指定参考因素是否被忠实保留,下设内容、结构、运动、风格、叙事 5 个子维度。 - **指令实现度(Instruction Realization, IR)**:衡量指令操作是否正确实现,下设**参考因素解耦与路由**(IRDR)与**目标符合度**(IRTC),显式诊断模型能否从参考中选择性提取目标因素并绑定至正确输出位置。 - **视频质量(Video Quality, VQ)**:独立评估技术质量、美学质量与物理合理性。 评分采用层级化聚合。设样本 i 在维度 d 下的活跃 L2 子维度集合为 G_i^d ,则其维度得分 S_i^d 为各子维度内活跃准则得分的均值再平均:
Si^d = (1) / (|G_i^d|) ∑(g ∈ Gi^d) (1) / (|A(i,g)|) ∑(c ∈ A_i,g) z(i,c)
—- ### 3. Omni-R2V Dataset:大规模异构训练数据集 该数据集包含约 **340K** 处理后的训练样本,覆盖 7 个任务族,分辨率涵盖 480p 至 2160p+,旨在为多样化 R2V 任务提供工业级训练资源。其核心构建策略包括: - **跨对匹配(Cross-Pair Matching)**:从不同视频源中检索满足特定关系的参考片段(如同一身份、相似风格、时序相邻镜头)。 - **逆向构建(Inverse Construction)**:通过提取工具(线稿提取、深度估计、镜头检测等)或生成工具(动作迁移、结构引导生成等),从目标视频构造参考,确保参考保留任务所需信息同时改变其他方面。 - **指令生成**:利用 Gemini-3.1-Pro 与 DeepSeek-V4-Pro 将参考与目标描述转换为训练指令,明确参考角色与目标实体的对应关系。 —- ### 4. 实验发现 该工作对 11 个先进开源与闭源模型(如 UniVideo、OmniWeaving、Bernini、MiniMax H3、Kling 3.0 Omni、Seedance 2.5、Gemini Omni 等)进行了系统评估,关键发现包括: - **能力分布不均**:所有模型在内容参考上表现相对较好,但在**运动、风格、结构、叙事及多参考组合**上存在显著性能差距,且某一维度的优势并不能自动迁移至其他维度。 - **开源与闭源差距缩小**:最强开源模型(如 MiniMax H3)已接近部分闭源模型水平,但没有任何模型能在所有任务族上 consistently 领先。 - **解耦与路由是瓶颈**:多数模型在目标符合度(IRTC)上得分较高,但在参考因素解耦与路由(IRDR)上表现明显较弱,表明模型常错误复制无关参考内容或将因素施加至错误目标。 - **评估协议验证**:自动评估与人工判断具有高度一致性(RF/IR/VQ 的 Pearson 相关系数分别为 0.81/0.78/0.86),且因素级检查清单显著优于整体评估。 —- ### 5. 主要贡献 - 提出了 **OmniVBench**,首个系统覆盖异构参考类型、组合式控制与因素级评估的 omni R2V 基准; - 构建了 **Omni-R2V Dataset**,约 340K 处理样本的大规模公开训练数据集,配套可扩展的数据构建流水线; - 通过广泛的模型评估揭示了当前 R2V 模型在多样化参考条件下的能力边界与关键局限,为后续研究提供了诊断基础与数据支撑。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Wenxue Li,Peiyan Guan,Haoyang Jiang,Junxian Cai,Hualuo Liu,Chunjie Zhang,Chong Guan,Kai Huang,Songlian Li,Taiyi Wu,Yongjian Yu,Xiaotong Zhao,Alan Zhao,Eric Liu,Xi Chen,Yu Liu,Lei Zhu
Categories:
PDF URL: https://arxiv.org/pdf/2609.22069.pdf
Arxiv URL: https://arxiv.org/abs/2609.22069
Arxiv ID: 2609.22069
CoolPaper URL: https://papers.cool/arxiv/2609.22069
Published: 2026-09-22T01:51:42.457Z
Updated: 2026-09-22T01:51:42.457Z
10. BI-Agent and BI-Bench: Towards Automating End-to-End Business Intelligence
Abstract:Business intelligence (BI) is a cornerstone of enterprise decision-making and is widely used by enterprise users in software such as Power BI and Tableau. In traditional BI workflows, users need to prepare data by (1) identifying relevant tables, (2) performing data transformations, and (3) building join relationships, before they can (4) answer their business questions. These steps can be complex and time-consuming, making BI challenging. Given the strong capabilities of large language models (LLMs) in working with data, we study their ability to answer BI questions end-to-end, without requiring users to manually perform the tedious preparation steps. To do this, we harvest a large collection of real-world BI projects from public sources, and manually extract pairs of (questions, ground-truth answers) from real user dashboards. The resulting benchmark, BI-Bench, is the first benchmark to systematically study LLMs’ ability on end-to-end BI. We find that even frontier LLMs perform poorly on BI-Bench, with less than 50% accuracy. To address their limitations, we design a tool-augmented BI-Agent that decomposes BI workflows into subtasks on structured data, such as search, join, and transform, and orchestrates specialized data management methods across BI stages. Furthermore, we develop a post-training framework that synthesizes training trajectories from real BI projects, enabling BI-Agent to be further post-trained using both supervised fine-tuning (SFT) and reinforcement learning (RL). BI-Agent achieves substantial accuracy gains of up to 40 percentage points with vanilla LLMs, and post-trained BI-Agent yields gains of up to 30 points. Our results highlight the importance of combining tool-augmented reasoning with domain-specific post-training in complex BI workflows, and point to promising directions for future research.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.20886 (HTTP 429)
Authors: Chuxuan Hu,Yeye He,Penny Zhou,Wee Hyong Tok,Daniel Kang,Surajit Chaudhuri
Categories:
PDF URL: https://arxiv.org/pdf/2609.20886.pdf
Arxiv URL: https://arxiv.org/abs/2609.20886
Arxiv ID: 2609.20886
CoolPaper URL: https://papers.cool/arxiv/2609.20886
Published: 2026-09-22T01:51:42.610Z
Updated: 2026-09-22T01:51:42.610Z
11. MintAct: A Unified Visual Agent for Digital Environments
Abstract:We present MintAct, a family of vision-language models that unifies UI grounding, multi-step navigation across mobile, desktop, and web, and visual tool use, trained at 2B, 4B, and 8B scales. Through careful design of our environments, data, and training recipes, MintAct models match the performance of per-domain specialists across all of these capabilities. To enable this, we develop a scalable environment and reinforcement learning (RL) infrastructure. On the environment side, we host hundreds of concurrent instances across heterogeneous per-domain backends, serving both trajectory data collection and online RL. To enable efficient and scalable RL training, an asynchronous framework keeps explicit control over the cross-domain training distribution and remains stable under noisy environment feedback and off-policy drift. Experimental results show that MintAct achieves state-of-the-art performance (48.9 on OSWorld-Verified) across a wide range of benchmarks at comparable model sizes.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*视觉语言智能体(vision-language agents)能力碎片化\*\*的问题,即当前数字环境中的各项能力(UI 定位、多步导航、视觉工具使用等)被分散在多个专门模型中,导致部署成本高、扩展性差,尤其难以适应资源受限的端侧场景。具体而言,论文聚焦于以下几个层面的挑战: \*\*1. 能力碎片化与模型统一\*\* - 现有工作将 UI 定位(UI grounding)、移动端导航(mobile navigation)、桌面端控制(desktop control)、网页导航(web navigation)和视觉工具使用(visual tool use)视为独立任务,分别构建、训练和评测。 - 这种“每域一个专家”的范式在 serving 和 scaling 时成本高昂,且在 2B–8B 参数的紧凑模型上尤为不切实际。 - 论文提出的核心问题是:\*\*能否在单一模型中统一所有这些能力,同时不牺牲各领域的 specialist 性能?\*\* \*\*2. 跨域异构性带来的数据与环境挑战\*\* - 不同领域的观察空间(observation space)和动作空间(action space)各不相同:移动端依赖触屏手势,桌面端依赖鼠标键盘,网页端有独立的导航语义,视觉工具使用则涉及结构化函数调用。 - 各域的数据来源、原生交互方式和可执行环境也截然不同。若简单合并动作空间或混合数据,会导致域间干扰(domain interference),侵蚀单域质量。 \*\*3. 多域异步强化学习的训练难题\*\* - 可靠的交互行为越来越依赖在线强化学习(RL),但各域后端异构且缓慢(如模拟器、浏览器、沙盒环境),产生高延迟、高方差的长程多模态轨迹。 - 同步 RL 会导致严重的 GPU 空闲;而朴素异步 RL 虽然提升吞吐,却会使训练分布向“ rollout 更快”的域漂移,破坏跨域平衡。 - 因此,统一不仅是建模问题,更是\*\*数据混合、环境基础设施和稳定异步训练\*\*的系统问题。 \*\*4. 端侧部署与实用性的矛盾\*\* - 论文特别关注 2B、4B、8B 规模的轻量级模型,希望在不依赖云端大模型的前提下,实现跨平台的通用数字助手能力。 综上,MintAct 旨在通过统一的环境设计、数据管线、多阶段训练配方(SFT → per-domain RL → RFT distillation → joint RL)以及可扩展的异步 RL 基础设施,训练出一个\*\*单一、轻量、跨域且性能匹敌各领域专家\*\*的视觉智能体。 Q2: 有哪些相关研究? 根据论文第 2 节(Related Work),相关研究主要分布在\*\*视觉智能体(Visual Agents)\*\*与\*\*面向智能体的异步强化学习(Asynchronous RL for Agents)\*\*两大方向,具体如下: ### 1. 视觉智能体(Visual Agents) 该方向可进一步细分为 \*\*GUI 定位与导航\*\*、\*\*视觉工具使用\*\* 两类。 #### 1.1 GUI 定位与导航(GUI Grounding and Navigation) 现有工作大多针对特定平台设计专门的行动空间、指令微调数据或 RL 训练流程,但鲜有单一模型同时覆盖多平台。 - \*\*移动端(Mobile)\*\* - \*\*Ferret-UI Lite\*\*(Yang et al., 2025c):通过多样化的 GUI 数据与强化学习构建紧凑的端侧智能体。 - \*\*MAI-UI\*\*(Zhou et al., 2025):结合在线 RL 与端云协同,面向真实场景部署。 - \*\*Mobile-Agent 系列\*\*(Wang et al., 2024b,a):逐步引入多智能体规划、反思、经验复用与基于环境的可扩展训练,以提升复杂移动导航能力。 - \*\*桌面端(Desktop)\*\* - \*\*UI-TARS\*\*(ByteDance Seed, 2025; Qin et al., 2025):利用高分辨率定位与长程跨平台交互推进桌面智能体。 - \*\*OpenCUA\*\*(Wang et al., 2026):开源的计算机使用智能体基础模型。 - \*\*EvoCUA\*\*(Xue et al., 2026):将任务生成、沙盒探索与自动验证整合为自进化训练闭环。 - \*\*网页端(Web)\*\* - \*\*ScaleCUA\*\*(Liu et al., 2026):通过规模化多样来源的交互数据提升跨站点泛化能力。 - \*\*Weblica\*\*(Kar et al., 2026):通过网站回放与合成构建多样化、可复现的网页环境,支持视觉网页智能体的大规模强化学习。 #### 1.2 视觉工具使用(Visual Tool Use) 该方向关注如何将视觉输入落地为结构化工具调用或可执行代码,以完成仅靠底层 UI 操作难以实现的任务。 - \*\*以图像为中心的工具辅助推理\*\* - \*\*Visual ChatGPT\*\*(Wu et al., 2023):编排预训练视觉专家完成多模态任务。 - \*\*GPT4Tools\*\*(Yang et al., 2023):从工具使用轨迹中学习多步工具选择。 - \*\*DeepEyes / OpenThinkIMG / Thyme / DeepEyesV2\*\*(Zheng et al., 2026; Su et al., 2025; Zhang et al., 2025c; Hong et al., 2026):利用强化学习将图像操作(裁剪、缩放、代码执行等)与推理、检索交错进行。 - \*\*混合式计算机使用智能体(Hybrid Computer-Use Agents)\*\* - \*\*MAI-UI / UltraCUA\*\*(Zhou et al., 2025; Yang et al., 2025b):将 GUI 交互与工具、API 及代码执行相结合。 - 相关评测基准包括 \*\*MobileWorld\*\*、\*\*OSWorld-MCP\*\*、\*\*Agents-last-exam\*\*(Kong et al., 2026; Jia et al., 2026; Sun et al., 2026)。 - \*\*多轮对话式视觉工具使用\*\* - \*\*MM-ToolSandBox\*\*(Ma et al., 2026):支持在多轮、多图像、状态化的环境中评测视觉工具调用,MintAct 即在此基础上扩展了相关能力。 --- ### 2. 面向智能体的异步强化学习(Asynchronous RL for Agents) 由于 GUI 交互的 rollout 延迟高、方差大且轨迹长,同步 RL 会造成严重的 GPU 空闲,因此异步 RL 成为 scaling post-training 的关键技术。 #### 2.1 异步 RL(Asynchronous RL) - \*\*Magistral\*\*(Rastogi et al., 2025):采用连续生成与高频 inflight 策略同步,以平衡吞吐与 on-policyness。 - \*\*AReaL\*\*(Fu et al., 2026):完全解耦 rollout 生成与策略优化,通过负载均衡与 off-policy 校正控制轨迹陈旧度。 - \*\*AsyncFlow\*\*(Han et al., 2025):基于分布式流式数据管理与动态负载均衡减少资源闲置。 #### 2.2 多轮/多域异步 RL(Multi-turn Asynchronous RL) 将异步范式扩展到多轮交互与工具使用场景,以应对更长的 rollout 延迟与更 uneven 的轨迹长度。 - \*\*AgentRL\*\*(Zhang et al., 2025b):面向多轮任务的完全异步流水线,提供统一接口。 - \*\*SkyRL-Agent\*\*(Cao et al., 2025):为长程工具使用智能体引入异步调度。 - \*\*AsyncWebRL\*\*(Bai et al., 2026):通过“永续 rollout 池”持续重叠网页 rollout、策略优化与模型同步。 上述系统大多针对\*\*单一领域或模态\*\*。MintAct 与此不同,其将异步 RL 扩展到了\*\*统一、多域视觉智能体\*\*场景,需在显式控制跨域训练分布的同时,处理异构后端、长程多模态轨迹与大规模训练。 Q3: 论文如何解决这个问题? 论文通过\*\*统一的模型设计\*\*、\*\*分阶段训练配方\*\*、\*\*可扩展的异构环境基础设施\*\*以及\*\*显式受控的异步强化学习框架\*\*,系统性地解决了视觉智能体能力碎片化与跨域训练难题。具体方法如下: --- ### 1. 统一模型设计 为让单一参数集合同时覆盖定位、导航与视觉工具使用,论文采用三项核心设计: - \*\*共享观察与定位空间\*\*:所有 UI 域(移动端、桌面端、网页端)均基于原始屏幕截图进行操作,动作通过归一化到统一尺度( 999×999 )的像素坐标定位,不依赖 DOM、可访问性树或平台专属 API,使感知与定位能力可直接跨域迁移。 - \*\*提示条件动作集\*\*:避免将各域动作空间简单合并为一个庞大的统一集合,而是通过\*\*域特定的系统提示\*\*(system prompt)暴露对应动作。推理时,模型依据目标域的提示生成该域对应的动作 token,从而在不干扰其他域的前提下支持多样化的原生交互。 - \*\*显式平衡的跨域混合\*\*:在监督微调(SFT)与强化学习(RL)的全阶段,均通过固定比例显式控制训练分布,防止单一域因数据量或 rollout 速度优势而主导训练、侵蚀其他域性能。 --- ### 2. 多阶段训练配方 论文设计了一条由简到繁、先分后合的四阶段训练流水线: - \*\*阶段一:高分辨率单步 SFT\*\* 聚焦 UI 定位与单步导航。输入分辨率高达 2,116,800 像素,利用公开静态数据集(GroundCUA、MolmoPoint、GUI-Odyssey、AndroidControl)建立基础的屏幕感知与精确坐标回归能力。 - \*\*阶段二:低分辨率多步 SFT\*\* 降低单图分辨率至 921,600 像素,以支持长历史序列的高效训练。使用在四大域环境(移动端、桌面端、网页端、视觉工具使用)中收集的多步轨迹进行联合训练,并严格保持 25:25:25:25 的域间比例。为视觉工具使用域引入\*\*工具注册表感知的轨迹分段\*\*(tool-registry-aware trajectory segmentation),在工具动态变化时将轨迹切分,确保每段监督信号的上下文与可用工具一致。 - \*\*阶段三:基于拒绝采样的 RFT(Rejection Fine-Tuning)\*\* 从阶段二得到的统一模型出发,为每个域单独训练一个 RL 专家(specialist);随后让这些专家在各自域的 SFT 任务上生成轨迹,经强 VLM 裁判过滤后保留成功轨迹,再对统一模型进行微调。该阶段将专家能力蒸馏回单一模型的同时,维持了跨域覆盖。 - \*\*阶段四:联合异步 RL\*\* 最终阶段在移动端与桌面端(并显式控制网页域与工具域的参与程度)进行联合在线优化,使模型通过直接与真实/合成环境交互,从动作结果中学习。 --- ### 3. 可扩展的环境与数据管线 为支撑上述训练,论文为每个域构建了独立的可执行环境与高吞吐数据流水线: - \*\*移动端\*\*:基于 AndroidWorld 模拟器,通过 HTTP 中间件解耦环境与 GPU 服务器,支持 100+ 并发实例。 - \*\*桌面端\*\*:基于 OSWorld Docker 容器化环境,支持 200+ 并发实例;单实例故障不中断整体训练。 - \*\*网页端\*\*:采用 Weblica 的离线缓存(Weblica-Cache)与合成网站(Weblica-Synth),消除网络延迟与反爬机制,保证可复现性。 - \*\*视觉工具使用\*\*:基于 MM-ToolSandBox 构建状态化多轮交互,支持超过 500 个层级化工具;通过动态工具检索(\`search\_tool\`)与代码执行(\`coding\_tool\`)管理大规模动作空间。 \*\*数据策略\*\*: - SFT 数据通过强教师模型(如 EvoCUA-32B、Qwen3-VL-32B-Instruct)在对应环境中 rollout 生成,并经 VLM-as-judge 过滤失败轨迹。 - RL 数据依据难度筛选:对每任务采样多条轨迹,保留成功率接近 50% 的任务,以最大化组相对策略优化(GRPO)的学习信号。 此外,论文构建了\*\*合成环境\*\*(基于 HTML/CSS/JavaScript 的 headless 浏览器环境),通过“能力飞轮”自动提取真实轨迹中的能力集群并生成对应环境与任务,用于低成本、高吞吐的 RL 训练与能力迁移。 --- ### 4. 异步强化学习框架与训练策略 为解决统一视觉智能体在 RL 中的三大瓶颈——\*\*慢环境交互\*\*、\*\*长多模态轨迹\*\*、\*\*受控混合训练\*\*——论文开发了面向异构多域的异步 RL 系统。 #### 4.1 基础设施架构 系统由以下组件闭环构成: - \*\*Rollouter\*\*:通过 SGLang 路由器调度大量并发 rollout 进程,依据负载与 KV-cache 亲和性分发推理请求。 - \*\*Environment Manager\*\*:维护分域的环境池(mobile/web/desktop/VTU/synthetic),为每个 rollout 独占分配环境,任务结束后回收复用。 - \*\*Message Queue\*\*:FIFO 缓冲 trajectory groups,容量设为 mini-batch 大小的可配置倍数;超出容量时淘汰最旧的未消费组,以限制样本陈旧度。 - \*\*轻量多模态卸载\*\*:队列中仅存储图像文件引用与元数据,历史截图写入磁盘;Trainer 消费时按需加载,降低主机内存压力。 - \*\*Parameter Synchronizer\*\*:每 K 个训练步将 Megatron 训练端的权重同步至 SGLang 推理端,控制策略陈旧。 #### 4.2 训练稳定性与 off-policy 校正 在多轮、异步、异构环境中,论文引入四项关键机制(如论文 Table 2 所示): \*\*(1)训练组成控制:对抗分布漂移\*\* - \*\*Per-domain quota\*\*:Trainer 按域配额 q_d (如两域联合训练时各 32/64)消费队列中的 trajectory groups,拒绝超额域的数据,确保实际训练分布符合预设比例。 - \*\*Quota-normalized backpressure\*\*:生产者端监控各域已准入的累计组数 c_d ,计算 r_d = c_d / q_d ;若某域领先最慢域超过一个训练批次,则暂停该域的 rollout 生成,避免产生大量将被丢弃的冗余数据。 \*\*(2)Off-policy 与噪声鲁棒性\*\* - \*\*环境失败掩码\*\*:检测由系统故障、无效状态或超时导致的假阴性奖励,在计算组统计量与策略损失时将这些轨迹屏蔽。 - \*\*双裁剪替代目标(Dual-clip surrogate)\*\*:针对 rollout 策略与训练策略之间的\*\*陈旧度差距\*\*(staleness gap),定义比例 r_(i,t)(θ) = exp(clip(logπ_θ - logπ_(prox), ±kappa)) ,并采用非对称裁剪:
ell(i,t)^(clip) = ell(i,t)^(hi), & Ai ≥ 0, min(-cA_i, ell(i,t)^(hi)), & Ai < 0,
其中 ell(i,t)^(hi) = max(-Ai r(i,t), -Ai,clip(r(i,t), 1-varepsilon(lo), 1+varepsilon(hi))) ,参数取 varepsilon(lo)=0.2, varepsilon(hi)=0.28, c=3, kappa=20 。该设计对低于基线的轨迹施加额外下界,防止 off-policy 更新在劣势方向上发散过快。 - **截断重要性采样权重(Truncated IS weight)**:针对推理引擎与训练引擎之间的**引擎差距**(engine gap),以推理端实际输出的分布 π(roll) 为基准,计算重要性比:
rho(i,t) = exp(clip(logπ(prox) - logπ(roll), ±kappa)), quad w(i,t) = m(i,t) · sg[min(rho(i,t), C)],
其中 C=2 ,sg 表示 stop-gradient;仅对数值不匹配导致的高方差 token 进行单侧上截断降权,避免少数异常 token 主导梯度。 最终优化目标为:
L(θ) = (1) / (S)∑_i∑_t w(i,t),ell(i,t)^(clip), quad S = min(max_i |y_i|, L(∩)),
其中响应掩码 m_(i,t) 独立控制 token 贡献,掩码不会将权重重新分配至幸存 token。训练不使用 KL 锚定策略或熵奖励。 —- ### 5. 总结 通过上述统一设计,MintAct 将移动端、桌面端、网页端的导航与视觉工具使用集成在 2B/4B/8B 的单一模型中。实验表明,该统一模型在各域的基准测试上**匹配或超越了同等规模的单域专家**,同时解决了跨域训练中的分布漂移、off-policy 不稳定与资源利用低效问题。 Q4: 论文做了哪些实验? 论文的实验围绕**统一模型的跨域性能验证**、**各训练阶段的贡献分析**以及**合成环境与真实环境的对比**展开,覆盖 2B、4B、8B 三个模型尺度。实验结果主要汇总于第 4 节与附录 A。 —- ### 1. 实验设置 **评测基准**。论文在以下领域选取了代表性 benchmark: - **定位(Grounding)**:MMBench-GUI、ScreenSpot-v2、UI-Vision、OSWorld-G - **移动导航(Mobile Navigation)**:AndroidControl、AndroidWorld - **桌面导航(Desktop Navigation)**:OSWorld-Verified - **网页导航(Web Navigation)**:Weblica、Online-Mind2Web(Om2W) - **视觉工具使用(Visual Tool Use)**:MM-ToolSandBox 在线导航任务的最大步数设为 30,视觉工具使用任务设为 100。 —- ### 2. 主要结果 Table 3 展示了 MintAct 在三个尺度上的最终性能与同规模基线的全面对比。 - **相较初始化模型的提升**:以 8B 为例,MintAct-Final 相比 Qwen3-VL-8B-Instruct 在 AndroidWorld 上从 47.6 提升至 67.0,在 OSWorld-Verified 上从 33.9 提升至 48.9,在 Weblica 上从 55.5 提升至 74.7,在 MM-ToolSandBox 上从 3.1 提升至 24.5。 - **与单域专家的对比**:单一 MintAct 模型同时达到或超过了各域专用基线。例如 MintAct-8B-Final 在 OSWorld-Verified(48.9)、Weblica(74.7)、UI-Vision(56.6)和 OSWorld-G(64.5)上取得了同规模公开模型中的最佳分数,同时在 AndroidWorld(67.0)等基准上保持强竞争力。 —- ### 3. 消融实验 #### 3.1 联合 SFT 模型与单域 SFT 专家(Table 4) 为验证“统一训练不损害单域性能”,论文将联合训练的 MintAct-SFT-8B 与仅在各自域上训练的 SFT 专家对比: - 在移动导航(AndroidControl 71.0 vs 69.8)、桌面导航(OSWorld-Verified 42.6 vs 37.7)和视觉工具使用(MM-ToolSandBox 19.8 vs 19.8)上,联合模型匹配或超过单域专家。 - 在定位(MMBench-GUI 82.7 vs 84.1)和网页导航(Weblica 57.5 vs 57.9)上处于相近水平。 #### 3.2 多阶段 SFT 的必要性(Table 5) 通过消融高分辨率单步 SFT(Stage 1)与低分辨率多步 SFT(Stage 2)验证两者互补性: - **仅 Stage 1**:定位能力突出(UI-Vision 59.3),但多步交互极弱(OSWorld-Verified 9.4,Weblica 15.6)。 - **仅 Stage 2**:导航与工具使用显著恢复(OSWorld-Verified 41.5,Weblica 59.1),但定位严重退化(UI-Vision 降至 25.0)。 - **两阶段结合**:在保持强定位(UI-Vision 56.9)的同时实现高导航与工具使用性能,证明两阶段缺一不可。 #### 3.3 RFT 蒸馏的有效性(Table 6) 在 MintAct-SFT 基础上,先训练各域 RL 专家,再通过拒绝采样(Rejection Sampling)蒸馏回统一模型: - **跨尺度一致增益**:在 8B 上,RFT 将 AndroidWorld 从 63.8 提升至 68.1,Weblica 从 57.5 提升至 72.8,Om2W 从 30.0 提升至 36.3;2B 与 4B 上也呈现类似趋势。 - **单模型保持多域覆盖**:RFT 模型在提升导航与工具使用的同时, grounding 分数基本不变(如 UI-Vision 56.9 → 56.3)。 #### 3.4 联合 RL 与单域 RL 专家(Table 7) 从 MintAct-SFT-8B 出发,对比仅在单域做 RL(RL-mobile、RL-desktop)与在移动+桌面联合做 RL(RL-joint): - **平均性能更优**:联合模型在导航平均(Nav. Avg.)上达到 55.9,超过 RL-mobile(54.1)与 RL-desktop(54.3)。 - **跨域迁移**:联合 RL 未使用任何网页数据,但 Weblica 从 57.5 提升至 60.8,Om2W 从 30.0 提升至 32.8;而视觉工具使用因未参与训练,维持在 SFT 水平(19.8)。 #### 3.5 联合 RL 在 RFT 基础上的进一步提升(Table 6) 对比 MintAct-RFT 与最终 MintAct-Final(RFT + 联合 RL): - **持续增益**:在 8B 上,OSWorld-Verified 从 43.1 提升至 48.9,Weblica 从 72.8 提升至 74.7,Om2W 从 36.3 提升至 39.1;4B 与 2B 上也呈现相同趋势。 - **定位稳定**:所有 grounding 指标波动均在约 1 个百分点以内。 #### 3.6 合成环境的贡献(Table 8) 论文构建了基于 headless 浏览器的合成环境,并 Q5: 有什么可以进一步探索的点? 根据论文第 6 节(Limitation),以下是可以进一步探索的研究方向: —- ### 1. 将联合强化学习扩展至全部环境 当前联合 RL 仅在移动端与桌面端进行,实验已表明这种联合训练能带来平均性能提升。一个直接的方向是将联合 RL 同时覆盖移动端、桌面端、网页端以及视觉工具使用域。然而,这要求在整个训练过程中持续并发维持大量异构环境,资源消耗极高,因此留待未来工作探索。 —- ### 2. 长程交互的上下文管理 现有训练流程将每一步的屏幕截图直接追加到上下文中,这种方式虽对 RL 最简便,但随着轨迹延长,上下文长度与显存占用会急剧增长。未来可探索更智能的上下文管理机制,例如对历史观察进行**总结、压缩或剪枝**,从而在保持任务相关性的前提下支持更长程的交互任务。 —- ### 3. 导航与工具使用的深度融合 当前视觉工具使用在很大程度上仍被当作一项独立能力。理想的统一智能体应能在**像素级 UI 导航**与**动态工具调用**之间自动、按需切换:仅在工具比直接交互更高效或更可行时才调用外部 API。实现这种无缝、由策略自身决定的混合行为,是未来统一视觉智能体的重要方向。 —- ### 4. 端侧与云端模型的协作机制 MintAct 的 2B–8B 规模非常适合端侧部署。值得探索的方向是研究**端侧小模型与云端大模型的协作范式**:端侧模型在本地处理简单、高频或隐私敏感的任务,仅在超出能力范围时将任务无缝移交至服务器端大模型。这种架构有望兼顾低延迟、隐私保护与强大能力。 —- ### 5. 动态工具发现与函数调用范式 论文沿用了标准函数调用(function-calling)范式,将可用工具定义作为模型上下文的一部分。但在动态工具注册场景下,新发现的工具必须在执行过程中插入,导致**提示前缀发生变化**,削弱了前缀缓存(prefix caching)的效率。 目前的训练方法通过**轨迹分段**(trajectory segmentation)来应对:每当工具集变化时,将轨迹切分为独立样本,每段使用对应的更新后系统提示,并将轨迹级奖励赋给各段。这种处理方式仅为**粗略的信用分配近似**,虽实用但不够优雅。 未来可探索: - 原生支持**动态工具发现**的函数调用接口(如延迟加载或动态注入工具定义),避免重构前文上下文; - 采用**编码智能体(coding-agent)接口**,通过稳定的代码执行环境以编程方式发现和调用工具; - 设计更**原则性的分段级信用分配机制**,替代当前的近似处理。 Q6: 总结一下论文的主要内容 该研究提出了 **MintAct**,一个参数规模为 2B、4B 和 8B 的统一视觉语言智能体家族,旨在解决当前数字环境中 UI 定位(grounding)、跨平台多步导航(移动端、桌面端、网页端)以及视觉工具使用(visual tool use)能力高度碎片化的问题。以下从问题动机、方法设计、实验验证与核心结论四个层面进行总结。 —- ### 1. 研究背景与核心问题 现有视觉智能体通常针对单一平台或任务独立构建专家模型(specialist),导致部署成本高、扩展性差,尤其不利于资源受限的端侧场景。将上述能力统一到单一模型中面临三重挑战: - **域间异构性**:各平台的观察空间(原始截图)、动作空间(触屏、键鼠、函数调用)及交互语义截然不同,简单合并数据或动作集合会造成域间干扰。 - **环境与数据瓶颈**:在线强化学习(RL)依赖异构后端(模拟器、浏览器、沙盒), rollout 延迟高、方差大,且轨迹为多模态长序列,训练资源消耗巨大。 - **分布漂移**:在异步训练中,不同域的环境速度差异会导致实际训练分布向“更快”的域漂移,破坏跨域平衡。 —- ### 2. 统一模型与训练方法 为实现“单一模型、多域覆盖、不损性能”,论文从模型架构、训练配方和基础设施三个层面进行系统设计。 #### 2.1 统一模型设计 - **共享像素坐标空间**:所有 UI 域均基于原始屏幕截图操作,动作通过归一化到 999×999 的像素坐标定位,不依赖 DOM 或平台专属 API,使感知能力直接跨域迁移。 - **提示条件动作集**:通过**域特定系统提示**(system prompt)动态暴露对应动作集合,避免将所有动作强行合并为一个庞大且互相干扰的联合空间。 - **显式平衡的跨域混合**:在监督微调(SFT)与 RL 阶段均严格控制域间采样比例(如 25:25:25:25),防止单域主导训练。 #### 2.2 四阶段训练配方 | 阶段 | 目标 | 关键设计 | |———|———|—————| | **高分辨率单步 SFT** | 建立 UI 定位与单步交互能力 | 输入分辨率高达 2,116,800 像素,基于公开静态数据集训练 | | **低分辨率多步 SFT** | 发展长程导航与工具使用 | 分辨率降至 921,600 像素,使用四域生成的多步轨迹;针对视觉工具使用的动态工具注册表,引入**工具注册表感知轨迹分段**(tool-registry-aware segmentation) | | **RFT(拒绝采样微调)** | 将单域专家能力蒸馏回统一模型 | 先训练每域 RL 专家,再让其生成轨迹,经 VLM 裁判过滤后保留成功样本,对统一模型进行微调 | | **联合异步 RL** | 跨域联合优化交互策略 | 在移动端与桌面端(向网页域有迁移)进行在线 RL,直接从环境反馈中学习 | —- ### 3. 异构环境与异步强化学习基础设施 #### 3.1 可扩展环境管线 论文为四域分别构建高并发环境: - **移动端**:基于 AndroidWorld,支持 100+ 并发实例; - **桌面端**:基于 OSWorld(Docker 容器化),支持 200+ 并发实例; - **网页端**:基于 Weblica(离线缓存 + 合成网站),消除网络延迟与反爬; - **视觉工具使用**:基于 MM-ToolSandBox,支持 500+ 层级化工具与动态工具检索。 此外,研究构建了基于 headless 浏览器的**合成环境**,通过“能力飞轮”自动挖掘真实轨迹中的技能集群并生成对应任务与环境,作为低成本、高吞吐的训练数据来源。 #### 3.2 异步 RL 框架 针对统一视觉智能体的训练瓶颈,论文开发了显式控制跨域分布的异步 RL 系统,核心组件包括 Rollouter、Environment Manager、Message Queue、Trainer 与 Parameter Synchronizer。 关键稳定训练策略包括: - **轻量多模态卸载**:队列中仅存储图像引用,历史截图落盘,降低内存压力。 - **域配额与反压机制(Per-domain quota & backpressure)**:Trainer 按配额 q_d 消费各域轨迹组;生产者端依据累计准入比例 r_d = c_d/q_d 暂停领先域的生成,防止资源浪费与分布漂移。 - **双裁剪替代目标(Dual-clip surrogate)**:处理 rollout 策略与训练策略间的陈旧度差距(staleness gap):
ell(i,t)^(clip) = ell(i,t)^(hi), & Ai ≥ 0, min(-cA_i, ell(i,t)^(hi)), & Ai < 0,
其中 ell(i,t)^(hi) = max(-Ai r(i,t), -Ai,clip(r(i,t), 1-varepsilon(lo), 1+varepsilon(hi))) 。 - **截断重要性采样权重**:处理推理引擎与训练引擎间的数值差距(engine gap):
rho(i,t) = exp(clip(logπ(prox) - logπ(roll), ±kappa)), quad w(i,t) = m(i,t) · sg[min(rho(i,t), C)].
- **动态组过滤**:在线剔除全成功或全失败的 GRPO 轨迹组,确保每批次均含有学习信号;同时对环境失败导致的假阴性奖励进行掩码处理。 —- ### 4. 实验结果 论文在 2B、4B Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Mingfei Gao,Rui Tian,Haiming Gang,Bohan Zhai,Le Zhang,Yuanzheng Gong,Di Feng,Ege Özsoy,Kaixin Ma,Vishwesh Kirthivasan,Oğuzhan Fatih Kar,Roman Bachmann,Anders Boesen Lindbo Larsen,Afshin Dehghan
Categories:
PDF URL: https://arxiv.org/pdf/2609.22083.pdf
Arxiv URL: https://arxiv.org/abs/2609.22083
Arxiv ID: 2609.22083
CoolPaper URL: https://papers.cool/arxiv/2609.22083
Published: 2026-09-22T01:51:42.619Z
Updated: 2026-09-22T01:51:42.619Z
12. GraphSkillEvo: Evolutionary Optimization of Graph-Structured Agent Skills
Abstract:Skills can improve the performance of Large Language Model (LLM) agents by providing task-specific procedural guidance, while skill optimization further improves their effectiveness through iterative refinement. However, existing skill optimization methods typically represent skills as unstructured natural-language instructions, creating two key challenges: 1) Unstructured skills often lack explicit workflow-level guidance and contain substantial redundancy, making them difficult for LLMs to execute; 2) the vast search space of unconstrained natural-language skills makes skill optimization ineffective. To address these challenges, we propose representing skills as graph-structured natural-language artifacts. In graph-structured skills, each node represents an execution step together with its operational guidance, while directed edges encode context-dependent transitions between steps. Compared to unstructured skills, graph-structured skills can provide clear workflow-level guidance. Moreover, the proposed graph-structured skill can also facilitate skill optimization. Building on this structured representation, we introduce GraphSkillEvo, a population-based evolutionary optimization framework with mutation and crossover operators for graph-structured skills. By maintaining multiple candidate skills and combining effective components, GraphSkillEvo enables broader and more comprehensive exploration of the structured skill space than purely LLM-based iterative self-refinement. Extensive experiments across five agent benchmarks demonstrate that GraphSkillEvo consistently outperforms the strong skill optimization baseline SkillOpt, improving average accuracy by 4.01% on GPT-5.4-nano and 1.76% on GPT-5.4. Our code is available at this https URL.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决现有大语言模型(LLM)智能体技能优化方法中,因采用\*\*无结构自然语言指令\*\*表示技能而引发的两大核心挑战: 1. \*\*技能执行困难(Difficulty in skill execution)\*\* - 现有方法优化的技能通常呈现为冗长的清单或项目符号指令,缺乏明确的工作流级(workflow-level)指导。 - 这种粗粒度的表示使LLM智能体难以在执行的每个阶段确定应当遵循哪条指令以及下一步应 transition 到哪个步骤。 - 该问题在能力较弱的模型(如 GPT-5.4-nano)上尤为突出,这类模型更易因指令过度冗长与结构模糊而难以遵循。 2. \*\*技能优化困难(Difficulty in skill optimization)\*\* - 无结构表示导致技能优化的搜索空间既庞大又高度冗余。 - 相似的工作流可通过大量不同的无结构文本变体表达,迫使优化器探索众多并不对应实质性程序变化的表征变体,降低了优化效率。 - 纯粹基于LLM自反思的迭代精修(如 SkillOpt)在此类冗余且缺乏约束的搜索空间中难以实现有效且全面的探索。 为应对上述问题,该论文提出将智能体技能形式化为\*\*图结构的自然语言产物\*\*(graph-structured natural-language artifacts),并在此基础上引入基于种群的进化优化框架 GraphSkillEvo,通过显式编码执行步骤与上下文依赖的转移关系,为技能执行提供清晰的工作流指导,同时为技能优化提供更紧凑、结构化的搜索空间。 Q2: 有哪些相关研究? 该论文的相关研究主要围绕两个方向展开:\*\*智能体技能优化(Agent Skill Optimization)\*\* 与 \*\*图结构在智能体技能中的应用(Graph for Agent Skill)\*\*。 ## 1. 智能体技能优化 现有研究将技能视为可重用的提示级自然语言产物,通过执行轨迹与交互经验自动构建或提炼技能: - \*\*EvoSkill\*\* (Alzubi et al., 2026):通过迭代失败分析与基于帕累托的选择来发现并优化技能。 - \*\*Trace2Skill\*\* (Ni et al., 2026):通过并行合并将多个轨迹补丁整合为单一可迁移技能。 - \*\*SkillX\*\* (Wang et al., 2026a):从执行轨迹中提取多级技能,并通过迭代精修与探索性扩展构建技能库。 - \*\*AutoRefine\*\* (Qiu et al., 2026):利用智能体执行轨迹的文本反馈诊断失败并改进技能。 - \*\*SkillOpt\*\* (Yang et al., 2026a):采用深度学习风格的控制机制(如 rollout 反射、文本编辑选择、验证门控)迭代优化技能,是该文主要对比的基线方法。 - \*\*基于强化学习的协同进化方法\*\*:如 EvolveR (Wu et al., 2025)、SAGE (Wang et al., 2026b) 和 SKILLRL (Xia et al., 2026a),通过强化学习迭代协同进化 LLM 与技能。 - \*\*终身与跨用户技能构建\*\*:AutoSkill (Yang et al., 2026b) 从终身经验构建个性化技能;SkillClaw (Ma et al., 2026) 聚合多用户交互轨迹以构建跨用户技能。 \*\*上述研究的共性局限\*\*:这些方法通常将技能表示为\*\*无结构的自然语言指令\*\*,缺乏显式的工作流级指导,且搜索空间庞大冗余。 ## 2. 图结构在智能体技能中的应用 近期研究开始将图结构引入技能表示,但主要聚焦于\*\*技能检索与组合\*\*: - \*\*Graph-of-Skills\*\* (Liu et al., 2026a) 与 \*\*SkillDAG\*\* (Bai et al., 2026):在大型技能库中引入图结构以实现高效检索,帮助智能体识别执行当前任务所需的技能子集。 - \*\*GraSP\*\* (Xia et al., 2026b):提出图结构技能组合,使智能体在任务执行过程中更有效地组织与编排多个技能。 - \*\*SSL 表示\*\* (Liang et al., 2026):将现有技能转换为调度-结构-逻辑(Scheduling-Structural-Logical)表示,以支持大型技能库中的检索与风险评估。 - \*\*HiSkill\*\* (Hao et al., 2026):发现多个技能并将其组织为图(每个技能对应一个节点),在任务求解时检索任务相关的技能子集。 \*\*与本文的区别\*\*:已有研究主要关注\*\*大型技能库中的技能检索\*\*以及\*\*任务执行过程中的多技能组合\*\*。相比之下,该论文的核心贡献在于将\*\*单个技能本身\*\*表示为图结构化的自然语言产物(节点为执行步骤,边为上下文依赖的转移),并在此基础上设计结构感知的进化算子(变异与交叉)以直接优化技能质量,而非仅用于检索或编排。 此外,在 LLM 智能体领域,早期工作如 \*\*Toolformer\*\* (Schick et al., 2023)、\*\*Voyager\*\* (Wang et al., 2023)、\*\*ReAct\*\* (Yao et al., 2022) 等奠定了 LLM 作为智能体在真实世界应用中部署的基础;而 \*\*SkillsBench\*\* (Li et al., 2026) 等研究则对技能在跨任务场景中的有效性进行了基准测试。 Q3: 论文如何解决这个问题? 该论文通过\*\*图结构化技能表示\*\*与\*\*基于种群的进化优化框架\*\*相结合,系统性地解决了无结构技能在执行与优化层面的双重困境。 ## 1. 图结构化技能表示(Graph-Structured Skills) 论文将技能形式化为图结构化的自然语言产物 s = langle h_s, g_s rangle ,其中 g_s = (V_s, E_s) 为有向图,显式编码执行步骤及其转移关系: - \*\*全局指导(Global Guidance, h_s )\*\*:汇集跨步骤共享的任务描述、通用原则与执行模板。 - \*\*节点集(Node Set, V_s )\*\*:每个节点对应一个可复用的执行步骤(如解析目标、检索证据、执行操作、验证答案),并包含该步骤自包含的操作指令、规则与约束。 - \*\*边集(Edge Set, E_s )\*\*:通过 M 个工作流 (c_m, p_m)_(m=1)^M 定义。每个工作流以适用条件 c_m 触发,以有序节点序列 p_m 指定执行路径,序列中相邻节点构成有向边,表示上下文依赖的步骤转移。 ### 针对执行困难的解决机制 图结构将底层工作流显式化,使智能体能够: - 依据当前任务条件选择对应的工作流; - 按图路径顺序执行,明确知晓“当前处于哪一步”以及“下一步应转移到哪个节点”; - 在每个节点获取精确的局部指令,避免在长篇幅无结构文本中检索相关指导。 这尤其缓解了较小模型(如 GPT-5.4-nano)因指令冗长、结构模糊而难以遵循的问题。 ### 针对优化困难的解决机制 - \*\*降低冗余\*\*:多条工作流共享的指令只需在节点集中定义一次,无需在不同文本段落中重复。 - \*\*压缩搜索空间\*\*:优化器直接在显式的执行步骤与依赖关系上操作,而非在大量无结构文本变体中搜索,从而将搜索空间约束为更紧凑、结构化的形式。 ## 2. GraphSkillEvo:基于种群的进化优化框架 在图结构化表示提供的结构化搜索空间基础上,论文提出 GraphSkillEvo,通过维护技能种群并运用结构感知的进化算子,实现对技能空间更广泛、更全面的探索。 ### 核心流程 \*\*Step 0:种群初始化\*\* 初始化种群 P^((1)) = s_i^((1))_(i=1)^N ,除初始技能外,其余由 LLM 依据任务上下文生成多样化的图结构技能。每个个体在验证集 D_(val) 上评估,获得适应度 J_(D_val)(s) 。 \*\*Step 1:训练集执行与反馈收集\*\* 在每代 t ,从训练集 D_(train) 采样批次实例。对每个技能 s_i^((t)) 执行并收集轨迹 T_i^((t)) ,同时保留至多 K 条失败轨迹 F_i^((t)) 作为后续反射信息:
Fi^((t)) ⊂eq τ(x, si^((t))) mid x ∈ B^((t)), r(x, si^((t))) = 0 , quad |F_i^((t))| ≤ K
**Step 2:新技能生成** 通过以下子步骤生成 N 个新技能: 1. **算子选择**:按轮询(round-robin)策略从四种算子中选择一种。 2. **父代选择**:基于适应度排名 r 的权重 p propto 1/(r+N) 从当前种群中选择父代。 3. **技能生成**:由 LLM 代理 A(gen) 根据选定算子与父代生成新技能。对于变异算子,额外提供失败轨迹作为反射信息:
sj^((t+1)) = A(gen)(oj^((t)), s(parent),j^((t)), F(parent),j^((t))), & if o_j^((t)) is mutation, A(gen)(oj^((t)), s(parent),j^((t))), & if o_j^((t)) is crossover.
四种结构感知进化算子 | 算子类型 | 作用对象 | 操作内容 | |:—-|:—-|:—-| | **全局指导变异** | h_s | 依据执行轨迹的反射信息修订全局指导(如通用原则、输出格式、图执行指南),保留原图结构。 | | **图结构变异** | V_s, E_s | 依据失败轨迹修订节点与边:精化节点指令、增删可复用节点、调整工作流路径,保留全局指导。 | | **全局指导交叉** | h_s | 重组两个父代中有效的全局指导成分,保留其中一个父代的完整图结构。 | | **图结构交叉** | V_s, E_s | 重组两个父代中有效的节点与边(如导入优质节点、合并重叠节点、交换工作流片段),保留其中一个父代的全局指导。 | **Step 3:种群选择** 对新技能在完整验证集上评估,从当前种群与新技能并集 P^((t)) ∪ P^((t+1)) 中保留适应度最高的 N 个个体构成下一代 P^((t+1)) :
P^((t+1)) ∈ argmax(S ⊂eq P^((t)) ∪ tildeP)^((t+1)) |S|=N ∑(s ∈ S) J_(D_val)(s)
重复上述步骤共 T 代后,返回最终种群中适应度最高的技能。 ### 相比现有方法的核心优势 - **种群机制**:同时维护多个高质量候选技能,避免单轨迹优化过早收敛。 - **交叉算子**:通过重组不同候选中已验证有效的图组件(全局指导、节点、工作流),实现跨搜索轨迹的信息交换,突破纯 LLM 自反思的局部探索局限。 - **结构感知**:变异与交叉操作均尊重图结构的显式边界(全局指导 vs. 图结构),确保生成的技能始终保持良好定义的图拓扑与执行语义。 通过上述设计,GraphSkillEvo 在提供清晰工作流指导以改善技能执行的同时,借助结构化表示与进化搜索显著提升了技能优化的效率与效果。 Q4: 论文做了哪些实验? 论文开展了系统的实验评估,涵盖主实验、效率分析、消融实验与跨模型迁移实验,具体包括以下方面: ### 1. 实验设置 - **基准测试**:选用五个具有代表性的智能体评测任务: - **SearchQA**:基于文本证据的事实问答 - **SpreadsheetBench**:真实 Excel 工作簿的程序化操作 - **DocVQA**:文档图像视觉问答 - **LiveMathematicianBench**:数学多选推理 - **ALFWorld**:持续交互的文本化家居环境任务 - **对比基线**: - **No Skill**:无技能,仅使用原生任务提示 - **Human Skill**:专家手写技能 - **LLM Skill**:由 LLM 一次性生成的技能 - **SkillOpt**:代表性的现有技能优化方法(基于 LLM 自反思的迭代优化) - **模型与执行环境**: - 语言模型:GPT-5.4 与 GPT-5.4-nano - 执行 Harness:无额外 Harness(No harness)与 Codex Harness 两种设置 - **优化超参数**:种群大小 N=4 ,进化代数 T=5 ,每代从训练集采样 15 条实例,每条技能保留至多 5 条失败轨迹用于变异。 ### 2. 主实验结果(Test-set Success Rate) 表 1 报告了跨五个基准、两个模型、两个 Harness 的测试集成功率。关键发现包括: - **全面领先**:在 14 个模型–Harness–基准设定中,GraphSkillEvo 在 13 个设定中取得最优。 - **相比无技能基线**的平均绝对提升: - GPT-5.4(No harness): +15.37% - GPT-5.4-nano(No harness): +21.86% - GPT-5.4(Codex harness): +10.31% - **相比 SkillOpt**的平均绝对提升: - GPT-5.4: +1.76% - GPT-5.4-nano: +4.01% - GPT-5.4(Codex harness): +1.33% - **小模型获益更显著**:GPT-5.4-nano 上的平均提升(4.01%)约为 GPT-5.4(1.76%)的两倍以上。 - **程序性任务提升突出**:在需要按步骤执行的 SpreadsheetBench 与 ALFWorld 上,GraphSkillEvo 相对 SkillOpt 分别提升 10.60% 与 3.73% 。 ### 3. 优化效率与 Token 消耗 - **收敛行为**:图 3 的验证集优化曲线显示,SkillOpt 在优化早期即趋于收敛,而 GraphSkillEvo 能够通过持续的性能更新收敛到更优解。 - **Token 成本**:表 2 显示 GraphSkillEvo 的总优化 Token 消耗显著低于 SkillOpt。在 GPT-5.4 上,GraphSkillEvo 消耗 61.94M tokens,仅为 SkillOpt( 81.08M )的 76.4% ;在 GPT-5.4-nano 上,GraphSkillEvo 消耗 75.94M ,约为 SkillOpt( 103.54M )的 73.3% 。 ### 4. 图结构有效性的消融与验证实验 #### RQ1:图结构对技能执行的影响(表 3) 将 GraphSkillEvo 优化出的图结构技能移除显式工作流组织,仅保留全局指导与节点级指令(即“无结构对应物”)。在 GPT-5.4-nano 上的测试表明: - 去除图结构导致 SearchQA、Spreadsheet、DocVQA、LiveMath、ALFWorld 的成功率分别下降 4.52 、 2.50 、 4.19 、 1.35 、 0.75 个百分点。 - 说明显式工作流组织本身就能帮助智能体更有效地应用指令。 #### RQ2:图结构对技能优化的影响(表 4) 在 GPT-5.4-nano 上进行消融,验证图表示与进化算子的独立贡献: - **w/o graph structure**:将种群进化用于无结构技能,平均性能从 71.52 降至 64.08 ( -7.44 ),表明仅有种群进化不足以弥补无结构表示的缺陷。 - **w/o crossover**:退化为多条并行的类 SkillOpt 自精修轨迹,平均性能降至 66.59 ( -4.93 ),说明交叉算子对组合不同轨迹中发现的有效组件至关重要。 - **w/o mutation**:仅保留交叉,平均性能大幅下降至 54.50 ( -17.02 ),表明基于执行反馈的局部变异是精细化改进的关键。 #### RQ3:跨模型迁移性(表 5) 检验用 GPT-5.4-nano 优化的技能直接迁移到 GPT-5.4 的效果: - 迁移后的 GraphSkillEvo 技能在所有三个测试基准(SearchQA、Spreadsheet、DocVQA)上均优于无技能基线。 - 尤其在 SpreadsheetBench 上,迁移后的 GraphSkillEvo 技能( 71.78 )不仅大幅超过迁移后的 SkillOpt( 53.21 ),甚至超过了直接用 GPT-5.4 优化得到的 GraphSkillEvo 技能( 69.40 ),表明图结构化的程序性知识具有良好的跨模型可迁移性。 ### 5. 补充实验 - **显著性检验**(附录 C.1):通过 Welch’s t-test 验证,GraphSkillEvo 在 SpreadsheetBench 与 ALFWorld 等程序性基准上显著优于 SkillOpt( p < 0.05 )。 - **案例研究**(附录 C.2 / 图 4):以 ALFWorld 为例,展示了图结构技能如何针对不同任务类型(直接拾取放置、状态变更后放置、光照下检查)提供显式工作流路径及对应的执行轨迹。 Q5: 有什么可以进一步探索的点? 基于论文结论与整体框架,以下几方面值得进一步探索: ## 1. 与参数优化方法结合 当前 GraphSkillEvo 仅优化技能产物(prompt-level artifacts),而保持 LLM 参数与执行 harness 固定。未来可将图结构技能优化与模型参数微调、适配器训练等参数优化方法相结合,探究技能结构(离散符号层)与模型参数(连续神经层)的协同进化,以进一步提升智能体在特定任务上的性能上限。 ## 2. 更丰富的图组合机制 当前技能图主要采用有向图形式,通过线性工作流路径(节点序列)组织执行步骤。可扩展支持更复杂的图组合原语,例如: - **子图嵌套与层次化组合**:允许节点内部展开为子图,形成层次化的技能表示,以处理需要递归分解的复杂任务; - **并行分支与同步汇合**:在执行路径中显式引入并行节点与同步屏障,支持可并行的子任务执行; - **带权图与概率转移**:为边赋予权重或概率,使智能体能够基于置信度或历史成功率进行随机或启发式路径选择。 ## 3. 跨领域图结构技能合并 现有工作主要针对单一任务或领域优化技能。未来可研究如何将来自不同领域的图结构技能合并为统一的技能库,同时保持各技能图的模块性与可调用性。这需要解决节点语义对齐、工作流冲突消解、以及跨领域适用条件推理等问题。 ## 4. 动态图结构自适应执行 当前图结构在优化阶段确定后,执行阶段通常按固定路径流转。可探索**执行时动态图重写**机制,使智能体能够根据实时环境反馈、工具返回结果或中间错误,动态插入、跳过或替换节点,实现更灵活的适应性执行。 ## 5. 更复杂的控制流结构 当前工作流以顺序执行和条件分支为主,可进一步引入循环(loop)、异常处理(exception handling)等控制流结构,使技能图能够表达需要迭代验证、重试或错误恢复的程序化任务,从而更精确地刻画复杂操作流程。 ## 6. 多智能体协作技能图 现有框架聚焦于单智能体技能。将其扩展至多智能体场景时,可构建跨智能体的技能图,其中不同智能体拥有各自的局部技能子图,并通过协商协议、共享节点或消息边进行协作,以支持分布式任务求解。 ## 7. 更大规模与多样性的验证 当前实验覆盖了问答、文档理解、电子表格操作、数学推理与具身交互五类任务。未来可在更多样化的基准(如涉及复杂工具链调用、长周期决策、多模态感知-动作循环的任务)以及更多模型族(如开源权重模型、不同规模的推理模型)上验证 GraphSkillEvo 的通用性与可扩展性。 Q6: 总结一下论文的主要内容 该论文针对大型语言模型(LLM)智能体技能优化中无结构自然语言表示的固有缺陷,提出将技能形式化为图结构产物,并基于此设计进化优化框架。以下是主要内容概括: —- ### 1. 研究背景与核心问题 现有技能优化方法(如 SkillOpt)通常将技能表示为无结构自然语言指令,引发两个关键挑战: - **执行困难**:冗长清单式指令缺乏显式工作流指导,使智能体难以确定当前步骤适用何种指导及下一步转移方向,能力较弱的模型(如 GPT-5.4-nano)尤为受限。 - **优化困难**:无约束文本导致搜索空间庞大且冗余,相似工作流可通过多种文本变体表达,使优化器被迫探索大量无实质差异的表征,降低迭代精修效率。 —- ### 2. 图结构技能表示 论文将技能定义为图结构化自然语言产物:
s = langle hs, g_s rangle, quad g_s = (V_s, E_s)
其中各组成部分的功能如下: - **全局指导 h_s **:汇集跨步骤共享的任务描述、通用原则与执行模板。 - **节点集 V_s = v_1, dots, v(ns) **:每个节点代表一个可复用的执行步骤(如解析目标、检索证据、验证答案),并包含该步骤的自包含操作指令、规则与约束。 - **边集 E_s **:通过 M 个工作流 (c_m, p_m)(m=1)^M 定义。适用条件 cm 触发对应执行路径 p_m (节点有序序列),序列中相邻节点构成有向边,编码上下文依赖的步骤转移。 相比无结构技能,该表示具备三大优势: 1. **低冗余**:共享指令只需在节点集中定义一次,可被多条工作流复用。 2. **显式工作流指导**:每个工作流明确规定节点执行顺序,帮助智能体定位当前阶段适用的精确指令。 3. **紧凑结构化搜索空间**:优化器直接操作显式步骤与依赖关系,而非在冗余文本变体中搜索。 —- ### 3. GraphSkillEvo 进化优化框架 基于上述表示,论文提出基于种群的进化计算框架 GraphSkillEvo,通过结构感知的变异与交叉算子探索技能空间。核心流程包括: **种群初始化与评估** 初始化含 N 个个体的种群 P^((1)) = s_i^((1))(i=1)^N ,并在验证集 D(val) 上评估适应度 J(Dval)(s) 。 **训练集执行与反馈收集** 每代 t 从训练集 D(train) 采样批次实例 B^((t)) ,对每个技能执行并收集轨迹。同时保留至多 K 条失败轨迹 F_i^((t)) 作为变异算子的反射信息:
Fi^((t)) ⊂eq τ(x, si^((t))) mid x ∈ B^((t)), r(x, si^((t))) = 0 , quad |F_i^((t))| ≤ K
**新技能生成(四种结构感知算子)** 采用轮询策略从以下算子中选择,基于排名权重 p propto 1/(r+N) 选取父代,并由 LLM 生成新技能: | 算子 | 操作对象 | 功能 | |:—-|:—-|:—-| | **全局指导变异** | h_s | 依据失败轨迹反射修订全局指导,保留原图结构 | | **图结构变异** | V_s, E_s | 依据失败轨迹修订节点指令、增删节点、调整工作流路径,保留全局指导 | | **全局指导交叉** | h_s | 重组两父代的有效全局指导,保留一父代的完整图结构 | | **图结构交叉** | V_s, E_s | 重组两父代的有效节点与边,保留一父代的全局指导 | **种群选择** 对新生成的 N 个技能在完整验证集上评估,从当前种群与新技能并集中保留适应度最高的 N 个个体:
P^((t+1)) ∈ argmax(S ⊂eq P^((t)) ∪ tildeP)^((t+1)) |S|=N ∑(s ∈ S) J(D_val)(s)
重复上述过程 T 代后,返回最终种群中适应度最高的技能。 —- ### 4. 实验验证 论文在五个基准(SearchQA、SpreadsheetBench、DocVQA、LiveMath、ALFWorld)、两个 LLM(GPT-5.4、GPT-5.4-nano)及两种执行环境(无 Harness / Codex Harness)上开展实验: - **主实验**:GraphSkillEvo 在 14 个模型–Harness–基准设定中的 13 个取得最优。相比 SkillOpt,平均提升在 GPT-5.4 上为 1.76% ,在 GPT-5.4-nano 上为 4.01% ;在程序性任务 SpreadsheetBench 上提升达 10.60% 。 - **效率分析**:GraphSkillEvo 的总优化 Token 消耗显著低于 SkillOpt(GPT-5.4 上减少约 23.6% ,GPT-5.4-nano 上减少约 26.7% ),且优化曲线显示其能持续收敛至更优解,而 SkillOpt 较早陷入停滞。 - **消融实验**: - 移除图结构(保留全局指导与节点文本但去除工作流组织)导致性能平均下降 7.44% ,验证图结构本身对优化的价值。 - 移除交叉算子退化为并行自精修轨迹,性能下降 4.93% ,证明跨候选重组可拓展探索范围。 - 移除变异算子导致性能大幅下降 17.02% ,表明执行反馈驱动的局部精修不可或缺。 - **跨模型迁移**:用 GPT-5.4-nano 优化的图结构技能迁移至 GPT-5.4 后仍保持有效,尤其在 SpreadsheetBench 上迁移技能( 71.78 )超过直接用 GPT-5.4 优化的结果( 69.40 ),显示图结构化程序知识的强可迁移性。 —- ### 5. 结论与展望 该论文通过图结构化表示将隐式工作流显式化,解决了无结构技能在执行清晰度与优化搜索效率上的双重缺陷。GraphSkillEvo 利用种群进化与结构感知算子,实现了对结构化技能空间的全面探索,在多项基准上以更低 Token 消耗取得优于强基线的性能。 未来研究方向包括:结合参数优化方法、扩展更丰富的图组合机制(如子图嵌套、并行分支)、开发跨领域图结构技能合并方法,以及在更多样化任务与模型上验证框架的通用性。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Rui Sun,Zhi Zheng,Zhenkun Wang,Zhichao Lu
Categories:
PDF URL: https://arxiv.org/pdf/2609.21749.pdf
Arxiv URL: https://arxiv.org/abs/2609.21749
Arxiv ID: 2609.21749
CoolPaper URL: https://papers.cool/arxiv/2609.21749
Published: 2026-09-22T01:51:42.745Z
Updated: 2026-09-22T01:51:42.745Z
13. Gricea: An Open Science Platform for Conversational AI Research
Abstract:We need studies on conversational AI (CAI) at scale to understand human behavior and shape CAI design. However, fragmented reporting of systems and study configurations hinders replication, extension, and knowledge accumulation. We present Gricea, an open-science platform representing studies as configurable, deployable research artifacts that researchers can run, inspect, share, and reuse. Informed by a formative analysis of prior CAI research, Gricea couples study procedures, participant-facing systems, and conversational task behavior in. In a replication study using Gricea, we replicated configurations 93% of eligible CUI 2026 papers; while also flagging missing information in 96% of papers that hinder faithful replication —- further motivating Gricea’s need. In a user study, researchers and practitioners from diverse backgrounds successfully constructed runnable studies addressing various open-ended research questions. Together, these findings demonstrate Gricea’s support for constructing, reproducing, and extending CAI studies through shared research artifacts, enabling cumulative knowledge building through open science.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.22039 (HTTP 429)
Authors: Nikhil Sharma,Yunlin Gong,Xinyang Cheng,Ziang Xiao
Categories:
PDF URL: https://arxiv.org/pdf/2609.22039.pdf
Arxiv URL: https://arxiv.org/abs/2609.22039
Arxiv ID: 2609.22039
CoolPaper URL: https://papers.cool/arxiv/2609.22039
Published: 2026-09-22T01:51:42.762Z
Updated: 2026-09-22T01:51:42.762Z
14. MoME: Mixture-of-Memory Embeddings for Context-Aware Sparse Lookup
Abstract:Scaling large language models efficiently has motivated sparse capacity mechanisms such as Mixture-of-Experts and, more recently, conditional memory: token-indexed embedding tables that augment the backbone with cheap parametric lookups. Existing memory-embedding methods retrieve via a deterministic function of the surface form, which collapses different contextual senses of the same token (e.g., python the language vs. the animal) into a single fixed entry. We introduce Mixture of Memory Embeddings (MoME), a context-aware memory mechanism that replaces each token’s single memory row with a mixture of M slots and uses a learned gate over the hidden state to choose which slots to read at each position. In controlled pretraining experiments across nanochat, Llama-3/MobileLLM, and Qwen3 backbones, MoME improves over Value Embedding, Bigram, and STEM baselines in iso-parameter and iso-training-FLOP settings, shows a more promising memory-size scaling trend at sub-billion scale, and remains efficient in training and inference. Qualitative routing analyses on polysemous tokens further suggest that the learned mixture exhibits a degree of semantic interpretability, dispatching the same surface token to distinct memory slots under different senses.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文旨在解决现有\*\*条件记忆(conditional memory)\*\*机制中\*\*记忆检索与上下文脱节\*\*的问题,具体表现为以下两个方面: \*\*1. 现有记忆嵌入方法的索引方式过于僵化\*\* 当前主流的记忆增强型语言模型(如 Per-Layer Embedding、Value Embedding、STEM、Engram、Bigram 等)均通过\*\*确定性的表面形式函数\*\*来索引记忆表——或基于 token 身份(token id),或基于固定 n-gram 哈希。这种检索方式与模型的隐藏状态无关,导致同一个 surface token 无论出现在何种语境中,始终只能访问相同的固定记忆向量。 \*\*2. 语义坍缩与容量错配\*\* 确定性索引引发了两个 compounding drawbacks: - \*\*上下文盲检索(Context-blind retrieval)\*\*:多义词(polysemous tokens)如 \*python\*(编程语言 vs. 动物)、\*bank\*(金融机构 vs. 河岸)或 \*spring\*(季节 vs. 机械弹簧)在不同上下文中的语义差异被完全忽略,多种截然不同的语义被迫压缩进单一向量。 - \*\*容量错配(Misallocated capacity)\*\*:记忆表的容量按 token 而非按语义内容分配。一方面,语义高度重叠的变体(如 \*cat/cats\*)各自占据独立行,造成冗余;另一方面,高负荷多义词却仅拥有一行记忆,无法区分其多种义项。 \*\*核心解决思路\*\* 为此,论文提出 \*\*Mixture of Memory Embeddings (MoME)\*\*。该机制将每个 token 对应的单一记忆行扩展为 \*\*M 个记忆 slots 的混合体\*\*,并引入一个基于当前隐藏状态(hidden state)的学习门控(learned gate)来动态选择和加权激活哪些 slots。这样,MoME 在保留 token 索引查找的高效性与稀疏激活优势的同时,使记忆检索能够根据上下文自适应地切换,从而将“语义路由”引入记忆表读取过程。 Q2: 有哪些相关研究? 该论文在第2节系统梳理了三个密切相关的研究方向,各方向的代表性工作及其与MoME的关系如下: --- ### 1. 语言模型的记忆学习(Learning Memories of LLMs) 这一方向涵盖了从外部检索到参数化记忆的多种尝试: - \*\*非参数检索与非端到端记忆网络\*\*:包括基于海量语料检索增强的模型(如 RETRO
4
、REALM
19
)以及早期的端到端记忆网络(如 Memory Networks
62
、End-to-End Memory Networks
58
)。MoME 与这类方法**正交**,它保持记忆为**参数化**且**按 token 索引**,而非依赖外部数据库或内容寻址读取。 - **将 FFN 层视为键值记忆**:Geva et al.
17
与 Meng et al.
38
发现 Transformer 的前馈层可解释为键值记忆,这催生了显式的记忆层设计,如 Product-Key Memory Networks
31
、Ultra-Sparse Memory Network
24
与大规模记忆层
1
。MoME 共享其**参数化记忆**的前提,但选择将记忆注入到 **per-head value stream**,并通过**按 token 身份索引**的轻量路径替代内容可寻址查找。 —- ### 2. 记忆嵌入增强的大语言模型(Memory-Embedding Augmented LLMs) 这是与 MoME 最直接相关的工作脉络,其核心是向 Transformer 附加可学习的嵌入表并通过确定性函数查找: | 方法 | 记忆索引方式 | 注入位置 | 上下文聚合 | |———|——————-|————-|—————-| | Per-Layer Embedding
16
| token id | 输入嵌入 | 无 | | Value Embedding
26, 29, 30, 68
| token id | Attention value | 无 | | STEM
54
| token id | SwiGLU 隐藏状态 | 无 | | Engram
6
| n-gram 哈希 | 块输入 | n-gram | | Bigram
9
| 2-gram 哈希 | — | 2-gram | | MoWE
43
| token → word-expert | — | 确定性路由 | - **共同限制**:上述方法的检索均为**表面形式的确定性函数**(token id 或固定 n-gram),与当前隐藏状态无关。MoME 正是要填补这一空白:在保持高效查找结构的同时,引入基于隐藏状态的上下文自适应路由。 - **嵌入表扩展的并行子方向**:近期研究致力于直接扩大嵌入表容量,例如 SCONE
65
学习高频 n-gram 嵌入并在推理时卸载;Over-Tokenized Transformer
22
与 Byte Latent Transformer
46
输入大量重叠的 n-gram/字节级嵌入。这些工作延续了早期的模块化哈希方法
23, 35, 53
,并受词汇表缩放律
60
驱动。然而,它们的路由仍然是**表面形式的固定函数**。 - **与跨层 value 设计的关联**:MoME 选择将记忆注入 value stream,这与以下设计相关: - ResFormer
68
:添加第一层 value 向量的残差; - NeuTRENO
42
:跨层正则化 value 向量; - DenseFormer
45
:深度加权平均隐藏状态; - Cross-Layer Attention 变体
5, 41
:跨层共享 K/V。 MoME 选择此注入点是为了让记忆分支能与标准 value 投影**并行执行**,最终以门控残差形式汇合,降低推理延迟(见第3.5节)。 —- ### 3. 混合专家模型(Mixture of Experts) - **稀疏门控 MoE**:从 Shazeer et al.
57
的原始工作到 Switch Transformers
15
、GLaM
14
、Mixtral
25
、GShard
32
等,MoE 的核心思想是将模型容量与每 token 的活跃计算量解耦。 - **细粒度专家设计**:DeepSeekMoE
11, 12
与 Mixture of a Million Experts
20
等将每个 FFN 拆分为众多小型专家,并引入共享专家。 MoME 直接将这一思想迁移到**记忆表侧**:每个 token 索引行不再存储单一向量,而是持有 M 个记忆 slots,并由门控在当前位置动态选择子集激活。这使得记忆容量可以像 MoE 中的专家容量一样进行稀疏扩展,同时保持检索的局部性与高效性。 Q3: 论文如何解决这个问题? 论文通过提出 **Mixture of Memory Embeddings (MoME)** 来解决现有记忆嵌入方法的上下文盲检索与容量错配问题。MoME 的核心思路是:将每个 token 对应的单一固定记忆行扩展为**多个记忆槽(slots)的混合体**,并引入基于当前隐藏状态的门控机制,使同一 surface token 在不同语境下能够动态地读取不同的记忆组合。具体实现包含以下几个关键设计: —- ### 1. 混合记忆表结构(Mixture-of-Slots Memory Bank) 不同于传统方法为每个 token 仅存储一个固定向量,MoME 将记忆表设计为一个三维可学习参数张量:
E(mem) ∈ R^(N × M × d(value))
其中 N 为通过一级索引确定的行数(通常为词汇量 V 或经分组压缩后的规模), M 为每行包含的记忆槽数量, d(value) 为注意力中每个 value head 的维度。位于第 n 行、第 a 槽的记忆向量记为:
m(n,a) = E(mem)[n, a, :] ∈ R^(d(value))
这种结构使得同一 token 不再被束缚于单一向量,而是拥有 M 个候选语义槽,为上下文自适应检索提供了容量基础。 —- ### 2. 两阶段上下文感知索引(Two-Stage Context-Aware Indexing) MoME 采用解耦的两阶段寻址策略,在保留 token 索引查找效率的同时引入上下文依赖性: - 第一阶段(Token 索引):由固定函数 $f: V to
N
将输入 token xt 映射到记忆行 n_t = f(x_t) 。这可以是恒等映射,也可以是后文提到的语义分组映射。 - 第二阶段(上下文槽选择):由可学习门控 gθ 基于当前隐藏状态 ht 动态选择并加权激活该行内的 K 个槽。对于每个 value head i ∈
H
$,门控先生成槽位 logits:
ell(t,i) = Wg^((i)) h_t + b_g^((i)) ∈ R^M
随后通过 Top- K 选择激活槽集合:
A(t,i) = TopK(ell(t,i), K), quad A(t,i) ⊂eq [M], |A_(t,i)| = K
由于 h_t 已通过上层 Transformer 整合了上下文信息,这一阶段实现了**上下文感知的动态路由**。 —- ### 3. 记忆聚合:Sigmoid-Norm 门控(Memory Aggregation) 为将选中的 K 个槽聚合成单个记忆向量,MoME 采用 sigmoid-norm 进行归一化。首先计算各槽的 sigmoid 分数:
s(t,i) = σ(ell(t,i))
然后仅在选中的槽集合 A(t,i) 内部进行归一化,得到混合权重:
α(t,a)^((i)) = s(t,i,a){∑(b ∈ At,i) s(t,i,b)}, quad a ∈ A(t,i)
最终聚合的记忆向量为加权求和:
m(t,i) = ∑(a ∈ A_t,i) α(t,a)^((i)) , m(n_t,a) ∈ R^(d(value))
当 K=1 时,则退化为 softmax 变体。该设计允许模型在同一行内对多个槽进行细粒度插值,从而表达更丰富的语义组合。 —- ### 4. 可选的 Token 语义分组(Token-Index Grouping) 为缓解”一 token 一行”带来的容量冗余(如 *cat* 与 *cats* 语义高度重叠却各占一行),MoME 引入可选的离线分组函数:
f(x) = kNN(U(ref)[x, :]; U(ref), c(grp))
该函数基于一个轻量预训练参考嵌入矩阵 U(ref) ,通过离线 k 近邻匹配将语义相似的 token 压缩到同一共享行中,压缩比为 c(grp) (例如 c(grp) = 2 或 4 )。节省出的 token 级容量被重新分配至上下文感知槽位,即按比例增加每行的槽数 M 。实验表明, c_(grp)=2 时可在保持参数量不变的前提下进一步降低困惑度。 —- ### 5. 门控注入与延迟友好设计(Gated Injection & Latency-Friendly Design) 聚合后的记忆向量通过门控残差注入 attention 的 value stream。首先由独立的 value-residual 门控生成每 head 的注入强度:
γθ(h_t) = 2σ(Wγ ht + bγ) ∈ R^H
随后将记忆向量加到标准 value 投影结果上:
v(t,i) = v(t,i) + γ(θ,t,i) , m(t,i)
其中初始化时门控 logit 为零,使 γ(θ,t,i) ≈ 1 ,保证训练初期的中性残差缩放。 在效率方面,MoME 充分利用了 value stream 的注入点:记忆分支的路由、检索与聚合计算可以与标准 value 投影**并行执行**,两者仅在最终的门控残差加法处汇合。相比将记忆注入 hidden state 的替代方案,这种并行路径在 Qwen3-4B 上几乎将推理延迟开销从 0.996 ms 降低到 0.509 ms 。 —- ### 6. 多 Head 共享记忆表(Multi-Head Memory) 作为参数高效设计,同一记忆层中的所有 value head **共享**同一个 E(mem) 表,从而将每层记忆参数量控制在 N M d(value) (而非 N M H d(value) )。尽管表是共享的,每个 head 仍保有独立的路由器输出,即不同 head 可以就”读取哪个槽”产生分歧,从而在共享存储的基础上保留 head 级的聚合灵活性。 —- ### 7. 与现有机制的兼容性 由于 MoME 对第一阶段索引器 f(xt) 不做强假设,它天然兼容 Bigram 等 n-gram 索引方法。实验表明,将 Bigram 的 2-gram 哈希作为一级索引、同时保留 MoME 的上下文槽选择作为二级索引,可在相同参数量下进一步提升性能,验证了两种稀疏机制的可叠加性。 综上,MoME 通过**“固定行索引 + 上下文槽路由”**的两级架构,在不牺牲 token 索引查找效率的前提下,为记忆嵌入引入了上下文自适应能力,从而解决了传统方法中单一向量强制坍缩多义语义、以及容量按 token 而非按语义内容分配的根本缺陷。 Q4: 论文做了哪些实验? 论文在控制条件下开展了系统性的预训练实验与模型分析,涵盖性能对比、容量缩放、效率评测与可解释性验证四个维度。具体实验内容包括: —- ### 1. 控制预训练对比实验 #### 1.1 Iso-FLOP 实验(nanochat 架构) 在 12 层、135M 参数的 nanochat-style 骨干网络上,固定训练预算为 3 × 10^(18) FLOPs(约 3.3B tokens),对比以下配置: - **基线**:无记忆的 Dense Base、Bigram、Value Embedding (VEmbedding) - **MoME 变体**:固定 151M 记忆参数,分别测试无分组(cgrp=1)及分组系数 cgrp=2, 4 - **记忆容量翻倍**:将记忆参数扩展至 302M,观察 MoME 与 Bigram 的缩放差异 #### 1.2 Iso-Token 实验(Llama/MobileLLM 与 Qwen3 架构) 在更大规模的现代骨干上固定训练 token 数,验证跨架构迁移性: - **Llama/MobileLLM 125M**:5B tokens,对比 Base、STEM、VEmbedding、MoME-A1/3、MoME-A2/6 - **Llama/MobileLLM 350M**:20B tokens,对比 Base、STEM、VEmbedding、MoME-A2/5、MoME-A2/10 - **Qwen3 0.6B**:20B tokens,对比 Base、STEM、VEmbedding、MoME-A2/8 —- ### 2. 记忆容量缩放实验(Memory-Size Scaling) 固定 nanochat d12 骨干与 iso-FLOP 训练预算,系统改变记忆块数量(3 至 24 块,对应 75.5M 至 604M 记忆参数),绘制 MoME 与 Bigram 的: - 训练/验证 bpb 曲线 - CORE 指标曲线 - 运行方差与稳定性对比 结果表明 MoME 在每个测试容量点均优于 Bigram,且训练波动显著更小。 —- ### 3. 组合机制实验(Compound Scaling) 验证 MoME 与 Bigram 的兼容性: - 以 Bigram 的 2-gram 哈希作为一级索引器,保留 MoME 的上下文槽选择作为二级索引 - 在相同记忆参数预算下(151M、302M、604M),对比纯 Bigram、纯 MoME 与组合配置 - 发现组合配置在较大预算下表现最佳,证明两种稀疏机制可叠加 —- ### 4. 推理延迟与效率评测 在多个骨干尺度上测量单步推理延迟增量(相对于无记忆基线): - **模型范围**:MobileLLM 350M/1B、Qwen3 0.6B/4B/8B - **对比注入位置**:MoME(value stream 注入)vs. hidden-state 注入变体 - 结果显示 MoME 的相对延迟开销随模型增大而降低(例如 Qwen3-4B 仅增加 2.35%),且 hidden-state 注入路径的延迟几乎翻倍 —- ### 5. 大规模训练验证(100B Tokens) 在 nanochat d24(24 层,约 0.78B 网络参数)上使用 **ClimbMix** 数据集训练 100B tokens: - 对比对象:Dense、Value Embedding、MoME-A2/12 - 评估指标:域内(ClimbMix)与域外(FineWeb-Edu、enwik9、Shakespeare)的 bpb,以及 CORE-22 - MoME 在所有域外评测上取得最低 bpb 与最高 CORE-22,并接近使用 36T tokens 训练的 Qwen3-0.6B 外部参考模型 —- ### 6. 模型分析与可解释性实验 #### 6.1 逐层记忆使用模式 对 100B 检查点计算各记忆层的注入门控均值 γ_ell 与注入记忆幅值 M_ell : - 发现记忆使用呈现 **U 型深度分布**:早期层与晚期层利用率高,中间层利用率低 - 提示记忆同时参与早期上下文构建与晚期任务特定精修 #### 6.2 多义词语义路由的定性分析 人工构造多义词(bank、bug、drive、apple、cell、python 等)的不同义项提示,观察单个 head 的路由权重: - 同一义项的提示几乎总是路由到相同记忆槽 - 义项切换时,激活槽显著跳变 - Bigram 等 n-gram 路由因上下文窗口过短无法消歧,而 MoME 可基于完整前缀进行区分 #### 6.3 多义词语义路由的定量分析(WiC 数据集) 在 670 对严格过滤的 Word-in-Context 样本上,评估 144 个层-head 位点: - **指标**:Jensen–Shannon 分歧差( Delta JSD )与 chance-corrected top-2 决策重叠差( Delta O ) - **结果**:117/144 个位点 Delta JSD > 0 ,110/144 个位点 Delta O > 0 - **注入门控敏感性分析**:对低注入门控样本降权后,仍保持显著的义项敏感路由模式 —- ### 7. 消融与对照实验(附录补充) - **路由控制消融**:对比 hidden-state 路由 vs. 纯 token 路由 vs. 固定随机路由,验证上下文条件的必要性 - **Dense 缩放对照**:在相同训练 FLOPs 下,对比纯 dense 加宽模型、延迟匹配 dense 模型与 MoME,MoME 在验证 bpb 与 CORE-22 上均占优 - **Token 索引基线对比**:在相同骨干上对比 Bigram、Canonical Engram、JTok、JTok-M、MoVE-Input 等适配基线 - **与稀疏 FFN-MoE 的联合实验**:验证 MoME 可与专家混合前馈网络共存并进一步提升 CORE-22 —- ### 8. 路由器槽位利用率审计(附录) 对 100B 检查点在多个领域(ClimbMix、FineWeb-Edu、enwik9、Shakespeare)上统计: - 边际有效槽位数、权重有效槽位数、最大槽位质量占比 - 同 token 在不同上下文中的条件有效槽位数 - 发现同 token 的重复出现倾向于在不同上下文中使用不同的槽对,验证了上下文自适应路由的实际行为 Q5: 有什么可以进一步探索的点? 基于论文的讨论与实验结果,以下方向值得进一步探索: —- ### 1. 更大规模与更严谨的因果验证 当前实验的最大模型约为 1.4B 总参数(0.8B dense 骨干),且部分关键实验(如 100B token 训练)仅使用单一种子。需在更大规模(数 B 至数十 B 参数)与多种子设置下验证 MoME 的 **scaling trend** 是否保持一致。此外,论文中关于选择性记忆使用和义项敏感路由的证据主要来自描述性统计与相关性分析;未来应通过 **因果干预**(causal interventions)——例如针对性地屏蔽或替换特定记忆槽——来确立这些行为与下游精度、鲁棒性或领域迁移性能之间的因果关系。 —- ### 2. 复合稀疏策略的协同设计 论文初步展示了 MoME 与 Bigram(以及附录中的稀疏 FFN-MoE)的兼容性,但复合机制的组合方式仍较朴素。未来可系统研究: - **多级索引的联合优化**:如何让一级 token/n-gram 索引器与二级上下文槽路由器在训练过程中 **协同演化**,而非简单拼接; - **与 MoE 的深度融合**:将记忆槽路由与专家路由纳入统一稀疏框架,设计共享负载均衡策略,避免双重路由带来的调度开销; - **动态容量分配**:根据 token 频率或任务需求,在 Bigram 表大小 N 、MoME 槽数 M 与骨干 FFN 维度之间进行可学习的自动权衡。 —- ### 3. 记忆路由作为模型行为控制接口 定性分析显示 MoME 的路由权重对多义词的语义语境高度敏感(如 *bank* 在金融与河岸义项间切换槽位)。这暗示记忆路由可能成为一个 **可解释的干预点**。未来可探索: - **显式语义对齐**:通过监督信号或对比学习,将特定槽位绑定到可解释的概念或知识域,实现更可控的”记忆编辑”; - **测试时路由 steering**:在不修改模型权重的情况下,通过偏置或固定特定槽位的激活权重来引导模型输出(类似 attention steering 或 activation engineering),用于安全对齐或风格控制。 —- ### 4. 记忆表的动态更新与持续学习 当前 MoME 的记忆表 E(mem) 为静态训练参数。对于需要持续吸收新知识或适应分布迁移的场景,可探索: - **局部记忆更新**:仅更新与特定实体/概念相关的记忆行或槽,避免全模型微调带来的灾难性遗忘; - **测试时记忆检索增强**:将 MoME 的 parametric memory 与非参数外部检索结合,让门控同时决定”读取内部记忆槽”还是”读取外部检索结果”。 —- ### 5. 注入位置与架构变体的系统性研究 MoME 当前主要探索了向 attention value stream 的注入(及其与 hidden-state 注入的延迟对比)。其他注入点——如直接注入 FFN 的 SwiGLU 隐藏状态(类似 STEM)、注入 query/key 流、或注入跨层共享的 key-value cache——尚未被系统评估。不同注入位置可能改变记忆与表示变换的交互动态,值得在统一框架下进行对比。 —- ### 6. 多语言与跨模态迁移 论文的实验集中在英语语言模型上。MoME 的语义分组(kNN-based token grouping)与多槽路由机制在多语言场景下可能表现出不同特性: - **跨语言共享槽位**:形态丰富或词汇重叠高的语言对可能从共享记忆行中获益; - **多模态扩展**:在视觉-语言模型中,是否可以将 MoME 的记忆表索引扩展到图像 token 或 patch embedding,实现模态条件化的稀疏记忆? —- ### 7. 路由正则化与稀疏性先验 虽然 MoME 的 Top- K 路由已带来稀疏激活,但当前未引入显式的负载均衡或多样性正则化。未来可考虑: - **槽位专业化正则化**:鼓励不同槽位学习互不重叠的语义子空间,减少冗余; - **熵惩罚或路由温度调度**:调节门控的尖锐程度,在训练初期保持探索性,后期增强专业化; - **结构稀疏先验**:利用词汇语义结构(如 WordNet、本体知识)初始化或约束分组函数 f(xt) ,而非纯数据驱动的 kNN 分组。 —- ### 8. 推理效率与工程优化 尽管 MoME 的延迟开销随模型增大而降低,但在极低延迟场景(如边缘设备上的 MobileLLM)中仍有优化空间: - **记忆表量化与压缩**:对 E(mem) 进行低比特量化或矩阵分解,进一步压缩存储; - **投机记忆检索**:利用 token 的局部连续性缓存并复用前一步的路由决策,减少 Top- K 选择的开销; - **层间记忆共享**:当前实验仅在同一层内共享记忆表,跨层共享或层级化记忆缓存(memory cache hierarchy)可能进一步减少参数量。 Q6: 总结一下论文的主要内容 这篇论文的主要内容可概括如下: —- ### 1. 研究背景与问题 现有的大语言模型条件记忆(conditional memory)方法——包括 Per-Layer Embedding、Value Embedding、STEM、Engram 和 Bigram 等——通常通过一个**确定性的表面形式函数**(如 token id 或固定 n-gram 哈希)来索引记忆表。这种设计存在两个根本缺陷: - **上下文盲检索**:同一 token(如 *python*、*bank*、*spring*)在不同语境下的多种语义被强行坍缩进单一固定向量,无法区分多义词的不同义项。 - **容量错配**:记忆容量按 token 而非语义内容分配,导致语义重叠的变体(如 *cat/cats*)各行其是、冗余重复,而高负荷多义词却只有一行记忆。 —- ### 2. 核心方法:Mixture of Memory Embeddings (MoME) 为解决上述问题,论文提出了 **MoME**,一种上下文感知的条件记忆机制。其核心设计包括: - **混合记忆表**:将每个 token 索引行从单一向量扩展为 M 个记忆槽(slots)的混合体,记为
E(mem) ∈ R^(N × M × d(value))
其中每槽存储向量 m(n,a) ∈ R^(d(value)) 。 - **两阶段上下文感知索引**: - 第一阶段:固定 token 索引器 f(xt) 将输入 token 映射到记忆行 n_t ; - 第二阶段:基于当前隐藏状态 h_t 的学习门控 gθ 生成槽位 logits ell(t,i) = W_g^((i)) h_t + b_g^((i)) ,通过 Top- K 选择激活槽集合 A(t,i) ,并用 sigmoid-norm 计算混合权重 α(t,a)^((i)) 。 - **记忆聚合与注入**:聚合后的记忆向量 m(t,i) = ∑(a ∈ A_t,i) α(t,a)^((i)) m(n_t,a) 通过门控残差注入 attention 的 value stream:
v(t,i) = v(t,i) + γ(θ,t,i) m_(t,i)
- **延迟友好设计**:记忆分支与标准 value 投影并行执行,仅在最末端汇合,显著降低推理延迟开销。 - **可选语义分组**:通过离线 kNN 将语义相似的 token 压缩到共享行,节省的容量转化为更多上下文感知槽位。 —- ### 3. 实验与结果 论文在控制预训练设置下进行了系统性评估: - **跨架构性能优势**:在 nanochat(135M)、Llama/MobileLLM(125M/350M)和 Qwen3(0.6B)三种骨干上,MoME 在 iso-parameter 与 iso-training-FLOP 设置下均优于 Value Embedding、Bigram 和 STEM 等强基线,验证了良好的架构迁移性。 - **记忆容量缩放趋势**:在 nanochat d12 上的缩放实验表明,MoME 在测试的 75M–604M 记忆参数范围内,其验证 bpb 始终优于同参数预算的 Bigram,且训练方差更低。 - **复合兼容性**:MoME 可与 Bigram 的 n-gram 哈希索引自然结合。实验显示,在相同参数预算下,复合配置优于任一单独机制。 - **推理效率**:MoME 引入的每步推理延迟开销很小(如 Qwen3-4B 仅增加 2.35%),且随骨干规模增大而相对降低。 - **大规模训练验证**:在 100B ClimbMix tokens 上训练的 d24 模型(约 0.78B 网络参数 + 0.61B 记忆参数)中,MoME 在所有域外评测集上取得最低 bpb 与最高 CORE-22 分数。 - **语义可解释性**:对多义词(*bank*、*bug*、*drive*、*apple*、*python* 等)的定性与定量分析表明,MoME 能将同一 token 在不同语义上下文中路由到不同的记忆槽。基于 WiC 数据集的统计检验显示,大多数层-head 位点对不同义项表现出显著不同的路由分布。 —- ### 4. 贡献总结 - 设计了 **MoME** 模块,首次将上下文感知的混合专家思想引入 token 索引记忆表的查找过程,在保持稀疏、高效查找的同时解决了上下文盲检索问题。 - 证明 MoME 在多种主流架构与规模下均具有竞争力,并展现出比现有记忆嵌入基线更优的**记忆容量缩放趋势**。 - 展示 MoME 与 Bigram 等机制的**可组合性**,为稀疏容量的复合扩展提供了实证支持。 - 通过路由分析揭示,学到的混合记忆门控具有**语义可解释性**,能够依据上下文动态区分多义词的不同义项。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Muchen Li,Leonid Sigal,Renjie Liao
Categories:
PDF URL: https://arxiv.org/pdf/2609.15126.pdf
Arxiv URL: https://arxiv.org/abs/2609.15126
Arxiv ID: 2609.15126
CoolPaper URL: https://papers.cool/arxiv/2609.15126
Published: 2026-09-22T01:51:42.927Z
Updated: 2026-09-22T01:51:42.927Z
15. Calibrating Teacher—Student Discrepancy for On-Policy Distillation
Abstract:On-policy distillation (OPD) improves reasoning models by learning the token-level discrepancy between a stronger teacher and an on-policy student. However, this discrepancy does not purely reflect the capability gap between the teacher and the student: it also contains deviations arising from the teacher itself, which are consequently mixed into the observed teacher—student discrepancy and indiscriminately learned by standard OPD during training. This issue is further exacerbated by privileged OPD, where privileged information induces larger teacher-side likelihood shifts, thereby encouraging the student to learn more of the teacher’s own deviation. We introduce \textbf{Calibrated On-Policy Distillation (Cal-OPD)}, which estimates the teacher’s self-deviation region through positive and negative privileged interventions and calibrates the original teacher—student discrepancy by retaining only the component that lies beyond this region. Experiments on mathematical reasoning benchmarks show that, while retaining only about 52—65\% of the original teacher—student discrepancy as the optimization signal, Cal-OPD consistently outperforms standard OPD and its variants across model scales.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*标准 On-Policy Distillation(OPD)中教师—学生差异信号被教师自身偏差污染\*\*的问题,具体可从以下层面理解: ### 1. 标准 OPD 的固有缺陷 On-Policy Distillation 通过优化学生与教师在学生生成轨迹上的 token 级对数似然差异来迁移推理能力:
A^(OPD)t = log π_T(y_t mid x, y(<t)) - log πS(y_t mid x, y(<t))
然而,观测到的 A^(OPD)_t 并非纯粹反映教师与学生的**能力差距**。它还混杂了教师在固定轨迹上因上下文变化而产生的**自身似然波动**——即论文定义的 **Teacher Self-Deviation(TSD)**。标准 OPD 将该差异无差别地作为监督信号,导致学生不仅学习有益的知识,还盲目模仿教师因上下文敏感而产生的表面波动。 ### 2. 特权 OPD 对偏差的放大 Privileged OPD 通过在训练时向教师提供额外信息(如标准答案、参考解法)来增强监督强度。但论文指出,这种特权上下文会进一步**放大教师侧的似然偏移**,使得教师—学生差异中包含更多非知识性的教师行为变化。现有研究已表明,这可能导致信息非对称、捷径行为以及推理模型性能下降。 ### 3. 论文提出的解决思路 为应对上述问题,论文提出 **Calibrated On-Policy Distillation(Cal-OPD)**。该方法不直接蒸馏特权教师,而是利用**正负特权干预**(positive and negative privileged interventions)估计教师的自偏差区域 R^T_t ,进而将原始差异分解为:
A^(OPD)t = A^(Cal)_t(校准后的有效差异) + A^(TSD)t(教师自偏差解释的差异)
Cal-OPD 仅保留超出估计自偏差区域的残差作为优化信号:
A^(Cal)t = l(L^T_t - ell^S_tr)+ - l(ell^St - U^T_tr)+
其中 $R^Tt =
L^T_t, U^T_t
为估计的 TSD 区间。实验表明,尽管 Cal-OPD 仅保留约 52–65% 的原始教师—学生差异用于优化,却在多个数学推理基准上持续优于标准 OPD 及其特权变体,同时缓解了响应长度膨胀问题。 Q2: 有哪些相关研究? 与本文相关的研究工作主要涵盖以下几个方向: ### 1. 知识蒸馏与序列级蒸馏 - 经典知识蒸馏:Hinton 等人提出通过软标签将强教师模型的能力迁移给学生(Hinton et al., 2015)。 - 序列级与模型压缩:Kim & Rush(2016)将蒸馏扩展到序列生成;Sanh 等人提出 DistilBERT(Sanh et al., 2019);Jiao 等人提出 TinyBERT(Jiao et al., 2020)。 - 大语言模型专用蒸馏:Gu 等人提出 MiniLLM,采用逆 KL 散度与学生感知目标(Gu et al., 2024);Ko 等人提出 DistiLLM(Ko et al., 2024);Zhang 等人研究双空间知识蒸馏(Zhang et al., 2024)。 ### 2. 推理链(Chain-of-Thought)蒸馏 - 推理策略迁移:Ho 等人通过教师生成的推理链进行微调(Ho et al., 2023);Hsieh 等人提出逐步蒸馏(Distilling Step-by-Step, Hsieh et al., 2023)。 - 结构化推理蒸馏:Li 等人提出符号化推理链蒸馏(SCoTD, Li et al., 2023);Chen 等人提出多推理链一致性蒸馏(MCC-KD, Chen et al., 2023);Mitra 等人提出 Orca 2(Mitra et al., 2023)。 - 反事实与分解蒸馏:Feng 等人利用反事实蒸馏教授推理(Feng et al., 2024);Dai 等人提出级联分解 CoT 蒸馏(Dai et al., 2024)。 - 深度推理模型:Guo 等人通过 DeepSeek-R1 展示了推理行为可向小模型蒸馏(Guo et al., 2025)。 ### 3. On-Policy Distillation(OPD) - 标准 OPD:Agarwal 等人提出在策略轨迹上直接进行 token 级差异蒸馏,缓解分布不匹配(Agarwal et al., 2024)。 - Qwen3 等工业实践:Yang 等人将 OPD 应用于大规模推理后训练(Yang et al., 2025)。 - OPD 变体: - ExOPD:Yang 等人引入奖励外推(Yang et al., 2026a)。 - EOPD:Jin 等人引入熵感知前向 KL 监督(Jin et al., 2026)。 - Uni-OPD:Hou 等人结合探索与结果引导校准(Hou et al., 2026a)。 - 自适应视野:Hou 等人提出 divergence-adaptive 监督 horizon(Hou et al., 2026b)。 - Delta 蒸馏:Heo 等人研究多语言数学推理中的 on-policy delta 蒸馏(Heo et al., 2026)。 - 自蒸馏与上下文蒸馏:Zhao 等人提出自蒸馏推理器(Zhao et al., 2026a);Tan & Hong 研究自监督 OPD(Tan & Hong, 2026);Ye 等人提出 on-policy 上下文蒸馏(Ye et al., 2026)。 ### 4. 特权信息蒸馏(Privileged & Context-Augmented Distillation) - 特权自蒸馏:Zhao 等人将验证后的参考解法作为特权信息(OPSD, Zhao et al., 2026a);Hübotter 等人提出 SDPO,利用环境反馈(Hübotter et al., 2026)。 - 特权信息的形式化研究:Penaloza 等人系统研究训练时特权信息(Penaloza et al., 2026);Stein 等人提出共识门控特权上下文(Stein et al., 2026);Sang 等人利用行为指令进行推理压缩(Sang et al., 2026)。 - 缓解特权副作用的方法: - Anti-Self-Distillation:Shen 等人逆转有害的特权教师指导(Shen et al., 2026a)。 - DOPD:Yu 等人动态路由 token 级监督以缓解特权幻觉(Yu et al., 2026b)。 - PHF:Li 等人迁移特权隐藏状态动态(Li et al., 2026b)。 - AR-OPD:Zhang 将特权指导锚定到局部兼容视图(Zhang, 2026)。 - Purified OPSD:Shen 等人移除参考诱导的不可迁移成分(Shen et al., 2026b)。 - DAPD:Wu 等人引入双锚定对抗信息非对称(Wu et al., 2026)。 - 特权信息的批判性分析:Kaur 等人指出特权上下文可能损害思考模型(Kaur et al., 2026);Ichihara 等人发现其他问题的参考也能获得相当增益(Ichihara et al., 2026);Shrestha & Tessier 指出正确答案参考并不提供一致收益(Shrestha & Tessier, 2026);Zhao 等人发现结构化特权信息优于原始解法轨迹(Zhao et al., 2026b)。 ### 5. 教师监督的可靠性研究 - 不确定性感知:Jin 等人提出熵感知 OPD(Jin et al., 2026);Ke 等人尊重自不确定性(Ke et al., 2026)。 - 结果与位置校准:Hou 等人通过结果级排序一致性校准(Uni-OPD, Hou et al., 2026a);Liu 等人提出位置加权 OPD,发现教师 token 可靠性受推理位置影响(Liu et al., 2026)。 - Logit 校准:Yang 等人利用结果对比校准特权教师 logit(OGLS-SD, Yang et al., 2026b)。 - 轨迹选择:Zhang 等人根据正确性与学生一致性选择教师轨迹(BRTS, Zhang et al., 2026)。 - 上下文敏感性:Pan 等人发现推理 token 相对稳定,而风格化/表面形式 token 对上下文干预更敏感(Pan et al., 2026);He 等人提出反事实敏感性信用重分配(He et al., 2026);Tian 等人指出特权上下文可诱导捷径行为(Tian et al., 2026)。 - 教师噪声:Ding & Zhang 揭示 OPD 教师监督存在大规模依赖的噪声,去除噪声监督后学生性能基本不变(Ding & Zhang, 2026)。 Q3: 论文如何解决这个问题? 该论文提出 Calibrated On-Policy Distillation(Cal-OPD),通过显式估计教师的“自偏差区域”(Teacher Self-Deviation Region)并滤除被该偏差所解释的差异成分,从而净化监督信号。具体解决路径可分为以下四个步骤: —- ### 1. 形式化定义 Teacher Self-Deviation(TSD) 对于固定的问题 x 、学生生成的轨迹前缀 y\{<t} 与当前 token y_t ,向教师注入一个仅教师可见的上下文干预 c$,度量该干预引起的教师似然偏移:
Delta^Tt(c) = log π_T(y_t mid x, c, y(<t)) - log πT(y_t mid x, y(<t))
由于 x, y_(<t), y_t 均保持不变, Delta^T_t(c) 纯粹反映教师自身因额外上下文而产生的似然波动,即 **TSD**。 —- ### 2. 利用正负特权干预估计 TSD 区域 Cal-OPD 不直接蒸馏特权教师,而是将特权信息作为**探测工具**。对每一 token,施加一对语义相反的特权干预 (c^(pos), c^(neg)) (例如“该解法正确且严谨” vs “该解法错误且不可靠”),计算对应的教师似然变化 Delta^(pos)_t 与 Delta^(neg)_t 。 基于此,估计教师自偏差的最大向下与向上幅度:
d^↓_t = maxl(0,, -Delta^(pos)_t,, -Delta^(neg)_tr), quad d^↑_t = maxl(0,, Delta^(pos)_t,, Delta^(neg)_tr)
引入松弛因子 λ ≥ 1 以补偿有限干预的估计误差,得到教师自偏差区域的区间估计:
R^T_t = l[ell^T_t - λd^↓_t,; ell^T_t + λd^↑_tr] = l[L^T_t,, U^T_tr]
—- ### 3. 校准原始教师—学生差异 Cal-OPD 将观测到的原始差异 A^(OPD)_t = ell^T_t - ell^S_t 分解为“TSD 可解释部分”与“超出 TSD 的残差部分”。校准后的 token 级优势函数定义为:
A^(Cal)t = l(L^T_t - ell^S_tr)+ - l(ell^St - U^T_tr)+
其中 $
z
_+ = max(z, 0) 。该公式的含义为: - 若学生似然 ell^S_t 落在估计的 TSD 区间 R^T_t 内,则 A^(Cal)_t = 0 ,表明原始差异可被教师自身波动完全解释,不应对学生施加监督; - 若 ell^S_t 低于下界 L^T_t ,则保留正向残差 (L^T_t - ell^S_t) ; - 若 ell^S_t 高于上界 U^T_t ,则保留负向残差 -( ell^S_t - U^T_t)$。 —- ### 4. 构造校准后的优化目标 将标准 OPD 损失中的原始优势替换为校准后的优势:
L(Cal-OPD)(θ) = -E(xsimD),, ysimπS(·mid x)[(1) / (T)∑(t=1)^(T) sgl(A^(Cal)tr) log π_S(y_t mid x, y(
A^(OPD)t = log π_T(y_t mid x, y(
R^T_t = l[ell^T_t - λd^↓_t,; ell^T_t + λd^↑_tr] = [L^T_t,, U^T_t]
- **校准差异信号**:当学生似然落在该区间内时,视原始差异为“可被 TSD 解释”,置零处理;仅保留超出区间的残差:
A^(Cal)t = l(L^T_t - ell^S_tr)+ - l(ell^St - U^T_tr)+ - **优化**:将标准 OPD 损失中的 A^(OPD)t 替换为 A^(Cal)_t 。 与 Privileged-OPD 的关键区别在于:**特权信息仅用于探测和校准教师参考,而非直接蒸馏给学生**。 —- ### 4. 实验结果与发现 在两类教师—学生配置(4B→1.7B 与 30B→4B)和六个数学推理基准(AMC23、AIME24–26、HMMT26、MATH500)上,实验表明: - **性能领先**:Cal-OPD 取得最高平均准确率(53.1 与 69.0),分别比学生基线提升 +3.9 与 +2.4,比标准 OPD 提升 +2.3 与 +3.1。Privileged-OPD 反而表现最差,验证直接蒸馏特权教师有害。 - **信号过滤效应**:Cal-OPD 仅保留约 **52–65%** 的原始教师—学生差异用于优化,却获得更优效果,说明“学得少而精”优于无差别模仿。 - **缓解长度膨胀**:标准 OPD 将平均响应长度从约 9.8K 扩张至 11.8K,而 Cal-OPD 控制在 9.3K 左右,且训练速度提升约 1.26 倍。 - **干预选择**:评估性反馈( C(eval) )作为校准探针最优;解法级特权( C_(sol) )因过度过滤有效监督而表现最差。 —- ### 5. 核心贡献 - **现象层面**:首次系统定义并实证了 OPD 中的 Teacher Self-Deviation,揭示教师似然并非统一可靠的点级参考,且特权上下文会放大该偏差。 - **方法层面**:提出 Cal-OPD,通过有限干预估计教师自偏差区域,并基于区域校准实现对原始差异的软过滤。 - **实践层面**:证明在数学推理任务上,校准后的残差信号尽管更稀疏,却能持续提升不同规模学生模型的推理能力,并为 OPD 的训练效率与响应长度控制提供了改进路径。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Qiangqiang He,Jin Li,MingCai Chen
Categories:
PDF URL: https://arxiv.org/pdf/2609.21619.pdf
Arxiv URL: https://arxiv.org/abs/2609.21619
Arxiv ID: 2609.21619
CoolPaper URL: https://papers.cool/arxiv/2609.21619
Published: 2026-09-22T01:51:43.020Z
Updated: 2026-09-22T01:51:43.020Z
16. From Pretraining to Proficiency: Real-World Subtask RL for Long-Horizon Manipulation with Minimal Human Intervention
Abstract:A pretrained robot foundation policy may execute most of a long-horizon task yet repeatedly fail at a few critical subtasks. Collecting additional full-task demonstrations for supervised fine-tuning (SFT) requires operators to repeat behaviors the policy already performs well. Reinforcement learning (RL) fine-tuning offers a promising path to bridge this gap, but existing approaches struggle to solve long-horizon tasks using only sparse rewards. We present PARTS (Policy Adaptation with RL on Targeted Subtasks), a real-world subtask RL framework that concentrates practice at these bottlenecks while allowing training rollouts to proceed with minimal human intervention. The frozen pretrained policy supplies nominal actions throughout execution, while agent-generated selectors and success verifiers activate residual corrections and provide local outcome rewards. These rewards support learning from successful subtasks even when complete-task successes are scarce. Training combines online RL with success-reweighted retraining, and each retrained residual policy is redeployed to collect further experience. Humans identify bottlenecks during setup and perform physical resets when needed. On bimanual YAM and single-arm Franka tasks, PARTS improves complete-task success from 32% to 61% and from 50% to 95%, respectively, using tens of minutes of real-world RL rollouts per task on average. Compared with existing real-world RL fine-tuning methods, PARTS raises full-task success by more than 25% under the same robot-rollout budget while requiring less human involvement.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决**预训练机器人策略在长程操作任务中的适配难题**,特别是当策略在大多数子任务上表现良好,但仅在少数关键瓶颈子任务上反复失败时的有效改进问题。 具体而言,论文针对以下核心挑战: **1. 长程任务中稀疏奖励导致的强化学习样本效率低下** - 预训练视觉-语言-动作(VLA)策略在长程任务中的完整任务成功率可能较低 - 若仅使用完整任务结束时的稀疏二元奖励 R = prod_(i=1)^(N) φ_i 进行微调,由于任务链条中任一子任务失败都会导致整轮交互无奖励,策略难以获得有效的学习信号 - 基础策略在前期子任务上的失败会显著减少智能体接触并练习后期瓶颈子任务的机会,形成"漏斗效应" **2. 全任务微调对已有可靠行为的干扰与数据浪费** - 全任务范围的强化学习会迫使机器人在已经熟练的子任务上继续消耗训练预算 - 对预训练骨干网络进行端到端更新(如EXPO-FT)可能破坏基础策略原本可靠的非瓶颈行为 - 监督微调需要操作员重复录制策略已掌握的行为片段,人工数据收集效率低下 **3. 真实世界机器人训练对人工监督的高度依赖** - 现有真实世界RL微调方法通常需要操作员在交互过程中进行动作纠正、策略切换决策或成功/失败标记 - 长程任务中频繁的人工干预、场景重置和标签标注限制了方法的可扩展性和实际部署可行性 **4. 瓶颈子任务的局部练习与全局评估之间的鸿沟** - 单独在瓶颈子任务上训练时,局部重置导致的初始状态分布 μ_i 可能与真实任务流中产生的进入分布 μ_i 不一致 - 仅在局部子任务上成功不足以保证完整长程任务的可靠性,需要协调局部残差策略与全局基础策略的交互 为此,论文提出**PARTS(Policy Adaptation with RL on Targeted Subtasks)**框架,通过冻结基础策略、仅对瓶颈子任务训练轻量级残差策略、提供局部结果奖励与自动验证,在最小化人工干预的前提下,将完整任务成功率在双手机器人平台上从32%提升至61%,在单臂平台上从50%提升至95%。 Q2: 有哪些相关研究? 根据论文的Related Work及引言部分,相关研究可梳理如下: ### 1. 预训练机器人基础策略 近期视觉-语言-动作(VLA)模型与世界-动作模型(WAMs)利用大规模机器人数据集、视觉语义知识及视频预测能力,涌现出跨任务的通用操作能力,代表性工作包括 π 0.5 、 π 0.7 等通用ist策略,以及 OpenVLA、NovaFlow 等框架。这些模型为后续的策略适配提供了强大的行为先验。 ### 2. 真实世界强化学习的方法论 - **Sim-to-real 迁移**:先在仿真中通过 RL 训练再部署到硬件的方法,与直接在真实世界交互更新的方法形成对比。 - **样本效率提升**:现有系统通过人类示教(demonstrations)、残差控制(residual control)、学习奖励函数(learned reward functions)以及人工干预(human intervention)来缓解真实世界中数据收集与无效探索的高昂成本。 - **长程任务分解**:为应对稀疏奖励问题, prior work 将长程任务分解为短视界目标或可复用技能,包括组合示教原语、从先前经验中发现技能、以及在相关任务间共享参数。 ### 3. 预训练 VLA 策略的在线微调 随着 VLA 模型能力增强,研究重心逐渐从零开始学习行为转向改进已有能力较强的策略。近期工作尝试通过在线 RL 对预训练 VLA 进行真实世界微调,例如: - **全局微调方法**:DSRL 通过在 VLA 的隐空间噪声上运行在线 RL 来引导动作生成;EXPO-FT 学习一个编辑策略(edit policy)并在 Q 函数指导下修改 VLA 的动作块,同时持续更新骨干网络;RLT 冻结 VLA 并训练小型 actor-critic 网络来精调参考动作。 - **局部适配方法**:部分近期系统也将学习限制在任务的部分阶段,例如基于动作方差、固定接触阶段或特定任务阶段进行策略调整。 ### 4. 长程任务中的子任务学习与技能发现 为缓解长程任务中的信用分配难题,研究者探索了多种子任务层面的学习方法: - 基于规划子目标的在线适配; - 针对选定任务阶段(task phases)进行精细化训练; - 从非分段示教中自下而上发现技能; - 基于技能的模型化强化学习。 ### 5. 人类监督在真实世界策略适配中的角色 现有真实世界策略学习广泛依赖人类监督以引导探索并防止代价高昂的失败,主要形式包括: - **纠正性动作**(corrective actions):操作员在交互过程中直接修正机器人动作; - **策略接管与切换**(policy takeover / switching):人类决定何时将控制权从基础策略移交给 RL 策略; - **结果标注**(success/failure labeling):人工提供成功或失败的标签信号。 ### 6. 自动化监督与自主训练系统 为降低对持续人工监控的依赖,近期研究致力于自动化部分监督流程: - **UniIntervene**:检测价值退化并检索恢复行为,用于全任务练习的策略; - **Robot Trains Robot**:为全任务练习自动实现保护机制、故障检测、调度与场景重置。 与上述工作相比,PARTS 的核心区别在于:将练习范围集中于瓶颈子任务而非全任务;通过可执行的程序(策略选择器、成功验证器、重置策略)替代了交互过程中的人工纠正、切换决策与奖励标注;在保持预训练策略冻结的同时,通过残差策略进行局部修正,并以局部结果奖励替代稀疏的全局奖励。 Q3: 论文如何解决这个问题? 论文提出 **PARTS(Policy Adaptation with RL on Targeted Subtasks)** 框架,通过将真实世界强化学习的训练预算集中于瓶颈子任务,同时保持预训练基础策略的冻结与可靠行为,解决长程操作任务中的适配难题。具体解决方案可分为以下四个层面: --- ### 1. 冻结基础策略 + 残差修正的解耦架构 PARTS 的核心设计是**不解冻预训练 VLA 基础策略**,而是让其作为名义执行器(nominal executor)贯穿任务始终,仅在人工识别的瓶颈子任务处注入轻量级残差策略。 - **基础策略** π_0 :基于少量任务演示进行监督微调(SFT)后冻结,负责完成所有非瓶颈子任务,并提供视觉特征 z_t 、本体感知 p_t 及名义动作块 A_t 。 - **残差策略** f_(θ_k) :每个瓶颈 k ∈ K 对应一个独立的残差 Actor,输出归一化残差动作块 $U_(k,t) ∈
-1,1
^(C × dk)$。 实际控制指令由以下公式合成:
a_t = C[a_t + ∑(k ∈ K) 1[gt = k] , B_k odot M_k odot u(k,t)]
其中: - gt ∈ 0 ∪ K 为当前激活的瓶颈索引(0 表示基础策略独占控制); - M_k 为二元坐标掩码,将残差限制在与瓶颈相关的动作维度(如夹爪开合或末端执行器平移); - B_k 为物理边界约束; - C(·) 施加机器人指令约束。 未训练的残差策略输出零残差,确保系统初始行为等价于基础策略,避免在训练初期破坏已有可靠行为。 —- ### 2. 基于局部结果奖励的在线强化学习 针对完整任务稀疏终端奖励 R = prod(i=1)^N φ_i 导致学习信号微弱的问题,PARTS 为每个瓶颈定义独立的局部结果奖励:
rk = φ_k
即子任务成败直接作为该瓶颈的奖励信号,将信用分配 horizon 从完整的 20–120 秒缩短至 3–15 秒。 **学习算法**:每个瓶颈配备独立的在线 TD3+BC 学习器,包含一个残差 Actor 与一对 Twin Critics,以及专属回放缓冲区 D_k 。 - **Critic 更新**(带目标网络 psi_j 与目标噪声 ε ):
U’ = M odot clip(f(θ)(s’, A’) + ε, -1, 1)
y = ∑(τ=0)^(C-1) γ^τ rτ + (1-d)γ^C min(j=1,2) Q(psi)_j(s’, U’)
LQ = ∑(j=1)^(2) E(B)[(Q(psi_j)(s, U) - y)^2]
- **Actor 更新**:最大化 Critic 估计值,同时通过行为克隆(BC)向成功片段的残差靠拢,并对失败片段的非零残差施加锚定惩罚:
Lπ = -λ_Q E(B)[Q(psi_1)(s, U)] + λ+ langle |U - U|^2 rangle(B)^+ + λ- langle |U|^2 rangle_(B)^-
其中 B^+ 与 B^- 分别表示成功与失败 episode 的批量样本。此外,**参考丢弃(reference dropout)** 以一定比例将名义动作块 A 置零,防止 Actor 仅复制基础策略输出而非真正改进。 —- ### 3. 可执行的自动化脚手架(Agentic Scaffolding) 为消除训练交互过程中的人工纠正、策略切换与奖励标注,PARTS 将人类对瓶颈的抽象描述(契约)转化为三个可执行程序,由 Coding Agents(如 Claude 与 GPT 系列)自动生成并迭代: - **策略选择器(Policy Selector)**:根据多视角 RGB、本体感知与运动谓词,在任务结构下判断当前状态是否满足瓶颈 k 的入口条件 E_k ,进而激活对应残差策略;若条件不满足,则保持基础策略控制。支持有序链式激活与重复激活(如 LEGO 任务中每块砖的重复抓取)。 - **成功验证器(Success Verifier)**:当人类定义的事件门控(如夹爪打开)触发后,检验契约中的后置条件 φ_k 。若结果需在时间维度上稳定(如耳机正确 seated 而非仅搭在边缘),则要求跨观测帧持续满足。验证器输出二元奖励 r_k ∈ 0,1 ;若视觉置信度不足,可请求人工覆写。 - **自动重置策略(Auto-Reset Policy)**:在每次尝试结束后决定是**直接重试**(失败但初始条件仍满足)还是**执行重置**(成功改变了场景或失败导致状态不可恢复)。重置优先由机器人自主完成(如放下抓取的物体),超出硬件能力时(如从充电盒中取出已插入的耳机)请求人工介入。 该设计使得 RL 训练交互无需人类实时监督,仅需在场景无法自主恢复时进行物理重置。 —- ### 4. 成功重加权重训练与重新部署(Success-Reweighted Retraining) 针对两个实际问题——局部奖励稀疏与局部重置导致的分布偏移——PARTS 引入周期性离线重训练: - **问题 1**:若基础策略在某瓶颈的成功率很低,在线回放缓冲区中成功样本极度稀缺,Critic 学习困难。 - **问题 2**:为节省重置时间,局部训练通常将场景重置到子任务起始状态 μ_i 而非完整任务初始状态。连续尝试的状态分布高度相似,在线更新容易过拟合到该特定配置,在评估时面对基础策略产生的真实进入分布 μ_i 时失效。 **解决方案**:定期从回放缓冲区 D_k 中构造 curated 数据集:
Dk = D_k^+ ∪ Sample_rho(D_k^-)
即保留**全部成功 episode**,并均匀采样比例为 rho 的失败 episode。在该固定数据集上从头训练新的 Actor-Critic 网络,由操作员选择优质检查点。随后,以该检查点与 curated 缓冲区初始化新一轮在线学习,继续收集新交互数据。 这一机制提高了奖励样本在 curated 数据中的比例,同时通过跨多次重置的成功样本覆盖更广泛的进入状态分布,缓解过拟合。 —- ### 5. 评估阶段的完整任务执行 在推理时,系统按任务结构顺序执行: 1. 基础策略控制非瓶颈段; 2. 策略选择器在瓶颈入口自动切换至对应残差策略; 3. 成功验证器确认 φ_k = 1 后,将控制权交还基础策略; 4. 后续瓶颈按相同逻辑依次处理,直至任务完成。 通过这种“基础策略为主、残差策略定点修正”的混合执行模式,PARTS 既保留了预训练模型的通用能力,又通过局部 RL 实现了对关键缺陷的针对性修复。 Q4: 论文做了哪些实验? 论文在真实机器人平台上开展了系统性的实验评估,围绕三个核心问题展开: - **Q1**:针对性子任务强化学习能否提升预训练 VLA 在完整长程任务上的表现? - **Q2**:在匹配的机器人交互预算(rollout budget)下,PARTS 与全任务强化学习微调方法相比如何? - **Q3**:成功重加权重训练(success-reweighted retraining)是否关键? 以下是实验的具体构成与结果: —- ### 1. 实验任务与平台 实验覆盖三个长程操作任务,涉及双臂与单臂平台,任务时长在 20–120 秒之间(约 600–3,600 个控制步,控制频率 30 Hz): | 任务 | 平台 | 长程结构 | 瓶颈子任务 | 难点特征 | |:—-|:—-|:—-|:—-|:—-| | **Earbud insertion** | 双臂 YAM | 开盒持盒 → 插入第一只 → 插入第二只 → 关盒放置 | Case preparation (RL0)、Insert 1st (RL1)、Insert 2nd (RL2) | 双手协调精度要求高;持盒姿态影响后续插入;夹爪遮挡导致视觉难以区分 seated 与 resting 状态 | | **LEGO sorting** | 双臂 YAM | 左右臂抓取 → 运输 → 按颜色分类投放(重复 10 块积木) | 抓取(Grasp) | 积木尺寸相对基础策略训练数据 out-of-distribution;抓取微小失败在重复 10 次后会耗尽时间预算 | | **Cable unplug & plug** | 单臂 Franka FR3 | 抓取连接器 → 拔出 → 移动到目标路由器 → 对齐插入 → 释放 | 对齐与插入(Align & Insert) | 插入需在端口容差内对齐并执行果断接触运动;微小偏移会导致连接器卡在壳体边缘 | —- ### 2. 对比基线 所有强化学习方法均从相同的 π 0.5 -SFT 基础策略出发,在**完全相同的真实机器人交互时间预算**下进行训练(统计纯机器人执行 rollouts 的耗时,排除场景重置与策略更新暂停时间)。训练过程中不接受人工示教纠正或 DAgger 式干预。 - ** π 0.5 + SFT**:基础策略在任务演示上监督微调后的性能,作为无在线 RL 的参照。 - **DSRL**:在冻结 VLA 的隐空间噪声上学习在线 RL 策略,通过选择噪声来引导动作生成,在**全任务**上训练。 - **EXPO-FT**:学习编辑策略修改 VLA 的动作块,并在 Q 函数指导下继续更新 VLA 骨干网络,在**全任务**上训练(未使用其原论文的人工干预与自动奖励检测)。 - **RLT**:冻结 VLA 并训练小型 actor-critic 精调参考动作块,但在 earbuds 与 cable 上采用**人工指定的单次 VLA-to-RL 切换**(无交还控制);在 LEGO 上因需要反复切换而改为全任务 RL。 - **PARTS (ours)**:本文方法,仅在瓶颈子任务内训练残差策略。 - **PARTS w/o retraining**:消融实验,移除成功重加权重训练与重新部署机制。 —- ### 3. 评估指标 每项方法在每个任务上评估 **20 轮完整 episode**,从完整任务的初始状态开始。指标包括: - **完整任务成功率(Binary whole-task success)**:所有阶段均成功的二元指标。 - **进度分数(Normalized progress score)**: - Earbuds:每完成一个阶段(开盒持盒 / 插入第一只 / 插入第二只)获得 1/3 分数,满分要求全部完成。 - Cable:拔出与插入各占 1/2 分数,满分要求两者均成功。 - LEGO:仅报告进度分数,即在 150 秒时限内完成分类的积木比例( 0% – 100% );因任务重复 10 次,二元成功指标信息量不足。 - **每阶段成功率(Per-stage success)**:在相同评估 episode 中,各瓶颈子任务独立满足其出口条件 φ_k 的比例,不依赖于其他阶段是否成功。 —- ### 4. 主要实验结果 #### Q1:PARTS 对基础策略的提升 - **Earbuds**:完整任务成功率从基础策略的 10% 提升至 40% ,进度分数从 45% 提升至 66.7% ;插入阶段(Insert 1st / 2nd)成功率提升 20–35 个百分点。 - **Cable**:完整任务成功率从 50% 提升至 95% ,进度分数从 75% 提升至 97.5% ;仅需约 29 分钟真实世界 RL rollouts。 - **LEGO**:进度分数从 54% 提升至 82% ;仅需约 17 分钟 RL rollouts,且同一抓取残差策略在 10 次重复抓取中被复用。 #### Q2:与全任务 RL 基线在相同预算下的对比 在控制的机器人交互时间下,PARTS 在所有任务上均一致优于基线: - **DSRL**:将探索限制在 VLA 可生成的行为空间内,学习稳定,但在有限预算下对基础策略的提升不显著。 - **EXPO-FT**:表现弱于甚至劣于基础策略,表明在稀疏全任务奖励驱动下持续更新 VLA 骨干网络可能破坏原本可靠的非瓶颈行为(如 cable 的拔出阶段)。 - **RLT**:作为与 PARTS 最接近的残差学习基线,仍显著落后。其单阶段切换设计无法处理 LEGO 等需要反复切换的重复瓶颈,且在 earbuds 等多瓶颈链式任务中缺乏 PARTS 的多次 Base↔Residual 协调能力。 PARTS 的优势源于: 1. **预算集中**:避免在基础策略已掌握的阶段浪费交互时间; 2. **局部密集奖励**:将信用分配 horizon 从 20–120 秒缩短至 3–15 秒,使成功率高于 25% 的瓶颈子任务能提供频繁的正向反馈; 3. **行为解耦**:冻结基础策略防止了可靠行为的退化。 #### Q3:成功重加权重训练的消融 在 earbuds 任务上移除 retraining 后(仅对 RL1 与 RL2 执行消融),完整任务与各瓶颈阶段的成功率均出现下降(图 4 中 hatched bars): - 原因:RL1 与 RL2 的基础成功率低,在线缓冲区中成功样本稀缺;且局部重置将场景恢复到 RL0 成功后的固定状态,导致连续尝试的状态分布高度相似。仅在线更新易使残差策略过拟合于该局部重置分布,在评估时无法泛化到基础策略真实产生的进入状态分布。 - RL0 未执行 retraining,因其基础成功率高且重置直接来自任务初始状态,已覆盖评估分布,消融影响可忽略。 —- ### 5. 人类参与方式对比 论文同时记录了各方法在 RL 数据收集阶段对人类监督的需求差异: | 方法 | Rollout 过程 | 奖励标注 | 场景重置 | |:—-|:—-|:—-|:—-| | DSRL | 自主 | 需人工 | 需人工 | | EXPO-FT | 需人工(切换/纠正) | 基于规则检测 + 人工覆写 | 需人工 | | RLT | 需人工(每 episode 切换) | 需人工 | 需人工 | | **PARTS** | **自主** | **自动验证器(多数情况)** | **自动或按需人工** | PARTS 将训练交互中的人工纠正、策略切换与奖励标注全部自动化,仅需人类在初始阶段指定瓶颈契约,并在机器人无法自主恢复场景时执行物理重置。 Q5: 有什么可以进一步探索的点? 基于论文结论与方法设计,以下方向值得进一步探索: ### 1. 瓶颈子任务的自动识别与契约生成 当前框架依赖人工观察基础策略的失败模式并指定瓶颈契约(entry set, action mask, outcome criterion 等)。未来可探索让智能体自动从策略失败日志、状态分布偏移或价值函数退化中识别瓶颈,并自动生成可执行的子任务契约,从而将 PARTS 推向**全自主 setup**,消除人工指定瓶颈的开销。 ### 2. 从稀疏结果奖励到稠密过程奖励 PARTS 目前采用二元局部结果奖励 r_k = φ_k 。当瓶颈子任务本身成功率极低或视觉验证困难时(如 earbuds 中 seated vs. resting 的判别),学习信号依然稀疏。未来可研究利用 VLMs、世界模型或视频预测模型自动生成**稠密的子任务过程奖励**(dense subtask rewards),在子任务内部提供更细粒度的信用分配,加速成功样本稀缺时的学习。 ### 3. 子任务失败后的自主恢复行为(Recovery Phases) 当前系统在子任务失败后依赖自动重试或人工物理重置。未来可引入**恢复策略(recovery policies)**的学习:当验证器判定 φ_k = 0 时,机器人不直接停止或请求人工,而是执行一个学习到的恢复行为将场景带回可重试状态。这能进一步减少对人类重置的依赖,并允许在真实场景中连续自主练习。 ### 4. 提升可执行脚手架(Agentic Scaffolding)的鲁棒性与自适应 策略选择器、成功验证器和重置策略目前由 coding agents 依据初始契约生成,在训练期间保持固定。未来可探索: - **在线自适应脚手架**:根据训练过程中观察到的分布漂移或验证失败案例,自动修正选择器的激活条件或验证器的判断阈值; - **VLM 的领域适配**:对用于视觉验证的 VLM 进行少量任务特定后训练(如 earbuds 的 seated 判别),替代当前仍需人工覆写的环节,实现完全自主的奖励标注。 ### 5. 复杂任务结构下的多瓶颈协调 论文中的任务主要涉及线性链式瓶颈或单一重复瓶颈。对于包含**并行瓶颈、条件分支或层级依赖**的更长程任务(如 σ_i 与 σ_j 同时执行,或 σ(i+1) 的选择取决于 σi 的多种可能出口状态),当前的选择器-验证器架构需要扩展。可探索图结构或层次化强化学习来管理多瓶颈间的切换与资源共享。 ### 6. 跨任务与跨平台的残差策略迁移 PARTS 为每个任务的每个瓶颈独立训练残差策略。未来可研究残差策略的**跨任务迁移**:例如,将不同任务中学到的”精确插入”或”小物体抓取”残差泛化为可复用的技能原语,或通过参数高效微调(如 LoRA)快速适配到新任务的类似瓶颈,进一步降低新任务上的样本复杂度。 ### 7. 极少甚至零样本初始化的适配 当前 PARTS 仍需要少量子任务演示来定义契约与初始化。未来可探索**零样本或少样本的瓶颈适配**:仅通过任务语言描述与基础策略的零试执行,结合主动学习或好奇心驱动探索,自动生成子任务边界并启动残差训练,从而进一步压缩人类干预至最低限度。 Q6: 总结一下论文的主要内容 ## 论文主要内容总结 ### 1. 研究背景与核心问题 预训练的视觉-语言-动作(VLA)机器人基础策略(如 π 0.5 )具备通用的操作先验,但在面向具体的长程操作任务时,往往仅在少数关键**瓶颈子任务**上反复失败。现有适配方法存在以下局限: - **全任务监督微调(SFT)** 要求操作员重复录制策略已掌握的子任务行为,人工数据收集效率低下; - **全任务强化学习(RL)** 依赖长程稀疏二元奖励 R = prod(i=1)^(N) φ_i ,前期子任务失败导致智能体难以练习后期瓶颈,且端到端更新易破坏原本可靠的非瓶颈行为; - **现有真实世界 RL 微调方法** 通常需要人工在交互过程中进行动作纠正、策略切换决策或成功/失败标注,可扩展性差。 ### 2. 核心方法:PARTS 框架 该研究提出 **PARTS(Policy Adaptation with RL on Targeted Subtasks)**,一种将真实世界 RL 训练预算集中于瓶颈子任务的适配框架,其关键设计包括: #### (1)冻结基础策略与残差修正 预训练 VLA 经少量任务演示 SFT 后完全冻结,作为名义执行器贯穿任务全程。仅在人工识别的瓶颈子任务处,激活轻量级的残差 Actor-Critic 策略。实际控制指令为:
at = C[a_t + ∑(k ∈ K) 1[gt = k] , B_k odot M_k odot u(k,t)]
其中 at 为基础策略的名义动作, u(k,t) 为残差输出, M_k 与 B_k 分别为动作坐标掩码与物理边界约束, g_t 为策略选择器输出的激活标志。未训练时残差输出为零,确保初始行为不退化。 #### (2)局部结果奖励与在线学习 每个瓶颈拥有独立的局部成功验证器,将子任务成败 φ_k 作为密集反馈:
r_k = φ_k
此举将信用分配 horizon 从完整的 20–120 秒缩短至 3–15 秒。各瓶颈独立维护回放缓冲区,采用 **TD3+BC** 进行在线更新:Critic 通过时序差分学习估计残差动作价值,Actor 在最大化 Critic 的同时,向成功 episode 的执行残差进行行为克隆,并对失败 episode 的非零残差施加锚定惩罚。 #### (3)自动化脚手架(Agentic Scaffolding) 为消除训练过程中的人工实时干预,由 Coding Agents 自动生成并迭代三个可执行程序: - **策略选择器**:根据视觉与本体感知判断瓶颈入口条件,自动切换基础策略与残差策略; - **成功验证器**:检验子任务后置条件,输出二元奖励;视觉模棱两可时可请求人工覆写; - **自动重置策略**:决定失败后直接重试或执行场景重置;机器人力所能及时自主恢复,否则请求人工物理重置。 #### (4)成功重加权重训练与重新部署 为缓解局部重置导致的分布偏移与成功样本稀缺,定期构造 curated 数据集:
D_k = D_k^+ ∪ Sample_rho(D_k^-)
即保留全部成功 episode 并采样少量失败 episode,从头训练新网络后重新部署并恢复在线学习。该机制帮助残差策略逃逸局部最优,提升对真实任务流进入状态的泛化能力。 ### 3. 实验设置 实验在双手机器人 YAM 与单臂机器人 Franka FR3 上开展,涵盖三个长程任务: - **Earbud insertion**(YAM):开盒持盒 → 插入两只耳机 → 关盒放置,瓶颈为持盒姿态与两次插入; - **LEGO sorting**(YAM):重复抓取、运输、投放 10 块小积木,瓶颈为尺寸超出分布的抓取动作; - **Cable unplug & plug**(Franka):拔出连接器并插入新路由器,瓶颈为对齐与插入。 对比基线包括冻结基础策略(SFT)、DSRL、EXPO-FT 与 RLT,所有 RL 方法在**严格匹配的机器人交互时间预算**下训练,且不接受人工动作纠正。 ### 4. 主要结果 - **任务成功率显著提升**:在 YAM 平台上,完整任务成功率从基础策略的 32% 提升至 61% ;在 Franka 平台上,从 50% 提升至 95% 。每个任务平均仅需数十分钟的真实世界 RL 交互。 - **优于全任务 RL 基线**:在相同交互预算下,PARTS 较 DSRL、EXPO-FT 与 RLT 提升完整任务成功率超过 25% 。EXPO-FT 因更新 VLA 骨干网络甚至破坏了原有可靠行为;RLT 的单次切换设计无法处理多瓶颈与重复瓶颈场景。 - **消融验证**:移除成功重加权重训练后,earbuds 任务的瓶颈阶段与完整任务成功率均下降,证明该机制对克服分布偏移与稀疏奖励至关重要。 - **人工干预最小化**:训练交互过程中无需人工纠正、策略切换或奖励标注,仅需在场景无法自主恢复时进行物理重置。 ### 5. 核心贡献 - **问题形式化**:提出了利用局部结果奖励在选定瓶颈上进行预训练策略 RL 适配的范式,以完整长程任务成功率作为最终评估标准。 - **系统框架**:设计了 PARTS,将可执行子任务监督、残差 RL、成功重加权重训练与重新部署相结合,使真实世界训练交互无需人类实时介入。 - **真实世界验证**:在双臂与单臂平台上证明,PARTS 能在有限的真实交互预算内,从较弱的基础策略出发,实现大幅且可靠的性能提升。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Sichang Su,Benjamin Yang,Zhiyun Deng,Boyuan Liang,Yip Fun Yeung,Zelin Wang,Lingfeng Sun
Categories:
PDF URL: https://arxiv.org/pdf/2609.21788.pdf
Arxiv URL: https://arxiv.org/abs/2609.21788
Arxiv ID: 2609.21788
CoolPaper URL: https://papers.cool/arxiv/2609.21788
Published: 2026-09-22T01:51:43.136Z
Updated: 2026-09-22T01:51:43.136Z
17. CADWorld: Computer-Use Benchmark for Long-Horizon Computer-Aided Design
Abstract:Computer-use agents are increasingly evaluated in realistic desktop environments, but existing benchmarks provide limited coverage of professional engineering workflows whose outputs are persistent, structured artifacts. Mechanical computer-aided design (CAD) is a particularly demanding setting: an agent must manipulate geometry and constraints over long interaction horizons while producing a native project whose dimensions, construction structure, and downstream engineering state remain valid. We introduce \textbf{CADWorld}, a benchmark for long-horizon computer use in FreeCAD. CADWorld contains 200 tasks spanning 11 mechanical-CAD workflow categories, including sketching, part modeling, assembly, CAM, FEM, measurement, mesh processing, and technical drawing. Agents operate through screenshots and GUI actions, while success is determined by task-specific executable checks over saved FreeCAD artifacts and auxiliary outputs, covering geometric properties, parametric structure, constraints, manufacturing state, and simulation results. Across seven current agents on the full benchmark, the strongest agent achieves 17.5\% success, compared with an 87.0\% expert reference pass. We find that weaker agents often fail before producing a valid artifact, whereas stronger agents increasingly fail on structural, geometric, and construction-process requirements. CADWorld therefore exposes a gap between general GUI competence and reliable execution of persistent, verifiable engineering workflows. Project accessible at this https URL.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 该论文旨在解决\*\*现有计算机使用代理(Computer-Use Agents, CUAs)基准测试在评估专业机械CAD(计算机辅助设计)工作流方面的系统性缺失与不足\*\*。具体而言,其核心问题意识体现在以下几个层面: --- ### 1. 填补通用CUA基准对专业工程工作流覆盖不足的空白 现有主流CUA基准(如OSWorld、WebArena等)主要聚焦于网页浏览、办公文档处理或通用操作系统任务,对\*\*需要生成持久化、可编辑、可验证工程工件\*\*的专业工作流缺乏深入评估。机械CAD涉及草图绘制、零件建模、装配、CAM(计算机辅助制造)、FEM(有限元分析)等长周期、强状态依赖的流程,其难度远超简单的按钮点击或表单填写。 ### 2. 克服现有CAD评估范式脱离真实GUI交互的局限 当前CAD领域的基准大多从\*\*几何表示或程序生成\*\*角度进行评估(例如生成CAD代码、命令序列、网格或点云),而非要求代理通过原始图形界面操作专业CAD软件。论文指出: - 生成代码后重新运行 ≠ 在原生CAD环境中通过GUI直接修改草图、特征或约束 - 仅评估最终几何外观或渲染图像,无法反映工程工件的参数化结构、特征历史、约束关系及下游可编辑性 因此,论文试图建立一种\*\*以GUI交互为核心、以原生CAD工件为评估对象\*\*的新范式。 ### 3. 解决长周期CAD工作流中"工件级正确性"的验证难题 机械CAD的成功标准不仅在于视觉相似,更在于: - \*\*几何精确性\*\*:尺寸、体积、位置、公差必须符合要求 - \*\*结构完整性\*\*:特征树、草图约束、装配关节、材料属性等必须正确保留 - \*\*下游可用性\*\*:工件需支持重新打开、测量、编辑及后续制造/仿真流程 现有基准缺乏针对这些多维度的、可执行的、任务特定的自动化检验机制。论文试图通过\*\*基于持久化工件的评估器(artifact-grounded evaluators)\*\*来解决这一问题,实现对几何属性、参数结构、约束状态、制造设置及仿真结果的程序化验证。 ### 4. 暴露通用GUI能力与可靠工程自动化之间的能力鸿沟 论文试图通过引入CADWorld这一基准,\*\*量化当前CUA在长周期机械CAD任务上的实际表现差距\*\*。实验显示,即使是最强的代理在200项任务上的成功率也仅为17.5%,远低于人类专家的87.0%。这一结果揭示了: - 弱代理往往因界面导航失败而无法生成有效工件 - 强代理虽能保存文件,却频繁在几何语义、结构要求和建模过程上出错 换言之,论文试图证明:\*\*具备通用GUI操作能力并不等同于能够可靠执行需要维持工程语义、空间推理与精确交互的专业CAD工作流\*\*。 Q2: 有哪些相关研究? 相关研究主要分布于\*\*通用计算机使用基准\*\*与\*\*CAD领域专用基准\*\*两个方向,论文在第2节(Related Work)及表1中对其进行了系统梳理与对比。 --- ### 1. 通用计算机使用基准(General Computer-Use Benchmarks) 这类基准推动了对真实图形界面环境中多模态代理的评估,但尚未深入覆盖专业机械CAD工作流: - \*\*Mind2Web\*\*(Deng et al., 2023):建立通用网页交互与指令遵循基准。 - \*\*WebArena\*\*(Zhou et al., 2023)与 \*\*VisualWebArena\*\*(Koh et al., 2024):分别构建基于文本与视觉的现实网页任务环境。 - \*\*OSWorld\*\*(Xie et al., 2024):将评估扩展至通用桌面应用与操作系统任务,支持基于状态的验证。 - \*\*OSWorld 2.0\*\*(Yuan et al., 2026):包含更长周期的真实世界工作流,涵盖少量工程/CAD子集。 - \*\*Agents' Last Exam\*\*(Sun et al., 2026):评估跨多个专业领域的经济相关任务,包含少量CAD/CAM相关内容。 - \*\*ScreenSpot-Pro\*\*(Li et al., 2025b)与 \*\*GUI-EDA\*\*(Li et al., 2025a):聚焦密集专业软件界面中的视觉定位与操作难度。 上述基准揭示了真实图形环境对代理的挑战,但均未系统覆盖机械CAD所需的草图约束、参数化零件建模、装配体、CAM、FEM、材料、测量及工程图等完整知识谱系。 --- ### 2. CAD领域专用基准(CAD-Domain Benchmarks) 这类研究主要从几何表示或程序化生成角度评估CAD能力,与CADWorld通过原生GUI交互并评估持久化工件的范式存在本质区别: #### 2.1 大规模几何与建模序列数据集 - \*\*ABC\*\*(Koch et al., 2019):大规模CAD模型几何数据集。 - \*\*Fusion 360 Gallery\*\*(Willis et al., 2021):提供程序化CAD构建的人类设计序列。 - \*\*SketchGraphs\*\*(Seff et al., 2020):面向CAD中关系几何建模的大规模草图数据集。 - \*\*DeepCAD\*\*(Wu et al., 2021):面向CAD模型生成的深度生成网络数据集。 #### 2.2 文本/视觉条件化的CAD生成基准 - \*\*Text2CAD\*\*(Khan et al., 2024)与 \*\*Text2CAD-Bench\*\*(Wang et al., 2026):评估基于文本提示的CAD生成。 - \*\*CADPrompt / CADCodeVerify\*\*(Alrashedy et al., 2024):评估可执行的CAD程序或代码生成。 - \*\*CADBench\*\*(Doris et al., 2026)与 \*\*BenchCAD\*\*(Zhang et al., 2026):评估由文本、视觉或代码指令生成的CAD程序。 #### 2.3 richer procedural structure、逆向工程与迭代编辑 - \*\*CAD-Recode\*\*(Rukhovich et al., 2024)与 \*\*CADReasoner\*\*(Kabisov et al., 2026):聚焦逆向工程与迭代重建。 - \*\*HistCAD\*\*(Dong et al., 2026b):建模带几何约束的参数化历史。 - \*\*MUSE\*\*(Dong et al., 2026a):考虑装配体与设计意图的生成基准。 - \*\*IterCAD-Bench\*\*(Hu et al., 2026)与 \*\*neuralCAD\*\*(Perrett et al., 2026):引入迭代或多模态编辑设定。 #### 2.4 诊断性评估基准 - \*\*CADTestBench\*\*(Mallis et al., 2026)与 \*\*CADEngBench\*\*(Singh et al., 2026):在诊断性评估方面做出改进,但仍以几何、代码或紧凑命令序列为主要评估对象。 --- ### 3. CADWorld与现有研究的区别 论文通过表1将CADWorld与上述基准进行了系统对比,核心差异体现在: | 维度 | 现有通用/CAD基准 | CADWorld | |------|------------------|----------| | \*\*交互方式\*\* | 网页/桌面通用任务;代码/命令/API生成 | 通过截图与GUI动作操作FreeCAD原生界面 | | \*\*评估对象\*\* | 文本答案、视觉相似性、生成代码、网格或静态几何 | 保存的\*\*原生可编辑工件\*\*(.FCStd) | | \*\*工件属性\*\* | 常丢失参数化历史、约束与特征树 | 保留完整构建历史,支持重新打开与直接编辑 | | \*\*验证精度\*\* | 渲染外观、点云或网格几何 | 可执行的几何、尺寸、拓扑、制造与仿真状态检查 | | \*\*任务覆盖\*\* | CAD仅占很小比例或仅覆盖单一环节 | 200项任务跨越11类机械工程工作流,含183个独立知识点 | 简言之,现有研究或关注通用GUI能力但缺乏CAD深度,或关注CAD生成但绕过真实GUI交互与持久化原生工件验证;CADWorld试图填补这两者之间的空白,将\*\*长周期GUI交互\*\*与\*\*工程工件级可执行验证\*\*统一于机械CAD场景。 Q3: 论文如何解决这个问题? 该论文通过构建并验证 \*\*CADWorld\*\* 基准测试系统来解决上述问题。该解决方案并非提出单一算法,而是建立了一个覆盖长周期机械CAD工作流、强制原生GUI交互、并以持久化工件可执行验证为核心的完整评估框架。具体实现路径如下: --- ### 1. 构建高覆盖度的专业化任务集 论文首先系统性地定义了机械CAD领域的评估范围,设计出包含 \*\*200项任务\*\* 的基准集,跨越 \*\*11个机械工程工作流类别\*\* 与 \*\*183个独立知识点\*\*。 - \*\*工作流类别\*\*:草图(Sketch)、零件(Part)、装配体(Assembly)、CAM、有限元分析(FEM)、外观(Appearance)、点云(Cloud Point)、宏(Macro)、测量(Measure)、网格(Mesh)与工程图(TechDraw)。 - \*\*任务结构\*\*:每项任务定义为元组 x_i = (iota_i, p_i, u_i, e_i, H_i) ,分别对应自然语言指令、可选前提文件、参考资产、任务特定评估器与最大交互步数。 - \*\*状态依赖与长周期特性\*\*:任务从空白文档或预置文件开始,要求代理在数十至上百步内协调跨草图、特征树、对话框、工作台与模块的复杂操作。 --- ### 2. 建立工件导向的可执行评估范式 区别于依赖视觉相似性或文本回答的传统基准,CADWorld 将评估锚定在代理\*\*保存的持久化工程工件\*\*上。 - \*\*评估对象\*\*:代理终止后保存的 \`.FCStd\` 原生文件及辅助输出(如CSV、网格、截图)。 - \*\*奖励函数\*\*:将交互形式化为部分可观察马尔可夫决策过程 M_i = (S, O, A, T, R_i, H_i) ,其中终端奖励由评估器严格定义为
Ri(sτ) = ei(φ(sτ)) ∈ 0, 1
仅当所有任务特定检查通过时取值为1,否则为0。 - **多层级检查**:评估器按工作流类型检查不同层级的工程状态: - **草图**:实体数量、几何约束、尺寸标注、轮廓面积与周长; - **零件**:对象类型、标签、体积、表面积、边界框与参数属性; - **装配体**:关节类型(如转动副、移动副、齿轮齿条副等)的元数据; - **CAM**:毛坯到目标体的材料去除、刀路数据、过切/欠切比率; - **FEM**:分析对象、材料、边界条件、网格、求解器结果及导出的CSV数值。 —- ### 3. 设计受限但完整的原生GUI交互接口 为确保代理通过与人相同的视觉-操作通道完成任务,CADWorld 构建了一个基于截图的动作循环,并强制排除直接脚本或API调用。 - **观察空间**:代理接收当前桌面截图、任务指令、可选参考图像及紧凑的近期轨迹历史。 - **动作空间**:基于 `pyautogui` 的受限命令集,包括鼠标移动、点击、拖拽、滚动、按键、热键及 `WAIT` / `DONE` / `FAIL` 控制令牌。 - **状态化组合输入**:支持键盘与鼠标的保持-释放序列(如 `keyDown(‘shift’)` + `mouseDown(button=’right’)` + `moveTo` + `mouseUp` + `keyUp`),以准确还原CAD中必需的视图旋转、多选与约束编辑操作。 - **交互预算**:标准设置下每任务最多允许100个GUI步骤,防止无限循环并统一效率比较基准。 —- ### 4. 实现可诊断的失败归因体系 为区分“无法操作界面”与“无法理解工程语义”两类失败,论文建立了 **11种确定性失败类型**(F1–F11),按评估阶段顺序匹配: - **F1–F3(保存阶段)**:代理声称完成但未保存、无输出文件、文件损坏; - **F4–F5(项目结构阶段)**:未使用前提文件、文档结构错误(缺失必要体、草图或特征); - **F6–F7(几何阶段)**:几何接近但超差、几何完全错误; - **F8–F10(建模方法阶段)**:形状正确但构建方式错误、构建过程错误、几何与过程均错误; - **F11(基础设施)**:诊断工具不可用。 该体系使得失败分析无需依赖大语言模型裁判或人工逐条检查,仅通过评估器证据与轨迹记录即可自动归因。 —- ### 5. 部署可复现的FreeCAD虚拟机环境 为保证基准的公开可复现性,论文选择 **FreeCAD** 作为宿主平台,部署于 **Docker/QEMU-KVM Ubuntu虚拟机** 中。 - **统一环境**:预配置1920×1080分辨率、固定软硬件资源(8核CPU、8GB RAM、64GB磁盘),消除因平台差异导致的性能波动。 - **完整轨迹记录**: runner 记录每步截图、JSONL轨迹、屏幕录像、运行日志与生成文件,确保评估结果可追溯至具体UI动作。 - **排除外部依赖**:所有任务资产在重置阶段预置到虚拟机中,代理不直接处理文件句柄,而是像人类一样通过GUI观察其存在。 —- ### 6. 通过大规模代理评估验证问题存在并量化差距 论文最终通过对 **7个当代计算机使用代理**(包括GPT-5.4、Opus 4.8、Kimi K2.6、OpenCUA等)的完整评估,验证并量化了所提出的问题: - **成功率差距**:最强代理(GPT-5.4)成功率仅为 **17.5%**,而人类专家参考基线为 **87.0%**; - **失败模式分布**:弱代理主要失败于无法生成有效工件(F1–F2),而强代理更多暴露于结构错误(F5)、几何超差(F6)与建模方法错误(F8–F9),证明通用GUI能力无法直接迁移为可靠的工程语义保持能力; - **下游工作流盲区**:所有代理在CAM、FEM与TechDraw任务上成功率为 **0%**,凸显当前代理对非视觉显性、强领域语义的专业流程缺乏理解。 此外,消融研究表明:移除原生计算机使用工具(computer-use harness)后,即使是最强模型也无法完成任何任务;仅允许终端命令行交互的代理虽能生成几何,但会破坏原生参数化编辑结构,进一步证明**通过GUI维持可编辑工件历史**的必要性。 Q4: 论文做了哪些实验? 论文围绕 **CADWorld** 基准开展了一系列实验,涵盖全量任务评估、消融对比、短任务诊断、人类专家参照及失败归因分析。所有实验均基于统一的 FreeCAD 虚拟机环境(Ubuntu 22.04 LTS,1920×1080 分辨率,最多 100 个 GUI 步骤)进行。 —- ### 1. 全量基准评估(200 任务覆盖集) 这是论文的核心实验,旨在量化当前通用计算机使用代理在机械 CAD 长周期工作流上的能力边界。 - **实验设置**:在完整 200 项任务上评估 7 个当代代理,包括: - 原生计算机使用模型:GPT-5.4(CUA)、Opus 4.8(CUA)、Holo 3.1、OpenCUA - 截图条件化的多模态大模型:Kimi K2.6、Qwen 3.6、MiniMax M3 - 同时记录人类专家演示作为效率锚点(非受试者群体研究,而是最优动作参考)。 - **评估指标**: - **成功率(Success Rate)**:保存的 `.FCStd` 工件通过该任务所有特定检查的比例; - **完成率(Finish Rate)**:代理正常结束但未通过检查的比例; - **效率指标**:平均输入/输出 token 数、API 成本、交互步数(含成功/完成子集的平均步数); - **失败归因**:按 F1–F11 的确定性规则对失败自动分类。 - **主要结果**(见 Table 3 与 Figure 4): - 最强代理 GPT-5.4 成功率仅 **17.5%**,Opus 4.8 为 **16.0%**,与人类专家的 **87.0%** 存在巨大差距; - 所有代理在 CAM、FEM、TechDraw 任务上成功率均为 **0%**; - 弱代理(Qwen 3.6、MiniMax M3、Holo 3.1、OpenCUA)成功率介于 **0%–1.5%**,且常陷入“死亡循环”(重复点击、无策略等待); - 失败模式随模型能力发生迁移:弱代理多因无法保存有效工件而失败(F1–F2),强代理则更频繁地在文档结构(F5)、几何精度(F6–F7)与建模过程(F8–F10)上出错。 —- ### 2. 消融实验:终端命令行 vs. 原生 GUI 交互 为回答两个关键问题——“仅通过终端命令能否完成这些任务?”以及“computer-use harness 是否显著提升性能?”——论文在 **50 项类别分层子集** 上开展了对比实验。 - **终端代理设置**:移除 GUI 动作接口,仅允许代理通过命令行/脚本与 FreeCAD 交互。 - **无 harness 的 GPT-5.4**:将同一模型置于无原生 computer-use 工具的条件下运行。 - **主要发现**(见 Figure 5): - 终端代理虽能生成部分几何,但其输出多为脚本驱动的“扁平”结果,**破坏了原生参数化编辑结构**,导致大量“错误文档结构”(F5)失败; - GPT-5.4 在 GUI harness 下成功率为 17.5%,而在 **无 harness 条件下完全无法完成任何任务**(0%),证明原生 computer-use 工具对该类工作流至关重要。 —- ### 3. 短任务子集诊断实验 为在低性能模型之间保留区分度,论文额外构造了 **10 项刻意简化的短任务**(freecad-sketch-061–063、freecad-part-076–077 等),测试最基础的草图、实体、材质、点云转换与测量能力。 - **实验设置**:与主实验相同的环境和代理阵容。 - **主要结果**(见 Appendix G,Table 9): - GPT-5.4 与 Opus 4.8 各完成 7/10; - Kimi K2.6 完成 4/10; - Holo 3.1、OpenCUA、MiniMax M3、Qwen 3.6 均未成功(0/10),但在步数分布上呈现差异,可用于区分模型能力下限。 —- ### 4. 人类专家效率参照实验 论文使用 **CUA Collector** 工具记录了人类专家在 112 项任务上的演示轨迹,用于与模型成功 case 进行效率对比。 - **实验设置**:选取 6 项同时存在人类记录与至少一个模型成功的代表性任务,比较步数与耗时。 - **主要结果**(见 Appendix H,Table 10): - 人类演示通常仅需 **8–32 步**、**34.2–147.0 秒**; - 最快成功的模型运行仍需 **19–53 步**、**82.8–215.4 秒**; - 差距在非常规模式(如点云转换、宏生成表格)下最大,在直接几何创建(如圆柱体)下相对较小。 —- ### 5. 失败案例的定性追踪实验 为理解失败机理,论文对保存的轨迹进行了定性检查,并在 Appendix I 中给出典型案例。 - **代表性失败模式**(见 Table 11): - **动作定位循环**:Holo 3.1 在文件对话框中 100 步内反复点击相近坐标(68 次点击于 (1056,630) ,23 次于 (1056,648) ),始终未能滚动或选中所需前提文件; - **空间定向错误**:模型生成了视觉上合理的七边形,但未满足“最右侧边垂直”的方向约束,导致草图评估器判定失败。 这些案例表明,仅凭最终截图或文本回答无法诊断错误,必须依赖完整动作轨迹与工件级检查。 —- ### 6. 跨工作流类别的细粒度分析 论文通过 Figure 4 提供了按工作流类别(Sketch、Part、Assembly、Manufacturing/Simulation、Utilities)的成功率与失败原因热力图。 - **发现**: - **Sketch**(12.7%)与 **Part**(22.1%)是强代理相对表现最好的类别,因其可见结果与公开教程中的交互模式较为常见; - **Assembly** 成功率骤降,反映代理难以理解关节元数据与运动语义; - **CAM / FEM / TechDraw** 完全失败,说明当前代理缺乏对非显性视觉状态(刀路、求解器对象、视图结构)的推理能力。 Q5: 有什么可以进一步探索的点? 基于论文的实验发现与第6节(Limitations)中明确的边界,以下方向值得进一步探索: —- ### 1. 从封闭目标向开放式设计意图的扩展 当前 CADWorld 任务均提供明确的目标描述与必要的前置资产,评估的是**执行能力**而非**设计能力**。未来可探索: - **需求获取与澄清**:代理如何通过与用户的多轮对话,将模糊的自然语言需求(如“设计一个能承受 500N 载荷的支架”)转化为可执行的 CAD 约束与几何参数。 - **设计空间探索与权衡**:在性能、重量、制造成本、材料可用性之间进行多目标权衡,而非仅验证单一几何解。 - **逆向工程与重构**:从非结构化输入(如扫描点云、手绘草图、遗留图纸)中恢复设计意图,并转化为参数化 CAD 模型。 —- ### 2. 跨 CAD 平台迁移与泛化 论文当前以 FreeCAD 为唯一评估环境,这保证了可复现性,但也限制了结论对工业实践的普适性。未来研究可探索: - **跨内核验证**:将同一套任务逻辑迁移至 SolidWorks、Siemens NX、Fusion 360 或 Onshape 等商业系统,检验代理对异构 UI 约定、几何内核差异及云/本地混合工作流的适应能力。 - **表示层与交互层的解耦**:开发能够先进行通用 CAD 语义推理(如“在此面上创建凹槽”),再映射至特定平台 UI 动作或 API 的中间表示,以提升跨平台泛化性。 —- ### 3. 专用工作流的深度突破 实验显示当前所有代理在 **CAM、FEM、TechDraw** 上的成功率为 0%。这提示需要针对下游工程工作流进行专门研究: - **制造语义理解**:代理需理解毛坯(stock)、目标体(target)、材料去除、刀具路径生成与后处理之间的因果关系,而非仅操作可见按钮。 - **仿真工作流自动化**:将载荷、边界条件、材料属性、网格划分与求解器配置的隐性状态显式化,开发能验证仿真有效性的专用评估器。 - **工程图与标注推理**:从 3D 模型中推导投影视图、剖面、尺寸链与公差标注,需结合制图标准(如 ISO/ASME)进行结构化评估。 —- ### 4. 长程状态依赖与错误恢复机制 论文发现强代理虽能保存工件,但频繁在**文档结构、几何精度与建模过程**上失败。未来可探索: - **特征树感知规划**:让代理显式维护对特征历史(feature history)与父子依赖关系的内部模型,避免早期草图修改导致下游 50 步之外的几何断裂。 - **中间状态验证与回溯**:在任务中途插入可执行的“检查点”(如验证草图是否全约束、拉伸是否成功),使代理具备自主诊断与局部回滚能力,而非仅在终点接受二元奖励。 - **交互效率优化**:当前最快成功代理仍需人类 2–4 倍的交互步数。研究如何从专家演示(behavior cloning)或强化学习中进行策略蒸馏,减少冗余的视图旋转与无目的探索。 —- ### 5. 视觉-空间-几何的联合推理增强 失败案例揭示了代理在 **2D 指针轨迹与 3D 几何/视图变换**之间的耦合困难。未来可探索: - **显式空间推理模块**:在纯截图输入之外,引入对几何选择集、约束求解器状态、特征树结构等辅助信号的融合感知,降低对像素级精度的过度依赖。 - **语义化动作抽象**:将低级的 `pyautogui.click(x, y)` 提升为“选择此面”“对此边应用相切约束”等语义动作,由环境负责解析为具体坐标,从而分离“做什么”与“在哪里点击”。 - **多视图一致性检查**:在 3D 建模中,代理需同时维护正视图、俯视图与等轴测图之间的一致性,避免在单一视角下产生视觉上合理但空间上错误的结构。 —- ### 6. 可编辑性与工程语义的显式评估 论文的消融实验表明,终端命令行代理虽能生成几何,但破坏了原生参数化编辑结构。未来可进一步量化: - **编辑距离的度量**:定义从保存工件中修改某一参数(如将圆孔半径从 5mm 改为 8mm)所需的最少人类操作步数,以此衡量代理输出的“工程可维护性”。 - **约束完整性指数**:不仅检查草图是否“全约束”,还评估约束的**工程合理性**(例如,对称约束是否优于逐点固定,以保证设计意图的传播)。 - **版本化与协作能力**:评估代理生成的工件在多用户审阅、工程变更(ECO)与版本控制系统中的兼容性。 —- ### 7. 鲁棒性与“死亡循环”的规避 低性能代理常陷入 **100 步内的重复点击与无策略等待**。未来可探索: - **动作多样性惩罚与探索激励**:在交互策略中引入对重复动作的显式惩罚,或设置基于信息增益的探索奖励。 - **错误信号的早期解读**:当代理进入错误对话框、选择错误工作台或触发几何求解失败时,开发能从 FreeCAD 的状态栏、报告视图与日志中提取诊断信号,并自动切换策略的机制。 - **人机协同的交互模式**:在代理置信度低于阈值时主动请求人类确认(如“请确认这是您需要的底面”),而非盲目执行,从而提升长周期任务的完成可靠性。 Q6: 总结一下论文的主要内容 该论文介绍了 **CADWorld**,一个用于评估计算机使用代理(Computer-Use Agents, CUAs)在长周期机械计算机辅助设计(CAD)工作流中性能的基准测试。以下为主要内容的结构化总结: —- ### 1. 研究背景与核心问题 现有计算机使用代理的基准测试多聚焦于通用网页浏览、办公任务或操作系统交互,对**专业工程工作流**的覆盖有限。机械CAD是一个极具挑战性的评估场景,原因包括: - **长周期与强状态依赖**:任务常需数十至数百步协调操作,跨越草图、特征树、对话框、工作台及分析模块; - **精确性要求**:微小的选择、点击、拖拽或参数输入错误可能通过下游依赖传播,导致几何或约束失效; - **工件级正确性**:成功不仅取决于视觉相似性,更取决于保存的**原生参数化工件**是否具备正确的尺寸、结构、约束历史及下游制造/仿真可用性。 现有CAD基准大多评估几何生成、CAD代码或命令序列,而非代理通过原生图形界面操作并生成可持久编辑的工程工件。这一空白促使作者提出:通用GUI能力是否足以支撑可靠的机械工程自动化? —- ### 2. CADWorld 基准设计 论文构建了 **CADWorld**,一个围绕 FreeCAD 的工件导向评估框架,核心设计包括: - **任务覆盖**:包含 **200项任务**,跨越 **11个工作流类别**(草图、零件建模、装配体、CAM、FEM、外观、测量、网格、点云、工程图、宏),涵盖 **183个独立知识点**。 - **交互范式**:代理仅通过**截图观察**与**可执行的GUI动作**(基于 `pyautogui` 的鼠标、键盘、状态化组合输入及控制令牌)与环境交互,排除直接脚本或文件系统访问,以贴近人类工程师的实际操作流程。 - **工件导向评估**:任务成功与否由**保存后的 `.FCStd` 文件及辅助输出**决定。评估器针对特定任务执行可程序化检查,包括: - 草图实体、约束与尺寸; - 零件体积、表面积、边界框与参数属性; - 装配体关节类型与运动关系; - CAM 材料去除与刀路正确性; - FEM 边界条件、求解结果与导出数值。 - **诊断体系**:定义 **11种确定性失败类型**(F1–F11),覆盖从“未保存文件”到“几何超差”再到“建模过程错误”的完整失败谱系,实现无需人工或LLM裁判的自动归因。 —- ### 3. 关键实验与结果 论文在统一环境(FreeCAD Ubuntu VM,1920×1080,最多100步)下评估了 **7个当代代理**(包括 GPT-5.4、Opus 4.8、Kimi K2.6、OpenCUA、Holo 3.1、Qwen 3.6、MiniMax M3),并与人类专家演示进行对比。 - **性能差距显著**:最强代理 GPT-5.4 成功率仅为 **17.5%**,Opus 4.8 为 **16.0%**,而人类专家参考基线为 **87.0%**。 - **失败模式分化**: - **弱代理**(如 Qwen 3.6、MiniMax M3)多因界面导航失败而无法生成有效工件(F1–F2:未保存或无输出),常陷入重复点击的“死亡循环”; - **强代理**(GPT-5.4、Opus 4.8)虽能保存文件,但更多暴露于**文档结构错误**(F5)、**几何精度不足**(F6–F7)及**建模过程不正确**(F8–F10)。 - **专业工作流完全失效**:所有代理在 **CAM、FEM、TechDraw** 任务上的成功率为 **0%**,表明当前代理难以处理非显性视觉状态(刀路、求解器对象、视图结构)与强领域语义的流程。 - **消融实验**: - **终端命令行替代**:移除 GUI harness 后,GPT-5.4 成功率降至 **0%**; - 仅允许命令行交互时,代理虽能生成几何,但输出为脚本驱动的扁平结构,**破坏了原生参数化编辑历史**,无法满足工程可编辑性要求。 —- ### 4. 核心结论与启示 - **通用GUI能力 ≠ 可靠工程自动化**:当前代理在视觉定位与按钮点击上的进步,并未自动转化为对机械CAD中几何意图、约束维护与长程状态依赖的可靠处理能力。 - **工件可编辑性是关键评估维度**:成功的CAD自动化必须保证代理生成的原生文件可被重新打开、测量、修改并延续至下游制造与仿真流程,而非仅生成一次性几何。 - **失败随能力提升而“后移”**:随着代理基础能力的增强,瓶颈从“能否操作界面”转向“能否在持久化工件中正确维护工程语义”,这要求未来的代理在感知、交互与工程推理之间形成闭环。 —- ### 5. 局限与未来方向 论文承认当前工作尚存在边界:任务目标均为明确给定的封闭问题,未涵盖开放式设计需求获取;仅基于 FreeCAD,未覆盖商业CAD套件的内核与UI差异;人类数据为专家效率参考而非群体研究。未来可朝向开放式设计、跨平台泛化、CAM/FEM专用工作流突破、显式特征树感知规划及人机协同交互等方向深化。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Zihan Dong,Yuanzhe Liu,Zhiyuan Ma,Qishi Zhan,Dehan Kong,Guohao Li,Kaixin Li
Categories:
PDF URL: https://arxiv.org/pdf/2609.16251.pdf
Arxiv URL: https://arxiv.org/abs/2609.16251
Arxiv ID: 2609.16251
CoolPaper URL: https://papers.cool/arxiv/2609.16251
Published: 2026-09-22T01:51:43.279Z
Updated: 2026-09-22T01:51:43.279Z
18. When AI Reviews Train AI Reviewers: Scientific-Judgment Collapse and Mitigation
Abstract:Large language models (LLMs) increasingly participate in scientific evaluation, both as automated reviewers and as assistants to human reviewers. As model-generated reviews enter public data and future training corpora, AI peer review can become recursive: later reviewers learn from judgments produced by earlier models. We study one step of this feedback loop in a controlled setting. Starting from Llama 3.1 8B, we first fine-tune a reviewer on official ICLR reviews from 2018—2023 and then train four successor models on ICLR 2024 data with systematically varied mixtures of official and model-generated reviews. Our study shows that introducing synthetic reviews compresses rating distributions and reduces both same-paper and corpus-level semantic diversity. We call this pattern $\textbf{scientific-judgment collapse}$. To mitigate this failure mode, we introduce $\textbf{TrustReviewer}$, an open-source LLM-based system for generating peer reviews of AI and machine learning papers. TrustReviewer intervenes at two complementary stages. For training-time prevention, we train the core reviewer in a single stage on a curated corpus designed to reduce low-quality and semantically degenerate supervision. For test-time correction, paired activation steering aims to further mitigate residual tendencies toward collapsed judgments without further training or additional expert annotation. Together, these results characterize a concrete risk of recursive reviewer training and provide practical interventions for preserving judgment diversity and improving recommendation alignment in AI-assisted scientific evaluation.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决的核心问题是\*\*递归AI评审训练导致的科学判断坍缩(scientific-judgment collapse)\*\*,并为此提出了一套实用的缓解方案。具体可从以下三个层面理解: --- ### 1. 反馈循环风险的识别 随着大语言模型(LLM)越来越多地参与科学同行评审(无论是作为自动化评审员还是人类评审员的助手),模型生成的评审意见会进入公开数据集,并被用于训练下一代模型。这形成了一个递归反馈循环:后续的评审员会学习前辈模型生成的判断。论文指出,这种递归训练可能导致模型遗忘原始分布中的低概率部分,从而在科学评审这一特定条件判断任务上引发独特的失效模式。 --- ### 2. 科学判断坍缩的表征与量化 论文通过受控实验(基于Llama 3.1 8B,在ICLR评审数据上训练)量化了引入合成评审数据后的负面效应,主要表现为: - \*\*评分分布压缩(Rating Compression)\*\*:随着合成评审暴露比例从0%增加到100%,评分分布的标准差和熵单调下降,表明模型倾向于输出更集中、更缺乏区分度的分数。 - \*\*同一论文语义多样性降低\*\*:对同一篇论文独立生成的多篇评审之间的语义差异随合成暴露增加而单调减小,从0%到100%合成暴露降幅约11%。 - \*\*语料库级语义多样性收缩\*\*:整个评审语料库在语义空间中的散布范围随合成暴露增加而收缩,降幅约5%。 这种坍缩的本质是\*\*同质化(homogenization)\*\*——模型表达的科学判断范围变窄,而非系统性地偏向宽容或严格。 --- ### 3. 缓解方案:TrustReviewer 为应对上述坍缩,论文提出了\*\*TrustReviewer\*\*系统,从两个互补阶段进行干预: - \*\*训练时预防(Training-time Prevention)\*\*:通过统一的数据筛选和语料库整理流程(去除 malformed、重复、过短、结构无效的评审),减少低质量和语义退化的监督信号,从源头抑制坍缩趋势。 - \*\*测试时修正(Test-time Correction)\*\*:采用\*\*配对激活引导(Paired Activation Steering)\*\*,利用同一篇论文的官方评审与模型生成评审在隐藏状态上的差异构建引导向量,在推理时注入以进一步缓解残余的坍缩倾向,无需额外训练或专家标注。 --- 综上,该论文不仅\*\*识别并量化了AI评审递归训练条件下科学判断多样性丧失的具体风险\*\*,还提供了\*\*可复现、开源的工程干预手段\*\*,以在AI辅助科学评估中保持判断多样性与推荐对齐性。 Q2: 有哪些相关研究? 论文中涉及的相关研究主要分布在以下三个方向: --- ### 1. 递归训练与合成数据反馈 该方向关注将模型生成样本用于后续模型训练时产生的分布退化现象: - \*\*模型坍缩的早期发现\*\*:Shumailov 等人(2023)提出递归使用生成数据会使模型遗忘原始分布中的低概率部分,导致分布尾部被抹去。Alemohammad 等人(2024)研究了自消费生成模型循环,发现保留新鲜真实数据对于维持质量与多样性至关重要。 - \*\*坍缩的可避免性与条件\*\*:Gerstgrasser 等人(2024)证明,在特定设置下积累真实与合成数据可以避免模型坍缩。Dohmatob 等人(2024)将模型坍缩重新表述为缩放定律的变化。Fu 等人(2025)从理论视角探讨如何在自消费训练循环中防止坍缩。 - \*\*语言模型中的分布偏移\*\*:Zhu 等人(2024)报告,随着合成数据比例上升,语言模型会出现分布偏移与 n -gram 过度集中。Kovač 等人(2025)进一步指出,递归分布偏移的幅度受底层训练数据性质的调节。 与本文的关系:上述工作主要关注通用生成任务的分布退化,而本文将其具体化为\*\*科学评审这一条件判断任务\*\*中的“科学判断坍缩”,并研究合成评审监督对评分分布与语义多样性的影响。 --- ### 2. 大语言模型用于学术同行评审 该方向探讨 LLM 在科学评审各环节中的应用及其效果: - \*\*自动化评审与评分预测\*\*:Zhou 等人(2024)评估了 GPT-3.5 与 GPT-4 在自动评分预测和评审生成任务上的表现,并引入了评审-修订问题。Zhuang 等人(2025)对该领域进行了全面综述。 - \*\*评审数据集构建\*\*:Tan 等人(2024)的 ReviewMT 整理了 ICLR 与 Nature Communications 的论文及评审流程数据;Demetrio 等人(2025)的 Gen-Review 将 ICLR 投稿与官方评审及提示控制的 LLM 评审进行配对。 - \*\*生成评审的质量缺陷\*\*:Li 等人(2025)、Fichtl 等人(2026)以及 Li 等人(2026)的实证研究发现,LLM 生成的评审虽流畅且具描述性,但往往过于泛泛、过度正面、难以识别实质性弱点,或论证依据不均衡。 - \*\*LLM 对评审流程的实际渗透\*\*:Liang 等人(2024)估计了多个 AI 会议评审语料中大量 LLM 修改的比率(但非逐条标注)。Thakkar 等人(2025)在 ICLR 2025 开展了随机对照研究,发现受控的 LLM 反馈可提高评审的针对性与可操作性。 与本文的关系:现有研究聚焦于 LLM 作为评审助手或独立评审员的\*\*生成质量\*\*,而本文关注一个更深层的反馈问题:\*\*当这些生成的评审被用作下一代模型的训练监督时,会如何改变后续模型的科学判断空间\*\*。 --- ### 3. 数据质量与测试时干预 该方向提供了缓解分布退化的两类技术手段——数据策展与表示工程: - \*\*指令微调数据策展\*\*:Zhou 等人(2023)的 LIMA 工作强调“少即是多”,即对齐数据的质量与多样性至关重要。Liu 等人(2024)对指令微调中的自动数据选择进行了系统研究。在合成数据领域,Alemohammad 等人(2024)与 Zhu 等人(2024)同样强调保留可靠且多样的真实数据支撑。 - \*\*激活引导与表示工程\*\*:Li 等人(2023)提出的推理时干预(Inference-Time Intervention, ITI)可通过内部表示修改引发更真实的回答。Arditi 等人(2024)发现语言模型的拒绝行为由单一方向介导。Zou 等人(2023)提出了表示工程(Representation Engineering)框架,用于自顶向下识别群体级激活方向以实现监控与控制。Turner 等人(2023)的 Activation Addition 利用对比提示获取引导方向并在推理时注入;Rimsky 等人(2024)的对比激活加法(Contrastive Activation Addition, CAA)则跨正负行为示例平均激活差异。Kang 与 Kim(2026)进一步通过动态拒绝机制增强激活引导下的指令遵循能力。 与本文的关系:TrustReviewer 将这些思想适配到评审场景——在\*\*训练时\*\*通过统一筛选与语料库整理减少低质量监督,在\*\*测试时\*\*通过\*\*配对激活引导\*\*(对比同一篇论文的官方评审与模型生成评审的隐藏状态)缓解残余坍缩,无需额外训练或专家标注。 Q3: 论文如何解决这个问题? 论文通过提出 \*\*TrustReviewer\*\* 系统来解决科学判断坍缩问题。该系统从\*\*训练时预防\*\*与\*\*测试时修正\*\*两个互补阶段进行干预,旨在减少低质量监督的退化效应,并在不重新训练或不依赖额外专家标注的情况下恢复判断多样性。 --- ### 1. 训练时预防:语料库整理(Corpus Curation) 第一阶段的目标是从源头减少导致语义坍缩的低质量与重复性监督信号。 - \*\*数据来源与范围\*\*:收集 ICLR 2018–2025 年的官方评审数据(论文中称为 D_(raw) ),涵盖约 112,743 个论文–评审对,总计约 19 亿 token。 - \*\*统一筛选流程\*\*:对全部数据应用严格的两阶段过滤,去除以下样本: - 包含后续回复标记(如 “follow-up comment”)的评审; - 长度不足 600 字符或过短的内容; - 存在严重重复(如 8 行以上重复或 4 个以上重复 30-gram)的退化文本; - 结构无效或无法解析评分的评审; - 格式化后超过 64,000 token 的超长样本。 - \*\*单阶段训练策略\*\*:将筛选后的语料记为 D_(curated) = C(D_(raw)) 。核心评审模型 M_(TR) 直接在整理后的全量语料上进行\*\*单阶段\*\*监督微调,不再引入中间合成评审模型,从而避免递归训练中合成数据对下一轮的污染。 --- ### 2. 测试时修正:配对激活引导(Paired Activation Steering) 第二阶段在推理时对残余的坍缩倾向进行表示层面的干预,无需修改模型参数。 - \*\*引导向量构建\*\*:从整理后的语料中采样 K=5,000 个论文–评审对,对每篇论文分别获取官方评审 r_i^(off) 和模型生成评审 r_i^(TR) 。计算第 ell 层最后一 token 的隐藏状态差异并取平均:
v(steer)^((ell)) = (1) / (K) ∑(i=1)^(K) [ φ(ell)(r_i^(off)) - φ(ell)(ri^(TR)) ]
其中 φ(ell)(r) 表示评审文本 r 在第 ell 层最终非填充 token 的隐藏状态。 - **生成时注入**:在选定的层(实验确定为最终解码层)向残差流添加引导向量。对于前向传播中的最后一个位置 t :
h(ell,t) = h(ell,t) + α , v_(steer)^((ell))
论文通过验证集搜索确定干预强度 α = 0.15 。该干预仅在预填充阶段的最终提示 token 以及后续每个解码步骤的当前 token 上执行。 - **核心优势**:此方法将官方评审(作为机构参考标准)与模型生成评审的表示差异编码为方向向量,在推理时“推开”坍缩倾向,且**不需要额外训练或人工标注**。 —- ### 3. 整体流程与实验效果 TrustReviewer 的完整流程可概括为:
D(raw) C D(curated) one-stage SFT M(TR) test-time steering M(TR)^(steered)
在 held-out 测试集上的验证表明: - **推荐对齐性**:TrustReviewer 的精确匹配率达到 **75.40%**,平均绝对距离(MAD)降至 **1.079**,均优于 Llama 3.1 8B、Qwen3.6-35B-A3B 和 OpenReviewer 等基线。 - **判断多样性**:评分熵达到 **2.18**,显著高于基线模型(如 Llama 的 1.53 和 Qwen 的 1.94),更接近官方评审参考值 2.38;同时,语料库级语义散布与同论文语义距离也均优于对比基线,证明测试时引导有效拓宽了聚合判断空间。 综上,论文通过**高质量语料整理**减少退化监督,再通过**配对激活引导**在推理时修正残余坍缩,双管齐下缓解了递归 AI 评审训练中的科学判断坍缩。 Q4: 论文做了哪些实验? 论文围绕递归 AI 评审训练的风险识别与缓解开展了两大系列实验:**受控递归训练分析**与**TrustReviewer 系统评估**。具体如下: —- ### 一、受控递归 AI 评审训练实验 该系列实验旨在隔离并量化合成评审监督对后续评审模型的影响。 #### 1. 实验框架设计 - **两阶段训练设置**: - **第一阶段**:以 Llama 3.1 8B 为基模型 M0 ,在 ICLR 2018–2023 官方评审数据上微调,得到初始评审模型 M_1 = T(M_0, D^(off)(2018:2023)) 。 - **第二阶段**:利用 M1 生成 ICLR 2024 的合成评审,与官方评审按不同比例混合,训练后继模型 M^p_2 = T(M_1, D^p(2024)(M_1)) 。 - **控制变量**:合成评审暴露比例 p ∈ 0%, 33%, 66%, 100% 。每篇投稿固定 3 条评审,分别对应 0、1、2、3 条合成评审,其余为官方评审。 - **控制条件**:所有 M^p_2 变体共享相同的初始化( M_1 )、过滤流程、上下文长度(64k tokens)、LoRA 配置(rank 64, scaling 128, dropout 0.05)及优化设置,唯一差异为训练混合比例 p 。 #### 2. 数据与训练配置 - **数据过滤**:统一去除畸形评审、后续回复、过短(<600 字符)、高度重复(8 行重复或 4 个重复 30-gram)及超长( ≥ 64k tokens)样本。 - **学习率**:第一阶段 2 × 10^(-5) ,第二阶段 2 × 10^(-6) ,余弦衰减。 - **评估集**:保留 2,000 篇跨年度(2018–2025)held-out 论文,所有模型在该固定集上生成评审以进行后续分析。 #### 3. 科学判断坍缩的观测实验 **3.1 评分分布压缩实验** - **目的**:检验合成暴露是否导致评分分布产生系统性偏移或多样性压缩。 - **指标**:评分均值(反映宽容/严格倾向)、标准差(反映离散程度)、熵(反映评分尺度使用广度)。 - **结果**:随着合成暴露增加,标准差与熵单调下降。例如,在 M^p_2 中,标准差从 p=0% 的 1.63 降至 p=100% 的约 1.45;熵从 2.31 降至约 2.15。均值呈现非单调变化( 0% to 33% 上升,之后回落),表明坍缩本质是**同质化**而非单向偏移。 **3.2 同论文语义多样性实验** - **目的**:测量对同一篇论文独立生成的多篇评审是否随合成暴露增加而变得雷同。 - **指标**:同论文语义差异,定义为评审嵌入的平均成对余弦距离:
D(paper) = (2) / (n(n-1)) ∑(i<j) ( 1 - cos(ei, e_j) )
其中 e_1, dots, e_n 为同一论文各评审的语义嵌入。 - **结果**: D(paper) 随合成暴露单调递减,从 p=0% 的约 0.159 降至 p=100% 的约 0.142,降幅约 **11%**。 **3.3 语料库级语义多样性实验** - **目的**:评估合成暴露是否导致整个评审语料库在语义空间收缩。 - **指标**:语料库质心散布,定义为:
Spread = (1) / (N) ∑(i=1)^(N) | e_i - e |_2^2
其中 e = (1) / (N)∑(i=1)^(N) ei 为语料库质心。 - **结果**:散布值随合成暴露单调递减,从 p=0% 的约 0.609 降至 p=100% 的约 0.579,降幅约 **5%**。 —- ### 二、TrustReviewer 评估实验 该系列实验验证所提出缓解方案在推荐对齐性与判断多样性上的效果。 #### 1. 评估设置 - **参评模型**: - TrustReviewer(完整系统,含测试时引导) - TrustReviewer w/o Steering(仅训练时整理,无引导) - 基线:Meta-Llama-3.1-8B-Instruct、OpenReviewer、Qwen3.6-35B-A3B - **生成配置**:temperature 0.6,nucleus sampling top\_p 0.95,最大 4,096 新 token,每篇论文执行 3 次独立生成运行。 - **指标**: - **推荐对齐**:精确匹配率(Exact Match,生成评分是否与任一官方评分一致)、平均绝对距离(MAD,与官方平均分的偏差)。 - **评分多样性**:评分分布熵(Entropy)。 - **语义多样性**:语料库级语义散布(Corpus Semantic Spread)、同论文语义距离(Same-Paper Semantic Difference)。 #### 2. 超参数选择实验(引导向量) - **目的**:确定配对激活引导的最优层与强度。 - **方法**:从整理语料中预留 100 个验证对(独立于 5,000 个校准对与 held-out 评估集),以精确匹配率为准则进行搜索。 - **搜索范围**:层集合 L 包括全部解码层、多个后期层区间及最终层;强度 α ∈ 0.05, 0.10, 0.15, 0.20, 0.25, 0.30, 0.40, 0.50 。 - **结果**:选定最终解码层 L^ = 31 ,强度 α^ = 0.15 。 #### 3. 主实验结果 - **推荐对齐性**:TrustReviewer 达到 **75.40%** 的精确匹配率,MAD 为 **1.079**,均优于所有对比基线(OpenReviewer 73.10%/1.113,Qwen3.6-35B-A3B 61.85%/1.335,Llama 33.93%/2.679)。 - **判断多样性**:TrustReviewer 评分熵为 **2.18**,显著高于通用基线(Llama 1.53,Qwen 1.94),接近官方参考值 2.38;语料库级语义散布与同论文语义距离亦优于基线。 - **测试时引导的增量效果**:相对于无引导版本,激活引导将精确匹配率从 73.85% 提升至 **75.40%**,熵从 2.13 提升至 **2.18**,并扩大了语料库级语义散布,MAD 基本维持不变。这表明引导在无需重训练或额外标注的情况下,可进一步缓解残余坍缩。 Q5: 有什么可以进一步探索的点? 基于论文的实验设计与讨论,以下方向可作为后续深入研究的重点: —- ### 1. 多代递归坍缩的动态演化 论文当前仅检验了**单步**递归训练(即第一代合成评审训练第二代模型)。后续研究可系统扩展至多代际( M_1 to M_2 to M_3 to dots ),以验证科学判断坍缩是否随代数增加而**非线性加剧**、是否存在收敛阈值,或是否能在特定数据混合策略下达到稳态。这对理解长期部署的 AI 评审系统的极限行为至关重要。 —- ### 2. 跨模型架构、规模与科学领域的泛化性 现有实验基于 Llama 3.1 8B 单一模型族,且限定于 ICLR 的机器学习领域评审。未来可在以下维度进行验证: - **模型规模与架构**:更大参数量的稠密模型或 MoE 架构对合成监督的鲁棒性是否更强; - **科学领域**:计算机视觉、自然语言处理、医学或物理学等不同学科的评价标准差异是否影响坍缩模式; - **评审格式**:双盲评审、开放式评审、期刊长文评审等不同格式下,语义坍缩的表现形式是否一致。 —- ### 3. 嵌入代理指标与人类评估的对齐 论文使用的语义嵌入距离(corpus spread、same-paper distance)是**实质性多样性的代理指标**。后续工作需引入大规模人类专家评估,以检验: - 嵌入空间中相距较远的评审是否确实对应于不同的、有效的科学关切; - 嵌入空间集中的评审是否确实遗漏了关键缺陷或论证维度; - 建立从表示空间度量到人类感知“评审质量/特异性/建设性”的映射关系。 —- ### 4. 动态在线学习与持续训练场景 当前实验采用受控的离线批量训练。实际部署中,评审模型可能面临**持续学习或增量更新**(如每年吸收新会议的官方评审)。未来可探索: - 在数据流中如何动态调整真实数据与合成数据的混合比例,以抑制坍缩; - 遗忘旧分布与适应新分布之间的权衡(catastrophic forgetting in reviewer models); - 开发实时监控指标,用于在训练过程中检测判断分布的异常集中。 —- ### 5. 训练时干预策略的精细化 TrustReviewer 的语料库整理采用基于规则与启发式的统一过滤。后续可研究: - **数据权重重估**:为高质量、高多样性的人类评审分配更高训练权重,而非简单剔除低质量样本; - **对比学习或偏好优化**:使用官方评审与模型生成评审构建偏好对,通过 DPO 或类似方法直接优化模型以偏好更分散、更贴近官方分布的判断; - **领域自适应整理**:针对不同会议或年份的评审规范差异,设计自适应的数据筛选阈值。 —- ### 6. 测试时修正机制的扩展与解释 配对激活引导目前仅使用单一官方–合成对比方向。可进一步探索: - **多向量分解**:将坍缩倾向分解为多个可解释的子方向(如“泛泛而谈”、“过度正面”、“模板化结构”),并分别进行正交干预; - **自适应强度**:根据输入论文的复杂度或领域,动态调整引导强度 α ,而非全局固定值; - **多层联合引导**:当前仅干预最终层,探索跨层协同引导对保持深层语义多样性的效果。 —- ### 7. AI 辅助评审的检测与审计工具 论文指出当前官方评审中可能已存在未被观测到的 AI 辅助。未来可开发: - 针对评审语料库的**坍缩检测器**,用于在部署前评估训练数据是否已出现判断同质化; - 面向会议组织者的**评审来源审计工具**,在不侵犯隐私的前提下估计语料中合成评审的占比及其对后续模型的潜在影响; - **因果推断框架**,在真实会议数据中识别 AI 辅助对评审分布的因果效应,而不仅仅是相关性估计。 Q6: 总结一下论文的主要内容 这篇论文研究了**递归 AI 评审训练**对科学判断多样性的影响,识别出**科学判断坍缩(scientific-judgment collapse)**现象,并提出了相应的缓解方案。 —- ### 1. 研究背景与问题 大语言模型(LLM)越来越多地参与科学同行评审,生成的评审意见可能进入公开数据集,成为后续模型的训练语料。这形成了一个递归反馈循环:后续评审模型学习前辈模型生成的判断。虽然递归训练中的“模型坍缩”已在通用生成任务中被研究,但其在**条件科学判断任务**中的具体表现尚不明确。论文的核心问题是:引入合成评审作为监督,是否会压缩后续模型表达的科学判断空间? —- ### 2. 科学判断坍缩的实验验证 论文构建了一个受控实验框架以隔离合成评审的影响: - **两阶段训练**:以 Llama 3.1 8B 为基座,先利用 ICLR 2018–2023 的官方评审训练初始模型 M_1 ;再利用 M_1 生成 ICLR 2024 的合成评审,与官方评审按 p ∈ 0%, 33%, 66%, 100% 的比例混合,训练后继模型 M_2^p 。 - **核心发现**:随着合成评审暴露比例增加,模型表现出系统性的判断坍缩: - **评分分布压缩**:评分标准差与熵单调下降,表明模型倾向于输出更集中、缺乏区分度的分数,而非系统性地更宽容或更严格。 - **同论文语义同质化**:对同一篇论文独立生成的多篇评审之间的语义距离随合成暴露增加而单调下降( 0% to 100% 降幅约 11%)。 - **语料库级语义收缩**:整个评审语料库在语义空间中的散布范围单调减小(降幅约 5%)。 —- ### 3. 缓解方案:TrustReviewer 为应对科学判断坍缩,论文提出了 **TrustReviewer**,从训练与推理两个阶段进行互补干预: - **训练时预防(Corpus Curation)**:对 ICLR 2018–2025 的全部官方评审执行统一、严格的过滤与整理,去除畸形、重复、过短及结构无效的样本,得到高质量语料 D(curated) ;并采用**单阶段**监督微调训练核心评审模型,避免引入递归合成的中间环节。 - **测试时修正(Paired Activation Steering)**:利用同一篇论文的官方评审与模型生成评审的隐藏状态差异,构建层特定的引导向量:
v(steer)^((ell)) = (1) / (K) ∑(i=1)^(K) [ φ(ell)(r_i^(off)) - φ(ell)(r_i^(TR)) ]
在生成时将该向量注入残差流,无需额外训练或专家标注即可进一步缓解残余坍缩倾向。 —- ### 4. 实验效果 在 held-out 评估集上,TrustReviewer 的表现包括: - **推荐对齐性**:精确匹配率达 **75.40%**,平均绝对距离(MAD)为 **1.079**,均优于 Llama 3.1 8B、Qwen3.6-35B-A3B 和 OpenReviewer 等基线。 - **判断多样性**:评分熵达到 **2.18**,显著高于各基线,更接近官方评审参考分布(2.38);语料库级与同论文语义多样性指标亦优于对比模型。 - **引导机制的有效性**:测试时引导在无需重训练的情况下,将精确匹配率提升 1.55 个百分点,并将评分熵从 2.13 提升至 2.18,同时扩大了语义散布。 —- ### 5. 主要贡献 - **风险表征**:首次在受控条件下量化了递归 AI 评审训练导致的科学判断坍缩,揭示了合成监督对评分分布与语义多样性的压缩效应。 - **开源系统**:发布了 TrustReviewer(含整理后的训练语料、代码与模型),提供训练时数据整理与测试时激活引导的双重干预机制,以在 AI 辅助科学评估中保持判断多样性与推荐对齐性。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Sy-Tuyen Ho,Minghui Liu,Furong Huang
Categories:
PDF URL: https://arxiv.org/pdf/2609.20942.pdf
Arxiv URL: https://arxiv.org/abs/2609.20942
Arxiv ID: 2609.20942
CoolPaper URL: https://papers.cool/arxiv/2609.20942
Published: 2026-09-22T01:51:43.440Z
Updated: 2026-09-22T01:51:43.440Z
19. FRAUDSkill: Structured Frozen-Weight Skill Optimization for Audio Anti-Fraud Detection
Abstract:Large audio-language models have shown promise for anti-fraud detection by directly processing speech and reasoning over fraud-related evidence. Their deployment, however, requires predictions to follow a predefined label space and a structured decision protocol consisting of service-scenario identification, fraud detection, and conditional fraud-type classification. Existing fine-tuning and prompt-based approaches typically encode task knowledge, constraints, and decision rules into model parameters or manually maintained prompts, making them difficult to adapt as fraud patterns and labeling policies evolve. To this end, we propose FRAUDSkill, a structured frozen-weight adaptation framework that leaves the underlying audio-language model unchanged while optimizing an external layer of skill programs, route-specific policies, and decision rules. We further combine structured output control with validation-guided multi-path inference to ensure protocol-compliant predictions. On the TeleAntiFraud benchmark, FRAUDSkill achieves 73.50% Macro-F1, outperforming the shared frozen-model baseline by 31.96% while reducing invalid outputs to 1.94%. Extensive experiments demonstrate that external skill optimization provides an effective and adaptable solution for structured audio anti-fraud detection without modifying the underlying model. The source code is available at this https URL.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
LLM Analysis Failed: Error: Kimi内容未就绪或抓取失败: 2609.18766 (timeout of 15000ms exceeded)
Authors: Chengxian Hu,Zhiming Ma,Mingjun Pan,Yifan Wang,Shun Zhang,Qifan Wang,Zhilei Zhao,Yijin Zhou,Yuxi Zhao,Huiyuan Liu,Peidong Wang,Peng Chen
Categories:
PDF URL: https://arxiv.org/pdf/2609.18766.pdf
Arxiv URL: https://arxiv.org/abs/2609.18766
Arxiv ID: 2609.18766
CoolPaper URL: https://papers.cool/arxiv/2609.18766
Published: 2026-09-22T01:51:43.494Z
Updated: 2026-09-22T01:51:43.494Z
20. TeleAntiFraud 2.0: A Refreshable, Profile-Grounded, and Audio-Based Benchmark for Telecom Fraud Detection
Abstract:Telecom fraud scripts evolve rapidly and are often designed to resemble routine service conversations, creating two key requirements for audio-based telecom-fraud evaluation. First, benchmarks must incorporate newly observed scam patterns without overwriting previously established test sets. Second, they must distinguish fraud from lawful, near-domain calls rather than relying on topic-separated negative examples. We present TeleAntiFraud 2.0, constructed with our Mixed-Tree Anti-Fraud Generation Pipeline and evaluated under a monthly frozen evaluation protocol. The pipeline transforms online fraud-case abstracts into profile-grounded scenarios, expands them through mixed-tree generation, realizes fraud and non-fraud dialogue paths under shared contexts, renders validated dialogues as role-matched speech, and freezes the resulting audio, labels, prompts, manifests, and provenance records for each monthly evaluation set. Each frozen set contains 900 Chinese calls, comprising 600 fraud and 300 near-domain non-fraud cases. Controlled text experiments show that three classifiers achieve perfect macro-averaged F1 (Macro-F1) when evaluated against unrelated or ordinary negatives, but drop to 0.65-0.68 with near-domain sibling negatives. Full-set audio and automatic-speech-recognition plus large-language-model (ASR+LLM) evaluations further reveal class-prior shortcuts, prediction collapse, and snapshot sensitivity. Together, these findings establish near-domain construction and collapse-aware reporting as core requirements for evaluating audio-based telecom-fraud models under realistic confusable conditions. The accompanying research artifact includes the construction code, evaluation scripts, manifests, and documentation. Our dataset and code are available at this https URL.
中文摘要
翻译失败: Translation limit exceeded. Please try it again later.
Response status: 401 (Unauthorized)
Response body : “{\”ShowCaptcha\”:false}”
LLM Analysis
Q: 这篇论文试图解决什么问题? 这篇论文试图解决\*\*基于音频的电信诈骗检测基准测试在应对诈骗模式持续演变以及近域混淆场景评估不足\*\*的核心问题。具体而言,论文识别出现有基准存在的两个关键缺陷,并针对它们提出系统性解决方案: \*\*1. 基准测试的可更新性与历史可比性冲突\*\* 电信诈骗脚本、冒充机构与说服策略快速演变,固定测试集在发布后无法吸纳新观察到的诈骗模式。然而,若持续替换或覆盖旧测试样本,又会导致历史评估结果无法复现、难以进行纵向比较。因此,领域需要一个既能\*\*持续纳入新出现的诈骗案例\*\*,又能\*\*保留并冻结过往测试集\*\*的评估协议。 \*\*2. 缺乏现实的近域合法负例(near-domain negatives)\*\* 现有基准的非欺诈样本往往来自不相关主题或数据源,导致模型容易依赖词汇分布、话题差异或来源特定的表面捷径(shortcut learning)进行区分,而非真正理解对话中的欺诈性行为。在现实场景中,诈骗电话常被精心设计成与合法的客服、风控通知或身份核验通话高度相似。若基准无法在\*\*共享上下文\*\*下构造与欺诈样本高度混淆的合法兄弟路径(sibling negatives),则会严重高估模型的真实检测能力。 为应对上述问题,论文提出 \*\*TeleAntiFraud 2.0\*\*,其核心设计包括: - \*\*月度冻结快照(monthly frozen snapshots)\*\*:通过版本化发布机制,在不覆盖历史测试集的前提下持续吸收新诈骗模式; - \*\*Mixed-Tree 反欺诈生成管道\*\*:将诈骗案例摘要转化为结构化画像,在共享场景上下文与开头对话中扩展出欺诈与合法兄弟路径,使标签仅取决于后续产生区分性的行为动作; - \*\*崩溃感知评估(collapse-aware reporting)\*\*:通过全集音频与 ASR+LLM 实验,揭示模型在接近真实混淆条件下的假阳性偏差、类别先验捷径与预测崩溃现象,推动社区采用类别平衡指标与输出分布分析。 Q2: 有哪些相关研究? 论文在 Related Work 中围绕三个方向梳理了相关研究: ### 1. 反欺诈数据集与基准 - \*\*经典统计与机器学习方法\*\*:Bolton and Hand (2002)、Kou et al. (2004)、Abdallah, Maarof, and Zainal (2016) 等通过统计建模、数据挖掘和领域专用机器学习开展欺诈检测研究,奠定了早期的方法论基础。 - \*\*跨领域欺诈数据集基准(FDB)\*\*:Grover et al. (2022) 聚合多领域公共欺诈数据集并提供统一评估接口,重点揭示了类别不平衡、特征异构、时序模式与对抗行为等挑战。 - \*\*多轮 LLM 欺诈诱导基准(Fraud-R1)\*\*:Yang et al. (2025) 将评估拓展至多轮交互场景,测试模型对增强式欺诈与钓鱼诱导的鲁棒性,涵盖角色扮演设定。 - \*\*音频-文本电信诈骗基准(TeleAntiFraud-28k)\*\*:Ma et al. (2025) 提出了用于慢思考电信诈骗分析的音频-文本基准。论文指出,上述基准或未能直接建模真实的语音通话交互,或缺乏吸纳新诈骗模式的机制,也未提供足够的近域合法负例。 ### 2. 动态与可审计评估 - \*\*数据伪影与捷径学习\*\*:Gururangan et al. (2018) 与 Geirhos et al. (2020) 的研究表明,评估结果的解释必须考虑数据收集过程及模型捷径学习问题。 - \*\*动态基准(Dynabench)\*\*:Kiela et al. (2021) 采用人与模型在循环的收集方式,在多轮迭代中持续暴露模型弱点。 - \*\*数据集文档规范(Datasheets)\*\*:Gebru et al. (2021) 强调数据来源、预期用途、收集选择与分布约束等元数据对可审计性的重要价值。 - \*\*对比集评估(Contrast Sets)\*\*:Gardner et al. (2020 Q3: 论文如何解决这个问题? 论文通过\*\*混合树反欺诈生成管道(Mixed-Tree Anti-Fraud Generation Pipeline)\*\*与\*\*月度冻结快照(monthly frozen snapshots)\*\*相结合的架构,系统性地解决了基准测试需持续刷新与近域合法负例缺失的双重挑战。具体解决方案可分为以下四个层面: --- ### 1. 混合树反欺诈生成管道 该管道将在线诈骗案例摘要转化为可追溯的通话音频,包含四个递进阶段: \*\*(1)场景画像(Scenario Profiling)\*\* 将非结构化的诈骗案例摘要转化为结构化画像 p ,明确接收者背景、呼叫方声称身份、说服策略、分阶段交互目标、风险相关实体以及可能升级、允许验证或终止的风险节点。画像区分了在同一通话族(call family)内\*\*共享的上下文\*\*(参与者、场景设定、早期语境)与后续阶段可变的分支动作、措辞和表达风格。 \*\*(2)混合树扩展(Mixed-Tree Expansion)\*\* 给定场景种子 x 及其画像 p ,构建混合树 T_x = (V, E, r, φ, σ, τ) ,其中: - V 为节点集, E 为边集, r 为共享根节点; - 节点属性映射 φ(v) = (p, h_v, o_v, d_v) 记录画像、交互历史、扩展标志与深度; - 状态映射 σ(v) ∈ A, F, N 分别表示\*\*模糊、欺诈、非欺诈\*\*状态; - 状态转移函数 τ 在遍历动作标记的边时更新节点状态。 对于每个待扩展的开放节点 v ,分支扩展函数 B 至多生成 b 个高层情节动作:
Av = B(p, h_v, σ(v)), quad |A_v| le b
每个动作 a ∈ A_v 创建候选子节点 u_a ,更新历史 h(ua) = h_v oplus a 与深度 d(ua) = d_v + 1 ,并通过验证器 rho 检验结构有效性与画像一致性。最终,仅当终端叶节点 ell 的轨迹包含充分的欺诈或非欺诈证据时,才赋予标签 c ∈ F, N ,形成叶节点集合 L_x^c 。 该机制确保欺诈与合法兄弟路径共享同一画像、共享开头语境 h_0 与早期风险语言,仅在产生标签证据的动作处发生分岔,从而**抑制话题级捷径**。 **(3)协作对话实现(Collaborative Dialogue Realization)** 为避免无约束生成导致角色责任模糊或偏离标签动作,论文将结构控制与角色条件语言生成分离,定义六智能体集合:
G = R ∪ F, quad R = R_c, R_r, quad F = B, Gamma, E_c, E_r
其中 R_c 与 R_r 分别实现呼叫方与接收方话语;功能智能体 B 与 Gamma 分别实现分支扩展与终止控制; E_c 与 E_r 分配角色特定的表达状态(如紧迫、困惑、中性)。 在每一轮 t 中,终止智能体先判定交互是否继续;若继续, B 生成候选动作集 A_t ,选定动作 a_t 后,由角色智能体生成话语 u_t = R(st)(p, h_t, σ_t, a_t) ,并由表达智能体赋予交付状态 e_t = E(st)(u_t, h_t) 。随后更新历史:
h(t+1) = ht oplus (s_t, a_t, u_t, e_t), quad σ(t+1) = τ(σ_t, a_t)
这一设计将表面措辞与决定标签的情节动作解耦,保证每一轮表面话语均可追溯至其生成的情节决策。 **(4)语音渲染与质量控制** 每条经验证的对话轨迹通过文本转语音合成转换为自然通话音频。呼叫方与接收方使用不同的角色兼容声线,并由存储的交付状态指导说话风格。轻量级信号检查在快照组装前剔除损坏输出,确保音频与对话文本、标签及清单一致。 —- ### 2. 可刷新且不可变的基准架构:TeleAntiFraud 2.0 为解决“持续吸纳新诈骗模式”与“历史结果可复现”之间的张力,论文将基准组织为**版本化月度冻结快照**: - **刷新性(Refreshability)**:新收集的诈骗案例摘要可通过同一管道处理,并纳入后续月度发布,无需修改早期快照的 artifact。 - **不可变性(Immutability)**:每个已发布的月度快照在冻结后不得增删或重新生成样本,其音频、标签、推理依据、生成元数据、评估提示、模型响应、解析预测及溯源记录全部固定。 - **清单合约(Manifest Contract)**:每个冻结清单将通话路径绑定至其音频、对话文本、标签与依据、交付标签、生成与说话人元数据、评估提示、模型设置、原始响应、解析预测、评估时间戳与溯源记录。研究 artifact 包含这些清单、对应音频及评估脚本;生成器单独维护,使未来快照可在不改动早期版本的前提下实例化新诈骗模式。 当前基准包含两个独立构建的快照(June/V1 与 July/V2),各含 900 通中文通话(600 通欺诈,300 通近域非欺诈),支持跨快照的敏感度分析。 —- ### 3. 近域混淆样本的显式构造 现有基准的非欺诈样本往往来自无关话题,导致模型依赖词汇或数据源捷径。论文通过混合树的**兄弟路径(sibling paths)**机制显式构造近域负例: - **共享上下文**:欺诈与合法路径共享同一参与者、场景设定、开头轮次及早期风险语言; - **动作级分岔**:路径仅在出现标签承载动作(如请求凭证、允许官方核验、拒绝请求或结束通话)后才产生分歧; - **轨迹级标签**:最终标签取决于完整交互轨迹,而非孤立关键词或话题线索。 这种设计使得非欺诈路径成为欺诈路径的**近域合法对应物(near-domain lawful counterparts)**,迫使模型必须依据对话中实际发生的行为动作进行区分,而非利用话题分布差异。 —- ### 4. 崩溃感知评估与报告协议 论文进一步提出**崩溃感知(collapse-aware)**分析协议,以揭示模型在真实混淆条件下的边界识别失败: - **多指标联合报告**:除欺诈类别 F1 外,同步报告 Macro-F1、Balanced Accuracy、欺诈召回率、非欺诈召回率及预测欺诈比例,避免单一指标受类别先验主导而产生误导。 - **预测分布分析**:检查模型是否存在预测崩溃(prediction collapse),例如全部预测为 FRAUD 时欺诈召回率趋近 1.0、准确率趋近 2:1 的先验、欺诈 F1 趋近 0.80,但 Balanced Accuracy 仅 0.50 且非欺诈召回率为零。 - **类别先验控制**:通过在 1:2、1:1、2:1 等不同欺诈/非欺诈比例下重采样,分离边界识别失败与多数类预测行为。 综上,论文通过**混合树生成**构造不可 shortcut 的近域样本,通过**月度冻结快照**实现基准的可控演进,并通过**崩溃感知协议**确保评估结果在高度混淆场景下仍具诊断价值。 Q4: 论文做了哪些实验? 论文的实验部分围绕**混合树构造的有效性验证**、**近域样本的混淆难度**、**冻结快照的模型崩溃诊断**以及**类别先验对指标解释的影响**四个维度展开,具体如下: —- ### 1. 混合树兄弟路径的捷径抑制实验(Controlled Text Experiments) 为验证混合树扩展是否有效抑制了话题级捷径,论文在构造层面开展了消融研究: - **实验设置**:在不相交的训练集(`pro_train+pro_val`)上训练三个文本分类器(Bigram Logistic Regression、SVM、RoBERTa),并在测试集(`pro_test`)的五个随机种子平衡重采样上评估。欺诈样本固定,负例按难度递进分为三类: - **无关随机负例**(unrelated random); - **普通域内负例**(ordinary in-domain); - **近域兄弟负例**(near-domain sibling,即共享上下文与早期交互的混合树兄弟路径)。 - **观测指标**:平均词法重叠度(Bigram overlap)与 Macro-F1(含 95% 置信区间)。 - **核心结果**(表 4): - 在无关与普通负例上,三类分类器均达到完美分离, Macro-F1 = 1.000 ; - 在近域兄弟负例上,性能显著下降至 0.650 – 0.680 ,且词法重叠度从 0.005 升至 0.274 。 该实验证实,随着负例与欺诈样本在共享上下文下的逼近,传统分类器无法继续依赖话题或词汇分布捷径,必须转向对动作级证据的推理。 —- ### 2. 跨基准线性可分性对比实验(Linear Separability Analysis) 为衡量近域样本在统一分析框架下的相对难度,论文使用相同的 TF-IDF+SVM 文本分类器对比了 TeleAntiFraud 2.0 与 TeleAntiFraud-28k: - **实验设置**:所有行均采用 TF-IDF+SVM,对比三种输入设置: - `TAF-28k-ASR`:TeleAntiFraud-28k 的 ASR 转录; - `TAF 2.0 dialogue`:TeleAntiFraud 2.0 的对话文本; - `TAF 2.0 ASR-test`:TeleAntiFraud 2.0 经 ASR 转录后的文本。 - **观测指标**:Macro-F1、Balanced Accuracy、欺诈召回率(Fraud R)、非欺诈召回率(Non-F R)、预测欺诈比例(Pred. F)。 - **核心结果**(表 5): - `TAF-28k-ASR` 近乎饱和, Macro-F1 = 0.9950 ; - `TAF 2.0 dialogue` 降至 0.9286 ; - `TAF 2.0 ASR-test` 进一步降至 0.7998 ,且非欺诈召回率下降至 0.5800 ,预测欺诈比例升至 0.7878 。 结果表明,TeleAntiFraud 2.0 的近域构造确实降低了线性可分性,尤其在引入 ASR 噪声后更显著。 —- ### 3. 冻结快照全集评估(Full-Set Audio and ASR+LLM Evaluation) 为诊断真实音频基准上的模型行为,论文对两个冻结快照(June/V1 与 July/V2,各 900 样本,欺诈与非欺诈比例 2:1)进行了全集运行: - **实验设置**: - **直接音频输入(Direct-audio)**:模型接收原始波形; - **ASR+LLM 输入**:所有音频先通过 Whisper-medium 统一转录,同一转录文本用于所有 LLM,以控制音频到文本的变异。 - 零样本任务定义,要求输出 `FRAUD` 或 `NONFRAUD` 标签;中英文提示分别运行后按样本加权平均。 - **参评模型**:涵盖 Gemini-Pro、MiMo-V2.5/V2、Qwen3.5-Omni+/Qwen3-Omni、Seed-2.0-lite、StepFun-1o、Claude-Opus4/Sonnet4、DeepSeek-V3、GLM-5.2、GPT-4o、MiniMax-M2.7、Qwen2.5-72B、Qwen3.7-Max 等多个模型家族。 - **核心结果**(表 6): - 大量配置出现**预测崩溃(prediction collapse)**:在 V1 的 27 个配置中 11 个、V2 的 27 个去重配置中 15 个表现出 all-FRAUD 特征,即欺诈召回率 to 1.0 、准确率 to 2/3 (与类别先验一致)、欺诈 F1 to 0.80 。 - 直接音频与 ASR+LLM 家族均暴露出此现象,说明模型能识别风险词汇或可疑框架,但无法依据后续动作区分完成诈骗轨迹与合法兄弟路径。 —- ### 4. 类别先验与指标解释实验(Class-Prior Resampling) 为分离“边界识别失败”与“多数类预测捷径”,论文在严格留出池上进行重采样分析: - **实验设置**:固定样本池,通过五个种子在三种欺诈/非欺诈比例下重采样: 1:2 、 1:1 、 2:1 。 - **观测对象**: - **all-FRAUD 基线**:欺诈 F1 从 0.500 ( 1:2 )升至 0.800 ( 2:1 ),但 Balanced Accuracy 恒为 0.500 ,非欺诈召回率恒为 0 ; - **TF-IDF+SVM**:对比例变化相对不敏感; - **MiniMax-CN**:即使在 1:1 比例下仍高度偏向欺诈(预测欺诈比例 0.830 ,非欺诈召回仅 0.233 )。 - **实验结论**:单一欺诈 F1 不足以诊断模型能力,必须联合报告类别平衡指标(Macro-F1、Balanced Accuracy)、双类召回率及预测分布。 —- ### 5. 补充材料中的构造层面审计实验(Construction Analysis) 在附录中,论文还报告了独立于模型分数的构造审计: - **混合树结构与迁移性**:基于 BGE-small-zh 嵌入的 813 段对话分析显示,树内平均距离 0.0188 ,跨树平均距离 0.3351 ,比率约 17.8× ;留一树外 F1 从域内 0.883 降至 0.605 ,支持树感知分割的必要性。 - **对话质量与标签可追溯性**:对 80 段对话音频的单标注员试点检查显示,对话真实性、策略连贯性、受害者反应合理性、音频自然度的平均评分分别为 4.60 、 4.41 、 4.35 、 4.13 (1–5 分制)。十位独立专家对 1000 条项目的审核显示,修正后 gold 一致性平均 0.792 ,置信度平均 4.431 , 74.4% 的判断被认为证据充分。 - **语音渲染控制**:在 15 对配对对话上移除情感 token 后,聚合 F1 从 0.920 升至 0.960 ,最大单模型差异 4.6 个点,说明情感变量被作为受控渲染因子处理。 Q5: 有什么可以进一步探索的点? 基于论文的局限性与开放挑战,以下方向值得进一步探索: ### 1. 长期时序演化与动态分析 当前基准仅包含 June/V1 与 July/V2 两个冻结快照。论文明确指出,**更长周期的时序结论需要额外的月度发布**。未来可通过持续积累 6–12 个甚至更多快照,系统分析诈骗模式漂移速度、模型性能衰减曲线,以及是否需要周期性重训练或自适应更新策略。 ### 2. 跨语言与低资源场景扩展 现有快照聚焦于**中文通话**。电信诈骗在全球多语言环境中均高度活跃,不同语言的语法结构、礼貌策略与声学特征差异显著。将 Mixed-Tree 管道适配至英语、日语、东南亚语言等低资源场景,并检验跨语言迁移是否仍受近域混淆与类别先验捷径影响,具有直接应用价值。 ### 3. 流式与早期检测协议 论文评估基于**完整对话轨迹**。然而实际风控场景要求系统在通话早期(甚至前 10–30 秒)即发出预警。未来可设计增量式评估协议:在混合树的不同深度节点截断输入,测量模型在信息不完整条件下的检测延迟与准确率权衡(detection latency vs. accuracy trade-off)。 ### 4. 细粒度欺诈类型与风险分级 当前标签为二值分类(`FRAUD` / `NONFRAUD`)。真实反欺诈业务通常需要识别具体诈骗类型(如冒充公检法、虚假征信、刷单返利等)并进行风险分级。可在 Mixed-Tree 的状态映射 σ 与叶子节点集合 L_x^c 中引入**多类或多层级标签**,评估模型在细粒度归因与风险量化上的表现。 ### 5. 对抗性自适应与鲁棒性压力测试 诈骗脚本会随检测系统部署而针对性演化。未来研究可引入**对抗性 Mixed-Tree 扩展**:在分支扩展函数 B 中加入已知检测模型的反馈,生成专门绕过当前主流模型决策边界的对抗路径,从而构建动态对抗基准(类似 Dynabench 的 human-and-model-in-the-loop 思想,但针对语音诈骗领域)。 ### 6. ASR 错误传播的消解策略 论文采用单一路径的 Whisper-medium 转录供所有 LLM 使用,这引入了**错误传播(error propagation)**风险。未来可探索: - 多 ASR 系统聚合(ensemble)或置信度加权转录; - 端到端音频模型与 ASR+LLM 级联系统的鲁棒性对比; - 在转录文本中显式插入不确定性标记,观察 LLM 对此类噪声的推理稳定性。 ### 7. 声学与副语言线索的深度利用 当前模型失败模式多与**文本内容**的类别先验捷径相关。欺诈通话中的紧张语调、语速变化、伪装声线、背景音效等副语言(paralinguistic)特征尚未被充分挖掘。未来可设计消融实验,分离文本语义与声学特征贡献,或开发融合音频表征与对话逻辑的联合推理架构。 ### 8. 混合树作为训练数据生成器 论文将 Mixed-Tree 定位为**评估数据**构造工具,但其可控生成能力同样适用于训练数据增强。可探索: - 利用混合树大规模合成欺诈/合法对话以缓解真实数据稀缺与隐私限制; - 检验在合成数据上训练的模型是否仍对近域兄弟路径具有泛化能力,或是否会继承生成器的特定偏差(如语气词分布、角色语言风格)。 ### 9. 人类基线与交互式决策研究 论文缺乏**人类听众/接线员**在相同音频集上的检测基线。引入人类实验可明确: - 当前模型性能是已超越还是仍落后于人类; - 人机协同决策(如模型辅助下的接线员判断)是否能有效降低近域混淆导致的假阳性; - 受害心理与认知偏差(如权威服从、紧迫感知)在音频通道中的量化影响。 ### 10. 可解释性与反事实推理 模型在合法兄弟路径上的高误报率暗示其决策边界可能偏离了真正具有因果性的动作特征。未来可结合反事实对话生成(如“若接收者拒绝透露验证码,对话仍被标记为欺诈的概率变化”),开发面向电信诈骗的**因果可解释性**方法,验证模型是否聚焦于正确的欺诈诱导动作而非表面相关词汇。 Q6: 总结一下论文的主要内容 这篇论文提出了 **TeleAntiFraud 2.0**,一个面向音频电信诈骗检测的刷新式、画像驱动、近域混淆基准测试。以下是论文主要内容的系统性总结。 —- ### 1. 研究背景与动机 电信诈骗造成的全球损失持续攀升,且诈骗脚本呈现两大特征:一是**快速演变**(冒充机构、话术、诱导动作不断更新),二是**高度伪装**(对话常被设计成与合法客服、风控通知或身份核验通话极为相似)。这对基于音频的诈骗检测评估提出了新要求:基准测试必须能够持续吸纳新出现的诈骗模式,同时必须与**近域合法通话**进行区分,而非仅依赖与欺诈话题无关的负例。 —- ### 2. 现有基准的核心缺陷 论文指出当前评估体系存在两个关键缺口: - **静态测试集无法刷新**:固定发布后,新观察到的诈骗脚本无法被纳入;若直接覆盖旧测试集,则历史结果不可复现、不可纵向比较。 - **缺乏近域负例**:非欺诈样本往往来自不相关主题或数据源,导致模型容易利用话题分布、词汇频率或数据源特异性捷径(shortcut learning)完成分类,而非真正理解“对话中请求了什么动作、是否允许独立验证、如何收尾”等行为级证据。 —- ### 3. 解决方案:TeleAntiFraud 2.0 基准 论文提出的基准包含两个相互支撑的设计: #### 3.1 月度冻结快照(Monthly Frozen Snapshots) 基准以**不可变的月度快照**形式组织。每个快照在冻结后,其音频、标签、推理依据、生成元数据、评估提示、模型响应及溯源记录均固定不变。新收集的诈骗案例摘要可通过统一管道纳入后续月度发布,而历史快照保持完整。这一设计同时实现了**可刷新性**(吸收新模式)与**可审计性**(历史结果可复现)。 当前发布的两个快照(June/V1 与 July/V2)各包含 900 通中文通话,其中 600 通欺诈、300 通近域非欺诈,保持固定的 2:1 组成。 #### 3.2 Mixed-Tree 反欺诈生成管道 该管道将在线诈骗案例摘要转化为结构化、可追溯的通话音频,分为四个阶段: - **场景画像(Scenario Profiling)**:将非结构化案例摘要转化为结构化画像 p ,明确参与者、呼叫方身份与策略、风险实体及决策节点。画像区分了在同一“通话族”内**共享的上下文**(参与者、场景、开头语境)与后续可变的情节动作。 - **混合树扩展(Mixed-Tree Expansion)**:在共享画像与开头语境 h_0 下,构建混合树 T_x = (V, E, r, φ, σ, τ) 。节点状态 σ(v) ∈ A, F, N 分别表示模糊、欺诈、非欺诈;分支扩展函数 B 至多生成 b 个高层情节动作(如请求凭证、允许官方验证、拒绝、结束通话)。欺诈与合法路径作为**兄弟路径(sibling paths)**共享同一根节点与早期交互,仅在产生标签证据的动作后才发生分岔。 - **协作对话实现(Collaborative Dialogue Realization)**:通过六智能体集合 G = R_c, R_r, B, Gamma, E_c, E_r 将情节动作转化为具体话语。结构控制(分支、终止)与角色条件语言生成(呼叫方/接收方话语、交付状态)分离,确保每一轮表面 utterance 均可追溯至其情节决策。 - **语音渲染与质量控制**:为角色分配兼容声线,依据存储的交付状态(如紧迫、困惑、中性)合成音频,并通过信号检查剔除损坏样本。 —- ### 4. 实验发现 论文通过控制实验与全集评估验证了基准的诊断价值: - **近域兄弟路径显著抑制捷径**:在文本控制实验中,当负例从“无关随机”递进至“近域兄弟”时,Bigram 词法重叠从 0.005 升至 0.274 ,而 Logistic Regression、SVM、RoBERTa 的 Macro-F1 从 1.000 骤降至 0.65 – 0.68 。这表明共享上下文迫使模型依赖行为动作而非话题线索。 - **线性可分性降低**:使用统一 TF-IDF+SVM 分类器,TeleAntiFraud 2.0 的 Macro-F1 显著低于 TeleAntiFraud-28k(尤其在 ASR 转录后降至 0.7998 ),且预测分布呈现欺诈偏向。 - **预测崩溃与类别先验捷径**:在 900 样本全集评估中,大量直接音频与 ASR+LLM 配置出现 **all-FRAUD 式崩溃**——欺诈召回率趋近 1.0 、准确率趋近 2/3 (与类别先验一致)、欺诈 F1 趋近 0.80 ,但 Balanced Accuracy 仅 0.50 且非欺诈召回为零。这说明模型识别了风险框架,却未能依据后续动作区分完成诈骗与合法兄弟路径。 - **指标敏感性**:通过在不同欺诈/非欺诈比例( 1:2 、 1:1 、 2:1 )下重采样,论文证明单一 fraud F1 会随类别先验 inflate,而 Balanced Accuracy 与 non-fraud recall 能更忠实反映边界识别失败。 —- ### 5. 主要贡献 - **刷新式音频基准协议**:首次在电信诈骗领域实现“持续纳入新诈骗模式 + 历史快照不可变”的版本化评估架构。 - **Mixed-Tree 生成管道**:通过共享画像、混合树扩展与协作对话实现,系统性地构造了欺诈与合法兄弟路径,使标签绑定于完整交互轨迹而非表面话题。 - **崩溃感知评估框架**:通过多模型跨快照实验,确立了在高度混淆条件下联合报告 Macro-F1、Balanced Accuracy、双类召回率及预测分布的必要性,为音频反欺诈模型的真实能力诊断提供了更严格的测试床。 Q7: 想要进一步了解论文 以上只是了解一篇论文的几个基本FAQ。如果你还想与Kimi进一步讨论该论文,请点击 这里 为你跳转Kimi AI网页版,并启动一个与该论文相关的新会话。
Authors: Huiyuan Liu,Zhiming Ma,Yanxing Liu,Shun Zhang,Qifan Wang,Di Liu,Yifan Wang,Yuyang Deng,Haoyang Meng,Yijin Zhou,Yuxi Zhao,Chengxian Hu,Peidong Wang,Peng Chen
Categories:
PDF URL: https://arxiv.org/pdf/2609.18748.pdf
Arxiv URL: https://arxiv.org/abs/2609.18748
Arxiv ID: 2609.18748
CoolPaper URL: https://papers.cool/arxiv/2609.18748
Published: 2026-09-22T01:51:43.610Z
Updated: 2026-09-22T01:51:43.610Z