多智能体协作、LLM蒸馏与结构工程基准新突破

今日精选 8 篇 AI/ML 论文,涵盖AI, IR, LG, CL, MA, CV, RO, SE, stat.ML等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多智能体协作、模型蒸馏、具身智能、结构工程自动化、以及检索与生成系统的可靠性评估等前沿方向。


1. SearchOS-V1:迈向鲁棒的开放域信息检索智能体协作

作者: Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang et al. | 分类: cs.AI, cs.IR 链接: arxiv.org/abs/2607.15257v1

集成工具的大语言模型(Tool-Integrated LLMs)已将网页搜索作为信息检索智能体的核心能力。然而,随着交互历史增长,智能体越来越难以追踪任务进度。当搜索尝试未能产生有效证据时,当前的单/多智能体系统容易陷入重复循环,浪费搜索预算并损害最终输出的质量。本文提出 SearchOS,一个系统级多智能体框架,它将脆弱、隐式的搜索进度转化为显式、持久和共享的状态。首先,他们将开放域信息检索形式化为带引用的关系模式补全,智能体在此过程中发现实体、跨链接表填充属性,并将每个值锚定到源证据。然后设计了搜索导向的上下文管理(SOCM),将演化状态外化为前沿任务、证据图、覆盖图和失败记忆。基于 SOCM,SearchOS 采用流水线并行调度机制,重叠子智能体的执行并持续用填补覆盖空白区域的任务填充空闲槽,以提高利用率和吞吐量。此外,SearchOS 引入搜索工具中间件层来拦截模型与工具的交互以记录确凿证据并应对停滞或预算耗尽,并提供可重用的分层技能系统。在 WideSearch 和 GISA 上,SearchOS 在所有评估指标上领先于单/多智能体基线。

点评: 将隐式搜索过程显式化为可共享的“黑板”状态,并通过流水线调度显著提升多智能体搜索效率,为解决搜索过程中的死循环问题提供了系统级方案。

2. 在策略Delta蒸馏(On-Policy Delta Distillation)

作者: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han | 分类: cs.LG, cs.CL 链接: arxiv.org/abs/2607.15161v1

在策略蒸馏(On-policy distillation)是强化学习中一种替代的后训练方法,它通过提供教师模型的 token 级监督来缓解奖励模型带来的约束。本文引入一种新的蒸馏奖励,称为 Delta 信号,而不是直接模仿教师模型的输出分布。Delta 信号定义为教师模型与其在推理能力指令微调之前的基座模型之间的差异。因此,它捕捉了推理调优所引起的变化,并提供更直接的信号来迁移推理能力。大量实验表明,Delta 信号显著改善了在策略蒸馏,该方法被命名为在策略Delta蒸馏(OPD²)。在数学、科学和代码推理基准测试上的实验表明,OPD² 持续优于传统的在策略蒸馏,使得推理型 LLM 在仅经过短暂后训练后即能达到强大性能。

点评: 核心创新在于蒸馏的不是“结果”(输出分布),而是“改变”(Delta信号),这让小模型更专注于学习推理能力的增量变化,而非重复基础知识。

3. 数字万神殿:使用LLM智能体模拟和审计联盟形成

作者: Dylan Van Mulders, Matthias Bogaert, Dirk Van den Poel | 分类: cs.CL, cs.AI, cs.MA 链接: arxiv.org/abs/2607.15095v1

政治联盟的形成是一个复杂的谈判过程,受具体政策目标和深层意识形态信念的双重驱动。虽然 LLM 为计算政治科学开辟了新途径,但 RLHF 带来的中立性和助益性偏见使它们无法维持坚定的党派行为。本文提出了一个多智能体框架,通过结合监督微调(SFT)、直接偏好优化(DPO)和检索增强生成(RAG)来调和事实基础与意识形态一致性:DPO 注入激进的党派特定角色,而每个党派专属的 RAG 管道让每个智能体约束在其官方竞选纲领内。在 2019 年弗拉芒选举上的实验表明,该框架能稳定地预测主要执政党排名,并且锚定于宣言的溯源可靠地预测了现实世界的协议条款,而幻觉内容则不能。

点评: 通过DPO+RAG的组合,巧妙解决了LLM在模拟政治博弈中“和稀泥”的问题,为社会科学提供了一个可审计、可复现的群体博弈沙盒。

4. Symbal:检测模型生成标题中的系统性偏差

作者: Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.15216v1

多模态大语言模型(MLLM)在生成图像描述时常引入错误,导致图文不匹配。本文关注一类被称为“系统性偏差”的描述错误:即 MLLM 生成标题中反复出现的错误与配对图像中特定视觉特征的存在密切相关。本文提出 Symbal,利用现成的基础模型通过结构化双重阶段设置来识别系统性偏差并用自然语言总结结果。同时引入 SymbalBench 基准,包含来自自然图像和医学图像两个领域的 170 万对图文数据。Symbal 在该基准上正确识别了 63.8% 数据集的系统性偏差,比次优基线改进了近 4 倍。

点评: 解决了大模型数据集“自我污染”的隐忧——当模型对自己生成的数据产生系统性盲区时,Symbal能自动审计并标记这些“看不见的偏见”。

5. 面向人形机器人的规模化行为基础模型

作者: Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.15163v1

人形控制需要自然的全身协调、对控制信号的精确实时响应以及跨不同环境上下文的鲁棒泛化能力。行为基础模型(BFM)通过利用大规模行为数据来解决这些挑战。本文重新审视了BFM的扩展策略,展示了通过协调三个核心组件:1)将多样化的人形控制问题重构为全局坐标系下全身行为再现的运动跟踪学习范式;2)同策略(on-policy)交互数量与参考动作多样性之间的战略协同;3)名为Humanoid Transformer的表征能力强、可扩展的模型架构。实验表明,该方法显著提升了控制保真度和任务泛化能力,在测试集上将平均每关键点位置误差(MPKPE)在局部模式下降低了超过 10%,在全局模式下降低了 82%。

点评: 为人形机器人控制提出了清晰的规模化三要素(范式、数据、架构),且82%的全局误差降低意味着在复杂场景下的泛化能力取得了质变。

6. StructureClaw:面向结构工程工作流的可溯源LLM智能体与可执行基准

作者: Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou et al. | 分类: cs.SE, cs.AI, cs.MA 链接: arxiv.org/abs/2607.14896v1

处理结构工程需求不仅仅是提供一个答案,而是需要一组相互依赖的工件:解释后的需求、可计算的模型、验证记录、求解器输出、代码检查记录和最终报告。目前基于问答或脚本生成的评估很少验证这一完整的证据链。本文提出 StructureClaw,一个以工件为中心的工作台,LLM 智能体通过受控的工程技能、类型化工具、共享工件状态和本地分析后端进行操作。同时引入 StructureClaw-Bench 可执行基准,包含 150 个控制场景。在十个智能体-模型配置下,平均成功率从通用技能基线的 56.8% 提升到完整自动工作流的 88.6%。

点评: 强调“工件链”而非单一答案的验证范式,有望成为专业领域(如工程、法律、医学)LLM应用评估的黄金标准。

7. 通过线性探测实现整流流的最优自蒸馏

作者: Saptarshi Roy, Debepsita Mukherjee, Pratik Patil | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2607.14947v1

现代生成模型越来越多地使用模型生成的信号进行训练,这既创造了自我改进的机会,也带来了崩溃的风险。本文研究整流流(RF)的最优自蒸馏:给定一个次优的教师速度场,受训于真实RF速度和教师速度混合物的学生能否可证明地改进教师?对于线性RF,他们证明了精确的仿射路径恒等式,推导了最优混合系数的闭式解,并证明了当教师风险沿正则化路径非平稳时,集成速度风险的严格改进。最优系数服从符号规则:正混合纠正欠正则化的教师,负混合纠正过正则化的教师。实验表明,最优自蒸馏在速度风险、模式恢复和有限步生成方面均优于教师和纯蒸馏方法。

点评: 首次从理论上严格证明了自蒸馏在生成模型(整流流)中的可行性和最优条件,给出了可计算的混合比例公式,对“模型自我合成数据”的实践具有重要指导意义。

8. 桥接证据:静态检索效用无法预测多步智能体搜索中的因果效用

作者: Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee | 分类: cs.IR, cs.CL 链接: arxiv.org/abs/2607.15253v1

检索系统是基于静态有用性概念进行训练和评估的:将文档和问题交给阅读器模型,看答案是否改善,并据此对文档打分。当语言模型充当搜索智能体,发出多个查询并在不同轮次之间进行推理时,这种想法失效了,因为一篇文档的重要性在于它能帮助智能体下一步做什么,而非对当前问题提供了什么信息。本文使用 ReAct 风格智能体在 HotpotQA 上进行实验,对比原始运行和删除某文档后从同一点重新运行的反事实结果,得到反事实轨迹效用(CTU)分数。跨越 23,322 个文档观测,CTU 与静态 RAG 效用(SRU)接近统计独立(Spearman rho = -0.026)。大约三分之一的文档被智能体读取后在因果关系上是决定性的,但静态阅读器看起来却毫无用处,作者称之为桥接文档。

点评: 一句话击中要害:传统检索评估的“静态相关性”与智能体场景下的“因果有用性”近乎零相关。该发现对构建真正的面向智能体的检索系统提出了根本性质疑。


本内容由 AI 辅助生成,论文信息来源于 arXiv。