智能体协作、行为基础模型与跨域系统偏差检测
今日精选 8 篇 AI/ML 论文,涵盖AI, IR, LG, CL, MA, CV, RO, SE, stat.ML等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多智能体信息检索、模型蒸馏、政治联盟模拟、多模态内容审计、人形机器人基础模型、工程领域智能体、生成模型自蒸馏以及智能体搜索中的因果效用评估等方向。
1. SearchOS-V1:迈向鲁棒的开域信息寻求智能体协作
作者: Yuyao Zhang, Junjie Gao, Zhengxian Wu, Jiaming Fan, Jin Zhang et al. | 分类: cs.AI, cs.IR 链接: arxiv.org/abs/2607.15257v1
近期工具集成大语言模型的进展使网页搜索成为信息寻求智能体的核心能力。然而,随着交互历史增长,智能体越来越难以追踪任务进展。当搜索尝试未能获得有效证据时,当前的单/多智能体系统容易陷入重复循环,浪费搜索预算并最终损害输出质量。我们提出SearchOS,一个系统级多智能体框架,将脆弱、隐式的搜索进展转化为显式、持久且共享的状态。首先,我们将开域信息搜寻形式化为带引用的关系模式补全,智能体在其中发现实体、跨链接表填充属性并将每个值锚定到源证据。然后我们设计了搜索导向的上下文管理,将演变中的状态外化为前沿任务、证据图、覆盖图和失败记忆。基于此,SearchOS采用流水线并行调度机制,重叠子智能体的执行,并持续用针对未解决覆盖差距的任务填充释放的槽位以提高利用率和吞吐量。为调度和控制搜索智能体的执行,SearchOS引入了搜索工具中间件,拦截模型与工具的交互以记录证据并对停滞或预算耗尽做出反应,并提供可重用的分层技能系统,包含策略技能和访问技能,以增强搜索过程并避免跨运行重复失败模式。在WideSearch和GISA基准上,SearchOS在所有指标上领先评估的单/多智能体基线,为鲁棒的信息寻求协作铺平了道路。
点评: 将隐式搜索状态显式化并引入流水线并行调度,为解决多智能体搜索中的死循环和预算浪费问题提供了系统级的工程解决方案,实验结果极具说服力。
2. 在策略Delta蒸馏
作者: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han | 分类: cs.LG, cs.CL 链接: arxiv.org/abs/2607.15161v1
在策略蒸馏是强化学习中一种替代后训练方法,通过提供来自教师模型的Token级监督来缓解奖励模型施加的约束。尽管在策略蒸馏已在各种设置中研究和应用,但其基本设计仍未得到充分探索。本文引入一种新的蒸馏奖励,称为delta信号,而非直接模仿教师模型的输出分布。delta信号被定义为教师模型与其进行推理能力指令调优前的基模型之间的差异。因此,它捕捉了推理调优引起的变化,并为迁移推理能力提供了更直接的信号。通过大量实证证据,我们展示了delta信号显著改进了在策略蒸馏,并将新方法称为在策略Delta蒸馏。在数学、科学和代码推理基准上的实验表明,OPD²始终优于传统在策略蒸馏,使推理LLM只需短期的后训练周期即可实现强劲性能。
点评: 巧妙地利用指令调优前后的模型差异作为蒸馏目标,比直接模仿教师输出更有效地传递推理能力,方法论创新与实验效果俱佳。
3. 数字万神殿:使用LLM智能体模拟和审计联盟形成
作者: Dylan Van Mulders, Matthias Bogaert, Dirk Van den Poel | 分类: cs.CL, cs.AI, cs.MA 链接: arxiv.org/abs/2607.15095v1
政治联盟的形成是一个复杂的谈判过程,由具体的政策目标和深层的意识形态信念共同驱动。虽然LLM为计算政治学开辟了新途径,但RLHF灌输的中立性和乐于助人偏见阻止它们维持坚定的党派行为。我们提出了一个多智能体框架,通过结合监督微调、直接偏好优化和检索增强生成来调和事实基础与意识形态对齐:DPO灌输激进的政党特定人格,而每个政党的RAG管道将每个智能体限制在其官方宣言中。我们在2019年佛兰德选举上操作了该框架,在由一个组阁者仲裁的星型谈判中部署党派智能体。为使涌现谈判可解释,我们引入了多层信息谱系拓扑,追踪最终协议中每个条款的宣言来源并将其分类为五种来源状态;引入联盟影响力评分,聚合这些可追溯的贡献以识别塑造协议的政党;并引入真实世界接地检查,将每个模拟条款与历史采用的联盟协议进行基准测试。在三个独立模拟中,该框架产生了稳定的胜者和排名(N-VA领先于CD&V和Open Vld),且宣言锚定的谱系可靠地预测了真实世界的实现,而虚构内容则不然。结果是:一个透明、可扩展的测试平台,用于政党兼容性和组阁者媒介妥协的预先探索。
点评: 将DPO、SFT与RAG巧妙结合来模拟立场坚定的党派智能体,并设计了完整的可解释性框架,为计算政治学提供了一种高度可控且可验证的研究范式。
4. Symbal:检测模型生成描述中的系统性偏差
作者: Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.15216v1
多模态大语言模型在生成图像描述时常引入错误,导致图像-文本对对齐不良。我们的工作关注一类我们称为系统性偏差的描述错误,即MLLM生成描述中的重复错误与配对图像中特定视觉特征的存在密切相关。给定一个带有MLLM生成描述的多模态数据集,我们的目标是检测此类错误,这一任务我们称为系统性偏差检测。作为第一个关键贡献,我们提出Symbal,利用现成基础模型的、有结构的双阶段设置来识别系统性偏差并以自然语言总结结果。作为第二个关键贡献,我们引入SymbalBench,一个为评估我们提出任务上的自动化方法而设计的基准。SymbalBench包含来自两个领域(自然图像和医学图像)的170万图像-文本对,组织成420个带有标注系统性偏差的多模态数据集。Symbal在该基准上表现出色,正确识别了63.8%数据集中的系统性偏差,比最近基线改进了近4倍。我们还用真实世界评估补充了SymbalBench上的评估,表明(1)Symbal能准确揭示四个MLLM生成描述中的系统性偏差,以及(2)Symbal是审计现成图像-描述数据集的强大工具。最终,我们的新任务、方法和基准可帮助用户审计MLLM生成的描述并识别关键错误,而无需访问底层MLLM。
点评: 系统性地定义并检测了一种之前被忽视的、与视觉特征强关联的模型生成偏差,170万样本的基准和近4倍的性能提升使得这项工作实用价值极高。
5. 人形机器人的缩放行为基础模型
作者: Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.15163v1
人形控制需要自然的全身协调、对控制信号的精确实时响应以及跨多样化环境上下文的鲁棒泛化,使其成为通用具身智能体的基石。行为基础模型最近作为解决这些挑战的有前途方案出现,通过利用大规模行为数据实现卓越的表现力、多样性和泛化性。然而,尽管对扩展BFM以进一步提升其能力的兴趣日益增长,关键因素(包括学习范式、行为数据和模型架构)应如何协调以实现有效扩展仍不清楚。本工作中,我们重新审视BFM的缩放配方,并证明通过协调三个核心组件可实现显著的性能提升:1)运动跟踪的学习范式,将多样化人形控制问题重新表述为在全局坐标系中再现集成的全身行为;2)在策略rollout数量与参考运动多样性之间的战略协同;3)称为Humanoid Transformer的表现力丰富且可扩展的模型架构,促进结构化行为表征的自然涌现。通过模拟和真实世界部署中的大量实验,我们证明我们的方法在控制保真度和任务泛化方面产生了显著改进,在局部模式下将测试集上的均值每关键点位置误差降低了超过10%,在全局模式下相比现有人形控制器降低了82%。这些结果确立了BFM作为可扩展、通用人形控制的有效基础。
点评: 系统性地揭示了人形机器人行为基础模型有效缩放的三个核心要素——学习范式、数据协同和模型架构,并在真实世界部署中取得了令人瞩目的控制精度提升。
6. StructureClaw:可追踪的LLM智能体与结构工程工作流的可执行基准
作者: Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou et al. | 分类: cs.SE, cs.AI, cs.MA 链接: arxiv.org/abs/2607.14896v1
处理一个结构工程请求需要的不仅仅是单一答案;它需要一系列相互依赖的工件:解释后的需求、可计算的模型、验证记录、求解器输出、代码检查记录和最终报告。聚焦于问答或脚本生成的评估很少验证这条完整的证据链,因此即使底层工程工作流不完整、内部不一致或不可执行,也可能奖励流畅的输出。为解决这一局限,我们提出StructureClaw,一个以工件为中心的工作台,其中LLM智能体通过受控的工程技能、类型化工具、共享工件状态和本地分析后端操作。我们还引入StructureClaw-Bench,一个包含150个受控场景的可执行基准,涵盖标准工作流执行、交互鲁棒性和多模态结构模型重建。一个场景仅在单次运行中所有必需的工件级和执行级断言都通过时才成功。在10个智能体-模型配置上,每个配置在相同的50个标准案例上评估,平均成功率从通用技能基线的56.8%上升到全自动工作流的88.6%。交互和多模态评估识别出两个突出的剩余挑战:无效数值输入的安全处理以及夹具一致的结构模型重建。这些发现表明,以工件为中心的评估可以暴露难以从最终响应中识别的工作流级失败,为评估和改进结构工程智能体提供了更严格的基础。
点评: 将评估从“回答质量”转向“完整工件链”,150个场景的可执行基准设计严谨,88.6%的成功率验证了系统方法在实际工程领域的巨大潜力。
7. 通过线性探查实现修正流的优化自蒸馏
作者: Saptarshi Roy, Debepsita Mukherjee, Pratik Patil | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2607.14947v1
现代生成模型越来越多地使用模型生成的信号进行训练,这既创造了自我改进的机会,也带来了崩溃的风险。我们研究针对修正流的最优自蒸馏:给定一个次优的教师速度场,学生模型在真实RF速度与教师速度的混合上训练能否证明性地改进教师?对于固定插值对上的带岭正则化的线性RF,我们证明了一个精确的仿射路径恒等式,推导出闭式最优混合系数,并展示了只要教师风险沿正则化路径非平稳,集成速度风险就有严格改进。最优系数遵循符号规则:正混合修正欠正则化的教师,而负混合修正过正则化的教师。我们还给出了避免在混合权重上网格搜索和重复重拟合的单次广义交叉验证和验证调优过程。将此定理与RF Wasserstein收敛界结合,我们证明最优自蒸馏改进了控制连续时间和有限步生成误差的速度估计项。高斯模型、高斯混合模型和图像数据的实验表明,最优自蒸馏在速度风险、模式恢复和有限步生成方面相对于教师和纯蒸馏均有改进。
点评: 在理论上严格证明了修正流模型自蒸馏的最优性,并给出了闭式解和符号规则,为生成模型的安全自我改进提供了扎实的理论基础。
8. 桥接证据:静态检索效用无法预测多步智能体搜索中的因果效用
作者: Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee | 分类: cs.IR, cs.CL 链接: arxiv.org/abs/2607.15253v1
检索系统基于静态的有用性概念进行训练和评估:将文档和问题交给阅读模型,看答案是否改善,并据此对文档打分。当文档被单独阅读时,这一概念成立。但当语言模型作为搜索智能体工作时,发出多个查询并跨轮次推理时,这一概念就失效了,因为一份文档可能重要在于它让智能体接下来能做什么,而不是它关于当前问题说了什么。我们测量而不是论证了这一差距。使用一个基于HotpotQA的ReAct风格智能体,我们回放了1000个开发问题,对于智能体读取的每份文档,将其删除并从该点重新运行轨迹的其余部分。将原始运行与其反事实进行比较,得到来自三个差值的反事实轨迹效用分数:最终答案质量、下一查询检索质量和轮次数。将CTU与静态RAG效用进行23,322份文档观测的对照,两者接近统计独立。智能体读取的文档中约三分之一在因果上是承重的,但对静态阅读器看起来无用;我们称这些为桥接文档。当阅读器轴换为BM25和交叉编码器代理时,该模式依然存在,在均匀分布的轴上给出27.2%的桥接单元。第二个实验确定了机制。使用先前工作中的可观察实体相关性度量,区分相关与非相关候选者的实体出现在智能体下一查询中的频率比仅出现在非相关文档中的实体高4.02倍。一份桥接文档通过交给智能体一个能重定向搜索的判别性实体来赢得其价值。静态相关性与因果有用性在智能体检索中是不同的量,优化前者并不能带来后者。
点评: 通过精巧的反事实实验设计,令人信服地揭示了当前检索系统评估的根本盲区——文档的”桥接价值”,对Agentic搜索系统设计和评估具有革命性启示。
本内容由 AI 辅助生成,论文信息来源于 arXiv。