多智能体协调、RAG融合与具身控制前沿进展
今日精选 8 篇 AI/ML 论文,涵盖LG, AI, CL, CV, MA, RO, CR, IR等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多智能体协调、LLM安全基准测试、机器人控制、事实核查、价值对齐、异质模型融合及金融RAG等多个前沿方向。
1. 价值冲突解决稳定性的几何视角
作者: Saket Reddy, Andy Liu | 分类: cs.LG, cs.AI 链接: arxiv.org/abs/2607.17946
大型语言模型在使用强化学习从人类反馈(RLHF)的压缩标量奖励进行训练时,往往难以处理价值冲突。为了应对这一挑战,我们研究了思维链推理如何帮助提升该领域的性能。从几何角度来看,思维链与其在损失函数最陡方向上进一步平滑模型损失景观相关,这有助于解决传统标量奖励的优化不稳定性。我们还通过相关下游基准测试表明,专注于价值冲突的思维链可以泛化到不同类型的道德推理,证明该思维链有望成为实现更好道德推理的有效机制。为了发挥这一潜力,我们设计了一种新的专注于价值冲突的思维链,进一步平滑了损失景观的最陡方向并提升了道德推理性能。这一发现表明,显式修改和改进推理动态的设计为提升模型在处理含复杂价值冲突的用户请求方面的性能提供了一条有前景的途径,推进了LLM的多元对齐。
点评: 将价值对齐问题转化为几何优化问题,提供了一个极其优雅的理论框架来理解思维链为何能提升道德推理能力。
2. 重新思考异质LLM融合:加权平均模型视角
作者: Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie et al. | 分类: cs.AI 链接: arxiv.org/abs/2607.18026
具有本质不同参数空间的大型语言模型能否通过直接加权平均进行融合,而无需训练或语义对齐?现有的异质融合方法通常引入蒸馏、适配器、学习到的潜在空间、路由或特征对齐,对于真正不同的十亿参数检查点是否可以采用更简单的方案,目前尚无定论。我们通过免训练的维度适配和比例控制插值重新审视了这一反直觉的问题。在联合式融合中,我们将较小的模型扩展到较大的参数空间;在交集式融合中,我们将较大的模型截断到较小的参数空间。在Qwen系列模型对和涵盖数学推理、代码生成、语言理解、常识推理、知识和指令跟随的基准测试中,确定性扩展在很大程度上保留了源模型的功能,而小比例插值可以通过转移互补能力来改进强源检查点。然而,接近平衡的插值常常导致性能崩溃,任务级结果揭示了跷跷板效应,即某些能力的提升伴随其他能力的衰退。这些结果表明,与轻量级维度适配和精心控制的比例相结合时,简单的参数平均是异质LLM融合的一个出奇强大的基线,暗示直接加权融合的限制也可能限制了更复杂的异质融合方法在大规模应用中的表现。
点评: 挑战了异质模型必须复杂融合的学术共识,用简单的维度适配+加权平均展示了惊人的效果,为模型合并提供了极简而强有力的新范式。
3. DeLIVeR: 通过强化知识图谱探索进行基于信息的真实性识别分解学习
作者: Cong Hoan Nguyen, Thomas Hoang, Hieu Minh Duong, Long Nguyen | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2607.17935
自动事实核查依然是大型语言模型面临的一大挑战,原因是传统检索系统中的“查询脆弱性”。我们提出了DeLIVeR,一个将证据检索视为强化策略探索任务的框架。DeLIVeR利用一个规划器LLM将复杂声明分解为有针对性的问题集,用于遍历结构化知识图谱以获取高精度证据。我们使用组相对策略优化(GRPO)和一套优先考虑结构多样性和判决准确性的奖励系统来优化规划器的策略。在LIAR、FEVER和PolitiFact上的评估显示,DeLIVeR显著优于最先进的基线。使用Qwen2.5-7B,我们的框架分别达到了83.73、84.57和79.70的最高F1分数,比HippoRAG2提升了10-15%。通过转向强化问题规划策略,DeLIVeR有效弥合了多跳推理差距,并为可验证的错误信息检测提供了可审计、透明的路径。
点评: 将事实核查从“一次性检索”升级为“强化学习驱动的多跳探索」,在多个经典基准上实现了突破性提升,对假新闻治理具有重要实用价值。
4. 稀疏证据足以:面向多模态视频虚假信息检测的智能体证据搜寻
作者: Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.18080
多模态视频虚假信息检测通常被表述为一个整体视频理解任务,即一次性处理和判断整个视频及其相关内容。然而,现实世界中的虚假信息往往呈现出稀疏和组合性的证据结构:一个可靠的判决可能仅依赖于少数耦合的线索,而大部分视频内容贡献了有限的附加信息。因此,穷举式多模态推理可能会引入大量冗余并模糊关键证据。这促使我们将证据获取与验证解耦:首先识别稀疏的、与判决相关的线索,然后基于获取的证据判断真实性。据此,我们提出了SIEVE,一个用于多模态视频虚假信息检测的稀疏交互式证据验证框架。一个证据搜寻智能体主动探索可用的多模态证据并构建紧凑的证据包,然后由验证器据此判断真实性。该智能体通过有监督的证据搜寻轨迹和一种证据感知的强化学习目标进行训练,该目标鼓励获取信息性证据,同时阻止不必要的或无效的交互。在多个视频虚假信息基准测试上的实验表明,SIEVE持续优于评估的基线,并支持使用紧凑证据包进行可靠验证。此外,产生的获取过程提供了显式且可检查的证据线索,提升了多模态假信息检测的透明度和立足点。
点评: 洞察到视频虚假信息检测中“线索稀疏”的本质,用智能体主动搜寻少量关键证据而非穷举分析,兼顾了效率和可解释性。
5. 价值感知预测实现通信丢失下的鲁棒多智能体协调
作者: Kemal Devrim Kafadar, Eren Özaltun, Mahmud Efnan Şanlı, Feyza Orak, Emirhan Gazi et al. | 分类: cs.MA, cs.LG, cs.RO 链接: arxiv.org/abs/2607.17914
鲁棒的多智能体协调高度依赖于智能体间的通信,而在现实部署中,通信常因物理和环境限制而中断。为了在间歇性通信故障期间维持运行,智能体可以采用内部预测模型来估计缺失的共享状态信息。然而,使用标准重构目标训练的预测器对所有转换一视同仁。在强化学习背景下,这迫使模型浪费容量去学习随机的探索噪声和次优策略的过时动态。在本文中,我们提出了一种价值感知扩展的多智能体通信丢失下的观察共享方法,称为价值感知MARO。通过使用底层Actor-Critic架构派生的优势估计动态加权预测器的损失函数,我们的目标显式地将预测器的学习过程与策略的演化耦合。这种表述将模型的能力集中在智能体主动强化的、具有高回报的有意动态上。我们在不同通信可靠性水平的多智能体粒子环境中的多个任务上评估了我们的框架。实验结果表明,我们的方法在通信可靠性下降时(尤其是低于40%)仍能保持性能。在基线已能维持高协调性的任务中,我们的方法表现相当,但在高丢失率场景下,我们的价值感知加权有效防止了标准预测器中观察到的性能崩溃。在这些环境中,与标准无加权基线相比,我们的方法实现了平均回报超过20%的提升,并将性能方差平均降低了64.7%。
点评: 针对多智能体系统通信中断这一硬伤,提出「价值感知”损失加权策略,让预测模型聚焦高回报动态而非噪声,在通信极度不稳定时表现显著稳定。
6. 自适应对手:面向LLM Agent安全的多轮、多LLM基准测试
作者: Devina Jain, David Hartmann, Chuan Li | 分类: cs.CR, cs.AI, cs.LG 链接: arxiv.org/abs/2607.18063
基于LLM的Agent处理外部内容,这使其面临提示注入和多轮操纵的风险。大多数安全基准测试针对的是在评估前收集到的固定攻击库(单轮或多轮)来评估防御方。我们提出了一个包含21个场景的基准测试,用于测试针对无记忆LLM防御方的自适应多轮攻击:一个自主LLM攻击者观察防御方先前的响应并在多轮之间转换策略,而每次防御方响应都被视为一次新的交互。在固定21个场景、攻击者、防御方和结构化输出评分的情况下,将评分限制在攻击者的第一轮,攻击成功率为0-1%;允许15轮自适应攻击后,攻击成功率上升至5.4-14.0%。汇集三个前沿攻击者LLM发现了比最佳单一攻击者多1.4-2.2倍的独特成功攻击,且生成的攻击与现有基准测试中的攻击余弦相似度很低(0.02-0.14)。Claude Opus 4.6和GPT-5.4在整体上持平(各5.4%;95%置信区间重叠),但它们的弱点截然不同:在一个场景中,Opus达到了60%的攻击成功率(95% CI 36-80%),而GPT-5.4和Gemini各保持在7%(CI 1-30%;该差距在更高N的复现中得以保持)。21个场景中有13个能区分至少一对防御方,但排名在不同场景间存在分歧(Kendall’s W = 0.19)。我们发布了该基准测试——21个评估场景、10个公共开发场景、编排器、基线框架和一个多攻击者CLI——以及3x3前沿矩阵的945份记录、一个攻击回放数据集,以及来自开放竞赛最终评分轮的18,422场gpt-oss-20b对战。
点评: 开创性的AI安全动态基准测试,揭示了“多轮适应攻击”的巨大威力,不同模型的安全弱点呈现显著且不一致的差异化,对Agent部署安全极具警示意义。
7. Patch Policy: 通过稠密视觉表征实现高效具身控制
作者: Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun et al. | 分类: cs.RO, cs.LG 链接: arxiv.org/abs/2607.18236
来自Vision Transformers的预训练稠密视觉特征能力强大,但在机器人学习中未得到充分利用。现代机器人策略要么将每次观测压缩为单个全局token,要么依赖从头开始训练的视觉主干,这既牺牲了细粒度的空间细节,又牺牲了大规模视觉预训练的好处。虽然存在确实操作于稠密块特征的政策(如大型视觉-语言-动作模型,VLAs),但它们往往笨重且缓慢,继承了十亿参数视觉-语言模型主干的全部计算成本。我们通过Patch Policy来弥补这一差距,这是一种极简的架构扩展,使得基于Transformer的策略能够直接消耗预训练的稠密块token,而无需完整VLM的计算开销。其核心是一个块因果注意力掩码,它在保留标准策略的时间因果性的同时,允许模型关注每次观测中的多个块token以及其他状态信息。Patch Policy轻量、快速且高效。在四个模拟和三个真实世界环境套件中,我们的方法比使用最先进的全局池化表征的策略实现了40%的相对改进。此外,它超越了微调后的OpenVLA-OFT 18%,同时仅使用了约0.7%的参数。我们相信Patch Policy为机器人社区提供了一种管道,可以轻松利用视觉表征学习的持续进步,而不会牺牲高频、反应式控制所需的训练效率或推理速度。
点评: Yann LeCun团队新作,用极小的架构改动让机器人策略直接消费ViT的稠密块特征,以0.7%的参数超越VLA架构,为实用化具身智能提供了高性能轻量级方案。
8. FinSAgent: 语料对齐的多智能体RAG框架用于基于证据的SEC文件问答
作者: Jijun Chi, Zhenghan Tai, Hanwei Wu, Tung Sum Thomas Kwok, Hailin He et al. | 分类: cs.IR, cs.CL, cs.MA 链接: arxiv.org/abs/2607.18102
针对美国证券交易委员会(SEC)文件的金融问答需要检索和综合分散在冗长、标准化且高度冗余的披露文件中的异质证据。现有的检索增强和多智能体系统通常直接从用户问题中获取检索查询,并按照语义相似度对候选结果进行排序。这些选择共同导致了先验-语料不对齐:模型先验与目标文件的结极、术语和证据标准不匹配。结果,查询生成遗漏了特定于语料的证据,而语义重排序则偏向于主题相似但证据无效的假阳性片段。我们提出了FinSAgent,一个基于证据的多智能体框架,它将SEC文件问答重新构建为语料对齐的检索规划,并基于一个单一原则纠正了两端的问题:在模型先验可能主导的地方注入语料侧条件。FinSAgent结合了:(1)锚定于强制10-K项目结构的角色专用智能体;(2)数据库感知的查询分解,将每个智能体的子查询基于轻量级的本地语料摘要视图;(3)多路径检索与一个学习到的特征门控重排序器,将证据有效性与语义相似性分离。在五个离线金融QA基准测试中,FinSAgent在检索覆盖率和答案正确性上超越了强大的单智能体和多智能体基线;在一项有1000名匿名用户评分的三臂随机在线实验中,它也获得了比基线更高的分数。
点评: 针对金融文档问答中「先验-语料不对齐”这一核心痛点,通过角色专业化智能体和语料感知查询分解实现精准检索,离线与在线实验均验证了其优越性。
本内容由 AI 辅助生成,论文信息来源于 arXiv。