推理加速、Agent 规划、多模态安全与模型过度拒绝

今日精选 8 篇 AI/ML 论文,涵盖LG, CL, AI, CV, RO, LO, IR, eess.SY, MA等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖LLM安全对齐、社交推理、机器人导航、医疗推理、工业推荐系统与故障控制等前沿方向。


1. 用竞争性奖励解决大语言模型的过度拒绝问题

作者: Taeyoun Kim, Aviral Kumar | 分类: cs.LG 链接: arxiv.org/abs/2606.31748v1

安全训练常常导致大语言模型过度拒绝:对有害提示的安全性提升了,但代价是对无害提示的拒绝率也上升。虽然可以通过强化学习训练模型在回答前先进行推理来缓解这一权衡,但推理本身往往只是为预定的回答”盖章”。本文提出SEAR模型,核心洞见是:不安全的推理本身可以作为一种有用的探索信号。作者不是预先阻止有害思维,而是鼓励模型充分探索不安全的推理过程,但最终产生安全的回答。这种有害探索通过消除歧义提高了模型区分有害和无害提示的能力。作者将问题形式化为一个对抗优化问题,其中”推理玩家”探索产生不安全回答的策略,“回答玩家”确保最终输出安全。通过密集过程奖励来训练单个模型在思维链的不同阶段扮演两个角色。SEAR在安全回答之前故意进行有害推理探索,有效缓解了过度拒绝,并能够防御直接操纵推理使其有害的攻击。

点评: 这篇论文提供了一个优雅的思路——与其强行压制有害想法,不如让模型充分探索后再做安全判断,过程奖励的引入使得这一竞争性目标得以稳定优化。


2. 超越对话的心智理论与说服:评估LLM通过规划与行动诱发信念状态的能力

作者: Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street | 分类: cs.CL 链接: arxiv.org/abs/2606.31916v1

现有的心智理论(ToM)基准通常依赖被动的问答形式,但随着LLM越来越多地以智能体形式自主运行,亟需新的评估方法。本文评估了一种称为”非对话规划ToM”的能力,即智能体通过采取行动而非对话来说服来诱导其他智能体产生特定信念状态。作者提出了NCP-ExploreToM框架,要求模型通过移动物体或引导角色进入房间来达成信念状态目标。在600个任务实例上评估了GPT-5、Gemini 2.5 Pro和Claude 4系列等6个前沿模型及人类参与者。GPT-5在智能体设定中成功率达到约80%,是唯一在任务上超越人类参与者的模型,但在不同场景下的稳健性仍不如人类。所有模型在诱导真实信念状态的任务上表现优于诱导虚假信念状态的任务,这对AI对齐研究是积极信号。

点评: 这篇论文跳出了”你问我答”式的ToM评估范式,首次在行动层面衡量LLM的社交推理能力,对理解自主智能体的安全与对齐至关重要。


3. 利用文本拒绝方向实现多模态安全

作者: Moreno D’Incà, Massimiliano Mancini, Nicu Sebe | 分类: cs.AI, cs.CV, cs.LG 链接: arxiv.org/abs/2606.31876v1

提升大语言模型的安全性可通过后训练对齐或利用激活空间中的拒绝方向来实现。这两种策略在多模态大语言模型(MLLM)中都面临挑战,因为收集不安全的多模态数据比单模态数据困难得多。本文放松了这一约束,研究直接从LLM骨干中提取的文本拒绝方向是否能跨模态(如图像、视频)泛化。初步发现证实了这种能力,但有效性受层选择、干预强度和跨模态对齐的制约。基于此,作者提出了MARS(模态无关拒绝引导),一种轻量级无需训练的方法,无需多模态安全数据即可注入多模态安全。MARS通过激活重定心纠正模态错位,在几何定义的信任区域内自适应调整干预强度,并在首个生成token上选择最优干预层。在五个最先进的MLLM上评估,MARS在保持实用性的同时实现了持续的安全性提升。

点评: 这一发现揭示了一个令人振奋的事实:安全相关的结构在不同模态间是共享的,文本拒绝方向可以作为多模态对齐的强有力基础。


4. 打破失败级联:面向医疗多模态推理的步骤感知强化学习

作者: Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun 等 | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2606.31825v1

多模态大语言模型在临床影像推理中展现出巨大潜力,但现有后训练流程仍以结果为中心,依赖最终答案正确性或序列级偏好。这导致稀疏的信用分配,难以优化临床应用中至关重要的推理过程。本文发现,早期推理失败的级联错误是医疗视觉问答中错误预测的主因。作者提出MRPO,一种融入步骤级过程奖励的强化学习算法。当最终答案错误时,MRPO对早期无效推理步骤中的token施加指数级递增的惩罚,从而打破失败级联而不影响成功的推理路径。在三个多模态LLM骨干上,MRPO一致优于标准GRPO和近期RL基线。在Qwen3-VL-8B-Instruct上,甚至超越了HuatuoGPT-Vision-34B等更大规模的医疗MLLM 2.79个百分点。早期推理失败率从64.0%降至13.0%。

点评: 医疗AI中,“过程比结果更重要”——MRPO针对早期推理错误的惩罚机制直击级联失败的要害,对高风险的医疗画像场景意义重大。


5. MVP-Nav:多层价值地图规划导航器

作者: Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang 等 | 分类: cs.RO, cs.AI, cs.CV 链接: arxiv.org/abs/2606.31919v1

仅使用RGB感知的零样本目标导航对具身智能体来说是一个根本性挑战,缺乏显式深度信息会带来严重的物理不确定性和语义-物理错位。现有方法要么依赖缺乏几何基础的高层语义推理,要么学习缺乏显式物理约束的端到端策略,常常导致语义上合理但物理上不安全的行为。本文提出MVP-Nav,一个物理感知的纯RGB导航框架,将感知、规划和控制与真实3D世界对齐。MVP-Nav利用3D基础模型从单目观测中重建显式物理占有,将2D语义实例投影为3D定向包围框,形成全局空间语义表示。为了统一高层语义推理和低层物理约束,作者引入了多层价值地图(MVM),将语义优先级和重建几何集成到共享代价空间中,实现物理接地几何规划。实验表明,MVP-Nav显著优于现有无深度方法,达到最先进水平。

点评: 这项工作巧妙地将3D基础模型引入具身导航,用结构化物理先验补偿深度传感器的缺失,为低成本机器人导航提供了新方案。


6. 更好的理解,更深入地理解

作者: Yu Wei | 分类: cs.LO, cs.AI 链接: arxiv.org/abs/2606.31892v1

“任何傻瓜都能知道;关键在于理解。“这句常被归功于爱因斯坦的名言捕捉了一个广泛认同的直觉:理解不仅仅是知道。然而,认识逻辑学相对较少关注理解,尽管它在当代认识论、科学哲学和关于AI的近期讨论中扮演着核心角色。哲学文献中反复出现的主题是:与知识不同,理解是有程度的——一个人可以或多或少地理解某事,一个人的理解可能比另一个人的更好。本文提出了一种比较性的理解认识逻辑,包含级别索引的理解模态和一种比较连接词,用于表达一个智能体比另一个智能体更好地理解为什么某个命题成立。在语义层面,用智能体索引的分级解释结构和论据风格项代数丰富了多智能体认识模型。这构成了一个统一框架,用于表示最低限度的、普通的、更严格的和理想的理解,以及智能体之间关于同一公式的比较。本文区分了有限有界层级演算和无穷全语言伴随系统,建立了可靠性和强完备性,并证明了每个固定有限层次片段是可判定的。

点评: 从哲学到形式逻辑再到AI,“理解”这一概念首次在比较性框架下得到精密刻画,对构建真正”理解”而非仅”知道”的AI系统具有理论奠基意义。


7. GR2技术报告:工业级生成式推理重排序器

作者: Yufei Li, Zaiwei Zhang, Mingfu Liang, Kavosh Asadi, Jay Xu 等 | 分类: cs.IR, cs.AI 链接: arxiv.org/abs/2606.31984v1

工业推荐系统通过多层漏斗(召回、排序、重排序)为数十亿用户服务,其中重排序步骤对用户参与度影响最大。尽管LLM在推荐领域引起热潮,但三个差距阻碍了工业部署:(1) 重排序阶段——最接近最终用户体验的环节——基本未被探索;(2) LLM通常零样本部署或通过监督微调,未充分利用RL开启的推理能力;(3) 部署的商品目录索引了数十亿非语义ID,超出基础LLM的词汇表。本文提出GR2,一个端到端框架,结合了:(i) 在语义ID上的中间训练;(ii) 从强教师模型通过定向提示和拒绝采样蒸馏出的推理轨迹;(iii) 面向重排序的RL可验证奖励。此外还引入了上下文压缩器、在线策略蒸馏来解决工业规模下的SFT坍塌问题。GR2在工业规模流量上相比传统基线提升了18.7%的R@1。研究发现,奖励设计在重排序中至关重要——LLM通过保留输入顺序或利用位置偏差来”作弊”,因此条件化可验证奖励是工业级必要组件。

点评: 这项来自业界的工作直面LLM在推荐系统落地中的”最后一公里”问题,对奖励设计中”作弊”行为的揭示尤为深刻。


8. 基于知识驱动的LLM智能体的自主容错控制教程

作者: Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz | 分类: eess.SY, cs.AI, cs.MA 链接: arxiv.org/abs/2606.31635v1

化工厂故障恢复仍然严重依赖操作员,尤其是当故障超出预定义的监督逻辑时。操作员需要解释警报、操作流程、P&ID图、联锁装置和过程趋势,然后决定如何在不触发停机的情况下将工厂切换到安全运行模式。本文研究了LLM智能体如何支持此类恢复决策。提出的框架将LLM视为一个受约束的监督规划器,使用工厂特定知识提出恢复行动,每个提案在执行前都会由外部验证器(符号或基于仿真)检查。本文开发了三个设计维度:LLM智能体适用的恢复模式;区分可接受与不可接受提案的验证策略;以及延迟、知识工程、安全集成和模型生命周期管理带来的部署约束。为便于使用,提供了两个可执行的Python环境,实现了模块化混合模块和连续搅拌釜反应器两个经典案例,并扩展了可配置故障和自定义恢复/验证方法接口。

点评: 在工业4.0背景下,这篇论文为LLM在工业控制中的安全落地提供了极具操作性的框架和验证方法论,尤其”外部验证器”的设计原则值得所有关键领域的LLM部署借鉴。


本内容由 AI 辅助生成,论文信息来源于 arXiv。