置信校准、角色智能体、有害视频基准与LLM迭代优化

今日精选 8 篇 AI/ML 论文,涵盖LG, CL, CV, AI, MA, RO, stat.ML, CR, DC等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖大模型校准、角色扮演、智能体循环、视频理解、机器人控制、序列概率、安全攻击及RL训练加速等多个前沿方向。


1. 你到底有多确定?在医学视觉问答中提升口头置信度校准

作者: Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman | 分类: cs.LG, cs.CL, cs.CV 链接: arxiv.org/abs/2606.27023

多模态大语言模型在医学视觉问答中往往输出过度自信的结果,而现有的口头置信度校准方法主要面向纯文本LLM,未能考虑医学图像理解的多模态特性。本文提出一种基于训练的框架,通过复合损失函数微调MLLM以改善校准。该损失函数结合了Brier风格校准项、防止置信度极端塌缩的锚定正则化器、对比图像-文本对齐项,以及基于KL散度的模型稳定项。对齐信号来源于一个2×2因子扰动设计,交叉了图像存在性与文本完整性,用以探测模型对视觉模态输入与语言先验的依赖程度。最后,使用top-K KL散度正则化器保护模型的回答能力。在三个医学VQA基准和两种架构上,该方法将校准误差降低60%以上,判别能力提升26%以上,同时保持预测准确性,显著优于各类对比方法。

点评: 针对医学多模态模型“盲目自信”的问题给出了系统性的校准方案,实验扎实且代码开源,对医疗AI落地具有重要实用价值。

2. 基于心理学推理与角色感知策略优化的通用角色扮演智能体

作者: Zhenhua Xu, Dongsheng Chen, Jian Li, Yitong Lin, Zhebo Wang et al. | 分类: cs.CL 链接: arxiv.org/abs/2606.27025

构建能忠实扮演任意角色的通用角色扮演智能体仍具挑战性。当前主流的监督微调范式仅鼓励行为模仿而缺乏类人深度思考过程,导致分布外泛化能力差。本文提出Psy-CoT,一个基于心理学的思维链框架,将响应前推理分解为三个角色特定步骤——交互感知、心理共情和逻辑构建,使模型从角色描述中动态思考而非仅有表面模式模仿。在此基础上,进一步提出角色感知策略优化,利用角色描述-令牌互信息对梯度进行非对称加权,有效解决了LLM奖励模型下欺骗性泛化问题。实验表明该方法在多角色基准上显著优于现有方法。

点评: 将心理学理论与强化学习有机结合,从“模仿”走向“理解角色”,为构建高保真AI角色智能体开辟了新路径。

3. 迭代式LLM智能体循环的语义早停

作者: Sahil Shrivastava | 分类: cs.AI, cs.LG, cs.MA 链接: arxiv.org/abs/2606.27009

多智能体大语言模型循环(如Writer与Critic之间的迭代修订)通常靠固定迭代上限来终止,这是一种对答案是否仍在改进完全“视而不见”的语法式终止策略。本文研究语义早停:当连续草稿的嵌入向量在语义上停止变化(通过余弦距离加耐心窗口)且答案质量不再提升时终止循环。理论贡献包括证明确定性终止与良定义性。实验表明,在HotpotQA上,无裁判的语义早停器在保持同等质量下减少38%的操作令牌消耗。此外,选择最优轮次的Oracle能达到远超所有实际策略的性能,将问题重新定位为“选哪个轮次最佳”这一开放性问题。

点评: 直击多智能体循环中资源浪费的核心痛点,理论扎实且实验设计精巧,对降低推理成本有很强的指导意义。

4. HarmVideoBench:大多模态模型中的有害视频理解基准

作者: Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang et al. | 分类: cs.CV, cs.CL 链接: arxiv.org/abs/2606.27187

大型视觉语言模型在自动内容审核领域具有巨大潜力。然而,现有有害视频基准存在两大缺陷:一是忽视了有害视频的多层次特征,仅将其简化为二分类任务;二是完全缺乏解释性理由。本文提出HarmVideoBench,一个包含1379个视频配以4137个多项选择题的多层次诊断基准,从观测证据、片段内意义和跨片段推理三个层次评估模型。同时提出BCR方法,能够预测推理边界并仅在必要时动态检索上下文,将基础模型的宏平均从61.7%提升至84.4%的SOTA水平。

点评: 填补了有害视频理解领域缺乏深度评估基准的空白,多层级的设计更有助于识别模型真正的理解能力而非表面判断。

5. 上下文模型预测生成:从语言模型到物理的开放词汇运动合成

作者: Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2606.26981

从文本描述合成人体运动面临着语义保真度与物理真实感之间的持久权衡。本文提出上下文模型预测生成框架,将运动合成重构为类似模型预测控制的过程。其中上下文感知运动生成模块使用LLM作为规划器分解文本指令并生成候选运动序列,模型预测生成模块通过物理仿真和语义对齐评估候选序列,选择最佳序列指导后续生成。这种闭环优化使ICMPG能够适应输入语义和模拟物理环境,无需特定任务策略重训练,在开放词汇设置下生成更物理合理和语义忠实的人体运动。

点评: 巧妙地将LLM的语言理解能力与物理仿真相结合,解决了文本到运动生成中长期存在的语义-物理矛盾,应用前景广阔。

6. 何时高概率答案是正确的?论序列概率与LLM正确性

作者: Johannes Zenn, Jonas Geiping | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2606.27359

许多LLM解码方法可以理解为将概率质量转移到模型更有可能的输出上。本文系统量化了解码方法、模型和基准四个层面上的序列概率与正确性之间的关系。研究发现,在固定数据集内,更高序列概率通常能预测正确答案的分布。然而,这种关系并不普遍适用于解码决策:通过改变超参数或方法提高序列概率并不能可靠提升准确率。此外,对于同一提示产生的不同响应,序列概率并非正确的良好指标。这些发现为解码、自一致性和无验证器自我改进提供了实践指导。

点评: 回答了LLM领域一个基础但常被忽略的问题,结论对解码策略的选择和自我纠错机制的设计具有重要参考价值。

7. ShareLock:针对MCP的隐秘多工具阈值投毒攻击

作者: Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan | 分类: cs.CR, cs.AI 链接: arxiv.org/abs/2606.27027

随着LLM驱动智能体的迅猛发展,模型上下文协议已成为连接LLM与外部工具的关键开放协议。然而,MCP的广泛采用也引入了工具投毒攻击等新型安全威胁。本文提出ShareLock,一个多工具阈值投毒框架,利用Shamir阈值方案将恶意指令分割为看似无害的秘密共享片段分布在多个工具描述中,实现信息论级别的隐秘性和容错性。经过服务器更新时植入了隐蔽恢复触发器后,聚合并重构隐藏指令,导致系统资产或隐私数据泄露。实验表明,该方法在基于工具描述的检测中显著优于现有单工具投毒策略,攻击成功率保持90%以上。

点评: 揭示了MCP生态中的新型高级安全威胁,攻击手法的隐秘性和鲁棒性值得智能体安全防护研究者高度重视。

8. RolloutPipe:解耦化在线策略LLM强化学习中重叠流水线化的Rollout与训练

作者: Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu | 分类: cs.DC, cs.LG 链接: arxiv.org/abs/2606.26997

大型语言模型基于可验证奖励的强化学习后训练日益重要。现代RLVR系统采用解耦架构,在不同GPU池中分离rollout生成与策略训练。然而,现有同步在线策略GRPO系统需完成完整rollout后才开始训练,导致训练GPU池闲置。本文提出RolloutPipe,通过完整组流水线和前沿组调度两项技术,将固定权重rollout转换为完全流水线化流程,使可训练的组在其生成完成后立即被发送至训练器。实验表明,该方法将rollout至训练结束时间缩短30.7%-42.3%,并降低训练器等待比例37%-76%。

点评: 通过精巧的系统设计解决了RL后训练中GPU资源利用率低的核心工程问题,对大规模RL训练效率提升有直接推动作用。


本内容由 AI 辅助生成,论文信息来源于 arXiv。