LLM校准、智能体早停与多模态安全评测
今日精选 8 篇 AI/ML 论文,涵盖LG, CL, CV, AI, MA, RO, stat.ML, CR, DC等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖模型校准、角色扮演智能体、语义早停机制、有害视频理解基准、物理驱动的运动生成、序列概率与正确性关系、MCP工具投毒攻击以及分布式强化学习训练优化。
1. 你到底有多确定?改进医学视觉问答中的口头表达校准
作者: Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman | 分类: cs.LG, cs.CL, cs.CV 链接: arxiv.org/abs/2606.27023v1
应用于医学视觉问答(VQA)的多模态大语言模型(MLLM)无论实际正确与否,往往都会产生过度自信的输出。而现有的口头表达置信度校准方法——主要针对纯文本LLM开发——并未考虑医学图像理解的多模态特性。本文提出了一种基于训练框架的方法,通过组合损失函数微调MLLM以改进其校准。该损失函数结合了Brier风格校准项、防止置信度坍缩至极端值的锚定正则化项、对比图文对齐项以及基于KL的模型稳定化项。对齐信号来源于一个2×2因子化扰动设计,该设计交叉了图像存在性与文本完整性,以探测模型对视觉模态输入与语言先验的依赖程度。最后,使用Top-K KL散度正则化器来保护模型在微调过程中的回答能力。在三个医学VQA基准和两种架构(MedGemma 4B IT和Qwen2 VL 7B Instruct)上,我们的方法将校准误差降低了60%以上,判别能力提升了26%以上,同时保持了预测准确性。在所有基准测试中,该技术的平均表现优于基于提示、基于采样和基于训练的方法,且消融实验证实损失函数的每个组件对于改进校准都是必要的。所有实验代码均已公开。
点评: 针对医学VQA中MLLM过度自信的顽疾,提供了一个系统性的多组件校准框架,在三个基准上校准误差降低60%以上,对医疗领域AI的可靠性落地意义重大。
2. 通过心理学驱动的推理与角色感知策略优化改进通用角色扮演智能体
作者: Zhenhua Xu, Dongsheng Chen, Jian Li, Yitong Lin, Zhebo Wang et al. | 分类: cs.CL 链接: arxiv.org/abs/2606.27025v1
构建能从自然语言描述中忠实扮演任何角色的通用角色扮演智能体仍然具有挑战性。当前主导范式——监督式微调——鼓励行为模仿,却缺乏深度的、类人的内部思考过程,导致跨分布泛化能力差。因此,我们提出Psy-CoT,一个基于心理学的思维链框架,它将响应前的推理分解为三个特定于角色的步骤——交互感知、心理共情和逻辑构建——使模型能够从角色描述中进行动态思考,而不仅仅是模仿表面模式。虽然结构化推理提供了基础,但仅此还不够;需要强化学习来进一步对齐模型与角色保真度。然而,我们观察到,在LLM奖励模型下,无论是欺骗奖励模型的通用短语还是真正角色特定的短语,都会收到相同的梯度信号——这种欺骗在训练过程中累积,误导模型将两者视为同等最优选择。为解决此问题,我们提出角色感知策略优化(RAPO),它利用角色描述-令牌互信息来不对称地加权梯度——在正向优势下放大角色特定令牌,在负向优势下减弱它们。在CoSER、CharacterBench和CharacterEval上的实验表明,Psy-CoT优于现有角色扮演CoT方法,且RAPO在多个模型规模上持续超越GRPO。
点评: 将心理学理论引入角色扮演智能体的推理过程,并创新性地通过互信息区分角色特定与通用表达,有效解决了强化学习中奖励模型被”欺骗”的痛点。
3. 迭代式LLM智能体循环的语义早停机制
作者: Sahil Shrivastava | 分类: cs.AI, cs.LG, cs.MA 链接: arxiv.org/abs/2606.27009v1
多智能体大语言模型(LLM)循环——例如,一个写作智能体执笔,一个评论智能体修改——几乎总是由固定的迭代次数上限终止。这是一个语法层面的”终止开关”:它无法感知答案是否仍在改进,因此在简单输入上浪费令牌,在困难问题上过早截断。我们研究语义早停:当连续草稿的嵌入在语义上停止变化(余弦距离配合耐心窗口)且答案的测量质量停止提升时,循环终止。我们的工作有三项贡献。首先,一个严谨的理论基础:我们证明确定性终止和良好的定义性并通过机器验证,同时将距离序列的收敛性作为经验测试的猜想而非(先前被过度宣称的)巴拿赫压缩。其次,一个评估者高效的评估协议:我们为每个问题生成完整轨迹一次,在相同的草稿上回放每个早停策略,并缓存每次LLM评估调用,从而以低成本实现严格的配对效率与质量比较;我们进一步将操作令牌(计入策略成本)与评估令牌(作为测量工具)分离。第三,基于多跳检索增强问答(HotpotQA)的实证研究。在60个问题的测试集上,免评估者的语义早停器在质量相当的情况下(Delta-IS = -0.004, p = 0.81)相对于固定迭代上限减少操作令牌38%,而完整质量门控变体则适得其反,因为其每轮评估主导了成本。一个选择最佳轮次的神谕策略在所有实用策略中获得了+0.115的信息评分提升(p ~ 4e-11),将问题从”何时停止”(容易)重新定义为”哪个轮次最佳”(待解决)。
点评: 对LLM多智能体循环的”语义早停”进行了理论分析和工程优化,揭示了一个反直觉发现:加入质量评估的早停反而因评估成本过高而得不偿失。
4. HarmVideoBench:大多模态模型中有害视频理解的基准测试
作者: Jiajun Wu, Haoyu Kang, Yining Sun, Jiacheng Hou, Heng Zhang et al. | 分类: cs.CV, cs.CL 链接: arxiv.org/abs/2606.27187v1
大规模视觉语言模型(LVLM)近期在自动内容审核方面展现出巨大潜力,激起了对开发有害视频基准测试的日益增长的兴趣。然而,我们识别出现有工作的两个主要局限:1)忽略了有害视频的多层次特征。现有基准主要将评估构建为二分类任务,未能捕捉到隐式或深层语境危害。2)完全缺失解释性理由。当前框架仅衡量模型是否正确标记了视频,而非解释为什么,将评估变成了一个”黑箱”,模型可以通过肤浅的捷径成功。为解决这些问题,我们提出HarmVideoBench,一个多层次诊断基准,包含1,379个视频和4,137道多项选择题。HarmVideoBench基准测试三个层次维度:可观察证据、片段内部含义和片段外推理,旨在通过精心平衡和策划的样本评估模型超越表面线索的深层理解。我们在HarmVideoBench上评估了19个领先模型,以评估其对有害视频的多维理解。此外,我们引入BCR,一种与基准对齐的方法,它预测推理边界并仅在需要时动态检索上下文。实验结果表明,BCR显著提升了基础模型在有害视频理解上的性能,将宏平均从61.7%提升至达到84.4%的当前最佳水平。
点评: 突破了有害视频检测”是/否”的简单分类范式,引入了多层语义理解和解释性要求,并提出了动态上下文检索方法,对内容审核的深度化演进具有关键价值。
5. 上下文模型预测式生成:从语言模型到物理驱动的开放词汇运动合成
作者: Xiaomeng Fu, Junfan Lin, Yang Liu, Yaowei Wang, Guanbin Li et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2606.26981v1
从文本描述合成人类运动对于沉浸式数字应用至关重要,然而现有方法在语义保真度和物理真实性之间面临着持续的权衡。基于大语言模型(LLM)的方法可以解释多样化的开放词汇指令并组合高层动作计划,但它们经常生成违反物理约束的运动。物理感知模型通过仿真或控制提高了真实感,但难以应对语义复杂性、精细指令和新颖概念。为解决这一差距,我们提出上下文模型预测式生成(ICMPG),一个将语言模型规划与推理时物理反馈集成的框架。ICMPG将运动合成重构为类似模型预测控制(MPC)的过程,包含两个模块。上下文感知运动生成(CAMG)模块使用LLM作为规划器来分解文本命令并从运动令牌中生成候选运动序列。模型预测生成(MPG)模块通过物理仿真和语义对齐评估这些候选,估算复合奖励,并选择最佳序列以指导后续生成步骤。与开环生成不同,这种闭环优化使ICMPG无需任务特定的策略重训练即可使运动适应输入语义和仿真物理环境。在标准与零样本开放词汇设置下的广泛实验表明,ICMPG能够稳健地泛化至多样化的指令,并在所评估的基准测试中生成比代表性基线更具物理合理性和语义忠实性的运动。该框架连接了语义解释与物理仿真,同时保持足够的灵活性以集成不同的LLM骨干,实现了更通用、可控的文本驱动运动合成。
点评: 将LLM的高层规划能力与MPC式的物理仿真反馈有机结合,有效弥合了文本驱动运动合成中”语义丰富但物理不真”与”物理真实但语义贫乏”之间的鸿沟。
6. 什么情况下高概率答案是正确的?论LLM中序列概率与正确性
作者: Johannes Zenn, Jonas Geiping | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2606.27359v1
大语言模型的许多解码方法可以被理解为实现概率质量向模型更可能输出的方向转移——无论是在令牌级别的局部层面,还是在序列级别的全局层面。因此,它们的成功依赖于一个基本问题:序列概率——即给定提示后一个连续文本的条件概率——何时真正与正确性对齐?在本文中,我们着手在四个层面量化这种关系,涵盖不同解码方法、不同方法内的超参数、数据集内不同提示-答案对,以及同一提示的多次响应。我们发现,在固定数据集内,更高的序列概率通常能预测跨提示-答案对的正确性。然而,这种关系一般无法推广到解码决策:通过改变超参数或方法增加序列概率并不能可靠地提升准确性。此外,对于同一提示的多次响应,序列概率并不是正确性的良好指标。这些发现厘清了何时解码可以且何时不能期望提升正确性,并为解码、自一致性以及免验证器的自我改进提供了实践指导。
点评: 系统性地揭示了”序列概率高≠答案正确”这一反直觉现象的关键边界条件,对构建可靠的LLM解码策略和自改进方法具有基础性指导意义。
7. ShareLock:针对MCP的隐蔽多工具阈值投毒攻击
作者: Liwei Liu, Tianzhu Han, Zijian Liu, Zishu Dong, Na Ruan | 分类: cs.CR, cs.AI 链接: arxiv.org/abs/2606.27027v1
随着LLM驱动智能体的快速发展,模型上下文协议(MCP)——一种连接LLM与外部工具的开放协议——已迅速成为现代智能体生态系统的基石。然而,MCP的广泛采用也引入了新的安全问题,例如工具投毒攻击(TPA),其利用LLM-服务器交互注入恶意提示。现有的投毒方案通常采用单一的明文嵌入范式,无法抵御人工检查或自动化检测器。当前研究仍缺乏对多工具投毒的系统性分析——其中多个工具可以被协同利用以分散检测风险。在本文中,我们介绍ShareLock,一个多工具阈值投毒框架,它利用Shamir阈值方案确保卓越的隐蔽性和容错性。ShareLock将恶意指令作为看似无害的秘密份额分发到多个工具描述中,实现了信息论安全性和针对适度审计的攻击鲁棒性。在服务器更新期间植入隐蔽的重构触发器后,聚合的份额重构出隐藏指令,导致系统资产或私有数据的严重泄露。为评估ShareLock的现实威胁,我们构建了一个涵盖四个多工具场景的综合基准,并在两个不同的MCP客户端上对主流LLM进行了广泛实验。结果表明,ShareLock在基于工具描述的检测方面显著优于现有的单工具投毒策略,同时保持了超过90%的平均攻击成功率。
点评: 针对新兴的MCP智能体生态系统,首次提出了基于秘密共享的多工具协同投毒攻击,展示了极高的隐蔽性和攻击成功率,对智能体安全防护提出了严峻挑战。
8. RolloutPipe:在解耦的同策略LLM强化学习中重叠流水线化Rollout与训练
作者: Rongjian Chen, Jianmin Hu, Kejiang Ye, Minxian Xu | 分类: cs.DC, cs.LG 链接: arxiv.org/abs/2606.26997v1
大语言模型(LLM)的推理后训练越来越依赖于使用可验证奖励的强化学习(RLVR),模型从数学、逻辑和科学任务的地面真实反馈中学习。为实现灵活的资源分配并支持异构训练设置,现代RLVR系统采用解耦架构,将rollout生成和策略训练分离到独立的GPU池中。然而,现有同步同策略GRPO(Group Relative Policy Optimization)RLVR系统在启动训练之前完成整个rollout,导致rollout进行时训练器GPU池闲置。异步RL流水线重叠两个阶段,但代价是使用过时数据进行训练。为应对这些挑战,我们提出RolloutPipe,一个针对解耦RLVR系统的后训练框架,它将固定权重的rollout转变为完整组流水线,其中可训练组在后续组仍在生成时就转移到训练器。RolloutPipe通过两种技术实现这一点:完整组流水线化(CGP)和前缘组调度(FGD)。CGP在每个可训练的完整组一旦完成时立即将其按FIFO顺序调度到训练器,而FGD是Rollout节点上的准入策略,优先接纳形成下一个训练批次所需的前缘组的请求,从而使训练器就绪组更早、更稳定地到达。该设计在rollout完成之前启动训练,同时保持同策略正确性。在Qwen3-1.7B上对四个推理和科学基准以及十二种rollout设置的评估表明,与最先进的rollout和训练系统Slime相比,RolloutPipe将rollout到训练结束时间缩短了30.7%-42.3%,并将训练器等待比率降低了37%-76%。
点评: 针对同策略RLVR系统中计算效率低下的核心痛点,通过精细化的组级别流水线调度实现了rollout与训练的无损重叠,在保持策略正确性的同时大幅缩短了训练时间。
本内容由 AI 辅助生成,论文信息来源于 arXiv。