推理痕迹窃取、具身智能安全与多模态深度伪造检测

精选 8 篇 AI/ML 论文,涵盖AI, CL, CY, GT, LG, CV, RO, CR, IR, SD等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖大模型 Theory of Mind 推理、强化学习参数空间探索、LLM 语用攻击面、神经元分割多智能体系统、机器人自主性验证层、专有模型推理痕迹窃取攻击、医学重排模型对比研究及音视频深伪检测基准。


1. Avalon-ToM-Bench:通过非对称博弈机制评估细粒度心智理论

作者: Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen | 分类: cs.AI, cs.CL, cs.CY, cs.GT 链接: arxiv.org/abs/2608.09638v1

心智理论(ToM)对于智能体交互至关重要,然而现有评估要么依赖过度简化心理状态推理的静态场景,要么提供的诊断性见解有限。我们提出了 Avalon-ToM-Bench,这是一个通过《抵抗:阿瓦隆》的非对称信息机制来操作化 ToM 的细粒度基准。它不是评估端到端的游戏玩法,而是将 ToM 分解为一个 2×2 的分类法——认识论与动机推理分别与推断和行动交叉——使用人工构造、视角约束的查询。对 28 个 LLM 的基准测试揭示了三个洞见:1)推理而非知识:模型表现出较强的游戏规则理解力,但 ToM 能力明显较弱,将失败隔离在社会推理而非领域知识缺失上。2)表达而非表征:通过线性探针和激活引导的机制分析表明,模型经常在隐藏状态中表征了正确的心理状态推断,但在生成过程中未能表达——线性探针恢复了 77-82% 的准确率,而模型自身的思维链只有 62-70%。3)策略而非深思:专门的推理训练产生了显著的改进,而测试时的思维链仅带来边际收益(平均+11.0对+1.1分),这表明稳健的 ToM 依赖于习得的推理策略,而非增加推理时的深思熟虑。

点评: 该基准通过游戏机制将 ToM 评估从静态问答推向动态交互,且“表征正确却表达失败”的发现对对齐与解码策略有重要启示。


2. 通过变分学习进行 RLVR 的参数探索

作者: Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych | 分类: cs.LG, cs.AI, cs.CL 链接: arxiv.org/abs/2608.09805v1

探索一直是强化学习研究的焦点。最近,越来越多的证据表明它也是 LLM 强化学习配方中的重要成分,能显著影响下游性能。许多现有方法在动作空间中控制探索,例如使用温度缩放。然而,这些方法无法重新排列词元,只能影响输出分布的方差。这限制了探索,并可能导致发散或训练停滞。在此,我们研究参数空间探索,其中 rollout 通过从后验中采样不同的策略生成,每个策略可能探索不同的 rollout。采样多样性较低或较高的策略则是探索的互补控制杠杆。我们引入了一系列方法,称为扰动参数策略优化(3PO),它使用不同的采样策略和不同的 rollout 分组进行奖励估计。在 OLMo-3-1025-7B 和 Qwen2.5-Math-7B 上的数学推理和代码生成任务实验表明,这些方法在几乎相同的 FLOPs 成本下,持续优于标准 GRPO 的平均下游性能。此外,使用多个参数样本在训练期间始终比 GRPO 和动作空间基线产生更少的零优势组和畸形或错误的 rollout。总的来说,我们的工作证明参数空间探索可以改进 LLM 的强化学习。

点评: 跳出动作空间,从参数后验采样的角度解决 LLM RL 探索瓶颈,为提升 RLVR 稳定性和最终性能提供了新的控制杠杆。


3. 语用攻击面:大语言模型中隐式上下文的脆弱性

作者: Bocheng Chen, Han Zi, Roucheng Ou, Yawei Liu, Minyue Chen et al. | 分类: cs.CL 链接: arxiv.org/abs/2608.09551v1

在大型语言模型(LLM)时代,攻击者经常操纵自然语言以引出不安全或有害的输出,这创造了 LLM 系统独有的新自然语言攻击面,攻击直接利用用户提示中的显式语言线索来绕过 LLM 的安全机制。然而,此类攻击通常可以通过现有的安全对齐算法来缓解。另一方面,人类语言本质上基于语用学,需要典型语境来解释语言,例如世界知识、社会规范。然而,这类语境通常是隐式的,因为它们没有在人类语言中直接表达,并且在安全对齐中没有被充分利用,这在人类语言解释和安全对齐方法之间造成了根本性的错配。在本文中,我们证明了这种错配暴露了 LLM 的脆弱性。我们将此漏洞称为语用攻击面,它可被利用来实现高攻击成功率。实验结果表明,我们提出的方法在各种开源和闭源模型上的性能大幅优于基线攻击方法。

点评: 揭示了安全对齐中“显式对齐、隐式盲区”的根本缺陷,提示未来的对齐研究需纳入语用层面的推理能力。


4. NeuroRefiner:用于 3D 荧光显微镜神经元分割的形态学感知多智能体细化

作者: Haiyang Yan, Jinyue Guo, Yanchao Zhang, Bingqing Wang, Zhenchen Li et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2608.09636v1

荧光显微镜中准确的 3D 神经元分割对神经科学至关重要。然而,神经元稀疏且细长的形态对现有分割方法构成了重大挑战。这些方法难以同时保留局部细节和全局拓扑,导致分割结果碎片化。为了解决这个问题,我们提出了 NeuroRefiner,一个多智能体系统,它形式化了涉及迭代全局观察和局部编辑的人类专家工作流程。具体来说,NeuroRefiner 包含三个协作智能体,分别负责诊断拓扑错误、生成修正指令和验证细化质量。为了促进智能体指令引导的分割细化,我们提出了 TopoRefineNet,一种专用的基于 3D U-Net 的工具,利用跨模态特征融合生成细化掩码。通过多轮智能体推理和体素级编辑,NeuroRefiner 产生了拓扑更准确且可解释性更强的分割结果。在 BigNeuron、CWMBS 和 ZBFWB 数据集上的实验表明,NeuroRefiner 优于最先进的方法,特别是在具有挑战性的 ZBFWB 数据集上 F1 分数提高了 3.02%。

点评: 将人类专家“观察-编辑-验证”的工作流转化为多智能体协作,有效解决了神经科学图像分割中的长尾拓扑错误。


5. Agentic Harnesses:面向机器人自主性的 LLM 驱动验证层

作者: Rohan Bhagra, Mahantesh Halapannavar, Uddhav Bhattarai | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2608.09857v1

先进人工智能工具的发展推动了机器人自主性的研究,但此类系统的开发主要集中在执行层面,而非验证规划模型提出的动作可行性。与通用 LLM 一样,机器人规划模型也存在风险:偏向于用户指定的目标,可能提出与科学伦理不一致的动作;由于无法“记住”先前的安全风险而可能不安全;或者容易受到针对自主生态系统的对抗性攻击。我们提出了一个位于规划与执行之间的 LLM 驱动验证层,用于评估动作的许可性。我们的 LLM-as-a-Judge 集成结合了跨模型的思维链推理,并综合了这些专家裁判的输出,类似于专家混合与自洽性方法的结合。该层作为中间件,在计划从服务器的规划模块到达 MCP 服务器,进而到达机器人的底层控制之前对其进行门控:计划被批准、被拒绝以重新表述,或被升级以供人工审查。通过该系统,我们在接受/升级/拒绝类别中实现了接近 85% 的精确率,对抗性攻击的遏制率达到 97%,在接受和拒绝任务之间的错误可忽略不计,错误主要出现在升级边界。

点评: 为机器人系统补上了关键的“安全刹车”,用多模型评审机制在规划与执行间建立可信的决策防火墙。


6. 窃取专有 LLM API 的推理痕迹

作者: Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer et al. | 分类: cs.CR, cs.AI, cs.LG 链接: arxiv.org/abs/2608.09867v1

领先的大语言模型提供商现在隐藏其模型的逐步推理(即思维链),以保护知识产权并限制信息泄露。提供商并非在服务器端存储这些痕迹,而是将它们作为加密文本块返回给客户端,客户端在每次后续请求中将其传回。基于先前的研究,我们识别出一个架构性漏洞:这些加密块在提供商的生态系统内跨会话、用户和模型完全兼容且可互换。我们利用这种兼容性开发了一种可扩展的解密越狱方法。通过将来自给定模型的加密推理痕迹注入同一提供商较弱的、防护较少的模型中,我们迫使其解码并逐字输出明文痕迹,而无需直接越狱功能更强的模型。此漏洞实现了四种不同的攻击向量。首先,它绕过了抗蒸馏机制,允许对手提取专有模型的推理过程,我们在 Anthropic、OpenAI 和 Google 上进行了演示。其次,它允许大规模私人数据提取。开发人员经常公开共享会话日志,却不知道加密块的内容。通过解码从公共仓库抓取的 315,320 个推理块,我们恢复了 367 个个人身份信息(PII)工件和 182 个凭证。第三,即使在模型的最终可见输出安全地拒绝了恶意请求的情况下,它也会无意中揭示推理过程中隐藏的危险信息。第四,攻击者可以利用此缺陷执行隐形提示注入,将恶意负载完全嵌入加密块中,以污染公共智能体 rollout。在负责任地披露之后,我们提出了具体的密码学和系统级缓解措施,以保护客户端推理。

点评: 该研究揭示了一个影响多家头部 AI 厂商的通用加密设计缺陷,将推理痕迹窃取从理论变为可规模化执行的现实威胁。


7. 列表式交叉编码器微调与智能体指令调优对 LLM 重排器的系统研究:以医学程序重排为例

作者: Matan Fainzilber, Shlomit Plavner | 分类: cs.IR, cs.CL 链接: arxiv.org/abs/2608.09650v1

针对患者查询重排医学程序是健康保险信息检索的关键组成部分,但患者语言与临床术语之间存在显著的词汇鸿沟。我们对该生产任务中的两种重排范式进行了系统比较:(1)使用列表式学习排序目标在各种层冻结配置下微调的小型交叉编码器(MedCPT, MiniLM-L12);(2)Qwen3-Reranker-4B,一个 4B 参数的指令重排器,其提示词通过由 GPT-4.1 驱动的智能体优化循环进行迭代优化。在一个包含 708 项保险服务的 2,647 个查询的专业数据集上,我们发现一个 109M 参数的交叉编码器使用 ListNet 微调后,在 NDCG@3 上比 4B 参数模型高出 2.6 个百分点,在 Spearman 相关系数上高出 13.3 个百分点——而参数量仅为后者的 1/37。我们报告了实际发现、一个可扩展的基于 LLM 的数据集构建流程,以及与生产重排系统相关的部署权衡。我们发布了代码和样本数据集,以支持可复现性和对其他领域的适应性。

点评: 用严谨的实验证明“小模型+精调”在垂直领域重排任务上仍可碾压大参数模型,对成本敏感的工业界极具参考价值。


8. MADBench:模态感知音频深伪检测基准

作者: Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia et al. | 分类: cs.SD, cs.AI 链接: arxiv.org/abs/2608.09593v1

语音合成和音频生成的最新进展使得高保真声学伪造变得低成本且难以溯源,促成了一种现实攻击场景,即语音和背景音频在真实视频上被独立操控。然而,现有研究要么专注于视觉操控,要么孤立地处理语音检测,要么将语音和非语音音频混为单一无差别的音频流,忽视了背景音频带来的独特取证挑战。这种混淆是有后果的:这两种声学成分源于根本不同的生成机制,表现出不同的伪影特征,并对检测系统构成不同的挑战。我们引入了 MADBench,这是第一个将语音和环境音频视为不同声学成分的基准,能够在独立操控的伪造源上对音频深伪检测进行成分感知评估。我们在统一协议下对具有代表性的最先进检测器和多模态大语言模型进行了基准测试。我们的实验揭示,环境音频操控在通用编码器上比合成语音更容易被检测到,而现有的预训练检测器在两种声学成分上都失败,且被操控的环境音频会不对称地降低语音深伪检测的性能——这些发现在先前基准的单标签范式下是完全不可见的。MADBench 为未来研究稳健的、成分感知的音频深伪检测奠定了坚实的基础。

点评: 首次将语音与背景音分离评估,揭示了深伪检测中“成分混淆”的盲区,为音视频取证提供了更精细的评测框架。


本内容由 AI 辅助生成,论文信息来源于 arXiv。