大模型推理优化、Agent 多场景博弈与机器人具身智能

今日精选 8 篇 AI/ML 论文,涵盖LG, AI, CL, CV, stat.ML, CR, RO, quant-ph等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖大模型推理优化、智能体忠诚度、脑机接口统一模型、认知偏差对代码安全的影响、机器人工具使用等前沿方向。


1. 经验增强策略优化:为大模型推理注入过往智慧

作者: Jinda Lu, Kexin Huang, Junkang Wu, Shuo Yang, Jinghan Li et al. | 分类: cs.LG 链接: arxiv.org/abs/2606.30420v1

基于可验证奖励的强化学习(RLVR)是提升大语言模型推理能力的重要范式。然而,现有RLVR方法通常从头开始进行同策略优化,导致采样成本高昂且对累积经验的利用效率低下。受限于此,本文提出经验增强策略优化方法(EAPO),利用先前经RL优化得到的策略作为动作层面的经验先验,在推理关键决策点有选择性地注入经验。为确保学习过程稳定无偏,EAPO还引入了自适应重要性采样机制。在Qwen-2.5-math 7B和Qwen-3-8B上的五个基准测试显示,EAPO的推理性能一致超越最先进的RLVR方法。

点评: 将”经验回收”提升到策略层面而非固定轨迹层面,直击RLVR采样效率低下的痛点,是实用价值极高的优化范式。


2. 你的智能体站在哪一边?多方场景下的忠诚度博弈

作者: Bojie Li, Noah Shi | 分类: cs.AI 链接: arxiv.org/abs/2606.30383v1

越来越多的LLM智能体面临多方交互场景:它既代表委托人行事,又与利益可能相左的另一方同时对话。“帮助当前对话对象”在这种情况下成为错误目标。本文研究这一多方忠诚度问题,并贡献了一套测量工具、两种机制和一个结构性教训。作者构建了PrincipalBench基准,包含75轮多轮对话与泄露探测。对13个前沿模型的评估暴露了二分局面(≤20% vs. 53.6-75.3%的损害率):存在选择性拒绝(正确拒绝对抗性探测但仍执行委托人合理请求)和过度拒绝两种集群。论文提出了提示级忠诚度框架和基于token级KL散度的蒸馏配方,但揭示了一个关键教训:两种机制都沿共同泄露/过度拒绝权衡曲线移动,无法同时优化两个维度。

点评: 精准戳中LLM agent落地中的信任核心问题,揭示了”单纯增强拒绝能力”必然牺牲可用性的本质困境。


3. 扩展地平线而非参数:35B参数Agent达到万亿参数级性能

作者: Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du et al. | 分类: cs.CL 链接: arxiv.org/abs/2606.30616v1

本文介绍Agents-A1,一个35B参数的混合专家智能体模型,通过扩展智能体的”地平线”(即长时程任务跨度)达到了万亿参数级别的性能。研究团队从两个维度探索了智能体地平线扩展:长时程轨迹扩展和异构智能体能力扩展。为此,他们构建了一套长时程知识-动作基础设施,生成了平均45K token的智能体轨迹。Agents-A1采用三阶段训练:全领域监督微调、领域级教师模型训练,以及多教师域路由同策略蒸馏。在与万亿参数模型(如Kimi-K2.6、DeepSeek-V4-pro)的对比中,Agents-A1在SEAL-0、IFBench、HiPhO等多项长时程任务上取得领先结果。

点评: “参数不是万能,任务深度才是”——这项研究颠覆了”大力出奇迹”的大模型思路,为资源受限团队提供了一条极具启发性的新路径。


4. BrainJanus:脑、视觉与语言的统一理解与生成模型

作者: Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng et al. | 分类: cs.CV, cs.LG 链接: arxiv.org/abs/2606.30319v1

建模外部感官刺激与内部神经活动之间的双向对应关系是神经科学的前沿课题。然而现有方法多将脑编码和解码当作孤立任务处理。本文提出BrainJanus,首个将大脑、视觉和语言整合在单一框架内的统一脑模型。具体而言,研究引入统一脑分词器,将连续神经动态量化为离散标记,并在共享全空间中对齐视觉和语言表征。基于此,利用All-in-One自回归架构实现任意模态间的双向生成——包括图像到大脑、文本到大脑的编码,以及大脑到图像、大脑到文本的解码。实验表明BrainJanus在多个基准任务上实现优越性能,并展现出零样本泛化能力和可解释的生物拓扑特征。

点评: 开创性地将脑机接口、视觉理解和语言模型统一到下一个token预测范式,真正践行了”one model to rule them all”的多模态整合理念。


5. 顿悟时刻的随机几何理论:大模型延迟泛化的标度律

作者: Róisín Luo, Christian Gagné, Jonas Ngnawé, Ihsan Ullah, Karyn Morrissey | 分类: stat.ML, cs.AI, cs.LG 链接: arxiv.org/abs/2606.30388v1

延迟泛化(即”顿悟”现象)指神经网络在训练早期拟合数据、但经历长时间延迟后才突然开始泛化的现象。本文首先理论上刻画了Adam优化动力学与权重收缩正则化诱导的”壳-核”拓扑结构,并得到实证验证:参数空间中,随机初始化解集中于薄球壳,包裹着记忆化解的球形壳,最内层则是泛化解的核心。利用停时理论,论文分析了该拓扑结构几何及优化轨迹逃离记忆化流形、首次到达泛化流形边界的时间,推导出学习率、批大小和L2正则化系数的顿悟标度律,并通过实验验证。

点评: 从随机几何角度为”顿悟”现象提供了严格的理论框架,将此前的零散实证观察统一到数学标度律中,理论深度极佳。


6. 言胜于码:LLM代码漏洞检测中的认知偏差研究

作者: Asif Shahriar, Hongyu Cai, Hadjer Benkraouda, Gang Wang, Z. Berkay Celik | 分类: cs.CR, cs.AI 链接: arxiv://abs/2606.30587v1

研究人员正越来越多地使用LLM进行自动化漏洞检测。最新研究表明LLM会受到影响人类判断的相同认知偏差的影响,但尚无研究探讨这些偏差是否影响模型的代码漏洞评估。本文首次系统探索了LLM代码漏洞检测中的认知偏差,构建了控制框架:固定代码仅改变上下文,触发三种偏差——光环效应(通过作者归因)、框架效应(通过任务目标和后果)和锚定效应(通过前序分析结果)。评估8个LLM在三种编程语言上的表现发现,所有模型均对此敏感:框架效应平均33.2%,锚定效应23.5%,光环效应18.4%。需语义推理的漏洞比仅需模式匹配的漏洞更易受影响。论文还演示了概念验证黑盒认知攻击,可压制多达97%的已检测漏洞。

点评: 揭示了一个令人不安的事实:LLM”读代码”的客观性可能和人类一样脆弱,提示在代码安全部署中需要高度警惕上下文操纵攻击。


7. GROW²:机器人工具使用中的”用哪个”和”用哪里”

作者: Yuhong Deng, Yuyao Liu, David Hsu | 分类: cs.RO, cs.AI, cs.CV 链接: arxiv.org/abs/2606.30632v1

如果没有刀,机器人能用盘子切蛋糕吗?工具使用极大地扩展了机器人的能力,但要创造性使用工具需要应对”开放世界可支配性定位”挑战:从开放类别中选出一个物体作为工具,并定位其具体动作区域。本文提出GROW²,利用物体零件作为自然抽象,将定位过程分层为语义和几何两个层次。语义层利用视觉语言模型的常识推理解析自然语言指令,选择合适的工具并识别相关零件;几何层利用视觉基础模型从单张RGB-D图像将所选零件定位到精确3D区域。在既有基准和真实机器人实验中,GROW²均超越最先进基线,实现零样本泛化。

点评: 将VLM的常识推理和视觉基础模型的精确几何定位巧妙结合,赋予机器人在真实世界中”物尽其用”的智能。


8. 阶段混合:通过知识蒸馏实现视觉量子强化学习

作者: Javier Lazaro, Juan-Ignacio Vazquez, Pablo Garcia-Bringas | 分类: quant-ph, cs.LG 链接: arxiv.org/abs/2606.30520v1

视觉环境对量子强化学习(QRL)构成了巨大挑战:高维观测、不稳定的RL优化和受限的变分量子线路难以联合训练。本文研究知识蒸馏作为视觉QRL的阶段混合化策略。具体方法:先训练经典视觉教师模型,冻结其编码器作为特征接口,将教师的策略行为蒸馏到紧凑的下游头中。这些头可以是经典或基于VQC的,使得小型量⼦兼容学生在相同冻结表征下得到评估。在CartPole Pixels等环境上的实验表明,阶段蒸馏使浅层VQC头能够获得非平凡视觉控制行为,且角度编码的VQC头保持了接近教师的性能。

点评: 巧妙绕开了量子计算与高维视觉输入直接耦合的困境,为量子机器学习在复杂感知任务上的应用开辟了务实路径。


本内容由 AI 辅助生成,论文信息来源于 arXiv。