多模态推理、量子纠错与无人机控制:LLM记忆与工具检索新突破
今日精选 8 篇 AI/ML 论文,涵盖AI, CL, LG, IR, CV, RO, eess.SY, SE, MA, quant-ph, eess.AS, SD等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多模态推理、工具检索、智能体记忆管理、量子纠错与无人机控制等多个前沿方向。
1. ClinPRISM:面向不规则临床时间序列问答的经济型多模态LLM推理框架
作者: Frank Nie, Ethan B Liu, Yuan Zhu, Wei Fan, Jindong Han | 分类: cs.AI, cs.CL 链接: arxiv.org/abs/2607.25947v1
在不规则临床时间序列上执行问答任务对医疗应用至关重要。尽管近期多模态时序大语言模型在通用时序问答中展现了潜力,但在处理临床观测数据的稀疏性、异步性和不规则采样模式方面仍然不足。为此,本文提出 ClinPRISM,一种经济高效的多模态LLM推理框架。首先设计了一种”不规则感知的多尺度编码器”,用于在不同时间尺度上捕获稀疏的临床证据;接着提出”时间证据蒸馏器”来整合多尺度表征并压缩为少量LLM兼容的token;此外还引入了渐进式对齐策略。研究构建了3万组配对多尺度描述的临床时间序列,以及横跨11项任务的4.1万条指令微调实例。基于40亿参数的LLM骨干,ClinPRISM在保留的评估基准上达到最先进水平,仅使用16个时序token,单问题推理延迟平均为0.15秒。
点评: 在临床时序分析这一高价值场景中,ClinPRISM以极低的token开销和推理延迟取得了SOTA性能,为医疗AI的落地部署提供了切实可行的技术路径。
2. HYSET:面向LLM智能体的集合级工具检索——基于查询条件的超边预测
作者: Xinyi Hong, Pinjun Dong, Xinyang Yu, Binyan Jiang | 分类: cs.LG, cs.AI, cs.IR 链接: arxiv.org/abs/2607.25718v1
大语言模型智能体在执行真实任务时越来越依赖调用外部工具。工具检索作为智能体流程中的关键组件,需要从数千个工具库中选择与任务相关的小子集。然而,现有检索器要么孤立地对每个工具打分,要么逐个顺序组装工具集,从未将候选集的联合效用作为一个整体来评估。本文提出 HYSET(基于超边的集合级工具检索),贡献有三:(1)将工具检索形式化为工具共调超图上的查询条件超边预测问题,使工具集本身成为评分单元;(2)通过基数特异性交互捕获与集合大小相关的工具兼容性;(3)将HYSET设计为无需修改下游智能体的预选模块。在ToolBench上的实验表明,HYSET在工具检索性能和端到端任务成功率上均持续优于最先进基线,并支持零样本/少样本迁移。
点评: 打破了传统”孤立打分”或”顺序组装”的工具检索范式,从集合级视角评估工具组合的协同效用,对提升LLM智能体的任务执行效率具有重要价值。
3. UniMem:面向无边界任务流的互补式情景-参数化记忆
作者: Siyu Xia, Chenheng Zhang, Yanting Wu, Haoxuan Li, Jiajun Chai et al. | 分类: cs.CL 链接: arxiv.org/abs/2607.26017v1
记忆对于LLM智能体积累任务经验和复用执行策略至关重要。然而,在无边界且不断演化的任务流中部署时,会出现经典的”稳定性-可塑性困境”:基于外部检索的记忆能够快速吸收新证据但难以内化重复模式且带来推理时开销;参数化记忆一旦学习便能稳定高效执行,但通常依赖显式的任务边界和固定参数预算。受人类大脑通过互补的情景存储和渐进巩固来平衡可塑性与稳定性的启发,本文提出UniMem,一种自主记忆管理的自路由框架。UniMem使用可学习的路由token作为记忆控制器,实现互补记忆通路间的自适应协调:新任务或稀疏任务保留在情景缓冲中通过检索增强执行,重复出现的稳定模式则被巩固到可扩展的参数化记忆中。实验表明,UniMem在长周期流式任务序列上持续优于基线,跨三个骨干模型平均提升4.0个精确匹配分数。
点评: 借鉴人脑的记忆巩固机制,解决了LLM智能体在长期部署中”记不住新知识”和”学不会重复模式”的痛点,为自主智能体的记忆管理提供了新思路。
4. PRISM-AH:面向视频级矛盾与犹豫识别的知识引导多模态交互流推理
作者: Podakanti Satyajith Chary, Barath Parthiban, Pranesh Velmurugan, Adeeba Khan, Nagarajan Ganapathy | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.25961v1
矛盾心理和犹豫(A/H)是导致健康行为改变延迟或放弃的前驱情感状态。在视频层面识别A/H非常困难,因为信号源于面部、声音、语言和肢体等模态之间及内部的不一致性,且因人而异。本文提出PRISM-AH(面向多模态矛盾/犹豫识别的交互流预测推理框架),将A/H视为随时间展开的多模态冲突。冻结的视觉、音频和文本编码器对齐到短时间窗口后送入轻量级流模型,该模型对跨模态不协调性进行评分、预测下一窗口以产生”犹豫意外”信号、发现行为原型,并以参与者元数据为条件。密集的窗口级标注作为辅助目标监督模型,决策阈值针对宏F1进行校准。最终知识引导的大语言模型利用数据集中的专家线索分类法对结构化证据进行推理,仅在验证性能提升时才进行后期融合。在525个视频的标注公开测试集上,PRISM-AH达到0.6133的宏F1,而零样本基线仅为0.2827。
点评: 从多模态冲突的角度建模高度抽象的人类情感状态,结合流模型与知识引导推理,显著超越了零样本基线,为情感计算领域的细粒度识别提供了新范式。
5. 面向四旋翼无人机控制的物理感知端到端深度强化学习方法
作者: Ya-Chia Shen, Woei-Leong Chan | 分类: cs.RO, cs.LG, eess.SY 链接: arxiv.org/abs/2607.25985v1
无人机(特别是四旋翼)因其欠驱动动力学特性——仅有的四个控制输入必须调控六个自由度——对自主控制构成独特挑战。本文研究了一种物理感知的端到端深度强化学习方法,直接作用于低层级体输入(总推力和身体扭矩),并通过高保真Simulink环境形成闭环。该模拟器集成了12状态刚体模型,包含基于Moore-Penrose伪逆的Action2RPM分配和每台电机的一阶执行器动力学,以及转子陀螺耦合效应。在推力悬停和俯仰扭矩悬停两种场景下评估了DDPG、TD3、PPO和SAC四种算法的表现,结果显示SAC和TD3在稳定性和探索效率上表现优异,而PPO样本效率较低。
点评: 在无人机控制这一关键工程领域,系统性地验证了物理建模、执行器动力学与DRL算法的交互影响,为可靠的无人机自主控制提供了可复现的基准。
6. KQFuzz:基于大语言模型的知识引导量子库模糊测试
作者: Fuyuan Xia, Qixin Zhang, Chenhao Ying, Haojin Zhu, Shuai Wang et al. | 分类: cs.SE, cs.AI, cs.MA, quant-ph 链接: arxiv.org/abs/2607.25647v1
随着量子计算的持续进步,确保量子库的可靠性和正确性变得愈加关键。已有基于LLM的量子库模糊测试方法被提出来发现潜在漏洞,但仍存在灵活性不足和效率低下的问题。本文提出KQFuzz,一种新颖的知识引导量子库模糊测试器。它利用全面的代码库知识来指导LLM生成测试用例,结合适应度引导评估和双层变异策略来探索复杂执行路径并触发潜在漏洞。KQFuzz首先引入专为量子程序设计的提示方案,策略性地纳入代码库知识以高效生成高质量量子种子程序;同时开发了评估和变异策略来处理生成的种子程序,在提高模糊测试效率的同时丰富测试用例多样性。在Qiskit、PennyLane和Cirq三个流行量子库上的实验表明,KQFuzz显著优于现有方法,覆盖率最高提升18.44%。在开发过程中发现了13个漏洞,全部已确认,其中12个已被开发者修复。
点评: 将LLM与量子软件测试相结合,在量子计算软件的可靠性保障方面取得了实质性进展,发现的实际漏洞数量和修复率颇具说服力。
7. 基于域自适应的声学场景分类设备不变性研究
作者: Abhishek dileep, Shubham Sharma, Padmanabhan Rajan | 分类: eess.AS, cs.AI, cs.SD 链接: arxiv.org/abs/2607.25887v1
本文探究了基于卷积神经网络和基于Transformer的特征表示在声学场景分类中应用域自适应技术的有效性。评估了域对抗神经网络(DANN)和条件域对抗网络(CDAN)两种主流域自适应方法在不同域偏移下的表现。研究表明,DANN在两种特征提取器上均能提供较为一致的域自适应效果,而CDAN仅在CNN特征提取器下表现有效。该研究揭示了域自适应方法需要根据底层特征表示进行针对性调整的规律。基于DCASE 2020数据集的多设备实验支持了上述结论。
点评: 虽然看似聚焦声学场景分类,但其关于不同特征表示下域自适应方法表现差异的系统性发现,对多设备、跨域迁移学习的通用方法论具有参考价值。
8. OmniQEC:AI科学家发现实用量子纠错码
作者: Ge Yan, Shanchuan Li, Pengyue Ma, Qixin Zhang, Pingchuan Ma et al. | 分类: quant-ph, cs.AI, cs.MA 链接: arxiv.org/abs/2607.25865v1
量子纠错是构建可扩展容错量子计算不可或缺的环节。然而,发现始终有效的QEC码极具挑战性,因为逻辑性能取决于码结构、硬件、症候提取和解码之间的交互,这些往往相互制约。本文提出OmniQEC,一种高效的AI科学家,专为发现适合在现代量子处理器上部署的QEC码而设计。OmniQEC将QEC设计表述为一个迭代发现过程,由高级大语言模型实现的编排器协调代码生成、代码级筛选、症候提取综合和基于解码器的电路评估。其核心结合了自演化推理机制与快慢协同工作流:快速循环使用低成本编码级代理探索候选码,慢速循环则执行物理接地电路级评估并将结果反馈到搜索中。在四个qLDPC构建家族上的实验表明,发现的码在逻辑错误抑制方面持续改进,且在98和240物理量子比特预算下分别超越了相应的BB码。
点评: 将LLM与物理信息驱动的码-电路-解码器协同设计相结合,展示了AI在加速量子纠错码发现这项极具挑战性任务上的巨大潜力,有望推动容错量子计算的实用化进程。
本内容由 AI 辅助生成,论文信息来源于 arXiv。