多智能体协同、低位压缩与自动驾驶世界模型前沿进展
今日精选 8 篇 AI/ML 论文,涵盖LG, AI, CL, CV, stat.ML, RO, CR, NI等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖大模型压缩、幻觉缓解、数据预处理、自动驾驶、强化学习理论、具身导航、AI安全水印及无线网络优化等前沿方向。
1. BiSCo-LLM:免查表的二进制球形编码用于极限低位大语言模型压缩
作者: Yuantian Shao, Peisong Wang, Zhilei Liu, Chuangyi Li, Yuanteng Chen et al. | 分类: cs.LG 链接: arxiv.org/abs/2607.08643v1
大语言模型在部署时日益受到内存容量、权重带宽和检查点存储的限制。现有低位压缩方法主要遵循两个方向:标量或分组量化简单且兼容高效低精度内核,但当目标预算接近每权重2比特时表示能力有限;向量量化权重压缩提供更丰富的块级表示,但通常引入显式码本、索引查找和额外存储开销。本文提出 BiSCo-LLM,一个无码本的二进制球形编码框架,用于极限低位LLM权重压缩。其核心流程基于三个组件:首先,局部权重块被映射到单位超球面并二值化为紧凑的球形码,主要载荷为位打包的符号流而非显式VQ质心;其次,残差BSQ阶段编码基球形编解码器留下的重构误差,提供无需存储码本的显式率失真路径;第三,在替换每个Transformer模块类别后执行类别级恢复蒸馏,减少局部权重重构与组装模型行为之间的不匹配。一个小的8位保护通道路径用作敏感通道的辅助稳定机制,并与BSQ载荷分开统计。报告的存储预算包括二进制码、神经解码器、保护通道载荷、LoRA适配器和元数据。
点评: 通过将权重压缩问题转化为超球面二值编码,彻底摆脱了传统VQ方法的码本存储与查找开销,在极限低位场景下实现了极具竞争力的存储效率与模型性能平衡。
2. 博弈论驱动的多智能体框架缓解语言模型幻觉
作者: Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu et al. | 分类: cs.AI 链接: arxiv.org/abs/2607.08403v1
轻量级大语言模型在基于规则的科学领域的应用受到严重限制,因为它们倾向于模仿语言模式而非复现公理推理,导致频繁出现幻觉。本文展示了G-Frame,一个集成贝叶斯和团队博弈原理的自适应多智能体框架,为高质量数据合成和模型训练建立了自动化闭环。通过结构化推理强制内化领域约束,我们合成了包含363,045条思维链和199,589个问答对的专业语料库。由此产生的7B模型OmniChem在自定义基准和ChemBench上达到了与GPT 4o mini相当的性能,同时相比其基础架构幻觉减少了79.46%。我们进一步展示了OmniChem在分子设计和合成规划方面的先进能力。这项工作建立了一个利用自适应多智能体克服固有推理缺陷的可扩展范式,为加速专业科学领域的知识发现提供了可行路径。
点评: “博弈论+多智能体”为科学领域的小模型幻觉问题提供了全新的解决思路,79.46%的幻觉降低幅度令人印象深刻,证明了结构化推理闭环在数据合成中的巨大潜力。
3. UltraX:大规模自适应编程式预训练数据精炼
作者: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang et al. | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2607.08646v1
随着可用训练数据接近其物理极限,缩放定律带来的收益开始减弱。因此,改进大语言模型现在更依赖于更高质量的数据利用而非数据扩张。然而,在大规模语料库背景下,现有精炼方法在质量、效率和可靠性方面面临显著限制:基于规则的方法受限于固定启发式策略,难以处理实例级变化;基于LLM的方法提高了质量,但无法满足大规模数据处理的效率和可靠性需求。为解决这些挑战,我们提出UltraX,一个面向大规模预训练数据的函数调用精炼框架,通过引入插入操作(除删除和修改外)补全了编辑函数空间,实现了细粒度的实例级编辑。具体来说,UltraX构建了一个可靠的程序监督生成流水线:数据集自适应提示优化首先引导专家LLM生成高质量的端到端精炼文本,然后行对齐映射和动态上下文替换将原始-精炼文本对转换为结构化程序监督。同时,UltraX通过低置信度示例过滤和按操作组合的比例控制采样来提高监督质量并稳定训练分布。在推理和执行阶段,通过滑动窗口预测、全局操作聚合和系统性后处理对模型输出进行归一化和验证,提高了大规模执行的稳定性和可靠性。实验表明,UltraX在所有语料库上实现了最高的平均性能,并且在使用更少训练Token的情况下匹配或超越了基线,展示了更强的数据效率和精炼可靠性。
点评: 在“数据天花板”日益凸显的当下,UltraX通过创新的程序化自适应编辑框架,为大规模预训练数据的高质量精炼提供了一条兼顾质量、效率与可靠性的实用路径。
4. WCog-VLA:双层级世界认知视觉-语言-动作模型用于端到端自动驾驶
作者: Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.08375v1
视觉-语言-动作(VLA)模型推动了端到端自动驾驶的发展。然而,现有方法要么缺乏全面的世界认知,要么世界预见能力碎片化,本质上将模型限制在反应式驾驶。为解决这一限制,我们提出WCog-VLA,一个新颖的双层级世界认知VLA框架,成功桥接了语义级世界预测与生成式世界演化,实现了主动式自动驾驶。在语义层面,WCog-VLA通过整合3D空间感知和注入智能体Token来捕捉世界动态,同时实现博弈论思维链推理,统一了世界认知与推理。在生成层面,我们引入对齐解耦扩散Transformer作为强大的生成式世界模型,合成物理上合理的多智能体联合轨迹。通过场景表示对齐,ADDT减少了所需的去噪步数,从而显著加速推理。为促进策略推理,我们进一步构建了一个包含85,000条博弈论思考链注释的大规模数据集。在NAVSIM基准上的广泛实验表明,WCog-VLA达到了92.9的SOTA PDMS分数。
点评: 将“世界认知”与“生成式演化”双层级融合,并结合博弈论思维链,使自动驾驶从“被动反应”迈向“主动规划”,在NAVSIM上取得的SOTA成绩证明了其强大潜力。
5. 分位数分布强化学习的统计效率与推断
作者: Zijie Cheng, Yang Peng, Zhihua Zhang | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2607.08444v1
本文从统计效率的角度研究基于分位数的分布强化学习。我们聚焦于分布策略评估,其目标是刻画给定策略下的回报分布。为获得回报分布的有限维表示,我们考虑由分位数投影分布贝尔曼方程诱导的分位数不动点。假设可以访问生成模型,我们基于经验马尔可夫决策过程构建估计量。对于固定分位数数量,我们在上确界W∞度量下建立了估计量与不动点之间的非渐近误差界,显示估计误差相对于m和n的规模为Õ(√(m/n))。这意味着基于分位数的分布策略评估问题可以以样本高效方式解决,达到最优的参数量级√n收敛速率。我们推导了分位数参数的渐近分布,并刻画了半参数效率界——我们的估计量达到了该界。在分位数数量发散的情况下,我们刻画了极限协方差结构,并证明其与分布策略评估非参数模型的半参数效率界相匹配,表明基于分位数的估计量在无限维极限下仍保持渐近效率。最后,我们为平滑泛函建立了Berry-Esseen定理,从而为分位数投影回报分布泛函的统计有效推断奠定了基础。
点评: 该工作从严谨的统计学习理论出发,系统证明了分位数分布RL方法的样本效率和渐近最优性,为这一重要方向的工程实践提供了坚实的理论基础。
6. FSD-VLN:面向空中长程视觉语言导航的快慢双系统建模
作者: Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.08359v1
视觉语言导航通过将语言指令映射到实时视觉输入,使无人机能够在未知环境中自主导航。相比依赖GPS或预编程的导航,VLN支持直观的人机交互和更强的环境适应性,需要高维语义推理与低延迟飞控的紧密集成。现有方法在全局多模态理解与序列动作生成之间存在结构错位,导致空中长程导航出现抖动的轨迹和严重的决策延迟。为解决此问题,我们提出FSD-VLN,一个将语义推理与低延迟飞行命令生成解耦的快慢双系统架构。该框架包含两个异步分支:慢流从预训练的视觉语言模型中提取稳定的语义先验,快流利用扩散Transformer建模跨时间动作分布以生成一致的飞行输出。我们进一步引入时间感知自适应优化器以稳定长序列训练并减少梯度振荡。大规模低空仿真实验表明,FSD-VLN在未见场景上的导航成功率比SOTA方法高出2倍,同时将单动作推理延迟和总任务运行时间削减超过50%。
点评: 借鉴认知科学中的“快慢思维”思想,解耦语义推理与运动控制,为解决空中机器人长程导航中“理解慢”与“飞行快”的矛盾提供了优雅且高效的工程范式。
7. TRACE:基于互补嵌入的双通道鲁棒归因水印用于LLM智能体轨迹
作者: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song et al. | 分类: cs.CR, cs.AI, cs.LG 链接: arxiv.org/abs/2607.08400v1
LLM智能体通过转销商到达用户,转销商可能对开发者的智能体进行品牌重贴或替换为更便宜的模型。当来源出现争议时,归因依赖于轨迹日志(工具调用、观察和执行动作的记录,而非模型的推理过程),而转销商存储并处理该日志以进行计费。水印因此必须在对手对该日志(即检测水印所依据的证据本身)拥有完全读写权限的情况下存活;现有智能体水印无法做到这一点,因为它们的归因直接从该日志读取。本文提出TRACE,据我们所知,这是第一个在动作选择上无失真、在删除下可自同步、在重写下无条件不变的智能体水印。删除会导致位置派生密钥失同步,重写会改变内容,因此抗删除密钥必须来自内容,抗重写密钥必须来自位置,且没有一个单独的密钥能同时满足两者。然而,一条轨迹有容纳两个水印的空间。TRACE叠加了一个选择通道(基于局部内容键控,使用无失真采样器设置选择哪个动作,保证智能体分布不变且检测在删除后重新同步)和一个计数通道(仅基于日志骨架键控,设置每个决策组包含多少条记录,重写无法触及)。我们证明了这种行为水印的信号是用决策熵购买的,每个确定性决策可免费使用,而随机决策至少支付其一半熵,并且擦除这两个通道会迫使转销商破坏其转售的轨迹。在ToolBench和ALFWorld上,TRACE在匹配无水印智能体成功率的同时,其选择通道在长程轨迹上达到接近z=100的检测分数,在70%的步骤删除下仍保持可检测性,并保持计数通道在任意强度的LLM重写下完全不变。
点评: 针对LLM Agent水印这一新兴且极具挑战性的安全需求,TRACE创新性地利用轨迹的“双渠道”特性,同时抵抗删除和重写攻击,其理论完备性与实验表现均令人信服。
8. ADORN:面向Open RAN的自适应漂移处理——基于强化学习的方法
作者: Ashit Kumar Subudhi, Bhargav Chirumamilla, Shubham Vaishnav, Mduduzi C. Hlophe, Praveen Kumar Donta et al. | 分类: cs.NI, cs.AI 链接: arxiv.org/abs/2607.08443v1
开放无线接入网中的动态流量变化会导致漂移,从而降低AI/ML模型的性能。传统的再训练方法可以保持预测准确性,但计算成本高昂,并可能导致服务等级协议违规。本文提出一种基于Q学习的自适应再训练方法,将再训练决策建模为马尔可夫决策过程,其中强化学习智能体学习一个在预测准确性与再训练成本之间取得平衡的策略。该方法结合了多专家长短期记忆集成,以减轻灾难性遗忘并提高在不同流量条件下的鲁棒性。实验结果表明,与贪婪和随机基线相比,所提方法有效降低了再训练开销,同时将系统性能维持在预定限制内。
点评: 将RL应用于O-RAN中的模型漂移处理是一个很实用的创新,通过智能决策再训练时机而非盲目重训,在保证SLA的同时大幅降低了计算成本,对5G/6G网络运维有直接价值。
本内容由 AI 辅助生成,论文信息来源于 arXiv。