多智能体协同、低比特压缩与端到端驾驶模型新进展

今日精选 8 篇 AI/ML 论文,涵盖LG, AI, CL, CV, stat.ML, RO, CR, NI等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖大语言模型压缩、幻觉缓解、数据质量提升、自动驾驶、强化学习理论、无人机导航、AI Agent水印以及网络智能运维等前沿方向。


1. BiSCo-LLM:面向极低比特大语言模型压缩的无查找表二进制球面编码

作者: Yuantian Shao, Peisong Wang, Zhilei Liu, Chuangyi Li, Yuanteng Chen et al. | 分类: cs.LG 链接: arxiv.org/abs/2607.08643v1

大语言模型在部署时日益受到内存容量、权重带宽和检查点存储的限制。现有的低比特压缩方法主要遵循两个方向:标量或分组量化简单且兼容高效的低精度内核,但在目标预算接近每个权重2比特时表示能力有限;向量量化权重压缩提供了更丰富的块级表示,但通常引入显式码本、索引查找和额外存储开销。本文提出BiSCo-LLM,一个无需码本的二进制球面编码框架,用于极低比特LLM权重压缩。其核心流程基于三个组件:首先,将局部权重块映射到单位超球面并二值化为紧凑的球面编码,使主要负载是位打包的符号流而非显式VQ质心;其次,残差BSQ阶段编码基本球面编解码器留下的重构误差,提供无需存储码本的显式率失真路径;第三,在每个Transformer模块类别替换后执行类别级恢复蒸馏,减少局部权重重构与组装模型行为之间的不匹配。一个小的8比特保护通道路径作为敏感通道的辅助稳定机制,与BSQ有效负载分开计数。报告存储预算包括二进制编码、神经解码器、保护通道有效负载、LoRA适配器和元数据。

点评: 通过将权重压缩问题转化为球面编码,在不引入码本的前提下实现了极低比特率下的高性能压缩,为LLM在边缘设备部署提供了极具前景的轻量化方案。

2. 博弈论驱动的多智能体框架缓解语言模型幻觉

作者: Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu et al. | 分类: cs.AI 链接: arxiv.org/abs/2607.08403v1

轻量级大语言模型在基于规则的科学领域的应用严重受限,因为它们倾向于模仿语言模式而非复现公理推理,导致频繁产生幻觉。我们展示了一种名为G-Frame的自适应多智能体框架,它整合了贝叶斯和团队博弈原则,为高质量数据合成和模型训练建立了自动闭环。通过结构化推理强制内化领域约束,我们合成了包含363,045条思维链和199,589个问答对的专门语料库。得到的7B模型OmniChem在自定义基准和ChemBench上实现了与GPT 4o mini相当的性能,同时相对于其基础架构展示了79.46%的幻觉减少。我们进一步展示了OmniChem在分子设计和合成规划中的高级能力。这项工作建立了一种利用自适应多智能体克服固有推理缺陷的可扩展范式,为加速专门科学领域的知识发现提供了可行路径。

点评: 将博弈论引入多智能体协作框架,在高价值科学领域(化学)实现了大模型的可靠推理,幻觉率大幅下降,展示了AI for Science的重要进展。

3. UltraX:大规模预训练数据的自适应程序化编辑精炼

作者: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang et al. | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2607.08646v1

随着可用训练数据接近其物理极限,扩展定律带来的收益开始减弱。因此,改进大语言模型现在更少依赖于数据扩充,而更多依赖于更高质量的数据利用。然而,在大规模语料库的背景下,现有精炼方法在质量、效率和可靠性方面面临重大限制:基于规则的方法受限于固定启发式,难以处理实例级变化;基于LLM的方法提高了质量,但无法满足大规模数据处理的效率和可靠性要求。为应对这些挑战,我们提出UltraX,一个面向大规模预训练数据的函数调用精炼框架,它通过引入插入操作(除了删除和修改之外)完善了编辑函数空间,实现了细粒度的实例级编辑。具体来说,UltraX构建了可靠的程序监督生成管道:数据集自适应提示优化首先引导专家LLM产生高质量的端到端精炼文本,然后行对齐映射和动态上下文替换将原始-精炼文本对转换为结构化程序监督。同时,UltraX通过低置信度示例过滤和按操作组合的比例控制采样来提高监督质量并稳定训练分布。在推理和执行过程中,通过滑动窗口预测、全局操作聚合和系统性后处理对模型输出进行归一化和验证,提高了大规模执行的稳定性和可靠性。实验表明,UltraX在所有语料库上实现了最高平均性能,并且用更少的训练token也能匹配或超越基线,展示了更强的数据效率和精炼可靠性。

点评: 在数据质量革命中,UltraX提出了一种新颖的、可大规模并行的程序化数据精炼方法,通过“插入、删除、修改”完备的编辑空间,有望成为下一代预训练数据处理的标准工具。

4. WCog-VLA:面向端到端自动驾驶的双层世界认知视觉-语言-动作模型

作者: Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.08375v1

视觉-语言-动作模型推进了端到端自动驾驶的发展。然而,现有方法要么缺乏全面的世界认知,要么存在碎片化的世界预测,本质上将这些模型限制在反应式驾驶中。为了解决这一局限性,我们提出WCog-VLA,一种新颖的双层世界认知VLA框架,成功地将语义世界预测与生成式世界演化相结合,以实现主动式自动驾驶。在语义层面,WCog-VLA通过整合3D空间感知和注入Agent Token来捕捉世界动态,同时实现博弈论思维链推理,统一了世界认知与推理。在生成层面,我们引入了对齐解耦扩散Transformer作为强大的生成式世界模型,合成物理上合理的联合多智能体轨迹。通过场景表示对齐,ADDT减少了所需的去噪步骤数,从而显著加速推理。为了促进策略推理,我们进一步构建了一个包含85,000条Game-CoT注释的大规模数据集。在NAVSIM基准上的大量实验表明,WCog-VLA达到了最先进的PDMS分数92.9。

点评: 通过“语义预测+生成演化”双层级认知架构,使自动驾驶从“反应式”跃迁至“主动式”,这是具身智能与自动驾驶交叉领域的一次重要尝试。

5. 分位数分布式强化学习的统计效率与推断

作者: Zijie Cheng, Yang Peng, Zhihua Zhang | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2607.08444v1

本文从统计效率的角度研究基于分位数的分布式强化学习。我们聚焦于分布式策略评估,其目标是刻画在给定策略下的回报分布(即折扣累积奖励的分布)。为了获得回报分布的有限维表示,我们考虑了由分位数投影分布式贝尔曼方程诱导的分位数不动点。假设可以访问一个生成模型,我们基于经验马尔可夫决策过程构建了一个估计器。对于固定数量的分位数,我们在上确界W∞度量下建立了估计误差的非渐近界,表明估计误差相对于和按量级缩放。这意味着基于分位数的分布式策略评估问题可以以样本高效的方式解决,达到了最优的参数化收敛率。我们推导了分位数参数的渐近分布,并刻画了其半参数效率界,我们的估计器达到了该界。在固定维设置之外,我们还研究了分位数数量发散时的渐近机制。我们刻画了极限协方差结构,并表明它与分布式策略评估非参数模型的半参数效率界相匹配,证明基于分位数的估计器在无限维极限下仍是渐近有效的。最后,我们为平滑泛函建立了Berry-Esseen定理,从而为基于分位数投影回报分布的函数进行统计有效推断提供了理论基础。

点评: 这项工作为高维、非平稳的强化学习环境提供了严谨的统计推断理论基础,首次证明了分位数DRL估计器在半参数与非参数层面均达到最优效率。

6. FSD-VLN:面向空中长程视觉-语言导航的快慢双系统建模

作者: Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.08359v1

视觉-语言导航通过将语言指令映射到实时视觉输入,使无人机能够在未知环境中自主导航。与依赖GPS或预编程的导航相比,VLN支持直观的人机交互和更强的环境适应性,需要高层语义推理与低延迟飞行控制的紧密集成。现有方法在全局多模态理解与序列动作生成之间存在结构性的不对齐,导致长程空中导航出现抖动轨迹和严重的决策延迟。为了解决这个问题,我们提出FSD-VLN,一种解耦语义推理和低延迟飞行命令生成的快慢双系统架构。该框架有两个异步分支:一个从预训练视觉语言模型中提取稳定语义先验的慢流,以及一个建模跨时间动作分布以产生一致飞行输出的扩散Transformer快流。我们进一步引入时间感知自适应优化器来稳定长序列训练并减少梯度振荡。大规模低空仿真实验表明,FSD-VLN在未见场景中的导航成功率相比现有最先进方法最高提升2倍,同时将单动作推理延迟和总任务运行时间削减超过50%。我们的工作验证了解耦语义-控制建模的益处,并为长程空中VLN提供了实用范式。

点评: “快慢系统”借鉴了认知科学中的双系统理论,有效解决了无人机长时域导航中语义理解与实时控制的矛盾,对机器人决策系统设计具有示范意义。

7. TRACE:基于互补嵌入的双通道鲁棒属性水印用于LLM Agent轨迹

作者: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song et al. | 分类: cs.CR, cs.AI, cs.LG 链接: arxiv.org/abs/2607.08400v1

LLM Agent通过经销商到达用户,经销商可能会重新品牌化开发者的Agent或替换为更便宜的模型。当来源存在争议时,归属取决于轨迹日志(工具调用、观察和执行动作的记录,而非模型的推理),经销商存储和处理这些日志来计量使用。因此,水印必须能够抵御对其检测所依据的同一证据拥有完全读写权限的 adversary;现有的Agent水印无法做到这一点,因为它们的归属直接可以从日志中读取。我们提出TRACE,据我们所知,这是第一个在动作选择上无失真、在删除下能自同步、在重写下无条件不变的Agent水印。删除会使基于位置的密钥失步,重写会改变内容,因此抗删除的密钥必须来自内容,抗重写的密钥必须来自位置,而没有任何单一密钥能同时满足两者。然而,一条轨迹有容纳两个水印的空间。TRACE叠加了一个选择通道(基于局部内容并使用无失真采样器设置选择哪个动作,使Agent的分布证明不变,且检测在删除后能重新同步)和一个计数通道(仅基于日志骨架设置每个决策组有多少条记录,这是任何重写都无法触及的)。我们证明了这种行为水印的信号是用决策熵换取的,每个决策至少消耗其一半的熵,确定性决策则不消耗任何熵,并且擦除两个通道会迫使经销商破坏其转售的轨迹。在ToolBench和ALFWorld上,TRACE在匹配未加水印Agent成功率的同时,其选择通道在长程轨迹上的检测分数接近z=100,在70%步骤删除下仍可检测,而计数通道在任意强度的LLM重写下保持完全不变。

点评: 针对LLM Agent商业落地中日益凸显的版权溯源问题,开创性地提出了一种对删除和重写攻击均具有理论保证鲁棒性的双通道水印方案,是该领域的里程碑式工作。

8. ADORN:面向Open RAN的自适应漂移处理——基于强化学习的方法

作者: Ashit Kumar Subudhi, Bhargav Chirumamilla, Shubham Vaishnav, Mduduzi C. Hlophe, Praveen Kumar Donta et al. | 分类: cs.NI, cs.AI 链接: arxiv.org/abs/2607.08443v1

开放无线接入网中的动态流量变化会导致数据漂移,从而降低人工智能/机器学习模型的性能。传统的重训练方法能保持预测准确性,但计算成本高,可能导致服务水平协议违规。本文提出了一种基于Q学习的自适应重训练方法,将重训练决策形式化为一个马尔可夫决策过程,其中强化学习智能体学习一个能平衡预测准确性和重训练成本的策略。该方法引入了多专家长短期记忆集成,以缓解灾难性遗忘并提高对不同流量条件的鲁棒性。实验结果表明,与贪婪和随机基线相比,所提方法有效降低了重训练开销,同时将系统性能维持在预设限值内。

点评: 将强化学习引入电信网络AI模型的智能运维,在保证SLA的前提下自适应地平衡模型性能与重训练成本,为6G时代的网络自智提供了新思路。


本内容由 AI 辅助生成,论文信息来源于 arXiv。