端侧压缩、幻觉抑制与视觉导航智能体前沿进展
今日精选 8 篇 AI/ML 论文,涵盖LG, AI, CL, CV, stat.ML, RO, CR, NI等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖大模型压缩、幻觉抑制、数据提纯、端到端自动驾驶、强化学习理论、无人机导航、Agent水印以及网络智能运维等前沿方向。
1. BiSCo-LLM:面向极限低位大模型压缩的无查找表二进制球面编码
作者: Yuantian Shao, Peisong Wang, Zhilei Liu, Chuangyi Li, Yuanteng Chen et al. | 分类: cs.LG 链接: arxiv.org/abs/2607.08643v1
大语言模型在部署时日益受到内存容量、权重带宽和检查点存储的限制。现有低位压缩方法主要有两个方向:标量或分组量化简单高效,但在目标预算接近每权重2比特时表征能力受限;向量量化压缩提供更丰富的块级表征,但通常引入显式码本、索引查找和额外存储开销。本文提出BiSCo-LLM,一个无码本的二进制球面编码框架,用于极限低位LLM权重压缩。其核心流程基于三个组件:首先,将局部权重块映射到单位超球面并二值化为紧凑的球面码,主要载荷为位打包的符号流而非显式VQ质心;其次,残差BSQ阶段编码基础球面编解码器留下的重构误差,提供无需存储码本的显式率失真路径;第三,在替换每个Transformer模块类别后进行类别级恢复蒸馏,减少局部权重重构与组装模型行为之间的不匹配。一个8位保护通道路径作为敏感通道的辅助稳定机制,与BSQ载荷分开统计。报告的存储预算包括二进制码、神经解码器、保护通道载荷、LoRA适配器和元数据。
点评: 该工作在2比特甚至更低比特的极限压缩场景下,巧妙地用球面编码替代了传统VQ码本,并通过残差编码和蒸馏补偿重构损失,为极致模型压缩提供了全新范式。
2. 博弈论驱动的多智能体框架有效缓解语言模型幻觉
作者: Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu et al. | 分类: cs.AI 链接: arxiv.org/abs/2607.08403v1
轻量级大语言模型在基于规则的科学领域中的应用受到严重限制,因为它们倾向于模仿语言模式而非复现公理推理,导致频繁的幻觉。本文表明,G-Frame——一个集成了贝叶斯和团队博弈原理的自适应多智能体框架——建立了高质量数据合成和模型训练的自动化闭环。通过结构化推理强制内化领域约束,我们合成了包含363,045条思维链和199,589个问答对的专用语料库。由此产生的7B模型OmniChem在定制基准和ChemBench上达到了与GPT-4o mini相当的性能,同时相对于其基础架构,幻觉减少了79.46%。我们还展示了OmniChem在分子设计和合成规划方面的高级能力。
点评: 将博弈论引入多智能体协作框架,实现了从数据合成到领域推理内化的自动化闭环,为科学专用小模型的幻觉抑制提供了极具工程价值的思路。
3. UltraX:大规模预训练数据的自适应程序化编辑精炼
作者: Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang et al. | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2607.08646v1
随着可用训练数据接近物理极限,缩放定律带来的收益开始递减。因此,改进LLM现在更多地依赖于更高质量的数据利用而非数据扩展。然而,在大规模语料库背景下,现有精炼方法在质量、效率和可靠性方面面临重大局限:基于规则的方法受限于固定启发式规则,难以应对实例级变化;基于LLM的方法提高了质量,但无法满足大规模数据处理的效率和可靠性要求。为了解决这些挑战,我们提出UltraX,一个用于大规模预训练数据的函数调用精炼框架,通过引入插入操作(除了删除和修改)来完善编辑函数空间,实现细粒度的实例级编辑。具体来说,UltraX构建了一个可靠的程序监督生成流水线,通过数据集自适应提示优化、行对齐映射和动态上下文替换等技术,将原始-精炼文本对转换为结构化程序监督。实验表明,UltraX在所有语料库上取得了最高的平均性能,并且在更少的训练token下达到或超过基线,展示了更强的数据效率和精炼可靠性。
点评: UltraX首次将”插入”操作纳入数据编辑空间,并构建了高度工程化的程序化监督生成流水线,为突破”数据墙”瓶颈提供了实用且可扩展的解决方案。
4. WCog-VLA:面向端到端自动驾驶的双层世界认知视觉-语言-行动模型
作者: Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.08375v1
视觉-语言-行动(VLA)模型推动了端到端自动驾驶的发展。然而,现有方法要么缺乏全面的世界认知,要么世界预测能力碎片化,从根本上限制了这些模型只能进行反应式驾驶。为了解决这一局限,我们提出了WCog-VLA,一个新颖的双层世界认知VLA框架,成功将语义级世界预测与生成式世界演化联系起来,实现主动式自动驾驶。在语义层面,WCog-VLA通过整合3D空间感知和注入Agent Token来捕捉世界动态,统一了世界认知与推理,同时支持基于博弈论的思维链(Game-CoT)推理。在生成层面,我们引入了对齐解耦扩散Transformer作为强大的生成式世界模型,合成物理上合理的多智能体联合轨迹。通过场景表征对齐,ADDT减少了所需的去噪步数,从而显著加速推理。在NAVSIM基准上的大量实验表明,WCog-VLA达到了92.9的SOTA PDMS分数。
点评: WCog-VLA通过”语义推理+生成演化”的双层设计,让自动驾驶从被动反应走向主动规划,Game-CoT的引入更是让多车交互博弈成为可能。
5. 分位数分布强化学习的统计效率与推断
作者: Zijie Cheng, Yang Peng, Zhihua Zhang | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2607.08444v1
本文从统计效率的角度研究基于分位数的分布强化学习。我们聚焦于分布策略评估,其目标是刻画在给定策略下折扣累积奖励的分布(即回报分布)。为了获得回报分布的有限维表示,我们考虑了由分位数投影分布贝尔曼方程导出的分位数不动点。假设可以访问生成模型,我们基于经验马尔可夫决策过程构建了估计量。对于固定分位数数量m,我们在上确界W∞度量下建立了估计量的非渐近误差界,表明估计误差相对于m和n的缩放为Õ(√m/n)。这意味着基于分位数的分布策略评估问题可以以样本高效的方式解决,达到最优的参数化√n收敛速率。我们推导了分位数参数的渐近分布,并刻画了半参数效率界。
点评: 这篇理论工作为分位数分布强化学习提供了严谨的统计基础,不仅证明了其样本效率和最优收敛率,还给出了Berry-Esseen定理,为实际推断应用提供了理论保障。
6. FSD-VLN:面向空中长程视觉-语言导航的快慢双系统建模
作者: Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.08359v1
视觉-语言导航使无人机能够通过将语言指令映射到实时视觉输入,在未知环境中自主导航。与依赖GPS或预编程的导航相比,VLN支持直观的人机交互和更强的环境适应性,需要高层语义推理与低延迟飞行控制的紧密集成。现有方法在全局多模态理解和序列动作生成之间存在结构性失调,导致长程空中导航出现抖动轨迹和严重的决策延迟。为了解决这个问题,我们提出FSD-VLN,一种将语义推理和低延迟飞行命令生成解耦的快慢双系统架构。该框架有两个异步分支:从预训练视觉-语言模型中提取稳定语义先验的慢速流,以及建模跨时间动作分布以产生一致飞行输出的扩散Transformer快速流。大规模低空仿真实验表明,FSD-VLN在未见场景中导航成功率比SOTA方法高出2倍,同时将单动作推理延迟和总任务运行时间降低了50%以上。
点评: 借鉴认知科学的双系统理论优雅地解决了无人机VLN中”理解慢、控制快”的矛盾,DiT在时序动作建模上的应用也为机器人控制提供了新思路。
7. TRACE:基于互补嵌入的LLM Agent轨迹鲁棒双通道可归属水印
作者: Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song et al. | 分类: cs.CR, cs.AI, cs.LG 链接: arxiv.org/abs/2607.08400v1
LLM Agent通过转售商触达用户,转售商可能对开发者的Agent进行品牌重命名或替换为更便宜的模型。当所有权产生争议时,归属权依赖于轨迹日志,而转售商可以完全读/写该日志。现有的Agent水印无法抵御这种攻击。我们提出TRACE,据我们所知,这是第一个在动作选择上无失真、在删除下可自同步、在重写下无条件不变异的Agent水印。删除会破坏基于位置的密钥,重写会改变内容,因此抗删除的密钥必须来自内容,抗重写的密钥必须来自位置,单一密钥无法同时满足两者。TRACE叠加了一个选择通道(基于局部内容键控,采用无失真采样器设置选择哪个动作)和一个计数通道(仅基于日志骨架键控,设置每个决策组包含的记录数量)。我们证明水印信号是用决策熵”购买”的,每个决策至少支付其一半的熵。
点评: 在Agent经济生态兴起的背景下,TRACE巧妙利用轨迹的双重特性设计了互补水印通道,完美解决了转售商恶意篡改场景下的归属权鉴别难题,实用价值极高。
8. ADORN:基于强化学习的Open RAN自适应漂移处理
作者: Ashit Kumar Subudhi, Bhargav Chirumamilla, Shubham Vaishnav, Mduduzi C. Hlophe, Praveen Kumar Donta et al. | 分类: cs.NI, cs.AI 链接: arxiv.org/abs/2607.08443v1
Open RAN中的动态流量变化会导致漂移,从而降低AI/ML模型的性能。传统的重训练方法能保持预测准确性,但计算成本高昂,且可能导致服务等级协议违规。本文提出一种基于Q学习的自适应重训练方法,将重训练决策建模为马尔可夫决策过程,其中RL Agent学习一个在预测准确性和重训练成本之间取得平衡的策略。该方法采用多专家LSTM集成来缓解灾难性遗忘,并提高在多样化流量条件下的鲁棒性。实验结果表明,与贪婪和随机基线相比,该方法有效降低了重训练开销,同时将系统性能维持在预定阈值内。
点评: 将强化学习引入网络AI模型的运维决策,自动平衡”性能保持”与”计算成本”,为O-RAN等动态环境下的模型生命周期管理提供了智能解决方案。
本内容由 AI 辅助生成,论文信息来源于 arXiv。