大模型智能体协作、端侧小参数对齐与6G语义通信新进展

精选 8 篇 AI/ML 论文,涵盖LG, CL, CV, AI, stat.ML, RO, SE, CR, eess.SP, MA等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖科学智能体基础模型、LLM 多智能体隐式通信、开放数据许可的小型语言模型、多模态大模型路由集成、鲁棒分布学习的样本选择方法、人体运动跟踪基准、自动驾驶漏洞动态分析以及 6G 语义通信中的信念同步。


1. Intern-S2-Preview:科学智能体基础模型

作者: Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen et al. | 分类: cs.LG, cs.CL, cs.CV 链接: arxiv.org/abs/2608.13505v1

科学发现越来越需要 AI 系统能够对异构模态的科学证据进行推理、与科学工具和环境交互,并在长任务视野中持续取得进展。我们提出了 Intern-S2-Preview,一系列科学智能体基础模型,旨在支持多模态科学理解、推理、生成和长视野任务。训练流程始于对渲染后的科学文档、交错图文数据和多样化科学语料库进行科学多模态预训练。从预训练检查点出发,我们应用统一的后训练流程,包括监督微调、可扩展多任务强化学习、黑盒与白盒智能体 RL 以及在线蒸馏。该流程由一系列实用技术支撑,这些技术提高了 rollout 和训练的稳定性与效率,包括带离策略校正的部分 rollout、自适应长度正则化、在线投机解码、稳健的多任务优化以及面向智能体任务的迹感知经验组装。在架构层面,Intern-S2-Preview-397B 将时间序列建模从高效长序列理解扩展到数值预测,而 Memory Decoder 作为一条独立的记忆增强路径被研究,用于在不修改冻结的 397B 主干网络的情况下快速实现科学领域专业化。在科学、多模态、智能体和通用基准上的评估表明,Intern-S2-Preview-397B 在多种设置下取得了有竞争力或领先的结果。时间序列模块提升了在 SciTS 上的科学信号理解与预测能力,而独立的 Intern-MemDec-4B 扩展在 Biology-Instructions 上的平均分从 56.92 提升至 60.32,且未修改冻结的 397B 主干网络。

点评: 大规模科学智能体模型的系统化工程实践,其在时间序列建模和记忆增强路径上的探索为科学发现专用 AI 提供了重要参考。


2. StateBridge:用于 LLM 多智能体系统隐式通信的无训练隐状态对齐

作者: Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras | 分类: cs.AI 链接: arxiv.org/abs/2608.13317v1

基于大语言模型的多智能体系统通常以文本(即离散 token)进行通信。然而,文本引入了离散瓶颈。将发送方的连续隐状态转换为离散 token 会丢弃 token 身份无法捕捉的信息。近期工作提出隐式通信作为替代方案,即智能体直接传输隐表征而不将其转换为文本。然而,现有的隐式方法要么需要跨 Transformer 逐层注入工作记忆,要么需要经过训练的项目器,这限制了可移植性。我们提出了 StateBridge,一种无训练的隐式通信方法,通过闭式正交变换将发送方的最终层隐状态对齐到接收方的输入空间。轻量级范数校准和词汇表锚定确保与预训练输入分布的兼容性。对齐后的状态作为连续前缀被前置到接收智能体的输入中。我们在数学推理、代码生成和问答任务上,使用两个模型家族的四种模型评估了 StateBridge。StateBridge 在 26 个模型-任务对中的 22 个上取得了最佳或并列最佳分数,持续优于最强基线。

点评: 巧妙的无训练对齐方案,有效绕过了隐式通信中常见的项目器训练瓶颈,为多智能体高效协作提供了轻量级新思路。


3. DFM Mimir v1:仅使用许可后训练数据在 1B 参数下达前沿性能的开放 HRM

作者: Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2608.13517v1

当前大语言模型的开发依赖于大规模且通常不合规的数据集,这对致力于开源和伦理数据来源的研究者构成了高门槛。我们推出了 Mimir v1,一个基于层次推理模型架构的 10 亿参数语言模型,它从头开始训练,仅使用许可的后训练数据,就在英语上展现出极具竞争力的性能,并为丹麦语设立了新的最先进水平。Mimir v1 在 161 个数据集的混合数据上训练,在英语、数学与代码以及丹麦语的 20 个基准测试中,优于原始的 HRM-Text 1B,并可媲美 Qwen 3.5 4B 和 Gemma 4 E2B 等更大的前沿模型。该模型已在 Hugging Face Hub 上提供。

点评: 证明了在严格遵守数据许可限制的前提下,小参数模型依然能达到接近前沿的性能,对推动开放、合规的模型研究具有重要意义。


4. 基于 MLLM 路由的异构集成用于鲁棒跨数据集图像分类

作者: Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck | 分类: cs.CV, cs.AI, cs.CL, cs.LG 链接: arxiv.org/abs/2608.13463v1

现代图像分类模型在单一任务特定数据集上训练时表现出色,但往往难以跨领域和难度级别进行泛化。我们提出了 ARMDIL,一种用于多领域图像分类的自适应路由器。ARMDIL 是一个集成模型,使用多模态大语言模型智能体动态地将每张图像路由到最合适的视觉主干网络。我们的多样化集成采用了卷积神经网络、自监督表征学习器和视觉-语言模型,每个模型都在由多个不同分布和特征的图像数据集构建的统一标签空间上训练。实证评估揭示了每种架构在不同视觉领域的独特能力和弱点。至关重要的是,我们表明 ARMDIL 能够有效地驾驭这些权衡,其性能与专门的基于训练的路由器相当。此外,它通过简单的提示修改即可集成新信息,从而极大地提高了适应性,同时通过自然语言推理轨迹增强了可解释性。这些跨数据集图像分类的进展为更可靠的通用视觉系统(如 AI 助手和自主机器人)铺平了道路。

点评: 将 MLLM 作为动态路由器来组合异构视觉模型,兼顾了性能、可扩展性与可解释性,是构建通用视觉系统的有益探索。


5. Wasserstein 滤波:一种用于鲁棒分布学习的样本选择方法

作者: Yikai Xu, Zhao Chen, Jian Huang | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2608.13418v1

给定一个包含部分受污染样本的数据集,我们的目标是恢复底层的干净总体分布。为此,我们提出了 Wasserstein 滤波,一种新颖的样本选择框架,它丢弃一部分可疑样本,并使用剩余数据的经验度量来估计目标分布。核心思想是选择一个子集,使其经验分布与完全受污染的经验分布之间的 Wasserstein 距离最大化,从而优先隔离并移除几何上有影响的离群点。为了使该优化在计算上可行,我们引入了三种算法:一种边际筛选方案 SinkMarg,以及两种联合优化算法 SinkWF 和 SlicedWF,分别利用熵最优传输和切片 Wasserstein 近似。在理论方面,我们引入了远排除与局部投影污染模型,该模型刻画了由分离良好的离群点和局部不可区分的扰动组成的污染。在该模型下,我们证明了 WF 估计器在具有有界协方差的分布族上实现了极小化最优性。在合成数据集、基准异常检测套件以及使用扩散模型的鲁棒生成学习上的大量数值实验表明,WF 作为一种高度实用、模型无关的预处理工具,能够提供有竞争力的异常检测性能,并在重度污染下为生成建模带来显著的下游收益。

点评: 从分布鲁棒性角度出发的样本筛选框架,理论保障与实用效果兼备,可作为生成模型和下游任务的通用数据清洗工具。


6. HumanTracker:迈向全面且对齐人类感知的运动跟踪基准

作者: Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan et al. | 分类: cs.RO, cs.AI, cs.CV 链接: arxiv.org/abs/2608.13555v1

人形运动跟踪是遥操作和全身模仿的核心,然而当前的评估常常与人们在视频中感知到的不一致。运动学误差平均了逐帧的位姿差异,却忽略了最重要的物理伪影,特别是支撑不稳定和接触错误,如脚部滑动和触地时机不当。同时,广泛使用的测试集规模小,缺乏考验接触丰富、长视野行为所需的多样性。我们引入了 HumanTracker,使人体跟踪评估既与感知对齐又可扩展。HumanTracker 基准包含来自多位专业表演者的约 153 小时光学运动轨迹,组织为四个运动家族,并带有文本标签以进行细粒度诊断。我们进一步提出了 HumanScore,一种在 12K 个运动对(包含 24K 个运动)上训练的偏好对齐度量。在具有代表性的最先进跟踪器上,HumanScore 能更好地预测人类偏好,并揭示运动学指标常常遗漏的接触和稳定性故障。

点评: 针对运动跟踪评估与人类感知脱节的问题,构建了大规模基准和偏好对齐指标,有望推动人形机器人运动生成与评估的范式改进。


7. 基于 LLM 的自动驾驶攻击者可达软件弱点动态分析

作者: Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman | 分类: cs.SE, cs.CR, cs.LG 链接: arxiv.org/abs/2608.13450v1

自动驾驶依赖庞大的安全关键软件栈,其中攻击者输入可达的弱点可能影响转向、制动或其他控制决策。静态分析可以识别候选位置,但动态确认可利用性需要可执行测试工件,而这些工件难以手动构建。我们研究了 LLM 能否为开源自动驾驶栈 Autoware 自动化这一过程。我们对 185 个包进行了编译器精确的静态分析,识别出 1,375 条决策规则、2,274 项验证检查和 482 条输入到安全输出的流,并由此得出弱点分类法,并抽样了 740 个可达位置。两个本地开放权重 LLM、一个无静态上下文的消融模型和一个朴素模板基线生成了 3,700 个工件集,这些工件集针对真实构建在 sanitizer 下编译,通过编译器在环反馈进行修复,并在可执行时进行模糊测试。主要结果是一个构建集成失败分类法,表明 80% 的首次编译失败源于依赖接线而非程序逻辑。推理模型首次尝试编译成功了 64% 的 harness,而代码专用模型仅为 6%。仅通过大量 stubbing,推理模型的修复才实现了完整的对象可编译性;其 harness 中只有不到一半到达了模糊测试器,且所有 37 个观察到的崩溃都源于桩代码而非 Autoware。在预算内未动态确认任何候选弱点。这些结果表明,构建集成,而非候选生成或模糊测试,是可靠 LLM 辅助动态分析完整自动驾驶软件栈的主要障碍。

点评: 首次系统性地揭示了 LLM 在自动化复杂安全关键系统动态分析中的真实瓶颈所在,其结论对 AI 辅助漏洞挖掘的落地具有重要警示意义。


8. AI 原生 6G 网络中面向语义通信的异质性感知信念同步

作者: Muhammad Hannan Akram, Muhammad Abubakar Rashid, Wassi Haider Kabir, Haejoon Jung, Kapal Dev et al. | 分类: eess.SP, cs.AI, cs.MA 链接: arxiv.org/abs/2608.13394v1

6G 网络将不仅仅是通信基础设施;它们有望演变为智能系统,其中成千上万个自主 AI 智能体相互连接。这些智能体部署在包括低轨卫星、高空平台、无人机、边缘服务器和地面设备在内的广泛平台上,持续观察环境并交换信息。语义通信提供了一种交换有意义信息而非原始数据的高效机制。然而,其有效性取决于通信智能体是否具有足够对齐的信念,以正确解释和解码传输的消息。在 6G 网络中,异构 AI 模型在多样化的计算约束下运行,并持续从各自本地环境中获取不同知识,这使得上述假设难以满足。本文提出了一个面向 6G AI 原生网络的异质性感知信念同步框架。它利用部署在多接入边缘计算服务器上的潜在翻译模型,将信念更新从一个智能体翻译为智能体特定的知识,而无需联合训练和同构模型架构。仅在必要时通过潜在翻译模型交换紧凑的信念更新,该框架保护了隐私、降低了同步成本,并最小化了本地知识漂移。我们通过一个多层天地一体化网络的案例研究验证了该框架。结果表明,在案例研究中,该框架在异构智能体之间保持了较低的同步成本(以传输的参数数量衡量)和较低的信念对齐误差。

点评: 面向 6G 时代海量异构 AI 智能体协作的关键问题,提出的信念同步机制在隐私、成本和漂移之间取得了良好平衡,极具应用前景。


本内容由 AI 辅助生成,论文信息来源于 arXiv。