多模态 Agent、多智能体通信、模型对齐与鲁棒学习前沿突破

精选 8 篇 AI/ML 论文,涵盖LG, CL, CV, AI, stat.ML, RO, SE, CR, eess.SP, MA等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖科学智能体基础模型、多智能体潜在通信、小参数高性能模型、异构模型集成路由、鲁棒分布学习、人体运动跟踪基准、自动驾驶安全分析以及 6G 语义通信等多个前沿方向。


1. Intern-S2-Preview:科学智能体基础模型

作者: Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen et al. | 分类: cs.LG, cs.CL, cs.CV 链接: arxiv.org/abs/2608.13505v1

科学发现日益需要能够在异构科学证据上进行推理、与科学工具和环境交互、并在长任务周期中持续进步的 AI 系统。我们提出了 Intern-S2-Preview,一系列科学智能体基础模型,旨在支持多模态科学理解、推理、生成和长周期任务。训练流程始于对渲染科学文档、交错图文数据和多样化学科语料库的科学多模态预训练。从预训练检查点出发,我们应用了统一的后训练流程,包括监督微调、可扩展的多任务强化学习(RL)、黑盒与白盒智能体 RL 以及在线蒸馏。该流程由提升 rollout 与训练稳定性和效率的实用技术支持,包括带离策略校正的部分 rollout、自适应长度正则化、在线推测解码、鲁棒多任务优化,以及针对智能体任务的 trace-aware 经验组装。在架构层面,Intern-S2-Preview-397B 将时间序列建模从高效长序列理解扩展至数值预测,同时 Memory Decoder 作为独立的记忆增强路径被研究,可在不修改冻结的 397B 主干的情况下实现快速科学专精。跨科学、多模态、智能体和通用基准的评估显示,Intern-S2-Preview-397B 在多种设置下取得了有竞争力或领先的结果。时间序列模块提升了 SciTS 上的科学信号理解与预测能力,而独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均得分从 56.92 提升至 60.32,且无需修改冻结的 397B 主干。

点评: 这是科学 AI 领域少见的超大参数开源模型,其多阶段 RL 训练管线和记忆解码器分离架构为长周期科学任务提供了新的技术路径。


2. StateBridge:用于 LLM 多智能体系统潜在通信的无训练隐状态对齐

作者: Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras | 分类: cs.AI 链接: arxiv.org/abs/2608.13317v1

基于大语言模型的多智能体系统通常以文本(即离散 token)进行通信。然而,文本引入了离散瓶颈。将发送者的连续隐状态转换为离散 token 会丢弃 token 身份本身无法捕获的信息。近期工作提出潜在通信作为替代方案,即智能体直接传输隐表示而不转换为文本。然而,现有潜在方法要么在 Transformer 中逐层注入工作记忆,要么需要训练投影器而限制了可移植性。我们提出 StateBridge,一种无训练的潜在通信方法,通过闭式正交变换将发送者的最终层隐状态对齐到接收者的输入空间。轻量级范数校准和词汇表锚定确保与预训练输入分布的兼容性。对齐后的状态作为连续前缀添加到接收者智能体的输入中。我们在数学推理、代码生成和问答任务上使用两个模型家族的四种模型评估了 StateBridge。StateBridge 在 26 个模型-任务对中的 22 个上取得最佳或并列最佳分数,持续优于最强基线。

点评: 无需训练即可实现智能体间隐状态直接通信,有效规避了文本离散瓶颈,对多智能体协作效率提升具有直接价值。


3. DFM Mimir v1:仅使用合规后训练数据在 1B 参数下实现前沿性能的开源 HRM

作者: Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke Poech | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2608.13517v1

当前大语言模型的开发依赖于大规模且通常不合规的数据集,这为致力于开源和符合伦理数据来源的研究者设置了高门槛。我们推出 Mimir v1,一个基于层级推理模型(HRM)架构的 10 亿参数语言模型,完全从零训练,仅使用合规的后训练数据便能在英语上展现极具竞争力的性能,并在丹麦语上树立新的最先进水平。该模型在 161 个数据集的混合上训练,在 20 个英语、数学与代码以及丹麦语基准测试中,Mimir v1 超越了原始 HRM-Text 1B,并与 Qwen 3.5 4B 和 Gemma 4 E2B 等更大规模的前沿模型竞争。模型已在 Hugging Face Hub 上开源。

点评: 证明了合规数据路径下小参数模型也能逼近前沿水平,对资源受限和重视数据合规的研究团队极具吸引力。


4. MLLM 路由异构集成用于鲁棒的跨数据集图像分类

作者: Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck | 分类: cs.CV, cs.AI, cs.CL, cs.LG 链接: arxiv.org/abs/2608.13463v1

现代图像分类模型在单一任务特定数据集上训练时表现出色,但往往难以跨领域和难度泛化。我们提出 ARMDIL,一种用于多领域图像分类的自适应路由器。ARMDIL 是一个集成系统,使用多模态大语言模型(MLLM)智能体动态地将每张图像路由到最合适的视觉主干。我们的多样化集成采用卷积神经网络(ResNets)、自监督表示学习器(SSL)和视觉-语言模型(VLM),每个都在由多个分布和特征不同的图像数据集构建的统一标签空间上训练。实证评估揭示了每种架构在不同视觉领域中的独特能力和弱点。关键的是,我们展示了 ARMDIL 能有效权衡这些取舍,与专门的基于训练的路由器表现相当。此外,它通过简单的提示修改即可集成新信息,大幅提升适应性,同时通过自然语言推理轨迹增强可解释性。这些跨数据集图像分类的进展为更可靠的通用视觉系统铺平了道路。

点评: 利用 MLLM 作为动态路由器打破单一模型泛化瓶颈,兼顾性能与可解释性,是通用视觉系统的一种务实而优雅的方案。


5. Wasserstein 滤波:用于鲁棒分布学习的样本选择方法

作者: Yikai Xu, Zhao Chen, Jian Huang | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2608.13418v1

给定一个部分样本被污染的数据集,我们的目标是恢复底层干净的总体分布。为此,我们提出 Wasserstein 滤波(WF),一种新颖的样本选择框架,它丢弃一部分可疑样本,并用剩余数据的经验测度来估计目标分布。核心见解是选择一个子集,使其经验分布与完全污染的原始经验分布之间的 Wasserstein 距离最大化,从而优先隔离并移除具有几何影响力的离群点。为使该优化计算可行,我们引入了三种算法:边际筛选方案 SinkMarg,以及两种联合优化算法 SinkWF 和 SlicedWF,分别利用熵最优传输和切片 Wasserstein 近似。在理论方面,我们提出了 Far Exclusion and Local Projection(FELP)污染模型,该模型刻画了由分离良好的离群点和局部不可区分的扰动组成的污染。在此模型下,我们证明了 WF 估计器在具有有界协方差的分布族上达到极小极大最优性。在合成数据集、基准异常检测套件和扩散模型鲁棒生成学习上的广泛数值实验表明,WF 作为一种高度实用、模型无关的预处理工具,能提供有竞争力的离群点检测性能,并在重污染下为生成建模带来实质性下游收益。

点评: 将样本选择问题转化为 Wasserstein 距离最大化,理论保证与实用算法兼备,为数据清洗和鲁棒生成学习提供了新工具。


6. HumanTracker:迈向全面且人类对齐的运动跟踪基准

作者: Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan et al. | 分类: cs.RO, cs.AI, cs.CV 链接: arxiv.org/abs/2608.13555v1

人形运动跟踪是遥操作和全身模仿的核心,但评估往往与人们在视频中的感知不一致。运动学误差平均了逐帧姿态差异,却忽略了最重要的物理伪影,特别是支撑不稳定和接触错误,如脚滑和触地时机不准。同时,广泛使用的测试集规模小且缺乏压力测试接触密集、长周期行为所需的多样性。我们引入 HumanTracker,使人形跟踪评估既感知对齐又可扩展。HumanTracker 基准包含来自多位专业表演者约 153 小时的光学运动轨迹,组织成四个运动家族并带有文本标签以支持细粒度诊断。我们进一步提出 HumanScore,一种在 12K 运动对(含 24K 个运动)上训练的偏好对齐度量。在代表性最先进的跟踪器上,HumanScore 能更好地预测人类偏好,并揭示运动学指标经常遗漏的接触和稳定性失败。

点评: 直击人形跟踪评估与人类感知脱节的痛点,大规模基准加上偏好对齐度量有望重塑该领域的评价标准。


7. LLM 辅助的自动驾驶车辆攻击者可达软件弱点动态威胁分析

作者: Md Wasiul Haque, Sagar Dasgupta, Mizanur Rahman, Md Rayhanur Rahman | 分类: cs.SE, cs.CR, cs.LG 链接: arxiv.org/abs/2608.13450v1

自动驾驶依赖大型安全关键软件栈,其中可从对抗性输入到达的弱点可能影响转向、制动或其他控制决策。静态分析可识别候选站点,但动态确认可利用性需要可执行测试工件,而手工构建这些工件很困难。我们研究大语言模型(LLM)能否为开源自动驾驶栈 Autoware 自动化这一过程。我们对 185 个包进行编译器精确的静态分析,识别出 1,375 条决策规则、2,274 项验证检查和 482 条输入到安全输出的数据流,由此推导出弱点分类法并采样了 740 个可达站点。两个本地开放权重 LLM、一个无静态上下文消融和一个朴素模板基线生成了 3,700 个工件集,在 sanitizer 下针对真实构建进行编译,通过编译器在环反馈修复,并在可执行时进行模糊测试。主要结果是一个构建集成失败分类法,显示 80% 的首次编译失败源于依赖接线而非程序逻辑。推理模型首次尝试编译了 64% 的 harness,而代码专用模型仅为 6%。仅通过大量桩代码(stubbing)才使推理模型实现完全目标可编译性;其 harness 中只有不到一半到达模糊测试器,且所有 37 次观察到的崩溃都源于桩代码而非 Autoware。在预算内没有候选弱点被动态确认。这些结果表明,构建集成而非候选生成或模糊测试,是 LLM 辅助全自动驾驶软件栈可靠动态分析的主要障碍。

点评: 以严谨的实证揭示了 LLM 辅助安全分析的真正瓶颈在于构建集成而非代码生成,为后续研究指明了关键发力方向。


8. AI 原生 6G 网络中语义通信的异构感知信念同步

作者: Muhammad Hannan Akram, Muhammad Abubakar Rashid, Wassi Haider Kabir, Haejoon Jung, Kapal Dev et al. | 分类: eess.SP, cs.AI, cs.MA 链接: arxiv.org/abs/2608.13394v1

6G 网络将不再仅仅作为通信基础设施;相反,它们有望演变为智能系统,其中数千个自主 AI 智能体相互连接。这些智能体部署在包括低地球轨道(LEO)卫星、高空平台(HAPs)、无人机(UAVs)、边缘服务器和地面设备在内的广泛平台上,持续观察环境并交换信息。语义通信提供了一种交换有意义信息而非原始数据的有效机制。然而,其有效性取决于通信智能体是否具有足够对齐的信念,以正确解释和解码传输的消息。在 6G 网络中,异构 AI 模型在多样化的计算约束下运行,并不断从其本地环境获取不同知识,这一假设变得难以满足。本文提出了一个面向 6G AI 原生网络的异构感知信念同步框架。它利用部署在多接入边缘计算(MEC)服务器上的潜在翻译模型,将信念更新从一个智能体转换为特定于智能体的知识,无需联合训练和同构模型架构。通过仅在必要时通过潜在翻译模型交换紧凑的信念更新,该框架保护隐私、降低同步成本并最小化本地知识漂移。我们通过一个多层地面/非地面网络案例研究验证了该框架。结果表明,在案例研究中,它保持了较低的同步成本(以传输的参数数量衡量)和跨异构智能体的低信念对齐误差。

点评: 直面 6G 分布式 AI 智能体信念不一致的核心挑战,潜在翻译模型方案兼顾隐私、效率与异构适应性,是语义通信走向实用的关键一步。


本内容由 AI 辅助生成,论文信息来源于 arXiv。