多智能体自适应、Agent安全验证与自省诊断框架

今日精选 8 篇 AI/ML 论文,涵盖AI, LG, CR, CL, SE, CV, MM, RO, GT, MA, math.NA等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多智能体系统自适应拓扑、网络安全检测、大模型运维能力评估、多模态数据构建、基准测试质量审计、硬件感知自主智能、博弈论安全利用策略以及图神经网络科学计算加速等前沿方向。


1. MANTA:面向自进化多智能体系统的多智能体网络拓扑自适应

作者: Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie et al. | 分类: cs.AI 链接: arxiv.org/abs/2607.28527v1

基于大语言模型的多智能体系统通过任务分解、智能体专业化、信息交换和中间验证来提升复杂问题求解能力。然而,现有系统通常将通信拓扑视为固定设计选择或离线优化目标。我们提出MANTA,一个多智能体网络拓扑自适应框架,使通信结构能够在推理时自进化。在执行前,MANTA从先前的结构经验中初始化一个任务条件拓扑。在部署期间,它监控协作轨迹,并在当前组织结构变得不足时应用有界结构更新。这些更新可以修改智能体角色、通信链接、执行顺序、信息可见性和验证路径,同时保持任务接口和智能体预算不变。我们在五个基准上(涵盖信息检索、工具使用、规划、工作流执行和数学推理)将MANTA与代表性的单智能体和多智能体基线进行了评估。MANTA取得了最高平均分74.0,比最强基线高出5.8个百分点,并在PlanCraft上取得最佳结果。这些结果表明,推理时的自我改进可以扩展到协作架构本身。

点评: 将”架构自进化”引入多智能体系统,突破了固定拓扑的局限,为复杂任务协作提供了全新范式,值得关注。


2. 基于推理增强语言模型的网络安全检测分类

作者: Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan et al. | 分类: cs.LG, cs.CR 链接: arxiv.org/abs/2607.28460v1

安全运营中心(SOC)的一个主要问题是告警疲劳,因为报告的检测数量超过了工作人员每天可以分类处理的能力。此前的工作直接提示或微调大语言模型(LLM)输出分类标签,但并未训练它们推理检测是否为真实威胁。我们在真实的人工标注Windows端点检测数据上,结合自动提示优化、自训练和带可验证奖励的强化学习,训练了一个思维链(CoT)推理增强的分类器。我们发现CoT推理也会降低自动分类所依赖的标签token概率,因此我们单独训练了一个校准器,读取完整推理轨迹并估计判定正确的概率。我们的系统达到了82.6%的测试准确率,在管理自动分类的高置信度工作点上,良性召回率提高了43.0%,恶意召回率提高了18.3%,优于直接标签LLM分类器。进一步研究表明,训练校准器是必要的——未经训练的置信度评判器会使高置信度召回率降至零——并且微调的30B模型显著优于前沿通用模型,这证明了针对性的训练比单纯扩大规模更有效。

点评: 解决了LLM用于安全告警分类时推理能力与置信度评估脱节的关键问题,对SOC实际部署极具实用价值。


3. ORCA-bench:语言模型智能体为值班准备就绪了吗?

作者: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang et al. | 分类: cs.CL, cs.AI, cs.SE 链接: arxiv.org/abs/2607.28545v1

大语言模型可以编写、修补和搜索代码,但值班根因分析(RCA)需要的是不同的能力:从模糊的用户报告出发,在事件发生数小时后,对嘈杂的指标、日志、追踪和源代码进行推理。我们介绍了ORCA-bench,这是一个将通用编程智能体置于生产保真度值班环境的基准测试。ORCA-bench将一个实时的OpenTelemetry插桩微服务系统——通过真实遥测接口(通过Grafana访问Prometheus、Jaeger和OpenSearch)暴露六天的指标、日志和追踪,并提供完整源代码访问权限——与1,079个RCA任务配对,这些任务系统地变化报告具体性、检测时间和并发故障场景。真实症状由专家SRE策划并签署确认,我们的LLM即评审器由人类独立重新评分(Cohen’s κ_w=0.90)。在五个前沿智能体中,中等难度任务(现实输入设置)的最佳RCA准确率为25.3%,困难任务仅为10.0%——即使使用Claude Fable 5也是如此。最弱的模型在40%的事件报告中产生不合理的幻觉根因,而移除源代码访问权限会降低所有指标。至关重要的是,这些表现是在一个精选的50 GB/六天测试平台上,在系统代码和仪器公开的情况下,隔离调查任务所获得的。由于真实生产系统要大几个数量级、更加动态和独特,我们报告的差距是前沿编码智能体被安全地委托生产可靠性之前所需工程投资的下限。

点评: 首个生产级保真度的oncall RCA基准,揭示了大模型在真实运维场景中的巨大差距,为智能运维设定了重要的评估标尺。


4. Theia:大规模多模态标注与Incidents1M数据集自动验证,用于无数据蒸馏

作者: Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini | 分类: cs.CV, cs.AI, cs.MM 链接: arxiv.org/abs/2607.28269v1

在灾害管理等关键领域部署视觉语言模型(VLM)需要高质量的多模态数据集,特别是在通过无数据知识蒸馏(DFKD)迁移知识时。然而,该领域现有数据集要么完全没有描述性文本(如Incidents1M),要么存在严重的文本-图像语义错位(如CrisisMMD)。在这项工作中,我们提出了一种新的方法论来构建和自动验证用于灾害响应的大规模多模态数据集。从仅视觉的Incidents1M出发,我们成功恢复了100,000张图像,并使用两种不同的Qwen3.5架构生成高保真文本描述:4B密集模型和35B混合专家(MoE)模型。为确保生成的标题为DFKD提供可靠的语义锚定,我们引入了利用Qwen3.5-9B的图像盲LLM即评审器验证流水线。通过有意向评审器隐藏原始图像,该评估器准确模拟了无数据蒸馏过程中学生模型的模态差距。我们在173,179个标签对上的评估表明,两种架构之间具有高度的语义一致性(78.65/100)。此外,自动评估揭示了一种保守的标注行为,特点是高精确率(77.6%)和低召回率(46.0%)。这最小化了假阳性噪声,同时暴露了原始地面真值中潜在的人工标注不一致性。这项工作提供了一个可扩展的、LLM验证的多模态数据集和一个可复现的框架,以推进跨模态知识蒸馏。

点评: 为灾害管理领域提供了高质量、经LLM验证的多模态数据集,其”图像盲评审”方法论对DFKD场景具有重要参考意义。


5. PAIChecker:揭示并检查SWE-Bench类基准中的PR-Issue错位

作者: Manyi Wang, Junjielong Xu, Pinjia He | 分类: cs.SE, cs.AI 链接: arxiv.org/abs/2607.28587v1

SWE-bench类基准被广泛用于评估LLM的问题解决能力。它们通常遵循共同的构建流程:通过从PR描述中提取问题引用来将每个PR(拉取请求)与其链接的问题配对;问题描述作为问题陈述,PR补丁作为测试预言。然而,由于开发和维护大型仓库的固有复杂性,这种PR-Issue配对在实践中经常错位。在这项工作中,我们系统地研究了SWE-bench Verified实例,发现13.6%的实例在五种模式、十一个细粒度场景中存在错位。为了未来能够可靠和可扩展地构建此类基准,我们提出了PAIChecker,一个用于检查SWE-bench类基准中PR-Issue错位的多智能体系统。具体来说,PAIChecker采用三阶段设计,结合特定模式识别、跨智能体标签综合和代码级验证,从而实现更准确、更可泛化和逐步验证的检测。在SWE-Gym和SWE-bench Multilingual上的实验表明,PAIChecker在所有四个LLM后端上均取得了最佳性能,分别达到92.12%和91.67%的二元准确率。

点评: 首次系统揭示了SWE-bench基准中数据错位问题的严重性,并提供自动化质检工具,对提升代码智能评估可信度意义重大。


6. 知道自己在老化的机器:硬件感知自主智能框架

作者: Cheng Siong Chin, Jianhua Zhang, Mohan Venkateshkumar | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.28451v1

自主系统不可避免地会老化,但它们的AI通常假设硬件保持在原始状态。电池退化、传感器漂移、处理器累积时序错误、内存可靠性下降,在假设能力和实际能力之间造成日益增长的错配。这可能导致”不可知性崩溃”,即任务失败源于累积的硬件退化而非单一组件故障。我们提出老化感知自主智能(AAAI),一个将硬件健康直接整合到推理、规划和任务执行中的框架。AAAI建立在三个支柱上:硬件自我意识,使用物理失效模型持续估计电源、传感、内存和计算子系统的健康状况;自适应推理,根据剩余硬件能力调整推理复杂度、规划范围(horizon)和任务优先级;以及以生存为中心的智能,通过性能优化、资源保护和优雅降级在任务目标间分配剩余操作寿命。AAAI不引入新硬件,而是将预测、生命周期管理和硬件感知计算统一为闭环认知架构。我们认为这种整合对于在不可达或安全关键环境中运行的自主系统至关重要,包括太空任务、海洋机器人和植入式医疗设备。通过使机器能够识别并响应自身老化,AAAI提高了弹性,延长了操作寿命,并支持更安全、更优雅的任务完成。

点评: 首次系统性将硬件健康状态纳入自主智能体的推理循环,对长寿命、高可靠性的无人系统设计具有重要启示。


7. 认证自身漏洞利用的智能体:安全对手利用的置信度调度受限响应

作者: Boning Li, Longbo Huang | 分类: cs.GT, cs.AI, cs.MA 链接: arxiv.org/abs/2607.28520v1

在两人零和博弈的不完美信息博弈中,采用纳什均衡策略的智能体能确保博弈价值,但会放弃有缺陷对手所提供的额外价值。弥散性偏离(Diffuse deviations)带来特别挑战:二元发布规则可能收集不到足够证据来行动,而对不完整对手模型的完全最优反应可能高度可利用。我们引入了预算受限的置信度调度受限响应(CS-RNR),这是第一种对手利用方法,其安全保证是智能体在它实际部署的策略上计算的证书,因此每个它承诺的漏洞利用都是它已自我审计的。该方法使用任意有效置信序列跟踪汇总动作频率,并且仅当频率区间与均衡参考分离时才将该频率视为可利用。已确认的偏离定义了一个保守的对手模型,受限响应求解将其转化为候选反策略网格。在部署前,每个完整候选通过全树最优反应进行评估。生成的证书与用户指定的预算进行比较,并与策略原子性地提交。由于此检查在已执行策略上进行,模型质量决定了所实现的利用程度,而证书控制相对于参考的预期损失。在Leduc扑克中,CS-RNR获得的稳态收益是货币验证二元门(money-verified binary gate)的6.2倍,同时保持每个部署策略在预算内。使用相同估计器的轨迹混合达到预算的13.6倍。在Leduc、Liar’s Dice和5-rank Leduc测试中,所有36,000手审计对局均满足报告的证书容差。

点评: 提出可认证安全的对手利用新方法,在不安全博弈场景下实现攻击收益与安全保证的平衡,理论创新和实用价值兼备。


8. 用于迭代求解器的图神经网络多级预条件器

作者: Zechen Zhang, Rui Peng Li, Yousef Saad | 分类: math.NA, cs.LG 链接: arxiv.org/abs/2607.28456v1

求解大型稀疏线性系统是科学计算的核心任务,而高效的迭代求解器严重依赖有效且稳健的预条件处理。虽然代数多重网格(AMG)等经典方法高度可扩展,但它们的稳健性在不定或非对称系统上可能会下降,因为最初为椭圆偏微分方程开发的启发式方法在这些系统上不太可靠。最近,图神经网络(GNN)作为数据驱动的预条件器出现;然而,强加AMG风格层次结构的实际影响对于一般稀疏矩阵仍未得到充分探索。在这项工作中,我们提出了一种图神经多级预条件器(GMP),它采用AMG层次结构作为结构先验,并在统一框架中学习平滑、限制和插值算子。我们的方法针对一般稀疏系统,并作为标准Krylov求解器的即插即用预条件器实例化。在超过800个稀疏矩阵的基准测试中,我们将GMP与经典AMG、单级ILUT和最先进的GNN预条件器进行了比较,并刻画了多级图神经预条件改善收敛的机制,或者相反,相对于强单级基线引入额外开销的机制。这些结果突显了在面向大规模科学模拟的学习预条件器中强制执行AMG风格多级结构的潜力和局限性。

点评: 将GNN与经典AMG层级结构深度融合,系统评估了数据驱动预条件器的适用边界,对科学计算与AI交叉领域有重要参考价值。


本内容由 AI 辅助生成,论文信息来源于 arXiv。