智能体网络拓扑自适应、安全漏洞检测与图神经预条件求解

今日精选 8 篇 AI/ML 论文,涵盖AI, LG, CR, CL, SE, CV, MM, RO, GT, MA, math.NA等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多智能体系统自适应进化、网络安全检测推理、AI 运维智能体评测、灾难管理多模态数据集、代码基准构建校验、硬件感知自主智能、博弈论安全策略以及图神经网络预条件器等前沿方向。


1. MANTA:面向自进化多智能体系统的多智能体网络拓扑自适应

作者: Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie et al. | 分类: cs.AI 链接: arxiv.org/abs/2607.28527v1

基于大语言模型的多智能体系统通过任务分解、智能体专业化、信息交换和中间验证来提升复杂问题解决能力。然而,现有系统通常将通信拓扑视为固定设计选择或离线优化目标。我们提出了 MANTA(Multi-Agent Network Topology Adaptation)框架,使通信结构能够在推理时自我进化。在执行前,MANTA 从先前的结构经验中初始化一个任务条件化拓扑。在部署期间,它监控协作轨迹,并在当前组织变得不足时应用有界结构更新。这些更新可以修改智能体角色、通信链接、执行顺序、信息可见性和验证路径,同时保持任务接口和智能体预算不变。我们在覆盖信息检索、工具使用、规划、工作流执行和数学推理的五个基准上,将 MANTA 与代表性的单智能体和多智能体基线进行了评估。MANTA 取得了最高平均分 74.0,比最强基线高出 5.8 个百分点,并在 PlanCraft 上获得了最佳结果。这些结果表明,推理时的自我改进可以扩展到协作架构本身。

点评: MANTA 首次将拓扑结构自适应引入多智能体系统的推理阶段,让协作架构本身具备了自进化能力,为复杂任务求解提供了全新维度。


2. 具有推理能力的语言模型用于网络安全检测分类

作者: Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan et al. | 分类: cs.LG, cs.CR 链接: arxiv.org/abs/2607.28460v1

安全运营中心(SOC)的一个主要问题是告警疲劳,因为报告的检测数量超过工作人员每天可以处理的范围。先前的工作会提示或微调大语言模型(LLM)直接输出分诊标签,但并未训练它们推理检测是否为真正的威胁。我们在真实的人工标注的 Windows 端点检测数据上,通过结合自动化提示优化、自训练和带可验证奖励的强化学习,训练了一个思维链(CoT)推理能力的分诊分类器。我们发现 CoT 推理也会降低自动分诊所依赖的标签 token 概率,因此我们另外训练了一个校准器,读取完整的推理轨迹并估计判定正确的概率。我们的系统达到了 82.6% 的测试准确率,在控制自动分诊的高置信度工作点上,良性召回率提高了 43.0%,恶意召回率提高了 18.3%,优于直接标签 LLM 分类器。我们进一步表明,训练后的校准器是必要的——未经训练的置信度判断器会将高置信度召回率降至零——并且微调的 30B 模型显著优于前沿通用模型,这说明了在规模之上进行针对性训练的价值。

点评: 该研究直击 SOC 告警疲劳痛点,通过引入可验证推理与概率校准机制,显著提升了安全检测的准确性与可信度,证明了专业领域”小而精”路线的有效性。


3. ORCA-bench:语言模型智能体为值班运维做好准备了么?

作者: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang et al. | 分类: cs.CL, cs.AI, cs.SE 链接: arxiv.org/abs/2607.28545v1

大语言模型可以编写、修补和搜索代码,但值班根因分析(RCA)需要的是另一种能力:从模糊的用户报告出发,在事件发生数小时后,对嘈杂的指标、日志、追踪和源代码进行推理。我们引入了 ORCA-bench,一个将通用编程智能体置于生产保真度值班环境中的基准测试。ORCA-bench 将一个实时的、基于 OpenTelemetry 插桩的微服务系统——通过真实的遥测接口(通过 Grafana 连接 Prometheus、Jaeger 和 OpenSearch)暴露六天的指标、日志和追踪,并提供完整的源代码访问权限——与 1,079 个系统性变化报告特异性、检测时间和并发故障场景的 RCA 任务配对。Ground-truth 症状由专家 SRE 策划并签署,我们的 LLM-as-judge 由人类独立重新评分(Cohen’s κ_w=0.90)。在五个前沿智能体中,Medium 难度任务(真实输入设置)的最佳 RCA 准确率为 25.3%,Hard 任务为 10.0%——即使使用 Claude Fable 5 也存在这一差距。最弱的模型在 40% 的事件报告中幻觉出不可信的根因,而移除源代码访问会降低所有指标。至关重要的是,这些表现是在一个精选的 50 GB/六天测试台上取得的,任务在代码和 instrumentation 都公开的系统上被隔离调查。由于真实的生成系统要大数个数量级、更加动态且更具特殊性,我们报告的差距是前沿编程智能体能够被安全地委以生产可靠性之前所需工程投入的下限。我们在 https://hub.harborframework.com/datasets/orca-bench/ORCA-bench 发布了公共数据集。

点评: ORCA-bench 填补了 AI 运维评测的关键空白,其结果表明前沿编码智能体距离真正胜任生产环境值班运维仍有显著差距,为相关研究方向敲响了警钟。


4. Theia:Incidents1M 数据集的大规模多模态标注与自动化验证用于无数据蒸馏

作者: Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini | 分类: cs.CV, cs.AI, cs.MM 链接: arxiv.org/abs/2607.28269v1

在灾难管理等关键领域部署视觉语言模型(VLM)需要高质量的多模态数据集,特别是通过无数据知识蒸馏(DFKD)进行知识迁移时。然而,该领域的现有数据集要么完全缺乏描述性文本(如 Incidents1M),要么存在严重的文本-图像语义错配(如 CrisisMMD)。在这项工作中,我们提出了一种构建和自动验证用于灾难响应的大规模多模态数据集的新方法。从仅有视觉信息的 Incidents1M 出发,我们成功恢复了 100,000 张图像,并使用两种不同的 Qwen3.5 架构生成了高保真文本描述:一个 4B 稠密模型和一个 35B Mixture-of-Experts (MoE) 模型。为了确保生成的标题为 DFKD 提供可靠的语义锚定,我们引入了一个基于 Qwen3.5-9B 的图像盲 LLM-as-a-Judge 验证流水线。通过有意向法官隐藏原始图像,该评估器准确地模拟了学生模型在无数据蒸馏期间的多模态差距。我们在 173,179 个标签对上进行的评估表明,两种架构之间具有高度语义一致性(78.65/100)。此外,自动化评估揭示了一种保守的标注行为,其特点是高精度(77.6%)和低召回率(46.0%)。这最大程度地减少了假阳性噪声,同时暴露了原始 ground truth 中潜在的人类标注不一致性。这项工作提供了一个可扩展的、经过 LLM 验证的多模态数据集和一个可复现的框架,以推进跨模态知识蒸馏。

点评: 该研究通过 LLM 驱动的自动化标注与验证流水线,规模化解决灾害响应领域多模态数据稀缺问题,为 DFKD 在新兴领域的落地提供了高质量数据基座。


5. PAIChecker:揭示并检查 SWE-Bench 类基准中的 PR-Issue 错配问题

作者: Manyi Wang, Junjielong Xu, Pinjia He | 分类: cs.SE, cs.AI 链接: arxiv.org/abs/2607.28587v1

SWE-bench 类基准被广泛用于评估 LLM 的问题解决能力。它们通常遵循一个通用的构建流程:通过从 PR 描述中提取 issue 引用来将每个 PR 与链接的 issue 配对;issue 描述用作问题陈述,PR 补丁作为测试 oracle。然而,由于大型仓库开发和维护的固有复杂性,这种 PR-Issue 配对在实践中经常出现错配。在这项工作中,我们系统地研究了 SWE-bench Verified 实例,发现 13.6% 的配对在五种模式的十一个细粒度场景中存在错配。为了在未来可靠且可扩展地构建这些基准,我们提出了 PAIChecker,一个用于检查 SWE-bench 类基准中 PR-Issue 错配的多智能体系统。具体来说,PAIChecker 采用三阶段设计,结合特定模式识别、跨智能体标签合成和代码级验证,从而能够实现更准确、更通用且逐步验证的检测。在 SWE-Gym 和 SWE-bench Multilingual 上的实验表明,PAIChecker 在所有四个 LLM 主干上均取得了最佳性能,二元准确率分别高达 92.12% 和 91.67%。

点评: 该项工作系统揭示了 SWE-bench 类基准中隐藏的数据质量问题,PAIChecker 为构建更可靠的代码智能评估体系提供了关键质检工具。


6. 知晓自身老化的机器:硬件感知自主智能框架

作者: Cheng Siong Chin, Jianhua Zhang, Mohan Venkateshkumar | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.28451v1

自主系统不可避免地会老化,但其人工智能通常假设硬件保持原始状态。电池会衰减,传感器会漂移,处理器会累积时序错误,内存可靠性会下降,从而在假设能力与实际能力之间产生日益增长的失配。这可能导致”不可知崩溃”,即任务失败源于累积的硬件退化而非单个组件故障。我们提出了 Aging-Aware Autonomous Intelligence (AAAI) 框架,将硬件健康直接集成到推理、规划和任务执行中。AAAI 建立在三个支柱之上:硬件自我意识,使用物理失效模型持续估计电源、感知、内存和计算子系统的健康状况;自适应推理,根据剩余硬件能力调整推理复杂度、规划范围长度和任务优先级;以生存为中心的智能,通过性能优化、资源节约和优雅降级,在任务目标之间分配剩余运行寿命。AAAI 并非引入新硬件,而是将预测、生命周期管理和硬件感知计算统一到一个闭环认知架构中。我们认为这种集成对于在不可达或安全关键环境中运行的自主系统至关重要,包括太空任务、海洋机器人和植入式医疗设备。通过使机器能够识别并响应自身老化,AAAI 提高了弹性,延长了运行寿命,并支持更安全、更优雅的任务完成。

点评: 该框架首次系统性地将硬件老化因素嵌入自主智能的决策闭环,为长寿命、高可靠自主系统(如深空探测器)的设计开辟了新思路。


7. 自我认证漏洞的智能体:置信度调度的受限响应用于安全对手利用

作者: Boning Li, Longbo Huang | 分类: cs.GT, cs.AI, cs.MA 链接: arxiv.org/abs/2607.28520v1

在两人零和完美信息博弈中,采用纳什均衡策略的智能体能确保博弈价值,但会放弃利用有缺陷对手所能带来的额外价值。弥散性偏离构成了特殊挑战:二元发布规则可能收集不到足够的证据来行动,而对不完整对手模型的完全最佳响应则可能高度可被利用。我们引入了预算约束的置信度调度受限响应(CS-RNR),这是第一种对手利用方法,其安全保证是智能体在实际部署策略上自行计算的证书,因此它承诺的每一次利用都是经过自我审计的。该方法使用随时有效的置信序列跟踪池化的行动频率,并且仅当频率区间与均衡参考值分离时才将频率视为可利用。已确认的偏离定义了一个保守的对手模型,受限响应求解将其转化为在网格化 pin 水平上的候选反策略。在部署前,每个完整候选都由全树最佳响应进行评估。所得证书与用户指定的预算进行比较,并与策略原子性地提交。由于此检查是在实际执行的策略上进行的,模型质量决定了所实现的利用程度,而证书则控制相对于参考的预期损失。在 Leduc hold’em 中,CS-RNR 获得的稳态收益是货币验证二元门的 6.2 倍,同时使每个部署策略都在预算内。使用相同估计器的轨迹混合达到了预算的 13.6 倍。在 Leduc、Liar’s Dice 和 5-rank Leduc 中,所有 36,000 个经审计的牌局都满足所报告的证书容差。

点评: 该研究提出了博弈论对手利用中的首个自审计安全机制,在追求超额收益的同时严格保证风险可控,对多智能体安全交互具有重要理论价值。


8. 用于迭代求解器的图神经多层预条件器

作者: Zechen Zhang, Rui Peng Li, Yousef Saad | 分类: math.NA, cs.LG 链接: arxiv.org/abs/2607.28456v1

求解大型稀疏线性系统是科学计算的核心任务,高效的迭代求解器严重依赖有效且稳健的预条件处理。虽然代数多重网格(AMG)等经典方法具有高度可扩展性,但其稳健性在不定或非对称系统上可能会下降,因为为椭圆 PDE 开发的启发式方法在这些情况下不太可靠。近年来,图神经网络(GNN)已作为数据驱动的预条件器出现;然而,对于通用稀疏矩阵,强加 AMG 风格层次结构的实际影响仍未得到充分探索。在这项工作中,我们提出了一种图神经多层预条件器(GMP),它采用 AMG 层次结构作为结构先验,并在统一框架中学习平滑、限制和插值算子。我们的方法针对通用稀疏系统,并实例化为标准 Krylov 求解器的即插即用预条件器。在包含 800 多个稀疏矩阵的基准测试中,我们将 GMP 与经典 AMG、单层 ILUT 和最先进的 GNN 预条件器进行了比较,并刻画了多层图神经预条件改善收敛性,或者相反地,相对于强单层基线引入开销的机制。这些结果凸显了在面向大规模科学模拟的学习型预条件器中强制采用 AMG 风格多层结构的潜力和局限性。

点评: 该工作将 AMG 层次先验与 GNN 学习深度融合,系统评估了学习型多层预条件器在大规模稀疏线性系统上的适用边界,为科学计算与深度学习的交叉研究提供了重要基准。


本内容由 AI 辅助生成,论文信息来源于 arXiv。