智能体自演化与安全利用、语言模型运维诊断及图神经网络预条件器
今日精选 8 篇 AI/ML 论文,涵盖AI, LG, CR, CL, SE, CV, MM, RO, GT, MA, math.NA等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多智能体系统自演化、网络安全检测、AI 工程化落地、多模态数据集构建、软件工程基准校验、具身智能硬件感知、博弈论安全利用以及科学计算加速等方向。
1. MANTA:面向自演化多智能体系统的多智能体网络拓扑自适应
作者: Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie et al. | 分类: cs.AI 链接: arxiv.org/abs/2607.28527v1
基于大语言模型的多智能体系统通过任务分解、智能体专业化、信息交换和中间验证来提升复杂问题求解能力。然而,现有系统通常将通信拓扑视为固定设计选择或离线优化目标。我们提出了 MANTA(Multi-Agent Network Topology Adaptation)框架,使通信结构能够在推理时自演化。在执行前,MANTA 从先前的结构经验中初始化任务条件化的拓扑结构。在部署期间,它监控协作轨迹,并在当前组织架构变得不足时应用有界结构更新。这些更新可以修改智能体角色、通信链路、执行顺序、信息可见性和验证路径,同时保持任务接口和智能体预算不变。我们在五个基准测试上将 MANTA 与有代表性的单智能体和多智能体基线进行了比较,涵盖信息检索、工具使用、规划、工作流执行和数学推理。MANTA 取得了最高平均分 74.0,比最强基线高出 5.8 个百分点,并在 PlanCraft 上获得了最佳结果。这些结果表明,推理时的自我改进可以扩展到协作架构本身。
点评: 打破”拓扑固定”的假设,让多智能体系统在推理时动态调整协作结构,是迈向真正自主协作系统的重要一步。
2. 具备推理能力的语言模型用于网络安全检测分类
作者: Amol Khanna, Manu Nandan, Cristian Viorel Popa, Joan Pujol-Roig, Diana Bolocan et al. | 分类: cs.LG, cs.CR 链接: arxiv.org/abs/2607.28460v1
安全运营中心(SOC)的一个主要问题是警报疲劳,因为报告的检测数量超过了工作人员每天可以分类处理的能力。先前的工作直接提示或微调大语言模型(LLM)来输出分类标签,但并未训练它们推理检测是否构成真实威胁。我们在真实、人工标注的 Windows 端点检测数据上训练了一个思维链(CoT)推理能力的分类器,结合了自动提示优化、自训练和带可验证奖励的强化学习。我们发现 CoT 推理也会降低自动分类所依赖的标签 token 概率,因此我们单独训练了一个校准器,它读取完整推理轨迹并估计判定正确的概率。我们的系统达到了 82.6% 的测试准确率,在控制自动分类的高置信度工作点上,良性召回率比直接标签 LLM 分类器提高了 43.0%,恶意召回率提高了 18.3%。我们进一步表明,训练过的校准器是必要的——未训练的置信度判断器会将高置信度召回率降至零——并且微调的 30B 模型显著优于前沿通用模型,这表明针对特定任务的训练比单纯扩大规模更有效。
点评: 将推理能力与概率校准解耦,既提升了可解释性又保证了自动化可靠性,为 LLM 在安全运营中的实际部署提供了可行路径。
3. ORCA-bench:语言模型智能体为值班运维做好准备了吗?
作者: Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang et al. | 分类: cs.CL, cs.AI, cs.SE 链接: arxiv.org/abs/2607.28545v1
大语言模型可以编写、修补和搜索代码,但值班根因分析(RCA)需要不同的能力:从模糊的用户报告出发,在事件发生数小时后,对嘈杂的指标、日志、跟踪和源代码进行推理。我们引入了 ORCA-bench,一个将通用编程智能体置于生产级值班场景的基准测试。ORCA-bench 将一个实时的 OpenTelemetry 仪器化微服务系统(通过 Prometheus、Jaeger 和 OpenSearch via Grafana 等真实遥测接口暴露六天的指标、日志和跟踪,并可完全访问源代码)与 1,079 个系统性地改变报告特异性、检测时间和并发故障场景的 RCA 任务配对。真实症状由专家 SRE 策划和签署,我们的 LLM-as-judge 由人类独立重新评分(Cohen’s κ_w=0.90)。在五个前沿智能体中,中等难度任务(现实输入设置)的最佳 RCA 准确率为 25.3%,困难任务为 10.0%——即使使用 Claude Fable 5 也仍存在这一差距。最弱的模型在 40% 的事件报告中幻觉出不可信的根因,而移除源代码访问权限会降低所有指标。至关重要的是,这些是在一个精选的 50 GB/六天测试平台上的表现,任务在代码和仪器公开的系统上隔离调查。由于真实生产系统要大数个数量级、更加动态和特殊,我们报告的差距是在前沿编码智能体可以被安全地委以生产可靠性之前所需工程投资的下限。
点评: 首个高保真度的”值班 AI”基准测试,揭示出当前最强模型在真实运维场景中准确率仅约 25%,为 AI 可靠性工程划定了清醒的底线。
4. Theia:Incidents1M 数据集的大规模多模态字幕生成与自动验证——面向无数据蒸馏
作者: Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini | 分类: cs.CV, cs.AI, cs.MM 链接: arxiv.org/abs/2607.28269v1
在灾害管理等关键领域部署视觉语言模型(VLM)需要高质量的多模态数据集,尤其是通过无数据知识蒸馏(DFKD)进行知识迁移时。然而,该领域的现有数据集要么完全缺乏描述性文本(如 Incidents1M),要么存在严重的文本-图像语义错配(如 CrisisMMD)。在这项工作中,我们提出了一种构建和自动验证用于灾害响应的大规模多模态数据集的新方法。从纯视觉的 Incidents1M 出发,我们成功恢复了 100,000 张图像,并使用两种不同的 Qwen3.5 架构生成了高保真文本描述:一个 4B 密集模型和一个 35B 混合专家(MoE)模型。为确保生成的字幕为 DFKD 提供可靠的语义锚定,我们引入了一个利用 Qwen3.5-9B 的图像盲 LLM-as-a-Judge 验证流程。通过有意向评审者隐藏原始图像,该评估器准确模拟了学生在无数据蒸馏过程中的模态差距。我们在 173,179 个标签对上的评估表明,两种架构之间具有高度的语义一致性(78.65/100)。此外,自动评估揭示了一种保守的字幕生成行为,特点是高精确率(77.6%)和低召回率(46.0%)。这最小化了假阳性噪声,同时暴露了原始 ground truth 中潜在的人工标注不一致性。这项工作提供了一个可扩展的、LLM 验证的多模态数据集和一个可复现的框架,以推进跨模态知识蒸馏。
点评: 创造性地利用”图像盲”评审机制模拟学生模型的模态鸿沟,为灾害响应领域的高质量多模态数据构建提供了可扩展的新范式。
5. PAIChecker:发现并检查 SWE-Bench 类基准测试中的 PR-Issue 错配问题
作者: Manyi Wang, Junjielong Xu, Pinjia He | 分类: cs.SE, cs.AI 链接: arxiv.org/abs/2607.28587v1
SWE-bench 类基准测试被广泛用于评估 LLM 的问题解决能力。它们通常遵循一个通用的构建流程:每个 PR(Pull Request)通过从 PR 描述中提取问题引用来与其关联的 issue 配对;issue 描述作为问题陈述,PR 补丁作为测试预言。然而,由于大型仓库开发和维护的固有复杂性,这种 PR-Issue 配对在实践中经常出现错配。在这项工作中,我们系统地研究了 SWE-bench Verified 实例,发现 13.6% 的实例在五种模式的十一个细粒度场景中存在错配。为了在未来实现这些基准测试的可靠和可扩展构建,我们提出了 PAIChecker,一个用于检查 SWE-bench 类基准中 PR-Issue 错配的多智能体系统。具体来说,PAIChecker 采用三阶段设计,结合了特定模式识别、跨智能体标签综合和代码级验证,从而实现了更准确、更通用和逐步验证的检测。在 SWE-Gym 和 SWE-bench Multilingual 上的实验表明,PAIChecker 在全部四个 LLM 主干上取得了最佳性能,二元准确率分别高达 92.12% 和 91.67%。
点评: 揭示了 SWE-bench 基准中隐藏的数据质量问题,为 LLM 代码能力评估的可信度提供了关键质检工具。
6. 知道自己正在老化的机器:硬件感知自主智能框架
作者: Cheng Siong Chin, Jianhua Zhang, Mohan Venkateshkumar | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.28451v1
自主系统不可避免地会老化,但它们的 AI 通常假设硬件保持原始状态。电池退化、传感器漂移、处理器累积时序错误、内存可靠性下降,导致假设能力与实际能力之间的差距日益扩大。这可能导致”不可知崩溃”——任务失败源于累积的硬件退化而非单一组件故障。我们提出了老化感知自主智能(AAAI),一个将硬件健康直接整合到推理、规划和任务执行中的框架。AAAI 建立在三大支柱之上:硬件自我意识,使用物理失效模型持续估计电源、传感、内存和计算子系统的健康状况;自适应推理,根据剩余硬件能力调整推理复杂度、规划范围(horizon)和任务优先级;以及以生存为中心的智能,通过性能优化、资源节约和优雅降级在任务目标之间分配剩余运行寿命。AAAI 不是引入新硬件,而是将预测性维护、生命周期管理和硬件感知计算统一到一个闭环认知架构中。我们认为这种整合对于在难以接近或安全关键环境中运行的自主系统至关重要,包括太空任务、海洋机器人和植入式医疗设备。通过使机器能够识别并响应自己的老化,AAAI 提高了弹性,延长了运行寿命,并支持更安全、更优雅的任务完成。
点评: 突破”硬件永新”的隐含假设,将硬件健康度纳入智能体推理闭环,对长寿命太空和深海任务具有重要现实意义。
7. 自我认证漏洞的智能体:置信度调度的受限响应实现安全对手利用
作者: Boning Li, Longbo Huang | 分类: cs.GT, cs.AI, cs.MA 链接: arxiv.org/abs/2607.28520v1
在两人零和的不完美信息博弈中,采用纳什均衡策略的智能体能保证博弈价值,但放弃了有缺陷对手所提供的额外价值。弥散性偏离构成了一个特殊挑战:二元释放规则可能因收集证据太少而无法行动,而对不完整对手模型的完全最优响应可能高度可利用。我们引入了预算约束的置信度调度受限响应(CS-RNR),这是第一种对手利用方法,其安全保证是智能体在实际部署策略上计算的证书,因此它承诺的每一个利用都是经过自我审计的。该方法使用随时有效的置信序列跟踪合并动作频率,并且仅当频率区间与均衡参考分离时才将该频率视为可利用。已确认的偏离定义了一个保守的对手模型,受限响应求解将其转化为一组在固定网格上的候选对抗策略。在部署之前,每个完整候选都通过全树最优响应进行评估。生成的证书与用户指定的预算进行比较,并与策略原子地提交。由于此检查是在实际执行的策略上进行的,模型质量决定了所实现的利用程度,而证书控制相对于参考的预期损失。在 Leduc hold’em 中,CS-RNR 获得的稳态收益是资金验证二元门控的 6.2 倍,同时保持每个部署的策略都在预算内。使用相同估计器的轨迹混合达到了预算的 13.6 倍。在 Leduc、Liar’s Dice 和 5-rank Leduc 中,所有 36,000 个经审计的手牌都满足报告的证书容差。
点评: 首次为对手利用提供可自我审计的安全证书机制,在博弈论安全性与收益获取之间建立了严格的可验证平衡。
8. 面向迭代求解器的图神经网络多层预条件器
作者: Zechen Zhang, Rui Peng Li, Yousef Saad | 分类: math.NA, cs.LG 链接: arxiv.org/abs/2607.28456v1
求解大型稀疏线性系统是科学计算的核心任务,高效的迭代求解器严重依赖有效且稳健的预条件处理。虽然代数多重网格(AMG)等经典方法具有高度可扩展性,但它们的稳健性在不定或非对称系统上可能会下降,因为最初为椭圆 PDE 开发的启发式方法在这些情况下不太可靠。近年来,图神经网络(GNN)作为数据驱动的预条件器出现;然而,对一般稀疏矩阵施加 AMG 风格层次结构的实际影响仍未被充分探索。在这项工作中,我们提出了一种图神经多层预条件器(GMP),它采用 AMG 层次结构作为结构先验,并在统一框架中学习平滑、限制和插值算子。我们的方法针对一般稀疏系统,并作为标准 Krylov 求解器的即插即用预条件器实例化。在一个包含 800 多个稀疏矩阵的基准测试上,我们与经典 AMG、单层 ILUT 和最先进的 GNN 预条件器进行了比较,并描述了多层图神经预条件化改善收敛性或相对于强单层基线引入开销的机制。这些结果突显了在用于大规模科学模拟的学习预条件器中强制 AMG 风格多层结构的潜力和局限性。
点评: 将经典多重网格的结构先验注入 GNN 预条件器,在 800+ 矩阵上系统评估了收益与代价,为学习型科学计算加速器提供了务实视角。
本内容由 AI 辅助生成,论文信息来源于 arXiv。