AI 智能体推理增强、源码恢复与物联网漏洞利用

今日精选 8 篇 AI/ML 论文,涵盖LG, CL, AI, CV, SE, CR, stat.ML, math.ST, stat.CO, stat.ME, RO等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖高效MoE模型、小模型测试时扩展、视觉语言模型演进十年、智能体任务拍卖机制、二进制源码恢复、物联网漏洞自动化利用、图结构深度高斯过程以及机器人操作强化学习等领域。


1. Mach-Mind-4-Flash 技术报告

作者: Foundation Model Team | 分类: cs.LG, cs.CL 链接: arxiv.org/abs/2607.09375v1

我们提出了 Mach-Mind-4-Flash,这是一个 35B 参数的混合专家(MoE)智能体模型,仅有 3B 激活参数。在不扩展预训练计算量的情况下,仅通过后训练优化,该模型的性能即可达到或超越 100B 参数级别的模型。通过引入可扩展的智能体交互环境进行大规模强化学习,该模型在实际应用任务上获得了显著的性能提升。我们的流程包括三个阶段:(1)统一的 RL/OPD 训练基础设施,具有动态多教师调度和算子级加速,实现了 17% 的端到端训练加速;(2)在推理、通用和智能体三个轨道上并行训练多个领域特定的 RL 专家,然后通过多教师在线策略蒸馏(MOPD)——一种路由反向 KL 目标,消除了混合奖励 RL 的跷跷板退化——融合为一个单一的通才模型;(3)混合中长 Token 策略优化(HMPO),一种单阶段 Token 效率方法,将推理链压缩 19-46%,且精度损失 ≤0.7 个百分点。Mach-Mind-4-Flash 在 AIME’26 上得分为 92.70,IFBench 为 82.82,Behavioral-SafetyBench 为 80.74,BFCL-v4 为 75.80,BrowseComp-zh 为 72.31,ClawBench 为 84.20——以极低的推理成本,领先或追平了激活规模大 10-30 倍的模型。

点评: 35B 参数 MoE 模型仅用 3B 激活参数就超越了 100B 级模型,MOPD 和 HMPO 等技术有效解决了多任务强化学习中的跷跷板问题和推理链过长问题,是高效模型设计的标杆之作。


2. 小尺寸视觉语言模型在多语言视觉多选题上的测试时扩展

作者: Spiros Baxevanakis, Peng-Jian Yang | 分类: cs.CL, cs.AI, cs.LG 链接: arxiv.org/abs/2607.09438v1

测试时扩展(TTS)能可靠地提升大型语言模型的推理能力,但它是否能迁移到小型开源视觉语言模型上尚不清楚。我们在 EXAMS-V(一个多语言视觉多选题基准)上对此进行了考察,对比了自一致性、先描述后推理结合 PRM 引导的波束搜索,以及两种事后选择器,涉及 Qwen2.5-VL-7B-Instruct 和 Qwen3.5-4B 模型。重要的是 TTS 运行的条件,而非搜索或验证机制本身。最大的影响因子是可解析性:早期的提示格式导致许多推理链推理正确但无法给出答案字母,标准的答案提示和引导修复步骤能大幅消除此问题。更大的解码预算消除了剩余问题:将每条链的 token 上限从 1k 提高到 2k 提升了 3.7 个百分点,而采样更多链(8 到 16)仅增加了 0.15 个百分点。一旦链有足够的完成空间,复杂的方法贡献甚微:PRM 引导的波束搜索比简单的自一致性差 0.39 个百分点,成本却高出 8 倍以上。最大的性能提升来自策略模型本身(+11.4 个百分点)。我们的最佳配置在 ImageCLEF 2026 测试集上达到 84.1% 的准确率,在 Visual MCQ 排行榜上排名第一。

点评: 这篇论文揭示了小模型 TTS 的关键瓶颈在于”解析性”而非复杂的搜索策略,简单增加 token 上限比复杂方法更有效,对资源受限场景下的 VLM 部署具有重要指导意义。


3. 视觉语言 AI 模型十年:准确性与视觉认知错误的演变

作者: Shravan Murlidaran, Miguel P. Eckstein | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.09654v1

在过去十年中,视觉语言模型(VLM)在视觉推理方面取得了显著进展。大多数评估都使用简单的场景(MS-COCO),无法展示复杂的人类交互或行为,仅有少量的非策划人类描述作为基准,并且没有关注模型的错误类型。在这里,我们引入了复杂社会行为(CSB)数据集,包含 100 张描绘复杂社会交互/行为的图像。我们分析了跨越十年(2017-2025)的 VLM 模型(四个前多模态大语言模型和五个 MLLM)的场景描述进展。我们评估了模型和 20 位人类描述相对于 CSB 数据集和 MS-COCO 样本上的黄金标准的准确性。我们分析了五种视觉认知错误类型:物体检测、识别、幻觉、场景理解和空间依赖性。CSB 数据集在场景描述准确性上显示出比 MS-COCO 更显著的提升,前 MLLM 模型的准确性远低于排名最后的描述,而 MLLM 则达到了与排名靠前的人类描述相似的准确性。我们证明,MLLM 已消除了简单 MS-COCO 场景与描绘复杂行为的场景(CSB)之间场景描述准确性的差距。MLLM 几乎消除了我们测试数据集中的所有错误类型,除了偶尔依赖与人类不同的图像区域进行场景描述(空间依赖性错误)。我们还表明,检测、识别和幻觉错误对场景描述准确性的影响最大。总之,我们的研究结果更全面地评估了视觉语言模型在过去十年中的进步程度。

点评: 十年跨度的大规模对比研究,首次系统分析了 VLM 错误类型的演变,发现 MLLM 已几乎消除所有传统错误类型,唯独”空间依赖性”错误依然存在,为未来研究方向提供了清晰指引。


4. Agora:基于拍卖的任务分配增强 LLM 智能体推理能力

作者: Kaiji Zhou, Ales Leonardis, Yue Feng | 分类: cs.AI, cs.CL 链接: arxiv.org/abs/2607.09600v1

增强大型语言模型(LLM)智能体的推理能力需要有效编排多样化的专家模型和工具。然而,现有框架通常基于任务与专家模型或工具功能之间的粗粒度匹配来调用 API,而忽略了关键因素,如功能相似的替代方案之间的性能差异和成本效率。为了解决这个问题,我们提出了 Agora,一个引入激励相容拍卖机制的框架,用于将任务动态分配给专家模型和工具。通过将推理步骤视为可交易物品,Agora 使智能体能够基于其修正后的能力进行竞标——确保关键逻辑被路由到最有能力的求解器,而非最自信的那个。在五个基准上的评估表明,在可比候选池下,Agora 优于匹配的单模型、路由和级联基线,同时通过单个拍卖参数提供了可控的成本-质量权衡。

点评: 将经济学中的拍卖机制引入 LLM 智能体的任务分配,解决了功能相似模型间的选择难题,实现了成本与质量的可控权衡,是智能体编排领域的创新思路。


5. 基于锚点检索和 LLM 推理的二进制函数实用源码恢复

作者: Charles Edward Gagnon, Steven H. H. Ding, Philippe Charland, Benjamin C. M. Fung | 分类: cs.SE, cs.AI 链接: arxiv.org/abs/2607.09452v1

我们提出了一种实用的流程,通过结合逆向工程、基于锚点的源代码检索和大型语言模型推理,从剥离的二进制函数中恢复源代码。我们的二进制到源代码检索方法试图从源代码数据库中找到源函数,而不是生成近似的反编译伪代码。它使用 Ghidra 提取锚点(如字符串、常量、外部调用和可用的函数名),通过倒排索引搜索数据库检索候选文件,将候选项缩小到可能的函数片段,并使用 LLM 基于反汇编代码、反编译代码和源代码元数据进行重新排序。可信的匹配结果还可以在后续轮次中用作锚点。在基于高保真源数据库对剥离和优化后的 tcpdump 二进制文件的评估中,我们提出的二进制到源匹配方法达到了 95.2% 的汇编指令覆盖率。基于 GitHub 检索数据库的实验显示性能较低,平均指令覆盖率为 35.5%,主要原因是检索失败。这些结果表明,基于源代码的二进制恢复在高质量数据库下表现出色,在噪声环境下仍然是一种有用的工具。

点评: 结合传统逆向工程和 LLM 推理的混合方法,在高保真数据库条件下实现了 95.2% 的指令覆盖率,为逆向工程和漏洞分析提供了实用且高效的解决方案。


6. VEXAIoT:利用 AI 智能体自主进行物联网漏洞利用

作者: Katherine Swinea, Kshitiz Aryal, Lopamudra Praharaj, Maanak Gupta | 分类: cs.CR, cs.AI 链接: arxiv.org/abs/2607.09653v1

物联网系统由于硬件受限、固件过时和不安全的默认配置而天生易受攻击,这产生了对可扩展和自适应安全测试方法的需求。尽管最近采用 LLM 智能体在渗透测试和 CTF 环境中显示出潜力,但它们在物联网特定漏洞上的应用尚未被探索。本文提出了一个自主多智能体框架 VEXAIoT,用于使用基于 LLM 的推理和进攻性安全工具在物联网环境中进行漏洞发现和利用。该框架结合了漏洞检测智能体和攻击执行智能体,以执行侦察、规划攻击序列并针对脆弱的物联网服务执行利用。该系统在 IoTGoat 和 Metasploitable 环境中进行了评估,覆盖了十个映射到 OWASP 物联网漏洞的攻击场景。实验结果显示,攻击成功率高达 100%,token 开销低,大多数攻击的平均执行时间低于两分钟。在 260 次攻击执行中,VEXAIoT 达到了 95.0% 的总体成功率,包括在 IoTGoat 中的 94.5% 成功率和在 Metasploitable2 中的 96.7% 成功率。这些结果证明了 LLM 驱动的智能体在受控环境中自动化物联网漏洞评估和进攻性安全工作流的潜力。

点评: 首次将 LLM 多智能体框架系统性地应用于物联网漏洞利用,95% 的超高成功率证明了 AI 驱动安全测试的可行性,对 IoT 安全领域意义重大。


7. 有向无环图上的深度高斯过程

作者: Federico L. Perlino, Oliver Hamelijnck, Adam M. Johansen, Theodoros Damoulas | 分类: stat.ML, cs.LG, math.ST, stat.CO, stat.ME 链接: arxiv.org/abs/2607.09645v1

许多现实世界的过程可以表示为沿着有向无环图(DAG)的函数组合。在因果建模中,这些对应于底层机制;在工程中,对应于多保真度层次;在基因调控网络中,对应于转录因子。这些函数在 DAG 上被部分观测到,具有噪声和异质性采样测量,给重建、不确定性传播和推理带来了重大挑战。为了应对这些挑战,我们在函数上放置先验,并自然地得到了 DAG 上的深度高斯过程。我们在理论上研究了它们的先验塌缩行为,以及图拓扑和中间观测对信息保存的影响。我们获得了关于输入区分度得以保留的深度渐近频率的几乎必然下界,识别了这些界成立的广泛核类别,并证明了关于输入连接作用的一个猜想。我们提供了一种结构化的变分近似,它保留了图依赖关系、保持了组合不确定性,并捕捉了碰撞节点的解释消除行为。最后,我们实证验证了我们的理论结果和方法论,并建模了潜在碰撞 DAG、蛋白质信号网络以及多保真度重离子碰撞仿真任务,在恢复低保真度贡献的同时达到了最先进的性能,并提供了仿真器层次结构的可解释性。

点评: 将深度高斯过程扩展到有向无环图结构,提供了严格的先验塌缩理论分析和高效的结构化变分近似,在因果推断、多保真度建模等多个领域具有广阔应用前景。


8. PAC-ACT:面向动作块变换器的后训练演员-评论家方法

作者: Yujie Pang, Zudong Li | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.09590v1

精密工业接触操作需要可靠的机器人策略,能够在姿态扰动和接触力约束下工作。视觉-语言-动作模型提供了广泛的泛化能力,但通常引入高推理延迟和 GPU 内存成本,而视觉-动作块策略更适合实时工业控制。然而,这些策略通常通过行为克隆进行训练,在接触密集任务中容易出现分布偏移。本文提出 PAC-ACT,一种面向预训练动作块变换器策略的强化学习后训练框架。PAC-ACT 在块级别重新定义策略优化,构建了 ACT 转换的演员-评论家架构,并引入了一种混合行为先验约束,以在在线微调期间保留预训练的动作分布。在工业精密接触基准上的实验表明,PAC-ACT 在保持低延迟和低 GPU 内存使用的同时,提升了任务成功率、接触稳定性和力安全性。在 Contour 任务中,PAC-ACT 显著降低了峰值接触力,并将超过 60N 的力读数比例减少了 46 倍。稀疏奖励消融实验进一步表明,所提出的行为先验约束能够在随机初始姿态下实现有效的探索。

点评: 针对工业接触操作中的分布偏移问题,创新性地将强化学习后训练应用于动作块变换器,峰值力读数减少 46 倍的效果令人印象深刻,为实时精密工业机器人控制提供了新范式。


本内容由 AI 辅助生成,论文信息来源于 arXiv。