智能体协作优化、多模态嵌入、具身智能与私密生成方法新进展
精选 8 篇 AI/ML 论文,涵盖AI, LG, CL, CV, IR, CR, RO, stat.ML, stat.ME等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖智能体 LLM 的后训练优化、测试时潜在推理、多模态检索统一模型、网络安全智能体、隐私保护不确定性量化以及视觉语言模型在搜索评估中的应用等前沿方向。
1. 面向资源受限智能体 LLM 后训练的协同协同进化方法
作者: Zhiyuan Wang, Shengcai Liu, Jiahao Wu, Ning Lu, Hui Ouyang et al. | 分类: cs.AI, cs.LG 链接: arxiv.org/abs/2608.02391v1
使用工具的大语言模型(LLM)智能体产生长程、多轮轨迹,这使得基于梯度的后训练极为消耗内存。进化策略(ES)无需反向传播即可实现内存高效的全参数后训练,并最终达到与基于梯度的强化学习(RL)相当的性能。然而,资源受限环境通常仅提供少量 GPU,ES 的高 GPU 小时需求意味着训练时间过长。为解决此问题,我们引入了协同参数子空间进化策略(CoPES),一种协同进化方法,将全参数空间分解为低维子空间并进行协同搜索,以提高优化效率。我们对用于数学任务的 Qwen3.5-4B 工具使用智能体进行后训练,并在五个难度不同的基准上进行了评估。在全参数 GRPO 最优验证检查点的 GPU 小时预算下,CoPES 恢复了 GRPO 验证准确率增益的 92%,而标准 ES 为 67%,同时其理论 GPU 内存需求低于全参数 GRPO 的八分之一。在所有五个基准的 pass@k 指标上,它始终优于标准 ES 和基于 LoRA 的 GRPO。额外实验进一步显示了 CoPES 在问答任务上的优势。这些结果表明,在资源约束下进行智能体 LLM 后训练时,CoPES 在内存需求和训练时间之间实现了更好的权衡。
点评: CoPES 为资源受限场景下的智能体后训练提供了实用解决方案,在显著降低内存需求的同时保持高性能,值得关注。
2. GradCuit:信用分配的梯度流实现稳健且可解释的测试时潜在推理
作者: Zhaoxin Yu, Qi Shen, Hengli Li, Zhaowei Zhang, Song-Chun Zhu et al. | 分类: cs.LG, cs.CL 链接: arxiv.org/abs/2608.02585v1
基于优化的潜在推理通过在测试时优化实例特定的连续状态来改进大语言模型输出,同时保持模型参数冻结。然而,现有方法通常通过解码后的 token 连接这些状态与推理轨迹,导致序列级信用分配不直接,并且模糊了潜在更新如何塑造后续推理。我们引入了 GradCuit,在选定的 Transformer 层的提示隐藏表示与生成续文之间插入可优化的潜在状态。因果自注意力为每个续文 token 的对数概率提供了到每个先前潜在状态的可区分路径,使得来自整个续文的奖励加权梯度可以直接分配给潜在状态。在五种指令微调骨干模型、三个推理基准和两种答案格式上,GradCuit 实现了 64.5% 的平均准确率,比思维链提示高出 6.6 个百分点,比最强竞争方法高出 2.4 个百分点。GradCuit 还表现出更强的鲁棒性:在七种学习率设置下,它始终优于 LatentSeek,同时将准确率标准差从 1.53 降至 0.82。在可解释性方面,token 级梯度归因显示潜在影响集中在推理连接 token 上,而层分析则确定中早期 Transformer 层是最有效的优化空间。
点评: GradCuit 通过直接优化内部推理状态,为测试时扩展提供了新思路,兼具鲁棒性与可解释性。
3. 智能体工作流的全局优化与推理时区域嫁接
作者: Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang et al. | 分类: cs.CL 链接: arxiv.org/abs/2608.02353v1
近期智能体工作流优化的进展通过任务特定的工作流搜索或输入条件架构选择来自动化工作流设计。然而,这些方法在执行前确定工作流,无法利用执行时的无标签质量信号来适应失败的工作流区域。通过整个工作流重新优化来实现这种推理时适应在计算上是不可行的。为应对这一挑战,我们引入了 GRAFT,它在保留全局优化工作流的同时,仅为每个输入局部替换选定的区域。无需参数训练,GRAFT 使用无标签执行质量信号评估区域级备选方案,并仅接受能改善局部质量且保持工作流级一致性的替换。GRAFT 可无需修改地应用于数学推理、代码生成以及多跳和知识密集型问答等任务。在匹配的优化器和执行器设置下,它比最强先验工作流优化方法 MaAS 平均提高 3.85 分。
点评: GRAFT 将工作流优化从静态产物转变为可动态适应的执行策略,推理时反馈使智能体系统更灵活。
4. UEmbed:统一稀疏与稠密多模态嵌入
作者: Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie et al. | 分类: cs.CV, cs.AI, cs.CL, cs.IR 链接: arxiv.org/abs/2608.02583v1
稀疏检索是现代搜索系统的支柱。现有工作引入了学习式稀疏检索(LSR)以超越精确词汇匹配。然而 LSR 目前仍局限于编码器风格的双向架构,其多模态扩展仍严重依赖辅助跨模态模块。为解决这些限制,我们引入了 UEmbed,一种仅解码器的多模态嵌入模型,在单次因果前向传递中同时生成稀疏词汇和稠密表示。UEmbed 在输入中附加 N 个可学习特殊 token,并将词汇表划分为 N 个不相交子集。每个 token 的因果隐藏状态在其指定子集上预测稀疏权重,N 个子集拼接成完整稀疏向量。我们在 2B、4B 和 9B 规模发布 UEmbed。UEmbed-9B 在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏),优于现有公开数据训练的多模态嵌入模型。
点评: UEmbed 统一了稠密与稀疏多模态嵌入,为检索系统提供更高效、更灵活的范式。
5. 通过数字孪生增强多尺度规划的智能体事件响应
作者: Yiran Gao, Tao Li, Kim Hammar | 分类: cs.CR, cs.AI 链接: arxiv.org/abs/2608.02422v1
事件响应目前由安全操作员使用预定义剧本管理,导致安全决策过程缓慢且劳动密集。因此,对自动化事件响应规划的需求日益增长。基于决策理论的规划方法已提出,但大多局限于抽象模型。利用 LLM 中嵌入的安全知识开发智能体响应系统是一种有前景的方法。然而,当前的智能体方法依赖反复调用 LLM 生成响应计划,因幻觉而不可靠。在本文中,我们结合决策理论规划与 LLM 生成的响应命令,开发了一种基于 LLM 的原则性规划方法。所提出的智能体事件响应方法使用 rollout 规划器计算分配安全资源的高层策略,再由轻量级 LLM 智能体将其转换为可执行命令。在此架构中,我们使用支持战术规划仿真和操作执行仿真的数字孪生。在三种攻击场景中,我们的方法平均减少恢复执行时间 15.1%,恢复率提高 33.6%。
点评: 数字孪生与多尺度 LLM 规划的结合为自动化安全事件响应带来更可靠的方案。
6. TS-MAMP:由退役电动汽车组件驱动的再造农业机器人与无需 NMS 的田间杂草检测
作者: Weijie Shi, Zicheng Xu, Zhenbang Cheng, Haoran Xuan, Mingbo Duan et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2608.02270v1
农业 4.0 机器人系统提高了田间效率,但对全球农业主导的分散小农户来说仍过于资本密集。同时,越来越多的退役低速电动车(LSEV)动力系统保留了功能性机电价值,但被破坏性回收。本文介绍了 TS-MAMP,一个在 3R 循环经济原则下构建的再造机器人。退役的 48V 无刷直流轮毂电机通过反电动势匹配配对,筛选状态健康 60%-80% 的铅酸电池模块在 100mV 模块间电压偏差内主动均衡。这些重用组件将动力系统与底盘 BOM 成本降低约 60% 至 450 美元以下。无 NMS 的 YOLOv10n 检测器达到 80.87% mAP@0.5,并通过 FP16 TensorRT 部署在 Jetson Nano 上,确认了设备端推理可行性。
点评: TS-MAMP 展示了退役电动汽车组件在低成本农业机器人中的再造路径,兼具环保与实用价值。
7. 通过分块实现私有生成式自举
作者: Jinwon Sohn, Veronika Ročková | 分类: stat.ML, cs.LG, stat.ME 链接: arxiv.org/abs/2608.02480v1
随着 AI 系统获得更多个人信息访问权限,保护统计回答的隐私至关重要。同样重要的是对回答中不确定性的私有化报告。为此,我们采用贝叶斯似然无关框架,并使后验模拟私有化。我们提出一种使用分块策略的私有贝叶斯自举新方法。我们不是为每个个体分配特质随机权重,而是随机分组并为一组分配一个权重。通过在组内隐藏个体贡献,我们强化了差分隐私门。我们利用摊销推理将私有学习与后验采样解耦。从观测权重到后验样本的推进行映射通过在训练中添加校准噪声来私有学习。我们将所得方法称为私有生成式贝叶斯自举(PGBB)。我们建立了差分隐私保证,分析了与非私有分块自举目标的收敛性,并量化了普通与分块贝叶斯自举后验之间的差异。此外,我们还推导了块 Dirichlet 浓度参数的无数据调优以渐近恢复后验离散度。
点评: PGBB 为不确定性量化提供了一种隐私保护方案,在保持差分隐私的同时提供竞争性的私有量化结果。
8. 利用视觉语言模型推进网络规模搜索的相关性度量
作者: Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath et al. | 分类: cs.IR, cs.LG 链接: arxiv.org/abs/2608.02446v1
相关性评估在个性化搜索系统中扮演着关键角色,作为用户参与指标之外的护栏,确保搜索结果与用户查询和意图一致。虽然人工标注是传统方法,但其高成本和长周期限制了可扩展性。在这项工作中,我们提出了一个基于 VLM 的自动化相关性评估流水线,部署在 Pinterest 搜索的在线 A/B 实验中。我们严格验证了 VLM 生成的判断与人工标注之间的一致性,证明 VLM 可以为实验提供可靠的相关性测量,同时大大提高了评估效率。利用基于 VLM 的标注进一步解锁了扩展查询集、优化采样设计和高效评估更广泛搜索体验的机会。这种方法带来了更高质量的相关性指标,并显著降低了在线实验测量中的最小可检测效应。
点评: 视觉语言模型驱动的自动化相关性评估显著提升了搜索实验的评估效率与可扩展性。
本内容由 AI 辅助生成,论文信息来源于 arXiv。