多智能体强化学习、具身评论模型与自适应偏好对齐新进展
今日精选 8 篇 AI/ML 论文,涵盖LG, AI, CL, CV, IR, stat.ML, stat.AP, SE, CR, RO等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖强化学习与策略优化、多模态表征学习、机器翻译推理、视觉抽象推理、智能体漏洞修复及世界模型等前沿方向。
1. SAF-OPD:面向同策略蒸馏的稳定优势融合框架
作者: Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu 等 | 分类: cs.LG, cs.AI 链接: arxiv.org/abs/2607.29209
基于可验证奖励的强化学习(RLVR)将单个响应级奖励广播至每个令牌,而同策略蒸馏(OPD)则利用更强教师模型为每个令牌提供密集优势信号,但性能受限于教师质量且抑制探索。二者的互补性使融合颇具前景,但研究发现固定系数融合会导致熵坍缩,根源在于两种优势信号的量级失配与时间失配。为此提出 SAF(稳定优势融合)框架,通过”稀疏化-压缩”机制实现量级控制,配合”热启动-退火”机制实现时间控制,各阶段可独立开关且开销可忽略。基于 GRPO 的 RLVR 实验覆盖 7 个数学推理与代码生成基准(Qwen3-1.7B/4B/8B),结果表明 SAF 有效避免熵坍缩,在全部六个模型-领域设定下将聚合分数提升 0.51–2.70%,训练稳定性显著改善。
点评: 精准定位 RLVR 与 OPD 融合中的两大失配问题,提出的轻量级四阶段方案为优势信号融合提供了新范式,实用价值突出。
2. 带思考的翻译:面向多领域机器翻译的难度自适应推理强化学习
作者: Yongshi Ye, Biao Fu, Chongxuan Huang, Yidong Chen, Xiaodong Shi | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2607.29287
多领域机器翻译(MDMT)因各领域语言复杂度不同而颇具挑战。受人类译者根据难度调节推理投入的启发,本文提出 TwT(Translation with Thought)——一个资源理性框架,可学习在直觉推理与深思熟虑推理之间动态切换。TwT 采用两阶段训练:(1)基于 DeepSeek-R1 蒸馏并由 GPT-4o 重写的难度感知长思维链进行监督微调;(2)采用混合奖励的强化学习同时优化翻译质量与推理效率。在 15 个基准、3 种可见语言和 59 种未见语言上的评估表明,TwT-7B 和 TwT-14B 在翻译质量上超越更大规模的 SOTA 推理模型,同时将令牌使用量减少 32–60%。
点评: 将认知科学中的”资源理性”理念引入机器翻译,实现了质量与效率的优雅平衡,“该想的时候想、不该想的时候不想”的设计思路值得借鉴。
3. 不要混合奖励,要混合策略:面向多奖励强化学习的策略分解与优化
作者: Ruiming Liang, Yi Zhong, Yizhen Yuan, Yinan Zheng, Tianyi Tan 等 | 分类: cs.AI 链接: arxiv.org/abs/2607.29246
现代大语言模型(LLM)不仅需要正确作答,还需适应不同的人类价值观和使用场景,多奖励强化学习因此日益重要。然而多目标优化面临严重的”对齐税”问题——不同优化目标可能相互权衡甚至冲突,导致训练不稳定、效率低下。本文提出 PRISM 框架,基于策略空间分解与组合的思想,不再混合不同奖励,而是优化一组独立的正面策略和一个全局负面策略,既缓解了多奖励策略优化中的潜在冲突,又通过灵活的策略组合实现推理时的可控性。在科学推理、工具使用推理和有益性-安全性对齐等实验上,PRISM 一致优于现有基线,并具备额外的推理时偏好控制能力。
点评: 视角新颖——从”奖励空间”转向”策略空间”做文章,一举解决多目标冲突与推理可控性两大痛点。
4. TraceViT:基于轨迹监督的视觉抽象推理
作者: Binnan Liu, Yechi Ma, Tian Xie, Wei Hua | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.29586
抽象与推理语料库(ARC)测试模型能否从少量输入-输出示例中推断未见变换并应用于新网格。循环视觉推理器通过多次迭代逐步精化预测,但传统训练仅约束最终输出,中间精化过程缺乏监督。本文提出 TraceViT,一种以语义单调变换链为训练信号的循环视觉推理器。通过重写并验证程序化任务实现,将每个解决方案分解为中间网格状态序列,每次迭代由少样本演示导出的任务参考和表示当前网格状态的对象工作区共同引导。轨迹链长度与循环步数可能不同,软轨迹对齐仅约束其序关系,允许模型自由分配迭代次数。TraceViT 在 ARC-AGI-1 上达到 67.8% 的 pass@2,在 ARC-AGI-2 上达到 24.3%。消融实验表明,轨迹监督仅在配合接地(grounding)时才发挥效用。
点评: 为 ARC 视觉推理提供了”过程监督”的新思路,证明中间步骤的可验证监督比单纯约束最终输出更有效。
5. GALA:淘宝上购推荐系统中用于自适应多模态表征的生成式对齐学习
作者: Jiping Liu, Zhongmin Zhang, Zisen Sang, Zhijia Fang, Tao Ouyang 等 | 分类: cs.IR, cs.LG 链接: arxiv.org/abs/2607.29213
外卖推荐系统日益依赖图像、文本和用户交互历史等多模态信号,但异构模态的有效融合仍是挑战,阻碍了多模态信号的联合建模与对动态用户意图的适应。主流两阶段方法中,内容语义预训练与行为驱动排序模型的分离限制了语义理解与用户行为模式的对齐。本文提出 GALA 三阶段流水线,核心创新在于中间的”生成式 RL 对齐”阶段——从用户行为构建多模态预训练数据,并通过基于转化的奖励进行精化,弥合预训练与微调之间的鸿沟。GALA 已在淘宝上购生产环境部署,服务超 2 亿日活用户。相较 SOTA 方法,离线 AUC 提升 +0.12/+0.20,在线 A/B 测试显示订单量提升 0.55%。
点评: 工业级多模态推荐系统的标杆之作——用生成式 RL 桥接预训练与微调的思想,在超大规模真实场景中得到了验证。
6. 双重机器学习的解析与 Bootstrap 置信区间:模拟研究与城乡肥胖差异应用
作者: Haozheng Xu, Siyuan Ma, Qingyan Xiang | 分类: stat.ML, cs.LG, stat.AP 链接: arxiv.org/abs/2607.29456
双重机器学习(DML)是治疗效应估计的常用方法,允许灵活使用各类机器学习算法进行 nuisance 参数估计并保持有效推断。然而实际应用中,不同 ML 算法的选择对 DML 方差估计的影响尚未被充分刻画。本文通过综合模拟研究比较了 DML 置信区间在不同 ML 算法下的覆盖率表现,涵盖普通最小二乘、LASSO、随机森林、LightGBM 和神经网络等学习器,同时对比解析置信区间与 Bootstrap 置信区间。结果表明,学习器选择对 DML 推断可靠性起关键作用;出乎意料的是,在许多设定下样本量增大时覆盖率反而下降。真实数据分析还发现,美国县级层面的乡村化程度对肥胖患病率具有统计显著的正向影响。
点评: 揭示了一个反直觉现象——样本量增大未必提升 DML 覆盖率,对应用研究者而言是重要的方法论警示。
7. AgenticRepair:面向智能体漏洞修复的多维程序上下文工程
作者: Michael Fu, Qiyue Mei, Patanamon Thongtanunam, Kla Tantithamthavorn | 分类: cs.SE, cs.AI, cs.CR 链接: arxiv.org/abs/2607.29422
自动化漏洞修复旨在从漏洞报告出发减少安全缺陷的修补时间。近年智能体 AI 方法在自动程序修复中展现了良好前景,但漏洞修复比一般缺陷修复需要更丰富的程序上下文——安全工程师实践中常会汇编这些信息,而现有智能体方法并未对此进行工程化处理。本文识别出三个关键缺口:捕获跨文件数据流与内存操作模式的代码结构上下文、揭示崩溃语义与内存来源的运行时执行上下文,以及还原脆弱代码模式引入过程的提交历史上下文。为此提出 AgenticRepair,通过三个专门化的 LLM 子智能体工程化上述上下文,并将其嵌入专用修复子智能体的记忆中用于上下文条件补丁合成。在包含 300 个真实实例的 SEC-Bench 上,AgenticRepair 达到 73% 的成功率,大幅超越最强基线 29 个百分点。
点评: 将”上下文工程”系统化引入智能体漏洞修复,三个互补的上下文维度设计精妙,为安全自动化修复树立了新标杆。
8. WCM:面向视觉-语言-动作强化学习的世界评论家模型
作者: Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong 等 | 分类: cs.RO, cs.CL, cs.CV 链接: arxiv.org/abs/2607.29613
视觉-语言-动作(VLA)模型的强化学习后训练在机器人操作领域展现出巨大潜力。基于评论家的 RL 方法依赖价值估计器,而现有估计器主要处理单帧观测或单帧 VLM 骨干潜在表征,与机器人控制的部分可观测特性存在根本性错配。简单地将观测历史纳入评论家会面临高维视觉空间的指数级复杂度,且纯标量回报回归对学习跨时间动态的监督不足。本文从根源上将其识别为状态近似问题:缺乏显式世界建模目标时,评论家表征无法捕捉价值估计所需的时间结构。为此提出世界评论家模型(WCM),基于轻量级 LeJEPA 架构,联合预测未来潜在状态与估计价值,使评论家的表征被显式训练以捕捉时间动态而非仅回归标量回报。WCM 无缝集成于同策略与异策略训练管线,兼容 Pi0、Pi0.5 和 OpenVLA-OFT 等主流 VLA 骨干。在四个基准的 149 个任务上,WCM 在分布内和分布外设定均取得 SOTA 性能,并在 7 个真实世界操作任务上完成验证。
点评: 创造性地将”世界模型”引入评论家设计,直击部分可观测性这一机器人 RL 的核心痛点,通用性与兼容性俱佳。
本内容由 AI 辅助生成,论文信息来源于 arXiv。