压缩对齐、VLA 微调、审计 Agent 与超参数保障
今日精选 8 篇 AI/ML 论文,涵盖LG, AI, math.OC, CL, CV, CR, RO, stat.ML, IT, math.ST, IR等方向
今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖大模型对齐与推理、多模态视觉推理、模型压缩与强化学习、AI 安全与可信认证、机器人 VLA 微调以及搜索系统自动化标注等前沿方向。
1. HiReLC:基于分层强化学习的神经网络压缩(剪枝与量化)
作者: Kamar Hibatallah Baghdadi, Kawther Guoual Belhamidi, Sara Belhadj, Aissa Boulmerka, Nadir Farhi | 分类: cs.LG, cs.AI, math.OC 链接: arxiv.org/abs/2606.26002v1
本文提出 HiReLC,一个分层集成强化学习框架,用于深度神经网络的自动联合量化与结构化剪枝。该框架将压缩搜索分解为两个抽象层级:低层智能体(LLA)独立按块操作,在多位宽、剪枝保留率、量化类型和粒度的多离散动作空间中为每个内核选择配置;高层智能体(HLA)通过基于 Fisher 信息灵敏度估计的集成投票来协调全局预算分配。为降低策略评估的计算成本,迭代主动学习循环将代理引导的 RL 优化与压缩后微调交错进行,使用轻量级 MLP 代理分摊昂贵评估,并在冷启动阶段使用 logit-MSE 代理。实验表明,在 Vision Transformer 和 CNN 基准上实现了 5.99-6.72 倍的参数存储压缩比,在一种设置下准确率提升 3.83%,在其余设置下仅下降 0.55-5.62%。
点评: 分层 RL 架构将模型压缩分解为“局部策略执行+全局资源协调”,有效避免了传统联合优化中的搜索爆炸问题,对实际部署中的自动化模型瘦身具有重要参考价值。
2. OPERA:基于客观困惑度强化学习的开放式推理对齐
作者: Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan 等 | 分类: cs.CL 链接: arxiv.org/abs/2606.25757v1
强化学习(RL)使大语言模型(LLM)在数学和代码生成等客观推理任务中表现出色。然而,将 RL 应用于创意写作等开放式任务仍然具有挑战性,因为以 LLM 作为评判者的奖励模型通常存在风格偏见和位置不一致,导致监督不稳定。为解决此问题,本文提出 OPERA,用源于困惑度动态的内在奖励取代不可靠的外部评判者。具体而言,从困惑度动态中推导出内在奖励信号,量化关键反思状态下的不确定性减少。在冷启动阶段,引入数据合成方法,利用精心设计的引导词生成多样化的推理轨迹,以及利用内部对数概率识别逻辑一致推理分支的困惑度优先展开。在 Qwen3-8B 上实施 OPERA 后,在开放式任务中建立了开源模型的新 SOTA,并在某些任务上与 Gemini2.5 和 MiniMax-M2.5 等专有模型持平或超越。
点评: 用模型自身困惑度波动替代外部 LLM 评判者,巧妙避免了开放式任务中奖励模型的偏差问题,为长文本生成和创造性推理的 RL 对齐提供了全新路径。
3. TriViewBench:面向多模态大模型多视角结构推理的受控复杂度缩放基准
作者: Yu-Yang Chen, Lan-Zhe Guo | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2606.26029v1
多模态大语言模型(MLLM)在标准视觉问答基准上表现出色,但其在受控结构复杂度下的可扩展性仍然不明确。本文提出 TriViewBench,一个由合成 3D 场景构建的受控三视角视觉推理基准,具有显式参数化的物体数量和遮挡程度。该基准包含 1923 个场景和超过 14000 个问答对,分为四个复杂度等级和三个推理类别:局部决策、物体计数和全局恢复。在统一提示协议下评估了 18 个开源和闭源 MLLM。所有 18 个模型无一例外地表现出相同的能力层级(局部决策 > 物体计数 > 全局恢复),且性能随复杂度单调下降:局部决策任务温和下降 12.11%,物体计数大幅下降 59.14%,全局恢复严重崩溃达 80.02%。错误分析揭示两种机制上独立的失败模式:单视角任务中因遮挡盲视导致欠计数,而多视角任务则因跨视角身份混淆反转成过计数。思维链(CoT)提示带来的总体收益几乎为零,其效果受能力门控强烈制约,表明瓶颈在于跨视角空间表征而非推理策略本身。
点评: 通过参数化的 3D 场景系统性地暴露了当前 MLLM 在多视角空间推理上的根本瓶颈——不是推理策略不足,而是跨视角表征能力缺失,为下一代视觉模型设计指明了关键改进方向。
4. 不可解除的安全内核:面向 AI Agent 及其他可逃避 AI 系统的执行时对齐
作者: Seth Dobrin, Łukasz Chmiel | 分类: cs.AI, cs.CR, cs.LG 链接: arxiv.org/abs/2606.26057v1
AI Agent 被授予访问工具、API 和其他基础设施的权限,使其成为这些系统中的活跃主体。当前主流方法将控制置于 Agent 自身的运行环境内:系统提示、输出过滤器和护栏库。Agent 地址空间中的任何控制都可被影响它的输入所触及;这泛化到任何对其自身运行环境具有足够影响力的 AI 系统,本文将其定义为可逃避 AI 系统。论文确定了授权机制必须具备的四个属性以实现架构性控制而非合作性请求:进程隔离、结构化唯一路径上的动作前执行、请求级和系统级的安全失效关闭,以及可在受控系统信任边界外验证的外部化签名证据。作者将该层定位为执行时 AI 对齐,补充了训练时对齐(RLHF、Constitutional AI)和推理时对齐。实验表明,在 1000 次自我修改中,所有 704 次针对安全关键核心的攻击均被拒绝,无一次逃逸。
点评: 提出了“可逃避 AI 系统”这一关键概念,并从架构层面给出了不可解除的安全控制方案,其 Rust 实现通过了形式化验证,对 Agent 安全治理具有里程碑式的实践意义。
5. 确定性审计中的概率性 Agent:基于德国 IT-Grundschutz 自动化审计的多 Agent 系统评估
作者: Lea Roxanne Muth, Marian Margraf | 分类: cs.CR, cs.AI 链接: arxiv.org/abs/2606.25622v1
NIS-2 指令要求数千家中小企业实施强大的风险管理。为确保合规,企业依赖德国联邦信息安全局的 IT-Grundschutz(IT-GS)等标准。然而,IT-GS 认证资源密集,需要大量人工进行文档编制、验证和修订。本文在先前概念框架的基础上,展示了结合混合检索增强生成(HybridRAG)的多 Agent 系统(MAS)架构在 IT-GS 认证部分自动化中的技术实现和实证评估。论文引入两项新颖的技术贡献:结构分析阶段的假设-验证循环,通过交叉引用 Agent 推断的依赖关系与知识图谱来减少幻觉,以及解耦推理管线,将 Agent 驱动的语义提取与确定性的保护需求继承分离开来。实证结果表明,MAS 在语义任务(结构分析和建模)中表现出高效能,显著减少了人工工作量,但在逻辑推理阶段(保护需求评估和 IT-GS 检查)中,当前 LLM 的概率特性难以满足 IT-GS 所需的确定性严谨性。
点评: 揭示了 LLM 在自动化合规审计中的核心悖论:语义理解能力卓越,但逻辑推理的概率本质与合规审计的确定性要求存在根本冲突,“假设-验证循环”是缓解这一矛盾的务实设计。
6. FORCE:通过价值校准预热与自蒸馏实现高效的 VLA 强化微调
作者: Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu 等 | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2606.26006v1
视觉-语言-动作(VLA)模型通常受限于次优数据带来的模仿天花板。强化学习(RL)微调可以超越此限制,但其样本效率极低。这一挑战源于两个核心问题:(1) 不稳定的 Q 函数导致的灾难性初始遗忘,以及 (2) 低质量探索数据导致的低效策略更新。本文提出 FORCE,一个三阶段框架,通过解决这两个问题来稳定微调。FORCE 首先引入价值校准预热阶段,利用在线策略展开来缓解 Q 函数的分布偏移。随后在线阶段,校准后的 Q 函数充当过滤器,同时筛选策略自身的动作提案和专家数据,确保仅高价值动作用于策略更新。在模拟和真实世界任务上的评估显示,FORCE 实现了 79% 的成功率绝对提升,比先前 RL 方法高出 10%,同时训练速度提升 32.5%,并且在无需人工干预的情况下实现了稳健性能。
点评: 精准诊断并解耦了 VLA 模型 RL 微调中的两大训练痛点,价值校准预热和 Q 函数过滤机制简单而有效,是推动机器人自主智能体实用化的重要一步。
7. 统计有效的超参数选择:从调优到保证
作者: Amirmohammad Farzaneh, Osvaldo Simeone | 分类: stat.ML, cs.IT, cs.LG, math.ST 链接: arxiv.org/abs/2606.25601v1
超参数选择是部署现代人工智能系统的关键步骤,需要调整推断时参数、实现级设置以及驱动决策规则的阈值等多个自由度。尽管具有实际重要性,超参数选择通常使用网格搜索或贝叶斯优化等最佳实践经验方法进行,这些方法无法提供关于可靠性或安全性的形式化统计保证。本专著提出了一个统一的统计框架,用于可靠的超参数选择,以“先学习后测试”(LTT)范式为核心,将问题建模为在候选超参数集上的多重假设检验。该框架能够选择可证明满足应用特定可靠性要求的超参数——包括平均风险界限、分位数风险界限或信息论约束——并具有显式的、有限样本的误差概率控制。
点评: 将超参数选择从“经验调优”提升到“统计保证”的范式高度,对于医疗、金融等高风险领域的 AI 系统部署具有不可替代的理论和工程价值。
8. AutoRelAnnotator:面向赞助搜索成本效益相关性评估的校准模型级联
作者: Md Omar Faruk Rokon, Shasvat Desai, Hong Yao, Kuang-chih Lee | 分类: cs.IR, cs.AI 链接: arxiv.org/abs/2606.25871v1
如何在不依赖人工标注的成本和延迟情况下,大规模生成高质量的相关性标注?相关性标注是搜索引擎排名系统的支柱,用于训练数据准备、NDCG 评估和根因分析。然而,人工标注速度慢,现成的 LLM 在领域特定任务上准确性不足。本文提出校准模型级联,通过将查询路由到逐渐变大的微调分类器,实现成本高效的离线相关性标注。核心洞见在于:准确性和成本是正交的优化目标——领域特定微调驱动准确性,级联驱动成本,而逐类等渗校准在此之上提供微小但可靠的增益。论文的三项贡献:(a) 分解增益,显示微调贡献 20 个准确率点,级联在近似保持准确率的同时将计算成本减半;(b) 引入逐类等渗校准作为级联的一个组件,贡献微小但统计显著的增益;(c) 在生产环境中验证,处理超过 1.5 亿次标注,显著缩短实验周期。
点评: 通过“微调保精度、级联降成本、校准补细节”的三层解耦设计,系统性地解决了搜索广告领域大规模离线标注的效率-质量权衡问题,工业落地价值突出。
本内容由 AI 辅助生成,论文信息来源于 arXiv。