毫米波感知、代码污染检测与具身智能安全审计新进展

精选 8 篇 AI/ML 论文,涵盖AI, LG, CV, CL, RO, CY, CR, SE, stat.ML等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖多模态感知(毫米波雷达与语言模型的结合)、AI 生成视频检测、代码安全防御、机器人操作、算法审计以及强化学习环境合成等前沿方向。


1. 语言模型能理解毫米波数据吗?——面向毫米波雷达人体理解的大语言模型基准测试

作者: Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi | 分类: cs.AI 链接: arxiv.org/abs/2608.14179v1

大语言模型(LLM)展示了卓越的推理和生成能力,这促使人们将其用作通用感知推理引擎。尽管视觉语言模型(VLM)等现代方法已尝试将推理能力融入视觉感知,但 LLM 与毫米波(mmWave)模态的整合——尽管毫米波在低光照和遮挡条件下具有独特优势——仍基本未被探索。主要瓶颈在于雷达-语言配对数据的稀缺、严重的跨数据集异质性以及基础毫米波编码器的缺失。我们通过一个极简文本化接口解决了这一空白,该接口将每个毫米波点云序列化为简洁的自然语言,使现成的 LLM 能够在问答(QA)设置中运行。在此基础上,我们提出了 mmWave-QA,这是首个面向语言条件化毫米波人体感知的基准测试。mmWave-QA 聚合了异构的公共毫米波数据集,并通过校准感知预处理和全局分类对齐进行协调,同时提供自然语言问答。该基准涵盖六个场景和五个 QA 任务,能够在不同的毫米波硬件和实验条件下进行标准化评估,为毫米波-LLM 集成的可扩展研究奠定了基础。我们还在 mmWave-QA 上评估和分析了 LLM,突显了它们在雷达感知方面的零样本推理潜力,以及在视觉退化情况下的鲁棒性。

点评: 首次将 LLM 与毫米波雷达感知结合并建立标准化基准,为低光照/遮挡场景下的多模态推理开辟了新路径,值得关注。


2. 基于影响函数检测被污染的代码生成提示批次

作者: Francesco Quinzan, Noor Munir, Yishun Lu, Stephen Roberts | 分类: cs.LG 链接: arxiv.org/abs/2608.14303v1

大语言模型(LLM)越来越多地用于代码生成,但它们仍然容易受到诱导不安全实现的提示的影响。现有的防御通常依赖于预定义威胁模型或已知漏洞模式,这限制了它们应对新型攻击的有效性。我们提出了 CodeSIFT,一种与威胁模型无关的检测方法,利用影响函数来识别诱导模型异常行为的提示批次。CodeSIFT 并非检测特定漏洞,而是衡量生成代码的参数空间影响,并使用统计检验来确定候选提示集是否偏离良性参考分布。为了评估我们的方法,我们引入了两个覆盖多种漏洞的基准数据集。我们在三个参数量从 3B 到 7B 的开源代码 LLM 上评估了 CodeSIFT,在中高注入率下 AUROC 得分高达 0.98,同时保持了校准良好的误报率,并显著优于静态分析基线。这些结果表明,基于影响函数的检测是识别恶意代码生成提示的一个有前途的方向,无需事先了解潜在攻击类别。

点评: 不依赖已知漏洞模式的威胁无关检测思路创新性强,对提升代码生成安全防线有实际参考价值。


3. 我们能防御针对真实危机事件的 AI 生成视频攻击吗?——检测器、生成器与社会传播的系统评估

作者: Shuo Liang, Yixing Ma, Pengfei Zhou, Xingyan Chen, Zihan Mei et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2608.14391v1

最近的视频生成器可以伪造战争、灾难、公共紧急事件和其他现实世界危机的逼真场景,造成重大的错误信息风险。然而,现有基准在这些场景下提供的关于检测器和生成器行为的证据有限,包括可检测性如何随生成条件变化、人们如何感知生成的视频,以及检测器在社会传播过程中是否保持可靠。为解决这一空白,我们引入了 RA-Bench,一个以真实视频为锚点的 AI 生成视频检测基准。RA-Bench 包含 17,886 个视频,包括 10 个社会风险类别下的 1,830 个真实视频锚点和来自四个开源及五个闭源生成器的 16,056 个生成剪辑。基于 RA-Bench,我们沿三个维度组织评估。我们首先评估了七种传统检测器、三种审查设置下的十个零样本多模态模型以及两个专门针对 AI 生成视频检测微调的 MLLM 的检测器泛化能力。在这些方法中,三个检测器家族均未能在 RA-Bench 实例上一致地泛化。然后,我们研究了可检测性如何随生成质量、条件信息和采样种子而变化。这些分析表明,生成属性对不同检测器家族的影响不同,而源级检测模式在不同种子间保持稳定。最后,我们研究了人类真实性判断和检测器在社会传播过程中的可靠性。我们发现,误导人类的视频对当前检测器来说也很困难,而社会传播使检测变得更加困难。总之,这些发现表明当前方法难以检测逼真的 AI 生成视频,突显了开发对不断演进的视频生成器具有鲁棒性的检测器的必要性。

点评: 大规模的真实危机事件视频检测基准,系统揭示了现有检测器在生成条件变化和社会传播中的脆弱性,对反 misinformation 研究有重要借鉴意义。


4. Envs-FORGE:面向智能体强化学习的前沿优化奖励落地环境合成

作者: Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi et al. | 分类: cs.CL 链接: arxiv.org/abs/2608.14312v1

终端智能体的强化学习(RL)需要可执行的训练环境,并具备可靠的奖励和有用的难度。固定的方法如 few-shot、Self-Instruct 和 Evol-Instruct 对每个种子应用相同的提示策略,即使当前策略可能受益于更难、更简单或仅仅不同的任务。我们提出了 Envs-FORGE,一种将验证器奖励转换为每个种子的环境合成动作的提示策略。Envs-FORGE 估计种子通过率,在目标学习前沿周围对六个投影方向动作进行评分,并求解每个种子的混合整数线性规划(MILP)以选择生成条件。选定的动作驱动指令、测试夹具、oracle 解决方案、测试和 Docker 环境的同步重写;只有经过 gold 验证的捆绑包才能进入 RL 训练。索引 MILP 形式还支持可选的软技能覆盖以进行组合规划。在 Qwen 3.5 35B 上,Envs-FORGE 在 tb-core 上将 Pass@1 比 Base 提高了 9.2 个百分点(从 40.0% 提升到 49.2%),在 tb-2.0 上提高了 6.4 个百分点(从 23.0% 提升到 29.4%),比最强的固定方法基线高出 2.4 和 2.1 个百分点。它在 SWE-bench Verified 上达到 77.1%,而 Base 为 73.4%,并在评估的 4B-35B 模型上将 tb-core 提升了 6.8-9.2 个百分点。所有合成方法都导出了 100 个验证环境,并使用 227 万至 288 万合成 token,将比较置于相同的下游训练集大小和相同的操作规模。源代码可在 https://github.com/DataArcTech/DataArc-SynData-Toolkit/ 获取。

点评: 自适应环境合成策略显著提升终端智能体 RL 性能,MILP 驱动的动作选择机制为数据合成提供了精细化的新范式。


5. Reflex:实现反应关键操作中快速且预测性的视觉-语言-动作模型

作者: Yuxuan Chen, Wanruo Zhang, Xiao Li | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2608.14379v1

视觉-语言-动作(VLA)模型最近在机器人操作中取得了令人鼓舞的性能。然而,现有基准主要评估静态操作任务上的泛化能力,在很大程度上忽视了动态交互场景。为填补这一空白,我们提出了 ReflexBench,一个用于反应关键操作的基准。ReflexBench 包含六个动态任务,并引入了一个评估框架,将模拟器步进与机器人控制解耦,同时支持同步和异步推理下的可配置延迟。在 ReflexBench 的基础上,我们提出了 ReflexVLA,一种专为反应关键操作设计的高效 VLA 模型,无需大规模机器人数据预训练。ReflexVLA 通过视觉骨干中的潜在未来预测和多帧时间融合增强了时间推理,同时通过批处理视觉编码和 CUDA Graph 重放减少了部署延迟。实验表明,ReflexVLA 持续提高了动态操作性能,同时在标准静态操作基准上保持了具有竞争力的准确性,真实世界实验进一步证明了其在实际部署条件下的有效性。项目网站:https://reflexvla.github.io

点评: 首个聚焦反应关键操作的 VLA 基准和高效模型,在时间推理与推理延迟上做出了针对性设计,对动态操控落地有直接推动。


6. AI 推荐哪一位医生?——大语言模型辅助医生选择中声誉与人口统计学信号的算法审计

作者: Syeda Anshrah Gillani, Mirza Samad Ahmed Baig | 分类: cs.CY, cs.AI, cs.CL 链接: arxiv.org/abs/2608.14399v1

患者越来越多地询问大语言模型(LLM)助手该看哪位医生,这使得这些系统成为 AI 信息中介:一种在人与人之间调解选择的算法,从而在静默和大规模地决定哪些医生变得可见。我们报告了一项预先指定的随机算法审计,研究何种因素因果性地推动这些推荐。七个模型(六个开源;gpt-4o-mini)在 3,024 个选择集、三个人格画像、九个提示改写和九个实验组中,各自从五个合成家庭医学医生卡片中进行选择,得到 40,068 个评分响应;性别和种族通过遵循通信审计方法的姓名来标识。声誉信号占主导地位:将评分从 3.9 提高到 4.7 会使选择概率增加 31.4 个百分点(pp),而将费用从 90 美元提高到 190 美元则使其降低 20.0 pp。人口统计学均等性被拒绝,但方向与人类审计研究预测的相反:女性姓名获得 2.5 pp 的优势,西班牙裔、南亚裔和黑人姓名比白人姓名获得 1.3-2.9 pp 的优势,这相当于每次就诊 7-14 美元的费用等价倾斜,而无内容的首位位置价值 11 美元。然而,模型在最 0.03% 的陈述理由中提到性别或种族,并在 0.39% 的试验中弃权,因此这些效应在模型自身的解释中是不可见的,依赖模型自我报告的透明度义务将无法检测到它们。一个推理模型完全未能通过预先指定的可审计性门槛。冻结的设计使审计可重复:任何新模型都可以针对相同的刺激进行评估,使周期性行为审计而非自我报告解释成为适合目的的监控技术。

点评: 大规模、可复现的算法审计揭示 LLM 在医生推荐中的隐性偏见与自我报告盲区,对医疗 AI 透明度和监管有深刻的政策启示。


7. 基于混合 LLM 的业务流程模型自动安全标注生成框架

作者: Md Kamrul Islam, Tiphaine Henry, Mattia Salnitri, Julius Köpke, Sami Souihi | 分类: cs.CR, cs.AI, cs.SE 链接: arxiv.org/abs/2608.14370v1

安全业务流程的建模和分析需要将安全标注整合到流程模型中。尽管 BPMN 扩展(包括 SecBPMN2)为此目的而存在,但从自然语言规范中推导准确完整的安全标注仍然是一项手动、专家密集型且容易出错的任务。本文提出了一个混合框架,以 BPMN 流程模型和安全需求文档为输入,自动生成符合 SecBPMN2 规范的安全标注。该方法结合了基于大语言模型(LLM)的语义提取与模式约束映射、基于规则的规范化和确定性验证。该框架在来自不同领域的 27 个流程模型的精选数据集上进行了全面评估。结果表明,它始终生成结构有效且具有高模式完整性的 SecBPMN2 标注。与人类安全分析师相比,该系统实现了显著更高的精确率(0.58 vs. 0.29),同时保持了相当的召回率(0.52 vs. 0.50),并将错误或不恰当的标注减少了近 50%。此外,标注生成明显快于手动标注。这些发现表明,LLM 与基于规则的混合自动化可以减少建模工作,同时提高一致性和可靠性,从而为 BPM 中的安全设计提供可扩展的基础。

点评: 将 LLM 语义提取与规则约束结合用于安全标注自动化,在精确率上大幅超越人工,为 security-by-design 的规模化落地提供了可行路径。


8. 分布时序差分学习中的在线推断

作者: Yang Peng, Liangyu Zhang | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2608.14408v1

我们研究了固定策略下收益分布泛函的在线统计推断。收益分布通过非参数分布时序差分学习从单个马尔可夫轨迹估计。对于 Polyak-Ruppert 平均估计器,我们证明了其根号 T 误差在 Cramér 空间中弱收敛到一个中心高斯随机元。我们还证明了,在观测轨迹的条件下,bootstrap 与原始平均之间的根号 T 差异弱收敛到相同的高斯极限。这些结果证明了平滑统计泛函(包括方差、CVaR、预期短缺和 expectiles)的 bootstrap 推断是合理的。对于非平滑统计泛函,我们在 T^{-1/2} 邻域内针对有限多个阈值开发了估计收益 CDF 的局部渐近理论,以及其 bootstrap 对应物。这一理论使我们能够对由 CDF 方程表征的非平滑统计泛函进行推断,包括收益分位数。

点评: 为分布强化学习的在线推断提供了严谨的渐近理论,其 bootstrap 有效性证明对实际应用中的不确定性量化有坚实支撑。


本内容由 AI 辅助生成,论文信息来源于 arXiv。