视频理解、代码修复与具身智能前沿进展

今日精选 8 篇 AI/ML 论文,涵盖AI, CL, CV, SD, LG, RO, eess.AS, HC, q-bio.GN等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖视频理解与字幕生成、代码修复、语音增强、机器人操作、故障诊断、医疗诊断和人机交互等多个前沿方向。


1. CineCap:基于时空锚点的结构化推理实现电影级视频字幕生成

作者: Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang 等 | 分类: cs.AI 链接: arxiv.org/abs/2606.24636v1

电影级字幕生成旨在使用专业的电影语言概念(如摄像机运动、镜头尺寸、景深、构图和拍摄角度)来描述视频的拍摄方式。这一能力对于细粒度视频理解和可控的电影级视频生成至关重要,但在现有的多模态大语言模型中仍未被充分探索。与基于问答的影视理解评估不同,电影级字幕生成需要在多个电影维度上生成统一的开放式描述。该任务的挑战在于:模型必须从微妙的视觉证据中推断出专业的电影概念,并生成既全面又准确的字幕。为此,我们提出了CineCap框架,它结合了基于时空锚点的结构化推理与强化学习,并引入了全面性、准确性和门控覆盖奖励。前者将专业的电影描述锚定在明确的视觉证据上,并将其组织成紧凑的原子化推理用于监督微调;后者则改善了描述完整性与事实正确性之间的平衡。此外,我们构建了CineCap Bench基准,包含472个手工标注的视频-字幕对用于系统评估。大量实验表明,CineCap持续优于强大的商业和开源基线模型,建立了电影级字幕生成的新SOTA。代码、模型检查点和基准已公开。

点评: 填补了多模态大模型在专业电影语言理解上的空白,其结构化推理与RL结合的设计思路对细粒度视频生成任务具有重要借鉴意义。

2. SHERLOC:面向代码修复代理的结构化诊断定位框架

作者: Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg | 分类: cs.CL 链接: arxiv.org/abs/2606.24820v1

LLM代理通过多轮工具使用来解决仓库级编码任务,但会将一半的预算花费在编辑前的故障定位上。虽然已出现专门的定位框架,但它们仍被评估为文件检索而非可操作的诊断,产生了缺乏修复代理所需诊断上下文的定位结果。我们提出SHERLOC(结构化假设驱动的探索与推理定位),这是一个免训练框架,将推理LLM与紧凑的仓库工具和自恢复机制配对,无需微调或多代理编排。SHERLOC在不同模型规模上达到了SOTA定位性能:在SWE-Bench Lite上accuracy@1为84.33%,在SWE-Bench Verified上recall@1为81.27%;在约30B参数规模下,它匹配或超越了其他代理方法。将我们的定位和诊断结果注入修复代理后,在SWE-Bench Verified上平均提升了5.95个百分点的解决率,同时将定位和总token消耗分别降低了36.7%和23.1%。

点评: 解决了代码修复中“定位”与“修复”的脱节问题,通过结构化推理大幅提升效率,对提升AI代码代理的实际可用性意义重大。

3. video-SALMONN-R³:通过“重看、重问、重答”实现高效视频理解

作者: Yixuan Li, Guangzhi Sun, Yudong Yang, Wei Li, Zejun MA 等 | 分类: cs.CV, cs.AI, cs.SD 链接: arxiv.org/abs/2606.24477v1

视频大语言模型通常受限于计算和内存预算,使用降低的帧率和空间分辨率,这可能导致它们错过问答所需的关键信息。一种实用高效的解决方案是两阶段范式:首先进行粗粒度视频理解以定位相关片段,然后以更高的时间或空间保真度重看这些片段。在本文中,我们提出了video-SALMONN-R³,这是首个通过强化学习实现重看能力的端到端视频-LLM,且不依赖思维链冷启动。这种设计消除了昂贵的CoT数据标注需求,避免了可能降低预训练视频理解能力的CoT监督微调。为了解决由重看引发的推理优先行为与预训练视频LLM的答案优先倾向之间的不匹配,我们提出了一种重答策略,即模型在首次观看时先给出直接答案,在重看后再进行精炼。最后,为了提高重看过程中对问题的遵循度,我们提出了一种重问机制,在重新访问定位片段时重新注入查询。实验结果表明,video-SALMONN-R³持续优于基础模型和QA-SFT基线,同时以显著更低的计算成本超越了以往的基于重看的方法。

点评: 提出了一种低成本、免CoT冷启动的“重看”方案,巧妙地解决了视频LLM资源受限与信息丢失的矛盾,为高效视频理解提供了新范式。

4. 基于LLM的两阶段Transformer框架:面向有限数据下的跨域轴承故障诊断

作者: Jinghan Wang, Feng Cheng, Wentao Wu, Hang Li, Gaoliang Peng 等 | 分类: cs.LG, cs.CL 链接: arxiv.org/abs/2606.24459v1

当工业环境中同时出现数据集异质性、工况变化和有限标注数据时,轴承故障诊断面临严峻挑战。现有方法孤立地解决这些问题,并依赖于隐式特征对齐,在并发挑战下效果有限。本文提出了一种知识引导的两阶段迁移学习框架,采用轻量级的GPT-2风格Transformer,利用因果自注意力从振动信号中提取层次化特征,建立显式通路,使预训练编码器权重和故障原型嵌入作为知识载体,从多源预训练迁移到目标域适配。该框架通过多源学习(获取通用表征)、基于原型的知识调制(实现目标适配)以及分类法自适应分类(实现异构故障类别间的无缝迁移)来解决双重偏移挑战。在四个真实数据集上的实验验证表明,仅使用10%的标注目标数据即可达到92.61%的平均准确率,比当前SOTA方法高出17.24个百分点,为工业4.0应用中的经济高效预测性维护建立了实用路径。

点评: 将LLM风格的Transformer架构引入工业故障诊断,其知识引导的两阶段迁移学习框架在极少量标注数据下取得了惊人效果,工程价值极高。

5. NoContactNoWorries:通过视觉和本体感觉估计接触状态以实现灵巧操作

作者: Soham Patil, Avirup Das, Sourabh Bhosale, Spandan Roy | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2606.24450v1

感知物理接触是灵巧操作的基础。虽然机器人通常依赖专用的硬件触觉传感器,但人类展现出一种非凡的能力,即通过整合视觉信息与对自身身体姿态和运动的内在感知来推断接触。受这种具身感知技能的启发,我们研究了机器人是否可以从视觉中学习推断接触状态,这种方法为二值接触估计提供了一种可扩展的替代触觉硬件的方案,从而避免了成本、脆弱性和集成方面的实际挑战。我们提出了NoContactNoWorries,一个基于Transformer的多模态框架,融合RGB-D视觉与机器人本体感觉,推断二值接触状态作为手-物体交互的伪触觉信号。我们通过在多个物体上训练单个接触预测模型进行验证,并展示了推断出的接触信号能够支持下游的强化学习代理完成手中物体重定向任务,且可泛化到未见物体。仿真和真实机器人实验均验证了我们的方法,凸显了从视觉和本体感觉推断接触的可行性。

点评: 模仿人类感知机制,用视觉+本体感觉替代昂贵的触觉传感器,这一思路对降低机器人灵巧操作的成本和复杂度具有突破性意义。

6. 超越U-Net:基于潜表示对齐的无跳跃连接主干网络用于流匹配语音增强

作者: Wangyi Pu, Michele Scarpiniti | 分类: cs.SD, cs.AI, eess.AS 链接: arxiv.org/abs/2606.24745v1

生成模型,尤其是扩散和基于分数的方法,最近在语音增强方面取得了强劲性能,但其迭代采样过程限制了实时部署。流匹配提供了一种高效替代方案,通过常微分方程以少量函数评估将带噪语音迁移到干净语音。在这项工作中,我们提出了一种用于流匹配语音增强的无跳跃连接编码器-解码器主干网络,并辅以潜表示对齐指导。不同于依赖U-Net跳跃连接(可能将噪声相关的低级特征传输到解码器),所提出的模型将其瓶颈和解码器表示与从冻结的不带量化的Descript Audio Codec编码器-解码器中提取的干净潜特征对齐。这种编解码器对齐的监督促进了紧凑的干净语音表示,同时保持了高效的少步推理。在WSJ0-CHiME3和VoiceBank-DEMAND上的实验表明,仅使用五次函数评估即获得了改进的PESQ和感知质量,在VoiceBank-DEMAND上尤为显著。

点评: 抛弃U-Net的跳跃连接,转而利用编解码器潜表示对齐,为流匹配语音增强提供了一种更干净、更高效的架构,对实时语音增强应用影响深远。

7. 这事儿很复杂:AI增强辅助沟通界面的设计与评估

作者: Blade Frisch, Will Wade, Dylan Gaines, Michelle Kinsella, Betts Peters 等 | 分类: cs.HC, cs.AI 链接: arxiv.org/abs/2606.24854v1

人工智能可以增强使用辅助与替代沟通(AAC)系统的人的能力。然而,评估AI增强的AAC界面可能很困难。人是交叉存在的个体,当前的评估指标难以捕捉人们对AAC的多方面且微妙的期望。我们探索了六个AAC问题空间的复杂性,研究了AI如何在这些空间中使用,并提出了更稳健的评估方法,以考虑人群的交叉细微差别。我们还讨论了这些问题空间中出现的一系列更广泛的问题,以及如何使用我们提出的评估方法来解决这些问题。

点评: 聚焦AI在无障碍沟通中的实际落地难题,批判性地反思了当前评估指标的不足,为人机交互领域的包容性设计提供了重要指导。

8. DeepBD:用于遗传性出生缺陷变异优先级排序与诊断的具身代理工作流

作者: Shiyu Li, Ziqi Yan, Zhihao Wu, Jielong Lu, Weiran Liao 等 | 分类: q-bio.GN, cs.AI 链接: arxiv.org/abs/2606.24779v1

出生缺陷是胎儿丢失、新生儿发病和长期残疾的主要原因。在疑似有遗传病因的病例中,外显子组和基因组测序已使许多病例从变异检测转向测序后解读:临床医生必须在不完全的胎儿或婴儿表型以及来自群体遗传学、变异效应预测、基因-疾病有效性、表型本体论、细胞和通路背景、蛋白质结构和临床文献的异质性证据下,对患者特定的候选变异进行排序。我们提出了DeepBD,一个用于遗传性出生缺陷变异优先级排序和诊断解读的具身代理工作流。DeepBD将工作流组织为:LLM辅助的病例结构化、预训练证据引擎、专家证据模块和具身诊断审查层。证据引擎从结构化规则证据、序列和变异效应表示以及表型条件化的生物学背景中学习患者特定的变异评分,而专家模块和代理层提供基于工具的精细化、候选池审查和基于排序候选的诊断导向综合。利用包含18,622个病例的内部胎儿和婴儿队列开发,DeepBD在内部保留的已解决病例基准上实现了Recall@1/3/5/10分别为0.658/0.882/0.912/0.929,在Exomiser衍生的前20名候选变异评估中,优于独立的Exomiser、DeepRare和提示LLM重排序基线。消融和重叠分析表明,规则证据、机制背景和专家精细化提供了互补信号。这些发现支持了一种将证据整合、工具精细化、LLM辅助诊断审查分离的具身代理工作流,用于遗传性出生缺陷的回顾性变异优先级排序。

点评: 展示了AI代理在精准医疗中的巨大潜力,通过LLM驱动的结构化工作流大幅提升遗传病诊断的准确性和效率,是AI for Science的杰出范例。


本内容由 AI 辅助生成,论文信息来源于 arXiv。