大模型推理校准、视频身份推理与具身容错控制

精选 8 篇 AI/ML 论文,涵盖AI, LG, CL, quant-ph, CV, SE, CY, eess.AS, math.OC, HC, RO等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖统计推理强化、模型校准、量子自然语言处理、视频推理基准、AI 风险治理、医疗语音筛查、工业优化及机器人容错控制等多元方向。


1. Fisher-R1:训练具备可靠假设检验能力的 LLM 代理

作者: Jiacheng Miao, Jin Mu, Guanhua Chen, James Zou | 分类: cs.AI 链接: arxiv.org/abs/2608.07437v1

可靠的假设检验是许多实证科学主张的基础。大型语言模型(LLM)代理越来越多地被用于自动化这一过程,因为它们可以检查数据集、生成代码并端到端地产生分析。然而,我们表明它们经常犯下微妙的推断错误,导致尽管分析执行正确却得出错误结论。现有基准未能捕捉这种失败模式,因为它们很少评估报告的 p 值在给定数据假设下是否统计有效。我们通过构建 P-Bench 来解决这一空白,这是一个包含 425 个开放式、现实假设检验任务的基准,涵盖经济学、生物学和医学。每个任务要求代理选择统计方法、计算 p 值,并仅根据科学假设和数据集得出结论。我们进一步推出了 Fisher-R1,一个使用合成任务和强化学习训练的、用于严格假设检验的开源权重 LLM 代理。在 P-Bench 上,Fisher-R1-14B 相比其基础模型有显著改进,并优于包括 GPT-5.4 和 DeepSeekV4-Pro 在内的强大专有和开源基线,在单次试验成功率上比 DeepSeek-V4-Pro 实现了 21% 的平均相对提升,在最困难的任务上提升高达 26%。我们的结果表明,当前的 LLM 代理缺乏用于假设检验的可靠统计推理能力,而在具有验证性统计奖励的任务上进行强化学习能显著提高可靠性。

点评: 直击 LLM 在科学分析中的“隐形错误”——统计有效性,并提供了专门基准与强化学习训练方案,对 AI for Science 的可靠性建设具有重要参考价值。


2. 超越事后温度缩放:用于 LLM 校准的双层优化

作者: Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou | 分类: cs.LG 链接: arxiv.org/abs/2608.07419v1

偏好对齐通常会使大型语言模型(LLM)过于自信且校准不佳。传统的后处理温度缩放本质上是依赖领域的:在一个领域上拟合的温度无法跨领域泛化。这促使我们在训练过程中修改模型参数以改善校准。我们提出将预测分布的熵最大化作为校准目标,通过抑制过度集中的预测来直接解决过度自信问题。受温度缩放启发,我们通过双层优化公式实现这一点,其中低层在参数化损失下训练模型,而高层选择损失超参数以最大化熵。为了使框架在 LLM 规模下实用,我们采用了一种高效的一阶近似,避免了显式的二阶计算。在多项选择和开放式生成问答中,实验表明我们的方法能产生校准良好的 LLM,并在域外泛化方面具有特别优势。

点评: 将校准目标内化到训练过程中,克服了传统事后方法的领域依赖短板,为提升 LLM 在关键应用中的置信度可靠性提供了新思路。


3. LLM 辅助重写中等复杂度金融句子用于 DisCoCat 情感分析的探索性评估

作者: Brian Llinas, Nikos Chrisochoides | 分类: cs.CL, quant-ph 链接: arxiv.org/abs/2608.07439v1

量子自然语言处理(QNLP)为文本建模提供了语法感知框架,分布组合范畴语法(DisCoCat)是其理论基础之一。先前关于金融情感分析的工作已经指出了 DisCoCat 的实际局限,包括解析器敏感性、高模拟成本以及处理较长句子的困难。我们研究了一种 LLM 辅助的预处理工作流,该工作流使用受控重写来压缩、简化或分解中等复杂度的金融情感句子,使其成为解析器兼容、电路高效的变体,同时保留情感承载意义。我们比较了提示策略、语言模型和过滤配置,并与 Stein 等人的仅低复杂度 DisCoCat 基线进行了对比。在电路层面,最强的压缩变体相对于原始中等复杂度子集,平均量子比特数和门数减少了超过 70%。在重复训练运行中,GPT-4.1-mini 配合 Prompt B 达到了最高平均准确率,0.550±0.0350.550 \pm 0.035,而基线为 0.521±0.0500.521 \pm 0.050。更大的训练集划分不一定能提高下游性能;在评估配置中,训练集大小与准确率呈中等程度负相关(Pearson r=0.446r=-0.446)。这些结果提供了探索性证据,表明 LLM 辅助重写可以使一些中等复杂度的输入在所评估的 DisCoCat 配置中可用,同时突出了提示设计、过滤和电路感知预处理作为更可扩展的基于 QNLP 的金融情感分析的考量因素。

点评: 巧妙地用 LLM 预处理桥接当前 QNLP 的实用性瓶颈,为量子语言模型在垂直领域的落地提供了一条务实的探索路径。


4. 我在视频中寻找你:面向以人为中心的视频推理的身份条件查询

作者: Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2608.07417v1

现实世界的视频推理通常涉及多模态、多源输入,而现有的视频推理任务通常假设简化的视频-文本设置,限制了身份匹配和以人为中心的推理。为了弥合这一差距,我们引入了身份条件查询(ICQ)任务,要求模型联合关联和解释输入视频和人物的参考图像,并利用这种条件化来处理身份接地、行为理解和时间推理等挑战。基于 ICQ,我们提出了 ISYV(I Seek You in Videos),一个系统性解决方案,包含三个组成部分:(1)ISYV-Bench,一个具有挑战性的评估基准,包含 1,377 个真实世界复杂视频和 1,377 个问答对,组织成六个难度级别,涵盖从身份识别到因果推理的能力;(2)ISYV-75K,一个通过自动化标注、多阶段验证和人工审查构建的 75K 高质量样本的大规模训练集;(3)ISYV-Framework,包含一个面向 ICQ 的模型和训练策略,用于学习利用信息丰富的视频片段而无需额外的片段级标注。大量实验表明,主流闭源和开源 MLLM 在 ISYV-Bench 上表现不佳,尤其是在跨域身份匹配和长时程跟踪方面。ISYV-Model 优于强基线,并在某些方面接近闭源性能。总体而言,ISYV 为以人为中心的视频推理提供了统一的任务定义、可扩展的数据集/基准和建模见解。

点评: 填补了视频推理任务中“身份条件化”的空白,其大规模基准和训练集有望推动多模态模型在人物追踪与理解方面的实质进步。


5. 基于分类学的开源 AI 风险缓解工具分析

作者: Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir T. Chitkushev et al. | 分类: cs.SE, cs.AI, cs.CY 链接: arxiv.org/abs/2608.07446v1

大型语言模型(LLM)在企业环境中的快速采用引入了运营、安全和治理风险。随着生成式 AI 应用从试点走向生产,手动识别和缓解危害变得越来越难以扩展。尽管许多工具支持模型评估、对抗性测试、运行时防护栏和可观测性,但工具格局仍然支离破碎。工具通常是为特定的工程任务设计的,并以与治理框架或风险分类法不一致的技术术语进行描述,这使得难以确定哪些工具解决哪些风险,以及关键差距在哪里。本文提出了一种结构化协议,通过基于分类学的开源 LLM 评估和安全工具分析来自动化 AI 风险缓解。我们将 21 个 prominent 开源工具的能力映射到扩展后的 MIT AI 风险缓解与响应分类法的 32 个子类别。一个 LLM 辅助的检索增强生成流程分析源代码和文档,以提取每个分类类别的能力。可靠性评估在三位独立评审者之间产生了适度一致性(Fleiss’ Kappa = 0.509)。分析揭示了一个高度不平衡的格局,工具集中在技术和操作控制上,而治理、法律和监管、金融和市场控制在很大程度上仍未得到解决。这激发了一种分层风险缓解架构,将基于工具的控制与组织和监管流程相结合。该映射协议在多数投票后达到了 75.5% 的 F1 分数。总体而言,该研究在企业 AI 风险类别和开源缓解能力之间提供了实用的映射,确定了需要人工监督的领域,并提出了适用于开源和专有解决方案的基于分类法的框架。

点评: 针对企业落地 AI 时的风险管理痛点,用分类学系统梳理了工具能力地图,对于构建可信 AI 治理体系具有直接的实践指导意义。


6. LSEAD:用于早期阿尔茨海默病筛查的隐私保护 LLM 语音分析框架

作者: Xin Wang, Yingchao Huang, Yuhan Su, Shanshan Yao, Wei Peng | 分类: eess.AS, cs.AI, cs.LG 链接: arxiv.org/abs/2608.07378v1

阿尔茨海默病(AD)的早期诊断对于实现可能减缓疾病进展并改善患者预后的及时干预至关重要。对于非侵入性且具有成本效益的 AD 检测方法的需求日益增长,尤其是在具有不同患者群体和记录条件的现实临床环境中。基于语音的筛查通过使用无需专用设备收集的自然语音来满足这些需求。大型语言模型(LLM)的最新进展通过提供丰富的语言表示和强大的泛化能力改善了语音分析。在本研究中,我们提出了 LSEAD,一个使用预训练开源 LLM 的基于语音的 AD 检测框架。语音录音被自动转录,并使用本地部署的 LLM 提取文本嵌入。在分类前应用主成分分析(PCA)来降低维度。由于该框架仅依赖语音转录和本地部署的模型,它支持无需外部数据交换的隐私保护 AD 风险评估。我们在 ADReSS20 和 ADReSSo2021 基准数据集上评估了 LSEAD。实验结果表明,基于 LLM 的嵌入在数据集间具有良好的泛化能力,并将 AD 分类准确率比现有方法提高了高达 5%,尤其是在早期检测方面。这些结果表明,LSEAD 为早期 AD 筛查提供了一种实用、安全且可扩展的方法。

点评: 利用本地部署 LLM 兼顾了筛查精度与医疗数据隐私,为认知障碍的早期大规模社区筛查提供了极具潜力的技术方案。


7. 通过逆向优化揭示生产计划中的专家目标:一项工业案例研究

作者: Shivi Dixit, Rishabh Gupta, Adam Kelloway, John Wassick, Qi Zhang | 分类: math.OC, cs.HC, cs.LG 链接: arxiv.org/abs/2608.07398v1

制造业的生产计划通常依赖于优化模型的使用,但定义合适的目标函数可能是一个挑战。在实践中,计划者必须平衡相互竞争的目标、管理不确定性,并考虑难以量化的定性业务偏好。因此,许多优化模型无法匹配专家行为,限制了信任和采用。在这项工作中,我们提出了一个数据驱动的逆向优化框架,以推断专家计划者决策中隐含的目标函数。我们将生产计划问题表述为一个混合整数线性规划,其中未知的目标函数被表示为假设成本项的加权和。然后应用基于次优性损失的逆向优化方法,从历史生产计划中学习目标权重。所提出的方法应用于 Dow 提供的真实工业案例,推断出的权重表明,避免库存短缺和保持一致的周期长度主导了计划者的决策。时间和产品相关的扩展进一步提高了预测准确性,并揭示了不断变化的优先级。专家访谈证实了这些见解的实际有效性。总体而言,这项研究表明,逆向优化可以将隐性的人类专业知识转化为可解释的模型,为复杂的工业系统实现更准确和可信的决策支持工具。

点评: 将“老师傅经验”通过逆向优化显性化为可解释的目标函数,对于提升工业软件的智能化水平和用户信任度具有标杆意义。


8. 学习具有自适应步态时机的容错运动

作者: Giovanbattista Gravina, Luca Rossini, Carlo Rizzardo, Arturo Laurenzi, Nikos Tsagarakis | 分类: cs.RO, cs.LG 链接: arxiv.org/abs/2608.07328v1

硬件故障要求腿式机器人迅速重组协调性和步态时机,以维持稳定性和机动性。这对于较大的四足机器人来说尤其具有挑战性,因为增加的质量和更严格的作动器限制降低了在较小平台上常观察到的高频补偿策略的可行性。在这项工作中,我们提出了一种深度强化学习方法,用于在作动器功率损失下的容错运动。该方法采用非对称 actor-critic 架构,其中 critic 在训练期间可以访问特权信息,而 actor 学习从本体感觉观察中重建相应的潜在表示。我们引入了一个潜在对齐损失,以鼓励 actor 和 critic 表示之间的一致性。此外,我们用可学习的步态频率参数增强了动作空间,使得能够响应地形变化和作动器退化进行自适应步态时机调整,而无需预定义的故障腿策略。该方法在不平坦地形的高保真模拟以及使用 68 公斤四足机器人的平地真实世界实验中得到了验证。

点评: 通过可学习步态频率参数让机器人自主适应故障,显著提升了大型四足机器人在真实场景下的生存能力,是容错控制领域一项扎实的进展。


本内容由 AI 辅助生成,论文信息来源于 arXiv。