推理时扩展、多语言规划与模态生成前沿进展

精选 8 篇 AI/ML 论文,涵盖AI, LG, CL, IR, CV, SD, SE, stat.ML, MA等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖了 LLM 测试时扩展的机制与效率优化、多语言与多模态推理基准、注意力机制的新发现,以及 AI 在音乐生成和代码生成中的应用研究。


1. 面向 LLM 测试时扩展的可解释自适应采样

作者: Mobina Kashaniyan, Ali Jannesari | 分类: cs.AI 链接: arxiv.org/abs/2608.03961v1

测试时扩展通过生成和聚合多个候选答案来提升 LLM 的推理能力,然而许多流程采用固定的每查询预算,在简单和困难提示上花费相同的计算量。这种固定预算也难以检查,因为它们无法解释为何特定提示会获得特定数量的样本。我们提出了一种带有轻量级模糊控制器的自适应测试时扩展方法,该控制器将可解释的信号(包括估计的提示复杂度和模型置信度)映射到每个查询的采样预算。控制器为更简单或更自信的提示分配更少的样本,而为更难或更不确定的提示分配更多样本,使推理时的计算可检查,而非固定或不透明。我们在匹配解码设置和控制答案选择的公平对齐协议下进行评估,并在问答和数学推理任务上与 best-of-N、计算感知扩展和基于自置信度的基线进行比较。跨模型和数据集,自适应模糊控制优于几个标准基线,并且在减少平均样本数的同时,保持接近选择器匹配的全预算控制。这些发现表明,可解释的自适应采样是提高大语言模型测试时推理效率的一个实用方向。

点评: 针对测试时计算分配“一刀切”的痛点,用模糊控制实现了可解释的动态预算分配,兼顾了效率与性能。


2. 推理 LLM 中的测试时扩展:推理机制、评估与可复现性

作者: Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye et al. | 分类: cs.LG, cs.AI 链接: arxiv.org/abs/2608.04001v1

大语言模型凭借更多的推理时计算,可以解决难度更高的推理问题。然而,“测试时扩展”一词现在涵盖了多种推理算法,这些算法沿着单条轨迹扩展思考、对完整候选进行采样并通过投票或验证进行聚合、或对未完成的局部状态进行搜索。这些算法在统计结构、计算核算和失败模式上各不相同。将所有这些过程视为可互换的单一标量“预算”,或在不说明产生结果的推理协议的情况下报告准确率,使得研究结果难以跨研究比较。我们沿着三个轴对测试时扩展进行了系统性阐述。首先,我们将测试时扩展形式化为对自回归模型隐式前缀树的预算推理,并区分了三种结构机制:单轨迹顺序扩展、叶级扩展与终端归约、以及前缀级扩展。其次,我们将被评估对象视为整个推理系统,并制定了将端到端系统性能与候选库诊断分开的评估原则。我们引入了一个评估框架,其坐标和简单函数可以恢复或限制常见的重复采样指标,并规定了计算和不确定性的协议匹配报告。第三,我们明确了推理协议的可复现性要求,区分了精确重放与分布可复现性,并确定了支持每种要求所需的工件。我们还按模型端和接口机制组织了开放权重推理生态系统,将这些原则应用于广泛知识、符号推理和竞赛数学基准,并组装了超过 20 亿条完整推理轨迹以供发布,其中包含逐渐丰富的验证器和词元级信号。

点评: 一篇“元研究”论文,为混乱的测试时扩展领域建立了系统性的分析框架、评估原则和可复现性标准,是该方向的重要参考资料。


3. MultiGlobeQA:面向地理空间推理的多语言与全球多样性基准

作者: Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana | 分类: cs.CL, cs.AI, cs.IR 链接: arxiv.org/abs/2608.03882v1

地理空间推理,即计算真实世界实体间的距离、包含关系和其他空间关系,对于导航和物流至关重要,然而大语言模型(LLM)尽管存储了大量地理知识,却难以进行所需的几何和拓扑计算。现有基准仅部分定位了这些失败:它们是合成或小规模的,主要是单语的,并且对地理覆盖的控制有限。我们引入了 MultiGlobeQA,一个包含 46,060 个问答对的多语言基准,涵盖 14 个空间函数族和 15 种答案格式,基于三个知识图谱的执行结果作为真实值。它通过收入和密度分层抽样覆盖了 201 个国家和地区,并提供英语和另外 16 种高/低资源语言的平行问题。在参数化、推理和代理设置下,LLM 在需要网格索引和形状计算的任务上表现崩溃,而拓扑关系和方向则表现最好。检索和工具使用带来了可观的提升,但即使在提供黄金事实的情况下,性能也停滞在三分之二以下,表明计算(而非知识获取)是瓶颈。模型在低收入地区的表现也不佳,而提供黄金事实反而扩大了这一差距。

点评: 首个大规模多语言地理空间推理基准,揭示了 LLM 在该领域的瓶颈是“计算”而非“知识”,为后续研究指明了方向。


4. 注意力是对大小写敏感的

作者: Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach | 分类: cs.CV, cs.CL, cs.LG 链接: arxiv.org/abs/2608.03711v1

在人类视觉感知中,大写字母作为自然显著性线索,能在小写文本中捕获注意力。在本文中,我们进行了一项系统性实证研究,揭示大语言模型(LLM)表现出类似的性质:字母大小写会调节内部注意力分配。通过对 13 个模型(9 个 LLM 和 4 个视觉-语言模型 VLM,具有不同分词方案)的分析,我们表明,在小写上下文中以交替或全大写形式格式化目标信息,会使注意力集中在这些文本片段上。在文本中,这种效应是普遍的,在所有评估的非推理模型中都成立。我们将其视为预训练 Transformer 先前未被充分探索的潜在属性,而非规定性方法。我们的研究揭示了一个核心的注意力-性能分歧:虽然这种“大小写效应”能稳健地转移注意力,但其对下游准确率的影响是非平凡的,注意力集中度的提高并不固有地提高任务准确率,并且在像交替大小写这样的高熵上下文中,可能会降低准确率。我们进一步确定了一个边界条件:推理模型中深思熟虑的“思考”阶段充当语义缓冲区,减轻了文本中的排版敏感性。将研究扩展到 VLM,我们发现该效应部分转移:相同的提示端大小写重组了跨模态注意力,沿着两个耦合的轴——主要是从图像到文本提示的宏观脱离,其次是残余视觉注意力对目标区域的集中。通过将大小写作为一种零样本注意力引导机制进行隔离,无需模型访问或微调,我们为预训练如何内化排版强调提供了新的基础性理解。

点评: 发现了一个有趣且普遍的现象:字母大小写可以作为零样本的注意力引导工具,但同时也提示了其对准确率影响的复杂性,为理解模型内部机制提供了新视角。


5. Agogic:面向 LLM 原生文本到符号音乐生成的表演计时音乐词元

作者: Junhao Chen, Mingjin Chen, Jingjia Mao, Lin Chen, Saining Zhang et al. | 分类: cs.SD, cs.CL 链接: arxiv.org/abs/2608.03999v1

文本到音乐语言模型始于一个通常由默认设置决定的选择:如何对音乐进行词元化。这一选择通常与骨干网络、数据和配方纠缠在一起,其影响从未被单独衡量过。我们固定了预训练的 Qwen3.5(0.8B-27B)、数据、预算和解码方式,仅跨七种词元化方式交换表示,并将纹理指标锚定到每种表示的无模型上限。排序结果是清晰且令人惊讶的:表示,而非模型大小,是分布保真度的决定性变量。将骨干网络扩展 34 倍几乎不改变 Fréchet 音乐距离(FMD),而切换表示则使其减半。PMT,一种我们发布的表演分辨率流(10 毫秒计时、逐音符力度、多轨纹理;609 个符号),在 0.8B 规模下达到 FMD 159,而节拍网格(1.7-1.8x 更低,其他情况下高达 2.8x)为 272-286(非重叠 bootstrap 置信区间),因此一个 0.8B 的表演分辨率模型优于 27B 的节拍网格模型。这在 26M 的从头训练主干和第二个表演分辨率分词器上再次出现:这是该类的一个属性,而非某个幸运词汇表。这也不是更精细网格的伪影:将 PMT 的起始时间捕捉到节拍网格的分辨率,仍然比两者领先 67-129 FMD(n=500)。这种效应是分布性的;它是否可听是另一个问题,我们的探针未予解答,但已预先注册了一项人类研究。原生字幕遵循度较弱但可分离:一个轻量级的解码时约束将乐器 F1 提高了一倍(从 0.28 提高到 0.60),并将正确调性(Correct-Key)从 0.16 提高到 0.35,且无分布性代价。我们发布了工具链、25+ 检查点、两个语料库(86.6k 个跨字幕/MIDI/ABC/音频对齐;625 万个带字幕的,是最大的音乐语料库),以及一个印记诊断:已发布的文本到 MIDI 系统几乎不受字幕影响地复现其训练分布(在不同领域上,和弦时间为 72% 对 71%)。该领域下一个关于表示的声明现在可以被衡量,而非断言。

点评: 通过严谨的控制变量实验,证明音乐词元化表示(而非模型规模)是文本到音乐生成保真度的关键,其发布的资源对领域研究价值巨大。


6. 模式优先于像素:衡量多模态代码生成中的模式补全偏差

作者: Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo | 分类: cs.SE, cs.AI, cs.CV 链接: arxiv.org/abs/2608.03691v1

多模态大语言模型(MLLM)越来越多地被用于将网页截图转换为前端代码,但重复的 UI 模式可能会使它们偏向于视觉上不正确但与模式一致的输出。在这项工作中,我们测试了重复网页模式如何在一个客观的截图到代码填空任务中损害 MLLM 的准确性。我们引入了第一个用于视觉模式补全偏差的基准,其中一个重复 UI 模式中的局部元素被扰动,模型必须从截图和 HTML 上下文中恢复被遮蔽的宽度或字体大小值。我们从 Design2Code 数据集中策划了 30 个网页,构建了 1,440 个评估截图,涵盖标准和噪声叠加条件下的结构卡片和文本样式模式。我们评估了五个前沿 MLLM,发现它们都强烈偏向于重复的基线。平均偏差率在卡片宽度扰动下达到 69.78%,在文本字体大小扰动下达到 80.22%,而平均准确率分别仅为 21.17% 和 7.89%。Codex-5.3 表现最佳,但在卡片上的准确率从 68.61% 下降到文本上的 13.89%,而 Flash-3.0 在文本上的偏差率达到 96.11%。噪声、更微妙的扰动和边界位置进一步增加了偏差率。推理分析进一步表明,更大的推理努力与更低的偏差相关,但定性证据表明,模型可以识别异常元素,但仍然会用与模式一致的答案覆盖它。我们的结果确定了多模态代码生成中的一个具体失败模式,并表明其严重性与视觉显著性密切相关。

点评: 首次系统地量化和分析多模态代码生成中的“模式补全偏差”,揭示了前沿模型在面对 UX 模式时的固有缺陷和成因。


7. GFlowNets 中基于信息几何的前向策略训练

作者: Yordan Raykov, Rodrigo Veiga | 分类: stat.ML, cs.LG 链接: arxiv.org/abs/2608.03967v1

生成流网络(GFlowNets)已成为对离散及混合离散-连续对象进行摊销推断的灵活框架,仅需通过奖励指定一个未归一化的目标密度。在这项工作中,我们通过诱导轨迹采样器的信息几何来构建 GFlowNets 中的前向策略训练。将前向策略视为诱导轨迹采样器,我们表明其固有的第一阶几何由轨迹族的 Fisher-Rao 度量给出,并且相关的自然梯度在相应 Fisher 信息可计算或可准确近似时提供了规范的局部更新。我们推导了轨迹 Fisher 信息到每步条件二阶矩的精确分解,这阐明了时间得分交互何时消失,以及共享参数化下何时保持密集耦合。这导致了三种计算机制:精确 Fisher 信息可处理的设置、蒙特卡洛估计器足以估计期望 Fisher 的设置,以及目标局部性或分解能产生 Fisher 期望的准确近似的结构可利用设置。在后一种情况下,图模型工具,如精确边缘化、分隔符方法和信念传播,为自然梯度更新提供了原则性的替代方案。由此产生的框架将目标结构转化为优化几何,并为 GFlowNets 中结构感知的前向策略训练提供了一条可行的途径。我们通过比较黎曼和欧几里得优化下的收敛和探索行为的示例,对框架进行了实证说明。

点评: 从信息几何角度为 GFlowNets 的训练提供了新的理论视角,为如何利用目标结构进行更高效的策略优化指明了方向。


8. 多语言多智能体规划失败的可操作诊断

作者: Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna et al. | 分类: cs.MA, cs.CL 链接: arxiv.org/abs/2608.03735v1

多语言多智能体系统在英语之外表现出显著的性能下降,然而先前的工作很少识别当用户请求被转换为可执行计划时,任务关键信息是如何丢失的。我们将多智能体系统中的规划器作为请求到操作的接口进行研究,并从失败的真实世界任务执行中推导出一个可操作的规划-落地失败分类法。基于 LLM 的分析表明,随着语言资源可用性的下降,这些失败在失败执行中所占的份额越来越大,在低资源语言中影响最强。为了测试该分类法是否支持缓解措施,我们引入了 TART,一种分类法引导的可操作表示,它将分类法的关键方面明确地呈现给规划器和下游子代理。在多种语言、三个 LLM 主干、两个数据集和两种代理配置中,TART 持续提高了性能。在多语言 GAIA 上,它将一个最先进系统的准确率平均提高了 5.6 个百分点,覆盖了从低资源到高资源设置的十一种语言。

点评: 首次系统性地诊断和分类了多语言多智能体系统中的规划失败,并提出了一个有效且可操作的改进方案,对构建健壮的跨语言智能体系统具有重要意义。


本内容由 AI 辅助生成,论文信息来源于 arXiv。