面向AI芯片、小模型协同与量子机器学习:多域前沿突破

今日精选 8 篇 AI/ML 论文,涵盖LG, CL, AI, CV, stat.ML, math.ST, CR, RO, quant-ph等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖OLED分子设计、大模型高效推理、长时推理智能体、波斯语OCR、参数高效微调、恶意软件分析、人形机器人部署和量子机器学习等前沿方向。


1. OLEDLM:面向OLED分子设计的统一语言模型

作者: Fukang Wen, Yuchong Tang, Jingyuan Li, Beichen Wang, Yixuan Jiang 等 | 分类: cs.LG 链接: arxiv.org/abs/2607.20194v1

有机发光二极管(OLED)材料的开发面临着化学空间巨大、量子化学约束严格以及标注数据稀缺等多重挑战。尽管OLED生成问题至关重要,但很少有模型能为此特定领域进行有效训练。我们提出了一种基于因果语言模型的反向分子设计框架:给定目标光电特性(如激发能、振子强度),模型直接生成满足指定约束的OLED SMILES序列。我们采用多阶段策略:首先,使用LLaMA风格的Transformer架构建立基础化学语言模型。据我们所知,这是首次将LLM成功适配到OLED领域,弥合了通用分子生成与光电材料严苛结构要求之间的鸿沟。其次,我们基于在大规模OLED数据集上预训练的BERT模型微调属性预测器。然后,利用属性预测器对微调后的模型进行强化学习,以生成更优的SMILES序列。最后,通过DFT验证,我们证明了该框架能够高效导航OLED化学空间,生成具有高结构有效性和优化光电特性的新型候选分子。

点评: 首次将LLM引入OLED分子设计领域,采用”预训练+属性预测器+RL”的多阶段策略,为光电材料的AI辅助研发开辟了新路径。


2. PyroDash:成本高效的词元级小型-大型语言模型协同推理

作者: Niqi Lyu, Pengtao Shi, Wei Qiu, Jianlin Zhong, Sicong Xia 等 | 分类: cs.CL 链接: arxiv.org/abs/2607.20327v1

大型语言模型(LLM)提供强大的推理能力但规模部署成本高昂,而小型语言模型(SLM)虽然成本低廉,但在困难问题上可靠性不足。我们提出了PyroDash,一个成本感知的词元级SLM-LLM协同推理框架。在生成过程中,SLM通过发射控制词元来决定是否需要请求协助。协作引擎随后将查询和部分推理轨迹发送给冻结的LLM,通过单次交接完成回答。该策略内化在SLM中,不需要单独的路由器、LLM重训练或访问LLM的logits。PyroDash分三阶段训练SLM:控制词元嵌入学习、基于卸载的监督微调,以及使用Group Relative Policy Optimization进行成本感知对齐。其奖励函数平衡了答案准确性与以LLM-only推理为标准化的推理成本。在五个数学推理基准上,PyroDash支持不同的精度-成本操作点。λ=0.05时,平均准确率达64.04%,比LLM-only基线高6.36个百分点,同时成本降低20.4%。λ=0.6时,准确率达54.55%,LLM词元比例仅1.90%,每个示例的LLM调用次数为0.012,总成本从49.36美元降至1.78美元。结果表明,习得的词元级交接策略可以在保持强推理性能的同时大幅减少LLM使用。

点评: 提出了一种优雅的”SLM主导、LLM按需辅助”的推理范式,通过控制词元实现细粒度的成本-精度权衡,对降低LLM部署成本具有重要实践意义。


3. PRO-LONG:程序化记忆实现长时程推理

作者: Alexis Fox, Junlin Wang, Paul Rosu, Bhuwan Dhingra | 分类: cs.AI 链接: arxiv.org/abs/2607.20064v1

长时程任务需要持续感知、推理和探索,这对LLM智能体来说是一个持续挑战。这一差距体现在它们在ARC-AGI-3等持续学习基准上的有限表现,尤其是在模型被开箱即用时。各种智能体框架已被提出以缩小这一差距,每个框架都采用了不同的策略来处理长序列观察,即在环境中保存什么信息以及如何将其加载到模型上下文中——我们认为这一选择尤为关键。现有的上下文管理方法面临显著的权衡:保留更多信息会使检索相关细节变得不那么可行。我们提出了PRO-LONG,一个围绕程序化记忆构建的最小化上下文管理框架,用于长时程、探索性场景中的LLM智能体。PRO-LONG通过保留完整的、结构化的交互日志,并利用编码智能体的最新进展来高效搜索历史记录,从而解决了这一权衡问题。在完整的ARC-AGI-3公共游戏集上,PRO-LONG在前沿模型上的平均性能比基础编码智能体提高了18.0个百分点,匹配或超越了最先进的专用框架(pass@1最高达76.1%),同时使用的词元数减少了4.2-5.8倍。使用Fable 5时,PRO-LONG在总成本1,750美元下实现了97.4%的best@2。

点评: 提出”程序化记忆”概念,通过结构化交互日志+编码智能体高效检索,巧妙地解决了长时程任务中的信息保存与检索难题,效率提升显著。


4. Persian Pixel:面向波斯语的大规模合成OCR数据集

作者: Pouria Mahdi, Haq Nawaz Malik | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2607.20385v1

尽管波斯语在多个国家有超过1.1亿使用者,但波斯语的光学字符识别(OCR)技术远不如拉丁字母语言成熟。这一差距源于两个基本挑战:波斯-阿拉伯文字系统的内在复杂性,以及大规模高质量标注数据集的有限可用性。波斯语脚本表现出强制性连笔连接、上下文相关的字形变换、广泛连字、变音符号置放以及Naskh和Nastaliq等书写形式的风格变化,这些都显著复杂化了文本识别。同时,手动标注的高成本和劳动密集型性质造成了持续的数据瓶颈,阻碍了稳健OCR系统的发展,减缓了波斯语文档数字化的进程。本文介绍了Persian Pixel,一个专为应对这些挑战而设计的综合性合成OCR数据集。该数据集包含超过343,000个高保真图像-文本对,涵盖句子、段落和整页文档布局,这些内容从精心策划的700万词波斯语语料库中使用SynthOCR-Gen渲染框架生成。生成流程忠实模拟了波斯语文字的排版特征,包括上下文字符连接、位置字形变体、变音符号置放以及多种代表性波斯字体。为弥合合成到真实的域差距,渲染图像进一步用超过25种随机退化模型进行增强,以模拟真实的文档获取伪影,包括墨水渗墨、纸张老化、模糊、光照变化、扫描仪缺陷、压缩伪影和多种噪声过程。通过克服长期存在的波斯语标注OCR数据稀缺问题,Persian Pixel为训练和微调包括TrOCR和Donut在内的现代OCR架构提供了可扩展且开放可用的资源。

点评: 通过大规模合成数据生成+逼真退化模拟,有效解决了波斯语OCR的数据瓶颈问题,为低资源复杂文字系统的AI应用提供了可复制的范例。


5. StatLoRA:低秩适配中基于统计推断的秩分配方法

作者: Yihang Gao, Vincent Y. F. Tan | 分类: stat.ML, cs.LG, math.ST 链接: arxiv.org/abs/2607.20205v1

低秩适配(LoRA)已成为一种广泛使用的LLM参数高效微调方法。由于不同模块和层对下游适配的贡献可能不同,在固定参数预算下分配秩资源是平衡效率、表达能力和泛化性能的重要问题。现有的自适应秩方法主要通过由梯度驱动的敏感性和不确定性度量精心设计的重要性分数来解决这一问题,但缺乏明确的统计解释。在本文中,我们将LoRA秩分配形式化为一个统计假设检验问题,并提出了StatLoRA,一种基于统计推断的秩分配方法。StatLoRA将每个LoRA组件与一个检验统计量相关联,并使用估计的p值来确定在指定秩预算下哪些组件应保留或剪枝。所提出的检验程序得到了我们关于随机优化器轨迹的中心极限理论支持。特别地,我们建立了一类广泛的深度学习优化器(包括AdamW)的渐近正态性,并推导了假设检验中使用的组件分数的相应渐近分布。我们在自然语言理解、自然语言生成和问答任务上,对DeBERTaV3-base、BART-Large和Qwen2.5-7B的LoRA微调进行了评估。实验表明,在匹配的秩预算下,StatLoRA实现了与vanilla LoRA、AdaLoRA和IGU-LoRA相当或更优的性能。

点评: 首次将LoRA秩分配问题转化为假设检验问题,提供了理论基础扎实且性能优异的自适应秩分配方案,具有重要的理论价值和实践指导意义。


6. 小、免费、且高效:编排开源小语言模型以超越单个大语言模型的恶意软件分析性能

作者: Adel ElZemity, Shujun Li, Budi Arief | 分类: cs.CR, cs.AI 链接: arxiv.org/abs/2607.20216v1

恶意软件分析需要快速解读涵盖文件系统、网络和进程行为的复杂引爆报告。虽然LLM在技术产物解释方面展现了令人印象深刻的能力,但闭源前沿模型的不透明性和不断上升的API成本促使人们探索开源替代方案。然而,许多开源模型规模庞大,需要大量计算资源并产生非平凡的主机成本,使其超出了资源受限部署的承受范围。本文研究了编排好的小语言模型(SLM)集成是否能够匹配或超过单个LLM在恶意软件引爆报告结构化问题上的性能。我们通过在Meta的CyberSecEval Malware Analysis基准上测试11个开源SLM、3个网络安全预训练模型和6个前沿LLM来建立基线。然后我们设计并评估了四种编排架构:(i) 将分析分解为结构化证据收集和推理阶段的多智能体流水线;(ii) 两个智能体迭代批评对方推理的对抗性辩论框架;(iii) 将通用SLM与网络安全专业模型配对的层级咨询系统;(iv) 结合证据驱动流水线与对抗性辩论推理的混合架构。混合系统(Qwen3-4B与Foundation-Sec-8B)实现了35.30%的总体准确率,超过了最强的网络安全专用基线(22.54%)和最强的无证据基线(34.77%);当提供相同证据流水线时,有证据的Gemini仍是最强配置,达38.22%。这些发现表明,证据驱动的编排可以显著提高协作SLM在支持恶意软件引爆报告解释方面的性能。

点评: 通过编排多个开源小模型,在恶意软件分析任务上以极低成本超越了单个大模型,证明了”小而众”策略在特定领域中的有效性。


7. 弥合实验室到商店的鸿沟:面向零售人形机器人的数据高效后训练与经验驱动学习VLA框架

作者: Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2607.20345v1

弥合基准性能与可靠现实世界操作之间的差距仍然是视觉-语言-动作(VLA)人形机器人的核心挑战,这些机器人必须处理执行错误、分布偏移和环境变化。本文提出了DEED(数据高效后训练与经验驱动学习),一个系统级方法,在超市薯片补货任务中使用Unitree G1-Edu人形机器人和GR00T N1.6基础模型进行评估。DEED包含三个关键组件:(1) 具有控制频率对齐、数据整理、任务相关视觉高亮和降低VLA依赖性的数据高效后训练流水线;(2) 经验驱动精炼的真实世界研究,通过基于文本的优势前缀和视觉-语言价值函数从RECAP改进而来;(3) 用于研究分布内和分布外行为的潜空间分析工具。我们的结果表明,弥合实验室到商店的鸿沟主要是一个系统集成挑战而非架构挑战:精心设计的数据和有针对性的后训练可以在仅使用单个GPU的情况下,将一次朴素微调失败的政策转变为能力足够的现实世界系统。

点评: 强调”系统集成比架构创新更重要”,通过数据高效后训练和经验驱动学习,在真实零售场景中用单GPU实现了人形机器人的可靠部署,工程实践意义重大。


8. 四种量子比特ZZ量子核在IBM量子硬件上状态向量参考几何的存活率:跨三种执行配置的固定子集诊断

作者: Rostyslav Sipakov | 分类: quant-ph, cs.LG 链接: arxiv.org/abs/2607.20377v1

量子核方法将数据集的几何编码在Gram矩阵中,因此对硬件核的学习声称假设预期几何能够存活于执行中。我们测量了一种冻结的四量子比特ZZ特征映射核在N=24个真实室内空气质量窗口上的存活情况,在ibm_fez上(每个电路1024次采样)分别在基线、仅动态退耦和仅门扭绞三种配置下重建,每个配置为单一非交错作业。每种配置都返回了一个完整、有限、半正定的Gram矩阵,并在很大但非完全描述程度上保留了中心状态向量几何(全矩阵中心核对齐CKA为0.933-0.989)。门扭绞在报告的每个几何轴上最为忠实,且是唯一具有jackknife解析改进于基线的配置(持续的Spearman、平均绝对误差和全矩阵CKA诊断);仅动态退耦在冻结窗口尺度上未与基线区分开。残余硬件失真(而非有限采样)是差异的主导因素。然而保真度与标签对齐是相反的:最忠实的配置具有最低的中心核-目标对齐,该对齐在状态向量和硬件的标签排列参考值附近或以下。我们将微小的硬件提升解读为非仿射失真的一种归一化特性,而非捕获的信号。这些描述性结果来自单个后端的单一作业,而非因果性缓解效能估计;不作量子优势、硬件分类器优越性或预测性声明。实现保真度和任务相关性是不同的维度;硬件量子机器学习研究应同时报告两者。

点评: 严谨地揭示了量子核方法在实际硬件上的”实现保真度”与”任务相关性”之间的非平凡关系,为量子机器学习研究提供了重要的描述性诊断方法论。


本内容由 AI 辅助生成,论文信息来源于 arXiv。