生存预测、多模态对齐与具身智能安全新进展

精选 8 篇 AI/ML 论文,涵盖AI, LG, CL, CV, RO, stat.ML, stat.AP, CR, SE等方向

今天从 arXiv 精选了 8 篇值得关注的 AI/ML 论文,涵盖癌症生存预测、LLM 强化学习、可解释性、视频生成、具身智能安全、分位数回归、RAG 事实验证与测试驱动代码生成等前沿方向。


1. CACSurv:基于一致性对齐比较学习与 LLM 的癌症生存预测

作者: Tianqi Xiang, Qixiang Zhang, Xinpeng Ding, Yi Li, Xiaomeng Li | 分类: cs.AI 链接: arxiv.org/abs/2608.16594v1

癌症生存预测支持治疗规划、风险分层和随访管理。现有方法使用结构化临床变量、全切片图像、基因组谱或多模态输入,而患者报告仍未得到充分探索。我们研究了以报告为中心的生存预测,使用组织病理学、临床和分子证据的报告。LLM 可以对这些报告进行推理,但逐病例的时间回归引入了两个不匹配。首先,公式化不匹配源于生存评估依赖于可比患者的排序,而独立时间预测不强制排序一致性。其次,监督不匹配源于删失患者的观察时间仅表示其存活超过该时间点,不能作为精确回归目标,尽管它仍暗示了与较早死亡患者的排序关系。为解决这些不匹配,我们提出了 CACSurv,一个用于以报告为中心的生存预测的一致性对齐比较框架。CACSurv 将生存建模重构为小队列比较推理,其中 LLM 预测相对预后排序。我们引入了从右删失下的可比关系推导出的一致性对齐奖励,使删失结果能在没有精确事件时间目标的情况下提供排序监督。在推理时,蒙特卡洛参考聚合将每个患者与采样参考进行比较,并将位置聚合成队列级排名。我们建立了涵盖六个 TCGA 癌症队列的 TCGA-SurvReport 基准。CACSurv 在所有六个队列上取得了最高的 C 指数,平均 C 指数为 0.722,比最强的已发表生存模型高出 6.5 个百分点,比最强的 LLM 时间回归基线高出 4.2 个百分点。我们的代码、模型和数据集将在 https://github.com/xmed-lab/CACSurv 提供。

点评: 首次系统性地将 LLM 引入以患者报告为中心的生存预测,创新性地用排序比较替代时间回归,巧妙解决了删失数据的监督难题,临床落地潜力巨大。


2. Le Critique:用于 LLM 强化学习的特权价值函数

作者: Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison | 分类: cs.LG 链接: arxiv.org/abs/2608.16739v1

用于 LLM 的强化学习算法主要以其方差缩减策略来区分。基于组相对的方法(如 GRPO)通过为每个提示采样多个 rollout 来减少梯度方差,但仅提供序列级信用。训练也被掉队 rollout 阻断,降低了吞吐量并增加了非策略性。学习到的价值函数理论上可以解决这两个问题,无需大型组即可提供 Token 级优势。然而,额外的基础设施工程挑战加上无 Critic 方法的实际成功,使得很难证明将其纳入 RL 流程的合理性。我们提出了两种互补策略来提高价值函数 RL 的性能:1)特权价值函数(PVF),它提供了一种优雅的机制来注入额外的任务相关 Token 级信号,而不会使策略目标产生偏差;2)TETHER,一种根据价值函数准确性在组相对基线和价值基线之间自适应插值的基线。在多个推理任务中,两种策略都持续优于标准价值函数基线,并与平均基线 GRPO 竞争或优于它。

点评: 直击 LLM RL 训练中价值函数长期被冷落的痛点,PVF 在不引入偏差的前提下注入 Token 级信号,TETHER 则实现了自适应基线切换,为提升 RL 训练效率提供了新思路。


3. 解释何时帮助上下文学习?自然语言解释类型与忠实度的比较研究

作者: Mahdi Dhaini, Adam Dejl, Juraj Vladika, Volkan Özer, Barbara Plank et al. | 分类: cs.CL, cs.AI 链接: arxiv.org/abs/2608.16627v1

自然语言解释(NLE)越来越多地被用作输入,例如作为影响上下文学习(ICL)中模型行为的 few-shot 推理依据。然而,目前仍不清楚不同类型的 NLE 在解释增强提示中对下游模型性能的影响如何比较。因此,我们提供了跨六个基准和四个指令微调模型的比较评估,研究 NLE 来源(可用时的人类编写、自生成解释、外部 LLM 生成)和 NLE 选择(随机 vs 基于忠实度的过滤)如何影响 NLE 在 ICL 设置中的下游效用。我们的广泛评估表明,在分类风格基准上,向 few-shot 提示添加 NLE 通常比没有解释的 few-shot 提示提高准确性;在 NLE 来源中,外部生成的 LLM-NLE 通常提供强大的下游效用,并在两者都可用时与人类依据保持竞争力,而自生成 NLE 对选择策略更敏感。在数学推理上,效果更依赖于模型和来源。我们进一步表明,基于忠实度的自生成 NLE 选择在整体上产生较小的平均收益,但根据指标、任务和模型的不同,可能提高或降低性能。不同的忠实度指标可能存在显著分歧,影响选择哪些自生成 NLE 示例及其下游预测效用。使用随机交换和分布外依据的鲁棒性测试表明部分鲁棒性,暗示语义对齐对性能提升有贡献。总体而言,我们的结果为在实际提示流程中选择和报告影响模型行为的解释提供了见解。

点评: 首次系统比较了不同来源和选择策略的 NLE 对 ICL 的影响,发现外部 LLM 生成的解释可与人类依据媲美,并为解释的忠实度选择提供了务实指导。


4. MLLM 引导的文本生成视频语义校正

作者: Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao et al. | 分类: cs.CV, cs.AI 链接: arxiv.org/abs/2608.16513v1

扩散模型和 Transformer 架构的最新进展带来了文本到视频生成的显著进步。然而,这些模型经常出现语义错误,如缺失对象、属性不正确或动作不匹配。尽管一些语义校正方法在采样前进行优化或在采样后进行细化,但在视频生成过程中如何检测和纠正语义偏差仍待探索。在本文中,我们引入了一个无需训练、可解释的生成中校正框架,将多模态大语言模型(MLLM)反馈直接集成到扩散采样循环中。我们的框架通过在视频合成期间注入语义评估信号来实现扩散轨迹校正,使模型能够通过持续自我反思来优化生成内容。我们提出了两个关键模块:语义评估监督器,生成中间预览帧以进行语义评估和偏差诊断;以及语义修改助手,通过可控的潜在轨迹干预在推理期间纠正语义漂移。我们的方法在不修改模型参数的情况下改善了语义对齐、视觉保真度和时间一致性。我们通过跨多个基准的广泛实验验证了我们方法的有效性。

点评: 巧妙地利用 MLLM 作为生成过程中的”监工”,在扩散采样中实时注入语义反馈,实现了无需训练的即插即用语义纠错,对提升视频生成可控性具有实用价值。


5. 当状态成为攻击面:LLM 驱动的具身代理中的状态语义注入

作者: Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang et al. | 分类: cs.RO, cs.AI 链接: arxiv.org/abs/2608.16806v1

LLM 已展示出在上下文学习、任务分解、逐步推理和代码生成方面的能力,推动其从文本生成模型逐渐演变为能够感知环境、调用工具和执行任务的代理核心。传统 LLM 代理通常通过网页、文档、数据库或外部工具获取信息,并根据用户目标生成相应的调用序列;当该技术进一步与机器人系统集成时,LLM 开始承担任务理解、高层规划和行为决策等功能。SayCan 结合了语言模型的任务推理能力与机器人技能的可供性,而 Code as Policies 和 ProgPrompt 分别通过策略代码和程序化提示生成机器人任务计划,VoxPoser 使用语言模型和视觉语言模型构建三维价值图来引导机器人操作。PaLM-E、RT-2 和 GR00T N1 等视觉-语言-动作模型进一步增强了语言、视觉感知和机器人动作之间的联系。在此类 LLM 驱动的具身代理中,模型不仅需要理解用户指令,还需要结合场景状态、对象属性、空间关系和执行反馈来完成任务接地,然后将生成的动作计划交给技能库、运动规划器或控制器执行。

点评: 首次系统性地将”状态”定义为 LLM 具身代理的攻击面,揭示了状态语义注入这一新型安全威胁,对机器人安全与可信 AI 具有重要警示意义。


6. 非交叉深度分位数回归用于分布级生存预测

作者: Shuai Huang, Zhe Qu, Zhaowei Hua, Guohao Shen, Rui Tang et al. | 分类: stat.ML, cs.LG, stat.AP 链接: arxiv.org/abs/2608.16864v1

在生存分析中,协变量对事件风险的作用方式在早期和晚期失败时间之间往往不同,而基于风险和治疗平均的摘要将这些变化压缩为单一数字。基于分位数的建模则描述原始时间尺度上的完整条件分布,但现有的删失数据方法要么不灵活,要么产生逻辑上不一致的交叉分位数曲线。我们提出了一个用于右删失数据的删失非交叉分位数(CNQ)框架,该框架联合估计多个条件生存分位数并通过构造保证有效的排序,灵活性由 Kolmogorov-Arnold 和 Transformer 主干提供,并建立了在所有拟合分位数水平上联合成立的有限样本超额风险界。在 27 个模拟设置和六个队列中,当条件分布不对称时,该框架在所有竞争方法中取得了更低的 Pinball 损失,并且在所有六个队列中间隔覆盖率更接近名义水平。在两个临床案例研究(METABRIC,乳腺癌;FLCHAIN,人群死亡率)中,它恢复了随生存分布变化且会被单一风险比隐藏的协变量效应,并产生一致的个体化分位数里程碑。代码:https://github.com/BIG-S2/deepcnq

点评: 通过构造性方法保证了分位数曲线的非交叉性,解决了生存分析中长期存在的逻辑一致性问题,并在临床数据上发现了传统风险比无法揭示的时变协变量效应。


7. 拓扑归因距离(TAD):揭示段级 RAG 对 LLM 输出几何的影响用于事件日志分析

作者: Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang | 分类: cs.CR, cs.AI 链接: arxiv.org/abs/2608.16775v1

LLM 越来越多地部署在网络安全运营中,以协助安全分析师针对新兴威胁做出快速决策。然而,在网络安全中使用 LLM 必须满足一个主要标准,即对生成输出的信任。随着代理式 AI 集成到运营系统中,强大的证据归因和来源追踪技术对于追踪模型生成的来源至关重要。当自主代理做出决策(无论对错)时,能够追溯决策链至关重要,否则团队无法识别哪个数据段导致了模型生成。现有方法通常难以区分复杂且高度相似的证据来源,例如网络事件日志。这揭示了一个关键差距:当前方法不能充分捕获检索证据与生成响应之间的整体几何关系,以实现可靠的证据验证。为弥合这一差距,我们受拓扑学启发,提出拓扑归因距离(TAD)来表征和捕获输出的全局几何形状及其相对于检索日志的变化。换言之,如果特定来源日志的嵌入在嵌入空间中显著改变了模型响应的几何结构,则表明该日志是模型生成响应的关键来源。因此,TAD 由段级消融归因驱动,以调查实际网络攻击的事件日志。我们演示了 TAD 如何以自适应方式找到对 LLM 输出归因最大的日志。这可以基于每个 LLM 的隐藏状态提供可解释和可信的追踪,以理解不同检索日志在几何上如何影响模型生成,并在网络安全和代理式 AI 工作流中提供证据验证。

点评: 创新性地将拓扑学思想引入 RAG 归因分析,通过段级消融与几何变化度量实现了对 LLM 输出来源的精确追踪,为网络安全的可解释 AI 提供了新工具。


8. TDD-Agent:用于代码生成的测试驱动推理

作者: Hongyue Yu, Kefan Li, Jiakun Li, Hongzheng Chai, Yuan Yuan et al. | 分类: cs.SE, cs.AI 链接: arxiv.org/abs/2608.16742v1

LLM 在代码生成方面取得了显著进展,但在复杂的仓库级任务中确保正确性仍然具有挑战性。现有方法通常将生成的测试用作静态的事后验证器,这限制了它们指导实现的能力,并且当测试本身不完整或不正确时可能引入误导性反馈。在本文中,我们引入了 TDD-Agent,它将测试驱动开发范式操作化用于代码生成。TDD-Agent 首先提示模型生成可执行测试,鼓励其在实现之前阐明预期行为,然后使用执行反馈对生成的代码和测试进行迭代双轨细化。我们首先通过 LiveCodeBench 上的提示变体 TDD-prompt 隔离了测试优先推理的效果,它持续优于基于推理的提示基线。在此基础上,我们在仓库级基准 RepoEval 上评估了完整的 TDD-Agent 框架,并表明它持续优于基于检索和基于代理的基线。额外分析表明,迭代细化不仅提高了代码正确性,还提高了生成测试的有效性,产生了更高的通过率、覆盖率和变异分数,表明测试可以作为不断演化的推理工件,而非固定验证器。我们的源代码可在 https://anonymous.4open.science/r/TDD-Agent-Framework-6370/ 获取。

点评: 将软件工程中的测试驱动开发理念引入 LLM 代码生成,让测试从静态验证器进化为动态推理工件,在仓库级任务上取得了显著提升。


本内容由 AI 辅助生成,论文信息来源于 arXiv。