混合整数线性规划(MILP)实例在求解器开发中难以获得,尤其是当模型来自私有或特定应用管道时。现有通用生成器通常选择公式模板、汇总统计、局部图编辑或重组后的块作为生成单元,但这些单元未能显式记录 MILP 局部部分与其余实例的耦合关系。GraphBU 旨在解决这一结构保留问题。
Graph Convolutional Attention: A Spectral Perspective on Graph Denoising and Diffusion
该研究针对生物医学问答任务,根据问题类型(是非题、事实题、列表题)分别设计不同的LLM推理流程,在BioASQ 14b Task B官方评测中表现具有竞争力,并在Batch 4的事实题子任务中获得第一名。
生物医学问答不仅需要从科学文献中准确提取信息,还需要跨文档可靠地整合证据。现有方法通常对所有问题采用相同的提示策略,忽略了不同问题类型在推理和评估上的差异。本研究旨在通过问题类型感知的LLM流水线提升答案的鲁棒性和证据可靠性。
提出ReChannel方法,利用预训练DiT模型直接进行像素空间稠密预测,无需生成式解码器,在无trimap抠图、KITTI深度和指代分割上达到新SOTA,且比同类方法更快更准。
大型文本到图像模型因其RGB生成预训练学习到丰富的语义、结构和几何先验,成为稠密预测的有吸引力的骨干网络。现有方法将稠密预测视为目标生成,把深度、法线、alpha抠图、掩膜、热力图等注释编码到RGB训练的VAE潜空间,再解码回图像状目标。本文指出这种做法继承了过多的生成输出界面:稠密预测要求同一图像平面上像素正确的任务原生场,而非渲染新的RGB内容。关键观…
FreqDepthKV 是一种无需重训练的推理时 KV 缓存压缩方法,通过将相邻层 KV 状态分解为共享低频深度分量和稀疏高频残差,按注意力头对重建敏感度的贡献动态分配压缩模式,在长上下文推理中能以 3.9 倍有效压缩比接近完整 KV 缓存的任务精度。
长上下文大语言模型推理日益受到 KV 缓存内存和带宽成本的限制,但激进的压缩策略会移除检索和多步推理所需的层特定证据。如何在不严重损失任务精度的前提下实现高压缩比,是当前推理优化的核心挑战。
FootsiesGym 是一个开源环境,将极简格斗游戏 Footsies 改造为适合强化学习研究的双人零和不完全信息博弈基准,并提供了向量化模拟器以支持高效训练。
论文提出了一个用于双人零和不完全信息博弈的基准环境 FootsiesGym。该环境基于 HiFight 开发的极简 2D 格斗游戏 Footsies,旨在隔离格斗游戏中“中立博弈”阶段循环、非传递的战略交互,同时保持足够简单以便高效分析。研究问题包括如何设计一个可复现、高吞吐量的训练平台,并评估现有强化学习算法在该环境下的表现。
Nimblemind多智能体系统(nMAS)在54份胃活检病理报告中检测幽门螺杆菌阳性及相关胃炎的四类二元字段,总体准确率达98.61%,且通过自动化证据链接可将人工审查时间从83.3工时降至1.4工时,显著提升效率。
新加坡约31%人口存在幽门螺杆菌感染证据。持续感染与慢性活动性胃炎和消化性溃疡相关,根除幽门螺杆菌是胃癌预防的关键。然而,支持幽门螺杆菌阳性和相关胃炎的证据分散在异构的编码字段和自由文本报告中,需要处理肯定和否定的上下文,关键词搜索受限,人工审查难以规模化。本研究回顾性评估了Nimblemind多智能体系统(nMAS)在提取这些信息中的表现。
EntroPath 是一种通过聚合点间所有 k 步路径的集合(而非单一路径)来构建相异度距离的流形学习新方法,在非均匀采样密度和分支轨迹突出的流形上,其恢复测地几何的效果优于传统扩散映射和最短路径方法。
现有的基于图的嵌入方法主要有两类:一类使用局部归一化随机游走(如扩散映射),另一类使用最短路径距离。前者容易将扩散集中在密集采样区域,后者对图中虚假捷径边敏感。研究问题是如何设计一种对采样密度鲁棒、又能避免捷径干扰的测地距离恢复方法。
ELSA3D通过引入弹性语义锚定机制(Anchor Tokens + 层级感知的八叉树分词器),在统一骨干网络中同时实现图像/文本到3D生成与3D描述任务,性能达到新SOTA,并大幅降低计算开销(FLOPs和推理延迟减半)。
现有的统一3D基础模型试图在单一骨干中完成3D资产生成和基于语言的推理,但文本-3D交互多为隐式的。常见做法是将文本和3D token拼接为扁平序列后依赖自注意力,导致粗粒度结构线索与细粒度几何细节在表示中混乱混合。为了解决这一问题,作者提出了ELSA3D——一种通过弹性语义锚定在匹配的抽象尺度上联合构建语言和几何推理的统一3D模型。
EgoPolice 是一个由真实警察随身摄像机视频构成的基准数据集,用于评估模型在高风险、快速运动场景下的自我中心视频理解能力。测试表明,当前最强视频模型(如 Gemini 2.5 Pro)在预测“掏枪”等高风险动作时仍表现不佳。
警察随身摄像机(body‑worn camera)产生了大量第一人称视角视频,但有效分析其中关键行为(如暴力冲突、武器出现)非常困难。现有视频理解模型多针对平稳、预设场景,难以处理警民互动中常见的剧烈抖动、密集交互和稀有高风险事件。EgoPolice 旨在填补这一空白,提供一个专门针对执法场景的挑战性基准。
DynaKRAG 通过一个学习的状态条件策略(state-conditioned policy)在多跳检索增强生成中动态选择当前最合适的证据操作(检索、诊断、充分性判断等),在 HotpotQA、2Wiki 和 MuSiQue 三个基准上均超越了现有最强基线。
现有多跳 RAG 方法往往将迭代检索、查询重写、证据批判、充分性判断等操作组织为特定管道或预定义控制拓扑,没有探索如何学习一个共享的策略来根据当前证据状态灵活选择下一步操作。DynaKRAG 将多跳证据获取建模为**状态条件控制**问题,在每个步骤中由“有效性层”构建可执行动作集,再由学习到的控制器选择下一操作,从而统一了证据获取中的诊断、补缺和终止决策。
论文证明:LLM 智能体在早期交互轮次中的隐藏层激活已能可靠预测最终失败,基于此设计的“探针级联”机制可在保持高召回率(如 90%)的前提下节省 37%~47% 的推理计算量,性能远超仅使用行为信号的方案。
大语言模型(LLM)智能体在解决多步任务时,常常沿着注定失败的轨迹执行,却持续消耗大量推理计算资源,直到失败变得明显。研究问题:能否从智能体的内部表征中早期预测失败,从而提前终止无效计算?
DepthWeave-KV通过跨层低秩基分解与令牌条件深度路由器,在64K上下文长度下实现8.3倍KV缓存压缩,同时保持接近全缓存的任务质量,吞吐率达72.8 tokens/s。
长上下文语言模型推理时,存储键值(KV)缓存所需的内存带宽和容量已成为瓶颈。现有压缩方法通常在各层或各令牌上使用统一的压缩预算,当词汇线索和语义状态需要不同保留度时,检索性能会下降。DepthWeave-KV旨在解决这一均匀压缩导致的关键信息丢失问题。
当前大语言模型在真实世界数据分析场景中表现远未达到实用要求;新提出的DataGovBench基准揭示了显著性能差距。
现有用于评估大语言模型(LLM)数据分析能力的基准大多脱离真实场景——它们只关注从小表格中检索事实,忽视了大尺寸多表格数据集、外部知识整合以及探索性洞察发现等现实复杂问题。本文提出了DataGovBench,一个基于政府公开数据设计的基准,旨在评估LLM在实际场景中的表现。
Danus: Orchestrating Mathematical Reasoning Agents with Fact-Graph Memory
CAIRN 是一种拓扑感知的 3D 大语言模型(3D-LLM),通过显式建模房间间的连通性和物体级关系,首次实现了对包含多个互联房间的真实家庭环境的跨房间 3D 场景理解,并在新提出的 CAIRN-MR 基准上大幅超越此前所有 3D-LLM 模型。
现有 3D 场景理解的大语言模型(3D-LLM)大多局限在简化的单房间场景中,无法处理真实住宅中多房间互联且包含多样物体的复杂环境。该研究旨在解决“跨房间 3D 场景理解”这一核心问题,使模型能够感知房间拓扑结构并在不同房间之间进行推理。
通过引入视觉对齐奖励和视觉-动作对齐奖励,VAORA方法能有效抑制视觉语言模型在交互式物理推理中的幻觉链式推理,并缩小推理与行为之间的差距,从而在未见过的任务和环境中实现更好的泛化。
视觉语言模型在交互式物理推理中难以泛化到未见过的任务和环境。主要存在两个失败模式:1)产生与物理现实矛盾的幻觉链式推理;2)模型的推理与实际行动之间不匹配。本研究提出VAORA,一种新颖的奖励设计方案,直接解决这两个问题。
数据增强(如生成对抗网络 GAN)并不能有效净化已投毒的 3D 点云数据集;投毒攻击能够逃避增强技术的清洗作用,在增强数据中传播并最终干扰通用分类器的决策。
针对公开数据集的投毒攻击会引发两大担忧:(i) 将投毒数据用于训练时导致感知对象误分类;(ii) 在系统条件满足时,后门被触发。然而,投毒攻击对数据增强模型的影响尚不明确。虽然数据增强会降低投毒攻击的成功可能性,但仍有悬而未决的问题:数据增强是否会影响投毒攻击的影响?是否会增加投毒样本或注入后门的数量?本文旨在探索这些问题。
本文首次系统研究了印地语(Hindi)音频描述(ADs),构建了首个由8部完整电影人工标注的印地语ADs数据集Andha-Dhun,并发现简单机器翻译会引入伪影、降低多样性,无法适配文化参照;而人工翻译虽有所改善但仍不足,最终强调印地语ADs应以印度BLV观众的可访问性为目标,内容适配比严格忠于原文更重要。
音频描述(Audio Descriptions, ADs)是指在影视媒体的空白段落中,为盲人或低视力(BLV)观众叙述视觉内容。随着印度中央电影认证委员会(CBFC)发布相关指令,ADs需要从英语扩展到其他印度语言。然而,此前没有任何工作针对印度语言生成ADs。本研究填补了这一空白,首次对印地语ADs进行系统性研究,涵盖数据、生成与评估。
视觉语言模型(VLM)在作为扩散图像编辑的条件编码器时,虽然其本身具备强定位能力,但由于单次前向传递的约束,定位信号无法可靠传播到预设的层配置中,而是隐藏在随输入提示变化的中间表示里——这一根本错配导致了现有编辑流程的定位失效。
背景:VLM 凭借多模态推理能力被广泛用作扩散图像编辑的**条件骨干网络**。 问题:独立 VLM 表现出强定位能力,但将其嵌入编辑流程后,定位精度显著下降,尤其在复杂多实体场景中。 假设:性能差距源于将 VLM 作为条件编码器——模型被限制为**单次前向传递**,无法执行其原本优化的自回归生成过程,导致能力未能充分暴露。