AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 541-560 条,共 2259 条
第 28 / 113 页
事件日期 2026-08-20

PCCA(Prompt-Conditioned Channel Attention)通过在编码器-解码器网络的多个阶段引入提示条件通道注意力,实现了提示驱动的层级特征调制,在不依赖特定解剖结构的情况下,稳定提升医学图像分割性能。

解剖学上合理的医学图像分割仍受低对比度、模糊边界和模态特异性伪影的困扰。交互式分割被认为能通过提示引导特征提取和定位,但现有方法大多在晚期阶段才融合提示,缺少跨层级、提示驱动的通道级调制机制,难以捕捉深层上下文和模态差异。本文针对这一局限提出 PCCA 与 PROMISE-Net。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

在高相干字典学习中,稀疏追踪得到的原子支撑即使看起来精确,也可能在物理意义上缺乏校准数据支撑;本文提出“分辨率感知的物理支撑置信推断”,将字典学习和部署表示的不确定性共同纳入度量,并给出物理分辨率的最优理论尺度与一种避免过度精确的高效计算方法 AEB。

论文关注字典学习加稀疏追踪的可解释性风险。常见流程是先用校准数据学到一个字典,再对部署信号进行稀疏追踪,并把被选中的原子支撑解释为物理上有意义的成分。但在高相干字典中,多个与校准数据同样兼容的字典,可能对同一个选中支撑给出不同的物理含义。因此,问题不是“能否找到稀疏支撑”,而是“该支撑的物理解释在不确定性下是否仍然可靠”。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

语言模型“自我改进”的判断若只看平均准确率或单次解码的题目级变化,极易被测量伪影误导;本文用冻结控制组贯穿同一训练流程,识别出七类测量失败,并提出一种无需新增实验的逐问题精确检验作为替代 null。

论文题为 *Phantom Gains: Auditing Self-Improvement Against a Measured Null*,关注的是:如何可靠地判断一个语言模型是否真的在“自我改进”。作者认为,当前越来越多人不是看平均准确率,而是看模型在哪些具体题目上获得或失去能力;但这类题目级转换意味着对两次有噪声的估计做差分,很容易把测量噪声误认为…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

Pandora's Router 将“是否值得为某个专家模型进一步细化价值估计”的权衡形式化为经典的 Pandora's Box 问题,在保持路由质量不降的同时大幅减少对昂贵估计器的调用;去中心化版本 Pandora's Bidder 则让专家自主决定是否做自我评估,但噪声环境下可能被策略性专家利用。

异构 AI 系统由多个模型、架构、推理框架或推理时设置组成,通过把查询路由到最合适的“专家”可以在质量和效率上取得双赢。但路由本身需要估计每个专家对该查询的期望回报,而估计有成本:便宜的估计器(如基于 embedding 的预测器)快但噪声大,准确的估计器(如接入检索结果或部分推理轨迹的精调模型)准但昂贵。本文研究的问题是:如何在考虑估计成本的前提下,决定…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

MCES 是一个不依赖单一因果推断方法的证据排序框架:它在观测面板数据上运行 11 种来自 8 个数学传统的方法,把结果汇成“趋同证据分数”(CES),用于对候选驱动因素与结果之间的关系强度排序;在基准测试中能将真实边排到前列,但作者明确表示它不提供干预意义上的因果识别,而是用于假设优先级排序。

实践者通常只用单一方法从观测数据推断因果,并把该方法的输出当作因果真相。 已有一些工具会为数据集选择“最优”方法,也有一些集成方法会把多个因果发现算法合并成一张图。 但很少有工作会跨不同数学传统、甚至纳入非因果方法来汇集证据。 本研究提出 MCES,回答的问题是:在一个观测系统中,哪些候选驱动因素最可能与一组结果相关,以及证据强度如何。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

MidTool 提出了一套面向通用工具使用能力的中间训练(mid-training)语料构建流程,并通过在 Qwen3-4B/8B-Base 上进行中间训练、再叠加 SFT 与 RL 后训练,在 BFCL、tau2-Bench 和 MCP Universe 上稳定提升了工具使用表现,表明通用工具使用也应获得专门的中间训练阶段,而非完全交给后训练。

论文研究的问题是:大语言模型中的“中间训练”阶段能否像增强数学、科学推理以及软件工程智能体能力那样,提升更通用的智能体工具使用能力?作者认为,通用工具使用是一个相对未被充分探索的智能体能力,因此提出 MidTool pipeline 和语料 MidTool-Mix。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

MemTrapBench 提示:大型语言模型的记忆即使被忠实记录且语义相关,也可能扭曲模型推理或信念、降低当前任务表现;在该基准上,所有被测记忆策略都弱于“无记忆”设置,而作者提出的推理期方法 AdaptiveMem 可以缓解这种“记忆认知陷阱”。

记忆模块正在成为 LLM 的关键组成部分,用来保留信息并从长期交互中学习。 现有记忆基准大多只检验信息是否被正确提取、存储和检索,忽视了“检索到的记忆如何重塑模型推理并影响当前任务表现”。 作者将这类失败称为“记忆诱发的认知陷阱”(memory-induced cognitive traps):即使记忆记录准确且与当前任务语义相关,也可能对模型推理或信念产…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

本论文让强化学习训练出的推理模型在回答的第一个 token 选择 NoThink、Short 或 Long 三种模式,从而自主决定推理长度;在 MATH 上训练的 1.5B 蒸馏模型上,平均响应长度从 4,796 个 token 降到 2,811 个 token(约 41% 减少),MATH500 准确率仍接近基线(0.782 vs. 0.796),并可以…

用强化学习训练的推理语言模型通常使用固定的 token 预算,而不是显式的自适应预算。 固定预算会导致简单问题过度计算、困难问题计算不足。 本文研究问题:模型能否学习自主分配推理努力? 具体做法:模型在响应的第一个 token 选择一种模式:NoThink(尽快作答)、Short(简要推理)、Long(延长推理)。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

Inter-X++ 是一个包含 11,388 条高保真交互序列、超过 810 万帧的大规模多模态人-人交互基准,并配套提出 OpenHHI 统一表示与建模框架,在生成和感知任务上均达到当前最优性能。

现有面向人-人交互的数据集与建模方法存在三个主要瓶颈:运动学保真度低、缺少精细手部姿态、多模态标注严重不足。同时,交互表示碎片化、评测协议不一致,也阻碍了公平和严格的 benchmark 构建。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

InsufficiencyBench 是首个面向“查询侧信息不足”的法律 AI 基准,测试大模型能否识别用户法律问题中缺失的关键事实、指出缺了什么,并避免基于臆测过早下结论;评测发现当前前沿模型表现显著不足,没有模型能同时做到“识别缺失信息”“对不完整查询作答时加以限定”且“直接回答完整查询”。

法律 AI 系统越来越多地被用来回答法律问题,但现有基准通常假设用户查询已经是信息完整的。实际使用中,用户常常遗漏对法律结果具有决定性影响的事实。该研究提出 InsufficiencyBench,目标不是评估模型对完整法律问题的回答能力,而是评估模型面对“不完整查询”时的行为:是否能意识到查询缺少法律上实质性的信息、是否能识别缺失的是什么、是否能克制住不要…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

本文提出 IAR(Inject, Align, Recover)三阶段后训练框架,将固定文档语料转化为大语言模型的参数化知识,在不依赖推理时检索的情况下提升领域问答能力,同时尽量保持通用能力。

大语言模型在推理时不检索源文档时,往往难以回答关于某个有界文档集合的问题。本文将这一场景定义为“文档知识内化”(document knowledge internalization):把固定语料库转换为可用的参数化知识,用于无检索问答。论文提出 IAR 框架,将传统继续预训练(continued pretraining)替换为结构化注入、问答行为对齐、通用…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

在非负鞅的路径空间上核算信息流,可得到任意随机时刻也成立的精确变分恒等式;从 Ville 到 PAC-Bayes 的经典集中不等式都可看作它的特例,且每条不等式“丢弃”的松弛量被显式刻画。

本文是 arXiv:2608.20337v1(作者 Akshay Balsubramani,2026-08-20 发布),主分类为 math.PR,另涉 cs.IT、cs.LG、math.ST。 研究问题:在非负鞅的完整轨迹路径空间上,信息流动如何被精确核算?这种核算能否统一经典集中不等式,并处理任意随机时间?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

TMI 可以在不预先指定任务、不要求单一工作流的条件下,从被动录制的屏幕截图和鼠标/键盘操作轨迹中分离交错任务,并归纳出符号化、可审计、可复用的结构化任务模型,在受控评测中优于既有工作流归纳基线。

现实中的计算机使用轨迹通常只包含低层事件,如截图、鼠标和键盘操作,而且真实工作往往是多任务交错进行的。论文要解决的问题是:能否自动从这类“无约束轨迹”中归纳出任务模型,而不是依赖预先给定的任务或单一工作流?现有方法通常假设任务已知或流程单一,且只能生成步骤级摘要,难以生成结构化任务模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

这篇论文于2026年8月20日发布在arXiv(论文ID: 2608.20231v1),作者为Sahil Sharma,分类为physics.soc-ph、cs.AI、cs.CY。文章针对“全自动化之后如果人类没有收入,谁来购买产出”这一常见反对意见展开,认为这种反对混淆了“购买力”的会计职能与人类这一生物物种。论文建立一个后AGI经济的理论模型:企业拥有…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

G3Ego 使用佩戴者的注视作为图构建的结构性线索,从稀疏采样帧中构建动作场景图并剪枝无关实体,从而在避免大规模视频预训练的前提下,实现有竞争力的自我中心动作识别与预测,并在类不平衡评估中持续改善 Macro-F1。

自我中心动作理解通常依赖在大规模外部视角数据集上预训练的大视频模型。然而,许多第一人称动作只依赖于少数手-物交互,仅涉及少量相关实体。G3Ego 尝试回答的问题是:如何利用注视这一信号,把模型注意力集中在真正与动作相关的实体上,而无需昂贵的视频预训练。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

G-CARL 提出“患者导向医学报告解读”(PMRI)这一多模态生成任务,并用“基于事实检索的原子声明核验 + 按实例加权的检查表奖励”来联合优化事实准确性与患者沟通质量,实验显示其整体表现优于现有后训练基线,且更受临床医生偏好。

患者对个性化医学报告解读的需求日益增加。该需求同时要求: 基于证据的医学事实性; 依赖对话情境的患者沟通。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

编码智能体的文档交互主要以“面向智能体”的指令文件和工作笔记为主,而非传统人类开发者文档;文档查阅与代码编辑、测试之间的关系并非简单线性,且“可操作、可验证”这两项常见的“智能体友好文档”假设在行为数据中缺乏一致支持。

技术文档传统上为人类开发者编写,但越来越多软件变更由自主编码智能体完成。 研究问题:编码智能体会查阅哪些文档、在什么时机查阅、查阅后会发生什么? 本研究基于行为轨迹数据,对智能体与文档的交互进行大规模实证分析,并提出一个描述性模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-20

本文提出了首个确定性算法,能够对任意二维奇异模型精确计算局部学习系数(即局部实对数规范阈值 RLCT),其适用条件为模型的 Kullback-Leibler 散度与某个多项式接触等价,并展示了包括多项式神经网络在内的广泛应用。

经典信息准则(如贝叶斯信息准则 BIC)依赖正则性假设,而深度学习等奇异模型不满足这些假设,会导致模型选择错误。广泛适用的贝叶斯信息准则(WBIC)需要局部学习系数 λ,在解析情形下 λ 等于模型 KL 散度的局部实对数规范阈值(RLCT)。此前学习系数的精确计算仅限特例,一般只能使用基于采样的估计方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条