AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 601-620 条,共 2259 条
第 31 / 113 页
事件日期 2026-08-19

SCORE 提出一种无目标标签的跨被试 EEG-to-Image 检索框架:通过“恢复”不同被试在共享图像空间中的坐标方向,在 200 路检索基准上显著改善无标签新用户的检索准确率,且部署时无需目标标签或更新编码器。

视觉解码可从 EEG 等神经信号中恢复被试感知的图像内容,有潜力用于神经通信。但现有 EEG-to-Image 检索方法面对没有标注校准数据的新用户时,性能远低于被试内(within-subject)方法,限制了实际部署。作者分析跨被试 EEG 特征后发现:不同被试对概念间关系的保持是相似的,但这些关系所在的坐标方向不同;由此提出 SCORE。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

在广泛临床采用前,必须对大语言模型(LLM)在医疗中的安全(safety)与安保(security)风险进行系统评估和缓解;该综述提供了一个统一框架,将风险映射到临床AI系统的开发阶段、安全防护层和当前临床相关威胁上。

生成式AI尤其是大语言模型正在快速进入临床诊疗,但广泛适用性也带来新的责任、脆弱性和威胁。 本文是发表于 *Nature* 的综述文章,在线发表时间为2026年8月19日,卷656,页577–589。 重点评述LLM本身及其与医院工作流、人类医务人员交互中的安全与安保文献。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-19

本文提出用最优传输(optimal transport)球替代相对熵球,构造“Wasserstein 熵值风险”(Wasserstein entropic value-at-risk, WEVaR),使正在学习环境的智能体在无知时保持谨慎、在自信时变得大胆,并且能覆盖名义模型认为“不可能”但实际可达的灾难情景;目前摘要给出了理论框架与双重对偶性,具体数值结…

研究问题:传统熵值风险(Entropic Value-at-Risk, EVaR)通过鲁棒优化恒等式将置信水平解释为相对熵球半径,但该相对熵球无法触及名义模型(nominal model)赋概率为零的灾难事件。对于一个安全攸关的学习型智能体,这些“名义上不可能”的灾难恰恰是必须对冲的。 本文做法:改用最优传输球(Wasserstein 球)作为替代模型集合…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

VITAL 是一个基于双通道共学习架构的深度学习框架,通过融合蛋白质语言模型嵌入与几何感知编码器,能够同时预测肽-蛋白相互作用、映射结合界面并估计定量亲和力,在多个基准上取得最高 AUC=0.87 的准确率,并以开源包和交互式网站形式供社区使用。

肽-蛋白相互作用的定量表征是计算生物学中的长期挑战,限制了机制理解和治疗开发。现有方法多聚焦于定性筛选或结构预测,缺乏同时提供界面信息与定量亲和力估计的统一平台。VITAL(Versatile InTerface-Aware global-local co-Learning)旨在解决这一问题,通过深度学习同时实现相互作用预测、界面映射和亲和力定量。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-08-19

多视图推理本身可以被预训练并在任务间复用:SIMPLE 的冻结推理骨干在不更新参数的情况下具有竞争力,经轻量适配器校准后在多数评测数据集上取得领先性能。

现代预训练编码器使异构视图的表示越来越可复用,但决定视图效用、组合证据的流程在每个下游任务中仍被重新学习。有关视图相关性、互补性、可靠性、缺失性的知识因此被反复丢弃,而不是跨任务迁移。本文重新表述多视图学习:不是学习固定融合函数,而是学习一种可复用的、任务条件化的推理流程。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

现代 Intel AI PC 虽然单机内存不足以容纳 70B 级大模型,但通过将模型按层切分为预编译的 OpenVINO 流水线分片,并组合使用“beam_idx Gather 注入”“投机解码”和“微批处理”三项技术,几台 AI PC 在普通网络上协作就能提供服务,且性能可达到甚至超过单机未拆分模型的吞吐。

论文提出一个分布式 LLM 推理方案,目标是利用 Intel AI PC 上常常空闲的集成 GPU 和 NPU 资源(16+ GB 统一内存),让一组 AI PC 协同运行单个设备无法容纳的大模型(如 70B 参数 LLM)。核心研究问题是如何把层间流水线并行改造成实际可用的高速推理系统,而不仅仅是“能跑起来”。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

单个训练样本对最终模型的贡献通常只能“估计”而无法“测量”,因为要直接测量,需要做两次完整的预训练,而两次训练之间仅在一个 batch 的一行上存在差异。本文在较小规模上把这种反事实实验真正跑了出来:训练了 32 个 124M 参数的 GPT-2 模型(在 OpenWebText 上),共 4 种条件、8 个随机种子。在总训练步数 9,536 步中的第 2…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

将梯度提升集成中每棵树的叶值视为坐标,每个样本就变成 R^M 空间中的一个点,模型分数就是坐标之和;这一视角为对比解释提供了精确且可审计的基础,并支持在“可执行性”约束下更有效的逆决策(recourse)。

研究问题:梯度提升集成的预测是“每棵树一个叶值相加”。能不能不再依赖近似、采样或对特征的可加性假设,而是通过视角转换直接获得精确对比解释? 核心论点:把叶值当作坐标而不是中间结果后,每个样本成为 R^M 中的一个点,模型在该空间中线性地工作:分数 = 坐标之和。 后续做法:论文基于该表示构建逆决策方法,并在五个表格数据集上使用重复交叉验证评估。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

该研究利用深度学习模型将大气环流预测转化为降水预测,预测2026年夏季中国中部将出现干燥异常,并通过可解释性分析将这一预测主要归因于特定的大气环流异常。

Interpretable AI predicts a 2026 summer dry anomaly in central China

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

本文提出了一条利用RGB正射影像辅助生成3D探地雷达(GPR)标注数据的高性价比流程,并设计了一个融合残差连接、混合卷积核与深度/通道注意力机制的3D CNN,在路面修补(patch)和裂缝(crack)缺陷的二分类任务中优于基线架构。

探地雷达(GPR)是土木与交通工程中广泛使用的无损地下探测技术,但要在自动化道路检测中大规模应用,面临两个关键挑战:一是标注过的真实3D GPR数据集稀缺;二是缺少专门针对3D GPR数据特性设计的深度学习模型。本研究同时应对这两项挑战,在真实运营中的高速公路路段上构建数据集,并提出专用3D深度学习框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

前沿语言模型的平均能力已接近饱和,真正区分系统的是重复相同请求时输出围绕目标的“散布”或“精度”,而不是“能力”本身。

论文(arXiv:2608.19140v1)指出,当前对前沿语言模型的比较、营销与基准测试都围绕“能力”(capability)——即最好或平均输出能达到什么水平。作者认为这衡量了错误的轴:模型的准确度已经饱和,均值能落在目标上;实际区分系统的是“精度”(precision),即在重复相同请求下输出围绕目标的集中程度。文章借用射击术语说明:能力是平均弹着点…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

作者提出利用 RVQ 神经音频编解码器自身的层级结构,在连续码本几何空间中做“对比式检索”来代替传统的离散 token 预测或连续回归,从而从较粗的编解码器 token 重建高质量音频;在语音和音乐的编解码器恢复任务上,该方法优于单遍 token 预测基线和单步回归基线(具体指标和实验细节待核实)。

背景:基于残差向量量化(RVQ)的神经音频编解码器,已成为基于 token 的通用音频生成中最主流的离散表示方式。 问题:从较粗的编解码器 token 重建高质量音频仍然是开放问题,并约束着所有生成这些 token 的系统的保真度上限。 既有框架:过去研究通常把“重建”二分为离散 token 预测或连续回归。 本文论点:这种二分法不完整;RVQ 的层层次本…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

本技术报告描述了通过人声模仿查询声音效果的两种互补微调策略,是 AES AIMLA 2025 挑战赛的获胜提交;但摘要未给出具体性能数字,实际效果有待核实。

该报告针对的是 AES AIMLA 2025 挑战赛中的声音效果查询任务:用户通过模仿声音(例如用嘴模拟“嗡嗡”或“碰撞”声)来检索对应音效。作者在赛后更新了技术报告,以补充挑战赛结束后发布的细节。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

本研究用超分辨率生成对抗网络(SRGAN)对锂离子电池NMC正极材料的低分辨率EBSD数据进行计算增强,在5倍超分辨率下可实现约25倍的采集加速或视场扩展,并在晶粒尺寸、形状等关键指标上保持可接受的精度。

电子背散射衍射(EBSD)是定量表征锂离子电池电极材料微观结构、优化电池性能的关键手段,但EBSD采集速度慢,难以获得具备统计代表性的高吞吐量数据集。本文尝试用机器学习超分辨率框架,将低分辨率EBSD数据计算增强为高分辨率数据,从而提高EBSD分析通量。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

S-JEPA 的软目标中,非最大概率的数值结构并不能完全决定学习到的 Encoder 表示;这些非最大概率值被分配到哪些 GMM 分量同样重要。

S-JEPA 使用软高斯混合模型(GMM)后验概率而非硬聚类标签来保留不确定性。已有做法通常只关注概率值本身,但一个未被回答的问题是:当某个样本的非最大概率值集合固定时,这些值具体映射到哪些 GMM 分量,是否会影响最终学到的 Encoder 表示?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

本文提出 MDTIM(Masked Diffusion Time-series Imputation Model),通过掩码扩散训练和随机离散化,使模型在时间序列插补任务中直接预测原始值,并在多种缺失场景下取得优于现有确定性方法和生成式方法的鲁棒性与可扩展性。

时间序列插补对可靠的时间序列分析至关重要,但真实数据中的复杂时序动态和噪声使其仍具挑战。现有方法存在两个主要局限:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条