AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1801-1820 条,共 2269 条
第 91 / 114 页
事件日期 2026-07-15

Mind Lab 发布的 Macaron-V1 采用 Mixture-of-LoRA(MoL)架构,通过四个独立 LoRA 模块分别掌管聊天、Agent、编程和生成式 UI,在 SWE-bench Verified 等评测中达到或超越 Opus 4.8、GPT-5.5 等闭源模型,同时坚持开放权重、可私有化部署,并被视为“经验时代”持续学习路线的重要落地案…

2026 年 7 月 15 日,前 OpenAI CTO Mira Murati 发布 Thinking Machines Lab(TML)的 Inkling 模型(975B 参数,20亿美元融资)。同日,图灵奖得主 Richard Sutton 宣布创办 Oak Lab,强调要从根基重新审视深度学习。 DeepSeek 创始人梁文锋此前也提出:下一代模型…

产业观察 · 原始来源:新智元 · ai-industry
事件日期 2026-07-15

快手旗舰级Agentic Coding模型KAT-Coder-Pro V2.5在编码智能体评测中超越Claude Opus 4.8(PinchBench 94.2分 vs Opus),SWE-Bench Pro 65.2分仅次于Opus,并通过AutoBuilder将仓库环境构建成功率从16.5%提升至57.2%,沉淀超10万个可验证环境。

快手发布KAT-Coder-Pro V2.5,这是其旗舰级Agentic Coding模型,专注于代码生成与工程任务。实测中,该模型可在34分钟内手搓点球游戏、用约1400行代码复刻《我的世界》,并在1分20秒内闭环定位真实开源库Bug。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-15

斯坦福团队在《Science》上发布的Biomni是首个整合105个生物信息学软件与59个数据库的通用AI智能体,可自主完成基因分析、药物研究、罕见病诊断等全流程科研任务,在443题评测中平均准确率57%,多项任务达到资深专家水平,并将罕见病诊断耗时从110分钟压缩至3分钟。

斯坦福大学研究团队在《Science》期刊上推出通用生物医学智能体Biomni。该智能体集成了105个生信软件和59个数据库,旨在让AI贯穿生命科学研究的全过程,包括基因分析、药物研究、疾病诊断、蛋白优化与实验设计。Biomni能够自主调用工具完成复杂工作流,并可与PyLabRobot对接,将自然语言实验需求转化为机器人可执行代码,打通干湿实验壁垒。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-15

VideoRAE 利用冻结的视频基础模型(V-JEPA 2、VideoMAEv2)的多尺度分层特征,通过轻量级 1D 自注意力投影仪压缩为紧凑、可重建且适合生成任务的视频潜在表示,在 UCF-101 类到视频生成任务上取得最先进的 gFVD(AR 40,DiT 93),训练速度比竞争自编码器基线快约 5 倍。

视频生成模型通常依赖 3D-VAE 学习潜在空间,但传统 3D-VAE 主要针对像素级重建优化,导致其潜在表示捕捉的语义和时空结构有限。与此同时,视频基础模型(VFM)如 V-JEPA 2 和 VideoMAEv2 表现出强大的视频理解能力,但能否将其冻结表示转化为紧凑、可重建且生成友好的视频潜在表示尚未被充分探索。本文提出 VideoRAE 回答这一问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

Transformer 前馈块的各个架构组件(跳跃连接、归一化放置、两矩阵结构、宽度扩展)在初始化时协同控制梯度秩(rank)的保留,从而平衡秩崩溃、集成行为与参数数量之间的内在权衡;输入-输出 Jacobian 的初始化秩可以预测 CIFAR-10 上的训练可行性。

深度 Transformer 中,矩阵乘法和非线性激活在增加表达力的同时会降低表示和梯度的秩,导致深度增加时出现“秩崩溃”(rank collapse)等谱病理。该论文系统研究 Transformer 前馈块中每个设计元素(跳跃连接、归一化、双矩阵结构、中间宽度扩展)如何影响秩随深度的演化,并试图统一已有的归一化放置、深度缩放等领域的结果。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

TRACE 是一种无需额外评判器或过程标注的密集信用分配方法,通过冻结参考模型的对数概率与时序差分(TD)变化为每个智能体动作分配奖励,在纯强化学习(无监督微调、无中间训练阶段、无实时网络数据)下显著提升了长程搜索智能体的工具使用能力。

多轮智能体在执行复杂任务时,需要经过数十至数百次工具调用序列才能给出最终答案,这使得后训练阶段面临根本性的信用分配挑战。仅基于最终结果的奖励在短程推理中可靠,但在长轨迹中变得稀疏且方差大,甚至可能误导:一次失败的探索中可能包含许多有用的动作,但结果奖励会将这些动作与最终错误等同对待,分配给它们相同的负优势。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

在不动用底层模型微调的情况下,仅用轻量级线性/注意力探针从 Evo 2 第 26 层冻结激活中提取信号,即可在宏基因组测试集上以高区分度检测抗菌素耐药性(AMR)和细菌毒力,为快速、低成本的宏基因组生物监测提供第一道筛查层。

基因组基础模型(如 Evo 2)能够学习丰富的序列表示,但其在生物安全筛查中的价值此前缺乏系统评估。本研究探索了在冻结 Evo 2 模型(不微调)的条件下,其倒数第二层(layer‑26)的激活中线性可及的生物安全相关信号量级,具体包括 AMR 和细菌毒力的检测能力,并检验该方法在实际短读测序场景中的鲁棒性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

将语言模型中的Screening机制(基于查询-键相似度的绝对相关性评估与显式低相关令牌剔除)扩展到视觉领域,提出VisionScreen模型,在图像分类基准上优于传统Vision Transformer(ViT)。

传统的ViT依靠softmax归一化的自注意力机制,为所有图像块分配相对权重,导致难以独立评估每个块的相关性。图像中常包含大量背景或冗余块,而自注意力无法显式排除它们,从而将不必要的信息引入特征聚合。本文受语言建模中Screening的启发,提出了VisionScreen,通过绝对相关性评估使每个图像块只聚合内容与空间上相关的块,不再依赖softmax带来…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本研究旨在解决两个核心问题:1)沙尘浓度上升趋势在欧洲是否一致?2)主要驱动因素究竟是沙漠化/干旱化,还是大气环流变化?团队通过构建欧洲最全面的沙尘金属元素日数据库(103个站点,约18,500个日测量值),结合机器学习模型与阿尔卑斯冰芯记录,给出了多尺度答案。

学术前沿 · 原始来源:nature.com · foundation-model
事件日期 2026-07-15

Peak-End-Net 是一种受心理学“峰终定律”启发的轻量级视频美学评估框架,利用冻结的视觉 Transformer 和少量可训练参数,在域内和跨域视频美学基准上均取得当前最优性能,验证了心理学建模在视频美学评估中的价值。

视频美学评估(VAA)旨在预测视频的美学吸引力,但相较于图像美学评估(IAA)等其他视觉评估任务进展缓慢。主要障碍包括:大规模标注基准的缺乏,以及美学判断固有的主观性。本文从心理学角度重新审视 VAA,基于“峰终定律”(人们主要依据体验中的高峰时刻和结尾来评判整体体验)设计新框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本文扩展了经验贝叶斯变分自编码器(EB-VAE)框架,使其能够同时建模纵向肿瘤体积轨迹和脱落(dropout)事件时间,并通过基因条件先验整合高维基因组协变量,在黑色素瘤和乳腺癌实验中验证了混合半机械解码器在参数可解释性上的优势。

在肿瘤治疗反应建模中,纵向肿瘤测量、脱落信息(丢失原因可能与疗效相关)和遗传协变量提供了互补信息,但如何将这些异构数据源整合到统一的群体模型中仍面临挑战。现有非线性混合效应模型(NLME)可解释但扩展性有限,而纯神经方法缺乏机制约束。本文旨在构建一个灵活的概率框架,同时处理:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

通过复用迭代微调过程中的检查点作为领域专家,并训练一个轻量级页面级图像分类器按视觉风格路由,该系统在满文三种书写风格(楷书、奏折半草书、行书)的OCR上,以0.30%、1.57%、4.83%的字错误率(CER)匹配了专门训练的专家性能,且路由器页面级领域分类准确率达99.3%。

历史满文OCR面临多种视觉风格差异(楷书、行书、奏折使用的半草书)以及标注数据稀缺的双重挑战。传统单一OCR模型难以兼顾全部风格,而逐域单独训练专家则需要大量标注和存储开销。该研究提出一种多专家路由系统,从已有的迭代微调过程中“捡回”中间检查点作为领域专家,并用一个轻量级分类器自动将页面分派到最合适的专家,从而在低资源场景下高效覆盖多风格OCR。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本文从最小最大(minimax)理论出发,证明基于似然的深度神经网络(DNN)估计器在同时存在乘性散斑噪声和加性高斯噪声时,非参数回归的估计误差上界与下界匹配,且收敛速率与仅有加性高斯噪声的情况相同(对数因子除外),表明乘性散斑噪声并未从本质上增加估计的统计难度。

散斑噪声(speckle noise)是一种乘性噪声,常见于合成孔径雷达(SAR)、光学相干断层扫描(OCT)和数字全息等相干成像模态。尽管深度学习方法在散斑去噪中已取得实际最优性能,但其基本统计极限长期未被探明。与加性噪声不同,乘性散斑噪声导致回归函数无法通过条件均值识别,常规的基于最小二乘法的深度学习方法不再适用。本研究首次从统计学习理论角度回答:在乘…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

利用录音元数据(如地点和时间)作为辅助监督信号,可以显著提升生物声学基础模型的物种识别性能及其对真实世界被动声学监测场景中物种分布偏移和声学域偏移的泛化能力。

生物声学基础模型通常依赖大规模公民科学平台(如 Xeno‑Canto)提供的地理与生态多样数据。已有工作表明,仅使用监督学习即可在如此大规模数据上训练出顶尖的物种检测模型——但这些社区数据仓库中附带的录音元数据(位置、时间等)尚未被充分利用。本研究系统探索了将元数据作为辅助监督信号的可行性,并提出新模型 MetaPerch,在 17 个生物声学数据集上评估…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

M⁴World 是一个能够同时生成未来环视视频流和同步 LiDAR 点云的多视角多模态驾驶世界模型,支持用户在个体物体级别进行交互式操控,并可稳定输出长达分钟级的流式预测。

驾驶世界生成(driving-world generation)是实现可扩展自动驾驶仿真的核心技术,但已有方法在物体级别的精细可控性以及长时间跨度的稳定性上存在明显不足。本文提出 M⁴World 以同时解决这两个瓶颈。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本文提出将李雅普诺夫特征指数(LCE)作为强化学习中的密集奖励信号,使智能体在倒立摆的竖直运动稳定任务中不仅复现了经典的Kapitza摆振荡模式,还发现了更优的阻尼方案——将摆锤完全固定在严格竖直位置(静止稳摆),超出了Kapitza摆原本的动态稳定范围。

**研究问题**:如何让强化学习智能体在没有显式物理方程指导的情况下,自动发现倒立摆通过竖直方向主动运动实现稳定的策略?传统稀疏奖励(如“是否稳定”)难以引导智能体学习,而物理启发式密集奖励可能加速探索。 **背景**:Kapitza摆是经典物理现象——通过高频竖直振荡使倒立摆稳定在倒立位置(动态稳定),但稳定后摆锤仍会持续小幅度振荡。本文试图通过强化学习…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-15

本文提出一种基于平方Wasserstein距离来衡量非高斯性的新ICA算法OT-ICA,证明最大化数据投影与标准正态分布之间的Wasserstein距离等价于恢复独立成分,在模拟数据和实际应用(EEG伪影去除、计量经济价格发现)中均优于传统代理方法。

线性独立成分分析(ICA)旨在从线性混合信号中恢复相互独立的源信号。经典ICA算法通过最大化非高斯性(用负熵衡量)来实现,但精确的负熵优化在计算上不可行,因此依赖代理对比函数(如四阶累积量)和参数化对数似然。本文提出直接使用平方Wasserstein距离 $W_2^2$ 作为非高斯性度量,规避了对代理函数的依赖。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条