AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1561-1580 条,共 2269 条
第 79 / 114 页
事件日期 2026-07-22

NVIDIA Rubin GPU通过晶体管架构、内存子系统(HBM4)和计算效率的全面提升,为智能体AI工作负载提供了相比Blackwell高达10倍的每单位能源吞吐量,该GPU是Vera Rubin平台的核心,旨在将数据中心重塑为单一计算单元,以应对智能体推理对低延迟、高吞吐和长上下文处理的需求。

随着AI应用从离散的模型训练和面向人类的聊天界面转向“始终在线”的AI工厂,这些工厂正承担起驱动智能体工作流的任务。智能体工作流需要推理、规划、使用工具、验证中间结果,并在庞大的上下文中执行复杂的多步骤任务。这些工作负载不是由单一的提示和响应定义的,而是需要跨多个推理步骤的持续推理,对每一步的延迟、解码吞吐量、长上下文注意力机制、KV缓存容量以及跨紧密耦合…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-22

2026年第二季度,通用Agent正式从对话工具进入真实工作流,夺回软件入口并深入垂直行业,但随后的Tokenmaxxing运动因成本高、无效Token占比大(约90%)、组织复核瓶颈而失败,催生出Multi-Agent、自进化AI、Loop Engineering和模型路由等新方向,同时就业、安全、信息污染和认知缴械等负面效应开始显现。

2025年底:多数人仍将AI当聊天工具,一问一答即结束。 2026年Q2:OpenClaw、Codex、Claude Cowork等将AI从对话框拉出,Agent能自主读写文件、跑代码、操作软件,甚至接入企业系统。 核心转变:问题从“Agent能不能干活”转向“如何搭建高效Human in Loop体系并有效降低成本”。 八个趋势连成连续故事:通用Agen…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-22

PSDA 是一种专为无监督域适应中分布匹配损失(如 CORAL 和 MMD)设计的随机方差缩减技术,通过跨域和域内配对采样形成“四元组”,有效降低小批量优化中的梯度方差,从而提升目标域精度。

无监督域适应(UDA)常用相关性对齐(CORAL)和最大均值差异(MMD)作为分布匹配损失。然而这两种损失在小批量优化中方差较高,且缺乏有限和结构,无法直接套用经典随机方差缩减(SVR)方法。本文提出 PSDA,旨在解决该方差瓶颈。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

生成式AI(以ChatGPT、Perplexity、Gemini为代表)已成长为学术图书馆资源的新兴发现渠道;集成链接引用功能后,AI带来的流量显著增长,且用户主要访问位于机构知识库中的开放获取电子学位论文。

该研究对2023年8月至2025年10月的网络分析数据进行了实证分析,考察生成式AI作为学术图书馆资源发现途径的角色。研究聚焦于AI中介流量随时间的变化,以及哪些AI平台和资源类型主导了用户访问。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

自然语言自编码器通过重构得分评估解释忠实性,但该测试对单个虚假声明不敏感,即使高重构得分也无法保证每个声明为真。本文提出RECAP方法,通过共训练线性解码头使指定内部内容可独立验证,显著提升对对抗性谎言的检测能力(AUC 0.95 vs 基线0.51)。

现有方法用自然语言自编码器对隐藏层激活做解释,认为若能从解释文本重构出激活则解释是忠实的。但该检验存在结构性缺陷:翻换单个虚假声明若不改变重构结果,该声明便不受到惩罚。研究表明(在Qwen-2.5-7B verbalizer上)重构得分远高于随机水平,但仅约2%的具体声明与重构相关,因此得分反映的是“大意”而非具体事实。在精确合成真实值下,标准方法在5/5…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

本文首次将基于虚拟现实(VR)的上半身遥操作与强化学习(RL)的下半身平衡运动控制栈从全尺寸人形机器人迁移到小型人形机器人 ROBOTIS OP3 上,实现了 0.45 m/s 的独立于手臂运动的行走,并在 10 分钟内完成约 5 m 距离的远程搬运任务。

全尺寸人形机器人的通用控制能力近年来快速增长,制造商普遍采用“VR 遥操作上半身 + RL 控制下半身”的范式,使单人远程操作员能同时观察、操作和行走于真实远端环境。然而这类控制栈通常部署在昂贵的大型机器人上,研究社区难以获取。相比之下,小型人形机器人虽然更普遍,但仿生程度低(传感器少、自由度少),缺乏类似的控制栈开发。本文试图填补这一空白:为小型人形机器…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

Condition Dropout(ConD)是一种简单的持续训练范式,通过在预训练 RGB-D 模型上冻结原始编码器、复制编码器并用零初始化特征注入,随机模拟完整、RGB-缺失和深度-缺失的输入,显著提升缺失模态下的分割鲁棒性,且在完整模态下性能略有提升。

RGB-D 语义分割在完整输入下已取得显著进展,但现有模型默认 RGB 和深度始终可用。实际监控场景中,传感器故障或遮挡常导致某一模态缺失。即便单模态已包含足够线索,仅在完整模态上训练的模型无法利用剩余模态特征,性能严重下降。本文提出 ConD 解决此问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

PortLLM 的 LoRA 补丁在连续预训练的多步更新中依然保持时间可移植性,其根本原因是高维向量之间的近正交性。

PortLLM 是一种无需训练、无需数据的微调方案,用于在连续预训练之后适配大语言模型。先前工作只验证了 LoRA 补丁的短期时间可移植性,但长期性能如何(跨多个连续预训练步骤)尚不清楚;此外,PortLLM 为什么有效缺乏理论解释。本研究通过 10 步连续预训练实验(基模型:Mistral、Gemma、Qwen)和两项理论分析回答了这两个问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

视觉语言模型(VLM)对图像和问题(文本)的呈现顺序存在系统性的性能差异(图像先于文本时准确率更高),但通过一种简单的、非对称的测试时训练方法可以消除这一差距,甚至提升基线性能。

以往研究发现VLM对输入格式(如模板、描述措辞)敏感,本文发现了一种新的语义无关扰动——**模态顺序**(image-first vs. question-first)会在多个模型和基准上引发可重复的性能差距。研究旨在量化此差距的规模,探索其内部机制,并提出一种轻量级修复方法。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

本文提出了一种基于Clopper-Pearson置信区间和潜在空间特征探索的框架,能够为任意提示下LLM生成有害输出的概率计算严格且可靠的下界,首次实现了对LLM安全性的形式化统计认证。

现有LLM安全评估通常依赖经验性测试或启发式规则,缺乏对有害输出概率的严格数学保证。作者提出以下问题:如何为给定提示计算一个形式化可证明的、小于真实有害概率的统计下界,且即使真实概率极小时也能高效计算?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

SoftReason 提出了一种完全可微的神经-软符号演绎推理架构,通过将演绎状态表示为张量并设计可微的即时推论算子,弥合了感知(高维数据)与符号推理(知识图谱规则)之间的梯度断层,首次实现端到端可训练的知识感知视觉问答。

传统神经符号系统在感知模块(从图像等高维数据提取事实)与演绎推理模块之间存在离散接口(如符号化中间表示),导致梯度无法反向传播。SoftReason 旨在解决这一“梯度鸿沟”,使得感知和推理可以在一个统一的、可微分的网络中进行联合学习。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

Self Gradient Forcing (SGF) 通过两遍训练策略,在不展开完整序列反向传播的前提下,恢复自回归视频扩散模型中未来帧损失对历史上下文编码的梯度监督,使仅用5秒训练窗口就能外推至数分钟的长视频,在主体身份、背景/布局一致性和时间稳定性上显著优于现有 Self Forcing 方法。

近年来,自回归视频扩散方法普遍基于 Self Forcing 框架:模型在训练时使用自身滚动生成的历史帧(而非真实视频上下文)作为输入,以减轻训练与推理之间的曝光偏差。然而,在 Self Forcing 中,历史键值缓存(key-value cache)仅作为冻结的 rollout 状态被未来帧使用,导致未来帧的损失无法反向传播来指导早期生成的隐变量如何写…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

PyroDash 通过让小语言模型(SLM)在生成过程中按 token 发出控制令牌,自主决定是否向大语言模型(LLM)卸载部分推理,可在数学推理基准上以更低总成本实现接近甚至超过纯 LLM 推理的准确率。

PyroDash: Cost-Efficient Token-Level Small-Large Language Model Collaborative Inference

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

PG-KINN 将 Kolmogorov-Arnold Network(KAN)作为试验空间,配合紧支撑分段多项式测试空间,通过 Petrov-Galerkin 弱形式集成物理信息,在裂纹奇异性、超弹性、逆参数识别等力学基准上一致优于传统 MLP 及现有 KAN 强/能量/逆形式方法(PIKAN)。

物理信息学习 PDE 长期由 MLP 主导,但 MLP 存在谱偏差和密集参数化限制精度与可解释性。KAN 因其可学习样条激活函数与经典离散化的分段多项式基在结构上对齐,缓解了这些问题。然而,将 PDE 转化为损失函数的方式同样关键:强形式残差最小化需要高阶导数和重加权损失;能量(Bubnov-Galerkin)形式仅适用于自伴算子,且在参数识别问题中会退化…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

PercepCap 通过先显式生成包含对象轨迹与时间事件的时空感知轨迹,再基于该轨迹生成最终字幕,从而提升视频字幕的时空理解准确性和模型可解释性。

视频字幕生成需要对物体位置(空间)和事件发生时间(时间)进行细粒度感知。 现有多模态大语言模型(MLLM)通常直接根据视频输入生成字幕,不暴露描述背后的感知证据,导致时空感知错误仅出现在最终输出中,难以直接定位底层感知错误。 为此提出 PercepCap,一种感知感知的视频字幕框架,在生成最终字幕前显式输出感知证据。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

ARROW 是首个面向流式数据环境、针对最大均值差异(MMD)和相关性对齐(CORAL)损失函数的在线随机方差缩减算法,其性能可与离线方法媲美。

现有针对 MMD 和 CORAL 损失的随机方差缩减(SVR)算法仅适用于离线场景,无法直接用于在线、分布式或增量学习,而流式数据中批次间统计波动会增大估计方差、降低域适应效果。本文提出 ARROW 以解决该问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-22

LLM能够从自身或教师模型的解题轨迹中提取自然语言形式的经验抽象(如策略和警示),并通过推理时检索或强化学习训练来提升数学和逻辑推理性能,且自提取抽象与教师提取抽象效果相当。

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条