AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 781-800 条,共 2259 条
第 40 / 113 页
事件日期 2026-08-13

DreamX-Phi 1.0 是一种动作条件视频世界模型,输入观测帧、语言指令和预设动作序列(末端执行器位姿与夹爪状态),预测未来观测;它通过 PRoPE 风格几何编码、深度分支和 SAM3 掩码 + V-JEPA 教师保证动作忠实性与物体一致性,并在 WorldArena 2.0 Challenge 的 Track 1 和 Track 2 上分别获得第一…

机器人操作需要预测动作执行后的未来视觉结果,但仅追求生成真实性不足以保证预测对动作的忠实性——模型可能生成“看似合理”的视频,却移动了错误的机械臂或丢失了被操作的物体。DreamX-Phi 1.0 旨在解决动作条件视频世界模型中“真实但不忠实”的问题,同时兼顾场景几何、小物体操作一致性以及部署效率。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

本文从半参数理论出发,为点击后转化率(CVR)这类链式结果提出了一个新的双稳健因果效应估计器,并设计了目标正则化框架来提升数值稳定性;理论和实验均表明,其优于朴素地组合“损失去偏”与标准因果估计器的做法。

CVR 是电商和广告中的关键指标,反映转化流程第二阶段的效率和用户体验,因此估计 CVR 的因果效应具有重要的实际意义。 直接对点击样本应用现有因果推断方法会带来样本选择偏差,并因排除未点击数据而增大方差。 近期 CVR 预测研究引入“理想损失”(ideal loss),试图在全样本上通过无偏的损失估计来优化模型参数;但损失的无偏性并不能保证最终估计量的无…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

Mimir v1 是一个基于 Hierarchical Reasoning Model(HRM)架构、参数规模为 10 亿的语言模型,从零开始训练,仅使用“许可”(permissible)的后训练数据,就在英语上表现出强竞争力,并在丹麦语上达到新的最先进水平,同时保持模型开放可获取。

当前大语言模型开发高度依赖大规模、通常并非合法可用的数据集,这对致力于开源和符合伦理数据来源的研究者构成了很高门槛。该研究针对这一问题提出 Mimir v1,探索是否可以在仅使用可许可数据的前提下,用较小规模的开放模型取得具有前沿竞争力的表现。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

本文提出一种简单且高效的“防御式提升器”(Defensive Booster),能够同时获得在线梯度提升的 Brier 分数竞争性保证和在线弱到强提升在弱学习条件下的误差收敛保证,而此前这两种保证需由不同方法分别提供。

研究在线概率预测问题:由自适应对手选择二元结果,预测者需要逐轮输出概率预测。作者希望利用一个针对弱假设类 $H$ 的在线学习算法,同时达到两种不可比较的保证:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

DARTree 是一种无需训练的推测解码方法,将预训练的自回归修正头(AR correction head)从单条链扩展到树结构,在数学、代码和对话等七个基准上实现了更高的平均接受长度和推理加速。

推测解码通过并行验证多个草稿 token 来无损加速自回归语言模型。扩散式草稿模型能并行预测整个 token 块,但其逐位置分布是边缘分布,并未按每个草稿路径实际选中的 token 进行条件化;现有循环修正方法仅沿单条草稿链引入因果信息,而扩散式树构建扩大了候选覆盖范围,但没有在单个分支内携带这种修正。DARTree 研究的问题是:如何将预训练的自回归修正…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

ContactGuard 利用动作条件潜世界模型,在机械臂尚未接触物体前预测策略动作块(action chunk)的短期后果,若预测潜状态指示失败则提前中止执行,从而避免接触类操作中“接触后才发现失败”的问题。

接触丰富的机器人操作中,失败往往要在机器人已经与物体发生接触后才被检测到。特别是在腕部相机设置下,虽然近距的夹爪—物体视图有助于观察接触状态,但一个不良的接近动作可能在传统检测器反应之前就已经造成推挤、未抓取、滑动或扰动物体。ContactGuard 针对分块视觉运动策略(chunked visuomotor policies)提出一种接触前执行监控方法,…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

基于 One-Class SVM(OCSVM)、Minibatch K-Means(MK-Means)和 Maximum Mean Discrepancy(MMD)的概念漂移检测方法,都能让恶意软件分类模型达到与周期性重训练相当的准确率,同时显著减少需要重训练的模型数量;其中 OCSVM 驱动的漂移感知重训练总体表现更优。

概念漂移指数据随时间的统计特性相对于训练数据发生变化。恶意软件检测或分类模型尤其容易因概念漂移而性能下降,因为攻击者会不断修改现有恶意软件。本文研究如何自动检测概念漂移,并在检测到漂移时触发重训练,以替代“无论是否漂移都定期重训练”的高成本策略。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

该文证明,对于测试时对抗样本鲁棒学习,VC 类的样本复杂度可以做到关于 VC 维 $d$ 线性;这一结果由一个简单的不当(improper)算法实现——对 $O(d^*)$ 个 bootstrap 样本分别做鲁棒经验风险最小化(RERM),再输出多数投票,其中 $d^*$ 为对偶 VC 维。同时,文中给出匹配下界:在该 oracle 模型下,任何学习器都需…

本文研究测试时(test-time)对抗样本鲁棒学习问题:学习一个预测器,使其在输入被对抗性扰动时仍保持正确。此前 Montasser, Hanneke, and Srebro (2019) 给出了一个上界,而本文证明 VC 类的对抗鲁棒学习具有线性于 VC 维的样本复杂度,相比旧上界实现指数级改进。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

AutoDesign 将“模型-框架(harness)系统”本身作为优化对象,通过元框架优化器驱动代码智能体依据运行反馈递归改进框架,在论文转海报任务上以低于 3 美元、40 分钟的自主运行达到接近会议海报质量,并在 PosterBench 上超越闭源商业系统 Claude Design。

多模态源材料到精简结构化媒介输出(如学术论文转海报)可被概念化为一个以模型-框架系统为中心的长时程智能体过程。理想框架系统应满足两点:贴合人类设计先验,并能通过经验探索积累可复用经验、实现递归自我改进。论文指出现有范式是静态的,缺乏这种能力。为此提出 AutoDesign,并选择论文到海报生成作为实例化与评估场景。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

本文首次完整刻画了Transformer在正则语言上的长度泛化能力,并给出一个以语言句法幺半群大小为参数的多项式时间判定算法。

Transformer语言模型有时能泛化到比训练时更长的序列,但缺乏对“哪些任务允许长度泛化”的精确刻画。正则语言是语言理论中的基础类别,此前甚至不知道Transformer能在哪些正则语言上实现长度泛化。本文解决这一问题,其核心工具是对C-RASP形式体系的代数刻画。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

AlayaWorld v1.1 在保持骨干架构、分块自回归生成方案和训练数据不变的前提下,大幅修订了条件信号的表示与注入方式,核心原则是让条件信号在潜在表示和时间结构上尽量贴近生成内容。

本卡片基于 arXiv 上发布的 *AlayaWorld: Interactive Long-Horizon World Modeling - Full Technical Report (v1.1)* 技术报告。报告介绍了一个改进版 AlayaWorld。与前版相比,骨干架构、分块自回归生成方案和训练数据保持不变,但条件信号的处理被重构:此前基于深度扭曲…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

Evoke 通过将持久世界状态外部化、并重新设计教师模型来提供长时程监督,使三步生成学生模型在保持低延迟交互的同时,获得有界上下文、抗长期漂移的开放式世界生成能力。

交互世界模型需要同时满足持久记忆、响应式交互和长时程生成,但这三个要求互相冲突:在去噪器上下文或键值缓存中维护历史会带来随会话变长的成本,迫使模型在会话长度与记忆保留之间取舍;低延迟交互依赖少步生成,而少步生成的能力又受限于其教师模型。Evoke 旨在同时解决这两个限制。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

本文为求解非光滑复合目标分布 \(\pi(dx)\propto \exp\{-f(x)-g(x)\}dx\) 的 MYULA 算法建立了更精细的复杂度界:用“参考主动迹” \(B_{\mathrm{ref}}\) 代替全局曲率上界 \(d/\lambda\) 来控制离散化误差;在分片线性、Lasso、分组和全变差惩罚下,精度依赖可由 \(\widetild…

研究问题:对如下非光滑复合目标,MYULA 达到给定 \(W_2\) 精度需要多少次迭代?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

巴西圣卡塔琳娜联邦大学(UFSC)的人工智能学术联盟(LIA)提出并实践了一套以学生为中心、基于项目的组织框架,将大学的教学、研究与拓展三大支柱整合起来;该框架具有灵活性,可被学术联盟及类似学生组织复制借鉴。

该论文针对“如何在工程与计算教育中系统整合教学、研究与社会拓展”这一问题,介绍了由学生主导的 LIA 所采用的组织框架。LIA 是 UFSC 的一个学术联盟,其经验被整理为一种可复制的模型,用于在课外教育环境中同时培养技术能力与横向能力。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

AaLLM 是一个开源、端到端的多智能体大语言模型工作流,输入用户规格后可直接输出包含拓扑生成与电路尺寸确定(sizing)的网表;在若干电路上,生成的新颖拓扑品质因数(FoM)可与已知拓扑相当,某些电路最高可达 3 倍提升,同时 SPICE 调用次数比现有 SOTA 多智能体流程减少 3–4.5 倍,墙钟时间减少 40 倍。

模拟电路设计是一个耗时、迭代的过程,设计空间非线性且高维,严重依赖专家直觉。现有基于大语言模型的方案大多是碎片化的,只单独处理尺寸确定或拓扑生成;这些方法需要手动添加领域技术知识,效率低且容易在电路尺寸确定过程中产生幻觉。此外,现有方法难以生成创新拓扑,只能依赖传统拓扑,可能导致次优设计。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

该论文提出“因果世界模型”(Causal World Model, CWM)的形式化定义,主张有用的世界模型不能只具备生成能力,还必须捕获实体属性、实体与实体之间以及实体与环境之间的因果交互,并探讨了这些组件能否从数据中恢复、能恢复到什么等价程度(即可识别性)。

世界模型(World Models)正被视为智能体在训练分布之外进行预测、规划和行动的基础。然而,现有世界模型研究往往强调生成能力,对“模型是否真正理解环境动态背后的因果结构”关注不足。本文从因果视角,在不同抽象层次上考察世界模型:从感知观测,到形成关于环境动态结构的表征,并提出一个统一视角来连接这些层次。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-12

阿里巴巴开放了其最大开放权重模型 Qwen3.8-2.4T-A95B(Qwen3.8-Max)的权重;NVIDIA 与开源生态合作,使该模型在 GB300 NVL72 上无需额外调优即可于 Day 0 以 FP8 精度实现每 GPU 每秒超过 4K tokens、每用户每秒超过 350 tokens 的推理吞吐。

Qwen3.8-2.4T-A95B 是阿里巴巴发布的最大开放权重模型,面向推理和智能体(agentic)工作负载设计。其总参数为 2.4T,每 token 激活 95B 参数;采用细粒度混合专家(MoE)架构,并混合使用全注意力与线性注意力。模型支持最高 100 万 token 的上下文窗口和最高 128K 的输出长度。

产业观察 · 原始来源:NVIDIA 博客 · ai-industry
事件日期 2026-08-12

RingCentral 正在借助 OpenAI 的 ChatGPT Work 与 Codex,加速 AI 产品开发,并将工程与运营两侧的智能数据集中起来;具体实现细节因缺乏正文而**待核实**。

OpenAI 官网发布了一篇题为 *How RingCentral builds AI-native work from engineering to ops* 的文章,介绍 RingCentral 的实践。 根据页面元数据,文章主题是“RingCentral 如何使用 ChatGPT Work 和 Codex 来加速 AI 产品开发,并在工程与运营之间集…

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-12

Anthropic响应欧盟《人工智能法案》第50条透明度义务,宣布8月2日后发布的Claude模型在生成文本中嵌入不可感知水印,并为文件附上C2PA标准的签名溯源元数据;水印在模型层生效,复制粘贴仍会跟随,但检出/未检出都不能简单等同于“AI撰写/非AI撰写”。

材料未单独列出研究问题,事件概述如下:为满足欧盟《人工智能法案》第50条透明度义务,Anthropic宣布8月2日后发布的模型上线即在生成文本中嵌入不可感知水印;对于文件类产物,则附带符合C2PA标准的签名溯源元数据。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-12

模型能生成Token不等于能作为生产可用API稳定交付;请求排队、缓存命中、故障切换等推理工程环节决定模型的速度、稳定性与账单。

Baseten的Philip Kiely指出,模型“能吐出Token”与“做成生产可用API”是两回事。推理系统负责请求排队、缓存命中、故障切换等环节,直接决定模型的速度、稳定性与成本。面对20万Token长上下文,系统会先做缓存感知路由,并将Prefill与Decode分派给不同GPU;开发者应保持系统提示稳定以提高缓存命中。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
每页 20 条