AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 321-340 条,共 2259 条
第 17 / 113 页
事件日期 2026-08-27

本文提出 D2C-Routing,将混合来源 AI 生成文本检测从二元文档级判断重构为“内容来源 + 表达来源”的维度到组合溯源,在 MixD2C 基准上达到 0.8603 的四类平均 TPR@1%FPR,比同设置下的 RACE-local 重跑高 6.5 个百分点。

D2C-Routing: Dimension-to-Composition Evidence Routing for Mixed-Origin AI-Generated Text Detection

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

CritICL 将弱模型产生的失败模式转化为批评式上下文示例,让强模型在推理时借鉴这些失败经验,从而以较低生成成本和较少采样次数获得与测试时扩展方法相当或更优的推理性能。

近期推理时扩展(inference-time scaling)方法显著提升了大语言模型的推理能力,但通常依赖重复生成或外部验证,计算开销较高。本文提出 CritICL,一种不依赖外部验证、只需少量生成的推理时框架,利用同一模型家族中“弱模型失败模式具有结构化规律”这一观察,将失败模式作为指导强模型推理的信号。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

CorporateBench 是一个人工验证的大规模多任务问答基准,用超过 23 万份文档模拟企业通信网络,评测大语言模型在信息抽取与知识库查询上的能力;实验显示,当输入规模接近真实企业场景时,五个被测模型的表现明显下降。

企业通常不愿共享内部通信数据,而现有合成数据集过于简单,导致大语言模型在企业级文档集合上的问答能力难以被有效评估。为此,研究者构建了 CorporateBench,以接近企业真实规模的评测条件弥补这一空缺。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

用“可验证奖励的强化学习”(RLVR)训练出多个领域专家模型后,合并任务向量(Merge)、混合数据训练(Mix RL)、多教师同策略蒸馏(MOPD)三种整合范式的平均表现差距很小(≤1.4个百分点),但在单一基准上最大差距可达8.6个百分点。选型时应考虑:是否已有专家模型、端到端成本是否重要、以及是否需要尽可能保留领域特异增益。

RLVR能显著提升大语言模型的特定能力,但要覆盖多个能力,常见做法是先训练多个领域专家模型,再把它们整合起来。此前 Merge、Mix RL、MOPD 三种范式基本是被分开研究的,缺乏系统比较,导致“该选哪种融合方式”并不清楚。本文在共享专家和数据、多个模型规模、多领域基准套件的条件下,对三种范式进行了统一比较。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

在摄影测量、NeRF-based、Gaussian splatting 和 LiDAR 四种三维重建方法的比较中,NeRF-based 方法生成的全息模型整体保真度最稳定,尤其擅长处理透明、反光和低纹理的实验室物品;形状和颜色的还原效果普遍优于纹理。

研究问题:当前的三维重建方法是否足以支持创建用于教育场景的、真实感强的实验室物体全息表示?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

CLAP 提出一种可同时在人类与机器人视频上训练的动作条件视频生成框架,通过末端执行器位姿、语言指令和潜在动作统一异构动作空间,并采用“先学通用物理先验、再注入具体动作空间”的课程式两阶段训练,使模型在 DROID 等挑战性环境中接近或超过单具身 SOTA 模型,并能在真实任务上零样本部署。

现有 SOTA 动作条件视频模型通常只针对单一机器人形态训练,难以利用海量、异构的互联网视频数据中蕴含的通用物理规律。 跨具身学习的主要障碍是动作表示在不同机器人平台间差异很大,且人类视频通常没有动作标注。 CLAP 的出发点是“无论执行者是谁,时空动态都受通用物理定律支配”,因此尝试把人类和机器人视频统一用于学习具身物理模拟器。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

该工作提出并实例化了一条从工业只读遥测日志到可执行多轮智能体任务的确定性、可重放构建流水线,发布 BTS-AgentBench 基准,并用两个独立构建精确复现了发布数据划分,表明该流水线在智能体基准构造与可复现性方面具有可验证的增量价值。

工业现场包含大量只读遥测数据,但很少有基准明确说明如何将这些记录编译为可执行的多轮智能体任务。作者提出一种“遥测到 episode”(telemetry-to-episode)的构建方法,并实现为 BTS-AgentBench,试图弥合原始遥测日志与智能体评测基准之间的构造鸿沟。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

在基于可验证奖励的强化学习(RLVR)中,用更小、更弱的语言模型生成部分推理轨迹作为外部前缀,强制目标模型基于这些前缀续写答案,可以有效缓解策略熵崩塌,提升大 `k` 下的 `pass@k`,且无需额外 SFT、复杂奖励设计或复杂提示。

RLVR 能显著提升 LLM 的推理能力,但训练中常出现策略熵下降,导致推理覆盖变窄、大 `k` 下 `pass@k` 退化。现有方法主要依靠算法正则化缓解熵崩塌,但忽略了“跨模型非参数扰动”这一方向。本文提出一种简单方法:在 RLVR 训练中引入外部弱模型生成的部分推理轨迹,作为目标模型的“陌生前缀”,从而促使模型探索更多样的推理路径。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

分块草拟器(Block Drafters)在一次前向传播中同时提出多个 token,但这种“并行盲区”造成的拒绝与模型自身对可观测信息建模不佳造成的拒绝一直被混在一起;本文提出用“信息地板”和“模型差距”将二者拆开,并发现:哪怕只实现一个真实 token,就能消除 86%–100% 的信息地板,而当前草拟器的大部分最终槽位拒绝仍来自模型差距。

分块草拟器会在更早的目标 token 尚未被真实生成/确认前,一次性提出多个 token。这种并行草拟方式存在“看不到块内路径信息”的问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

现有以F1为主的指标只评估扫描器“给出可用安全判断”时的准确性,却掩盖了扫描器“无法给出判断”的覆盖盲区。基于170个合成工件(145个标本家族)的评估显示,ModelAudit对135个有标签家族全部给出明确安全判断(100%),Fickling为81.5%,ModelScan仅49.6%;但在能给出明确判断时,ModelScan的精度、召回率和F1均达…

研究问题:如何更全面地评估AI模型安全扫描器(如ModelScan、ModelAudit、Fickling)对机器学习工件中可执行或不安全内容的检测能力?传统指标(如F1)只度量“给出可用安全判断”的情况,忽略了扫描器因不支持、分析中断等原因而无法做出判断的样本,导致评估偏差。为此,论文提出区分“非N/A覆盖率”“分析完成度”“明确安全决策”“非安全发现”…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-27

本文证明,在表格型分布强化学习中,同步分位数时序差分学习(QTD)在步长 \(\alpha_t=c(t+1)^{-a}\)、\(a\in(1/2,1)\) 下具有全局有限样本保证;最后迭代的随机波动主阶为 \(\widetilde O(T^{-a/2}/\sqrt{1-\gamma})\),且不随分位数数量出现多项式增长。

研究问题:同步 QTD 在表格型分布强化学习中的估计误差如何随样本量 \(T\) 衰减?能否从任意初始化出发获得全局有限样本保证? 论文性质:arXiv 预印本,作者为 Zijie Cheng、Xiang Li、Yang Peng、Zhihua Zhang。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-26

据量子位报道,中国具身智能创业公司“超维动力”在2026年世界机器人大会(WRC)现场演示了人形机器人打乒乓球,并展示了从本体、灵巧手、数采设备、世界模型到训练Infra的全栈布局;文章判断,具身智能竞争正从“单点Demo”转向“本体—模型—数据—真实场景”的闭环效率。

2026年8月26日,量子位报道,超维动力在全尺寸人形机器人KAI Bot上演示乒乓球系统SMASH,现场吸引大量观众。 同步展示的还有高自由度灵巧手KAI Hand、数采头环KAI Halo、KAI World Model,以及覆盖数据和训练流程的KAI Embodied AI Infra。 核心问题:为什么具身智能需要同时做硬件本体、具身大模型、高质量…

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-08-26

Agnes 最新发布 Agnes Video 2.5 系列,其中 Flash 版本在 Pavo 平台上完全免费(消耗0积分),可用于大量生成和前期试错;Agnes Video 2.5 每天赠送200积分,支持最高2K视频和多参考输入,官方定位面向短剧、广告等真实商业内容场景。

2026-08-26,量子位报道,明星AI实验室 Agnes 发布 Agnes Video 2.5 系列,并上线 Pavo 创作平台。作者实测使用 Flash 免费复刻抖音《云上天宫》和制作精致版《牛来》,并在剧情短片模式下生成短剧、广告片、宣传片和特定风格MV。

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-08-26

OpenAI 就 Hugging Face 安全事件公布了调查发现,并概述了为加强 AI 模型安全、监控与对齐而采取的后续步骤;由于原始正文未能抓取,具体事件细节和措施内容待核实。

涉及对象:Hugging Face 安全事件;OpenAI 参与调查并分享发现。 研究问题:如何从该事件中吸取教训,强化 AI 模型的安全、监控与对齐。 具体事件经过、影响范围、时间线等:待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-26

Physical Intelligence 联合创始人 Levine 判断,机器人仍处于 GPT-2 之前的阶段,行业尚未找到可持续放大的“Transformer 式”路径,也难预测数据翻倍能带来多少能力提升。

在腾讯研究院 AI 速递(20260826)收录的对话观点中,Physical Intelligence 联创 Levine 对机器人行业的技术阶段、数据价值、泛化来源和可靠性门槛作出判断,核心结论是机器人尚未进入可预测规模化阶段。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-26

雷鸟创新CEO李宏伟认为,智能眼镜的终局仍是“AI+AR”;在AI进展快于AR的当前阶段,眼镜的首个杀手级应用应是AI助理。新品“iO”以“人类增强”为定位,主动放弃摄像头、大芯片与Android,聚焦全天佩戴与AI,先以“全天智记”增强记忆。

这则材料来自“腾讯研究院AI速递 20260826”中的“对话”栏目,记录了雷鸟创新CEO李宏伟关于智能眼镜产品方向与技术路线的观点。核心讨论问题是:智能眼镜的终局形态是什么?当前应该优先做AI还是AR?产品设计如何在性能、佩戴体验与隐私之间取舍?

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-26

LingBot-Vision 是一个以边界为中心的自监督视觉基础模型,利用掩码边界建模(Masked Boundary Modeling)让边界表征从数据中自发涌现,并在无预训练骨干、无人工标注、无外部边缘检测器的条件下,在深度估计、语义分割、视频目标分割等稠密感知任务上取得领先结果;同时作为 LingBot-Depth 2.0 的编码器初始化,显著提升深…

现代视觉基础模型往往优先保持语义不变性(semantic invariance),却牺牲了细节空间理解。LingBot-Vision 从“边界/形状不连续”入手研究视觉预训练,认为边界和形状不连续为感知几何属性提供关键线索。其核心是掩码边界建模:模型在预训练中在线学习亚像素(sub-pixel)边界表征,并把发现的边界承载 token 作为掩码目标,驱动稠…

产业观察 · 原始来源:technology.robbyant.com · ai-industry
事件日期 2026-08-26

LingBot-Map 是一个流式 3D 重建模型,通过名为“几何上下文注意力”(Geometric Context Attention, GCA)的结构化流式状态,在 10,000+ 帧的长序列上以约 20 FPS 实时构建高保真 3D 场景地图,且单帧内存与计算开销近乎恒定。

流式 3D 重建的核心问题是“记忆”——保留什么、以什么形式保留。LingBot-Map 提出 GCA 作为可端到端学习的紧凑流式状态,解决在持续输入视频帧时如何高效维持全局几何一致性的问题。该模型同时支持相机位姿估计和深度图预测,并在多个 Benchmark 上展示了流式位姿估计效果。

产业观察 · 原始来源:technology.robbyant.com · ai-industry
事件日期 2026-08-26

LingBot-Depth 用“深度传感器自身产生的空洞”作为掩码信号,通过掩码深度建模(Masked Depth Modeling, MDM)学习用 RGB 视觉上下文补全缺失深度,把消费级深度相机在玻璃、镜面、金属等反光透明物体上失效的问题,转化为可训练的感知任务,并在深度补全、单目深度估计、立体匹配和机器人抓取上取得领先结果。

消费级深度相机在无纹理区域、透明玻璃、镜面和金属表面经常无法输出有效深度,因为立体匹配算法在左右视图“看起来一样”或发生畸变时会失效,产生“空洞”。LingBot-Depth 的核心研究问题是:如何把这些传感器失效区域从“噪声”变成“学习信号”,让模型根据 RGB 图像理解视觉上下文,预测缺失区域的度量级深度。

产业观察 · 原始来源:technology.robbyant.com · ai-industry
事件日期 2026-08-26

据 a16z 合伙人 Casado 爆料,一款被称为“今年最重要发布”的新模型即将到来,多方线索指向 Ilya Sutskever 旗下 SSI 的首款模型,传闻核心是持续学习突破,但尚未获得官方证实。

a16z 合伙人 Casado 预告已获得一款新模型的访问权限,称其为今年最重要的模型发布。 多方线索指向 Ilya Sutskever 旗下 SSI(Safe Superintelligence)的首款模型,或于 8 月亮相。 SSI 成立两年几乎零公开成果,却以“无收入、无产品”状态完成 20 亿美元融资,估值达 320 亿美元,坚持“能力与安全同路”…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
每页 20 条