AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 841-860 条,共 2259 条
第 43 / 113 页
事件日期 2026-08-11

MISA-T 是一种面向混合强化学习(RL)回滚服务的路由层准入策略,通过自适应会话准入、工作负载感知的 KV 缓存容量分配和驻留时间感知的 KV 记账,在保持前缀缓存命中率和工作负载混合比例的前提下,显著提升 rollout 吞吐并缩短迭代时间。

现代大语言模型(LLM)的强化学习后训练流水线越来越需要组合来自多个领域和反馈范式的 rollout 工作负载。前缀感知路由可以通过缓存复用和负载均衡提升推理效率,但无法控制异构 rollout 会话如何竞争 KV 缓存容量。当 RLVR、RLHF 和 agentic rollouts 共享异步推理服务时,它们不同的序列结构、交互模式和 KV 驻留时间会产…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

MMCS 提出一种新的多模态预训练范式,通过把文本实体替换为对应视觉对象来提供显式对象级监督,仅用 5 万样本即可匹配或超过基于 60 万图像-文本对训练的模型。

现有多模态大语言模型(MLLMs)的模态对齐预训练主要使用图像-文本对,将全局图像表征映射到长文本描述。这种图像级对齐存在指称歧义:模型难以从全局表征推断多个视觉对象与文本实体之间的对应关系,导致数据效率低、语义接地(semantic grounding)不佳。论文提出 MMCS 以解决该问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

AI 研究系统可以在长程数学研究中帮助人类专家把格罗滕迪克常数 \(K_G\) 的最佳已知界限收紧为 \[ \frac{6\pi}{11} \le K_G \le \frac{\pi}{2\log(1+\sqrt2)} - 10^{-4}, \] 并产出被领域专家认为新颖的数学洞见。

AI Agent 在数学研究中的使用越来越多,但“如何有效使用它们”仍然不清楚。 本文以格罗滕迪克常数 \(K_G\) 为对象,给出一个长程人机数学协作案例研究。 \(K_G\) 的精确值尚属未知;它刻画组合问题与其连续松弛之间的难度差距。 作者报告使用 AI 研究系统改进了 \(K_G\) 的最佳已知界限,并详细讨论了使用 AI 进行数学研究的长处与短板…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

本文构造了一个交互式 PCP 协议,使多项式时间验证者只需在少数点上查询电路、并读取一个证明预言机的少量位置,即可验证由概率电路和置信电路隐式表示的指数多个概率主张的近似一致性。

概率预测器在回答大量条件概率查询时,其答案是否自洽?这种自洽性能否在多项式时间内验证?该问题与 AI 安全相关:如果安全依赖于模型对“某项行动可能引发不希望结果”的概率预测是否诚实,那么就需要形式化地验证这些概率主张的一致性。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

本文提出一种分层经验贝叶斯朴素贝叶斯(HEB-NB)平滑方法,通过数据自适应地学习 Dirichlet 先验浓度,取代固定强度的平滑规则(如 Laplace、Lidstone、Krichevsky-Trofimov、m-估计),在理论上给出 minimax 最优性保证,并在 31 个基准数据集上提升概率预测质量与校准性能。

朴素贝叶斯(NB)是分类数据的标准分类器,但常用的平滑规则使用固定平滑强度,忽略了特征基数、样本量和类别不平衡,导致在现代高基数表格数据上产生非消失偏差。论文旨在解决这一问题,提出自适应平滑的 HEB-NB,并将其扩展至 AODE(平均单依赖估计器)。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

TrustNLP 研讨会六届共 144 篇论文显示,可信自然语言处理领域的研究重心已从“静态模型的事后解释”转向“生成式系统的机制理解与主动控制”;其中 truthfulness(真实性/诚实性)是增长最快的维度,fairness(公平性)是最持续的主题,explainability(可解释性)则呈 U 形变化。

TrustNLP 是自 2021 年起与 ACL 系列主要会议联合举办的可信 NLP 研讨会,六届会议录论文从 8 篇增至 41 篇。该工作综合了全部 144 篇 proceedings 论文,沿六个信任维度进行分类,分类框架基于 TrustLLM、DecodingTrust 等已有框架。摘要把六年的总体变化概括为“从可解释性到控制”:早期更关注静态模型的…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

在受控合成基准 CriticalSCM-Bench v1 上,学习排序模型 LambdaMART 仅在部分供应链场景中显著优于简单基准;而在数字基础设施场景中,领域知识驱动的常量缓冲策略依然更强,说明供应链干预排序不应默认追求模型复杂度。

检测或归因供应链扰动,并不等于选择能最大化“可恢复净值”的干预措施。本文提出“决策感知的因果干预排序”问题,并发布 CriticalSCM-Bench v1 基准,用于在因果真值已知的条件下评估不同干预策略的净值表现。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

条件独立性(CI)检验是约束基因果发现的“统计引擎”:在 PC、FCI 等算法中,骨架剪枝和关键方向判定直接依赖 CI 检验结果;本综述将常用 CI 检验方法分为六大家族,并系统考察其假设、稳健性与可扩展性。

本文是一篇关于约束基因果发现中条件独立性检验的综述,重点面向生物医学领域常见的高维和混合数据类型。研究问题包括:不同 CI 检验族在什么情况下能反映数据生成分布、何时失效;测试层面的性质(如功效随条件集大小衰减、Ⅰ/Ⅱ 类错误的不对称后果)如何传导为图层面的骨架恢复与 v-结构定向错误。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

本研究对稀疏自编码器(SAE)的活跃潜在特征集合进行“集合级重叠”分析,发现SAE特征在理想化设置之外并不以简单“特征袋子”(bag-of-features)的语义进行组合,且其集合相似性主要追踪模型内部结构,而非人类概念边界或典型性判断。

既有工作(Shani et al., 2026)发现:大语言模型(LLM)的密集表示大致能恢复人类概念类别边界,但无法反映细粒度的典型性结构;该工作使用的是基于密集模型表示的余弦相似度。 本文重新审视该问题,改用“活跃SAE潜在变量集合的重叠度”作为更可解释的相似性度量,并检验它能否更好地拟合人类概念判断。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

AdvFD 提出在 Fréchet 距离损失中加入“可学习的对抗表征”,并用真实特征白化来稳定对抗训练,从而缓解生成器后训练中的“Fréchet hacking”问题,在 JiT 和 pMF 两种骨干上一致改善单步生成器后训练效果。

Fréchet 距离近期被用作生成器后训练的分布级目标,补充传统的样本级扩散损失和流匹配损失。 直接优化 Fréchet 目标可能导致“Fréchet hacking”:目标指标持续改善,但视觉质量或其他特征空间中的 Fréchet 对齐停滞甚至恶化。 作者认为该问题源于现有 Fréchet 损失使用静态预训练特征空间,这些特征空间只能提供“固定且不完整”…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

材料为 arXiv:2608.11173v1,作者 Eric A. F. Reinhardt 和 Adam J. Hauser,arXiv 显示发布时间为 2026-08-11,分类为 quant-ph、cs.LG。 该论文针对 Transformer 等现代 AI 模型中的注意力机制,讨论其中一类输入输出被约束为概率单纯形(输出分量和为 1)的问题。 研…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-11

ExtractBench 是一个覆盖 370 份真实企业文档、4,869 页、8 个业务领域、67 种文档类型的开源文档提取基准;在该基准上,LlamaIndex 新推出的 LlamaExtract Agentic Plus 以 95.6% 的总体 value F1 和 8.1 美分/页的成本位列第一。

研究问题:企业智能体正越来越多地基于非结构化文档中的关键业务数据运行,当人类不再逐条校对时,文档提取系统需要在生产级场景下被可靠评估。 现存基准的不足:第一代基准(如 SROIE、DocILE、RealKIE)只评测固定字段恢复,无法评估系统面对未见过的 schema 的能力;新一代 schema-guided 基准虽支持推理时新 schema,但覆盖面窄…

学术前沿 · 原始来源:LlamaIndex 博客 · benchmark-evaluation
事件日期 2026-08-10

阿里推出 CosyVoice Studio 全栈语音平台,背靠 Qwen-Audio 语音大模型,Realtime 版在 Artificial Analysis 榜单综合指数 84.1%,并分设 CosyFlow、CosyCreative、CosyAgent 三大方向,依托千问、钉钉、高德、淘天等真实业务场景打磨,标志着国内 AI 语音竞争从单点工具走向平…

据腾讯研究院AI速递 20260810 报道,阿里推出 CosyVoice Studio,定位为“全栈语音平台”。该平台以 Qwen-Audio 语音大模型为底层能力,提供 Realtime 版本,并在 Artificial Analysis 榜单上获得综合指数 84.1%。平台分设 CosyFlow、CosyCreative、CosyAgent 三大方向…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation, agent
事件日期 2026-08-10

OpenAI CFO Sarah Friar 分享了打造“AI原生财务职能”的五条经验,涵盖自动化预测、强化管控与AI投资回报衡量;因原始页面未能抓取正文,具体细节待核实。

OpenAI 发布文章《Building an AI-native finance function》,作者为 CFO Sarah Friar。 文章主题围绕如何在财务部门中系统性落地 AI,而非零散使用工具。 Candidate summary 提示其内容包括:自动化预测(automated forecasting)、更强管控(stronger cont…

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-10

OpenAI 将 GPT-5.6 Luna 设为免费用户默认模型,Free 与 Go 用户普通文本聊天取消次数限制;付费用户则使用聊天优化版 GPT-5.6 Sol。这显示 OpenAI 正以“免费高频文本对话”扩大规模,同时以图片、文件上传等高算力功能作为付费分层边界。

研究问题/产品更新:OpenAI 如何调整 GPT-5.6 的免费与付费产品形态? 事件概述:据腾讯研究院AI速递 20260810 转述,OpenAI 宣布 GPT-5.6 Luna 成为免费用户默认模型,Free 与 Go 用户普通文本聊天不再限次,Think 深度思考功能也向免费用户开放。 付费用户方面:OpenAI 为其提供聊天优化版 GPT-5.…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-10

据腾讯研究院AI速递(20260810)转引信息,OpenAI首款硬件是一款由苹果前设计官Jony Ive旗下LoveFrom参与设计的“甜甜圈音箱”,定位为以AI为核心、能感知环境并主动提供帮助的计算设备,计划2026年亮相、2027年开卖;OpenAI硬件部门还在研发约5款产品,但正面临苹果商业秘密诉讼,若初步禁令获批可能影响上市进度。

OpenAI首款硬件产品曝光。产品形态为音箱,先切入家庭市场。苹果前设计官Jony Ive旗下LoveFrom参与设计。产品定位不是普通音箱,而是以AI为核心的计算设备,能够感知环境并主动提供帮助。计划2026年亮相、2027年开卖。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
每页 20 条