AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1001-1020 条,共 2259 条
第 51 / 113 页
事件日期 2026-08-06

根据 arXiv 摘要,EmoWorld 在冻结的流匹配视频扩散 Transformer(Video DiT)中,将视频生成里的全局氛围、情绪语义线索和时间演化解耦,并通过 VAS/SAS/TAS 三种机制实现可控情感视频生成。在 Wan2.2 上,VAS 使目标情绪对齐提升 19%、时间波动代理指标下降 48%;SAS 使目标情绪对齐提升 37%、检测到…

摘要指出,情绪会影响观众如何理解一个场景,但现有视频生成模型往往把“全局氛围”“带情绪含义的语义线索”和“时间进展”纠缠在同一个文本条件中,难以独立控制。EmoWorld 提出在冻结的 Video DiT 内解耦这些因素:准备阶段提取层相关的情感方向和可复用线索库;推理阶段通过视觉氛围、语义情感和时间情感三条路径分别控制生成。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

在FLAIR影像上先做超分辨率再分割白质高信号(WMH)时,主要风险是**抹除小的真实病灶**而非幻构出不存在的病灶;这种抹除随模拟层厚增加而加重,但所有重建方法仍比原始厚层扫描更有利于病灶检出;其中ECLARE表现最好,多对比隐式神经表示(INR)并不优于三次插值。

临床上FLAIR常以厚层采集,面内分辨率尚可但穿层分辨率差。超分辨率(SR)常用于把各向异性扫描重建为各向同性体积。但SR是否在WMH分割前保留病灶内容未知:模型可能抹除小的真实病灶,也可能幻构出本来没有的病灶。本研究系统评估这一问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

本文提出深度引导的检测器 DG-Det 和通用后处理流程,通过融合深度线索、多尺度 RGB-D 交叉注意力、显式遮挡预测与跨帧去重,在拥挤和遮挡场景的视频目标计数任务上,相比现有基线将 MAE 降低 62.01%,RMSE 也一致改善;同时发布了一个带深度信息和多类别标注的 RGB-D 视频目标计数数据集。

研究问题:在拥挤场景中进行视频目标计数,即根据给定文本或视觉提示,稳健地统计某一目标类别的所有实例。 现有方法主要依赖 RGB 信息,在拥挤和遮挡条件下区分能力不足。 本文思路:引入深度信息以增强空间理解,并设计统一去重框架解决跨帧重复计数问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

DASH 提出在标准同策略自蒸馏(OPSD)的逐 token 监督中引入“散度自适应传播门”,根据局部散度相对序列均值的偏差动态调整反向多步聚合,从而在不增加任何 teacher/student 前向计算的情况下,在 3 个数学推理基准、3 个模型规模上一致优于 vanilla OPSD。

带可验证奖励的强化学习(RLVR)能提升大模型推理能力,但奖励信号通常是序列级的、稀疏的。OPSD 通过查询特权教师模型,在 student 访问过的前缀上提供稠密的 token 级分布监督,缓解了信号稀疏问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

根据论文摘要,本文指出可解释人工智能(XAI)在“解释方法的评估”方面存在不足,并通过DetoxAI图像识别系统、人类基础评估示例,以及应对概念漂移的反事实解释适配等案例加以说明,最后强调需要追踪数据、模型和解释的共同演化。由于未获取正文,具体结论细节待核实。

研究问题:如何评估解释方法?现有评估是否充分?在涉及概念漂移的演化数据场景下,解释方法如何调整和验证? 论文以DetoxAI图像识别系统为案例,展示XAI评估不足的问题,该系统用于偏见检测和概念遗忘(具体机制待核实)。 随后给出一个“人类基础评估”(human-grounded evaluation)的实例,用于评估解释图像分类的方法(评估任务和指标待核实…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

CalibForge 提出用“求解器相对的可学习区”来合成终端任务:通过对抗性求解器校准,让候选任务既可执行可验证,又对训练中的智能体具有适当挑战性,最终构建 5,431 个校准终端任务,并在 Terminal-Bench 2.0 等基准上显著提升模型性能。

训练终端智能体需要可执行且可验证的任务,但“可求解”不等于“适合学习”。现有的可执行性验证只保证任务可行,无法揭示任务在给定求解器设置下对学习过程是否具有适当难度。CalibForge 针对这一问题,提出利用求解器的已验证行为来反向修订候选任务,从而自动合成“可学习”的终端任务。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

本文提出并检验了用概念激活向量(CAVs)分析两类基于Transformer的L2口语自动评分系统内部是否存在对第一语言(L1)、年龄等无关属性的偏差;发现概念的可恢复性与敏感性依赖模型表示和架构,稀疏自编码器(SAEs)虽提高了概念的线性可恢复性,但会削弱原始激活空间中的敏感性。

自动口语评估系统越来越多地用于高风险场景,例如给第二语言(L2)学习者的口语测试打分。关键诉求是:分数应取决于口语水平,而不是母语(L1)、年龄等与能力无关的属性。基于Transformer的基础模型提高了这类评分器的准确率,但其黑盒表征使公平性和可解释性分析更困难。本文研究的问题是:如何检测并区分神经网络口语评分模型内部是否编码了不想要的“概念”,以及这…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

在表格密集的长文档(如财务报告、审计报告、监管申报)中,基于“文本分块 → 嵌入 → Top-K 近邻”的 RAG 设计会结构性丢失单位与表头上下文;本文提出的 READ 用三种确定性操作替代黑盒检索,在 51 个已验证问题上达到 58.8% 准确率,显著高于稠密检索的 15.7%(Holm 校正后 p=2×10⁻⁵);但 BM25 与 READ 在统计上…

长文档检索增强生成(RAG)的主流设计是:切分文本、对块做嵌入、返回查询的 Top-K 近邻。 本文认为,对财务报表、审计报告、监管申报等文档,这一设计在结构上不可靠。 在一份 780 页的政府财务报告中,86.8% 的内容行是表格行;大量近乎相同的数字同时出现在同一个嵌入空间中。 数字的单位通常来自其上方中位数 13 行处的表头;分块边界常常把数字与其单…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

任务型对话智能体(task-oriented conversational agents)的评估结果是否可信,取决于 benchmark 本身是否可靠;本文提出一个无需参考标准(reference-free)的框架,用 LLM 作为裁判,从“一致性、复杂度、策略覆盖度”三个维度评估 benchmark 质量,并提供可操作的弱点诊断。

现状:任务型对话智能体通常使用人工整理或自动生成的 benchmark 来评估,但 benchmark 本身的质量很少被评估。 问题:低质量 benchmark 可能包含不一致的任务、过于简单的场景、有限的策略覆盖,从而导致对智能体的评估不可靠。 目标:提出一种系统评估 benchmark 质量的方法,而不是只评测智能体本身。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

GB/T-Bench 是首个面向国家标准文件结构化审查的基准,实验显示最强 LLM 与专家仍有显著差距;提出的多智能体框架 GB/T-Reviewer 可将最佳审查得分从 0.3280 提升至 0.5094。

国家标准文件(如中国 GB/T 标准)篇幅长、结构高度规范,且受范围、术语、规范性表述和章节一致性等显式规则约束,是评测 LLM 处理规则密集型文档审查的代表性场景。 现有基准多关注领域知识与问答,忽略了对专业文档的内在质量审查;这类审查高度依赖人类专家,成本高且难以规模化。 为了弥补这一空白,作者构建了 GB/T-Bench,并提出了增强审查能力的 GB…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

AV-AIVAT 将方差缩减工具 AIVAT 与随时有效置信序列(CSs)结合,使两个智能体的强弱比较可以在“证据已经足够”的那一刻合法停止;在 95% 名义水平、目标精度 ±1 大盲注、使用渐近置信序列(AsympCS)时,原始收益所需的中位对局数是 AIVAT 校正后收益的 74 倍。

比较两个智能体谁更强,通常要靠多局博弈让技能差异压过运气噪声。每局博弈都有金钱、模型推理或专家时间成本,而且所需局数事先未知。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

研究问题:在 agnostic PAC 设定中,二分类假设类 \(H\subseteq\{-1,+1\}^X\) 的 VC 维为 \(d\ge1\),目标是从 \(n\) 个 i.i.d. 样本中输出 \(\widehat h\),使其风险 \(L(\widehat h)\) 尽量接近 \(H\) 内最优风险 \(L^*=\min_{h\in H}L(h)…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-06

本文提出一个六维分类法,用机制、目标、数据需求、持久性、结构范围和模型类型六大维度统一描述与比较训练后适应(post-training adaptation)技术,为AI治理中的模型变更追踪提供共同词汇表。

训练后适应已成为现代机器学习实践的核心,包含重训练、微调、参数高效适应、对齐、检索增强、模型编辑、遗忘、校准和多模态指令微调等。然而,相关文献在技术族、模型类别和部署场景之间高度碎片化,导致不同方法难以比较,训练后模型究竟被如何修改也缺少统一描述。该综述旨在整合这些文献,提出一个系统的分类框架。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-05

据量子位 2026-08-05 报道,清华系团队 Sand.ai 推出了视频生成模型 MAGI-2-preview,并公开代码与权重。该模型采用 MoE 架构,总参数 114B,单次前向激活约 6B,被文章称为“全球首个千亿 MoE 视频生成模型”。

产业观察 · 原始来源:量子位 · generative-model
事件日期 2026-08-05

根据宇树科技官网新闻页的标题元数据,其创始人王兴兴(Wang Xingxing)登上《时代》杂志封面,新闻标注日期为2026-08-05;具体报道内容、封面期号及采访细节待核实。

该条新闻来自宇树科技官网新闻栏目,英文标题为“Unitree founder Wang Xingxing graces the cover of Time magazine 2026-08-05 Media Coverage”,表明这属于媒体封面报道。由于官网正文未能抓取,除标题所示信息外,其余事件背景与报道内容均待核实。

产业观察 · 原始来源:unitree.com · ai-industry
事件日期 2026-08-05

SK海力士与闪迪联合推出下一代高带宽闪存(HBF)的首个标准规范,由OCP作为行业通用标准发布;同时公布了第十代375层4D NAND等新一代闪存技术进展。

腾讯研究院AI速递(20260805)报道,SK海力士联手闪迪发布了高带宽闪存HBF的首个标准规范。该规范由开放组织OCP作为行业通用标准发布,谷歌、Tenstorrent已加入联盟。FMS 2026上首次公开了第十代375层4D NAND,并提出面向代理式AI的分层内存架构方案。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-05

Cursor 开源了名为 **Mixture-of-Kittens(MoK)** 的确定性 MoE 训练 megakernel,将 MoE 层的通信与计算融合到单个内核中;在 GB300 NVL72 上,其 MXFP8 前向吞吐量最高可达最快公开基线的 **2.37 倍**,并在生产训练环境中将端到端 tokens/s 提升了 **1.41 倍**。

Cursor 在训练其智能体编程模型 Composer 时发现,混合专家(MoE)层始终是主要瓶颈:根据负载和训练配置,MoE 层可消耗超过一半的端到端训练时间。过去他们曾编写 MXFP8、NVFP4 训练内核和“warp decode”推理方法,但这些技术只优化了计算部分,通信开销仍独立存在。转向 GB300 NVL72 后,硬件特点(单 NVLink…

产业观察 · 原始来源:Cursor 博客 · ai-industry
事件日期 2026-08-05

Palantir CEO Karp 认为,大语言模型是概率性的,不能直接用于造车、发火箭等高精度任务;企业买 Token 烧钱难以产出价值,关键在于将模型、应用层与算力结合,并让客户自持权重、数据与算力。

在腾讯研究院 AI 速递(20260805)中,报道了 Palantir CEO Karp 关于“FDE”(具体含义待核实)和“买 Token 创造不了价值”的观点。Karp 批评当前企业单纯购买大模型 Token 的做法,认为这种方式既无法保证高精度任务,又存在数据机密被厂商拿走的风险。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-05

OpenAI针对苹果的起诉发表官方声明并公开邮件与聊天记录,否认“有组织地窃取硬件机密”,称苹果所谓的诉前沟通源于一封发错的邮件和“一通不存在的电话”;但公开记录也显示,两名前员工离职后确曾回答产品计划相关问题,且iCloud权限一度保留。

2026年7月,苹果起诉OpenAI及两名前员工,指控其有组织地窃取硬件机密,并申请禁令叫停OpenAI硬件项目(具体起诉日期、法院、案号待核实)。 OpenAI发布官方声明反击,公开邮件与聊天记录,表示苹果声称的诉前沟通实际上是由一封发错的邮件和“一通不存在的电话”引起的。 OpenAI称,前员工离职后接触机密系在职苹果员工主动交接所致;但记录同时显示,…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
每页 20 条