AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 621-640 条,共 2259 条
第 32 / 113 页
事件日期 2026-08-19

DistScan 提出一种新的目标检测后门检测思路:即使输入中没有触发器,后门注入也会系统性地改变模型在 NMS 前的预测类别分布,使其偏离训练类别频率;因此只需在干净验证集上统计中间类别预测,即可判断模型是否被植入后门,无需访问模型权重、无需知道触发器、也无需额外训练。

在安全关键场景中部署的目标检测模型容易受到后门攻击:当隐藏触发器出现时,模型会发生针对性的异常行为。已有检测方法要么依赖触发器反演,要么依赖特定架构假设;更重要的是,代表性已有方法在面对“场景级攻击”时难以可靠泛化。场景级攻击指单个触发器同时诱发场景中所有目标的异常行为。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

DA-WAM 提出将预测表示学习、动作条件未来建模与轨迹评分统一到一个驾驶决策目标下,让预测的未来直接参与轨迹选择,并在 NAVSIM-v1 和 NAVSIM-v2 上取得当前最优性能(具体指标数值待核实)。

自动驾驶系统需要根据自车动作预测场景演化,但现有世界模型在决策中的潜力尚未充分发挥。关键挑战是:未来建模不能只追求“预测准确”,还必须做到“对决策有信息量”——即预测出的未来应直接影响轨迹选择。论文指出,现有方法要么把未来表示学习与规划优化解耦,要么让不同轨迹候选共享同一组预测状态,从而稀释了动作带来的后果差异,削弱了未来表示对轨迹取舍的指导作用。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

该研究针对Hawkes过程驱动的非马尔可夫随机控制问题,提出先用混合指数核将多变量Hawkes过程有限维马尔可夫化,再在近似模型上使用一种连续时间确定性策略梯度算法(Hawkes-CT DDPG)求解,并证明了马尔可夫化过程、强度及问题值对原非马尔可夫模型的收敛性。

Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

本文提出一种基于嵌入(embedding)的大规模动态主题建模方法,用于在 12.7 亿条 Reddit 评论中检测与量化“主题漂移”(topic drift);初步结果显示,政治与社会争议话题在嵌入空间中呈现显著方向性漂移,而音乐、体育等领域相对稳定。

研究问题是:如何在评论级(comment-level)的短文本大规模语料中,定量检测和描述主题随着时间发生的语义漂移与话语演变。作者将动态主题建模技术应用到 Reddit 语料库(2006–2022,12.7 亿条评论),在嵌入空间而非词频或主题分布空间中分析语义变化。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

ChildSafeAds 2026 是一个面向“可能触达儿童和青少年”的YouTube视频中商业内容检测的共享任务,提供来自939个频道的3,360个视频数据,并设置三个子任务和四级证据访问设置,用于评估系统在广告/商业内容识别、产品分类和法律风险识别上的表现。

儿童和青少年是YouTube的重要受众,视频中嵌入的赞助内容与商业推广若不充分披露,可能带来合规与儿童保护问题。本共享任务旨在推动对这类视频中商业内容的自动识别与分析。每个实例以SponsorBlock(一个开源的众包浏览器扩展)用户标注的赞助片段为起点,配对可用的转录文本、视频与频道信息,以及视频描述中链接的销售或服务页面,构建为可评估的数据集。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

NEAR 框架通过将高重复次数的神经响应中心作为锚点,同时从“带噪查询”和“候选图像表征”两侧向该锚点对齐,显著提升了仅有一或几次重复时的脑-图像检索准确率,减少了对大量重复采集的依赖。

脑-图像检索(brain-to-image retrieval)旨在从脑信号中解码视觉信息,可用于神经康复、梦境解码等。现有方法通常需要对同一图像刺激重复采集多达 80 次神经试次并求平均,以抑制噪声、提高信号稳定性;这带来高延迟、高成本和高用户负担。当重复次数很少(如 1 次或 4 次)时,检索准确率会急剧下降。以往研究多将这种下降归因于查询端的噪声,但…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

语言模型智能体可以通过连续隐藏状态进行公共转录中不可见的隐蔽通信;论文提出的“可验证潜在对齐(VLA)”框架能够在不使用攻击样本训练主监控器的情况下,以较高准确率监控此类私有通道,并在具备白盒反事实访问时有效缓解合谋行为。

语言模型智能体不仅通过文本对话协作,还可能通过模型内部的连续隐藏状态(latent states)互相传递信息。这些状态不会出现在公开转录文本中,因此可能被用于隐蔽的恶意协调,例如在拍卖中合谋压低出价。现有安全机制通常只检查公开文本,无法发现这类私密通信。论文引入 Verifiable Latent Alignments (VLA),一个激活感知(acti…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

GC-OPD 在 rollout 组内分别归一化验证器奖励和轨迹级 OPD 分数,用二者之差作为带符号的“教师-验证器分歧残差”,再按相对优势分配到 token,从而在不丢弃逐 token 稠密教师指导的情况下引入验证器的整体任务反馈;在 5 个长上下文基准上,Qwen3-4B 的五基准均值从 29.08 提升到 40.47,Qwen3-8B 从 35.1…

同策略蒸馏(OPD)让学生在自己的采样上训练,并由更强教师逐 token 提供稠密指导。 在长上下文任务中,逐 token 教师支持可能偏爱“局部合理”的回答,忽略分布在不同位置的证据,或违反全局任务约束。 任务级验证器从整体回答判断任务完成度,能给出反映部分成功的分级奖励。 作者在两类代表性长上下文证据聚合任务上诊断这一错位:随着输入范围变长,轨迹级 O…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

ADEPT 提出一种大规模强化学习框架:先在通用物体重放置任务上预训练灵巧策略,再通过稳定的后训练配方适配下游任务,使多指机器人能从原始视觉-触觉感知直接学习长时程操作技能,并零样本从仿真迁移到真实机器人。

高自由度多指机器人的灵巧操作往往难以从零开始强化学习,且每个新任务都要重复学习相似技能。本文研究的是:如何通过预训练与后训练,让灵巧操作策略具备跨任务的迁移能力,并最终在真实机器人上部署。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-19

法国量子计算初创公司 Pasqal 的研究者开发了一款自主AI智能体,能用英语提示生成量子计算代码并自动在量子计算机上运行;它并非完全免人工,但显著降低了量子编程门槛。

Nature 新闻(2026年8月19日)报道,Pasqal 公司的研究者把“vibe coding”带入了量子计算。该工具接受英文自然语言描述,将之转化为量子计算代码,并自主在量子计算机上执行。相关预印本已于2026年7月发布在 arXiv 上。

学术前沿 · 原始来源:nature.com · agent
事件日期 2026-08-18

美国时间8月16日,Stripe以超70亿美元收购AI模型路由平台OpenRouter,核心不是获得大模型,而是把支付与金融基础设施延伸至AI推理调用环节,抢占多模型环境下的“交易层”。

收购方:Stripe。 被收购方:OpenRouter,AI模型路由平台。 交易金额:超70亿美元,较OpenRouter在5月完成的13亿美元B轮融资估值增长逾5倍;此前双方曾讨论约100亿美元收购价。 交易时间:美国时间8月16日;具体年份、交易完成状态待核实。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation
事件日期 2026-08-18

Artificial Analysis 发布 Search Index,用同一个候选模型和同一个开源智能体 harness 横向对比多家搜索 API 提供商,量化搜索工具在质量、成本、速度上对智能体的增益。

2026 年 8 月 18 日,Artificial Analysis 发布文章“Announcing the Artificial Analysis Search Index: Same Agent, Different Search”,推出一个新基准:在完全相同的智能体设置下,仅替换搜索 API 提供商,对比其搜索质量、成本和速度。研究问题是:当智能体…

产业观察 · 原始来源:artificialanalysis.ai · benchmark-evaluation, agent
事件日期 2026-08-18

OpenAI 宣布启动一项旨在加强国家安全领域 AI 应用的民主监督的倡议,通过提供工具、培训和专业知识支持政府机构(待核实)。

根据公开元数据,OpenAI 于近期发布了一项计划,名称为 “Strengthening democratic oversight in national security”。该计划的核心方向是帮助政府机构在国家安全相关场景中更好地对 AI 进行民主监督,具体支持形式包括工具、培训和专家资源(待核实)。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-18

Git 的分布式设计在托管场景下成为主要挑战;以 GitHub 为代表的规模化托管最终放弃分布式文件系统或分布式 Git 对象存储,转向基于 packfile 级复制、本地 NVMe 存储和强一致同步的 Spokes 架构,该架构已成为行业标准。

本文来自 Cursor 研究博客,作者 Vicent Martí,发表于 2026-08-18。核心问题是:为什么托管 Git 仓库如此困难,以及如何规模化托管 Git 仓库。文章回顾了 Git 的 packfile 存储与传输机制,分析多种扩展方案,并重点介绍了 GitHub 的 Spokes 系统。

产业观察 · 原始来源:Cursor 博客 · ai-industry
事件日期 2026-08-18

OpenAI与CodeAI宣布合作,目标是帮助学生建立AI素养、批判性思考AI,并培养负责任地使用和塑造AI的技能。(待核实具体细节)

OpenAI官网发布文章《Partnering with CodeAI to prepare the first AI generation》,宣布与CodeAI建立合作。从摘要看,双方将围绕学生AI素养展开工作,涉及对AI的批判性思维以及负责任地使用、塑造AI的能力。由于正文未抓取,合作启动时间、具体形式(课程、平台、研究等)、覆盖区域和参与方式均待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-18

根据来源材料显示,OpenAI正在通过加强监控、对齐与安全保障来调控前沿AI模型的开发节奏,以应对“网络关键能力”(cyber-critical capabilities)时代带来的新风险。但具体内容与细节均待核实。

OpenAI发布了一则题为“Pacing model development in an era of cyber-critical capabilities”的页面/内容,讨论在AI模型可能具有网络空间关键能力的新背景下,应如何把握模型开发与部署的速度。由于未能抓取正文,该内容的具体研究问题、发布背景与结构均待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-18

宇树科技发布人形机器人“超人”,腿长0.85米,原地跳高约2米、极限奔跑速度12.66米/秒;材料称两项数据均超越人类极限,但其中人类跳高纪录的对比口径存在明显疑点,需待核实。

据腾讯研究院AI速递(20260818)援引发布信息,宇树科技正式发布全新人形机器人“超人”。王兴兴介绍,该产品从立项到推出仅用3个多月,目前仍处快速迭代阶段。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-18

在 DeepSWE 软件工程基准的 904 次 rollout 中,GPT-5.6 Sol 单次正确率领先(pass@1 72.7% vs 62.8%),但成本是 DeepSeek V4 Pro 0813 的 35 倍;若先跑 DeepSeek V4 Pro 0813、失败后再升级到 Sol 的级联策略,能以每任务 3.35 美元解决 83.0% 的任务,…

Together AI 于 2026 年 8 月 18 日发表了一篇对比测试,研究在 DeepSWE(一个覆盖多种任务类型和编程语言的软件工程能力基准)上,成本极低的 DeepSeek V4 Pro 0813 与旗舰级 GPT-5.6 Sol 各自的准确率、成本、失败模式,以及两者组合路由的效果。测试在全部 113 个 DeepSWE 任务上各跑 4 次,…

产业观察 · 原始来源:Together AI 博客 · ai-industry
事件日期 2026-08-18

卡住AI落地的不是模型能力,而是企业仍用旧流程、权限与管理方式接住它;当智能变便宜,验收机制和组织AI能力的“主动性”比模型本身更关键。

腾讯研究院AI速递(20260818)引述经济学家Cowen的观点:模型已经足够强,落地真正卡在“验收机制”。多数公司只是给旧流程加一个聊天窗口,模型省下十分钟,整体流程仍是三天。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
每页 20 条