AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 741-760 条,共 2259 条
第 38 / 113 页
事件日期 2026-08-13

OpenRouter联合创始人兼CEO Alex Atallah认为,美国在开源大模型上已远落后中国,DeepSeek、GLM、Kimi等模型靠高性价比占据主导;企业应警惕依赖单一前沿模型巨头,并用动态眼光评估员工使用AI的成本与产出。

腾讯研究院AI速递(20260813)摘要了OpenRouter联合创始人兼CEO Alex Atallah的一组观点,涉及开源模型竞争、SaaS软件价值重估、以及AI时代企业员工成本核算方式的变化。此外,材料还提到Stripe拟以100亿美元收购OpenRouter的传闻(待核实)。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation
事件日期 2026-08-13

根据现有元数据,OpenAI 正在预览一项名为 **Ultrafast** 的 API 服务层级,用于运行 **GPT-5.6 Sol**,最高可提速 **14 倍**,并由 **Cerebras** 提供算力支持,输出速度最高可达 **750 tokens/秒**。由于未能抓取正文,具体细节待核实。

OpenAI 官方页面发布了 **Previewing Ultrafast mode**,主题是 GPT-5.6 Sol 的极速推理服务。当前仅能依据元数据和候选摘要生成草稿,页面正文未抓取,因此发布范围、开放时间和具体机制均待核实。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-13

据腾讯研究院AI速递(2026-08-13)报道,OpenAI宣布Linux版ChatGPT桌面应用进入预览阶段,将ChatGPT、ChatGPT Work与Codex三件套带到Linux开发环境;但兼容范围有限,仅支持部分主流发行版,且Linux上的桌面控制力弱于macOS。

这是OpenAI对社区自2024年以来要求Linux桌面应用呼声的回应。预览版允许用户在熟悉的Linux开发环境中直接使用ChatGPT、ChatGPT Work与Codex处理项目与浏览器工作流。现阶段Linux上的Computer Use仍以浏览器自动化为主,桌面控制力弱于macOS。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-08-13

OpenAI任命Dali Rajic为首席营收官(Chief Revenue Officer),领导其全球营收组织,帮助各类企业充分实现AI价值。由于原始网页未能抓取正文,本卡片仅基于已知元数据整理,细节待核实。

根据来源元数据,OpenAI宣布任命Dali Rajic担任首席营收官。其职责是领导OpenAI的全球营收体系,并帮助企业客户从AI中获取更大价值。具体任命时间、前任情况、汇报关系及职责范围等细节暂无法从材料中确认。

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-08-13

Ramp 的 Agent 平台 Inspect 已实现无人值守工作流:CI、监控与定时任务可自动触发 Agent 收集日志、定位代码、跑测试并回传审核,自动化触发的会话数量已超过人工发起;其落地经验强调最小权限、默认只读、高风险操作留人工确认。

腾讯研究院AI速递 20260813 报道了 Ramp 对其 Agent 平台 Inspect 无人值守工作流的拆解。核心问题是:如何让 Agent 在无人值守情况下可靠完成复杂任务,以及企业接入 Agent 自动化需要具备哪些基础条件。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-13

OpenAI 为 ChatGPT 桌面端和 Codex CLI 提供了一条统一导入路径,可一键复制 Claude Code、Cursor 的配置、技能、插件、项目以及30天聊天记录;但迁移只进不出,细粒度权限、复杂 Hooks 链、Anthropic 模型本身和云端聊天记录无法带走。

该条目出自“腾讯研究院AI速递 20260813”,不是独立原始公告;具体官方文档链接和发布细节待核实。 OpenAI 统一了“外部智能体导入文档”,接收端是 ChatGPT 桌面端与 Codex CLI,来源端包括 Claude Code、Cursor。 导入范围覆盖配置、技能、插件、项目和30天聊天记录;导入方式是搬运副本,且没有反向导出能力。 材料称…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-13

荣耀开售号称“全球首款机器人手机”的 Robot Phone,9999元起,预订量已超40万台,8月18日首销。其核心卖点是4自由度机械臂云台与总参数超300B的智能体基座大模型,支持100步以上复杂任务、单轮成功率90.4%。

据“腾讯研究院AI速递 20260813”第6条信息,荣耀开售全球首款机器人手机 Robot Phone,起售价9999元,预订量已超40万台,8月18日首销。该机配备4自由度机械臂云台,支持拍摄自动追焦;智能体基座大模型总参数超300B,支持100步以上复杂任务,单轮成功率90.4%;首发 YOYO 机器人模式与技能商店,并开源机器人方案。硬件方面,首发…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-08-13

Vero 是首个在“仓库级”评估 AI 智能体联合生成代码实现与机器可检查形式化证明的基准。最强配置的智能体仅完整解决 43 个实例中的 27 个,在最难仓库上未闭合任何规范(closes no specifications);这说明当前智能体距离仓库级可验证软件综合仍有明显差距。

AI 智能体越来越多地被用于编程,但其生成的代码没有正确性保证。论文提出“验证式代码生成”路线:智能体同时输出实现和满足规范、可由机器检查的证明。现有基准要么只针对单个函数,要么在给定实现的前提下只评估证明生成;尚不清楚智能体能否在真实的多模块代码库中做出连贯的实现与证明选择。Vero 旨在填补这一空白。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

V-RAE 提出在冻结的视觉基础模型表示之上构建视频生成用潜空间,证明重建最优的潜空间不一定适合生成,而基于语义表示的潜空间能以更快收敛、更高质量同时支持视频重建、生成与预测。

当前隐空间视频生成依赖自编码器定义生成模型所操作的紧凑潜空间。现有视频自编码器的潜空间主要面向像素级重建进行优化,缺乏高层语义组织;但重建最优的潜空间未必适合生成建模。V-RAE 重新思考“什么样的视频潜空间更适合生成”,并引入一种视频表示自编码器(V-RAE)来构建紧凑的生成潜变量。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

UniTexture 提出用单个带纹理的 3D 物体作为跨任务通用对抗扰动源,只优化一个共享表面纹理,就能在多个操纵任务中使 VLA 模型产生攻击者指定的动作偏移;在 OpenVLA 和 π0.5 上,平均任务成功率从良性条件的 90.0% 降至攻击下的 48.4%,并可跨套件、跨模型迁移。

视觉-语言-行动(VLA)模型是通用机器人策略,可遵循语言指令完成多种操纵任务。由于它们直接控制具身智能体,对抗干扰可能引发不安全物理行为。已有攻击通常针对单一任务或指令优化,多任务 VLA 的跨任务漏洞尚少被探索。UniTexture 的研究问题是:能否用单一纹理化 3D 物体,在多个任务中同时诱导 VLA 动作预测产生定向偏差?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

TraVEL 通过将自车轨迹相似性作为强化学习奖励来微调多模态视频嵌入模型,使驾驶视频检索在不增加推理阶段负担的情况下,显著提升对左转/右转、加速/减速等运动中心事件的区分能力。

从大规模驾驶日志中高效检索相关片段,对数据策展、模型开发和安全分析至关重要。传统规则化检索系统可以显式定位驾驶事件,但依赖专家规则、辅助数据和多阶段感知流程;通用多模态嵌入模型虽然简单高效,但往往利用静态场景线索作为捷径,难以区分“左转 vs. 右转”“加速 vs. 减速”这类以运动为核心的驾驶事件。本文研究如何将通用多模态嵌入模型适配到驾驶视频检索任务。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

大语言模型在遭遇知识边界之外的实体时,通常仍会生成听起来很具体的细节,而不是退回到更安全、更一般的表述;研究发现,模型中其实已经存在用于“格莱斯式退避”的神经信号,但生成策略没有把这些信号利用起来。

论文提出一个观察:当被问及超出自身知识范围的实体时,LLM会倾向于编造看似合理的细节,而不是像“合作式说话者”那样,在不确定指称时沿着特异性层级向上退避,用较低信息量换取较高真实性。作者将这种失败置于格莱斯语用学框架中,并追问:LLM是否具备执行这种“退避”的构成要素?

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

掩码扩散(masking diffusion)的 KL 离散化误差可由“去掩码增长复杂度”(unmasking growth complexity, UGC)的局部增量控制;据此可构造“认证最优”(certified-optimal)采样器——以高概率达到指定 KL 误差,且迭代复杂度与对应 oracle 过程只差常数因子,并可在高维示例中用常数个自适应调…

本文是 arXiv 上的理论性学术论文,研究 masking diffusion 在离散采样中的调度(schedule)设计。核心问题是:如何在去掩码/揭示过程中安排计算块,使 KL 离散化误差尽可能小。作者提出用数据几何量 UGC 来刻画这一问题,并给出可估计、可认证最优的调度构造方式。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

在预训练的第一个token就植入期望助手人格(Synthetic Persona Pretraining, SPP),比仅在预训练结束后再引入对齐能更有效地提升宪法遵循、越狱鲁棒性,并减少道德困境中的错位,同时保持模型能力;早期干预的优势随预训练预算增加而增强。

当前语言模型通常在预训练完成之后才引入对齐和“助手身份”,此时行为先验已经固化,导致价值观像一层“薄薄的外壳”,而不是根深蒂固,容易产生后续错位。该论文提出一种新范式:在预训练阶段、从第一个token起就安装期望的助手人格,从而让对齐从一开始就融入模型。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

SbCD(Symmetry-breaking Crystal Diffusion)提出用马尔可夫跳跃扩散过程显式建模晶体生成中空间群之间的转移,从最低对称性先验出发逐步生成完整晶体结构;在 MP20 和 MPTS-52 上的 de novo 生成实验中,性能明显优于其“保持对称性”的对照版本。

晶体生成在材料科学中受到广泛关注,但现有生成模型难以输出完整的晶体学规格,导致对全局对称性和结构依赖关系的建模能力受限。 目前最先进的方法通常只生成到“位点对称性”层面,并在生成时从经验分布中采样空间群;这种做法没有把空间群转变本身整合进生成过程。 本文借鉴物理中的自发对称性破缺思想,提出一种新的扩散生成框架,旨在从最低对称性先验反向生成完整结构规格。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

SNM-VFI 提出一种无需训练的生成式视频帧插值框架,利用预训练光流模型产生对应感知的中间帧和置信图,作为潜在先验引导预训练视频扩散模型,从而兼顾运动对应保持与感知真实感,并在 DAVIS、Sintel、KITTI 等基准上展示了较强的感知质量、重建精度和时间一致性。

传统扩散式视频帧插值方法通常从随机噪声合成中间帧,难以显式控制运动对应。SNM-VFI 研究如何在不重新训练扩散模型的前提下,把光流估计得到的中间帧和置信图注入到视频扩散过程中,实现运动可控的插值,并改善遮挡、物体边界等不确定区域的生成质量。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

SCULPT 提出一种“减法组合”的部件感知 3D 生成框架,在结构化 3D 潜空间中迭代地“切出”一个部件并同步更新剩余物体,使得部件边界与整体几何在生成过程中原生对齐,避免了先分割或先加法拼装带来的接缝、穿透和材质不连续问题。

部件感知 3D 生成旨在生成既完整连贯、又暴露结构化部件(便于编辑、指定材质、动画和复用)的数字资产。现有方法往往在生成循环之外强加部件结构:

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-08-13

SAEVerbalizer 通过将稀疏自编码器(SAE)的解码器方向注入大语言模型(LLM)的表示,并微调 LLM 下游层,使模型直接为 SAE 特征生成自然语言解释,从而绕开依赖外部行为观察的传统解释路径。

稀疏自编码器被用来从 LLM 表示中提取大量特征,但解释这些特征目前仍主要依赖外部观察——即通过观察模型行为来推断特征含义。这种方式既容易得到浅层解释,又需要大量行为数据采集,计算效率低。SAEVerbalizer 提出直接利用 SAE 解码器方向来生成自然语言解释,以同时缓解这两方面问题。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条