OpenAI 对 GPT-5.6 进行价格调整:入门款 Luna 输入/输出价格降 80%,主力款 Terra 降 20%,旗舰款 Sol 维持原价;Sol 新增 Fast mode,速度最高达标准模式 2.5 倍、价格翻倍,并称通过重写 GPU Kernel 使服务成本降 20%,形成降本飞轮。
根据腾讯研究院AI速递 20260803 的汇总:
OpenAI 对 GPT-5.6 进行价格调整:入门款 Luna 输入/输出价格降 80%,主力款 Terra 降 20%,旗舰款 Sol 维持原价;Sol 新增 Fast mode,速度最高达标准模式 2.5 倍、价格翻倍,并称通过重写 GPU Kernel 使服务成本降 20%,形成降本飞轮。
根据腾讯研究院AI速递 20260803 的汇总:
谷歌DeepMind发布Gemini Robotics 2,其VLA(视觉-语言-动作)模型可实现人形机器人从脚到指尖的全身移动与操作;同步推出负责高级推理规划的ER 2与端侧部署的On-Device 2,后者仅需200个示例即可适配新本体;模型可迁移至Apollo、Franka等多种硬件,并支持多机器人协作完成长序列任务。
据腾讯研究院AI速递(20260803)摘要,谷歌DeepMind发布Gemini Robotics 2,聚焦于让VLA模型驱动人形机器人进行全身控制。发布同时包含ER 2与On-Device 2两个版本。材料未提供更详细的研究问题背景,更多技术细节待核实。
根据元数据摘要,Circles 利用 OpenAI API 与 Codex 构建 AI 原生的电信个性化体验,实现了每用户平均收入(ARPU)提升 22%、客户流失率下降 9%,并提升了开发效率。
OpenAI 官网的案例页面介绍了 Circles 如何借助 OpenAI 技术为电信行业提供个性化服务。由于未抓取到正文,该案例的具体背景、实施时间、合作电信运营商、技术架构等信息均待核实。
根据页面元数据,OpenAI 针对苹果(Apple)的诉讼发布公开回应,称该诉讼“没有根据”,并纠正关于其员工的表述,同时分享相关消息记录以说明经过。具体案情、证据细节与最终事实有待原文核实。
页面标题为 *Apple is getting this wrong*,由 OpenAI 官方域名发布。 候选摘要显示:OpenAI 回应苹果“没有根据”的诉讼,纠正关于其员工的表述,并分享消息记录来还原发生了什么。 由于正文未能抓取,事件起因、苹果的具体指控、诉讼地点与时间线均待核实。
奥特曼改口说,人们并不真想要一个“AI CEO”,因为AI能决策但无法被追责;他同时承认高估了AI消灭初级岗位的速度。黄仁勋则说,“AI毁掉工作”的叙事搞反了:AI接管任务不等于消灭工作。材料称,应届生岗位占比不降反升,但标准化入门任务被AI接管,年轻人成长入口正在收窄。
本条来自《腾讯研究院AI速递 20260803》,被归入“报告观点”,并非原创研究报告。它讨论的问题是:AI是在“消灭工作”,还是在“接管任务并重塑职业成长路径”?奥特曼和黄仁勋的表态,构成了对AI失业末日论的反驳。
腾讯基于开源Hy3模型的科研智能体Hyra,为加法组合学中悬置半个多世纪的和差集问题给出完整答案,并公开了论文预印本、显式构造及Lean 4形式化证明。
研究问题:加法组合学中的“和差集问题”,该问题已悬置半个多世纪。 事件概述:腾讯科研智能体Hyra运行约24小时,提出核心构造,证明相关上确界确为2。
DeepSeek-V4-Flash正式版API已上线公测,采用MoE架构,支持百万token上下文,Agent能力显著增强,在Terminal Bench 2.1等多项基准上超过4月发布的Pro预览版;输入命中缓存价格仅0.2元/百万token。
根据腾讯研究院AI速递(2026年8月3日)报道,DeepSeek-V4-Flash正式版API上线公测。该模型以Agent能力为核心卖点,多项基准表现超过此前发布的Pro预览版,并计划在8月初推出Pro正式版。
WorldExam 是一个分层诊断基准,用于评估可控视频生成模型作为世界模型时的表现,重点考察模型能否从场景状态推断世界应当如何反应,并生成输入中没有显式描述的合理后果;评测发现,高视觉质量和显式指令遵循并不保证模型具备“内在反应性”,目前没有模型能同时覆盖广泛任务并持续表现强。
可控视频生成模型正越来越多地被当作世界模型来开发。研究者指出,评估这些模型不能只看生成视频的表观外观,还要看其所描绘世界的“内在反应性”(inherent reactivity),即从场景状态推断世界应如何反应、并生成输入中未显式描述的合理后果的能力。然而,现有基准主要评估视觉质量或显式指令完成度,通常只检查请求的动作和交互结果是否实现,对内在反应性的考察…
对于没有指定人口属性值的开放式生成(如“美国的CEO”),公平性评估不能预先假定一个目标分布;目标分布必须经过显式论证,且目标构建本身就是公平性评估的一部分,而非前置步骤。
论文提出生成式模型公平性评估中的“缺失目标问题”(missing-target problem):当提示中未指定敏感属性(如性别、种族)时,模型会自行决定生成结果的人口统计构成。现有群体公平定义通常假设敏感属性在输入侧给定,而生成式审计虽然检查输出侧的人口构成,但其比较目标往往来自人为设定,缺少正当性论证。研究问题因此是:在开放生成中,公平性比较的“目标分…
本文提出 VR3D 框架,利用从单张2D图像提取的3D先验,将外观特征提升到统一3D空间进行视角无关的交互,并通过可靠性感知融合聚合多源表示,在 CARGO、AG-ReID.v1 和 AG-ReID.v2 上优于现有方法(CARGO 上 Rank-1 提升 5.63%)。
空中-地面行人重识别(Aerial-Ground Person Re-Identification)面临跨平台视角差异带来的严重遮挡和几何形变问题。现有方法仅在 2D 图像空间内学习视角不变表示,导致所学特征仍与视角偏差耦合。针对该问题,作者提出 VR3D(View-Robust 3D Representation Learning)框架,将图像映射到统一…
该论文提出 VI-MoLE,将混合 LoRA 专家的路由问题建模为“认证价值信息分配”(certified value-of-information allocation),主张用边际风险降低而非单纯的不确定性来决定是否激活更多专家;具体实验结论与数值结果待核实。
混合低秩适配(MoE-LoRA)通过将每个输入路由到部分适配器,以较低参数开销提升模型容量。 近期动态路由方法在路由器或预测不确定时激活更多专家。作者认为这一规则把“不确定性”与“有用的额外计算”不恰当地等同起来:一个不确定样本既可能包含尚未被查询的互补专家证据,也可能在所有专家都给出相似判断后仍然模糊。 论文因此提出以“价值信息”(value of in…
UEmbed 是一种仅解码器(decoder-only)多模态嵌入模型,通过向输入追加 N 个可学习特殊 token,并在一次因果前向传播中同时生成稀疏词项权重与稠密向量,从而在一个模型内统一稀疏检索与稠密检索,并扩展到多模态输入;UEmbed-9B 在 MMEB-v2 上达到 71.8(dense)和 71.0(sparse)。
稀疏检索是现代搜索系统的基础,从网页搜索到检索增强生成(RAG)都依赖它。已有的 Learned Sparse Retrieval(LSR)方法试图超越精确词法匹配、获得更丰富的语义,但 LSR 仍主要受限于编码器式双向架构,并且在多模态场景中的扩展还依赖大量辅助跨模态模块。UEmbed 的目标是解决这两个局限:让稀疏检索不再绑定编码器架构,同时让文本与多…
在随机化精确体积小集合扩张假设(randomized exact-volume Small-Set Expansion Hypothesis)下,Axiotis 和 Sviridenko [AS21] 关于“稀疏凸优化中限制条件数的线性依赖无法被多项式时间算法改进”的猜想,对最小二乘目标成立:对任意固定 γ∈(0,1],不存在随机多项式时间算法能以至少 2…
The Condition-Number Barrier in Sparse Least Squares
PRECOG 将检索增强生成(RAG)的 prefill 成本从与上下文长度成正比降为每次查询 O(1),通过在状态空间模型(SSM)中将文档语料库预编码为隐藏状态并在查询时直接注入,在边缘硬件上实现约 4500× 的 prefill 延迟降低,同时保持与上下文 RAG 相当的答案质量。
传统 RAG 在检索到的上下文长度上产生线性 prefill 成本;若使用 Transformer 骨干,KV 缓存还会随生成 token 数增长。SSM 天然避免了第二种成本,但第一种仍然存在。本文提出 PRECOG(Pre-Computed Context Injection),利用 SSM 的固定大小、位置无关的循环隐藏状态作为模型所读取内容的完整摘…
本文提出用光滑、逐元素严格凸的重参数化替换单纯形乘积空间,将原本的约束优化转化为流形上的无约束优化,并证明该做法可使流形上的二阶 KKT 点映射到原问题的弱二阶 KKT 点,从而得到更优的黎曼梯度下降(RGD)算法。
Smooth Reparameterizations of Functions on Simplicial Product Spaces: Applications to Probabilistic Tensor Decomposition and Functional Data Registration
学习型记忆系统在自进化 LLM 智能体中面临两个紧密耦合的挑战:
Arabizi(阿拉伯语拉丁字母转写)在不同阿拉伯语方言使用者的认知与书写实践中呈现出系统性的方言内规律和方言间差异,这挑战了多数NLP研究将其视为“因阿拉伯文字技术支持不足而产生的临时现象”的主流假设。
本研究聚焦阿拉伯语说话者对Arabizi的实际看法和使用模式,并比较阿尔及利亚、埃及、黎巴嫩、摩洛哥、突尼斯五种方言的书写规范。作者认为,既有NLP研究多把Arabizi当作临时替代品,忽略了它作为真实语言实践的社会与方言维度;因此需要从使用者视角重新审视Arabizi。
ReMiX-MAE 提出一种自监督多模态掩码预训练框架,在训练时使用同步的 RGB、热成像和深度面部视频,并显式训练对模态缺失的鲁棒性,从而在推理阶段仅用 RGB 视频也能取得比单纯 RGB 掩码自编码器更稳定的疼痛评估表现;它还配套收集了一个带视频级自报标签和纵向治疗轨迹的“交感介导疼痛”(SMP)数据集。
临床中自动疼痛评估困难:标注稀缺且是弱标签(常为序列级自我报告);疼痛线索在 RGB 视频中可能细微或接近中性;热成像和深度信号有信息量,但常规临床部署不切实际。 研究目标:让模型从多模态视频中学习可迁移的面部表征,并能在实际部署时只依赖 RGB 信号。
生成式机器学习虽已在晶体发现中取得进展,但难以充分探索既新颖又有用的材料候选空间;一种基于强化学习的方法可将候选生成引导至这些区域,从而支持新型功能材料的设计。
该文是发表于 *Nature Machine Intelligence* 的 News & Views,作者为 Zhendong Cao 和 Lei Wang(中国科学院物理研究所)。文章评论了 Park & Walsh(2026)发表于同一期刊的研究(DOI: 10.1038/s42256-026-01262-4)。研究问题在于:现有生成式机器学习方法在…
扩散模型依赖的“随机噪声”在有限精度硬件上实际由伪随机规则产生的确定性数值轨道实现;这些可被模型学习的轨道结构不仅是分布选择,还会作为一种与模型相关的结构化输入影响训练和生成质量。
扩散模型被普遍视为以随机张量为输入的生成模型,但真实硬件上的随机性来自伪随机数生成器的确定性数值轨道。该研究提出的核心问题是:这些伪随机轨道是否会被扩散模型“学会”,从而影响生成质量?