AI消息速览

知识卡片

按事件日期排列,包含已接受、待审核和稍后处理的卡片。待审核内容仅供参考。

显示第 1721-1740 条,共 2269 条
第 87 / 114 页
事件日期 2026-07-16

阿里推出的Qwen-Audio-3.0-Realtime实时语音交互模型支持音色克隆与情感感知生成,可动态调整语气节奏,在Artificial Analysis语音推理子项综合排名第一,超越GPT-Realtime-2。

2026年7月16日,阿里升级其语音交互模型为Qwen-Audio-3.0-Realtime。该模型在实时语音交互中具备情感感知能力,能根据上下文动态调整语气和节奏,告别机械朗读感;内置多模态双工控制模型,支持声纹级背景过滤,可在嘈杂多人环境中精准锁定主对话者,打断检测与响应时延领先;同时支持动态工具调用完成路线规划、信息查询等任务。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · benchmark-evaluation
事件日期 2026-07-16

清华团队 Xmax AI 推出实时交互视频模型 X2.0,画质提升至 960p/24fps、延迟达到毫秒级,并开放 API 供商用,成本仅为竞品 Decart 的十二分之一,目标是将视频从单向观看变为可实时操控的交互界面。

2026 年 7 月 16 日(腾讯研究院 AI 速递报道),Xmax AI 发布其实时交互视频模型 X2.0,面向企业客户开放商业 API。该模型采用端到端流式重渲染架构,支持实时操控视频画面,并已实现 iPhone 端侧推理。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-16

OpenAI主张青少年应平等获得安全的AI工具,并正在为ChatGPT添加适龄保护、学习工具、家长控制及专家合作机制。

OpenAI在其官网发布文章《Why teens deserve access to safe AI》,阐述其面向青少年用户的安全策略。文章指出,AI可以帮助青少年学习、创造和探索,但需要设计专门的防护措施。OpenAI正在为ChatGPT加入适龄内容保护、教育导向功能、家长监管工具,并与儿童发展专家合作以完善方案。(*待核实:具体发布日期和文章细节*)

产业观察 · 原始来源:OpenAI · ai-industry
事件日期 2026-07-16

原力灵机发布具身世界模型DW0.5,将其作为VLA后训练的“虚拟环境”,通过三大专家模块实现强化学习的低成本闭环,使真机数据需求降低60%、训练成本降低40%。

2026年7月,原力灵机发布首款具身世界模型DW0.5,并将其接入世界模型驱动的具身智能后训练框架DFOL 2.0。该模型用上万小时真机、多视角数据完成联合预训练,能高保真模拟成功与失败轨迹,支撑VLA模型的在线强化学习训练,解决具身智能后训练中缺乏低成本反馈闭环的行业难题。

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-07-16

腾讯Robotics X联合混元发布并开源了具身世界认知基座模型RxBrain,能够在单一模型内统一文本、图像与视频的理解和生成,搭配模态路由的MoT架构,在真机操作任务平均成功率达87%,超越π0与π0.5。

2026年7月16日,腾讯Robotics X与混元团队联合推出并开源了名为RxBrain的具身认知基座模型。该模型旨在为机器人提供高层视觉与语言协同推理能力,从而指导下游动作模型执行物理任务。RxBrain已基于超过5万小时的具身数据训练,并在联合规划评估中优于传统模块化方案。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-16

彭博社披露 OpenAI 首款自研硬件是一款无屏、可移动的智能音箱,搭载全双工 GPT‑Live 语音交互,能通过摄像头和传感器感知环境,主动预测用户需求并控制智能家居,标志着 OpenAI 从软件走向“终端+入口”战略。

2026 年 7 月 16 日,彭博社爆料 OpenAI 正在开发其首款自主硬件设备,该设备被描述为“无屏移动式 AI 音箱”,内置摄像头与传感器,可感知环境语境,并通过 ChatGPT 语音控制智能家居。设备搭载全双工 GPT‑Live 语音交互系统,能根据用户日程、邮件与习惯主动预测需求、提出建议,复杂任务则交由更强模型处理。OpenAI 目前约有五款…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-16

波士顿动力在液压、运动控制等机器人技术上长期是行业标杆,但技术成本高、量产难、与真实商业场景匹配度有限,导致其始终难以做大;被现代汽车集团逐步转为全资子公司后,2024年亏损扩大至4405亿韩元,2026年月产量据称仅约4台Atlas。其最大启示是:机器人创业不能只追求技术领先,必须从真实需求出发定义产品,并最终回答“人形机器人到底能在哪个场景长期干活并持…

本卡片要回答的问题是:为什么“世界上最会造机器人的公司”波士顿动力始终难做大?材料以波士顿动力三十多年发展为主线,对比当下中国机器人公司密集上市的背景,梳理其从DARPA研究项目到被谷歌、软银、现代汽车多次收购,最终被完全纳入现代汽车集团的历程,分析其技术能力与市场商业化之间的落差。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-16

银河通用提出 WAM‑TTT(World‑Action Model Test‑Time Training)框架,首次将测试时训练(TTT)范式从大语言模型迁移至物理世界的机器人控制,让机器人仅凭未标注的人类视频即可在部署阶段快速适应新场景,无需重新预训练或昂贵的遥操作数据。

2026 年 7 月 16 日,银河通用正式发布全球首个面向具身智能大模型的测试时后训练框架 WAM‑TTT。该框架基于预训练的世界动作模型(WAM),通过在推理阶段引入轻量级快速权重记忆模块,使机器人能够从原始人类 RGB 视频中理解当前任务,并将场景信息写入临时记忆,再结合原有动作能力完成任务。这解决了具身智能行业长期存在的部署后泛化性衰减、跨场景适配…

产业观察 · 原始来源:量子位 · ai-industry
事件日期 2026-07-16

Cohere与多伦多大学于2026年7月16日宣布多年期合作,将Cohere的私有可部署、企业级AI平台North整合进多伦多大学的全校AI平台,以支持负责任AI在高校场景中的规模化采纳。

2026年7月16日,Cohere和多伦多大学宣布建立多年期合作伙伴关系,旨在支持这所加拿大领先的研究与教育机构负责任地采纳AI。合作将Cohere的“主权级、企业级”AI技术与多伦多大学在科研、教育和负责任技术采纳方面的专长结合。Cohere的私有可部署agentic AI平台North,将作为多伦多大学即将推出的全校AI平台的“编排层”,帮助大学社区成…

产业观察 · 原始来源:Cohere 博客 · ai-industry
事件日期 2026-07-16

两位杨教授(杨国安、杨斌)一致认为,AI时代企业变革成败的关键在于“一号位”(CEO)的信念、勇气与热爱。杨国安通过“杨五环2.0”提供了一份从技术到领导力的系统化变革蓝图;杨斌则通过“AI次方变革”与“组织的中年”理论,强调成熟组织必须主动“变小”、在边缘地带孕育颠覆性创新才能赢得未来。

在清华大学经济管理学院举办的《智在未来》新书发布会上,杨国安教授发布了其关于AI时代企业战略与管理的“杨五环2.0”模型。同时,杨斌教授提出了与之互补但视角迥异的“AI次方变革”理论,并剖析了成熟组织面临的“组织的中年”困境。两位教授共同探讨了CEO在AI变革中的核心作用。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-16

知网明确禁止将AI(如DeepSeek、Gemini)列为论文作者,已下架相关论文,并要求使用AI必须在研究方法或致谢中说明,否则不予上线传播。

针对部分期刊将DeepSeek、Gemini等AI模型列为作者引发的争议,中国知网(CNKI)已对这类论文作下架处理,并公开发布声明:不接受AI被列为署名作者。所有作者必须为自然人、法人或非法人组织;若使用AI辅助研究,必须在“研究方法”或“致谢”部分明确说明,以保证可溯源,违背此规则的论文不予上线传播。

产业观察 · 原始来源:腾讯研究院(搜狐同步) · ai-industry
事件日期 2026-07-16

NVIDIA BlueField-4 DPU、Vera BlueField-4 STX存储处理器与DOCA软件平台构成AI工厂的“基础设施操作系统”,通过卸载、加速和隔离网络、存储、安全、遥测及上下文管理任务,提升GPU利用率、降低每token成本并增加每瓦token数,以应对智能体AI工作流对基础设施数据路径的新需求。

2026年7月16日,NVIDIA在技术博客中介绍了BlueField平台如何通过极致协同设计(extreme co-design)规模化智能体AI工厂。文章指出,智能体AI将推理从单一模型执行扩展为分布式工作流——一个请求可触发多次模型调用、工具调用、内存查找、策略检查、存储访问与网络传输。因此,基础设施数据路径成为推理管线的一部分,需要高速移动、保护、…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-16

普林斯顿教授Narayanan在ICML 2026指出,当前AI能力虽快速提升但可靠性几乎停滞,提出“智能体三难”(通用性、高风险、自动化不可兼得),并认为AI更应被定位为协作工具而非替代工具,人类需将节省时间再投资于自身成长,先成为专家再借AI放大能力。

在ICML 2026会议上,普林斯顿大学教授Narayanan针对AI行业普遍存在的“替代焦虑”提出批判性观点。他认为,尽管AI模型能力持续飙升,但可靠性(如鲁棒性、可解释性、安全性)几乎停滞不前,导致高自动化场景下风险不可控。由此他提出“智能体三难”:通用性、高风险、自动化三者无法同时成立——任何智能体在追求高度通用和高自动化的同时,必然伴随高风险,反之…

产业观察 · 原始来源:腾讯研究院(搜狐同步) · agent
事件日期 2026-07-16

2026年7月16日,NVIDIA 技术博客详细介绍了如何将上下文感知的视频 AI 代理集成到企业工作流中。该方案基于 NVIDIA NemoClaw(用于构建自主代理的开放蓝本集合)和 NVIDIA Blueprints(可定制的参考工作流),具体使用了 Metropolis Blueprint for Video Search and Summariz…

产业观察 · 原始来源:NVIDIA 博客 · agent
事件日期 2026-07-16

Cars24通过集成OpenAI驱动的语音和聊天代理,每月处理超100万分钟的对话,成功挽回了12%的丢失销售线索,并将代理工作流(agentic workflows)推广至全公司多个团队。

Cars24(一家二手车交易平台)部署了基于OpenAI模型的语音和聊天代理,用于处理客户咨询。该代理系统每月处理超过100万分钟的对话,成功挽回了原本可能流失的销售线索(12%)。此外,该公司还将此类代理工作流扩展到内部多个团队,使更多部门能够自主构建和运行智能体。

产业观察 · 原始来源:OpenAI · agent
事件日期 2026-07-16

大型语言模型(LLM)中的物理危险(Physical Danger,PD)与文本内容危险(Content Danger,CD)在隐状态空间中形成可分离信号;基于此设计的 PRISM 单层逻辑探针能以低误报率高精度检测物理风险,显著优于同等规模的 LLM 裁判。

LLM 越来越多地被用作具身智能体的高层次规划器。一条在语言层面完全安全的指令,一旦在物理世界中执行,可能变得不安全。本文研究“物理危险”是否等同于传统的“内容危险”问题。通过隐状态方向分析和随机分割零检验,作者证明 PD 和 CD 在多个 LLM 的表示空间中构成可分离的信号。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

TikStance 是一个包含 161 个视频和 13,876 条评论的多模态层次数据集,覆盖 2024 年美国大选周期中的三位主要政治人物(Donald Trump、Joe Biden、Kamala Harris),为短视频平台政治立场检测提供了可靠的标注基准。

政治讨论正大量迁移到短视频平台,但计算分析受限于缺乏同时保留视听信息和层次对话结构的数据集。TikStance 旨在填补这一空白,支持在视听与对话上下文中进行多目标立场分析。

学术前沿 · 原始来源:arXiv 论文 · foundation-model
事件日期 2026-07-16

AI正从工具转变为科研循环中的自主参与者,导致研究从“手工艺模式”转向“流水线模式”,即研究的工业化;这一转变虽具潜力,但带来七大关键问题,需在负责任推进的前提下加以应对。

2026年7月,Emmanuel Jeannot在arXiv发表论文“The Industrialization of Research ; On AI-Driven Science and Its Consequences”,系统论述了人工智能对科学研究的根本性重塑:AI不再仅仅是更强大的仪器,而是成为研究循环中自主参与的实体。这标志着研究从“手工艺模型…

学术前沿 · 原始来源:arXiv 论文 · foundation-model
每页 20 条