知识卡片:Xmax AI 发布实时交互视频模型 X2.0 并开放商用 API
一句话结论
清华团队 Xmax AI 推出实时交互视频模型 X2.0,画质提升至 960p/24fps、延迟达到毫秒级,并开放 API 供商用,成本仅为竞品 Decart 的十二分之一,目标是将视频从单向观看变为可实时操控的交互界面。
事件概述
2026 年 7 月 16 日(腾讯研究院 AI 速递报道),Xmax AI 发布其实时交互视频模型 X2.0,面向企业客户开放商业 API。该模型采用端到端流式重渲染架构,支持实时操控视频画面,并已实现 iPhone 端侧推理。
方法/产品要点
- 画质与延迟:输出分辨率 960p,帧率 24fps,交互延迟做到毫秒级。
- 核心架构:端到端流式重渲染架构,支持实时反馈与画面操控。
- 开放能力:提供换人、换装、换风格、触控、次元互动五项预设能力,以及自定义 Free 模式。
- 端侧部署:已实现 iPhone 端侧推理,可在移动设备上运行。
- API 定价:API 成本约为竞品 Decart 的十二分之一。
主要结果或产业意义
- 应用场景:瞄准直播互动(如虚拟主播、实时换装)、电商试穿等需要实时交互视频的领域。
- 行业影响:试图将视频从“单向观看”转变为“可操作的交互界面”,可能重塑直播带货、在线教育、虚拟社交等行业的用户体验。
- 成本优势:极低的 API 成本使中小型开发者也能接入实时交互视频能力,加速技术普及。
为什么重要
- 与竞品 Decart 的对比:成本仅为十二分之一,意味着实时交互视频的商业化门槛大幅降低。
- 实时性与端侧推理的结合:在手机端实现毫秒级延迟的实时视频操控,此前主要依赖云端算力,X2.0 展示了端侧推理的可能性。
- 增量信息:相比已有实时视频生成模型(如 Sora、Runway 等侧重离线生成),X2.0 强调“实时交互”和“端到端流式重渲染”,是对视频生成赛道从生成到交互的范式突破。
局限与不确定性
- 材料未提及模型在复杂场景(如多人互动、高动态背景)下的稳定性与画质表现。
- 未说明 API 的具体计价模式与并发限制。
- iPhone 端侧推理的具体机型及性能表现待核实。
- 实时交互视频的延迟受网络条件影响,实际用户体验可能因环境而异。
可用于图书/PPT/简报的角度
- 技术演进角度:视频 AI 从“生成-等待”到“实时交互”的里程碑。
- 商业应用角度:电商直播、虚拟试衣、在线教育中的低成本实时互动方案。
- 成本对比角度:以 Decart 为参照,展示国产团队在工程优化和成本控制上的突破。
- 创业视角:实时交互视频 API 作为基础设施,可能催生新一批交互式应用。
原始材料
- URL: https://m.sohu.com/a/1050798744_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=4
- 英文标题: Xmax AI Releases X2.0, Real-time Interactive Video Model with Open API
- 英文关键词: real-time video, interactive AI, Xmax AI, X2.0, API, Decart, end-to-end streaming re-rendering