AI消息速览

商汤开源SenseNova U1.5-Lite统一多模态模型

事件日期 2026-08-04 · 产业观察 · 已接受

事件日期2026-08-04
信息日期2026-08-04
入库日期2026-08-04
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:商汤开源SenseNova U1.5-Lite统一多模态模型

一句话结论

商汤开源统一多模态模型SenseNova U1.5-Lite-Preview,基于NEO-Unify架构,仅8B-MoT规模,实现原生4K生成、更准确的中英文字与复杂版式,以及更稳定可迭代的图像编辑,多项基准显著超越前代U1,效果可比肩商用闭源模型。

事件概述

据腾讯研究院AI速递(2026-08-04)报道,商汤开源了统一多模态模型SenseNova U1.5-Lite-Preview。相比此前版本U1,新版原生支持4K生成,在图像纹理、文字渲染、版式呈现和图像编辑方面均有明显提升。

方法/产品要点

  • 模型名称:SenseNova U1.5-Lite-Preview
  • 架构:NEO-Unify
  • 规模:8B-MoT
  • 原生支持4K生成,纹理质感更精细
  • 中英文字与复杂版式识别和生成更准确
  • 图像编辑更稳定,支持迭代式修改
  • 改进方式包括重新设计生成头、减弱网格伪影、重组编辑数据

主要结果或产业意义

多项基准测试显示,U1.5-Lite-Preview显著超越前代U1,效果可比肩商用闭源模型。开源这一模型有助于降低统一多模态能力的获取门槛,推动图像生成、编辑及相关应用的发展。

为什么重要

这是商汤在开源统一多模态方向上的新进展。与已有的“商汤开源SenseNova-Vision统一视觉大模型(2026-07-14)”相比,本条记录的是后续更新,增量信息在于:从统一视觉模型扩展到统一多模态生成与编辑,并且以较小规模(8B-MoT)实现了4K生成和可迭代图像编辑,体现出架构与数据优化的价值。

局限与不确定性

  • 材料为二手摘要,未给出具体基准名称、数值、数据集及对比的商用闭源模型,实际性能差异待核实。
  • 未提及训练数据、参数细节、开源协议、硬件需求等信息。
  • U1.5-Lite-Preview与SenseNova-Vision是否属于同一开源序列,版本关系待核实。

可用于图书/PPT/简报的角度

可将其作为“开源多模态模型最新进展”案例;也可用于说明小规模模型通过生成头重新设计、数据重组等优化方式,达到接近商用闭源模型的效果,体现开源生态与模型效率的重要性。

与既有脉络的关系

已有相关卡片“商汤开源SenseNova-Vision统一视觉大模型(2026-07-14)”记录的是商汤统一视觉模型。本条为约三周后的新动作,属于同一机构在开源多模态方向上的延续或更新,增量信息是原生4K生成与图像编辑能力。

英文标题

SenseNova U1.5-Lite Open-Sourced by SenseTime: Unified Multimodal Model with 4K Generation/Editing

英文关键词

SenseNova; SenseTime; open source; multimodal; 4K generation; image editing; NEO-Unify

原始材料

URL: https://m.sohu.com/a/1058375324_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334

来源:腾讯研究院AI速递 20260804