AI消息速览

腾讯混元开源Hy4量化轻量版,权重1.5TB压缩到214GB

事件日期 2026-09-02 · 产业观察 · 已接受

事件日期2026-09-02
信息日期2026-09-02
入库日期2026-09-02
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:腾讯混元开源Hy4量化轻量版,权重1.5TB压缩到214GB

英文关键词:Tencent Hunyuan, Hy4, Sherry, sparse ternary quantization, MIX-STQ1_0, heterogeneous inference

一句话结论

腾讯混元将 Hy4 preview 的权重从接近 1.5TB 压缩到约 214GB,采用自研 Sherry 稀疏三值量化与 MIX-STQ1_0 混合精度分配,在主流评测中与 BF16 原版差距在一两分以内,检索类任务基本不掉点,并在“4090 笔记本 + 四卡 A4000”异构联合推理下跑到约 1.02 token/s。

事件概述

腾讯研究院AI速递 20260902 中报道,腾讯混元开源了 Hy4 量化轻量版。该版本把 Hy4 preview 的权重大幅压缩,目标是降低运行这一模型的硬件门槛。原始材料为快讯摘要,未提供完整技术报告或开源仓库链接。

方法/产品要点

  • 产品形式:Hy4 量化轻量版,基于 Hy4 preview 权重进行压缩。
  • 权重体积:从接近 1.5TB 压缩到约 214GB。
  • 量化方法:采用自研 Sherry 稀疏三值量化。
  • 编码方式:四个权重一组编码为 5 比特,平均约 1.25 比特/权重。
  • 混合精度策略:使用 MIX-STQ1_0,按各层敏感度逐层分配混合精度。

主要结果或产业意义

  • 评测表现:主流评测与 BF16 原版差距在一两分以内,检索类任务基本不掉点。
  • 部署表现:在 4090 笔记本加四卡 A4000 的异构联合推理下跑到 1.02 token/s。
  • 产业意义:大幅降低运行 Hy4 这类大模型的硬件门槛,使更大模型在消费级或异构算力环境下运行成为可能。

为什么重要

本条是“大模型量化压缩 + 开源部署”方向上的具体案例,增量信息在于给出了明确的压缩规模和效果数据:约 1.5TB → 214GB,性能差距很小。这样的数字比泛泛讨论“开源大模型”更有参考价值,也体现出稀疏三值量化、按层敏感度分配混合精度、异构推理等技术正在进入实际产品化阶段。

与既有脉络的关系

本条与已有相关卡片(NIST AI RMF、Epoch AI 出版物、OpenRouter 博客归档)没有直接承接关系,属于新的 AI 产业动态。增量信息在于腾讯混元 Hy4 量化轻量版的技术路径和实测吞吐数据。

局限与不确定性

以下内容原始材料未披露,待核实:

  • “开源”具体指权重开源、代码开源还是两者都开源,以及发布平台和许可证。
  • 主流评测的具体基准名称、评测集规模和完整分数。
  • 1.02 token/s 的测试细节,例如是否包含启动、权重加载、量化/反量化或异构通信开销。
  • 4090 笔记本加四卡 A4000 的具体显存配置、功耗与稳定运行条件。
  • Sherry 和 MIX-STQ1_0 是否有论文、技术报告或更详细的方法说明。

可用于图书/PPT/简报的角度

  • 大模型量化的收益:1.5TB 到 214GB 意味着什么。
  • 稀疏三值量化与混合精度分配的技术趋势。
  • 开源大模型如何通过压缩降低硬件门槛。
  • 异构推理的实际场景:笔记本 + 多卡运行大型模型。
  • AI 产业速递类信息的阅读方式:关注数字、模型名称、评测条件与开源许可是否完整。

原始材料

  • 原始来源标题:腾讯研究院AI速递 20260902
  • 原始页面地址:https://m.sohu.com/a/1070665925_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2
  • 原始页面未提供独立英文标题;如需英文引用,可按“Tencent Hunyuan Open-Sources Quantized Lightweight Hy4, Compressing Weights from 1.5TB to 214GB”作为非官方的编译标题。