知识卡片:腾讯混元开源Hy4量化轻量版,权重1.5TB压缩到214GB
英文关键词:Tencent Hunyuan, Hy4, Sherry, sparse ternary quantization, MIX-STQ1_0, heterogeneous inference
一句话结论
腾讯混元将 Hy4 preview 的权重从接近 1.5TB 压缩到约 214GB,采用自研 Sherry 稀疏三值量化与 MIX-STQ1_0 混合精度分配,在主流评测中与 BF16 原版差距在一两分以内,检索类任务基本不掉点,并在“4090 笔记本 + 四卡 A4000”异构联合推理下跑到约 1.02 token/s。
事件概述
腾讯研究院AI速递 20260902 中报道,腾讯混元开源了 Hy4 量化轻量版。该版本把 Hy4 preview 的权重大幅压缩,目标是降低运行这一模型的硬件门槛。原始材料为快讯摘要,未提供完整技术报告或开源仓库链接。
方法/产品要点
- 产品形式:Hy4 量化轻量版,基于 Hy4 preview 权重进行压缩。
- 权重体积:从接近 1.5TB 压缩到约 214GB。
- 量化方法:采用自研 Sherry 稀疏三值量化。
- 编码方式:四个权重一组编码为 5 比特,平均约 1.25 比特/权重。
- 混合精度策略:使用 MIX-STQ1_0,按各层敏感度逐层分配混合精度。
主要结果或产业意义
- 评测表现:主流评测与 BF16 原版差距在一两分以内,检索类任务基本不掉点。
- 部署表现:在 4090 笔记本加四卡 A4000 的异构联合推理下跑到 1.02 token/s。
- 产业意义:大幅降低运行 Hy4 这类大模型的硬件门槛,使更大模型在消费级或异构算力环境下运行成为可能。
为什么重要
本条是“大模型量化压缩 + 开源部署”方向上的具体案例,增量信息在于给出了明确的压缩规模和效果数据:约 1.5TB → 214GB,性能差距很小。这样的数字比泛泛讨论“开源大模型”更有参考价值,也体现出稀疏三值量化、按层敏感度分配混合精度、异构推理等技术正在进入实际产品化阶段。
与既有脉络的关系
本条与已有相关卡片(NIST AI RMF、Epoch AI 出版物、OpenRouter 博客归档)没有直接承接关系,属于新的 AI 产业动态。增量信息在于腾讯混元 Hy4 量化轻量版的技术路径和实测吞吐数据。
局限与不确定性
以下内容原始材料未披露,待核实:
- “开源”具体指权重开源、代码开源还是两者都开源,以及发布平台和许可证。
- 主流评测的具体基准名称、评测集规模和完整分数。
- 1.02 token/s 的测试细节,例如是否包含启动、权重加载、量化/反量化或异构通信开销。
- 4090 笔记本加四卡 A4000 的具体显存配置、功耗与稳定运行条件。
- Sherry 和 MIX-STQ1_0 是否有论文、技术报告或更详细的方法说明。
可用于图书/PPT/简报的角度
- 大模型量化的收益:1.5TB 到 214GB 意味着什么。
- 稀疏三值量化与混合精度分配的技术趋势。
- 开源大模型如何通过压缩降低硬件门槛。
- 异构推理的实际场景:笔记本 + 多卡运行大型模型。
- AI 产业速递类信息的阅读方式:关注数字、模型名称、评测条件与开源许可是否完整。
原始材料
- 原始来源标题:腾讯研究院AI速递 20260902
- 原始页面地址:https://m.sohu.com/a/1070665925_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2
- 原始页面未提供独立英文标题;如需英文引用,可按“Tencent Hunyuan Open-Sources Quantized Lightweight Hy4, Compressing Weights from 1.5TB to 214GB”作为非官方的编译标题。