AI消息速览

腾讯混元Hy3极致量化开源,295B旗舰单卡可部署

事件日期 2026-07-15 · 产业观察 · 已接受

事件日期2026-07-15
信息日期2026-07-15
入库日期2026-07-15
通道产业观察
状态已接受
来源腾讯研究院(搜狐同步)

知识卡片:腾讯混元Hy3极致量化开源,295B旗舰单卡可部署

一句话结论:腾讯混元将295B参数的Hy3大模型量化为1bit和4bit的GGUF格式,1bit版压缩至85.5GiB(缩小6.7倍),单张96GB显卡即可部署;配套MTP投机解码使解码提速约50%~60%,且Agent、代码等能力接近满血BF16版本。

事件概述
腾讯混元团队公开了旗舰模型Hy3(295B参数)的极致量化方案,提供1bit和4bit两种GGUF格式,以及可直接对接vLLM的GPTQ Int4版。同时为llama.cpp新增了Multi-Token Prediction (MTP) 投机解码支持,显著提升了推理速度。

方法/产品要点

  • 量化方案
    • 1bit版:模型体积从598GB压缩至85.5GiB,缩小约6.7倍,单张96GB显存显卡可完整部署。
    • 4bit版:体积为169.9GiB,需两张显卡承载。
    • 额外提供GPTQ Int4版本,可直接连接vLLM推理框架。
  • 推理加速
    • 团队为llama.cpp实现了MTP投机解码,投机接受率稳定约60%。
    • 1bit量化下解码速度提升约50%,4bit量化下提升近60%。
  • 性能保真:输出分布与Top-K概率贴近BF16精度,在Agent、多语言代码、工具调用和长文理解等任务上表现接近原生满血模型。

主要结果或产业意义

  • 使得295B量级的超大模型在消费级单卡(如NVIDIA 96GB)上可运行,大幅降低了部署门槛。
  • 量化后依然保持较高的输出质量和任务能力,为端侧或小集群部署超大规模模型提供了可行路径。
  • MTP投机解码的补全,使llama.cpp在长上下文生成场景下获得显著加速,提升了开源推理生态的效率。

为什么重要

  • 此前部署295B级别模型通常需要多卡甚至集群,本工作将资源需求压缩至单卡或双卡,使中小团队和个人开发者也能实验并应用旗舰模型。
  • 同时补充了开源推理栈(llama.cpp、vLLM)对大规模量化和投机解码的支持,为社区提供了可直接使用的工程化方案。

局限与不确定性

  • 1bit量化对模型具体能力的影响未在材料中详细披露,仅提及“接近满血”,实际在部分边缘任务或长程推理上的退化程度待核实。
  • MTP投机解码的接受率(60%)受输入和任务类型影响,最佳使用场景尚未明确。
  • 整体方案在商业部署中的稳定性、显存溢出风险等未提及,需实际测试验证。

可用于图书/PPT/简报的角度

  • 技术突破:295B模型单卡部署的实现路径——量化+投机解码。
  • 成本对比:从598GB到85.5GiB,显存需求降低至原来的1/7。
  • 开源生态贡献:为llama.cpp补齐MTP支持,推动大模型推理社区进步。
  • 应用场景:适合资源受限环境下的Agent、代码生成、长文理解等任务。

原始材料

  • URL: https://m.sohu.com/a/1050336266_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334&digest_item=2
  • 标题:腾讯研究院AI速递 20260715
  • 英文标题(参考):Tencent Hunyuan Hy3 Extreme Quantization Open-Source
  • 英文关键词:foundation-model, agent, quantization, GGUF, MTP speculative decoding
  • Parent digest: 腾讯研究院AI速递 20260715
  • Parent URL: https://m.sohu.com/a/1050336266_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334