知识卡片:腾讯混元极低bit翻译模型,3.3GB压缩至440MB
英文标题: Tencent Hunyuan Extreme Low-bit Translation Model: 3.3GB Compressed to 440MB
英文关键词: Hunyuan; Extreme Low-bit; Translation; Quantization; Edge AI; FLORES-200
一句话结论
腾讯混元通过2-bit与1.25-bit两套极致量化方案,将端侧翻译模型Hy-MT2-1.8B从约3.3GB压缩至440MB,翻译质量几乎无损,并在FLORES-200评测上优于微软、豆包等商业翻译API。
事件概述或研究问题
为降低端侧翻译模型的部署门槛,腾讯混元尝试将1.8B参数量级模型压缩到几百MB量级,同时保持翻译质量。速递显示,该工作已形成2-bit和1.25-bit两条量化路线,并联合英特尔、哔哩哔哩推进算子优化与实时弹幕翻译落地。
方法/产品要点
- 原始模型:Hy-MT2-1.8B,体积约3.3GB。
- 2-bit量化:采用“拉伸弹性量化”,模型压缩至574MB。
- 1.25-bit量化:基于自研Sherry三值量化,模型压缩至440MB;该技术入选ACL 2026 Oral。
- 联合英特尔完成x86算子优化,token rate最高提升5倍。
- 联合哔哩哔哩接入直播弹幕实时翻译,单条弹幕平均耗时500至800毫秒。
主要结果或产业意义
- 压缩后翻译质量几乎无损,FLORES-200评测优于微软、豆包等商业翻译API。
- 支持本地部署,可保护隐私、降低端侧AI使用门槛。
- 与英特尔的算子优化及B站弹幕翻译场景,展示了从模型量化到行业落地的完整链路。
为什么重要
该案例说明极低bit量化可将1.8B模型压缩至数百MB,为端侧翻译、实时字幕等资源受限场景提供可行路径。自研Sherry三值量化入选ACL 2026 Oral,提示方法本身具备一定学术创新性;与产业伙伴的联合优化也体现了技术从研究到产品的转化能力。
局限与不确定性
- “翻译质量几乎无损”的具体评测口径和量化指标细节待核实。
- FLORES-200对比中,商业翻译API的具体版本和配置未说明,待核实。
- 模型是否已开源、商用授权条件、支持语言列表等信息未在材料中说明,待核实。
- 实际端侧部署设备范围(如手机型号、x86平台规格)以及内存/功耗表现待核实。
可用于图书/PPT/简报的角度
- 端侧AI模型压缩案例:如何将3.3GB翻译模型装入手机。
- 量化前沿:2-bit、1.25-bit、三值量化、拉伸弹性量化。
- 生态合作:腾讯混元 × 英特尔 × 哔哩哔哩的产业落地路径。
- 评测对比:FLORES-200上与微软、豆包等商业API的效果比较。
原始材料
- 腾讯研究院AI速递 20260827(搜狐转载),URL: https://m.sohu.com/a/1068024885_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334