知识卡片:腾讯混元开源HyOCR-1.5,1B端到端OCR推理提速6倍
一句话结论
腾讯混元开源的HyOCR-1.5是端到端OCR领域首个完整开源训练、推理与权重的专家模型,仅1B参数即可覆盖8种以上OCR任务,借助DFlash投机解码在Transformers下实现6.37倍加速,成为推理速度最快的OCR视觉语言模型(VLM),并支持在CPU及普通笔记本上运行。
事件概述
2026年7月14日,腾讯混元宣布开源HyOCR-1.5。该模型专注于端到端OCR任务,以极小参数量(1B)实现了多任务覆盖与极低推理延迟,在OmniDocBench v1.6基准上以94.74分位居端到端第一,并显著增强了古文字、图表解析等长尾能力,同时新增了无文字负样本处理能力。
方法/产品要点
- 模型架构:HyOCR-1.5是一个专家模型(Expert Model),参数量为1B,覆盖8种以上OCR相关任务(如文字检测、识别、版面分析、表格识别等)。
- 推理加速:采用DFlash投机解码(Speculative Decoding)技术,在Transformers框架下推理速度提升6.37倍,成为当前推理最快的OCR VLM。
- 轻量化部署:支持通过
llama.cpp在CPU及普通笔记本上运行,无需专用GPU。 - 训练与权重大小:首次完整开源训练代码、推理代码与模型权重,降低社区复现与二次开发门槛。
主要结果或产业意义
- 性能领先:在OmniDocBench v1.6评测中取得94.74分,排名端到端OCR第一。
- 长尾能力提升:古文字、图表解析等传统难点场景表现显著增强,并具备识别无文字负样本的能力(即能正确区分无文字的空白/背景区域)。
- 开源生态贡献:作为首个完整开源的端到端OCR专家模型,有望推动OCR技术在学术研究与工业应用中的普及。
- 计算成本降低:1B参数配合轻量推理栈,使高质量OCR可在个人设备或低成本服务器上运行。
为什么重要
此前端到端OCR模型往往参数量大、推理慢或仅开源部分组件。HyOCR-1.5以极小参数量和开源完整管线打破了这一壁垒,同时通过投机解码将推理速度提升一个量级,使端到端OCR真正具备实时与移动端部署潜力。此外,新增的负样本处理能力解决了传统OCR模型在非文字区域误判的痛点。
局限与不确定性
- 材料的评测结果仅基于OmniDocBench v1.6,其他复杂场景(如手写、多语言混合、极端光照)的泛化能力尚待验证。
- “推理最快的OCR VLM”这一表述来自腾讯混元官方,需进一步通过第三方独立基准确认。
- 古文字与图表解析的具体性能指标未在摘要中列出,有待完整技术报告发布。
- 开源的许可证类型和社区贡献指南尚未明确,可能影响商用和衍生作品的合规性。
可用于图书/PPT/简报的角度
- 技术科普:介绍端到端OCR从大模型到小参数轻量模型的演进,以HyOCR-1.5为例说明投机解码原理。
- 行业案例:展示最新AI开源项目如何平衡性能与成本,适用于智能文档、金融票据、古籍数字化等场景。
- 趋势分析:对比传统OCR与基于VLM的端到端OCR,分析1B参数模型的“小模型大能力”路线对AI基础设施的启示。
- PPT数据点:可引用“6.37倍推理加速”“94.74分”“1B参数覆盖8种任务”作为关键数字。
原始材料
- 标题:腾讯研究院AI速递 20260714(原文第二条)
- URL:https://m.sohu.com/a/1049851171_455313?scm=10001.325_13-325_13.0.0-0-0-0-0.5_1334
- 英文标题:HyOCR-1.5
- 英文关键词:OCR, VLM, DFlash, Transformers, CPU, llama.cpp, OmniDocBench