知识卡片:预训练大语言模型的原地分词器扩展
英文标题: In-Place Tokenizer Expansion for Pre-trained LLMs
英文关键词: Tokenizer Expansion, Pre-trained LLMs, BPE, Multilingual, On-device, Mixture-of-Experts
一句话结论: 本文提出一种“原地”分词器扩展方法,在不重头训练的前提下,通过延续BPE合并、拷贝嵌入、两阶段适应(先嵌入训练再全模型继续预训练),将紧凑型LLM的分词器升级至128K词汇表,使印地语、越南语等语言每字符的解码速度提升2.2–3.7倍。
事件概述或研究问题: 预训练时固定的分词器按语料比例分配词汇,若后期部署优先级变化(如加入新语言),新增语言的每个词会被切分成更多token,导致时延、计算和能耗增加。云模型可容忍大词汇表(嵌入和LM-head矩阵占比小),但紧凑型模型(如设备端模型)受限于带宽,只能使用小词汇表,导致非主要语言碎片化严重。如何高效地为已预训练的小模型扩展分词器、同时保持原始质量,是本文解决的问题。
方法/产品要点:
- 原地扩展(In-Place Expansion): 前提是模型生产者可控制分词器设计。
- BPE继续合并: 在现有分词器的BPE合并规则基础上,对多语言语料进一步合并,使大部分源token保持为单个token,每个新token有精确的源子token分解。
- 嵌入初始化: 被保留的源token嵌入直接拷贝;新token的嵌入初始化为其源子token嵌入的均值。
- 两阶段适应(Two-Stage Adaptation): 第一阶段仅训练嵌入层(其余参数冻结),第二阶段全模型继续预训练,以恢复至源检查点质量。
- 应用实例: 以LFM2-8B-A1B(8B参数MoE模型)的继续预训练检查点为起点,产出LFM2.5-8B-A1B(配备128K词汇表的分词器)。
主要结果或产业意义:
- 扩展后的分词器对印地语、越南语的编码token数分别减少约2.4倍和2.6倍,对泰语减少高达4.0倍。
- 结合更大词汇表带来的每token成本,估计在这些语言的参考设备上,每字符解码速度提升2.2–3.7倍。
- 作者开源了模型权重和扩展后的分词器。
为什么重要:
- 针对紧凑型设备端模型的多语言支持痛点,提供了一种无需从头预训练的低成本升级方案。
- 通过“原地”方式避免破坏原有知识,使已部署的小模型可以平滑扩展语言覆盖。
- 相比已有相关卡片(本卡片为新话题,无直接关联),本文首次系统解决分词器事后扩展中的嵌入初始化与快速适应问题,并公开了负面发现供社区参考。
局限与不确定性:
- 源分词器原始词汇表大小未在摘要中明确(待核实)。
- 扩展后的模型在非目标语言(如英语)上的性能是否完全无损,摘要仅提到“恢复源检查点质量”,具体数值待核实全文。
- 方法要求模型生产者可控制分词器设计,对第三方黑盒模型不适用。
- 负面的发现(如哪些尝试失败)在摘要中仅提及,未详细列出(待核实)。
可用于图书/PPT/简报的角度:
- 设备端AI的多语言扩展:如何用最小代价让离线模型支持更多语言?
- 分词器瓶颈:预训练固定分词器对后添加语言的不公平性及解决方案。
- 紧凑型模型的大词汇表适配:嵌入层带宽占用与速度增益的权衡(2.2–3.7倍加速)。
原始材料:
- 论文标题:In-Place Tokenizer Expansion for Pre-trained LLMs
- arXiv ID:2607.15232v1
- URL:https://arxiv.org/abs/2607.15232v1
- 作者:Jimmy T. H. Smith, Tarek Dakhran, Alberto Cabrera, Simon S. Lee, Paul Pak, Aditya Tadimeti, Tim Seyde, Maxime Labonne, Alexander Amini, Mathias Lechner
- 发表/更新日期:2026-07-16