AI消息速览

分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

事件日期 2026-07-10 · 学术前沿 · 已接受

事件日期2026-07-10
信息日期2026-07-10
入库日期2026-07-13
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:分词器移植:缓解边缘高效孟加拉语ASR中的自回归崩溃

一句话结论:通过将Moonshine ASR模型的英语字节级分词器替换为孟加拉语原生的BanglaBERT WordPiece分词器,可彻底消除因高词元生育率导致的自回归崩溃,在保持边缘部署效率的同时将词错误率降至21.54%。

事件概述或研究问题:轻量级语音识别模型(如Moonshine)在孟加拉语等形态丰富、非拉丁语系语言上性能严重退化。研究发现根本原因在于模型使用的英语中心化字节级分词器(byte-level tokenizer)会将孟加拉语单词拆分成大量字节碎片(高词元生育率),进而在自回归解码过程中引发灾难性崩溃(catastrophic autoregressive collapse)。

方法/产品要点

  • 提出一种词汇移植管线(vocabulary transplantation pipeline):将解码器词汇表替换为孟加拉语原生的BanglaBERT WordPiece词汇,并调整相应的词嵌入矩阵尺寸。
  • 无需从头预训练或大量额外数据,仅通过替换词汇表与微调即可快速适应。

主要结果或产业意义

  • 词元生育率(token fertility)从9.16降至1.30,自回归序列长度减少85.8%,解码不稳定性完全消除。
  • 在882小时Lipi-Ghor数据集上达到21.54%的词错误率(WER),实时因子(RTF)为0.0053,满足边缘部署要求。
  • 提供了一种跨脚本(cross-script)适应轻量级ASR模型的可扩展、可复现方案,无需资源密集的预训练。

为什么重要:该工作揭示了面向英语优化的分词器在多语言场景下的根本性缺陷,并提出了一个极简且高效的修补方案。对于边缘设备上部署多语言ASR具有直接指导意义,尤其适用于孟加拉语等低资源高形态语言。

局限与不确定性

  • (待核实)论文未明确讨论在其他非拉丁语言(如阿拉伯语、印地语)上的泛化效果,以及BanglaBERT WordPiece词汇构建所需的标注资源依赖性。
  • (待核实)RTF指标仅在特定硬件上测得,实际部署效果可能因设备而异。

可用于图书/PPT/简报的角度

  • 案例:展示“分词器偏见”如何导致模型失效,以及如何通过“移植”原生词汇表拯救模型。
  • 技术要点:词元生育率与自回归崩溃的关系。
  • 产业启示:边缘AI模型的多语言适配不必重新训练,替换分词器即可显著提升性能。

原始材料

  • 论文标题:Tokenizer Transplantation: Mitigating Autoregressive Collapse in Edge-Efficient Bengali ASR
  • 英文关键词:foundation-model, ASR, tokenizer transplantation, Bengali
  • 来源URL:https://arxiv.org/abs/2607.09598v1