知识卡片:实时句子级手语翻译
- 英文标题:Toward Real-Time Sentence-Level Sign Language Translation
- 英文关键词:sign language translation, real-time, streaming, SHuBERT, ByT5, QLoRA, latency optimization, Raspberry Pi
一句话结论
本文设计并实现了一个硬件感知的流式句子级手语翻译系统,在保持可接受翻译质量(测试集BLEU 15.9)的同时,将平均响应延迟从1.873秒降低至1.354秒(降幅27.71%),并验证了该架构可在树莓派4B等低功耗客户端上运行。
事件概述或研究问题
现有手语理解系统大多针对孤立词汇级手势,难以服务自然对话中的连续句子翻译。本文的目标不是提出新的翻译架构,而是以实时部署为首要目标,研究句子级手语翻译(Sentence-Level Sign Language Translation, SLT)在实际系统中的可行性与延迟瓶颈。
方法/产品要点
- 模型选择与微调:采用SHuBERT‑ByT5翻译栈,在How2Sign数据集中均匀采样的9,872个样本子集上微调。因计算和存储限制,仅使用该子集。微调时冻结SHuBERT,仅对ByT5部分使用QLoRA(量化低秩适配)。
- 流式系统架构:计算密集的感知与翻译运行在CPU/GPU后端;参考客户端为Raspberry Pi 4B(负责摄像头采集、本地文字显示与语音输出)。捕获协议与客户端无关,同一后端可服务于浏览器、手机或笔记本电脑。
- 延迟优化技术:采用分块摄取(chunked ingestion)、有界队列(bounded queues)、并行化感知(parallelized perception)、时序重排序(temporal reordering)以及句子边界状态机(sentence-boundary state machine)来减少端到端延迟。
主要结果或产业意义
- 翻译质量:验证集BLEU 16.7,测试集BLEU 15.9、BLEURT 44.7。
- 延迟改进:在整个9,872样本工作子集上,平均最终响应延迟从1.873秒降至1.354秒(降幅27.71%),P95延迟从2.919秒降至2.130秒(降幅27.03%)。
- 产业意义:首次展示了面向句子级手语翻译的实时流式系统,将高质量手语翻译推向实际部署(如公共服务、教育等场景)的可行性。
为什么重要
大多数手语研究停留在孤立词识别或非实时翻译,本文证明了在低成本硬件(树莓派4B)上实现句子级实时翻译是可能的,并提供了具体的延迟优化方案与参考实现。与既有知识卡片无直接重复,为手语翻译领域补充了实时系统工程视角的增量证据。
局限与不确定性
- 数据集仅使用How2Sign的9,872个样本子集,规模较小,可能无法覆盖真实对话中的多样性。
- 翻译BLEU分数(15-17)与高精度同声翻译仍有差距,译文忠实度与流畅度有待提升。
- 延迟测量基于特定硬件(树莓派4B客户端 + CPU/GPU后端),在更复杂网络环境或更高分辨率输入下的表现待核实。
- 未报告用户主观评价或实际无障碍场景中的可用性测试结果。
可用于图书/PPT/简报的角度
- 无障碍技术:手语翻译实时化的突破,为听障人士沟通提供新工具。
- 低功耗AI部署:树莓派作为边缘客户端的案例,展示轻量端侧与云端协同的流式翻译范式。
- 系统工程:分块摄取、队列管理、并行化等技巧如何系统性地降低AI服务延迟。
原始材料
- 论文标题:Toward Real-Time Sentence-Level Sign Language Translation
- arXiv ID:2607.09611v1
- 作者:Thanh-Hoang Nguyen Doan
- 发布于:2026-07-10
- 摘要链接:https://arxiv.org/abs/2607.09611v1
- PDF链接:https://arxiv.org/pdf/2607.09611v1