知识卡片:面向可部署的孟加拉手语识别:专家验证数据集与轻量注意力模型
英文标题:Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model
英文关键词:Bangla Sign Language Recognition; Lightweight Attention; RSBdSL38; Expert-Validated Dataset; On-device AI
原始来源:https://arxiv.org/abs/2608.06252v1
一句话结论
本文发布了一个专家验证的孟加拉手语(BdSL)图像数据集 RSBdSL38,并提出了一个仅 298,470 参数的轻量注意力卷积网络。该模型从零训练在 RSBdSL38 上达到 96.37% 准确率(五种子均值 95.72% ± 0.54%),性能接近九种 ImageNet 预训练高效架构的最优水平,但参数量和计算量低一个数量级以上;量化后可在普通智能手机上以 3.98 ms/张运行。
事件概述或研究问题
孟加拉国聋人和听障人士主要使用孟加拉手语(BdSL)交流。若能在个人设备上自动识别 BdSL,有望扩大教育与服务的可及性。现有系统使用的数据集多来自受控环境、缺乏专家验证,且依赖重量级预训练骨干网络,不适合端侧部署。本文构建了专家验证的 RSBdSL38 数据集,并提出一个轻量级从零训练的注意力卷积模型,以弥合基准性能与实际部署之间的差距。
方法/产品要点
- 数据集 RSBdSL38:10,874 张专家验证图像,覆盖全部 38 个 BdSL 手型符号,对应孟加拉字母表的 51 个字母;数据采集自孟加拉国三所特殊教育学校的真实手语者。字母与手型符号的精确对应关系待核实。
- 模型结构:轻量注意力卷积网络,参数量 298,470。主要组件包括分组瓶颈残差块、通道与空间注意力、多尺度深度可分离手部特征块、双池化、Swish 激活。
- 训练策略:从头训练,不使用 ImageNet 预训练;与九种预训练高效架构在相同协议下对比。
- 部署特征:量化后模型大小 0.48 MB,普通智能手机上单张图像推理 3.98 ms,整体运行占用 15.5 MB。
主要结果或产业意义
- 在 RSBdSL38 上,模型准确率为 96.37%(五种子 95.72% ± 0.54%),比九种 ImageNet 预训练高效架构中最佳者低 1.08 个百分点,但参数量少 8.5–68 倍,MACs 少 1.3–21.7 倍。
- 重新训练后在六个公开 BdSL 基准上达到 92.95–98.33%;在合并语料上为 97.04%;在 BdSL-38 上零样本准确率为 76.25%。
- 消融实验显示,移除任意一个架构阶段会造成 7.61–89.30 个准确率点的损失,而训练方案变化的影响至多为 3.17 个点,说明架构设计贡献关键。
- 可解释性检查(Grad-CAM、删除-插入和权重随机化)表明预测依据是打手型的手,而非背景。
- 跨手语者泛化测试中,预留 6/36 位手语者的划分下准确率为 85.18%。
- 数据集、代码和模型已公开,为低资源手语识别提供可复现、可部署的基线。
为什么重要
- 首次同时提供专家验证的 BdSL 数据集和适合端侧部署的轻量模型,填补了现有受控数据集与真实部署之间的缺口。
- 以极低参数量接近预训练大模型性能,为资源受限场景下的手语识别提供了新思路。
- 该工作将基准准确率转化为可部署的辅助技术,且成本远低于预训练骨干方案。
局限与不确定性
- 数据集仅覆盖 38 个手型符号,未覆盖 BdSL 词汇、句子或动态手势;38 个符号与 51 个字母的具体对应关系待核实。
- 跨手语者划分下准确率为 85.18%,仍明显低于受控条件下的 96.37%,真实环境泛化能力有待进一步验证。
- 手机端 3.98 ms/张的推理性能是在量化后的特定设备上测得,具体设备型号和推理框架待核实。
- 作者机构、数据采集伦理审查、完整作者列表等细节待核实。
可用于图书/PPT/简报的角度
- 案例:低资源语言手语识别如何从实验室走向手机部署。
- 数据价值:专家验证的数据集是 AI 落地的重要瓶颈。
- 模型设计:轻量架构在准确率与计算开销之间取得平衡的实例。
- 可解释性:用 Grad-CAM 等工具验证模型关注的是手部而非背景。
与既有脉络的关系
本卡片与已有卡片中 Surv-IPTB、扩散语音识别、语音多模态认知检测无直接主题关联;本条目的增量信息在于提出首个专家验证的 BdSL 手型数据集及轻量模型,属于端侧手语识别方向的新工作。
原始材料
- 英文标题:Toward Deployable Bangla Sign Language Recognition with Expert-Validated Data and a Lightweight Attention-Based Model
- arXiv ID:2608.06252v1
- 作者:Saad Ahmed, Md Khalid Syfullaha(据 arXiv 摘要页列出,完整作者列表待核实)
- 提交/更新:2026-08-06
- 类别:cs.CV, cs.AI
- 链接:https://arxiv.org/abs/2608.06252v1