知识卡片:语篇感知的文本到手语标注翻译:DiscoSign
说明:本卡仅基于 arXiv 页面可见的候选摘要/元数据生成;原文全文未能抓取。所有缺少数值或细节的内容均标注“待核实”。
一句话结论
DiscoSign 是一个面向语篇(discourse)级别的手语翻译框架,提出用模块化大语言模型(LLM)处理“文本→手语标注(gloss)”中的语篇现象。摘要称,相比“仅句子翻译”,该方法显著改善了空间一致性和实体追踪,同时保持有竞争力的单句翻译质量。
研究问题
传统手语处理系统大多以“句子”为基本单位,忽略手语理解所依赖的语篇级现象;但真实手语交流中,跨句的空间位置、指代关系、句法结构和概念与手语符号之间的映射都会影响连贯性。DiscoSign 针对这些问题,尝试把翻译从句子级推进到语篇级。
方法要点
- 框架:基于 LLM 的模块化“语篇感知”翻译架构,专门处理三类关键语篇现象:
- 空间共指消解:让同一实体在持续话语中保持稳定的空间位置与共指关系。
- 疑问-回答小句(QAC):处理具有特定语篇功能的假拟分裂结构(pseudocleft structures)。
- 概念-标注一致性:保证英语概念与美国手语(ASL)的手语标注之间映射相对稳定。
- 评价方法:作者认为传统翻译指标难以衡量语篇层质量,因此提出一组新的评价指标,分别对应框架试图处理的语篇一致性维度。
- 实验数据:在句子级和语篇级数据集上与“仅句子翻译”对照(数据集名称、规模待核实)。
主要结果 / 产业意义
- 摘要称,语篇感知处理显著提升了空间一致性和实体追踪效果,同时没有明显牺牲单句 gloss 翻译质量。
- 据摘要,这是首个面向“语篇级文本到手语标注翻译”的系统性框架,并配套了相应评价方法。
- 产业意义上,这类工作为 AI 手语翻译从“单句可用”走向“连续语篇可用”提供了方法和评测基础,可服务于手语内容生成、无障碍字幕等场景。
为什么重要
- 手语不是孤立句子的简单拼接;很多信息依赖跨句的空间指代和语篇结构。若只做句子级翻译,翻译结果可能在单句上可读,但连起来仍不符合手语使用习惯。
- 与既有脉络的关系:已有相关卡片“实时句子级手语翻译”更关注降低延迟、提高端侧可行性;本卡片的增量在于把问题扩展到“语篇级”,并将空间共指、QAC、概念-标注一致性整合进 LLM 翻译框架,还提出配套语篇评价指标。
局限与不确定性
- 全文无法获取,以下内容待核实:
- 具体数据集名称、规模,以及“显著提升”对应的定量数值。
- 使用的 LLM 型号、参数规模、计算成本和是否开源。
- 是否仅覆盖“英语→美国手语(ASL)”,是否可推广到其他手语或语言。
- 作者、机构、发表状态、是否经过同行评议。
- 论文版本信息来自 arXiv:2609.02796v1。
可用于图书/PPT/简报的角度
- “手语翻译不只是逐句翻译”:用空间指代和跨句一致性说明句子级 AI 的不足。
- “从句子到语篇:手语翻译的下一个前沿”:以 DiscoSign 为案例介绍新的翻译与评测思路。
- “无障碍 AI 的评价指标不能只照搬机器翻译 BLEU”:语篇级手语任务需要新的评测指标。
原始材料
- 英文标题:DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation
- 英文关键词(据摘要提炼;原文未单独列出):sign language translation; discourse-aware; gloss; LLM; spatial coreference; question-answer clauses; concept-gloss consistency; American Sign Language
- 来源:arXiv:2609.02796v1,https://arxiv.org/abs/2609.02796v1
- Track: academic
- Topics: foundation-model
- 候选摘要(英文):Sign language processing systems have traditionally operated at the sentence level, ignoring critical discourse phenomena fundamental to sign language comprehension. We introduce DiscoSign, a computational approach for discourse-aware text to sign language gloss translation grounded in linguistic research. We address three key phenomena within our modular Large Language Model (LLM)-based translation framework: (i) spatial coreference resolution, where entities maintain consistent spatial locations throughout discourse; (ii) Question-Answer Clauses (QACs), pseudocleft structures serving specific discourse functions; and (iii) concept-gloss consistency, ensuring stable mappings between English concepts and American Sign Language (ASL) signs. Traditional translation metrics fail to capture discourse-level quality, so we introduce a suite of novel evaluation metrics designed to assess each dimension of discourse coherence addressed by our framework. Experiments on sentence-level and discourse-level datasets show that our approach for discourse-aware processing significantly improves spatial consistency and entity tracking relative to sentence-only translation, while maintaining competitive single-sentence gloss translation quality. Our work establishes the first systematic framework for discourse-level text to sign language gloss translation with corresponding evaluation methodology.