AI消息速览

语篇感知的文本到手语标注翻译:DiscoSign

事件日期 2026-09-02 · 学术前沿 · 已接受

事件日期2026-09-02
信息日期2026-09-02
入库日期2026-09-04
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:语篇感知的文本到手语标注翻译:DiscoSign

说明:本卡仅基于 arXiv 页面可见的候选摘要/元数据生成;原文全文未能抓取。所有缺少数值或细节的内容均标注“待核实”。

一句话结论

DiscoSign 是一个面向语篇(discourse)级别的手语翻译框架,提出用模块化大语言模型(LLM)处理“文本→手语标注(gloss)”中的语篇现象。摘要称,相比“仅句子翻译”,该方法显著改善了空间一致性和实体追踪,同时保持有竞争力的单句翻译质量。

研究问题

传统手语处理系统大多以“句子”为基本单位,忽略手语理解所依赖的语篇级现象;但真实手语交流中,跨句的空间位置、指代关系、句法结构和概念与手语符号之间的映射都会影响连贯性。DiscoSign 针对这些问题,尝试把翻译从句子级推进到语篇级。

方法要点

  • 框架:基于 LLM 的模块化“语篇感知”翻译架构,专门处理三类关键语篇现象:
    1. 空间共指消解:让同一实体在持续话语中保持稳定的空间位置与共指关系。
    2. 疑问-回答小句(QAC):处理具有特定语篇功能的假拟分裂结构(pseudocleft structures)。
    3. 概念-标注一致性:保证英语概念与美国手语(ASL)的手语标注之间映射相对稳定。
  • 评价方法:作者认为传统翻译指标难以衡量语篇层质量,因此提出一组新的评价指标,分别对应框架试图处理的语篇一致性维度。
  • 实验数据:在句子级和语篇级数据集上与“仅句子翻译”对照(数据集名称、规模待核实)。

主要结果 / 产业意义

  • 摘要称,语篇感知处理显著提升了空间一致性和实体追踪效果,同时没有明显牺牲单句 gloss 翻译质量。
  • 据摘要,这是首个面向“语篇级文本到手语标注翻译”的系统性框架,并配套了相应评价方法。
  • 产业意义上,这类工作为 AI 手语翻译从“单句可用”走向“连续语篇可用”提供了方法和评测基础,可服务于手语内容生成、无障碍字幕等场景。

为什么重要

  • 手语不是孤立句子的简单拼接;很多信息依赖跨句的空间指代和语篇结构。若只做句子级翻译,翻译结果可能在单句上可读,但连起来仍不符合手语使用习惯。
  • 与既有脉络的关系:已有相关卡片“实时句子级手语翻译”更关注降低延迟、提高端侧可行性;本卡片的增量在于把问题扩展到“语篇级”,并将空间共指、QAC、概念-标注一致性整合进 LLM 翻译框架,还提出配套语篇评价指标。

局限与不确定性

  • 全文无法获取,以下内容待核实:
    • 具体数据集名称、规模,以及“显著提升”对应的定量数值。
    • 使用的 LLM 型号、参数规模、计算成本和是否开源。
    • 是否仅覆盖“英语→美国手语(ASL)”,是否可推广到其他手语或语言。
    • 作者、机构、发表状态、是否经过同行评议。
    • 论文版本信息来自 arXiv:2609.02796v1。

可用于图书/PPT/简报的角度

  • “手语翻译不只是逐句翻译”:用空间指代和跨句一致性说明句子级 AI 的不足。
  • “从句子到语篇:手语翻译的下一个前沿”:以 DiscoSign 为案例介绍新的翻译与评测思路。
  • “无障碍 AI 的评价指标不能只照搬机器翻译 BLEU”:语篇级手语任务需要新的评测指标。

原始材料

  • 英文标题:DiscoSign: Discourse-Aware Text to Sign Language Gloss Translation
  • 英文关键词(据摘要提炼;原文未单独列出):sign language translation; discourse-aware; gloss; LLM; spatial coreference; question-answer clauses; concept-gloss consistency; American Sign Language
  • 来源:arXiv:2609.02796v1,https://arxiv.org/abs/2609.02796v1
  • Track: academic
  • Topics: foundation-model
  • 候选摘要(英文):Sign language processing systems have traditionally operated at the sentence level, ignoring critical discourse phenomena fundamental to sign language comprehension. We introduce DiscoSign, a computational approach for discourse-aware text to sign language gloss translation grounded in linguistic research. We address three key phenomena within our modular Large Language Model (LLM)-based translation framework: (i) spatial coreference resolution, where entities maintain consistent spatial locations throughout discourse; (ii) Question-Answer Clauses (QACs), pseudocleft structures serving specific discourse functions; and (iii) concept-gloss consistency, ensuring stable mappings between English concepts and American Sign Language (ASL) signs. Traditional translation metrics fail to capture discourse-level quality, so we introduce a suite of novel evaluation metrics designed to assess each dimension of discourse coherence addressed by our framework. Experiments on sentence-level and discourse-level datasets show that our approach for discourse-aware processing significantly improves spatial consistency and entity tracking relative to sentence-only translation, while maintaining competitive single-sentence gloss translation quality. Our work establishes the first systematic framework for discourse-level text to sign language gloss translation with corresponding evaluation methodology.