知识卡片:AI翻译中的“可评估性差距”:可读性与源文保留的分歧
英文标题:When Readability and Source Retention Diverge: An Evaluability Gap in AI Translation
英文关键词:AI translation; readability; source retention; evaluability gap(原文未提供关键词列表,以上据标题与摘要提炼)
一句话结论
对于AI翻译,一个“可读”的输出可能产生“可评估性差距”:即使把源文本展示给用户,用户给出的整体质量评分也未必反映该输出在多大程度上保留了源文内容;这一现象在复杂文本上尤为明显。
事件概述或研究问题
该研究关注AI翻译输出评估中的一个认知缺口:用户能否真正评估“源文保留”程度?作者提出,可读性与源文保留可能背离;即便界面同时显示源文,用户对整体质量的判断也可能无法体现保留内容的差异。研究同时考察了用户对输出和系统的评价如何与信任、以及是否愿意把个人文本交给系统处理(披露意愿)相关。
方法/产品要点
- 在纯文本界面中使用名为TransLingo的系统(具体性质待核实)开展一项2×2比较,N=306。
- 两个因素:源文本条件(简单生成叙事 vs 复杂文学哲学散文)与输出呈现方式(LLM生成的可读性导向输出 vs 研究者修订的保真度导向输出)。
- 对刺激材料进行描述性审计,比较两类输出对源文内容的保留程度。
- 测量指标包括感知翻译质量、感知智能、代理导向的拟人化归因、任务绩效信任、跨六个领域的自述披露意愿(具体领域待核实)。
- 通过因素分析(factorial analyses)检验交互效应,并用理论排序的评价结构SEM分析各评价变量之间的并发关系。
主要结果或产业意义
- 描述性刺激审计显示,在两种源文本条件下,保真度导向输出都比可读性导向输出保留了更多源文内容。
- 感知质量存在显著的“呈现方式×源文本条件”交互:对简单生成叙事,参与者给保真度导向输出更高评分;对复杂文学哲学散文,两种输出之间没有可靠差异。
- 类似的源文本条件依赖模式也出现在感知智能、代理导向拟人化归因和任务绩效信任上。
- 结构方程模型显示,任务绩效信任是自述披露意愿的近端相关因素。
- 观察到的评分模式将“源文本可及(source access)”与“源文本可评估性(source evaluability)”区分开:在复杂刺激下,展示源文本并不足以让整体质量评分反映保留内容上的差异。
为什么重要
该研究提示,AI翻译的用户评价不能简单等同于翻译质量,尤其不能把“可读性”视为“保真度”。对产品设计而言,仅提供原文对照也许不够,还需要帮助用户识别输出遗漏或改写了什么。同时,用户是否愿意将个人文本托付给AI翻译系统,与“任务绩效信任”关系更近,这意味着系统需要分别支持“评估翻译输出”和“数据处理安全/隐私决策”。本条与已有卡片涉及的时间序列生成、多智能体临床推理、多智能体辩论无直接关联,是AI翻译人机交互评价的新主题。
局限与不确定性
- 摘要未报告具体效应量、样本人口统计、刺激材料细节和SEM拟合指数,待核实。
- “可读性导向”与“保真度导向”输出的具体生成/修订方式未在摘要中展开,待核实。
- TransLingo是仅指测试界面还是底层翻译系统,待核实。
- 结果是否适用于其他语言对、其他文本类型和非纯文本界面,待核实。
可用于图书/PPT/简报的角度
- 案例角度:为什么AI翻译“读起来顺”不一定“译得准”?展示原文也可能无济于事。
- 概念角度:区分“可以看到源文”与“能够评估源文保留情况”,即可评估性差距。
- 设计角度:AI翻译工具应同时提供输出质量评估支持与数据处置信任支持。
原始材料
- 英文标题:When Readability and Source Retention Diverge: An Evaluability Gap in AI Translation
- arXiv ID:2608.19083v1(Primary category: cs.HC; Categories: cs.HC, cs.CL)
- 作者:Chenchen Mao, Hanjing Shi, Haiyan Jia, Emily Wegrzyn, Dominic DiFranzo
- 发布/更新:2026-08-19
- 摘要地址:https://arxiv.org/abs/2608.19083v1
- PDF地址:https://arxiv.org/pdf/2608.19083v1