知识卡片:有界评分量表上的双重差分可能制造虚假效应——来自预注册LLM评委审计的证据
一句话结论:在用于审计LLM评委偏见的“双重差分”设计中,如果结果是从有界评分量表读取的,量表截断(censoring)本身就能制造统计上显著的交互效应;一次预注册审计中看似显著的交互项(+0.378,p=0.002)无法被识别为偏好,仅由共同严重度偏移和量表地板效应即可复现其中79%–85%。
事件概述或研究问题:LLM评委的偏见审计常用匹配条件对比,更强设计是“双重差分”:先对同一题目下的两个候选回答做项目内对比,再对某个被操纵的属性做第二次差分,最终在有界评分量表上读取结果。这篇文章证明,这个终点在报告它的量表上并未被识别(not identified)——双重差分的每一项都被各自的截断比例所影响,观测统计量混淆了“差异偏好”与“差异衰减”。
方法/产品要点:本文用闭式推导说明机制,并用一次预注册审计展示失败实例。审计对象是一个冻结的教学法评委(frozen pedagogy judge),方案在990次调用前密封。预注册主要终点是“陈述的学习者档案”对该评委脚手架偏好的影响;审计中唯一名义显著的交互项,被进一步构造成一个包含零偏好差异的模型来检验。
主要结果或产业意义:预注册主要终点为 null:+0.085 分(95% BCa [-0.167, +0.353],p=0.684)。审计中名义显著的交互项为 +0.378(p=0.002),但一个包含零偏好差异的构造仅从观测到的严重度偏移和量表地板效应即可复现其79%–85%。作者还表明,该机制的贡献可以从审计自身的评分中测量出来。
为什么重要:已有相关卡片覆盖了具体的LLM审计案例(如Grokipedia政治中立性审计)和基于病理报告的多智能体系统;本卡片的增量在于从测量论层面揭示一种系统性统计假象:当评分量表有界、且不同刺激离边界距离不等时,双重差分会把共同严重度偏移转化为虚假交互。这意味着在LLM评委审计中,显著的“偏见差异”必须先排除量表截断的贡献,而不能直接解释为模型偏好。
局限与不确定性:摘要未给出对该机制的独立外部验证、在其他模型或量表上的复现情况,也未提供替代估计量或修正方法;这些细节待核实。冻结教学法评委的具体身份和审计完整协议细节也未在摘要中展开。
可用于图书/PPT/简报的角度:一个直观例子:如果两个回答都在1–7分量表上,一个接近地板,一个远离地板,那么即使两者的偏好真正无差异,只要评分者整体变严,靠近地板的那个受到的截断影响更大,从而产生虚假的交互。这个例子可用于解释“为什么不能只看p值”,以及量表边界如何扭曲测量。
原始材料:
- 英文标题:Difference-in-Differences on a Censored Rating Scale Can Manufacture an Effect: Evidence from a Pre-Registered LLM-Judge Audit
- 英文关键词:Difference-in-Differences; Censored Rating Scale; LLM Judge; Measurement Bias; Pre-registered Audit
- 来源:arXiv:2608.27309v1 [cs.CL](cs.AI, cs.CY),2026-08-27
- 作者:Shuyi Fan, Boyuan Deng, Mengyu Xu, Xinhong Xie, Chenyang Li, Hongyang Zhang
- URL:https://arxiv.org/abs/2608.27309v1