现有最先进的大语言模型(LLM)在充当政治信息中介时,高聚合得分掩盖了系统性失败:它们在信息清晰时表现可靠,但在信息缺失、模糊或矛盾时频繁崩溃,同时会扁平化政治语言强度,且失败可能受政党先验和输出语言影响;目前没有模型能一贯可靠地完成这一中介任务。
随着LLM越来越多地中介公民所依赖的政治信息,缺乏标准化方法来评估其是否负责任地承担这一角色。已有研究将任务视为“信息再现”而非“信息中介”,未涉及认识论维度及与不完美信息的交互。本研究提出Polistemics基准,基于公民认识论能动性推导出的规范标准“Epistemic Modesty”,在可控设置中变化信息的清晰度、噪声和一致性,评估LLM作为选举政…