AI消息速览

InsufficiencyBench:评估法律问答中用户查询信息不足的LLM

事件日期 2026-08-20 · 学术前沿 · 已接受

事件日期2026-08-20
信息日期2026-08-20
入库日期2026-08-22
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:InsufficiencyBench:评估法律问答中用户查询信息不足的LLM

一句话结论

InsufficiencyBench 是首个面向“查询侧信息不足”的法律 AI 基准,测试大模型能否识别用户法律问题中缺失的关键事实、指出缺了什么,并避免基于臆测过早下结论;评测发现当前前沿模型表现显著不足,没有模型能同时做到“识别缺失信息”“对不完整查询作答时加以限定”且“直接回答完整查询”。

事件概述或研究问题

法律 AI 系统越来越多地被用来回答法律问题,但现有基准通常假设用户查询已经是信息完整的。实际使用中,用户常常遗漏对法律结果具有决定性影响的事实。该研究提出 InsufficiencyBench,目标不是评估模型对完整法律问题的回答能力,而是评估模型面对“不完整查询”时的行为:是否能意识到查询缺少法律上实质性的信息、是否能识别缺失的是什么、是否能克制住不要给出过早结论。

方法/产品要点

  • 构建了一个形式化的缺失要素分类体系:8 个典型缺失要素类别,分布在 3 种结构性失效模式中——switch、gating 和 fatal prerequisite(具体含义原文未展开,待核实)。
  • 数据集规模:共 202 个基准项,包括 58 个基础查询和 144 个有缺陷变体。
  • 覆盖范围:6 个法律领域、24 个美国司法辖区。
  • 标注方式:由执业律师(practising attorneys)进行标注。
  • 评测对象:10 个前沿大模型(具体模型名单原文未列出,待核实)。

主要结果或产业意义

  • 在缺失要素识别任务上,没有任何模型超过 F2 = 0.46;中位召回率为 0.44。
  • 模型行为呈现两极化:要么无差别地过度谨慎/闪烁其词,要么在虚构假设下默默给出答案。
  • 没有模型同时满足研究者认为理想的两项要求:对信息不足的查询能识别并限定回答,同时对完整查询能直接回答。

为什么重要

  • 法律场景中,用户往往不知道自己遗漏了关键事实;如果 AI 只会在“完整问题”上表现良好,真实部署风险很高。
  • 该基准把注意力从“答案质量”转向“查询充分性”,为法律 AI 的安全性和可靠性评测提供了新维度。
  • 与已有相关卡片中的个人代理、遗忘精度、信念表达等方向不同,本条聚焦法律领域的信息充分性判断,是对大模型评测体系的一个增量补充。

局限与不确定性

  • 基准仅覆盖美国法域和 6 个法律领域,对其他国家或更多法律领域未必适用。
  • 3 种结构失效模式(switch、gating、fatal prerequisite)的具体定义、8 个缺失要素类别名称及示例,原文摘要未提供,待核实。
  • 10 个前沿模型的具体名称、评测设置、prompt 形式、是否使用检索或外部工具等细节,原文摘要未提供,待核实。
  • 标注者来自执业律师,但标注一致性、信度等信息原文摘要未提供,待核实。

可用于图书/PPT/简报的角度

  • 用一个“用户问法律问题但漏掉关键事实”的案例,说明大模型可能自信地给出错误法律结论。
  • 对比“模型在完整查询上表现好”与“在真实不完整查询上表现差”的差距,强调评测设计不能脱离真实使用场景。
  • 用数据支撑观点:F2 ≤ 0.46、中位召回 0.44,说明现有前沿模型尚不能可靠识别法律问题中的信息不足。

原始材料

  • 英文标题:InsufficiencyBench: Evaluating LLM legal advice on underspecified user queries
  • 英文关键词:legal AI benchmark; query-side insufficiency; LLM evaluation; legal reasoning; underspecified user queries
  • 原始来源:https://arxiv.org/abs/2608.20220v1
  • arXiv ID:2608.20220v1
  • 作者:Samuel J. Vincent, Daniel Calloway, Fangyi Yu, Andrew M. Bean, Nabeel Seedat
  • 发布时间:2026-08-20T16:14:47Z
  • 更新日期:2026-08-20T16:14:47Z
  • 主要分类:cs.AI