AI消息速览

CorporateBench:面向企业级时间知识库的大规模问答基准

事件日期 2026-08-27 · 学术前沿 · 已接受

事件日期2026-08-27
信息日期2026-08-27
入库日期2026-08-29
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CorporateBench:面向企业级时间知识库的大规模问答基准

一句话结论

CorporateBench 是一个人工验证的大规模多任务问答基准,用超过 23 万份文档模拟企业通信网络,评测大语言模型在信息抽取与知识库查询上的能力;实验显示,当输入规模接近真实企业场景时,五个被测模型的表现明显下降。

事件概述或研究问题

企业通常不愿共享内部通信数据,而现有合成数据集过于简单,导致大语言模型在企业级文档集合上的问答能力难以被有效评估。为此,研究者构建了 CorporateBench,以接近企业真实规模的评测条件弥补这一空缺。

方法/产品要点

  • 通过四个合成的企业语料进行评测,企业规模从 12 名员工到 10,000 名员工不等。
  • 每个语料均从一个随时间演化的知识库中采样,保证跨越数十万份文档的逻辑一致性。
  • 评测维度包括两个:信息抽取(information extraction)和知识库查询(knowledge base querying)。
  • 基准经过了人工验证(human-validated)。
  • 对五个大语言模型进行了评估。

主要结果或产业意义

  • 在 CorporateBench 上,随着输入规模接近现实企业场景,模型性能越来越差。
  • 该基准为“企业通信推理”提供了可量化的评测指标,填补了现有大模型评测生态中的关键空缺。
  • 对于企业级检索增强生成、内部知识库问答等应用,该基准有助于暴露模型在大规模文档条件下的真实能力边界。

为什么重要

以往的企业场景评测要么缺乏真实数据,要么使用过于简单的合成数据集,难以反映实际部署条件。CorporateBench 提供了一个可扩展、逻辑一致、且规模接近真实企业文档量的评测基准,能更可靠地衡量大模型在企业文档检索与问答中的表现。

局限与不确定性

  • 语料来自合成企业,并非真实企业数据,因此结论向真实企业通信场景的推广程度仍需验证(待核实是否另有相关实验说明)。
  • 摘要中未披露被评测的五个模型具体名称、性能数字、任务细节等(待核实)。
  • 摘要未说明基准的构建成本、数据获取方式、评测协议等细节(待核实)。

可用于图书/PPT/简报的角度

  • 大模型在企业知识管理中的可靠性:输入规模越大,性能衰减越快。
  • 如何在不泄露企业隐私的前提下构造高质量评测语料:时间知识库 + 合成企业。
  • 从学术基准到产业落地的差距:为什么现有简单基准不够用。

与既有脉络的关系

既有真实世界数据分析基准 DataGovBench 关注数据复杂性,RMISC 关注时间序列基础模型的真实世界语料;CorporateBench 则聚焦企业通信场景下的大规模文档问答与时间知识库,提供的是面向企业级 LLM 应用的评测基准,与二者形成互补。

原始材料

  • 英文标题:CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases
  • 英文关键词(根据内容提炼):CorporateBench; Large-scale Q&A Benchmark; Temporal Knowledge Bases; Enterprise LLM Evaluation; Information Extraction; Knowledge Base Querying
  • 来源:https://arxiv.org/abs/2608.27391v1
  • arXiv ID:2608.27391v1
  • 作者:Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov
  • 发布时间:2026-08-27
  • 类别:cs.AI, cs.CL, cs.IR, cs.LG