知识卡片:CorporateBench:面向企业级时间知识库的大规模问答基准
一句话结论
CorporateBench 是一个人工验证的大规模多任务问答基准,用超过 23 万份文档模拟企业通信网络,评测大语言模型在信息抽取与知识库查询上的能力;实验显示,当输入规模接近真实企业场景时,五个被测模型的表现明显下降。
事件概述或研究问题
企业通常不愿共享内部通信数据,而现有合成数据集过于简单,导致大语言模型在企业级文档集合上的问答能力难以被有效评估。为此,研究者构建了 CorporateBench,以接近企业真实规模的评测条件弥补这一空缺。
方法/产品要点
- 通过四个合成的企业语料进行评测,企业规模从 12 名员工到 10,000 名员工不等。
- 每个语料均从一个随时间演化的知识库中采样,保证跨越数十万份文档的逻辑一致性。
- 评测维度包括两个:信息抽取(information extraction)和知识库查询(knowledge base querying)。
- 基准经过了人工验证(human-validated)。
- 对五个大语言模型进行了评估。
主要结果或产业意义
- 在 CorporateBench 上,随着输入规模接近现实企业场景,模型性能越来越差。
- 该基准为“企业通信推理”提供了可量化的评测指标,填补了现有大模型评测生态中的关键空缺。
- 对于企业级检索增强生成、内部知识库问答等应用,该基准有助于暴露模型在大规模文档条件下的真实能力边界。
为什么重要
以往的企业场景评测要么缺乏真实数据,要么使用过于简单的合成数据集,难以反映实际部署条件。CorporateBench 提供了一个可扩展、逻辑一致、且规模接近真实企业文档量的评测基准,能更可靠地衡量大模型在企业文档检索与问答中的表现。
局限与不确定性
- 语料来自合成企业,并非真实企业数据,因此结论向真实企业通信场景的推广程度仍需验证(待核实是否另有相关实验说明)。
- 摘要中未披露被评测的五个模型具体名称、性能数字、任务细节等(待核实)。
- 摘要未说明基准的构建成本、数据获取方式、评测协议等细节(待核实)。
可用于图书/PPT/简报的角度
- 大模型在企业知识管理中的可靠性:输入规模越大,性能衰减越快。
- 如何在不泄露企业隐私的前提下构造高质量评测语料:时间知识库 + 合成企业。
- 从学术基准到产业落地的差距:为什么现有简单基准不够用。
与既有脉络的关系
既有真实世界数据分析基准 DataGovBench 关注数据复杂性,RMISC 关注时间序列基础模型的真实世界语料;CorporateBench 则聚焦企业通信场景下的大规模文档问答与时间知识库,提供的是面向企业级 LLM 应用的评测基准,与二者形成互补。
原始材料
- 英文标题:CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases
- 英文关键词(根据内容提炼):CorporateBench; Large-scale Q&A Benchmark; Temporal Knowledge Bases; Enterprise LLM Evaluation; Information Extraction; Knowledge Base Querying
- 来源:https://arxiv.org/abs/2608.27391v1
- arXiv ID:2608.27391v1
- 作者:Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov
- 发布时间:2026-08-27
- 类别:cs.AI, cs.CL, cs.IR, cs.LG