AI消息速览

双维度大语言模型框架用于大规模测评中题目附带内容相似性自动分析

事件日期 2026-08-25 · 学术前沿 · 已接受

事件日期2026-08-25
信息日期2026-08-25
入库日期2026-08-26
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:双维度大语言模型框架用于大规模测评中题目附带内容相似性自动分析

一句话结论

本研究提出了一种基于大语言模型(LLM)的双维度自动题目相似性分析框架(AISA),将题目相似性分解为“结构化分解”与“语义相关性”两个维度;心理测量学验证和计算机化自适应测试(CAT)模拟表明,该框架比传统文本相似度指标(如 BLEU、余弦相似度)更贴近题目非实质局部依赖指标,并能改善 CAT 选题的估计稳定性与偏差。

研究问题

大规模测评快速发展,自动题目生成(AIG)日益普及,导致“附带内容冗余”(incidental content redundancy)问题加剧:题目中与构念无关的元素(如措辞、情境表述)可能在题目之间无意重复。传统相似度指标(BLEU、余弦相似度)难以同时捕捉造成用户感知冗余的细微结构层和语义层。因此,本文试图构建一个由 LLM 驱动的自动题目相似性分析框架,并检验其在心理测量学指标和 CAT 应用中的效果。

方法/产品要点

  • 提出框架名称:Automated Item Similarity Analysis(AISA),由 LLM 提供能力支撑。
  • 双维度定义相似性:
    • 结构化分解(Structured Decomposition)
    • 语义相关性(Semantic Relatedness)
  • 与传统文本指标进行对比验证。
  • 在 CAT 中引入基于 LLM 相似性约束的选题策略,并与基于传统指标的约束策略进行比较。

主要结果或产业意义

  • 心理测量学验证:LLM 派生的相似性指标与传统文本指标相比,与构念无关局部依赖(construct-irrelevant local dependence)的指标更为一致,并产生更连贯的题目参数分组。
  • CAT 模拟结果:将基于 LLM 的相似性约束纳入选题,能在效率损失很小的情况下提高估计稳定性、降低偏差,优于基于传统指标的约束。
  • 产业意义:该框架可能支持可扩展的题库维护(bank curation)、内容感知的测验组卷(content-aware test assembly)以及对考生体验敏感的自适应测试。

为什么重要

已有相关卡片多关注 AI 在教育或科研中的具体应用或框架,但未涉及大规模测评题目相似性与 LLM 的结合。本条增量在于:首次将 LLM 驱动的相似性分析同时用于心理测量学验证和 CAT 模拟,为题库质量控制提供了从“文本表面相似度”转向“构念无关附带内容感知”的自动化路径,且该框架不依赖人工标注,具备大规模部署潜力。

局限与不确定性

  • 原文仅提供摘要,具体实验数据、样本量、题目类型、评测细节、模型版本等尚未在来源材料中体现,需核实。
  • “LLM 指标与传统指标相比更优”是否具有统计显著性和跨场景稳健性,待核实。
  • CAT 模拟的具体设置(题库规模、能力分布、约束强度、效率度量方式)待核实。
  • 对“结构化分解”和“语义相关性”的具体操作化定义、Prompt 设计或评分方式,待核实。
  • 该框架是否适用于非英语题目或多语言测评,待核实。

可用于图书/PPT/简报的角度

  • 用“题库也会‘撞车’:LLM 如何发现题目间隐藏的重复”作为科普切入点。
  • 展示从“文本相似”到“构念无关内容相似”的维度跃迁。
  • 面向测评机构的案例:在 CAT 中利用 LLM 约束选题,兼顾效率与公平。
  • 将本框架与“自动题目生成”结合,说明 AIG 时代需要新的质量保障工具。

与既有脉络的关系

已有卡片分别涉及医学 AI 编排(LCA)、高等教育 AI 学习助手大规模分析(Syntea)、以及形式化验证的因果推断框架(CausalForge)。本卡片是该系列中首个聚焦“大规模教育测评内容安全”与“LLM 驱动的题目相似性分析”的条目,补充了 LLM 在测评内容质量控制中的应用场景,而非学习行为分析或研究流程自动化。

原始材料

  • 英文标题:A Dual-Dimensional LLM Framework for Automated Item Incidental Content Similarity Analysis in Large-Scale Assessments
  • 英文关键词(根据主题归纳,原页面未明确给出关键词栏):Automated Item Similarity Analysis; Large Language Models; Incidental Content Redundancy; Computerized Adaptive Testing; Psychometric Validation
  • 来源:arXiv:2608.24825v1
  • URL: https://arxiv.org/abs/2608.24825v1
  • PDF: https://arxiv.org/pdf/2608.24825v1
  • 作者:Jing Huang, Jihong Zhang, Hua-Hua Chang
  • 发表日期(来源页面显示):2026-08-25T17:07:16Z
  • 主要分类:cs.AI
  • 摘要(英文原文照录):The rapid expansion of large-scale assessments and the growing adoption of automatic item generation have intensified concerns about incidental content redundancy, where construct-irrelevant elements such as wording or contextual framing become unintentionally repetitive across items. Traditional similarity metrics like BLEU or cosine similarity, often fail to capture the nuanced structural and semantic layers that drive perceived redundancy simultaneously. This study proposes a dual-dimensional framework for Automated Item Similarity Analysis (AISA) powered by Large Language Models (LLMs), operationalizing similarity through Structured Decomposition and Semantic Relatedness. Psychometric validation indicates that LLM-derived metrics align more closely with indicators of construct-irrelevant local dependence and yield more coherent item parameter groupings than traditional text-based measures. The framework is further evaluated through its application in Computerized Adaptive Testing (CAT). Simulations reveal that incorporating LLM-based similarity constraints into item selection improves estimation stability and reduces bias with minimal efficiency trade-offs, outperforming constraints based on conventional metrics. These findings highlight the potential of LLM-powered AISA to support scalable bank curation, content-aware test assembly, and experience-sensitive adaptive testing across diverse assessment contexts.