在本体学习(Ontology Learning, OL)任务上,更大的 LLM 并不总是带来更一致的性能提升;受控评测显示,模型架构与谱系可能比参数规模更重要,且在稠密 Qwen3.5 谱系中,规模增大主要改善精确率而非召回率。
该研究针对一个尚未被充分刻画的问题:LLM 规模到底如何影响本体学习性能?作者采用 OntoLearner 检索增强生成流水线,对 13 个模型做了受控比较,覆盖稠密(dense)与混合专家(Mixture-of-Experts)变体、Qwen3.5/Qwen3.6 谱系以及专有 GPT 发布版本。评测任务包括术语类型标注、分类体系发现和非分类关系抽取,数…