AI消息速览

CreativeInstruct——可扩展地教LLM在质量、创造性与多样性之间取得平衡

事件日期 2026-08-07 · 学术前沿 · 已接受

事件日期2026-08-07
信息日期2026-08-07
入库日期2026-08-10
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:CreativeInstruct——可扩展地教LLM在质量、创造性与多样性之间取得平衡

一句话结论

据论文摘要,CreativeInstruct 通过让模型学习注入特殊 [StartCreativity] 标记,能在保留后训练模型质量的同时恢复接近基础模型的创造性与多样性;在强化学习场景下,GRPO 用在 CreativeInstruct checkpoint 上比用在普通后训练 checkpoint 上在 AMC 上提升约4%、在 MATH 上提升约5个百分点。

事件概述/研究问题

后训练(post-training)虽然提升了大语言模型(LLM)的能力,但通常会降低输出多样性和创造力,这对显式需要创造力的任务(如故事生成)和隐式需要创造力的任务(如强化学习)都不利。论文提出 CreativeInstruct,一种可扩展的指令微调方法,并引入基于图编辑距离的结构多样性指标。

方法/产品要点

  • 问题诊断:后训练在提升能力的同时削弱多样性和创造力。
  • CreativeInstruct:可扩展的指令微调方法,让 LLM 在“接近基础模型的创造性生成”和“后训练模型的质量”之间取得平衡。
  • 核心机制:学习注入特殊 [StartCreativity] 片段/标记,使生成偏向创造性。
  • 评估指标创新:提出基于图编辑距离的结构多样性指标,捕捉词面/语义指标遗漏的叙事结构层面变化。
  • 推理时高效:不需要在推理时同时运行多个模型。

主要结果或产业意义

  • 叙事生成:CreativeInstruct 的多样性匹配或超过多模型基线和这些输出的蒸馏变体,且不牺牲质量。
  • 人类评估:70.3% 的情况下,标注者认为 CreativeInstruct 的生成比后训练 LLM 的生成更有创造力。
  • 强化学习基座:将 GRPO 应用于 CreativeInstruct checkpoint,相比应用于后训练 checkpoint,AMC 提升约4%,MATH 提升约5个百分点。
  • 产业意义:适合需要在“质量”与“创造性/多样性”之间平衡的应用,如故事生成、创意写作辅助,以及需要探索性的强化学习/推理任务。

为什么重要

这项研究把“后训练损害创造性”视为一个可修复的问题,并给出了一条不需要多个模型参与推理的可扩展指令微调路径。更重要的是,创造性/多样性提升不仅体现在文学生成上,还能改善强化学习在数学推理基准上的表现,说明创造性在 RL/探索中可能是一个被低估的因素。

与既有脉络的关系

本条与已有相关卡片中的 ColBERT 正则化、视频质量评估、Lift3D-VLA 无直接承接关系;它的增量信息聚焦在“LLM 后训练之后的创造力/多样性下降”以及“特殊标记 + 指令微调恢复多样性”,属于 foundation-model 主题下的新方向。

局限与不确定性

  • 摘要未提供训练数据规模、模型规模、计算成本、质量评估的具体指标和数值;这些内容待核实。
  • [StartCreativity] 的插入位置、训练目标、是否依赖特定基座模型,待核实。
  • 是否适用于非英语、非叙事任务,以及超长生成场景,待核实。
  • 人类评估的样本量、评分维度与标注者构成,待核实。
  • “不牺牲质量”的测量方式(自动指标、任务基准等)未在摘要中展开,待核实。

可用于图书/PPT/简报的角度

  • 标题角度:对齐的隐性代价——后训练如何让 LLM 变得更“保守”?
  • 技术角度:用一个特殊标记,在“基础模型的发散”和“后训练的质量”之间做平衡。
  • 评估角度:用图编辑距离看叙事结构多样性,而不只是看词句是否重复。
  • 应用角度:创造力不只是写故事需要;数学推理强化学习中也能看到收益。

原始材料

  • English Title: CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity
  • English Keywords: large language models; instruction tuning; creativity; diversity; structural diversity; reinforcement learning
  • arXiv ID: 2608.07460v1
  • Authors: Ananya Sahu, Mohit Bansal, Elias Stengel-Eskin
  • Published: 2026-08-07(依据 arXiv 元数据)
  • URL: https://arxiv.org/abs/2608.07460v1
  • PDF URL: https://arxiv.org/pdf/2608.07460v1