通过迭代式生成-去重闭环,使用NVIDIA NeMo Data Designer、NeMo Curator和Nemotron模型,可以在单台8路NVIDIA B200节点上,在约6天内生成超过50万条高质量、类别均衡的金融新闻标题数据集(FinHeadlineMix),有效缓解真实金融数据分布不均和稀有事件缺失的问题。
微调大语言模型(LLM)用于金融自然语言处理受到数据有限且不平衡的制约。真实金融新闻过度代表盈利报告和股票波动,而信用评级变化、产品审批、劳工问题等稀有事件难以大规模获取。合成数据生成可以填补这些缺口,但多样性需要超越单次大规模生成。本工作提出一种迭代式流水线,结合结构化生成、语义去重和高通量合成,最终产出502,536条唯一金融新闻标题,覆盖12个主题加…