知识卡片:超越情绪:金融新闻的结构化信息抽取
一句话结论
仅用单一情绪分数无法充分刻画金融新闻的预测信息;通过大语言模型抽取多维结构化语义特征,可在股票预测中显著超越单纯的情绪分析,表明金融文本中的“情绪—语义解耦”是系统性的且可利用的。
事件概述或研究问题
传统金融情绪分析在新闻驱动的股票预测中已成为标准组件,但将内容丰富的新闻压缩为单一极性分数会造成信息损失。作者假设金融新闻编码了多个与情绪正交的信息维度——如事件类型、影响范围、时间跨度、语义置信度——这些维度具有独立的预测价值。研究通过大规模实验检验这一假设,并评估结构化信息提取框架相对于传统情绪分析是否带来增量收益。
方法/产品要点
- 提出一种结构化信息提取框架,使用 LLaMA-3.1-70B 从金融新闻中抽取六个语义维度(具体维度完整列表待核实)。
- 使用 FNSPID 数据集,包含 41,618 条新闻—股票配对(news–stock pairs) 进行大规模实验。
- 对比基准特征:使用 FinBERT 生成的金融情绪特征。
- 评估方式:在线性模型与非线性模型下比较各特征组合的预测性能(以 F1 衡量)。
- 通过消融实验和特征重要性分析,量化非情绪类结构维度的独立贡献。
主要结果或产业意义
- FinBERT 情绪特征的表现高度依赖模型复杂度:在非线性模型下 F1=0.576,在线性模型下 F1=0.230,说明情绪与收益之间的关系是高度非线性的。
- LLM 提取的结构化特征与情绪特征存在系统性分歧:两者在预测信号上的系统性不一致率达 53.5%,表明结构化特征捕捉了情绪之外的正交信息。
- 组合特征显著优于单一来源:情绪特征 + 结构化特征得到 F1=0.600,显著优于任何单一阵(p < 0.0001),并在全部七种事件类型上保持一致提升。
- 非情绪结构维度具有独立贡献:消融实验显示,事件类型、影响主体、时间跨度、置信度等结构维度在 FinBERT 之外额外带来 ΔF1 = +0.019。
- 六个抽取维度的特征重要性较均衡(14%–21%),说明将新闻压缩为单一情绪分数的确会造成显著的信息损失。
为什么重要
这是“已有相关卡片”脉络中的一个新方向:既有工作关注区块链情绪分类、开源大模型生成漏洞威胁信息、智能体轨迹优化,而本卡片聚焦金融新闻的多维结构化信息抽取,并首次系统性量化了“情绪—语义解耦”的预测价值。其增量信息在于:不仅说明大语言模型可以抽取金融结构化信息,还用大规模实验证明这些结构信息与情绪信号正交、可叠加,并且贡献均衡,为多维度金融 NLP 提供了新思路。
局限与不确定性
- 六个语义维度的具体定义与抽取方法在材料中未完全列出,待核实。
- 材料未说明 LLaMA-3.1-70B 抽取结构化特征的准确率、运行成本或人工评估结果,待核实。
- F1 的具体预测目标(如上涨/下跌方向分类)未在材料中明确说明,待核实。
- 仅基于 FNSPID 单一数据集,结论的泛化性尚需在更多金融新闻数据集上验证。
- 未提供与更复杂深度学习模型(如直接使用新闻文本端到端预测)的对比,待核实。
可用于图书/PPT/简报的角度
- “从涨跌情绪到事件语义:金融新闻分析的下一个前沿”
- “大模型如何把财经新闻变成结构化数据?”
- “为什么单一情绪分数不够用:来自 4 万条新闻—股票配对的证据”
- “FinBERT vs. LLaMA-3.1:情绪与结构化信息在股票预测中的互补性”
原始材料
- 英文标题:Beyond Sentiment: Structured Information Extraction from Financial News
- 英文关键词:Financial NLP; Structured Information Extraction; Sentiment Analysis; Large Language Models; Stock Prediction; FinBERT; LLaMA-3.1
- 来源:arXiv:2607.28496v1, cs.CL,发布于 2026-07-30
- URL:https://arxiv.org/abs/2607.28496v1