AI消息速览

超越情绪:金融新闻的结构化信息抽取

事件日期 2026-07-30 · 学术前沿 · 已接受

事件日期2026-07-30
信息日期2026-07-30
入库日期2026-08-01
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:超越情绪:金融新闻的结构化信息抽取

一句话结论

仅用单一情绪分数无法充分刻画金融新闻的预测信息;通过大语言模型抽取多维结构化语义特征,可在股票预测中显著超越单纯的情绪分析,表明金融文本中的“情绪—语义解耦”是系统性的且可利用的。

事件概述或研究问题

传统金融情绪分析在新闻驱动的股票预测中已成为标准组件,但将内容丰富的新闻压缩为单一极性分数会造成信息损失。作者假设金融新闻编码了多个与情绪正交的信息维度——如事件类型、影响范围、时间跨度、语义置信度——这些维度具有独立的预测价值。研究通过大规模实验检验这一假设,并评估结构化信息提取框架相对于传统情绪分析是否带来增量收益。

方法/产品要点

  • 提出一种结构化信息提取框架,使用 LLaMA-3.1-70B 从金融新闻中抽取六个语义维度(具体维度完整列表待核实)。
  • 使用 FNSPID 数据集,包含 41,618 条新闻—股票配对(news–stock pairs) 进行大规模实验。
  • 对比基准特征:使用 FinBERT 生成的金融情绪特征。
  • 评估方式:在线性模型与非线性模型下比较各特征组合的预测性能(以 F1 衡量)。
  • 通过消融实验和特征重要性分析,量化非情绪类结构维度的独立贡献。

主要结果或产业意义

  • FinBERT 情绪特征的表现高度依赖模型复杂度:在非线性模型下 F1=0.576,在线性模型下 F1=0.230,说明情绪与收益之间的关系是高度非线性的。
  • LLM 提取的结构化特征与情绪特征存在系统性分歧:两者在预测信号上的系统性不一致率达 53.5%,表明结构化特征捕捉了情绪之外的正交信息。
  • 组合特征显著优于单一来源:情绪特征 + 结构化特征得到 F1=0.600,显著优于任何单一阵(p < 0.0001),并在全部七种事件类型上保持一致提升。
  • 非情绪结构维度具有独立贡献:消融实验显示,事件类型、影响主体、时间跨度、置信度等结构维度在 FinBERT 之外额外带来 ΔF1 = +0.019。
  • 六个抽取维度的特征重要性较均衡(14%–21%),说明将新闻压缩为单一情绪分数的确会造成显著的信息损失。

为什么重要

这是“已有相关卡片”脉络中的一个新方向:既有工作关注区块链情绪分类、开源大模型生成漏洞威胁信息、智能体轨迹优化,而本卡片聚焦金融新闻的多维结构化信息抽取,并首次系统性量化了“情绪—语义解耦”的预测价值。其增量信息在于:不仅说明大语言模型可以抽取金融结构化信息,还用大规模实验证明这些结构信息与情绪信号正交、可叠加,并且贡献均衡,为多维度金融 NLP 提供了新思路。

局限与不确定性

  • 六个语义维度的具体定义与抽取方法在材料中未完全列出,待核实。
  • 材料未说明 LLaMA-3.1-70B 抽取结构化特征的准确率、运行成本或人工评估结果,待核实。
  • F1 的具体预测目标(如上涨/下跌方向分类)未在材料中明确说明,待核实。
  • 仅基于 FNSPID 单一数据集,结论的泛化性尚需在更多金融新闻数据集上验证。
  • 未提供与更复杂深度学习模型(如直接使用新闻文本端到端预测)的对比,待核实。

可用于图书/PPT/简报的角度

  • “从涨跌情绪到事件语义:金融新闻分析的下一个前沿”
  • “大模型如何把财经新闻变成结构化数据?”
  • “为什么单一情绪分数不够用:来自 4 万条新闻—股票配对的证据”
  • “FinBERT vs. LLaMA-3.1:情绪与结构化信息在股票预测中的互补性”

原始材料

  • 英文标题:Beyond Sentiment: Structured Information Extraction from Financial News
  • 英文关键词:Financial NLP; Structured Information Extraction; Sentiment Analysis; Large Language Models; Stock Prediction; FinBERT; LLaMA-3.1
  • 来源:arXiv:2607.28496v1, cs.CL,发布于 2026-07-30
  • URL:https://arxiv.org/abs/2607.28496v1