做行为金融、舆情与股价联动、市场情绪预测的同学看过来!很多小伙伴研究新闻情绪对美股的影响时,要么找不到高质量、长周期的财经新闻文本,要么不会做NLP情绪打分,还要自己手动对齐行情数据,前处理工作量巨大,根本没法直接跑实证。本期给大家整理美股财经新闻情绪×市场行情全量整合数据集,覆盖2020年至今完整周期,包含原始新闻逐条情绪评分、日度聚合情绪指标、三大指数(标普500/纳指/道琼斯)量价数据、VIX恐慌指数,以及已经做好特征工程的机器学习面板,开箱即可用于情绪传导、事件研究、收益预测等实证分析,省去文本爬取、NLP打分、数据对齐全部工作。配套附赠4套完整可运行Python分析代码,全部中文注释、本地路径直接运行,涵盖数据探索、统计回归、机器学习预测、时序预测与投资组合优化全流程,论文实证章节直接套用。一、数据集核心亮点
✅ 专业情绪打分:采用VADER金融文本专用模型,对新闻标题+摘要复合评分,compound值-1到+1精准量化✅ 权威来源加权:路透、彭博、WSJ、FT、CNBC五大高可信度媒体1.5倍权重,过滤低质噪音✅ 全市场覆盖:SPY标普500、QQQ纳斯达克100、DIA道琼斯三大ETF+VIX恐慌指数,量价指标齐全✅ 多维度情绪指标:均值/中位数/标准差、正负占比、加权复合分、EMA均线、情绪动量一应俱全✅ 6个文件分层设计:从原始新闻→日度聚合→行情数据→合并面板→ML 特征包,按需取用不用二次加工✅ 时间跨度充足:市场数据覆盖2020年至今,包含疫情、加息、AI行情完整周期,事件研究样本充足✅ 配套4套Python分析代码,全部中文注释,本地路径直接运行,无需自行搭建分析框架✅ CC0公共领域协议,学术论文、商业项目均可免费使用,无版权纠纷二、数据集整体概览
1. 基础信息
- 总文件数:6个CSV数据文件+4套Python分析代码
- 适用软件:Python/R/Stata/Excel全兼容
2. 情绪评分方法说明
每条新闻使用VADER模型对「标题+摘要」联合打分,compound得分范围−1.0(极度负面)到+1.0(极度正面)。高可信度来源(Reuters、Bloomberg、WSJ、FT、CNBC)在日度加权聚合时享受1.5×权重,更贴近专业市场信息传导逻辑。三、6个数据文件详细说明
1. news_sentiment_raw.csv 原始新闻情绪逐条数据
核心用途:文本级分析、单条新闻事件研究、自定义情绪聚合 | | |
| | |
| | |
| | |
| | |
| | |
| | |
| | |
| | |
| | positive/negative/neutral三分类 |
| | |
2. news_sentiment_daily.csv 日度情绪聚合面板
3. market_prices.csv 三大指数+VIX全量行情
核心字段(SPY/QQQ/DIA 三套结构一致):4. sentiment_market_panel.csv 情绪+市场合并主分析文件
核心用途:主回归、相关性分析首选,无需手动merge | | |
| | |
| | |
| | low/normal/elevated/extreme |
| | |
| | |
5. ml_features.csv 机器学习特征工程版
| |
| |
| sent_rolling_mean/std_5/10/20d |
| |
| sent_x_article_count(情绪×新闻量) |
| |
| |
四、配套Python分析代码(4套全中文注释)
本次附赠4套完整可运行的Python分析脚本,覆盖从数据探索到高级建模全流程,全部中文注释、本地路径、开箱即用,金融实证论文直接套用。脚本1:数据探索与可视化功能
功能:一键加载全部6个数据文件,自动统计缺失值、输出描述性统计,生成8张专业可视化图表。
核心输出:情绪趋势图、市场行情走势图、新闻来源分析、情绪-收益散点图等。
使用方式:修改DATA_DIR为本地数据路径,直接运行即可在output目录生成全部图表。
# 核心配置示例DATA_DIR = "./data" # 数据存放目录OUTPUT_DIR = "./output" # 图表输出目录
脚本2:情绪-市场相关性与统计回归分析
功能:一键加载全部6个数据文件,自动统计缺失值、输出描述性统计,生成8张专业可视化图表。核心输出:情绪趋势图、市场行情走势图、新闻来源分析、情绪-收益散点图等。使用方式:修改DATA_DIR为本地数据路径,直接运行即可在output目录生成全部图表。# 回归示例model = ols('spy_return_next1d ~ weighted_compound + vix_close + spy_return_1d', data=df).fit()
脚本3:机器学习预测建模
功能:专业金融时序预测框架,采用滚动时间序列交叉验证(Walk-forward CV)避免未来信息泄露,对比逻辑回归、随机森林、XGBoost三种模型。
核心功能:
- 基于预测信号的简单策略回测(累计收益、夏普比率、最大回撤)
# 滚动验证参数train_window=252 # 训练窗口:1年交易日test_window=20 # 测试窗口:1个月step=20 # 滚动步长
脚本4:Prophet时序预测与投资组合优化
功能:Facebook Prophet时间序列预测+情绪择时策略+马科维茨均值方差优化,三位一体。
核心模块:
- Prophet 预测:基础单变量预测vs加入情绪外生变量的多变量预测,对比准确率提升
- 情绪择时策略:简单情绪择时、反向情绪策略、情绪动量策略,三套策略绩效对比
- 马科维茨优化:SPY/QQQ/DIA三大指数资产配置,求解最小方差组合、最大夏普组合,绘制有效前沿
# 可投资产assets = ['SPY 标普500', 'QQQ 纳斯达克100', 'DIA 道琼斯']# 输出:最小方差组合权重、最大夏普组合权重、有效前沿曲线
代码使用说明
- 环境依赖:Python 3.8+,需安装pandas、numpy、matplotlib、seaborn、scikit-learn、statsmodels、scipy等基础库;Prophet和 XGBoost为可选依赖,未安装时会自动跳过对应模块。
- 路径配置:所有脚本统一使用DATA_DIR="./data"作为数据目录,将6个CSV文件放入data文件夹即可运行,无需修改其他路径。
- 输出结果:所有图表自动保存到./output目录,统计结果直接打印到控制台。
- 论文复用:代码结构清晰、注释详尽,可直接用于行为金融、市场情绪、量化投资方向的本科 / 硕博论文实证章节。
五、适配研究场景 & 推荐用法
- 行为金融:新闻情绪对股价的传导效应用weighted_compound对次日收益做回归,检验情绪是否具有预测性;分VIX高低区制做异质性分析。
- 事件研究:重大新闻冲击下的市场反应筛选compound极值日作为事件窗口,计算CAR累计超额收益。
- 情绪动量交易策略回测基于sent_momentum信号构建多空组合,回测年化收益与夏普比率。
- 机器学习:股价涨跌预测直接使用ml_features.csv,用XGBoost/LSTM等模型训练次日涨跌分类器。
- VIX 与情绪联动研究检验负面新闻占比是否领先VIX上升,验证情绪→恐慌指数传导路径。
- 不同主题新闻的差异化影响按topic字段拆分通胀、衰退、盈利、政策等子主题,分别检验对市场的冲击强度。
- 投资组合优化结合情绪信号做动态资产配置,优化三大指数配置权重。
六、数据使用注意事项
- 情绪数据与交易日严格对齐,非交易日无行情数据,合并后自动剔除;
- weighted_compound为推荐核心情绪指标,比简单均值更能反映专业媒体影响力;
- VADER为英文金融文本专用模型,对英文财经新闻适配性优于通用大模型打分;
- ml_features.csv已做好滞后项与滚动特征,直接划分训练集测试集即可建模;
- CC0协议可自由商用,但建议在论文或项目中注明数据来源。
💡 实操小提示
Python 情绪 - 收益相关性快速检验
import pandas as pddf = pd.read_csv("sentiment_market_panel.csv")# 核心情绪指标与次日收益相关系数corr = df[["weighted_compound", "spy_return_next1d"]].corr()print(corr)# 按VIX区制分组看相关性print(df.groupby("vix_regime")["weighted_compound"].corr(df["spy_return_next1d"]))
Stata 基础回归示例
导入sentiment_market_panel.csv后,可直接运行:
reg spy_return_next1d weighted_compound sent_momentum vix_pct_chg, robust
研究进阶建议
负面新闻占比(pct_negative)对下跌行情的解释力通常强于正面新闻,建议做非对称效应检验;
- 情绪动量(sent_momentum)在震荡市中预测效果更显著,牛市中信号容易钝化。
💡 数据获取与使用说明
1. 数据 & 代码包获取方式
本次全套6个CSV数据文件+4套Python分析代码包为公益科研分享,无任何付费门槛:关注公众号,后台回复关键词「s003」,即可获取百度/夸克网盘下载链接;
2. 免责声明与使用规范
本数据集遵循CC0公共领域协议,仅用于学术学习、实证研究,不构成任何投资建议。严禁将数据集、衍生加工代码、处理后数据用于付费售卖、商业投顾服务等盈利行为,违者责任自负。数据为程序自动抓取与计算,不定期人工复核,但不绝对保证零误差,实证前建议少量样本交叉校验。如涉及数据版权相关问题,请后台留言,我们将第一时间下架处理。