10、库存数据的来源与处理:官方数据、行业数据与高频数据
做基差交易的人,都绕不开库存数据。
我常说一句话:库存是基差的锚。没有靠谱的库存数据,你的价差分析就是空中楼阁。但问题来了——库存数据从哪来?怎么用?哪些能信?哪些要自己动手处理?
这一章,咱们就把这事彻底讲透。
10.1 官方数据:慢,但权威
官方数据,说白了就是国家统计局、交易所、行业协会定期发布的库存报告。比如中国的铜库存周报、美国的EIA原油库存、LME的仓单数据。
优点很明显:
- 权威性高,没人敢造假
- 口径统一,便于历史对比
- 免费或低成本获取
缺点也很要命:
- 发布频率低(周度、月度为主)
- 滞后严重(比如中国社库数据,周五收盘后才出)
- 颗粒度粗(只给总量,不分地区、不分品级)
我的经验:官方数据适合做长周期趋势判断,不适合短线交易。比如你判断铜的库存拐点,用官方周度数据就够了。但你要做日内基差套利,等官方数据出来,黄花菜都凉了。
避坑指南:我曾经吃过一次亏——某品种的官方库存数据突然大幅跳升,我以为是累库信号,结果后来发现是统计口径调整了。所以,每次数据发布后,先看注释,确认口径是否变化。
10.2 行业数据:快,但杂
行业数据,指的是资讯机构、咨询公司、行业协会自己调研发布的库存数据。比如SMM的铜库存、Mysteel的钢材库存、CCTD的煤炭库存。
这类数据的特点是:
- 频率高:很多能做到日度甚至实时
- 颗粒度细:分地区、分仓库、分品级
- 时效性好:当天调研,当天发布
但问题也明显:
- 样本偏差:调研覆盖不全,可能漏掉关键仓库
- 统计口径不统一:不同机构的数据不能直接对比
- 存在利益冲突:有些机构背后有产业资本,数据可能被操纵
注意:行业数据一定要交叉验证。我习惯的做法是:至少对比三家机构的数据,如果某家数据明显偏离,先标记为可疑,再找原因。
10.3 高频数据:快,但需要处理
高频数据,是最近几年才火起来的。主要来源包括:
- 卫星遥感数据:比如通过卫星图像估算原油罐区库存
- 港口进出数据:通过AIS船舶轨迹推算到港量
- 仓库出入库数据:部分仓库的实时出入库记录
- 价格反推数据:利用期现价差、月间价差反推库存变化
这类数据的优势是:
- 实时性极强:可以做到分钟级更新
- 覆盖面广:理论上可以覆盖全球主要仓储节点
- 难以操纵:数据来源分散,造假成本高
但缺点也很突出:
- 噪声大:原始数据需要大量清洗
- 成本高:卫星数据、港口数据都要付费
- 解读难度大:需要专业算法才能转化为可用库存数据
我的建议:高频数据适合做日内和短线交易。但如果你没有数据处理能力,别碰。我见过太多人买了卫星数据,结果不会用,最后扔在硬盘里吃灰。
10.4 数据处理:从原始数据到可用信号
不管数据来源是哪,拿到手之后都要处理。我总结了一套标准流程:
- 清洗:剔除异常值、补全缺失值、统一时间戳
- 对齐:不同来源的数据,要统一到同一时间频率
- 标准化:消除口径差异,比如把“吨”和“桶”统一
- 去噪:用移动平均、卡尔曼滤波等方法平滑数据
- 信号提取:计算库存变化率、库存偏离度等指标
举个实际例子。我处理LME铜库存数据时,会做这样几步:
# 伪代码示例:库存数据处理流程
def process_inventory_data(raw_data):
# 1. 清洗:剔除0值和异常跳变
clean_data = remove_outliers(raw_data, threshold=3)
# 2. 对齐:统一到日度频率
aligned_data = resample(clean_data, freq='D')
# 3. 标准化:计算库存变化率
aligned_data['change_pct'] = aligned_data.pct_change()
# 4. 去噪:7日移动平均
aligned_data['smooth'] = aligned_data['change_pct'].rolling(7).mean()
# 5. 信号:计算库存偏离度(当前值 vs 历史均值)
aligned_data['z_score'] = (aligned_data['smooth'] -
aligned_data['smooth'].mean()) / aligned_data['smooth'].std()
return aligned_data
避坑指南:我曾经在清洗环节犯过错误——把库存数据中的“0”值直接当作缺失值处理了。后来发现,有些仓库确实会库存清零。所以,处理前一定要先了解业务逻辑。
10.5 三种数据的融合策略
单一数据源都有缺陷。我个人的做法是:官方数据定方向,行业数据定幅度,高频数据定时机。
具体来说:
- 用官方周度数据判断库存趋势(累库还是去库)
- 用行业日度数据估算库存变化幅度
- 用高频数据捕捉库存拐点和突发事件
举个例子。做原油基差交易时:
- EIA周度库存报告:判断整体供需格局
- Genscape日度库存数据:跟踪库欣地区变化
- 卫星遥感数据:实时监控海上浮仓库存
三者结合,才能形成完整的库存画像。
核心要点:没有完美的数据源,只有合理的组合策略。你想想看,如果某个数据源就能解决所有问题,那市场上早就没有套利空间了。
10.6 知识体系框架
下面这张图,是我自己整理的库存数据体系。你看一眼,就能明白三种数据的关系和定位。
这张图我用了好几年,每次带新人都会拿出来讲一遍。说白了,库存数据处理的核心就三件事:知道数据从哪来、怎么处理、怎么组合用。
最后说一句:数据是死的,人是活的。同样的库存数据,在不同人手里能玩出完全不同的花样。我见过有人用卫星数据做原油基差,年化收益做到30%以上。也见过有人守着官方周度数据,照样稳定盈利。关键不在于数据多高级,而在于你怎么理解、怎么用。
公众号:蓝海数据掘金营,微信 deep3321