10、库存数据的来源与处理:官方数据、行业数据与高频数据

做基差交易的人,都绕不开库存数据。

我常说一句话:库存是基差的锚。没有靠谱的库存数据,你的价差分析就是空中楼阁。但问题来了——库存数据从哪来?怎么用?哪些能信?哪些要自己动手处理?

这一章,咱们就把这事彻底讲透。

10.1 官方数据:慢,但权威

官方数据,说白了就是国家统计局、交易所、行业协会定期发布的库存报告。比如中国的铜库存周报、美国的EIA原油库存、LME的仓单数据。

优点很明显:

  • 权威性高,没人敢造假
  • 口径统一,便于历史对比
  • 免费或低成本获取

缺点也很要命:

  • 发布频率低(周度、月度为主)
  • 滞后严重(比如中国社库数据,周五收盘后才出)
  • 颗粒度粗(只给总量,不分地区、不分品级)

我的经验:官方数据适合做长周期趋势判断,不适合短线交易。比如你判断铜的库存拐点,用官方周度数据就够了。但你要做日内基差套利,等官方数据出来,黄花菜都凉了。

避坑指南:我曾经吃过一次亏——某品种的官方库存数据突然大幅跳升,我以为是累库信号,结果后来发现是统计口径调整了。所以,每次数据发布后,先看注释,确认口径是否变化。

10.2 行业数据:快,但杂

行业数据,指的是资讯机构、咨询公司、行业协会自己调研发布的库存数据。比如SMM的铜库存、Mysteel的钢材库存、CCTD的煤炭库存。

这类数据的特点是:

  • 频率高:很多能做到日度甚至实时
  • 颗粒度细:分地区、分仓库、分品级
  • 时效性好:当天调研,当天发布

但问题也明显:

  • 样本偏差:调研覆盖不全,可能漏掉关键仓库
  • 统计口径不统一:不同机构的数据不能直接对比
  • 存在利益冲突:有些机构背后有产业资本,数据可能被操纵

注意:行业数据一定要交叉验证。我习惯的做法是:至少对比三家机构的数据,如果某家数据明显偏离,先标记为可疑,再找原因。

10.3 高频数据:快,但需要处理

高频数据,是最近几年才火起来的。主要来源包括:

  • 卫星遥感数据:比如通过卫星图像估算原油罐区库存
  • 港口进出数据:通过AIS船舶轨迹推算到港量
  • 仓库出入库数据:部分仓库的实时出入库记录
  • 价格反推数据:利用期现价差、月间价差反推库存变化

这类数据的优势是:

  • 实时性极强:可以做到分钟级更新
  • 覆盖面广:理论上可以覆盖全球主要仓储节点
  • 难以操纵:数据来源分散,造假成本高

但缺点也很突出:

  • 噪声大:原始数据需要大量清洗
  • 成本高:卫星数据、港口数据都要付费
  • 解读难度大:需要专业算法才能转化为可用库存数据

我的建议:高频数据适合做日内和短线交易。但如果你没有数据处理能力,别碰。我见过太多人买了卫星数据,结果不会用,最后扔在硬盘里吃灰。

10.4 数据处理:从原始数据到可用信号

不管数据来源是哪,拿到手之后都要处理。我总结了一套标准流程:

  1. 清洗:剔除异常值、补全缺失值、统一时间戳
  2. 对齐:不同来源的数据,要统一到同一时间频率
  3. 标准化:消除口径差异,比如把“吨”和“桶”统一
  4. 去噪:用移动平均、卡尔曼滤波等方法平滑数据
  5. 信号提取:计算库存变化率、库存偏离度等指标

举个实际例子。我处理LME铜库存数据时,会做这样几步:

# 伪代码示例:库存数据处理流程
def process_inventory_data(raw_data):
    # 1. 清洗:剔除0值和异常跳变
    clean_data = remove_outliers(raw_data, threshold=3)
    
    # 2. 对齐:统一到日度频率
    aligned_data = resample(clean_data, freq='D')
    
    # 3. 标准化:计算库存变化率
    aligned_data['change_pct'] = aligned_data.pct_change()
    
    # 4. 去噪:7日移动平均
    aligned_data['smooth'] = aligned_data['change_pct'].rolling(7).mean()
    
    # 5. 信号:计算库存偏离度(当前值 vs 历史均值)
    aligned_data['z_score'] = (aligned_data['smooth'] - 
                               aligned_data['smooth'].mean()) / aligned_data['smooth'].std()
    
    return aligned_data

避坑指南:我曾经在清洗环节犯过错误——把库存数据中的“0”值直接当作缺失值处理了。后来发现,有些仓库确实会库存清零。所以,处理前一定要先了解业务逻辑。

10.5 三种数据的融合策略

单一数据源都有缺陷。我个人的做法是:官方数据定方向,行业数据定幅度,高频数据定时机

具体来说:

  • 用官方周度数据判断库存趋势(累库还是去库)
  • 用行业日度数据估算库存变化幅度
  • 用高频数据捕捉库存拐点和突发事件

举个例子。做原油基差交易时:

  • EIA周度库存报告:判断整体供需格局
  • Genscape日度库存数据:跟踪库欣地区变化
  • 卫星遥感数据:实时监控海上浮仓库存

三者结合,才能形成完整的库存画像。

核心要点:没有完美的数据源,只有合理的组合策略。你想想看,如果某个数据源就能解决所有问题,那市场上早就没有套利空间了。

10.6 知识体系框架

下面这张图,是我自己整理的库存数据体系。你看一眼,就能明白三种数据的关系和定位。

库存数据来源与处理体系 官方数据 统计局/交易所/行业协会 频率:周/月度 特点:权威、滞后 行业数据 资讯机构/咨询公司 频率:日度 特点:快速、样本偏差 高频数据 卫星/港口/仓库实时 频率:分钟/小时 特点:实时、噪声大 数据处理流程:清洗 → 对齐 → 标准化 → 去噪 → 信号提取 融合策略 官方数据定方向 → 行业数据定幅度 → 高频数据定时机 基差交易信号

这张图我用了好几年,每次带新人都会拿出来讲一遍。说白了,库存数据处理的核心就三件事:知道数据从哪来、怎么处理、怎么组合用

最后说一句:数据是死的,人是活的。同样的库存数据,在不同人手里能玩出完全不同的花样。我见过有人用卫星数据做原油基差,年化收益做到30%以上。也见过有人守着官方周度数据,照样稳定盈利。关键不在于数据多高级,而在于你怎么理解、怎么用


公众号:蓝海数据掘金营,微信 deep3321