5、基差回归模型的理论基础:OLS回归原理、最小二乘法、回归系数的经济含义
聊到基差回归模型,很多人第一反应就是「拿历史数据跑个线性回归」。嗯,这话没错,但你要是真这么干,大概率会踩坑。我刚开始做基差交易那会儿,也以为回归就是调个包、看个R²就完事了。结果呢?模型在样本内拟合得漂漂亮亮,一到实盘就崩。
为什么会这样?说白了,你没搞懂OLS回归到底在干什么,也没理解回归系数背后的经济含义。今天我就把这层窗户纸捅破。
5.1 OLS回归原理:最小二乘法到底在干啥?
OLS,全称是Ordinary Least Squares,普通最小二乘法。名字听着唬人,其实逻辑特别朴素。
你想想看,我们做基差回归,本质上就是想找一条直线,让它尽可能「贴近」所有数据点。这条直线长这样:
Y = β₀ + β₁X + ε
其中Y是基差(或者基差的变化量),X是某个影响因素(比如库存、持仓、期限结构斜率),β₀是截距,β₁是斜率,ε是残差。
那问题来了:什么叫「尽可能贴近」?
最小二乘法给出的答案是——让所有数据点到这条直线的垂直距离的平方和最小。注意,是平方和,不是绝对值之和。为什么用平方?两个原因:
- 数学上方便:平方函数可导,能直接求极值
- 惩罚大误差:平方会让大的偏离被放大,模型会更在意那些「离谱」的点
核心公式:最小二乘法要最小化的目标函数是
min Σ (Yᵢ - β₀ - β₁Xᵢ)²
对β₀和β₁分别求偏导,令其等于0,就能解出最优的回归系数。
我在项目中遇到过一件事:有一次做豆粕基差回归,数据里有个极端值——某天基差突然飙到历史最高。如果用最小二乘法,这个点会把整条回归线「拉偏」。后来我改用稳健回归(Huber估计),结果就好多了。所以啊,OLS虽然经典,但遇到异常值要小心。
5.2 回归系数的经济含义:别只看数字
很多交易员跑完回归,看一眼p值小于0.05就欢呼「显著!」,然后直接拿系数去建策略。这是大忌。
回归系数不是单纯的数学数字,它背后有明确的经济含义。
| 系数 | 数学含义 | 经济含义(基差回归场景) |
|---|---|---|
| β₀(截距) | 当X=0时,Y的期望值 | 当影响因素为0时,基差的「基准水平」 |
| β₁(斜率) | X每变动1单位,Y平均变动β₁单位 | 影响因素每变化1个单位,基差预期变化多少 |
| ε(残差) | 实际值与拟合值的差异 | 基差的「非系统性波动」,也就是套利机会所在 |
举个例子。假设你跑出来:
基差 = 50 + 2.3 × 库存变化率
这个2.3意味着什么?库存变化率每增加1%,基差平均扩大2.3个点。如果你看到库存数据突然飙升,按照这个模型,基差应该会走阔。这时候你就可以考虑做多基差(买现货抛期货)。
我的经验:回归系数一定要结合业务逻辑去验证。我曾经跑出一个系数为负的模型,统计上显著,但经济逻辑完全说不通——库存增加反而让基差收窄?后来发现是数据时间窗口选错了,用了交割月附近的数据,基差被逼仓效应扭曲了。
5.3 OLS回归的假设条件:不满足就别硬用
OLS回归有五个经典假设,任何一个被违反,结果都可能出问题。我列出来,你对照着检查:
- 线性关系:X和Y的关系是线性的。如果不是,考虑加平方项或对数变换
- 误差独立:残差之间不能有自相关。时间序列数据最容易犯这个错
- 同方差性:残差的方差是常数。如果方差随X变化,用异方差稳健标准误
- 误差正态分布:残差服从正态分布。样本量大的时候可以放宽
- 无多重共线性:自变量之间不能高度相关。比如同时把「库存」和「库存变化率」放进去,大概率会出问题
避坑指南:我曾经在螺纹钢基差回归中,同时用了「螺纹钢库存」和「热卷库存」两个变量。结果两个系数的标准误都特别大,t值不显著。后来一查,这两个变量相关系数0.89——典型的共线性问题。解决办法是只保留一个,或者用主成分分析降维。
5.4 知识体系框架图
下面这张图把本章的核心逻辑串起来了。你看一遍,应该能对OLS回归在基差交易中的角色有个整体把握。
5.5 实战中的几个关键点
理论说完了,聊点实际的。你在用OLS做基差回归时,这几个地方一定要盯紧:
- 数据频率要匹配:如果你用日度基差数据,自变量也必须是日度。用周度库存去回归日度基差,时间错位会搞出伪回归
- 滞后项要考虑:基差对库存变化的反应往往有滞后。我习惯把自变量滞后1-3期都试一遍,看哪个滞后期效果最好
- 滚动窗口训练:基差关系不是一成不变的。我一般用过去60个交易日的数据滚动训练,每天更新一次回归系数
- 残差要画图看:别只看数字。把残差序列画出来,看看有没有明显的趋势或周期性。如果有,说明模型漏掉了重要变量
一句话总结:OLS回归是基差交易的基础工具,但前提是你得理解系数在说什么、假设条件是否满足。否则,你跑出来的不过是一堆漂亮的数字,跟赚钱没什么关系。