24、基差回归与跨品种套利:品种间基差的相关性、多品种回归模型
跨品种套利,说白了就是利用两个相关品种之间的价差波动来赚钱。但很多人一上来就盯着价格差,忽略了基差这个核心变量。我个人的经验是——基差回归模型在跨品种套利中,往往比单纯的价格回归更稳定。为什么?因为基差里包含了期限结构、仓储成本、资金利率这些基本面信息,而价格差里全是噪音。
品种间基差的相关性:你以为是独立,其实是一家人
先问一个问题:螺纹钢和热卷的基差,是各自独立的吗?
答案显然是否定的。它们共享同样的原材料(铁矿石、焦炭),面对同样的下游需求(房地产、基建),只是加工工艺不同。所以它们的基差走势,天然存在高度相关性。
我在项目中遇到过这样的情况:2019年螺纹钢基差大幅走强,热卷基差却纹丝不动。很多人以为这是套利机会,直接做多螺纹基差、做空热卷基差。结果呢?螺纹基差继续走强,热卷基差突然跳水,两边都亏。问题出在哪?他们只看了相关性,没看因果性。
品种间基差的相关性,可以分为三类:
- 强正相关:同产业链上下游品种,如豆粕和豆油、螺纹和热卷。基差走势基本同步,但幅度不同。
- 弱正相关:替代品关系,如玉米和豆粕(饲料替代)、铜和铝(部分工业替代)。基差有时同步,有时背离。
- 负相关:对冲关系,如原油和沥青(裂解利润)、铁矿石和螺纹钢(利润分配)。基差走势相反。
核心观点:跨品种套利不是看价格差,而是看基差差。基差差回归,才是真正的套利逻辑。
多品种回归模型:从两两到N维
两品种的基差回归,用简单的OLS就能搞定。但当你面对三个、四个甚至更多品种时,事情就变得复杂了。比如你想同时交易螺纹、热卷、铁矿石、焦炭这四个品种的基差,怎么建模?
我个人习惯用向量误差修正模型(VECM)。它能把多个品种的基差放在一个系统里,同时估计它们之间的长期均衡关系和短期调整速度。
举个具体的例子。假设我们有三品种:螺纹钢(RB)、热卷(HC)、铁矿石(I)。它们的基差分别记为B_RB、B_HC、B_I。我们想找它们之间的协整关系。
# Python示例:VECM多品种基差回归
import statsmodels.api as sm
from statsmodels.tsa.vector_ar.vecm import VECM
# 假设data是DataFrame,包含三列:B_RB, B_HC, B_I
# 先做Johansen协整检验
result = sm.tsa. Johansen(data, det_order=0, k_ar_diff=1)
print('协整秩:', result.lr1)
print('临界值:', result.cvt)
# 如果协整秩为1,说明存在一个长期均衡关系
# 拟合VECM模型
model = VECM(data, k_ar_diff=1, coint_rank=1, deterministic='ci')
vecm_res = model.fit()
print(vecm_res.summary())
# 查看误差修正项系数(调整速度)
print('调整速度:', vecm_res.alpha)
这里要注意一个坑:协整关系不等于套利关系。我曾经在焦煤、焦炭、螺纹钢三个品种上找到了一组漂亮的协整关系,回测收益曲线完美。但实盘一跑,连续亏损三个月。为什么?因为协整关系是统计上的,但套利需要经济逻辑支撑。焦煤和焦炭的基差受环保政策影响极大,政策一改,协整关系就断了。
避坑指南:多品种回归模型一定要加入经济约束。比如,螺纹和热卷的基差差不能超过轧制成本,铁矿石和螺纹的基差差不能超过炼钢利润。这些约束比统计显著性更重要。
实战框架:多品种基差套利的四步法
我总结了一套流程,每次做跨品种基差套利都按这个来:
- 品种筛选:找产业链相关、流动性好的品种。别碰那些一天成交几千手的冷门品种。
- 基差计算:统一基差定义。现货价格用哪个市场?期货用主力合约还是连续合约?这些细节必须一致。
- 协整检验:用Johansen检验找长期均衡关系。记住,协整秩至少为1,最好不超过2,否则模型太复杂。
- 交易信号生成:根据误差修正项(ECT)的偏离程度开仓。我一般用2倍标准差作为阈值。
小技巧:多品种模型里,每个品种的调整速度不一样。有的品种调整快(比如螺纹钢),有的慢(比如铁矿石)。开仓时,优先做调整速度快的品种,因为你能更快获利了结。
知识体系图:多品种基差回归的核心逻辑
下面这张图展示了整个知识体系的结构。你看,从品种相关性出发,经过协整检验,再到VECM建模,最后生成交易信号。每一步都有坑,每一步都需要经济逻辑支撑。
一个真实的案例:豆粕与菜粕的基差套利
豆粕和菜粕是饲料中的蛋白替代品。它们的基差走势高度相关,但偶尔会出现背离。我记得2022年有一次,豆粕基差因为大豆到港延迟而飙升,菜粕基差却因为水产需求疲软而走弱。两者基差差拉大到历史极值。
我当时的做法是:
- 计算豆粕基差和菜粕基差的协整关系,发现协整秩为1,长期均衡系数约为1.2(即豆粕基差每变动1%,菜粕基差平均变动1.2%)。
- 当前基差差偏离均衡值2.5个标准差,触发开仓信号。
- 做空豆粕基差(卖出现货、买入期货),做多菜粕基差(买入现货、卖出期货)。
- 两周后,大豆到港恢复,豆粕基差回落;水产需求回暖,菜粕基差回升。基差差回归均衡,平仓获利。
关键点:这个案例里,我没有直接做多豆粕、做空菜粕的期货价差,而是做了基差差。为什么?因为基差差回归的是基本面逻辑,而期货价差里还包含了市场情绪、资金博弈等噪音。基差回归模型,说白了就是用基本面信息过滤掉市场噪音。
多品种回归模型的常见陷阱
最后,我列几个实战中容易踩的坑:
| 陷阱 | 表现 | 解决方法 |
|---|---|---|
| 伪协整 | 统计上显著,但经济逻辑不通 | 加入成本约束、利润约束 |
| 参数不稳定 | 协整系数随时间变化 | 使用滚动窗口重新估计 |
| 流动性不足 | 某个品种无法按理论仓位执行 | 优先选主力合约,降低仓位 |
| 政策冲击 | 突然的关税、环保政策改变基差关系 | 设置政策因子作为外生变量 |
嗯,说到这里,我想强调一点:多品种基差回归模型不是万能钥匙。它适合那些产业链清晰、基本面逻辑强的品种组合。如果你拿它去套利比特币和黄金,那肯定不行。选对品种,比选对模型更重要。
我个人习惯在模型跑完之后,手动检查一下每个品种的现货市场情况。比如,如果某个品种的现货市场突然出现大量囤货,那基差可能会短期失真。这时候模型信号再漂亮,我也不会开仓。
好了,关于多品种基差回归模型的核心内容就这些。记住,基差回归的本质是基本面回归,统计工具只是辅助。把经济逻辑放在第一位,模型放在第二位,你的跨品种套利才能稳定盈利。