Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.066 — 2026-09-08
NEWS 约 6 分钟

复现崩塌:2.30夏普为何变负

一篇无代码的统计套利论文报出夏普2.30,复现却全线为负:问题可能不只在模型,也在数据、成本与实现。

你照着菜谱做一道菜,原作者端出来的是满分成品,你得到的却完全不能入口。量化研究也会遇到这种落差,而且代价更高:论文中的历史收益可能很漂亮,真正重做时却方向相反。一名 Reddit 复现者尝试重建无公开代码的神经注意力统计套利模型,原论文所称的扣费后夏普比率为 2.30,他算出的 K=30 平均样本外夏普却是 −0.698。

夏普比率(Sharpe ratio)粗略衡量每承担一单位波动获得多少超额收益。2.30通常意味着风险调整后表现很强;负数则意味着连现金基准都可能跑不赢。这场复现因此值得看。但先说清信源限制:目前全部结果都来自同一篇 Reddit 帖子。原论文、作者代码、原始结果文件和独立复现都未进入供稿,以下数字均是发帖者的报告,不能视为已经交叉验证。

他是怎么重做的?

原工作名为《Neural Attention Factor Models for Statistical Arbitrage》。统计套利,是寻找一组股票价格对历史关系的短期偏离,通常同时做多和做空,尽量削弱大盘涨跌的影响。模型中的 K 可以理解为要提取的潜在共同因素数量。

据复现者转述,原论文在24年美国股票数据上、K=30 时得到扣费后夏普2.30,但没有发布代码。没有代码意味着复现者只能根据文字重新决定数据清洗、特征生成、交易时间和成本计算等细节。对回测——把交易规则放进历史数据模拟——来说,这些细节足以改写结果。

复现者使用2016年6月至2026年8月的 Russell 1000 市值前500只股票,共2,542个交易日。样本包含835只曾经入选的股票,并保留336只退出成分股在存续期间的数据,以减轻“只看活到今天的赢家”造成的偏差。

他用2016至2023年训练,2024至2026年做样本外评估。所谓样本外,就是用模型训练时没见过的数据考试。实验采用38个特征、训练100个 epoch(模型完整学习一遍训练数据称为一个 epoch),每种配置跑3个 seed——即用不同随机初始状态重复训练,并计入5个基点交易成本和1个基点做空成本。一个基点等于0.01个百分点。

基本面数据来自 SEC EDGAR,并按公司实际申报日滞后:10-Q季报中位滞后38天,10-K年报中位滞后58天,重述数据被排除。这样做是为了避免“偷看未来”,即让模型在历史某天使用当时尚未公开的信息。

不是一次走运或倒霉

复现者报告,所有测试的 K 值平均样本外夏普都为负:K=1 为 −1.338,K=5 为 −0.783,K=8 为 −1.735,K=15 为 −1.407,K=30 为 −0.698。K=30 虽然最不差,而且3个 seed 的标准差只有0.056,但这只说明该实现对随机初始化较稳定,不能证明结果能跨时期成立。

训练过程表面上没有失控。发帖者称,训练指标 net_SR 从 −9.9升至 +0.10;解释方差 exp_var 也从 K=1 时的0.098升至 K=30 时的0.282。换句话说,模型确实在训练数据里学到了某种稳定结构,但这种结构到了未见数据中没有转化成收益。至于它是否真的“反转”,仍只是复现者的解释,并无独立验证。

更值得注意的是,简单基准也给出了警报。同一股票池上的确定性 PCA 残差均值回归策略,在 K=1 至50及每个日历年中均为负。PCA(主成分分析)是一种把许多股票的共同波动压缩成少数因素的方法;残差均值回归则押注偏离共同关系的价格会回去。K=30 时,该基准毛收益为 −0.59%,成本为5.86%,净收益为 −6.45%,30日信号的年换手率高达9,190%。这说明交易频率和成本口径可能对结论有决定性影响。

但同一股票池、同一窗口下,weekly 1/N 基准的夏普为 +1.363。1/N 是最朴素的平均配置:把资金大致均分,并按周调整。复杂模型全线为负而简单规则为正,至少说明问题不能轻易归咎于这段市场“完全没有机会”。

真正的问题不是谁输谁赢

“2.30变成负数”很抓眼球,却不能直接证明原模型失效。原论文与复现的样本期、股票池、基本面数据源、训练切分和成本假设不同;特征数也是39对38。任何一项差异,都可能让两个回测不再是同一道题。

这恰好点出可复制性的价值:它不只检查结论,还逼研究者把隐藏的实现选择说清楚。量化金融长期存在“factor zoo”争论,即研究者发现的收益预测指标多得像动物园。据 The Journal of Finance 和 Oxford Academic《Significance》所述,Harvey、Liu和Zhu曾清点至少316个已发表因子,质疑大量尝试会降低漂亮结果的可信度;后来 Jensen 等人用153个因子和93个国家的数据提出反驳,并公开代码与数据。争论没有简单结论,但公开材料能让争论从猜测走向核验。

局限与未知

  • 帖子标题写复现夏普 −0.64,正文表格却是 K=30 平均值 −0.698。两者不能混用,本文采用表格值,但仍需原始文件核验。
  • 复现只使用一次时间切分,样本外约两年八个月。它能提出警报,尚不足以证明跨时期稳健性。
  • 供稿在发帖者描述修复 look-ahead(前视偏差)处被截断,具体错误、修复范围和复核材料不完整,因此也不能排除其他实现偏差。

眼下最稳妥的结论不是“论文错了”,也不是“复现者写错了代码”。而是:当高夏普策略没有代码,且结果对数据、成本和交易细节高度敏感时,2.30只是一个有待复核的研究结果,不是可以直接相信的交易事实。


供稿材料 SOURCES — 1

← 返回 2026-09-08 · 量化板块