你在短视频里看到一套“胜率很高”的交易方法,照着历史行情一试,曲线果然漂亮。问题是,这条曲线可能只是从许多指标里碰巧挑出的赢家;真下单后,手续费和滑点还会继续吃掉收益;若再加杠杆,账户甚至未必活得到所谓“长期有效”兑现的那一天。
Adam Darmanin 的 arXiv 论文《Retail Trader’s Ruin》把这三件事放进同一次检验。它测试五类广泛推广的零售信号:趋势、振荡器、K线、成交量和日历规则,另设一个分散化动量策略作为校准基准。最终,振荡器、成交量、日历和K线四项被归为 REFUTED;趋势与动量基准为 INCONCLUSIVE;没有一项获得 SUPPORTED。
这里必须先收紧标题的含义。“集体失灵”是传播性的概括,不等于论文证明所有流行信号永远无效。REFUTED 针对的是预先声明的效果和可部署性主张;INCONCLUSIVE 则是证据不足,不能翻译成“无效”。本文全部结果来自这一篇尚未经过外部同行评审的论文,不能视为跨信源确认。
漂亮回测,要连过三道门
论文不再只问“历史收益是不是正的”,而要求一种策略同时过三关。
第一关是统计优势。研究者同时试很多指标、参数和市场时,即使所有方法都没有真实效果,也容易撞上一条漂亮曲线。这叫多重检验。论文用分层 Benjamini–Yekutieli 校正提高过关门槛,并用 stationary bootstrap——按随机长度的连续行情片段反复抽样——估计置信区间,尽量保留金融数据前后相关的特征。
它还设置了 exposure-matched benchmark,即“持仓暴露匹配基准”。例如,一条日历规则一年只持仓部分时间,就不能简单拿它和全年满仓相比。基准会在信号持仓时同步持有、空仓时持有现金,从而把“少在市场里待了一阵”与真正的择时能力分开。
第二关是经济可行性。回测毛收益要扣掉手续费、买卖价差、滑点和市场冲击。论文以单次往返交易 10 个基点为主要成本设定,并考察 5至20个基点的敏感性。它不只看点估计是否为正,还看置信区间能否越过预先设定的实质效果门槛。换句话说,策略不仅要“看起来赚钱”,证据还得足以说明它赚得有实际意义。
第三关是有限本金下的生存能力。长期平均收益为正,不代表账户能活到长期。杠杆会放大连续亏损,触发追加保证金或强制平仓。论文把已有的收益重抽样送入4,000条路径的模拟,并以一个季度内强平概率的置信区间上界是否低于10%作为生存门槛。
三关采用“与”关系:统计、成本和生存缺一不可。任何一关被明确排除,整体即为 REFUTED;全部通过才是 SUPPORTED;置信区间跨过门槛、样本无法回答时,则保留为 INCONCLUSIVE。
哪些信号真正倒在了门口
振荡器的结果最明确。以 RSI——根据近期涨跌幅度判断“超买”或“超卖”的指标——为代表的策略,在这份样本中不仅没有跑赢暴露匹配基准,Sharpe 差距的置信区间还全部为负;扣除成本后的年化复合收益差距也显著为负。因此,它同时败在统计关和经济关。
日历规则以 Sell-in-May 为代表,即根据月份决定何时持仓。它的统计结果不足以达到预设的实质效果,扣除成本后的收益差距则显著低于零,同样在两关被反驳。
成交量信号采用 OBV——把成交量按价格涨跌方向累计的指标。其统计置信区间上界为0.175,低于论文预设的实质门槛,因此统计主张被排除;经济结果本身仍是不确定。K线部分测试七种形态。七种在未经充分约束时都能得到显著结果,但效果量和交易成本一加入,优势变得微小或反转,最终两关均被判为 REFUTED。这正是回测幻觉最直观的一幕:能找到“显著”,不等于找到可交易的利润。
趋势信号使用50日与200日均线的金叉、死叉。它没有得到支持,但也没有被证伪,因为统计和经济置信区间都太宽,跨过了判定门槛。论文还测试了一个流动性加权、只做多过去表现最强股票的分散化动量基准。它同样未通过统计关,却被归为 INCONCLUSIVE,而非 REFUTED。作者把这视为流程没有把“不确定”粗暴判成“无效”的校准信号;不过,论文也承认,月度样本下的统计关不足以识别典型幅度的动量效果。
结论还会随“多大才算有意义”的门槛变化。在论文的敏感性网格中,REFUTED 的数量从三项到五项不等;但没有任何对象从 REFUTED 翻成 SUPPORTED,动量基准始终保持 INCONCLUSIVE。这说明四项反驳并非对所有门槛完全不变,也说明结果不是简单的“六项全部失败”。
爆仓不是美国情景下的主因
论文按 FINRA 与 ESMA 规则设置杠杆和保证金情景。在美国股票主情景中,达到生存关的五个对象在2倍杠杆下都通过了强平概率门槛。四项 REFUTED 并不是死于爆仓,而是没有同时证明统计优势和成本后收益。K线因只有事件研究、没有连续可交易收益序列,未进入生存模拟。
在杠杆更高的欧盟股票 CFD 情景中,生存关开始产生区分:5倍杠杆下,趋势和振荡器越过10%的强平概率门槛;动量基准的点估计低于10%,但置信区间上界超过门槛,只能算边界状态。杠杆风险因此是真实约束,只是它没有改变这篇论文的主要分类。
为什么值得关注
这项工作的价值不在于又列出一张“无效指标”名单,而在于改变提问方式。传统回测常把统计显著当终点,这篇论文要求策略继续回答两个现实问题:利润能否覆盖成交摩擦,账户能否在杠杆和连续亏损中存活。
研究还尽量处理了常见的幸存者偏差。成交量、K线与动量的横截面检验使用当时真实存在的指数成分,而不是拿今天仍在指数中的赢家倒推历史,并加入退市修正。欧盟市场复验及62个行业、资产和指标组合的异质性检验,也没有出现通过 Benjamini–Yekutieli 校正的正面单元。它们强化了一个克制的判断:偶尔冒出的亮点,在同时考虑搜索次数和成本后很难站稳。
局限与未知
- 论文没有一块从未被研究或调参触及的干净留出样本。stationary bootstrap 衡量的是现有数据内的不确定性,不能替代真正的样本外检验。
- 五类信号使用了不同市场和数据结构;成本采用固定基点近似,也缺少更细的保证金、借券费率和买卖价差数据。结论不能直接外推到所有账户、券商与监管环境。
- 论文尚未经过外部同行评审。动量基准未能通过统计关,也暴露出样本检验能力不足;趋势与动量因此只能写作“尚无定论”,不能写成已经失灵。