你让 AI 连续猜一百次硬币走势,再只展示猜得最准的那一次,它看起来很可能像个高手。量化交易也有类似陷阱:大语言模型(LLM)可以低成本批量生成策略,而回测——把交易规则放进历史数据,观察过去的收益与风险——总能从大量尝试中挑出几个漂亮结果。问题是,这些策略究竟发现了规律,还是偷看了答案、碰巧走运?
Eray Gençay 的论文提出一套面向 LLM 策略发现的评估系统。它抓住两件事:先从工具层面禁止策略使用未来信息,再把 AI 尝试过的每个候选方案记账,按真实搜索规模提高证据门槛。论文在两个资产池中测试这套方法,并报告了一个并不讨喜、却很重要的结果:被动持有基准可以获得认证,但实验中的 LLM 策略没有一个过关。
下文数字与结论均来自这篇论文。它目前是唯一信源,部分强结论尚无外部复现,因此应视为作者在其特定实验设置下得到的结果。
第一扇门:别让 AI 拿到未来答案
前视偏差(look-ahead bias)是指策略在某个历史时点用了当时还不知道的数据,等于带着答案参加考试。比如用“明天的收益”决定今天买什么,回测自然会好得离谱。更隐蔽的数据泄漏,也可能发生在特征计算、股票筛选或测试环节。
论文没有仅靠提示词要求 LLM“不要偷看”,而是限制它能够调用的工具。AI 只能用注册并验证过的特征、信号节点和投资组合模板来拼装策略;涉及未来信息的特征不在可选清单里。参数、节点引用和外部事件的发布时间也会经过程序检查。换句话说,危险操作不是“禁止但仍可执行”,而是根本无法表达。
这套约束还有一个附带效果:它减少了模型胡编参数。作者用一个直接输出 JSON、但没有循环内验证的对照系统运行 60 次,60 个方案全部因特征名或参数无效而被拒。使用验证工具后,gpt-4.1 的百次搜索中有 99 个方案有效;claude-sonnet-5 有 80 个有效。这里的提升说明系统更会生成可执行方案,不代表这些方案更会赚钱。
为什么统计检验抓不住作弊者
论文故意放入一个能看到次日收益的“oracle”策略,用它测试统计校正能否代替防泄漏。结果很极端:该策略在设计期的 Sharpe ratio 为 34.7,评估期达到 51.5,Deflated Sharpe Ratio(DSR)为 1.00。
Sharpe ratio 用单位波动对应的收益衡量风险调整后表现。DSR 则进一步考虑研究者试过多少方案,避免把海量搜索中的幸运冠军误当成真本事。论文还使用 PBO,即“回测过拟合概率”,检查样本内赢家换到其他数据块后是否掉队。
但这些统计工具默认输入数据本身可信。oracle 连评估期都持续使用未来信息,所以依然能顺利过关。这不表示 DSR 或 PBO 通常无效,只说明它们解决的是“从许多正常回测中挑到幸运赢家”,无法修复被污染的信息源。防泄漏与统计校正是两道不同的门。
第二扇门:AI 每试一次,都要记账
多重检验与搜索偏差的直觉很简单:候选策略越多,仅凭运气撞出高分的机会越大。LLM 恰好会把这个问题放大。它能不断提出、测试和修改方案,操作者最后可能只看到冠军,却不知道冠军背后躺着多少失败者。
论文为此设置“试验账本”,记录搜索过程中每一次不同的策略评估。系统再依据真实试验次数和各次 Sharpe 的分布,计算不断上升的 DSR 门槛。作者绘制的“蒸发曲线”显示:随着尝试增加,最佳样本内 Sharpe 确实越来越高,但证据门槛涨得更快。AI 的高产在这里不是免费能力,而是一笔必须偿还的统计债务。
这也解释了为什么预注册假设——先写清要检验什么,再看结果——应该面对较低门槛。它只押一个事先提出的观点;暴力搜索则试过大量变体,必须拿出更强证据。论文不是偏爱人类,而是按实际搜索次数收费。
漂亮回测过了真关吗?
主要实验使用两个资产池:一个是包含 453 只股票的时点一致美国股票数据,另一个是覆盖多类资产的 39 只 ETF。股票池会依据当时可得的过去流动性重新筛选。回测计入佣金、买卖价差、平方根市场冲击和做空借券成本;股票实验留出 2022—2025 年,ETF 实验留出 2017—2025 年作评估期。
在 gpt-4.1 的百候选搜索中,最佳方案结合 RSI——衡量近期涨跌强弱的指标——与成交量标准分数,并按月重新排序。它的设计期 Sharpe 为 1.69,高于买入并持有的 1.15。若只展示这两个数字,故事已经相当诱人。
但账本累计了 102 次试验后,DSR 所要求的 Sharpe 门槛升至 1.21,该策略的 DSR 只有 0.86,未达到论文采用的 0.95 水平。随后打开从未供搜索使用的评估窗口,策略 Sharpe 降到 0.18;买入并持有为 0.60。这里 PBO 反而只有 0.01,因为冠军在一群整体较弱的候选者中仍保持相对排名,却失去了绝对收益优势。最终是样本外置信区间——对真实表现可能范围的估计——抓住了崩塌。
换用 claude-sonnet-5 后,搜索行为不同,但结论相同。它探索了 39 种特征组合,gpt-4.1 为 22 种;其最佳策略设计期 Sharpe 仅为 0.44,样本外继续恶化。五次独立的 gpt-4.1 重复实验也都没有策略通过认证。这个“全部失败”只适用于论文所选模型、资产、成本、窗口和搜索预算,不能外推成 LLM 永远找不到有效策略。
这套裁判并非只会判输
如果评估框架什么都拒绝,它也没有太大价值。论文在 39 只 ETF、九年评估窗口的实验中,认证了 SPY 和等权多资产买入并持有:两者样本外 Sharpe 分别为 0.85 和 0.71,置信区间排除了零。作者所说的“认证”,指的正是样本外 Sharpe 的置信区间不含零,而不是承诺未来必然盈利。
一些主动策略虽然获得正收益,证据仍不够。时间序列动量——根据单项资产自身过去趋势决定持有或离场——样本外 Sharpe 为 0.49,却未获认证。随机权重组合在九年里也能赚钱,恰好说明“样本外盈利”本身仍不足以证明技巧。
论文还把一名人类交易员的生产规则系统放进同一套评估。它被表达为包含 84 个节点的状态化规则,并先与原 PineScript 实现逐根价格柱核对,四类进出条件没有不一致。该系统在开发期盈利,但九年评估期没有延续优势,并落后于持有黄金。统一工具的意义正在这里:AI 和人类都不能凭身份获得更宽松的裁判。
为什么值得关注
这篇工作的重点不是又造了一台“策略工厂”,而是重新定义工厂的质检线。第一,数据权限决定策略能否接触未来信息;第二,完整账本公开冠军背后的搜索规模;第三,DSR、PBO 与样本外区间分别识别幸运入选、排名退化和绝对表现崩塌。任何单一分数都无法同时回答这三个问题。
它也给 LLM 研究一个朴素提醒:机器越擅长大规模试错,评估越不能只看它最后交出的最好答案。生产力提升了,证明责任也要同步提高。
局限与未知
- 论文是目前唯一信源,尚缺独立复现;“所有 LLM 策略失败”不能超出本次模型、资产池、成本假设和最多一百个候选的设置。
- 美国股票数据采用固定的当前成分股名单,作者承认存在幸存者偏差;样本中虽包含八只中途退市股票,也没有彻底消除这个问题。
- 股票评估窗口只有四年。论文自己强调,中等强度、低频策略往往需要更长时间或更广资产覆盖才能取得足够统计把握,因此“未认证”不等于“策略不存在”。