你拿到几张物体的影子,当然可以画出一个看起来合理的轮廓。但换一种画法,也可能同样贴合这些影子,背后却是另一个形状。期权市场也有类似问题:模型可以把报价拟合得很准,却未必还原出可靠的风险中性分布——一套与期权价格一致的未来价格权重。它不是投资者对真实概率的预测,但交易员会用它观察市场怎样给极端涨跌等状态定价。
Lennon J. Shikhman、Michael Galarnyk、Aadi Dash 和 Nicholas A. Welsh 的这项研究,专门拆开了两个常被混为一谈的问题:模型能不能复原价格,以及它能不能找回生成价格的潜在分布。论文同时使用有“标准答案”的合成实验和按时间切分的 NIFTY 市场数据,结果没有选出一个包打天下的赢家,反而说明:你关心价格、尾部还是完整分布,最合适的模型可能完全不同。
本文数字均来自这篇 arXiv 论文,尚无外部复现、市场数据提供方或其他团队的交叉验证。
价格为什么会对,分布却会错?
这是一个逆问题:研究者看见的是有限、稀疏而且带噪声的期权报价,却要反推出一整条看不见的分布。期权定价会把分布中许多位置的信息汇总成一个价格。这个过程会抹平细节,就像几种不同配方的汤,尝起来可能几乎一样。
论文把定价过程离散到 128 个密度节点和执行价节点上,再排除不满足总概率质量与远期价格约束的变化方向。在剩余的 126 个方向中,按论文设定的数值阈值,只有 31 个能被报价分辨,95 个在数值上近似“看不见”。这不是适用于所有市场的识别定理,只是针对该网格、阈值和执行价覆盖范围的诊断,但它把问题展示得很直接。
研究者还构造出两处分布。它们的 距离为 0.061——这个指标衡量两条密度曲线总体相差多少——却在实验覆盖的执行价范围和数值精度下给出不可区分的期权价格。换句话说,价格拟合无法替模型决定该选哪条分布。模型最后选出的答案,必然依赖某种结构偏好,也就是 inductive bias:它事先更愿意相信哪类形状。
两套考场,分别检查两件事
论文没有直接拿市场报价证明“真实分布已经找回”。现实市场并不存在一条可供核对的唯一真值分布。因此,作者设置了两个互补基准。
第一套是合成基准。模拟器从三类过程生成精确分布,再算出期权报价。模型只看稀疏且位置不规则的报价,研究者则能用隐藏的真实分布检查答案。每个随机种子生成 3,000 个样本;每张完整曲面有 16 个期限和 128 个执行价节点,但模型实际只看到 40 至 320 个报价。论文比较了 DeepONet、FNO、quote transformer、set decoder 等学习模型,也比较了直接拟合分布的传统方法。
第二套是 NIFTY 市场基准。数据按时间切分,模型先学习较早时期,再预测未见过的合约报价。这叫样本外检验,用来区分可泛化的结构和只在训练数据上好看的拟合。这里能检验的只有隐藏报价,不能检验真实风险中性分布。
综合冠军很朴素,局部赢家却不同
在合成基准的综合结果上,two-component lognormal mixture——用两个对数正态成分拼出分布的参数模型——表现最好。它取得最低的价格误差、 误差、Wasserstein 距离和固定尾部误差。Wasserstein 距离关注概率质量被放到了多远的位置;固定尾部误差则专门检查小概率区域。后者很重要,因为风险管理最关心的极端状态,可能只对总体价格误差贡献很小。
但换一个目标,排名就变了。相较这个 mixture 基线,DeepONet 的 1% 分位数误差降低 39.0%,方差误差降低 34.6%。1% 分位数描述分布极左侧的结果,因此更贴近尾部问题。这两项是探索性比较,优势出现在全部十个随机种子中,但不能改写为 DeepONet 整体优于 mixture。
模型的结构是否与数据生成方式匹配,也会改变结果。Mixture 在与自身形式匹配的 Black–Scholes 和 mixture 样本上最强;到了结构错设的 Merton jump diffusion 场景,quote transformer 的 误差比 mixture 低 16.4%。这说明学习模型的价值更像一种范围有限的适应能力,而不是普遍替代传统模型。
论文还发现,在测试过的训练目标中,直接用真实密度的均方误差监督,潜在分布恢复最好。只让模型把观察到的价格拟合好,或者额外加入若干辅助损失,并没有自动带来更准确的密度。这再次说明,价格目标和分布目标不是同一件事。
到了真实市场,故事又变了一次
NIFTY 实证部分包含 6,191 张 call 记录,覆盖 295 个日期和 19 个到期日。测试链中有 1,053 个价格提供给模型,另有 524 个隐藏价格用于检验。数据来自一分钟成交条,而非买卖报价中点或可执行报价,这限定了解读范围。
研究者让 DeepONet 在每条测试期权链上做 test-time adaptation——模型部署时再根据当下可见报价短暂调整。经过验证集选择的设置把其价格 RMSE 从 0.004833 降至 0.003464,相对下降 28.3%,十个初始化种子都出现改善。
不过,逐到期日重新拟合的传统模型仍明显更准。Lognormal mixture 的 RMSE 为 0.000166,SVI——一种参数化波动率曲线模型——为 0.000241。两者都远低于适配后的 DeepONet。比较并非完全对等:传统方法会为每个到期日单独重拟合,神经网络则先跨时期训练,再做短暂调整。但结果至少说明,在这批隐藏市场报价上,学习模型尚未追上传统局部拟合。
更关键的是,NIFTY 实验只能证明哪种方法更会预测未见报价。它没有真实潜在密度,因此不能证明价格更准的模型也恢复了更准确的分布。
为什么值得关注
这项研究提醒我们,期权模型的评价不能只看一列价格误差。价格拟合是必要证据,却不是分布已经被识别的充分证据。若任务是补全报价,局部参数模型可能更合适;若任务关注极端分位数、方差,或面对结构错设,学习模型可能在特定指标上更有优势。
说白了,每种方法都在替不可辨认的部分作选择。参数模型把选择写进分布形式,学习模型把选择藏在训练数据、架构和损失函数里。真正该问的不是“哪个模型最好”,而是:它为哪个目标而好,又凭什么在报价没有提供答案的地方作出这个选择。
局限与未知
- 合成实验的真值只在选定的三类生成过程内成立;利率、股息、行权方式、动态过程和观测噪声仍可能与真实市场不符。
- NIFTY 使用成交条和短期限近似,且没有潜在分布标签;它只能检验价格泛化,不能验证密度真伪。
- 主要统计比较只有十个随机种子;数值上的“不可见方向”也依赖网格、阈值和执行价覆盖,不能外推为一般性定理。