Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.072 — 2026-09-14
PAPER H 45 约 8 分钟

做市模型如何穿越订单流变盘

一套深度强化学习做市模型,尝试在订单流突然转向时守住库存与收益。

你在集市上同时挂出收购价和卖出价,靠中间的差价赚钱。平常客流均衡,这门生意不难;但如果一群人连续只买不卖,你很快就会卖空。若还按平常节奏报价,风险会越积越大。这正是做市模型面对的“变盘”:价格未必先动,订单流的方向已经换了。

Felipe Moret 与 Fabrizio Lillo 的论文研究的,就是如何让模型察觉这种切换,并及时改变报价。两位作者提出深度强化学习做市模型 RLMM,在同一套零智能限价订单簿模拟器中,与经典的 GLFT 模型比较。论文报告称,RLMM 在平稳环境中覆盖了更好的风险—收益权衡;当订单流持续偏向一侧时,它也会失灵,但加入两个状态信号并调整训练方式后,模拟中的盈利能力得以恢复。本文全部效果结论均来自这篇论文,尚无独立信源交叉验证。

经典公式为什么会慢半拍

做市(Market making)是同时挂出买价和卖价,通过买卖价差获得收入。麻烦在于,两边不会总是同时成交。买单成交会增加库存,卖单成交会减少库存;库存偏得太远,做市商就暴露在价格反向波动之下。

Avellaneda–Stoikov 及其扩展 GLFT,是经典的随机控制做市模型。它们会依据库存、波动率、剩余时间和预估成交强度调整报价。库存太多,就让卖价更容易成交、买价更难成交,像轻轻转动方向盘,把仓位拉回中性。优点是规则清楚,可以写成公式。

问题在于,这类公式通常假设价格和订单到达过程相对稳定,订单流也大致对称。真实的微观交易节奏却可能在平静、持续买入和持续卖出之间切换。论文称,这类状态变化可能与算法拆分执行的大额订单,即 metaorders 有关,但并未证明因果关系。

GLFT 还难以直接表示限价订单簿里的排队细节。限价订单簿(Limit Order Book,LOB)是交易所按价格和时间排列的待成交买卖单。相同价格下,先挂单的人先成交。于是,一张单子排在队首还是队尾,会直接影响成交机会。报价每次撤掉重挂,还会丢失已经等来的排队位置。

先让模型在同一座“模拟市场”里比赛

作者搭建了连续时间、事件驱动的零智能订单簿。所谓零智能,是指外部限价单、市价单和撤单按设定的随机过程到来,并不模拟每个交易者的策略思考。模拟器会逐笔跟踪队列位置,按价格—时间优先规则成交,也会在价格漂移时重新居中价格网格。

参数校准参考了 Amazon 的 Level-3 订单数据,覆盖 2025 年 8 月 1 日至 9 月 10 日的 28 个交易日,并剔除每天开盘和收盘各 60 分钟。Level-3 数据记录单笔订单层面的变化,因而能观察排队与撤单。随后,GLFT 与学习模型都在校准后的模拟器里运行,并使用相匹配的订单流随机样本,以减少环境差异对比较的干扰。

GLFT 在这里不是陪跑基线。作者先估算报价离中间价不同距离时的成交强度,也用“波动率特征图”避开极短周期的买卖价跳动和最小报价单位噪声。论文实验显示,校准后的 GLFT 相比始终挂在最佳买卖价的简单策略,主要优势是控制库存,而不总是提高平均 PnL(盈亏)。风险厌恶越高,库存收得越紧,但也会牺牲价差收入。

RLMM 学的不是一个答案,而是一组可能结果

RLMM 把做市改写成连续决策问题。每隔约一秒模拟时间,它读取买卖价差、最佳价附近的排队深度、当前库存和自身挂单状态,再从六种报价动作中选一种。报价可以留在最佳价、退后一档,或在条件允许时向价差内改善一档。挂单价格不变时,系统保留原单,避免无谓丢掉排队优先级;库存碰到硬上限后,安全层会关闭继续扩大仓位的那一侧报价。

它的学习骨架是 Rainbow-style distributional DQN(C51)。DQN 是一种强化学习方法:模型反复行动,根据后续奖励判断某个状态下哪种动作更好。C51 的不同之处是,它不只估计“平均能赚多少”,还学习未来回报可能落在哪些区间。订单簿成交稀疏,又受队列位置和随机订单流影响,同一报价可能安静无事,也可能连续成交。只看平均值,容易把尾部风险抹平;学习回报分布,至少能让模型表示这种不对称。

奖励同时考虑成交后的盯市盈亏和库存惩罚。库存进入允许范围的外半区后,额外惩罚会快速增大。说白了,模型可以为了赚钱暂时持仓,但不能把仓位上限当作日常停车位。

据论文的配对随机种子实验,平稳订单流下,RLMM 在观测到的整条风险—收益前沿上优于 GLFT。论文还报告,在静态但不对称的订单流中,RLMM 保持盈利的范围比 GLFT 更宽。不过原文没有在供稿中给出完整的 PnL、显著性和提升幅度,因此这个“全面优于”仍应结合实验表格与基线配置判断。

真正的难题是连续偏向一边

短暂的不均衡并不可怕。危险的是方向持续存在:例如买方市价单长时间占优,做市商的卖单不断成交,库存逐渐逼近边界。模型一旦“库存饱和”,可用动作就受到安全层限制,赚价差的能力下降,回撤随之扩大。

论文发现,这不只是 GLFT 的问题。只在平稳订单流上训练的 RLMM,同样会在持续方向性失衡下出现大幅回撤。深度网络并不会自动获得应对陌生市场状态的能力;它仍受训练分布约束。

作者的修补办法,是给 RLMM 增加两盏仪表灯。

第一盏是 Bayesian online change-point filter,即贝叶斯在线变点过滤器。它根据每一笔市价单的买卖方向,持续估计当前订单流偏向买方还是卖方,以及这一状态大概延续了多久。模型看不到真实的隐藏状态,只能读取过滤器给出的信念摘要。

第二盏是 queue-adjusted quote-exposure imbalance,即经过队列位置调整的挂单暴露失衡。它不只问“我两边有没有挂单”,还问“这些单离队首有多近”。一张埋在长队后面的买单,和一张即将成交的买单,风险显然不同。这个信号让模型在成交发生前,就看到自己哪一侧更容易被打中。

论文称,把这两个信号加入状态并在状态切换订单流上微调后,RLMM 在模拟中恢复了盈利能力。它们分工明确:前者判断外部客流正在往哪边走,后者判断自己的摊位正朝哪边敞开。

再把训练预算投向最难的行情

最后一步是 scenario-bandit。Bandit 可以理解为一种动态分配训练机会的方法:哪些市场情景近期回报低,就提高它们随后被抽中的权重。模型因此不会把大部分练习时间花在已经擅长的平静行情上。

据论文报告,这一步在两类压力测试中进一步改善了表现。一类让订单流状态持续时间随机变化;另一类让前后状态的方向存在相关性。它的价值不在于预测下一次变盘,而在于反复暴露并修补策略最薄弱的情景。

为什么值得关注

这篇工作的重点不是“深度学习取代公式”,而是把失败过程拆开了。经典 GLFT 在稳定环境里仍能有效约束库存;RLMM 能从队列和成交反馈中学到更灵活的报价;但两者一旦只见过平稳订单流,都会在持续单边流量下暴露结构性弱点。

更有意思的是修复思路:模型不必直接知道市场处于哪个制度,只需获得对订单流方向的在线估计,再结合自身真实的排队暴露,就能学会调整报价。它把“识别外部变化”和“计算自身风险”分成两个可观察信号,比单纯加深网络更容易解释。

局限与未知

  • 全部结果来自零智能限价订单簿模拟,而非真实交易或独立历史回测。“恢复盈利”和“优于 GLFT”不能外推为实盘结论。
  • 供稿未提供关键 PnL、回撤、样本量、显著性及提升幅度。论文的效果措辞仍需结合完整实验表格核验。
  • 状态切换可能与 metaorders 有关只是作者提出的可能解释;现有方法出现负 PnL,也只宜理解为论文所设压力场景中的结果。

供稿材料 SOURCES — 1

← 返回 2026-09-14 · 量化板块