Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.093 — 2026-10-05
PAPER 约 6 分钟

同一套模型,为何下出不同订单

同样三种模型、同样一条新闻,换种说法就会换一批模型下单,订单方向也可能随之改变。

你让三位分析师读同一则公司公告。三人都在场,却未必都会下单:有人觉得信号够强,有人选择观望。再把公告换一种写法,最积极的可能变成另一人。于是,桌边坐着谁是一回事,真正把订单递出去的是谁,又是另一回事。

论文《Shared Models, Selective Trading, and Order Flow》研究的正是这道缝隙。作者 Victoria Ruojie Li 与 Arka Prava Bandyopadhyay 没有只问不同大语言模型会怎样判断新闻,而是继续追问:哪些判断最终跨过门槛,进入订单流——也就是市场收到的买卖单及其方向、数量和顺序?这关系到一个现实担忧:大家共享少数基础模型,是否必然做出同质化交易?

论文给出的答案比较克制:未必。安装了哪些模型,不等于订单里会出现哪些模型。新闻怎么呈现、谁选择参与,以及买卖能否相互抵消,都会改变结果。以下证据全部来自这篇论文及其合成市场,尚无独立研究交叉验证。

市场里有三种模型,下单的却可能只剩一种声音

实验市场有 15 个智能体,各有五个使用 Llama 3.1 8B、Qwen 2.5 7B 和 Mistral 7B。每个市场运行 25 轮。智能体持有不同现金、股票和投资任务,例如保本、稳健增长或允许小幅冒险。

每轮,模型会看到自己的资产、近期价格、买卖盘和新闻,再决定买、卖或持有。这里的“持有”很关键:模型产生看法,不代表它一定交易。只有越过置信度、风险或收益门槛的信号,才会成为有效买卖决定。

作者比较了两类公司事件。一类是融资公告,涉及缓解资金压力和股本约增加 30%;另一类是裁员公告,涉及裁减 20%员工、降低 25%运营成本,同时失去三个开发团队中的一个。每类事件都准备了不同的表述版本。所谓“表述”并非只换几个褒贬词,有些版本还加入解释、社会线索或其他交易者的反应。

研究用 30 组配对配置比较每个主要条件。配置固定了初始资产和行动顺序,却没有固定模型每次生成文本时的随机性。因此,它更像让同一批角色重复经历相似场景,而不是精确重放完全相同的一天。

48 个百分点,不是需求暴增

融资事件最能说明“订单构成”和“净订单”为什么要分开看。更换公告表述后,Qwen 在已提交订单中的占比移动了 48.1 个百分点;但作者称,每个市场的净订单数变化很小。

这两个结果并不矛盾。净订单看买单减去卖单后的余额;订单构成看订单分别来自哪些模型。好比一支球队换了大半阵容,最后比分仍然接近。谁在场上发生了巨变,不代表净结果一定同步放大。

裁员事件则出现了另一种组合。解释性表述把 Mistral 在公告轮有效行动中的占比从 17.5%推到 57.4%,上升 39.9 个百分点。这个变化的探索性配对自助法区间为 32.8 至 47.5 个百分点;删去任意一组配置后,估计仍在 38.8 至 41.3 个百分点之间。

与此同时,全部模型的买入占比从 27.5%升至 64.1%,净订单方向发生反转,两个版本每个市场的净订单差为 3.63。这里的净订单仍是买卖“决定”的数量之差,不是成交股数,也不是价格涨跌。

进一步看,解释性版本下,Mistral 在公告轮提交了 112 个买入、没有卖出;事实性版本下是 21 个买入、没有卖出。总有效行动数则从 120 增至 195。不过,作者没有据此证明某个模型改变了全部成员的观点。观望者也可能持有明确看法,只是没有下单。

同质化真正危险的时刻

论文还把混合市场替换为全 Mistral 或全 Qwen。融资公告后的三轮窗口内,全 Mistral 市场提交的 159 个决定全部是买入;全 Qwen 市场的 215 个决定全部是卖出。两种同质市场在 30 组配置中都没有出现反向订单。

混合市场则提交了 52 个买入和 81 个卖出,只有四组配置完全单边,另有一组没有有效决定。这说明,当活跃模型本来就朝同一方向交易时,同质群体会消除原本能够抵消的订单流。

但这不是“模型越多越好”的证明。该比较同时改变了模型身份、市场此前的行动历史和参与程度,并没有在模型质量不变的条件下单独测量“集中度”。如果两种模型恰好方向相同,增加模型名称也不会自动带来行为多样性。

真正的新问题是:谁获得了投票权

这项工作的价值,在于把模型选择问题从“谁预测得更准”推进到“谁真正进入市场”。三种模型各占人口的三分之一,不代表它们各占订单的三分之一。新闻呈现可以改变参与率,参与率又会重排有效模型权重。

作者的分析分解还指出,即使总体需求对信息的敏感度不变,这种筛选也可能改善或恶化价格准确性。原因是,进入交易的权重可能与各模型的估值误差相关。不过,这只是机制性结论:它说明结果为何没有固定方向,并不证明 LLM 交易已经提高或损害定价效率。

换句话说,共享模型是否造成同质化,不能只数机构用了多少种模型。还要看提示和新闻如何写、哪些信号获准下单、哪些交易者选择沉默,以及不同方向能否在订单流中碰面。

局限与未知

  • 这是合成市场。背景买卖盘很厚,成交价被限制在很窄的范围内;论文主要测量提交的决定,不足以识别真实的价格发现、冲击或错价。
  • 两组文本同时改变长度、解释和社会线索,不能把结果单独归因于语气或“情绪化措辞”。三个模型也都是相对较小的模型,事件只有两类。
  • 当前结果仍受生成随机性影响。作者把更干净的文本复现、固定生成设置,以及给定真实价值的准确性验证列为后续研究;这些方案尚未提供新的实证结果。

供稿材料 SOURCES — 1

← 返回 2026-10-05 · 量化板块