Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.082 — 2026-09-24
NEWS 约 6 分钟

美团把外卖精排合成一个大模型

美团把多个外卖场景的精排合成一个基座模型,并试着让效果、扩展性与成本同时成立。

IMAGE — 美团技术团队

你打开外卖首页,系统推荐正餐;转到拼好饭,它又要理解你更在意价格和组合。过去,这些场景往往像几家各自开灶的厨房:分别训练模型,分别保存用户行为,也很难共享算力和经验。美团现在试着把它们并到同一个“大厨房”里。MTFM(Meituan Foundation Model for Recommendation)用一套共享基座处理多个外卖业务的精排,同时给各业务保留独立部分。

精排是推荐流程的最后一道关键筛选:系统先从海量商家和商品中粗筛,再由精排模型给较小的候选集打分,决定用户最终看到的顺序。统一这一步,直接关系到多个业务能否共享用户兴趣、训练数据和计算资源。

以下效果与部署情况均来自美团技术博客,尚无独立第三方印证。

难点不是合并,而是合并后仍然好用

不同外卖场景的数据格式并不整齐。首页可能推荐商家,另一个频道可能推荐商品或券包;各自记录的特征也不同。强行统一字段,容易丢掉某些业务独有的信息。

MTFM 的第一步,是把输入都转换为 Token——模型可以处理的离散单元。这里的 Token 不是文字,而是用户、候选商品和行为等推荐特征。模型把它们分成三类:H-Token 表示跨业务的历史行为,R-Token 表示点击、加购等近实时行为,T-Token 表示当前待打分的商家、商品或券包。

前两类由所有业务共享,T-Token 则由各业务单独维护。异构 Tokenizer——针对不同输入分别编码的转换器——让各场景保留自己的特征格式,再把结果送入同一个注意力骨干网络。换句话说,模型统一的是处理语言,不要求每个业务先把表格改成一模一样。

动态掩码负责规定信息如何流动。掩码可以理解为模型里的可见范围:历史行为对所有 Token 开放;实时行为严格遵守时间顺序;每个候选只能看到曝光前已经发生的行为;同一请求中的不同候选彼此不可见。这样既能共享用户信息,也能避免模型在训练时偷看到未来或其他候选的信息。

把贵的计算留给关键候选

MTFM 使用类 Transformer 骨干。Transformer 的 Self-Attention(自注意力)允许序列中的各个 Token 相互查看,擅长建立全局联系,但计算量会随序列长度平方增长。多条千级长度序列放进统一模型后,如果每层都做完整自注意力,训练和推理成本会迅速上升。

美团采用 Self-Attention 与 Target Attention(目标注意力)混合的架构。少数完整注意力层负责汇总全局信息,更多目标注意力层则把计算集中到待打分的 T-Token。V1 版本共 16 层,由 4 个 Block 组成,每个 Block 包含 1 层 Full Attention 和 3 层 Target Attention。博客给出的消融实验称,这个 3:1 配置在各任务的 GAUC 上效果最好;GAUC 是按用户或分组衡量排序质量的指标。与全 Full Attention 架构相比,它还能把 batch size——一次并行处理的样本量——扩大 1.7 倍,并把样本吞吐提高到 2.9 倍。

V2 又把候选侧进一步“加宽”。原因很直观:一个候选包含用户、上下文和商品等大量特征,却和较简单的用户行为一样被压进单个 Token,信息密度并不对称。MTFM 把每个 Target 映射成 4 个 Token Embedding——也就是四份供模型处理的数值表示——分别提取信息,再用低成本的 Mixing 模块让它们交换内容,减少四份表示学成相似副本的风险。材料对这套机制同时使用了 “Target Scale-Up” 和 “Target Token Scale-Up” 两种名称,正式名称仍需以论文为准。

一个模型,不等于所有业务共用一套答案

MTFM 采用“共享基座 + 业务解耦”。共享的 Attention Backbone 负责学习长序列中的用户兴趣;之后,MMoE——用多个专家模块处理不同任务的多任务结构——提取跨业务信息;每个业务再接自己的任务塔,预测点击率等目标。共同规律留在基座里,业务差异交给后半段处理。

训练时,系统以用户为单位,把同一用户当天在多个场景中的曝光聚成一条样本。多个业务因此可以复用一次长序列计算,而不必反复处理相同的用户历史。部署时,各业务只保留共享序列基座和自己的任务塔,把线上计算限制在当前业务相关组件中。这套设计可以概括为“统一训练、多业务部署”。

美团称,跨场景迁移对小流量业务的提升更明显:相关指标提高 0.60~0.93 个百分点,中流量业务提高 0.25 个百分点,大流量业务持平微正。这符合统一基座最值得关注的一点:数据较少的场景,可以借到大场景学到的用户兴趣,而不必独自从头训练。

为什么值得关注

这项工作的价值,不只是把几套模型合成一套,而是给出了统一推荐基座进入生产环境的一整套取舍:异构 Tokenizer 处理字段差异,动态掩码控制信息边界,混合注意力压低长序列成本,User-Level 训练复用用户计算,业务独立任务塔保留场景差异。

据美团披露,MTFM 已在外卖各核心场景完成全量部署,多个业务的订单量提升为 2.06%~6.68%,效果最显著的业务线超过 6%。模型单样本计算量达到 192 GFLOPs——GFLOPs 是十亿次浮点运算的量级——比传统 DLRM 高数百倍,但线上推理成本反而降低 24.0%。两组数字并非必然矛盾:前者描述计算量,后者描述实际服务成本,不过博客没有给出足够口径,暂时无法解释硬件、批处理和吞吐各自贡献了多少。相关工作据称于 2026 年 5 月被 KDD 2026 接收。

局限与未知

  • 所有核心效果目前都来自美团单一信源。材料没有披露各业务逐项数据、实验周期、流量规模和统计显著性,因此订单变化不宜直接解释为已经确定的因果增量。
  • “首次实现”“全面超越”和“稳健的 Scaling 能力”都是美团的概括。现有材料只说明模型在参数量和序列长度扩大时表现稳定,没有提供足够完整的数据供外部复核。
  • 192 GFLOPs 与推理成本下降 24.0% 使用了不同口径。缺少基线、硬件和成本定义,尚不能判断这套架构在其他生产环境中能否复现同样的效率收益。

供稿材料 SOURCES — 1

← 返回 2026-09-24 · 数据板块