设计一个新分子,像是先画好成品,再倒推该买哪些原料、依次做什么反应。这个过程叫逆合成。候选路线数量庞大,稀有却关键的反应又容易被漏掉,因此药物、材料和农化品研发仍很依赖化学家手工规划。
发表于 Nature 的 RetroChimera 把两类各有所长的模型组合起来:R-SMILES 2 是生成式模型,能直接写出前体分子,灵活但可能“幻觉”;NeuralLoc 则从分子图结构出发。系统汇总两边的答案,再用学习排序——让模型学会把更合适的候选排在前面。说白了,它不是押注单一模型,而是先广泛提案,再挑出更可信的拆解步骤,以缩小人工搜索范围。
据 Microsoft Research 介绍,在盲测中,博士级化学家对单步反应预测的偏好超过此前模型及文献记录;RetroChimera 还展示了零样本迁移(不针对新数据专门训练便直接预测)和用专有数据微调的能力。不过,供稿未披露具体胜率,也未说明完整合成路线在实验室中的成功率。