近万张昂贵的 AI 加速卡,也可能像停车场一样:一边排长队,一边留着空位。招商银行要解决的正是这种错配——训练、微调和在线推理需求各不相同,却要共享同一批芯片。据 InfoQ 报道,招商银行已将 99% 的加速计算资源纳入统一框架。
这套系统以 Kubernetes——自动分配和管理计算任务的基础设施平台——作为控制层,统一调度近 10000 张不同型号的加速卡。训练任务等到所需资源全部就绪再启动;推理服务则跟随实时请求增减实例;数据访问也被加速,尽量减少芯片等待任务或数据的时间。
按照招商银行公布的数据,加速卡平均利用率从 35% 提升至 60% 以上;在模型和服务条件相同时,每处理 100 万 Token——模型读取和生成文本时使用的计量单位——推理成本下降超过 60%。这组生产数据说明,大规模部署 AI 后,关键问题不只是有多少卡,更是能否让同一批卡持续干活。报道未披露具体成本基数,效果仍以招商银行公布口径为准。