像厨房突然多了几位快手厨师,出菜更快了,但备料、质检和报警没跟上,问题反而更容易成批送到客人面前。Spotify 的复盘正是如此:AI 提高了开发和自动改代码的速度,真正暴露的却不是所谓“AI 垃圾代码”,而是原有的监控、容量规划和变更防护追不上新节奏。
最具体的一次发生在 6 月 24 日。Spotify 每天处理超过 50 万首歌曲、视频、播客和有声书;当天,定时批处理任务与新节目争抢资源,一项画质改进又增加了单集所需算力,再叠加一个让吞吐量下降约 10% 的调度漏洞,原本几分钟即可发布的节目延迟了数小时。部分处理失败此前还会“静默”发生,无法及时触发告警。
Spotify 随后补上端到端监控——从上传到发布全程追踪,修复调度器,降低批处理优先级,并扩充容量;资源紧张时,关键服务和新上传内容优先。另一项自动依赖升级虽通过检查,仍在生产环境出错,公司因此也加强回滚能力,并把自动变更安排在负责团队的工作时间。教训很朴素:AI 能加快修复,也能放大技术债;吞吐提升不等于软件自动变好。