训练机器人走路,往往要反复试错几个小时;如果每次尝试都发生在真机上,时间和成本更高。RSS 2026 的最佳论文 FlashSAC,瞄准的正是这个瓶颈。据量子位报道,本届 RSS 收到708篇投稿,录用210篇,最终8篇进入决赛名单。奖项反映的是同行评审后的阶段性判断,并不等于技术已经完成产业验证。
FlashSAC采用离策略强化学习——机器人可以拿过去或其他方式收集的数据继续训练,不必每次重新尝试。团队的关键做法有些反直觉:减少梯度更新次数,也就是少做几轮“纠错”,同时扩大模型、数据吞吐量和经验池,再限制权重、特征与梯度的幅度,避免价值网络的误差越积越大。
报道称,FlashSAC在10种模拟器、60余项任务中整体超过PPO及多种离策略基线;在人形机器人行走的仿真到现实(Sim2Real)实验中,训练时间从数小时缩短到数分钟。这个结果值得关注,因为它把研究热点指向一个很实际的问题:机器人学习不只要效果好,还得训练得足够快、足够稳。