Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.017 — 2026-07-21
NEWS 约 1 分钟

RSS最佳论文锁定机器人前沿

RSS从708篇投稿中选出三项大奖,FlashSAC以分钟级机器人训练拿下最佳论文。

IMAGE — 量子位

训练机器人走路,往往要反复试错几个小时;如果每次尝试都发生在真机上,时间和成本更高。RSS 2026 的最佳论文 FlashSAC,瞄准的正是这个瓶颈。据量子位报道,本届 RSS 收到708篇投稿,录用210篇,最终8篇进入决赛名单。奖项反映的是同行评审后的阶段性判断,并不等于技术已经完成产业验证。

FlashSAC采用离策略强化学习——机器人可以拿过去或其他方式收集的数据继续训练,不必每次重新尝试。团队的关键做法有些反直觉:减少梯度更新次数,也就是少做几轮“纠错”,同时扩大模型、数据吞吐量和经验池,再限制权重、特征与梯度的幅度,避免价值网络的误差越积越大。

报道称,FlashSAC在10种模拟器、60余项任务中整体超过PPO及多种离策略基线;在人形机器人行走的仿真到现实(Sim2Real)实验中,训练时间从数小时缩短到数分钟。这个结果值得关注,因为它把研究热点指向一个很实际的问题:机器人学习不只要效果好,还得训练得足够快、足够稳。


供稿材料 SOURCES — 1

← 返回 2026-07-21 · 科技板块