Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.083 — 2026-09-25
PAPER 约 1 分钟

分布式RL的经验池升级为数据平面

Conduit把经验缓冲区升级为独立数据平面,让大规模RL的数据搬运也能统一调度。

像许多人同时打游戏、再把录像交给教练复盘:人一多,慢的未必是打或学,而是录像怎么存、怎么搬、何时整理。分布式强化学习(RL)也有这个问题。Actor负责尝试并采集经验,Learner用经验更新模型;夹在中间的经验缓冲区,本来只是临时仓库,规模扩大后却要承担传输、抽样和批处理。论文测得,在RLlib中,这条“经验路径”占DQN单轮时间的50.2%,在PPO中占26.2%。

Conduit的关键做法,是把仓库升级成独立的Experience Data Plane(经验数据平面,即专门搬运和调度训练数据的基础设施)。框架仍决定哪些经验该存、该用;Conduit则决定数据放在CPU还是GPU、分布在哪些节点,以及何时搬运和整理。它会同时考虑内存容量与连接带宽,并在不破坏训练规则时,把数据处理与采集或模型更新重叠起来。

作者将其接入RLlib,未改动原有执行逻辑;据论文报告,Conduit最多降低97%的显性经验路径延迟、38%的端到端单轮延迟,并扩展到1,024块GPU且保持收敛。更值得注意的不是又做了一个更快的缓冲区,而是把长期藏在训练框架里的数据运输,变成可单独优化的系统层。


供稿材料 SOURCES — 1

← 返回 2026-09-25 · 学术板块