练手术机器人,难点不只是让它学会正确缝合,还要让它看见动作做坏后会发生什么。NVIDIA 发布的 Cosmos-H-Dreams,正试图把这类训练变成可实时操控的生成式模拟:输入一张初始手术画面,再持续接收机器人运动学信号——也就是器械刚刚怎样移动、旋转和开合——模型随即生成接下来可能出现的视频,让人或控制策略在闭环中继续操作。
它最值得注意的一点,是训练材料不只包含成功示范。团队还加入了掉针、落针位置偏离和打结失败等片段,因为用于评估机器人的模拟器,必须能呈现错误动作的后果。为让长时间生成更稳定,教师模型的训练视野从 12 帧逐步扩到 72 帧,再把能力“蒸馏”进计算更省的因果学生模型——即只根据已经发生的画面继续往后生成。NVIDIA 称,该系统借助 FlashDreams 流式推理库,可在单张 RTX PRO 6000 GPU 上实时运行;目前公开模型聚焦 dVRK 桌面缝合,合成结果能否符合真实物理与临床情况仍需验证。