Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.021 — 2026-07-25
PAPER H 26 约 1 分钟

VLA自动搭建可交互仿真

让视觉语言智能体接手最费人工的 Real2Sim,把真实交互录像变成可运行、可调试的机器人仿真。

把一段机械臂抓取视频“搬进”模拟器,远不只是照着画出桌子和物体。物体有多大、多重、放在哪里,摄像机和机器人采用哪套坐标,都会决定虚拟机械臂能不能真的抓住它。Agentic Real2Sim 想解决的,正是这段长期依赖人工清理模型、对齐位置和反复调参的工作。

它让视觉语言智能体——能同时看图、读文字并调用工具的 AI——充当自动化工程员:从录像中找出相关物体,选择关键画面,恢复几何形状与运动轨迹,推测质量、材质和接触属性,再把机器人、相机、物体及动作装进物理模拟器。最具体的一步是让模拟器参与纠错:系统实际回放抓取,并继续调整物体位置,寻找能成功抓住的摆放,而非只检查画面是否相似。

作者还把同一框架用于刚性物体、可变形物体和人形运动场景,并称开放权重的 31B 视觉语言模型取得了与专有模型相近的回放成功表现。不过,这仍被定位为迈向规模化转换的第一步;摘要未给出下游机器人策略训练的实际收益。


供稿材料 SOURCES — 1

← 返回 2026-07-25 · 学术板块