Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.027 — 2026-07-31
PAPER 约 1 分钟

人机互动世界模型跑进实时档

数字人把身体、手、表情与物体接触一起生成,并在双 H100 上跑到实时速度。

你挥手拿起杯子时,数字人不能只把胳膊画对:手指要及时握住杯子,表情要连贯,杯子也得随动作变化。这项工作把这些变化放进同一个人物中心世界模型——也就是让 AI 预测人物动作之后,自己和周围物体接下来会怎样——目标是让数字人能够被现场操控,而非事后慢慢生成。

它最值得注意的一步,是把控制拆成两路。身体、手和面部的平滑运动被压成统一的潜在表示,即一组供模型预测使用的内部数字摘要;“未接触”“抓握”等明确事件则作为离散指令输入。这样,动作过程与接触类别不必挤在一句开放式文字提示里,用户可以分别控制“怎么动”和“是否抓住”。作者还用多尺度编码兼顾上身的大动作与手、脸的细微变化。

经 CausVid 与 Self-Forcing 加速后,系统在两张 H100 GPU 上以流式方式达到 25 FPS。作者称其手与物体的配合、细微动作保真度和实时交互均优于对比方法;不过这一速度依赖两张高端 GPU,论文聚焦的也只是上半身及附近物体,离通用数字世界仍有距离。


供稿材料 SOURCES — 1

← 返回 2026-07-31 · 学术板块