Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.091 — 2026-10-03
PAPER 约 1 分钟

世界模型终于开始“听见”环境

HelixWorld让可实时操控的世界模型同时生成画面与空间声,声音会随视角一起转动。

想象你在虚拟街道里转头:画面已经转向右侧,汽车声却还停在原处,沉浸感立刻破功。HelixWorld要解决的正是这种错位。它是一种交互式世界模型——会根据用户操作持续生成环境变化,而非播放预制视频;同时生成空间立体声,让左右声道呈现声源的方向与距离感。

关键在于,模型会读取六自由度相机轨迹,也就是相机在三维空间中的位置和朝向,让视点移动与声音方位同步演化。团队先训练较强的“教师”模型,再把能力压缩给更快的“学生”模型,以减少连续生成时误差越滚越大的问题。作者称,系统可在单张 NVIDIA H800 GPU 上以每秒 24 帧持续生成同步的声音和画面。

这项工作的另一处实质进展是数据:团队从 4100 小时素材中筛出 3000 小时、约 210 万段同步片段,剔除配乐、旁白和伪立体声,并补上相机位姿。效果结论目前主要来自论文作者自述,但它把世界模型从“会动的无声画面”推进到了可听、可操控的环境模拟。


供稿材料 SOURCES — 1
01
HelixWorld: A Real-time Interactive Audio-Visual World Model arXiv (cs.AI+cs.LG+cs.CL+cs.CV+stat.ML) · PAPER
原文 ↗

← 返回 2026-10-03 · 学术板块