Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.022 — 2026-07-26
NEWS 约 4 分钟

Vivix:单卡实时生成破万帧元

Vivix A1宣称单卡吞吐突破每秒1万 video token,实时视频角色开始逼近“说完就动”,但关键指标仍待复测。

IMAGE — 量子位

你对屏幕里的虚拟猫说“转过身”,它不是等几秒后重做一段视频,而是一边听,一边继续生成画面,约半秒便开始动作。Vivix 最新发布的实时交互多模态模型 A1,想解决的正是这个问题:把视频生成从“做好一段再播放”,变成像视频通话一样持续回应。

这项发布最醒目的数字,是单卡吞吐量超过每秒 10000 个 video token。Video token 是模型压缩画面后处理的内部表示,不是一帧完整视频。因此,“破万帧元”不能理解成每秒生成一万帧,也无法在缺少压缩方式、分辨率和帧率等条件时直接换算成画面速度。

本文数据均来自量子位对 Vivix 官网技术博客的转述。目前没有论文、代码、完整评测或第三方复测,以下性能结论都应视为官方自报结果。

它怎样做到边听边生成?

A1 采用原生流式架构。所谓流式生成,就是模型边接收输入,边连续输出结果,不等整段内容准备完毕。它把图片、视频、声音、交互历史和已生成内容共同写入持续状态,让角色在不断行动时尽量保持身份、场景和物体关系一致。

这很像一边铺铁轨一边开车:模型不知道几秒后用户会说什么,却要保证眼前的动作接得上,长期生成也不逐渐“变脸”或错位。A1 用局部连续性约束相邻动作,再用全局序列信息维持较长时间的角色和场景一致性。

它也不只把语音转成文字再处理。A1 直接建模语言含义、语气等声学特征、非语言声音、环境事件、手势和动态画面。上层的 Director Agent——负责较慢的推理、工具调用和长期行为安排——则异步提供宏观控制。快反应与慢规划由此可以同时推进。

两步生成,再压低系统等待

A1 拥有近 30B 激活参数,即一次运行中实际参与计算的参数接近300亿。为了减少视频扩散的计算量,Vivix 使用 MJD(Multidimensional Joint Distillation,多维联合蒸馏),把原本作为质量基线的 8-Step 生成过程压缩成 2-Step。蒸馏可以理解为让较省计算的“学生模型”学习较完整的“教师模型”;这里不仅学习单帧画质,也同时照顾短时细节、长期连贯性和多模态分布。

工程侧还采用原生 NVFP4 训练与推理策略。NVFP4 是一种低精度数值格式,可以减少显存和计算开销,但也可能让误差在连续画面中累积。Vivix 称其在训练和蒸馏阶段便让模型适应这种精度,并配合自研的通信—计算调度与 mega-kernel——把多项计算合并执行的“大内核”——减少数据搬运和等待。

按官方测试,A1 单卡吞吐超过 10000 video tokens/s。流式调度器响应新输入最短约 300 毫秒;从用户输入到画面首次出现可见反应,平均约 0.6 秒。两者衡量的阶段不同:前者是调度响应的最短值,后者才是可见反应的平均等待时间,不能混为一个端到端指标。

为什么值得关注?

实时互动视频能否工程化,主要看三件事:反应够不够快、单位时间能处理多少内容,以及画面能否长期连贯。A1 的意义不只在某个模型指标,而在于它试图把多模态感知、持续生成、快速响应和推理基础设施放进同一条链路。

如果官方数据能够在明确硬件和画质条件下复现,近 30B 激活参数模型的单卡高吞吐,将意味着实时视频角色可能不必依赖昂贵的多卡部署。Vivix 同时推出了可交互叙事模型 W1,并已开放 A1 内测以及官网、API 开放平台的体验申请。

局限与未知

  • 官方没有披露单卡测试所用的 GPU 型号、分辨率、帧率、上下文长度、并发量和完整量化设置,因此“每秒 10000 video token”暂时无法横向比较。
  • “消费级 GPU 实时推理”“近似画质下效率提升近两个数量级”缺少明确对照组和画质评价标准,不能视为已经验证的结论。
  • “全球首个统一多模态参考、实时交互与流式生成的基础模型”是 Vivix 的定位,现有单一信源不足以确认其首创范围。

供稿材料 SOURCES — 1

← 返回 2026-07-26 · 科技板块