过去,想在本地运行一个能生成图像和视频的超大模型,通常先得面对服务器级显存。现在,社区开始尝试把这类模型塞进高端个人工作站。NVIDIA Newsroom称,Cosmos 3 是面向 Physical AI(让机器理解并预测现实世界)的开放模型,可处理视觉推理、世界生成与动作预测;其中 Cosmos3 是一个64B参数模型。
据 GitHub 项目仓库,非官方项目 cosmos3-quant-mlx-cuda 为四步文生图版本制作了 INT4 权重——即用约4位整数压缩模型参数。其 transformer 文件从 BF16 的119.21 GiB降至35.70 GiB,缩小约70.1%。在配备128GB统一内存的 M4 Max 上,一次受控生成耗时75.43秒,峰值内存38.97 GiB。项目同时提供 MLX(Apple芯片的机器学习框架)推理与 CUDA(NVIDIA显卡计算平台)验证工具。
这说明64B级生成模型正在从云端向本地工作站下沉,但离“完整本地视频生成”还有距离:当前量化只覆盖 Text-to-Image transformer,CUDA也尚无端到端性能或显存数据。项目展示的单一样例中,INT4与BF16的画面及构图还有明显差异,暂不足以判断普遍画质。