Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.025 — 2026-07-29
REPO 约 1 分钟

GLM视觉模型压到NVFP4

GLM-5.2 接上视觉模块并压成 NVFP4,已给出 Blackwell 部署方案。

IMAGE — HF Trending Models(模型榜单)

给一个只会读写的模型装上“眼睛”,通常意味着重新训练大量参数。Baseten 这版 GLM-5.2-Vision-NVFP4 走了条更省事的路:保留 GLM-5.2 文本模型和 MoonViT 视觉编码器的原始权重,只训练中间的 PatchMerger 投影器——它像接口适配器,把图片特征转换成语言模型能接收的表示。新训练部分为 4950 万参数,文本权重则采用 NVFP4,即面向 NVIDIA 新一代硬件的 4 位浮点格式。

值得关注的不是“模型变小到随手可跑”,而是一个现成的低精度视觉语言模型已经给出部署路径。仓库标注模型约 466 GB,可在 8 张 B200 上运行最长 100 万 token 的上下文,或在 4 张 B200 上运行 25.6 万 token;目前仅支持 Blackwell 硬件。NVFP4 理论上能减少显存和计算开销,但材料没有提供与其他精度版本的显存、速度或效果对比,因此实际吞吐提升仍待验证。


供稿材料 SOURCES — 1
01
baseten/GLM-5.2-Vision-NVFP4 HF Trending Models(模型榜单) · REPO
原文 ↗

← 返回 2026-07-29 · 开源板块