Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.029 — 2026-08-02
NEWS 15 信源 约 8 分钟

DeepSeek V4 Flash:正式开源

DeepSeek V4 Flash 正式版开放权重与 API,多套本地量化同步落地,能力与部署门槛值得重估。

IMAGE — HF Trending Models(模型榜单)
DeepSeek V4 Flash:正式发布并开放权重

你想让 AI 帮忙改一个项目,有两种办法:打开网页,把任务交给云端;或者把模型下载到自己的机器,数据和运行方式都由自己掌握。DeepSeek V4 Flash 此前主要是本地玩家反复测试的预览模型。现在,它第一次把两条路同时铺开:正式权重上线,API 开放 public beta,社区量化版本也迅速跟进。

这比一次普通的版本更新更值得看。模型权重——训练后保存下来的大量数值参数——决定了开发者能否下载并自行运行模型;API 则是软件通过网络调用托管模型的接口,不需要准备本地算力。两者同时落地,意味着这款模型开始从测试对象变成可实际选用的工具。

不过,本文采用“正式发布并开放权重”的表述。材料没有提供许可证条款,因此尚不能确认它是否符合严格的 OSI 开源定义。性能数字也主要来自 DeepSeek 自测,社区速度则是个别用户报告。

从预览版走到正式版

DeepSeek-V4-Flash-0731 是 DeepSeek-V4-Flash 的正式版本,已经取代 Preview。官方权重现已出现在 Hugging Face,可通过 Transformers、vLLM 和 SGLang 等工具加载。官方还给出了在单个 4×GB300 节点上运行的示例,但这只是推荐配置之一,不代表普通用户必须照此准备硬件。

据 DeepSeek API 更新日志,正式版 API 于 2026 年 7 月 31 日进入 public beta。原有调用方式不变,只需把模型名设为 deepseek-v4-flash。这次只更新 Flash API,DeepSeek-V4-Pro API 以及 APP、WEB 中的模型都没有变化;DeepSeek 同时表示,V4 Pro 正式版将很快推出。

这也不是一次更换底座的升级。官方称,0731 与 Preview 的架构和规模相同,只重新做了后训练——即模型完成基础训练后,再通过一轮针对性训练调整行为与能力。换句话说,DeepSeek 没有重造一台发动机,而是重新调校了它。

正式版还与 DeepSeek-V4-Flash-DSpark 采用相同结构,附带 speculative decoding module(投机解码模块)。它的思路是先猜出接下来可能生成的若干内容,再由模型检查,从而争取更快输出。官方在 vLLM 中提供了 DSpark 的启用参数。不过,材料没有给出正式版开启与关闭该模块的对照速度。

模型的“思考力度”现在分为 low、high 和 max 三档,用来控制回答前投入多少推理。它也没有附带常见的 Jinja 格式对话模板,而是提供专门的编码目录和 Python 脚本,把 OpenAI 兼容格式的消息转换成模型输入,并解析输出。这对直接接入现有工具的开发者来说,是一个需要留意的适配点。

成绩提升,先看它测了什么

DeepSeek 把重点放在 Agent 能力上。Agent 在这里不是单纯聊天,而是让 AI 操作文件、终端和开发工具,连续完成编程任务。此类基准既考验模型,也会受到外围运行架和工具流程影响。

在官方列出的九项测试中,0731 全部高于 DeepSeek-V4-Pro (Preview)。几个较直观的数字是:Terminal Bench 2.1 得分 82.7,NL2Repo 为 54.2,Cybergym 为 76.7;Toolathlon-Verified 为 70.3,Agents’ Last Exam 为 25.2。官方还报告 DeepSWE 54.4,以及内部测试集 DSBench-FullStack 68.7、DSBench-Hard 59.6。

这些成绩说明,重新后训练可能明显改变了模型使用工具和完成编程流程的表现。但暂时不能把表格直接当成独立结论。公开 Code Agent 测试使用尚未发布的 DeepSeek Harness minimal mode,并设置 max effort、top_p=0.95temperature=1.0。外界目前缺少完整复现条件。DeepSWE 的 54.4 也尚未得到 DeepSWE 验证;两项 DSBench 又是 DeepSeek 内部测试集,外部无法据现有材料复核。

还要避开一个容易误读的比较:社区有人把 Preview 的 Terminal Bench 2.0 成绩 56.9 与正式版在 2.1 上的 82.7 相减,得到 25.8 分提升。测试版本不同,这不是严格的同场比较。官方模型卡中可直接比较的 Terminal Bench 2.1 成绩,则是正式版 82.7、Preview 61.8、Pro Preview 72.1。

本地部署不再只等官方

本刊在 7 月 19 日记录过它在 RTX 5090、RTX 3090 和 MacBook 上的长上下文与量化测试;7 月 28 日比较过不同编码 Agent 运行架的成本;7 月 30 日又跟进了 Strix Halo 统一内存设备上的压缩与投机解码。这次真正的新节点,是正式权重与多套本地版本同时出现。

社区已经发布 Unsloth、bartowski、antirez 和 nazeshinjite 等多套 GGUF 量化。GGUF 是本地推理工具常用的模型文件格式;量化则用较低精度保存和计算权重,以减少内存、显存与算力需求。代价是压缩越激进,越需要检查能力是否受损。

个别实测给出了初步尺度。一名用户称,162GB 的 Q8_K_XL 版本在单张 40GB A100 上生成约 16.1 tok/s;把 6 个 experts 加载进显存后约为 17.7 tok/s。另一名量化制作者称,其 DS4 专用版本在 MBP M5 Max 上略高于 30 tok/s,约为 llama.cpp 的两倍。tok/s 指模型每秒生成多少个 token,也就是切分后的文本单位。

但两组结果使用不同量化、推理引擎和加载方案,不能横向判定哪类硬件更快。“lossless”或“original quality”之类说法,也还缺少量化误差或任务评测支持。

为什么值得重新评估

这次更新的意义,不只是一张更高的成绩表。云端用户可以直接切换到正式版 API;本地用户则能下载官方权重,并在多套社区量化之间选择。模型从预览期的少数玩家实验,进入了更完整的分发与使用阶段。

价格仍是最大悬念之一。社区帖子称其 API 价格为每百万 tokens 0.09/0.18 美元,并宣称比 Kimi K3 便宜超过 50 倍,但材料没有原始计价页面,也未说明输入、输出及缓存口径。这组数字目前不宜作为确定价格引用。Artificial Analysis Index 50 分及相关排名同样只有 Reddit 标题,缺少原始榜单佐证。

局限与未知

  • 官方 Agent 成绩依赖尚未发布的运行架与特定参数,部分测试还是内部数据集;第三方复现仍需等待。
  • 多套量化已经解决“能否下载和运行”的问题,但不同压缩方案的能力损失、内存要求与实际速度还没有统一比较。
  • 权重已经开放获取,但许可证条款未见于材料;API 的正式计价口径也仍待原始来源确认。

供稿材料 SOURCES — 15
01
deepseek-ai/DeepSeek-V4-Flash-0731 HF Trending Models(模型榜单) · REPO
原文 ↗

← 返回 2026-08-02 · 开源板块