你让 AI 接手一个代码仓库,它往往要反复阅读历史对话、文件和工具返回结果,真正费钱的未必是最后写出的几行代码,而是每一轮都要重新翻阅那一大摞材料。DeepSeek V4.1 Flash 这次主要解决的就是这笔“阅读费”:模型少算一些,也少存一些,同时尽量保住处理复杂任务的能力。
9 月 10 日,V4.1 Flash 结束内测,正式上线网页、App 和 API,并开放模型权重与技术报告。它还原生支持多模态视觉理解,也就是能在同一个模型里处理文字和图片。与本刊 9 月 9 日报道内测时相比,现在不仅架构和价格已经明确,产品定位也落了地:Flash 不再只是 Pro 的便宜替代品,而是会直接接手旧 Pro 的请求。本文性能数据主要来自 DeepSeek 公告和技术报告,媒体虽有多方转述,但尚不等于独立复测。
它到底省在什么地方?
V4.1 Flash 采用 Causal-Encoder-Decoder——一种把读取输入和生成输出分开组织的结构。它同时采用 MoE(混合专家)设计:模型包含许多“专家”子网络,每次只调用其中一部分,不必让全部参数一起工作。
这套结构最醒目的地方是不对称。模型读取输入时激活 8B 参数,生成输出时激活 16B 参数。换句话说,它用较轻的配置浏览大批材料,再把更多计算留给真正作答。这个安排尤其贴合 Agent(智能体)任务:Agent 经常要读几万 Token 的代码、网页和操作记录,最后只输出几百 Token 的判断或指令。Token 可以简单理解为模型处理文字时切分出的基本单位。
模型规模的公开口径需要谨慎。多数报道写作 552B 参数,但 InfoQ 根据技术报告称,这是 552B 主干参数,另有 196B Engram 条件记忆参数。因此,把 552B 直接称为无条件的“总参数量”并不稳妥。可以确定的是,模型采用了新的预训练方式,并进行了更大规模的强化学习后训练。
把模型的“草稿纸”压薄
另一项核心变化是重构 KV Cache——模型保存上下文中间结果的“草稿纸”,有了它,生成后续内容时就不必从头重算。上下文越长、同时服务的任务越多,这张草稿纸占用的高速内存和存储空间就越可观。
DeepSeek 给出的数据是:与上一代 V4 Flash 相比,V4.1 Flash 的 KV Cache 对 HBM(芯片旁的高带宽内存)需求降至四分之一,对 SSD(固态硬盘)需求降至八分之一;相对 DeepSeek V1,缓存体积缩小了 437 倍。模型支持最高 100 万 Token 上下文。当上下文从 4K 扩到 1M、长度增加 256 倍时,单个输出 Token 所需的 Decode FLOPs——生成阶段的计算量——只增加约 25%。
这些数字说明长任务的部署压力明显下降,但不能直接理解为用户账单也按四分之一或八分之一缩减。账单还取决于输入是否命中缓存、输出长度、工具调用轮次和失败重试等因素。
更强,至少先超过自家 Pro
DeepSeek 称,V4.1 Flash 在性能、费用、速度和任务总用时上全面超过 V4 Pro。官方基准中,它在 DeepSWE v1.1、CyberGym 和 Automation-Bench 上取得图表最高分;其中 DeepSWE v1.1 通过率为 74.2%。新的训练方式与更大规模的后训练,显然承担了在降低运行成本后补足能力的任务。
不过,“全面超过”应限定在 DeepSeek 对自家 Pro 的比较上,不能外推成超过所有旗舰模型。以 Terminal-Bench 3.0 为例,V4.1 Flash 得分 30.0,低于 Opus 5 的 43.3,也低于 GPT-5.6 Sol 的 34.4。在 GPQA Diamond、ProgramBench 等项目上,它同样仍落后于部分闭源模型。更准确的说法是:它在若干软件工程、网络安全和自动化任务上很有竞争力,但并非处处领先。
降价之外,是一次产品线换班
新 API 价格已于 9 月 10 日 12 时生效。闲时每百万 Token 的缓存命中输入为 0.02 元、未命中输入为 1 元、输出为 4 元,高峰价格翻倍。相比此前 V4 Flash,三项闲时价格分别下降 60%、约 33.3% 和约 11.1%。反复读取相同长材料的 Agent,最容易吃到缓存命中降价的红利;主要生成新内容的任务,节省幅度会小一些。
更关键的是接口替换。北京时间 9 月 14 日 12 时后、V4.1 Pro 上线前,发往 deepseek-v4-pro 的请求会自动转给 V4.1 Flash,并按 Flash 价格计费。旧版 V4 Flash 与 V4 Flash Vision Exp 已下线,其旧模型名也暂时路由到新模型。“转正”因此不是多了一个型号,而是 DeepSeek 主动让 Flash 接班 Pro。
生态也在同一天跟进。DeepSeek Harness v0.1.5 同步更新,模型针对其不同配置做了专项训练和优化;腾讯 WorkBuddy、CodeBuddy 和 OpenCode 已全量接入。据寒武纪宣布,它还基于 vLLM 完成 Day 0 适配——即模型发布当天便提供运行支持,并称新模型可在其芯片上稳定运行。这是单方披露,仍有待更多部署数据验证,但它让“更省”迅速延伸到国产算力部署,而不只停留在 DeepSeek 自己的 API 价格表上。
局限与未知
- DeepSeek 的能力和效率结论主要来自官方测试,完整测试条件与独立复现仍不充分;社区所称约 300—500 tokens/秒也缺少硬件、量化、并发和上下文条件,不能当作稳定指标。
- Pro 接口只留出很短的迁移时间。即使新模型平均能力更强,Prompt、输出结构和工具调用习惯仍可能变化,已经上线的业务和科研复现需要重新检查。
- Day 0 适配说明部署入口已经打开,但寒武纪尚未在材料中披露具体吞吐、延迟和成本数据,实际部署收益仍待观察。