DeepSeek-V4-Flash 正式版已发布
该模型以 284B 总参数(每 token 激活 13B)的体量,在九项 Agent 基准测试中全部超过此前最强的 DeepSeek-V4-Pro 预览版(1.6T 总参数,激活 49B)
其中最显著的 DeepSWE 测试,得分从 7.3 飙升至 54.4,增长六倍多,而 API 价格保持不变:输入 1 元/百万 token,输出 2 元/百万 token。

九项 Agent 测试全胜
DeepSeek-V4-Flash 正式版在以下九项基准测试中均取得最高分:
- Terminal Bench 2.1:82.7 分(预览版 61.8,Pro 预览版 72.1)
- NL2Repo:54.2 分
- CyberGym:76.7 分(预览版 38.7,Pro 预览版 52.7)
- DeepSWE:54.4 分(预览版 7.3,Pro 预览版 12.8)
- Toolathlon Verified:70.3 分
- Agents' Last Exam:25.2 分
- AutomationBench:25.1 分
- DSBench-FullStack:68.7 分
- DSBench-Hard:59.6 分
需要说明的是,这九项基准均为 Agent 和编码类测试,传统知识问答类测试上 Pro 的参数优势依然存在。
DeepSWE:从 7.3 到 54.4
DeepSWE 包含 113 个原创软件工程任务,涵盖五种编程语言。AI 需要在隔离环境中持续修改代码、测试、定位并修复 bug,全程不能中断,考察模型持续编程能力。
预览版仅得 7.3 分,正式版直接飙到 54.4,超过 GLM-5.2(46.2),与 Claude Opus 4.8(58.0)仅差 3.6 分。
CyberGym 测试同样表现突出,从 38.7 涨至 76.7,接近翻倍。该测试要求 AI 在真实开源项目中找出安全漏洞并写出复现攻击代码。

架构未变,提升来自后训练
V4-Flash 正式版的模型架构、预训练数据、参数量与前代完全一致,所有提升均来自后训练。
DeepSeek 采用先训练多个领域专家模型(监督微调 + GRPO 强化学习),再通过蒸馏整合到统一模型的后训练框架。
推测本次优化了工具调用格式、长任务规划、代码修改后的测试验证以及执行失败后的自动恢复能力。
对标 Claude Opus 4.8
在多项指标上,DeepSeek-V4-Flash 与 Claude Opus 4.8 的差距在 3-6 分,Agents' Last Exam 仅差 0.5 分。
所有有数据的项目均高于 GLM-5.2。
有开发者本地部署后测试反馈"各项测试只落后 Claude Opus 4.8 大约 3 分"。
定价优势
- 输入(非缓存):1 元/百万 token
- 输入(缓存命中):0.02 元/百万 token(正价的 2%)
- 输出:2 元/百万 token
- 并发上限:2500(Pro 为 500)
实测 DeepSeek 模型缓存命中率在 90% 以上,实际输入成本极低。
跑一次 Agent 任务成本可能仅几分钱到几毛钱。
横向对比,Claude Opus 4.8 输出价格约 168 元/百万 token,相差约 80 倍。

原生对接 Codex 和 Responses API
DeepSeek-V4-Flash 正式版原生支持 OpenAI Responses API 格式,已针对 Codex 做专门适配。
可在 Codex CLI、桌面端、VS Code 扩展中直接使用,base_url 指向 api.deepseek.com,模型名填 deepseek-v4-flash。
Responses API 支持流式输出、工具调用、推理档位切换(low/high/max)和结构化输出。
但目前仅 Flash 支持,V4-Pro 预计 8 月初适配。图片输入、文件上传、MCP 工具、Computer Use 暂不支持。
当前为无状态接口,需自行携带上下文。
DeepSeek Harness 布局
DeepSeek 正在打造自己的 Harness(执行框架),负责工具调用、终端运行、上下文管理等模型外工作。
团队负责人崔天一此前在 Jane Street 从事量化交易九年,今年 3 月加入 DeepSeek 组建 Harness 团队,明确对标 Claude Code。

测试前提与注意事项
- 所有 Agent 测试均在 max 推理档位下运行(top_p 0.95、temperature 1.0),实际使用中可根据需要调整。
- DSBench-FullStack 和 DSBench-Hard 为 DeepSeek 内部测试集,任务和评分标准未公开。
- Harness 极简模式尚未发布,外部研究者暂时无法完整复现测试条件。
- 本次仅升级 Flash 的 API 接口,App 和网页端模型未变化,V4-Pro 正式版尚未发布。
适用场景
如果场景以代码和工具为主(写代码、修 bug、运行终端、调用 API、搭建 Agent),Flash 正式版即可满足。
模型支持 100 万 token 上下文和 38.4 万 token 最大输出,兼容 OpenAI ChatCompletions 和 Anthropic Messages 两种 API 格式。

如需上传图片、文件,或依赖 MCP 和 Computer Use,目前暂不支持。

开源信息
DeepSeek-V4-Flash 已在 Hugging Face 开源,MIT 协议,可商用。
已有开发者在两台 DGX Sparks 上跑出 77 token/秒的速度,百万 token 上下文下同时运行 Gemma-4-12B 处理视觉任务。284B 完整 MoE 权重需常驻显存,硬件门槛较高。