2026 年 8 月 13 日,DeepSeek 在官网 API 文档页悄然更新了一行模型版本号:deepseek-v4-pro 的 fingerprint 从预览版变为 fp_v4pro_20260812。没有发布会,没有直播,从 4 月 24 日预览版上线到正式版发布,中间隔了 111 天。
在这 111 天里,Kimi K3 高调发布抢走开源头条,同门的 V4 Flash 正式版先行一步于 7 月 31 日上线。而 V4 Pro 正式版最大的变化只有一条:同样的架构、同样的参数量,只做了后训练(post-training),却让 Agent 能力从一个几乎不可用的水平,直接跳到了能和 Claude Opus 4.8、Kimi K3 正面对打的位置。
架构没变,能力暴涨

V4 Pro 正式版的模型架构与预览版完全一致:1.6T 总参数,49B 激活参数的 MoE(混合专家)结构,支持 1M 上下文长度,最大 384K 输出。同门的 V4 Flash 则是 284B 总参数 / 13B 激活参数。两者共享同一种注意力机制创新:Token-wise 压缩配合 DSA(DeepSeek Sparse Attention),在保持 1M 上下文的同时大幅降低推理所需的计算和内存开销。
变化发生在后训练阶段。DeepSeek 官方在 V4 Flash 正式版更新日志中明确写道:Flash-0731 保持了与 Flash-Preview 相同的模型结构和尺寸,仅重新进行了后训练,就让 Agent 基准测试成绩远超 V4-Pro-Preview。Pro 正式版走的同一条路:不改架构,专攻代码 Agent 场景的大规模后训练。
Agent 基准测试:从不可用到一线水平
V4 Pro 正式版在 Agent 相关评测上的提升幅度可以用「脱胎换骨」来形容。以下数据来自 DeepSeek 官方基准测试表和社区整理:
| 基准测试 | V4-Pro-0813 | V4-Flash-0731 | V4-Pro-Preview | GLM-5.2 | Kimi-K3 | Opus-4.8 | Fable 5 |
|---|---|---|---|---|---|---|---|
| HLE(无工具/有工具) | 42.7/60.0 | 37.8/51.5 | 37.7/48.2 | 40.5/54.7 | 43.5/56.0 | 49.8/57.9 | 53.3/63.0 |
| Terminal Bench 2.1 | 87.9 | 82.7 | 72.1 | 81.0 | 88.3 | 85.0 | 88.0 |
| NL2Repo | 61.5 | 54.2 | 38.5 | 48.9 | - | 69.7 | - |
| Cybergym | 83.3 | 76.7 | 52.7 | - | 80.0 | 78.3 | 83.1 |
| DeepSWE | 62.7 | 54.4 | 12.8 | 46.2 | 67.5 | 58.0 | 70.0 |
| Toolathlon-Verified | 74.1 | 70.3 | 55.9 | 59.9 | 76.5 | 76.2 | 77.9 |
| Agents' Last Exam | 25.7 | 25.2 | 16.5 | 23.8 | 27.6 | 25.7 | - |
| AutomationBench (Public) | 31.8 | 25.1 | 12.8 | 12.9 | 30.8 | 27.2 | 29.1 |
| DSBench-FullStack | 71.1 | 68.7 | 41.8 | 61.8 | 73.7 | 71.6 | 77.2 |
| DSBench-Hard | 67.2 | 59.6 | 31.1 | 54.5 | 63.0 | 71.7 | 68.3 |
DeepSWE 是变化最剧烈的单项。预览版只有 12.8 分,正式版飙到 62.7,涨了近 50 分。这个基准测试评估模型解决真实软件工程问题的能力,涉及长链路的代码修改、环境操作和工具调用,恰好是预览版最容易翻车的场景。
Cybergym 从 52.7 升至 83.3,Terminal Bench 2.1 从 72.1 提至 87.9,DSBench-Hard 从 31.1 翻倍至 67.2。这些测试有一个共同特点:都需要模型在多步骤的任务流程中自主决策,而不是单轮回答一个问题。
与竞品的对比
把 V4 Pro 0813 放到竞品中看,它在部分项目中已经追平或超越了一线闭源模型。Terminal Bench 2.1 的 87.9 分超过 Opus-4.8 的 85.0,仅次于 Kimi-K3 的 88.3 和 Fable 5 的 88.0。Cybergym 的 83.3 分甚至微超 Fable 5 的 83.1。
但 Pro 正式版并非全面领先。纯知识推理方面,HLE(不使用工具)只有 42.7 分,落后 Opus-4.8 的 49.8 和 Fable 5 的 53.3。NL2Repo 以 61.5 分落后 Opus-4.8 的 69.7。在 Kimi K3 占优的 DeepSWE(67.5 vs 62.7)、Toolathlon(76.5 vs 74.1)、DSBench-FullStack(73.7 vs 71.1)等项目上,V4 Pro 仍有轻微差距。
多模态:从纯文本到图像推理
预览版是纯文本模型,正式版首次原生支持图像推理。DeepThink 引擎现在可以在同一个思考流程中分析图片、解读截图、处理混合文档。对于需要视觉理解的 Agent 场景(例如分析 UI 截图、解读数据图表、处理带图文档),这是从无到有的能力补充。
V4 Pro 正式版同时原生支持 OpenAI Responses API 格式,并专门适配了 Codex 工作流。开发者可以在 DeepSeek API 文档中找到一键配置方法,直接用 Codex 风格的 Agent 循环调用 V4 Pro。
价格策略:从固定到分时
V4 Pro 正式版发布同时,DeepSeek 宣布调整 API 定价模式。8 月 16 日 16:00 UTC 起执行新的分时计价:
| 模型 | 时段 | 输入(缓存命中) | 输入(缓存未命中) | 输出 |
|---|---|---|---|---|
| V4-Flash | 非高峰 | $0.007 | $0.22 | $0.66 |
| V4-Flash | 高峰 | $0.014 | $0.44 | $1.32 |
| V4-Pro | 非高峰 | $0.022 | $0.66 | $1.98 |
| V4-Pro | 高峰 | $0.044 | $1.32 | $3.96 |
高峰时段为 UTC 01:00-04:00 和 06:00-10:00(对应北京时间 09:00-12:00 和 14:00-18:00),其余时段为非高峰,价格为高峰的一半。非高峰时段的 V4 Pro 输出价格为 $1.98/百万 token,相比 Kimi K3 的 $15/百万 token 约低 7.5 倍。
当前(8 月 16 日前)V4 Pro 仍执行旧定价:输入 $0.435/百万 token(缓存未命中),输出 $0.87/百万 token。DeepSeek 在 8 月 6 日已预告计划近期上调 API 定价,这次分时计价是涨价的第一步。
DeepSeek Harness:Agent 框架即将到来
V4 Flash 正式版更新日志中藏着一条关键信息:官方基准测试使用了「DeepSeek Harness 极简模式(即将发布)」作为 Agent 框架,采用 max 档位、top_p=0.95、temperature=1.0。结合近期 DeepSeek 注册「DeepSeek Harness 团队」公众号和招聘 Agent Harness 产品经理、研发工程师的信息,DeepSeek 正在把模型和 Agent 运行框架打包推出。
Harness 在 AI 工程领域指的是位于大模型之上的工程层,负责工具调用、记忆管理、子代理编排和终止逻辑。Anthropic 在 2025 年底至 2026 年初推广了这个概念。社区讨论中,Artificial Analysis 的数据显示,同一个模型换用不同的 Harness 可以产生约 10 分的编码 Agent 指数差异,相当于 GPT-5.6 Sol Max 和 Luna Max 之间的差距。
DeepSeek Harness 的定位是对标 Claude Code 的编程 Agent 产品。官方在招聘信息中要求候选产品经理熟悉 Claude Code、Codex、Cursor、OpenCode、GitHub Copilot、Manus 等产品。极简模式只是第一个版本,完整的 Harness 产品还在开发中。
开发者实际影响
对于已经使用 DeepSeek API 的开发者,迁移成本几乎为零。模型名称不变(deepseek-v4-pro),API 调用方式不变,只是底层模型自动切换到了 0813 版本。支持的功能包括 JSON 输出、工具调用、Responses API、Anthropic API 格式、Chat Prefix Completion。
V4 Pro 的并发限制为 500(V4 Flash 为 2500),开发者需要根据 Agent 工作负载调整并发策略。利用缓存可以显著降低成本:缓存命中的输入价格只有缓存未命中的约 3%,标准 Agent 循环中的缓存命中率通常可以达到 90% 以上。
对于需要 Agent 执行复杂代码任务的开发者,V4 Pro 正式版的定位是一线开源权重模型中最具性价比的选择。DeepSWE 62.7、Terminal Bench 87.9、Cybergym 83.3 的组合,在每百万 token 输出 $0.87 的价格下,已经可以直接用于生产环境的代码 Agent 工作流。