DeepSeek V4 Pro 正式版技术解读:后训练驱动 Agent 能力跃升

2026 年 8 月 13 日,DeepSeek 在官网 API 文档页悄然更新了一行模型版本号:deepseek-v4-pro 的 fingerprint 从预览版变为 fp_v4pro_20260812。没有发布会,没有直播,从 4 月 24 日预览版上线到正式版发布,中间隔了 111 天。

在这 111 天里,Kimi K3 高调发布抢走开源头条,同门的 V4 Flash 正式版先行一步于 7 月 31 日上线。而 V4 Pro 正式版最大的变化只有一条:同样的架构、同样的参数量,只做了后训练(post-training),却让 Agent 能力从一个几乎不可用的水平,直接跳到了能和 Claude Opus 4.8、Kimi K3 正面对打的位置。

架构没变,能力暴涨

DeepSeek V4 Pro 正式版 Agent 能力基准测试

V4 Pro 正式版的模型架构与预览版完全一致:1.6T 总参数,49B 激活参数的 MoE(混合专家)结构,支持 1M 上下文长度,最大 384K 输出。同门的 V4 Flash 则是 284B 总参数 / 13B 激活参数。两者共享同一种注意力机制创新:Token-wise 压缩配合 DSA(DeepSeek Sparse Attention),在保持 1M 上下文的同时大幅降低推理所需的计算和内存开销。

变化发生在后训练阶段。DeepSeek 官方在 V4 Flash 正式版更新日志中明确写道:Flash-0731 保持了与 Flash-Preview 相同的模型结构和尺寸,仅重新进行了后训练,就让 Agent 基准测试成绩远超 V4-Pro-Preview。Pro 正式版走的同一条路:不改架构,专攻代码 Agent 场景的大规模后训练。

Agent 基准测试:从不可用到一线水平

V4 Pro 正式版在 Agent 相关评测上的提升幅度可以用「脱胎换骨」来形容。以下数据来自 DeepSeek 官方基准测试表和社区整理:

基准测试V4-Pro-0813V4-Flash-0731V4-Pro-PreviewGLM-5.2Kimi-K3Opus-4.8Fable 5
HLE(无工具/有工具)42.7/60.037.8/51.537.7/48.240.5/54.743.5/56.049.8/57.953.3/63.0
Terminal Bench 2.187.982.772.181.088.385.088.0
NL2Repo61.554.238.548.9-69.7-
Cybergym83.376.752.7-80.078.383.1
DeepSWE62.754.412.846.267.558.070.0
Toolathlon-Verified74.170.355.959.976.576.277.9
Agents' Last Exam25.725.216.523.827.625.7-
AutomationBench (Public)31.825.112.812.930.827.229.1
DSBench-FullStack71.168.741.861.873.771.677.2
DSBench-Hard67.259.631.154.563.071.768.3

DeepSWE 是变化最剧烈的单项。预览版只有 12.8 分,正式版飙到 62.7,涨了近 50 分。这个基准测试评估模型解决真实软件工程问题的能力,涉及长链路的代码修改、环境操作和工具调用,恰好是预览版最容易翻车的场景。

Cybergym 从 52.7 升至 83.3,Terminal Bench 2.1 从 72.1 提至 87.9,DSBench-Hard 从 31.1 翻倍至 67.2。这些测试有一个共同特点:都需要模型在多步骤的任务流程中自主决策,而不是单轮回答一个问题。

与竞品的对比

把 V4 Pro 0813 放到竞品中看,它在部分项目中已经追平或超越了一线闭源模型。Terminal Bench 2.1 的 87.9 分超过 Opus-4.8 的 85.0,仅次于 Kimi-K3 的 88.3 和 Fable 5 的 88.0。Cybergym 的 83.3 分甚至微超 Fable 5 的 83.1。

但 Pro 正式版并非全面领先。纯知识推理方面,HLE(不使用工具)只有 42.7 分,落后 Opus-4.8 的 49.8 和 Fable 5 的 53.3。NL2Repo 以 61.5 分落后 Opus-4.8 的 69.7。在 Kimi K3 占优的 DeepSWE(67.5 vs 62.7)、Toolathlon(76.5 vs 74.1)、DSBench-FullStack(73.7 vs 71.1)等项目上,V4 Pro 仍有轻微差距。

多模态:从纯文本到图像推理

预览版是纯文本模型,正式版首次原生支持图像推理。DeepThink 引擎现在可以在同一个思考流程中分析图片、解读截图、处理混合文档。对于需要视觉理解的 Agent 场景(例如分析 UI 截图、解读数据图表、处理带图文档),这是从无到有的能力补充。

V4 Pro 正式版同时原生支持 OpenAI Responses API 格式,并专门适配了 Codex 工作流。开发者可以在 DeepSeek API 文档中找到一键配置方法,直接用 Codex 风格的 Agent 循环调用 V4 Pro。

价格策略:从固定到分时

V4 Pro 正式版发布同时,DeepSeek 宣布调整 API 定价模式。8 月 16 日 16:00 UTC 起执行新的分时计价:

模型时段输入(缓存命中)输入(缓存未命中)输出
V4-Flash非高峰$0.007$0.22$0.66
V4-Flash高峰$0.014$0.44$1.32
V4-Pro非高峰$0.022$0.66$1.98
V4-Pro高峰$0.044$1.32$3.96

高峰时段为 UTC 01:00-04:00 和 06:00-10:00(对应北京时间 09:00-12:00 和 14:00-18:00),其余时段为非高峰,价格为高峰的一半。非高峰时段的 V4 Pro 输出价格为 $1.98/百万 token,相比 Kimi K3 的 $15/百万 token 约低 7.5 倍。

当前(8 月 16 日前)V4 Pro 仍执行旧定价:输入 $0.435/百万 token(缓存未命中),输出 $0.87/百万 token。DeepSeek 在 8 月 6 日已预告计划近期上调 API 定价,这次分时计价是涨价的第一步。

DeepSeek Harness:Agent 框架即将到来

V4 Flash 正式版更新日志中藏着一条关键信息:官方基准测试使用了「DeepSeek Harness 极简模式(即将发布)」作为 Agent 框架,采用 max 档位、top_p=0.95、temperature=1.0。结合近期 DeepSeek 注册「DeepSeek Harness 团队」公众号和招聘 Agent Harness 产品经理、研发工程师的信息,DeepSeek 正在把模型和 Agent 运行框架打包推出。

Harness 在 AI 工程领域指的是位于大模型之上的工程层,负责工具调用、记忆管理、子代理编排和终止逻辑。Anthropic 在 2025 年底至 2026 年初推广了这个概念。社区讨论中,Artificial Analysis 的数据显示,同一个模型换用不同的 Harness 可以产生约 10 分的编码 Agent 指数差异,相当于 GPT-5.6 Sol Max 和 Luna Max 之间的差距。

DeepSeek Harness 的定位是对标 Claude Code 的编程 Agent 产品。官方在招聘信息中要求候选产品经理熟悉 Claude Code、Codex、Cursor、OpenCode、GitHub Copilot、Manus 等产品。极简模式只是第一个版本,完整的 Harness 产品还在开发中。

开发者实际影响

对于已经使用 DeepSeek API 的开发者,迁移成本几乎为零。模型名称不变(deepseek-v4-pro),API 调用方式不变,只是底层模型自动切换到了 0813 版本。支持的功能包括 JSON 输出、工具调用、Responses API、Anthropic API 格式、Chat Prefix Completion。

V4 Pro 的并发限制为 500(V4 Flash 为 2500),开发者需要根据 Agent 工作负载调整并发策略。利用缓存可以显著降低成本:缓存命中的输入价格只有缓存未命中的约 3%,标准 Agent 循环中的缓存命中率通常可以达到 90% 以上。

对于需要 Agent 执行复杂代码任务的开发者,V4 Pro 正式版的定位是一线开源权重模型中最具性价比的选择。DeepSWE 62.7、Terminal Bench 87.9、Cybergym 83.3 的组合,在每百万 token 输出 $0.87 的价格下,已经可以直接用于生产环境的代码 Agent 工作流。

来源:DeepSeek 官方 API 文档V4 Pro GA 发布公告Hacker News 讨论