8 月 12 日晚间,DeepSeek 将 V4 Pro 从预览版正式转正。官方 API 文档中,deepseek-v4-pro 对应的模型版本已更新为 DeepSeek-V4-Pro-0813,开发者可直接调用,模型名保持不变,无需修改代码。
随后流出的官方评测表,给出了这一版在 Agent 相关评测集上的完整成绩,以及与 Opus-4.8、Fable 5 两个前沿模型的横向对比。
完整评测数据
与 Opus 4.8 的对比:互有胜负
V4-Pro-0813 在四个项目上超过了 Opus-4.8:
- Terminal Bench 2.1:87.9 对 85.0
- Cybergym:83.3 对 78.3
- DeepSWE:62.7 对 58.0
- AutomationBench:31.8 对 27.2
另有 Agents' Last Exam 两者打平,均为 25.7。
但在另外几项上仍然落后:NL2Repo(61.5 对 69.7)、Toolathlon-Verified(74.1 对 76.2)、DSBench-Hard(67.2 对 71.7),DSBench-FullStack 则以 71.1 对 71.6 略微落后。
HLE 一项比较特殊:不带工具时 V4-Pro 为 42.7,明显低于 Opus 的 49.8;但带工具后反超,60.0 对 57.9。
与 Fable 5 的对比:差距仍在,但个别项已反超
在有对照数据的项目中,V4-Pro-0813 有两项超过 Fable 5:
- Cybergym:83.3 对 83.1(小幅领先)
- AutomationBench:31.8 对 29.1(该项三个模型中最高)
Terminal Bench 2.1 上几乎追平,87.9 对 88.0,差距仅 0.1。
但在其余项目上差距仍然明显:DeepSWE(62.7 对 70.0)、DSBench-FullStack(71.1 对 77.2)、Toolathlon-Verified(74.1 对 77.9),HLE 差距最大(42.7/60.0 对 53.3/63.0)。
需要注意表中对 Fable 5 的标注是 "w/ fallback",即带回退机制下的成绩。
预览版到正式版:跃升幅度很大
对比同系列的预览版,这次更新的提升幅度相当可观:
- DeepSWE:12.8 → 62.7,涨了近 5 倍
- DSBench-FullStack:41.8 → 71.1
- DSBench-Hard:31.1 → 67.2
- Cybergym:52.7 → 83.3
- AutomationBench:12.8 → 31.8
- NL2Repo:38.5 → 61.5
- Terminal Bench 2.1:72.1 → 87.9
几乎所有项目都有大幅提升,其中 DeepSWE 的变化最为夸张。
一个容易被忽略的细节:Flash 也很能打
这张表里还藏着另一条信息——V4-Flash-0731 的成绩相当接近 Opus-4.8:
- Terminal Bench 2.1:82.7,对 Opus 的 85.0
- Cybergym:76.7,对 78.3
- Toolathlon-Verified:70.3,对 76.2
- Agents' Last Exam:25.2,对 25.7
而 Flash 的价格只有 Pro 的三分之一(按每百万 token 计,缓存未命中输入 1 元对 3 元,输出 2 元对 6 元)。
对于成本敏感、调用量大的场景,这个性价比关系值得单独算一笔账。
定价与规格
按每百万 token 计算:
| V4 Pro V4 Flash | ||
| 输入(缓存命中) | 0.025 元 | 0.02 元 |
| 输入(缓存未命中) | 3 元 | 1 元 |
| 输出 | 6 元 | 2 元 |
其他规格:
- 上下文窗口 100 万 token,最大输出 384,000 token
- 总参数 1.6 万亿,激活参数规模大于 Flash
- 并发限制:Pro 为 500,Flash 为 2500
- 支持三种模式:非思考、高推理档、最大推理档
- 新增支持 Responses API 格式与 Codex 接入
社区实测:评价并不一致
官方数据亮眼,但开发者社区的初步反馈存在分歧。
有开发者认为其"benchmark 与 K3 不相上下",代码深度和思考泛化能力比 V4 Flash 好不少。
也有偏负面的评价。一篇标题为《抛开价格不谈不算强,不过抛不开》的测评指出,该版本在前端风格和习惯上与 V4 Flash 差别不大,推测两者使用了同一套后训练语料;结论是抛开价格不算出众,但考虑价格性价比仍不错。
还有开发者报告,在图形渲染管线相关的 demo 测试中,使用完全相同的提示词,V4 Pro 连续三次生成失败,而 V4 Flash 在同样任务上能够成功,实测输出速度约 80–90 token/s。
这类单点样本不足以推翻榜单结论,但提示了一个常见现象:基准分数与具体场景下的实际表现未必一致。
需要说明的几点
评测数据来自 DeepSeek 官方,为厂商自报口径,截至目前尚无独立第三方对 0813 版本进行复现。
该评测表的原始出处为官方微信群,DeepSeek 未通过公开渠道正式发布,后经技术社区流出。
8 月 6 日的涨价预告至今没有下文——官方尚未公布新费率和生效时间,本文所列价格为当前 API 文档所示。
模型越来越便宜、Agent 调用越来越频繁,真正会卡住业务的往往不再是模型本身,而是那条把请求送出去、把结果拿回来的路。万联专注企业跨境网络与 AI 接入加速,让高频调用稳定跑得下去。有需要可以聊聊。
