DeepSeek V4 Pro 正式版:四项超过 Opus 4.8,与 Fable 5 仍有差距

8 月 12 日晚,DeepSeek 将 V4 Pro 从预览版转正,模型名不变、无需改代码即可调用。随后流出的官方评测表显示:V4-Pro-0813 在 Terminal Bench 2.1、Cybergym、DeepSWE、AutomationBench 四项上超过 Opus 4.8,与 Fable 5 差距缩小但仍存在。表里还藏着另一条线索——只要三分之一价格的 Flash,成绩已相当接近 Opus。

朱辉阳
万联SD-WAN
资讯
10 阅读
DeepSeek V4 Pro 正式版:四项超过 Opus 4.8,与 Fable 5 仍有差距

8 月 12 日晚间,DeepSeek 将 V4 Pro 从预览版正式转正。官方 API 文档中,deepseek-v4-pro 对应的模型版本已更新为 DeepSeek-V4-Pro-0813,开发者可直接调用,模型名保持不变,无需修改代码。

随后流出的官方评测表,给出了这一版在 Agent 相关评测集上的完整成绩,以及与 Opus-4.8、Fable 5 两个前沿模型的横向对比。

完整评测数据

与 Opus 4.8 的对比:互有胜负

V4-Pro-0813 在四个项目上超过了 Opus-4.8:

  • Terminal Bench 2.1:87.9 对 85.0
  • Cybergym:83.3 对 78.3
  • DeepSWE:62.7 对 58.0
  • AutomationBench:31.8 对 27.2

另有 Agents' Last Exam 两者打平,均为 25.7。

但在另外几项上仍然落后:NL2Repo(61.5 对 69.7)、Toolathlon-Verified(74.1 对 76.2)、DSBench-Hard(67.2 对 71.7),DSBench-FullStack 则以 71.1 对 71.6 略微落后。

HLE 一项比较特殊:不带工具时 V4-Pro 为 42.7,明显低于 Opus 的 49.8;但带工具后反超,60.0 对 57.9。

与 Fable 5 的对比:差距仍在,但个别项已反超

在有对照数据的项目中,V4-Pro-0813 有两项超过 Fable 5:

  • Cybergym:83.3 对 83.1(小幅领先)
  • AutomationBench:31.8 对 29.1(该项三个模型中最高)

Terminal Bench 2.1 上几乎追平,87.9 对 88.0,差距仅 0.1。

但在其余项目上差距仍然明显:DeepSWE(62.7 对 70.0)、DSBench-FullStack(71.1 对 77.2)、Toolathlon-Verified(74.1 对 77.9),HLE 差距最大(42.7/60.0 对 53.3/63.0)。

需要注意表中对 Fable 5 的标注是 "w/ fallback",即带回退机制下的成绩。

预览版到正式版:跃升幅度很大

对比同系列的预览版,这次更新的提升幅度相当可观:

  • DeepSWE:12.8 → 62.7,涨了近 5 倍
  • DSBench-FullStack:41.8 → 71.1
  • DSBench-Hard:31.1 → 67.2
  • Cybergym:52.7 → 83.3
  • AutomationBench:12.8 → 31.8
  • NL2Repo:38.5 → 61.5
  • Terminal Bench 2.1:72.1 → 87.9

几乎所有项目都有大幅提升,其中 DeepSWE 的变化最为夸张。

一个容易被忽略的细节:Flash 也很能打

这张表里还藏着另一条信息——V4-Flash-0731 的成绩相当接近 Opus-4.8:

  • Terminal Bench 2.1:82.7,对 Opus 的 85.0
  • Cybergym:76.7,对 78.3
  • Toolathlon-Verified:70.3,对 76.2
  • Agents' Last Exam:25.2,对 25.7

而 Flash 的价格只有 Pro 的三分之一(按每百万 token 计,缓存未命中输入 1 元对 3 元,输出 2 元对 6 元)。

对于成本敏感、调用量大的场景,这个性价比关系值得单独算一笔账。

定价与规格

按每百万 token 计算:

 V4 Pro V4 Flash
 输入(缓存命中)0.025 元0.02 元
输入(缓存未命中)3 元1 元
输出6 元2 元

其他规格:

  • 上下文窗口 100 万 token,最大输出 384,000 token
  • 总参数 1.6 万亿,激活参数规模大于 Flash
  • 并发限制:Pro 为 500,Flash 为 2500
  • 支持三种模式:非思考、高推理档、最大推理档
  • 新增支持 Responses API 格式与 Codex 接入

社区实测:评价并不一致

官方数据亮眼,但开发者社区的初步反馈存在分歧。

有开发者认为其"benchmark 与 K3 不相上下",代码深度和思考泛化能力比 V4 Flash 好不少。

也有偏负面的评价。一篇标题为《抛开价格不谈不算强,不过抛不开》的测评指出,该版本在前端风格和习惯上与 V4 Flash 差别不大,推测两者使用了同一套后训练语料;结论是抛开价格不算出众,但考虑价格性价比仍不错。

还有开发者报告,在图形渲染管线相关的 demo 测试中,使用完全相同的提示词,V4 Pro 连续三次生成失败,而 V4 Flash 在同样任务上能够成功,实测输出速度约 80–90 token/s。

这类单点样本不足以推翻榜单结论,但提示了一个常见现象:基准分数与具体场景下的实际表现未必一致。

需要说明的几点

评测数据来自 DeepSeek 官方,为厂商自报口径,截至目前尚无独立第三方对 0813 版本进行复现。

该评测表的原始出处为官方微信群,DeepSeek 未通过公开渠道正式发布,后经技术社区流出。

8 月 6 日的涨价预告至今没有下文——官方尚未公布新费率和生效时间,本文所列价格为当前 API 文档所示。

模型越来越便宜、Agent 调用越来越频繁,真正会卡住业务的往往不再是模型本身,而是那条把请求送出去、把结果拿回来的路。万联专注企业跨境网络与 AI 接入加速,让高频调用稳定跑得下去。有需要可以聊聊。

分享文章

返回博客列表