当前位置: 首页 > news >正文

刚刚 DeepSeek V4 Pro 0813正式发布:Pro终于把旗舰位置拿回来了

就在刚刚,DeepSeek V4 Pro 正式版上线,底层版本号为DeepSeek-V4-Pro-0813

这次不只是 API 页面换了一个日期。DeepSeek 随后放出的正式版跑分显示,0813 在代码 Agent、工具调用和自动化任务上都有明显提升。7 月底,参数更小的 V4 Flash 0731 曾在九项 Agent 测试中全面超过 Pro 预览版;不到两周,Pro 又把差距拉了回来。

先说结论:V4 Pro 0813 在 DeepSeek 自家模型中重新坐稳旗舰位置,也进入了当前 Agent 模型的第一梯队。不过,它没有全面超过 Kimi K3、Opus 4.8 和 Fable 5。

图:DeepSeek 官方公布的 V4 Pro 0813 模型对比成绩,2026 年 8 月 13 日。

这次正式发布了什么

DeepSeek 官方 API 文档已经将deepseek-v4-pro指向DeepSeek-V4-Pro-0813。原有用户不需要改模型名,也不需要更换 Base URL,重新请求时会直接使用新版本。DeepSeek API 文档

目前确认的规格如下:

项目DeepSeek V4 Pro 0813
API 模型名deepseek-v4-pro
底层版本DeepSeek-V4-Pro-0813
模型结构MoE
总参数量1.6T
每 Token 激活参数49B
上下文长度1M Token
最大输出384K Token
推理模式非思考、思考(默认)
API 支持Chat Completions、Responses、Anthropic 兼容接口
其他能力JSON Output、Tool Calls、前缀续写、FIM
输入模态文本

其中,版本号、上下文、输出上限和接口能力来自当前 API 页面;1.6T 总参数、49B 激活参数来自 DeepSeek V4 Pro 模型卡。官方暂未说明 0813 是否调整了基础架构,从跑分变化的位置看,这轮升级的重点显然落在了后训练和 Agent 能力上。DeepSeek 模型与价格|V4 Pro 官方模型卡

Pro 预览版到 0813:有几项几乎换了一个模型

先看 DeepSeek 内部的纵向对比。除 HLE 外,下面的分数均为单项成绩,越高越好;HLE 分别列出不使用工具和使用工具的成绩。

BenchmarkV4 Pro 0813V4 Flash 0731V4 Pro Preview0813 相比 Pro Preview
HLE(不用/使用工具)42.7 / 60.037.8 / 51.537.7 / 48.2+5.0 / +11.8
Terminal Bench 2.187.982.772.1+15.8
NL2Repo61.554.238.5+23.0
Cybergym83.376.752.7+30.6
DeepSWE62.754.412.8+49.9
Toolathlon-Verified74.170.355.9+18.2
Agents’ Last Exam25.725.216.5+9.2
AutomationBench(Public)31.825.112.8+19.0
DSBench-FullStack71.168.741.8+29.3
DSBench-Hard67.259.631.1+36.1

最夸张的是 DeepSWE:12.8 涨到 62.7,增加了 49.9 分。Cybergym、DSBench-FullStack 和 DSBench-Hard 也分别提高 30.6、29.3 和 36.1 分。这几项都涉及较长链路的代码修改、环境操作或工具调用,刚好也是 V4 Pro 预览版最容易掉链子的地方。

这组变化很难用“多想一会儿”解释。更合理的判断是,0813 进行了面向代码 Agent 的大规模后训练,补齐了预览版在工具使用和长任务执行上的短板。

相比 V4 Flash 0731,Pro 0813 在表中所有项目也都领先,但差距没有它对预览版那么夸张:Terminal Bench 高 5.2 分,DeepSWE 高 8.3 分,DSBench-FullStack 只高 2.4 分,Agents’ Last Exam 更是只高 0.5 分。

所以 Flash 0731 并没有突然失去价值。它仍是更便宜、更快的选择;Pro 的优势主要出现在更难、更长、失败成本更高的任务里。

和 GLM、Kimi、Claude 放在一起,V4 Pro 到了什么位置

官方图同时列出了 GLM 5.2、Kimi K3、Opus 4.8,以及带 fallback 的 Fable 5。完整成绩如下:

BenchmarkV4 Pro 0813GLM 5.2Kimi K3Opus 4.8Fable 5(含 fallback)
HLE(不用/使用工具)42.7 / 60.040.5 / 54.743.5 / 56.049.8 / 57.953.3 / 63.0
Terminal Bench 2.187.981.088.385.088.0
NL2Repo61.548.969.7
Cybergym83.380.078.383.1
DeepSWE62.746.267.558.070.0
Toolathlon-Verified74.159.976.576.277.9
Agents’ Last Exam25.723.827.625.7
AutomationBench(Public)31.812.930.827.229.1
DSBench-FullStack71.161.873.771.677.2
DSBench-Hard67.254.563.071.768.3

V4 Pro 0813 有两个明确的单项第一:

  • Cybergym 83.3,略高于 Fable 5 的 83.1;
  • AutomationBench Public 31.8,高于 Kimi K3 的 30.8、Fable 5 的 29.1 和 Opus 4.8 的 27.2。

Terminal Bench 2.1 的 87.9 也已经贴近最高水平:比 Opus 4.8 高 2.9 分,距离 Kimi K3 只有 0.4 分,距离 Fable 5 只有 0.1 分。

短板同样很清楚。HLE 不使用工具时,V4 Pro 0813 只有 42.7,落后 Opus 4.8 的 49.8 和 Fable 5 的 53.3;DeepSWE、Toolathlon 和 DSBench-FullStack 也没有拿到第一。NL2Repo 则以 61.5 落后 Opus 4.8 的 69.7。

这不是一张“DeepSeek 全面碾压”的表。更准确的说法是:V4 Pro 0813 在终端操作、安全和自动化工作流上已经能和头部闭源模型正面对打,但在纯知识推理与部分复杂软件工程任务上仍有差距。

这张跑分表还要注意三件事

第一,数据来自 DeepSeek 官方,并非第三方独立复测。厂商跑分适合判断模型升级方向,最后是否好用,仍要看同一套 Agent 框架和真实项目里的复现结果。

第二,Fable 5 一栏明确写有w/ fallback,说明部分任务可能触发后备模型。它和单一模型的直接比较需要留一点余地。

第三,DSBench-FullStack 与 DSBench-Hard 是 DeepSeek 自有测试集。它们能反映内部优化成果,但外部目前无法像公开 Benchmark 那样完整核验。真正值得优先看的,是 Terminal Bench、DeepSWE、Toolathlon、HLE 等公开项目。

截至发稿,Artificial Analysis 的 V4 Pro 页面仍显示 4 月版本,尚未明确标注完成 0813 重测。此前“Flash 0731 综合分高于 Pro”的第三方结论,现在只能视为旧版 Pro 的历史成绩,不能再拿来代表 0813。Artificial Analysis:V4 Pro

价格没变:Pro 仍然便宜,但不再是 Flash 的平替

DeepSeek 当前的人民币 API 价格如下:

每百万 TokenV4 Flash 0731V4 Pro 0813
输入,缓存命中0.02 元0.025 元
输入,缓存未命中1 元3 元
输出2 元6 元
并发上限2500500

Pro 的缓存命中价只比 Flash 高 0.005 元,但缓存未命中输入和输出都是 Flash 的三倍。对于会反复读取同一个代码仓库、长文档或系统提示词的 Agent,缓存命中价格很有吸引力;普通聊天、批量生成和高并发接口,Flash 依旧更划算。DeepSeek 官方价格页

需要留意的是,官方已经在价格页提示:近期计划整体上调 API 定价,而且“预计涨幅较大”。因此,当前 3 元输入、6 元输出的 Pro 价格不一定会维持很久。

已接入的项目不用改代码

DeepSeek 继续使用滚动模型名deepseek-v4-pro。原来的 Java、Python 或 Node.js 项目不需要迁移接口,只要正常发起请求,就会访问最新的 0813 版本。

{"model":"deepseek-v4-pro","messages":[{"role":"user","content":"阅读这个代码仓库,定位订单重复扣款的原因并提交修复方案"}],"thinking":{"type":"enabled"},"reasoning_effort":"max","stream":true}

OpenAI 兼容接口仍是https://api.deepseek.com,Anthropic 兼容接口为https://api.deepseek.com/anthropic

滚动升级虽然省事,生产环境仍建议保留版本切换前后的回归样例。0813 对 Agent 行为改动很大,同一条提示词的工具选择、思考长度和输出格式都可能变化。至少应重新测试函数调用、JSON 输出、超时设置和 Token 上限,不要只看接口是否返回 200。

最后说几句

V4 Pro 0813 最重要的变化,是把预览版“题做得不错,但 Agent 容易翻车”的印象扭了回来。

DeepSWE 从 12.8 到 62.7,Cybergym 从 52.7 到 83.3,Terminal Bench 从 72.1 到 87.9。这不是边角修补。虽然 DeepSeek 还没有公布 0813 的完整训练细节,但从提升集中的项目看,代码 Agent 显然是这轮更新的主线。Flash 0731 先展示了后训练带来的跃升,Pro 0813 随后又把上限往前推了一截。

当然,官方跑分只是第一张成绩单。V4 Pro 0813 能否在不同 Agent 框架、真实代码库和长时间任务中保持稳定,还要等第三方复测。至少从今天这张表看,DeepSeek 已经回答了一个最直接的问题:

Pro 为什么叫 Pro?这次终于有一组说得过去的答案了。


资料来源

  1. DeepSeek 官方发布的 V4 Pro 0813 跑分对比图,2026 年 8 月 13 日
  2. DeepSeek:首次调用 API
  3. DeepSeek:模型与价格
  4. DeepSeek:更新日志
  5. DeepSeek V4 Pro 官方模型卡
  6. DeepSeek V4 Flash 0731 官方模型卡
  7. Artificial Analysis:DeepSeek V4 Pro

信息核验时间:2026 年 8 月 13 日。模型版本、价格和第三方榜单可能继续更新。

http://www.cnnetsun.cn/news/4026557.html

相关文章:

  • C语言函数递归:从“自己调用自己“到“大事化小“的完整复盘
  • RPG Maker MV解密神器上手指南:不用装软件,浏览器一键解锁加密资源
  • AI时代最残酷的真相:就业、工资和社保正在被重构
  • 线程池的自定义异常处理机制
  • Redis Vector Search 加缓存,先设计失效和回源
  • 2026 分账系统选型指南:原生、第三方、四方系统如何区分?认清伪合规陷阱
  • Skills vs MCP:Agent能力扩展的双螺旋
  • UVM Adapter:寄存器模型与总线的“翻译官”
  • ChatGPT转 word 工具推荐:首选「AI 导出鸭」平板版,专为iPad/安卓平板深度适配ChatGPT等主流AI,一键无损导出Word,完整保留公式、代码与流程图,让大屏导出更高效。
  • 依赖数据迁移工具做增量同步有哪些易错点?调整数据迁移工具策略怎么保证断点续传可靠?
  • 工业物联网设备接入从2天压缩到2分钟:AI原生物联底座实测
  • 不手写推导模型和 Jacobian,如何把 OCP/MPC 模型生成可部署 C++ SDK
  • 浏览器直达服务器串口:百敖基于 openUBMC 的 Web SOL 技术实践
  • 企业微信 iPad 协议 SCRM 开发效果实测
  • RAG的向量数据库:为LLM提供语义搜索能力
  • 【C++】13. 继承
  • Go 语言入门笔记(一):从零搭环境到跑通第一个程序
  • Windows 11 越来越卡?Win11Debloat 一键系统优化与隐私清理终极指南
  • 流放之路价格查询终极助手:这款免费开源工具,5分钟告别手动比价
  • 猫抓资源嗅探扩展使用路线图:3个成长阶段,把网页视频音频图片全拿下
  • 不用模拟器也能在 Windows 上装安卓应用:APK Installer 三步入门指南
  • 动态规划专练:力扣第1035、392题
  • 十大最佳 AI 编码工具
  • 混合办公两难:视频会议私有化部署频频失守的真相
  • 第一次让 AI 帮你写代码:用 JavaScript 完成一个待办事项清单
  • C语言基础:操作符详解(一)
  • 中级开发者用 AI,最容易掉进的 5 个坑
  • 从Cursor到多智能体:2026年AI全栈开发工具到底该怎么选?
  • 误删、格式化、硬盘罢工之后:TestDisk与PhotoRec免费数据恢复工具完整自救手册
  • 微信投票活动全攻略:从选工具到落地执行