一句话结论:DeepSeek V4 Pro 从预览版跳到正式版,是近半年最大幅度的一次更新 —— Agent 类任务上多项第一,部分指标已经超过我日常用的 Opus-4.8。

一、刷到更新,先看官方文档

最近打开 DeepSeek 接口文档的时候,第一眼就注意到 deepseek-v4-pro 这个模型版本号悄悄换了 —— 从预览版的快照换成了正式版:

DeepSeek 接口文档 · 模型与价格

模型名从一堆 -Preview 编号收敛到了一个非常工程化的命名:DeepSeek-V4-Pro-0813。从命名上就能看出来,这次不是常规迭代,是 8 月 13 日定档的正式发版。

二、Agent 评测:正式版相对预览版是跨越式升级

如果只看 V4 Pro 自己的数据,正式版相对预览版在多个 Agent 基准上几乎是从”还能用”跨到”第一梯队”。下面是官方放出的关键数据:

  • Terminal Bench 2.1:87.9(全场最高)
  • CyberGym:83.3(排名第一)
  • HLE w/ tools:60.0(超过 Opus-4.8 的 57.9)
  • AutomationBench:31.8(明显领先同类模型)

V4 Pro 正式版 vs 其他前沿模型 · Agent 评测对比

几个值得注意的观察:

  • DeepSWE 从 12.8 跳到 62.7,一个版本涨了近 5 倍 —— 这意味着 V4 Pro 在真实软件工程任务上的可用性发生了质变,不再是”能跑通但慢、且容易卡死”的预览版状态。
  • HLE w/ tools 这条线 V4 Pro 反超了 Opus-4.8。HLE(Humanity’s Last Exam)一直是公认的硬骨头,能在带工具的设置下超过 Opus-4.8,说明 V4 Pro 不只是”刷分型选手”,是真的在用工具思考。
  • 部分指标已经逼近带 fallback 的 Fables 系列 —— 这是 Anthropic 上一代最强档位的水平。

三、我的第一感受:把它接进 Claude Code 工作流

光看评测没用,得上手跑一跑才知道。我现在主力是用 Claude Code 做长程 Agent 任务,刚好把 V4 Pro 接进来当 fallback —— 简单场景用 Opus-4.8,复杂、容易卡住的任务让 V4 Pro 顶上。

跑下来的直观感受有三点:

  1. 响应明显更快。同一个多文件重构任务,V4 Pro 的总耗时大概只有 Opus-4.8 的 60% 左右,尤其是工具调用之间的停顿短了不少,做长链任务时体感差距明显。
  2. 工具调用更”敢”。预览版的 V4 Pro 在权限决策上偏保守,常常需要反复确认才能继续;正式版会一次性给出更完整的工具调用计划,减少人为确认的次数。
  3. 多步任务里”跑偏”的次数明显变少。这是 DeepSWE 分数飙升最直接的反应 —— 跑长链的时候,V4 Pro 不再像预览版那样在第 6、7 步突然开始走神。

当然,正式版也不是万能的:

  • 在极长上下文(接近 1M token)的复杂推理上,Opus-4.8 仍然更稳,V4 Pro 在窗口后半段偶尔会出现”忘记前面约束”的情况。
  • 中文表达的细腻度上 V4 Pro 还有提升空间,写代码注释、PR 描述时偶尔会显得生硬,需要再 review 一遍。

四、怎么用上 V4-Pro-0813

好消息是,模型更新之后不需要改任何调用代码 —— 之前用 deepseek-v4-pro 的请求会自动路由到最新版本(0813)。

如果你已经在用 DeepSeek 的 API,原来的请求继续用就行:

curl https://api.deepseek.com/v1/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [{"role": "user", "content": "..."}]
  }'

模型名保持 deepseek-v4-pro 不变,后端会自动把请求路由到 DeepSeek-V4-Pro-0813 这个快照。官方文档里看到的 0813 是版本标识,不是新的 model 字段。

想确认当前拿到的具体是哪个快照,可以查 DeepSeek 接口文档的”模型 & 价格”页面(上面那张图就是)。

五、一点小判断

DeepSeek 这两年从 V2、V3 一路迭代到 V4,每一代都在”性价比 + 真实工程能力”这两条线上同时往前推。这次 V4 Pro 正式版让我比较意外的是 —— Agent 评测的领先是真实的,不是营销

尤其是 HLE w/ tools 反超 Opus-4.8 这条,意味着国产模型在”会调用工具、能跑长链”这件事上,已经实质性追上了 Anthropic 当前最强档。如果接下来半年还能保持这个迭代节奏,V4 后续版本值得长期盯。


想第一时间跟进这类模型更新、AI 工作流实战和 OpenClaw 多 Agent 实践?欢迎扫码加入「春天的 AI 交流群」,和我一起折腾。

春天的 AI 交流群二维码