模型发布

DeepSeek-V4-Pro 正式版发布,Agent 能力成最大升级看点

DeepSeek 在 API 更新日志中正式推出 V4-Pro 模型,APP、网页端与 API 三端同步开放,模型名为 deepseek-v4-pro。新版本主打 Agent 能力,HLE 带工具成绩 60.0、Terminal Bench 2.1 跑出 87.9,适合需要稳定工具调用和长任务执行的开发者和团队。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
DeepSeek-V4-Pro 正式版发布,Agent 能力成最大升级看点

DeepSeek 近日在 API 更新日志中上线 V4-Pro 正式版。模型名定为 deepseek-v4-pro,APP、网页端与 API 三端同步开放,用户无需额外申请即可调用。

核心更新点

这次更新的关键词是 Agent。从官方给出的成绩看,新模型在需要工具调用和多步推理的基准上有明显跃升:HLE(带工具)拿到

60.0 分,无工具条件下

42.7 分;Terminal Bench

2.1 跑出

87.9。这些数字是 Agent 工作流最常用的判断依据。

HLE(Humanity's Last Exam)覆盖大量需要检索和推理的题目,Terminal Bench 2.1 则偏重在终端里跑长任务,例如代码生成、文件操作、调试。两者一起提升,意味着模型不只是答得准,而是更能在真实工具链里独立干活。

上手与接入

对开发者来说,最直接的接入路径是 API。把模型参数换成 deepseek-v4-pro 即可体验正式版能力。网页端和 APP 同步上线,则让非技术用户也能立刻试用,不必配置客户端或等待排队。

对开发者和团队的含义

如果你已经在用 DeepSeek 跑批量任务,升级前值得做三件事:先用真实流量回放一遍 Agent 链路,确认工具解析和错误重试稳定;其次,对成本敏感的项目要对比新旧版本的 token 单价;最后给工作流留好回退开关,避免边界 case 上的表现与预期不一致。

对独立创作者和小团队,V4-Pro 的工具能力提升意味着可以少写很多补丁 prompt。比如让模型直接拉取数据、生成脚本、跑命令并整理报告,原本需要拆成三四个步骤,现在有机会压成一个端到端流程。

值得继续观察的几件事

一是 V4-Pro 与上一代的速度、价格对比,官方尚未给出完整对照表;二是工具调用在企业内网场景下的稳定性,特别是权限受限、响应慢的接口;三是上下文窗口与多模态扩展,V4-Pro 仍以文本和代码为主,后续是否推出视觉版本值得跟踪。

整体看,DeepSeek 这次把"会调用工具"当作正式版的主打卖点,说明国产模型正在从答得对过渡到能办事。对国内 AI 工具使用者和海外华人开发者来说,V4-Pro 提供了一个门槛较低的升级路径。关键是把 Agent 工作流和真实业务对上,而不是只盯着排行榜分数。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具