
8 月 12 日晚九江家具封边胶,DeepSeek 新官 API 文档,旗舰模型 DeepSeek V4 Pro 0813 正式版(以下统称为 V4 Pro)悄然上线。这是继 7 月 31 日 V4 Flash 0731 转正之后,DeepSeekV4 这代产品补上的后块拼图。
能力面,V4 Pro 的 Agent 能力几乎提升,知名机构 SemiAnalysis 表示,DeepSeek V4 Pro 和 Flash 在 Agent 相关测试中,都甩开了参数大的英伟达Nemotron 3 Ultra模型。
根据 DeepSeek 释放的基准测试数据,V4 Pro 在终端操作、代码工程等基准测试中"猛追" Opus 4.8、Fable 5 这种海外前沿模型,并在部分基准测试中先。
价格上,V4 Pro 定价延续了 DeepSeek 贯的"地板价"策略。根据官页面提供的信息,V4 Pro 每百万 tokens 输入(缓存未命中)3 元、输出6 元,缓存命中输入低至0.025 元。以输出为例,V4 Pro 6 元的输出价格仅为Opus 5 的三十分之、Fable5 的六十分之。
不过需要注意,DeepSeek 也在官页面上预告涨价,且涨幅较大。从这个角度来看,平价的 V4 Pro 可以看作是 DeepSeek 在新模型上线初期引流的场"临时价格战"。
01
1M 上下文、双 API 兼容、全开放
根据 DeepSeek 官文档,V4 Pro 正式版模型版本号为DeepSeek V4 Pro 0813,开发者可通过 deepseek V4 pro 直接调用。与 Flash 版致,V4 Pro 提供OpenAI 格式与Anthropic 格式两套接口。
核心规格面,V4 Pro 支持100 万 tokens 上下文窗口与大 38.4 万 tokens 输出,可以次读入大型代码仓库、企业知识库或长篇文档,并支撑长时间、多步骤的 Agent 任务。
模型默认开启思考模式,同时支持切换为非思考模式,开发者可在响应速度与理度之间自主选择。
V4 Pro 与 Flash 版致:Json Output、Tool Calls、Responses API、Anthropic API、对话前缀续写(Beta)全部支持;FIM 补全(Beta)则在非思考模式下可用。这意味着DeepSeek 在接口层面已经完整对齐了当前主流的 Agent 开发工具链。
价格面,V4 Pro 每百万 tokens 输入(缓存未命中)3 元、输出6 元,缓存命中输入低至0.025 元;Flash 版对应价格为 1 元、2 元与 0.02 元,两者价差恰好三倍,形成"频轻量任务走 Flash、复杂理任务走 Pro "的清晰产品分层。
另外,在并发限制面,Pro 为 500,Flash 为 2500,进步印证了两者的定位差异。
02
Agent 能力代际跃升
根据 DeepSeek 官释放的信息,V4 Pro 0813 在终端操作、代码工程、工具调用、安全攻等维度的基准测试中"猛追" Fable 5 这种海外前沿模型,并在部分基准测试中先。
其中,考察模型在真实终端环境中执行命令、解决系统问题的能力的 Terminal Bench 2.1 中得分 87.9;面向 AI 安全攻场景的 Cybergym 中得分 83.3;聚焦软件工程与数据科学全栈任务的 DeepSWE 与 DSBench 中分别为 62.7、71.1(DSBench-FullStack)、67.2(DSBench-Hard);在考察知识理度的 HLE(Humanity ’ s Last Exam)上,工具 / 带工具成绩分别为 42.7/60.0;在衡量自动化流程的完成质量的 AutomationBench 中得分 31.8。
相比 4 月发布的 V4-Pro 预览版,正式版基准测试释放的能力数据,可以说是代际别的提升:DeepSWE 从 12.8 跃升至 62.7,提升近 5 倍;Cybergym 从 52.7 升至 83.3;AutomationBench 从 12.8 升至 31.8;DSBench-Hard 从 31.1 翻倍至 67.2;Terminal Bench 2.1 也从 72.1 提升至 87.9。
Agent 能力的暴涨,是本次正式版核心的升信号。
与 V4-Flash-0731(平均分约 57.4)相比,V4 Pro 在全部九项基准评测中保持先,尤其在 DeepSWE(62.7 对 54.4)、DSBench-Hard(67.2 对 59.6)等难度任务上拉开了明显差距。
不过也要注意,在主流基准测试中,V4 Pro 并非碾压:在 HLE 工具(纯知识理)与 NL2Repo(代码库理解)两个维度上,它与 Anthropic 旗舰仍存在实实的差距。比较有意思的是—— HLE 加入工具调用后,V4 Pro 以 60.0 对 57.9 反 Opus 4.8,显示其工具使用能力已能弥补纯理的短板。
03
"爆英伟达"不靠参数
V4 Pro 正式版上线后,海外分析机构迅速给出反应。
知名半体与 AI 分析机构 SemiAnalysis 在 X 平台发文祝贺 DeepSeek 发布 V4 Pro 0813(文中称其为" 1.5T "模型),并直言其在 Agent 任务上"大幅击败 NVIDIA 的 Nemotron 3 Ultra "(massively beats Nemotron3 Ultra on agentic tasks)。
SemiAnalysis 同时指出九江家具封边胶,定位低的V4-Flash 0731 同样大幅先 Nemotron 3 Ultra——而 Flash 的激活参数比后者少 4.2 倍、总参数少近 2 倍。
其引用的 Terminal Bench 2.1 数据显示:Nemotron 3 Ultra(NVFP4)得分53.9,相比"轻量版"的 Flash,也差了 29 分,Pro 的先幅度达到 34 分。
除了吹捧 DeepSeek 外,SemiAnalysis 还在跟帖中附上了对 Nemotron 模式的批评—— Nemotron 联盟由多个实验室和公司组成,由 NVIDIA 与 Mistral AI 共同主个基础模型训练,该模型将开源,并作为后续 Nemotron 4 系列模型的基础。SemiAnalysis 认为这种联盟松散不利于和 DeepSeek 这样的实验室竞争,应该在联盟内部采用"赛马机制"引创新。
Semianalysis 贴出来的有关 V4 Pro 和 Flash 模型在" Agent "能力上越英伟达 Nemotron 3 Ultra 的数据,主要反映在两个面:个是广度,个是能力进化幅度。
关于覆盖的广度,前面提到过。V4 Pro 的 Agent 能力并非依赖单点突破,而是横跨九个维度铺开:终端操作、软件工程、数据科学全栈、安全攻等九个维度,都在追前沿模型,万能胶生产厂家甚至过,这种全链条的能力支持,恰恰是 Agent 模型的核心竞争力。
很简单,当前的 Agent 任务,都需要长时间、多步骤地调用工具、处理异常、串联任务,任何块短板都会致整条任务链断裂,所以对模型的要求不是某项激进的先,而是要在各个维度对能力均衡的拔。
所以在提升的幅度上,与 4 月的 Preview 版相比,V4 Pro 正式版在 Agent 维度完成了近乎重做的升:DeepSWE 提升近 5 倍、Cybergym 提升 58、AutomationBench 提升约 1.5 倍、DSBench-Hard 翻倍等等。
另外,Flash 0731 在 Terminal Bench 2.1 上同样拿到 82.7 分,也过英伟达的 Nemotron 3 Ultra,说明整个 V4 系列的 Agent 能力底座已经整体抬升。
结 SemiAnalysis 提到的参数率(激活参数少 4.2 倍),DeepSeek 实际上还证明了件事:Agent 能力的先,可以不再依赖参数规模的堆砌。
还有个值得注意的信号:DeepSeek 的 Agent 团队组建。
据公开报道,该团队于今年 5 月在 DeepSeek 内部立项组建,由崔添翼(浙江大学计机学院毕业、曾任职 Jane Street 近九年)担任负责人,批开放研究员、研发工程师、产品经理三类岗位;崔添翼在社交平台公开表示"部门仍然非常缺人,每天都在面试",并于 8 月 2 日面向全球开发者征集 Harness 内测用户。
8 月 11 日前后," DeepSeek Harness 团队"微信公众号完成注册,认证主体为北京度求索人工智能基础技术研究有限公司,尚未发布内容——这被外界普遍解读为Harness 产品即将发布的前兆。
04
价格战与"临时价比"
与前沿模型基准测试对比中,可以清楚看到:对阵 Claude Opus 4.8,V4Pro 基本平。
在双均有数据的评测项中,V4Pro 赢下五项:Terminal Bench 2.1(87.9 对 85.0)、Cybergym(83.3 对 78.3)、DeepSWE(62.7 对 58.0)、AutomationBench(31.8 对 27.2)以及 HLE 带工具(60.0 对 57.9);Agents ’ Last Exam 双战平(25.7 对 25.7);在 HLE 工具(42.7 对 49.8)、NL2Repo(61.5 对 69.7)等项目中落后。
从均值的角度来看,V4 Pro 为 62.8,Opus 4.8 为 62.6 ——几乎持平。
对阵 Claude Fable 5,V4Pro 贴身紧逼。V4 Pro 在 Cybergym 上以 83.3 对 83.1 实现反,AutomationBench 以 31.8 对 29.1 胜出,Terminal Bench 2.1 仅差 0.1 分(87.9 对 88.0)。平均分 62.8 对 70.5,V4Pro 达到 Anthropic 新旗舰约九成的水平。
Terminal Bench 2.1 项的对比尤其直观:Fable5 得分 88.0、输出价 50 美元,V4Pro 得分 87.9、输出价 0.87 美元——分数相差 0.1,价格相差 57 倍。也就是说,同样跻身梯队的终端 Agent 能力,两者的"入场券"成本不在个量。
如果纵向对比,V4-Pro-Preview 与正式版定价相同,Terminal Bench 成绩却从 72.1 跃升至 87.9,这也可以变相看成加量不加价。
Agent 能力大幅度跃升,但业界对 DeepSeek 的共识在于——价格伤力。
根据公开资料,Anthropic 端旗舰 Claude Opus 5 每百万 tokens 输入 5 美元、输出 25 美元(约人民币 36 元 /180 元,与 Opus 4.8 定价相同);新旗舰 Fable 5 输入 10 美元、输出 50 美元(约 72 元 /360 元)。
以此计,V4 Pro 6 元的输出价格仅为Opus5的三十分之、Fable5 的六十分之。
在整个前沿模型市场,DeepSeek 的价格优势仍然明显:OpenAI 旗舰 GPT-5.6 Sol 输出 30 美元(约 216 元)、均衡型的 GPT-5.6 Terra 输出 12 美元(约 86 元);定位 Coding/Agent 主力的 Claude Sonnet 5 输出 10 美元(约 72 元)。
可以说,DeepSeek 用 V4 Pro 把旗舰 Agent 模型的价格基准线,直接拉低了个数量。不过,这价格窗口可能不会持续太久。DeepSeek 已在官页面明确标注:"计划近期整体上调 DeepSeekAPI 服务的定价,预计涨幅较大。"
所以,DeepSeek V4 Pro 正式版"三十分之、六十分之"价差,本质上是发布初期的窗口期定价——对于正在选型 Agent 底座的开发者而言,当前的低价既是红利,也是倒计时。
但要知道,相比海外模型,DeepSeek 即便是涨价,在能力项毕竟前沿模型的同时,依旧有非常的价格调控空间,或者说价比优势。而关于涨价,Kimi 企业业务负责人黄震昕的此前的观点值得思考。他说:"开源模型、大模型不该被贴上低价标签,我们做出了 SOTA 模型 , 也能匹配理商业定价。"相关词条:罐体保温施工 异型材设备 锚索 玻璃棉 保温护角专用胶
奥力斯 保温护角专用胶批发 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。

