DeepSeek 新旗舰跑一百万字输出只要六块钱,Agent 能力咬住了第一梯队,但它看不了图;Grok 4.6 速度快,可一旦超过 20 万字,账单就翻倍。这篇有官方跑分、有接进 WorkBuddy 的五个实测、有人民币价格,最后落到咱们该不该换、怎么换。
写在前面
大家好,我是宋超。
昨天后半夜到今天凌晨,两个小时之内,DeepSeek 的新旗舰 V4 Pro 正式版和马斯克家的 Grok 4.6 前后脚发布了。
这条我本来可以简单转一下就算了,但咱们班里用 DeepSeek 的人太多,有人用 CC Switch 把 CodeX 接到了 DeepSeek,有人在 WorkBuddy 里配的就是 DeepSeek,这事跟你们的钱包和干活效率都挨着。我花了点时间,把两家的官方文档和跑分表翻了一遍,又看了两篇今早刚出的文章,一篇讲行业格局,一篇把新模型接进 WorkBuddy 做了实测。数据我都核对过了。
结论先放这儿:这两个模型都很猛,但各有一个硬伤,知道了再决定动不动。对咱们大多数人来说,最划算的那条路不用花钱。
这次发布的是正式版,DeepSeek 官方给的编号是 V4-Pro-0813。之前四月份出过一个预览版,很多人试过觉得一般,这次是脱胎换骨。
先看官方自己放出来的跑分表:

这张表列了一堆评测集,名字看着都头大。我挑两个最能说明问题的,用大白话解释一下它们在考什么。
第一个叫 Terminal Bench。你可以把它理解成:把模型直接扔进电脑的命令行里,让它自己装环境、敲命令、遇到报错自己想办法,最后真把活干完。这考的是「能不能独立干成一件事」,跟咱们平时让 CodeX 自己跑任务是一回事。
这一项,V4 Pro 正式版考了 87.9 分。预览版是 72.1,一次涨了 15 分。Claude 那边最强的 Fable 5 是 88.0 分,Opus 4.8 是 85.0 分。
差 Fable 5 零点一分,反超了 Opus 4.8。
第二个叫 DeepSWE,考的是更接近真实的软件开发:读懂一整个代码项目,然后处理里面复杂的工程问题。V4 Pro 考了 62.7,预览版只有 12.8。Fable 5 是 70.0,Opus 4.8 是 58.0。
这项它还差 Fable 5 一截,但同样超过了 Opus 4.8。
表里另外几项也可以看看。网络安全那项(Cybergym)它 83.3 分,Fable 5 是 83.1,它反超了。数据科学的难题那项(DSBench-Hard)它 67.2,Fable 5 是 68.3,几乎咬住。
给它工具、让它动手操作,DeepSeek V4 Pro 已经挤进第一梯队了。不给工具、光靠它肚子里的知识和推理,跟 Fable 5 还差十几分。
今早爱范儿也发了一篇实测。他们用的工具正好是咱们熟悉的 WorkBuddy,做的也是普通人能看懂的活,比跑分好懂。
第一个任务,他们让它从「微信读书 Skill」里读出八月的读书数据,做成一个 HTML 数据报表。
这活儿不难。有意思的是它多做的一步:它跑去翻了文件库里另一个跟这次任务无关的「爱范儿设计规范 Skill」,按那套规范给报表配上了公司的专属配色。

没人告诉它要这么干。正在搞 Skill 大赛的同学可以记一下这件事:Skill 不光是被动等着被调用,模型够聪明的时候,它会自己判断该把哪几个凑起来用。
再往后,他们让它做一个新闻网站首页,提示词写得相当模糊,没规定版式,没规定风格。它自己搜了近期真实的科技新闻,模仿传统媒体做了衬线字体的版式,还「手绘」了一张配图。
还有俄罗斯方块和一个模拟鸟群飞行的互动组件,方块带了点伪 3D 的效果:

布置这几个任务的时候,作者只跟它说了一句「我要去睡觉」。做什么方向、怎么实现,全是模型自己掂量的。
这句话比跑分更能说明「Agent 能力」是什么意思。你给个大概方向,它把模糊的要求拆成清楚的需求,自己规划,分步做完。
我去 DeepSeek 官方定价页核对了当前价格,直接说人民币,按每百万 Token 算(一百万 Token 大概相当于一两百万汉字):
输入,缓存没命中 3 元,缓存命中只要 0.025 元。输出 6 元。
让它吐出一百万字的东西,六块钱。
Claude 那边的 Fable 5 是输入 10 美元、输出 50 美元。输出这一项,DeepSeek 便宜了大约 57 倍。缓存命中的输入差了将近 300 倍。
这里插一句「缓存命中」是什么意思,之前的精选里也讲过:同一场对话里,你每次提问都会自动带上前面的聊天记录,这些「旧内容」它刚处理过、还热乎着,不用重新算一遍,所以收费极低。跟 AI 聊得越久,旧内容占比越高,平均下来越便宜。
一个 Agent 能力接近顶尖的模型,跑起来的成本只有对手的几十分之一。这个局面挺少见。
第一个短板最要紧,它不支持多模态,说人话就是看不了图。
我把官方模型说明翻了一遍,视觉、音频、视频一个都没有。发布前有过「原生多模态」的传闻,最后没有兑现。
这对咱们的影响很具体:你想把一张报错截图丢给它看、让它帮你分析,不行;你想让它看着一张设计稿改网页,不行;你想让它读一份扫描版的 PDF,也不行。这些活儿它一概干不了。
第二个,速度一般。这一点卡兹克在文章里讲得很直白,他同时开着两边跑任务,Grok 那边跑完三个了,DeepSeek 这边一个还没跑完。这是他的实际体验,我照实转述。
第三个,涨价预告还悬在头上。我今天又去官方定价页看了一眼,那句话还挂着,说近期计划整体上调价格、预期涨幅较大。上面那些数字,都是「目前」的价格。
Grok 4.6 是 8 月 12 号发布的。先看 xAI 官方给的跑分:

有个综合智力评分叫 AA Intelligence Index,Grok 4.6 是 61 分,上一代 Grok 4.5 是 56 分,GPT-5.6 Sol 是 61 分,Fable 5 是 62 分。基本追平了第一梯队。
有几项它是全场最高的:一个模拟真实经济活动价值的评测(GDPVal)它 1753 分,Fable 5 是 1741;一个考公文和商务处理的评测(AA-Briefcase)它 1577,Fable 5 是 1574;法律那项它 15.8%,其他家都在 12% 以下。
做财务模型、写报告、处理法律文书这类办公场景的活儿,它是真强。
短板也在表里明摆着。终端任务那一项(Terminal-Bench v3.0)它只有 26%,GPT-5.6 Sol 是 34.6%,Fable 5 是 34.1%。让它自己进命令行折腾环境,它比对手差一截。
别把这个 26% 跟前面 DeepSeek 那个 87.9 放一起比,那是两份不同版本的考卷(一个 v3.0 一个 2.1),难度不一样,比了没意义。
这张表是 xAI 自己发布的,脚注写明了对手的成绩取自公开数据。厂商自己的跑分表,看个趋势就好。
Grok 4.6 的上下文是 50 万 Token,价格是输入 2 美元、输出 6 美元。
但我在 xAI 官方文档里查到一条卡兹克文章里没提的规则:一旦你这次请求的内容超过 20 万 Token,价格全部翻倍,输入变 4 美元、输出变 12 美元。
注意是「全部」,不是超出的部分翻倍。
如果你习惯把一大堆资料一次性丢给它,或者一场对话聊得特别长,很可能在毫不知情的时候跨过那条线,账单翻一倍。用它处理长文档的同学留意一下。
它能看图,支持图像输入,单张最大 20MB,正好补上 DeepSeek 的缺口。
它的知识截止到 2026 年 2 月,问它更近的事情要让它联网。
这两个模型的消息我是从卡兹克那儿看到的。他提了一个说法,我觉得值得单独讲讲。
他说大模型一直有个不可能三角,性能、价格、速度,三样很难同时满足。
聪明的模型往往又贵又慢。便宜的模型速度可以,但能力差一截。又快又聪明的,价格就下不来。
前两项大家讨论得多,但速度这一项经常被忽略。他的原话是:
如果你和我一样,每天接近十个小时的时候,几乎都在让各种 Agent 不停歇的干活,速度有时候就是一个至关重要的因素。
他描述的那个状态很多人应该有共鸣。一个任务跑十几分钟很常见,半小时起步也不稀奇。人被卡在那儿,百无聊赖,只能刷手机,时间被硬生生切成碎片。
他认为这一夜之后,这个三角从两个方向被撕开了口子。DeepSeek 用极低的价格证明了准顶尖的 Agent 能力可以很便宜,Grok 用速度证明了接近顶尖的能力可以跑得飞快。夹在中间不上不下的模型,日子就难过了。
他还公布了自己重新分配后的模型组合:日常主力开发用 Grok,最难、绝对不能出差错的大任务交给 ChatGPT 和 Codex,那些不要求实时反馈的自动化任务全部切给 DeepSeek V4 Pro。他为此付了 300 美元的 Grok 会员,又给 DeepSeek 充了一千块。
他还有一句话我挺认同的,抄在这儿:
在很多时候,速度也会把模型的智力,真正变成生产力。
这张「智能水平对成本」的图流传挺广,他这次把两个新模型标了上去。横轴是花的钱,纵轴是聪明程度,越往左上角越划算:

图很密,手机上可能要放大看。图里 DeepSeek V4 Pro 那个位置标着「预测」,因为它的正式评分还没出来,是估算的,看个大概就行。
爱范儿那篇实测的末尾还挖到一件事。
他们在 DeepSeek 之前那份更新公告里翻到一句不起眼的话,说测试用的是「DeepSeek Harness 极简模式(即将发布)」。
Harness 这个词你可能没听过,翻译过来大概是「运行框架」。拿公司打比方,大模型是那个聪明员工,Harness 就是他所在的那套办公系统,负责给他派活、给他开权限、让他能调用工具、检查他干得对不对、出了问题留下记录。
业内这一两年慢慢有个看法,各家模型的智商都快摸到天花板了,往后拉开差距的可能是这套让它干活的系统好不好使,而不是模型本身多聪明。一个中等水平的员工放进好的管理系统里能干出不少活,一个很聪明的人扔进没人管没工具的地方,照样干不成事。
爱范儿判断 DeepSeek 的 Harness 快来了,理由是他们之前在招这个方向的工程师,前几天还注册了一个叫「DeepSeek Harness 团队」的公众号。这是他们的推测,不是官方消息,我照实转述,咱们一起等着看。
这件事跟咱们学的东西是一个道理。
咱们做 Skill、搭工作流、整理知识库,干的就是给 AI 搭办公系统:告诉它规矩,给它素材,规定输出长什么样。上面那个细节最能说明问题,模型自己跑去调用了另一个设计规范 Skill,那是因为有人事先把规范整理好放在了那儿。换个什么都没准备的环境,同一个模型也变不出这一手。
所以别老盯着哪个模型最强。
上面那些数字都是给行业看的。落到咱们身上,就是下面这四件事。
DeepSeek 的网页版和手机 App 现在用的就是 V4,深度思考和联网搜索都不收费。
想知道这个「跟 Fable 5 只差 0.1 分」的模型到底什么水平,打开 chat.deepseek.com 或者 App 直接问就行,一分钱不用花。
咱们班里大部分同学的日常需求,写文案、理思路、改稿子、做方案,网页版够用了。先别急着研究 API 怎么接,先去用几次,看它跟你之前用的有什么不一样。
两个模型价格正好差三倍,Flash 是输入 1 元、输出 2 元,Pro 是输入 3 元、输出 6 元。
接法上没什么门槛。DeepSeek 的接口跟 OpenAI、Anthropic 兼容,API Key 粘进去,CodeX、Claude Code 就能直接拿它当后端。这次更新也不用你手动改设置,原来填的那个 deepseek-v4-pro,现在自动就是正式版了。
我的建议是日常的活儿继续用 Flash,够了。碰到下面这两类情况再换 Pro。
一是需要它自己连续折腾很多步的任务,比如让它从零搭一个小工具、自己装环境自己调试。这种活儿 Flash 和 Pro 的差距最明显,跑分上一个 82.7 一个 87.9,实际体验里就是「中途卡住了」和「一路干完了」的区别。
二是要读懂一整个项目再改代码的活儿。这一项两者差了 8 分(54.4 对 62.7),差距更实在。
你要只是让它写点东西、答个问题,Pro 那三倍的钱花得没道理。
咱们班里太多人的用法是截个图丢给 AI 问这是怎么回事,所以这条我再说一次。
DeepSeek V4 Pro 干不了这个。CodeX 接到了 DeepSeek,涉及截图、设计稿、扫描件的活儿它一概处理不了。
真要看图,要么切回能看图的模型,要么绕个道。咱们精选里讲过的把 PDF 转成干净 Markdown 就是在解决同一类问题,模型看不懂的东西,先想办法变成它能读的形式。
八月初 DeepSeek 就发过涨价预告,说要整体上调、涨幅较大,我们当时也发过一条精选(看这条)。到今天为止,正式的涨价方案还没公布,现在这个价格还是老价格。
现在这个价格窗口不知道能开多久。手里有非跑不可的批量任务,趁现在跑掉划算。但也别为了囤便宜就乱充钱,充多少心里有个数。
Grok 那边,300 美元一个月的会员对咱们大多数人不是必需品。它的长处是速度,而速度最值钱的时候,是你每天有好几个小时都在盯着 AI 干活、时间被等待切得七零八落。没到这个强度,这笔钱先省下。
这两天大概会有不少「赶紧换新模型」的声音,我的想法不太一样。
新模型出得越快,人越容易慌,好像不换就落后了。可你回头看这半年,从 Claude 遥遥领先到现在各领风骚几周,前后也就三四个月。这个节奏,追是追不完的。
前面爱范儿那个实测其实已经把话说明白了。同样一个模型,因为文件库里事先躺着一份整理好的设计规范,它就能自己把配色做对。那份规范是人提前准备的,不是模型送的。
先去免费的网页版试几次,看它跟你之前用的有什么不同。等你真碰上「这个活儿它干不了」,再回头研究要不要换、换哪个。到那时候你才知道自己缺的到底是什么。
有试出心得的同学,欢迎发到社区广场,尤其是踩到坑的,比夸它好用有价值得多。
这篇里的跑分、价格、模型规格,我都去 DeepSeek 和 xAI 的官方文档核对过。观点和实测部分来自下面两篇,都是今天凌晨到早上发的,想看完整版可以点进去:
一、《一夜之间,DeepSeek V4 Pro 和 Grok 4.6 把全球大模型推入了新的斩杀线》,公众号「数字生命卡兹克」。文中「不可能三角」和「斩杀线」的说法、以及他自己的模型组合和使用体验,出自这篇。
二、《实测 DeepSeek V4 Pro 正式版:Agent 能力终于支棱了,还藏了一个大招》,公众号「爱范儿」。接入 WorkBuddy 的五个实测案例、以及关于 Harness 的那段推测,出自这篇。
登录后可以评论和点赞
还没有人说话,来做第一个