DeepSeek 昨天上线了第一个能读图片的模型,一张图最多算 384 个 token,跟发两三百个字的钱差不多。文章里放了它做出来的一整套西藏自驾游 PPT 和照着网页截图做的二次创作,也讲清楚了它只会看图、不会画图这个最容易搞混的地方,最后给了三条今天就能上手的路。
写在前面
大家好,我是宋超。
昨天 DeepSeek 干了件大事,它终于会看图了。
咱们不少同学是拿 API Key 把 DeepSeek 接在 CodeX、Hermes 后面用的。那条路上的 DeepSeek 一直是个睁眼瞎,你截个图丢过去,它直接甩你一句「这个模型不支持图片」。从昨天起,这个错没了。
这篇我先给你看几张它做出来的东西,再说你能拿它干哪些活,以及今天怎么动手。后半段有两件用之前该心里有数的事,我也写了,但你别被那两条劝退,它们不影响你现在就去玩一把。
APPSO 拿这个新模型做了一份西藏自驾游的 PPT,商业定制那种规格。往下滑,这是完整的一份。

深色底、大图压字,30 天、5800 公里、5648 米海拔这些数字一路铺下来,从远征路线到藏南、藏北、藏东分段,最后落在「山在那里」。这是一次生成的一整份。
第二个例子我更喜欢。他们让它照着 DeepSeek Harness 的官网做二次创作。

你给模型看一个网页长什么样,它就能照着这个感觉做出新的来。第四周我们讲做网站的时候,最难的一步是把你脑子里想要的样子描述给 AI 听。现在你看到喜欢的页面,截个图给它就行了。
看到这儿你八成会有个疑问,说好的「会看图」,怎么直接做出一整份 PPT 来了,这不就是画图吗。
这里有个链条,值得花两分钟弄明白,因为它决定了你该对这个模型抱什么预期。
一份 PPT 从 AI 手里出来,是这么走的。你把西藏那些照片素材交给它,它先看懂每一张是什么,哪张是雪山、哪张是藏羚羊、哪张是经幡。接着它写出一份很细的施工图,第几页放什么标题、配哪段文字、什么颜色、哪张照片摆在哪个位置,全都写明白。最后由软件照着这份施工图渲染成你看到的成品。
模型从头到尾输出的都是文字,那份施工图就是文字。成品里的照片,还是你交给它的原图,它一张也没画。
新增的看图本事,管的是这条链子的第一步。以前那个纯文本的 DeepSeek 看不见你给的素材,不知道哪张是雪山哪张是羚羊,也就没法决定哪张放哪儿、配什么话。现在它看得见了,这份 PPT 才做得成。
第二个例子是同一个道理。给它看官网截图,它看懂了版式,然后写出新的网页代码,浏览器渲染出来就是你看到的那个页面。
所以「用这个模型生成 PPT」这个说法没毛病,它生成的是版面、文案和结构。让它凭空给你画一张雪山出来,那是另一类工具的活。
它的输入可以是文字加图片,输出只有文字。DeepSeek 现在 API 上挂着三个模型,没有一个能生图,官方文档里也没有文生图这个接口。
DeepSeek 早先开源过一个能画图的模型,叫 Janus-Pro,2025 年 1 月放出来的。但那是开源的模型权重,得自己找机器部署,App 里没有,API 上也没有,普通人基本碰不到。
要画图还是得另外找工具,课上提过的即梦、可灵都能干这活。前两天讲 PPT Master 那篇我说过,配图对整份 PPT 的观感影响很大,说的是同一件事,看图的和画图的得分开配。
官方给的方向是三块,办公、开发、内容生产。我把它翻译成你手上具体的活。
办公这块,会议白板拍下来让它整理成纪要,发票、快递单、菜单拍照丢给它转成表格,PDF 里那页看不懂的图表截下来问它数据在说什么。
开发这块,报错截图直接丢过去,不用再一个字一个字敲进去。页面哪里排歪了,截个图跟它说这里不对。
内容这块,看到一张喜欢的封面或者版式,截图给它,让它讲清楚这版式好在哪、换成你的内容该怎么排。手写的笔记拍照,让它录成文字,直接进你的 Obsidian。
直接开 DeepSeek 网页版或者 App,用识图模式传图就问。这条 6 月就通了。想先感受一下它眼力如何,从这儿开始最快。
升到 0.1.1 就行。/goal、/plan 这些命令现在能接图文混着的输入。几个小时后跟的 rc.2 版本又专门优化了图片上传,传过的图能重复用,还会自动帮你缩放转格式。

模型名是可以自己填的,换成 deepseek-v4-flash-vision-exp 就用上新模型了。至于能不能直接把图发出去,还要看你那个 Agent 工具本身支不支持,这一块我没在你们各自的电脑上一台台验过。你试了就回社区说一声,成没成都对后面的同学有用。
价格一分没涨,跟原来的纯文本版完全一样。
要紧的是图片怎么算钱。每张图最多折算 384 个 token,384 个 token 大概是两三百个汉字。你发一张图过去,花的钱跟发两三百字差不多。
V2EX 上有位开发者的反应挺能代表大家,他说「一张图片!最多占 384token!全体程序员欣喜若狂!」。另一位说得更干脆,「无脑切这个 vision 模型好了,收费也没区别」。
看图这块,它跟 Opus-4.8 打得有来有回。四项测试里赢了两项,图文综合的 Agents' Last Exam 是 27.3 对 25.7,视觉推理的 ZeroBench 是 35.0 对 34.0。另外两项输了,差得不多。

上半部分那些纯文本的测试更值得留意。通常给一个模型加上看图能力,它的文字功夫会掉一点。这回没掉,有几项还涨了,写代码的 DeepSWE 从 54.4 涨到 59.3,超过了 Opus-4.8 的 58.0。对你来说这句话的意思是,换成这个能看图的模型,你原来那些纯文字的活不会变差。
知道这两条,你用起来会更顺。
有位 Hacker News 网友拿一张时钟图去考它。

它答的是 5 点 10 分,把红色那根细针当成了时针。正确答案是 8 点 09 分 25 秒。
所以让它认画面里有什么、读大段文字、看整体版式,放心用。要它读仪表盘上的精确刻度、认电路图上的元件编号,自己再核一遍。

你传进去的图,不管原来多大,进模型之前都会被等比缩小,缩到总像素约等于一张 800×800 的图。一张 1920×1080 的截图,缩完大概是 1067×600。
看截图、读一页 PPT、认张照片,这个分辨率够用。要它看财报里密密麻麻的小表格,把大图裁成几块分别喂进去,效果会好很多。
第四周我们讲怎么做网站、怎么找 skill 装 skill。模型能看图之后,有一条路彻底通了,你看到喜欢的页面截图给它,遇到报错截图给它,都省掉一大段描述的功夫。
Skill 大赛还在进行。你要是摸出一套让它看图看得更准的说法,或者把它接进了自己的工作流,那本身就是能交上来的作品。
今天就去试一张图,随手拍的、顺手截的都行,看看它能说出什么来。试完到社区里发一条,成了把结果放上来,卡住了把情况贴上来,我们一起看看。
(想弄明白 Harness 到底是个什么东西,社区里有一篇专门讲它的每日精选。)