原标题:DeepSeek终于能看图了!首个多模态模型实测,到底夯不夯?
大家好,我是小林。
本周四,DeepSeek Harness 迎来了一波更新。其中最关键的一项,是补上了多模态输入。
也就是说,新版本除了普通对话,/goal、/plan 这些常用命令也能接收图文输入了。
刚看到这项更新时,我还以为 DeepSeek Harness 是让我们接入其他多模态模型来用。
结果第二天,DeepSeek 就发布了自己的多模态视觉理解模型:DeepSeek-V4-Flash-Vision-Exp。
好家伙,DeepSeek 终于能看图了。
现在回头看,DeepSeek Harness 这次更新,明显是在给自家的多模态模型铺路嘛。
当然,价格还是熟悉的 DeepSeek 风格,一张图片最多占 384 tokens,计费价格与 V4-Flash 一致。
接下来,我来实测一波,看看 deepseek 多模态能力如何?
实测一把
把 DSH 更新到 0.1.1-rc.2 版本后,模型列表里就能看到 DeepSeek-V4-Flash-Vision-Exp 了。
看一张截图,能不能找到原文?
我随手打开自己的大模型面试题网站 (xiaolinnote.com),截了一张文章图片,然后丢给 DeepSeek-V4-Flash-Vision-Exp,让它找出这篇文章的原文地址。
结果它很顺利地找到了对应的文章链接。
这个测试本身不算难,但对 DeepSeek 来说意义挺明确。以前的文本模型连图片都接收不了,现在它不但能看图,还能根据图片里的信息继续搜索。
看着图片,能不能画出 ASCII 图?
我把「梁圣」这张图片发给 DeepSeek-V4-Flash-Vision-Exp,让它用 ASCII 码把图片重新画出来。
这是 DeepSeek 生成的效果:
人物的脸型、短发、眼镜和偏严肃的表情都保留了下来,基本能让人一眼认出原图。
我之前也试过另一套方案,先外挂一个多模态模型识图,再交给 DeepSeek V4 Flash 文本模型生成。这是当时的效果:
放在一起对比,原生多模态的效果明显更好。少了一层模型转述后,人物特征保留得更完整。
相同的图片和提示词,我也发给了 GPT-5.6 Sol。
你们觉得哪个更好?我觉得差距也是很大,都能还原出原图的人物轮廓和神态。
截图生成网页,能还原到什么程度?
对 AI 编程来说,看图最直接的用法,就是截图复刻网页。
很多网页的布局、颜色和组件,用文字描述半天都不一定说得清楚,直接把截图丢给 AI 反而更省事。
我先拿自己的简历网站 jianli.xiaolinnote.com 做测试,把首页截图发给 DeepSeek-V4-Flash-Vision-Exp,让它照着复刻。
这是 DeepSeek 生成的页面,整体布局基本都复刻出来了,相似度也还不错。
相同的提示词,我又交给 GPT-5.6 Sol 跑了一遍。
如果只比较视觉相似度,这一轮还是 GPT-5.6 Sol 更接近原网页。
我又换了一个信息密度更高的数据看板。
这是 DeepSeek-V4-Flash-Vision-Exp 复刻出来的效果:
这是 GPT-5.6 Sol 复刻出来的效果:
两个网页测下来,结果比较一致。
DeepSeek 已经能看懂截图,并把页面的主要布局做出来,但如果单纯比较视觉还原度,GPT-5.6 Sol 目前还是更胜一筹。
复刻一个能玩的《我的世界》
我截了一张 3D《我的世界》的游戏页面,让 DeepSeek-V4-Flash-Vision-Exp 开发一个类似的网页游戏。
这是 DeepSeek 做出来的效果,打开之后,整个画面确实有《我的世界》那味了。
跑步,跳跃这些都没问题。
我实际打开玩了一遍。游戏可以正常运行,场景里的砖块也能使用。
相同的提示词,我也交给 GPT-5.6 Sol 做了一遍。
GPT-5.6 Sol 生成的版本同样可以正常游玩。
这一轮两个模型都完成了任务。不过从地图大小来看,DeepSeek 生成的地图会更大一些。
复刻皇室战争游戏
还不过瘾,我就继续再复刻一个「皇室战争游戏」的游戏
这是 DeepSeek-V4-Flash-Vision-Exp 做出来的效果:
单看画风,确实简陋了一些,但游戏真的可以完整玩起来。
我实际玩了接近两分钟,最后拆掉了对方两座塔。虽然游戏结束前没能拆掉最后一座主塔,但我的拆塔数量比对方多,所以系统还是判定我赢了。
下面是 GPT-5.6 Sol 使用相同提示词做出来的版本:
两个都把游戏的核心玩法做出来了,画风细节程度的话,我感觉都差不多。
写在最后
上面这些案例跑下来,我也就花了 5-6 元,这个成本我觉得依旧很香
当然,现在这个模型名字里还带着 Exp。
从实测结果看,它的视觉还原能力还有提升空间,尤其是复杂网页,和 GPT-5.6 Sol 仍然存在一点的差距,不过整体上已经相当不错的。
但至少从这次开始,DeepSeek 已经补上了 AI 编程里很关键的一块能力:看见界面、理解界面,然后把界面做出来。
262