• 正文
  • 相关推荐
申请入驻 产业图谱

DeepSeek Harness支持多模态!V4视觉模型图文编程、页面复刻完整对比

9小时前
262
加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

原标题:DeepSeek终于能看图了!首个多模态模型实测,到底夯不夯?

大家好,我是小林。

本周四,DeepSeek Harness 迎来了一波更新。其中最关键的一项,是补上了多模态输入。

也就是说,新版本除了普通对话,/goal/plan 这些常用命令也能接收图文输入了。

刚看到这项更新时,我还以为 DeepSeek Harness 是让我们接入其他多模态模型来用。

结果第二天,DeepSeek 就发布了自己的多模态视觉理解模型:DeepSeek-V4-Flash-Vision-Exp

好家伙,DeepSeek 终于能看图了。

现在回头看,DeepSeek Harness 这次更新,明显是在给自家的多模态模型铺路嘛。

当然,价格还是熟悉的 DeepSeek 风格,一张图片最多占 384 tokens,计费价格与 V4-Flash 一致。

接下来,我来实测一波,看看 deepseek 多模态能力如何?

实测一把

把 DSH 更新到 0.1.1-rc.2 版本后,模型列表里就能看到 DeepSeek-V4-Flash-Vision-Exp 了。

看一张截图,能不能找到原文?

我随手打开自己的大模型面试题网站 (xiaolinnote.com),截了一张文章图片,然后丢给 DeepSeek-V4-Flash-Vision-Exp,让它找出这篇文章的原文地址。

结果它很顺利地找到了对应的文章链接。

这个测试本身不算难,但对 DeepSeek 来说意义挺明确。以前的文本模型连图片都接收不了,现在它不但能看图,还能根据图片里的信息继续搜索。

看着图片,能不能画出 ASCII 图?

我把「梁圣」这张图片发给 DeepSeek-V4-Flash-Vision-Exp,让它用 ASCII 码把图片重新画出来。

这是 DeepSeek 生成的效果:

人物的脸型、短发、眼镜和偏严肃的表情都保留了下来,基本能让人一眼认出原图。

我之前也试过另一套方案,先外挂一个多模态模型识图,再交给 DeepSeek V4 Flash 文本模型生成。这是当时的效果:

放在一起对比,原生多模态的效果明显更好。少了一层模型转述后,人物特征保留得更完整。

相同的图片和提示词,我也发给了 GPT-5.6 Sol。

你们觉得哪个更好?我觉得差距也是很大,都能还原出原图的人物轮廓和神态。

截图生成网页,能还原到什么程度?

对 AI 编程来说,看图最直接的用法,就是截图复刻网页。

很多网页的布局、颜色和组件,用文字描述半天都不一定说得清楚,直接把截图丢给 AI 反而更省事。

我先拿自己的简历网站 jianli.xiaolinnote.com 做测试,把首页截图发给 DeepSeek-V4-Flash-Vision-Exp,让它照着复刻。

这是 DeepSeek 生成的页面,整体布局基本都复刻出来了,相似度也还不错。

相同的提示词,我又交给 GPT-5.6 Sol 跑了一遍。

如果只比较视觉相似度,这一轮还是 GPT-5.6 Sol 更接近原网页。

我又换了一个信息密度更高的数据看板。

这是 DeepSeek-V4-Flash-Vision-Exp 复刻出来的效果:

这是 GPT-5.6 Sol 复刻出来的效果:

两个网页测下来,结果比较一致。

DeepSeek 已经能看懂截图,并把页面的主要布局做出来,但如果单纯比较视觉还原度,GPT-5.6 Sol 目前还是更胜一筹。

复刻一个能玩的《我的世界》

我截了一张 3D《我的世界》的游戏页面,让 DeepSeek-V4-Flash-Vision-Exp 开发一个类似的网页游戏。

这是 DeepSeek 做出来的效果,打开之后,整个画面确实有《我的世界》那味了。

跑步,跳跃这些都没问题。

我实际打开玩了一遍。游戏可以正常运行,场景里的砖块也能使用。

相同的提示词,我也交给 GPT-5.6 Sol 做了一遍。

GPT-5.6 Sol 生成的版本同样可以正常游玩。

这一轮两个模型都完成了任务。不过从地图大小来看,DeepSeek 生成的地图会更大一些。

复刻皇室战争游戏

还不过瘾,我就继续再复刻一个「皇室战争游戏」的游戏

这是 DeepSeek-V4-Flash-Vision-Exp 做出来的效果:

单看画风,确实简陋了一些,但游戏真的可以完整玩起来。

我实际玩了接近两分钟,最后拆掉了对方两座塔。虽然游戏结束前没能拆掉最后一座主塔,但我的拆塔数量比对方多,所以系统还是判定我赢了。

下面是 GPT-5.6 Sol 使用相同提示词做出来的版本:

两个都把游戏的核心玩法做出来了,画风细节程度的话,我感觉都差不多。

写在最后

上面这些案例跑下来,我也就花了 5-6 元,这个成本我觉得依旧很香

当然,现在这个模型名字里还带着 Exp

从实测结果看,它的视觉还原能力还有提升空间,尤其是复杂网页,和 GPT-5.6 Sol 仍然存在一点的差距,不过整体上已经相当不错的。

但至少从这次开始,DeepSeek 已经补上了 AI 编程里很关键的一块能力:看见界面、理解界面,然后把界面做出来。

相关推荐

酷爱图解晦涩难懂的计算机基础知识。