关于多模态布局,梁文锋曾表示:“我们一直在推进多模态相关工作。对产品来说,它很关键;对面向C端用户的产品而言,它同样重要。但就智能的天花板而言,它只是一个组成部分,并非核心方向。我们后续会推出相关模型,也就是V4的后续版本将支持原生多模态。”

梁文锋确实兑现了承诺。2026年8月21日,DeepSeek发布了DeepSeek V4 Flash Vision Exp,官方称这是一款多模态视觉理解模型。

与V4 Flash和V4 Pro不同,DeepSeek V4 Flash Vision Exp既没有附带技术报告,也没有开源,官方仅提供了一张性能表格和几个演示案例。

然而,DeepSeek V4 Flash Vision Exp怎么看都不像一个单纯的“组成部分”。

从过往来看,DeepSeek OCR、DeepSeek OCR 2这类模型才符合梁文锋所说的“组成部分”定位。这些模型的功能是将图片中以像素形式存在的文字,转化为计算机能识别的纯文本字符。

因此,相比DeepSeek OCR,DeepSeek V4 Flash Vision Exp更像是一个“核心方向”的模型。

难道梁文锋对多模态的看法发生了变化?实际情况可能并非如此。但有一点可以确定,那就是梁文锋学会了放低姿态,通过产品与用户进行更紧密的互动。

梁文锋此前曾说过:“通往AGI需要经过产品这个环节,但不必在C端、B端投入过多精力。”然而随着DSH的爆火,发布后不到一周,DS就推出了更新,提升了多模态能力。

过去的梁文锋对产品有一种“执着”,不完美就不发布。DeepSeek V3.2版本与DeepSeek V4预览版之间,间隔了整整4个半月。如果从V3正式版发布算起,仅一个大版本就用了1年零4个月。

如今,不仅更新速度加快了,还把DeepSeek V4 Flash Vision Exp这种实验性质的模型开放给公众,这些都表明梁文锋的态度发生了一些变化。

多模态是Agent和推理的入口

如果你是一名跑步运动员,你应该展示的是跑多少米用了多少秒的成绩,这样别人才知道你的速度。但如果你告诉别人的是三分球命中率,那显然是想展示你的精准度。

DeepSeek V4 Flash Vision Exp也是如此,它想传达的远不止是展示DeepSeek现有的多模态能力那么简单。

明明是一个多模态模型,官方公布的评测中却包含了一串Agent基准测试。例如Terminal Bench 2.1得分为83.9,DeepSWE得分为59.3。

在AI视觉模型领域,有一套默认的测试标准。

一个新视觉模型发布时,通常需要展示以下几项:MMMU(跨30个学科、大学水平的图文理解与推理,考察“看到图能否做对题”)、MathVista(考察图片中的数学推理)、DocVQA(考察从扫描文档中找答案)、ChartQA(考察读懂图表中的数字和趋势)、OCRBench(考察基础文字识别)。

无论是Qwen-VL、Gemini还是GPT-4o,发布新版本时都会展示这套基准。

即便DeepSeek V4 Flash Vision Exp也展示了一些多模态侧基准,但这些基准也“不太常规”,充满了浓厚的Agent色彩。

Chartography考察专业人士阅读专业图表并做决策,ApexBench是多模态Agent基准,Agents’ Last Exam是通用Agent评测。没有一项是“看图答题”,全是“看完图,继续执行任务”。

这张跑分图本身就是DeepSeek的一种暗示。

梁文锋始终认为多模态不是AGI的核心方向,DeepSeek V4 Flash Vision Exp是DeepSeek在Agent和推理这条主线上自然产生的结果,只不过它恰好也具有“多模态”属性。

DeepSeek V4 Flash Vision Exp所体现的价值观是,多模态从来不是为了让用户“看图聊天”,而是让Agent看懂网页截图、读懂图表数据、理解UI布局,然后继续执行任务。

多模态不是目的,而是手段,是服务于核心方向的插件。DeepSeek的核心方向仍然是Agent和推理,DeepSeek V4 Flash Vision Exp所做的,也只是强化了产品的推理能力。

尽管DeepSeek V4 Flash Vision Exp很神秘,但它并非凭空出现的模型。

4月29日晚,DeepSeek多模态负责人陈小康(Xiaokang Chen)在X平台发文预告,配文“Now, we see you”,宣布DeepSeek多模态识图功能开启灰度测试。

第二天,DeepSeek正式在GitHub发布技术报告《Thinking with Visual Primitives》(以视觉原语思考)及配套仓库。论文作者单位包括DeepSeek、北京大学、清华大学,属于三方联合研究成果。

然而,这篇论文在5月1日凌晨被删除,相关官宣推文也消失不见,GitHub官方仓库直接变为404状态,项目彻底无法访问。DeepSeek全程未发布任何撤稿公告,也未公开解释原因。

好在,社区保留了这篇论文的拷贝版本。

这篇论文没有去讲“我们模型看得多清楚”,而是提出了一个问题:模型能看见,但不一定能想清楚。

传统多模态模型用自然语言描述图片中的对象,比如“左边那个男的”“右边那个高的”。但在复杂场景中,这种描述非常模糊,模型很容易越推越乱,最终导致整个逻辑崩溃。

以集体照为例,左边有好几个男的,那么哪个男的是模型所描述的那个?

DeepSeek的解法,是将点坐标和边界框提升为“思维的最小单元”,直接嵌入推理链,让模型“边推理边指向”,就像人数东西时会伸出手指,一个一个点着数。

通过这套机制,模型在计数、空间推理、迷宫导航等任务上,将抽象的判断精确锚定到图像坐标,从“左边那个男的”、“右边那个高的”,变成了“我手指的这个”、“我手指的那个”。

6月,经DeepSeek官方确认,其在客户端和网页端上线的Vision模式,底层就是这套视觉原语机制。

而DeepSeek V4 Flash Vision Exp,是将同一套技术移植到了V4-Flash的API基座上,重点强化多模态Agent能力,核心推理逻辑完全沿用了论文的方案,没有超出其技术框架。

不仅如此,论文当时的实验,就是基于DeepSeek-V4-Flash作为语言骨干所搭建的多模态方案。这次DeepSeek V4 Flash Vision Exp光看名字也知道,仍然使用的是DeepSeek-V4-Flash。

除了DeepSeek V4 Flash Vision Exp这个模型,DeepSeek在多模态方面的进展还体现在DSH上。8月19日晚,作为DeepSeek目前的主力产品,DSH更新了rc.8版本,提升了Agent的多模态能力。

rc.8的核心,是DeepSeek在多模态方面“两条腿”走路。

一条叫“原生直通”。rc.8给模型适配器增加了可配置的原生图片请求能力,只要底层模型声明支持视觉输入,比如GLM、Qwen,或刚上线的V4-Flash-Vision-Exp,Harness就把图片原封不动送进模型,不做任何中间加工。

另一条叫“工具层视觉”,服务于纯文本模型。

例如,使用DeepSeek自己的V4-Flash,直接读图会失败。这时Harness不会报错退出,而是自动降级为一套工具链,先做OCR识别文字,再统计图片颜色比例、扫描部分像素行、读取尺寸和颜色模式,将这些信息拆分成结构化证据,最后交给文本模型去推理整张图。

Cherry Studio的核心创始人Yinsen将这种方式称为“伪视觉”,对付PPT截图、流程图、界面这类结构清晰的图够用,面对真实照片和复杂的空间关系就很勉强。

但要说明的是,DSH在rc.8之前,甚至连“伪视觉”都没有,全靠社区的视觉插件,以及通过pi2dsh桥接进来的视觉方案。

它们的做法大同小异,先调用一个外部的视觉模型(如GLM、Qwen)将图片识别成文字,再将结果塞回文本模型。

这些插件证明了DSH架构的开放性,同时也暴露了一件事:DeepSeek自己没有视觉模型,只能借用别人的眼睛。

DSH还有哪些可以补足?

正如开头提到的,尽管梁文锋没有改变旧观点,但他也学会了放低姿态。

2025年,在DeepSeek R1惊艳全球之后,社区就开始等待DeepSeek发布V4。

2025年下半年,随着V3.1、V3.2等迭代版本陆续推出,无数媒体“独家爆料”,称DeepSeek下一代旗舰大模型V4,计划于2025年7月、8月、9月……直至2025年年底发布。

结果自然无一准确,堪称现代版狼来了。

2026年春节前,距离V3发布已过去400多天,所有人都在赌DeepSeek会复刻春节档R1的奇迹,将V4卡在农历新年这个节庆日子上线。

结果2月4日,外媒援引消息人士的话称,春节期间V4不会发布,DeepSeek官方也对此事保持沉默。

然后时间线一路后移。最后到了4月24日,V4才以预览版的形式登场,一次同时放出了V4-Pro和V4-Flash。

梁文锋的产品观是,宁可跳票,也不肯在产品没有完全做好的前提下发布。

可也就是在这段时间里,DeepSeek“掉队”了。

国际方面,2025年8月,OpenAI发布了GPT-5;11月,Anthropic发布Opus 4.5。这两款模型都是问鼎全球性能榜的产品。

而在国内,2025年4月Qwen 3,不到半年后,阿里一口气放出了Qwen3-VL、Qwen3-Omni、Qwen3-Max、Qwen3-Coder。还有Kimi的首个原生多模态模型K2.5、智谱的GLM-4.7、MiniMax的M2.1、腾讯的hunyuan world等等,数不胜数。

与之相对,DeepSeek发布的产品只有V3.1(8月V3.1,9月V3.1-terminus)和V3.2(12月)。

除了DeepSeek,全世界都在以月为单位发布模型,Anthropic更是以天为单位,在2026年2月1日到3月末,52天的时间里发布了73款功能和产品。

假如梁文锋是大厂的产品经理,以他发产品的效率,恐怕撑不过试用期就得被开除。只可惜DeepSeek是他的。

正式版更磨人。

6月29日,DeepSeek给全体API开发者发邮件,明确表示V4正式版7月中旬上线。7月21日,有消息表示正式版将要延期,目标挪到7月底。7月28日,又有消息说可能拖到8月10日至20日之间。

7月31日,V4-Flash正式版才千呼万唤始出来,而V4-Pro正式版,直到8月12日晚间才正式上线。

梁文锋对待产品,不做到自己满意,绝对不放出来。

可到了DeepSeek V4 Flash Vision Exp这里,明显味道变了。

模型上线当晚,社区就开始对其进行检测。根据实测显示,DeepSeek V4 Flash Vision Exp连梁文锋本人最具代表性的一张照片都无法识别。

不仅如此,还有用户反馈,称DeepSeek V4 Flash Vision Exp在理解复杂图表时会漏掉关键信息,中文场景的处理偏弱,有人在对话里插入图片后,还发现上下文缓存机制受到牵连。

一圈看下来,社区对DeepSeek V4 Flash Vision Exp的普遍看法是“效果好像也就那样”。

这个模型就像在餐馆等着上菜,看不见后厨,不知道这盘菜什么时候才能端上来,厨师怕你等不及,于是从锅里盛了一勺给你尝尝,告诉你说菜还没做好,但是在做了。

其中的原因,很可能在于梁文锋持续受到优秀产品的压力。 DSH从立项之初就对标Anthropic的Claude Code和OpenAI的Codex。

8月23日,外媒报道称Anthropic或将于8月底递表上市,因此目前正处于静默期,Claude Code没有较大的更新。

OpenAI却很激进,8月20日直接开源了Codex Harness,这是支撑Codex运行的底层系统。负责将模型和工具接起来,让模型能打开文件、执行命令、记住任务进行到哪一步,以及遇到有风险的操作要停下来询问。

但这并不是重点,重点是,在产品逻辑上,Codex Harness将多模态放在了Agent运行时的核心位置。

在Codex的工作流里,图片不是先交给某个外部视觉模型,再将识别结果转述给文本模型。

模型可以直接接收截图、界面和其他视觉输入,并将这些内容纳入同一条任务链。模型会先理解画面,再决定要调用什么工具、修改哪些文件、运行哪些命令,最后根据执行结果继续修正。

正如前文所述,DSH无论是哪条腿,在多模态这件事上,在DeepSeek V4 Flash Vision Exp之前,它都是割裂的。DSH只负责以“模型处理过的图片”进行推理,而非用图片进行推理。

显然,Codex效果更强,首先是因为它减少了一次信息损耗。图片经过OCR或摘要之后,模型看到的已经不是原始画面,而是工具挑选出来的文字和特征。

只要处理过的图片漏掉一些信息,那么后面的推理就只能建立在不完整的证据上。

举个例子,前面的话就相当于模型处理后的图片,后面那句话是原图。你会发现,仅仅只漏掉一个字,意思就完全相反了。

要断章取义——出自“不要断章取义”

原生视觉输入则让模型直接面对图像,文字、布局、位置和相互关系可以在同一上下文里被判断。

其次,Codex将视觉理解和行动闭环连在了一起。它不是单独回答“这张图里有什么”,而是要根据截图判断下一步该做什么,再通过终端、文件和其他工具验证结果。

就算是中间出错了,新的截图和执行反馈还能继续回到同一条推理链里。这样一来,多模态就不再是“识别完了就完了,后面发生啥不关我事”的状态了,而是一个持续的服务,以提高推理的性能。

而这一步也是目前DSH所欠缺的。

所以这也是为什么OpenAI在开源Codex Harness后,DeepSeek会立马开源DeepSeek V4 Flash Vision Exp,梁文锋是想告诉用户,别急,别人有的我们也有,不过需要一点时间。

社区正在补足DSH的最后一公里

当然,DSH最明显的短板,是它与普通用户之间距离太远了,没点计算机知识,估计连DSH怎么安装都不清楚。

好在的是,正是由于DSH开源,所以这最后一公里,社区已经开始接手了。

最典型的例子是DSH Desktop,这个项目由一位06年的大二学生Benson Wang开发。

它的核心就四个大字“一键安装”。把原本需要复杂安装环境,以及输入npm指令才能安装使用的DSH,变成一个exe,下载后双击安装就能直接变成一个桌面工具。

然而就是这么简单的一个项目,短短几天,就在GitHub上获得了1.8万颗星星。可见,大家普遍都认为DSH就该有一个简单方便的桌面版本,现在的DSH确实有些“反人类”了。

顺便一提,DSH Desktop这个项目的贡献者也有DSH负责人崔添翼,不过这并不说明他参与了开发,而是GitHub本身的开源协作机制,让DSH原本的贡献者出现在了这里。

Benson Wang表示,他正在开发手机版的DSH,项目名为anywhere DSH。

他计划通过iOS和Android连接桌面端,让用户在手机上发起任务、查看Agent进度,并在需要时继续跟进。

这也是社区最有价值的地方。

事实上,DSH官方团队本身也非常关注社区。比如他们关注了DSH-better-sidebar这个项目,这是DSH第三方社区UI增强插件,给DSH原生Web界面提供了一套完整的服务化侧边栏工作台框架。以及awesome-dsh-plugins,提供DSH插件精选和搜索雷达,相当于是一个DSH的插件市场。

或许不久的将来,DSH会“收编”这些优秀的项目和开发者,丰富现在的DSH。

诚然,社区项目不能自动等同于DeepSeek的战略转向。开放生态越是发展,就越是会有版本兼容、权限控制、插件安全等问题出现。

但官方的态度就说明,DSH正在通过社区吸纳好的想法。

或许不久的将来,DSH也将上线官方的插件市场,想用什么插件,自己直接在官方的入口里搜就行了。

本文来自微信公众号“字母AI”,作者:苗正,36氪经授权发布。