菜单
小墨

小墨

DeepSeek V4 Flash视觉模型正式上线,补齐多模态感知短板

多模态能力已成为大模型竞争的关键维度,而视觉感知作为其中最核心的入口,直接决定了大模型在真实场景中的适用范围。8月21日,DeepSeek正式上线V4系列首个支持图片输入的视觉模型——deepseek-v4-flash-vision-exp(实验版本)。这一动作意味着,DeepSeek终于为自家模型装上了“眼睛”,补齐了Agent系统在感知层面的最后一块短板。

定价策略:与Flash版本完全一致

根据官方API文档披露的信息,V4 Flash Vision Exp拥有1M超长上下文窗口,最大输出长度达384K,支持JSON Output、Tool Calls、Responses API、Anthropic API以及对话前缀续写等丰富功能。图片输入将按尺寸折算成Token,与文本Token统一计费。从参数规格来看,这款视觉模型延续了V4 Flash系列高吞吐、低延迟的设计理念,并非追求极致的单次图片理解效果,而是更侧重于在Agent工作流中的高效运行。

背景:Harness上线后,视觉能力成为刚需

值得关注的是,V4 Flash Vision Exp的API价格与普通Flash版本保持一致:缓存命中价格在空闲时段和高峰时段分别为0.05元和0.10元/百万Token,缓存未命中分别为1.5元和3元,输出分别为4.5元和9元。图片不会单独收取“每张图”的费用,而是纳入统一的Token计费体系。这一策略与DeepSeek一贯的产品逻辑高度吻合——将新能力压入现有定价框架,而非单独设立收费项目。如果正式版延续这一定价,视觉理解能力将再次被拉入DeepSeek擅长的价格战区间。

科技改变生活

“Pimjolabs”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

从时间线来看,DeepSeek对视觉能力的布局其实早有预谋。一周前,DeepSeek刚刚开源了Agent Harness框架,将模型、工具、技能、会话、沙箱、存储和Agent Loop整合进一套可组合的运行框架。然而尴尬的是,V4 Flash和V4 Pro在模型目录中均被声明为纯文本模型,输入模态只有text,导致开发者在Harness中上传图片时会直接收到MODEL_DOES_NOT_SUPPORT_IMAGES的报错。

面对这一困境,社区开发者迅速拿出了临时解决方案:一种是在DeepSeek前串联Qwen-VL等视觉模型,先将图片转换为文字描述再交给DeepSeek推理;另一种是修改Harness,让图片先保存到工作区,再由视觉插件或子Agent读取处理。GitHub上甚至出现了专门为DeepSeek设计的vision bridge插件。然而,这些方案本质上是用第三方视觉能力“曲线救国”,并未真正解决DeepSeek自有模型的视觉感知问题。

社区的临时方案与官方的最终回应

实际上,DeepSeek早已在Harness的最新版本中埋下了伏笔。rc.8版本的Release Notes明确提到“增强多模态支持度,DeepSeek模型适配器支持配置启用原生图片请求”,/goal、/plan等命令也开始支持图文输入。这些信号让敏锐的开发者意识到:DeepSeek自己的视觉模型可能即将到来。果然,8月21日下午,开发者在Harness相关代码中发现了deepseek-v4-flash-vision-exp的身影。

如有侵权,请联系删除。

#DeepSeek#多模态大模型#视觉模型#V4 Flash#AI Agent
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信