菜单
小墨

小墨

DeepSeek 推出实验性多模态视觉模型,文本能力不打折、视觉理解大幅跃升

多模态大模型正成为 AI 发展的重要方向,如何让模型同时具备强大的文本理解与视觉感知能力,一直是业界探索的核心课题。近日,一款实验性多模态视觉理解模型正式登陆 API 平台,为开发者提供了新的选择。

多模态能力释放:三大典型场景实践

这款模型最大的亮点在于其平衡的能力设计。在公开基准测试中,它与纯文本正式版在 Agent、推理、世界知识等文本任务上表现持平,并未因加入视觉能力而出现性能妥协。与此同时,在需要视觉理解的 Agent Benchmark 上,该模型实现了显著跃升,多模态 Agent 能力已接近 Opus-4.8 的水平,展现出强大的视觉-语言协同能力。

API 服务:灵活的接入方式与计费规则

该模型在各类 Agent 框架中展现出优秀的适配性,能够有效支持多样化的应用场景。在商业内容创作领域,用户只需提供详细的需求描述,即可生成定制化的商业演示文稿,涵盖从视觉风格定义到真实摄影图片的完整内容;在开发者网站重构场景中,模型能够理解现有页面的视觉要素,经过多轮交互后生成符合特定风格要求的全新网站设计;在创意前端开发领域,模型可以基于灵感描述,生成具有独特视觉风格的交互式 Demo。

多模态能力的成熟,正在重新定义 AI Agent 的边界——从理解文字到理解世界。

“技术观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

API 调用方式

开发者可以通过设置 model 参数为 'deepseek-v4-flash-vision-exp' 来访问该模型。API 服务采用 token 计费模式,图片会被转换为 token 后纳入计费,单张图片最多占用 384 个 token。值得注意的是,该模型的计费价格与纯文本版本保持一致,用户可以以相同的成本获得视觉理解能力的增强。API 支持 Chat Completions、Messages、Responses 三种调用格式,兼容主流 Agent 工具生态。

技术洞察与展望

在图片输入方面,API 提供了三种灵活的传入方式:Base64 内联图片、外部 URL 链接以及 Files API 上传。其中 Files API 作为一项免费服务,用户可先将图片上传至平台,获取 file_id 后在请求中引用。这一设计不仅节省了请求带宽,还支持同一张图片在多个请求中重复使用,避免了重复上传的麻烦。

如有侵权,请联系删除。

#多模态大模型#视觉理解#API服务#DeepSeek
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信