菜单
小墨

小墨

DeepSeek轻量级视觉模型问世:多模态Agent能力实现新突破

多模态能力正成为大模型竞争的关键战场。近日,DeepSeek正式发布V4-Flash-Vision-Exp,这是其轻量级模型V4-Flash的多模态视觉实验版本。尽管名称中带有"Exp"(实验)标识,但其在各项基准测试中展现出的性能表现,却远超人们对一个实验版本的预期。

概述

在专门评估Agent综合能力的Agents' Last Exam基准测试中,V4-Flash-Vision-Exp取得了27.3分的成绩,超越Opus-4.8的25.7分。在ZeroBench测试中,同样以35.0分对比34.0分实现领先。这些看似微小的差距,实际上具有重要意义——它代表着一款以高性价比著称的厂商,用轻量级的"Flash"级别模型,在多模态Agent赛道上实现了对当前公认最强闭源模型的正面超越。

视觉与文本能力的协同增强

更值得关注的是,该模型在叠加视觉能力后,其纯文本性能并未出现退化。在Terminal Bench、DeepSWE、Toolathlon等纯文本Agent基准测试中,V4-Flash-Vision-Exp的成绩与V4-Flash-0731基本持平。更令人惊喜的是,部分指标甚至实现提升:DeepSWE从54.4提升至59.3,Toolathlon从70.3跃升至75.9。这一现象在多模态模型领域颇为罕见——通常情况下,模型在同时处理视觉和文本任务时,容易出现"此消彼长"的情况,如同一个人同时学习两门外语,母语水平反而可能出现下滑。V4-Flash-Vision-Exp的表现证明,其视觉能力的融入非但没有拖累文本处理,反而进一步强化了整体理解与推理能力。

当小模型也能干大模型的活,靠卖算力赚钱的逻辑就要重新算账了。

“行业观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

成本控制与效率优化的平衡之道

技术架构层面,V4-Flash本身定位为Flash级别的轻量架构,具备快速推理与低成本运行的优势。在此基础上叠加视觉能力后,每张图片最多仅消耗384个token,且API定价与纯文本版本保持一致。相比那些动辄消耗上千token进行图片编码的大模型方案,这一成本控制策略堪称激进。此外,随模型同步上线的Files API采用免费策略——用户上传图片后可获得file_id,后续请求直接引用,无需重复传输。这一设计对于需要处理大量图片的Agent工作流而言,不仅节省成本,更有效降低了延迟。

瞄准Agent工作流的实际应用场景

若论此次发布的真正战略意图,Agent工作流无疑是核心战场。诚然,纯聊天场景下,多模态大模型早已足够应对,但真正的Agent需要实现"看懂图→理解意图→调用工具→完成任务"的完整链路。V4-Flash-Vision-Exp在ApexBench测试中从26.2跃升至36.5,涨幅接近40%,充分说明其能力不止于视觉识别,而是能够将视觉信息有效融入决策与执行过程。在官方演示中,模型能够完整分析复杂的营销长图,从视觉元素识别到文案意图理解,再到营销策略提取,一气呵成。这类能力若落地于电商运营、数据分析、自动化办公等实际场景,其应用价值远超单纯的聊天机器人。

如有侵权,请联系删除。

#多模态模型#AI Agent#视觉理解#开源大模型#DeepSeek
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信