菜单
小墨

小墨

3B小模型VLX-Seek面世:细粒度感知能力超越Gemini

视觉语言模型(VLM)近年来取得了显著进展,能够对图像进行语义理解和问答交互。然而,当任务从简单的"看见"升级为精准的"定位"时,许多模型便暴露出明显的短板:可以回答"画面里有几个人",却难以准确指出"穿红衣服的那个人具体在哪个位置"。这种"看得懂却看不准"的问题,成为制约VLM在具身智能、实时追踪等场景落地的关键瓶颈。

传统定位范式的困境

针对这一挑战,Om AI近日发布了VLX-Seek模型——一个参数量仅为3B的端侧流式多模态模型。该模型专注于细粒度视觉感知能力,在MSCOCO val2017基准测试中达到45.3 mAP,超越Gemini 3.1 Pro的41.4;在更考验实例感知的PixMo Count任务上拿到85.0分,领先Gemini 2.5 Pro的73.8。这一成绩表明,小参数模型同样可以在精准定位任务上与大模型一较高下。

区域令牌:重新定义视觉定位

要让VLM完成精确定位任务,模型需要同时判断目标的类别、位置、边界和实例数量。传统方案通常让语言模型直接生成坐标,如[x1, y1, x2, y2]的形式。然而,这种看似直观的做法在实际应用中面临多重挑战:首先,坐标是精确数值序列,而非自然语言,LLM在生成稳定数值方面并非其强项;其次,多目标场景下坐标序列急剧增长,模型容易出现漏检或格式错误;更重要的是,长坐标序列会显著拖慢解码速度,在机器人、无人机等需要实时响应的端侧场景中,这种效率损耗往往是致命的。此外,当目标不存在时,坐标生成式模型容易产生幻觉,生成虚假的定位框。

精确定位这种任务形式,和语言模型的生成方式并不天然匹配。VLX-Seek的解决思路是避开直接生成坐标这条脆弱路径,把目标变成可被语言模型理解和引用的令牌。

“技术观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

核心技术创新:HFRE混合细粒度编码

VLX-Seek采用了一种创新的区域令牌(Region Token)机制。与直接生成坐标不同,该模型首先将图像中的候选区域转换为可被语言模型理解和引用的令牌。推理时,模型接收一组带有编号的区域令牌,通过语言条件检索找出最符合描述的目标,并输出对应的区域索引。这种"先选后指"的范式,将定位问题转化为语言模型更擅长的比较和选择任务,大幅提升了输出的稳定性和可解释性。

性能验证与场景价值

为了让区域令牌真正携带语义信息,VLX-Seek引入了混合细粒度区域编码器(HFRE)。该模块采用双视觉路径架构:主视觉编码器保留原始VLM的语义对齐能力,提供高层语义理解;辅助视觉编码器则提供高分辨率的局部细节,捕捉边缘、纹理和小目标信息。两种信息融合后,再通过尺度适配和投影模块,使区域令牌同时具备语义理解和细粒度感知双重能力。

如有侵权,请联系删除。

#多模态模型#视觉语言模型#端侧AI#模型优化
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信