Qwen3.8-Omni-Flash全模态发布:1M上下文窗口与音视频成本骤降98%
多模态大模型正在重塑人机交互的边界。今日,千问正式发布Qwen3.8-Omni-Flash新一代原生全模态模型,其支持文本、图像、音频与视频的统一输入,上下文窗口达到惊人的1M量级。这一里程碑式的突破意味着模型能够在单次处理中完整理解长达数小时的视频内容、跨越整部影片的叙事逻辑,以及处理复杂的跨模态任务链。该模型已在千问AI平台开放体验,为开发者和企业用户提供了极具竞争力的多模态推理基础设施。
全模态统一架构的能力跃迁
Qwen3.8-Omni-Flash的核心突破在于其原生全模态架构设计。与传统的多模态拼接方案不同,该模型从底层实现了文本、图像、音频、视频四种模态的深度融合,使得跨模态理解与生成更加自然流畅。在累计30项权威评测中,Qwen3.8-Omni-Flash相较上一代Qwen3.5-Omni-Plus平均得分提升超过26%,其中音视频Agent相关评测提升尤为显著,WildClawBench-MM提升36.5分,AgenticVBench提升22.3分,充分验证了原生全模态架构在复杂任务处理上的优势地位。
价格与性能的双重优化
成本的急剧下降是本次发布的另一大亮点。Qwen3.8-Omni-Flash的音频输入价格降幅超过98%,音视频输入价格降幅超过93%,这意味着企业可以更低成本构建大规模音视频处理能力。官方披露,模型在基础能力上的提升同样显著,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,AliMeeting语音识别DER/cpWER从88.11/89.61大幅降至3.35/17.18。千问团队更将模型应用于自身研发流程,仅用12小时便完成评测集选择、数据构建与4轮迭代,将四川话识别错误率相对下降约40.7%。
全模态大模型的成败,不在单一模态的精度里、不在实验室的评测数据里,而在多模态融合的每一行工程实现里。
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
音视频Agent的应用图景
从产业落地的视角审视,Qwen3.8-Omni-Flash正在开启音视频Agent的规模化应用时代。该模型原生支持视频剪辑Agent、MV创作Agent、影视制作与解说Agent、音视频转图文摘要Agent以及音视频对话Agent等多种工作流,覆盖了从内容创作到智能交互的完整链路。为支撑长程工作流与实时交互需求,千问同步扩展了Qwen-MM-Plugins工具链,并开源Qwen-Live Harness。在Agentic Understanding模式下,OmniVideoBench准确率从63.4提升至67.8,Token消耗降幅达45.7%,这意味着开发者可以用更低的计算成本实现更精准的音视频理解。对于需要处理长视频、进行复杂音视频分析的企业场景,这一突破将大幅降低部署门槛。
全模态实时交互的新范式
Qwen3.8-Omni-Flash Realtime版本的推出更具标志性意义——这是首个支持“听声辨位“的全模态大模型,能够在实时交互中精准定位声音来源并做出响应。这一能力在智能客服中心、智能导览、多人会议转写、远程协作等场景具有广阔的应用空间。企业可以基于该模型构建更自然、更智能的语音交互系统,实现从简单的语音问答到复杂的多人对话理解、从被动响应到主动感知的跨越。音视频能力的整体提升也使模型在影视制作、内容审核、教育培训等领域展现出更高的实用价值,帮助企业快速构建基于多模态大模型的智能化产品与服务。
Qwen3.8-Omni-Flash的发布标志着全模态大模型进入性能与成本并重的新阶段。1M上下文窗口、超过26%的综合性能提升、音频输入价格降幅超98%——这些数字背后是多模态AI从“能用“到“好用“再到“普惠“的质变。随着工具链的完善和开源生态的扩展,音视频Agent正在从概念走向落地,企业级多模态应用的大门已经敞开。
