菜单
小墨

小墨

小米AICube亮相:三芯协同驱动本地大模型部署

随着大语言模型参数规模的持续膨胀,如何在消费级设备上高效运行百亿级参数模型,已成为硬件厂商竞相攻克的核心课题。苹果通过统一内存架构破局,NVIDIA推出DGX Spark和RTX Spark系列,AMD则依托Ryzen AI Max系列实现CPU与GPU协同调用内存资源。如今,又一位重量级玩家入局——小米在玄戒芯片技术沟通会上展示了Xiaomi AICube工程原型机,正式宣告进军桌面级本地AI算力市场。

概述

AICube的核心创新在于其独特的三芯片协同架构。玄戒O3定位移动端旗舰SoC,采用10核CPU搭配16核G2-UltraNX GPU和200TOPS NPU,主要负责系统调度和低功耗任务处理。玄戒O100则是专为AI加速设计的专用芯片,采用6nm制程和3D晶圆级堆叠封装,通过近存计算技术实现1.22TB/s的惊人内存带宽,大幅缩短数据搬运距离。玄戒D100源自智能驾驶场景,采用先进3nm制程工艺,集成20核CPU和16核NPU,最高支持160GB统一内存容量,理论上可承载200B参数模型的本地部署需求。三颗芯片各司其职:O3处理日常交互,O100加速模型推理,D100承载大模型运行的算力和内存需求。

三芯异构:定位各异的算力矩阵

在模型部署层面,AICube采用了120B+3B的双模型策略,这一设计的精妙之处在于任务的精准分流。3B模型参数量仅为120B的1/40,具备占用空间小、响应速度快的显著优势,适合意图识别、简单问答和基础指令处理等高频场景。而120B大模型虽然能力更强,但每次推理都需要读取更多权重数据,对内存和算力的消耗也更为可观。当用户仅需打开文件、调节设备或查询简单信息时,调用大模型无疑是一种资源浪费;而在代码分析、长文档处理或多步骤复杂任务时,大模型的介入则显得必要而合理。这套设计比单纯追求模型规模更加务实——小模型处理日常琐事,大模型按需介入,两者各展所长。

AICube真正想解决的,是一台设备如何根据任务复杂度智能分配算力,而非单纯追求模型参数规模的堆砌。

“技术观察”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

双模型协同:快慢切换的智能调度

值得特别关注的是O100芯片所强调的1.22TB/s近存计算带宽。大语言模型在生成内容时,需要持续从内存中读取模型权重,模型规模越大,每生成一个Token所需搬运的数据量就越多。传统冯·诺依曼架构中,计算单元与内存之间的数据交换往往成为性能瓶颈。O100通过3D堆叠封装技术,将高速内存与NPU计算层垂直堆叠,物理距离的缩短直接转化为带宽的跃升。不过需要指出的是,这一带宽数值不能简单换算为实际的Token/s吞吐量——模型推理速度还受制于芯片算力、量化精度、软件框架优化以及芯片间通信效率等多重因素。

近存计算:突破内存带宽瓶颈

从硬件规格来看,AICube采用航天级铝合金一体成型机身,整机遍布33874个CNC蜂窝散热孔,确保150W持续性能释放的稳定运行。按照4-bit量化标准计算,120B模型权重约需60GB存储空间,运行时还需为操作系统、推理框架、上下文缓存和KV Cache预留额外内存。D100最高160GB的统一内存容量,理论上足以容纳量化后的120B模型并预留上下文空间。然而,目前仍有诸多关键信息尚未揭晓:120B和3B模型的具体名称、实际推理速度、整机内存配置,以及三颗芯片之间的互联方案,这些都将直接影响用户对设备实际性能的判断。

如有侵权,请联系删除。

#AI硬件#本地大模型#芯片架构#端侧AI
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信