电信开源Xing4.0-29B-A4B:百亿MoE模型如何实现单卡15GB极低显存
当大模型从「对话助手」走向「任务执行者」,参数量与推理成本之间的矛盾成为制约落地的核心瓶颈。中电信人工智能科技有限公司近日正式发布Xing4.0-29B-A4B大模型,这款总参数量29B、激活参数仅4B的MoE架构模型,通过4-bit量化将单卡显存占用压缩至约15GB,在RTX 3090、RTX 4090等消费级24GB显存的GPU上即可本地运行。更值得关注的是,这是国内首个基于昇腾910C国产算力集群、采用国产框架完成训练的百亿级智能体大模型,标志着国产大模型在复杂工程任务领域实现从「会回答」到「会做事」的能力跃迁。
稀疏激活:4B参数驱动29B总参的算力革命
MoE(Mixture of Experts)混合专家架构的核心优势在于稀疏激活机制——模型总计64个专家模块,每次推理仅激活Top4路由通道,将实际计算量压缩至传统Dense模型的七分之一左右。对于部署方而言,这意味着以更低的显存占用和算力消耗,获得接近高激活量模型的推理能力。Xing4.0-29B-A4B原生支持256K上下文长度、可扩展至512K,能够处理长程任务规划、跨文档分析和复杂多步骤工作流。与此同时,模型采用MLA(多头潜变量注意力)压缩Key-Value缓存,结合MTP(多Token预测)增强生成连贯性,并通过mHC(流形约束超连接)改善深层网络训练稳定性,三项架构创新协同作用,有效保障长会话场景下的任务逻辑连贯与执行稳定。
性能评测:逼近头部Dense模型的智能体能力
在业界公认的智能体能力基准测试中,Xing4.0-29B-A4B展现出小参数规模下的竞争力:SWE-bench Verified得分75.0,接近Qwen3.6-35B-A3B的76.0水平,大幅超越Gemma4-26B-A4B的53.0分;Terminal-Bench 2.1得分57.5,同时超越Qwen3.6-35B-A3B和Gemma4-26B-A4B。在通用Agent评测中,Claw-Eval得分76.55、DeepresearchBII得分60.80、τ³-Bench得分64.63,均在参数量显著更小的情况下超越对比模型。在SuperCLUE智能体能力综合评测中,Xing4.0-29B-A4B以93.52分位列第三名,与前两名头部Qwen模型的差距不足1分,充分验证了小参数MoE模型在复杂任务执行、工具调用和代码处理方面的有效性。
大模型的成败,不在参数量的堆砌里、不在云端算力的依赖里,而在稀疏激活与极致压缩的每一个优化细节里。
“行业观察”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
国芯训国模:国产算力与框架的深度适配
模型的训练过程基于昇腾910C集群开展新一代架构与国产算力协同优化。在框架层面,针对mHC多残差连接特性,基于MindSpore/MindFormers完成特性适配、跨框架精度对齐及融合算子开发;针对64路由专家、Top4激活的细粒度MoE,围绕专家负载均衡、Grouped GEMM、共享专家计算与All-to-All通信重叠进行优化,并结合DVM图算自动融合降低通信长尾开销;采用层级加算子级选择性重计算,以及Ascend C定制mHC融合算子,持续提升计算与显存效率。经过模型架构、编译、算子与硬件的多层次协同,整网训练吞吐较开箱性能提升约96%,接近翻倍。强化学习阶段依托昇腾生态完成Slime强化学习框架适配,面向Agent、Coding、Reasoning等复杂任务开展多专家强化学习训练,并通过MOPD技术实现多专家能力高效融合,进一步强化复杂推理与长程任务规划能力。
轻量化部署:消费级GPU上的企业级智能体
对于企业用户而言,Xing4.0-29B-A4B的轻量化特性大幅降低了私有化部署的硬件门槛。4-bit量化技术将单卡显存占用降低至约15GB,相比FP16方案降低约75%,在现有消费级GPU上即可支持长上下文任务本地运行,推理吞吐达到约30 tokens/s。这意味着个人开发者可基于消费级硬件完成复杂任务拆解、工具调用执行与代码生成验证;中小型企业无需采购昂贵的A系列专业卡,依托现有设备即可构建私有化知识库问答、数据分析、文档处理等智能体应用,数据全程不出域,满足核心生产系统的合规要求。模型已向vLLM、SGLang、TensorRT-LLM、llama.cpp和KTransformers五大推理框架提交适配,并支持LLaMA-Factory、Mindformers等微调框架,开发者可沿用熟悉的开源工具链实现全链路落地。在业务场景上,模型已在运营商智能客服、财务报表分析、招标文件评审、合同风险识别等场景验证了端到端自主执行能力。
Xing4.0-29B-A4B的发布,验证了MoE稀疏激活架构在智能体任务中的有效性——更小的激活参数并不意味着更弱的任务执行能力,反而为消费级硬件上的本地化部署开辟了路径。随着国产算力与框架的持续成熟,训推一体的国产大模型生态正在加速成型,为企业级Agent应用提供了一条低门槛、高效率的落地路径。
