腾讯混元Hy4 preview开源:小型团队的交付能力初现,但仍需人工把控最后一公里
今日,腾讯正式发布并开源混元Hy4 preview大模型。该模型拥有770B总参数、49B激活参数,上下文长度突破1M,专注于Agent、Coding与生产力场景的深度优化。相比上一代,Hy4 preview在多步骤Agent任务、代码开发和复杂任务拆解方面实现显著提升,尤其在上下文承接、指令遵循和长链路执行能力上展现出更强的稳定性。
实测验证:交付能力与边界清晰可见
在Coding场景中,Hy4 preview进一步强化了代码理解、生成、修改和复杂工程任务的处理能力;在生产力场景中,重点提升了文档处理、信息分析、办公自动化、游戏开发和跨工具协作等能力。特别值得注意的是,该模型首次具备了一句需求直接生成可玩游戏原型的能力,开发者可通过多轮交互持续完善复杂项目。在科学研究场景下,模型也展现出更强的复杂问题理解、推理与求解能力。 更值得关注的是,Hy4 preview在自身研发过程中发挥了积极作用——首次参与训练方法、数据策略、评估体系和底层算子的自动优化。通过自主分析推理系统瓶颈,围绕算子融合、通信优化等方向开展多轮优化,端到端吞吐相较基线提升31.8%,初步展现了自主优化推理基础设施的能力。
性能提升:多场景能力全面进化
为验证模型的实际表现,我们在WorkBuddy平台对Hy4 preview进行了多维度测试。通过AI编程工具采购调研、四端产品开发(Web、移动端、桌面端、3D作战室)和季度运营复盘三个不同复杂度的任务,我们发现: Hy4 preview已经具备"把一件事情做完"的能力。在四端产品开发测试中,模型不仅完成了从数据层设计到各端适配开发的全流程交付,还主动建立了共享数据层和大量自动测试,甚至连隐藏边界场景都考虑到了。这种小型产品团队式的交付能力,已经达到目前相当强的一档表现。 然而,"最后一公里"仍是当前瓶颈。在采购调研测试中,模型的信息密度、官方资料覆盖和动态政策捕捉能力明显优于普通搜索型回答,但因几处关键事实和成本计算错误被卡在及格线。数字自检和交叉校验环节的缺失,导致少量错误进入了核心结论。这说明,当前人力核验仍是必不可少的环节——模型像一个相当能干的采购研究员,但还不是可以不复核就签字的采购负责人。
场景,是腾讯做AI最厚的底牌。场景中的数据,不管是用户生成的,还是专业机构提供的,都为大模型提供了上下文。
“汤道生”积墨 AI 智能体开发平台
快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。
算力困境:追赶中的挑战与机遇
腾讯集团高级执行副总裁汤道生近日坦言,混元大模型经历了多个阶段和多次重构,但"公司整体算力严重不足"拖慢了模型训练和产品发展。这种算力焦虑早有迹象:Token调用呈爆发式增长,有限资源甚至需要优先满足内部需求。 从财务数据看,2026年二季度腾讯资本开支达到527.8亿元,同比大增176%,环比一季度增加约65%,主要投向AI基础设施和算力采购。仅上半年资本开支就达到约847亿元,已超过2025年全年792亿元的水平。 为应对算力挑战,腾讯选择开放生态策略,与更多芯片厂商合作,同时让国产算力芯片厂商拥抱腾讯作为应用标杆。同时,腾讯也在加速整合模型体系,自2月重建基础设施以来,混元大模型平均每两个月迭代一次大版本。
未来展望:模型之上
Hy4 preview已在WorkBuddy/CodeBuddy国内版及国际版、元宝、ima等产品同步首发,也可通过腾讯云Tokenhub和OpenRouter接入API使用。在定价上继续走普惠高性价比路线:输入6元/百万tokens,输出18元/百万tokens。 汤道生认为,AI应用不止模型,还有算法和工程。"场景,是腾讯做AI最厚的底牌。场景中的数据不管是用户生成的,还是专业机构提供的,都为大模型提供了上下文;场景中的历史互动,也能被提炼成个人记忆,或打造成可复用的技能。" Hy4仍在继续追赶基础模型,但腾讯显然不准备只靠模型翻身。对于行业而言,这次开源不仅是技术层面的突破,更是一次关于"人机协作边界"的深度实践——模型展现出的交付能力令人振奋,但如何设计好最后一公里的人工核验机制,将决定这类Agent能否真正落地为企业生产力工具。
如有侵权,请联系删除。
