菜单
小墨

小墨

GLM-5.3:开源大模型的后训练突破与安全守护

在大型语言模型的发展历程中,基座模型的迭代一直是行业关注的焦点。然而,当基座模型的参数规模逐步逼近物理极限时,如何在现有架构上进一步释放模型潜力,成为值得深入探讨的课题。GLM-5.3的发布为这一命题提供了新的解题思路——在不改变基座模型的前提下,通过极致的后训练Scaling实现能力的跃升。

更接近真实开发体验的编程体感

GLM-5.3的核心突破在于其后训练策略的系统性升级。与前代GLM-5.2相比,该模型在数十倍扩展的长程任务环境、更丰富多样的任务类型以及超长的后训练时间三个维度上实现了质的飞跃。技术层面,IndexShare、SAO以及持续演进的新一代Slime框架构成了高效强化学习的三大支柱,使得模型能够在相同基座上持续进化。实验结果表明,这种充分的后训练确实涌现出了超出预期的能力提升,暗示着当前基座的智能上界远未触及天花板。

安全能力的涌现:从漏洞发现到协议审计

在衡量模型真实编程能力的各项基准测试中,GLM-5.3展现出令人瞩目的竞争力。在Terminal-Bench 3.0测试中,模型得分从4.6跃升至28.3;在DeepSWE v1.1上,得分从46.2提升至66.9;在Agents' Last Exam上,得分从23.8提升至28.5。这些数据表明,GLM-5.3在复杂软件工程、终端操作和真实世界Agent任务上均取得了显著进步。

单弦不成音,独木不成林

“GLM团队”
积墨 AI 核心产品

积墨 AI 智能体开发平台

快速搭建具备商业价值的 AI 智能体,支持复杂工作流编排、50+ 主流模型接入与私有化部署。

开源的盾:重新定义AI安全生态

GLM-5.3的训练方法论值得深入剖析。不同于传统训练模式仅让模型完成孤立编程题,该模型的训练环境被拓展至接近真实专家工作的完整流程。部分任务的复杂度相当于一位工程师连续数天的工作量——以机器学习优化任务为例,模型使用与算法工程师相同的计算集群、存储系统、内部文档、代码库和实验结果,需端到端实现可量化的提速。在这样的环境中训练,模型学到的不再是单向执行指令,而是从发现问题开始,推进分析、实施验证,最终独立完成工作的完整能力链条。这种训练范式使得GLM-5.3在编程与智能体能力上接近Claude Fable 5的水平,同时在Token利用率上展现出显著优势——在High档位下达到31.4%的准确率,每项任务平均仅需输出约5万tokens,远低于Claude Opus 4.8所需的约12万tokens。

随着任务环境的不断扩张,研究团队观察到模型在网络安全领域的表现超出预期。安全能力的涌现并非偶然——网络安全工作本质上是约束严格的编程能力,而编程能力的提升自然带动了安全边界的拓展。在CyberGym测试中,GLM-5.3得分为84.5%,高于GLM-5.2的77.2%,也略高于部分闭源模型。在ExploitBench和ExploitGym等更考验深度推理能力的基准上,GLM-5.3同样展现出显著进步,但与前沿闭源模型相比仍有差距。值得注意的是,三个基准呈现一致的规律:越接近漏洞利用链前端,GLM-5.3相较前代的提升越明显;越深入完整利用,模型与闭源前沿模型之间的差距也越大。换言之,模型进步最快的方向正是当前仍需重点追赶的方向。 更为深远的是,安全能力的边界已从软件代码审查延伸至互联网基础协议。借助GLM模型在DNS协议中发现潜伏40余年的关键协议级漏洞——攻击者只需发送少量特殊请求,即可将服务器计算压力最高放大近8万倍,可能影响全球九成以上的主流DNS系统。此外,GLM-5.3还协助发现了Cursor编辑器中的混合架构漏洞、数亿用户级通信软件的高危远程代码执行漏洞、微软邮件系统

如有侵权,请联系删除。

#大模型#开源#网络安全#后训练
分享文章

相关文章推荐

试用咨询
企业微信二维码

扫码添加企业微信