GLM-5是如何炼成的?
现在,其背后的论文终于完全公开了。
论文的名字也很直接:告别Vibe Coding,迈入智能体工程(Agentic Engineering)。
正如我们之前实测的那样,GLM-5能够自己连续跑代码超过24小时,进行700次工具调用和800次上下文切换,从零开始创建Game Boy Advance(GBA)模拟器。
简而言之,GLM-5将开源AI带入了长任务时代。
外国网友称其为“最好的开源模型”:
并且认为“极大拉小了和Claude Opus 4.6之间的距离”
此外,资本市场的表现也侧面印证了大模型公司的实力。
春节期间,智谱股价飙升,这毋庸置疑。
现如今,这份长达40页的论文,彻底揭开了它背后的一切技术秘密。亮点如下:
架构方面:在上一代经过验证的ARC(智能体、推理与编程)能力和MoE之上,引入DeepSeek同款稀疏注意力(DSA);成本大幅缩减的同时,长上下文能力依然保持。
后训练方面:全新构建的异步强化学习基础设施,将生成和训练解耦,加上独创的异步智能体RL算法,显著提升效率。
芯片适配方面:GLM-5完成了与华为昇腾、摩尔线程、海光、寒武纪、昆仑芯、沐曦以及燧原等国产芯片的全栈适配。
接下来,就让我们一起深入解析这篇让外国网友羡慕的技术论文。
在深入技术之前,我们需要先理解GLM-5在技术发展当下所面临的难题,即大模型需要真正开始干复杂的任务了。
因为在GLM-4.5时代,智谱已经证明了将ARC能力融合进单一MoE架构是完全可行的。
但当模型真正投入到复杂的软件工程、长周期多轮对话的真实业务中时,算力成本和真实环境适应性成为了老大难的问题。
△GLM-5的整体训练流程
GLM-5要解决的就是这些瓶颈。因此,它在核心技术方面祭出了三把板斧。
本文由主机测评网于2026-07-06发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://vpshk.cn/20260748998.html