021-37708864
科学技术未来
行业资讯
公司新闻
技术专题
凌晨GLM-5炸场!世界开源模型第一名!模型训练大幅创新!
来源:https://www.51cto.com/article/836444.html | 作者: 云昭 | 发布时间 :2026-02-21 | 141 次浏览: | 🔊 点击朗读正文 ❚❚ | 分享到:
凌晨GLM-5炸场!世界开源模型第一名!模型训练大幅创新!实测:Agentic能力、前端细节逼近专业人士,可模拟手机OS,游戏秒运行!代际变化大模型叙事逻辑已经出现了极为明显的变化。过去三年,大家更会关注:谁更会回答问题,谁回答得更聪明、准确、快速?但随着一系列Agent产品的涌现,大模型也开始向真实世界的复杂任务发起冲锋。现在的问题变成:谁能真正承担任务?

GLM-5 终于来了!


2月12日凌晨,智谱正式发布了GLM-5。


早上,小编就围绕它展开了测评。先说一句话感受,可以说非常跟上一代GLM-4.7,比起来,代际变化非常大。


一句话感受,是一场非常激进的扩张。


模型训练大幅创新


先来看模型和参数,参数规模从 355B(32B 激活)跃升到 744B(40B 激活),预训练数据从 23T tokens 增加到 28.5T tokens,同时引入 DeepSeek Sparse Attention,在维持长上下文能力的同时压缩部署成本。


这样,虽然整体模型大了一倍、但部署成本没有增加多少,同时,模型表现更加稳定了。


真正的变化发生在训练范式上。


强化学习一直是大模型从“能用”走向“好用”的关键,但问题是效率极低,尤其在超大模型上几乎难以规模化。GLM-5 团队为此构建了一套名为“ slime”的异步强化学习基础设施,大幅提升训练吞吐量,让后训练不再是粗颗粒度修补,而是高频、细粒度迭代。这意味着模型不仅在能力上变强,在优化路径上也更系统。


全球开源模型综合排名第一


效果如何?


在推理、代码与智能体任务上,GLM-5 已经成为全球开源模型中的最佳表现者,并开始逼近一线闭源模型。



有一个例子值得注意。


在衡量长期规划能力的 Vending Bench 2 上——一个要求模型经营一年“自动售货机业务”的基准测试——GLM-5 最终账户余额达到 4,432 美元,在开源模型中排名第一,接近 Claude Opus 4.5。这里考验的不是答题,而是资源调度、长期决策与策略稳定性。



从对话转向工作,大模型转向Agentic时代


更值得注意的是定位变化。


GLM-5 不再强调“聊天能力”,而是明确面向复杂系统工程与长周期 Agent 任务。在内部 CC-Bench-V2 评测中,其在前端、后端与长任务执行上显著超越 GLM-4.7,缩小与顶级模型的差距。


这其实透露出一个更重要的趋势变化:基础模型正在从“对话产品”转向“工作基础设施”。(从 Claude Opus4.6 也能看出来这个趋势越来越明显。)


就像 Office 之于知识工作者,IDE 之于工程师,大模型正在成为一套“生产力系统”。


GLM-5 已经支持将文本或原始材料直接转化为 .docx、.pdf、.xlsx 等文件——PRD、财务报表、课程讲义、试卷、执行手册、菜单——从输入到交付,一步完成。


这也说明,生成内容这种能力已经被各大模型厂商卷到足够Cover了,今年以后的大模型的突破重点,将长期聚焦在“完成工作闭环”方面。

新闻资讯

了解行业动态,紧跟时代脉搏,紧抓技术风口