智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主
8月14日中午,智谱甩出新一代旗舰 GLM-5.3。没换基座、没改架构、没堆参数——一句”Scaling post-training is all we did”定调,多项公开基准上成为当前排名最高的开源模型。
一、发布速览:一句话定调的”史诗级 Plus”
二、跑分拆解:六项基准数据全景对比
三、技术解读:什么是”后训练 Scaling”
四、安全彩蛋:269 个项目揪出 2436 个漏洞
五、大背景:国产三巨头一个月连环迭代
六、生态落地:荣耀 YOYO Claw 火速接入
七、普通开发者怎么选怎么用
八、结语:开源模型的天,真的变了
一、发布速览:一句话定调的”史诗级 Plus”
2026年8月14日中午,智谱正式发布新一代旗舰模型 GLM-5.3,总参数规模 7430 亿(743B,MoE 架构)。据证券时报报道,这次升级最”反直觉”的地方在于:GLM-5.3 与 GLM-5.2 共用同一个基座模型,参数量、架构完全未变,所有能力提升全部来自后训练阶段的规模化(post-training Scaling)。
智谱创始人唐杰此前在社交媒体上为这次升级定调为“史诗级 Plus”。据智谱官方披露,GLM-5.3 在内部自建体感评测中编程能力较 GLM-5.2 提升 50%,模型即日起上线 ZCode、AutoClaw 等平台,API 随后上线,完整模型权重将在两周内以宽松许可证开源(发布前先完成安全评估与模型加固)。
· 发布时间:2026年8月14日中午
· 基座:743B MoE,与 GLM-5.2 完全相同
· 提升来源:纯后训练(长程任务环境规模数十倍扩张 + 环境类型更丰富 + 训练时长延长)
· 编程能力:内部体感评测较 GLM-5.2 提升 50%
· 开源计划:两周内开放权重,宽松许可证
· 发布节奏:GLM-5(2/12)→ GLM-5.1(4/7)→ GLM-5.2(6/16)→ GLM-5.3(8/14),约两个月一更
二、跑分拆解:六项基准数据全景对比
光说”提升50%”没有体感,直接上数据。综合智谱官方发布、证券时报、CSDN 技术解读等多方信息,GLM-5.3 的基准成绩单如下:
| 基准测试 | GLM-5.2 | GLM-5.3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 ↑6倍 | 33.7 | 34.6 |
| DeepSWE v1.1 | 46.2 | 66.9 | 69.7 | 72.7 |
| AutomationBench v1.0.6 | 26.2 | 48.2(第一) | 46.2 | 45.8 |
| CyberGym(安全) | 77.2 | 84.5(第一) | 83.8 | 83.6 |
| ExploitBench(安全) | 24.4 | 54.4 | 78.0 | 76.5 |
| GDPval-AA v2 | 1508 | 1769 | 1743 | 1730 |
三个最值得注意的细节:
三、技术解读:什么是”后训练 Scaling”
据证券时报的通俗解释:后训练 Scaling 指的是在模型预训练完成后,通过优化训练方法、提升数据质量和强化学习策略,让模型在特定任务上表现更优。可以理解为“课本没变,但换了更好的训练方法,因此提升了学生成绩”。
具体到 GLM-5.3,智谱做了三件事:把长程任务环境(long-horizon RL 环境)规模扩张数十倍;让环境类型更丰富;显著延长后训练时间。据头条技术博主”谦”的分析,这套打法的本质是:当预训练的架构红利见顶后,竞争主战场转移到了后训练阶段的工程能力——谁的任务环境构造得更好、奖励信号设计得更准,谁的模型就更聪明。
“同一基座、纯后训练带来 6 倍的 Terminal-Bench 跳升”说明智谱的后训练(尤其长程 RL 环境构造)已是核心壁垒;但它同时意味着架构红利已尽,后续升级必须靠更重的训练投入,边际成本会越来越高。这也是为什么各家都在卷”工程化后训练”而不是一味堆参数。
四、安全彩蛋:269 个项目揪出 2436 个漏洞
这次 GLM-5.3 最出圈的其实不是编程,而是网络安全能力。据多家媒体报道:
一个耐人寻味的呼应是:就在上个月,开源社区 Hugging Face 曾通过部署智谱 GLM-5.2,还原 AI 智能体入侵攻击过程,帮助控制了事态。安全能力从”副产品”变成”主打牌”,GLM 系列算是给国产模型蹚出了一条差异化路线——对企业安全团队来说,以前请安全专家按小时计费,现在一个开源模型就能先扫一遍代码。
五、大背景:国产三巨头一个月连环迭代
GLM-5.3 不是孤立事件。过去一个月,国产头部大模型厂商完成了教科书级别的”接力发布”:
| 时间 | 厂商/模型 | 关键点 |
|---|---|---|
| 7月17日 | 月之暗面 Kimi K3 | 2.8 万亿参数,全球首个迈入 3 万亿级别的开源模型 |
| 8月13日 | DeepSeek V4 Pro 正式版 | 1.6 万亿总参数、激活 490 亿;输出 6 元/百万 token,仅为 Claude Fable 5 的 1/60 |
| 8月12-14日 | 阿里 Qwen3.8 系列 | Max 级 2.4T-A95B 权重首次开放;27B 版本消费级显卡可跑,Apache 2.0 协议 |
| 8月14日 | 智谱 GLM-5.3 | 同基座纯后训练,多项基准开源第一,两周内开源 |
据央广网报道,全球多模型聚合平台发布的 2026 年 7 月 AI 大模型调用量排行榜中,中国企业包揽前 5 名;在全球最大的 AI 开源社区上,中国开源模型累计下载量居全球首位。另有 OpenRouter 统计显示,中国大模型调用量已连续 15 周超过美国。
更值得关注的是”开源”本身成了全球趋势:Meta 在今年 5 月还宣称旗舰模型不适合开源,8 月 10 日就发布了开源模型 Muse Glimmer;OpenAI 也在 2025 年推出过开放权重模型 GPT-oss。上海交通大学田丰指出,对后入场的企业来说,开源是成本最低、最直接拿到市场分发权限的办法——但要注意“开源 ≠ 免费”,开源大模型指的是”开放权重”,与传统开源”公开源代码、任何人可复现构建”只有部分重叠。
六、生态落地:荣耀 YOYO Claw 火速接入
模型发布不到 24 小时,8 月 15 日凌晨,荣耀全场景软件主理人席迎军在微博宣布:YOYO Claw 正式接入 GLM-5.3,”虾虾大脑”全新升级。YOYO Claw 是荣耀今年 4 月发布的跨端智能体,支持在荣耀 PC、荣耀 Pad 上运行,还能连接第三方设备。
对普通用户来说,这意味着 GLM-5.3 的编程与智能体能力将直接进入手机和 PC 的系统级体验。据 CSDN 报道,GLM Coding Plan 也已全量上线 GLM-5.3,订阅用户无需等待权重开源就能第一时间用上。智谱官方口径是”即日起上线 ZCode、AutoClaw 等平台,API 随后上线”。
智谱确认权重将在发布两周后开放,此前先完成安全评估与模型加固。结合 GLM-5.2 当年 MIT 协议开源的先例,GLM-5.3 大概率也会给一个相当宽松的许可证——对想私有化部署的企业来说,值得把这个时间点记在日历上。
七、普通开发者怎么选怎么用
1. 重度编程场景:现在就能用
GLM Coding Plan 订阅用户已可直接切换 GLM-5.3;用 Claude Code、Codex、Cursor 等 Agent 工具的开发者,可以通过智谱的兼容端点接入。Terminal-Bench 28.3 的成绩意味着它在真实终端任务(编译、部署、调试流水线)上已经不是摆设。
2. 安全审计场景:给代码库做”免费体检”
269 个项目发现 2436 个漏洞的实战数据说明,用它做白盒代码审查、漏洞初筛是靠谱的。企业安全团队可以把 GLM-5.3 作为人工审计前的第一道过滤,大幅压缩审计成本。
3. 成本敏感场景:横向比价再下单
本周选项太多:要极致性价比选 DeepSeek V4 Pro(输出 6 元/百万 token);要消费级显卡本地部署选 Qwen3.8-27B(Apache 2.0);要开源旗舰权重等两周后的 GLM-5.3 和已开放的 Qwen3.8-2.4T。纯文本对话和成本敏感场景,DeepSeek V4-Flash 依然是兜底选择。
4. 等 GLM-5.3 开源权重再自建
743B MoE 架构对推理资源要求不低,中小企业建议关注各家 Day0 适配动态——参考 Kimi K3 开源首日昇腾 Atlas A3、阿里云 M890 同步跑通的先例,GLM-5.3 权重开放时大概率也会有国产算力平台的官方适配方案。
八、结语:开源模型的天,真的变了
据证券时报观察,国产大模型的竞争焦点,正在从单项能力比拼走向高价值场景的全面争夺。Coding Agent、安全审计、企业服务等方向,正在成为大模型从”技术叙事”走向”商业叙事”的关键入口。GLM-5.3 能不能把开源第一的宝座坐稳?两周后权重开放、各路独立复测出炉,答案自然会浮出水面。
发表回复