智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主

作者:






智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主






GLM-5.3 来了
基座不动,纯后训练 · Terminal-Bench 暴涨 6 倍 · 两周内开源
AI
AI工具导航
cn.xcoolevdb.site · 2026年8月15日

智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主

8月14日中午,智谱甩出新一代旗舰 GLM-5.3。没换基座、没改架构、没堆参数——一句”Scaling post-training is all we did”定调,多项公开基准上成为当前排名最高的开源模型。

📋 本文目录

一、发布速览:一句话定调的”史诗级 Plus”

二、跑分拆解:六项基准数据全景对比

三、技术解读:什么是”后训练 Scaling”

四、安全彩蛋:269 个项目揪出 2436 个漏洞

五、大背景:国产三巨头一个月连环迭代

六、生态落地:荣耀 YOYO Claw 火速接入

七、普通开发者怎么选怎么用

八、结语:开源模型的天,真的变了

一、发布速览:一句话定调的”史诗级 Plus”

2026年8月14日中午,智谱正式发布新一代旗舰模型 GLM-5.3,总参数规模 7430 亿(743B,MoE 架构)。据证券时报报道,这次升级最”反直觉”的地方在于:GLM-5.3 与 GLM-5.2 共用同一个基座模型,参数量、架构完全未变,所有能力提升全部来自后训练阶段的规模化(post-training Scaling)。

“Scaling post-training is all we did.” —— 我们做的,只有后训练规模化。

智谱创始人唐杰此前在社交媒体上为这次升级定调为“史诗级 Plus”。据智谱官方披露,GLM-5.3 在内部自建体感评测中编程能力较 GLM-5.2 提升 50%,模型即日起上线 ZCode、AutoClaw 等平台,API 随后上线,完整模型权重将在两周内以宽松许可证开源(发布前先完成安全评估与模型加固)。

⚡ 关键信息速览

· 发布时间:2026年8月14日中午

· 基座:743B MoE,与 GLM-5.2 完全相同

· 提升来源:纯后训练(长程任务环境规模数十倍扩张 + 环境类型更丰富 + 训练时长延长)

· 编程能力:内部体感评测较 GLM-5.2 提升 50%

· 开源计划:两周内开放权重,宽松许可证

· 发布节奏:GLM-5(2/12)→ GLM-5.1(4/7)→ GLM-5.2(6/16)→ GLM-5.3(8/14),约两个月一更

二、跑分拆解:六项基准数据全景对比

光说”提升50%”没有体感,直接上数据。综合智谱官方发布、证券时报、CSDN 技术解读等多方信息,GLM-5.3 的基准成绩单如下:

基准测试 GLM-5.2 GLM-5.3 Claude Fable 5 GPT-5.6 Sol
Terminal-Bench 3.0 4.6 28.3 ↑6倍 33.7 34.6
DeepSWE v1.1 46.2 66.9 69.7 72.7
AutomationBench v1.0.6 26.2 48.2(第一) 46.2 45.8
CyberGym(安全) 77.2 84.5(第一) 83.8 83.6
ExploitBench(安全) 24.4 54.4 78.0 76.5
GDPval-AA v2 1508 1769 1743 1730

三个最值得注意的细节:

  • Terminal-Bench 3.0 从 4.6 跃升到 28.3——这是公认最难的终端任务基准,4.6 基本等于”不会做”,28.3 已经挤进第一梯队,与闭源旗舰的差距肉眼可见地缩小。
  • AutomationBench 和 CyberGym 两项直接反超 Claude Fable 5 和 GPT-5.6 Sol,这是开源模型少有的”局部登顶”。
  • 在 Z.ai Code Bench 高难度档上,GLM-5.3 以 31.4% 的通过率(消耗约 5 万 token)超越 Claude Opus 4.8 的 29.5%(消耗约 12 万 token)——用不到一半的 token 干了更多的事,对按量计费的开发者来说是实打实的成本优势。
  • 三、技术解读:什么是”后训练 Scaling”

    据证券时报的通俗解释:后训练 Scaling 指的是在模型预训练完成后,通过优化训练方法、提升数据质量和强化学习策略,让模型在特定任务上表现更优。可以理解为“课本没变,但换了更好的训练方法,因此提升了学生成绩”

    具体到 GLM-5.3,智谱做了三件事:把长程任务环境(long-horizon RL 环境)规模扩张数十倍;让环境类型更丰富;显著延长后训练时间。据头条技术博主”谦”的分析,这套打法的本质是:当预训练的架构红利见顶后,竞争主战场转移到了后训练阶段的工程能力——谁的任务环境构造得更好、奖励信号设计得更准,谁的模型就更聪明。

    💡 深层信号

    “同一基座、纯后训练带来 6 倍的 Terminal-Bench 跳升”说明智谱的后训练(尤其长程 RL 环境构造)已是核心壁垒;但它同时意味着架构红利已尽,后续升级必须靠更重的训练投入,边际成本会越来越高。这也是为什么各家都在卷”工程化后训练”而不是一味堆参数。

    四、安全彩蛋:269 个项目揪出 2436 个漏洞

    这次 GLM-5.3 最出圈的其实不是编程,而是网络安全能力。据多家媒体报道:

  • CyberGym 基准以 84.5% 排名第一,超过 Mythos 5 的 83.8%,拿下”最强开源安全模型”称号。
  • 白盒代码审查与漏洞发现能力持平 Mythos 5,实际在 269 个项目中发现了 2436 个漏洞
  • 据 ToxicDiary 等媒体报道,它还在知名 AI 编程工具 Cursor 里顺手揪出了一个严重漏洞——模型不只是会写代码,还能反过来审代码、找坑。
  • 一个耐人寻味的呼应是:就在上个月,开源社区 Hugging Face 曾通过部署智谱 GLM-5.2,还原 AI 智能体入侵攻击过程,帮助控制了事态。安全能力从”副产品”变成”主打牌”,GLM 系列算是给国产模型蹚出了一条差异化路线——对企业安全团队来说,以前请安全专家按小时计费,现在一个开源模型就能先扫一遍代码。

    五、大背景:国产三巨头一个月连环迭代

    GLM-5.3 不是孤立事件。过去一个月,国产头部大模型厂商完成了教科书级别的”接力发布”:

    时间 厂商/模型 关键点
    7月17日 月之暗面 Kimi K3 2.8 万亿参数,全球首个迈入 3 万亿级别的开源模型
    8月13日 DeepSeek V4 Pro 正式版 1.6 万亿总参数、激活 490 亿;输出 6 元/百万 token,仅为 Claude Fable 5 的 1/60
    8月12-14日 阿里 Qwen3.8 系列 Max 级 2.4T-A95B 权重首次开放;27B 版本消费级显卡可跑,Apache 2.0 协议
    8月14日 智谱 GLM-5.3 同基座纯后训练,多项基准开源第一,两周内开源

    据央广网报道,全球多模型聚合平台发布的 2026 年 7 月 AI 大模型调用量排行榜中,中国企业包揽前 5 名;在全球最大的 AI 开源社区上,中国开源模型累计下载量居全球首位。另有 OpenRouter 统计显示,中国大模型调用量已连续 15 周超过美国。

    更值得关注的是”开源”本身成了全球趋势:Meta 在今年 5 月还宣称旗舰模型不适合开源,8 月 10 日就发布了开源模型 Muse Glimmer;OpenAI 也在 2025 年推出过开放权重模型 GPT-oss。上海交通大学田丰指出,对后入场的企业来说,开源是成本最低、最直接拿到市场分发权限的办法——但要注意“开源 ≠ 免费”,开源大模型指的是”开放权重”,与传统开源”公开源代码、任何人可复现构建”只有部分重叠。

    六、生态落地:荣耀 YOYO Claw 火速接入

    模型发布不到 24 小时,8 月 15 日凌晨,荣耀全场景软件主理人席迎军在微博宣布:YOYO Claw 正式接入 GLM-5.3,”虾虾大脑”全新升级。YOYO Claw 是荣耀今年 4 月发布的跨端智能体,支持在荣耀 PC、荣耀 Pad 上运行,还能连接第三方设备。

    对普通用户来说,这意味着 GLM-5.3 的编程与智能体能力将直接进入手机和 PC 的系统级体验。据 CSDN 报道,GLM Coding Plan 也已全量上线 GLM-5.3,订阅用户无需等待权重开源就能第一时间用上。智谱官方口径是”即日起上线 ZCode、AutoClaw 等平台,API 随后上线”。

    🔗 一个细节

    智谱确认权重将在发布两周后开放,此前先完成安全评估与模型加固。结合 GLM-5.2 当年 MIT 协议开源的先例,GLM-5.3 大概率也会给一个相当宽松的许可证——对想私有化部署的企业来说,值得把这个时间点记在日历上。

    七、普通开发者怎么选怎么用

    1. 重度编程场景:现在就能用

    GLM Coding Plan 订阅用户已可直接切换 GLM-5.3;用 Claude Code、Codex、Cursor 等 Agent 工具的开发者,可以通过智谱的兼容端点接入。Terminal-Bench 28.3 的成绩意味着它在真实终端任务(编译、部署、调试流水线)上已经不是摆设。

    2. 安全审计场景:给代码库做”免费体检”

    269 个项目发现 2436 个漏洞的实战数据说明,用它做白盒代码审查、漏洞初筛是靠谱的。企业安全团队可以把 GLM-5.3 作为人工审计前的第一道过滤,大幅压缩审计成本。

    3. 成本敏感场景:横向比价再下单

    本周选项太多:要极致性价比选 DeepSeek V4 Pro(输出 6 元/百万 token);要消费级显卡本地部署选 Qwen3.8-27B(Apache 2.0);要开源旗舰权重等两周后的 GLM-5.3 和已开放的 Qwen3.8-2.4T。纯文本对话和成本敏感场景,DeepSeek V4-Flash 依然是兜底选择。

    4. 等 GLM-5.3 开源权重再自建

    743B MoE 架构对推理资源要求不低,中小企业建议关注各家 Day0 适配动态——参考 Kimi K3 开源首日昇腾 Atlas A3、阿里云 M890 同步跑通的先例,GLM-5.3 权重开放时大概率也会有国产算力平台的官方适配方案。

    八、结语:开源模型的天,真的变了

    “从’追赶’到’同台竞技’,只用了不到一年。GLM-5.3 最狠的地方不是跑分,而是证明了一件事:当别人还在堆参数的时候,智谱把’同一套参数’炼出了新境界。基座不动、纯靠后训练把 Terminal-Bench 拉高 6 倍——这不是挤牙膏,是跳级。开源模型与闭源旗舰之间的那堵墙,正在被一周一个的国产发布拆掉。”

    据证券时报观察,国产大模型的竞争焦点,正在从单项能力比拼走向高价值场景的全面争夺。Coding Agent、安全审计、企业服务等方向,正在成为大模型从”技术叙事”走向”商业叙事”的关键入口。GLM-5.3 能不能把开源第一的宝座坐稳?两周后权重开放、各路独立复测出炉,答案自然会浮出水面。


    评论

    一条对“智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主”的回复

    1. […] 本站在此前对智谱GLM-5.3的深度解析中提到过,编程与长程Agent已是国产旗舰模型的军备竞赛主战场;而Ox Alpha的规格画像,恰好与这条路线完全吻合。这也是它被怀疑”出身名门”的第一个原因:无名之辈很难拿出这种工程规格。 […]

    发表回复

    您的邮箱地址不会被公开。 必填项已用 * 标注