标签: 多模态

  • 智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8






    智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8


    智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8

    开源大模型
    原生多模态
    2026年9月4日
    约8分钟读完

    📌 本文看点

    ① 匿名模型Ox-Alpha六天悬念复盘:怎么把全球开发者社区钓上钩
    ② 320B-A18B全新预训练架构,GLM-5系列首个原生多模态,跟GLM-5.3旗舰是什么关系
    ③ 价格账本:百万Token输入0.8元、输出2.8元,限时5折后0.4元起,什么概念
    ④ 10万张国产芯片扛住全球负载,比登顶更重要
    ⑤ 开发者接入指南:三行代码、格式全兼容,本地部署四条路线怎么选
    ⑥ 智谱半年报里藏的下一步:GLM-6.0瞄准自进化,下一代基座已在路上

    8月的最后一周,全球AI开发者都被一头来历不明的”牛”搅得心神不定。8月20日,一个代号Ox-Alpha的匿名模型悄悄登上大模型聚合平台OpenRouter,上线首日直接冲到调用量第一,刷新平台单日纪录;随后它又在代码评测平台OpenCode,把DeepSeek保持了56天的榜首位置拉下马。

    没人知道它姓甚名谁,中文社区干脆给它起了个亲昵的外号——“牛来”。8月26日晚,智谱正式摘下它的面具:Ox-Alpha就是GLM-5.3-Flash,一个320B总参数、每个Token只激活18B的MoE模型,也是GLM-5系列里第一个原生多模态模型。

    这篇文章把”牛来”的来龙去脉、硬参数、价格账本、接入方式,以及智谱半年报里藏着的下一步棋,一次说清楚。

    01 · 六天悬念:Ox-Alpha怎么把全球社区钓上钩

    先复盘时间线,这场”猜谜营销”的节奏值得细品:

    “牛来”事件时间线

    8月20日Ox-Alpha上线OpenRouter,首日登顶调用量第一
    随后数日登顶OpenCode,终结DeepSeek 56天榜首
    匿名期间编程测试首日即获80%得分率,彭博社发出问询
    8月26日智谱官宣:Ox-Alpha = GLM-5.3-Flash

    匿名期间,社区猜谜热一度达到顶点:有人根据分词器特征和视频Token消耗模式,推断它出自智谱GLM系列;也有人押注是谷歌DeepMind的下一代模型。智谱官方后来透露,”牛”这个代号灵感源自国内近期热映的一部电影——六天之后,谜底揭晓,”牛”真的被牵出来了。

    💡 为什么”牛来”能炸场:在权威的Artificial Analysis智能指数测评中,它拿下57分,与Anthropic旗舰Claude Opus 4.8持平;而它的定价只有Opus 4.8的1/40。一款开源模型第一次以这个姿态站上成本前沿。

    02 · 硬底子:全新预训练的320B-A18B,GLM-5系列首个原生多模态

    先把最容易搞混的一件事说清楚:GLM-5.3-Flash不是从GLM-5.3旗舰上”裁剪”出来的。它是一个全新的预训练模型,用了约30万亿Token的多模态数据从零预训练,跟8月14日发布的GLM-5.3旗舰是两条产品线:

    • GLM-5.3旗舰:与GLM-5.2共用约7450亿参数的MoE基座,所有提升来自后训练,官方称复杂编程与长程任务的端到端完成率提升超50%,在Terminal Bench 3.0等长程编码基准中拿下开源模型最优成绩;官方数据显示其代码审计能力可在开源项目中发现数千个潜在漏洞。
    • GLM-5.3-Flash:全新架构,专为极低成本设计,走”成本前沿”路线,基准表现与实际应用均优于GLM-5.2。

    Flash的架构细节值得展开:总参数320B、单Token激活约18B,采用稀疏注意力(DSA)与线性注意力(KDA)混合架构,配合MLA、mHC和MTP等组件;语言模型45层,视觉编码器24层。

    GLM-5.3-Flash 核心规格

    模型规格320B总参 / 18B激活(MoE)
    架构亮点DSA稀疏注意力 + KDA线性注意力混合
    多模态图像 / 视频 / 文件 / 文本输入(文本输出)
    上下文窗口100万Token,最大输出128K
    预训练数据约30万亿Token多模态数据
    智能指数57分(AA口径,追平Claude Opus 4.8)

    “原生多模态”这四个字对GLM系列意义不小——智谱的GLM终于”有眼睛了”,图像、视频都能直接读进上下文,再叠加1M窗口,处理长视频理解、批量文档这类任务的想象空间一下子打开了。

    03 · 价格才是王炸:把成本前沿打到地板上

    聊模型不聊价格是耍流氓。智谱官网的价格表是这样的:

    GLM-5.3-Flash API价格(bigmodel.cn)

    输入(原价)0.8元 / 百万Token
    输出(原价)2.8元 / 百万Token
    输入(限时5折)0.4元 / 百万Token
    输出(限时5折)1.4元 / 百万Token
    缓存命中(5折)0.115元 / 百万Token
    缓存存储限时免费

    限时5折从上线起算两周,9月10日前后截止,之后恢复原价。这个价格什么概念?官方口径是单任务成本0.045美元,进入智能成本前沿;而智谱半年报披露,GLM系列单位Token推理成本较年初下降了80%。有开发者做过对比,五折期间它的输入输出价格甚至比DeepSeek V4 Flash空闲时段的档位还要低一截——要知道后者一直被叫做”大模型斩杀线”。

    除了智谱自家平台,阿里云百炼、腾讯云、360智脑等平台也已经同步上架这个模型,价格口径基本一致。对开发者来说,多平台供应意味着不再被单一渠道的限流和可用性绑死,容灾选择多了。

    04 · 10万张国产芯片扛全球负载:比登顶更重要的事

    如果说”登顶OpenRouter”是流量层面的胜利,那支撑这场胜利的底座才是行业层面的大事:据36氪等媒体报道,支撑全球大规模免费测试的全部算力来自10万张国产芯片,供应链或来自华为、摩尔线程、海光等国内头部厂商。

    这件事的分量可以这样理解:过去国产算力讨论最多的是”能不能用”,这次是”扛不扛得住全球开发者的高并发轰炸”。上个月讯飞开源的星火X2.5端侧模型也强调了全国产算力全流程训练——国产模型+国产算力这条双线,正在从宣传口径变成工程事实。对政企、车载这些对数据安全和供应链自主有硬要求的场景,这往往不是加分项,而是准入项。

    05 · 开发者怎么用:三行代码接入,格式全兼容

    接入门槛非常低。模型代码是glm-5.3-flash,兼容OpenAI Chat Completions、Anthropic Messages等主流API格式,用OpenAI SDK就能直接调:

    from openai import OpenAI
    
    client = OpenAI(
        api_key="你的API Key",
        base_url="https://open.bigmodel.cn/api/paas/v4/"
    )
    
    resp = client.chat.completions.create(
        model="glm-5.3-flash",
        messages=[{"role": "user", "content": "用Python写个快速排序"}]
    )
    print(resp.choices[0].message.content)

    能力清单参考各平台文档:支持Function Calling工具调用、结构化输出、前缀续写、上下文缓存;不支持联网搜索、批量推理和模型调优(以百炼文档为准)。限流方面,以阿里云百炼为例是RPM 200、TPM 300万,高频场景基本够用。

    💡 适合什么场景:系统自动化、后端批处理、办公自动化、Agent工具调用这类高频、大规模、对成本敏感的调用。有开发者的实测结论很直白:所有系统自动化任务、后端任务、办公任务全面切换到它上面,”极度的经济实惠”。

    06 · 本地部署现实吗:先泼盆冷水,再给路线图

    “开源了是不是就能本地跑?”先泼冷水:官方Hugging Face权重是FP8格式,光文件就约306GiB,加载后还要预留框架开销、CUDA图、通信缓冲和KV Cache。所以对个人用户来说,开源的意义更多是”可白嫖的API+可审计的权重”,真要本地跑,得先看看自己配不配:

    部署路线 适合场景 硬件参考
    vLLM 多卡低延迟服务 官方示例TP4,优先NVIDIA Hopper及更新架构
    SGLang 长上下文、高吞吐 提供低延迟/高吞吐策略与HiCache
    KTransformers 消费级GPU+大内存异构 CPU-GPU异构专家推理,示例约350GB系统内存
    Transformers 研究代码、自定义算子 适合查权重看接口,不建议扛高并发

    个人玩家的现实路径是Ollama + GGUF量化版:社区量化文件大约15-30GB,装好Ollama后下载GGUF文件、写个Modelfile、ollama create导入就能跑。一台32GB内存的台式机配合CPU-GPU混合推理,跑量化版是够得着的。

    07 · 半年报视角:GLM-6.0瞄准自进化,下一代基座已在路上

    把镜头拉远一点,9月初智谱披露的半年报里藏着更多信息:上半年研发投入21.31亿元,同比增长33.6%;亏损20.72亿元,同比收窄。更关键的是技术路线的官方定调——“Scaling deep while scaling up”(横向扩展的同时进行深度扩展)。

    过去数月,GLM-5.1、5.2、5.3一直沿用同一个约7450亿参数的基座(今年1月完成训练,原计划使用半年以上),能力迭代主要靠后训练完成,市场也因此出现”智谱过度依赖后训练”的质疑。业绩会上智谱创始人唐杰的回应很直接:

    参数规模并非Scaling的唯一变量。这是结合现有数据、算力资源,权衡不同训练阶段边际收益作出的主动选择,并非停止基础大模型的迭代升级。

    智谱董事长刘德兵补了关键一刀:后训练做到极致之后,下一个阶段的增长必须回到基座模型上,公司下一代基座模型已经在推进。也就是说,GLM-6.0将回到基座迭代,方向瞄准”自进化”。过去11个月GLM系列完成六次迭代,智能指数从32提升到60——如果下一代基座兑现,这个斜率有望继续拉陡。

    08 · 冷静看:三个别神化的地方

    夸了这么多,泼三盆冷水保持清醒:

    1. 匿名营销是双刃剑。”匿名刷榜-官宣揭幕”的打法热度拉满,但也引来”数据是否可持续”的审视。模型真实口碑,最终要看开发者三个月后的留存,而不是发布周的热搜。
    2. 57分是单口径成绩。AA智能指数追平Opus 4.8,不等于全场景持平;而且它是”多模态输入、纯文本输出”,不支持联网搜索,重度多模态生成需求得绕道。
    3. 第三方可用性有波动。聚合平台的历史数据显示,部分时段可用率波动明显(从个位数到八成以上的时段记录都出现过)。生产环境务必做好重试、降级和多渠道备份——这也是多平台上架反而成了它的隐性优势。

    写在最后

    “牛来”这波操作,本质上是一次普惠价格+顶端实力的压力测试:用一款320B的开源多模态模型,把”旗舰级智能”的调用成本打到几毛钱档位,同时用10万张国产芯片证明自主算力扛得住全球负载。对开发者来说,最实在的动作很简单——趁着5折还没结束,把手里那些跑得心疼的批量任务切过去试试,用账单投票。

    📝 本文由 XcoolEVDB – AI工具深度解读 原创发布 | 数据与观点综合自智谱官方、36氪、新华网、腾讯云/阿里云等平台公开资料,截至2026年9月4日

    🔗 相关阅读:讯飞星火X2.5端侧双模型开源 | 腾讯混元Hy4 preview开源 | 阿里Qoder智能体工作台