“牛来大模型”Ox Alpha身份之谜:1M上下文免费不限量,Tokenizer指纹直指智谱

作者:






“牛来大模型”Ox Alpha身份之谜:1M上下文免费不限量,Tokenizer指纹直指智谱






🐂
“牛来大模型”Ox Alpha身份之谜
1M上下文 · 免费不限量 · 匿名上线 · 全网破案
Tokenizer指纹 · 视频token预算 · API错误码 · 智谱还是谷歌
AI
AI工具导航
cn.xcoolevdb.site · 2026年8月23日

“牛来大模型”Ox Alpha身份之谜:1M上下文免费不限量,Tokenizer指纹直指智谱

8月20日,一款名为Ox Alpha的匿名模型突然空降OpenRouter,104.86万token超长上下文、单次13.1万token输出、文本图片视频三模态输入,再叠加OpenCode平台连续数天几乎不限量免费使用——三天时间,它烧掉了250B token,成为全球开发者的焦点。更热闹的是身份之谜:一边是Tokenizer指纹和视频token预算层层指向智谱GLM,另一边是DeepMind研究员的暧昧发言把谷歌拉进”认牛大会”。本文用证据链复盘这场AI圈大型破案现场。

📋 本文目录

一、事件速览:8月20日,一头匿名”牛”闯进AI圈

二、规格拆解:1M上下文+131K输出+三模态,就是冲着代码Agent来的

三、免费风暴:OpenCode Go不限量供应,几天烧掉250B token

四、破案线索一:Tokenizer指纹——75个token的固定偏移

五、破案线索二:视频token预算——每秒147个token的”血缘”

六、破案线索三:API错误码与”trained by Z.ai”彩蛋

七、反转剧情:DeepMind暧昧发言,谷歌成”认牛大会”热门

八、性能罗生门:80%通过率的小样本测试 vs “低于预期”的差评

九、前科与范式:从Pony Alpha到Ox Alpha,匿名发布成模型圈新玩法

十、开发者行动指南:白嫖姿势、测试建议与匿名期风险

一、事件速览:8月20日,一头匿名”牛”闯进AI圈

8月20日,OpenRouter上线了一款来历不明的模型:Ox Alpha。平台方只留下一句说明——它来自一家”暂时保持匿名的第三方提供商”。据量子位报道(凤凰网科技转载),因为Ox就是”牛”,又正赶上《牛来》梗火遍互联网,国内网友干脆给它起了个亲切的外号:”牛来大模型”。

匿名+顶配+免费,三个要素叠加,效果立竿见影。开发者们拿着代码库、终端和各种刁钻任务一拥而上给它出题,社区里迅速分化出两大侦探阵营:一派验Tokenizer、测视频token消耗、抓API报错,恨不得给模型做一套”数字DNA鉴定”,把嫌疑锁定在智谱;另一派盯着DeepMind员工最近的社交媒体发言,以及那个迟迟没有正式露面的Gemini 3.5 Pro,坚信这头牛来自谷歌。

🔑 事件关键节点速览

• 8月20日:Ox Alpha以匿名身份空降OpenRouter,官方仅称”匿名第三方提供商”

• 规格曝光:104.86万token上下文,单次最大输出13.1万token,支持文本/图片/视频输入

• 随后:OpenCode宣布Ox Alpha上线OpenCode Go,连续数天几乎不限量免费,且不计入用户原本额度

• 三天内:累计使用量达250B token级别,约8500名独立用户,超11万次完成会话

• 8月22-23日:Tokenizer指纹、视频token预算等”破案”证据全网刷屏,智谱与谷歌成为两大候选

这不是OpenRouter第一次上演匿名模型猜谜戏码,但很可能是热度最高的一次。原因很简单:这头牛不仅免费,还真的很能干活。

二、规格拆解:1M上下文+131K输出+三模态,就是冲着代码Agent来的

先看纸面规格。Ox Alpha的配置放在2026年8月的模型圈里依然激进:

项目 Ox Alpha规格 业界常规水平
上下文窗口 104.86万token(约1M) 旗舰级普遍128K-1M
单次最大输出 13.1万token(131K) 普遍8K-64K
输入模态 文本+图片+视频 多数仅文本/图片
定位方向 代码、长周期Agent、复杂推理 通用对话为主
工具调用 支持 旗舰标配
推理模式 强制推理模式 可选

这些数字意味着什么?据量子位的解读,1M上下文意味着一次Prompt理论上能塞进整个大型代码仓库、数百页文档,或者一长串Agent运行记录;131K最大输出则远超普通聊天场景,为的是让模型一次性吐出完整的大型项目代码。再加上图片和视频输入、工具调用以及强制推理模式,Ox Alpha从一开始瞄准的就是代码Agent和长周期任务——这正是当下竞争最激烈的模型赛道。

本站在此前对智谱GLM-5.3的深度解析中提到过,编程与长程Agent已是国产旗舰模型的军备竞赛主战场;而Ox Alpha的规格画像,恰好与这条路线完全吻合。这也是它被怀疑”出身名门”的第一个原因:无名之辈很难拿出这种工程规格。

三、免费风暴:OpenCode Go不限量供应,几天烧掉250B token

规格只是入场券,真正把Ox Alpha推上风口的是免费策略。OpenCode随后宣布,Ox Alpha上线OpenCode Go,连续数天几乎不限量免费使用,而且不计入用户原本的Go额度。公开讨论中甚至出现了”每天100万亿token级别服务容量”的说法——即便按保守口径估计,这也是一场教科书级的流量轰炸。

效果如何?OpenCode公开数据显示,这头”劳模牛”已累计出现250B token级别的使用量,拥有约8500名独立用户和超过11万次完成会话。连Stripe CEO Patrick Collison都亲自上手试了一遍,给出的评价是:”It’s very impressive.”(非常令人印象深刻。)

📊 免费风暴数据面板

• 累计使用量:250B token级别(上线仅数天)

• 独立用户:约8500名

• 完成会话:超11万次

• 免费政策:OpenCode Go不限量、不占原额度

• 名人背书:Stripe CEO Patrick Collison实测”very impressive”

对普通开发者而言,这是实打实的红利窗口:不用注册海外支付方式、不用买API套餐,就能白嫖一款1M上下文的多模态旗舰级模型跑真实任务。至于平台方为什么愿意烧这个钱——匿名模型+免费额度本身就是最便宜的全球众测,后面第九章会展开这个商业逻辑。

四、破案线索一:Tokenizer指纹——75个token的固定偏移

现在进入本文最有意思的部分:全网侦探是怎么给一头匿名牛做”DNA鉴定”的。第一条线索来自Tokenizer。

背景知识:tokenizer负责把输入内容切成模型能处理的token。不同模型家族往往采用不同的词表和切分逻辑,所以面对一些刻意设计的文本时,token数量会留下较稳定的”指纹”——想通过蒸馏或后训练模仿另一款模型的回答风格容易,但换个词表这件事,外部很难伪装。

据量子位报道,有测试者拿不同Prompt对Ox Alpha和多款模型进行比较,结果发现Ox Alpha与GLM-5.3的token计数呈现高度一致的关系。一组流传较广的测试中:同样一段混合了中英文、代码和emoji的文本,GLM-5.3与GLM-5.2都计算出68个token,而Ox Alpha显示143个——多出来的75个token,恰好能够由模型外部附加的一段隐藏System Prompt解释。另有测试者使用25组不同Prompt进行验证,也观察到了类似的固定偏移关系。

🔍 线索一速读:Tokenizer指纹

• 测试文本:中英文+代码+emoji混合

• GLM-5.3 / GLM-5.2 计数:68 token

• Ox Alpha 计数:143 token(固定偏移+75)

• 解释:偏移量恰好可由隐藏System Prompt覆盖

• 验证规模:25组不同Prompt均呈现固定偏移关系

换句话说:如果把隐藏System Prompt的75个token扣除,Ox Alpha的Tokenizer行为和GLM-5.3几乎完全重合。这是”智谱说”的第一块基石。

五、破案线索二:视频token预算——每秒147个token的”血缘”

如果说Tokenizer指纹还有”碰巧相似”的辩解空间,第二条线索的技术含量就高得多:视频token预算。

原理:文本模型可以通过蒸馏、后训练或者System Prompt去模仿另一款模型的回答习惯,但视频编码和token预算涉及多模态输入进入模型之前的工程设计——采样帧率怎么定、每帧分配多少token、时长增长时预算怎么膨胀,这些属于模型基础设施层的”底层工程指纹”,极难伪装。

据量子位报道,有研究者专门制作了4段受控测试视频,分别交给Ox Alpha和几款多模态模型,观察系统为视频分配多少输入token。结果,Ox Alpha和GLM-5V-Turbo在多项特征上出现了高度相似的token预算:

• 视频帧率变化后,采样策略基本不受影响;

• 视频时长增加时,token消耗约以每秒147个token的速度线性增长;

• 每帧分辨率变化对应的token缩放方式一致;

• 在4段控制视频上,两者测出的额外token预算甚至能够逐项对上。

对照组里,MiMo、Qwen和GLM-4.6V等模型都呈现出与Ox Alpha不同的特征。也就是说,在视频处理这个”难以伪装”的维度上,Ox Alpha与智谱GLM-5V-Turbo的工程指纹高度吻合。这是”智谱说”目前最硬核的证据。

六、破案线索三:API错误码与”trained by Z.ai”彩蛋

第三条线索来自API服务层——这是侦探们”钓鱼执法”的成果。

据量子位报道,社区有人故意给Ox Alpha传入异常参数,捕捉到了类似”[1210] The temperature parameter is illegal”的错误信息。这种错误码格式、参数限制以及中英文混排的返回方式,被认为与智谱相关服务存在较高相似度。毕竟正常自建服务的报错格式千奇百怪,能撞上同一套错误码编号体系的概率并不高。

更戏剧性的是,甚至还有用户声称在模型的推理输出中捕捉到过”trained by Z.ai”这样的残留信息——Z.ai正是智谱的海外品牌域名。不过需要强调,这一条目前主要来自社区截图和二手转述,证据等级明显低于前面的Tokenizer测试和视频token测试,现阶段更适合当作彩蛋来看。

证据 指向 证据等级
Tokenizer计数与GLM-5.3高度一致(固定偏移75) 智谱 强(25组Prompt复现)
视频token预算与GLM-5V-Turbo逐项吻合(147 token/秒) 智谱 强(工程指纹难伪装)
API错误码[1210]及中英混排报错格式 智谱 中等(相似度高)
推理输出疑似残留”trained by Z.ai” 智谱 弱(社区截图,二手转述)
DeepMind研究员Evan Otero暧昧发言 谷歌 弱(vague posting,无实证)
Gemini 3.5 Pro长期跳票+规格画像吻合 谷歌 推测(时间线+产品画像)

有意思的是,所有硬证据都指向智谱一边,而谷歌一边目前只有氛围证据。但AI圈的剧情从来不能只看证据——接下来就是反转部分。

七、反转剧情:DeepMind暧昧发言,谷歌成”认牛大会”热门

原本智谱的线索一路领先,结果8月22日前后,剧情拐向了谷歌。

先说客观背景:Ox Alpha公开的产品画像确实容易让人联想到Gemini——1M级超长上下文、原生图像和视频输入、面向长期Agent任务、强调复杂代码工程和工具调用,这些都是谷歌过去几代Gemini持续重点投入的方向。而谷歌此时恰好还有一款迟迟没有正式公布的旗舰:今年Google I/O期间,官方曾给出Gemini 3.5 Pro”Coming next month”的预期,结果发布时间一拖再拖,外界至今仍在等待。

真正的爆点是人事动态。据量子位梳理,Google DeepMind研究员Evan Otero在相关讨论中先发了一个词”Gemini”,随后又补了一句:”如果Ox Alpha就是我们一路遇到的朋友呢?”(What if Ox Alpha is the friend we made along the way?)

“如果Ox Alpha就是我们一路遇到的朋友呢?”——Google DeepMind研究员 Evan Otero

当然,这两条发言都没有明确表示”Ox Alpha就是Gemini”,但在全网疯狂猜模型身份的背景下,迅速被社区解读为一次标准的vague posting(暧昧发帖)。Techmeme汇总的社媒讨论里,还有开发者注意到近期Gemini团队成员突然密集谈论Gemini以及下一代模型,也有人因此把牛来大模型与Gemini 3.5 Pro甚至Gemini 4联系起来。

于是网上迅速分成两派:一派拿着Tokenizer和视频token账单喊”这明明就是GLM”;另一派指着DeepMind的𝕏帖子说”Google你别演了”。平心而论,目前没有公开证据能坐实任何一方——这也恰恰说明,在蒸馏、模型融合、后训练以及第三方推理服务越来越普遍之后,”模型是谁训练的”和”模型在哪里部署”甚至都可能是两道独立的题。

八、性能罗生门:80%通过率的小样本测试 vs “低于预期”的差评

身份成谜的同时,Ox Alpha的实力同样充满争议,堪称罗生门。

捧的一方拿出了实测数据:一项包含10个真实软件工程任务的社区测试里,Ox Alpha完成8个,通过率80%。同一组任务里,Fable 5为65%,GLM-5.3为62%,GPT-5.6 Sol为52%。

模型 完成数(/10) 通过率
Ox Alpha 8 80%
Fable 5 6.5 65%
GLM-5.3 6.2 62%
GPT-5.6 Sol 5.2 52%

⚠️ 注意:这只是10道题的小样本社区测试,不属于官方Benchmark,远远不足以证明Ox Alpha综合能力已经超过这些旗舰模型。

踩的一方同样有来头。Abacus.AI CEO Bindu Reddy公开表示,他们测试后发现Ox Alpha表现低于预期,一些指标只达到较早一代模型的水平;沃顿商学院教授Ethan Mollick的评价是”惊艳程度一般般”;还有开发者用自己的私有Benchmark测试后认为它在低推理强度下表现一般,视觉任务中也有人发现它明显弱于Gemini系列。

所以眼下对Ox Alpha最准确的描述可能还是:一款在某些代码和Agent任务上表现极亮眼、规格极激进,同时评测结果分歧极大的匿名模型。免费+神秘身份,给它额外套了一层流量Buff——评价体系本身也被流量污染了,这正是匿名期模型的典型困境。

九、前科与范式:从Pony Alpha到Ox Alpha,匿名发布成模型圈新玩法

为什么全网看到Ox Alpha的第一反应是”智谱,你又来了”?因为前科实锤。

据量子位回顾,今年2月,OpenRouter曾经上线另一款匿名模型Pony Alpha,当时大家也围着它猜了半天,最后OpenRouter揭晓答案——Pony Alpha就是GLM-5的早期测试版本。所以这次Ox Alpha一出现,不少人的直觉就是同一套剧本重演:先匿名挂出来让全球开发者免费压测,收集真实负反馈,修完bug再官宣。

这套”匿名发布”范式的商业逻辑其实非常清晰:

免费众测替代内部评测:8500名独立开发者、250B token的真实使用,比任何内部Benchmark都能暴露长尾问题;

匿名规避舆论风险:表现好是惊喜,表现差无人追责,官方从容迭代;

悬念营销零成本:身份之谜自带传播性,全网自发破案等于免费广告;

竞对情报烟雾弹:对手无法确定这是新模型还是旧模型换皮,定价与发布节奏都被打乱。

顺带一提,匿名期的干扰项还包括”Cursor拿智谱开源模型自己再训一遍,然后套个牛头”这类调侃——在开源权重+定制后训练盛行的年代,这种解释竟然也无法被排除。本站在开源大模型许可证深度拆解一文中讨论过,Kimi K3与Qwen3.8-Max的开放权重正让”拿别人家底座练自己家模型”成为现实操作,模型血缘的模糊化已经是行业性课题。

至于答案,大概率不会藏太久。按照OpenRouter最近几次Alpha模型的剧情发展,匿名期结束之后,总得有人出来牵牛回家。

十、开发者行动指南:白嫖姿势、测试建议与匿名期风险

给想上手的开发者四条实操建议:

1. 入口:OpenRouter搜索Ox Alpha,或直接用OpenCode Go(免费几乎不限量、不占原额度);适合跑代码仓库级长任务、长文档处理、Agent工作流验证。

2. 测试建议:别迷信单一榜单,用你自己的真实任务测;重点测长上下文召回(100万token深处放关键信息再提问)、多轮Agent稳定性、视频理解三个差异化能力。

3. 匿名期风险:不要把公司核心代码、敏感数据喂给匿名模型——你不知道日志被谁收集、用于什么后续训练;免费期随时可能结束,别把生产链路绑死在上面。

4. 理性吃瓜:身份揭晓前,一切结论都是概率推断;对开发者而言,”好不好用”比”是谁家的”更重要,等官宣了再看也不迟。

💡 一句话总结

匿名、免费、顶配,Ox Alpha把”饥饿营销+免费众测”玩成了行为艺术;Tokenizer指纹与视频token预算的证据链目前领先,但DeepMind的暧昧发言提醒我们:在蒸馏与第三方部署盛行的年代,模型身份鉴定正在变成一门玄学。牛是谁的牛不重要,重要的是——趁免费,赶紧测。

后续如果智谱或谷歌官方认领这头牛,本站将第一时间跟进拆解。也欢迎回顾我们此前的相关深度内容:智谱GLM-5.3发布深度解析DeepSeek Harness开源Agent框架拆解,以及AI办公智能体大战分析


评论

一条对““牛来大模型”Ox Alpha身份之谜:1M上下文免费不限量,Tokenizer指纹直指智谱”的回复

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注