标签: 开源大模型

  • 智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8






    智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8


    智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8

    开源大模型
    原生多模态
    2026年9月4日
    约8分钟读完

    📌 本文看点

    ① 匿名模型Ox-Alpha六天悬念复盘:怎么把全球开发者社区钓上钩
    ② 320B-A18B全新预训练架构,GLM-5系列首个原生多模态,跟GLM-5.3旗舰是什么关系
    ③ 价格账本:百万Token输入0.8元、输出2.8元,限时5折后0.4元起,什么概念
    ④ 10万张国产芯片扛住全球负载,比登顶更重要
    ⑤ 开发者接入指南:三行代码、格式全兼容,本地部署四条路线怎么选
    ⑥ 智谱半年报里藏的下一步:GLM-6.0瞄准自进化,下一代基座已在路上

    8月的最后一周,全球AI开发者都被一头来历不明的”牛”搅得心神不定。8月20日,一个代号Ox-Alpha的匿名模型悄悄登上大模型聚合平台OpenRouter,上线首日直接冲到调用量第一,刷新平台单日纪录;随后它又在代码评测平台OpenCode,把DeepSeek保持了56天的榜首位置拉下马。

    没人知道它姓甚名谁,中文社区干脆给它起了个亲昵的外号——“牛来”。8月26日晚,智谱正式摘下它的面具:Ox-Alpha就是GLM-5.3-Flash,一个320B总参数、每个Token只激活18B的MoE模型,也是GLM-5系列里第一个原生多模态模型。

    这篇文章把”牛来”的来龙去脉、硬参数、价格账本、接入方式,以及智谱半年报里藏着的下一步棋,一次说清楚。

    01 · 六天悬念:Ox-Alpha怎么把全球社区钓上钩

    先复盘时间线,这场”猜谜营销”的节奏值得细品:

    “牛来”事件时间线

    8月20日Ox-Alpha上线OpenRouter,首日登顶调用量第一
    随后数日登顶OpenCode,终结DeepSeek 56天榜首
    匿名期间编程测试首日即获80%得分率,彭博社发出问询
    8月26日智谱官宣:Ox-Alpha = GLM-5.3-Flash

    匿名期间,社区猜谜热一度达到顶点:有人根据分词器特征和视频Token消耗模式,推断它出自智谱GLM系列;也有人押注是谷歌DeepMind的下一代模型。智谱官方后来透露,”牛”这个代号灵感源自国内近期热映的一部电影——六天之后,谜底揭晓,”牛”真的被牵出来了。

    💡 为什么”牛来”能炸场:在权威的Artificial Analysis智能指数测评中,它拿下57分,与Anthropic旗舰Claude Opus 4.8持平;而它的定价只有Opus 4.8的1/40。一款开源模型第一次以这个姿态站上成本前沿。

    02 · 硬底子:全新预训练的320B-A18B,GLM-5系列首个原生多模态

    先把最容易搞混的一件事说清楚:GLM-5.3-Flash不是从GLM-5.3旗舰上”裁剪”出来的。它是一个全新的预训练模型,用了约30万亿Token的多模态数据从零预训练,跟8月14日发布的GLM-5.3旗舰是两条产品线:

    • GLM-5.3旗舰:与GLM-5.2共用约7450亿参数的MoE基座,所有提升来自后训练,官方称复杂编程与长程任务的端到端完成率提升超50%,在Terminal Bench 3.0等长程编码基准中拿下开源模型最优成绩;官方数据显示其代码审计能力可在开源项目中发现数千个潜在漏洞。
    • GLM-5.3-Flash:全新架构,专为极低成本设计,走”成本前沿”路线,基准表现与实际应用均优于GLM-5.2。

    Flash的架构细节值得展开:总参数320B、单Token激活约18B,采用稀疏注意力(DSA)与线性注意力(KDA)混合架构,配合MLA、mHC和MTP等组件;语言模型45层,视觉编码器24层。

    GLM-5.3-Flash 核心规格

    模型规格320B总参 / 18B激活(MoE)
    架构亮点DSA稀疏注意力 + KDA线性注意力混合
    多模态图像 / 视频 / 文件 / 文本输入(文本输出)
    上下文窗口100万Token,最大输出128K
    预训练数据约30万亿Token多模态数据
    智能指数57分(AA口径,追平Claude Opus 4.8)

    “原生多模态”这四个字对GLM系列意义不小——智谱的GLM终于”有眼睛了”,图像、视频都能直接读进上下文,再叠加1M窗口,处理长视频理解、批量文档这类任务的想象空间一下子打开了。

    03 · 价格才是王炸:把成本前沿打到地板上

    聊模型不聊价格是耍流氓。智谱官网的价格表是这样的:

    GLM-5.3-Flash API价格(bigmodel.cn)

    输入(原价)0.8元 / 百万Token
    输出(原价)2.8元 / 百万Token
    输入(限时5折)0.4元 / 百万Token
    输出(限时5折)1.4元 / 百万Token
    缓存命中(5折)0.115元 / 百万Token
    缓存存储限时免费

    限时5折从上线起算两周,9月10日前后截止,之后恢复原价。这个价格什么概念?官方口径是单任务成本0.045美元,进入智能成本前沿;而智谱半年报披露,GLM系列单位Token推理成本较年初下降了80%。有开发者做过对比,五折期间它的输入输出价格甚至比DeepSeek V4 Flash空闲时段的档位还要低一截——要知道后者一直被叫做”大模型斩杀线”。

    除了智谱自家平台,阿里云百炼、腾讯云、360智脑等平台也已经同步上架这个模型,价格口径基本一致。对开发者来说,多平台供应意味着不再被单一渠道的限流和可用性绑死,容灾选择多了。

    04 · 10万张国产芯片扛全球负载:比登顶更重要的事

    如果说”登顶OpenRouter”是流量层面的胜利,那支撑这场胜利的底座才是行业层面的大事:据36氪等媒体报道,支撑全球大规模免费测试的全部算力来自10万张国产芯片,供应链或来自华为、摩尔线程、海光等国内头部厂商。

    这件事的分量可以这样理解:过去国产算力讨论最多的是”能不能用”,这次是”扛不扛得住全球开发者的高并发轰炸”。上个月讯飞开源的星火X2.5端侧模型也强调了全国产算力全流程训练——国产模型+国产算力这条双线,正在从宣传口径变成工程事实。对政企、车载这些对数据安全和供应链自主有硬要求的场景,这往往不是加分项,而是准入项。

    05 · 开发者怎么用:三行代码接入,格式全兼容

    接入门槛非常低。模型代码是glm-5.3-flash,兼容OpenAI Chat Completions、Anthropic Messages等主流API格式,用OpenAI SDK就能直接调:

    from openai import OpenAI
    
    client = OpenAI(
        api_key="你的API Key",
        base_url="https://open.bigmodel.cn/api/paas/v4/"
    )
    
    resp = client.chat.completions.create(
        model="glm-5.3-flash",
        messages=[{"role": "user", "content": "用Python写个快速排序"}]
    )
    print(resp.choices[0].message.content)

    能力清单参考各平台文档:支持Function Calling工具调用、结构化输出、前缀续写、上下文缓存;不支持联网搜索、批量推理和模型调优(以百炼文档为准)。限流方面,以阿里云百炼为例是RPM 200、TPM 300万,高频场景基本够用。

    💡 适合什么场景:系统自动化、后端批处理、办公自动化、Agent工具调用这类高频、大规模、对成本敏感的调用。有开发者的实测结论很直白:所有系统自动化任务、后端任务、办公任务全面切换到它上面,”极度的经济实惠”。

    06 · 本地部署现实吗:先泼盆冷水,再给路线图

    “开源了是不是就能本地跑?”先泼冷水:官方Hugging Face权重是FP8格式,光文件就约306GiB,加载后还要预留框架开销、CUDA图、通信缓冲和KV Cache。所以对个人用户来说,开源的意义更多是”可白嫖的API+可审计的权重”,真要本地跑,得先看看自己配不配:

    部署路线 适合场景 硬件参考
    vLLM 多卡低延迟服务 官方示例TP4,优先NVIDIA Hopper及更新架构
    SGLang 长上下文、高吞吐 提供低延迟/高吞吐策略与HiCache
    KTransformers 消费级GPU+大内存异构 CPU-GPU异构专家推理,示例约350GB系统内存
    Transformers 研究代码、自定义算子 适合查权重看接口,不建议扛高并发

    个人玩家的现实路径是Ollama + GGUF量化版:社区量化文件大约15-30GB,装好Ollama后下载GGUF文件、写个Modelfile、ollama create导入就能跑。一台32GB内存的台式机配合CPU-GPU混合推理,跑量化版是够得着的。

    07 · 半年报视角:GLM-6.0瞄准自进化,下一代基座已在路上

    把镜头拉远一点,9月初智谱披露的半年报里藏着更多信息:上半年研发投入21.31亿元,同比增长33.6%;亏损20.72亿元,同比收窄。更关键的是技术路线的官方定调——“Scaling deep while scaling up”(横向扩展的同时进行深度扩展)。

    过去数月,GLM-5.1、5.2、5.3一直沿用同一个约7450亿参数的基座(今年1月完成训练,原计划使用半年以上),能力迭代主要靠后训练完成,市场也因此出现”智谱过度依赖后训练”的质疑。业绩会上智谱创始人唐杰的回应很直接:

    参数规模并非Scaling的唯一变量。这是结合现有数据、算力资源,权衡不同训练阶段边际收益作出的主动选择,并非停止基础大模型的迭代升级。

    智谱董事长刘德兵补了关键一刀:后训练做到极致之后,下一个阶段的增长必须回到基座模型上,公司下一代基座模型已经在推进。也就是说,GLM-6.0将回到基座迭代,方向瞄准”自进化”。过去11个月GLM系列完成六次迭代,智能指数从32提升到60——如果下一代基座兑现,这个斜率有望继续拉陡。

    08 · 冷静看:三个别神化的地方

    夸了这么多,泼三盆冷水保持清醒:

    1. 匿名营销是双刃剑。”匿名刷榜-官宣揭幕”的打法热度拉满,但也引来”数据是否可持续”的审视。模型真实口碑,最终要看开发者三个月后的留存,而不是发布周的热搜。
    2. 57分是单口径成绩。AA智能指数追平Opus 4.8,不等于全场景持平;而且它是”多模态输入、纯文本输出”,不支持联网搜索,重度多模态生成需求得绕道。
    3. 第三方可用性有波动。聚合平台的历史数据显示,部分时段可用率波动明显(从个位数到八成以上的时段记录都出现过)。生产环境务必做好重试、降级和多渠道备份——这也是多平台上架反而成了它的隐性优势。

    写在最后

    “牛来”这波操作,本质上是一次普惠价格+顶端实力的压力测试:用一款320B的开源多模态模型,把”旗舰级智能”的调用成本打到几毛钱档位,同时用10万张国产芯片证明自主算力扛得住全球负载。对开发者来说,最实在的动作很简单——趁着5折还没结束,把手里那些跑得心疼的批量任务切过去试试,用账单投票。

    📝 本文由 XcoolEVDB – AI工具深度解读 原创发布 | 数据与观点综合自智谱官方、36氪、新华网、腾讯云/阿里云等平台公开资料,截至2026年9月4日

    🔗 相关阅读:讯飞星火X2.5端侧双模型开源 | 腾讯混元Hy4 preview开源 | 阿里Qoder智能体工作台


  • 讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成






    讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成


    讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成

    开源大模型
    端侧AI
    2026年9月2日
    约6分钟读完

    📌 本文看点

    ① 端侧模型首个原生百万Token上下文,到底解决了什么老毛病
    ② 混合注意力+20万亿Token数据+全国产算力,技术底座拆给你看
    ③ 办公/代码/智能家居/机器人四大场景实测数据
    ④ Ollama一条命令跑起来的部署指南
    ⑤ 9月7日293B旗舰、10月全国产算力新品,后面还有大招

    9月的第一天,AI圈就丢下一颗炸弹。这次不是又一个大厂云端模型刷榜,而是一个更贴近你的动作:科大讯飞全资子公司词元星火,正式开源了星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型

    名字里的”端侧”两个字是重点——它们不是跑在云机房里,而是要装进你的手机、电脑、汽车座舱和智能家居设备里,本地跑、本地算、数据不出门。

    而这两款小模型最狠的一点是:端侧模型里,第一个原生支持最长100万Token上下文窗口的产品。之前这个量级只有云端大模型玩得起,现在小到1.7B参数的模型也能装下了。

    01 · 百万Token上下文:端侧等这一刻很久了

    先说清楚一个老问题:为什么端侧模型一直”记性差”?

    过去端侧模型处理长内容,通常要把文档切成几段分别处理。结果就是你可能亲身体验过的:问到第三章的内容,它忘了第一章说了啥;跨章节的规定互相打架,它对不上号。

    💡 一句话理解百万Token的价值:把一本几十万字的完整手册、一整年的聊天记录、或者一整套代码库一次性喂给模型,它能”看全”并”记住”,在连续对话中不丢前情。

    官方给的售后场景例子很直观:用户把完整售后手册导入星火X2.5-4B,然后问一个刁钻问题——”购买10天后设备故障,且使用过第三方耗材,符不符合换货要求?”

    这问题难在哪?答案藏在手册的不同章节里:退换货规则一章、故障处理一章、第三方耗材的例外条款又一章。模型得自己关联跨章节规定,给出综合判断。更绝的是,你再加个”用户在偏远地区”的新条件,它还能保持前文情境,结合物流、数据清除、费用承担和处理时限继续给建议。

    这就是长上下文的真实意义:不是比谁数字大,而是让模型基于完整信息做判断,而不是靠切片碰运气

    02 · 技术底座:混合注意力+20万亿Token+全国产算力

    两个数字先摆出来:

    星火X2.5端侧双模型 核心参数

    模型规格X2.5-4B / X2.5-1.7B
    上下文窗口原生100万Token(端侧首个)
    架构混合注意力架构
    预训练数据约20万亿Token多样化数据
    训练算力全国产算力平台全流程
    能力侧重智能体 / 代码 / 数学 / 指令遵循
    上下文专项千亿Token级高质量长文数据训练

    三个技术点值得展开说:

    ① 混合注意力架构:小模型装下大记忆的关键

    100万Token的上下文如果用传统注意力机制硬算,显存和算力都扛不住。星火X2.5采用混合注意力架构,在长序列处理上做工程取舍,让1.7B这么小的参数量也能承载百万级窗口——这是”端侧首个”能成立的技术前提。

    ② 20万亿Token预训练+千亿Token级长文数据

    上下文能力不是架构给个窗口就完事,还得喂对数据。讯飞披露星火X2.5使用了覆盖长篇文档、技术资料等场景的千亿Token级高质量数据专门训练上下文能力,也就是让模型在训练阶段就习惯”读长文”,而不是部署后才硬适应。

    ③ 全国产算力:从训练到推理的完整闭环

    两款模型基于全国产算力平台完成全流程训练。结合讯飞此前”基于华为昇腾等国产平台训练”的路线,这条”自主可控”的路线图在端侧继续延伸——对政企、车载这些对数据安全和供应链有要求的场景,这往往不是加分项,而是准入项。

    03 · 四大场景实测数据:办公、代码、智能家居、机器人

    参数是纸面的,场景数据更实在。官方给的四个方向:

    个人办公:从数据到双语报告全流程

    以Loomy上的办公案例为例:用户上传销售明细表,要求做销售分析并交付中英文部门业绩报告。星火X2.5-4B的完整动作链:

    1. 编写脚本完成数据汇总、关键指标提取和趋势分析
    2. 生成约3000字的中文部门业绩报告
    3. 沿用原有结构和格式生成英文版报告
    4. 完成内容、结构和排版校验

    从原始数据到双语交付一条龙,全程在本地完成。

    代码开发:4B对标大2-3倍的云端模型

    在算法实现、代码补全与生成任务中,星火X2.5-4B可对标参数规模大2至3倍的云端模型。更实用的是接入方式:支持通过DeepSeek Harness、OpenCode、Codex、Pi等开源Harness,把模型接进本地开发和自动化脚本流程。写代码、生成脚本、调试辅助,可以不出本地直接完成。

    智能家居:1.7B的响应速度亮眼

    🏠 在Domux智能家居测试集上,星火X2.5-1.7B控制指令端到端执行正确率达90.3%,平均响应时间仅0.85秒。听懂自然语言、直接执行,这个延迟对”开个灯”级别的交互才够用。

    机器人:部署到本体和边缘设备

    两款模型可部署在机器人本体或边缘设备中,支持操作控制、目标追踪、导航决策等任务,减少对云端连接和固定预设程序的依赖。对需要持续感知和连续执行的机器人场景,”断网也能干活”是刚需。

    04 · 部署指南:一条命令跑起来

    开源生态的兼容性决定上手门槛。这次讯飞给出的清单相当开放:

    部署支持清单

    硬件平台英伟达 / 华为 / 海光 / 后摩
    推理框架vLLM / SGLang / llama.cpp
    快速部署工具Ollama / LM Studio
    权重地址Hugging Face / GitHub
    API服务讯飞星辰MaaS(限时免费)

    如果只是想在自己电脑上体验一把,Ollama是最快路径:

    # Ollama拉起星火X2.5端侧模型(示例)
    ollama run spark-x2.5-4b
    
    # 或者用LM Studio图形界面加载GGUF版本
    # 权重下载地址:
    # Hugging Face: huggingface.co/collections/XHToken/spark-x25
    # GitHub:       github.com/XHToken/Spark-X2.5

    不想折腾本地部署的话,对应API已上线讯飞星辰MaaS平台(maas.xfyun.cn/modelSquare),目前限时免费,可以先白嫖再决定要不要本地化。

    05 · 端侧还是云端?给普通用户的真实建议

    别被”端侧首个百万Token”冲昏头,端侧和云端各有各的活法:

    维度 端侧(星火X2.5-4B/1.7B) 云端大模型
    隐私 数据不出设备,敏感场景强项 需信任厂商的传输与存储
    延迟 本地推理,智能家居0.85秒级 受网络波动影响
    断网可用 完全离线可用 依赖连接
    能力上限 4B对标大2-3倍云端模型(官方口径) 旗舰模型天花板更高
    成本 开源免费,硬件一次性投入 按Token计费,长期累积

    我的建议很简单:涉及隐私、要离线、高频低复杂度的活,端侧;复杂推理、开放性创作、重任务,云端。未来的形态大概率是端云协同——日常交互端侧扛,重活难活云端接。这次讯飞端侧+旗舰同步推进的节奏,就是在铺这条路。

    06 · 后续看点:9月7日293B旗舰,10月还有大招

    这次开源只是讯飞9月行程的第一站:

    • 9月7日:星火X2.5-293B旗舰基座大模型发布。这是目前讯飞参数规模最大的通用模型,重点升级代码生成和复杂智能体协作能力。
    • 10月1024全球开发者节:全国产算力全新主力通用大模型。目标在代码能力和Token性价比上进入国内第一梯队。
    📅 划重点:端侧双模型开源(9/1)→ 293B旗舰(9/7)→ 全国产算力新品(10月)。一个月三连击,讯飞这次把节奏卡得很密。9月7日旗舰发布后,建议回来对照看端侧与旗舰的能力差,那才是端云协同路线的完整拼图。

    07 · 结语:端侧AI的国产路线图

    回看这次发布,三个信号值得记住:

    第一,端侧军备赛正式开打。百万Token上下文从云端专属变成端侧标配的起点,就是9月1日。手机厂商、车载、智能家居的本地AI能力上限,被重新定义了。

    第二,全国产算力不再只是口号。从训练到部署(华为/海光/后摩硬件+讯飞自家平台),这条链路的完整度才是”自主可控”四个字的底气。

    第三,开源策略务实。Ollama、LM Studio、vLLM全兼容,权重开放+API限免,降低的是开发者的试错成本,扩大的是生态基数。

    至于百万Token到底能不能在你的设备上跑出官方数据的体验,等9月7日旗舰发布后,可以一起实测验证。

    你会用本地大模型来干什么?评论区聊聊。

    参考来源:IT之家、中国日报网、快科技、中国经营报、36氪、Tech in Asia(2026年9月1日-2日报道)

    本文由 AI 辅助整理生成,数据以官方发布为准 | 转载请注明出处


  • 腾讯混元Hy4 preview开源:770B参数、1M上下文,它还参与了”造自己”






    腾讯混元Hy4 preview开源:770B参数、1M上下文,它还参与了”造自己”






    🚀
    腾讯混元 Hy4 preview 开源
    770B 参数 · 1M 上下文 · 递归自我改进闭环
    2026年8月28日正式发布并开源
    AI
    AI工具导航
    cn.xcoolevdb.site · 每期扣一扣国产AI新品

    腾讯混元Hy4 preview开源:770B参数、1M上下文,它还参与了”造自己”

    8月的国产大模型圈卷得像早高峰的地铁:智谱刚开源GLM-5.3-Flash,阿里同日甩出Qwen3.8-Flash,8月28日腾讯混元直接把压箱底的Hy4 preview放上了开源平台——770B总参数、1M上下文,外加一个更值得琢磨的细节:这个模型参与了”造自己”。

    📑 本文目录
    1. 30秒速览:Hy4 preview 是什么
    2. 从Hy3到Hy4:四个月的跨代升级
    3. 1M上下文不是数字游戏
    4. 盲测2.99分:怎么看这份成绩单
    5. 四大生产力场景:为干活而生
    6. 真正的大新闻:它参与了造自己
    7. 价格与上手路径
    8. 八月混战:Hy4的卡位
    9. 适合谁用 & FAQ

    一、30秒速览:Hy4 preview 是什么

    先把结论放前面。2026年8月28日,腾讯混元发布并开源新一代大语言模型 Hy4 preview,核心参数三句话:总参数770B、激活参数49B(MoE架构)、上下文长度突破1M。官方定位很直白——“为生产力而生”,在代码、办公、游戏、科学这几类真实干活场景上重点发力。

    发布与开源时间
    2026-08-28
    架构
    MoE · 770B总参 / 49B激活
    上下文长度
    1M(1,048,576 tokens)
    推理模式
    high(默认)/ no_think
    开源协议
    Apache 2.0 · 免费商用
    API定价
    输入6元 / 输出18元 / 百万tokens

    模型已在 WorkBuddy / CodeBuddy 国内版及国际版、元宝、ima 等腾讯产品同步首发,普通用户打开产品就能体验;开发者可以通过腾讯云TokenHub和OpenRouter接入API;想自己折腾的,HuggingFace、GitHub、ModelScope、GitCode 四个平台都能直接拉权重,协议是Apache 2.0,允许免费商用。

    💡 一个背景

    自今年2月重建基础设施以来,混元大模型平均每两个月迭代一次大版本,采用”preview先行、正式版跟进”的节奏,把真实用户反馈持续引入研发。Hy4正式版大概率已在路上。

    二、从Hy3到Hy4:四个月的跨代升级

    光看770B没感觉?拉出上一代Hy3对比一下,升级幅度一目了然:

    维度 Hy3 Hy4 preview 变化
    总参数 295B 770B 约2.6倍
    激活参数 21B 49B 约2.3倍
    上下文长度 256K 1M 4倍
    迭代周期 四个月完成跨代

    这里得夸一下MoE(混合专家)架构的妙处:770B总参数意味着知识储备拉满,但每次推理只激活49B参数,相当于”大模型的脑子、小模型的电费”。这也是为什么各家旗舰都扎堆MoE——能力要堆上去,推理成本不能跟着翻几倍。

    三、1M上下文不是数字游戏

    100万token是什么概念?换算成汉字大约70多万字。给你两个直观参照:

    • 整本《红楼梦》丢进去,它能精准定位到任意一回的细节,不用你分段摘要、来回补充背景;
    • 一个中型项目的全量代码库一次性喂进去,跨文件排查bug、梳理整体架构,不用拆成碎片反复投喂。

    长上下文真正改变的是工作方式:很多过去依赖RAG”检索拼接”的场景,现在可以整本直接读。信息不再被切碎,上下文里的逻辑关系得以保留,这对代码理解、长文档分析、跨文件协作这类任务价值巨大。

    四、盲测2.99分:怎么看这份成绩单

    官方公布的评测方式有点意思:腾讯组织了163名内部专家,对203个工程任务做盲测,Hy4 preview拿到2.99/4.00的均分,略优于GLM 5.3(2.92)和Kimi K3(2.94)。另外在 Code Arena WebDev 榜单上排第5,开源模型里排第3。

    ⚠️ 冷静看数据

    这批盲测是腾讯内部组织的,专家和任务集由腾讯定义,”略优”的差距也在毫厘之间。参考即可,别当唯一标准。不过”稳居开源第一梯队”这个判断,目前多家媒体口径一致,没有太大争议。

    值得一提的是模型的训练方式:Hy4通过与软件工程、游戏、金融、安全等领域的腾讯专家数据共建,加上与WorkBuddy等产品的深度协同(Co-Design),练的是”真实生产力任务”而不是跑分技巧。这一点从下面四大场景的侧重就能看出来。

    五、四大生产力场景:为干活而生

    🛠 软件工程

    长程开发任务的理解、规划、调试与验证能力增强,能接住”从需求到上线”的完整链路;前端开发的视觉审美和交互质量也有针对性提升。和CodeBuddy协同后,走的是”模型+工具”的组合拳。

    📊 办公分析

    复杂办公环境理解和金融分析能力显著提升,重点优化数据分析与跨文件协作——从信息处理到文档、表格、演示文稿交付的完整流程,这是冲着WorkBuddy的办公场景去的。

    🎮 游戏开发

    “一句话生成可玩原型”能力增强,能熟练调用游戏引擎,开发者可以通过多轮交互持续完善复杂游戏项目。对独立开发者和小团队来说,这是个省掉大量重复劳动的方向。

    🔬 科学研究

    复杂科研问题的理解、推理与求解能力提升,在AI研发、分子动力学模拟、凝聚态物理、基础数学等场景均有长足进步。

    🔎 给HSE同行提个醒

    官方披露的训练数据共建名单里,“安全”与软件工程、游戏、金融并列出现。对做安全生产管理的人来说,这是个值得盯的信号——用Hy4做隐患数据图谱、应急预案初稿生成、安全培训问答这类场景,后续值得实际测一测。

    六、真正的大新闻:它参与了造自己

    如果只盯着参数和榜单,你会错过这次发布最本质的东西。

    Hy4 preview 第一次全程参与了自身的研发:训练方法、数据策略、评估体系、底层算子的自动优化,全都有它的份。模型自己提方案、跑实验、看结果、继续迭代,实验产生的代码、日志和反馈进入下一轮探索——官方称之为“初步的递归自我改进闭环”。翻译成人话:AI开始自己优化自己了。

    不止于”说漂亮话”,它还有可量化的产出:Hy4自主分析推理系统瓶颈,围绕算子融合、通信优化等方向开展多轮优化,端到端吞吐量相较基线提升31.8%,在不同上下文长度和并发度下均取得稳定收益。

    💡 为什么这事重要

    以前是人调模型,现在是模型也下场调自己——包括调自己跑起来的基础设施。这一步迈得不算大,但方向的味道很足:模型的迭代速度可能开始摆脱纯人力节奏。2026年这个时间点,”递归自我改进”从论文概念走进旗舰模型的发布说明,本身就是个里程碑式信号。

    七、价格与上手路径

    定价延续混元的普惠路线,在770B这个体量级里算相当克制的:

    计费项 价格(元/百万tokens)
    推理输入 6
    推理输出 18
    缓存命中输入 0.3

    另外,WorkBuddy和CodeBuddy开了为期两周的限时免费,想尝鲜的现在就能白嫖,建议抓紧。

    五条上手路径,按需选择:

    1. 纯体验:打开元宝或ima,直接聊,零门槛;
    2. 写代码:CodeBuddy国内版/国际版,两周限免期内值得重度试;
    3. 办公流:WorkBuddy,测测文档、表格、PPT的交付完整度;
    4. 开发者接API:腾讯云TokenHub或OpenRouter,model名 hy4-preview;
    5. 本地部署:四个开源平台拉权重,Apache 2.0免费商用。
    ⚠️ 部署前先掂量

    BF16原始权重约1.42TiB(131个safetensors分片),另有FP8量化版约减半。个人玩家基本无望,企业私有化也需要多卡集群。普通用户老老实实走API或产品端。

    📌 迁移提醒

    腾讯云TokenHub价格表显示,Hy3 preview 将于2026-08-31下线。还在调老版本API的项目注意迁移,别等报错了才想起来。

    八、八月混战:Hy4的卡位

    把镜头拉远,8月的国产大模型市场已经卷成什么样了:

    • 智谱:8月14日发布GLM-5.3,8月26日开源GLM-5.3-Flash(就是此前以”Ox Alpha”马甲匿名登顶OpenRouter的那位),320B总参/18B激活、原生多模态、MIT协议;
    • 阿里:8月26日开源Qwen3.8-Flash,125B总参仅激活6B,推理成本每百万tokens输入1元、输出3元;8月12日Qwen3.8-Max权重开源;
    • 月之暗面:Kimi K3 7月中旬发布、7月底全量权重开源,KDA注意力架构+1M无损上下文;
    • DeepSeek:V4系列8月17日起峰谷计费,周末全天闲时价。

    各家打法其实已经分化:有的卷价格(Flash系把token打到”白菜价”),有的卷开源声量(权重、许可证、Day0适配)。而Hy4 preview的差异点在于两头都不放弃——价格守在普惠线,同时把筹码押在”递归自我改进”+”自家产品矩阵协同”上:CodeBuddy、WorkBuddy、元宝、ima首发即落地,模型能力直接灌进亿级用户的生产力入口,这是纯模型厂商短期学不来的。

    九、适合谁用 & FAQ

    • 开发者:长程工程任务、大代码库重构与排查,CodeBuddy限免期内值得重度体验;
    • 办公族:数据分析、跨文件协作、文档表格PPT一条龙,WorkBuddy是主战场;
    • 游戏/创意团队:一句话出可玩原型,快速验证玩法;
    • 科研人员:模拟计算与复杂推理辅助;
    • 企业用户:Apache 2.0免费商用,私有化部署有FP8量化版可选。
    Q1:Hy4 preview免费吗?
    分两层:模型权重Apache 2.0协议开源,免费商用;API按量收费(输入6元/输出18元/缓存命中0.3元每百万tokens)。另外WorkBuddy和CodeBuddy有两周限时免费,产品端体验零成本。
    Q2:本地部署需要什么配置?
    BF16原始权重约1.42TiB,FP8量化版约减半,都需要多卡集群起步,个人玩家建议直接走API、元宝或ima。
    Q3:和GLM-5.3、Kimi K3比,选哪个?
    盲测分上Hy4略优(2.99 vs 2.92/2.94),但那是腾讯自家的测试口径。选型建议:重前端和长文档解析,Kimi K3口碑扎实;重极致性价比,GLM-5.3-Flash和Qwen3.8-Flash更狠;重长程生产力任务和产品协同,Hy4有独到优势。最好的办法是拿自己的真实任务各跑一遍。
    Q4:1M上下文实际能喂多少内容?
    中文场景大约70多万汉字,相当于一整本长篇小说,或一个中型项目的全量代码库。注意上下文越长,成本和延迟也越高,按需使用。

    写在最后

    参数和榜单很快会过时,但“递归自我改进闭环”这个方向值得单独记一笔:当模型开始参与优化自己的训练方法、评估体系甚至推理基础设施,迭代速度的天花板就从”有多少工程师”变成了”闭环转多快”。混元把”preview先行、正式版跟进”当成常规节奏,真实世界的反馈持续灌回研发——9月的Hy4正式版,到时候咱们再扣一扣细节。

    🔗 参考来源
    • 人民网《腾讯混元开源新一代大语言模型Hy4 preview》2026-08-29
    • 科技日报《腾讯混元Hy4 preview发布并开源》2026-08-28
    • 腾讯云TokenHub官方文档《模型价格》2026-08-28更新
    • 新浪科技《腾讯混元Hy4来了!7700亿参数直接开源》2026-08-29
    • 搜狐科技《腾讯770B模型开源:真正吓人的是它参与了造自己》2026-08-29
    • DataLearner《Hy4 preview:770B参数、1M上下文、价格与评测》2026-08-28
    腾讯混元Hy4 preview开源大模型MoECodeBuddyWorkBuddyAI编程
    AI工具导航 · cn.xcoolevdb.site | 本文由AI辅助整理,数据以官方发布为准