Kimi K3 全栈开源首日:2.8 万亿权重落地 Hugging Face,昇腾 Atlas A3 / 阿里云 M890 同台 Day0 跑通

作者:






Kimi K3 全栈开源首日:2.8 万亿权重落地 Hugging Face,昇腾 Atlas A3 / 阿里云 M890 同台 Day0 跑通






🚀
Kimi K3 全栈开源首日
2.8 万亿权重 + 三项 Infra 同步落地
昇腾 Atlas A3 · 阿里云 M890 同台 Day0 跑通
AI
AI工具导航
@xcoolevdb · 2026年7月28日

7 月 27 日深夜,月之暗面把 Kimi K3 的模型权重、技术报告,连同 MoonEP / FlashKDA / AgentEnv 三项核心训练 Infra 一起推上 Hugging Face——这是全球首个迈入 3 万亿参数级别的开放权重模型。Hugging Face CEO 亲口确认:30 分钟点赞 4000+,创平台成立以来最快发布增长纪录。7 月 28 日上午,华为昇腾 Atlas A3、阿里云真武 M890、趋境科技 SGLang 同步完成 Day0 适配——国内首个跑通近 3 万亿参数模型的超节点当天上线。WebDev Arena 1679 Elo 登顶、K3 自己写编译器、自己设计 45nm 芯片原型,白宫指控、商务部回应、25 家美国公司联名反对封杀、月之暗面 500 亿美元目标估值——一文看懂这条把”前沿智能”门槛再次打下来的全栈开源之路。

📑 本文目录

· 一、为什么说”全栈开源”是这一枪

· 二、首日数据:Hugging Face 30 分钟 4000 赞

· 三、国产算力 Day0 适配:昇腾 / 阿里云 / 趋境科技

· 四、跑分:1679 Elo 登顶 WebDev Arena,全球第四

· 五、自主工程能力:模型自己写编译器、自己设计芯片

· 六、监管风暴:白宫指控、商务部回应、25 家公司联名

· 七、商业化跃迁:500 亿美元估值、最快半年港股上市

· 八、一张表:K3 vs Qwen3.8 vs DeepSeek V4 vs Fable 5

· 九、对 AI 工具选型的 4 条落地启示

一、为什么说”全栈开源”是这一枪

过去一周,开源社区有过太多”承诺开源但仓库还是 404″的戏码。7 月 16 日 K3 以托管服务首发后,Hugging Face 仓库连续十天挂着 404,几家海外技术媒体干脆做了一面倒计时墙。7 月 27 日深夜,承诺落地——月之暗面把 K3 的完整权重、技术报告、连同三项核心 Infra 技术一并推上了 Hugging Face、GitHub 和 ModelScope。

理解这次发布的真正重量,要先看它”全栈”到什么程度:

📦 7/27 深夜同步放出的”四件套”

· 模型权重:2.8 万亿参数 MoE 原生多模态模型,采用修改版 MIT 许可证

· 技术报告:47 页,覆盖训练方法、架构创新、评测与 Infra

· MoonEP:超大规模细粒度 MoE 通信库,负载不均场景保持极致效率

· FlashKDA:KDA 注意力算子高性能实现,H20 预填充速度比基线提升 1.72~2.22 倍

· AgentEnv:与 KVCache.ai 合作的智能体沙箱,支持环境快照、恢复与 Fork

“别人开源,是把菜谱给你;月之暗面,是把后厨连人带制度打包送你。”这是社区里流传最广的一句话。三项 Infra 技术的同步开源意味着:任何想复现 K3 训练的研究者,都能直接拿到 KDA 算子实现、MoE 通信库和 Agent 训练沙箱——这三样恰恰是大规模 MoE 训练最难的工程门槛。

2.8 万亿参数的硬指标

  • 总参数 / 激活参数:2.88 万亿 / 1040 亿
  • MoE 架构:896 个路由专家,每个 token 激活其中 16 个 + 2 个共享专家(56 倍稀疏比例)
  • 上下文窗口:原生 100 万 token
  • 多模态:从预训练第一天起视觉与文本就交织,视觉编码器 MoonViT-V2 从零训练(不依赖 SigLIP)
  • 注意力机制:Kimi Delta Attention(KDA,混合线性注意力,93 层中覆盖 69 层)+ Attention Residuals + 24 层门控隐注意力
  • MoE 优化:Stable LatentMoE 框架
  • 训练效率:相比 K2 提升 2.5 倍,MoonClip 二阶优化器把训练数据量从 40T 砍到 20T

二、首日数据:Hugging Face 30 分钟 4000 赞

权重上传后,社区热度几乎是即时引爆:

4000+
30 分钟 Hugging Face 点赞

#1
Hugging Face 趋势榜登顶

3700
上线前等待下载的开发者

1
平台成立最快发布增长纪录

Hugging Face CEO Clément Delangue 亲自发文:K3 上线 30 分钟点赞超 4000,登顶趋势榜榜首,创下了平台成立以来最快的发布增长纪录。这个数字的意义是:它不是营销话术,而是全球开发者社区用脚投票——他们等这一天,已经等了至少十天。

“现在,每个人都可以下载并部署 Kimi K3 模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。”
——月之暗面官方声明

三、国产算力 Day0 适配:昇腾 / 阿里云 / 趋境科技

权重放出的 12 小时内,国产算力链给出了教科书级别的”Day0″响应——不是”我们尽快评估”,而是当天就跑通、当天就上线:

🏛️ 华为昇腾 CANN:昇腾 950 全系列 + Atlas A3

· 7/27 深夜宣布:昇腾 950 全系列、Atlas A3 产品支持 K3 部署

· K3 896 专家的大 EP 部署场景,充分发挥昇腾超节点架构优势

· AIV 直接下发 UB Memory 通信任务,抬升 MoE 推理吞吐上限

☁️ 阿里云:灵骏真武 M890 超节点(国内首个跑通近 3 万亿)

· 7/28 上午宣布:真武 M890 超节点实例已 Day0 适配 K3

· 国内首个跑通近 3 万亿参数模型的超节点

· 千问 AI 平台、阿里云百炼后续将上线 K3 模型 API

· 真武 M890 硬件:144GB 显存、800GB/s 片间互联、原生支持 FP32 到 FP4 全精度

🔧 趋境科技:SGLang 推理引擎 Day0 适配

· 基于开源推理引擎 SGLang,完成 K3 在昇腾 Atlas A3 上的 Day0 推理适配

· SGLang 是当前大模型推理主流开源框架之一

海外同样响应迅速:Nebius、Baseten、Fireworks 等主流 AI 基础设施厂商均宣布首日完成适配。Nebius 给出了迄今对 K3 最高的评价:“首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步”

🚨 一个关键观察

国产算力链这次不是”补位”——是真在领跑。阿里云真武 M890 是国内首个跑通近 3 万亿参数模型的超节点,比海外几个主流厂商在 K3 上的适配并不慢。配合昇腾 Atlas A3 与趋境 SGLang,”国产超大 MoE 推理”这条线,从”实验室 Demo”进入了”生产可用”。

四、跑分:1679 Elo 登顶 WebDev Arena,全球第四

开源阵营第一次不是在”够用”上做文章,而是”我就是最强”。K3 在 WebDev Arena 上以 1679 Elo 登顶,成为首个全面超越 GPT / Claude 等闭源旗舰的开源模型

93.5%
GPQA 研究生级科学问答

77.8%
ProgramBench 编程第一

1679
WebDev Arena Elo 登顶

57.1
AA Intelligence Index 全球第四

  • GPQA:93.5%,高于 Claude Fable 5 的 92.6%,仅微低于 GPT-5.6 Sol 的 94.1%
  • ProgramBench:77.8% 第一
  • FrontierSWE:81.2 分(仅次于 Fable 5 的 86.6,高于 GPT-5.6 Sol 的 71.3)
  • Artificial Analysis Intelligence Index v4.1:57.1 分,全球第四

连对手都坐不住。马斯克在评测报道下留言”Impressive”,xAI 随后宣布启动 2 万亿参数 Grok 4.6 训练,明确以超越 K3 为目标。OpenAI 战略负责人则公开表示,K3 的性能”无法依靠简单的蒸馏或类似手段实现“——这句话从对手嘴里说出来,反而是对 K3 自研路线最强的背书。

五、自主工程能力:模型自己写编译器、自己设计芯片

真正让技术圈兴奋的,不是 K3 在公开榜单上的分数,而是技术报告里披露的自主工程能力——K3 不仅能”用工具”,它能”造工具”:

5.1 GPU 内核优化(24 小时,K3 自主完成)

K3 在 24 小时内自主完成了 AttnRes、DeepSeek Sparse Attention、KDA、MLA 四种代表性 GPU 内核的优化——这种任务通常需要资深的 CUDA 工程师团队花几周时间。关键结果:

  • AttnRes 延迟:283.6ms → 114.4ms(2.5 倍加速
  • DSA 运行时间减少 55.1%
  • KDA 运行时间减少 73.6%
  • MLA 接近峰值 TFLOPS
  • 综合表现:与 Claude Fable 5 持平,显著优于 Opus 4.8 / GPT-5.6 Sol / GPT-5.5

更值得注意的是:测试环境同时覆盖 NVIDIA H200 与来自其他供应商的 GPGPU,意味着 K3 的部署能力已不局限于英伟达生态——这与华为昇腾 / 阿里云真武的 Day0 适配形成了完美的”模型 + 算力”双线协同。

5.2 MiniTriton:从 Python 到 PTX 全链路自研的 GPU 编译器

K3 自主开发了名为 MiniTriton 的紧凑型 GPU 编译器,从 Python 前端到 PTX 代码生成全链路由模型完成。在 NVIDIA L20 上,MiniTriton 的性能超越 PyTorch eager、torch.compile 和标准 Triton 实现。换句话说,K3 不仅能写 CUDA,它能写”写 CUDA 的工具”。

5.3 48 小时自主芯片设计

作为早期概念验证,K3 在 48 小时自主运行中,基于开源 EDA 工具和 Nangate 45nm 工艺库,完成了一款推理芯片原型的设计、优化与验证。这款芯片:

  • 面积仅 4 mm²
  • 集成 146 万个标准单元
  • 0.277 MB SRAM
  • 带融合去量化的 INT4 MAC 阵列

这是一款”由模型设计、为模型服务”的芯片,标志着 AI 已具备从算法到硬件的全栈自主工程能力。

“过去的 AI 还不能算真智能——但我们正迈入经验时代,势不可挡。”
——图灵奖得主 Richard Sutton,WAIC 2026 主论坛

六、监管风暴:白宫指控、商务部回应、25 家公司联名

K3 开源这件事,从第一天起就不只是技术议题。开源后 24 小时内,三股力量同时下场:

6.1 美方指控与制裁威胁

  • 白宫科技政策办公室主任公开指控 K3 蒸馏 Anthropic 技术
  • 财政部长放话制裁
  • 传言实体清单可能波及月之暗面

6.2 商务部 7/28 回应

7 月 28 日,商务部发言人正式表态:“美方以莫须有理由打压中国科技企业扰乱全球产业链,中方将密切跟踪事态,保留采取一切必要措施维护国内企业合法权益。”这是中方在 K3 开源后给出的最高层级官方背书。

6.3 25 家美国公司联名反对封杀

7/24,黄仁勋在社交平台发布了一封由 a16z 发起、英伟达联合 Perplexity AI、Ollama 等科技公司共同签署的公开信,主张”前沿开源模型与前沿闭源模型应并存发展”。这份名单几乎囊括了硅谷的半壁江山:

  • 支持方(25 家):英伟达、微软、Meta、IBM、a16z、YC、Perplexity、Ollama、Hugging Face 等
  • 缺席方:OpenAI、Anthropic、Google——三家头部闭源实验室均未在首批名单上

🎯 一句话理解这场博弈

当开源前沿快速逼近闭源 SOTA,全行业可获取的”最低能力水位”被显著抬高,基础设施和平台公司(英伟达 / 微软 / Meta)天然倾向开放闭源前沿实验室(OpenAI / Anthropic / Google)天然强调安全边界。这场争论将直接影响美国 AI 监管框架、企业本地部署、云厂商竞争和中国模型使用限制。

七、商业化跃迁:500 亿美元估值、最快半年港股上市

开源不等于放弃商业化。K3 这一枪打出去后,月之暗面的资本化进程反而加速:

  • 日收入增长至少 6 倍(彭博)
  • ARR:6 月达 3 亿美元(4 月还只有 2 亿)
  • 融资节奏:5 月以 200 亿美元估值完成 20 亿美元融资(美团龙珠领投)
  • Pre-IPO 轮:7/22 报道,8 月启动,目标投前估值 500 亿美元(约 3386 亿元人民币)
  • 港股上市:最快 6 个月内登陆港股
500 亿
目标估值(美元)

6x
日收入增长倍数

3 亿
6 月 ARR(美元)

6 月
最快港股上市

八、一张表:K3 vs Qwen3.8 vs DeepSeek V4 vs Fable 5

模型 参数规模 开源状态 核心亮点 上手方式
Kimi K3(月之暗面) 2.8T(激活 1040 亿 / 896 专家) 已开源(修改版 MIT) WebDev Arena 1679 Elo 第一、自研编译器、自研芯片、权重 + Infra 全开 Hugging Face / ModelScope / 昇腾 / 阿里云
Qwen3.8-Max(阿里) 2.4T(激活未披露) 预览版承诺”很快”开源 双协议兼容、自称仅次 Fable 5 Token Plan / Qoder / QoderWork 预览版
DeepSeek V4-Pro 1.6T(激活 490 亿) 已开源 推理量仅前代 27%、峰谷计费极致性价比 API 正式商用(7/19 上线)
Claude Fable 5(参照) 未公开 闭源 公认天花板,FrontierSWE 86.6 API / Claude Code
GPT-5.6 Sol(参照) 未公开 闭源 综合旗舰,编码被 K3 逼近 API(7/9 全量商用)

同步观察 OpenRouter 生态

  • 中国开源模型占 OpenRouter 多模型 API 网关路由 token 用量 46.4%,美国模型 35.7%
  • OpenRouter 全球调用量周榜(7/20-7/26)前五全部为中国模型,小米 MiMo-V2.5 登顶
  • 开源模型处理 token 占比从 2026 年 1 月 34% 飙升至 6 月 65%
  • 中国大模型在全球调用量中连续 11 周领跑,开源模型下载量占比 41%
  • Mozilla《开源 AI 现状报告》:开源 vs 闭源平均性能差距缩至 3.3%

九、对 AI 工具选型的 4 条落地启示

🎯 给 AI 工具用户的 4 条落地建议

1. 私有化窗口期已到:K3 权重已落地,量化后约 1.4TB 显存门槛(MaaS 业务可走昇腾 / 真武超节点 Day0 适配),自托管首次具备”前沿性能 + 数据主权”双重价值——闭源模型随时可能涨价、限流、停服,而开源权重一旦落到硬盘里,谁也夺不走。

2. 换模型成本降至历史最低:K3 兼容 OpenAI / Anthropic 双协议,Cursor / Claude Code / Trae / 各类 Agent 框架改一行配置即可切换。建议对 K3、Qwen3.8、DeepSeek V4 做一轮同题横测再锁定主力模型。

3. 国产算力链进入”订单验证”阶段:华为昇腾 / 阿里云真武同台首日适配,证明国产超节点已能稳定承载 3 万亿参数 MoE 推理;国产芯片”能用 → 好用”开始进入指数拐点。做企业本地化部署评估时,国产算力首次可以进入”必选”列表而非”备选”。

4. 编程场景盯紧缓存命中率:K3 官方 API 输入 3 美元 / 缓存 0.3 美元(每百万 token),缓存命中与未命中价差 10 倍——用好提示词缓存 + 投机解码(Draft Model),账单能直接砍一个数量级。

图灵奖得主萨顿说”我们正迈入经验时代”,K3 这场全栈开源把”经验时代”的入场券几乎免费递到了每个人手里。无论你用不用得动 K3 本身,至少从此,最强模型的权重,不再只锁在几家硅谷公司的服务器里。AI工具导航会持续跟踪 K3 量化版本、MiniTriton 编译器、45nm 芯片原型的后续实测,第一时间带来第一手横评。

本文综合自:每日经济新闻、新智元、第一财经、北京日报、新浪财经、36 氪、券商中国、界面新闻、硅基见闻、硅基局外人及月之暗面、阿里云、华为 CANN、Hugging Face、Artificial Analysis 官方披露。数据截至 2026 年 7 月 28 日 16:00。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注