作者: admin

  • 开源大模型开始谈分成:Kimi K3与Qwen3.8-Max许可证深度拆解,免费午餐时代终结






    开源大模型开始谈分成:Kimi K3与Qwen3.8-Max许可证深度拆解,免费午餐时代终结






    📜
    开源大模型开始”谈分成”了
    Kimi K3 License · Qwen3.8-Max License · 2000万美元门槛 · 最高30%分成 · 免费增值时代
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月19日

    开源大模型开始谈分成:Kimi K3与Qwen3.8-Max许可证深度拆解,免费午餐时代终结

    在开源世界,最动听的一句话曾经是:”你尽管下载,不用付钱。”但2026年这个夏天,这句话正在被改写——”你可以下载,但当你把它包装成商业服务、收入达到一定规模时,需要回来协商分成。”7月底月之暗面随Kimi K3权重发布的定制License,和8月中旬阿里Qwen3.8-Max跟进的商用条款,正在给”开源=永久免费”的旧范式画上句号。

    📋 本文目录

    一、事件速览:两张License改写开源规则

    二、逐条拆解:Kimi K3 License的三个关键条款

    三、逐条拆解:Qwen3.8-Max License的四道门槛

    四、横向对比:K3、Qwen3.8-Max与MIT阵营

    五、谁被”点名”:MaaS厂商与AI编程助手的生死线

    六、为什么是现在:涨价潮与三重结构性推动

    七、佐证与先例:DigitalOcean们已经签字了

    八、Meta的镜像:同一周,另一条开源路线

    九、开发者实操指南:三件事尽早厘清

    十、结语:从礼物经济到免费增值经济

    一、事件速览:两张License改写开源规则

    先把时间线拉直。2026年7月16日深夜,月之暗面发布Kimi K3——2.8万亿参数,全球最大的开源权重模型。7月27日晚,完整权重上传至Hugging Face(仓库moonshotai/Kimi-K3),同步发布的还有一份定制化的”Kimi K3 License”,放弃了此前K2时代接近MIT的宽松许可。

    十几天后的8月12日,阿里兑现开源承诺:Qwen3.8-Max的底座权重以Qwen3.8-2.4T-A95B之名发布,这是通义千问Max级旗舰模型首次开放权重。但Qwen家族延续多年的Apache 2.0不见了,取而代之的是一份专有的Qwen3.8-Max License,同样埋着商业条款。

    据钛媒体8月19日报道,两张License的直接后果是:开源大模型”免费下载+永久免费使用”的旧范式正在接近终结,开源不再等于免费,而是”免费增值(freemium)”。

    ⚡ 关键信息速览

    · Kimi K3:2.8万亿参数,7/27权重开放,权重包约1.56TB

    · Qwen3.8-Max:2.4万亿参数(激活95B),8/12权重开放,BF16版约4.89TB

    · 共同设计:纯内部使用豁免;MaaS业务收入超阈值须另行签协议

    · 阈值差异:K3定在2000万美元/12个月,Qwen抬到5000万美元/12个月

    · 据路透社援引知情人士:部分合作分成比例最高可达30%

    · 对照组:DeepSeek V4、GLM-5.2目前仍是标准MIT许可

    二、逐条拆解:Kimi K3 License的三个关键条款

    Kimi K3的许可证并非标准开源协议,业内也因此更倾向称之为”开放权重”而非严格意义的”开源”。把条款摊开看,核心有三条:

    条款一:MaaS收入门槛

    如果被许可方经营MaaS业务——即把模型推理或微调能力作为服务提供给第三方——且自身及关联方连续12个月总收入超过2000万美元,商业使用前需要与月之暗面另行签署商业协议。许可证本身没有写明固定分成比例,但路透社援引匿名信源称,实际谈判中月之暗面要求的收入分成最高可达30%

    条款二:大规模署名要求

    商业产品月活超过1亿,或月收入超过2000万美元,必须在界面显著位置标注”Kimi K3″字样。这是品牌露出要求,不是付费要求——但意味着你的产品首页要给模型厂商打广告。

    条款三:豁免边界

    仅把模型嵌入具体功能的终端产品,不当然被视为MaaS;纯内部使用、通过官方产品或认证推理伙伴调用,可以豁免。换句话说,条款的重点不是向所有开发者收费,而是保留长尾生态,同时截住最容易绕开官方API的商业渠道——第三方推理平台和模型服务商。

    值得注意的细节是:营收门槛按被许可方及其关联方的合计营收计算,不只看这款产品本身赚多少钱。母公司体量达标,子公司同样会被拉进商业协议的范畴。我们此前在《Kimi K3全栈开源首日》一文中关注的是权重落地与国产算力Day0适配,这次License条款的变化,是同一事件里商业层面的下半场。

    三、逐条拆解:Qwen3.8-Max License的四道门槛

    阿里这张License结构上是”MIT风格+附加条款”,据DataLearner模型卡信息和36氪报道,可以拆成四条:

    第1条:版权声明(NOTICE)

    在所有副本或实质部分保留版权声明和许可声明。标准条款,对所有人适用,零成本。

    第2条:规模署名

    商业产品或服务月活超过1亿,或月收入超过2000万美元,须在用户界面显著位置展示模型名称。

    第3条:商用授权门槛(要花钱的那条)

    如果企业及关联方从事MaaS或AI Work Assistant业务(涵盖AI编程助手、办公软件等,单一用途工具与垂直领域助手除外),且连续12个月合计收入超过5000万美元,商业使用前须另行取得Qwen许可。

    第4条:内部使用豁免

    不对第三方开放的纯内部使用不受上述约束——前提是模型、输出或底层能力不暴露给外部。

    🔍 容易被忽略的细节:同场发布,两种许可

    同一次开源公告里,Qwen3.8-27B(270亿参数稠密模型)走的仍然是宽松的Apache 2.0,官方口径还特别强调它量化后可在消费级显卡上流畅运行、有望成为本地部署主力;而2.4T旗舰用的是定制License。

    阿里实际上做了一次”分层开源”:小模型放生态,大模型留商业口子。

    另一个技术细节值得部署团队注意:开源权重版与API版并不完全等同。官方模型卡说明,API版Qwen3.8-Max额外提供视觉输入、非思考模式、默认1M上下文和官方内置工具;而开源的Qwen3.8-2.4T-A95B是纯文本模型、强制思考模式、原生上下文262,144 tokens。你在云端API测到的能力,下载权重自建服务并不能直接复现。

    四、横向对比:K3、Qwen3.8-Max与MIT阵营

    把三家的许可策略并排看,格局一目了然:

    维度 Kimi K3 Qwen3.8-Max DeepSeek V4 / GLM-5.2
    许可类型 定制K3 License 定制Max License 标准MIT
    MaaS收入门槛 2000万美元/12个月 5000万美元/12个月
    额外触发场景 MaaS(推理/微调服务) MaaS + AI编程/办公助手
    署名要求 月活1亿或月收2000万美元 月活1亿或月收2000万美元
    内部使用豁免
    衍生模型约束 继承原始许可 继承原始许可 宽松

    一个明显的分野:Qwen把”AI Work Assistant”单列为触发条件,瞄准的正是当下商业化最成熟、最赚钱的场景——AI编程助手和办公助手,也是”把模型能力包装成产品卖出去”的最高频形态。用钛媒体的话说:谁最有可能从开源模型上获得规模化收入,条款就瞄准谁。

    五、谁被”点名”:MaaS厂商与AI编程助手的生死线

    这套设计的实际效果是:对95%以上的开发者和中小团队,条款几乎是透明、无感的;但对云厂商、模型聚合平台和头部Agent创业公司这些真正的”大鱼”,免费午餐结束了。

    结合我们此前对《Qwen3.8-Max发布与千问办公实测》和《DeepSeek Harness万物皆插件框架》的追踪,2026年大模型的应用主战场恰恰是编程Agent和办公智能体——而这两张License精准卡在了这条赛道的商业化咽喉上。

    行业背景数据也支撑这一点:8月首周,全球最大模型调用平台OpenRouter上排名前10的模型有6个来自中国,DeepSeek V4 Flash单周处理8.2万亿tokens;a16z合伙人向《经济学人》透露,前来融资的硅谷AI初创公司中使用中国开源模型的比例可能高达80%。当中国开源权重成为全球AI创业的事实底座,模型厂商自然要重新考虑”为他人做嫁衣”的问题。

    六、为什么是现在:涨价潮与三重结构性推动

    开源走向”收费化”不是心血来潮,有三股结构性力量在同时推动。

    第一,成本结构变了

    2万亿参数以上的模型,训练成本动辄数十亿元,推理同样需要庞大算力集群。Kimi K3的权重包1.56TB,官方建议64卡以上的超节点部署;Qwen3.8-Max的BF16开放版约4.89TB、拆成213个safetensors分片。当开源模型的部署门槛高到只有头部玩家才能承担,”为他人做嫁衣”的商业逻辑自然难以为继。AI行业评论员田丰的点评一针见血:

    “开源是权重免费,算力、部署工程、持续迭代与合规责任全部不免费。开源真正改变的是价格锚,不是成本结构。”

    第二,变现路径变了

    摩根士丹利8月9日研报指出,中国大模型的授权模式正从宽松的Apache/MIT(L1级)向更严格的定制商业许可(L2/L3级)迁移;变现从第一方API直销(1P),扩展至与云服务商、模型聚合平台的收入分成(3P)。Kimi K3和Qwen3.8-Max,就是这个判断最先落地的两个注脚。

    第三,定价周期反转了

    8月17日零时,DeepSeek API新价格正式生效:旗舰模型V4-Pro高峰时段输出价格从6元涨至27元/百万tokens,涨幅350%;缓存命中输入价格从0.025元涨至0.3元,涨幅1100%(12倍)。峰时为工作日9:00-12:00、14:00-18:00,闲时价格为高峰的一半——我们在《DeepSeek V4峰谷计价解析》里详细拆过这套机制,当时还是”错峰更便宜”的促销逻辑,如今变成了全面的定价上修。

    DeepSeek不是孤例。据南风窗等媒体报道:Kimi K3开启最高算力档位时API输出价格上调至100元/百万词元(上一代K2.6为22.4元);智谱年内三次上调价格,GLM-5的API平均涨幅达83%;腾讯云混元2.0部分接口涨幅高达463%。大摩统计,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万Token,回升至2026年二季度的21.9元/百万Token,涨幅约80%。竞争主轴正从”拼价格”切换到”拼智能”。

    厂商/模型 调价动作 幅度
    DeepSeek V4-Pro 高峰输出 6→27元/百万tokens +350%
    DeepSeek V4-Pro 缓存命中输入 0.025→0.3元 +1100%
    Kimi K3(最高档) 输出 22.4→100元/百万词元 约3.5倍
    智谱 GLM-5 年内三次上调,API平均涨幅 +83%
    腾讯混元2.0 部分接口涨幅最高 +463%
    行业平均 输出价格 12.2→21.9元/百万Token(2025Q1→2026Q2) +80%

    普通用户不必恐慌:DeepSeek官方明确,网页版和App日常聊天使用仍全程免费,此次调价仅面向API开发者。但对企业级使用者,”开源权重+低价API”的双重红利确实在同步收窄。

    七、佐证与先例:DigitalOcean们已经签字了

    30%的分成比例没有写进任何公开许可文本,但分成协议本身的存在已有实锤:

  • 美国云计算公司DigitalOcean已确认与月之暗面签署商业协议,但拒绝透露具体条款。其CEO帕迪·斯里尼瓦桑把这套模式称为”经过市场检验的开源’免费增值’模式”;
  • 中软国际7月20日的监管申报文件披露了一份”Token收入分成及联合创新合作协议”,约定按比例分成,但比例未公开;
  • 路透社8月10日曾提前报道阿里计划为Qwen下一代开源旗舰引入类似机制,8月12日权重落地时License条款如约出现。
  • 基础模型免费下载,深度合作、优化部署、抢先拿到下一版模型,都是付费项——这套在SaaS行业成熟运转多年的freemium逻辑,正式被移植到了大模型开源生态。大摩的报告还提到杰文斯悖论:更便宜高效的开源模型催生更大的总需求,63%的受访企业同时使用开源和闭源模型,二者并非替代关系;变现路径扩展到与云厂商收入分成后,可寻址收入池反而扩大了。

    八、Meta的镜像:同一周,另一条开源路线

    几乎同一时间,大洋彼岸传出了看似相反的信号。8月10日,扎克伯格发布万字长文《The Future is for Everyone》,宣布Meta重回开源路线:发布300亿参数的MuseGlimmer(Apache 2.0),并承诺未来数周开放更强的Muse Spark 1.2权重,以激烈措辞批评闭源阵营。

    但耐人寻味的是,同一篇宣言里,扎克伯格同步宣布建立新的治理结构,赋予独立董事会批准模型发布安全标准的权力——开源与否、何时开源、开放到哪一版,从此不再是创始人一念之间的事。

    一边是月之暗面和阿里在License里写下收入阈值,一边是Meta为开源设立前置安全审查,形式不同,内核一致:开源正在被重新定义为一种战略工具。开放什么、对谁开放、开放到什么程度,都取决于策略考量。当开源从”信仰”变成”筹码”,参与者们不约而同地开始给”免费”装上计价器。

    九、开发者实操指南:三件事尽早厘清

    对绝大多数团队而言,这套新规则的实际影响远小于舆论的喧嚣——2000万美元的门槛对普通开发者是”遥不可及”的数字。多数情况下可以继续免费使用,但有三件事需要尽早厘清:

    第一,License是版本依赖的,不是一次性的

    以Qwen为例:Qwen3.5、3.6开放(Apache 2.0),3.7闭源,3.8开放但加了条件——每一个版本的”法律属性”都不同。如果产品栈深度绑定某个特定版本,法务部门应该和工程部门一起,维护一张”模型许可证清单”。

    第二,衍生模型继承条款

    基于Kimi K3或Qwen3.8-Max微调出的模型,同样受原始许可证约束。团队需要文档化”哪个产品用了哪个权重”,避免在融资尽调或商业谈判中暴露合规风险。营收口径尤其要小心:门槛按被许可方及关联方合计营收计算,母公司体量达标,子公司同样触发。

    第三,选型天平正在改变

    旗舰档里,Kimi K3与Qwen3.8-Max选择了定制许可;而DeepSeek V4和GLM-5.2(详见我们此前的《GLM-5.3后训练解析》)仍然是标准MIT许可,零收入触发、零署名强制。对成本敏感、对合规确定性要求高的平台型公司,即使旗舰模型能力略逊一筹,MIT许可的确定性本身就有价值。能力与自由度的权衡,需要被写进每一次技术选型的决策表。

    十、结语:从礼物经济到免费增值经济

    “免费午餐”终结了,但开源没有死。它只是从一种近乎公益的”礼物经济”,演进为一种边界清晰的”免费增值经济”——基础能力免费,规模化的商业价值明码标价。

    Kimi K3与Qwen3.8-Max把可持续性问题摆到了开源的台面上,这未必是坏事。免费且无责任的权重,与收费但可持续的研发,本就难以长期共存。当开源模型开始向贡献者回流收入,生态才能真正运转起来:开发者有可用的工具,厂商有持续投入的动力,整个链条上下游都能获得各自的回报。

    对于中国大模型行业,这个夏天的信号已经足够清晰:免费的窗口正在收窄,开源也终于开始面对商业现实。而对开发者的启示同样简单——权重还能下载,代码还能微调,但在你把模型做成生意之前,先读一遍License。


  • DeepSeek Harness开源深度解析:万物皆插件Agent框架,3天10万Star,Claude Code迎来最强开源平替






    DeepSeek Harness开源深度解析:万物皆插件Agent框架,3天10万Star,Claude Code迎来最强开源平替






    🧩
    DeepSeek Harness 来了
    万物皆插件 · MIT 完全开源 · 3 天 10 万 Star · 4300+ 插件生态
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月17日

    DeepSeek Harness开源深度解析:万物皆插件Agent框架,3天10万Star,Claude Code迎来最强开源平替

    8月13日晚,DeepSeek 正式开源 Agent 框架 Harness v0.1 开发者预览版。一句”Everything is a Plugin(万物皆插件)”,3天收割10万GitHub Star、4300个第三方插件——这次DeepSeek瞄准的不是又一个聊天模型,而是Claude Code身下的那把椅子。

    📋 本文目录

    一、事件速览:一个框架,72小时点燃开源圈

    二、什么是Harness:Model + Harness = Agent

    三、架构拆解:Cordis微内核与”一切皆插件”

    四、四种运行模式:从极简到创造

    五、三家对比:Harness vs Claude Code vs Codex

    六、生态爆发:4300个插件都在干什么

    七、上手指南:10分钟装好你的第一个DSH

    八、冷静提示:v0.1的坑与正确姿势

    九、结语:从”卖API”到”卖车架”

    一、事件速览:一个框架,72小时点燃开源圈

    先看时间线。据IT之家、36氪等多家媒体报道,npm 包 @deepseek-ai/dsh 早在8月10日就已悄然首发,此后四天内连发七个版本;8月11日”DeepSeek Harness 团队”微信公众号完成注册;直到8月13日晚,v0.1 开发者预览版正式面向全球开发者开放,GitHub 仓库 deepseek-ai/deepseek-harness 同日公开,采用 MIT 协议完全开源——无商业使用限制、无版权捆绑、无闭源模块。

    热度数据可以用”离谱”形容:

  • 发布当晚,GitHub Star 不到 2 小时破万,12 小时突破 5 万;
  • 上线 72 小时(3 天),Star 突破 10 万,截至8月17日官方仓库已达 11 万+
  • 36氪发布当晚实测,dsh-plugin 标签下的社区插件仓库已有 288 个
  • 据人人都是产品经理统计,发布 3 天第三方插件突破 4300 个,增速峰值达每小时 99 个;
  • 社区目录 Oh-My-DSH 已收录精选插件 1117 个、监测生态仓库 1521 个,累计 Star 超 30 万。
  • ⚡ 关键信息速览

    · 发布时间:2026年8月13日晚(npm 包 8/10 首发)

    · 版本:v0.1 开发者预览版,MIT 协议完全开源

    · 仓库:github.com/deepseek-ai/deepseek-harness(11万+ Star)

    · CLI 工具:dsh,支持四种运行模式

    · 代码规模:230+ workspace 成员,默认内置 100+ 可单独开关的插件

    · 模型支持:40+ 供应商,模型无关设计

    多家科技媒体将这次发布解读为对 Anthropic Claude Code 与 OpenAI Codex 的正面回应。而 DeepSeek 官方此前在招聘信息中就给出过那个著名公式:Model + Harness = Agent。这次,他们把等式右边那个”Harness”直接开源了。

    二、什么是Harness:Model + Harness = Agent

    很多读者的第一反应是:Harness 是什么?字面意思是”马具/缰绳”。在 AI 工程语境里,它指的是把大模型”接”进真实世界的那一层——读写文件、调用工具、执行命令、控制权限、决定重试还是中止,都是它的活。你可以把它理解成 AI 的”操作系统外壳”。

    “Model 负责想,Harness 负责做。模型是发动机,Harness 是车架子——过去厂商卖你一辆焊死的成品车,座椅方向盘全动不了;DeepSeek 这次卖的是乐高底盘。” —— 综合自阿里云开发者社区、CSDN 技术解读

    为什么这一层突然重要了?因为过去两年,市面上冒出了几十个 Agent 框架——LangChain、AutoGen、CrewAI、MetaGPT……每个都号称”通用”,但真正用起来会发现:要么绑死了某个模型 API,要么把工具调用、记忆管理、沙箱执行硬编码进核心逻辑。你想换个模型?改源码。想换种存储方式?改源码。想把单 Agent 改成多 Agent 协作?还是改源码。

    据aitop100等社区评论,这根本不是”框架”,这是”半成品”。而 Claude Code 和 Codex 走的是另一条极端路线:能力封装得极好、开箱即用,但模型怎么被驱动、工具怎么被调度,对用户完全是个黑盒,而且只能用官方绑定的模型。DeepSeek Harness 给出的答案是第三条路:把”配置”本身当作一等公民,所有能力可插拔。

    三、架构拆解:Cordis微内核与”一切皆插件”

    “一切皆插件”这句话的真意,是框架里没有特权组件。这不是营销口号,而是架构事实。

    DeepSeek Harness 底层用的是 Cordis 插件元框架——一个只负责插件加载、卸载和依赖管理的微内核,来自国内老牌 QQ 机器人框架 Koishi 生态(作者 Shigma),已经在生产环境稳定跑了四年。Cordis 本身不承载任何业务功能,就像乐高的底座板——只提供插口,不规定你必须拼出什么。

    在 DeepSeek Harness 里,这些全部都是插件,谁都不比谁高贵,谁都可以被换掉:

    能力维度 传统框架 DeepSeek Harness
    模型接入 绑定官方 API 模型插件,40+ 供应商随便换
    工具调用 硬编码核心逻辑 工具插件,独立增删
    会话存储 固定方案 存储插件,按需替换
    沙箱环境 不可定制 沙箱插件,可换实现
    Agent 循环 改源码才能动 循环本身也是插件
    UI 界面 官方焊死 UI 插件,甚至能换皮肤

    两个值得展开的技术细节:

  • 可逆副作用(Reversible Effects):每个插件注册时产生的所有副作用都会被追踪,卸载时自动回收,不留垃圾、不漏内存。翻译成使用体验就是热插拔——装插件、卸插件、换整套 UI,都不用重启,系统跑着跑着就把自己的一部分换掉了。
  • 连 DeepSeek 自家模型都没有特权:它也只是又一个插件。你想换成 Kimi、GLM、Qwen 或任何 OpenAI 兼容端点,跟换个主题皮肤是同一个操作。对比 Claude Code——用哪个模型、有什么能力,全是 Anthropic 定的,用户碰都碰不到。
  • 这种设计在软件工程里有个经典名字:微内核架构(Microkernel Architecture)。Eclipse IDE、VS Code、Android 系统都是这个路子。DeepSeek 把它搬到了 Agent 领域,数字也相当直观:官方默认部署里有一百多个可单独开关的插件,仓库包含 230+ 个 workspace 成员(core、llm、shell、terminal、fs、lsp、web、skill、subagent、workflow 等)。

    四、四种运行模式:从极简到创造

    DeepSeek Harness 提供 dsh 命令行工具,核心命令 dsh –profile 针对不同场景加载不同插件集合,共四种模式:

    模式 能力组合 适合场景
    标准模式 完整编程 Agent:编辑文件、执行 shell、搜索网页 日常开发主力
    PTC 模式 标准能力 + 程序化工具调用(模型生成 TypeScript 代码组合多轮调用) 复杂任务编排
    极简模式 仅保留 Bash + 字符串替换编辑器两个工具 最小环境基准测试
    创造模式 运行期动态挂载/移除插件,可在内存中试验 Cordis 插件 魔改与插件开发

    其中 PTC(Programmatic Tool Calling)模式值得一提:传统工具调用是模型一次调一个工具、等结果、再调下一个;PTC 让模型直接生成一段 TypeScript 代码,把多轮工具调用”编排”成一个程序一次跑完——这对批量文件操作、多步骤验证类任务的效率提升是数量级的。

    另外两个在闭源产品里看不到的能力:对话状态完整保存、可重播,也能从任意步骤分岔。Agent 的能力配置完全透明——对团队来说,这意味着 Agent 的行为可以被审计、被复现,而不只是一个黑盒。

    五、三家对比:Harness vs Claude Code vs Codex

    DeepSeek Harness(v0.1,2026年8月13日发布)是继 Codex 和 Claude Code 之后,第三款由大模型原厂推出的 AI 编程 Agent Harness。三款工具共同指向同一件事——”Model + Harness = Agent”,但底层设计哲学截然不同:

    维度 DeepSeek Harness Claude Code OpenAI Codex
    开源属性 MIT 完全开源 商业闭源 CLI 核心闭源
    模型绑定 无关,40+ 供应商 强绑定 Claude 系列 强绑定 GPT 系列
    核心架构 Cordis 微内核 + 一切皆插件 闭环开箱即用 IDE 插件 + 云端集成
    扩展能力 极高,UI/调度/工具全可换 较低,仅 Tools/Hooks 中等,依赖 VS Code 机制
    状态追溯 原生日志可回放/分岔 内部压缩策略 IDE 会话面板
    私有部署 支持,完全本地化 不支持 不支持
    沙箱安全 沙箱本身可换插件 权限二次确认 内核级 Seatbelt 沙箱

    三家的路线差异一句话说清:

  • Claude Code 走”产品极致化”路线:针对 Claude 模型深度调优终端交互、Diff 预览、权限确认与上下文压缩,目标是做”最强 CLI 工具”,26 个生命周期钩子满足企业级治理;
  • Codex 走”安全边界”路线:内核级 Seatbelt 沙箱、最多 6 条并行线程,2026年7月已并入 ChatGPT 桌面端,适合对安全边界要求最高的场景;
  • DeepSeek Harness 走”基础设施开源化”路线:它不只是一个产品,更是一个开发框架——企业可以在 dsh 之上构建适合自己业务规则的 Code Agent,不需要从零造轮子,也不被任何一家模型厂商绑死。
  • 成本账也很关键。据社区实测口径,配 V4-Flash 模型跑单任务成本约 0.2 元,而 Claude Code 订阅起步 20 美元/月。顺带一提,DeepSeek V4 系列 API 已于8月17日起启用峰谷计价,我们此前在《DeepSeek V4正式商用上线:峰谷计费如何帮开发者砍掉一半API账单》中有详细测算,配合 Harness 使用可以把 Agent 成本再压一档。

    六、生态爆发:4300个插件都在干什么

    如果说 Star 数反映的是关注度,那插件数反映的是真金白银的开发者投入。发布 3 天 4300 个第三方插件、增速峰值每小时 99 个——我们综合社区目录与多篇评测,把生态大致分成五类:

    1. UI 增强类(最刚需)

    默认的 dsh web 就是一个纯聊天框——没有文件树、没有终端、没有 Git 面板、没有任务看板,”毛坯房”本房。所以 dsh-web-ui 几乎成了装机必备:任务看板、Git 图表、右侧面板、远程移动端 UI、实时 Token 统计、甚至桌面宠物一应俱全。还有 Claude Code 风格的全屏 TUI(dsh-tianshu-tui),带像素鲸鱼顶栏和上下文进度条。

    2. 视觉能力类(最巧妙)

    纯文本模型看不了图?社区用插件解决了:dsh-vision-toolkit 给纯文本模型加一双”眼睛”,支持带意图的图片问答、长截图 OCR、UI 还原、GUI 自动化;ModLens 则把截图、文档、UI 图处理成结构化 JSON 证据(OCR 文本、布局、语义),桥接纯文本 LLM 的视觉鸿沟。

    3. 多 Agent 协作类(最前沿)

    dsh-agent-teams 实现多 Agent 协作,dsh-plan-execute 用双模型架构分离规划与执行,dsh-context-doctor 做上下文审计。DeepSeek 官方也预告了记忆压缩、自适应上下文等方向——这些正是 Agent 长程任务的命门。

    4. 搜索与内容发现类

    覆盖中英文/学术/代码/购物/金融的多语言搜索插件,以及支持 B站、小红书、抖音、YouTube、X、知乎、Reddit、微博等平台的跨平台 AI 内容发现 Agent。

    5. 生态基础设施类

    Awesome DSH Plugins 目录(中英双语、每日兼容性追踪)、Claude Managed Agents API 的开源实现、本地优先的桌面 Agent 应用等。有开发者直言:”一千多个插件,总有一款适合你”——这背后是”一切皆插件”架构给出的确定性:任何能力缺口,都可以用插件补上,而不需要等官方。

    💡 一个观察

    插件生态的爆发速度本身就是架构的试金石。Claude Code 的 Skills 体系是官方审批制的”精品店”,DSH 的插件是自由市场的”菜市场”——前者质量可控、上限受限,后者泥沙俱下、长尾无限。4300 个插件里必然有大量蹭标签的低质量仓库(人人都是产品经理的扒取统计也证实了这一点),但自由市场的网络效应一旦形成,护城河比任何官方规划都深。这正是 VS Code 战胜 Atom 的剧本。

    七、上手指南:10分钟装好你的第一个DSH

    第一步:安装

    npm install -g @deepseek-ai/dsh
    # 或免安装直接体验
    npx @deepseek-ai/dsh

    第二步:选择运行模式

    dsh –profile standard # 标准模式:完整编程Agent
    dsh –profile ptc # PTC模式:程序化工具调用
    dsh –profile minimal # 极简模式:仅bash+编辑器
    dsh –profile creative # 创造模式:运行时魔改插件

    第三步:装插件(从”毛坯”到”精装”)

    dsh plugin –profile web add @linxin666/dsh-web-ui-all
    # GitHub 搜索 dsh-plugin 话题发现更多插件
    # 社区目录:awesome-deepseek-harness / Oh-My-DSH

    第四步:换模型(想用什么换什么)

    在配置中替换模型插件即可切换到 Anthropic、OpenAI、Kimi、GLM、Qwen 或任意 OpenAI 兼容端点——DeepSeek 官方明确支持 40+ 模型供应商。官方推荐搭配自然是 V4 系列:V4-Flash 求性价比,V4-Pro 求能力上限,8月17日起还有峰谷计价加成。

    新手路线建议:

    先装 dsh-web-ui 和文件管理类基础插件把”毛坯房”变成”能住”;再根据使用习惯选一个交互方式(TUI 或桌面 App);遇到具体需求(看图、多 Agent 协作)时再去 GitHub 搜 dsh-plugin 话题按需加装。不要一上来就装几十个插件——插件之间可能存在架构冲突。

    八、冷静提示:v0.1的坑与正确姿势

    官方自己把话说得很清楚:v0.1 是开发者预览版。综合 CSDN 评测与社区反馈,上手前这几条务必记住:

  • 有 breaking changes:插件 API 和配置文件格式都没稳定,现在写的插件下个版本可能就废了。想围绕它做生态投入,得先算清楚这笔账。
  • 供应链风险:官方用 npx 执行远程代码、支持从 Git 安装第三方插件。预览阶段插件生态尚未建立信任体系,装第三方插件前建议自己 pin 版本、审查权限。
  • 别拿公司主仓库试:v0.1 的稳定性没有保证,建议先在容器或沙箱环境里跑通流程,再考虑接真实项目。
  • 别指望它现在就替代 Claude Code:真实改代码场景要用的权限模型、diff 审查、IDE 集成还不是 v0.1 的重点,打磨程度与 Claude Code、Codex 仍有明显差距。官方定位就是”底层框架 + 开发者预览”。
  • 一句话总结:尝鲜可以,别急着上生产。它现在的正确打开方式是——用它搭你自己的 Agent 工作流、写你自己的插件、攒你自己的私有工具链,等 API 稳定后再考虑规模化。

    九、结语:从”卖API”到”卖车架”

    “模型是发动机,Harness 是车架。过去 DeepSeek 卖发动机(API),Claude Code 卖整车;现在 DeepSeek 把车架开源了,还附赠一个 4300 个零件的改装市场。真正的野心不是做一个 Claude Code 的平替,而是让所有人都能在开源车架上拼出自己那辆车。”

    从年初 V3 时代”最便宜的推理”,到 V4 时代”峰谷计价的成本管理”,再到如今 Harness 开源”Agent 基础设施”——DeepSeek 的每一步都在把”能力”变成”公共品”。据 Hugging Face 最新报告,中国开源模型下载量已占全球 41%,首次超过美国;而 DeepSeek Harness 3 天 10 万 Star、4300 个插件的爆发,说明这种”公共品化”不只是权重层面,已经蔓延到了 Agent 工程层。

    对开发者而言,接下来值得盯三个时间点:插件 API 趋稳的正式版发布、社区目录的兼容性追踪数据、以及各大模型厂商是否会跟进开放自己的 Harness。Agent 框架的”安卓时刻”,可能比很多人预想的来得更早。


  • 智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主






    智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主






    GLM-5.3 来了
    基座不动,纯后训练 · Terminal-Bench 暴涨 6 倍 · 两周内开源
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月15日

    智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主

    8月14日中午,智谱甩出新一代旗舰 GLM-5.3。没换基座、没改架构、没堆参数——一句”Scaling post-training is all we did”定调,多项公开基准上成为当前排名最高的开源模型。

    📋 本文目录

    一、发布速览:一句话定调的”史诗级 Plus”

    二、跑分拆解:六项基准数据全景对比

    三、技术解读:什么是”后训练 Scaling”

    四、安全彩蛋:269 个项目揪出 2436 个漏洞

    五、大背景:国产三巨头一个月连环迭代

    六、生态落地:荣耀 YOYO Claw 火速接入

    七、普通开发者怎么选怎么用

    八、结语:开源模型的天,真的变了

    一、发布速览:一句话定调的”史诗级 Plus”

    2026年8月14日中午,智谱正式发布新一代旗舰模型 GLM-5.3,总参数规模 7430 亿(743B,MoE 架构)。据证券时报报道,这次升级最”反直觉”的地方在于:GLM-5.3 与 GLM-5.2 共用同一个基座模型,参数量、架构完全未变,所有能力提升全部来自后训练阶段的规模化(post-training Scaling)。

    “Scaling post-training is all we did.” —— 我们做的,只有后训练规模化。

    智谱创始人唐杰此前在社交媒体上为这次升级定调为“史诗级 Plus”。据智谱官方披露,GLM-5.3 在内部自建体感评测中编程能力较 GLM-5.2 提升 50%,模型即日起上线 ZCode、AutoClaw 等平台,API 随后上线,完整模型权重将在两周内以宽松许可证开源(发布前先完成安全评估与模型加固)。

    ⚡ 关键信息速览

    · 发布时间:2026年8月14日中午

    · 基座:743B MoE,与 GLM-5.2 完全相同

    · 提升来源:纯后训练(长程任务环境规模数十倍扩张 + 环境类型更丰富 + 训练时长延长)

    · 编程能力:内部体感评测较 GLM-5.2 提升 50%

    · 开源计划:两周内开放权重,宽松许可证

    · 发布节奏:GLM-5(2/12)→ GLM-5.1(4/7)→ GLM-5.2(6/16)→ GLM-5.3(8/14),约两个月一更

    二、跑分拆解:六项基准数据全景对比

    光说”提升50%”没有体感,直接上数据。综合智谱官方发布、证券时报、CSDN 技术解读等多方信息,GLM-5.3 的基准成绩单如下:

    基准测试 GLM-5.2 GLM-5.3 Claude Fable 5 GPT-5.6 Sol
    Terminal-Bench 3.0 4.6 28.3 ↑6倍 33.7 34.6
    DeepSWE v1.1 46.2 66.9 69.7 72.7
    AutomationBench v1.0.6 26.2 48.2(第一) 46.2 45.8
    CyberGym(安全) 77.2 84.5(第一) 83.8 83.6
    ExploitBench(安全) 24.4 54.4 78.0 76.5
    GDPval-AA v2 1508 1769 1743 1730

    三个最值得注意的细节:

  • Terminal-Bench 3.0 从 4.6 跃升到 28.3——这是公认最难的终端任务基准,4.6 基本等于”不会做”,28.3 已经挤进第一梯队,与闭源旗舰的差距肉眼可见地缩小。
  • AutomationBench 和 CyberGym 两项直接反超 Claude Fable 5 和 GPT-5.6 Sol,这是开源模型少有的”局部登顶”。
  • 在 Z.ai Code Bench 高难度档上,GLM-5.3 以 31.4% 的通过率(消耗约 5 万 token)超越 Claude Opus 4.8 的 29.5%(消耗约 12 万 token)——用不到一半的 token 干了更多的事,对按量计费的开发者来说是实打实的成本优势。
  • 三、技术解读:什么是”后训练 Scaling”

    据证券时报的通俗解释:后训练 Scaling 指的是在模型预训练完成后,通过优化训练方法、提升数据质量和强化学习策略,让模型在特定任务上表现更优。可以理解为“课本没变,但换了更好的训练方法,因此提升了学生成绩”

    具体到 GLM-5.3,智谱做了三件事:把长程任务环境(long-horizon RL 环境)规模扩张数十倍;让环境类型更丰富;显著延长后训练时间。据头条技术博主”谦”的分析,这套打法的本质是:当预训练的架构红利见顶后,竞争主战场转移到了后训练阶段的工程能力——谁的任务环境构造得更好、奖励信号设计得更准,谁的模型就更聪明。

    💡 深层信号

    “同一基座、纯后训练带来 6 倍的 Terminal-Bench 跳升”说明智谱的后训练(尤其长程 RL 环境构造)已是核心壁垒;但它同时意味着架构红利已尽,后续升级必须靠更重的训练投入,边际成本会越来越高。这也是为什么各家都在卷”工程化后训练”而不是一味堆参数。

    四、安全彩蛋:269 个项目揪出 2436 个漏洞

    这次 GLM-5.3 最出圈的其实不是编程,而是网络安全能力。据多家媒体报道:

  • CyberGym 基准以 84.5% 排名第一,超过 Mythos 5 的 83.8%,拿下”最强开源安全模型”称号。
  • 白盒代码审查与漏洞发现能力持平 Mythos 5,实际在 269 个项目中发现了 2436 个漏洞
  • 据 ToxicDiary 等媒体报道,它还在知名 AI 编程工具 Cursor 里顺手揪出了一个严重漏洞——模型不只是会写代码,还能反过来审代码、找坑。
  • 一个耐人寻味的呼应是:就在上个月,开源社区 Hugging Face 曾通过部署智谱 GLM-5.2,还原 AI 智能体入侵攻击过程,帮助控制了事态。安全能力从”副产品”变成”主打牌”,GLM 系列算是给国产模型蹚出了一条差异化路线——对企业安全团队来说,以前请安全专家按小时计费,现在一个开源模型就能先扫一遍代码。

    五、大背景:国产三巨头一个月连环迭代

    GLM-5.3 不是孤立事件。过去一个月,国产头部大模型厂商完成了教科书级别的”接力发布”:

    时间 厂商/模型 关键点
    7月17日 月之暗面 Kimi K3 2.8 万亿参数,全球首个迈入 3 万亿级别的开源模型
    8月13日 DeepSeek V4 Pro 正式版 1.6 万亿总参数、激活 490 亿;输出 6 元/百万 token,仅为 Claude Fable 5 的 1/60
    8月12-14日 阿里 Qwen3.8 系列 Max 级 2.4T-A95B 权重首次开放;27B 版本消费级显卡可跑,Apache 2.0 协议
    8月14日 智谱 GLM-5.3 同基座纯后训练,多项基准开源第一,两周内开源

    据央广网报道,全球多模型聚合平台发布的 2026 年 7 月 AI 大模型调用量排行榜中,中国企业包揽前 5 名;在全球最大的 AI 开源社区上,中国开源模型累计下载量居全球首位。另有 OpenRouter 统计显示,中国大模型调用量已连续 15 周超过美国。

    更值得关注的是”开源”本身成了全球趋势:Meta 在今年 5 月还宣称旗舰模型不适合开源,8 月 10 日就发布了开源模型 Muse Glimmer;OpenAI 也在 2025 年推出过开放权重模型 GPT-oss。上海交通大学田丰指出,对后入场的企业来说,开源是成本最低、最直接拿到市场分发权限的办法——但要注意“开源 ≠ 免费”,开源大模型指的是”开放权重”,与传统开源”公开源代码、任何人可复现构建”只有部分重叠。

    六、生态落地:荣耀 YOYO Claw 火速接入

    模型发布不到 24 小时,8 月 15 日凌晨,荣耀全场景软件主理人席迎军在微博宣布:YOYO Claw 正式接入 GLM-5.3,”虾虾大脑”全新升级。YOYO Claw 是荣耀今年 4 月发布的跨端智能体,支持在荣耀 PC、荣耀 Pad 上运行,还能连接第三方设备。

    对普通用户来说,这意味着 GLM-5.3 的编程与智能体能力将直接进入手机和 PC 的系统级体验。据 CSDN 报道,GLM Coding Plan 也已全量上线 GLM-5.3,订阅用户无需等待权重开源就能第一时间用上。智谱官方口径是”即日起上线 ZCode、AutoClaw 等平台,API 随后上线”。

    🔗 一个细节

    智谱确认权重将在发布两周后开放,此前先完成安全评估与模型加固。结合 GLM-5.2 当年 MIT 协议开源的先例,GLM-5.3 大概率也会给一个相当宽松的许可证——对想私有化部署的企业来说,值得把这个时间点记在日历上。

    七、普通开发者怎么选怎么用

    1. 重度编程场景:现在就能用

    GLM Coding Plan 订阅用户已可直接切换 GLM-5.3;用 Claude Code、Codex、Cursor 等 Agent 工具的开发者,可以通过智谱的兼容端点接入。Terminal-Bench 28.3 的成绩意味着它在真实终端任务(编译、部署、调试流水线)上已经不是摆设。

    2. 安全审计场景:给代码库做”免费体检”

    269 个项目发现 2436 个漏洞的实战数据说明,用它做白盒代码审查、漏洞初筛是靠谱的。企业安全团队可以把 GLM-5.3 作为人工审计前的第一道过滤,大幅压缩审计成本。

    3. 成本敏感场景:横向比价再下单

    本周选项太多:要极致性价比选 DeepSeek V4 Pro(输出 6 元/百万 token);要消费级显卡本地部署选 Qwen3.8-27B(Apache 2.0);要开源旗舰权重等两周后的 GLM-5.3 和已开放的 Qwen3.8-2.4T。纯文本对话和成本敏感场景,DeepSeek V4-Flash 依然是兜底选择。

    4. 等 GLM-5.3 开源权重再自建

    743B MoE 架构对推理资源要求不低,中小企业建议关注各家 Day0 适配动态——参考 Kimi K3 开源首日昇腾 Atlas A3、阿里云 M890 同步跑通的先例,GLM-5.3 权重开放时大概率也会有国产算力平台的官方适配方案。

    八、结语:开源模型的天,真的变了

    “从’追赶’到’同台竞技’,只用了不到一年。GLM-5.3 最狠的地方不是跑分,而是证明了一件事:当别人还在堆参数的时候,智谱把’同一套参数’炼出了新境界。基座不动、纯靠后训练把 Terminal-Bench 拉高 6 倍——这不是挤牙膏,是跳级。开源模型与闭源旗舰之间的那堵墙,正在被一周一个的国产发布拆掉。”

    据证券时报观察,国产大模型的竞争焦点,正在从单项能力比拼走向高价值场景的全面争夺。Coding Agent、安全审计、企业服务等方向,正在成为大模型从”技术叙事”走向”商业叙事”的关键入口。GLM-5.3 能不能把开源第一的宝座坐稳?两周后权重开放、各路独立复测出炉,答案自然会浮出水面。


  • Kimi K3 全栈开源首日:2.8 万亿权重落地 Hugging Face,昇腾 Atlas A3 / 阿里云 M890 同台 Day0 跑通






    Kimi K3 全栈开源首日:2.8 万亿权重落地 Hugging Face,昇腾 Atlas A3 / 阿里云 M890 同台 Day0 跑通






    🚀
    Kimi K3 全栈开源首日
    2.8 万亿权重 + 三项 Infra 同步落地
    昇腾 Atlas A3 · 阿里云 M890 同台 Day0 跑通
    AI
    AI工具导航
    @xcoolevdb · 2026年7月28日

    7 月 27 日深夜,月之暗面把 Kimi K3 的模型权重、技术报告,连同 MoonEP / FlashKDA / AgentEnv 三项核心训练 Infra 一起推上 Hugging Face——这是全球首个迈入 3 万亿参数级别的开放权重模型。Hugging Face CEO 亲口确认:30 分钟点赞 4000+,创平台成立以来最快发布增长纪录。7 月 28 日上午,华为昇腾 Atlas A3、阿里云真武 M890、趋境科技 SGLang 同步完成 Day0 适配——国内首个跑通近 3 万亿参数模型的超节点当天上线。WebDev Arena 1679 Elo 登顶、K3 自己写编译器、自己设计 45nm 芯片原型,白宫指控、商务部回应、25 家美国公司联名反对封杀、月之暗面 500 亿美元目标估值——一文看懂这条把”前沿智能”门槛再次打下来的全栈开源之路。

    📑 本文目录

    · 一、为什么说”全栈开源”是这一枪

    · 二、首日数据:Hugging Face 30 分钟 4000 赞

    · 三、国产算力 Day0 适配:昇腾 / 阿里云 / 趋境科技

    · 四、跑分:1679 Elo 登顶 WebDev Arena,全球第四

    · 五、自主工程能力:模型自己写编译器、自己设计芯片

    · 六、监管风暴:白宫指控、商务部回应、25 家公司联名

    · 七、商业化跃迁:500 亿美元估值、最快半年港股上市

    · 八、一张表:K3 vs Qwen3.8 vs DeepSeek V4 vs Fable 5

    · 九、对 AI 工具选型的 4 条落地启示

    一、为什么说”全栈开源”是这一枪

    过去一周,开源社区有过太多”承诺开源但仓库还是 404″的戏码。7 月 16 日 K3 以托管服务首发后,Hugging Face 仓库连续十天挂着 404,几家海外技术媒体干脆做了一面倒计时墙。7 月 27 日深夜,承诺落地——月之暗面把 K3 的完整权重、技术报告、连同三项核心 Infra 技术一并推上了 Hugging Face、GitHub 和 ModelScope。

    理解这次发布的真正重量,要先看它”全栈”到什么程度:

    📦 7/27 深夜同步放出的”四件套”

    · 模型权重:2.8 万亿参数 MoE 原生多模态模型,采用修改版 MIT 许可证

    · 技术报告:47 页,覆盖训练方法、架构创新、评测与 Infra

    · MoonEP:超大规模细粒度 MoE 通信库,负载不均场景保持极致效率

    · FlashKDA:KDA 注意力算子高性能实现,H20 预填充速度比基线提升 1.72~2.22 倍

    · AgentEnv:与 KVCache.ai 合作的智能体沙箱,支持环境快照、恢复与 Fork

    “别人开源,是把菜谱给你;月之暗面,是把后厨连人带制度打包送你。”这是社区里流传最广的一句话。三项 Infra 技术的同步开源意味着:任何想复现 K3 训练的研究者,都能直接拿到 KDA 算子实现、MoE 通信库和 Agent 训练沙箱——这三样恰恰是大规模 MoE 训练最难的工程门槛。

    2.8 万亿参数的硬指标

    • 总参数 / 激活参数:2.88 万亿 / 1040 亿
    • MoE 架构:896 个路由专家,每个 token 激活其中 16 个 + 2 个共享专家(56 倍稀疏比例)
    • 上下文窗口:原生 100 万 token
    • 多模态:从预训练第一天起视觉与文本就交织,视觉编码器 MoonViT-V2 从零训练(不依赖 SigLIP)
    • 注意力机制:Kimi Delta Attention(KDA,混合线性注意力,93 层中覆盖 69 层)+ Attention Residuals + 24 层门控隐注意力
    • MoE 优化:Stable LatentMoE 框架
    • 训练效率:相比 K2 提升 2.5 倍,MoonClip 二阶优化器把训练数据量从 40T 砍到 20T

    二、首日数据:Hugging Face 30 分钟 4000 赞

    权重上传后,社区热度几乎是即时引爆:

    4000+
    30 分钟 Hugging Face 点赞

    #1
    Hugging Face 趋势榜登顶

    3700
    上线前等待下载的开发者

    1
    平台成立最快发布增长纪录

    Hugging Face CEO Clément Delangue 亲自发文:K3 上线 30 分钟点赞超 4000,登顶趋势榜榜首,创下了平台成立以来最快的发布增长纪录。这个数字的意义是:它不是营销话术,而是全球开发者社区用脚投票——他们等这一天,已经等了至少十天。

    “现在,每个人都可以下载并部署 Kimi K3 模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。”
    ——月之暗面官方声明

    三、国产算力 Day0 适配:昇腾 / 阿里云 / 趋境科技

    权重放出的 12 小时内,国产算力链给出了教科书级别的”Day0″响应——不是”我们尽快评估”,而是当天就跑通、当天就上线:

    🏛️ 华为昇腾 CANN:昇腾 950 全系列 + Atlas A3

    · 7/27 深夜宣布:昇腾 950 全系列、Atlas A3 产品支持 K3 部署

    · K3 896 专家的大 EP 部署场景,充分发挥昇腾超节点架构优势

    · AIV 直接下发 UB Memory 通信任务,抬升 MoE 推理吞吐上限

    ☁️ 阿里云:灵骏真武 M890 超节点(国内首个跑通近 3 万亿)

    · 7/28 上午宣布:真武 M890 超节点实例已 Day0 适配 K3

    · 国内首个跑通近 3 万亿参数模型的超节点

    · 千问 AI 平台、阿里云百炼后续将上线 K3 模型 API

    · 真武 M890 硬件:144GB 显存、800GB/s 片间互联、原生支持 FP32 到 FP4 全精度

    🔧 趋境科技:SGLang 推理引擎 Day0 适配

    · 基于开源推理引擎 SGLang,完成 K3 在昇腾 Atlas A3 上的 Day0 推理适配

    · SGLang 是当前大模型推理主流开源框架之一

    海外同样响应迅速:Nebius、Baseten、Fireworks 等主流 AI 基础设施厂商均宣布首日完成适配。Nebius 给出了迄今对 K3 最高的评价:“首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步”

    🚨 一个关键观察

    国产算力链这次不是”补位”——是真在领跑。阿里云真武 M890 是国内首个跑通近 3 万亿参数模型的超节点,比海外几个主流厂商在 K3 上的适配并不慢。配合昇腾 Atlas A3 与趋境 SGLang,”国产超大 MoE 推理”这条线,从”实验室 Demo”进入了”生产可用”。

    四、跑分:1679 Elo 登顶 WebDev Arena,全球第四

    开源阵营第一次不是在”够用”上做文章,而是”我就是最强”。K3 在 WebDev Arena 上以 1679 Elo 登顶,成为首个全面超越 GPT / Claude 等闭源旗舰的开源模型

    93.5%
    GPQA 研究生级科学问答

    77.8%
    ProgramBench 编程第一

    1679
    WebDev Arena Elo 登顶

    57.1
    AA Intelligence Index 全球第四

    • GPQA:93.5%,高于 Claude Fable 5 的 92.6%,仅微低于 GPT-5.6 Sol 的 94.1%
    • ProgramBench:77.8% 第一
    • FrontierSWE:81.2 分(仅次于 Fable 5 的 86.6,高于 GPT-5.6 Sol 的 71.3)
    • Artificial Analysis Intelligence Index v4.1:57.1 分,全球第四

    连对手都坐不住。马斯克在评测报道下留言”Impressive”,xAI 随后宣布启动 2 万亿参数 Grok 4.6 训练,明确以超越 K3 为目标。OpenAI 战略负责人则公开表示,K3 的性能”无法依靠简单的蒸馏或类似手段实现“——这句话从对手嘴里说出来,反而是对 K3 自研路线最强的背书。

    五、自主工程能力:模型自己写编译器、自己设计芯片

    真正让技术圈兴奋的,不是 K3 在公开榜单上的分数,而是技术报告里披露的自主工程能力——K3 不仅能”用工具”,它能”造工具”:

    5.1 GPU 内核优化(24 小时,K3 自主完成)

    K3 在 24 小时内自主完成了 AttnRes、DeepSeek Sparse Attention、KDA、MLA 四种代表性 GPU 内核的优化——这种任务通常需要资深的 CUDA 工程师团队花几周时间。关键结果:

    • AttnRes 延迟:283.6ms → 114.4ms(2.5 倍加速
    • DSA 运行时间减少 55.1%
    • KDA 运行时间减少 73.6%
    • MLA 接近峰值 TFLOPS
    • 综合表现:与 Claude Fable 5 持平,显著优于 Opus 4.8 / GPT-5.6 Sol / GPT-5.5

    更值得注意的是:测试环境同时覆盖 NVIDIA H200 与来自其他供应商的 GPGPU,意味着 K3 的部署能力已不局限于英伟达生态——这与华为昇腾 / 阿里云真武的 Day0 适配形成了完美的”模型 + 算力”双线协同。

    5.2 MiniTriton:从 Python 到 PTX 全链路自研的 GPU 编译器

    K3 自主开发了名为 MiniTriton 的紧凑型 GPU 编译器,从 Python 前端到 PTX 代码生成全链路由模型完成。在 NVIDIA L20 上,MiniTriton 的性能超越 PyTorch eager、torch.compile 和标准 Triton 实现。换句话说,K3 不仅能写 CUDA,它能写”写 CUDA 的工具”。

    5.3 48 小时自主芯片设计

    作为早期概念验证,K3 在 48 小时自主运行中,基于开源 EDA 工具和 Nangate 45nm 工艺库,完成了一款推理芯片原型的设计、优化与验证。这款芯片:

    • 面积仅 4 mm²
    • 集成 146 万个标准单元
    • 0.277 MB SRAM
    • 带融合去量化的 INT4 MAC 阵列

    这是一款”由模型设计、为模型服务”的芯片,标志着 AI 已具备从算法到硬件的全栈自主工程能力。

    “过去的 AI 还不能算真智能——但我们正迈入经验时代,势不可挡。”
    ——图灵奖得主 Richard Sutton,WAIC 2026 主论坛

    六、监管风暴:白宫指控、商务部回应、25 家公司联名

    K3 开源这件事,从第一天起就不只是技术议题。开源后 24 小时内,三股力量同时下场:

    6.1 美方指控与制裁威胁

    • 白宫科技政策办公室主任公开指控 K3 蒸馏 Anthropic 技术
    • 财政部长放话制裁
    • 传言实体清单可能波及月之暗面

    6.2 商务部 7/28 回应

    7 月 28 日,商务部发言人正式表态:“美方以莫须有理由打压中国科技企业扰乱全球产业链,中方将密切跟踪事态,保留采取一切必要措施维护国内企业合法权益。”这是中方在 K3 开源后给出的最高层级官方背书。

    6.3 25 家美国公司联名反对封杀

    7/24,黄仁勋在社交平台发布了一封由 a16z 发起、英伟达联合 Perplexity AI、Ollama 等科技公司共同签署的公开信,主张”前沿开源模型与前沿闭源模型应并存发展”。这份名单几乎囊括了硅谷的半壁江山:

    • 支持方(25 家):英伟达、微软、Meta、IBM、a16z、YC、Perplexity、Ollama、Hugging Face 等
    • 缺席方:OpenAI、Anthropic、Google——三家头部闭源实验室均未在首批名单上

    🎯 一句话理解这场博弈

    当开源前沿快速逼近闭源 SOTA,全行业可获取的”最低能力水位”被显著抬高,基础设施和平台公司(英伟达 / 微软 / Meta)天然倾向开放闭源前沿实验室(OpenAI / Anthropic / Google)天然强调安全边界。这场争论将直接影响美国 AI 监管框架、企业本地部署、云厂商竞争和中国模型使用限制。

    七、商业化跃迁:500 亿美元估值、最快半年港股上市

    开源不等于放弃商业化。K3 这一枪打出去后,月之暗面的资本化进程反而加速:

    • 日收入增长至少 6 倍(彭博)
    • ARR:6 月达 3 亿美元(4 月还只有 2 亿)
    • 融资节奏:5 月以 200 亿美元估值完成 20 亿美元融资(美团龙珠领投)
    • Pre-IPO 轮:7/22 报道,8 月启动,目标投前估值 500 亿美元(约 3386 亿元人民币)
    • 港股上市:最快 6 个月内登陆港股
    500 亿
    目标估值(美元)

    6x
    日收入增长倍数

    3 亿
    6 月 ARR(美元)

    6 月
    最快港股上市

    八、一张表:K3 vs Qwen3.8 vs DeepSeek V4 vs Fable 5

    模型 参数规模 开源状态 核心亮点 上手方式
    Kimi K3(月之暗面) 2.8T(激活 1040 亿 / 896 专家) 已开源(修改版 MIT) WebDev Arena 1679 Elo 第一、自研编译器、自研芯片、权重 + Infra 全开 Hugging Face / ModelScope / 昇腾 / 阿里云
    Qwen3.8-Max(阿里) 2.4T(激活未披露) 预览版承诺”很快”开源 双协议兼容、自称仅次 Fable 5 Token Plan / Qoder / QoderWork 预览版
    DeepSeek V4-Pro 1.6T(激活 490 亿) 已开源 推理量仅前代 27%、峰谷计费极致性价比 API 正式商用(7/19 上线)
    Claude Fable 5(参照) 未公开 闭源 公认天花板,FrontierSWE 86.6 API / Claude Code
    GPT-5.6 Sol(参照) 未公开 闭源 综合旗舰,编码被 K3 逼近 API(7/9 全量商用)

    同步观察 OpenRouter 生态

    • 中国开源模型占 OpenRouter 多模型 API 网关路由 token 用量 46.4%,美国模型 35.7%
    • OpenRouter 全球调用量周榜(7/20-7/26)前五全部为中国模型,小米 MiMo-V2.5 登顶
    • 开源模型处理 token 占比从 2026 年 1 月 34% 飙升至 6 月 65%
    • 中国大模型在全球调用量中连续 11 周领跑,开源模型下载量占比 41%
    • Mozilla《开源 AI 现状报告》:开源 vs 闭源平均性能差距缩至 3.3%

    九、对 AI 工具选型的 4 条落地启示

    🎯 给 AI 工具用户的 4 条落地建议

    1. 私有化窗口期已到:K3 权重已落地,量化后约 1.4TB 显存门槛(MaaS 业务可走昇腾 / 真武超节点 Day0 适配),自托管首次具备”前沿性能 + 数据主权”双重价值——闭源模型随时可能涨价、限流、停服,而开源权重一旦落到硬盘里,谁也夺不走。

    2. 换模型成本降至历史最低:K3 兼容 OpenAI / Anthropic 双协议,Cursor / Claude Code / Trae / 各类 Agent 框架改一行配置即可切换。建议对 K3、Qwen3.8、DeepSeek V4 做一轮同题横测再锁定主力模型。

    3. 国产算力链进入”订单验证”阶段:华为昇腾 / 阿里云真武同台首日适配,证明国产超节点已能稳定承载 3 万亿参数 MoE 推理;国产芯片”能用 → 好用”开始进入指数拐点。做企业本地化部署评估时,国产算力首次可以进入”必选”列表而非”备选”。

    4. 编程场景盯紧缓存命中率:K3 官方 API 输入 3 美元 / 缓存 0.3 美元(每百万 token),缓存命中与未命中价差 10 倍——用好提示词缓存 + 投机解码(Draft Model),账单能直接砍一个数量级。

    图灵奖得主萨顿说”我们正迈入经验时代”,K3 这场全栈开源把”经验时代”的入场券几乎免费递到了每个人手里。无论你用不用得动 K3 本身,至少从此,最强模型的权重,不再只锁在几家硅谷公司的服务器里。AI工具导航会持续跟踪 K3 量化版本、MiniTriton 编译器、45nm 芯片原型的后续实测,第一时间带来第一手横评。

    本文综合自:每日经济新闻、新智元、第一财经、北京日报、新浪财经、36 氪、券商中国、界面新闻、硅基见闻、硅基局外人及月之暗面、阿里云、华为 CANN、Hugging Face、Artificial Analysis 官方披露。数据截至 2026 年 7 月 28 日 16:00。


  • 豆包专业版办公任务模式深度解析:68元/月雇一个能操作电脑的AI员工

    💼
    豆包专业版 办公任务模式
    68 元/月雇一个能操作电脑的 AI 员工
    操作本地电脑 · 调用浏览器 · Skills 技能 · 定时任务
    AI
    AI工具导航
    @xcoolevdb · 2026年7月26日

    7 月 25 日,字节跳动豆包专业版上线全新「办公任务模式」——它不再只是对话框里的 AI 助手,而是一个能直接操作你电脑、调用浏览器、执行定时任务的办公 Agent。依托豆包 2.1 Pro 旗舰模型,内置数十项标准化技能并支持自定义搭建,连续包月 68 元。从「你问我答」到「你说目标,我干活」,这标志着国产 AI 办公工具正式进入 Agent 落地元年。

    📑 本文目录

    · 一、为什么 2026 年的 AI 办公需要 Agent?

    · 二、四大核心能力拆解

    · 三、豆包 2.1 Pro:办公任务模式的大脑

    · 四、Skills 技能体系:从标准化到自定义

    · 五、实战场景:它到底能干什么活?

    · 六、68 元/月的性价比账本

    · 七、与竞品对比:三个梯队的 Agent 市场

    · 八、局限与展望

    一、为什么 2026 年的 AI 办公需要 Agent?

    过去两年,AI 办公工具经历了三代进化:第一代是「问答式 AI」,你问一句它答一句;第二代是「对话式助手」,能多轮对话、帮你润色文案;但一个根本问题始终没解决——AI 只能输出文字,不能帮你干活

    艾瑞咨询《2026 中国 AI 办公白皮书》显示,国内白领平均每天 6.2 小时面对电脑,其中 43% 的时间消耗在机械重复操作上:文件归类整理、表格数据搬运、跨系统信息流转、格式转换排版……这些工作不需要创造力,但必须有人盯着屏幕一步步点。

    💡 核心洞察

    办公的真正痛点不是「不会写」,而是「不想干」——大量低价值、重复性的操作占据了人们的时间和注意力。AI 需要从「写给你看」变成「替你干完」。

    豆包专业版办公任务模式的设计逻辑正是如此:不是做一个更会聊天的 AI,而是做一个能动手干活的 AI 员工。你给目标,它规划步骤、调用工具、执行到底,最后把成品交到你手里。

    二、四大核心能力拆解

    办公任务模式的底层架构基于 Agent 范式,包含四大核心能力模块:

    🖥️ 操作本地电脑

    在授权后,AI 可以直接操作电脑中的文件夹、文档、表格。帮你整理资料、归类文件、批量处理文档、修改报表,把原本需要半小时的表格整理工作,几分钟就处理完毕。无需来回切换软件反复操作。

    🌐 自主调用浏览器

    写方案需要行业数据、做汇报需要案例参考,不用一个个点开网页检索筛选。下达需求后,它自动浏览网页,检索、筛选、整合有效资讯,剔除大量无效信息,直接输出整理完毕的参考资料。

    ⚡ Skills 专业技能

    内置数十项标准化技能,覆盖 Office 三件套(文档、表格、PPT)的专业操作,还能做图片视频设计、数据计算、思维导图生成等。一套流程连贯完成,不用反复切换多个工具软件。

    ⏰ 定时任务

    设置好之后,到点自动启动工作流程。定时汇总每日工作台账、定期推送项目进度提醒、自动抓取竞品信息——不用靠大脑硬记一堆截止日期,告别因遗忘任务导致的工作失误。

    4大
    核心能力模块

    数十项
    内置标准化技能

    自定义
    技能搭建支持

    68元
    连续包月价格

    三、豆包 2.1 Pro:办公任务模式的大脑

    办公任务模式的推理引擎是豆包 2.1 Pro 旗舰模型。相比普通对话模型,它针对 Agent 场景做了专项优化:

    1. 任务规划能力

    理解一个复杂目标后,自动拆解为可执行的步骤序列。比如你说「帮我准备明天项目汇报的材料」,它会分解为:抓取项目进度数据 → 整理关键指标 → 生成 PPT 大纲 → 填充内容 → 排版美化。

    2. 工具调用能力

    在任务执行过程中,根据步骤需要自主选择和调用合适的工具——需要查资料就打开浏览器,需要做 PPT 就调用 Office 技能,需要汇总数据就操作 Excel。每一步的工具选择和参数配置都是自动完成的。

    3. 自主纠错能力

    执行任务时如果某一步失败了(比如网页打不开、文件格式不对),不会直接报错停止,而是自动换一种方式重试。这种「自己给自己 debug」的能力,是从聊天 AI 到办公 Agent 的关键跨越。

    「从 OpenAI 的企业客服智能体 Presence,到智能体手机集中亮相 WAIC,再到豆包办公 Agent——2026 年下半年的主题词已经清晰:智能体正在真正上岗,从能聊走向能干活。」

    四、Skills 技能体系:从标准化到自定义

    技能体系是办公任务模式的核心卖点,也是它区别于普通 AI 对话助手的关键:

    标准化技能(开箱即用)

    Office 三件套:文档起草排版、表格数据处理、PPT 大纲生成与美化

    信息检索:网页信息抓取、竞品动态监控、行业报告摘要

    数据处理:数据清洗、格式转换、统计分析、图表生成

    内容创作:文案撰写、图片设计、视频脚本

    效率工具:思维导图、会议纪要整理、邮件起草

    自定义技能(按需搭建)

    标准化技能覆盖了大多数通用场景,但每个人的工作流程都有个性化需求。办公任务模式支持用户自定义搭建技能,把高频操作封装成可复用的流程模板。比如:

    「每天早上 8 点自动抓取竞品官网更新,整理成表格,发到工作群」

    「每周五下午自动汇总本周工作台账,生成周报初稿」

    「收到新邮件后,自动提取关键信息,更新到项目管理表」

    ⚠️ 使用提示

    AI Agent 的能力上限取决于使用者的需求拆解能力。同样一个工具,有人只会让它「帮我写个邮件」,有人能拆解出完整的工作流自动化方案。差距不在 AI,在人。68 元买的是工具,不是结果。

    五、实战场景:它到底能干什么活?

    场景一:课件制作

    告诉豆包「帮我做一份《安全生产管理》第四章的课件 PPT,15 页左右,风格简洁清晰,每页配上讲解文案」。几分钟后,一份完整的 PPT 已经生成——内容扎实、排版整齐,连每页的逐字稿都配好了。你要做的就是微调细节,加入自己单位的案例。

    场景二:成绩汇总与分析

    考试结束后,让豆包自动汇总各科成绩,生成分析报告:平均分、及格率、分数段分布、薄弱知识点识别。原本需要两小时的统计工作,十分钟搞定。

    场景三:跨应用信息流转

    这是办公任务模式的杀手级场景:自主检索本地电脑文件夹中的零碎素材,自动读取特定文档中对应日期的文案内容,跨应用打开浏览器,在官方账号上自主发布一条定时内容。从文件到浏览器到社交平台,一条指令串联三个应用。

    场景四:定时数据看板

    设置好定时任务,每天早上自动抓取指定数据源,更新数据仪表盘,推送关键指标异动提醒。不用每天手动刷新,到点自动交付。

    六、68 元/月的性价比账本

    68 元/月是什么概念?一天 2 块多钱。我们来算一笔账:

    对比项 人工成本 豆包专业版
    每天机械重复操作 2.5 小时 × 时薪 40 元 = 100 元/天 68 元/月(全月)
    文件整理归类 30 分钟/次 3 分钟/次
    跨系统信息搬运 20 分钟/次 1 分钟/次
    周报/汇报制作 1-2 小时/周 10 分钟/周
    网页信息检索整理 40 分钟/次 5 分钟/次
    💰 性价比结论

    如果办公任务模式每天能帮你省出 30 分钟的机械操作时间,按白领平均时薪计算,一个月省下的时间价值远超 68 元。关键不在于 AI 能不能替代你,而在于它能不能把你从低价值劳动中解放出来,让你把时间花在真正需要创造力和判断力的工作上。

    七、与竞品对比:三个梯队的 Agent 市场

    2026 年下半年的 AI Agent 市场已经悄然形成三个梯队:

    维度 第一梯队:企业级 Agent 平台 第二梯队:消费级办公助手 第三梯队:系统级 AI 助手
    代表产品 WorkBuddy、CodeBuddy NPC 豆包专业版 小艺 Claw、Step AOS
    定价 企业定制(万元级/年) 68 元/月 系统集成(设备自带)
    交付深度 企业级可靠性、全流程闭环 个人办公场景全能助理 设备级系统操控
    核心能力 流程编排 + 团队协同 + 治理合规 Skills 技能 + 定时任务 + 浏览器 系统级接口 + 跨应用操控
    适用人群 中大型企业研发/运营团队 白领/教师/自由职业者 手机/设备用户
    门槛 高(需企业部署) 极低(下载即用) 零(买设备自带)

    三个梯队的差距本质上不是模型谁更强,而是交付深度不同。豆包用标准化 Skills 把高频场景封装成产品,交付轻但覆盖面广;第一梯队解决「企业级可靠性」问题,第二梯队解决「个人级可用性」问题,第三梯队解决「无处不在」的问题。

    值得注意的是,豆包专业版办公任务模式还具备一个独特优势:零代码在线应用生成。它不仅能操作电脑,还能直接创建、修改和一键部署网站应用——数据仪表盘、项目管理看板、活动报名系统,支持后端数据库,配备完善的访问权限管理。这在 68 元/月的价位上几乎没有竞品。

    八、局限与展望

    客观来看,豆包专业版办公任务模式也有值得关注的局限:

    能力边界待验证:作为 7 月 25 日刚上线的新功能,能干多少活、干得多靠谱,还需要大规模用户验证。Agent 场景的稳定性是长期考验。

    安全与隐私:操作本地电脑意味着 AI 需要访问你的文件系统,虽然基于授权机制,但企业用户对数据安全的顾虑仍然存在。办公场景的敏感数据处理需格外谨慎。

    技能自定义门槛:标准化技能开箱即用,但自定义技能搭建需要使用者具备一定的流程拆解能力。对不擅长结构化思考的用户,可能只停留在用标准化技能的层面。

    模型能力天花板:Agent 的上限取决于底层模型,复杂的多步骤推理和跨场景协调仍有提升空间。尤其是需要强逻辑推理的财务分析、法律审查等场景,当前仍需人工复核。

    但方向是清晰的:2026 年 AI 办公工具的竞争,已经从「谁的对话更流畅」转向「谁能真正替你干活」。豆包专业版办公任务模式是国内消费级 AI 办公领域打出的重要一枪——不卷参数,不拼价格,只解决一个朴素问题:让你少一点机械操作,多一点思考空间。

    📌 一句话总结

    豆包专业版办公任务模式 = 豆包 2.1 Pro 大脑 + 操作本地电脑 + 浏览器调用 + Skills 技能体系 + 定时任务 + 在线应用生成。68 元/月,它不是一个更会聊天的 AI,而是一个能帮你干活的数字员工。对于每天被机械操作淹没的办公族,这可能是 2026 年最值得试用的 AI 工具之一。

    #豆包专业版
    #办公任务模式
    #豆包2.1Pro
    #AI办公
    #Agent
    #Skills技能
    #定时任务
    #字节跳动
    #AI工具导航
  • 腾讯云CodeBuddy NPC深度解析:首个流程原生研发智能体,首轮Token降超90%






    腾讯云CodeBuddy NPC深度解析:首个流程原生研发智能体,首轮Token降超90%






    🤖
    腾讯云 CodeBuddy NPC 深度解析
    首个「流程原生」研发智能体
    AI 住进代码仓库 · 首轮 Token 降超 90% · NPC Team 协同交付
    AI
    AI工具导航
    @xcoolevdb · 2026年7月24日

    7 月 23 日,腾讯云发布 CodeBuddy NPC——这不是又一个「AI 写代码」工具,而是一个能住进 Git 仓库、读懂 Issue、自己交 PR、看 CI 失败自动修的云端研发智能体。NPC 代表 Non-Player Collaborator(非玩家协作者),它的核心逻辑是:AI 不再是编辑器里的辅助工具,而是研发流程里的「原住民」。官方首轮 Token 消耗从 2 万+ 降至约 2000,降幅超 90%,企业无需改造工具链即可接入。

    📑 本文目录

    · 一、发布背景:为什么 2026 年需要「流程原生」智能体?

    · 二、核心创新:AI Native Git——让 AI 拥有研发记忆

    · 三、NPC Team:多角色协同,从游戏开发到企业研发

    · 四、Token 优化方法论:首轮压到 2000 的四步法

    · 五、与本地 AI 编程工具的本质区别

    · 六、CNB 平台底座:8 年积淀的研发基础设施

    · 七、对企业研发的 5 条启示

    · 八、局限与展望

    一、发布背景:为什么 2026 年需要「流程原生」智能体?

    过去两年,AI 编程工具从代码补全(Copilot 时代)进化到多文件理解(Cursor 时代),再到终端 Agent(Claude Code / Codex 时代)。但一个根本问题始终没解决:AI 和研发流程是割裂的

    据中国信通院《2026 企业研发效能白皮书》,国内中大型科技企业平均每个新功能从需求提出到线上可用仍需 11.7 天,其中近 40% 耗在沟通对齐、环境配置、PR 反复驳回与 CI 调试上。平均每个研发人员每天要在 Jira、Git、SonarQube、Prometheus、飞书、钉钉等 11.3 个系统间切换,上下文丢失率高达 42%。

    💡 核心洞察

    企业痛点不是编码速度不够,而是 AI 与研发流程割裂。AI 不在团队的代码仓库里、不接团队的构建和验证流程,成了一个游离在流程之外的旁观者。

    腾讯云的解法不是做「更好的代码补全」,而是让 AI 直接住进研发流程——这就是 CodeBuddy NPC 的设计起点。

    二、核心创新:AI Native Git——让 AI 拥有研发记忆

    CodeBuddy NPC 提出了「AI Native Git」技术范式,将 Git 仓库及相关研发资产转化为 AI 的原生工作上下文:

    📋 Issue → 需求记忆

    记录任务、背景与目标。开发者在 Issue 中 @NPC 即可下发任务,无需手动复制需求。

    📁 代码仓库 → 工程记忆

    承载项目结构、依赖关系与演进历史。NPC 直接读取仓库代码,理解项目架构。

    🔀 PR → 变更记忆

    沉淀方案、代码与评审反馈。NPC 自主提交 PR,并附带变更说明和风险标注。

    ✅ CI/CD → 质量记忆

    记录构建结果、失败原因与修复过程。CI 失败时 NPC 自动定位问题、修复代码并重新执行。

    有了这四层「研发记忆」,NPC 的工作方式从「一次性生成代码」变为「持续完成研发任务」。它像一位新入职的同事:先读项目文档,了解架构决策,再开始干活——而不是每次都从零开始。

    三大典型场景

    1. 开发网站

    自动读取需求和项目代码,完成开发、提交 PR,并生成预览环境。整个过程在 Issue 中 @NPC 一步触发。

    2. 自主解决代码冲突

    当多人协作产生合并冲突,NPC 自动处理冲突、修改代码、重新提交,无需人工介入。

    3. 自动修复 CI

    CI 失败后,NPC 自动定位问题、修复代码并重新执行,循环迭代直到通过质量门禁。这是「AI Native Git」闭环的典型体现:提交 → 验证 → 修复 → 再验证。

    三、NPC Team:多角色协同,从游戏开发到企业研发

    单 Agent 能力有上限,复杂研发任务需要多角色协同。CodeBuddy NPC 支持通过四个维度编排专属 NPC 团队:

    Role
    角色定义

    SOP
    标准流程

    Skill
    技能配置

    Team
    团队编排

    官方演示:零人工干预完成游戏全流程开发

    腾讯云用一支 NPC Team 全程零人工干预完成了一款游戏开发:

    项目经理 NPC:需求拆解与任务分配

    剧本、美术、配乐、配音 NPC:分别完成内容创作

    资产整合 NPC:汇总代码与素材

    代码评审 NPC + 测试 NPC:完成最终验证

    关键特性:一个 NPC 的输出可以直接成为下一个 NPC 的输入,任务、代码、素材和测试结果持续沉淀在同一个项目中。

    🏢 企业定制示例

    企业可以通过 Role、Skill、SOP 和 Team 编排自己的 NPC Team。例如:产品 NPC 负责需求澄清,技术 Leader NPC 生成技术方案,开发 NPC 协同编码验证,交付分析 NPC 回收数据反哺流程优化——定义一个完整的「AI 原生团队」。

    四、Token 优化方法论:首轮压到 2000 的四步法

    Agent 执行一次任务需要多轮 LLM 调用,每轮都把系统提示词和工具描述重新发给模型。首轮 Token 是每轮都要「带着走」的固定成本——压得越小,后续每一轮都跟着省,形成「滚雪球」式节约。

    腾讯云沉淀出一套 Agent 能效优化方法论,四个方向:

    方向 具体做法 效果
    做减法 裁剪冗余工具、精简描述、消除二义性 减少无效 Token 传递
    立规矩 把 SOP 写进提示词,让模型少走弯路 减少自行试错轮次
    提效率 CLI 紧凑输出、Cache 去重叠、降低工具调用轮次 压缩每轮 Token 消耗
    标准化 对 Skill、CLI、系统工具持续调优 长期成本基线持续下降
    2万+
    优化前首轮 Token

    ~2000
    优化后首轮 Token

    >90%
    首轮 Token 降幅

    滚雪球
    多轮累计节约效应

    此外,企业还可根据任务复杂度灵活配置模型策略:简单任务调用低成本模型(如 DeepSeek),复杂研发任务调用更强模型(如 GLM),多模态任务在云端容器沙箱中运行相应模型——在性能与成本间取得平衡。

    五、与本地 AI 编程工具的本质区别

    CodeBuddy NPC 和 Cursor、Claude Code、Copilot 等「本地辅助」工具的核心区别不在功能数量,而在工作范式的根本差异

    维度 本地 AI 编程工具 CodeBuddy NPC
    运行位置 本地 IDE / 终端 云端,依托 CNB 平台
    上下文来源 当前打开的文件 / 项目 Issue + 仓库 + PR + CI 全流程
    工作模式 辅助编写,需人工逐行确认 自主闭环,从需求到交付
    记忆能力 会话级,重启后丢失 研发记忆,跨会话持续
    协作方式 人 + AI(1:1) 多 NPC Team 协同(N:N)
    交付物 代码片段 / 文件修改 可验收的完整成果(PR + 测试 + 文档)
    成本控制 按 API 调用计费 Token 优化 + 模型路由 + 企业级治理
    「我们并不希望行业再多一个『更会写代码』的工具,而是希望企业真正拥有一个能理解研发上下文、遵守团队流程、持续交付结果的 AI 队友。」——黄友昆,腾讯云 CodeBuddy、CNB 产品负责人

    简言之:本地工具解决「写代码快不快」的问题,CodeBuddy NPC 解决「交付稳不稳」的问题。两者不是替代关系,而是互补——本地工具管编码体验,NPC 管流程闭环。

    六、CNB 平台底座:8 年积淀的研发基础设施

    CodeBuddy NPC 不是凭空诞生的产品,它深度依托腾讯云 CNB(Cloud Native Build)研发平台,后者自 2018 年起在腾讯内部持续迭代:

    Git 代码托管:支撑百 G 乃至 TB 级超大仓库(含模型文件)

    CI/CD 流水线:与 NPC 的「提交→验证→修复→再验证」闭环深度集成

    制品库:构建产物标准化管理

    云原生开发环境:容器沙箱 + 开源模型,扩展多模态 NPC 能力

    8年+
    CNB 平台积淀

    10万+
    月活开发者

    CNB 支撑了腾讯文档、腾讯广告、手机 QQ 等高频迭代业务,覆盖物流、消费电子、零售、金融等多个行业。更重要的是,CNB 为国内开发者提供了自主可控、数据合规的研发协作环境——在企业级场景下,这是海外 SaaS 工具难以提供的。

    七、对企业研发的 5 条启示

    1. 从「给每个人发 AI 工具」到「让 AI 重构协作方式」

    腾讯的实践不是把 AI 工具分发给每个人就结束,而是围绕 AI 重构协作方式:PM 发起任务 → AI 参与需求澄清与任务拆解 → 技术 Leader 与 AI 共建方案 → 研发与 AI 协同开发验证 → 交付分析回收数据反哺优化。这是一个闭环。

    2. 开发者角色从「生产者」变为「监督者 + 规则制定者」

    当 NPC 能独立闭环交付,开发者的核心价值不再是写代码的速度,而是:定目标、做决策、验收成果、制定规则(SOP)让 NPC 更好地工作。

    3. 不改造工具链,AI 就无法真正落地

    很多企业买了 AI 编程工具却发现用不起来,根因是工具和现有流程割裂。CodeBuddy NPC 的做法是:不要求企业改造任何工具链,直接在现有 Git、TAPD、构建发布流程中接入。

    4. Token 成本是 Agent 落地的隐形成本

    Agent 多轮调用的 Token 成本往往被低估。首轮 Token 压缩 90% 带来的是多轮累计的指数级节约。企业在选型时应关注 Agent 的 Token 效率,而不仅是单次调用价格。

    5. 可信交付 > 黑箱输出

    NPC 的所有操作留痕可溯、权限可控、审计合规。在企业级研发中,「AI 交付的结果可验收」比「AI 写的代码多快」重要得多。

    八、局限与展望

    客观来看,CodeBuddy NPC 也有值得关注的局限:

    平台绑定:深度依托 CNB 平台,对非腾讯云用户存在迁移成本

    场景聚焦:当前主要面向企业级研发流程,个人开发者/小团队的轻量场景可能不是最优解

    早期产品:多角色 NPC Team 的编排复杂度较高,SOP 编写和调试需要学习成本

    模型依赖:效果受底层模型能力制约,复杂架构决策仍需人类把关

    但方向是清晰的:2026 年 AI 编程工具的竞争,已经从「谁的模型更强」转向「谁的流程更闭环」。CodeBuddy NPC 是国内云厂商在这个赛道上打出的重要一枪——不卷参数,不拼算力,只解决一个朴素问题:让写代码的人,少一点机械劳动,多一点创造快感。

    📌 一句话总结

    CodeBuddy NPC = AI Native Git + 研发记忆 + NPC Team + Token 优化 + CNB 底座。它不是在帮开发者写代码,而是在替开发者跑流程——从需求到交付,全链路闭环,企业无需改造工具链。对于正在评估 AI 研发工具的企业,这是一个值得认真试用的新选项。

    #CodeBuddyNPC
    #腾讯云
    #云端研发智能体
    #AINativeGit
    #NPCTeam
    #Token优化
    #CNB
    #AI编程
    #研发流程
    #AI工具导航


  • WAIC 2026闭幕盘点:Kimi K3开源2.8万亿参数、Qwen3.8宣战Fable 5,具身智能从舞台走进车间






    WAIC 2026闭幕盘点:Kimi K3开源2.8万亿参数、Qwen3.8宣战Fable 5,具身智能从舞台走进车间






    🌐
    WAIC 2026 闭幕盘点
    Kimi K3 开源 2.8 万亿 · Qwen3.8 深夜宣战
    具身智能进车间 · 世界AI合作组织落户上海
    AI
    AI工具导航
    @xcoolevdb · 2026年7月20日

    7 月 20 日,为期四天的 2026 世界人工智能大会(WAIC 2026)在上海闭幕。300+ 新品全球首发、162 亿元意向签约只是表面数字——真正的信号是:Kimi K3 以 2.8 万亿参数开源登顶代码榜、阿里 Qwen3.8 深夜官宣 2.4 万亿直指 Fable 5、人形机器人集体”进厂打工”、29 国签约成立世界人工智能合作组织。AI 正式从”能聊天”进入”能干活”时代。

    📑 本文目录

    · 一、四天大会,先用一组数字看懂

    · 二、模型第一弹:Kimi K3——2.8万亿开源”深水炸弹”

    · 三、模型第二弹:Qwen3.8-Max——阿里深夜官宣2.4万亿

    · 四、模型第三弹:商汤U1 Pro + 昆仑万维世界模型

    · 五、一张表看懂:WAIC国产旗舰模型横评

    · 六、具身智能:机器人不跳舞了,开始拧螺丝

    · 七、两条暗线:全球治理与国产算力

    · 八、对AI工具选型的4条启示

    一、四天大会,先用一组数字看懂

    WAIC 2026(7月17-20日,上海)是今年全球 AI 产业密度最高的四天。闭幕日的核心数据如下:

    300+
    全球首发新品

    1100+
    参展企业

    162亿
    意向签约金额(元)

    57个
    实体应用场景落地

    值得注意的一个比例:300 多款首发新品中,60% 以上是可直接落地的行业解决方案,不是炫技 Demo。大会同期展出的还有 261 款大模型和 208 款具身智能终端。产业底盘方面,2025 年中国 AI 核心产业规模已突破 1.2 万亿元、企业超 6200 家、全球 60% 的 AI 专利在中国手里,AI 渗透率超过 86%——每 10 个中国人里近 9 人每周至少用一次 AI。

    🎯 一句话总结本届 WAIC

    去年机器人还在台上跳舞翻跟头,今年全部进了车间;去年大模型还在比谁跑分高,今年直接开源万亿参数”掀桌子”。AI 从 PPT 走进了车间、药房、仓库和手机。

    二、模型第一弹:Kimi K3——2.8万亿开源”深水炸弹”

    7 月 17 日凌晨(大会开幕当天),月之暗面正式发布新一代旗舰大模型 Kimi K3,这是本届 WAIC 期间分量最重的一颗”炸弹”:

    • 规模:2.8 万亿总参数,超越 DeepSeek-V4-Pro 的 1.6 万亿,成为目前全球参数量最大的开源权重模型,把开源阵营抬进 3 万亿级别。
    • 架构:MoE 混合专家(896 个专家、每 token 激活 16 个),基于 KDA(Kimi Delta Attention)混合线性注意力 + 注意力残差技术,整体扩展效率比 K2 提升约 2.5 倍;100 万 token 上下文,原生支持视觉理解。
    • 跑分:发布数小时即登顶 Arena 代码榜(1679 分),中国大模型首次拿下该榜第一;SWE Marathon 长程编程 42.0 分第一;FrontierSWE 81.2 分,仅次于 Claude Fable 5(86.6)、高于 GPT-5.6 Sol(71.3)。
    • 长任务案例:连续 48 小时自主 Agent 运行,基于开源 EDA 工具独立完成一款芯片的构建、优化与验证(100MHz 时序收敛、仿真吞吐超 8700 token/秒);另一案例中整理 42 年 AI ASIC 产业资料,经历 120 多轮自我迭代、约 2800 次网页搜索、处理 87 份季度报告和 99 份原始 PDF。
    💰 API 定价与开源节奏

    · 输入:缓存命中 2 元 / 未命中 20 元(每百万 token),官方称编程场景缓存率超 90%

    · 输出:100 元 / 每百万 token;第三方测算单任务成本约 0.94 美元,约为 Claude Opus 4.8 的一半

    · 完整模型权重将于 7 月 27 日前发布,官方建议在至少 64 个加速器的超级节点上部署

    市场反应立竿见影:发布次日纳指期货盘前跌逾 1.8%,摩根大通称之为“DeepSeek 2.0 时刻”;马斯克在评论区留言”Impressive”。公司层面,Kimi ARR 已突破 3 亿美元,新一轮融资投前估值达 315 亿美元(半年前仅 43 亿美元),最快 6 个月内有望港股上市。

    值得称道的是,月之暗面官方主动列出了三条局限:对历史思考内容敏感(中途换框架质量不稳)、简单场景下可能”过于主动”替用户做非预期判断、整体用户体验仍落后 Fable 5 与 GPT-5.6 Sol。这种坦率反而增加了跑分的可信度。

    三、模型第二弹:Qwen3.8-Max——阿里深夜官宣2.4万亿

    Kimi K3 发布不到 72 小时,7 月 19 日深夜,阿里通义千问官方账号甩出一句话:“这可能是除了 Fable 5 外,最强大的模型。”——Qwen3.8-Max 预览版正式亮相:

    • 规模:2.4 万亿总参数,千问团队首个超 1 万亿参数的多模态模型,可处理文本、图像、视频与文档。上一代 Qwen3 开源旗舰(2025年4月)总参数才 2350 亿——一年出头翻了约 10 倍。
    • 上手:预览版已首发上线阿里 Token Plan、Qoder、QoderWork 三大入口,按标准定价 10% 计费;Token Plan 个人版 Lite 档低至 39 元/月。API 同时兼容 OpenAI 与 Anthropic 两套协议,Cursor、Claude Code 等工具基本不用改配置即可切换。
    • 开源承诺:官方明确正式版”很快开源全部权重”——但截至闭幕日,未公布日期、许可证与 Hugging Face 仓库。
    • 生态位:Qoder 已占中国 AI 编程市场 47.6% 的营收份额,超过第二到第五名总和;千问的 AI 耳机、AI 眼镜也在本届 WAIC 亮相。

    🧊 需要泼的三盆冷水

    1. “仅次于 Fable 5″是阿里内部评测口径,尚无第三方公开跑分;激活参数量未披露,2.4 万亿只是总量。

    2. 有开发者反馈预览版”幻觉率颇高”,稳定性待观察。

    3. 万亿级模型私有化部署门槛极高(至少 8 张 H100 级别显卡),中小团队短期仍只能靠 API。

    至此,国产开源阵营形成“万亿俱乐部”三强:Kimi K3(2.8T)、Qwen3.8(2.4T)、DeepSeek V4-Pro(1.6T,7月19日正式版上线,峰谷计费后 V4 Flash 每百万输出 token 低至 0.28 美元)。美国 AI 社区已有预测:接下来几个月中国将出现一波开源模型浪潮。

    四、模型第三弹:商汤U1 Pro + 昆仑万维世界模型

    商汤 SenseNova U1 Pro:告别”抽卡”的交付级多模态

    7 月 18 日,商汤发布旗舰多模态模型 SenseNova U1 Pro,定位”面向长程任务的交付级原生多模态智能体基座”。它解决的是 AI 绘图最大的痛点——反复刷新”抽卡”:模型自带完整创作逻辑(看懂需求→规划画面→生成内容→自查漏洞→自动修正),原生支持 8K 超清输出,图文混排出错率极低。

    现场展示的三个案例颇具说服力:独立完成 WAIC 九周年 4:1 超宽水墨长卷(高密度文字地标清晰可辨);一次性产出《沙影之刃》22 个逻辑一致的连续分镜;配合办公助手”小浣熊”走完”收集信息—分析数据—可视化报告”全流程。底层依托自研 NEO-unify 统一架构,打通文字理解与图像生成。目前测试版定向邀请中,完整版将于 8 月上线。

    昆仑万维:宣布”2026为世界模型元年”

    7 月 19 日,昆仑万维在 WAIC 专场宣布核心模型矩阵升级:Matrix-Game 3.5 世界模型(5B 参数、720p 分辨率单卡 20FPS 实时生成、1 分钟记忆能力,已积累超 500 万高质量视频切片、覆盖 1200 余个游戏场景)、Mureka v9.5 与 O3 音乐模型。董事长兼 CEO 方汉判断:过去两年 AI 的核心命题是”生成”,从 2026 年起转向“理解”与”交互”——让 AI 真正理解物理世界运行规律并与真实环境闭环互动。

    五、一张表看懂:WAIC国产旗舰模型横评

    模型 参数规模 开源状态 核心亮点 上手方式
    Kimi K3(月之暗面) 2.8T(激活16/896专家) 权重 7/27 前发布 Code Arena 第一、100万上下文、原生视觉 Kimi 网页/App、Kimi Work、API 已上线
    Qwen3.8-Max(阿里) 2.4T(激活量未披露) 承诺”很快开源”,无日期 万亿级多模态、双协议兼容、官方自称仅次 Fable 5 Token Plan/Qoder/QoderWork 预览版(1折)
    DeepSeek V4-Pro 1.6T(激活490亿) 已开源 推理量仅前代27%、峰谷计费极致性价比 API 正式商用(7/19上线)
    SenseNova U1 Pro(商汤) 未披露 基础版 U1 已开源 交付级多模态、8K 原生、告别抽卡 测试版定向邀请,完整版 8 月上线
    Claude Fable 5(参照) 未公开 闭源 公认天花板,FrontierSWE 86.6 API / Claude Code
    GPT-5.6 Sol(参照) 未公开 闭源 综合旗舰,编码被 K3 逼近 API(7/9 全量商用)

    一个清晰的趋势:国产模型发布节奏已到”每48小时一炸”——7/17 Kimi K3、7/19 DeepSeek V4 正式版 + Qwen3.8、7/20 百度秒哒3.5/京东JoyAI矩阵/面壁 MiniCPM-Robo 等集中亮相。硅谷一年发一次旗舰,中国一个月发五次。

    六、具身智能:机器人不跳舞了,开始拧螺丝

    本届 WAIC 具身智能赛道聚了 200 多家企业,但气质完全变了——没人再比谁的机器人翻跟头翻得溜,都在讲”进厂了几个””在哪条产线跑””不良率降了多少”:

    🏆 智元 远征A3 Ultra(镇馆之宝)

    174cm 身高、700TOPS 算力,能搬货、能锁螺丝、24 小时连轴转,已在宁德时代产线上跑。智元还在三地四馆部署 60 台机器人做导览、问询、零售——不是 Demo,是真干活。

    📦 京东物流 精灵G2 Max

    直接扔进智狼仓做入库、搬箱、码垛,24 小时不间断。人形机器人第一次在真实仓储常态化上岗

    💊 蚂蚁灵波 智慧药房(镇馆之宝)

    三台不同形态机器人协作,接单、取药、打包 90 秒搞定,已在国大药房上海门店运营。

    🤖 宇树 GD-01 载人变形机甲

    3 米高、500 公斤、人形四足自由切换,售价 390 万。马斯克都转发说”太帅了”。不卖量,卖的是”中国能做出这东西”这张名片。

    产线级突破同样实在:复旦大学与新智具身联合研发的视觉触觉融合系统,已在上汽智己车灯装配线运行——装配精度 0.1 毫米、不良率降低 85%;西门子正式面向中国市场发售 Eigen 工程智能体,可独立完成工业自动化工程从需求分析到系统验证的全流程;成立仅一年半的松应科技凭 ORCA OS(多形态机器人协同训练物理 AI 操作系统)拿下西门子战略合作。工信部预计,2026 年中国人形机器人全年产量将突破 10 万台

    七、两条暗线:全球治理与国产算力

    暗线一:29国签约,AI有了”正经组织”

    开幕式当天最重磅的消息不是任何新品,而是世界人工智能合作组织正式成立——29 个国家代表现场签约,永久总部落户上海。中方同时宣布提供 5000 个 AI 专题研修名额、建设国际 AI 应用合作中心、推动”妈祖”气象预警方案在 30 国落地。大会还发布了《智能体互信互联互操作全球合作倡议》,腾讯、京东、西门子、亚马逊等 200 多家中外企业加入,要做三件事:统一智能体通信协议、开放头部平台接口、建立可追溯身份认证机制。

    说人话:以后你家的 AI 客服和我家的 AI 销售能直接对话办事。标准一旦定下来,跟进的就是真金白银的订单。IDC 也在大会期间发布行业首份《DAA 研究报告》:2026 年全球数字 AI 智能体数量将达 7940 万个,2030 年预计突破 22.16 亿个。

    暗线二:国产算力从”能用”到”组集群”

    十大”镇馆之宝”里算力相关占了半壁江山:华为 Atlas 950 超节点(单柜 64 张昇腾卡、最大扩展 8192 卡,1024 卡集群”像一台计算机一样协同工作”)首次真机展出;曙光 8000 全国产十万卡 AI 超集群已接入国家超算互联网;阿里真武 M890(144GB 显存、800GB/s 片间互联、原生支持 FP32 到 FP4 全精度)、中兴 OEX 超节点同台亮相。全场 108 款芯片集中展示、200 多家智算企业参展。

    政策面同步加码:七部委 7 月 15 日联合发布智算中心建设新政——国资新建智算中心核心硬件国产化比例 ≥75%,采购国产服务器/HBM/先进封装设备可申领最高 30% 财政补贴,万卡机房强制配套液冷。国产算力正从”概念”进入”订单验证”阶段。

    八、对AI工具选型的4条启示

    🎯 给AI工具用户的4条落地建议

    1. 开源选型进入窗口期:Kimi K3 权重 7/27 放出、Qwen3.8 开源在即,有私有化部署需求的团队现在就该评估算力门槛(K3 建议 64 卡超节点)与许可证条款,等权重落地直接开跑。

    2. 换模型的成本已降到历史最低:Qwen3.8 同时兼容 OpenAI 与 Anthropic 双协议,Cursor/Claude Code 等工具改一行配置即可切换。建议对 K3、Qwen3.8、DeepSeek V4 做一轮同题横测再锁定主力模型。

    3. 编程场景盯紧缓存命中率:Kimi 官方缓存率超 90%,命中与未命中输入价差 10 倍——用好提示词缓存,API 账单能直接砍一个数量级。

    4. “能干活”取代”能聊天”成为验收标准:本届 WAIC 60% 首发是可落地解决方案。选工具就看三点——能不能进你的真实流程、能不能接你的业务数据、一线员工用不用得起来。

    图灵奖得主萨顿在主论坛说:”现在的 AI 还不算真智能——但我们正迈入经验时代,势不可挡。”四天的 WAIC 2026 证明了一件事:AI 的竞争已从参数比拼进入交付能力比拼。对普通用户和中小企业,这是最好的时代——最强的模型能力,正在以开源和低价两种方式同时变得触手可及。AI工具导航会持续跟进 Kimi K3 权重发布(7/27)与 Qwen3.8 正式版,第一时间带来实测横评。

    本文综合自:每日经济新闻、证券时报、四川观察WAIC观察、搜狐科技、澎湃新闻、凤凰网、开源证券/东吴证券研报及月之暗面、阿里通义、商汤官方披露。数据截至 2026 年 7 月 20 日 16:00。


  • 阶跃星辰Step AOS深度解析:全球首个智能体原生操作系统意味着什么?






    阶跃星辰Step AOS深度解析:全球首个智能体原生操作系统意味着什么?






    🧠
    Step AOS 深度解析
    全球首个智能体原生操作系统
    阶跃星辰如何从底层重构移动终端?
    AI
    AI工具导航
    @xcoolevdb · 2026年7月14日

    7月13日晚,阶跃星辰在上海正式发布全球首个智能体原生操作系统 Step AOS、个人智能体 Amoo 以及大模型原生终端品牌 STEPX 旗下首款手机 STEPX Neo。这不是在 Android 上叠一层 AI 壳,而是从底层重构操作系统以服务智能体运行。本文从架构设计、记忆系统、安全体系、生态合作四个维度深度解析。

    📑 本文目录

    · 一、为什么说 Step AOS 不是”AI壳”?

    · 二、架构拆解:原子能力引擎 + 端云多脑体系

    · 三、记忆系统:双域三步,让智能体”越用越懂你”

    · 四、四维安全:可信、可见、可控、可逆

    · 五、STEPX Neo 硬件:为智能体重新分配资源

    · 六、Amoo:你的第一个系统级个人智能体

    · 七、生态合作:10大App以协议接口接入,而非GUI模拟

    · 八、与竞品对比:Step AOS vs Apple Intelligence vs 豆包手机

    · 九、对开发者和AI工具选型的4条启示

    一、为什么说 Step AOS 不是”AI壳”?

    当前市面上绝大多数”AI手机”的本质,是在 Android/iOS 上叠加一层 AI 助手——你打开一个对话框,AI 帮你搜索、总结、生成内容,但它无法真正操作手机上的其他 App。这就像在 Windows 上装一个 ChatGPT 桌面版,AI 和操作系统之间是”应用”关系,不是”原生”关系。

    Step AOS 的根本不同在于:它从操作系统的资源调度层开始,就把”智能体”当作第一公民来设计。传统移动操作系统的调度逻辑围绕”人操作应用”构建——你点开微信,系统把 CPU、内存、网络优先给微信。Step AOS 的调度逻辑围绕”智能体执行任务”构建——你说”帮我订明天去上海的高铁”,智能体自主调度 12306、支付宝、日历三个应用的系统资源。

    🔑 核心差异一句话总结

    传统 AI 手机 = 操作系统 + AI 应用(两层分离)
    Step AOS = 操作系统为智能体而生(底层融合)

    阶跃星辰董事长印奇在发布会上明确表示:”中国大模型的商业化之路不是 Coding,软硬结合是我们比较相信的路,就先去尝试。”这句话的分量在于——国内大模型六小虎中,阶跃是第一个真正从”模型厂”走向”操作系统+硬件”全栈布局的玩家。

    二、架构拆解:原子能力引擎 + 端云多脑体系

    Step AOS 的技术架构核心由两大引擎构成:

    原子能力引擎

    Step AOS 将系统底层能力按 MCP(Model Context Protocol)标准拆解为四大类最小单元:

    📡 通讯能力

    电话、短信、5G/Wi-Fi 网络状态等通信资源的原子化调用,智能体可直接拨打电话或发送短信。

    📱 应用能力

    第三方应用的协议接口调用(非 GUI 模拟),目前已接入支付宝、美团、高德、滴滴、京东、百度等。

    📂 文件能力

    文件系统读写、文档解析、图片/视频处理等本地资源的结构化调用。

    ⚙️ 系统能力

    通知管理、日程、位置服务、传感器数据等系统能力的标准化输出。

    关键点在于:MCP 标准的采用意味着这些原子能力不绑定阶跃自家的模型——任何兼容 MCP 的 AI Agent 理论上都可以调用这些能力。这为未来的智能体生态开放打下了基础。

    端云多脑体系

    Step AOS 采用”端云协同”的多模型架构,根据任务复杂度动态选择模型:

    Step Edge
    端侧模型家族
    简单任务本地秒回

    Step-2
    云端万亿参数基座
    复杂任务深度推理

    层级联调
    动态升级策略
    按成本/速度/精度自动路由

    MCP
    标准化协议
    能力调用可审计可追溯

    这种设计回应了 7/12 GPT-5.6 误删 Mac 用户文件事故暴露的核心问题:如果 AI 的本地权限过大且缺乏分层机制,一个小模型的判断失误可能造成不可逆的系统破坏。端云多脑体系通过”简单事本地快响应、复杂事云端深思考”的动态路由,在效率和安全之间取得平衡。

    三、记忆系统:双域三步,让智能体”越用越懂你”

    智能体与聊天机器人的本质区别,在于”记忆”。ChatGPT 记不住你上周说过什么,但一个真正的智能体应该像你的秘书一样,用得越久越了解你。Step AOS 的记忆系统设计是本次发布中最值得关注的技术亮点之一。

    双域结构

    👤 用户域(User Domain)

    记录用户的习惯、偏好、身份信息。比如你妈妈痛风不能吃海鲜,智能体在她生日推荐餐厅时会自动过滤海鲜选项。这类记忆属于用户,用户可以查看、编辑、删除。

    🤖 智能体域(Agent Domain)

    记录智能体自身的知识与经验积累。比如 Amoo 学会了”用户说’帮我订票’通常意味着高铁而非飞机”,这种经验使智能体越来越聪明。这类记忆属于智能体,随使用持续成长。

    三步链路:记 → 理 → 忆

    Step AOS 的记忆不是简单的”存取键值对”,而是一个三步认知链路:

    • 记(Record):感知并记录交互数据——你说的话、点击的操作、停留的时间。
    • 理(Understand):对原始数据进行结构化理解和归纳——从”用户每次点外卖都选少辣”推断出”用户偏好清淡口味”。
    • 忆(Recall):在需要时精准检索相关记忆——推荐餐厅时自动调取你的饮食偏好,而非每次都问一遍。

    💡 技术解读

    这种”记-理-忆”三步链路,本质上是 RAG(检索增强生成)在个人智能体场景的深度定制。不同于通用 RAG 从外部知识库检索,Step AOS 的 RAG 源头是用户的个人行为数据,这让检索的精准度和相关性远超通用方案。

    四、四维安全:可信、可见、可控、可逆

    7/12 GPT-5.6 误删 Mac 用户主目录文件的事故,给全行业敲响了警钟:AI 能力越强,对系统的破坏力也越大。Step AOS 在安全体系上的设计,很大程度上是对这次事故的系统性回应。

    维度 设计原则 具体实现
    可信 操作在可信执行环境中完成 敏感操作(支付、删除文件等)在 TEE 可信执行环境中完成,数据不出安全边界
    可见 每一步操作可审计、可回溯 智能体所有操作生成操作日志,用户可随时查看 Amoo 执行了哪些动作
    可控 权限按需授予、用完即收 动态权限管理:调用相机时授权,任务完成后自动收回;智能体记忆可删除
    可逆 误操作可一键撤回 关键操作(如删除文件、发送消息)进入”待确认”队列,支持撤回
    “安全不是一个功能,而是一种架构。你不能在AI系统建好之后再去加安全,那就像在造好的大楼里加装承重墙。”——Step AOS 安全架构设计理念

    四维安全体系中最值得关注的是“可逆”设计。GPT-5.6 误删文件事故之所以严重,正是因为 AI 的操作是单向的、不可逆的——一旦执行,数据即丢失。Step AOS 的”待确认队列”机制,相当于给 AI 的每一步操作都加了”Ctrl+Z”能力,这应该是所有 AI 操作系统的标配。

    五、STEPX Neo 硬件:为智能体重新分配资源

    STEPX Neo 是 STEPX 品牌旗下的首款大模型原生智能体手机,硬件设计上有两个显著差异化特征:

    🔲 背部像素交互屏

    相机模组右侧集成一块像素风格交互屏,可显示智能体 Amoo 的形象和状态——不用亮屏就能知道 Amoo 正在执行什么任务。这是从”人找手机”到”手机主动告知”的交互范式转变。

    ⚡ 智能体优先资源调度

    传统手机把大部分算力留给前台 App,Step AOS 则为智能体预留专属算力通道——当 Amoo 在后台执行跨应用任务时,系统保证其算力不受前台应用干扰。这需要从 SoC 调度层做定制,不是纯软件能做到的。

    硬件层面的另一个关键决策是端侧模型家族 Step Edge 的部署。阶跃星辰在发布会上公布了面向汽车、手机等终端场景的 Step Edge 端侧模型,这意味着 STEPX Neo 可以在无网络环境下完成基本的智能体任务,比如本地日程管理、语音拨打电话等。

    六、Amoo:你的第一个系统级个人智能体

    Amoo 不是 ChatGPT 那样的”问答助手”,而是系统级智能体——它活在操作系统的底层,能跨应用调度、持续记忆、自主决策。

    🎯 Amoo 的核心能力

    1. 意图理解:用户不需要逐步下达指令,只需表达任务意图。比如”帮我安排周末上海两日游”,Amoo 自动拆解为订酒店、查景点、买门票、安排路线四个子任务。

    2. 跨应用执行:通过协议接口(非 GUI 模拟)调用美团订酒店、携程买门票、高德导航、滴滴叫车——每个步骤都是真实 API 调用,不是屏幕点击模拟。

    3. 持续成长:双域三步记忆系统让 Amoo 越用越懂你。用了一个月后,它会知道你偏好靠窗高铁座、喜欢下午2点入住酒店、习惯用支付宝而非微信支付。

    4. 主动建议:不仅等你发指令,还会基于日历、天气、位置等上下文主动提供建议——”你明天8点有会,建议7:15出发,高德显示当前路况畅通。”

    印奇在发布会上表示,今天的发布会只是”上半场”,阶跃将在未来100天与用户共同打造智能体生态,100天后的发布会上将有更多智能体亮相。这种”100天共创”策略,说明阶跃很清楚——智能体的核心壁垒不在模型参数,而在场景打磨和用户习惯养成。

    七、生态合作:10大App以协议接口接入,而非GUI模拟

    智能体手机的最大悬念一直是:App 愿不愿意给你开放权限?如果不开放,智能体只能通过”模拟屏幕点击”来操作 App——这种方式慢、不可靠、且容易被反爬虫机制拦截。

    阶跃星辰的答案是:协议接口接入。首批生态合作伙伴包括:

    支付宝
    支付能力

    美团
    生活服务

    高德
    导航出行

    滴滴
    出行叫车

    电商购物

    百度
    搜索信息

    携程
    酒店机票

    WPS
    办公文档

    剪映
    视频剪辑

    美图
    图片编辑

    这10个App覆盖了”衣食住行办公创作”六大场景,且都是各自领域的头部应用。更关键的是,它们不是通过 GUI 模拟接入,而是通过协议接口(API)直接开放能力——这意味着智能体的操作速度、稳定性、准确性远超屏幕模拟方案。

    “不是在手机上点按钮,而是直接调用服务的原子能力。”——阶跃星辰终端总裁倪嘉悦

    但生态合作也有隐忧:这10家App的接入深度如何?是全功能开放还是仅限基础能力?用户数据在智能体和App之间如何流转?这些细节在发布会上没有完全披露,需要等STEPX Neo上市后的实际体验来验证。

    八、与竞品对比:Step AOS vs Apple Intelligence vs 豆包手机

    维度 Step AOS Apple Intelligence 豆包手机(字节)
    系统层级 从Android/Linux/RTOS底层重构 iOS原生集成 Android定制层叠加
    智能体调用方式 MCP协议接口(API级别) App Intents框架(App自声明) GUI模拟+部分API
    记忆系统 双域三步(记-理-忆) 设备端Personal Context 对话历史+用户画像
    安全设计 四维:可信/可见/可控/可逆 Private Cloud Compute+端侧处理 沙箱隔离+人工确认
    生态合作 10大App以API接入 App Store生态原生支持 字节系App深度+第三方浅层
    端云协同 Step Edge(端)+Step-2(云)层级联调 本地3B模型+云端GPT-5.6 豆包端侧+云端大模型
    上市时间 2026 Q3 2026年9月(iOS 19) 已上市

    从对比可以看出,Step AOS 在架构深度安全设计上领先,Apple Intelligence 在生态成熟度上碾压,豆包手机在上市节奏上占先。三者的竞争不是零和博弈——它们分别代表了”底层重构派”、”生态融合派”和”快速迭代派”三种不同的AI手机路线。

    九、对开发者和AI工具选型的4条启示

    🎯 给AI工具开发者的4条启示

    1. MCP标准成为智能体互操作的基础设施:Step AOS 选择 MCP 作为原子能力的调用协议,说明 MCP 在国内正成为事实标准。开发者在设计 AI Agent 时,应优先兼容 MCP 协议,确保未来可无缝接入 Step AOS 等智能体操作系统。

    2. “协议接口接入”是AI工具分发的新范式:传统 AI 工具依赖 App Store 分发,用户需要下载安装。但在 Step AOS 的智能体生态中,AI 工具以”原子能力”的形式存在——用户不需要安装,智能体按需调用。这意味着 AI 工具开发者需要重新设计交付形态。

    3. 个人记忆数据成为AI工具的核心差异化壁垒:Step AOS 的双域记忆系统说明,谁掌握用户的个人行为数据,谁就能构建最强的个性化智能体。AI 工具开发者应尽早布局用户数据积累和 RAG 架构,这是未来竞争的护城河。

    4. 安全即架构,不是功能:GPT-5.6误删文件事故 + Step AOS 四维安全体系,共同指向一个结论——AI 工具的安全审计、权限分级、操作回滚必须从 Day 1 设计,不能事后补。正在开发 AI Agent 的团队,建议立即审视自己的权限模型是否有”可逆”能力。

    阶跃星辰 Step AOS 的发布,标志着国内 AI 从”大模型军备赛”正式进入”操作系统争夺战”阶段。如果说大模型是 AI 的”大脑”,那么操作系统就是 AI 的”神经系统”——谁掌握了神经系统的定义权,谁就掌握了 AI 生态的入口。

    WAIC 2026(7/17-20 上海)即将开幕,Step AOS 和 STEPX Neo 将首次公开展示。AI工具导航会持续跟进实机体验和生态进展,帮你建立完整的 AI 工具选型认知地图。

    本文综合自:阶跃星辰7月13日发布会官方资料、36氪智东西报道、财新网报道、华尔街见闻报道。数据截至2026年7月14日15:00。


  • AI智能体手机2026横评:努比亚/阶跃星辰/OpenAI同台竞技,WAIC 2026首聚






    AI智能体手机2026横评:努比亚/阶跃星辰/OpenAI同台竞技,WAIC首聚






    📱
    AI智能体手机 2026 横评
    努比亚 / 阶跃星辰 / OpenAI 同台竞技
    WAIC 2026 倒计时 5 天,谁主沉浮?
    AI
    AI工具导航
    @xcoolevdb · 2026年7月12日

    WAIC 2026(7/17-20 上海)开幕倒计时 5 天,AI 智能体手机赛道骤然升温。努比亚倪飞抛出”原生智能体”四把能力标尺、阶跃星辰联手华勤技术抢先量产、OpenAI 联手苹果筹备 AI 终端——三巨头抢在大会前夜同台亮相。本文从产品定义、技术路线、商业化节奏三个维度深度横评。

    📑 本文目录

    · 一、WAIC 前夜:为什么 AI 智能体手机突然火?

    · 二、努比亚倪飞:原生智能体的”四把能力标尺”

    · 三、阶跃星辰 × 华勤技术:全球首个原生 AI 智能体手机

    · 四、OpenAI × 苹果:当北美巨头遇上 iPhone 生态

    · 五、三巨头核心参数横评表(一张表看懂)

    · 六、技术路线分歧:端侧大模型 vs 云端协同

    · 七、商业化时间表:谁先量产,谁先出局?

    · 八、对国内 AI 工具选型的 4 条启示

    一、WAIC 前夜:为什么 AI 智能体手机突然火?

    2026 年 7 月 12 日,距离世界人工智能大会(WAIC 2026)开幕还有 5 天,但 AI 智能体手机赛道已经提前进入”前哨战”。过去 48 小时内,三条重磅消息密集落地:

    • 努比亚倪飞长文:中兴通讯终端事业部总裁、努比亚总裁倪飞发布署名文章,定义”AI 手机的下半场”——从”功能叠加”走向”原生智能体”,明确努比亚将在 WAIC 2026 首发”全球首款 AI 智能体手机”。
    • 阶跃星辰官宣:“上海 AI 六小虎”之一的阶跃星辰宣布与 A 股头部 ODM 华勤技术深度定制,量产全球首个原生 AI 智能体手机,抢在 OpenAI 同类产品前上市。
    • OpenAI 联姻苹果:OpenAI 与苹果的合作进入”AI 终端”延伸阶段,传闻 iOS 19 将在 WWDC 26 后续推出更深度整合的 AI 智能体能力。

    🎯 行业拐点信号

    如果说 2024-2025 是”大模型军备竞赛”,2026 下半年显然是“AI 终端抢滩登陆战”。手机作为最高频的 AI 入口,已成为中美 AI 巨头的必争之地——这与 2010 年代的移动互联网入口之争如出一辙。

    二、努比亚倪飞:原生智能体的”四把能力标尺”

    倪飞在 7 月 12 日发布的长文中,明确提出”AI 智能体手机”必须跨过四把能力标尺,这也是行业内首次给出”原生智能体”的清晰定义:

    🔊 标尺一:听得懂最自然的表达

    不用刻意迁就话术——用户说什么就是什么,不要求”按指令格式输入”,模型能理解口语化、模糊化、带情感色彩的自然语言。

    ⚡ 标尺二:随时响应,办完交代的事

    响应延迟从”云端往返”压缩到”本地毫秒级”,且能自主拆解多步任务——你说”帮我订明天去上海的高铁,靠窗座”,手机能直接调用 12306 完成支付。

    🧠 标尺三:记得住你的习惯与备忘

    长期记忆 + 个性化建模,无需反复交代——比如你妈妈痛风不能吃海鲜,手机会自动在她生日推荐餐厅时过滤海鲜选项。

    🔐 标尺四:安全作为底层地基

    所有能力建立在完备的隐私防护之上——这是吸取了 7/12 凌晨 GPT-5.6 Sol 版本”误删 Mac 用户主目录文件”事故的教训。AI 能力越强,对系统的破坏力也越大。

    倪飞明确,努比亚 AI 智能体手机将在 WAIC 2026(7/17-20 上海)首次公开展示,定位为”量产旗舰”而非”概念机”,这意味着 7 月底或 8 月初就能在努比亚门店看到真机。

    “不再是用户迁就手机的逻辑,而是手机主动理解人的需求。”——倪飞,中兴通讯终端事业部总裁

    三、阶跃星辰 × 华勤技术:全球首个原生 AI 智能体手机

    阶跃星辰(StepFun)的入场姿态比努比亚更激进——它直接喊出”全球首个落地原生 AI 智能体手机”的口号,时间节点明确在 2026 年 Q3 量产上市。背后的关键支撑来自三方面:

    200亿+
    阶跃星辰累计融资

    10%
    华勤全球智能硬件出货占比

    7 月内
    原生 AI 手机发布时间窗

    6 小虎
    阶跃星辰”上海 AI 六小虎”地位

    与努比亚的差异点:阶跃星辰不依赖硬件自研(不像努比亚背靠中兴),而是走”模型 + ODM 深度定制”路线——这与 SpaceXAI 收购 Cursor 后的”模型厂 + 编程工具”垂直整合有异曲同工之妙。

    • 模型层:阶跃星辰自研 Step-2 万亿参数基座,主打”长程任务规划 + 多模态理解 + 工具调用”三大能力。
    • 硬件层:华勤技术负责整机制造,覆盖全球 10% 智能硬件市场,品控和供应链比白牌厂商稳得多。
    • 生态层:豪威(影像传感器)、中兴(通信)协同布局,形成”大模型 + 整机制造 + 影像 + 通信”全链路生态。

    商业化路径:阶跃星辰已于近期完成股改,全力冲刺港股 IPO。”AI 智能体手机”作为硬件入口,将成为 IPO 估值的核心叙事——这与可灵 AI(快手)30 亿美元融资 + 赴港 IPO 的逻辑一致。

    四、OpenAI × 苹果:当北美巨头遇上 iPhone 生态

    OpenAI 与苹果的合作早已不是新闻(Apple Intelligence 已深度集成 ChatGPT),但”AI 智能体手机”的提法,OpenAI 一直没正式发声。最新动向显示:

    🍎 关键时间表

    1. iOS 19(2026 年 9 月):更深度整合 ChatGPT Agent API,Siri 升级为”主动智能体”,能跨 App 执行多步任务。

    2. GPT-5.6 修复补丁(7/12 已发布):针对 7/12 凌晨曝出的”误删 Mac 用户主目录文件”重大 bug,OpenAI 紧急发布补丁并致歉。

    3. 2026 Q4:OpenAI 自研 AI 硬件(代号”Gumdrop”)进入工程样机阶段,传闻由富士康代工。

    值得注意的是,OpenAI 的核心壁垒在“端云协同”——本地轻量模型(Phi-级别)+ 云端 GPT-5.6 重型模型分工协作。努比亚倪飞提出的”安全作为底层地基”,很大程度上就是在回应 GPT-5.6 这次本地权限失控事故。

    五、三巨头核心参数横评表(一张表看懂)

    维度 努比亚 阶跃星辰 OpenAI × 苹果
    代表机型 努比亚 AI 智能体旗舰(未命名) 阶跃星辰 × 华勤 原生 AI 手机 iPhone 18 Pro(AI Agent 增强版)
    发布时间 2026 年 7/17-20 WAIC 首发 2026 年 Q3 量产上市 2026 年 9 月(iOS 19 同步)
    底层模型 中兴星云大模型 + 通义/混元接入 阶跃 Step-2 万亿参数 GPT-5.6(云端)+ 本地 Phi-mini
    硬件路线 中兴自研整机(ZTE 旗舰工艺) 华勤 ODM 深度定制 苹果 A20 Pro 芯片 + NPU 强化
    核心能力标尺 倪飞”四把标尺”:自然/响应/记忆/安全 长程任务规划 + 多模态 + 工具调用 Apple Intelligence + ChatGPT 深度整合
    商业模式 硬件销售(高端旗舰定价) 硬件 + 订阅服务(Step Agent Pass) 硬件 + Apple One + ChatGPT Plus
    生态优势 中兴通信底层 + 努比亚 UI 沉淀 华勤供应链 + 国产 ODM 联盟 iOS 20 亿设备存量 + App Store 生态

    六、技术路线分歧:端侧大模型 vs 云端协同

    三家公司的根本分歧,其实就藏在”模型跑在哪儿”这个核心问题里:

    📍 努比亚路线:端侧优先

    受 7/12 GPT-5.6 误删文件事故影响,倪飞在”安全”标尺中明确倾向“端侧为主、云端兜底”。这意味着手机 SoC 需配备 30B 以上参数本地模型,对内存和散热要求极高。

    ☁️ 阶跃星辰路线:云端为主、端侧加速

    Step-2 万亿参数完全跑在云端,手机端只做”轻量推理 + 缓存”。这种路线成本低、迭代快,但断网就变砖。

    🔄 OpenAI 路线:端云混合

    本地 Phi-mini 负责”实时响应”,云端 GPT-5.6 负责”复杂任务”。这种路线最成熟,但需要操作系统级别的权限管理(iOS 19 重点突破方向)。

    从产业演进看,2026 年是”端云混合”的过渡年,2027 年才会迎来”端侧为主”的真爆发。努比亚如果想 WAIC 上”全球首发”,必须在散热和内存上做出硬件突破。

    七、商业化时间表:谁先量产,谁先出局?

    AI 智能体手机的胜负手,不在技术而在”量产 + 渠道 + 售后”三道关:

    7/17-20
    WAIC 2026 上海

    9 月
    iPhone 18 Pro 发布

    Q3
    阶跃星辰量产上市

    2027
    “原生智能体”真爆发

    从时间窗口看,阶跃星辰有望抢在 8 月成为首个量产上市的原生 AI 智能体手机,而努比亚在 WAIC 上做”产品发布 + 渠道铺货”,OpenAI × 苹果则要等到 9 月 iPhone 18 Pro 发布会。三家打的是节奏差——先发者拿话题、跟进者拿销量、后发者拿生态。

    “AI 手机不是 PPT,而是真实、可批量、可销售的产品。”——WAIC 2026 智元机器人现场金句(同样适用于 AI 智能体手机)

    八、对国内 AI 工具选型的 4 条启示

    🎯 给 AI 工具开发者的 4 条启示

    1. 端侧推理成必争之地:30B 以下参数模型蒸馏 + 量化(GGUF/EXL2)+ NPU 适配,是 2026 H2 的硬技术栈。

    2. 工具调用标准化:OpenAI Function Call、Anthropic MCP、Google A2A 三大协议之争,国内厂商应至少兼容 1 个,避免被锁死生态。

    3. 记忆 + 个性化:RAG 已成基础设施,下一波差异化在”长期记忆 + 习惯建模 + 主动建议”,对应倪飞标尺三。

    4. 安全即护城河:GPT-5.6 误删文件事故是给全行业的警示——AI 工具的安全审计、权限分级、操作回滚必须从 Day 1 设计,不能事后补。

    WAIC 2026 即将开幕,AI 智能体手机只是开场序曲。接下来 4 天(7/17-20),我们还会看到 300 款 AI 新品全球首发——具身智能、AI 眼镜、AI 陪伴玩具、AI 算力芯片等赛道同步爆发。AI 工具导航会持续跟进每一波新动态,帮你建立完整的 AI 工具选型认知地图。

    本文综合自:IT 之家倪飞署名文章、阶跃星辰官方公告、新华社 WAIC 2026 报道、OpenAI 7/12 紧急补丁说明。数据截至 2026 年 7 月 12 日 15:51。


  • 7月第一周AI五连发:GPT-5.6/全双工GPT-Live/Grok 4.5/270亿iPhone本地/万亿LongCat-2.0,AI工具导航站一文看懂






    7月第一周AI五连发:GPT-5.6/全双工GPT-Live/Grok 4.5/270亿iPhone本地/万亿LongCat-2.0,AI工具导航站一文看懂






    🚀
    7月第一周 AI 五连发
    GPT-5.6 / GPT-Live / Grok 4.5 / PrismML / LongCat-2.0
    AI 工具导航站一文看懂
    AI
    AI工具导航
    @xcoolevdb · 2026年7月10日

    72 小时,5 款重磅 AI 产品/技术密集登场——OpenAI 三档分层、Grok 联手 Cursor、PrismML 把 270 亿参数塞进 iPhone、美团在国产算力上训出万亿模型。AI 工具导航站帮你看清:谁是真创新,谁是炒冷饭。

    📑 本文目录

    · 一、72 小时五连发:一张时间轴看清这一周

    · 二、OpenAI GPT-5.6 三档分层:旗舰 30 美元/百万 Token 的算账逻辑

    · 三、OpenAI GPT-Live-1:1.5 亿周活背后的”全双工”真相

    · 四、SpaceX AI × Cursor 600 亿联姻:Grok 4.5 是嫁妆还是彩礼?

    · 五、PrismML 1-bit 压缩:270 亿参数跑 iPhone 的工程奇迹

    · 六、美团 LongCat-2.0:国产五万卡训万亿,标志拐点已至

    · 七、对国内 AI 工具选型的 5 条启示

    一、72 小时五连发:一张时间轴看清这一周

    如果把 2026 年 7 月 8-10 日这 72 小时单独拎出来,会发现这是 2026 年以来 AI 行业节奏最密的一段——五款来自不同玩家、不同定位的产品/技术密集落地:

    5
    重磅发布/技术

    72h
    发布时间窗口

    5
    参与厂商

    $600亿
    最大单笔交易

    时间(美东) 玩家 产品/事件 核心看点
    7/8 OpenAI GPT-Live-1 / mini 全双工语音,重构 ChatGPT 语音层
    7/8 OpenAI GPT-5.6 Sol/Terra/Luna 三档分层运营,定价 1-30 美元/M Token
    7/8 SpaceX AI × Cursor Grok 4.5 + 600 亿收购 1.5 万亿参数 V9 基础模型,编程深度优化
    7/9 PrismML(加州理工) 270 亿参数 iPhone 本地 1-bit 压缩,模型体积 1/14,内存 -90%
    7/9 美团 LongCat-2.0 1.6 万亿参数,五万卡国产算力训练

    还没完——同期 Meta 宣布 9 月量产自研 AI 芯片 Iris、字节发布兆瓦级 AI Rack 3.0 算力柜、Anthropic 拟在澳洲建 1.4GW 数据中心。7 月这第一周,AI 行业正同时在模型层、硬件层、商业层三个维度加速洗牌。

    二、OpenAI GPT-5.6 三档分层:旗舰 30 美元/百万 Token 的算账逻辑

    7 月 9 日,OpenAI 通过 ChatGPT、Codex 与 OpenAI API 正式向全球开放 GPT-5.6 系列三个版本:

    🚀 GPT-5.6 Sol(旗舰版)

    · 定价:5 美元输入 / 30 美元输出(每百万 Token)

    · 性能:编程测试 Terminal-Bench 2.1 Ultra 模式 91.9%,Agents’ Last Exam 53.6 分(超 Claude Fable 5 达 13.1 个百分点)

    · 上下文:扩展至 150 万 tokens

    · 推理速度:Cerebras 平台 750 Tokens/秒

    ⚖️ GPT-5.6 Terra(均衡版)

    · 定价:2.5 美元输入 / 15 美元输出(每百万 Token)

    · 定位:性能接近 GPT-5.5,成本砍半

    · 适用:日常办公、中等复杂任务的主力档

    ⚡ GPT-5.6 Luna(轻量版)

    · 定价:1 美元输入 / 6 美元输出(每百万 Token)

    · 定位:极速低价,16 分之 1 成本超越 Claude Fable 5

    · 适用:高频调用、低延迟场景

    同步的还有两个动作:微软 Copilot 全量接入 GPT-5.68 月 9 日关停 Atlas 浏览器(去年 10 月才发布的 AI 原生浏览器运营不足一年即终止)。

    💡 AI 工具导航站解读

    这是 OpenAI 从”单一旗舰”走向”分层运营“的关键节点。当 GPT-5.6 Luna 的定价仅为 Claude Fable 5 的 1/16 时,企业用户的算账逻辑被彻底重写:

    · 高频小任务:用 Luna,单次成本压到 0.000001 美元

    · 主力业务流:用 Terra,性能价格比最优

    · 前沿/科研级:用 Sol,关键问题才调用

    这才是”AI 工具”概念的真正落地——按需选档,而不是用一把钥匙开所有门。

    三、OpenAI GPT-Live-1:1.5 亿周活背后的”全双工”真相

    7 月 9 日同期发布的 GPT-Live-1 与 GPT-Live-1 mini,把 ChatGPT 的语音体验做了”全双工”重构:

    🔹 核心机制

      每秒进行多次”说话 / 倾听 / 暂停 / 打断”状态切换
      配套”嗯””对””明白”等轻回应语模拟真人倾听
      语音交互层与推理层解耦——复杂任务后台交给 GPT-5.5,前台维持流畅
      付费用户可切换”即时 / 中等 / 高”三档推理强度

    🔹 用户规模

      每周已有 1.5 亿人使用 ChatGPT 的 Voice 功能
      GPT-Live-1 → ChatGPT Go / Plus / Pro 付费用户
      GPT-Live-1 mini → 免费用户

    🔹 与传统语音助手的关键差异

    传统语音助手是”半双工”——必须等它说完才能继续说,体感僵硬。GPT-Live-1 的”全双工”可以同时输入输出、实时打断,配合轻回应语形成类真人的对话节奏。这是语音 AI 走向”工具→伙伴”的关键工程化突破。

    “AI 正在告别’自定义’时代”——这不是单一技术升级,而是人机语音交互范式的根本改变。

    四、SpaceX AI × Cursor 600 亿联姻:Grok 4.5 是嫁妆还是彩礼?

    7 月 8 日,马斯克在社交平台宣布两件大事:

    🔹 一是 SpaceX AI 正式发布 Grok 4.5

      基于 1.5 万亿参数 V9 基础模型
      数万台英伟达 GB300 GPU 训练,Cursor 真实开发数据回灌
      SWE Bench Pro 64.7%、DeepSWE 1.0 62%
      Harvey 法律智能体基准排名第一
      同任务 Token 消耗仅为 Opus 4.8 的 1/4
      定价:2 美元输入 / 6 美元输出(每百万 Token)

    🔹 二是 SpaceX 拟以 600 亿美元全股票收购 Cursor

    这是 2026 年 AI 编程赛道最大单笔交易。从产品形态看,Cursor 已经不只是一个”代码补全”工具,而是一个专业开发者工作流操作系统——这是 Grok 4.5 选择 Cursor 数据回灌训练的根本原因。

    ⚠️ AI 工具导航站提示

    对国内开发者来说,Cursor 收购案是双刃剑:

    · 短期:Cursor 用户体验可能变贵、变受限(被 SpaceX 生态绑定)

    · 中期:Grok 4.5 的”编程数据回灌“路线会被国内大厂效仿——美团 LongCat-2.0 已经把 “Agentic Coding 深度优化”写进模型目标,腾讯混元 Hy3、阿里通义千问、字节豆包都会跟进

    · 长期:AI 编程工具的”赢家通吃”窗口正在收窄,国产替代的窗口期在 12-18 个月内

    五、PrismML 1-bit 压缩:270 亿参数跑 iPhone 的工程奇迹

    7 月 9 日,加州理工孵化的 AI 初创 PrismML 宣布,把一个 270 亿参数大模型(基于阿里开源的 Qwen 3.6)压缩到在 iPhone 17 Pro 上原生运行。这个事件被 The Information 称为”设备端 AI 的分水岭”。

    🔹 核心技术:原生 1-bit 压缩

      权重仅用 {-1, +1} 表示
      模型体积压缩至全精度版本的 1/14
      内存占用降低 90%+
      推理速度最高提升 8 倍
      能耗降低 75%-80%

    🔹 商业进展

    苹果已与 PrismML 接洽,探讨在 Apple Intelligence 中落地的方案。如果合作达成,将是苹果在设备端 AI 赛道补上的最关键拼图——之前 Apple Intelligence 主要依赖云端 Private Cloud Compute,端侧模型规模一直受限。

    💡 行业拐点

    “算力在哪里,模型就在哪里”——这条铁律正在被 1-bit 压缩技术改写。

    过去三年,行业共识是”大模型必须依赖云端 GPU 集群”。PrismML 的 1-bit 方案第一次证明:

    · 1B-3B 参数级别:手机可原生运行,无需联网

    · 10B-30B 参数级别:1-bit 压缩后,iPhone 17 Pro 也能跑

    · 70B+ 参数级别:仍需云端,但推理成本可大幅下降

    这与同期美团 LongCat-2.0 走”五万卡集群训万亿“的路线形成有趣对照——一个往端侧压,一个往云端拉,但都指向同一个方向:让 AI 跑得更快、更便宜、更无处不在

    六、美团 LongCat-2.0:国产五万卡训万亿,标志拐点已至

    7 月 9 日,美团技术团队发布 LongCat-2.0 模型——业界首个在五万卡国产算力集群上完成全流程训练与推理的万亿参数模型

    🔹 模型规格

      总参数 1.6 万亿,动态激活 330 亿至 560 亿(MoE 架构)
      原生支持 100 万 Token超长上下文
      聚焦 Agentic Coding 深度优化

    🔹 训练与开放

      全部使用五万卡国产算力集群(昇腾/海光/天数等)
      模型全面开源,同步开放国产卡推理代码
      提供 BF16 / FP8 / INT8 多精度版本,覆盖不同算力平台

    🔹 行业意义

    这不是一个普通的开源大模型发布——它证明了两件事:

      国产算力已具备支撑世界级大模型全流程训练的能力——在英伟达 GPU 出口管制的当下,这是产业安全的根基
      大厂不再只卷参数,开始卷”工程化”——MoE 动态激活 + 多精度版本 + 国产推理代码全套交付,比单纯秀万亿参数更有商业价值
    “2026 年的胜负手不在参数,而在’垂直模型 + Agent 框架 + 工程化部署’的组合。”——AI 工具导航站编辑

    七、对国内 AI 工具选型的 5 条启示

    启示一:按需选档,别再用”一把钥匙”

    OpenAI 三档分层定价后,国内企业也该反思:不是所有任务都该用旗舰模型。高频小任务用 Luna 级(国产对应模型如 Qwen-Lite / DeepSeek-V4-Flash),主力业务用 Terra 级(Qwen-Plus / DeepSeek-V4),关键决策才用 Sol 级(旗舰满血版)。

    启示二:全双工语音是 2026 下半年必追的工程化方向

    1.5 亿周活证明 ChatGPT 语音已成主流入口。国内做智能助手、AI 客服、车载 AI 的团队必须跟进全双工架构——否则会像 2024 年还在做”文字版 ChatPDF”的团队一样,错失下一代用户习惯。

    启示三:编程工具的”赢家通吃”窗口只剩 12-18 个月

    Cursor 被 600 亿收购后,AI 编程赛道的整合会加速。国产 Cursor 替代品(Trae / CodeBuddy / 通义灵码 / 文心快码)必须在这 12-18 个月内建立真实开发者数据壁垒,否则会被生态绑架。

    启示四:1-bit 压缩是设备端 AI 的胜负手

    PrismML 的 1-bit 方案不是”实验室 Demo”,而是苹果准备落地的产品级技术。国内端侧 AI 团队(vivo/OPPO/小米/荣耀)应该立即跟进——这是 AI 手机、AI PC、AI 眼镜 三大赛道共同的胜负手。

    启示五:国产算力 + 万亿模型是国运级机会

    美团 LongCat-2.0 第一次在五万卡国产集群上训出万亿模型——这与同期 Meta 自研 Iris 芯片 9 月量产、字节发布兆瓦级 AI Rack 3.0 算力柜一起,构成了”算力国产化 + 模型自主化 + 工程开源化“的三位一体战略。

    下周 WAIC 2026(7/17-20)开幕,华为 Atlas 950 超节点真机首展、阶跃 Agent 操作系统发布、全球首款 AI 智能体手机亮相——可以预见,国内 AI 工具赛道会迎来又一轮密集催化。AI 工具导航站(cn.xcoolevdb.site)会持续跟进,第一时间给到深度横评。

    📌 写在最后

    2026 年 7 月的第一周,会被记入 AI 行业的”五连发周“——

    · GPT-5.6 证明:旗舰不必唯一,分层才是商业真相

    · GPT-Live-1 证明:全双工语音是下一代人机交互的工程化基础

    · Grok 4.5 证明:编程工具与基础模型的”数据回灌”是新的护城河

    · PrismML 1-bit 证明:设备端 AI 的”算力在哪里”铁律已被改写

    · LongCat-2.0 证明:国产算力 + 万亿模型已经站住脚

    这 5 件事看似独立,实际指向同一个结论——AI 正在从”参数军备”走向”工程化落地”,从”云端独占”走向”端云协同”,从”通用对话”走向”垂直任务”。

    而对国内 AI 工具导航站来说,这意味着我们的内容选题也要从”谁参数大“转向”谁用得起、用得好、用得稳“。下半年,我们也会持续跟进这些新模型的实测对比。

    本文由 xcoolevdb 智能写作整理自 36 氪、新智元、IT 之家、华尔街见闻、证券时报、第一财经、钛媒体、虎嗅、雷锋网、The Information、TechCrunch 等公开报道(2026 年 7 月 8-10 日)。观点仅供参考,欢迎留言讨论。