博客

  • 开源大模型开始谈分成:Kimi K3与Qwen3.8-Max许可证深度拆解,免费午餐时代终结






    开源大模型开始谈分成:Kimi K3与Qwen3.8-Max许可证深度拆解,免费午餐时代终结






    📜
    开源大模型开始”谈分成”了
    Kimi K3 License · Qwen3.8-Max License · 2000万美元门槛 · 最高30%分成 · 免费增值时代
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月19日

    开源大模型开始谈分成:Kimi K3与Qwen3.8-Max许可证深度拆解,免费午餐时代终结

    在开源世界,最动听的一句话曾经是:”你尽管下载,不用付钱。”但2026年这个夏天,这句话正在被改写——”你可以下载,但当你把它包装成商业服务、收入达到一定规模时,需要回来协商分成。”7月底月之暗面随Kimi K3权重发布的定制License,和8月中旬阿里Qwen3.8-Max跟进的商用条款,正在给”开源=永久免费”的旧范式画上句号。

    📋 本文目录

    一、事件速览:两张License改写开源规则

    二、逐条拆解:Kimi K3 License的三个关键条款

    三、逐条拆解:Qwen3.8-Max License的四道门槛

    四、横向对比:K3、Qwen3.8-Max与MIT阵营

    五、谁被”点名”:MaaS厂商与AI编程助手的生死线

    六、为什么是现在:涨价潮与三重结构性推动

    七、佐证与先例:DigitalOcean们已经签字了

    八、Meta的镜像:同一周,另一条开源路线

    九、开发者实操指南:三件事尽早厘清

    十、结语:从礼物经济到免费增值经济

    一、事件速览:两张License改写开源规则

    先把时间线拉直。2026年7月16日深夜,月之暗面发布Kimi K3——2.8万亿参数,全球最大的开源权重模型。7月27日晚,完整权重上传至Hugging Face(仓库moonshotai/Kimi-K3),同步发布的还有一份定制化的”Kimi K3 License”,放弃了此前K2时代接近MIT的宽松许可。

    十几天后的8月12日,阿里兑现开源承诺:Qwen3.8-Max的底座权重以Qwen3.8-2.4T-A95B之名发布,这是通义千问Max级旗舰模型首次开放权重。但Qwen家族延续多年的Apache 2.0不见了,取而代之的是一份专有的Qwen3.8-Max License,同样埋着商业条款。

    据钛媒体8月19日报道,两张License的直接后果是:开源大模型”免费下载+永久免费使用”的旧范式正在接近终结,开源不再等于免费,而是”免费增值(freemium)”。

    ⚡ 关键信息速览

    · Kimi K3:2.8万亿参数,7/27权重开放,权重包约1.56TB

    · Qwen3.8-Max:2.4万亿参数(激活95B),8/12权重开放,BF16版约4.89TB

    · 共同设计:纯内部使用豁免;MaaS业务收入超阈值须另行签协议

    · 阈值差异:K3定在2000万美元/12个月,Qwen抬到5000万美元/12个月

    · 据路透社援引知情人士:部分合作分成比例最高可达30%

    · 对照组:DeepSeek V4、GLM-5.2目前仍是标准MIT许可

    二、逐条拆解:Kimi K3 License的三个关键条款

    Kimi K3的许可证并非标准开源协议,业内也因此更倾向称之为”开放权重”而非严格意义的”开源”。把条款摊开看,核心有三条:

    条款一:MaaS收入门槛

    如果被许可方经营MaaS业务——即把模型推理或微调能力作为服务提供给第三方——且自身及关联方连续12个月总收入超过2000万美元,商业使用前需要与月之暗面另行签署商业协议。许可证本身没有写明固定分成比例,但路透社援引匿名信源称,实际谈判中月之暗面要求的收入分成最高可达30%

    条款二:大规模署名要求

    商业产品月活超过1亿,或月收入超过2000万美元,必须在界面显著位置标注”Kimi K3″字样。这是品牌露出要求,不是付费要求——但意味着你的产品首页要给模型厂商打广告。

    条款三:豁免边界

    仅把模型嵌入具体功能的终端产品,不当然被视为MaaS;纯内部使用、通过官方产品或认证推理伙伴调用,可以豁免。换句话说,条款的重点不是向所有开发者收费,而是保留长尾生态,同时截住最容易绕开官方API的商业渠道——第三方推理平台和模型服务商。

    值得注意的细节是:营收门槛按被许可方及其关联方的合计营收计算,不只看这款产品本身赚多少钱。母公司体量达标,子公司同样会被拉进商业协议的范畴。我们此前在《Kimi K3全栈开源首日》一文中关注的是权重落地与国产算力Day0适配,这次License条款的变化,是同一事件里商业层面的下半场。

    三、逐条拆解:Qwen3.8-Max License的四道门槛

    阿里这张License结构上是”MIT风格+附加条款”,据DataLearner模型卡信息和36氪报道,可以拆成四条:

    第1条:版权声明(NOTICE)

    在所有副本或实质部分保留版权声明和许可声明。标准条款,对所有人适用,零成本。

    第2条:规模署名

    商业产品或服务月活超过1亿,或月收入超过2000万美元,须在用户界面显著位置展示模型名称。

    第3条:商用授权门槛(要花钱的那条)

    如果企业及关联方从事MaaS或AI Work Assistant业务(涵盖AI编程助手、办公软件等,单一用途工具与垂直领域助手除外),且连续12个月合计收入超过5000万美元,商业使用前须另行取得Qwen许可。

    第4条:内部使用豁免

    不对第三方开放的纯内部使用不受上述约束——前提是模型、输出或底层能力不暴露给外部。

    🔍 容易被忽略的细节:同场发布,两种许可

    同一次开源公告里,Qwen3.8-27B(270亿参数稠密模型)走的仍然是宽松的Apache 2.0,官方口径还特别强调它量化后可在消费级显卡上流畅运行、有望成为本地部署主力;而2.4T旗舰用的是定制License。

    阿里实际上做了一次”分层开源”:小模型放生态,大模型留商业口子。

    另一个技术细节值得部署团队注意:开源权重版与API版并不完全等同。官方模型卡说明,API版Qwen3.8-Max额外提供视觉输入、非思考模式、默认1M上下文和官方内置工具;而开源的Qwen3.8-2.4T-A95B是纯文本模型、强制思考模式、原生上下文262,144 tokens。你在云端API测到的能力,下载权重自建服务并不能直接复现。

    四、横向对比:K3、Qwen3.8-Max与MIT阵营

    把三家的许可策略并排看,格局一目了然:

    维度 Kimi K3 Qwen3.8-Max DeepSeek V4 / GLM-5.2
    许可类型 定制K3 License 定制Max License 标准MIT
    MaaS收入门槛 2000万美元/12个月 5000万美元/12个月
    额外触发场景 MaaS(推理/微调服务) MaaS + AI编程/办公助手
    署名要求 月活1亿或月收2000万美元 月活1亿或月收2000万美元
    内部使用豁免
    衍生模型约束 继承原始许可 继承原始许可 宽松

    一个明显的分野:Qwen把”AI Work Assistant”单列为触发条件,瞄准的正是当下商业化最成熟、最赚钱的场景——AI编程助手和办公助手,也是”把模型能力包装成产品卖出去”的最高频形态。用钛媒体的话说:谁最有可能从开源模型上获得规模化收入,条款就瞄准谁。

    五、谁被”点名”:MaaS厂商与AI编程助手的生死线

    这套设计的实际效果是:对95%以上的开发者和中小团队,条款几乎是透明、无感的;但对云厂商、模型聚合平台和头部Agent创业公司这些真正的”大鱼”,免费午餐结束了。

    结合我们此前对《Qwen3.8-Max发布与千问办公实测》和《DeepSeek Harness万物皆插件框架》的追踪,2026年大模型的应用主战场恰恰是编程Agent和办公智能体——而这两张License精准卡在了这条赛道的商业化咽喉上。

    行业背景数据也支撑这一点:8月首周,全球最大模型调用平台OpenRouter上排名前10的模型有6个来自中国,DeepSeek V4 Flash单周处理8.2万亿tokens;a16z合伙人向《经济学人》透露,前来融资的硅谷AI初创公司中使用中国开源模型的比例可能高达80%。当中国开源权重成为全球AI创业的事实底座,模型厂商自然要重新考虑”为他人做嫁衣”的问题。

    六、为什么是现在:涨价潮与三重结构性推动

    开源走向”收费化”不是心血来潮,有三股结构性力量在同时推动。

    第一,成本结构变了

    2万亿参数以上的模型,训练成本动辄数十亿元,推理同样需要庞大算力集群。Kimi K3的权重包1.56TB,官方建议64卡以上的超节点部署;Qwen3.8-Max的BF16开放版约4.89TB、拆成213个safetensors分片。当开源模型的部署门槛高到只有头部玩家才能承担,”为他人做嫁衣”的商业逻辑自然难以为继。AI行业评论员田丰的点评一针见血:

    “开源是权重免费,算力、部署工程、持续迭代与合规责任全部不免费。开源真正改变的是价格锚,不是成本结构。”

    第二,变现路径变了

    摩根士丹利8月9日研报指出,中国大模型的授权模式正从宽松的Apache/MIT(L1级)向更严格的定制商业许可(L2/L3级)迁移;变现从第一方API直销(1P),扩展至与云服务商、模型聚合平台的收入分成(3P)。Kimi K3和Qwen3.8-Max,就是这个判断最先落地的两个注脚。

    第三,定价周期反转了

    8月17日零时,DeepSeek API新价格正式生效:旗舰模型V4-Pro高峰时段输出价格从6元涨至27元/百万tokens,涨幅350%;缓存命中输入价格从0.025元涨至0.3元,涨幅1100%(12倍)。峰时为工作日9:00-12:00、14:00-18:00,闲时价格为高峰的一半——我们在《DeepSeek V4峰谷计价解析》里详细拆过这套机制,当时还是”错峰更便宜”的促销逻辑,如今变成了全面的定价上修。

    DeepSeek不是孤例。据南风窗等媒体报道:Kimi K3开启最高算力档位时API输出价格上调至100元/百万词元(上一代K2.6为22.4元);智谱年内三次上调价格,GLM-5的API平均涨幅达83%;腾讯云混元2.0部分接口涨幅高达463%。大摩统计,中国大模型平均API输出价格已从2025年一季度的约12.2元/百万Token,回升至2026年二季度的21.9元/百万Token,涨幅约80%。竞争主轴正从”拼价格”切换到”拼智能”。

    厂商/模型 调价动作 幅度
    DeepSeek V4-Pro 高峰输出 6→27元/百万tokens +350%
    DeepSeek V4-Pro 缓存命中输入 0.025→0.3元 +1100%
    Kimi K3(最高档) 输出 22.4→100元/百万词元 约3.5倍
    智谱 GLM-5 年内三次上调,API平均涨幅 +83%
    腾讯混元2.0 部分接口涨幅最高 +463%
    行业平均 输出价格 12.2→21.9元/百万Token(2025Q1→2026Q2) +80%

    普通用户不必恐慌:DeepSeek官方明确,网页版和App日常聊天使用仍全程免费,此次调价仅面向API开发者。但对企业级使用者,”开源权重+低价API”的双重红利确实在同步收窄。

    七、佐证与先例:DigitalOcean们已经签字了

    30%的分成比例没有写进任何公开许可文本,但分成协议本身的存在已有实锤:

  • 美国云计算公司DigitalOcean已确认与月之暗面签署商业协议,但拒绝透露具体条款。其CEO帕迪·斯里尼瓦桑把这套模式称为”经过市场检验的开源’免费增值’模式”;
  • 中软国际7月20日的监管申报文件披露了一份”Token收入分成及联合创新合作协议”,约定按比例分成,但比例未公开;
  • 路透社8月10日曾提前报道阿里计划为Qwen下一代开源旗舰引入类似机制,8月12日权重落地时License条款如约出现。
  • 基础模型免费下载,深度合作、优化部署、抢先拿到下一版模型,都是付费项——这套在SaaS行业成熟运转多年的freemium逻辑,正式被移植到了大模型开源生态。大摩的报告还提到杰文斯悖论:更便宜高效的开源模型催生更大的总需求,63%的受访企业同时使用开源和闭源模型,二者并非替代关系;变现路径扩展到与云厂商收入分成后,可寻址收入池反而扩大了。

    八、Meta的镜像:同一周,另一条开源路线

    几乎同一时间,大洋彼岸传出了看似相反的信号。8月10日,扎克伯格发布万字长文《The Future is for Everyone》,宣布Meta重回开源路线:发布300亿参数的MuseGlimmer(Apache 2.0),并承诺未来数周开放更强的Muse Spark 1.2权重,以激烈措辞批评闭源阵营。

    但耐人寻味的是,同一篇宣言里,扎克伯格同步宣布建立新的治理结构,赋予独立董事会批准模型发布安全标准的权力——开源与否、何时开源、开放到哪一版,从此不再是创始人一念之间的事。

    一边是月之暗面和阿里在License里写下收入阈值,一边是Meta为开源设立前置安全审查,形式不同,内核一致:开源正在被重新定义为一种战略工具。开放什么、对谁开放、开放到什么程度,都取决于策略考量。当开源从”信仰”变成”筹码”,参与者们不约而同地开始给”免费”装上计价器。

    九、开发者实操指南:三件事尽早厘清

    对绝大多数团队而言,这套新规则的实际影响远小于舆论的喧嚣——2000万美元的门槛对普通开发者是”遥不可及”的数字。多数情况下可以继续免费使用,但有三件事需要尽早厘清:

    第一,License是版本依赖的,不是一次性的

    以Qwen为例:Qwen3.5、3.6开放(Apache 2.0),3.7闭源,3.8开放但加了条件——每一个版本的”法律属性”都不同。如果产品栈深度绑定某个特定版本,法务部门应该和工程部门一起,维护一张”模型许可证清单”。

    第二,衍生模型继承条款

    基于Kimi K3或Qwen3.8-Max微调出的模型,同样受原始许可证约束。团队需要文档化”哪个产品用了哪个权重”,避免在融资尽调或商业谈判中暴露合规风险。营收口径尤其要小心:门槛按被许可方及关联方合计营收计算,母公司体量达标,子公司同样触发。

    第三,选型天平正在改变

    旗舰档里,Kimi K3与Qwen3.8-Max选择了定制许可;而DeepSeek V4和GLM-5.2(详见我们此前的《GLM-5.3后训练解析》)仍然是标准MIT许可,零收入触发、零署名强制。对成本敏感、对合规确定性要求高的平台型公司,即使旗舰模型能力略逊一筹,MIT许可的确定性本身就有价值。能力与自由度的权衡,需要被写进每一次技术选型的决策表。

    十、结语:从礼物经济到免费增值经济

    “免费午餐”终结了,但开源没有死。它只是从一种近乎公益的”礼物经济”,演进为一种边界清晰的”免费增值经济”——基础能力免费,规模化的商业价值明码标价。

    Kimi K3与Qwen3.8-Max把可持续性问题摆到了开源的台面上,这未必是坏事。免费且无责任的权重,与收费但可持续的研发,本就难以长期共存。当开源模型开始向贡献者回流收入,生态才能真正运转起来:开发者有可用的工具,厂商有持续投入的动力,整个链条上下游都能获得各自的回报。

    对于中国大模型行业,这个夏天的信号已经足够清晰:免费的窗口正在收窄,开源也终于开始面对商业现实。而对开发者的启示同样简单——权重还能下载,代码还能微调,但在你把模型做成生意之前,先读一遍License。


  • DeepSeek Harness开源深度解析:万物皆插件Agent框架,3天10万Star,Claude Code迎来最强开源平替






    DeepSeek Harness开源深度解析:万物皆插件Agent框架,3天10万Star,Claude Code迎来最强开源平替






    🧩
    DeepSeek Harness 来了
    万物皆插件 · MIT 完全开源 · 3 天 10 万 Star · 4300+ 插件生态
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月17日

    DeepSeek Harness开源深度解析:万物皆插件Agent框架,3天10万Star,Claude Code迎来最强开源平替

    8月13日晚,DeepSeek 正式开源 Agent 框架 Harness v0.1 开发者预览版。一句”Everything is a Plugin(万物皆插件)”,3天收割10万GitHub Star、4300个第三方插件——这次DeepSeek瞄准的不是又一个聊天模型,而是Claude Code身下的那把椅子。

    📋 本文目录

    一、事件速览:一个框架,72小时点燃开源圈

    二、什么是Harness:Model + Harness = Agent

    三、架构拆解:Cordis微内核与”一切皆插件”

    四、四种运行模式:从极简到创造

    五、三家对比:Harness vs Claude Code vs Codex

    六、生态爆发:4300个插件都在干什么

    七、上手指南:10分钟装好你的第一个DSH

    八、冷静提示:v0.1的坑与正确姿势

    九、结语:从”卖API”到”卖车架”

    一、事件速览:一个框架,72小时点燃开源圈

    先看时间线。据IT之家、36氪等多家媒体报道,npm 包 @deepseek-ai/dsh 早在8月10日就已悄然首发,此后四天内连发七个版本;8月11日”DeepSeek Harness 团队”微信公众号完成注册;直到8月13日晚,v0.1 开发者预览版正式面向全球开发者开放,GitHub 仓库 deepseek-ai/deepseek-harness 同日公开,采用 MIT 协议完全开源——无商业使用限制、无版权捆绑、无闭源模块。

    热度数据可以用”离谱”形容:

  • 发布当晚,GitHub Star 不到 2 小时破万,12 小时突破 5 万;
  • 上线 72 小时(3 天),Star 突破 10 万,截至8月17日官方仓库已达 11 万+
  • 36氪发布当晚实测,dsh-plugin 标签下的社区插件仓库已有 288 个
  • 据人人都是产品经理统计,发布 3 天第三方插件突破 4300 个,增速峰值达每小时 99 个;
  • 社区目录 Oh-My-DSH 已收录精选插件 1117 个、监测生态仓库 1521 个,累计 Star 超 30 万。
  • ⚡ 关键信息速览

    · 发布时间:2026年8月13日晚(npm 包 8/10 首发)

    · 版本:v0.1 开发者预览版,MIT 协议完全开源

    · 仓库:github.com/deepseek-ai/deepseek-harness(11万+ Star)

    · CLI 工具:dsh,支持四种运行模式

    · 代码规模:230+ workspace 成员,默认内置 100+ 可单独开关的插件

    · 模型支持:40+ 供应商,模型无关设计

    多家科技媒体将这次发布解读为对 Anthropic Claude Code 与 OpenAI Codex 的正面回应。而 DeepSeek 官方此前在招聘信息中就给出过那个著名公式:Model + Harness = Agent。这次,他们把等式右边那个”Harness”直接开源了。

    二、什么是Harness:Model + Harness = Agent

    很多读者的第一反应是:Harness 是什么?字面意思是”马具/缰绳”。在 AI 工程语境里,它指的是把大模型”接”进真实世界的那一层——读写文件、调用工具、执行命令、控制权限、决定重试还是中止,都是它的活。你可以把它理解成 AI 的”操作系统外壳”。

    “Model 负责想,Harness 负责做。模型是发动机,Harness 是车架子——过去厂商卖你一辆焊死的成品车,座椅方向盘全动不了;DeepSeek 这次卖的是乐高底盘。” —— 综合自阿里云开发者社区、CSDN 技术解读

    为什么这一层突然重要了?因为过去两年,市面上冒出了几十个 Agent 框架——LangChain、AutoGen、CrewAI、MetaGPT……每个都号称”通用”,但真正用起来会发现:要么绑死了某个模型 API,要么把工具调用、记忆管理、沙箱执行硬编码进核心逻辑。你想换个模型?改源码。想换种存储方式?改源码。想把单 Agent 改成多 Agent 协作?还是改源码。

    据aitop100等社区评论,这根本不是”框架”,这是”半成品”。而 Claude Code 和 Codex 走的是另一条极端路线:能力封装得极好、开箱即用,但模型怎么被驱动、工具怎么被调度,对用户完全是个黑盒,而且只能用官方绑定的模型。DeepSeek Harness 给出的答案是第三条路:把”配置”本身当作一等公民,所有能力可插拔。

    三、架构拆解:Cordis微内核与”一切皆插件”

    “一切皆插件”这句话的真意,是框架里没有特权组件。这不是营销口号,而是架构事实。

    DeepSeek Harness 底层用的是 Cordis 插件元框架——一个只负责插件加载、卸载和依赖管理的微内核,来自国内老牌 QQ 机器人框架 Koishi 生态(作者 Shigma),已经在生产环境稳定跑了四年。Cordis 本身不承载任何业务功能,就像乐高的底座板——只提供插口,不规定你必须拼出什么。

    在 DeepSeek Harness 里,这些全部都是插件,谁都不比谁高贵,谁都可以被换掉:

    能力维度 传统框架 DeepSeek Harness
    模型接入 绑定官方 API 模型插件,40+ 供应商随便换
    工具调用 硬编码核心逻辑 工具插件,独立增删
    会话存储 固定方案 存储插件,按需替换
    沙箱环境 不可定制 沙箱插件,可换实现
    Agent 循环 改源码才能动 循环本身也是插件
    UI 界面 官方焊死 UI 插件,甚至能换皮肤

    两个值得展开的技术细节:

  • 可逆副作用(Reversible Effects):每个插件注册时产生的所有副作用都会被追踪,卸载时自动回收,不留垃圾、不漏内存。翻译成使用体验就是热插拔——装插件、卸插件、换整套 UI,都不用重启,系统跑着跑着就把自己的一部分换掉了。
  • 连 DeepSeek 自家模型都没有特权:它也只是又一个插件。你想换成 Kimi、GLM、Qwen 或任何 OpenAI 兼容端点,跟换个主题皮肤是同一个操作。对比 Claude Code——用哪个模型、有什么能力,全是 Anthropic 定的,用户碰都碰不到。
  • 这种设计在软件工程里有个经典名字:微内核架构(Microkernel Architecture)。Eclipse IDE、VS Code、Android 系统都是这个路子。DeepSeek 把它搬到了 Agent 领域,数字也相当直观:官方默认部署里有一百多个可单独开关的插件,仓库包含 230+ 个 workspace 成员(core、llm、shell、terminal、fs、lsp、web、skill、subagent、workflow 等)。

    四、四种运行模式:从极简到创造

    DeepSeek Harness 提供 dsh 命令行工具,核心命令 dsh –profile 针对不同场景加载不同插件集合,共四种模式:

    模式 能力组合 适合场景
    标准模式 完整编程 Agent:编辑文件、执行 shell、搜索网页 日常开发主力
    PTC 模式 标准能力 + 程序化工具调用(模型生成 TypeScript 代码组合多轮调用) 复杂任务编排
    极简模式 仅保留 Bash + 字符串替换编辑器两个工具 最小环境基准测试
    创造模式 运行期动态挂载/移除插件,可在内存中试验 Cordis 插件 魔改与插件开发

    其中 PTC(Programmatic Tool Calling)模式值得一提:传统工具调用是模型一次调一个工具、等结果、再调下一个;PTC 让模型直接生成一段 TypeScript 代码,把多轮工具调用”编排”成一个程序一次跑完——这对批量文件操作、多步骤验证类任务的效率提升是数量级的。

    另外两个在闭源产品里看不到的能力:对话状态完整保存、可重播,也能从任意步骤分岔。Agent 的能力配置完全透明——对团队来说,这意味着 Agent 的行为可以被审计、被复现,而不只是一个黑盒。

    五、三家对比:Harness vs Claude Code vs Codex

    DeepSeek Harness(v0.1,2026年8月13日发布)是继 Codex 和 Claude Code 之后,第三款由大模型原厂推出的 AI 编程 Agent Harness。三款工具共同指向同一件事——”Model + Harness = Agent”,但底层设计哲学截然不同:

    维度 DeepSeek Harness Claude Code OpenAI Codex
    开源属性 MIT 完全开源 商业闭源 CLI 核心闭源
    模型绑定 无关,40+ 供应商 强绑定 Claude 系列 强绑定 GPT 系列
    核心架构 Cordis 微内核 + 一切皆插件 闭环开箱即用 IDE 插件 + 云端集成
    扩展能力 极高,UI/调度/工具全可换 较低,仅 Tools/Hooks 中等,依赖 VS Code 机制
    状态追溯 原生日志可回放/分岔 内部压缩策略 IDE 会话面板
    私有部署 支持,完全本地化 不支持 不支持
    沙箱安全 沙箱本身可换插件 权限二次确认 内核级 Seatbelt 沙箱

    三家的路线差异一句话说清:

  • Claude Code 走”产品极致化”路线:针对 Claude 模型深度调优终端交互、Diff 预览、权限确认与上下文压缩,目标是做”最强 CLI 工具”,26 个生命周期钩子满足企业级治理;
  • Codex 走”安全边界”路线:内核级 Seatbelt 沙箱、最多 6 条并行线程,2026年7月已并入 ChatGPT 桌面端,适合对安全边界要求最高的场景;
  • DeepSeek Harness 走”基础设施开源化”路线:它不只是一个产品,更是一个开发框架——企业可以在 dsh 之上构建适合自己业务规则的 Code Agent,不需要从零造轮子,也不被任何一家模型厂商绑死。
  • 成本账也很关键。据社区实测口径,配 V4-Flash 模型跑单任务成本约 0.2 元,而 Claude Code 订阅起步 20 美元/月。顺带一提,DeepSeek V4 系列 API 已于8月17日起启用峰谷计价,我们此前在《DeepSeek V4正式商用上线:峰谷计费如何帮开发者砍掉一半API账单》中有详细测算,配合 Harness 使用可以把 Agent 成本再压一档。

    六、生态爆发:4300个插件都在干什么

    如果说 Star 数反映的是关注度,那插件数反映的是真金白银的开发者投入。发布 3 天 4300 个第三方插件、增速峰值每小时 99 个——我们综合社区目录与多篇评测,把生态大致分成五类:

    1. UI 增强类(最刚需)

    默认的 dsh web 就是一个纯聊天框——没有文件树、没有终端、没有 Git 面板、没有任务看板,”毛坯房”本房。所以 dsh-web-ui 几乎成了装机必备:任务看板、Git 图表、右侧面板、远程移动端 UI、实时 Token 统计、甚至桌面宠物一应俱全。还有 Claude Code 风格的全屏 TUI(dsh-tianshu-tui),带像素鲸鱼顶栏和上下文进度条。

    2. 视觉能力类(最巧妙)

    纯文本模型看不了图?社区用插件解决了:dsh-vision-toolkit 给纯文本模型加一双”眼睛”,支持带意图的图片问答、长截图 OCR、UI 还原、GUI 自动化;ModLens 则把截图、文档、UI 图处理成结构化 JSON 证据(OCR 文本、布局、语义),桥接纯文本 LLM 的视觉鸿沟。

    3. 多 Agent 协作类(最前沿)

    dsh-agent-teams 实现多 Agent 协作,dsh-plan-execute 用双模型架构分离规划与执行,dsh-context-doctor 做上下文审计。DeepSeek 官方也预告了记忆压缩、自适应上下文等方向——这些正是 Agent 长程任务的命门。

    4. 搜索与内容发现类

    覆盖中英文/学术/代码/购物/金融的多语言搜索插件,以及支持 B站、小红书、抖音、YouTube、X、知乎、Reddit、微博等平台的跨平台 AI 内容发现 Agent。

    5. 生态基础设施类

    Awesome DSH Plugins 目录(中英双语、每日兼容性追踪)、Claude Managed Agents API 的开源实现、本地优先的桌面 Agent 应用等。有开发者直言:”一千多个插件,总有一款适合你”——这背后是”一切皆插件”架构给出的确定性:任何能力缺口,都可以用插件补上,而不需要等官方。

    💡 一个观察

    插件生态的爆发速度本身就是架构的试金石。Claude Code 的 Skills 体系是官方审批制的”精品店”,DSH 的插件是自由市场的”菜市场”——前者质量可控、上限受限,后者泥沙俱下、长尾无限。4300 个插件里必然有大量蹭标签的低质量仓库(人人都是产品经理的扒取统计也证实了这一点),但自由市场的网络效应一旦形成,护城河比任何官方规划都深。这正是 VS Code 战胜 Atom 的剧本。

    七、上手指南:10分钟装好你的第一个DSH

    第一步:安装

    npm install -g @deepseek-ai/dsh
    # 或免安装直接体验
    npx @deepseek-ai/dsh

    第二步:选择运行模式

    dsh –profile standard # 标准模式:完整编程Agent
    dsh –profile ptc # PTC模式:程序化工具调用
    dsh –profile minimal # 极简模式:仅bash+编辑器
    dsh –profile creative # 创造模式:运行时魔改插件

    第三步:装插件(从”毛坯”到”精装”)

    dsh plugin –profile web add @linxin666/dsh-web-ui-all
    # GitHub 搜索 dsh-plugin 话题发现更多插件
    # 社区目录:awesome-deepseek-harness / Oh-My-DSH

    第四步:换模型(想用什么换什么)

    在配置中替换模型插件即可切换到 Anthropic、OpenAI、Kimi、GLM、Qwen 或任意 OpenAI 兼容端点——DeepSeek 官方明确支持 40+ 模型供应商。官方推荐搭配自然是 V4 系列:V4-Flash 求性价比,V4-Pro 求能力上限,8月17日起还有峰谷计价加成。

    新手路线建议:

    先装 dsh-web-ui 和文件管理类基础插件把”毛坯房”变成”能住”;再根据使用习惯选一个交互方式(TUI 或桌面 App);遇到具体需求(看图、多 Agent 协作)时再去 GitHub 搜 dsh-plugin 话题按需加装。不要一上来就装几十个插件——插件之间可能存在架构冲突。

    八、冷静提示:v0.1的坑与正确姿势

    官方自己把话说得很清楚:v0.1 是开发者预览版。综合 CSDN 评测与社区反馈,上手前这几条务必记住:

  • 有 breaking changes:插件 API 和配置文件格式都没稳定,现在写的插件下个版本可能就废了。想围绕它做生态投入,得先算清楚这笔账。
  • 供应链风险:官方用 npx 执行远程代码、支持从 Git 安装第三方插件。预览阶段插件生态尚未建立信任体系,装第三方插件前建议自己 pin 版本、审查权限。
  • 别拿公司主仓库试:v0.1 的稳定性没有保证,建议先在容器或沙箱环境里跑通流程,再考虑接真实项目。
  • 别指望它现在就替代 Claude Code:真实改代码场景要用的权限模型、diff 审查、IDE 集成还不是 v0.1 的重点,打磨程度与 Claude Code、Codex 仍有明显差距。官方定位就是”底层框架 + 开发者预览”。
  • 一句话总结:尝鲜可以,别急着上生产。它现在的正确打开方式是——用它搭你自己的 Agent 工作流、写你自己的插件、攒你自己的私有工具链,等 API 稳定后再考虑规模化。

    九、结语:从”卖API”到”卖车架”

    “模型是发动机,Harness 是车架。过去 DeepSeek 卖发动机(API),Claude Code 卖整车;现在 DeepSeek 把车架开源了,还附赠一个 4300 个零件的改装市场。真正的野心不是做一个 Claude Code 的平替,而是让所有人都能在开源车架上拼出自己那辆车。”

    从年初 V3 时代”最便宜的推理”,到 V4 时代”峰谷计价的成本管理”,再到如今 Harness 开源”Agent 基础设施”——DeepSeek 的每一步都在把”能力”变成”公共品”。据 Hugging Face 最新报告,中国开源模型下载量已占全球 41%,首次超过美国;而 DeepSeek Harness 3 天 10 万 Star、4300 个插件的爆发,说明这种”公共品化”不只是权重层面,已经蔓延到了 Agent 工程层。

    对开发者而言,接下来值得盯三个时间点:插件 API 趋稳的正式版发布、社区目录的兼容性追踪数据、以及各大模型厂商是否会跟进开放自己的 Harness。Agent 框架的”安卓时刻”,可能比很多人预想的来得更早。


  • 智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主






    智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主






    GLM-5.3 来了
    基座不动,纯后训练 · Terminal-Bench 暴涨 6 倍 · 两周内开源
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月15日

    智谱GLM-5.3发布深度解析:同一基座纯后训练,Terminal-Bench暴涨6倍,开源编程第一易主

    8月14日中午,智谱甩出新一代旗舰 GLM-5.3。没换基座、没改架构、没堆参数——一句”Scaling post-training is all we did”定调,多项公开基准上成为当前排名最高的开源模型。

    📋 本文目录

    一、发布速览:一句话定调的”史诗级 Plus”

    二、跑分拆解:六项基准数据全景对比

    三、技术解读:什么是”后训练 Scaling”

    四、安全彩蛋:269 个项目揪出 2436 个漏洞

    五、大背景:国产三巨头一个月连环迭代

    六、生态落地:荣耀 YOYO Claw 火速接入

    七、普通开发者怎么选怎么用

    八、结语:开源模型的天,真的变了

    一、发布速览:一句话定调的”史诗级 Plus”

    2026年8月14日中午,智谱正式发布新一代旗舰模型 GLM-5.3,总参数规模 7430 亿(743B,MoE 架构)。据证券时报报道,这次升级最”反直觉”的地方在于:GLM-5.3 与 GLM-5.2 共用同一个基座模型,参数量、架构完全未变,所有能力提升全部来自后训练阶段的规模化(post-training Scaling)。

    “Scaling post-training is all we did.” —— 我们做的,只有后训练规模化。

    智谱创始人唐杰此前在社交媒体上为这次升级定调为“史诗级 Plus”。据智谱官方披露,GLM-5.3 在内部自建体感评测中编程能力较 GLM-5.2 提升 50%,模型即日起上线 ZCode、AutoClaw 等平台,API 随后上线,完整模型权重将在两周内以宽松许可证开源(发布前先完成安全评估与模型加固)。

    ⚡ 关键信息速览

    · 发布时间:2026年8月14日中午

    · 基座:743B MoE,与 GLM-5.2 完全相同

    · 提升来源:纯后训练(长程任务环境规模数十倍扩张 + 环境类型更丰富 + 训练时长延长)

    · 编程能力:内部体感评测较 GLM-5.2 提升 50%

    · 开源计划:两周内开放权重,宽松许可证

    · 发布节奏:GLM-5(2/12)→ GLM-5.1(4/7)→ GLM-5.2(6/16)→ GLM-5.3(8/14),约两个月一更

    二、跑分拆解:六项基准数据全景对比

    光说”提升50%”没有体感,直接上数据。综合智谱官方发布、证券时报、CSDN 技术解读等多方信息,GLM-5.3 的基准成绩单如下:

    基准测试 GLM-5.2 GLM-5.3 Claude Fable 5 GPT-5.6 Sol
    Terminal-Bench 3.0 4.6 28.3 ↑6倍 33.7 34.6
    DeepSWE v1.1 46.2 66.9 69.7 72.7
    AutomationBench v1.0.6 26.2 48.2(第一) 46.2 45.8
    CyberGym(安全) 77.2 84.5(第一) 83.8 83.6
    ExploitBench(安全) 24.4 54.4 78.0 76.5
    GDPval-AA v2 1508 1769 1743 1730

    三个最值得注意的细节:

  • Terminal-Bench 3.0 从 4.6 跃升到 28.3——这是公认最难的终端任务基准,4.6 基本等于”不会做”,28.3 已经挤进第一梯队,与闭源旗舰的差距肉眼可见地缩小。
  • AutomationBench 和 CyberGym 两项直接反超 Claude Fable 5 和 GPT-5.6 Sol,这是开源模型少有的”局部登顶”。
  • 在 Z.ai Code Bench 高难度档上,GLM-5.3 以 31.4% 的通过率(消耗约 5 万 token)超越 Claude Opus 4.8 的 29.5%(消耗约 12 万 token)——用不到一半的 token 干了更多的事,对按量计费的开发者来说是实打实的成本优势。
  • 三、技术解读:什么是”后训练 Scaling”

    据证券时报的通俗解释:后训练 Scaling 指的是在模型预训练完成后,通过优化训练方法、提升数据质量和强化学习策略,让模型在特定任务上表现更优。可以理解为“课本没变,但换了更好的训练方法,因此提升了学生成绩”

    具体到 GLM-5.3,智谱做了三件事:把长程任务环境(long-horizon RL 环境)规模扩张数十倍;让环境类型更丰富;显著延长后训练时间。据头条技术博主”谦”的分析,这套打法的本质是:当预训练的架构红利见顶后,竞争主战场转移到了后训练阶段的工程能力——谁的任务环境构造得更好、奖励信号设计得更准,谁的模型就更聪明。

    💡 深层信号

    “同一基座、纯后训练带来 6 倍的 Terminal-Bench 跳升”说明智谱的后训练(尤其长程 RL 环境构造)已是核心壁垒;但它同时意味着架构红利已尽,后续升级必须靠更重的训练投入,边际成本会越来越高。这也是为什么各家都在卷”工程化后训练”而不是一味堆参数。

    四、安全彩蛋:269 个项目揪出 2436 个漏洞

    这次 GLM-5.3 最出圈的其实不是编程,而是网络安全能力。据多家媒体报道:

  • CyberGym 基准以 84.5% 排名第一,超过 Mythos 5 的 83.8%,拿下”最强开源安全模型”称号。
  • 白盒代码审查与漏洞发现能力持平 Mythos 5,实际在 269 个项目中发现了 2436 个漏洞
  • 据 ToxicDiary 等媒体报道,它还在知名 AI 编程工具 Cursor 里顺手揪出了一个严重漏洞——模型不只是会写代码,还能反过来审代码、找坑。
  • 一个耐人寻味的呼应是:就在上个月,开源社区 Hugging Face 曾通过部署智谱 GLM-5.2,还原 AI 智能体入侵攻击过程,帮助控制了事态。安全能力从”副产品”变成”主打牌”,GLM 系列算是给国产模型蹚出了一条差异化路线——对企业安全团队来说,以前请安全专家按小时计费,现在一个开源模型就能先扫一遍代码。

    五、大背景:国产三巨头一个月连环迭代

    GLM-5.3 不是孤立事件。过去一个月,国产头部大模型厂商完成了教科书级别的”接力发布”:

    时间 厂商/模型 关键点
    7月17日 月之暗面 Kimi K3 2.8 万亿参数,全球首个迈入 3 万亿级别的开源模型
    8月13日 DeepSeek V4 Pro 正式版 1.6 万亿总参数、激活 490 亿;输出 6 元/百万 token,仅为 Claude Fable 5 的 1/60
    8月12-14日 阿里 Qwen3.8 系列 Max 级 2.4T-A95B 权重首次开放;27B 版本消费级显卡可跑,Apache 2.0 协议
    8月14日 智谱 GLM-5.3 同基座纯后训练,多项基准开源第一,两周内开源

    据央广网报道,全球多模型聚合平台发布的 2026 年 7 月 AI 大模型调用量排行榜中,中国企业包揽前 5 名;在全球最大的 AI 开源社区上,中国开源模型累计下载量居全球首位。另有 OpenRouter 统计显示,中国大模型调用量已连续 15 周超过美国。

    更值得关注的是”开源”本身成了全球趋势:Meta 在今年 5 月还宣称旗舰模型不适合开源,8 月 10 日就发布了开源模型 Muse Glimmer;OpenAI 也在 2025 年推出过开放权重模型 GPT-oss。上海交通大学田丰指出,对后入场的企业来说,开源是成本最低、最直接拿到市场分发权限的办法——但要注意“开源 ≠ 免费”,开源大模型指的是”开放权重”,与传统开源”公开源代码、任何人可复现构建”只有部分重叠。

    六、生态落地:荣耀 YOYO Claw 火速接入

    模型发布不到 24 小时,8 月 15 日凌晨,荣耀全场景软件主理人席迎军在微博宣布:YOYO Claw 正式接入 GLM-5.3,”虾虾大脑”全新升级。YOYO Claw 是荣耀今年 4 月发布的跨端智能体,支持在荣耀 PC、荣耀 Pad 上运行,还能连接第三方设备。

    对普通用户来说,这意味着 GLM-5.3 的编程与智能体能力将直接进入手机和 PC 的系统级体验。据 CSDN 报道,GLM Coding Plan 也已全量上线 GLM-5.3,订阅用户无需等待权重开源就能第一时间用上。智谱官方口径是”即日起上线 ZCode、AutoClaw 等平台,API 随后上线”。

    🔗 一个细节

    智谱确认权重将在发布两周后开放,此前先完成安全评估与模型加固。结合 GLM-5.2 当年 MIT 协议开源的先例,GLM-5.3 大概率也会给一个相当宽松的许可证——对想私有化部署的企业来说,值得把这个时间点记在日历上。

    七、普通开发者怎么选怎么用

    1. 重度编程场景:现在就能用

    GLM Coding Plan 订阅用户已可直接切换 GLM-5.3;用 Claude Code、Codex、Cursor 等 Agent 工具的开发者,可以通过智谱的兼容端点接入。Terminal-Bench 28.3 的成绩意味着它在真实终端任务(编译、部署、调试流水线)上已经不是摆设。

    2. 安全审计场景:给代码库做”免费体检”

    269 个项目发现 2436 个漏洞的实战数据说明,用它做白盒代码审查、漏洞初筛是靠谱的。企业安全团队可以把 GLM-5.3 作为人工审计前的第一道过滤,大幅压缩审计成本。

    3. 成本敏感场景:横向比价再下单

    本周选项太多:要极致性价比选 DeepSeek V4 Pro(输出 6 元/百万 token);要消费级显卡本地部署选 Qwen3.8-27B(Apache 2.0);要开源旗舰权重等两周后的 GLM-5.3 和已开放的 Qwen3.8-2.4T。纯文本对话和成本敏感场景,DeepSeek V4-Flash 依然是兜底选择。

    4. 等 GLM-5.3 开源权重再自建

    743B MoE 架构对推理资源要求不低,中小企业建议关注各家 Day0 适配动态——参考 Kimi K3 开源首日昇腾 Atlas A3、阿里云 M890 同步跑通的先例,GLM-5.3 权重开放时大概率也会有国产算力平台的官方适配方案。

    八、结语:开源模型的天,真的变了

    “从’追赶’到’同台竞技’,只用了不到一年。GLM-5.3 最狠的地方不是跑分,而是证明了一件事:当别人还在堆参数的时候,智谱把’同一套参数’炼出了新境界。基座不动、纯靠后训练把 Terminal-Bench 拉高 6 倍——这不是挤牙膏,是跳级。开源模型与闭源旗舰之间的那堵墙,正在被一周一个的国产发布拆掉。”

    据证券时报观察,国产大模型的竞争焦点,正在从单项能力比拼走向高价值场景的全面争夺。Coding Agent、安全审计、企业服务等方向,正在成为大模型从”技术叙事”走向”商业叙事”的关键入口。GLM-5.3 能不能把开源第一的宝座坐稳?两周后权重开放、各路独立复测出炉,答案自然会浮出水面。


  • 字节SeedRealtime发布:原生音视频全双工大模型,全模态交互新时代






    字节SeedRealtime发布:原生音视频全双工大模型,全模态自然交互新时代






    🎙️
    SeedRealtime
    字节跳动原生音视频全双工大模型
    实现边看、边听、边说的全模态自然交互
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月9日

    字节SeedRealtime发布:原生音视频全双工大模型,全模态交互新时代来临

    8月5日,字节Seed团队正式推出SeedRealtime——原生音视频全双工大模型。统一架构融合音频、视频与文本,实现”边看、边听、边说”的实时多模态交互。端到端人工评测显示,相比传统级联模型,对话节奏问题减少了一半。已在豆包App全量上线,成为业界首个规模化落地的音视频全双工方案。

    📋 本文导读

    一、什么是SeedRealtime:告别”卡拍”的实时交互

    二、三大核心突破:理解、主动、节奏

    三、技术架构拆解:端到端统一模型 vs 传统级联系统

    四、典型应用场景:7个真实案例

    五、如何体验SeedRealtime

    六、行业对比与竞争格局

    七、行业意义与展望

    一、什么是SeedRealtime:告别”卡拍”的实时交互

    2026年8月5日,字节跳动Seed团队正式发布SeedRealtime——一个原生音视频全双工大模型。这标志着AI交互从”一问一答”的对讲机模式,正式迈向”同时听、同时看、同时说”的真人对话模式。

    先理解一个关键词:全双工(Full-Duplex)

    传统AI语音交互就像”对讲机”——你讲完,我再说;而全双工的SeedRealtime就像真人对话——听、看、想、说可以同时发生,不需要等对方把话说完才开始动脑子。

    更关键的是它的架构。SeedRealtime不是把”语音识别+视觉理解+文本生成”几个模块像糖葫芦一样串起来,而是在底层就把音频、视频、文本三种模态融成一体。它面对的不再是”转写后的文字”或”截下来的静图”,而是一个连续、动态、还带着杂音的真实世界信息流。

    💡 核心定位

    原生音视频全双工大模型,用统一端到端架构融合音频、视频与文本,在连续的多模态信息流上实时交互,带来”边看、边听、边说”的全新体验。

    已规模化落地,不止是Demo

    SeedRealtime已在豆包App全量上线,成为业界率先实现音视频全双工技术规模化落地的产品。这意味着这项技术已经从实验室走到了亿万用户的手机上。

    2亿+
    豆包App日活用户
    50%
    节奏问题减少
    3模态
    音频+视频+文本
    7场景
    官方展示案例

    二、三大核心突破:理解、主动、节奏

    突破一:音视频联合理解——看得懂画面,分得清对象

    SeedRealtime原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义,也能准确理解视觉中的时序指代,让所见、所闻与所说融为一体。

    真实场景:四人聚餐,人多话杂

    用户逐一介绍在场的人,SeedRealtime就能根据外形特征把名字和人对上——认出浅色头发的七七、戴眼镜的Julia,还主动和乐乐打招呼。在之后的交谈中,始终把每个人的声音和身份对应起来。

    大家你一言我一语聊起旅行:有人想去海边拍照、逛海洋馆,有人怕热怕累,还有人对海鲜过敏。SeedRealtime能分辨每句话出自谁,并根据大家的交流,给出一份兼顾每个人需求的旅行方案。

    🎯 技术亮点

    认人、辨声、听懂各自的需求,这些都在同一场对话里由一个模型实时完成,无需多次截图上传或分段提问。

    真实场景:川菜馆跨语言沟通

    外籍食客面对中文菜单一筹莫展。SeedRealtime直接从画面中认出菜品、用英语推荐,还能顺着文化背景解释”为什么鱼香肉丝里没有鱼”、”皮蛋是怎么做的”。服务员上菜时顺道说”很下饭”,它能结合画面中的菜理解这句话并翻译给客人听。

    突破二:主动交互能力——持续观察,适时介入

    模型具备持续的环境感知与主动表达能力。它能在察觉画面状态变化时主动提醒,并能调用工具融入表达,让交互从被动响应升级为主动协作。

    场景:博物馆智能导览

    在河北博物院逛展,用户交代一句”看到错金银铜虎噬鹿屏座就提醒我”,SeedRealtime便在镜头不断移动的过程中留意画面,扫过那件展品时出声提醒。随后,它结合画面细节,讲解错金银四龙四凤铜方案座、长信宫灯等镇馆之宝。

    场景:咖啡机操作纠错

    操作一台复杂咖啡机的过程中,模型能够基于视觉状态的变化实现实时纠错与反馈。当观察到用户把整粒咖啡豆直接倒进萃取手柄时,模型快速指出:”豆子不能直接倒进去,得先磨成细粉”;萃取结束后,它基于对杯中油脂成色与液量的视觉解析,主动给出”下次萃取时间缩短2-3秒”的调整建议。

    场景:论文研读辅助

    研读ResNet论文时,模型结合网络结构图讲清跳接如何缓解梯度消失;当用户说”帮我盯着,翻到训练参数那部分提醒我”,它便在快速翻页的过程中持续观看画面,准确认出”3.4 Implementation”段落并主动叫停,随即报出学习率、动量、权重衰减等关键训练配置。

    突破三:流畅的交互节奏——在干扰中判断何时开口

    轮次判断不再交给外部VAD规则,而由SeedRealtime基于多模态信息持续决策:该接话时不迟疑,该沉默时不打断,在复杂环境中依然保持沟通的流畅连贯。

    在大兴机场,同伴闲聊”老李的航班”它不为所动;你正式开口问,哪怕航班信息已经划出画面,它仍能结合刚才看到的屏幕信息回答,并联网告诉你行李转盘在哪。在家里,它能屏蔽背景的电话声,始终盯着你孩子手指的方向做英语教学。

    端到端人工评测结果显示,相比级联模型,SeedRealtime的音视频对话节奏问题减少了一半——”话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少。

    三、技术架构拆解:端到端统一模型 vs 传统级联系统

    要理解SeedRealtime的技术突破,需要先了解当前实时音视频交互的两种主流路线。

    传统级联系统的困境

    传统AI视频通话采用”接力赛”模式:你的声音先过ASR(语音识别)转成文字,画面过VLM(视觉语言模型)被理解,再交给LLM综合回答,最后TTS(语音合成)念出来。

    这套流程有两个致命问题:

    • 延迟层层叠加,信息逐级损耗——每传一手就掉一层
    • 对话节奏根本控不住。人说话有停顿,模型能靠停顿判断什么时候接话;可视频画面是”时刻在线”的,一直在变。模型既要看懂画面,又不能被背景噪音频繁触发,还得判断该盯谁、何时开口

    SeedRealtime的端到端统一架构

    SeedRealtime的核心突破,在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答,而是在连续音视频流上,让感知、理解、决策与表达同步进行。

    对比维度 传统级联系统 SeedRealtime
    架构方式 ASR+VLM+LLM+TTS多模块串联 统一端到端架构,原生融合音频、视频、文本
    轮次判断 依赖外部VAD(语音活动检测) 模型自行判断,不依赖外部模块
    延迟与损耗 多模块串联导致延迟叠加、信息损耗 削减多模块堆叠的延迟与信息损耗
    对话节奏 容易出现抢话、停顿突兀、答非所问 节奏问题减少约50%,对话更自然流畅
    视觉理解 静态截图分析,无法持续追踪 连续画面流实时理解,支持动态场景
    主动交互 被动等待用户提问 持续环境感知,可主动提醒和介入
    🔑 关键技术点

    SeedRealtime将”感知、理解、决策、表达”塞进同一个实时决策体系。当看、听、说被纳入同一套决策体系,模型便不再只是等待用户提问,而能持续理解场景变化,在合适的时机主动开口。

    更深层的技术挑战:音视频联合建模与时序对齐

    用户说”这个怎么弄”时,模型需要结合当前画面、手势、视线与历史动作,判断”这个”具体指向什么。遇到同音词或模糊语音时,也要借助视觉场景完成消歧。只有将声音、画面与时序信息统一建模,模型才能真正把所见、所闻与所说对应起来。

    四、典型应用场景:从日常到专业的全覆盖

    官方展示的7个案例覆盖了社交、文旅、学习、操作辅助、出行等多个领域,充分体现了SeedRealtime的全模态交互能力。

    👥 场景一:多人聚会实时沟通

    四位好友聚餐,人多话杂。SeedRealtime能根据外形特征把名字和人对上,始终把每句话和身份绑定。大家聊旅行需求时,能分辨每句话出自谁,给出兼顾所有人的方案。

    🍜 场景二:跨语言餐饮沟通

    外籍食客面对中文菜单,SeedRealtime直接从画面识别菜品、用英语推荐,还能解释”鱼香肉丝为什么没有鱼”等文化背景知识。服务员的话也能实时翻译。

    🏛️ 场景三:博物馆智能导览

    交代一句”看到某件文物就提醒我”,模型便在镜头移动时持续留意画面,目标出现即主动提醒,接着讲解相关工艺和历史。

    ☕ 场景四:设备操作实时指导

    操作咖啡机过程中,模型基于视觉状态变化实时纠错——发现咖啡豆直接倒入手柄时立刻提醒,萃取后根据油脂成色给调整建议。

    📄 场景五:学术论文研读辅助

    结合网络结构图讲解跳接原理,用户说”翻到训练参数那部分提醒我”,模型在快速翻页中准确识别目标段落并主动叫停,报出关键配置。

    ✈️ 场景六:嘈杂环境出行辅助

    大兴机场同伴闲聊时不会误触发;用户正式提问时,即使航班信息已划出画面,仍能结合刚才看到的屏幕信息回答,并联网查询行李转盘。

    👶 场景七:儿童英语互动教学

    在家里能屏蔽背景电话声,始终盯着孩子手指的方向做英语教学。在连续画面流中保持专注,不受环境噪音干扰。

    五、如何体验SeedRealtime

    SeedRealtime目前已在豆包App全量上线,普通用户更新后即可免费体验。

    📱 体验步骤

    第一步:打开应用商店,更新豆包App至最新版本

    第二步:打开豆包App任意聊天窗口,点击”打电话”入口

    第三步:进入视频通话界面,首次使用需开启摄像头和麦克风权限

    第四步:直接展示物品、环境或操作过程,通过自然语言提问

    体验建议:

    • 选择光线充足的环境,帮助模型提升视觉理解效果
    • 使用支持摄像头和麦克风权限的设备
    • 保持网络稳定,提升实时交互质量
    • 尝试设置主动观察任务(如”看到XX就提醒我”),体验主动交互能力

    官方项目主页:seed.bytedance.com/seedrealtime

    六、行业对比与竞争格局

    SeedRealtime并非唯一瞄准实时多模态交互的方案。它与Google的Gemini Live、OpenAI的GPT-4o实时模式处于同一赛道,但技术侧重点各有不同。

    对比维度 SeedRealtime Gemini Live GPT-4o实时模式
    开发方 字节跳动Seed团队 Google DeepMind OpenAI
    核心架构 统一融合音频+视频+文本+时序 原生多模态架构 Omni多模态架构
    全双工能力 原生全双工,自主判断节奏 支持实时双向语音 支持实时语音互动
    视觉理解 连续画面流+动态场景+多人环境 摄像头画面分析 图像理解和实时视觉交互
    主动交互 环境感知+目标识别+主动提醒 支持主动交流 支持实时任务辅助
    中文优化 针对中文场景深度优化 支持多语言 支持中文
    应用生态 豆包App(2亿+日活) Gemini应用+Google生态 ChatGPT应用生态
    落地状态 已全量上线豆包App 已上线 已上线

    三者各有侧重:

    SeedRealtime重点突破原生音视频全双工能力,通过统一架构减少传统多模块串联的信息损耗,在中文场景和国内应用生态方面有天然优势。Gemini Live和GPT-4o实时模式更强调通用AI助手能力,具备成熟的全球覆盖能力。

    值得注意的是,字节在此前已推出Seeduplex(纯语音全双工模型,2026年4月发布),而SeedRealtime是其在音视频全双工方向的进一步升级,从”边听边说”进化到”边看边听边说”。

    七、行业意义与展望

    从”能对话”到”能行动”的进化

    SeedRealtime的发布,标志着AI交互正在经历一次范式转变。当AI不再只会”一问一答”,而是能在连续变化的场景里理解上下文、把握时机、主动帮忙,我们可能正在见证一次从”能对话”到”能行动”的进化。

    真正的智能,始于对复杂世界的实时感知。

    技术演进路线清晰

    从字节的产品节奏可以看出清晰的演进路线:Seeduplex(纯语音全双工,4月)→ SeedRealtime(音视频全双工,8月)。下一步,团队将在更低延迟、更主动的感知决策、更稳的多人场景,以及打通工具调用与现实连接上继续突破。

    对普通用户意味着什么

    • AI不再是”问一句答一句”的工具,而是能持续感知环境的伙伴
    • 语言学习、旅行导览、设备操作等场景获得质的提升
    • 中文用户获得了原生优化的全双工交互体验
    • 免费体验门槛降低,只需更新豆包App即可使用
    📝 总结

    SeedRealtime是字节Seed团队在多模态交互领域的又一里程碑。它用统一端到端架构解决了传统级联系统的延迟、信息损耗和节奏失控三大痛点,实现了”边看、边听、边说”的全模态自然交互。已在豆包App全量上线,让亿万用户率先体验到AI交互的下一种可能。

    本文内容基于字节跳动Seed官方博客及公开资料整理。信息来源:seed.bytedance.com


  • 阿里Qwen3.8-Max发布:2.4万亿参数旗舰+千问办公公测,企业级Agent三国杀打响






    阿里Qwen3.8-Max发布:2.4万亿参数旗舰+千问办公公测,企业级Agent三国杀打响






    🔥
    阿里 Qwen3.8-Max 发布日
    2.4 万亿参数旗舰 + 千问办公公测
    企业级 Agent 三国杀正式打响
    AI
    AI工具导航
    @xcoolevdb · 2026年8月3日

    8 月 3 日,阿里巴巴双线齐发:新一代基座大模型 Qwen3.8-Max 正式上线,总参数 2.4 万亿,Arena 榜单仅次于 Claude 系列,稳居全球第一梯队;企业级 Agent 产品”千问办公”(QwenWork)同步开启公测,业内首款同时覆盖桌面端、云端、企业协同三层 Agent 架构。API 国内输入 12 元/百万 token、输出 36 元,国际价仅为 Opus5 的 40% 与 24%,下周开源 Qwen3.8-Max 和 Qwen3.8-27B。编程能力从空文件夹出发独立 16 天交付真实项目,法务一周审阅量压缩到一小时——一文拆解这场把”最强参数 + 最低价格 + 最快开源”三张牌同时打出的发布。

    📑 本文目录

    · 一、2.4 万亿参数:两万亿俱乐部再添一员

    · 二、核心能力拆解:编程 + 办公双杀

    · 三、自主编程 16 天交付:从空文件夹到可用框架

    · 四、千问办公公测:三端 Agent 架构首亮相

    · 五、企业级 Agent 三国杀:阿里 vs 腾讯 vs 字节

    · 六、API 定价与开源计划

    · 七、跑分速览:Arena、CodeArena、OSWorld 多榜齐发

    · 八、万亿俱乐部横向对比:Qwen3.8 vs K3 vs DeepSeek V4 vs Fable 5

    · 九、对开发者和企业的 4 条落地建议

    一、2.4 万亿参数:两万亿俱乐部再添一员

    继月之暗面 Kimi K3(2.8T)之后,突破两万亿参数的国产大模型又添了一位选手。Qwen3.8-Max 总参数量 2.4 万亿,采用第三代 MoE 混合专家架构,推理仅激活 950 亿有效参数,兼顾超强能力与推理成本控制。

    🔧 Qwen3.8-Max 核心规格

    · 总参数 / 激活参数:2.4 万亿 / 950 亿

    · 架构:稀疏 MoE + 混合注意力机制联合优化

    · 上下文窗口:100 万 Token

    · 多模态:原生支持文本、图片、视频、文档理解

    · 定位:Qwen 系列迄今综合性能最强基座模型

    从 7 月 19 日 WAIC 首发预览,到 7 月 21 日更新前端(WebDev)能力,再到 8 月 3 日正式发布——Qwen3.8 这半个月,几乎是以”天”为单位在进化。阿里真武 M890 超节点也已成功适配 Qwen3.8,芯片、云平台与千问大模型全链路优化,在 Agentic 推理场景中最多可实现 1.5 倍性能提升。

    二、核心能力拆解:编程 + 办公双杀

    Qwen3.8 的升级重点非常明确:编程(Coding)专业办公(Cowork)。在内部真实任务的测评中,全栈开发、数据分析、Office 办公工作流这类复杂、多 Agent、长程任务,Qwen3.8 都展现了匹敌世界前沿模型的实力。

    编程能力:从写函数到交付项目

    2 年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手。而如今,Qwen3.8 可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人干预。在权威 CodeArena 编程榜中,Qwen3.8 位居全球第四。

    办公能力:干得广,也干得稳

    通过真实环境和算力的联合强化学习(RL)扩展,Qwen3.8-Max 实现了数百种高价值、高频专业任务的真实表现提升:

    • 法务审核:法务团队标注千余个法律条款需要一周,Qwen3.8 一小时完成
    • 体育分析:篮球数据分析团队逐帧标注 160 小时比赛录像,Qwen3.8 数十分钟精准拆解 8400 多个攻防回合并输出战术报告
    • 量化策略:金融研究团队数年积累才能完成的量化策略研究,Qwen3.8 连续工作数小时后交付完整的 ETF 轮动策略并实现规模化盈利

    长程任务:数千轮交互里持续进化

    面对长周期任务,Qwen3.8-Max 涌现出系统级自主规划与全栈闭环自适应学习能力。无论是精密严苛的数字芯片设计,还是瞬息万变的商业模拟运营,它都能在”执行—反馈—迭代”的闭环中历经数千轮超长交互,持续重构自己的算法与策略。

    多模态智能体:视觉生产力新高度

    Qwen3.8-Max 把 AI 的视觉理解推向新高度:能跨页理解 200 页的财报,把 100 小时的长视频组织成可检索、可追溯的 Graph 记忆。执行中持续审视自己的中间产物,一旦出错就自主定位、重新规划并修正。在权威 Vision Arena 榜单中,Qwen3.8-Max 排名全球第二。

    三、自主编程 16 天交付:从空文件夹到可用框架

    这次最出圈的演示,是 Qwen3.8 的自主编程能力。只需一句”创建一个自进化的智能体 Harness”,Qwen3.8 就像一位资深工程师,从零开始自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取和执行任务,人类工程师还可通过钉钉给 Qwen3.8 提出新要求。

    16天
    独立编程运行周期

    oh-my-cli
    产出的自进化智能体框架

    Hermes级
    达到的 Agent 能力级别

    已开源
    完整过程公开在 GitHub

    Qwen3.8 独立编程运行约 16 天后,做出了一个 Hermes Agent 级别的、真实可用的自进化智能体框架”oh-my-cli”,目前该项目已完全开源,完整过程公开保存在 GitHub 仓库里,可供所有人查看。这不是 Demo,不是玩具——而是一个真实可用的工程产物。

    “2 年前的模型能写好函数、补全代码;如今的模型能从空文件夹出发,独立交付十数天的真实项目。这不是量变,是质变。”
    ——阿里云官方发布

    四、千问办公公测:三端 Agent 架构首亮相

    跟模型一起发布的,还有企业级 Agent 产品”千问办公”(QwenWork)。它由 QoderWork、MuleRun、悟空三款产品全面整合而来,是业内首款同时支持桌面端 Agent、云端 Agent、企业协同 Agent的产品。

    🏢 千问办公六大核心能力

    · 企业 IM 协作:已打通钉钉 25 项能力,包括消息群聊、考勤审批、会议日程、文档生成等

    · Office 产物一站生成:输出 PPTX、Word、Excel、HTML 等原生可编辑文件

    · 多模态内容理解:识别图片、音频、视频

    · 全栈网页生成:可制作带数据库与交互逻辑的免部署独立网页(QwenWork Pages)

    · 专业数据源聚合:接入 1688 等电商后台、小红书等社交媒体

    · 自定义技能与专家套件:将个人最佳实践固化为团队可复用资产

    组织级 Skill:个人经验变企业资产

    最值得关注的是”组织级 Skill”功能。一家 20 人规模的律师事务所,资深律师用千问办公完成首份并购尽调报告后,可将全过程一键沉淀为”组织级 Skill”,向全团队共享。新员工接到同类案件,无需逐项请教前辈,调用该 Skill 即可产出报告。

    这意味着个人经验可以转化为企业资产——过去靠”师傅带徒弟”传递的隐性知识,现在可以被结构化、可复用地沉淀下来。

    定价与公测福利

    版本 价格 适合
    个人免费版 0 元 个人用户体验和轻量使用
    标准版 78 元/月 个人深度使用
    企业标准版 198 元/月/席 企业团队协作

    公测期间新用户注册即送 2000 积分,每日登录还可领取 500 至 2000 积分。网页版和独立 PC 客户端已开放,钉钉 PC 端和手机端内置入口近期也将开放。

    五、企业级 Agent 三国杀:阿里 vs 腾讯 vs 字节

    千问办公的出现并非孤例。在它之前,腾讯和字节跳动已经率先完成了组织架构与产品形态的整合。企业级 AI Agent 的三国杀正式打响。

    🔵 阿里:千问办公(QwenWork)

    · 路径最完整:桌面端 Agent + 云端 Agent + 企业协同 Agent 三层架构

    · Qwen 决定智能上限,钉钉提供组织关系和流程入口,阿里云承接数据和算力

    · 优势:全栈组合清晰;挑战:三个体系能否形成统一体验

    🟢 腾讯:WorkBuddy

    · 深度绑定企业微信生态,IM 原生入口

    · 优势:企业微信渗透率高,组织关系天然在线

    · 挑战:模型能力是否跟得上 Agent 场景的复杂度

    🔴 字节:豆包企业版

    · 豆包大模型 + 飞书协同,C 端经验反哺 B 端

    · 优势:C 端用户基数大,产品体验打磨充分

    · 挑战:企业级数据安全和合规能力需要验证

    对企业老板来说,这不仅是”选哪个 AI 工具”的问题,而是整个低代码选型逻辑正在被重写。选型逻辑正在从”选平台”升级为”选生态”——企业现有用哪个协同工具,就优先考虑哪个 Agent 产品,迁移成本最低。

    六、API 定价与开源计划

    这次最狠的其实是价格。今日起,全球开发者都可通过千问 AI 平台获得 Qwen3.8 的 API 服务:

    💰 Qwen3.8-Max API 定价

    · 国内输入:12 元 / 百万 tokens

    · 国内输出:36 元 / 百万 tokens

    · 隐式缓存命中:1.5 元 / 百万 tokens

    · 国际输入价:仅为 Opus5 的 40%

    · 国际输出价:仅为 Opus5 的 24%

    横向对比:Kimi K3 海外定价约 3 美元/百万输入、15 美元/百万输出;Fable 5 约 10 美元输入、30 美元输出。Qwen3.8 用 2.4 万亿参数的”顶配”,打出了”白菜价”。

    🔓 开源计划

    · Qwen3.8-Max:预计下周开源权重

    · Qwen3.8-27B:同步开源

    · 获取渠道:ModelScope、Hugging Face

    · API 接入:阿里云百炼、千问 AI 平台、Qoder、QoderWork

    七、跑分速览:Arena、CodeArena、OSWorld 多榜齐发

    Top 2
    Arena 全球总榜(仅次于 Claude)

    #4
    CodeArena 编程榜

    86.1
    OSWorld-Verified 电脑操作

    93.0
    PaperBench 科研复现

    82.8
    IFBench 指令遵循

    92.6
    GPQA Diamond 科学推理

    82.0
    BabyVision 视觉推理

    #2
    Vision Arena 视觉榜

    值得注意的是,OSWorld-Verified 86.1 分位居主流模型首位——这意味着在电脑操作能力上,Qwen3.8-Max 已经是目前最强的模型之一,这对 Agent 场景的落地至关重要。

    八、万亿俱乐部横向对比

    模型 总参数 激活参数 开源 API 输入价 核心优势
    Qwen3.8-Max 2.4T 95B 下周开源 12 元/M 编程+办公双杀,三端Agent
    Kimi K3 2.8T 104B 已开源 ~21 元/M 全球最大开源权重,Infra全开
    DeepSeek V4 1.6T 部分开源 1 元/M(Flash) 极致性价比,昇腾950协同
    Fable 5 未公开 闭源 ~70 元/M 综合能力最强,基准领先

    这一轮国产大模型的密度堪称历史级:7 月 16 日 Kimi K3 开源,7 月 19 日 Qwen3.8 预览首发,8 月 1 日 DeepSeek V4-Flash 正式上线,8 月 3 日 Qwen3.8 正式发布。传闻中 MiniMax M3 Pro(2.5-3T)、GLM-5.5 都在路上。这已经不是”百模大战”,而是万亿参数俱乐部的淘汰赛。

    九、对开发者和企业的 4 条落地建议

    💡 落地建议

    1. 优先体验千问办公的 Skill 功能:如果你是中小企业,先把高频重复任务(周报、数据分析、合同审核)做成 Skill,验证 ROI 后再考虑企业版部署。

    2. API 选型看场景:编程和 Agent 任务优先 Qwen3.8-Max,纯文本对话和成本敏感场景考虑 DeepSeek V4-Flash(1 元/百万 token),需要最大开源权重选 Kimi K3。

    3. 等开源再部署:Qwen3.8-Max 下周开源,27B 版本适合私有化部署。不急的话,等权重放出后用 vLLM/SGLang 自建推理,成本远低于 API 调用。

    4. Agent 生态选型看协同工具:用钉钉选千问办公,用企微选 WorkBuddy,用飞书选豆包企业版——迁移成本最低的路径就是最优路径。

    “从’追赶’到’同台竞技’,再到价格战和开源战,国产大模型这半年的进度条,快得让人有点跟不上。Qwen3.8 的意义不只是又一个 2.4T 的模型——它是阿里把’最强参数 + 最低价格 + 最快开源’三张牌同时打出来的宣言:大模型的竞争,已经从炫技进入拼刺刀阶段。”

    本文由 AI工具导航(cn.xcoolevdb.site)原创整理,数据来源:阿里云官方发布、IT之家、澎湃新闻、21世纪经济报道、CSDN 等。转载请注明出处。


  • Kimi K3 全栈开源首日:2.8 万亿权重落地 Hugging Face,昇腾 Atlas A3 / 阿里云 M890 同台 Day0 跑通






    Kimi K3 全栈开源首日:2.8 万亿权重落地 Hugging Face,昇腾 Atlas A3 / 阿里云 M890 同台 Day0 跑通






    🚀
    Kimi K3 全栈开源首日
    2.8 万亿权重 + 三项 Infra 同步落地
    昇腾 Atlas A3 · 阿里云 M890 同台 Day0 跑通
    AI
    AI工具导航
    @xcoolevdb · 2026年7月28日

    7 月 27 日深夜,月之暗面把 Kimi K3 的模型权重、技术报告,连同 MoonEP / FlashKDA / AgentEnv 三项核心训练 Infra 一起推上 Hugging Face——这是全球首个迈入 3 万亿参数级别的开放权重模型。Hugging Face CEO 亲口确认:30 分钟点赞 4000+,创平台成立以来最快发布增长纪录。7 月 28 日上午,华为昇腾 Atlas A3、阿里云真武 M890、趋境科技 SGLang 同步完成 Day0 适配——国内首个跑通近 3 万亿参数模型的超节点当天上线。WebDev Arena 1679 Elo 登顶、K3 自己写编译器、自己设计 45nm 芯片原型,白宫指控、商务部回应、25 家美国公司联名反对封杀、月之暗面 500 亿美元目标估值——一文看懂这条把”前沿智能”门槛再次打下来的全栈开源之路。

    📑 本文目录

    · 一、为什么说”全栈开源”是这一枪

    · 二、首日数据:Hugging Face 30 分钟 4000 赞

    · 三、国产算力 Day0 适配:昇腾 / 阿里云 / 趋境科技

    · 四、跑分:1679 Elo 登顶 WebDev Arena,全球第四

    · 五、自主工程能力:模型自己写编译器、自己设计芯片

    · 六、监管风暴:白宫指控、商务部回应、25 家公司联名

    · 七、商业化跃迁:500 亿美元估值、最快半年港股上市

    · 八、一张表:K3 vs Qwen3.8 vs DeepSeek V4 vs Fable 5

    · 九、对 AI 工具选型的 4 条落地启示

    一、为什么说”全栈开源”是这一枪

    过去一周,开源社区有过太多”承诺开源但仓库还是 404″的戏码。7 月 16 日 K3 以托管服务首发后,Hugging Face 仓库连续十天挂着 404,几家海外技术媒体干脆做了一面倒计时墙。7 月 27 日深夜,承诺落地——月之暗面把 K3 的完整权重、技术报告、连同三项核心 Infra 技术一并推上了 Hugging Face、GitHub 和 ModelScope。

    理解这次发布的真正重量,要先看它”全栈”到什么程度:

    📦 7/27 深夜同步放出的”四件套”

    · 模型权重:2.8 万亿参数 MoE 原生多模态模型,采用修改版 MIT 许可证

    · 技术报告:47 页,覆盖训练方法、架构创新、评测与 Infra

    · MoonEP:超大规模细粒度 MoE 通信库,负载不均场景保持极致效率

    · FlashKDA:KDA 注意力算子高性能实现,H20 预填充速度比基线提升 1.72~2.22 倍

    · AgentEnv:与 KVCache.ai 合作的智能体沙箱,支持环境快照、恢复与 Fork

    “别人开源,是把菜谱给你;月之暗面,是把后厨连人带制度打包送你。”这是社区里流传最广的一句话。三项 Infra 技术的同步开源意味着:任何想复现 K3 训练的研究者,都能直接拿到 KDA 算子实现、MoE 通信库和 Agent 训练沙箱——这三样恰恰是大规模 MoE 训练最难的工程门槛。

    2.8 万亿参数的硬指标

    • 总参数 / 激活参数:2.88 万亿 / 1040 亿
    • MoE 架构:896 个路由专家,每个 token 激活其中 16 个 + 2 个共享专家(56 倍稀疏比例)
    • 上下文窗口:原生 100 万 token
    • 多模态:从预训练第一天起视觉与文本就交织,视觉编码器 MoonViT-V2 从零训练(不依赖 SigLIP)
    • 注意力机制:Kimi Delta Attention(KDA,混合线性注意力,93 层中覆盖 69 层)+ Attention Residuals + 24 层门控隐注意力
    • MoE 优化:Stable LatentMoE 框架
    • 训练效率:相比 K2 提升 2.5 倍,MoonClip 二阶优化器把训练数据量从 40T 砍到 20T

    二、首日数据:Hugging Face 30 分钟 4000 赞

    权重上传后,社区热度几乎是即时引爆:

    4000+
    30 分钟 Hugging Face 点赞

    #1
    Hugging Face 趋势榜登顶

    3700
    上线前等待下载的开发者

    1
    平台成立最快发布增长纪录

    Hugging Face CEO Clément Delangue 亲自发文:K3 上线 30 分钟点赞超 4000,登顶趋势榜榜首,创下了平台成立以来最快的发布增长纪录。这个数字的意义是:它不是营销话术,而是全球开发者社区用脚投票——他们等这一天,已经等了至少十天。

    “现在,每个人都可以下载并部署 Kimi K3 模型——无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。”
    ——月之暗面官方声明

    三、国产算力 Day0 适配:昇腾 / 阿里云 / 趋境科技

    权重放出的 12 小时内,国产算力链给出了教科书级别的”Day0″响应——不是”我们尽快评估”,而是当天就跑通、当天就上线:

    🏛️ 华为昇腾 CANN:昇腾 950 全系列 + Atlas A3

    · 7/27 深夜宣布:昇腾 950 全系列、Atlas A3 产品支持 K3 部署

    · K3 896 专家的大 EP 部署场景,充分发挥昇腾超节点架构优势

    · AIV 直接下发 UB Memory 通信任务,抬升 MoE 推理吞吐上限

    ☁️ 阿里云:灵骏真武 M890 超节点(国内首个跑通近 3 万亿)

    · 7/28 上午宣布:真武 M890 超节点实例已 Day0 适配 K3

    · 国内首个跑通近 3 万亿参数模型的超节点

    · 千问 AI 平台、阿里云百炼后续将上线 K3 模型 API

    · 真武 M890 硬件:144GB 显存、800GB/s 片间互联、原生支持 FP32 到 FP4 全精度

    🔧 趋境科技:SGLang 推理引擎 Day0 适配

    · 基于开源推理引擎 SGLang,完成 K3 在昇腾 Atlas A3 上的 Day0 推理适配

    · SGLang 是当前大模型推理主流开源框架之一

    海外同样响应迅速:Nebius、Baseten、Fireworks 等主流 AI 基础设施厂商均宣布首日完成适配。Nebius 给出了迄今对 K3 最高的评价:“首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步”

    🚨 一个关键观察

    国产算力链这次不是”补位”——是真在领跑。阿里云真武 M890 是国内首个跑通近 3 万亿参数模型的超节点,比海外几个主流厂商在 K3 上的适配并不慢。配合昇腾 Atlas A3 与趋境 SGLang,”国产超大 MoE 推理”这条线,从”实验室 Demo”进入了”生产可用”。

    四、跑分:1679 Elo 登顶 WebDev Arena,全球第四

    开源阵营第一次不是在”够用”上做文章,而是”我就是最强”。K3 在 WebDev Arena 上以 1679 Elo 登顶,成为首个全面超越 GPT / Claude 等闭源旗舰的开源模型

    93.5%
    GPQA 研究生级科学问答

    77.8%
    ProgramBench 编程第一

    1679
    WebDev Arena Elo 登顶

    57.1
    AA Intelligence Index 全球第四

    • GPQA:93.5%,高于 Claude Fable 5 的 92.6%,仅微低于 GPT-5.6 Sol 的 94.1%
    • ProgramBench:77.8% 第一
    • FrontierSWE:81.2 分(仅次于 Fable 5 的 86.6,高于 GPT-5.6 Sol 的 71.3)
    • Artificial Analysis Intelligence Index v4.1:57.1 分,全球第四

    连对手都坐不住。马斯克在评测报道下留言”Impressive”,xAI 随后宣布启动 2 万亿参数 Grok 4.6 训练,明确以超越 K3 为目标。OpenAI 战略负责人则公开表示,K3 的性能”无法依靠简单的蒸馏或类似手段实现“——这句话从对手嘴里说出来,反而是对 K3 自研路线最强的背书。

    五、自主工程能力:模型自己写编译器、自己设计芯片

    真正让技术圈兴奋的,不是 K3 在公开榜单上的分数,而是技术报告里披露的自主工程能力——K3 不仅能”用工具”,它能”造工具”:

    5.1 GPU 内核优化(24 小时,K3 自主完成)

    K3 在 24 小时内自主完成了 AttnRes、DeepSeek Sparse Attention、KDA、MLA 四种代表性 GPU 内核的优化——这种任务通常需要资深的 CUDA 工程师团队花几周时间。关键结果:

    • AttnRes 延迟:283.6ms → 114.4ms(2.5 倍加速
    • DSA 运行时间减少 55.1%
    • KDA 运行时间减少 73.6%
    • MLA 接近峰值 TFLOPS
    • 综合表现:与 Claude Fable 5 持平,显著优于 Opus 4.8 / GPT-5.6 Sol / GPT-5.5

    更值得注意的是:测试环境同时覆盖 NVIDIA H200 与来自其他供应商的 GPGPU,意味着 K3 的部署能力已不局限于英伟达生态——这与华为昇腾 / 阿里云真武的 Day0 适配形成了完美的”模型 + 算力”双线协同。

    5.2 MiniTriton:从 Python 到 PTX 全链路自研的 GPU 编译器

    K3 自主开发了名为 MiniTriton 的紧凑型 GPU 编译器,从 Python 前端到 PTX 代码生成全链路由模型完成。在 NVIDIA L20 上,MiniTriton 的性能超越 PyTorch eager、torch.compile 和标准 Triton 实现。换句话说,K3 不仅能写 CUDA,它能写”写 CUDA 的工具”。

    5.3 48 小时自主芯片设计

    作为早期概念验证,K3 在 48 小时自主运行中,基于开源 EDA 工具和 Nangate 45nm 工艺库,完成了一款推理芯片原型的设计、优化与验证。这款芯片:

    • 面积仅 4 mm²
    • 集成 146 万个标准单元
    • 0.277 MB SRAM
    • 带融合去量化的 INT4 MAC 阵列

    这是一款”由模型设计、为模型服务”的芯片,标志着 AI 已具备从算法到硬件的全栈自主工程能力。

    “过去的 AI 还不能算真智能——但我们正迈入经验时代,势不可挡。”
    ——图灵奖得主 Richard Sutton,WAIC 2026 主论坛

    六、监管风暴:白宫指控、商务部回应、25 家公司联名

    K3 开源这件事,从第一天起就不只是技术议题。开源后 24 小时内,三股力量同时下场:

    6.1 美方指控与制裁威胁

    • 白宫科技政策办公室主任公开指控 K3 蒸馏 Anthropic 技术
    • 财政部长放话制裁
    • 传言实体清单可能波及月之暗面

    6.2 商务部 7/28 回应

    7 月 28 日,商务部发言人正式表态:“美方以莫须有理由打压中国科技企业扰乱全球产业链,中方将密切跟踪事态,保留采取一切必要措施维护国内企业合法权益。”这是中方在 K3 开源后给出的最高层级官方背书。

    6.3 25 家美国公司联名反对封杀

    7/24,黄仁勋在社交平台发布了一封由 a16z 发起、英伟达联合 Perplexity AI、Ollama 等科技公司共同签署的公开信,主张”前沿开源模型与前沿闭源模型应并存发展”。这份名单几乎囊括了硅谷的半壁江山:

    • 支持方(25 家):英伟达、微软、Meta、IBM、a16z、YC、Perplexity、Ollama、Hugging Face 等
    • 缺席方:OpenAI、Anthropic、Google——三家头部闭源实验室均未在首批名单上

    🎯 一句话理解这场博弈

    当开源前沿快速逼近闭源 SOTA,全行业可获取的”最低能力水位”被显著抬高,基础设施和平台公司(英伟达 / 微软 / Meta)天然倾向开放闭源前沿实验室(OpenAI / Anthropic / Google)天然强调安全边界。这场争论将直接影响美国 AI 监管框架、企业本地部署、云厂商竞争和中国模型使用限制。

    七、商业化跃迁:500 亿美元估值、最快半年港股上市

    开源不等于放弃商业化。K3 这一枪打出去后,月之暗面的资本化进程反而加速:

    • 日收入增长至少 6 倍(彭博)
    • ARR:6 月达 3 亿美元(4 月还只有 2 亿)
    • 融资节奏:5 月以 200 亿美元估值完成 20 亿美元融资(美团龙珠领投)
    • Pre-IPO 轮:7/22 报道,8 月启动,目标投前估值 500 亿美元(约 3386 亿元人民币)
    • 港股上市:最快 6 个月内登陆港股
    500 亿
    目标估值(美元)

    6x
    日收入增长倍数

    3 亿
    6 月 ARR(美元)

    6 月
    最快港股上市

    八、一张表:K3 vs Qwen3.8 vs DeepSeek V4 vs Fable 5

    模型 参数规模 开源状态 核心亮点 上手方式
    Kimi K3(月之暗面) 2.8T(激活 1040 亿 / 896 专家) 已开源(修改版 MIT) WebDev Arena 1679 Elo 第一、自研编译器、自研芯片、权重 + Infra 全开 Hugging Face / ModelScope / 昇腾 / 阿里云
    Qwen3.8-Max(阿里) 2.4T(激活未披露) 预览版承诺”很快”开源 双协议兼容、自称仅次 Fable 5 Token Plan / Qoder / QoderWork 预览版
    DeepSeek V4-Pro 1.6T(激活 490 亿) 已开源 推理量仅前代 27%、峰谷计费极致性价比 API 正式商用(7/19 上线)
    Claude Fable 5(参照) 未公开 闭源 公认天花板,FrontierSWE 86.6 API / Claude Code
    GPT-5.6 Sol(参照) 未公开 闭源 综合旗舰,编码被 K3 逼近 API(7/9 全量商用)

    同步观察 OpenRouter 生态

    • 中国开源模型占 OpenRouter 多模型 API 网关路由 token 用量 46.4%,美国模型 35.7%
    • OpenRouter 全球调用量周榜(7/20-7/26)前五全部为中国模型,小米 MiMo-V2.5 登顶
    • 开源模型处理 token 占比从 2026 年 1 月 34% 飙升至 6 月 65%
    • 中国大模型在全球调用量中连续 11 周领跑,开源模型下载量占比 41%
    • Mozilla《开源 AI 现状报告》:开源 vs 闭源平均性能差距缩至 3.3%

    九、对 AI 工具选型的 4 条落地启示

    🎯 给 AI 工具用户的 4 条落地建议

    1. 私有化窗口期已到:K3 权重已落地,量化后约 1.4TB 显存门槛(MaaS 业务可走昇腾 / 真武超节点 Day0 适配),自托管首次具备”前沿性能 + 数据主权”双重价值——闭源模型随时可能涨价、限流、停服,而开源权重一旦落到硬盘里,谁也夺不走。

    2. 换模型成本降至历史最低:K3 兼容 OpenAI / Anthropic 双协议,Cursor / Claude Code / Trae / 各类 Agent 框架改一行配置即可切换。建议对 K3、Qwen3.8、DeepSeek V4 做一轮同题横测再锁定主力模型。

    3. 国产算力链进入”订单验证”阶段:华为昇腾 / 阿里云真武同台首日适配,证明国产超节点已能稳定承载 3 万亿参数 MoE 推理;国产芯片”能用 → 好用”开始进入指数拐点。做企业本地化部署评估时,国产算力首次可以进入”必选”列表而非”备选”。

    4. 编程场景盯紧缓存命中率:K3 官方 API 输入 3 美元 / 缓存 0.3 美元(每百万 token),缓存命中与未命中价差 10 倍——用好提示词缓存 + 投机解码(Draft Model),账单能直接砍一个数量级。

    图灵奖得主萨顿说”我们正迈入经验时代”,K3 这场全栈开源把”经验时代”的入场券几乎免费递到了每个人手里。无论你用不用得动 K3 本身,至少从此,最强模型的权重,不再只锁在几家硅谷公司的服务器里。AI工具导航会持续跟踪 K3 量化版本、MiniTriton 编译器、45nm 芯片原型的后续实测,第一时间带来第一手横评。

    本文综合自:每日经济新闻、新智元、第一财经、北京日报、新浪财经、36 氪、券商中国、界面新闻、硅基见闻、硅基局外人及月之暗面、阿里云、华为 CANN、Hugging Face、Artificial Analysis 官方披露。数据截至 2026 年 7 月 28 日 16:00。


  • 豆包专业版办公任务模式深度解析:68元/月雇一个能操作电脑的AI员工

    💼
    豆包专业版 办公任务模式
    68 元/月雇一个能操作电脑的 AI 员工
    操作本地电脑 · 调用浏览器 · Skills 技能 · 定时任务
    AI
    AI工具导航
    @xcoolevdb · 2026年7月26日

    7 月 25 日,字节跳动豆包专业版上线全新「办公任务模式」——它不再只是对话框里的 AI 助手,而是一个能直接操作你电脑、调用浏览器、执行定时任务的办公 Agent。依托豆包 2.1 Pro 旗舰模型,内置数十项标准化技能并支持自定义搭建,连续包月 68 元。从「你问我答」到「你说目标,我干活」,这标志着国产 AI 办公工具正式进入 Agent 落地元年。

    📑 本文目录

    · 一、为什么 2026 年的 AI 办公需要 Agent?

    · 二、四大核心能力拆解

    · 三、豆包 2.1 Pro:办公任务模式的大脑

    · 四、Skills 技能体系:从标准化到自定义

    · 五、实战场景:它到底能干什么活?

    · 六、68 元/月的性价比账本

    · 七、与竞品对比:三个梯队的 Agent 市场

    · 八、局限与展望

    一、为什么 2026 年的 AI 办公需要 Agent?

    过去两年,AI 办公工具经历了三代进化:第一代是「问答式 AI」,你问一句它答一句;第二代是「对话式助手」,能多轮对话、帮你润色文案;但一个根本问题始终没解决——AI 只能输出文字,不能帮你干活

    艾瑞咨询《2026 中国 AI 办公白皮书》显示,国内白领平均每天 6.2 小时面对电脑,其中 43% 的时间消耗在机械重复操作上:文件归类整理、表格数据搬运、跨系统信息流转、格式转换排版……这些工作不需要创造力,但必须有人盯着屏幕一步步点。

    💡 核心洞察

    办公的真正痛点不是「不会写」,而是「不想干」——大量低价值、重复性的操作占据了人们的时间和注意力。AI 需要从「写给你看」变成「替你干完」。

    豆包专业版办公任务模式的设计逻辑正是如此:不是做一个更会聊天的 AI,而是做一个能动手干活的 AI 员工。你给目标,它规划步骤、调用工具、执行到底,最后把成品交到你手里。

    二、四大核心能力拆解

    办公任务模式的底层架构基于 Agent 范式,包含四大核心能力模块:

    🖥️ 操作本地电脑

    在授权后,AI 可以直接操作电脑中的文件夹、文档、表格。帮你整理资料、归类文件、批量处理文档、修改报表,把原本需要半小时的表格整理工作,几分钟就处理完毕。无需来回切换软件反复操作。

    🌐 自主调用浏览器

    写方案需要行业数据、做汇报需要案例参考,不用一个个点开网页检索筛选。下达需求后,它自动浏览网页,检索、筛选、整合有效资讯,剔除大量无效信息,直接输出整理完毕的参考资料。

    ⚡ Skills 专业技能

    内置数十项标准化技能,覆盖 Office 三件套(文档、表格、PPT)的专业操作,还能做图片视频设计、数据计算、思维导图生成等。一套流程连贯完成,不用反复切换多个工具软件。

    ⏰ 定时任务

    设置好之后,到点自动启动工作流程。定时汇总每日工作台账、定期推送项目进度提醒、自动抓取竞品信息——不用靠大脑硬记一堆截止日期,告别因遗忘任务导致的工作失误。

    4大
    核心能力模块

    数十项
    内置标准化技能

    自定义
    技能搭建支持

    68元
    连续包月价格

    三、豆包 2.1 Pro:办公任务模式的大脑

    办公任务模式的推理引擎是豆包 2.1 Pro 旗舰模型。相比普通对话模型,它针对 Agent 场景做了专项优化:

    1. 任务规划能力

    理解一个复杂目标后,自动拆解为可执行的步骤序列。比如你说「帮我准备明天项目汇报的材料」,它会分解为:抓取项目进度数据 → 整理关键指标 → 生成 PPT 大纲 → 填充内容 → 排版美化。

    2. 工具调用能力

    在任务执行过程中,根据步骤需要自主选择和调用合适的工具——需要查资料就打开浏览器,需要做 PPT 就调用 Office 技能,需要汇总数据就操作 Excel。每一步的工具选择和参数配置都是自动完成的。

    3. 自主纠错能力

    执行任务时如果某一步失败了(比如网页打不开、文件格式不对),不会直接报错停止,而是自动换一种方式重试。这种「自己给自己 debug」的能力,是从聊天 AI 到办公 Agent 的关键跨越。

    「从 OpenAI 的企业客服智能体 Presence,到智能体手机集中亮相 WAIC,再到豆包办公 Agent——2026 年下半年的主题词已经清晰:智能体正在真正上岗,从能聊走向能干活。」

    四、Skills 技能体系:从标准化到自定义

    技能体系是办公任务模式的核心卖点,也是它区别于普通 AI 对话助手的关键:

    标准化技能(开箱即用)

    Office 三件套:文档起草排版、表格数据处理、PPT 大纲生成与美化

    信息检索:网页信息抓取、竞品动态监控、行业报告摘要

    数据处理:数据清洗、格式转换、统计分析、图表生成

    内容创作:文案撰写、图片设计、视频脚本

    效率工具:思维导图、会议纪要整理、邮件起草

    自定义技能(按需搭建)

    标准化技能覆盖了大多数通用场景,但每个人的工作流程都有个性化需求。办公任务模式支持用户自定义搭建技能,把高频操作封装成可复用的流程模板。比如:

    「每天早上 8 点自动抓取竞品官网更新,整理成表格,发到工作群」

    「每周五下午自动汇总本周工作台账,生成周报初稿」

    「收到新邮件后,自动提取关键信息,更新到项目管理表」

    ⚠️ 使用提示

    AI Agent 的能力上限取决于使用者的需求拆解能力。同样一个工具,有人只会让它「帮我写个邮件」,有人能拆解出完整的工作流自动化方案。差距不在 AI,在人。68 元买的是工具,不是结果。

    五、实战场景:它到底能干什么活?

    场景一:课件制作

    告诉豆包「帮我做一份《安全生产管理》第四章的课件 PPT,15 页左右,风格简洁清晰,每页配上讲解文案」。几分钟后,一份完整的 PPT 已经生成——内容扎实、排版整齐,连每页的逐字稿都配好了。你要做的就是微调细节,加入自己单位的案例。

    场景二:成绩汇总与分析

    考试结束后,让豆包自动汇总各科成绩,生成分析报告:平均分、及格率、分数段分布、薄弱知识点识别。原本需要两小时的统计工作,十分钟搞定。

    场景三:跨应用信息流转

    这是办公任务模式的杀手级场景:自主检索本地电脑文件夹中的零碎素材,自动读取特定文档中对应日期的文案内容,跨应用打开浏览器,在官方账号上自主发布一条定时内容。从文件到浏览器到社交平台,一条指令串联三个应用。

    场景四:定时数据看板

    设置好定时任务,每天早上自动抓取指定数据源,更新数据仪表盘,推送关键指标异动提醒。不用每天手动刷新,到点自动交付。

    六、68 元/月的性价比账本

    68 元/月是什么概念?一天 2 块多钱。我们来算一笔账:

    对比项 人工成本 豆包专业版
    每天机械重复操作 2.5 小时 × 时薪 40 元 = 100 元/天 68 元/月(全月)
    文件整理归类 30 分钟/次 3 分钟/次
    跨系统信息搬运 20 分钟/次 1 分钟/次
    周报/汇报制作 1-2 小时/周 10 分钟/周
    网页信息检索整理 40 分钟/次 5 分钟/次
    💰 性价比结论

    如果办公任务模式每天能帮你省出 30 分钟的机械操作时间,按白领平均时薪计算,一个月省下的时间价值远超 68 元。关键不在于 AI 能不能替代你,而在于它能不能把你从低价值劳动中解放出来,让你把时间花在真正需要创造力和判断力的工作上。

    七、与竞品对比:三个梯队的 Agent 市场

    2026 年下半年的 AI Agent 市场已经悄然形成三个梯队:

    维度 第一梯队:企业级 Agent 平台 第二梯队:消费级办公助手 第三梯队:系统级 AI 助手
    代表产品 WorkBuddy、CodeBuddy NPC 豆包专业版 小艺 Claw、Step AOS
    定价 企业定制(万元级/年) 68 元/月 系统集成(设备自带)
    交付深度 企业级可靠性、全流程闭环 个人办公场景全能助理 设备级系统操控
    核心能力 流程编排 + 团队协同 + 治理合规 Skills 技能 + 定时任务 + 浏览器 系统级接口 + 跨应用操控
    适用人群 中大型企业研发/运营团队 白领/教师/自由职业者 手机/设备用户
    门槛 高(需企业部署) 极低(下载即用) 零(买设备自带)

    三个梯队的差距本质上不是模型谁更强,而是交付深度不同。豆包用标准化 Skills 把高频场景封装成产品,交付轻但覆盖面广;第一梯队解决「企业级可靠性」问题,第二梯队解决「个人级可用性」问题,第三梯队解决「无处不在」的问题。

    值得注意的是,豆包专业版办公任务模式还具备一个独特优势:零代码在线应用生成。它不仅能操作电脑,还能直接创建、修改和一键部署网站应用——数据仪表盘、项目管理看板、活动报名系统,支持后端数据库,配备完善的访问权限管理。这在 68 元/月的价位上几乎没有竞品。

    八、局限与展望

    客观来看,豆包专业版办公任务模式也有值得关注的局限:

    能力边界待验证:作为 7 月 25 日刚上线的新功能,能干多少活、干得多靠谱,还需要大规模用户验证。Agent 场景的稳定性是长期考验。

    安全与隐私:操作本地电脑意味着 AI 需要访问你的文件系统,虽然基于授权机制,但企业用户对数据安全的顾虑仍然存在。办公场景的敏感数据处理需格外谨慎。

    技能自定义门槛:标准化技能开箱即用,但自定义技能搭建需要使用者具备一定的流程拆解能力。对不擅长结构化思考的用户,可能只停留在用标准化技能的层面。

    模型能力天花板:Agent 的上限取决于底层模型,复杂的多步骤推理和跨场景协调仍有提升空间。尤其是需要强逻辑推理的财务分析、法律审查等场景,当前仍需人工复核。

    但方向是清晰的:2026 年 AI 办公工具的竞争,已经从「谁的对话更流畅」转向「谁能真正替你干活」。豆包专业版办公任务模式是国内消费级 AI 办公领域打出的重要一枪——不卷参数,不拼价格,只解决一个朴素问题:让你少一点机械操作,多一点思考空间。

    📌 一句话总结

    豆包专业版办公任务模式 = 豆包 2.1 Pro 大脑 + 操作本地电脑 + 浏览器调用 + Skills 技能体系 + 定时任务 + 在线应用生成。68 元/月,它不是一个更会聊天的 AI,而是一个能帮你干活的数字员工。对于每天被机械操作淹没的办公族,这可能是 2026 年最值得试用的 AI 工具之一。

    #豆包专业版
    #办公任务模式
    #豆包2.1Pro
    #AI办公
    #Agent
    #Skills技能
    #定时任务
    #字节跳动
    #AI工具导航
  • 腾讯云CodeBuddy NPC深度解析:首个流程原生研发智能体,首轮Token降超90%






    腾讯云CodeBuddy NPC深度解析:首个流程原生研发智能体,首轮Token降超90%






    🤖
    腾讯云 CodeBuddy NPC 深度解析
    首个「流程原生」研发智能体
    AI 住进代码仓库 · 首轮 Token 降超 90% · NPC Team 协同交付
    AI
    AI工具导航
    @xcoolevdb · 2026年7月24日

    7 月 23 日,腾讯云发布 CodeBuddy NPC——这不是又一个「AI 写代码」工具,而是一个能住进 Git 仓库、读懂 Issue、自己交 PR、看 CI 失败自动修的云端研发智能体。NPC 代表 Non-Player Collaborator(非玩家协作者),它的核心逻辑是:AI 不再是编辑器里的辅助工具,而是研发流程里的「原住民」。官方首轮 Token 消耗从 2 万+ 降至约 2000,降幅超 90%,企业无需改造工具链即可接入。

    📑 本文目录

    · 一、发布背景:为什么 2026 年需要「流程原生」智能体?

    · 二、核心创新:AI Native Git——让 AI 拥有研发记忆

    · 三、NPC Team:多角色协同,从游戏开发到企业研发

    · 四、Token 优化方法论:首轮压到 2000 的四步法

    · 五、与本地 AI 编程工具的本质区别

    · 六、CNB 平台底座:8 年积淀的研发基础设施

    · 七、对企业研发的 5 条启示

    · 八、局限与展望

    一、发布背景:为什么 2026 年需要「流程原生」智能体?

    过去两年,AI 编程工具从代码补全(Copilot 时代)进化到多文件理解(Cursor 时代),再到终端 Agent(Claude Code / Codex 时代)。但一个根本问题始终没解决:AI 和研发流程是割裂的

    据中国信通院《2026 企业研发效能白皮书》,国内中大型科技企业平均每个新功能从需求提出到线上可用仍需 11.7 天,其中近 40% 耗在沟通对齐、环境配置、PR 反复驳回与 CI 调试上。平均每个研发人员每天要在 Jira、Git、SonarQube、Prometheus、飞书、钉钉等 11.3 个系统间切换,上下文丢失率高达 42%。

    💡 核心洞察

    企业痛点不是编码速度不够,而是 AI 与研发流程割裂。AI 不在团队的代码仓库里、不接团队的构建和验证流程,成了一个游离在流程之外的旁观者。

    腾讯云的解法不是做「更好的代码补全」,而是让 AI 直接住进研发流程——这就是 CodeBuddy NPC 的设计起点。

    二、核心创新:AI Native Git——让 AI 拥有研发记忆

    CodeBuddy NPC 提出了「AI Native Git」技术范式,将 Git 仓库及相关研发资产转化为 AI 的原生工作上下文:

    📋 Issue → 需求记忆

    记录任务、背景与目标。开发者在 Issue 中 @NPC 即可下发任务,无需手动复制需求。

    📁 代码仓库 → 工程记忆

    承载项目结构、依赖关系与演进历史。NPC 直接读取仓库代码,理解项目架构。

    🔀 PR → 变更记忆

    沉淀方案、代码与评审反馈。NPC 自主提交 PR,并附带变更说明和风险标注。

    ✅ CI/CD → 质量记忆

    记录构建结果、失败原因与修复过程。CI 失败时 NPC 自动定位问题、修复代码并重新执行。

    有了这四层「研发记忆」,NPC 的工作方式从「一次性生成代码」变为「持续完成研发任务」。它像一位新入职的同事:先读项目文档,了解架构决策,再开始干活——而不是每次都从零开始。

    三大典型场景

    1. 开发网站

    自动读取需求和项目代码,完成开发、提交 PR,并生成预览环境。整个过程在 Issue 中 @NPC 一步触发。

    2. 自主解决代码冲突

    当多人协作产生合并冲突,NPC 自动处理冲突、修改代码、重新提交,无需人工介入。

    3. 自动修复 CI

    CI 失败后,NPC 自动定位问题、修复代码并重新执行,循环迭代直到通过质量门禁。这是「AI Native Git」闭环的典型体现:提交 → 验证 → 修复 → 再验证。

    三、NPC Team:多角色协同,从游戏开发到企业研发

    单 Agent 能力有上限,复杂研发任务需要多角色协同。CodeBuddy NPC 支持通过四个维度编排专属 NPC 团队:

    Role
    角色定义

    SOP
    标准流程

    Skill
    技能配置

    Team
    团队编排

    官方演示:零人工干预完成游戏全流程开发

    腾讯云用一支 NPC Team 全程零人工干预完成了一款游戏开发:

    项目经理 NPC:需求拆解与任务分配

    剧本、美术、配乐、配音 NPC:分别完成内容创作

    资产整合 NPC:汇总代码与素材

    代码评审 NPC + 测试 NPC:完成最终验证

    关键特性:一个 NPC 的输出可以直接成为下一个 NPC 的输入,任务、代码、素材和测试结果持续沉淀在同一个项目中。

    🏢 企业定制示例

    企业可以通过 Role、Skill、SOP 和 Team 编排自己的 NPC Team。例如:产品 NPC 负责需求澄清,技术 Leader NPC 生成技术方案,开发 NPC 协同编码验证,交付分析 NPC 回收数据反哺流程优化——定义一个完整的「AI 原生团队」。

    四、Token 优化方法论:首轮压到 2000 的四步法

    Agent 执行一次任务需要多轮 LLM 调用,每轮都把系统提示词和工具描述重新发给模型。首轮 Token 是每轮都要「带着走」的固定成本——压得越小,后续每一轮都跟着省,形成「滚雪球」式节约。

    腾讯云沉淀出一套 Agent 能效优化方法论,四个方向:

    方向 具体做法 效果
    做减法 裁剪冗余工具、精简描述、消除二义性 减少无效 Token 传递
    立规矩 把 SOP 写进提示词,让模型少走弯路 减少自行试错轮次
    提效率 CLI 紧凑输出、Cache 去重叠、降低工具调用轮次 压缩每轮 Token 消耗
    标准化 对 Skill、CLI、系统工具持续调优 长期成本基线持续下降
    2万+
    优化前首轮 Token

    ~2000
    优化后首轮 Token

    >90%
    首轮 Token 降幅

    滚雪球
    多轮累计节约效应

    此外,企业还可根据任务复杂度灵活配置模型策略:简单任务调用低成本模型(如 DeepSeek),复杂研发任务调用更强模型(如 GLM),多模态任务在云端容器沙箱中运行相应模型——在性能与成本间取得平衡。

    五、与本地 AI 编程工具的本质区别

    CodeBuddy NPC 和 Cursor、Claude Code、Copilot 等「本地辅助」工具的核心区别不在功能数量,而在工作范式的根本差异

    维度 本地 AI 编程工具 CodeBuddy NPC
    运行位置 本地 IDE / 终端 云端,依托 CNB 平台
    上下文来源 当前打开的文件 / 项目 Issue + 仓库 + PR + CI 全流程
    工作模式 辅助编写,需人工逐行确认 自主闭环,从需求到交付
    记忆能力 会话级,重启后丢失 研发记忆,跨会话持续
    协作方式 人 + AI(1:1) 多 NPC Team 协同(N:N)
    交付物 代码片段 / 文件修改 可验收的完整成果(PR + 测试 + 文档)
    成本控制 按 API 调用计费 Token 优化 + 模型路由 + 企业级治理
    「我们并不希望行业再多一个『更会写代码』的工具,而是希望企业真正拥有一个能理解研发上下文、遵守团队流程、持续交付结果的 AI 队友。」——黄友昆,腾讯云 CodeBuddy、CNB 产品负责人

    简言之:本地工具解决「写代码快不快」的问题,CodeBuddy NPC 解决「交付稳不稳」的问题。两者不是替代关系,而是互补——本地工具管编码体验,NPC 管流程闭环。

    六、CNB 平台底座:8 年积淀的研发基础设施

    CodeBuddy NPC 不是凭空诞生的产品,它深度依托腾讯云 CNB(Cloud Native Build)研发平台,后者自 2018 年起在腾讯内部持续迭代:

    Git 代码托管:支撑百 G 乃至 TB 级超大仓库(含模型文件)

    CI/CD 流水线:与 NPC 的「提交→验证→修复→再验证」闭环深度集成

    制品库:构建产物标准化管理

    云原生开发环境:容器沙箱 + 开源模型,扩展多模态 NPC 能力

    8年+
    CNB 平台积淀

    10万+
    月活开发者

    CNB 支撑了腾讯文档、腾讯广告、手机 QQ 等高频迭代业务,覆盖物流、消费电子、零售、金融等多个行业。更重要的是,CNB 为国内开发者提供了自主可控、数据合规的研发协作环境——在企业级场景下,这是海外 SaaS 工具难以提供的。

    七、对企业研发的 5 条启示

    1. 从「给每个人发 AI 工具」到「让 AI 重构协作方式」

    腾讯的实践不是把 AI 工具分发给每个人就结束,而是围绕 AI 重构协作方式:PM 发起任务 → AI 参与需求澄清与任务拆解 → 技术 Leader 与 AI 共建方案 → 研发与 AI 协同开发验证 → 交付分析回收数据反哺优化。这是一个闭环。

    2. 开发者角色从「生产者」变为「监督者 + 规则制定者」

    当 NPC 能独立闭环交付,开发者的核心价值不再是写代码的速度,而是:定目标、做决策、验收成果、制定规则(SOP)让 NPC 更好地工作。

    3. 不改造工具链,AI 就无法真正落地

    很多企业买了 AI 编程工具却发现用不起来,根因是工具和现有流程割裂。CodeBuddy NPC 的做法是:不要求企业改造任何工具链,直接在现有 Git、TAPD、构建发布流程中接入。

    4. Token 成本是 Agent 落地的隐形成本

    Agent 多轮调用的 Token 成本往往被低估。首轮 Token 压缩 90% 带来的是多轮累计的指数级节约。企业在选型时应关注 Agent 的 Token 效率,而不仅是单次调用价格。

    5. 可信交付 > 黑箱输出

    NPC 的所有操作留痕可溯、权限可控、审计合规。在企业级研发中,「AI 交付的结果可验收」比「AI 写的代码多快」重要得多。

    八、局限与展望

    客观来看,CodeBuddy NPC 也有值得关注的局限:

    平台绑定:深度依托 CNB 平台,对非腾讯云用户存在迁移成本

    场景聚焦:当前主要面向企业级研发流程,个人开发者/小团队的轻量场景可能不是最优解

    早期产品:多角色 NPC Team 的编排复杂度较高,SOP 编写和调试需要学习成本

    模型依赖:效果受底层模型能力制约,复杂架构决策仍需人类把关

    但方向是清晰的:2026 年 AI 编程工具的竞争,已经从「谁的模型更强」转向「谁的流程更闭环」。CodeBuddy NPC 是国内云厂商在这个赛道上打出的重要一枪——不卷参数,不拼算力,只解决一个朴素问题:让写代码的人,少一点机械劳动,多一点创造快感。

    📌 一句话总结

    CodeBuddy NPC = AI Native Git + 研发记忆 + NPC Team + Token 优化 + CNB 底座。它不是在帮开发者写代码,而是在替开发者跑流程——从需求到交付,全链路闭环,企业无需改造工具链。对于正在评估 AI 研发工具的企业,这是一个值得认真试用的新选项。

    #CodeBuddyNPC
    #腾讯云
    #云端研发智能体
    #AINativeGit
    #NPCTeam
    #Token优化
    #CNB
    #AI编程
    #研发流程
    #AI工具导航


  • WAIC 2026闭幕盘点:Kimi K3开源2.8万亿参数、Qwen3.8宣战Fable 5,具身智能从舞台走进车间






    WAIC 2026闭幕盘点:Kimi K3开源2.8万亿参数、Qwen3.8宣战Fable 5,具身智能从舞台走进车间






    🌐
    WAIC 2026 闭幕盘点
    Kimi K3 开源 2.8 万亿 · Qwen3.8 深夜宣战
    具身智能进车间 · 世界AI合作组织落户上海
    AI
    AI工具导航
    @xcoolevdb · 2026年7月20日

    7 月 20 日,为期四天的 2026 世界人工智能大会(WAIC 2026)在上海闭幕。300+ 新品全球首发、162 亿元意向签约只是表面数字——真正的信号是:Kimi K3 以 2.8 万亿参数开源登顶代码榜、阿里 Qwen3.8 深夜官宣 2.4 万亿直指 Fable 5、人形机器人集体”进厂打工”、29 国签约成立世界人工智能合作组织。AI 正式从”能聊天”进入”能干活”时代。

    📑 本文目录

    · 一、四天大会,先用一组数字看懂

    · 二、模型第一弹:Kimi K3——2.8万亿开源”深水炸弹”

    · 三、模型第二弹:Qwen3.8-Max——阿里深夜官宣2.4万亿

    · 四、模型第三弹:商汤U1 Pro + 昆仑万维世界模型

    · 五、一张表看懂:WAIC国产旗舰模型横评

    · 六、具身智能:机器人不跳舞了,开始拧螺丝

    · 七、两条暗线:全球治理与国产算力

    · 八、对AI工具选型的4条启示

    一、四天大会,先用一组数字看懂

    WAIC 2026(7月17-20日,上海)是今年全球 AI 产业密度最高的四天。闭幕日的核心数据如下:

    300+
    全球首发新品

    1100+
    参展企业

    162亿
    意向签约金额(元)

    57个
    实体应用场景落地

    值得注意的一个比例:300 多款首发新品中,60% 以上是可直接落地的行业解决方案,不是炫技 Demo。大会同期展出的还有 261 款大模型和 208 款具身智能终端。产业底盘方面,2025 年中国 AI 核心产业规模已突破 1.2 万亿元、企业超 6200 家、全球 60% 的 AI 专利在中国手里,AI 渗透率超过 86%——每 10 个中国人里近 9 人每周至少用一次 AI。

    🎯 一句话总结本届 WAIC

    去年机器人还在台上跳舞翻跟头,今年全部进了车间;去年大模型还在比谁跑分高,今年直接开源万亿参数”掀桌子”。AI 从 PPT 走进了车间、药房、仓库和手机。

    二、模型第一弹:Kimi K3——2.8万亿开源”深水炸弹”

    7 月 17 日凌晨(大会开幕当天),月之暗面正式发布新一代旗舰大模型 Kimi K3,这是本届 WAIC 期间分量最重的一颗”炸弹”:

    • 规模:2.8 万亿总参数,超越 DeepSeek-V4-Pro 的 1.6 万亿,成为目前全球参数量最大的开源权重模型,把开源阵营抬进 3 万亿级别。
    • 架构:MoE 混合专家(896 个专家、每 token 激活 16 个),基于 KDA(Kimi Delta Attention)混合线性注意力 + 注意力残差技术,整体扩展效率比 K2 提升约 2.5 倍;100 万 token 上下文,原生支持视觉理解。
    • 跑分:发布数小时即登顶 Arena 代码榜(1679 分),中国大模型首次拿下该榜第一;SWE Marathon 长程编程 42.0 分第一;FrontierSWE 81.2 分,仅次于 Claude Fable 5(86.6)、高于 GPT-5.6 Sol(71.3)。
    • 长任务案例:连续 48 小时自主 Agent 运行,基于开源 EDA 工具独立完成一款芯片的构建、优化与验证(100MHz 时序收敛、仿真吞吐超 8700 token/秒);另一案例中整理 42 年 AI ASIC 产业资料,经历 120 多轮自我迭代、约 2800 次网页搜索、处理 87 份季度报告和 99 份原始 PDF。
    💰 API 定价与开源节奏

    · 输入:缓存命中 2 元 / 未命中 20 元(每百万 token),官方称编程场景缓存率超 90%

    · 输出:100 元 / 每百万 token;第三方测算单任务成本约 0.94 美元,约为 Claude Opus 4.8 的一半

    · 完整模型权重将于 7 月 27 日前发布,官方建议在至少 64 个加速器的超级节点上部署

    市场反应立竿见影:发布次日纳指期货盘前跌逾 1.8%,摩根大通称之为“DeepSeek 2.0 时刻”;马斯克在评论区留言”Impressive”。公司层面,Kimi ARR 已突破 3 亿美元,新一轮融资投前估值达 315 亿美元(半年前仅 43 亿美元),最快 6 个月内有望港股上市。

    值得称道的是,月之暗面官方主动列出了三条局限:对历史思考内容敏感(中途换框架质量不稳)、简单场景下可能”过于主动”替用户做非预期判断、整体用户体验仍落后 Fable 5 与 GPT-5.6 Sol。这种坦率反而增加了跑分的可信度。

    三、模型第二弹:Qwen3.8-Max——阿里深夜官宣2.4万亿

    Kimi K3 发布不到 72 小时,7 月 19 日深夜,阿里通义千问官方账号甩出一句话:“这可能是除了 Fable 5 外,最强大的模型。”——Qwen3.8-Max 预览版正式亮相:

    • 规模:2.4 万亿总参数,千问团队首个超 1 万亿参数的多模态模型,可处理文本、图像、视频与文档。上一代 Qwen3 开源旗舰(2025年4月)总参数才 2350 亿——一年出头翻了约 10 倍。
    • 上手:预览版已首发上线阿里 Token Plan、Qoder、QoderWork 三大入口,按标准定价 10% 计费;Token Plan 个人版 Lite 档低至 39 元/月。API 同时兼容 OpenAI 与 Anthropic 两套协议,Cursor、Claude Code 等工具基本不用改配置即可切换。
    • 开源承诺:官方明确正式版”很快开源全部权重”——但截至闭幕日,未公布日期、许可证与 Hugging Face 仓库。
    • 生态位:Qoder 已占中国 AI 编程市场 47.6% 的营收份额,超过第二到第五名总和;千问的 AI 耳机、AI 眼镜也在本届 WAIC 亮相。

    🧊 需要泼的三盆冷水

    1. “仅次于 Fable 5″是阿里内部评测口径,尚无第三方公开跑分;激活参数量未披露,2.4 万亿只是总量。

    2. 有开发者反馈预览版”幻觉率颇高”,稳定性待观察。

    3. 万亿级模型私有化部署门槛极高(至少 8 张 H100 级别显卡),中小团队短期仍只能靠 API。

    至此,国产开源阵营形成“万亿俱乐部”三强:Kimi K3(2.8T)、Qwen3.8(2.4T)、DeepSeek V4-Pro(1.6T,7月19日正式版上线,峰谷计费后 V4 Flash 每百万输出 token 低至 0.28 美元)。美国 AI 社区已有预测:接下来几个月中国将出现一波开源模型浪潮。

    四、模型第三弹:商汤U1 Pro + 昆仑万维世界模型

    商汤 SenseNova U1 Pro:告别”抽卡”的交付级多模态

    7 月 18 日,商汤发布旗舰多模态模型 SenseNova U1 Pro,定位”面向长程任务的交付级原生多模态智能体基座”。它解决的是 AI 绘图最大的痛点——反复刷新”抽卡”:模型自带完整创作逻辑(看懂需求→规划画面→生成内容→自查漏洞→自动修正),原生支持 8K 超清输出,图文混排出错率极低。

    现场展示的三个案例颇具说服力:独立完成 WAIC 九周年 4:1 超宽水墨长卷(高密度文字地标清晰可辨);一次性产出《沙影之刃》22 个逻辑一致的连续分镜;配合办公助手”小浣熊”走完”收集信息—分析数据—可视化报告”全流程。底层依托自研 NEO-unify 统一架构,打通文字理解与图像生成。目前测试版定向邀请中,完整版将于 8 月上线。

    昆仑万维:宣布”2026为世界模型元年”

    7 月 19 日,昆仑万维在 WAIC 专场宣布核心模型矩阵升级:Matrix-Game 3.5 世界模型(5B 参数、720p 分辨率单卡 20FPS 实时生成、1 分钟记忆能力,已积累超 500 万高质量视频切片、覆盖 1200 余个游戏场景)、Mureka v9.5 与 O3 音乐模型。董事长兼 CEO 方汉判断:过去两年 AI 的核心命题是”生成”,从 2026 年起转向“理解”与”交互”——让 AI 真正理解物理世界运行规律并与真实环境闭环互动。

    五、一张表看懂:WAIC国产旗舰模型横评

    模型 参数规模 开源状态 核心亮点 上手方式
    Kimi K3(月之暗面) 2.8T(激活16/896专家) 权重 7/27 前发布 Code Arena 第一、100万上下文、原生视觉 Kimi 网页/App、Kimi Work、API 已上线
    Qwen3.8-Max(阿里) 2.4T(激活量未披露) 承诺”很快开源”,无日期 万亿级多模态、双协议兼容、官方自称仅次 Fable 5 Token Plan/Qoder/QoderWork 预览版(1折)
    DeepSeek V4-Pro 1.6T(激活490亿) 已开源 推理量仅前代27%、峰谷计费极致性价比 API 正式商用(7/19上线)
    SenseNova U1 Pro(商汤) 未披露 基础版 U1 已开源 交付级多模态、8K 原生、告别抽卡 测试版定向邀请,完整版 8 月上线
    Claude Fable 5(参照) 未公开 闭源 公认天花板,FrontierSWE 86.6 API / Claude Code
    GPT-5.6 Sol(参照) 未公开 闭源 综合旗舰,编码被 K3 逼近 API(7/9 全量商用)

    一个清晰的趋势:国产模型发布节奏已到”每48小时一炸”——7/17 Kimi K3、7/19 DeepSeek V4 正式版 + Qwen3.8、7/20 百度秒哒3.5/京东JoyAI矩阵/面壁 MiniCPM-Robo 等集中亮相。硅谷一年发一次旗舰,中国一个月发五次。

    六、具身智能:机器人不跳舞了,开始拧螺丝

    本届 WAIC 具身智能赛道聚了 200 多家企业,但气质完全变了——没人再比谁的机器人翻跟头翻得溜,都在讲”进厂了几个””在哪条产线跑””不良率降了多少”:

    🏆 智元 远征A3 Ultra(镇馆之宝)

    174cm 身高、700TOPS 算力,能搬货、能锁螺丝、24 小时连轴转,已在宁德时代产线上跑。智元还在三地四馆部署 60 台机器人做导览、问询、零售——不是 Demo,是真干活。

    📦 京东物流 精灵G2 Max

    直接扔进智狼仓做入库、搬箱、码垛,24 小时不间断。人形机器人第一次在真实仓储常态化上岗

    💊 蚂蚁灵波 智慧药房(镇馆之宝)

    三台不同形态机器人协作,接单、取药、打包 90 秒搞定,已在国大药房上海门店运营。

    🤖 宇树 GD-01 载人变形机甲

    3 米高、500 公斤、人形四足自由切换,售价 390 万。马斯克都转发说”太帅了”。不卖量,卖的是”中国能做出这东西”这张名片。

    产线级突破同样实在:复旦大学与新智具身联合研发的视觉触觉融合系统,已在上汽智己车灯装配线运行——装配精度 0.1 毫米、不良率降低 85%;西门子正式面向中国市场发售 Eigen 工程智能体,可独立完成工业自动化工程从需求分析到系统验证的全流程;成立仅一年半的松应科技凭 ORCA OS(多形态机器人协同训练物理 AI 操作系统)拿下西门子战略合作。工信部预计,2026 年中国人形机器人全年产量将突破 10 万台

    七、两条暗线:全球治理与国产算力

    暗线一:29国签约,AI有了”正经组织”

    开幕式当天最重磅的消息不是任何新品,而是世界人工智能合作组织正式成立——29 个国家代表现场签约,永久总部落户上海。中方同时宣布提供 5000 个 AI 专题研修名额、建设国际 AI 应用合作中心、推动”妈祖”气象预警方案在 30 国落地。大会还发布了《智能体互信互联互操作全球合作倡议》,腾讯、京东、西门子、亚马逊等 200 多家中外企业加入,要做三件事:统一智能体通信协议、开放头部平台接口、建立可追溯身份认证机制。

    说人话:以后你家的 AI 客服和我家的 AI 销售能直接对话办事。标准一旦定下来,跟进的就是真金白银的订单。IDC 也在大会期间发布行业首份《DAA 研究报告》:2026 年全球数字 AI 智能体数量将达 7940 万个,2030 年预计突破 22.16 亿个。

    暗线二:国产算力从”能用”到”组集群”

    十大”镇馆之宝”里算力相关占了半壁江山:华为 Atlas 950 超节点(单柜 64 张昇腾卡、最大扩展 8192 卡,1024 卡集群”像一台计算机一样协同工作”)首次真机展出;曙光 8000 全国产十万卡 AI 超集群已接入国家超算互联网;阿里真武 M890(144GB 显存、800GB/s 片间互联、原生支持 FP32 到 FP4 全精度)、中兴 OEX 超节点同台亮相。全场 108 款芯片集中展示、200 多家智算企业参展。

    政策面同步加码:七部委 7 月 15 日联合发布智算中心建设新政——国资新建智算中心核心硬件国产化比例 ≥75%,采购国产服务器/HBM/先进封装设备可申领最高 30% 财政补贴,万卡机房强制配套液冷。国产算力正从”概念”进入”订单验证”阶段。

    八、对AI工具选型的4条启示

    🎯 给AI工具用户的4条落地建议

    1. 开源选型进入窗口期:Kimi K3 权重 7/27 放出、Qwen3.8 开源在即,有私有化部署需求的团队现在就该评估算力门槛(K3 建议 64 卡超节点)与许可证条款,等权重落地直接开跑。

    2. 换模型的成本已降到历史最低:Qwen3.8 同时兼容 OpenAI 与 Anthropic 双协议,Cursor/Claude Code 等工具改一行配置即可切换。建议对 K3、Qwen3.8、DeepSeek V4 做一轮同题横测再锁定主力模型。

    3. 编程场景盯紧缓存命中率:Kimi 官方缓存率超 90%,命中与未命中输入价差 10 倍——用好提示词缓存,API 账单能直接砍一个数量级。

    4. “能干活”取代”能聊天”成为验收标准:本届 WAIC 60% 首发是可落地解决方案。选工具就看三点——能不能进你的真实流程、能不能接你的业务数据、一线员工用不用得起来。

    图灵奖得主萨顿在主论坛说:”现在的 AI 还不算真智能——但我们正迈入经验时代,势不可挡。”四天的 WAIC 2026 证明了一件事:AI 的竞争已从参数比拼进入交付能力比拼。对普通用户和中小企业,这是最好的时代——最强的模型能力,正在以开源和低价两种方式同时变得触手可及。AI工具导航会持续跟进 Kimi K3 权重发布(7/27)与 Qwen3.8 正式版,第一时间带来实测横评。

    本文综合自:每日经济新闻、证券时报、四川观察WAIC观察、搜狐科技、澎湃新闻、凤凰网、开源证券/东吴证券研报及月之暗面、阿里通义、商汤官方披露。数据截至 2026 年 7 月 20 日 16:00。


  • DeepSeek V4正式商用上线:峰谷计费如何帮开发者砍掉一半API账单






    DeepSeek V4正式商用上线:峰谷计费如何帮开发者砍掉一半API账单






    🧠
    DeepSeek V4 正式商用上线
    万亿参数双版本齐发 · 国内首创峰谷分时计费 · 夜间算力降50%
    从预览版到正式版,六大核心变化全解析
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026-07-16
    DeepSeek V4正式商用上线:峰谷计费如何帮开发者砍掉一半API账单
    7月15日,国产万亿参数大模型DeepSeek V4正式版全量开放商用。Pro旗舰版1.6万亿参数+Flash轻量版2840亿参数双版本齐发,全系标配100万Token超长上下文,国内首创算力峰谷分时计费模式——高峰时段价格翻倍,夜间算力下调50%。这对开发者和企业意味着什么?本文从模型升级、计费变革、架构创新、性能对标、国产适配、成本优化六大维度深度拆解。
    📋 目录

    一、正式版来了:从预览版到商用的六大变化

    二、峰谷计费详解:不是涨价,是给你省钱的机会

    三、双版本怎么选:Pro vs Flash 实战指南

    四、架构创新:为什么V4能又强又便宜

    五、性能对标:跑到了什么位置

    六、国产适配:昇腾NPU原生支持

    七、开发者省钱四条实战策略

    八、总结与展望

    一、正式版来了:从预览版到商用的六大变化

    4月24日,DeepSeek V4预览版悄然上线,以1.6万亿参数、100万上下文、MIT开源三大标签震动全球AI社区。三个月后的7月15日,V4正式版终于全量开放商用,带来了远不止”修bug”级别的升级。

    1.6T
    V4-Pro 总参数
    284B
    V4-Flash 总参数
    100万
    Token 上下文窗口
    -50%
    夜间算力价格降幅

    正式版六大核心变化:

    峰谷分时计费:国内首创,高峰时段(9-12点、14-18点)价格翻倍,其余时段保持原价,引导错峰使用

    性能提升:官方邮件明确表示正式版带来”更多功能优化和性能提升”,推理能力进一步增强

    多模态支持:预览版仅支持纯文本,正式版视图模式已重新上线,识别速度和准确率均有提升

    API兼容升级:旧接口 deepseek-chat 和 deepseek-reasoner 将于7月24日停服,需迁移至 v4-pro/flash

    缓存机制优化:缓存命中价格极低(Pro仅0.025元/百万tokens),命中率Pro达95%、Flash达91%

    国产算力验证:昇腾950PR计算性能达H20的2.87倍,待昇腾950批量上市后Pro价格还将大幅下调

    二、峰谷计费详解:不是涨价,是给你省钱的机会

    很多开发者看到”高峰翻倍”第一反应是涨价,但仔细算账会发现,峰谷计费本质上是给会规划的人省钱,给不规划的人加价

    2.1 时段划分与价格

    高峰时段:工作日 9:00-12:00、14:00-18:00(每天7小时)

    谷时时段:其余所有时间,包括工作日12:00-14:00午休、18:00-次日9:00夜间、周末全天、节假日

    模型/计费项 谷时价格 峰时价格 涨幅
    V4-Pro 输入(缓存命中) 0.025 元/M 0.05 元/M +100%
    V4-Pro 输入(缓存未命中) 3 元/M 6 元/M +100%
    V4-Pro 输出 6 元/M 12 元/M +100%
    V4-Flash 输入(缓存命中) 0.02 元/M 0.04 元/M +100%
    V4-Flash 输入(缓存未命中) 1 元/M 2 元/M +100%
    V4-Flash 输出 2 元/M 4 元/M +100%
    💡 关键发现

    缓存命中的价格极低,且峰谷时段差异对缓存命中影响微乎其微。Pro缓存命中仅0.025元/百万tokens,与缓存未命中的3元相差120倍。这意味着:把系统提示词和常用上下文缓存好,是抵抗峰时涨价的最有效手段。

    2.2 实际影响算一笔账

    假设应用每天调用V4-Pro 10,000次,每次输入2000 tokens + 输出500 tokens:

    场景 日费用 月费用
    全部谷时调用 90 元 ≈ 2,700 元
    全部峰时调用 180 元 ≈ 5,400 元
    合理错峰(70%谷时) 117 元 ≈ 3,510 元

    同样的使用量,仅因调用时段不同,月费相差2,700元。对于日消耗百万级tokens的中型应用,这个差距更悬殊。

    三、双版本怎么选:Pro vs Flash 实战指南
    维度 V4-Pro(旗舰) V4-Flash(轻量)
    总参数 1.6 万亿 2840 亿
    激活参数/Token 490 亿 130 亿
    预训练数据 33 万亿 Token 32 万亿 Token
    上下文窗口 100 万 Token 100 万 Token
    最大输出 384K Token 384K Token
    输出价格(谷时) 6 元/百万 2 元/百万
    并发支持 500 2500
    本地部署体积 865GB 160GB
    开源协议 MIT MIT

    选型口诀:日常用Flash,推理用Pro,长文本用Pro,高并发用Flash

    ✅ 用 V4-Flash 的场景

    简单分类、格式提取、摘要生成、关键词提取、意图识别

    高并发实时场景(客服、翻译、内容审核)

    批量测试生成(大部分测试场景Flash够用)

    M5 MacBook Pro(128GB)加轻量量化可本地运行

    ✅ 用 V4-Pro 的场景

    复杂推理、代码生成与审查、深度分析

    多步骤规划、架构设计、创意写作

    高准确率要求的金融/法律/医疗场景

    超长文档理解、全代码库分析

    四、架构创新:为什么V4能又强又便宜

    DeepSeek V4便宜不是靠亏钱补贴,而是靠真实的架构创新压低成本。三大核心突破解决了长上下文、训练稳定性、计算效率三大行业难题。

    4.1 MoE混合专家:只用必要的算力

    V4-Pro总参数1.6T,但每个Token实际只激活49B参数——激活比例不到3%。这意味着每次推理的计算量远比1.6T全量参数小得多,同等硬件能跑更多请求。V4-Flash更极致:284B总参数只激活13B,推理开销与中型模型相当,但背后挂载着284B的专家知识池。

    4.2 混合注意力架构:1M上下文不再昂贵

    标准Transformer的注意力计算复杂度是O(n²),上下文越长计算量指数增长。V4的混合注意力方案(CSA压缩序列注意力 + HCA重度压缩注意力)直接破局:

    27%
    1M上下文推理FLOPs
    仅为前代V3.2的
    10%
    1M上下文KV Cache
    仅为前代V3.2的

    这意味着100万Token上下文在V4上是真实可用的,不是一个标榜的数字。上下文从128K扩展到1M,算力仅增长1.8倍,彻底打破了传统O(n²)规律。

    4.3 流形约束超连接(mHC)

    传统超连接的信号放大倍数最高可达3000倍,数值极不稳定。V4提出mHC:将连接矩阵投影到数学流形上,通过Sinkhorn-Knopp算法将信号放大倍数严格控制在1.6倍以内,仅增加6.7%计算开销,就能稳定训练万亿参数模型。

    4.4 mxFP4训练精度:国产算力原生适配

    V4采用mxFP4精度而非NVIDIA主流的FP8,这一选择与华为昇腾NPU、壁仞科技等国产算力的指令集高度契合。技术报告中首次披露了在昇腾平台上的完整验证结果。

    五、性能对标:跑到了什么位置

    DeepSeek官方的诚实定位:V4-Pro落后SOTA闭源模型约3-6个月。这不是谦虚,而是关键信息——它不是最强的,但足够强,而且足够便宜。

    基准测试 DeepSeek V4-Pro GPT-5.4 Claude Opus 4.5
    LiveCodeBench 93.50(第1名)
    Codeforces竞技编程 3206分
    SWE-bench Verified 80.60% ~80% 80.9%
    GPQA Diamond 90.10%
    IMO-AnswerBench 89.80%
    BrowseComp(信息检索) 83.40%
    📊 性能画像

    代码能力独树一帜:LiveCodeBench全球第一,Codeforces 3206分接近人类顶级程序员水平

    数学推理国内最强:IMO-AnswerBench 89.80分,领先GLM 5.1约6个百分点

    Agent能力大幅提升:开源模型最佳水平,内部使用体验优于Sonnet 4.5

    短板坦诚:HLE(最难综合知识推理)48.20分,落后Kimi K2.6约6个百分点

    “DeepSeek V4是LLM世界里的好又多超市——东西又好,价格又便宜。” — 社区评价
    六、国产适配:昇腾NPU原生支持

    V4正式版的另一重大意义,是全面适配国产AI算力,打破英伟达GPU垄断:

    训练初期依托英伟达H800,推理阶段深度优化华为昇腾950PR、寒武纪MLU芯片

    昇腾950PR计算性能达英伟达H20(对华合规芯片)的2.87倍

    华为昇腾超节点(昇腾950芯片)已原生支持V4,可绕开NVIDIA出口管制实现国内规模化部署

    mxFP4精度与国产NPU指令集高度契合,是首个在技术报告中正式披露国产算力性能数据的顶尖模型

    官方承诺:待昇腾950批量上市后,Pro版本价格还将进一步大幅下调

    七、开发者省钱四条实战策略
    策略一:任务分级,高峰避峰

    将任务分为两类:

    实时任务(用户等待结果):聊天对话、即时问答——正常调用,控制频率

    批处理任务(无需立即返回):日报生成、数据摘要、邮件撰写、内容审核——调度到谷时(18:00后或12:00-14:00)批量执行

    仅靠这一条,批处理任务成本直接减半

    策略二:最大化缓存命中率

    缓存命中价格(0.025元 vs 3元)相差120倍。优化要点:

    固定system prompt位置,始终放在消息列表最前面

    多轮对话保持messages数组前缀不变,追加新消息而非重构整个数组

    长知识库场景:文档、FAQ、规则集前置到system prompt,每次只更改user部分

    策略三:Pro与Flash按复杂度分流

    Flash输出成本是Pro的1/3(2元 vs 6元),对于能降级的任务直接省2/3。一个实测案例:跑电商API全部单元测试生成,Flash谷时$1.12,Pro峰时$27.84,差价25倍

    策略四:备好降级与告警

    账单管理后台设置用量告警,超预算阈值立即通知

    代码做好fallback降级:高峰时段自动切换Flash,或延迟非紧急请求

    关注DeepSeek官方邮件,24小时窗口期内掌握计费调整

    💰 省钱效果实测

    中等规模独立开发者(日均20万输入+5万输出tokens):

    不优化:~$9.80/月 → 时区套利+缓存:~$5.50/月 → 节省44%

    极致优化(全谷时):~$4.80/月 → 节省51%

    八、总结与展望
    📌 六句话总结

    1. 正式版不只是修bug:峰谷计费、多模态、性能提升、国产适配全方位升级

    2. 峰谷计费是双刃剑:会规划的人省钱50%,不规划的人多花100%

    3. 缓存命中是核心:0.025元 vs 3元差120倍,优化缓存是第一优先级

    4. Flash日常够用:大多数任务Flash胜任,输出成本仅Pro的1/3

    5. 代码能力全球顶尖:LiveCodeBench第一,Codeforces 3206分人类级

    6. 昇腾适配是长期利好:国产算力规模化后价格还将大幅下调

    DeepSeek V4正式版的发布,标志着国产万亿参数大模型从技术验证走向规模化商用。峰谷计费看似是涨价,实质上是行业精细化运营的信号——当模型能力足够强,成本优化就成了下一个战场。

    对于开发者而言,核心结论只有一条:不是API变贵了,而是你需要更聪明地调用它。批处理错峰、缓存最大化、Pro/Flash分流——三条策略叠下来,月费砍一半不是梦。

    值得期待的是,昇腾950批量上市后Pro价格还将大幅下调,届时DeepSeek V4的性价比优势将进一步拉大。国产AI的普惠之路,正在从愿景走向现实。

    “从参数突破到架构革新,从算力自主到普惠开源,DeepSeek V4不仅是一款大模型,更是中国AI走向世界前沿的宣言。”