分类: AI工具

  • AI Agent都在推荐什么工具?6742次提问测出的真相






    AI Agent都在推荐什么工具?6742次提问测出的真相


    AI Agent都在推荐什么工具?6742次提问测出的真相

    AI Agent
    AEO
    工具推荐
    2026-09-08

    先问个扎心的问题:你上一次认真逛”工具导航站”选工具,是什么时候?

    我猜很久了。现在的流程基本变成了——打开Claude Code或者Codex,直接问一句”这个项目用什么数据库””测试框架选哪个”,AI啪一下给出答案,你还觉得挺靠谱。

    但你想过没有:它凭什么推荐这个,不推荐那个?

    这事以前大家只是模糊感觉”AI推荐谁很重要”,没人拿出数据。直到Latent Space干了一件狠事:烧掉几十亿token,做了个叫Frontier AEO Tracker的项目,把这个问题变成了可以审计的数据集。今天带大家把核心结论扒一遍。

    一、这是个什么实验

    先解释个新词:AEO = Answer Engine Optimization(答案引擎优化)。以前做SEO是争取在谷歌搜索结果里排前面,现在要做AEO——争取在AI Agent回答”该用什么工具”时,被它点名。

    实验规模(2026年9月的V5快照):

    维度 数据
    Prompt框架 6种问法
    模型-CLI配置 7套
    工具品类 161类
    计划提问数 6,762次
    通过验证的回答 6,742次

    7套配置里有大伙熟悉的面孔:GPT-5.6 Sol和GPT-6 Astra(走Codex)、Claude Opus 5和Fable 5.1(走Claude Code)、Grok 4.6(走Cursor)、Muse Spark 1.3、SWE-1.7(走Devin)。注意:Gemini、GLM、DeepSeek因为报错和限流没能进榜——这是采集约束,不是能力结论,看榜时别被带节奏。

    评分规则也透明:首选/并列首选60分,直接替代25分,被提及15分;场景性反推荐扣25分,广泛性反推荐扣60分。每个问答对都公开可查。

    二、谁在霸榜:5个100%全票王

    最炸裂的发现是这个——有5款工具,被所有7套模型配置一致推荐为首选,净AEO得分100%:

    工具 品类 净AEO得分
    PostgreSQL 数据库 100%
    Supabase 集成后端 100%
    Sentry 可观测性 100%
    Vitest 测试框架 100%
    Slack 团队聊天 100%

    紧随其后的是一批”接近垄断”的选手:Confluence 96.6%、Zapier和Pipedrive 96.2%、Render 90.5%、PostHog 89.6%、Linear 85.8%、Stripe和Neon 84.7%。这些产品在Agent嘴里几乎没有对手。

    其他赛道的座次也很有信息量:

    赛道 第一名 第二名 第三名
    编程Agent Claude Code 56.9% Codex 43.8% Cursor 38.4%
    AI应用搭建 Lovable 73.7% Replit 66.5% Bolt.new 24.3%
    AI搜索 Tavily 67.7% Exa 54.6% Brave 52.4%
    AI记忆 Mem0 71.7%
    SEO工具 Semrush 79.1% Ahrefs 61.5%

    最有节目效果的是最后一行:SEO工具类目里,Semrush压过Ahrefs一头。SEO老兵们,在AEO这个新战场上也要抢座次,多少有点黑色幽默。

    三、模型有私心,而且不装

    数据里有个藏不住的现象:自荐偏差。Fable和Opus爱推Claude Code,Sol和Astra爱推Codex,Grok爱Cursor,Muse爱自家Muse Code——每家模型都在给自家生态导流,这很难说是巧合。

    有意思的是例外:GPT系的模型多次推荐竞品Claude,作者专门表扬这是”值得称赞的无偏见”。你品品——当”不偏心”变成需要专门表扬的稀罕事,这本身就说明了问题。将来AEO咨询行业大概率会分化出一支”反偏差优化”业务,我先把话放这。

    还有更值得投了AEO的创业公司注意的:代际翻转。同一个实验室,Sol升级到Astra、Opus升级到Fable之后,产品推荐出现了”非常关键的翻转”。你去年针对老模型做的优化,新模型上来可能直接清零。每次大模型换代,都是一次重新洗牌。

    四、最意外的发现:模型越自信,赢家通吃越狠

    这是整份数据里我认为最值钱的发现。对比两代模型的搜索行为:

    模型换代 搜索来源中位数 变化
    Sol → Astra 9个 → 5个 -44%
    Opus → Fable 11个 → 15个 +36%

    GPT-6 Astra不只搜得少,被轻度改写问题后推荐结果几乎不变——更”高效”,也更”固执”。

    这意味着什么?当模型的选择随机性下降,被推荐产品的赢家通吃效应就越强。以前模型多看几个来源,第5名好歹能混个”陪跑”;现在Astra只看5个来源就拍板,没进短名单的产品,连露脸的机会都没有了。

    SEO时代谷歌给你十条蓝链接,排第8名还有流量;Agent时代它只报1个首选加2个备选。100%和0%的差距,不是排名差距,是有无之分

    五、161类里只有28个”霸主”,剩下的全是窗口

    别被上面的100%吓到,反过来看更有意思:161个品类里,只有28类存在全模型一致的首选。也就是说,剩下130多个品类还处在势均力敌的混战状态——没有谁锁定胜局。

    这就是2026版的”SEO黄金时代”窗口。当年在谷歌算法早期卡住位置的站点吃到了十年红利,现在AEO的早期窗口就摆在130多个类目面前。谁先成为这些品类里模型认可的”标准答案”,谁就锁定了下一代的分发入口。

    六、给工具站和开发者的3条实操建议

    重点来了。文章里有个对我们这种AI工具站性命攸关的判断:模型推荐强依赖可抓取的结构化markdown内容和权威信源。Ora和Vercel实测过的AEO手段(比如markdown content-negotiation)被证实真实有效;反过来,内容抓取失败会让模型直接放弃读你的站点。翻译一下:导航站的传统价值(收录全、更新快)会被”模型直答”截流,但”被Agent引用”是新长出来的位置——Tracker数据里”top cited sources(高频引用来源)”这一层,就是测评站的新座位。

    基于此给3条能落地的建议:

    ① 技术可及性是地基:让模型读得到、读得顺

    官网和测评内容提供干净的markdown版本,部署llms.txt,关键页面别用纯JS渲染挡爬虫。每篇评测给出清晰的对比表格和明确的”首选/替代”结论。抓取失败等于直接出局,这一步做不好后面全白搭。

    ② 争夺”被引用”位置:做可审计的客观内容

    模型的推荐依赖权威信源,谁的内容结构清晰、评分规则透明、数据可复核,谁就更可能成为Agent回答时的引用来源。与其堆关键词,不如把每一篇测评都做成”模型愿意引用”的格式——标注测试方法、给出评分依据、保持更新日期。

    ③ 抢滩无霸主品类,并盯紧代际翻转

    优先在130多个还没有”全票霸主”的品类里建立存在感,这些赛道还没人锁定胜局。同时每次主流模型换代(比如Sol→Astra这种)后重新复查自己的AEO效果——代际翻转是真实存在的,老模型的推荐结果不能当成新模型的保证。

    写在最后

    这份Tracker本质上是对”模型即分销渠道“的第一次严肃测量。它真正吓人的地方不是PostgreSQL拿了100%,而是它揭示的趋势:AI的回答正在取代传统的”逛和比”,而模型的口味会随着换代越来越稳定、越来越固执。

    对做产品的人,这是个残酷的信号——没进短名单,就出局。对做内容的人,这反而是十年一遇的窗口——Agent需要可引用的信源,而绝大多数网站还没开始准备。

    窗口就在那130多个品类里。动作快点的,已经开始抢了。

    数据与观点来源:本文核心数据来自 Latent Space(latent.space)发布的 Frontier AEO Tracker 项目及其数据站 aeo.latent.space(V5快照,2026年9月),实验方法受 AmplifyingAI《What Claude Code Actually Chooses》启发。所有评分规则、问答数据均可在原站公开查证。本文为中文解读,结论以原文为准。

    · 完 ·


  • 英伟达129亿美元收购Hugging Face:AI工具第一入口易主全解读






    英伟达129亿美元收购Hugging Face:AI工具第一入口易主全解读


    英伟达129亿美元收购Hugging Face:AI工具第一入口易主全解读

    AI工具
    行业观察
    2026年9月6日
    约11分钟读完

    📌 本文看点

    ① 英伟达史上最大收购:129.3亿美元买下”AI领域的GitHub”,交易结构一笔一笔拆给你看
    ② 86倍年化收入的定价逻辑:为什么说这钱不能按SaaS账本算
    ③ 开发者和AI工具用户会有什么实际变化:交割前后分开看
    ④ 中国模型占HF下载量41%、首次超过美国,这条出海通道会生变吗
    ⑤ 中立性大考:AMD、英特尔们既是股东又是对手,信任怎么维持
    ⑥ 2027年交割前的四个观察信号,逐个列出

    当地时间9月3日,英伟达官宣了一条重磅消息:同意以129.303亿美元(约870.76亿元人民币)收购Hugging Face,也就是大家常说的”抱抱脸”。双方早在9月2日就签好了最终协议,交易预计2027年上半年完成,目前还差监管部门点头。

    这笔钱花得有多狠?对照一下就知道:英伟达此前最大的收购是2020年约69亿美元买下迈络思(Mellanox),这次直接翻了近一倍,成了英伟达历史上最大的一笔收购。

    01 · 事件速览:129.3亿美元买下AI工具第一入口

    先看核心数字:

    项目 数据
    收购价格 129.303亿美元(约870.76亿元人民币)
    对价构成 约119亿美元支付给HF股东 + 最高约10亿美元股权留任计划
    签署日期 2026年9月2日
    官宣日期 2026年9月3日(当地时间)
    预计交割 2027年上半年,待监管部门批准
    平台体量 1800万+开发者、300万+模型、50万+数据集、100万+应用、20万+企业用户
    交易纪录 英伟达史上最大收购案

    这里有个细节值得说:约119亿美元是付给HF股东的,另外最高约10亿美元是股权留任计划,专门留给加入英伟达的HF员工——这批信息来自英伟达提交美国SEC的文件。换句话说,英伟达买的不只是平台,还有这支团队的人心。留住核心员工,就是保住了模型生态的维护者和社区关系,这比服务器贵得多。

    02 · 为什么是Hugging Face:AI领域的GitHub

    Hugging Face成立于2016年,最早做的是消费者聊天产品,后来转型做开放机器学习平台,一步步长成了今天的样子。它的核心产品HF Hub,圈内人叫它“AI领域的GitHub”——这个称号不是白来的。

    看看平台体量:超1800万名开发者、研究人员和创作者,超300万个模型,50万个数据集,100万个应用,还有超20万家企业用户。现在搞AI的人要找模型、下数据集,第一反应就是打开HF。

    对英伟达来说,这个入口其实并不陌生。双方的交集从2023年就开始了:那一年DGX Cloud接入HF平台,之后又推出基于NIM微服务的推理服务。更关键的是,英伟达本身就是HF最大的开放模型和数据贡献者——贡献了500多个模型、250多个数据集。

    说白了,英伟达早就深度参与HF生态,这次只是从”合作关系”升级成了”一家人”。

    03 · 英伟达的算盘:从算力霸主到分发入口

    英伟达靠卖GPU赚翻了,但它最怕什么?是别人绕开它。买下HF,本质上是把“分发入口”攥在手里:全世界的开发者通过HF下模型、部署应用,这条路径以后都流经英伟达的地盘。谁掌握入口,谁就能定义默认选项——默认的推理后端跑在谁家硬件上,默认的部署模板适配哪家的云。

    黄仁勋的表态也印证了这个思路:扩大HF平台规模、强化基础设施、扩大开发者和机构获取AI能力的渠道。注意,重点全落在”入口”和”渠道”上。

    这笔买卖和英伟达的开放模型路线并不冲突。逻辑很简单:模型越开放,跑的推理就越多,消耗的算力就越大,买的GPU自然越多。HF不靠卖模型赚钱,英伟达也不需要HF去卖模型——一个管分发,一个管算力,正好凑成一条完整的链路。

    把英伟达的收购史摆在一起看,更能看出这次的战略意图:

    收购对象 时间 金额 结果
    迈络思(Mellanox) 2020年 约69亿美元 完成,成为数据中心业务基石
    Arm 2020年宣布 400亿美元 2022年因监管阻力终止
    Hugging Face 2026年 129.3亿美元 预计2027年上半年交割

    买迈络思,拿下了数据中心网络;想买Arm,瞄准的是芯片架构(没成);这次买HF,盯上的是AI应用的分发层。算力、网络、入口——英伟达的版图正沿着产业链上下游同时延伸。

    04 · 86倍年化收入的定价,贵不贵?

    单看财务账,这个价格贵得离谱。HF目前年化收入约1.5亿美元,129.3亿的收购价相当于年化收入的86倍。横向对比一下:传统软件公司被收购时,价格通常是年收入的5到15倍,这已经是相当体面的溢价。

    再看估值变化:2023年HF完成2.35亿美元融资时,估值45亿美元,投资方阵容里就有英伟达、谷歌、亚马逊——也就是说,英伟达三年前就是HF的股东了。从45亿到129.3亿,三年时间估值翻了接近3倍。三年前英伟达只是坐在股东席上观望,三年后直接掏钱把整张桌子买下。

    那英伟达为什么愿意出这个价?关键在稀缺性。1800万开发者的账号体系、300万模型的分发入口,这种资产在市场上找不到第二份。GitHub之于代码,HF之于模型,都是”全行业默认入口”级别的存在——这种资产平时根本不挂牌出售,一旦出售,就没有讨价还价的空间。

    这笔账不能按SaaS收入倍数算。对英伟达来说,86倍买断AI分发第一入口,错过的代价可能比买贵更高。

    05 · 对开发者和AI工具用户的实际影响

    先说结论:短期不用慌。交易预计2027年上半年才交割,中间还要过监管审批这一关,在那之前,模型下载、部署流程一切照旧,不用折腾。真正值得关注的是交割之后的三个变化。

    交割之后会怎么变?HF CEO Clément Delangue的表态先给了颗定心丸:收购完成后HF仍将保持平台中立,开发者可以自主选择芯片、云服务和计算基础设施。注意措辞的针对性——AMD、英特尔、亚马逊这三家,既是HF的早期投资者,又是英伟达在芯片和云上的直接对手。这句话就是提前说给他们听的。

    实际体验层面,有几个变化几乎可以预期:

    推理部署更顺滑。HF和英伟达的合作底子在:DGX Cloud接入、NIM微服务推理。整合后模型从下载到部署到英伟达硬件的路径会更短,配置成本更低。

    默认工具链会向英伟达生态倾斜。一键部署模板、文档示例、推荐配置,大概率优先围绕英伟达硬件优化。用CUDA系显卡的开发者体验会更顺,用别家卡的得留意兼容性说明。

    中小企业上车的门槛会降低。20多万家企业用户已在HF上选型,以后可能连算力采购一起打包解决,对中小团队来说多了一个”一站式”选项。

    对国内AI工具用户来说,还有一个绕不开的问题:Qwen、DeepSeek、GLM这些中国开源模型的全球分发都高度依赖HF——中国模型刚在HF平台上拿下41%的下载量,英伟达入主后这条”出海通道”会不会生变?这个话题信息量很大,下一部分单独展开。

    06 · 中国开源模型的出海窗口生变?

    对国内AI圈来说,这笔交易最扎心的部分不在价格,而在通道

    先看一组数据:Hugging Face今年春季发布的开源生态报告显示,过去一年中国研发模型占平台下载量的41%,首次超过美国。Qwen、DeepSeek、GLM这些国产开源模型,正是借助HF拿到了全球开发者触达、下载分发和二次开发入口——中国模型能在这轮开源浪潮里打出全球影响力,HF这条通道功不可没。

    现在,这条通道的新主人变成了英伟达。更要命的是,平台上还有超20万家企业用户在围绕这些模型搭建产品——通道的粘性越高,生变时的牵连就越广。

    风险不是猜测,英伟达自己在SEC文件里写得明明白白:若监管措施限制英伟达为源自特定地区的模型提供产品和服务,可能对HF平台及英伟达经营产生重大影响。翻译一下:如果监管升级到”特定地区模型不能接入英伟达生态服务”的程度,Qwen们在这条通道上的位置就很微妙了。

    对国内开发者和模型团队来说,合理的做法是趁窗口期还在,把分发渠道做多元化备份——鸡蛋别放在一个篮子里,这个道理在2026年不用再教第二遍。

    07 · 中立性大考:AMD、英特尔们会买账吗

    HF社区最值钱的资产,除了模型还有信任。而信任眼下正面临一场大考。

    麻烦在哪?AMD、英特尔、亚马逊这些公司,既是HF的早期投资者,又是英伟达在芯片和云服务上的直接竞争对手。它们当初投HF,看中的就是开放平台的居间价值;现在平台归了最大的对头,这层信任基础难免晃动。

    HF CEO Clément Delangue的回应很明确:收购完成后HF仍将保持平台中立,开发者可自主选择芯片、云服务和计算基础设施。话说得很到位,但真正的问题不在承诺,而在执行——当中立平台背后的股东变成了利益相关方,每一次产品调整、每一个默认选项,都会被放在放大镜下审视。最理想的状态,是像收购前一样按社区规则办事;最坏的情况,是默认选项慢慢长成自家产品的导流口。中间地带有多大,要看接下来的执行。

    历史也给过警示。2020年英伟达计划以400亿美元收购Arm,正是因为监管对”中立架构被一家芯片巨头控制”的担忧持续发酵,交易拖到2022年终止。Arm是芯片架构的中立底座,HF是开源模型的中立底座,两笔交易的监管逻辑高度相似。区别在于:这次金额更小(129.3亿),但市场集中度争议未必更小。

    08 · 时间线与观察点:2027年交割前的关键节点

    这笔交易从官宣到交割还有很长的路。交易预计2027年上半年完成,前提是通过监管审批——参照Arm案拖了两年多才终止的时间线,这个周期里变数不少。

    未来几个季度,建议盯住这几个信号:

    四个值得持续观察的信号

    监管审批进度反垄断审查态度是最大变量,附加条款直接影响中立性
    竞争对手的动作AMD/英特尔/亚马逊加大投入还是逐步收缩,去留即风向标
    平台产品走向默认部署选项、推荐配置是否向英伟达硬件倾斜
    员工留任情况最高约10亿美元留任计划能锁住多少人、锁多久

    只要这四个信号没有明显恶化,开发者可以放心把HF继续当主力平台用。

    09 · 写在最后:给国内AI工具生态的三个启示

    回头看这笔129.3亿美元的收购,有三个点值得国内AI工具从业者琢磨:

    第一,入口比工具值钱。HF自己不训练大模型,靠”模型界的GitHub”这个入口位置,就撑起了86倍年化收入的定价。做AI工具的团队,与其在单点功能上内卷,不如想想能不能占据某个”大家默认会来”的位置——社区、导航、工作流,都是入口的形态。

    第二,全球化通道要有备份。中国模型41%的下载量走的是HF一条路,SEC文件里的一句风险披露就能让这条路的未来蒙上阴影。出海的通道、工具、社区,都值得提前做多元化布局。

    第三,中立是稀缺品,也是竞争力。当头部平台陆续被巨头收编,”不站队”本身会变成越来越值钱的卖点。国内做AI工具生态的团队,谁能守住开放和中立,谁就可能接住下一波外溢的信任。

    交易还没交割,故事才讲到一半。接下来这两年,值得每个AI工具从业者持续盯着看。

    信息来源:21世纪经济报道《英伟达870亿收购开源模型社区”抱抱脸”,如何保证中立性?》(2026-09-04)、Hugging Face Spring 2026开源生态报告等公开报道,本文为基于公开信息的独立分析。


  • 智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8






    智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8


    智谱GLM-5.3-Flash全解读:”牛来”六天登顶OpenRouter,57分追平Opus 4.8

    开源大模型
    原生多模态
    2026年9月4日
    约8分钟读完

    📌 本文看点

    ① 匿名模型Ox-Alpha六天悬念复盘:怎么把全球开发者社区钓上钩
    ② 320B-A18B全新预训练架构,GLM-5系列首个原生多模态,跟GLM-5.3旗舰是什么关系
    ③ 价格账本:百万Token输入0.8元、输出2.8元,限时5折后0.4元起,什么概念
    ④ 10万张国产芯片扛住全球负载,比登顶更重要
    ⑤ 开发者接入指南:三行代码、格式全兼容,本地部署四条路线怎么选
    ⑥ 智谱半年报里藏的下一步:GLM-6.0瞄准自进化,下一代基座已在路上

    8月的最后一周,全球AI开发者都被一头来历不明的”牛”搅得心神不定。8月20日,一个代号Ox-Alpha的匿名模型悄悄登上大模型聚合平台OpenRouter,上线首日直接冲到调用量第一,刷新平台单日纪录;随后它又在代码评测平台OpenCode,把DeepSeek保持了56天的榜首位置拉下马。

    没人知道它姓甚名谁,中文社区干脆给它起了个亲昵的外号——“牛来”。8月26日晚,智谱正式摘下它的面具:Ox-Alpha就是GLM-5.3-Flash,一个320B总参数、每个Token只激活18B的MoE模型,也是GLM-5系列里第一个原生多模态模型。

    这篇文章把”牛来”的来龙去脉、硬参数、价格账本、接入方式,以及智谱半年报里藏着的下一步棋,一次说清楚。

    01 · 六天悬念:Ox-Alpha怎么把全球社区钓上钩

    先复盘时间线,这场”猜谜营销”的节奏值得细品:

    “牛来”事件时间线

    8月20日Ox-Alpha上线OpenRouter,首日登顶调用量第一
    随后数日登顶OpenCode,终结DeepSeek 56天榜首
    匿名期间编程测试首日即获80%得分率,彭博社发出问询
    8月26日智谱官宣:Ox-Alpha = GLM-5.3-Flash

    匿名期间,社区猜谜热一度达到顶点:有人根据分词器特征和视频Token消耗模式,推断它出自智谱GLM系列;也有人押注是谷歌DeepMind的下一代模型。智谱官方后来透露,”牛”这个代号灵感源自国内近期热映的一部电影——六天之后,谜底揭晓,”牛”真的被牵出来了。

    💡 为什么”牛来”能炸场:在权威的Artificial Analysis智能指数测评中,它拿下57分,与Anthropic旗舰Claude Opus 4.8持平;而它的定价只有Opus 4.8的1/40。一款开源模型第一次以这个姿态站上成本前沿。

    02 · 硬底子:全新预训练的320B-A18B,GLM-5系列首个原生多模态

    先把最容易搞混的一件事说清楚:GLM-5.3-Flash不是从GLM-5.3旗舰上”裁剪”出来的。它是一个全新的预训练模型,用了约30万亿Token的多模态数据从零预训练,跟8月14日发布的GLM-5.3旗舰是两条产品线:

    • GLM-5.3旗舰:与GLM-5.2共用约7450亿参数的MoE基座,所有提升来自后训练,官方称复杂编程与长程任务的端到端完成率提升超50%,在Terminal Bench 3.0等长程编码基准中拿下开源模型最优成绩;官方数据显示其代码审计能力可在开源项目中发现数千个潜在漏洞。
    • GLM-5.3-Flash:全新架构,专为极低成本设计,走”成本前沿”路线,基准表现与实际应用均优于GLM-5.2。

    Flash的架构细节值得展开:总参数320B、单Token激活约18B,采用稀疏注意力(DSA)与线性注意力(KDA)混合架构,配合MLA、mHC和MTP等组件;语言模型45层,视觉编码器24层。

    GLM-5.3-Flash 核心规格

    模型规格320B总参 / 18B激活(MoE)
    架构亮点DSA稀疏注意力 + KDA线性注意力混合
    多模态图像 / 视频 / 文件 / 文本输入(文本输出)
    上下文窗口100万Token,最大输出128K
    预训练数据约30万亿Token多模态数据
    智能指数57分(AA口径,追平Claude Opus 4.8)

    “原生多模态”这四个字对GLM系列意义不小——智谱的GLM终于”有眼睛了”,图像、视频都能直接读进上下文,再叠加1M窗口,处理长视频理解、批量文档这类任务的想象空间一下子打开了。

    03 · 价格才是王炸:把成本前沿打到地板上

    聊模型不聊价格是耍流氓。智谱官网的价格表是这样的:

    GLM-5.3-Flash API价格(bigmodel.cn)

    输入(原价)0.8元 / 百万Token
    输出(原价)2.8元 / 百万Token
    输入(限时5折)0.4元 / 百万Token
    输出(限时5折)1.4元 / 百万Token
    缓存命中(5折)0.115元 / 百万Token
    缓存存储限时免费

    限时5折从上线起算两周,9月10日前后截止,之后恢复原价。这个价格什么概念?官方口径是单任务成本0.045美元,进入智能成本前沿;而智谱半年报披露,GLM系列单位Token推理成本较年初下降了80%。有开发者做过对比,五折期间它的输入输出价格甚至比DeepSeek V4 Flash空闲时段的档位还要低一截——要知道后者一直被叫做”大模型斩杀线”。

    除了智谱自家平台,阿里云百炼、腾讯云、360智脑等平台也已经同步上架这个模型,价格口径基本一致。对开发者来说,多平台供应意味着不再被单一渠道的限流和可用性绑死,容灾选择多了。

    04 · 10万张国产芯片扛全球负载:比登顶更重要的事

    如果说”登顶OpenRouter”是流量层面的胜利,那支撑这场胜利的底座才是行业层面的大事:据36氪等媒体报道,支撑全球大规模免费测试的全部算力来自10万张国产芯片,供应链或来自华为、摩尔线程、海光等国内头部厂商。

    这件事的分量可以这样理解:过去国产算力讨论最多的是”能不能用”,这次是”扛不扛得住全球开发者的高并发轰炸”。上个月讯飞开源的星火X2.5端侧模型也强调了全国产算力全流程训练——国产模型+国产算力这条双线,正在从宣传口径变成工程事实。对政企、车载这些对数据安全和供应链自主有硬要求的场景,这往往不是加分项,而是准入项。

    05 · 开发者怎么用:三行代码接入,格式全兼容

    接入门槛非常低。模型代码是glm-5.3-flash,兼容OpenAI Chat Completions、Anthropic Messages等主流API格式,用OpenAI SDK就能直接调:

    from openai import OpenAI
    
    client = OpenAI(
        api_key="你的API Key",
        base_url="https://open.bigmodel.cn/api/paas/v4/"
    )
    
    resp = client.chat.completions.create(
        model="glm-5.3-flash",
        messages=[{"role": "user", "content": "用Python写个快速排序"}]
    )
    print(resp.choices[0].message.content)

    能力清单参考各平台文档:支持Function Calling工具调用、结构化输出、前缀续写、上下文缓存;不支持联网搜索、批量推理和模型调优(以百炼文档为准)。限流方面,以阿里云百炼为例是RPM 200、TPM 300万,高频场景基本够用。

    💡 适合什么场景:系统自动化、后端批处理、办公自动化、Agent工具调用这类高频、大规模、对成本敏感的调用。有开发者的实测结论很直白:所有系统自动化任务、后端任务、办公任务全面切换到它上面,”极度的经济实惠”。

    06 · 本地部署现实吗:先泼盆冷水,再给路线图

    “开源了是不是就能本地跑?”先泼冷水:官方Hugging Face权重是FP8格式,光文件就约306GiB,加载后还要预留框架开销、CUDA图、通信缓冲和KV Cache。所以对个人用户来说,开源的意义更多是”可白嫖的API+可审计的权重”,真要本地跑,得先看看自己配不配:

    部署路线 适合场景 硬件参考
    vLLM 多卡低延迟服务 官方示例TP4,优先NVIDIA Hopper及更新架构
    SGLang 长上下文、高吞吐 提供低延迟/高吞吐策略与HiCache
    KTransformers 消费级GPU+大内存异构 CPU-GPU异构专家推理,示例约350GB系统内存
    Transformers 研究代码、自定义算子 适合查权重看接口,不建议扛高并发

    个人玩家的现实路径是Ollama + GGUF量化版:社区量化文件大约15-30GB,装好Ollama后下载GGUF文件、写个Modelfile、ollama create导入就能跑。一台32GB内存的台式机配合CPU-GPU混合推理,跑量化版是够得着的。

    07 · 半年报视角:GLM-6.0瞄准自进化,下一代基座已在路上

    把镜头拉远一点,9月初智谱披露的半年报里藏着更多信息:上半年研发投入21.31亿元,同比增长33.6%;亏损20.72亿元,同比收窄。更关键的是技术路线的官方定调——“Scaling deep while scaling up”(横向扩展的同时进行深度扩展)。

    过去数月,GLM-5.1、5.2、5.3一直沿用同一个约7450亿参数的基座(今年1月完成训练,原计划使用半年以上),能力迭代主要靠后训练完成,市场也因此出现”智谱过度依赖后训练”的质疑。业绩会上智谱创始人唐杰的回应很直接:

    参数规模并非Scaling的唯一变量。这是结合现有数据、算力资源,权衡不同训练阶段边际收益作出的主动选择,并非停止基础大模型的迭代升级。

    智谱董事长刘德兵补了关键一刀:后训练做到极致之后,下一个阶段的增长必须回到基座模型上,公司下一代基座模型已经在推进。也就是说,GLM-6.0将回到基座迭代,方向瞄准”自进化”。过去11个月GLM系列完成六次迭代,智能指数从32提升到60——如果下一代基座兑现,这个斜率有望继续拉陡。

    08 · 冷静看:三个别神化的地方

    夸了这么多,泼三盆冷水保持清醒:

    1. 匿名营销是双刃剑。”匿名刷榜-官宣揭幕”的打法热度拉满,但也引来”数据是否可持续”的审视。模型真实口碑,最终要看开发者三个月后的留存,而不是发布周的热搜。
    2. 57分是单口径成绩。AA智能指数追平Opus 4.8,不等于全场景持平;而且它是”多模态输入、纯文本输出”,不支持联网搜索,重度多模态生成需求得绕道。
    3. 第三方可用性有波动。聚合平台的历史数据显示,部分时段可用率波动明显(从个位数到八成以上的时段记录都出现过)。生产环境务必做好重试、降级和多渠道备份——这也是多平台上架反而成了它的隐性优势。

    写在最后

    “牛来”这波操作,本质上是一次普惠价格+顶端实力的压力测试:用一款320B的开源多模态模型,把”旗舰级智能”的调用成本打到几毛钱档位,同时用10万张国产芯片证明自主算力扛得住全球负载。对开发者来说,最实在的动作很简单——趁着5折还没结束,把手里那些跑得心疼的批量任务切过去试试,用账单投票。

    📝 本文由 XcoolEVDB – AI工具深度解读 原创发布 | 数据与观点综合自智谱官方、36氪、新华网、腾讯云/阿里云等平台公开资料,截至2026年9月4日

    🔗 相关阅读:讯飞星火X2.5端侧双模型开源 | 腾讯混元Hy4 preview开源 | 阿里Qoder智能体工作台


  • 讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成






    讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成


    讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成

    开源大模型
    端侧AI
    2026年9月2日
    约6分钟读完

    📌 本文看点

    ① 端侧模型首个原生百万Token上下文,到底解决了什么老毛病
    ② 混合注意力+20万亿Token数据+全国产算力,技术底座拆给你看
    ③ 办公/代码/智能家居/机器人四大场景实测数据
    ④ Ollama一条命令跑起来的部署指南
    ⑤ 9月7日293B旗舰、10月全国产算力新品,后面还有大招

    9月的第一天,AI圈就丢下一颗炸弹。这次不是又一个大厂云端模型刷榜,而是一个更贴近你的动作:科大讯飞全资子公司词元星火,正式开源了星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型

    名字里的”端侧”两个字是重点——它们不是跑在云机房里,而是要装进你的手机、电脑、汽车座舱和智能家居设备里,本地跑、本地算、数据不出门。

    而这两款小模型最狠的一点是:端侧模型里,第一个原生支持最长100万Token上下文窗口的产品。之前这个量级只有云端大模型玩得起,现在小到1.7B参数的模型也能装下了。

    01 · 百万Token上下文:端侧等这一刻很久了

    先说清楚一个老问题:为什么端侧模型一直”记性差”?

    过去端侧模型处理长内容,通常要把文档切成几段分别处理。结果就是你可能亲身体验过的:问到第三章的内容,它忘了第一章说了啥;跨章节的规定互相打架,它对不上号。

    💡 一句话理解百万Token的价值:把一本几十万字的完整手册、一整年的聊天记录、或者一整套代码库一次性喂给模型,它能”看全”并”记住”,在连续对话中不丢前情。

    官方给的售后场景例子很直观:用户把完整售后手册导入星火X2.5-4B,然后问一个刁钻问题——”购买10天后设备故障,且使用过第三方耗材,符不符合换货要求?”

    这问题难在哪?答案藏在手册的不同章节里:退换货规则一章、故障处理一章、第三方耗材的例外条款又一章。模型得自己关联跨章节规定,给出综合判断。更绝的是,你再加个”用户在偏远地区”的新条件,它还能保持前文情境,结合物流、数据清除、费用承担和处理时限继续给建议。

    这就是长上下文的真实意义:不是比谁数字大,而是让模型基于完整信息做判断,而不是靠切片碰运气

    02 · 技术底座:混合注意力+20万亿Token+全国产算力

    两个数字先摆出来:

    星火X2.5端侧双模型 核心参数

    模型规格X2.5-4B / X2.5-1.7B
    上下文窗口原生100万Token(端侧首个)
    架构混合注意力架构
    预训练数据约20万亿Token多样化数据
    训练算力全国产算力平台全流程
    能力侧重智能体 / 代码 / 数学 / 指令遵循
    上下文专项千亿Token级高质量长文数据训练

    三个技术点值得展开说:

    ① 混合注意力架构:小模型装下大记忆的关键

    100万Token的上下文如果用传统注意力机制硬算,显存和算力都扛不住。星火X2.5采用混合注意力架构,在长序列处理上做工程取舍,让1.7B这么小的参数量也能承载百万级窗口——这是”端侧首个”能成立的技术前提。

    ② 20万亿Token预训练+千亿Token级长文数据

    上下文能力不是架构给个窗口就完事,还得喂对数据。讯飞披露星火X2.5使用了覆盖长篇文档、技术资料等场景的千亿Token级高质量数据专门训练上下文能力,也就是让模型在训练阶段就习惯”读长文”,而不是部署后才硬适应。

    ③ 全国产算力:从训练到推理的完整闭环

    两款模型基于全国产算力平台完成全流程训练。结合讯飞此前”基于华为昇腾等国产平台训练”的路线,这条”自主可控”的路线图在端侧继续延伸——对政企、车载这些对数据安全和供应链有要求的场景,这往往不是加分项,而是准入项。

    03 · 四大场景实测数据:办公、代码、智能家居、机器人

    参数是纸面的,场景数据更实在。官方给的四个方向:

    个人办公:从数据到双语报告全流程

    以Loomy上的办公案例为例:用户上传销售明细表,要求做销售分析并交付中英文部门业绩报告。星火X2.5-4B的完整动作链:

    1. 编写脚本完成数据汇总、关键指标提取和趋势分析
    2. 生成约3000字的中文部门业绩报告
    3. 沿用原有结构和格式生成英文版报告
    4. 完成内容、结构和排版校验

    从原始数据到双语交付一条龙,全程在本地完成。

    代码开发:4B对标大2-3倍的云端模型

    在算法实现、代码补全与生成任务中,星火X2.5-4B可对标参数规模大2至3倍的云端模型。更实用的是接入方式:支持通过DeepSeek Harness、OpenCode、Codex、Pi等开源Harness,把模型接进本地开发和自动化脚本流程。写代码、生成脚本、调试辅助,可以不出本地直接完成。

    智能家居:1.7B的响应速度亮眼

    🏠 在Domux智能家居测试集上,星火X2.5-1.7B控制指令端到端执行正确率达90.3%,平均响应时间仅0.85秒。听懂自然语言、直接执行,这个延迟对”开个灯”级别的交互才够用。

    机器人:部署到本体和边缘设备

    两款模型可部署在机器人本体或边缘设备中,支持操作控制、目标追踪、导航决策等任务,减少对云端连接和固定预设程序的依赖。对需要持续感知和连续执行的机器人场景,”断网也能干活”是刚需。

    04 · 部署指南:一条命令跑起来

    开源生态的兼容性决定上手门槛。这次讯飞给出的清单相当开放:

    部署支持清单

    硬件平台英伟达 / 华为 / 海光 / 后摩
    推理框架vLLM / SGLang / llama.cpp
    快速部署工具Ollama / LM Studio
    权重地址Hugging Face / GitHub
    API服务讯飞星辰MaaS(限时免费)

    如果只是想在自己电脑上体验一把,Ollama是最快路径:

    # Ollama拉起星火X2.5端侧模型(示例)
    ollama run spark-x2.5-4b
    
    # 或者用LM Studio图形界面加载GGUF版本
    # 权重下载地址:
    # Hugging Face: huggingface.co/collections/XHToken/spark-x25
    # GitHub:       github.com/XHToken/Spark-X2.5

    不想折腾本地部署的话,对应API已上线讯飞星辰MaaS平台(maas.xfyun.cn/modelSquare),目前限时免费,可以先白嫖再决定要不要本地化。

    05 · 端侧还是云端?给普通用户的真实建议

    别被”端侧首个百万Token”冲昏头,端侧和云端各有各的活法:

    维度 端侧(星火X2.5-4B/1.7B) 云端大模型
    隐私 数据不出设备,敏感场景强项 需信任厂商的传输与存储
    延迟 本地推理,智能家居0.85秒级 受网络波动影响
    断网可用 完全离线可用 依赖连接
    能力上限 4B对标大2-3倍云端模型(官方口径) 旗舰模型天花板更高
    成本 开源免费,硬件一次性投入 按Token计费,长期累积

    我的建议很简单:涉及隐私、要离线、高频低复杂度的活,端侧;复杂推理、开放性创作、重任务,云端。未来的形态大概率是端云协同——日常交互端侧扛,重活难活云端接。这次讯飞端侧+旗舰同步推进的节奏,就是在铺这条路。

    06 · 后续看点:9月7日293B旗舰,10月还有大招

    这次开源只是讯飞9月行程的第一站:

    • 9月7日:星火X2.5-293B旗舰基座大模型发布。这是目前讯飞参数规模最大的通用模型,重点升级代码生成和复杂智能体协作能力。
    • 10月1024全球开发者节:全国产算力全新主力通用大模型。目标在代码能力和Token性价比上进入国内第一梯队。
    📅 划重点:端侧双模型开源(9/1)→ 293B旗舰(9/7)→ 全国产算力新品(10月)。一个月三连击,讯飞这次把节奏卡得很密。9月7日旗舰发布后,建议回来对照看端侧与旗舰的能力差,那才是端云协同路线的完整拼图。

    07 · 结语:端侧AI的国产路线图

    回看这次发布,三个信号值得记住:

    第一,端侧军备赛正式开打。百万Token上下文从云端专属变成端侧标配的起点,就是9月1日。手机厂商、车载、智能家居的本地AI能力上限,被重新定义了。

    第二,全国产算力不再只是口号。从训练到部署(华为/海光/后摩硬件+讯飞自家平台),这条链路的完整度才是”自主可控”四个字的底气。

    第三,开源策略务实。Ollama、LM Studio、vLLM全兼容,权重开放+API限免,降低的是开发者的试错成本,扩大的是生态基数。

    至于百万Token到底能不能在你的设备上跑出官方数据的体验,等9月7日旗舰发布后,可以一起实测验证。

    你会用本地大模型来干什么?评论区聊聊。

    参考来源:IT之家、中国日报网、快科技、中国经营报、36氪、Tech in Asia(2026年9月1日-2日报道)

    本文由 AI 辅助整理生成,数据以官方发布为准 | 转载请注明出处


  • 豆包工作发布引爆AI办公Agent大战:字节腾讯阿里三强横评,打工人怎么选






    豆包工作发布引爆AI办公Agent大战:字节腾讯阿里三强横评,打工人怎么选


    豆包工作发布引爆AI办公Agent大战:字节腾讯阿里三强横评,打工人怎么选

    2026-08-31
    AI工具
    AI办公Agent
    深度横评
    阅读约12分钟
    📑 本文目录

    01 · 一周三连击:AI办公赛道变天了

    02 · 豆包工作拆解:从”会聊天”到”干完活”

    03 · 定价与额度经济学:0/68/200/500元四档怎么算账

    04 · 腾讯WorkBuddy:一个险被砍掉的项目逆袭

    05 · 阿里双线作战:千问办公+Qoder

    06 · 三强横评表:一张图看懂怎么选

    07 · 企业落地建议:别只看功能,安全才是分水岭

    08 · 趋势判断与结语

    8月25日,字节跳动把「豆包工作」做成了独立应用正式发布。这不是一次普通的产品更新——它标志着国内AI办公赛道正式从”对话助手内卷”切换到”Agent集团军作战”。仅仅一天之后的8月26日晚,阿里千问Qwen3.8-Flash与智谱GLM-5.3-Flash同日开源;8月28日,阿里又上线了全新Qoder智能体工作台。再往前数,8月20日阿里发布了Qwen-UI-Agent图形界面智能体基座模型。

    8月的最后一周,国产AI工具密集出牌,而牌桌中央的位置只有一个:谁的Agent能把活真正干完。这篇文章我们把字节豆包工作、腾讯WorkBuddy、阿里千问办公三家的产品掰开揉碎,从能力、定价、生态、安全四个维度做一次完整横评,帮你回答那个最实际的问题——到底该用哪个。

    01 · 一周三连击:AI办公赛道变天了

    先看时间线,你就明白为什么说”变天”:

    • 8月17日:豆包上线手机远程控制电脑,手机发指令就能处理电脑里的文件;
    • 8月18日:Windows虚拟桌面上线,AI在独立环境执行任务,不污染用户本机;
    • 8月20日:豆包侧边工作台上线的同一天,阿里发布Qwen-UI-Agent,让模型”看懂每一块屏幕”;
    • 8月21日:豆包推出技能商店、连接器和工作伙伴;
    • 8月24日:字节官宣TRAE、扣子(Coze)团队并入豆包体系,AI办公重心收拢到豆包;
    • 8月25日:豆包工作独立应用正式发布,订阅最高500元/月;
    • 8月26日:Qwen3.8-Flash与GLM-5.3-Flash同日开源,办公Agent的模型底座直接降价;
    • 8月28日:阿里Qoder智能体工作台上线,主打企业级专业开发。

    一个清晰的趋势浮出水面:2023年是AI编程工具的”补全年”,2024年是”对话年”,而2026年正在成为”自主年”——AI工具的核心叙事从”帮你写一行代码””回你一段话”,彻底转向”帮你交付一个完整结果”。(据极客公园《2026 AI编程软件观察》)

    02 · 豆包工作拆解:从”会聊天”到”干完活”

    豆包工作脱胎于2026年6月上线的”豆包办公”工作任务模式,8月密集整合TRAE、扣子团队的能力后正式独立。它的定位说得很直白:从”问答助手”进化为能替你干活的”数字打工人”——指令进,成果出,文件直接放到你桌面上。据南方都市报报道,其电脑版已可通过官网下载,新用户登录即领30天订阅权益。

    四大核心能力

    ① 本地电脑操控 + 云电脑双模式

    授权之后,豆包能直接在本机整理文件、填表格、改文档——有用户让它归类堆了半年的桌面截图,两分钟搞定。更关键的是”双模式”分工:涉及本地软件和私密文件的任务全程本机跑;需要长时间挂机、定时触发的批量任务丢给云电脑独立运行,电脑关机了,任务还在跑。外出时还能用手机远程操控电脑继续推进。

    ② 技能商店 + 连接器

    上百个即插即用的技能覆盖财报解读、合同生成、PPT制作,不用写复杂提示词;连接器打通飞书、钉钉、企业微信、腾讯会议,信息在系统之间直接流转,省掉复制粘贴。

    ③ 工作伙伴小队

    目前豆包工作内已上架一百多个”工作伙伴”——UI设计师、HR招聘助手、种草图文高手、短剧策划师……你可以组建多智能体小队,一段指令把采集、分析、创作、汇总串成完整链路。有体验者描述”AI编辑部小队”:第二天飞书群里已经躺着带标题和配图的初稿。

    ④ 飞书深度打通:企业上下文继承

    这是豆包工作最大的差异化。用飞书账号登录后,它能在权限范围内调用企业沉淀的聊天记录、文档、会议纪要、日程——Agent不是靠你输入的一句话凭空猜,而是基于真实的企业上下文理解和执行。创作的内容也会沉淀回飞书,成为可复用的企业知识。

    实测表现:能干完活,但还不够懂业务

    据钛媒体实测,用豆包2.1 Pro模型制作中秋奶茶营销策划案,它同时交付了飞书文档、PPT文件和演讲稿,商业策划案的模块基本齐全,还支持”指哪改哪”的框选修改。但也暴露了短板:业务理解层面仍有距离,复杂执行会翻车,多表公式、精细排版仍需人工复核。(据钛媒体《实测豆包工作:WorkBuddy迎来最强对手?》)

    03 · 定价与额度经济学:0/68/200/500元四档怎么算账

    版本 月费 核心权益 适合谁
    免费版 ¥0 基础问答、文档格式整理、联网搜索,无本地操控 轻度尝鲜
    标准版 ¥68/月 5倍额度、工作任务模式、本地操控、技能商店、定时任务 个人白领主力档
    加强版 ¥200/月 20倍额度、云电脑模式、多设备协同 高频办公与小团队
    高级版 ¥500/月 50倍额度、优先算力、工作伙伴增强 重度生产力用户

    账其实不难算:68元约等于几杯咖啡,换回每周数小时重复劳动,对月交付材料超过三份的人很值。但有评测指出了硬伤——额度不透明。重度用户得先搞清楚自己的用量再决定档位,建议路径是:先开免费版跑通你的高频任务,确认体验后再升标准档。(定价信息综合自南方都市报及公开评测,官方可能调整)

    04 · 腾讯WorkBuddy:一个险被砍掉的项目逆袭

    三强中最有戏剧性的故事属于腾讯。腾讯集团高级执行副总裁汤道生日前在腾讯内刊发文复盘:WorkBuddy的前身是腾讯云早年收购的coding.net开发者工具,商业模式不佳、长期亏损,公司推进降本增效期间,CSIG一度准备收缩投入,”幸好没有砍掉这个项目”。

    转折点是AI编程。2024年腾讯推出CodeBuddy获得私有化部署收入,2026年初Agent热潮出现后,团队基于CodeBuddy底座推出界面更简单、面向非研发人员的WorkBuddy,用于写方案、制作数据报告和处理邮件、会议。汤道生披露:WorkBuddy上线后前三个月迭代超过40个版本,代码基本由AI生成,人只负责判断、调试和把关。本站此前也关注过其增长势头:WorkBuddy以1115万月活领跑国内AI办公Agent赛道

    生态侧,腾讯正在推动企业微信、腾讯文档、ima知识库、腾讯会议和iwiki与WorkBuddy打通。模型底座也刚完成升级:8月底腾讯混元发布并开源Hy4 preview,770B总参数、49B激活的MoE架构,1M上下文,输入6元/百万tokens、输出18元/百万tokens,WorkBuddy与CodeBuddy同步开启两周限时免费。(详见本站前文:腾讯混元Hy4 preview开源

    汤道生还明确了腾讯的双Agent战略:WorkBuddy代表完成检索、写作和分析的个人Agent;服务Agent通过腾讯云ADP平台连接CRM、知识库、OA、ERP等企业系统。两者并存互补——员工用WorkBuddy拆任务写报告,服务Agent调用客户数据、报价规则和合同模板完成权限校验。这是腾讯把”场景优势”变成收入的路径。

    值得注意的是汤道生的坦诚:他承认”公司整体的算力严重不足”曾拖慢腾讯模型训练和产品发展,也直言元宝过去一年在用户增长压力下”效果并不满意”。2026年二季度腾讯资本开支527.84亿元,同比增长176%,主要投向混元基础模型训练与推理支持。

    05 · 阿里双线作战:千问办公+Qoder

    阿里的打法是”开源降成本 + 办公抓场景”两条线同时推进。

    线一:把模型底座打成”地板价”

    8月26日晚开源的Qwen3.8-Flash用上了全新架构:千亿总参数仅激活6B,引入自研稀疏注意力QSA与GDN线性注意力的混合架构,在1M tokens长上下文高缓存场景可提速8倍以上,API输入每百万tokens仅1元。同日开源的智谱GLM-5.3-Flash(320B-A18B)是GLM-5系列首个原生多模态模型。开源大模型的推理成本被打下来,意味着基于这些底座做办公Agent的门槛大幅降低。(据金台资讯、AIHub综合报道)

    线二:办公与开发场景两头下注

    千问办公持续迭代代码解释器与Agent分享链路;8月20日发布的Qwen-UI-Agent则瞄准”让AI看懂每一块屏幕”,覆盖移动端、PC桌面、网页和深度搜索环境的GUI智能体基座。8月28日上线的Qoder智能体工作台直接剑指企业级专业开发——36氪实测中,它为无实际业务系统的场景自主生成了101条全覆盖回归测试用例,并输出符合企业工程化标准的完整测试报告。华尔街投行杰富瑞对八款全球主流AI Agent的真实办公任务实测中,千问办公综合排名第一。

    资金弹药也充足:阿里巴巴8月完成港股上市以来首次新股配售,募资800亿港元,净额100%投入全栈AI能力建设,配售启动一小时即获超额认购。

    06 · 三强横评表:一张图看懂怎么选

    维度 豆包工作 腾讯WorkBuddy 阿里千问办公/Qoder
    关键节点 8/25独立发布 2026年初上线,1115万月活 持续迭代+8/28 Qoder上线
    产品定位 任务执行型”数字打工人” 非研发人员的办公Agent 办公助手+企业级开发工作台
    核心差异 本地+云电脑双模式、工作伙伴小队、飞书上下文继承 CodeBuddy工程底座、腾讯文档协作、双Agent战略 开源低成本底座、Qwen-UI-Agent、企业级测试能力
    生态绑定 飞书深度打通+钉钉/企微连接器 企业微信、腾讯文档、ima、腾讯会议 钉钉+阿里云生态
    定价 免费+68/200/500元三档订阅 限时免费中(Hy4发布活动) API输入1元/百万tokens起
    短板 额度不透明、复杂任务会翻车 入场晚、品牌认知待建立 产品体验碎片化、入口分散
    适合人群 个人白领、自媒体、中小团队 腾讯生态企业、文档协作重度用户 开发者、成本敏感的技术团队

    一句话总结三家打法:字节在收拢(TRAE+扣子并入豆包,一个入口打全场);腾讯在补课(算力加码+双Agent分层);阿里在铺路(把模型成本打下来,让生态伙伴帮它打仗)。

    07 · 企业落地建议:别只看功能,安全才是分水岭

    功能表谁都能列,但企业选型真正的分水岭在安全与权限体系。这里给三条实操建议:

    建议一:按现有生态绑定选,迁移成本大于功能差异

    用飞书的企业,豆包工作能直接继承组织权限内的文档与会议纪要,冷启动成本最低;重度使用企业微信+腾讯文档的团队,WorkBuddy的协同链路更顺;以钉钉为主阵地的团队优先看千问办公。三家连接器都宣称支持竞对产品,但”深度打通”和”能用”是两回事。

    建议二:审查授权边界与审计能力

    豆包工作强调全链路Agent安全防护(设备接入、权限设置、额度管控、数据加密、操作审计),并严格继承飞书既有权限体系、个人与企业数据隔离,据称已是国内首批通过办公智能体能力与云端基准测试双项认证的办公智能体。选型时务必验证:Agent能访问哪些目录和系统、操作是否留痕、越权如何拦截。

    建议三:从”初筛+人工复核”的混合模式起步

    对文档密集型行业(比如安全生产领域的隐患台账、检查报告、培训材料),Agent适合承担初稿生成、数据汇总、格式整理,但财务数据、合同条款、合规结论必须人工审计后再用——所有评测都确认了这一点:AI交付的是80分的底稿,最后一公里仍需要人的专业判断。

    08 · 趋势判断与结语

    回看这一周,有三个信号值得记住:

    • 入口战争结束,交付战争开始。比拼的不再是谁的对话框好看,而是谁能把文件真正放到你桌面上;
    • Token经济学决定产品形态。Agent执行复杂任务的token消耗可达普通对话的百倍以上,”免费聊天+付费干活”的分层模式会成为行业标配;
    • 好戏还没完。微信被曝正小范围测试个人AI代理”小微”,腾讯的社交AI随时可能入局;智谱GLM-5.3-Flash等开源模型两周内快速铺开,第三方办公Agent会迎来爆发。

    对普通用户,我们维持一个克制的建议:先用免费版跑通自己最高频的三个任务(多数人答案是会议纪要、周报、数据整理),跑得通再谈付费。AI办公Agent的竞争才刚跑完”头一公里”,你的工作流选择不必抢跑,但值得从今天开始认真试。

    #豆包工作
    #AI办公Agent
    #腾讯WorkBuddy
    #千问办公
    #字节跳动
    #AI工具测评

    本文由 AI工具导航(xcoolevdb.site)发布,持续追踪AI工具最新动态。


  • 腾讯混元Hy4 preview开源:770B参数、1M上下文,它还参与了”造自己”






    腾讯混元Hy4 preview开源:770B参数、1M上下文,它还参与了”造自己”






    🚀
    腾讯混元 Hy4 preview 开源
    770B 参数 · 1M 上下文 · 递归自我改进闭环
    2026年8月28日正式发布并开源
    AI
    AI工具导航
    cn.xcoolevdb.site · 每期扣一扣国产AI新品

    腾讯混元Hy4 preview开源:770B参数、1M上下文,它还参与了”造自己”

    8月的国产大模型圈卷得像早高峰的地铁:智谱刚开源GLM-5.3-Flash,阿里同日甩出Qwen3.8-Flash,8月28日腾讯混元直接把压箱底的Hy4 preview放上了开源平台——770B总参数、1M上下文,外加一个更值得琢磨的细节:这个模型参与了”造自己”。

    📑 本文目录
    1. 30秒速览:Hy4 preview 是什么
    2. 从Hy3到Hy4:四个月的跨代升级
    3. 1M上下文不是数字游戏
    4. 盲测2.99分:怎么看这份成绩单
    5. 四大生产力场景:为干活而生
    6. 真正的大新闻:它参与了造自己
    7. 价格与上手路径
    8. 八月混战:Hy4的卡位
    9. 适合谁用 & FAQ

    一、30秒速览:Hy4 preview 是什么

    先把结论放前面。2026年8月28日,腾讯混元发布并开源新一代大语言模型 Hy4 preview,核心参数三句话:总参数770B、激活参数49B(MoE架构)、上下文长度突破1M。官方定位很直白——“为生产力而生”,在代码、办公、游戏、科学这几类真实干活场景上重点发力。

    发布与开源时间
    2026-08-28
    架构
    MoE · 770B总参 / 49B激活
    上下文长度
    1M(1,048,576 tokens)
    推理模式
    high(默认)/ no_think
    开源协议
    Apache 2.0 · 免费商用
    API定价
    输入6元 / 输出18元 / 百万tokens

    模型已在 WorkBuddy / CodeBuddy 国内版及国际版、元宝、ima 等腾讯产品同步首发,普通用户打开产品就能体验;开发者可以通过腾讯云TokenHub和OpenRouter接入API;想自己折腾的,HuggingFace、GitHub、ModelScope、GitCode 四个平台都能直接拉权重,协议是Apache 2.0,允许免费商用。

    💡 一个背景

    自今年2月重建基础设施以来,混元大模型平均每两个月迭代一次大版本,采用”preview先行、正式版跟进”的节奏,把真实用户反馈持续引入研发。Hy4正式版大概率已在路上。

    二、从Hy3到Hy4:四个月的跨代升级

    光看770B没感觉?拉出上一代Hy3对比一下,升级幅度一目了然:

    维度 Hy3 Hy4 preview 变化
    总参数 295B 770B 约2.6倍
    激活参数 21B 49B 约2.3倍
    上下文长度 256K 1M 4倍
    迭代周期 四个月完成跨代

    这里得夸一下MoE(混合专家)架构的妙处:770B总参数意味着知识储备拉满,但每次推理只激活49B参数,相当于”大模型的脑子、小模型的电费”。这也是为什么各家旗舰都扎堆MoE——能力要堆上去,推理成本不能跟着翻几倍。

    三、1M上下文不是数字游戏

    100万token是什么概念?换算成汉字大约70多万字。给你两个直观参照:

    • 整本《红楼梦》丢进去,它能精准定位到任意一回的细节,不用你分段摘要、来回补充背景;
    • 一个中型项目的全量代码库一次性喂进去,跨文件排查bug、梳理整体架构,不用拆成碎片反复投喂。

    长上下文真正改变的是工作方式:很多过去依赖RAG”检索拼接”的场景,现在可以整本直接读。信息不再被切碎,上下文里的逻辑关系得以保留,这对代码理解、长文档分析、跨文件协作这类任务价值巨大。

    四、盲测2.99分:怎么看这份成绩单

    官方公布的评测方式有点意思:腾讯组织了163名内部专家,对203个工程任务做盲测,Hy4 preview拿到2.99/4.00的均分,略优于GLM 5.3(2.92)和Kimi K3(2.94)。另外在 Code Arena WebDev 榜单上排第5,开源模型里排第3。

    ⚠️ 冷静看数据

    这批盲测是腾讯内部组织的,专家和任务集由腾讯定义,”略优”的差距也在毫厘之间。参考即可,别当唯一标准。不过”稳居开源第一梯队”这个判断,目前多家媒体口径一致,没有太大争议。

    值得一提的是模型的训练方式:Hy4通过与软件工程、游戏、金融、安全等领域的腾讯专家数据共建,加上与WorkBuddy等产品的深度协同(Co-Design),练的是”真实生产力任务”而不是跑分技巧。这一点从下面四大场景的侧重就能看出来。

    五、四大生产力场景:为干活而生

    🛠 软件工程

    长程开发任务的理解、规划、调试与验证能力增强,能接住”从需求到上线”的完整链路;前端开发的视觉审美和交互质量也有针对性提升。和CodeBuddy协同后,走的是”模型+工具”的组合拳。

    📊 办公分析

    复杂办公环境理解和金融分析能力显著提升,重点优化数据分析与跨文件协作——从信息处理到文档、表格、演示文稿交付的完整流程,这是冲着WorkBuddy的办公场景去的。

    🎮 游戏开发

    “一句话生成可玩原型”能力增强,能熟练调用游戏引擎,开发者可以通过多轮交互持续完善复杂游戏项目。对独立开发者和小团队来说,这是个省掉大量重复劳动的方向。

    🔬 科学研究

    复杂科研问题的理解、推理与求解能力提升,在AI研发、分子动力学模拟、凝聚态物理、基础数学等场景均有长足进步。

    🔎 给HSE同行提个醒

    官方披露的训练数据共建名单里,“安全”与软件工程、游戏、金融并列出现。对做安全生产管理的人来说,这是个值得盯的信号——用Hy4做隐患数据图谱、应急预案初稿生成、安全培训问答这类场景,后续值得实际测一测。

    六、真正的大新闻:它参与了造自己

    如果只盯着参数和榜单,你会错过这次发布最本质的东西。

    Hy4 preview 第一次全程参与了自身的研发:训练方法、数据策略、评估体系、底层算子的自动优化,全都有它的份。模型自己提方案、跑实验、看结果、继续迭代,实验产生的代码、日志和反馈进入下一轮探索——官方称之为“初步的递归自我改进闭环”。翻译成人话:AI开始自己优化自己了。

    不止于”说漂亮话”,它还有可量化的产出:Hy4自主分析推理系统瓶颈,围绕算子融合、通信优化等方向开展多轮优化,端到端吞吐量相较基线提升31.8%,在不同上下文长度和并发度下均取得稳定收益。

    💡 为什么这事重要

    以前是人调模型,现在是模型也下场调自己——包括调自己跑起来的基础设施。这一步迈得不算大,但方向的味道很足:模型的迭代速度可能开始摆脱纯人力节奏。2026年这个时间点,”递归自我改进”从论文概念走进旗舰模型的发布说明,本身就是个里程碑式信号。

    七、价格与上手路径

    定价延续混元的普惠路线,在770B这个体量级里算相当克制的:

    计费项 价格(元/百万tokens)
    推理输入 6
    推理输出 18
    缓存命中输入 0.3

    另外,WorkBuddy和CodeBuddy开了为期两周的限时免费,想尝鲜的现在就能白嫖,建议抓紧。

    五条上手路径,按需选择:

    1. 纯体验:打开元宝或ima,直接聊,零门槛;
    2. 写代码:CodeBuddy国内版/国际版,两周限免期内值得重度试;
    3. 办公流:WorkBuddy,测测文档、表格、PPT的交付完整度;
    4. 开发者接API:腾讯云TokenHub或OpenRouter,model名 hy4-preview;
    5. 本地部署:四个开源平台拉权重,Apache 2.0免费商用。
    ⚠️ 部署前先掂量

    BF16原始权重约1.42TiB(131个safetensors分片),另有FP8量化版约减半。个人玩家基本无望,企业私有化也需要多卡集群。普通用户老老实实走API或产品端。

    📌 迁移提醒

    腾讯云TokenHub价格表显示,Hy3 preview 将于2026-08-31下线。还在调老版本API的项目注意迁移,别等报错了才想起来。

    八、八月混战:Hy4的卡位

    把镜头拉远,8月的国产大模型市场已经卷成什么样了:

    • 智谱:8月14日发布GLM-5.3,8月26日开源GLM-5.3-Flash(就是此前以”Ox Alpha”马甲匿名登顶OpenRouter的那位),320B总参/18B激活、原生多模态、MIT协议;
    • 阿里:8月26日开源Qwen3.8-Flash,125B总参仅激活6B,推理成本每百万tokens输入1元、输出3元;8月12日Qwen3.8-Max权重开源;
    • 月之暗面:Kimi K3 7月中旬发布、7月底全量权重开源,KDA注意力架构+1M无损上下文;
    • DeepSeek:V4系列8月17日起峰谷计费,周末全天闲时价。

    各家打法其实已经分化:有的卷价格(Flash系把token打到”白菜价”),有的卷开源声量(权重、许可证、Day0适配)。而Hy4 preview的差异点在于两头都不放弃——价格守在普惠线,同时把筹码押在”递归自我改进”+”自家产品矩阵协同”上:CodeBuddy、WorkBuddy、元宝、ima首发即落地,模型能力直接灌进亿级用户的生产力入口,这是纯模型厂商短期学不来的。

    九、适合谁用 & FAQ

    • 开发者:长程工程任务、大代码库重构与排查,CodeBuddy限免期内值得重度体验;
    • 办公族:数据分析、跨文件协作、文档表格PPT一条龙,WorkBuddy是主战场;
    • 游戏/创意团队:一句话出可玩原型,快速验证玩法;
    • 科研人员:模拟计算与复杂推理辅助;
    • 企业用户:Apache 2.0免费商用,私有化部署有FP8量化版可选。
    Q1:Hy4 preview免费吗?
    分两层:模型权重Apache 2.0协议开源,免费商用;API按量收费(输入6元/输出18元/缓存命中0.3元每百万tokens)。另外WorkBuddy和CodeBuddy有两周限时免费,产品端体验零成本。
    Q2:本地部署需要什么配置?
    BF16原始权重约1.42TiB,FP8量化版约减半,都需要多卡集群起步,个人玩家建议直接走API、元宝或ima。
    Q3:和GLM-5.3、Kimi K3比,选哪个?
    盲测分上Hy4略优(2.99 vs 2.92/2.94),但那是腾讯自家的测试口径。选型建议:重前端和长文档解析,Kimi K3口碑扎实;重极致性价比,GLM-5.3-Flash和Qwen3.8-Flash更狠;重长程生产力任务和产品协同,Hy4有独到优势。最好的办法是拿自己的真实任务各跑一遍。
    Q4:1M上下文实际能喂多少内容?
    中文场景大约70多万汉字,相当于一整本长篇小说,或一个中型项目的全量代码库。注意上下文越长,成本和延迟也越高,按需使用。

    写在最后

    参数和榜单很快会过时,但“递归自我改进闭环”这个方向值得单独记一笔:当模型开始参与优化自己的训练方法、评估体系甚至推理基础设施,迭代速度的天花板就从”有多少工程师”变成了”闭环转多快”。混元把”preview先行、正式版跟进”当成常规节奏,真实世界的反馈持续灌回研发——9月的Hy4正式版,到时候咱们再扣一扣细节。

    🔗 参考来源
    • 人民网《腾讯混元开源新一代大语言模型Hy4 preview》2026-08-29
    • 科技日报《腾讯混元Hy4 preview发布并开源》2026-08-28
    • 腾讯云TokenHub官方文档《模型价格》2026-08-28更新
    • 新浪科技《腾讯混元Hy4来了!7700亿参数直接开源》2026-08-29
    • 搜狐科技《腾讯770B模型开源:真正吓人的是它参与了造自己》2026-08-29
    • DataLearner《Hy4 preview:770B参数、1M上下文、价格与评测》2026-08-28
    腾讯混元Hy4 preview开源大模型MoECodeBuddyWorkBuddyAI编程
    AI工具导航 · cn.xcoolevdb.site | 本文由AI辅助整理,数据以官方发布为准


  • 阿里全新Qoder发布:从AI编程工具到智能体工作台,600万用户的下一站






    阿里全新Qoder发布:从AI编程工具到智能体工作台,600万用户的下一站






    🚀
    阿里全新Qoder发布
    AI编程工具进化为智能体工作台
    Harness长链路自治 · 编程/通用双模式 · 40+连接器生态
    2026年8月27日 · AI工具深度观察
    AI
    AI工具导航
    @cn.xcoolevdb.site · 原创深度

    阿里全新Qoder发布:从AI编程工具到智能体工作台,600万用户的下一站

    一年前的今天,Qoder作为AI编程IDE亮相;一年后的8月27日,它带着全新的定位回来了——不再只是写代码的工具,而是一个面向所有人、把目标变成交付物的智能体工作台。

    📑 本文目录

    一、Qoder这一年:从AI IDE到智能体工作台

    二、核心升级:Harness技术的四张底牌

    三、双模式设计:程序员和普通人各取所需

    四、Goal与Plan:Agent如何替你把活干完

    五、下载方式与限时福利

    六、行业视角:编码Agent的终局是什么

    据IT之家8月27日消息,阿里巴巴今日正式发布全新Qoder——一个以Coding能力为核心底座、面向所有人打造的智能体工作台。官方给出的使用方式非常简单:”告诉Qoder你想完成什么,它会理解上下文、制定计划、调用工具、执行并验证,整个过程随时可以查看、调整或接管。”

    这句话背后是一次彻底的产品重定义:Qoder不再是”帮你补全代码的编辑器”,而是”接手任务并交付结果的数字同事”。本文拆解这次发布的全部关键信息。

    一、Qoder这一年:从AI IDE到智能体工作台

    原版Qoder IDE于2025年8月发布,彼时还是一款典型的AI编程工具——智能补全、问答、代码生成,对标Cursor、通义灵码们。过去一年,国内AI编程赛道竞争白热化,字节Trae、腾讯CodeBuddy、智谱GLM Coding Plan各成一派,各家比拼的不只是模型能力,更是谁先把”Coding Agent”做成开发者的日常入口。

    一年来Qoder交出的成绩单是:全球用户超过600万,企业客户超过10万家。这个基本盘足以支撑一次大胆的产品跃迁——今天的新Qoder,主要工作对象已经从”代码工程”全面转向”智能体任务”,产品形态也从IDE进化为工作台。

    二、核心升级:Harness技术的四张底牌

    这次发布最值得关注的词是Harness——一个在近几个月被DeepSeek Harness、各类Agent框架反复带火的工程概念。简单说,Harness就是包在大模型外面、负责”让模型真正把事办成”的执行框架。全新Qoder围绕它给出了四张底牌:

    ① “读—改—验证—迭代”的长链路自治。Agent能自行检索代码库、跨文件编辑、运行测试,并根据真实执行结果自我纠错。这解决的正是AI编程工具的老毛病:生成一段代码很简单,但保证它能跑通、跑对很难。让验证环节闭环,才叫交付。

    ② 分级权限模式+工具白名单机制。敏感操作必须显式授权才能执行。在企业场景里,这条比任何炫技功能都重要——企业敢不敢用Agent,第一道门槛从来不是能力,而是可控性。

    ③ 内置海内外SOTA模型并深度适配。Harness与Qwen模型协同迭代,在长上下文处理、自动上下文压缩、工具调用准确率上形成端到端优化优势。模型和执行框架一起调优,而不是拿公网API简单套壳,这是阿里系产品独有的纵深。

    ④ 跨会话长期记忆+周期性自我提炼技能。Qoder会记住你的项目结构、代码习惯和工作偏好,并且周期性地把重复动作沉淀为技能。官方的说法是:”用得越久,越懂你的项目和习惯。”这意味着切换成本会随使用时长不断升高,产品粘性设计得很聪明。

    三、双模式设计:程序员和普通人各取所需

    新Qoder提供了两种模式:编程模式面向开发者和代码相关任务,Keep传统强项;通用模式则面向更广泛的用户和场景——用户无需直接处理代码,也能借助Coding和工具能力完成任务。

    这个设计和字节豆包工作(8月25日发布)的思路异曲同工:Coding能力正在成为通用智能体的”隐形基础设施”。写代码只是表象,真正的价值在于Coding背后那套”理解-拆解-执行-验证”的严谨思维链——它可以用来做数据处理、文档生成、系统操作等一切数字化任务。

    值得玩味的是时间点:豆包工作发布两天后,阿里就掏出全新Qoder应战;再往前数,腾讯WorkBuddy、百度搭子、千问办公都已就位。 国内大厂在”泛Coding Agent工作台”这条赛道上的卡位战,已经全面开打。

    四、Goal与Plan:Agent如何替你把活干完

    在具体交互上,新Qoder的骨架由五个部件组成:

    · Goal:让Agent围绕明确目标持续工作,而不是一问一答地零散响应。
    · Plan:先想清楚路径再动手,让任务执行有章法可循。
    · 记忆、本地项目和运行状态:为任务提供完整背景,减少重复交代成本。
    · Browser Use、Computer Use:可以直接操作网页和桌面应用,突破聊天框的边界,触达真实工作环境。

    生态层面,Qoder接入了40+连接器、70+插件与20K+技能,无论是代码仓库、项目管理、云服务还是内部工具,都可以作为上下文和工具直接融入AI的工作流。此外它还支持语音随口唤起——不只回应指令,更会主动带来任务进展、重要提醒与下一步建议。

    这套组合拳的意图很清晰:从”单次对话”升级为”持续共事”。当Agent有了目标感、计划性、记忆力和操作系统级的执行权限,它才可能承担起”数字同事”而非”问答玩具”的角色。

    五、下载方式与限时福利

    全新Qoder桌面应用端已发布,可前往 qoder.com 下载国际版、qoder.cn 下载中国版。即日起至9月1日10:00,面向国际版与中国版用户开放限时福利:

    · 个人版:连续5天,每天10:00可领取500 Qwen系列专属Credits,最多可领2,500 Credits;
    · 企业版:活动期间在全新Qoder中使用Qwen3.8系列模型,可享5折优惠。

    🎁 薅羊毛提示

    个人用户记得每天上午10点准时上线领取,连续5天累计2500 Qwen Credits,足够体验一轮完整的智能体任务流。企业侧用Qwen3.8系列打5折,叠加近期千问开源模型的价格战红利,成本空间已经压得很低。

    六、行业视角:编码Agent的终局是什么

    把时间线拉长看,最近半个月的国内AI产品节奏堪称密集:8月25日字节豆包工作发布、8月26日智谱认领”牛来”模型GLM-5.3-Flash并开源、阿里深夜开源Qwen3.8-Flash,再到今天全新Qoder亮相——大厂们的动作高度一致:模型降价开源打底,Agent产品卡位冲线

    编码是这个战场的第一站,但显然不会是终点。三个趋势值得关注:

    第一,Coding能力正在下沉为通用底座。无论是豆包工作的办公场景还是Qoder的通用模式,比拼的都是同一套”理解-计划-执行-验证”链路。谁把这条链路的可靠性做到最高,谁就能承接更复杂的真实工作。

    第二,安全与权限成为企业采购的分水岭。新Qoder的分级权限+白名单设计与豆包工作的云电脑隔离方案指向同一个问题:让Agent拿到操作系统的执行权之后,如何兜住风险。这个环节做不好,再强的能力也进不了企业预算表。

    第三,记忆与个性化构筑长期壁垒。跨会话记忆、技能自我提炼,本质是把使用时长转化为切换成本。Agent产品的竞争将从”单次效果”转向”相处越久越好用”的复利曲线。

    💡 一句话总结

    全新Qoder标志着国内AI编程工具集体跨过”Copilot补全”阶段,进入”Agent交付”时代:模型管聪明,Harness管可靠,权限管安全,记忆管忠诚。600万用户的下一站,是把写代码的经验变成替所有人干活的通用生产力。

    后续我们将持续跟进新Qoder的实际任务完成率、企业落地案例,以及与豆包工作、百度搭子的正面对比评测。相关阅读:《豆包工作发布首日拆解:字节押上TRAE和扣子,办公Agent四国杀开打》《AI办公智能体大战:WorkBuddy领跑,百度搭子增速1063%》


  • 豆包工作发布首日拆解:字节押上TRAE和扣子,办公Agent四国杀开打






    豆包工作发布首日拆解:字节押上TRAE和扣子,办公Agent四国杀开打






    🤖
    豆包工作发布首日拆解
    字节押上TRAE和扣子 · 飞书上下文全面打通
    办公Agent四国杀正式开打
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月25日

    豆包工作发布首日拆解:字节押上TRAE和扣子,办公Agent四国杀开打

    8月25日,字节跳动正式发布企业级办公Agent豆包工作,把TRAE、扣子和7月底已并入的飞书团队全部集结在豆包体系之下,叠加腾讯WorkBuddy、阿里千问办公、百度库库AI,办公Agent四国杀正式成型。这场大战的真正战场不在模型,而在企业上下文。

    📋 本文目录

    一、事件速览:8月25日,字节亮牌

    二、豆包工作能做什么:从聊天框到交付结果

    三、任务执行系统:操作电脑、云电脑接力、手机遥控、多Agent工作小队

    四、组织大整合:TRAE、扣子、飞书向豆包集结

    五、飞书上下文:字节最硬的牌

    六、四国杀格局盘点(四产品对比表+8月时间线表)

    七、为什么办公Agent的PMF先从ToC跑出来

    八、模型聚合之后,决胜点是路由

    九、高盛视角:Agent进入执行时代

    十、上手指南与冷思考+结语

    一、事件速览:8月25日,字节亮牌

    8月25日,据华尔街见闻、极客公园等多家媒体报道,字节跳动正式发布企业级办公Agent豆包工作。电脑版官网可下载,免费领30天订阅权益;同步升级飞书内的豆包企业版入口。这是字节首次以完整的”产品+组织”双线阵容切入企业办公Agent战场,也是国内办公Agent四国杀格局真正成型的一天。

    豆包工作产品负责人赵祺在发布中表示,豆包工作可以自主拆解任务、调用工具、持续推进复杂工作流,从”对话窗口”升级为”交付结果”。配合8月24日的组织调整公告——TRAE、扣子团队并入豆包体系,向豆包产品负责人赵祺汇报,TRAE Work/扣子与豆包整合,TRAE IDE/CLI继续编程线,7月底飞书团队已并入豆包——可以看出字节对这场战的打法:把模型、Agent、IDE、企业协作、办公应用五条产品线全部押到豆包这一条船上。

    本站在四天前本站盘点的办公Agent大战一文中,曾指出8月14日阿里千问办公、百度库库AI同日上线,叠加腾讯WorkBuddy,办公Agent三国杀已经形成。四天过去,字节豆包工作以最强阵容入局,三国杀正式升级为四国杀,而其中暗藏的牌局远不止一款新产品那么简单。

    🔑 8月25日豆包工作发布关键节点

    • 8月25日:豆包工作正式发布,电脑版官网可下载,免费领30天订阅权益

    • 产品定位:企业级办公Agent,自主拆解任务、调用工具、推进复杂工作流

    • 入口升级:飞书内豆包企业版入口同步升级,实现”一处升级,全端可用”

    • 8月24日:组织调整,TRAE、扣子并入豆包,向赵祺汇报

    • 7月底:飞书团队已并入豆包体系

    • 8月17-21日:密集发布手机远程控制电脑、Windows虚拟桌面、双模式、侧边工作台、技能商店、连接器、工作伙伴,累计200+技能和连接器

    如果只看产品发布,这是一次常规的企业Agent上新;但如果把镜头拉远到8月整月——密集的产品发布、组织整合、认证落地、竞对跟进——就会发现,这并非单点动作,而是字节用一个月时间完成了从”AI产品矩阵”到”AI办公操作系统”的转身。

    二、豆包工作能做什么:从聊天框到交付结果

    豆包工作的核心定位,可以用一句话概括:它不再是一个聊天框,而是一个交付结果的工作系统。

    据极客公园和豆包工作公众号介绍,豆包工作在能力上覆盖了企业办公的全链路场景:

    写东西:写方案、会议纪要、报告、调研总结、表格分析

    生成物:生成文档、表格、PPT、图片、视频、网页、应用

    指哪改哪:协作编辑中支持框选定、点修改,所见即所得

    操作设备:授权后操作浏览器和电脑,跨应用执行任务

    长任务:长任务调用云电脑接力,本机关机不中断

    远程控制:手机远程操控电脑,实现人在路上,任务在跑

    多Agent:组建多Agent工作小队(数据/研究/设计智能体协作)

    把这些能力放在一起,会发现豆包工作的产品形态和前几代办公AI有明显区别:它不是把任务拆成”提示词+对话、复制粘贴结果”的循环,而是把任务看作”从输入到交付物的完整工作流”,由Agent自主规划路径、调用工具、推进多步骤执行。

    特别值得注意的一项能力是”框选定、点修改”。这一交互最早在Cursor、Notion AI等工具中出现,本质是把AI的编辑粒度从”整段重写”细化到”局部元素级修改”,对最终用户的修改成本而言是数量级降低。豆包工作把它纳入默认交互,意味着字节认为这一交互已经过了教育期,可以放进企业Agent的标配能力里。

    💼 豆包工作能做什么(企业视角)

    • 写方案:输入目标与约束,输出完整可执行方案文档

    • 会议纪要:基于真实会议内容生成结构化纪要与待办

    • 报告与调研总结:多源信息汇总、分析、产出报告

    • 表格分析:对Excel/在线表格做分析、出图、给结论

    • 多模态生成:文档/表格/PPT/图片/视频/网页/应用一站生成

    • 协作编辑:框选定 点修改的局部精修,不再整段重写

    换言之,豆包工作这次发布真正想回答的并不是”AI能不能写东西”,而是”AI能不能把整件事做完,并把结果交到人手里”。这是从”工具”到”工作系统”的产品跃迁,也是字节对企业级办公Agent的第一份正式答卷。

    三、任务执行系统:操作电脑、云电脑接力、手机遥控、多Agent工作小队

    如果只把豆包工作看作”更强的聊天框”,会错过这次发布真正的产品质变。它的核心不是对话模型,而是一套任务执行系统。这套系统由四个关键机制组成,每一个都在重塑Agent的产品形态。

    3.1 操作电脑:Agent首次跨应用执行

    据豆包工作公众号介绍,豆包工作授权后可以操作浏览器和电脑。这意味着Agent不再局限于”在某个应用内部”完成任务,而是能跨应用调度——比如在ERP里抓数据、在Excel里处理、再把结果贴到飞书文档。这一能力在企业场景里是刚需,也是”个人Agent”和”企业Agent”的分水岭。

    3.2 云电脑接力:本机关机任务不中断

    长任务调用云电脑接力,本机关机不中断,这一点解决的是企业Agent最常被诟病的可靠性问题。过去如果Agent跑一个长流程,本机关机、网络断开、浏览器关闭都会让任务中断。云电脑接力的引入让Agent有了”独立运行环境”,用户的本机只承担交互入口的角色,执行过程由云端承接。

    3.3 手机远程操控电脑:Agent随人而走

    8月17-21日密集更新中,手机远程控制电脑正式上线。这意味着你可以在路上用手机指挥家里的电脑跑任务,人和设备的空间解耦。这一能力对企业高管的差旅场景、自由职业者的移动场景都意义重大,也让Agent从”工位工具”升级为”随身助手”。

    3.4 多Agent工作小队:数据/研究/设计智能体协作

    最关键的一项是组建多Agent工作小队——数据智能体、研究智能体、设计智能体可以协作完成同一个任务。这一能力本质上是在企业Agent之上叠加了一层”团队抽象”:一个复杂任务被拆解为数据收集、深度研究、视觉设计等子任务,各Agent并行执行,最后由调度Agent整合交付。这与企业里”数据分析师+研究员+设计师”的小团队工作方式高度同构。

    执行机制 解决的痛点 企业价值
    操作浏览器和电脑 Agent无法跨应用调度 数据抓取、跨系统协作
    云电脑接力 本机关机任务中断 长时间流程可靠性
    手机远程操控 人机空间绑定 差旅/移动办公
    多Agent工作小队 单人Agent能力有限 复杂任务并行执行
    技能商店/连接器 Agent能力扩展难 200+技能/连接器生态
    Windows虚拟桌面/双模式/侧边工作台 企业IT环境兼容 不破坏既有工作流

    如果说模型是Agent的大脑,那这四个机制就是Agent的”手脚+办公位+团队”。豆包工作在产品形态上,实际上已经把”Agent”这个词从”对话”重定义为了”任务执行系统”。

    四、组织大整合:TRAE、扣子、飞书向豆包集结

    如果只看产品发布,容易低估字节这次动作的力度;真正有信号意义的是8月24日的组织公告:TRAE、扣子团队并入豆包体系,向豆包产品负责人赵祺汇报。这是一次罕见的大整合,把字节内部与”AI办公”相关的多条产品线全部押到了一条船上。

    整合之后的产品分工是:

    TRAE Work/扣子:与豆包工作整合,主要承担Agent和办公场景的入口能力

    TRAE IDE/CLI:继续编程线,服务开发者,不并入办公线

    飞书团队:7月底已并入豆包,与豆包工作共享上下文与权限体系

    豆包工作:作为企业级办公Agent的主品牌,统筹对外发布与商业化

    这套组织调整传递的信号很明确:字节认为企业办公Agent不是单一产品的胜利,而是”模型+Agent+IDE+企业协作+办公应用”整条产品线协同作战的结果。任何一环薄弱,都会导致Agent在企业场景里跑不通。

    🏢 字节组织整合关键节点

    • 7月底:飞书团队并入豆包体系

    • 8月17-21日:豆包工作密集更新(手机远程控制/Windows虚拟桌面/双模式/侧边工作台/技能商店/连接器/工作伙伴)

    • 8月24日:TRAE、扣子团队并入豆包,向赵祺汇报

    • 8月25日:豆包工作正式发布,TRAE Work/扣子与豆包整合

    • 累计能力:200+技能和连接器,覆盖办公全链路

    这种整合在互联网大厂里并不常见——多数公司的做法是让各条产品线独立跑,KPI分摊,组织不交叉。但办公Agent的特殊性在于,它的每一个具体场景都需要模型、Agent编排、企业上下文、协作应用、安全合规五件事协同,任何一件分头负责都会出现推诿。字节选择把五条线压到豆包一个品牌下,等于在赌”集中兵力打穿企业场景”是当下唯一正确的姿势。

    再往深一层看,TRAE本来是字节的”AI IDE”产品线,主攻代码场景;扣子是字节的”AI应用搭建”产品线,主攻低代码Agent构建;飞书是字节的协作办公套件;豆包是字节的大模型品牌。这四块业务在组织上分属不同部门时,会自然各自为战;一旦整合到豆包体系,模型层的更新就能直接喂给Agent,Agent的执行结果可以直接写回飞书文档,飞书的权限体系可以无缝被Agent调用——这是典型的”产品集成+组织整合”双管齐下的打法。

    五、飞书上下文:字节最硬的牌

    如果说TRAE、扣子、飞书的整合是组织动作,那飞书在产品层面的贡献是”上下文”。在豆包工作的发布会里,飞书上下文被反复强调,字节的逻辑很清楚:企业Agent的真正壁垒不是模型,而是模型能调用的”企业上下文”。

    据极客公园报道,豆包工作在飞书内的打通是这一轮发布最重磅的产品能力,具体表现为:

    权限范围内调用:聊天记录、文档、会议纪要、日程等飞书数据,基于用户授权和飞书权限体系调用

    基于真实企业上下文:写方案、调数据、生成报告时,直接读取飞书内已有的协作内容

    共创内容沉淀回飞书:Agent生成的内容可以写回飞书文档,反哺企业知识库

    继承飞书权限体系:个人/企业数据隔离,全链路安全可控

    国内首批通过办公智能体能力与云端基准测试双项认证

    这一组能力的关键词是”权限”和”上下文”。对企业IT而言,这两件事比”AI能不能写”重要十倍:任何Agent在企业里跑不通,根因几乎都是”调不到真实数据”或”权限/合规过不了”。字节通过飞书的整合,把这两个根因直接消除了。

    “组织上下文分散在聊天、文档、会议、权限、业务系统里,积累效应强、迁移成本高,是长期壁垒。个人Agent交付的是主观价值(省2小时),进组织才有客观价值(转化率/交付周期/收入)。”

    这一逻辑被多家办公Agent的产品负责人反复强调。本站整理公开材料发现,飞书上下文在豆包工作里的实际作用,可以拆成三层:

    第一层:数据层

    飞书内的聊天记录、文档、会议纪要、日程,成为Agent可以直接调用的”企业数据源”。这与”上传一份PDF让AI读”是完全不同的事——飞书数据是实时、结构化、有权限的,Agent调用时看到的内容,和员工看到的内容完全一致。

    第二层:权限层

    飞书已有的成熟权限体系(可见/可编辑/可分享/可下载)被豆包工作继承,Agent执行任务时严格按用户权限运行。这让企业IT不必为Agent单独建一套权限,大幅降低部署成本。

    第三层:回流层

    Agent的产出物写回飞书后,自动进入企业知识库,成为后续Agent和其他员工可复用的资产。这意味着每一次Agent执行,都在给企业沉淀数据资产,而不是用完即丢。

    这才是豆包工作最硬的一张牌。模型可以套壳,工具可以拼凑,但一家公司的”飞书+企业上下文”是用一年、三年、五年的协作历史沉淀出来的,迁移成本高到企业无法承受。字节把这张牌打出来,等于把办公Agent的护城河从”模型能力”重新定义到了”企业上下文厚度”。

    六、四国杀格局盘点

    把镜头拉远到8月整月,会发现豆包工作发布是这一轮办公Agent大战的高潮,而不是起点。从8月3日阿里千问办公公测,到8月14日千问办公和库库AI同日上线,再到8月25日豆包工作正式发布,国内办公Agent的四国杀格局在不到一个月内彻底成型。

    本站在前文已经盘点了8月14日时点的三强格局。四天过去,四款产品在模型策略、组织架构、生态策略上各有动作,值得用一张总览表说清楚。

    6.1 四产品对比表:模型/形态/生态策略

    产品 厂商 核心形态 模型池 生态策略
    豆包工作 字节跳动 桌面端办公Agent 豆包Seed/GLM/DeepSeek/千问 TRAE+扣子+飞书全线整合,飞书上下文
    WorkBuddy 腾讯 桌面端办公Agent 混元Hy3/GLM/MiniMax/Kimi/DeepSeek 企业微信/腾讯文档接入,腾讯系办公生态
    千问办公 阿里巴巴 桌面端办公Agent 通义千问/GLM-5.3/DeepSeek V4 Pro 整合QoderWork/MuleRun/悟空,计划接钉钉
    库库AI 百度 桌面端办公Agent 文心/DeepSeek/GLM 8/14启用中文名”库库”+桌面端,搜索+知识图谱

    这张表最直观的信号是:四款产品全部不约而同地走向了”多模型路由”的策略——每一家都在自家主力模型之外,接入了GLM、DeepSeek、千问等头部模型作为可选后端。这印证了第八章会展开的判断:在企业Agent场景里,模型不是壁垒,模型之上的路由/编排/上下文才是壁垒。

    6.2 8月时间线表:四国杀成型全记录

    日期 事件 意义
    8月3日 千问办公公测,整合QoderWork/MuleRun/悟空,计划接钉钉 阿里办公Agent公开亮相
    8月14日 千问办公上线GLM-5.3和DeepSeek V4 Pro 多模型路由策略落地
    8月14日 库库AI启用中文名+桌面端,引入DeepSeek/GLM 百度从”搜索+AI”转向”办公Agent”
    8月17-21日 豆包工作密集更新,200+技能和连接器 字节铺好产品基础
    8月24日 TRAE、扣子并入豆包,向赵祺汇报 字节组织大整合
    8月25日 豆包工作正式发布 四国杀格局正式成型

    短短不到一个月,四款产品完成从”亮相”到”产品就位+组织整合”的全部动作。如果回看2025年同期,这一波节奏的密度几乎是前一年的两倍——这正是”AI产业进入执行时代”的真实写照(第九章会展开)。

    6.3 WorkBuddy参照:腾讯跑出来的真实数据

    四国杀里进度最快、产品形态最先验证的,是腾讯的WorkBuddy。据腾讯2026年Q1财报,WorkBuddy是”中国使用最广泛的效率AI智能体”,日活已达百万量级。易观Analysys数据显示,WorkBuddy 6月桌面端月访问量为2097万。

    据报道,WorkBuddy今年3月还只是腾讯内部一个十几人团队的支线产品,马化腾过问后迅速扩至百人团队。活跃留存超过60%,付费留存超过80%——这两个数字在SaaS行业里都属于顶尖水平,说明WorkBuddy不仅把人拉进来了,还把人留下来了,更让企业愿意付钱。

    对字节而言,WorkBuddy的存在既是压力也是坐标:压力在于腾讯已经抢跑,字节必须拿出比WorkBuddy更强的产品力;坐标在于WorkBuddy的数据已经证明,办公Agent在企业市场有真金白银的PMF,字节不必从零教育市场。

    七、为什么办公Agent的PMF先从ToC跑出来

    一个有意思的现象是:办公Agent四国杀里,几乎所有厂商都是从ToC(个人用户)起步,然后才杀向ToB(企业)。这和企业级SaaS的传统逻辑相反——过去二十年的SaaS都是先ToB再ToC,因为企业有付费能力、有采购流程、有IT决策者。

    但办公Agent打破了这个逻辑。原因在于,Agent的”价值证明”和SaaS的”价值证明”在传播路径上是反的。SaaS的卖点是”管理效率”,只能由老板和IT部门感知,员工是被动接受者;Agent的卖点是”省时间”,每个员工自己就能感知,而且越早用越能积累先发优势。

    从员工到老板:自下而上的渗透路径

    WorkBuddy的数据已经验证了这条路径:活跃留存60%、付费留存80%,这意味着用户先在ToC场景里深度使用,然后主动向企业申请采购。这种”员工先买、企业后买”的路径,在SaaS时代几乎没有先例,只有在生成式AI爆发的2024-2026年才成为可能。

    从个人价值到组织价值:主观到客观的跨越

    多位行业产品负责人在公开发言中提到,个人Agent交付的是主观价值(省2小时),进组织才有客观价值(转化率/交付周期/收入)。这一句话点出了办公Agent从ToC到ToB的关键跨越:省2小时是个人感知,转化率/交付周期/收入是老板感知。当Agent在企业里规模化部署之后,价值评估维度必须从”主观省时间”升级到”客观业务指标”。

    这也是为什么豆包工作这次发布格外强调”飞书上下文”——企业上下文的接入,正是让Agent从”省时间”升级到”改善业务指标”的关键一步。Agent能调到企业真实的销售数据、生产数据、客户数据,才能交付业务结果;调不到,就只能在”省时间”这个维度打转。

    八、模型聚合之后,决胜点是路由

    对比四国杀的四款产品,有一个非常显眼的趋势:每一家都在接入外部模型。豆包工作内置Seed/GLM/DeepSeek/千问,WorkBuddy模型池是混元Hy3/GLM/MiniMax/Kimi/DeepSeek,千问办公上线了GLM-5.3和DeepSeek V4 Pro,库库AI引入DeepSeek/GLM。

    这意味着模型本身已经不是壁垒。豆包的Seed很强,但GLM-5.3、DeepSeek V4 Pro同样在头部;混元Hy3、Kimi、GLM在WorkBuddy的模型池里都能用。任何一款Agent,只要接上”国产Top5模型”作为可选后端,在模型能力上就基本够用。

    真正的决胜点:路由与编排

    当模型成为公共资源,胜负手就转移到了”路由”上:什么时候用哪个模型?什么任务用强推理模型、什么任务用快速模型?如何把多个模型的结果整合成一份合格的交付物?这背后考验的是Agent的”任务理解-任务拆解-任务分发-结果整合”四步能力。

    路由之上的能力:工具与连接器

    仅有模型路由还不够,Agent还需要把模型能力落地到具体工具上——这就是为什么豆包工作发布时专门强调200+技能和连接器。工具的数量和覆盖广度,决定了Agent能不能真正”做事”;模型的智能,决定了Agent能不能”做对事”。两者缺一不可。

    再往上:企业上下文

    再往上走一层,决定胜负的就是”企业上下文”——Agent能调到什么数据?能在什么权限下运行?能写回到哪个系统?这正是飞书上下文对豆包工作的价值,也是WorkBuddy绑定企业微信和腾讯文档的价值,是千问办公绑定钉钉的价值,是库库AI绑定百度网盘+文库的价值。

    所以今天的办公Agent竞争,本质上是”模型之上叠加路由、路由之上叠加工具、工具之上叠加企业上下文”的三层叠加。每一层都有壁垒,但最大壁垒在最上层——企业上下文的厚度,才是迁移成本最高、对手最难复制的护城河。

    九、高盛视角:Agent进入执行时代

    把视角再拉远一层,高盛2026年8月研报中提出的判断,值得所有关注AI产业的人认真看。在这份报告里,高盛对AI产业演进给出了几个关键判断:

    商业化模式转变:从按席位订阅转向按消费量、交易量、结果收费。订阅制是SaaS时代的逻辑,按结果付费是Agent时代的逻辑。

    Agent角色转变:从辅助工具走向工作流执行者。Agent不再只是帮员工查资料,而是直接替员工完成任务、交付结果。

    价值转移:从模型向专有数据、业务上下文、领域专业能力迁移。模型同质化之后,真正的价值在专有数据和业务上下文。

    算力需求:未来5年AI相关算力需求增长约24倍。Agent执行时代对算力的消耗将远高于聊天时代。

    这四条判断放到办公Agent四国杀里,几乎一一对应:豆包工作从订阅制向”按结果/按任务”计费迁移,Agent从对话工具转向任务执行者,价值从豆包Seed模型转向飞书企业上下文,200+技能和连接器对算力的消耗远超聊天场景。

    高盛报告里还提到了一个关键趋势:”未来5年AI相关算力需求增长约24倍。”这意味着办公Agent一旦进入企业规模化部署阶段,云算力的消耗将呈现指数级增长,反过来会重塑云计算市场的竞争格局。这也是为什么豆包工作发布里专门提到”云电脑接力”——这一能力既是产品功能,也是算力战略的落地。

    “公共数据被充分学习后,人产生的新知识、新经验、新想法越来越重要。”——百度 王颖

    百度王颖的这句话,和高盛报告里的”价值向专有数据迁移”是同一逻辑:当模型在公共数据上已经训练到极致,下一阶段的差异化就来自”专有数据+人的新知识+业务上下文”。这正是办公Agent在企业市场的真正机会——不是再造一个更强的模型,而是把模型放进企业的真实业务流里,让它持续学到企业独有的知识。

    十、上手指南与冷思考+结语

    上手指南:四步用上豆包工作

    1. 下载入口:电脑版官网可下载,免费领30天订阅权益,先跑通核心场景。

    2. 飞书打通:同步升级飞书内豆包企业版入口,授权后让Agent调用真实企业上下文。

    3. 多Agent小队:尝试组建数据/研究/设计智能体协作的复杂任务,体验并行执行。

    4. 远程+长任务:在差旅场景用手机远程操控电脑,体验云电脑接力的可靠性。

    冷思考:五个值得警惕的点

    1. 免费期是教育期,不是常态:30天免费权益用完后,企业付费意愿和组织预算是否到位,需要提前评估。

    2. 权限合规永远排第一:Agent调用企业上下文时,即使有飞书权限保护,也要提前和IT/法务对齐数据边界。

    3. 不要把生产链路绑死在一款Agent上:四国杀格局未定,TRAE Work/扣子/WORKBUDDY/千问办公/库库AI都有被切换的可能,关键任务留有备选方案。

    4. 人的判断不可被替代:Agent交付的方案/报告/纪要,关键决策环节必须由人复核,不能直接用。

    5. 多Agent协作的”团队税”:多Agent工作小队听起来很美,但调度开销、沟通成本、结果不一致的风险都会拉高实际成本,小任务不建议用。

    💡 一句话总结

    8月25日豆包工作发布,是字节把TRAE、扣子、飞书三张牌押上桌面的关键一步,办公Agent四国杀正式成型。这场大战的真正战场不在模型,而在企业上下文——谁能把模型、路由、工具、企业上下文四层能力叠加到最厚,谁就能在下一阶段的AI办公操作系统之争中拿到船票。Agent从聊天框到交付结果,产业从订阅制到按结果付费,执行时代已经来了。

    后续我们将持续跟进豆包工作、WorkBuddy、千问办公、库库AI四国杀的产品迭代、企业落地和算力消耗数据。也欢迎回顾我们此前的相关深度内容:四天前本站盘点的办公Agent大战


  • “牛来大模型”Ox Alpha身份之谜:1M上下文免费不限量,Tokenizer指纹直指智谱






    “牛来大模型”Ox Alpha身份之谜:1M上下文免费不限量,Tokenizer指纹直指智谱






    🐂
    “牛来大模型”Ox Alpha身份之谜
    1M上下文 · 免费不限量 · 匿名上线 · 全网破案
    Tokenizer指纹 · 视频token预算 · API错误码 · 智谱还是谷歌
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月23日

    “牛来大模型”Ox Alpha身份之谜:1M上下文免费不限量,Tokenizer指纹直指智谱

    8月20日,一款名为Ox Alpha的匿名模型突然空降OpenRouter,104.86万token超长上下文、单次13.1万token输出、文本图片视频三模态输入,再叠加OpenCode平台连续数天几乎不限量免费使用——三天时间,它烧掉了250B token,成为全球开发者的焦点。更热闹的是身份之谜:一边是Tokenizer指纹和视频token预算层层指向智谱GLM,另一边是DeepMind研究员的暧昧发言把谷歌拉进”认牛大会”。本文用证据链复盘这场AI圈大型破案现场。

    📋 本文目录

    一、事件速览:8月20日,一头匿名”牛”闯进AI圈

    二、规格拆解:1M上下文+131K输出+三模态,就是冲着代码Agent来的

    三、免费风暴:OpenCode Go不限量供应,几天烧掉250B token

    四、破案线索一:Tokenizer指纹——75个token的固定偏移

    五、破案线索二:视频token预算——每秒147个token的”血缘”

    六、破案线索三:API错误码与”trained by Z.ai”彩蛋

    七、反转剧情:DeepMind暧昧发言,谷歌成”认牛大会”热门

    八、性能罗生门:80%通过率的小样本测试 vs “低于预期”的差评

    九、前科与范式:从Pony Alpha到Ox Alpha,匿名发布成模型圈新玩法

    十、开发者行动指南:白嫖姿势、测试建议与匿名期风险

    一、事件速览:8月20日,一头匿名”牛”闯进AI圈

    8月20日,OpenRouter上线了一款来历不明的模型:Ox Alpha。平台方只留下一句说明——它来自一家”暂时保持匿名的第三方提供商”。据量子位报道(凤凰网科技转载),因为Ox就是”牛”,又正赶上《牛来》梗火遍互联网,国内网友干脆给它起了个亲切的外号:”牛来大模型”。

    匿名+顶配+免费,三个要素叠加,效果立竿见影。开发者们拿着代码库、终端和各种刁钻任务一拥而上给它出题,社区里迅速分化出两大侦探阵营:一派验Tokenizer、测视频token消耗、抓API报错,恨不得给模型做一套”数字DNA鉴定”,把嫌疑锁定在智谱;另一派盯着DeepMind员工最近的社交媒体发言,以及那个迟迟没有正式露面的Gemini 3.5 Pro,坚信这头牛来自谷歌。

    🔑 事件关键节点速览

    • 8月20日:Ox Alpha以匿名身份空降OpenRouter,官方仅称”匿名第三方提供商”

    • 规格曝光:104.86万token上下文,单次最大输出13.1万token,支持文本/图片/视频输入

    • 随后:OpenCode宣布Ox Alpha上线OpenCode Go,连续数天几乎不限量免费,且不计入用户原本额度

    • 三天内:累计使用量达250B token级别,约8500名独立用户,超11万次完成会话

    • 8月22-23日:Tokenizer指纹、视频token预算等”破案”证据全网刷屏,智谱与谷歌成为两大候选

    这不是OpenRouter第一次上演匿名模型猜谜戏码,但很可能是热度最高的一次。原因很简单:这头牛不仅免费,还真的很能干活。

    二、规格拆解:1M上下文+131K输出+三模态,就是冲着代码Agent来的

    先看纸面规格。Ox Alpha的配置放在2026年8月的模型圈里依然激进:

    项目 Ox Alpha规格 业界常规水平
    上下文窗口 104.86万token(约1M) 旗舰级普遍128K-1M
    单次最大输出 13.1万token(131K) 普遍8K-64K
    输入模态 文本+图片+视频 多数仅文本/图片
    定位方向 代码、长周期Agent、复杂推理 通用对话为主
    工具调用 支持 旗舰标配
    推理模式 强制推理模式 可选

    这些数字意味着什么?据量子位的解读,1M上下文意味着一次Prompt理论上能塞进整个大型代码仓库、数百页文档,或者一长串Agent运行记录;131K最大输出则远超普通聊天场景,为的是让模型一次性吐出完整的大型项目代码。再加上图片和视频输入、工具调用以及强制推理模式,Ox Alpha从一开始瞄准的就是代码Agent和长周期任务——这正是当下竞争最激烈的模型赛道。

    本站在此前对智谱GLM-5.3的深度解析中提到过,编程与长程Agent已是国产旗舰模型的军备竞赛主战场;而Ox Alpha的规格画像,恰好与这条路线完全吻合。这也是它被怀疑”出身名门”的第一个原因:无名之辈很难拿出这种工程规格。

    三、免费风暴:OpenCode Go不限量供应,几天烧掉250B token

    规格只是入场券,真正把Ox Alpha推上风口的是免费策略。OpenCode随后宣布,Ox Alpha上线OpenCode Go,连续数天几乎不限量免费使用,而且不计入用户原本的Go额度。公开讨论中甚至出现了”每天100万亿token级别服务容量”的说法——即便按保守口径估计,这也是一场教科书级的流量轰炸。

    效果如何?OpenCode公开数据显示,这头”劳模牛”已累计出现250B token级别的使用量,拥有约8500名独立用户和超过11万次完成会话。连Stripe CEO Patrick Collison都亲自上手试了一遍,给出的评价是:”It’s very impressive.”(非常令人印象深刻。)

    📊 免费风暴数据面板

    • 累计使用量:250B token级别(上线仅数天)

    • 独立用户:约8500名

    • 完成会话:超11万次

    • 免费政策:OpenCode Go不限量、不占原额度

    • 名人背书:Stripe CEO Patrick Collison实测”very impressive”

    对普通开发者而言,这是实打实的红利窗口:不用注册海外支付方式、不用买API套餐,就能白嫖一款1M上下文的多模态旗舰级模型跑真实任务。至于平台方为什么愿意烧这个钱——匿名模型+免费额度本身就是最便宜的全球众测,后面第九章会展开这个商业逻辑。

    四、破案线索一:Tokenizer指纹——75个token的固定偏移

    现在进入本文最有意思的部分:全网侦探是怎么给一头匿名牛做”DNA鉴定”的。第一条线索来自Tokenizer。

    背景知识:tokenizer负责把输入内容切成模型能处理的token。不同模型家族往往采用不同的词表和切分逻辑,所以面对一些刻意设计的文本时,token数量会留下较稳定的”指纹”——想通过蒸馏或后训练模仿另一款模型的回答风格容易,但换个词表这件事,外部很难伪装。

    据量子位报道,有测试者拿不同Prompt对Ox Alpha和多款模型进行比较,结果发现Ox Alpha与GLM-5.3的token计数呈现高度一致的关系。一组流传较广的测试中:同样一段混合了中英文、代码和emoji的文本,GLM-5.3与GLM-5.2都计算出68个token,而Ox Alpha显示143个——多出来的75个token,恰好能够由模型外部附加的一段隐藏System Prompt解释。另有测试者使用25组不同Prompt进行验证,也观察到了类似的固定偏移关系。

    🔍 线索一速读:Tokenizer指纹

    • 测试文本:中英文+代码+emoji混合

    • GLM-5.3 / GLM-5.2 计数:68 token

    • Ox Alpha 计数:143 token(固定偏移+75)

    • 解释:偏移量恰好可由隐藏System Prompt覆盖

    • 验证规模:25组不同Prompt均呈现固定偏移关系

    换句话说:如果把隐藏System Prompt的75个token扣除,Ox Alpha的Tokenizer行为和GLM-5.3几乎完全重合。这是”智谱说”的第一块基石。

    五、破案线索二:视频token预算——每秒147个token的”血缘”

    如果说Tokenizer指纹还有”碰巧相似”的辩解空间,第二条线索的技术含量就高得多:视频token预算。

    原理:文本模型可以通过蒸馏、后训练或者System Prompt去模仿另一款模型的回答习惯,但视频编码和token预算涉及多模态输入进入模型之前的工程设计——采样帧率怎么定、每帧分配多少token、时长增长时预算怎么膨胀,这些属于模型基础设施层的”底层工程指纹”,极难伪装。

    据量子位报道,有研究者专门制作了4段受控测试视频,分别交给Ox Alpha和几款多模态模型,观察系统为视频分配多少输入token。结果,Ox Alpha和GLM-5V-Turbo在多项特征上出现了高度相似的token预算:

    • 视频帧率变化后,采样策略基本不受影响;

    • 视频时长增加时,token消耗约以每秒147个token的速度线性增长;

    • 每帧分辨率变化对应的token缩放方式一致;

    • 在4段控制视频上,两者测出的额外token预算甚至能够逐项对上。

    对照组里,MiMo、Qwen和GLM-4.6V等模型都呈现出与Ox Alpha不同的特征。也就是说,在视频处理这个”难以伪装”的维度上,Ox Alpha与智谱GLM-5V-Turbo的工程指纹高度吻合。这是”智谱说”目前最硬核的证据。

    六、破案线索三:API错误码与”trained by Z.ai”彩蛋

    第三条线索来自API服务层——这是侦探们”钓鱼执法”的成果。

    据量子位报道,社区有人故意给Ox Alpha传入异常参数,捕捉到了类似”[1210] The temperature parameter is illegal”的错误信息。这种错误码格式、参数限制以及中英文混排的返回方式,被认为与智谱相关服务存在较高相似度。毕竟正常自建服务的报错格式千奇百怪,能撞上同一套错误码编号体系的概率并不高。

    更戏剧性的是,甚至还有用户声称在模型的推理输出中捕捉到过”trained by Z.ai”这样的残留信息——Z.ai正是智谱的海外品牌域名。不过需要强调,这一条目前主要来自社区截图和二手转述,证据等级明显低于前面的Tokenizer测试和视频token测试,现阶段更适合当作彩蛋来看。

    证据 指向 证据等级
    Tokenizer计数与GLM-5.3高度一致(固定偏移75) 智谱 强(25组Prompt复现)
    视频token预算与GLM-5V-Turbo逐项吻合(147 token/秒) 智谱 强(工程指纹难伪装)
    API错误码[1210]及中英混排报错格式 智谱 中等(相似度高)
    推理输出疑似残留”trained by Z.ai” 智谱 弱(社区截图,二手转述)
    DeepMind研究员Evan Otero暧昧发言 谷歌 弱(vague posting,无实证)
    Gemini 3.5 Pro长期跳票+规格画像吻合 谷歌 推测(时间线+产品画像)

    有意思的是,所有硬证据都指向智谱一边,而谷歌一边目前只有氛围证据。但AI圈的剧情从来不能只看证据——接下来就是反转部分。

    七、反转剧情:DeepMind暧昧发言,谷歌成”认牛大会”热门

    原本智谱的线索一路领先,结果8月22日前后,剧情拐向了谷歌。

    先说客观背景:Ox Alpha公开的产品画像确实容易让人联想到Gemini——1M级超长上下文、原生图像和视频输入、面向长期Agent任务、强调复杂代码工程和工具调用,这些都是谷歌过去几代Gemini持续重点投入的方向。而谷歌此时恰好还有一款迟迟没有正式公布的旗舰:今年Google I/O期间,官方曾给出Gemini 3.5 Pro”Coming next month”的预期,结果发布时间一拖再拖,外界至今仍在等待。

    真正的爆点是人事动态。据量子位梳理,Google DeepMind研究员Evan Otero在相关讨论中先发了一个词”Gemini”,随后又补了一句:”如果Ox Alpha就是我们一路遇到的朋友呢?”(What if Ox Alpha is the friend we made along the way?)

    “如果Ox Alpha就是我们一路遇到的朋友呢?”——Google DeepMind研究员 Evan Otero

    当然,这两条发言都没有明确表示”Ox Alpha就是Gemini”,但在全网疯狂猜模型身份的背景下,迅速被社区解读为一次标准的vague posting(暧昧发帖)。Techmeme汇总的社媒讨论里,还有开发者注意到近期Gemini团队成员突然密集谈论Gemini以及下一代模型,也有人因此把牛来大模型与Gemini 3.5 Pro甚至Gemini 4联系起来。

    于是网上迅速分成两派:一派拿着Tokenizer和视频token账单喊”这明明就是GLM”;另一派指着DeepMind的𝕏帖子说”Google你别演了”。平心而论,目前没有公开证据能坐实任何一方——这也恰恰说明,在蒸馏、模型融合、后训练以及第三方推理服务越来越普遍之后,”模型是谁训练的”和”模型在哪里部署”甚至都可能是两道独立的题。

    八、性能罗生门:80%通过率的小样本测试 vs “低于预期”的差评

    身份成谜的同时,Ox Alpha的实力同样充满争议,堪称罗生门。

    捧的一方拿出了实测数据:一项包含10个真实软件工程任务的社区测试里,Ox Alpha完成8个,通过率80%。同一组任务里,Fable 5为65%,GLM-5.3为62%,GPT-5.6 Sol为52%。

    模型 完成数(/10) 通过率
    Ox Alpha 8 80%
    Fable 5 6.5 65%
    GLM-5.3 6.2 62%
    GPT-5.6 Sol 5.2 52%

    ⚠️ 注意:这只是10道题的小样本社区测试,不属于官方Benchmark,远远不足以证明Ox Alpha综合能力已经超过这些旗舰模型。

    踩的一方同样有来头。Abacus.AI CEO Bindu Reddy公开表示,他们测试后发现Ox Alpha表现低于预期,一些指标只达到较早一代模型的水平;沃顿商学院教授Ethan Mollick的评价是”惊艳程度一般般”;还有开发者用自己的私有Benchmark测试后认为它在低推理强度下表现一般,视觉任务中也有人发现它明显弱于Gemini系列。

    所以眼下对Ox Alpha最准确的描述可能还是:一款在某些代码和Agent任务上表现极亮眼、规格极激进,同时评测结果分歧极大的匿名模型。免费+神秘身份,给它额外套了一层流量Buff——评价体系本身也被流量污染了,这正是匿名期模型的典型困境。

    九、前科与范式:从Pony Alpha到Ox Alpha,匿名发布成模型圈新玩法

    为什么全网看到Ox Alpha的第一反应是”智谱,你又来了”?因为前科实锤。

    据量子位回顾,今年2月,OpenRouter曾经上线另一款匿名模型Pony Alpha,当时大家也围着它猜了半天,最后OpenRouter揭晓答案——Pony Alpha就是GLM-5的早期测试版本。所以这次Ox Alpha一出现,不少人的直觉就是同一套剧本重演:先匿名挂出来让全球开发者免费压测,收集真实负反馈,修完bug再官宣。

    这套”匿名发布”范式的商业逻辑其实非常清晰:

    免费众测替代内部评测:8500名独立开发者、250B token的真实使用,比任何内部Benchmark都能暴露长尾问题;

    匿名规避舆论风险:表现好是惊喜,表现差无人追责,官方从容迭代;

    悬念营销零成本:身份之谜自带传播性,全网自发破案等于免费广告;

    竞对情报烟雾弹:对手无法确定这是新模型还是旧模型换皮,定价与发布节奏都被打乱。

    顺带一提,匿名期的干扰项还包括”Cursor拿智谱开源模型自己再训一遍,然后套个牛头”这类调侃——在开源权重+定制后训练盛行的年代,这种解释竟然也无法被排除。本站在开源大模型许可证深度拆解一文中讨论过,Kimi K3与Qwen3.8-Max的开放权重正让”拿别人家底座练自己家模型”成为现实操作,模型血缘的模糊化已经是行业性课题。

    至于答案,大概率不会藏太久。按照OpenRouter最近几次Alpha模型的剧情发展,匿名期结束之后,总得有人出来牵牛回家。

    十、开发者行动指南:白嫖姿势、测试建议与匿名期风险

    给想上手的开发者四条实操建议:

    1. 入口:OpenRouter搜索Ox Alpha,或直接用OpenCode Go(免费几乎不限量、不占原额度);适合跑代码仓库级长任务、长文档处理、Agent工作流验证。

    2. 测试建议:别迷信单一榜单,用你自己的真实任务测;重点测长上下文召回(100万token深处放关键信息再提问)、多轮Agent稳定性、视频理解三个差异化能力。

    3. 匿名期风险:不要把公司核心代码、敏感数据喂给匿名模型——你不知道日志被谁收集、用于什么后续训练;免费期随时可能结束,别把生产链路绑死在上面。

    4. 理性吃瓜:身份揭晓前,一切结论都是概率推断;对开发者而言,”好不好用”比”是谁家的”更重要,等官宣了再看也不迟。

    💡 一句话总结

    匿名、免费、顶配,Ox Alpha把”饥饿营销+免费众测”玩成了行为艺术;Tokenizer指纹与视频token预算的证据链目前领先,但DeepMind的暧昧发言提醒我们:在蒸馏与第三方部署盛行的年代,模型身份鉴定正在变成一门玄学。牛是谁的牛不重要,重要的是——趁免费,赶紧测。

    后续如果智谱或谷歌官方认领这头牛,本站将第一时间跟进拆解。也欢迎回顾我们此前的相关深度内容:智谱GLM-5.3发布深度解析DeepSeek Harness开源Agent框架拆解,以及AI办公智能体大战分析


  • AI办公智能体大战:WorkBuddy 1115万月活领跑,百度搭子增速1063%追击






    AI办公智能体大战:WorkBuddy 1115万月活领跑,百度搭子增速1063%追击






    💼
    AI办公智能体大战
    PC端月活突破3000万 · WorkBuddy 1115万领跑 · 百度搭子增速1063%追击
    月活 · 增速 · 桌面Agent · 腾讯vs百度 · 硅谷对照
    AI
    AI工具导航
    cn.xcoolevdb.site · 2026年8月21日

    AI办公智能体大战:WorkBuddy 1115万月活领跑,百度搭子增速1063%追击

    两个月前,本站发布过一篇国内桌面Agent大混战:Kimi Work、豆包专业版、Qoder等五大产品横评,当时整个赛道还在萌芽期,各家用的是”聊天框+插件”的初级形态。两个月后的今天,AI办公智能体PC端月活总量突破3000万,20多款产品涌入赛道,WorkBuddy和百度搭子双雄合计占六成市场。这不是渐变,这是爆发。本文将用数据、产品拆解和行业分析,还原这场AI办公智能体战争的全貌。

    📋 本文目录

    一、事件速览:7月榜单数据全景——月活破3000万,双雄占六成

    二、榜单拆解:AI产品榜7月数据 + 易观流量数据——三个月翻三倍

    三、WorkBuddy深度解析:从十几人支线到马化腾亲自过问的百人王牌

    四、百度搭子深度解析:百度”新三虎”排头兵,1063%增速从何而来

    五、横向对比:WorkBuddy vs 百度搭子 vs TraeWork vs 千问办公

    六、追兵阵营:字节TraeWork、千问办公、WorkSwarm蜂群等长尾玩家

    七、全球对照:微软Copilot Cowork、Google Workspace Studio、OpenAI ChatGPT Work

    八、竞争本质:界面”模板皮肤化”,为什么竞争转向”用户心智”之战

    九、增长空间与隐忧:20倍渗透空间 vs 留存、长任务可靠性、商业化

    十、普通用户选购指南 + 结语

    一、事件速览:7月榜单数据全景——月活破3000万,双雄占六成

    8月17-18日,AI产品榜发布2026年7月桌面榜(PC)数据。这是一份足以重新定义”AI办公”赛道格局的榜单。

    核心数字:国内AI办公桌面端月活跃用户总量突破3000万。其中,WorkBuddy以1115.23万月活位居AI办公智能体总榜第一,环比增长304.40%;百度搭子(DuMate)以674.30万月活位居第二,环比增长1063.79%,拿下增速榜第一。两款产品合计月活接近1800万,约占整体市场的六成。

    字节TraeWork月活265.99万,千问办公60.79万。头部格局清晰:WorkBuddy和百度搭子已经形成双雄格局,其余玩家月活加起来不到双雄的一半。

    🔑 关键数字速览

    • AI办公智能体PC端月活总量:突破3000万

    • WorkBuddy:1115.23万月活,环比+304.40%,总榜第一

    • 百度搭子:674.30万月活,环比+1063.79%,增速榜第一

    • 双雄合计:约1800万月活,占整体市场约六成

    • 第三名TraeWork:265.99万月活,与双雄差距明显

    这份榜单的特殊之处在于:它不是一个成熟市场的”排位赛”,而是一个新兴赛道在爆发初期的”起跑信号”。两个月前,这个赛道还只有几家产品在试水——本站6月30日发布的国内桌面Agent大混战:Kimi Work、豆包专业版、Qoder等五大产品横评中,当时的主流形态还是”聊天框+局部工具调用”。两个月后,月活翻了近十倍,产品形态也完成了从”AI助手”到”AI Agent”的质变。

    二、榜单拆解:AI产品榜7月数据 + 易观流量数据——三个月翻三倍

    如果把AI产品榜的数据和易观此前发布的流量数据放在一起看,增长曲线更加震撼。

    据易观数据,2026年6月,17款主流桌面端AI办公智能体合计月访问量突破6000万。而今年一季度,这个数字还只有2000万。三个月,翻了三倍。这个增速放在任何一个互联网细分赛道都是罕见的。

    再看各家的环比增速,百度搭子以1063.79%的增速一骑绝尘,WorkBuddy的304.40%也远超行业平均。注意,WorkBuddy的基数已经很大——6月PC端月访问量达到2097万,超过第二、三名之和,在这个基础上还能翻三倍,说明增长不是靠营销催出来的短期脉冲,而是产品力驱动的持续拉新。

    产品 7月月活(万) 环比增速 所属厂商
    WorkBuddy 1115.23 304.40% 腾讯
    百度搭子 674.30 1063.79% 百度
    TraeWork 265.99 字节跳动
    千问办公 60.79 阿里巴巴

    值得注意的是,百度搭子的1063.79%增速意味着它在一个月内用户量翻了十倍以上。如果保持这个势头,百度搭子有望在接下来几个月内逼近WorkBuddy的月活规模。这不是静态的排名,而是一场正在发生的追赶战。

    据钛媒体8月20日报道,短短不到半年时间,中国市场已有超20款桌面端Agent产品问世。这个数字本身就说明问题:当一个赛道在半年内涌入20多个玩家,并且头部产品月活已经破千万,那就不是”可能火”,而是”已经在火”。

    三、WorkBuddy深度解析:从十几人支线到马化腾亲自过问的百人王牌

    出身:CodeBuddy团队的”意外走红”

    WorkBuddy的故事,是2026年AI行业最戏剧性的产品叙事之一。

    据36氪8月12日报道,WorkBuddy今年3月还只是腾讯云里一个十几人团队基于代码助手CodeBuddy做出的支线产品。彼时CodeBuddy在开发者圈子里已经小有名气,团队顺手做了一个面向办公场景的Agent产品,没想到一脚踩中了风口。

    几个月后,马化腾亲自过问,团队迅速扩至百人规模。更关键的是,腾讯六大事业群一路开绿灯——这意味着WorkBuddy不是一个事业群的”小项目”,而是整个腾讯的战略级产品。仅北上广深四城线下投放整体费用接近亿元,这在腾讯内部产品中是罕见的投入力度。

    “WorkBuddy和CodeBuddy实现了突破性的用户增长。”——马化腾,腾讯2026年Q1财报

    腾讯Q1财报称,以日活跃账户数计算,WorkBuddy已成为中国使用最广的效率AI智能体服务。这不是外部机构的评价,而是写进财报的官方表述。

    产品能力:Ask/Plan/Craft三模式 + 云端本地混合

    WorkBuddy的产品设计可以用一个词概括:分层。它不是把所有能力揉在一起,而是根据任务复杂度让用户选择不同的工作模式。

    Ask模式

    纯问答,不执行操作。适合查资料、问问题、做知识查询,消耗资源最少,响应最快。

    Plan模式

    先出计划再执行。用户说一个目标,WorkBuddy先拆解成步骤列表,让用户确认后再逐步执行。适合需要谨慎对待的复杂任务——比如批量处理50多个文件按日期归档,实测全程不到30秒。

    Craft模式

    直接执行明确任务。省去确认环节,一步到位。适合已经熟悉的重复性工作。

    三种模式设计巧妙:它把”AI能做多快”和”用户想多放心”之间的权衡变成了一道选择题,而不是让用户在不确定性中焦虑。

    云端+本地混合运行

    WorkBuddy采用”云端+本地”混合模式,这意味着它既能调用云端大模型的理解能力,也能直接操作本地文件和应用程序。批量文件处理、定时任务(如每天17:00自动生成日报并永久生效)等场景,依赖的就是这种混合架构。

    微信远程联动

    这是WorkBuddy最独特的场景化能力:用户绑定微信后,通过微信小程序就能远程让AI在电脑端执行任务。比如人在外面开会,想起来一个文件需要处理,直接在微信里发一条指令,WorkBuddy在电脑上就干了。这个场景打通了”不在电脑前”的高频需求。

    五模型自由切换

    WorkBuddy内置混元、DeepSeek、GLM、Kimi、MiniMax五大国产模型,用户可在不同任务场景下自由切换。这一设计降低了用户对单一模型的依赖,也体现了腾讯”不站队单一模型”的开放策略。

    腾讯底座与生态

    WorkBuddy与腾讯QClaw共享同一套AI Agent底层底座,采用”同源底座与分层解耦”五层架构——基础设施、智能体底座、能力服务、业务应用、用户交互。它已接入腾讯文档、QQ邮箱、腾讯网盘、腾讯会议,同时兼容OpenClaw技能生态。这意味着WorkBuddy不是孤立的Agent,而是嵌在腾讯办公生态里的一个中枢节点。

    留存数据:60%+活跃留存,80%+付费留存

    腾讯Q1财报显示,WorkBuddy活跃用户留存率超过60%,付费用户留存率超过80%。PC端月访问量从3月的885万冲到6月的2097万,涨了2.4倍,超过第二、三名之和。这两个数据放到任何互联网产品维度都是优秀的——高留存意味着产品不是”薅一波就走”的流量生意,而是用户真的在用。

    WorkBuddy Bench:办公场景最稳定

    7月23日,WorkBuddy团队发布了WorkBuddy Bench评测。他们把七个头部模型装进CodeBuddy Code和Claude Code两套Agent Harness,完成代码、网页、办公和安全四类共260项任务。结果很有意思:办公恰好是四类任务中模型与Harness变化后表现最稳定的。CodeBuddy Code环境里七个模型得分落在77.47-82.37之间,换一套Harness,七个模型里有五个得分变化不到2分。

    这说明什么?办公场景下,Agent框架(Harness)的质量比模型本身更重要。一个好的框架能让不同模型都稳定输出,而差的框架再好的模型也发挥不出来。WorkBuddy的”同源底座”策略,正是瞄准了这个竞争差异点。

    四、百度搭子深度解析:百度”新三虎”排头兵,1063%增速从何而来

    出身:百度智能云的”专业办公智能体平台”

    百度搭子(DuMate)今年3月上线,归属百度智能云事业群,定位”专业办公智能体平台”。与WorkBuddy的”从代码助手到办公Agent”的路径不同,百度搭子从第一天起就瞄准了办公场景,产品命名和定位都更聚焦。

    用户提出工作目标后,百度搭子可以完成任务拆解、资料检索、文件处理和工具调用,连续处理跨应用、跨文件的复杂任务。它在PinchBench(AI智能体操作电脑和手机能力基准测试)和DeepResearchBench(AI深度研究能力基准测试)等国际Agent评测中达到SOTA水平,说明百度在Agent底层能力上的积累已经达到了国际一线水平。

    迭代节奏:从个人版到企业版,不到半年走完

    百度搭子的迭代速度非常快。6月搭子企业版上线,8月7日个人版迭代至v1.0.67,新增网页发布、内嵌浏览器、远程任务、自动化模板。这在不到半年的时间内完成了从个人工具到企业级产品的完整产品矩阵搭建。

    百度搭子还有一个关键设计:本地沙箱运行,删除/发送等高危操作采用分级授权。这在安全维度上做到了”该拦的拦,该放的放”,兼顾了Agent的自主性和安全性。

    据8月12日百度披露,搭子日查询量自上线以来增长60倍,过去一个月再次翻倍。这种增长曲线与1063.79%的月活增速数据相互印证,说明搭子的增长是真实的用户活跃度提升,而不是单纯的下载量膨胀。

    百度”新三虎”:搭子、库库AI、秒哒

    据36氪8月21日报道,百度形成了押注AI办公的”新三虎”格局——百度搭子、库库AI、秒哒。搭子是排头兵,库库AI和秒哒分别在知识管理和低代码方向补位。百度Q2财报显示,AI应用季度收入25亿元,同比增长3%;百度文库和网盘的AI DAU渗透率同比增长27.4%。

    百度的AI办公打法不是单点产品,而是”搭子攻前端,文库网盘做渗透,库库秒哒做纵深”的三层布局。这比腾讯的”WorkBuddy+CodeBuddy+QClaw”组合更偏应用层,少了一层开发者生态。

    🔍 腾讯 vs 百度:AI办公战略对比

    • 腾讯:WorkBuddy(办公Agent)+ CodeBuddy(代码助手)+ QClaw(远程操控),共享同一底座,覆盖开发者到办公用户

    • 百度:搭子(办公Agent)+ 库库AI(知识管理)+ 秒哒(低代码),以应用层产品矩阵覆盖办公全场景

    • 腾讯优势:生态与入口(微信、腾讯文档、QQ邮箱等),留存率更高

    • 百度优势:全栈技术与任务交付能力,国际评测成绩更强

    五、横向对比:WorkBuddy vs 百度搭子 vs TraeWork vs 千问办公

    四款目前市场上最受关注的AI办公智能体,放在一起对比,各自的基因和路线差异一目了然。

    维度 WorkBuddy 百度搭子 TraeWork 千问办公
    月活 1115.23万 674.30万 265.99万 60.79万
    环比增速 304.40% 1063.79%
    所属厂商 腾讯 百度 字节跳动 阿里巴巴
    核心优势 生态+入口+留存 全栈技术+评测SOTA 模型能力+流量 开源生态+企业客户
    模型支持 混元/DeepSeek/GLM/Kimi/MiniMax 文心系列 豆包系列 通义千问系列
    运行模式 云端+本地混合 本地沙箱 云端为主 云端为主
    独特功能 微信远程联动/定时任务 内嵌浏览器/远程任务 豆包联动 阿里云生态联动
    企业版 有(6月上线) 待确认

    从上表可以看出,WorkBuddy和百度搭子已经在月活规模上拉开差距,但定位和打法截然不同。WorkBuddy更像”腾讯生态的中枢Agent”,搭子更像”百度技术的独立Agent产品”。TraeWork和千问办公虽然背靠大厂,但目前在产品形态和市场声量上都还处于追赶阶段。

    六、追兵阵营:字节TraeWork、千问办公、WorkSwarm蜂群等长尾玩家

    双雄之外,还有一批值得关注的玩家。它们虽然月活还不能与头部抗衡,但各有独特定位和差异化打法。

    字节TraeWork(265.99万月活)

    字节在AI办公赛道的布局是”豆包+TraeWork”双线并行。豆包专业版7月刚上线办公任务模式,TraeWork则是桌面端Agent的独立产品。背靠字节的流量优势和豆包模型能力,TraeWork有潜力,但目前产品形态和WorkBuddy、搭子相比还不够成熟。

    千问办公(60.79万月活)

    阿里巴巴的通义千问系列在办公场景的落地产品。依托阿里云的企业客户基础和通义千问模型能力,千问办公在企业级市场有一定优势,但C端渗透率明显不足。

    WorkSwarm蜂群

    openJiuwen推出的WorkSwarm蜂群办公智能体,率先登陆鸿蒙PC应用市场,兼容Windows/Mac。它的差异化在于”单Agent-集群双模式”——用户可以只用一个Agent,也可以启动多个Agent协同工作。全套代码开源,对开发者友好。

    阶跃AI桌面版

    自研Step 3.7 Flash模型,扫码即用,无需复杂配置。可接入Excel、飞书、钉钉等十余款MCP工具,定位”轻量级、零门槛”的AI桌面助手。

    QClaw

    腾讯旗下另一款AI桌面产品,与WorkBuddy共享同一底座。特色是支持微信、QQ扫码远程操控电脑,数据本地运行。QClaw更偏向”远程操控”场景,与WorkBuddy的”办公Agent”定位形成互补。

    这些长尾玩家虽然目前月活不高,但它们的存在证明了一个事实:AI办公智能体不是只有大厂才能做的赛道。开源、轻量、鸿蒙生态等差异化的切入点,都有可能在未来某个节点爆发。

    七、全球对照:微软Copilot Cowork、Google Workspace Studio、OpenAI ChatGPT Work

    把视线拉到全球,AI办公智能体的竞争是一个全球性现象,但中国和硅谷走了两条不同的路线。

    硅谷的路线是”嵌入现有办公生态”。据新立场Pro等媒体报道,微软正围绕Microsoft 365做Agent,把Copilot Cowork、Office里的Agent能力以及Agent 365逐渐连起来——让Agent直接在Word、Excel、Teams里工作,用户不需要切换工具。Google让Workspace Studio把企业SOP变成可复用的Agent流程,瞄准的是企业级流程自动化。OpenAI 7月发布ChatGPT Work,让它跨文件和连接的应用持续工作数小时,走的是”超级个人助理”路线。

    中国的路线则不同。国内第一轮真正跑出规模的是WorkBuddy、百度搭子这类更接近Claude Code的独立Agent——它们不是嵌在某个办公软件里,而是作为一个独立的桌面端产品,直接面对用户的操作系统。这种差异的背后是办公生态的不同:海外以Microsoft 365和Google Workspace为核心,国内办公场景更碎片化,微信、飞书、钉钉、WPS各自为政,一个独立的桌面Agent反而更容易覆盖全场景。

    🌍 硅谷 vs 中国:AI办公Agent路线对比

    • 硅谷路线:嵌入现有办公生态(Microsoft 365 / Google Workspace),Agent是”功能升级”

    • 中国路线:独立桌面Agent产品,直接面向操作系统,Agent是”新物种”

    • 硅谷逻辑:用户已经习惯在Office/Google Docs里工作,Agent应该在那里

    • 中国逻辑:用户办公工具碎片化,独立Agent反而是最高效的”统一入口”

    • 趋势:两条路线可能会在”多应用协同”这个点上交汇

    两种路线没有绝对优劣之分。硅谷的嵌入路线更”润物细无声”,但受限于单一办公套件;中国的独立Agent路线覆盖更广,但需要用户主动切换使用习惯。谁能在”多应用协同”这个痛点上做得更好,谁就可能在下一阶段拉开差距。

    八、竞争本质:界面”模板皮肤化”,为什么竞争转向”用户心智”之战

    钛媒体8月20日的报道指出一个尖锐的观察:把WorkBuddy、千问办公、百度搭子乃至豆包桌面端放在一起,”应用界面大同小异,各类Skill与内置专家高度相似,像同一套模板的不同皮肤”。

    这不是批评,而是事实。当20多款产品用了相似的交互范式——左侧对话区,右侧预览区,底部输入框,中间是技能/工具面板——产品形态本身已经很难形成差异化。

    “效率工具过去拼谁更好用,现在拼谁先被用户记住。”——钛媒体,2026年8月20日

    这个判断切中了要害。当产品形态趋同,竞争就从”功能竞争”转向”认知竞争”。WorkBuddy的优势在于腾讯生态和微信入口——用户不需要”下载一个新App”,微信里就能用。百度搭子的优势在于技术实力和国际评测的背书——”这个产品在SOTA评测里排第一”对专业用户有说服力。

    钛媒体认为,腾讯的护城河是生态与入口,百度的护城河是全栈技术与任务交付能力。这两条护城河本质上都不是”产品功能”层面的,而是”用户心智”层面的——用户选择WorkBuddy因为”它和微信、腾讯文档无缝连接”,选择搭子因为”它的Agent能力评测最强”。

    这也解释了为什么WorkBuddy三个月花了近亿元做线下投放——当产品功能拉不开差距,谁先占领用户的心智入口,谁就赢了一半。百度搭子1063%的增速则说明,即使没有腾讯级别的投放预算,过硬的技术实力同样能带来爆发式增长。

    九、增长空间与隐忧:20倍渗透空间 vs 留存、长任务可靠性、商业化

    增长空间:至少还有20倍

    按传统办公软件用户规模估算,AI办公仍有约20倍增长空间。中国PC端办公用户数以亿计,而AI办公智能体目前月活刚突破3000万,渗透率还不高。乐观来看,这个赛道的天花板非常高。

    隐忧一:留存挑战

    WorkBuddy的60%+留存是优秀成绩,但反过来看,仍有近40%的用户来了又走。AI办公智能体的核心挑战不是”让人来”,而是”让人留下来”。用户下载一个Agent很可能是出于好奇,但真正把它融入日常工作流需要时间和习惯的改变。百度搭子的1063%增速能不能转化为高留存,是下一个关键观察点。

    隐忧二:长任务可靠性

    Agent面对的不是”一句话回答”,而是”跨多个应用、持续数十分钟甚至数小时的复杂任务”。在这个过程中,任何一个环节出错——比如文件路径搞错、应用权限不足、模型理解偏差——都可能导致整个任务失败。WorkBuddy的Plan模式(先出计划再执行)和百度搭子的分级授权,都是在为这个可靠性问题打补丁。但根本性的”长任务可靠性”问题,目前还没有哪个产品彻底解决。

    隐忧三:商业化路径

    目前AI办公智能体的商业化还处于早期。WorkBuddy有付费用户,但具体定价策略尚未完全公开。百度搭子有企业版,但个人版目前免费。腾讯Q1财报提到付费用户留存率超过80%,说明愿意付费的用户粘性很高,但付费渗透率是多少、整体ARPU怎么样,目前还没有公开数据。这个赛道的商业化,可能还需要一到两年的探索期。

    十、普通用户选购指南 + 结语

    不同用户怎么选

    如果你已经深度使用腾讯生态(微信、腾讯文档、QQ邮箱、腾讯会议)

    WorkBuddy几乎是唯一选择。微信远程联动、定时任务、腾讯文档无缝接入,这些场景化能力是其他产品暂时无法替代的。而且留存率60%+说明用户是真的在用,不是在尝鲜。

    如果你更看重Agent的”硬实力”——任务拆解、多步推理、复杂任务执行

    百度搭子值得深试。PinchBench和DeepResearchBench的SOTA成绩不是营销话术,而是实打实的评测结果。搭子的本地沙箱和分级授权设计在安全性上也更成熟。

    如果你用豆包/字节系产品比较多

    TraeWork可以关注,但目前产品成熟度与头部有差距,建议观望一两个版本迭代后再做决定。

    如果你是开发者或喜欢折腾

    WorkSwarm蜂群的开源全代码和鸿蒙兼容性是不错的切入点,阶跃AI桌面版的MCP工具接入也值得一试。

    如果你的需求很简单——只是需要一个AI帮忙处理文件、查资料、写文档

    当前阶段,WorkBuddy和百度搭子各有千秋,可以先都试用一下,看你更习惯哪个产品的交互方式。毕竟正如钛媒体所说,功能上大同小异,关键在于”哪个让你更顺手”。

    结语

    回到两个月前。本站6月30日发布的国内桌面Agent大混战:Kimi Work、豆包专业版、Qoder等五大产品横评,当时的结论是”赛道还在萌芽期,各家形态差异大,没有明确赢家”。

    两个月后,答案已经清晰:WorkBuddy和百度搭子组成了第一梯队,月活门槛已经拉到了600万以上;字节和阿里在追赶,但差距明显;20多家新玩家涌入,但绝大多数还在”同一套模板换皮肤”的阶段。

    但这只是开局。3000万月活在AI办公这个万亿级赛道上,连冰山一角都算不上。WorkBuddy的护城河是生态,百度搭子的护城河是技术,谁能把”让用户离不开”这件事做到极致,谁就能在下一阶段真正拉开差距。

    AI办公智能体的战争,才刚刚开始。