阿里Qwen3.8-Max发布:2.4万亿参数旗舰+千问办公公测,企业级Agent三国杀打响

作者:






阿里Qwen3.8-Max发布:2.4万亿参数旗舰+千问办公公测,企业级Agent三国杀打响






🔥
阿里 Qwen3.8-Max 发布日
2.4 万亿参数旗舰 + 千问办公公测
企业级 Agent 三国杀正式打响
AI
AI工具导航
@xcoolevdb · 2026年8月3日

8 月 3 日,阿里巴巴双线齐发:新一代基座大模型 Qwen3.8-Max 正式上线,总参数 2.4 万亿,Arena 榜单仅次于 Claude 系列,稳居全球第一梯队;企业级 Agent 产品”千问办公”(QwenWork)同步开启公测,业内首款同时覆盖桌面端、云端、企业协同三层 Agent 架构。API 国内输入 12 元/百万 token、输出 36 元,国际价仅为 Opus5 的 40% 与 24%,下周开源 Qwen3.8-Max 和 Qwen3.8-27B。编程能力从空文件夹出发独立 16 天交付真实项目,法务一周审阅量压缩到一小时——一文拆解这场把”最强参数 + 最低价格 + 最快开源”三张牌同时打出的发布。

📑 本文目录

· 一、2.4 万亿参数:两万亿俱乐部再添一员

· 二、核心能力拆解:编程 + 办公双杀

· 三、自主编程 16 天交付:从空文件夹到可用框架

· 四、千问办公公测:三端 Agent 架构首亮相

· 五、企业级 Agent 三国杀:阿里 vs 腾讯 vs 字节

· 六、API 定价与开源计划

· 七、跑分速览:Arena、CodeArena、OSWorld 多榜齐发

· 八、万亿俱乐部横向对比:Qwen3.8 vs K3 vs DeepSeek V4 vs Fable 5

· 九、对开发者和企业的 4 条落地建议

一、2.4 万亿参数:两万亿俱乐部再添一员

继月之暗面 Kimi K3(2.8T)之后,突破两万亿参数的国产大模型又添了一位选手。Qwen3.8-Max 总参数量 2.4 万亿,采用第三代 MoE 混合专家架构,推理仅激活 950 亿有效参数,兼顾超强能力与推理成本控制。

🔧 Qwen3.8-Max 核心规格

· 总参数 / 激活参数:2.4 万亿 / 950 亿

· 架构:稀疏 MoE + 混合注意力机制联合优化

· 上下文窗口:100 万 Token

· 多模态:原生支持文本、图片、视频、文档理解

· 定位:Qwen 系列迄今综合性能最强基座模型

从 7 月 19 日 WAIC 首发预览,到 7 月 21 日更新前端(WebDev)能力,再到 8 月 3 日正式发布——Qwen3.8 这半个月,几乎是以”天”为单位在进化。阿里真武 M890 超节点也已成功适配 Qwen3.8,芯片、云平台与千问大模型全链路优化,在 Agentic 推理场景中最多可实现 1.5 倍性能提升。

二、核心能力拆解:编程 + 办公双杀

Qwen3.8 的升级重点非常明确:编程(Coding)专业办公(Cowork)。在内部真实任务的测评中,全栈开发、数据分析、Office 办公工作流这类复杂、多 Agent、长程任务,Qwen3.8 都展现了匹敌世界前沿模型的实力。

编程能力:从写函数到交付项目

2 年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手。而如今,Qwen3.8 可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人干预。在权威 CodeArena 编程榜中,Qwen3.8 位居全球第四。

办公能力:干得广,也干得稳

通过真实环境和算力的联合强化学习(RL)扩展,Qwen3.8-Max 实现了数百种高价值、高频专业任务的真实表现提升:

  • 法务审核:法务团队标注千余个法律条款需要一周,Qwen3.8 一小时完成
  • 体育分析:篮球数据分析团队逐帧标注 160 小时比赛录像,Qwen3.8 数十分钟精准拆解 8400 多个攻防回合并输出战术报告
  • 量化策略:金融研究团队数年积累才能完成的量化策略研究,Qwen3.8 连续工作数小时后交付完整的 ETF 轮动策略并实现规模化盈利

长程任务:数千轮交互里持续进化

面对长周期任务,Qwen3.8-Max 涌现出系统级自主规划与全栈闭环自适应学习能力。无论是精密严苛的数字芯片设计,还是瞬息万变的商业模拟运营,它都能在”执行—反馈—迭代”的闭环中历经数千轮超长交互,持续重构自己的算法与策略。

多模态智能体:视觉生产力新高度

Qwen3.8-Max 把 AI 的视觉理解推向新高度:能跨页理解 200 页的财报,把 100 小时的长视频组织成可检索、可追溯的 Graph 记忆。执行中持续审视自己的中间产物,一旦出错就自主定位、重新规划并修正。在权威 Vision Arena 榜单中,Qwen3.8-Max 排名全球第二。

三、自主编程 16 天交付:从空文件夹到可用框架

这次最出圈的演示,是 Qwen3.8 的自主编程能力。只需一句”创建一个自进化的智能体 Harness”,Qwen3.8 就像一位资深工程师,从零开始自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取和执行任务,人类工程师还可通过钉钉给 Qwen3.8 提出新要求。

16天
独立编程运行周期

oh-my-cli
产出的自进化智能体框架

Hermes级
达到的 Agent 能力级别

已开源
完整过程公开在 GitHub

Qwen3.8 独立编程运行约 16 天后,做出了一个 Hermes Agent 级别的、真实可用的自进化智能体框架”oh-my-cli”,目前该项目已完全开源,完整过程公开保存在 GitHub 仓库里,可供所有人查看。这不是 Demo,不是玩具——而是一个真实可用的工程产物。

“2 年前的模型能写好函数、补全代码;如今的模型能从空文件夹出发,独立交付十数天的真实项目。这不是量变,是质变。”
——阿里云官方发布

四、千问办公公测:三端 Agent 架构首亮相

跟模型一起发布的,还有企业级 Agent 产品”千问办公”(QwenWork)。它由 QoderWork、MuleRun、悟空三款产品全面整合而来,是业内首款同时支持桌面端 Agent、云端 Agent、企业协同 Agent的产品。

🏢 千问办公六大核心能力

· 企业 IM 协作:已打通钉钉 25 项能力,包括消息群聊、考勤审批、会议日程、文档生成等

· Office 产物一站生成:输出 PPTX、Word、Excel、HTML 等原生可编辑文件

· 多模态内容理解:识别图片、音频、视频

· 全栈网页生成:可制作带数据库与交互逻辑的免部署独立网页(QwenWork Pages)

· 专业数据源聚合:接入 1688 等电商后台、小红书等社交媒体

· 自定义技能与专家套件:将个人最佳实践固化为团队可复用资产

组织级 Skill:个人经验变企业资产

最值得关注的是”组织级 Skill”功能。一家 20 人规模的律师事务所,资深律师用千问办公完成首份并购尽调报告后,可将全过程一键沉淀为”组织级 Skill”,向全团队共享。新员工接到同类案件,无需逐项请教前辈,调用该 Skill 即可产出报告。

这意味着个人经验可以转化为企业资产——过去靠”师傅带徒弟”传递的隐性知识,现在可以被结构化、可复用地沉淀下来。

定价与公测福利

版本 价格 适合
个人免费版 0 元 个人用户体验和轻量使用
标准版 78 元/月 个人深度使用
企业标准版 198 元/月/席 企业团队协作

公测期间新用户注册即送 2000 积分,每日登录还可领取 500 至 2000 积分。网页版和独立 PC 客户端已开放,钉钉 PC 端和手机端内置入口近期也将开放。

五、企业级 Agent 三国杀:阿里 vs 腾讯 vs 字节

千问办公的出现并非孤例。在它之前,腾讯和字节跳动已经率先完成了组织架构与产品形态的整合。企业级 AI Agent 的三国杀正式打响。

🔵 阿里:千问办公(QwenWork)

· 路径最完整:桌面端 Agent + 云端 Agent + 企业协同 Agent 三层架构

· Qwen 决定智能上限,钉钉提供组织关系和流程入口,阿里云承接数据和算力

· 优势:全栈组合清晰;挑战:三个体系能否形成统一体验

🟢 腾讯:WorkBuddy

· 深度绑定企业微信生态,IM 原生入口

· 优势:企业微信渗透率高,组织关系天然在线

· 挑战:模型能力是否跟得上 Agent 场景的复杂度

🔴 字节:豆包企业版

· 豆包大模型 + 飞书协同,C 端经验反哺 B 端

· 优势:C 端用户基数大,产品体验打磨充分

· 挑战:企业级数据安全和合规能力需要验证

对企业老板来说,这不仅是”选哪个 AI 工具”的问题,而是整个低代码选型逻辑正在被重写。选型逻辑正在从”选平台”升级为”选生态”——企业现有用哪个协同工具,就优先考虑哪个 Agent 产品,迁移成本最低。

六、API 定价与开源计划

这次最狠的其实是价格。今日起,全球开发者都可通过千问 AI 平台获得 Qwen3.8 的 API 服务:

💰 Qwen3.8-Max API 定价

· 国内输入:12 元 / 百万 tokens

· 国内输出:36 元 / 百万 tokens

· 隐式缓存命中:1.5 元 / 百万 tokens

· 国际输入价:仅为 Opus5 的 40%

· 国际输出价:仅为 Opus5 的 24%

横向对比:Kimi K3 海外定价约 3 美元/百万输入、15 美元/百万输出;Fable 5 约 10 美元输入、30 美元输出。Qwen3.8 用 2.4 万亿参数的”顶配”,打出了”白菜价”。

🔓 开源计划

· Qwen3.8-Max:预计下周开源权重

· Qwen3.8-27B:同步开源

· 获取渠道:ModelScope、Hugging Face

· API 接入:阿里云百炼、千问 AI 平台、Qoder、QoderWork

七、跑分速览:Arena、CodeArena、OSWorld 多榜齐发

Top 2
Arena 全球总榜(仅次于 Claude)

#4
CodeArena 编程榜

86.1
OSWorld-Verified 电脑操作

93.0
PaperBench 科研复现

82.8
IFBench 指令遵循

92.6
GPQA Diamond 科学推理

82.0
BabyVision 视觉推理

#2
Vision Arena 视觉榜

值得注意的是,OSWorld-Verified 86.1 分位居主流模型首位——这意味着在电脑操作能力上,Qwen3.8-Max 已经是目前最强的模型之一,这对 Agent 场景的落地至关重要。

八、万亿俱乐部横向对比

模型 总参数 激活参数 开源 API 输入价 核心优势
Qwen3.8-Max 2.4T 95B 下周开源 12 元/M 编程+办公双杀,三端Agent
Kimi K3 2.8T 104B 已开源 ~21 元/M 全球最大开源权重,Infra全开
DeepSeek V4 1.6T 部分开源 1 元/M(Flash) 极致性价比,昇腾950协同
Fable 5 未公开 闭源 ~70 元/M 综合能力最强,基准领先

这一轮国产大模型的密度堪称历史级:7 月 16 日 Kimi K3 开源,7 月 19 日 Qwen3.8 预览首发,8 月 1 日 DeepSeek V4-Flash 正式上线,8 月 3 日 Qwen3.8 正式发布。传闻中 MiniMax M3 Pro(2.5-3T)、GLM-5.5 都在路上。这已经不是”百模大战”,而是万亿参数俱乐部的淘汰赛。

九、对开发者和企业的 4 条落地建议

💡 落地建议

1. 优先体验千问办公的 Skill 功能:如果你是中小企业,先把高频重复任务(周报、数据分析、合同审核)做成 Skill,验证 ROI 后再考虑企业版部署。

2. API 选型看场景:编程和 Agent 任务优先 Qwen3.8-Max,纯文本对话和成本敏感场景考虑 DeepSeek V4-Flash(1 元/百万 token),需要最大开源权重选 Kimi K3。

3. 等开源再部署:Qwen3.8-Max 下周开源,27B 版本适合私有化部署。不急的话,等权重放出后用 vLLM/SGLang 自建推理,成本远低于 API 调用。

4. Agent 生态选型看协同工具:用钉钉选千问办公,用企微选 WorkBuddy,用飞书选豆包企业版——迁移成本最低的路径就是最优路径。

“从’追赶’到’同台竞技’,再到价格战和开源战,国产大模型这半年的进度条,快得让人有点跟不上。Qwen3.8 的意义不只是又一个 2.4T 的模型——它是阿里把’最强参数 + 最低价格 + 最快开源’三张牌同时打出来的宣言:大模型的竞争,已经从炫技进入拼刺刀阶段。”

本文由 AI工具导航(cn.xcoolevdb.site)原创整理,数据来源:阿里云官方发布、IT之家、澎湃新闻、21世纪经济报道、CSDN 等。转载请注明出处。


评论

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注