讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成
📌 本文看点
① 端侧模型首个原生百万Token上下文,到底解决了什么老毛病
② 混合注意力+20万亿Token数据+全国产算力,技术底座拆给你看
③ 办公/代码/智能家居/机器人四大场景实测数据
④ Ollama一条命令跑起来的部署指南
⑤ 9月7日293B旗舰、10月全国产算力新品,后面还有大招
9月的第一天,AI圈就丢下一颗炸弹。这次不是又一个大厂云端模型刷榜,而是一个更贴近你的动作:科大讯飞全资子公司词元星火,正式开源了星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型。
名字里的”端侧”两个字是重点——它们不是跑在云机房里,而是要装进你的手机、电脑、汽车座舱和智能家居设备里,本地跑、本地算、数据不出门。
而这两款小模型最狠的一点是:端侧模型里,第一个原生支持最长100万Token上下文窗口的产品。之前这个量级只有云端大模型玩得起,现在小到1.7B参数的模型也能装下了。
01 · 百万Token上下文:端侧等这一刻很久了
先说清楚一个老问题:为什么端侧模型一直”记性差”?
过去端侧模型处理长内容,通常要把文档切成几段分别处理。结果就是你可能亲身体验过的:问到第三章的内容,它忘了第一章说了啥;跨章节的规定互相打架,它对不上号。
官方给的售后场景例子很直观:用户把完整售后手册导入星火X2.5-4B,然后问一个刁钻问题——”购买10天后设备故障,且使用过第三方耗材,符不符合换货要求?”
这问题难在哪?答案藏在手册的不同章节里:退换货规则一章、故障处理一章、第三方耗材的例外条款又一章。模型得自己关联跨章节规定,给出综合判断。更绝的是,你再加个”用户在偏远地区”的新条件,它还能保持前文情境,结合物流、数据清除、费用承担和处理时限继续给建议。
这就是长上下文的真实意义:不是比谁数字大,而是让模型基于完整信息做判断,而不是靠切片碰运气。
02 · 技术底座:混合注意力+20万亿Token+全国产算力
两个数字先摆出来:
星火X2.5端侧双模型 核心参数
三个技术点值得展开说:
① 混合注意力架构:小模型装下大记忆的关键
100万Token的上下文如果用传统注意力机制硬算,显存和算力都扛不住。星火X2.5采用混合注意力架构,在长序列处理上做工程取舍,让1.7B这么小的参数量也能承载百万级窗口——这是”端侧首个”能成立的技术前提。
② 20万亿Token预训练+千亿Token级长文数据
上下文能力不是架构给个窗口就完事,还得喂对数据。讯飞披露星火X2.5使用了覆盖长篇文档、技术资料等场景的千亿Token级高质量数据专门训练上下文能力,也就是让模型在训练阶段就习惯”读长文”,而不是部署后才硬适应。
③ 全国产算力:从训练到推理的完整闭环
两款模型基于全国产算力平台完成全流程训练。结合讯飞此前”基于华为昇腾等国产平台训练”的路线,这条”自主可控”的路线图在端侧继续延伸——对政企、车载这些对数据安全和供应链有要求的场景,这往往不是加分项,而是准入项。
03 · 四大场景实测数据:办公、代码、智能家居、机器人
参数是纸面的,场景数据更实在。官方给的四个方向:
个人办公:从数据到双语报告全流程
以Loomy上的办公案例为例:用户上传销售明细表,要求做销售分析并交付中英文部门业绩报告。星火X2.5-4B的完整动作链:
- 编写脚本完成数据汇总、关键指标提取和趋势分析
- 生成约3000字的中文部门业绩报告
- 沿用原有结构和格式生成英文版报告
- 完成内容、结构和排版校验
从原始数据到双语交付一条龙,全程在本地完成。
代码开发:4B对标大2-3倍的云端模型
在算法实现、代码补全与生成任务中,星火X2.5-4B可对标参数规模大2至3倍的云端模型。更实用的是接入方式:支持通过DeepSeek Harness、OpenCode、Codex、Pi等开源Harness,把模型接进本地开发和自动化脚本流程。写代码、生成脚本、调试辅助,可以不出本地直接完成。
智能家居:1.7B的响应速度亮眼
机器人:部署到本体和边缘设备
两款模型可部署在机器人本体或边缘设备中,支持操作控制、目标追踪、导航决策等任务,减少对云端连接和固定预设程序的依赖。对需要持续感知和连续执行的机器人场景,”断网也能干活”是刚需。
04 · 部署指南:一条命令跑起来
开源生态的兼容性决定上手门槛。这次讯飞给出的清单相当开放:
部署支持清单
如果只是想在自己电脑上体验一把,Ollama是最快路径:
# Ollama拉起星火X2.5端侧模型(示例)
ollama run spark-x2.5-4b
# 或者用LM Studio图形界面加载GGUF版本
# 权重下载地址:
# Hugging Face: huggingface.co/collections/XHToken/spark-x25
# GitHub: github.com/XHToken/Spark-X2.5
不想折腾本地部署的话,对应API已上线讯飞星辰MaaS平台(maas.xfyun.cn/modelSquare),目前限时免费,可以先白嫖再决定要不要本地化。
05 · 端侧还是云端?给普通用户的真实建议
别被”端侧首个百万Token”冲昏头,端侧和云端各有各的活法:
| 维度 | 端侧(星火X2.5-4B/1.7B) | 云端大模型 |
|---|---|---|
| 隐私 | 数据不出设备,敏感场景强项 | 需信任厂商的传输与存储 |
| 延迟 | 本地推理,智能家居0.85秒级 | 受网络波动影响 |
| 断网可用 | 完全离线可用 | 依赖连接 |
| 能力上限 | 4B对标大2-3倍云端模型(官方口径) | 旗舰模型天花板更高 |
| 成本 | 开源免费,硬件一次性投入 | 按Token计费,长期累积 |
我的建议很简单:涉及隐私、要离线、高频低复杂度的活,端侧;复杂推理、开放性创作、重任务,云端。未来的形态大概率是端云协同——日常交互端侧扛,重活难活云端接。这次讯飞端侧+旗舰同步推进的节奏,就是在铺这条路。
06 · 后续看点:9月7日293B旗舰,10月还有大招
这次开源只是讯飞9月行程的第一站:
- 9月7日:星火X2.5-293B旗舰基座大模型发布。这是目前讯飞参数规模最大的通用模型,重点升级代码生成和复杂智能体协作能力。
- 10月1024全球开发者节:全国产算力全新主力通用大模型。目标在代码能力和Token性价比上进入国内第一梯队。
07 · 结语:端侧AI的国产路线图
回看这次发布,三个信号值得记住:
第一,端侧军备赛正式开打。百万Token上下文从云端专属变成端侧标配的起点,就是9月1日。手机厂商、车载、智能家居的本地AI能力上限,被重新定义了。
第二,全国产算力不再只是口号。从训练到部署(华为/海光/后摩硬件+讯飞自家平台),这条链路的完整度才是”自主可控”四个字的底气。
第三,开源策略务实。Ollama、LM Studio、vLLM全兼容,权重开放+API限免,降低的是开发者的试错成本,扩大的是生态基数。
至于百万Token到底能不能在你的设备上跑出官方数据的体验,等9月7日旗舰发布后,可以一起实测验证。
你会用本地大模型来干什么?评论区聊聊。
参考来源:IT之家、中国日报网、快科技、中国经营报、36氪、Tech in Asia(2026年9月1日-2日报道)
本文由 AI 辅助整理生成,数据以官方发布为准 | 转载请注明出处
发表回复