标签: Ollama

  • 讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成






    讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成


    讯飞星火X2.5端侧双模型开源:百万Token首次进手机,20万亿Token全国产算力练成

    开源大模型
    端侧AI
    2026年9月2日
    约6分钟读完

    📌 本文看点

    ① 端侧模型首个原生百万Token上下文,到底解决了什么老毛病
    ② 混合注意力+20万亿Token数据+全国产算力,技术底座拆给你看
    ③ 办公/代码/智能家居/机器人四大场景实测数据
    ④ Ollama一条命令跑起来的部署指南
    ⑤ 9月7日293B旗舰、10月全国产算力新品,后面还有大招

    9月的第一天,AI圈就丢下一颗炸弹。这次不是又一个大厂云端模型刷榜,而是一个更贴近你的动作:科大讯飞全资子公司词元星火,正式开源了星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型

    名字里的”端侧”两个字是重点——它们不是跑在云机房里,而是要装进你的手机、电脑、汽车座舱和智能家居设备里,本地跑、本地算、数据不出门。

    而这两款小模型最狠的一点是:端侧模型里,第一个原生支持最长100万Token上下文窗口的产品。之前这个量级只有云端大模型玩得起,现在小到1.7B参数的模型也能装下了。

    01 · 百万Token上下文:端侧等这一刻很久了

    先说清楚一个老问题:为什么端侧模型一直”记性差”?

    过去端侧模型处理长内容,通常要把文档切成几段分别处理。结果就是你可能亲身体验过的:问到第三章的内容,它忘了第一章说了啥;跨章节的规定互相打架,它对不上号。

    💡 一句话理解百万Token的价值:把一本几十万字的完整手册、一整年的聊天记录、或者一整套代码库一次性喂给模型,它能”看全”并”记住”,在连续对话中不丢前情。

    官方给的售后场景例子很直观:用户把完整售后手册导入星火X2.5-4B,然后问一个刁钻问题——”购买10天后设备故障,且使用过第三方耗材,符不符合换货要求?”

    这问题难在哪?答案藏在手册的不同章节里:退换货规则一章、故障处理一章、第三方耗材的例外条款又一章。模型得自己关联跨章节规定,给出综合判断。更绝的是,你再加个”用户在偏远地区”的新条件,它还能保持前文情境,结合物流、数据清除、费用承担和处理时限继续给建议。

    这就是长上下文的真实意义:不是比谁数字大,而是让模型基于完整信息做判断,而不是靠切片碰运气

    02 · 技术底座:混合注意力+20万亿Token+全国产算力

    两个数字先摆出来:

    星火X2.5端侧双模型 核心参数

    模型规格X2.5-4B / X2.5-1.7B
    上下文窗口原生100万Token(端侧首个)
    架构混合注意力架构
    预训练数据约20万亿Token多样化数据
    训练算力全国产算力平台全流程
    能力侧重智能体 / 代码 / 数学 / 指令遵循
    上下文专项千亿Token级高质量长文数据训练

    三个技术点值得展开说:

    ① 混合注意力架构:小模型装下大记忆的关键

    100万Token的上下文如果用传统注意力机制硬算,显存和算力都扛不住。星火X2.5采用混合注意力架构,在长序列处理上做工程取舍,让1.7B这么小的参数量也能承载百万级窗口——这是”端侧首个”能成立的技术前提。

    ② 20万亿Token预训练+千亿Token级长文数据

    上下文能力不是架构给个窗口就完事,还得喂对数据。讯飞披露星火X2.5使用了覆盖长篇文档、技术资料等场景的千亿Token级高质量数据专门训练上下文能力,也就是让模型在训练阶段就习惯”读长文”,而不是部署后才硬适应。

    ③ 全国产算力:从训练到推理的完整闭环

    两款模型基于全国产算力平台完成全流程训练。结合讯飞此前”基于华为昇腾等国产平台训练”的路线,这条”自主可控”的路线图在端侧继续延伸——对政企、车载这些对数据安全和供应链有要求的场景,这往往不是加分项,而是准入项。

    03 · 四大场景实测数据:办公、代码、智能家居、机器人

    参数是纸面的,场景数据更实在。官方给的四个方向:

    个人办公:从数据到双语报告全流程

    以Loomy上的办公案例为例:用户上传销售明细表,要求做销售分析并交付中英文部门业绩报告。星火X2.5-4B的完整动作链:

    1. 编写脚本完成数据汇总、关键指标提取和趋势分析
    2. 生成约3000字的中文部门业绩报告
    3. 沿用原有结构和格式生成英文版报告
    4. 完成内容、结构和排版校验

    从原始数据到双语交付一条龙,全程在本地完成。

    代码开发:4B对标大2-3倍的云端模型

    在算法实现、代码补全与生成任务中,星火X2.5-4B可对标参数规模大2至3倍的云端模型。更实用的是接入方式:支持通过DeepSeek Harness、OpenCode、Codex、Pi等开源Harness,把模型接进本地开发和自动化脚本流程。写代码、生成脚本、调试辅助,可以不出本地直接完成。

    智能家居:1.7B的响应速度亮眼

    🏠 在Domux智能家居测试集上,星火X2.5-1.7B控制指令端到端执行正确率达90.3%,平均响应时间仅0.85秒。听懂自然语言、直接执行,这个延迟对”开个灯”级别的交互才够用。

    机器人:部署到本体和边缘设备

    两款模型可部署在机器人本体或边缘设备中,支持操作控制、目标追踪、导航决策等任务,减少对云端连接和固定预设程序的依赖。对需要持续感知和连续执行的机器人场景,”断网也能干活”是刚需。

    04 · 部署指南:一条命令跑起来

    开源生态的兼容性决定上手门槛。这次讯飞给出的清单相当开放:

    部署支持清单

    硬件平台英伟达 / 华为 / 海光 / 后摩
    推理框架vLLM / SGLang / llama.cpp
    快速部署工具Ollama / LM Studio
    权重地址Hugging Face / GitHub
    API服务讯飞星辰MaaS(限时免费)

    如果只是想在自己电脑上体验一把,Ollama是最快路径:

    # Ollama拉起星火X2.5端侧模型(示例)
    ollama run spark-x2.5-4b
    
    # 或者用LM Studio图形界面加载GGUF版本
    # 权重下载地址:
    # Hugging Face: huggingface.co/collections/XHToken/spark-x25
    # GitHub:       github.com/XHToken/Spark-X2.5

    不想折腾本地部署的话,对应API已上线讯飞星辰MaaS平台(maas.xfyun.cn/modelSquare),目前限时免费,可以先白嫖再决定要不要本地化。

    05 · 端侧还是云端?给普通用户的真实建议

    别被”端侧首个百万Token”冲昏头,端侧和云端各有各的活法:

    维度 端侧(星火X2.5-4B/1.7B) 云端大模型
    隐私 数据不出设备,敏感场景强项 需信任厂商的传输与存储
    延迟 本地推理,智能家居0.85秒级 受网络波动影响
    断网可用 完全离线可用 依赖连接
    能力上限 4B对标大2-3倍云端模型(官方口径) 旗舰模型天花板更高
    成本 开源免费,硬件一次性投入 按Token计费,长期累积

    我的建议很简单:涉及隐私、要离线、高频低复杂度的活,端侧;复杂推理、开放性创作、重任务,云端。未来的形态大概率是端云协同——日常交互端侧扛,重活难活云端接。这次讯飞端侧+旗舰同步推进的节奏,就是在铺这条路。

    06 · 后续看点:9月7日293B旗舰,10月还有大招

    这次开源只是讯飞9月行程的第一站:

    • 9月7日:星火X2.5-293B旗舰基座大模型发布。这是目前讯飞参数规模最大的通用模型,重点升级代码生成和复杂智能体协作能力。
    • 10月1024全球开发者节:全国产算力全新主力通用大模型。目标在代码能力和Token性价比上进入国内第一梯队。
    📅 划重点:端侧双模型开源(9/1)→ 293B旗舰(9/7)→ 全国产算力新品(10月)。一个月三连击,讯飞这次把节奏卡得很密。9月7日旗舰发布后,建议回来对照看端侧与旗舰的能力差,那才是端云协同路线的完整拼图。

    07 · 结语:端侧AI的国产路线图

    回看这次发布,三个信号值得记住:

    第一,端侧军备赛正式开打。百万Token上下文从云端专属变成端侧标配的起点,就是9月1日。手机厂商、车载、智能家居的本地AI能力上限,被重新定义了。

    第二,全国产算力不再只是口号。从训练到部署(华为/海光/后摩硬件+讯飞自家平台),这条链路的完整度才是”自主可控”四个字的底气。

    第三,开源策略务实。Ollama、LM Studio、vLLM全兼容,权重开放+API限免,降低的是开发者的试错成本,扩大的是生态基数。

    至于百万Token到底能不能在你的设备上跑出官方数据的体验,等9月7日旗舰发布后,可以一起实测验证。

    你会用本地大模型来干什么?评论区聊聊。

    参考来源:IT之家、中国日报网、快科技、中国经营报、36氪、Tech in Asia(2026年9月1日-2日报道)

    本文由 AI 辅助整理生成,数据以官方发布为准 | 转载请注明出处


  • 速评:Ollama让本地AI变得极简






    速评:Ollama让本地AI变得极简


    XCool AI 工具导航
    xcoolevdb.site · 国内AI产品深度测评

    速评:Ollama让本地AI变得极简

    Ollama成为本地AI部署的默认选择是有原因的:它移除了你和运行模型之间的所有障碍。一条命令安装。一条命令下载。一条命令开始对话。就是这样。

    ⚠️ 免责声明

    ⚠️ 免责声明:本文包含京东联盟推广链接,通过链接购买可能产生佣金,不影响商品价格。我们仅推荐经过评估的产品,观点独立客观。

    Ollama成为本地AI部署的默认选择是有原因的:它移除了你和运行模型之间的所有障碍。一条命令安装。一条命令下载。一条命令开始对话。就是这样。

    这件事的意义不在于方便——而在于数据主权。你发送给GitHub Copilot或Cursor的每一行代码都要经过别人的服务器。对于副项目,这没问题。但对于专有代码、金融模型或任何不能离开你基础设施的内容,本地部署不是可选项——而是必需品。

    Ollama的天才之处在于让本地AI如此简单,以至于你没有借口不用。兼容OpenAI的API意味着你现有的代码只需改个URL就能用。精选模型库意味着你不需要理解量化格式。Docker支持意味着它能融入任何部署管线。

    代价是真实的:本地模型(7B-70B参数)无法匹敌云端前沿模型的推理深度。但对于日常编码辅助、文档问答和隐私敏感工作流,Ollama + 一个好的8B模型如Qwen 3对大多数任务确实够用了。而且成本?永远零token费用。

    📌 来源

    📌 来源: X/Twitter原始讨论

    💬 我的看法: 本地AI运动不是拒绝云端——而是拥有选择权。Ollama给了你零摩擦的选择。今天就在你的笔记本上试试,你就会理解为什么134,000+的GitHub星标都在说同样的话。

    🛒 相关推荐:

    • 🖥️ Mac Mini M4(24GB)—— 运行Ollama本地最具性价比的机器 【京东购买链接】

    • 🎮 NVIDIA RTX 4090 —— 需要以速度跑更大模型时 【京东购买链接】

    #Ollama
    #本地AI
    #开源
    #速评
    #数据主权


  • 2026年最佳本地AI部署工具:在自己的机器上跑AI






    2026年最佳本地AI部署工具:在自己的机器上跑AI


    XCool AI 工具导航
    xcoolevdb.site · 国内AI产品深度测评

    2026年最佳本地AI部署工具:在自己的机器上跑AI

    在自己机器上跑AI,已经不只是隐私极客的专属了。随着Llama 3.3、Qwen 3、Gemma 4等强大的开源模型陆续开放,本地AI部署对于想要零token费用、完全数据隐私和离线能力的开发者来说,已经成为非常实际的选择。

    📖 目录

    1. 快速对比表

    2. Ollama —— 开发者的默认选择

    3. LM Studio —— 可视化探索者

    4. GPT4All —— 新手入门首选

    5. LocalAI —— 生产级自托管API

    6. text-generation-webui (oobabooga) —— 高级用户的工坊

    7. 硬件推荐(按预算)

    8. 我的推荐

    9. 本地AI推荐硬件

    ⚠️ 免责声明

    ⚠️ 免责声明:本文包含京东联盟推广链接,通过链接购买可能产生佣金,不影响商品价格。我们仅推荐经过评估的产品,观点独立客观。

    在自己机器上跑AI,已经不只是隐私极客的专属了。随着Llama 3.3、Qwen 3、Gemma 4等强大的开源模型陆续开放,本地AI部署对于想要零token费用、完全数据隐私和离线能力的开发者来说,已经成为非常实际的选择。

    好消息是:本地AI的工具已经变得非常简单了。坏消息是:选择太多,选错了可能浪费几个小时配置。本指南对比5款最佳本地AI部署工具,帮你找到最适合的那一个。

    快速对比表

    工具 核心优势 价格 最适合 评分
    Ollama 最简CLI + API设置 免费(MIT) 开发者 & 终端爱好者 ⭐ 9.5/10
    LM Studio 精美GUI + 模型探索 免费(免费软件) 偏好图形界面的用户 ⭐ 9.0/10
    GPT4All 对新手友好 + 本地文档RAG 免费(MIT) 初学者 & 隐私优先用户 ⭐ 8.0/10
    LocalAI 多模态OpenAI替代 免费(MIT) 生产环境自托管API ⭐ 7.5/10
    text-generation-webui 极致自定义 & 控制 免费(AGPL) 高级用户 & 研究者 ⭐ 7.5/10

    1. Ollama —— 开发者的默认选择

    Ollama已经成为2026年本地AI的事实标准。30秒内安装完成——macOS上brew install ollama,Linux上一条curl命令——然后你就能跑模型了。无需管理依赖、无需配置文件、零学习曲线。

    核心功能:

    • 约30秒安装;一条命令下载第一个模型

    • 兼容OpenAI的API,地址在localhost:11434

    • 精选模型库,ollama.com上数百个模型可选

    • 提供Docker镜像,支持容器化部署

    • 自定义Modelfile,支持提示词调优和LoRA适配器

    • Apple Silicon上通过Metal优化,表现出色

    价格: 免费开源(MIT许可证)。

    最适合: 习惯在终端工作的开发者,想把大语言模型融入日常工具链,而不是单独开一个应用。对大多数本地AI用户来说,Ollama就是正确答案。

    2. LM Studio —— 可视化探索者

    LM Studio走的是另一条路:一个精美的桌面应用,你可以在GUI中浏览、下载和对比模型。就像在你桌面上有个模型游乐场——可以并排加载多个模型、交互式调参、在界面内切换模型。

    核心功能:

    • 应用内直接访问完整的Hugging Face模型目录

    • 兼容OpenAI的API服务器,地址在localhost:1234

    • 内置文档对话(RAG),支持PDF、DOCX、TXT、CSV

    • MCP支持(v0.3.17+),用于代理式集成

    • 多GPU支持和推测解码

    • TypeScript和Python SDK方便开发

    • LM Link通过Tailscale加密实现远程访问

    价格: 个人使用免费(专有免费软件)。企业功能需额外付费。

    最适合: 偏好图形界面、需要可视化模型对比,或不想学CLI命令就能探索不同模型的用户。也适合想在本地搭建兼容OpenAI端点用于测试后再部署到生产的开发者。

    3. GPT4All —— 新手入门首选

    GPT4All的设计目标是让本地AI人人可用。它的杀手锏是LocalDocs——内置的检索增强生成(RAG)系统,让你可以上传本地文档,直接在聊天界面中查询,无需任何额外配置。

    核心功能:

    • LocalDocs RAG:上传PDF、文档和文本文件进行基于文档的问答

    • 不需要GPU——基础模型可在CPU上运行

    • 跨平台:Windows、macOS、Linux

    • 精选模型列表,针对消费级硬件优化

    • Python绑定支持编程访问

    价格: 免费开源(MIT许可证)。

    最适合: 想用最简单的方式跟本地模型聊天、查询自己文档的初学者。也适合没有独立GPU的硬件用户。

    4. LocalAI —— 生产级自托管API

    LocalAI定位为完全自托管的OpenAI API替代方案,运行在你自己的基础设施上。它不止于文本生成,还支持图像生成(Stable Diffusion)、语音转文字(Whisper)、文字转语音、嵌入和重排序——全部通过一个本地API端点提供。

    核心功能:

    • 完整的OpenAI API兼容(文本、图像、音频)

    • 多种模型格式:GGML、GGUF、GPTQ、PyTorch

    • Docker优先部署,适合生产环境

    • 并发模型服务,支持自定义资源分配

    • 基于YAML的模型配置,精细化控制

    价格: 免费开源(MIT许可证)。

    最适合: 在容器化环境中部署自托管AI API的团队。对本地开发来说可能”杀鸡用牛刀”,但当你需要在防火墙后从单一服务提供文本、图像和音频生成时,它就是最佳选择。

    5. text-generation-webui (oobabooga) —— 高级用户的工坊

    对于想要对每个推理参数进行最大控制的用户,text-generation-webui提供了最精细的界面。它专为需要微调生成设置、实验不同后端、把模型推到极限的研究者和高级用户打造。

    核心功能:

    • 支持数十种模型架构和量化格式

    • 扩展系统支持LoRA训练、多模态管线等

    • 多后端选项:llama.cpp、ExLlama、AutoGPTQ

    • 深度参数控制:temperature、top_p、top_k、repetition penalty等

    • 开源且社区驱动,活跃开发中

    价格: 免费开源(AGPL许可证)。

    最适合: 研究者、极客和需要对模型推理每个环节进行精细控制的高级用户。因配置门槛较高,不推荐初学者使用。

    硬件推荐(按预算)

    你的硬件 推荐模型 预期效果
    8GB内存,纯CPU Phi-4-mini, Gemma 3 1B 基础对话,慢但可用
    16GB内存笔记本 Gemma 3 4B, Qwen 3 8B 适合学习 & 摘要
    32GB内存Mac/PC Gemma 3 12B, Qwen 3 14B 本地生产力不错
    RTX 4090(24GB显存) Gemma 3 27B, Qwen 3 30B 消费级GPU最优档位

    我的推荐

    对2026年的绝大多数用户,Ollama就是正确的默认选择。它结合了即时安装、出色性能、丰富生态和最低的集成摩擦力。如果你更看重可视化探索和模型对比,选LM Studio。只有在需要多模态自托管API用于生产部署时,才考虑LocalAI

    🛒 本地AI推荐硬件

    • 🎮 NVIDIA GeForce RTX 4090 24GB —— 消费级GPU跑本地AI的甜点位 【京东购买链接】

    • 💻 树莓派5(8GB)—— 在边缘端跑小模型 【京东购买链接】

    • 🗄️ 群晖DS923+ NAS —— 网络存储也能跑容器 【京东购买链接】

    • 🖥️ Mac Mini M4(24GB)—— 本地AI最具性价比的入门机器 【京东购买链接】

    #本地AI
    #Ollama
    #开源AI
    #AI部署
    #数据隐私