通义千问开源 Qwen3.8-Flash:125B 总参数只激活 6B,训练成本砍到九分之一
通义千问放出 Qwen3.8-Flash 开源权重,作为 Qwen4 架构早期预览。125B 总参数、每 token 仅激活 6B,训练成本降至前代九分之一,API 定价低至每百万输入 0.16 美元。

通义千问团队近日在 X 上悄悄放出了 Qwen3.8-Flash 的开源权重,定位是 Qwen4 架构的早期预览。这次发布没有大张旗鼓,却在 MoE 路线上把性价比往前推了一步。
模型规格:125B 总参数只激活 6B
Qwen3.8-Flash 采用稀疏 MoE 架构,总参数 125B,每个 token 推理时只激活 6B。这意味着实际算力消耗接近一个 6B 稠密模型,对显存和延迟都比同总参数的稠密模型友好得多。
原生上下文 262K,可通过配置扩展到 1M,能覆盖大多数长文档、RAG、长代码生成场景。这是一组明显冲着实际生产需求设计的数字,不是实验室炫技。
训练成本与价格
官方提到训练成本仅为前代 Qwen3.7-Plus 的九分之一,性能却全面超越后者。这个成本/性能比的跃迁,是这次发布最值得拆的点。
API 定价定在每百万输入 token 0.16 美元、输出 0.47 美元。换算下来,输入端几乎和某些开源小模型的商用价持平,对国内调用方吸引力直接。
对开发者和企业的影响
独立开发者可以用消费级显卡跑出近似 6B 模型的体验,做长文摘要、代码补全、本地知识库都够用。128GB 显存级别的节点就有可能扛住中等并发,对个人和小团队门槛明显降低。
企业本地化部署的硬件门槛同步降低,原来必须上 H100 的场景,现在可能用国产推理卡拼出可接受的吞吐。这对预算敏感的国内企业尤其有意义。
多模态是这次发布的隐藏重点。开源权重意味着社区可以自行微调视觉、文档理解等任务,比闭源 API 多了一层可控性和可定制性,是这次开源最被低估的价值。
后续值得关注的几个点
一是 Qwen4 正式版何时落地,Qwen3.8-Flash 究竟是先行版还是技术 demo,决定它的长期可用性。二是 MoE 路由策略会不会随权重公开,社区能否复现官方数据。
三是国内云厂商接入后的实际价格、限速和配额策略。Qwen 系列在国内云生态铺得很深,这一环对中小团队影响最直接。
对会翻墙搜 AI 信息的国内用户来说,Qwen3.8-Flash 是一份少见的低价大碗组合。建议先看一周内的社区实测反馈,再决定要不要替换现有模型。
同主题阅读路径
查看「模型发布」栏目读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。
查看 AI 工具