模型发布

SGLang 接入 Google TPU 意味着什么?Qwen、DeepSeek 也能在 TPU 上跑了

开源大模型推理框架 SGLang 通过与 Google Cloud 合作,将完整功能引入 TPU 平台。开发者可在 TPU 上运行 Gemma、Qwen、DeepSeek 等模型,国产大模型又多了一个部署选项。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
SGLang 接入 Google TPU 意味着什么?Qwen、DeepSeek 也能在 TPU 上跑了

近日,LMSYS 团队在博客中宣布开源推理框架 SGLang 通过 RadixArk 与 Google Cloud 的合作,正式将完整功能推向 Google TPU 平台。开发者现在可以通过 SGL-JAX 后端,在最新的 TPU 上运行 Gemma、Qwen、DeepSeek 等主流大语言模型和多模态模型。

SGLang 最初由 LMSYS 团队推出,是目前社区里最活跃的 LLM 推理框架之一。它在结构化输出、长上下文、并行策略上的设计,针对在线服务和复杂 agent 场景做了不少优化。SGLang 此前主要跑在 NVIDIA GPU 上,TPU 的支持一直被社区视为一块短板。

SGLang 落地 TPU,意味着什么

过去要在 Google TPU 上跑开源大模型,路径相对有限。开发者通常需要依赖 JAX 生态自己写推理逻辑,或者使用分散的工具链,迁移成本不低。现在 SGLang 直接把上层 API 抽象带过来了,降低了从 GPU 迁移到 TPU 的工程门槛

这次合作的关键角色是 RadixArk——一家专注 LLM 推理基础设施的团队。SGL-JAX 作为 SGLang 的 JAX 后端,过去主要由 RadixArk 维护,如今补齐了和生产环境相关的能力,包括服务调度、KV 缓存管理、多 TPU 拓扑通信等。

对开发者和企业用户的影响

对开发者来说,最直接的好处是部署选项变多了。如果一个项目已经在使用 SGLang,现在可以几乎不做改动地尝试 TPU 后端,对比不同硬件上的性能和成本。对于 agent、复杂工具调用这类场景,这意味着可以在 TPU 上复用同一套代码。

对企业用户而言,多一个硬件选项就是多一份谈判筹码。尤其在全球 AI 算力分布不均的当下,TPU 能否成为 NVIDIA 的有效替代,一直是大模型落地中的现实问题。这次合作说明 TPU 上的开源生态正在追上 GPU。

中文用户应该关注什么

对于国内和海外华人开发者来说,这次更新值得特别留意。Qwen 和 DeepSeek 都在支持列表里,意味着国产模型在 TPU 上获得了更顺滑的部署路径。如果团队本身在 Google Cloud 上有资源,可以直接拿来跑私有化推理。

不过实际效果还要看几个细节:SGL-JAX 在 TPU 上的吞吐、延迟数据;与 GPU 版本的性能差距;以及是否支持线上大规模部署所需的特性。这些信息 LMSYS 团队通常会在后续博客中补充。

后续观察点

接下来值得看几件事。第一,SGLang 在 TPU 上的 benchmark 是否能跑出来,这是判断它能否进入生产环境的关键。第二,是否会有更多模型被原生支持,尤其是国产开源模型。

第三,Google Cloud 是否会基于这次合作推出 TPU 上的 SGLang 一键部署模板。对中小团队来说,这比框架本身更重要。第四,类似的趋势是否会延伸到其他非 NVIDIA 平台,比如 AWS Trainium 或国产 NPU。

总体来看,SGLang 跨向 TPU 是开源推理生态走向多硬件分化的一个缩影。它对普通开发者未必是新闻,但对正在选型基础设施的团队来说,是一个值得认真评估的选项。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具