模型发布

腾讯混元把高性能算子塞进 SGLang:开源 HPC-Ops 到底改了什么

腾讯混元将 HPC-Ops 高性能算子库合入 SGLang 主分支,Dynamic Attention 与 Fused MoE 在混元 Hy3 模型上最高降低 TPOT 48.8%,对大模型推理部署和开源生态产生实质影响。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
腾讯混元把高性能算子塞进 SGLang:开源 HPC-Ops 到底改了什么

SGLang 社区最近收到了一份来自腾讯混元的"硬通货":高性能算子库 HPC-Ops 正式合入主分支,Dynamic Attention、Router GEMM 与 Fused MoE 三类算子同时上线。这不是一次普通的 PR 提交,而是把混元在大模型推理侧的底层优化直接放进了主流开源框架。

消息由 LMSYS 团队(也就是 Chatbot Arena 背后那群人)在博客中披露。LMSYS 之所以愿意主动发文,是因为这些算子在混元自研的 Hy3 模型上跑出了最高 48.8% 的 TPOT 降幅,这对一个已经成熟的开源推理框架来说,是相当少见的提升幅度。

这次开源到底改了什么

HPC-Ops 不是一个完整模型,而是一组针对 GPU 推理瓶颈定制的高性能算子。Dynamic Attention 负责长上下文场景下的注意力计算动态调度,Router GEMM 优化 MoE 路由器中的矩阵乘,Fused MoE 则把专家分发、计算和合并做成一条流水线,减少显存往返。

把它们放进 SGLang,意味着用户开箱就能享受混元在自家生产环境里调过的推理路径,而不用自己再手写 CUDA kernel。对比同类工作,混元这次同时给出 Attention、Router、MoE 三件套,覆盖面比单点优化更完整。

性能数字背后意味着什么

TPOT(Time Per Output Token)是单 token 生成延迟的硬指标,直接影响对话体验的"跟手感"。48.8% 的降幅意味着在相同硬件上,Hy3 类模型的输出速度几乎接近翻倍,对在线服务是肉眼可辨的提升

更关键的是,这一成绩来自 SGLang 主流分支而非私有分支。其他模型只要路由结构和注意力模式与 Hy3 类似,理论上也能复用这套算子,这和过去"算子只服务自家模型"的做法有本质差别。

对开发者和企业的实际影响

对自部署团队来说,最直接的红利是显存占用和延迟同时下降,推理成本曲线会向左移动。原来跑不动的长上下文窗口,现在可能在同样卡数下就能扛住。

对企业用户而言,这意味着可以用更少的 GPU 提供同等 QPS,或者把多余的算力预算投向更大的模型。对于做 RAG、多轮 Agent、长文档摘要等场景的团队,这是值得立刻评估的升级路径。

中文用户应该关注什么

首先是使用门槛很低:算子已经合入 SGLang 主分支,升级版本即可生效,不需要重新编译或切换框架。其次是兼容范围:混元的 Hy3 系列模型受益最明显,其他 MoE 架构模型的效果需要自行 benchmark。

另外值得留意的是,这是国内大厂把推理侧核心优化反向输出到国际开源社区的又一次动作。对国内 AI 工程师来说,跟着 SGLang 的更新节奏盯住 HPC-Ops 的后续迭代,比单纯看模型发布会更有性价比。

后续观察点

接下来值得看三件事:一是其他主流模型(Llama、Qwen、DeepSeek 系)在 SGLang 上启用 HPC-Ops 后的实际收益;二是混元是否会继续放出训练侧或编解码侧的算子;三是 LMSYS 是否会将这些优化纳入 Chatbot Arena 的推理评测维度。

可以预见,推理性能战正在从"模型参数战"转向"算子与调度战"。谁能持续往开源框架里灌注底层优化,谁就能在下一轮部署成本竞争中拿到主动权。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具