模型发布

通义 Qwen-Audio-3.0-Realtime 上线,实时语音推理榜超过 OpenAI

阿里通义实验室推出实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中拿下综合第一,超过 GPT-Realtime-2。国产语音模型正在把差距拉开。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
通义 Qwen-Audio-3.0-Realtime 上线,实时语音推理榜超过 OpenAI

阿里通义实验室正式发布实时语音交互模型 Qwen-Audio-3.0-Realtime,并在第三方测评平台 Artificial Analysis 的语音推理(Speech Reasoning)子项中拿下综合排名第一,超过 OpenAI 旗下 GPT-Realtime-2。这是国产语音模型又一次在公开榜单上跑进前列。

这次跑分说明了什么

Artificial Analysis 是业内被引用较多的独立模型评测机构,榜单按任务维度细分。Speech Reasoning 重点考察多轮语音对话里的逻辑、上下文和复杂指令处理,不是简单的语音转文字。

能在这个子项里排第一,意味着模型在'边听边想'这件事上已经有不错表现。对中文团队来说,这比单纯 ASR 准确率更值得盯。

实时语音模型现在卷什么

过去一年,实时语音交互从'能听清'升级到'能对话'。首字延迟、多轮记忆、中断打断、情绪识别、函数调用,是新一代模型比拼的重点。GPT-Realtime-2 和 Qwen-Audio-3.0-Realtime 都压在同一条赛道上。

Qwen 系列从文本模型起家,逐步扩展到多模态。音频线从 Qwen-Audio 一路迭代到 3.0,节奏是先拉齐语音理解和生成,再往实时交互上压。这条路线和 OpenAI 把 Realtime 系列独立出来很像。

对开发者和企业意味着什么

对开发者来说,多了一个国产实时语音选项。语音 Agent 最关心首字延迟、断网容错、自定义音色和函数调用能力。如果 Qwen-Audio-3.0-Realtime 能交出稳定 API,国内做语音 Agent 的团队可以少绕一层网络。

对企业用户来说,语音客服、电话外呼、车载助手、智能硬件这几类场景会最先尝到红利。但跑分高不等于部署稳,实际延迟和成本才是关键。

后续值得观察什么

下一步重点看几件事:- API 开放时间和定价区间- 是否兼容 Qwen 现有工具链- 是否上线阿里云百炼- 真实业务场景中的延迟和成本

第三方榜单只是起点,真实场景的表现才是分水岭。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具