第 10 页
阅读模型发布
OpenAI 推出 GPT-Live:把语音栈从客户端到模型重建了一遍
OpenAI 联合创始人 Greg Brockman 公开 GPT-Live 实时音频架构,主打边说边听的全双工能力,意图让推理与工具调用不再打断对话。这一改动是 ChatGPT 语音体验的一次底层换血。

模型发布、产品动态和行业观察统一按发布时间从新到旧排列。
OpenAI 联合创始人 Greg Brockman 公开 GPT-Live 实时音频架构,主打边说边听的全双工能力,意图让推理与工具调用不再打断对话。这一改动是 ChatGPT 语音体验的一次底层换血。


MiniMax 发布全能多模态模型 H3,支持文本、图像、视频、音频联合理解与生成,可输出 2K 分辨率、原生立体声 15 秒视频,2K 定价不到主流三分之一,并即将开源模型权重。

面壁智能与清华NLP团队提出ALIGN方法,自动对齐智能体与环境接口。实验显示,仅调整反馈表述,Qwen2.5-7B在ALFWorld上的任务成功率从13.4%跃升至31.3%,四个基准最高提升45.67%。

欧盟《人工智能法》新一轮透明度要求于8月2日正式落地,聊天机器人和深度伪造内容被纳入强制标识范围。谷歌、微软、OpenAI等180多家机构签署行为准则,Meta缺席,违规最高可罚全球年营收1%。

国家发改委7月发布会交出AI产业半年答卷:全国产10万卡超集群投用,智能算力规模达去年同期2.8倍,深度求索、月之暗面等本土企业发布多个万亿参数开源大模型,相关行业保持30%以上高增长。

DeepSeek 推出 V4-Flash 官方 API 公测,Agent 能力大幅升级,基准测试分数超过 V4-Pro-Preview,并原生支持 Responses API 与 Codex 适配。