SGLang 接入 Google TPU 意味着什么?Qwen、DeepSeek 也能在 TPU 上跑了
开源大模型推理框架 SGLang 通过与 Google Cloud 合作,将完整功能引入 TPU 平台。开发者可在 TPU 上运行 Gemma、Qwen、DeepSeek 等模型,国产大模型又多了一个部署选项。
AI快讯
模型发布、产品动态和行业观察,统一按发布时间从新到旧排列。
开源大模型推理框架 SGLang 通过与 Google Cloud 合作,将完整功能引入 TPU 平台。开发者可在 TPU 上运行 Gemma、Qwen、DeepSeek 等模型,国产大模型又多了一个部署选项。
Gemini Spark 正式接入 Chrome 的自动浏览功能,用户授权后可处理表单填写、预约看房这类网页任务。本文拆解它的核心能力、行业背景、对开发者和企业的影响,以及中文用户能从中读出的趋势。
美国生活方式名人玛莎·斯图尔特联合创办的 AI 初创公司 Hint 正式推出,主打面向个人房主的家居管理助手,覆盖维护提醒、能耗、空气质量、合同文件查询等场景,目前免费提供 iOS 版本。
腾讯混元开源端到端投机解码框架 AngelSpec,在 Hy3-A21B 上实现 1.98–2.40 倍加速,吞吐量比 DFlash 高 10.5–11.8%,训练代码与草稿模型权重一并放出。
知名 AI 教育者吴恩达宣布创办 LearnVector,主打 AI 一对一个性化学习,获 Coursera 一亿美元投资。平台将整合 Coursera 课程内容,强调定制学习路径而非自由聊天,押注的是 AI 在教育场景的真正落地。
火山引擎正式上线豆包搜索服务,定位给 AI Agent 提供实时、可信的联网搜索能力。支持 API、Skill、MCP 三种接入形态,企业和开发者每月可获得 500 次免费调用,覆盖跨语言、多模态、多垂类查询。
微软发布 MAI-Cyber-1-Flash,137B 总参数中只激活 5B,支持 256k 上下文,是其 MDASH 智能体框架的核心驱动。它在 CyberGym 基准上跑出 95.95%,瞄准企业级安全运维自动化。
Feyn Labs 发布的 FeyNoBg 在 8 项去背景基准中拿下 4 项第一,参数从 222M 扩到 263M,模型与训练库 NoBg 一并开源。对做电商图、证件照和素材处理的国内团队来说,是一个值得拿来对比的本地化方案。
GitHub Copilot 推出 Harness 工作流,主张用一个 AI 助手覆盖原型、规划、实现和代码审查全过程,减少多工具切换损耗。开发者、企业用户和国产工具厂商都在跟进。
数字生命卡兹克开源 Leader.skill,基于"目标七问"方法论把模糊意图拆成结构化任务书,并建议规划与执行分别交给擅长长程推理的大模型。中文开发者和团队可以免费二次改造,但接生产链路前仍需自测。