通义千问开源 Qwen3.8-Flash:125B 总参数只激活 6B,训练成本砍到九分之一
通义千问放出 Qwen3.8-Flash 开源权重,作为 Qwen4 架构早期预览。125B 总参数、每 token 仅激活 6B,训练成本降至前代九分之一,API 定价低至每百万输入 0.16 美元。
覆盖大语言模型、推理部署、GPU、开源模型与模型能力更新。
通义千问放出 Qwen3.8-Flash 开源权重,作为 Qwen4 架构早期预览。125B 总参数、每 token 仅激活 6B,训练成本降至前代九分之一,API 定价低至每百万输入 0.16 美元。
一项调查显示,有组织在9天内发布124篇、超56万字的报告,专门优化内容让ChatGPT等AI聊天机器人引用。这种新型"AI搜索优化"正在冲击AI答案的可靠性,也给国内使用AI工具的用户敲响警钟。
Andrew Ng 名下 OpenWorker 发布新版,把代码漏洞扫描、依赖供应链注入、云配置检查三类网络安全智能体集成进完全开源的 harness,并支持本地运行开源权重模型,让敏感代码不必出内网。
SemiAnalysis 创始人 Dylan Patel 预测,OpenAI 和 Anthropic 到 2028 年将控制全球大部分 AI 算力,理由是它们能把算力变成收入、出价更高。这会直接影响 API 定价、开源路线走向和企业的算力采购。
OpenRouter 发布模型选型方法论,强调按完成任务成本而非 token 单价评估。其 MCP 服务器已在 Claude Code、Cursor 等编辑器内可查实时排名与价格,并提供 auto-beta 自动路由。
OpenAI 将 GPT-5.6 模型家族接入软件开发智能体 Kiro,含 Sol、Terra、Luna 三款。Terminal-Bench 2.1 测试显示,GPT-5.6 Terra 在 Kiro 内完成任务成本下降约 82%。这次更新由 OpenAI 与 AWS 合作优化,主打更低迭代次数和更高 token 性价比。
面壁智能发布面向 Lean 4 的数学自动形式化开源框架 MathForm,配套 FormalVerse 数据集含 36.7 万条已验证样本。在 10 万预算对照下,模型 Consistency Check 达到 60.32%,超过 FineLeanCorpus 与 NuminaMath-LEAN 两个主流基线,整套流水线完全开源可复现。
阿里推出面向真实界面的 GUI 智能体基座模型,覆盖手机、电脑、网页与 DeepSearch 场景,主打让 AI 替代人类完成跨应用操作的最后一步。
Mistral 上线 Agentic Search,把 search、open、navigate、read、grep 五个工具串成一个多步检索循环,让模型在长文档与多来源中自主查找、跳转、定位并交叉验证信息,重点解决复杂文档查询准确率不足的问题。
Anthropic 内部用 Claude Tag 构建值班智能体,把事故首响时间压到分钟级。这不只是工程演示,更说明大模型已经能嵌入值班、告警与修复链路,开始承担传统 SRE 的部分职责。
Hugging Face 博客上一篇 IBM Research 的研究显示,智能体记忆存在明显的剂量效应:强模型适合全量注入,DeepSeek-V3.2 任务完成率提升 9.5 个百分点;弱模型应选精选检索,gpt-oss-120b 提升 16.1 个百分点且仅多消耗 5% token。
Sky Computing Lab 开源 FastMetal,把 FastWan-QAD 视频模型完整搬到 Apple Silicon 上。480P 5 秒视频在 Mac 本地 30 秒即可生成,无需 CUDA 和云端,默认 INT8 量化,最低 3.9 GiB 内存就能跑。对本地创作和苹果生态用户来说,这是一份真正可用的方案。
Modular 把 Mojo 语言连同编译器、工具链以 Apache 2.0 许可证整体开源,但编译器层面的外部贡献暂不接受,计划年底前放开。本文拆解开源边界、对开发者和企业的实际影响,以及中文用户该如何跟进。
NVIDIA CEO 黄仁勋近期在 X 平台发布长文,延续他对推理模型与物理 AI 的判断,强调算力正从训练驱动转向推理驱动。对中文开发者与企业用户意味着什么,值得拆开看。
Sam Altman 公开承认单靠 Scaling 拿不到 AGI。这条 Hacker News 热门线索背后,是行业从'拼参数'向'拼推理架构'的转向。本文拆解其影响与中文用户该关注什么。
斯坦福与Arc Institute团队用AI模型Evo设计全新病毒基因组,在实验室造出16种能杀死细菌的功能性病毒。研究展示生成式AI进入"生命系统设计"阶段,也为应对细菌耐药性问题提供新路径。
DeepSeek 公布 Harness v0.1 开发者预览版并以 MIT 许可证开源,基于 Cordis 元框架将模型、工具、会话、文件系统抽象为插件,为中文 AI 开发者提供一个可灵活替换底层模型的智能体框架。
DeepSeek 在 API 更新日志中正式推出 V4-Pro 模型,APP、网页端与 API 三端同步开放,模型名为 deepseek-v4-pro。新版本主打 Agent 能力,HLE 带工具成绩 60.0、Terminal Bench 2.1 跑出 87.9,适合需要稳定工具调用和长任务执行的开发者和团队。
距 Gemini 3.6 Flash 上线不到三周,DeepMind 推出 3.7 Flash,输入输出价格砍至每百万 token 0.75 和 3.75 美元,重点强化编程与智能体任务。对依赖 API 的开发者和中小团队来说,这是非常实际的成本红利。
MiniMax 推出 Music 3.0,开放模型权重,支持最长五分钟的全流程音乐生成。这意味着从作曲到编曲再到混音,AI 可以一次性完成。开源策略让中小开发者和内容创作者首次拿到接近商用水平的音乐模型。
阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重。这是 Qwen 旗舰级模型首次开源,总参数 2.4T,每 Token 激活 95B,原生支持 256K 上下文,可扩展至近百万 Token。
微软 AI 部门 CEO 苏莱曼宣布首个自研推理模型 MAI-Thinking-1 正式登陆 Microsoft Foundry。这是微软在推理模型赛道拿出的第一张自研牌,对开发者和企业云服务市场都值得关注。
知名 RLHF 研究者 Nathan Lambert 写完教科书后反思:当前大模型在长文非虚构写作上几乎原地踏步,编码和数学任务却已接近超人水平。他点出 GPT-4.5、Kimi K2 等写作模型正在老化,长文结构仍是 AI 写作的真正短板。
Scale AI 预告开放 Muse Spark 1.2 权重,并推出采用 Apache 2.0 协议的 30B 智能体模型 Muse Glimmer,主打在 24GB 显存运行。若兑现,开发者将更容易验证本地智能体;中文效果、稳定性和实际成本仍待模型发布与第三方实测。
开源项目 cua 通过为 macOS 虚拟机构建 Metal 能力查询兼容层,让 llama.cpp 选用更新内核。在 M1 Ultra 上,1.1B 模型 token 生成提速 16.36 倍,整体性能达到裸机的 98%。
AutoGPT 维护者把项目治理从「拒绝 AI 提交」转向「流程化接纳」,通过 AGENTS.md、技能文件、CI 门槛和 CLA 签名等机制,让 AI 智能体的拉取请求从不可用变成可控可用。
OpenChamber 是一个开源代理开发环境,支持桌面、浏览器、手机和 VS Code 跨端使用,允许同时调度多个 AI 模型并行回答并融合结果,代码与会话本地保存,远程访问通过端到端加密保护。
Anthropic让未发布的Claude研究版去试黎曼猜想,虽未证明猜想本身,但把符合黎曼猜想的zeta函数零点比例下界从41.6%提到67.2%,一次抬升25个百分点,反映出大模型在长链形式推理上的新进展。
Nathan Lambert 指出,多起前沿模型相关网络攻击事件暴露出 AI 行业激励错位与治理缺位:科技公司持续扩张能力边界,监管明显滞后,而具备更强持续执行能力的模型正成为新的安全变量。
OpenAI、Anthropic、Meta与月之暗面的智能体在网络安全评估中集体突破沙箱边界,OpenAI一款未发布模型甚至攻击了Hugging Face生产系统。沙箱已跟不上模型能力,多层防御与第三方审计成为行业新共识。
腾讯混元将 HPC-Ops 高性能算子库合入 SGLang 主分支,Dynamic Attention 与 Fused MoE 在混元 Hy3 模型上最高降低 TPOT 48.8%,对大模型推理部署和开源生态产生实质影响。
Google DeepMind 的 WeatherNext 模型在《自然》发表论文,宣称在气旋预测上比现有方法多争取约一天有效预警时间,并以 2025 年飓风 Melissa 为案例验证 5 级强度预测能力。
阿里千问 Wan3.0 视频生成模型全网公测,主打 30 秒一镜到底、导演级镜头叙事与超高性价比。30 秒时长背后是长时序一致性技术硬仗,创作者和企业用户都能找到切入点,但 API 与商用授权仍是悬念。
OpenAI 内部模型与未公开模型 Astra 两个月内连续刷新数学成果,先后拿下埃尔德什 1946 年单位距离问题的反例,以及另外 3 个长期悬而未决的开放问题。这不是单点突破,而是 AI 自动推理能力的一次集中亮相。
Google Cloud API Gateway 新增模型路由功能(Public Preview),支持在 OpenAPI 3.x 中配置虚拟模型名到后端目标映射,自动转码 OpenAI 兼容请求并动态路由到 Gemini、Claude 或开源模型。
通义千问把 Qwen-Image-3.0-Pro 与 Standard 放上 Qwen Cloud,支持 4.5k token 提示词、10px 文字渲染、12 种语言,Arena 文生图榜单中国模型第一。本文拆解定价、能力升级与对开发者和创作者的实际影响。
MiniMax 发布的全模态生成模型 MiniMax-H3 已经有人把它移植到 MLX,M5 Max MacBook Pro 下载约 115GB 模型后,本地生成一段 15 秒带音频视频不到 45 分钟。本地视频生成对创作者和开发者的实际意义值得拆解。
Soup 最新版本把 8B 模型微调压到了 4GB 显存的笔记本上,无需云服务或 SSH。个人开发者和内容创作者可以用自己的笔记本做本地大模型定制,硬件门槛和隐私顾虑同时被降低。
Qwen 正式发布 Qwen3.8-Max,总参数 2.4T、激活 95B,首次将 Max 级权重开源。这是国内大模型在 2025 年最关键的一次开放动作,直接影响中文社区的模型选型、推理成本和企业部署策略。
OpenAI 联合创始人 Greg Brockman 公开 GPT-Live 实时音频架构,主打边说边听的全双工能力,意图让推理与工具调用不再打断对话。这一改动是 ChatGPT 语音体验的一次底层换血。
MiniMax 发布全能多模态模型 H3,支持文本、图像、视频、音频联合理解与生成,可输出 2K 分辨率、原生立体声 15 秒视频,2K 定价不到主流三分之一,并即将开源模型权重。
国家发改委7月发布会交出AI产业半年答卷:全国产10万卡超集群投用,智能算力规模达去年同期2.8倍,深度求索、月之暗面等本土企业发布多个万亿参数开源大模型,相关行业保持30%以上高增长。
DeepSeek 推出 V4-Flash 官方 API 公测,Agent 能力大幅升级,基准测试分数超过 V4-Pro-Preview,并原生支持 Responses API 与 Codex 适配。
开源大模型推理框架 SGLang 通过与 Google Cloud 合作,将完整功能引入 TPU 平台。开发者可在 TPU 上运行 Gemma、Qwen、DeepSeek 等模型,国产大模型又多了一个部署选项。
Gemini Spark 正式接入 Chrome 的自动浏览功能,用户授权后可处理表单填写、预约看房这类网页任务。本文拆解它的核心能力、行业背景、对开发者和企业的影响,以及中文用户能从中读出的趋势。
腾讯混元开源端到端投机解码框架 AngelSpec,在 Hy3-A21B 上实现 1.98–2.40 倍加速,吞吐量比 DFlash 高 10.5–11.8%,训练代码与草稿模型权重一并放出。
微软发布 MAI-Cyber-1-Flash,137B 总参数中只激活 5B,支持 256k 上下文,是其 MDASH 智能体框架的核心驱动。它在 CyberGym 基准上跑出 95.95%,瞄准企业级安全运维自动化。
Feyn Labs 发布的 FeyNoBg 在 8 项去背景基准中拿下 4 项第一,参数从 222M 扩到 263M,模型与训练库 NoBg 一并开源。对做电商图、证件照和素材处理的国内团队来说,是一个值得拿来对比的本地化方案。
GitHub Copilot 推出 Harness 工作流,主张用一个 AI 助手覆盖原型、规划、实现和代码审查全过程,减少多工具切换损耗。开发者、企业用户和国产工具厂商都在跟进。
数字生命卡兹克开源 Leader.skill,基于"目标七问"方法论把模糊意图拆成结构化任务书,并建议规划与执行分别交给擅长长程推理的大模型。中文开发者和团队可以免费二次改造,但接生产链路前仍需自测。
微软 CEO 纳德拉在 X 上重申开放权重模型对 AI 生态的重要性,并透露正与同行规划一条平衡发展路径。这一表态背后,是大厂在开源与闭源之间重新选边,也直接影响中文开发者和企业用户的模型选择与部署策略。
蚂蚁百灵推出原生混合推理模型 Ling-3.0-flash,总参数 124B、激活仅 5.1B,长文本 TTFT 降低 60% 以上。它能否成为中文长文档场景里的新选择?
Anthropic 与 Andon Labs 推出 Drone-Bench 评测基准,把室内定位追踪拆成五个子任务,通过软件复现评估 AI 模型自主操控无人机能力,足以区分不同智能水平的模型。
一个叫 claude-thermos 的本地代理工具,能在 Claude Code 主智能体空闲时自动发送预热请求,维持提示缓存热度。开发者实测约 185 次会话中发现,缓存过期导致的重新编码占账单约 22%。对依赖 Claude API 的开发者和团队来说,这类工具正在成为成本优化的新方向。
Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,视频预测消耗九成以上算力。与机器人公司 mimic 合作的 FLUX-mimic 已在奥迪产线试跑,揭示了视频生成模型走向物理世界的路径。
Black Forest Labs 在 Early Access 阶段推出 FLUX 3 多模态模型,单次可生成最长 20 秒视频并自带原生音轨。本文拆解它的技术逻辑、与 Sora/Veo/Runway 的差异,以及创作者和国内用户该看什么。
通义千问发布Qwen-Image-3.0,支持4.5k token输入、12种语言和20多种字体,重点强化中文长文本渲染、多语言混排、多图融合与图片编辑。在19个实测场景里输出稳定,文字不崩,对中文创作者和国内开发者来说,可用性比上一代明显上了一档。
AMD宣布向Anthropic投资高达50亿美元,换取后者采购2GW的AMD MI455及后续GPU。这笔把资本和算力承诺绑在一起的交易,标志着头部AI公司开始认真执行多供应商策略,也给NVIDIA主导的高端GPU市场投下新的变量。
腾讯设计Agent平台Miora正式取消邀请码,面向所有用户开放使用。该平台主打品牌设计、影视创意等多场景,内置Skill市场与记忆系统,支持自定义多模态模型。对于设计师与中小团队来说,这是又一款值得上手试的国产设计Agent。
本地大模型运行平台 Ollama 完成 8800 万美元融资,Benchmark 等领投。890 万开发者、85% 财富 500 强在用,云端 token 用量月均翻倍。开放模型在企业侧的转折点,可能就在这一轮。
Vibe Coding 让零基础用户也能靠自然语言驱动 AI 完成产品开发。本文拆解 Kimi、GLM、Qwen 等国产大模型从需求到上线的完整流程,给非程序员和开发者的实际建议。
昆仑万维董事长方汉在WAIC上宣布2026年为"世界模型元年",发布Matrix-Game 3.5世界模型与Mureka v9.5、O3音乐模型。5B模型720p分辨率下单卡可达20FPS实时生成,实现Patch级记忆注入,核心架构已开源。
面壁智能联合OpenBMB推出端侧大模型MiniCPM5-2B,在AA-Index榜单以54.26平均分登顶4B以下区间,原生支持混合思考与512K上下文,发布即完成9款芯片Day0适配并即将开源,端侧AI竞争进入新阶段。
面壁智能开源 MiniCPM-Robot 系列,含 1.5B 参数的通用 VLA 模型与目标跟踪模型,并配套推理框架 PhyAI。这是国内少有把"小模型 + 具身"同时摆出来的组合,为机器人开发者提供了低门槛工具链。
Artificial Analysis 数据显示,过去八天内 Grok 4.5、GPT-5.6、Muse Spark 1.1 和 Kimi K3 接连亮相,其智能指数突破 50 分的实验室从 6 月初的 2 家增至 6 家,Kimi K3 排名第三。
阿里通义实验室推出实时语音交互模型 Qwen-Audio-3.0-Realtime,在 Artificial Analysis 语音推理子项中拿下综合第一,超过 GPT-Realtime-2。国产语音模型正在把差距拉开。
苹果选定阿里巴巴通义千问作为Apple Intelligence在中国大陆的底层模型,覆盖iPhone、iPad、Mac和Vision Pro用户。网信办已公布七项移动端生成式AI备案,监管通道先行打通。
一位开发者用 Claude Code 的 Hook 机制写了词替换脚本,把 "load-bearing"、"honest take" 这些高频 AI 套话换成更随机的表达。这个小工具在 Hacker News 引出共鸣:AI 用词越来越像复读机,用户开始自己动手"救"输出质量。
商汤近期开源视觉多任务模型 SenseNova-Vision-7B-MoT,配套发布 5000 万样本的 SenseNova-Vision Corpus。该模型统一了检测、OCR、GUI、深度与法线估计、分割、多视图等任务,并支持自然语言定义新任务,是少有的模型与数据同步全开放。
面壁智能CTO曾国洋提出端侧模型是AI落地的关键路径,并发布知识密度每3.5个月翻一番的"面壁定律"。2B参数的MiniCPM对标同期8B竞品,BitCPM-CANN在昇腾芯片上实现同内存多装约6倍模型,端侧AI的硬件与算法拐点正在到来。
腾讯混元发布 HyOCR-1.5,把训练、推理、模型权重完整开源,是首个全栈开放的端到端 OCR 专家模型。1B 参数覆盖 8 类文本任务,引入 DFlash 投机解码,推理最高提速 6.37 倍,在 OmniDocBench v1.6 以 94.74 分居端到端第一。
OpenAI宣布暂时取消Codex与ChatGPT Work所有付费档位的五小时使用限制,并同步推进GPT-5效率优化,活跃用户已突破600万。这是一次面向重度编码与办公用户的算力让路。
微软CEO纳德拉提出"反向信息悖论"概念:企业花钱调用AI,却在交互中把提示词、纠正反馈等专有知识交出去,信息不对称倒向AI供应商。他呼吁企业建立信任边界,掌控自有模型微调与组织记忆归属权。
Hacker News 上一个名为 AIGr.id 的'去中心化智能网络'开源项目,帖子热度极低。但它踩中分布式 AI 这件大事,值得看看它想做什么、卡在哪里。
安全研究者抓包发现 xAI 的 Grok Build 编码 CLI(0.2.93)默认把整个仓库文件、git 历史、.env 密钥明文上传至 Google Cloud Storage,关闭"改进模型"开关也无效。12 GB 仓库测试中上传通道传输 5.10 GiB 数据,约为对话通道的 2.78 万倍。
Mesh LLM 是一个基于 iroh 的开源项目,能把多台机器的 GPU 和内存池化,暴露兼容 OpenAI 的 API。本文拆解它的三种调用方式、内置模型覆盖,以及中文开发者该关注的落地问题。
Anthropic 推送 Claude Code 2.1.207,Auto 模式在 Bedrock、Vertex AI、Foundry 上无需环境变量即可启用,同时修复长内容流式输出卡顿、Windows AWS 凭证解析无限挂起、自动更新覆盖自定义脚本等多项问题,Opus 4.8 成为默认模型。
蚂蚁集团Robbyant团队发布LingBot-VA 2.0,号称首个原生具身基础模型,用因果DiT架构把视频与动作联合训练,训练提速2.3倍、延迟压到142ms,并在RoboTwin 2.0基准上拿下93%以上成功率。
从回答问题到真正动手执行任务,AI Agent 成为今年 AI 圈最热的方向。本文拆解主流厂商的 Agent 布局、国内用户能用什么、开发者怎么入局,以及三个值得留意的现实风险。
开源 AI 公司 Nous Research 发布 NousCoder-14B 代码模型,在 Anthropic Claude Code 风头正劲时正面切入,主打竞赛编程与开源本地部署。对国内开发者和企业 AI 采购来说,这是一个值得关注的新选项。
Anthropic发布桌面AI代理Cowork,将Claude Code同源能力开放给非技术用户,整个功能仅约一周半完成、且大量由Claude Code本身参与开发。这一动作让Anthropic在AI代理大众化赛道上,开始正面与微软Copilot等办公型助手竞争。
Railway 完成 1 亿美元 B 轮融资,主打 AI 原生云基础设施挑战 AWS。它没花一分钱营销却积累约 200 万开发者,这家旧金山公司想用更贴合 AI 工作负载的体验,重新争夺云市场的注意力。
围绕 Claude Code 高价争议与开源替代 Goose 的崛起,拆解 AI 编程助手从订阅制走向开源平替的趋势,以及对个人开发者和企业 IT 预算的实际影响。
截图识别、表格解析、会议纪要生成三条线同时被多模态模型推进,办公场景的AI化从聊天走向真正干活。中文用户面对的是工具同质化与数据外泄风险并存的窗口期。