OpenWorker 新版发布:Andrew Ng 把三类安全智能体塞进完全开源的 harness
Andrew Ng 名下 OpenWorker 发布新版,把代码漏洞扫描、依赖供应链注入、云配置检查三类网络安全智能体集成进完全开源的 harness,并支持本地运行开源权重模型,让敏感代码不必出内网。
聚合 Claude Code、Codex、代码模型、开发工具和 AI 原生工程实践。
Andrew Ng 名下 OpenWorker 发布新版,把代码漏洞扫描、依赖供应链注入、云配置检查三类网络安全智能体集成进完全开源的 harness,并支持本地运行开源权重模型,让敏感代码不必出内网。
OpenRouter 发布模型选型方法论,强调按完成任务成本而非 token 单价评估。其 MCP 服务器已在 Claude Code、Cursor 等编辑器内可查实时排名与价格,并提供 auto-beta 自动路由。
OpenAI 将 GPT-5.6 模型家族接入软件开发智能体 Kiro,含 Sol、Terra、Luna 三款。Terminal-Bench 2.1 测试显示,GPT-5.6 Terra 在 Kiro 内完成任务成本下降约 82%。这次更新由 OpenAI 与 AWS 合作优化,主打更低迭代次数和更高 token 性价比。
面壁智能发布面向 Lean 4 的数学自动形式化开源框架 MathForm,配套 FormalVerse 数据集含 36.7 万条已验证样本。在 10 万预算对照下,模型 Consistency Check 达到 60.32%,超过 FineLeanCorpus 与 NuminaMath-LEAN 两个主流基线,整套流水线完全开源可复现。
Sky Computing Lab 开源 FastMetal,把 FastWan-QAD 视频模型完整搬到 Apple Silicon 上。480P 5 秒视频在 Mac 本地 30 秒即可生成,无需 CUDA 和云端,默认 INT8 量化,最低 3.9 GiB 内存就能跑。对本地创作和苹果生态用户来说,这是一份真正可用的方案。
Modular 把 Mojo 语言连同编译器、工具链以 Apache 2.0 许可证整体开源,但编译器层面的外部贡献暂不接受,计划年底前放开。本文拆解开源边界、对开发者和企业的实际影响,以及中文用户该如何跟进。
DeepSeek 公布 Harness v0.1 开发者预览版并以 MIT 许可证开源,基于 Cordis 元框架将模型、工具、会话、文件系统抽象为插件,为中文 AI 开发者提供一个可灵活替换底层模型的智能体框架。
DeepSeek 在 API 更新日志中正式推出 V4-Pro 模型,APP、网页端与 API 三端同步开放,模型名为 deepseek-v4-pro。新版本主打 Agent 能力,HLE 带工具成绩 60.0、Terminal Bench 2.1 跑出 87.9,适合需要稳定工具调用和长任务执行的开发者和团队。
距 Gemini 3.6 Flash 上线不到三周,DeepMind 推出 3.7 Flash,输入输出价格砍至每百万 token 0.75 和 3.75 美元,重点强化编程与智能体任务。对依赖 API 的开发者和中小团队来说,这是非常实际的成本红利。
Scale AI 预告开放 Muse Spark 1.2 权重,并推出采用 Apache 2.0 协议的 30B 智能体模型 Muse Glimmer,主打在 24GB 显存运行。若兑现,开发者将更容易验证本地智能体;中文效果、稳定性和实际成本仍待模型发布与第三方实测。
AutoGPT 维护者把项目治理从「拒绝 AI 提交」转向「流程化接纳」,通过 AGENTS.md、技能文件、CI 门槛和 CLA 签名等机制,让 AI 智能体的拉取请求从不可用变成可控可用。
OpenChamber 是一个开源代理开发环境,支持桌面、浏览器、手机和 VS Code 跨端使用,允许同时调度多个 AI 模型并行回答并融合结果,代码与会话本地保存,远程访问通过端到端加密保护。
阿里通义千问团队开源Qwen-MM-Plugins,将图片、视频、文档、3D/CAD等多模态能力拆解为独立插件,让AI智能体从"看懂"升级为"看懂并动手处理",开发者可自由组合调用。
多家媒体报道,科学家首次借助人工智能独立设计出新病毒。这件事把生成式AI的能力从文字、图像、代码,扩展到了生命科学最基本的对象,也让"AI for Bio"再次进入公众视野。
GitHub 工程团队公开一种新的代码审查工作流:用堆叠式 Pull Request 把 AI 智能体生成的上千行代码拆成数据、API、接线、UI 四层独立 PR,每层单独审查、单独跑测试。这套思路直击 AI 编码时代巨型 diff 难以评审的痛点,对企业研发流程和中文开发者都有借鉴价值。
DeepSeek 推出 V4-Flash 官方 API 公测,Agent 能力大幅升级,基准测试分数超过 V4-Pro-Preview,并原生支持 Responses API 与 Codex 适配。
开源大模型推理框架 SGLang 通过与 Google Cloud 合作,将完整功能引入 TPU 平台。开发者可在 TPU 上运行 Gemma、Qwen、DeepSeek 等模型,国产大模型又多了一个部署选项。
腾讯混元开源端到端投机解码框架 AngelSpec,在 Hy3-A21B 上实现 1.98–2.40 倍加速,吞吐量比 DFlash 高 10.5–11.8%,训练代码与草稿模型权重一并放出。
Feyn Labs 发布的 FeyNoBg 在 8 项去背景基准中拿下 4 项第一,参数从 222M 扩到 263M,模型与训练库 NoBg 一并开源。对做电商图、证件照和素材处理的国内团队来说,是一个值得拿来对比的本地化方案。
GitHub Copilot 推出 Harness 工作流,主张用一个 AI 助手覆盖原型、规划、实现和代码审查全过程,减少多工具切换损耗。开发者、企业用户和国产工具厂商都在跟进。
开发者 Vista 在 X 分享了一款基于 bento 风格改造的开源 AI Skill,输入主题即可生成可编辑、可在线协作的 HTML 演示稿,背后正在成形的 "Skills" 工具链生态同样值得关注。
Berkeley RDI 把软件自主开发拆成代码自主、流水线自主、需求自主三级,给能力声明和部署选择提供了一个可对照的刻度,对中文用户判断 AI 编程工具的真实位置很有参考价值。
微软 CEO 纳德拉在 X 上重申开放权重模型对 AI 生态的重要性,并透露正与同行规划一条平衡发展路径。这一表态背后,是大厂在开源与闭源之间重新选边,也直接影响中文开发者和企业用户的模型选择与部署策略。
一个叫 claude-thermos 的本地代理工具,能在 Claude Code 主智能体空闲时自动发送预热请求,维持提示缓存热度。开发者实测约 185 次会话中发现,缓存过期导致的重新编码占账单约 22%。对依赖 Claude API 的开发者和团队来说,这类工具正在成为成本优化的新方向。
Vibe Coding 让零基础用户也能靠自然语言驱动 AI 完成产品开发。本文拆解 Kimi、GLM、Qwen 等国产大模型从需求到上线的完整流程,给非程序员和开发者的实际建议。
面壁智能开源 MiniCPM-Robot 系列,含 1.5B 参数的通用 VLA 模型与目标跟踪模型,并配套推理框架 PhyAI。这是国内少有把"小模型 + 具身"同时摆出来的组合,为机器人开发者提供了低门槛工具链。
一个面向编程 AI 智能体的开源记忆项目在 GitHub 发布,支持通过 SSH 同步记忆数据,可自托管、无需依赖特定云服务。它瞄准的是 AI 编码助手跨会话失忆的痛点,对个人开发者和团队都值得一看。
MiniMax Code 桌面端完成底层重构,引入 Pi Agent 框架,会话启动和长任务稳定性明显提升,同时接入恒生金融数据库和企查查 MCP,金融模块即将上线,远程控制与浏览器操控功能本月内推出。
一位开发者用 Claude Code 的 Hook 机制写了词替换脚本,把 "load-bearing"、"honest take" 这些高频 AI 套话换成更随机的表达。这个小工具在 Hacker News 引出共鸣:AI 用词越来越像复读机,用户开始自己动手"救"输出质量。
腾讯混元发布 HyOCR-1.5,把训练、推理、模型权重完整开源,是首个全栈开放的端到端 OCR 专家模型。1B 参数覆盖 8 类文本任务,引入 DFlash 投机解码,推理最高提速 6.37 倍,在 OmniDocBench v1.6 以 94.74 分居端到端第一。
OpenAI宣布暂时取消Codex与ChatGPT Work所有付费档位的五小时使用限制,并同步推进GPT-5效率优化,活跃用户已突破600万。这是一次面向重度编码与办公用户的算力让路。
Hacker News 上一个名为 AIGr.id 的'去中心化智能网络'开源项目,帖子热度极低。但它踩中分布式 AI 这件大事,值得看看它想做什么、卡在哪里。
Hacker News AI 板块出现一条低互动帖子,把中世纪拉丁俗谚改写成「自然不给的,AI 不给」。这句冷门讨论直指生成式 AI 的能力边界,对中文创作者、开发者和普通用户重新理解 AI 工具很有参考价值。
安全研究者抓包发现 xAI 的 Grok Build 编码 CLI(0.2.93)默认把整个仓库文件、git 历史、.env 密钥明文上传至 Google Cloud Storage,关闭"改进模型"开关也无效。12 GB 仓库测试中上传通道传输 5.10 GiB 数据,约为对话通道的 2.78 万倍。
一个叫 Ghost Font 的原型项目,把文字藏进由背景同色点组成的短视频,靠运动信息和诱饵文本让主流多模态模型无法识读真实内容,背后是屏幕时代 AI 抓取与人类隐私的新一轮攻防。
Anthropic 推送 Claude Code 2.1.207,Auto 模式在 Bedrock、Vertex AI、Foundry 上无需环境变量即可启用,同时修复长内容流式输出卡顿、Windows AWS 凭证解析无限挂起、自动更新覆盖自定义脚本等多项问题,Opus 4.8 成为默认模型。
AI 创业者 Matt Shumer 给 OpenAI 最新 Agent 开全权限执行本地清理,因 $HOME 变量解析错误触发危险命令,多年数代代码、文件、照片丢失。事件把 Agent 行业的权限边界和危险指令拦截问题摆到了台面上。
从回答问题到真正动手执行任务,AI Agent 成为今年 AI 圈最热的方向。本文拆解主流厂商的 Agent 布局、国内用户能用什么、开发者怎么入局,以及三个值得留意的现实风险。
开源 AI 公司 Nous Research 发布 NousCoder-14B 代码模型,在 Anthropic Claude Code 风头正劲时正面切入,主打竞赛编程与开源本地部署。对国内开发者和企业 AI 采购来说,这是一个值得关注的新选项。
Anthropic发布桌面AI代理Cowork,将Claude Code同源能力开放给非技术用户,整个功能仅约一周半完成、且大量由Claude Code本身参与开发。这一动作让Anthropic在AI代理大众化赛道上,开始正面与微软Copilot等办公型助手竞争。
Railway 完成 1 亿美元 B 轮融资,主打 AI 原生云基础设施挑战 AWS。它没花一分钱营销却积累约 200 万开发者,这家旧金山公司想用更贴合 AI 工作负载的体验,重新争夺云市场的注意力。
围绕 Claude Code 高价争议与开源替代 Goose 的崛起,拆解 AI 编程助手从订阅制走向开源平替的趋势,以及对个人开发者和企业 IT 预算的实际影响。