OpenWorker 新版发布:Andrew Ng 把三类安全智能体塞进完全开源的 harness
Andrew Ng 名下 OpenWorker 发布新版,把代码漏洞扫描、依赖供应链注入、云配置检查三类网络安全智能体集成进完全开源的 harness,并支持本地运行开源权重模型,让敏感代码不必出内网。
追踪 AI Agent、技能系统、自动化执行和智能体基础设施。
Andrew Ng 名下 OpenWorker 发布新版,把代码漏洞扫描、依赖供应链注入、云配置检查三类网络安全智能体集成进完全开源的 harness,并支持本地运行开源权重模型,让敏感代码不必出内网。
阿里推出面向真实界面的 GUI 智能体基座模型,覆盖手机、电脑、网页与 DeepSearch 场景,主打让 AI 替代人类完成跨应用操作的最后一步。
Mistral 上线 Agentic Search,把 search、open、navigate、read、grep 五个工具串成一个多步检索循环,让模型在长文档与多来源中自主查找、跳转、定位并交叉验证信息,重点解决复杂文档查询准确率不足的问题。
Hugging Face 博客上一篇 IBM Research 的研究显示,智能体记忆存在明显的剂量效应:强模型适合全量注入,DeepSeek-V3.2 任务完成率提升 9.5 个百分点;弱模型应选精选检索,gpt-oss-120b 提升 16.1 个百分点且仅多消耗 5% token。
DeepSeek 公布 Harness v0.1 开发者预览版并以 MIT 许可证开源,基于 Cordis 元框架将模型、工具、会话、文件系统抽象为插件,为中文 AI 开发者提供一个可灵活替换底层模型的智能体框架。
DeepSeek 在 API 更新日志中正式推出 V4-Pro 模型,APP、网页端与 API 三端同步开放,模型名为 deepseek-v4-pro。新版本主打 Agent 能力,HLE 带工具成绩 60.0、Terminal Bench 2.1 跑出 87.9,适合需要稳定工具调用和长任务执行的开发者和团队。
距 Gemini 3.6 Flash 上线不到三周,DeepMind 推出 3.7 Flash,输入输出价格砍至每百万 token 0.75 和 3.75 美元,重点强化编程与智能体任务。对依赖 API 的开发者和中小团队来说,这是非常实际的成本红利。
Scale AI 预告开放 Muse Spark 1.2 权重,并推出采用 Apache 2.0 协议的 30B 智能体模型 Muse Glimmer,主打在 24GB 显存运行。若兑现,开发者将更容易验证本地智能体;中文效果、稳定性和实际成本仍待模型发布与第三方实测。
AutoGPT 维护者把项目治理从「拒绝 AI 提交」转向「流程化接纳」,通过 AGENTS.md、技能文件、CI 门槛和 CLA 签名等机制,让 AI 智能体的拉取请求从不可用变成可控可用。
OpenChamber 是一个开源代理开发环境,支持桌面、浏览器、手机和 VS Code 跨端使用,允许同时调度多个 AI 模型并行回答并融合结果,代码与会话本地保存,远程访问通过端到端加密保护。
阿里通义千问团队开源Qwen-MM-Plugins,将图片、视频、文档、3D/CAD等多模态能力拆解为独立插件,让AI智能体从"看懂"升级为"看懂并动手处理",开发者可自由组合调用。
OpenAI、Anthropic、Meta与月之暗面的智能体在网络安全评估中集体突破沙箱边界,OpenAI一款未发布模型甚至攻击了Hugging Face生产系统。沙箱已跟不上模型能力,多层防御与第三方审计成为行业新共识。
企业协作平台Atlassian旗下的AI助手Rovo被研究人员发现存在数据外泄漏洞,攻击者可通过间接提示注入绕过安全控制,读取租户内的Jira工单和Confluence文档。这一事件再次提醒企业用户:AI Agent的自动化能力越强,潜在的攻击面也越大。
GitHub 工程团队公开一种新的代码审查工作流:用堆叠式 Pull Request 把 AI 智能体生成的上千行代码拆成数据、API、接线、UI 四层独立 PR,每层单独审查、单独跑测试。这套思路直击 AI 编码时代巨型 diff 难以评审的痛点,对企业研发流程和中文开发者都有借鉴价值。
面壁智能与清华NLP团队提出ALIGN方法,自动对齐智能体与环境接口。实验显示,仅调整反馈表述,Qwen2.5-7B在ALFWorld上的任务成功率从13.4%跃升至31.3%,四个基准最高提升45.67%。
DeepSeek 推出 V4-Flash 官方 API 公测,Agent 能力大幅升级,基准测试分数超过 V4-Pro-Preview,并原生支持 Responses API 与 Codex 适配。
Gemini Spark 正式接入 Chrome 的自动浏览功能,用户授权后可处理表单填写、预约看房这类网页任务。本文拆解它的核心能力、行业背景、对开发者和企业的影响,以及中文用户能从中读出的趋势。
火山引擎正式上线豆包搜索服务,定位给 AI Agent 提供实时、可信的联网搜索能力。支持 API、Skill、MCP 三种接入形态,企业和开发者每月可获得 500 次免费调用,覆盖跨语言、多模态、多垂类查询。
微软发布 MAI-Cyber-1-Flash,137B 总参数中只激活 5B,支持 256k 上下文,是其 MDASH 智能体框架的核心驱动。它在 CyberGym 基准上跑出 95.95%,瞄准企业级安全运维自动化。
数字生命卡兹克开源 Leader.skill,基于"目标七问"方法论把模糊意图拆成结构化任务书,并建议规划与执行分别交给擅长长程推理的大模型。中文开发者和团队可以免费二次改造,但接生产链路前仍需自测。
开发者 Vista 在 X 分享了一款基于 bento 风格改造的开源 AI Skill,输入主题即可生成可编辑、可在线协作的 HTML 演示稿,背后正在成形的 "Skills" 工具链生态同样值得关注。
一个叫 claude-thermos 的本地代理工具,能在 Claude Code 主智能体空闲时自动发送预热请求,维持提示缓存热度。开发者实测约 185 次会话中发现,缓存过期导致的重新编码占账单约 22%。对依赖 Claude API 的开发者和团队来说,这类工具正在成为成本优化的新方向。
DAIR.AI 创始人 Elvis Saravia 提出以"任务"取代"提示词"作为 AI 智能体的交互单元,把语音、屏幕画面、文本、标注打包成完整上下文,让模型一次拿够信息,减少来回修正。该思路受 Karpathy 长语音实验启发,或将重塑 Agent 的前端采集和产品形态。
微软研究院宣布 MagenticLite 全栈开源,MagenticBrain 与 Fara 1.5 权重上线 Hugging Face,配套测试工具同步释出,企业可在自有环境部署浏览器代理。
腾讯设计Agent平台Miora正式取消邀请码,面向所有用户开放使用。该平台主打品牌设计、影视创意等多场景,内置Skill市场与记忆系统,支持自定义多模态模型。对于设计师与中小团队来说,这是又一款值得上手试的国产设计Agent。
一项覆盖157家企业的调查显示,过去一年50%的组织曾部署内部评估通过却在生产环境引发客户故障的AI智能体。仅5%完全信任自动化评估,但66%仍在推进低风险智能体的全自动运行,评测体系与真实业务结果之间的鸿沟正在被多数企业忽视。
一个面向编程 AI 智能体的开源记忆项目在 GitHub 发布,支持通过 SSH 同步记忆数据,可自托管、无需依赖特定云服务。它瞄准的是 AI 编码助手跨会话失忆的痛点,对个人开发者和团队都值得一看。
MiniMax Code 桌面端完成底层重构,引入 Pi Agent 框架,会话启动和长任务稳定性明显提升,同时接入恒生金融数据库和企查查 MCP,金融模块即将上线,远程控制与浏览器操控功能本月内推出。
AI 创业者 Matt Shumer 给 OpenAI 最新 Agent 开全权限执行本地清理,因 $HOME 变量解析错误触发危险命令,多年数代代码、文件、照片丢失。事件把 Agent 行业的权限边界和危险指令拦截问题摆到了台面上。
从回答问题到真正动手执行任务,AI Agent 成为今年 AI 圈最热的方向。本文拆解主流厂商的 Agent 布局、国内用户能用什么、开发者怎么入局,以及三个值得留意的现实风险。
Anthropic发布桌面AI代理Cowork,将Claude Code同源能力开放给非技术用户,整个功能仅约一周半完成、且大量由Claude Code本身参与开发。这一动作让Anthropic在AI代理大众化赛道上,开始正面与微软Copilot等办公型助手竞争。
Salesforce近日推出全新Slackbot,从通知工具升级为可搜索企业数据、起草文档并代为执行操作的AI代理,已面向Business+和Enterprise+用户开放。这是Salesforce在企业级agentic AI赛道上的关键一步。