模型发布

Gemini Spark 接入 Chrome 自动浏览:浏览器里的 AI 代理人能不能真的替你干活?

Gemini Spark 正式接入 Chrome 的自动浏览功能,用户授权后可处理表单填写、预约看房这类网页任务。本文拆解它的核心能力、行业背景、对开发者和企业的影响,以及中文用户能从中读出的趋势。

本文基于官方公告、公开资料和行业讨论整理,重要事实建议以原文和官方更新为准。
Gemini Spark 接入 Chrome 自动浏览:浏览器里的 AI 代理人能不能真的替你干活?

Google 旗下的 Gemini Spark 正式接入 Chrome 的自动浏览功能,用户授权后,Spark 可以直接在浏览器里帮忙完成网页操作,比如预约看房、填写航班信息。这件事本身动静不大,但它把

这条路径又往前推了一步。

根据官方说法,Spark 不会替你点下

这类高风险按钮。它主打的是重复、繁琐的表单任务——恰好是普通用户每天最耗时间的那一块。能做哪些、不能做哪些,边界划得非常保守。

浏览器正在变成 AI 代理的主战场

把时间线拉长看,过去一年几乎所有头部 AI 公司都在抢

这个入口。Chrome 自身有十几亿用户,把 AI 助手放进地址栏旁的入口,相当于给普通人配了一个会操作网页的副驾驶。

这种思路不是 Google 独家。OpenAI 的 Operator、Anthropic 的 Computer Use、Arc 旗下的 Dia,都在赌同一件事:未来的浏览器不只是看网页的工具,而是替你执行任务的接口。Spark 这次更新,可以理解为 Google 的一次防守动作。

对开发者和企业用户的影响

对企业来说,更值得关注的是 API 层。如果未来 Spark 的能力开放给第三方,类似 RPA 的脚本工作会被进一步压缩。一个人能用自然语言

浏览器自己点表单,意味着原本要写脚本的流程,现在一句话就能触发。

开发者则要留意新的权限模型。浏览器代理人需要读取页面、填写字段、点击按钮,这些动作一旦被滥用,攻击面会扩大。Chrome 团队需要重新审视扩展程序生态,权限边界怎么划,会是接下来半年的讨论重点。

中文用户能从中读出什么

现实是,大多数国内用户暂时没有方便使用 Gemini Spark 的渠道。Chrome 在国内访问不稳,Gemini 本身也需要特定网络环境。这件事对中文用户的直接价值有限,但它指出的方向很值得参考。

如果你日常已经在用 Edge 的 Copilot、夸克的 AI 搜索或豆包浏览器助手,可以观察一个指标——它能不能跨网站完成任务,而不是只回答当前页面的内容。这是判断浏览器 AI 是否

的分水岭。

几个值得继续看的方向

授权粒度、错误恢复、隐私数据,是接下来要盯紧的三条线。当前的 Spark 还停留在

的层面,但更细的问题是:每次操作都单独确认,还是一次授权用到底?这关系着用户对失控的恐惧。

浏览器 AI 代理人在 2024 年还像是 demo 视频,2025 年开始有真实可用的版本。要把它当成工具而不是玩具,关键看它能不能在你打开十几个标签页的时候,安静地替你关掉那些不需要一直盯着的。

同主题阅读路径

查看「模型发布」栏目
继续比较相关工具

读完文章后,如果你想继续筛选 AI 工具,可以从真实使用场景开始做横向比较。

查看 AI 工具