先说结论
Gemini 3.5 Flash 的 computer use 现在已经值得开发者认真试,但还不适合你把所有线上高风险流程直接交给它。
- 普通用户:如果你只是想偶尔让 AI 点页面、搜信息、填表,先别把它理解成“自动替你办事”的黑盒。它更像需要护栏的 agent 能力。
- 进阶用户 / 开发者:如果你本来就在做 browser automation、QA、客服后台流程、知识工作自动化,
Gemini 3.5 Flash现在很值得进 shortlist。Google 已经把它定义成 computer use 的推荐模型。 - 站长 / 工具团队:它最适合先接低风险、可回滚、可观察的任务,比如测试、资料采集、后台巡检、表单草拟和内容录入前半段。涉及支付、合同同意、对外发送、生产变更和账号安全的最后一步,都必须保留人工确认。
一句话判断:它可以当执行层 agent,但不能当无人看守的最终操作员。
首图来源:本站自制信息图,依据 Google 2026-06-24 官方公告、Google AI for Developers 的 computer use 与 pricing 文档整理绘制;未使用第三方受限版权图片。
这次上线的核心变化是什么
Google 在 2026 年 6 月 24 日 的官方博客里写得很清楚:computer use 已经从过去单独的 Gemini 2.5 computer use model,内建到 Gemini 3.5 Flash 里了。
这件事的意义不在于“Google 也有 computer use”,而在于:
3.5 Flash本来就是当前 Google 的主力 Flash 模型- 它本来就支持函数调用、Search、Maps 等工具
- 现在它把 UI 操作也放进同一个主力模型里
对开发者来说,这比再接一个独立 preview model 更重要,因为它让:
- agentic execution
- coding
- long-horizon workflow
- browser / mobile / desktop 操作
开始压回一条统一路线。
官方文档有一个值得注意的矛盾点
Google 2026-07-06 更新的 What’s new in Gemini 3.5 Flash 页面里,正文、迁移清单和 Gemini 3 family features 都写着 Computer Use 已经支持;但同一页最下面的 FAQ 又写着 “Computer Use is not supported in Gemini 3.5 Flash”。
基于当前官方资料,我的判断是:
2026-06-24官方博客明确说已经内建进3.5 Flash- 独立的
computer use文档明确把gemini-3.5-flash列为推荐模型 - 同页正文和迁移清单也写着
Computer Use is supported
因此我推断 FAQ 那一条更像是尚未清理的旧文案,而不是当前能力状态。
这是基于多份官方页面交叉后的推断,不是单页逐字照搬。
什么时候它值得先上
更适合优先试的,是下面这些任务:
| 场景 | 为什么适合 | 仍要保留什么 |
|---|---|---|
| 浏览器测试 / QA 巡检 | 步骤固定、结果可观察、失败成本低 | 截图日志和重跑机制 |
| 后台资料录入前半段 | 可以先导航、打开页面、填写草稿 | 最终提交前人工确认 |
| Search / Docs / SaaS 里的资料采集 | 需要看页面、点链接、跨界面走流程 | 域名白名单和访问限制 |
| 内部知识工作自动化 | 比如生成草稿、取数、整理状态 | 明确禁止越权和最终发送 |
如果你关心的是“能不能做大规模 agent”,它现在比 Gemini File Search 怎么用 更靠执行层;如果你关心的是“默认主力模型怎么选”,则还要连着看 全球 AI 模型雷达。
什么时候先别上生产
Google 官方安全文档几乎把高风险边界写透了。只要涉及下面这些事,先别让它自动完成最后一步:
- 接受 ToS、隐私条款、Cookie banner 或 EULA
- 发消息、发邮件、发帖、下单、付款
- 点击最终的
Send、Submit、Confirm Purchase - 解决 CAPTCHA
- 生产环境删改数据、权限变更、发布上线
官方最佳实践明确要求:当安全响应提示 require_confirmation 时,要让用户确认;而且即便没有自动触发,也应该在系统指令里手动定义“哪些动作必须停下来等人确认”。
安全能力为什么比“会不会点按钮”更关键
很多对 computer use 的热点解读只会盯着演示,但官方文档真正有价值的是安全层:
- 内建安全类别,自动判断是否需要用户确认
- 可选的 prompt injection detection,会扫描截图像素里的隐藏对抗指令
- 建议实现 allowlist / blocklist
- 建议记录 prompts、screenshots、model actions、最终执行动作
Google 在独立 computer use 文档里还强调,它支持:
- browser
- mobile
- desktop
这很强,但也意味着一旦没做边界控制,它可以在更多环境里出错。所以真正成熟的用法不是“把 agent 放出去”,而是“给 agent 明确边界,再让它跑”。
成本怎么估,不要只看模型单价
Google 官方定价页在 2026-07-06 列出的 gemini-3.5-flash 标准价格是:
Standard:输入$1.50 / 1M tokens,输出$9.00 / 1M tokensBatch:输入$0.75 / 1M tokens,输出$4.50 / 1M tokensFlex:输入$0.75 / 1M tokens,输出$4.50 / 1M tokensPriority:输入$2.70 / 1M tokens,输出$16.20 / 1M tokens
这还只是模型 token 账单。你如果同时打开了:
- Search grounding
- 截图回传
- 多轮 agent loop
- 更高 thinking level
真实完成成本通常会比单轮聊天高很多。
对站长和工具团队来说,更靠谱的估算方法是:
- 记每个任务平均跑几轮
- 记截图和页面状态回传频率
- 记人工接管率
- 看最后“完成一个任务”的成本,而不是“一次调用”的成本
最稳的上线姿势是什么
更建议直接照官方安全思路来做:
- 先做低风险任务:例如导航、读页面、准备草稿、收集结果。
- 强制确认最后一步:所有发送、提交、支付、删除都停下来等人。
- 打开 prompt injection 检测:尤其是要浏览外部页面时。
- 做环境白名单:只允许访问你批准的站点。
- 记录日志:至少记录 prompt、截图、模型建议动作、最终执行动作。
如果你已经在看 Gemini 3.5 Flash 的 agent coding 路线,会发现它和 computer use 的关系很直接:一个解决“怎么想和怎么调工具”,另一个解决“怎么在真实界面里做动作”。
中国用户和中国团队要额外看什么
1. 不要把它当“零运维网页脚本”
你还是得准备:
- 可控浏览器或桌面环境
- 截图回传逻辑
- 系统提示词里的安全边界
- 失败重试和人工接管机制
2. 海外生态接入条件仍然存在
Gemini API、Google 开发文档和相关工具链本身就是海外生态的一部分。中国团队在正式放入业务流之前,要先确认访问、采购、账号和合规边界,而不是只看 demo。
3. 更适合“内控清晰的低风险自动化”
它很适合先做:
- SEO 巡检
- 页面 QA
- 站内内容录入前半段
- 竞争对手公开页采集
不适合一开始就做:
- 自动发帖
- 自动发信
- 自动修改线上核心配置
质量门槛判断:什么时候它算真的可用
如果你跑完一组真实任务后,同时满足下面三条,才算值得继续扩大范围:
- 人工接管率下降了
- 任务完成时间下降了
- 没有出现越权、误点或不可回滚操作
如果只是一两次 demo 很顺,不代表它已经可用于生产。
常见问题
Gemini 3.5 Flash 的 computer use 现在到底支不支持?
按当前多份官方页面交叉看,支持。2026-06-24 官方博客和 computer use 独立文档都明确支持,2026-07-06 的 3.5 Flash 更新页正文和迁移清单也写着支持。FAQ 那条“不支持”更像旧文案残留,这是我基于官方多页内容做的推断。
它适合直接做付款、发消息、发版吗?
不适合。Google 官方最佳实践明确建议这些最终且不可逆动作要有人类确认。
它最适合先用在哪类团队里?
适合已经有浏览器自动化、内部工具自动化、QA 或后台流程自动化基础的团队。因为你们更容易补上白名单、日志、确认点和回滚机制。
这篇文章的首图来源是什么?
首图为本站自制信息图,文件位于 /article-images/gemini-3-5-flash-computer-use-guide-2026-07-19.svg。图中的 browser / mobile / desktop 环境、确认点、注入检测和官方价格,依据 Google 2026-06-24 公告、computer use 文档和 2026-07-06 官方定价页整理,没有使用第三方受限版权图片。