Computer Use 不再独立:Gemini 3.5 Flash 原生集成,跨平台企业自动化进入新阶段
6 月 24 日,Google DeepMind 宣布将 Computer Use 功能直接内置到 Gemini 3.5 Flash 主模型中。开发者不再需要单独调用独立模型,通过单一 API 即可构建能跨浏览器、移动端和桌面端环境执行操作的智能 Agent。这是 Computer Use 首次以原生内置工具形态出现在 Gemini 主模型中。
6 月 24 日,Google DeepMind 宣布将 Computer Use 功能直接内置到 Gemini 3.5 Flash 主模型中。开发者不再需要单独调用独立模型,通过单一 API 即可构建能跨浏览器、移动端和桌面端环境执行操作的智能 Agent。这是 Computer Use 首次以原生内置工具形态出现在 Gemini 主模型中。
Computer Use 此前以独立模型形式存在于 Gemini 2.5 中,开发者需要单独部署、额外调用。现在它被直接集成到 Gemini 3.5 Flash 主模型,与搜索、地图等工具并列,成为模型的原生能力之一。
需单独部署 Computer Use 模型,额外调用接口,与主模型分离,集成成本高。
Computer Use 直接嵌入主模型,单一 API 即可调用,与函数调用、搜索等工具无缝协同。
注:能力维度基于官方发布信息整理。跨平台支持范围指 Agent 可执行操作的环境类型,实际表现取决于具体任务复杂度与安全策略配置。
Gemini 本身已在函数调用和搜索、地图等内置工具上表现出色。Computer Use 的加入,补齐了 "看到界面、理解界面、操作界面" 的关键一环,使 Agent 从"只读"进化为"可读写执行"。
让 Agent 直接操作公开环境,安全是不可绕过的关卡。Google DeepMind 为 Computer Use 设计了一套分层防御体系。
针对 Computer Use 场景进行专门的对抗训练,提升模型对 prompt injection 等攻击的抵抗力。
对敏感或不可逆操作要求显式人工确认,防止误操作造成损失。
自动识别并拦截间接 prompt injection 攻击,在任务执行过程中实时阻断。
建议开发者结合安全沙箱、人工验证和严格访问控制,构建完整防护链。
注:安全机制的有效性取决于具体部署环境与实际使用方式。企业级防护功能为可选开启,需在 Gemini Enterprise Agent Platform 中配置。
Google 官方透露,企业客户已开始在真实环境中使用 Computer Use 驱动价值。以下两个方向是发布中明确提及的核心用例。
注:以上用例基于 Google 官方发布中提到的"continuous software testing"和"knowledge work across professional applications"方向构建,非具体客户案例。
Computer Use 从独立模型走向原生集成,表面上是产品形态的变化,背后是 Agent 能力"基础设施化"的关键一步。
当操控计算机的能力不再需要单独部署、单独调用、单独维护,企业自动化的门槛就从 "会不会集成" 降到了 "要不要用"。这与搜索、地图等工具被内置到模型中的逻辑一脉相承——工具越底层,使用越广泛。
但一个诚实的注脚:
安全风险依然存在。公开网络环境下的 prompt injection、误操作、权限滥用,都不是模型本身能解决的。Google 的"纵深防御"思路是当前最务实的方案,但真正的考验不在实验室,而在生产环境——当 Agent 每天执行数万次操作时,边界情况总会找到你的漏洞。
Computer Use 内置进主模型,降低了企业构建 Agent 的门槛——从"需要独立部署一个模型"到"一个 API 搞定",跨度不可谓不大。但安全风险依然存在:公开网络环境下的 prompt injection、误操作、权限滥用,都不是模型本身能解决的。Google 的"纵深防御"思路是对的,但真正的考验不在实验室,在生产环境。
Computer Use 已通过 Gemini API 和 Gemini Enterprise Agent Platform 开放,开发者可立即开始构建。
Google DeepMind → 开始构建也可在 Browserbase 托管的演示环境中直接体验。