🤖 模型 · 技术发布

Computer Use 不再独立:Gemini 3.5 Flash 原生集成,跨平台企业自动化进入新阶段

6 月 24 日,Google DeepMind 宣布将 Computer Use 功能直接内置到 Gemini 3.5 Flash 主模型中。开发者不再需要单独调用独立模型,通过单一 API 即可构建能跨浏览器、移动端和桌面端环境执行操作的智能 Agent。这是 Computer Use 首次以原生内置工具形态出现在 Gemini 主模型中。

综合公开信息整理 2026-06-24 全文约 3 分钟读完
#Gemini #Computer Use #AI Agent #企业自动化
3 跨平台支持:浏览器 / 移动端 / 桌面端
2 企业级安全防护:对抗训练 + 人工确认
1 原生 API 集成,无需独立模型

⚡ 30 秒速览

  • 不再需要独立模型:Computer Use 从 Gemini 2.5 独立模型升级为 3.5 Flash 内置工具,一个 API 即可调用。
  • 跨平台操控:浏览器、移动端、桌面端全覆盖,适合长周期任务与企业自动化场景。
  • 企业安全体系:针对性对抗训练 + 双重可选防护机制(人工确认 + 注入检测),纵深防御。
  • 已开放使用:通过 Gemini API 和 Gemini Enterprise Agent Platform 即可开始构建。

01能力解析 从独立模型到原生内置

Computer Use 此前以独立模型形式存在于 Gemini 2.5 中,开发者需要单独部署、额外调用。现在它被直接集成到 Gemini 3.5 Flash 主模型,与搜索、地图等工具并列,成为模型的原生能力之一。

之前:独立模型(Gemini 2.5)

需单独部署 Computer Use 模型,额外调用接口,与主模型分离,集成成本高。

现在:原生内置(Gemini 3.5 Flash)

Computer Use 直接嵌入主模型,单一 API 即可调用,与函数调用、搜索等工具无缝协同。

🌐 浏览器操控
📱 移动端操作
💻 桌面端自动化
🔗 API 原生集成

注:能力维度基于官方发布信息整理。跨平台支持范围指 Agent 可执行操作的环境类型,实际表现取决于具体任务复杂度与安全策略配置。

Gemini 本身已在函数调用和搜索、地图等内置工具上表现出色。Computer Use 的加入,补齐了 "看到界面、理解界面、操作界面" 的关键一环,使 Agent 从"只读"进化为"可读写执行"。

02安全体系 纵深防御,不回避风险

让 Agent 直接操作公开环境,安全是不可绕过的关卡。Google DeepMind 为 Computer Use 设计了一套分层防御体系。

基础层

针对性对抗训练

针对 Computer Use 场景进行专门的对抗训练,提升模型对 prompt injection 等攻击的抵抗力。

企业可选

敏感操作人工确认

对敏感或不可逆操作要求显式人工确认,防止误操作造成损失。

企业可选

间接注入自动检测

自动识别并拦截间接 prompt injection 攻击,在任务执行过程中实时阻断。

最佳实践

安全沙箱 + 访问控制

建议开发者结合安全沙箱、人工验证和严格访问控制,构建完整防护链。

🛡️ 纵深防御(Defense-in-Depth):Google 强调没有单一方案能解决所有安全问题,鼓励开发者将平台防护与自身安全策略结合,构建多层防线。

注:安全机制的有效性取决于具体部署环境与实际使用方式。企业级防护功能为可选开启,需在 Gemini Enterprise Agent Platform 中配置。

03企业用例 已经在发生的场景

Google 官方透露,企业客户已开始在真实环境中使用 Computer Use 驱动价值。以下两个方向是发布中明确提及的核心用例。

🧪 持续软件测试:跨浏览器兼容性自动化 企业已落地

  • Agent 自动在多个浏览器环境中执行测试用例,识别布局异常、功能失效与性能退化。
  • 发现异常后自主截图、记录日志、生成缺陷报告,并关联对应代码提交。
  • 支持长周期回归测试,7×24 无人值守,测试报告每日自动推送。
场景价值:将软件测试从"人工执行→人工记录"变为"Agent 执行→人工审核",效率提升显著。

📊 跨应用知识工作:多平台数据整合与分析 企业已落地

  • Agent 跨浏览器、桌面应用、企业系统提取数据,无需人工切换上下文。
  • 自动识别数据结构、清洗整合、生成分析报告,支持多种输出格式。
  • 可设定周期性任务:每周一自动汇总多平台数据,生成投研风格报告。
场景价值:知识工作者从"数据搬运工"转变为"分析决策者",重复性高脑力劳动被自动化。

注:以上用例基于 Google 官方发布中提到的"continuous software testing"和"knowledge work across professional applications"方向构建,非具体客户案例。

04深层意义 工具链越短,门槛越低

Computer Use 从独立模型走向原生集成,表面上是产品形态的变化,背后是 Agent 能力"基础设施化"的关键一步。

当操控计算机的能力不再需要单独部署、单独调用、单独维护,企业自动化的门槛就从 "会不会集成" 降到了 "要不要用"。这与搜索、地图等工具被内置到模型中的逻辑一脉相承——工具越底层,使用越广泛。

但一个诚实的注脚:

安全风险依然存在。公开网络环境下的 prompt injection、误操作、权限滥用,都不是模型本身能解决的。Google 的"纵深防御"思路是当前最务实的方案,但真正的考验不在实验室,而在生产环境——当 Agent 每天执行数万次操作时,边界情况总会找到你的漏洞。

编辑核心判断

Computer Use 内置进主模型,降低了企业构建 Agent 的门槛——从"需要独立部署一个模型"到"一个 API 搞定",跨度不可谓不大。但安全风险依然存在:公开网络环境下的 prompt injection、误操作、权限滥用,都不是模型本身能解决的。Google 的"纵深防御"思路是对的,但真正的考验不在实验室,在生产环境。

当调用计算机像调用搜索一样自然,企业自动化的竞争就从"谁能做"变成了"谁先做"。而安全,将是决定速度的天花板。

现在就能用

Computer Use 已通过 Gemini API 和 Gemini Enterprise Agent Platform 开放,开发者可立即开始构建。

Google DeepMind → 开始构建

也可在 Browserbase 托管的演示环境中直接体验。