📱 智能终端 · 产品发布

谷歌Pixel 11发布:Gemini跨越40+应用接管系统工作流,AI手机进入"Agent时代"

8月12日,谷歌正式发布Pixel 11系列。新机搭载Tensor G6芯片,端侧性能提升3.5倍、能耗降低3.5倍,但真正改变游戏规则的,是Gemini从"功能助手"升级为系统级Agent——它能跨越40多个应用执行多步骤任务,并主动理解邮件、日历与航班信息,在用户说出目标之前预判需求。

综合公开信息 2025-08-12 全文约 4 分钟读完
#谷歌Pixel 11 #Gemini Agent #Tensor G6 #AI手机 #系统级AI
40+ 跨应用多步骤任务执行
3.5× 端侧处理速度提升
3.5× 能耗降低 · Tensor G6

⚡ 30 秒速览

  • 核心升级:Gemini 从"被动应答"变为系统级 Agent,可跨越 40+ 应用理解上下文、拆解目标、执行多步任务,用户只需说出"做什么"。
  • 硬件底座:Tensor G6 芯片端侧算力提升 3.5 倍,能耗同步降低 3.5 倍,让高频 AI 任务在本地流畅运行,不依赖云端。
  • 模型战略转向:发布次日即推 Gemini 3.7 Flash,API 价格降至前代一半。Flash 路线正成为手机 AI 规模化的经济前提。
  • 行业连锁反应:DeepMind 被曝重组,可能裁员 1/3;多位核心 AI 人才出走。谷歌旗舰模型延期,但 Flash 迭代加速。
  • 两条路线并行:Pixel 走"系统级 AI 融入工作流"路线,豆包手机走"Agent 像用户一样操作 App"路线——殊途同归,都指向"一句话搞定一切"。

01Gemini 进化:从功能助手到系统级 Agent

过去几年,手机里的 AI 大多藏在相机或备忘录里——帮你修一张照片、写一段文字、回答一个问题。它始终是一个"功能",而不是"系统的一部分"。

Pixel 11 改变了这件事。

谷歌让 Gemini 成为 Android 的智能层:它不再等待被调用,而是主动感知用户正在做什么,并协调不同应用完成任务。用户只需说出目标,剩下的事情——理解需求、调用工具、协调流程、确认交付——全部由 Agent 完成。

传统 AI 手机

AI 是独立功能入口,藏在相机、备忘录或语音助手里。用户需主动打开、手动操作,AI 只做单点任务。

Pixel 11 · 系统级 AI

Gemini 融入系统工作流,跨 40+ 应用理解上下文,自动拆解目标、调用工具、执行多步任务,用户只需确认。

跨应用能力覆盖 Gmail、Calendar、Google Maps、Notes 等 40+ 原生及第三方应用,支持邮件内容提取、日程冲突检测、航班信息联动等复合场景。

最值得关注的是它的上下文理解能力:Gemini 可以同时读取邮件中的确认函、日历上的会议时间、航班 App 里的行程信息,然后自动判断"用户是否需要提前出发",而不是等用户问"我几点该出发"。

一个诚实的注脚:跨应用能力目前仍以 Google 自身服务为主,第三方应用的支持深度取决于 API 开放程度。这不是谷歌一家能解决的问题。

02Tensor G6:端侧 AI 的算力底座

系统级 Agent 对算力的消耗是巨大的。如果每次交互都要上云,延迟、成本和隐私都无法支撑高频使用场景。Pixel 11 给出的答案是:把尽可能多的推理留在本地

3.5×端侧处理速度提升
3.5×能耗降低
40+跨应用协同
4机型:11/Pro/XL/Fold

Tensor G6 搭载最新版 Gemini Nano,负责端侧推理;复杂任务仍调用云端 Gemini,但通过本地预处理大幅降低云端调用频率与数据量。

Tensor G6 并非追求"把完整大模型塞进手机",而是通过端云协同找到平衡:Gemini Nano 处理高频、低延迟的本地任务(如语音输入过滤、实时拍摄分析),更复杂的推理则交给云端。这种架构下,用户获得的体验是——AI 响应几乎无感,且不需要时刻联网。

Pixel 11 的背部设计延续了横向摄像头模组,镜头排列更简洁,机身可以平稳放在桌面上。但相比外观,真正重要的是:AI 不再是一个需要"打开"的功能,而是手机本身的工作方式。

03Flash 路线:为什么对手机更重要

Pixel 11 发布仅一天后,谷歌又推出了 Gemini 3.7 Flash——强化了多步骤规划与工具调用能力,限时 API 价格降至前代的一半。

这不是巧合,而是战略重心的转移。

与此同时,DeepMind 被曝正在重组,可能裁员 1/3 甚至更高;Noam Shazeer、John Jumper、Jeff Dean、Quoc Le 等多位核心 AI 人才相继离开。旗舰模型一再延期,但 Flash 模型从 3.5、3.6 到 3.7 快速迭代。

旗舰模型路线

追求参数最大、能力最强,但成本高、推理慢、部署周期长。适合云端深度分析,不适合手机高频实时交互。

Flash 模型路线

追求性价比与响应速度,成本低、推理快、可大规模部署。手机 AI 需要的是"够聪明且足够快",而非"最强但最慢"。

对于手机而言,Flash 路线可能比旗舰模型更有现实意义。手机里的 AI 要随时理解用户需求、调用工具、跨应用执行任务,这意味着模型不仅要足够聪明,还必须足够快、足够便宜,并且能够稳定地完成大量高频操作。

从经济角度看,Flash 模型是 AI 硬件规模化落地的数学前提。如果每次交互的推理成本降不下来,AI 手机就永远停留在"演示级"体验。

04它到底能做什么?三个核心功能场景

🗺️ 跨应用任务:"说目标,剩下的交给 AI"系统级 Agent

  • 用户说"这周末想去青岛玩两天 solo trip",Gemini 自动检索交通、住宿、景点实时数据。
  • 结合 Gmail 中的历史行程确认函、日历中的空闲时间、航班 App 的实时价格,生成完整行程与预算清单。
  • 多步之间存在依赖——先查天气再定出行方式,先定住宿再规划路线——Agent 自主拆解,一次性跑通。
核心价值:用户从"操作者"变为"确认者",AI 接管所有中间步骤。

🎤 Rambler:像聊天一样输入,像编辑一样输出端侧 AI

  • 用户用自然口语输入,Gemini 自动过滤"嗯""那个""就是说"等停顿与重复,整理成结构清晰的文字。
  • 支持会议记录、语音笔记、长文口述等场景,端侧处理,无需联网,响应无延迟。
  • 不只是"语音转文字",而是"口语转书面语"——保留原意,去掉冗余。
核心价值:让语音输入真正可用,大幅降低文字创作的门槛。

📷 Magic Capture:AI 帮你挑最好的那一瞬间计算摄影

  • 拍摄过程中,AI 实时分析多帧画面,自动识别表情、动作、构图质量。
  • 在连拍序列中选出最理想的瞬间,减少用户拍摄后筛选、编辑的步骤。
  • 结合 Tensor G6 端侧算力,分析过程在本地完成,不依赖云端。
核心价值:AI 介入创作流程,但保留用户的最终选择权。

05AI 手机的两种想象:Pixel 路线 vs 豆包路线

Pixel 11 展示了一条清晰的路径:让 AI 深入操作系统内部,成为系统级的智能层。但这不是唯一的答案。

另一条路,是豆包手机正在探索的方向。

豆包手机一代的思路是让 AI 像用户一样操作手机——理解屏幕界面、点击按钮、填写表单,模拟人的操作路径。而据公开信息,豆包二代开始尝试更底层的连接方式:通过 MCP(模型上下文协议)和 A2A(智能体协作)让应用主动向 AI 开放能力,而非让 AI 去模拟点击。

Pixel 路线 · 系统级融入

AI 嵌入操作系统,调用系统能力与 Google 服务,理解上下文、协调应用。优势是底层权限深,劣势是依赖自有生态。

豆包路线 · Agent 操作

AI 像用户一样操作 App 界面,或通过标准化协议直接调用应用能力。优势是跨平台通用,劣势是权限与商业边界受限。

两种路线背后,对应着同一个核心问题:AI 如何与互联网服务建立连接?

手机系统掌握的是设备能力,而互联网服务掌握在一个个独立 App 手中。是否开放能力、开放哪些能力,最终取决于应用自身的商业决策。这不是技术问题,而是生态问题。

无论哪种路线,最终目标一致:用户只需说出目标,AI 在手机里直接解决。但"直接解决"的背后,是互联网服务分发逻辑的深层重构。

编辑核心判断

AI 手机越智能,移动互联网的旧秩序越被动。

Pixel 11 展示了 AI 进入系统工作流的能力,但谷歌同时面临 DeepMind 重组、人才流失与旗舰模型延期的压力。真正的挑战不在技术端——AI 完全替代用户操作的那一天,就是过去二十年围绕 App 建立起来的商业生态开始重构的那一天。下一代 AI 手机需要回答的问题不是"模型有多强",而是"当 AI 替用户完成所有操作,平台的商业价值从何而来"。这不是产品问题,是底座问题。

现在就能用

Pixel 11 系列已在 Google Store 上架,搭载 Android 最新系统,Gemini 系统级 Agent 随新机全面开放。现有 Pixel 用户将在后续系统更新中获得部分 Agent 能力。

Google Store 查看详情