推理硬件革命:下一个「装进内存」时刻
高性能、低能耗的专用推理硬件是让Agent系统触达更多人的关键,能带来50倍延迟改善和30–80倍能效提升。
延迟改善
50倍
专用推理硬件 vs 通用GPU/CPU
能效提升
30–80倍
对比TPU同时代CPU/GPU
Jeff Dean在YC访谈中提出 · 专用推理硬件是Agent普及的基石
TPU起源:从餐巾纸数学到芯片基础
如果每个用户每天对着手机说三分钟话,用CPU根本撑不住,于是我们造出了TPU。
— Jeff Dean · Google首席科学家
TPU性能对比
能效30–80倍 · 延迟20–30倍
2013年语音识别驱动
通用计算
CPU/GPU可运行各种任务,但效率低
专用计算
TPU针对线性代数优化,效率极高,恰好适合Transformer
AI时代的延迟数字与能耗本质
1
:
1000
计算能耗 vs 数据搬运能耗
这一千倍差距决定了必须做batching,用batch size分摊成本,本质上是数据I/O问题而非模型问题。
上下文工程:下一个前沿
模型只是系统的一部分,真正重要的是构建能检索、调用工具、记忆上下文的完整系统,即上下文工程。
上下文工程的美妙之处在于,这些信息对模型来说是极其清晰的,远比训练数据中模糊的几万亿token要明确得多。
— Jeff Dean · Google首席科学家
训练数据
几万亿token混在一起,融成参数浓汤
上下文
明确、直接的信息,模型易于理解
创业公司生存指南:选0%领域
拿当前最强通用模型测试目标领域:成功率0%或1%是好信号,20%是危险信号,因为能力已萌芽,下一代模型很快覆盖。
0–1%
安全值
Jeff Dean建议创业公司选择
20%
危险值
说明能力已萌芽,即将被通用模型覆盖
通用模型的能力确实在越来越广的范围内变强,所以你必须想清楚你现在做的东西是能长期成立的,还是说前沿模型在未来6个月或12个月内就会做得比你好。
— Jeff Dean · Google首席科学家
当Agent写完所有代码,稀缺技能是品味
在Agent编程时代,稀缺技能是知道该让Agent去解决什么问题的品味,它来自经验、未来清单和疯狂思想实验。
经验
解决大量问题,积累直觉
未来清单
写下12个月内可能重要的十件事,一年后复盘
疯狂思想实验
挑战假设,如「如果晶体管每天出错20次怎么办」
如果你选对了问题并且成功解决了它,那远比你把一个无聊的问题执行得漂漂亮亮要好得多。
— Jeff Dean · Google首席科学家
用AI构建更好的AI:自动实验循环
2027年预测:机器学习系统将实现全自动的问题分解和自动实验循环,不限于ML,适用于任何有可衡量目标的领域。
加速比
30万倍
神经近似器比原模拟器快30万倍且精度几乎一样
本质上,你要优化的是每单位计算输入的发现数量。
— Jeff Dean · Google首席科学家