🎙️ AI Coding · 深度对谈

别再所有人平分AI算力:顶级模型给资深工程师才省钱,新人刷题式成长已失效

在 2026 世界人工智能大会期间的一场对谈中,拥有近 20 年企业软件开发经验的滕昱,与曾在 Google 担任软件工程师、后加入月之暗面从事研发的唐飞虎,给出一个罕见一致的判断:AI 正在优先放大资深工程师的经验与判断力,而不是让所有人平均受益。

来源:综合公开信息 2026-07 全文约 5 分钟读完
#AI Coding #Vibe Coding #工程师成长 #Agent #人机协作
70~80% 普通应用需求可由 Vibe Coding 覆盖(滕昱估算)
~90% 次一级模型可解决的日常开发问题
2-3 个/天 资深工程师在 Google 时代的日均 PR 数
50-80 Agent 辅助下的未来管理半径

⚡ 30 秒速览

  • 一个共识:AI 不会让工程师集体失业,但正在淘汰"只写代码"的人——资深经验被放大,新人刷题式成长失效。
  • 一个分歧:滕昱认为模型没有判断力、CS 红利期已结束;唐飞虎认为模型已有判断机制、基础原理仍值得学。
  • 标准迁移:AI Coding 的衡量指标从"消耗多少 Token"转向"完成了什么任务、创造了什么价值"。
  • 企业警示:把 Token 当 KPI 只会催生刷量,正确做法是把最强模型交给最资深的工程师。
  • 给新人:不要和 AI 比拼刷题,先做起来,用真实作品集证明人机协作能力。

01Token 不再是重点 衡量标准正在迁移

滕昱同时使用三个编程模型,采购策略是"买最贵的、直接拉满"。唐飞虎几乎试用所有主流工具,甚至会给模型跑 Benchmark 来用满额度。但两人都不精确统计自己每天消耗多少 Token。

不是不想算,而是算法变了

过去 Vibe Coding 是一轮提问对应一轮回答,Token 消耗容易估算;现在开发者更像是在给 Agent 设定一个目标,让它持续执行、反复调试,可能一个小时之后才需要人类介入。

1 对 1旧模式:一问一答
1 →∞新模式:一个目标持续执行
数小时Agent 自主调试、碰壁、跳出
价值衡量转向任务完成与产出

一个复杂任务背后可能藏着数十次工具调用、代码修改与环境交互——单独统计 Token 数量,已无法代表生产效率。

02"人人都是开发者" 边界依然清晰

不懂代码的人能通过 Vibe Coding 做出产品吗?两人都给出乐观回答,但程度不同。滕昱估计普通应用中 70%-80% 的需求可以通过描述交给 Agent;但涉及新逻辑、新架构、缺乏成熟参考的系统设计时,模型容易陷入重复循环。

唐飞虎更乐观,因为他刚经历了一次"代差级"体验:

🛥️ 48 小时失败,一句话成功 Kimi K3

  • 参加 SIGGRAPH 活动时想做一款 3D 停船游戏,连续折腾 48 小时,船无法正常驾驶,海浪和暴风雨也做不出来
  • 换成最新 Kimi K3 后,一句话就生成了相当像样的版本,他自己甚至玩了很长时间
  • 判断:外界常常低估模型进步速度——几个月前还是专业开发者才能完成的工作,下一代模型可能只需一句指令
但两人同时强调:"能生成代码"不等于"成为专业工程师"。模型无法决定系统为什么存在、应该解决什么现实问题,以及何时应当停止错误路线。

03一个罕见的共识 AI 在放大资深工程师

两人背景迥异,却在一个问题上完全一致:AI 不会让所有工程师失去价值,它正在优先放大资深工程师的经验和判断能力。真正受到冲击的,是过去依靠重复编码积累经验的新人,以及层级复杂、流程沉重的大型软件组织。

⚠️ 受损方

重复编码型新人:基础工作被 AI 接管,陷入"经验真空",刷题式成长失效。

大型软件组织:层级复杂、流程沉重、评估方式粗糙,AI 反而放大内耗。

✅ 受益方

资深工程师:Agent 提供近乎无限的执行能力,经验被成倍放大。

10-20 人精英团队:层级少、目标一致,AI 直接读写项目,大幅扩展沟通带宽。

滕昱补充了一个底层逻辑:代码本身是"把人类需求翻译成计算机语言"的过程,有编译器作为反馈兜底,天然适合 AI 率先进入。北美大厂管理者一两年前就想明白了——AI Coding 一定会发生,只是不确定具体时间。

04模型是发动机 Harness 是机身

在 AI Coding 产品中,模型决定基础能力,Harness 负责提供工具、上下文、执行环境与任务流程。同一个模型放入不同 Harness,实际表现可能天差地别。

唐飞虎的比喻:模型是航空发动机,Harness 是机身骨架——缺一不可。

模型(发动机)Harness(机身骨架)工具 / 上下文 / 执行环境完整任务闭环

新的 Agent 评测已不再单独比较模型,而是比较"模型 + Harness"组合——企业购买的从来不是一组裸参数,而是一整套系统。同一底座模型配不同 Harness,差距可能非常大。

但滕昱提醒:不要过早投入打造"完美 Harness"。模型进化太快,三个月前精心设计的工作流,可能很快被新模型内化。真正该思考的问题是:作为"人类智能体",你与 AI 的差异究竟在哪里?

05AI 有没有判断力 一场没有结论的争论

这是全场最尖锐的分歧。两人态度鲜明,几乎无法调和。

滕昱 · 没有
"模型在训练中无法真正感知痛苦。"
  • 人类自我意识与感知痛苦、认识死亡、理解自身边界有关
  • 模型不会主动承认"这条路线本身是错的,我不该继续"
  • 更关键:模型不能为判断承担后果——S1 故障时,人必须在 5-10 分钟内拍板
唐飞虎 · 已经有
"模型已经具备某种判断机制。"
  • Kimi 训练中,文章质量等主观任务需要模型自评打分
  • 有人分析 Claude Fable 5 思考过程时,发现其呈现类似"嘶吼"的内部状态
  • 亲历 GitHub Token 事件:模型拒绝了"不安全"的操作

🔐 一次意外的"伦理选择" 真实经历

  • 过去让模型帮助上传代码到 GitHub,它通常要求提供个人访问令牌,再执行操作
  • 有一次在交代任务之初就直接把 Token 发给模型——模型反而拒收,认为这种方式不安全
  • 同一个任务、同一个模型,只因对话路径不同,就做出了完全相反的决定
唐飞虎据此认为,人类语料本身就包含情绪、判断与价值观,模型训练后会在某种程度上继承这些结构。但两种观点背后,其实是两个不同的问题:模型能否生成判断,与模型能否为判断负责

06企业最大的误区 把 Token 当 KPI

当 AI Coding 从"鼓励尝鲜"进入"计算 ROI"阶段,早期粗放的管理方式开始反噬。

🚫 Token 排行榜是如何失效的 反面教材

  • 北美大厂曾建立内部 Token 使用排行榜,试图用排名"逼迫"员工使用 AI
  • 结果两极分化:少数员工长期霸榜,更多员工无动于衷
  • Token 被纳入 KPI 后,有员工让 AI 读邮件、写日报、自动生成回复——消耗涨了,生产价值没变
  • 企业随后又开始反向追查 Token 花在了哪里,至今没有收敛方案

滕昱把引入 Agent 比作招聘新员工——需要流程、数据、制度与培训来约束。他还提醒一个生产环境的现实:银行等企业不会允许外部 AI Agent 临时进入生产环境,S1 级故障来了,工程师必须在 5-10 分钟内做决定,哪怕只是先重启系统。AI 生成代码,无法免除人类责任。

07算清一笔账 最好的模型给最资深的人

一个反直觉、但被两人共同验证的结论:把最强模型交给资深工程师,才是 ROI 最高的配置。大公司内部 Token 消耗最高的人,往往也是最资深、最高效的开发者——他们清楚哪些任务值得做、应该怎么拆解、模型在哪个节点需要纠正。

🥇 资深工程师设目标 / 途中纠正 / 判断输出
最高
小型精英团队10-20 人 · 目标一致
普通开发者能完成基础任务,但判断力不足
中等
Token 刷量者消耗高 · 产出低 · 价值为负
最低

条形宽度为定性示意,表示"单位 Token 的生产价值",非实测数据,仅作直观比较。核心差异不在用量,而在"会不会用"。

唐飞虎补充了另一层成本:最困难的任务上,便宜模型往往更贵——更多迭代、更多 Debug、更多人工介入,甚至延误项目。正确做法是按任务选模型,而不是所有人平分算力。

08新人如何跨过经验真空 以及要不要学计算机

最紧迫的问题:过去新人靠写基础代码、修 Bug 积累经验,现在这些活儿正被 AI 接管。怎么办?两人的建议惊人一致:先做起来

🚀

先做起来

设计一个解决真实问题的小程序,比较 AI 生成的代码与自己实现的差异。

⚖️

别算小账

初期不要纠结 Token 成本,先建立与 Agent 协作的直觉和判断力。

🧠

别刷题

不要和 AI 比拼 LeetCode——它见过的题目和代码远超任何个人。"你是人,不是 Agent。"

📚

补人文

理解语言、思想、人和社会。人文知识会在职业关键节点产生长期价值。

面试方式也在变。唐飞虎做面试官时不阻止候选人用 AI,反而设计人机协作任务,故意埋入问题,观察候选人能否发现模型错误、调整方向、完成交付。未来的求职证明,可能不再是刷题记录,而是一套借助 Agent 完成的真实作品集

滕昱 · 观点激进

传统计算机专业的 30 年红利期已结束。北美已出现研究生提前毕业潮。建议把计算机作为第二专业。

AI 最先冲击的恰恰是规则清晰、反馈明确的编码工作。"文科可能更吃香。"

唐飞虎 · 相对保守

仍然建议学计算机。数学逻辑和系统机制仍是判断模型输出的基础。

但课程体系必须改——Vibe Coding 已经新增了"与 AI 沟通"的能力要求。

编辑核心判断

AI Coding 正在把软件工程的价值重心从"写代码"推向"做判断"。模型负责执行,人类负责定义目标、识别错误、承担后果——真正的分界线,不是会不会写代码,而是敢不敢拍板、能不能负责。

从今天开始

打开任意一款 AI 编程工具,设定一个小目标,让 Agent 完成一次完整交付。
不需要等到"准备好"——用起来,就是最快的准备。

开始你的第一个 Agent 项目