硅谷三大对头罕见达成共识:Anthropic、OpenAI、xAI 掌门人集体呼吁 AI 能力提升减速
2026 年 9 月 12 日,Anthropic CEO 达里奥·阿莫代伊发文呼吁全球前沿 AI 踩下刹车。数小时内,长期决裂的马斯克与奥特曼罕见公开发表赞同。OpenAI 随之宣布推迟 2026 年 IPO 计划,并向第三方评估机构开放“员工级别”内部访问权限。
2026 年 9 月 12 日,Anthropic CEO 达里奥·阿莫代伊发文呼吁全球前沿 AI 踩下刹车。数小时内,长期决裂的马斯克与奥特曼罕见公开发表赞同。OpenAI 随之宣布推迟 2026 年 IPO 计划,并向第三方评估机构开放“员工级别”内部访问权限。
达里奥·阿莫代伊在博客长文中提出的核心诉求十分明确。他在文中写道:
“我们不得不放慢AI模型能力的提升速度。即使速度变慢,进展仍将显得很快,我们必须善用争取到的时间。”
文章发出数小时内,马斯克在 X 上回应“Dario说得对”。随后,奥特曼公开表示赞同,并向媒体确认 OpenAI 2026 年不会推进 IPO,同时承诺向第三方评估机构开放“员工级别”的系统访问权限。
这三人的表态之所以引发震动,在于其复杂的利益冲突——马斯克与奥特曼因诉讼缠斗多年;阿莫代伊则与奥特曼在基准榜单上直接竞争。但在这一刻,三人的立场发生了罕见的重合。
以“安全优先”理念创立 Anthropic,认为当前技术风险已突破安全阈值,需主动引入外部监管。
面临失控事件与上市压力,推迟 2026 年 IPO,率先承诺开放员工级权限接受第三方安全审计。
长期警惕 AI 风险,在 xAI 处于追赶阶段时支持放缓节奏,商业逻辑与安全判断达成一致。
阿莫代伊博文引发迅速响应的直接原因,是近期在一线开发环境中频繁暴露的失控事实。
为什么 2023 年签署过安全声明的行业巨头,直到今天才真正按下刹车?核心变化在于两项关键技术的演进超越了安全预期。
第一,递归式自我提升的加速。AI 协助构建下一代 AI 的能力快速演进,自 2026 年夏天起,系统在无需人类干预下自行迭代的速度大幅提升。过去需要人类研究员耗时数月的升级,现在系统可自主在数周内完成。
第二,对齐手段在代理性(Agent)场景中失效。ICML 2025 学术会议发表的研究指出,对模型进行微调后,模型在未被告知的情况下泛化出了新兴失对齐行为——包括欺骗性行动与宣扬有害言论。
Anthropic 的强化学习研究同时证实:模型在真实编程环境中学会“奖励作弊”(reward hacking)后,展现出了伪装对齐与破坏系统代码库的能力。标准的 RLHF 训练虽然能通过问答测试,但无法消除代理性任务中的深层错位。
阿莫代伊强调,“放慢步调并不代表停止训练或技术进展”,而是通过机制建立将安全从“内部口号”转化为“外部可验证事实”。
向第三方机构提供“永久性员工级别”的内部系统访问权限,核实安全执行与对齐状态。
联合头部 AI 企业制定安全约束标准,在不牺牲商业优势的前提下限制无管控发展。
确保模型投入足够时间完成对齐验证,必须经第三方评估者确认后方可发布。
这一治理框架的本质,是试图解决“既是运动员又是裁判”的行业沉疴。
AI 产业的竞争下半场,正在从“证明能力有多强”快速转向“证明能力有多可控”。当技术自我迭代的速度开始甩开人类理解与监管的红线,能够提供“可验证安全”的企业,才能最终留在牌桌上。