🧬 模型 · 路线对决

智谱 GLM-5.3 八项赢七项,市场却用脚投票:自进化路线之争进入深水区

8月14日,智谱发布GLM-5.3,在编程、终端操作、Agent、网络安全等八项核心基准中七项超越DeepSeek V4 Pro,但当日股价却高开低走,收盘跌3.57%,日内回撤超11%。同一基座、不同后训练路线的两款模型,正在将国产大模型的竞争从“参数比拼”推向“方法论对撞”。

综合公开信息整理 2026-08-16 全文约 4 分钟读完
#智谱GLM-5.3 #DeepSeek V4 Pro #自进化 #AI Agent #后训练
7 / 8 项胜出 GLM-5.3 vs DeepSeek V4 Pro 核心基准
28.3 Terminal Bench 3.0 得分 · 开源第一
84.5% CyberGym 网络安全全球第一

⚡ 30 秒速览

  • 核心事实:GLM-5.3 与 5.2 共用 7430 亿参数基座,所有提升来自后训练;DeepSeek V4 Pro 也基于同一 1.6T 基座,能力跃迁同样来自后训练。
  • 关键差异:智谱未涨价,DeepSeek 却大幅上调 API 价格(峰谷计费,涨幅 50%–1100%),标志“价格屠夫”时代结束。
  • 自进化分岔:智谱走“模型自己变聪明”——训练阶段闭环进化;DeepSeek 走“插件化生态”——推理阶段工具重组。两条路线,两种 AGI 信仰。
  • 市场信号:GLM-5.3 发布当天股价跌 3.57%,说明投资者不再只看性能,而是更关注哪条路线能跑到 AGI 终点。
  • 体验入口:智谱 GLM-5.3 已开放 API 调用,DeepSeek V4 Pro 正式版及 DSH 框架已开源。

01八项核心基准 GLM-5.3 对 DeepSeek V4 Pro 形成“精准狙击”

在智谱官方公布的性能对比图中,GLM-5.3 在编程、终端操作、Agent 任务、网络安全等八个维度中,七项领先 DeepSeek V4 Pro 正式版。其中,在网络安全基准 CyberGym 上以 84.5% 登顶全球,压过 Anthropic 与 OpenAI 的旗舰模型。

🏆 GLM-5.3智谱
84.5%
Claude Mythos 5Anthropic
83.8%
GPT-5.6 SolOpenAI
83.6%
DeepSeek V4 ProDeepSeek
79.1%

注:柱形自 75 分起缩放,非零起点;分差以标注分数为准。CyberGym 测试要求模型从白盒源码出发识别并验证漏洞,全程自动化评判。

但更值得关注的是,GLM-5.3 并非“新”模型——它和 GLM-5.2 使用同一个 7430 亿参数基座,所有提升全部来自后训练。这和 DeepSeek V4 Pro 从预览版到正式版的逻辑完全一致:基座不变,能力跃迁靠的是训练方法论的升级。

02自进化分岔:两条路,两种 AGI 信仰

智谱 vs DeepSeek,本质上是“模型自己变聪明”与“模型的身体可以无限重组”的对撞。

智谱 · 唐杰路线

追求“生物学意义上的进化”——基因在迭代中变得更聪明。通过自动环境合成流水线,让模型在训练阶段自我出题、自我判卷,规模扩大数倍。

DeepSeek · 梁文锋+崔添翼路线

追求“工具意义上的进化”——人本身没变,但工具重组让能力指数级扩张。DSH 框架提出“一切皆插件”,模型在推理阶段可热插拔工具。

3自进化关卡
(记忆 → 自治 → 自进化)
5DSH 核心原则
(一切皆插件)
88页论文
(时空可组合性)
10万+GitHub Stars
(DSH 框架)

左:唐杰在内部信《巨浪已来》中将 AGI 突破拆解为三座大山;右:DSH 框架基于 Cordis 微内核,支持运行时热插拔,可逆效应确保无副作用。

智谱的方法是“自己出真题自己做”。GLM-5.3 引入了一套全自动的环境生成流水线:一个“AI 研究员”去真实场景中抄题目,一个“AI 判卷员”不看答案只盯解题轨迹,确保每道题都能解、过程干净。这套机制让训练环境规模扩大了数倍,也使长程编码任务训练速度提升了 2.3 倍

DeepSeek 则把进化场所从模型内部搬到了模型外部。DSH 框架的核心理念是“一切皆插件”——模型接入、工具注册表、沙箱、存储,甚至驱动 Agent 的主循环,全部是可拔插的积木。底层 Cordis 微内核的“可逆效应”确保插件卸载时不留垃圾,Agent 可以在运行过程中随时更换工具,相当于“热插拔”一把螺丝刀。

一个诚实的注脚:两条路线都还在早期。智谱的自进化目前只覆盖了训练阶段,推理时模型仍是被动的;DeepSeek 的插件化生态虽然灵活,但模型本身的能力并未随着工具重组而提升。谁能先跑通闭环,谁就能定义下一阶段的 AGI 范式。

03它到底能做什么?两个意外收获

🛡️ 网络安全:从“找漏洞”到“形成攻击链”全球第一 84.5%

  • 初衷只是让模型找漏洞、分析漏洞,但训练规模上去后,事态失控了。
  • 官方博客写道:“我们本来以为它只是更会找单个漏洞,但出乎意料的是,它开始跨越漏洞利用的多个阶段,形成完整的攻击链计划。”
  • 在 CyberGym 测试中,GLM-5.3 从白盒源码出发,自主完成识别、验证、利用,84.5% 的得分压过 Anthropic 和 OpenAI 的旗舰。
自进化的魅力:开发者设定的目标被模型自己“超纲”了

⚙️ 终端操作:从 4.6 到 28.3 的暴涨开源第一

  • Terminal Bench 3.0 是 Agent 领域影响力最大的基准之一,GLM-5.2 得分仅 4.6。
  • 5.3 通过自主环境合成与 slime 训练框架的系统级优化,得分暴涨至 28.3,拿下开源模型第一。
  • DeepSWE v1.1 从 46.2 涨到 66.9,Agents' Last Exam 从 23.8 涨到 28.5,AutomationBench 从 26.2 涨到 48.2。
训练框架 slime 的改造是关键:练习与考试环境的一致性从 99.99% 提升到近乎无损,误差从千万分之一量级归零。

04为什么市场不买账?

GLM-5.3 成绩单亮眼,但股价却跌了 3.57%,从日内高点回撤超 11%。这不是第一次——4 月 DeepSeek V4 预览版发布当天,智谱暴跌逾 9%,一度跌破千元大关。

市场的逻辑已经变了。投资者不再只看模型性能本身,而是更关注哪条路线更可能跑到 AGI 终点。GLM-5.3 虽然八项赢七项,但这是“符合预期”的后训练迭代,没有超出基座不变的框架。而 DeepSeek V4 Pro + DSH 的组合,或许才是长期变量。

另一个信号是涨价。从 8 月 17 日起,DeepSeek 全面引入峰谷分时定价,涨幅 50% 至 1100%。这个以“价格屠夫”闻名的公司,也不再坚持低价策略。智谱同样在连续涨价——一季度累计涨幅约 83%。全行业都在涨价,意味着用补贴换市场份额的阶段正式落幕了

价值定价成本加成定价技术溢价自我造血

涨价不是算力贵了,是公司长大了。AGI 研发是个无底洞,唐杰的“摸高计划”要投入百亿级做可解释性、建合成数据工厂;梁文锋要养 DSH 的开源生态。不能一直靠融资,终究得自己造血。

编辑核心判断

自进化路线的竞争,正在从“谁更聪明”转向“谁更能让聪明本身发生”。唐杰赌的是训练阶段闭环,梁文锋赌的是推理阶段生态。两条路线都还没跑通,但资本市场已经用脚投票:它更相信工具的指数级扩展,而不是模型的自我迭代。

现在就能用

GLM-5.3 已开放 API 调用,DeepSeek V4 Pro 正式版及 DSH 框架均已开源。

智谱开放平台 → 控制台 DeepSeek → 开发者文档