智谱 GLM-5.3 八项赢七项,市场却用脚投票:自进化路线之争进入深水区
8月14日,智谱发布GLM-5.3,在编程、终端操作、Agent、网络安全等八项核心基准中七项超越DeepSeek V4 Pro,但当日股价却高开低走,收盘跌3.57%,日内回撤超11%。同一基座、不同后训练路线的两款模型,正在将国产大模型的竞争从“参数比拼”推向“方法论对撞”。
8月14日,智谱发布GLM-5.3,在编程、终端操作、Agent、网络安全等八项核心基准中七项超越DeepSeek V4 Pro,但当日股价却高开低走,收盘跌3.57%,日内回撤超11%。同一基座、不同后训练路线的两款模型,正在将国产大模型的竞争从“参数比拼”推向“方法论对撞”。
在智谱官方公布的性能对比图中,GLM-5.3 在编程、终端操作、Agent 任务、网络安全等八个维度中,七项领先 DeepSeek V4 Pro 正式版。其中,在网络安全基准 CyberGym 上以 84.5% 登顶全球,压过 Anthropic 与 OpenAI 的旗舰模型。
注:柱形自 75 分起缩放,非零起点;分差以标注分数为准。CyberGym 测试要求模型从白盒源码出发识别并验证漏洞,全程自动化评判。
但更值得关注的是,GLM-5.3 并非“新”模型——它和 GLM-5.2 使用同一个 7430 亿参数基座,所有提升全部来自后训练。这和 DeepSeek V4 Pro 从预览版到正式版的逻辑完全一致:基座不变,能力跃迁靠的是训练方法论的升级。
智谱 vs DeepSeek,本质上是“模型自己变聪明”与“模型的身体可以无限重组”的对撞。
追求“生物学意义上的进化”——基因在迭代中变得更聪明。通过自动环境合成流水线,让模型在训练阶段自我出题、自我判卷,规模扩大数倍。
追求“工具意义上的进化”——人本身没变,但工具重组让能力指数级扩张。DSH 框架提出“一切皆插件”,模型在推理阶段可热插拔工具。
左:唐杰在内部信《巨浪已来》中将 AGI 突破拆解为三座大山;右:DSH 框架基于 Cordis 微内核,支持运行时热插拔,可逆效应确保无副作用。
智谱的方法是“自己出真题自己做”。GLM-5.3 引入了一套全自动的环境生成流水线:一个“AI 研究员”去真实场景中抄题目,一个“AI 判卷员”不看答案只盯解题轨迹,确保每道题都能解、过程干净。这套机制让训练环境规模扩大了数倍,也使长程编码任务训练速度提升了 2.3 倍。
DeepSeek 则把进化场所从模型内部搬到了模型外部。DSH 框架的核心理念是“一切皆插件”——模型接入、工具注册表、沙箱、存储,甚至驱动 Agent 的主循环,全部是可拔插的积木。底层 Cordis 微内核的“可逆效应”确保插件卸载时不留垃圾,Agent 可以在运行过程中随时更换工具,相当于“热插拔”一把螺丝刀。
一个诚实的注脚:两条路线都还在早期。智谱的自进化目前只覆盖了训练阶段,推理时模型仍是被动的;DeepSeek 的插件化生态虽然灵活,但模型本身的能力并未随着工具重组而提升。谁能先跑通闭环,谁就能定义下一阶段的 AGI 范式。
GLM-5.3 成绩单亮眼,但股价却跌了 3.57%,从日内高点回撤超 11%。这不是第一次——4 月 DeepSeek V4 预览版发布当天,智谱暴跌逾 9%,一度跌破千元大关。
市场的逻辑已经变了。投资者不再只看模型性能本身,而是更关注哪条路线更可能跑到 AGI 终点。GLM-5.3 虽然八项赢七项,但这是“符合预期”的后训练迭代,没有超出基座不变的框架。而 DeepSeek V4 Pro + DSH 的组合,或许才是长期变量。
另一个信号是涨价。从 8 月 17 日起,DeepSeek 全面引入峰谷分时定价,涨幅 50% 至 1100%。这个以“价格屠夫”闻名的公司,也不再坚持低价策略。智谱同样在连续涨价——一季度累计涨幅约 83%。全行业都在涨价,意味着用补贴换市场份额的阶段正式落幕了。
涨价不是算力贵了,是公司长大了。AGI 研发是个无底洞,唐杰的“摸高计划”要投入百亿级做可解释性、建合成数据工厂;梁文锋要养 DSH 的开源生态。不能一直靠融资,终究得自己造血。
自进化路线的竞争,正在从“谁更聪明”转向“谁更能让聪明本身发生”。唐杰赌的是训练阶段闭环,梁文锋赌的是推理阶段生态。两条路线都还没跑通,但资本市场已经用脚投票:它更相信工具的指数级扩展,而不是模型的自我迭代。
GLM-5.3 已开放 API 调用,DeepSeek V4 Pro 正式版及 DSH 框架均已开源。
智谱开放平台 → 控制台 DeepSeek → 开发者文档