🔍 模型路线 · 争议调查

J-Space 造假风波背后,思维链之父 Jason Wei 戳破"小模型+工具"幻想

一个声称能让小模型追平顶级大模型的开源项目,48 小时内从全网狂欢到彻底崩塌。社区复测显示性能不升反降,作者承认数据"夸张"却拿不出原始日志。几乎同一时间,"思维链"(Chain-of-Thought)发明者 Jason Wei 发文,从速度、思维深度、长任务可靠性三个维度,精准戳破了"小模型+万能工具"的幻想。

综合公开信息整理 2026-07-24 全文约 4 分钟读完
#J-Space #Jason Wei #小模型+工具 #Agent 路线之争 #Harness
⏱ 48 小时 从全网狂欢到彻底崩塌
⬇ 性能下降 社区复测:不升反降
2.53× 宣称提速 — 已被证伪

⚡ 30 秒速览

  • J-Space 宣称:用 DeepSeek V4 Flash + 外部 Harness 追平 GLM-5.3,换用 V4 Pro 甚至超越 Claude Fable 5,速度提升 2.53 倍、Token 效率提升 2.21 倍。
  • 社区打假:GitHub 用户 GoForceX 独立复测,加入 J-Space 后基准测试分数不升反降,Token 消耗增加,推理速度更慢。
  • 作者回应:承认数据"确实夸张",却始终拿不出可复现的运行日志,反而开始删除质疑的 issue。
  • Jason Wei 三个软肋:速度差距(多一层控制必然更慢)、思维深度(无法赋予小模型抽象归纳能力)、长任务可靠性(误差累积导致崩溃)。
  • 深层信号:历史一再证明——精巧工程最终会被规模和算力碾压。工具只是放大器,不是发动机。

01发生了什么?J-Space 48 小时从狂欢到崩塌

一个名为 J-Space Cognition Suite 的开源项目在 X 上迅速走红。它声称无需修改模型权重,仅靠 DeepSeek V4 Flash 加其精巧的外部 Harness,就能在 Agent 任务中追平 GLM-5.3;若换成 DeepSeek V4 Pro,甚至能直接超越 Claude Fable 5。同时速度提升 2.53 倍,Token 效率提升 2.21 倍。

如果这是真的,这无疑是 AI 工程史上的奇迹——用几十分之一的成本复刻顶级大模型的效果。

然而,泡沫破裂的速度比想象中更快。

J-Space 宣称

DeepSeek V4 Flash + Harness 追平 GLM-5.3
V4 Pro 超越 Claude Fable 5
速度提升 2.53 倍 · Token 效率提升 2.21 倍

❌ 未通过复测

社区复测结果

基准测试分数不升反降
Token 消耗明显增加
推理速度比原生模型更慢

✅ 可复现的真相

GitHub 用户 GoForceX 严格按照项目说明,使用 Terminal Bench 完成了独立复测。结果与宣传完全相反。当社区进一步要求公开完整原始实验数据时,作者承认数据"确实夸张",却始终拿不出可复现的运行日志,反而开始删除质疑的 issue。

注:加装 J-Space 后,每一轮推理都要多做判断、多走流程,Harness 本质上是在模型外面加了一层控制逻辑,消耗额外计算资源和 Token 预算。宣称"提速 2.53 倍"本身就违背基本工程逻辑。

02Jason Wei 的三个软肋为什么小模型+工具行不通

几乎在同一时间,OpenAI 思维链核心发明者 Jason Wei 在 X 上发布长文,用自己学羽毛球的经历做比:

"在球场上,我就像一个 1B 参数的认知核心。教练教的每个击球动作我都能做,但要在高速回合里把架拍、转体、击球点、随挥这些要点全部串联起来,几乎要耗尽全部精力。这跟那些练了上万次、将动作化为肌肉记忆的专业选手完全不是一个级别。"

他精准点破了"小模型+万能工具"幻想的三个软肋:

速度差距

小模型+工具注定经历"判断→构造→等待→筛选→整合"完整链路。每多一步,延迟增加一截。多步推理任务耗时指数级上升。

— Harness 本身就需要消耗资源
🧠

思维深度

大模型能把海量数据消化成见识和常识。小模型+工具只能翻前三条评论,无法提炼出客观、综合的总体印象。

— 工具无法赋予抽象归纳能力
🔗

长任务可靠性

复杂长周期任务中,每一步微小误差像滚雪球一样越滚越大。小模型元认知弱,层层转接外部工具出错概率更高。

— 复测中"性能小幅下降"即典型表现

说到底,工具只是放大器,不是发动机。在限定 Benchmark、限定提示词、人工筛选样本的条件下,小模型+工具能跑出漂亮的数字,但在真正的开放任务、长任务、模糊约束、多工具协作的真实场景中,内化的本能永远比临场查手册更快、更稳、更准。

03认知转变从工程派到规模派

很有趣的一件事是,Jason Wei 当初也是"大模型规模论"的怀疑者。而今天,他坚定站在"大模型不可替代"这一边。他的认知转变之路,几乎就是过去五年大模型行业发展的缩影。

2021

思维链(Chain-of-Thought)诞生

在 Google Brain 发现:让模型"把思考过程一步步写出来",推理能力大幅提升。此时仍沉迷于用精巧 Prompt 挖掘模型潜能。

2022

涌现能力 — 关键转折点

里程碑论文《Emergent Abilities of Large Language Models》证明:小模型不具备高阶能力(三位数加法、多步推理),参数规模跨过 ~100B 临界点后能力涌现。

2022

思维链只在大模型上有效

论文中一个被忽略的关键结论:在小模型上使用思维链,不仅不会提升性能,反而因引出错误中间推理步骤导致成绩下降。逻辑推理本身,就是规模的产物。

2023-25

OpenAI 前沿推理项目

作为核心成员参与 o1 系列研发,深化了对大模型内生能力的理解。写下:"想让大模型超越人类老师,就必须用强化学习,去逼出它内生的高阶思考能力。"

这两个发现彻底堵死了"小模型靠精巧 Prompt 或 Harness 实现高阶推理"的幻想。逻辑推理本身,就是规模的产物。

04递归永远无法完美模拟注意力Omar Khattab 的数学论证

DSPy 框架作者、MIT 助理教授 Omar Khattab 在 Jason 发推后不久,从学术和系统层面再次佐证了"内化优于外挂"这一核心判断。

他用底层数学逻辑指出了两者的计算差异:

大模型使用 注意力机制,将所有上下文完整保留在显存中,每次以"全知视角"重新审视所有信息。而小模型+工具本质上是一种 压缩与递归——必须把复杂的外部世界塞进工具的输入输出里,在一轮轮强行"信息脱水"和往下传递的过程中,大量高维信息丢失了。

"虽然我们在工程上可以用各种'外挂'来模拟出智能的表象,但在数学层面上,靠一轮轮压缩的'递归',永远无法完美模拟'注意力机制'对全局的掌控力。"

— Omar Khattab, MIT 助理教授, DSPy 框架作者

Omar 团队还在其重磅论文《Machine Studying》中重新定义了什么是 AI 的"专业能力":判断一个系统专不专业,不该看它闭卷考试拿了多少分,要看它用多少推理计算量能换来多高的准确率。新手型 Agent 必须靠疯狂搜索、反复试错,消耗大量 Token 才能勉强答对;而专家型 Agent 搜索次数少、命中率高,在低计算预算下就能有很好的表现。

这一视角将争论从"能不能"拉到了"效率差多少"的层面。

05苦涩的教训历史一再重演:规模最终胜出

这场争论走到最后,终究绕不开 AI 领域那个经典之作——强化学习教父 Rich Sutton 的《苦涩的教训》:

"人类在 AI 领域的所有精巧工程设计,最终都会被绝对的算力和数据规模碾得粉碎。"

从这个视角看,小模型+工具本质上就是一种精巧工程,试图用人类擅长的工程链路去弥补模型本身容量的不足。而大模型则是纯粹规模定律的胜利。

1970s
专家系统盛行,相信把人类知识写成规则就能造出智能,最终走向失败。
1990-2010s
NLP 依赖精心设计的特征工程与统计模型,直到深度学习出现,端到端大规模训练直接重构了整个领域。
2010s末
知识图谱再度兴起,结果预训练大模型证明,从海量数据中自发学到的隐式知识,远比人工构建的结构化知识更强大。
2026
J-Space 造假事件:历史的最新注脚。精巧 Harness 试图绕开规模,但社区复测证明——捷径并不存在。

注:每一次,人们都试图用巧思走捷径;每一次,最终胜出的都是更简单、更吃算力的方法。苦涩的教训一再应验。

但为什么人们还是一次次投入"工程派"的怀抱?因为太贵了。万亿参数模型的训练成本是天文数字,不是每家公司都能承担得起,而且每个日常场景也并不都需要顶级智能。有开发者提出更折中的未来方向:核心认知能力被拆分为多个十亿级的专家模型协同工作,就像混合专家(MoE)架构的延伸——更灵活、可替换、可审计,而不是用一个粗放的 Harness 试图包打天下。

编辑核心判断

J-Space 造假是一次必然的泡沫。它精准击中了行业"既想要高智能、又想要低成本"的集体焦虑,但历史反复证明:在 AI 领域,规模不是万能的,但没有规模是万万不能的。工程优化的价值在于降低部署门槛、提升效率,但它永远无法替代模型内生的高阶认知能力。下一个试图绕过规模的"奇迹",已经在路上了。

相关讨论仍在继续

这场围绕"小模型+工具能否替代大模型"的路线争论,远未结束。X 上 Jason Wei 与 Omar Khattab 的推文下,开发者、学者、创业者正展开激烈辩论。一方坚持"性价比才是王道",另一方坚信"内化能力不可替代"。
你的立场是什么?

讨论仍在进行中