J-Space 造假风波背后,思维链之父 Jason Wei 戳破"小模型+工具"幻想
一个声称能让小模型追平顶级大模型的开源项目,48 小时内从全网狂欢到彻底崩塌。社区复测显示性能不升反降,作者承认数据"夸张"却拿不出原始日志。几乎同一时间,"思维链"(Chain-of-Thought)发明者 Jason Wei 发文,从速度、思维深度、长任务可靠性三个维度,精准戳破了"小模型+万能工具"的幻想。
一个声称能让小模型追平顶级大模型的开源项目,48 小时内从全网狂欢到彻底崩塌。社区复测显示性能不升反降,作者承认数据"夸张"却拿不出原始日志。几乎同一时间,"思维链"(Chain-of-Thought)发明者 Jason Wei 发文,从速度、思维深度、长任务可靠性三个维度,精准戳破了"小模型+万能工具"的幻想。
一个名为 J-Space Cognition Suite 的开源项目在 X 上迅速走红。它声称无需修改模型权重,仅靠 DeepSeek V4 Flash 加其精巧的外部 Harness,就能在 Agent 任务中追平 GLM-5.3;若换成 DeepSeek V4 Pro,甚至能直接超越 Claude Fable 5。同时速度提升 2.53 倍,Token 效率提升 2.21 倍。
如果这是真的,这无疑是 AI 工程史上的奇迹——用几十分之一的成本复刻顶级大模型的效果。
然而,泡沫破裂的速度比想象中更快。
DeepSeek V4 Flash + Harness 追平 GLM-5.3
V4 Pro 超越 Claude Fable 5
速度提升 2.53 倍 · Token 效率提升 2.21 倍
基准测试分数不升反降
Token 消耗明显增加
推理速度比原生模型更慢
GitHub 用户 GoForceX 严格按照项目说明,使用 Terminal Bench 完成了独立复测。结果与宣传完全相反。当社区进一步要求公开完整原始实验数据时,作者承认数据"确实夸张",却始终拿不出可复现的运行日志,反而开始删除质疑的 issue。
注:加装 J-Space 后,每一轮推理都要多做判断、多走流程,Harness 本质上是在模型外面加了一层控制逻辑,消耗额外计算资源和 Token 预算。宣称"提速 2.53 倍"本身就违背基本工程逻辑。
几乎在同一时间,OpenAI 思维链核心发明者 Jason Wei 在 X 上发布长文,用自己学羽毛球的经历做比:
"在球场上,我就像一个 1B 参数的认知核心。教练教的每个击球动作我都能做,但要在高速回合里把架拍、转体、击球点、随挥这些要点全部串联起来,几乎要耗尽全部精力。这跟那些练了上万次、将动作化为肌肉记忆的专业选手完全不是一个级别。"
他精准点破了"小模型+万能工具"幻想的三个软肋:
小模型+工具注定经历"判断→构造→等待→筛选→整合"完整链路。每多一步,延迟增加一截。多步推理任务耗时指数级上升。
大模型能把海量数据消化成见识和常识。小模型+工具只能翻前三条评论,无法提炼出客观、综合的总体印象。
复杂长周期任务中,每一步微小误差像滚雪球一样越滚越大。小模型元认知弱,层层转接外部工具出错概率更高。
说到底,工具只是放大器,不是发动机。在限定 Benchmark、限定提示词、人工筛选样本的条件下,小模型+工具能跑出漂亮的数字,但在真正的开放任务、长任务、模糊约束、多工具协作的真实场景中,内化的本能永远比临场查手册更快、更稳、更准。
很有趣的一件事是,Jason Wei 当初也是"大模型规模论"的怀疑者。而今天,他坚定站在"大模型不可替代"这一边。他的认知转变之路,几乎就是过去五年大模型行业发展的缩影。
在 Google Brain 发现:让模型"把思考过程一步步写出来",推理能力大幅提升。此时仍沉迷于用精巧 Prompt 挖掘模型潜能。
里程碑论文《Emergent Abilities of Large Language Models》证明:小模型不具备高阶能力(三位数加法、多步推理),参数规模跨过 ~100B 临界点后能力涌现。
论文中一个被忽略的关键结论:在小模型上使用思维链,不仅不会提升性能,反而因引出错误中间推理步骤导致成绩下降。逻辑推理本身,就是规模的产物。
作为核心成员参与 o1 系列研发,深化了对大模型内生能力的理解。写下:"想让大模型超越人类老师,就必须用强化学习,去逼出它内生的高阶思考能力。"
这两个发现彻底堵死了"小模型靠精巧 Prompt 或 Harness 实现高阶推理"的幻想。逻辑推理本身,就是规模的产物。
DSPy 框架作者、MIT 助理教授 Omar Khattab 在 Jason 发推后不久,从学术和系统层面再次佐证了"内化优于外挂"这一核心判断。
他用底层数学逻辑指出了两者的计算差异:
大模型使用 注意力机制,将所有上下文完整保留在显存中,每次以"全知视角"重新审视所有信息。而小模型+工具本质上是一种 压缩与递归——必须把复杂的外部世界塞进工具的输入输出里,在一轮轮强行"信息脱水"和往下传递的过程中,大量高维信息丢失了。
"虽然我们在工程上可以用各种'外挂'来模拟出智能的表象,但在数学层面上,靠一轮轮压缩的'递归',永远无法完美模拟'注意力机制'对全局的掌控力。"
Omar 团队还在其重磅论文《Machine Studying》中重新定义了什么是 AI 的"专业能力":判断一个系统专不专业,不该看它闭卷考试拿了多少分,要看它用多少推理计算量能换来多高的准确率。新手型 Agent 必须靠疯狂搜索、反复试错,消耗大量 Token 才能勉强答对;而专家型 Agent 搜索次数少、命中率高,在低计算预算下就能有很好的表现。
这一视角将争论从"能不能"拉到了"效率差多少"的层面。
这场争论走到最后,终究绕不开 AI 领域那个经典之作——强化学习教父 Rich Sutton 的《苦涩的教训》:
"人类在 AI 领域的所有精巧工程设计,最终都会被绝对的算力和数据规模碾得粉碎。"
从这个视角看,小模型+工具本质上就是一种精巧工程,试图用人类擅长的工程链路去弥补模型本身容量的不足。而大模型则是纯粹规模定律的胜利。
注:每一次,人们都试图用巧思走捷径;每一次,最终胜出的都是更简单、更吃算力的方法。苦涩的教训一再应验。
但为什么人们还是一次次投入"工程派"的怀抱?因为太贵了。万亿参数模型的训练成本是天文数字,不是每家公司都能承担得起,而且每个日常场景也并不都需要顶级智能。有开发者提出更折中的未来方向:核心认知能力被拆分为多个十亿级的专家模型协同工作,就像混合专家(MoE)架构的延伸——更灵活、可替换、可审计,而不是用一个粗放的 Harness 试图包打天下。
J-Space 造假是一次必然的泡沫。它精准击中了行业"既想要高智能、又想要低成本"的集体焦虑,但历史反复证明:在 AI 领域,规模不是万能的,但没有规模是万万不能的。工程优化的价值在于降低部署门槛、提升效率,但它永远无法替代模型内生的高阶认知能力。下一个试图绕过规模的"奇迹",已经在路上了。
这场围绕"小模型+工具能否替代大模型"的路线争论,远未结束。X 上 Jason Wei 与 Omar Khattab 的推文下,开发者、学者、创业者正展开激烈辩论。一方坚持"性价比才是王道",另一方坚信"内化能力不可替代"。
你的立场是什么?