撞名 Anthropic 的“外挂”刷屏:声称助 DeepSeek 碾压 Fable 5,实测却无第三方复现且 Token 消耗翻倍
近日,一个名为 J-Space Cognition Suite 的社区开源项目在 X 上迅速传播。项目方宣称,在不修改 DeepSeek V4-Pro 模型权重的前提下,仅靠外层 Harness 即可实现多项基准超越 Fable 5。然而,该项目不仅引发关于 Anthropic 研究的命名误解,其性能提升更完全缺乏独立团队复现,且存在高昂的 Token 溢价。
近日,一个名为 J-Space Cognition Suite 的社区开源项目在 X 上迅速传播。项目方宣称,在不修改 DeepSeek V4-Pro 模型权重的前提下,仅靠外层 Harness 即可实现多项基准超越 Fable 5。然而,该项目不仅引发关于 Anthropic 研究的命名误解,其性能提升更完全缺乏独立团队复现,且存在高昂的 Token 溢价。
J-Space Cognition Suite 本质上并非微调模型,也没有生成新的模型 checkpoint,而是在模型运行外围增加一层 Harness。项目方公布的改造前后对比数据看似十分出彩:
在 Agent 评测中,重试次数、工具调用轮数上限、记忆模块及停止条件均会剧烈改变得分。未标明严苛控制变量与成本上限的提分,无法作为确定性的 Benchmark 事实。
此次传播中最直接的混乱来自命名。不少开发者以为 DeepSeek 用上了 Anthropic 的前沿研究,实际两者存在本质差异:
模型内部可解释性研究:2026 年 7 月发表,探讨 Claude 内部神经表征与全局工作空间理论(GWT),属于底层机制探索。
外部推理时 Harness:社区第三方开源项目,通过 Python 脚本与外部看板(Kanban)维护任务状态,与 Anthropic 无官方关联。
有开发者扒了其 GitHub 仓库代码后直言,该项目本质就是一个运行在模型外围的 Skill 插件,加上一些持久化任务管理的辅助脚本。
部分社区开发者在尝试复现时遇到了挫折。针对不同配置的实际调用测试显示,套用该方案不仅未见性能飞跃,反而带来了显著的算力负担:
“这就是炒作,而且是假的。我没能复现其中任何一项说法。实际上,它消耗的 Token 反而比基线更多,推理表现也没有超过不使用这个 Skill 的 DeepSeek。”
测试表明,使用原生 Harness + V4 Flash 运行编程任务时,并未观察到宣称的成本节省效果。相反,由于增加了额外的验证和状态巡检轮次,实际 Token 开销大幅上升。
抛开炒作成分,J-Space 试图解决的问题确实击中了当下 Agent 发展的核心瓶颈:
为应对这些问题,行业正在探索“状态外置”与“上下文压缩(Compaction)”。然而新方案同时引发了新的安全风险:
例如 OpenCode 内置的 Compaction 机制会在上下文过长时自动生成摘要,但社区 Issue 报告显示,一个原本被设定为只读的 Explore 子 Agent,在触发 Compaction 后可能丢掉权限约束,开始误修改文件。
不压缩上下文,Agent 会过于臃肿;压缩上下文,又可能丢失任务目标与权限边界。这正是当下通用 Harness 与模型原生 Harness(如 DeepSeek DSH、OpenAI Agents SDK)共同面临的困境。
推理时 Harness 正在重塑智能体基准的含金量。当 Benchmark 分数越来越依赖外围重试、记忆与验证框架时,不标明 Token 成本和推理强度上限的提分宣传,本质上只是用算力换取分数的工程游戏。没有严格标准化环境与成本上限的第三方 A/B 测评,都无法证明模型底座或 Harness 架构的实质跃升。