769 份简历、712 个仓库、120 万星:一条内测帖引爆 Agent 开源生态
8 月 1 日,DeepSeek Harness 团队负责人崔添翼发帖招募内测人员,要求提交开源 Agent 项目仓库。评论区迅速变成「开源 Agent 路演」——截至 8 月 3 日上午,共收到 769 份报名、712 个去重仓库,累计超过 120 万 Stars,横跨 18 个技术赛道。
8 月 1 日,DeepSeek Harness 团队负责人崔添翼发帖招募内测人员,要求提交开源 Agent 项目仓库。评论区迅速变成「开源 Agent 路演」——截至 8 月 3 日上午,共收到 769 份报名、712 个去重仓库,累计超过 120 万 Stars,横跨 18 个技术赛道。
一条内测招募帖,变成了一场开源 Agent 生态的「大摸底」。开发者们带着自己的项目涌入评论区,从个人 Harness 到企业级框架,几乎覆盖了当前 Agent 基础设施的所有探索方向。
几个数字,勾勒出这次「评论区路演」的全貌。
注:统计由社区志愿者完成,截至 8 月 3 日上午 11:30。由于评论区混杂报名、讨论与围观,部分项目存在分类偏差,但整体数据可作为参考。
智能体框架和编程智能体是最大的两个方向,合计 242 个项目,占全部项目的约三分之一。记忆与上下文相关项目有 56 个,累计 194k 星(剔除头部项目 vllm 的 88k 星后仍有约 106k 星)。研究与评测、安全治理各有 24 个项目,虽然规模最小,却决定着 Agent 能否真正进入生产环境。
业内有一个简洁的公式:Model + Harness = Agent。模型负责理解需求、推理和生成方案,Harness 负责把这些能力落到真实环境中——调用工具、操作终端、读写文件、管理上下文、处理错误,最终完成一个完整的任务闭环。
它不是代码生成工具,而是一层「执行系统」。
模型能力决定一切。基准测试(MMLU / GPQA)考的是「模型知不知道」。
考的是「智能体能不能把整件事做完并交付可验证结果」——执行层决定成败。
DeepSeek 已在内部使用 Harness 完成 V4-Flash 正式版的基准测试,测试重点集中在终端操作、多工具调用、全栈开发等长流程任务场景。若社区预测成立,Harness 承担的正是连接模型能力与真实软件工程流程的执行层角色。
从 DeepSeek-V4-Flash 已公布的成绩单来看,五组基准测试指向同一个方向:让 Agent 在真实工程环境中持续执行、多步协作。
注:这五组基准的共同特点是任务链条长、步骤多,需要 Agent 持续调用工具并根据反馈调整策略。单一调用无法覆盖。
这些测试的选择,与社区流传的「对标 Claude Code、Codex 等 Coding Agent 产品」的目标高度一致。DeepSeek 测试的并非单纯的代码生成,而是自主执行软件工程任务的完整能力。
报名项目背后,开发者关注的是一个非常现实的问题:当 Agent 需要独立完成真实工程任务时,哪些方面还需要优化?
答案集中在三个方向。
在 712 个仓库中,有一批项目已经积累了相当规模的社区认可。它们未必都会进入 DeepSeek 的内测名单,但代表着当前 Agent 开源生态的头部力量。
注:星数反映了社区关注度,但并非唯一标准。很多高星项目的报名者并非作者本人,而是仅提交过 PR 的参与者,不代表项目本身参与内测。
769 份报名记录提前勾勒出 Agent 时代的竞争焦点:当模型推理能力逐渐趋同,工程基础设施——长任务执行、记忆管理、安全控制——将成为决定 Agent 能否从 Demo 走向生产的关键分水岭。
DeepSeek Harness 最终会是什么样,目前还没有答案。
但这张由 769 位开发者、712 个仓库、120 万 Stars 绘制的路线图,已经提前告诉了我们 Agent 工程化下一步要攻克的方向。
综合公开信息整理 · 统计截至 2026-08-03