🔬 开源生态 · 社区大摸底

769 份简历、712 个仓库、120 万星:一条内测帖引爆 Agent 开源生态

8 月 1 日,DeepSeek Harness 团队负责人崔添翼发帖招募内测人员,要求提交开源 Agent 项目仓库。评论区迅速变成「开源 Agent 路演」——截至 8 月 3 日上午,共收到 769 份报名、712 个去重仓库,累计超过 120 万 Stars,横跨 18 个技术赛道。

综合公开信息整理 2026-08-04 全文约 4 分钟读完
#DeepSeek #Agent Harness #开源生态 #Coding Agent #内测招募
769 报名开发者 · 评论区路演
712 去重开源仓库
120 万+ 累计 Stars · 18 个赛道

⚡ 30 秒速览

  • 规模有多大:769 位开发者、712 个有效仓库、120 万+ Stars,覆盖智能体框架、编程智能体、记忆系统、安全工具等 18 个方向。
  • 谁在参与:智能体框架与编程智能体是最大板块,合计 242 个项目,占总量约三分之一。
  • 深层信号:Agent 工程化三大方向浮出水面——长任务执行、上下文与记忆管理、评测与安全。
  • 社区猜测:DeepSeek 或基于 Harness 打造 AI Coding Agent,对标 Claude Code、Codex(未官方确认)。
  • 统计档案:社区志愿者已完成去重整理,712 个仓库的星数、分类、描述可公开查阅。

01报名全景 769 份「简历」里的生态剖面

一条内测招募帖,变成了一场开源 Agent 生态的「大摸底」。开发者们带着自己的项目涌入评论区,从个人 Harness 到企业级框架,几乎覆盖了当前 Agent 基础设施的所有探索方向。

几个数字,勾勒出这次「评论区路演」的全貌。

769报名人数
712去重仓库
120 万+累计 Stars
18技术赛道

注:统计由社区志愿者完成,截至 8 月 3 日上午 11:30。由于评论区混杂报名、讨论与围观,部分项目存在分类偏差,但整体数据可作为参考。

智能体框架和编程智能体是最大的两个方向,合计 242 个项目,占全部项目的约三分之一。记忆与上下文相关项目有 56 个,累计 194k 星(剔除头部项目 vllm 的 88k 星后仍有约 106k 星)。研究与评测、安全治理各有 24 个项目,虽然规模最小,却决定着 Agent 能否真正进入生产环境。

02Harness 是什么?模型之外的执行层

业内有一个简洁的公式:Model + Harness = Agent。模型负责理解需求、推理和生成方案,Harness 负责把这些能力落到真实环境中——调用工具、操作终端、读写文件、管理上下文、处理错误,最终完成一个完整的任务闭环。

它不是代码生成工具,而是一层「执行系统」。

传统理解

模型能力决定一切。基准测试(MMLU / GPQA)考的是「模型知不知道」。

Harness 实际

考的是「智能体能不能把整件事做完并交付可验证结果」——执行层决定成败。

DeepSeek 已在内部使用 Harness 完成 V4-Flash 正式版的基准测试,测试重点集中在终端操作、多工具调用、全栈开发等长流程任务场景。若社区预测成立,Harness 承担的正是连接模型能力与真实软件工程流程的执行层角色。

03五组基准 考的都是「长流程」

从 DeepSeek-V4-Flash 已公布的成绩单来看,五组基准测试指向同一个方向:让 Agent 在真实工程环境中持续执行、多步协作。

Terminal Bench终端环境操作
Cybergym安全攻防能力
Toolathlon多工具调用
DSBench-FullStack全栈开发
DSBench-Hard全栈开发·高难度

注:这五组基准的共同特点是任务链条长、步骤多,需要 Agent 持续调用工具并根据反馈调整策略。单一调用无法覆盖。

这些测试的选择,与社区流传的「对标 Claude Code、Codex 等 Coding Agent 产品」的目标高度一致。DeepSeek 测试的并非单纯的代码生成,而是自主执行软件工程任务的完整能力。

04769 份报名暴露的三大方向 Agent 工程化的关键迭代路径

报名项目背后,开发者关注的是一个非常现实的问题:当 Agent 需要独立完成真实工程任务时,哪些方面还需要优化?

答案集中在三个方向。

🔁 长任务执行能力 242 个项目 · 最大板块

  • deer-flow(79k 星):探索长周期 SuperAgent 框架,让 Agent 在持续执行中保持稳定。
  • CodeWhale(40k 星):由 DeepSeek 原生项目发展成的编程智能体框架,聚焦多步骤代码生成。
  • orca(36k 星):关注多 Agent 编排,解决复杂任务拆解与协同问题。
核心问题:Agent 能否从「一次调用」进化到「持续执行」?这决定了它能否覆盖 Terminal Bench、DSBench 这类需要多步骤、多工具协作的任务。

🧠 上下文与记忆管理 56 个项目 · 194k 星

  • 当任务从几分钟延长到几个小时,Agent 面临的不只是推理能力问题,还有如何保存状态、理解项目历史。
  • 开发者正在尝试 Git、数据库、知识图谱 等不同路线,但 Agent 记忆目前仍没有统一答案。
  • 剔除头部项目 vllm 后,该方向仍有约 106k 星,说明社区投入度极高。
核心问题:Agent 能否记住昨天做了什么,并在今天的任务中正确调用?这是从「工具」走向「协作者」的关键一步。

🛡️ 评测与安全治理 各 24 个项目

  • 有开发者尝试建立 跨 Harness 评测体系,统一不同框架的评价标准。
  • 安全方向关注工具调用权限、文件系统隔离和代码执行沙箱,确保 Agent 不会成为风险源。
  • 报名区中有开发者曾挖掘 Codex、Claude Code、Cursor 等产品的漏洞,关注点正是 Agent 从 Demo 走向产品时的安全边界。
核心问题:如果说长任务和记忆解决的是「能不能完成任务」,那么评测和安全解决的就是「能不能被放心使用」。

05评论区里的「高星选手」 Top 5 项目一览

在 712 个仓库中,有一批项目已经积累了相当规模的社区认可。它们未必都会进入 DeepSeek 的内测名单,但代表着当前 Agent 开源生态的头部力量。

🥇 open-design设计系统 · 83k 星
83k
lobehubAgent 应用生态 · 81k 星
81k
deer-flow长周期 SuperAgent · 79k 星
79k
career-opsAgent 应用 · 63k 星
63k
CodeWhale编程智能体框架 · 40k 星
40k

注:星数反映了社区关注度,但并非唯一标准。很多高星项目的报名者并非作者本人,而是仅提交过 PR 的参与者,不代表项目本身参与内测。

编辑核心判断

769 份报名记录提前勾勒出 Agent 时代的竞争焦点:当模型推理能力逐渐趋同,工程基础设施——长任务执行、记忆管理、安全控制——将成为决定 Agent 能否从 Demo 走向生产的关键分水岭。

DeepSeek Harness 最终会是什么样,目前还没有答案。
但这张由 769 位开发者、712 个仓库、120 万 Stars 绘制的路线图,已经提前告诉了我们 Agent 工程化下一步要攻克的方向。

综合公开信息整理 · 统计截至 2026-08-03