自构建智能体实验:LangChain4j 代码助手克隆自己,工作流比监督者快 3 倍
一项「元实验」引发关注:研究人员让代码助手阅读 LangChain4j 框架文档,自主设计并构建一个智能编码器系统。结果令人惊讶——AI 不仅成功克隆了自己的核心能力,还揭示了两种架构之间速度与自主性的根本权衡。
一项「元实验」引发关注:研究人员让代码助手阅读 LangChain4j 框架文档,自主设计并构建一个智能编码器系统。结果令人惊讶——AI 不仅成功克隆了自己的核心能力,还揭示了两种架构之间速度与自主性的根本权衡。
研究团队给代码助手下了一道不寻常的指令:「研究 LangChain4j 智能体框架的 API 和功能,在此基础上设计一个智能编码器,使其成为你自己的克隆体。」
代码助手在几分钟内给出了方案——它选择了监督者模式,设计了一个包含 4 个子代理的架构:
每个子代理负责一道工序:探索代码库、制定执行计划、编写/修改代码、编译并运行测试。监督者代理在运行时自主生成子代理调用及其参数,协调整个流程。
一个诚实的注脚:
首次运行时,gpt-4o 在监督者模式下陷入了工具调用循环,超过 100 次调用后被框架中断。更换为 gpt-5-mini 后,系统成功运行。模型选择对智能体系统的稳定性影响显著。
研究团队没有止步于监督者模式。他们要求代码助手再设计一种更确定性、更高效的替代方案——工作流模式由此诞生。
主智能体在运行时自主生成子代理调用及参数,协调所有子代理。灵活性高,但 LLM 协调开销大,速度慢。
严格五步序列:探索→计划(含审查循环)→实现→执行(含评估与重构循环)→总结。确定性高,速度快。
注:工作流模式包含 PlanReviewLoop 和 ExecutionLoop 两个内嵌循环,前者用于审查计划,后者用于迭代评估与重构。退出条件为评估分数 ≥ 0.8 或达到最大迭代次数 5 次。
速度差异的核心原因:监督者模式中,LLM 需要自主生成所有子代理的调用参数,协调开销巨大;工作流模式则通过确定性架构和严格的步骤序列,消除了这部分开销。
为了测试自构建智能编码器的实际能力,团队创建了一个包含 4 个隐蔽 bug 的 Calculator 类,然后用系统来修复它。
值得注意的是,监督者模式虽然速度慢,但在修复过程中展示了更强的自主性——它自行决定先探索代码库,再制定计划,最后执行修复,整个过程无需人工干预。
两种架构都成功完成了任务,但它们代表了两种截然不同的设计哲学。
工作流模式是「确定性优先」——把流程拆解为固定的步骤序列,用内置循环处理迭代优化。它的优势是可预测、速度快、开销低。代价是灵活性受限:如果任务超出了预设步骤的范畴,系统可能无法适应。
监督者模式是「自主性优先」——让 LLM 在运行时动态决策,协调子代理、分配任务。它的优势是灵活、适应性强,能处理非结构化任务。代价是速度慢、开销大,且对底层模型的能力要求更高(gpt-4o 失败,gpt-5-mini 成功)。
这不是一个「谁更好」的问题,而是一个「什么场景用什么」的问题。
智能体架构设计没有银弹。工作流模式用确定性换速度,适合流程明确、效率至上的场景;监督者模式用自主性换灵活,适合探索性强、路径不确定的任务。真正的工程智慧,是在两者之间找到正确的平衡点。
完整项目代码已公开发布,包含两种架构的全部实现、测试用例及执行日志,可复现验证。
GitHub → langchain4j-agentic 实验仓库