💰 融资 · 估值异动

AI代码过剩后,给代码"冲厕所"的CI基础设施公司估值暴涨十倍

8 月 12 日,为 GitHub Actions 提供持续集成(CI)基础设施的 Blacksmith 完成 4,500 万美元 B 轮融资,估值达 5.5 亿美元。不到一年前,它的估值还只有约 6,000 万美元。它不写代码,只负责代码写完后"跑测试、做构建"——AI 代码产量井喷,让这门后台脏活成了最贵的基础设施。

综合公开信息整理 2025-08-13 全文约 4 分钟读完
#Blacksmith #CI基础设施 #AI编程 #估值异动
5.5亿$ B轮后估值 · 不到一年涨近十倍
4500万$ B轮融资额 · 8月12日披露
5000+ 服务组织数 · 一年前约800家

⚡ 30 秒速览

  • 发生了什么:Blacksmith 完成 4,500 万美元 B 轮,估值从 6,000 万飙至 5.5 亿美元,不到一年涨近十倍。
  • 它做什么:不写代码,只做 GitHub Actions 的"执行层"——提供高单核 CPU、本地缓存和 NVMe 存储来跑 CI 任务,速度约为托管服务器的 2 倍。
  • 为什么火了:Coding Agent 爆发后代码产量井喷,CI 任务量每季度平均增长 60%,"代码怎么验"取代"代码怎么写"成为新瓶颈。
  • 谁在推:OpenAI 实验中 3 人团队 5 个月用 Codex 写出 100 万行代码、1,500 个 PR;Claude Code 负责人同时管理数千甚至上万 Agent。
  • 底层逻辑:AI 可以自己找 Bug、改代码,但"这段代码真的能用"不能靠嘴说,必须真跑一遍——服务器不会因为代码是 AI 写的就少跑一次测试。

01不到一年,估值涨了近十倍 钱投在了哪里

Blacksmith 没有发明更聪明的 AI,也不帮程序员写代码。它做的是 AI 把代码写出来以后剩下的事情:跑测试、做构建,确认这些 AI 生成的代码到底能不能安全进入真正的软件

让身价暴涨的不是测试本身,是那些需要处理的代码正在变得越来越多。

2024 年 9 月 · A 轮
~6,000万$
约 800 家组织,年化收入 1,000 万美元,员工约 10 人
2025 年 8 月 · B 轮
5.5亿$
5,000+ 组织,年化数千万美元,大客户年付超 100 万,员工约 30 人

注:估值涨幅按 6,000 万至 5.5 亿计算约 9.2 倍,文中简称"近十倍"。年化收入从"1,000 万"进入"数千万"区间,未披露精确上限。

02AI 写的代码,人类已经看不过来了

Blacksmith 在 2025 年 9 月 A 轮融资时披露:排除开发者人数增长影响后,现有客户的 CI 任务量平均每季度增长 60%。原因很直接——人一天只有 24 小时,能生产的代码有限,但 Coding Agent 不需要下班。

Claude Code 负责人 Boris Cherny 在今年 6 月的大会上说,自己已经 8 个月没有手写过一行代码。他现在管理着一支越来越庞大的 Agent 队伍——大会当天早上同时管理"几百个",有时是几千甚至上万个。

代码生产,开始脱离人类的工作时间。

3初始工程师
5个月
~100万行代码
~1500个 PR

注:以上为 OpenAI 内部实验数据——3 名工程师从空白代码库开始,用 Codex 开发内部软件,人类不直接写代码,全部由 Agent 生成。OpenAI 估算同样工作若全由人类手写约需十倍时间。单次 Codex 任务经常连续工作超 6 小时。

但很快新问题出现了:代码写得太快,人开始看不过来了。OpenAI 在实验中直接写道,新瓶颈变成了"人类 QA 能力"。这个团队每周五要拿出一整天清理"AI slop"——重复实现、不一致风格和不断累积的技术债。后来连"擦屁股"也交给了 Agent:后台 Codex 定期扫描代码库、自动提交重构 PR,Review 也开始 Agent 之间互查。

AI 开始同时出现在生产线两端:一边疯狂生产代码,另一边帮人找问题。

但中间那些必须实际跑完的测试,并没有消失。

03CI 到底是什么?一条代码流水线

一段代码从程序员手里写出来,到真正出现在用户手机上,中间还有很长一段路。程序员每提交一次代码,机器就自动把代码拉下来、重新构建、运行测试、检查结果——发现问题打回去,全部通过才有资格往下走。这套自动流水线就叫持续集成(CI)

GitHub Actions(规则层)

规定"要跑哪些测试、按什么顺序跑",是开发者最常用的 CI 工具之一。

Blacksmith(执行层)

提供真正执行这些任务的计算环境——高单核 CPU、本地缓存、NVMe 存储,速度约为托管服务器的 2 倍,迁移只需改一行配置。

Blacksmith 创始人把 CI 形容为"开发者的管道工程",甚至开玩笑说想让 CI"至少这一次变得性感一点"。而 AI 编程恰好把它最不起眼的地方变成了优势:过去程序员一天提交几次代码,CI 就跑几次;现在 Agent 可以持续改代码、反复尝试、并行调用 Subagent,每一次修改都会触发新一轮构建、测试和验证

AI 越会写代码,Blacksmith 需要跑的机器反而越多。

04谁在给 AI 代码"擦屁股" 玩家与定位

过去一年,几乎所有主流 AI 公司都开始往代码生产线的后半段走。但它们的位置各不相同。

BlacksmithCI 执行层
提供跑测试的机器和计算环境,让所有代码真正跑一遍
冲厕所
OpenAI Codex代码生成 + Review
写代码、跑测试、自动提交重构 PR,Review 公司内部绝大多数 PR,每天发现数百个问题
擦屁股
Claude Code安全审查
3 月加入自动安全审查,查 SQL 注入、XSS、身份验证漏洞,通过 GitHub Actions 自动运行
擦屁股
GitHubCode Quality
7 月上线,PR 阶段检查可靠性和可维护性,结合 Copilot Autofix 给修复建议,内部合并前解决 67.3% 问题
擦屁股

注:"冲厕所"与"擦屁股"为原文比喻,指 CI 执行层(验证基础设施)与代码审查/安全扫描的分工差异。前者提供计算资源让代码真跑一遍,后者靠 AI 读代码找问题。

05Blacksmith 自己也在往 AI 叠 从执行层到闭环

今天的 Blacksmith 已不满足于只做更快的 CI 执行层,它开始把 AI 能力往上叠:

Codesmith · 代码修改与定位AI 能力上叠

  • 读取代码仓库、修改代码并创建 PR
  • 根据 CI 失败信息辅助定位和修复问题
定位:从"跑机器"延伸到"改代码",但仍需跑一遍验证。

Testboxes · 虚拟测试环境闭环关键

  • 给 Agent 临时创建一个虚拟测试环境,把刚改完的代码真正跑一遍
  • 失败后结果返回给 Agent 继续修改——形成"写→跑→改→再跑"的闭环
这条链路的关键:AI 可以自己找 Bug、改代码,但"真的能用"不能靠嘴说,必须真跑——消耗真实计算资源。

一条新的软件生产线开始成型:

Agent 写代码Blacksmith 跑测试失败?AI 总结问题Codesmith 改代码扔回 Testbox

模型可以把写代码的边际成本不断压低,但服务器不会因为代码是 AI 写的就少跑一次测试。量大再凑个满减——Blacksmith 赚的,本质上是这最后一笔省不掉的钱。

06AI 没有消灭瓶颈,只是把它推到了下游

过去几年,AI 编程最激烈的竞争发生在代码生成端:谁能写得更快,谁能处理更大的代码库。但当代码真的开始过剩,下一场竞争已经悄悄往后移动。

这甚至形成了一种和很多"AI 替代软件"故事完全相反的关系:模型越强,代码生成成本越低;成本越低,代码产量越大;产量越大,后面的测试、Review 和安全审查需求反而越多

Coding Agent 可以换,但验证基础设施不能省。

不管代码是 Codex 写的、Claude Code 写的,还是人写的;也不管最后是谁负责 Review——只要想知道这段代码到底能不能跑,测试就必须真正执行。Blacksmith 最早选择自建 CI 基础设施而非在公有云上租机器,针对编译、构建和测试优化 CPU、存储、缓存和虚拟机调度,就是这个原因。

别人争的是谁更会看代码,Blacksmith 赚的是代码最后必须跑一遍的钱。

编辑核心判断

AI 没有消灭软件开发的瓶颈,只是把它从"代码怎么写"推到了"代码怎么验"。当生成成本趋近于零,验证成本就成了整个产业链上最硬的刚需——谁掌握让代码"真跑一遍"的基础设施,谁就卡住了 Agent 工业化生产的咽喉。