DeepSeek 重启融资:投前估值 5000 亿元,开源大模型商业化提速
据多家公开信息,DeepSeek 已完成新一轮融资,投前估值约 5000 亿元人民币(约 700 亿美元),成为国内估值最高的 AI 大模型创业公司之一。本轮融资由多家头部机构参与,资金将用于模型研发、算力扩张与生态建设。
据多家公开信息,DeepSeek 已完成新一轮融资,投前估值约 5000 亿元人民币(约 700 亿美元),成为国内估值最高的 AI 大模型创业公司之一。本轮融资由多家头部机构参与,资金将用于模型研发、算力扩张与生态建设。
DeepSeek 本轮融资采用投前估值 5000 亿元的结构,较上一轮翻了近 3 倍。参与方既包括红杉、高瓴等长期支持 AI 的美元基金,也出现了地方国资的身影——这标志着“百模大战”进入资本密集期。
一个值得关注的细节:此轮融资从启动到完成仅用 6 周,超额认购达 3 倍。在资本寒冬未完全散去的背景下,这样的速度说明 DeepSeek 的产品力与工程能力得到了市场高度认可。
注:估值数据基于公开信息,折合美元约 700 亿,未考虑期权池稀释。对比:OpenAI 最新估值约 3000 亿美元。
但数字只是表象。真正让资本兴奋的,是 DeepSeek 在技术路线上的“第三条道路”——不盲目堆参数,而是用极致的工程优化和 MoE 架构,实现 GPT-4 级别的能力,同时将推理成本降到行业最低。
DeepSeek 的技术路线可以用三个词概括:开源、高效、低成本。其旗舰模型 DeepSeek-V3 在 MMLU、HumanEval、GSM8K 等主流基准上,得分与 GPT-4o 不相上下,而 API 价格仅为 OpenAI 的十分之一。
性能顶尖,但成本高企,企业大规模部署难以承受。API 价格 $15/百万 tokens,且不开源,生态封闭。
推理成本低至 $1.5/百万 tokens,模型权重与架构完全开源,开发者可自由部署、微调、二次开发。
注:MMLU 为 5-shot 评测,HumanEval 为 pass@1,GSM8K 为 8-shot。数据来自 DeepSeek 官方技术报告及第三方复现,GPT-4o 对应分数分别为 88.5% / 92.0% / 95.3%(OpenAI 官方)。
更关键的是,DeepSeek 在推理效率上做到了极致。通过自研的 MLA(Multi-head Latent Attention)架构和 MoE 稀疏激活,V3 模型在保持高准确率的同时,激活参数仅 37B,推理速度是同类模型的 2-3 倍。
答案藏在创始团队的基因里:一群对“极致工程”有偏执的人。创始人梁文锋出身量化交易,团队骨干来自清华大学、浙江大学等顶尖高校,对 GPU 集群调度、模型并行训练、推理加速有深刻理解。
DeepSeek 的研发哲学是“用最少的算力,榨取最大的模型性能”。他们花了大量精力在数据质量与训练策略上,而不是单纯堆参数。结果是:DeepSeek-V3 的训练成本仅为 GPT-4 的 1/5,但能力接近。
这套技术栈的成熟,让 DeepSeek 在开源社区收获了极高的声誉。Hugging Face 上,DeepSeek 系列模型累计下载量超过 500 万次,成为全球最受欢迎的开源大模型之一。
但一个诚实的注脚:开源模型在长尾任务、多轮对话连贯性上仍与顶级闭源模型有差距。DeepSeek 的下一站——DeepSeek-V4 和 R2——将重点解决这些短板。
开源大模型不再是“用爱发电”——DeepSeek 证明,极致的工程效率可以同时实现高性能、低成本与商业闭环。当算力成为稀缺资源,谁能在单位算力上榨出更多智能,谁就能定义下一个时代。
DeepSeek-V3 已在官网开放 API 接入,开源模型权重可在 Hugging Face 下载,开发者社区持续活跃。
deepseek.com → 体验 API 或下载模型