端侧智能 · 供应链观察

端侧AI从技术偏好走向供应链现实:MiniCPM称下载量达数千万,车载部署目标达数十万

端侧AI正在从模型性能展示进入手机、汽车等硬件的量产供应链,但模型厂商能否获得持续利润,取决于芯片适配、运行时软件、长期维护和对OEM议价能力,而不是模型规模或下载量本身。

数千万 MiniCPM累计下载量|报道口径
数十万 年末车载覆盖目标|尚待核验
能装上 ≠ 能赚钱 利润留存仍要经过系统交付与长期维护验证

01端侧AI为何从技术路线变成产品刚需

过去三年,生成式AI竞争主要围绕参数规模、训练数据和云端算力展开;如今,手机、汽车和其他终端开始要求AI在弱网、断网或高隐私场景下继续工作,端侧推理因此进入真实产品周期。

端侧产品刚需 ↑↑ 弱网 · 隐私 · 实时交互
端侧小模型 低延迟 · 高频任务 价值:低延迟
端云协同 不是替代,而是任务分流
云端大模型 复杂推理 · 长上下文 价值:高能力
本地响应更快
隐私数据少外传
云端能力补足
端侧AI与云端AI的商业和技术差异
响应速度 云端受网络连接、服务器排队和数据往返影响 本地处理通常延迟更低,适合语音唤醒、车载控制和实时交互
数据处理 数据需要上传或经过远程服务处理 可减少原始数据离开设备,但仍需关注日志、更新和模型遥测
成本结构 按照调用量、Token或算力消耗持续计费 主要承担设备算力、内存、能耗和软件适配成本
模型能力 更容易部署大参数模型并快速更新 受内存、功耗、散热和存储限制,需要量化、蒸馏或稀疏化
供应商切换 通常通过API或服务配置切换,迁移相对容易 涉及芯片适配、认证、系统更新和长期维护,切换成本更高

02MiniCPM案例:小模型开始进入硬件供应链

ModelBest及其MiniCPM系列体现了端侧模型公司的典型路径:先以参数效率和开源传播建立技术影响力,再通过车载系统、手机等硬件项目实现规模化部署。

2022

公司成立
源自清华大学实验室

技术传播

MiniCPM系列扩散
参数效率与开源传播

2026年中报道口径 数千万

累计下载量
≠ 活跃用户 / 付费客户

待核验
年末目标 数十万

车载覆盖目标
≠ 已确认交付量

报道中的案例信号

座舱软件已进入多家中国车企的量产车型,管理层预计截至年末覆盖数十万辆汽车。

数字的证据边界

报道未披露下载平台、去重方式、活跃用户、合同金额或车型清单,下载量不能直接等同于商业规模。

所谓“密度定律”

单位参数提取能力每隔数月翻倍,更接近企业或研究团队的经验观察,而非行业普遍接受的基础定律。

外推限制

有效性取决于任务集合、评测方法、训练数据、推理精度和模型版本,不能简单外推到所有模型。

端侧轻量模型供给:参数规模只是相对背景
Apple
约30亿参数
Microsoft
Phi-3 Mini,约38亿
Meta
10亿 / 30亿
Google
Gemma,约20亿

03端侧AI的商业模式:从按Token收费转向项目和供应链收入

端侧AI的收入不是云API调用量的简单函数,而是由模型授权、芯片适配、系统集成、量产部署和多年软件维护共同构成。模型公司能否从一次性项目收入转向持续性软件收入,是其商业化质量的关键。

一次性项目收入 可持续收入
模型授权
定制训练
量化蒸馏
芯片适配
运行时集成
认证 / 量产交付
OTA + 长期维护 收入周期延长,商业质量最终在此确认
芯片厂商
平台厂商
OEM整机厂商
模型公司

需要验证:量产设备数量、单设备收入、维护和更新收入、续约率、项目毛利率、客户集中度,以及跨芯片迁移能力。

04模型变小之后,真正稀缺的是系统工程能力

端侧模型的竞争壁垒正在从“谁拥有更小的模型”转向“谁能在特定芯片、功耗、内存和产品周期下稳定交付”。参数规模本身已经不再是足够强的差异化指标。

45 TOPS 理论NPU吞吐量 ≠ 实际体验
⑥ 场景数据与评测体系 真实噪声、方言、断网、功耗与安全要求
⑤ 量产交付 + 多年维护 升级、漏洞修复、模型回滚与硬件批次兼容
④ 运行时软件 启动、并发、功耗、模型更新与跨平台部署
③ 芯片专属优化 真正调用NPU,而不是退回CPU或GPU
② 量化 / 蒸馏 / 剪枝 降低内存与功耗,同时尽可能保持准确率
① 硬件底座 内存、带宽、算力与散热,覆盖面最广的基础约束

TOPS只反映理论运算吞吐量;内存容量和带宽、量化精度、算子支持、编译器效率、持续功耗和散热设计,同样决定真实体验。

05竞争加剧:小模型供给扩大,先发优势面临稀释

端侧模型市场正在从少数专业公司的技术赛道,转变为芯片厂商、手机厂商、云服务商和开源社区共同参与的平台竞争。未来的关键不再是模型能否运行,而是能否在指定设备上以更低成本、更高稳定性持续运行。

模型能力竞争 准确率 / 多语言 / 推理
优势可见,但容易被追赶
系统工程竞争 延迟 / 功耗 / 稳定性
产品差异真实,但定制成本高
供应链 / 生态竞争 芯片 × 平台 × OEM × 开源社区
规模大,但模型价值可能被平台吸收
指定设备持续稳定运行 三种竞争方式共同争夺的核心目标
Qualcomm AI Hub MediaTek NeuroPilot Google LiteRT Meta ExecuTorch ONNX Runtime

迁移门槛 ↓ · OEM替换成本 ↓ · 单一模型独占性 ↓

06科创板政策与资本市场:技术成熟不等于商业成熟

原始报道将科创板相关上市政策变化视为一个信号:AI模型企业可能在传统收入规模尚未完全达标时,凭借技术成果和规模化商业应用获得资本市场机会。但上市资格放宽并不能替代对收入质量和盈利模式的检验。

报道声称 AI模型可在传统收入不足时申请上市;至少一个模型实现规模化商业使用
正式政策文件? 文件名 / 日期 / 适用条款
“规模化”有量化口径? 装机 / 活跃 / 合同 / 收入
收入质量可持续? 毛利 / 续费 / 客户集中度
才能进入资本判断 证据逐层收敛后再下结论
评测分数付费意愿
开源下载活跃部署 / 收入
量产装机单机收入 / 毛利
客户数量业务稳定性
项目收入可持续软件收入

07端侧AI价值分配的核心风险

端侧AI已经证明小模型可以进入大规模硬件,但尚未证明模型专业公司能够在价值链中长期保留足够利润。真正的行业测试,是模型厂商能否从项目供应商升级为不可替代的软件基础设施提供者。

平台层 入口控制
OEM层 产品定价
模型层 技术重要、易被替代
芯片层 算力入口、迭代迅速
芯片层 价值:NPU、内存和软件栈带来的硬件溢价 风险:芯片迭代快,AI性能可能被追平
平台层 价值:系统入口、模型接口和用户分发 风险:承担生态兼容、安全和隐私责任
OEM层 价值:产品差异化和品牌溢价 风险:承担整合、售后和最终体验责任
模型层 价值:授权费、定制费和持续维护收入 风险:被平台标准化、OEM自研或开源模型压低价格
进入量产 持续收费 保留利润

编辑判断

端侧AI已经从实验室和开发者社区进入手机、汽车等大规模硬件。小模型、量化和NPU让本地推理成为可能,ModelBest及MiniCPM的案例则说明,模型公司可以通过参数效率、开源传播和场景适配获得供应链入口。

但数千万下载、数十万车载覆盖、手机合作和科创板政策表述,仍缺少平台口径、合同金额、单机收入、毛利率、续费率、客户集中度和正式政策来源。尤其是“截至2026年年中”等时间表述,正式使用前仍应进一步核查。

端侧AI的长期胜负不由模型规模或传播度单独决定,而由芯片适配、运行时软件、供应链交付、多年维护和利润留存共同决定。技术能力只有转化为量产交付和长期维护能力后,才可能形成商业壁垒。

进入量产只是第一关,持续收费是第二关,能否在平台厂商与整机厂商之间保留足够利润,才是最终测试。

待验证指标

  • 实际活跃部署量
  • 持续软件收入
  • 跨芯片迁移能力
  • OEM依赖程度

综合公开信息整理