线下 AI 走向物理世界:三维感知、百万小时数据与视觉基础模型押注
Aibee 爱笔智能创始人兼 CEO 林元庆表示,公司从 2017 年开始把 AI 部署到购物中心、机场、道路等真实空间,如今每天处理超过 100 万小时视频数据,并将下一阶段押注于视觉基础大模型。
注:数字均来自受访方在访谈中的表述;“9 年”按 2017 年成立计算,未经过第三方审计。
Aibee 爱笔智能创始人兼 CEO 林元庆表示,公司从 2017 年开始把 AI 部署到购物中心、机场、道路等真实空间,如今每天处理超过 100 万小时视频数据,并将下一阶段押注于视觉基础大模型。
注:数字均来自受访方在访谈中的表述;“9 年”按 2017 年成立计算,未经过第三方审计。
林元庆把 AI 的应用演进概括为五条主线:自然语言处理、语音识别、计算机视觉、机器人学与大数据分析。2017 年创业时,爱笔选择的并不是当时更容易获得关注的互联网应用,而是把 AI 放进购物中心、机场和道路等实体空间。
他的判断是,语言阶段可以大量依赖公共数据,但物理世界的 AI 必须建立在真实场景上:物体在哪里、如何移动、与谁发生交互,都需要持续采集和理解。
概念变了,路线没有变。
注:四类场景是受访方披露的业务覆盖范围,不等同于全部项目均已规模化复制。
这条路线的核心并不是让摄像头“看见”更多,而是让数据最终能够进入业务决策:招商、营运、营销、停车、交通控制,都要有可执行的结果。
空间智能最难的部分,往往不是展示一个漂亮的三维模型,而是让系统在真实空间里持续运行:摄像头数量多、物体分布密、光线和遮挡复杂,还要把计算成本压到客户能够接受的范围。
公司成立,开始围绕物理空间进行三维理解与智能化改造。
据林元庆回忆,早期系统需要 150 台 8 卡 GPU 服务器,一天视频数据要计算约 10 天。
同等数据量的计算时间压缩到一天,受访方称计算效率提升接近 100 倍。
超过 90% 的计算被放入摄像头,相关任务最终不再依赖独立 GPU 服务器。
注:时间线依据受访方回忆整理;“至今”对应访谈时点,未给出具体日期。
这条时间线能证明的是工程优化能力,而不是“物理世界 AGI 已经实现”。从算法、蒸馏、量化、剪枝到边缘计算,长期积累确实形成了成本壁垒;但它距离通用能力,还隔着数据质量、跨环境泛化和安全治理。
在线上世界,UV、PV、停留和转化早已是产品经理的日常指标。线下空间过去缺少稳定的逐人识别与轨迹数据,爱笔试图用三维感知把这套方法搬进购物中心、道路和机场。
注:案例中的业绩、覆盖数量与合作情况均为受访方披露,未提供第三方审计或统一统计口径。
爱笔的技术路线并非单独训练一个模型解决所有问题,而是先建立空间智能中间层:让系统知道人、车、飞机、商品分别在哪里,正在做什么,以及它们之间如何交互;上层应用再调用这些结构化结果。
注:技术栈为受访方对产品架构的概括,实际项目中的模块组合和部署方式可能不同。
产品化的价值,最终要体现在成本曲线上。林元庆称,一个 10 万平方米购物中心的三维建模,行业通常需要约 300 万至 500 万元,而爱笔可以做到 10 万元以内;北京海淀区道路三维扫描,其他公司报价曾高达 2 亿至 3 亿元,爱笔项目报价为 800 万元。
注:柱形仅作数量级示意,非严格比例;两组项目的具体范围、验收标准与服务周期未在访谈中完整披露。
所以,“结硬寨,打呆战”并不是一句性格描述,而是一种工程策略:先把底层技术抽象出来,再通过边缘计算和算法优化,把一次性项目压缩成可迁移的产品。
林元庆认为,具身智能需要“身体”进入真实空间,但在此之前,更底层的能力是视觉系统本身:它要像人的眼睛一样实时感知,理解三维深度、语义和像素级细节。
注:LVM-rtdsp 是受访方提出的视觉基础模型方向,四个字母分别对应实时、深度、语义和像素级能力。
这套设想与具身智能的关系,是先提供环境智能,再让机器人、车辆和其他设备调用环境信息。例如,购物中心停车系统可以预置自主代客泊车所需的场端能力;当车端能力成熟后,只需升级场端算法,便可能形成车端与场端的协同。
受访方还预测,基于固定摄像头与预先三维建模的“第三视觉”学习框架,可能比移动设备主导的“第一视觉”更早成熟 2 至 3 年,并认为通用视觉模型可以让部分自动驾驶训练效率提升 万倍以上。
但预测不是验证。
| 报道中的判断 | 目前能支持的证据 | 仍需验证的问题 |
|---|---|---|
| 场景数据是核心资产 | 长期积累固定摄像头数据,并已用于购物中心、道路、机场等项目。 | 数据是否覆盖足够多的天气、设备、区域与异常情况,尚无公开数据集说明。 |
| 技术具备跨行业迁移性 | 受访方披露已覆盖四类主要场景,底层使用相近的空间智能能力。 | 不同场景的实际部署周期、误检率、维护成本与失败案例未披露。 |
| 将成为世界模型的一部分 | 具备感知、建模、分析和场端协同的产品链路。 | 缺少公开的独立基准,无法据此判断其是否达到通用视觉基础模型水平。 |
| 未来 3—5 年成为行业标配 | 受访方称头部购物中心、机场和新能源汽车门店已有较大覆盖。 | 市场份额、收入质量、续约率和客户投入产出比仍缺少可核验数据。 |
注:表格将受访方观点与可验证程度拆开呈现;“已覆盖”不代表公开证明了规模化盈利或行业标准地位。
爱笔真正的护城河,不是“每天处理 100 万小时视频”这句数字,而是把固定摄像头数据、三维空间中间层与客户业务闭环,压进了一个可以交付的成本结构。
但就现有公开材料看,它更像一家在复杂线下场景中积累深厚的空间智能工程公司,尚不能仅凭访谈宣称已经证明了通用物理世界 AGI;独立评测、隐私合规、持续经营数据和跨场景失败率,都是必须补上的证据。
物理世界 AI 的行业分水岭,不是模型能否“看懂”一段视频,而是能否在不同场景中以可接受成本,稳定、合规地把理解转化为结果。
原文未提供面向公众的体验地址或下载入口,也未披露可直接试用的开放产品。