物理世界 AI · 深度解读

线下 AI 走向物理世界:三维感知、百万小时数据与视觉基础模型押注

Aibee 爱笔智能创始人兼 CEO 林元庆表示,公司从 2017 年开始把 AI 部署到购物中心、机场、道路等真实空间,如今每天处理超过 100 万小时视频数据,并将下一阶段押注于视觉基础大模型。

访谈内容整理 观点与经营数据以受访方披露为主 全文约 6 分钟读完
#空间智能 #Physical AI #视觉基础模型 #线下场景
9 年 持续投入线下空间智能
100万+小时/日 受访方称每日处理的视频数据
0.5 当前相关数据计算耗时口径

注:数字均来自受访方在访谈中的表述;“9 年”按 2017 年成立计算,未经过第三方审计。

⚡ 30 秒速览

  • 发生了什么:Aibee 爱笔智能没有追逐语言大模型热点,而是长期做线下空间的三维数字化与智能化。
  • 凭什么支撑:公司称每天处理超过 100 万小时真实视频,并将计算从 150 台 GPU 服务器逐步压缩到摄像头端。
  • 已经做什么:能力覆盖购物中心、连锁门店、机场与枢纽、双智城市,案例包括珠宝门店业绩提升 146%、路口拥堵系数下降约一半。
  • 真正的押注:林元庆希望从“理解人、车、飞机等特定目标”,扩展到理解现实空间中所有物体的视觉基础大模型。
  • 需要保留什么:公开材料以访谈和企业口径为主,缺少独立基准、连续经营指标、隐私治理细节与跨场景失败率。

01发生了什么 不是追风口,而是等技术水位上涨

林元庆把 AI 的应用演进概括为五条主线:自然语言处理、语音识别、计算机视觉、机器人学与大数据分析。2017 年创业时,爱笔选择的并不是当时更容易获得关注的互联网应用,而是把 AI 放进购物中心、机场和道路等实体空间。

他的判断是,语言阶段可以大量依赖公共数据,但物理世界的 AI 必须建立在真实场景上:物体在哪里、如何移动、与谁发生交互,都需要持续采集和理解。

概念变了,路线没有变。

购物中心 客流、停车、导航、运营与营销智能体
连锁门店 识别进店、停留、转化等经营漏斗
机场与枢纽 航站楼、停机坪、停车场与道路协同
双智城市 路口三维感知、交通优化与数字孪生

注:四类场景是受访方披露的业务覆盖范围,不等同于全部项目均已规模化复制。

这条路线的核心并不是让摄像头“看见”更多,而是让数据最终能够进入业务决策:招商、营运、营销、停车、交通控制,都要有可执行的结果。

02为什么可信 九年投入被压缩成一条工程时间线

空间智能最难的部分,往往不是展示一个漂亮的三维模型,而是让系统在真实空间里持续运行:摄像头数量多、物体分布密、光线和遮挡复杂,还要把计算成本压到客户能够接受的范围。

2017

从“线下空间数字化”起步

公司成立,开始围绕物理空间进行三维理解与智能化改造。

2018

首个购物中心的计算规模

据林元庆回忆,早期系统需要 150 台 8 卡 GPU 服务器,一天视频数据要计算约 10 天。

约 8—9 个月后

从 150 台降到 12 台

同等数据量的计算时间压缩到一天,受访方称计算效率提升接近 100 倍。

此后至今

从云端 GPU 走向摄像头端

超过 90% 的计算被放入摄像头,相关任务最终不再依赖独立 GPU 服务器。

注:时间线依据受访方回忆整理;“至今”对应访谈时点,未给出具体日期。

这条时间线能证明的是工程优化能力,而不是“物理世界 AGI 已经实现”。从算法、蒸馏、量化、剪枝到边缘计算,长期积累确实形成了成本壁垒;但它距离通用能力,还隔着数据质量、跨环境泛化和安全治理。

03它能做什么 把线下经验改写成可计算的业务漏斗

在线上世界,UV、PV、停留和转化早已是产品经理的日常指标。线下空间过去缺少稳定的逐人识别与轨迹数据,爱笔试图用三维感知把这套方法搬进购物中心、道路和机场。

珠宝门店:从“感觉经营”到逐段定位问题

  • 系统分析门店门口经过人数、进店人数、停留超过 8 分钟的人数,以及最终下单人数。
  • 项目持续了三个多月,改进方向包括产品设计年轻化与提升店员接待能力。
  • 受访方称,门店业绩提升 146%,交给购物中心的抽成租金增加约 5 倍
业务闭环:识别客流损耗点 → 调整商品与服务 → 用结果验证改造是否有效。

北京联想东桥:用路口数字孪生优化红绿灯

  • 项目持续约 6 个月,对机动车、非机动车和行人的位置、速度、朝向进行三维感知。
  • 受访方称,早晚高峰拥堵系数下降约 一半,全天车辆通过数量同比提升约 14%
  • 方案使用现有摄像头完成 3D 感知,不依赖额外雷达设备。
与传统地图数据的差别:从车流和速度的宏观估计,推进到路口内每个参与者的实时状态理解。

机场与海外项目:把场端智能接入复杂空间

  • 马斯喀特机场项目覆盖航站楼、停机坪、周边停车场与道路,成为受访方所称的海外标杆项目。
  • 在机场场景中,系统需要同时处理人、车、行李和飞机等多类物体及其空间关系。
  • 受访方还称,全国客流量排名靠前的机场中有 16 家与其深度合作,但未披露合作口径、合同规模与持续时间。
判断边界:复杂场景落地说明方案具备项目交付能力,但不能直接等同于已形成全球通用平台。

注:案例中的业绩、覆盖数量与合作情况均为受访方披露,未提供第三方审计或统一统计口径。

04为什么能做到 真正的中间层,是把复杂能力变成产品

爱笔的技术路线并非单独训练一个模型解决所有问题,而是先建立空间智能中间层:让系统知道人、车、飞机、商品分别在哪里,正在做什么,以及它们之间如何交互;上层应用再调用这些结构化结果。

感知层
摄像头、计算机视觉、3D 感知,采集真实空间中的物体和运动状态。
空间层
三维建模与时空理解,统一描述位置、速度、方向和交互关系。
分析层
大数据分析与语言大模型,把感知结果转化为业务建议。
应用层
客流、停车、导航、招商、营运、营销智能体,直接连接客户的经营流程。
协同层
机器人与场端智能,为自动代客泊车、配送机器人等未来设备提供环境信息。

注:技术栈为受访方对产品架构的概括,实际项目中的模块组合和部署方式可能不同。

产品化的价值,最终要体现在成本曲线上。林元庆称,一个 10 万平方米购物中心的三维建模,行业通常需要约 300 万至 500 万元,而爱笔可以做到 10 万元以内;北京海淀区道路三维扫描,其他公司报价曾高达 2 亿至 3 亿元,爱笔项目报价为 800 万元。

受访方披露的成本对比
10 万平方米购物中心
传统方案
300—500万
同类购物中心
爱笔方案
<10万
海淀道路扫描
其他报价
2—3亿
海淀道路扫描
爱笔项目
800万

注:柱形仅作数量级示意,非严格比例;两组项目的具体范围、验收标准与服务周期未在访谈中完整披露。

所以,“结硬寨,打呆战”并不是一句性格描述,而是一种工程策略:先把底层技术抽象出来,再通过边缘计算和算法优化,把一次性项目压缩成可迁移的产品。

05下一站:视觉基础模型 从理解特定物体,走向理解整个世界

林元庆认为,具身智能需要“身体”进入真实空间,但在此之前,更底层的能力是视觉系统本身:它要像人的眼睛一样实时感知,理解三维深度、语义和像素级细节。

R Realtime
实时感知
D Depth
三维深度
S Semantic
语义理解
P Pixel-level
像素级细节

注:LVM-rtdsp 是受访方提出的视觉基础模型方向,四个字母分别对应实时、深度、语义和像素级能力。

这套设想与具身智能的关系,是先提供环境智能,再让机器人、车辆和其他设备调用环境信息。例如,购物中心停车系统可以预置自主代客泊车所需的场端能力;当车端能力成熟后,只需升级场端算法,便可能形成车端与场端的协同。

受访方还预测,基于固定摄像头与预先三维建模的“第三视觉”学习框架,可能比移动设备主导的“第一视觉”更早成熟 2 至 3 年,并认为通用视觉模型可以让部分自动驾驶训练效率提升 万倍以上

但预测不是验证。

报道中的判断 目前能支持的证据 仍需验证的问题
场景数据是核心资产 长期积累固定摄像头数据,并已用于购物中心、道路、机场等项目。 数据是否覆盖足够多的天气、设备、区域与异常情况,尚无公开数据集说明。
技术具备跨行业迁移性 受访方披露已覆盖四类主要场景,底层使用相近的空间智能能力。 不同场景的实际部署周期、误检率、维护成本与失败案例未披露。
将成为世界模型的一部分 具备感知、建模、分析和场端协同的产品链路。 缺少公开的独立基准,无法据此判断其是否达到通用视觉基础模型水平。
未来 3—5 年成为行业标配 受访方称头部购物中心、机场和新能源汽车门店已有较大覆盖。 市场份额、收入质量、续约率和客户投入产出比仍缺少可核验数据。

注:表格将受访方观点与可验证程度拆开呈现;“已覆盖”不代表公开证明了规模化盈利或行业标准地位。

编辑核心判断

爱笔真正的护城河,不是“每天处理 100 万小时视频”这句数字,而是把固定摄像头数据、三维空间中间层与客户业务闭环,压进了一个可以交付的成本结构。

但就现有公开材料看,它更像一家在复杂线下场景中积累深厚的空间智能工程公司,尚不能仅凭访谈宣称已经证明了通用物理世界 AGI;独立评测、隐私合规、持续经营数据和跨场景失败率,都是必须补上的证据。

物理世界 AI 的行业分水岭,不是模型能否“看懂”一段视频,而是能否在不同场景中以可接受成本,稳定、合规地把理解转化为结果。

如何进一步了解

原文未提供面向公众的体验地址或下载入口,也未披露可直接试用的开放产品。

建议的验证路径:要求查看脱敏场景数据、部署成本、误检率、连续运行时间与客户续约情况,再通过企业合作渠道获取项目演示。