星环科技推出全球首个完整 GPU 原生数据库,把数据"户口"从 CPU 搬到 GPU
7 月 18 日 WAIC 期间,星环科技发布面向 AI Agent 的新一代高性能数据库。存储、计算、编译、执行引擎全栈重写为 GPU 体系,TPC-DS SF1000 基准测试相对 DuckDB 获得 70 倍加速,目标直指 Agent 推理链路中"GPU 干等数据"的存储墙瓶颈。
7 月 18 日 WAIC 期间,星环科技发布面向 AI Agent 的新一代高性能数据库。存储、计算、编译、执行引擎全栈重写为 GPU 体系,TPC-DS SF1000 基准测试相对 DuckDB 获得 70 倍加速,目标直指 Agent 推理链路中"GPU 干等数据"的存储墙瓶颈。
过去两年大模型应用以单轮问答为主;如今 Agent 转向多步骤循环,一次复杂任务可能触发数百次数据访问,多 Agent 并发时数据处理需求呈数量级增长。
瓶颈出在 CPU 与 GPU 的硬件代差,以及数据搬运拉长的链路:
数据需在 CPU 内存与 GPU 显存间反复搬运,存储墙使延迟被调用次数放大。"它就是在干等,等着数据处理完。"孙元浩说。GPU 利用率被压到 30%–40%,昂贵算力在闲置。
继续堆 CPU 节点治标不治本——内存、交换机、电力、散热同步扩容,总成本增长更快。孙元浩判断:"CPU 已经跟不上,就要用 GPU 来算。"
孙元浩用了一个比喻区分两类产品:"部分功能放 GPU,就像坐一段飞机再步行一段,再坐飞机再步行——整个数据分析时间被明显拖慢。"
部分数据库功能放到 GPU 上,其余仍在 CPU 侧执行,数据需跨硬件搬运。
存储层、计算层、编译层、执行引擎全部围绕 GPU 重写,SQL 分析、向量检索、图计算留在同一套 GPU 体系内完成。
技术核心是 GIDS(GPU-Initiated Direct Storage)——由 GPU 直接发起存储访问,完全绕过 CPU 和主机内存,实现真正意义上的 GPU 直连存储。三个价值:消除 CPU 瓶颈、降低数据传输延迟、最大化 GPU 利用率。
经济性拐点也在此时出现:性能提升一两倍难以摊薄 GPU 成本;当提升达数十倍甚至上百倍,企业完成相同任务所需机器数量和运行时间明显下降,单位任务成本才出现向下拐点。
注:柱形按最大值(5881×)等比缩放,因跨度极大低倍数项几乎不可见;精确倍数以右侧标注为准。智能投研场景为不同测试任务中的最高值,非单一任务固定值。
孙元浩把全栈重写比作"从地球移民到火星"——原来成熟的软件包和工具大多不能直接用,很多东西得自己重做。
星环科技 2013 年成立,长期投入分布式数据库和多模型数据管理,2020 年提出多模型数据库方向。GPU 的高并行计算架构与既有技术路线存在延续性:
过去二十年数据库通过 Scale-out(水平扩展)解决单机性能不足;如今 GPU 强大算力与高速互联推动计算重新走向高密度 Scale-up(垂直扩展)。分布式时代积累的能力,构成了此次架构迁移的基石。
在星环的 GPU 原生架构中,数据库不再只是存储和查询容器,而是进化为能理解语义、管理长期记忆、主动为 Agent 供给上下文的认知基础设施——统一承载关系型、向量、图、全文和文档多模型数据,减少多库拼接产生的数据复制与系统割裂。
本文核心数据(70 倍加速、5881 倍提升、79.3% 准确率)均来自星环科技单方披露,尚未见第三方独立复测;TPC-DS 对比对象为开源 DuckDB,未涵盖同代商业云数仓全量横评,读者宜将倍数视为"企业自报上限"而非行业共识。
尽管如此,架构方向成立:Agent 多步循环确实在把数据访问从"一次问答"推向"百次并发",CPU 内存带宽与 GPU 显存带宽的代差是物理事实,GIDS 绕过主机内存的思路在 HBM 时代有工程合理性。国产算力适配与超大规模数据管理的长期验证仍需观察。
当 GPU 从模型推理专属算力进一步进入数据分析、知识检索和记忆管理,数据库行业的"CPU 时代"正在被改写——谁先跑通 GPU 原生全栈,谁就握住了 Agent 基础设施的入场券。
星环科技 GPU 原生认知数据库已进入真实业务场景验证阶段,产品文档与适配进展见官网。
transwarp.cn → 产品与适配进展