🔧 基础设施 · 架构突破

星环科技推出全球首个完整 GPU 原生数据库,把数据"户口"从 CPU 搬到 GPU

7 月 18 日 WAIC 期间,星环科技发布面向 AI Agent 的新一代高性能数据库。存储、计算、编译、执行引擎全栈重写为 GPU 体系,TPC-DS SF1000 基准测试相对 DuckDB 获得 70 倍加速,目标直指 Agent 推理链路中"GPU 干等数据"的存储墙瓶颈。

来源:公开报道 2026-07-18 全文约 4 分钟读完
#星环科技 #GPU原生数据库 #AI Agent #WAIC 2026
🥇 全球首个 完整 GPU 原生数据库 · 全栈重写
70× TPC-DS SF1000 相对 DuckDB 加速
5881× 智能投研任务最高加速倍数

⚡ 30 秒速览

  • 问题在哪:Agent 多步循环一次复杂任务触发数百次数据访问,数据在 CPU 内存与 GPU 显存间反复搬运,GPU 利用率降到 30%–40%
  • 怎么解决:把存储层、计算层、编译层和执行引擎全部围绕 GPU 重写,实现 GIDS(GPU 直连存储),绕过 CPU 和主机内存。
  • 性能跃迁:TPC-DS 99 项查询获 70 倍 加速;企业知识库文档解析 10 倍、检索 20 倍、端到端推理 6 倍
  • 不是 GPU 加速,是 GPU 原生:市面已有产品只把部分功能放 GPU,星环把整个数据库"户口"迁过去。
  • CEO 原话:"模型给的是概率答案,数据库给的是精准答案。"——数据库要成为 Agent 的"真相所在"。

01Agent 干等数据 GPU 利用率被压到三四十

过去两年大模型应用以单轮问答为主;如今 Agent 转向多步骤循环,一次复杂任务可能触发数百次数据访问,多 Agent 并发时数据处理需求呈数量级增长。

瓶颈出在 CPU 与 GPU 的硬件代差,以及数据搬运拉长的链路:

CPU 侧 · 数据库传统驻地

  • 通用核心约 百级
  • 内存带宽约 400 GB/s
  • 承担查询、检索、解析

GPU 侧 · 模型推理驻地

  • 并行计算单元 万级
  • 显存带宽 数 TB/s
  • 承担推理、向量、图计算

数据需在 CPU 内存与 GPU 显存间反复搬运,存储墙使延迟被调用次数放大。"它就是在干等,等着数据处理完。"孙元浩说。GPU 利用率被压到 30%–40%,昂贵算力在闲置。

继续堆 CPU 节点治标不治本——内存、交换机、电力、散热同步扩容,总成本增长更快。孙元浩判断:"CPU 已经跟不上,就要用 GPU 来算。"

02把数据库"户口"迁到 GPU 不是加速,是重写

孙元浩用了一个比喻区分两类产品:"部分功能放 GPU,就像坐一段飞机再步行一段,再坐飞机再步行——整个数据分析时间被明显拖慢。"

GPU 加速数据库

部分数据库功能放到 GPU 上,其余仍在 CPU 侧执行,数据需跨硬件搬运。

GPU 原生数据库

存储层、计算层、编译层、执行引擎全部围绕 GPU 重写,SQL 分析、向量检索、图计算留在同一套 GPU 体系内完成。

技术核心是 GIDS(GPU-Initiated Direct Storage)——由 GPU 直接发起存储访问,完全绕过 CPU 和主机内存,实现真正意义上的 GPU 直连存储。三个价值:消除 CPU 瓶颈、降低数据传输延迟、最大化 GPU 利用率。

经济性拐点也在此时出现:性能提升一两倍难以摊薄 GPU 成本;当提升达数十倍甚至上百倍,企业完成相同任务所需机器数量和运行时间明显下降,单位任务成本才出现向下拐点。

03性能跃迁 四组测试场景

智能投研任务因子计算/历史回测/策略验证
5881×
TPC-DS SF100099 项完整查询 · 对比 DuckDB
70×
知识检索性能企业知识问答场景
20×
文档解析与知识入库含 OCR · 8.9 万页文档
10×
单题端到端推理含解析/检索/推理全链路

注:柱形按最大值(5881×)等比缩放,因跨度极大低倍数项几乎不可见;精确倍数以右侧标注为准。智能投研场景为不同测试任务中的最高值,非单一任务固定值。

04真实业务验证 两个落地场景

📚 企业知识问答:8.9 万页文档 + 2600 万数值准确率 79.3%

  • 系统需处理 8.9 万页文档、2600 万个数值及大量分析与推理任务。
  • 含 OCR 的文档解析与知识入库性能提升约 10 倍,检索提升约 20 倍,单题端到端推理提升约 6 倍
  • 过去有客户将数据导入向量库需等一个月,数据更新又要重复漫长流程——"一次入库等一个月,企业根本无法接受。"
最终任务准确率达 79.3%,为同场景可比基准下的可验证结果。

💹 智能投研:同一天验证几百倍策略30×–5881×

  • 因子计算、历史回测、参数搜索、策略验证均需反复扫描多源数据,星环在不同测试任务中实现 30 倍至 5881 倍性能提升。
  • 研究人员可在同一天验证更多因子和策略,扩大搜索空间,在市场窗口关闭前完成验证。
  • "谁先把有效策略投入市场,谁就能更早获得收益。"——孙元浩

05为什么是星环先做到?十二年分布式积累

孙元浩把全栈重写比作"从地球移民到火星"——原来成熟的软件包和工具大多不能直接用,很多东西得自己重做。

星环科技 2013 年成立,长期投入分布式数据库和多模型数据管理,2020 年提出多模型数据库方向。GPU 的高并行计算架构与既有技术路线存在延续性:

任务拆解调度数据分区多模型统一

过去二十年数据库通过 Scale-out(水平扩展)解决单机性能不足;如今 GPU 强大算力与高速互联推动计算重新走向高密度 Scale-up(垂直扩展)。分布式时代积累的能力,构成了此次架构迁移的基石。

在星环的 GPU 原生架构中,数据库不再只是存储和查询容器,而是进化为能理解语义、管理长期记忆、主动为 Agent 供给上下文的认知基础设施——统一承载关系型、向量、图、全文和文档多模型数据,减少多库拼接产生的数据复制与系统割裂。

编辑视角

本文核心数据(70 倍加速、5881 倍提升、79.3% 准确率)均来自星环科技单方披露,尚未见第三方独立复测;TPC-DS 对比对象为开源 DuckDB,未涵盖同代商业云数仓全量横评,读者宜将倍数视为"企业自报上限"而非行业共识。

尽管如此,架构方向成立:Agent 多步循环确实在把数据访问从"一次问答"推向"百次并发",CPU 内存带宽与 GPU 显存带宽的代差是物理事实,GIDS 绕过主机内存的思路在 HBM 时代有工程合理性。国产算力适配与超大规模数据管理的长期验证仍需观察。

当 GPU 从模型推理专属算力进一步进入数据分析、知识检索和记忆管理,数据库行业的"CPU 时代"正在被改写——谁先跑通 GPU 原生全栈,谁就握住了 Agent 基础设施的入场券。

进一步了解

星环科技 GPU 原生认知数据库已进入真实业务场景验证阶段,产品文档与适配进展见官网。

transwarp.cn → 产品与适配进展