⚙️ 云计算 · AI 基础设施

统一 Spark 与 Ray 架构:腾讯云发布 AI DLC,将 Agent 数据处理至应用耗时缩短八成

7 月 30 日,腾讯云发布智能数据湖计算平台 AI DLC。该平台在业界首次实现全托管 Spark 与 Ray 的同架构运行,压缩了从数据清洗到模型训练、推理及 Agent 反馈的跨平台搬运损耗。

来源:公开报道 2024-07-30 全文约 2 分钟读完
#腾讯云 #AIDLC #数据湖 #Agent基础设施
-80% 端到端处理耗时(内部业务实测)
1/5 同等任务所需算力消耗
3.6 标准测试下查询性能提升

⚡ 30 秒速览

  • 解决什么问题:过去数据团队用 Spark 清洗、AI 团队用 Ray 训练,数据需反复跨平台搬运;AI DLC 实现两套框架同一平台运行,共享资源与权限。
  • 架构特点:Serverless 架构,按任务秒级弹性伸缩;将 CPU、GPU、TPU 纳入统一资源池调度,已适配国产主流 GPU 芯片。
  • 核心计算引擎:搭载自研向量化引擎 Meson(Spark 查询最高加速 5 倍)与多模态引擎 Xpark(推理吞吐提升 3 倍)。
  • Agent 数据回流:Agent 运行产生的轨迹与反馈可实时沉淀至数据湖,完成清洗与后训练后反哺模型,形成闭环。

01解决割裂: Spark 与 Ray 的同平台融合

企业在开发 AI 应用时,数据处理与模型链路通常由两套工程体系割裂支撑。AI DLC 通过统一底座将链路直接打通:

传统开发模式

Spark 处理数据 → 写入存储 → 跨平台搬运 → Ray 进行训练与推理。数据反复搬运,权限与算力分别维护。

AI DLC 融合模式

Spark 与 Ray 共享同一数据湖与权限体系。数据清洗完成后,直接在同一平台交付 Ray 进行训练与推理。

平台基于 Serverless 机制运作,避免企业长期维护固定集群。异构算力按任务类型动态分配:

CPU / GPU / TPU 统一池任务动态调度运行结束自动释放

02落地效果:内部 Agent 与智驾场景实测

🤖 腾讯自研 Agent(WorkBuddy)数据量月增速 > 100%

  • 数据规模:运行中持续产生对话、文档及用户反馈,部分单字段数据达 GB 级。
  • 落地表现:接入 AI DLC 后,同一批数据处理的端到端耗时降低 80%,完成相同任务的算力成本降至约五分之一(企业披露数据)。
  • 链路闭环:运行轨迹沉淀至数据湖,直接完成清洗、特征提取与评估回流,构建自动化后训练流水线。

🚗 博世自动驾驶(ARENA 统一管控平台)日处理上万推理任务

  • 痛点:测试车辆每日生成海量视频及传感器数据,抽帧清洗依赖 CPU,脱敏与模型训练依赖 GPU。
  • 实际应用:通过统一调度平台沉淀 200 多个推理模板,实现 CPU/GPU 混合负载调度,提升智驾数据闭环效率。

03底层支持:两大自研计算引擎表现

⚡ Meson(向量化计算引擎)

兼容 Spark API 与生态。企业披露的标准测试中,查询性能提升 3.6 倍,复杂查询最高加速 5 倍,CPU 使用率降低约一半。

🖼️ Xpark(多模态计算引擎)

针对文档、图片及音视频提供 50 多种算法算子。对比开源方案,推理吞吐提升 3 倍,GPU 利用率接近 100%。

注:以上提升幅度均引自企业发布会及内部测试基准数据,实际业务表现受集群配置与负载类型影响,待第三方复测。

📌 编辑视角

关于信息来源:本篇报道主要基于企业单方发布的技术架构与内部实测数据(如 WorkBuddy 端到端耗时降 80%),目前尚缺乏第三方基准测试(如 TPC-DS 或开源 Benchmark)对 Meson/Xpark 引擎性能的独立交叉验证。

业务落地考量:尽管博世案例展现了工业级部署可行性,但在复杂企业环境中,异构芯片(国产 GPU 与主流卡)混合调度的实际稳定性与迁移成本,仍需更多外部客户验证。

💡 行业判断:AI 数据平台正在从单纯的「静态存储分析」向「Agent 运行时基础设施」演进,数据的实时反哺与后训练闭环将成为云计算厂商的新竞争焦点。
服务通过腾讯云控制台以 Serverless 托管形式开放提供,支持通过 MCP、Skills 及 Open API 接入。