🧭 AI 基础设施 · 产品发布

科大讯飞发布星火 Token Factory:替企业"统管"大模型,称昇腾推理效率较开源框架提升约 5 倍

7 月 19 日,科大讯飞推出企业级 AI 模型智能路由平台星火 Token Factory,定位为企业应用与大模型之间的统一中间层,主打统一接入、智能路由、Token 成本优化与安全合规治理,官方称其推理引擎在昇腾硬件上较开源 vLLM-Ascend 效率提升约 5 倍——企业 AI 的竞争焦点,正在从「谁的模型强」转向「谁会把模型管好」。

来源:公开报道 2026-07-23 全文约 3 分钟读完
#科大讯飞 #星火TokenFactory #模型路由 #AI基础设施 #昇腾算力
≈5× 官方称推理效率较开源 vLLM-Ascend 提升(昇腾硬件)
30–40% 首 Token 延迟降低幅度(官方基准测试口径)
<100ms 智能路由平均决策延迟

⚡ 30 秒速览

  • 它是什么:企业应用与大模型之间的「统一中间层」,覆盖统一接入、智能路由、Token 成本优化、安全合规治理,形成「接入—治理—观测—运营」闭环。
  • 路由怎么玩:按 Prompt 长短、对话轮次、session 亲和等特征把请求分为 L1–L3 三级,综合质量、成本、延迟、可用性、安全等级五个因子「派单」,平均决策延迟 <100ms。
  • 最硬的数字:官方称昇腾上推理效率较开源 vLLM-Ascend 提升约 5 倍、首 Token 延迟降 30%–40%,同等算力可支撑「接近翻倍」的请求量——但暂无第三方复测。
  • 治理三板斧:三权分立、不可篡改的全链路审计、敏感信息分级路由「不出域」,直指央国企私有化部署场景。
  • 一个提醒:本篇为科大讯飞供稿通稿,所有性能与效果表述均为厂方口径,无定价、无客户案例、无第三方数据。
🔍 编辑视角 · 先看清来源,再消化数字

原始报道文末注明「本文由科大讯飞提供,获授权转载」——本质是一篇企业通稿,而非独立报道。

这意味着:「效率提升约 5 倍」「首 Token 延迟降低 30%–40%」等关键数字全部来自讯飞自家基准测试,原文未披露测试模型、并发规模与硬件配置,也没有第三方复现、客户名单与定价信息,「降本」无法折算成具体账单。另一个值得留意的口径细节:官方同时给出「同等算力支撑接近翻倍请求量」的换算,与 5 倍数字之间的关系未展开说明。

建议读法:把它当作讯飞对「企业 AI 中台」需求的一次产品化回答,而非性能定论。我们的独立判断是——模型路由 / AI 网关赛道(OpenRouter、各云厂商 MaaS 均在布局)已是兵家必争,讯飞真正的差异化不在路由算法本身,而在「国产算力深度优化 + 等保级治理」的组合拳,目标直指私有化部署的央国企与强监管行业。这个定位是否成立,等第三方实测与客户案例说话。

01企业为什么突然需要"模型中台"?

大模型应用正从单点试点走向多业务、多场景、多团队协同。一家企业往往要同时接入多个模型服务,支撑代码助手、智能客服、知识问答、内容生成、文档处理等不同场景——模型越接越多,管理却跟不上了。

矛盾集中在两处:不同任务复杂度差异显著,实际应用中却往往用统一模型通吃,导致资源利用率不高、Token 成本持续上涨;而多模型并行运行,又对系统稳定性、安全治理与运营管理提出了更高要求。

上一阶段 · 模型能力建设

关注模型本身能力是否足够强大,以单点试点为主。

现阶段 · AI 基础设施建设

关注稳定运行、统一治理、持续优化与成本可控。

原文的判断很直白:「企业关注的重点,不再仅仅是模型本身能力是否足够强大,而是如何让模型能力真正融入业务体系。」星火 Token Factory 正是冲着这个转折点来的。

02智能路由:给每个请求"派最合适的单"

平台先对请求做复杂度「体检」,再决定派给哪个模型:

请求进入复杂度判定 L1–L3五因子匹配模型转发执行全程留痕
3任务等级(L1–L3)
5复杂度判定特征
5模型匹配因子
<100ms平均决策延迟

判定特征包括 Prompt 长短、规则预置、自定义规则、对话轮次、session 亲和(同一会话保持在同一模型)五个维度;匹配时综合考虑质量、成本、延迟、可用性、安全等级五个因子。

最终效果:文本分类、信息抽取等简单任务交给更具性价比的模型,长文档分析、复杂推理等高复杂度任务优先匹配高能力模型——以此压低大尺寸模型的调用压力,为企业释放成本优化空间。省下的,都是真金白银的 Token。

03推理引擎:把宝押在国产算力上

国产化私有部署场景下,推理引擎直接决定算力利用率与服务成本。讯飞围绕昇腾硬件特性,对主流开源大模型做了从底层算子到上层调度的端到端优化,共分四层:

🗜️

显存侧

多种模型压缩与精度优化技术,在精度可控的前提下大幅降低显存占用——有限硬件得以承载更大规模模型、更长上下文与更高并发。

⚙️

计算与通信侧

融合核心计算算子,把零散计算合成高效指令序列;对多卡通信做调度重排,实现计算与通信的并行重叠

🗄️

缓存与调度侧

跨节点分布式 KV Cache 与多级存储调度,引入 Cache-Aware 缓存路由与上下文复用重组策略,提升长上下文、高并发场景下的缓存命中率。

解码侧

面向昇腾硬件的并行解码加速机制,缩短生成密集场景下的端到端延迟。

官方实测(相同昇腾硬件、主流开源模型):

vLLM-Ascend开源框架 · 基线
星火 Token Factory讯飞 · 昇腾端到端优化
≈5×

注:柱形为零起点的相对推理效率倍数示意。「提升约 5 倍」与「首 Token 延迟降低 30%–40%」均为讯飞官方基准测试结果,测试配置未公开,暂无第三方复测;官方另给出「同等昇腾算力可支撑接近翻倍业务请求量」的换算,与 5 倍数字的口径关系未展开说明。

04治理与算账:央国企最关心的两件事

🛡️

三权分立

管理不碰数据、操作不碰权限、审计不碰业务,三者相互独立、相互制约;结合混合授权,从制度与技术双重层面杜绝越权与数据泄露。

📋

审计日志

关键操作自动生成不可篡改、不可删除、不可绕过的全链路审计记录,覆盖数据访问、权限变更、模型调用、数据导出等六大类操作,满足等保要求。

🔒

敏感信息防护

覆盖身份证、手机号、银行卡、姓名、地址、邮箱、车牌等个人隐私,以及财务、薪资、合同等经营数据,进行分级路由——敏感数据不出域

💰

成本归因

日志追踪、路由决策记录、Token 消耗统计与成本归因分析,配合预算管理、ROI 分析与可视化报表。官方的说法是让 AI 应用「从黑盒运行走向透明运营」。

05这件事的行业坐标

星火 Token Factory 的本质是 AI 网关 / 模型中台——这个赛道在全球已有 OpenRouter 等玩家,国内云厂商的 MaaS 平台也在铺设类似能力。讯飞的打法很明确:不和通用模型比「聪明」,而是吃「国产算力 + 私有化部署 + 合规治理」这碗饭。

讯飞官方定调:企业大模型应用正在「从单点探索迈向规模化运营」,竞争从模型能力转向应用价值,投入产出比、运营效率与长期治理能力成为新考题。这款产品,就是讯飞交出的答卷。

编辑核心判断

当大模型变成可插拔的零件,「把一堆模型管得更省、更稳、更透明」本身就是新的竞争力。

如果你在评估这类平台四个该问的问题

  1. 要求厂商用你家的真实业务流量复测「5 倍」数字——官方基准与生产环境往往是两回事。
  2. 问清路由误判的回退机制:简单请求被派给高成本模型时,损失如何控制、由谁兜底?
  3. 核对审计、等保与「数据不出域」是否覆盖你所在行业的监管细则,而非泛泛合规。
  4. 横向对比替代方案(OpenRouter、云厂商 MaaS 网关等)的定价模型与供应商锁定风险

原文未提供公开体验入口或试用链接;以上为编辑建议,不构成采购意见。产品详情以科大讯飞官方披露为准。