科大讯飞发布星火 Token Factory:替企业"统管"大模型,称昇腾推理效率较开源框架提升约 5 倍
7 月 19 日,科大讯飞推出企业级 AI 模型智能路由平台星火 Token Factory,定位为企业应用与大模型之间的统一中间层,主打统一接入、智能路由、Token 成本优化与安全合规治理,官方称其推理引擎在昇腾硬件上较开源 vLLM-Ascend 效率提升约 5 倍——企业 AI 的竞争焦点,正在从「谁的模型强」转向「谁会把模型管好」。
7 月 19 日,科大讯飞推出企业级 AI 模型智能路由平台星火 Token Factory,定位为企业应用与大模型之间的统一中间层,主打统一接入、智能路由、Token 成本优化与安全合规治理,官方称其推理引擎在昇腾硬件上较开源 vLLM-Ascend 效率提升约 5 倍——企业 AI 的竞争焦点,正在从「谁的模型强」转向「谁会把模型管好」。
原始报道文末注明「本文由科大讯飞提供,获授权转载」——本质是一篇企业通稿,而非独立报道。
这意味着:「效率提升约 5 倍」「首 Token 延迟降低 30%–40%」等关键数字全部来自讯飞自家基准测试,原文未披露测试模型、并发规模与硬件配置,也没有第三方复现、客户名单与定价信息,「降本」无法折算成具体账单。另一个值得留意的口径细节:官方同时给出「同等算力支撑接近翻倍请求量」的换算,与 5 倍数字之间的关系未展开说明。
建议读法:把它当作讯飞对「企业 AI 中台」需求的一次产品化回答,而非性能定论。我们的独立判断是——模型路由 / AI 网关赛道(OpenRouter、各云厂商 MaaS 均在布局)已是兵家必争,讯飞真正的差异化不在路由算法本身,而在「国产算力深度优化 + 等保级治理」的组合拳,目标直指私有化部署的央国企与强监管行业。这个定位是否成立,等第三方实测与客户案例说话。
大模型应用正从单点试点走向多业务、多场景、多团队协同。一家企业往往要同时接入多个模型服务,支撑代码助手、智能客服、知识问答、内容生成、文档处理等不同场景——模型越接越多,管理却跟不上了。
矛盾集中在两处:不同任务复杂度差异显著,实际应用中却往往用统一模型通吃,导致资源利用率不高、Token 成本持续上涨;而多模型并行运行,又对系统稳定性、安全治理与运营管理提出了更高要求。
关注模型本身能力是否足够强大,以单点试点为主。
关注稳定运行、统一治理、持续优化与成本可控。
原文的判断很直白:「企业关注的重点,不再仅仅是模型本身能力是否足够强大,而是如何让模型能力真正融入业务体系。」星火 Token Factory 正是冲着这个转折点来的。
平台先对请求做复杂度「体检」,再决定派给哪个模型:
判定特征包括 Prompt 长短、规则预置、自定义规则、对话轮次、session 亲和(同一会话保持在同一模型)五个维度;匹配时综合考虑质量、成本、延迟、可用性、安全等级五个因子。
最终效果:文本分类、信息抽取等简单任务交给更具性价比的模型,长文档分析、复杂推理等高复杂度任务优先匹配高能力模型——以此压低大尺寸模型的调用压力,为企业释放成本优化空间。省下的,都是真金白银的 Token。
国产化私有部署场景下,推理引擎直接决定算力利用率与服务成本。讯飞围绕昇腾硬件特性,对主流开源大模型做了从底层算子到上层调度的端到端优化,共分四层:
多种模型压缩与精度优化技术,在精度可控的前提下大幅降低显存占用——有限硬件得以承载更大规模模型、更长上下文与更高并发。
融合核心计算算子,把零散计算合成高效指令序列;对多卡通信做调度重排,实现计算与通信的并行重叠。
跨节点分布式 KV Cache 与多级存储调度,引入 Cache-Aware 缓存路由与上下文复用重组策略,提升长上下文、高并发场景下的缓存命中率。
面向昇腾硬件的并行解码加速机制,缩短生成密集场景下的端到端延迟。
官方实测(相同昇腾硬件、主流开源模型):
注:柱形为零起点的相对推理效率倍数示意。「提升约 5 倍」与「首 Token 延迟降低 30%–40%」均为讯飞官方基准测试结果,测试配置未公开,暂无第三方复测;官方另给出「同等昇腾算力可支撑接近翻倍业务请求量」的换算,与 5 倍数字的口径关系未展开说明。
管理不碰数据、操作不碰权限、审计不碰业务,三者相互独立、相互制约;结合混合授权,从制度与技术双重层面杜绝越权与数据泄露。
关键操作自动生成不可篡改、不可删除、不可绕过的全链路审计记录,覆盖数据访问、权限变更、模型调用、数据导出等六大类操作,满足等保要求。
覆盖身份证、手机号、银行卡、姓名、地址、邮箱、车牌等个人隐私,以及财务、薪资、合同等经营数据,进行分级路由——敏感数据不出域。
日志追踪、路由决策记录、Token 消耗统计与成本归因分析,配合预算管理、ROI 分析与可视化报表。官方的说法是让 AI 应用「从黑盒运行走向透明运营」。
星火 Token Factory 的本质是 AI 网关 / 模型中台——这个赛道在全球已有 OpenRouter 等玩家,国内云厂商的 MaaS 平台也在铺设类似能力。讯飞的打法很明确:不和通用模型比「聪明」,而是吃「国产算力 + 私有化部署 + 合规治理」这碗饭。
讯飞官方定调:企业大模型应用正在「从单点探索迈向规模化运营」,竞争从模型能力转向应用价值,投入产出比、运营效率与长期治理能力成为新考题。这款产品,就是讯飞交出的答卷。
当大模型变成可插拔的零件,「把一堆模型管得更省、更稳、更透明」本身就是新的竞争力。
原文未提供公开体验入口或试用链接;以上为编辑建议,不构成采购意见。产品详情以科大讯飞官方披露为准。