Hugging Face 开源新编码模型,CPU 长文本推理快 3.7 倍、14 模型评测排第四
Hugging Face 发布 LFM2.5-Encoders(230M / 350M 双规格),在 8,192 token 上下文的 CPU 推理中,以 28 秒完成一次前向传播——同条件 ModernBERT-base 需 90 秒以上。在 14 模型 17 任务综合评测中,350M 版本排名第四,前三名体量均超其数倍乃至十倍。
Hugging Face 发布 LFM2.5-Encoders(230M / 350M 双规格),在 8,192 token 上下文的 CPU 推理中,以 28 秒完成一次前向传播——同条件 ModernBERT-base 需 90 秒以上。在 14 模型 17 任务综合评测中,350M 版本排名第四,前三名体量均超其数倍乃至十倍。
评测覆盖 14 个模型、17 项任务(来自 GLUE、SuperGLUE 与多语言分类),每个模型在每项任务上完全微调,取 5 个 held-out seeds 的均值,确保分数稳定可复现。完整框架与原始结果已开源。
关键位次如下(原文未公布完整 14 模型排名,仅披露以下位次信息):
注:原文未公布完整排名表与具体分数,柱形仅示意相对位次,非精确数值。350M 排第 4,前三名均体量更大,其中含一个 3.5B 模型(近 10 倍于 350M);230M 击败 ModernBERT-base 与全部 EuroBERT,且比多数更小。两个编码器的得分也均高于 Hugging Face 自家上月发布的 LFM2.5-Retrievers。
编码模型是现代生产 NLP 系统的底座——分类器、意图路由、安全过滤器都跑在它上面。这些任务 全天候运行在 CPU 上,输入越来越长,成本和速度直接决定能否落地。BERT 确立了这个范式,ModernBERT 近期推进了精度与速度,LFM2.5-Encoders 是下一步。
两个模型从 LFM2 decoder backbone(230M / 350M)初始化,通过若干改动将 causal decoder 转为 bidirectional encoder,以掩码语言建模目标预训练,可微调用于分类、token 级任务和搜索。
确立了编码模型范式,但在长输入下吞吐量急剧下降,8K token CPU 推理需 90 秒以上。
继承 LFM2 架构快速推理特性,成本随输入长度增长缓慢,8K token CPU 推理 28 秒完成。
两个规格均支持 8,192 token 上下文,与 ModernBERT 持平;但在长输入下的速度优势随长度增大而持续扩大。
在 8,192 token 上下文(一份完整合同、一份会议转录、一个长客服对话串的典型长度)下,CPU 单次前向传播耗时对比:
8,192 token / CPU 单次前向传播
同样条件,快 3.7 倍
更关键的趋势:随输入增长,ModernBERT 吞吐量急剧下降,而 LFM2.5-Encoders 先升至中段再逐步收敛。230M 版本在所有序列长度上都是最快编码器——短输入时甚至比更小的 ModernBERT-base 还快。
GPU 上呈现类似模式但差距较小:Apple GPU 上约 2K token 起 LFM2.5-Encoders 反超,短于 1K 时 ModernBERT-base 仍领先。
实测含义:开发者可以在笔记本 CPU 上,30 秒内扫描或分类一份完整合同、转录或长客服对话——无需 GPU。
当你有一项高吞吐的理解类任务——需要全天候运行、必须便宜且快——微调后的编码器比生成式 LLM 更小、更快、运行成本远低,且能跑在你已有的 CPU 上。
将用户输入分发到对应处理流程,全天候运行,延迟敏感。
对内容做合规策略校验,充当安全过滤器。
从文本中识别个人身份信息,token 级标注任务。
对长文档做分类、打分、提取,8K 上下文一次跑完。
两个规格的选择逻辑:
速度优先,CPU 上所有序列长度最快,适合延迟敏感的高频任务。
精度优先,评测排名第 4,适合对准确率要求更高的理解任务。
本文原始来源为 Hugging Face 官方博客,属产品发布通稿性质。评测数据为单方披露,未见第三方复测;但评测框架与 17 项任务的原始结果已开源,可逐条复现。速度数据为官方自测,测试环境(CPU 型号、批次大小等细节)未在博客中完整披露,实际表现需以自测为准。
编码模型是生产 NLP 的隐形底座。当 8K 上下文 CPU 推理从分钟级压到秒级,意味着大量理解类任务可以从 GPU 集群下沉到已有 CPU 基础设施——这不是模型参数的胜利,是架构工程在重塑成本结构。
两个规格均已开放权重,安装最新版 transformers 即可加载,附微调教程与 CPU-only 在线 Demo。
huggingface.co → 搜索 LFM2.5-Encoder