EntropyMoE 提出熵感知稀疏路由,无分词器大模型效率跃升近 40%
EntropyMoE 以熵感知路由机制重构稀疏专家分配逻辑,在无分词器大语言模型上实现路由效率提升 37%、长文本推理速度翻倍,为下一代高效基础模型开辟新路径。
EntropyMoE 以熵感知路由机制重构稀疏专家分配逻辑,在无分词器大语言模型上实现路由效率提升 37%、长文本推理速度翻倍,为下一代高效基础模型开辟新路径。
传统 MoE 路由(如 Top-K)对所有 token 一视同仁——无论信息量高低,都分配相同数量的专家。但在无分词器模型中,token 是字符或字节级别,信息密度差异极大:一个空格 vs 一个关键动词,在路由决策中被同等对待。
EntropyMoE 的解法很直接:计算每个 token 的熵值,高熵 token 路由到更多专家,低熵 token 走轻量路径。
—— 熵值越高,token 携带的信息量越大,越需要更多专家协同处理。
所有 token 分配 相同数量 的专家,忽视信息密度差异。空格、标点与核心动词争夺相同的计算资源。
按熵值 动态分配 专家数量:高熵 token 获得 2~4 个专家,低熵 token 仅用 1 个专家,算力效率大幅提升。
注:熵计算基于 token 的 softmax 输出分布,延迟极低,可忽略不计。负载均衡度越接近 100% 表示专家利用越均匀。
在 C4 与 The Pile 数据集上的评测显示,EntropyMoE 在同等计算量下全面优于传统路由策略。
注:柱形表示 perplexity(困惑度),越低越好。自 7.0 分起缩放,非零起点。EntropyMoE 在 7B 参数规模、同等训练算力下测得。
更关键的指标是计算效率:在达到相同 perplexity 时,EntropyMoE 所需的训练 FLOPs 比 Top-2 路由减少 22%,比密集模型减少 31%。
无分词器模型(Tokenizer-Free)直接处理字符或字节,天然具备多语言公平、拼写鲁棒、长文本无损等优势。但它的致命短板是:序列太长,信息密度太低——大量字符是空格、标点、停用词,传统路由把它们和高价值 token 同等对待,算力浪费严重。
EntropyMoE 的熵感知路由,恰好击中了这个痛点。
—— 它不是让模型变强,而是让模型把力气用在正确的地方。
「把这份中英日三语合同翻译成法语,保留所有数字和条款编号。」——无分词器模型天然支持多语言混合输入,EntropyMoE 确保高信息量的条款内容获得充足计算资源,标点和格式字符不浪费算力。
「总结这篇 80 页的量子计算论文,重点提取方法、实验设置和结论。」——128K 上下文窗口 + 熵感知路由,让长论文中的关键段落(方法、结论)获得更多专家关注,背景描述和参考文献走轻量路径。
「在 2 万行代码的仓库中找到所有未处理的异常,并给出修复建议。」——高熵的异常处理逻辑和 API 调用被精准捕捉,低熵的日志打印和注释行几乎不消耗计算资源。
EntropyMoE 的贡献不只是一项新技术——它揭示了 MoE 路由长期被忽视的一个基本事实:不是所有 token 都值得同等对待。
在无分词器模型中,这个事实被放大到极致:字符级 token 的信息方差,远大于词级 token。EntropyMoE 用熵这把尺子,精准度量了这种差异。
一个诚实的注脚:
熵计算本身带来额外开销,在短序列(<4K)场景下收益有限;此外,熵阈值的设定需要针对不同任务调优,并非「一次性解决所有问题」。但瑕不掩瑜——在长文本、多语言、代码生成等核心场景中,EntropyMoE 的收益远超其成本。
MoE 架构的下一个竞争焦点,正在从「谁的路由更均衡」转向「谁的路由更聪明」——熵感知让模型学会了判断信息的价值,这比单纯增加专家数量更有意义。
EntropyMoE 7B 权重、推理脚本与评测指南已在 GitHub 公开,支持单卡 A100 运行,可处理最长 128K 序列。
GitHub → EntropyMoE 开源仓库