行业新闻

美团提出基于N-gram的嵌入扩展新范式 实现轻量化MoE高效进化

美团提出基于N-gram的嵌入扩展新范式 实现轻量化MoE高效进化

美团用N-gram技巧改造MoE,让大模型更轻量高效,适合资源受限场景。

美团技术团队提出一种基于N-gram的全新模型框架,通过嵌入扩展新范式实现轻量级MoE(混合专家模型,一种将多个专业化子模型组合以提升性能的结构),在保持效果的同时大幅降低计算成本,为模型部署提供更高效的方案。

正文摘录

![美团发布基于 N-gram 全新模型:嵌入扩展新范式,实现轻量化 MoE 高效进化](https://p1.meituan.net/meituantechblog/d76ddabeffc58fce059778b3d0c76bec377089.jpg) 美团发布基于 N-gram 全新模型:嵌入扩展新范式,实现轻量化 MoE 高效进化 美团技术团队 2026-02-10 LongCat 开源 大模型 传统 MoE(混合专家模型)架构通常通过增加专家数量来提升模型能力,但随着专家数量增加,会面临边际收益递减和系统通信开销上升等问题。美团 LongCat 团队通过全面的分析与实验发现:嵌入扩展相比专家扩展能获得更优的帕累托前沿。这意味着嵌入扩展在特定条件下相比专家扩展能实现更优的效能边界。 基于这些洞见,我们正式推出 LongCat-Flash-Lite —— 一款拥有 685 亿参数,每次推理仅激活 29 亿~45 亿参数的轻量化 MoE 模型。通过将超过 300 亿参数高效用于嵌入层,LongCat-Flash-Lite 不仅超越了参数量等效的 MoE 基线模型,还在与同规模现有模型的对比中展现出卓越的竞争力,尤其在智能体与代码领域表现突出,并依托 YARN 技术可支持最长 256K 上下文,能高效处理长文档、大规模代码分析等场景。同时,该模型基于嵌入扩展的应用与系统级优化,让模型推理效率大幅提升,在输入 4K,输出 1k 的典型负载下,LongCat API 可提供 500-700 token/s 的生成速度。 01 更优的扩展效率:从“堆专家”到“扩嵌入” N-gram 嵌入层的核心作用在于增强模型对局部上下文语义的捕获能力。

阅读原文(tech.meituan.com)→

行业新闻2026-02-10原文

相关内容