动态

Uni-MoE-2.0-Omni发布,多模态理解与生成统一

Uni-MoE-2.0-Omni发布,多模态理解与生成统一
Yunxin Li
我们激动地宣布Uni-MoE-2.0-Omni——一个突破性的全能多模态大模型,从多模态理解进化到无缝理解与生成!

新特性:
我们探索了如何通过渐进式架构演变和训练策略,将密集LLM转化为高效的MoE驱动的全能多模态大模型。

架构创新:
- 新颖的全能3D RoPE + 动态容量MoE
- 统一语音、文本、图像、视频在时空维度上的对齐,更适合全能多模态输入
- 基于任务复杂度的自适应计算分配
- 深度融合的多模态编码器-解码器设计
- 支持任意输入/输出模态组合
- 实现真正的全能多模态交互与生成

训练突破:
渐进式训练策略:
跨模态对齐 → 专家预热 → MoE微调与RL → 生成训练
高效地将密集LLM扩展到基于MoE的全能多模态大模型,总计75B tokens
确保稳定收敛,数据量更少,尤其适用于RL

基于语言锚定的混合理解与生成训练
在语言生成框架下统一理解与生成任务
打破模态之间的障碍

能力:
语音生成与交互
图像生成与编辑
图像/视频理解
视听推理
以及10+多模态任务!

关键结果:
在76个可比任务中,以仅75B tokens优于Qwen2.5-Omni(1.2T tokens)50+项!
视频理解(8):+5%
全能理解(4):+7%
语音问答:领先+4.3%
图像处理:领先+7%

现已开源!
模型:https://huggingface.co/collections/HIT-TMG/lychee-uni-moe-20…
代码:https://github.com/HITsz-TMG/Uni-MoE/tree/master/Uni-MoE-2…
主页:https://idealistxy.github.io/Uni-MoE-v2.github.io/…
AK
Uni-MoE-2.0-Omni

以语言为中心的全能多模态大模型,采用先进的MoE、训练与数据 https://t.co/6BBVKL8ryF
动态Yunxin Li2025-11-18原文

相关内容