动态

介绍类GPT-4o的多模态大模型Stream-Omni

介绍类GPT-4o的多模态大模型Stream-Omni
Shaolei Zhang
Stream-Omni:一个类GPT-4o的文本-视觉-语音多模态大模型
(1)同时支持文本、视觉、语音输入,生成文本和语音回复。
(2)语音交互过程中,同步生成中间的语音识别、文本回复结果,提供更加全面的多模态交互体验!

论文:
https://
arxiv.org/abs/2506.13642
代码&Demo:
https://
github.com/ictnlp/Stream-
Omni
动态Shaolei Zhang2025-06-18原文

相关内容