阿里推出AI语音平台CosyVoice Studio 将语义理解融入语音能力
阿里推出CosyVoice Studio,将语义理解融入语音能力,提供语音转写、音频创作和语音智能体,面向企业免费开放。
阿里发布国内首个一站式AI语音平台CosyVoice Studio,基于自研语音模型Qwen-Audio,提供语音键盘(可滤除口语词并生成结构化文本)、音频创作工具(支持播客与有声书生成)及语音智能体搭建功能,全面覆盖企业、开发者和个人用户的语音需求。
正文摘录
8月7日,阿里巴巴正式推出国内首个一站式 AI 语音生产力平台 CosyVoice Studio。该平台基于阿里推出的自研语音模型 Qwen-Audio 打造,在全球权威 AI 评测平台 Artificial Analysis 上,该模型斩获语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一。CosyVoice Studio 含有三个主要功能,其中语音键盘能够把说完的话变成去掉口语填充词逻辑更清晰的结构化文本,音频内容创作工具能把用户想讲的内容变成播客和有声书,语音智能体能够根据企业需求创建实时对话的语音智能体。该平台可全面满足企业、开发者和用户的 AI 语音需求。 语音正在成为 AI 时代人机交互的核心界面。随着大模型能力的成熟,用户在使用 AI 产品时越来越自然地选择语音对话而非文字输入。行业的技术架构也在随之演变,早期散点化的语音转写和语音合成工具,正在向端到端的语音 Agent 靠拢。CosyVoice Studio 将阿里的语音模型能力第一次以聚合产品的形态对外开放:企业用户可以在平台上直接体验效果,再按需调用 API,个人用户也能通过该产品直接使用。 语音键盘 CosyVoice 不仅具备通用的语音转文字能力,而且在转写之上叠加了语义理解和文本生成能力。在日常交流场景中,CosyVoice 会自动过滤“那个”“嗯”等口语填充词,将零散的想法整理为清晰有逻辑的表达。用户说话时的自我修正,比如“不对不对,我意思是”,不会留下改口痕迹,只保留最终意图。在正式工作场景中,口述一段话即可直接生成邮件、工作汇报、会议纪要的格式与话术。 面向专业场景,CosyVoice 支持数字、公式等特殊文本的智能转写,“三点五八亿”“百分之十二点六”可以直接输出为3.58亿、12.6%。