Cohere 发布开源语音识别模型 Transcribe,HuggingFace 排行榜第一
Cohere 开源了当前最准确的语音识别模型 Transcribe,在权威排行榜上领先,适合企业生产部署。
Cohere 宣布开源语音识别模型 Transcribe,基于 Conformer 架构(结合卷积与自注意力的声学模型),在 HuggingFace Open ASR 排行榜上以 5.42% 的词错误率(WER,越低越好)登顶,超越 Whisper、ElevenLabs 等模型。模型支持 14 种语言,拥有 2B 参数,可本地或云端部署,适用于会议转录、语音分析、实时客服等场景,采用 Apache 2.0 许可证。
正文摘录
Cohere 正式发布 Transcribe——一款开源、可在今日 [下载](https://huggingface.co/CohereLabs/cohere-transcribe-03-2026) 的先进自动语音识别 (ASR) 模型。 语音正迅速成为 AI 工作负载与自动化的核心模态——从会议转录、语音分析,到实时客服智能体。 我们的目标很直接:在实际条件下,把专用 ASR 模型的精度推向新前沿。该模型从零开始训练,刻意把降低词错误率 (WER, Word Error Rate) 作为重点,同时始终将生产就绪性放在首位。换句话说,它不只是研究产物,而是一套为日常使用设计的系统。 Cohere Transcribe 体现了这一意图:它可开源使用,提供完整的基础设施控制;推理 footprint 可控,适合实际 GPU 及本地使用;拥有业界最佳的服务效率;同时也可通过 Cohere 的安全、完全托管式模型推理平台 [Model Vault](https://cohere.com/solutions/model-vault) 使用。 Cohere Transcribe 目前在 HuggingFace 的 [Open ASR Leaderboard](https://huggingface.co/spaces/hf-audio/openasrleaderboard) 上排名 第一,刷新了实际转录性能的基准。 这标志着我们在将高性能语音识别带入企业 AI 工作流这件事情上,从 0 到 1 的开端。请继续阅读了解更多。