行业新闻

Together AI 如何构建全球最快的语音转文本栈

Together AI 如何构建全球最快的语音转文本栈

Together AI 通过系统级全链路优化(而非单纯 GPU 加速)实现了业界最快语音转文本速度,值得工程团队借鉴。

Together AI 在 Artificial Analysis 评测中拿下最快语音转文本(ASR,自动语音识别)速度。秘诀是:他们把整个处理链路当作一个系统问题来优化,而不只是单点加速 GPU 推理。

正文摘录

Together AI 如何构建全球最快的语音转文本技术栈 ![](https://cdn.prod.website-files.com/69654e88dce9154b5f12070c/6a19c64909bbdf4db77100df841eb48a.png) Artificial Analysis 报告的速度因子(每秒转录的输入音频秒数)——数值越高越好 模态问题 一个包含 100 万 token 的文本提示可以装下整个《哈利·波特》系列,其体积仍只有约 5 MB。这个规模听起来很大,但输入本身很紧凑。文本也几乎可以直接用于推理:分词、批处理,然后通过模型即可。 音频则彻底改变了问题的形态。同样的《哈利·波特》语料以有声书形式存储时,体积为 5 到 10 GB,大约比文本大三个数量级。在到达 GPU 之前,服务器需要解码容器、重采样、滤除噪声、运行语音活动检测 (VAD)、分割语音片段并计算音频特征。 模型侧也发生了变化。如今的 LLM 拥有数千亿或数万亿参数,服务工作自然集中在 GPU 内部:量化、KV 缓存、注意力内核、批处理和并行处理。语音转文本模型则小得多,通常在数亿到数十亿参数之间,因此周围的数据路径更为关键。 这使得 ASR 服务成为一个涵盖 GPU 执行、CPU 预处理、内存移动、传输、连接调度和运行时行为的全路径系统问题。同一套技术栈还必须服务于两种不同的场景:离线转录(吞吐量最重要)和流式转录(延迟和抖动占主导)。 Together 的 ASR 技术栈服务于 Artificial Analysis 评出的两款最低延迟语音转文本模型:NVIDIA Parakeet-TDT 0.6B v3 和 OpenAI Whisper Large v3。

阅读原文(together.ai)→

行业新闻2026-05-29原文

相关内容