Audio8 ASR Infinite 流式语音识别模型发布,每秒解码 12.5 次
Audio8 ASR Infinite
流式语音识别模型
其原生流式架构每秒解码 12.5 次
滚动 KV Cache 让内存占用和延迟保持恒定,即使 7×24 小时不间断运行也是如此
每个时钟步输出一个文本 token(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡
huggingchat 的 ML 实习生搭了一套 gradio 工作流来上手试用:https://t.co/6OB6nG0Rog
huggingchat: https://t.co/C0TsUhOgmp
模型: https://t.co/EVjrwvo0U8
流式语音识别模型
其原生流式架构每秒解码 12.5 次
滚动 KV Cache 让内存占用和延迟保持恒定,即使 7×24 小时不间断运行也是如此
每个时钟步输出一个文本 token(每秒 12.5 / 8.3 / 6.25 次决策),在感知粒度与资源开销之间取得平衡
huggingchat 的 ML 实习生搭了一套 gradio 工作流来上手试用:https://t.co/6OB6nG0Rog
huggingchat: https://t.co/C0TsUhOgmp
模型: https://t.co/EVjrwvo0U8