动态

PhoneLLM 开源语音代理模型,低延迟低成本。

PhoneLLM 开源语音代理模型,低延迟低成本。
Victor M
转发 @kwindla:介绍 PhoneLLM,一个用于语音代理的开放模型。

在典型语音代理任务上,GPT 5.6 Terra 的性能,但延迟为其三分之一,成本为其十八分之一。

对于语音代理,我们需要既低延迟又擅长工具调用和指令遵循的模型。

这里存在权衡,构建语音代理时我们经常不得不在延迟和能力之间妥协。借助 PhoneLLM(以及实现该模型的训练和数据栈),我们正在解决这个问题。

过去几年,前沿模型开发的大部分精力都放在利用测试时计算上。这很棒!各种尺寸的模型在开启“思考”模式时表现非常出色。

但如果需要代理以语音对话速度响应,就不能使用思考模型。

PhoneLLM 是 NVIDIA Nemotron Nano 30B 的全权重微调。我们在广泛的真实电话和客户支持用例上进行了训练。训练重点是继承 Nano 30B 优秀的基座能力,并教会模型在禁用思考的情况下执行典型语音代理任务。

结果非常好:在长对话中工具调用准确、回复简洁贴题。

而且很快:在轻负载 B200 上运行 PhoneLLM,服务端测量的 TTFAT <100ms。:-)

但说真的,我们在评估模型延迟时,会使用真实的 Pipecat 语音代理流水线进行完整的端到端批量请求模拟。

单块 B200 可支持超过 80 个并发代理,P95 端到端 TTFAT <600ms,包括网络开销。LLM 每分钟成本约 0.0025 美元(四分之一美分)。延迟低于当今任何第三方 API。

关于此模型的更多细节,包括 HuggingFace 上的权重、用 Modal 一键启动,以及可克隆的入门项目仓库,都在本线程中……
动态Victor M2026-08-31原文

相关内容