PhoneLLM 开源语音代理模型,低延迟低成本。
转发 @kwindla:介绍 PhoneLLM,一个用于语音代理的开放模型。
在典型语音代理任务上,GPT 5.6 Terra 的性能,但延迟为其三分之一,成本为其十八分之一。
对于语音代理,我们需要既低延迟又擅长工具调用和指令遵循的模型。
这里存在权衡,构建语音代理时我们经常不得不在延迟和能力之间妥协。借助 PhoneLLM(以及实现该模型的训练和数据栈),我们正在解决这个问题。
过去几年,前沿模型开发的大部分精力都放在利用测试时计算上。这很棒!各种尺寸的模型在开启“思考”模式时表现非常出色。
但如果需要代理以语音对话速度响应,就不能使用思考模型。
PhoneLLM 是 NVIDIA Nemotron Nano 30B 的全权重微调。我们在广泛的真实电话和客户支持用例上进行了训练。训练重点是继承 Nano 30B 优秀的基座能力,并教会模型在禁用思考的情况下执行典型语音代理任务。
结果非常好:在长对话中工具调用准确、回复简洁贴题。
而且很快:在轻负载 B200 上运行 PhoneLLM,服务端测量的 TTFAT <100ms。:-)
但说真的,我们在评估模型延迟时,会使用真实的 Pipecat 语音代理流水线进行完整的端到端批量请求模拟。
单块 B200 可支持超过 80 个并发代理,P95 端到端 TTFAT <600ms,包括网络开销。LLM 每分钟成本约 0.0025 美元(四分之一美分)。延迟低于当今任何第三方 API。
关于此模型的更多细节,包括 HuggingFace 上的权重、用 Modal 一键启动,以及可克隆的入门项目仓库,都在本线程中……
在典型语音代理任务上,GPT 5.6 Terra 的性能,但延迟为其三分之一,成本为其十八分之一。
对于语音代理,我们需要既低延迟又擅长工具调用和指令遵循的模型。
这里存在权衡,构建语音代理时我们经常不得不在延迟和能力之间妥协。借助 PhoneLLM(以及实现该模型的训练和数据栈),我们正在解决这个问题。
过去几年,前沿模型开发的大部分精力都放在利用测试时计算上。这很棒!各种尺寸的模型在开启“思考”模式时表现非常出色。
但如果需要代理以语音对话速度响应,就不能使用思考模型。
PhoneLLM 是 NVIDIA Nemotron Nano 30B 的全权重微调。我们在广泛的真实电话和客户支持用例上进行了训练。训练重点是继承 Nano 30B 优秀的基座能力,并教会模型在禁用思考的情况下执行典型语音代理任务。
结果非常好:在长对话中工具调用准确、回复简洁贴题。
而且很快:在轻负载 B200 上运行 PhoneLLM,服务端测量的 TTFAT <100ms。:-)
但说真的,我们在评估模型延迟时,会使用真实的 Pipecat 语音代理流水线进行完整的端到端批量请求模拟。
单块 B200 可支持超过 80 个并发代理,P95 端到端 TTFAT <600ms,包括网络开销。LLM 每分钟成本约 0.0025 美元(四分之一美分)。延迟低于当今任何第三方 API。
关于此模型的更多细节,包括 HuggingFace 上的权重、用 Modal 一键启动,以及可克隆的入门项目仓库,都在本线程中……