vLLM推出Semantic Router,实现单次调用背后的多模型协作
vLLM的Semantic Router让单次API调用背后可动态调度多个模型协作,在不增加用户复杂度的情况下降低成本并提升推理质量。
传统的路由器只把请求分给某个模型,但vLLM的Semantic Router能在一次API调用内,根据意图自动编排多个模型:先用便宜的模型尝试,confidence不够再升级;或同时让多个模型各出一份结果,再合成更可靠的答案。用户看到的只是一个普通模型接口,后台却有一支带预算、带验证、带回退的模型小队,帮你降低成本、提升安全性。
正文摘录
.jpg)  所有人都在等下一个 SOTA 模型的诞生,但你不知道的变化,正悄悄发生在模型前侧。 在过去一年里,router 已经从 "把请求分给哪个模型" 的转发代理,演变成了模型推理的核心 "总指挥"。 它的目标扩展为: - 降低成本 :什么时候必须用前沿模型,什么时候用开源 SOTA 模型,还是本地小模型已经足够? - 安全防护 :当请求属于法律、医疗、金融、未成年人、企业机密等敏感区域,是否应该自动切到更严格的模型?或者用更强的过滤器或更稳的审查和校验,或者上升到人为确认? - 云边协同 :哪些请求意图应该留在边端,比如通过 AI PC 部署的本地模型,做本地低延迟的快速处理;哪些任务应该升级到云端,让更强模型接手? 上面这些都是 router 从传统的路由转发,演进出来的 "系统智能"。 vLLM 社区推出的 Semantic Router 除了专注上面三个方向,正在更进一步: 我们认为:router 不只是选择模型,还可以提升模型能力。