无问芯穹联合清华、上交开源具身端侧推理引擎 APXInf
具身模型要在机器人本体上实时跑,延迟、功耗和稳定性是落地瓶颈;APXInf 开源了一套端侧推理引擎,把 Pi 0.5 的端到端延迟压到 26ms。
无问芯穹联合清华、上交开源具身端侧推理引擎 APXInf,支持 RTX 4090、Jetson Orin 与 Jetson Thor。它面向机器人本体做端到端推理优化,在 Thor 上把 Pi 0.5 FP8 的推理延迟从 278ms 降到 26ms 以内,同时兼顾长时间运行的稳定性与新模型的接入效率。
正文摘录
今天的具身模型,已经能够看懂环境、理解指令,并把看到的、听到的信息转化为机器人该怎么动的决策。但机器人最终还是要在物理世界里连续干活——从“眼睛看到”到“大脑决策”再到“手脚动起来”,整套流程都需要在极短的时间内完成闭环,这也是具身智能从 Demo 走向规模化应用,绕不开的核心关卡。 而当一个在云端运行良好的具身模型,放到机器人本体上,首先要面对的问题往往不是“模型够不够聪明”,而是推理系统本身: 对于云端的聊天机器人而言,几百毫秒的延迟或许只是体验上的细微差异;但对于需要持续感知、连续决策和实时控制的机器人而言,几百毫秒带来的可能是动作迟滞、轨迹不连贯,甚至多次任务的失败。 而当机器人走向规模化落地,还会叠加另一笔更加现实的“经济账”:算力成本、功耗,以及有限硬件资源的利用率。 因此,具身智能规模化落地需要的,并不是简单地把云端推理框架“搬”到机器人本体,而是一套 真正面向端侧场景设计的推理系统:在有限的算力、功耗和成本约束下,兼顾小 Batch、低延迟与持续实时交互,并充分挖掘硬件的性能上限。 今天,无问芯穹联合清华大学、上海交通大学,正式开源具身智能端侧推理引擎——APXInf,超前卡位具身智能从模型能力走向规模化落地的核心环节。APXInf 支持 RTX 4090、Jetson Orin、Jetson Thor 等主流计算平台,覆盖从模型开发、效果验证到机器人本体部署的完整链路。它关注的不只是让具身模型在真实机器人上能够“跑起来”,更希望可以 在有限资源下“跑得够快、够稳,也足够容易接入拓展和持续迭代”。 通过针对机器人端侧场景的系统性推理优化,APXInf 希望能够进一步缩短具身智能从 POC 走向规模化落地的那“最后一公里”。 一端,是机器人本体对推理系统提出的严苛要求:极致性能、低延迟、低功耗与高稳定性;