Inception CEO Stefano Ermon:扩散模型将在 AI 推理中胜出自回归架构
扩散模型先驱 Stefano Ermon 讲为什么并行生成 token 的扩散架构在推理效率和硬件利用上优于自回归 LLM,以及 Inception 如何把它用到文本与代码生成。
嘉宾Stefano Ermon
节目简介
生成式 AI 撞上硬件与延迟瓶颈,斯坦福教授、扩散模型先驱 Stefano Ermon 押注一条新架构路线。他解释自回归 LLM(逐 token 顺序生成的大语言模型)的局限,以及扩散模型并行生成 token 为何在标准 GPU 上带来更好的推理扩展性与硬件利用率,并介绍 Inception 的 Mercury 模型、语音 agent 落地场景、规模化部署扩散模型所需的软件栈,以及为什么下一阶段 AI 竞争的核心是效率。