AVTR-1 Real-Time Open Weights Model
AVTR-1 是开源实时AI头像模型,面向开发者和创作者,提供全双工语音交互的低延迟动态头像生成。
Maker 说
Hey Product Hunt 👋
我是Sergei Sherman,@Avaturn的CEO。
今天,我们正式发布AVTR-1——一个开源权重的实时AI头像模型,在关键基准测试上达到了新的最优水平。
如果你正在做任何涉及实时AI头像的项目,AVTR-1就是为你准备的。
✍️ AVTR-1的不同之处在于:整个脸都是生成出来的,不只是把嘴唇贴到预先录好的视频片段上。头像面部的每一个像素——从头顶到下巴——都是逐帧实时生成的。原生双工——头像在主动倾听。模型一直在生成,无论头像是在说话还是在听。就像真人通话一样,头像的面部会实时回应你的话语和语气。你说到第三个词时语气显得惊讶,那眉毛在第三个词就抬起来了,而不是等整句话说完。三年来,“实时头像”一直意味着预先录好的视频加上生成的嘴巴贴在上面。我们直接扔掉了录像。
🎯 为什么你需要AVTR-1:开源权重。个人、研究和年收入低于1000万美元的商业用途免费。超过这一收入需通过我们获取商业许可。单块A100或4060上端到端延迟低于200ms。可在数据中心、云端或你自己的设备上运行。内置Avaturn Streamer——实时头像的开源基础设施层。可即插即用AVTR-1或任何其他开源权重的实时视频模型。一边接入你的视频模型,另一边接上你的对话后端。开箱即用的参考头像。模型卡片,版权已清除,今天即可部署。repo中第一天就带有Cartesia和Pipecat的启动合作伙伴示例。🏗️ 我们明确不发布一样东西——并希望行业与我们共同构建:公开的、供应商中立的实时AI头像排行榜。这个品类需要一个透明的计分板,由整个生态系统共同维护。清晰、公开的竞争是快速改进的唯一途径。我们邀请所有其他供应商、所有开源贡献者、所有研究人员共同打造它。
🎉 所有内容今天已上线:代码、推理、评估:github.com/avaturn-live/avtr-1下载模型权重:huggingface.co/avaturn-live/avtr-1技术报告、完整论文、可复现基准:avtr-1.avaturn.live在线演示:avaturn.live实时生成的视频是下一个前沿。之前的每一波——先是文本,然后是实时音频——都产生了该品类赖以发展的开放层。今天我们交付这一层:模型和编排两者都包含。
有问题、反馈或正在做什么项目,请在下方留言——我今天全天在线 🚀
——Sergei
你知道那种感觉吗——你对大多数AI avatar说什么都行(比如“我妈妈去世了”,或者“天哪窗外有个杀人犯!”),它们只会眨眨眼,循环播放空闲动作,点点头,然后说一句“哦,那听起来不错。”这些机器人就是嘴巴定时动动,完全没有语义理解。
AVTR-1实时生成面部的每个像素,逐帧渲染。当你说话的意思发生变化时,表情也会随之变化——比如第三个词时眉毛上扬,因为内容需要,而不是因为句子结束了。
对开发者来说:目前还没有视频智能体领域的Pipecat替代品。@Avaturn Live 正在提供完整技术栈——模型权重、streamer、同步层、参考avatar。带上你自己的GPU,15分钟就能上手。开放权重很了不起,如果你的业务ARR低于1000万美元,完全免费。