虎牙发布实时多模态数字人基础模型 VAM 1.0,一张照片即可生成
虎牙 VAM 1.0 用一张照片生成实时交互的数字人,解决了业界三大痛点,在真实感、低延迟和多角色协同上取得突破。
虎牙推出基于 DiT 架构的 VAM 1.0 数字人模型,仅需一张照片即可生成能实时对话、唱歌跳舞的多模态数字人。它克服了长期运行下的身份漂移、多目标平衡和高并发延迟三大难题,首帧延迟约 1.3 秒,后续每帧 0.77 秒。实际体验中数字人可自如切换话题、支持语音和弹幕双路交互,并实现多人角色协同。
正文摘录
每天在网上冲浪,经常能刷到各种 AI 数字人,什么播新闻的、讲世界杯的、直播间带货的…… 本以为自己对这种「一眼假、莫得情感」的「人」没啥兴趣,结果转头我就和 虎牙的 AI 数字人 聊了整整一小时。 她真就像朋友一样,既能回答我的问题,又能不断抛出新话题,接梗也是不在话下。聊了一个多小时,我俩终于在最喜欢的歌手是周杰伦和孙燕姿这件事上,达成了默契。 这个 AI 数字人形象,来自虎牙刚刚推出的虎牙 VAM 1.0(Vivid Avatar Model),一个基于 DiT 架构的实时多模态数字人基础模型 。 用它的方式简单到有点离谱:只要扔进去一张照片,就能转化成一个能说话、能听你说话、能唱歌跳舞的「全能」AI 数字人。 我们也实际体验了一下,看看虎牙做得到底怎么样,再和大家聊聊这个行业已经发展到什么程度了。 以前刷到的 AI 数字人,说白了更像是「循环播放的 AI 视频」,基本都是照着脚本念,没啥互动感,体态和声音也比较生硬。 但虎牙这个不太一样,很明显骨子里就带着那种 「直播基因」 ,真能跟你聊得有来有回。 因为「千人一面」的 AI 视频只能播,「千人千面」的直播间才能接住人。观众发弹幕你得回,有人打断你得停,冷场三秒人就划走了。 当然了,这个道理行业玩家都懂,但受限于技术,很多 AI 数字人还停留在「能播不能聊」的尴尬阶段。 你发弹幕它不理睬,你打断它没反应,不说话的时候直接「僵住」或者给你播放循环画面,能做的事也就是念念口播,唱歌跳舞自然就不要想了。 另外呢,作为一个 i 人,我实在不想让她叫我「宝子」,我告诉她换一个对我的称呼,喊我「小红」就行,然后她真的全程就叫我「小红」了,一次没错过。 而且,在我们聊天的过程中,雪儿全程都不用我来想话题,她会顺着我们聊的内容自己往下延展。聊到成都时我随口问了句「那你会说四川话吗」,她秒回「会呀」,然后直接开始用四川话给我摆龙门阵。