行业新闻

国产视频模型以94毫秒延迟和100%监控胜率超越Gemini

国产视频模型以94毫秒延迟和100%监控胜率超越Gemini

国产视频模型延迟低至94毫秒,监控准确率100%,超越Gemini,展现视频理解领域突破。

国产视频模型在延迟(94毫秒)和监控任务准确率(100%)上超过谷歌Gemini,表明国内模型在视频理解领域取得重大突破,有望推动视频分析应用发展。

正文摘录

![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimgb34610cab3.jpg) 新智元报道 ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg3b253ef414-218.png) 【新智元导读】 京东开源 JoyAI-VL-Interaction,把视频 AI 从「你问我答」的轮次对话,推进到「持续在场、主动开口、按时机说话」的流式交互新范式。 世界杯决赛最后一秒,球进了。 你身边那个号称能「看懂视频」的 AI,还在安静地等你开口问一句「刚才发生了什么?」。 这就是今天几乎所有视频 AI 的样子——不管包装得多酷炫,骨子里都是同一个逻辑: 你问,它答。 可真实世界里最需要 AI 出声的那些瞬间,从来不会等人提问——解说员不会等导播发话才开口喊「Goal」。 这些场景要的不是「问答」, 而是一双全程在线、自己拿主意什么时候该说话的眼睛。 现在,京东把这双「眼睛」开源了,它叫 JoyAI-VL-Interaction。 ![](https://aiera.com.cn/wp-content/uploads/2026/06/aieraimg9155529bda.png) JoyAI-VL-Interaction 的重点不只是「看懂视频」,更是要让模型在连续的视频流里自己决定—— 何时回应、何时沉默、何时把复杂任务甩给后台。 一句话: 它学会了什么时候该闭嘴,更学会了什么时候必须开口。 这套系统刚开源就拿到了生态层面的背书——JoyAI-VL-Interaction 获得了 vLLM-Omni 的 day-0 支持,已原生合入 vLLM-Omni 主线。 开发者可以在 vLLM-Omni 上一键拉起服务体验,也可以直接从京东的仓库一键启动。

阅读原文(aiera.com.cn)→

行业新闻新智元2026-06-24原文

相关内容