行业新闻

苹果新研究提出 IVT:内化视觉思考,推理提速 5 倍

苹果用“训练时预测未来、推理时不画未来”的 IVT 方法,在保持精度的同时让视频推理提速 5 倍,值得关注。

苹果团队提出内化视觉思考(IVT),一种训练模型预测未来画面、推理时却只依赖当前视频的后训练框架。相比显式生成未来帧的视觉思维链,IVT 将推理延迟从 6.56 秒降至 1.22 秒,在多个视频推理任务上精度相当或更高,因为未来视觉信息被内化为内部表征,无需显式画出。

正文摘录

![](https://image.jiqizhixin.com/uploads/article/coverimage/247f757d-c536-40af-b96e-46fda0788bb6/08(2).jpg) ![图片](/r/blog/3b1171a9ab1a71831b108a9c6abb610eb7a556fe22170b8ca9ef0ccda97f7834.png) 对于能够与真实世界交互的智能系统来说,仅仅理解 “眼前发生了什么” 还远远不够。机器人、智能助手或主动视频理解系统还需要根据不完整的视觉信息推断事件如何发展,并提前预测接下来可能发生的动作。 一种直观的做法是视觉思维链(Visual Chain-of-Thought,Visual CoT):先让模型生成一张 “想象中的未来画面”,再基于这张图像完成后续推理。未来画面能够直接表达物体位置、运动趋势、交互关系和状态变化,但生成、解码并重新编码中间图像也带来了显著开销。对于强调实时响应的主动视频推理任务而言,一个预测即使最终正确,如果在事件已经发生后才给出,价值也会大幅下降。 Apple 研究团队最近提出了一个不同的问题:如果未来视觉信息真正的价值,是帮助模型学习世界将如何变化,那么是否一定要在推理阶段把这个未来真正 “画出来”? 围绕这一问题,团队提出 Internalized Visual Thinking(IVT,内化视觉思考),一种将预测性世界建模能力内化到模型表征中的后训练框架。IVT 在训练阶段同时学习文本答案和未来帧的隐空间表征,但在推理阶段完全移除未来视觉预测过程,只根据当前观测视频直接生成答案。

阅读原文(jiqizhixin.com)→

行业新闻机器之心2026-09-03原文

相关内容