港理工与字节提出 VisInteract:用交互搜索解决 Text-to-Vis 意图不完整问题,入选 NeurIPS 2026 Spotlight
用户的需求往往一次说不清,这篇论文让出图系统学会主动追问、走错还能回头,而不是自己替用户拍板。
文本到可视化(Text-to-Vis,让用户说出想看什么、系统自动查库出图的流程)通常默认用户一次就把需求说全,但真实查询往往含糊、缺信息甚至有事实错误。港理工与字节团队提出 VisInteract:把出图变成多轮交互,配基准 VisInteract-Bench(1098 条样本)和基于蒙特卡洛树搜索的方法 Vis-MCTS,让系统主动追问、能分叉也能回退,把用户真实意图问回来。
正文摘录
.jpg)  本文作者分别来自香港理工大学以及字节跳动。共同第一作者许文鑫、卢锦伟来自香港理工大学。许文鑫是香港理工大学博士生,指导老师为张晨教授与魏骁勇教授。 数据要让人看懂,通常得先从数据库里查出来,再画成图。文本到可视化(Text-to-Vis)做的就是这件事:用户说出想看什么,系统去库里查询,再用图表把需要的数据展示出来。 你可能会觉得,现在的大模型已经非常强,这不过是小菜一碟。模型强是强,可需求得说清楚。通常,大多数用户没法一次把自己的需求表达完整。比如「把 2025 年 top-5 产品的月度营收画出来,按地区拆开」,听着已经很具体,可 top-5 按销售额还是按销量、退款算不算、数据库里到底有没有 2025 年的数据,这些都还没定。只出一次图,系统不会问,只会自己默默选定一种解释。 所以,要得到与用户真实意图相匹配的数据可视化,往往需要模型与用户进行多轮交互:缺的补上,含糊的问清,说错的改掉,一步步落到真正想看的那张图。这也是这项工作的研究背景。从适用性上看,这个场景要解决的是真实业务里的查数与出图。