动态

腾讯微信AI发布WeAgent-MMSearch,让检索到的图像持久保留在多模态搜索推理中

腾讯微信AI发布WeAgent-MMSearch,让检索到的图像持久保留在多模态搜索推理中
Tencent AI
RT @Weixin_WeChat: 搜它、看它、用它持续推理。👀

最后这一点比听起来要难得多。

在许多搜索 agent 的设定中,检索过程中途获取的图像并不会保留在模型后续的上下文中。结果,一条看似多模态的搜索轨迹可能会逐渐退化为纯文本推理。

WeAgent-MMSearch 由腾讯微信 AI 团队研发,旨在让视觉证据始终留在推理循环之中。

借助持久化的多模态状态,检索到的图像在整条搜索轨迹中都保持可访问。Agent 可以重新查看它们、跨轮次交叉核对视觉证据、执行反向图像搜索,并在后续推理和工具调用中直接对检索到的图像进行推理——而不是把一切降维成文本。

通过 agentic SFT 加 Failure-Aware GSPO,WeAgent-MMSearch 在 8 个基准上取得平均 55.97 的分数,较基线提升 19.22 分。

我们还推出了 VisTarget-Bench,这是一个经人工核验、包含 150 项任务的基准,旨在拆解标准评测常常混为一谈的两种失败模式:未能检索到正确的视觉证据,以及即便检索到证据后仍未能正确作答。

每项任务都配有一张留出的目标图像,使我们能够分别衡量 agent 是否检索到了预期的证据,以及一旦找到该证据它是否能正确作答。

对于多模态搜索而言,找到证据只是开始。

关于 WeAgent-MMSearch 的更多内容:
https://t.co/PyMa41lR3L
动态Tencent AI2026-09-21原文

相关内容