腾讯微信AI发布WeAgent-MMSearch,让检索到的图像持久保留在多模态搜索推理中
RT @Weixin_WeChat: 搜它、看它、用它持续推理。👀
最后这一点比听起来要难得多。
在许多搜索 agent 的设定中,检索过程中途获取的图像并不会保留在模型后续的上下文中。结果,一条看似多模态的搜索轨迹可能会逐渐退化为纯文本推理。
WeAgent-MMSearch 由腾讯微信 AI 团队研发,旨在让视觉证据始终留在推理循环之中。
借助持久化的多模态状态,检索到的图像在整条搜索轨迹中都保持可访问。Agent 可以重新查看它们、跨轮次交叉核对视觉证据、执行反向图像搜索,并在后续推理和工具调用中直接对检索到的图像进行推理——而不是把一切降维成文本。
通过 agentic SFT 加 Failure-Aware GSPO,WeAgent-MMSearch 在 8 个基准上取得平均 55.97 的分数,较基线提升 19.22 分。
我们还推出了 VisTarget-Bench,这是一个经人工核验、包含 150 项任务的基准,旨在拆解标准评测常常混为一谈的两种失败模式:未能检索到正确的视觉证据,以及即便检索到证据后仍未能正确作答。
每项任务都配有一张留出的目标图像,使我们能够分别衡量 agent 是否检索到了预期的证据,以及一旦找到该证据它是否能正确作答。
对于多模态搜索而言,找到证据只是开始。
关于 WeAgent-MMSearch 的更多内容:
https://t.co/PyMa41lR3L
最后这一点比听起来要难得多。
在许多搜索 agent 的设定中,检索过程中途获取的图像并不会保留在模型后续的上下文中。结果,一条看似多模态的搜索轨迹可能会逐渐退化为纯文本推理。
WeAgent-MMSearch 由腾讯微信 AI 团队研发,旨在让视觉证据始终留在推理循环之中。
借助持久化的多模态状态,检索到的图像在整条搜索轨迹中都保持可访问。Agent 可以重新查看它们、跨轮次交叉核对视觉证据、执行反向图像搜索,并在后续推理和工具调用中直接对检索到的图像进行推理——而不是把一切降维成文本。
通过 agentic SFT 加 Failure-Aware GSPO,WeAgent-MMSearch 在 8 个基准上取得平均 55.97 的分数,较基线提升 19.22 分。
我们还推出了 VisTarget-Bench,这是一个经人工核验、包含 150 项任务的基准,旨在拆解标准评测常常混为一谈的两种失败模式:未能检索到正确的视觉证据,以及即便检索到证据后仍未能正确作答。
每项任务都配有一张留出的目标图像,使我们能够分别衡量 agent 是否检索到了预期的证据,以及一旦找到该证据它是否能正确作答。
对于多模态搜索而言,找到证据只是开始。
关于 WeAgent-MMSearch 的更多内容:
https://t.co/PyMa41lR3L