论文

ArogyaSutra: 面向印度语言多模态医疗推理的多智能体框架

ArogyaSutra: 面向印度语言多模态医疗推理的多智能体框架

多模态大语言模型在通用领域展现了有前景的推理能力,但在医疗等专业场景中性能有限,尤其在多语言和低资源情境下。这一差距在印度农村等地区尤为关键,患者常用本土印度语言表达复杂医疗问题,并依赖医学图像等多模态输入。现有的以英语为中心的 MLLM 难以支持此类用例,限制了人工智能医疗辅助的公平可及性。 为解决这一挑战,我们构建了 ArogyaBodha,一个大规模多语言多模态医学问答数据集,整合了八个异构来源,覆盖 31 个身体系统、六种成像模态和 21 个临床领域,涵盖英语和七种主要印度语言。我们进一步提出 ArogyaSutra,一种基于 actor-critic 的多智能体框架,集成工具接地与双记忆机制,实现逐步推理感知的决策,并利用存储的 actor-critic 仿真轨迹进行蒸馏。 实验表明,我们的数据集和框架在所有印度语言上提升了多语言医疗推理准确率,消融实验验证了各组件的贡献。源代码和数据集发布于:https://iitp-cse.github.io/ ArogyaSutra/

论文精读

TL;DR 构建多语言医疗数据集 ArogyaBodha 并提出 actor-critic 多智能体框架 ArogyaSutra,通过工具定位与双记忆机制提升低资源场景下的多模态医疗推理准确率,为跨语言医疗 AI 落地提供数据与架构支撑。

问题

问题背景

多模态大语言模型(MLLMs)在通用视觉问答、摘要等任务中推理能力显著提升,并已初步扩展至医疗领域,通过监督微调支持医学影像解释与临床问题解答。然而,现有工作大多以英语为中心,对多语言、低资源场景的覆盖严重不足,导致非英语母语的医患互动难以获得同等质量的AI辅助。

现有方法局限

  • 直接预测范式 的局限性:多数医疗MLLMs遵循端到端生成简短答案的模式,缺乏显式的逐步推理链,在需要多步鉴别诊断或综合生理参数分析的复杂医学查询中,输出常过于简略或逻辑跳跃,可解释性与可靠性不足。
  • 工具利用不足:现有框架很少集成外部视觉工具(如医学影像分析API)或结构化知识库,难以对多模态输入进行细粒度解析(例如,先识别病灶区域再推断病理),限制了模型在真实临床流程中的实用性。
  • 低资源语言挑战:非英语场景下,平行医学数据稀缺,机器翻译易引入关键术语错误或语义偏移;同时,跨语言知识迁移缺乏有效的对齐机制,导致模型在印地语、孟加拉语等印度语言上表现骤降。
  • 记忆与反思机制缺失:传统单轮推理无法利用历史交互信息或自我修正,面对多轮问诊、治疗方案调整等动态场景时缺乏适应性。

为什么这个问题难且重要

从技术角度看,挑战在于:1)需要在多语言环境下保持医学概念、实体关系的精确对齐,避免因翻译误差引发误诊风险;2)多模态推理要求同时理解视觉信号(X光片、组织切片等)和文本上下文,并在低资源语言中构建跨模态联合表征;3)逐步决策的可信度——每一步推理必须可追溯,并能动态调用工具来验证假设,这与通用的开放域对话有本质区别。业界关注度持续升高,因为全球仍有大量人口被英语中心的AI医疗排斥在外,构建多语言、多模态医疗推理系统是实现普惠健康的重要技术突破口。此外,该方向也推动MLLMs从“数据驱动”向“知识+工具驱动”的Agent化演进,对自动驾驶、法律咨询等高风险低资源场景具有外溢价值。

行业类比

与自动驾驶感知-规划-控制链条类似,医疗多模态推理需要从感知(影像分析)到认知(诊断推理)再到决策(治疗建议)的可靠闭环;低资源语言支持则相当于在复杂路况下,系统必须理解本地交通标识与规则,任何语义误解都可能造成严重后果。

核心洞察

  • 多模态医疗推理在低资源多语言场景下存在显著性能差距。现有的多模态大语言模型(MLLMs)几乎全部以英语为中心,忽视印度本地语言等低资源语言,导致无法处理患者用母语表达的复杂医学查询及医学影像。ArogyaBodha 数据集与 ArogyaSutra 框架通过大规模多语言多模态数据构建与演员-评论家多智能体架构,专门解决这一缺口,使模型能够逐步融合视觉证据并支持多语言推理,实现了低资源场景中医疗推理的显著提升。与仅做英文微调或直接预测的基线相比,该工作首次将工具使用和记忆机制与多智能体协同引入多语言医疗领域。
  • 演员-评论家多智能体框架与工具-记忆融合的协同推理。ArogyaSutra 并非简单调用语言模型,而是采用 **双记忆机制**(短期/长期记忆)和视觉工具接地,让演员智能体在评论家指导下进行分步决策与自省,再通过仿真轨迹蒸馏至最终模型。这种设计模拟了临床医生从检查图像到逐步判断的过程,相较于现有仅输出最终答案的医疗 MLLM 或单一智能体框架,更符合真实诊断流程,且消融实验证实每一步组件都有效提升准确率。

方法

ArogyaSutra 框架采用 actor-critic 多智能体架构,融合工具调用双记忆机制,实现多模态医学推理。输入为多模态医学数据:图像(如 X 光、CT)和多语言文本问题(支持英印七种印度语)。框架直接处理低资源语言,无需显式翻译。

关键模块:

  1. 视觉工具基础 (Vision Tools Grounding):调用预训练的医学图像分析工具,将视觉输入转化为结构化语义描述,使语言模型能理解非文本信息。
  2. 双记忆机制:维护短期记忆(当前对话上下文和推理步骤)和长期记忆(从历史病例中提取的概念知识库),二者协同提供跨病例的参考信息,增强推理一致性。
  3. Actor-Critic 推理Actor 智能体逐步生成推理步骤(如“怀疑肺部感染,建议 CT 检查”),Critic 智能体根据医学逻辑和工具反馈评估每一步的合理性,输出价值分数,指导下一步生成。这种逐步验证确保了推理的透明度和可靠性。
  4. 轨迹蒸馏:训练过程中存储 Actor-Critic 生成的完整推理轨迹,将其作为监督信号蒸馏到一个轻量级单模型中,降低部署延迟,同时保留多智能体的协作推理能力。

输出:最终模型产出一段文本答案,包含推理链条和结论。

与依赖直接预测的现有医学 MLLM 不同,ArogyaSutra 显式引入工具增强、多步骤记忆导向的推理评估,并利用蒸馏弥补多智能体高昂的计算成本,尤其针对低资源多模态医学场景。

实验

实验设计

研究在自建的多语言多模态医学问答数据集 ArogyaBodha 上进行评估。该数据集覆盖 8 种语言(英语及 7 种印度语)、6 种成像模态31 个身体系统21 个临床领域,样本来自 8 个异构源并经过严格筛选与翻译。评估采用 actor-critic 框架 ArogyaSutra,集成视觉工具调用与双记忆机制,并利用模拟轨迹蒸馏策略。对比基线包括主流多模态大模型(MLLMs)和直接预测范式,通过准确率指标衡量多语言医学推理能力,同时设置消融实验验证工具接地、记忆模块及蒸馏步骤的贡献。

关键发现

  • ArogyaSutra 在所有印度语言上均取得了推理准确率的提升,尤其显著改善了低资源语言的医学问答性能。
  • 工具接地(vision tools grounding)使模型能动态调用专业视觉分析模块,减少了跨语言视觉理解错误。
  • 双记忆机制(短期工作记忆与长期情景记忆)存储历史推理轨迹,支持逐步决策回溯,显著降低了复杂病例的思维链误差。
  • 蒸馏 actor-critic 模拟轨迹的策略,在不增加推理开销的前提下进一步压缩了模型大小与响应延迟。

基线对比解读

与直接预测的 MLLMs 不同,ArogyaSutra 的多智能体架构显式模拟了人类医生的诊断流程:观察→工具调用→记忆回溯→最终判断。在低资源语言场景下,常规 MLLMs 由于缺乏对应语料与医学知识对齐,性能急剧下降,而 ArogyaSutra 通过 多语言对齐的预训练数据集语言无关的视觉工具 缓解了这一差距。消融实验证实,移除记忆模块后模型在需要多步推理的复杂查询上准确率降幅最大,表明记忆对推理一致性的关键作用;而蒸馏策略使轻量版模型保持了接近完整框架的精度,验证了模拟轨迹的知识捕获能力。整体上,该框架为低资源多语言医疗 AI 提供了一种可工程化落地的推理增强范式。

行业影响

落地场景

ArogyaSutra 框架及配套数据集 ArogyaBodha 瞄准多语言、多模态医疗推理的低资源场景,可直接赋能以下产品与业务:

  • 智能预问诊系统:集成到在线医疗平台或医院 App,支持患者用母语描述症状并上传医学影像(X 光、CT、皮肤镜等),AI 实时生成分诊建议与健康问答。
  • 多语言健康助手:在即时通讯工具(如 WhatsApp、Telegram)上部署医疗聊天机器人,服务移民社区或乡村地区用户,降低语言门槛。
  • 医疗教育与培训:为医护人员提供多语种案例检索与知识问答,辅助低资源语言地区的继续教育。

商业价值

该技术通过三条主线创造价值:

  • 降本:自动化初步问诊与报告解读,减少人工客服及初级医生的重复工作量,尤其适合缺乏专业医生的地区,降低人力依赖。
  • 增收:为远程医疗平台提供差异化多语言能力,扩大用户覆盖范围,进而提升付费订阅或按次咨询收入;也可作为 AI 能力模块授权给第三方获取授权费。
  • 体验提升:患者能以母语自然交互,并获得结合图像与文本的综合诊断推理,减少因语言障碍导致的误诊风险,提升信任与使用频率。

与现有产品/工作流的接口

该框架以 actor-critic 多智能体架构 为核心,天然适合模块化集成:

  • API 调用:封装为独立的医疗推理微服务,接受图像+文本输入,输出结构化诊断建议与推理链。通过 REST/gRPC 接入现有电子健康记录(EHR)或远程医疗平台。
  • 知识库增强:内置 工具接地(tool grounding)双记忆机制,可对接现有医学知识图谱(如 UMLS、SNOMED CT)或本地化语料库,确保回答可追溯、可验证。
  • 与主流 MLLM 的互补:可作为专用模块挂载在通用大模型(如 GPT-4V、Med-PaLM)之上,专门处理多语言与低资源医疗场景,通过 轨迹蒸馏 将推理能力迁移至轻量模型,降低部署成本。

具体落地用例

  1. 跨国远程医疗平台:例如 Teladoc 或 DoctorOnDemand 在服务南亚裔移民患者时,可集成 ArogyaSutra,让患者用印地语或孟加拉语描述皮肤问题并上传照片,系统自动生成初步诊断与专科转介建议,极大缩短等待时间并减少翻译成本。
  2. 人道主义救援组织:如无国界医生(MSF)在资源匮乏的缅甸或非洲法语区部署智能分诊机器人,支持当地语言(借助框架的多语言扩展能力)和基础影像分析,辅助非专业工作人员快速区分紧急与非紧急病例。

这两个用例均充分体现了多语言、多模态推理在低资源场景下的普惠价值,且不涉及地域限制,符合全球 AI 行业的共同需求。

局限

  • **数据集构建依赖翻译与合成**:ArogyaBodha 数据集通过翻译英语医学 QA 对和从异构源整合构建,尽管做了质量控制(如翻译分析),但可能缺少真实患者交互中的非正式用语、方言变体和上下文残缺,导致对实际口语化医疗查询的覆盖不足。部分模态(如医学图像)本身不蕴含语言,翻译可能不会影响图像—文本对,但文本部分的文化适配性存疑,可能影响模型在真实场景下的泛化。
  • **多 Agent 框架的通用性未充分验证**:ArogyaSutra 基于 actor-critic 结构,使用固定工具集(视觉工具)和双记忆机制,并依赖模拟轨迹蒸馏。然而实验仅在自建测试集上评估,未与更通用的医学多模态 Agent 框架(如 MedAgents 等)进行对比,也未探讨在非印度语言或医疗系统差异较大的场景下的迁移能力。蒸馏压缩了角色轨迹,可能损失探索多样性,导致框架在面对未见过的复杂病例时性能下降。
  • **视觉工具定位的深度与可解释性不足**:框架中的视觉工具定位(Vision Tools Grounding)负责识别医学图像中的关键区域,但论文未详细说明工具与底层视觉模型的关系,例如是否基于预训练的分割/检测模型,或细粒度病灶定位能力。与专业的医学影像分析工具相比,该定位可能停留在粗粒度级别,难以处理需要精确度量(如肿瘤尺寸测量)的任务。此外,决策过程的可解释性较弱,不利于临床辅助的审慎评估。
论文Tanmoy Kanti Halder2026-06-11原文

相关内容