OmniScientist: 一种全模态、全学科的 AI 科学家
基础模型的最新进展使 AI 科学家能够自动化越来越完整的研究工作流,从假设生成、代码执行到稿件撰写。然而,仅覆盖工作流并不能提供科学发现所依赖的全部证据。现有系统通常基于文本、代码、标签或预计算摘要进行推理,导致空间、时间、跨通道和过程性关系等科学上关键的信息无法被智能体利用。我们提出 OmniScientist,一种端到端、全模态的 AI 科学家,可直接从异构原始证据中进行多学科研究。它由一个感知层和三个自主智能体(构思、实验、撰写)组成,在确定性流水线中运行,使得观察能够贯穿整个研究生命周期,影响研究问题、实验决策和最终结论。系统通过代码执行 idea(构思检查)、rigour(严谨性检查)和 claim(主张检查),实现新颖性筛选、统计有效性、执行溯源和数值可追溯性。 我们在涵盖 5 个学科家族、4 类科学证据 以及包括图像、信号、音频、视频、3D 结构、轨迹、表格、公式和图在内的多种模态的 36 个真实数据案例 上评估了 OmniScientist。系统在所有 36 个案例中完成了从原始数据到编译稿件的完整路径,并在参考推理骨干下实现了 6.3 的平均总体论文得分。在与仅接收预计算标量特征的盲变体的配对比较中,直接感知在全部 7 个评估维度上均有提升,并在 85% 的头对头判断中胜出。结果表明,全生命周期的感知对于基于证据的科学发现至关重要,并为广泛能力的 AI 科学家提供了实用路径。
论文精读
TL;DR OmniScientist 让 AI 科学家直接感知图像、信号、音频等原始多模态证据,全流程从原始数据产出论文;在 36 个真实案例中跑通,并以 85% 胜出率证明全生命周期感知优于预计算特征。
问题
问题背景:全模态、全学科 AI 科学家正成为自动化科研的新前沿,基础模型已能覆盖从假设生成到论文撰写的完整流程。
现有方法局限:多数系统仅对文本、代码、标签或预计算摘要进行推理,缺少对原始证据中空间、时间、跨通道与程序关系的直接感知。例如,医学影像中的纹理模式、地震波形中的时序异常、3D 结构中的几何约束,若被降维为标量特征,代理便无法发现需要跨模态关联的科学现象。盲变体实验显示,仅接收预计算标量特征时,7 个评估维度全部下降,85% 的对比判断败给直接感知版本。
为什么难/重要:科学发现依赖完整证据链,而原始数据模态多样、结构复杂,要求感知层与下游规划、实验、写作在生命周期内保持确定性交互;同时必须通过代码执行强制新颖性筛选、统计有效性、执行溯源和数值可追溯。业界对端到端 AI 科研系统关注度持续上升,但缺乏可验证、可复现的全流程方案。
行业类比:类似自动驾驶需要多传感器原始信号融合而非仅依赖高精地图,AI 科学家也必须直接感知原始科学证据,而非只读预提取特征。
核心洞察
- 生命周期全感知是证据基础科学发现的关键。现有 AI 科学家大多在文本、代码、标签或预计算摘要上推理,丢失了空间、时间、跨通道、程序等对科学结论至关重要的关系;OmniScientist 把感知层嵌入 ideation、experiment、writeup 三个阶段,使原始观察能直接塑造研究问题、实验决策和最终声明。盲测对比显示,仅接收预计算标量特征的变体在所有7个评估维度上均落后且85%头对头判断失败,证明感知粒度与 agent 决策的耦合是超越 workflow coverage 的核心差异。
- 代码级检查将科学规范转化为确定性约束,而非依赖 LLM 自我声明。OmniScientist 通过 idea、rigour、claim checks 在代码中强制执行新颖性筛选、统计有效性、执行溯源和数值可追溯性,从而把科研流程中的关键质量门槛变成可验证的 pipeline 步骤。这与多数仅提供 LLM 推理并假设其可靠性的 AI 科学家形成对比,增强了端到端生成结果的可信度,为生产环境中的自动化研究提供了工程保障。
方法
输入与感知层
系统接收 异构原始证据,涵盖图像、信号、音频、视频、3-D 结构、轨迹、表格、公式、图表等模态。感知层 直接对这些原始数据进行编码,提取空间、时间、跨通道和程序性关系,避免了仅依赖预计算标量特征的信息损失。
三个自主代理与确定性管道
在 确定性管道 内,三个自主代理顺序协作:
- 构思代理:基于感知层的观察生成研究假设,并通过代码运行的
idea check进行新颖性筛选。 - 实验代理:设计并执行实验,
rigour check在代码中强制统计有效性,确保执行溯源。 - 写作代理:整合实验证据撰写手稿,
claim check实施数值可追溯性,保证最终声明可直接追溯到原始数据。
输出
最终输出为 编译好的手稿,从原始数据到成稿全流程自动化。在 36 个真实数据案例中,系统全部完成,平均论文得分 6.3(参考推理主干)。
与同类方法的差异点:现有 AI 科学家通常在文本、代码、标签或预计算摘要上推理,OmniScientist 通过全生命周期感知直接处理原始异构证据,实现证据驱动的研究决策。
实验
实验设计
评估基于 36 个真实数据案例,覆盖 5 个学科家族、4 类科学证据及多种模态(图像、信号、音频、视频、3D 结构、轨迹、表格、公式、图)。系统需从原始数据出发,完整产出可编译手稿。设置 盲变体(仅接收预计算标量特征)作为对照,隔离感知层作用。推理主干为参考 reasoning backbone,并通过代码执行 idea、rigour、claim 检查保障严谨性。
关键发现
OmniScientist 在全部 36 个案例中完成从原始数据到编译手稿的全流程,整体论文平均分 6.3。与盲变体相比,直接感知在全部 7 个评估维度上均有提升,并在 85% 的成对判断中胜出。这表明生命周期全阶段感知对证据驱动的科学发现至关重要。
基线对比解读
盲变体仅依赖标量特征,丢失空间、时间、跨通道与程序关系;OmniScientist 通过感知层将原始异构证据直接接入 ideation / experiment / writeup 各阶段,使观测能够持续塑造研究问题、实验决策与最终结论。相比仅扩展工作流覆盖的现有 AI scientist,这一设计从证据访问层面解决问题。工程启示:科学智能体应将感知作为贯穿生命周期的第一等公民,而非仅在输入前端做特征提取;同时以代码强制执行的 idea / rigour / claim 检查提供可验证的执行溯源与数值追踪,可作为稳定落地的工程基线。
行业影响
落地场景
OmniScientist 适合需要从原始异构证据 自动生成可验证结论的企业研发场景。例如:
- 药物研发:直接处理高通量筛选的显微图像、化合物结构、剂量-反应曲线,自动提出假设并执行统计分析,生成候选分子报告。
- 内容平台风控:对图文、音视频内容做多模态原始数据审核,生成带证据链的违规判定,减少对标注摘要的依赖。
商业价值
主要价值在降本与提效:传统上需要科学家+工程师协作的多天任务,OmniScientist 可在数小时内完成从原始数据到编译手稿的全流程。代码级检查 idea check / rigour check / claim check 强制统计有效性与数值可追溯,降低错误结论导致的合规风险,尤其适用于医疗、金融等强监管领域。在36个真实数据案例中,系统完整完成所有任务,平均论文得分6.3,表明其输出质量接近可用水平。
与现有工作流集成
OmniScientist 采用确定性流水线,可封装为研究自动化微服务,接入现有 MLOps 栈:
- 感知层作为数据接口,接在数据湖或特征存储之后,直接消费原始文件(图像、信号、表格等)。
- 三个代理通过检查器 与现有实验跟踪系统(如 MLflow)和版本控制(Git)集成,每次数据更新触发重跑,保证结论新鲜度。
- 最终产出可编译的论文格式,直接对接内部知识库或报告生成工具。
相比仅使用预计算标量特征的“盲”AI科学家,直接感知在7个评估维度上全面胜出,证明生命周期全阶段感知 是工业级应用中减少信息损失的关键。
局限
- 评估规模与泛化性有限。论文在 36 个案例上验证,虽涵盖多学科和多模态,但样本量较小,难以全面反映真实科学研究的复杂性和多样性。此外,评估主要依赖参考推理骨干的性能,未充分测试在不同骨干模型下的鲁棒性,也未与现有 AI 科学家系统(如 AI Scientist、ChemCrow)在统一基准上直接比较,因此其优越性证据主要来自自身消融,外部有效性有待进一步检验。
- 确定性管道可能限制科学探索的灵活性。OmniScientist 采用固定顺序的 ideation-experiment-writeup 管道,虽保证了可重复性和可审计性,但真实科学研究往往需要非线性的迭代、回溯和试错。该系统可能难以处理需要动态调整研究方向或复杂实验设计的问题,尤其是在开放域发现任务中,其表现可能不如人类科学家或更灵活的代理系统。
- 感知层的实现细节和潜在瓶颈未充分披露。论文声称直接处理各类原始证据,但感知层如何具体适配不同模态(如 3D 结构、轨迹、公式)尚不明了,可能依赖于特定预训练模型或降采样策略,导致信息损失。此外,对于高分辨率图像、长视频等数据,计算成本和内存开销可能很大,实际部署时可能面临工程挑战,而这些在论文中缺乏系统分析和优化讨论。