Intern-S2-Preview: 科学智能体基础模型
科学发现日益需要能够对异构模态的科学证据进行推理、与科学工具和环境交互、并在长时间任务中持续推进的 AI 系统。为此,我们提出 Intern-S2-Preview 系列科学智能体基础模型,支持多模态科学理解、推理、生成和长时程任务。 训练流程从科学多模态预训练开始,基于渲染的科学文档、交错图文数据和多样科学语料。从预训练检查点出发,我们应用统一的训练后流程,包括监督微调、可扩展的多任务强化学习(RL)、黑盒与白盒智能体 RL、以及在线策略蒸馏。该流程由多项实用技术支撑,如带离线策略修正的部分展开、自适应长度正则化、在线推测解码、鲁棒多任务优化,以及智能体任务的轨迹感知经验组装。 在架构层面,Intern-S2-Preview-397B 将时间序列建模从高效长序列理解扩展到数值预测,同时 Memory Decoder 作为独立的记忆增强路径被研究,可在不修改冻结的 397B 主干的情况下快速实现科学领域特化。在多个科学、多模态、智能体和通用基准上的评估表明,Intern-S2-Preview-397B 在多项设置中达到有竞争力或领先的结果。时间序列模块提升了 SciTS 上的科学信号理解与预测能力;独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升到 60.32,且无需修改冻结的 397B 主干。
论文精读
TL;DR Intern-S2-Preview-397B 通过多模态预训练、多任务 RL、黑白盒智能体 RL 与 Memory Decoder 记忆增强,实现对长程科学推理与时间序列预测的领先支持,且冻结主干即可快速适配科学任务。
问题
问题背景
当前 AI for Science 的核心关注点,是构建能够处理异构科学证据(论文、图表、实验数据、时间序列)、调用科学工具(模拟器、数据库、文献检索)并完成长周期科研任务的智能体系统。
现有方法局限
现有科学 AI 模型通常只覆盖单一环节,存在明显技术短板:
- 多模态科学理解不足:多数模型不能同时推理科学文档中的文本、公式、表格、图像,尤其缺乏对渲染版式文档的结构化理解,导致从论文中抽取证据的能力受限。
- 长程智能体能力缺失:传统 RL 训练在长 horizon 任务上效率低、训练不稳定,难以支撑需要数十步工具调用和状态追踪的科学实验闭环。
- 短上下文与记忆瓶颈:科学推理常需要跨文档、跨实验的长期记忆,现有模型缺乏可插拔的记忆增强机制,无法在不改动大模型骨干的前提下快速适配新领域。
- 时间序列预测分离:科学信号预测(如材料性能、气象、基因表达)通常与文本模型割裂,缺少统一架构同时支持长序列理解与数值预测。
为什么这个问题难 / 重要
科学发现任务同时考验多模态对齐、工具反馈稀疏性、长程信用分配三大难题。科学数据噪声大、模态异构性强,工具调用结果可能延迟或部分可观测,导致 RL 训练容易崩溃。业界对科学智能体的需求持续升温,但可复现、可扩展的训练方案仍然稀缺,因此 Intern-S2-Preview 提出的 partial rollout + off-policy correction、adaptive length regularization、online speculative decoding 等工程技巧,直击训练稳定性和效率痛点。
行业类比
如同软件工程智能体需要长程规划和工具使用能力才能完成代码调试,科学发现智能体必须在实验设计、数据采集、假设验证的循环中持续决策,其复杂度比 SWE-agent 类任务更高,因为环境反馈更稀疏且不可微。
核心洞察
- 一是将黑盒与白盒 agentic RL 统一进科学基础模型后训练,并用 on-policy distillation 固化策略。与仅做 SFT 或知识 QA 的科学 LLM 不同,该工作把工具调用、环境交互和长程科学任务纳入 RL 奖励优化,同时引入 partial rollout with off-policy correction 和 adaptive length regularization 来稳定 397B 模型的 rollout 和训练,解决大规模 agentic RL 的样本效率与长度失控问题。
- 二是提出 Memory Decoder 作为冻结 397B 主干之上的轻量记忆增强扩展,用于快速科学领域特化,而不修改主模型权重。相比 LoRA/Adapter 等参数高效微调,Memory Decoder 显式引入记忆读取机制,在 Biology-Instructions 上将平均分从 56.92 提升到 60.32(+3.4),展示了一条不牺牲通用能力、可插拔的领域适配路径,适合多租户部署和服务化。
- 三是将时间序列建模从长序列理解扩展到数值预测,使科学基础模型不仅能消费多模态信号,还能生成未来走向。该差异体现在 Intern-S2-Preview-397B 在 SciTS 基准上同时改善科学信号理解与 forecasting,说明把 time series generation 模块纳入预训练/后训练可以闭环科学发现流程,而多数多模态 LLM 止步于静态数据问答。
方法
输入与预训练
Intern-S2-Preview 的输入包括渲染后的科学文档(如 PDF 页面图像)、交错图文数据、以及大规模科学语料。预训练阶段先进行 视觉预训练 与 语言预训练,并通过 图像检索增强 在在线检索与后处理阶段提升图文对齐质量。该阶段产出具备多模态科学理解能力的基座。
统一后训练管线
从预训练 checkpoint 出发,依次执行:
- 监督微调 (SFT):用高质量指令数据对齐科学任务格式。
- 多任务强化学习 (RL):通过可扩展的多任务 RL 学习推理与决策。
- 黑盒 / 白盒 Agentic RL:在科学工具与环境交互中优化长时任务策略。
- On-policy 蒸馏:将 RL 策略蒸馏回基座模型,稳定行为。
训练稳定性与效率由以下技巧支撑:
- partial rollout with off-policy correction:部分轨迹 rollout 并做离策略修正,降低采样方差。
- adaptive length regularization:动态控制生成长度,平衡推理深度与计算开销。
- online speculative decoding:加速 RL rollout 的序列生成。
- robust multi-task optimization:多任务梯度冲突下的鲁棒优化。
- trace-aware experience assembly:按轨迹片段组装经验,用于 Agentic 任务。
架构扩展
- 时间序列模块:升级时间序列编码器以支持高效长序列建模,并新增 时间序列生成模块 用于数值预测。
- Memory Decoder:独立记忆增强路径,可在不修改冻结的 397B 主干的情况下,通过少量数据快速适配生物指令等科学子领域,例如将
Biology-Instructions平均分从 56.92 提升到 60.32。
输出与差异
输出为科学 Agentic 基础模型,可完成多模态科学理解、推理、生成以及跨长任务 horizon 的持续进展。与一般科学 LLM 或通用多模态模型相比,其关键差异在于将 时间序列预测与生成 融入科学推理,并通过 记忆解码器 实现冻结主干的低成本领域扩展,同时针对科学 Agentic 长时任务设计了多种 RL 稳定性技巧。
实验
实验设计
- 评估覆盖 科学 / 多模态 / agentic / 通用 benchmark;文中明确列出的特定基准为
SciTS与Biology-Instructions。 - 时间序列模块在
SciTS上验证科学信号理解与预测;Memory Decoder 作为独立 4B 扩展,在冻结 397B backbone 上评估快速科学特化。
关键发现
- 时间序列模块提升了
SciTS上的理解与预测能力。 - Memory Decoder 将
Biology-Instructions平均分从 56.92 提升至 60.32,且无需修改冻结的 397B backbone。 - 整体在科学、多模态、agentic、通用 benchmark 上取得 competitive 或 leading 表现。
对比解读
- Memory Decoder 的增益 (+3.4) 说明独立记忆增强路径可以低成本垂直化大模型,绕过全参数微调的稳定性与算力约束。
- 时间序列模块从长序列理解扩展到数值预测,扩大科学任务覆盖。
- 与常规 LLM 后训练相比,本文 RL 流程重点在稳定性工程:partial rollout + off-policy correction、adaptive length regularization、online speculative decoding、robust multi-task optimization、trace-aware experience assembly。
行业影响
落地场景
Intern-S2-Preview 面向科学研发场景,可直接嵌入制药、材料、生物信息等行业的 AI 辅助系统。具体可落地的产品形态包括:
- 科研文献智能助手:自动阅读多模态论文(图文混排、表格、公式),生成结构化综述或假设。
- 实验方案生成与优化:结合工具调用(如数据库查询、模拟器),为长流程实验提供逐步决策支持。
- 时间序列预测模块:用于实验仪器信号分析、化合物活性预测、临床指标趋势判断等数值型任务。
商业价值
核心价值在降本增效:替代大量人工文献调研与初级数据分析工作,缩短从假设到验证的周期。在药物发现中,可减少湿实验试错次数;在材料科学中,加速候选配方筛选。同时,Memory Decoder 允许在不更新 397B 主干的前提下快速适配垂直领域,显著降低垂直行业模型的部署与迭代成本。
与现有产品/工作流接口
该模型以 API 或私有化部署形式集成,对现有研发平台侵入性低。可通过以下方式接入:
- 在电子实验记录本 (ELN) 或 数据管理平台 中增加智能分析插件,调用模型解析历史实验数据并给出建议。
- 使用 Memory Decoder(轻量 4B 模块)挂载到已有 397B 服务上,仅需少量领域数据即可获得专业能力,不破坏基础模型通用性。
- 时间序列模块可作为独立服务,与企业现有预测系统(如生产排程、设备监控)对接,提供更精准的时序建模。
具体 use case:
- 制药企业:集成到内部药物靶点发现流水线,模型自动阅读专利、论文和实验图像,预测化合物-靶点相互作用,并生成下一批实验建议,减少化学合成与筛选成本。
- 科学仪器公司:在其分析软件中内置 Intern-S2-Preview 智能体,用户输入实验图谱后,模型自动解释信号、预测趋势,并推荐仪器参数调整,提升仪器附加价值与用户粘性。
局限
- **模型规模与部署成本**:Intern-S2-Preview-397B 参数量巨大,预训练和 RL 训练消耗大量计算资源,推理延迟高,难以满足实时科学 agent 交互需求;Memory Decoder 作为外挂模块虽冻结 backbone,但额外前向仍增加推理开销。论文未充分披露训练成本、分布式策略和量化部署方案,实际使用门槛较高。
- **科学任务泛化与评测局限**:评测主要依赖现有 benchmark(如 SciTS、Biology-Instructions),可能无法反映真实科学发现中开放环境、长时依赖和工具交互的复杂性。Agentic RL 通常在模拟环境中训练,与真实实验室设备、文献数据库和实验设计流程存在差距,论文未报告端到端真实科学任务上的表现,泛化能力有待验证。
- **领域覆盖与专精模型差距**:Memory Decoder 在 Biology-Instructions 上仅提升 3.4 分(56.92→60.32),绝对增益有限且需额外训练;时间序列模块主要针对数值预测,缺乏对图结构、分子、蛋白质等科学模态的统一建模。与 AlphaFold 等专精科学模型相比,通用科学 agent 在特定任务上可能仍处于劣势。