Notes2Skills: 从实验笔记到确定性感知的科学智能体技能
科学发现工作流通常依赖实验笔记,其中记录观察、不确定性结果及后续计划。这些笔记保留了演进的科学推理和作者的不确定性,为AI参与科学探索提供了更深入的机会。然而,现有研究多聚焦于论文、协议或结构化数据库,忽略了非正式的实验笔记,导致AI可能将不确定的判断误认为确定结论或可执行操作。 为此,我们提出Notes2Skills,一个两阶段框架,将实验笔记转化为可验证的技能,同时保留作者的确定性。通过确定性感知处理,Notes2Skills在七个条件和三次湿实验室会话中,是唯一既不会将不确定笔记误认为指令,也不会丢弃确定指令的配置。 实验表明,确定性保留是连接实验笔记与可靠智能体技能的关键缺失环节,为更安全的AI协同科学家系统开辟了道路。
论文精读
TL;DR Notes2Skills 框架将实验室笔记转化为保留作者不确定性的 AI 代理技能,区分推测与确定结论,弥合了非正式笔记与可靠代理行为之间的关键鸿沟。
问题
问题背景
当前,科学研究自动化正处于从结构化数据走向全文本理解的关键阶段。AI 代理能够辅助或自主执行实验,但其知识来源仍高度依赖正式出版物和实验协议,而忽略了真实发现过程中最原始、信息量最丰富的载体——实验室笔记。这些笔记记录了观察、试验性推理、不确定性判断与后续计划,是连接人类科学直觉与可执行操作的桥梁。
现有方法局限
多数科学文本处理技术面向结构化或半结构化内容:
- 论文:经过多轮修饰,剥离了试错过程,无法反映真实的探索轨迹。
- 协议:仅包含成熟的操作步骤,缺乏对“为什么修改”或“可能替代方案”的论述。
- 数据库:仅收纳已确认的事实,丢失了推理链条中的不确定性。
当直接处理笔记时,基于BERT 的命名实体识别或大语言模型的零样本提取普遍存在“不确定性洗白”(uncertainty laundering) 问题。笔记中频繁出现的模糊词汇(如“或许”、“可能由……引起”)被扁平化为确定事实,导致两类风险:要么将猜测误解为指令(假阳性执行),要么完全丢弃不确定但有价值的信息(假阴性遗漏)。现有技术缺乏对认知模态(如断言、推测、否定)的细粒度建模,无法区分“应该做”与“可以试试”的动作边界。
为什么这个问题难且重要
从非结构化文本中重建作者信念状态是深层语义理解的难点,需要同时解析行动、实体及其确定性标签,且需保持三者的逻辑一致性。科学实验的高成本(湿实验试剂、时间、安全规范)要求 AI 代理的技能必须可验证、可靠。一个错误判断可能导致资源浪费甚至实验事故。工业界正大力投入 AI 科学家项目(如 AI co-scientist),但若无法安全吸收笔记中的不确定性,系统只能退回至处理干净的协议,丧失灵活性。因此,确定性保留是构建可信科学协作代理的关键空白。
行业类比
类似自动驾驶系统必须区分“极高置信度的障碍物”与“可能是阴影”以决定制动策略,科学 AI 代理也需从笔记中分辨“已验证的结论”与“待验证的假设”,否则将像自动驾驶误判路况一样,在实验决策中引发系统性偏差。
核心洞察
- 科学家笔记中的**作者不确定性**是构建可信 AI 科学助手的缺失拼图。现有科学文本处理多聚焦于论文或结构化协议,其中结论已被“抛光”;而原始笔记混杂观察、推测和计划,若不加区分直接作为指令输入,Agent 会误将试探性想法当作确认行动,引发不可靠操作。Notes2Skills 首次系统地对笔记中的 **epistemic directive** 进行提取与分类(确认/疑似/排除),保留作者的不确定性刻度,使 Agent 能区分“已验证”与“待验证”,从而避免盲目执行尚未确定的步骤。这一思路区别于简单的信息抽取或纯 LLM 压缩,为科学 Agent 引入了类似于人类科学家“置信度沟通”的机制。
- 两阶段编译过程将非结构化笔记转化为**可审计的元技能 (MetaSkill)**,为科学 Agent 提供了决策可追溯性。以往直接加载笔记或仅用 LLM 生成动作列表的方案(如外部 LLM 基线)无法回答“为什么此刻执行该步骤”以及“该步骤多可靠”;而 Notes2Skills 的 MetaSkill 封装触发条件与确定性阈值,形成可验证的规则胶囊。在执行侧,保守策略 (conservative execution rules) 确保只有达到预设确定性的指令才被激活,这相当于在技能加载层嵌入安全约束。这种方法不仅提升下游任务成功率,更关键的是提供了一条从原始实验记录到可审计决策的工程化路径,对构建负责任的 AI 共科学家系统具有范式意义。
方法
Notes2Skills 框架将非结构化的实验室笔记转化为 AI 科学代理可执行的、带确定性标注的技能。流程分为两个阶段:
阶段 1:认知指令提取(Epistemic Directive Extraction)
输入:科学家在实验中记录的自由文本笔记,内容混杂了已验证的观察、试探性判断和后续实验计划。
模块:使用大语言模型(LLM)作为提取器,通过精心设计的提示(包含少量示例和语料库特定的系统消息)将每条笔记片段映射到结构化的认知指令(Epistemic Directive)。指令包含三个核心字段:
directive_type:区分“事实陈述”“假设”“待办动作”等类别;certainty:作者表达的确定性水平(如“确认”“可能”“未知”);content:标准化后的可操作描述。
输出:一组带确定性标签的认知指令列表,作为中间表示。
阶段 2:元技能编译(MetaSkill Compilation)
输入:阶段 1 生成的认知指令。
模块:一个基于规则的编译器,将指令转换为元技能胶囊(MetaSkill Capsule)。胶囊采用统一 schema,除动作内容外,强制嵌入“确信度”字段,并定义了一套保守执行规则:
- 仅当
certainty高于阈值时,指令才被视为可执行技能; - 低确定性内容被标记为
FLAG,供下游代理参考但不会直接触发操作; - 采用“行为有界”设计,确保代理不会将试探性语言误解为确定指令。
输出:可供 AI 代理加载的、确定性保持的技能包。下游代理在执行时依据技能携带的确定性标签决定是否执行或如何加权。
与同类工作的差异
以往将科学文本编译为代理技能的工作(如从协议或论文中提取步骤)默认文本内容是确定且正确的,无法区分科学笔记中普遍存在的试探性判断与确认结论。Notes2Skills 首次在技能生成中显式建模并保留作者的不确定性,从而避免 AI 代理误将猜测当成事实执行,为构建更安全的 AI 科学协作系统提供了关键一环。
实验
实验设计
论文围绕 Notes2Skills 两阶段框架展开,将非正式实验记录转化为可执行的 AI 科学代理技能。第一阶段 (Epistemic Directive Extraction) 从笔记中提取三种认识论指令:已验证观察、暂定判断与后续步骤;第二阶段 (MetaSkill Compilation) 将指令封装为包含确定性标签与执行前提的 元技能胶囊 (MetaSkill Capsule)。实验覆盖 7 种系统配置 与 3 场湿实验会话,在各配置下将原始笔记、纯动作技能与 Notes2Skills 技能加载到同一个规则化执行器 (Executor) 中,测量下游行为。执行器依据保守规则拒绝在前提未满足时执行暂定指令。
关键发现
在 下游确定性审计 中,Notes2Skills 是唯一既不误将不确定笔记当作确定指令 (零误执行),也不丢弃确定指令 (零遗漏) 的配置。原始 LLM 直接使用笔记时会出现 不确定性洗白 (Uncertainty Laundering),将“可能成功”改写为“执行该步骤”,导致执行器盲目操作。而纯动作技能 (去除确定性信息) 则完全忽略暂定判断,丢失有价值线索。Notes2Skills 通过在元技能中保留作者原意的 确定性强度,使执行器能对暂定建议采取“标记但不执行”的策略,平衡安全性与信息完整性。
与基线的对比解读
与 External LLM 基线 (直接由 LLM 控制动作) 相比,Notes2Skills 将决策逻辑从黑箱模型中解耦,下沉到可审计的执行规则中,提升可解释性与可控性。与 仅使用动作库 的配置相比,Notes2Skills 额外提供实验上下文与假设,让代理能根据实验进展自主选择何时验证暂定判断,而非简单丢弃。消融实验表明,确定性保留是实验室笔记到可靠代理技能的关键缺失模块。即便第一阶段提取由较弱模型完成,只要第二阶段封装了确定性,下游表现依然稳健,验证了框架对提取噪声的鲁棒性。
行业影响
落地场景
Notes2Skills 直接面向需要从非结构化实验记录中提取可执行知识的场景。典型落地产品包括:
- 药物研发 AI 助手:将化学家、生物学家的湿实验笔记转化为可验证的后续实验步骤,支持 AI 驱动的迭代优化。
- 材料科学自动化平台:从合成记录中提取可复现的配方与参数范围,降低人工解析成本。
- 企业级 ELN(电子实验室笔记本)增强:为现有 ELN 系统(如 Benchling、LabArchives)增加“确定性感知”模块,自动标记推测性表述,避免下游自动化错误执行。
- 科学知识图谱构建:从实验室原始记录中抽取实体与关系时,保留置信度层级,提升图谱可靠性。
商业价值
核心价值在于研发降本与风险控制:
- 减少实验试错成本:AI agent 通过 Notes2Skills 获取技能时,能区分“已验证结论”与“待验证猜测”,避免基于不可靠指令执行昂贵实验造成的物料与时间浪费。
- 加速从记录到行动的闭环:传统上,实验记录需人工审阅后才能规划下一步;Notes2Skills 自动抽取并编译为可执行技能,可将决策周期缩短数倍。
- 合规与可审计性:在 GxP 监管行业(制药、医疗器械),保留确定性标记意味着可追溯 AI 决策依据,辅助审计。
与现有工作流的集成
该框架以无侵入方式嵌入现有研发技术栈:
- 输入接口:直接消费自然语言实验笔记(文本、ELN 导出),无需预结构化。
- 输出格式:MetaSkill Capsule JSON,包含技能名称、前置条件、行动序列及确定性标签,可被多数实验自动化框架(如 ChemOS、SD2)解析。
- 与 LLM-based Agent 的配合:Stage 1 提取的 EDE 可作为 prompt 上下文注入通用 agent,或直接编译为可执行函数;Stage 2 的审计机制确保技能安全性。可部署为微服务,挂载到现有 LIMS 或 ELN API。
具体落地用例
跨国制药公司的药物化学发现:化学家记录反应结果时写道“产物可能是酮式结构,尚需确认”。Notes2Skills 将其标记为 certainty=low,避免机器人直接预订 NMR 测试;同时提取“进行 NMR 确认”作为高确定性 next step,推动流程。
生物技术公司的自动化菌株工程:实验笔记包含“转化效率80%,推测质粒浓度过高导致”。框架提取出 validated_observation(效率值)与 tentative_hypothesis(原因推测),仅将优化质粒浓度作为定量调整的技能,防止系统盲目稀释样本,提升实验通量与成功率。
局限
- **领域与数据集局限**:论文构建的 **FreeNotes** 数据集仅来源于湿实验室笔记,且规模有限(3 次湿实验室会话,7 种条件)。虽然人工标注一致性较高,但样本多样性不足可能影响方法在干实验、计算模拟或跨学科笔记上的泛化能力。作者未讨论笔记在语言风格、记录习惯、缩写噪声等方面的更大方差,而这些在实际实验室环境中普遍存在。
- **模式依赖与可扩展性**:**Notes2Skills** 工作流中的 **MetaSkill 编译** 依赖预定义的动作集(action set)与模式(schema),需领域专家手工设计 **保守执行规则** 和 **技能胶囊**。当面对新的实验范式或动作空间时,重新设计这些规则和模式的成本较高,且难以保证覆盖所有不确定性表达。这限制了该框架向大规模、多领域科学代理的快速迁移。
- **不确定性的粗粒度建模**:框架将作者的不确定性简化为三类 **指导性类型**(directive_type: `firm`, `tentative`, `flag`),可能丢失了科学推理中更细粒度的置信度信息(如概率估计、条件依赖等)。此外,**Stage 1 的 EDE 提取** 在不确定语句上的性能仍有误差(见论文 **Exp 1** 的错误分析),可能影响下游技能加载的可靠性,但作者未深入探讨错误传播对 **确定保留审计** (Preservation Audit) 的定量影响。