论文

Dr. Claw: 用于氛围研究的人工智能科学家工作台

Dr. Claw: 用于氛围研究的人工智能科学家工作台

命令行编码智能体(如 Claude Code、Gemini CLI)已能读写文件并维持长时间会话,但端到端研究仍零散分布于聊天工具、IDE、终端与写作环境,且使研究可审计的决策过程很少被保存。我们提出 Dr. Claw,一个开源工作台,它不引入另一个自主智能体,而是将现有编码智能体执行器封装进可控且可审计的人机协同工作流。 其核心包括持久化状态对象、可复用技能库与多执行器协调机制,将人类决策与 AI 执行紧密关联,使规划、执行与写作成为可追踪、可恢复的闭环。通过交互式三视图场景与故障恢复演练,我们展示了 Dr. Claw 的应用;并在固定底层执行器的前提下,将其与裸命令行智能体对比,以凸显完整编排层(任务图、状态对象和技能库)相较于所封装智能体的优势。实验表明,Dr. Claw 在研究完整性上得分更高,同时留下了可审计、可恢复的过程记录。演示仓库:https://github.com/OpenLAIR/dr-claw,以 AGPL-3.0 发布,部分上游组件采用 GPL-3.0。

论文精读

TL;DR Dr. Claw 把现有命令行编码代理包装成可审计、可恢复的人类在环研究工作台,用任务图、状态对象和技能库衔接人类决策与 AI 执行,在相同 executor 下比裸代理研究更完整且全程留痕。

问题

问题背景

AI 辅助科学研究正从单次问答走向端到端自动化。命令行编码代理(如 Claude Code、Gemini CLI)已能读写文件、长时间运行任务,但完整研究流程仍在聊天工具、IDE、终端、写作环境之间割裂。

现有方法局限

当前方案存在三类技术缺陷:

  • 状态不可审计:代理的中间决策(如文献筛选、实验方案变更)往往只存在于会话日志,缺乏结构化持久层,无法追溯或回滚。
  • 过度自主的风险:多数 research agent 追求全自动流水线,人类仅在首尾介入,难以在关键节点施加控制,导致结果不可信或方向偏离。
  • 上下文切换开销:研究者需在多个工具间手动同步上下文与中间产物,认知负担高,且过程不可复现。

为什么这个问题难 / 重要

科研任务具有长周期、多分支、强依赖的特征,要求系统同时满足:

  1. 可审计性:每一步 AI 执行都能关联到人类决策,形成合规痕迹。
  2. 可恢复性:失败后能定位到具体步骤并无损回退,而非推倒重来。
  3. 多执行器协调:不同子任务可能需不同后端(如代码生成、文献解析),统一编排且保持状态一致是工程难点。

业界对 AI Scientist 的关注度极高,但可复现性、安全性和人类监督始终是信任瓶颈。缺少可审计的工作空间层,单靠更强大的 agent 无法解决工程落地问题。

行业类比

如同 MLOps 中的实验追踪与流水线编排:若没有 MLflow 或 Kubeflow,仅凭脚本也能训练模型,但无法规模化、审计或协作。Dr. Claw 试图为 AI 研究提供类似的过程事实标准。

核心洞察

  • Dr. Claw 的核心不是再造一个自主 agent,而是为现有 coding-agent executor 添加可审计、可恢复的编排层。 与许多追求端到端自主性的研究 agent 不同,Dr. Claw 直接在 Claude Code、Gemini CLI 等成熟 executor 之上叠加 **持久状态对象** 和 **可复用技能库**,把重点从模型能力转向工作流工程。评估中固定 backend executor 的对比实验表明,性能增益完全来自编排层,而非底层 agent 差异,这为业界集成现有工具提供了清晰路径。
  • 以持久状态对象和技能库为核心,将人类决策纳入可恢复的审计循环。 论文通过 `persistent state objects` 和 `reusable skill library` 显式关联人类决策与 AI 执行,使规划、执行、写作形成可追踪、可恢复的链路。相比普通 CLI coding agents 在 session 结束后丢失上下文、失败无法非破坏性回滚,Dr. Claw 的 `task graph` 让审计成为架构属性而非事后补充,这对需要复现实验或合规审查的团队有直接价值。

方法

输入:用户的研究目标、自然语言指令以及过程中的人工决策(例如任务拆分、参数调整、执行审批)。

关键模块:

  • 持久状态对象(persistent state objects):将任务图、中间产物和执行历史显式建模为可查询的数据结构,形成可追踪的决策链路。
  • 可复用技能库(reusable skill library):沉淀文献检索、实验设计、论文写作等研究技能,底层 executor 按需调用,避免重复开发。
  • 多 executor 协调(multi-executor coordination):管理多个命令行编码代理(如 Claude Code、Gemini CLI),分配子任务、合并结果,并维护全局一致性。
  • 人类在环交互循环(human-in-the-loop interaction loop):规划、执行、写作三个阶段均可人工介入,决策被记录到状态对象,形成审计日志。

输出:一个可追踪、可恢复的研究过程轨迹,包含生成的代码、实验数据、写作草稿以及完整的决策审计记录。

与同类方法的差异点:Dr. Claw 不引入新的自主代理,而是通过编排层(任务图 + 状态对象 + 技能库)包装现有 executor,将人类决策显式纳入循环,在保证灵活性的同时提升审计性与可恢复性。

实验

实验设计

Dr. Claw 的评估基于与共享同一后端 executor 的裸命令行 agent 对比,固定 executor 变量,以突显编排层(task graph、state objects、skill library)的贡献。演示包括交互式三视图场景和失败恢复走查;评估维度覆盖开放目标下的研究完整度、触发可靠性、非破坏性失败恢复,以及一项回顾性三条件人工研究。

关键发现

在 executor 相同的前提下,Dr. Claw 的研究完整度得分高于裸命令行 agent,同时可持续保留可审计、可恢复的过程轨迹。审计性被定位为架构级 affordance,而非单一评分;失败恢复走查展示了非破坏性恢复能力。人工研究进一步考察了人在环中对上下文切换成本与决策保留的影响。

基线对比解读

裸命令行 agent 已具备文件读写和长会话能力,但研究过程仍分散在聊天工具、IDE、终端和写作环境之间,且决策记录难以持久化。Dr. Claw 通过持久状态对象、可复用技能库与多 executor 协调,将人类决策链接到 AI 执行,形成从规划、执行到写作的统一可追溯闭环。这表明在开放式研究任务中,编排层对完整性和可审计性的提升可能比底层 agent 能力更为关键,工程团队可关注工作流状态管理与技能复用,而非单纯追求更强 agent。

行业影响

落地场景

Dr. Claw 可作为 AI 研究编排层 嵌入任意需要 多步骤、可审计 的复杂知识工作流:

  • 金融研究自动化:生成个股或行业研究报告,保留数据源选择、模型调用、结论修正等决策链,满足合规审计。
  • 医疗文献综述:驱动多篇论文分析与证据提取,人类专家实时介入修正方向,形成可追溯的证据链。
  • 电商用户反馈分析:从海量评论中抽取主题、生成洞察报告,过程可恢复,避免重复批处理。

与裸命令行 agent 相比,Dr. Claw 的差异在于状态对象和技能库将人类决策固化进流程,而非让 agent 自由发挥,这对生产环境至关重要。

商业价值

  • 降本:减少人工在 chat、IDE、终端间的上下文切换损耗,避免因流程不可恢复导致的重复执行,直接降低 token 与人力成本。
  • 增收:加速研究报告、竞品分析等产出周期,提升高质量交付频率。
  • 体验提升:可审计、可恢复的特性增强团队对 AI 产出的信任,降低采用阻力。

实际工程启示:人类决策的持久化比单纯提高 agent 自主性更能解决落地瓶颈,因为企业需要的是可控产出,而非黑箱惊喜。

跟现有产品/工作流的接口

Dr. Claw 定位为包装层,不替换现有 coding agent:

  1. 通过配置文件接入 Claude Code / Gemini CLI 等后端执行器。
  2. 暴露 task graph / state objects 作为标准数据接口,可被 CI/CD 或 MLOps 平台消费。
  3. 技能库采用可复用格式,团队可沉淀内部最佳实践。

集成示例:在企业服务场景,可将 Dr. Claw 嵌入内部知识库系统,自动生成技术方案文档,同时把每一步 AI 操作记录到审计日志,与现有权限系统对接。

局限

  • - **评估对比范围有限**:仅与使用相同后端执行器的裸命令行智能体进行对比,未与 **AI Scientist**、**ChemCrow**、**GPT Researcher** 等现有端到端研究框架系统比较,无法说明编排层相对于其他工作流产品的增益。且测试任务集规模较小,研究完整性指标较单一,缺乏对效率、成本、用户满意度等多维量化。
  • - **底层能力受限于包装的执行器**:Dr. Claw 的创新集中在编排层,推理与工具调用仍依赖现有 coding-agent 执行器。当执行器产生幻觉或错误操作时,审计与恢复机制只能记录并重试,不能修正模型本身的缺陷。同时 skill 库的创建与维护需要大量人工设计与配置,多执行器协调策略也增加了系统复杂度,上手门槛较高。
  • - **审计价值未被量化与许可约束**:论文将审计能力定位为架构特性而非评分指标,未通过用户实验或对比实验证明审计信息对实际研究效率、错误恢复或复现性的提升幅度。此外,项目采用 **AGPL-3.0** 许可,虽利于开源生态,但可能限制希望闭源集成的企业场景,影响在生产环境中的落地范围。
论文Dingjie Song2026-08-31原文

相关内容