开源项目

harvey-labs

harvey-labs

开源的法律 Agent 基准测试集与执行框架,覆盖 24+ 法律领域、1600+ 个真实任务,支持代理指令、文档和评分标准。亮点是提供完整 harness 和 LLM judge 自动评分,可跑通从 setup、agent run 到报告对比的端到端流程,适合做法律领域 Agent 能力评估和迭代。

README

Harvey LAB

Legal Agent Benchmark (LAB):一个用于在真实法律工作中评估 Agent 的开源基准。

最新版本 许可证:MIT 法律实践领域 任务 测试套件

Harvey LAB 是一个开源项目,旨在对 LLM Agent 在真实环境中执行法律工作的能力进行基准测评。

LAB 由两部分组成:一个包含 Agent 指令、文档和评分标准的 任务(tasks) 数据集,以及一个用于针对这些任务运行和评估 Agent 的 执行框架(execution harness)。

LAB 是一个持续进行中的项目,我们期望不断扩充和完善任务集与执行框架。

阅读公告文章:介绍 Harvey 的 Legal Agent Benchmark

快速开始

从 docs/tutorial.md 中的完整指南开始——它端到端地展示了一个真实的 M&A 数据室(data room)任务:环境设置、任务检查、Agent 运行、评分、报告审查和对比仪表板。

更多文档

指南 描述
架构 任务模型、执行框架、工具、适配器、报告和批量运行(sweeps)
评估方法论 全通过评分标准(rubric)评分以及 LLM 评委行为
贡献指南 添加任务、模型适配器、评估改进和文档

引用

如果您在研究中使用 Harvey LAB,请按以下格式引用:

@misc{harveylab2026,
  title   = {Harvey LAB: The Legal Agent Benchmark},
  author  = {{Harvey AI}},
  year    = {2026},
  version = {v1.0},
  url     = {https://github.com/harveyai/harvey-labs/tree/v1.0},
  note    = {Announcement: \url{https://www.harvey.ai/blog/introducing-harveys-legal-agent-benchmark}}
}
开源项目harveyai2026-08-09原文

相关内容