harvey-labs
开源的法律 Agent 基准测试集与执行框架,覆盖 24+ 法律领域、1600+ 个真实任务,支持代理指令、文档和评分标准。亮点是提供完整 harness 和 LLM judge 自动评分,可跑通从 setup、agent run 到报告对比的端到端流程,适合做法律领域 Agent 能力评估和迭代。
README
Legal Agent Benchmark (LAB):一个用于在真实法律工作中评估 Agent 的开源基准。
Harvey LAB 是一个开源项目,旨在对 LLM Agent 在真实环境中执行法律工作的能力进行基准测评。
LAB 由两部分组成:一个包含 Agent 指令、文档和评分标准的 任务(tasks) 数据集,以及一个用于针对这些任务运行和评估 Agent 的 执行框架(execution harness)。
LAB 是一个持续进行中的项目,我们期望不断扩充和完善任务集与执行框架。
阅读公告文章:介绍 Harvey 的 Legal Agent Benchmark
快速开始
从 docs/tutorial.md 中的完整指南开始——它端到端地展示了一个真实的 M&A 数据室(data room)任务:环境设置、任务检查、Agent 运行、评分、报告审查和对比仪表板。
更多文档
| 指南 | 描述 |
|---|---|
| 架构 | 任务模型、执行框架、工具、适配器、报告和批量运行(sweeps) |
| 评估方法论 | 全通过评分标准(rubric)评分以及 LLM 评委行为 |
| 贡献指南 | 添加任务、模型适配器、评估改进和文档 |
引用
如果您在研究中使用 Harvey LAB,请按以下格式引用:
@misc{harveylab2026,
title = {Harvey LAB: The Legal Agent Benchmark},
author = {{Harvey AI}},
year = {2026},
version = {v1.0},
url = {https://github.com/harveyai/harvey-labs/tree/v1.0},
note = {Announcement: \url{https://www.harvey.ai/blog/introducing-harveys-legal-agent-benchmark}}
}