📌 项目地址harveyai/harvey-labs | ⭐ 765 颗星 | 🔧 Python | 📜 未标注

别拿通用benchmark衡量法律AI

大多数LLM benchmark考的是文本理解、常识推理、代码生成这类通用能力。但法律工作的特殊性在于:任务开放、文档长、事实密集、输出必须严格对应证据。一个在MMLU上拿高分的模型,面对一份股权购买协议的数据室,很可能不知道从哪里开始读、该提取什么信息、如何按客户要求输出结论。

Harvey LAB(Legal Agent Benchmark)正是为填补这个空白而生的开源基准。它由法律AI公司Harvey发布,核心目标只有一个:在真实法律工作流中评估和提升LLM agent的能力。项目包含两部分:一个任务数据集(含agent指令、文档、评分rubric),以及一个用于运行和评估agent的执行harness(execution harness)。

不仅考模型,还考agent的行为

LAB考的不是“写出正确答案”,而是“像律师一样把活干完”。以官方walkthrough里的例子来说:一个并购(M&A)数据室任务,agent需要面对一堆真实的合同文件,完成从信息检索到风险分析、再到按指定格式输出结论的全流程。

这与传统benchmark有本质区别:

  • 任务是开放式的:没有唯一标准答案,而是通过rubric(评分标准)评估agent的输出质量。
  • 评测的是执行轨迹:不只看最终结果,还评估agent如何规划任务、调用工具、处理超长文档。
  • 模拟真实环境:文档集、任务指令、客户要求的输出格式,都来自法律实务的典型场景。

架构:两个组件,一套流程

LAB由两层构成:

Dataset(任务集):每个task包含三类核心资源——agent instructions(任务指令,告诉agent要做什么)、documents(供agent查阅的文档材料)、rubrics(评分标准,定义输出如何打分)。

Execution Harness(执行框架):负责跑通整个评估流程——加载任务、调用agent、收集输出、按rubric评分、生成报告。支持接入不同的模型适配器(model adapters),意味着你可以用同一个任务集评测不同厂商的模型或自己的agent系统。

以下是官方文档中给出的架构模块,具体实现请参考docs/architecture.md

模块 说明
Task model 任务的数据结构定义
Harness 执行与评估主流程
Tools 提供给agent的辅助工具
Adapters 不同模型/agent系统的接入层
Reports 评估结果报告生成
Sweeps 批量跑多任务、多配置的机制

官方宣称的评测方式是全过评分(all-pass rubric scoring):rubric中的每一项必须全部通过,才算该任务成功。这种严格模式比“按比例给分”更能反映agent在法律交付场景中的可靠性——因为律师工作里,漏掉一个关键信息可能导致整个结论失效。更详细的评测方法论见docs/eval-strategies.md

实际用法:从tutorial开始

LAB没有给一条pip install命令——它是一个研究型仓库,使用方式以文档为主。官方明确建议从tutorial.md开始,它带你走完一个完整的并购数据室任务全流程:环境准备、任务检查、agent运行、评分、报告审查、对比dashboard(看不同配置的agent表现差异)。

具体步骤为:

  1. 克隆仓库。
  2. 按照docs/tutorial.md的指引,跑一遍端到端示例。
  3. docs/architecture.md理解底层设计。
  4. 如果要提交新任务或改进评测,看CONTRIBUTING.md

LAB不是开箱即用的测评工具,而是一个需要花时间理解其任务约束、评分逻辑、适配器接口的框架。如果你想评估自己的agent在法务场景的落地能力,tutorial是最好的入场券。

与其他benchmark的区别

目前公开的LLM评测基准大多是通用型或专业领域问答型。LAB的独特价值在于其“法律任务”与“agent执行”的双重针对性:

  • 针对agent而非纯模型:不是问模型“这道法律题选什么”,而是看agent能不能自己读文档、定计划、调用工具、交付结构化成果。
  • 针对法律真实场景而非法律知识问答:评估的是工作流,不是知识记忆。数据室分析、合同审查这类任务,更接近律师真实工作。
  • 严格评分标准:all-pass模式意味着agent不能靠“部分正确”蒙混过关,这对法律这类高容错率极低的行业是有意义的信号。

如果你想找的是“哪个模型法律知识最多”这类排行榜,LAB不是你要的东西。如果关注的是“我的agent能不能自动完成一项需要读一堆合同、输出一份结构化分析报告的活”,LAB提供了可复现的评测方法。

注意:评审、成本与迭代状态

几个需要提前了解的点:

  • 模型适配器需要自己写:LAB本身不绑定特定模型或agent框架,接入自家agent需要按adapter接口开发,有一定工程量。
  • LLM judge成本与稳定性:部分评分可能依赖LLM作为裁判,官方文档专门讨论了评估方法和judge行为,建议读一遍,避免对分数产生误读。
  • 项目处于持续迭代阶段:官方明确说“LAB is an ongoing project”,任务集和执行harness会持续扩充和调整。这意味着当前版本的结果与未来版本的评测可能不完全可比。
  • 许可证和引用:用于学术研究时,请按仓库提供的bibtex引用。注意版本号是v1.0,发布于2026年。

一段话总结

Harvey LAB是法律AI领域的第一个开源agent benchmark,它把评估重心从“模型知道什么”转向“agent能不能干活”。如果你想严肃评估agent在法律场景中的真实可用性,或者想为这个基准贡献法律任务,LAB是一个值得关注的起点。用之前先读tutorial,不要跳过。

这篇文章对你有帮助吗?

发表回复