harvey-labs harveyai
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
- 주요 언어
- Python
- Stars
- 1,096
- Forks
- 197
태그
- 数据集
- 框架
- 研究Agent
- 微基准测试
- 工具调用
- Python
- 提示词工程
요약
Harvey LAB(Legal Agent Benchmark)是一个开源基准测试项目,专为评估LLM智能体在真实法律工作场景中的能力而构建。它包含两大核心组件:覆盖24+法律实践领域、共1671个任务的数据集(含指令、文档和评分标准),以及用于运行和评估智能体的执行框架。项目支持从M&A数据室审查等真实法律任务的端到端执行、评分和结果分析,适用于法律AI研究者和开发者对智能体能力的系统性评测与改进。
README
<p align="center"> <img src="docs/assets/lab-hero.png" alt="Harvey LAB" width="100%"> </p> <p align="center"> <strong>Legal Agent Benchmark (LAB): An open-source benchmark for evaluating agents on real legal work.</strong> </p> <p align="center"> <a href="https://github.com/harveyai/harvey-labs/tag…