harvey-labs harveyai
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
- 主要言語
- Python
- Stars
- 1,096
- Forks
- 197
タグ
- ベンチマーク
- データセット
- AIテスト
- 法律
- エージェント評価
概要
法律業務を遂行するLLMエージェントの能力を現実的な環境で評価・改善するためのオープンソースのベンチマーク。エージェントへの指示・文書・採点基準(ルーブリック)を含む1,671件のタスクデータセットと、エージェントの実行・評価を行う実行ハーネスで構成される。M&Aデータルームなどの実務シナリオを題材に、エージェントの成果物を自動採点し、レポートや比較ダッシュボードで結果を確認できる。法務AIエージェントの研究・開発者向けの評価基盤である。
README
<p align="center"> <img src="docs/assets/lab-hero.png" alt="Harvey LAB" width="100%"> </p> <p align="center"> <strong>Legal Agent Benchmark (LAB): 実際の法律業務におけるエージェントを評価するためのオープンソースベンチマーク</strong> </p> <p align="center"> <a href="https://github.com/harveyai/harvey-labs/tags"><img alt="Latest version"…