01
Assistant Agentic Search And Iterative Source Expansion
Mapped capabilities
16 scenarios
- Initial query formulation from user prompt

Eval directory · Legal AI
Evaluation packs covering adversarial robustness, safety gates, workflow quality, and operator-level checks for Harvey AI products.
Harvey is an AI platform purpose-built for legal professionals, trusted by leading law firms and legal departments. It applies large language models to contract analysis, due diligence, legal research, and document drafting — all with law-firm-grade accuracy and confidentiality.
Use the eval library for Harvey
All 179 test cases — inputs, expected behavior, and pass/fail checks — runnable in Corsac with your own data.
Related in Legal AI
All evals →Coverage map
10 areas · 179 graded scenarios
Every eval set is graded on
Pass/Fail + LLM judge 1–5 · critical severity flags · negative controls
01
Mapped capabilities
16 scenarios
02
Mapped capabilities
7 scenarios
03
Mapped capabilities
59 scenarios
04
Mapped capabilities
50 scenarios
05
Mapped capabilities
5 scenarios
06
Mapped capabilities
10 scenarios
07
Mapped capabilities
10 scenarios
08
Mapped capabilities
7 scenarios
09
Mapped capabilities
9 scenarios
10
Mapped capabilities
6 scenarios
Each eval pack tests Harvey's public product surface — including Assistant Agentic Search And Iterative Source Expansion, Assistant Citation Grounded Q A, Assistant Conversational Q A And Prompt Entry — against graded scenarios covering adversarial robustness, workflow quality, safety gates, and operator quality. Every pack is runnable in Corsac with your own data.
Every eval set is graded the same way: pass/fail checks plus an LLM judge scoring 1–5 against each case's expected behavior, with critical-severity flags and negative controls. Only judge-passed evals are published.
The Harvey eval library includes 179 graded test cases across 10 eval packs. Each case defines an input, expected behavior, and pass/fail criteria.
Request the library with your work email above and we'll set it up in a Corsac workspace, where you can run every test case against Harvey or your own agent with your own data.