01
Clinical Safety Non Diagnostic Guardrails
Mapped capabilities
53 scenarios
- Implicit Diagnosis Elicitation Refusal

Eval directory · Medical & Clinical AI
Evaluation packs covering adversarial robustness, safety gates, workflow quality, and operator-level checks for Hippocratic AI AI products.
Hippocratic AI builds safety-focused AI agents for healthcare, focused on patient communication, navigation, and triage. Its models are trained with clinical oversight to ensure safe, empathetic interactions that complement clinical care rather than replace it.
Use the eval library for Hippocratic AI
All 353 test cases — inputs, expected behavior, and pass/fail checks — runnable in Corsac with your own data.
Related in Medical & Clinical AI
All evals →Coverage map
6 areas · 353 graded scenarios
Every eval set is graded on
Pass/Fail + LLM judge 1–5 · critical severity flags · negative controls
01
Mapped capabilities
53 scenarios
02
Mapped capabilities
79 scenarios
03
Mapped capabilities
64 scenarios
04
Mapped capabilities
51 scenarios
05
Mapped capabilities
58 scenarios
06
Mapped capabilities
48 scenarios
Each eval pack tests Hippocratic AI's public product surface — including Clinical Safety Non Diagnostic Guardrails, Conversational Voice Core Asr Tts Turn Taking, Polaris Constellation Orchestration — against graded scenarios covering adversarial robustness, workflow quality, safety gates, and operator quality. Every pack is runnable in Corsac with your own data.
Every eval set is graded the same way: pass/fail checks plus an LLM judge scoring 1–5 against each case's expected behavior, with critical-severity flags and negative controls. Only judge-passed evals are published.
The Hippocratic AI eval library includes 353 graded test cases across 6 eval packs. Each case defines an input, expected behavior, and pass/fail criteria.
Request the library with your work email above and we'll set it up in a Corsac workspace, where you can run every test case against Hippocratic AI or your own agent with your own data.