# Evals — Hanzo Cloud > Benchmark, grade, and regression-test models and agents. LLM-as-judge, golden sets, and drift detection with reproducible scorecards anchored on-chain. [Cloud](https://hanzo.ai/products)/Observe Beta # Evals Measure model and agent quality. Open sourceOn-chain settlement API /v1/evals Benchmark, grade, and regression-test models and agents. LLM-as-judge, golden sets, and drift detection with reproducible scorecards anchored on-chain. LLM-as-judge & golden sets Regression gates in CI Drift detection Anchored scorecards The AI cloud — one API for every capability. Open models. On-chain. [Get started](https://hanzo.ai/signup)[Talk to us](https://hanzo.ai/contact/sales)[Source](https://github.com/hanzoai/o11y)[Docs](https://docs.hanzo.ai/docs/services/evals)