Skip to main content
Evaluations score Agent Graphs against metrics across builds and drafts. Workspace OPERATE → Evaluations shows fleet Analytics and History / Sessions. Configure runs from Graph Studio Agent Evaluations.
Requires Professional or Enterprise. UI: evaluationsIncluded / upgrade wall. API: MinPlan.Evaluations on /eval/*. Permissions: workspace.evaluations.{read,configure,run,delete_run}.

Setup guide

Run on draft or Connect to Build end-to-end.

Studio panel

Connect to Build, Run on draft, Experiment, Signal.

Connect to Build

Live or scheduled scoring on a build.

Run on draft

Simulation, Autonomous, and Production datasets.

Where in the product

Evaluations Analytics KPIs

Evaluations — Analytics

Analytics

Range: Last 7 days / Last 30 days / Last 90 days · Refresh. Breakdowns: By dataset · By environment · By mode · By flow · volume heatmap · Recent runsView history.

History / Sessions

History Sessions tab

Evaluations — History / Sessions

Columns: Dataset · Status · Mode · Version · Env · Result · When · Run (delete if workspace.evaluations.delete_run). Open a run for the detail drawer (metrics, cases, logs).

Datasets and modes

Environments: Development · UAT · Production.
Running against Production is limited to Superadmin and QA. Admins and Developers use Development and UAT.

APIs (summary)

Prefix /eval (Pro+): /analytics, /runs, /metrics, /config, /dataset/*, /run, /run-mixed-metrics, /run-production-sessions, /evaluations, /evaluations/connect-to-build, streams, scenario generators.