Prerequisites
- Pro+ (
evaluationsIncluded) - Permissions:
workspace.evaluations.read+runand/orconfigure - For Production env or Production datasets: Superadmin or QA only
- A saved Agent Graph (and a Build if using Connect to Build / Signal)
Path 1 — Run on draft (iterate while designing)
- Open Graph Studio → Evaluations (
?tab=eval). - Click Run on draft.
- Dataset — pick Simulation, Autonomous, or Production.
- Choose mode (Agentic eval / Single-turn eval / Multi-turn eval) and env (Development / UAT / Production).
- Continue by dataset:
Simulation / Autonomous
Production
- Watch progress in Studio; open OPERATE → Evaluations for results.
Path 2 — Connect to Build (live or scheduled)
- Studio Evaluations → Connect to Build.
- Mode — Live (Score traffic as it hits this build) or Schedule (Score the top anomalies from the last N days).
- Build — Name, Build picker; if Schedule: Last N days (1–7), Top anomalies (1–100), Run at (UTC); optional Enable signal.
- Metrics — Select & tune.
- Review — Save & attach.
POST /eval/evaluations/connect-to-build. Detail: Connect to Build.
Path 3 — Signal only
- Studio Evaluations → Signal.
- Toggle Signal per build (Build · Version · Since · Signal).
Read results
- OPERATE → Evaluations → Analytics — Runs in range, Completed, Pass rate, Failed runs; By dataset / environment / mode / flow.
- History / Sessions — search Run ID / session ID; filter Flow, Version, Env, Status; open run detail; delete if permitted.
Experiment
Experiment is listed in Studio but is a stub today (compare builds / build vs draft). Use Connect to Build or Run on draft instead.Checklist
- Pro+ unlocked
- Dataset + metrics chosen
- Launch or Save & attach succeeded
- Run visible in Analytics / History
- Production paths only used by Superadmin/QA

