Overview
Fleet health across your evaluation runs, last 30 days.
Recent evaluation runs
Evaluation Runs
List and filter every evaluation run by model, dataset, status, and date.
| Model | Dataset | Status | Started | Duration |
|---|
Model Comparison
Compared runs (0)
| Run |
|---|
Model quality over time
Daily quality score for each compared run’s model + dataset pair