Overview

Fleet health across your evaluation runs, last 30 days.

Recent evaluation runs

Evaluation Runs

List and filter every evaluation run by model, dataset, status, and date.

ModelDatasetStatusStartedDuration

Model Comparison

Compared runs (0)

Run

Model quality over time

Daily quality score for each compared run’s model + dataset pair