- Data revision
- —
- Fetched
- —
- Observations
- —
Check your connection or open the source dataset.
Data view
Reliability
Configuration provenance
Comparisons
Source runs
Visual explorer
Charts
Score comparison
Coverage-adjusted quality for each visible configuration.
Task-family distribution
Configuration scores within each task family. Boxes require multiple comparable configurations.
Efficiency
Score against reported duration, cost, and token usage. Missing reports are omitted, never zero-filled.
Recovery
First-attempt and final exact results for the same visible configurations.
Accepted results
Loading configurations…
No configurations match these filters.
All is the default for benchmark and reasoning. Scores are macro-averaged by reasoning, benchmark version, then benchmark family, so larger datasets do not dominate. Explicit Edit uses 75% first exact plus 25% final exact. Evidence includes missing task-mode and benchmark coverage. Duration, cost and tokens use reported observations.