Claude Haiku 4.5
6.2cheap tier1 run per challengeavg 13326msjudged by claude-sonnet-5
Every challenge this model has run, with the full paper trail — click into any row to read the raw response the judge scored.
13 challenges · best to worst
fizzbuzz
9.7correctness 10.0quality 9.0documentation 10.06422msinspect trace →
refactor
9.0correctness 10.0quality 8.0documentation 9.04281msinspect trace →
readme-writer
8.7correctness 8.0quality 9.0documentation 9.09373msinspect trace →
sql
8.7correctness 9.0quality 8.0documentation 9.03378msinspect trace →
elixir-test
8.7correctness 8.0quality 9.0documentation 9.06332msinspect trace →
binary-search
8.3correctness 9.0quality 7.0documentation 9.09962msinspect trace →
async-fetch
8.3correctness 9.0quality 8.0documentation 8.08387msinspect trace →
go-test
7.7correctness 8.0quality 9.0documentation 6.06437msinspect trace →
test-writing
5.0correctness 4.0quality 5.0documentation 6.011766msinspect trace →
debug
4.7correctness 5.0quality 5.0documentation 4.07262msinspect trace →
api-client
1.7correctness 0.0quality 2.0documentation 3.014221msinspect trace →
doom
0.7correctness 0.0quality 1.0documentation 1.050595msinspect trace →
slots
0.0correctness 0.0quality 0.0documentation 0.034823msinspect trace →