Prove the lift
AI model performance benchmarks
Real, eval-proven comparisons: two models run head-to-head over a real dataset, scored by an LLM-as-judge, with the measured lift on each. Filter by model to explore.
170 results
New
gpt-4o-mini vs claude-sonnet-4-6
−17 ptscontract-clause-qa·6 rows·3h agoView →
Newclaude-sonnet-4-5 vs mixtral-8x7b
+23 ptsecommerce-catalog-norm·5 rows·3h agoView →
Newgemini-2.5-pro vs qwen2.5-vl-32b
+27 ptscontract-clause-qa·5 rows·3h agoView →
Newgpt-5.1 vs claude-opus-4-6
+20 ptscode-review-bench·7 rows·3h agoView →
Newllama-4-maverick vs gpt-5.1
−12 ptsecommerce-catalog-norm·5 rows·3h agoView →
Newdeepseek-r1 vs llama-3.1-405b
+21 ptsmedical-coding-extract·5 rows·3h agoView →
Newmistral-large vs llama-3.3-70b
+16 ptssupport-ticket-triage·6 rows·3h agoView →
Newgrok-3 vs minimax-m3
+1 ptsecommerce-catalog-norm·5 rows·3h agoView →
Newnova-pro vs claude-3-7-sonnet
+18 ptsmedical-coding-extract·5 rows·3h agoView →
Newglm-5.2 vs mistral-large
+9 ptssupport-ticket-triage·5 rows·3h agoView →
Newgemini-2.5-pro vs claude-opus-4-6
+8 ptsfinancial-doc-extract·5 rows·3h agoView →
Newclaude-opus-4-6 vs gemini-3-pro
−1 ptsinsurance-extraction-eval·6 rows·3h agoView →
Newgrok-4 vs claude-3-7-sonnet
+19 ptsfinancial-doc-extract·5 rows·3h agoView →
Newllama-3.1-405b vs grok-4
−4 ptsecommerce-catalog-norm·5 rows·3h agoView →
Newgpt-4.1-mini vs gpt-oss-20b
+21 ptsmedical-coding-extract·5 rows·3h agoView →
Newgemini-2.5-pro vs kimi-k2-thinking
−2 ptsinsurance-extraction-eval·6 rows·3h agoView →
Newllama-4-maverick vs claude-sonnet-4-6
+17 ptsfinancial-doc-extract·5 rows·3h agoView →
Newgpt-5 vs grok-4
+9 ptscontract-clause-qa·5 rows·3h agoView →
Newgpt-4.1 vs claude-haiku-4-5
+17 ptssupport-ticket-triage·6 rows·3h agoView →
Newgpt-4o vs o3-mini
+2 ptsecommerce-catalog-norm·5 rows·3h agoView →
Newclaude-opus-4-6 vs claude-sonnet-5
+11 ptscontract-clause-qa·5 rows·3h agoView →
Newmistral-large vs gpt-oss-20b
+18 ptsinsurance-extraction-eval·8 rows·3h agoView →
Newglm-5.2 vs gpt-oss-120b
+21 ptsecommerce-catalog-norm·5 rows·3h agoView →
Newgpt-5.1 vs claude-opus-5
+8 ptscode-review-bench·5 rows·3h agoView →
Prove the lift on your own data.
Run any two models over your tasks, judged automatically, and publish the result as a shareable benchmark.
Try Invoked