Prove the lift
AI model performance benchmarks
Real, eval-proven comparisons: two models run head-to-head over a real dataset, scored by an LLM-as-judge, with the measured lift on each. Filter by model to explore.
171 results
claude-sonnet-4-6 vs claude-haiku-4-5
+33 ptsInsurance Claims Reasoning·6 rows·54d agoView →
gpt-4o-mini vs claude-sonnet-4-6
−17 ptscontract-clause-qa·6 rows·55d agoView →
claude-sonnet-4-5 vs mixtral-8x7b
+23 ptsecommerce-catalog-norm·5 rows·55d agoView →
gemini-2.5-pro vs qwen2.5-vl-32b
+27 ptscontract-clause-qa·5 rows·55d agoView →
gpt-5.1 vs claude-opus-4-6
+20 ptscode-review-bench·7 rows·55d agoView →
llama-4-maverick vs gpt-5.1
−12 ptsecommerce-catalog-norm·5 rows·55d agoView →
deepseek-r1 vs llama-3.1-405b
+21 ptsmedical-coding-extract·5 rows·55d agoView →
mistral-large vs llama-3.3-70b
+16 ptssupport-ticket-triage·6 rows·55d agoView →
grok-3 vs minimax-m3
+1 ptsecommerce-catalog-norm·5 rows·55d agoView →
nova-pro vs claude-3-7-sonnet
+18 ptsmedical-coding-extract·5 rows·55d agoView →
glm-5.2 vs mistral-large
+9 ptssupport-ticket-triage·5 rows·55d agoView →
gemini-2.5-pro vs claude-opus-4-6
+8 ptsfinancial-doc-extract·5 rows·55d agoView →
claude-opus-4-6 vs gemini-3-pro
−1 ptsinsurance-extraction-eval·6 rows·55d agoView →
grok-4 vs claude-3-7-sonnet
+19 ptsfinancial-doc-extract·5 rows·55d agoView →
llama-3.1-405b vs grok-4
−4 ptsecommerce-catalog-norm·5 rows·55d agoView →
gpt-4.1-mini vs gpt-oss-20b
+21 ptsmedical-coding-extract·5 rows·55d agoView →
gemini-2.5-pro vs kimi-k2-thinking
−2 ptsinsurance-extraction-eval·6 rows·55d agoView →
llama-4-maverick vs claude-sonnet-4-6
+17 ptsfinancial-doc-extract·5 rows·55d agoView →
gpt-5 vs grok-4
+9 ptscontract-clause-qa·5 rows·55d agoView →
gpt-4.1 vs claude-haiku-4-5
+17 ptssupport-ticket-triage·6 rows·55d agoView →
gpt-4o vs o3-mini
+2 ptsecommerce-catalog-norm·5 rows·55d agoView →
claude-opus-4-6 vs claude-sonnet-5
+11 ptscontract-clause-qa·5 rows·55d agoView →
mistral-large vs gpt-oss-20b
+18 ptsinsurance-extraction-eval·8 rows·55d agoView →
glm-5.2 vs gpt-oss-120b
+21 ptsecommerce-catalog-norm·5 rows·55d agoView →
Prove the lift on your own data.
Run any two models over your tasks, judged automatically, and publish the result as a shareable benchmark.
Try Invoked