Prove the lift

AI model performance benchmarks

Real, eval-proven comparisons: two models run head-to-head over a real dataset, scored by an LLM-as-judge, with the measured lift on each. Filter by model to explore.

170 results
New

gpt-4o-mini vs claude-sonnet-4-6

17 pts
contract-clause-qa·6 rows·4h agoView →
New

claude-sonnet-4-5 vs mixtral-8x7b

+23 pts
ecommerce-catalog-norm·5 rows·4h agoView →
New

gemini-2.5-pro vs qwen2.5-vl-32b

+27 pts
contract-clause-qa·5 rows·4h agoView →
New

gpt-5.1 vs claude-opus-4-6

+20 pts
code-review-bench·7 rows·4h agoView →
New

llama-4-maverick vs gpt-5.1

12 pts
ecommerce-catalog-norm·5 rows·4h agoView →
New

deepseek-r1 vs llama-3.1-405b

+21 pts
medical-coding-extract·5 rows·4h agoView →
New

mistral-large vs llama-3.3-70b

+16 pts
support-ticket-triage·6 rows·4h agoView →
New

grok-3 vs minimax-m3

+1 pts
ecommerce-catalog-norm·5 rows·4h agoView →
New

nova-pro vs claude-3-7-sonnet

+18 pts
medical-coding-extract·5 rows·4h agoView →
New

glm-5.2 vs mistral-large

+9 pts
support-ticket-triage·5 rows·4h agoView →
New

gemini-2.5-pro vs claude-opus-4-6

+8 pts
financial-doc-extract·5 rows·4h agoView →
New

claude-opus-4-6 vs gemini-3-pro

1 pts
insurance-extraction-eval·6 rows·4h agoView →
New

grok-4 vs claude-3-7-sonnet

+19 pts
financial-doc-extract·5 rows·4h agoView →
New

llama-3.1-405b vs grok-4

4 pts
ecommerce-catalog-norm·5 rows·4h agoView →
New

gpt-4.1-mini vs gpt-oss-20b

+21 pts
medical-coding-extract·5 rows·4h agoView →
New

gemini-2.5-pro vs kimi-k2-thinking

2 pts
insurance-extraction-eval·6 rows·4h agoView →
New

llama-4-maverick vs claude-sonnet-4-6

+17 pts
financial-doc-extract·5 rows·4h agoView →
New

gpt-5 vs grok-4

+9 pts
contract-clause-qa·5 rows·4h agoView →
New

gpt-4.1 vs claude-haiku-4-5

+17 pts
support-ticket-triage·6 rows·4h agoView →
New

gpt-4o vs o3-mini

+2 pts
ecommerce-catalog-norm·5 rows·4h agoView →
New

claude-opus-4-6 vs claude-sonnet-5

+11 pts
contract-clause-qa·5 rows·4h agoView →
New

mistral-large vs gpt-oss-20b

+18 pts
insurance-extraction-eval·8 rows·4h agoView →
New

glm-5.2 vs gpt-oss-120b

+21 pts
ecommerce-catalog-norm·5 rows·4h agoView →
New

gpt-5.1 vs claude-opus-5

+8 pts
code-review-bench·5 rows·4h agoView →
Prove the lift on your own data.

Run any two models over your tasks, judged automatically, and publish the result as a shareable benchmark.

Try Invoked