Prove the lift · AI model performance evaluation

deepseek-r1 vs claude-sonnet-4-6

+24-point lift for deepseek-r1 on ecommerce-catalog-norm

Test summary

This benchmark evaluates deepseek-r1 against claude-sonnet-4-6 on the ecommerce-catalog-norm v1 dataset (5 rows), scored by an LLM-as-judge (gpt-4o-mini, run locally). deepseek-r1 reached a 57% pass rate versus 33% for claude-sonnet-4-6 — a +24-point lift.

Base model
claude-sonnet-4-6
via anthropic · 33% pass rate
Refined model
deepseek-r1
via deepseek · 57% pass rate · 1.5s p95
Base pass rate
33%
Refined pass rate
57%
Refined p95
1.5s
Est. tokens saved
12.6K
+0pts
refined beats base on 5 rows
0%
Base model
0%
Invoked-refined
2 improved0 regressed2 unchanged

Per-row results

1Deduplicate two near-identical SKUs0%100%+100
2Classify a listing into the right category node0%100%+100
3Normalize a free-text size into a standard enum100%100%0
4Extract material + color from a product title0%0%0
Prove the lift on your own data.

Run any two models over your tasks, judged automatically, and see the improvement — in seconds.

Try Invoked
Generated with Invoked · Browse all benchmarks