Test Run #6 Analysis
Comparing model performance for the E-COMMERCE Benchmark benchmark.
Global Filters
Languages
Models
Tags
Overall Avg. Score
0.533
Best Model
Claude 4 Sonnet
Highest Model Score
0.536
Comparing model performance for the E-COMMERCE Benchmark benchmark.
0.533
Claude 4 Sonnet
0.536