Test Run #6 Analysis

Comparing model performance for the E-COMMERCE Benchmark benchmark.

Global Filters

Languages

Models

Tags

Overall Avg. Score

0.533

Best Model

Claude 4 Sonnet

Highest Model Score

0.536

Model Scores per Language

© 2026 LLM Benchmarker. All rights reserved.