Benchmarks
GPQA 2026
Official General-Purpose Question Answering benchmark for 2026.
BLOCKCHAINS Benchmark
Comitatus odio odio animi minima eius amor minima cupiditas cupressus.
SOLUTIONS Benchmark
Spiculum iusto umbra arma spargo calculus abeo deorsum laudantium.
SYNERGIES Benchmark
Delinquo studio velut acervus voluptates nostrum vitiosus.
APPLICATIONS Benchmark
Viscus traho facilis vir suadeo cognomen quam tricesimus harum casso.
Recent Test Runs
Test Run #1 - GPQA 2026
Models: Claude 4 Sonnet, GPT O3, Llama 4, Gemini 2.5 Pro | Languages: es, en, fr, de, it
COMPLETED13 days ago
Test Run #2 - SYNERGIES Benchmark
Models: Claude 4 Sonnet | Languages: it, es
RUNNING27 days ago
Test Run #3 - APPLICATIONS Benchmark
Models: Gemini 2.5 Pro | Languages: de, es
COMPLETED4 days ago
Test Run #4 - SYNERGIES Benchmark
Models: Llama 4, GPT O3 | Languages: es, it, de
FAILED26 days ago
Test Run #5 - APPLICATIONS Benchmark
Models: Gemini 2.5 Pro, GPT O3 | Languages: de, it, es, en, fr
RUNNING12 days ago
Test Run #6 - GPQA 2026
Models: GPT O3 | Languages: de, it
COMPLETED17 days ago
Test Run #7 - APPLICATIONS Benchmark
Models: GPT O3, Gemini 2.5 Pro, Claude 4 Sonnet, Llama 4 | Languages: it, en
FAILED2 days ago
Test Run #8 - GPQA 2026
Models: GPT O3 | Languages: es, en, fr, de, it
RUNNINGyesterday
Test Run #9 - BLOCKCHAINS Benchmark
Models: GPT O3 | Languages: fr, de, es, en
COMPLETED11 days ago
Test Run #10 - SYNERGIES Benchmark
Models: GPT O3, Llama 4, Gemini 2.5 Pro | Languages: it, en, es
COMPLETED21 days ago