Modelos Relacionados
Benchmarks
MMLU-Pro
40.6%
GPQA Diamond
32.1%
HLE
4.7%
LiveCodeBench
9.8%
SciCode
11.8%
TerminalBench HardNão avaliado
MATH-500
32.9%
AIME
1.7%
AIME 2025Não avaliado
IFBenchNão avaliado
Long Context RecallNão avaliado
Tau2Não avaliado
Média do MercadoMelhor Score