Início › AI Benchmark

Qual IA é a melhor hoje? Com a fonte de cada número.

258 modelos de 32 laboratórios, medidos por quem mede de verdade. Aqui não tem opinião: tem fonte. Como isto é apurado

Lançamento mais recente 28/09/2026

Claude Sonnet 5.5

Anthropic · API access

Ainda sem ECI: o índice de capacidade da Epoch AI é composto e sai numa rodada posterior ao lançamento, então este modelo ainda não ocupa posição no ranking por inteligência. O que já existe está abaixo: as provas individuais da Epoch AI, cada uma ao lado do melhor resultado já registrado nela, e, quando já publicadas, as notas da Arena e do LiveBench. Quando o ECI sair, o modelo sobe sozinho para a tabela.

Apex Agents 44,6% recorde 67,8% (Gemini 3.7 Flash)
CritPt 11,4% recorde 30,6% (GPT-5.5 Pro)
CursorBench 35,8% recorde 46,8% (Claude Fable 5.1)
FrontierCode 52,1% recorde 53,5% (Claude Fable 5)
FrontierSWE 61,9% recorde 65,5% (GPT-6 Astra)
ProofBench 100,0% recorde 100,0% (Claude Fable 5.1)
SciCode 49,1% recorde 61,0% (Claude Fable 5)
LiveBench, média geral 77,8 recorde 83,4 (Claude Fable 5.1)

Fonte das notas: Epoch AI, sob Creative Commons Attribution 4.0. A ROO3 não mede modelo nenhum. A média geral é do LiveBench, sob CC BY-SA 4.0. Ver todos os recém-lançados sem nota

Ranking por inteligência

ECI, do Epoch AI · 20 de 258 apurado em 29/09/2026 às 05:25
# Modelo Laboratório ECI ELO LiveBench Acesso Lançamento
novoGPT-6 Sol OpenAI sem ECI ainda sem par 79,3 API access 22/09/2026
novoGPT-6 Luna OpenAI sem ECI ainda sem par 72,0 API access 22/09/2026
🥇 GPT-6 Astra OpenAI 166,60 sem par 82,2 API access 03/09/2026
novoClaude Opus 5.5 Anthropic sem ECI ainda 1.572 83,2 API access 22/09/2026
novoClaude Sonnet 5.5 Anthropic sem ECI ainda sem par 77,8 API access 28/09/2026
🥈 Claude Fable 5.1 Anthropic 165,00 sem par 83,4 API access 01/09/2026
🥉 Claude Fable 5 Anthropic 163,60 1.546 83,0 API access 09/06/2026
4 Claude Opus 5 Anthropic 162,67 1.571 80,1 API access 24/07/2026
5 GPT-5.5 Pro OpenAI 162,45 sem par sem par API access 23/04/2026
6 GPT-5.6 Sol OpenAI 161,99 1.523 81,1 API access 09/07/2026
7 GPT-5.6 Terra OpenAI 159,31 1.514 77,9 API access 09/07/2026
8 GPT-5.5 OpenAI 159,25 1.535 80,2 API access 23/04/2026
9 GPT-5.4 Pro OpenAI 159,12 sem par sem par API access 05/03/2026
10 Claude Opus 4.8 Anthropic 158,30 1.509 76,2 API access 28/05/2026
11 Gemini 3.7 Flash Google DeepMind 157,72 1.553 78,8 API access 13/08/2026
12 Kimi K3 Moonshot 157,68 sem par 79,2 Open weights (non-commercial) 16/07/2026
13 Gemini 3.8 Flash Google DeepMind 157,13 1.547 75,8 API access 02/09/2026
14 GPT-5.4 OpenAI 156,92 1.520 78,0 API access 05/03/2026
15 Muse Spark 1.3 Meta AI 156,89 sem par 81,6 API access 02/09/2026
16 GPT-5.3 Codex OpenAI 156,84 sem par sem par API access 05/02/2026
17 Qwen 3.8 Max Alibaba 156,69 1.537 78,5 API access 02/08/2026
novoGrok 4.7 xAI sem ECI ainda 1.476 77,4 API access 21/09/2026
18 Grok 4.6 xAI 156,48 1.479 78,0 API access 12/08/2026
19 Claude Opus 4.7 Anthropic 156,39 1.530 76,5 API access 16/04/2026
20 Claude Sonnet 5 Anthropic 156,34 1.491 76,0 API access 30/06/2026
Mostrando 20 de 258 modelos. A barrinha sob o ECI parte de 155,11, e não de zero: nesta faixa uma escala do zero deixaria todas iguais. Linha marcada como novo é lançamento que a Epoch AI ainda não pontuou. Ela aparece junto do laboratório para comparação e não ocupa colocação, porque sem nota não existe posição. Apuração de 29/09/2026 às 05:25, horário de Brasília.

ECI é capacidade medida em provas difíceis, apurada pelo Epoch AI. ELO é preferência de pessoas comuns em conversas às cegas, da LMArena. O LiveBench, média de 23 tarefas objetivas com perguntas renovadas, é a terceira leitura. Os rankings não coincidem, e a diferença entre eles é a informação mais útil daqui. A ordem padrão é a do ECI. Nenhum dos índices é nosso: nós apuramos, casamos os nomes e mostramos a origem de cada número.

258modelos no ranking
32laboratórios acompanhados
102com nota de preferência humana
2fontes, ambas CC BY 4.0
A fronteira

Cada ponto é um modelo. A linha é o recorde da época.

Capacidade (ECI) pela data de lançamento. A linha verde liga os modelos que, no dia em que saíram, eram o melhor que existia. É a leitura mais direta de quanto o ritmo acelerou.

modelo recorde na data Fonte: Epoch AI, CC BY 4.0.
Custo por tarefa

Quanto cada modelo entrega por dólar

Cada linha é um modelo, e cada ponto é um nível de esforço, do mais barato ao mais caro. Mais alto é nota maior; mais à direita é tarefa mais barata. A curva mostra o que se ganha pagando mais pelo mesmo modelo, e onde deixa de valer a diferença.

CursorBench
Nota no CursorBench pelo custo médio por tarefaCada linha é um modelo e cada ponto é um nível de esforço. O eixo de custo cresce da direita para a esquerda.20%25%30%35%40%45%50%55%60%US$ 0US$ 3US$ 6US$ 9US$ 12US$ 15US$ 18Custo médio por tarefa · mais barato à direitaClaude Opus 5.5 · esforço xhigh · 56,0% · US$ 6,98 por tarefa · 101.083 tokensClaude Opus 5.5 · esforço max · 57,8% · US$ 13,43 por tarefa · 218.363 tokensClaude Sonnet 5.5 · esforço low · 35,8% · US$ 0,500 por tarefa · 11.668 tokensClaude Sonnet 5.5 · esforço medium · 39,2% · US$ 0,700 por tarefa · 16.036 tokensClaude Sonnet 5.5 · esforço high · 47,8% · US$ 1,67 por tarefa · 37.391 tokensClaude Sonnet 5.5 · esforço xhigh · 53,1% · US$ 3,88 por tarefa · 100.158 tokensClaude Sonnet 5.5 · esforço max · 55,5% · US$ 9,67 por tarefa · 271.920 tokensClaude Fable 5.1 · esforço low · 45,1% · US$ 5,44 por tarefa · 34.795 tokensClaude Fable 5.1 · esforço medium · 46,8% · US$ 7,05 por tarefa · 45.411 tokensClaude Fable 5.1 · esforço high · 49,2% · US$ 9,08 por tarefa · 58.438 tokensClaude Fable 5.1 · esforço xhigh · 51,6% · US$ 13,01 por tarefa · 87.294 tokensClaude Fable 5.1 · esforço max · 51,8% · US$ 17,28 por tarefa · 117.236 tokensClaude Opus 5 · esforço low · 40,7% · US$ 4,87 por tarefa · 31.995 tokensClaude Opus 5 · esforço medium · 43,3% · US$ 6,94 por tarefa · 45.272 tokensClaude Opus 5 · esforço high · 44,7% · US$ 9,00 por tarefa · 61.405 tokensClaude Opus 5 · esforço xhigh · 46,1% · US$ 11,43 por tarefa · 80.094 tokensClaude Opus 5 · esforço max · 46,6% · US$ 11,95 por tarefa · 85.384 tokensGrok 4.7 · esforço low · 33,1% · US$ 1,58 por tarefa · 15.677 tokensGrok 4.7 · esforço medium · 41,6% · US$ 3,49 por tarefa · 36.683 tokensGrok 4.7 · esforço high · 43,9% · US$ 4,69 por tarefa · 56.382 tokensGrok 4.7 · esforço xhigh · 46,3% · US$ 6,01 por tarefa · 70.141 tokensGPT-5.6 Sol · esforço low · 24,6% · US$ 0,870 por tarefa · 4.885 tokensGPT-5.6 Sol · esforço medium · 31,1% · US$ 1,77 por tarefa · 10.111 tokensGPT-5.6 Sol · esforço high · 35,7% · US$ 2,85 por tarefa · 16.174 tokensGPT-5.6 Sol · esforço xhigh · 37,7% · US$ 4,40 por tarefa · 24.729 tokensGPT-5.6 Sol · esforço max · 41,7% · US$ 8,23 por tarefa · 42.944 tokensMuse Spark 1.3 · esforço minimal · 24,3% · US$ 0,560 por tarefa · 10.620 tokensMuse Spark 1.3 · esforço low · 29,3% · US$ 0,930 por tarefa · 17.483 tokensMuse Spark 1.3 · esforço medium · 32,6% · US$ 1,49 por tarefa · 27.255 tokensMuse Spark 1.3 · esforço high · 33,4% · US$ 1,66 por tarefa · 30.654 tokensMuse Spark 1.3 · esforço xhigh · 37,5% · US$ 2,10 por tarefa · 40.891 tokensMuse Spark 1.3 · esforço max · 41,6% · US$ 2,64 por tarefa · 52.005 tokensGrok 4.6 · esforço low · 33,4% · US$ 2,25 por tarefa · 16.307 tokensGrok 4.6 · esforço medium · 36,1% · US$ 3,48 por tarefa · 24.893 tokensGrok 4.6 · esforço high · 40,4% · US$ 5,20 por tarefa · 41.387 tokensGrok 4.6 · esforço xhigh · 41,4% · US$ 6,10 por tarefa · 49.814 tokensGPT-5.6 Terra · esforço low · 25,2% · US$ 0,520 por tarefa · 5.914 tokensGPT-5.6 Terra · esforço medium · 27,6% · US$ 0,640 por tarefa · 7.307 tokensGPT-5.6 Terra · esforço high · 30,7% · US$ 1,11 por tarefa · 13.162 tokensGPT-5.6 Terra · esforço xhigh · 33,6% · US$ 1,81 por tarefa · 23.436 tokensGPT-5.6 Terra · esforço max · 41,3% · US$ 5,14 por tarefa · 60.814 tokensGemini 3.8 Flash · esforço medium · 37,3% · US$ 4,06 por tarefa · 128.364 tokensGemini 3.8 Flash · esforço high · 39,6% · US$ 4,70 por tarefa · 162.565 tokensClaude Opus 5.5Claude Sonnet 5.5Claude Fable 5.1Claude Opus 5Grok 4.7GPT-5.6 SolMuse Spark 1.3Grok 4.6GPT-5.6 TerraGemini 3.8 Flash
Anthropic OpenAI Google DeepMind outros laboratórios

Os 10 de maior nota entre os 12 modelos medidos em mais de um nível de esforço (13 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0, a partir de cursor.com/cursorbench.

Ver os números
ModeloEsforçoNotaCusto por tarefaTokens
Claude Opus 5.5max57,8%US$ 13,43218.363
Claude Opus 5.5xhigh56,0%US$ 6,98101.083
Claude Sonnet 5.5max55,5%US$ 9,67271.920
Claude Sonnet 5.5xhigh53,1%US$ 3,88100.158
Claude Sonnet 5.5high47,8%US$ 1,6737.391
Claude Sonnet 5.5medium39,2%US$ 0,70016.036
Claude Sonnet 5.5low35,8%US$ 0,50011.668
Claude Fable 5.1max51,8%US$ 17,28117.236
Claude Fable 5.1xhigh51,6%US$ 13,0187.294
Claude Fable 5.1high49,2%US$ 9,0858.438
Claude Fable 5.1medium46,8%US$ 7,0545.411
Claude Fable 5.1low45,1%US$ 5,4434.795
Claude Opus 5max46,6%US$ 11,9585.384
Claude Opus 5xhigh46,1%US$ 11,4380.094
Claude Opus 5high44,7%US$ 9,0061.405
Claude Opus 5medium43,3%US$ 6,9445.272
Claude Opus 5low40,7%US$ 4,8731.995
Grok 4.7xhigh46,3%US$ 6,0170.141
Grok 4.7high43,9%US$ 4,6956.382
Grok 4.7medium41,6%US$ 3,4936.683
Grok 4.7low33,1%US$ 1,5815.677
GPT-5.6 Solmax41,7%US$ 8,2342.944
GPT-5.6 Solxhigh37,7%US$ 4,4024.729
GPT-5.6 Solhigh35,7%US$ 2,8516.174
GPT-5.6 Solmedium31,1%US$ 1,7710.111
GPT-5.6 Sollow24,6%US$ 0,8704.885
Muse Spark 1.3max41,6%US$ 2,6452.005
Muse Spark 1.3xhigh37,5%US$ 2,1040.891
Muse Spark 1.3high33,4%US$ 1,6630.654
Muse Spark 1.3medium32,6%US$ 1,4927.255
Muse Spark 1.3low29,3%US$ 0,93017.483
Muse Spark 1.3minimal24,3%US$ 0,56010.620
Grok 4.6xhigh41,4%US$ 6,1049.814
Grok 4.6high40,4%US$ 5,2041.387
Grok 4.6medium36,1%US$ 3,4824.893
Grok 4.6low33,4%US$ 2,2516.307
GPT-5.6 Terramax41,3%US$ 5,1460.814
GPT-5.6 Terraxhigh33,6%US$ 1,8123.436
GPT-5.6 Terrahigh30,7%US$ 1,1113.162
GPT-5.6 Terramedium27,6%US$ 0,6407.307
GPT-5.6 Terralow25,2%US$ 0,5205.914
Gemini 3.8 Flashhigh39,6%US$ 4,70162.565
Gemini 3.8 Flashmedium37,3%US$ 4,06128.364
DeepSWE
Nota no DeepSWE pelo custo médio por tarefaCada linha é um modelo e cada ponto é um nível de esforço. O eixo de custo cresce da direita para a esquerda.0%10%20%30%40%50%60%70%80%US$ 0US$ 5US$ 10US$ 15US$ 20US$ 25Custo médio por tarefa · mais barato à direitaGPT-6 Astra · esforço low · 67,0% · US$ 2,19 por tarefa · 10.580 tokensGPT-6 Astra · esforço medium · 72,8% · US$ 4,38 por tarefa · 20.362 tokensGPT-6 Astra · esforço high · 73,2% · US$ 5,72 por tarefa · 26.506 tokensGPT-6 Astra · esforço xhigh · 74,1% · US$ 6,52 por tarefa · 29.557 tokensGPT-6 Astra · esforço max · 73,2% · US$ 12,37 por tarefa · 61.149 tokensGemini 3.8 Flash · esforço medium · 71,0% · US$ 1,97 por tarefa · 124.684 tokensGemini 3.8 Flash · esforço high · 73,8% · US$ 2,36 por tarefa · 143.243 tokensClaude Opus 5 · esforço low · 58,1% · US$ 1,66 por tarefa · 19.884 tokensClaude Opus 5 · esforço medium · 68,9% · US$ 3,29 por tarefa · 36.982 tokensClaude Opus 5 · esforço high · 72,8% · US$ 6,08 por tarefa · 64.207 tokensClaude Opus 5 · esforço xhigh · 73,2% · US$ 9,07 por tarefa · 91.672 tokensClaude Opus 5 · esforço max · 73,6% · US$ 11,84 por tarefa · 117.566 tokensGPT-5.6 Sol · esforço low · 45,4% · US$ 1,07 por tarefa · 10.579 tokensGPT-5.6 Sol · esforço medium · 61,1% · US$ 1,86 por tarefa · 18.425 tokensGPT-5.6 Sol · esforço high · 69,4% · US$ 3,47 por tarefa · 28.450 tokensGPT-5.6 Sol · esforço xhigh · 70,7% · US$ 4,70 por tarefa · 40.745 tokensGPT-5.6 Sol · esforço max · 72,7% · US$ 8,39 por tarefa · 60.014 tokensClaude Fable 5 · esforço low · 59,6% · US$ 3,76 por tarefa · 25.243 tokensClaude Fable 5 · esforço medium · 65,4% · US$ 6,09 por tarefa · 40.201 tokensClaude Fable 5 · esforço high · 68,6% · US$ 9,18 por tarefa · 57.287 tokensClaude Fable 5 · esforço xhigh · 69,9% · US$ 13,41 por tarefa · 80.352 tokensClaude Fable 5 · esforço max · 69,7% · US$ 21,63 por tarefa · 118.593 tokensGPT-5.6 Terra · esforço low · 24,1% · US$ 0,428 por tarefa · 8.572 tokensGPT-5.6 Terra · esforço medium · 35,1% · US$ 0,583 por tarefa · 11.747 tokensGPT-5.6 Terra · esforço high · 53,8% · US$ 1,13 por tarefa · 21.517 tokensGPT-5.6 Terra · esforço xhigh · 60,2% · US$ 2,13 por tarefa · 39.617 tokensGPT-5.6 Terra · esforço max · 69,6% · US$ 4,95 por tarefa · 71.939 tokensGrok 4.6 · esforço low · 41,6% · US$ 1,04 por tarefa · 16.458 tokensGrok 4.6 · esforço medium · 67,5% · US$ 3,45 por tarefa · 49.764 tokensGrok 4.6 · esforço high · 65,2% · US$ 4,38 por tarefa · 61.161 tokensGrok 4.6 · esforço xhigh · 66,7% · US$ 5,50 por tarefa · 71.404 tokensGPT-5.6 Luna · esforço low · 1,5% · US$ 0,072 por tarefa · 3.128 tokensGPT-5.6 Luna · esforço medium · 11,3% · US$ 0,216 por tarefa · 8.180 tokensGPT-5.6 Luna · esforço high · 44,2% · US$ 0,778 por tarefa · 25.778 tokensGPT-5.6 Luna · esforço xhigh · 56,9% · US$ 1,54 por tarefa · 44.678 tokensGPT-5.6 Luna · esforço max · 67,2% · US$ 3,03 por tarefa · 73.400 tokensGPT-5.5 · esforço low · 27,0% · US$ 1,20 por tarefa · 9.443 tokensGPT-5.5 · esforço medium · 54,0% · US$ 2,75 por tarefa · 19.625 tokensGPT-5.5 · esforço high · 64,4% · US$ 5,10 por tarefa · 31.159 tokensGPT-5.5 · esforço xhigh · 67,0% · US$ 7,23 por tarefa · 46.295 tokensGemini 3.7 Flash · esforço low · 53,8% · US$ 1,83 por tarefa · 73.365 tokensGemini 3.7 Flash · esforço medium · 65,5% · US$ 2,03 por tarefa · 93.991 tokensGemini 3.7 Flash · esforço high · 65,3% · US$ 2,18 por tarefa · 107.248 tokensGPT-6 AstraGemini 3.8 FlashClaude Opus 5GPT-5.6 SolClaude Fable 5GPT-5.6 TerraGrok 4.6GPT-5.6 LunaGPT-5.5Gemini 3.7 Flash
Anthropic OpenAI Google DeepMind outros laboratórios

Os 10 de maior nota entre os 14 modelos medidos em mais de um nível de esforço (26 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0, a partir de deepswe.datacurve.ai.

Ver os números
ModeloEsforçoNotaCusto por tarefaTokens
GPT-6 Astramax73,2%US$ 12,3761.149
GPT-6 Astraxhigh74,1%US$ 6,5229.557
GPT-6 Astrahigh73,2%US$ 5,7226.506
GPT-6 Astramedium72,8%US$ 4,3820.362
GPT-6 Astralow67,0%US$ 2,1910.580
Gemini 3.8 Flashhigh73,8%US$ 2,36143.243
Gemini 3.8 Flashmedium71,0%US$ 1,97124.684
Claude Opus 5max73,6%US$ 11,84117.566
Claude Opus 5xhigh73,2%US$ 9,0791.672
Claude Opus 5high72,8%US$ 6,0864.207
Claude Opus 5medium68,9%US$ 3,2936.982
Claude Opus 5low58,1%US$ 1,6619.884
GPT-5.6 Solmax72,7%US$ 8,3960.014
GPT-5.6 Solxhigh70,7%US$ 4,7040.745
GPT-5.6 Solhigh69,4%US$ 3,4728.450
GPT-5.6 Solmedium61,1%US$ 1,8618.425
GPT-5.6 Sollow45,4%US$ 1,0710.579
Claude Fable 5max69,7%US$ 21,63118.593
Claude Fable 5xhigh69,9%US$ 13,4180.352
Claude Fable 5high68,6%US$ 9,1857.287
Claude Fable 5medium65,4%US$ 6,0940.201
Claude Fable 5low59,6%US$ 3,7625.243
GPT-5.6 Terramax69,6%US$ 4,9571.939
GPT-5.6 Terraxhigh60,2%US$ 2,1339.617
GPT-5.6 Terrahigh53,8%US$ 1,1321.517
GPT-5.6 Terramedium35,1%US$ 0,58311.747
GPT-5.6 Terralow24,1%US$ 0,4288.572
Grok 4.6xhigh66,7%US$ 5,5071.404
Grok 4.6high65,2%US$ 4,3861.161
Grok 4.6medium67,5%US$ 3,4549.764
Grok 4.6low41,6%US$ 1,0416.458
GPT-5.6 Lunamax67,2%US$ 3,0373.400
GPT-5.6 Lunaxhigh56,9%US$ 1,5444.678
GPT-5.6 Lunahigh44,2%US$ 0,77825.778
GPT-5.6 Lunamedium11,3%US$ 0,2168.180
GPT-5.6 Lunalow1,5%US$ 0,0723.128
GPT-5.5xhigh67,0%US$ 7,2346.295
GPT-5.5high64,4%US$ 5,1031.159
GPT-5.5medium54,0%US$ 2,7519.625
GPT-5.5low27,0%US$ 1,209.443
Gemini 3.7 Flashhigh65,3%US$ 2,18107.248
Gemini 3.7 Flashmedium65,5%US$ 2,0393.991
Gemini 3.7 Flashlow53,8%US$ 1,8373.365
ARC-AGI
Nota no ARC-AGI pelo custo médio por tarefaCada linha é um modelo e cada ponto é um nível de esforço. O eixo de custo cresce da direita para a esquerda.45%50%55%60%65%70%75%80%85%90%95%100%US$ 0,05US$ 0,1US$ 1US$ 10US$ 20Custo médio por tarefa (escala logarítmica) · mais barato à direitaGPT-5.6 Sol · esforço low · 74,5% · US$ 0,170 por tarefaGPT-5.6 Sol · esforço medium · 92,5% · US$ 0,220 por tarefaGPT-5.6 Sol · esforço high · 97,0% · US$ 0,300 por tarefaGPT-5.6 Sol · esforço xhigh · 97,5% · US$ 0,400 por tarefaGPT-5.6 Sol · esforço max · 96,5% · US$ 0,540 por tarefaGPT-5.5 Pro · esforço xhigh · 95,0% · US$ 4,52 por tarefaGPT-5.5 Pro · esforço high · 96,5% · US$ 4,53 por tarefaGPT-5.6 Terra · esforço low · 60,2% · US$ 0,090 por tarefaGPT-5.6 Terra · esforço medium · 77,0% · US$ 0,130 por tarefaGPT-5.6 Terra · esforço high · 92,0% · US$ 0,190 por tarefaGPT-5.6 Terra · esforço xhigh · 94,0% · US$ 0,260 por tarefaGPT-5.6 Terra · esforço max · 96,5% · US$ 0,550 por tarefaGPT-5.5 · esforço low · 76,2% · US$ 0,200 por tarefaGPT-5.5 · esforço medium · 92,2% · US$ 0,390 por tarefaGPT-5.5 · esforço high · 94,5% · US$ 0,560 por tarefaGPT-5.5 · esforço xhigh · 95,0% · US$ 0,730 por tarefaKimi K3 · esforço low · 65,7% · US$ 0,181 por tarefaKimi K3 · esforço high · 86,7% · US$ 0,480 por tarefaKimi K3 · esforço max · 94,5% · US$ 0,770 por tarefaGPT-5.4 · esforço low · 68,2% · US$ 0,150 por tarefaGPT-5.4 · esforço medium · 86,2% · US$ 0,250 por tarefaGPT-5.4 · esforço high · 92,7% · US$ 0,370 por tarefaGPT-5.4 · esforço xhigh · 93,7% · US$ 0,620 por tarefaClaude Opus 4.7 · esforço low · 91,0% · US$ 0,760 por tarefaClaude Opus 4.7 · esforço medium · 91,0% · US$ 1,04 por tarefaClaude Opus 4.7 · esforço high · 93,5% · US$ 1,41 por tarefaClaude Opus 4.7 · esforço max · 92,0% · US$ 2,58 por tarefaClaude Opus 4.8 · esforço low · 88,0% · US$ 0,671 por tarefaClaude Opus 4.8 · esforço medium · 91,5% · US$ 0,912 por tarefaClaude Opus 4.8 · esforço high · 92,0% · US$ 1,04 por tarefaClaude Opus 4.8 · esforço max · 92,5% · US$ 2,33 por tarefaGemini 3.5 Flash · esforço minimal · 48,8% · US$ 0,065 por tarefaGemini 3.5 Flash · esforço high · 92,5% · US$ 0,428 por tarefaGPT-5.2 Pro · esforço medium · 81,2% · US$ 3,98 por tarefaGPT-5.2 Pro · esforço high · 85,7% · US$ 5,87 por tarefaGPT-5.2 Pro · esforço xhigh · 90,5% · US$ 11,65 por tarefaGPT-5.6 SolGPT-5.5 ProGPT-5.6 TerraGPT-5.5Kimi K3GPT-5.4Claude Opus 4.7Claude Opus 4.8Gemini 3.5 FlashGPT-5.2 Pro
Anthropic OpenAI Google DeepMind outros laboratórios

Os 10 de maior nota entre os 24 modelos medidos em mais de um nível de esforço (92 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0, a partir de arcprize.org/leaderboard.

Ver os números
ModeloEsforçoNotaCusto por tarefaTokens
GPT-5.6 Solmax96,5%US$ 0,540-
GPT-5.6 Solxhigh97,5%US$ 0,400-
GPT-5.6 Solhigh97,0%US$ 0,300-
GPT-5.6 Solmedium92,5%US$ 0,220-
GPT-5.6 Sollow74,5%US$ 0,170-
GPT-5.5 Prohigh96,5%US$ 4,53-
GPT-5.5 Proxhigh95,0%US$ 4,52-
GPT-5.6 Terramax96,5%US$ 0,550-
GPT-5.6 Terraxhigh94,0%US$ 0,260-
GPT-5.6 Terrahigh92,0%US$ 0,190-
GPT-5.6 Terramedium77,0%US$ 0,130-
GPT-5.6 Terralow60,2%US$ 0,090-
GPT-5.5xhigh95,0%US$ 0,730-
GPT-5.5high94,5%US$ 0,560-
GPT-5.5medium92,2%US$ 0,390-
GPT-5.5low76,2%US$ 0,200-
Kimi K3max94,5%US$ 0,770-
Kimi K3high86,7%US$ 0,480-
Kimi K3low65,7%US$ 0,181-
GPT-5.4xhigh93,7%US$ 0,620-
GPT-5.4high92,7%US$ 0,370-
GPT-5.4medium86,2%US$ 0,250-
GPT-5.4low68,2%US$ 0,150-
Claude Opus 4.7max92,0%US$ 2,58-
Claude Opus 4.7high93,5%US$ 1,41-
Claude Opus 4.7medium91,0%US$ 1,04-
Claude Opus 4.7low91,0%US$ 0,760-
Claude Opus 4.8max92,5%US$ 2,33-
Claude Opus 4.8high92,0%US$ 1,04-
Claude Opus 4.8medium91,5%US$ 0,912-
Claude Opus 4.8low88,0%US$ 0,671-
Gemini 3.5 Flashhigh92,5%US$ 0,428-
Gemini 3.5 Flashminimal48,8%US$ 0,065-
GPT-5.2 Proxhigh90,5%US$ 11,65-
GPT-5.2 Prohigh85,7%US$ 5,87-
GPT-5.2 Promedium81,2%US$ 3,98-
ARC-AGI 2
Nota no ARC-AGI 2 pelo custo médio por tarefaCada linha é um modelo e cada ponto é um nível de esforço. O eixo de custo cresce da direita para a esquerda.0%10%20%30%40%50%60%70%80%90%100%US$ 0,1US$ 1US$ 10US$ 20Custo médio por tarefa (escala logarítmica) · mais barato à direitaGPT-5.6 Sol · esforço low · 42,5% · US$ 0,320 por tarefaGPT-5.6 Sol · esforço medium · 67,1% · US$ 0,470 por tarefaGPT-5.6 Sol · esforço high · 85,4% · US$ 0,740 por tarefaGPT-5.6 Sol · esforço xhigh · 90,0% · US$ 1,04 por tarefaGPT-5.6 Sol · esforço max · 92,5% · US$ 1,44 por tarefaGPT-5.5 · esforço low · 33,3% · US$ 0,350 por tarefaGPT-5.5 · esforço medium · 70,4% · US$ 0,860 por tarefaGPT-5.5 · esforço high · 83,3% · US$ 1,45 por tarefaGPT-5.5 · esforço xhigh · 85,0% · US$ 1,87 por tarefaGPT-5.5 Pro · esforço high · 84,6% · US$ 10,51 por tarefaGPT-5.5 Pro · esforço xhigh · 84,2% · US$ 10,76 por tarefaGPT-5.6 Terra · esforço low · 18,8% · US$ 0,170 por tarefaGPT-5.6 Terra · esforço medium · 37,5% · US$ 0,270 por tarefaGPT-5.6 Terra · esforço high · 67,1% · US$ 0,550 por tarefaGPT-5.6 Terra · esforço xhigh · 74,2% · US$ 0,690 por tarefaGPT-5.6 Terra · esforço max · 83,9% · US$ 1,09 por tarefaClaude Opus 4.7 · esforço low · 62,1% · US$ 2,38 por tarefaClaude Opus 4.7 · esforço medium · 67,5% · US$ 2,96 por tarefaClaude Opus 4.7 · esforço high · 68,3% · US$ 3,17 por tarefaClaude Opus 4.7 · esforço max · 75,8% · US$ 7,43 por tarefaGPT-5.4 · esforço low · 29,2% · US$ 0,270 por tarefaGPT-5.4 · esforço medium · 55,4% · US$ 0,680 por tarefaGPT-5.4 · esforço high · 67,5% · US$ 1,02 por tarefaGPT-5.4 · esforço xhigh · 74,0% · US$ 1,52 por tarefaClaude Opus 4.8 · esforço low · 62,2% · US$ 1,68 por tarefaClaude Opus 4.8 · esforço medium · 71,7% · US$ 2,39 por tarefaClaude Opus 4.8 · esforço high · 72,1% · US$ 2,74 por tarefaGemini 3.5 Flash · esforço minimal · 8,9% · US$ 0,107 por tarefaGemini 3.5 Flash · esforço high · 72,1% · US$ 0,850 por tarefaClaude Sonnet 4.6 · esforço high · 60,4% · US$ 2,70 por tarefaClaude Sonnet 4.6 · esforço max · 58,3% · US$ 2,72 por tarefaKimi K3 · esforço low · 12,4% · US$ 0,254 por tarefaKimi K3 · esforço high · 55,0% · US$ 0,947 por tarefaKimi K3 · esforço max · 60,4% · US$ 1,59 por tarefaGPT-5.6 SolGPT-5.5GPT-5.5 ProGPT-5.6 TerraClaude Opus 4.7GPT-5.4Claude Opus 4.8Gemini 3.5 FlashClaude Sonnet 4.6Kimi K3
Anthropic OpenAI Google DeepMind outros laboratórios

Os 10 de maior nota entre os 24 modelos medidos em mais de um nível de esforço (89 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0.

Ver os números
ModeloEsforçoNotaCusto por tarefaTokens
GPT-5.6 Solmax92,5%US$ 1,44-
GPT-5.6 Solxhigh90,0%US$ 1,04-
GPT-5.6 Solhigh85,4%US$ 0,740-
GPT-5.6 Solmedium67,1%US$ 0,470-
GPT-5.6 Sollow42,5%US$ 0,320-
GPT-5.5xhigh85,0%US$ 1,87-
GPT-5.5high83,3%US$ 1,45-
GPT-5.5medium70,4%US$ 0,860-
GPT-5.5low33,3%US$ 0,350-
GPT-5.5 Proxhigh84,2%US$ 10,76-
GPT-5.5 Prohigh84,6%US$ 10,51-
GPT-5.6 Terramax83,9%US$ 1,09-
GPT-5.6 Terraxhigh74,2%US$ 0,690-
GPT-5.6 Terrahigh67,1%US$ 0,550-
GPT-5.6 Terramedium37,5%US$ 0,270-
GPT-5.6 Terralow18,8%US$ 0,170-
Claude Opus 4.7max75,8%US$ 7,43-
Claude Opus 4.7high68,3%US$ 3,17-
Claude Opus 4.7medium67,5%US$ 2,96-
Claude Opus 4.7low62,1%US$ 2,38-
GPT-5.4xhigh74,0%US$ 1,52-
GPT-5.4high67,5%US$ 1,02-
GPT-5.4medium55,4%US$ 0,680-
GPT-5.4low29,2%US$ 0,270-
Claude Opus 4.8high72,1%US$ 2,74-
Claude Opus 4.8medium71,7%US$ 2,39-
Claude Opus 4.8low62,2%US$ 1,68-
Gemini 3.5 Flashhigh72,1%US$ 0,850-
Gemini 3.5 Flashminimal8,9%US$ 0,107-
Claude Sonnet 4.6max58,3%US$ 2,72-
Claude Sonnet 4.6high60,4%US$ 2,70-
Kimi K3max60,4%US$ 1,59-
Kimi K3high55,0%US$ 0,947-
Kimi K3low12,4%US$ 0,254-
Quem está na frente

O melhor modelo de cada laboratório

Ordenado pelo ECI do modelo mais capaz que cada organização tem no ranking.

OpenAI

GPT-6 Astra
166,60
36 modelos no ranking · United States of America

Anthropic

Claude Fable 5.1
165,00
23 modelos no ranking · United States of America

Google DeepMind

Gemini 3.7 Flash
157,72
27 modelos no ranking · United States of America

Moonshot

Kimi K3
157,68
7 modelos no ranking · China

Meta AI

Muse Spark 1.3
156,89
22 modelos no ranking · United States of America

Alibaba

Qwen 3.8 Max
156,69
36 modelos no ranking · China

xAI

Grok 4.6
156,48
10 modelos no ranking · United States of America

Z.ai (Zhipu AI)

GLM-5.3
155,56
6 modelos no ranking · China

DeepSeek

DeepSeek V4 Pro 0813
155,39
15 modelos no ranking · China

Thinking Machines

Inkling-Small
150,13
2 modelos no ranking · United States of America

Xiaomi Corp

MiMo-V2.5-Pro
149,27
1 modelo no ranking · China

MiniMax

MiniMax-M3
147,00
3 modelos no ranking · China
Fila de medição

Recém-lançados, ainda sem nota

A Epoch AI cadastra o modelo no dia em que ele sai e calcula a nota de capacidade depois. Nessa janela o modelo existe, já pode estar na mão de todo mundo, e ainda não tem ECI. Ele não ocupa posição no ranking acima, que é ordenado por capacidade, e fica listado aqui. Quando a Arena e o LiveBench já tiverem medido, as notas aparecem; quando não, a coluna fica vazia, como no resto da página. Hoje são 12 modelos nessa situação. A coluna de capacidade diz quantas provas individuais da Epoch AI já têm resultado publicado para aquele modelo: é medição de verdade, só ainda não consolidada no índice.

Modelo Laboratório Lançamento ELO LiveBench Capacidade Acesso
Claude Sonnet 5.5 Anthropic 28/09/2026 sem par 77,8 7 provas já medidas API access
Claude Opus 5.5 Anthropic 22/09/2026 1.572 83,2 14 provas já medidas API access
GPT-6 Luna OpenAI 22/09/2026 sem par 72,0 12 provas já medidas API access
GPT-6 Sol OpenAI 22/09/2026 sem par 79,3 13 provas já medidas API access
Grok 4.7 xAI 21/09/2026 1.476 77,4 6 provas já medidas API access
Step 5 Preview StepFun 18/09/2026 sem par sem par 2 provas já medidas API access
SWE-2 Cognition 10/09/2026 sem par sem par 1 prova já medida Hosted access (no API)
Mercury 2.5 Inception Labs 08/09/2026 sem par sem par 2 provas já medidas API access
Tencent Hy4 preview Tencent 28/08/2026 sem par sem par 1 prova já medida Open weights (unrestricted)
Qwen3.8 Flash Alibaba 26/08/2026 sem par sem par 1 prova já medida API access
Grok Build 0.1 xAI 29/05/2026 sem par 67,8 aguardando medição API access
GPT-5.2 Codex OpenAI 18/12/2025 sem par 74,0 aguardando medição API access
Os 12 lançamentos mais recentes sem nota de capacidade. Assim que a Epoch AI publicar o ECI, o modelo entra no ranking sozinho.
Como isto é apurado

A ROO3 não mede modelo nenhum

Esta página não tem laboratório e não roda benchmark. Ela reúne, traduz e credita duas medições públicas feitas por quem tem estrutura para isso. Dizer o contrário seria a primeira mentira, e a partir dela nenhum número aqui valeria nada.

Ordenamos pelo ECI, e não por média

ECI, ELO e LiveBench estão em escalas diferentes: o ECI gira em torno de 150, o ELO em torno de 1400 e o LiveBench vai de 0 a 100. Somar os três num "score próprio" produziria um número bonito que não significa nada. O ranking segue o ECI, e as outras notas ficam ao lado para você comparar com os próprios olhos.

Coluna vazia é resposta, não falha

As fontes escrevem o mesmo modelo de jeitos diferentes. Casar por semelhança de texto é exatamente como um agregador começa a mentir sem dar erro: basta colar o ELO de um "Flash" no "Pro" de mesmo nome. Aqui o casamento é exato ou não existe. Hoje, 102 dos 258 modelos têm par confirmado na Arena e 48 no LiveBench.

Um modelo, o teto dele

O mesmo modelo aparece nas fontes várias vezes, uma por ajuste de esforço de raciocínio. Em vez de repetir o topo do ranking com o mesmo nome cinco vezes, guardamos o melhor resultado de cada família em cada coluna. É o teto real daquele modelo.

Fonte fora do ar não zera coluna

Quando uma das fontes não responde, a apuração mantém o número do dia anterior e registra a falha. O contrário, apagar a coluna em silêncio, é o tipo de defeito que ninguém percebe: a página continua no ar, bonita, com um dado a menos.

Só fonte que permite redistribuir

Existem rankings mais famosos que estes. Ficaram de fora porque os termos de uso deles proíbem republicar o dado em site comercial de terceiro. Preferimos fontes que autorizam por escrito a outra que renderia mais visita e um problema jurídico.

Seis vezes por dia, automático

Um processo agendado baixa as três fontes, confere que a licença de cada uma continua a mesma (CC BY na Epoch AI e na Arena, CC BY-SA no LiveBench), guarda a impressão digital do arquivo do dia e grava. Se a licença mudar, a sincronização daquela fonte para sozinha e nada novo dela é gravado.

Fontes e créditos

De quem é o dado

A Epoch AI e a Arena estão sob Creative Commons Attribution 4.0, e o LiveBench sob Attribution-ShareAlike 4.0. As três permitem uso comercial e redistribuição desde que creditadas. Os números do LiveBench seguem sob a mesma CC BY-SA. O crédito abaixo é gerado a partir do registro da própria apuração, e não escrito à mão, para não se perder numa edição futura.

Epoch AI, "AI Benchmarking Hub". Publicado em epoch.ai. Dados sob licença CC BY 4.0, reordenados por roo3.co.

Epoch AI, AI Benchmarking Hub · CC BY 4.0

253 registros lidos em 29/09/2026 às 05:25.

Leaderboard da Arena (LMArena), do dataset público lmarena-ai/leaderboard-dataset no Hugging Face, sob licença CC BY 4.0. Não somos afiliados à Arena.

Arena (LMArena), leaderboard-dataset · CC BY 4.0

126 registros lidos em 29/09/2026 às 05:25.

LiveBench, da equipe do LiveBench, publicado em livebench.ai sob licença CC BY-SA 4.0. A média geral é recalculada por roo3.co com a mesma conta do site (média das categorias), e esses números seguem sob CC BY-SA 4.0. Não somos afiliados ao LiveBench.

LiveBench (livebench.ai) · CC BY-SA 4.0

64 registros lidos em 29/09/2026 às 05:25.

A ROO3 não é afiliada à Epoch AI, à Arena (LMArena) nem ao LiveBench. Os dados foram reunidos, ordenados e traduzidos para o português; os valores não foram alterados, e a média geral do LiveBench é recalculada com a mesma conta do site dele. Marcas citadas pertencem aos respectivos donos.

Perguntas frequentes

O que estes números querem dizer

Qual é a melhor IA hoje?

Depende do que você chama de melhor. Por capacidade medida em provas difíceis, vale o topo do ECI. Por preferência de pessoas comuns em conversas do dia a dia, vale o topo do ELO. O LiveBench é uma terceira leitura, com perguntas renovadas para reduzir a chance de o modelo já ter visto a prova. Os rankings não coincidem, e é por isso que esta página mostra as colunas lado a lado em vez de inventar uma nota única.

O que é o ECI?

Epoch Capabilities Index, da Epoch AI. Um índice composto que junta o desempenho do modelo em vários benchmarks difíceis numa escala só, o que permite comparar modelos que nunca fizeram exatamente as mesmas provas. Quanto maior, melhor.

O que é o ELO da Arena?

É a nota de preferência humana da Arena. Pessoas mandam a mesma pergunta para dois modelos sem saber quais são, escolhem a melhor resposta, e o sistema calcula uma nota no mesmo esquema de rating do xadrez. Mede o que as pessoas gostam de receber, que não é a mesma coisa que capacidade bruta.

O que é o LiveBench?

É um benchmark com 23 tarefas objetivas em 7 categorias (raciocínio, programação, programação com agentes, matemática, análise de dados, linguagem e seguir instruções), com perguntas renovadas a cada seis meses para reduzir a chance de o modelo já ter visto a prova. A nota vai de 0 a 100 e é a média das categorias, a mesma conta que o site do LiveBench usa. Costuma publicar a nota de um lançamento antes do índice da Epoch AI.

Por que alguns modelos estão com a coluna de ELO vazia?

Porque aquele modelo não foi encontrado na Arena com certeza. Casar nome por semelhança é como um ranking passa a mentir sem dar erro nenhum. Quando não há casamento exato, a coluna fica vazia. Preferimos a lacuna ao número errado.

Não achei um modelo que acabou de sair. Cadê?

Se ele saiu há pouco, ele aparece no cartão de lançamento no topo da página e na lista "Recém-lançados, ainda sem nota", logo abaixo da tabela. A Epoch AI cadastra o modelo no dia do lançamento e calcula a nota de capacidade depois, então existe uma janela em que o modelo é público mas ainda não tem ECI. Nessa janela ele não ocupa posição no ranking, que é ordenado por capacidade, mas aparece com as notas do LiveBench e da Arena quando elas já existem, o que costuma acontecer antes do ECI. Não estimamos a nota que falta.

Modelo de peso aberto aparece aqui?

Aparece, e dá para filtrar só por eles na barra acima da tabela. A coluna Acesso mostra se o modelo é servido por API, se os pesos são abertos ou se o acesso é restrito, conforme a classificação da própria Epoch AI.

Posso usar estes dados no meu trabalho?

Os dados originais são das três fontes citadas nos créditos: Epoch AI e Arena sob Creative Commons Attribution 4.0, e LiveBench sob Attribution-ShareAlike 4.0. Você pode usar, inclusive comercialmente, desde que credite as fontes originais do mesmo jeito que fazemos aqui; o que vier do LiveBench segue sob a mesma CC BY-SA. O crédito não é gentileza: é a condição da licença.

Com que frequência atualiza?

Seis vezes por dia, automaticamente. A data e a hora da última apuração ficam no topo da página e no rodapé da tabela. Se uma das fontes estiver fora do ar, a página mantém os números da apuração anterior em vez de zerar a coluna.

Saber qual é a melhor IA é fácil. Difícil é usar no seu negócio.

A gente implanta IA em empresa de verdade: atendimento, conteúdo, processo. Com número no fim do mês, não com promessa.

Falar sobre IA na minha empresa
Resposta rápida no WhatsApp. São José do Rio Preto, SP e todo o Brasil.