Qual IA é a melhor hoje? Com a fonte de cada número.
258 modelos de 32 laboratórios, medidos por quem mede de verdade. Aqui não tem opinião: tem fonte. Como isto é apurado
Claude Sonnet 5.5
Anthropic · API access
Ainda sem ECI: o índice de capacidade da Epoch AI é composto e sai numa rodada posterior ao lançamento, então este modelo ainda não ocupa posição no ranking por inteligência. O que já existe está abaixo: as provas individuais da Epoch AI, cada uma ao lado do melhor resultado já registrado nela, e, quando já publicadas, as notas da Arena e do LiveBench. Quando o ECI sair, o modelo sobe sozinho para a tabela.
Fonte das notas: Epoch AI, sob Creative Commons Attribution 4.0. A ROO3 não mede modelo nenhum. A média geral é do LiveBench, sob CC BY-SA 4.0. Ver todos os recém-lançados sem nota
🏆 Ranking por inteligência
ECI, do Epoch AI · 20 de 258 apurado em 29/09/2026 às 05:25| # | Modelo | Laboratório | ECI | ELO | LiveBench | Acesso | Lançamento |
|---|---|---|---|---|---|---|---|
| novoGPT-6 Sol | OpenAI | sem ECI ainda | sem par | 79,3 | API access | 22/09/2026 | |
| novoGPT-6 Luna | OpenAI | sem ECI ainda | sem par | 72,0 | API access | 22/09/2026 | |
| 🥇 | GPT-6 Astra | OpenAI | 166,60 | sem par | 82,2 | API access | 03/09/2026 |
| novoClaude Opus 5.5 | Anthropic | sem ECI ainda | 1.572 | 83,2 | API access | 22/09/2026 | |
| novoClaude Sonnet 5.5 | Anthropic | sem ECI ainda | sem par | 77,8 | API access | 28/09/2026 | |
| 🥈 | Claude Fable 5.1 | Anthropic | 165,00 | sem par | 83,4 | API access | 01/09/2026 |
| 🥉 | Claude Fable 5 | Anthropic | 163,60 | 1.546 | 83,0 | API access | 09/06/2026 |
| 4 | Claude Opus 5 | Anthropic | 162,67 | 1.571 | 80,1 | API access | 24/07/2026 |
| 5 | GPT-5.5 Pro | OpenAI | 162,45 | sem par | sem par | API access | 23/04/2026 |
| 6 | GPT-5.6 Sol | OpenAI | 161,99 | 1.523 | 81,1 | API access | 09/07/2026 |
| 7 | GPT-5.6 Terra | OpenAI | 159,31 | 1.514 | 77,9 | API access | 09/07/2026 |
| 8 | GPT-5.5 | OpenAI | 159,25 | 1.535 | 80,2 | API access | 23/04/2026 |
| 9 | GPT-5.4 Pro | OpenAI | 159,12 | sem par | sem par | API access | 05/03/2026 |
| 10 | Claude Opus 4.8 | Anthropic | 158,30 | 1.509 | 76,2 | API access | 28/05/2026 |
| 11 | Gemini 3.7 Flash | Google DeepMind | 157,72 | 1.553 | 78,8 | API access | 13/08/2026 |
| 12 | Kimi K3 | Moonshot | 157,68 | sem par | 79,2 | Open weights (non-commercial) | 16/07/2026 |
| 13 | Gemini 3.8 Flash | Google DeepMind | 157,13 | 1.547 | 75,8 | API access | 02/09/2026 |
| 14 | GPT-5.4 | OpenAI | 156,92 | 1.520 | 78,0 | API access | 05/03/2026 |
| 15 | Muse Spark 1.3 | Meta AI | 156,89 | sem par | 81,6 | API access | 02/09/2026 |
| 16 | GPT-5.3 Codex | OpenAI | 156,84 | sem par | sem par | API access | 05/02/2026 |
| 17 | Qwen 3.8 Max | Alibaba | 156,69 | 1.537 | 78,5 | API access | 02/08/2026 |
| novoGrok 4.7 | xAI | sem ECI ainda | 1.476 | 77,4 | API access | 21/09/2026 | |
| 18 | Grok 4.6 | xAI | 156,48 | 1.479 | 78,0 | API access | 12/08/2026 |
| 19 | Claude Opus 4.7 | Anthropic | 156,39 | 1.530 | 76,5 | API access | 16/04/2026 |
| 20 | Claude Sonnet 5 | Anthropic | 156,34 | 1.491 | 76,0 | API access | 30/06/2026 |
ECI é capacidade medida em provas difíceis, apurada pelo Epoch AI. ELO é preferência de pessoas comuns em conversas às cegas, da LMArena. O LiveBench, média de 23 tarefas objetivas com perguntas renovadas, é a terceira leitura. Os rankings não coincidem, e a diferença entre eles é a informação mais útil daqui. A ordem padrão é a do ECI. Nenhum dos índices é nosso: nós apuramos, casamos os nomes e mostramos a origem de cada número.
Cada ponto é um modelo. A linha é o recorde da época.
Capacidade (ECI) pela data de lançamento. A linha verde liga os modelos que, no dia em que saíram, eram o melhor que existia. É a leitura mais direta de quanto o ritmo acelerou.
Quanto cada modelo entrega por dólar
Cada linha é um modelo, e cada ponto é um nível de esforço, do mais barato ao mais caro. Mais alto é nota maior; mais à direita é tarefa mais barata. A curva mostra o que se ganha pagando mais pelo mesmo modelo, e onde deixa de valer a diferença.
Os 10 de maior nota entre os 12 modelos medidos em mais de um nível de esforço (13 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0, a partir de cursor.com/cursorbench.
Ver os números
| Modelo | Esforço | Nota | Custo por tarefa | Tokens |
|---|---|---|---|---|
| Claude Opus 5.5 | max | 57,8% | US$ 13,43 | 218.363 |
| Claude Opus 5.5 | xhigh | 56,0% | US$ 6,98 | 101.083 |
| Claude Sonnet 5.5 | max | 55,5% | US$ 9,67 | 271.920 |
| Claude Sonnet 5.5 | xhigh | 53,1% | US$ 3,88 | 100.158 |
| Claude Sonnet 5.5 | high | 47,8% | US$ 1,67 | 37.391 |
| Claude Sonnet 5.5 | medium | 39,2% | US$ 0,700 | 16.036 |
| Claude Sonnet 5.5 | low | 35,8% | US$ 0,500 | 11.668 |
| Claude Fable 5.1 | max | 51,8% | US$ 17,28 | 117.236 |
| Claude Fable 5.1 | xhigh | 51,6% | US$ 13,01 | 87.294 |
| Claude Fable 5.1 | high | 49,2% | US$ 9,08 | 58.438 |
| Claude Fable 5.1 | medium | 46,8% | US$ 7,05 | 45.411 |
| Claude Fable 5.1 | low | 45,1% | US$ 5,44 | 34.795 |
| Claude Opus 5 | max | 46,6% | US$ 11,95 | 85.384 |
| Claude Opus 5 | xhigh | 46,1% | US$ 11,43 | 80.094 |
| Claude Opus 5 | high | 44,7% | US$ 9,00 | 61.405 |
| Claude Opus 5 | medium | 43,3% | US$ 6,94 | 45.272 |
| Claude Opus 5 | low | 40,7% | US$ 4,87 | 31.995 |
| Grok 4.7 | xhigh | 46,3% | US$ 6,01 | 70.141 |
| Grok 4.7 | high | 43,9% | US$ 4,69 | 56.382 |
| Grok 4.7 | medium | 41,6% | US$ 3,49 | 36.683 |
| Grok 4.7 | low | 33,1% | US$ 1,58 | 15.677 |
| GPT-5.6 Sol | max | 41,7% | US$ 8,23 | 42.944 |
| GPT-5.6 Sol | xhigh | 37,7% | US$ 4,40 | 24.729 |
| GPT-5.6 Sol | high | 35,7% | US$ 2,85 | 16.174 |
| GPT-5.6 Sol | medium | 31,1% | US$ 1,77 | 10.111 |
| GPT-5.6 Sol | low | 24,6% | US$ 0,870 | 4.885 |
| Muse Spark 1.3 | max | 41,6% | US$ 2,64 | 52.005 |
| Muse Spark 1.3 | xhigh | 37,5% | US$ 2,10 | 40.891 |
| Muse Spark 1.3 | high | 33,4% | US$ 1,66 | 30.654 |
| Muse Spark 1.3 | medium | 32,6% | US$ 1,49 | 27.255 |
| Muse Spark 1.3 | low | 29,3% | US$ 0,930 | 17.483 |
| Muse Spark 1.3 | minimal | 24,3% | US$ 0,560 | 10.620 |
| Grok 4.6 | xhigh | 41,4% | US$ 6,10 | 49.814 |
| Grok 4.6 | high | 40,4% | US$ 5,20 | 41.387 |
| Grok 4.6 | medium | 36,1% | US$ 3,48 | 24.893 |
| Grok 4.6 | low | 33,4% | US$ 2,25 | 16.307 |
| GPT-5.6 Terra | max | 41,3% | US$ 5,14 | 60.814 |
| GPT-5.6 Terra | xhigh | 33,6% | US$ 1,81 | 23.436 |
| GPT-5.6 Terra | high | 30,7% | US$ 1,11 | 13.162 |
| GPT-5.6 Terra | medium | 27,6% | US$ 0,640 | 7.307 |
| GPT-5.6 Terra | low | 25,2% | US$ 0,520 | 5.914 |
| Gemini 3.8 Flash | high | 39,6% | US$ 4,70 | 162.565 |
| Gemini 3.8 Flash | medium | 37,3% | US$ 4,06 | 128.364 |
Os 10 de maior nota entre os 14 modelos medidos em mais de um nível de esforço (26 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0, a partir de deepswe.datacurve.ai.
Ver os números
| Modelo | Esforço | Nota | Custo por tarefa | Tokens |
|---|---|---|---|---|
| GPT-6 Astra | max | 73,2% | US$ 12,37 | 61.149 |
| GPT-6 Astra | xhigh | 74,1% | US$ 6,52 | 29.557 |
| GPT-6 Astra | high | 73,2% | US$ 5,72 | 26.506 |
| GPT-6 Astra | medium | 72,8% | US$ 4,38 | 20.362 |
| GPT-6 Astra | low | 67,0% | US$ 2,19 | 10.580 |
| Gemini 3.8 Flash | high | 73,8% | US$ 2,36 | 143.243 |
| Gemini 3.8 Flash | medium | 71,0% | US$ 1,97 | 124.684 |
| Claude Opus 5 | max | 73,6% | US$ 11,84 | 117.566 |
| Claude Opus 5 | xhigh | 73,2% | US$ 9,07 | 91.672 |
| Claude Opus 5 | high | 72,8% | US$ 6,08 | 64.207 |
| Claude Opus 5 | medium | 68,9% | US$ 3,29 | 36.982 |
| Claude Opus 5 | low | 58,1% | US$ 1,66 | 19.884 |
| GPT-5.6 Sol | max | 72,7% | US$ 8,39 | 60.014 |
| GPT-5.6 Sol | xhigh | 70,7% | US$ 4,70 | 40.745 |
| GPT-5.6 Sol | high | 69,4% | US$ 3,47 | 28.450 |
| GPT-5.6 Sol | medium | 61,1% | US$ 1,86 | 18.425 |
| GPT-5.6 Sol | low | 45,4% | US$ 1,07 | 10.579 |
| Claude Fable 5 | max | 69,7% | US$ 21,63 | 118.593 |
| Claude Fable 5 | xhigh | 69,9% | US$ 13,41 | 80.352 |
| Claude Fable 5 | high | 68,6% | US$ 9,18 | 57.287 |
| Claude Fable 5 | medium | 65,4% | US$ 6,09 | 40.201 |
| Claude Fable 5 | low | 59,6% | US$ 3,76 | 25.243 |
| GPT-5.6 Terra | max | 69,6% | US$ 4,95 | 71.939 |
| GPT-5.6 Terra | xhigh | 60,2% | US$ 2,13 | 39.617 |
| GPT-5.6 Terra | high | 53,8% | US$ 1,13 | 21.517 |
| GPT-5.6 Terra | medium | 35,1% | US$ 0,583 | 11.747 |
| GPT-5.6 Terra | low | 24,1% | US$ 0,428 | 8.572 |
| Grok 4.6 | xhigh | 66,7% | US$ 5,50 | 71.404 |
| Grok 4.6 | high | 65,2% | US$ 4,38 | 61.161 |
| Grok 4.6 | medium | 67,5% | US$ 3,45 | 49.764 |
| Grok 4.6 | low | 41,6% | US$ 1,04 | 16.458 |
| GPT-5.6 Luna | max | 67,2% | US$ 3,03 | 73.400 |
| GPT-5.6 Luna | xhigh | 56,9% | US$ 1,54 | 44.678 |
| GPT-5.6 Luna | high | 44,2% | US$ 0,778 | 25.778 |
| GPT-5.6 Luna | medium | 11,3% | US$ 0,216 | 8.180 |
| GPT-5.6 Luna | low | 1,5% | US$ 0,072 | 3.128 |
| GPT-5.5 | xhigh | 67,0% | US$ 7,23 | 46.295 |
| GPT-5.5 | high | 64,4% | US$ 5,10 | 31.159 |
| GPT-5.5 | medium | 54,0% | US$ 2,75 | 19.625 |
| GPT-5.5 | low | 27,0% | US$ 1,20 | 9.443 |
| Gemini 3.7 Flash | high | 65,3% | US$ 2,18 | 107.248 |
| Gemini 3.7 Flash | medium | 65,5% | US$ 2,03 | 93.991 |
| Gemini 3.7 Flash | low | 53,8% | US$ 1,83 | 73.365 |
Os 10 de maior nota entre os 24 modelos medidos em mais de um nível de esforço (92 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0, a partir de arcprize.org/leaderboard.
Ver os números
| Modelo | Esforço | Nota | Custo por tarefa | Tokens |
|---|---|---|---|---|
| GPT-5.6 Sol | max | 96,5% | US$ 0,540 | - |
| GPT-5.6 Sol | xhigh | 97,5% | US$ 0,400 | - |
| GPT-5.6 Sol | high | 97,0% | US$ 0,300 | - |
| GPT-5.6 Sol | medium | 92,5% | US$ 0,220 | - |
| GPT-5.6 Sol | low | 74,5% | US$ 0,170 | - |
| GPT-5.5 Pro | high | 96,5% | US$ 4,53 | - |
| GPT-5.5 Pro | xhigh | 95,0% | US$ 4,52 | - |
| GPT-5.6 Terra | max | 96,5% | US$ 0,550 | - |
| GPT-5.6 Terra | xhigh | 94,0% | US$ 0,260 | - |
| GPT-5.6 Terra | high | 92,0% | US$ 0,190 | - |
| GPT-5.6 Terra | medium | 77,0% | US$ 0,130 | - |
| GPT-5.6 Terra | low | 60,2% | US$ 0,090 | - |
| GPT-5.5 | xhigh | 95,0% | US$ 0,730 | - |
| GPT-5.5 | high | 94,5% | US$ 0,560 | - |
| GPT-5.5 | medium | 92,2% | US$ 0,390 | - |
| GPT-5.5 | low | 76,2% | US$ 0,200 | - |
| Kimi K3 | max | 94,5% | US$ 0,770 | - |
| Kimi K3 | high | 86,7% | US$ 0,480 | - |
| Kimi K3 | low | 65,7% | US$ 0,181 | - |
| GPT-5.4 | xhigh | 93,7% | US$ 0,620 | - |
| GPT-5.4 | high | 92,7% | US$ 0,370 | - |
| GPT-5.4 | medium | 86,2% | US$ 0,250 | - |
| GPT-5.4 | low | 68,2% | US$ 0,150 | - |
| Claude Opus 4.7 | max | 92,0% | US$ 2,58 | - |
| Claude Opus 4.7 | high | 93,5% | US$ 1,41 | - |
| Claude Opus 4.7 | medium | 91,0% | US$ 1,04 | - |
| Claude Opus 4.7 | low | 91,0% | US$ 0,760 | - |
| Claude Opus 4.8 | max | 92,5% | US$ 2,33 | - |
| Claude Opus 4.8 | high | 92,0% | US$ 1,04 | - |
| Claude Opus 4.8 | medium | 91,5% | US$ 0,912 | - |
| Claude Opus 4.8 | low | 88,0% | US$ 0,671 | - |
| Gemini 3.5 Flash | high | 92,5% | US$ 0,428 | - |
| Gemini 3.5 Flash | minimal | 48,8% | US$ 0,065 | - |
| GPT-5.2 Pro | xhigh | 90,5% | US$ 11,65 | - |
| GPT-5.2 Pro | high | 85,7% | US$ 5,87 | - |
| GPT-5.2 Pro | medium | 81,2% | US$ 3,98 | - |
Os 10 de maior nota entre os 24 modelos medidos em mais de um nível de esforço (89 medidos ao todo nesta prova). Modelo lançado há poucos dias entra quando a fonte publica a medição. Fonte: Epoch AI, CC BY 4.0.
Ver os números
| Modelo | Esforço | Nota | Custo por tarefa | Tokens |
|---|---|---|---|---|
| GPT-5.6 Sol | max | 92,5% | US$ 1,44 | - |
| GPT-5.6 Sol | xhigh | 90,0% | US$ 1,04 | - |
| GPT-5.6 Sol | high | 85,4% | US$ 0,740 | - |
| GPT-5.6 Sol | medium | 67,1% | US$ 0,470 | - |
| GPT-5.6 Sol | low | 42,5% | US$ 0,320 | - |
| GPT-5.5 | xhigh | 85,0% | US$ 1,87 | - |
| GPT-5.5 | high | 83,3% | US$ 1,45 | - |
| GPT-5.5 | medium | 70,4% | US$ 0,860 | - |
| GPT-5.5 | low | 33,3% | US$ 0,350 | - |
| GPT-5.5 Pro | xhigh | 84,2% | US$ 10,76 | - |
| GPT-5.5 Pro | high | 84,6% | US$ 10,51 | - |
| GPT-5.6 Terra | max | 83,9% | US$ 1,09 | - |
| GPT-5.6 Terra | xhigh | 74,2% | US$ 0,690 | - |
| GPT-5.6 Terra | high | 67,1% | US$ 0,550 | - |
| GPT-5.6 Terra | medium | 37,5% | US$ 0,270 | - |
| GPT-5.6 Terra | low | 18,8% | US$ 0,170 | - |
| Claude Opus 4.7 | max | 75,8% | US$ 7,43 | - |
| Claude Opus 4.7 | high | 68,3% | US$ 3,17 | - |
| Claude Opus 4.7 | medium | 67,5% | US$ 2,96 | - |
| Claude Opus 4.7 | low | 62,1% | US$ 2,38 | - |
| GPT-5.4 | xhigh | 74,0% | US$ 1,52 | - |
| GPT-5.4 | high | 67,5% | US$ 1,02 | - |
| GPT-5.4 | medium | 55,4% | US$ 0,680 | - |
| GPT-5.4 | low | 29,2% | US$ 0,270 | - |
| Claude Opus 4.8 | high | 72,1% | US$ 2,74 | - |
| Claude Opus 4.8 | medium | 71,7% | US$ 2,39 | - |
| Claude Opus 4.8 | low | 62,2% | US$ 1,68 | - |
| Gemini 3.5 Flash | high | 72,1% | US$ 0,850 | - |
| Gemini 3.5 Flash | minimal | 8,9% | US$ 0,107 | - |
| Claude Sonnet 4.6 | max | 58,3% | US$ 2,72 | - |
| Claude Sonnet 4.6 | high | 60,4% | US$ 2,70 | - |
| Kimi K3 | max | 60,4% | US$ 1,59 | - |
| Kimi K3 | high | 55,0% | US$ 0,947 | - |
| Kimi K3 | low | 12,4% | US$ 0,254 | - |
O melhor modelo de cada laboratório
Ordenado pelo ECI do modelo mais capaz que cada organização tem no ranking.
OpenAI
Anthropic
Google DeepMind
Moonshot
Meta AI
Alibaba
xAI
Z.ai (Zhipu AI)
DeepSeek
Thinking Machines
Xiaomi Corp
MiniMax
Recém-lançados, ainda sem nota
A Epoch AI cadastra o modelo no dia em que ele sai e calcula a nota de capacidade depois. Nessa janela o modelo existe, já pode estar na mão de todo mundo, e ainda não tem ECI. Ele não ocupa posição no ranking acima, que é ordenado por capacidade, e fica listado aqui. Quando a Arena e o LiveBench já tiverem medido, as notas aparecem; quando não, a coluna fica vazia, como no resto da página. Hoje são 12 modelos nessa situação. A coluna de capacidade diz quantas provas individuais da Epoch AI já têm resultado publicado para aquele modelo: é medição de verdade, só ainda não consolidada no índice.
| Modelo | Laboratório | Lançamento | ELO | LiveBench | Capacidade | Acesso |
|---|---|---|---|---|---|---|
| Claude Sonnet 5.5 | Anthropic | 28/09/2026 | sem par | 77,8 | 7 provas já medidas | API access |
| Claude Opus 5.5 | Anthropic | 22/09/2026 | 1.572 | 83,2 | 14 provas já medidas | API access |
| GPT-6 Luna | OpenAI | 22/09/2026 | sem par | 72,0 | 12 provas já medidas | API access |
| GPT-6 Sol | OpenAI | 22/09/2026 | sem par | 79,3 | 13 provas já medidas | API access |
| Grok 4.7 | xAI | 21/09/2026 | 1.476 | 77,4 | 6 provas já medidas | API access |
| Step 5 Preview | StepFun | 18/09/2026 | sem par | sem par | 2 provas já medidas | API access |
| SWE-2 | Cognition | 10/09/2026 | sem par | sem par | 1 prova já medida | Hosted access (no API) |
| Mercury 2.5 | Inception Labs | 08/09/2026 | sem par | sem par | 2 provas já medidas | API access |
| Tencent Hy4 preview | Tencent | 28/08/2026 | sem par | sem par | 1 prova já medida | Open weights (unrestricted) |
| Qwen3.8 Flash | Alibaba | 26/08/2026 | sem par | sem par | 1 prova já medida | API access |
| Grok Build 0.1 | xAI | 29/05/2026 | sem par | 67,8 | aguardando medição | API access |
| GPT-5.2 Codex | OpenAI | 18/12/2025 | sem par | 74,0 | aguardando medição | API access |
A ROO3 não mede modelo nenhum
Esta página não tem laboratório e não roda benchmark. Ela reúne, traduz e credita duas medições públicas feitas por quem tem estrutura para isso. Dizer o contrário seria a primeira mentira, e a partir dela nenhum número aqui valeria nada.
Ordenamos pelo ECI, e não por média
ECI, ELO e LiveBench estão em escalas diferentes: o ECI gira em torno de 150, o ELO em torno de 1400 e o LiveBench vai de 0 a 100. Somar os três num "score próprio" produziria um número bonito que não significa nada. O ranking segue o ECI, e as outras notas ficam ao lado para você comparar com os próprios olhos.
Coluna vazia é resposta, não falha
As fontes escrevem o mesmo modelo de jeitos diferentes. Casar por semelhança de texto é exatamente como um agregador começa a mentir sem dar erro: basta colar o ELO de um "Flash" no "Pro" de mesmo nome. Aqui o casamento é exato ou não existe. Hoje, 102 dos 258 modelos têm par confirmado na Arena e 48 no LiveBench.
Um modelo, o teto dele
O mesmo modelo aparece nas fontes várias vezes, uma por ajuste de esforço de raciocínio. Em vez de repetir o topo do ranking com o mesmo nome cinco vezes, guardamos o melhor resultado de cada família em cada coluna. É o teto real daquele modelo.
Fonte fora do ar não zera coluna
Quando uma das fontes não responde, a apuração mantém o número do dia anterior e registra a falha. O contrário, apagar a coluna em silêncio, é o tipo de defeito que ninguém percebe: a página continua no ar, bonita, com um dado a menos.
Só fonte que permite redistribuir
Existem rankings mais famosos que estes. Ficaram de fora porque os termos de uso deles proíbem republicar o dado em site comercial de terceiro. Preferimos fontes que autorizam por escrito a outra que renderia mais visita e um problema jurídico.
Seis vezes por dia, automático
Um processo agendado baixa as três fontes, confere que a licença de cada uma continua a mesma (CC BY na Epoch AI e na Arena, CC BY-SA no LiveBench), guarda a impressão digital do arquivo do dia e grava. Se a licença mudar, a sincronização daquela fonte para sozinha e nada novo dela é gravado.
De quem é o dado
A Epoch AI e a Arena estão sob Creative Commons Attribution 4.0, e o LiveBench sob Attribution-ShareAlike 4.0. As três permitem uso comercial e redistribuição desde que creditadas. Os números do LiveBench seguem sob a mesma CC BY-SA. O crédito abaixo é gerado a partir do registro da própria apuração, e não escrito à mão, para não se perder numa edição futura.
Epoch AI, "AI Benchmarking Hub". Publicado em epoch.ai. Dados sob licença CC BY 4.0, reordenados por roo3.co.
Leaderboard da Arena (LMArena), do dataset público lmarena-ai/leaderboard-dataset no Hugging Face, sob licença CC BY 4.0. Não somos afiliados à Arena.
LiveBench, da equipe do LiveBench, publicado em livebench.ai sob licença CC BY-SA 4.0. A média geral é recalculada por roo3.co com a mesma conta do site (média das categorias), e esses números seguem sob CC BY-SA 4.0. Não somos afiliados ao LiveBench.
A ROO3 não é afiliada à Epoch AI, à Arena (LMArena) nem ao LiveBench. Os dados foram reunidos, ordenados e traduzidos para o português; os valores não foram alterados, e a média geral do LiveBench é recalculada com a mesma conta do site dele. Marcas citadas pertencem aos respectivos donos.
O que estes números querem dizer
Qual é a melhor IA hoje?
Depende do que você chama de melhor. Por capacidade medida em provas difíceis, vale o topo do ECI. Por preferência de pessoas comuns em conversas do dia a dia, vale o topo do ELO. O LiveBench é uma terceira leitura, com perguntas renovadas para reduzir a chance de o modelo já ter visto a prova. Os rankings não coincidem, e é por isso que esta página mostra as colunas lado a lado em vez de inventar uma nota única.
O que é o ECI?
Epoch Capabilities Index, da Epoch AI. Um índice composto que junta o desempenho do modelo em vários benchmarks difíceis numa escala só, o que permite comparar modelos que nunca fizeram exatamente as mesmas provas. Quanto maior, melhor.
O que é o ELO da Arena?
É a nota de preferência humana da Arena. Pessoas mandam a mesma pergunta para dois modelos sem saber quais são, escolhem a melhor resposta, e o sistema calcula uma nota no mesmo esquema de rating do xadrez. Mede o que as pessoas gostam de receber, que não é a mesma coisa que capacidade bruta.
O que é o LiveBench?
É um benchmark com 23 tarefas objetivas em 7 categorias (raciocínio, programação, programação com agentes, matemática, análise de dados, linguagem e seguir instruções), com perguntas renovadas a cada seis meses para reduzir a chance de o modelo já ter visto a prova. A nota vai de 0 a 100 e é a média das categorias, a mesma conta que o site do LiveBench usa. Costuma publicar a nota de um lançamento antes do índice da Epoch AI.
Por que alguns modelos estão com a coluna de ELO vazia?
Porque aquele modelo não foi encontrado na Arena com certeza. Casar nome por semelhança é como um ranking passa a mentir sem dar erro nenhum. Quando não há casamento exato, a coluna fica vazia. Preferimos a lacuna ao número errado.
Não achei um modelo que acabou de sair. Cadê?
Se ele saiu há pouco, ele aparece no cartão de lançamento no topo da página e na lista "Recém-lançados, ainda sem nota", logo abaixo da tabela. A Epoch AI cadastra o modelo no dia do lançamento e calcula a nota de capacidade depois, então existe uma janela em que o modelo é público mas ainda não tem ECI. Nessa janela ele não ocupa posição no ranking, que é ordenado por capacidade, mas aparece com as notas do LiveBench e da Arena quando elas já existem, o que costuma acontecer antes do ECI. Não estimamos a nota que falta.
Modelo de peso aberto aparece aqui?
Aparece, e dá para filtrar só por eles na barra acima da tabela. A coluna Acesso mostra se o modelo é servido por API, se os pesos são abertos ou se o acesso é restrito, conforme a classificação da própria Epoch AI.
Posso usar estes dados no meu trabalho?
Os dados originais são das três fontes citadas nos créditos: Epoch AI e Arena sob Creative Commons Attribution 4.0, e LiveBench sob Attribution-ShareAlike 4.0. Você pode usar, inclusive comercialmente, desde que credite as fontes originais do mesmo jeito que fazemos aqui; o que vier do LiveBench segue sob a mesma CC BY-SA. O crédito não é gentileza: é a condição da licença.
Com que frequência atualiza?
Seis vezes por dia, automaticamente. A data e a hora da última apuração ficam no topo da página e no rodapé da tabela. Se uma das fontes estiver fora do ar, a página mantém os números da apuração anterior em vez de zerar a coluna.
Saber qual é a melhor IA é fácil. Difícil é usar no seu negócio.
A gente implanta IA em empresa de verdade: atendimento, conteúdo, processo. Com número no fim do mês, não com promessa.
Falar sobre IA na minha empresa