Toda vez que sai um modelo novo, o anúncio vem com a mesma frase mágica: "número 1 no ranking". A OpenAI diz, o Google diz, a Anthropic diz. E você, que só queria saber qual IA usar no trabalho, fica com uma dúvida razoável: número 1 segundo quem?
Na maioria das vezes, a resposta é um site onde qualquer pessoa pode entrar, digitar uma pergunta e votar em qual de duas respostas anônimas ficou melhor. Sem saber de quem é cada uma. Milhões de vezes por mês.
Esse site se chama Arena. E ele virou, meio sem querer, o juiz que a indústria inteira aceitou.
Um projeto de faculdade que virou árbitro de bilhões
O Arena nasceu em 2023 como Chatbot Arena, um projeto de pesquisadores da UC Berkeley. Em 2024 ganhou domínio próprio como LMArena, em abril de 2025 virou empresa independente e, em janeiro de 2026, simplificou o nome para Arena.
A parte "projeto de faculdade" acabou rápido. Em maio de 2025 levantou US$ 100 milhões com avaliação de US$ 600 milhões. Em janeiro de 2026, mais US$ 150 milhões, agora avaliado em US$ 1,7 bilhão. Hoje são mais de 5 milhões de usuários mensais em 150 países e cerca de 60 milhões de conversas por mês.
E o modelo de negócio é curioso: desde setembro de 2025, laboratórios e empresas pagam para avaliar seus modelos com a comunidade do Arena. Em dezembro, esse serviço já rodava a um ritmo anual de US$ 30 milhões. Ou seja: o árbitro também vende consultoria para os times que ele apita.
A prova cega que nenhuma marca consegue comprar
O mecanismo é simples, e por isso é poderoso. Você escreve um prompt, dois modelos anônimos respondem, você escolhe o melhor e só depois descobre quem era quem. Os votos alimentam um sistema estatístico parecido com o Elo do xadrez: ganhar de um modelo forte vale mais do que ganhar de um fraco.
A diferença para os benchmarks tradicionais é grande:
| Benchmark tradicional | Arena | |
|---|---|---|
| Quem avalia | Um gabarito fixo | Pessoas reais |
| Perguntas | Sempre as mesmas | Infinitas e imprevisíveis |
| Risco de "decorar a prova" | Alto | Baixo |
| Viés de marca | Não se aplica | Eliminado pelo anonimato |
| O que mede | Acerto técnico | Preferência humana |
Benchmarks fixos envelhecem mal. Quanto mais famosos, mais os modelos acabam treinados (de propósito ou não) para ir bem neles. No Arena, a prova muda a cada voto, porque cada pessoa traz a própria pergunta estranha de terça-feira à tarde.
E o anonimato resolve o fã-clube. Se você sabe que está avaliando o ChatGPT contra o Claude, sua preferência de marca vota junto com você.
Quando o placar vira alvo
Existe uma lei antiga em economia, a Lei de Goodhart: quando uma métrica vira meta, ela deixa de ser uma boa métrica. O Arena não escapou dela.
Em abril de 2025, a Meta lançou o Llama 4 e o Maverick apareceu no topo do ranking. Só que a versão testada no Arena era diferente da versão disponível ao público, ajustada para agradar votantes. O Arena mudou suas regras depois do episódio.
No mesmo mês, pesquisadores da Cohere, Stanford, MIT, Princeton e outras instituições publicaram um estudo de 68 páginas chamado The Leaderboard Illusion. A acusação: grandes laboratórios testavam dezenas de variantes em privado antes do lançamento e publicavam só a que ia melhor. No caso mais extremo, 27 variantes privadas da Meta antes do Llama 4.
Um ranking pode ser honesto e, ainda assim, ser jogado por quem tem mais fichas.
O Arena respondeu que a política de testes privados era pública desde 2024 e aberta a qualquer provedor. Os dois lados têm pontos válidos. O que ficou claro é que, com bilhões em jogo, o placar deixou de ser só ciência.
O que o ranking mede de verdade (e o que não mede)
Aqui está o detalhe que quase ninguém lê: o Arena mede qual resposta as pessoas preferem. Não qual está mais correta.
Preferência humana é influenciada por tom, formatação, tamanho da resposta, confiança na escrita. Uma resposta bonita e errada pode ganhar de uma resposta seca e certa, principalmente quando quem vota não domina o assunto.
Isso não torna o ranking inútil. Torna ele específico. Ele responde muito bem à pergunta "com qual IA as pessoas gostam de conversar?" e responde mal à pergunta "qual IA vai acertar o cálculo tributário da minha empresa?".
Como usar sem cair na armadilha
Se você está escolhendo um modelo para o seu time, o Arena é um ótimo ponto de partida e um péssimo ponto final. Algumas regras práticas:
- Olhe as categorias, não só o topo geral. O Arena separa rankings por código, visão, imagem, vídeo e outras tarefas. O campeão geral pode não ser o campeão no que você precisa.
- Diferenças pequenas são empate. Alguns pontos de distância no Elo não significam que um modelo é melhor que o outro na prática.
- Teste com os seus prompts. O próprio site permite escolher modelos e comparar lado a lado. Use perguntas reais do seu dia a dia.
- Combine com outras fontes. Benchmarks técnicos, custo por uso, privacidade de dados e integração com as ferramentas que você já usa pesam tanto quanto o ranking.
O ponto
O Arena resolveu um problema real: tirou a avaliação de IA das mãos exclusivas de quem fabrica a IA e colocou nas mãos de milhões de pessoas comuns. Isso é raro e valioso.
Mas nenhum ranking decide por você. Ele diz o que a multidão prefere. Você ainda precisa saber o que o seu negócio precisa.
Se você gosta de entender a tecnologia antes de acreditar no marketing dela, assine a newsletter da macareno.net. Toda semana, um pouco menos de hype e um pouco mais de contexto.
Fontes
- Arena (AI platform), Wikipedia
- LMArena is now Arena, Arena Blog
- LMArena lands $1.7B valuation four months after launching its product, TechCrunch
- The Leaderboard Illusion, arXiv
- LMArena Response to "The Leaderboard Illusion", LMArena
