El ranking de IA más respetado del mundo se decide **a votos, a ciegas**
IAIA GenerativaAnálisis

El ranking de IA más respetado del mundo se decide a votos, a ciegas

Arena (antes LMArena) clasifica modelos de IA con millones de votos humanos anónimos. Cómo funciona, por qué se volvió referencia de la industria y dónde engaña el marcador.

Macareno6 min de lectura

Cada vez que sale un modelo nuevo, el anuncio trae la misma frase mágica: "número 1 en el ranking". OpenAI lo dice, Google lo dice, Anthropic lo dice. Y tú, que solo querías saber qué IA usar en el trabajo, te quedas con una duda razonable: ¿número 1 según quién?

La mayoría de las veces, la respuesta es un sitio donde cualquiera puede entrar, escribir una pregunta y votar cuál de dos respuestas anónimas fue mejor. Sin saber de quién es cada una. Millones de veces al mes.

Ese sitio se llama Arena. Y se convirtió, casi sin querer, en el juez que toda la industria aceptó.

Un proyecto universitario que terminó arbitrando miles de millones

Arena nació en 2023 como Chatbot Arena, un proyecto de investigadores de UC Berkeley. En 2024 estrenó dominio propio como LMArena, en abril de 2025 se convirtió en empresa independiente y, en enero de 2026, simplificó su nombre a Arena.

La etapa de "proyecto universitario" duró poco. En mayo de 2025 levantó US$ 100 millones con una valoración de US$ 600 millones. En enero de 2026, otros US$ 150 millones, ya valorada en US$ 1.700 millones. Hoy suma más de 5 millones de usuarios mensuales en 150 países y cerca de 60 millones de conversaciones al mes.

Y el modelo de negocio es curioso: desde septiembre de 2025, laboratorios y empresas pagan por evaluar sus modelos con la comunidad de Arena. En diciembre, ese servicio ya corría a un ritmo anual de US$ 30 millones. O sea: el árbitro también le vende asesoría a los equipos que dirige.

La prueba ciega que ninguna marca puede comprar

El mecanismo es simple, y por eso es poderoso. Escribes un prompt, dos modelos anónimos responden, eliges el mejor y solo después descubres quién era quién. Los votos alimentan un sistema estadístico parecido al Elo del ajedrez: ganarle a un modelo fuerte vale más que ganarle a uno débil.

La diferencia con los benchmarks tradicionales es grande:

Benchmark tradicional Arena
Quién evalúa Una pauta fija Personas reales
Preguntas Siempre las mismas Infinitas e impredecibles
Riesgo de "memorizar la prueba" Alto Bajo
Sesgo de marca No aplica Eliminado por el anonimato
Qué mide Acierto técnico Preferencia humana

Los benchmarks fijos envejecen mal. Mientras más famosos, más terminan los modelos entrenados (a propósito o no) para salir bien en ellos. En Arena, la prueba cambia con cada voto, porque cada persona trae su propia pregunta extraña de martes en la tarde.

Y el anonimato resuelve el club de fans. Si sabes que estás evaluando ChatGPT contra Claude, tu preferencia de marca vota contigo.

Cuando el marcador se vuelve objetivo

Hay una ley antigua en economía, la Ley de Goodhart: cuando una métrica se convierte en meta, deja de ser una buena métrica. Arena no se salvó.

En abril de 2025, Meta lanzó Llama 4 y Maverick apareció en lo más alto del ranking. Solo que la versión probada en Arena era distinta a la disponible al público, ajustada para gustarle a los votantes. Arena cambió sus reglas después del episodio.

Ese mismo mes, investigadores de Cohere, Stanford, MIT, Princeton y otras instituciones publicaron un estudio de 68 páginas llamado The Leaderboard Illusion. La acusación: los grandes laboratorios probaban decenas de variantes en privado antes del lanzamiento y publicaban solo la que salía mejor. En el caso más extremo, 27 variantes privadas de Meta antes de Llama 4.

Un ranking puede ser honesto y, aun así, lo juega mejor quien tiene más fichas.

Arena respondió que su política de pruebas privadas era pública desde 2024 y abierta a cualquier proveedor. Ambos lados tienen puntos válidos. Lo que quedó claro es que, con miles de millones en juego, el marcador dejó de ser solo ciencia.

Lo que el ranking mide de verdad (y lo que no)

Este es el detalle que casi nadie lee: Arena mide qué respuesta las personas prefieren. No cuál es más correcta.

La preferencia humana se ve influida por el tono, el formato, el largo de la respuesta, la seguridad al escribir. Una respuesta bonita y equivocada puede ganarle a una seca y correcta, sobre todo cuando quien vota no domina el tema.

Eso no vuelve inútil al ranking. Lo vuelve específico. Responde muy bien a la pregunta "¿con qué IA le gusta conversar a la gente?" y responde mal a "¿qué IA va a acertar el cálculo tributario de mi empresa?".

Cómo usarlo sin caer en la trampa

Si estás eligiendo un modelo para tu equipo, Arena es un excelente punto de partida y un pésimo punto final. Algunas reglas prácticas:

  • Mira las categorías, no solo la cima general. Arena separa rankings por código, visión, imagen, video y otras tareas. El campeón general puede no ser el campeón en lo que necesitas.
  • Las diferencias pequeñas son empate. Unos pocos puntos de distancia en el Elo no significan que un modelo sea mejor que otro en la práctica.
  • Prueba con tus propios prompts. El mismo sitio permite elegir modelos y compararlos lado a lado. Usa preguntas reales de tu día a día.
  • Combínalo con otras fuentes. Benchmarks técnicos, costo de uso, privacidad de datos e integración con las herramientas que ya usas pesan tanto como el ranking.

El punto

Arena resolvió un problema real: sacó la evaluación de IA de las manos exclusivas de quienes fabrican la IA y la puso en manos de millones de personas comunes. Eso es raro y valioso.

Pero ningún ranking decide por ti. Te dice lo que prefiere la multitud. Tú todavía tienes que saber lo que necesita tu negocio.

Si te gusta entender la tecnología antes de creerle al marketing, suscríbete a la newsletter de macareno.net. Cada semana, un poco menos de hype y un poco más de contexto.

Fuentes

Compartir artículo

Siguiente paso de negocio

Conecta este artículo con un servicio y un caso real de MacarenoNet para llevar la idea a ejecución.

Servicio recomendado

Servicios de Transformación Digital

Consultoría, implementación y mejora continua en ecosistema Microsoft.

Ver servicio

Caso recomendado

Dashboard de Proyectos

Caso real con impacto en ejecución y visibilidad para áreas de negocio.

Ver caso