Issue archive · updated 2026-04-29

LLM Leaderboard Archive — 2026-04

Archived 2026-04 LLM leaderboard: category leaders and full rankings for that issue.

01

Generación de Texto y Razonamiento

Generación de texto y razonamiento

Current leader GPT-5.5 OpenAI previously: GPT-5.4

2026 entra en la era de los tres titanes — sin un modelo dominante único, la mejor elección depende de la tarea.

#ModelCompanyScoreStrengths
1 GPT-5.5Released April 23, the first fully retrained foundation model since GPT-5. OpenAI 89 Terminal-Bench 2.0: 82.7% · OSWorld-Verified: 78.7% · GDPval: 84.9% · ARC-AGI-2: 85.0% · 1M-token context
2 Claude Opus 4.7Released April 16, strongest at long-context and code review. Anthropic 86 SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Most reliable multi-step reasoning · Most thorough code-logic review · 1M-token context
3 Gemini 3.1 ProIn preview, strongest at math and algorithmic competition. Google ~85 LiveCodeBench Elo: 2887 · 1M-token context · Lowest API price ($2/$12) · Leading video understanding · Best price-to-performance
Al 24/04/2026, GPT-5.5 (OpenAI) lidera la generación de texto y razonamiento con puntuación compuesta 89, seguido por Claude Opus 4.7 (Anthropic, 86) y Gemini 3.1 Pro (Google, ~85). GPT-5.5 gana en Terminal-Bench 2.0 (82,7%) y OSWorld-Verified (78,7%); Claude Opus 4.7 gana en SWE-Bench Pro (64,3%) y MCP-Atlas (79,1%); Gemini 3.1 Pro gana en LiveCodeBench Elo (2887). Los tres soportan contexto de 1M tokens.
02

Texto a Imagen

Generación de imágenes

Current leader GPT Image-2 OpenAI previously: Nano Banana 2

GPT Image-2 toma el trono con 99,2% de precisión en renderizado de texto, mientras Nano Banana 2 mantiene ventaja en generación en tiempo real.

#ModelCompanyScoreStrengths
1 GPT Image-2Highest text-rendering accuracy. OpenAI 99.2% Text-rendering accuracy 99.2% · Chinese / Arabic support · Spatial logic & anatomical correctness · Character consistency · Thinking-mode reasoning engine
2 Nano Banana 2Ultra-fast 4K generation with live web search. Google 4-15s Flash architecture, ultra-fast generation · 4K image in 4-15s · Live web-search integration · Fastest on the market · Deep Gemini-ecosystem integration
3 Flux ProStrongest open-source ecosystem. Black Forest Labs Open-source, commercial use · Rich community ecosystem · Style diversity · Local deployment
Al 24/04/2026, GPT Image-2 (OpenAI) lidera la generación de texto-a-imagen con 99,2% de precisión en renderizado de texto, seguido por Nano Banana 2 (Google, salida 4K en menos de 15s) y Flux Pro (Black Forest Labs, ecosistema open-source más fuerte). GPT Image-2 gana en tipografía, consistencia de personaje y lógica espacial; Nano Banana 2 gana en velocidad Flash e integración con búsqueda en tiempo real.
03

Texto a Vídeo

Generación de video

Current leader Veo 3.1 Google previously: Sora 2

Sora 2 ha salido de escena; Google Veo 3.1 ahora lidera en capacidad general, mientras Seedance 2.0 y Kling 3.0 lideran en nichos específicos.

#ModelCompanyScoreStrengths
1 Veo 3.1Native audio + multi-shot, strongest overall. Google Native audio generation · Multi-shot narrative · Excellent physics simulation · YouTube-ecosystem integration
2 Seedance 2.0Strongest multi-shot storyboarding. ByteDance Multi-shot storyboarding · Professional cinematic language · Leading domestic Chinese model · Douyin/TikTok ecosystem integration
3 Kling 3.0 OmniCinematic-grade visuals + most accurate lip-sync. Kuaishou Cinematic-grade visuals · Most accurate lip-sync · Kuaishou ecosystem integration · Optimized for Chinese scenarios
Al 24/04/2026, Google Veo 3.1 lidera la generación de texto-a-vídeo con audio nativo y narrativa multi-toma, seguido por Seedance 2.0 (ByteDance, storyboarding multi-toma más fuerte) y Kling 3.0 Omni (Kuaishou, calidad cinematográfica y sincronización labial más precisa). Sora 2 ha sido descontinuado.
04

Generación de Código

Generación de código y programación agéntica

Current leader GPT-5.5 (Agentic) OpenAI previously: Claude Opus 4.6

GPT-5.5 recupera el liderazgo en codificación agente-terminal; Claude Opus 4.7 aún domina refactorización multi-archivo y orquestación de herramientas.

#ModelCompanyScoreStrengths
1 GPT-5.5Terminal-Bench 2.0 #1, strongest agentic coding. OpenAI 82.7% Terminal-Bench 2.0: 82.7% · Expert-SWE: 73.1% · Autonomous coding judgment · Fewer tokens for the same task
2 Claude Opus 4.7SWE-Bench Pro #1, strongest multi-file refactoring. Anthropic 64.3% SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Multi-file logic review · Code-vulnerability detection
3 Gemini 3.1 ProLiveCodeBench #1, strongest in algorithmic competition. Google 2887 Elo LiveCodeBench Elo: 2887 · 1M-context whole-repo analysis · Lowest price · Best for algorithmic competition
Al 24/04/2026, GPT-5.5 (OpenAI) lidera la generación de código con 82,7% en Terminal-Bench 2.0, seguido por Claude Opus 4.7 (Anthropic, SWE-Bench Pro 64,3%) y Gemini 3.1 Pro (Google, LiveCodeBench Elo 2887). Elija GPT-5.5 para codificación agente autónoma, Claude Opus 4.7 para refactorización multi-archivo, Gemini para análisis de repo completo con contexto de 1M tokens.
05

Texto a Voz

Voz / Habla

Current leader ElevenLabs v3 ElevenLabs previously: ElevenLabs v2

ElevenLabs sigue siendo la referencia de la industria en realismo de voz y clonación; Hume AI lidera en voz emocional.

#ModelCompanyScoreStrengths
1 ElevenLabs v3Industry-benchmark voice realism. ElevenLabs 9.2/10 Realism score 9.2/10 · 75ms ultra-low latency · 29+ languages · Professional Clone quality · Enterprise-grade API
2 Hume AI OctaveTop of the emotional-voice leaderboard. Hume AI 9.3/10 Emotion recognition 9.3/10 · Emotional response capability · Empathetic interaction · Precise affect awareness
3 GPT-4o VoiceBest real-time conversational experience. OpenAI Low-latency real-time conversation · Natural voice output · Multilingual real-time translation · Deep ChatGPT integration
Al 24/04/2026, ElevenLabs v3 lidera texto-a-voz con puntuación de realismo 9,2/10 y latencia de 75ms en 29+ idiomas, seguido por Hume AI Octave (calificación de voz emocional más alta 9,3/10) y GPT-4o Voice (mejor experiencia de conversación en tiempo real).
06

Generación de Música con IA

Generación de música

Current leader Suno v5.5 Suno previously: Suno v5

Suno v5.5 sigue siendo la plataforma más usada; las herramientas se diferencian en velocidad, post-producción y despliegue empresarial.

#ModelCompanyScoreStrengths
1 Suno v5.5Most widely used AI music platform. Suno Largest user base · Studio multi-track editing · MIDI export · Fastest to a finished song
2 Udio v1.5Strongest post-production and stem control. Udio Stem download · Mix control · Key adjustment · Professional post-production
3 Lyria 3 ProBest for enterprise / API deployment. Google DeepMind Vertex AI delivery · Structured generation · Clear copyright posture · Enterprise-grade deployment
Al 24/04/2026, Suno v5.5 lidera la generación de música con IA por adopción de usuarios con edición multi-pista Studio y exportación MIDI, seguido por Udio v1.5 (edición a nivel de stem y post-producción más fuertes) y Lyria 3 Pro (Google DeepMind, mejor para despliegue empresarial / API vía Vertex AI).
07

Comprensión Visual

Visión / Comprensión multimodal

Current leader GPT-4o Vision OpenAI previously: GPT-4o Vision

GPT-4o Vision mantiene el liderazgo de uso general; Gemini Vision lidera en comprensión de vídeo y análisis de documentos largos.

#ModelCompanyScoreStrengths
1 GPT-4o VisionStrongest general-purpose vision understanding. OpenAI UI parsing · Chart understanding · Live visual conversation · Multimodal fusion
2 Gemini VisionLeader for video and long-document understanding. Google 1M-token long documents · Leading video understanding · Multi-frame analysis · Search integration
3 Qwen-VLTop open-source Chinese-scenario vision model. Alibaba Optimized for Chinese scenarios · Open-source, commercial use · Multimodal reasoning · Local deployment
Al 24/04/2026, GPT-4o Vision (OpenAI) lidera la comprensión visual de uso general con el análisis de UI y conversación visual en tiempo real más fuertes, seguido por Gemini Vision (Google, líder en documentos largos y comprensión de vídeo con 1M tokens) y Qwen-VL (Alibaba, modelo open-source más fuerte para escenarios en chino).
08

Código Abierto

Código abierto / Pesos abiertos

Current leader Llama 4 Meta previously: Llama 3

Los modelos open-source están alcanzando a los closed-source en varios benchmarks. Llama 4, DeepSeek V4 y Qwen3 forman la primera línea.

#ModelCompanyScoreStrengths
1 Llama 4Most complete open-source ecosystem. Meta Multimodal support · Largest community ecosystem · Commercial-use license · Multiple sizes
2 DeepSeek V4Strongest open-source reasoning, upgraded architecture. DeepSeek Superior math and reasoning · Best-in-class coding ability · Efficient MoE architecture · Extremely low API price
3 Qwen3Top open-source Chinese model. Alibaba Strongest Chinese understanding · Multimodal support · Agent capability · Full size coverage
Al 24/04/2026, Llama 4 (Meta) lidera los modelos open-source por ecosistema con soporte multimodal y licencia comercial-amigable, seguido por DeepSeek V4 (DeepSeek, razonamiento open-source más fuerte con arquitectura MoE y menor precio de API) y Qwen3 (Alibaba, modelo open-source líder en idioma chino y capacidad de agente).

This month's trends

Sources & methodology

Data as of 2026-04-29

Monthly archive