Issue archive · updated 2026-04-29

LLM Leaderboard Archive — 2026-04

Archived 2026-04 LLM leaderboard: category leaders and full rankings for that issue.

01

Geração de Texto e Raciocínio

Geração de texto e raciocínio

Current leader GPT-5.5 OpenAI previously: GPT-5.4

2026 entra na era dos três titãs — sem modelo dominante único, a melhor escolha depende da tarefa em mãos.

#ModelCompanyScoreStrengths
1 GPT-5.5Released April 23, the first fully retrained foundation model since GPT-5. OpenAI 89 Terminal-Bench 2.0: 82.7% · OSWorld-Verified: 78.7% · GDPval: 84.9% · ARC-AGI-2: 85.0% · 1M-token context
2 Claude Opus 4.7Released April 16, strongest at long-context and code review. Anthropic 86 SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Most reliable multi-step reasoning · Most thorough code-logic review · 1M-token context
3 Gemini 3.1 ProIn preview, strongest at math and algorithmic competition. Google ~85 LiveCodeBench Elo: 2887 · 1M-token context · Lowest API price ($2/$12) · Leading video understanding · Best price-to-performance
Em 24/04/2026, GPT-5.5 (OpenAI) lidera geração de texto e raciocínio com pontuação composta 89, seguido por Claude Opus 4.7 (Anthropic, 86) e Gemini 3.1 Pro (Google, ~85). GPT-5.5 vence em Terminal-Bench 2.0 (82,7%) e OSWorld-Verified (78,7%); Claude Opus 4.7 vence em SWE-Bench Pro (64,3%) e MCP-Atlas (79,1%); Gemini 3.1 Pro vence em LiveCodeBench Elo (2887). Os três suportam contexto de 1M tokens.
02

Texto para Imagem

Geração de imagens

Current leader GPT Image-2 OpenAI previously: Nano Banana 2

GPT Image-2 toma o trono com 99,2% de precisão na renderização de texto, enquanto Nano Banana 2 mantém vantagem na geração em tempo real.

#ModelCompanyScoreStrengths
1 GPT Image-2Highest text-rendering accuracy. OpenAI 99.2% Text-rendering accuracy 99.2% · Chinese / Arabic support · Spatial logic & anatomical correctness · Character consistency · Thinking-mode reasoning engine
2 Nano Banana 2Ultra-fast 4K generation with live web search. Google 4-15s Flash architecture, ultra-fast generation · 4K image in 4-15s · Live web-search integration · Fastest on the market · Deep Gemini-ecosystem integration
3 Flux ProStrongest open-source ecosystem. Black Forest Labs Open-source, commercial use · Rich community ecosystem · Style diversity · Local deployment
Em 24/04/2026, GPT Image-2 (OpenAI) lidera a geração de texto-para-imagem com 99,2% de precisão na renderização de texto, seguido por Nano Banana 2 (Google, saída 4K em menos de 15s) e Flux Pro (Black Forest Labs, ecossistema open-source mais forte). GPT Image-2 vence em tipografia, consistência de personagem e lógica espacial; Nano Banana 2 vence em velocidade Flash e integração com busca em tempo real.
03

Texto para Vídeo

Geração de vídeo

Current leader Veo 3.1 Google previously: Sora 2

Sora 2 saiu de cena; Google Veo 3.1 agora lidera em capacidade geral, enquanto Seedance 2.0 e Kling 3.0 lideram em nichos específicos.

#ModelCompanyScoreStrengths
1 Veo 3.1Native audio + multi-shot, strongest overall. Google Native audio generation · Multi-shot narrative · Excellent physics simulation · YouTube-ecosystem integration
2 Seedance 2.0Strongest multi-shot storyboarding. ByteDance Multi-shot storyboarding · Professional cinematic language · Leading domestic Chinese model · Douyin/TikTok ecosystem integration
3 Kling 3.0 OmniCinematic-grade visuals + most accurate lip-sync. Kuaishou Cinematic-grade visuals · Most accurate lip-sync · Kuaishou ecosystem integration · Optimized for Chinese scenarios
Em 24/04/2026, Google Veo 3.1 lidera geração de texto-para-vídeo com áudio nativo e narrativa multi-cena, seguido por Seedance 2.0 (ByteDance, storyboarding multi-cena mais forte) e Kling 3.0 Omni (Kuaishou, qualidade visual cinematográfica e sincronia labial mais precisa). Sora 2 foi descontinuado.
04

Geração de Código

Geração de código e codificação agêntica

Current leader GPT-5.5 (Agentic) OpenAI previously: Claude Opus 4.6

GPT-5.5 retoma a liderança em codificação agente-terminal; Claude Opus 4.7 ainda domina refatoração multi-arquivo e orquestração de ferramentas.

#ModelCompanyScoreStrengths
1 GPT-5.5Terminal-Bench 2.0 #1, strongest agentic coding. OpenAI 82.7% Terminal-Bench 2.0: 82.7% · Expert-SWE: 73.1% · Autonomous coding judgment · Fewer tokens for the same task
2 Claude Opus 4.7SWE-Bench Pro #1, strongest multi-file refactoring. Anthropic 64.3% SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Multi-file logic review · Code-vulnerability detection
3 Gemini 3.1 ProLiveCodeBench #1, strongest in algorithmic competition. Google 2887 Elo LiveCodeBench Elo: 2887 · 1M-context whole-repo analysis · Lowest price · Best for algorithmic competition
Em 24/04/2026, GPT-5.5 (OpenAI) lidera geração de código com 82,7% em Terminal-Bench 2.0, seguido por Claude Opus 4.7 (Anthropic, SWE-Bench Pro 64,3%) e Gemini 3.1 Pro (Google, LiveCodeBench Elo 2887). Escolha GPT-5.5 para codificação agente autônoma, Claude Opus 4.7 para refatoração multi-arquivo, Gemini para análise de repositório completo com contexto de 1M tokens.
05

Texto para Voz

Voz / Fala

Current leader ElevenLabs v3 ElevenLabs previously: ElevenLabs v2

ElevenLabs continua sendo a referência da indústria em realismo de voz e clonagem; Hume AI lidera em voz emocional.

#ModelCompanyScoreStrengths
1 ElevenLabs v3Industry-benchmark voice realism. ElevenLabs 9.2/10 Realism score 9.2/10 · 75ms ultra-low latency · 29+ languages · Professional Clone quality · Enterprise-grade API
2 Hume AI OctaveTop of the emotional-voice leaderboard. Hume AI 9.3/10 Emotion recognition 9.3/10 · Emotional response capability · Empathetic interaction · Precise affect awareness
3 GPT-4o VoiceBest real-time conversational experience. OpenAI Low-latency real-time conversation · Natural voice output · Multilingual real-time translation · Deep ChatGPT integration
Em 24/04/2026, ElevenLabs v3 lidera texto-para-voz com pontuação de realismo 9,2/10 e latência de 75ms em 29+ idiomas, seguido por Hume AI Octave (maior nota de voz emocional 9,3/10) e GPT-4o Voice (melhor experiência de conversa em tempo real).
06

Geração de Música com IA

Geração de música

Current leader Suno v5.5 Suno previously: Suno v5

Suno v5.5 continua sendo a plataforma mais usada; ferramentas se diferenciam em velocidade, pós-produção e implantação empresarial.

#ModelCompanyScoreStrengths
1 Suno v5.5Most widely used AI music platform. Suno Largest user base · Studio multi-track editing · MIDI export · Fastest to a finished song
2 Udio v1.5Strongest post-production and stem control. Udio Stem download · Mix control · Key adjustment · Professional post-production
3 Lyria 3 ProBest for enterprise / API deployment. Google DeepMind Vertex AI delivery · Structured generation · Clear copyright posture · Enterprise-grade deployment
Em 24/04/2026, Suno v5.5 lidera a geração de música com IA por adoção de usuários com edição multi-pista Studio e exportação MIDI, seguido por Udio v1.5 (edição em nível de stem e pós-produção mais fortes) e Lyria 3 Pro (Google DeepMind, melhor para implantação empresarial / API via Vertex AI).
07

Compreensão Visual

Visão / Compreensão multimodal

Current leader GPT-4o Vision OpenAI previously: GPT-4o Vision

GPT-4o Vision mantém a liderança em uso geral; Gemini Vision lidera em compreensão de vídeo e análise de documentos longos.

#ModelCompanyScoreStrengths
1 GPT-4o VisionStrongest general-purpose vision understanding. OpenAI UI parsing · Chart understanding · Live visual conversation · Multimodal fusion
2 Gemini VisionLeader for video and long-document understanding. Google 1M-token long documents · Leading video understanding · Multi-frame analysis · Search integration
3 Qwen-VLTop open-source Chinese-scenario vision model. Alibaba Optimized for Chinese scenarios · Open-source, commercial use · Multimodal reasoning · Local deployment
Em 24/04/2026, GPT-4o Vision (OpenAI) lidera a compreensão visual de uso geral com a mais forte análise de UI e conversa visual em tempo real, seguido por Gemini Vision (Google, líder em documentos longos e compreensão de vídeo com 1M tokens) e Qwen-VL (Alibaba, modelo open-source mais forte para cenários em chinês).
08

Código Aberto

Open source / Pesos abertos

Current leader Llama 4 Meta previously: Llama 3

Modelos open-source estão alcançando os closed-source em vários benchmarks. Llama 4, DeepSeek V4 e Qwen3 formam o primeiro escalão.

#ModelCompanyScoreStrengths
1 Llama 4Most complete open-source ecosystem. Meta Multimodal support · Largest community ecosystem · Commercial-use license · Multiple sizes
2 DeepSeek V4Strongest open-source reasoning, upgraded architecture. DeepSeek Superior math and reasoning · Best-in-class coding ability · Efficient MoE architecture · Extremely low API price
3 Qwen3Top open-source Chinese model. Alibaba Strongest Chinese understanding · Multimodal support · Agent capability · Full size coverage
Em 24/04/2026, Llama 4 (Meta) lidera os modelos open-source por ecossistema com suporte multimodal e licenciamento comercial-amigável, seguido por DeepSeek V4 (DeepSeek, raciocínio open-source mais forte com arquitetura MoE e menor preço de API) e Qwen3 (Alibaba, modelo open-source líder em idioma chinês e capacidade de agente).

This month's trends

Sources & methodology

Data as of 2026-04-29

Monthly archive