Issue archive · updated 2026-04-29

LLM Leaderboard Archive — 2026-04

Archived 2026-04 LLM leaderboard: category leaders and full rankings for that issue.

01

Génération de Texte et Raisonnement

Génération de texte et raisonnement

Current leader GPT-5.5 OpenAI previously: GPT-5.4

2026 entre dans l'ère des trois titans — pas de modèle dominant unique, le meilleur choix dépend de la tâche.

#ModelCompanyScoreStrengths
1 GPT-5.5Released April 23, the first fully retrained foundation model since GPT-5. OpenAI 89 Terminal-Bench 2.0: 82.7% · OSWorld-Verified: 78.7% · GDPval: 84.9% · ARC-AGI-2: 85.0% · 1M-token context
2 Claude Opus 4.7Released April 16, strongest at long-context and code review. Anthropic 86 SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Most reliable multi-step reasoning · Most thorough code-logic review · 1M-token context
3 Gemini 3.1 ProIn preview, strongest at math and algorithmic competition. Google ~85 LiveCodeBench Elo: 2887 · 1M-token context · Lowest API price ($2/$12) · Leading video understanding · Best price-to-performance
Au 24/04/2026, GPT-5.5 (OpenAI) domine la génération de texte et le raisonnement avec un score composite de 89, suivi par Claude Opus 4.7 (Anthropic, 86) et Gemini 3.1 Pro (Google, ~85). GPT-5.5 gagne sur Terminal-Bench 2.0 (82,7 %) et OSWorld-Verified (78,7 %) ; Claude Opus 4.7 gagne sur SWE-Bench Pro (64,3 %) et MCP-Atlas (79,1 %) ; Gemini 3.1 Pro gagne sur LiveCodeBench Elo (2887). Les trois supportent un contexte de 1M tokens.
02

Texte vers Image

Génération d'images

Current leader GPT Image-2 OpenAI previously: Nano Banana 2

GPT Image-2 prend le trône avec 99,2 % de précision de rendu de texte, tandis que Nano Banana 2 garde un avantage en génération temps réel.

#ModelCompanyScoreStrengths
1 GPT Image-2Highest text-rendering accuracy. OpenAI 99.2% Text-rendering accuracy 99.2% · Chinese / Arabic support · Spatial logic & anatomical correctness · Character consistency · Thinking-mode reasoning engine
2 Nano Banana 2Ultra-fast 4K generation with live web search. Google 4-15s Flash architecture, ultra-fast generation · 4K image in 4-15s · Live web-search integration · Fastest on the market · Deep Gemini-ecosystem integration
3 Flux ProStrongest open-source ecosystem. Black Forest Labs Open-source, commercial use · Rich community ecosystem · Style diversity · Local deployment
Au 24/04/2026, GPT Image-2 (OpenAI) domine la génération texte-vers-image avec 99,2 % de précision de rendu de texte, suivi par Nano Banana 2 (Google, sortie 4K en moins de 15 s) et Flux Pro (Black Forest Labs, écosystème open-source le plus fort). GPT Image-2 gagne sur la typographie, la cohérence des personnages et la logique spatiale ; Nano Banana 2 gagne sur la vitesse de l'architecture Flash et l'intégration de recherche en temps réel.
03

Texte vers Vidéo

Génération de vidéos

Current leader Veo 3.1 Google previously: Sora 2

Sora 2 est sorti de la course ; Google Veo 3.1 mène désormais en capacité globale, tandis que Seedance 2.0 et Kling 3.0 dominent dans des niches spécifiques.

#ModelCompanyScoreStrengths
1 Veo 3.1Native audio + multi-shot, strongest overall. Google Native audio generation · Multi-shot narrative · Excellent physics simulation · YouTube-ecosystem integration
2 Seedance 2.0Strongest multi-shot storyboarding. ByteDance Multi-shot storyboarding · Professional cinematic language · Leading domestic Chinese model · Douyin/TikTok ecosystem integration
3 Kling 3.0 OmniCinematic-grade visuals + most accurate lip-sync. Kuaishou Cinematic-grade visuals · Most accurate lip-sync · Kuaishou ecosystem integration · Optimized for Chinese scenarios
Au 24/04/2026, Google Veo 3.1 domine la génération texte-vers-vidéo avec audio natif et narration multi-plans, suivi par Seedance 2.0 (ByteDance, storyboarding multi-plans le plus fort) et Kling 3.0 Omni (Kuaishou, qualité visuelle cinématographique et lip-sync le plus précis). Sora 2 a été déprécié.
04

Génération de Code

Génération de code et codage agentique

Current leader GPT-5.5 (Agentic) OpenAI previously: Claude Opus 4.6

GPT-5.5 reprend la tête en codage agent-terminal ; Claude Opus 4.7 garde le refactoring multi-fichiers et l'orchestration d'outils.

#ModelCompanyScoreStrengths
1 GPT-5.5Terminal-Bench 2.0 #1, strongest agentic coding. OpenAI 82.7% Terminal-Bench 2.0: 82.7% · Expert-SWE: 73.1% · Autonomous coding judgment · Fewer tokens for the same task
2 Claude Opus 4.7SWE-Bench Pro #1, strongest multi-file refactoring. Anthropic 64.3% SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Multi-file logic review · Code-vulnerability detection
3 Gemini 3.1 ProLiveCodeBench #1, strongest in algorithmic competition. Google 2887 Elo LiveCodeBench Elo: 2887 · 1M-context whole-repo analysis · Lowest price · Best for algorithmic competition
Au 24/04/2026, GPT-5.5 (OpenAI) domine la génération de code avec 82,7 % sur Terminal-Bench 2.0, suivi par Claude Opus 4.7 (Anthropic, SWE-Bench Pro 64,3 %) et Gemini 3.1 Pro (Google, LiveCodeBench Elo 2887). Choisissez GPT-5.5 pour le codage agentique autonome, Claude Opus 4.7 pour le refactoring multi-fichiers, Gemini pour l'analyse de dépôt complet avec contexte de 1M tokens.
05

Synthèse Vocale

Voix / Parole

Current leader ElevenLabs v3 ElevenLabs previously: ElevenLabs v2

ElevenLabs reste la référence industrielle pour le réalisme vocal et le clonage ; Hume AI mène en voix émotionnelle.

#ModelCompanyScoreStrengths
1 ElevenLabs v3Industry-benchmark voice realism. ElevenLabs 9.2/10 Realism score 9.2/10 · 75ms ultra-low latency · 29+ languages · Professional Clone quality · Enterprise-grade API
2 Hume AI OctaveTop of the emotional-voice leaderboard. Hume AI 9.3/10 Emotion recognition 9.3/10 · Emotional response capability · Empathetic interaction · Precise affect awareness
3 GPT-4o VoiceBest real-time conversational experience. OpenAI Low-latency real-time conversation · Natural voice output · Multilingual real-time translation · Deep ChatGPT integration
Au 24/04/2026, ElevenLabs v3 domine la synthèse vocale avec un score de réalisme de 9,2/10 et une latence de 75 ms sur 29+ langues, suivi par Hume AI Octave (meilleure note de voix émotionnelle 9,3/10) et GPT-4o Voice (meilleure expérience de conversation en temps réel).
06

Génération Musicale par IA

Génération musicale

Current leader Suno v5.5 Suno previously: Suno v5

Suno v5.5 reste la plateforme la plus utilisée ; les outils se différencient sur la vitesse, la post-production et le déploiement entreprise.

#ModelCompanyScoreStrengths
1 Suno v5.5Most widely used AI music platform. Suno Largest user base · Studio multi-track editing · MIDI export · Fastest to a finished song
2 Udio v1.5Strongest post-production and stem control. Udio Stem download · Mix control · Key adjustment · Professional post-production
3 Lyria 3 ProBest for enterprise / API deployment. Google DeepMind Vertex AI delivery · Structured generation · Clear copyright posture · Enterprise-grade deployment
Au 24/04/2026, Suno v5.5 domine la génération musicale par IA en adoption utilisateur avec édition multi-piste Studio et export MIDI, suivi par Udio v1.5 (édition au niveau stem et post-production les plus fortes) et Lyria 3 Pro (Google DeepMind, meilleur pour le déploiement entreprise / API via Vertex AI).
07

Compréhension Visuelle

Vision / Compréhension multimodale

Current leader GPT-4o Vision OpenAI previously: GPT-4o Vision

GPT-4o Vision garde la tête en usage général ; Gemini Vision domine en compréhension vidéo et analyse de documents longs.

#ModelCompanyScoreStrengths
1 GPT-4o VisionStrongest general-purpose vision understanding. OpenAI UI parsing · Chart understanding · Live visual conversation · Multimodal fusion
2 Gemini VisionLeader for video and long-document understanding. Google 1M-token long documents · Leading video understanding · Multi-frame analysis · Search integration
3 Qwen-VLTop open-source Chinese-scenario vision model. Alibaba Optimized for Chinese scenarios · Open-source, commercial use · Multimodal reasoning · Local deployment
Au 24/04/2026, GPT-4o Vision (OpenAI) domine la compréhension visuelle généraliste avec la plus forte analyse d'UI et conversation visuelle en temps réel, suivi par Gemini Vision (Google, leader en compréhension vidéo et documents longs avec 1M tokens) et Qwen-VL (Alibaba, modèle open-source le plus fort pour scénarios chinois).
08

Open Source

Open source / Poids ouverts

Current leader Llama 4 Meta previously: Llama 3

Les modèles open-source rattrapent rapidement les closed-source sur plusieurs benchmarks. Llama 4, DeepSeek V4 et Qwen3 forment le premier rang.

#ModelCompanyScoreStrengths
1 Llama 4Most complete open-source ecosystem. Meta Multimodal support · Largest community ecosystem · Commercial-use license · Multiple sizes
2 DeepSeek V4Strongest open-source reasoning, upgraded architecture. DeepSeek Superior math and reasoning · Best-in-class coding ability · Efficient MoE architecture · Extremely low API price
3 Qwen3Top open-source Chinese model. Alibaba Strongest Chinese understanding · Multimodal support · Agent capability · Full size coverage
Au 24/04/2026, Llama 4 (Meta) domine les modèles open-source par écosystème avec support multimodal et licence commercial-friendly, suivi par DeepSeek V4 (DeepSeek, raisonnement open-source le plus fort avec architecture MoE et le prix d'API le plus bas) et Qwen3 (Alibaba, modèle open-source leader en langue chinoise et capacité d'agent).

This month's trends

Sources & methodology

Data as of 2026-04-29

Monthly archive