Issue archive · updated 2026-04-29

LLM Leaderboard Archive — 2026-04

Archived 2026-04 LLM leaderboard: category leaders and full rankings for that issue.

01

Metin Üretimi ve Akıl Yürütme

Metin üretimi ve akıl yürütme

Current leader GPT-5.5 OpenAI previously: GPT-5.4

2026, üç dev modelin çağına giriyor — tek baskın model yok, en iyi seçim göreve bağlı.

#ModelCompanyScoreStrengths
1 GPT-5.5Released April 23, the first fully retrained foundation model since GPT-5. OpenAI 89 Terminal-Bench 2.0: 82.7% · OSWorld-Verified: 78.7% · GDPval: 84.9% · ARC-AGI-2: 85.0% · 1M-token context
2 Claude Opus 4.7Released April 16, strongest at long-context and code review. Anthropic 86 SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Most reliable multi-step reasoning · Most thorough code-logic review · 1M-token context
3 Gemini 3.1 ProIn preview, strongest at math and algorithmic competition. Google ~85 LiveCodeBench Elo: 2887 · 1M-token context · Lowest API price ($2/$12) · Leading video understanding · Best price-to-performance
2026-04-29 itibarıyla, GPT-5.5 (OpenAI) 89 bileşik puanla metin üretimi ve akıl yürütmede liderlik ediyor; Claude Opus 4.7 (Anthropic, 86) ve Gemini 3.1 Pro (Google, ~85) onu izliyor. GPT-5.5 Terminal-Bench 2.0'da (%82,7) ve OSWorld-Verified'da (%78,7) kazanıyor; Claude Opus 4.7 SWE-Bench Pro'da (%64,3) ve MCP-Atlas'ta (%79,1) kazanıyor; Gemini 3.1 Pro LiveCodeBench Elo'da (2887) kazanıyor. Üçü de 1M-token bağlamı destekliyor.
02

Metinden Görüntüye

Görsel üretimi

Current leader GPT Image-2 OpenAI previously: Nano Banana 2

GPT Image-2, %99,2 metin renderleme doğruluğuyla tahta çıkıyor; Nano Banana 2 ise gerçek zamanlı üretimde öne çıkıyor.

#ModelCompanyScoreStrengths
1 GPT Image-2Highest text-rendering accuracy. OpenAI 99.2% Text-rendering accuracy 99.2% · Chinese / Arabic support · Spatial logic & anatomical correctness · Character consistency · Thinking-mode reasoning engine
2 Nano Banana 2Ultra-fast 4K generation with live web search. Google 4-15s Flash architecture, ultra-fast generation · 4K image in 4-15s · Live web-search integration · Fastest on the market · Deep Gemini-ecosystem integration
3 Flux ProStrongest open-source ecosystem. Black Forest Labs Open-source, commercial use · Rich community ecosystem · Style diversity · Local deployment
2026-04-29 itibarıyla, GPT Image-2 (OpenAI) %99,2 metin renderleme doğruluğuyla metinden-görüntüye üretiminde liderlik ediyor; Nano Banana 2 (Google, 15 saniye altında 4K çıktı) ve Flux Pro (Black Forest Labs, en güçlü açık kaynak ekosistem) onu izliyor. GPT Image-2 tipografi hassasiyeti, karakter tutarlılığı ve uzamsal mantıkta kazanıyor; Nano Banana 2 Flash mimari hızında ve gerçek zamanlı arama entegrasyonunda kazanıyor.
03

Metinden Videoya

Video üretimi

Current leader Veo 3.1 Google previously: Sora 2

Sora 2 yarıştan çekildi; Google Veo 3.1 artık genel yetenekte liderlik ederken, Seedance 2.0 ve Kling 3.0 belirli nişlerde lider.

#ModelCompanyScoreStrengths
1 Veo 3.1Native audio + multi-shot, strongest overall. Google Native audio generation · Multi-shot narrative · Excellent physics simulation · YouTube-ecosystem integration
2 Seedance 2.0Strongest multi-shot storyboarding. ByteDance Multi-shot storyboarding · Professional cinematic language · Leading domestic Chinese model · Douyin/TikTok ecosystem integration
3 Kling 3.0 OmniCinematic-grade visuals + most accurate lip-sync. Kuaishou Cinematic-grade visuals · Most accurate lip-sync · Kuaishou ecosystem integration · Optimized for Chinese scenarios
2026-04-29 itibarıyla, Google Veo 3.1 yerel ses ve çoklu sahne anlatımıyla metinden-videoya üretiminde liderlik ediyor; Seedance 2.0 (ByteDance, en güçlü çoklu sahne storyboard'u) ve Kling 3.0 Omni (Kuaishou, sinematik görsel kalitesi ve en isabetli dudak senkronizasyonu) onu izliyor. Sora 2 kullanımdan kaldırıldı.
04

Kod Üretimi

Kod üretimi ve ajan kodlama

Current leader GPT-5.5 (Agentic) OpenAI previously: Claude Opus 4.6

GPT-5.5, terminal-ajan kodlamada liderliği geri alıyor; Claude Opus 4.7 hâlâ çok dosyalı refaktörleme ve araç orkestrasyonunda hâkim.

#ModelCompanyScoreStrengths
1 GPT-5.5Terminal-Bench 2.0 #1, strongest agentic coding. OpenAI 82.7% Terminal-Bench 2.0: 82.7% · Expert-SWE: 73.1% · Autonomous coding judgment · Fewer tokens for the same task
2 Claude Opus 4.7SWE-Bench Pro #1, strongest multi-file refactoring. Anthropic 64.3% SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Multi-file logic review · Code-vulnerability detection
3 Gemini 3.1 ProLiveCodeBench #1, strongest in algorithmic competition. Google 2887 Elo LiveCodeBench Elo: 2887 · 1M-context whole-repo analysis · Lowest price · Best for algorithmic competition
2026-04-29 itibarıyla, GPT-5.5 (OpenAI) Terminal-Bench 2.0'da %82,7 ile kod üretiminde liderlik ediyor; Claude Opus 4.7 (Anthropic, SWE-Bench Pro %64,3) ve Gemini 3.1 Pro (Google, LiveCodeBench Elo 2887) onu izliyor. Otonom ajantik kodlama için GPT-5.5'i, çok dosyalı refaktörleme için Claude Opus 4.7'yi, 1M-token bağlamla tüm-repo analizi için Gemini'yi seçin.
05

Metinden Konuşmaya

Ses / Konuşma

Current leader ElevenLabs v3 ElevenLabs previously: ElevenLabs v2

ElevenLabs, ses gerçekçiliği ve klonlamada endüstri referansı olmayı sürdürüyor; Hume AI duygusal seste lider.

#ModelCompanyScoreStrengths
1 ElevenLabs v3Industry-benchmark voice realism. ElevenLabs 9.2/10 Realism score 9.2/10 · 75ms ultra-low latency · 29+ languages · Professional Clone quality · Enterprise-grade API
2 Hume AI OctaveTop of the emotional-voice leaderboard. Hume AI 9.3/10 Emotion recognition 9.3/10 · Emotional response capability · Empathetic interaction · Precise affect awareness
3 GPT-4o VoiceBest real-time conversational experience. OpenAI Low-latency real-time conversation · Natural voice output · Multilingual real-time translation · Deep ChatGPT integration
2026-04-29 itibarıyla, ElevenLabs v3 9,2/10 gerçekçilik puanı ve 75ms gecikmeyle 29+ dilde metinden-konuşmaya alanında liderlik ediyor; Hume AI Octave (en yüksek duygusal ses puanı 9,3/10) ve GPT-4o Voice (en iyi gerçek zamanlı konuşma deneyimi) onu izliyor.
06

AI Müzik Üretimi

Müzik üretimi

Current leader Suno v5.5 Suno previously: Suno v5

Suno v5.5, en yaygın kullanılan platform olmayı sürdürüyor; araçlar hız, post-prodüksiyon ve kurumsal dağıtımda farklılaşıyor.

#ModelCompanyScoreStrengths
1 Suno v5.5Most widely used AI music platform. Suno Largest user base · Studio multi-track editing · MIDI export · Fastest to a finished song
2 Udio v1.5Strongest post-production and stem control. Udio Stem download · Mix control · Key adjustment · Professional post-production
3 Lyria 3 ProBest for enterprise / API deployment. Google DeepMind Vertex AI delivery · Structured generation · Clear copyright posture · Enterprise-grade deployment
2026-04-29 itibarıyla, Suno v5.5 çok izli Studio düzenleme ve MIDI dışa aktarmayla kullanıcı benimsemesinde AI müzik üretimine liderlik ediyor; Udio v1.5 (en güçlü stem-seviye düzenleme ve post-prodüksiyon) ve Lyria 3 Pro (Google DeepMind, Vertex AI üzerinden kurumsal / API dağıtım için en iyi) onu izliyor.
07

Görsel Anlama

Görüş / Çok modlu anlama

Current leader GPT-4o Vision OpenAI previously: GPT-4o Vision

GPT-4o Vision genel amaçlı liderliğini sürdürüyor; Gemini Vision video anlama ve uzun belge ayrıştırmada lider.

#ModelCompanyScoreStrengths
1 GPT-4o VisionStrongest general-purpose vision understanding. OpenAI UI parsing · Chart understanding · Live visual conversation · Multimodal fusion
2 Gemini VisionLeader for video and long-document understanding. Google 1M-token long documents · Leading video understanding · Multi-frame analysis · Search integration
3 Qwen-VLTop open-source Chinese-scenario vision model. Alibaba Optimized for Chinese scenarios · Open-source, commercial use · Multimodal reasoning · Local deployment
2026-04-29 itibarıyla, GPT-4o Vision (OpenAI) en güçlü UI ayrıştırma ve canlı görsel konuşmayla genel amaçlı görsel anlamada liderlik ediyor; Gemini Vision (Google, 1M-token uzun belge ve video anlama lideri) ve Qwen-VL (Alibaba, Çince senaryolar için en güçlü açık kaynak model) onu izliyor.
08

Açık Kaynak

Açık kaynak / Açık ağırlıklar

Current leader Llama 4 Meta previously: Llama 3

Açık kaynak modeller, kapalı kaynak modellere birkaç kıyaslamada hızla yetişiyor. Llama 4, DeepSeek V4 ve Qwen3 ilk kademeyi oluşturuyor.

#ModelCompanyScoreStrengths
1 Llama 4Most complete open-source ecosystem. Meta Multimodal support · Largest community ecosystem · Commercial-use license · Multiple sizes
2 DeepSeek V4Strongest open-source reasoning, upgraded architecture. DeepSeek Superior math and reasoning · Best-in-class coding ability · Efficient MoE architecture · Extremely low API price
3 Qwen3Top open-source Chinese model. Alibaba Strongest Chinese understanding · Multimodal support · Agent capability · Full size coverage
2026-04-29 itibarıyla, Llama 4 (Meta) ekosistem açısından çok modlu destek ve ticari-dostu lisanslamayla açık kaynak modellere liderlik ediyor; DeepSeek V4 (DeepSeek, MoE mimarili en güçlü açık kaynak akıl yürütme ve en düşük API fiyatı) ve Qwen3 (Alibaba, Çince dil ve ajan yeteneklerinde lider açık kaynak model) onu izliyor.

This month's trends

Sources & methodology

Data as of 2026-04-29

Monthly archive