Issue archive · updated 2026-04-29

LLM Leaderboard Archive — 2026-04

Archived 2026-04 LLM leaderboard: category leaders and full rankings for that issue.

01

توليد النص والاستدلال

توليد النصوص والاستدلال

Current leader GPT-5.5 OpenAI previously: GPT-5.4

يدخل 2026 عصر الثلاثة الكبار — لا نموذج مهيمن واحد، الاختيار الأفضل يعتمد على المهمة المطروحة.

#ModelCompanyScoreStrengths
1 GPT-5.5Released April 23, the first fully retrained foundation model since GPT-5. OpenAI 89 Terminal-Bench 2.0: 82.7% · OSWorld-Verified: 78.7% · GDPval: 84.9% · ARC-AGI-2: 85.0% · 1M-token context
2 Claude Opus 4.7Released April 16, strongest at long-context and code review. Anthropic 86 SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Most reliable multi-step reasoning · Most thorough code-logic review · 1M-token context
3 Gemini 3.1 ProIn preview, strongest at math and algorithmic competition. Google ~85 LiveCodeBench Elo: 2887 · 1M-token context · Lowest API price ($2/$12) · Leading video understanding · Best price-to-performance
حتى 2026-04-29، يتصدر GPT-5.5 (OpenAI) توليد النص والاستدلال بدرجة مركبة 89، يليه Claude Opus 4.7 (Anthropic، 86) وGemini 3.1 Pro (Google، ~85). يفوز GPT-5.5 في Terminal-Bench 2.0 (82.7%) وOSWorld-Verified (78.7%)؛ يفوز Claude Opus 4.7 في SWE-Bench Pro (64.3%) وMCP-Atlas (79.1%)؛ يفوز Gemini 3.1 Pro في LiveCodeBench Elo (2887). جميعها تدعم سياق 1M-token.
02

تحويل النص إلى صورة

توليد الصور

Current leader GPT Image-2 OpenAI previously: Nano Banana 2

يستحوذ GPT Image-2 على العرش بدقة عرض نص 99.2%، بينما يحتفظ Nano Banana 2 بميزة في التوليد الفوري.

#ModelCompanyScoreStrengths
1 GPT Image-2Highest text-rendering accuracy. OpenAI 99.2% Text-rendering accuracy 99.2% · Chinese / Arabic support · Spatial logic & anatomical correctness · Character consistency · Thinking-mode reasoning engine
2 Nano Banana 2Ultra-fast 4K generation with live web search. Google 4-15s Flash architecture, ultra-fast generation · 4K image in 4-15s · Live web-search integration · Fastest on the market · Deep Gemini-ecosystem integration
3 Flux ProStrongest open-source ecosystem. Black Forest Labs Open-source, commercial use · Rich community ecosystem · Style diversity · Local deployment
حتى 2026-04-29، يتصدر GPT Image-2 (OpenAI) توليد الصور من النص بدقة عرض نص 99.2%، يليه Nano Banana 2 (Google، إخراج 4K في أقل من 15 ثانية) وFlux Pro (Black Forest Labs، أقوى نظام بيئي مفتوح المصدر). يفوز GPT Image-2 في دقة الطباعة واتساق الشخصيات والمنطق المكاني؛ يفوز Nano Banana 2 في سرعة بنية Flash والتكامل مع البحث الفوري.
03

تحويل النص إلى فيديو

توليد الفيديو

Current leader Veo 3.1 Google previously: Sora 2

خرج Sora 2 من المنافسة؛ يقود Google Veo 3.1 الآن في القدرة الإجمالية، بينما يقود Seedance 2.0 وKling 3.0 في تخصصات محددة.

#ModelCompanyScoreStrengths
1 Veo 3.1Native audio + multi-shot, strongest overall. Google Native audio generation · Multi-shot narrative · Excellent physics simulation · YouTube-ecosystem integration
2 Seedance 2.0Strongest multi-shot storyboarding. ByteDance Multi-shot storyboarding · Professional cinematic language · Leading domestic Chinese model · Douyin/TikTok ecosystem integration
3 Kling 3.0 OmniCinematic-grade visuals + most accurate lip-sync. Kuaishou Cinematic-grade visuals · Most accurate lip-sync · Kuaishou ecosystem integration · Optimized for Chinese scenarios
حتى 2026-04-29، يتصدر Google Veo 3.1 توليد النص إلى فيديو بصوت أصلي وسرد متعدد اللقطات، يليه Seedance 2.0 (ByteDance، أقوى لوحة قصة متعددة اللقطات) وKling 3.0 Omni (Kuaishou، صور سينمائية وأدق مزامنة شفاه). تم إيقاف Sora 2.
04

توليد الكود

توليد الكود والبرمجة الوكيلة

Current leader GPT-5.5 (Agentic) OpenAI previously: Claude Opus 4.6

يستعيد GPT-5.5 الصدارة في برمجة الوكيل الطرفي؛ لا يزال Claude Opus 4.7 يمتلك إعادة البناء متعدد الملفات وتنسيق الأدوات.

#ModelCompanyScoreStrengths
1 GPT-5.5Terminal-Bench 2.0 #1, strongest agentic coding. OpenAI 82.7% Terminal-Bench 2.0: 82.7% · Expert-SWE: 73.1% · Autonomous coding judgment · Fewer tokens for the same task
2 Claude Opus 4.7SWE-Bench Pro #1, strongest multi-file refactoring. Anthropic 64.3% SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · Multi-file logic review · Code-vulnerability detection
3 Gemini 3.1 ProLiveCodeBench #1, strongest in algorithmic competition. Google 2887 Elo LiveCodeBench Elo: 2887 · 1M-context whole-repo analysis · Lowest price · Best for algorithmic competition
حتى 2026-04-29، يتصدر GPT-5.5 (OpenAI) توليد الكود بـ 82.7% في Terminal-Bench 2.0، يليه Claude Opus 4.7 (Anthropic، SWE-Bench Pro 64.3%) وGemini 3.1 Pro (Google، LiveCodeBench Elo 2887). اختر GPT-5.5 للبرمجة الوكيلية المستقلة، Claude Opus 4.7 لإعادة بناء متعدد الملفات، Gemini للتحليل الكامل للمستودع بسياق 1M-token.
05

تحويل النص إلى كلام

الصوت / الكلام

Current leader ElevenLabs v3 ElevenLabs previously: ElevenLabs v2

تظل ElevenLabs المعيار الصناعي لواقعية الصوت واستنساخه؛ تقود Hume AI في الصوت العاطفي.

#ModelCompanyScoreStrengths
1 ElevenLabs v3Industry-benchmark voice realism. ElevenLabs 9.2/10 Realism score 9.2/10 · 75ms ultra-low latency · 29+ languages · Professional Clone quality · Enterprise-grade API
2 Hume AI OctaveTop of the emotional-voice leaderboard. Hume AI 9.3/10 Emotion recognition 9.3/10 · Emotional response capability · Empathetic interaction · Precise affect awareness
3 GPT-4o VoiceBest real-time conversational experience. OpenAI Low-latency real-time conversation · Natural voice output · Multilingual real-time translation · Deep ChatGPT integration
حتى 2026-04-29، تتصدر ElevenLabs v3 تحويل النص إلى كلام بدرجة واقعية 9.2/10 وزمن استجابة 75ms عبر 29+ لغة، تليها Hume AI Octave (أعلى تقييم للصوت العاطفي 9.3/10) وGPT-4o Voice (أفضل تجربة محادثة فورية).
06

توليد الموسيقى بالذكاء الاصطناعي

توليد الموسيقى

Current leader Suno v5.5 Suno previously: Suno v5

تظل Suno v5.5 المنصة الأكثر استخدامًا؛ تتميز الأدوات في السرعة، ما بعد الإنتاج، ونشر المؤسسات.

#ModelCompanyScoreStrengths
1 Suno v5.5Most widely used AI music platform. Suno Largest user base · Studio multi-track editing · MIDI export · Fastest to a finished song
2 Udio v1.5Strongest post-production and stem control. Udio Stem download · Mix control · Key adjustment · Professional post-production
3 Lyria 3 ProBest for enterprise / API deployment. Google DeepMind Vertex AI delivery · Structured generation · Clear copyright posture · Enterprise-grade deployment
حتى 2026-04-29، تتصدر Suno v5.5 توليد الموسيقى بالذكاء الاصطناعي من حيث اعتماد المستخدمين بتحرير Studio متعدد المسارات وتصدير MIDI، تليها Udio v1.5 (أقوى تحرير على مستوى الستيم وما بعد الإنتاج) وLyria 3 Pro (Google DeepMind، الأفضل لنشر المؤسسات / API عبر Vertex AI).
07

فهم الرؤية

الرؤية / الفهم متعدد الوسائط

Current leader GPT-4o Vision OpenAI previously: GPT-4o Vision

يحتفظ GPT-4o Vision بأقوى ريادة عامة الأغراض؛ يقود Gemini Vision في فهم الفيديو وتحليل المستندات الطويلة.

#ModelCompanyScoreStrengths
1 GPT-4o VisionStrongest general-purpose vision understanding. OpenAI UI parsing · Chart understanding · Live visual conversation · Multimodal fusion
2 Gemini VisionLeader for video and long-document understanding. Google 1M-token long documents · Leading video understanding · Multi-frame analysis · Search integration
3 Qwen-VLTop open-source Chinese-scenario vision model. Alibaba Optimized for Chinese scenarios · Open-source, commercial use · Multimodal reasoning · Local deployment
حتى 2026-04-29، يتصدر GPT-4o Vision (OpenAI) فهم الرؤية العام الأغراض بأقوى تحليل واجهة مستخدم ومحادثة بصرية فورية، يليه Gemini Vision (Google، الرائد في فهم الفيديو والمستندات الطويلة بـ 1M-token) وQwen-VL (علي بابا، أقوى نموذج مفتوح المصدر للسيناريوهات الصينية).
08

المصادر المفتوحة

مفتوح المصدر / أوزان مفتوحة

Current leader Llama 4 Meta previously: Llama 3

تقترب النماذج مفتوحة المصدر بسرعة من النماذج المغلقة في عدة معايير. Llama 4، DeepSeek V4، وQwen3 يشكلون الفئة الأولى.

#ModelCompanyScoreStrengths
1 Llama 4Most complete open-source ecosystem. Meta Multimodal support · Largest community ecosystem · Commercial-use license · Multiple sizes
2 DeepSeek V4Strongest open-source reasoning, upgraded architecture. DeepSeek Superior math and reasoning · Best-in-class coding ability · Efficient MoE architecture · Extremely low API price
3 Qwen3Top open-source Chinese model. Alibaba Strongest Chinese understanding · Multimodal support · Agent capability · Full size coverage
حتى 2026-04-29، يتصدر Llama 4 (Meta) النماذج مفتوحة المصدر من حيث النظام البيئي بدعم متعدد الوسائط وترخيص تجاري ودود، يليه DeepSeek V4 (DeepSeek، أقوى استدلال مفتوح المصدر مع بنية MoE وأقل سعر API) وQwen3 (علي بابا، النموذج الرائد مفتوح المصدر للغة الصينية وقدرات الوكيل).

This month's trends

Sources & methodology

Data as of 2026-04-29

Monthly archive