存档 · 2026-04-29 更新

LLM 排行榜存档 — 2026-04

2026-04 期 LLM 排行榜存档:九大类目当期领先模型与完整排名。

01

文本生成与综合推理

文本生成与推理

本月榜首 GPT-5.5 OpenAI 上期: GPT-5.4

2026 年进入三巨头并列时代,没有单一绝对霸主,而是按场景选择最优模型。

#模型厂商评分核心优势
1 GPT-5.54 月 23 日发布,首个全量重训基础模型。 OpenAI 89 Terminal-Bench 2.0: 82.7% · OSWorld-Verified: 78.7% · GDPval: 84.9% · ARC-AGI-2: 85.0% · 100 万 token 上下文
2 Claude Opus 4.74 月 16 日发布,长上下文与代码审查最强。 Anthropic 86 SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · 多步推理最稳定 · 代码逻辑审查最细致 · 100 万 token 上下文
3 Gemini 3.1 Pro预览中,数学与算法竞赛最强。 Google ~85 LiveCodeBench Elo: 2887 · 100 万 token 上下文 · 价格最低($2/$12) · 视频理解领先 · 性价比最高

2026 年 4 月 23 日发布,14 项基准 SOTA,综合评分 89。

GPT-5.5 在 Agentic / 终端编码领先;Claude Opus 4.7 在多文件代码重构和审查领先;Gemini 在算法竞赛最强。

截至 2026-04-29,GPT-5.5(OpenAI)以综合评分 89 在文本生成与推理领域领先,亚军为 Claude Opus 4.7(Anthropic,86)和 Gemini 3.1 Pro(Google,约 85)。GPT-5.5 在 Terminal-Bench 2.0(82.7%)和 OSWorld-Verified(78.7%)胜出;Claude Opus 4.7 在 SWE-Bench Pro(64.3%)和 MCP-Atlas(79.1%)胜出;Gemini 3.1 Pro 在 LiveCodeBench Elo(2887)胜出。三者均支持 100 万 token 上下文。
02

文生图

图像生成

本月榜首 GPT Image-2 OpenAI 上期: Nano Banana 2

GPT Image-2 凭借 99.2% 文本渲染准确率夺得霸主地位,Nano Banana 2 仍在实时生成保持优势。

#模型厂商评分核心优势
1 GPT Image-2文本渲染准确率最高。 OpenAI 99.2% 文本渲染准确率 99.2% · 支持中文 / 阿拉伯语 · 空间逻辑与解剖正确性 · 角色一致性 · Thinking Mode 推理引擎
2 Nano Banana 2极速 4K 生成,实时联网搜索。 Google 4-15s Flash 架构极速生成 · 4K 图像 4-15 秒 · 实时联网搜索集成 · 速度最快 · 与 Gemini 生态深度集成
3 Flux Pro开源生态最强。 Black Forest Labs 开源可商用 · 社区生态丰富 · 风格多样性 · 本地部署能力

2026 年 4 月发布,文本渲染与空间逻辑大幅领先。

GPT Image-2 胜在排版精度和物理逻辑,Nano Banana 2 胜在速度和实时性,两者互补。

截至 2026-04-29,GPT Image-2(OpenAI)以 99.2% 文本渲染准确率在文生图领域领先,亚军为 Nano Banana 2(Google,4K 图像 4-15 秒生成)和 Flux Pro(Black Forest Labs,开源生态最完善)。GPT Image-2 在排版精度、角色一致性、空间逻辑胜出;Nano Banana 2 在 Flash 架构速度和实时联网搜索胜出。
03

文生视频

视频生成

本月榜首 Veo 3.1 Google 上期: Sora 2

Sora 2 已退出竞争,当前 Google Veo 3.1 综合实力最强,国产模型 Seedance 2.0 和 Kling 3.0 在特定领域领先。

#模型厂商评分核心优势
1 Veo 3.1原生音频 + 多镜头,综合实力最强。 Google 原生音频生成 · 多镜头叙事 · 物理模拟优秀 · 与 YouTube 生态集成
2 Seedance 2.0多镜头故事板能力最强。 ByteDance 多镜头故事板 · 镜头语言专业 · 国产模型代表 · 抖音生态集成
3 Kling 3.0 Omni电影级画质 + 对口型最强。 Kuaishou 电影级画质 · 对口型最精准 · 快手生态集成 · 中文场景优化

Sora 2 已停用,Veo 3.1 成为综合最强。

Veo 3.1 综合最佳,Seedance 多镜头最强,Kling 电影级 + 对口型最强,Pika 是社交创作者首选。

截至 2026-04-29,Google Veo 3.1 凭借原生音频和多镜头叙事在文生视频领域领先,亚军为 Seedance 2.0(字节跳动,多镜头故事板最强)和 Kling 3.0 Omni(快手,电影级画质 + 对口型最精准)。Sora 2 已停用退出。
04

代码生成

代码生成与智能体编码

本月榜首 GPT-5.5 (Agentic) OpenAI 上期: Claude Opus 4.6

GPT-5.5 在终端 Agent 编码夺回领先,Claude Opus 4.7 在多文件代码重构和工具编排仍有优势。

#模型厂商评分核心优势
1 GPT-5.5Terminal-Bench 2.0 第一,Agentic 编码最强。 OpenAI 82.7% Terminal-Bench 2.0: 82.7% · Expert-SWE: 73.1% · 自主编码判断力 · 相同任务 token 更少
2 Claude Opus 4.7SWE-Bench Pro 第一,多文件重构最强。 Anthropic 64.3% SWE-Bench Pro: 64.3% · MCP-Atlas: 79.1% · 多文件逻辑审查 · 代码漏洞捕获
3 Gemini 3.1 ProLiveCodeBench 第一,算法竞赛最强。 Google 2887 Elo LiveCodeBench Elo: 2887 · 1M 上下文全仓库分析 · 价格最低 · 算法竞赛最优

4 月 23 日 GPT-5.5 发布,Terminal-Bench 2.0 领先 13 个百分点。

GPT-5.5 做终端 Agentic 编码,Claude Opus 4.7 做多文件重构审查,Gemini 做全仓库分析。

截至 2026-04-29,GPT-5.5(OpenAI)以 Terminal-Bench 2.0 82.7% 在代码生成领域领先,亚军为 Claude Opus 4.7(Anthropic,SWE-Bench Pro 64.3%)和 Gemini 3.1 Pro(Google,LiveCodeBench Elo 2887)。终端 Agentic 编码选 GPT-5.5;多文件重构选 Claude Opus 4.7;全仓库分析(100 万 token 上下文)选 Gemini。
05

语音合成

语音 / 语音合成

本月榜首 ElevenLabs v3 ElevenLabs 上期: ElevenLabs v2

ElevenLabs 仍是语音真实感和克隆质量的绝对标杆,Hume AI 在情感语音方面领先。

#模型厂商评分核心优势
1 ElevenLabs v3行业标杆级语音真实感。 ElevenLabs 9.2/10 真实感评分 9.2/10 · 75ms 超低延迟 · 29+ 语言支持 · Professional Clone 质量 · 企业级 API
2 Hume AI Octave情感 AI 语音第一。 Hume AI 9.3/10 情感识别 9.3/10 · 情感回应能力 · 共情交互 · 情绪感知精准
3 GPT-4o Voice实时对话体验最佳。 OpenAI 低延迟实时对话 · 自然语音输出 · 多语言实时翻译 · 与 ChatGPT 深度集成

持续领先,v3 版本 75ms 超低延迟。

ElevenLabs v3 适合专业配音和克隆,Hume 适合情感交互,GPT-4o Voice 适合实时对话。

截至 2026-04-29,ElevenLabs v3 以 9.2/10 真实感评分和 75ms 延迟在语音合成领域领先(支持 29+ 语言),亚军为 Hume AI Octave(情感语音评分最高 9.3/10)和 GPT-4o Voice(实时对话体验最佳)。
06

AI 音乐生成

音乐生成

本月榜首 Suno v5.5 Suno 上期: Suno v5

Suno v5.5 仍是使用最广泛的平台,各工具在快速出歌、后期编辑和企业部署各有优势。

#模型厂商评分核心优势
1 Suno v5.5使用最广泛的 AI 音乐平台。 Suno 最广泛用户基础 · Studio 多轨编辑 · MIDI 导出 · 最快出成品歌曲
2 Udio v1.5后期编辑与分轨控制最强。 Udio 分轨下载 · 混音控制 · 调性调整 · 专业后期编辑
3 Lyria 3 Pro企业 / API 部署最佳。 Google DeepMind Vertex AI 输出 · 结构化生成 · 版权清晰 · 企业级部署

持续迭代,v5.5 Studio 支持多轨编辑和 MIDI 导出。

Suno 最快出歌,Udio 编辑最强,Lyria 企业部署最安全,ElevenMusic / StableAudio 商用版权最清晰。

截至 2026-04-29,Suno v5.5 以最广泛用户基础和多轨 Studio 编辑、MIDI 导出能力在 AI 音乐生成领域领先,亚军为 Udio v1.5(分轨下载、混音控制最强)和 Lyria 3 Pro(Google DeepMind,Vertex AI 企业 / API 部署最佳)。
07

视觉理解

视觉 / 多模态理解

本月榜首 GPT-4o Vision OpenAI 上期: GPT-4o Vision

GPT-4o Vision 保持通用性最强地位,Gemini Vision 在视频理解和长文档解析方面领先。

#模型厂商评分核心优势
1 GPT-4o Vision通用视觉理解最强。 OpenAI UI 界面解析 · 图表理解 · 实时视觉对话 · 多模态融合
2 Gemini Vision视频理解与长文档第一。 Google 百万 token 长文档 · 视频理解领先 · 多帧分析 · 与搜索集成
3 Qwen-VL国产视觉模型第一。 Alibaba 中文场景优化 · 开源可商用 · 多模态推理 · 本地部署

持续领先,UI 解析与实时视觉对话最强。

GPT-4o Vision 通用性最强,Gemini Vision 长视频 / 文档最强,Qwen-VL 是国产开源最佳。

截至 2026-04-29,GPT-4o Vision(OpenAI)以最强 UI 解析和实时视觉对话在视觉理解领域领先,亚军为 Gemini Vision(Google,100 万 token 长文档和视频理解领先)和 Qwen-VL(阿里巴巴,国产开源中文场景最优)。
08

开源模型

开源 / 开放权重

本月榜首 Llama 4 Meta 上期: Llama 3

开源模型快速追赶闭源模型,在部分基准已接近甚至超越。Llama 4、DeepSeek V4、Qwen3 是第一梯队。

#模型厂商评分核心优势
1 Llama 4开源生态最完善。 Meta 多模态支持 · 社区生态最大 · 可商用许可 · 多尺寸选择
2 DeepSeek V4推理与代码能力全面进化的开源旗舰。 DeepSeek 数学与推理能力显著提升 · 代码生成业界最强 · MoE 架构高效 · API 价格极低
3 Qwen3中文开源模型第一。 Alibaba 中文理解最强 · 多模态支持 · Agent 能力 · 全尺寸覆盖

2026 年发布,多模态能力大幅提升。

Llama 4 生态最大,DeepSeek 推理最强且最便宜,Qwen3 中文和 Agent 能力最优。

截至 2026-04-29,Llama 4(Meta)以最完善的开源生态在开源模型领域领先(支持多模态、可商用许可),亚军为 DeepSeek V4(DeepSeek,开源推理最强、MoE 架构、API 价格极低)和 Qwen3(阿里巴巴,国产开源中文与 Agent 能力第一)。

本月趋势洞察

数据来源与方法

数据截至 2026-04-29

月度存档