存档 · 2026-06-10 更新

LLM 排行榜存档 — 2026-06

2026-06 期 LLM 排行榜存档:九大类目当期领先模型与完整排名。

01

文本生成与综合推理

文本生成与推理

本月榜首 Claude Fable 5 Anthropic 上期: Claude Opus 4.8

6 月 9 日 Anthropic 发布 Claude Fable 5——首个面向公众的 Mythos-class 模型,一上线即以 65 分登顶 Artificial Analysis Intelligence Index v4.0,领先 Opus 4.8 四分。推理前沿如今整段被 Anthropic 占据。

#模型厂商评分核心优势
1 Claude Fable 56 月 9 日发布。首个公开的 Mythos-class 模型——以 65 分登顶 AA Intelligence Index v4.0,Humanity's Last Exam 得 53%(领先 7 分以上)。 Anthropic 65 Intelligence Index v4.0:65(第 1) · Humanity's Last Exam:53% · AA-Omniscience 创历史最高分 · 1M+ 上下文 · 自适应推理 · 发布日期 2026-06-09
2 Claude Opus 4.85 月 28 日发布。自适应推理 + 最大努力模式;现居 AA Intelligence Index v4.0 第 2,仅次于 Fable 5。 Anthropic 61.4 Intelligence Index v4.0:61.4 分 · 自适应推理(Adaptive Reasoning) · 编码与 agentic 任务相比 4.7 全面升级 · 长任务一致性 · 发布日期 2026-05-28
3 GPT-5.54 月 24 日发布。1M token 上下文,原生支持 MCP + Skills + 计算机操作 + 托管 Shell。 OpenAI 60.2 Intelligence Index v4.0(xhigh):60.2 分 · 1M token 上下文 · 原生 MCP + Skills · 内置 computer use · 工具搜索 + Web 搜索 · 发布日期 2026-04-24
4 Gemini 3.1 Pro强势 agentic 前沿,配套 Antigravity 2.0 平台。 Google 57 Intelligence Index v4.0:57 分 · 与 Antigravity 2.0 agentic 平台原生集成 · 并列 GPT-5.5 medium 与 Qwen3.7 Max
5 Grok 4.34 月 30 日发布。AA Intelligence Index 53,常驻推理、1M 上下文、激进定价——前沿四强里最便宜的一个。 xAI 53 Intelligence Index v4.0:53 · 常驻推理 · 1M 上下文 · 输入/输出较 Grok 4.20 便宜约 40%/60% · agentic 与工具调用强

2026 年 6 月 9 日发布。AA Intelligence Index v4.0:65(自适应推理,最大模式)——领先 Opus 4.8(61.4)与 GPT-5.5 xhigh(60.2)四分;Gemini 3.1 Pro(57)与 Grok 4.3(53)紧随其后。

Fable 5 属于 Opus 之上的 Mythos-class 梯队,附带额外安全限制;Opus 4.8 仍是高并发、成本敏感场景的默认主力。

截至 2026-06-10,Claude Fable 5(Anthropic,2026-06-09 发布)以 Intelligence Index v4.0 综合得分 65(自适应推理最大模式)领衔 Artificial Analysis 总榜,超过 Claude Opus 4.8(61.4)、GPT-5.5 xhigh(OpenAI,60.2)、Gemini 3.1 Pro(Google,57)与 Grok 4.3(xAI,53)。Fable 5 是首个公开发布的 Mythos-class 模型,Humanity's Last Exam 得 53%——领先次席 7 分以上。
02

图像生成

图像生成

本月榜首 GPT Image 2 OpenAI 上期: GPT Image-2

OpenAI 推出 GPT Image 2,token 计费 + Batch API 五折。Recraft V4.1 占据 Artificial Analysis 图像质量榜首,Adobe Firefly 仍是企业版权安全的默认选择。

#模型厂商评分核心优势
1 GPT Image 24 月 21 日发布。SOTA 质量 + token 计费 + Batch API 半价。 OpenAI None 按 token 计费 · Batch API 50% 折扣 · 灵活尺寸 · 高保真输入 · 发布日期 2026-04-21
2 Recraft V4.1在 Artificial Analysis 文生图竞技场质量第一。 Recraft None AA 文生图质量榜首 · 强势 control / 风格迁移 · 设计师级输出
3 Adobe Firefly Image 4完全使用授权数据训练;商用版权安全的企业级首选。 Adobe None 训练数据全部授权 · 企业商用赔付保障 · 原生集成 Creative Cloud

2026 年 4 月 21 日发布。token 计费,Batch API 50% 折扣。

Recraft V4.1 在 AA 文生图竞技场上质量第一;GPT Image 2 在生态和定价透明度上胜出。

截至 2026-06-10,GPT Image 2(OpenAI,2026-04-21 发布)是部署量最大的基础图像模型,采用 token 计费,Batch API 五折。Recraft V4.1 占据 Artificial Analysis 文生图质量榜首;Adobe Firefly 仍是企业版权安全的默认选择。
03

视频生成

视频生成

本月榜首 Seedance 2.0 ByteDance 上期: Veo 3.5

Seedance 2.0(字节跳动)登顶 Artificial Analysis 文生视频 Arena(含音频)ELO 1215——首个让音画联合生成达到 SOTA 的模型。Google Veo 3.5 领跑无声电影级画质;Kling 4 守住性价比一端。OpenAI Sora 应用已于 2026-04-26 停服,退出榜单。

#模型厂商评分核心优势
1 Seedance 2.0登顶 Artificial Analysis 文生视频 Arena(含音频)ELO 1215——领先 Veo。原生音画联合生成:从文/图/音/视频输入产出 15 秒多镜头、音画同步片段。 ByteDance 1215 AA 含音频视频榜 #1 · ELO 1215 · 15 秒多镜头 · 音画同步 · 多模态输入(文/图/音/视频) · 双分支扩散 Transformer
2 Veo 3.5电影级输出,时序连贯最佳。 Google None 1080p 输出 · 物理仿真稳定 · 长镜头时序连贯 · 原生 Gemini API 集成
3 Kling 4亚太短视频广告创意一家独大;行业最快迭代节奏。 Kuaishou 快手 None 原生 9:16 竖屏 · 最快编辑迭代 · 原生抖音 / TikTok 风格 · 低延迟生成

Seedance 2.0 稳居含音频文生视频 Arena 第 1;Sora 2 因 OpenAI 关停 Sora 应用(2026-04-26)退出榜单。

音画同步与多镜头叙事选 Seedance 2.0;电影级画质选 Veo 3.5;性价比选 Kling 4。

截至 2026-06-10,Seedance 2.0(字节跳动)领跑文生视频,在 Artificial Analysis 文生视频 Arena(含音频)以 ELO 1215 居第 1——领先 Google Veo。它从文/图/音/视频输入产出 15 秒多镜头、原生音画同步片段。Veo 3.5(Google)领跑无声电影级画质,Kling 4(快手)守住性价比梯队;OpenAI Sora 应用已于 2026-04-26 停服,退出榜单。
04

代码生成与 Agentic Coding

代码生成与智能体编码

本月榜首 Claude Fable 5 Anthropic 上期: Claude Opus 4.8

Claude Fable 5 于 6 月 9 日发布,一上线即以 80.3% 登顶 SWE-bench Pro——在同一未污染多语言基准上领先 Opus 4.8(69.2%)约 11 分。Pro 分数显著低于已污染的 Verified 集,所以 80% 才是诚实的新前沿水位。

#模型厂商评分核心优势
1 Claude Fable 5SWE-bench Pro 以 80.3% 居第 1(6 月 9 日发布)——领先全场 11 分。Mythos-class agentic coding,专攻最难的多文件、长程任务。 Anthropic 80.3 SWE-bench Pro:80.3%(第 1) · 领先 Opus 4.8 11 分 · 长程 agentic 编辑 · 1M+ 上下文 · Mythos-class · 发布日期 2026-06-09
2 Claude Opus 4.8SWE-bench Pro 以 69.2% 居第 2(6 月 8 日更新),仅次于 Fable 5。多文件重构、代码审查与长程 agentic 编辑的成本敏感默认选择。 Anthropic 69.2 SWE-bench Pro:69.2%(第 2) · 多文件重构 SOTA · 代码审查最佳 · 支持视觉感知编码
3 GPT-5.3 Codex (xhigh)SWE-bench Pro 第 3(6 月 8 日)。专门化终端代码 Agent;AA Intelligence Index 54。 OpenAI 54 AA Intelligence Index:54 · 内置沙盒 Shell · agentic 循环强势 · Terminal-Bench 最佳
4 Cursor Composer 2.5AA Coding Agent Index 第 3。IDE 原生结对,多文件上下文。 Cursor None AA Coding Agent Index:第 3 名 · IDE 原生上下文 · 多文件编辑 · 原生 diff 工作流

Fable 5 于 6 月 9 日以 80.3% 登顶 SWE-bench Pro;Opus 4.8(69.2%)第 2,GPT-5.3 Codex 第 3。

最难的多文件重构与长程 Agent 选 Fable 5;成本敏感默认选 Opus 4.8;沙盒终端 Agent 选 GPT-5.3 Codex;IDE 原生结对编程选 Cursor Composer 2.5。

截至 2026-06-10,Claude Fable 5(Anthropic,2026-06-09 发布)领跑 agentic coding,在 SWE-bench Pro 榜以 80.3% 居第 1——领先 Claude Opus 4.8(69.2%)与 GPT-5.3 Codex(OpenAI)约 11 分。SWE-bench Pro 使用 1,865 个未污染的多语言任务,分数显著低于仅 Python 的 Verified 集。Cursor Composer 2.5 在 AA Coding Agent Index 上位列 IDE 原生编码 Agent 前列。
05

语音 / 音频

语音 / 语音合成

本月榜首 Realtime 2 OpenAI 上期: ElevenLabs v3

OpenAI 5 月 7 日发布的 Realtime 2 把可配置推理的 speech-to-speech 推上正式版;AA TTS 冠军换成 Fun-Realtime-TTS,STT 冠军是 MAI-Transcribe-1.5。

#模型厂商评分核心优势
1 Realtime 25 月 7 日正式版。可配置推理 speech-to-speech,配套 translate / Whisper 流式变体。 OpenAI None 可配置推理 · speech-to-speech agent · 流式翻译变体 · 流式 STT 变体 · 发布日期 2026-05-07
2 ElevenLabs v3角色声音克隆与有声书制作的行业默认。 ElevenLabs None 角色声音克隆 SOTA · 100+ 语言 · 长篇有声书质量 · 情感控制
3 Fun-Realtime-TTSAA TTS 榜首。 Fun (Alibaba DAMO) None AA TTS 榜首 · 200ms 内延迟 · 多说话人流式 · 中日韩强势

Realtime 2 系列 5 月 7 日上线(gpt-realtime-2 / -translate / -whisper)。

agentic 语音选 Realtime 2;角色声音克隆选 ElevenLabs v3;纯 TTS 质量选 Fun-Realtime-TTS;转录选 MAI-Transcribe-1.5。

截至 2026-06-10,OpenAI Realtime 2(2026-05-07 发布)是 agentic 语音 speech-to-speech 领先模型,支持可配置推理。Fun-Realtime-TTS 居 Artificial Analysis TTS 榜首;MAI-Transcribe-1.5 在 STT 准确率-速度上领先。ElevenLabs v3 在角色声音克隆方面仍占主导。
06

音乐生成

音乐生成

本月榜首 Suno v6 Suno 上期: Suno v5.5

Suno v6 在整曲连贯与歌词韵律上拉开差距;Udio v3 继续推进录音棚级混音;Lyria(Google)已接入 Gemini Omni 走 any-to-music 工作流。

#模型厂商评分核心优势
1 Suno v6预计 6 月底滚动发布。整曲连贯与歌词韵律最佳。 Suno None 整曲连贯 SOTA · 歌词韵律最佳 · 多语言演唱 · 风格迁移
2 Udio v3录音棚级混音,分轨输出。 Udio None 分轨输出 · 录音棚级混音 · 电子曲风强势 · DAW 友好
3 Lyria (via Gemini Omni)已并入 Gemini Omni,支持任意输入到音乐 + 跨模态。 Google None Gemini Omni 原生 · 跨模态生成 · 图/视频 → 音乐工作流

Suno v6 预计 6 月底滚动发布;v5.5 仍为线上默认。

整曲生成选 Suno v6;录音棚级分轨选 Udio v3;跨模态生成(图/视频/音乐)走 Gemini Omni 调 Lyria。

截至 2026-06-10,Suno v6(预计 6 月底滚动发布)在整曲生成与歌词韵律上领先;v5.5 仍是线上默认。Udio v3 在录音棚级混音与分轨输出上领先。Google Lyria 已并入 Gemini Omni,承担跨模态(图/视频/音乐)工作流。
07

视觉 / 多模态理解

视觉 / 多模态理解

本月榜首 Claude Opus 4.7-thinking Anthropic 上期: GPT-4o Vision

Anthropic 用 Opus 4.7-thinking、4.6-thinking、4.7 横扫 LMArena Vision 前 3。Opus 4.8 因刚发布尚未上 Arena ELO,预计 6 月底巩固冠军。

#模型厂商评分核心优势
1 Claude Opus 4.7-thinkingLMArena Vision 居首。OCR + 图表 + 文档理解最佳。 Anthropic 1309 LMArena Vision ELO:1309 · OCR SOTA · 图表理解 · 文档问答
2 GPT-5.5图像支撑的推理链最强;原生 computer-use 视觉管线。 OpenAI None 图像推理链最佳 · Computer use 视觉 · 1M token 多模态 · 发布日期 2026-04-24
3 Gemini 3.1 Pro视频理解与长时序推理最佳。 Google None 视频理解 SOTA · 长时序推理 · 集成 Robotics-ER 1.6 · 200 万 token+ 多模态

LMArena Vision 前 3 全部 Anthropic(1309 / 1303 / 1298 ELO)。

OCR / 文档问答 / 图表理解选 Anthropic;图像支撑的推理链选 GPT-5.5;视频理解选 Gemini 3.1 Pro。

截至 2026-06-10,Claude Opus 4.7-thinking(Anthropic,LMArena Vision ELO 1309)在视觉与多模态理解领域领先,其次为 Opus 4.6-thinking(1303)与 Opus 4.7(1298)—— Anthropic 横扫 Vision Arena 前 3。Opus 4.8 因刚发布暂未上 Arena ELO。GPT-5.5 在图像支撑的推理链上领先;Gemini 3.1 Pro 在视频理解上领先。
08

开源 / 开放权重

开源 / 开放权重

本月榜首 Kimi K2.6 Moonshot AI 上期: Llama 4

Kimi K2.6(Moonshot)以 AA Intelligence Index 54 居开源权重榜首——距前沿闭源仅 7 分。DeepSeek V4 Pro(MIT,52)是开源推理第 2,Google 新发的 Gemma 4 12B(Apache 2.0,2026-06-03)把原生多模态塞进 16GB 笔记本即可运行的体量。开源与闭源的差距是有史以来最窄的一次。

#模型厂商评分核心优势
1 Kimi K2.6AA Intelligence Index 开源权重榜首。距闭源前沿仅 7 分。 Moonshot AI 54 AA Intelligence Index:54 · 开源权重 · 中英双强 · 长上下文保持力
2 DeepSeek V4 ProMIT 开源权重,AA Intelligence Index 52——全榜第 3,开源推理模型第 2(仅次于 Kimi K2.6)。 DeepSeek 52 AA Intelligence Index:52(全榜#3) · MIT 许可 · 开放权重 · MoE 1.6T 总参 / 49B 激活 · 1M tokens 上下文
3 Gemma 4 12B2026-06-03 发布,Apache 2.0 开放权重。encoder-free 原生多模态(文/图/音/视频),256K 上下文,16GB 笔记本即可本地跑——性能逼近上代 27B。 Google Apache 2.0 · 开放权重 · 256K 上下文 · 原生多模态 · 16GB 显存可跑 · MMLU-Pro 77.2 · GPQA-Diamond 78.8
4 Qwen3.7 Plus中文自托管部署的最佳开源选择。 Alibaba 53 AA Intelligence Index:53 · 最佳中文开源 · 工具调用强 · 开放权重

Kimi K2.6(54)登顶开源;DeepSeek V4 Pro(52)第 2;Gemma 4 12B 带来 16GB 笔记本可跑的多模态。

通用开源部署选 Kimi K2.6;想要便宜的前沿级推理选 DeepSeek V4 Pro;端侧多模态选 Gemma 4 12B;中文自托管选 Qwen3.7 Plus。

截至 2026-06-10,Kimi K2.6(Moonshot AI)以 Artificial Analysis Intelligence Index 54 居开源权重模型榜首,距前沿闭源(Claude Opus 4.8,61)仅 7 分。DeepSeek V4 Pro(DeepSeek,MIT 许可)以 Intelligence Index 52(全榜第 3 / 共 89)居开源模型第 2。Google 于 2026-06-03 以 Apache 2.0 发布 Gemma 4 12B——encoder-free 多模态、256K 上下文、16GB 内存即可运行。Qwen3.7 Plus(阿里巴巴,53)撑起中国开源第一梯队。
09

性价比 / 价格性能比

每美元智能

本月榜首 DeepSeek V4 Flash DeepSeek

2026 的性价比之战由中国开源军团主导。DeepSeek V4 Flash 以约 1/10 的价格拿到逼近旗舰的智能(Index 47),混合成本约 $0.06 / 百万 tokens。榜单点明一条警示:「Flash」「mini」标签不等于便宜——Gemini 3.5 Flash 智能分高达 55,但跑完整套 Intelligence Index 的成本高出 20 倍以上。

#模型厂商评分核心优势
1 DeepSeek V4 Flash每美元智能之王。AA Intelligence Index 47,$0.14/$0.28 每百万 tokens——约为同档 Flash 旗舰的十分之一,cache 命中价为 2026 一线模型最低。 DeepSeek 47 AA Intelligence Index:47 · $0.14 输入 / $0.28 输出 每百万 · 混合 ≈ $0.06 / 百万 · MIT 开源权重 · 1M 上下文
2 DeepSeek V4 Pro高智能 + 低价象限的最佳平衡。Intelligence Index 52(全榜前 3),$0.435/$0.87——仅为 GPT-5.5、Claude Opus 等同档旗舰的零头。 DeepSeek 52 AA Intelligence Index:52(全榜#3) · $0.435 输入 / $0.87 输出 每百万 · 全榜智能前 3 · MIT 开源权重
3 Qwen3.7 Plus让性价比之战不被单一厂商垄断。Intelligence Index 53,$0.40 输入——分数高于 V4 Pro;代价是输出更贵、出速更慢。 Alibaba 53 AA Intelligence Index:53 · $0.40 输入 / $1.16 输出 每百万 · 性价比梯队最高分 · 中文与工具调用强

新增类目。DeepSeek V4 Flash 领跑每美元智能;开源模型包揽性价比梯队。

超大批量低成本场景选 DeepSeek V4 Flash;要更强推理又想省钱选 V4 Pro;想避免单一厂商依赖选 Qwen3.7 Plus。

截至 2026-06-10,DeepSeek V4 Flash(DeepSeek)以 Artificial Analysis Intelligence Index 47、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——混合成本约 $0.06 / 百万 tokens,约为同档 Flash 旗舰的十分之一。DeepSeek V4 Pro(Index 52,$0.435/$0.87)与 Qwen3.7 Plus(阿里巴巴,Index 53,$0.40/$1.16)共同组成性价比第一梯队。注意「Flash」「mini」并不代表便宜:Gemini 3.5 Flash 智能 55,但跑一遍 Intelligence Index 的成本高出 20 倍以上。

本月趋势洞察

数据来源与方法

数据截至 2026-06-10

月度存档