存档 · 2026-08-09 更新

LLM 排行榜存档 — 2026-08

2026-08 期 LLM 排行榜存档:九大类目当期领先模型与完整排名。

01

文本生成与综合推理

Text Generation & Reasoning

本月榜首 Claude Opus 5 Anthropic

8 月 9 日抓取 Artificial Analysis:Claude Opus 5 仍居榜首,但整条前沿带分数上移——Opus 5 max 63(7 月刊 61)、Fable 5 with fallback 62、GPT-5.6 Sol max 61、开源 Kimi K3 max 60。Muse Spark 1.2(xhigh)以 57 新进中前排,Grok 4.5 high 为 56。

#模型厂商评分核心优势
1 Claude Opus 5仍居 AA Intelligence Index 榜首——现为 63(max),高于 7 月刊的 61。 Anthropic 63 Intelligence Index:63(max) · SWE-bench Verified 约 96% · $5 / $25 每百万 tokens · 1M 上下文 · 发布日期 2026-07-24
2 Claude Fable 5AA 将 Fable 5(with fallback)报在 62——8 月分数重估后总榜第 2。 Anthropic 62 Intelligence Index:62(with fallback) · Mythos-class 安全防护 · 1M+ 上下文 · 自适应推理 · 发布日期 2026-06-09
3 GPT-5.6 SolSol max 在 AA 升至 61;仍是 OpenAI 旗舰档。 OpenAI 61 Intelligence Index:61(max) · Terminal-Bench 2.1:88.8% · $5 / $30 每百万 tokens · 1M 上下文 · 2026-07-09 全面开放
4 Kimi K3开源 K3 max 达到 60——全球第 4,距 Opus 5 仅 3 分。 Moonshot AI 60 Intelligence Index:60(开源第 1) · 2.8T MoE · 1M 上下文 · LMArena WebDev 第 1(7 月) · 开放权重 · $3/$15 每百万 · 发布日期 2026-07-17
5 Muse Spark 1.2新进中前排,AA Index 57(xhigh)——改写了 7 月 top-5 结构。 Muse 57 Intelligence Index:57(xhigh) · 相对 7 月 top 档为新面孔 · 闭源竞争者
6 Grok 4.5AA high 模式 56 分;仍是 $2/$6 的便宜常驻推理之选。 xAI 56 Intelligence Index:56(high) · 激进定价:$2 / $6 每百万 · 常驻推理 · 1M 上下文 · 发布日期 2026-07-08

AA Intelligence Index 前四相对 7 月刊普遍 +2~3 分。Muse Spark 1.2 新进中前排;DeepSeek V4 Flash 0731 报 52 分。

默认前沿主力仍是 Opus 5($5/$25);Mythos-class 天花板是 Fable 5;OpenAI 分层回应是 Sol;开源进前沿带仍是 Kimi K3。

截至 2026-08-09,Claude Opus 5(Anthropic)以 Intelligence Index 63(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(62)、GPT-5.6 Sol(OpenAI,61)与开源模型 Kimi K3(Moonshot AI,60)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens。
02

图像生成

Image Generation

本月榜首 GPT Image 2 OpenAI

GPT Image 2(high)把 Artificial Analysis 文生图 Arena 领先扩大到 ELO 1357(7 月刊 1338)。Reve 2.1 以 1314 居第 2。Google Nano Banana 2(Gemini 3.1 Flash Image Preview)以 1307 杀进前 3。Seedream 5.0 Pro 报 1266。

#模型厂商评分核心优势
1 GPT Image 2AA 文生图 Arena ELO 1357(high)——质量与生态双冠继续扩大。 OpenAI 1357 AA 文生图 Arena ELO:1357(第 1) · 按 token 计费 · Batch API 50% 折扣 · 高保真输入
2 Reve 2.1以 ELO 1314 稳居第 2,分层生成。 Reve 1314 AA 文生图 Arena ELO:1314(第 2) · 分层生成 · $24 / 千图 · 首发即一线质量
3 Nano Banana 2Gemini 3.1 Flash Image Preview 品牌——以 1307 新进 AA 前 3。 Google 1307 AA 文生图 Arena ELO:1307(第 3) · Gemini 3.1 Flash Image Preview · Google 全家桶集成
4 MAI-Image-2.5企业图像默认选项,ELO 1298。 Microsoft 1298 AA 文生图 Arena ELO:1298 · 企业集成 · 微软栈
5 Seedream 5.0 Pro中国生产向首选,ELO 1266,文字渲染强。 ByteDance 1266 AA 文生图 Arena ELO:1266 · 图层分离 · 文字渲染强

GPT Image 2 high 1338→1357;Nano Banana 2 新进前 3;Seedream 5.0 Pro 仍是前排中国生产选项。

质量+生态选 GPT Image 2;分层生成性价比选 Reve 2.1;Google 预览栈选 Nano Banana 2;中文排版选 Seedream 5.0 Pro。

截至 2026-08-09,GPT Image 2(OpenAI,high)以 ELO 1357 居 Artificial Analysis 文生图 Arena 榜首,领先 Reve 2.1(1314)与 Nano Banana 2 / Gemini 3.1 Flash Image Preview(Google,1307)。Seedream 5.0 Pro(字节跳动)为 1266。
03

视频生成

Video Generation

本月榜首 Gemini Omni Flash Google

Gemini Omni Flash 以 ELO 1244(7 月 1240)继续拿下 AA 文生视频(含音频)榜首。MiniMax H3 以 1240 冲到第 2。Dreamina Seedance 2.0 720p 第 3(1224);Wan2.7-260612 与 HappyHorse-1.1 进入前 5。Sora API 关停日仍为 2026-09-24。

#模型厂商评分核心优势
1 Gemini Omni FlashAA 含音频视频榜 #1,ELO 1244——音画同步王冠仍在。 Google 1244 AA 含音频视频榜 #1 · ELO 1244 · 无音频榜亦 #1 · ELO 1324 · 原生音画同步 · Gemini Omni 全家桶
2 MiniMax H3AA 含音频视频榜新第 2,ELO 1240——8 月视频最大变量。 MiniMax 1240 AA 含音频视频榜 #2 · ELO 1240 · 无音频榜 #2 · ELO 1306 · 相对 7 月场次快速攀升
3 Seedance 2.0Dreamina Seedance 2.0 720p ELO 1224——仍是字节生产主力。 ByteDance 1224 AA 含音频视频榜 #3 · ELO 1224 · 生产线成熟 · 多模态参考
4 Wan2.7-260612阿里 Wan2.7-260612 含音频榜 ELO 1161。 Alibaba 1161 AA 含音频视频榜 ELO:1161 · 阿里云原生
5 Kling 3.0 Pro仍是亚太短视频性价比线;顶端名次战在 H3/Seedance 之间。 Kuaishou 快手 1110 原生 4K/60fps 线 · Turbo 迭代速度 · 原生抖音 / TikTok 风格

含音频榜:Gemini Omni Flash 1240→1244;MiniMax H3 从 Seedance 手中夺走第 2;Seedance 2.0 仍居第 3。

音画同步竞技场选 Gemini Omni Flash;强势挑战者选 MiniMax H3;字节生产线选 Seedance 2.0。

截至 2026-08-09,Gemini Omni Flash(Google)以 ELO 1244 领跑 Artificial Analysis 文生视频(含音频),领先 MiniMax H3(1240)与 Dreamina Seedance 2.0 720p(字节跳动,1224)。OpenAI Sora API 仍计划于 2026-09-24 停服。
04

代码生成与 Agentic Coding

Code Generation & Agentic Coding

本月榜首 Claude Opus 5 Anthropic

Claude Opus 5 仍以 7 月 SWE-bench Verified 高水位(约 96%)领跑 agentic coding。Kimi K3 守住开源 / LMArena WebDev 人气榜(1679)。GPT-5.6 Sol 仍以 88.8% 领跑 Terminal-Bench 2.1。8 月 9 日核查未发现更干净的公开数字超越 Opus 5。

#模型厂商评分核心优势
1 Claude Opus 5SWE-bench Verified 约 96% 高水位仍在;AA Index 现为 63。 Anthropic 96 SWE-bench Verified:约 96%(第 1) · AA Intelligence Index:63 · $5 / $25 每百万 tokens · 长程 agentic 编辑
2 Kimi K3开源 WebDev 竞技场王者 1679;AA Index 60。 Moonshot AI 1679 LMArena WebDev:1679(第 1) · AA Intelligence Index:60 · 开放权重 · 2.8T MoE · $3 / $15 每百万 tokens
3 Claude Fable 5Mythos-class 编码天花板;AA 总榜 62。 Anthropic 95 SWE-bench Verified:95% · Mythos-class agentic coding · 1M+ 上下文
4 GPT-5.6 Sol沙盒终端 Agent 最强——Terminal-Bench 2.1 88.8%。 OpenAI 88.8 Terminal-Bench 2.1:88.8%(第 1) · SWE-bench Pro:64.6% · 内置沙盒 Shell

王座未易主:Opus 5 仍是 SWE-bench 领先;Kimi K3 仍是 WebDev 第 1;AA 总榜 Opus/Kimi 现为 63/60。

最难重构选 Opus 5;开源前端与部署选 Kimi K3;Mythos 天花板选 Fable 5;沙盒终端 Agent 选 GPT-5.6 Sol。

截至 2026-08-09,Claude Opus 5(Anthropic)仍以 7 月 24 日发布测得的 SWE-bench Verified 约 96% 领跑 agentic coding。Kimi K3(Moonshot AI)以 ELO 1679 守住 LMArena WebDev;GPT-5.6 Sol 以 88.8% 领跑 Terminal-Bench 2.1。
05

语音 / 音频

Voice / Speech

本月榜首 Realtime 2 OpenAI

speech-to-speech 王位未变——OpenAI Realtime 2 仍领跑 agentic 语音。AA TTS 上 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 继续第 1(7 月 1234,王冠未易主,分数微漂)。Speechify Simba 3.2 第 2(1227),Gemini 3.1 Flash TTS 第 3(1210)。

#模型厂商评分核心优势
1 Realtime 2仍是 agentic 语音默认——可配置推理 speech-to-speech。 OpenAI 可配置推理 · speech-to-speech agent · 流式翻译 + STT 变体 · 发布日期 2026-05-07
2 Qwen-Audio-3.0-TTS-PlusAA TTS 第 1,ELO 1229——组件级 TTS 王冠仍在中国厂商。 Alibaba 1229 AA TTS ELO:1229(第 1) · 多语言 + 中日韩强势 · 阿里云原生
3 Simba 3.2AA TTS 第 2,ELO 1227——紧咬 Qwen。 Speechify 1227 AA TTS ELO:1227(第 2) · 消费级朗读音质
4 ElevenLabs v3仍是角色声音克隆默认;Scribe v2 realtime STT 仍在栈内。 ElevenLabs 角色声音克隆 SOTA · Scribe v2 realtime STT · Music v2 API · 100+ 语言

TTS 冠军仍是 Qwen-Audio-3.0-TTS-Plus;Elo 1234→1229。Agentic S2S 仍是 Realtime 2。

agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;角色克隆选 ElevenLabs v3。

截至 2026-08-09,OpenAI Realtime 2 仍是 agentic 语音 speech-to-speech 领先模型。阿里 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 居 Artificial Analysis TTS 榜首,领先 Speechify Simba 3.2(1227)与 Gemini 3.1 Flash TTS(1210)。
06

音乐生成

Music Generation

本月榜首 Suno v5.5 Suno

截至 8 月 9 日核查,Suno v6 仍未发布。Suno v5.5 仍是整曲默认。ElevenLabs Music v2(6 月 15 日起 API)与 Udio v3 分轨仍是录音棚向备选;Lyria 仍走 Gemini Omni 跨模态路径。

#模型厂商评分核心优势
1 Suno v5.5仍是 Suno 最新已发布版本——整曲连贯与歌词韵律最佳。 Suno 整曲连贯 SOTA · 歌词韵律最佳 · 多语言演唱 · 风格迁移
2 Udio v3录音棚级混音,分轨输出。 Udio 分轨输出 · 录音棚级混音 · 电子曲风强势 · DAW 友好
3 ElevenLabs Music v2自 6 月 15 日起的 API 优先授权曲库音乐生成。 ElevenLabs API 优先的音乐生成 · 授权曲库 · Music Finetunes API · 与语音栈集成

王座未变。Suno v6 仍未官宣/上线。

整曲选 Suno v5.5;分轨棚用选 Udio v3;授权 API 音乐选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。

截至 2026-08-09,Suno v5.5 仍是领先的音乐生成模型——Suno v6 仍未发布。ElevenLabs Music v2 继续提供 API(自 2026-06-15);Udio v3 在分轨棚用工作流上保持领先。
07

视觉 / 多模态理解

Vision / Multimodal Understanding

本月榜首 Claude Fable 5 Anthropic

Claude Fable 5 仍以 7 月重算的 LMArena Vision ELO 1327 居首——8 月 9 日未确认到更高的公开 Vision 数字。AA 总智能 Opus 5 为 63、Fable 5 为 62,多模态理解仍偏 Anthropic。Gemini 3.6 Flash(Index 52)是 Google 快速多模态选项。

#模型厂商评分核心优势
1 Claude Fable 5LMArena Vision 第 1(1327);AA 总榜 62。 Anthropic 1327 LMArena Vision ELO:1327(第 1) · AA Intelligence Index:62 · OCR + 文档理解 SOTA · 1M+ 上下文
2 Claude Opus 5多模态旗舰,AA 总榜第 1(63)。 Anthropic 63 AA Intelligence Index:63(总榜第 1) · 文档问答 + 图表 · $5 / $25 每百万 tokens
3 GPT-5.6 Sol图像支撑推理,AA Index 61。 OpenAI 61 AA Intelligence Index:61 · 图像支撑推理 · 1M 上下文
4 Gemini 3.6 FlashAA 总榜新报 52——Google 快速多模态栈之选。 Google 52 AA Intelligence Index:52 · AA 上输出速度快 · Gemini 多模态栈

Vision 王冠未变(Fable 5 @ 1327)。Gemini 3.6 Flash 出现在 AA 总榜 52 分。

OCR/文档/图表选 Anthropic;图像支撑推理选 GPT-5.6 Sol;视频理解选 Gemini 线。

截至 2026-08-09,Claude Fable 5(Anthropic)仍以 ELO 1327 居 LMArena Vision 榜首;Claude Opus 5(AA Index 63)与 GPT-5.6 Sol(AA Index 61)在总智能上紧随。Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index 上为 52。
08

开源 / 开放权重

Open-Source / Open-Weights

本月榜首 Kimi K3 Moonshot AI

Kimi K3 max 达到 AA Intelligence Index 60——仍是开源第 1、全球第 4,距 Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 在不调价($0.14/$0.28)情况下升至 52。GLM-5.2 max 约 53;MiniMax-M3 为 45。

#模型厂商评分核心优势
1 Kimi K3开源第 1,AA Index 60——全球第 4,距 Opus 5 仅 3 分。 Moonshot AI 60 AA Intelligence Index:60(开源第 1) · 2.8T MoE · 1M 上下文 · LMArena WebDev 第 1 · $3 / $15 每百万 tokens
2 DeepSeek V4 Flash 07310731 刷新至 Index 52,价格仍 $0.14/$0.28——开源性价比之王。 DeepSeek 52 AA Intelligence Index:52 · $0.14 入 / $0.28 出 每百万 · MIT 开放权重 · 1M 上下文
3 GLM-5.2AA max 约 53——强势开源中文备选。 Zhipu AI 53 AA Intelligence Index:约 53(max) · 已开放按量 API
4 Gemma 4 12BApache 2.0 端侧多模态默认。 Google Apache 2.0 · 开放权重 · 256K 上下文 · 原生多模态 · 16GB 显存可跑

Kimi K3 57→60;DeepSeek V4 Flash 0731 47→52;开源王冠未易主。

前沿开源部署选 Kimi K3;纯性价比选 DeepSeek V4 Flash 0731;端侧多模态选 Gemma 4 12B。

截至 2026-08-09,Kimi K3(Moonshot AI)以 Artificial Analysis Intelligence Index 60 居开源权重模型榜首——全球第 4,距闭源前沿 Claude Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 为 52 分,定价 $0.14/$0.28 每百万 tokens。
09

性价比 / 价格性能比

每美元智能

本月榜首 DeepSeek V4 Flash 0731 DeepSeek 上期: DeepSeek V4 Flash

DeepSeek V4 Flash 0731 成为新的性价比头条:Intelligence Index 52,价格仍是让 Flash 在 7 月以 47 分称王的 $0.14/$0.28。MiniMax-M3 仍是 Index 45 的便宜高编码档。Kimi K3 有 Index 60 但 $3/$15——偏质量而非纯每美元智能。

#模型厂商评分核心优势
1 DeepSeek V4 Flash 0731Index 52、$0.14/$0.28——0731 刷新后仍是每美元智能之王。 DeepSeek 52 AA Intelligence Index:52 · $0.14 入 / $0.28 出 每百万 · 混合成本仍约旗舰 1/10 · MIT 开放权重 · 1M 上下文
2 MiniMax-M3AA Index 45——便宜高编码性价比档。 MiniMax 45 AA Intelligence Index:45 · 编码每美元强 · 标准 API 价位档
3 GLM-5.2绝对价格高于 Flash,指数更高(max 约 53)。 Zhipu AI 53 AA Intelligence Index:约 53(max) · 按量 API
4 Kimi K3不是最便宜——但是 $3/$15 下最好的开源质量(Index 60)。 Moonshot AI 60 AA Intelligence Index:60 · $3 / $15 每百万 tokens · 开源接近前沿

领导者名称更新为 V4 Flash 0731;Index 47→52 且价格不变。MiniMax-M3 仍是 7 月叙事中的 SWE-bench 性价比选项。

超大批量低成本选 V4 Flash 0731;预算内更强开源推理选 GLM / K 系次旗舰;能接受 $15 输出则 Kimi K3 接近前沿。

截至 2026-08-09,DeepSeek V4 Flash 0731 以 Artificial Analysis Intelligence Index 52、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——价格未变,指数相对 7 月刊的 47 上升。

本月趋势洞察

数据来源与方法

数据截至 2026-08-09

月度存档