8 月 9 日抓取 Artificial Analysis:Claude Opus 5 仍居榜首,但整条前沿带分数上移——Opus 5 max 63(7 月刊 61)、Fable 5 with fallback 62、GPT-5.6 Sol max 61、开源 Kimi K3 max 60。Muse Spark 1.2(xhigh)以 57 新进中前排,Grok 4.5 high 为 56。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Opus 5仍居 AA Intelligence Index 榜首——现为 63(max),高于 7 月刊的 61。 | Anthropic | 63 | Intelligence Index:63(max) · SWE-bench Verified 约 96% · $5 / $25 每百万 tokens · 1M 上下文 · 发布日期 2026-07-24 |
| 2 | Claude Fable 5AA 将 Fable 5(with fallback)报在 62——8 月分数重估后总榜第 2。 | Anthropic | 62 | Intelligence Index:62(with fallback) · Mythos-class 安全防护 · 1M+ 上下文 · 自适应推理 · 发布日期 2026-06-09 |
| 3 | GPT-5.6 SolSol max 在 AA 升至 61;仍是 OpenAI 旗舰档。 | OpenAI | 61 | Intelligence Index:61(max) · Terminal-Bench 2.1:88.8% · $5 / $30 每百万 tokens · 1M 上下文 · 2026-07-09 全面开放 |
| 4 | Kimi K3开源 K3 max 达到 60——全球第 4,距 Opus 5 仅 3 分。 | Moonshot AI | 60 | Intelligence Index:60(开源第 1) · 2.8T MoE · 1M 上下文 · LMArena WebDev 第 1(7 月) · 开放权重 · $3/$15 每百万 · 发布日期 2026-07-17 |
| 5 | Muse Spark 1.2新进中前排,AA Index 57(xhigh)——改写了 7 月 top-5 结构。 | Muse | 57 | Intelligence Index:57(xhigh) · 相对 7 月 top 档为新面孔 · 闭源竞争者 |
| 6 | Grok 4.5AA high 模式 56 分;仍是 $2/$6 的便宜常驻推理之选。 | xAI | 56 | Intelligence Index:56(high) · 激进定价:$2 / $6 每百万 · 常驻推理 · 1M 上下文 · 发布日期 2026-07-08 |
AA Intelligence Index 前四相对 7 月刊普遍 +2~3 分。Muse Spark 1.2 新进中前排;DeepSeek V4 Flash 0731 报 52 分。
默认前沿主力仍是 Opus 5($5/$25);Mythos-class 天花板是 Fable 5;OpenAI 分层回应是 Sol;开源进前沿带仍是 Kimi K3。
截至 2026-08-09,Claude Opus 5(Anthropic)以 Intelligence Index 63(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(62)、GPT-5.6 Sol(OpenAI,61)与开源模型 Kimi K3(Moonshot AI,60)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens。
02 本月榜首 GPT Image 2 OpenAI
GPT Image 2(high)把 Artificial Analysis 文生图 Arena 领先扩大到 ELO 1357(7 月刊 1338)。Reve 2.1 以 1314 居第 2。Google Nano Banana 2(Gemini 3.1 Flash Image Preview)以 1307 杀进前 3。Seedream 5.0 Pro 报 1266。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | GPT Image 2AA 文生图 Arena ELO 1357(high)——质量与生态双冠继续扩大。 | OpenAI | 1357 | AA 文生图 Arena ELO:1357(第 1) · 按 token 计费 · Batch API 50% 折扣 · 高保真输入 |
| 2 | Reve 2.1以 ELO 1314 稳居第 2,分层生成。 | Reve | 1314 | AA 文生图 Arena ELO:1314(第 2) · 分层生成 · $24 / 千图 · 首发即一线质量 |
| 3 | Nano Banana 2Gemini 3.1 Flash Image Preview 品牌——以 1307 新进 AA 前 3。 | Google | 1307 | AA 文生图 Arena ELO:1307(第 3) · Gemini 3.1 Flash Image Preview · Google 全家桶集成 |
| 4 | MAI-Image-2.5企业图像默认选项,ELO 1298。 | Microsoft | 1298 | AA 文生图 Arena ELO:1298 · 企业集成 · 微软栈 |
| 5 | Seedream 5.0 Pro中国生产向首选,ELO 1266,文字渲染强。 | ByteDance | 1266 | AA 文生图 Arena ELO:1266 · 图层分离 · 文字渲染强 |
GPT Image 2 high 1338→1357;Nano Banana 2 新进前 3;Seedream 5.0 Pro 仍是前排中国生产选项。
质量+生态选 GPT Image 2;分层生成性价比选 Reve 2.1;Google 预览栈选 Nano Banana 2;中文排版选 Seedream 5.0 Pro。
截至 2026-08-09,GPT Image 2(OpenAI,high)以 ELO 1357 居 Artificial Analysis 文生图 Arena 榜首,领先 Reve 2.1(1314)与 Nano Banana 2 / Gemini 3.1 Flash Image Preview(Google,1307)。Seedream 5.0 Pro(字节跳动)为 1266。
Gemini Omni Flash 以 ELO 1244(7 月 1240)继续拿下 AA 文生视频(含音频)榜首。MiniMax H3 以 1240 冲到第 2。Dreamina Seedance 2.0 720p 第 3(1224);Wan2.7-260612 与 HappyHorse-1.1 进入前 5。Sora API 关停日仍为 2026-09-24。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Gemini Omni FlashAA 含音频视频榜 #1,ELO 1244——音画同步王冠仍在。 | Google | 1244 | AA 含音频视频榜 #1 · ELO 1244 · 无音频榜亦 #1 · ELO 1324 · 原生音画同步 · Gemini Omni 全家桶 |
| 2 | MiniMax H3AA 含音频视频榜新第 2,ELO 1240——8 月视频最大变量。 | MiniMax | 1240 | AA 含音频视频榜 #2 · ELO 1240 · 无音频榜 #2 · ELO 1306 · 相对 7 月场次快速攀升 |
| 3 | Seedance 2.0Dreamina Seedance 2.0 720p ELO 1224——仍是字节生产主力。 | ByteDance | 1224 | AA 含音频视频榜 #3 · ELO 1224 · 生产线成熟 · 多模态参考 |
| 4 | Wan2.7-260612阿里 Wan2.7-260612 含音频榜 ELO 1161。 | Alibaba | 1161 | AA 含音频视频榜 ELO:1161 · 阿里云原生 |
| 5 | Kling 3.0 Pro仍是亚太短视频性价比线;顶端名次战在 H3/Seedance 之间。 | Kuaishou 快手 | 1110 | 原生 4K/60fps 线 · Turbo 迭代速度 · 原生抖音 / TikTok 风格 |
含音频榜:Gemini Omni Flash 1240→1244;MiniMax H3 从 Seedance 手中夺走第 2;Seedance 2.0 仍居第 3。
音画同步竞技场选 Gemini Omni Flash;强势挑战者选 MiniMax H3;字节生产线选 Seedance 2.0。
截至 2026-08-09,Gemini Omni Flash(Google)以 ELO 1244 领跑 Artificial Analysis 文生视频(含音频),领先 MiniMax H3(1240)与 Dreamina Seedance 2.0 720p(字节跳动,1224)。OpenAI Sora API 仍计划于 2026-09-24 停服。
Claude Opus 5 仍以 7 月 SWE-bench Verified 高水位(约 96%)领跑 agentic coding。Kimi K3 守住开源 / LMArena WebDev 人气榜(1679)。GPT-5.6 Sol 仍以 88.8% 领跑 Terminal-Bench 2.1。8 月 9 日核查未发现更干净的公开数字超越 Opus 5。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Opus 5SWE-bench Verified 约 96% 高水位仍在;AA Index 现为 63。 | Anthropic | 96 | SWE-bench Verified:约 96%(第 1) · AA Intelligence Index:63 · $5 / $25 每百万 tokens · 长程 agentic 编辑 |
| 2 | Kimi K3开源 WebDev 竞技场王者 1679;AA Index 60。 | Moonshot AI | 1679 | LMArena WebDev:1679(第 1) · AA Intelligence Index:60 · 开放权重 · 2.8T MoE · $3 / $15 每百万 tokens |
| 3 | Claude Fable 5Mythos-class 编码天花板;AA 总榜 62。 | Anthropic | 95 | SWE-bench Verified:95% · Mythos-class agentic coding · 1M+ 上下文 |
| 4 | GPT-5.6 Sol沙盒终端 Agent 最强——Terminal-Bench 2.1 88.8%。 | OpenAI | 88.8 | Terminal-Bench 2.1:88.8%(第 1) · SWE-bench Pro:64.6% · 内置沙盒 Shell |
王座未易主:Opus 5 仍是 SWE-bench 领先;Kimi K3 仍是 WebDev 第 1;AA 总榜 Opus/Kimi 现为 63/60。
最难重构选 Opus 5;开源前端与部署选 Kimi K3;Mythos 天花板选 Fable 5;沙盒终端 Agent 选 GPT-5.6 Sol。
截至 2026-08-09,Claude Opus 5(Anthropic)仍以 7 月 24 日发布测得的 SWE-bench Verified 约 96% 领跑 agentic coding。Kimi K3(Moonshot AI)以 ELO 1679 守住 LMArena WebDev;GPT-5.6 Sol 以 88.8% 领跑 Terminal-Bench 2.1。
05 本月榜首 Realtime 2 OpenAI
speech-to-speech 王位未变——OpenAI Realtime 2 仍领跑 agentic 语音。AA TTS 上 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 继续第 1(7 月 1234,王冠未易主,分数微漂)。Speechify Simba 3.2 第 2(1227),Gemini 3.1 Flash TTS 第 3(1210)。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Realtime 2仍是 agentic 语音默认——可配置推理 speech-to-speech。 | OpenAI | — | 可配置推理 · speech-to-speech agent · 流式翻译 + STT 变体 · 发布日期 2026-05-07 |
| 2 | Qwen-Audio-3.0-TTS-PlusAA TTS 第 1,ELO 1229——组件级 TTS 王冠仍在中国厂商。 | Alibaba | 1229 | AA TTS ELO:1229(第 1) · 多语言 + 中日韩强势 · 阿里云原生 |
| 3 | Simba 3.2AA TTS 第 2,ELO 1227——紧咬 Qwen。 | Speechify | 1227 | AA TTS ELO:1227(第 2) · 消费级朗读音质 |
| 4 | ElevenLabs v3仍是角色声音克隆默认;Scribe v2 realtime STT 仍在栈内。 | ElevenLabs | — | 角色声音克隆 SOTA · Scribe v2 realtime STT · Music v2 API · 100+ 语言 |
TTS 冠军仍是 Qwen-Audio-3.0-TTS-Plus;Elo 1234→1229。Agentic S2S 仍是 Realtime 2。
agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;角色克隆选 ElevenLabs v3。
截至 2026-08-09,OpenAI Realtime 2 仍是 agentic 语音 speech-to-speech 领先模型。阿里 Qwen-Audio-3.0-TTS-Plus 以 ELO 1229 居 Artificial Analysis TTS 榜首,领先 Speechify Simba 3.2(1227)与 Gemini 3.1 Flash TTS(1210)。
截至 8 月 9 日核查,Suno v6 仍未发布。Suno v5.5 仍是整曲默认。ElevenLabs Music v2(6 月 15 日起 API)与 Udio v3 分轨仍是录音棚向备选;Lyria 仍走 Gemini Omni 跨模态路径。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Suno v5.5仍是 Suno 最新已发布版本——整曲连贯与歌词韵律最佳。 | Suno | — | 整曲连贯 SOTA · 歌词韵律最佳 · 多语言演唱 · 风格迁移 |
| 2 | Udio v3录音棚级混音,分轨输出。 | Udio | — | 分轨输出 · 录音棚级混音 · 电子曲风强势 · DAW 友好 |
| 3 | ElevenLabs Music v2自 6 月 15 日起的 API 优先授权曲库音乐生成。 | ElevenLabs | — | API 优先的音乐生成 · 授权曲库 · Music Finetunes API · 与语音栈集成 |
王座未变。Suno v6 仍未官宣/上线。
整曲选 Suno v5.5;分轨棚用选 Udio v3;授权 API 音乐选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。
截至 2026-08-09,Suno v5.5 仍是领先的音乐生成模型——Suno v6 仍未发布。ElevenLabs Music v2 继续提供 API(自 2026-06-15);Udio v3 在分轨棚用工作流上保持领先。
Claude Fable 5 仍以 7 月重算的 LMArena Vision ELO 1327 居首——8 月 9 日未确认到更高的公开 Vision 数字。AA 总智能 Opus 5 为 63、Fable 5 为 62,多模态理解仍偏 Anthropic。Gemini 3.6 Flash(Index 52)是 Google 快速多模态选项。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Fable 5LMArena Vision 第 1(1327);AA 总榜 62。 | Anthropic | 1327 | LMArena Vision ELO:1327(第 1) · AA Intelligence Index:62 · OCR + 文档理解 SOTA · 1M+ 上下文 |
| 2 | Claude Opus 5多模态旗舰,AA 总榜第 1(63)。 | Anthropic | 63 | AA Intelligence Index:63(总榜第 1) · 文档问答 + 图表 · $5 / $25 每百万 tokens |
| 3 | GPT-5.6 Sol图像支撑推理,AA Index 61。 | OpenAI | 61 | AA Intelligence Index:61 · 图像支撑推理 · 1M 上下文 |
| 4 | Gemini 3.6 FlashAA 总榜新报 52——Google 快速多模态栈之选。 | Google | 52 | AA Intelligence Index:52 · AA 上输出速度快 · Gemini 多模态栈 |
Vision 王冠未变(Fable 5 @ 1327)。Gemini 3.6 Flash 出现在 AA 总榜 52 分。
OCR/文档/图表选 Anthropic;图像支撑推理选 GPT-5.6 Sol;视频理解选 Gemini 线。
截至 2026-08-09,Claude Fable 5(Anthropic)仍以 ELO 1327 居 LMArena Vision 榜首;Claude Opus 5(AA Index 63)与 GPT-5.6 Sol(AA Index 61)在总智能上紧随。Gemini 3.6 Flash 在 Artificial Analysis Intelligence Index 上为 52。
Kimi K3 max 达到 AA Intelligence Index 60——仍是开源第 1、全球第 4,距 Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 在不调价($0.14/$0.28)情况下升至 52。GLM-5.2 max 约 53;MiniMax-M3 为 45。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Kimi K3开源第 1,AA Index 60——全球第 4,距 Opus 5 仅 3 分。 | Moonshot AI | 60 | AA Intelligence Index:60(开源第 1) · 2.8T MoE · 1M 上下文 · LMArena WebDev 第 1 · $3 / $15 每百万 tokens |
| 2 | DeepSeek V4 Flash 07310731 刷新至 Index 52,价格仍 $0.14/$0.28——开源性价比之王。 | DeepSeek | 52 | AA Intelligence Index:52 · $0.14 入 / $0.28 出 每百万 · MIT 开放权重 · 1M 上下文 |
| 3 | GLM-5.2AA max 约 53——强势开源中文备选。 | Zhipu AI | 53 | AA Intelligence Index:约 53(max) · 已开放按量 API |
| 4 | Gemma 4 12BApache 2.0 端侧多模态默认。 | Google | — | Apache 2.0 · 开放权重 · 256K 上下文 · 原生多模态 · 16GB 显存可跑 |
Kimi K3 57→60;DeepSeek V4 Flash 0731 47→52;开源王冠未易主。
前沿开源部署选 Kimi K3;纯性价比选 DeepSeek V4 Flash 0731;端侧多模态选 Gemma 4 12B。
截至 2026-08-09,Kimi K3(Moonshot AI)以 Artificial Analysis Intelligence Index 60 居开源权重模型榜首——全球第 4,距闭源前沿 Claude Opus 5(63)仅 3 分。DeepSeek V4 Flash 0731 为 52 分,定价 $0.14/$0.28 每百万 tokens。
DeepSeek V4 Flash 0731 成为新的性价比头条:Intelligence Index 52,价格仍是让 Flash 在 7 月以 47 分称王的 $0.14/$0.28。MiniMax-M3 仍是 Index 45 的便宜高编码档。Kimi K3 有 Index 60 但 $3/$15——偏质量而非纯每美元智能。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | DeepSeek V4 Flash 0731Index 52、$0.14/$0.28——0731 刷新后仍是每美元智能之王。 | DeepSeek | 52 | AA Intelligence Index:52 · $0.14 入 / $0.28 出 每百万 · 混合成本仍约旗舰 1/10 · MIT 开放权重 · 1M 上下文 |
| 2 | MiniMax-M3AA Index 45——便宜高编码性价比档。 | MiniMax | 45 | AA Intelligence Index:45 · 编码每美元强 · 标准 API 价位档 |
| 3 | GLM-5.2绝对价格高于 Flash,指数更高(max 约 53)。 | Zhipu AI | 53 | AA Intelligence Index:约 53(max) · 按量 API |
| 4 | Kimi K3不是最便宜——但是 $3/$15 下最好的开源质量(Index 60)。 | Moonshot AI | 60 | AA Intelligence Index:60 · $3 / $15 每百万 tokens · 开源接近前沿 |
领导者名称更新为 V4 Flash 0731;Index 47→52 且价格不变。MiniMax-M3 仍是 7 月叙事中的 SWE-bench 性价比选项。
超大批量低成本选 V4 Flash 0731;预算内更强开源推理选 GLM / K 系次旗舰;能接受 $15 输出则 Kimi K3 接近前沿。
截至 2026-08-09,DeepSeek V4 Flash 0731 以 Artificial Analysis Intelligence Index 52、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——价格未变,指数相对 7 月刊的 47 上升。