7 月 24 日 Anthropic 发布 Claude Opus 5,以 61 分(最大模式)夺回 Artificial Analysis Intelligence Index 榜首——领先自家 Mythos-class 的 Fable 5(60)一分。OpenAI GPT-5.6 Sol 落在 59,Moonshot 的开源 Kimi K3 以 57 分杀进前沿梯队。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Opus 57 月 24 日发布。以 61 分夺回 AA Intelligence Index 榜首——价格只有 Mythos-class 梯队的一半。 | Anthropic | 61 | Intelligence Index:61(max)/ 60(xhigh) · SWE-bench Verified 约 96% · $5 / $25 每百万 tokens · 1M 上下文 · 发布日期 2026-07-24 |
| 2 | Claude Fable 56 月 9 日 Mythos-class 首发;Opus 5 发布后居总榜第 2(60 分)。6 月曾短暂出口管制,6 月 23 日恢复。 | Anthropic | 60 | Intelligence Index:60 · Humanity's Last Exam:53% · Mythos-class 安全防护 · 1M+ 上下文 · 自适应推理 · 发布日期 2026-06-09 |
| 3 | GPT-5.6 Sol6 月 26 日预览,7 月 9 日全面开放。Sol/Terra/Luna 分层家族;Sol max 得分 59,Terminal-Bench 2.1 达 88.8%。 | OpenAI | 59 | Intelligence Index:59(max) · Terminal-Bench 2.1:88.8% · $5 / $30 每百万 tokens · 1M 上下文 · 2026-07-09 全面开放 |
| 4 | Kimi K37 月 17 日发布。2.8T 参数开源权重 MoE——首个进入前沿梯队的开源模型,同时登顶 LMArena WebDev。 | Moonshot AI | 57 | Intelligence Index:57(开源第 1) · 2.8T MoE · 1M 上下文 · LMArena WebDev 第 1 · 开放权重 · 发布日期 2026-07-17 |
| 5 | Grok 4.57 月 8 日发布,$2/$6 每百万 tokens——前沿梯队里最便宜的推理模型。 | xAI | 53 | 激进定价:$2 / $6 每百万 · 常驻推理 · 1M 上下文 · agentic 与工具调用强 · 发布日期 2026-07-08 |
2026 年 7 月 24 日发布。AA Intelligence Index:61(max)/ 60(xhigh),$5/$25 每百万 tokens——约为 Mythos-class 梯队一半价格。
Opus 5 成为前沿默认主力;Fable 5 守住 Mythos-class 天花板;GPT-5.6 Sol 是 OpenAI 的分层回应;Kimi K3 是首个进入前沿梯队的开源模型。
截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 Intelligence Index 61(最大模式)领衔 Artificial Analysis 总榜,超过 Claude Fable 5(60)、GPT-5.6 Sol(OpenAI,59)与开源模型 Kimi K3(Moonshot AI,57)。Opus 5 定价 $5 输入 / $25 输出每百万 tokens——约为 Mythos-class 梯队的一半。
GPT Image 2 现在连 Artificial Analysis 文生图 Arena 质量榜也登顶了(ELO 1338)——质量与生态双冠。Reve 2.1 发布当天空降第 2(ELO 1301),字节 Seedream 5.0 Pro 进前 10,Black Forest 的 FLUX 3 限量发布,成为首个图/视频/音频 omni 模型。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | GPT Image 2登顶 AA 文生图 Arena(ELO 1338),叠加既有生态与定价优势。 | OpenAI | 1338 | AA 文生图 Arena ELO:1338(第 1) · 按 token 计费 · Batch API 50% 折扣 · 高保真输入 · 发布日期 2026-04-21 |
| 2 | Reve 2.17 月 9 日发布。凭借分层生成与 $24/千图的颠覆性定价,发布当天空降 AA 榜第 2。 | Reve | 1301 | AA 文生图 Arena ELO:1301(第 2) · 分层生成 · $24 / 千图 · 首发即一线质量 |
| 3 | Seedream 5.0 Pro7 月 8 日发布。图层分离 + 顶级文字渲染,跻身 AA 榜前 10。 | ByteDance | 1239 | AA 文生图 Arena ELO:1239(前 10) · 图层分离 · 文字渲染强 · $90 / 千图 |
Recraft V4.1 跌出第一梯队;Reve 2.1(7 月 9 日)与 Seedream 5.0 Pro(7 月 8 日)新进榜;FLUX 3(7 月 23 日)限量发布。
质量 + 生态选 GPT Image 2;分层生成、$24/千图选 Reve 2.1;文字渲染选 Seedream 5.0 Pro;企业版权安全仍选 Firefly。
截至 2026-07-27,GPT Image 2(OpenAI)以 ELO 1338 居 Artificial Analysis 文生图 Arena 榜首,领先 Reve 2.1(1301,2026-07-09 发布)与 MAI-Image-2.5(微软,1269),Seedream 5.0 Pro(字节跳动,1239)居前十。Black Forest Labs 于 2026-07-23 限量发布 FLUX 3——覆盖图像、20 秒视频与音频的 omni 模型。
Google Gemini Omni Flash 以 ELO 1240 拿下 Artificial Analysis 文生视频 Arena(含音频),终结 Seedance 2.0 的连冠(1225)。字节的回击已经在路上:Seedance 2.5(7 月 16 日起灰度)带来原生 30 秒 4K/10bit 生成,尚未入榜。OpenAI 正式退场——Sora API 将于 9 月 24 日关停。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Gemini Omni Flash以 ELO 1240 登顶 AA 文生视频 Arena(含音频)——Google 首个拿下音画同步冠军的模型。 | Google | 1240 | AA 含音频视频榜 #1 · ELO 1240 · 原生音画同步 · Gemini Omni 全家桶集成 · API 现成可用 |
| 2 | Seedance 2.0 / 2.52.0 以 ELO 1225 退居第 2;2.5(原生 30 秒、4K/10bit、50 个参考输入)自 7 月 16 日灰度,尚未入榜。 | ByteDance | 1225 | AA 含音频视频榜 ELO:1225(第 2) · 2.5:原生 30 秒 4K/10bit · 多模态输入(文/图/音/视频) · 双分支扩散 Transformer |
| 3 | Kling 3.0 Pro6 月 17 日 Turbo 升级,守住亚太短视频性价比位;3.0 线原生 4K/60fps。 | Kuaishou 快手 | 1110 | AA 含音频视频榜 ELO:1110 · 3.0 Turbo:最快迭代 · 原生 4K/60fps(3.0 线) · 原生抖音 / TikTok 风格 |
Arena 榜首易主:Seedance 2.0 → Gemini Omni Flash(1240 vs 1225);Seedance 2.5 自 7 月 16 日灰度上线;Sora API 9 月 24 日停服。
音画同步竞技场最强选 Gemini Omni Flash;30 秒 4K 生产选 Seedance 2.5;亚太短视频性价比选 Kling 3.0。
截至 2026-07-27,Gemini Omni Flash(Google)领跑文生视频,在 Artificial Analysis 文生视频 Arena(含音频)以 ELO 1240 居第 1,领先 Seedance 2.0(字节跳动,1225)与 Wan 2.7(阿里巴巴,1160)。字节跳动于 2026-07-16 开始灰度 Seedance 2.5,支持原生 30 秒 4K/10bit 输出。OpenAI Sora API 将于 2026-09-24 停止服务。
Claude Opus 5(7 月 24 日)把 SWE-bench Verified 推到约 96%——历史新高;同时 Moonshot 的开源 Kimi K3 以 1679 分杀上 LMArena WebDev 榜首,成为第一个登顶前端代码竞技场的中国模型。代码前沿一分为二:基准榜归 Anthropic,人气榜归 Kimi。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Opus 5发布当天 SWE-bench Verified 约 96%(独立评测最高 97.0%)——代码新前沿。 | Anthropic | 96 | SWE-bench Verified:约 96%(第 1) · $5 / $25 每百万 tokens · 长程 agentic 编辑 · 1M 上下文 · 发布日期 2026-07-24 |
| 2 | Kimi K3以 1679 分登顶 LMArena WebDev——首个居该榜第 1 的中国模型。开放权重,独立评测 SWE-bench Verified 93.4%。 | Moonshot AI | 1679 | LMArena WebDev:1679(第 1) · 开放权重 · 2.8T MoE · SWE-bench Verified:93.4% · $3 / $15 每百万 tokens · 发布日期 2026-07-17 |
| 3 | Claude Fable 5SWE-bench Verified 95%;最难多文件、长程任务的 Mythos-class 天花板。 | Anthropic | 95 | SWE-bench Verified:95% · Mythos-class agentic coding · 1M+ 上下文 · 6 月出口暂停后已恢复 |
| 4 | GPT-5.6 SolTerminal-Bench 2.1 达 88.8%——沙盒终端 Agent 最强;SWE-bench Pro 64.6%。 | OpenAI | 88.8 | Terminal-Bench 2.1:88.8%(第 1) · SWE-bench Pro:64.6% · 内置沙盒 Shell · 2026-07-09 全面开放 |
Opus 5 登顶 SWE-bench Verified(约 96%,7 月 24 日);Kimi K3 登顶 LMArena WebDev(1679,7 月 16 日),领先 Fable 5(1631)与 GPT-5.6 Sol(1618)。
最难重构与长程 Agent 选 Opus 5;Mythos-class 天花板选 Fable 5;前端开发与开源部署选 Kimi K3;沙盒终端 Agent 选 GPT-5.6 Sol。
截至 2026-07-27,Claude Opus 5(Anthropic,2026-07-24 发布)以 SWE-bench Verified 约 96% 领跑 agentic coding,为历史最高分。Kimi K3(Moonshot AI,开放权重)以 ELO 1679 登顶 LMArena WebDev——首个居该榜第 1 的中国模型——领先 Claude Fable 5(1631)与 GPT-5.6 Sol(OpenAI,1618)。GPT-5.6 Sol 同时以 88.8% 领跑 Terminal-Bench 2.1,是沙盒终端 Agent 最强。
speech-to-speech 王位没有变化——OpenAI Realtime 2 仍领跑 agentic 语音。但组件级冠军都换成了中国厂商:阿里 Qwen-Audio-3.0-TTS-Plus 登顶 AA TTS 榜(ELO 1234),Fun-Realtime-ASR-preview 以 1.7% WER 领跑 STT。ElevenLabs 以 Music v2 和 Scribe v2 realtime 回应。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Realtime 2仍是 agentic 语音默认选择。可配置推理 speech-to-speech,配套 translate / Whisper 流式变体。 | OpenAI | — | 可配置推理 · speech-to-speech agent · 流式翻译变体 · 流式 STT 变体 · 发布日期 2026-05-07 |
| 2 | Qwen-Audio-3.0-TTS-Plus以 ELO 1234 登顶 AA TTS 榜——中国厂商首个 TTS 冠军。 | Alibaba | 1234 | AA TTS ELO:1234(第 1) · 2026 年 7 月发布 · 多语言 + 中日韩强势 · 阿里云原生 |
| 3 | ElevenLabs v3AA TTS 滑到第 11,但仍是角色声音克隆默认;新增 Scribe v2 realtime 与 Music v2 API。 | ElevenLabs | — | 角色声音克隆 SOTA · Scribe v2 realtime STT(2.2% WER) · Music v2 API(6 月 15 日) · 100+ 语言 |
TTS 冠军:Fun-Realtime-TTS → Qwen-Audio-3.0-TTS-Plus(1234);STT 冠军:MAI-Transcribe-1.5 → Fun-Realtime-ASR-preview(1.7% WER)。
agentic 语音选 Realtime 2;纯 TTS 质量选 Qwen-Audio-3.0-TTS-Plus;转录选 Fun-Realtime-ASR;角色声音克隆选 ElevenLabs v3。
截至 2026-07-27,OpenAI Realtime 2 仍是 agentic 语音 speech-to-speech 领先模型。阿里 Qwen-Audio-3.0-TTS-Plus 以 ELO 1234 居 Artificial Analysis TTS 榜首,领先 Speechify Simba 3.2(1230)与 Gemini 3.1 Flash TTS(1215)。Fun-Realtime-ASR-preview 以 1.7% WER 领跑语音转文字,领先 ElevenLabs Scribe v2(2.2%)。
更正上月判断:Suno v6 最终没有发布——v5.5 仍是线上默认与类目第一。真正的动作在别处:ElevenLabs Music v2 于 6 月 15 日上线 API,Google Lyria 继续借 Gemini Omni 走跨模态 any-to-music 路线。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Suno v5.5仍是 Suno 最新版本——v6 并未发布。整曲连贯与歌词韵律最佳。 | Suno | — | 整曲连贯 SOTA · 歌词韵律最佳 · 多语言演唱 · 风格迁移 |
| 2 | Udio v3录音棚级混音,分轨输出。 | Udio | — | 分轨输出 · 录音棚级混音 · 电子曲风强势 · DAW 友好 |
| 3 | ElevenLabs Music v26 月 15 日上线 API。基于授权曲库的音乐生成,支持微调。 | ElevenLabs | — | API 优先的音乐生成 · 授权曲库 · Music Finetunes API · 与 ElevenLabs 语音栈集成 |
Suno v6 错过传闻中的 6 月窗口,至今未官宣;v5.5 稳居第 1。ElevenLabs Music v2 经 API 入场。
整曲生成选 Suno v5.5;录音棚级分轨选 Udio v3;授权曲库工作流选 ElevenLabs Music v2;跨模态走 Gemini Omni 调 Lyria。
截至 2026-07-27,Suno v5.5 仍是领先的音乐生成模型——传闻中的 Suno v6 并未发布。ElevenLabs 于 2026-06-15 将 Music v2 上线 API;Udio v3 在录音棚级混音与分轨输出上保持领先。Google Lyria 已并入 Gemini Omni,承担跨模态(图/视频/音乐)工作流。
Fable 5 以 1327 ELO 拿下 LMArena Vision 榜首,终结 Opus 4.7 一代的霸榜。Opus 5 与 GPT-5.6 Sol 在身后约 15 分以内紧咬——视觉榜头部第一次变成真正的三厂竞赛。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Fable 5以 1327 分登顶 LMArena Vision(7 月 12 日按新票仓重算)——同时领跑文本竞技场。 | Anthropic | 1327 | LMArena Vision ELO:1327(第 1) · 文本竞技场同居第 1 · OCR + 文档理解 SOTA · 1M+ 上下文 |
| 2 | Claude Opus 5新多模态旗舰,Vision 榜上距 Fable 5 仅约 15 ELO。 | Anthropic | — | 前沿多模态理解 · 文档问答 + 图表 · $5 / $25 每百万 tokens · 发布日期 2026-07-24 |
| 3 | Gemini 3.1 Pro视频理解与长时序推理最佳。 | Google | — | 视频理解 SOTA · 长时序推理 · 集成 Robotics-ER 1.6 · 200 万 token+ 多模态 |
Vision 第 1 易主:Opus 4.7-thinking(1309)→ Fable 5(1327,7 月 12 日按新票仓重算)。
OCR / 文档问答 / 图表理解选 Anthropic;图像支撑的推理链选 GPT-5.6 Sol;视频理解选 Gemini 3.1 Pro。
截至 2026-07-27,Claude Fable 5(Anthropic)以 ELO 1327 居 LMArena Vision 榜首,Claude Opus 5 与 GPT-5.6 Sol(OpenAI)在约 15 分以内紧随其后。Fable 5 同时占据文本竞技场第 1。Gemini 3.1 Pro(Google)仍是视频理解领先者。
Moonshot 的 Kimi K3(7 月 17 日)成为新的开源之王:2.8T 参数 MoE,AA Intelligence Index 57——全球第 3,首个进入前沿梯队的开源模型,距 Opus 5 仅 4 分,还 outright 登顶 LMArena WebDev。代价是输出定价涨到 $15/百万,接近 K2.6 的 4 倍。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Kimi K3AA Intelligence Index 57 居开源榜首——全球第 3,距闭源前沿仅 4 分。同时登顶 LMArena WebDev。 | Moonshot AI | 57 | AA Intelligence Index:57(开源第 1) · 2.8T MoE · 1M 上下文 · LMArena WebDev 第 1 · $3 / $15 每百万 tokens · 发布日期 2026-07-17 |
| 2 | Kimi K2.6前任开源之王,现在是 K 系的性价比之选:Index 54,输出价仅为 K3 的 1/4。 | Moonshot AI | 54 | AA Intelligence Index:54 · 开源权重 · 输出约 $4 / 百万(K3 为 $15) · 中英双强 |
| 3 | DeepSeek V4 ProMIT 开源权重,AA Intelligence Index 52——便宜的前沿级推理默认。满血 V4 仍只是传闻。 | DeepSeek | 52 | AA Intelligence Index:52 · MIT 许可 · 开放权重 · $0.435 / $0.87 每百万 · 1M tokens 上下文 |
| 4 | Gemma 4 12BApache 2.0 开放权重。encoder-free 原生多模态,256K 上下文,16GB 笔记本即可本地跑。 | Google | — | Apache 2.0 · 开放权重 · 256K 上下文 · 原生多模态 · 16GB 显存可跑 · MMLU-Pro 77.2 · GPQA-Diamond 78.8 |
Kimi K3(57)从 K2.6(54)手中接过开源王座;K2.7 Code(1T/32B MoE)6 月中补强编程线;DeepSeek V4 满血版仍只是传闻。
前沿级开源部署选 Kimi K3;同生态、输出价仅 1/4 选 K2.6;便宜推理选 DeepSeek V4 Pro;端侧多模态选 Gemma 4 12B。
截至 2026-07-27,Kimi K3(Moonshot AI,2026-07-17 发布)以 Artificial Analysis Intelligence Index 57 居开源权重模型榜首——全球第 3,距闭源前沿(Claude Opus 5,61)仅 4 分。该 2.8T 参数 MoE 提供 1M token 上下文,定价 $3/$15 每百万 tokens,并在 LMArena WebDev 排名第 1。Kimi K2.6(54)与 DeepSeek V4 Pro(MIT,52)组成开源第一梯队其余席位;Google Gemma 4 12B(Apache 2.0)仍是端侧多模态首选。
性价比之战进入僵持:DeepSeek 自 4 月起没动过价格,V4 Flash 仍以混合约 $0.06 / 百万 tokens 提供 Intelligence Index 47——同级旗舰的十分之一。两件事值得注意:旧的 deepseek-chat/reasoner 别名 7 月 24 日退役(需迁移到 deepseek-v4-flash/pro);MiniMax M3 上市促销结束,回到 $0.60/$2.40 标准价。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | DeepSeek V4 Flash每美元智能之王,自 4 月未调价。Index 47,$0.14/$0.28 每百万 tokens——约为同档 Flash 旗舰的十分之一。 | DeepSeek | 47 | AA Intelligence Index:47 · $0.14 输入 / $0.28 输出 每百万 · 混合 ≈ $0.06 / 百万 · MIT 开源权重 · 1M 上下文 |
| 2 | DeepSeek V4 Pro高智能 + 低价象限的最佳平衡。Intelligence Index 52,$0.435/$0.87——仅为同档旗舰的零头。 | DeepSeek | 52 | AA Intelligence Index:52 · $0.435 输入 / $0.87 输出 每百万 · 前沿级推理 · MIT 开源权重 |
| 3 | MiniMax M3SWE-bench Verified 80%+ 里最便宜的模型。上市促销结束,现为 $0.60/$2.40 标准价。 | MiniMax | — | SWE-bench Verified:80%+ · $0.60 输入 / $2.40 输出 每百万 · 最便宜的 agentic 可用梯队 · 开放权重 |
头部厂商无调价;DeepSeek 旧别名 7 月 24 日退役;MiniMax M3 促销结束;GLM-5.2 开放按量 API。
超大批量低成本选 V4 Flash;要更强推理又想省钱选 V4 Pro;要最便宜的 SWE-bench 80%+ 选 MiniMax M3;想分散厂商选 Qwen3.7 Plus。
截至 2026-07-27,DeepSeek V4 Flash 以 Artificial Analysis Intelligence Index 47、$0.14 输入 / $0.28 输出(每百万 tokens)领跑性价比——混合成本约 $0.06 / 百万,约为同级旗舰的十分之一。价格自 4 月未变;旧 deepseek-chat 与 deepseek-reasoner 别名于 2026-07-24 退役。MiniMax M3($0.60/$2.40)是 SWE-bench Verified 80% 以上最便宜的模型;GLM-5.2 已开放按量 API($1.40/$4.40)。