最新的推理能力领导者,展示在逻辑处理和决策制定方面最先进的模型。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Opus 5.5在推理方面领先,得分强劲。 | Anthropic | 58 | 逻辑处理 · 决策制定 |
| 2 | Claude Opus 5.5 (xhigh with fallback)具有回退功能的强劲表现。 | Anthropic | 56 | 回退逻辑 · 稳健推理 |
| 3 | Claude Opus 5.5 (high with fallback)具有回退功能的高推理能力。 | Anthropic | 54 | 高容量 · 回退支持 |
| 4 | Claude Fable 5.1 (max with fallback)最大化推理与回退。 | Anthropic | 53 | 最大化逻辑 · 回退 |
| 5 | Claude Fable 5.1 (xhigh with fallback)X高推理与回退。 | Anthropic | 53 | X高逻辑 · 回退 |
| 6 | GPT-6 Astra (max)最大化推理能力。 | OpenAI | 53 | 最大化推理 · 高级逻辑 |
Claude Opus 5.5 以 58 的智能指数得分取代了 Claude Opus 5 成为领导者。
Anthropic 继续凭借其 Claude Opus 系列在推理类别中占据主导地位。
截至 2026-09-24,Claude Opus 5.5 以 58 分在 169 个排名模型中领先。
在当前 Text to Image Arena 中,GPT Image 2.5 Sunburst (max) 以 Elo 1197 领跑,其后是 GPT Image 2.5 Flare (max)(1191)和 GPT Image 2 (high)(1171)。Sunburst 的样本数为 13,433。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | GPT Image 2.5 Sunburst (max)当前 Text to Image Arena 榜首,Elo 1197。 | OpenAI | 1197 | 样本数 13,433 · API 价格:每 1,000 张图 $210.7 |
| 2 | GPT Image 2.5 Flare (max)当前 Text to Image Arena 排名第 2,Elo 1191。 | OpenAI | 1191 | 稳居榜单前二 |
| 3 | GPT Image 2 (high)当前 Text to Image Arena 排名第 3,Elo 1171。 | OpenAI | 1171 | 进入榜单前三 · API 价格:每 1,000 张图 $211.0 |
| 4 | Grok Imagine Image 2.0当前 Text to Image Arena 排名第 4,Elo 1150。 | xAI | 1150 | API 价格:每 1,000 张图 $60.0 |
| 5 | MAI-Image-2.6当前 Text to Image Arena 排名第 5,Elo 1147。 | Microsoft | 1147 | API 价格:每 1,000 张图 $38.9 |
| 6 | Nano Banana 2 (Gemini 3.1 Flash Image)当前 Text to Image Arena 排名第 6,Elo 1122。 | Google | 1122 | API 价格:每 1,000 张图 $67.0 |
本期榜首已由 8 月刊的 GPT Image 2 / Nano Banana 2 组合更替。
开放权重图像模型方面,Ideogram 4.0 (Quality) 以 1011 领跑,其后是 Ideogram 4.0(1003)和 FLUX.2 [dev](1000)。
截至 2026-09-24,GPT Image 2.5 Sunburst (max) 以 Elo 1197 排名第 1,样本数为 13,433。
Gemini Omni Flash 以 1233 Elo 继续领跑支持音频的文生视频榜单,Wan 3.0 以 1229 紧随其后。在无音频赛道中,榜首则由 Wan 3.0 以 1336 获得。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Gemini Omni Flash继续领跑有音频视频赛道,领先 Wan 3.0 四个 Elo。 | Google | 1233 Elo | 有音频榜单以 1233 Elo 排名第 1 · 无音频榜单以 1330 排名第 2 · 榜单价格为每分钟 $6.00 |
| 2 | Wan 3.0有音频赛道位列第二,同时登顶无音频榜单。 | Alibaba | 1229 Elo | 有音频榜单以 1229 Elo 排名第 2 · 无音频榜单以 1336 排名第 1 · 榜单价格为每分钟 $12.00 |
| 3 | Minimax H3 Max post-trained by fal仅落后第二名 Wan 3.0 两个 Elo,并拥有前五名中最低的榜单价格。 | fal | 1227 Elo | 有音频榜单以 1227 Elo 排名第 3 · 与第二名仅相差 2 Elo · 榜单价格为每分钟 $2.40 |
| 4 | MiniMax H3 Open Weights当前支持音频的视频模型中排名最高的开放权重方案。 | MiniMax | 1220 Elo | 以 1220 Elo 领跑有音频开放权重模型 · 有音频总榜排名第 4 · 榜单价格为每分钟 $7.80 |
| 5 | Dreamina Seedance 2.0 720p跻身竞争密集的前五,与榜首仅相差 23 Elo。 | ByteDance | 1210 Elo | 有音频榜单以 1210 Elo 排名第 5 · 距第一名仅 23 Elo · 榜单价格为每分钟 $9.07 |
本月榜首较 8 月未变,但 Wan 3.0 升至第二;两个 MiniMax H3 版本分别占据第三和第四位。
头部竞争高度胶着:第一名 Gemini Omni Flash 与第五名 Dreamina Seedance 2.0 720p 仅相差 23 Elo。同期前五名的价格差异显著,每分钟从 $2.40 到 $12.00 不等。
截至 2026-09-24,Wan 3.0 在有音频榜单以 1229 Elo 位列第 2,在无音频榜单则以 1336 排名第 1。
Terminal-Bench 2.1 覆盖软件工程、系统管理、数据处理、模型训练与安全任务。此次更新包含 89 项任务,并修正了环境和指令问题;pass@1 按三次重复运行取平均值,评测由 Artificial Analysis 独立执行。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback取得 Terminal-Bench 2.1 当前最高的经验证成绩。 | Anthropic | 91.4% | 以 91.4% pass@1 位列第 1 · 采用 Max Effort 自适应推理配置 · 评测覆盖五类技术与运维任务 |
| 2 | Claude Fable 5.1 Adaptive Reasoning Xhigh with Default Fallback与榜首配置仅相差 0.4 个百分点。 | Anthropic | 91.0% | 以 91.0% pass@1 位列第 2 · 采用 Xhigh 自适应推理配置 · 在 89 项任务的刷新版评测中保持 90% 以上成绩 |
| 3 | Claude Fable 5.1 Adaptive Reasoning High with Default Fallback帮助 Claude Fable 5.1 包揽榜单前三名。 | Anthropic | 89.9% | 以 89.9% pass@1 位列第 3 · 采用 High 自适应推理配置 · 较榜首 Max Effort 配置低 1.5 个百分点 |
Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 取代 8 月榜首 Claude Opus 5。由于 Terminal-Bench 2.1 属于刷新后的评测版本,9 月百分比不宜与上期分数直接比较。
榜单前三均为 Claude Fable 5.1 的不同推理强度配置,成绩集中在 89.9% 至 91.4%。对企业选型而言,推理强度档位已成为与基础模型名称同样重要的评估维度。
截至 2026-09-24,Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 以 91.4% 的 pass@1 成绩位列 Terminal-Bench 2.1 第 1 名。
Cartesia Sonic 3.6 于 2026 年 8 月发布,目前以 1278 Elo 位居 Provider Voice Arena 榜首。Inworld Realtime TTS-2 以 1243 排名第二,SpeechifyAI Simba 3.2 和 Alibaba Qwen-Audio-3.0-TTS-Plus 分别以 1238、1235 紧随其后。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Cartesia Sonic 3.6这款于 2026 年 8 月发布的模型成为 Provider Voice Arena 新榜首。 | Cartesia | 1278 Elo | 以 1278 Elo 排名第一 · API 标价为每 100 万字符 $49.0 |
| 2 | Inworld Realtime TTS-2在本期供应商语音榜单中排名第二。 | Inworld | 1243 Elo | 取得 1243 Elo · API 标价为每 100 万字符 $20.8 |
| 3 | SpeechifyAI Simba 3.2位列第三,与 Realtime TTS-2 相差 5 个 Elo 分。 | SpeechifyAI | 1238 Elo | 取得 1238 Elo · API 标价为每 100 万字符 $6.6 |
| 4 | Alibaba Qwen-Audio-3.0-TTS-PlusAlibaba 的语音模型跻身竞争紧密的第一梯队,位列第四。 | Alibaba | 1235 Elo | 取得 1235 Elo · API 标价为每 100 万字符 $27.6 |
| 5 | VUI Labs Luna TTSLuna TTS 进入 Provider Voice Arena 前五。 | VUI Labs | 1230 Elo | 取得 1230 Elo · API 标价为每 100 万字符 $80.0 |
| 6 | Inworld Realtime TTS-2 Flash凭借标准版与 Flash 版,Inworld 在前六名中占据两个席位。 | Inworld | 1214 Elo | 取得 1214 Elo · API 标价为每 100 万字符 $10.4 |
Cartesia Sonic 3.6 取代 8 月榜首 Realtime 2;在本期榜单中,Inworld Realtime TTS-2 位列第二。
头部六款模型的 API 成本差异明显:SpeechifyAI Simba 3.2 的标价为每 100 万字符 $6.6,Sonic 3.6 为 $49.0,VUI Labs Luna TTS 则为 $80.0。开放权重阵营中,Breeze TTS 2 以 1203 成为排名最高的 TTS 模型。
截至 2026-09-24,Cartesia Sonic 3.6 以 1278 Elo 位列 Provider Voice Arena 第 1 名。
Mureka V9 以 1177 Elo 位居 Instrumental Music Arena 榜首,Suno V5.5 以 1171 排名第二,Mureka V8 以 1143 排名第三。该榜单采用盲选偏好投票,并将器乐与人声模式分开评测。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Mureka V9以 2,237 个样本支撑评测,位居 Instrumental Music Arena 榜首。 | Mureka | 1177 Elo | 在器乐模型盲选偏好排名中取得最高 Elo · 排名领先于 Suno V5.5 |
| 2 | Suno V5.5基于 2,222 个样本取得 1171 Elo,排名第二。 | Suno | 1171 Elo | 盲选偏好得分位列第二 · Suno 有两款模型进入前四,Suno V5.5 排名更高 |
| 3 | Mureka V8以 1143 Elo 位列第三,样本量为 3,130 个。 | Mureka | 1143 Elo | Mureka 第二款进入前三的模型 · 在列出的六款领先模型中样本量最高 |
| 4 | Suno V5基于 2,713 个样本取得 1137 Elo,排名第四。 | Suno | 1137 Elo | 进入该榜单前四 · Suno 第二款跻身前四的模型 |
| 5 | StepAudio 3 Music以 1113 Elo 位列第五,样本量为 2,212 个。 | StepAudio | 1113 Elo | 在器乐盲选偏好投票中进入前五 · 排名领先于 Google Lyria 3 Pro |
| 6 | Google Lyria 3 Pro基于 2,959 个样本取得 1102 Elo,排名第六。 | Google | 1102 Elo | 进入器乐音乐榜单前六 · 评测覆盖 2,959 个样本 |
Mureka V9 取代 8 月榜首 Suno v5.5;Suno V5.5 本期降至第二位。
Mureka 与 Suno 各占前四名中的两个席位。各模型样本量从 StepAudio 3 Music 的 2,212 个到 Mureka V8 的 3,130 个不等;来源页面未提供音乐模型价格。
截至 2026-09-24,Mureka V9 以 1177 Elo 位列 Instrumental Music Arena 第 1 名。
Vision Arena 于 2026 年 9 月 13 日发布的榜单覆盖 152 个模型和 1,314,119 次投票。Claude Fable 5 High 以 1310±8 位居第一,Qwen3.8 Max 以 1302±8 紧随其后,两个 Claude Opus 4.7 配置也进入前四。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | Claude Fable 5 High位居 9 月 Vision Arena 榜首。 | Anthropic | 1310±8 | 在 152 个模型中排名第 1 · 所在榜单累计获得 1,314,119 次投票 |
| 2 | Qwen3.8 Max与榜首相差 8 个 Elo 分。 | Alibaba | 1302±8 | 综合排名第 2 · 每 100 万输入和输出 token 的价格分别为 $2 和 $6 |
| 3 | Claude Opus 4.7 High排名第 3,仅落后 Qwen3.8 Max 1 分。 | Anthropic | 1301±7 | 综合排名第 3 · 得分区间为 1301±7 |
| 4 | Claude Opus 4.7标准配置比 High 配置低 1 分。 | Anthropic | 1300±7 | 综合排名第 4 · 与榜首仅相差 10 分 |
| 5 | Claude Opus 4.6 High帮助 Anthropic 占据前五名中的四席。 | Anthropic | 1299±7 | 综合排名第 5 · 仅落后 Claude Opus 4.7 1 分 |
Claude Fable 5 High 登上榜首,接替 8 月榜单中的 Claude Fable 5。
榜首模型每 100 万输入和输出 token 的价格分别为 $10 和 $50;第二名 Qwen3.8 Max 分别为 $2 和 $6。对于重视部署成本的企业,前两名之间存在明显价差。
截至 2026-09-24,Claude Fable 5 High 以 1310±8 排名第 1;该期 Vision Arena 覆盖 152 个模型和 1,314,119 次投票。
MiMo-V2.6-Pro 以 46 分位列 Artificial Analysis 开放权重模型第一,GLM-5.3 max 以 45 分紧随其后,Kimi K3 max 以 44 分排名第三。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | MiMo-V2.6-Pro当前 Intelligence Index 排名最高的开放权重模型。 | Xiaomi | 46 | Intelligence Index 得分 46 · 开放权重模型排名第一 · 上下文窗口为 1M |
| 2 | GLM-5.3 max位列开放权重模型第二,与榜首相差 1 个指数点。 | Zhipu AI | 45 | Intelligence Index 得分 45 · 开放权重模型排名第二 · GLM-5.3 的上下文窗口为 1M |
| 3 | Kimi K3 max8 月榜首本期位列开放权重模型第三。 | Moonshot AI | 44 | Intelligence Index 得分 44 · 开放权重模型排名第三 · 上下文窗口为 1M |
| 4 | GLM-5.3-FlashGLM-5.3-Flash 位列当前开放权重榜第四。 | Zhipu AI | 42 | Intelligence Index 得分 42 · 开放权重模型排名第四 |
| 5 | Qwen3.8 2.4T A95BQwen3.8 2.4T A95B 的 Intelligence Index 得分为 40。 | Alibaba | 40 | Intelligence Index 得分 40 · 进入开放权重模型前六 |
| 6 | Qwen3.8-Flash-NextQwen3.8-Flash-Next 同样取得 40 分,与 Qwen3.8 2.4T A95B 持平。 | Alibaba | 40 | Intelligence Index 得分 40 · 进入开放权重模型前六 |
MiMo-V2.6-Pro 取代 8 月榜首 Kimi K3,成为本期开放权重模型的新领跑者。
开放权重模型继续保持竞争力,但与专有模型的绝对前沿仍有差距:MiMo-V2.6-Pro 得分为 46,而 Claude Opus 5.5 max with fallback 为 58。
截至 2026-09-24,Artificial Analysis 收录的 169 个模型中有 68 个采用开放权重,其中 MiMo-V2.6-Pro 以 46 分排名第一。
GPT-6 Luna (low) 的单任务成本为 $0.0045,Intelligence Index 为 21。本期将其列为性价比领先者,是基于 Artificial Analysis 同一对比表作出的编辑判断:在已明确列出的正成本模型中,其单任务成本最低,同时智能得分高于两款成本显示为 $0.00 的实用型模型。
| # | 模型 | 厂商 | 评分 | 核心优势 |
| 1 | GPT-6 Luna (low)已明确列出的正成本模型中单任务成本最低,同时取得 21 的 Intelligence Index。 | OpenAI | $0.0045/task | 每任务成本 $0.0045 · Intelligence Index 为 21 · 综合成本与智能表现后,被编辑评估为总体性价比最佳 |
| 2 | Granite 4.2 3B以每任务 $0.01 跻身当前 Cost per Task 领先模型。 | IBM | $0.01/task | 每任务成本 $0.01 · 3B 模型规格 · 在已公布的低成本领先模型序列中位列第 2 |
| 3 | Ministral 3 3B单任务成本同为 $0.01,与 Granite 4.2 3B 持平。 | Mistral AI | $0.01/task | 每任务成本 $0.01 · 3B 模型规格 · 进入当前三款低成本领先模型名单 |
GPT-6 Luna (low) 取代 8 月榜首 DeepSeek V4 Flash 0731。
Command A+ 与 North Mini Code 的单任务成本均显示为 $0.00,但 Intelligence Index 分别只有 13 和 10。企业评估总体价值时,不能脱离这一性能差距仅比较账面成本。
截至 2026-09-24,GPT-6 Luna (low) 以每任务 $0.0045 位列成本效益第 1,Intelligence Index 为 21。