存档 · 2026-09-24 更新

LLM 排行榜存档 — 2026-09

2026-09 期 LLM 排行榜存档:九大类目当期领先模型与完整排名。

LLM 月度天梯榜 · 2026-09

把这期榜单带走

保存一张清晰的分享图,或扫码在另一台设备阅读。

01

推理

文本生成与推理

本月榜首 Claude Opus 5.5 Anthropic 上期: Claude Opus 5

最新的推理能力领导者,展示在逻辑处理和决策制定方面最先进的模型。

#模型厂商评分核心优势
1 Claude Opus 5.5在推理方面领先,得分强劲。 Anthropic 58 逻辑处理 · 决策制定
2 Claude Opus 5.5 (xhigh with fallback)具有回退功能的强劲表现。 Anthropic 56 回退逻辑 · 稳健推理
3 Claude Opus 5.5 (high with fallback)具有回退功能的高推理能力。 Anthropic 54 高容量 · 回退支持
4 Claude Fable 5.1 (max with fallback)最大化推理与回退。 Anthropic 53 最大化逻辑 · 回退
5 Claude Fable 5.1 (xhigh with fallback)X高推理与回退。 Anthropic 53 X高逻辑 · 回退
6 GPT-6 Astra (max)最大化推理能力。 OpenAI 53 最大化推理 · 高级逻辑

Claude Opus 5.5 以 58 的智能指数得分取代了 Claude Opus 5 成为领导者。

Anthropic 继续凭借其 Claude Opus 系列在推理类别中占据主导地位。

截至 2026-09-24,Claude Opus 5.5 以 58 分在 169 个排名模型中领先。
02

文生图

图像生成

本月榜首 GPT Image 2.5 Sunburst (max) OpenAI 上期: GPT Image 2 / Nano Banana 2

在当前 Text to Image Arena 中,GPT Image 2.5 Sunburst (max) 以 Elo 1197 领跑,其后是 GPT Image 2.5 Flare (max)(1191)和 GPT Image 2 (high)(1171)。Sunburst 的样本数为 13,433。

#模型厂商评分核心优势
1 GPT Image 2.5 Sunburst (max)当前 Text to Image Arena 榜首,Elo 1197。 OpenAI 1197 样本数 13,433 · API 价格:每 1,000 张图 $210.7
2 GPT Image 2.5 Flare (max)当前 Text to Image Arena 排名第 2,Elo 1191。 OpenAI 1191 稳居榜单前二
3 GPT Image 2 (high)当前 Text to Image Arena 排名第 3,Elo 1171。 OpenAI 1171 进入榜单前三 · API 价格:每 1,000 张图 $211.0
4 Grok Imagine Image 2.0当前 Text to Image Arena 排名第 4,Elo 1150。 xAI 1150 API 价格:每 1,000 张图 $60.0
5 MAI-Image-2.6当前 Text to Image Arena 排名第 5,Elo 1147。 Microsoft 1147 API 价格:每 1,000 张图 $38.9
6 Nano Banana 2 (Gemini 3.1 Flash Image)当前 Text to Image Arena 排名第 6,Elo 1122。 Google 1122 API 价格:每 1,000 张图 $67.0

本期榜首已由 8 月刊的 GPT Image 2 / Nano Banana 2 组合更替。

开放权重图像模型方面,Ideogram 4.0 (Quality) 以 1011 领跑,其后是 Ideogram 4.0(1003)和 FLUX.2 [dev](1000)。

截至 2026-09-24,GPT Image 2.5 Sunburst (max) 以 Elo 1197 排名第 1,样本数为 13,433。
03

视频生成

视频生成

本月榜首 Gemini Omni Flash Google

Gemini Omni Flash 以 1233 Elo 继续领跑支持音频的文生视频榜单,Wan 3.0 以 1229 紧随其后。在无音频赛道中,榜首则由 Wan 3.0 以 1336 获得。

#模型厂商评分核心优势
1 Gemini Omni Flash继续领跑有音频视频赛道,领先 Wan 3.0 四个 Elo。 Google 1233 Elo 有音频榜单以 1233 Elo 排名第 1 · 无音频榜单以 1330 排名第 2 · 榜单价格为每分钟 $6.00
2 Wan 3.0有音频赛道位列第二,同时登顶无音频榜单。 Alibaba 1229 Elo 有音频榜单以 1229 Elo 排名第 2 · 无音频榜单以 1336 排名第 1 · 榜单价格为每分钟 $12.00
3 Minimax H3 Max post-trained by fal仅落后第二名 Wan 3.0 两个 Elo,并拥有前五名中最低的榜单价格。 fal 1227 Elo 有音频榜单以 1227 Elo 排名第 3 · 与第二名仅相差 2 Elo · 榜单价格为每分钟 $2.40
4 MiniMax H3 Open Weights当前支持音频的视频模型中排名最高的开放权重方案。 MiniMax 1220 Elo 以 1220 Elo 领跑有音频开放权重模型 · 有音频总榜排名第 4 · 榜单价格为每分钟 $7.80
5 Dreamina Seedance 2.0 720p跻身竞争密集的前五,与榜首仅相差 23 Elo。 ByteDance 1210 Elo 有音频榜单以 1210 Elo 排名第 5 · 距第一名仅 23 Elo · 榜单价格为每分钟 $9.07

本月榜首较 8 月未变,但 Wan 3.0 升至第二;两个 MiniMax H3 版本分别占据第三和第四位。

头部竞争高度胶着:第一名 Gemini Omni Flash 与第五名 Dreamina Seedance 2.0 720p 仅相差 23 Elo。同期前五名的价格差异显著,每分钟从 $2.40 到 $12.00 不等。

截至 2026-09-24,Wan 3.0 在有音频榜单以 1229 Elo 位列第 2,在无音频榜单则以 1336 排名第 1。
04

代码与终端任务

代码生成与智能体编码

本月榜首 Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback Anthropic 上期: Claude Opus 5

Terminal-Bench 2.1 覆盖软件工程、系统管理、数据处理、模型训练与安全任务。此次更新包含 89 项任务,并修正了环境和指令问题;pass@1 按三次重复运行取平均值,评测由 Artificial Analysis 独立执行。

#模型厂商评分核心优势
1 Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback取得 Terminal-Bench 2.1 当前最高的经验证成绩。 Anthropic 91.4% 以 91.4% pass@1 位列第 1 · 采用 Max Effort 自适应推理配置 · 评测覆盖五类技术与运维任务
2 Claude Fable 5.1 Adaptive Reasoning Xhigh with Default Fallback与榜首配置仅相差 0.4 个百分点。 Anthropic 91.0% 以 91.0% pass@1 位列第 2 · 采用 Xhigh 自适应推理配置 · 在 89 项任务的刷新版评测中保持 90% 以上成绩
3 Claude Fable 5.1 Adaptive Reasoning High with Default Fallback帮助 Claude Fable 5.1 包揽榜单前三名。 Anthropic 89.9% 以 89.9% pass@1 位列第 3 · 采用 High 自适应推理配置 · 较榜首 Max Effort 配置低 1.5 个百分点

Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 取代 8 月榜首 Claude Opus 5。由于 Terminal-Bench 2.1 属于刷新后的评测版本,9 月百分比不宜与上期分数直接比较。

榜单前三均为 Claude Fable 5.1 的不同推理强度配置,成绩集中在 89.9% 至 91.4%。对企业选型而言,推理强度档位已成为与基础模型名称同样重要的评估维度。

截至 2026-09-24,Claude Fable 5.1 Adaptive Reasoning Max Effort with Default Fallback 以 91.4% 的 pass@1 成绩位列 Terminal-Bench 2.1 第 1 名。
05

语音与文本转语音

语音 / 语音合成

本月榜首 Cartesia Sonic 3.6 Cartesia 上期: Realtime 2

Cartesia Sonic 3.6 于 2026 年 8 月发布,目前以 1278 Elo 位居 Provider Voice Arena 榜首。Inworld Realtime TTS-2 以 1243 排名第二,SpeechifyAI Simba 3.2 和 Alibaba Qwen-Audio-3.0-TTS-Plus 分别以 1238、1235 紧随其后。

#模型厂商评分核心优势
1 Cartesia Sonic 3.6这款于 2026 年 8 月发布的模型成为 Provider Voice Arena 新榜首。 Cartesia 1278 Elo 以 1278 Elo 排名第一 · API 标价为每 100 万字符 $49.0
2 Inworld Realtime TTS-2在本期供应商语音榜单中排名第二。 Inworld 1243 Elo 取得 1243 Elo · API 标价为每 100 万字符 $20.8
3 SpeechifyAI Simba 3.2位列第三,与 Realtime TTS-2 相差 5 个 Elo 分。 SpeechifyAI 1238 Elo 取得 1238 Elo · API 标价为每 100 万字符 $6.6
4 Alibaba Qwen-Audio-3.0-TTS-PlusAlibaba 的语音模型跻身竞争紧密的第一梯队,位列第四。 Alibaba 1235 Elo 取得 1235 Elo · API 标价为每 100 万字符 $27.6
5 VUI Labs Luna TTSLuna TTS 进入 Provider Voice Arena 前五。 VUI Labs 1230 Elo 取得 1230 Elo · API 标价为每 100 万字符 $80.0
6 Inworld Realtime TTS-2 Flash凭借标准版与 Flash 版,Inworld 在前六名中占据两个席位。 Inworld 1214 Elo 取得 1214 Elo · API 标价为每 100 万字符 $10.4

Cartesia Sonic 3.6 取代 8 月榜首 Realtime 2;在本期榜单中,Inworld Realtime TTS-2 位列第二。

头部六款模型的 API 成本差异明显:SpeechifyAI Simba 3.2 的标价为每 100 万字符 $6.6,Sonic 3.6 为 $49.0,VUI Labs Luna TTS 则为 $80.0。开放权重阵营中,Breeze TTS 2 以 1203 成为排名最高的 TTS 模型。

截至 2026-09-24,Cartesia Sonic 3.6 以 1278 Elo 位列 Provider Voice Arena 第 1 名。
06

器乐音乐生成

音乐生成

本月榜首 Mureka V9 Mureka 上期: Suno v5.5

Mureka V9 以 1177 Elo 位居 Instrumental Music Arena 榜首,Suno V5.5 以 1171 排名第二,Mureka V8 以 1143 排名第三。该榜单采用盲选偏好投票,并将器乐与人声模式分开评测。

#模型厂商评分核心优势
1 Mureka V9以 2,237 个样本支撑评测,位居 Instrumental Music Arena 榜首。 Mureka 1177 Elo 在器乐模型盲选偏好排名中取得最高 Elo · 排名领先于 Suno V5.5
2 Suno V5.5基于 2,222 个样本取得 1171 Elo,排名第二。 Suno 1171 Elo 盲选偏好得分位列第二 · Suno 有两款模型进入前四,Suno V5.5 排名更高
3 Mureka V8以 1143 Elo 位列第三,样本量为 3,130 个。 Mureka 1143 Elo Mureka 第二款进入前三的模型 · 在列出的六款领先模型中样本量最高
4 Suno V5基于 2,713 个样本取得 1137 Elo,排名第四。 Suno 1137 Elo 进入该榜单前四 · Suno 第二款跻身前四的模型
5 StepAudio 3 Music以 1113 Elo 位列第五,样本量为 2,212 个。 StepAudio 1113 Elo 在器乐盲选偏好投票中进入前五 · 排名领先于 Google Lyria 3 Pro
6 Google Lyria 3 Pro基于 2,959 个样本取得 1102 Elo,排名第六。 Google 1102 Elo 进入器乐音乐榜单前六 · 评测覆盖 2,959 个样本

Mureka V9 取代 8 月榜首 Suno v5.5;Suno V5.5 本期降至第二位。

Mureka 与 Suno 各占前四名中的两个席位。各模型样本量从 StepAudio 3 Music 的 2,212 个到 Mureka V8 的 3,130 个不等;来源页面未提供音乐模型价格。

截至 2026-09-24,Mureka V9 以 1177 Elo 位列 Instrumental Music Arena 第 1 名。
07

视觉理解

视觉 / 多模态理解

本月榜首 Claude Fable 5 High Anthropic 上期: Claude Fable 5

Vision Arena 于 2026 年 9 月 13 日发布的榜单覆盖 152 个模型和 1,314,119 次投票。Claude Fable 5 High 以 1310±8 位居第一,Qwen3.8 Max 以 1302±8 紧随其后,两个 Claude Opus 4.7 配置也进入前四。

#模型厂商评分核心优势
1 Claude Fable 5 High位居 9 月 Vision Arena 榜首。 Anthropic 1310±8 在 152 个模型中排名第 1 · 所在榜单累计获得 1,314,119 次投票
2 Qwen3.8 Max与榜首相差 8 个 Elo 分。 Alibaba 1302±8 综合排名第 2 · 每 100 万输入和输出 token 的价格分别为 $2 和 $6
3 Claude Opus 4.7 High排名第 3,仅落后 Qwen3.8 Max 1 分。 Anthropic 1301±7 综合排名第 3 · 得分区间为 1301±7
4 Claude Opus 4.7标准配置比 High 配置低 1 分。 Anthropic 1300±7 综合排名第 4 · 与榜首仅相差 10 分
5 Claude Opus 4.6 High帮助 Anthropic 占据前五名中的四席。 Anthropic 1299±7 综合排名第 5 · 仅落后 Claude Opus 4.7 1 分

Claude Fable 5 High 登上榜首,接替 8 月榜单中的 Claude Fable 5。

榜首模型每 100 万输入和输出 token 的价格分别为 $10 和 $50;第二名 Qwen3.8 Max 分别为 $2 和 $6。对于重视部署成本的企业,前两名之间存在明显价差。

截至 2026-09-24,Claude Fable 5 High 以 1310±8 排名第 1;该期 Vision Arena 覆盖 152 个模型和 1,314,119 次投票。
08

开放权重模型

开源 / 开放权重

本月榜首 MiMo-V2.6-Pro Xiaomi 上期: Kimi K3

MiMo-V2.6-Pro 以 46 分位列 Artificial Analysis 开放权重模型第一,GLM-5.3 max 以 45 分紧随其后,Kimi K3 max 以 44 分排名第三。

#模型厂商评分核心优势
1 MiMo-V2.6-Pro当前 Intelligence Index 排名最高的开放权重模型。 Xiaomi 46 Intelligence Index 得分 46 · 开放权重模型排名第一 · 上下文窗口为 1M
2 GLM-5.3 max位列开放权重模型第二,与榜首相差 1 个指数点。 Zhipu AI 45 Intelligence Index 得分 45 · 开放权重模型排名第二 · GLM-5.3 的上下文窗口为 1M
3 Kimi K3 max8 月榜首本期位列开放权重模型第三。 Moonshot AI 44 Intelligence Index 得分 44 · 开放权重模型排名第三 · 上下文窗口为 1M
4 GLM-5.3-FlashGLM-5.3-Flash 位列当前开放权重榜第四。 Zhipu AI 42 Intelligence Index 得分 42 · 开放权重模型排名第四
5 Qwen3.8 2.4T A95BQwen3.8 2.4T A95B 的 Intelligence Index 得分为 40。 Alibaba 40 Intelligence Index 得分 40 · 进入开放权重模型前六
6 Qwen3.8-Flash-NextQwen3.8-Flash-Next 同样取得 40 分,与 Qwen3.8 2.4T A95B 持平。 Alibaba 40 Intelligence Index 得分 40 · 进入开放权重模型前六

MiMo-V2.6-Pro 取代 8 月榜首 Kimi K3,成为本期开放权重模型的新领跑者。

开放权重模型继续保持竞争力,但与专有模型的绝对前沿仍有差距:MiMo-V2.6-Pro 得分为 46,而 Claude Opus 5.5 max with fallback 为 58。

截至 2026-09-24,Artificial Analysis 收录的 169 个模型中有 68 个采用开放权重,其中 MiMo-V2.6-Pro 以 46 分排名第一。
09

成本效益

每美元智能

本月榜首 GPT-6 Luna (low) OpenAI 上期: DeepSeek V4 Flash 0731

GPT-6 Luna (low) 的单任务成本为 $0.0045,Intelligence Index 为 21。本期将其列为性价比领先者,是基于 Artificial Analysis 同一对比表作出的编辑判断:在已明确列出的正成本模型中,其单任务成本最低,同时智能得分高于两款成本显示为 $0.00 的实用型模型。

#模型厂商评分核心优势
1 GPT-6 Luna (low)已明确列出的正成本模型中单任务成本最低,同时取得 21 的 Intelligence Index。 OpenAI $0.0045/task 每任务成本 $0.0045 · Intelligence Index 为 21 · 综合成本与智能表现后,被编辑评估为总体性价比最佳
2 Granite 4.2 3B以每任务 $0.01 跻身当前 Cost per Task 领先模型。 IBM $0.01/task 每任务成本 $0.01 · 3B 模型规格 · 在已公布的低成本领先模型序列中位列第 2
3 Ministral 3 3B单任务成本同为 $0.01,与 Granite 4.2 3B 持平。 Mistral AI $0.01/task 每任务成本 $0.01 · 3B 模型规格 · 进入当前三款低成本领先模型名单

GPT-6 Luna (low) 取代 8 月榜首 DeepSeek V4 Flash 0731。

Command A+ 与 North Mini Code 的单任务成本均显示为 $0.00,但 Intelligence Index 分别只有 13 和 10。企业评估总体价值时,不能脱离这一性能差距仅比较账面成本。

截至 2026-09-24,GPT-6 Luna (low) 以每任务 $0.0045 位列成本效益第 1,Intelligence Index 为 21。

本月趋势洞察

数据来源与方法

数据截至 2026-09-24

月度存档