AI 大模型周榜:阿里 qwen3.8-max 冲进综合榜 Top 6,国产多模型表现亮眼
8 月 10 日消息,Arena(arena.ai)平台发布 2026 年第 32 周(8 月 3 日 ~8 月 9 日)AI 大模型盲测排名,本周共有多款新模型入榜,其中国产模型阿里 qwen3.8-max 表现突出,杀入综合榜第 6 名,ELO 分数达到 1497 分,整体处于头部梯队。Meta 全新推出的 muse-spark-1.2 (xHigh) 也位列综合榜第 4 名,成为海外阵营的亮眼新秀。本周多个细分榜单都有新模型亮相,国产模型在前端开发、代码、生图等领域均实现突破。
注:本榜单基于 Arena(arena.ai)平台匿名盲测投票,通过 ELO(智能体榜为百分比信号)计算排名,反映用户主观偏好而非绝对能力测试;不同分榜相互独立,不宜跨榜比较,分差在误差范围内均视为并列,新模型也需积累一定投票量后才会正式入榜。
综合榜
本周综合榜头部格局相对稳定,Anthropic 旗下 claude-fable-5 依旧占据榜首位置,ELO 分数为 1507 分,claude-opus-4-6-thinking、claude-opus-4-7-thinking 紧随其后位列第二、三名,三者分差均在 10 分以内,在误差范围内视为接近。本周最大看点是两款新模型强势闯入头部:Meta 新发布的 muse-spark-1.2 (xHigh) 首秀排名第 4,ELO 1498 分;阿里全新 qwen3.8-max 拿到第 6 名,ELO 1497 分,与第 5 名的 claude-opus-4-6 同分,仅因置信区间差异排名靠后,同样在统计误差范围内并列。头部整体分数密集,前 10 名分数均在 1488 分以上,竞争极为激烈。
国产模型在综合榜已有多款进入中上游,具体排名如下:
阿里 qwen3.8-max 排名第 6 名,ELO 1497 分;
月之暗面 kimi-k3-max 排名第 14 名,ELO 1485 分,排名持平;
阿里 qwen3.7-max-preview 排名第 23 名,ELO 1475 分,排名下降 2 位。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1507 ±6 | 19390 | $10 / $50 | 1M |
| 2 | - | claude-opus-4-6-thinking | Anthropic | 1505 ±4 | 69336 | $2.5 / $12.5 | 1M |
| 3 | - | claude-opus-4-7-thinking | Anthropic | 1502 ±4 | 57018 | $5 / $25 | 1M |
| 4 | 新上榜 | muse-spark-1.2 (xHigh) | Meta | 1498 ±13 | 2057 | $1.25 / $4.25 | N/A |
| 5 | ↓ 1 | claude-opus-4-6 | Anthropic | 1497 ±3 | 73158 | $2.5 / $12.5 | 1M |
| 6 | 新上榜 | qwen3.8-max | Alibaba | 1497 ±9 | 4662 | $2 / $6 | 1M |
| 7 | ↓ 2 | claude-opus-4-7 | Anthropic | 1493 ±4 | 58135 | $5 / $25 | 1M |
| 8 | ↓ 2 | claude-opus-5-high | Anthropic | 1493 ±6 | 14902 | $5 / $25 | 1M |
| 9 | ↓ 2 | claude-opus-5-max | Anthropic | 1488 ±8 | 7137 | $5 / $25 | 1M |
| 10 | ↓ 1 | muse-spark | Meta | 1488 ±6 | 13476 | N/A | N/A |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 14 | ↓ 2 | kimi-k3-max | Moonshot | 1485 ±7 | 9861 | N/A | N/A |
| 23 | ↓ 2 | qwen3.7-max-preview | Alibaba | 1475 ±10 | 3695 | $1.48 / $4.43 | 1M |
代码榜
代码榜头部依旧被 Anthropic 模型垄断,claude-fable-5 蝉联第一,ELO 1553 分,claude-opus-4-7-thinking、claude-opus-4-6-thinking 分别占据第二、三名。月之暗面 kimi-k3-max 本周排名从第 8 位上升至第 6 位,ELO 分数上涨 11 分至 1542 分,闯入 Top 6,成为代码榜排名最高的国产模型。阿里 qwen3.8-max 排名第 8,ELO 1532 分,同样进入前十。Meta muse-spark-1.2 (xHigh) 本周首次入榜排名第 15,ELO 1526 分。
国产模型在代码榜已有多款进入前 30,具体如下:
月之暗面 kimi-k3-max 排名第 6 名,ELO 1542 分,较上周上升 2 位;
阿里 qwen3.8-max 排名第 8 名,ELO 1532 分;
阿里 qwen3.7-max-preview 排名第 17 名,ELO 1526 分,排名下滑 1 位;
小米 mimo-v2.5-pro 排名第 28 名,ELO 1519 分,排名持平;
智谱 glm-5.1 排名第 30 名,ELO 1517 分,较上周下降 3 位。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-fable-5 | Anthropic | 1553 ±9 | 5234 | $10 / $50 | 1M |
| 2 | - | claude-opus-4-7-thinking | Anthropic | 1552 ±6 | 16303 | $5 / $25 | 1M |
| 3 | - | claude-opus-4-6-thinking | Anthropic | 1551 ±6 | 18015 | $2.5 / $12.5 | 1M |
| 4 | - | claude-opus-4-6 | Anthropic | 1547 ±6 | 20444 | $2.5 / $12.5 | 1M |
| 5 | - | claude-opus-4-7 | Anthropic | 1546 ±6 | 16534 | $5 / $25 | 1M |
| 6 | ↑ 2 | kimi-k3-max | Moonshot | 1542 ±12 | 2611 | N/A | N/A |
| 7 | ↓ 1 | claude-opus-4-8-thinking | Anthropic | 1535 ±7 | 10509 | $2.5 / $12.5 | 1M |
| 8 | 新上榜 | qwen3.8-max | Alibaba | 1532 ±16 | 1411 | $2 / $6 | 1M |
| 9 | ↑ 1 | muse-spark-1.1 | Meta | 1532 ±10 | 4199 | $1.25 / $4.25 | N/A |
| 10 | ↓ 1 | claude-opus-4-5-20251101- thinking-32k | Anthropic | 1530 ±7 | 7603 | $5 / $25 | 200K |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 17 | ↓ 1 | qwen3.7-max-preview | Alibaba | 1526 ±18 | 1112 | $1.48 / $4.43 | 1M |
| 28 | - | mimo-v2.5-pro | Xiaomi | 1519 ±7 | 13199 | $0.44 / $0.87 | 1.05M |
| 30 | ↓ 3 | glm-5.1 | Z.ai | 1517 ±7 | 10330 | $1.4 / $4.4 | 202.8K |
前端开发榜
本周前端开发榜榜首依旧是 claude-opus-5-max,ELO 1686 分,月之暗面 kimi-k3-max 稳定保持第二位,ELO 1675 分,仅下跌 1 分,仍紧逼头部海外模型。阿里 qwen3.8-max 拿下第四名,ELO 1667 分,直接进入前五,表现十分抢眼。深度求索 deepseek-v4-flash-high 也首次入榜,排名第 8 位,ELO 1581 分。国产模型在前端开发榜已经占据多个 top10 位置,整体竞争力持续提升。
国产模型具体排名如下:
月之暗面 kimi-k3-max 排名第 2 名,ELO 1675 分,排名持平;
阿里 qwen3.8-max 排名第 4 名,ELO 1667 分;
智谱 glm-5.2-max 排名第 7 名,ELO 1588 分,上升 1 位;
深度求索 deepseek-v4-flash-high 排名第 8 名,ELO 1581 分,首次入榜。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | claude-opus-5-max | Anthropic | 1686 ±11 | 4029 | $5 / $25 | 1M |
| 2 | - | kimi-k3-max | Moonshot | 1675 ±12 | 4372 | $3 / $15 | 1.05M |
| 3 | - | claude-opus-5-high | Anthropic | 1670 ±10 | 5145 | $5 / $25 | 1M |
| 4 | 新上榜 | qwen3.8-max | Alibaba | 1667 ±16 | 1980 | $2 / $6 | 1M |
| 5 | ↓ 1 | claude-fable-5 | Anthropic | 1630 ±9 | 6816 | $10 / $50 | 1M |
| 6 | ↓ 1 | gpt-5.6-sol-xhigh (codex-harness) | OpenAI | 1620 ±9 | 6903 | $5 / $30 | 1.05M |
| 7 | ↓ 1 | glm-5.2-max | Z.ai | 1588 ±9 | 6924 | $1.4 / $4.4 | 1M |
| 8 | 新上榜 | deepseek-v4-flash-high | DeepSeek | 1581 ±15 | 1931 | $0.14 / $0.28 | 1.05M |
| 9 | ↓ 1 | claude-opus-4-8-thinking | Anthropic | 1565 ±8 | 9549 | $2.5 / $12.5 | 1M |
| 10 | ↓ 1 | claude-opus-4-7 | Anthropic | 1560 ±7 | 12398 | $5 / $25 | 1M |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 21 | ↓ 3 | seed-2.1-pro-preview | Bytedance | 1524 ±9 | 6069 | N/A | N/A |
| 24 | ↓ 1 | hy3 | Tencent | 1522 ±15 | 1729 | $0.13 / $0.53 | 262.1K |
| 25 | ↓ 3 | qwen3.7-max-20260517 | Alibaba | 1516 ±8 | 8044 | $1.48 / $4.43 | 1M |
| 26 | ↓ 2 | glm-5.1 | Z.ai | 1515 ±8 | 7853 | $1.4 / $4.4 | 202.8K |
| 27 | ↓ 2 | kimi-k2.6 | Moonshot | 1510 ±8 | 9261 | $0.95 / $4 | 262.1K |
智能体榜
智能体榜本周头部发生更替,Anthropic Claude Opus 5 (High) 从第三名上升至第一名,净提升度达到 11.99%,此前榜首 Claude Fable 5 (High) 降至第二,净提升度 11.66%,两者净提升度差距小于双方置信区间之和,在误差范围内视为并列。国产模型月之暗面 Kimi K3 (Max) 稳定保持第五名,净提升度 10.08%,任务确认成功率达到 14.97%,已经跻身智能体榜第一梯队。深度求索 Deepseek V4 Flash (High) (20260731) 本周首次入榜排名第 21,净提升度 2.84%,任务确认成功率达到 8.53%,首秀表现符合预期。
国产模型在智能体榜已有多款进入前 30,具体如下:
月之暗面 Kimi K3 (Max) 排名第 5 名,净提升度 10.08%,任务确认成功率 14.97%,排名持平;
智谱 GLM 5.2 (Max) 排名第 12 名,净提升度 6.75%,排名持平;
深度求索 Deepseek V4 Flash (High) (20260731) 排名第 21 名,净提升度 2.84%,首次入榜;
智谱 GLM 5.1 排名第 24 名,净提升度 0.35%,排名下降 2 位。
| 排名 | 较上周 | 模型 | 厂商 | 净提升度 (±CI) | 任务确认成功率 | 好评 / 差评比 | 可控性 |
|---|---|---|---|---|---|---|---|
| 1 | ↑ 2 | Claude Opus 5 (High) | Anthropic | 11.99% ±1.37% | 16.04% ±2.79% | 19.46% ±5.19% | 10.29% ±2.51% |
| 2 | ↓ 1 | Claude Fable 5 (High) | Anthropic | 11.66% ±2.39% | 11.47% ±4.46% | 22.56% ±8.25% | 10.01% ±4.93% |
| 3 | ↓ 1 | Claude Opus 5 (Max) | Anthropic | 11.19% ±1.62% | 16.36% ±3.11% | 19.07% ±6.03% | 5.8% ±3.1% |
| 4 | - | GPT 5.6 Sol (xHigh) | OpenAI | 10.28% ±1.72% | 9.06% ±3.48% | 22.7% ±6.42% | 8.42% ±3.5% |
| 5 | - | Kimi K3 (Max) | Moonshot | 10.08% ±1.07% | 14.97% ±2.09% | 19.68% ±3.85% | 7.45% ±1.97% |
| 6 | - | Claude Opus 4.8 (Thinking) | Anthropic | 9.35% ±1.7% | 8.81% ±2.9% | 21.46% ±5.38% | 8.5% ±3.08% |
| 7 | ↑ 1 | GPT 5.5 (xHigh) | OpenAI | 8.45% ±0.99% | 5.24% ±2.08% | 13.56% ±3.55% | 8.19% ±1.8% |
| 8 | ↑ 1 | Claude Opus 4.7 (Thinking) | Anthropic | 8.33% ±1.32% | 6.65% ±2.76% | 11.87% ±4.59% | 8.61% ±2.72% |
| 9 | ↓ 2 | Claude Sonnet 5 (High) | Anthropic | 7.46% ±2.15% | 5.56% ±4.29% | 14.8% ±7.65% | 5.14% ±4.55% |
| 10 | ↑ 1 | Claude Opus 4.7 | Anthropic | 7.32% ±1.36% | 5.55% ±2.85% | 10.72% ±4.45% | 9.54% ±2.7% |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 12 | - | GLM 5.2 (Max) | Z.ai | 6.75% ±0.9% | 9.21% ±1.83% | 12.39% ±3.21% | 5.62% ±1.59% |
| 21 | 新上榜 | Deepseek V4 Flash (High) (20260731) | DeepSeek | 2.84% ±1.1% | 8.53% ±2.54% | 0.46% ±3.64% | 0.43% ±2.19% |
| 23 | - | Kimi K2.7 Code | Moonshot | 0.69% ±1.94% | 4.12% ±4.08% | 2.36% ±6.68% | 1.92% ±4.37% |
| 24 | ↓ 2 | GLM 5.1 | Z.ai | 0.35% ±0.77% | 1.06% ±1.72% | 0.72% ±2.5% | 0.76% ±1.4% |
| 25 | - | Qwen3.7 Max | Alibaba | 0.16% ±0.88% | 0.24% ±2.11% | 5.07% ±2.72% | 0.21% ±1.55% |
| 26 | - | DeepSeek V4 Pro | DeepSeek | 0.33% ±0.86% | 2.74% ±2.16% | 3.35% ±2.78% | 0.3% ±1.54% |
| 27 | ↑ 2 | Kimi K2.6 | Moonshot | 0.48% ±2.16% | 2.28% ±4.11% | 2.12% ±6.8% | 1.66% ±4.49% |
| 30 | ↓ 3 | Hy3 | Tencent | 1.12% ±1.42% | 2.2% ±3.04% | 3.7% ±4.91% | 9.01% ±2.6% |
AI 生图榜
本周 AI 生图榜头部依旧是 OpenAI gpt-image-2 (medium) 占据第一,ELO 1380 分,SpaceXAI 新推出的 grok-imagine-image-2.0 (low) 首次入榜即拿到第二名,ELO 1320 分,表现出色。国产方面,阿里 qwen-image-3.0-pro 首次入榜排名第七,ELO 1258 分, seedream-5.0-pro 排名第八,ELO 1257 分,两款国产模型均进入前十,整体处于第一梯队。 hunyuan-image-3.0 排名第 29 名,ELO 1151 分,表现稳定。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gpt-image-2 (medium) | OpenAI | 1380 ±5 | 69194 | N/A | N/A |
| 2 | 新上榜 | grok-imagine-image-2.0 (low) | SpaceXAI | 1320 ±12 | 2722 | N/A | N/A |
| 3 | ↓ 1 | reve-2.1 | Reve | 1302 ±8 | 7598 | N/A | N/A |
| 4 | ↓ 1 | muse-image | Meta | 1283 ±7 | 14510 | N/A | N/A |
| 5 | ↓ 1 | reve-2.0 | Reve | 1270 ±6 | 14650 | N/A | N/A |
| 6 | ↓ 1 | gemini-3.1-flash-image (nano-banana-2) [web-search] | 1263 ±5 | 27910 | N/A | N/A | |
| 7 | 新上榜 | qwen-image-3.0-pro | Alibaba | 1258 ±10 | 3735 | N/A | N/A |
| 8 | ↓ 2 | seedream-5.0-pro | Bytedance | 1257 ±5 | 26510 | N/A | N/A |
| 9 | ↓ 2 | mai-image-2.5 | Microsoft AI | 1256 ±5 | 44940 | N/A | N/A |
| 10 | ↓ 2 | gemini-3.1-flash-lite-image (nano-banana-2-lite) | 1251 ±6 | 16419 | N/A | N/A | |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 16 | ↓ 2 | qwen-image-2.0-pro-2026-06-22 | Alibaba | 1191 ±6 | 12026 | N/A | N/A |
| 29 | ↓ 4 | hunyuan-image-3.0 | Tencent | 1151 ±3 | 173366 | N/A | N/A |
AI 视频榜
AI 视频榜头部格局稳定,谷歌 gemini-omni-flash 依旧占据榜首,ELO 1513 分, dreamina-seedance-2.0-720p 保持第二名,ELO 1479 分,差距仅 34 分,接近头部水平。MiniMax 全新 minimax-h3 首次入榜排名第四,ELO 1455 分,直接闯入前五,成为国产 AI 视频模型的最新亮点。阿里 happyhorse-1.0 排名第五,ELO 1428 分,同样保持稳定,国产模型已经占据榜单前五中的三个席位,优势明显。
| 排名 | 较上周 | 模型 | 厂商 | 分数 (±CI) | 票数 | 价格 ($/M) 输入 / 输出 | 上下文 |
|---|---|---|---|---|---|---|---|
| 1 | - | gemini-omni-flash | 1513 ±12 | 14571 | N/A | N/A | |
| 2 | - | dreamina-seedance-2.0-720p | Bytedance | 1479 ±11 | 47067 | N/A | N/A |
| 3 | - | muse-video | Meta | 1458 ±15 | 2160 | N/A | N/A |
| 4 | 新上榜 | minimax-h3 | MiniMax | 1455 ±19 | 1060 | N/A | N/A |
| 5 | ↓ 1 | happyhorse-1.0 | Alibaba-ATH | 1428 ±13 | 21979 | N/A | N/A |
| 6 | ↓ 1 | sora-2-pro | OpenAI | 1365 ±8 | 44543 | $0 / $0.3 | N/A |
| 7 | - | veo-3.1-audio | 1364 ±14 | 13687 | $0 / $0.4 | N/A | |
| 8 | ↓ 2 | veo-3.1-audio-1080p | 1363 ±10 | 24846 | N/A | N/A | |
| 9 | ↓ 1 | veo-3.1-fast-audio | 1362 ±11 | 39301 | $0 / $0.15 | N/A | |
| 10 | ↓ 1 | veo-3.1-fast-audio-1080p | 1358 ±10 | 25637 | N/A | N/A | |
| — 以下为 Top 10 外的国产模型 — | |||||||
| 13 | ↓ 2 | wan2.7-t2v | Alibaba | 1347 ±9 | 15246 | N/A | N/A |
| 16 | ↓ 1 | wan2.6-t2v | Alibaba | 1330 ±9 | 41706 | N/A | N/A |
| 17 | ↓ 1 | seedance-v1.5-pro | Bytedance | 1256 ±7 | 75653 | N/A | N/A |
| 19 | ↓ 2 | wan2.5-t2v-preview | Alibaba | 1252 ±10 | 25895 | N/A | N/A |
| 28 | ↓ 1 | hailuo-2.3 | MiniMax | 1202 ±7 | 72127 | N/A | N/A |
| 29 | ↓ 1 | hailuo-02-pro | MiniMax | 1198 ±13 | 9365 | N/A | N/A |
| 30 | ↓ 1 | seedance-v1-pro | Bytedance | 1190 ±11 | 12117 | N/A | N/A |
本周 Arena 周榜迎来多款重量级新模型,国产大模型在综合、代码、前端开发、生图、视频等多个维度均实现突破,阿里 qwen3.8-max 首秀即杀入头部梯队,证明国产大模型综合能力已经接近国际第一梯队水平,多个细分领域国产模型已经占据领先位置。下周预计将有更多新模型完成测试入榜,我们也将持续关注排名变化。
声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!
AI 中文社