AI 大模型周榜:国产 Kimi K3 首次杀入综合榜 Top 10,登顶前端开发榜

浏览28次 点赞0次 收藏0次

7 月 20 日消息,Arena(arena.ai)平台发布了 2026-29 期大模型排行榜,统计周期为 2026 年 7 月 13 日 ~2026 年 7 月 19 日。

本周榜单迎来大规模新模型集中入榜,其中最受关注的是国产模型 kimi-k3 的突出表现:它不仅首次杀入综合榜 Top 10,更直接登顶前端开发榜榜首,在细分能力上实现了对多数海外头部模型的反超。

整体来看,多款国产模型在多个榜单的前列位置站稳脚跟,梯队完整度进一步提升。

综合榜

综合榜头部位置由 Claude、Meta、谷歌、OpenAI 等厂商的新模型主导,第一名依然由 claude-fable-5 占据,ELO 为 1507 分。Anthropic 旗下多款思考版本模型集中入驻 Top 5,彼此之间分差全部在 15 分以内,在误差范围内属于并列第一梯队。

本周最大的亮点是国产模型 kimi-k3 凭借 1486 分的 ELO 排名来到第 9 位,首次跻身综合榜 Top 10,和第 8 名的 gemini-3-pro、第 10 名的 gpt-5.6-sol-xhigh 分数完全一致,属于第一梯队的边缘位置。

国产模型在综合榜分布于中上游位置,梯队表现稳定:

  • 月之暗面 kimi-k3 排名第 9 位,ELO 1486 分,较上周上升 1 位,首次进入 Top 10;

  • 阿里 qwen3.7-max-preview 排名第 18 位,ELO 1475 分,排名持平;

  • 智谱 glm-5.1 排名第 27 位,ELO 1471 分,较上周下降 2 位;

  • 智谱 glm-5.2 (max) 排名第 30 位,ELO 1468 分,排名持平。

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1 —🇺🇸 claude-fable-5Anthropic1507 ±78819$10 / $501M
2 —🇺🇸 claude-opus-4-6-thinkingAnthropic1504 ±461003$5 / $251M
3 —🇺🇸 claude-opus-4-7-thinkingAnthropic1503 ±448292$5 / $251M
4 —🇺🇸 claude-opus-4-6Anthropic1498 ±464747$5 / $251M
5 —🇺🇸 claude-opus-4-7Anthropic1494 ±449467$5 / $251M
6 —🇺🇸 muse-spark-1.1Meta1493 ±85729$1.25 / $4.25N/A
7 —🇺🇸 muse-sparkMeta1487 ±613572N/AN/A
8 ↑1🇺🇸 gemini-3-pro谷歌1486 ±441290$2 / $121.05M
9 ↑1🇨🇳 kimi-k3月之暗面1486 ±113024$3 / $151.05M
10 ↓2🇺🇸 gpt-5.6-sol-xhighOpenAI1486 ±94095N/AN/A
— 以下为 Top 10 外的国产模型 —
18 ↓1🇨🇳 qwen3.7-max-preview阿里1475 ±103717$1.48 / $4.431M
27 ↓2🇨🇳 glm-5.1智谱1471 ±528606$1.4 / $4.4202.8K
30 —🇨🇳 glm-5.2 (max)智谱1468 ±615642$1.4 / $4.41M

代码榜

代码榜榜首位置发生变动,claude-opus-4-7-thinking 从第 2 位升至第 1 位,ELO 分数为 1553 分,把此前排名第一的 claude-fable-5 挤到第 2 位,后者分数降至 1551 分。两者仅有 2 分的差距,完全在置信区间范围内,属于并列第一梯队。Anthropic 的多款思考模型几乎包揽了榜单前 7 的所有位置,整体统治力依然强劲。

而国产模型 kimi-k3 首次进入代码榜 Top 10,排名第 10 位,ELO 1529 分,和第 9 名的模型分数仅差 1 分,表现相当接近第一梯队。

国产模型在代码榜覆盖多段位梯队,表现均衡:

  • 月之暗面 kimi-k3 排名第 10 位,ELO 1529 分,首次进入代码榜 Top 10;

  • 阿里 qwen3.7-max-preview 排名第 12 位,ELO 1527 分;

  • 智谱 glm-5.1 排名第 17 位,ELO 1521 分,较上周上升 1 位;

  • 小米 mimo-v2.5-pro 排名第 24 位,ELO 1518 分,较上周下降 1 位;

  • 月之暗面 kimi-k2.6 排名第 26 位,ELO 1515 分,较上周下降 1 位;

  • ernie-5.1 排名第 27 位,ELO 1514 分,较上周下降 1 位;

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1 ↑1🇺🇸 claude-opus-4-7-thinkingAnthropic1553 ±713772$5 / $251M
2 ↓1🇺🇸 claude-fable-5Anthropic1551 ±122459$10 / $501M
3 —🇺🇸 claude-opus-4-6-thinkingAnthropic1550 ±615751$5 / $251M
4 ↑1🇺🇸 claude-opus-4-6Anthropic1549 ±617906$5 / $251M
5 ↓1🇺🇸 claude-opus-4-7Anthropic1548 ±714088$5 / $251M
6 —🇺🇸 claude-opus-4-8-thinkingAnthropic1535 ±88002$5 / $251M
7 —🇺🇸 claude-opus-4-8Anthropic1533 ±88172$5 / $251M
8 —🇺🇸 muse-spark-1.1Meta1532 ±151718$1.25 / $4.25N/A
9 —🇺🇸 claude-opus-4-5-20251101-thinking-32kAnthropic1530 ±77614$5 / $25200K
10🇨🇳 kimi-k3月之暗面1529 ±22798$3 / $151.05M
— 以下为 Top 10 外的国产模型 —
12 ↑1🇨🇳 qwen3.7-max-preview阿里1527 ±181123$1.48 / $4.431M
17 ↑1🇨🇳 glm-5.1智谱1521 ±88056$1.4 / $4.4202.8K
24 ↓1🇨🇳 mimo-v2.5-pro小米1518 ±710969$0.44 / $0.871.05M
26 ↓1🇨🇳 kimi-k2.6月之暗面1515 ±710359$0.95 / $4262.1K
27 ↓1🇨🇳 ernie-5.11514 ±710403N/AN/A

前端开发榜

前端开发榜呈现出前所未有的格局,国产模型 kimi-k3 直接以 1679 分的高 ELO 稳居第一名,大幅领先第二名 claude-fable-5 的 1631 分,分差达到 48 分,优势十分明显。

第四名同样由国产模型 glm-5.2 (max) 拿下,ELO 1587 分,超过了多款 Claude、OpenAI 的旗舰模型。这意味着国产大模型在前端开发这一细分场景的能力已经走在了全球最前列。

国产模型在前端开发榜占据头部和中上游多个位置,覆盖完整梯队:

  • 月之暗面 kimi-k3 排名第 1 位,ELO 1679 分,排名稳居第一;

  • 智谱 glm-5.2 (max) 排名第 4 位,ELO 1587 分,排名保持在前五;

  • seed-2.1-pro-preview 排名第 14 位,ELO 1534 分,首次入驻榜单前半区;

  • 智谱 glm-5.1 排名第 15 位,ELO 1526 分,表现稳定;

  • 阿里 qwen3.7-max-20260517 排名第 17 位,ELO 1516 分;

  • 月之暗面 kimi-k2.6 排名第 18 位,ELO 1515 分;

排名模型厂商分数 (±CI)票数价格 ($/M) 输入 / 输出上下文
1 —🇨🇳 kimi-k3月之暗面1679 ±171757$3 / $151.05M
2 —🇺🇸 claude-fable-5Anthropic1631 ±132505$10 / $501M
3 —🇺🇸 gpt-5.6-sol-xhigh (codex-harness)OpenAI1618 ±132542$5 / $301.05M
4 —🇨🇳 glm-5.2 (max)智谱1587 ±104722$1.4 / $4.41M
5 —🇺🇸 claude-opus-4-8-thinkingAnthropic1562 ±97309$5 / $251M
6 —🇺🇸 grok-4.5SpaceXAI1558 ±132214$2 / $6500K
7 —🇺🇸 claude-opus-4-7-thinkingAnthropic1558 ±710534$5 / $251M
8 —🇺🇸 claude-opus-4-7Anthropic1555 ±79976$5 / $251M
9 —🇺🇸 claude-opus-4-6-thinkingAnthropic1542 ±612919$5 / $251M
10 —🇺🇸 claude-sonnet-5-highAnthropic1542 ±122959$2 / $101M
— 以下为 Top 10 外的国产模型 —
14 —🇨🇳 seed-2.1-pro-preview1534 ±103909N/AN/A
15 —🇨🇳 glm-5.1智谱1526 ±95870$1.4 / $4.4202.8K
17 —🇨🇳 qwen3.7-max-20260517阿里1516 ±86455$1.48 / $4.431M
18 —🇨🇳 kimi-k2.6月之暗面1515 ±79321$0.95 / $4262.1K

智能体榜

智能体榜本周全部是全新入榜模型,排名第一的是 Claude Fable 5 (High),净提升度 13.94%,同时拥有 30.65% 的最高好评 / 差评比,工具幻觉率仅 1.33% 属于较低水平。第二名 GPT 5.6 Sol (xHigh) 的可控性数值最高,达到 17.26%。头部三款模型的净提升度差距都明显大于各自的置信区间,属于表现分层的清晰格局。

国产模型 GLM 5.2 (Max) 杀入榜单 Top 10 位列第 9,净提升度为 6.24%,它的 Bash 恢复速度仅 4.45,远好于头部平均水平,命令出错后能快速恢复,表现突出。

国产模型在智能体榜覆盖靠前和中间多个位置,工具相关能力表现亮眼:

  • 智谱 glm-5.2 (max) 排名第 9 位,净提升度 6.24%,任务确认成功率 8.72%;

  • 智谱 glm-5.1 排名第 16 位,净提升度 1.19%;

  • 阿里 qwen3.7 Plus 排名第 18 位,净提升度 0.61%,工具幻觉率仅 0.19%;

  • 月之暗面 kimi-k2.7-code 排名第 20 位,净提升度 0.76%;

  • 阿里 qwen3.7 Max 排名第 21 位,净提升度 0.81%;

  • 深度求索 deepseek-v4-pro 排名第 22 位,净提升度 1.11%;

排名模型厂商净提升度 (±CI)任务确认成功率好评 / 差评比可控性会话数
1 —🇺🇸 Claude Fable 5 (High)Anthropic13.94% ±1.56%17.27%30.65%12.07%16059
2 —🇺🇸 GPT 5.6 Sol (xHigh)OpenAI10.94% ±3.76%10.93%17.64%17.26%7881
3 —🇺🇸 Claude Opus 4.8 (Thinking)Anthropic9.28% ±1.35%7.82%17.96%10.15%33392
4 —🇺🇸 GPT 5.5 (xHigh)OpenAI8.26% ±0.87%6.88%12.61%6.7%36289
5 —🇺🇸 Claude Sonnet 5 (High)Anthropic8.0% ±1.71%10.33%13.9%4.92%23640
6 —🇺🇸 Claude Opus 4.7 (Thinking)Anthropic7.73% ±1.22%5.22%11.36%9.17%34357
7 —🇺🇸 Claude Opus 4.7Anthropic7.63% ±1.22%5.28%13.38%7.56%34950
8 —🇺🇸 GPT 5.5 (High)OpenAI7.16% ±0.75%6.42%7.61%8.72%61455
9 —🇨🇳 GLM 5.2 (Max)智谱6.24% ±1.1%8.72%12.59%4.1%31993
10 —🇺🇸 GPT 5.5OpenAI6.05% ±0.72%4.33%5.53%7.99%62335
— 以下为 Top 10 外的国产模型 —
16 —🇨🇳 GLM 5.1智谱1.19% ±0.82%0.78%0.53%0.62%51362
18 —🇨🇳 Qwen3.7 Plus阿里0.61% ±1.38%1.1%4.04%2.73%10048
20 —🇨🇳 Kimi K2.7 Code月之暗面0.76% ±2.01%4.51%1.38%10.78%7468

AI 生图 & AI 视频榜

AI 生图榜本周整体格局稳定,OpenAI 的 gpt-image-2 (medium) 依然以 1385 分的 ELO 稳居第一, seedream-5.0-pro 作为最高排名的国产模型位列第 11 位,ELO 1231 分,紧随多款海外头部生图模型之后。

而在 AI 视频榜,谷歌 gemini-omni-flash 位列榜首;的 dreamina-seedance-2.0-720p 稳居第二名,ELO 分数 1482 分,表现远超多数海外视频生成模型;同时阿里 happyhorse-1.0 也拿下第 4 位,国产力量在 AI 视频生成第一梯队已经占据了重要席位

本周 Arena 榜单的最大亮点就是国产模型的多点突破,尤其是 kimi-k3 首次冲进综合榜 Top 10,并且直接登顶前端开发榜,证明国产大模型不仅在通用能力上追平第一梯队,在特定工程类任务场景已经形成了领先优势。同时字节、阿里、智谱等厂商的多款模型也在代码、生图、视频、智能体多个榜单的前半区站稳脚跟。

下周预计将有更多用户评测数据进一步积累,部分新入榜模型的排名和分数还可能出现小幅变动,值得关注后续国产模型能否在更多细分榜单拿下榜首位置。

声明:本文转载自IT 之家,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯