Arena平台发布2026年第34周(8月17日~8月23日)AI大模型盲测排名,本榜单基于用户匿名投票的ELO评分,反映用户主观偏好而非绝对能力测试,分榜间不宜跨榜比较。
综合榜:头部稳定,国产模型表现分化
本次综合榜头部格局保持稳定,Anthropic旗下三款模型蝉联前三,claude-fable-5以1508分位列第一,claude-opus-4-6-high、claude-opus-4-7-high分别以1504分、1502分紧随其后,三者分差在误差范围内视为接近。
本周国产模型亮点与分化并存:
1. 月之暗面kimi-k3-max上升2位至第10名,首次杀入综合榜前十,ELO得分为1489分;
2. 智谱glm-5.3-max首次入榜即位列第13名,ELO得分1487分,表现突出;
3. 阿里qwen3.8-max排名下滑明显,从第8名降至第19名;
4. 阿里qwen3.7-max-preview排名基本持平,位列第27名。
代码榜:头部微调,国产新模型首秀亮眼
代码榜头部格局出现微调,claude-opus-4-7-high升至榜首,claude-opus-4-6-high位列第二,原本的榜首claude-fable-5降至第三,三者ELO分差仅1分,误差范围内视为并列。
国产模型在代码榜的表现可圈可点:
1. 月之暗面kimi-k3-max稳定保持第6名,ELO得分1542分;
2. 智谱glm-5.3-max首次入榜即杀入前十,位列第10名,ELO得分1531分;
3. 阿里qwen3.7-max-preview排名基本持平,位列第17名;
4. 阿里qwen3.8-max排名下滑12位至第25名;
5. 小米mimo-v2.5-pro位列第27名,排名基本持平。
前端开发榜:国产模型占据核心席位
前端开发榜头部依旧稳定,claude-opus-5-max以1691分蝉联第一,国产模型在榜单中占据核心位置:
1. 月之暗面kimi-k3-max、阿里qwen3.8-max稳定占据二、三名,ELO得分分别为1674分、1669分,与榜首分差在误差范围内接近;
2. 智谱glm-5.3-max首次入榜即位列第8名;
3. 阿里qwen3.8-27b首次入榜位列第9名,两款国产新模型均进入前十;
4. 目前已有多款国产模型进入前十五,在前端开发领域竞争力显著。
AI生图榜:头部稳定,国产模型稳居前十
AI生图榜头部格局保持稳定,gpt-image-2 (medium)以1381分继续领跑,国产模型表现稳定:
1. 字节跳动seedream-5.0-pro稳定保持第8名;
2. 阿里qwen-image-3.0-pro位列第9名,两款国产模型均进入前十;
3. 腾讯hunyuan-image-3.0本周升至第29名,保持在前三十行列。
AI视频榜:字节新模型首秀即进前五
AI视频榜中,gemini-omni-flash以1512分继续排名第一,字节跳动新发布的dreamina-seedance-2.5-720p首次入榜即来到第4名,ELO得分1477分,紧随其前代产品dreamina-seedance-2.0-720p(第3名)之后,两款国产模型均进入前五,表现亮眼。此外,还有多款国产模型位列前二十。
智能体榜:国产模型跻身头部梯队
智能体榜头部依旧由Anthropic模型占据,Claude Opus 5 (High)以12.47%的净提升度保持第一,Claude Opus 5 (Max)、Claude Fable 5 (High)分列二、三名,三者差距在误差范围内视为接近。
国产模型在智能体榜的突破值得关注:
1. 月之暗面Kimi K3 (Max)上升一位至第4名,净提升度10.41%,任务确认成功率达17.97%,进入头部梯队;
2. 深度求索DeepSeek V4 Pro (High) (0813)、阿里Qwen3.8 Max两款国产模型首次入榜,分别位列第14、15名;
3. 已有多款国产模型进入前三十,头部表现已摸到第一梯队门槛。
趋势总结
本周国产AI大模型在综合、代码、前端开发、视频、智能体等多赛道迎来多点突破,新模型首秀表现亮眼,部分模型已跻身头部梯队。随着更多国产大模型新版本的发布,未来AI赛道的竞争将进一步加剧,国产模型的整体竞争力有望持续提升。