全球 AI 排行榜

数据来源:LMSYS Chatbot Arena · GitHub,
每日自动更新

❓ Elo 分数是什么?为什么按它排名?

Elo 是国际象棋界发明的评分系统,用来衡量选手的相对实力。放到大模型上,衡量的就是「哪个模型更会聊天、更能干活」。

怎么算出来的:LMSYS Chatbot Arena 把两个模型匿名摆在一起回答同一个问题,真人用户在不看名字的情况下投票选出更好的那个——赢一局加分、输一局扣分,对手越强、赢得越多,和棋类评级是同一个逻辑。

为什么用它排名:这是真人盲测的结果,不是厂商自吹的跑分、也不是纸面参数。分数越高,代表在成百上千场「对决」里越常被真人选为更优;分差越大,实力差距越明显。

后面的「±」是置信区间:投票样本越少、误差越大,会随样本累积逐步收紧。

开源模型 Top 10 · 代码/推理

#模型厂商Elo 分投票
🥇1hy4-previewTencent1624.0 ±13.02.3k
🥈2glm-5.3-maxZ.ai1614.0 ±11.03.7k
🥉3deepseek-v4.1-flash-maxDeepSeek1614.0 ±17.01.4k
4glm-5.3-flashZ.ai1607.0 ±12.02.9k
5qwen3.8-27bAlibaba1593.0 ±9.04.9k
6glm-5.2-maxZ.ai1592.0 ±7.010.5k

闭源模型 Top 10 · 综合聊天

#模型厂商Elo 分投票
🥇1claude-fable-5-highAnthropic1506.0 ±5.030.1k
🥈2claude-opus-4-6-highAnthropic1505.0 ±4.072.0k
🥉3claude-opus-4-7-highAnthropic1502.0 ±4.060.0k
4muse-spark-1.2 (xHigh)Meta1500.0 ±11.03.2k
5claude-fable-5.1-maxAnthropic1498.0 ±8.05.8k
6claude-opus-4-6Anthropic1497.0 ±3.075.9k
7claude-opus-4-7Anthropic1494.0 ±4.061.1k
8muse-spark-1.3-maxMeta1493.0 ±9.04.7k
9gemini-3.8-flash-highGoogle1493.0 ±9.05.1k
10claude-opus-5-highAnthropic1493.0 ±4.042.6k
本榜为「大模型作为 AI Agent 的能力排行」,按 Net Improvement 排序,不是 Agent 产品(Operator、Manus 等)的排名。

AI Agent Top 10

#模型厂商Net Improvement会话数
🥇1Claude Fable 5.1 (Max)Anthropic13.71 ±1.7213.3k
🥈2GPT 6 Astra (Max)OpenAI11.54 ±2.1010.4k
🥉3Claude Opus 5 (High)Anthropic10.25 ±1.4124.8k
4Claude Opus 5 (Max)Anthropic10.16 ±1.5519.9k
5Claude Fable 5 (High)Anthropic8.81 ±1.2538.3k
6Claude Opus 4.8 (High)Anthropic8.19 ±1.2739.7k
7GPT 5.6 Sol (xHigh)OpenAI7.10 ±1.2832.2k
8Kimi K3 (Max)Moonshot6.22 ±0.62108.6k
9Claude Sonnet 5 (High)Anthropic5.97 ±1.6230.6k
10GPT 5.5 (xHigh)OpenAI5.03 ±0.9253.1k

视频生成 Top 10

#模型厂商Elo 分投票
🥇1gemini-omni-1.1-flashGoogle1515.0 ±15.01.8k
🥈2gemini-omni-flashGoogle1511.0 ±10.021.9k
🥉3wan3.0Alibaba1494.0 ±19.01.2k
4flux-3-videoBlack Forest Labs1494.0 ±17.01.3k
5grok-imagine-video-1.5-agentSpaceXAI1491.0 ±19.01.2k
6dreamina-seedance-2.5-720pBytedance1482.0 ±12.04.1k
7dreamina-seedance-2.0-720pBytedance1479.0 ±8.052.9k
8minimax-h3MiniMax1462.0 ±10.07.6k
9muse-videoMeta1456.0 ±15.02.2k
10happyhorse-1.0Alibaba-ATH1427.0 ±13.022.1k

AI 绘画 Top 10

#模型厂商Elo 分投票
🥇1gpt-image-2.5-sunburstOpenAI1421.0 ±13.03.1k
🥈2gpt-image-2.5-flareOpenAI1399.0 ±13.02.9k
🥉3gpt-image-2 (medium)OpenAI1381.0 ±4.078.7k
4mai-image-2.6Microsoft AI1331.0 ±7.011.2k
5grok-imagine-image-2.0 (low)SpaceXAI1315.0 ±12.02.7k
6reve-2.1Reve1301.0 ±8.07.6k
7muse-imageMeta1277.0 ±6.026.0k
8reve-2.0Reve1270.0 ±6.014.6k
9gemini-3.1-flash-image (nano-banana-2) [web-search]Google1261.0 ±5.042.0k
10seedream-5.0-proBytedance1257.0 ±4.062.4k

视觉多模态 Top 10

#模型厂商Elo 分投票
🥇1claude-fable-5-highAnthropic1310.0 ±8.011.3k
🥈2qwen3.8-maxAlibaba1302.0 ±8.08.7k
🥉3claude-opus-4-7-highAnthropic1301.0 ±7.021.1k
4claude-opus-4-7Anthropic1300.0 ±7.021.4k
5claude-opus-4-6-highAnthropic1299.0 ±7.020.8k
6muse-spark-1.3-maxMeta1294.0 ±15.01.8k
7muse-sparkMeta1294.0 ±9.05.6k
8claude-opus-4-6Anthropic1293.0 ±7.025.1k
9muse-spark-1.2 (xHigh)Meta1292.0 ±15.01.8k
10claude-opus-5-highAnthropic1289.0 ±8.011.6k

GitHub AI 开源项目 Top 10

#项目描述Star语言
🥇1openclaw/openclawThe AI that really does things. Any OS. Any Platform. The lo⭐ 389.8kTypeScript
🥈2obra/superpowersAn agentic skills framework & software development methodolo⭐ 287.2kShell
🥉3NousResearch/hermes-agentThe agent that grows with you⭐ 245.9kPython
4n8n-io/n8nFair-code workflow automation platform with native AI capabi⭐ 204.4kTypeScript
5Significant-Gravitas/AutoGPTAutoGPT is the vision of accessible AI for everyone, to use ⭐ 187.4kPython
6firecrawl/firecrawlThe context API to search, scrape, and interact with the web⭐ 180.9kTypeScript
7f/prompts.chatf.k.a. Awesome ChatGPT Prompts. Share, discover, and collect⭐ 170.4kHTML
8AUTOMATIC1111/stable-diffusion-webuiStable Diffusion web UI⭐ 165.0kPython
9Snailclimb/JavaGuideJava 面试 & 后端通用面试指南,覆盖计算机基础、数据库、分布式、高并发、系统设计与 AI 应用开发⭐ 158.6kJavaScript
10langgenius/difyBuild Agentic workflows, RAG pipelines, with rich AI model a⭐ 155.9kTypeScript