xingpanai.com
全球AI大模型能力排行,基于真实人类盲测投票与API调用数据
个人认为这个开源评测矩阵做得非常好,各项垂直领域的专业刷题跑分非常硬核,故特别添加了其开源模型的详细榜单作为矩阵补充。
LLM Stats 综合大模型能力排名,基于 TrueSkill 算法
| 排名 | 模型名称 | 研发厂商 | LLM 综合总榜↑ | 开源总榜 |
|---|---|---|---|---|
| 1 | OpenAI | #1 | — | |
| 2 | Anthropic | #2 | — | |
| 3 | Anthropic | #3 | — | |
| 4 | Moonshot | #4 | 51 | |
| 5 | OpenAI | #5 | — | |
| 6 | Meta | #6 | — | |
| 7 | Anthropic | #7 | — | |
| 8 | Anthropic | #8 | — | |
| 9 | xAI | #9 | — | |
| 10 | OpenAI | #10 | — | |
| 11 | ByteDance | #11 | — | |
| 12 | Zhipu | #12 | 4 | |
| 13 | Qwen | #13 | — | |
| 14 | Anthropic | #14 | — | |
| 15 | OpenAI | #15 | — | |
| 16 | Anthropic | #16 | — | |
| 17 | OpenAI | #17 | — | |
| 18 | Moonshot | #18 | 3 | |
| 19 | ByteDance | #19 | — | |
| 20 | #20 | — | ||
| 21 | DeepSeek | #21 | 6 | |
| 22 | #22 | — | ||
| 23 | Qwen | #23 | — | |
| 24 | Tencent | #24 | 68 | |
| 25 | OpenAI | #25 | — | |
| 26 | MiniMax | #26 | 17 | |
| 27 | OpenAI | #27 | — | |
| 28 | Meta | #28 | — | |
| 29 | OpenAI | #29 | — | |
| 30 | xAI | #30 | — | |
| 31 | Zhipu | #31 | 1 | |
| 32 | Qwen | #32 | — | |
| 33 | ByteDance | #33 | — | |
| 34 | DeepSeek | #34 | 12 | |
| 35 | Moonshot | #35 | 5 | |
| 36 | Qwen | #36 | 8 | |
| 37 | #37 | — | ||
| 38 | Anthropic | #38 | — | |
| 39 | Moonshot | #39 | 20 | |
| 40 | Xiaomi | #40 | — | |
| 41 | Anthropic | #41 | — | |
| 42 | OpenAI | #42 | — | |
| 43 | Zhipu | #43 | 2 | |
| 44 | StepFun | #44 | 30 | |
| 45 | #45 | — | ||
| 46 | MiniMax | #46 | 15 | |
| 47 | Nvidia | #47 | 69 | |
| 48 | OpenAI | #48 | — | |
| 49 | OpenAI | #49 | — | |
| 50 | OpenAI | #50 | — |