Top AI Models Ranked Across 7 Leaderboards
The best AI models (LLMs) ranked by a composite of 7 independent leaderboards: LMArena, Artificial Analysis, LLM Stats, Design Arena, Vellum, LiveBench and Vals.ai. Updated daily and cross-referenced with the most popular AI apps.
Last updated: 2026-08-13
- Claude Fable 5 by Anthropic — composite score 94.2/100 across 4 leaderboards (LMArena #1, Artificial Analysis #2, LiveBench #2, LLM Stats #3) — app: claude.ai
- Grok 4.6 by SpaceXAI — composite score 90/100 across 2 leaderboards (Vals.ai #2, Artificial Analysis #4) — app: Grok
- Claude Opus 5 by Anthropic — composite score 89.7/100 across 5 leaderboards (Vellum #1, Artificial Analysis #1, LLM Stats #2, LiveBench #3, Vals.ai #8) — app: claude.ai
- Muse Spark 1.2 by Meta — composite score 81.7/100 across 3 leaderboards (Vals.ai #3, LMArena #4, Artificial Analysis #7)
- Qwen3.8 Max by Alibaba — composite score 77.5/100 across 2 leaderboards (LMArena #5, Artificial Analysis #6) — app: Qwen
- GPT-5.6 Sol by OpenAI — composite score 73/100 across 5 leaderboards (LLM Stats #1, LiveBench #1, Artificial Analysis #3, LMArena #13, Vals.ai #14) — app: ChatGPT
- Kimi K3 by Kimi — composite score 70.5/100 across 5 leaderboards (Vellum #5, Artificial Analysis #5, LLM Stats #5, LiveBench #6, Vals.ai #12) — app: Kimi AI
- Claude Opus 4.8 by Anthropic — composite score 67.4/100 across 4 leaderboards (Vellum #3, LLM Stats #7, LiveBench #7, LMArena #11) — app: claude.ai
- GPT-5.6 Terra by OpenAI — composite score 60.4/100 across 4 leaderboards (LiveBench #5, LLM Stats #6, Artificial Analysis #8, Vals.ai #15) — app: ChatGPT
- DeepSeek V4 Flash by DeepSeek — composite score 59.4/100 across 3 leaderboards (Vals.ai #5, Vellum #8, Artificial Analysis #14) — app: Deepseek
- Claude Opus 4.6 by Anthropic — composite score 58/100 across 2 leaderboards (LMArena #2, Vellum #16) — app: claude.ai
- Gemini 3.1 Pro by Google — composite score 55.6/100 across 3 leaderboards (LMArena #8, LiveBench #8, Vellum #13) — app: Google Gemini
- Gemini 3 Pro by Google — composite score 53.7/100 across 2 leaderboards (LMArena #9, Vellum #11) — app: Google Gemini
- DeepSeek V4 Pro by DeepSeek — composite score 53.2/100 across 4 leaderboards (Vals.ai #1, Vellum #9, Artificial Analysis #11, LiveBench #20) — app: Deepseek
- Claude Sonnet 5 by Anthropic — composite score 52.2/100 across 5 leaderboards (Vellum #4, LLM Stats #9, LiveBench #9, Artificial Analysis #10, Vals.ai #18) — app: claude.ai
- Grok 4.5 by SpaceXAI — composite score 51.3/100 across 4 leaderboards (Artificial Analysis #9, LLM Stats #10, LiveBench #10, Vals.ai #11) — app: Grok
- Muse Spark 1.1 by Meta — composite score 49.6/100 across 4 leaderboards (LMArena #6, LLM Stats #8, LiveBench #11, Vals.ai #17)
- GPT 5.5 by OpenAI — composite score 48.7/100 across 4 leaderboards (LiveBench #4, LLM Stats #11, LMArena #12, Vellum #14) — app: ChatGPT
- Gemini 3.6 Flash by Google — composite score 41.3/100 across 4 leaderboards (LMArena #10, Vals.ai #10, Artificial Analysis #15, LiveBench #16) — app: Google Gemini
- Gemini 3.5 Flash by Google — composite score 35.4/100 across 3 leaderboards (LiveBench #12, LMArena #14, Vellum #15) — app: Google Gemini
- GLM 5.2 by Z AI — composite score 33.7/100 across 5 leaderboards (Vellum #6, Artificial Analysis #12, LLM Stats #13, LiveBench #17, Vals.ai #19)
- GPT 5.6 Luna by OpenAI — composite score 28.3/100 across 4 leaderboards (Artificial Analysis #13, LLM Stats #14, LiveBench #14, Vals.ai #16) — app: ChatGPT
- Inkling by Abacus.AI — composite score 18.3/100 across 3 leaderboards (Vals.ai #13, LiveBench #19, Artificial Analysis #20)
- Qwen3.7 Max by Alibaba — composite score 10.8/100 across 2 leaderboards (LLM Stats #15, LMArena #18) — app: Qwen
- Kimi K2.7 Code by Kimi — composite score 10/100 across 2 leaderboards (Artificial Analysis #18, Vals.ai #20) — app: Kimi AI