Aggregating LMSYS Arena, LiveBench, Artificial Analysis, SWE-bench, HLE, MMLU-Pro, and GPQA benchmarks — covering Claude, GPT, Gemini, DeepSeek and more
Weighted composite ranking across all major benchmarks — a holistic measure of model capability
Data SourceUnexpected token '<', "<!DOCTYPE "... is not valid JSON

检测到您的浏览器使用中文,要切换到中文版吗?