LMSYS Arena、LiveBench、Artificial Analysis、SWE-bench、HLE、MMLU-Pro、GPQAを含む7つの評価基準を統合 — Claude、GPT、Gemini、DeepSeekなど主要モデルを網羅
主要ベンチマークすべてを加重集計した総合ランキング—モデルの実力を多面的に評価
Unexpected token '<', "<!DOCTYPE "... is not valid JSON
データソース