รวบรวมเกณฑ์มาตรฐาน LMSYS Arena, LiveBench, Artificial Analysis, SWE-bench, HLE, MMLU-Pro และ GPQA — ครอบคลุม Claude, GPT, Gemini, DeepSeek และอื่นๆ
การจัดอันดับแบบถ่วงน้ำหนักจากทุกเบนช์มาร์กหลัก — การวัดความสามารถของโมเดลแบบองค์รวม
แหล่งข้อมูลUnexpected token '<', "<!DOCTYPE "... is not valid JSON
