모든 벤치마크
여러 공개 리더보드에서 모은 169개 벤치마크의 AI 모델 순위
에이전트
- Finance Agent v2모델 61개자주 인용
🥇 1위
Gemini 4 Argon65.4% - SWE-Bench Pro모델 52개자주 인용제조사 발표
🥇 1위
Claude Opus 5.589.9%
- FrontierCode모델 36개자주 인용
🥇 1위
Claude Opus 5.554.6%
- DeepSWE모델 26개자주 인용
🥇 1위
Gemini 4 Argon77.9% - Agents' Last Exam모델 25개자주 인용
🥇 1위
Gemini 4 Argon39.5% - Toolathlon-Verified모델 22개자주 인용
🥇 1위
GLM 5.3 Flash78.4%
- OSWorld-Verified모델 14개자주 인용
🥇 1위
Claude Fable 586.0%
- OSWorld 2.0모델 9개자주 인용
🥇 1위
Claude Opus 544.3%
- Harvey's Legal Agent Benchmark모델 62개인용 많음
🥇 1위
Muse Spark 1.225.4%
- Legal Research Bench모델 61개인용 많음
🥇 1위
Claude Fable 5.155.3%
- Tax Agent Bench모델 55개인용 많음
🥇 1위
Claude Fable 5.177.6%
- Vending-Bench 2모델 47개인용 많음
🥇 1위
GPT-6 Astra$15,515
- APEX-Agents모델 46개인용 많음
🥇 1위
Gemini 4 Argon82.2% - BrowseComp모델 40개인용 많음제조사 발표
🥇 1위
GPT-5.6 Sol92.2%
- Finance Agent v1.1모델 37개인용 많음이전 버전
🥇 1위
Claude Opus 4.764.4%
- MCP-Atlas모델 37개인용 많음제조사 발표
🥇 1위
Muse Spark 1.290.3%
- GDP.pdf모델 33개인용 많음
🥇 1위
GPT-6 Astra34.2%
- CyberGym모델 29개인용 많음
🥇 1위
MiMo-V2.6-Flash95.1%
- Terminal-Bench 2.0모델 28개인용 많음이전 버전
🥇 1위
GPT-5.584.7%
- JobBench모델 26개인용 많음
🥇 1위
Claude Opus 565.7%
- Agents' Last Exam (CLI)모델 25개인용 많음
🥇 1위
Claude Opus 5.534.3%
- FrontierSWE모델 16개인용 많음
🥇 1위
GPT-6 Astra65.5%
- DeepSearchQA (F1)모델 15개인용 많음제조사 발표
🥇 1위
Kimi K395.0%
- Finance Agent v1모델 15개인용 많음이전 버전
🥇 1위
Claude Opus 4.660.7%
- CursorBench모델 14개인용 많음
🥇 1위
Claude Opus 5.557.8%
- DeepSearchQA모델 14개인용 많음
🥇 1위
Kimi K2.683.0%
- PostTrainBench모델 11개인용 많음
🥇 1위
Claude Fable 541.8%
- Remote Labor Index모델 11개인용 많음
🥇 1위
GPT-6 Astra20.8%
- METR Time Horizon (50%)모델 10개인용 많음
🥇 1위
Claude Opus 4.611시간 59분
- ExploitBench모델 8개인용 많음
🥇 1위
GPT-5.547.4%
- MCPMark-Verified모델 8개인용 많음
🥇 1위
Kimi K396.1%
- Terminal-Bench 3.0모델 7개인용 많음
🥇 1위
GPT-5.6 Sol34.6%
- PaperBench모델 6개인용 많음제조사 발표
🥇 1위
Kimi K2.563.5%
- OSWorld모델 5개인용 많음
🥇 1위
Claude Sonnet 4.672.1%
- SWE-Lancer모델 3개인용 많음제조사 발표
🥇 1위
GPT-555.0%
- SWE-bench Verified모델 29개변별력 낮음
🥇 1위
Claude Opus 4.783.5%
- Cybench모델 6개
🥇 1위
Claude Opus 4.693.0%
- TheAgentCompany모델 1개갱신 멈춤
🥇 1위
Claude Sonnet 433.1%
- Deep Research Bench (FutureSearch)모델 17개
🥇 1위
Claude Opus 4.655.3%
- MCPMark모델 12개이전 버전
🥇 1위
GPT-552.6%
- GDPval (OpenAI)모델 5개갱신 멈춤
🥇 1위
Claude Opus 4.545.5%
- τ²-bench Airline모델 5개
🥇 1위
Claude Opus 4.584.0%
- τ²-bench Retail모델 5개
🥇 1위
Qwen3.5 397B A17B84.4%
- OSWorld 2.0 (offline)모델 2개
🥇 1위
Claude Opus 548.6%
코딩
추론
- ARC-AGI-2모델 50개자주 인용
🥇 1위
GPT-6 Astra95.0%
- ARC-AGI-1모델 50개인용 많음변별력 낮음
🥇 1위
Claude Opus 5.598.5%
- SimpleBench모델 40개인용 많음
🥇 1위
Claude Fable 581.9%
- DTBench모델 71개
🥇 1위
Claude Opus 5.598.9%
- LMCA모델 70개
🥇 1위
Claude Opus 5.568.2
- Mystery Game Puzzles모델 54개
🥇 1위
GPT-6 Astra84.0%
- Ko-ARC-AGI모델 48개한국어
🥇 1위
GPT-5.6 Terra97.0%
- EnigmaEval모델 19개
🥇 1위
Claude Fable 539.3%
- Swallow Leaderboard — English (avg)모델 8개
🥇 1위
Gemma 4 31B87.4%
수학
- FrontierMath Tiers 1-3 v2모델 58개자주 인용
🥇 1위
GPT-6.1 Sol93.7%
- FrontierMath Tier 4 v2모델 50개자주 인용
🥇 1위
GPT-6.1 Sol100.0%
- AIME 2026모델 16개자주 인용
🥇 1위
GPT-5.5100.0%
- OTIS Mock AIME 2024-2025모델 70개인용 많음
🥇 1위
Claude Fable 5.1100.0%
- IMO-AnswerBench모델 20개인용 많음제조사 발표
🥇 1위
Nemotron 3 Ultra92.3%
- MathArena Apex 2025모델 20개인용 많음
🥇 1위
Claude Opus 4.881.3%
- HMMT February 2026모델 16개인용 많음
🥇 1위
GPT-5.598.5%
- USAMO 2026 (proofs)모델 7개인용 많음
🥇 1위
GPT-5.598.2%
- MATH Level 5모델 10개변별력 낮음
🥇 1위
GPT-598.1%
- ProofBench (Vals)모델 65개
🥇 1위
Claude Fable 5.1100.0%
- HRM8K모델 48개한국어
🥇 1위
Gemini 3 Flash97.0% - Ko-AIME 2025모델 48개한국어
🥇 1위
GPT-5.5100.0%
- FrontierMath Tiers 1-3 (2025-02)모델 32개이전 버전
🥇 1위
GPT-5.4 Pro50.0%
- FrontierMath Tier 4 (2025-07)모델 29개이전 버전
🥇 1위
Claude Opus 4.831.3%
- MathArena Apex Shortlist 2025모델 18개
🥇 1위
GPT-5.598.4%
- MathArena Visual Math모델 11개
🥇 1위
GPT-5.594.9%
- BRUMO 2025모델 8개
🥇 1위
Gemini 3 Flash100.0% - CMIMC 2025모델 8개
🥇 1위
GLM-592.5%
- HMMT February 2025모델 8개
🥇 1위
Gemini 3 Flash97.5% - PolyMath (Japanese, HT)모델 8개일본어
🥇 1위
GPT-5.477.6%
- SMT 2025모델 8개
🥇 1위
Gemini 3 Flash92.9% - HMMT November 2025모델 7개
🥇 1위
GLM-594.2%
- FrontierMath: Erdős Problems모델 5개
🥇 1위
GPT-6 Astra2.9%
- IMO 2025 (proofs)모델 2개
🥇 1위
GPT-538.1%
- USAMO 2025 (proofs)모델 1개
🥇 1위
Gemini 2.5 Pro24.4%
지식
- MedCode모델 72개인용 많음
🥇 1위
Claude Opus 563.6%
- KMMLU-Pro모델 48개인용 많음한국어
🥇 1위
Claude Opus 4.895.0%
- Humanity's Last Exam (with tools)모델 44개인용 많음제조사 발표
🥇 1위
Claude Opus 5.567.7%
- HealthBench Professional모델 21개인용 많음제조사 발표
🥇 1위
Claude Opus 5.565.6%
- HealthBench모델 12개인용 많음제조사 발표
🥇 1위
Claude Opus 5.560.6%
- HealthBench Hard모델 9개인용 많음제조사 발표
🥇 1위
Muse Spark42.8%
- MMLU모델 1개변별력 낮음
🥇 1위
Nova 2 Lite77.0%
- HAE-RAE Bench v1 (Reading)모델 48개한국어
🥇 1위
GPT-5.6 Luna93.0%
- KMMLU모델 48개한국어
🥇 1위
Gemini 3.1 Pro94.0% - Ko-HLE모델 48개한국어
🥇 1위
Claude Fable 553.1%
- JamC-QA모델 8개일본어
🥇 1위
GPT-5.489.1%
과학
긴 문서
사실성
- SimpleQA Verified모델 56개인용 많음
🥇 1위
GPT-6 Astra75.6%
- FACTS Benchmark Suite모델 31개인용 많음
🥇 1위
GPT-6 Astra75.7%
- SimpleQA Verified (Kaggle)모델 27개인용 많음
🥇 1위
Gemini 3.1 Pro77.5% - Arena Text Factuality모델 90개
🥇 1위
Gemini 4 Argon1511 - Ko-TruthfulQA모델 48개한국어
🥇 1위
Claude Fable 598.0%
- FACTS Grounding모델 31개
🥇 1위
GPT-6 Sol85.2%
- FACTS Multimodal모델 31개
🥇 1위
Gemini 3.8 Flash50.7% - FACTS Parametric모델 30개
🥇 1위
GPT-6 Astra83.1%
- FACTS Search모델 17개
🥇 1위
GPT-6 Astra89.9%
지시 따르기
다국어
- Nejumi LLM Leaderboard 4모델 62개인용 많음일본어
🥇 1위
Claude Opus 587.2%
- Horangi 4 (Korean LLM Leaderboard)모델 49개인용 많음한국어
🥇 1위
Gemini 3.1 Pro84.1% - Global-MMLU-Lite모델 23개인용 많음
🥇 1위
Claude Opus 595.7%
- MMMLU모델 18개인용 많음제조사 발표
🥇 1위
Gemini 3.1 Pro92.6% - Swallow Leaderboard — Japanese (avg)모델 8개인용 많음일본어
🥇 1위
GPT-5.471.7%
- CLIcK모델 3개인용 많음제조사 발표한국어
🥇 1위
A.X K291.6% - jaster (0-shot)모델 62개일본어
🥇 1위
GPT-5.588.0%
- Nejumi 4 — GLP (general language)모델 62개일본어
🥇 1위
Claude Opus 586.7%
- Horangi 4 — GLP (general language)모델 49개한국어
🥇 1위
Claude Fable 583.9%
- KoBALT-700 (semantics)모델 48개한국어
🥇 1위
Gemini 3.1 Pro91.0% - KoBALT-700 (syntax)모델 48개한국어
🥇 1위
GPT-5.6 Sol90.0%
- Global-MMLU-Lite (Japanese)모델 23개일본어
🥇 1위
Claude Opus 596.0%
- Global-MMLU-Lite (Korean)모델 23개한국어
🥇 1위
Claude Opus 595.5%
멀티모달
- MMMU-Pro모델 37개자주 인용제조사 발표
🥇 1위
Gemini 3.5 Flash83.6% - ZeroBench모델 41개인용 많음
🥇 1위
GPT-6 Astra52.0%
- CharXiv (Reasoning)모델 31개인용 많음제조사 발표
🥇 1위
Kimi K391.3%
- Blueprint-Bench 2모델 29개인용 많음
🥇 1위
Gemini 4 Argon54.4% - ScreenSpot-Pro모델 13개인용 많음제조사 발표
🥇 1위
GPT-6 Astra92.7%
- Chartography모델 6개인용 많음제조사 발표
🥇 1위
Gemini 4 Argon71.6% - Furniture Assembly모델 27개
🥇 1위
Claude Opus 5.583.3%
- ZeroBench (sub-questions)모델 12개
🥇 1위
GPT-5 Mini27.8%
- VPCT모델 10개
🥇 1위
Gemini 3 Flash72.6% - GeoBench모델 7개
🥇 1위
Gemini 3 Flash88.0% - SpatialViz-Bench모델 4개
🥇 1위
Gemini 2.5 Pro44.7% - MindCube모델 1개
🥇 1위
Claude Sonnet 444.8%