LiveBench Data Analysis
한 줄 요약 · 표와 데이터를 읽고 분석하는 문제를 얼마나 맞히는지
- 무엇을 측정하나요?
- 표 데이터를 다루는 실무 실력입니다. 열의 종류 알아맞히기, 표를 다른 형식(JSON·CSV·HTML)으로 바꾸기, 두 표를 이어 붙일 열 찾기처럼 데이터 분석가가 매일 하는 일입니다.
- 누가 어떻게 평가하나요?
- Abacus.AI·뉴욕대 등 연구진이 만든 LiveBench 는 최근 대회 문제·논문·뉴스에서 매달 새 문제를 내어, AI 가 학습 중에 문제를 미리 봤을 가능성(오염)을 줄입니다. 답이 정해진 문제만 내고 프로그램이 자동 채점하며 다른 AI 가 채점하지 않습니다. 이 표는 livebench.ai 가 공개한 최신 월간 결과표를 가져오되, 최신 표에서 빠진 AI 는 마지막으로 실린 점수를 순위 없이 표 아래에 따로 보여 줍니다. 데이터 분석 과목은 Kaggle·Socrata 의 실제 공개 데이터로 만든 열 유형 판별·표 변환·표 결합 과제로 구성됩니다.
- 점수 읽는 법
- 0~100점입니다. 문항이 어렵게 설계돼 최상위 AI 도 70점을 넘기기 어려우며, 매달 문제가 바뀌므로 시점이 다른 점수는 직접 비교하지 않는 것이 좋습니다. 통계 해석이나 시각화 실력은 포함되지 않습니다.
마지막 업데이트: 2026-06-25
순위
최고 점수83.0GPT-6 Astra
측정한 모델50개
최근 갱신2026.06.25
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까?Long Context Reasoning
Kimi K3🥇
Kimi K3🥇대중들이 가장 선호하는 사업 관련 답변을 하는 AI는?Arena Business, Management & Finance
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇OpenAIGPT-6 Astra80.7%83.01473
- 🥈OpenAIGPT-6.1 Sol84.0%82.21475
- 🥉OpenAIGPT-5.584.3%81.61485
- #4OpenAIGPT-6 Sol83.7%81.21446
- #5AnthropicClaude Fable 582.3%80.51502
- #6AnthropicClaude Fable 5.185.3%80.31484
- #7OpenAIGPT-5.6 Sol84.0%79.81485
- #8AnthropicClaude Opus 5.584.7%79.81489
- #9MetaMuse Spark 1.383.0%79.61505
- #10OpenAIGPT-5.6 Terra83.0%79.31467
- #10OpenAIGPT-5.482.0%79.31482
- #12DeepSeekDeepSeek V4.1 Flash84.0%79.31479
- #13Moonshot AIKimi K388.7%78.71487
- #14AnthropicClaude Sonnet 5.582.7%78.61464
- #15GoogleGemini 3.1 Pro82.0%78.51477
- #16AnthropicClaude Opus 4.778.7%78.31496
- #17OpenAIGPT-5.6 Luna83.7%78.01463
- #18AnthropicClaude Sonnet 4.680.0%78.01482
- #19xAIGrok 4.780.0%76.91433
- #20MetaMuse Spark 1.279.0%76.51514
- #21Z.aiGLM 5.3 Flash80.0%76.41467
- #22MiniMaxMiniMax M383.0%76.21448
- #23AnthropicClaude Opus 582.0%74.51484
- #24DeepSeekDeepSeek V4 Pro80.3%74.51460
- #25AnthropicClaude Opus 4.577.3%74.41472
- #26AlibabaQwen3.8 Flash79.7%74.2—
- #27xAIGrok 4.681.0%73.91447
- #28Z.aiGLM 5.278.3%73.71466
- #29OpenAIGPT-6 Luna83.3%73.41447
- #30xAIGrok 4.579.3%73.01465
- #31MetaMuse Spark 1.177.7%72.51493
- #32AlibabaQwen3.7 Max79.0%71.81458
- #33AnthropicClaude Sonnet 582.0%71.71465
- #34OpenAIGPT-5.4 Mini77.0%70.81460
- #34xAIGrok Build 0.1—70.8—
- #36Z.aiGLM 5.379.7%70.21475
- #37AlibabaQwen3.6 Plus78.3%69.91446
- #38AnthropicClaude Opus 4.678.0%69.91500
- #39DeepSeekDeepSeek V4 Flash79.7%68.01439
- #40GoogleGemini 3.7 Flash83.0%68.01483
- #41OpenAIGPT-5.4 Nano76.7%67.61405
- #42AnthropicClaude Opus 4.877.7%66.01487
- #43Moonshot AIKimi K2.681.0%65.11455
- #44GoogleGemini 3.5 Flash74.3%64.91462
- #45GoogleGemini 3.6 Flash80.0%63.01472
- #46Moonshot AIKimi K2.7 Code79.3%62.7—
- #47xAIGrok 4.375.0%55.81439
- #48NVIDIANemotron 3 Ultra79.3%54.51418
- #49GoogleGemini 3.8 Flash84.0%54.01481
- #50GoogleGemini 3.5 Flash-Lite76.0%53.31452
모델 절반이 74.3 이하최종 갱신 2026-06-25
이전 순위표 기준 점수
최신 순위표(2026.06.25)에 반영되지 않은 점수입니다. 출처에서 빠졌거나 아직 갱신되지 않은 모델로, 마지막으로 받은 점수를 참고로 보여 주며 순위는 매기지 않습니다.
- —2026.02.11$2.4067.9
- —2026.04.07$3.6563.2
- —2026.03.31$2.1962.9
- —2026.01.27$2.2761.4
- —2026.04.27$0.8958.8
- —2026.04.02$0.3458.8

- —2025.08.07$7.8157.0
- —2026.03.18$0.9756.3
- —2026.03.03$1.1954.9

- —2025.05.22$1254.6
- —2026.04.01$3.3054.1
- —2025.09.15$0.4252.2
- —2025.06.17$7.8151.6

- —2025.08.07$1.5649.6
- —2026.02.12$0.9749.6
- —2026.03.18$2.5049.2

- —2025.08.05$6049.0
- —2025.12.17$2.3848.3

- —2025.06.17$1.9547.3

- —2025.09.25$0.3347.0

- —2025.09.29$1247.0
- —2025.10.15$445.1
- —2025.12.01$0.8345.0
- —2025.08.07$0.3144.3
- —2026.03.09$2.1943.5
- —2025.11.19$0.4240.6
- —2026.04.01$0.6640.3
- —2025.08.05$0.4038.8
- —2026.03.11$0.3421.2
최근 60일 내 출시된 AI 37개 중 21개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 18개
출처: LiveBench 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.