LiveBench Data Analysis

한 줄 요약 · 표와 데이터를 읽고 분석하는 문제를 얼마나 맞히는지

무엇을 측정하나요?
표 데이터를 다루는 실무 실력입니다. 열의 종류 알아맞히기, 표를 다른 형식(JSON·CSV·HTML)으로 바꾸기, 두 표를 이어 붙일 열 찾기처럼 데이터 분석가가 매일 하는 일입니다.
누가 어떻게 평가하나요?
Abacus.AI·뉴욕대 등 연구진이 만든 LiveBench 는 최근 대회 문제·논문·뉴스에서 매달 새 문제를 내어, AI 가 학습 중에 문제를 미리 봤을 가능성(오염)을 줄입니다. 답이 정해진 문제만 내고 프로그램이 자동 채점하며 다른 AI 가 채점하지 않습니다. 이 표는 livebench.ai 가 공개한 최신 월간 결과표를 가져오되, 최신 표에서 빠진 AI 는 마지막으로 실린 점수를 순위 없이 표 아래에 따로 보여 줍니다. 데이터 분석 과목은 Kaggle·Socrata 의 실제 공개 데이터로 만든 열 유형 판별·표 변환·표 결합 과제로 구성됩니다.
점수 읽는 법
0~100점입니다. 문항이 어렵게 설계돼 최상위 AI 도 70점을 넘기기 어려우며, 매달 문제가 바뀌므로 시점이 다른 점수는 직접 비교하지 않는 것이 좋습니다. 통계 해석이나 시각화 실력은 포함되지 않습니다.

마지막 업데이트: 2026-06-25

순위

최고 점수83.0GPT-6 Astra
측정한 모델50개
최근 갱신2026.06.25
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇OpenAIGPT-6 Astra80.7%83.01473
  2. 🥈OpenAIGPT-6.1 Sol84.0%82.21475
  3. 🥉OpenAIGPT-5.584.3%81.61485
  4. #4OpenAIGPT-6 Sol83.7%81.21446
  5. #5AnthropicClaude Fable 582.3%80.51502
  6. #6AnthropicClaude Fable 5.185.3%80.31484
  7. #7OpenAIGPT-5.6 Sol84.0%79.81485
  8. #8AnthropicClaude Opus 5.584.7%79.81489
  9. #9MetaMuse Spark 1.383.0%79.61505
  10. #10OpenAIGPT-5.6 Terra83.0%79.31467
  11. #10OpenAIGPT-5.482.0%79.31482
  12. #12DeepSeekDeepSeek V4.1 Flash84.0%79.31479
  13. #13Moonshot AIKimi K388.7%78.71487
  14. #14AnthropicClaude Sonnet 5.582.7%78.61464
  15. #15GoogleGemini 3.1 Pro82.0%78.51477
  16. #16AnthropicClaude Opus 4.778.7%78.31496
  17. #17OpenAIGPT-5.6 Luna83.7%78.01463
  18. #18AnthropicClaude Sonnet 4.680.0%78.01482
  19. #19xAIGrok 4.780.0%76.91433
  20. #20MetaMuse Spark 1.279.0%76.51514
  21. #21Z.aiGLM 5.3 Flash80.0%76.41467
  22. #22MiniMaxMiniMax M383.0%76.21448
  23. #23AnthropicClaude Opus 582.0%74.51484
  24. #24DeepSeekDeepSeek V4 Pro80.3%74.51460
  25. #25AnthropicClaude Opus 4.577.3%74.41472
  26. #26AlibabaQwen3.8 Flash79.7%74.2—
  27. #27xAIGrok 4.681.0%73.91447
  28. #28Z.aiGLM 5.278.3%73.71466
  29. #29OpenAIGPT-6 Luna83.3%73.41447
  30. #30xAIGrok 4.579.3%73.01465
  31. #31MetaMuse Spark 1.177.7%72.51493
  32. #32AlibabaQwen3.7 Max79.0%71.81458
  33. #33AnthropicClaude Sonnet 582.0%71.71465
  34. #34OpenAIGPT-5.4 Mini77.0%70.81460
  35. #34xAIGrok Build 0.1—70.8—
  36. #36Z.aiGLM 5.379.7%70.21475
  37. #37AlibabaQwen3.6 Plus78.3%69.91446
  38. #38AnthropicClaude Opus 4.678.0%69.91500
  39. #39DeepSeekDeepSeek V4 Flash79.7%68.01439
  40. #40GoogleGemini 3.7 Flash83.0%68.01483
  41. #41OpenAIGPT-5.4 Nano76.7%67.61405
  42. #42AnthropicClaude Opus 4.877.7%66.01487
  43. #43Moonshot AIKimi K2.681.0%65.11455
  44. #44GoogleGemini 3.5 Flash74.3%64.91462
  45. #45GoogleGemini 3.6 Flash80.0%63.01472
  46. #46Moonshot AIKimi K2.7 Code79.3%62.7—
  47. #47xAIGrok 4.375.0%55.81439
  48. #48NVIDIANemotron 3 Ultra79.3%54.51418
  49. #49GoogleGemini 3.8 Flash84.0%54.01481
  50. #50GoogleGemini 3.5 Flash-Lite76.0%53.31452
모델 절반이 74.3 이하최종 갱신 2026-06-25

이전 순위표 기준 점수

최신 순위표(2026.06.25)에 반영되지 않은 점수입니다. 출처에서 빠졌거나 아직 갱신되지 않은 모델로, 마지막으로 받은 점수를 참고로 보여 주며 순위는 매기지 않습니다.

  1. —
    Z.ai2026.02.11
    67.9
  2. —
    Z.ai2026.04.07
    63.2
  3. —62.9
  4. —
    Moonshot AI2026.01.27
    61.4
  5. —
    Alibaba2026.04.27
    58.8
  6. —
    Google2026.04.02
    58.8
  7. —
    OpenAI2025.08.07
    57.0
  8. —
    MiniMax2026.03.18
    56.3
  9. —
    Google2026.03.03
    54.9
  10. —
    Anthropic2025.05.22
    54.6
  11. —
    Z.ai2026.04.01
    54.1
  12. —52.2
  13. —
    Google2025.06.17
    51.6
  14. —
    OpenAI2025.08.07
    49.6
  15. —
    MiniMax2026.02.12
    49.6
  16. —
    Xiaomi2026.03.18
    49.2
  17. —
    Anthropic2025.08.05
    49.0
  18. —
    Google2025.12.17
    48.3
  19. —
    Google2025.06.17
    47.3
  20. —
    Google2025.09.25
    47.0
  21. —
    Anthropic2025.09.29
    47.0
  22. —
    Anthropic2025.10.15
    45.1
  23. —
    DeepSeek2025.12.01
    45.0
  24. —
    OpenAI2025.08.07
    44.3
  25. —
    xAI2026.03.09
    43.5
  26. —
    xAI2025.11.19
    40.6
  27. —
    Arcee AI2026.04.01
    40.3
  28. —
    OpenAI2025.08.05
    38.8
  29. —
    NVIDIA2026.03.11
    21.2

최근 60일 내 출시된 AI 37개 중 21개는 아직 이 지표에 반영되지 않았습니다 · Claude Haiku 5.5, Decider V1.1 27B, Mistral Large 4 외 18개

출처: LiveBench 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.