Q1 여러 시험을 종합한 실력은 어느 정도일까? AA Intelligence Index · 하위 25%89위 Q1 여러 시험을 종합한 실력은 어느 정도일까? AA Intelligence Index · 하위 25%89위 Q2 대중들이 가장 선호하는 답변을 하는 AI는? Arena Text · 하위 20%79위 Q3 여러 전문 분야의 지식을 폭넓게 갖췄을까? MMLU-Pro · 하위 25%22위
Q1 하위 25%89위 / 116 16.9 추론 강도: Thinking Q2 1414 Q3 80.0% 강도별 None 15.4 Thinking 16.9
AA Intelligence Index 알아보기 AA Intelligence Index 자세히 알아보기
Q1 고객 응대 업무를 규정에 맞게 처리할 수 있을까? τ³-Banking · 하위 14%69위 Q1 고객 응대 업무를 규정에 맞게 처리할 수 있을까? τ³-Banking · 하위 14%69위 Q2 작은 사업을 1년 동안 혼자 운영해 돈을 벌 수 있을까? Vending-Bench 2 · 하위 11%43위 Q3 고객 응대 업무를 규정에 맞게 처리할 수 있을까? TAU2 · 하위 18%66위
Q1 하위 14%69위 / 79 9.3% 추론 강도: Thinking Q2 $459 Q3 54.7% τ³-Banking 알아보기 τ³-Banking 자세히 알아보기
Q1 긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까? Long Context Reasoning · 하위 44%66위 Q1 긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까? Long Context Reasoning · 하위 44%66위 Q2 대중들이 가장 선호하는 사업 관련 답변을 하는 AI는? Arena Business, Management & Finance · 하위 24%75위 Q3 공시 자료를 찾아 재무 분석을 할 수 있을까? Finance Agent v2 · 하위 9%57위 Q1 하위 44%66위 / 115 74.3% 추론 강도: Thinking Q2 1420 Q3 31.0% Q4 60.6% Q5 28.3% Q6 10.6% Q7 0.8% Q8 32.7% Q9 1420 Q10 46.9% Q11 43.0% 강도별 None 49.7% Thinking 74.3%
Long Context Reasoning 알아보기 Long Context Reasoning 자세히 알아보기
Q1 대중들이 가장 선호하면서 틀린 말도 없는 답변을 하는 AI는? Arena Text Factuality · 하위 15%78위 Q1 대중들이 가장 선호하면서 틀린 말도 없는 답변을 하는 AI는? Arena Text Factuality · 하위 15%78위 Q2 검색 없이도 사실을 정확하게 알고 있을까? SimpleQA Verified · 하위 8%53위 Q3 여러 단계에 걸친 웹 조사를 해낼 수 있을까? Deep Research Bench · 하위 30%13위 Q1 하위 15%78위 / 90 1418 Q2 13.2% Q3 45.5% Q4 12.8% Q5 9.8% Q6 90.2% Q7 59.0 Arena Text Factuality 알아보기 Arena Text Factuality 자세히 알아보기
Q1 몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까? Terminal-Bench 4.0 · 하위 27%58위 Q1 몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까? Terminal-Bench 4.0 · 하위 27%58위 Q2 대중들이 가장 선호하는 코딩 답변을 하는 AI는? Arena Coding · 하위 28%71위 Q3 정답이 없는 최적화 문제에서 더 좋은 답을 찾을까? ALE-Bench · 하위 21%60위 Q1 하위 27%58위 / 78 0.0% 추론 강도: Thinking Q2 1481 Q3 653 Q4 44.2% Q5 27.3% Q6 43.9 Q7 1329 Q8 61.5% Q9 42.2% Q10 45.4% Q11 1464 Q12 35.5% Terminal-Bench 4.0 알아보기 Terminal-Bench 4.0 자세히 알아보기
Q1 대중들이 가장 선호하는 글쓰기·문학 답변을 하는 AI는? Arena Writing, Literature & Language · 하위 23%76위 Q1 대중들이 가장 선호하는 글쓰기·문학 답변을 하는 AI는? Arena Writing, Literature & Language · 하위 23%76위 Q2 대화가 길어질 때 대중들이 가장 선호하는 AI는? Arena Multi-turn · 하위 23%76위 Q3 형식·길이 같은 까다로운 조건을 빠짐없이 지킬까? IFBench · 하위 23%64위 Q1 하위 23%76위 / 97 1400 Q2 1425 Q3 54.3% Q4 1388 Q5 1415 Q6 1064 Q7 85.2% Q8 1389 Arena Writing, Literature & Language 알아보기 Arena Writing, Literature & Language 자세히 알아보기
Q1 여러 분야 전문가도 어려워하는 문제를 풀 수 있을까? Humanity's Last Exam · 하위 12%104위 Q1 여러 분야 전문가도 어려워하는 문제를 풀 수 있을까? Humanity's Last Exam · 하위 12%104위 Q2 연구 수준의 물리 문제를 풀 수 있을까? CritPt · 하위 9%72위 Q3 대중들이 가장 선호하는 수학 답변을 하는 AI는? Arena Math · 하위 14%82위 Q1 하위 12%104위 / 116 10.4% 추론 강도: Thinking Q2 0.0% Q3 1400 Q4 67.2% Q5 66.7% Q6 83.7 Q7 83.7% Q8 1430 Q9 1433 Q10 96.4% Q11 5.9% Q12 2.1% Q13 47.7% Q14 4.0% Q15 8.0% Q16 73.6% Q17 30.9 강도별 None 4.2% Thinking 10.4%
Humanity's Last Exam 알아보기 Humanity's Last Exam 자세히 알아보기
Q 집 안 사진 여러 장으로 평면도를 그릴 수 있을까? Blueprint-Bench 2 · 하위 11%27위
Q 집 안 사진 여러 장으로 평면도를 그릴 수 있을까? Blueprint-Bench 2 · 하위 11%27위
하위 11%27위 / 29 0.0% Blueprint-Bench 2 알아보기 Blueprint-Bench 2 자세히 알아보기
Q1 한국어로 물을 때 대중들이 가장 선호하는 AI는? Arena Korean · 하위 21%64위 Q1 한국어로 물을 때 대중들이 가장 선호하는 AI는? Arena Korean · 하위 21%64위 Q2 일본어로 물을 때 대중들이 가장 선호하는 AI는? Arena Japanese · 하위 19%62위 Q3 여러 언어로 물어도 전문 지식을 잘 쓸까? MMMLU · 하위 12%17위 Q1 하위 21%64위 / 79 1366 Q2 1361 Q3 83.0% Q4 1441 Q5 1451 Q6 1425 Q7 1416 Q8 13.7% Q9 31.2% Q10 87.0% Q11 66.9% Q12 73.3% Q13 60.4% Q14 83.0% Q15 79.7% Q16 93.5% Q17 79.6% Q18 77.0% Q19 64.0% Q20 33.3% Q21 26.0% Q22 9.0% Q23 77.0% Q24 8.8% Q25 82.0% Q26 67.0% Q27 62.0% Q28 75.0% Q29 76.0% Q30 36.3% Q31 78.8% Q32 88.7% Q33 73.7% Arena Korean 알아보기 Arena Korean 자세히 알아보기