Q1 여러 시험을 종합한 실력은 어느 정도일까? AA Intelligence Index · 하위 45%65위 Q1 여러 시험을 종합한 실력은 어느 정도일까? AA Intelligence Index · 하위 45%65위 Q2 대중들이 가장 선호하는 답변을 하는 AI는? Arena Text · 하위 42%58위 Q3 외운 답이 아니라 처음 보는 문제도 잘 풀까? LiveBench Overall · 하위 8%47위
Q1 하위 45%65위 / 116 24.1 추론 강도: Extra High Q2 1447 Q3 66.4 강도별 None 11.1 Medium 19.7 Extra High 24.1
AA Intelligence Index 알아보기 AA Intelligence Index 자세히 알아보기
Q1 고객 응대 업무를 규정에 맞게 처리할 수 있을까? τ³-Banking · 상위 41%32위 Q1 고객 응대 업무를 규정에 맞게 처리할 수 있을까? τ³-Banking · 상위 41%32위 Q2 고객 응대 업무를 규정에 맞게 처리할 수 있을까? TAU2 · 하위 41%48위 Q3 필요한 도구를 골라 제대로 쓸 수 있을까? MCP-Atlas · 하위 14%33위
Q1 상위 41%32위 / 79 25.6% 추론 강도: Extra High Q2 83.3% Q3 57.7% τ³-Banking 알아보기 τ³-Banking 자세히 알아보기
Q1 긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까? Long Context Reasoning · 하위 50%59위 Q1 긴 문서 여러 개에 흩어진 정보를 모아 답할 수 있을까? Long Context Reasoning · 하위 50%59위 Q2 표를 읽고 원하는 형태로 정리할 수 있을까? LiveBench Data Analysis · 하위 34%34위 Q3 대중들이 가장 선호하는 사업 관련 답변을 하는 AI는? Arena Business, Management & Finance · 상위 47%45위 Q1 하위 50%59위 / 115 77.0% 추론 강도: Extra High Q2 70.8 Q3 1460 Q4 45.4% Q5 60.9% Q6 36.6% Q7 12.5% Q8 0.0% Q9 53.4% 강도별 None 37.0% Medium 67.0% Extra High 77.0%
Long Context Reasoning 알아보기 Long Context Reasoning 자세히 알아보기
Q1 대중들이 가장 선호하면서 틀린 말도 없는 답변을 하는 AI는? Arena Text Factuality · 하위 44%52위 Q1 대중들이 가장 선호하면서 틀린 말도 없는 답변을 하는 AI는? Arena Text Factuality · 하위 44%52위 Q2 검색 없이도 사실을 정확하게 알고 있을까? SimpleQA Verified · 하위 13%50위 Q3 여러 단계에 걸친 웹 조사를 해낼 수 있을까? Deep Research Bench · 하위 12%16위 Q1 하위 44%52위 / 90 1447 Q2 29.4% Q3 36.3% Q4 41.5% Q5 5.5% Q6 94.5% Q7 57.6 Arena Text Factuality 알아보기 Arena Text Factuality 자세히 알아보기
Q1 몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까? Terminal-Bench 4.0 · 하위 50%40위 Q1 몇 시간 걸리는 개발 일도 컴퓨터를 직접 다루며 혼자 끝낼까? Terminal-Bench 4.0 · 하위 50%40위 Q2 대중들이 가장 선호하는 코딩 답변을 하는 AI는? Arena Coding · 하위 38%62위 Q3 코드를 실행해 보며 고쳐 과제를 끝낼 수 있을까? LiveBench Agentic Coding · 하위 16%43위 Q1 하위 50%40위 / 78 2.0% 추론 강도: Extra High Q2 1495 Q3 41.7 Q4 1189 Q5 54.4% Q6 59.2% Q7 52.3% Q8 56.1 Q9 1397 Q10 52.1% Q11 71.6 Q12 27.0% Q13 60.3% Q14 1485 Terminal-Bench 4.0 알아보기 Terminal-Bench 4.0 자세히 알아보기
Q1 대중들이 가장 선호하는 글쓰기·문학 답변을 하는 AI는? Arena Writing, Literature & Language · 하위 40%60위 Q1 대중들이 가장 선호하는 글쓰기·문학 답변을 하는 AI는? Arena Writing, Literature & Language · 하위 40%60위 Q2 대화가 길어질 때 대중들이 가장 선호하는 AI는? Arena Multi-turn · 상위 48%46위 Q3 형식·길이 같은 까다로운 조건을 빠짐없이 지킬까? IFBench · 상위 35%28위 Q1 하위 40%60위 / 97 1423 Q2 1466 Q3 73.3% Q4 1401 Q5 1434 Q6 71.0 Q7 1409 Q8 59.8 Arena Writing, Literature & Language 알아보기 Arena Writing, Literature & Language 자세히 알아보기
Q1 여러 분야 전문가도 어려워하는 문제를 풀 수 있을까? Humanity's Last Exam · 하위 41%70위 Q1 여러 분야 전문가도 어려워하는 문제를 풀 수 있을까? Humanity's Last Exam · 하위 41%70위 Q2 연구 수준의 물리 문제를 풀 수 있을까? CritPt · 하위 47%43위 Q3 대중들이 가장 선호하는 수학 답변을 하는 AI는? Arena Math · 하위 38%60위 Q1 하위 41%70위 / 116 28.1% 추론 강도: Extra High Q2 10.0% Q3 1439 Q4 87.5% Q5 88.9% Q6 78.5 Q7 51.2% Q8 9.8% Q9 21.0% Q10 1465 Q11 1452 Q12 71.3 Q13 28.3% Q14 2.1% Q15 63.7% Q16 18.9% Q17 24.0% Q18 11.0% Q19 80.0% Q20 40.8 강도별 None 5.9% Medium 18.6% Extra High 28.1%
Humanity's Last Exam 알아보기 Humanity's Last Exam 자세히 알아보기
Q1 대중들이 가장 선호하는 사진·도표 답변을 하는 AI는? Arena Vision · 하위 26%44위 Q1 대중들이 가장 선호하는 사진·도표 답변을 하는 AI는? Arena Vision · 하위 26%44위 Q2 대학 수준의 그림·도표 문제를 풀 수 있을까? MMMU-Pro · 하위 46%21위
Q1 하위 26%44위 / 58 1245 Q2 76.6% Arena Vision 알아보기 Arena Vision 자세히 알아보기
Q1 한국어로 물을 때 대중들이 가장 선호하는 AI는? Arena Korean · 하위 37%51위 Q1 한국어로 물을 때 대중들이 가장 선호하는 AI는? Arena Korean · 하위 37%51위 Q2 일본어로 물을 때 대중들이 가장 선호하는 AI는? Arena Japanese · 하위 39%47위 Q3 까다로운 질문에서 대중들이 가장 선호하는 AI는? Arena Hard Prompts · 하위 42%58위 Q1 하위 37%51위 / 79 1393 Q2 1409 Q3 1469 Q4 1480 Q5 1451 Q6 1457 Q7 89.0% Q8 75.7% Q9 75.9% Q10 75.6% Q11 96.0% Q12 92.5% Q13 94.2% Q14 83.7% Q15 563 Q16 308 Q17 93 Q18 -0.06 Q19 88.0% Q20 77.0% Q21 96.7% Q22 68.7% Q23 28.0% Q24 82.0% Q25 8.7% Q26 81.0% Q27 71.0% Q28 76.0% Q29 95.0% Q30 52.0% Q31 45.7% Q32 77.8% Q33 84.0% Q34 75.8% Q35 11.0% Arena Korean 알아보기 Arena Korean 자세히 알아보기