τ³-Banking
한 줄 요약 · 은행 상담원처럼 규정 문서를 찾아 읽고 일을 제대로 처리하는지
- 무엇을 측정하나요?
- 은행 고객센터 상담원 역할을 얼마나 잘하는지 봅니다. 업무 규정을 미리 알려 주지 않기 때문에, AI 가 규정 문서를 스스로 찾아 읽고 그 규정대로 계좌·카드 같은 시스템 조치를 여러 단계에 걸쳐 처리해야 합니다. Artificial Analysis 가 옛 τ²-Bench 를 레거시로 돌린 뒤 쓰는 현행 평가입니다.
- 누가 어떻게 평가하나요?
- Sierra 가 만든 τ³-Bench(τ-Knowledge)의 은행(Banking) 영역입니다. 21개 상품군에 걸친 규정 문서 약 700건(약 19만 토큰)을 검색 도구로 찾아 읽어야 하고, 가상 고객과 대화가 끝난 뒤 시스템 상태가 정답과 일치하는지로 성공을 판정합니다. Artificial Analysis 가 직접 실행합니다.
- 점수 읽는 법
- 0~100%. 매우 어려워 상위 모델도 절반 안팎이고 중간값은 20% 전후입니다. 2026년 7월 채점 수정(v1.0.1) 이전 결과와는 비교할 수 없습니다.
순위
최고 점수50.7%Grok 4.6
측정한 모델79개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
컴퓨터를 직접 다뤄 전문가의 실무를 해낼 수 있을까?Agents' Last Exam
Gemini 4 Argon🥇
Gemini 4 Argon🥇작은 사업을 1년 동안 혼자 운영해 돈을 벌 수 있을까?Vending-Bench 2
GPT-6 Astra🥇
GPT-6 Astra🥇
- 🥇xAIGrok 4.6추론 강도: High50.7%—$9,047
- 🥈MetaMuse Spark 1.3추론 강도: Max50.5%32.2%—
- 🥉Z.aiGLM 5.3추론 강도: Max50.3%—$8,164
- #4AnthropicClaude Fable 5.1추론 강도: Max47.2%—$5,422
- #4Z.aiGLM 5.3 Flash47.2%——
- #6Moonshot AIKimi K3추론 강도: Max46.0%28.3%$5,165
- #7GoogleGemini 3.8 Flash추론 강도: Medium45.8%—$5,094
- #8AlibabaQwen3.8 Flash45.4%——
- #9AnthropicClaude Opus 5추론 강도: High44.7%32.2%$11,182
- #10OpenAIGPT-5.6 Sol추론 강도: Max44.3%30.6%$9,619
- #11OpenAIGPT-6 Astra추론 강도: Extra High43.1%34.2%$15,515
- #12xAIGrok 4.5추론 강도: High42.1%27.0%$3,887
- #13OpenAIGPT-5.6 Terra추론 강도: Max40.2%28.0%$7,343
- #14DeepSeekDeepSeek V4 Pro추론 강도: Max39.6%12.4%$3,285
- #14OpenAIGPT-5.4추론 강도: Extra High39.6%20.5%$6,144
- #16DeepSeekDeepSeek V4 Flash추론 강도: Max39.4%——
- #17OpenAIGPT-5.5추론 강도: Extra High39.0%26.6%$7,524
- #18AnthropicClaude Fable 5추론 강도: Max38.1%—$5,680
- #19AnthropicClaude Sonnet 5추론 강도: Max37.3%—$6,378
- #20GoogleGemini 3.7 Flash추론 강도: Medium35.5%——
- #21Motif TechnologiesMotif 335.3%——
- #22MetaMuse Spark 1.2추론 강도: Extra High34.8%——
- #23AnthropicClaude Opus 4.7추론 강도: Max34.6%21.1%$10,937
- #23Z.aiGLM 5.2추론 강도: Max34.6%20.4%$8,314
- #25AnthropicClaude Sonnet 4.6추론 강도: Max34.4%—$7,204
- #26AnthropicClaude Opus 4.8추론 강도: Max34.2%27.0%$5,787
- #27GoogleGemini 3.5 Flash추론 강도: High32.2%—$5,396
- #28MetaMuse Spark 1.1추론 강도: Extra High31.8%—$6,520
- #29OpenAIGPT-5.6 Luna추론 강도: Max31.1%30.3%$4,095
- #30GoogleGemini 3.6 Flash추론 강도: High29.9%——
- #31OpenAIGPT-5.4 Nano추론 강도: Extra High27.4%——
- #32OpenAIGPT-5.4 Mini추론 강도: Extra High25.6%——
- #33AnthropicClaude Sonnet 4.5추론 강도: Thinking24.5%—$3,839
- #34Moonshot AIKimi K2.6추론 강도: Thinking23.3%9.2%$6,205
- #34UpstageSolar Pro 423.3%——
- #36TencentHy322.9%——
- #37OpenAIGPT-5추론 강도: High22.1%——
- #38GoogleGemini 3.1 Pro21.4%16.4%$3,774
- #39GoogleGemini 3 Flash추론 강도: Thinking20.8%—$3,635
- #39AlibabaQwen3.6 Plus20.8%8.6%$5,115
- #41Moonshot AIKimi K2.7 Code20.2%—$5,083
- #42MetaMuse Spark19.6%——
- #43DeepSeekDeepSeek V3.218.8%——
- #44Ring AIRing-2.6-1T17.9%——
- #45GoogleGemini 3.5 Flash-Lite17.5%——
- #45AlibabaQwen3.7 Plus17.5%——
- #47AnthropicClaude Sonnet 4추론 강도: Thinking16.7%——
- #48SK TelecomA.X K216.1%——
- #49OpenAIGPT-5 Mini추론 강도: High15.5%—−$31
- #50MiniMaxMiniMax M315.3%—$2,158
- #51Mistral AIMistral Medium 3.515.1%——
- #52GoogleGemma 4 31B추론 강도: Thinking14.8%——
- #53LG AI ResearchK-EXAONE14.2%——
- #53Moonshot AIKimi K2.5추론 강도: Thinking14.2%—$1,198
- #53NVIDIANemotron 3 Ultra추론 강도: Thinking14.2%——
- #56Z.aiGLM-5.1추론 강도: Thinking13.6%11.5%$5,634
- #57AlibabaQwen3.5 397B A17B추론 강도: Thinking13.4%——
- #58MeituanLongCat 2.013.2%——
- #59OpenAIGPT OSS 120B추론 강도: High12.8%—−$22
- #60xAIGrok 4.3추론 강도: High12.4%7.2%$35
- #61StepfunStep 3.7 Flash12.0%——
- #62AlibabaQwen3.7 Max11.8%——
- #63LG AI ResearchK-EXAONE 2.011.5%——
- #64NVIDIANemotron 3 Super추론 강도: Thinking10.3%——
- #65XiaomiMiMo V2.5 Pro추론 강도: Thinking9.9%——
- #65MiniMaxMiniMax M2.79.9%5.9%—
- #67GoogleGemini 2.5 Pro9.7%—$574
- #67GoogleGemini 3.1 Flash Lite9.7%——
- #69AnthropicClaude Haiku 4.5추론 강도: Thinking9.3%—$459
- #69AlibabaQwen3.6 35B A3B추론 강도: Thinking9.3%——
- #71XiaomiMiMo V2.58.7%8.6%—
- #71UpstageSolar Pro 38.7%——
- #73CohereNorth Mini Code6.4%——
- #74NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking6.0%——
- #75Arcee AITrinity Large Thinking5.8%——
- #76Mistral AIMistral Small 4추론 강도: Thinking4.9%——
- #77MetaLlama 4 Maverick3.7%——
- #78MetaLlama 4 Scout3.3%——
- #79IBMGranite 4.1 8B3.1%——
모델 절반이 20.8% 이하
최근 60일 내 출시된 AI 34개 중 24개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 21개
출처: Artificial Analysis 데이터 출처·게재 중단 요청점수 해석 시 유의사항
- 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
- '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.