τ³-Banking

한 줄 요약 · 은행 상담원처럼 규정 문서를 찾아 읽고 일을 제대로 처리하는지

무엇을 측정하나요?
은행 고객센터 상담원 역할을 얼마나 잘하는지 봅니다. 업무 규정을 미리 알려 주지 않기 때문에, AI 가 규정 문서를 스스로 찾아 읽고 그 규정대로 계좌·카드 같은 시스템 조치를 여러 단계에 걸쳐 처리해야 합니다. Artificial Analysis 가 옛 τ²-Bench 를 레거시로 돌린 뒤 쓰는 현행 평가입니다.
누가 어떻게 평가하나요?
Sierra 가 만든 τ³-Bench(τ-Knowledge)의 은행(Banking) 영역입니다. 21개 상품군에 걸친 규정 문서 약 700건(약 19만 토큰)을 검색 도구로 찾아 읽어야 하고, 가상 고객과 대화가 끝난 뒤 시스템 상태가 정답과 일치하는지로 성공을 판정합니다. Artificial Analysis 가 직접 실행합니다.
점수 읽는 법
0~100%. 매우 어려워 상위 모델도 절반 안팎이고 중간값은 20% 전후입니다. 2026년 7월 채점 수정(v1.0.1) 이전 결과와는 비교할 수 없습니다.

순위

최고 점수50.7%Grok 4.6
측정한 모델79개
모델 출시 시기 (오른쪽이 최신)
그때까지의 최고 기록위로 갈수록 좋음
  1. 🥇xAIGrok 4.6추론 강도: High50.7%—$9,047
  2. 🥈MetaMuse Spark 1.3추론 강도: Max50.5%32.2%—
  3. 🥉Z.aiGLM 5.3추론 강도: Max50.3%—$8,164
  4. #4AnthropicClaude Fable 5.1추론 강도: Max47.2%—$5,422
  5. #4Z.aiGLM 5.3 Flash47.2%——
  6. #6Moonshot AIKimi K3추론 강도: Max46.0%28.3%$5,165
  7. #7GoogleGemini 3.8 Flash추론 강도: Medium45.8%—$5,094
  8. #8AlibabaQwen3.8 Flash45.4%——
  9. #9AnthropicClaude Opus 5추론 강도: High44.7%32.2%$11,182
  10. #10OpenAIGPT-5.6 Sol추론 강도: Max44.3%30.6%$9,619
  11. #11OpenAIGPT-6 Astra추론 강도: Extra High43.1%34.2%$15,515
  12. #12xAIGrok 4.5추론 강도: High42.1%27.0%$3,887
  13. #13OpenAIGPT-5.6 Terra추론 강도: Max40.2%28.0%$7,343
  14. #14DeepSeekDeepSeek V4 Pro추론 강도: Max39.6%12.4%$3,285
  15. #14OpenAIGPT-5.4추론 강도: Extra High39.6%20.5%$6,144
  16. #16DeepSeekDeepSeek V4 Flash추론 강도: Max39.4%——
  17. #17OpenAIGPT-5.5추론 강도: Extra High39.0%26.6%$7,524
  18. #18AnthropicClaude Fable 5추론 강도: Max38.1%—$5,680
  19. #19AnthropicClaude Sonnet 5추론 강도: Max37.3%—$6,378
  20. #20GoogleGemini 3.7 Flash추론 강도: Medium35.5%——
  21. #21Motif TechnologiesMotif 335.3%——
  22. #22MetaMuse Spark 1.2추론 강도: Extra High34.8%——
  23. #23AnthropicClaude Opus 4.7추론 강도: Max34.6%21.1%$10,937
  24. #23Z.aiGLM 5.2추론 강도: Max34.6%20.4%$8,314
  25. #25AnthropicClaude Sonnet 4.6추론 강도: Max34.4%—$7,204
  26. #26AnthropicClaude Opus 4.8추론 강도: Max34.2%27.0%$5,787
  27. #27GoogleGemini 3.5 Flash추론 강도: High32.2%—$5,396
  28. #28MetaMuse Spark 1.1추론 강도: Extra High31.8%—$6,520
  29. #29OpenAIGPT-5.6 Luna추론 강도: Max31.1%30.3%$4,095
  30. #30GoogleGemini 3.6 Flash추론 강도: High29.9%——
  31. #31OpenAIGPT-5.4 Nano추론 강도: Extra High27.4%——
  32. #32OpenAIGPT-5.4 Mini추론 강도: Extra High25.6%——
  33. #33AnthropicClaude Sonnet 4.5추론 강도: Thinking24.5%—$3,839
  34. #34Moonshot AIKimi K2.6추론 강도: Thinking23.3%9.2%$6,205
  35. #34UpstageSolar Pro 423.3%——
  36. #36TencentHy322.9%——
  37. #37OpenAIGPT-5추론 강도: High22.1%——
  38. #38GoogleGemini 3.1 Pro21.4%16.4%$3,774
  39. #39GoogleGemini 3 Flash추론 강도: Thinking20.8%—$3,635
  40. #39AlibabaQwen3.6 Plus20.8%8.6%$5,115
  41. #41Moonshot AIKimi K2.7 Code20.2%—$5,083
  42. #42MetaMuse Spark19.6%——
  43. #43DeepSeekDeepSeek V3.218.8%——
  44. #44Ring AIRing-2.6-1T17.9%——
  45. #45GoogleGemini 3.5 Flash-Lite17.5%——
  46. #45AlibabaQwen3.7 Plus17.5%——
  47. #47AnthropicClaude Sonnet 4추론 강도: Thinking16.7%——
  48. #48SK TelecomA.X K216.1%——
  49. #49OpenAIGPT-5 Mini추론 강도: High15.5%—−$31
  50. #50MiniMaxMiniMax M315.3%—$2,158
  51. #51Mistral AIMistral Medium 3.515.1%——
  52. #52GoogleGemma 4 31B추론 강도: Thinking14.8%——
  53. #53LG AI ResearchK-EXAONE14.2%——
  54. #53Moonshot AIKimi K2.5추론 강도: Thinking14.2%—$1,198
  55. #53NVIDIANemotron 3 Ultra추론 강도: Thinking14.2%——
  56. #56Z.aiGLM-5.1추론 강도: Thinking13.6%11.5%$5,634
  57. #57AlibabaQwen3.5 397B A17B추론 강도: Thinking13.4%——
  58. #58MeituanLongCat 2.013.2%——
  59. #59OpenAIGPT OSS 120B추론 강도: High12.8%—−$22
  60. #60xAIGrok 4.3추론 강도: High12.4%7.2%$35
  61. #61StepfunStep 3.7 Flash12.0%——
  62. #62AlibabaQwen3.7 Max11.8%——
  63. #63LG AI ResearchK-EXAONE 2.011.5%——
  64. #64NVIDIANemotron 3 Super추론 강도: Thinking10.3%——
  65. #65XiaomiMiMo V2.5 Pro추론 강도: Thinking9.9%——
  66. #65MiniMaxMiniMax M2.79.9%5.9%—
  67. #67GoogleGemini 2.5 Pro9.7%—$574
  68. #67GoogleGemini 3.1 Flash Lite9.7%——
  69. #69AnthropicClaude Haiku 4.5추론 강도: Thinking9.3%—$459
  70. #69AlibabaQwen3.6 35B A3B추론 강도: Thinking9.3%——
  71. #71XiaomiMiMo V2.58.7%8.6%—
  72. #71UpstageSolar Pro 38.7%——
  73. #73CohereNorth Mini Code6.4%——
  74. #74NVIDIANemotron 3 Nano 30B A3B추론 강도: Thinking6.0%——
  75. #75Arcee AITrinity Large Thinking5.8%——
  76. #76Mistral AIMistral Small 4추론 강도: Thinking4.9%——
  77. #77MetaLlama 4 Maverick3.7%——
  78. #78MetaLlama 4 Scout3.3%——
  79. #79IBMGranite 4.1 8B3.1%——
모델 절반이 20.8% 이하

최근 60일 내 출시된 AI 34개 중 24개는 아직 이 지표에 반영되지 않았습니다 · Mistral Large 4, Clef, Perplexity Decider v1 27B 외 21개

출처: Artificial Analysis 데이터 출처·게재 중단 요청

점수 해석 시 유의사항

  • 사전에 정해진 방식으로 일괄 측정한 점수이므로, 실제 사용 환경의 결과와 다를 수 있습니다.
  • '제조사 발표' 표시가 있는 점수는 AI 개발사가 자체 발표한 수치로, 제3자 측정값이 아닙니다.