AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Grok 4.6, 프런티어 벤치마크 도달

Grok 4.6, 프런티어 벤치마크 도달

Artificial Analysis·2026년 8월 13일 (목)
  • •Grok 4.6은 Artificial Analysis Intelligence Index에서 61점을 기록해 GPT-5.6 Sol과 같았다
  • •Agentic 벤치마크에서 GDPval-AA v2 1753 Elo, 𝜏³-Banking 50.7%, Terminal-Bench 88.4%를 기록했다
  • •가격은 1M 토큰당 $2/$6로 유지됐고, 측정 비용은 작업당 $0.84였다
  • •Grok 4.6은 Artificial Analysis Intelligence Index에서 61점을 기록해 GPT-5.6 Sol과 같았다
  • •Agentic 벤치마크에서 GDPval-AA v2 1753 Elo, 𝜏³-Banking 50.7%, Terminal-Bench 88.4%를 기록했다
  • •가격은 1M 토큰당 $2/$6로 유지됐고, 측정 비용은 작업당 $0.84였다
  • •Grok 4.6은 Artificial Analysis Intelligence Index에서 61점을 기록해 GPT-5.6 Sol과 같았다
  • •Agentic 벤치마크에서 GDPval-AA v2 1753 Elo, 𝜏³-Banking 50.7%, Terminal-Bench 88.4%를 기록했다
  • •가격은 1M 토큰당 $2/$6로 유지됐고, 측정 비용은 작업당 $0.84였다
  • •Grok 4.6은 Artificial Analysis Intelligence Index에서 61점을 기록해 GPT-5.6 Sol과 같았다
  • •Agentic 벤치마크에서 GDPval-AA v2 1753 Elo, 𝜏³-Banking 50.7%, Terminal-Bench 88.4%를 기록했다
  • •가격은 1M 토큰당 $2/$6로 유지됐고, 측정 비용은 작업당 $0.84였다

SpaceXAI의 Grok 4.6은 2026년 8월 12일 Artificial Analysis Intelligence Index에서 61점을 기록해 GPT-5.6 Sol(max)과 같은 수준에 올랐다. 다만 Claude Opus 5(max, 63)와 Claude Fable 5(max with fallback, 62)에는 뒤졌다. 이 점수는 출시 후 한 달을 조금 넘긴 Grok 4.5보다 5점 높고, Grok 4.3보다 +23점 높아 SpaceXAI가 Artificial Analysis가 추적하는 프런티어 그룹에 복귀했다.

Grok 4.6의 가장 강한 성과는 정적 추론보다 에이전트형 작업에서 나왔다. GDPval-AA v2에서 1753 Elo를 기록해 Claude Opus 5에만 뒤졌고, 신뢰구간이 겹치기 때문에 Claude Fable 5 및 Qwen3.8 Max와 통계적으로 구분되지 않았다. 도구 사용을 포함한 다중 턴 고객 서비스 벤치마크인 𝜏³-Banking에서는 50.7%를 기록해 Qwen3.8 Max의 51.3%와 함께 상위 2개 모델에 들었다. 또한 터미널 기반 소프트웨어 작업을 평가하는 Terminal-Bench v2.1에서는 88.4%를 기록해 선두 모델들과 맞섰다.

이 모델은 Grok 4.5의 대표 가격인 1M 입력/출력 토큰당 $2/$6를 유지했다. 한편 캐시 적중 가격은 Grok 4.5의 1M 토큰당 $0.3에서 $0.5로 올랐다. Artificial Analysis는 $2/$6 가격이 Claude Opus 5의 $5/$25와 GPT-5.6 Sol의 $5/$30보다 60%+ 낮다고 밝혔다. 측정 비용은 작업당 $0.84로, 지능이 약간 더 높은 Kimi K3와 같았으며 Intelligence vs. Cost per Task 파레토 프런티어에 놓였다.

Grok 4.6은 장기 에이전트형 지식 업무를 평가하는 비공개 벤치마크 AA-Briefcase에도 처음 등장해 1577 Elo를 기록했다. Artificial Analysis는 루브릭 채점, 발표 품질, 분석 품질 전반에서 균형 잡힌 결과를 근거로 이 모델을 Fable 5급으로 평가했으며 Claude Opus 5 계열보다는 뒤에 배치했다. 이 모델은 평균 ~53턴과 ~0.5B 입력 토큰으로 작업을 완료했으며, Claude Opus 5(max)는 평균 ~103턴과 ~2.0B 입력 토큰을 사용했다. 컨텍스트 윈도우는 Grok 4.5와 같은 500k 토큰으로 유지됐다.

SpaceXAI의 Grok 4.6은 2026년 8월 12일 Artificial Analysis Intelligence Index에서 61점을 기록해 GPT-5.6 Sol(max)과 같은 수준에 올랐다. 다만 Claude Opus 5(max, 63)와 Claude Fable 5(max with fallback, 62)에는 뒤졌다. 이 점수는 출시 후 한 달을 조금 넘긴 Grok 4.5보다 5점 높고, Grok 4.3보다 +23점 높아 SpaceXAI가 Artificial Analysis가 추적하는 프런티어 그룹에 복귀했다.

Grok 4.6의 가장 강한 성과는 정적 추론보다 에이전트형 작업에서 나왔다. GDPval-AA v2에서 1753 Elo를 기록해 Claude Opus 5에만 뒤졌고, 신뢰구간이 겹치기 때문에 Claude Fable 5 및 Qwen3.8 Max와 통계적으로 구분되지 않았다. 도구 사용을 포함한 다중 턴 고객 서비스 벤치마크인 𝜏³-Banking에서는 50.7%를 기록해 Qwen3.8 Max의 51.3%와 함께 상위 2개 모델에 들었다. 또한 터미널 기반 소프트웨어 작업을 평가하는 Terminal-Bench v2.1에서는 88.4%를 기록해 선두 모델들과 맞섰다.

이 모델은 Grok 4.5의 대표 가격인 1M 입력/출력 토큰당 $2/$6를 유지했다. 한편 캐시 적중 가격은 Grok 4.5의 1M 토큰당 $0.3에서 $0.5로 올랐다. Artificial Analysis는 $2/$6 가격이 Claude Opus 5의 $5/$25와 GPT-5.6 Sol의 $5/$30보다 60%+ 낮다고 밝혔다. 측정 비용은 작업당 $0.84로, 지능이 약간 더 높은 Kimi K3와 같았으며 Intelligence vs. Cost per Task 파레토 프런티어에 놓였다.

Grok 4.6은 장기 에이전트형 지식 업무를 평가하는 비공개 벤치마크 AA-Briefcase에도 처음 등장해 1577 Elo를 기록했다. Artificial Analysis는 루브릭 채점, 발표 품질, 분석 품질 전반에서 균형 잡힌 결과를 근거로 이 모델을 Fable 5급으로 평가했으며 Claude Opus 5 계열보다는 뒤에 배치했다. 이 모델은 평균 ~53턴과 ~0.5B 입력 토큰으로 작업을 완료했으며, Claude Opus 5(max)는 평균 ~103턴과 ~2.0B 입력 토큰을 사용했다. 컨텍스트 윈도우는 Grok 4.5와 같은 500k 토큰으로 유지됐다.

원문 보기 (영어)·2026년 8월 12일
#grok 4 6#spacexai#artificial analysis#intelligence index#agentic ai#gdpval aa#terminal bench#aa briefcase#cost efficiency