AI 비교AI 찾기AI 뉴스AI 강의
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Minecraft 데모는 벤치마크가 아니다

Minecraft 데모는 벤치마크가 아니다

kuber.studio·2026년 9월 7일 (월)
  • •Kuber.studio는 한 번의 프롬프트로 Minecraft를 재현하는 일이 능력 벤치마크가 아닌 데모-벤치마크라고 지적했다
  • •GPT Astra 출시 반응은 1시간 안에 Minecraft와 SVG 데모 등 바이럴 과제 5개를 반복했다
  • •저자는 LiveBench, ARC-AGI, Humanity’s Last Exam처럼 숨겨지거나 순환되는 평가를 더 강한 기준으로 제시했다
  • •Kuber.studio는 한 번의 프롬프트로 Minecraft를 재현하는 일이 능력 벤치마크가 아닌 데모-벤치마크라고 지적했다
  • •GPT Astra 출시 반응은 1시간 안에 Minecraft와 SVG 데모 등 바이럴 과제 5개를 반복했다
  • •저자는 LiveBench, ARC-AGI, Humanity’s Last Exam처럼 숨겨지거나 순환되는 평가를 더 강한 기준으로 제시했다
  • •Kuber.studio는 한 번의 프롬프트로 Minecraft를 재현하는 일이 능력 벤치마크가 아닌 데모-벤치마크라고 지적했다
  • •GPT Astra 출시 반응은 1시간 안에 Minecraft와 SVG 데모 등 바이럴 과제 5개를 반복했다
  • •저자는 LiveBench, ARC-AGI, Humanity’s Last Exam처럼 숨겨지거나 순환되는 평가를 더 강한 기준으로 제시했다
  • •Kuber.studio는 한 번의 프롬프트로 Minecraft를 재현하는 일이 능력 벤치마크가 아닌 데모-벤치마크라고 지적했다
  • •GPT Astra 출시 반응은 1시간 안에 Minecraft와 SVG 데모 등 바이럴 과제 5개를 반복했다
  • •저자는 LiveBench, ARC-AGI, Humanity’s Last Exam처럼 숨겨지거나 순환되는 평가를 더 강한 기준으로 제시했다

Kuber.studio는 2026년 9월 6일 “Recreating Minecraft Is Not a Benchmark”를 공개하고, 한 번의 프롬프트로 Minecraft를 재현하는 바이럴 AI 출시 데모가 더 이상 모델 능력을 안정적으로 측정하지 못한다고 주장했다. 게시물에 따르면 GPT Astra는 “며칠 전” 출시됐고, 1시간 안에 저자의 피드에는 같은 5가지 예시가 반복됐다. Minecraft 재현, MS Paint 자화상, 자전거를 타는 펠리컨 SVG, 그럴듯한 중력으로 회전하는 상자 안에서 튀는 공, SVG 게임 컨트롤러였다.

저자는 이런 예시를 “데모-벤치마크”라고 부른다. 넓은 독자가 쉽게 이해할 수 있는 시각 과제이지만, 범위가 충분히 유한해 다음 모델이 “완벽”해질 수 있는 대상이라는 뜻이다. 게시물은 고정되고 유명한 목표에 8주의 준비 시간이 더해지면 AI 연구소가 해당 시연에 직접 최적화할 수 있으며, 따라서 결과는 일반 능력보다 출시 준비 상태를 더 많이 측정한다고 주장했다.

게시물에 따르면 같은 문제는 공개 평가에서도 나타난다. Thinking Machines의 Inkling Small은 파라미터가 플래그십 형제 모델의 3분의 1 미만인데도 Artificial Analysis Intelligence Index에서 1점 이내의 점수를 기록했고, Humanity’s Last Exam, GPQA Diamond, SciCode에서는 이를 앞섰다. 저자는 공개적이고 정적이며 유명한 테스트 세트가 학습 데이터와 미세조정 선택에 흘러들 수 있다고 말한다.

게시물은 더 강한 대안으로 순환형 또는 비공개 평가를 지목했다. LiveBench는 질문을 순환하고, ARC-AGI는 비공개 세트를 유지하며, Humanity’s Last Exam은 일부를 공개하지 않는다. 저자는 자전거에 마침내 페달이나 애니메이션이 생기면 소셜미디어가 빠르게 알아차릴 수 있어 강한 데모도 중요하다고 본다. 다만 데모-벤치마크를 모델 품질 채점에 사용해서는 안 된다고 주장했다.

Kuber.studio는 2026년 9월 6일 “Recreating Minecraft Is Not a Benchmark”를 공개하고, 한 번의 프롬프트로 Minecraft를 재현하는 바이럴 AI 출시 데모가 더 이상 모델 능력을 안정적으로 측정하지 못한다고 주장했다. 게시물에 따르면 GPT Astra는 “며칠 전” 출시됐고, 1시간 안에 저자의 피드에는 같은 5가지 예시가 반복됐다. Minecraft 재현, MS Paint 자화상, 자전거를 타는 펠리컨 SVG, 그럴듯한 중력으로 회전하는 상자 안에서 튀는 공, SVG 게임 컨트롤러였다.

저자는 이런 예시를 “데모-벤치마크”라고 부른다. 넓은 독자가 쉽게 이해할 수 있는 시각 과제이지만, 범위가 충분히 유한해 다음 모델이 “완벽”해질 수 있는 대상이라는 뜻이다. 게시물은 고정되고 유명한 목표에 8주의 준비 시간이 더해지면 AI 연구소가 해당 시연에 직접 최적화할 수 있으며, 따라서 결과는 일반 능력보다 출시 준비 상태를 더 많이 측정한다고 주장했다.

게시물에 따르면 같은 문제는 공개 평가에서도 나타난다. Thinking Machines의 Inkling Small은 파라미터가 플래그십 형제 모델의 3분의 1 미만인데도 Artificial Analysis Intelligence Index에서 1점 이내의 점수를 기록했고, Humanity’s Last Exam, GPQA Diamond, SciCode에서는 이를 앞섰다. 저자는 공개적이고 정적이며 유명한 테스트 세트가 학습 데이터와 미세조정 선택에 흘러들 수 있다고 말한다.

게시물은 더 강한 대안으로 순환형 또는 비공개 평가를 지목했다. LiveBench는 질문을 순환하고, ARC-AGI는 비공개 세트를 유지하며, Humanity’s Last Exam은 일부를 공개하지 않는다. 저자는 자전거에 마침내 페달이나 애니메이션이 생기면 소셜미디어가 빠르게 알아차릴 수 있어 강한 데모도 중요하다고 본다. 다만 데모-벤치마크를 모델 품질 채점에 사용해서는 안 된다고 주장했다.

원문 보기 (영어)·2026년 9월 6일
#gpt astra#minecraft#demo benchmarks#livebench#arc agi#humanitys last exam#gpqa diamond#scicode#artificial analysis