GPT-2 XL 벤치마크 재검증
- •Second Squeeze는 2019년 GPT-2 XL과 2025년 Qwen3-0.6B를 로컬에서 비교했다
- •초기 GPT-2 속도 0.31 tokens per second는 재실행 뒤 8.5로 수정됐다
- •수정된 벤치마크는 처음 보고된 297x 격차가 아니라 약 11x 속도 차이를 보였다
L. 코데로(L. Cordero)는 July 27에 로컬 AI 벤치마킹 프로젝트 “Second Squeeze” 기록을 공개했다. 코데로는 AMD의 Advancing AI 2026 summit에서 노트북 안에서 모델이 답하는 장면을 본 뒤, 같은 노트북에서 2019년 GPT-2 XL과 2025년 Qwen3-0.6B를 비교했다. 프로젝트는 AMD의 로컬 AI 서버인 Lemonade를 사용해 1.5 billion parameters 규모의 GPT-2 XL과 그 절반보다 작은 2025년 모델 Qwen3-0.6B를 실행했다.
코데로는 설정에 1주일이 걸렸고 여러 설치 문제가 있었다고 밝혔다. 명령어가 문서가 암시한 내용과 달랐고, 처음에는 Lemonade가 PATH에 없었으며, GPU backend 다운로드가 잠긴 파일 때문에 2번 멈췄고, 설치된 Python이 너무 최신이라 평가 도구에는 두 번째 Python 버전이 필요했다. 첫 목표는 2019년 정확도 벤치마크로 GPT-2를 시험하는 것이었지만, Lemonade가 표준 도구가 요구한 확률 데이터를 반환하지 않았다.
코데로와 Claude는 누락된 확률 데이터를 추적하고 오류를 재현한 뒤, 저자의 첫 오픈소스 기여로 Lemonade issue 2822를 제출했다. 이후 벤치마크는 정확도에서 속도와 기본 지시 따르기 평가로 옮겨갔고, 모든 수치를 한 명령으로 다시 실행할 수 있도록 재현 가능한 스크립트를 사용했다.
첫 속도 결과는 GPT-2가 0.31 tokens per second, 최신 모델이 90 tokens per second로 나타나 297x 격차를 시사했다. 그러나 스크립트 기반 벤치마크를 다시 실행하자 GPT-2는 0.31이 아니라 8.5 tokens per second를 기록했다. 앞선 실행이 backend 다운로드가 아직 진행 중이고 모델이 디스크에서 막 불러와진 상태에서 이뤄졌기 때문이며, 수정된 성능 격차는 297x가 아니라 약 11x였다.
간단한 완성 프롬프트 “The capital of France is,”에서 Qwen3-0.6B는 Paris라고 답하고 짧은 추론을 보였지만, GPT-2 XL은 무작위 import 문을 생성했다. Second Squeeze는 대시보드, MIT 라이선스 저장소, 테스트, Lemonade issue와 함께 공개됐으며, 코데로는 다음 단계가 실제 AMD GPU에서 프로젝트를 실행하는 것이라고 말했다.