Thinking Machines Lab, Inkling 모델 성능 공개
- •Thinking Machines Lab의 Inkling이 에이전트 지식 업무 벤치마크인 AA-Briefcase에서 836 Elo 점수를 기록했다.
- •루브릭 점수 19.3%를 달성하여 DeepSeek V4 Flash max와 Gemini 3.5 Flash-Lite를 앞섰다.
- •Inkling은 프레젠테이션 Elo 863점, 분석 품질 Elo 764점을 각각 기록하며 업무 영역별 성능 차이를 보였다.
Thinking Machines Lab이 개발한 Inkling 모델이 수천 개의 입력 파일을 다루는 에이전트 지식 업무 테스트 플랫폼인 AA-Briefcase 벤치마크에서 836 Elo 점수를 기록했다. 현재 해당 모델은 Nemotron 3 Ultra나 GLM-5.2와 같은 주요 오픈 가중치 모델들보다는 낮지만, DeepSeek V4 Flash보다는 높은 순위에 위치한다. AA-Briefcase는 이진 루브릭 검사, 쌍대 분석 품질 평가, 쌍대 프레젠테이션 품질 평가를 통해 성능을 측정한다.
Inkling의 AA-Briefcase 루브릭 점수는 19.3%로 집계됐다. 이는 MiMo-V2.5-Pro의 21.4%에는 미치지 못하지만, DeepSeek V4 Flash max의 18.7%와 Gemini 3.5 Flash-Lite의 14.8%를 상회하는 수치다. Inkling은 멀티모달 기능을 갖추고 있음에도 불구하고, 엑셀, 파워포인트, PDF, 워드 이외의 비표준 파일 형식을 처리할 때 가장 낮은 성능을 보였다. 또한, 프레젠테이션 품질 부문에서 863 Elo를 기록하며 분석 품질 부문의 764 Elo보다 우수한 성능을 나타냈다.
자원 사용 측면에서 Inkling은 작업당 평균 52K개의 출력 토큰을 소모하며, 전체 벤치마크 제품군 수행에는 5M개의 토큰을 사용한다. 토큰 소모량은 엑셀 파일 처리 시 가장 높았으며, 워드, PDF, 파워포인트, 기타 파일 형식 순으로 뒤를 이었다. 작업당 평균 81회, 중앙값 49회의 턴이 발생하며 상호작용 길이에 넓은 분포를 보였다. 평균 턴 수가 높은 편임에도 불구하고, 턴당 도구 호출 빈도는 평균 0.5회로 타 모델 대비 상대적으로 낮은 수치를 기록했다.