BTB, LLM 추론 폭주 겨냥
- •Biting the Bullet은 같은 접두사 LLM 요청 폭주를 예측하고 요청 도착 전 RDMA로 KV 캐시를 복제한다
- •Infer-Sim 테스트에서 BTB는 캐시 인식 라우팅 대비 평균 첫 토큰까지 시간을 10-60% 줄였다
- •Bursted-ART는 기업형 폭주를 모델링하기 위해 65,536-token 공유 접두사의 synthetic 60-second windows를 추가했다
슈레이 비르미왈(Shrey Birmiwal)과 아니시 바트(Anish Bhat)는 2026년 7월 22일 Biting the Bullet(BTB)을 공개했다. BTB는 운영 환경에서 많은 LLM 요청이 같은 긴 접두사를 공유할 때 생기는 bursty LLM inference를 겨냥한 라우팅 방식이다. BTB는 대규모 같은 접두사 폭주를 예측한 뒤, 폭주 요청이 도착하기 전에 RDMA에서 GPU HBM으로 prefix KV cache(재사용 프롬프트 텍스트의 저장된 attention data)를 미리 복사한다. Bursted-ART 기반 Infer-Sim 테스트에서 BTB는 SGLang의 기본 cache-aware router 대비 평균 첫 토큰까지 시간을 10-60% 줄였고, 최선 사례에서는 p95 첫 토큰까지 시간을 최대 80-82% 낮췄다.
저자들은 일반 라우터가 같은 접두사 폭주에서 서로 다른 방식으로 실패한다고 설명했다. least-load routing은 요청을 cold replicas에 분산해 각 replica가 같은 긴 접두사를 다시 계산하게 한다. cache-aware routing은 prefix-cache 일치도가 가장 높은 replica로 요청을 보내 cache hit를 유지하지만, 그 결과 하나의 warm replica에 대기열이 쌓이고 다른 replica는 유휴 상태가 된다. Llama-3.3-70B에서 prefix KV는 token당 약 320 KiB이므로 1,000-token cached prefix는 약 320 MiB다. Llama-3.3-70B fp16을 제공하는 4xH100 tensor-parallel node에서 8k-token prefix의 KV를 사용할 수 있게 만드는 데 걸리는 시간은 prefill 571 ms, Disk / NVMe 374 ms, RDMA 13.1 ms, RAM 11.9 ms, HBM 0.20 ms다.
저자들은 공개 trace가 data labeling, parsing PDFs, batch extraction, sub-agent fanout 같은 기업형 폭주 패턴을 놓친다고 봤다. ART-Chat-2.5M은 300,000 rows, arrival timestamps, prefix hash/content, 그리고 <=10s 안의 >=16 KV blocks 기준 max burst fanout 25를 갖췄다. Mooncake trace는 12k-24k rows, arrival timestamps, prefix hash/content, max burst fanout 2를 포함했다. BurstGPT는 300,000 rows와 arrival timestamps는 있었지만 prefix content가 없었고, LMSYS-Chat-1M은 1M conversations, ShareGPT는 ~90k conversations를 갖췄지만 arrival timestamps가 없었다.
BTB는 prototype constants 4개를 사용한다. 값은 X=2 same-prefix arrivals, Y=256 shared-prefix blocks, Z=1s detection window, M=4 replicas to warm이다. 같은 Y-block prefix가 Z seconds 안에 X times 도착하면 BTB는 해당 prefix를 active로 표시하고 RDMA(서버 간 직접 memory access)로 KV를 다른 GPU에 보낸다. 이후 같은 prefix를 가진 요청은 부하가 가장 낮은 warm replica로 라우팅될 수 있다. prefix가 너무 짧거나, burst count가 아직 발동하지 않았거나, resident copy가 없으면 BTB는 일반 cache-aware router로 되돌아간다.
Bursted-ART에서 나온 simulated Infer-Sim 결과는 엇갈렸지만 대체로 긍정적이었다. 70b_h100x4에서 cache-aware mean과 p95는 1.373s, 4.697s였고 BTB는 0.632s, 4.697s를 기록해 +54.0% mean speedup과 +0.0% p95 speedup을 보였다. qwen3_8b_h100x4는 0.034s mean, 0.325s p95에서 0.023s, 0.059s로 개선됐으며 +33.3% mean, +81.8% p95 speedup을 냈다. glm45_h100x4는 +60.0% mean, +59.0% p95 speedup을, glm52_h100x8은 +53.5%와 +78.0%를, kimi_k2_h100x8은 +48.1%와 +79.9%를, dense1t_b300x4는 +10.3%와 +7.4%를 기록했다.
저자들은 BTB를 predictive resource management와 cache-aware routing 사이에 놓고 PreServe, Cachewise, Learned Prefix Caching, Preble, Mooncake, 제프 딘(Jeff Dean)과 루이스 바로소(Luiz Barroso)의 "The Tail at Scale"과 비교했다. 향후 과제에는 production serving stack 테스트, speculative prefill, pin, evict, demote, promote 같은 cache action, adaptive detection thresholds, 사용자 query를 burst hint로 활용하는 방식이 포함됐다. Bursted-ART는 ART-Chat-2.5M replay windows에서 출발해 65,536-token shared prefixes를 가진 synthetic 60-second windows를 추가하며, 현재 10 train windows, 30 test windows, 25,600 train rows, 76,800 test rows를 갖고 있다.