Manifest, LLM 라우터 폐기
- •Manifest는 3월 LLM 게이트웨이의 일부로 출시한 LLM 라우터를 6월 폐기했다
- •라우터는 요청을 4개 등급으로 분류했으며, 7000명 클라우드 사용자 사이에서 결과가 엇갈렸다
- •Manifest는 캐시 읽기가 캐시되지 않은 입력보다 75%~90% 저렴하다고 밝혔다
Manifest는 3월 LLM 라우터를 출시한 뒤 6월 이를 폐기했고, 9월 1일 완전 종료를 예정하면서 대부분의 사용 사례에서 모델 라우팅을 더 이상 신뢰하지 않는다고 밝혔다. 회사는 즉석에서 모델을 고르는 라우터가 추론 비용을 낮춘다는 최근 출시 흐름에도 불구하고, 검증된 단일 모델을 쓰는 편이 대체로 더 낫다고 설명했다.
Manifest의 라우터는 LLM 게이트웨이의 일부로, 각 요청을 simple, standard, complex, reasoning 등 4개 등급으로 분류했다. 7000명 클라우드 사용자의 4개월 사용 결과, 회사는 엇갈린 성과와 GitHub 이슈 및 토론을 확인했으며, 프롬프트 텍스트만으로는 작업 복잡도를 충분히 드러내기 어렵다고 결론냈다. 도구 호출, 웹 검색, 저장소 맥락이 실제 필요한 작업량을 바꿀 수 있기 때문이다.
Manifest는 캐싱이 라우팅보다 비용을 더 안정적으로 줄이는 경우가 많다고 밝혔다. 캐시 읽기는 캐시되지 않은 입력보다 75%~90% 저렴하며, 시스템 프롬프트와 대화 이력은 많은 토큰을 차지할 수 있다. 특히 반복 텍스트가 프롬프트 앞부분에 있을 때 prefix cache가 잘 작동하는데, 캐시를 의식한 라우터는 첫 모델에 계속 붙어 같은 모델에 질의하게 되므로 사실상 라우팅을 피하게 된다.
Manifest는 LLM 라우터가 작업 세션 중 모델을 옮겨 다니며 행동 일관성을 낮출 수 있다고도 밝혔다. 회사는 엔지니어가 의도에 맞춰 모델과 노력 수준 매개변수를 선택해야 한다고 주장했으며, 자동화된 agentic workflow나 자율 에이전트에서 예측 불가능성이 eval, 시스템 프롬프트, 관측 가능성 전반의 유지보수 비용을 키울 수 있다고 말했다. Manifest는 관찰한 대부분의 사용 사례에서 라우팅으로 얻는 절감분이 추산하기 어려운 다른 비용으로 상쇄돼, 라우팅의 가치가 크지 않았다고 결론냈다.