스노우플레이크, 코텍스 AI 게이트웨이 공개 미리보기
- •스노우플레이크, 2026년 10월 8일 AWS 상용 리전에서 코텍스 AI 게이트웨이 공개 미리보기 시작
- •내부 테스트서 토큰 효율 최대 3배, 풀 리퀘스트 처리량 유지하며 토큰 약 25% 절감
- •모델·MCP 접근 제어와 추적·보호 장치·비용 한도 제공, 도구 기능은 비공개 미리보기
스노우플레이크는 2026년 10월 8일 AWS 상용 리전에서 코텍스 AI 게이트웨이 공개 미리보기를 시작했습니다. 뉴질랜드, 말레이시아, 스페인은 제외됐습니다. 이 서비스는 AI 클라이언트와 기업 시스템 사이에 중앙 통제 지점을 두어, 플랫폼 팀이 모델·에이전트·모델 컨텍스트 프로토콜(MCP) 서버의 사용 현황을 함께 살펴보고 관리하도록 지원합니다. 모델 추론을 위한 단일 엔드포인트, 동적 라우팅, MCP 도구 관리, 관측 기능, 보안 정책과 비용 통제를 제공합니다. 플랫폼 팀은 모델과 도구 접근을 관리하고 지출을 추적·통제하며 AI가 사용자를 위해 수행한 작업을 확인할 수 있고, 애플리케이션 팀은 단일 엔드포인트를 대상으로 개발할 수 있습니다.
추론 기능은 OpenAI, Grok, GLM, Gemini, Llama, Mistral, DeepSeek 모델용 Chat Completions API와 Claude용 Messages API를 지원합니다. 스트리밍, 도구 호출, 구조화된 출력, 프롬프트 캐싱, 이미지 입력과 추론은 각 모델에서 기본 제공되는 방식으로 작동하며, 기존 클라이언트는 기본 URL과 토큰을 바꾸면 연결할 수 있습니다. OpenAI Responses API 지원은 곧 추가될 예정입니다. 관리자는 역할 기반 접근 제어(RBAC)로 사용할 수 있는 모델을 정하며, Snowflake CLI에서 `snow ai opencode` 명령어로 에이전트 트래픽을 게이트웨이에 연결하도록 설정할 수 있습니다.
스노우플레이크는 곧 비공개 미리보기로 제공될 동적 모델 라우팅이 에이전트의 각 단계에 적합하다고 판단한 모델 가운데 비용이 가장 낮은 모델을 선택한다고 밝혔습니다. 연구팀은 반복적이고 복잡성이 낮은 작업은 효율적인 모델로, 더 깊은 추론이 필요한 작업은 프런티어 모델로 보내도록 라우팅을 미세 조정했습니다. 내부 dbt 파이프라인 평가에서 이 방식은 비슷한 품질을 유지하면서 프런티어 모델만 쓰는 방식보다 토큰 효율이 최대 3배 높았습니다. 별도 코딩 테스트에서는 엔지니어링 팀이 풀 리퀘스트 처리량을 유지하면서 토큰을 약 25% 적게 사용했습니다. 승인된 모델만 사용하고 데이터 거주지 설정을 따르며 라우팅 결정도 기록한다고 스노우플레이크는 설명했습니다.
스노우플레이크는 에이전트 하네스로 Snowflake CoCo를 사용한 내부 ADE-bench 결과도 공개했습니다. DeepSeek-V4-Flash는 74.4%를 기록해 시험한 독점 모델 가운데 가장 높은 점수를 낸 모델을 앞섰습니다. GLM-5.3은 비공개 미리보기 출시를 계획 중이며, 이전 버전인 GLM-5.2는 ADE-bench2에서 66%를 기록했고 해당 벤치마크에서 토큰 사용량이 가장 적었습니다. 이 모델들은 스노우플레이크의 보안 경계 안에서 관리 대상 데이터와 함께 실행되며, 같은 역할 기반 접근 제어와 감사 기록을 적용받습니다. 비공개 미리보기인 도구 기능에는 OAuth를 사용자 대신 처리하는 100개 이상의 MCP 서버 엄선 카탈로그가 포함됩니다. 관리자는 특정 도구, 공개된 모든 도구, 현재와 앞으로 공개될 도구를 사용할 수 있게 설정할 수 있습니다. 비활성화한 도구는 클라이언트에 표시되지 않고 호출할 수도 없으며, 호출은 기록해 추적 정보에 포함할 수 있습니다.
스노우플레이크가 실시한 설문에서는 응답 고객 약 3명 중 1명이 에이전트 감시에 자체 제작 대시보드를 사용했습니다. 스노우플레이크는 클라우드 보안 연합 조사 결과도 인용했습니다. 조사 대상 조직의 82%가 지난 1년 동안 이전에 알지 못했던 AI 에이전트나 자율 워크플로를 한 개 이상 발견했습니다. 「2026 데이터 침해 비용 보고서」에 따르면 섀도 AI 사용 수준이 높은 조직의 평균 침해 비용은 539만 달러였으며, 섀도 AI 사고는 침해를 당한 조직의 43%에 영향을 미쳤습니다. 코텍스 AI 게이트웨이는 통과하는 모델 및 도구 호출을 스노우플레이크에서 OpenTelemetry 추적으로 기록합니다. 여기에는 로컬 개발자 노트북과 원격 쿠버네티스 클러스터에서 발생한 호출도 포함되며, 에이전트 코드 변경은 필요하지 않습니다. 추적 기록에는 요청 모델, 입력·출력 토큰, 캐시 활동, 소요 시간, 상태 코드, 도구, 클라이언트 버전과 세션이 포함될 수 있습니다. 관리자가 페이로드 기록을 켠 경우에만 프롬프트, 응답, 도구 호출 내용도 저장됩니다.
스노우플레이크는 자사 AI 제품을 프롬프트 인젝션과 탈옥 시도로부터 보호하는 기존 코텍스 AI 가드레일을 곧 게이트웨이를 통해 연결된 타사 에이전트에도 적용할 예정입니다. 비용 통제 기능은 게이트웨이 수준이나 리소스·사용자 태그별 예산, 그리고 몇 분 안에 차단을 적용하는 월간 및 선택형 일일 사용자별 할당량을 제공합니다. 게이트웨이 사용량은 AI_GATEWAY_USAGE_HISTORY에 기록되며, 모델별 크레딧과 요청 ID를 통해 지출을 대화, 워크플로, 작업, 요청 및 도구 호출에 연결할 수 있습니다. 스노우플레이크는 코텍스 AI 게이트웨이를 기업이 에이전트를 검사하기 위한 출발점이라고 설명했습니다.