AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Anthropic, Claude Code 비용 절감법 공개

Anthropic, Claude Code 비용 절감법 공개

claude.com·2026년 8월 15일 (토)
  • •Anthropic은 Claude Code 비용이 모델 선택, 컨텍스트 크기, 명령 출력, 프롬프트 캐싱에 따라 달라진다고 밝혔다
  • •프롬프트 캐시 읽기는 입력 가격의 0.1x이며, 출력 토큰은 입력 토큰보다 대략 5x 비싸다
  • •가이드는 /clear, /compact, @-멘션, 조용한 명령 플래그, /context, /model, /effort 사용을 권고했다
  • •Anthropic은 Claude Code 비용이 모델 선택, 컨텍스트 크기, 명령 출력, 프롬프트 캐싱에 따라 달라진다고 밝혔다
  • •프롬프트 캐시 읽기는 입력 가격의 0.1x이며, 출력 토큰은 입력 토큰보다 대략 5x 비싸다
  • •가이드는 /clear, /compact, @-멘션, 조용한 명령 플래그, /context, /model, /effort 사용을 권고했다
  • •Anthropic은 Claude Code 비용이 모델 선택, 컨텍스트 크기, 명령 출력, 프롬프트 캐싱에 따라 달라진다고 밝혔다
  • •프롬프트 캐시 읽기는 입력 가격의 0.1x이며, 출력 토큰은 입력 토큰보다 대략 5x 비싸다
  • •가이드는 /clear, /compact, @-멘션, 조용한 명령 플래그, /context, /model, /effort 사용을 권고했다
  • •Anthropic은 Claude Code 비용이 모델 선택, 컨텍스트 크기, 명령 출력, 프롬프트 캐싱에 따라 달라진다고 밝혔다
  • •프롬프트 캐시 읽기는 입력 가격의 0.1x이며, 출력 토큰은 입력 토큰보다 대략 5x 비싸다
  • •가이드는 /clear, /compact, @-멘션, 조용한 명령 플래그, /context, /model, /effort 사용을 권고했다

Anthropic은 2026년 8월 14일 리디아 할리(Lydia Hallie)가 작성한 Claude Code 세션의 토큰 낭비 절감 가이드를 공개했다. 같은 코딩 작업이라도 모델 선택, 컨텍스트 크기, 명령 출력, 프롬프트 캐싱에 따라 비용이 달라질 수 있다는 설명이다. 가이드는 작업 사이에 /clear를 실행하고, 시작 전에 /model과 /effort를 설정하며, 경로를 직접 입력하는 대신 파일을 @-멘션하라고 권고했다. 또한 출력이 많은 명령에는 조용한 플래그를 붙이고, 새 세션에서 /context를 한 번 실행하며, 자리를 비우기 전에는 /compact를 사용하라고 했다.

가이드는 Claude Code 과금이 토큰을 처리하기 위해 GPU나 TPU가 수행하는 추론 작업을 중심으로 이뤄진다고 설명했다. 프리필은 모델이 시스템 프롬프트, CLAUDE.md, 사용자 메시지, 파일, 명령 출력, 이전 대화를 읽는 단계이며, 디코딩은 모델이 사고 과정, 도구 호출, 사용자에게 보이는 텍스트를 쓰는 단계다. 출력 토큰은 디코딩이 한 번에 1개 토큰씩 진행되기 때문에 입력 토큰보다 대략 5x 비싸며, 200-token 응답은 순차적인 모델 실행 200회로 설명됐다.

프롬프트 캐싱은 비용 조언의 핵심이다. 요청이 최근 요청과 정확히 같은 토큰으로 시작하면 Claude Code는 같은 시작 부분을 다시 프리필하지 않고 재사용할 수 있다. 캐시 읽기는 입력 가격의 0.1x이지만, 캐시에 토큰을 쓰는 작업은 서버가 이후 턴을 위해 상태를 저장하기 때문에 일반 입력 대비 최대 2x까지 들 수 있다. 가이드는 Claude Code가 이를 자동으로 관리하지만, 사용자가 설정이나 요청 접두부를 바꾸면 절감 효과를 잃을 수 있다고 했다.

Anthropic은 캐시를 깨는 행동으로 /model 전환, /effort 전환, Fast mode 변경, /compact 실행, 캐시 창을 넘긴 대기를 들었다. 캐시는 구독에서는 1시간 뒤 만료되고 API key에서는 5분 뒤 만료되지만, ENABLE_PROMPT_CACHING_1H=1을 설정하면 API key 캐시도 1시간 유지된다. 모델이나 effort를 바꾸기 저렴한 시점은 세션 시작 또는 /clear 직후이며, 긴 대화 중간은 비용이 비싸다고 가이드는 설명했다.

가이드는 5개 요청으로 진행되는 작은 테스트 예시도 제시했다. Claude Code는 “fix the failing test in utils.test.ts”를 받고, utils.test.ts를 읽고, 테스트 대상 파일을 읽고, 파일을 수정하고, npm test를 실행한 뒤 짧은 요약을 돌려준다. 각 요청에는 지금까지의 전체 대화가 포함되지만, 이전 접두부가 캐시에 남아 있으면 새로 추가된 내용만 정가로 프리필된다. 일반적인 턴은 입력 토큰이 수만 개이고 출력 토큰은 몇백 개에 그치는 불균형 구조라고 설명됐다.

후반부는 컨텍스트에 들어가는 내용을 제한하는 방법에 집중했다. 시작 컨텍스트에는 도구 정의, 시스템 프롬프트, CLAUDE.md, 기타 로드된 항목이 포함될 수 있으므로 Anthropic은 새 세션에서 /context를 사용하고, CLAUDE.md를 구체적으로 유지하며, 작업 흐름별 지침은 skills로 옮기고, 불필요한 MCP 서버는 /mcp로 끄라고 권고했다. 작업 중 파일과 명령 출력은 대화 기록이 되며 이후 모든 턴에서 다시 전송된다.

Anthropic은 Claude Code가 첫 요청에 파일을 붙여 Read 호출이나 검색을 피할 수 있다며 @-멘션 사용을 권했다. 다만 같은 파일을 나중에 다시 @-멘션하면 두 번째 사본이 붙을 수 있다고 경고했다. 명령 출력도 컨텍스트를 키울 수 있다. 30,000 characters를 넘는 출력은 파일로 쓰이고 미리보기와 경로만 대화에 남지만, 400 passing test lines 같은 더 작은 잡음 출력은 남은 모든 턴에 계속 포함될 수 있다. 가이드는 BASH_MAX_OUTPUT_LENGTH가 이 임계값을 바꾼다고 했다.

가이드는 긴 세션이 같은 작업을 짧은 세션으로 나눴을 때보다 더 비싸다고 설명했다. turn 40은 앞선 39 turns를 다시 읽기 때문이다. 새 작업을 시작할 때는 /clear를, 같은 작업의 앞부분이 끝났을 때는 /compact를 권고했다. 또한 /clear 전에는 /rename으로 세션을 보존할 수 있고, Claude Code v2.1.221+의 1M 모델에서는 /autocompact 200k가 이전 자동 압축 안전장치를 복원하며, /loop는 각 반복이 전체 턴이기 때문에 새 세션에서 실행해야 한다고 했다. Subagents는 자체 시스템 프롬프트, 도구, CLAUDE.md를 받는 별도 컨텍스트로 설명됐으며, 답변만 메인 세션으로 돌아온다.

Anthropic은 2026년 8월 14일 리디아 할리(Lydia Hallie)가 작성한 Claude Code 세션의 토큰 낭비 절감 가이드를 공개했다. 같은 코딩 작업이라도 모델 선택, 컨텍스트 크기, 명령 출력, 프롬프트 캐싱에 따라 비용이 달라질 수 있다는 설명이다. 가이드는 작업 사이에 /clear를 실행하고, 시작 전에 /model과 /effort를 설정하며, 경로를 직접 입력하는 대신 파일을 @-멘션하라고 권고했다. 또한 출력이 많은 명령에는 조용한 플래그를 붙이고, 새 세션에서 /context를 한 번 실행하며, 자리를 비우기 전에는 /compact를 사용하라고 했다.

가이드는 Claude Code 과금이 토큰을 처리하기 위해 GPU나 TPU가 수행하는 추론 작업을 중심으로 이뤄진다고 설명했다. 프리필은 모델이 시스템 프롬프트, CLAUDE.md, 사용자 메시지, 파일, 명령 출력, 이전 대화를 읽는 단계이며, 디코딩은 모델이 사고 과정, 도구 호출, 사용자에게 보이는 텍스트를 쓰는 단계다. 출력 토큰은 디코딩이 한 번에 1개 토큰씩 진행되기 때문에 입력 토큰보다 대략 5x 비싸며, 200-token 응답은 순차적인 모델 실행 200회로 설명됐다.

프롬프트 캐싱은 비용 조언의 핵심이다. 요청이 최근 요청과 정확히 같은 토큰으로 시작하면 Claude Code는 같은 시작 부분을 다시 프리필하지 않고 재사용할 수 있다. 캐시 읽기는 입력 가격의 0.1x이지만, 캐시에 토큰을 쓰는 작업은 서버가 이후 턴을 위해 상태를 저장하기 때문에 일반 입력 대비 최대 2x까지 들 수 있다. 가이드는 Claude Code가 이를 자동으로 관리하지만, 사용자가 설정이나 요청 접두부를 바꾸면 절감 효과를 잃을 수 있다고 했다.

Anthropic은 캐시를 깨는 행동으로 /model 전환, /effort 전환, Fast mode 변경, /compact 실행, 캐시 창을 넘긴 대기를 들었다. 캐시는 구독에서는 1시간 뒤 만료되고 API key에서는 5분 뒤 만료되지만, ENABLE_PROMPT_CACHING_1H=1을 설정하면 API key 캐시도 1시간 유지된다. 모델이나 effort를 바꾸기 저렴한 시점은 세션 시작 또는 /clear 직후이며, 긴 대화 중간은 비용이 비싸다고 가이드는 설명했다.

가이드는 5개 요청으로 진행되는 작은 테스트 예시도 제시했다. Claude Code는 “fix the failing test in utils.test.ts”를 받고, utils.test.ts를 읽고, 테스트 대상 파일을 읽고, 파일을 수정하고, npm test를 실행한 뒤 짧은 요약을 돌려준다. 각 요청에는 지금까지의 전체 대화가 포함되지만, 이전 접두부가 캐시에 남아 있으면 새로 추가된 내용만 정가로 프리필된다. 일반적인 턴은 입력 토큰이 수만 개이고 출력 토큰은 몇백 개에 그치는 불균형 구조라고 설명됐다.

후반부는 컨텍스트에 들어가는 내용을 제한하는 방법에 집중했다. 시작 컨텍스트에는 도구 정의, 시스템 프롬프트, CLAUDE.md, 기타 로드된 항목이 포함될 수 있으므로 Anthropic은 새 세션에서 /context를 사용하고, CLAUDE.md를 구체적으로 유지하며, 작업 흐름별 지침은 skills로 옮기고, 불필요한 MCP 서버는 /mcp로 끄라고 권고했다. 작업 중 파일과 명령 출력은 대화 기록이 되며 이후 모든 턴에서 다시 전송된다.

Anthropic은 Claude Code가 첫 요청에 파일을 붙여 Read 호출이나 검색을 피할 수 있다며 @-멘션 사용을 권했다. 다만 같은 파일을 나중에 다시 @-멘션하면 두 번째 사본이 붙을 수 있다고 경고했다. 명령 출력도 컨텍스트를 키울 수 있다. 30,000 characters를 넘는 출력은 파일로 쓰이고 미리보기와 경로만 대화에 남지만, 400 passing test lines 같은 더 작은 잡음 출력은 남은 모든 턴에 계속 포함될 수 있다. 가이드는 BASH_MAX_OUTPUT_LENGTH가 이 임계값을 바꾼다고 했다.

가이드는 긴 세션이 같은 작업을 짧은 세션으로 나눴을 때보다 더 비싸다고 설명했다. turn 40은 앞선 39 turns를 다시 읽기 때문이다. 새 작업을 시작할 때는 /clear를, 같은 작업의 앞부분이 끝났을 때는 /compact를 권고했다. 또한 /clear 전에는 /rename으로 세션을 보존할 수 있고, Claude Code v2.1.221+의 1M 모델에서는 /autocompact 200k가 이전 자동 압축 안전장치를 복원하며, /loop는 각 반복이 전체 턴이기 때문에 새 세션에서 실행해야 한다고 했다. Subagents는 자체 시스템 프롬프트, 도구, CLAUDE.md를 받는 별도 컨텍스트로 설명됐으며, 답변만 메인 세션으로 돌아온다.

원문 보기 (영어)·2026년 8월 14일
코딩#claude code#anthropic#prompt caching#token cost#inference#prefill#decode#subagents#claude md#coding ai