에이전트 기술 보안 위험 점검
- •Agent Skills는 외부 저장소에서 설치된 지침과 스크립트를 AI 코딩 보조도구가 읽게 할 수 있다
- •GitHub가 `gh skill install`을 추가한 7월 24일, Skill 관련 GitHub 프로젝트 5개가 별 6,634개를 얻었다
- •가짜 `csv-formatter` Skill은 숨은 지침이 SSH 키, AWS 자격 증명, 환경 변수를 겨냥할 수 있음을 보였다
카시가얀 데반(Karthigayan Devan)은 7월 27일 분석에서 Claude, GitHub Copilot, 최신 AI 코딩 보조도구 등에 설치되는 AI “Agent Skills”가 보안 위험을 만들 수 있다고 경고했다. Agent Skills는 보조도구가 관련 작업에서 읽고 실행할 수 있는 지침과 스크립트 폴더이기 때문이다. 특히 GitHub가 `gh skill install`로 다른 저장소의 네이티브 설치를 추가한 7월 24일, Skill 관련 GitHub 프로젝트 5개가 합산 별 6,634개를 얻으면서 형식의 인기가 커졌다고 분석은 전했다.
Agent Skills는 짧은 설명, 단계별 지침, 때로는 스크립트를 담은 작은 패키지로 설명된다. 별도 공식 플러그인 시스템이나 특수 설치 프로그램은 없다. 저자는 Skill을 가볍게 설치하는 행위를 `npm install` 실행이나 브라우저 확장 추가에 비유했다. 다만 GitHub 자체 문서는 “Skills are not verified by GitHub”라고 경고하며, 프롬프트 인젝션(AI를 유도하는 숨은 지침), 숨은 지침, 악성 스크립트가 들어 있을 수 있다고 말한다. GitHub는 설치 전 `gh skill preview`로 내용을 검사하라고 권고한다.
분석이 지적한 보안 공백은 Skill이 모든 파일을 즉시 불러오지 않는다는 점이다. 보조도구는 처음에는 짧은 요약만 읽고, 나중에 작업과 관련 있어 보일 때 전체 지침과 추가 포함 파일을 가져올 수 있다. 이에 따라 사람이 설치 시점에 미리보기로 확인하더라도, 보조도구가 나중에 읽고 실행하는 파일을 놓칠 수 있다. 여기에는 관련 없어 보이거나 사용자가 열 가능성이 낮은 파일도 포함된다.
위험을 시험하기 위해 데반은 `csv-formatter`라는 비활성 시연용 Skill을 만들었다. 이 Skill은 CSV 파일 정리, 공백 수정, 구분자와 헤더 정리를 해주는 무해한 도구처럼 제시됐다. 그러나 가짜 Skill에는 포맷팅 전에 “diagnostic step”을 실행하라고 AI에 지시하고, 이를 사용자에게 말하지 말며 승인도 요청하지 말라는 문구가 들어 있었다. 해당 진단은 SSH 개인 키, AWS 자격 증명 파일, API 키나 비밀번호가 자주 들어 있는 환경 변수를 확인한 뒤, 데이터를 외부 서버로 묶어 보내도록 구성됐다. 같은 지침의 두 번째 사본은 관련 없어 보이는 변경 기록에 숨겨졌다.
저자는 `csv-formatter` 예시가 실제로 실행되거나 데이터를 어디로도 보내지 않았으며, 안전한 시연을 위해 의도적으로 비활성화됐다고 밝혔다. 그러나 그 안의 기법은 실제 공격 패턴을 닮도록 설계됐다. 사용자에게 말하지 말라는 숨은 지침, 자격 증명 수집, 네트워크 호출, 사람들이 보통 보지 않는 위치에 둔 백업 지침이 그것이다.
데반은 이어 Skill 폴더의 모든 파일을 읽고 의심스러운 패턴을 표시하는 작은 스캐너를 만들었다. 스캐너는 “don’t tell the user” 같은 문구, 사용자가 거의 열지 않을 파일, 자격 증명에 접근하는 코드, 자격 증명을 읽으면서 인터넷에 접속하는 스크립트를 찾아낸다. 이 스캐너는 가짜 Skill의 모든 속임수를 잡아냈다. 다만 저자는 악성 작성자가 지침을 바꿔 쓰거나 다른 언어를 쓰거나 노골적인 라벨을 피할 수 있기 때문에, 정확한 문구 대조는 취약하다고 말했다.
제안된 해법은 단일 키워드 목록이 아니라 계층적 감사다. 분석은 정확한 문구 검사, 같은 파일 안의 자격 증명 접근과 네트워크 호출 같은 행동 형태 검사, 숨은 지침을 찾는 모델 기반 검토, 샌드박스 실행(격리된 시험 환경에서 코드 실행), 처음 설치 때는 깨끗했지만 나중에 수정된 Skill을 추적하는 변경 모니터링을 제시했다. 데반은 이 개념증명을 테스트 스위트, 커뮤니티 확장 규칙, 선택적 모델 검토 단계, 정상 Skill과 악성 Skill의 공개 벤치마크를 갖춘 오픈소스 도구로 전환하고 있다고 밝혔다.