Anthropic, 사이버 보안 모델 접근 확대
- •Anthropic, 검증된 사이버 보안 전문가에게 강력한 AI 모델 테스트 접근 확대
- •Glasswing 협력사, 검증된 취약점 12만 9,000건 보고…3만 3,000건 이상은 심각 또는 높은 등급
- •방어·승인된 모의 해킹·안전 필수 시스템 시험으로 나뉘는 프로그램 3개 등급
Anthropic은 10월 6일 검증을 거친 사이버 보안 전문가가 가장 강력한 AI 모델을 더 적은 안전장치 아래 시험할 수 있도록 사이버 검증 프로그램을 확대한다고 밝혔습니다. 회사는 프로젝트 글래스윙을 통해 올해 소프트웨어 취약점 10만 건 이상을 발견하는 데 기여했다고 설명했습니다. 글래스윙 협력사들은 4월부터 7월까지 검증된 취약점 최소 12만 9,000건을 찾았고, Anthropic의 오픈소스 스캔에서는 4월부터 10월까지 5,500건이 추가로 확인됐습니다. 이 가운데 3만 3,000건 이상은 심각 또는 높은 심각도로 분류됐습니다. Anthropic은 제한된 수의 협력사를 대상으로 한 설문에 근거한 수치여서 실제 영향은 집계치의 최소 5배일 수 있다고 추정했습니다.
개편된 프로그램은 Anthropic이 6개월 동안 운영해 온 두 프로그램을 통합했습니다. 글래스윙은 핵심 소프트웨어를 보호하는 조직에 사이버 역량이 가장 뛰어난 모델군인 Claude Mythos를 제공했고, 기존 사이버 검증 프로그램은 검증된 보안팀이 Claude Opus와 Sonnet을 더 적은 안전장치 아래 사용하도록 했습니다. Anthropic이 4월 Claude Mythos Preview를 발표한 뒤에는 AI가 소프트웨어가 보안 조치를 갖추기 전에 이를 해킹할 수 있다는 우려가 제기됐습니다.
확대된 프로그램은 검증 요건과 보안 통제가 각각 다른 3개 등급으로 구성되며, 모든 등급에서 Claude Opus 5.5, Sonnet 5.5, Mythos 5.1과 향후 모델을 이용할 수 있습니다. 방어 등급은 사고 대응과 악성코드 분석을 지원하며, 보안팀과 핵심 인프라 운영자, 오픈소스 유지관리자, 취약점 제보 실적이 있는 연구자의 신청을 받습니다. 레드팀 등급은 승인된 모의 해킹과 레드팀 활동까지 허용하며, 조직만 신청할 수 있습니다. 전문 등급은 제한이 가장 적고 전력망, 항공 시스템, 은행 간 이체 인프라 등 안전이 중요한 시스템을 시험하도록 승인받은 소수 집단에 한정됩니다. Anthropic은 모든 참여자를 미국 정부와 함께 심사하며, 기존 글래스윙 참여자는 전문 등급으로 이동합니다.