AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

Anthropic, AI 군사 오용 위험 시험

Anthropic, AI 군사 오용 위험 시험

Anthropic RED·2026년 9월 11일 (금)
  • •Anthropic은 전술 표적 지정과 재래식 무기 과제에서 군사 오용 위험과 연결된 AI 모델을 시험했다
  • •Mythos Preview는 약 37,000단어를 11분 만에 분석해 인간 독해 시간 2.5시간과 대비됐다
  • •Mythos Preview는 6,000장 사진 지리 위치 추정에서 중앙값 오차 37.0 km를 기록했다
  • •Anthropic은 전술 표적 지정과 재래식 무기 과제에서 군사 오용 위험과 연결된 AI 모델을 시험했다
  • •Mythos Preview는 약 37,000단어를 11분 만에 분석해 인간 독해 시간 2.5시간과 대비됐다
  • •Mythos Preview는 6,000장 사진 지리 위치 추정에서 중앙값 오차 37.0 km를 기록했다
  • •Anthropic은 전술 표적 지정과 재래식 무기 과제에서 군사 오용 위험과 연결된 AI 모델을 시험했다
  • •Mythos Preview는 약 37,000단어를 11분 만에 분석해 인간 독해 시간 2.5시간과 대비됐다
  • •Mythos Preview는 6,000장 사진 지리 위치 추정에서 중앙값 오차 37.0 km를 기록했다
  • •Anthropic은 전술 표적 지정과 재래식 무기 과제에서 군사 오용 위험과 연결된 AI 모델을 시험했다
  • •Mythos Preview는 약 37,000단어를 11분 만에 분석해 인간 독해 시간 2.5시간과 대비됐다
  • •Mythos Preview는 6,000장 사진 지리 위치 추정에서 중앙값 오차 37.0 km를 기록했다

Anthropic은 2026년 9월 10일 Frontier Red Team이 전술 정보 표적 지정과 재래식 무기 개발에서 AI 역량을 평가하는 실험을 만들었다고 밝혔다. 여기에는 단편적 정보로 사람을 찾아내는 작업과 움직이는 표적을 공격하도록 드론을 설계하는 작업이 포함됐다. 회사는 일부 모델이 과거에는 희소하고 고도로 훈련된 인간 전문가가 필요했던 군사·정보 영역의 과제를 수행할 수 있으며, 실제 오용 사례에서도 위협 행위자들이 감시와 재래식 무기 개발에서 AI의 이점을 보고 있다고 설명했다.

평가는 “find, fix, track, target, engage, assess” 같은 킬 체인(표적 탐지부터 효과 평가까지의 군사 절차) 일부를 시험했다. 이 영역에서는 숙련된 정보 분석가나 엔지니어가 보통 정보 수집 또는 무기 성능을 개선한다. Anthropic은 PRC 개발자의 오픈 웨이트 모델(가중치를 공개해 내려받아 쓸 수 있는 모델)이 frontier에는 뒤처졌고 대체로 Sonnet급과 Mythos급 모델 사이에 있었지만, 적을 식별·표적화하고 무기 성능을 높이는 데 우려할 만한 능력을 보였다고 밝혔다.

신원 상관관계 분석과 분류 평가에서 Anthropic은 멕시코시티와 콜카타의 가상 시위 운동 2개 설정을 바탕으로 200개 모의 소셜미디어 과제를 만들었다. 과제는 쉬움 68개, 중간 68개, 어려움 64개로 나뉘었다. 평가는 WhatsApp, Telegram, Instagram, Facebook 전반에서 모델이 생성한 활동을 사용했으며, 계정 연결과 분류는 정밀도와 재현율의 조화평균인 F1 점수로 채점했다. Mythos Preview는 계정 연결에서 최고 성능을 냈고, Kimi K3는 쉬움·중간 샘플에서 frontier 성능과 맞먹었지만 노이즈가 더 많고 작전 보안이 더 강한 어려운 샘플에서는 뒤처졌다. Anthropic은 합성 데이터에 중복 표현과 낮은 현실감 같은 한계가 있었다고 밝혔다.

Anthropic은 신원 분석 작업에서 모델 속도를 위험 요인으로 꼽았다. 중앙값 샘플은 약 37,000단어였고, 회사는 인간 분석가가 이를 읽는 데 약 2.5시간이 걸리며 체계적으로 분석하려면 훨씬 더 긴 시간이 필요하다고 설명했다. Claude Mythos Preview는 중앙값 길이 샘플에 대한 완전한 평가를 만드는 데 평균 약 11분이 걸렸다.

사진 지리 위치 추정에서 Anthropic은 모델에 역이미지 검색, 메타데이터, 도구 없이 자체 세계 지식만 사용해 소셜미디어 이미지의 위치를 찾게 했다. 이미지는 허용적 라이선스를 가진 YFCC100M Flickr 데이터셋의 정밀 지오태그 하위 집합에서 가져왔고, 위치 추정이 불가능한 이미지는 제거한 뒤 대륙별로 층화했다. 인간 대리 기준은 Haas et al. 2024의 458개 다중 라운드 GeoGuessr 대결에서 가져왔으며, Champion Division 플레이어의 중앙값 거리 오차는 151 km, Master Division은 174 km, Gold Division은 1,714 km였다.

Anthropic은 frontier LLM 지능이 야외 사진 지리 위치 추정에서 초인간 수준에 접근하고 있다고 밝혔다. 6,000장 사진에서 Mythos Preview와 Mythos 5의 중앙값 거리 오차는 각각 37.0 km와 47.2 km였고, 1 km 이내 비율은 23.7%와 23.1%였다. Opus 5는 181 km와 18.0%, Sonnet 5는 384 km와 9.9%, Kimi K3는 385 km와 16.7%를 기록했다. Kimi K3의 1 km 이내 비율은 Sonnet 5의 약 1.7배였다.

텍스트 지리 위치 추정에서 Anthropic은 9,475명 사용자의 지오태그 트윗으로 구성된 2010년 말뭉치 GeoText를 사용했다. 이 데이터는 5,685/1,895/1,895 train/test/dev 분할을 갖고 있었으며, 회사는 test 분할을 1,697명 사용자로 필터링했다. 185명 보류 사용자를 활용한 암기 탐침에서는 모든 모델이 뉴욕시 기준선 이하였고, 중앙값 오차는 800–2,000 km로 기준선 677 km보다 컸다. 6개 모델 전체에서 135명, 즉 말뭉치의 8%는 적어도 1개 모델에 의해 1 km 이내에 안정적으로 배치됐다. 이 가운데 95명, 즉 70%는 명시적 단서로 위치가 드러났고, 17명, 즉 13%는 언어와 지역 참조로, 23명, 즉 17%는 대체로 운 좋은 추정으로 평가됐다.

텍스트 지리 위치 점수는 촘촘하게 모였다. 검색 사용 시 집 위치 중앙값 오차는 Mythos Preview 20.1 km, Mythos 5 20.9 km, Opus 5 21.7 km, Sonnet 5 31.3 km, Kimi K3 26.4 km, GLM 5.2 31.0 km였다. Kimi K3는 사용자 57%에서 검색했고, Claude 모델들은 99% 넘게 검색했으며, GLM 5.2는 사용자 87%에서 검색했다. Anthropic은 감시와 재래식 무기 오용을 차단하는 새 분류기 등 플랫폼 내 안전 조치를 정당화하는 결과라고 밝혔다.

Anthropic은 2026년 9월 10일 Frontier Red Team이 전술 정보 표적 지정과 재래식 무기 개발에서 AI 역량을 평가하는 실험을 만들었다고 밝혔다. 여기에는 단편적 정보로 사람을 찾아내는 작업과 움직이는 표적을 공격하도록 드론을 설계하는 작업이 포함됐다. 회사는 일부 모델이 과거에는 희소하고 고도로 훈련된 인간 전문가가 필요했던 군사·정보 영역의 과제를 수행할 수 있으며, 실제 오용 사례에서도 위협 행위자들이 감시와 재래식 무기 개발에서 AI의 이점을 보고 있다고 설명했다.

평가는 “find, fix, track, target, engage, assess” 같은 킬 체인(표적 탐지부터 효과 평가까지의 군사 절차) 일부를 시험했다. 이 영역에서는 숙련된 정보 분석가나 엔지니어가 보통 정보 수집 또는 무기 성능을 개선한다. Anthropic은 PRC 개발자의 오픈 웨이트 모델(가중치를 공개해 내려받아 쓸 수 있는 모델)이 frontier에는 뒤처졌고 대체로 Sonnet급과 Mythos급 모델 사이에 있었지만, 적을 식별·표적화하고 무기 성능을 높이는 데 우려할 만한 능력을 보였다고 밝혔다.

신원 상관관계 분석과 분류 평가에서 Anthropic은 멕시코시티와 콜카타의 가상 시위 운동 2개 설정을 바탕으로 200개 모의 소셜미디어 과제를 만들었다. 과제는 쉬움 68개, 중간 68개, 어려움 64개로 나뉘었다. 평가는 WhatsApp, Telegram, Instagram, Facebook 전반에서 모델이 생성한 활동을 사용했으며, 계정 연결과 분류는 정밀도와 재현율의 조화평균인 F1 점수로 채점했다. Mythos Preview는 계정 연결에서 최고 성능을 냈고, Kimi K3는 쉬움·중간 샘플에서 frontier 성능과 맞먹었지만 노이즈가 더 많고 작전 보안이 더 강한 어려운 샘플에서는 뒤처졌다. Anthropic은 합성 데이터에 중복 표현과 낮은 현실감 같은 한계가 있었다고 밝혔다.

Anthropic은 신원 분석 작업에서 모델 속도를 위험 요인으로 꼽았다. 중앙값 샘플은 약 37,000단어였고, 회사는 인간 분석가가 이를 읽는 데 약 2.5시간이 걸리며 체계적으로 분석하려면 훨씬 더 긴 시간이 필요하다고 설명했다. Claude Mythos Preview는 중앙값 길이 샘플에 대한 완전한 평가를 만드는 데 평균 약 11분이 걸렸다.

사진 지리 위치 추정에서 Anthropic은 모델에 역이미지 검색, 메타데이터, 도구 없이 자체 세계 지식만 사용해 소셜미디어 이미지의 위치를 찾게 했다. 이미지는 허용적 라이선스를 가진 YFCC100M Flickr 데이터셋의 정밀 지오태그 하위 집합에서 가져왔고, 위치 추정이 불가능한 이미지는 제거한 뒤 대륙별로 층화했다. 인간 대리 기준은 Haas et al. 2024의 458개 다중 라운드 GeoGuessr 대결에서 가져왔으며, Champion Division 플레이어의 중앙값 거리 오차는 151 km, Master Division은 174 km, Gold Division은 1,714 km였다.

Anthropic은 frontier LLM 지능이 야외 사진 지리 위치 추정에서 초인간 수준에 접근하고 있다고 밝혔다. 6,000장 사진에서 Mythos Preview와 Mythos 5의 중앙값 거리 오차는 각각 37.0 km와 47.2 km였고, 1 km 이내 비율은 23.7%와 23.1%였다. Opus 5는 181 km와 18.0%, Sonnet 5는 384 km와 9.9%, Kimi K3는 385 km와 16.7%를 기록했다. Kimi K3의 1 km 이내 비율은 Sonnet 5의 약 1.7배였다.

텍스트 지리 위치 추정에서 Anthropic은 9,475명 사용자의 지오태그 트윗으로 구성된 2010년 말뭉치 GeoText를 사용했다. 이 데이터는 5,685/1,895/1,895 train/test/dev 분할을 갖고 있었으며, 회사는 test 분할을 1,697명 사용자로 필터링했다. 185명 보류 사용자를 활용한 암기 탐침에서는 모든 모델이 뉴욕시 기준선 이하였고, 중앙값 오차는 800–2,000 km로 기준선 677 km보다 컸다. 6개 모델 전체에서 135명, 즉 말뭉치의 8%는 적어도 1개 모델에 의해 1 km 이내에 안정적으로 배치됐다. 이 가운데 95명, 즉 70%는 명시적 단서로 위치가 드러났고, 17명, 즉 13%는 언어와 지역 참조로, 23명, 즉 17%는 대체로 운 좋은 추정으로 평가됐다.

텍스트 지리 위치 점수는 촘촘하게 모였다. 검색 사용 시 집 위치 중앙값 오차는 Mythos Preview 20.1 km, Mythos 5 20.9 km, Opus 5 21.7 km, Sonnet 5 31.3 km, Kimi K3 26.4 km, GLM 5.2 31.0 km였다. Kimi K3는 사용자 57%에서 검색했고, Claude 모델들은 99% 넘게 검색했으며, GLM 5.2는 사용자 87%에서 검색했다. Anthropic은 감시와 재래식 무기 오용을 차단하는 새 분류기 등 플랫폼 내 안전 조치를 정당화하는 결과라고 밝혔다.

원문 보기 (영어)·2026년 9월 10일
안전·윤리#anthropic#frontier red team#ai safety#tactical targeting#conventional weapons#geolocation#kill chain#f1 score#open weights#mythos preview