AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

검토 결과, 실제 에이전트형 보안 시스템은 제한적

검토 결과, 실제 에이전트형 보안 시스템은 제한적

Semantic Scholar·2026년 10월 2일 (금)
  • •2023년부터 2026년까지 취약점 관리 분야의 언어 모델 연구 53건을 검토
  • •53건 중 15건, 28.3%만 실질적인 에이전트형 행동 기준 충족
  • •근거에 기반한 취약점 관리에 제한적이고 감사 가능한 LLM 활용 권고
  • •2023년부터 2026년까지 취약점 관리 분야의 언어 모델 연구 53건을 검토
  • •53건 중 15건, 28.3%만 실질적인 에이전트형 행동 기준 충족
  • •근거에 기반한 취약점 관리에 제한적이고 감사 가능한 LLM 활용 권고
  • •2023년부터 2026년까지 취약점 관리 분야의 언어 모델 연구 53건을 검토
  • •53건 중 15건, 28.3%만 실질적인 에이전트형 행동 기준 충족
  • •근거에 기반한 취약점 관리에 제한적이고 감사 가능한 LLM 활용 권고
  • •2023년부터 2026년까지 취약점 관리 분야의 언어 모델 연구 53건을 검토
  • •53건 중 15건, 28.3%만 실질적인 에이전트형 행동 기준 충족
  • •근거에 기반한 취약점 관리에 제한적이고 감사 가능한 LLM 활용 권고

2026년 《Expert Systems》에 발표된 체계적 문헌 검토는 대규모 언어 모델(LLM), 사전학습 언어·코드 모델, 에이전트형 인공지능이 취약점 관리 분야에서 어떻게 연구되고 있는지 살폈습니다. 저자들은 PRISMA 2020 지침에 따라 학술 데이터베이스 6곳을 검색하고, 2026년 8월 22일 검색 결과를 갱신했으며, 인용 문헌의 앞뒤 연구도 확인했습니다. 그 결과 2023년부터 2026년까지 발표된 동료 심사 1차 연구 53건을 선정했습니다.

검토 대상 연구는 취약점 발견·탐지, 취약점 정보·우선순위 지정, 위협 맥락·악용·운영 단계의 탐색, 수정·대응·자율 방어 등 4개 영역으로 분류됐습니다. 모델 중심 연구는 표준화된 벤치마크 근거를 가장 많이 제공했지만, 데이터셋 구성과 클래스 불균형(범주별 데이터 수의 편차), 데이터 누출(학습 데이터가 평가에 섞이는 현상), 코드 맥락, 언어 범위, 데이터셋 간 전이 여부에 따라 결과가 달랐습니다.

53건 중 15건, 즉 28.3%만이 검토에서 정의한 실질적 에이전트 행동을 구현하거나 직접 평가했습니다. 기준에는 증거를 상황에 맞게 수집하고, 도구를 반복 사용하며, 피드백에 따라 제어하고, 여러 요소가 협력하거나 제한된 행동을 수행하는 능력이 포함됐습니다. 검색 증강, 구조화된 프로그램·보안 지식, 외부 도구, 다중 에이전트 협력, 검증을 활용하는 연구는 최근 늘었지만, 익스플로잇 중심 연구나 자율 방어 평가만으로 실제 취약점 관리에서의 자율성이 입증되지는 않았습니다.

수정·대응 분야에서는 작업 실행에 성공했다는 사실만으로 취약점이 제거됐거나, 수정이 의미상 정확하고 운영상 안전하며 실제 서비스에 투입할 준비가 됐다고 볼 수 없었습니다. 검토진은 근거 성숙도 평가 체계를 적용하고 데이터, 평가, 근거 연결, 검증, 거버넌스에서 반복되는 미비점을 살폈습니다. 연구 결과는 무제한 자율 운영보다 근거에 기반한 취약점 관리 업무에서 LLM을 제한적이고 감사 가능한 방식으로 활용할 것을 뒷받침합니다.

2026년 《Expert Systems》에 발표된 체계적 문헌 검토는 대규모 언어 모델(LLM), 사전학습 언어·코드 모델, 에이전트형 인공지능이 취약점 관리 분야에서 어떻게 연구되고 있는지 살폈습니다. 저자들은 PRISMA 2020 지침에 따라 학술 데이터베이스 6곳을 검색하고, 2026년 8월 22일 검색 결과를 갱신했으며, 인용 문헌의 앞뒤 연구도 확인했습니다. 그 결과 2023년부터 2026년까지 발표된 동료 심사 1차 연구 53건을 선정했습니다.

검토 대상 연구는 취약점 발견·탐지, 취약점 정보·우선순위 지정, 위협 맥락·악용·운영 단계의 탐색, 수정·대응·자율 방어 등 4개 영역으로 분류됐습니다. 모델 중심 연구는 표준화된 벤치마크 근거를 가장 많이 제공했지만, 데이터셋 구성과 클래스 불균형(범주별 데이터 수의 편차), 데이터 누출(학습 데이터가 평가에 섞이는 현상), 코드 맥락, 언어 범위, 데이터셋 간 전이 여부에 따라 결과가 달랐습니다.

53건 중 15건, 즉 28.3%만이 검토에서 정의한 실질적 에이전트 행동을 구현하거나 직접 평가했습니다. 기준에는 증거를 상황에 맞게 수집하고, 도구를 반복 사용하며, 피드백에 따라 제어하고, 여러 요소가 협력하거나 제한된 행동을 수행하는 능력이 포함됐습니다. 검색 증강, 구조화된 프로그램·보안 지식, 외부 도구, 다중 에이전트 협력, 검증을 활용하는 연구는 최근 늘었지만, 익스플로잇 중심 연구나 자율 방어 평가만으로 실제 취약점 관리에서의 자율성이 입증되지는 않았습니다.

수정·대응 분야에서는 작업 실행에 성공했다는 사실만으로 취약점이 제거됐거나, 수정이 의미상 정확하고 운영상 안전하며 실제 서비스에 투입할 준비가 됐다고 볼 수 없었습니다. 검토진은 근거 성숙도 평가 체계를 적용하고 데이터, 평가, 근거 연결, 검증, 거버넌스에서 반복되는 미비점을 살폈습니다. 연구 결과는 무제한 자율 운영보다 근거에 기반한 취약점 관리 업무에서 LLM을 제한적이고 감사 가능한 방식으로 활용할 것을 뒷받침합니다.

원문 보기 (영어)·2026년 9월 28일
#large language models#agentic ai#vulnerability management#systematic review#prisma 2020#vulnerability detection#autonomous defense#security remediation