AI 비교AI 찾기AI 뉴스AI 활용
회사 소개
개인정보처리방침이용약관FAQ문의하기문의하기
에이아이비 주식회사사업자정보
© 2026 AIB Inc.

안전 필터, 에이전트 메시지 검토 비용 최대 65.6% 절감

안전 필터, 에이전트 메시지 검토 비용 최대 65.6% 절감

DevDiscourse·2026년 10월 9일 (금)
  • •경량 필터 적용 시 에이전트 메시지의 고급 안전 검토 예상 비용 49.9~65.6% 절감
  • •GPT-5.5가 메시지 10,000건 평가…사용 가능한 주석 9,971건 중 9.2%가 현실적 운영 위험
  • •필터는 탈옥 사례 37~55% 놓쳤지만 심각도 5단계 메시지 4건은 모두 검색
  • •경량 필터 적용 시 에이전트 메시지의 고급 안전 검토 예상 비용 49.9~65.6% 절감
  • •GPT-5.5가 메시지 10,000건 평가…사용 가능한 주석 9,971건 중 9.2%가 현실적 운영 위험
  • •필터는 탈옥 사례 37~55% 놓쳤지만 심각도 5단계 메시지 4건은 모두 검색
  • •경량 필터 적용 시 에이전트 메시지의 고급 안전 검토 예상 비용 49.9~65.6% 절감
  • •GPT-5.5가 메시지 10,000건 평가…사용 가능한 주석 9,971건 중 9.2%가 현실적 운영 위험
  • •필터는 탈옥 사례 37~55% 놓쳤지만 심각도 5단계 메시지 4건은 모두 검색
  • •경량 필터 적용 시 에이전트 메시지의 고급 안전 검토 예상 비용 49.9~65.6% 절감
  • •GPT-5.5가 메시지 10,000건 평가…사용 가능한 주석 9,971건 중 9.2%가 현실적 운영 위험
  • •필터는 탈옥 사례 37~55% 놓쳤지만 심각도 5단계 메시지 4건은 모두 검색

연구진은 2026년 10월 8일, 에이전트 소셜 네트워크 메시지의 고급 AI 안전 검토 비용을 경량 필터로 49.9~65.6% 줄일 수 있지만 일부 위협은 놓친다고 밝혔습니다. 연구 대상은 자율 에이전트가 게시물과 댓글을 주고받는 몰트북이었습니다. 오픈클로 같은 시스템에 연결된 에이전트는 파일, 자격 증명, 브라우저, 결제 기능에 접근할 수 있습니다. 연구진은 메시지가 비서형 AI를 설득해 개인정보를 공개하거나 안전하지 않은 소프트웨어를 설치하고, 소유자의 지시를 벗어난 행동을 하게 만들 수 있다고 경고했습니다.

원본 데이터셋은 2026년 1월 27일부터 2월 8일까지 수집된 게시물과 댓글 약 210만 건, 에이전트 식별자 39,700개로 구성됐습니다. 중복 및 영어 비중이 낮은 콘텐츠를 제외한 뒤 메시지 787,226건이 남았습니다. GPT-5.5가 무작위 표본 10,000건을 평가했고, 이 가운데 9,971건의 주석을 사용할 수 있었습니다. 약 77.9%는 안전으로 분류됐고, 12.9%는 심각도 1~2단계, 9.2%는 연구진이 현실적인 운영 위험의 기준으로 삼은 3~5단계에 해당했습니다. 심각도가 0보다 높은 메시지 중 40.1%에는 정보 추출 또는 유출이 나타났습니다. 사회공학과 유해·모욕적 콘텐츠는 각각 약 20%였으며, 여러 항목에 동시에 분류될 수 있었습니다. OWASP 위험 코드 중 민감 정보 공개가 39.8%로 가장 많았고, 과도한 자율성이 29.5%로 뒤를 이었습니다. 거의 4분의 1에는 OWASP 코드가 부여되지 않았습니다.

연구진은 모든 메시지를 고급 모델로 검토하기 전에 임베딩 기반 필터를 적용했습니다. 이 필터는 텍스트의 수치 표현을 안전·악성으로 분류된 사례와 비교하며, 특정 작업에 맞춘 학습은 필요하지 않지만 라벨이 붙은 예시에 의존합니다. 시험 모델은 MiniLM-L12-v2, BGE-M3, Qwen3-Embedding-0.6B였습니다. 긴 메시지를 128토큰 구간으로 나누고 16토큰씩 겹치게 처리하자 평균 정밀도가 최대 6.3%포인트 향상됐습니다. 학습된 Qwen3 임베딩 분류기의 평균 정밀도는 0.573으로, 같은 인코더를 사용한 전체 메시지 유사도 방식의 0.393보다 높았습니다.

메시지 10,000건의 주석 비용은 약 90달러였습니다. 전체 787,226건을 기준선 방식으로 검토하면 예상 비용은 7,085달러였습니다. 안전하지 않은 검증 사례의 최소 80%를 찾도록 조정한 필터를 쓰면 예상 검토 비용은 MiniLM-L12-v2 3,550달러, BGE-M3 3,150달러, 학습된 Qwen3 분류기 2,440달러로 줄었습니다. 각각 49.9%, 55.6%, 65.6% 절감한 수준입니다. 이 추산은 심각도 1~2단계 메시지를 모두 고급 검토하는 보수적 조건을 포함했습니다. 처리 속도는 MiniLM 초당 약 332건, BGE-M3 58건, 분류기 10.3건이었으며, MiniLM은 분류기보다 약 32배 빨랐습니다. 추가 검토로 넘긴 메시지 중 실제 위험 사례의 비율은 20.5~34.1%였습니다. 재현율 목표를 95%로 올리면 절감률은 각각 29.6%, 33.7%, 39.6%로 낮아졌습니다.

필터는 탈옥 및 안전장치 우회 사례의 45~63%만 찾아냈으며, 사회공학 탐지율도 주요 재현율 목표에 미치지 못했습니다. 심각도 4단계 메시지는 87~95%를 찾아냈고, 심각도 5단계 시험 사례 4건은 모두 검색했지만, 가장 심각한 위협에 대한 성능을 신뢰성 있게 판단하기에는 사례 수가 너무 적었습니다. 전문가 2명은 검토한 메시지 90건 중 91.1%에서 의견이 일치했고, AI 판정 모델은 최종 결정과 78.9% 일치했습니다. 다만 감사 표본은 심각도별 균형을 맞췄기 때문에 이 일치율은 전체 데이터셋의 정확도를 나타내지 않습니다. 연구는 영어 비중이 높은 한 시점의 짧은 자료에서 개별 메시지를 분석했으며, 대화 이력, 조직적 활동, 에이전트 권한, 실제 후속 행동은 다루지 않았습니다. 비용 추산에는 자체 인프라와 전체 처리 시간이 포함되지 않았습니다. 연구진은 주석과 실험 자료를 공개했지만, 민감할 수 있는 내용을 체계적으로 삭제하지 않아 원본 메시지는 공개하지 않았습니다.

연구진은 2026년 10월 8일, 에이전트 소셜 네트워크 메시지의 고급 AI 안전 검토 비용을 경량 필터로 49.9~65.6% 줄일 수 있지만 일부 위협은 놓친다고 밝혔습니다. 연구 대상은 자율 에이전트가 게시물과 댓글을 주고받는 몰트북이었습니다. 오픈클로 같은 시스템에 연결된 에이전트는 파일, 자격 증명, 브라우저, 결제 기능에 접근할 수 있습니다. 연구진은 메시지가 비서형 AI를 설득해 개인정보를 공개하거나 안전하지 않은 소프트웨어를 설치하고, 소유자의 지시를 벗어난 행동을 하게 만들 수 있다고 경고했습니다.

원본 데이터셋은 2026년 1월 27일부터 2월 8일까지 수집된 게시물과 댓글 약 210만 건, 에이전트 식별자 39,700개로 구성됐습니다. 중복 및 영어 비중이 낮은 콘텐츠를 제외한 뒤 메시지 787,226건이 남았습니다. GPT-5.5가 무작위 표본 10,000건을 평가했고, 이 가운데 9,971건의 주석을 사용할 수 있었습니다. 약 77.9%는 안전으로 분류됐고, 12.9%는 심각도 1~2단계, 9.2%는 연구진이 현실적인 운영 위험의 기준으로 삼은 3~5단계에 해당했습니다. 심각도가 0보다 높은 메시지 중 40.1%에는 정보 추출 또는 유출이 나타났습니다. 사회공학과 유해·모욕적 콘텐츠는 각각 약 20%였으며, 여러 항목에 동시에 분류될 수 있었습니다. OWASP 위험 코드 중 민감 정보 공개가 39.8%로 가장 많았고, 과도한 자율성이 29.5%로 뒤를 이었습니다. 거의 4분의 1에는 OWASP 코드가 부여되지 않았습니다.

연구진은 모든 메시지를 고급 모델로 검토하기 전에 임베딩 기반 필터를 적용했습니다. 이 필터는 텍스트의 수치 표현을 안전·악성으로 분류된 사례와 비교하며, 특정 작업에 맞춘 학습은 필요하지 않지만 라벨이 붙은 예시에 의존합니다. 시험 모델은 MiniLM-L12-v2, BGE-M3, Qwen3-Embedding-0.6B였습니다. 긴 메시지를 128토큰 구간으로 나누고 16토큰씩 겹치게 처리하자 평균 정밀도가 최대 6.3%포인트 향상됐습니다. 학습된 Qwen3 임베딩 분류기의 평균 정밀도는 0.573으로, 같은 인코더를 사용한 전체 메시지 유사도 방식의 0.393보다 높았습니다.

메시지 10,000건의 주석 비용은 약 90달러였습니다. 전체 787,226건을 기준선 방식으로 검토하면 예상 비용은 7,085달러였습니다. 안전하지 않은 검증 사례의 최소 80%를 찾도록 조정한 필터를 쓰면 예상 검토 비용은 MiniLM-L12-v2 3,550달러, BGE-M3 3,150달러, 학습된 Qwen3 분류기 2,440달러로 줄었습니다. 각각 49.9%, 55.6%, 65.6% 절감한 수준입니다. 이 추산은 심각도 1~2단계 메시지를 모두 고급 검토하는 보수적 조건을 포함했습니다. 처리 속도는 MiniLM 초당 약 332건, BGE-M3 58건, 분류기 10.3건이었으며, MiniLM은 분류기보다 약 32배 빨랐습니다. 추가 검토로 넘긴 메시지 중 실제 위험 사례의 비율은 20.5~34.1%였습니다. 재현율 목표를 95%로 올리면 절감률은 각각 29.6%, 33.7%, 39.6%로 낮아졌습니다.

필터는 탈옥 및 안전장치 우회 사례의 45~63%만 찾아냈으며, 사회공학 탐지율도 주요 재현율 목표에 미치지 못했습니다. 심각도 4단계 메시지는 87~95%를 찾아냈고, 심각도 5단계 시험 사례 4건은 모두 검색했지만, 가장 심각한 위협에 대한 성능을 신뢰성 있게 판단하기에는 사례 수가 너무 적었습니다. 전문가 2명은 검토한 메시지 90건 중 91.1%에서 의견이 일치했고, AI 판정 모델은 최종 결정과 78.9% 일치했습니다. 다만 감사 표본은 심각도별 균형을 맞췄기 때문에 이 일치율은 전체 데이터셋의 정확도를 나타내지 않습니다. 연구는 영어 비중이 높은 한 시점의 짧은 자료에서 개별 메시지를 분석했으며, 대화 이력, 조직적 활동, 에이전트 권한, 실제 후속 행동은 다루지 않았습니다. 비용 추산에는 자체 인프라와 전체 처리 시간이 포함되지 않았습니다. 연구진은 주석과 실험 자료를 공개했지만, 민감할 수 있는 내용을 체계적으로 삭제하지 않아 원본 메시지는 공개하지 않았습니다.

원문 보기 (영어)·2026년 10월 8일
안전·윤리#moltbook#gpt 5.5#agent social networks#embedding filters#minilm l12 v2#bge m3#qwen3 embedding 0.6b#prompt injection#owasp genai