MIT, AI 내부 작동 확인하는 '뉴럴 투명성' 도구 공개
- •MIT 연구진이 AI와 대화하기 전 내부 행동 특성을 시각화하여 미리 보여주는 기술을 개발했다.
- •연구 결과, 사용자는 AI의 성격 특성을 15개 중 11개 항목에서 잘못 예측하는 것으로 나타났다.
- •내부 신경망 활성화를 시각화하면 다중 대화 과정에서 발생할 수 있는 사용자의 과도한 신뢰를 줄일 수 있다.
MIT 미디어 랩(MIT Media Lab)의 팻 파타라누타폰(Pat Pataranutaporn) 교수 연구팀은 사용자가 AI 모델의 내부 행동을 미리 파악할 수 있는 '뉴럴 투명성' 인터페이스를 공개했다. ACM 지능형 사용자 인터페이스 학회(ACM Conference on Intelligent User Interfaces)에서 발표된 이 기술은 기계적 해석 가능성(mechanistic interpretability)을 활용하여 AI의 복잡한 내부 신경망 활성화를 사용자가 이해하기 쉬운 성격 특성으로 변환한다. 연구팀은 공감 능력과 독성과 같은 상반된 개념에 대한 모델의 반응을 분석해, 이를 선버스트(sunburst) 형태의 시각 자료로 구현하여 설계 단계부터 잠재적인 행동 방식을 드러낸다.
연구 결과에 따르면 사용자가 인식하는 AI의 모습과 실제 성능 사이에는 상당한 괴리가 존재한다. 개인화된 AI 챗봇을 대상으로 진행된 실험에서 참가자들은 15개의 측정 항목 중 11개 항목에서 AI의 행동을 잘못 예측했다. 특히 사용자는 AI의 긍정적인 특성은 과대평가하는 반면, 사용자의 의견에 맹목적으로 동조하는 아첨 현상과 같은 위험 요소는 과소평가하는 경향을 보였다. 팻 파타라누타폰 교수는 시각화 도구가 사용자 신뢰도를 높이는 데는 성공했으나, 시스템 프롬프트 작성 방식에는 즉각적인 변화를 이끌어내지 못해 시각적 투명성만으로는 안전한 설계가 충분히 보장되지 않는다는 점을 지적했다.
이에 연구팀은 대화가 진행됨에 따라 모델의 상태가 고정되지 않고 변화하는 방식에 대한 후속 연구를 진행 중이다. 초기 결과는 이러한 동적 변화를 시각화하는 것이 사용자로 하여금 AI의 행동 변화를 인지하게 하고, AI에 대한 근거 없는 확신을 줄이는 데 효과적임을 보여준다. 연구진은 AI가 의료, 교육, 개인적 관계에 깊숙이 통합됨에 따라 식품 영양 성분표와 같은 투명성 도구가 필수적이라고 강조했다. 궁극적으로는 사후 수정이 아닌 선제적 설계를 통해 개인화된 AI가 사용자에게 해를 끼치지 않고 긍정적인 지원을 제공하도록 만드는 것이 이번 연구의 목적이다.