주요 LLM, 자유지상 좌파로 측정
- •주요 LLM 16개가 politicalcompass.org 반복 테스트에서 모두 자유지상 좌파 사분면에 놓였다
- •Grok은 경제 좌파 -5.9와 경제 우파 +3.3 페르소나가 정확히 50/50으로 갈렸다
- •모델들은 자신이 놓인 정치적 위치를 평균 4.64점 빗나가게 판단했다
Unslop.run 블로거는 2026년 7월 27일 politicalcompass.org로 주요 LLM 16개를 반복 테스트한 결과, 약 70,000개 답변에서 모든 모델이 자유지상 좌파 사분면에 놓였다고 밝혔다. 테스트에는 구글, Anthropic, OpenAI, xAI, Meta, Mistral, 중국 연구소 모델이 포함됐으며, Grok 4.5, Llama 4 Maverick, Mistral Large와 Small, 여러 중국 모델도 대상이었다. 각 모델은 62문항 정치 나침반 테스트 전체를 30회, 문항을 반대로 쓴 버전을 30회, 순서를 바꾼 버전을 10회 풀어 동의 편향이나 문항 순서가 결과를 바꾸는지 확인했다.
가장 특이한 결과는 Grok에서 나왔다. Grok의 평균 경제 점수는 -1.3이었지만, 실제 실행 결과는 두 페르소나로 정확히 50/50 갈렸다. 하나는 경제 좌파 쪽 평균 -5.9였고, 다른 하나는 경제 우파 쪽 평균 +3.3이었다. Grok은 두 페르소나 모두에서 사회 축상 자유지상주의 성향을 유지했다. 저자는 Grok의 학습 데이터와 우파 성향 출력 조정이 어긋났을 가능성을 설명으로 제시했지만, 이를 추측으로 표시하며 사실이라고 장담하지 않겠다고 말했다.
나머지 15개 모델은 자유지상 좌파 사분면에 확고히 자리했다. 경제 점수는 가장 온건한 모델로 설명된 Claude Fable 5의 -4.8부터 Gemini Flash의 -8.6까지였다. 사회 점수는 약 -5.0에서 -7.6 사이에 모였고, 반복 실행 간 최대 차이는 10점 척도에서 약 1.2점이었다. 저자는 무작위 답변이라면 (0, 0)이 나와야 하므로, 이렇게 모인 결과를 우연으로 보지 않았다.
연구소의 소재 국가는 패턴을 크게 설명하지 못했다. 미국 모델 10개의 중심점은 (-5.9, -6.4)였고, Grok을 제외하면 (-6.4, -6.6)이었다. 중국 모델 4개 평균은 (-6.5, -6.1), 유럽 모델 2개 평균은 (-7.9, -6.5)였다. Kimi K2는 (-7.5, -7.1)을 기록해 테스트 내 어떤 GPT 모델보다 더 자유지상 좌파 쪽에 놓였고, Qwen3 235B는 (-6.1, -5.0)으로 측정 모델 중 사회적으로 가장 온건했다.
모델들은 새 대화에서 자신을 정치 나침반 위에 배치하라는 질문을 30회 받았을 때도 자신의 정치적 위치를 잘못 판단했다. 평균 오차는 4.64점이었다. GLM 4.5는 자신을 거의 중도라고 설명했지만 테스트에서는 -5.7, -6.6으로 나왔다. 저자가 가장 극단적인 모델이라고 부른 Gemini Flash는 자신을 -3.2, -3.2의 온건한 좌파 자유주의로 설명했다. Grok은 경제 축에서 자신을 +3.4에 놓아 우파 페르소나만 맞혔고, 평균 -5.9였던 좌파 절반은 놓쳤다.
구체적 문항에서는 62개 명제 중 42개에 대해 Grok의 두 페르소나를 포함한 16개 모델 모두가 같은 답을 냈다. 모든 모델은 인종적 우월성, 우생학, 누구도 선천적으로 동성애자가 아니라는 주장에 반대했다. 또한 모든 모델은 기업이 스스로 환경을 보호한다고 믿을 수 없고, 대중을 오도한 기업은 처벌받아야 하며, 동성 커플의 입양은 허용돼야 하고, 성인 두 명 사이의 사적 행위는 다른 사람이 간섭할 일이 아니라는 데 동의했다.
저자는 2026년 결과를 Rozado의 2024년 PLOS ONE 연구와 비교했다. 해당 연구는 챗봇 24개를 테스트해 평균 (-3.7, -4.2)를 얻었고, 새 테스트의 16개 모델은 약 (-6.3, -6.4)를 기록했다. 저자는 프로토콜이 동일하지 않다고 경고하며, 이 수치를 추세선이 아니라 두 개의 스냅샷으로 봐야 한다고 말했다. 같은 2년 동안 OpenAI 모델은 출시가 거듭될수록 더 왼쪽으로 이동했고, Anthropic 모델은 중심 쪽으로 되돌아갔다.
저자는 62개 명제 중 12개를 Gallup, Pew, GSS의 미국 여론조사와도 맞춰봤다. 12개 중 10개에서 모델들은 미국 다수 의견과 같은 편에 섰지만 일관성은 더 강했다. 대중이 58 to 71 percent로 동의한 항목에서 모델들은 거의 100 percent 실행에서 동의했고, 대중이 68 to 88 percent로 반대한 항목에서 모델들은 97 to 100 percent 비율로 반대했다. 예외는 미국인의 53 percent가 지지한 사형제와 52 percent가 지지한 아동 체벌이었으며, 모델 동의율은 각각 4 percent와 3 percent에 그쳤다.
채점 검증에서는 62개 문항 중 18개만 경제 축에 영향을 줬고, 우측 이동 문항 9개와 좌측 이동 문항 9개로 균등하게 나뉘었다. 62개 전체 명제에 동의하면 경제 점수는 +0.4였고, 62개 전체 명제에 반대하면 -0.3이었다. 이는 많은 모델이 기록한 약 -6점대와 거리가 컸다. 사회 축에서는 동의 시 권위주의 쪽으로 미는 문항이 31개, 자유지상주의 쪽으로 미는 문항이 12개였으므로 단순한 동의 성향만으로 자유지상 좌파 결과가 만들어지지는 않는다고 봤다.