Qwen 3.5の検閲回路が特定される
- •Qwen 3.5-9Bは、中国で敏感とされるトピックに対して検閲を行う特定の内部回路を使用している。
- •検閲メカニズムは、モデルの第11層から第20層にかけて計算される3つの方向ベクトルで構成される。
- •これらのベクトルを操作するステアリング実験により、研究者はモデルの学習済み応答を上書きできることを示した。
Qwen 3.5-9Bのメカニスティックな解釈可能性(モデルの内部構造を数学的に解析し、挙動の根拠を特定する手法)に関する研究により、政治的な検閲がモデル内部の小さな識別可能な回路によって制御されていることが判明した。研究チームは、天安門事件や法輪功などの敏感なトピックが、ベースモデルとしての事実知識を保持しつつ、特定の行動パターン(話題のそらしやプロパガンダ)へと誘導される経路を確認した。この検閲は、決定を下す第11層から第20層と、出力を生成する第20層から第31層の2段階で機能する。
同回路は、内部の隠れ状態において「d_prc」(中国関連の検閲対象コンテンツの識別)、「d_refuse」(拒否の判断)、「d_style」(話題そらしかプロパガンダかの選択)という3つの方向を符号化している。残差ストリーム(モデル内の層間を流れる情報の通り道)にベクトルを加算するステアリング(モデルの出力を特定方向に強制的に変化させる手法)を用いることで、研究者はモデルの応答を反転させることに成功した。この方向ベクトルは単純な真偽判定ではなく、構造的なプロンプトパターンに基づいて段階的に作動する分類器であることが示された。
検閲の挙動はチャット版で一貫しており、未調整のQwen 3.5-9B-Baseモデルでは西洋的な観点を含む事実知識が保持されていた。これは検閲が事前学習段階ではなく、事後学習で追加された行動層であることを示唆している。4つのカテゴリにわたる200個のプロンプトを分析した結果、この回路は主に中国政府が関与する検閲に特化していることが分かった。特定の層でこれらのベクトルを操作するとシグモイド曲線を描く反応が得られ、これらのベクトルが直接的にモデルの出力を制御している因果関係が立証された。