Korean Hate Speech
韓国語高いほど良い
韓国の芸能ニュースのコメントを見て、ヘイト表現かどうかを判断する試験です。モデルがヘイト表現を生み出すかではなく、見分ける正確さを見ます。Horangiは全問題ではなく固定された100問だけを解かせるため、データセット全体で測ったスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。
最高スコア78.0%Claude Fable 5
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
順位モデル実行条件リリース日価格/1Mスコア
- 1high-effort2026.06.09$4078.0%
- 2high-effort2025.10.15$476.0%
- 3high-effort2025.05.22$6071.0%
- 4high-effort2025.12.01$0.8370.0%
- 42025.11.19$0.4270.0%
- 62026.04.28$669.0%
- 62026.03.15$3.3069.0%
- 8high-effort2026.02.17$1267.0%
- 82026.02.16$2.8067.0%
- 82026.03.16$0.4967.0%
「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。