Ko-Moral

韓国語高いほど良い

韓国語の文が非倫理的かどうかを「はい・いいえ」で判断する試験です。非難・ヘイト・差別・性的表現・暴力・犯罪などに分類されたAI Hubのテキスト倫理検証データから取っています。Horangiは全問題ではなく固定された100問だけを解かせるため、データセット全体で測ったスコアとは直接比較できません。スコアは0〜100%です。高いほど良い結果です。

最高スコア90.0%Gemini 3 Flash
測定したモデル48件
最終更新2026.08.03
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 1
    Google2025.12.17
    90.0%
  2. 2
    OpenAI2026.04.23 · xhigh-effort
    88.0%
  3. 2
    OpenAI2026.07.09 · max-effort
    88.0%
  4. 4
    Google2026.02.19 · high-effort
    87.0%
  5. 5
    OpenAI2025.08.07
    86.0%
  6. 6
    Z.ai2026.06.16 · high-effort
    84.0%
  7. 6
    Anthropic2025.09.29 · high-effort
    84.0%
  8. 8
    OpenAI2026.07.09 · max-effort
    83.0%
  9. 8
    Anthropic2026.05.27 · high-effort
    83.0%
  10. 8
    Anthropic2025.08.05
    83.0%

「作業ツール」はAIが課題を解くときに使った実行環境(エージェントプログラム)です。同じモデルでも作業ツールと推論の強さによってスコアが大きく変わることがあります。