IFBench

かんたんに言うと · 「ちょうど50語で」のような細かい条件を守れるか

何を測定しますか?
Artificial Analysis が「レガシー」に分類し新モデルの測定が稀な評価です(最近のモデルは表にない場合があります)。指示をどれだけ正確に守るかを見ます。「300字以内で、最後の文は疑問文で、数字は使わずに」のような形式条件を漏れなく守る力で、答えの内容ではなく規則の遵守を測ります。
誰がどのように評価しますか?
Allen AI が作りました。従来の IFEval になかった新しい条件58種を実際のユーザー対話(WildChat)のプロンプトに付けて評価し、条件を守ったかをプログラムが自動検査します。Artificial Analysis が自ら実行します。
スコアの読み方
0〜100%。知識ではなく規則の遵守なので条件を一つ落としただけで減点され、人が見れば優れた答えでも形式が外れれば低く出ます。

順位

最高スコア83.3%Grok 4.3
測定したモデル81件
モデルのリリース時期(右が最新)
その時点の最高記録上ほど良い
  1. 🥇xAIGrok 4.3推論強度: Medium1424144683.3%
  2. 🥈MiniMaxMiniMax M31422145082.9%
  3. 🥉NVIDIANemotron 3 Ultra推論強度: Thinking1392139881.4%
  4. #4xAIGrok 4.20 (Reasoning)推論強度: Thinking1448147981.2%
  5. #5AlibabaQwen3.7 Max1459148380.5%
  6. #6XiaomiMiMo V2.5 Pro推論強度: Thinking1450148179.9%
  7. #7DeepSeekDeepSeek V4 Flash1416145379.2%
  8. #8AlibabaQwen3.5 397B A17B推論強度: Thinking1421145478.8%
  9. #9GoogleGemini 3 Flash推論強度: Thinking1461148278.0%
  10. #9AlibabaQwen3.7 Plus1437146478.0%
  11. #11GoogleGemini 3.1 Flash Lite1420143577.2%
  12. #12GoogleGemini 3.1 Pro1480149777.1%
  13. #13AlibabaQwen3.6 Max1446146976.6%
  14. #14DeepSeekDeepSeek V4 Pro1451147576.5%
  15. #15GoogleGemini 3.5 Flash推論強度: High1472147876.3%
  16. #16Z.aiGLM-5.1推論強度: Thinking1452147876.3%
  17. #17Moonshot AIKimi K2.6推論強度: Thinking1441146176.0%
  18. #18MetaMuse Spark1463149375.9%
  19. #18OpenAIGPT-5.4 Nano推論強度: Extra High1363141375.9%
  20. #20SK TelecomA.X K2——75.9%
  21. #21OpenAIGPT-5.5推論強度: Extra High1466148475.9%
  22. #22MiniMaxMiniMax M2.71387142675.7%
  23. #23GoogleGemma 4 31B推論強度: Thinking1435146575.6%
  24. #24OpenAIGPT-5 Mini推論強度: High1352137375.4%
  25. #25AlibabaQwen3.6 Plus1423144575.2%
  26. #26OpenAIGPT-5.4推論強度: Extra High1465149373.9%
  27. #27Z.aiGLM 5.2推論強度: Max1459147573.3%
  28. #28OpenAIGPT-5.4 Mini推論強度: Extra High1423146673.3%
  29. #29Z.aiGLM-5-Turbo——73.2%
  30. #30OpenAIGPT-5推論強度: High1396142073.1%
  31. #31OpenAIGPT-5.6 Sol推論強度: Max1482148772.7%
  32. #32LG AI ResearchK-EXAONE 2.0——72.6%
  33. #33Z.aiGLM-5推論強度: Thinking1449147172.3%
  34. #34MiniMaxMiniMax M2.51369139771.6%
  35. #35NVIDIANemotron 3 Super推論強度: Thinking1325135171.5%
  36. #36OpenAIGPT-5.6 Terra推論強度: Max1445147071.2%
  37. #37UpstageSolar Pro 3——71.2%
  38. #38NVIDIANemotron 3 Nano 30B A3B推論強度: Thinking1267129071.1%
  39. #39AmazonNova 2 Lite推論強度: High1298132370.7%
  40. #40Moonshot AIKimi K2.5推論強度: Thinking1428145270.2%
  41. #41OpenAIGPT OSS 120B推論強度: High1309132769.0%
  42. #42XiaomiMiMo V2 Pro1431146668.8%
  43. #43Mistral AIMistral Medium 3.51405143368.8%
  44. #44OpenAIGPT-5 Nano推論強度: High1289132467.6%
  45. #45StepfunStep 3.7 Flash——67.3%
  46. #46XiaomiMiMo V2.51412145167.1%
  47. #47LG AI ResearchK-EXAONE推論強度: Thinking——64.7%
  48. #48AlibabaQwen3.6 35B A3B推論強度: Thinking——64.4%
  49. #49AnthropicClaude Fable 5推論強度: Max1508151863.5%
  50. #50NVIDIANemotron 3 Nano Omni——63.2%
  51. #51TencentHy31377141563.1%
  52. #51Moonshot AIKimi K2.7 Code——63.1%
  53. #53AnthropicClaude Opus 4.8推論強度: Max1468149462.2%
  54. #54Z.aiGLM 5V Turbo推論強度: Thinking1414143261.1%
  55. #55DeepSeekDeepSeek V3.2推論強度: Thinking1410142960.7%
  56. #56AnthropicClaude Opus 4.7推論強度: Max1484151458.6%
  57. #57AnthropicClaude Opus 4.5推論強度: Thinking1467148458.0%
  58. #58CohereNorth Mini Code——57.6%
  59. #59AnthropicClaude Sonnet 4.5推論強度: Thinking1454147857.3%
  60. #60AnthropicClaude Sonnet 4.6推論強度: Max1455148156.6%
  61. #61Arcee AITrinity Large Thinking1343134656.3%
  62. #62AnthropicClaude Opus 4.1推論強度: Thinking1446147255.4%
  63. #63AnthropicClaude Sonnet 4推論強度: Thinking1398142154.7%
  64. #64AnthropicClaude Haiku 4.5推論強度: Thinking1400142554.3%
  65. #65AnthropicClaude Opus 4推論強度: Thinking1431143953.7%
  66. #66AnthropicClaude Opus 4.6推論強度: Max1490151253.1%
  67. #67xAIGrok 4.1 Fast (Reasoning)推論強度: Thinking1408141452.7%
  68. #68GoogleGemini 2.5 Flash Lite推論強度: Thinking1371137452.6%
  69. #69AlibabaQwen3.5 Plus——51.2%
  70. #70GoogleGemini 2.5 Flash推論強度: Thinking1402140350.3%
  71. #71xAIGrok 4.20推論強度: None1452148349.3%
  72. #72GoogleGemini 2.5 Pro1445144848.7%
  73. #73Mistral AIMistral Small 4推論強度: Thinking——48.2%
  74. #74Ring AIRing-2.6-1T——44.6%
  75. #75MeituanLongcat Flash Chat1392143243.1%
  76. #76MetaLlama 4 Maverick1312132643.0%
  77. #76OpenAIGPT-4.11308129943.0%
  78. #78BaiduERNIE 5.0 Thinking1419144241.4%
  79. #79MetaLlama 4 Scout1305131939.5%
  80. #80IBMGranite 4.1 8B1274127938.6%
  81. #81xAIGrok 4.1 Fast推論強度: None——36.5%
モデルの半数が69.0%以下

直近60日にリリースされたAI 37個のうち37個はまだこの試験のスコアがありません · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions ほか34個

出典: Artificial Analysis データの出典・掲載停止のご依頼

関連ニュース

このスコアを読むときに知っておくこと

  • あらかじめ決められた方法で一括測定したスコアなので、自分の質問での結果とは異なる場合があります。
  • 「開発元発表」と表示されたスコアは、AI開発元が自ら発表した数値で、第三者の測定ではありません。