IFBench
In plain words · Whether it follows strict rules like "exactly 50 words"
- What does it measure?
- Artificial Analysis now classifies this as 'legacy' and rarely measures new models, so recent ones may be missing. How precisely the AI follows instructions: constraints like 'under 300 characters, end with a question, no digits'. It measures rule compliance, not the quality of the content.
- Who evaluates it, and how?
- Created by Allen AI. 58 new constraints not found in the older IFEval are attached to prompts from real user conversations (WildChat), and a program automatically checks whether each constraint was met. Artificial Analysis runs it independently.
- Reading the score
- 0–100%. Because it is about rule-following rather than knowledge, missing a single constraint costs points, and an answer that looks excellent to a person scores low if the format is off.
Rank
Top score83.3%Grok 4.3
Models tested81
Model release date (newest on the right)
Best score so farHigher on the chart is better
Which AI gives the writing and literature answers people prefer most?Arena Writing, Literature & Language
Gemini 4 Argon🥇
Gemini 4 Argon🥇Which AI do people prefer most in long conversations?Arena Multi-turn
Gemini 4 Argon🥇
Gemini 4 Argon🥇
- 🥇xAIGrok 4.3Reasoning effort: Medium1424144683.3%
- 🥈MiniMaxMiniMax M31422145082.9%
- 🥉NVIDIANemotron 3 UltraReasoning effort: Thinking1392139881.4%
- #4xAIGrok 4.20 (Reasoning)Reasoning effort: Thinking1448147981.2%
- #5AlibabaQwen3.7 Max1459148380.5%
- #6XiaomiMiMo V2.5 ProReasoning effort: Thinking1450148179.9%
- #7DeepSeekDeepSeek V4 Flash1416145379.2%
- #8AlibabaQwen3.5 397B A17BReasoning effort: Thinking1421145478.8%
- #9GoogleGemini 3 FlashReasoning effort: Thinking1461148278.0%
- #9AlibabaQwen3.7 Plus1437146478.0%
- #11GoogleGemini 3.1 Flash Lite1420143577.2%
- #12GoogleGemini 3.1 Pro1480149777.1%
- #13AlibabaQwen3.6 Max1446146976.6%
- #14DeepSeekDeepSeek V4 Pro1451147576.5%
- #15GoogleGemini 3.5 FlashReasoning effort: High1472147876.3%
- #16Z.aiGLM-5.1Reasoning effort: Thinking1452147876.3%
- #17Moonshot AIKimi K2.6Reasoning effort: Thinking1441146176.0%
- #18MetaMuse Spark1463149375.9%
- #18OpenAIGPT-5.4 NanoReasoning effort: Extra High1363141375.9%
- #20SK TelecomA.X K2——75.9%
- #21OpenAIGPT-5.5Reasoning effort: Extra High1466148475.9%
- #22MiniMaxMiniMax M2.71387142675.7%
- #23GoogleGemma 4 31BReasoning effort: Thinking1435146575.6%
- #24OpenAIGPT-5 MiniReasoning effort: High1352137375.4%
- #25AlibabaQwen3.6 Plus1423144575.2%
- #26OpenAIGPT-5.4Reasoning effort: Extra High1465149373.9%
- #27Z.aiGLM 5.2Reasoning effort: Max1459147573.3%
- #28OpenAIGPT-5.4 MiniReasoning effort: Extra High1423146673.3%
- #29Z.aiGLM-5-Turbo——73.2%
- #30OpenAIGPT-5Reasoning effort: High1396142073.1%
- #31OpenAIGPT-5.6 SolReasoning effort: Max1482148772.7%
- #32LG AI ResearchK-EXAONE 2.0——72.6%
- #33Z.aiGLM-5Reasoning effort: Thinking1449147172.3%
- #34MiniMaxMiniMax M2.51369139771.6%
- #35NVIDIANemotron 3 SuperReasoning effort: Thinking1325135171.5%
- #36OpenAIGPT-5.6 TerraReasoning effort: Max1445147071.2%
- #37UpstageSolar Pro 3——71.2%
- #38NVIDIANemotron 3 Nano 30B A3BReasoning effort: Thinking1267129071.1%
- #39AmazonNova 2 LiteReasoning effort: High1298132370.7%
- #40Moonshot AIKimi K2.5Reasoning effort: Thinking1428145270.2%
- #41OpenAIGPT OSS 120BReasoning effort: High1309132769.0%
- #42XiaomiMiMo V2 Pro1431146668.8%
- #43Mistral AIMistral Medium 3.51405143368.8%
- #44OpenAIGPT-5 NanoReasoning effort: High1289132467.6%
- #45StepfunStep 3.7 Flash——67.3%
- #46XiaomiMiMo V2.51412145167.1%
- #47LG AI ResearchK-EXAONEReasoning effort: Thinking——64.7%
- #48AlibabaQwen3.6 35B A3BReasoning effort: Thinking——64.4%
- #49AnthropicClaude Fable 5Reasoning effort: Max1508151863.5%
- #50NVIDIANemotron 3 Nano Omni——63.2%
- #51TencentHy31377141563.1%
- #51Moonshot AIKimi K2.7 Code——63.1%
- #53AnthropicClaude Opus 4.8Reasoning effort: Max1468149462.2%
- #54Z.aiGLM 5V TurboReasoning effort: Thinking1414143261.1%
- #55DeepSeekDeepSeek V3.2Reasoning effort: Thinking1410142960.7%
- #56AnthropicClaude Opus 4.7Reasoning effort: Max1484151458.6%
- #57AnthropicClaude Opus 4.5Reasoning effort: Thinking1467148458.0%
- #58CohereNorth Mini Code——57.6%
- #59AnthropicClaude Sonnet 4.5Reasoning effort: Thinking1454147857.3%
- #60AnthropicClaude Sonnet 4.6Reasoning effort: Max1455148156.6%
- #61Arcee AITrinity Large Thinking1343134656.3%
- #62AnthropicClaude Opus 4.1Reasoning effort: Thinking1446147255.4%
- #63AnthropicClaude Sonnet 4Reasoning effort: Thinking1398142154.7%
- #64AnthropicClaude Haiku 4.5Reasoning effort: Thinking1400142554.3%
- #65AnthropicClaude Opus 4Reasoning effort: Thinking1431143953.7%
- #66AnthropicClaude Opus 4.6Reasoning effort: Max1490151253.1%
- #67xAIGrok 4.1 Fast (Reasoning)Reasoning effort: Thinking1408141452.7%
- #68GoogleGemini 2.5 Flash LiteReasoning effort: Thinking1371137452.6%
- #69AlibabaQwen3.5 Plus——51.2%
- #70GoogleGemini 2.5 FlashReasoning effort: Thinking1402140350.3%
- #71xAIGrok 4.20Reasoning effort: None1452148349.3%
- #72GoogleGemini 2.5 Pro1445144848.7%
- #73Mistral AIMistral Small 4Reasoning effort: Thinking——48.2%
- #74Ring AIRing-2.6-1T——44.6%
- #75MeituanLongcat Flash Chat1392143243.1%
- #76MetaLlama 4 Maverick1312132643.0%
- #76OpenAIGPT-4.11308129943.0%
- #78BaiduERNIE 5.0 Thinking1419144241.4%
- #79MetaLlama 4 Scout1305131939.5%
- #80IBMGranite 4.1 8B1274127938.6%
- #81xAIGrok 4.1 FastReasoning effort: None——36.5%
Half of models ≤ 69.0%
37 of the 37 AIs released in the last 60 days have no score here yet · Claude Haiku 5.5, Decider V1.1 27B, GPT-6 Luna Decisions and 34 more
Source: Artificial Analysis Data sources & removal requestsRelated news
What to keep in mind
- This score comes from a fixed, predefined evaluation, so it may differ from what you get with your own question.
- Scores labelled 'Self-reported' were published by the AI maker itself, not measured by a third party.