DeepSeek V4 Flash 0731が50点
- •DeepSeek V4 Flash 0731は50点を記録し、April 2026のDeepSeek V4 Flashから10点上昇
- •OpenAIの80%値下げ後も、Cost per TaskはGPT-5.6 Lunaを約60%下回る
- •GDPval-AA v2のEloは1189から1559へ上昇、Terminal-Bench 2.1は79%
DeepSeek V4 Flash 0731はJuly 31, 2026、Artificial Analysis Intelligence Indexで50点を記録した。April 2026に40点で公開されたDeepSeek V4 Flashから10点の上昇である。新モデルはDeepSeek V4 Proを6点上回り、GPT-5.6 Luna(max, 51)を1点下回った。recently released Gemini 3.6 Flash(50)とは同点で、Muse Spark 1.1(xhigh, 51)からは1点差だった。
DeepSeek V4 Flash 0731のDeepSeek first-party APIにおけるCost per Taskは、OpenAIがtodayにGPT-5.6 Lunaを80%値下げした後でも、GPT-5.6 Luna(max)より約60%低い。Artificial Analysisは主因として、DeepSeekのfirst-party APIが約98%のcache hit discountを提供している点を挙げた。業界の多くが提供するcache hit discountは90%である。新モデルは従来のDeepSeek V4 Flashと同一のアーキテクチャと価格体系を共有し、Artificial AnalysisのIntelligence対Cost per Taskのパレート境界(最良のトレードオフ境界)に位置した。
DeepSeek V4 Flash 0731は、Kimi K3(max, 57)が示すopen weights frontierを7点下回り、GLM-5.2(max, 51)とは1点以内に入った。DeepSeekは今後数週間で同モデルのfull weightsを公開する見通しだ。モデルは1M tokenのコンテキストウィンドウを維持し、総パラメータ数は284B、推論時に有効なパラメータは13Bである。入出力はテキストのみをサポートする。
Agentic performanceは新リリースで大きく上昇した。DeepSeek V4 Flash 0731は、agentic real-world work tasksの評価であるGDPval-AA v2でEloレーティング1559を達成し、従来のDeepSeek V4 Flashの1189から伸びた。weights公開後は、Artificial AnalysisによればKimi K3(max, 1687)に次ぐ2番目に高いopen weights scoreとなり、GLM-5.2(max, 1510)を上回る。Terminal-Bench 2.1は17点上昇して79%、τ³-Bench Bankingは8点上昇して31%となった。
AA-Omniscienceの改善は、accuracyの上昇ではなくhallucinationsの減少によるものだった。DeepSeek V4 Flash 0731はAA-Omniscience Indexで-16を記録し、前モデルの-23から+7改善した。AA-Omniscience Hallucination Rateは84%で、記事の表現では11または12ポイント低下した一方、accuracyは37%で変わらなかった。
DeepSeek V4 Flash 0731は、Artificial Analysisが列挙したすべてのIntelligence Index評価で改善した。CritPtは9点上昇して17%、SciCodeは5点上昇して50%、Humanity’s Last Examは5点上昇して37%、AA-LCRは3点上昇して66%、GPQA Diamondは1点上昇して91%だった。総出力トークン使用量は12%減り、DeepSeek V4 Flashの約234MからDeepSeek V4 Flash 0731の約206Mになった。価格は入力/出力1M tokenあたり$0.14/$0.28で、cache hit priceは1M tokenあたり$0.0028である。