DeepSeek V4 Flash 0731, 50점 기록
- •DeepSeek V4 Flash 0731은 50점을 기록해 2026년 4월 DeepSeek V4 Flash보다 10점 올랐다
- •OpenAI의 80% 가격 인하 뒤에도 Cost per Task는 GPT-5.6 Luna보다 ~60% 낮다
- •GDPval-AA v2 Elo는 1189에서 1559로 상승했고, Terminal-Bench 2.1은 79%를 기록했다
DeepSeek V4 Flash 0731은 2026년 7월 31일 Artificial Analysis Intelligence Index에서 50점을 기록했다. 이는 2026년 4월 40점으로 출시된 DeepSeek V4 Flash보다 10점 높은 수치다. 새 모델은 DeepSeek V4 Pro보다 6점 앞서고 GPT-5.6 Luna(max, 51)보다 1점 낮으며, 최근 출시된 Gemini 3.6 Flash(50)와 같은 점수이고 Muse Spark 1.1(xhigh, 51)보다 1점 뒤에 있다.
DeepSeek V4 Flash 0731의 DeepSeek 1차 API 기준 Cost per Task는 OpenAI가 이날 GPT-5.6 Luna 가격을 80% 인하한 뒤에도 GPT-5.6 Luna(max)보다 ~60% 낮다. Artificial Analysis는 주요 요인으로 DeepSeek 1차 API의 ~98% 캐시 히트 할인을 꼽았다. 이는 업계 대부분이 제공하는 90% 캐시 히트 할인보다 높다. 이 모델은 이전 DeepSeek V4 Flash와 동일한 아키텍처와 가격 체계를 공유하며, Artificial Analysis의 Intelligence 대 Cost per Task 파레토 프런티어(최적 절충 경계)에 올랐다.
DeepSeek V4 Flash 0731은 Kimi K3(max, 57)가 세운 오픈 웨이트 프런티어보다 7점 낮고, GLM-5.2(max, 51)와는 1점 이내에 있다. DeepSeek은 앞으로 몇 주 안에 이 모델의 전체 웨이트를 공개할 것으로 예상된다. 이 모델은 1M 토큰 컨텍스트 윈도우를 유지하고, 전체 파라미터 284B와 추론 시 활성 파라미터 13B를 사용하며, 텍스트 입력과 출력만 지원한다.
새 릴리스에서는 에이전트 성능이 크게 올랐다. DeepSeek V4 Flash 0731은 실제 업무형 에이전트 과제를 평가하는 GDPval-AA v2에서 Elo 레이팅 1559를 달성했다. 이전 DeepSeek V4 Flash의 1189보다 높은 수치다. 웨이트가 공개되면 Artificial Analysis 기준으로 Kimi K3(max, 1687)에 이어 두 번째로 높은 오픈 웨이트 점수가 되며, GLM-5.2(max, 1510)를 앞선다. Terminal-Bench 2.1은 17점 올라 79%가 됐고, τ³-Bench Banking은 8점 올라 31%를 기록했다.
AA-Omniscience 향상은 정확도 상승보다 환각 감소에서 나왔다. DeepSeek V4 Flash 0731은 AA-Omniscience Index에서 -16점을 받았으며, 이전 모델의 -23보다 +7 개선됐다. AA-Omniscience Hallucination Rate는 84%로 낮아졌고, 기사 표현상 11 또는 12점 하락했다. 정확도는 37%로 변하지 않았다.
DeepSeek V4 Flash 0731은 Artificial Analysis가 열거한 모든 Intelligence Index 평가에서 개선됐다. CritPt는 9점 올라 17%, SciCode는 5점 올라 50%, Humanity’s Last Exam은 5점 올라 37%, AA-LCR은 3점 올라 66%, GPQA Diamond는 1점 올라 91%가 됐다. 전체 출력 토큰 사용량은 DeepSeek V4 Flash의 ~234M에서 DeepSeek V4 Flash 0731의 ~206M으로 12% 줄었다. 가격은 1M 입력/출력 토큰당 $0.14/$0.28이며, 캐시 히트 가격은 1M 토큰당 $0.0028이다.