AI使い比べAIを探すAIニュースAI教室
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Minecraftデモはベンチマークではない

Minecraftデモはベンチマークではない

kuber.studio·2026年9月7日 (月)
  • •Kuber.studioは、1つのプロンプトでMinecraftを再現する行為を能力ベンチマークではなくデモ・ベンチマークだとした
  • •GPT Astra公開への反応では、MinecraftやSVGデモを含む5つの拡散タスクが1時間以内に繰り返された
  • •筆者はLiveBench、ARC-AGI、Humanity’s Last Examを、隠匿または入れ替え型のより強い評価として挙げた
  • •Kuber.studioは、1つのプロンプトでMinecraftを再現する行為を能力ベンチマークではなくデモ・ベンチマークだとした
  • •GPT Astra公開への反応では、MinecraftやSVGデモを含む5つの拡散タスクが1時間以内に繰り返された
  • •筆者はLiveBench、ARC-AGI、Humanity’s Last Examを、隠匿または入れ替え型のより強い評価として挙げた
  • •Kuber.studioは、1つのプロンプトでMinecraftを再現する行為を能力ベンチマークではなくデモ・ベンチマークだとした
  • •GPT Astra公開への反応では、MinecraftやSVGデモを含む5つの拡散タスクが1時間以内に繰り返された
  • •筆者はLiveBench、ARC-AGI、Humanity’s Last Examを、隠匿または入れ替え型のより強い評価として挙げた
  • •Kuber.studioは、1つのプロンプトでMinecraftを再現する行為を能力ベンチマークではなくデモ・ベンチマークだとした
  • •GPT Astra公開への反応では、MinecraftやSVGデモを含む5つの拡散タスクが1時間以内に繰り返された
  • •筆者はLiveBench、ARC-AGI、Humanity’s Last Examを、隠匿または入れ替え型のより強い評価として挙げた

Kuber.studioは2026年9月6日、「Recreating Minecraft Is Not a Benchmark」を公開し、1つのプロンプトでMinecraftを再現するような拡散型AI公開デモは、もはやモデル能力を信頼できる形では測れないと主張した。投稿によると、GPT Astraは「a couple of days ago」に公開され、1時間以内に筆者のフィードは同じ5例で埋まった。Minecraft再現、MS Paintの自画像、SVGで描いた自転車に乗るペリカン、もっともらしい重力で回転する箱の中を跳ねるボール、SVGゲームコントローラーである。

筆者はこれらを「デモ・ベンチマーク」と呼ぶ。幅広い読者が理解しやすい視覚タスクだが、範囲が有限で、次のモデルが「perfect」になりやすい課題という位置づけだ。投稿は、固定され有名になった目標と8週間の準備期間があれば、AI研究所はそれらのデモに直接最適化できるため、結果は一般能力よりも公開準備を測るものになると論じた。

投稿によれば、同じ問題は公開評価にもある。Thinking MachinesのInkling Smallは、パラメータ数がフラッグシップ版の3分の1未満でありながら、Artificial Analysis Intelligence Indexで同系の最上位モデルと1ポイント以内の差を記録し、Humanity’s Last Exam、GPQA Diamond、SciCodeでは上回った。筆者は、公開され、静的で、有名なテストセットは訓練データやファインチューニングの選択に漏れ込む可能性があるとしている。

投稿は、より強い代替策として入れ替え型または非公開の評価を挙げた。LiveBenchは問題を入れ替え、ARC-AGIは非公開セットを保ち、Humanity’s Last Examは一部を留保している。筆者は、ソーシャルメディアが自転車にペダルやアニメーションがようやく付いたことを素早く見抜けるため、強いデモにも意味はあるとしつつ、デモ・ベンチマークをモデル品質の採点に使うべきではないと結論づけた。

Kuber.studioは2026年9月6日、「Recreating Minecraft Is Not a Benchmark」を公開し、1つのプロンプトでMinecraftを再現するような拡散型AI公開デモは、もはやモデル能力を信頼できる形では測れないと主張した。投稿によると、GPT Astraは「a couple of days ago」に公開され、1時間以内に筆者のフィードは同じ5例で埋まった。Minecraft再現、MS Paintの自画像、SVGで描いた自転車に乗るペリカン、もっともらしい重力で回転する箱の中を跳ねるボール、SVGゲームコントローラーである。

筆者はこれらを「デモ・ベンチマーク」と呼ぶ。幅広い読者が理解しやすい視覚タスクだが、範囲が有限で、次のモデルが「perfect」になりやすい課題という位置づけだ。投稿は、固定され有名になった目標と8週間の準備期間があれば、AI研究所はそれらのデモに直接最適化できるため、結果は一般能力よりも公開準備を測るものになると論じた。

投稿によれば、同じ問題は公開評価にもある。Thinking MachinesのInkling Smallは、パラメータ数がフラッグシップ版の3分の1未満でありながら、Artificial Analysis Intelligence Indexで同系の最上位モデルと1ポイント以内の差を記録し、Humanity’s Last Exam、GPQA Diamond、SciCodeでは上回った。筆者は、公開され、静的で、有名なテストセットは訓練データやファインチューニングの選択に漏れ込む可能性があるとしている。

投稿は、より強い代替策として入れ替え型または非公開の評価を挙げた。LiveBenchは問題を入れ替え、ARC-AGIは非公開セットを保ち、Humanity’s Last Examは一部を留保している。筆者は、ソーシャルメディアが自転車にペダルやアニメーションがようやく付いたことを素早く見抜けるため、強いデモにも意味はあるとしつつ、デモ・ベンチマークをモデル品質の採点に使うべきではないと結論づけた。

原文(英語)を読む·2026年9月6日
#gpt astra#minecraft#demo benchmarks#livebench#arc agi#humanitys last exam#gpqa diamond#scicode#artificial analysis