AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

LLMの事実性に想起の壁

LLMの事実性に想起の壁

Google Research Blog·2026年8月13日 (木)
  • •Google Researchは、最前線LLMの事実誤りが、符号化された事実の欠落ではなく想起失敗に由来しやすいとした
  • •WikiProfileベンチマークは、Wikipedia由来の2,150件の事実を13のLLMと約4.5 million件の応答で検証した
  • •Gemini-3-ProとGPT-5は事実の95-98%を符号化する一方、直接想起では26-34%を取りこぼした
  • •Google Researchは、最前線LLMの事実誤りが、符号化された事実の欠落ではなく想起失敗に由来しやすいとした
  • •WikiProfileベンチマークは、Wikipedia由来の2,150件の事実を13のLLMと約4.5 million件の応答で検証した
  • •Gemini-3-ProとGPT-5は事実の95-98%を符号化する一方、直接想起では26-34%を取りこぼした
  • •Google Researchは、最前線LLMの事実誤りが、符号化された事実の欠落ではなく想起失敗に由来しやすいとした
  • •WikiProfileベンチマークは、Wikipedia由来の2,150件の事実を13のLLMと約4.5 million件の応答で検証した
  • •Gemini-3-ProとGPT-5は事実の95-98%を符号化する一方、直接想起では26-34%を取りこぼした
  • •Google Researchは、最前線LLMの事実誤りが、符号化された事実の欠落ではなく想起失敗に由来しやすいとした
  • •WikiProfileベンチマークは、Wikipedia由来の2,150件の事実を13のLLMと約4.5 million件の応答で検証した
  • •Gemini-3-ProとGPT-5は事実の95-98%を符号化する一方、直接想起では26-34%を取りこぼした

Google Researchの研究者ニタイ・カルデロン(Nitay Calderon)とガル・ヨナ(Gal Yona)はAugust 12, 2026、最前線LLMが事実を誤る主因は、事実がパラメータ内に存在しないことではなく、符号化された事実を想起できないことにあるとする研究を発表した。研究は知識プロファイリングを導入し、符号化、想起、認識を分けてparametric factuality(モデル内部に保存された事実)を診断した。

研究チームはGemini-3、Gemini-2.5-Pro、Gemini-3-Pro and Flash、GPT-5を含む最前線LLMを、Wikipedia由来の2,150件の事実で構成されるWikiProfileでテストした。各事実には10のタスクが対応し、内訳は符号化タスク2件、知識評価タスク4件、多肢選択式の認識バリアント4件だった。著者らは13のLLMをthinkingあり・なしで評価し、モデル、事実、タスクごとに8件の応答をサンプリングし、プロンプトを与えたLLM自動評価器で約4.5 million件の応答を採点した。

知識プロファイリングは各事実を、符号化失敗、想起失敗、直接想起、thinking付き想起、符号化なしの推論という5つのプロファイルに分類する。符号化とは、モデルが事前学習に近い文脈で事実を再現できることを指す。想起とは、符号化済みの事実について意味的に等価な質問に答えられることを意味し、認識とは選択肢の中から正しい事実を識別できることを意味する。thinkingは回答前の中間計算を指し、chain-of-thought prompting(段階的推論を促すプロンプト)やthinkingに最適化されたLLMを含む。

主要な結果は、最前線モデルで符号化が飽和に近い一方、想起はなお不完全だという点だった。Gemini-3-ProとGPT-5は事実の95-98%を符号化したが、直接想起では26-34%の事実で失敗した。thinkingを有効にしても、モデルはなお11-12%の事実で失敗した。著者らは、事実誤りは「空の棚」ではなく「失われた鍵」と表現する方がますます適切だとしている。保存された知識に、安定してアクセスできていないという意味である。

研究は、Gemma 3ファミリーのスケーリングが符号化失敗を大きく減らす一方、想起失敗は依然として相当残り、残存エラーに占める割合が大きくなると報告した。著者らによれば、スケーリングはモデルが保存する内容を、アクセスできる内容より強く改善する。希少な事実も人気のある事実に近い率で符号化されていたが、人気度の下位20%と上位20%を比べると想起ギャップはより大きかった。

研究者らは、モデルが「A is B」を学習しても逆方向の質問に苦戦するreversal curseも再検討した。自由記述生成では逆方向の質問が一貫して難しかったが、多肢選択式の検証では直接質問より難しいわけではなく、しばしば容易だった。著者らは、逆方向の事実が符号化され認識可能であっても、クエリの方向が学習時の露出と異なる場合には想起が難しくなる証拠だと解釈している。

thinkingは、直接想起が最も弱い領域、特に希少な事実と逆方向の質問で、アクセスしにくい符号化済み知識の回復に最も強く寄与した。thinkingに最適化されたモデルでは、thinkingが符号化済みだが直接には知られていない事実のおよそ40-65%を回復した一方、符号化されていない事実では5-15%にとどまった。著者らは、thinkingはモデルが符号化していない事実から答えを導くというより、主に想起を助けているようだと述べた。ただし、thinkingには計算コストがあり、いつ呼び出すべきかは不明なままだとも指摘した。

Google Researchの研究者ニタイ・カルデロン(Nitay Calderon)とガル・ヨナ(Gal Yona)はAugust 12, 2026、最前線LLMが事実を誤る主因は、事実がパラメータ内に存在しないことではなく、符号化された事実を想起できないことにあるとする研究を発表した。研究は知識プロファイリングを導入し、符号化、想起、認識を分けてparametric factuality(モデル内部に保存された事実)を診断した。

研究チームはGemini-3、Gemini-2.5-Pro、Gemini-3-Pro and Flash、GPT-5を含む最前線LLMを、Wikipedia由来の2,150件の事実で構成されるWikiProfileでテストした。各事実には10のタスクが対応し、内訳は符号化タスク2件、知識評価タスク4件、多肢選択式の認識バリアント4件だった。著者らは13のLLMをthinkingあり・なしで評価し、モデル、事実、タスクごとに8件の応答をサンプリングし、プロンプトを与えたLLM自動評価器で約4.5 million件の応答を採点した。

知識プロファイリングは各事実を、符号化失敗、想起失敗、直接想起、thinking付き想起、符号化なしの推論という5つのプロファイルに分類する。符号化とは、モデルが事前学習に近い文脈で事実を再現できることを指す。想起とは、符号化済みの事実について意味的に等価な質問に答えられることを意味し、認識とは選択肢の中から正しい事実を識別できることを意味する。thinkingは回答前の中間計算を指し、chain-of-thought prompting(段階的推論を促すプロンプト)やthinkingに最適化されたLLMを含む。

主要な結果は、最前線モデルで符号化が飽和に近い一方、想起はなお不完全だという点だった。Gemini-3-ProとGPT-5は事実の95-98%を符号化したが、直接想起では26-34%の事実で失敗した。thinkingを有効にしても、モデルはなお11-12%の事実で失敗した。著者らは、事実誤りは「空の棚」ではなく「失われた鍵」と表現する方がますます適切だとしている。保存された知識に、安定してアクセスできていないという意味である。

研究は、Gemma 3ファミリーのスケーリングが符号化失敗を大きく減らす一方、想起失敗は依然として相当残り、残存エラーに占める割合が大きくなると報告した。著者らによれば、スケーリングはモデルが保存する内容を、アクセスできる内容より強く改善する。希少な事実も人気のある事実に近い率で符号化されていたが、人気度の下位20%と上位20%を比べると想起ギャップはより大きかった。

研究者らは、モデルが「A is B」を学習しても逆方向の質問に苦戦するreversal curseも再検討した。自由記述生成では逆方向の質問が一貫して難しかったが、多肢選択式の検証では直接質問より難しいわけではなく、しばしば容易だった。著者らは、逆方向の事実が符号化され認識可能であっても、クエリの方向が学習時の露出と異なる場合には想起が難しくなる証拠だと解釈している。

thinkingは、直接想起が最も弱い領域、特に希少な事実と逆方向の質問で、アクセスしにくい符号化済み知識の回復に最も強く寄与した。thinkingに最適化されたモデルでは、thinkingが符号化済みだが直接には知られていない事実のおよそ40-65%を回復した一方、符号化されていない事実では5-15%にとどまった。著者らは、thinkingはモデルが符号化していない事実から答えを導くというより、主に想起を助けているようだと述べた。ただし、thinkingには計算コストがあり、いつ呼び出すべきかは不明なままだとも指摘した。

原文(英語)を読む·2026年8月12日
#llm#google research#parametric factuality#knowledge profiling#wikiprofile#recall failure#chain of thought#reversal curse#gemini 3#gpt 5