NVIDIA研究者、検索と長文推論を単一モデルで統合
- •NVIDIA研究者が、検索と長文推論の根拠選択を担うモデル「UNREAL」を提案
- •Wikipediaの2,100万チャンクで、HotpotQAの再現率が49.1%から73.2%に上昇
- •長文タスクの精度を改善し、約3万2,000トークン以上の処理で計算量と初動時間を削減
NVIDIAの研究者は、文書群からの検索と長文推論の両方で根拠を選ぶモデル内蔵型フレームワーク「UNREAL」を発表しました。凍結した大規模言語モデル(LLM)を1つ使い、モデル内部の表現から検索クエリを導きます。基盤モデルを変更せず、学習可能なパラメーターを50万未満追加します。
2,100万チャンクを収録したWikipediaの索引では、UNREALを組み込んだ密ベクトル型およびハイブリッド型の4つのモデルすべてが、当時最高水準の検索・再順位付けシステムを上回りました。最良のモデルでは、HotpotQAの再現率が49.1%から73.2%に、2WikiMultiHopQAでは31.7%から60.1%に、MuSiQueでは8.8%から14.4%に上昇しました。
長文タスクでは、同じ根拠選択の仕組みで回答生成前に無関係な情報を取り除きます。最大コンテキスト長が12万8,000トークンの条件で、NoLiMaの正解率は1.0%から24.83%に上がりました。256KのLVEvalでは、F1スコアが49.97%から54.66%に上昇しました。全文脈を処理する場合と比べ、UNREALは約3万2,000トークン以上の入力で浮動小数点演算(FLOPs)と最初のトークンが出るまでの時間を減らし、入力が長いほど削減幅も大きくなります。論文は、こうした結果から、モデル内部で根拠を選ぶ手法が、疎な根拠を扱う検索と長文推論に共通して使えると述べています。
論文は10月6日に公開され、NVIDIA関係者を含む著者らが10月7日にHugging Face Papersへ投稿しました。著者一覧には、筆頭著者のエダン・キンダーマン(Edan Kinderman)、エラド・ホファー(Elad Hoffer)、ヨハイ・ブラウ(Yochai Blau)、ブライアン・チミエル(Brian Chmiel)、ロン・バナー(Ron Banner)、ダニエル・スードリー(Daniel Soudry)、ボリス・ギンズバーグ(Boris Ginsburg)が記載されています。