マルチエージェントLLMの二層反省
- •Bilevel Coordinated Reflectionは、二層ゲームと確率的メモリ反省でオーケストレーター・ワーカー型LLMシステムを統御する
- •SRMAは、根拠付き評価リスクが厳密に低下した場合だけ候補メモリを受け入れ、厳密な収束保証を示す
- •Kimiベースの完全システムは500件のSWE-benchインスタンスで72.2%を解決し、mini-SWE-agent参照の70.8%を上回った
Yihang Chen、Yuxiang Chen、Yuxuan Huang、Meng Fang、Weilin Luo、Jun Wangは、AI研究論文「Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems」をHugging Faceに掲載した。arxiv:2609.02750として登録された同論文はSep 2に公開され、Yihang ChenがSep 7に投稿し、84 upvotesで#1 Paper of the dayと表示された。
著者らは、オーケストレーター・ワーカー型LLMシステムをbilevel coordination game(二層の戦略的意思決定モデル)として定式化した。オーケストレーターがタスクを分解し、ワーカーが局所更新を行う構造である。結合が有界である条件下では、ワーカーの局所更新ゲームはapproximate potential game(利害がそろうゲーム)となり、その均衡のずれは分解品質によって制御される。
論文は、反省を意味メモリ状態の上を動く確率的過程として分析した。自由形式の反省について、著者らは有限時間の上限を導出し、最悪ケースでのタイト性を証明し、反証可能な持続的有害条件の下で正の下限を与えた。生成されたトランスクリプトだけを観測するゲートは、テキスト上区別できない環境全体でメモリを一様に改善できないという情報理論上の不可能性も示した一方、環境に根拠を置くゲートなら可能だとした。
著者らはStochastic Reflective Memory Ascent、略称SRMAを導入した。SRMAは、根拠付き評価リスクが厳密に低下した場合だけ候補メモリを受け入れる。キャリブレーションと非退化な修正質量の条件下で、SRMAは厳密に収束し、その速度は幾何的または多項式的である。対応する構成により、両方の速度領域がオーダーの意味でタイトであることも示された。論文は、確率的評価のための信頼度ゲーティングと、区分的定常環境に対する再アンカリング保証も提示した。
実験では、環境に根拠を置く指標を使い、予測された協調則とドリフト則を検証した。500件のSWE-benchインスタンスで、Kimiベースの完全システムは72.2%を解決し、公開mini-SWE-agent参照の70.8%と比較された。ページはコードとしてhttps://github.com/YihangChen9/Bilevel-Coordinated-Reflection にリンクしている。