NeoHorse-1、エージェント訓練を検証
- •NeoHorse-1はエージェント型ポストトレーニング、知的ルーティング、構造化フィードバックループ、カリキュラム型蒸留をエージェントベンチマークに使う
- •ポストトレーニング後のマクロ平均は4Bで58.94から64.87、9Bで65.60から69.04に上昇した
- •Hugging FaceはNeoHorse-1をSep 8公開、Sep 9投稿、当日の#1 Paperとして掲載した
NeoHorse Teamと15人超の共同著者はSep 8、再帰的自己改善に向けたエージェントネイティブモデル群としてNeoHorse-1を公開した。2026-09-10付のHugging Face論文ページによると、同システムはエージェント型ポストトレーニング、知的ルーティング、構造化フィードバックループ、カリキュラム型蒸留を使い、エージェントベンチマーク全体の性能を高める。論文はJarvisPeiがSep 9に投稿し、ページ上で当日の#1 Paper、250 upvotesと表示された。
NeoHorse-1は異種モデルプールと知的ルーティングを組み合わせ、ユーザーの各ターンについて予測された能力需要、選択されたサービスタイア、その後のやり取りを記録する。これらの記録は、交互に現れる推論、ツール呼び出し、ハーネス文脈を保った訓練例になる。システムは構造検証、6次元の意味評価、サブシーン単位のラベリングを通じて例を採用する。
ルーティング信号は教師ありファインチューニングを3段階のカリキュラムに整理し、ルーティング誘導型オンポリシー蒸留にも広がる。そこでは教師モデルが同じ進行に沿って、学生モデルが生成した応答を監督する。能力に基づく割り当ては評価フィードバックを次の訓練ミックスに変換し、モデルの振る舞いが後続の訓練データ選択に影響する評価・選択・更新のループを作る。
ハーネスベースのエージェント、ツール使用、コーディング、指示追従を含む11のベンチマークで、NeoHorse-1のポストトレーニングはマクロ平均を4Bで58.94から64.87へ、9Bで65.60から69.04へ引き上げた。著者らは、ポストトレーニング済み4Bモデルと9Bベースモデルの集計上の差が大きく縮まったと述べ、NeoHorse-1を、反復を重ねるハーネス媒介型の再帰的自己改善に向けた初期プロトタイプと位置づけた。