FreeToken、MoEを端末で稼働
- •FreeTokenは大型オープンウェイトMoEモデルをデータセンターではなく個人用マシンで提供する
- •システムは8GBノートPC GPUからワークステーションGPUまで20超のMoEモデルを支える
- •著者らは35B、284B、753BのGLM-5.2モデルをローカルハードウェアで提供したと報告した
Shuo Yang、Xiaoze Fan、Melissa Pan、Haocheng Xi、Zhe Wang、Shanlin Sun、Kurt Keutzer、Song Han、Matei Zaharia、Chenfeng Xu、Ion StoicaはAug 17、エッジネイティブなMixture-of-Experts提供システムFreeTokenを公開した。University of California, Berkeleyのandy-yangによるHugging Face投稿はAug 19だった。FreeTokenは、大型オープンウェイトモデルをデータセンター基盤前提ではなく、個人用マシン上で動かすために設計されている。
FreeTokenは個人用マシンを小型GPUではなく、統合された伸縮的な推論プラットフォームとして扱う。要旨によると、モデル配置と読み込み、エキスパート常駐、CPU--GPU実行、エージェント状態の再利用、実行時メモリ管理にまたがって提供スタックを共同設計する。
FreeTokenが狙うローカルAIの現実は2つある。エージェントのワークロードは実行パターンを継続的に変え、エッジハードウェアはマシンごとに異なるバランスの異種リソースを持つ。FreeTokenは固定のオフロード戦略に縛られず、利用可能なリソースへ計算とモデル状態を継続的に割り当てる。
システムは20超のMoEモデルに対応し、8GBノートPC GPUから単一ワークステーションGPUまでのハードウェア上で、実際のコーディングエージェントやツール利用エージェントを動かす。著者らはFreeTokenにより、個人用マシンが実用的に提供できる範囲が変わると述べ、ノートPC上の35Bモデル、ゲーミングデスクトップ上の284Bモデル、単一ワークステーションGPU上の753B GLM-5.2を例に挙げた。
著者らはFreeTokenがオープンウェイトを展開可能なローカルソフトウェアに変え、ユーザーがすでに所有するマシンをフロンティア規模の知能の実用プラットフォームにすると述べた。システムはflashml.aiで公開され、Hugging Faceの論文ページには58 upvotes、48 collection additions、1 collection including the paperが表示されていた。