ByteDance、10兆パラメータモデルを訓練
- •ByteDanceが最大10兆パラメータのAIモデルを訓練中と報じられた
- •10兆パラメータならMoonshot AIの2.8兆パラメータKimi K3を上回る規模となる
- •モデルは事前学習段階にあり、通常は3カ月から6カ月かかる
ByteDanceは、最大10兆パラメータの人工知能モデルを訓練していると報じられた。TikTokを所有する中国のテクノロジー企業で、Free Press JournalがAugust 07にFTと事情に詳しい関係者を引用して伝えた。モデルの規模はAnthropicのMythosシステムに近づく可能性があるが、報道によると詳細は独自に確認できず、ByteDanceはコメント要請に直ちに応じなかった。
パラメータ数とは、モデルが訓練データから学習し、パターン認識、応答生成、タスク実行に使う数値設定を指す。モデル規模の大まかな指標として使われることが多いが、能力を直接示すものではない。10兆パラメータなら、ByteDanceのモデルはMoonshot AIのKimi K3の3倍超となる。Kimi K3は2.8兆パラメータで、中国のAI研究所がこれまで公開したモデルの中でも最大級に入る。
FTは業界推計として、AnthropicのMythos 5を約8兆パラメータ、より広く利用可能なガードレール付きの姉妹モデルFable 5を約5兆パラメータとした。AnthropicはMythos、Fable、その他モデルのパラメータ数を公式に開示していないため、これらの数字は業界推計にとどまる。OpenAIのGPT-5.5など米国モデルに帰属されるパラメータ数にも、同じ留保が付くとされた。
ByteDanceのモデルは事前学習(大規模データセットからの初期学習)の段階にある。報道によると、この段階は通常3カ月から6カ月かかる。その後、公開の可能性がある場合はファインチューニングへ進む見通しで、最終的なパラメータ数は固定されておらず、訓練終了前に変わる可能性がある。
この動きに先立ち、ByteDance創業者の張一鳴が従業員に対し、短期的な利益だけを目的にAI蒸留技術へ依存することを避けるよう伝えたと報じられていた。その発言は、Moonshot AIがKimi K3を構築する際にAnthropicのFableモデルを蒸留したと米政府高官が主張した後に出た。
Mythosは、AnthropicのOpus層より上位に位置するフロンティアモデル群だ。エージェント型コーディング、推論、サイバーセキュリティ能力で注目を集めているとされる。ハッキングや脆弱性悪用への懸念から、MythosへのアクセスはAnthropicのProject Glasswingの下で信頼済みパートナーにほぼ限定されてきた。一方、Fable 5は安全性を強化し、より広く提供される版である。