AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

Reflection、5010億パラメーターのBeam発表

Reflection、5010億パラメーターのBeam発表

Ledge AI·2026年10月9日 (金)
  • •Reflection、同社初のオープンウェイトモデルBeamを10月5日に発表
  • •5010億パラメーターのうち230億を使用、学習に1万500基のGB300を4週間投入
  • •10月中にApache 2.0で重み公開予定、FP8・NVFP4量子化版も提供へ
  • •Reflection、同社初のオープンウェイトモデルBeamを10月5日に発表
  • •5010億パラメーターのうち230億を使用、学習に1万500基のGB300を4週間投入
  • •10月中にApache 2.0で重み公開予定、FP8・NVFP4量子化版も提供へ
  • •Reflection、同社初のオープンウェイトモデルBeamを10月5日に発表
  • •5010億パラメーターのうち230億を使用、学習に1万500基のGB300を4週間投入
  • •10月中にApache 2.0で重み公開予定、FP8・NVFP4量子化版も提供へ
  • •Reflection、同社初のオープンウェイトモデルBeamを10月5日に発表
  • •5010億パラメーターのうち230億を使用、学習に1万500基のGB300を4週間投入
  • •10月中にApache 2.0で重み公開予定、FP8・NVFP4量子化版も提供へ

米AIスタートアップのReflectionは2026年10月5日、コーディングや推論、AIエージェントの作業に対応する同社初のオープンウェイトモデル「Beam」を発表しました。総パラメーター数は5010億で、文章の処理ごとに使うアクティブパラメーターは230億です。一部利用者に先行提供しており、10月中に学習済みパラメーターである重みをApache 2.0ライセンスで公開する予定です。

Beamは入力に応じて複数の専門部分から一部を選ぶMixture-of-Experts(専門部分を選択する構造)を採用し、各トークンの処理に5010億すべてではなく230億のパラメーターを使用します。Reflectionはモデルをゼロから事前学習し、続く強化学習で推論やツール使用の能力を高めました。公表スコアは、長工程のソフトウェア開発を測るDeepSWE v1.1で44.4、端末上の作業を測るTerminal Bench v2.1で80.1でした。GLM 5.2は同じ順に44.0、81.0で、Qwen 3.8-Maxは51.0、86.6と両評価でBeamを上回りました。

Reflectionによると、Beamは高度な推論評価でGLM 5.2に匹敵するスコアを、約3分の1〜4分の1の推論計算量で達成しました。計算量は処理に使うパラメーター数と推論過程・最終回答の長さから推定し、入力処理、長い文脈を扱う計算、サービス運用の負荷は含みません。実利用料金や応答速度を直接比べた結果ではありません。利用者は課題に応じて推論計算量を調整でき、低い設定では短く、高い設定では難しい課題に長い推論を使います。

事前学習には23.8兆トークンを使い、Webや公開資料、ライセンス取得済みデータを選別して、コード、技術文書、数学・科学の知識を学習させました。強化学習では1万500基のNVIDIA GB300 GPUを4週間稼働させ、課題への試行を1億回以上生成しました。コーディング、ツール使用、科学・技術分野などを対象に約100万の学習環境を用意し、課題の難易度と品質を繰り返し調整したとしています。Reflectionは強化学習の計算量を増やす間、DeepSWEの評価性能が向上し続けたと説明しました。

Beamは悪用や想定外の動作を調べるレッドチーミングと公開前の最終評価を進めています。Reflectionは10月中に重み、技術レポート、性能や制約をまとめたモデルカード、実行・評価・追加学習に必要な開発資料を公開する予定です。重みにはApache 2.0ライセンスを適用し、メモリ使用量や計算負荷を抑えるFP8・NVFP4の量子化版も提供する予定で、先行利用の登録を受け付けています。

米AIスタートアップのReflectionは2026年10月5日、コーディングや推論、AIエージェントの作業に対応する同社初のオープンウェイトモデル「Beam」を発表しました。総パラメーター数は5010億で、文章の処理ごとに使うアクティブパラメーターは230億です。一部利用者に先行提供しており、10月中に学習済みパラメーターである重みをApache 2.0ライセンスで公開する予定です。

Beamは入力に応じて複数の専門部分から一部を選ぶMixture-of-Experts(専門部分を選択する構造)を採用し、各トークンの処理に5010億すべてではなく230億のパラメーターを使用します。Reflectionはモデルをゼロから事前学習し、続く強化学習で推論やツール使用の能力を高めました。公表スコアは、長工程のソフトウェア開発を測るDeepSWE v1.1で44.4、端末上の作業を測るTerminal Bench v2.1で80.1でした。GLM 5.2は同じ順に44.0、81.0で、Qwen 3.8-Maxは51.0、86.6と両評価でBeamを上回りました。

Reflectionによると、Beamは高度な推論評価でGLM 5.2に匹敵するスコアを、約3分の1〜4分の1の推論計算量で達成しました。計算量は処理に使うパラメーター数と推論過程・最終回答の長さから推定し、入力処理、長い文脈を扱う計算、サービス運用の負荷は含みません。実利用料金や応答速度を直接比べた結果ではありません。利用者は課題に応じて推論計算量を調整でき、低い設定では短く、高い設定では難しい課題に長い推論を使います。

事前学習には23.8兆トークンを使い、Webや公開資料、ライセンス取得済みデータを選別して、コード、技術文書、数学・科学の知識を学習させました。強化学習では1万500基のNVIDIA GB300 GPUを4週間稼働させ、課題への試行を1億回以上生成しました。コーディング、ツール使用、科学・技術分野などを対象に約100万の学習環境を用意し、課題の難易度と品質を繰り返し調整したとしています。Reflectionは強化学習の計算量を増やす間、DeepSWEの評価性能が向上し続けたと説明しました。

Beamは悪用や想定外の動作を調べるレッドチーミングと公開前の最終評価を進めています。Reflectionは10月中に重み、技術レポート、性能や制約をまとめたモデルカード、実行・評価・追加学習に必要な開発資料を公開する予定です。重みにはApache 2.0ライセンスを適用し、メモリ使用量や計算負荷を抑えるFP8・NVFP4の量子化版も提供する予定で、先行利用の登録を受け付けています。

原文(日本語)を読む·2026年10月7日
#reflection#beam#open weight model#mixture of experts#deepswe#terminal bench#reinforcement learning#apache 2.0#quantization