AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

OpenArchがLLM実装を公開

OpenArchがLLM実装を公開

github.com·2026年9月15日 (火)
  • •OpenArchは、学習用に読みやすく書かれた現代的なオープンソースLLMアーキテクチャのPyTorch実装を公開した
  • •リポジトリには、GPT-2 XLからKimi K2までのモデルで利用可能なforward pass実装が並ぶ
  • •プロジェクトは72アーキテクチャを対象とし、モデル、README、テスト、リファクタリングの貢献者を募っている
  • •OpenArchは、学習用に読みやすく書かれた現代的なオープンソースLLMアーキテクチャのPyTorch実装を公開した
  • •リポジトリには、GPT-2 XLからKimi K2までのモデルで利用可能なforward pass実装が並ぶ
  • •プロジェクトは72アーキテクチャを対象とし、モデル、README、テスト、リファクタリングの貢献者を募っている
  • •OpenArchは、学習用に読みやすく書かれた現代的なオープンソースLLMアーキテクチャのPyTorch実装を公開した
  • •リポジトリには、GPT-2 XLからKimi K2までのモデルで利用可能なforward pass実装が並ぶ
  • •プロジェクトは72アーキテクチャを対象とし、モデル、README、テスト、リファクタリングの貢献者を募っている
  • •OpenArchは、学習用に読みやすく書かれた現代的なオープンソースLLMアーキテクチャのPyTorch実装を公開した
  • •リポジトリには、GPT-2 XLからKimi K2までのモデルで利用可能なforward pass実装が並ぶ
  • •プロジェクトは72アーキテクチャを対象とし、モデル、README、テスト、リファクタリングの貢献者を募っている

OpenArchは、anuj0456によるGitHubリポジトリで、現代的なオープンソースLLMアーキテクチャをPyTorchで手書き実装し、読みやすさと学習用途を重視している。リポジトリは2026-09-14付のHacker News議論で投稿され、そのスレッドはスコア110、コメント25件だった。プロジェクトはセバスチャン・ラシュカ(Sebastian Raschka)のLLM Architecture Galleryを基にし、原論文、技術レポート、参照用config.json、ラシュカの解説、Machine Learning Masteryの資料を参照している。

OpenArchは、transformersや他の本番用ライブラリと競うためのものではない。掲げる目的は明快さで、各アーキテクチャは読みやすい単一ファイルに収められ、アテンション種別、正規化、レイヤー構成、MoEルーティング、位置エンコーディングなどの選択が横並びで比較できるよう明示されている。READMEによると、本番用リポジトリは速度、シャーディング、後方互換性を重視することが多い一方、OpenArchは読むことに最適化している。

リポジトリは102 commitsを記録し、画像、マルチモーダル、テキストモデル向けのフォルダを含む。forward passで利用可能とされるテキスト実装には、GPT-2 XL 1.5B、Llama 2 7B、Llama 3 8B、OLMo 2 7B、DeepSeek R1 671B、Gemma 3 27B、Mistral 3 24B、Llama 4 Maverick 400B、Qwen 3 4Bと30B-A3B、Kimi K2 1T、GLM 4.5 355B、GPT-OSS 20Bがある。Grok-2.5 270Bは構築中とされている。

モデル表は、RMS NormやQK-Normなどの正規化手法、RoPEなどの位置エンコーディング、Multihead Attention、Grouped Query Attention、Multihead Latent Attention、スライディングウィンドウ型を含むアテンション設計を比較している。READMEは、MHA、GQA、MQA、MLA、NoPE、partial RoPE、YaRN、denseとsparseのMoE、ハイブリッドMamba/attention、multi-token-prediction、latent experts、gated attentionといったアーキテクチャ上の違いも挙げている。

マルチモーダル欄ではPaliGemma 3Bが利用可能、Qwen3 3Bが構築中とされている。画像欄では、Dall-eがTransformerアーキテクチャで構築中と記載されている。対象リスト全体はArchitecture Galleryの72アーキテクチャに対応しており、未実装モデルの追加、README.md作成、公式重みに対する少数トークンでのforward-passテスト追加、バグ修正、docstring改善、共有コンポーネントのリファクタリングで貢献者を募っている。プロジェクトはApache License 2.0を採用し、個別モデル実装は該当する場合に元モデルのライセンスに従うとしている。

OpenArchは、anuj0456によるGitHubリポジトリで、現代的なオープンソースLLMアーキテクチャをPyTorchで手書き実装し、読みやすさと学習用途を重視している。リポジトリは2026-09-14付のHacker News議論で投稿され、そのスレッドはスコア110、コメント25件だった。プロジェクトはセバスチャン・ラシュカ(Sebastian Raschka)のLLM Architecture Galleryを基にし、原論文、技術レポート、参照用config.json、ラシュカの解説、Machine Learning Masteryの資料を参照している。

OpenArchは、transformersや他の本番用ライブラリと競うためのものではない。掲げる目的は明快さで、各アーキテクチャは読みやすい単一ファイルに収められ、アテンション種別、正規化、レイヤー構成、MoEルーティング、位置エンコーディングなどの選択が横並びで比較できるよう明示されている。READMEによると、本番用リポジトリは速度、シャーディング、後方互換性を重視することが多い一方、OpenArchは読むことに最適化している。

リポジトリは102 commitsを記録し、画像、マルチモーダル、テキストモデル向けのフォルダを含む。forward passで利用可能とされるテキスト実装には、GPT-2 XL 1.5B、Llama 2 7B、Llama 3 8B、OLMo 2 7B、DeepSeek R1 671B、Gemma 3 27B、Mistral 3 24B、Llama 4 Maverick 400B、Qwen 3 4Bと30B-A3B、Kimi K2 1T、GLM 4.5 355B、GPT-OSS 20Bがある。Grok-2.5 270Bは構築中とされている。

モデル表は、RMS NormやQK-Normなどの正規化手法、RoPEなどの位置エンコーディング、Multihead Attention、Grouped Query Attention、Multihead Latent Attention、スライディングウィンドウ型を含むアテンション設計を比較している。READMEは、MHA、GQA、MQA、MLA、NoPE、partial RoPE、YaRN、denseとsparseのMoE、ハイブリッドMamba/attention、multi-token-prediction、latent experts、gated attentionといったアーキテクチャ上の違いも挙げている。

マルチモーダル欄ではPaliGemma 3Bが利用可能、Qwen3 3Bが構築中とされている。画像欄では、Dall-eがTransformerアーキテクチャで構築中と記載されている。対象リスト全体はArchitecture Galleryの72アーキテクチャに対応しており、未実装モデルの追加、README.md作成、公式重みに対する少数トークンでのforward-passテスト追加、バグ修正、docstring改善、共有コンポーネントのリファクタリングで貢献者を募っている。プロジェクトはApache License 2.0を採用し、個別モデル実装は該当する場合に元モデルのライセンスに従うとしている。

原文(英語)を読む·2026年9月14日
#openarch#pytorch#llm#llm architectures#mixture of experts#rope#qwen#deepseek#kimi k2#llama