AI使い比べAIを探すAIニュースAI活用法
会社紹介
個人情報保護方針利用規約FAQお問い合せお問い合わせ
エーアイビー株式会社事業者情報
© 2026 AIB Inc.

TransformersがGGUF対応を追加

TransformersがGGUF対応を追加

HuggingFace Blog·2026年9月23日 (水)
  • •Hugging FaceはApple Silicon上のローカル推論向けに、transformersへGGUF対応を追加した
  • •Qwen3.5-4BのGGUFサイズは8.42 GB BF16から2.74 GB Q4_K_Mまでとなる
  • •MacBook Pro M2 Max上の3つのGGUFチェックポイントで、transformers generateとllama-benchを比較した
  • •Hugging FaceはApple Silicon上のローカル推論向けに、transformersへGGUF対応を追加した
  • •Qwen3.5-4BのGGUFサイズは8.42 GB BF16から2.74 GB Q4_K_Mまでとなる
  • •MacBook Pro M2 Max上の3つのGGUFチェックポイントで、transformers generateとllama-benchを比較した
  • •Hugging FaceはApple Silicon上のローカル推論向けに、transformersへGGUF対応を追加した
  • •Qwen3.5-4BのGGUFサイズは8.42 GB BF16から2.74 GB Q4_K_Mまでとなる
  • •MacBook Pro M2 Max上の3つのGGUFチェックポイントで、transformers generateとllama-benchを比較した
  • •Hugging FaceはApple Silicon上のローカル推論向けに、transformersへGGUF対応を追加した
  • •Qwen3.5-4BのGGUFサイズは8.42 GB BF16から2.74 GB Q4_K_Mまでとなる
  • •MacBook Pro M2 Max上の3つのGGUFチェックポイントで、transformers generateとllama-benchを比較した

Hugging Faceは2026年9月22日、transformersでGGUFモデルを効率的に実行する対応を追加した。ユーザーはHub上のノートPC向け量子化チェックポイントをfrom_pretrainedで読み込み、使い慣れたtransformers APIからローカルでgenerateを実行できる。初期実装はApple Silicon上のローカル推論を対象とし、Qwen3.5アーキテクチャから始まり、kernelsライブラリ経由でllama.cppのggmlカーネルを再利用し、generateのオーバーヘッドを減らす。

GGUFはllama.cppチームが開発したファイル形式で、モデル重みとメタデータ、トークナイザー情報、任意のチャットテンプレートを1つのファイルにまとめる。複数の量子化レベルに対応し、精度の一部と引き換えにメモリ使用量を下げる。UnslothのQwen3.5-4Bでは、BF16が8.42 GB、Q6_Kが3.53 GB、Q5_K_Mが3.14 GB、Q4_K_Mが2.74 GB。Hugging FaceはQ4_K_Mから始め、より多くのメモリを使える場合はQ5_K_MまたはQ6_Kを試すよう勧める一方、品質面のトレードオフはモデルとタスクに依存すると注意している。

GGUFモデルを読み込むには、Apple Silicon Mac、公開済みggml量子化カーネルビルドが対応するPyTorch版、通常は最新2つのPyTorchリリース、次回リリースまでmainから取得する最新transformers版、互換性のあるkernels版が必要となる。ユーザーはHubのmodel_idとgguf_fileのファイル名をfrom_pretrainedに渡す。互換性のある量子化カーネルがない場合、ローダーはモデルを逆量子化するフォールバックに入り、より多くのメモリを使う。重みがMetal上でパックされたまま保持される場合、transformersは互換性のあるggml/Metalレイヤーカーネルを自動で読み込み、注意機構の実装としてggml-org/ggml-attnを使う。カーネルを取得できない場合は「sdpa」にフォールバックする。

同じチェックポイントはtransformers serveでも実行でき、OpenAI互換APIとして公開される。model引数は<model_id>:<filename>.ggufの形式を使い、例としてunsloth/Qwen3.5-4B-GGUF:Qwen3.5-4B-Q4_K_M.ggufが挙げられる。JanやPiなどのクライアントは、Base URL http://localhost:8000/v1 とそのModel IDで接続できる。thinking対応のチャットテンプレートでは、--reasoning offが無効化、--reasoning onが有効化、--reasoning autoがチャットテンプレートの既定値に従う設定となる。

Hugging Faceは、小型のdenseモデル、大型のdenseモデル、Mixture-of-Expertsモデルという3つのGGUFチェックポイントで、transformersとllama.cppをベンチマークした。llama.cpp列では、llama-bench build 5f55650a7、release b10200、ggml 0.18.0のMetalバックエンド、llama-bench -m <file> -p 0 -n 128 -r 3を使用し、プロンプト処理を除外して、3回の反復平均による128デコードトークンのtg128を報告した。transformers列では、12トークンのプロンプトから同じ128トークンをgenerateで生成し、ウォーム済み3回の最良値を採用した。環境はMacBook Pro M2 Max、32 GBユニファイドメモリ、macOS 26.6、PyTorch 2.12.1、kernels 0.17.0、電源接続時で、prefillを含む。

Hugging Faceは、transformersが3つのチェックポイントすべてでllama.cppに近いと述べた。ただし、transformersはprefillを含み、llama-benchはdecode-onlyスループットを報告するため、チャートは同一条件のベンチマークを意味しないともしている。効率的なローカル推論を最優先する場合、同社は専用ランタイム、メモリ管理、幅広いハードウェア対応を理由に、引き続きllama.cppを推奨する。transformers統合は、hooksで中間活性化を調べる、モデルのforward passを変更する、GGUFモデルを評価する、GGUF変換を検証する、独自のデコード案を試す、GgufConfig(dequantize=True)で重みを逆量子化した後にファインチューニングする、といったPythonとPyTorchのワークフロー向けに位置づけられている。

カーネル作業には、パック済み量子化重みを読むggml-quantization、Qwen3.5とQwen3.8で使われるzero-centered RMSNormを含む融合正規化向けggml-norm、Metal flash attention向けggml-attn、Qwen3.5とQwen3.8のハイブリッドアーキテクチャ向けggml-gated-delta-net、MoEルーティングでのexpert選択向けtopk Metal実装が含まれる。Hugging Faceはgenerateにも変更を加え、#48814で不要なattention maskを早期に削除し、#47975で停止チェックを遅延させた。同社によると、これらの改善はGGUFファイルだけでなく、すべてのtransformersモデルに適用される。現在の制限は、初期ターゲットがApple Silicon上の単一の対話型会話であること、パック済み推論パスが現時点ではMPSのみであることだ。

Hugging Faceは2026年9月22日、transformersでGGUFモデルを効率的に実行する対応を追加した。ユーザーはHub上のノートPC向け量子化チェックポイントをfrom_pretrainedで読み込み、使い慣れたtransformers APIからローカルでgenerateを実行できる。初期実装はApple Silicon上のローカル推論を対象とし、Qwen3.5アーキテクチャから始まり、kernelsライブラリ経由でllama.cppのggmlカーネルを再利用し、generateのオーバーヘッドを減らす。

GGUFはllama.cppチームが開発したファイル形式で、モデル重みとメタデータ、トークナイザー情報、任意のチャットテンプレートを1つのファイルにまとめる。複数の量子化レベルに対応し、精度の一部と引き換えにメモリ使用量を下げる。UnslothのQwen3.5-4Bでは、BF16が8.42 GB、Q6_Kが3.53 GB、Q5_K_Mが3.14 GB、Q4_K_Mが2.74 GB。Hugging FaceはQ4_K_Mから始め、より多くのメモリを使える場合はQ5_K_MまたはQ6_Kを試すよう勧める一方、品質面のトレードオフはモデルとタスクに依存すると注意している。

GGUFモデルを読み込むには、Apple Silicon Mac、公開済みggml量子化カーネルビルドが対応するPyTorch版、通常は最新2つのPyTorchリリース、次回リリースまでmainから取得する最新transformers版、互換性のあるkernels版が必要となる。ユーザーはHubのmodel_idとgguf_fileのファイル名をfrom_pretrainedに渡す。互換性のある量子化カーネルがない場合、ローダーはモデルを逆量子化するフォールバックに入り、より多くのメモリを使う。重みがMetal上でパックされたまま保持される場合、transformersは互換性のあるggml/Metalレイヤーカーネルを自動で読み込み、注意機構の実装としてggml-org/ggml-attnを使う。カーネルを取得できない場合は「sdpa」にフォールバックする。

同じチェックポイントはtransformers serveでも実行でき、OpenAI互換APIとして公開される。model引数は<model_id>:<filename>.ggufの形式を使い、例としてunsloth/Qwen3.5-4B-GGUF:Qwen3.5-4B-Q4_K_M.ggufが挙げられる。JanやPiなどのクライアントは、Base URL http://localhost:8000/v1 とそのModel IDで接続できる。thinking対応のチャットテンプレートでは、--reasoning offが無効化、--reasoning onが有効化、--reasoning autoがチャットテンプレートの既定値に従う設定となる。

Hugging Faceは、小型のdenseモデル、大型のdenseモデル、Mixture-of-Expertsモデルという3つのGGUFチェックポイントで、transformersとllama.cppをベンチマークした。llama.cpp列では、llama-bench build 5f55650a7、release b10200、ggml 0.18.0のMetalバックエンド、llama-bench -m <file> -p 0 -n 128 -r 3を使用し、プロンプト処理を除外して、3回の反復平均による128デコードトークンのtg128を報告した。transformers列では、12トークンのプロンプトから同じ128トークンをgenerateで生成し、ウォーム済み3回の最良値を採用した。環境はMacBook Pro M2 Max、32 GBユニファイドメモリ、macOS 26.6、PyTorch 2.12.1、kernels 0.17.0、電源接続時で、prefillを含む。

Hugging Faceは、transformersが3つのチェックポイントすべてでllama.cppに近いと述べた。ただし、transformersはprefillを含み、llama-benchはdecode-onlyスループットを報告するため、チャートは同一条件のベンチマークを意味しないともしている。効率的なローカル推論を最優先する場合、同社は専用ランタイム、メモリ管理、幅広いハードウェア対応を理由に、引き続きllama.cppを推奨する。transformers統合は、hooksで中間活性化を調べる、モデルのforward passを変更する、GGUFモデルを評価する、GGUF変換を検証する、独自のデコード案を試す、GgufConfig(dequantize=True)で重みを逆量子化した後にファインチューニングする、といったPythonとPyTorchのワークフロー向けに位置づけられている。

カーネル作業には、パック済み量子化重みを読むggml-quantization、Qwen3.5とQwen3.8で使われるzero-centered RMSNormを含む融合正規化向けggml-norm、Metal flash attention向けggml-attn、Qwen3.5とQwen3.8のハイブリッドアーキテクチャ向けggml-gated-delta-net、MoEルーティングでのexpert選択向けtopk Metal実装が含まれる。Hugging Faceはgenerateにも変更を加え、#48814で不要なattention maskを早期に削除し、#47975で停止チェックを遅延させた。同社によると、これらの改善はGGUFファイルだけでなく、すべてのtransformersモデルに適用される。現在の制限は、初期ターゲットがApple Silicon上の単一の対話型会話であること、パック済み推論パスが現時点ではMPSのみであることだ。

原文(英語)を読む·2026年9月22日
インフラ#transformers#gguf#llama cpp#hugging face#qwen3 5#quantization#apple silicon#ggml#local inference#pytorch