ローカル形式とPython APIを統合
Hugging Faceは9月22日、TransformersでGGUFを直接扱う機能を発表しました。モデルIDと`gguf_file`を`from_pretrained`へ渡し、標準の生成・配信APIを使えます。GGUFは重み、トークナイザー、任意のチャットテンプレートを一ファイルに収め、量子化で精度と容量を調整します。
初期対象はApple SiliconとQwen3.5で、llama.cppのggml Metalカーネルを再利用します。Qwen3.5 4Bの例ではBF16 8.42GBがQ4_K_M 2.74GBになりますが、KVキャッシュなど実行時メモリは別です。
すべてのGGUFが同じ速度になるわけではない
最新版Transformers、対応PyTorchとカーネルが必要です。非対応時はSDPAへ戻り、逆量子化でメモリが増える場合があります。自分の業務で精度、初回トークン、速度、最大メモリ、ライセンスを確認すべきです。