何が違うか
Googleは2026年6月10日、DiffusionGemma を公開しました。通常の言語モデルが左から1トークンずつ作るのに対し、下書きトークンの塊を複数ステップで同時に修正するテキスト拡散方式です。総26BのMoEですがトークンごとに3.8Bを有効化し、量子化版は約18GB VRAMに収まる設計です。
無料で使えるか
重みはApache 2.0でHugging Faceに公開され、トークン単位のモデル料金はありません。ただしリポジトリのアクセス条件、メモリ、GPU電力、ホスティング費用は利用者負担です。
公表された利点
- 複数トークンの並列修正により、単一アクセラレーターの低・中バッチで低遅延を狙います。
- GoogleはGPUで最大4倍速い生成を報告しています。
- 中間生成の編集や複数候補の並列探索研究に利用できます。
重要な制限
Googleは総合的な出力品質が標準Gemma 4より低いと明記し、最高品質が必要な本番にはGemma 4を推奨しています。高QPS・大バッチでは速度利点が減るか費用が増える可能性があります。同じ機器で初回トークン、完了時間、品質、電力当たり処理量を比較してください。