무엇이 다른가
Google은 2026년 6월 10일 DiffusionGemma를 공개했습니다. 일반적인 언어 모델이 앞에서부터 토큰을 하나씩 생성하는 것과 달리, 초안 토큰 묶음을 여러 단계에 걸쳐 동시에 고치는 텍스트 확산 방식을 사용합니다. 모델은 총 26B 파라미터의 MoE 구조지만 토큰당 3.8B만 활성화하며, 양자화 버전은 약 18GB VRAM에 맞도록 설계됐습니다.
무료로 사용할 수 있나
Google은 Apache 2.0 라이선스로 가중치를 Hugging Face에 공개했습니다. 다운로드 자체에는 모델 사용료가 없지만 저장소 접근 조건, 약 26B 규모의 메모리, GPU 전력과 호스팅 비용은 사용자가 부담합니다.
발표된 장점
- 한 단계에서 여러 토큰을 병렬로 정제해 낮거나 중간 배치의 단일 가속기에서 지연을 줄이는 것이 목표입니다.
- Google은 GPU에서 최대 4배 빠른 생성을 보고했습니다.
- 중간 생성 과정을 수정하거나 제어하는 실험과 다양한 후보를 병렬로 탐색하는 연구에 활용할 수 있습니다.
중요한 제한
Google은 DiffusionGemma의 전반적 출력 품질이 표준 Gemma 4보다 낮다고 명시합니다. 높은 품질이 최우선인 운영 서비스에는 Gemma 4를 권장하며, 높은 QPS와 큰 배치에서는 속도 이점이 줄거나 비용이 늘 수 있습니다. 따라서 동일한 하드웨어에서 첫 토큰 지연, 전체 응답 시간, 품질과 와트당 처리량을 함께 비교해야 합니다.