Google, 병렬 토큰 생성 실험 모델 DiffusionGemma 공개

Google이 26B MoE 텍스트 확산 모델 DiffusionGemma를 Apache 2.0으로 공개했다. 한 단계에서 여러 토큰을 다듬어 낮은 배치에서 빠른 응답을 목표로 한다.

무엇이 다른가

Google은 2026년 6월 10일 DiffusionGemma를 공개했습니다. 일반적인 언어 모델이 앞에서부터 토큰을 하나씩 생성하는 것과 달리, 초안 토큰 묶음을 여러 단계에 걸쳐 동시에 고치는 텍스트 확산 방식을 사용합니다. 모델은 총 26B 파라미터의 MoE 구조지만 토큰당 3.8B만 활성화하며, 양자화 버전은 약 18GB VRAM에 맞도록 설계됐습니다.

무료로 사용할 수 있나

Google은 Apache 2.0 라이선스로 가중치를 Hugging Face에 공개했습니다. 다운로드 자체에는 모델 사용료가 없지만 저장소 접근 조건, 약 26B 규모의 메모리, GPU 전력과 호스팅 비용은 사용자가 부담합니다.

발표된 장점

  • 한 단계에서 여러 토큰을 병렬로 정제해 낮거나 중간 배치의 단일 가속기에서 지연을 줄이는 것이 목표입니다.
  • Google은 GPU에서 최대 4배 빠른 생성을 보고했습니다.
  • 중간 생성 과정을 수정하거나 제어하는 실험과 다양한 후보를 병렬로 탐색하는 연구에 활용할 수 있습니다.

중요한 제한

Google은 DiffusionGemma의 전반적 출력 품질이 표준 Gemma 4보다 낮다고 명시합니다. 높은 품질이 최우선인 운영 서비스에는 Gemma 4를 권장하며, 높은 QPS와 큰 배치에서는 속도 이점이 줄거나 비용이 늘 수 있습니다. 따라서 동일한 하드웨어에서 첫 토큰 지연, 전체 응답 시간, 품질과 와트당 처리량을 함께 비교해야 합니다.

공식 출처