GGUF를 Transformers 코드로 바로 연다: llama.cpp 양자화 모델의 경계가 낮아졌다

Hugging Face가 Transformers의 from_pretrained로 GGUF 모델을 불러오고 ggml 커널로 실행하는 초기 지원을 추가했다.

로컬 모델 형식과 Python 생태계가 만난다

Hugging Face는 9월 22일 Transformers에서 llama.cpp 계열 GGUF 체크포인트를 직접 실행하는 지원을 발표했습니다. 모델 저장소와 `gguf_file`을 `from_pretrained`에 넘기면 표준 Transformers 생성·서빙 인터페이스를 사용할 수 있습니다. GGUF는 가중치, 토크나이저와 선택적 채팅 템플릿을 한 파일에 담고 여러 양자화 단계로 메모리와 정밀도를 절충합니다.

초기 구현은 Apple Silicon과 Qwen3.5 구조에 초점을 맞추며, llama.cpp의 ggml Metal 커널을 `kernels` 라이브러리로 재사용합니다. 공개 예시의 Qwen3.5 4B는 BF16 8.42GB에서 Q4_K_M 2.74GB로 줄어듭니다. 다만 이는 파일 크기이며 실행 중 KV 캐시와 런타임 메모리는 별도입니다.

아직 모든 GGUF를 같은 속도로 돌리는 기능은 아니다

현재는 최신 Transformers의 main 브랜치와 호환되는 PyTorch·커널이 필요합니다. 호환 커널을 가져오지 못하면 SDPA로 돌아가고 가중치를 역양자화해 메모리가 더 들 수 있습니다. 모델 구조, 양자화 방식과 하드웨어에 따라 품질·속도가 달라집니다.

실제 도입에서는 Q4_K_M부터 시작하되 대표 업무의 정답률, 첫 토큰 지연, 생성 속도, 최대 메모리와 라이선스를 함께 확인해야 합니다.

공식 출처