로컬 모델 형식과 Python 생태계가 만난다
Hugging Face는 9월 22일 Transformers에서 llama.cpp 계열 GGUF 체크포인트를 직접 실행하는 지원을 발표했습니다. 모델 저장소와 `gguf_file`을 `from_pretrained`에 넘기면 표준 Transformers 생성·서빙 인터페이스를 사용할 수 있습니다. GGUF는 가중치, 토크나이저와 선택적 채팅 템플릿을 한 파일에 담고 여러 양자화 단계로 메모리와 정밀도를 절충합니다.
초기 구현은 Apple Silicon과 Qwen3.5 구조에 초점을 맞추며, llama.cpp의 ggml Metal 커널을 `kernels` 라이브러리로 재사용합니다. 공개 예시의 Qwen3.5 4B는 BF16 8.42GB에서 Q4_K_M 2.74GB로 줄어듭니다. 다만 이는 파일 크기이며 실행 중 KV 캐시와 런타임 메모리는 별도입니다.
아직 모든 GGUF를 같은 속도로 돌리는 기능은 아니다
현재는 최신 Transformers의 main 브랜치와 호환되는 PyTorch·커널이 필요합니다. 호환 커널을 가져오지 못하면 SDPA로 돌아가고 가중치를 역양자화해 메모리가 더 들 수 있습니다. 모델 구조, 양자화 방식과 하드웨어에 따라 품질·속도가 달라집니다.
실제 도입에서는 Q4_K_M부터 시작하되 대표 업무의 정답률, 첫 토큰 지연, 생성 속도, 최대 메모리와 라이선스를 함께 확인해야 합니다.