오픈소스OPEN SOURCE

Hugging Face, 4.9조 토큰 규모 오픈 코드 데이터셋 Stack v3 공개

Hugging Face Code가 2025년 8월 GitHub 직접 크롤을 기반으로 1억7300만 개 저장소와 약 4.9조 토큰을 담은 Stack v3 학습 데이터셋을 공개했습니다.

2026. 07. 23.1 개 출처 검토
10초 요약
  • 학습 세트는 약 15.9TB, 713개 프로그래밍 언어, 1억7300만 개 저장소 행으로 구성됩니다.
  • 저장소 문맥, 라이선스 탐지, 개인정보 제거와 코드 작성자 옵트아웃 반영 절차를 제공합니다.
  • ODC-BY 라이선스로 배포되며 개별 소스 파일의 원래 라이선스 확인은 여전히 필요합니다.
WHAT HAPPENED

무슨 일이 있었나?

Hugging Face Code가 2025년 8월 GitHub 직접 크롤을 기반으로 1억7300만 개 저장소와 약 4.9조 토큰을 담은 Stack v3 학습 데이터셋을 공개했습니다.

규모만큼 중요한 것은 데이터 계보와 사용 권리입니다. 모델 개발자는 데이터셋 라이선스와 각 저장소 라이선스를 구분하고, 평가 데이터 오염과 생성 코드의 라이선스 위험을 별도로 관리해야 합니다.

WHY IT MATTERS

왜 중요한가?

코딩 모델의 성능과 재현성은 학습 데이터의 최신성, 라이선스와 중복 처리에 크게 좌우되므로 공개 데이터 계층의 확장은 오픈 모델 생태계의 기반을 넓힙니다.

WHO SHOULD CARE

누구에게 중요한가?

오픈모델 개발자코딩 AI 연구자데이터 거버넌스팀
AIZIGOO VIEW

AIZIGOO 한줄평

데이터 규모는 Hugging Face 데이터셋 카드 기준이며 저장소·토큰 집계 방식에 따라 해석이 달라질 수 있습니다.