무슨 일이 있었나?
Hugging Face Code가 2025년 8월 GitHub 직접 크롤을 기반으로 1억7300만 개 저장소와 약 4.9조 토큰을 담은 Stack v3 학습 데이터셋을 공개했습니다.
규모만큼 중요한 것은 데이터 계보와 사용 권리입니다. 모델 개발자는 데이터셋 라이선스와 각 저장소 라이선스를 구분하고, 평가 데이터 오염과 생성 코드의 라이선스 위험을 별도로 관리해야 합니다.
왜 중요한가?
코딩 모델의 성능과 재현성은 학습 데이터의 최신성, 라이선스와 중복 처리에 크게 좌우되므로 공개 데이터 계층의 확장은 오픈 모델 생태계의 기반을 넓힙니다.
누구에게 중요한가?
오픈모델 개발자코딩 AI 연구자데이터 거버넌스팀
AIZIGOO 한줄평
데이터 규모는 Hugging Face 데이터셋 카드 기준이며 저장소·토큰 집계 방식에 따라 해석이 달라질 수 있습니다.