何が起きたのか?
Hugging Face Codeは、2025年8月のGitHub直接クロールに基づき、1億7300万リポジトリと約4.9兆トークンを含むStack v3学習データを公開しました。
規模は来歴と権利管理の代わりになりません。開発者はデータセットと各リポジトリのライセンスを区別し、評価データ汚染や生成コードのライセンスリスクも管理する必要があります。
なぜ重要なのか?
学習データの新しさ、ライセンス、重複処理はコーディングモデルを左右するため、大規模な公開データは再現可能なオープンモデルの基盤を広げます。
誰にとって重要か?
オープンモデル開発者コーディングAI研究者データガバナンス担当
AIZIGOOの見解
規模はHugging Faceのデータセットカードに基づき、リポジトリやトークンの集計方法で解釈が変わる場合があります。