オープンソースOPEN SOURCE

Hugging Face、約4.9兆トークンのオープンコードデータセットStack v3を公開

Hugging Face Codeは、2025年8月のGitHub直接クロールに基づき、1億7300万リポジトリと約4.9兆トークンを含むStack v3学習データを公開しました。

2026/07/231 件の情報源を確認
クイック要約
  • 学習セットは15.9TB、713言語、1億7300万リポジトリで構成されます。
  • リポジトリ文脈、ライセンス検出、個人情報除去、開発者のオプトアウト反映を提供します。
  • ODC-BYで配布されますが、個々のソースファイルの元ライセンス確認は引き続き必要です。
WHAT HAPPENED

何が起きたのか?

Hugging Face Codeは、2025年8月のGitHub直接クロールに基づき、1億7300万リポジトリと約4.9兆トークンを含むStack v3学習データを公開しました。

規模は来歴と権利管理の代わりになりません。開発者はデータセットと各リポジトリのライセンスを区別し、評価データ汚染や生成コードのライセンスリスクも管理する必要があります。

WHY IT MATTERS

なぜ重要なのか?

学習データの新しさ、ライセンス、重複処理はコーディングモデルを左右するため、大規模な公開データは再現可能なオープンモデルの基盤を広げます。

WHO SHOULD CARE

誰にとって重要か?

オープンモデル開発者コーディングAI研究者データガバナンス担当
AIZIGOO VIEW

AIZIGOOの見解

規模はHugging Faceのデータセットカードに基づき、リポジトリやトークンの集計方法で解釈が変わる場合があります。