NVIDIA、RAG検索向けNemotron 3 Embedの8B・1Bオープンモデルを公開

8B BF16、1B BF16、Blackwell向け1B NVFP4の3モデルを公開。多言語・コード検索と32K文脈を掲げる。

公開内容

NVIDIAは2026年7月16日、Nemotron 3 Embed を公開しました。精度重視の8B BF16、効率重視の1B BF16、Blackwell向け高スループットの1B NVFP4で構成し、ウェイト、データセット、微調整・蒸留レシピも提供します。

検索エージェントへの意味

埋め込みモデルは文書、コード、会話履歴から根拠を探すRAGとエージェントメモリの入口です。NVIDIAは多言語・コード検索、32K文脈に対応し、8Bモデルが7月15日のRTEBスナップショットで78.5点の首位だったと報告しています。

3つの配備方式

  • 8B BF16:精度重視の検索と企業RAG
  • 1B BF16:遅延と費用を抑える一般配備
  • 1B NVFP4:Blackwellでの高スループットと省メモリ

限界

順位と効率はNVIDIAの評価と特定時点のリーダーボードです。自社の言語、分野、鮮度、再現率、生成回答への影響、索引費用、総遅延を比較してください。モデルの文脈長と特定NIMランタイムの検証上限もバージョン別確認が必要です。

公式情報