公開内容
NVIDIAは2026年7月16日、Nemotron 3 Embed を公開しました。精度重視の8B BF16、効率重視の1B BF16、Blackwell向け高スループットの1B NVFP4で構成し、ウェイト、データセット、微調整・蒸留レシピも提供します。
検索エージェントへの意味
埋め込みモデルは文書、コード、会話履歴から根拠を探すRAGとエージェントメモリの入口です。NVIDIAは多言語・コード検索、32K文脈に対応し、8Bモデルが7月15日のRTEBスナップショットで78.5点の首位だったと報告しています。
3つの配備方式
- 8B BF16:精度重視の検索と企業RAG
- 1B BF16:遅延と費用を抑える一般配備
- 1B NVFP4:Blackwellでの高スループットと省メモリ
限界
順位と効率はNVIDIAの評価と特定時点のリーダーボードです。自社の言語、分野、鮮度、再現率、生成回答への影響、索引費用、総遅延を比較してください。モデルの文脈長と特定NIMランタイムの検証上限もバージョン別確認が必要です。