NVIDIA Nemotron 3 Embed 공개, RAG 검색용 8B·1B 오픈 모델 3종

8B BF16, 1B BF16과 Blackwell용 1B NVFP4로 구성된 검색 모델군이 공개됐다. 다국어·코드 검색과 32K 문맥을 지원한다.

무엇이 나왔나

NVIDIA는 2026년 7월 16일 Nemotron 3 Embed 모델군을 공개했습니다. 정확도 중심 8B BF16, 효율 중심 1B BF16, Blackwell GPU 처리량을 겨냥한 1B NVFP4의 세 가지 공개 모델로 구성됩니다. 가중치와 데이터셋, 미세조정·증류 레시피도 함께 제공합니다.

검색 에이전트에 주는 의미

임베딩 모델은 문서·코드·대화 기록에서 필요한 근거를 찾는 RAG와 에이전트 메모리의 입구입니다. NVIDIA는 다국어와 코드 검색, 최대 32K 문맥을 지원하며 8B 모델이 7월 15일 RTEB 스냅샷에서 78.5점으로 1위였다고 보고했습니다.

세 가지 배포 선택

  • 8B BF16: 정확도가 중요한 검색과 기업 RAG
  • 1B BF16: 지연 시간과 비용을 줄인 일반 배포
  • 1B NVFP4: Blackwell 환경의 높은 처리량과 작은 메모리 사용

확인할 한계

순위와 효율 수치는 NVIDIA가 구성한 평가와 특정 시점의 리더보드 결과입니다. 실제 도입에서는 자사 문서의 언어·도메인·최신성, 재현율, 오답 근거가 생성 답변에 미치는 영향, 색인 비용과 엔드투엔드 지연을 함께 비교해야 합니다. 모델 문맥 길이와 개별 NIM 런타임의 검증 한도도 버전별로 확인해야 합니다.

공식 출처