
Hugging Face에 공개된 NVIDIA 공식 모델 카드에 따르면 회사는 2026년 6월 4일 Nemotron 3 Ultra 550B-A55B-BF16 모델을 공개했다. 이 모델은 총 5500억 개 매개변수와 추론 시 550억 개 활성 매개변수를 쓰는 LatentMoE 기반 대규모 언어 모델이다.
NVIDIA는 모델 카드에서 Nemotron 3 Ultra를 복잡한 에이전트 워크플로, 장문 문맥 분석, 도구 사용, 다국어 추론, 고위험 RAG 작업에 적합한 모델로 소개했다. 최대 문맥 길이는 100만 토큰이며, 한국어를 포함한 여러 언어를 지원한다고 설명했다.
모델 구조는 Mamba-2, MoE, 일부 Attention 계층을 결합한 하이브리드 Latent Mixture-of-Experts 방식이다. NVIDIA는 Multi-Token Prediction 계층을 통해 생성 속도와 품질을 높이고, NVFP4 사전학습 방식을 활용해 학습 효율을 높였다고 밝혔다.
상용 및 비상용 이용은 OpenMDW License Agreement 1.1에 따라 가능하다고 모델 카드에 명시돼 있다. 다만 오픈소스 소프트웨어 라이선스와 동일한 의미로 단정하기보다는, 공개 가중치와 별도 모델 라이선스 조건을 함께 확인해야 한다.
NVIDIA는 앞서 6월 1일 공식 보도자료에서 Nemotron 3 Ultra가 Hugging Face, ModelScope, OpenRouter, build.nvidia.com 및 NVIDIA NIM 마이크로서비스 형태로 6월 4일 제공될 예정이라고 밝혔다. 당시 회사는 이 모델이 코딩, 연구, 엔터프라이즈 워크플로를 위한 장기 실행 에이전트를 겨냥한다고 설명했다.
이번 공개는 AI 인프라 기업인 NVIDIA가 GPU와 소프트웨어 스택뿐 아니라 공개 가중치 모델 생태계에서도 입지를 넓히려는 흐름으로 볼 수 있다. 특히 장문 문맥, 에이전트 실행, 코드·수학·과학 추론 벤치마크를 전면에 내세운 점은 기업용 에이전트 플랫폼 경쟁과 맞닿아 있다.
다만 모델 카드의 벤치마크는 NVIDIA가 제시한 평가 결과이므로, 실제 성능과 비용 효율은 독립 평가, 배포 환경, 하드웨어 구성, 워크로드에 따라 달라질 수 있다. 최소 GPU 요구 사항도 8x GB200/B200/GB300/B300, 16x H100, 8x H200으로 제시돼 일반 개발자가 직접 운용하기에는 높은 인프라 장벽이 있다.
출처: NVIDIA 공식 Hugging Face 모델 카드 `NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16`(2026년 6월 4일) https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-BF16
참고: NVIDIA 공식 보도자료 `Enterprise Software Leaders Build AI Agents With NVIDIA`(2026년 6월 1일) https://investor.nvidia.com/news/press-release-details/2026/Enterprise-Software-Leaders-Build-AI-Agents-With-NVIDIA/default.aspx