Saltar al contenido principal

NVIDIA Nemotron · Omni · Nemotron 3 Nano Omni

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8: especificaciones, GPU, hosting y despliegue

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 es una versión Actual de la línea Omni de NVIDIA Nemotron, certificada desde su revisión oficial.

Ilustración técnica de despliegue para NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8
Flujo de referencia; los datos exactos se muestran aparte.
Parámetros totales31,0B
Parámetros activos3,0B
Ventana de contexto262.144 tokens
Estado de versiónActual · Actual
ArquitecturaNemotronH_Nano_Omni_Reasoning_V3
ModalidadesTexto, Imagen, Audio, Vídeo
LicenciaAcuerdo de licencia de modelo abierto de NVIDIA
Estado de despliegueDesplegable con una configuración certificada
Estado comercialUso comercial permitido con condiciones
Fecha de lanzamiento2026-04-24

Arquitectura, fortalezas y usos

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 es una versión oficial autoalojable de NVIDIA en la línea NVIDIA Nemotron Omni. Usa NemotronH_Nano_Omni_Reasoning_V3 con 31B / 3B MoE y un contexto verificado de 262,144 tokens.

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 usa NemotronH_Nano_Omni_Reasoning_V3 con 31B / 3B MoE. El perfil registra 64 capas, ancho oculto 8192 y 64 cabezas de atención cuando se publican.

Arquitectura NemotronH_Nano_Omni_Reasoning_V3 verificada
Contexto certificado de 262,144 tokens
Proveniencia oficial del checkpoint
Inferencia LLM privada
Flujos con agentes
Documentos de contexto largo

Checkpoints y cuantizaciones certificados

Solo se muestran variantes exactas, vinculadas a esta versión y certificadas por su fuente.

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8

nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8

Oficial · FP8 · safetensors

Entorno de ejecución certificado: vLLM SGLang TensorRT-LLM Llama.cpp

Precisión / cuantizaciónFormatoBitsConfianza del editorEstado de despliegue
FP8safetensors8OficialEntorno de ejecución certificado

Hardware recomendado

Use solo configuraciones de entorno de ejecución certificadas con la precisión exacta. El ranking comprueba pesos, caché KV, sobrecarga, arquitectura GPU y topología.

Memoria estimada de pesos29.74 GB
KV cache1 GB
Sobrecarga del entorno de ejecución10.25 GB
Total con margen de seguridad50.83 GB

Mejor relación calidad-precio

1× NVIDIA H200 SXM 141GB

141 GB VRAM total · nvswitch

90.17 GB de margen · Capacidad limitada

USD 2.345 / mes

Opción viable de menor coste

3× NVIDIA L4 24GB

72 GB VRAM total · pcie

21.17 GB de margen · Disponible

USD 750 / mes

Máximo rendimiento

1× NVIDIA H200 SXM 141GB

141 GB VRAM total · nvswitch

90.17 GB de margen · Capacidad limitada

USD 2.345 / mes

Licencia y autoalojamiento

Los 31 B de pesos residentes deben caber en las GPU. Contexto y concurrencia añaden caché KV.

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 se publica bajo Acuerdo de licencia de modelo abierto de NVIDIA. Se conservan la URL oficial y la fecha de verificación.

Uso comercial permitido con condiciones. El uso comercial está sujeto a condiciones. Revise las condiciones oficiales indicadas antes del despliegue.

Cronología de la versión

nvidia/nemotron/nemotron-3-nano-omni-30b-a3b-reasoning-fp8 @ dd885e9548478d0d433c1239ed4598ad4a9faf7f58a8c706ab89885e5e2117fa

Fuente oficial

Preguntas frecuentes

¿Cuánta VRAM requiere NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8?

La estimación depende de precisión, contexto y concurrencia y usa datos certificados.

¿Qué entornos de ejecución admiten NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8?

Hay pruebas oficiales certificadas para vllm, sglang, tensorrt-llm, llama.cpp.

¿Puede usarse NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 comercialmente?

La clasificación es Uso comercial permitido con condiciones. Consulte los términos oficiales de Acuerdo de licencia de modelo abierto de NVIDIA.

Referencias oficiales

Última verificación: 2026-08-26