Zum Hauptinhalt springen

NVIDIA Nemotron · Omni · Nemotron 3 Nano Omni

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8: Daten, GPU-Bedarf, Hosting und Bereitstellung

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 ist eine Aktuell-Version im Omni-Zweig der NVIDIA Nemotron-Familie und anhand der offiziellen Revision zertifiziert.

Technische Bereitstellungsillustration für NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8
Referenzablauf; exakte Architekturdaten stehen separat.
Gesamtparameter31,0B
Aktive Parameter3,0B
Kontextfenster262.144 tokens
VersionsstatusAktuell · Aktuell
ArchitekturNemotronH_Nano_Omni_Reasoning_V3
ModalitätenText, Bild, Audio, Video
LizenzVereinbarung über die offene Modelllizenz von NVIDIA
BereitstellungsstatusMit zertifizierter Konfiguration bereitstellbar
Kommerzieller StatusKommerzielle Nutzung unter Auflagen erlaubt
Veröffentlichungsdatum2026-04-24

Architektur, Stärken und Einsatzbereiche

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 ist eine offizielle selbst hostbare NVIDIA-Version im Zweig NVIDIA Nemotron Omni. Sie nutzt NemotronH_Nano_Omni_Reasoning_V3 mit 31B / 3B MoE und 262,144 geprüften Kontext-Token.

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 nutzt NemotronH_Nano_Omni_Reasoning_V3 mit 31B / 3B MoE. Das Quellenprofil enthält 64 Schichten, Breite 8192 und 64 Attention-Köpfe, soweit veröffentlicht.

Geprüfte NemotronH_Nano_Omni_Reasoning_V3-Architektur
262,144 zertifizierte Kontext-Token
Offizielle Checkpoint-Herkunft
Private LLM-Inferenz
Agentische Abläufe
Verarbeitung langer Dokumente

Zertifizierte Checkpoints und Quantisierungen

Angezeigt werden nur exakte, quellengeprüfte Varianten dieser Version.

Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8

nvidia/Nemotron-3-Nano-Omni-30B-A3B-Reasoning-FP8

Offiziell · FP8 · safetensors

Laufzeitumgebung verifiziert: vLLM SGLang TensorRT-LLM Llama.cpp

Präzision / QuantisierungFormatBitVertrauen in HerausgeberBereitstellungsstatus
FP8safetensors8OffiziellLaufzeitumgebung verifiziert

Empfohlene Hardware

Nutzen Sie nur zertifizierte Laufzeitkonfigurationen mit exakter Checkpoint-Präzision. Die Rangfolge prüft Gewichte, KV-Cache, Laufzeitaufwand, GPU-Architektur und Topologie.

Geschätzter Gewichtsspeicher29.74 GB
KV cache1 GB
Laufzeitaufwand10.25 GB
Gesamt mit Sicherheitsreserve50.83 GB

Empfohlenes Preis-Leistungs-Verhältnis

1× NVIDIA H200 SXM 141GB

141 GB VRAM gesamt · nvswitch

90.17 GB Reserve · Begrenzte Kapazität

$2.345,00 / Monat

Günstigste geeignete Option

3× NVIDIA L4 24GB

72 GB VRAM gesamt · pcie

21.17 GB Reserve · Verfügbar

$750,00 / Monat

Höchste Leistung

1× NVIDIA H200 SXM 141GB

141 GB VRAM gesamt · nvswitch

90.17 GB Reserve · Begrenzte Kapazität

$2.345,00 / Monat

Lizenz und Selbsthosting

Der vollständige Residenzsatz von 31 B muss auf die GPUs passen. Kontext und Parallelität erhöhen den KV-Cache.

NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 wird unter Vereinbarung über die offene Modelllizenz von NVIDIA veröffentlicht. Offizielle URL und Prüfdatum werden gespeichert.

Kommerzielle Nutzung unter Auflagen erlaubt. Die kommerzielle Nutzung ist an Bedingungen geknüpft. Prüfen Sie vor der Bereitstellung die verlinkten offiziellen Bedingungen.

Versionsverlauf

nvidia/nemotron/nemotron-3-nano-omni-30b-a3b-reasoning-fp8 @ dd885e9548478d0d433c1239ed4598ad4a9faf7f58a8c706ab89885e5e2117fa

Offizielle Quelle

Häufige Fragen

Wie viel VRAM benötigt NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8?

Die Schätzung hängt von Präzision, Kontext und Parallelität ab und nutzt zertifizierte Daten.

Welche Laufzeitumgebungen unterstützen NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8?

Geprüfte Upstream-Belege liegen für vllm, sglang, tensorrt-llm, llama.cpp vor.

Darf NVIDIA Nemotron 3 Nano Omni 30B-A3B Reasoning FP8 kommerziell genutzt werden?

Die gespeicherte Einstufung ist Kommerzielle Nutzung unter Auflagen erlaubt. Maßgeblich sind die offiziellen Vereinbarung über die offene Modelllizenz von NVIDIA-Bedingungen.

Offizielle Quellen

Zuletzt geprüft: 2026-08-26