7B/8B-Inferenz
Empfohlen
NVIDIA · Hopper
Geeignet für große Modelle, langen Kontext, schweres Fine-Tuning und speicherintensive KI-Workloads.
Monatliche Miete
~ USD 3.21/Stunde basierend auf einem 730-Stunden-Monat
Verfügbarkeit: Limited capacity
GPUs vergleichen| Anbieter | NVIDIA |
|---|---|
| Modell | NVIDIA H200 SXM 141GB |
| SKU | H200 SXM |
| Architecture | Hopper |
| Hardwareklasse | datacenter gpu |
| VRAM | 141 GB |
|---|---|
| Speichertyp | HBM3e |
| Speicherbandbreite | 4800 GB/s |
| Präzision | Dicht | Mit spärlicher Ausführung |
|---|---|---|
| FP64 | 34 TFLOPS | — |
| FP64 Tensor | 67 TFLOPS | — |
| FP32 | 67 TFLOPS | — |
| TF32 Tensor | 494.5 TFLOPS | 989 TFLOPS |
| BF16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP8 Tensor | 1979 TFLOPS | 3958 TFLOPS |
| INT8 Tensor | 1979 TOPS | 3958 TOPS |
| Formfaktor / Schnittstelle | SXM module |
|---|---|
| Interface | PCIe Gen5 x16 host interface |
| TDP | 700 W |
| NVLink | 900 GB/s NVLink |
| NVSwitch | Unterstützt |
| MIG | Bis zu 7 MIGs @ 18 GB |
| Max. GPUs pro Knoten | 8 |
| CUDA | Unterstützt |
|---|---|
| Verifizierung | OFFICIAL_VENDOR |
| Quelle | www.nvidia.com |
Empfohlen
Empfohlen mit Quantisierung oder FP16/BF16-Headroom-Prüfung
Empfohlen mit Quantisierung für Produktions-Headroom
Empfohlen für quantisierte Inferenz; Kontext und Parallelität prüfen
Geeignet für LoRA/QLoRA; vollständiges Fine-Tuning hängt von Modellgröße und Topologie ab
Multi-GPU-Knoten mit hoher Bandbreite verwenden
80 GB HBM3 · Available
USD 1,860/Monat
80 GB HBM2e · Limited capacity
USD 1,579/Monat
80 GB HBM2e · Available
USD 915/Monat
Die Eignung hängt von Modellgröße, Präzision, Kontextlänge und Parallelität ab. Nutzen Sie den Empfehlungsrechner mit Reserve.
Der öffentliche Monatspreis ist die genehmigte Preisversion. Der Stundenwert wird aus 730 Monatsstunden abgeleitet.
Multi-GPU-Konfigurationen sind möglich, wenn Inventar und Knotentopologie es erlauben.