7B/8B-Inferenz
Empfohlen
NVIDIA · Hopper
Stark für quantisierte 70B-Inferenz, LoRA-Fine-Tuning und Serving mit hohem Durchsatz.
Monatliche Miete
~ USD 2.16/Stunde basierend auf einem 730-Stunden-Monat
Verfügbarkeit: Limited capacity
GPUs vergleichen| Anbieter | NVIDIA |
|---|---|
| Modell | NVIDIA H100 PCIe 80GB |
| SKU | H100 PCIe |
| Architecture | Hopper |
| Hardwareklasse | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Speichertyp | HBM2e |
| Speicherbandbreite | 2000 GB/s |
| Präzision | Dicht | Mit spärlicher Ausführung |
|---|---|---|
| FP64 | 26 TFLOPS | — |
| FP64 Tensor | 51 TFLOPS | — |
| FP32 | 51 TFLOPS | — |
| TF32 Tensor | 378 TFLOPS | 756 TFLOPS |
| BF16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP8 Tensor | 1513 TFLOPS | 3026 TFLOPS |
| INT8 Tensor | 1513 TOPS | 3026 TOPS |
| Formfaktor / Schnittstelle | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen5 x16 |
| TDP | 350 W |
| NVLink | 600 GB/s NVLink Bridge |
| NVSwitch | Nicht unterstützt |
| MIG | Bis zu 7 MIGs @ 10 GB |
| Max. GPUs pro Knoten | 8 |
| CUDA | Unterstützt |
|---|---|
| Verifizierung | OFFICIAL_VENDOR |
| Quelle | www.nvidia.com |
Empfohlen
Empfohlen mit Quantisierung oder FP16/BF16-Headroom-Prüfung
Empfohlen mit Quantisierung für Produktions-Headroom
Empfohlen für quantisierte Inferenz; Kontext und Parallelität prüfen
Geeignet für LoRA/QLoRA; vollständiges Fine-Tuning hängt von Modellgröße und Topologie ab
Multi-GPU-Knoten mit hoher Bandbreite verwenden
80 GB HBM3 · Available
USD 1,860/Monat
80 GB HBM2e · Available
USD 915/Monat
48 GB GDDR6 ECC · Available
USD 506/Monat
Die Eignung hängt von Modellgröße, Präzision, Kontextlänge und Parallelität ab. Nutzen Sie den Empfehlungsrechner mit Reserve.
Der öffentliche Monatspreis ist die genehmigte Preisversion. Der Stundenwert wird aus 730 Monatsstunden abgeleitet.
Multi-GPU-Konfigurationen sind möglich, wenn Inventar und Knotentopologie es erlauben.