7B/8B-Inferenz
Empfohlen
NVIDIA · Ampere
Stark für quantisierte 70B-Inferenz, LoRA-Fine-Tuning und Serving mit hohem Durchsatz.
Monatliche Miete
~ USD 1.25/Stunde basierend auf einem 730-Stunden-Monat
Verfügbarkeit: Available
GPUs vergleichen| Anbieter | NVIDIA |
|---|---|
| Modell | NVIDIA A100 SXM 80GB |
| SKU | A100 SXM 80GB |
| Architecture | Ampere |
| Hardwareklasse | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Speichertyp | HBM2e |
| Speicherbandbreite | 2039 GB/s |
| Präzision | Dicht | Mit spärlicher Ausführung |
|---|---|---|
| FP64 | 9.7 TFLOPS | — |
| FP64 Tensor | 19.5 TFLOPS | — |
| FP32 | 19.5 TFLOPS | — |
| TF32 Tensor | 156 TFLOPS | 312 TFLOPS |
| BF16 Tensor | 312 TFLOPS | 624 TFLOPS |
| FP16 Tensor | 312 TFLOPS | 624 TFLOPS |
| INT8 Tensor | 624 TOPS | 1248 TOPS |
| Formfaktor / Schnittstelle | SXM module |
|---|---|
| Interface | PCIe Gen4 x16 host interface |
| TDP | 400 W |
| NVLink | 600 GB/s NVLink |
| NVSwitch | Unterstützt |
| MIG | Bis zu 7 MIGs @ 10 GB |
| Max. GPUs pro Knoten | 8 |
| CUDA | Unterstützt |
|---|---|
| Verifizierung | OFFICIAL_VENDOR |
| Quelle | www.nvidia.com |
Empfohlen
Empfohlen mit Quantisierung oder FP16/BF16-Headroom-Prüfung
Empfohlen mit Quantisierung für Produktions-Headroom
Empfohlen für quantisierte Inferenz; Kontext und Parallelität prüfen
Geeignet für LoRA/QLoRA; vollständiges Fine-Tuning hängt von Modellgröße und Topologie ab
Multi-GPU-Knoten mit hoher Bandbreite verwenden
80 GB HBM3 · Available
USD 1,860/Monat
80 GB HBM2e · Limited capacity
USD 1,579/Monat
48 GB GDDR6 ECC · Available
USD 506/Monat
Die Eignung hängt von Modellgröße, Präzision, Kontextlänge und Parallelität ab. Nutzen Sie den Empfehlungsrechner mit Reserve.
Der öffentliche Monatspreis ist die genehmigte Preisversion. Der Stundenwert wird aus 730 Monatsstunden abgeleitet.
Multi-GPU-Konfigurationen sind möglich, wenn Inventar und Knotentopologie es erlauben.