7B/8B-Inferenz
Empfohlen
NVIDIA · Ada Lovelace
Ausgewogen für mittlere LLMs, Bildgenerierung, Computer Vision und kostenbewusste Produktionsinferenz.
Monatliche Miete
~ USD 0.69/Stunde basierend auf einem 730-Stunden-Monat
Verfügbarkeit: Available
GPUs vergleichen| Anbieter | NVIDIA |
|---|---|
| Modell | NVIDIA L40S 48GB |
| SKU | L40S |
| Architecture | Ada Lovelace |
| Hardwareklasse | datacenter gpu |
| VRAM | 48 GB |
|---|---|
| Speichertyp | GDDR6 ECC |
| Speicherbandbreite | 864 GB/s |
| Präzision | Dicht | Mit spärlicher Ausführung |
|---|---|---|
| FP32 | 91.6 TFLOPS | — |
| TF32 Tensor | 183 TFLOPS | 366 TFLOPS |
| BF16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP8 Tensor | 733 TFLOPS | 1466 TFLOPS |
| INT8 Tensor | 733 TOPS | 1466 TOPS |
| Formfaktor / Schnittstelle | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 350 W |
| NVLink | Nicht unterstützt |
| NVSwitch | Nicht unterstützt |
| MIG | Nicht unterstützt |
| Max. GPUs pro Knoten | 8 |
| CUDA | Unterstützt |
|---|---|
| Verifizierung | OFFICIAL_VENDOR |
| Quelle | www.nvidia.com |
Empfohlen
Empfohlen mit Quantisierung oder FP16/BF16-Headroom-Prüfung
Empfohlen mit Quantisierung für Produktions-Headroom
Benötigt meist mehrere GPUs oder stärkere Quantisierung
Geeignet für LoRA/QLoRA; vollständiges Fine-Tuning hängt von Modellgröße und Topologie ab
Nicht die primäre Wahl für großes verteiltes Training
24 GB GDDR6 · Available
USD 250/Monat
80 GB HBM3 · Available
USD 1,860/Monat
80 GB HBM2e · Limited capacity
USD 1,579/Monat
Die Eignung hängt von Modellgröße, Präzision, Kontextlänge und Parallelität ab. Nutzen Sie den Empfehlungsrechner mit Reserve.
Der öffentliche Monatspreis ist die genehmigte Preisversion. Der Stundenwert wird aus 730 Monatsstunden abgeleitet.
Multi-GPU-Konfigurationen sind möglich, wenn Inventar und Knotentopologie es erlauben.