Inférence 7B/8B
Recommandé
NVIDIA · Ada Lovelace
Équilibré pour LLM moyens, génération d’images, vision par ordinateur et inférence de production optimisée.
Location mensuelle
~ USD 0.69/heure sur la base de 730 heures par mois
Disponibilité: Available
Comparer les GPU| Fournisseur | NVIDIA |
|---|---|
| Modèle | NVIDIA L40S 48GB |
| SKU | L40S |
| Architecture | Ada Lovelace |
| Classe matérielle | datacenter gpu |
| VRAM | 48 GB |
|---|---|
| Type de mémoire | GDDR6 ECC |
| Bande passante mémoire | 864 GB/s |
| Précision | Mode dense | Avec sparsité |
|---|---|---|
| FP32 | 91.6 TFLOPS | — |
| TF32 Tensor | 183 TFLOPS | 366 TFLOPS |
| BF16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP8 Tensor | 733 TFLOPS | 1466 TFLOPS |
| INT8 Tensor | 733 TOPS | 1466 TOPS |
| Format / interface | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 350 W |
| NVLink | Non pris en charge |
| NVSwitch | Non pris en charge |
| MIG | Non pris en charge |
| GPU max par nœud | 8 |
| CUDA | Pris en charge |
|---|---|
| Vérification | OFFICIAL_VENDOR |
| Source | www.nvidia.com |
Recommandé
Recommandé avec quantification ou analyse de marge FP16/BF16
Recommandé avec quantification pour garder une marge de production
Nécessite souvent plusieurs GPU ou une quantification plus forte
Adapté à LoRA/QLoRA ; le fine-tuning complet dépend du modèle et de la topologie
Pas le choix principal pour entraînement distribué large
24 GB GDDR6 · Available
USD 250/mois
80 GB HBM3 · Available
USD 1,860/mois
80 GB HBM2e · Limited capacity
USD 1,579/mois
L’adéquation dépend du modèle, de la précision, du contexte et de la concurrence. Utilisez le recommandateur pour dimensionner avec marge.
Le prix mensuel public est la version de prix autorisée. L’équivalent horaire est dérivé du prix mensuel sur une base de 730 heures.
Les configurations multi-GPU sont possibles lorsque l’inventaire et la topologie du nœud le permettent.