Inférence 7B/8B
Recommandé
NVIDIA · Ada Lovelace
Efficace pour petits modèles, embeddings, reranking, développement et services IA sensibles au coût.
Location mensuelle
~ USD 0.34/heure sur la base de 730 heures par mois
Disponibilité: Available
Comparer les GPU| Fournisseur | NVIDIA |
|---|---|
| Modèle | NVIDIA L4 24GB |
| SKU | L4 |
| Architecture | Ada Lovelace |
| Classe matérielle | datacenter gpu |
| VRAM | 24 GB |
|---|---|
| Type de mémoire | GDDR6 |
| Bande passante mémoire | 300 GB/s |
| Précision | Mode dense | Avec sparsité |
|---|---|---|
| FP32 | 30.3 TFLOPS | — |
| TF32 Tensor | 60 TFLOPS | 120 TFLOPS |
| BF16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP8 Tensor | 242.5 TFLOPS | 485 TFLOPS |
| INT8 Tensor | 242.5 TOPS | 485 TOPS |
| Format / interface | PCIe low-profile accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 72 W |
| NVLink | Non pris en charge |
| NVSwitch | Non pris en charge |
| MIG | Non pris en charge |
| GPU max par nœud | 8 |
| CUDA | Pris en charge |
|---|---|
| Vérification | OFFICIAL_VENDOR |
| Source | www.nvidia.com |
Recommandé
Recommandé avec quantification ou analyse de marge FP16/BF16
Limité
Nécessite souvent plusieurs GPU ou une quantification plus forte
Limité aux petites charges ou charges adaptées
Pas le choix principal pour entraînement distribué large
48 GB GDDR6 ECC · Available
USD 506/mois
80 GB HBM3 · Available
USD 1,860/mois
80 GB HBM2e · Limited capacity
USD 1,579/mois
L’adéquation dépend du modèle, de la précision, du contexte et de la concurrence. Utilisez le recommandateur pour dimensionner avec marge.
Le prix mensuel public est la version de prix autorisée. L’équivalent horaire est dérivé du prix mensuel sur une base de 730 heures.
Les configurations multi-GPU sont possibles lorsque l’inventaire et la topologie du nœud le permettent.