Inférence 7B/8B
Recommandé
NVIDIA · Ampere
Adapté à l’inférence 70B quantifiée, au fine-tuning LoRA et au service à haut débit.
Location mensuelle
~ USD 1.25/heure sur la base de 730 heures par mois
Disponibilité: Available
Comparer les GPU| Fournisseur | NVIDIA |
|---|---|
| Modèle | NVIDIA A100 SXM 80GB |
| SKU | A100 SXM 80GB |
| Architecture | Ampere |
| Classe matérielle | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Type de mémoire | HBM2e |
| Bande passante mémoire | 2039 GB/s |
| Précision | Mode dense | Avec sparsité |
|---|---|---|
| FP64 | 9.7 TFLOPS | — |
| FP64 Tensor | 19.5 TFLOPS | — |
| FP32 | 19.5 TFLOPS | — |
| TF32 Tensor | 156 TFLOPS | 312 TFLOPS |
| BF16 Tensor | 312 TFLOPS | 624 TFLOPS |
| FP16 Tensor | 312 TFLOPS | 624 TFLOPS |
| INT8 Tensor | 624 TOPS | 1248 TOPS |
| Format / interface | SXM module |
|---|---|
| Interface | PCIe Gen4 x16 host interface |
| TDP | 400 W |
| NVLink | 600 GB/s NVLink |
| NVSwitch | Pris en charge |
| MIG | Jusqu’à 7 MIG @ 10 Go |
| GPU max par nœud | 8 |
| CUDA | Pris en charge |
|---|---|
| Vérification | OFFICIAL_VENDOR |
| Source | www.nvidia.com |
Recommandé
Recommandé avec quantification ou analyse de marge FP16/BF16
Recommandé avec quantification pour garder une marge de production
Recommandé pour inférence quantifiée ; vérifier contexte et concurrence
Adapté à LoRA/QLoRA ; le fine-tuning complet dépend du modèle et de la topologie
Utiliser des nœuds multi-GPU avec topologie à haute bande passante
80 GB HBM3 · Available
USD 1,860/mois
80 GB HBM2e · Limited capacity
USD 1,579/mois
48 GB GDDR6 ECC · Available
USD 506/mois
L’adéquation dépend du modèle, de la précision, du contexte et de la concurrence. Utilisez le recommandateur pour dimensionner avec marge.
Le prix mensuel public est la version de prix autorisée. L’équivalent horaire est dérivé du prix mensuel sur une base de 730 heures.
Les configurations multi-GPU sont possibles lorsque l’inventaire et la topologie du nœud le permettent.