Inférence 7B/8B
Recommandé
NVIDIA · Hopper
Idéal pour grands modèles, longs contextes, fine-tuning lourd et charges IA très consommatrices de mémoire.
Location mensuelle
~ USD 3.21/heure sur la base de 730 heures par mois
Disponibilité: Limited capacity
Comparer les GPU| Fournisseur | NVIDIA |
|---|---|
| Modèle | NVIDIA H200 SXM 141GB |
| SKU | H200 SXM |
| Architecture | Hopper |
| Classe matérielle | datacenter gpu |
| VRAM | 141 GB |
|---|---|
| Type de mémoire | HBM3e |
| Bande passante mémoire | 4800 GB/s |
| Précision | Mode dense | Avec sparsité |
|---|---|---|
| FP64 | 34 TFLOPS | — |
| FP64 Tensor | 67 TFLOPS | — |
| FP32 | 67 TFLOPS | — |
| TF32 Tensor | 494.5 TFLOPS | 989 TFLOPS |
| BF16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP8 Tensor | 1979 TFLOPS | 3958 TFLOPS |
| INT8 Tensor | 1979 TOPS | 3958 TOPS |
| Format / interface | SXM module |
|---|---|
| Interface | PCIe Gen5 x16 host interface |
| TDP | 700 W |
| NVLink | 900 GB/s NVLink |
| NVSwitch | Pris en charge |
| MIG | Jusqu’à 7 MIG @ 18 Go |
| GPU max par nœud | 8 |
| CUDA | Pris en charge |
|---|---|
| Vérification | OFFICIAL_VENDOR |
| Source | www.nvidia.com |
Recommandé
Recommandé avec quantification ou analyse de marge FP16/BF16
Recommandé avec quantification pour garder une marge de production
Recommandé pour inférence quantifiée ; vérifier contexte et concurrence
Adapté à LoRA/QLoRA ; le fine-tuning complet dépend du modèle et de la topologie
Utiliser des nœuds multi-GPU avec topologie à haute bande passante
80 GB HBM3 · Available
USD 1,860/mois
80 GB HBM2e · Limited capacity
USD 1,579/mois
80 GB HBM2e · Available
USD 915/mois
L’adéquation dépend du modèle, de la précision, du contexte et de la concurrence. Utilisez le recommandateur pour dimensionner avec marge.
Le prix mensuel public est la version de prix autorisée. L’équivalent horaire est dérivé du prix mensuel sur une base de 730 heures.
Les configurations multi-GPU sont possibles lorsque l’inventaire et la topologie du nœud le permettent.