Inférence 7B/8B
Recommandé
NVIDIA · Hopper
Adapté à l’inférence 70B quantifiée, au fine-tuning LoRA et au service à haut débit.
Location mensuelle
~ USD 2.16/heure sur la base de 730 heures par mois
Disponibilité: Limited capacity
Comparer les GPU| Fournisseur | NVIDIA |
|---|---|
| Modèle | NVIDIA H100 PCIe 80GB |
| SKU | H100 PCIe |
| Architecture | Hopper |
| Classe matérielle | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Type de mémoire | HBM2e |
| Bande passante mémoire | 2000 GB/s |
| Précision | Mode dense | Avec sparsité |
|---|---|---|
| FP64 | 26 TFLOPS | — |
| FP64 Tensor | 51 TFLOPS | — |
| FP32 | 51 TFLOPS | — |
| TF32 Tensor | 378 TFLOPS | 756 TFLOPS |
| BF16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP8 Tensor | 1513 TFLOPS | 3026 TFLOPS |
| INT8 Tensor | 1513 TOPS | 3026 TOPS |
| Format / interface | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen5 x16 |
| TDP | 350 W |
| NVLink | 600 GB/s NVLink Bridge |
| NVSwitch | Non pris en charge |
| MIG | Jusqu’à 7 MIG @ 10 Go |
| GPU max par nœud | 8 |
| CUDA | Pris en charge |
|---|---|
| Vérification | OFFICIAL_VENDOR |
| Source | www.nvidia.com |
Recommandé
Recommandé avec quantification ou analyse de marge FP16/BF16
Recommandé avec quantification pour garder une marge de production
Recommandé pour inférence quantifiée ; vérifier contexte et concurrence
Adapté à LoRA/QLoRA ; le fine-tuning complet dépend du modèle et de la topologie
Utiliser des nœuds multi-GPU avec topologie à haute bande passante
80 GB HBM3 · Available
USD 1,860/mois
80 GB HBM2e · Available
USD 915/mois
48 GB GDDR6 ECC · Available
USD 506/mois
L’adéquation dépend du modèle, de la précision, du contexte et de la concurrence. Utilisez le recommandateur pour dimensionner avec marge.
Le prix mensuel public est la version de prix autorisée. L’équivalent horaire est dérivé du prix mensuel sur une base de 730 heures.
Les configurations multi-GPU sont possibles lorsque l’inventaire et la topologie du nœud le permettent.