NVIDIA H100 PCIe 80GB GPU accelerator

NVIDIA · Hopper

NVIDIA H100 PCIe 80GB

Adapté à l’inférence 70B quantifiée, au fine-tuning LoRA et au service à haut débit.

Location mensuelle

USD 1,579/mois

~ USD 2.16/heure sur la base de 730 heures par mois

Disponibilité: Limited capacity

Comparer les GPU

Spécifications techniques

Identité

Fournisseur NVIDIA
Modèle NVIDIA H100 PCIe 80GB
SKU H100 PCIe
Architecture Hopper
Classe matérielle datacenter gpu

Mémoire

VRAM 80 GB
Type de mémoire HBM2e
Bande passante mémoire 2000 GB/s

Calcul

Précision Mode dense Avec sparsité
FP64 26 TFLOPS
FP64 Tensor 51 TFLOPS
FP32 51 TFLOPS
TF32 Tensor 378 TFLOPS 756 TFLOPS
BF16 Tensor 756.5 TFLOPS 1513 TFLOPS
FP16 Tensor 756.5 TFLOPS 1513 TFLOPS
FP8 Tensor 1513 TFLOPS 3026 TFLOPS
INT8 Tensor 1513 TOPS 3026 TOPS

Plateforme

Format / interface PCIe dual-slot accelerator card
Interface PCIe Gen5 x16
TDP 350 W
NVLink 600 GB/s NVLink Bridge
NVSwitch Non pris en charge
MIG Jusqu’à 7 MIG @ 10 Go
GPU max par nœud 8

Logiciel

CUDA Pris en charge
Vérification OFFICIAL_VENDOR
Source www.nvidia.com

Adéquation aux charges

  • Inférence LLMTrès bon
  • Fine-tuning LLMTrès bon
  • Entraînement completTrès bon
  • Génération image / vidéoTrès bon
  • Embeddings / rerankingExcellent

Frameworks

  • PyTorch
  • TensorFlow
  • JAX
  • Hugging Face
  • vLLM
  • TensorRT
  • ONNX Runtime
  • CUDA

Guide de compatibilité modèle

Inférence 7B/8B

Recommandé

Inférence 13B/14B

Recommandé avec quantification ou analyse de marge FP16/BF16

Inférence 30B/32B

Recommandé avec quantification pour garder une marge de production

Inférence 65B/70B

Recommandé pour inférence quantifiée ; vérifier contexte et concurrence

Fine-tuning

Adapté à LoRA/QLoRA ; le fine-tuning complet dépend du modèle et de la topologie

Grand entraînement

Utiliser des nœuds multi-GPU avec topologie à haute bande passante

GPU associés

FAQ hébergement GPU IA

Ce GPU convient-il à l’inférence LLM ?

L’adéquation dépend du modèle, de la précision, du contexte et de la concurrence. Utilisez le recommandateur pour dimensionner avec marge.

Comment le prix mensuel est-il calculé ?

Le prix mensuel public est la version de prix autorisée. L’équivalent horaire est dérivé du prix mensuel sur une base de 730 heures.

Puis-je louer plusieurs GPU ?

Les configurations multi-GPU sont possibles lorsque l’inventaire et la topologie du nœud le permettent.