7B/8B inference
अनुशंसित
NVIDIA · Hopper
quantized 70B inference, LoRA fine-tuning और high-throughput serving के लिए मजबूत विकल्प।
मासिक किराया
~ USD 2.55/घंटा 730 घंटे के महीने पर आधारित
उपलब्धता: Available
GPU तुलना करें| विक्रेता | NVIDIA |
|---|---|
| मॉडल | NVIDIA H100 SXM 80GB |
| SKU | H100 SXM |
| Architecture | Hopper |
| हार्डवेयर श्रेणी | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| मेमोरी प्रकार | HBM3 |
| मेमोरी बैंडविड्थ | 3350 GB/s |
| प्रिसिजन | घना | स्पार्सिटी सहित |
|---|---|---|
| FP64 | 34 TFLOPS | — |
| FP64 Tensor | 67 TFLOPS | — |
| FP32 | 67 TFLOPS | — |
| TF32 Tensor | 494.5 TFLOPS | 989 TFLOPS |
| BF16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP8 Tensor | 1979 TFLOPS | 3958 TFLOPS |
| INT8 Tensor | 1979 TOPS | 3958 TOPS |
| फॉर्म फैक्टर / इंटरफ़ेस | SXM module |
|---|---|
| Interface | PCIe Gen5 x16 host interface |
| TDP | 700 W |
| NVLink | 900 GB/s NVLink |
| NVSwitch | समर्थित |
| MIG | 7 MIG तक @ 10 GB |
| प्रति नोड अधिकतम GPU | 8 |
| CUDA | समर्थित |
|---|---|
| सत्यापन | OFFICIAL_VENDOR |
| स्रोत | www.nvidia.com |
अनुशंसित
quantisation या FP16/BF16 headroom समीक्षा के साथ अनुशंसित
production headroom के लिए quantisation के साथ अनुशंसित
quantised inference के लिए अनुशंसित; context और concurrency की समीक्षा करें
LoRA/QLoRA के लिए उपयुक्त; full fine-tuning model size और topology पर निर्भर है
high-bandwidth topology वाले multi-GPU nodes उपयोग करें
80 GB HBM2e · Limited capacity
USD 1,579/माह
80 GB HBM2e · Available
USD 915/माह
48 GB GDDR6 ECC · Available
USD 506/माह
उपयुक्तता मॉडल, प्रिसीजन, कॉन्टेक्स्ट और समवर्ती उपयोग पर निर्भर है. मार्जिन के साथ सुझाव इंजन उपयोग करें.
सार्वजनिक मासिक मूल्य स्वीकृत मूल्य संस्करण है. घंटे का समतुल्य 730 घंटे के आधार पर निकाला जाता है.
जब इन्वेंटरी और नोड टोपोलॉजी अनुमति दें, multi-GPU कॉन्फ़िगरेशन उपलब्ध हैं.