7B/8B inference
अनुशंसित
NVIDIA · Hopper
quantized 70B inference, LoRA fine-tuning और high-throughput serving के लिए मजबूत विकल्प।
मासिक किराया
~ USD 2.16/घंटा 730 घंटे के महीने पर आधारित
उपलब्धता: Limited capacity
GPU तुलना करें| विक्रेता | NVIDIA |
|---|---|
| मॉडल | NVIDIA H100 PCIe 80GB |
| SKU | H100 PCIe |
| Architecture | Hopper |
| हार्डवेयर श्रेणी | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| मेमोरी प्रकार | HBM2e |
| मेमोरी बैंडविड्थ | 2000 GB/s |
| प्रिसिजन | घना | स्पार्सिटी सहित |
|---|---|---|
| FP64 | 26 TFLOPS | — |
| FP64 Tensor | 51 TFLOPS | — |
| FP32 | 51 TFLOPS | — |
| TF32 Tensor | 378 TFLOPS | 756 TFLOPS |
| BF16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP8 Tensor | 1513 TFLOPS | 3026 TFLOPS |
| INT8 Tensor | 1513 TOPS | 3026 TOPS |
| फॉर्म फैक्टर / इंटरफ़ेस | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen5 x16 |
| TDP | 350 W |
| NVLink | 600 GB/s NVLink Bridge |
| NVSwitch | समर्थित नहीं |
| MIG | 7 MIG तक @ 10 GB |
| प्रति नोड अधिकतम GPU | 8 |
| CUDA | समर्थित |
|---|---|
| सत्यापन | OFFICIAL_VENDOR |
| स्रोत | www.nvidia.com |
अनुशंसित
quantisation या FP16/BF16 headroom समीक्षा के साथ अनुशंसित
production headroom के लिए quantisation के साथ अनुशंसित
quantised inference के लिए अनुशंसित; context और concurrency की समीक्षा करें
LoRA/QLoRA के लिए उपयुक्त; full fine-tuning model size और topology पर निर्भर है
high-bandwidth topology वाले multi-GPU nodes उपयोग करें
80 GB HBM3 · Available
USD 1,860/माह
80 GB HBM2e · Available
USD 915/माह
48 GB GDDR6 ECC · Available
USD 506/माह
उपयुक्तता मॉडल, प्रिसीजन, कॉन्टेक्स्ट और समवर्ती उपयोग पर निर्भर है. मार्जिन के साथ सुझाव इंजन उपयोग करें.
सार्वजनिक मासिक मूल्य स्वीकृत मूल्य संस्करण है. घंटे का समतुल्य 730 घंटे के आधार पर निकाला जाता है.
जब इन्वेंटरी और नोड टोपोलॉजी अनुमति दें, multi-GPU कॉन्फ़िगरेशन उपलब्ध हैं.