7B/8B inference
अनुशंसित
NVIDIA · Ampere
quantized 70B inference, LoRA fine-tuning और high-throughput serving के लिए मजबूत विकल्प।
मासिक किराया
~ USD 1.25/घंटा 730 घंटे के महीने पर आधारित
उपलब्धता: Available
GPU तुलना करें| विक्रेता | NVIDIA |
|---|---|
| मॉडल | NVIDIA A100 SXM 80GB |
| SKU | A100 SXM 80GB |
| Architecture | Ampere |
| हार्डवेयर श्रेणी | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| मेमोरी प्रकार | HBM2e |
| मेमोरी बैंडविड्थ | 2039 GB/s |
| प्रिसिजन | घना | स्पार्सिटी सहित |
|---|---|---|
| FP64 | 9.7 TFLOPS | — |
| FP64 Tensor | 19.5 TFLOPS | — |
| FP32 | 19.5 TFLOPS | — |
| TF32 Tensor | 156 TFLOPS | 312 TFLOPS |
| BF16 Tensor | 312 TFLOPS | 624 TFLOPS |
| FP16 Tensor | 312 TFLOPS | 624 TFLOPS |
| INT8 Tensor | 624 TOPS | 1248 TOPS |
| फॉर्म फैक्टर / इंटरफ़ेस | SXM module |
|---|---|
| Interface | PCIe Gen4 x16 host interface |
| TDP | 400 W |
| NVLink | 600 GB/s NVLink |
| NVSwitch | समर्थित |
| MIG | 7 MIG तक @ 10 GB |
| प्रति नोड अधिकतम GPU | 8 |
| CUDA | समर्थित |
|---|---|
| सत्यापन | OFFICIAL_VENDOR |
| स्रोत | www.nvidia.com |
अनुशंसित
quantisation या FP16/BF16 headroom समीक्षा के साथ अनुशंसित
production headroom के लिए quantisation के साथ अनुशंसित
quantised inference के लिए अनुशंसित; context और concurrency की समीक्षा करें
LoRA/QLoRA के लिए उपयुक्त; full fine-tuning model size और topology पर निर्भर है
high-bandwidth topology वाले multi-GPU nodes उपयोग करें
80 GB HBM3 · Available
USD 1,860/माह
80 GB HBM2e · Limited capacity
USD 1,579/माह
48 GB GDDR6 ECC · Available
USD 506/माह
उपयुक्तता मॉडल, प्रिसीजन, कॉन्टेक्स्ट और समवर्ती उपयोग पर निर्भर है. मार्जिन के साथ सुझाव इंजन उपयोग करें.
सार्वजनिक मासिक मूल्य स्वीकृत मूल्य संस्करण है. घंटे का समतुल्य 730 घंटे के आधार पर निकाला जाता है.
जब इन्वेंटरी और नोड टोपोलॉजी अनुमति दें, multi-GPU कॉन्फ़िगरेशन उपलब्ध हैं.