7B/8B inference
अनुशंसित
NVIDIA · Ada Lovelace
छोटे मॉडल inference, embeddings, reranking, development और लागत-संवेदनशील AI सेवाओं के लिए कुशल।
मासिक किराया
~ USD 0.34/घंटा 730 घंटे के महीने पर आधारित
उपलब्धता: Available
GPU तुलना करें| विक्रेता | NVIDIA |
|---|---|
| मॉडल | NVIDIA L4 24GB |
| SKU | L4 |
| Architecture | Ada Lovelace |
| हार्डवेयर श्रेणी | datacenter gpu |
| VRAM | 24 GB |
|---|---|
| मेमोरी प्रकार | GDDR6 |
| मेमोरी बैंडविड्थ | 300 GB/s |
| प्रिसिजन | घना | स्पार्सिटी सहित |
|---|---|---|
| FP32 | 30.3 TFLOPS | — |
| TF32 Tensor | 60 TFLOPS | 120 TFLOPS |
| BF16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP8 Tensor | 242.5 TFLOPS | 485 TFLOPS |
| INT8 Tensor | 242.5 TOPS | 485 TOPS |
| फॉर्म फैक्टर / इंटरफ़ेस | PCIe low-profile accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 72 W |
| NVLink | समर्थित नहीं |
| NVSwitch | समर्थित नहीं |
| MIG | समर्थित नहीं |
| प्रति नोड अधिकतम GPU | 8 |
| CUDA | समर्थित |
|---|---|
| सत्यापन | OFFICIAL_VENDOR |
| स्रोत | www.nvidia.com |
अनुशंसित
quantisation या FP16/BF16 headroom समीक्षा के साथ अनुशंसित
सीमित
आम तौर पर कई GPU या अधिक मजबूत quantisation चाहिए
छोटी या adapted workloads तक सीमित
बड़े distributed training के लिए प्राथमिक विकल्प नहीं
48 GB GDDR6 ECC · Available
USD 506/माह
80 GB HBM3 · Available
USD 1,860/माह
80 GB HBM2e · Limited capacity
USD 1,579/माह
उपयुक्तता मॉडल, प्रिसीजन, कॉन्टेक्स्ट और समवर्ती उपयोग पर निर्भर है. मार्जिन के साथ सुझाव इंजन उपयोग करें.
सार्वजनिक मासिक मूल्य स्वीकृत मूल्य संस्करण है. घंटे का समतुल्य 730 घंटे के आधार पर निकाला जाता है.
जब इन्वेंटरी और नोड टोपोलॉजी अनुमति दें, multi-GPU कॉन्फ़िगरेशन उपलब्ध हैं.