Инференс 7B/8B
Рекомендуется
NVIDIA · Ada Lovelace
Эффективно для малых моделей, embeddings, reranking, разработки и сервисов с ограниченным бюджетом.
Месячная аренда
~ USD 0.34/час из расчета 730 часов в месяц
Доступность: Available
Сравнить GPU| Поставщик | NVIDIA |
|---|---|
| Модель | NVIDIA L4 24GB |
| SKU | L4 |
| Architecture | Ada Lovelace |
| Класс оборудования | datacenter gpu |
| VRAM | 24 GB |
|---|---|
| Тип памяти | GDDR6 |
| Пропускная способность памяти | 300 GB/s |
| Точность | Плотный режим | С разреженностью |
|---|---|---|
| FP32 | 30.3 TFLOPS | — |
| TF32 Tensor | 60 TFLOPS | 120 TFLOPS |
| BF16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP8 Tensor | 242.5 TFLOPS | 485 TFLOPS |
| INT8 Tensor | 242.5 TOPS | 485 TOPS |
| Форм-фактор / интерфейс | PCIe low-profile accelerator card |
|---|---|
| Интерфейс | PCIe Gen4 x16 |
| TDP | 72 W |
| NVLink | Не поддерживается |
| NVSwitch | Не поддерживается |
| MIG | Не поддерживается |
| Макс. GPU на узел | 8 |
| CUDA | Поддерживается |
|---|---|
| Проверка | OFFICIAL_VENDOR |
| Источник | www.nvidia.com |
Рекомендуется
Рекомендуется с квантованием или проверкой запаса FP16/BF16
Ограничено
Обычно требует несколько GPU или более сильное квантование
Ограничено малыми или адаптированными нагрузками
Не основной вариант для крупного распределенного обучения
48 GB GDDR6 ECC · Available
USD 506/месяц
80 GB HBM3 · Available
USD 1,860/месяц
80 GB HBM2e · Limited capacity
USD 1,579/месяц
Подходит зависит от модели, точности, длины контекста и параллельности. Используйте рекомендатель для расчета с запасом.
Публичная месячная цена является одобренной версией цены. Почасовой эквивалент выводится из 730 часов в месяц.
Multi-GPU конфигурации доступны, если позволяют инвентарь и топология узла.