Inferência 7B/8B
Recomendado
NVIDIA · Ada Lovelace
Eficiente para modelos pequenos, embeddings, reranking, desenvolvimento e serviços sensíveis ao custo.
Aluguer mensal
~ USD 0.34/hora com base num mês de 730 horas
Disponibilidade: Disponível
Comparar GPUs| Fornecedor | NVIDIA |
|---|---|
| Modelo | NVIDIA L4 24GB |
| SKU | L4 |
| Architecture | Ada Lovelace |
| Classe de hardware | datacenter gpu |
| VRAM | 24 GB |
|---|---|
| Tipo de memória | GDDR6 |
| Largura de banda da memória | 300 GB/s |
| Precisão | Denso | Com esparsidade |
|---|---|---|
| FP32 | 30.3 TFLOPS | — |
| TF32 Tensor | 60 TFLOPS | 120 TFLOPS |
| BF16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP8 Tensor | 242.5 TFLOPS | 485 TFLOPS |
| INT8 Tensor | 242.5 TOPS | 485 TOPS |
| Formato / interface | PCIe low-profile accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 72 W |
| NVLink | Não suportado |
| NVSwitch | Não suportado |
| MIG | Não suportado |
| GPU máx. por nó | 8 |
| CUDA | Suportado |
|---|---|
| Verificação | OFFICIAL_VENDOR |
| Fonte | www.nvidia.com |
Recomendado
Recomendado com quantização ou revisão de margem FP16/BF16
Limitado
Normalmente requer várias GPU ou quantização mais forte
Limitado a cargas pequenas ou adaptadas
Não é a escolha principal para treino distribuído grande
48 GB GDDR6 ECC · Disponível
USD 506/mês
80 GB HBM3 · Disponível
USD 1,860/mês
80 GB HBM2e · Capacidade limitada
USD 1,579/mês
A adequação depende do modelo, precisão, contexto e concorrência. Use o recomendador para dimensionar com margem.
O preço mensal público é a versão de preço autorizada. O equivalente horário deriva do preço mensal com base em 730 horas.
Configurações multi-GPU são possíveis quando o inventário e a topologia do nó permitem.