Inferência 7B/8B
Recomendado
NVIDIA · Ada Lovelace
Equilibrado para LLMs médios, geração de imagem, visão computacional e inferência de produção.
Aluguer mensal
~ USD 0.69/hora com base num mês de 730 horas
Disponibilidade: Disponível
Comparar GPUs| Fornecedor | NVIDIA |
|---|---|
| Modelo | NVIDIA L40S 48GB |
| SKU | L40S |
| Architecture | Ada Lovelace |
| Classe de hardware | datacenter gpu |
| VRAM | 48 GB |
|---|---|
| Tipo de memória | GDDR6 ECC |
| Largura de banda da memória | 864 GB/s |
| Precisão | Denso | Com esparsidade |
|---|---|---|
| FP32 | 91.6 TFLOPS | — |
| TF32 Tensor | 183 TFLOPS | 366 TFLOPS |
| BF16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP8 Tensor | 733 TFLOPS | 1466 TFLOPS |
| INT8 Tensor | 733 TOPS | 1466 TOPS |
| Formato / interface | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 350 W |
| NVLink | Não suportado |
| NVSwitch | Não suportado |
| MIG | Não suportado |
| GPU máx. por nó | 8 |
| CUDA | Suportado |
|---|---|
| Verificação | OFFICIAL_VENDOR |
| Fonte | www.nvidia.com |
Recomendado
Recomendado com quantização ou revisão de margem FP16/BF16
Recomendado com quantização para manter margem de produção
Normalmente requer várias GPU ou quantização mais forte
Adequado para LoRA/QLoRA; o fine-tuning completo depende do modelo e da topologia
Não é a escolha principal para treino distribuído grande
24 GB GDDR6 · Disponível
USD 250/mês
80 GB HBM3 · Disponível
USD 1,860/mês
80 GB HBM2e · Capacidade limitada
USD 1,579/mês
A adequação depende do modelo, precisão, contexto e concorrência. Use o recomendador para dimensionar com margem.
O preço mensal público é a versão de preço autorizada. O equivalente horário deriva do preço mensal com base em 730 horas.
Configurações multi-GPU são possíveis quando o inventário e a topologia do nó permitem.