Inferência 7B/8B
Recomendado
NVIDIA · Ampere
Forte para inferência 70B quantizada, fine-tuning LoRA e serving de alto débito.
Aluguer mensal
~ USD 1.25/hora com base num mês de 730 horas
Disponibilidade: Disponível
Comparar GPUs| Fornecedor | NVIDIA |
|---|---|
| Modelo | NVIDIA A100 SXM 80GB |
| SKU | A100 SXM 80GB |
| Architecture | Ampere |
| Classe de hardware | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Tipo de memória | HBM2e |
| Largura de banda da memória | 2039 GB/s |
| Precisão | Denso | Com esparsidade |
|---|---|---|
| FP64 | 9.7 TFLOPS | — |
| FP64 Tensor | 19.5 TFLOPS | — |
| FP32 | 19.5 TFLOPS | — |
| TF32 Tensor | 156 TFLOPS | 312 TFLOPS |
| BF16 Tensor | 312 TFLOPS | 624 TFLOPS |
| FP16 Tensor | 312 TFLOPS | 624 TFLOPS |
| INT8 Tensor | 624 TOPS | 1248 TOPS |
| Formato / interface | SXM module |
|---|---|
| Interface | PCIe Gen4 x16 host interface |
| TDP | 400 W |
| NVLink | 600 GB/s NVLink |
| NVSwitch | Suportado |
| MIG | Até 7 MIGs de 10 GB |
| GPU máx. por nó | 8 |
| CUDA | Suportado |
|---|---|
| Verificação | OFFICIAL_VENDOR |
| Fonte | www.nvidia.com |
Recomendado
Recomendado com quantização ou revisão de margem FP16/BF16
Recomendado com quantização para manter margem de produção
Recomendado para inferência quantizada; rever contexto e concorrência
Adequado para LoRA/QLoRA; o fine-tuning completo depende do modelo e da topologia
Use nós multi-GPU com topologia de alta largura de banda
80 GB HBM3 · Disponível
USD 1,860/mês
80 GB HBM2e · Capacidade limitada
USD 1,579/mês
48 GB GDDR6 ECC · Disponível
USD 506/mês
A adequação depende do modelo, precisão, contexto e concorrência. Use o recomendador para dimensionar com margem.
O preço mensal público é a versão de preço autorizada. O equivalente horário deriva do preço mensal com base em 730 horas.
Configurações multi-GPU são possíveis quando o inventário e a topologia do nó permitem.