Inferência 7B/8B
Recomendado
NVIDIA · Hopper
Forte para inferência 70B quantizada, fine-tuning LoRA e serving de alto débito.
Aluguer mensal
~ USD 2.55/hora com base num mês de 730 horas
Disponibilidade: Disponível
Comparar GPUs| Fornecedor | NVIDIA |
|---|---|
| Modelo | NVIDIA H100 SXM 80GB |
| SKU | H100 SXM |
| Architecture | Hopper |
| Classe de hardware | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Tipo de memória | HBM3 |
| Largura de banda da memória | 3350 GB/s |
| Precisão | Denso | Com esparsidade |
|---|---|---|
| FP64 | 34 TFLOPS | — |
| FP64 Tensor | 67 TFLOPS | — |
| FP32 | 67 TFLOPS | — |
| TF32 Tensor | 494.5 TFLOPS | 989 TFLOPS |
| BF16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP8 Tensor | 1979 TFLOPS | 3958 TFLOPS |
| INT8 Tensor | 1979 TOPS | 3958 TOPS |
| Formato / interface | SXM module |
|---|---|
| Interface | PCIe Gen5 x16 host interface |
| TDP | 700 W |
| NVLink | 900 GB/s NVLink |
| NVSwitch | Suportado |
| MIG | Até 7 MIGs de 10 GB |
| GPU máx. por nó | 8 |
| CUDA | Suportado |
|---|---|
| Verificação | OFFICIAL_VENDOR |
| Fonte | www.nvidia.com |
Recomendado
Recomendado com quantização ou revisão de margem FP16/BF16
Recomendado com quantização para manter margem de produção
Recomendado para inferência quantizada; rever contexto e concorrência
Adequado para LoRA/QLoRA; o fine-tuning completo depende do modelo e da topologia
Use nós multi-GPU com topologia de alta largura de banda
80 GB HBM2e · Capacidade limitada
USD 1,579/mês
80 GB HBM2e · Disponível
USD 915/mês
48 GB GDDR6 ECC · Disponível
USD 506/mês
A adequação depende do modelo, precisão, contexto e concorrência. Use o recomendador para dimensionar com margem.
O preço mensal público é a versão de preço autorizada. O equivalente horário deriva do preço mensal com base em 730 horas.
Configurações multi-GPU são possíveis quando o inventário e a topologia do nó permitem.