Inferência 7B/8B
Recomendado
NVIDIA · Hopper
Forte para inferência 70B quantizada, fine-tuning LoRA e serving de alto débito.
Aluguer mensal
~ USD 2.16/hora com base num mês de 730 horas
Disponibilidade: Capacidade limitada
Comparar GPUs| Fornecedor | NVIDIA |
|---|---|
| Modelo | NVIDIA H100 PCIe 80GB |
| SKU | H100 PCIe |
| Architecture | Hopper |
| Classe de hardware | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Tipo de memória | HBM2e |
| Largura de banda da memória | 2000 GB/s |
| Precisão | Denso | Com esparsidade |
|---|---|---|
| FP64 | 26 TFLOPS | — |
| FP64 Tensor | 51 TFLOPS | — |
| FP32 | 51 TFLOPS | — |
| TF32 Tensor | 378 TFLOPS | 756 TFLOPS |
| BF16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP8 Tensor | 1513 TFLOPS | 3026 TFLOPS |
| INT8 Tensor | 1513 TOPS | 3026 TOPS |
| Formato / interface | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen5 x16 |
| TDP | 350 W |
| NVLink | 600 GB/s NVLink Bridge |
| NVSwitch | Não suportado |
| MIG | Até 7 MIGs de 10 GB |
| GPU máx. por nó | 8 |
| CUDA | Suportado |
|---|---|
| Verificação | OFFICIAL_VENDOR |
| Fonte | www.nvidia.com |
Recomendado
Recomendado com quantização ou revisão de margem FP16/BF16
Recomendado com quantização para manter margem de produção
Recomendado para inferência quantizada; rever contexto e concorrência
Adequado para LoRA/QLoRA; o fine-tuning completo depende do modelo e da topologia
Use nós multi-GPU com topologia de alta largura de banda
80 GB HBM3 · Disponível
USD 1,860/mês
80 GB HBM2e · Disponível
USD 915/mês
48 GB GDDR6 ECC · Disponível
USD 506/mês
A adequação depende do modelo, precisão, contexto e concorrência. Use o recomendador para dimensionar com margem.
O preço mensal público é a versão de preço autorizada. O equivalente horário deriva do preço mensal com base em 730 horas.
Configurações multi-GPU são possíveis quando o inventário e a topologia do nó permitem.