Inferencia 7B/8B
Recomendado
NVIDIA · Hopper
Adecuado para inferencia 70B cuantizada, fine-tuning LoRA y servicio de alto rendimiento.
Alquiler mensual
~ USD 2.16/hora basado en un mes de 730 horas
Disponibilidad: Limited capacity
Comparar GPUs| Proveedor | NVIDIA |
|---|---|
| Modelo | NVIDIA H100 PCIe 80GB |
| SKU | H100 PCIe |
| Architecture | Hopper |
| Clase de hardware | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| Tipo de memoria | HBM2e |
| Ancho de banda de memoria | 2000 GB/s |
| Precisión | Denso | Con dispersión |
|---|---|---|
| FP64 | 26 TFLOPS | — |
| FP64 Tensor | 51 TFLOPS | — |
| FP32 | 51 TFLOPS | — |
| TF32 Tensor | 378 TFLOPS | 756 TFLOPS |
| BF16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP8 Tensor | 1513 TFLOPS | 3026 TFLOPS |
| INT8 Tensor | 1513 TOPS | 3026 TOPS |
| Formato / interfaz | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen5 x16 |
| TDP | 350 W |
| NVLink | 600 GB/s NVLink Bridge |
| NVSwitch | No compatible |
| MIG | Hasta 7 MIG de 10 GB |
| GPU máx. por nodo | 8 |
| CUDA | Compatible |
|---|---|
| Verificación | OFFICIAL_VENDOR |
| Fuente | www.nvidia.com |
Recomendado
Recomendado con cuantización o revisión de margen FP16/BF16
Recomendado con cuantización para mantener margen de producción
Recomendado para inferencia cuantizada; revise contexto y concurrencia
Adecuado para LoRA/QLoRA; el fine-tuning completo depende del modelo y la topología
Use nodos multi-GPU con topología de alto ancho de banda
80 GB HBM3 · Available
USD 1,860/mes
80 GB HBM2e · Available
USD 915/mes
48 GB GDDR6 ECC · Available
USD 506/mes
La idoneidad depende del modelo, precisión, contexto y concurrencia. Use el recomendador para dimensionar con margen.
El precio mensual público es la versión autorizada. El equivalente por hora deriva del precio mensual con una base de 730 horas.
Las configuraciones multi-GPU son posibles cuando el inventario y la topología del nodo lo permiten.