7B/8B 推論
推奨
NVIDIA · Hopper
量子化 70B 推論、LoRA ファインチューニング、高スループット serving に適します。
| ベンダー | NVIDIA |
|---|---|
| モデル | NVIDIA H100 PCIe 80GB |
| SKU | H100 PCIe |
| Architecture | Hopper |
| ハードウェア種別 | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| メモリ種別 | HBM2e |
| メモリ帯域幅 | 2000 GB/s |
| 精度 | 密 | スパース有効 |
|---|---|---|
| FP64 | 26 TFLOPS | — |
| FP64 Tensor | 51 TFLOPS | — |
| FP32 | 51 TFLOPS | — |
| TF32 Tensor | 378 TFLOPS | 756 TFLOPS |
| BF16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP16 Tensor | 756.5 TFLOPS | 1513 TFLOPS |
| FP8 Tensor | 1513 TFLOPS | 3026 TFLOPS |
| INT8 Tensor | 1513 TOPS | 3026 TOPS |
| フォームファクタ / インターフェース | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen5 x16 |
| TDP | 350 W |
| NVLink | 600 GB/s NVLink Bridge |
| NVSwitch | 非対応 |
| MIG | 最大 7 MIG(10 GB) |
| ノードあたり最大 GPU 数 | 8 |
| CUDA | 対応 |
|---|---|
| 検証 | OFFICIAL_VENDOR |
| 出典 | www.nvidia.com |
推奨
量子化、または FP16/BF16 の余裕確認を推奨
本番余裕を保つため量子化を推奨
量子化推論に推奨。コンテキストと同時実行数を確認してください
LoRA/QLoRA に適合。フルファインチューニングはモデルサイズとトポロジに依存します
高帯域トポロジの multi-GPU ノードを使用してください
80 GB HBM3 · Available
USD 1,860/月
80 GB HBM2e · Available
USD 915/月
48 GB GDDR6 ECC · Available
USD 506/月
適性はモデル、精度、コンテキスト、同時実行数に依存します。余裕を含めて推奨機能で確認してください。
公開月額価格は承認済み価格バージョンです。時間換算は 730 時間ベースで月額から算出します。
在庫とノードトポロジが許す場合、複数 GPU 構成に対応します。