7B/8B 推論
推奨
NVIDIA · Hopper
大規模モデル、長いコンテキスト、重いファインチューニング、高メモリ AI ワークロードに適します。
| ベンダー | NVIDIA |
|---|---|
| モデル | NVIDIA H200 SXM 141GB |
| SKU | H200 SXM |
| Architecture | Hopper |
| ハードウェア種別 | datacenter gpu |
| VRAM | 141 GB |
|---|---|
| メモリ種別 | HBM3e |
| メモリ帯域幅 | 4800 GB/s |
| 精度 | 密 | スパース有効 |
|---|---|---|
| FP64 | 34 TFLOPS | — |
| FP64 Tensor | 67 TFLOPS | — |
| FP32 | 67 TFLOPS | — |
| TF32 Tensor | 494.5 TFLOPS | 989 TFLOPS |
| BF16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP16 Tensor | 989.5 TFLOPS | 1979 TFLOPS |
| FP8 Tensor | 1979 TFLOPS | 3958 TFLOPS |
| INT8 Tensor | 1979 TOPS | 3958 TOPS |
| フォームファクタ / インターフェース | SXM module |
|---|---|
| Interface | PCIe Gen5 x16 host interface |
| TDP | 700 W |
| NVLink | 900 GB/s NVLink |
| NVSwitch | 対応 |
| MIG | 最大 7 MIG(18 GB) |
| ノードあたり最大 GPU 数 | 8 |
| CUDA | 対応 |
|---|---|
| 検証 | OFFICIAL_VENDOR |
| 出典 | www.nvidia.com |
推奨
量子化、または FP16/BF16 の余裕確認を推奨
本番余裕を保つため量子化を推奨
量子化推論に推奨。コンテキストと同時実行数を確認してください
LoRA/QLoRA に適合。フルファインチューニングはモデルサイズとトポロジに依存します
高帯域トポロジの multi-GPU ノードを使用してください
80 GB HBM3 · Available
USD 1,860/月
80 GB HBM2e · Limited capacity
USD 1,579/月
80 GB HBM2e · Available
USD 915/月
適性はモデル、精度、コンテキスト、同時実行数に依存します。余裕を含めて推奨機能で確認してください。
公開月額価格は承認済み価格バージョンです。時間換算は 730 時間ベースで月額から算出します。
在庫とノードトポロジが許す場合、複数 GPU 構成に対応します。