7B/8B 推論
推奨
NVIDIA · Ampere
量子化 70B 推論、LoRA ファインチューニング、高スループット serving に適します。
| ベンダー | NVIDIA |
|---|---|
| モデル | NVIDIA A100 SXM 80GB |
| SKU | A100 SXM 80GB |
| Architecture | Ampere |
| ハードウェア種別 | datacenter gpu |
| VRAM | 80 GB |
|---|---|
| メモリ種別 | HBM2e |
| メモリ帯域幅 | 2039 GB/s |
| 精度 | 密 | スパース有効 |
|---|---|---|
| FP64 | 9.7 TFLOPS | — |
| FP64 Tensor | 19.5 TFLOPS | — |
| FP32 | 19.5 TFLOPS | — |
| TF32 Tensor | 156 TFLOPS | 312 TFLOPS |
| BF16 Tensor | 312 TFLOPS | 624 TFLOPS |
| FP16 Tensor | 312 TFLOPS | 624 TFLOPS |
| INT8 Tensor | 624 TOPS | 1248 TOPS |
| フォームファクタ / インターフェース | SXM module |
|---|---|
| Interface | PCIe Gen4 x16 host interface |
| TDP | 400 W |
| NVLink | 600 GB/s NVLink |
| NVSwitch | 対応 |
| MIG | 最大 7 MIG(10 GB) |
| ノードあたり最大 GPU 数 | 8 |
| CUDA | 対応 |
|---|---|
| 検証 | OFFICIAL_VENDOR |
| 出典 | www.nvidia.com |
推奨
量子化、または FP16/BF16 の余裕確認を推奨
本番余裕を保つため量子化を推奨
量子化推論に推奨。コンテキストと同時実行数を確認してください
LoRA/QLoRA に適合。フルファインチューニングはモデルサイズとトポロジに依存します
高帯域トポロジの multi-GPU ノードを使用してください
80 GB HBM3 · Available
USD 1,860/月
80 GB HBM2e · Limited capacity
USD 1,579/月
48 GB GDDR6 ECC · Available
USD 506/月
適性はモデル、精度、コンテキスト、同時実行数に依存します。余裕を含めて推奨機能で確認してください。
公開月額価格は承認済み価格バージョンです。時間換算は 730 時間ベースで月額から算出します。
在庫とノードトポロジが許す場合、複数 GPU 構成に対応します。