7B/8B 推論
推奨
NVIDIA · Ada Lovelace
中規模 LLM、画像生成、コンピュータビジョン、コスト重視の本番推論に適します。
| ベンダー | NVIDIA |
|---|---|
| モデル | NVIDIA L40S 48GB |
| SKU | L40S |
| Architecture | Ada Lovelace |
| ハードウェア種別 | datacenter gpu |
| VRAM | 48 GB |
|---|---|
| メモリ種別 | GDDR6 ECC |
| メモリ帯域幅 | 864 GB/s |
| 精度 | 密 | スパース有効 |
|---|---|---|
| FP32 | 91.6 TFLOPS | — |
| TF32 Tensor | 183 TFLOPS | 366 TFLOPS |
| BF16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP16 Tensor | 362.05 TFLOPS | 733 TFLOPS |
| FP8 Tensor | 733 TFLOPS | 1466 TFLOPS |
| INT8 Tensor | 733 TOPS | 1466 TOPS |
| フォームファクタ / インターフェース | PCIe dual-slot accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 350 W |
| NVLink | 非対応 |
| NVSwitch | 非対応 |
| MIG | 非対応 |
| ノードあたり最大 GPU 数 | 8 |
| CUDA | 対応 |
|---|---|
| 検証 | OFFICIAL_VENDOR |
| 出典 | www.nvidia.com |
推奨
量子化、または FP16/BF16 の余裕確認を推奨
本番余裕を保つため量子化を推奨
通常は複数 GPU または強い量子化が必要です
LoRA/QLoRA に適合。フルファインチューニングはモデルサイズとトポロジに依存します
大規模分散学習の主用途ではありません
24 GB GDDR6 · Available
USD 250/月
80 GB HBM3 · Available
USD 1,860/月
80 GB HBM2e · Limited capacity
USD 1,579/月
適性はモデル、精度、コンテキスト、同時実行数に依存します。余裕を含めて推奨機能で確認してください。
公開月額価格は承認済み価格バージョンです。時間換算は 730 時間ベースで月額から算出します。
在庫とノードトポロジが許す場合、複数 GPU 構成に対応します。