7B/8B 推理
推荐
NVIDIA · Ada Lovelace
适合小模型推理、embedding、reranking、开发和成本敏感 AI 服务。
| 供应商 | NVIDIA |
|---|---|
| 型号 | NVIDIA L4 24GB |
| SKU | L4 |
| Architecture | Ada Lovelace |
| 硬件类别 | datacenter gpu |
| VRAM | 24 GB |
|---|---|
| 内存类型 | GDDR6 |
| 内存带宽 | 300 GB/s |
| 精度 | 密集 | 启用稀疏 |
|---|---|---|
| FP32 | 30.3 TFLOPS | — |
| TF32 Tensor | 60 TFLOPS | 120 TFLOPS |
| BF16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP16 Tensor | 121 TFLOPS | 242 TFLOPS |
| FP8 Tensor | 242.5 TFLOPS | 485 TFLOPS |
| INT8 Tensor | 242.5 TOPS | 485 TOPS |
| 外形 / 接口 | PCIe low-profile accelerator card |
|---|---|
| Interface | PCIe Gen4 x16 |
| TDP | 72 W |
| NVLink | 不支持 |
| NVSwitch | 不支持 |
| MIG | 不支持 |
| 每节点最大 GPU 数 | 8 |
| CUDA | 支持 |
|---|---|
| 验证 | OFFICIAL_VENDOR |
| 来源 | www.nvidia.com |
推荐
建议使用量化,或检查 FP16/BF16 余量
有限
通常需要多块 GPU 或更强量化
仅适合小型或适配后的工作负载
不是大规模分布式训练的首选
48 GB GDDR6 ECC · Available
USD 506/月
80 GB HBM3 · Available
USD 1,860/月
80 GB HBM2e · Limited capacity
USD 1,579/月
适配度取决于模型、精度、上下文和并发。请使用推荐器按余量计算。
公开月租是已授权价格版本。小时等价从月价按 730 小时换算。
当库存和节点拓扑允许时,可以提供多 GPU 配置。