Pronto para engenharia
GLM-5.3-Flash FP8 Pacote de producao
GLM / GLM-5.3-Flash · FP8 · Estado de engenharia: Pronto para engenharia
Linhagem da transformacao
Lancamento baseGLM-5.3-Flash
Engenharia de modelosFP8 Quantizacao, Empacotamento de runtime, Avaliacao e benchmarking
Opcoes de entregaDescarregar pacote / Alojar com FusionPointAI / Descarregar + alojar
Preco transparente
- Engenharia do modelo baseUSD 95,700.00
- FP8 QuantizacaoUSD 5,900.00
- Empacotamento de runtimeUSD 2,800.00
- Avaliacao e benchmarkingUSD 3,600.00
- Descarregar pacoteUSD 1,500.00
- Configuracao de implantacao geridaUSD 3,200.00
- Engenharia unicaUSD 112,700.00
Alojamento mensal
- 3 x nvidia-h200-sxm-141gbUSD 7,035.00
- Alojamento mensalUSD 7,035.00
Quantizacao
OrigemOrigem
TransformationEstimado ate medicao durante a engenharia
Topologia de GPU
3 × nvidia-h200-sxm-141gb
transformers
Transferencia ou alojamento gerido
Artefacto, configuracao, tokenizador e somas de verificacao
Alocacao GPU, runtime, endpoint e monitorizacao