Saltar al contenido principal

GLM · Rápido · GLM-5.3

GLM-5.3-Flash: especificaciones, GPU, hosting y despliegue

GLM-5.3-Flash es una versión Actual de la línea Rápido de GLM, certificada desde su revisión oficial.

Ilustración técnica de despliegue para GLM-5.3-Flash
Flujo de referencia; los datos exactos se muestran aparte.
Parámetros totales320,0B
Parámetros activos18,0B
Ventana de contexto1.048.576 tokens
Estado de versiónActual · Actual
ArquitecturaGlm5NextForConditionalGeneration
ModalidadesTexto, Imagen
LicenciaLicencia MIT
Estado de despliegueDesplegable con una configuración certificada
Estado comercialUso comercial permitido
Fecha de lanzamiento2026-08-25

Arquitectura, fortalezas y usos

GLM-5.3-Flash es una versión oficial autoalojable de Z.ai en la línea GLM Rápido. Usa Glm5NextForConditionalGeneration con 320B / 18B MoE y un contexto verificado de 1,048,576 tokens.

GLM-5.3-Flash usa Glm5NextForConditionalGeneration con 320B / 18B MoE. El perfil registra 45 capas, ancho oculto 4096 y 64 cabezas de atención cuando se publican.

Arquitectura Glm5NextForConditionalGeneration verificada
Contexto certificado de 1,048,576 tokens
Proveniencia oficial del checkpoint
Inferencia LLM privada
Flujos con agentes
Documentos de contexto largo

Checkpoints y cuantizaciones certificados

Solo se muestran variantes exactas, vinculadas a esta versión y certificadas por su fuente.

GLM-5.3-Flash

zai-org/GLM-5.3-Flash

Oficial · FP8 · safetensors

Entorno de ejecución certificado: Transformers vLLM SGLang Tokenspeed KTransformers

Precisión / cuantizaciónFormatoBitsConfianza del editorEstado de despliegue
FP8safetensors8OficialEntorno de ejecución certificado

GLM-5.3-Flash

ZhipuAI/GLM-5.3-Flash

Oficial · Desconocido · unknown

Precisión / cuantizaciónFormatoBitsConfianza del editorEstado de despliegue

Hardware recomendado

Use solo configuraciones de entorno de ejecución certificadas con la precisión exacta. El ranking comprueba pesos, caché KV, sobrecarga, arquitectura GPU y topología.

Memoria estimada de pesos306.96 GB
KV cache11.25 GB
Sobrecarga del entorno de ejecución102.59 GB
Total con margen de seguridad521.8 GB
Dimensionamiento de referencia técnicamente compatible

Ningún inventario actual de FusionPointAI cumple todos los requisitos de entorno de ejecución, arquitectura, topología y memoria para este checkpoint. Use el estimador para hardware compatible global.

Licencia y autoalojamiento

Los 320 B de pesos residentes deben caber en las GPU. Contexto y concurrencia añaden caché KV.

GLM-5.3-Flash se publica bajo Licencia MIT. Se conservan la URL oficial y la fecha de verificación.

Uso comercial permitido. La licencia oficial permite el uso comercial; todas sus obligaciones siguen vigentes.

Alternativas y variantes hermanas

GLM-4.7 Flash, GLM-5.3-Flash

Cronología de la versión

zai/glm/glm-5-3-flash @ 925c6647cbf1c9ad3acc32541ac622ff5c77ca509cb2dd2ad949e53edeceeaac

Fuente oficial

ZhipuAI/GLM-5.3-Flash @ 2026-08-31T12:52:00Z

Fuente oficial

Preguntas frecuentes

¿Cuánta VRAM requiere GLM-5.3-Flash?

La estimación depende de precisión, contexto y concurrencia y usa datos certificados.

¿Qué entornos de ejecución admiten GLM-5.3-Flash?

Hay pruebas oficiales certificadas para transformers, vllm, sglang, tokenspeed, ktransformers.

¿Puede usarse GLM-5.3-Flash comercialmente?

La clasificación es Uso comercial permitido. Consulte los términos oficiales de Licencia MIT.

Referencias oficiales

Última verificación: 2026-08-26