Arquitectura, fortalezas y usos
GLM-5.3-Flash es una versión oficial autoalojable de Z.ai en la línea GLM Rápido. Usa Glm5NextForConditionalGeneration con 320B / 18B MoE y un contexto verificado de 1,048,576 tokens.
GLM-5.3-Flash usa Glm5NextForConditionalGeneration con 320B / 18B MoE. El perfil registra 45 capas, ancho oculto 4096 y 64 cabezas de atención cuando se publican.
Arquitectura Glm5NextForConditionalGeneration verificada
Contexto certificado de 1,048,576 tokens
Proveniencia oficial del checkpoint
Inferencia LLM privada
Flujos con agentes
Documentos de contexto largo