Arquitetura, vantagens e usos
GLM-5.3-Flash é uma versão oficial autoalojável da Z.ai na linha GLM Rápido. Usa Glm5NextForConditionalGeneration com 320B / 18B MoE e contexto verificado de 1,048,576 tokens.
GLM-5.3-Flash usa Glm5NextForConditionalGeneration com 320B / 18B MoE. O perfil regista 45 camadas, largura 4096 e 64 cabeças de atenção quando publicados.
Arquitetura Glm5NextForConditionalGeneration verificada
Contexto certificado de 1,048,576 tokens
Proveniência oficial do checkpoint
Inferência LLM privada
Fluxos de agentes
Documentos de contexto longo