跳到主要内容

GLM · 快速 · GLM-5.3

GLM-5.3-Flash:规格、GPU 需求、托管与部署

GLM-5.3-Flash 是 GLM 家族快速分支中的当前版本,并由官方修订认证。

GLM-5.3-Flash 技术部署示意图
参考部署流程;精确架构事实另行列出。
总参数320.0B
激活参数18.0B
上下文窗口1,048,576 tokens
版本状态当前 · 当前
架构Glm5NextForConditionalGeneration
模态文本, 图像
许可证MIT 许可证
部署状态具备认证配置,可部署
商业状态允许商业使用
发布日期2026-08-25

架构、优势与用途

GLM-5.3-Flash 是 Z.ai 在 GLM 快速分支中的官方可自托管版本,采用 Glm5NextForConditionalGeneration、320B / 18B MoE,认证上下文为 1,048,576 词元。

GLM-5.3-Flash 使用 Glm5NextForConditionalGeneration 和 320B / 18B MoE。官方资料发布时记录 45 层、隐藏维度 4096 和 64 个注意力头。

已验证的 Glm5NextForConditionalGeneration 架构
1,048,576 词元认证上下文
官方检查点来源
私有 LLM 推理
智能体工作流
长文档处理

已认证检查点与量化

仅显示与此版本关联并经来源认证的精确变体。

GLM-5.3-Flash

zai-org/GLM-5.3-Flash

官方 · FP8 · safetensors

已验证运行环境: Transformers vLLM SGLang Tokenspeed KTransformers

精度 / 量化格式位数发布者可信度部署状态
FP8safetensors8官方已验证运行环境

GLM-5.3-Flash

ZhipuAI/GLM-5.3-Flash

官方 · 未知 · unknown

精度 / 量化格式位数发布者可信度部署状态

推荐硬件

仅使用与精确检查点精度匹配的认证运行时组合。硬件排序会检查权重、KV 缓存、开销、GPU 架构与拓扑。

估算权重内存306.96 GB
KV 缓存11.25 GB
运行时开销102.59 GB
含安全余量总计521.8 GB
技术兼容参考配置

当前 FusionPointAI 库存没有同时通过此检查点的运行时、架构、拓扑和内存检查。请使用估算器查看全球兼容硬件。

许可证与自托管注意事项

全部 320 B 常驻权重必须装入所选 GPU;上下文与并发会增加 KV 缓存。

GLM-5.3-Flash 采用 MIT 许可证 发布,并保留版本级官方 URL 与验证日期。

允许商业使用. 官方许可允许商业使用,但仍须遵守其全部义务。

替代方案与同代变体

GLM-4.7 Flash, GLM-5.3-Flash

发布历程

zai/glm/glm-5-3-flash @ 925c6647cbf1c9ad3acc32541ac622ff5c77ca509cb2dd2ad949e53edeceeaac

官方来源

ZhipuAI/GLM-5.3-Flash @ 2026-08-31T12:52:00Z

官方来源

常见问题

GLM-5.3-Flash 需要多少 VRAM?

估算取决于精度、上下文和并发,并使用认证数据。

哪些运行时支持 GLM-5.3-Flash?

transformers, vllm, sglang, tokenspeed, ktransformers 已有认证的上游证据。

GLM-5.3-Flash 可用于商业用途吗?

存储分类为允许商业使用;请查阅官方 MIT 许可证 条款。

官方来源

最近验证: 2026-08-26