GLM-4.7-Flash
公式 · BF16 · safetensors
検証済み実行環境: SGLang Transformers
| 精度 / 量子化 | 形式 | ビット | 公開元の信頼区分 | デプロイ状態 |
|---|---|---|---|---|
| BF16 | safetensors | 16 | 公式 | 検証済み実行環境 |
GLM · 高速 · GLM-4.7
GLM-4.7 Flash は GLM の高速系列に属するレガシーバージョンで、公式リビジョンから検証されています。
GLM-4.7 Flash は Z.ai の公式セルフホスト版で、GLM 高速系列、Glm4MoeLiteForCausalLM、30B / 3B MoE、検証済み 202,752 トークンコンテキストを備えます。
GLM-4.7 Flash は Glm4MoeLiteForCausalLM と 30B / 3B MoE を使用します。公開されている場合は 47 層、隠れ幅 2048、注意ヘッド 20 を記録します。
このバージョンに紐づく、情報源で検証済みの正確なバリアントだけを表示します。
公式 · BF16 · safetensors
検証済み実行環境: SGLang Transformers
| 精度 / 量子化 | 形式 | ビット | 公開元の信頼区分 | デプロイ状態 |
|---|---|---|---|---|
| BF16 | safetensors | 16 | 公式 | 検証済み実行環境 |
正確なチェックポイント精度に対応する検証済みランタイム構成だけを使用します。重み、KV キャッシュ、負荷、GPU アーキテクチャ、トポロジを確認します。
推奨コストパフォーマンス
160 GB 合計 VRAM · nvlink
65.65 GB 余裕 · 利用可能
USD 1,830 / 月最安の適合構成
96 GB 合計 VRAM · pcie
1.65 GB 余裕 · 利用可能
USD 1,000 / 月最高性能
160 GB 合計 VRAM · nvlink
65.65 GB 余裕 · 利用可能
USD 1,830 / 月30 B の常駐重み全体が選択 GPU に収まる必要があります。コンテキストと同時実行で KV キャッシュが増えます。
GLM-4.7 Flash は mit で公開され、公式 URL と検証日を保持します。
商用利用可. 公式ライセンスは商用利用を許可していますが、すべての義務は引き続き適用されます。
GLM-5.3-Flash
精度、コンテキスト、同時実行数に依存し、認証済みデータで計算します。
sglang, transformers の公式証拠が認証されています。
保存区分は商用利用可です。公式 mit 条件を確認してください。
最終検証日: 2026-09-03