メインコンテンツへスキップ

GLM · 高速 · GLM-4.7

GLM-4.7 Flash:仕様、GPU 要件、ホスティング、デプロイ

GLM-4.7 Flash は GLM の高速系列に属するレガシーバージョンで、公式リビジョンから検証されています。

GLM-4.7 Flash の技術デプロイ図
参照デプロイフロー。正確なデータは別途記載します。
総パラメータ30.0B
有効パラメータ3.0B
コンテキスト長202,752 tokens
バージョン状態レガシー · レガシー
アーキテクチャGlm4MoeLiteForCausalLM
モダリティテキスト
ライセンスmit
デプロイ状態認証済み構成でデプロイ可能
商用状態商用利用可
公開日2026-01-19

アーキテクチャ、強み、用途

GLM-4.7 Flash は Z.ai の公式セルフホスト版で、GLM 高速系列、Glm4MoeLiteForCausalLM、30B / 3B MoE、検証済み 202,752 トークンコンテキストを備えます。

GLM-4.7 Flash は Glm4MoeLiteForCausalLM と 30B / 3B MoE を使用します。公開されている場合は 47 層、隠れ幅 2048、注意ヘッド 20 を記録します。

検証済み Glm4MoeLiteForCausalLM
202,752 トークンの検証済みコンテキスト
公式チェックポイント来歴
非公開 LLM 推論
エージェント処理
長文書処理

検証済みチェックポイントと量子化

このバージョンに紐づく、情報源で検証済みの正確なバリアントだけを表示します。

GLM-4.7-Flash

zai-org/GLM-4.7-Flash

公式 · BF16 · safetensors

検証済み実行環境: SGLang Transformers

精度 / 量子化形式ビット公開元の信頼区分デプロイ状態
BF16safetensors16公式検証済み実行環境

推奨ハードウェア

正確なチェックポイント精度に対応する検証済みランタイム構成だけを使用します。重み、KV キャッシュ、負荷、GPU アーキテクチャ、トポロジを確認します。

推定重みメモリ57.56 GB
KV キャッシュ2.93 GB
ランタイム負荷15.61 GB
安全余裕込み合計94.35 GB

推奨コストパフォーマンス

2× NVIDIA A100 SXM 80GB

160 GB 合計 VRAM · nvlink

65.65 GB 余裕 · 利用可能

USD 1,830 / 月

最安の適合構成

4× NVIDIA L4 24GB

96 GB 合計 VRAM · pcie

1.65 GB 余裕 · 利用可能

USD 1,000 / 月

最高性能

2× NVIDIA A100 SXM 80GB

160 GB 合計 VRAM · nvlink

65.65 GB 余裕 · 利用可能

USD 1,830 / 月

ライセンスとセルフホスティング

30 B の常駐重み全体が選択 GPU に収まる必要があります。コンテキストと同時実行で KV キャッシュが増えます。

GLM-4.7 Flash は mit で公開され、公式 URL と検証日を保持します。

商用利用可. 公式ライセンスは商用利用を許可していますが、すべての義務は引き続き適用されます。

代替候補と同世代バリアント

GLM-5.3-Flash

リリース履歴

zai/glm/glm-4-7-flash @ dcf13b0a7be7e03cf02d6537df02dac6875b209cb9b1f81c247c89652729b9ca

公式情報源

よくある質問

GLM-4.7 Flash にはどの程度の VRAM が必要ですか?

精度、コンテキスト、同時実行数に依存し、認証済みデータで計算します。

GLM-4.7 Flash に対応するランタイムは?

sglang, transformers の公式証拠が認証されています。

GLM-4.7 Flash は商用利用できますか?

保存区分は商用利用可です。公式 mit 条件を確認してください。

公式情報源

最終検証日: 2026-09-03