Katalog
Z.aiweitergereicht

GLM-4.7-Flash

GLM-4.7-Flash ist die leichte Variante von Z.ai in der 30-Mrd.-Klasse (MIT-Lizenz, Januar 2026): ein Mixture-of-Experts-Modell mit rund 30 Mrd. Parametern, davon 3 Mrd. aktiv je Token. Es zielt auf agentisches Programmieren, Aufgabenplanung und Werkzeugnutzung ab, wenn Kosten und Latenz mehr zählen als Spitzenqualität, und behält seine Überlegungen über mehrere Gesprächsrunden hinweg. Die Modellkarte nennt 59,2 Punkte bei SWE-bench Verified. Bereitgestellt wird es über globale Anbieter im Rahmen unseres europäischen Vertrags; Anfragen gehen nur an Betreiber, die weder Eingaben noch Antworten speichern.

Modell-ID: glm-4.7-flash

from openai import OpenAI client = OpenAI(    api_key="hb-...",    base_url="https://api.heabsy.com/v1",) r = client.chat.completions.create(    model="glm-4.7-flash",    messages=[{"role": "user", "content": "Hello"}],)print(r.choices[0].message.content)
Kontext
195K Token
Betrieb
Globale Anbieter · EU-Vertrag
Werkzeugaufrufe
Schlussfolgern
Strukturierte Ausgabe
Bildverstehen
Eingabe
0,09 $/ 1M
Eingabe aus Cache
0,09 $/ 1M
Ausgabe
0,62 $/ 1M

Preisliste, Stand 12. September 2026. Keine Mindestabnahme, kein Abonnement.

Eckdaten

Entwickler
Z.ai
Veröffentlicht
Jänner 2026
Lizenz
MIT
Architektur
Mixture of Experts · 30 Mrd. Parameter, 3 Mrd. aktiv je Token
Eingabe
Text
Denkmodus
Reasoning-Modell
Vom Entwickler genannte Sprachen
Englisch, Chinesisch

Quelle: Modellkarte des Entwicklers, Stand 17. September 2026.

Lizenz: was sie für Ihr Unternehmen bedeutet

MIT. Eine freizügige Open-Source-Lizenz: Nutzung, Veränderung und gewerblicher Einsatz sind erlaubt, auch in Produkten, die Sie verkaufen; wer die Gewichte weitergibt, muss Lizenztext und Urheberrechtshinweise mitliefern.

Zusammenfassung der Lizenz, keine Rechtsberatung.

Benchmark-Ergebnisse laut Entwickler

SWE-bench Verified
59,2
τ²-Bench
79,5

Werte aus der Modellkarte des Entwicklers, keine eigene Messung. Quelle: huggingface.co/zai-org/GLM-4.7-Flash

Technische Angaben

Kontextfenster
195K Token
Maximale Ausgabe
65 536 Token
Durchsatzgrenze
200K Tok/min
Tokenizer
Other
Streaming
ja
Offene Gewichte
z-ai/glm-4.7-flash
Unterstützte Parameter
max_tokens
1 … 65536
temperature
0 … 2
top_p
0 … 1
frequency_penalty
-2 … 2
presence_penalty
-2 … 2
stop
array
seed
integer
Für Sie eingekauft, von uns abgerechnet

Dieses Modell wird über globale Anbieter im Rahmen unseres europäischen Vertrags bereitgestellt: ein Auftragsverarbeitungsvertrag mit einer EU-Gesellschaft, eine Rechnung für alle Modelle im Katalog, kein US-Vertragspartner in Ihren Unterlagen. Die Verarbeitung kann außerhalb des EWR erfolgen — ist eine Verarbeitung ausschließlich im EWR gefordert, nutzen Sie unser Modell auf eigener Hardware.

Fragen zu diesem Modell

Wo wird GLM-4.7-Flash berechnet?

Außerhalb des EWR, über einen globalen Anbieter unter unserem europäischen Vertrag. Sie haben einen Auftragsverarbeitungsvertrag mit einer EU-Gesellschaft und eine Rechnung, aber die Berechnung läuft nicht im EWR — wir sagen das, statt es zu verschweigen.

Speichert GLM-4.7-Flash Anfragen und Antworten?

Nein. Dieses Modell läuft ohne Datenspeicherung: Inhalte werden nicht dauerhaft abgelegt und nichts davon wird für Training verwendet.

Wie groß ist das Kontextfenster von GLM-4.7-Flash?

195K Token, davon bis zu 65 536 Token Ausgabe.

Was kostet GLM-4.7-Flash?

0,09 $ je Million Token Eingabe und 0,62 $ je Million Token Ausgabe. Keine Mindestabnahme, kein Abonnement; dieselbe Preisliste gilt für die Schnittstelle und für die Rechnung.

Gibt es bei GLM-4.7-Flash eine Durchsatzgrenze?

Ja, 200K Token pro Minute. Höhere Grenzen sind eine Frage des Volumens, nicht des Prinzips.

Versteht GLM-4.7-Flash Deutsch?

Deutsch steht nicht auf der Liste des Entwicklers (Englisch, Chinesisch). Prüfen Sie das Modell mit eigenen deutschsprachigen Unterlagen, bevor Sie sich darauf verlassen.

Unter welcher Lizenz steht GLM-4.7-Flash?

MIT. Eine freizügige Open-Source-Lizenz: Nutzung, Veränderung und gewerblicher Einsatz sind erlaubt, auch in Produkten, die Sie verkaufen; wer die Gewichte weitergibt, muss Lizenztext und Urheberrechtshinweise mitliefern.

Lässt sich der Denkmodus von GLM-4.7-Flash abschalten?

GLM-4.7-Flash ist als Reasoning-Modell ausgelegt; eine Möglichkeit, den Denkmodus abzuschalten, beschreibt die Modellkarte nicht.

Vergleich mit ähnlichen Modellen

ModellEntwicklerParameterKontextLizenzEingabe / 1 Mio. Token
GLM-4.7-FlashZ.ai30B / 3B195KMIT0,09 $
GLM-5.3-Flash (NVFP4)Z.ai320B / 18B1MMIT0,04 $
Nemotron 3.5 LightningNVIDIA30B / 3B256KOpenMDW-1.10,12 $
Gemma 4 31BGoogle DeepMind30,7B256KApache-2.00,14 $

30 weitere Modelle über denselben Schlüssel und dieselbe Rechnung.

Katalog ansehen

Zuletzt aktualisiert: