GLM-5.3-Flash (NVFP4)
GLM-5.3-Flash ist das erste nativ multimodale GLM-5-Modell von Z.ai (MIT-Lizenz, August 2026). Trotz des Namens ist es ein großes Mixture-of-Experts-Netz — 320 Mrd. Parameter, 18 Mrd. aktiv je Token —, gebaut für Programmieraufgaben und lange Agentenabläufe mit langem Kontext bei niedrigen Inferenzkosten. Der Denkaufwand ist wählbar (niedrig, hoch, maximal), und neben Text liest es auch Bilder. Der Entwickler weist nur Englisch und Chinesisch aus: Für deutsche Unterlagen gehört es in den Vergleichstest, nicht blind in die Produktion. Bereitgestellt wird es über globale Anbieter im Rahmen unseres europäischen Vertrags; Anfragen gehen nur an Betreiber, die weder Eingaben noch Antworten speichern.
Modell-ID: glm53-flash
from openai import OpenAI client = OpenAI( api_key="hb-...", base_url="https://api.heabsy.com/v1",) r = client.chat.completions.create( model="glm53-flash", messages=[{"role": "user", "content": "Hello"}],)print(r.choices[0].message.content)
curl https://api.heabsy.com/v1/chat/completions \ -H "Authorization: Bearer $HEABSY_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "glm53-flash", "messages": [{"role": "user", "content": "Hello"}] }'
import OpenAI from "openai"; const client = new OpenAI({ apiKey: process.env.HEABSY_API_KEY, baseURL: "https://api.heabsy.com/v1",}); const r = await client.chat.completions.create({ model: "glm53-flash", messages: [{ role: "user", content: "Hello" }],});console.log(r.choices[0].message.content);
Preisliste, Stand 12. September 2026. Keine Mindestabnahme, kein Abonnement.
Eckdaten
- Entwickler
- Z.ai
- Veröffentlicht
- August 2026
- Lizenz
- MIT
- Architektur
- Mixture of Experts · 320 Mrd. Parameter, 18 Mrd. aktiv je Token
- Eingabe
- Text, Bilder
- Denkmodus
- Aufwand wählbar
- Vom Entwickler genannte Sprachen
- Englisch, Chinesisch
Quelle: Modellkarte des Entwicklers, Stand 17. September 2026.
Lizenz: was sie für Ihr Unternehmen bedeutet
MIT. Eine freizügige Open-Source-Lizenz: Nutzung, Veränderung und gewerblicher Einsatz sind erlaubt, auch in Produkten, die Sie verkaufen; wer die Gewichte weitergibt, muss Lizenztext und Urheberrechtshinweise mitliefern.
Zusammenfassung der Lizenz, keine Rechtsberatung.
Benchmark-Ergebnisse laut Entwickler
- DeepSWE v1.1
- 63,4
- AutomationBench
- 48,8
Werte aus der Modellkarte des Entwicklers, keine eigene Messung. Quelle: docs.z.ai/guides/vlm/glm-5.3-flash
Vom Entwickler empfohlene Einstellungen
- temperature 1, top_p 0,95
Technische Angaben
- Kontextfenster
- 1M Token
- Maximale Ausgabe
- 32 768 Token
- Durchsatzgrenze
- 50M Tok/min
- Tokenizer
- Other
- Streaming
- ja
- Offene Gewichte
- zai-org/GLM-5.3-Flash
- max_tokens
- 1 … 32768
- temperature
- 0 … 2
- top_p
- 0 … 1
- frequency_penalty
- -2 … 2
- presence_penalty
- -2 … 2
- stop
- array
- seed
- integer
Dieses Modell wird über globale Anbieter im Rahmen unseres europäischen Vertrags bereitgestellt: ein Auftragsverarbeitungsvertrag mit einer EU-Gesellschaft, eine Rechnung für alle Modelle im Katalog, kein US-Vertragspartner in Ihren Unterlagen. Die Verarbeitung kann außerhalb des EWR erfolgen — ist eine Verarbeitung ausschließlich im EWR gefordert, nutzen Sie unser Modell auf eigener Hardware.
Fragen zu diesem Modell
›Wo wird GLM-5.3-Flash berechnet?
Außerhalb des EWR, über einen globalen Anbieter unter unserem europäischen Vertrag. Sie haben einen Auftragsverarbeitungsvertrag mit einer EU-Gesellschaft und eine Rechnung, aber die Berechnung läuft nicht im EWR — wir sagen das, statt es zu verschweigen.
›Speichert GLM-5.3-Flash Anfragen und Antworten?
Nein. Dieses Modell läuft ohne Datenspeicherung: Inhalte werden nicht dauerhaft abgelegt und nichts davon wird für Training verwendet.
›Wie groß ist das Kontextfenster von GLM-5.3-Flash?
1M Token, davon bis zu 32 768 Token Ausgabe.
›Was kostet GLM-5.3-Flash?
0,04 $ je Million Token Eingabe und 0,12 $ je Million Token Ausgabe. Keine Mindestabnahme, kein Abonnement; dieselbe Preisliste gilt für die Schnittstelle und für die Rechnung.
›Gibt es bei GLM-5.3-Flash eine Durchsatzgrenze?
Ja, 50M Token pro Minute. Höhere Grenzen sind eine Frage des Volumens, nicht des Prinzips.
›Versteht GLM-5.3-Flash Deutsch?
Deutsch steht nicht auf der Liste des Entwicklers (Englisch, Chinesisch). Prüfen Sie das Modell mit eigenen deutschsprachigen Unterlagen, bevor Sie sich darauf verlassen.
›Unter welcher Lizenz steht GLM-5.3-Flash?
MIT. Eine freizügige Open-Source-Lizenz: Nutzung, Veränderung und gewerblicher Einsatz sind erlaubt, auch in Produkten, die Sie verkaufen; wer die Gewichte weitergibt, muss Lizenztext und Urheberrechtshinweise mitliefern.
›Lässt sich der Denkmodus von GLM-5.3-Flash abschalten?
Der Entwickler lässt den Denkaufwand wählen; ein vollständiges Abschalten beschreibt die Modellkarte nicht.
Vergleich mit ähnlichen Modellen
| Modell | Entwickler | Parameter | Kontext | Lizenz | Eingabe / 1 Mio. Token |
|---|---|---|---|---|---|
| GLM-5.3-Flash (NVFP4) | Z.ai | 320B / 18B | 1M | MIT | 0,04 $ |
| GLM-4.7-Flash | Z.ai | 30B / 3B | 195K | MIT | 0,09 $ |
| DeepSeek-V4-Flash-0731 | DeepSeek | 284B / 13B | 1.3M | MIT | 0,06 $ |
| DeepSeek V4 Flash | DeepSeek | 284B / 13B | 1M | MIT | 0,25 $ |
30 weitere Modelle über denselben Schlüssel und dieselbe Rechnung.
Katalog ansehenZuletzt aktualisiert: