Jedes Modell hier: ein Schlüssel, eine Rechnung, ein europäischer Vertragspartner.
OpenAI- und Anthropic-kompatible Schnittstelle. Preise je Million Token direkt aus der Preisliste des Gateways — keine Mindestabnahme, kein Abonnement.
Ausgeliefert auf Karten, die wir im Europäischen Wirtschaftsraum betreiben. Keine Protokollierung, Prefix-Cache, und jede Tempoangabe auf der Infrastrukturseite wurde hier gemessen. Wer ausschließlich Verarbeitung im EWR braucht, bleibt in dieser Ebene.
Erfüllt über globale Anbieter unter unserem europäischen Vertrag: Sie schließen einen Auftragsverarbeitungsvertrag mit einer EU-Gesellschaft und bekommen eine Rechnung für alle Modelle statt eines US-Vertragspartners je Anbieter. Die Berechnung kann außerhalb des EWR laufen — der Katalog sagt das, statt es zu verschweigen.
Alle Modelle, ein Schlüssel, eine Rechnung
Qwen3.8 27B
Official NVFP4 build on our own fleet in the EEA — the model every measurement on this page was taken on.
GLM 5.3 Flash
GLM-5.3-Flash is a native multimodal model from Z.ai
gpt-oss-120b
gpt-oss-120b is an open-weight, 117B-parameter Mixture-of-Experts (MoE) language model from OpenAI designed for high-reasoning, agentic, and general-purpose pro
DeepSeek V4 Flash 0423
DeepSeek V4 Flash is an efficiency-optimized Mixture-of-Experts model from DeepSeek with 284B total parameters and 13B activated parameters, supporting a 1M-tok
Hy3
Hy3 is a 295B-parameter Mixture-of-Experts model from Tencent (21B active, 192 experts with top-8 routing) built for reasoning, agentic workflows, and real-worl
MiMo-V2.5
MiMo-V2.5 is a native omnimodal model by Xiaomi
Mistral Small 4
Mistral Small 4 is the next major release in the Mistral Small family, unifying the capabilities of several flagship Mistral models into a single system
MiniMax M3
MiniMax-M3 is a multimodal foundation model from MiniMax
DeepSeek V4 Pro 0423
DeepSeek V4 Pro is a large-scale Mixture-of-Experts model from DeepSeek with 1.6T total parameters and 49B activated parameters, supporting a 1M-token context w
Qwen3 Coder Plus
Qwen3 Coder Plus is Alibaba's proprietary version of the Open Source Qwen3 Coder 480B A35B
Kimi K2.7 Code
MoonshotAI: Kimi K2.7 Code is a coding-focused model in Moonshot AI's Kimi K2 family, built to complete end-to-end programming tasks reliably over long contexts
GLM 5.2
GLM 5.2 is a large-scale reasoning model from Z.ai
GLM 5.3
GLM-5.3 is a large-scale reasoning model from Z.ai, built for complex software engineering and long-horizon agent tasks
Kimi K3
Kimi K3 is a 2.8T parameter open-weight multimodal reasoning model from Moonshot AI
Preise aus der Preisliste des Gateways, Stand 2026-08-29. Die Rechnung folgt dem Gateway, und diese Seite folgt der Rechnung — nie umgekehrt.api.heabsy.com/openrouter/v1/models
Fehlt ein Modell, das Sie brauchen?
Der weitergereichte Katalog wächst auf Anfrage, und offene Modelle lassen sich auf unsere eigene Hardware im EWR holen, sobald die Last eine eigene Flotte rechtfertigt.
Häufige Fragen
Welches Modell soll ich nehmen?+
Für Dokumentenarbeit auf Deutsch entscheidet das der Pilot an Ihren eigenen Unterlagen, nicht die Rangliste: bei deutschen Verträgen und Handbüchern unterscheiden sich Modelle deutlich stärker, als die Benchmarks vermuten lassen. Wo ausschließlich Verarbeitung im EWR gefordert ist, bleibt nur das Modell auf eigener Hardware.
Was ist der Unterschied zwischen eigener Hardware und weitergereicht?+
Beim Modell auf eigener Hardware betreiben wir die Karten selbst im Europäischen Wirtschaftsraum: Anfragen werden nicht protokolliert, nichts wird für Training verwendet, die Verarbeitung bleibt im EWR. Weitergereichte Modelle kaufen wir bei globalen Anbietern unter unserem europäischen Vertrag ein — Sie haben einen Auftragsverarbeitungsvertrag und eine Rechnung, aber die Berechnung kann außerhalb des EWR laufen. Der Katalog sagt bei jedem Modell, was zutrifft.
Ändern sich die Preise?+
Sie folgen der Preisliste des Gateways und werden von dort übernommen, nicht von Hand gepflegt. Der Stand steht unter dem Katalog. Abgerechnet wird immer das, was das Gateway berechnet — diese Seite folgt der Rechnung und nicht umgekehrt.
Gibt es eine Mindestabnahme?+
Nein, weder Mindestumsatz noch Abonnement. Bezahlt wird nach Token, getrennt nach frischer Eingabe, Eingabe aus dem Cache und Ausgabe. Bei agentischer Arbeit ist der Cache-Anteil der größte Posten, und er kostet einen Bruchteil.
Fehlt ein Modell, das wir brauchen?+
Der weitergereichte Katalog wächst auf Anfrage. Offene Modelle lassen sich zusätzlich auf unsere eigene Hardware holen, sobald die Last eine eigene Flotte rechtfertigt — das ist eine Frage des Volumens, nicht des Prinzips.
Zuletzt aktualisiert: