Katalog
Qweneigene Hardware · EWR

Qwen3.8 27B

Qwen3.8 27B im offiziellen NVFP4-Build von RadixArk, ausgeliefert auf Karten, die wir im Europäischen Wirtschaftsraum betreiben. Stark bei Programmieraufgaben, Werkzeugaufrufen und agentischer Arbeit. An diesem Modell wurde alles gemessen, was auf der Infrastrukturseite steht: rund 176 Token pro Sekunde auf einem Stream, erstes Token in 0,3 bis 0,9 Sekunden, und ein Routing, das ein Gespräch auf der Maschine hält, die seinen Kontext bereits im Cache hat — 91 bis 97 Prozent Trefferquote bei agentischer Last, wobei zwischengespeicherte Eingabe nur einen Bruchteil des frischen Preises kostet. Anfragen und Antworten werden weder protokolliert noch dauerhaft gespeichert.

Modell-ID: qwen38

api.heabsy.com · OpenAI SDK
from openai import OpenAI client = OpenAI(    api_key="hb-...",    base_url="https://api.heabsy.com/v1",) r = client.chat.completions.create(    model="qwen38",    messages=[{"role": "user", "content": "Hello"}],)
Kontext
volles Fenster
Betrieb
Eigene Hardware · EWR
Werkzeugaufrufe
Schlussfolgern
Strukturierte Ausgabe
Bildverstehen
Eingabe
$0.40/ 1M
Eingabe aus Cache
$0.05/ 1M
Ausgabe
$3.00/ 1M

Preisliste des Gateways, Stand 2026-08-29. Keine Mindestabnahme, kein Abonnement.

Verarbeitung im EWR, keine Protokolle

Dieses Modell läuft auf Karten, die wir im Europäischen Wirtschaftsraum betreiben. Anfragen und Antworten werden weder protokolliert noch dauerhaft gespeichert, nichts davon wird für Training verwendet. An diesem Modell wurde alles gemessen, was auf der Infrastrukturseite steht: rund 176 Token pro Sekunde, erstes Token unter einer Sekunde, 91 bis 97 Prozent Cache-Trefferquote bei agentischer Last.

13 weitere Modelle über denselben Schlüssel und dieselbe Rechnung.

Katalog ansehen

Zuletzt aktualisiert: