GLM-5.3-Flash (NVFP4)
GLM-5.3-Flash — первая изначально мультимодальная модель серии GLM-5 от Z.ai (лицензия MIT, август 2026). Вопреки названию это большая «смесь экспертов» — 320 млрд параметров, 18 млрд активны на токен, — построенная для программирования и долгой агентской работы на длинном контексте при низкой стоимости обслуживания. Глубину рассуждения можно выбрать; кроме текста, модель читает изображения. Разработчик заявляет только английский и китайский: русские материалы стоит проверить на пилоте. Исполняется через глобальных поставщиков по нашему европейскому договору; запросы уходят только тем, кто не хранит ни ввод, ни ответы.
ID модели: glm53-flash
from openai import OpenAI client = OpenAI( api_key="hb-...", base_url="https://api.heabsy.com/v1",) r = client.chat.completions.create( model="glm53-flash", messages=[{"role": "user", "content": "Hello"}],)print(r.choices[0].message.content)
curl https://api.heabsy.com/v1/chat/completions \ -H "Authorization: Bearer $HEABSY_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "glm53-flash", "messages": [{"role": "user", "content": "Hello"}] }'
import OpenAI from "openai"; const client = new OpenAI({ apiKey: process.env.HEABSY_API_KEY, baseURL: "https://api.heabsy.com/v1",}); const r = await client.chat.completions.create({ model: "glm53-flash", messages: [{ role: "user", content: "Hello" }],});console.log(r.choices[0].message.content);
Прайс-лист, состояние на 12 сентября 2026 г.. Без минимального объёма и без подписки.
О модели
- Разработчик
- Z.ai
- Выпущена
- август 2026 г.
- Лицензия
- MIT
- Архитектура
- смесь экспертов · 320 млрд параметров, 18 млрд активны на токен
- Принимает на вход
- текст, изображения
- Рассуждение
- выбирается глубина
- Языки, названные разработчиком
- английский, китайский
Источник: карточка модели у разработчика, состояние на 17 сентября 2026 года.
Лицензия: что она означает для вашей компании
MIT. Разрешительная лицензия open source: модель можно использовать, изменять и применять в коммерческих продуктах; при распространении весов вместе с ними нужно передавать текст лицензии и уведомления об авторских правах.
Краткий пересказ лицензии, а не юридическая консультация.
Результаты тестов по данным разработчика
- DeepSWE v1.1
- 63,4
- AutomationBench
- 48,8
Цифры из карточки модели, опубликованной разработчиком, — не наши замеры. Источник: docs.z.ai/guides/vlm/glm-5.3-flash
Настройки, которые рекомендует разработчик
- temperature 1, top_p 0,95
Источник: docs.z.ai/guides/vlm/glm-5.3-flash
Технические характеристики
- Окно контекста
- 1M токенов
- Максимум на выходе
- 32 768 токенов
- Предел пропускной способности
- 50M ток/мин
- Токенизатор
- Other
- Потоковая выдача
- да
- Открытые веса
- zai-org/GLM-5.3-Flash
- max_tokens
- 1 … 32768
- temperature
- 0 … 2
- top_p
- 0 … 1
- frequency_penalty
- -2 … 2
- presence_penalty
- -2 … 2
- stop
- array
- seed
- integer
Эта модель исполняется через глобальных поставщиков по нашему европейскому договору: один договор об обработке с компанией из ЕС, один счёт на все модели, без американского контрагента в ваших документах. Вычисление может идти за пределами ЕЭЗ — там, где нужна обработка строго в ЕЭЗ, подходит наша модель на своём железе.
Вопросы об этой модели
›Где считается GLM-5.3-Flash?
За пределами ЕЭЗ, через глобального поставщика по нашему европейскому договору. У вас один договор об обработке с компанией из ЕС и один счёт, но само вычисление идёт не в ЕЭЗ — мы говорим это прямо, а не умалчиваем.
›Сохраняет ли GLM-5.3-Flash запросы и ответы?
Нет. Модель работает без хранения данных: содержимое запросов не пишется в долговременное хранилище и ничего из него не идёт на обучение.
›Насколько велико окно контекста у GLM-5.3-Flash?
1M токенов, из них до 32 768 токенов на выходе.
›Сколько стоит GLM-5.3-Flash?
0,04 $ за миллион токенов входа и 0,12 $ за миллион токенов выхода. Без минимального объёма и подписки; один прайс-лист для интерфейса и для счёта.
›Есть ли у GLM-5.3-Flash предел пропускной способности?
Да, 50M токенов в минуту. Более высокий предел — вопрос объёма, а не принципа.
›Понимает ли GLM-5.3-Flash русский язык?
Русского нет в списке разработчика (английский, китайский). Проверьте модель на своих русскоязычных материалах, прежде чем на неё полагаться.
›Под какой лицензией выпущена модель GLM-5.3-Flash?
MIT. Разрешительная лицензия open source: модель можно использовать, изменять и применять в коммерческих продуктах; при распространении весов вместе с ними нужно передавать текст лицензии и уведомления об авторских правах.
›Можно ли отключить рассуждение у GLM-5.3-Flash?
Разработчик позволяет выбрать глубину рассуждения; полное отключение в карточке не описано.
Сравнение с похожими моделями
| Модель | Разработчик | Параметры | Контекст | Лицензия | Ввод / 1 млн |
|---|---|---|---|---|---|
| GLM-5.3-Flash (NVFP4) | Z.ai | 320B / 18B | 1M | MIT | 0,04 $ |
| GLM-4.7-Flash | Z.ai | 30B / 3B | 195K | MIT | 0,09 $ |
| DeepSeek-V4-Flash-0731 | DeepSeek | 284B / 13B | 1.3M | MIT | 0,06 $ |
| DeepSeek V4 Flash | DeepSeek | 284B / 13B | 1M | MIT | 0,25 $ |
30 моделей ещё — по тому же ключу и в том же счёте.
Смотреть каталогОбновлено: