Каталог
Z.aiчерез партнёров

GLM-5.3-Flash (NVFP4)

GLM-5.3-Flash — первая изначально мультимодальная модель серии GLM-5 от Z.ai (лицензия MIT, август 2026). Вопреки названию это большая «смесь экспертов» — 320 млрд параметров, 18 млрд активны на токен, — построенная для программирования и долгой агентской работы на длинном контексте при низкой стоимости обслуживания. Глубину рассуждения можно выбрать; кроме текста, модель читает изображения. Разработчик заявляет только английский и китайский: русские материалы стоит проверить на пилоте. Исполняется через глобальных поставщиков по нашему европейскому договору; запросы уходят только тем, кто не хранит ни ввод, ни ответы.

ID модели: glm53-flash

from openai import OpenAI client = OpenAI(    api_key="hb-...",    base_url="https://api.heabsy.com/v1",) r = client.chat.completions.create(    model="glm53-flash",    messages=[{"role": "user", "content": "Hello"}],)print(r.choices[0].message.content)
Контекст
1M токенов
Где работает
Глобальные поставщики · договор с ЕС
Вызов инструментов
Рассуждение
Структурированный вывод
Работа с изображениями
Ввод
0,04 $/ 1M
Ввод из кэша
0,02 $/ 1M
Вывод
0,12 $/ 1M

Прайс-лист, состояние на 12 сентября 2026 г.. Без минимального объёма и без подписки.

О модели

Разработчик
Z.ai
Выпущена
август 2026 г.
Лицензия
MIT
Архитектура
смесь экспертов · 320 млрд параметров, 18 млрд активны на токен
Принимает на вход
текст, изображения
Рассуждение
выбирается глубина
Языки, названные разработчиком
английский, китайский

Источник: карточка модели у разработчика, состояние на 17 сентября 2026 года.

Лицензия: что она означает для вашей компании

MIT. Разрешительная лицензия open source: модель можно использовать, изменять и применять в коммерческих продуктах; при распространении весов вместе с ними нужно передавать текст лицензии и уведомления об авторских правах.

Краткий пересказ лицензии, а не юридическая консультация.

Результаты тестов по данным разработчика

DeepSWE v1.1
63,4
AutomationBench
48,8

Цифры из карточки модели, опубликованной разработчиком, — не наши замеры. Источник: docs.z.ai/guides/vlm/glm-5.3-flash

Настройки, которые рекомендует разработчик

  • temperature 1, top_p 0,95

Источник: docs.z.ai/guides/vlm/glm-5.3-flash

Технические характеристики

Окно контекста
1M токенов
Максимум на выходе
32 768 токенов
Предел пропускной способности
50M ток/мин
Токенизатор
Other
Потоковая выдача
да
Открытые веса
zai-org/GLM-5.3-Flash
Поддерживаемые параметры
max_tokens
1 … 32768
temperature
0 … 2
top_p
0 … 1
frequency_penalty
-2 … 2
presence_penalty
-2 … 2
stop
array
seed
integer
Куплено для вас, счёт от нас

Эта модель исполняется через глобальных поставщиков по нашему европейскому договору: один договор об обработке с компанией из ЕС, один счёт на все модели, без американского контрагента в ваших документах. Вычисление может идти за пределами ЕЭЗ — там, где нужна обработка строго в ЕЭЗ, подходит наша модель на своём железе.

Вопросы об этой модели

Где считается GLM-5.3-Flash?

За пределами ЕЭЗ, через глобального поставщика по нашему европейскому договору. У вас один договор об обработке с компанией из ЕС и один счёт, но само вычисление идёт не в ЕЭЗ — мы говорим это прямо, а не умалчиваем.

Сохраняет ли GLM-5.3-Flash запросы и ответы?

Нет. Модель работает без хранения данных: содержимое запросов не пишется в долговременное хранилище и ничего из него не идёт на обучение.

Насколько велико окно контекста у GLM-5.3-Flash?

1M токенов, из них до 32 768 токенов на выходе.

Сколько стоит GLM-5.3-Flash?

0,04 $ за миллион токенов входа и 0,12 $ за миллион токенов выхода. Без минимального объёма и подписки; один прайс-лист для интерфейса и для счёта.

Есть ли у GLM-5.3-Flash предел пропускной способности?

Да, 50M токенов в минуту. Более высокий предел — вопрос объёма, а не принципа.

Понимает ли GLM-5.3-Flash русский язык?

Русского нет в списке разработчика (английский, китайский). Проверьте модель на своих русскоязычных материалах, прежде чем на неё полагаться.

Под какой лицензией выпущена модель GLM-5.3-Flash?

MIT. Разрешительная лицензия open source: модель можно использовать, изменять и применять в коммерческих продуктах; при распространении весов вместе с ними нужно передавать текст лицензии и уведомления об авторских правах.

Можно ли отключить рассуждение у GLM-5.3-Flash?

Разработчик позволяет выбрать глубину рассуждения; полное отключение в карточке не описано.

Сравнение с похожими моделями

МодельРазработчикПараметрыКонтекстЛицензияВвод / 1 млн
GLM-5.3-Flash (NVFP4)Z.ai320B / 18B1MMIT0,04 $
GLM-4.7-FlashZ.ai30B / 3B195KMIT0,09 $
DeepSeek-V4-Flash-0731DeepSeek284B / 13B1.3MMIT0,06 $
DeepSeek V4 FlashDeepSeek284B / 13B1MMIT0,25 $

30 моделей ещё — по тому же ключу и в том же счёте.

Смотреть каталог

Обновлено: