контекст 1MReasoningResponses API

GLM 5.3 Flash в QuickSilver Pro

GLM 5.3 Flash — быстрая модель Z.ai с открытыми весами, младшая сестра GLM 5.3: то же reasoning-семейство 2026 года, дистиллированное до цены «рабочей лошадки», с полным контекстным окном на 1M токенов и максимальным выводом 131K. На QuickSilver Pro она стоит $0.06 за вход / $0.20 за выход за миллион токенов, примерно на 20% ниже собственной списочной цены Z.ai: $0.075 / $0.25. Как и у GLM 5.3, reasoning на этом endpoint включён всегда и не отключается — глубиной управляет `reasoning_effort`.

$0.06 вход · $0.20 выход за 1M токенов
Автор:Raullen Chai·Обновлено

Коротко

Контекст
1M токенов
Вход / 1M
$0.06
Выход / 1M
$0.20
Думает по умолчанию
Да

Массовые агенты и кодинг по цене «рабочей лошадки» — быстрая модель с открытыми весами из новейшего reasoning-семейства Z.ai, с контекстным окном на 1M токенов.

Сравнение цен ($/1M токенов)

ПровайдерВходВыходк QSP
QuickSilver Pro$0.06$0.20самая низкая цена
Z.ai (z-ai/glm-5.3-flash)$0.075$0.25на 20% ниже
OpenAI (GPT-4o mini)$0.15$0.60на 67% ниже

Когда использовать

Берите GLM 5.3 Flash, когда нужно поведение семейства GLM 5.3 — reasoning плюс инструменты — за малую долю цены: массовые агентные циклы, фоновая кодогенерация, суммаризация огромных рабочих наборов в контексте на 1M токенов и пакетные пайплайны, где главное — стоимость одного вызова. При цене $0.06 / $0.20 за миллион токенов она конкурирует с самым дешёвым уровнем каталога, сохраняя окно на 1M токенов, — такого сочетания бюджетные модели не предлагают. Reasoning включён всегда; используйте `reasoning_effort`, чтобы выбрать баланс между глубиной, задержкой и стоимостью.

Когда выбрать другую модель

Для самой сложной инженерии в масштабе репозитория и длинных планов в семействе сильнее GLM 5.3 — то же окно, более глубокая модель. Reasoning обязателен и здесь, поэтому модель тратит токены на размышления даже на тривиальных репликах; если нужна дешёвая модель, которая отвечает сразу, DeepSeek V4 Flash ($0.086/$0.173) отвечает без этих накладных расходов. Если у вас есть промпты, настроенные на GLM 5.2 или GLM 5.3, перед переходом на младшую модель проведите A/B-тест — трассы и ритм вызовов инструментов внутри семейства отличаются.

Быстрый старт (curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

Совместимо с OpenAI. Миграция в одну строку через base_url.

FAQ

Reasoning включён всегда — на этом endpoint он обязателен и не отключается (запрос, который пытается его выключить, отклоняется на стороне апстрима). Используйте `reasoning_effort`, чтобы выбрать баланс между глубиной, задержкой и стоимостью. Reasoning-токены тарифицируются как выходные и расходуются из бюджета `max_tokens` до видимого ответа, поэтому задавайте `max_tokens` с запасом, иначе ответ может вернуться обрезанным. Если нужен GLM без постоянно включённых размышлений, используйте GLM 5.2.

То же семейство, другая весовая категория: GLM 5.3 Flash — быстрый вариант с открытыми весами, выпущенный 2026-08-26, по цене $0.06 за вход / $0.20 за выход за миллион токенов против $1.12 / $3.52 у GLM 5.3 — примерно в 18 раз дешевле на входе. У обеих одинаковое контекстное окно на 1M токенов, лимит вывода 131K и всегда включённый reasoning. Используйте Flash для объёма; переходите на GLM 5.3, когда узкое место — сложность задачи, а не пропускная способность.

Да — GLM 5.3 Flash на QuickSilver Pro представляет собой OpenAI-совместимый endpoint chat completions (Responses API тоже работает). Укажите base_url=https://api.quicksilverpro.io/v1, вставьте свой ключ QSP и используйте model="glm-5.3-flash". Streaming, tool calling (`tool_choice: "auto"` — этот endpoint отклоняет принудительный выбор конкретной функции) и учёт usage.cost работают. `response_format: json_schema` на этом endpoint пока не обеспечивается принудительно; если нужен строгий структурированный вывод, используйте GLM 5.2.

Z.ai указывает для GLM 5.3 Flash $0.075 за вход / $0.25 за выход за миллион токенов; на QuickSilver Pro — $0.06 / $0.20, примерно на 20% ниже и на входе, и на выходе. Тот же OpenAI-совместимый интерфейс; миграция — это замена base_url и ключа, а из ID модели нужно убрать префикс провайдера `z-ai/`.

Попробуйте GLM 5.3 Flash с удвоенным балансом — до $50 бонусных кредитов

Получить API Key