Qwen3.8 Flash Next в QuickSilver Pro
Qwen3.8 Flash Next — превью архитектуры Qwen4 от Alibaba с открытыми весами: mixture-of-experts модель с 6B активных параметров, полным для семейства контекстным окном 1M токенов и максимальным выводом 131K. В QuickSilver Pro она стоит $0.12 за вход / $0.376 за выход за миллион токенов — на ~20% ниже собственной списочной цены Alibaba в $0.15 / $0.47.
Коротко
Самый дешёвый способ запустить Qwen следующего поколения на контексте масштаба репозитория — MoE с 6B активных параметров и окном 1M токенов.
Сравнение цен ($/1M токенов)
| Провайдер | Вход | Выход | к QSP |
|---|---|---|---|
| QuickSilver Pro | $0.12 | $0.376 | самая низкая цена |
| Alibaba (qwen/qwen3.8-flash) | $0.15 | $0.47 | на 20% ниже |
| OpenAI (GPT-4o mini) | $0.15 | $0.60 | на 37% ниже |
Когда использовать
Выбирайте Qwen3.8 Flash Next для высоконагруженных агентных и кодинг-задач, где главное — стоимость вызова и размер рабочего набора: рефакторинг на длинном контексте, документные пайплайны и агенты с интенсивным кэшированием, которые перечитывают один и тот же контекст. Маршрутизация с 6B активных параметров удерживает задержку и цену низкими, стек превью Qwen4 нацелен на агентные задачи, а полное окно 1M токенов отдаётся по маршруту, на котором оно действительно соблюдается.
Когда выбрать другую модель
Для самых сложных одношаговых рассуждений переходите на Qwen3.8 Max или GLM 5.3. Это релиз превью-линейки, и его поведение может меняться с ревизиями апстрима — зафиксируйте свои eval-тесты, если нужна неизменная цель. Выход тарифицируется по $0.376 за миллион, так что генерацию с большим объёмом вывода стоит сначала сравнить с DeepSeek V4 Flash и Qwen3.8 27B.
Быстрый старт (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-flash-next",
"messages": [{"role": "user", "content": "Hello!"}]
}'Совместимо с OpenAI. Миграция в одну строку через base_url.
FAQ
Qwen3.8 Flash Next — ранний релиз с открытыми весами, построенный на attention-стеке следующего поколения Qwen4 от Alibaba и настроенный под агентные нагрузки с длинным контекстом при MoE-размере в 6B активных параметров. Он выходит раньше полной линейки Qwen4, так что относитесь к нему как к быстро меняющемуся превью, а не как к неизменной продакшен-цели.
Да — полное окно в 1,000,000 токенов и до 131K выходных токенов на вызов, причём QuickSilver Pro использует маршрут, на котором эти лимиты действительно соблюдаются. Вызовы с длинным контекстом тарифицируются по тем же фиксированным $0.12 за миллион входных токенов.
Да — Qwen3.8 Flash Next в QuickSilver Pro — это OpenAI-совместимый endpoint chat completions (Responses API тоже работает). Укажите base_url=https://api.quicksilverpro.io/v1, вставьте свой ключ QSP и используйте model="qwen3.8-flash-next". Streaming, tool calling и учёт usage.cost — всё работает.
Alibaba предлагает Qwen3.8 Flash Next по $0.15 за вход / $0.47 за выход за миллион токенов; в QuickSilver Pro — $0.12 / $0.376, на ~20% ниже по обеим позициям. Тот же OpenAI-совместимый интерфейс; миграция — это замена base_url и ключа, плюс нужно убрать префикс провайдера `qwen/` из ID модели.