контекст 1MМультимодальнаяReasoningResponses API

Qwen3.8 Max в QuickSilver Pro

Qwen 3.8 Max — флагман Alibaba от августа 2026 года и самая крупная модель, которую компания выпускала: 2.4 триллиона параметров в архитектуре mixture-of-experts, контекстное окно 1M токенов и ввод текста, изображений и видео. Alibaba позиционирует её для автономного кодинга и долгосрочной агентной работы, а не для чата. В QuickSilver Pro она стоит $2.00 за вход / $6.00 за выход за 1M токенов — это опубликованная ставка самой Alibaba, переданная без наценки, — с одним OpenAI-совместимым ключом на весь каталог.

$2.00 вход · $6.00 выход за 1M токенов
Автор:Raullen Chai·Обновлено

Коротко

Контекст
1M токенов
Вход / 1M
$2.00
Выход / 1M
$6.00
Думает по умолчанию
Нет

Автономный кодинг + долгосрочные агенты — самая крупная модель Alibaba, контекст 1M, по её собственной списочной цене.

Сравнение цен ($/1M токенов)

ПровайдерВходВыходк QSP
QuickSilver Pro$2.00$6.00—
Alibaba (qwen3.8-max)$2.00$6.00так же
OpenAI (GPT-5.6 Sol)$5.00$30.00на 80% ниже

Когда использовать

Выбирайте 3.8 Max для работы, которая долго идёт без присмотра: многодневные кодинг-агенты, циклы планирования на сотни ходов и задачи, где агент должен сам замечать свои ошибки и корректировать курс, а не ждать нового промпта. В материалах Alibaba к запуску описаны многодневные автономные прогоны разработки и циклы планирования в сотни ходов, а зрение подаётся как контур обратной связи для планирования и самокоррекции, а не просто как ввод — относитесь к этому как к заявлениям вендора и сверяйте со своими eval-тестами. Контекст 1M означает, что большой репозиторий или длинная трасса могут оставаться в памяти, а не пересказываться заново на каждом ходу.

Когда выбрать другую модель

Это верх линейки, и цена соответствующая. Для рутинного чата, генерации кода и продакшен-агентов Qwen 3.7 Plus по $0.256/$1.024 примерно в 6× дешевле на выходе, а Qwen 3.7 Max по $1.25/$3.75 — примерно в 1.6×; начните с них и переходите выше только там, где ваши eval-тесты показывают, что 3.8 Max себя оправдывает. Кроме того, она думает по умолчанию: шлюз QuickSilver Pro отправляет enable_thinking=false, чтобы рутинные вызовы не оплачивали скрытую цепочку рассуждений, — здесь это важнее, чем на более дешёвых моделях. Передайте enable_thinking=true там, где цепочка нужна, и закладывайте бюджет выходных токенов соответственно.

Быстрый старт (curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

Совместимо с OpenAI. Миграция в одну строку через base_url.

FAQ

$2.00 за 1M входных токенов и $6.00 за 1M выходных токенов, чтение кэшированного входа — $0.25 за 1M. Это опубликованная ставка самой Alibaba, переданная без изменений. Большая часть нашего каталога продаётся ниже рыночного ориентира, но эта модель существует только у Alibaba, поэтому нет более дешёвого маршрута, за счёт которого можно было бы дать скидку, и мы не делаем вид, что это не так: вы платите столько же, сколько у источника, с одним ключом и одним балансом на все остальные модели, которые у нас есть.

По списочным ценам — да, существенно: $2.00/$6.00 против $5.00/$30.00 у OpenAI за GPT-5.6 Sol — на 80% меньше на выходе — и против списочных $5.00/$25.00 у Anthropic за Claude Opus 5. Это разные модели из разных лабораторий, так что одна цена не должна решать вопрос; прогоните все три на своей нагрузке. Если хотите сравнить прямо в QuickSilver Pro, и GPT-5.6 Sol, и Claude Opus 5 доступны по тому же API-ключу и с того же баланса, так что переключение — это замена одной строки с названием модели.

Она думает по умолчанию. По замерам на живом endpoint в день запуска ответ на «Reply with exactly: OK» стоил 28 completion-токенов, из них 22 — невидимая цепочка рассуждений. Чтобы рутинные вызовы за это не платили, шлюз QuickSilver Pro по умолчанию отправляет enable_thinking=false. Передайте enable_thinking=true в теле запроса, чтобы включить размышления обратно, — это работает и для запросов без streaming, и со streaming, что верно не для каждой модели Qwen.

1M токенов контекста. По документации Alibaba, максимальный ввод — 991K токенов, он снижается до 983K при включённых размышлениях, а максимальный вывод — 131K токенов. Кэшированный вход тарифицируется по $0.25 за 1M вместо полных $2.00, так что длинный системный промпт или репозиторий, который остаётся в контексте от хода к ходу, на втором и последующих вызовах стоит намного меньше, чем на первом.

3.8 Max — более новая и гораздо более крупная модель (2.4T параметров против флагмана линейки 3.7), и Alibaba нацеливает её именно на автономный кодинг и долгосрочную агентную работу, где зрение — часть цикла планирования, а не просто формат ввода. Обе дают контекст 1M. 3.7 Max в 1.6× дешевле на выходе ($1.25/$3.75) и остаётся лучшим выбором по умолчанию для сложных рассуждений, которым не нужно работать без присмотра по несколько дней; переходите на 3.8 Max там, где ваши eval-тесты показывают, что поведение на длинном горизонте окупается.

На момент запуска — нет. Alibaba объявила, что веса Qwen 3.8 Max и меньшей Qwen 3.8-27B появятся примерно в течение недели после релиза 2026-08-03. До тех пор хостируемый API — единственный способ её запустить. Мы в любом случае продолжим отдавать её через тот же endpoint — в вашей интеграции ничего не изменится, если и когда веса выйдут.

Направьте OpenAI SDK на https://api.quicksilverpro.io/v1 и укажите в качестве модели qwen3.8-max. Streaming, tool / function calling и структурированный JSON-вывод работают на стандартном интерфейсе Chat Completions — вызовы инструментов были проверены на продакшене в день запуска. Каждый ответ содержит стандартный для OpenAI учёт usage, а также поле usage.cost, рассчитанное по публичным ценам выше, так что расходы можно сверять на стороне клиента без второго вызова API.

Попробуйте Qwen3.8 Max с удвоенным балансом — до $50 бонусных кредитов

Получить API Key