Qwen3.8 Max в QuickSilver Pro
Qwen 3.8 Max — флагман Alibaba от августа 2026 года и самая крупная модель, которую компания выпускала: 2.4 триллиона параметров в архитектуре mixture-of-experts, контекстное окно 1M токенов и ввод текста, изображений и видео. Alibaba позиционирует её для автономного кодинга и долгосрочной агентной работы, а не для чата. В QuickSilver Pro она стоит $2.00 за вход / $6.00 за выход за 1M токенов — это опубликованная ставка самой Alibaba, переданная без наценки, — с одним OpenAI-совместимым ключом на весь каталог.
Коротко
Автономный кодинг + долгосрочные агенты — самая крупная модель Alibaba, контекст 1M, по её собственной списочной цене.
Сравнение цен ($/1M токенов)
| Провайдер | Вход | Выход | к QSP |
|---|---|---|---|
| QuickSilver Pro | $2.00 | $6.00 | — |
| Alibaba (qwen3.8-max) | $2.00 | $6.00 | так же |
| OpenAI (GPT-5.6 Sol) | $5.00 | $30.00 | на 80% ниже |
Когда использовать
Выбирайте 3.8 Max для работы, которая долго идёт без присмотра: многодневные кодинг-агенты, циклы планирования на сотни ходов и задачи, где агент должен сам замечать свои ошибки и корректировать курс, а не ждать нового промпта. В материалах Alibaba к запуску описаны многодневные автономные прогоны разработки и циклы планирования в сотни ходов, а зрение подаётся как контур обратной связи для планирования и самокоррекции, а не просто как ввод — относитесь к этому как к заявлениям вендора и сверяйте со своими eval-тестами. Контекст 1M означает, что большой репозиторий или длинная трасса могут оставаться в памяти, а не пересказываться заново на каждом ходу.
Когда выбрать другую модель
Это верх линейки, и цена соответствующая. Для рутинного чата, генерации кода и продакшен-агентов Qwen 3.7 Plus по $0.256/$1.024 примерно в 6× дешевле на выходе, а Qwen 3.7 Max по $1.25/$3.75 — примерно в 1.6×; начните с них и переходите выше только там, где ваши eval-тесты показывают, что 3.8 Max себя оправдывает. Кроме того, она думает по умолчанию: шлюз QuickSilver Pro отправляет enable_thinking=false, чтобы рутинные вызовы не оплачивали скрытую цепочку рассуждений, — здесь это важнее, чем на более дешёвых моделях. Передайте enable_thinking=true там, где цепочка нужна, и закладывайте бюджет выходных токенов соответственно.
Быстрый старт (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{"role": "user", "content": "Hello!"}]
}'Совместимо с OpenAI. Миграция в одну строку через base_url.
FAQ
$2.00 за 1M входных токенов и $6.00 за 1M выходных токенов, чтение кэшированного входа — $0.25 за 1M. Это опубликованная ставка самой Alibaba, переданная без изменений. Большая часть нашего каталога продаётся ниже рыночного ориентира, но эта модель существует только у Alibaba, поэтому нет более дешёвого маршрута, за счёт которого можно было бы дать скидку, и мы не делаем вид, что это не так: вы платите столько же, сколько у источника, с одним ключом и одним балансом на все остальные модели, которые у нас есть.
По списочным ценам — да, существенно: $2.00/$6.00 против $5.00/$30.00 у OpenAI за GPT-5.6 Sol — на 80% меньше на выходе — и против списочных $5.00/$25.00 у Anthropic за Claude Opus 5. Это разные модели из разных лабораторий, так что одна цена не должна решать вопрос; прогоните все три на своей нагрузке. Если хотите сравнить прямо в QuickSilver Pro, и GPT-5.6 Sol, и Claude Opus 5 доступны по тому же API-ключу и с того же баланса, так что переключение — это замена одной строки с названием модели.
Она думает по умолчанию. По замерам на живом endpoint в день запуска ответ на «Reply with exactly: OK» стоил 28 completion-токенов, из них 22 — невидимая цепочка рассуждений. Чтобы рутинные вызовы за это не платили, шлюз QuickSilver Pro по умолчанию отправляет enable_thinking=false. Передайте enable_thinking=true в теле запроса, чтобы включить размышления обратно, — это работает и для запросов без streaming, и со streaming, что верно не для каждой модели Qwen.
1M токенов контекста. По документации Alibaba, максимальный ввод — 991K токенов, он снижается до 983K при включённых размышлениях, а максимальный вывод — 131K токенов. Кэшированный вход тарифицируется по $0.25 за 1M вместо полных $2.00, так что длинный системный промпт или репозиторий, который остаётся в контексте от хода к ходу, на втором и последующих вызовах стоит намного меньше, чем на первом.
3.8 Max — более новая и гораздо более крупная модель (2.4T параметров против флагмана линейки 3.7), и Alibaba нацеливает её именно на автономный кодинг и долгосрочную агентную работу, где зрение — часть цикла планирования, а не просто формат ввода. Обе дают контекст 1M. 3.7 Max в 1.6× дешевле на выходе ($1.25/$3.75) и остаётся лучшим выбором по умолчанию для сложных рассуждений, которым не нужно работать без присмотра по несколько дней; переходите на 3.8 Max там, где ваши eval-тесты показывают, что поведение на длинном горизонте окупается.
На момент запуска — нет. Alibaba объявила, что веса Qwen 3.8 Max и меньшей Qwen 3.8-27B появятся примерно в течение недели после релиза 2026-08-03. До тех пор хостируемый API — единственный способ её запустить. Мы в любом случае продолжим отдавать её через тот же endpoint — в вашей интеграции ничего не изменится, если и когда веса выйдут.
Направьте OpenAI SDK на https://api.quicksilverpro.io/v1 и укажите в качестве модели qwen3.8-max. Streaming, tool / function calling и структурированный JSON-вывод работают на стандартном интерфейсе Chat Completions — вызовы инструментов были проверены на продакшене в день запуска. Каждый ответ содержит стандартный для OpenAI учёт usage, а также поле usage.cost, рассчитанное по публичным ценам выше, так что расходы можно сверять на стороне клиента без второго вызова API.