GPT-OSS 120B в QuickSilver Pro
GPT-OSS 120B — модель OpenAI с открытыми весами, mixture-of-experts на 117B параметров и самая используемая открытая модель в продакшен-стеках агентов. На QuickSilver Pro она стоит $0.041 за вход / $0.187 за выход за миллион токенов — примерно на 70% ниже $0.15 / $0.60, которые указывают именитые хостинги, — с контекстным окном на 131,072 токенов. Reasoning на этом endpoint включён всегда и не отключается — глубиной управляет `reasoning_effort`.
Коротко
Массовые продакшен-агенты на открытой 117B MoE-модели OpenAI — проверено на сотнях миллиардов токенов.
Сравнение цен ($/1M токенов)
| Провайдер | Вход | Выход | к QSP |
|---|---|---|---|
| QuickSilver Pro | $0.041 | $0.187 | — |
| Нижняя цена OpenRouter (openai/gpt-oss-120b) | $0.037 | $0.17 | на 10% дороже |
| OpenAI (GPT-4o mini) | $0.15 | $0.60 | на 69% ниже |
Когда использовать
Берите GPT-OSS 120B, когда нужно следование инструкциям уровня OpenAI по ценам открытых моделей: массовые агентные циклы, автоматизация с интенсивной работой с инструментами, фоновая суммаризация и классификация в больших объёмах. Её 117B MoE активирует всего 5.1B параметров на токен, поэтому она быстрая, и она проверена в бою — на ней работают одни из крупнейших публичных агентных развёртываний на сегодня. Reasoning включён всегда; используйте `reasoning_effort`, чтобы выбрать баланс между глубиной, задержкой и стоимостью.
Когда выбрать другую модель
Её окно на 131,072 токенов — среднего размера: для контекста на всю кодовую базу GLM 5.3 Flash и Qwen3.8 27B предлагают тот же ценовой класс с гораздо большими окнами. Для рассуждений передовой сложности переходите на GPT-5.6 Sol или Claude Opus 5. Reasoning здесь обязателен, поэтому тривиальные частые вызовы тратят токены на размышления — DeepSeek V4 Flash ($0.086/$0.173) отвечает сразу, без этих накладных расходов.
Быстрый старт (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-oss-120b",
"messages": [{"role": "user", "content": "Hello!"}]
}'Совместимо с OpenAI. Миграция в одну строку через base_url.
FAQ
Reasoning включён всегда — на этом endpoint он обязателен и не отключается (запрос, который пытается его выключить, отклоняется на стороне апстрима). Используйте `reasoning_effort`, чтобы выбрать баланс между глубиной, задержкой и стоимостью. Reasoning-токены тарифицируются как выходные и расходуются из бюджета `max_tokens` до видимого ответа, поэтому задавайте `max_tokens` с запасом, иначе ответ может вернуться обрезанным.
Да — та самая mixture-of-experts-модель на 117B с открытыми весами, опубликованная OpenAI, которая обслуживается как хостируемый OpenAI-совместимый endpoint. Вы получаете модель, не разворачивая у себя инфраструктуру класса 120B, — со streaming, tool calling и потокенной оплатой с баланса QuickSilver Pro.
Да — GPT-OSS 120B на QuickSilver Pro представляет собой OpenAI-совместимый endpoint chat completions (Responses API тоже работает). Укажите base_url=https://api.quicksilverpro.io/v1, вставьте свой ключ QSP и используйте model="gpt-oss-120b". Streaming, tool calling и учёт usage.cost работают.
Именитые хостинги указывают для GPT-OSS 120B $0.15 за вход / $0.60 за выход за миллион токенов; на QuickSilver Pro — $0.041 / $0.187: примерно на 70% ниже этого уровня и около 10% выше самых дешёвых предложений на OpenRouter. Тот же OpenAI-совместимый интерфейс; миграция — это замена base_url и ключа, а из ID модели нужно убрать префикс провайдера `openai/`.