Gemini 3.5 Flash в QuickSilver Pro
Gemini 3.5 Flash — Flash-модель Google нового поколения: GA (не preview), контекст 1M токенов, думает по умолчанию. По возможностям и по цене стоит между 3 Flash Preview и 3.1 Pro Preview. В QuickSilver Pro она стоит $1.275 за входные / $7.65 за выходные токены за 1M токенов — примерно на 15% ниже розничной цены Vertex и цены OpenRouter $1.50/$9.00. Через QuickSilver Pro thinking у 3.5 Flash включён всегда; если нужна Gemini без thinking, используйте 3.1 Flash Lite ($0.2125/$1.275).
Коротко
Reasoning-модель Flash production-уровня — стабильность GA при качестве 3.x, по цене между 3 Flash и 3.1 Pro.
Сравнение цен ($/1M токенов)
| Провайдер | Вход | Выход | к QSP |
|---|---|---|---|
| QuickSilver Pro | $1.275 | $7.65 | самая низкая цена |
| OpenRouter (google/gemini-3.5-flash) | $1.50 | $9.00 | на 15% ниже |
| OpenAI (GPT-4o) | $2.50 | $10.00 | на 23% ниже |
Когда использовать
Выбирайте 3.5 Flash, когда нужен reasoning уровня 3.x на GA-модели, семантика которой не изменится у вас под ногами: production-агентные циклы с нетривиальным рассуждением на каждом шаге, coding-агенты, которым нужно более сильное качество Flash, анализ длинного контекста, где расходы на thinking за один ход приемлемы. Метка GA означает, что Google взял обязательство по стабильности поведения и цен, — модель можно выпускать в критичных для выручки сценариях, в отличие от 3 Flash Preview или 3.1 Pro Preview.
Когда выбрать другую модель
Для рутинного массового чата 3.1 Flash Lite ($0.2125/$1.275) стоит гораздо меньше. Для reasoning высшего уровня, где важно более глубокое мышление 3.1 Pro, правильный следующий шаг — Pro preview. Если нужна Gemini без thinking (предсказуемые бюджеты токенов), без reasoning поставляется только Flash Lite — 3.5 Flash думает по умолчанию, а `reasoning.enabled=false` молча отбрасывается.
Быстрый старт (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash",
"messages": [{"role": "user", "content": "Hello!"}]
}'Совместимо с OpenAI. Миграция в одну строку через base_url.
FAQ
3.5 Flash — это GA: Google взял обязательство по стабильности форматов вывода, цен и поведения. 3 Flash Preview может измениться без предупреждения. Кроме того, 3.5 Flash примерно в 2.5-3 раза дороже ($1.275/$7.65 за 1M против $0.425/$2.55 у 3 Flash Preview), что отражает более сильный reasoning и production-стабильность. Прогоните сравнительные evals на своей задаче; для прототипирования подойдёт Preview, для выпуска в продакшен берите 3.5.
3.1 Pro Preview — флагманский уровень reasoning: более глубокое мышление, более сложные задачи, $2/$12 за 1M по розничной цене Vertex. 3.5 Flash — production-уровень Flash: сильный reasoning, меньшая стоимость ($1.50/$9 по розничной цене Vertex) и стабильность GA. Используйте 3.5 Flash для production-трафика, которому нужен reasoning; переходите на 3.1 Pro для evals на самых сложных reasoning-задачах. Обе модели думают по умолчанию; переключателя для отключения thinking через QuickSilver Pro пока нет ни у одной.
В QuickSilver Pro 3.5 Flash стоит $1.275 за входные / $7.65 за выходные токены за 1M токенов — примерно на 15% ниже розничной цены Vertex и цены OpenRouter $1.50/$9.00. Один счёт, один OpenAI-совместимый ключ на 14 моделей, реферальные вознаграждения и учёт `usage.cost` в каждом ответе.