Gemini 3.5 Flash QuickSilver Pro पर
Gemini 3.5 Flash Google का next-generation Flash मॉडल है — GA (preview नहीं), 1M-token context, डिफ़ॉल्ट रूप से सोचता है। क्षमता और कीमत दोनों में यह 3 Flash Preview और 3.1 Pro Preview के बीच आता है। QuickSilver Pro पर इसकी कीमत प्रति 1M tokens $1.275 input / $7.65 output है, यानी Vertex retail और OpenRouter की कीमत से ~15% कम; उनकी कीमत है $1.50/$9.00। QuickSilver Pro के ज़रिए 3.5 Flash में thinking हमेशा चालू रहती है; बिना thinking वाले Gemini के लिए 3.1 Flash Lite ($0.2125/$1.275) इस्तेमाल करें।
एक नज़र में
Production-grade reasoning Flash — 3.x quality के साथ GA stability, लागत में 3 Flash और 3.1 Pro के बीच।
Pricing तुलना ($/1M tokens)
| Provider | Input | Output | QSP की तुलना में |
|---|---|---|---|
| QuickSilver Pro | $1.275 | $7.65 | सबसे कम कीमत |
| OpenRouter (google/gemini-3.5-flash) | $1.50 | $9.00 | 15% कम |
| OpenAI (GPT-4o) | $2.50 | $10.00 | 23% कम |
कब इस्तेमाल करें
3.5 Flash तब चुनें जब आपको ऐसे GA मॉडल पर 3.x-quality reasoning चाहिए जिसकी semantics आपके नीचे से नहीं बदलेगी: production agentic loops जिनमें हर turn पर non-trivial reasoning हो, coding agents जिन्हें ज़्यादा मज़बूत Flash quality चाहिए, और long-context analysis जहाँ एक turn की thinking का खर्च स्वीकार्य हो। GA label का मतलब है कि Google ने stable behavior और pricing का वादा किया है — इसे revenue-critical paths में ship करना ठीक है, 3 Flash Preview या 3.1 Pro Preview के उलट।
कब कोई और model चुनें
Routine high-volume chat के लिए 3.1 Flash Lite ($0.2125/$1.275) काफ़ी सस्ता है। Top-tier reasoning के लिए, जहाँ 3.1 Pro की गहरी thinking मायने रखती है, Pro preview ही सही अगला कदम है। बिना thinking वाले Gemini (predictable token budgets) के लिए केवल Flash Lite बिना reasoning के आता है — 3.5 Flash डिफ़ॉल्ट रूप से सोचता है और `reasoning.enabled=false` चुपचाप drop कर दिया जाता है।
Quickstart (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash",
"messages": [{"role": "user", "content": "Hello!"}]
}'OpenAI-संगत। base_url बदलकर एक लाइन में migration।
FAQ
3.5 Flash GA है — Google ने stable output formats, pricing और behavior का वादा किया है। 3 Flash Preview बिना सूचना के बदल सकता है। 3.5 Flash ~2.5-3x महंगा भी है (प्रति 1M $1.275/$7.65 बनाम 3 Flash Preview के $0.425/$2.55), जो ज़्यादा मज़बूत reasoning quality और production stability को दर्शाता है। अपने task पर side-by-side evals चलाएँ; prototyping के लिए Preview ठीक है, ship करने के लिए 3.5 इस्तेमाल करें।
3.1 Pro Preview flagship reasoning tier है — गहरी thinking, ज़्यादा कठिन समस्याएँ, Vertex retail पर प्रति 1M $2/$12। 3.5 Flash production Flash tier है — मज़बूत reasoning, कम लागत ($1.50/$9 Vertex retail), और GA-stable। जिस production traffic को reasoning चाहिए उसके लिए 3.5 Flash इस्तेमाल करें; सबसे कठिन reasoning tasks पर evals के लिए 3.1 Pro पर जाएँ। दोनों डिफ़ॉल्ट रूप से सोचते हैं; QuickSilver Pro के ज़रिए अभी किसी में भी thinking बंद करने का toggle उपलब्ध नहीं है।
QuickSilver Pro पर 3.5 Flash की कीमत प्रति 1M tokens $1.275 input / $7.65 output है — Vertex retail और OpenRouter की कीमत से ~15% कम; उनकी कीमत है $1.50/$9.00। एक bill, 14 models के लिए एक OpenAI-compatible key, referral rewards, और हर response पर `usage.cost` accounting।