GPT-OSS 120B QuickSilver Pro पर
GPT-OSS 120B OpenAI का open-weight 117B mixture-of-experts मॉडल है — production agent stacks में सबसे ज़्यादा इस्तेमाल होने वाला open मॉडल। QuickSilver Pro पर इसकी कीमत $0.041 input / $0.187 output प्रति million tokens है, जो brand-name hosts की listed $0.15 / $0.60 से लगभग 70% कम है, 131,072-token context window के साथ। इस endpoint पर reasoning हमेशा चालू रहती है और बंद नहीं की जा सकती — `reasoning_effort` से गहराई नियंत्रित करें।
एक नज़र में
OpenAI के open-weight 117B MoE पर high-volume production agents — सैकड़ों अरब tokens पर परखा हुआ।
Pricing तुलना ($/1M tokens)
| Provider | Input | Output | QSP की तुलना में |
|---|---|---|---|
| QuickSilver Pro | $0.041 | $0.187 | — |
| OpenRouter की न्यूनतम rate (openai/gpt-oss-120b) | $0.037 | $0.17 | 10% महँगा |
| OpenAI (GPT-4o mini) | $0.15 | $0.60 | 69% कम |
कब इस्तेमाल करें
GPT-OSS 120B तब चुनें जब आपको open-model कीमतों पर OpenAI-स्तर की instruction following चाहिए: high-volume agent loops, tool-heavy automation, बड़े पैमाने पर background summarization और classification। इसका 117B MoE प्रति token केवल 5.1B parameters active करता है, इसलिए यह तेज़ है, और यह असली इस्तेमाल में परखा हुआ है — आज चल रहे कुछ सबसे बड़े public agent deployments इसी पर चलते हैं। Reasoning हमेशा चालू रहती है; गहराई और latency व लागत के बीच संतुलन के लिए `reasoning_effort` इस्तेमाल करें।
कब कोई और model चुनें
इसकी 131,072-token window मध्यम आकार की है — पूरे codebase के context के लिए GLM 5.3 Flash और Qwen3.8 27B उसी price class में कहीं बड़ी windows देते हैं। Frontier-स्तर की कठिन reasoning के लिए GPT-5.6 Sol या Claude Opus 5 पर जाएँ। यहाँ reasoning अनिवार्य है, इसलिए मामूली high-frequency calls भी thinking tokens खर्च करती हैं — DeepSeek V4 Flash ($0.086/$0.173) बिना overhead के सीधे जवाब देता है।
Quickstart (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-oss-120b",
"messages": [{"role": "user", "content": "Hello!"}]
}'OpenAI-संगत। base_url बदलकर एक लाइन में migration।
FAQ
Reasoning हमेशा चालू रहती है — इस endpoint पर यह अनिवार्य है और बंद नहीं की जा सकती (इसे बंद करने की कोशिश करने वाली request upstream पर reject हो जाती है)। गहराई और latency व लागत के बीच संतुलन के लिए `reasoning_effort` इस्तेमाल करें। Reasoning tokens output tokens के रूप में bill होते हैं और दिखने वाले जवाब से पहले आपके `max_tokens` budget में से लिए जाते हैं, इसलिए `max_tokens` खुलकर सेट करें, वरना जवाब कटा हुआ आ सकता है।
हाँ — वही open-weight 117B mixture-of-experts मॉडल जिसे OpenAI ने publish किया, एक hosted OpenAI-compatible endpoint के रूप में serve किया जाता है। आपको 120B-class infrastructure खुद चलाए बिना मॉडल मिलता है, streaming, tool calling, और आपके QuickSilver Pro balance पर per-token billing के साथ।
हाँ — QuickSilver Pro पर GPT-OSS 120B एक OpenAI-compatible chat completions endpoint है (Responses API भी काम करता है)। base_url=https://api.quicksilverpro.io/v1 सेट करें, अपनी QSP key paste करें, और model="gpt-oss-120b" इस्तेमाल करें। Streaming, tool calling, और usage.cost accounting सब काम करते हैं।
Brand-name hosts GPT-OSS 120B को $0.15 input / $0.60 output प्रति million tokens पर list करते हैं; QuickSilver Pro पर यह $0.041 / $0.187 है — उस tier से लगभग 70% कम, और सबसे सस्ती OpenRouter listings से करीब 10% ऊपर। वही OpenAI-compatible surface; migration के लिए बस base_url और key बदलें, और model ID से `openai/` provider prefix हटा दें।