Qwen3.8 Max QuickSilver Pro पर
Qwen 3.8 Max, Alibaba का August 2026 का flagship है और उसका अब तक ship किया गया सबसे बड़ा मॉडल — mixture-of-experts में 2.4 trillion parameters, 1M-token context window, और text, image तथा video input। Alibaba इसे chat के बजाय autonomous coding और long-horizon agentic काम के लिए position करता है। QuickSilver Pro पर यह $2.00 input / $6.00 output प्रति 1M tokens है — Alibaba का अपना प्रकाशित rate, बिना किसी markup के आगे दिया गया — और पूरे catalog के लिए एक ही OpenAI-compatible key।
एक नज़र में
Autonomous coding + long-horizon agents — Alibaba का सबसे बड़ा मॉडल, 1M context, उसकी अपनी list price पर।
Pricing तुलना ($/1M tokens)
| Provider | Input | Output | QSP की तुलना में |
|---|---|---|---|
| QuickSilver Pro | $2.00 | $6.00 | — |
| Alibaba (qwen3.8-max) | $2.00 | $6.00 | बराबर |
| OpenAI (GPT-5.6 Sol) | $5.00 | $30.00 | 80% कम |
कब इस्तेमाल करें
3.8 Max उस काम के लिए चुनें जो लंबे समय तक बिना निगरानी के चलता है: कई दिनों तक चलने वाले coding agents, सैकड़ों turns तक फैले planning loops, और ऐसे काम जहाँ agent को दोबारा prompt किए जाने के बजाय अपनी गलतियाँ खुद पकड़कर रास्ता सुधारना होता है। Alibaba की launch सामग्री कई दिनों के autonomous development runs और सैकड़ों turns के planning loops का वर्णन करती है, और vision path को केवल input नहीं बल्कि planning और self-correction के feedback loop के रूप में पेश करती है — इन्हें vendor के दावे मानें और अपने evals पर परखें। 1M context का मतलब है कि बड़ी repository या लंबा trace हर turn पर दोबारा summarise होने के बजाय context में बना रह सकता है।
कब कोई और model चुनें
यह range का सबसे ऊपरी मॉडल है और कीमत भी वैसी ही है। रोज़मर्रा की chat, codegen या production agents के लिए $0.256/$1.024 पर Qwen 3.7 Plus output पर लगभग 6× सस्ता है और $1.25/$3.75 पर Qwen 3.7 Max लगभग 1.6× सस्ता — वहीं से शुरू करें और ऊपर तभी जाएँ जब आपके evals दिखाएँ कि 3.8 Max अपनी कीमत वसूल रहा है। यह डिफ़ॉल्ट रूप से सोचता भी है: QuickSilver Pro gateway enable_thinking=false भेजता है ताकि रोज़मर्रा की calls पर छिपे reasoning trace का बिल न बने, और यह बात कम लागत वाले models की तुलना में यहाँ ज़्यादा मायने रखती है। जहाँ आपको trace चाहिए वहाँ enable_thinking=true पास करें, और output tokens का budget उसी हिसाब से रखें।
Quickstart (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [{"role": "user", "content": "Hello!"}]
}'OpenAI-संगत। base_url बदलकर एक लाइन में migration।
FAQ
प्रति 1M input tokens $2.00 और प्रति 1M output tokens $6.00, cached input reads $0.25 प्रति 1M पर। यह Alibaba का अपना प्रकाशित rate है, बिना बदलाव के आगे दिया गया। हमारा ज़्यादातर catalog market reference से नीचे बिकता है, लेकिन यह मॉडल केवल Alibaba के पास उपलब्ध है, इसलिए discount के लिए कोई सस्ता route नहीं है और हम ऐसा दिखावा भी नहीं करते — आप वही चुकाते हैं जो स्रोत पर चुकाते, और साथ में हमारे बाकी सभी models के लिए एक ही key और एक ही balance मिलता है।
List prices पर, हाँ, काफ़ी कम: $2.00/$6.00, जबकि GPT-5.6 Sol के लिए OpenAI का $5.00/$30.00 — output पर 80% कम — और Claude Opus 5 के लिए Anthropic की $5.00/$25.00 list। ये अलग-अलग labs के अलग-अलग models हैं, इसलिए फ़ैसला केवल कीमत से नहीं होना चाहिए; तीनों को अपने workload पर benchmark करें। अगर आप सीधे QuickSilver Pro पर तुलना करना चाहते हैं, तो GPT-5.6 Sol और Claude Opus 5 दोनों उसी API key और उसी balance पर हैं, इसलिए switch करना model string की एक line का बदलाव है।
यह डिफ़ॉल्ट रूप से सोचता है। Launch के दिन live endpoint पर मापने पर, "Reply with exactly: OK" का जवाब देने में 28 completion tokens लगे, जिनमें से 22 अदृश्य reasoning trace के थे। रोज़मर्रा की calls पर इसका बिल न बने, इसके लिए QuickSilver Pro gateway डिफ़ॉल्ट रूप से enable_thinking=false भेजता है। वापस चालू करने के लिए request body में enable_thinking=true पास करें — यह streaming के साथ-साथ non-streaming requests पर भी काम करता है, जो हर Qwen मॉडल के लिए सच नहीं है।
1M tokens का context। Alibaba के documentation के अनुसार अधिकतम input 991K tokens है, जो thinking चालू होने पर घटकर 983K रह जाता है, और अधिकतम output 131K tokens है। Cached input का बिल पूरे $2.00 के बजाय $0.25 प्रति 1M पर बनता है, इसलिए लंबा system prompt या कई turns तक context में रखी गई repository दूसरी और उसके बाद की calls पर पहली की तुलना में कहीं कम खर्चीली पड़ती है।
3.8 Max नया और कहीं बड़ा मॉडल है — 3.7 line के flagship के मुकाबले 2.4T parameters — और Alibaba इसे खास तौर पर autonomous coding और long-horizon agentic काम के लिए लक्षित करता है, जहाँ vision केवल एक input format नहीं बल्कि planning loop का हिस्सा है। दोनों 1M context देते हैं। 3.7 Max output पर 1.6× सस्ता है ($1.25/$3.75) और उस कठिन reasoning के लिए बेहतर डिफ़ॉल्ट बना हुआ है जिसे कई दिनों तक बिना निगरानी के चलाने की ज़रूरत नहीं होती; 3.8 Max पर तभी जाएँ जब आपके evals दिखाएँ कि longer-horizon व्यवहार अपनी कीमत वसूल रहा है।
Launch के समय नहीं। Alibaba ने घोषणा की थी कि Qwen 3.8 Max और छोटे Qwen 3.8-27B के weights 2026-08-03 की release के लगभग एक सप्ताह के भीतर आएँगे। तब तक इसे चलाने का एकमात्र तरीका hosted API है। दोनों ही स्थितियों में हम इसे उसी endpoint से serve करते रहेंगे — weights आएँ या जब भी आएँ, आपके integration में कुछ नहीं बदलता।
OpenAI SDK को https://api.quicksilverpro.io/v1 पर point करें और model string को qwen3.8-max पर सेट करें। Streaming, tool / function calling और structured JSON output, सभी standard Chat Completions surface पर काम करते हैं — tool calls को launch के दिन production पर verify किया गया था। हर response में OpenAI-standard usage accounting के साथ एक usage.cost field होता है, जो ऊपर दी गई सार्वजनिक कीमतों से गणना किया जाता है, ताकि आप दूसरी API call के बिना client-side पर खर्च का मिलान कर सकें।