होम/Models/Qwen3.8 Flash Next
1M contextResponses API

Qwen3.8 Flash Next QuickSilver Pro पर

Qwen3.8 Flash Next Qwen4 architecture का Alibaba का open-weight preview है — एक 6B-active mixture-of-experts मॉडल, family की पूरी 1M-token context window और 131K अधिकतम output के साथ। QuickSilver Pro पर यह $0.12 input / $0.376 output प्रति million tokens है, Alibaba की अपनी list price से ~20% कम, जो है $0.15 / $0.47।

प्रति 1M tokens: input $0.12 · output $0.376
लेखक:Raullen Chai·अपडेट:

एक नज़र में

Context
1M tokens
Input / 1M
$0.12
Output / 1M
$0.376
Default में सोचता है
नहीं

Repo-scale context पर next-generation Qwen चलाने का सबसे सस्ता तरीका — 1M-token window वाला 6B-active MoE।

Pricing तुलना ($/1M tokens)

ProviderInputOutputQSP की तुलना में
QuickSilver Pro$0.12$0.376सबसे कम कीमत
Alibaba (qwen/qwen3.8-flash)$0.15$0.4720% कम
OpenAI (GPT-4o mini)$0.15$0.6037% कम

कब इस्तेमाल करें

Qwen3.8 Flash Next उन high-volume agent और coding workloads के लिए चुनें जहाँ प्रति call लागत और working set का आकार सबसे अहम हैं: long-context refactors, document pipelines, और cache-heavy agents जो एक ही context को बार-बार पढ़ते हैं। इसकी 6B-active routing latency और कीमत कम रखती है, जबकि Qwen4-preview stack agentic कामों को लक्षित करता है, और पूरी 1M-token window उसी route पर serve होती है जो इसे वाकई लागू करता है।

कब कोई और model चुनें

सबसे कठिन single-shot reasoning के लिए Qwen3.8 Max या GLM 5.3 पर जाएँ। Preview-lineage release होने के कारण upstream revisions के साथ इसका व्यवहार बदल सकता है — अगर आपको frozen target चाहिए तो अपने evals pin करें। Output का बिल $0.376 प्रति million पर बनता है, इसलिए output-heavy generation के लिए फ़ैसला करने से पहले DeepSeek V4 Flash और Qwen3.8 27B से तुलना करें।

Quickstart (curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

OpenAI-संगत। base_url बदलकर एक लाइन में migration।

FAQ

Qwen3.8 Flash Next Alibaba के next-generation Qwen4 attention stack पर बनी एक शुरुआती open-weight release है, जिसे 6B-active MoE footprint पर long-context agentic workloads के लिए tune किया गया है। यह पूरी Qwen4 line से पहले ship हुई है, इसलिए इसे frozen production target नहीं, तेज़ी से बदलता preview मानें।

हाँ — पूरी 1,000,000-token window, प्रति call 131K तक output tokens के साथ, और QuickSilver Pro वही route serve करता है जो इन limits को वाकई लागू करता है। Long-context calls का बिल उसी flat $0.12 प्रति million input tokens पर बनता है।

हाँ — Qwen3.8 Flash Next QuickSilver Pro पर एक OpenAI-compatible chat completions endpoint है (Responses API भी काम करता है)। base_url=https://api.quicksilverpro.io/v1 सेट करें, अपनी QSP key paste करें, और model="qwen3.8-flash-next" इस्तेमाल करें। Streaming, tool calling और usage.cost accounting, सभी काम करते हैं।

Alibaba Qwen3.8 Flash Next को $0.15 input / $0.47 output प्रति million tokens पर list करता है; QuickSilver Pro $0.12 / $0.376 है, input और output दोनों पर ~20% कम। वही OpenAI-compatible surface; migration सिर्फ़ base_url + key बदलना और model ID से `qwen/` provider prefix हटाना है।

Qwen3.8 Flash Next को double credits के साथ आज़माएँ — $50 तक bonus credits

API Key पाएँ