होम/Models/Qwen3.8 Omni Flash
1M contextMultimodalReasoningResponses API

Qwen3.8 Omni Flash QuickSilver Pro पर

Qwen3.8 Omni Flash Qwen का पहला agentic omni मॉडल है — एक ही endpoint जो text के साथ image, audio और video को natively समझता है, जो कुछ देखता और सुनता है उस पर reasoning करता है, और लंबे workflows में tools चलाता है। इसमें family की पूरी 1M-token context window और 131K अधिकतम output बरकरार है। QuickSilver Pro पर यह $0.15 input / $0.47 output प्रति million tokens है — हर modality के लिए एक ही unified rate, Alibaba की अपनी first-party कीमत पर, और बाकी catalog वाली उसी OpenAI-compatible key और USD balance से उपलब्ध।

प्रति 1M tokens: input $0.15 · output $0.47
लेखक:Raullen Chai·अपडेट:

एक नज़र में

Context
1M tokens
Input / 1M
$0.15
Output / 1M
$0.47
Default में सोचता है
नहीं

एक omni endpoint पर agentic audio-video समझ — 1M-token window पर image, audio, video और tools।

Pricing तुलना ($/1M tokens)

ProviderInputOutputQSP की तुलना में
QuickSilver Pro$0.15$0.47—
Alibaba (qwen3.8-omni-flash)$0.15$0.47बराबर
OpenAI (GPT-4o)$2.50$10.0095% कम

कब इस्तेमाल करें

Qwen3.8 Omni Flash तब चुनें जब एक ही request को कई modalities पर reasoning करनी हो: किसी call को transcribe और summarise करना, लंबे video से मुख्य क्षण निकालना, किसी image का caption या QA करना, या ऐसा agent चलाना जो screen देखता है और tools के ज़रिए कार्रवाई करता है। हर input modality — text, image, audio, video — का बिल उसी कम per-token rate पर बनता है, इसलिए mixed-media pipelines सस्ती रहती हैं, और 1M-token window की वजह से लंबी recording या पूरा document set chunk किए जाने के बजाय context में बना रह सकता है। Alibaba इसे agentic delivery के लिए tune करता है, इसलिए यह content का केवल वर्णन नहीं करता बल्कि काम की योजना बनाकर उसे tools से पूरा करता है — इन्हें vendor के दावे मानें और अपने evals पर परखें।

कब कोई और model चुनें

सबसे कठिन single-shot text reasoning के लिए Qwen3.8 Max या GLM 5.3 पर जाएँ। अगर आपका workload बिना media का शुद्ध text है, तो omni machinery के बिना Qwen3.8 Flash Next सस्ता है। Flash tier को तेज़ रखने के लिए thinking डिफ़ॉल्ट रूप से बंद रखी जाती है; अगर आपको दिखने वाला reasoning trace चाहिए, तो enable_thinking=true पास करें और अतिरिक्त output tokens का budget रखें। अभी-अभी release हुआ मॉडल होने के कारण upstream revisions के साथ इसका व्यवहार बदल सकता है — अगर आपको frozen target चाहिए तो अपने evals pin करें।

Quickstart (curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-omni-flash",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

OpenAI-संगत। base_url बदलकर एक लाइन में migration।

FAQ

Text, images, audio और video, एक ही मॉडल में natively — यह हर modality को अलग pipeline पर route करने के बजाय जो कुछ देखता और सुनता है उस पर एक साथ reasoning करता है। Output text होता है। QuickSilver Pro पर हर input modality का बिल उसी $0.15 प्रति million tokens पर बनता है: Alibaba हर modality को tokenise करके एक ही unified input कीमत लेता है, इसलिए audio या video के लिए अलग rate का budget रखने की ज़रूरत नहीं।

$0.15 input / $0.47 output प्रति million tokens, और cached input reads $0.016 पर — text, image, audio और video के लिए एक ही unified rate। यह Alibaba की अपनी first-party list के बराबर है; QuickSilver Pro इसमें पूरे catalog के लिए एक OpenAI-compatible key और एक USD balance जोड़ता है, और अलग Alibaba account बनाने की ज़रूरत नहीं रहती। Migration सिर्फ़ base_url + key बदलना है।

हाँ — पूरी 1M-token window, प्रति call 131K तक output tokens के साथ, और यह text के साथ-साथ media पर भी लागू होती है: लंबी video या audio file, tokenise होने के बाद, उसी window को साझा करती है। Long-context calls का बिल उसी flat $0.15 प्रति million input tokens पर बनता है।

हाँ — Qwen3.8 Omni Flash QuickSilver Pro पर एक OpenAI-compatible Chat Completions endpoint है (Responses API भी काम करता है)। base_url=https://api.quicksilverpro.io/v1 सेट करें, अपनी QSP key paste करें, और model="qwen3.8-omni-flash" इस्तेमाल करें। Multimodal content parts, streaming, tool calling और usage.cost accounting, सभी काम करते हैं। Thinking डिफ़ॉल्ट रूप से बंद है; दिखने वाला reasoning trace पाने के लिए enable_thinking=true पास करें।

Qwen3.8 Omni Flash को double credits के साथ आज़माएँ — $50 तक bonus credits

API Key पाएँ