होम/Models/DeepSeek V4.1 Flash
1M contextReasoningResponses API

DeepSeek V4.1 Flash QuickSilver Pro पर

DeepSeek V4.1 Flash DeepSeek का V4.1 Flash है: एक नया model architecture जो V4 Flash से तेज़ और ज़्यादा सक्षम है, 1M-token context और Codex के लिए native Responses API के साथ। QuickSilver Pro इसे FP8 precision पर $0.125 / $0.55 प्रति million tokens में serve करता है — DeepSeek के अपने peak-hour list rate के आधे से भी कम।

प्रति 1M tokens: input $0.125 · output $0.55
लेखक:Raullen Chai·अपडेट:

एक नज़र में

Context
1M tokens
Input / 1M
$0.125
Output / 1M
$0.55
Default में सोचता है
हाँ

Codex, agentic coding और long-context automation के लिए DeepSeek का सबसे नया Flash architecture।

Pricing तुलना ($/1M tokens)

ProviderInputOutputQSP की तुलना में
QuickSilver Pro$0.125$0.55सबसे कम कीमत
DeepSeek की list price (DeepSeek API)$0.30$1.2054% कम
OpenAI (GPT-4o-mini)$0.15$0.608% कम

कब इस्तेमाल करें

V4.1 Flash तब चुनें जब आपको Codex, agentic coding, multi-step tool use और long-context automation के लिए DeepSeek का नवीनतम Flash architecture चाहिए — V4 Flash से तेज़ responses और बेहतर coding/tool use। आधिकारिक build एक stable QSP model ID के तहत OpenAI Chat Completions और Responses API, दोनों तरह के clients को support करता है।

कब कोई और model चुनें

जमे-जमाए, सबसे कम लागत वाले workhorse के लिए V4 Flash ($0.086/$0.173) सस्ता है। वाकई कठिन reasoning के लिए V4 Pro पर जाएँ। V4.1 Flash यहाँ केवल text लेता है — अगर आपको image input चाहिए, तो हमारे 68 models में से 35 उसे स्वीकार करते हैं।

Quickstart (curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

OpenAI-संगत। base_url बदलकर एक लाइन में migration।

FAQ

V4.1 Flash DeepSeek का नया Flash architecture है — coding और tool use में तेज़ और ज़्यादा सक्षम। V4 Flash ($0.086/$0.173) जमा-जमाया, सबसे कम लागत वाला विकल्प बना हुआ है। दोनों डिफ़ॉल्ट रूप से सोचते हैं और OpenAI Chat Completions तथा Responses APIs उपलब्ध कराते हैं।

V4.1 Flash डिफ़ॉल्ट रूप से reasoning करता है। Chat Completions के ज़रिए सीधी, बिना thinking वाली chat के लिए `reasoning: { enabled: false }` पास करें; Responses API clients गहराई नियंत्रित करने के लिए `reasoning.effort` सेट कर सकते हैं।

हाँ। base_url=https://api.quicksilverpro.io/v1 को model="deepseek-v4.1-flash" के साथ इस्तेमाल करें। QSP `/v1/chat/completions` और `/v1/responses` दोनों उपलब्ध कराता है; Codex में `wire_api = "responses"` इस्तेमाल करें।

DeepSeek V4.1 Flash को double credits के साथ आज़माएँ — $50 तक bonus credits

API Key पाएँ