होम/Models/Nemotron 3 Ultra
262K contextResponses API

Nemotron 3 Ultra QuickSilver Pro पर

Nemotron 3 Ultra NVIDIA का open frontier-reasoning मॉडल है: 550B-parameter Mixture-of-Experts, प्रति token 55B active parameters के साथ, जो गहरी reasoning और agent orchestration के लिए hybrid Transformer-Mamba architecture पर बना है। QuickSilver Pro 262K-token context देता है, $0.50 input / $2.20 output प्रति million tokens पर, zero data retention के साथ — सबसे कम stable paid market rate के बराबर।

प्रति 1M tokens: input $0.50 · output $2.20
लेखक:Raullen Chai·अपडेट:

एक नज़र में

Context
262K tokens
Input / 1M
$0.50
Output / 1M
$2.20
Default में सोचता है
नहीं

कठिन reasoning और multi-step agents के लिए NVIDIA का सबसे बड़ा open मॉडल — कुल 550B parameters, प्रति token 55B active, और 262K context।

Pricing तुलना ($/1M tokens)

ProviderInputOutputQSP की तुलना में
QuickSilver Pro$0.50$2.20—
बाज़ार मूल्य (public paid rate)$0.50$2.20बराबर

कब इस्तेमाल करें

Nemotron 3 Ultra तब इस्तेमाल करें जब किसी open-weight मॉडल को कठिन काम उठाना हो: multi-step planning, दूसरे agents और tools का orchestration, लंबे विश्लेषणात्मक जवाब, और ऐसे coding tasks जहाँ छोटे efficiency मॉडल की गहराई कम पड़ जाती है। यह function calling और JSON Schema structured output को support करता है, और cached input की कीमत $0.10 प्रति million tokens है।

कब कोई और model चुनें

यह बड़ा मॉडल है और efficiency models की तुलना में धीरे generate करता है, इसलिए latency-sensitive chat या high-volume सरल extraction के लिए यह ठीक नहीं बैठता — उनके लिए Nemotron 3.5 Lightning इस्तेमाल करें। एक response अधिकतम 16,384 output tokens तक सीमित है। QSP endpoint केवल text लेता है और फ़िलहाल zero data retention के साथ 262K-token context की गारंटी देता है।

Quickstart (curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nemotron-3-ultra",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

OpenAI-संगत। base_url बदलकर एक लाइन में migration।

FAQ

$0.50 प्रति million input tokens, $2.20 प्रति million output tokens, और $0.10 प्रति million cached-input tokens — सबसे कम stable paid market rate के बराबर, बिना किसी markup के।

ये दोनों एक ही परिवार के दो विपरीत छोरों पर हैं। Lightning 30B का मॉडल है जिसमें 3B active parameters हैं, और यह speed और लागत के लिए tune किया गया है। Ultra 550B का मॉडल है जिसमें 55B active parameters हैं, और यह reasoning की गहराई और orchestration के लिए tune किया गया है। Lightning से शुरू करें और जब आपकी evaluations दिखाएँ कि छोटा मॉडल fail हो रहा है, तब Ultra पर जाएँ।

हाँ। यह streaming, function calling (forced tool choice सहित), और JSON Schema structured output को support करता है। QSP इसे reasoning बंद रखकर serve करता है, इसलिए responses सीधे आते हैं और उनमें कोई अलग reasoning trace या छिपे हुए reasoning tokens नहीं होते।

base_url=https://api.quicksilverpro.io/v1 सेट करें, अपनी QSP key इस्तेमाल करें, और model="nemotron-3-ultra" सेट करें। Chat Completions और Responses API दोनों के clients एक ही public model ID इस्तेमाल करते हैं।

Nemotron 3 Ultra को double credits के साथ आज़माएँ — $50 तक bonus credits

API Key पाएँ