Nemotron 3 Ultra в QuickSilver Pro
Nemotron 3 Ultra — открытая модель NVIDIA для reasoning передового уровня: Mixture-of-Experts на 550B параметров с 55B активных параметров на токен, построенная на гибридной архитектуре Transformer-Mamba для глубоких рассуждений и оркестрации агентов. QuickSilver Pro даёт контекст на 262K токенов по цене $0.50 за вход / $2.20 за выход за миллион токенов, с нулевым хранением данных — столько же, сколько самая низкая стабильная платная цена на рынке.
Коротко
Крупнейшая открытая модель NVIDIA для сложных рассуждений и многошаговых агентов — 550B параметров всего, 55B активных на токен и контекст 262K.
Сравнение цен ($/1M токенов)
| Провайдер | Вход | Выход | к QSP |
|---|---|---|---|
| QuickSilver Pro | $0.50 | $2.20 | — |
| Рыночная цена (public paid rate) | $0.50 | $2.20 | так же |
Когда использовать
Используйте Nemotron 3 Ultra, когда трудную работу должна тянуть модель с открытыми весами: многошаговое планирование, оркестрация других агентов и инструментов, длинные аналитические ответы и задачи кодинга, где небольшой экономичной модели не хватает глубины. Она поддерживает function calling и структурированный вывод по JSON Schema, а кэшированный вход стоит $0.10 за миллион токенов.
Когда выбрать другую модель
Это большая модель, и генерирует она медленнее экономичных, поэтому плохо подходит для чувствительного к задержкам чата или массового простого извлечения данных — для этого используйте Nemotron 3.5 Lightning. Один ответ ограничен 16,384 выходными токенами. Endpoint QSP работает только с текстом и сейчас гарантирует контекст на 262K токенов с нулевым хранением данных.
Быстрый старт (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nemotron-3-ultra",
"messages": [{"role": "user", "content": "Hello!"}]
}'Совместимо с OpenAI. Миграция в одну строку через base_url.
FAQ
$0.50 за миллион входных токенов, $2.20 за миллион выходных токенов и $0.10 за миллион токенов кэшированного входа — столько же, сколько самая низкая стабильная платная цена на рынке, без наценки.
Они находятся на противоположных концах одного семейства. Lightning — модель на 30B с 3B активных параметров, настроенная на скорость и стоимость. Ultra — модель на 550B с 55B активных параметров, настроенная на глубину рассуждений и оркестрацию. Начинайте с Lightning и переходите на Ultra, когда ваши оценки покажут, что младшая модель не справляется.
Да. Она поддерживает streaming, function calling (включая принудительный выбор инструмента) и структурированный вывод по JSON Schema. QSP обслуживает её с выключенным reasoning, поэтому ответы прямые: без отдельной reasoning-трассы и скрытых reasoning-токенов.
Укажите base_url=https://api.quicksilverpro.io/v1, используйте свой ключ QSP и задайте model="nemotron-3-ultra". Клиенты Chat Completions и Responses API используют один и тот же публичный ID модели.