Nemotron 3.5 Lightning в QuickSilver Pro
Nemotron 3.5 Lightning — открытая модель NVIDIA: Mixture-of-Experts на 30B параметров, из которых на токен активны всего 3B. Она создана для быстрых агентов с интенсивной работой с инструментами, высокопроизводительной автоматизации и адаптации под предметную область. QuickSilver Pro даёт контекст на 262K токенов по цене $0.066 за вход / $0.176 за выход за миллион токенов, с нулевым хранением данных — примерно на 10% выше самой низкой стабильной платной цены на рынке.
Коротко
Быстрые и недорогие агенты с инструментами — 30B параметров всего, 3B активных на токен и контекст 262K.
Сравнение цен ($/1M токенов)
| Провайдер | Вход | Выход | к QSP |
|---|---|---|---|
| QuickSilver Pro | $0.066 | $0.176 | — |
| Рыночная цена (public paid rate) | $0.06 | $0.16 | на 10% дороже |
| OpenAI (GPT-4o-mini) | $0.15 | $0.60 | на 71% ниже |
Когда использовать
Используйте Nemotron 3.5 Lightning для массовых ассистентов по кодингу, retrieval-агентов, долгих циклов с инструментами, структурированного извлечения данных и сценариев, где многократно переиспользуется большой системный промпт или контекст репозитория. Разреженная архитектура 30B-A3B делает генерацию недорогой, а кэшированный вход стоит $0.033 за миллион токенов.
Когда выбрать другую модель
Это быстрая экономичная модель, а не передовой флагман. Сложные исследования, математические рассуждения или сложный автономный кодинг передавайте DeepSeek V4 Pro, Qwen3.8 Max или Grok 4.6, когда ваши оценки оправдывают более высокую цену. Endpoint QSP работает только с текстом и сейчас гарантирует контекст на 262K токенов с нулевым хранением данных.
Быстрый старт (curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nemotron-3.5-lightning",
"messages": [{"role": "user", "content": "Hello!"}]
}'Совместимо с OpenAI. Миграция в одну строку через base_url.
FAQ
$0.066 за миллион входных токенов, $0.176 за миллион выходных токенов и $0.033 за миллион токенов кэшированного входа — примерно на 10% выше самой низкой стабильной платной цены на рынке.
Архитектура модели поддерживает до 1M токенов, но QSP сейчас гарантирует в продакшене 262K токенов. Мы публикуем тот лимит, который тестируем и обеспечиваем, а не рекламируем теоретический максимум.
Да. Она поддерживает streaming, function calling и структурированный вывод по JSON Schema. QSP обслуживает её с выключенным reasoning, поэтому ответы прямые: без отдельной reasoning-трассы и скрытых reasoning-токенов.
Укажите base_url=https://api.quicksilverpro.io/v1, используйте свой ключ QSP и задайте model="nemotron-3.5-lightning". Клиенты Chat Completions и Responses API используют один и тот же публичный ID модели.