Nemotron 3 Ultra · QuickSilver Pro
Nemotron 3 Ultra 是 NVIDIA 的开放前沿推理模型:550B 参数的 Mixture-of-Experts,每个 token 激活 55B 参数,基于 Transformer-Mamba 混合架构,为深度推理和 agent 编排而构建。QuickSilver Pro 提供 262K token 的上下文,每百万 token 输入 $0.50 / 输出 $2.20,零数据保留 —— 与市场上最低的稳定付费价格持平。
概览
NVIDIA 最大的开放模型,面向高难度推理和多步 agent —— 总参数 550B,每个 token 激活 55B,上下文 262K。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $0.50 | $2.20 | — |
| 市场价 (public paid rate) | $0.50 | $2.20 | 相同 |
适用场景
当需要由开放权重模型承担高难度工作时,使用 Nemotron 3 Ultra:多步规划、编排其他 agent 和工具、长篇分析型回答,以及小型高效模型深度不够用的编码任务。它支持函数调用和 JSON Schema 结构化输出,缓存输入价格为每百万 token $0.10。
何时该选其他模型
它是一个大模型,生成速度比高效型模型慢,因此不适合对延迟敏感的对话或大批量的简单抽取 —— 这些场景请用 Nemotron 3.5 Lightning。单次回复的输出上限为 16,384 token。QSP 的这个 endpoint 仅支持文本,目前保证 262K token 的上下文,零数据保留。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nemotron-3-ultra",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
每百万输入 token $0.50,每百万输出 token $2.20,每百万缓存输入 token $0.10 —— 与市场上最低的稳定付费价格持平,不加价。
它们位于同一系列的两端。Lightning 是 30B 模型,激活参数 3B,针对速度和成本调优。Ultra 是 550B 模型,激活参数 55B,针对推理深度和编排调优。建议先用 Lightning,当你的评测显示小模型力不从心时再升级到 Ultra。
支持。它支持流式输出、函数调用(包括强制指定工具)和 JSON Schema 结构化输出。QSP 以关闭推理的方式提供该模型,因此回复直接给出,不带单独的推理轨迹,也没有隐藏的推理 token。
设置 base_url=https://api.quicksilverpro.io/v1,使用你的 QSP key,并设置 model="nemotron-3-ultra"。Chat Completions 和 Responses API 客户端使用同一个公开模型 ID。