Nemotron 3.5 Lightning · QuickSilver Pro
Nemotron 3.5 Lightning 是 NVIDIA 的开放 30B 参数 Mixture-of-Experts 模型,每个 token 仅激活 3B 参数。它为快速、重度使用工具的 agent、高吞吐自动化和领域定制而构建。QuickSilver Pro 提供 262K token 的上下文,每百万 token 输入 $0.066 / 输出 $0.176,零数据保留 —— 比市场上最低的稳定付费价格高约 10%。
概览
快速、便宜的工具调用 agent —— 总参数 30B,每个 token 激活 3B,上下文 262K。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $0.066 | $0.176 | — |
| 市场价 (public paid rate) | $0.06 | $0.16 | 贵 10% |
| OpenAI (GPT-4o-mini) | $0.15 | $0.60 | 低 71% |
适用场景
Nemotron 3.5 Lightning 适合大批量编码助手、检索 agent、长时间运行的工具循环、结构化抽取,以及反复复用大型 system prompt 或仓库上下文的工作流。稀疏的 30B-A3B 设计让生成成本保持低廉,缓存输入价格为每百万 token $0.033。
何时该选其他模型
这是一个快速的高效型模型,不是前沿旗舰。高难度的研究、数学推理或复杂的自主编码,在你的评测证明值得为更高价格买单时,请升级到 DeepSeek V4 Pro、Qwen3.8 Max 或 Grok 4.6。QSP 的这个 endpoint 仅支持文本,目前保证 262K token 的上下文,零数据保留。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "nemotron-3.5-lightning",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
每百万输入 token $0.066,每百万输出 token $0.176,每百万缓存输入 token $0.033 —— 比市场上最低的稳定付费价格高约 10%。
模型架构最多可支持 1M token,而 QSP 目前在生产环境中保证 262K token。我们公布的是经过我们测试并实际执行的上限,而不是宣传一个理论最大值。
支持。它支持流式输出、函数调用和 JSON Schema 结构化输出。QSP 以关闭推理的方式提供该模型,因此回复直接给出,不带单独的推理轨迹,也没有隐藏的推理 token。
设置 base_url=https://api.quicksilverpro.io/v1,使用你的 QSP key,并设置 model="nemotron-3.5-lightning"。Chat Completions 和 Responses API 客户端使用同一个公开模型 ID。