首页/模型/Nemotron 3.5 Lightning
262K 上下文Responses API

Nemotron 3.5 Lightning · QuickSilver Pro

Nemotron 3.5 Lightning 是 NVIDIA 的开放 30B 参数 Mixture-of-Experts 模型,每个 token 仅激活 3B 参数。它为快速、重度使用工具的 agent、高吞吐自动化和领域定制而构建。QuickSilver Pro 提供 262K token 的上下文,每百万 token 输入 $0.066 / 输出 $0.176,零数据保留 —— 比市场上最低的稳定付费价格高约 10%。

每 1M token:输入 $0.066 · 输出 $0.176
作者Raullen Chai·更新于

概览

上下文
262K token
输入 / 1M
$0.066
输出 / 1M
$0.176
默认思考
否

快速、便宜的工具调用 agent —— 总参数 30B,每个 token 激活 3B,上下文 262K。

价格对比($/1M token)

服务商输入输出对比 QSP
QuickSilver Pro$0.066$0.176—
市场价 (public paid rate)$0.06$0.16贵 10%
OpenAI (GPT-4o-mini)$0.15$0.60低 71%

适用场景

Nemotron 3.5 Lightning 适合大批量编码助手、检索 agent、长时间运行的工具循环、结构化抽取,以及反复复用大型 system prompt 或仓库上下文的工作流。稀疏的 30B-A3B 设计让生成成本保持低廉,缓存输入价格为每百万 token $0.033。

何时该选其他模型

这是一个快速的高效型模型,不是前沿旗舰。高难度的研究、数学推理或复杂的自主编码,在你的评测证明值得为更高价格买单时,请升级到 DeepSeek V4 Pro、Qwen3.8 Max 或 Grok 4.6。QSP 的这个 endpoint 仅支持文本,目前保证 262K token 的上下文,零数据保留。

快速开始(curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "nemotron-3.5-lightning",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

兼容 OpenAI。只需改一行 base_url 即可迁移。

常见问题

每百万输入 token $0.066,每百万输出 token $0.176,每百万缓存输入 token $0.033 —— 比市场上最低的稳定付费价格高约 10%。

模型架构最多可支持 1M token,而 QSP 目前在生产环境中保证 262K token。我们公布的是经过我们测试并实际执行的上限,而不是宣传一个理论最大值。

支持。它支持流式输出、函数调用和 JSON Schema 结构化输出。QSP 以关闭推理的方式提供该模型,因此回复直接给出,不带单独的推理轨迹,也没有隐藏的推理 token。

设置 base_url=https://api.quicksilverpro.io/v1,使用你的 QSP key,并设置 model="nemotron-3.5-lightning"。Chat Completions 和 Responses API 客户端使用同一个公开模型 ID。

充值翻倍试用 Nemotron 3.5 Lightning —— 最高赠送 $50 额度

获取 API Key