GPT-OSS 120B · QuickSilver Pro
GPT-OSS 120B 是 OpenAI 的开放权重 117B mixture-of-experts 模型 —— 生产环境 agent 技术栈中使用最多的开放模型。在 QuickSilver Pro 上,每百万 token 输入 $0.041 / 输出 $0.187,比知名托管商标出的 $0.15 / $0.60 低约 70%,上下文窗口为 131,072 token。这个 endpoint 上推理始终开启、无法关闭 —— 请用 `reasoning_effort` 控制深度。
概览
基于 OpenAI 开放权重 117B MoE 的大批量生产级 agent —— 已经过数千亿 token 的实战检验。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $0.041 | $0.187 | — |
| OpenRouter 低价 (openai/gpt-oss-120b) | $0.037 | $0.17 | 贵 10% |
| OpenAI (GPT-4o mini) | $0.15 | $0.60 | 低 69% |
适用场景
想以开放模型的价格获得 OpenAI 级别的指令遵循能力时,选 GPT-OSS 120B:大批量 agent 循环、重度使用工具的自动化、大规模的后台摘要和分类。它的 117B MoE 每个 token 只激活 5.1B 参数,所以速度快,而且久经考验 —— 当下一些规模最大的公开 agent 部署就由它驱动。推理始终开启;可用 `reasoning_effort` 在深度与延迟、成本之间取舍。
何时该选其他模型
它 131,072 token 的窗口属于中等大小 —— 如果要放入整个代码库的上下文,GLM 5.3 Flash 和 Qwen3.8 27B 处于同一价格档,窗口却大得多。对于前沿难度的推理,请升级到 GPT-5.6 Sol 或 Claude Opus 5。这里推理是强制开启的,所以简单的高频调用也会消耗思考 token —— DeepSeek V4 Flash($0.086/$0.173)直接作答,没有这部分开销。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-oss-120b",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
推理始终开启 —— 在这个 endpoint 上推理是强制的,无法关闭(试图关闭推理的请求会被上游拒绝)。可以用 `reasoning_effort` 在深度与延迟、成本之间取舍。推理 token 按输出 token 计费,并会先于可见回答从你的 `max_tokens` 预算中扣除,所以 `max_tokens` 要设得宽裕一些,否则回复可能被截断。
是的 —— 就是 OpenAI 发布的开放权重 117B mixture-of-experts 模型,以托管的 OpenAI 兼容 endpoint 形式提供。你无需自己运行 120B 级别的基础设施就能用上这个模型,并享有流式输出、工具调用,以及从 QuickSilver Pro 余额中按 token 计费。
可以 —— GPT-OSS 120B 在 QuickSilver Pro 上是一个 OpenAI 兼容的 chat completions endpoint(Responses API 同样可用)。设置 base_url=https://api.quicksilverpro.io/v1,填入你的 QSP key,并使用 model="gpt-oss-120b"。流式输出、工具调用和 usage.cost 统计都可用。
知名托管商对 GPT-OSS 120B 的标价是每百万 token 输入 $0.15 / 输出 $0.60;QuickSilver Pro 是 $0.041 / $0.187 —— 比这一档低约 70%,比 OpenRouter 上最便宜的报价高约 10%。同样的 OpenAI 兼容接口;迁移只需更换 base_url 和 key,并去掉模型 ID 中的 `openai/` 提供商前缀。