Gemini 3.5 Flash · QuickSilver Pro
Gemini 3.5 Flash 是 Google 的新一代 Flash 模型 —— GA(非预览版),1M token 上下文,默认开启思考。能力和价格都介于 3 Flash Preview 和 3.1 Pro Preview 之间。在 QuickSilver Pro 上,标价为每 1M token 输入 $1.275 / 输出 $7.65,比 Vertex 零售价和 OpenRouter 低约 15%,对应价格为 $1.50/$9.00。通过 QuickSilver Pro 使用 3.5 Flash 时思考始终开启;如需不思考的 Gemini,请用 3.1 Flash Lite($0.2125/$1.275)。
概览
生产级的推理型 Flash —— GA 稳定性加 3.x 质量,成本介于 3 Flash 和 3.1 Pro 之间。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $1.275 | $7.65 | 最低价 |
| OpenRouter (google/gemini-3.5-flash) | $1.50 | $9.00 | 低 15% |
| OpenAI (GPT-4o) | $2.50 | $10.00 | 低 23% |
适用场景
当你需要 3.x 质量的推理,又要一个语义不会突然变化的 GA 模型时,选 3.5 Flash:每轮都有较复杂推理的生产 agentic 循环、需要更强 Flash 质量的编程 agent,以及可以接受单轮思考开销的长上下文分析。GA 标签意味着 Google 已承诺行为和定价稳定 —— 可以放心用在营收关键路径上,这一点不同于 3 Flash Preview 或 3.1 Pro Preview。
何时该选其他模型
对于日常的高并发对话,3.1 Flash Lite($0.2125/$1.275)要便宜得多。对于需要 3.1 Pro 更深层思考的顶级推理,Pro 预览版才是合适的升级选择。如需不思考的 Gemini(token 预算可预期),只有 Flash Lite 不带推理 —— 3.5 Flash 默认开启思考,`reasoning.enabled=false` 会被静默丢弃。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.5-flash",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
3.5 Flash 是 GA —— Google 已承诺输出格式、定价和行为保持稳定。3 Flash Preview 可能在不通知的情况下发生变化。3.5 Flash 也贵约 2.5-3x(每 1M $1.275/$7.65,而 3 Flash Preview 为 $0.425/$2.55),这反映了更强的推理质量和生产稳定性。请在你自己的任务上做并排评测;做原型用 Preview 就够了,上线请用 3.5。
3.1 Pro Preview 是旗舰推理档 —— 思考更深、能解更难的问题,Vertex 零售价为每 1M $2/$12。3.5 Flash 是生产级 Flash 档 —— 推理能力强、成本更低(Vertex 零售价 $1.50/$9),且为 GA 稳定版。需要推理的生产流量用 3.5 Flash;在最难的推理任务上做评测时再升级到 3.1 Pro。两者都默认开启思考;目前都还不能通过 QuickSilver Pro 关闭思考。
QuickSilver Pro 上 3.5 Flash 的标价为每 1M token 输入 $1.275 / 输出 $7.65 —— 比 Vertex 零售价和 OpenRouter 低约 15%,对应价格为 $1.50/$9.00。一张账单、一把 OpenAI 兼容的 key 覆盖 14 个模型,还有推荐奖励,以及每次响应的 `usage.cost` 费用统计。