Qwen3.7 Max · QuickSilver Pro
Qwen 3.7 Max 是 Alibaba 2026 年 5 月发布的旗舰 —— Qwen 3.7 系列的顶配,针对困难的多步推理、长程 agent 工作流,以及那些你原本会选 GPT-4o 或 Claude Sonnet 4.5 的深度工具调用任务做了调优。在 QuickSilver Pro 上,价格为每 1M token 输入 $1.25 / 输出 $3.75 —— 输出比 GPT-4o 低约 62%,拥有 1M 上下文(GPT-4o 的 8×),一把 OpenAI 兼容的 key 通用 32 个模型。这是 Alibaba 自家对该模型的定价,原价透传。
概览
旗舰级推理 + 长程 agent —— GPT-4o 级的质量,输出成本低约 62%,上下文是其 8×。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $1.25 | $3.75 | 最低价 |
| OpenRouter (qwen/qwen3.7-max) | $1.475 | $4.425 | 低 15% |
| OpenAI (GPT-4o) | $2.50 | $10.00 | 低 63% |
适用场景
当 3.6 Plus 在你的评测上不够聪明时,就选 3.7 Max:多跳推理、需要跨 10+ 次工具调用进行规划的 agent 工作流、对百万 token 语料的长上下文分析,以及需要把整个代码仓库记在脑子里的代码审查或重构 agent。它在这类工作负载上与 GPT-4o 或 Claude Sonnet 4.5 是同一类选择 —— 选 3.7 Max 是为了输出 token 上的成本优势和更宽的上下文窗口。
何时该选其他模型
日常对话、代码生成或生产环境 agent,如果价格为 $0.70/$2.10 的 DeepSeek V4 Pro 能给出同样的答案,那么 V4 Pro 的输出价格低约 6×。纯数学 / 定理类推理,DeepSeek V4 Pro 在性价比上领先。3.7 Max 默认开启思考;QuickSilver Pro 网关默认关闭思考,让日常调用不会为隐藏的推理过程计费 —— 传入 `enable_thinking=true` 即可重新开启。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.7-max",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
在 Qwen 公布的基准测试(MMLU-Pro、GPQA Diamond、HumanEval、Tau-bench、BFCL-v3)上,3.7 Max 在推理和工具使用方面与 GPT-4o 相差无几,在长上下文检索方面则明显领先,这得益于它 1M token 的窗口,而 GPT-4o 为 128K。做决定之前请先用你自己的评测比对 —— 在 3.7 Max 所针对的工作负载(agent + 长上下文)上,单 token 的成本优势($1.25/$3.75 对比 GPT-4o 的 $2.5/$10)和 8× 的上下文优势通常是决定性的。
3.7 Max 默认开启思考。为了避免日常调用为隐藏的推理过程计费,QuickSilver Pro 网关对 3.7 Max 的请求默认关闭思考。如果你需要推理过程,请在请求体中传入 `enable_thinking=true`,并相应地预留输出 token 预算(通常为普通对话输出的 3-5×)。
V4 Pro 的价格为每 1M $0.70 / $2.10,输出低约 6×,并且在许多公开的推理基准测试(MATH、GPQA、AIME)上与 3.7 Max 持平。只有当 V4 Pro 在你的 agent / 长上下文评测上明显表现不佳时,才选 3.7 Max —— 在 Alibaba 公布的 agent 基准测试中,Qwen 的工具使用和 BFCL-v3 得分略微领先。为这份溢价买单之前请先做 A/B 测试;对于大多数生产环境的推理工作负载,V4 Pro 是更好的默认选择。