GLM 5.3 Flash · QuickSilver Pro
GLM 5.3 Flash 是 Z.ai 推出的 GLM 5.3 的高速开放权重版本 —— 同属 2026 年的推理系列,蒸馏到主力模型的价位,并保留完整的 1M token 上下文窗口和 131K 最大输出。在 QuickSilver Pro 上,每百万 token 输入 $0.06 / 输出 $0.20,比 Z.ai 自家刊例价低约 20%,后者为 $0.075 / $0.25。与 GLM 5.3 一样,这个 endpoint 上推理始终开启、无法关闭 —— 请改用 `reasoning_effort` 控制深度。
概览
以主力模型的价位跑大批量 agent 和编码 —— Z.ai 最新推理系列中的高速开放权重成员,拥有 1M token 的上下文窗口。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $0.06 | $0.20 | 最低价 |
| Z.ai (z-ai/glm-5.3-flash) | $0.075 | $0.25 | 低 20% |
| OpenAI (GPT-4o mini) | $0.15 | $0.60 | 低 67% |
适用场景
想以极低的价格获得 GLM 5.3 系列的推理与工具调用表现时,选 GLM 5.3 Flash:大批量 agent 循环、后台代码生成、在 1M token 上下文中对超大工作集做摘要,以及单次调用成本占主导的批处理流水线。每百万 token $0.06 / $0.20 的价格可与目录中最便宜的一档竞争,同时保留 1M token 的窗口 —— 这是其他低价模型给不了的组合。推理始终开启;可用 `reasoning_effort` 在深度与延迟、成本之间取舍。
何时该选其他模型
对于最难的仓库级工程和长程规划,GLM 5.3 是该系列中更强的选择 —— 窗口相同,模型更深。这里推理同样是强制开启的,所以即使是简单的轮次也会消耗思考 token;如果你想要一个直接作答的便宜模型,DeepSeek V4 Flash($0.086/$0.173)作答时没有这部分开销。如果你的提示词是针对 GLM 5.2 或 GLM 5.3 调优的,降档切换前请先做 A/B 测试 —— 该系列各模型的推理轨迹和工具调用节奏并不相同。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3-flash",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
推理始终开启 —— 在这个 endpoint 上推理是强制的,无法关闭(试图关闭推理的请求会被上游拒绝)。可以用 `reasoning_effort` 在深度与延迟、成本之间取舍。推理 token 按输出 token 计费,并会先于可见回答从你的 `max_tokens` 预算中扣除,所以 `max_tokens` 要设得宽裕一些,否则回复可能被截断。如果你想要一个不是始终思考的 GLM,请使用 GLM 5.2。
同一系列,不同量级:GLM 5.3 Flash 是 2026-08-26 发布的高速开放权重版本,每百万 token 输入 $0.06 / 输出 $0.20,而 GLM 5.3 是 $1.12 / $3.52 —— 输入价格便宜约 18x。两者共享 1M token 的上下文窗口、131K 的最大输出上限,以及推理始终开启的约定。跑量用 Flash;当瓶颈是任务难度而不是吞吐量时,再升级到 GLM 5.3。
可以 —— GLM 5.3 Flash 在 QuickSilver Pro 上是一个 OpenAI 兼容的 chat completions endpoint(Responses API 同样可用)。设置 base_url=https://api.quicksilverpro.io/v1,填入你的 QSP key,并使用 model="glm-5.3-flash"。流式输出、工具调用(`tool_choice: "auto"` —— 这个 endpoint 不接受强制指定某个函数)和 usage.cost 统计都可用。`response_format: json_schema` 在这个 endpoint 上暂不强制生效;如果需要严格的结构化输出,请使用 GLM 5.2。
Z.ai 对 GLM 5.3 Flash 的标价是每百万 token 输入 $0.075 / 输出 $0.25;QuickSilver Pro 是 $0.06 / $0.20,输入输出两端都低约 20%。同样的 OpenAI 兼容接口;迁移只需更换 base_url 和 key,并去掉模型 ID 中的 `z-ai/` 提供商前缀。