首页/模型/GLM 5.3 Flash
1M 上下文推理Responses API

GLM 5.3 Flash · QuickSilver Pro

GLM 5.3 Flash 是 Z.ai 推出的 GLM 5.3 的高速开放权重版本 —— 同属 2026 年的推理系列,蒸馏到主力模型的价位,并保留完整的 1M token 上下文窗口和 131K 最大输出。在 QuickSilver Pro 上,每百万 token 输入 $0.06 / 输出 $0.20,比 Z.ai 自家刊例价低约 20%,后者为 $0.075 / $0.25。与 GLM 5.3 一样,这个 endpoint 上推理始终开启、无法关闭 —— 请改用 `reasoning_effort` 控制深度。

每 1M token:输入 $0.06 · 输出 $0.20
作者Raullen Chai·更新于

概览

上下文
1M token
输入 / 1M
$0.06
输出 / 1M
$0.20
默认思考
是

以主力模型的价位跑大批量 agent 和编码 —— Z.ai 最新推理系列中的高速开放权重成员,拥有 1M token 的上下文窗口。

价格对比($/1M token)

服务商输入输出对比 QSP
QuickSilver Pro$0.06$0.20最低价
Z.ai (z-ai/glm-5.3-flash)$0.075$0.25低 20%
OpenAI (GPT-4o mini)$0.15$0.60低 67%

适用场景

想以极低的价格获得 GLM 5.3 系列的推理与工具调用表现时,选 GLM 5.3 Flash:大批量 agent 循环、后台代码生成、在 1M token 上下文中对超大工作集做摘要,以及单次调用成本占主导的批处理流水线。每百万 token $0.06 / $0.20 的价格可与目录中最便宜的一档竞争,同时保留 1M token 的窗口 —— 这是其他低价模型给不了的组合。推理始终开启;可用 `reasoning_effort` 在深度与延迟、成本之间取舍。

何时该选其他模型

对于最难的仓库级工程和长程规划,GLM 5.3 是该系列中更强的选择 —— 窗口相同,模型更深。这里推理同样是强制开启的,所以即使是简单的轮次也会消耗思考 token;如果你想要一个直接作答的便宜模型,DeepSeek V4 Flash($0.086/$0.173)作答时没有这部分开销。如果你的提示词是针对 GLM 5.2 或 GLM 5.3 调优的,降档切换前请先做 A/B 测试 —— 该系列各模型的推理轨迹和工具调用节奏并不相同。

快速开始(curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

兼容 OpenAI。只需改一行 base_url 即可迁移。

常见问题

推理始终开启 —— 在这个 endpoint 上推理是强制的,无法关闭(试图关闭推理的请求会被上游拒绝)。可以用 `reasoning_effort` 在深度与延迟、成本之间取舍。推理 token 按输出 token 计费,并会先于可见回答从你的 `max_tokens` 预算中扣除,所以 `max_tokens` 要设得宽裕一些,否则回复可能被截断。如果你想要一个不是始终思考的 GLM,请使用 GLM 5.2。

同一系列,不同量级:GLM 5.3 Flash 是 2026-08-26 发布的高速开放权重版本,每百万 token 输入 $0.06 / 输出 $0.20,而 GLM 5.3 是 $1.12 / $3.52 —— 输入价格便宜约 18x。两者共享 1M token 的上下文窗口、131K 的最大输出上限,以及推理始终开启的约定。跑量用 Flash;当瓶颈是任务难度而不是吞吐量时,再升级到 GLM 5.3。

可以 —— GLM 5.3 Flash 在 QuickSilver Pro 上是一个 OpenAI 兼容的 chat completions endpoint(Responses API 同样可用)。设置 base_url=https://api.quicksilverpro.io/v1,填入你的 QSP key,并使用 model="glm-5.3-flash"。流式输出、工具调用(`tool_choice: "auto"` —— 这个 endpoint 不接受强制指定某个函数)和 usage.cost 统计都可用。`response_format: json_schema` 在这个 endpoint 上暂不强制生效;如果需要严格的结构化输出,请使用 GLM 5.2。

Z.ai 对 GLM 5.3 Flash 的标价是每百万 token 输入 $0.075 / 输出 $0.25;QuickSilver Pro 是 $0.06 / $0.20,输入输出两端都低约 20%。同样的 OpenAI 兼容接口;迁移只需更换 base_url 和 key,并去掉模型 ID 中的 `z-ai/` 提供商前缀。

充值翻倍试用 GLM 5.3 Flash —— 最高赠送 $50 额度

获取 API Key