首页/模型/Qwen3.8 Max
1M 上下文多模态推理Responses API

Qwen3.8 Max · QuickSilver Pro

Qwen 3.8 Max 是 Alibaba 2026 年 8 月发布的旗舰,也是其迄今发布的最大模型 —— 采用 mixture-of-experts 架构,参数量达 2.4 万亿,拥有 1M token 上下文窗口,支持文本、图像和视频输入。Alibaba 将它定位于自主编码和长程 agent 工作,而非聊天。在 QuickSilver Pro 上,价格为每 1M token 输入 $2.00 / 输出 $6.00 —— 即 Alibaba 自家公布的价格,原价透传、不加价 —— 并且一把 OpenAI 兼容的 key 即可通用整个模型目录。

每 1M token:输入 $2.00 · 输出 $6.00
作者Raullen Chai·更新于

概览

上下文
1M token
输入 / 1M
$2.00
输出 / 1M
$6.00
默认思考
否

自主编码 + 长程 agent —— Alibaba 最大的模型,1M 上下文,按其官方刊例价提供。

价格对比($/1M token)

服务商输入输出对比 QSP
QuickSilver Pro$2.00$6.00—
Alibaba (qwen3.8-max)$2.00$6.00相同
OpenAI (GPT-5.6 Sol)$5.00$30.00低 80%

适用场景

需要长时间无人值守运行的工作,就选 3.8 Max:持续多日的编码 agent、跨越数百轮的规划循环,以及需要 agent 自己发现错误并纠正方向、而不是靠重新提示的任务。Alibaba 的发布材料描述了持续多日的自主开发运行和数百轮的规划循环,并把视觉通路定位为用于规划和自我纠错的反馈回路,而不仅仅是一种输入 —— 请把这些视为厂商的说法,并用你自己的评测加以验证。1M 的上下文意味着大型代码仓库或很长的执行轨迹可以常驻其中,而不必每轮重新摘要。

何时该选其他模型

这是整个系列的顶配,价格也是顶配。日常对话、代码生成或生产环境 agent,Qwen 3.7 Plus 的价格为 $0.256/$1.024,输出大约低 6×;Qwen 3.7 Max 为 $1.25/$3.75,约低 1.6× —— 先从它们开始,只有当你的评测表明 3.8 Max 物有所值时再升级。它也默认开启思考:QuickSilver Pro 网关会发送 enable_thinking=false,让日常调用不会为隐藏的推理过程计费,这一点在它身上比在低成本模型上更重要。需要推理过程时请传入 enable_thinking=true,并相应地预留输出 token 预算。

快速开始(curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

兼容 OpenAI。只需改一行 base_url 即可迁移。

常见问题

每 1M 输入 token $2.00,每 1M 输出 token $6.00,缓存输入读取为每 1M $0.25。这是 Alibaba 自家公布的价格,原样透传。我们目录中的大多数模型售价低于市场参考价,但这个模型只有 Alibaba 一家提供,没有更低成本的渠道可以用来补贴折扣,我们也不会假装有 —— 你支付的价格与源头相同,同时可以用一把 key、一份余额通用我们提供的所有其他模型。

按刊例价算,是的,而且便宜很多:$2.00/$6.00,对比 OpenAI 的 GPT-5.6 Sol $5.00/$30.00 —— 输出便宜 80% —— 以及 Anthropic 的 Claude Opus 5 刊例价 $5.00/$25.00。它们是来自不同实验室的不同模型,所以不应只凭价格做决定;请在你自己的工作负载上对三者都做基准测试。如果想直接在 QuickSilver Pro 上对比,GPT-5.6 Sol 和 Claude Opus 5 都在同一把 API key、同一份余额之下,切换只需改一行模型字符串。

它默认开启思考。发布当天我们对线上 endpoint 实测,回答「Reply with exactly: OK」消耗了 28 个 completion token,其中 22 个是不可见的推理过程。为了避免日常调用为此计费,QuickSilver Pro 网关默认发送 enable_thinking=false。在请求体中传入 enable_thinking=true 即可重新开启 —— 它对非流式请求和流式请求都有效,而并非每个 Qwen 模型都是如此。

上下文为 1M token。Alibaba 文档给出的最大输入为 991K token,开启思考时降至 983K,最大输出为 131K token。缓存输入按每 1M $0.25 计费,而不是全价 $2.00,因此很长的系统提示词或跨轮次常驻的代码仓库,在第二次及之后的调用中成本远低于第一次。

3.8 Max 是更新、也大得多的模型 —— 2.4T 参数,对比 3.7 系列的旗舰 —— Alibaba 专门把它瞄准自主编码和长程 agent 工作,视觉是规划循环的一部分,而不只是一种输入格式。两者都提供 1M 上下文。3.7 Max 的输出价格低 1.6×($1.25/$3.75),对于不需要连续多日无人值守运行的困难推理,它仍是更好的默认选择;当你的评测表明更长程的表现值回成本时,再升级到 3.8 Max。

发布时还没有。Alibaba 宣布,Qwen 3.8 Max 以及更小的 Qwen 3.8-27B 的权重将在 2026-08-03 发布后约一周内放出。在此之前,托管 API 是运行它的唯一方式。无论如何,我们都会继续通过同一个 endpoint 提供它 —— 权重放出与否,你的集成都无需任何改动。

把 OpenAI SDK 指向 https://api.quicksilverpro.io/v1,并将模型字符串设为 qwen3.8-max。流式输出、工具 / 函数调用和结构化 JSON 输出都可以在标准的 Chat Completions 接口上使用 —— 工具调用已在发布当天针对生产环境验证过。每个响应都带有 OpenAI 标准的 usage 统计,外加一个按上述公开价格计算的 usage.cost 字段,因此你可以在客户端对账开支,无需再调用一次 API。

充值翻倍试用 Qwen3.8 Max —— 最高赠送 $50 额度

获取 API Key