首页/模型/Qwen3.8 Flash Next
1M 上下文Responses API

Qwen3.8 Flash Next · QuickSilver Pro

Qwen3.8 Flash Next 是 Alibaba 对 Qwen4 架构的开放权重预览版 —— 一个 6B 激活的 mixture-of-experts 模型,拥有该系列完整的 1M token 上下文窗口和 131K 最大输出。在 QuickSilver Pro 上,价格为每百万 token 输入 $0.12 / 输出 $0.376,比 Alibaba 自家的刊例价低约 20%,其刊例价为 $0.15 / $0.47。

每 1M token:输入 $0.12 · 输出 $0.376
作者Raullen Chai·更新于

概览

上下文
1M token
输入 / 1M
$0.12
输出 / 1M
$0.376
默认思考
否

在代码仓库规模的上下文上运行下一代 Qwen 的最便宜方式 —— 一个带 1M token 窗口的 6B 激活 MoE。

价格对比($/1M token)

服务商输入输出对比 QSP
QuickSilver Pro$0.12$0.376最低价
Alibaba (qwen/qwen3.8-flash)$0.15$0.47低 20%
OpenAI (GPT-4o mini)$0.15$0.60低 37%

适用场景

在单次调用成本和工作集大小起决定作用的大批量 agent 和编码工作负载上,就选 Qwen3.8 Flash Next:长上下文重构、文档流水线,以及反复重读同一份上下文、重度依赖缓存的 agent。6B 激活的路由让延迟和价格都保持在低位,Qwen4 预览版技术栈则面向 agent 式任务,并且完整的 1M token 窗口由真正落实该上限的线路提供。

何时该选其他模型

最难的单次推理,请升级到 Qwen3.8 Max 或 GLM 5.3。作为预览谱系的版本,它的行为可能随上游版本更新而变化 —— 如果需要一个固定不变的目标,请固定你的评测。输出按每百万 $0.376 计费,因此输出量大的生成任务在做决定之前应先与 DeepSeek V4 Flash 和 Qwen3.8 27B 做对比。

快速开始(curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-flash-next",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

兼容 OpenAI。只需改一行 base_url 即可迁移。

常见问题

Qwen3.8 Flash Next 是一个早期的开放权重版本,构建在 Alibaba 下一代 Qwen4 注意力技术栈之上,以 6B 激活的 MoE 规模针对长上下文 agent 工作负载做了调优。它先于完整的 Qwen4 系列发布,因此请把它当作一个快速迭代的预览版,而不是固定不变的生产目标。

是真的 —— 完整的 1,000,000 token 窗口,每次调用最多 131K 输出 token,而且 QuickSilver Pro 提供的正是真正落实这些上限的线路。长上下文调用同样按每百万输入 token $0.12 的统一价格计费。

可以 —— Qwen3.8 Flash Next 在 QuickSilver Pro 上是一个 OpenAI 兼容的 chat completions endpoint(Responses API 也可以用)。设置 base_url=https://api.quicksilverpro.io/v1,粘贴你的 QSP key,并使用 model="qwen3.8-flash-next"。流式输出、工具调用和 usage.cost 统计都可以使用。

Alibaba 对 Qwen3.8 Flash Next 的标价为每百万 token 输入 $0.15 / 输出 $0.47;QuickSilver Pro 为 $0.12 / $0.376,输入输出两端均低约 20%。同样的 OpenAI 兼容接口;迁移只需替换 base_url 和 key,并去掉模型 ID 中的 `qwen/` 提供商前缀。

充值翻倍试用 Qwen3.8 Flash Next —— 最高赠送 $50 额度

获取 API Key