首页/模型/Qwen3.8 Omni Flash
1M 上下文多模态推理Responses API

Qwen3.8 Omni Flash · QuickSilver Pro

Qwen3.8 Omni Flash 是 Qwen 首个 agent 式全模态(omni)模型 —— 一个 endpoint 就能在文本之外原生理解图像、音频和视频,对所见所闻进行推理,并在长工作流中驱动工具。它保留了该系列完整的 1M token 上下文窗口,最大输出 131K。在 QuickSilver Pro 上,价格为每百万 token 输入 $0.15 / 输出 $0.47 —— 所有模态统一一个价格,与 Alibaba 自家的官方价格一致,并且与目录中其他模型共用同一把 OpenAI 兼容的 key 和同一份美元余额。

每 1M token:输入 $0.15 · 输出 $0.47
作者Raullen Chai·更新于

概览

上下文
1M token
输入 / 1M
$0.15
输出 / 1M
$0.47
默认思考
否

在一个全模态 endpoint 上实现 agent 式音视频理解 —— 图像、音频、视频和工具,共用 1M token 窗口。

价格对比($/1M token)

服务商输入输出对比 QSP
QuickSilver Pro$0.15$0.47—
Alibaba (qwen3.8-omni-flash)$0.15$0.47相同
OpenAI (GPT-4o)$2.50$10.00低 95%

适用场景

当单个请求需要跨模态推理时,就选 Qwen3.8 Omni Flash:转写并总结一通电话、从长视频中提取关键片段、为图像生成描述或做质检,或者运行一个观察屏幕并通过工具执行操作的 agent。每种输入模态 —— 文本、图像、音频、视频 —— 都按同样低的单 token 价格计费,因此混合媒体的处理流水线依然便宜;1M token 的窗口可以让一段很长的录音或一整套文档常驻其中,而不必切块。Alibaba 针对 agent 式交付对它做了调优,因此它会规划任务并用工具执行,而不只是描述内容 —— 请把这些视为厂商的说法,并用你自己的评测加以验证。

何时该选其他模型

最难的单次文本推理,请升级到 Qwen3.8 Max 或 GLM 5.3。如果你的工作负载是纯文本、不含媒体,Qwen3.8 Flash Next 更便宜,也没有全模态的额外负担。为了让 flash 档保持快速,思考默认被抑制;如果需要可见的推理过程,请传入 enable_thinking=true,并为额外的输出 token 留出预算。作为刚发布的模型,它的行为可能随上游版本更新而变化 —— 如果需要一个固定不变的目标,请固定你的评测。

快速开始(curl)

curl https://api.quicksilverpro.io/v1/chat/completions \
  -H "Authorization: Bearer $QSP_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-omni-flash",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

兼容 OpenAI。只需改一行 base_url 即可迁移。

常见问题

文本、图像、音频和视频,全部在一个模型内原生支持 —— 它对所见所闻进行联合推理,而不是把每种模态分发到各自独立的流水线。输出为文本。在 QuickSilver Pro 上,每种输入模态都按相同的每百万 token $0.15 计费:Alibaba 把每种模态都转换为 token,并按统一的输入价格收费,因此不需要为音频或视频单独的费率做预算。

每百万 token 输入 $0.15 / 输出 $0.47,缓存输入读取为 $0.016 —— 文本、图像、音频和视频统一一个价格。这与 Alibaba 自家的官方刊例价一致;QuickSilver Pro 额外提供的是一把 OpenAI 兼容的 key 和一份美元余额通用整个目录,无需另外开通 Alibaba 账号。迁移只需替换 base_url 和 key。

是真的 —— 完整的 1M token 窗口,每次调用最多 131K 输出 token,并且它同样适用于媒体和文本:长视频或长音频文件转换为 token 后,共用同一个窗口。长上下文调用同样按每百万输入 token $0.15 的统一价格计费。

可以 —— Qwen3.8 Omni Flash 在 QuickSilver Pro 上是一个 OpenAI 兼容的 Chat Completions endpoint(Responses API 也可以用)。设置 base_url=https://api.quicksilverpro.io/v1,粘贴你的 QSP key,并使用 model="qwen3.8-omni-flash"。多模态 content parts、流式输出、工具调用和 usage.cost 统计都可以使用。思考默认关闭;传入 enable_thinking=true 即可开启可见的推理过程。

充值翻倍试用 Qwen3.8 Omni Flash —— 最高赠送 $50 额度

获取 API Key