Qwen3.8 Omni Flash · QuickSilver Pro
Qwen3.8 Omni Flash 是 Qwen 首个 agent 式全模态(omni)模型 —— 一个 endpoint 就能在文本之外原生理解图像、音频和视频,对所见所闻进行推理,并在长工作流中驱动工具。它保留了该系列完整的 1M token 上下文窗口,最大输出 131K。在 QuickSilver Pro 上,价格为每百万 token 输入 $0.15 / 输出 $0.47 —— 所有模态统一一个价格,与 Alibaba 自家的官方价格一致,并且与目录中其他模型共用同一把 OpenAI 兼容的 key 和同一份美元余额。
概览
在一个全模态 endpoint 上实现 agent 式音视频理解 —— 图像、音频、视频和工具,共用 1M token 窗口。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $0.15 | $0.47 | — |
| Alibaba (qwen3.8-omni-flash) | $0.15 | $0.47 | 相同 |
| OpenAI (GPT-4o) | $2.50 | $10.00 | 低 95% |
适用场景
当单个请求需要跨模态推理时,就选 Qwen3.8 Omni Flash:转写并总结一通电话、从长视频中提取关键片段、为图像生成描述或做质检,或者运行一个观察屏幕并通过工具执行操作的 agent。每种输入模态 —— 文本、图像、音频、视频 —— 都按同样低的单 token 价格计费,因此混合媒体的处理流水线依然便宜;1M token 的窗口可以让一段很长的录音或一整套文档常驻其中,而不必切块。Alibaba 针对 agent 式交付对它做了调优,因此它会规划任务并用工具执行,而不只是描述内容 —— 请把这些视为厂商的说法,并用你自己的评测加以验证。
何时该选其他模型
最难的单次文本推理,请升级到 Qwen3.8 Max 或 GLM 5.3。如果你的工作负载是纯文本、不含媒体,Qwen3.8 Flash Next 更便宜,也没有全模态的额外负担。为了让 flash 档保持快速,思考默认被抑制;如果需要可见的推理过程,请传入 enable_thinking=true,并为额外的输出 token 留出预算。作为刚发布的模型,它的行为可能随上游版本更新而变化 —— 如果需要一个固定不变的目标,请固定你的评测。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-omni-flash",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
文本、图像、音频和视频,全部在一个模型内原生支持 —— 它对所见所闻进行联合推理,而不是把每种模态分发到各自独立的流水线。输出为文本。在 QuickSilver Pro 上,每种输入模态都按相同的每百万 token $0.15 计费:Alibaba 把每种模态都转换为 token,并按统一的输入价格收费,因此不需要为音频或视频单独的费率做预算。
每百万 token 输入 $0.15 / 输出 $0.47,缓存输入读取为 $0.016 —— 文本、图像、音频和视频统一一个价格。这与 Alibaba 自家的官方刊例价一致;QuickSilver Pro 额外提供的是一把 OpenAI 兼容的 key 和一份美元余额通用整个目录,无需另外开通 Alibaba 账号。迁移只需替换 base_url 和 key。
是真的 —— 完整的 1M token 窗口,每次调用最多 131K 输出 token,并且它同样适用于媒体和文本:长视频或长音频文件转换为 token 后,共用同一个窗口。长上下文调用同样按每百万输入 token $0.15 的统一价格计费。
可以 —— Qwen3.8 Omni Flash 在 QuickSilver Pro 上是一个 OpenAI 兼容的 Chat Completions endpoint(Responses API 也可以用)。设置 base_url=https://api.quicksilverpro.io/v1,粘贴你的 QSP key,并使用 model="qwen3.8-omni-flash"。多模态 content parts、流式输出、工具调用和 usage.cost 统计都可以使用。思考默认关闭;传入 enable_thinking=true 即可开启可见的推理过程。