Kimi K3 · QuickSilver Pro
Kimi K3 是 Moonshot 的 2.8T 参数开放权重多模态推理模型 —— 适用于复杂编码、知识工作和长程 agent 工作流,尤其擅长在大型代码仓库中穿梭、使用工具、调试,以及对照图像、日志、测试和运行时反馈进行迭代。它的架构采用 KDA 和 Attention Residuals 来提升计算效率。在 QuickSilver Pro 上,价格为每 1M token 输入 $2.55 / 输出 $12.75,比 OpenRouter 低约 15%,后者为 $3.00 / $15.00,并拥有 1M token 上下文窗口。
概览
前沿多模态推理,面向长程编码和 agent 工作流,1M token 上下文。
价格对比($/1M token)
| 服务商 | 输入 | 输出 | 对比 QSP |
|---|---|---|---|
| QuickSilver Pro | $2.55 | $12.75 | 最低价 |
| OpenRouter (moonshotai/kimi-k3) | $3.00 | $15.00 | 低 15% |
适用场景
当任务横跨大型代码仓库或语料库,并且需要对其整体进行前沿级推理时,就选 K3:对照日志、测试和运行时反馈进行调试的复杂编码 agent;在代码之外还要对照图像进行迭代的多模态工作流;以及在 1M token 工作集上规划并协调大量工具调用的长程 agent。它的 KDA + Attention Residuals 架构让这类长上下文推理保持较高的计算效率。
何时该选其他模型
日常对话、短上下文代码生成或单次任务,这个单 token 价格是大材小用 —— DeepSeek V4 Flash($0.086/$0.173)或 V4 Pro($0.70/$2.10)能以低得多的价格搞定它们。对于最看重推理 token 节制的纯编码 agent 循环,可以拿更精简的同门 Kimi K2.7 Code 来做 A/B 测试。纯数学推理,选 DeepSeek V4 Pro。
快速开始(curl)
curl https://api.quicksilverpro.io/v1/chat/completions \
-H "Authorization: Bearer $QSP_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "kimi-k3",
"messages": [{"role": "user", "content": "Hello!"}]
}'兼容 OpenAI。只需改一行 base_url 即可迁移。
常见问题
K3 是更大、原生多模态的一次升级 —— 一个 2.8T 参数的开放权重推理模型,拥有 1M token 上下文,而 K2 系列是万亿参数的文本模型,上下文为 256K。它针对复杂编码、知识工作和长程 agent 工作流做了调优,并接受图像输入,因此可以在代码之外对照截图、图表和渲染结果进行迭代。它的架构采用 KDA 和 Attention Residuals,在这样的规模下提升计算效率。如果你的工作负载是纯编码且对成本敏感,K2.7 Code 更精简的推理 token 预算可能仍然更优 —— 请在你的评测上对两者做 A/B 测试。
可以 —— K3 在 QuickSilver Pro 上是一个 OpenAI 兼容的 chat completions endpoint。设置 base_url=https://api.quicksilverpro.io/v1,并使用 model="kimi-k3"。QSP 当前的 OpenRouter 线路支持 `reasoning: { enabled: false }`;Moonshot 的直连 API 则不支持,因此不要假定这个开关在不同提供商之间通用。
OpenRouter 对 K3 的标价为每 1M token 输入 $3.00 / 输出 $15.00;QuickSilver Pro 为 $2.55 / $12.75 —— 输入输出两端均低约 15%。同样的 OpenAI 兼容接口;迁移只需替换 base_url 和 key,并去掉模型 ID 中的 `moonshotai/` 提供商前缀。
在之后的每一轮和每一次工具调用中,都要附上 API 返回的完整 assistant 消息;不要只保留 `content`,也不要在一段已有的推理对话中途切换到 K3。除非与 K3 的固定值 temperature=1.0、top_p=0.95、n=1 以及各项 penalty 为零一致,否则请不要覆盖采样参数。开启推理时,请使用顶层的 `reasoning_effort`,取值为 low、high 或 max。