Каталог моделей
Один OpenAI-совместимый API: open-source LLM (DeepSeek V4, Qwen включая 3.7 Max и 3.6 Plus, Kimi, GLM) плюс семейство Gemini от Google для мультимодального чата, reasoning и генерации изображений. Все цены — за 1M токенов в USD по состоянию на июль 2026. ID модели — это значение поля model в теле запроса.
Обзор
| Model ID | Контекст | Вход | Выход | Примечания |
|---|---|---|---|---|
| deepseek-v4-flash | 1M | $0.086 | $0.173 | Дешёвая рабочая лошадка для чата и кодинга. По умолчанию думает — передайте reasoning.enabled=false для ответов в стиле V3. |
| deepseek-v4.1-flash | 1M | $0.125 | $0.55 | official DeepSeek V4.1 Flash — new architecture, faster, 1M context, Responses API |
| deepseek-v4-pro | 1M | $0.70 | $2.10 | Премиум-резонирование с контекстом 1M токенов. Аналог o3-mini при выходных ценах ~в 6× ниже. |
| qwen3.8-max | 1M | $2.00 | $6.00 | Флагман Alibaba Qwen 3.8, выпущен 2026-08-03: MoE на 2.4T параметров, который Alibaba позиционирует для автономного кодинга и долгих agent-задач. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте enable_thinking=true, чтобы включить трассу рассуждений. |
| qwen3.8-max-prime | 1M | $4.00 | $12.00 | Qwen 3.8 top-tier flagship, deepest reasoning & autonomous coding, 1M context |
| qwen3.8-omni-flash | 1M | $0.15 | $0.47 | Qwen's first agentic omni model: native image, audio and video understanding with tool use and reasoning, 1M context, at Alibaba's first-party price |
| qwen3.7-max | 1M | $1.25 | $3.75 | Qwen 3.7 флагман. Agent-нагрузки, программирование и долгосрочные задачи. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте enable_thinking=true, чтобы включить трассу рассуждений. |
| qwen3.7-plus | 1M | $0.256 | $1.024 | Мультимодальный agent-флагман Alibaba для долгих циклов программирования, контекст 1M. Передайте reasoning.enabled=true, чтобы включить рассуждение. |
| qwen3.7-flash | 1M | $0.024 | $0.104 | Быстрая мультимодальная agent-модель для визуального кодинга, поиска, инструментов и массовой автоматизации. |
| qwen3.6-plus | 1M | $0.26 | $1.56 | 1T-параметрический MoE-флагман. 1M контекст. Самая используемая Qwen на OpenRouter по объёму. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте reasoning.enabled=true, чтобы включить трассу рассуждений. |
| qwen3.6-35b | 262K | $0.112 | $0.80 | 35B/3B-active MoE. Долгий контекст для RAG и суммаризации, сильное резонирование. |
| qwen3.8-27b | 1M | $0.34 | $2.04 | Qwen's fast open 27B reasoning model with a 1M-token context window |
| qwen3.8-flash-next | 1M | $0.12 | $0.376 | Qwen's open Qwen4-architecture preview: 6B-active MoE, fast and cheap, with a 1M-token context window |
| kimi-k2.6 | 256K | $0.5472 | $2.728 | Opus-класс для agentic / планирования. Лучший выбор, когда ваши evals выбирают Claude Opus. |
| kimi-k2.7-code | 256K | $0.584 | $2.80 | K2 от Moonshot, настроенная под долгосрочное agentic-программирование. Moonshot сообщает примерно на 30% меньше токенов рассуждений на задачу, чем у K2.6. |
| kimi-k3 | 1M | $2.55 | $12.75 | Флагманская мультимодальная reasoning-модель Moonshot с открытыми весами на 2.8T. Сложное программирование, работа со знаниями и долгосрочные agentic-сценарии. |
| muse-spark-1.3 | 1M | $1.00 | $3.40 | Coding & agentic reasoning model, 1M context |
| muse-spark-1.2 | 1M | $1.00 | $3.40 | Coding-focused reasoning model, 1M context |
| muse-glimmer-30b | 131,072 | $0.28 | $1.20 | Compact agentic multimodal model, distilled from Muse Spark |
| glm-5.3 | 1M | $1.12 | $3.52 | Z.ai latest reasoning flagship, 1M context, complex software engineering & long-horizon agents |
| glm-5.3-prime | 1M | $2.24 | $7.04 | Z.ai GLM 5.3 Prime, top reasoning flagship, 1M context, complex software engineering |
| glm-5.3-flash | 1M | $0.06 | $0.20 | Z.ai fast open-weights reasoning model, 1M context at workhorse pricing |
| glm-5.2 | 1M | $1.12 | $3.52 | Флагманская крупномасштабная reasoning-модель от Z.ai. Контекст 1M, создана для долгосрочных agent-сценариев и разработки ПО уровня проекта. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте reasoning.enabled=true, чтобы включить трассу рассуждений. |
| nemotron-3.5-lightning | 262K | $0.066 | $0.176 | 30B-A3B open MoE for fast, tool-heavy agents |
| gpt-oss-120b | 131,072 | $0.041 | $0.187 | OpenAI's open-weight 117B MoE, high-volume agents & reasoning, 131K context |
| gpt-6-astra | 1M | $10.00 ($20.00 >200K) | $50.00 ($75.00 >200K) | Флагман GPT-6 от OpenAI. Долгосрочные agentic-задачи в программировании, глубокие исследования и работа с документами; принимает изображения. |
| gpt-6-luna | 1M | $0.10 ($0.20 >200K) | $0.50 ($0.75 >200K) | OpenAI's cost-efficient GPT-6, high-volume chat & lightweight agentic work, 1M context |
| gpt-6.1-sol | 1M | $2.00 ($4.00 >200K) | $10.00 ($15.00 >200K) | OpenAI's GPT-6.1 Sol, near-Astra agentic coding at Sol pricing, 1M context |
| gpt-6-sol | 1M | $2.00 ($4.00 >200K) | $10.00 ($15.00 >200K) | OpenAI's GPT-6 mid-flagship, strong reasoning & agentic coding, 1M context |
| gpt-5.6-luna | 1M | $0.16 | $0.96 | Быстрый и экономичный уровень GPT-5.6 от OpenAI. Для высоконагруженного чата и классификации с низкой задержкой. Reasoning-модель; передайте reasoning.enabled=false, чтобы подавить трассу. |
| gpt-5.6-terra | 1M | $1.60 | $9.60 | Сбалансированный средний уровень GPT-5.6 от OpenAI, между Luna и Sol. Повседневное программирование, рассуждение и agent-задачи. |
| gpt-5.6-sol | 1M | $1.60 | $8.00 | Флагман GPT-5.6 от OpenAI. Сложное рассуждение, программирование и agentic-сценарии, особенно многошаговые задачи. |
| grok-4.5 | 500K | $1.60 | $4.80 | Передовая модель xAI для программирования, работы со знаниями и STEM. Всегда рассуждает — reasoning.enabled=false отклоняется; управляйте глубиной через reasoning_effort. |
| grok-4.6 | 500K | $2.00 ($4.00 >200K) | $6.00 ($12.00 >200K) | Передовая модель xAI для программирования, работы со знаниями, STEM и анализа изображений; принимает изображения. Всегда рассуждает — reasoning.enabled=false отклоняется; управляйте глубиной через reasoning_effort. |
| grok-4.7 | 500K | $2.00 ($4.00 >200K) | $6.00 ($12.00 >200K) | Флагман xAI для программирования, agentic-задач и работы со знаниями, преемник Grok 4.6. Создан для длительной разработки ПО и самопроверки; принимает изображения. Всегда рассуждает — reasoning.enabled=false отклоняется; управляйте глубиной через reasoning_effort. |
| minimax-m3 | 1M | $0.24 | $0.96 | Передовая модель MiniMax с открытыми весами. Только текстовый ввод, настроена под долгосрочное agentic-программирование. |
| mimo-v2.6-pro | 1M | $0.348 | $0.696 | Флагманская модель Xiaomi с открытыми весами MiMo-V2.6-Pro (MoE 1,02T, 42B активных) — лучшая open-weights модель по Artificial Analysis Intelligence Index. Программирование и agent-сценарии; принимает изображения. Работает в режиме без рассуждения (reasoning выключен). |
| mimo-v2.6-flash | 1M | $0.112 | $0.224 | Быстрая и недорогая MiMo-V2.6-Flash от Xiaomi с открытыми весами (MoE 309B, 15B активных). Повседневное программирование и агенты; принимает изображения. Работает в режиме без рассуждения (reasoning выключен). |
| mimo-v2.5 | 1M | $0.112 | $0.224 | MiMo-V2.5 от Xiaomi с открытыми весами. Экономичное повседневное программирование и agent-сценарии. |
| hy4-preview | 1M | $0.6672 | $2.0008 | Tencent's Hy4 (preview). Successor to Hy3 for coding and agentic workflows with reasoning. |
| hy3 | 262K | $0.091 | $0.363 | Hy3 от Tencent. Универсальное программирование и agent-сценарии с переключаемым рассуждением. |
| jev-1.13 | 32K | $0.042 | бесплатно | Модель System One от TypeSafe на POST /v1/systemone — не чат-модель. Отвечает на типизированные вопросы choice / score / noul о JSON-состоянии с калиброванными вероятностями. Оплачивается только вход. |
| claude-opus-5-5 | 1M | $1.60 | $8.00 | Самый способный Claude от Anthropic и первая модель семейства Claude 5.5. Опережает Opus 5 и Fable 5.1 в agentic-программировании, работе со знаниями и управлении компьютером, при более низкой цене за токен, чем у Opus 5. Принимает изображения на вход. Anthropic не принимает принудительный tool_choice для этой модели; QuickSilver Pro передаёт его как auto с инструкцией вызвать инструмент — это направляет модель, но не гарантирует вызов. |
| claude-opus-5 | 1M | $2.00 | $10.00 | Opus 5 от Anthropic для сложного рассуждения, программирования и долгосрочной agentic-работы. Принимает изображения на вход. |
| claude-fable-5-1 | 1M | $4.00 | $20.00 | Модель Anthropic класса Mythos, версия 5.1, для глубокого рассуждения и долгосрочной agentic-работы. |
| claude-fable-5 | 1M | $4.00 | $20.00 | Модель Anthropic класса Mythos для глубокого рассуждения и долгосрочной agentic-работы. |
| claude-opus-4-8 | 1M | $2.00 | $10.00 | Флагман Anthropic. Рассуждение, программирование и agent-нагрузки высшего уровня. |
| claude-sonnet-5-5 | 1M | $1.00 | $5.00 | Anthropic's newest Sonnet, faster and fewer tokens per task, 1M context |
| claude-sonnet-5 | 1M | $1.00 | $5.00 | Новейший Sonnet от Anthropic. Более сильные рассуждения и код по цене ниже прежнего среднего уровня. |
| claude-haiku-4-5 | 200K | $0.40 | $2.00 | Быстрый недорогой уровень Anthropic для высоконагруженных задач. Не выдаёт трассу рассуждений. |
| gemini-3.7-flash | 1M | $0.6375 | $3.1875 | fast multimodal Flash for agents; promotional pricing through 2026-12-31 |
| gemini-3.8-flash | 1M | $0.6375 | $3.1875 | most capable Flash for agents; promotional pricing through 2026-12-31 |
| gemini-3.6-flash | 1M | $0.6375 | $3.1875 | Текущая универсальная Flash-модель GA. Рекомендуется для новых интеграций. |
| gemini-3.5-flash-lite | 1M | $0.255 | $2.125 | Текущая недорогая Flash-Lite GA для высоконагруженных сценариев. |
| gemini-3.5-flash | 1M | $1.275 | $7.65 | Следующее поколение Flash от Google (GA). 1M контекст, по умолчанию мыслит. По возможностям и цене — между 3 Flash Preview и 3.1 Pro. |
| gemini-3.1-pro-preview | 1M | $1.70 | $10.20 | Флагман reasoning от Google. 1M контекст, глубокое мышление. Preview API; семантика может ещё измениться до GA. |
| gemini-3-pro-image | 1M | $1.70 | $10.20 | GA-генерация изображений pro-уровня. Заменяет отключённый preview ID. |
| gemini-3-flash-preview | 1M | $0.425 | $2.55 | Только для совместимости. Перенесите новые и существующие нагрузки на gemini-3.6-flash. |
| gemini-3.1-flash-lite | 1M | $0.2125 | $1.275 | Только для совместимости. Перенесите новые и существующие нагрузки на gemini-3.5-flash-lite. |
| flux.2-pro | - | — | $0.027 за изображение | Флагманская генерация изображений через /v1/images/generations. Оплата за изображение. |
| flux.1-schnell | - | — | $0.003 за изображение | ultra-fast open image generation, billed per image |
| sdxl-turbo | - | — | $0.003 за изображение | fast open image generation (SDXL Turbo), billed per image |
| flux.2-klein | - | — | $0.02 за изображение | open FLUX.2 image generation, billed per image |
| qwen-image-max | - | — | $0.1 за изображение | Alibaba's Qwen-Image flagship: high-fidelity generation with strong typography, billed per image |
| seedream-5.0-pro | - | — | $0.07 за изображение | ByteDance's Seedream 5.0 Pro: flagship photorealistic image generation, billed per image |
| seedream-4 | - | — | $0.055 за изображение | ByteDance Seedream 4: fast, high-quality image generation, billed per image |
| bria-fibo-1.5 | - | — | $0.055 за изображение | Bria FIBO 1.5: image generation trained on fully licensed data (commercially safe), billed per image |
Какую модель выбрать?
- Базовый выбор для кода -
deepseek-v4-flash. Практичная отправная точка для кода, чата и production-агентов. 1M контекст; вход $0.086, выход $0.173. - Сложные рассуждения -
deepseek-v4-pro. Для математики, доказательств и сложных многошаговых задач. 1M контекст; вход $0.70, выход $2.10. - RAG по длинным документам -
qwen3.6-35b. Компактный MoE для retrieval и суммаризации длинных документов. 262K контекст; вход $0.112, выход $0.80. - Agentic-планирование -
kimi-k2.6. Для случаев, где ваши тесты выбирают планирование уровня Opus. 256K контекст; вход $0.5472, выход $2.728. - Мультимодальные задачи -
gemini-3.6-flash. Для prompt с изображениями и текстом. 1M контекст; вход $0.6375, выход $3.1875. - Генерация изображений -
gemini-3-pro-image. Для изображений профессионального уровня. 1M контекст; вход $1.70, выход $10.20. - Короткие массовые запросы -
gemini-3.5-flash-lite. Для экономичной маршрутизации, классификации и извлечения. 1M контекст; вход $0.255, выход $2.125. - Решения: маршрутизация и классификация -
jev-1.13. Модель System One, не чат: типизированные ответы с калиброванными вероятностями на POST /v1/systemone. 32K контекст; вход $0.042, выход бесплатно.
Думающие vs нережущие модели
V4 (V4 Flash, V4 Pro, Kimi K2.6) и Qwen 3.6 выдают chain-of-thought trace перед финальным ответом. Даже односимвольный "Hi" может вернуть ~175 reasoning tokens. Чтобы получить дешёвый нерезонирующий чат на этих моделях, передайте:
Некоторые всегда-резонирующие модели (например, Grok 4.5) игнорируют reasoning.enabled=false — резонирование и есть модель. Если не нужна chain-of-thought — используйте V4 Flash.
Модели Claude: структурированный вывод и выбор инструмента
Модели Claude не обеспечивают соблюдение response_format: {type: "json_schema"} — запрос выполняется успешно, но ответ приходит обычным текстом, а не JSON по схеме. Если вам нужен вывод по схеме, опишите её как инструмент с strict: true и читайте аргументы вызова инструмента: этот путь действительно ограничен схемой.
Для claude-opus-5-5, claude-sonnet-5-5 и claude-fable-5-1 Anthropic не принимает принудительный tool_choice. QuickSilver Pro всё равно принимает такой запрос и передаёт его как "auto" вместе с инструкцией вызвать этот инструмент, поэтому модель лишь настойчиво направляется к инструменту, а не принуждается — обрабатывайте ответ без tool_calls. Остальные модели Claude поддерживают принудительный выбор нативно.
Модели System One (типизированные решения)
Модели System One — сейчас это Jev 1.13 — не чат-модели. Вы отправляете JSON-состояние и типизированные вопросы (choice, score или noul) на POST /v1/systemone и получаете калиброванные вероятности за один прямой проход — без сгенерированного текста, который нужно разбирать. Подходят для маршрутизации, классификации, триажа, оценки и guardrail-решений. Оплачиваются только входные токены — выход бесплатный; вызов через Chat Completions отклоняется.
Страницы по отдельным моделям
У каждой модели есть своя страница с сравнениями цен, FAQ и кодом quickstart. Ссылки:
- DeepSeek V4 Flash
- DeepSeek V4.1 Flash
- DeepSeek V4 Pro
- Qwen3.8 Max
- Qwen3.8 Omni Flash
- Qwen3.7 Max
- Qwen3.7 Plus
- Qwen3.7 Flash
- Qwen3.6 Plus
- Qwen3.6-35B-A3B
- Qwen3.8 27B
- Qwen3.8 Flash Next
- Kimi K2.6
- Kimi K2.7 Code
- Kimi K3
- Muse Spark 1.3
- Muse Spark 1.2
- Muse Glimmer 30B
- GLM 5.3
- GLM 5.3 Flash
- GLM 5.2
- Nemotron 3.5 Lightning
- GPT-OSS 120B
- GPT-6 Astra
- Grok 4.6
- Grok 4.7
- MiniMax M3
- MiMo-V2.6-Pro
- MiMo-V2.6-Flash
- MiMo-V2.5
- Hy4 Preview
- Hy3
- Jev 1.13
- Claude Opus 5.5
- Gemini 3.7 Flash
- Gemini 3.8 Flash
- Gemini 3.6 Flash
- Gemini 3.5 Flash-Lite
- Gemini 3.5 Flash
- Gemini 3.1 Pro Preview
- Gemini 3 Flash Preview
- Gemini 3.1 Flash Lite
- FLUX.2 Pro
- FLUX.1 Schnell
- SDXL Turbo
- FLUX.2 Klein
- Qwen-Image Max
- Seedream 5.0 Pro
- Seedream 4
- Bria FIBO 1.5
Отдельные страницы по моделям Gemini ещё в работе — до тех пор таблица выше остаётся каноническим источником цен и возможностей.