Модели

Каталог моделей

Один OpenAI-совместимый API: open-source LLM (DeepSeek V4, Qwen включая 3.7 Max и 3.6 Plus, Kimi, GLM) плюс семейство Gemini от Google для мультимодального чата, reasoning и генерации изображений. Все цены — за 1M токенов в USD по состоянию на июль 2026. ID модели — это значение поля model в теле запроса.

Обзор

Model IDКонтекстВходВыходПримечания
deepseek-v4-flash1M$0.086$0.173Дешёвая рабочая лошадка для чата и кодинга. По умолчанию думает — передайте reasoning.enabled=false для ответов в стиле V3.
deepseek-v4.1-flash1M$0.125$0.55official DeepSeek V4.1 Flash — new architecture, faster, 1M context, Responses API
deepseek-v4-pro1M$0.70$2.10Премиум-резонирование с контекстом 1M токенов. Аналог o3-mini при выходных ценах ~в 6× ниже.
qwen3.8-max1M$2.00$6.00Флагман Alibaba Qwen 3.8, выпущен 2026-08-03: MoE на 2.4T параметров, который Alibaba позиционирует для автономного кодинга и долгих agent-задач. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте enable_thinking=true, чтобы включить трассу рассуждений.
qwen3.8-max-prime1M$4.00$12.00Qwen 3.8 top-tier flagship, deepest reasoning & autonomous coding, 1M context
qwen3.8-omni-flash1M$0.15$0.47Qwen's first agentic omni model: native image, audio and video understanding with tool use and reasoning, 1M context, at Alibaba's first-party price
qwen3.7-max1M$1.25$3.75Qwen 3.7 флагман. Agent-нагрузки, программирование и долгосрочные задачи. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте enable_thinking=true, чтобы включить трассу рассуждений.
qwen3.7-plus1M$0.256$1.024Мультимодальный agent-флагман Alibaba для долгих циклов программирования, контекст 1M. Передайте reasoning.enabled=true, чтобы включить рассуждение.
qwen3.7-flash1M$0.024$0.104Быстрая мультимодальная agent-модель для визуального кодинга, поиска, инструментов и массовой автоматизации.
qwen3.6-plus1M$0.26$1.561T-параметрический MoE-флагман. 1M контекст. Самая используемая Qwen на OpenRouter по объёму. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте reasoning.enabled=true, чтобы включить трассу рассуждений.
qwen3.6-35b262K$0.112$0.8035B/3B-active MoE. Долгий контекст для RAG и суммаризации, сильное резонирование.
qwen3.8-27b1M$0.34$2.04Qwen's fast open 27B reasoning model with a 1M-token context window
qwen3.8-flash-next1M$0.12$0.376Qwen's open Qwen4-architecture preview: 6B-active MoE, fast and cheap, with a 1M-token context window
kimi-k2.6256K$0.5472$2.728Opus-класс для agentic / планирования. Лучший выбор, когда ваши evals выбирают Claude Opus.
kimi-k2.7-code256K$0.584$2.80K2 от Moonshot, настроенная под долгосрочное agentic-программирование. Moonshot сообщает примерно на 30% меньше токенов рассуждений на задачу, чем у K2.6.
kimi-k31M$2.55$12.75Флагманская мультимодальная reasoning-модель Moonshot с открытыми весами на 2.8T. Сложное программирование, работа со знаниями и долгосрочные agentic-сценарии.
muse-spark-1.31M$1.00$3.40Coding & agentic reasoning model, 1M context
muse-spark-1.21M$1.00$3.40Coding-focused reasoning model, 1M context
muse-glimmer-30b131,072$0.28$1.20Compact agentic multimodal model, distilled from Muse Spark
glm-5.31M$1.12$3.52Z.ai latest reasoning flagship, 1M context, complex software engineering & long-horizon agents
glm-5.3-prime1M$2.24$7.04Z.ai GLM 5.3 Prime, top reasoning flagship, 1M context, complex software engineering
glm-5.3-flash1M$0.06$0.20Z.ai fast open-weights reasoning model, 1M context at workhorse pricing
glm-5.21M$1.12$3.52Флагманская крупномасштабная reasoning-модель от Z.ai. Контекст 1M, создана для долгосрочных agent-сценариев и разработки ПО уровня проекта. По умолчанию думает — шлюз по умолчанию подавляет размышления; передайте reasoning.enabled=true, чтобы включить трассу рассуждений.
nemotron-3.5-lightning262K$0.066$0.17630B-A3B open MoE for fast, tool-heavy agents
gpt-oss-120b131,072$0.041$0.187OpenAI's open-weight 117B MoE, high-volume agents & reasoning, 131K context
gpt-6-astra1M$10.00 ($20.00 >200K)$50.00 ($75.00 >200K)Флагман GPT-6 от OpenAI. Долгосрочные agentic-задачи в программировании, глубокие исследования и работа с документами; принимает изображения.
gpt-6-luna1M$0.10 ($0.20 >200K)$0.50 ($0.75 >200K)OpenAI's cost-efficient GPT-6, high-volume chat & lightweight agentic work, 1M context
gpt-6.1-sol1M$2.00 ($4.00 >200K)$10.00 ($15.00 >200K)OpenAI's GPT-6.1 Sol, near-Astra agentic coding at Sol pricing, 1M context
gpt-6-sol1M$2.00 ($4.00 >200K)$10.00 ($15.00 >200K)OpenAI's GPT-6 mid-flagship, strong reasoning & agentic coding, 1M context
gpt-5.6-luna1M$0.16$0.96Быстрый и экономичный уровень GPT-5.6 от OpenAI. Для высоконагруженного чата и классификации с низкой задержкой. Reasoning-модель; передайте reasoning.enabled=false, чтобы подавить трассу.
gpt-5.6-terra1M$1.60$9.60Сбалансированный средний уровень GPT-5.6 от OpenAI, между Luna и Sol. Повседневное программирование, рассуждение и agent-задачи.
gpt-5.6-sol1M$1.60$8.00Флагман GPT-5.6 от OpenAI. Сложное рассуждение, программирование и agentic-сценарии, особенно многошаговые задачи.
grok-4.5500K$1.60$4.80Передовая модель xAI для программирования, работы со знаниями и STEM. Всегда рассуждает — reasoning.enabled=false отклоняется; управляйте глубиной через reasoning_effort.
grok-4.6500K$2.00 ($4.00 >200K)$6.00 ($12.00 >200K)Передовая модель xAI для программирования, работы со знаниями, STEM и анализа изображений; принимает изображения. Всегда рассуждает — reasoning.enabled=false отклоняется; управляйте глубиной через reasoning_effort.
grok-4.7500K$2.00 ($4.00 >200K)$6.00 ($12.00 >200K)Флагман xAI для программирования, agentic-задач и работы со знаниями, преемник Grok 4.6. Создан для длительной разработки ПО и самопроверки; принимает изображения. Всегда рассуждает — reasoning.enabled=false отклоняется; управляйте глубиной через reasoning_effort.
minimax-m31M$0.24$0.96Передовая модель MiniMax с открытыми весами. Только текстовый ввод, настроена под долгосрочное agentic-программирование.
mimo-v2.6-pro1M$0.348$0.696Флагманская модель Xiaomi с открытыми весами MiMo-V2.6-Pro (MoE 1,02T, 42B активных) — лучшая open-weights модель по Artificial Analysis Intelligence Index. Программирование и agent-сценарии; принимает изображения. Работает в режиме без рассуждения (reasoning выключен).
mimo-v2.6-flash1M$0.112$0.224Быстрая и недорогая MiMo-V2.6-Flash от Xiaomi с открытыми весами (MoE 309B, 15B активных). Повседневное программирование и агенты; принимает изображения. Работает в режиме без рассуждения (reasoning выключен).
mimo-v2.51M$0.112$0.224MiMo-V2.5 от Xiaomi с открытыми весами. Экономичное повседневное программирование и agent-сценарии.
hy4-preview1M$0.6672$2.0008Tencent's Hy4 (preview). Successor to Hy3 for coding and agentic workflows with reasoning.
hy3262K$0.091$0.363Hy3 от Tencent. Универсальное программирование и agent-сценарии с переключаемым рассуждением.
jev-1.1332K$0.042бесплатноМодель System One от TypeSafe на POST /v1/systemone — не чат-модель. Отвечает на типизированные вопросы choice / score / noul о JSON-состоянии с калиброванными вероятностями. Оплачивается только вход.
claude-opus-5-51M$1.60$8.00Самый способный Claude от Anthropic и первая модель семейства Claude 5.5. Опережает Opus 5 и Fable 5.1 в agentic-программировании, работе со знаниями и управлении компьютером, при более низкой цене за токен, чем у Opus 5. Принимает изображения на вход. Anthropic не принимает принудительный tool_choice для этой модели; QuickSilver Pro передаёт его как auto с инструкцией вызвать инструмент — это направляет модель, но не гарантирует вызов.
claude-opus-51M$2.00$10.00Opus 5 от Anthropic для сложного рассуждения, программирования и долгосрочной agentic-работы. Принимает изображения на вход.
claude-fable-5-11M$4.00$20.00Модель Anthropic класса Mythos, версия 5.1, для глубокого рассуждения и долгосрочной agentic-работы.
claude-fable-51M$4.00$20.00Модель Anthropic класса Mythos для глубокого рассуждения и долгосрочной agentic-работы.
claude-opus-4-81M$2.00$10.00Флагман Anthropic. Рассуждение, программирование и agent-нагрузки высшего уровня.
claude-sonnet-5-51M$1.00$5.00Anthropic's newest Sonnet, faster and fewer tokens per task, 1M context
claude-sonnet-51M$1.00$5.00Новейший Sonnet от Anthropic. Более сильные рассуждения и код по цене ниже прежнего среднего уровня.
claude-haiku-4-5200K$0.40$2.00Быстрый недорогой уровень Anthropic для высоконагруженных задач. Не выдаёт трассу рассуждений.
gemini-3.7-flash1M$0.6375$3.1875fast multimodal Flash for agents; promotional pricing through 2026-12-31
gemini-3.8-flash1M$0.6375$3.1875most capable Flash for agents; promotional pricing through 2026-12-31
gemini-3.6-flash1M$0.6375$3.1875Текущая универсальная Flash-модель GA. Рекомендуется для новых интеграций.
gemini-3.5-flash-lite1M$0.255$2.125Текущая недорогая Flash-Lite GA для высоконагруженных сценариев.
gemini-3.5-flash1M$1.275$7.65Следующее поколение Flash от Google (GA). 1M контекст, по умолчанию мыслит. По возможностям и цене — между 3 Flash Preview и 3.1 Pro.
gemini-3.1-pro-preview1M$1.70$10.20Флагман reasoning от Google. 1M контекст, глубокое мышление. Preview API; семантика может ещё измениться до GA.
gemini-3-pro-image1M$1.70$10.20GA-генерация изображений pro-уровня. Заменяет отключённый preview ID.
gemini-3-flash-preview1M$0.425$2.55Только для совместимости. Перенесите новые и существующие нагрузки на gemini-3.6-flash.
gemini-3.1-flash-lite1M$0.2125$1.275Только для совместимости. Перенесите новые и существующие нагрузки на gemini-3.5-flash-lite.
flux.2-pro-—$0.027 за изображениеФлагманская генерация изображений через /v1/images/generations. Оплата за изображение.
flux.1-schnell-—$0.003 за изображениеultra-fast open image generation, billed per image
sdxl-turbo-—$0.003 за изображениеfast open image generation (SDXL Turbo), billed per image
flux.2-klein-—$0.02 за изображениеopen FLUX.2 image generation, billed per image
qwen-image-max-—$0.1 за изображениеAlibaba's Qwen-Image flagship: high-fidelity generation with strong typography, billed per image
seedream-5.0-pro-—$0.07 за изображениеByteDance's Seedream 5.0 Pro: flagship photorealistic image generation, billed per image
seedream-4-—$0.055 за изображениеByteDance Seedream 4: fast, high-quality image generation, billed per image
bria-fibo-1.5-—$0.055 за изображениеBria FIBO 1.5: image generation trained on fully licensed data (commercially safe), billed per image

Какую модель выбрать?

  • Базовый выбор для кода - deepseek-v4-flash. Практичная отправная точка для кода, чата и production-агентов. 1M контекст; вход $0.086, выход $0.173.
  • Сложные рассуждения - deepseek-v4-pro. Для математики, доказательств и сложных многошаговых задач. 1M контекст; вход $0.70, выход $2.10.
  • RAG по длинным документам - qwen3.6-35b. Компактный MoE для retrieval и суммаризации длинных документов. 262K контекст; вход $0.112, выход $0.80.
  • Agentic-планирование - kimi-k2.6. Для случаев, где ваши тесты выбирают планирование уровня Opus. 256K контекст; вход $0.5472, выход $2.728.
  • Мультимодальные задачи - gemini-3.6-flash. Для prompt с изображениями и текстом. 1M контекст; вход $0.6375, выход $3.1875.
  • Генерация изображений - gemini-3-pro-image. Для изображений профессионального уровня. 1M контекст; вход $1.70, выход $10.20.
  • Короткие массовые запросы - gemini-3.5-flash-lite. Для экономичной маршрутизации, классификации и извлечения. 1M контекст; вход $0.255, выход $2.125.
  • Решения: маршрутизация и классификация - jev-1.13. Модель System One, не чат: типизированные ответы с калиброванными вероятностями на POST /v1/systemone. 32K контекст; вход $0.042, выход бесплатно.

Думающие vs нережущие модели

V4 (V4 Flash, V4 Pro, Kimi K2.6) и Qwen 3.6 выдают chain-of-thought trace перед финальным ответом. Даже односимвольный "Hi" может вернуть ~175 reasoning tokens. Чтобы получить дешёвый нерезонирующий чат на этих моделях, передайте:

Полный код в Quickstart →

Некоторые всегда-резонирующие модели (например, Grok 4.5) игнорируют reasoning.enabled=false — резонирование и есть модель. Если не нужна chain-of-thought — используйте V4 Flash.

Модели Claude: структурированный вывод и выбор инструмента

Модели Claude не обеспечивают соблюдение response_format: {type: "json_schema"} — запрос выполняется успешно, но ответ приходит обычным текстом, а не JSON по схеме. Если вам нужен вывод по схеме, опишите её как инструмент с strict: true и читайте аргументы вызова инструмента: этот путь действительно ограничен схемой.

Для claude-opus-5-5, claude-sonnet-5-5 и claude-fable-5-1 Anthropic не принимает принудительный tool_choice. QuickSilver Pro всё равно принимает такой запрос и передаёт его как "auto" вместе с инструкцией вызвать этот инструмент, поэтому модель лишь настойчиво направляется к инструменту, а не принуждается — обрабатывайте ответ без tool_calls. Остальные модели Claude поддерживают принудительный выбор нативно.

Модели System One (типизированные решения)

Модели System One — сейчас это Jev 1.13 — не чат-модели. Вы отправляете JSON-состояние и типизированные вопросы (choice, score или noul) на POST /v1/systemone и получаете калиброванные вероятности за один прямой проход — без сгенерированного текста, который нужно разбирать. Подходят для маршрутизации, классификации, триажа, оценки и guardrail-решений. Оплачиваются только входные токены — выход бесплатный; вызов через Chat Completions отклоняется.

Документация System One (англ.) →

Страницы по отдельным моделям