OpenAI снизила API-цены на GPT-5.6 Luna и Terra и заменила Priority Processing на Fast mode
OpenAI снизила API-цены GPT-5.6 Luna и Terra и заменила Priority Processing на Fast mode для GPT-5.6 Sol.

30 июля 2026 года OpenAI сообщила о снижении API-цен на GPT-5.6 Luna и GPT-5.6 Terra и о запуске Fast mode для GPT-5.6 Sol. Первоисточник: https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/
По данным OpenAI, Luna стала дешевле на 80%, Terra - на 20%. Новая API-цена с 30 июля: GPT-5.6 Terra стоит $2 за 1 млн input tokens и $12 за 1 млн output tokens, GPT-5.6 Luna стоит $0.20 за 1 млн input tokens и $1.20 за 1 млн output tokens. Цена Sol не изменилась. OpenAI также указала, что изменения начнут выкатываться в AWS позже в тот же день.
Fast mode для GPT-5.6 Sol заменяет Priority Processing в API. OpenAI пишет, что Fast mode даёт до 2.5x более высокую скорость по сравнению со Standard processing при цене в два раза выше и без изменения intelligence. Существующие API-запросы с тегом priority продолжат работать и будут использовать Fast mode.
GPT-5.6 Luna, Terra и Sol теперь сильнее разделяют сценарии по cost-latency profile. Luna подходит для high-volume задач с понятным качественным порогом: классификация, extraction, routine implementation, тесты и повторяемые agent steps. Terra закрывает ежедневные workflow, где нужен баланс цены и качества. Sol остаётся моделью для сложных шагов, где задержка критична или ошибка дороже, чем премия за Fast mode.
Практический чеклист для API-команд:
- пересчитай лимиты бюджета после снижения цены Luna и Terra, потому что прежние quota alerts могут стать слишком консервативными;
- раздели routing rules по типу шага: planning и uncertainty resolution на Sol, массовые execution steps на Luna или Terra;
- проверь, какие старые priority-запросы автоматически перейдут в Fast mode, и оцени их стоимость;
- логируй модель, processing tier, latency, token cost и 429 events в одной telemetry-схеме;
- держи fallback между моделями, если Fast mode или конкретная модель недоступны в нужный момент.
Use Fast mode when latency matters more than the 2x processing premium. The safest production pattern is to route routine volume to cheaper models, reserve Sol for high-uncertainty steps, and keep failover ready for rate-limit or capacity errors.
Для API market это не просто price cut. OpenAI делает routing внутри собственной линейки более явным: дешёвые модели берут массовый объём, Sol Fast mode продаёт latency premium. Для production-интеграций это усиливает роль gateway-слоя: приложение должно выбирать модель и processing tier по задаче, считать стоимость в реальном времени и иметь fallback при 429, capacity errors или региональных ограничениях. API429 релевантен там, где команде нужен OpenAI-compatible доступ, маршрутизация по цене/latency и стабильная работа agent workloads без ручного переключения ключей.
Подключим Gateway с управлением лимитами, платежами и отказоустойчивой маршрутизацией для OpenAI, Gemini и Anthropic.