Google Cloud добавила model routing в API Gateway Public Preview
Google Cloud запустила model routing в API Gateway Public Preview: OpenAI-compatible routing к Gemini, Claude и GPT family.

4 августа 2026 года Google Cloud объявила Public Preview функции model routing в API Gateway. Gateway принимает OpenAI-compatible prompt requests, транскодирует payload in-flight и маршрутизирует запросы к моделям Gemini, Anthropic Claude или OpenAI GPT family в Gemini Enterprise Agent Platform Model Garden. Первоисточник: https://developers.googleblog.com/a-unified-api-for-ai-model-routing/
Model routing - это управляемый слой traffic management для AI API. Разработчик описывает router в OpenAPI 3.x specification через расширения API Gateway, задаёт backend targets и связывает virtual model names с deployed MaaS models. Клиентское приложение отправляет стандартный POST-запрос с полем model, а gateway выбирает backend rule, переводит запрос в нужную схему prediction и возвращает ответ через единый интерфейс. Документация Google: https://docs.cloud.google.com/api-gateway/docs/model-routing-overview
Что важно в Public Preview:
- routing работает по model tag или model name в OpenAI-compatible JSON payload;
- все модели внутри одного router должны находиться на одном host, например
aiplatform.googleapis.comили одном regional endpoint; - поддерживается response streaming через server-sent events, но не request-side streaming, gRPC, WebSockets и Gemini Live;
- OpenAPI 2.0 не поддерживается, нужен OpenAPI 3.x;
- gateway с model routing нельзя включить или отключить на уже существующем gateway instance, для смены режима нужен новый API config и gateway;
- model routing gateways не поддерживают VPC Service Controls;
- максимальный timeout gateway - 3,600 seconds, а scale-to-zero может добавить cold-start latency.
Для enterprise-команд это означает, что routing logic переезжает из самописных proxy и SDK-ветвлений в managed gateway. Governance admins получают централизованные authentication, quotas и traffic volume monitoring, а AI developers сохраняют OpenAI-compatible REST interface для приложений.
Практический чеклист перед тестом: 1. Проверь, что все target models уже deployed в Agent Platform Model Garden и доступны на одном host. 2. Опиши routing rules в OpenAPI 3.x и явно задай default model. 3. Требуй поле model в каждом client request, потому что preview-документация отдельно отмечает этот edge case. 4. Замерь latency с cold start и response streaming отдельно от model latency. 5. Подготовь fallback вне одного router, если production workload зависит от VPC Service Controls, Gemini Live или cross-host routing.
Use model routing when the team wants one OpenAI-compatible endpoint for several deployed models and can accept preview constraints. The safest production pattern is to treat managed routing as one reliability layer, while keeping quota monitoring, retries and failover policy outside a single provider boundary.
Мнение API429: Google фактически подтверждает, что model routing становится базовой частью AI API-инфраструктуры. Но preview-ограничения важны: same-host routing, отсутствие VPC Service Controls и несовместимость с Gemini Live не закрывают все production-сценарии. Для API market это усиливает спрос на gateway-слои, которые умеют работать с лимитами, 429, OpenAI-compatible доступом, fallback между провайдерами и наблюдаемостью поверх конкретного cloud gateway.
Подключим Gateway с управлением лимитами, платежами и отказоустойчивой маршрутизацией для OpenAI, Gemini и Anthropic.