Google вывела Gemini 3.5 Transcribe и Transcribe Live в GA для Gemini API
Google вывела Gemini 3.5 Transcribe в GA: speech-to-text, Live API, WebSockets, 429 и reliability для voice AI.

26 августа 2026 года Google обновила release notes Gemini API: две dedicated speech-to-text модели перешли в general availability. Первоисточник: https://ai.google.dev/gemini-api/docs/changelog
Google указала два endpoint ID: gemini-3.5-transcribe для low-latency non-streaming transcription и gemini-3.5-transcribe-live для bidirectional streaming speech-to-text через Live API over WebSockets. В changelog перечислены utterance-based language detection across 85+ languages, speaker diarization, word-level timestamps, custom vocabulary biasing до 1 000 terms, interim и finalized transcription events, Smart transcription mode и несколько Voice Activity Detection strategies. Документация API также подтверждает, что Gemini API имеет Models endpoint для programmatic listing и metadata retrieval: https://ai.google.dev/api/models
Gemini 3.5 Transcribe is a production speech-to-text model family for Gemini API. Для разработчиков это закрывает два разных режима: batch или request/response transcription для файлов и streaming transcription для звонков, live support, meetings, voice agents и subtitle pipelines. Главное отличие non-streaming и Live варианта - latency и state: обычный endpoint проще для обработанных файлов, а Live API требует устойчивого WebSocket-сеанса, VAD policy и обработки partial/final events.
Практический checklist для production voice AI: 1. Раздели batch transcription и live transcription в routing policy, потому что у них разные timeout, retry и billing-профили. 2. Логируй interim events, finalized events, VAD stops, 429, reconnects и dropped WebSocket sessions как разные failure modes. 3. Для custom vocabulary храни версию словаря рядом с transcript metadata, чтобы повторная обработка была воспроизводимой. 4. Добавь fallback-путь для live-сценариев: degrade to non-streaming recording или alternate STT provider, если stream получает 429 или unstable latency. 5. Проверяй доступность model ID через Models endpoint перед rollout на новые ключи или регионы.
The safest production pattern is to treat speech-to-text as an API reliability workflow, not only a model call. Если voice agent зависит от real-time transcription, gateway должен управлять лимитами, reconnect policy, fallback и observability до того, как 429 или WebSocket failure прервёт пользовательскую сессию.
Мнение API429: GA-релиз Gemini 3.5 Transcribe расширяет рынок voice AI API за пределы обычного chat completions. У live transcription выше чувствительность к latency, 429 и обрывам WebSocket, поэтому routing layer должен видеть streaming-события, retries, provider limits и fallback отдельно. API429 уместен как OpenAI-compatible gateway для команд, которым нужно держать voice agents и transcription pipelines стабильными в production.
Подключим Gateway с управлением лимитами, платежами и отказоустойчивой маршрутизацией для OpenAI, Gemini и Anthropic.