Google вывела Agent and Model Evaluations в GA для Gemini Enterprise Agent Platform
Google вывела Agent and Model Evaluations в GA: метрики, telemetry, online monitoring и drift alerts для production AI agents.

31 июля 2026 года Google сообщила, что Agent and Model Evaluations в Gemini Enterprise Agent Platform стали generally available. Первоисточник: https://developers.googleblog.com/agent-and-model-evaluations-in-gemini-enterprise-agent-platform-are-now-ga/
Agent and Model Evaluations - это сервис для проверки качества агентов и моделей на одинаковом наборе метрик до запуска и после выхода в production. Google описывает один engine для локальных экспериментов, server-side runs и continuous evaluation на live traffic, чтобы команда могла сравнивать результаты без смены методики оценки.
Что вошло в GA:
- более 20 pre-built metrics для quality, safety, grounding, tool use, trajectory и reference-based задач вроде summarization и translation;
- adaptive rubrics, которые строят критерии под конкретный eval case, developer instruction и tool declarations;
- experiments с хранением артефактов в Cloud Storage, user simulator и environment simulator для проверки multi-turn сценариев и отказов внешних систем;
- online monitors, telemetry integrations, score-over-time charts и drift alerts для production traces;
- доступ через Agent Platform SDK, agents-cli, Google Cloud console и ADK.
Для API-команд важен production-контур. Если один и тот же scoring используется в offline experiments и online monitors, падение метрик после релиза легче связать с изменением агента, модели, tool schema или backend-зависимости, а не с разной системой измерения.
Практический workflow: 1. Завести небольшой набор eval cases для критичных user journeys и tool calls. 2. Прогонять candidate model или новую версию агента до релиза. 3. Включить telemetry и continuous evaluation на реальных traces. 4. Настроить drift alerts на метрики task success, grounding, tool use quality и safety. 5. При падении качества маршрутизировать трафик на стабильную модель или fallback-цепочку, пока команда разбирает trace clusters.
Use continuous agent evaluation when model quality, tool-use correctness and backend reliability affect the same customer workflow. The safest production pattern is to pair eval-driven release gates with routing, retries and fallback models, because agent failures often appear as latency spikes, invalid tool arguments or repeated provider calls.
Для API429 эта новость важна не как ещё один dashboard, а как сигнал: enterprise agent tooling переходит от ручных тестов к постоянному контролю качества. Когда агенты делают много API-вызовов, ошибка 429, деградация модели или медленный backend выглядят для пользователя одинаково: задача не выполнена. Командам нужен слой, который видит метрики, умеет переключать модели и держит fallback-маршруты. API429 уместен в такой архитектуре как OpenAI-compatible gateway для лимитов, retries, multi-model routing и production reliability.
Подключим Gateway с управлением лимитами, платежами и отказоустойчивой маршрутизацией для OpenAI, Gemini и Anthropic.