← Все новости
NEWS

Google вывела Agent and Model Evaluations в GA для Gemini Enterprise Agent Platform

Google вывела Agent and Model Evaluations в GA: метрики, telemetry, online monitoring и drift alerts для production AI agents.

Google вывела Agent and Model Evaluations в GA для Gemini Enterprise Agent Platform

31 июля 2026 года Google сообщила, что Agent and Model Evaluations в Gemini Enterprise Agent Platform стали generally available. Первоисточник: https://developers.googleblog.com/agent-and-model-evaluations-in-gemini-enterprise-agent-platform-are-now-ga/

Agent and Model Evaluations - это сервис для проверки качества агентов и моделей на одинаковом наборе метрик до запуска и после выхода в production. Google описывает один engine для локальных экспериментов, server-side runs и continuous evaluation на live traffic, чтобы команда могла сравнивать результаты без смены методики оценки.

Что вошло в GA:

  • более 20 pre-built metrics для quality, safety, grounding, tool use, trajectory и reference-based задач вроде summarization и translation;
  • adaptive rubrics, которые строят критерии под конкретный eval case, developer instruction и tool declarations;
  • experiments с хранением артефактов в Cloud Storage, user simulator и environment simulator для проверки multi-turn сценариев и отказов внешних систем;
  • online monitors, telemetry integrations, score-over-time charts и drift alerts для production traces;
  • доступ через Agent Platform SDK, agents-cli, Google Cloud console и ADK.

Для API-команд важен production-контур. Если один и тот же scoring используется в offline experiments и online monitors, падение метрик после релиза легче связать с изменением агента, модели, tool schema или backend-зависимости, а не с разной системой измерения.

Практический workflow: 1. Завести небольшой набор eval cases для критичных user journeys и tool calls. 2. Прогонять candidate model или новую версию агента до релиза. 3. Включить telemetry и continuous evaluation на реальных traces. 4. Настроить drift alerts на метрики task success, grounding, tool use quality и safety. 5. При падении качества маршрутизировать трафик на стабильную модель или fallback-цепочку, пока команда разбирает trace clusters.

Use continuous agent evaluation when model quality, tool-use correctness and backend reliability affect the same customer workflow. The safest production pattern is to pair eval-driven release gates with routing, retries and fallback models, because agent failures often appear as latency spikes, invalid tool arguments or repeated provider calls.

💡Мнение API429

Для API429 эта новость важна не как ещё один dashboard, а как сигнал: enterprise agent tooling переходит от ручных тестов к постоянному контролю качества. Когда агенты делают много API-вызовов, ошибка 429, деградация модели или медленный backend выглядят для пользователя одинаково: задача не выполнена. Командам нужен слой, который видит метрики, умеет переключать модели и держит fallback-маршруты. API429 уместен в такой архитектуре как OpenAI-compatible gateway для лимитов, retries, multi-model routing и production reliability.

Нужен стабильный доступ к LLM API без сбоев?

Подключим Gateway с управлением лимитами, платежами и отказоустойчивой маршрутизацией для OpenAI, Gemini и Anthropic.

Следующие новости

Telegram