AI Observability: Метрики здоровья
Модуль AI Observability поставляет готовые глобальные метрики для модуля МАЯК.
Они рассчитываются на данных из индексов gen_ai_* и позволяют включить AI-инфраструктуру в общую модель здоровья организации.
Метрики используются как индикаторы состояния AI-контура в ресурсно-сервисной модели. С их помощью можно отслеживать деградацию AI-компонентов, настраивать пороги критичности и связывать техническое состояние AI-инфраструктуры с влиянием на сервисы.
Назначение
Метрики здоровья позволяют:
- отображать состояние AI-компонентов наравне с инфраструктурными и прикладными сервисами
- учитывать GPU, AI-сервисы, трассировки и запросы в единой модели здоровья
- настраивать пороги деградации для ключевых показателей AI-инфраструктуры
- использовать AI-инфраструктуру как отдельный слой в сквозных сервисных моделях
Описание метрик
1. Температура GPU, °C
Источник данных: gen_ai_gpu_metrics*
Метрика показывает температуру ядра GPU в градусах Цельсия. Полезна для раннего обнаружения аппаратной деградации: критичный нагрев GPU может повлиять на производительность AI-сервисов и стабильность обработки запросов.

2. Загрузка GPU, %
Источник данных: gen_ai_gpu_metrics*
Метрика показывает текущую утилизацию GPU в процентах. Помогает определить, достаточно ли текущих GPU-ресурсов для обработки AI-запросов и требуется ли масштабирование инфраструктуры.

3. Утилизация памяти GPU, %
Источник данных: gen_ai_gpu_metrics*
Метрика показывает процент занятой видеопамяти GPU. Особенно важна для inference-сценариев с крупными LLM-моделями, где запас видеопамяти напрямую влияет на стабильность сервиса.

4. Длительность запросов, мс
Источник данных: gen_ai_traces*
Метрика показывает среднюю длительность AI-запросов и операций в миллисекундах. Помогает отслеживать качество работы AI-сервисов с точки зрения времени ответа и выявлять деградацию до того, как она станет заметна пользователям.

5. Ошибки в трассировках
Источник данных: gen_ai_traces*
Метрика показывает количество ошибок, зафиксированных в трассировках AI-сервисов. Помогает быстро определить, что деградация связана не только с нагрузкой или задержками, но и с ошибками выполнения операций.

6. Доступность сервисов
Источник данных: gen_ai_metrics*
Метрика показывает доступность AI-сервисов по метрике up. Позволяет учитывать доступность AI-сервисов в общей модели здоровья и быстро видеть, какой компонент перестал передавать данные.

Применение в эксплуатации
Метрики здоровья позволяют:
- Получать ранние сигналы деградации — рост температуры GPU, утилизации памяти, ошибок или длительности запросов виден до того, как проблема повлияет на пользователей
- Контролировать AI-инфраструктуру в общей модели здоровья — GPU, AI-сервисы и трассировки становятся частью единой ресурсно-сервисной модели
- Настраивать пороги критичности — значения метрик можно адаптировать под особенности конкретного стенда, нагрузки и используемых моделей
- Связывать технические сбои с сервисным влиянием — деградация AI-компонента может учитываться при расчете состояния связанных сервисов
Метрики здоровья устанавливаются утилитой ai_observability_ko_maker.