Перейти к основному содержимому
Версия: 6.1

AI Observability: Метрики здоровья

Модуль AI Observability поставляет готовые глобальные метрики для модуля МАЯК.
Они рассчитываются на данных из индексов gen_ai_* и позволяют включить AI-инфраструктуру в общую модель здоровья организации. Метрики используются как индикаторы состояния AI-контура в ресурсно-сервисной модели. С их помощью можно отслеживать деградацию AI-компонентов, настраивать пороги критичности и связывать техническое состояние AI-инфраструктуры с влиянием на сервисы.


Назначение

Метрики здоровья позволяют:

  • отображать состояние AI-компонентов наравне с инфраструктурными и прикладными сервисами
  • учитывать GPU, AI-сервисы, трассировки и запросы в единой модели здоровья
  • настраивать пороги деградации для ключевых показателей AI-инфраструктуры
  • использовать AI-инфраструктуру как отдельный слой в сквозных сервисных моделях

Описание метрик

1. Температура GPU, °C

Источник данных: gen_ai_gpu_metrics*

Метрика показывает температуру ядра GPU в градусах Цельсия. Полезна для раннего обнаружения аппаратной деградации: критичный нагрев GPU может повлиять на производительность AI-сервисов и стабильность обработки запросов.

Температура GPU,°C

2. Загрузка GPU, %

Источник данных: gen_ai_gpu_metrics*

Метрика показывает текущую утилизацию GPU в процентах. Помогает определить, достаточно ли текущих GPU-ресурсов для обработки AI-запросов и требуется ли масштабирование инфраструктуры.

Загрузка GPU, %

3. Утилизация памяти GPU, %

Источник данных: gen_ai_gpu_metrics*

Метрика показывает процент занятой видеопамяти GPU. Особенно важна для inference-сценариев с крупными LLM-моделями, где запас видеопамяти напрямую влияет на стабильность сервиса.

Утилизация памяти GPU, %

4. Длительность запросов, мс

Источник данных: gen_ai_traces*

Метрика показывает среднюю длительность AI-запросов и операций в миллисекундах. Помогает отслеживать качество работы AI-сервисов с точки зрения времени ответа и выявлять деградацию до того, как она станет заметна пользователям.

Длительность запросов, мс

5. Ошибки в трассировках

Источник данных: gen_ai_traces*

Метрика показывает количество ошибок, зафиксированных в трассировках AI-сервисов. Помогает быстро определить, что деградация связана не только с нагрузкой или задержками, но и с ошибками выполнения операций.

Ошибки в трассировках

6. Доступность сервисов

Источник данных: gen_ai_metrics*

Метрика показывает доступность AI-сервисов по метрике up. Позволяет учитывать доступность AI-сервисов в общей модели здоровья и быстро видеть, какой компонент перестал передавать данные.

Доступность сервисов


Применение в эксплуатации

Метрики здоровья позволяют:

  • Получать ранние сигналы деградации — рост температуры GPU, утилизации памяти, ошибок или длительности запросов виден до того, как проблема повлияет на пользователей
  • Контролировать AI-инфраструктуру в общей модели здоровья — GPU, AI-сервисы и трассировки становятся частью единой ресурсно-сервисной модели
  • Настраивать пороги критичности — значения метрик можно адаптировать под особенности конкретного стенда, нагрузки и используемых моделей
  • Связывать технические сбои с сервисным влиянием — деградация AI-компонента может учитываться при расчете состояния связанных сервисов

Метрики здоровья устанавливаются утилитой ai_observability_ko_maker.