Перейти к основному содержимому
Версия: Последняя

Система мониторинга в IQChannels

Новая система мониторинга в IQChannels представляет собой централизованную платформу для наблюдаемости за состоянием всех ключевых компонентов платформы: сервисов, баз данных, очередей, бизнес-метрик и инфраструктуры. Она внедрена для обеспечения высокой прозрачности, своевременного выявления проблем и эффективной диагностики инцидентов.

Назначение

Система мониторинга решает следующие задачи:

  • Раннее обнаружение проблем: позволяет выявлять сбои и деградации до того, как они повлияют на пользователей.
  • Контроль за SLA: отслеживает ключевые показатели стабильности и производительности.
  • Ускоренная диагностика: дает возможность быстро локализовать и устранить причины инцидентов.
  • Прозрачность: обеспечивает доступ к информации о работе системы для всех заинтересованных сторон.
  • Поддержка масштабирования: предоставляет данные, необходимые для анализа производительности и роста нагрузки.

Архитектура и технологии

Система построена на следующих инструментах:

  • Prometheus: система сбора метрик по pull-модели. Подключается ко всем нодам или инстансам приложения, экспортирующим метрики в формате Prometheus.
  • Grafana: визуализатор метрик. Используется для построения дашбордов, отображающих состояние сервисов и бизнес-показателей.
  • Поддержка ELK-подобных стеков (Elasticsearch, Logstash, Kibana): централизованная система логирования. Служит для сбора, хранения и анализа логов всех компонентов.
  • Sugared zap: унифицированная библиотека логирования, генерирующая структурированные JSON-логи с ключевыми полями.

Возможности

Технические метрики

  • Количество запросов, время ответа, процент ошибок API;
  • Нагрузка на базы данных, сложные запросы, «висячие» транзакции;
  • Состояние очередей, cron-задач, goroutines;
  • Потребление CPU и памяти.

Бизнес-метрики

  • Количество тикетов в очереди и без исполнителя;
  • Необработанные сообщения, неподтвержденные вложения;
  • Производительность обработки тикетов по проектам.

Дашборды

  • Стандартизированные панели по категориям: API, БД, очереди, сообщения;
  • Готовые решения по мониторингу SLA и инцидентов;
  • Возможность кастомизации и расширения панелей под конкретные команды или проекты.

Централизованное логирование

  • Полнотекстовый поиск по логам всех компонентов;
  • Графики частоты событий и аномалий.

Преимущества

  • Единый стек наблюдаемости: покрывает метрики, логи и визуализацию;
  • Масштабируемость: пригодна как для отдельных инсталляций, так и для кластерного режима;
  • Гибкость: позволяет создавать новые дашборды для различных сервисов и метрик.

Подробнее о метриках: Метрики iQChannels