Система мониторинга в IQChannels
Новая система мониторинга в IQChannels представляет собой централизованную платформу для наблюдаемости за состоянием всех ключевых компонентов платформы: сервисов, баз данных, очередей, бизнес-метрик и инфраструктуры. Она внедрена для обеспечения высокой прозрачности, своевременного выявления проблем и эффективной диагностики инцидентов.
Назначение
Система мониторинга решает следующие задачи:
- Раннее обнаружение проблем: позволяет выявлять сбои и деградации до того, как они повлияют на пользователей.
- Контроль за SLA: отслеживает ключевые показатели стабильности и производительности.
- Ускоренная диагностика: дает возможность быстро локализовать и устранить причины инцидентов.
- Прозрачность: обеспечивает доступ к информации о работе системы для всех заинтересованных сторон.
- Поддержка масштабирования: предоставляет данные, необходимые для анализа производительности и роста нагрузки.
Архитектура и технологии
Система построена на следующих инструментах:
- Prometheus: система сбора метрик по pull-модели. Подключается ко всем нодам или инстансам приложения, экспортирующим метрики в формате Prometheus.
- Grafana: визуализатор метрик. Используется для построения дашбордов, отображающих состояние сервисов и бизнес-показателей.
- Поддержка ELK-подобных стеков (Elasticsearch, Logstash, Kibana): централизованная система логирования. Служит для сбора, хранения и анализа логов всех компонентов.
- Sugared zap: унифицированная библиотека логирования, генерирующая структурированные JSON-логи с ключевыми полями.
Возможности
Технические метрики
- Количество запросов, время ответа, процент ошибок API;
- Нагрузка на базы данных, сложные запросы, «висячие» транзакции;
- Состояние очередей, cron-задач, goroutines;
- Потребление CPU и памяти.
Бизнес-метрики
- Количество тикетов в очереди и без исполнителя;
- Необработанные сообщения, неподтвержденные вложения;
- Производительность обработки тикетов по проектам.
Дашборды
- Стандартизированные панели по категориям: API, БД, очереди, сообщения;
- Готовые решения по мониторингу SLA и инцидентов;
- Возможность кастомизации и расширения панелей под конкретные команды или проекты.
Централизованное логирование
- Полнотекстовый поиск по логам всех компонентов;
- Графики частоты событий и аномалий.
Преимущества
- Единый стек наблюдаемости: покрывает метрики, логи и визуализацию;
- Масштабируемость: пригодна как для отдельных инсталляций, так и для кластерного режима;
- Гибкость: позволяет создавать новые дашборды для различных сервисов и метрик.
Подробнее о метриках: Метрики iQChannels