-
Сопровождать и развивать систему мониторинга на базе Zabbix, Prometheus и Grafana.
-
Настраивать и поддерживать дашборды, метрики, триггеры и алерты.
-
Контролировать доступность, производительность и стабильность информационных систем.
-
Осуществлять первичный анализ инцидентов, выявлять причины возникновения проблем и передавать их профильным командам.
-
Взаимодействовать с командами DevOps, разработки и технической поддержки по вопросам мониторинга и логирования.
-
Формировать требования к метрикам и логированию новых сервисов.
-
Оптимизировать систему алертинга, снижать количество ложных срабатываний и повысить качество мониторинга.
-
Контролировать актуальность документации, базы знаний и инструкций по мониторингу.
-
Участвовать в развитии процессов наблюдаемости (Observability) и повышении надежности сервисов.
-
Администрирование систем
-
Уверенные знания Linux на уровне администратора.
-
Понимание принципов работы файловых систем, процессов и сетевого взаимодействия.
-
Навыки анализа системных логов (journalctl, syslog, logrotate).
-
Опыт диагностики производительности серверов (CPU, RAM, Disk IO, Network).
-
Мониторинг и Observability
-
Практический опыт работы с Grafana, Zabbix и Prometheus.
-
Навыки построения дашбордов и настройки алертинга.
-
Опыт настройки метрик, триггеров и правил оповещения.
-
Понимание принципов Observability (Metrics, Logs, Traces).
-
Будет преимуществом опыт работы с системами централизованного логирования (ELK/OpenSearch, Loki, Graylog).
-
Будет плюсом
-
Опыт работы с Docker и Kubernetes.
-
Базовые знания CI/CD.
-
Навыки автоматизации с использованием Bash или Python.
-
Понимание принципов работы современных распределенных ИТ-систем.
Ключевые навыки
- Работа с большим объемом информации
- Умение работать в коллективе
- Поиск информации в интернет
- Работа с базами данных