Единая точка сбора метрик: как мы сделали быстрый, расширяемый и интегрируемый подход к мониторингу виртуализации

SRE и эксплуатация систем

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

Backend-разработчики

Тезисы

В крупных инсталляциях на базе oVirt получение метрик через стандартные механизмы может занимать десятки минут и создавать значительную нагрузку на систему управления. Использование REST API для извлечения метрик в таких сценариях плохо масштабируется, а хранение метрик в реляционной базе данных усложняет работу с ними.

У себя мы переработали этот слой: реализовали единый REST API для метрик, перевели хранение текущих значений в in-memory и встроились в существующий процесс сбора данных, перехватывая поток метрик. Все данные объединены в одном endpoint в формате Prometheus, включая метрики с хостов через Node Exporter, который теперь устанавливается и настраивается «из коробки».

В результате мы сократили время получения состояния инфраструктуры до секунд (менее 10 секунд на сотнях хостов) и получили расширяемую систему сбора метрик с возможностью добавления новых источников и простой интеграцией с внешними системами мониторинга.

Обсудим ограничения подхода (отсутствие хранения истории, рост объема метрик и single point of failure), сложности, вставшие на пути, и способы их решения.

Работаю инженер-разработчиком с 2003 года. Сейчас занимаюсь разработкой системы виртуализации zVirt. Мне интересна разработка на Java, и, в частности, то, чем я сейчас занимаюсь - все что связано с виртуализацией

Видео

Другие доклады секции

SRE и эксплуатация систем