Единая точка сбора метрик: как мы сделали быстрый, расширяемый и интегрируемый подход к мониторингу виртуализации
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
В крупных инсталляциях на базе oVirt получение метрик через стандартные механизмы может занимать десятки минут и создавать значительную нагрузку на систему управления. Использование REST API для извлечения метрик в таких сценариях плохо масштабируется, а хранение метрик в реляционной базе данных усложняет работу с ними.
У себя мы переработали этот слой: реализовали единый REST API для метрик, перевели хранение текущих значений в in-memory и встроились в существующий процесс сбора данных, перехватывая поток метрик. Все данные объединены в одном endpoint в формате Prometheus, включая метрики с хостов через Node Exporter, который теперь устанавливается и настраивается «из коробки».
В результате мы сократили время получения состояния инфраструктуры до секунд (менее 10 секунд на сотнях хостов) и получили расширяемую систему сбора метрик с возможностью добавления новых источников и простой интеграцией с внешними системами мониторинга.
Обсудим ограничения подхода (отсутствие хранения истории, рост объема метрик и single point of failure), сложности, вставшие на пути, и способы их решения.
Работаю инженер-разработчиком с 2003 года. Сейчас занимаюсь разработкой системы виртуализации zVirt. Мне интересна разработка на Java, и, в частности, то, чем я сейчас занимаюсь - все что связано с виртуализацией
Видео
Другие доклады секции
SRE и эксплуатация систем