HypEx на Spark: как мы масштабировали проведение пилотов

Архитектура и масштабируемость

Распределенные системы
Рефакторинг
Методы и техника разработки ПО
Разработка библиотек, включая open source библиотеки

Программный комитет ещё не принял решения по этому докладу

Целевая аудитория

data-scientist'ы и те, кто разрабатывает для них инструменты

Тезисы

  • HypEx — первый open-source инструмент, объединяющий единый API для проведения широкого спектра пилотов на Pandas и Apache Spark.
  • От монолита к модульной архитектуре. Мультибэкендную архитектуру без изменения пользовательского API.
  • От ноутбука к кластеру без переписывания кода. Один и тот же сценарий анализа теперь можно запускать как на Pandas для локальной разработки, так и на Spark для промышленных объемов данных, сохраняя единый интерфейс.
  • Большие пилоты стали доступны. Расскажем, какие объемы данных удалось обрабатывать после перехода на Spark, как изменились производительность и применимость HypEx, и в каких сценариях распределенный бэкенд становится необходимостью, а не просто оптимизацией.

Возглавляю команду разработки HypEx в Сбере, занимаюсь разработкой продуктов в сфере статистического анализа, и ai-агентаов

Data Scientist в Сбере. Занимается дизайном и анализом продуктовых экспериментов, причинно-следственным анализом и оценкой ML-решений по историческим данным. Развивает open-source инструменты HypEx и OffPolicyLab, исследует применение LLM и мультиагентных систем для генерации и проверки продуктовых гипотез.

Видео

Другие доклады секции

Архитектура и масштабируемость