HypEx на Spark: как мы масштабировали проведение пилотов
Программный комитет ещё не принял решения по этому докладу
Целевая аудитория
Тезисы
- HypEx — первый open-source инструмент, объединяющий единый API для проведения широкого спектра пилотов на Pandas и Apache Spark.
- От монолита к модульной архитектуре. Мультибэкендную архитектуру без изменения пользовательского API.
- От ноутбука к кластеру без переписывания кода. Один и тот же сценарий анализа теперь можно запускать как на Pandas для локальной разработки, так и на Spark для промышленных объемов данных, сохраняя единый интерфейс.
- Большие пилоты стали доступны. Расскажем, какие объемы данных удалось обрабатывать после перехода на Spark, как изменились производительность и применимость HypEx, и в каких сценариях распределенный бэкенд становится необходимостью, а не просто оптимизацией.
Возглавляю команду разработки HypEx в Сбере, занимаюсь разработкой продуктов в сфере статистического анализа, и ai-агентаов
Data Scientist в Сбере. Занимается дизайном и анализом продуктовых экспериментов, причинно-следственным анализом и оценкой ML-решений по историческим данным. Развивает open-source инструменты HypEx и OffPolicyLab, исследует применение LLM и мультиагентных систем для генерации и проверки продуктовых гипотез.
Видео
Другие доклады секции
Архитектура и масштабируемость