Создание пайплайнов данных: сбор, очистка и подготовка данных с использованием Hadoop, Apache Spark и Airflow
На выходе
Разворачивать и настраивать Linux для задач инженерии данных; Проектировать пайплайны обработки данных в реальном времени; Использовать Apache Spark для трансформации больших объемов данных; Автоматизировать потоки данных с помощью Apache Airflow; Работать с облачными хранилищами AWS, Google Cloud и Azure
Навыки
Linux · Hadoop · Apache Spark · Apache Airflow · Google Cloud · Azure · Python