Обработка терабайтов данных и профессиональная эксплуатация Spark в кластерах с YARN
Уровень
для практикующих
На выходе
Проектировать архитектуру вычислений на Spark; Оптимизировать Spark-задания для минимизации shuffle; Настраивать работу Spark в кластерах YARN; Проводить тюнинг Garbage Collection и потребления памяти; Интегрировать Spark с Hive и эффективно использовать SQL API