Оптимизация размера файлов
Представьте, что у вас есть 2 больших файла с данными на кластере из 10 узлов. Каждый файл содержит 10 млн строк примерно одинакового размера. При работе с данными скорость отклика приемлема, однако первоначальное чтение файлов занимает значительное время. Обратите внимание: данные используете только вы, и они обновляются при каждом запуске.
Какой из следующих вариантов наилучшим образом улучшит производительность?
Это упражнение является частью курса
Очистка данных с помощью PySpark
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение