НачатьНачать бесплатно

Оптимизация размера файлов

Представьте, что у вас есть 2 больших файла с данными на кластере из 10 узлов. Каждый файл содержит 10 млн строк примерно одинакового размера. При работе с данными скорость отклика приемлема, однако первоначальное чтение файлов занимает значительное время. Обратите внимание: данные используете только вы, и они обновляются при каждом запуске.

Какой из следующих вариантов наилучшим образом улучшит производительность?

Это упражнение является частью курса

Очистка данных с помощью PySpark

Посмотреть курс

Практическое интерактивное упражнение

Превратите теорию в практику с помощью одного из наших интерактивных упражнений

Начать упражнение