Оптимізація розміру файлів
Уявімо, що у вас є 2 великі файли даних у кластері з 10 вузлами. Кожен файл містить 10 млн рядків приблизно однакового розміру. Під час роботи з даними відгук прийнятний, але початкове зчитування з файлів займає відчутно багато часу. Зверніть увагу: дані використовуєте тільки ви, і вони змінюються під кожен запуск.
Який із наведених варіантів найкраще покращить продуктивність?
Ця вправа є частиною курсу
Очищення даних у PySpark
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу