ПочатиПочніть безкоштовно

Оптимізація розміру файлів

Уявімо, що у вас є 2 великі файли даних у кластері з 10 вузлами. Кожен файл містить 10 млн рядків приблизно однакового розміру. Під час роботи з даними відгук прийнятний, але початкове зчитування з файлів займає відчутно багато часу. Зверніть увагу: дані використовуєте тільки ви, і вони змінюються під кожен запуск.

Який із наведених варіантів найкраще покращить продуктивність?

Ця вправа є частиною курсу

Очищення даних у PySpark

Переглянути курс

Практична інтерактивна вправа

Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ

Почати вправу