Використання ледачої обробки
Операції з ледачою обробкою зазвичай виконуються приблизно за той самий час незалежно від фактичного обсягу даних. Пам'ятайте, що це тому, що Spark не виконує жодних перетворень, доки не буде викликано дію.
У цій вправі ми визначимо датафрейм (aa_dfw_df) і додамо кілька перетворень. Зверніть увагу на час, потрібний для завершення перетворень під час їх визначення порівняно з тим, коли дані фактично запитуються. Різниця може бути невеликою, але помітною. Під час роботи з повноцінним кластером Spark і більшими обсягами даних ця різниця буде ще відчутнішою.
Ця вправа є частиною курсу
Очищення даних у PySpark
Інструкції до вправи
- Завантажте датафрейм.
- Додайте перетворення
F.lower()до стовпцяDestination Airport. - Відобразіть датафрейм за допомогою
.show(), звернувши увагу на різницю в часі, потрібному для завершення цієї дії.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____