Utiliser le traitement paresseux
Les opérations en traitement paresseux retournent généralement un résultat en à peu près le même temps, peu importe la quantité réelle de données. Rappelez-vous que c'est parce que Spark n'effectue aucune transformation tant qu'une action n'est pas demandée.
Dans cet exercice, vous allez définir un DataFrame (aa_dfw_df) et ajouter quelques transformations. Notez le temps requis pour achever les transformations lorsqu'elles sont définies, comparativement au moment où les données sont réellement interrogées. Les écarts peuvent être courts, mais vous les remarquerez. Avec un véritable grappe Spark et de plus grands volumes de données, la différence sera encore plus évidente.
Cette activité fait partie du cours
Nettoyer des données avec PySpark
Instructions de l’exercice
- Chargez le DataFrame.
- Ajoutez la transformation
F.lower()à la colonneDestination Airport. - Affichez le DataFrame et observez le temps nécessaire pour compléter cette action.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load the CSV file
aa_dfw_df = ____.____.____('csv').options(Header=True).load('AA_DFW_2018.csv.gz')
# Add the airport column using the F.lower() method
aa_dfw_df = aa_dfw_df.withColumn('airport', ____(aa_dfw_df['Destination Airport']))
# Show the DataFrame
____