Cacha en DataFrame
Du har fått i uppgift att utföra flera analysoperationer på en DataFrame. Du har lärt dig att cachning kan förbättra prestandan när man återanvänder DataFrames och vill nu implementera det.
Du kommer att arbeta med ett nytt dataset som innehåller information om flygavgångar. Det kan finnas duplicerad data som behöver rensas bort.
DataFrame:n departures_df är definierad, men inga åtgärder har utförts än.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Cacha de unika raderna i DataFrame:n
departures_df. - Kör en räkningsfråga på
departures_dfoch notera hur lång tid operationen tar. - Räkna raderna igen och notera tidsskillnaden för en cachad DataFrame.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
start_time = time.time()
# Add caching to the unique rows in departures_df
departures_df = departures_df.____.____
# Count the unique rows in departures_df, noting how long the operation takes
print("Counting %d rows took %f seconds" % (departures_df.____, time.time() - start_time))
# Count the rows again, noting the variance in time of a cached DataFrame
start_time = time.time()
print("Counting %d rows again took %f seconds" % (____, time.time() - start_time))