Prestanda vid filimport
Du har fått en stor datamängd att importera till en Spark DataFrame och vill testa skillnaden i importhastighet genom att dela upp filen.
Du har två typer av filer tillgängliga: departures_full.txt.gz och departures_xxx.txt.gz, där xxx är 000 – 013. Samma antal rader är fördelat mellan filerna.
Den här övningen är en del av kursen
Datarensning med PySpark
Övningsinstruktioner
- Importera filen
departures_full.txt.gzoch filernadepartures_xxx.txt.gztill separata DataFrames. - Kör en räkning på varje DataFrame och jämför körtiderna.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)
# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))
start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))