Kom igångKom igång gratis

Prestanda vid filimport

Du har fått en stor datamängd att importera till en Spark DataFrame och vill testa skillnaden i importhastighet genom att dela upp filen.

Du har två typer av filer tillgängliga: departures_full.txt.gz och departures_xxx.txt.gz, där xxx är 000013. Samma antal rader är fördelat mellan filerna.

Den här övningen är en del av kursen

Datarensning med PySpark

Visa kurs

Övningsinstruktioner

  • Importera filen departures_full.txt.gz och filerna departures_xxx.txt.gz till separata DataFrames.
  • Kör en räkning på varje DataFrame och jämför körtiderna.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Redigera och kör kod