Začněte nyníZačněte zdarma

Výkon při importu souborů

Máš k dispozici velkou sadu dat, kterou chceš načíst do Spark DataFrame. Chceš otestovat rozdíl v rychlosti importu tak, že soubor rozdělíš na více částí.

Máš dva typy souborů: departures_full.txt.gz a departures_xxx.txt.gz, kde xxx je 000013. Stejný počet řádků je rovnoměrně rozdělen mezi jednotlivé soubory.

Toto cvičení je součástí kurzu

Cleaning Data with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Načti soubor departures_full.txt.gz a soubory departures_xxx.txt.gz do samostatných DataFramů.
  • Spusť počítání řádků na každém DataFrame a porovnej časy zpracování.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the full and split files into DataFrames
full_df = spark.read.csv('____')
split_df = ____(____)

# Print the count and run time for each DataFrame
start_time_a = time.time()
print("Total rows in full DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_a))

start_time_b = time.time()
print("Total rows in split DataFrame:\t%d" % ____)
print("Time to run: %f" % (time.time() - start_time_b))
Upravit a spustit kód