Začněte nyníZačněte zdarma

Načítání dat o letech

V tomto cvičení načteš data o leteckých letech ze souboru CSV. Aby cvičení proběhlo rychle, jsou data ořezána na pouhých 50 000 záznamů. Větší datovou sadu ve stejném formátu najdeš zde.

Poznámky k formátu CSV:

  • pole jsou oddělena čárkou (výchozí oddělovač) a
  • chybějící data jsou označena řetězcem 'NA'.

Slovník dat:

  • mon — měsíc (celé číslo od 1 do 12)
  • dom — den v měsíci (celé číslo od 1 do 31)
  • dow — den v týdnu (celé číslo; 1 = pondělí, 7 = neděle)
  • carrier — dopravce (kód IATA)
  • flight — číslo letu
  • org — letiště odletu (kód IATA)
  • mile — vzdálenost (míle)
  • depart — čas odletu (desetinná hodina)
  • duration — předpokládaná délka letu (minuty)
  • delay — zpoždění (minuty)

pyspark je již naimportován a relace byla inicializována.

Poznámka: Data byla výrazně podvzorkována.

Toto cvičení je součástí kurzu

Machine Learning with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Načti data ze souboru CSV s názvem flights.csv. Datové typy sloupců přiřaď automaticky. Ošetři chybějící hodnoty.
  • Kolik záznamů data obsahují?
  • Prohlédni si prvních pět záznamů.
  • Jaké datové typy byly sloupcům přiřazeny? Vypadají správně?

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
Upravit a spustit kód