Načítání dat o letech
V tomto cvičení načteš data o leteckých letech ze souboru CSV. Aby cvičení proběhlo rychle, jsou data ořezána na pouhých 50 000 záznamů. Větší datovou sadu ve stejném formátu najdeš zde.
Poznámky k formátu CSV:
- pole jsou oddělena čárkou (výchozí oddělovač) a
- chybějící data jsou označena řetězcem 'NA'.
Slovník dat:
mon— měsíc (celé číslo od 1 do 12)dom— den v měsíci (celé číslo od 1 do 31)dow— den v týdnu (celé číslo; 1 = pondělí, 7 = neděle)carrier— dopravce (kód IATA)flight— číslo letuorg— letiště odletu (kód IATA)mile— vzdálenost (míle)depart— čas odletu (desetinná hodina)duration— předpokládaná délka letu (minuty)delay— zpoždění (minuty)
pyspark je již naimportován a relace byla inicializována.
Poznámka: Data byla výrazně podvzorkována.
Toto cvičení je součástí kurzu
Machine Learning with PySpark
Pokyny k cvičení
- Načti data ze souboru CSV s názvem
flights.csv. Datové typy sloupců přiřaď automaticky. Ošetři chybějící hodnoty. - Kolik záznamů data obsahují?
- Prohlédni si prvních pět záznamů.
- Jaké datové typy byly sloupcům přiřazeny? Vypadají správně?
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Read data from CSV file
flights = spark.____.____(____,
sep=____,
header=____,
inferSchema=____,
nullValue=____)
# Get number of records
print("The data contain %d records." % flights.____())
# View the first five records
flights.____(5)
# Check column data types
print(flights.____)