Încărcarea datelor despre zboruri
În acest exercițiu vei încărca date despre zboruri dintr-un fișier CSV. Pentru ca exercițiul să ruleze rapid, setul de date a fost redus la 50 000 de înregistrări. Poți obține un set de date mai mare, în același format, aici.
Note despre formatul CSV:
- câmpurile sunt separate printr-o virgulă (acesta este separatorul implicit) și
- datele lipsă sunt marcate prin șirul 'NA'.
Dicționar de date:
mon— luna (număr întreg între 1 și 12)dom— ziua din lună (număr întreg între 1 și 31)dow— ziua din săptămână (număr întreg; 1 = luni și 7 = duminică)carrier— compania aeriană (cod IATA)flight— numărul zboruluiorg— aeroportul de plecare (cod IATA)mile— distanța (mile)depart— ora de plecare (oră zecimală)duration— durata estimată (minute)delay— întârzierea (minute)
pyspark a fost deja importat, iar sesiunea a fost inițializată.
Notă: Datele au fost reduse semnificativ prin eșantionare.
Acest exercițiu face parte din cursul
Machine Learning cu PySpark
Instrucțiuni pentru exercițiu
- Citește datele dintr-un fișier CSV numit
flights.csv. Atribuie automat tipuri de date coloanelor și gestionează valorile lipsă. - Câte înregistrări conțin datele?
- Aruncă o privire asupra primelor cinci înregistrări.
- Ce tipuri de date au fost atribuite coloanelor? Par corecte?
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Read data from CSV file
flights = spark.____.____(____,
sep=____,
header=____,
inferSchema=____,
nullValue=____)
# Get number of records
print("The data contain %d records." % flights.____())
# View the first five records
flights.____(5)
# Check column data types
print(flights.____)