ÎncepețiÎncepe gratuit

Încărcarea datelor despre zboruri

În acest exercițiu vei încărca date despre zboruri dintr-un fișier CSV. Pentru ca exercițiul să ruleze rapid, setul de date a fost redus la 50 000 de înregistrări. Poți obține un set de date mai mare, în același format, aici.

Note despre formatul CSV:

  • câmpurile sunt separate printr-o virgulă (acesta este separatorul implicit) și
  • datele lipsă sunt marcate prin șirul 'NA'.

Dicționar de date:

  • mon — luna (număr întreg între 1 și 12)
  • dom — ziua din lună (număr întreg între 1 și 31)
  • dow — ziua din săptămână (număr întreg; 1 = luni și 7 = duminică)
  • carrier — compania aeriană (cod IATA)
  • flight — numărul zborului
  • org — aeroportul de plecare (cod IATA)
  • mile — distanța (mile)
  • depart — ora de plecare (oră zecimală)
  • duration — durata estimată (minute)
  • delay — întârzierea (minute)

pyspark a fost deja importat, iar sesiunea a fost inițializată.

Notă: Datele au fost reduse semnificativ prin eșantionare.

Acest exercițiu face parte din cursul

Machine Learning cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Citește datele dintr-un fișier CSV numit flights.csv. Atribuie automat tipuri de date coloanelor și gestionează valorile lipsă.
  • Câte înregistrări conțin datele?
  • Aruncă o privire asupra primelor cinci înregistrări.
  • Ce tipuri de date au fost atribuite coloanelor? Par corecte?

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
Editează și rulează codul