Läsa in flygdata
I den här övningen ska du läsa in flygdata från en CSV-fil. För att övningen ska köras snabbt har datamängden begränsats till 50 000 poster. En större datamängd i samma format finns tillgänglig här.
Om CSV-formatet:
- fält avgränsas med kommatecken (detta är standardavgränsaren), och
- saknade värden anges med strängen 'NA'.
Dataordlista:
mon— månad (heltal mellan 1 och 12)dom— dag i månaden (heltal mellan 1 och 31)dow— veckodag (heltal; 1 = måndag och 7 = söndag)carrier— flygbolag (IATA-kod)flight— flygnummerorg— avreseflygplats (IATA-kod)mile— sträcka (miles)depart— avgångstid (decimaltimme)duration— beräknad flygtid (minuter)delay— försening (minuter)
pyspark har redan importerats och sessionen är initialiserad.
Obs: Datamängden har reducerats kraftigt.
Den här övningen är en del av kursen
Maskininlärning med PySpark
Övningsinstruktioner
- Läs in data från en CSV-fil med namnet
flights.csv. Tilldela kolumnerna datatyper automatiskt och hantera saknade värden. - Hur många poster finns i datamängden?
- Titta på de fem första posterna.
- Vilka datatyper har tilldelats kolumnerna? Verkar de stämma?
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Read data from CSV file
flights = spark.____.____(____,
sep=____,
header=____,
inferSchema=____,
nullValue=____)
# Get number of records
print("The data contain %d records." % flights.____())
# View the first five records
flights.____(5)
# Check column data types
print(flights.____)