Wczytywanie danych spisowych
Zacznijmy od stworzenia pierwszego DataFrame'a w PySparku! Plik adult_reduced.csv zawiera dane dotyczące dorosłych, pogrupowane według różnych kategorii demograficznych. Dane zostały opracowane na podstawie spisu powszechnego USA i obejmują łącznie 32 562 rekordów.
Wczytaj plik CSV i sprawdź wynikowy schemat danych.
Słownik danych:
| Zmienna | Opis |
|---|---|
| age | Wiek osoby |
| education_num | Poziom wykształcenia |
| marital_status | Stan cywilny |
| occupation | Zawód |
| income | Kategoria dochodów |
To ćwiczenie jest częścią kursu
Wprowadzenie do PySpark
Instrukcje do ćwiczenia
- Utwórz DataFrame PySpark z pliku
"adult_reduced.csv", używając metodyspark.read.csv(). - Wyświetl wynikowy DataFrame.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Read in the CSV
census_adult = ____.____.____(____)
# Show the DataFrame
census_adult.____