Wczytywanie pliku CSV do DataFrame
W poprzednim ćwiczeniu poznałeś metodę tworzenia DataFrame z RDD. Zazwyczaj jednak najczęściej stosowanym sposobem tworzenia DataFrame jest wczytywanie danych z pliku CSV. W tym ćwiczeniu utworzysz PySpark DataFrame z pliku people.csv, który jest już dostępny w postaci zmiennej file_path, a następnie potwierdzisz, że utworzony obiekt jest PySpark DataFrame.
Pamiętaj, że w swoim środowisku masz już dostępną sesję SparkSession spark oraz zmienną file_path (ścieżkę do pliku people.csv).
To ćwiczenie jest częścią kursu
Podstawy Big Data z PySpark
Instrukcje do ćwiczenia
- Utwórz DataFrame ze zmiennej
file_path, która wskazuje ścieżkę do plikupeople.csv. - Potwierdź, że wynik jest obiektem PySpark DataFrame.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))