Zacznij terazZacznij za darmo

Wczytywanie pliku CSV do DataFrame

W poprzednim ćwiczeniu poznałeś metodę tworzenia DataFrame z RDD. Zazwyczaj jednak najczęściej stosowanym sposobem tworzenia DataFrame jest wczytywanie danych z pliku CSV. W tym ćwiczeniu utworzysz PySpark DataFrame z pliku people.csv, który jest już dostępny w postaci zmiennej file_path, a następnie potwierdzisz, że utworzony obiekt jest PySpark DataFrame.

Pamiętaj, że w swoim środowisku masz już dostępną sesję SparkSession spark oraz zmienną file_path (ścieżkę do pliku people.csv).

To ćwiczenie jest częścią kursu

Podstawy Big Data z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz DataFrame ze zmiennej file_path, która wskazuje ścieżkę do pliku people.csv.
  • Potwierdź, że wynik jest obiektem PySpark DataFrame.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)

# Check the type of people_df
print("The type of people_df is", ____(people_df))
Edytuj i uruchom kod