Zacznij terazZacznij za darmo

Konwersja Spark DataFrame do pandas

Załóżmy, że wykonałeś(-aś) zapytanie na ogromnym zbiorze danych i zagregowałeś(-aś) wyniki do bardziej przystępnej postaci.

Czasem wygodnie jest następnie pracować z taką tabelą lokalnie – na przykład za pomocą biblioteki pandas. Spark DataFrame umożliwia to w prosty sposób dzięki metodzie .toPandas(). Wywołanie tej metody na Spark DataFrame zwraca odpowiadający mu pandas DataFrame. To wszystko!

W tym ćwiczeniu zapytanie zlicza liczbę lotów do każdego lotniska z SEA i PDX.

Pamiętaj, że w twoim środowisku pracy jest już dostępna SparkSession o nazwie spark!

To ćwiczenie jest częścią kursu

Podstawy PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Uruchom zapytanie za pomocą metody .sql(). Zapisz wynik w zmiennej flight_counts.
  • Użyj metody .toPandas() na flight_counts, aby utworzyć pandas DataFrame o nazwie pd_counts.
  • Wyświetl w konsoli metodę .head() na obiekcie pd_counts.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"

# Run the query
flight_counts = ____

# Convert the results to a pandas DataFrame
pd_counts = ____

# Print the head of pd_counts
print(____)
Edytuj i uruchom kod