Konwersja Spark DataFrame do pandas
Załóżmy, że wykonałeś(-aś) zapytanie na ogromnym zbiorze danych i zagregowałeś(-aś) wyniki do bardziej przystępnej postaci.
Czasem wygodnie jest następnie pracować z taką tabelą lokalnie – na przykład za pomocą biblioteki pandas. Spark DataFrame umożliwia to w prosty sposób dzięki metodzie .toPandas(). Wywołanie tej metody na Spark DataFrame zwraca odpowiadający mu pandas DataFrame. To wszystko!
W tym ćwiczeniu zapytanie zlicza liczbę lotów do każdego lotniska z SEA i PDX.
Pamiętaj, że w twoim środowisku pracy jest już dostępna SparkSession o nazwie spark!
To ćwiczenie jest częścią kursu
Podstawy PySpark
Instrukcje do ćwiczenia
- Uruchom zapytanie za pomocą metody
.sql(). Zapisz wynik w zmiennejflight_counts. - Użyj metody
.toPandas()naflight_counts, aby utworzyćpandasDataFrame o nazwiepd_counts. - Wyświetl w konsoli metodę
.head()na obiekciepd_counts.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Don't change this query
query = "SELECT origin, dest, COUNT(*) as N FROM flights GROUP BY origin, dest"
# Run the query
flight_counts = ____
# Convert the results to a pandas DataFrame
pd_counts = ____
# Print the head of pd_counts
print(____)