Zapisywanie do pliku
W filmie zobaczyłeś, że dane są często ładowane do bazy MPP, takiej jak Redshift, aby umożliwić ich analizę.
Typowy przepływ pracy polega na zapisaniu danych w kolumnowych plikach danych. Pliki te są następnie przesyłane do systemu przechowywania, skąd można je skopiować do hurtowni danych. W przypadku Amazon Redshift systemem przechowywania jest na przykład S3.
Pierwszym krokiem jest zapisanie pliku w odpowiednim formacie. W tym ćwiczeniu skorzystasz z formatu Apache Parquet.
W twoim obszarze roboczym dostępny jest DataFrame PySpark o nazwie film_sdf oraz DataFrame biblioteki pandas o nazwie film_pdf.
To ćwiczenie jest częścią kursu
Wprowadzenie do inżynierii danych
Instrukcje do ćwiczenia
- Zapisz DataFrame biblioteki
pandaso nazwiefilm_pdfdo pliku parquet o nazwie"films_pdf.parquet". - Zapisz DataFrame biblioteki PySpark o nazwie
film_sdfdo pliku parquet o nazwie"films_sdf.parquet".
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")