Scrierea într-un fișier
În videoclip, ai văzut că fișierele sunt adesea încărcate într-o bază de date MPP, cum ar fi Redshift, pentru a le face disponibile în vederea analizei.
Fluxul de lucru tipic presupune scrierea datelor în fișiere de date de tip columnar. Aceste fișiere sunt apoi încărcate într-un sistem de stocare și de acolo pot fi copiate în depozitul de date. În cazul Amazon Redshift, sistemul de stocare ar fi, de exemplu, S3.
Primul pas este să scrii fișierul în formatul potrivit. Pentru acest exercițiu, vei alege formatul de fișier Apache Parquet.
În spațiul tău de lucru există un DataFrame PySpark numit film_sdf și un DataFrame pandas numit film_pdf.
Acest exercițiu face parte din cursul
Introducere în Data Engineering
Instrucțiuni pentru exercițiu
- Scrie DataFrame-ul
pandasfilm_pdfîntr-un fișier parquet numit"films_pdf.parquet". - Scrie DataFrame-ul PySpark
film_sdfîntr-un fișier parquet numit"films_sdf.parquet".
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")