ÎncepețiÎncepe gratuit

Scrierea într-un fișier

În videoclip, ai văzut că fișierele sunt adesea încărcate într-o bază de date MPP, cum ar fi Redshift, pentru a le face disponibile în vederea analizei.

Fluxul de lucru tipic presupune scrierea datelor în fișiere de date de tip columnar. Aceste fișiere sunt apoi încărcate într-un sistem de stocare și de acolo pot fi copiate în depozitul de date. În cazul Amazon Redshift, sistemul de stocare ar fi, de exemplu, S3.

Primul pas este să scrii fișierul în formatul potrivit. Pentru acest exercițiu, vei alege formatul de fișier Apache Parquet.

În spațiul tău de lucru există un DataFrame PySpark numit film_sdf și un DataFrame pandas numit film_pdf.

Acest exercițiu face parte din cursul

Introducere în Data Engineering

Vezi cursul

Instrucțiuni pentru exercițiu

  • Scrie DataFrame-ul pandas film_pdf într-un fișier parquet numit "films_pdf.parquet".
  • Scrie DataFrame-ul PySpark film_sdf într-un fișier parquet numit "films_sdf.parquet".

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
Editează și rulează codul