फाइल में लिखना
वीडियो में आपने देखा कि फाइलों को अक्सर विश्लेषण के लिए उपलब्ध कराने के लिए Redshift जैसे MPP डेटाबेस में लोड किया जाता है.
सामान्य वर्कफ़्लो में डेटा को कॉलमनर डेटा फाइलों में लिखा जाता है. इन फाइलों को फिर किसी स्टोरेज सिस्टम में अपलोड किया जाता है और वहाँ से उन्हें डेटा वेयरहाउस में कॉपी किया जा सकता है. Amazon Redshift के मामले में, उदाहरण के लिए, स्टोरेज सिस्टम S3 होगा.
पहला कदम सही फॉर्मैट में फाइल लिखना है. इस अभ्यास में आप Apache Parquet फाइल फॉर्मैट चुनेंगे.
आपके वर्कस्पेस में film_sdf नाम का एक PySpark DataFrame और film_pdf नाम का एक pandas DataFrame मौजूद है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Introduction to Data Engineering
अभ्यास निर्देश
pandasDataFramefilm_pdfको"films_pdf.parquet"नाम की parquet फाइल में लिखें.- PySpark DataFrame
film_sdfको"films_sdf.parquet"नाम की parquet फाइल में लिखें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Write the pandas DataFrame to parquet
film_pdf.____("____")
# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")