शुरू करेंमुफ़्त में शुरू करें

फाइल में लिखना

वीडियो में आपने देखा कि फाइलों को अक्सर विश्लेषण के लिए उपलब्ध कराने के लिए Redshift जैसे MPP डेटाबेस में लोड किया जाता है.

सामान्य वर्कफ़्लो में डेटा को कॉलमनर डेटा फाइलों में लिखा जाता है. इन फाइलों को फिर किसी स्टोरेज सिस्टम में अपलोड किया जाता है और वहाँ से उन्हें डेटा वेयरहाउस में कॉपी किया जा सकता है. Amazon Redshift के मामले में, उदाहरण के लिए, स्टोरेज सिस्टम S3 होगा.

पहला कदम सही फॉर्मैट में फाइल लिखना है. इस अभ्यास में आप Apache Parquet फाइल फॉर्मैट चुनेंगे.

आपके वर्कस्पेस में film_sdf नाम का एक PySpark DataFrame और film_pdf नाम का एक pandas DataFrame मौजूद है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Introduction to Data Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pandas DataFrame film_pdf को "films_pdf.parquet" नाम की parquet फाइल में लिखें.
  • PySpark DataFrame film_sdf को "films_sdf.parquet" नाम की parquet फाइल में लिखें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Write the pandas DataFrame to parquet
film_pdf.____("____")

# Write the PySpark DataFrame to parquet
film_sdf.____.____("____")
कोड संपादित करें और चलाएँ