शुरू करेंमुफ़्त में शुरू करें

सब कुछ एक साथ लाना I

आपने PySpark में एक मजबूत आधार बनाया है, इसके मुख्य कॉम्पोनेन्ट्स को एक्सप्लोर किया है, और Spark SQL, DataFrames, तथा एडवांस्ड ऑपरेशंस से जुड़े प्रैक्टिकल सिनेरियो पर काम किया है. अब समय है कि सब कुछ एक साथ जोड़ें. अगले दो अभ्यासों में, आप एक SparkSession बनाएँगे, एक DataFrame बनाएँगे, उस DataFrame को cache करेंगे, एनालिटिक्स चलाएँगे और परिणाम की व्याख्या करेंगे!

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pyspark.sql से SparkSession इम्पोर्ट करें.
  • SparkSession.builder.getOrCreate() का उपयोग करके final_spark नाम का नया SparkSession बनाएँ.
  • यह जाँचने के लिए कि my_spark एक SparkSession है, उसे कंसोल पर प्रिंट करें.
  • प्रीलोडेड स्कीमा और कॉलम डेफिनिशन से एक नया DataFrame बनाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import SparkSession from pyspark.sql
from ____ import ____

# Create my_spark
my_spark = SparkSession.builder.appName(____).____

# Print my_spark
____

# Load dataset into a DataFrame
df = ____(data, schema=columns)

df.show()
कोड संपादित करें और चलाएँ