शुरू करेंमुफ़्त में शुरू करें

RDD से DataFrame

RDDs की तरह, DataFrames भी Spark में immutable और distributed data structures होते हैं. हालाँकि RDDs Spark की एक मौलिक data structure हैं, लेकिन DataFrames के साथ डेटा पर काम करना RDDs की तुलना में आसान होता है. इसलिए, RDD को DataFrame में बदलना समझना ज़रूरी है.

इस अभ्यास में, आप पहले से दिए गए sample_list से एक RDD बनाएँगे. यह RDD tuples की एक सूची रखता है: ('Mona',20), ('Jennifer',34),('John',20), ('Jim',26) जहाँ हर tuple में व्यक्ति का नाम और उनकी आयु है. इसके बाद, आप RDD और schema (जो 'Name' और 'Age' की सूची है) का उपयोग करके एक DataFrame बनाएँगे और अंत में यह जाँचेंगे कि आउटपुट PySpark DataFrame है.

ध्यान रखें, आपके workspace में पहले से SparkContext sc और SparkSession spark उपलब्ध हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sample_list से एक RDD बनाएँ.
  • ऊपर बने RDD और schema का उपयोग करके एक PySpark DataFrame बनाएँ.
  • आउटपुट को PySpark DataFrame के रूप में कन्फर्म करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create an RDD from the list
rdd = sc.____(sample_list)

# Create a PySpark DataFrame
names_df = spark.createDataFrame(____, ____=['Name', 'Age'])

# Check the type of names_df
print("The type of names_df is", ____(names_df))
कोड संपादित करें और चलाएँ