CSV को DataFrame में लोड करना
पिछले अभ्यास में, आपने RDD से DataFrame बनाने का एक तरीका देखा था। आम तौर पर, CSV फाइल से डेटा लोड करना DataFrames बनाने की सबसे प्रचलित विधि है। इस अभ्यास में, आप people.csv फाइल से एक PySpark DataFrame बनाएँगे, जो आपको पहले से file_path के रूप में दिया गया है, और यह भी पुष्टि करें कि बना हुआ ऑब्जेक्ट PySpark DataFrame है।
ध्यान रखें, आपके वर्कस्पेस में पहले से SparkSession spark और वैरिएबल file_path (यानी people.csv फाइल का पथ) उपलब्ध हैं।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
file_pathवैरिएबल (जोpeople.csvफाइल का पथ है) से एक DataFrame बनाएँ।- आउटपुट के PySpark DataFrame होने की पुष्टि करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create an DataFrame from file_path
people_df = spark.____(file_path, header=True, inferSchema=True)
# Check the type of people_df
print("The type of people_df is", ____(people_df))