बीच का रास्ता छोड़ें
अब आप pandas के ज़रिए डेटा को Spark में डालना जानते हैं, लेकिन शायद आप सोच रहे होंगे कि pandas से झंझट क्यों करें? क्या कोई टेक्स्ट फ़ाइल सीधे Spark में पढ़ना आसान नहीं होगा? बिलकुल होगा!
अच्छी बात यह है कि आपकी SparkSession में .read एट्रिब्यूट होता है, जिसमें अलग-अलग डेटा सोर्स से Spark DataFrames बनाने के कई मेथड होते हैं. इन्हें इस्तेमाल करके आप .csv फ़ाइल से भी बिलकुल वैसा ही DataFrame बना सकते हैं जैसा आप सामान्य pandas DataFrames के साथ करते हैं!
वैरिएबल file_path में फ़ाइल airports.csv का पथ एक string के रूप में दिया गया है. इस फ़ाइल में दुनिया भर के विभिन्न हवाई अड्डों की जानकारी है.
spark नाम की एक SparkSession आपके वर्कस्पेस में उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark की नींव
अभ्यास निर्देश
.read.csv()मेथड का उपयोग करकेairportsनाम का एक Spark DataFrame बनाएँ- पहला आर्ग्युमेंट
file_pathहै - आर्ग्युमेंट
header=Trueपास करें ताकि Spark फ़ाइल की पहली पंक्ति से कॉलम नाम ले सके.
- पहला आर्ग्युमेंट
- इस DataFrame को
.show()कॉल करके प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Don't change this file path
file_path = "/usr/local/share/datasets/airports.csv"
# Read in the airports data
airports = ____.____.____(____, ____=____)
# Show the data
____.____()