DataFrames के रूप में फ्लैट फाइल इम्पोर्ट करने के लिए pandas का उपयोग (2)
पिछले अभ्यास में, आपने एक फ्लैट फाइल को pandas DataFrame में इम्पोर्ट किया था. बोनस यह है कि उसी से संबंधित numpy array को .to_numpy() मेथड से सीधे निकाला जा सकता है. अब आप यह MNIST डेटासेट पर आज़माएँगे, जो digits.csv के रूप में उपलब्ध है.
pd.read_csv() कई आर्गुमेंट लेता है जो इस अभ्यास में आपके काम आएँगे:
nrowsआपको यह निर्धारित करने देता है कि फ़ाइल से कितनी पंक्तियाँ पढ़नी हैं. उदाहरण के लिए,nrows=10सिर्फ पहली 10 पंक्तियाँ इम्पोर्ट करेगा.headerउस पंक्ति संख्या को स्वीकार करता है जिसका उपयोग कॉलम लेबल के रूप में किया जाएगा और जहाँ से डेटा शुरू होता है. अगर फ़ाइल में हेडर पंक्ति नहीं है, तो आपheader=Noneसेट कर सकते हैं, औरpandasस्वतः 0 से शुरू होने वाले इन्टीजर कॉलम लेबल असाइन कर देगा (जैसे, 0, 1, 2, …).
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में डेटा आयात का परिचय
अभ्यास निर्देश
- फ़ंक्शन
pd.read_csv()का उपयोग करके फ़ाइल की पहली 5 पंक्तियाँ एक DataFrame में इम्पोर्ट करें और परिणाम कोdataमें असाइन करें. आपकोnrowsऔरheaderआर्गुमेंट का उपयोग करना होगा. ध्यान दें कि इस फ़ाइल में कोई हेडर पंक्ति नहीं है. dataमें बने DataFrame से एकnumpyarray बनाएँ और उसेdata_arrayमें असाइन करें.print(type(data_array))चलाकरdata_arrayके datatype को प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Assign the filename: file
file = 'digits.csv'
# Read the first 5 rows of the file into a DataFrame: data
data = ____(____, ____, ____)
# Build a numpy array from the DataFrame: data_array
data_array = ____
# Print the datatype of data_array to the shell
print(type(data_array))