कदम 2: टेक्स्ट स्रोतों की पहचान करें
इस छोटे से अभ्यास में आप बॉस्टन के आस-पास की प्रॉपर्टी रेंटल रिव्यूज़ का एक छोटा कॉर्पस लोड और जाँचेंगे। उम्मीद है कि आप पहले से read.csv() जानते हैं, जो आपको कॉमा-सेपरेटेड फ़ाइल लोड करने देता है। यह भले साधारण लगे, लेकिन इस अध्याय का उद्देश्य आपको शुरुआत से अंत तक पूरी वर्कफ़्लो करने देना है, तो आइए डेटा इन्जेशन से शुरू करते हैं!
इसके बाद आप डेटा फ़्रेम की structure की समीक्षा करने के लिए str() लगाएँगे। यह वेक्टरों के शुरुआती मान और क्लास टाइप्स को कॉम्पैक्ट तरीके से दिखाने वाला सुविधाजनक फंक्शन है।
अंत में आप डेटा फ़्रेम के dimensions प्रिंट करने के लिए dim() का उपयोग करेंगे। डेटा फ़्रेम के लिए, आपका कंसोल पंक्तियों और कॉलमों की संख्या दिखाएगा।
अन्य फंक्शन जैसे head(), tail() या summary() अक्सर डेटा एक्सप्लोरेशन के लिए उपयोग होते हैं, लेकिन इस बार हम जाँच को छोटा रखते हैं ताकि आप जल्दी से मज़ेदार सेंटिमेंट एनालिसिस पर पहुँच सकें!
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Sentiment Analysis
अभ्यास निर्देश
Boston की प्रॉपर्टी रेंटल रिव्यूज़ एक CSV फ़ाइल में स्टोर हैं, जिसका लोकेशन पहले से परिभाषित वैरिएबल bos_reviews_file देता है.
read.csv()सेbos_reviews_fileवाली प्रॉपर्टी रिव्यूज़ लोड करें। ऑब्जेक्ट का नामbos_reviewsरखें.- बेस
str()फंक्शन कोbos_reviewsपर लगाकर डेटा फ़्रेम की संरचना जाँचें. bos_reviewsपरdim()कॉल करके जानें कि आप कितनी रिव्यूज़ पर काम कर रहे हैं.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# bos_reviews_file has been pre-defined
bos_reviews_file
# load raw text
bos_reviews <- ___
# Structure
___
# Dimensions
___