प्रोडक्ट रिव्यूज़ की भाषा पहचान
आप non_english_reviews नाम के एक छोटे डेटासेट पर भाषा पहचान का अभ्यास करेंगे. यह Amazon प्रोडक्ट रिव्यूज़ से गैर-अंग्रेजी रिव्यूज़ का एक सैंपल है.
आप डेटासेट की पंक्तियों पर इटरेट करेंगे, हर पंक्ति की भाषा डिटेक्ट करेंगे और उसे एक खाली लिस्ट में जोड़ेंगे. इस लिस्ट को क्लीन करना होगा ताकि इसमें सिर्फ रिव्यू की भाषा रहे, जैसे English के लिए 'en', न कि सामान्य आउटपुट en:0.9987654. याद रखें कि भाषा पहचान फंक्शन एक से अधिक भाषाएँ डिटेक्ट कर सकता है, और रिटर्न हुई लिस्ट का पहला आइटम सबसे संभावित कैंडिडेट होता है. अंत में, आप इस लिस्ट को एक नए कॉलम में असाइन करेंगे.
लॉजिक वही है जो स्लाइड्स और पिछले अभ्यास में इस्तेमाल हुआ था, पर इस बार आप फंक्शन को किसी लिस्ट पर लगाने के बजाय एक डेटासेट के साथ काम कर रहे हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Sentiment Analysis
अभ्यास निर्देश
non_english_reviewsडेटासेट की पंक्तियों पर इटरेट करें.- लूप के अंदर, डेटासेट के दूसरे कॉलम की भाषा डिटेक्ट करें.
- लिस्ट कॉम्प्रिहेंशन एक्सप्रेशन के भीतर
:पर split करके string को क्लीन करें. - अंत में, क्लीन की गई लिस्ट को एक नए कॉलम में असाइन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from langdetect import detect_langs
languages = []
# Loop over the rows of the dataset and append
for row in ____(____(non_english_reviews)):
languages.append(____(non_english_reviews.iloc[row, 1]))
# Clean the list by splitting
languages = [str(lang).____(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = ____
print(non_english_reviews.head())