शुरू करेंमुफ़्त में शुरू करें

प्रोडक्ट रिव्यूज़ की भाषा पहचान

आप non_english_reviews नाम के एक छोटे डेटासेट पर भाषा पहचान का अभ्यास करेंगे. यह Amazon प्रोडक्ट रिव्यूज़ से गैर-अंग्रेजी रिव्यूज़ का एक सैंपल है.

आप डेटासेट की पंक्तियों पर इटरेट करेंगे, हर पंक्ति की भाषा डिटेक्ट करेंगे और उसे एक खाली लिस्ट में जोड़ेंगे. इस लिस्ट को क्लीन करना होगा ताकि इसमें सिर्फ रिव्यू की भाषा रहे, जैसे English के लिए 'en', न कि सामान्य आउटपुट en:0.9987654. याद रखें कि भाषा पहचान फंक्शन एक से अधिक भाषाएँ डिटेक्ट कर सकता है, और रिटर्न हुई लिस्ट का पहला आइटम सबसे संभावित कैंडिडेट होता है. अंत में, आप इस लिस्ट को एक नए कॉलम में असाइन करेंगे.

लॉजिक वही है जो स्लाइड्स और पिछले अभ्यास में इस्तेमाल हुआ था, पर इस बार आप फंक्शन को किसी लिस्ट पर लगाने के बजाय एक डेटासेट के साथ काम कर रहे हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Sentiment Analysis

पाठ्यक्रम देखें

अभ्यास निर्देश

  • non_english_reviews डेटासेट की पंक्तियों पर इटरेट करें.
  • लूप के अंदर, डेटासेट के दूसरे कॉलम की भाषा डिटेक्ट करें.
  • लिस्ट कॉम्प्रिहेंशन एक्सप्रेशन के भीतर : पर split करके string को क्लीन करें.
  • अंत में, क्लीन की गई लिस्ट को एक नए कॉलम में असाइन करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
कोड संपादित करें और चलाएँ