對西班牙文評論做 stemming
你可能還記得在前一章,我們用過語言偵測套件來判定不同 Amazon 產品評論所使用的語言。這個練習中,你會先偵測 non_english_reviews 的語言。這些評論包含多種語言,但你只需要篩選出西班牙文的評論。如果忘了部分觀念,歡迎回去重看介紹外語偵測的影片。
第二步,你會從西班牙文評論建立文字斷詞(tokens),並使用適用西班牙文的 SnowBall 詞幹提取器進行 stemming。 語言偵測套件並不完美,因此有時候偵測結果可能不正確。
本練習屬於課程
Python 情感分析
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']