開始使用免費開始

對西班牙文評論做 stemming

你可能還記得在前一章,我們用過語言偵測套件來判定不同 Amazon 產品評論所使用的語言。這個練習中,你會先偵測 non_english_reviews 的語言。這些評論包含多種語言,但你只需要篩選出西班牙文的評論。如果忘了部分觀念,歡迎回去重看介紹外語偵測的影片。

第二步,你會從西班牙文評論建立文字斷詞(tokens),並使用適用西班牙文的 SnowBall 詞幹提取器進行 stemming。 語言偵測套件並不完美,因此有時候偵測結果可能不正確。

本練習屬於課程

Python 情感分析

檢視課程

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
編輯並執行程式碼