始める無料で始める

スペイン語レビューのステミング

前のチャプターで、Amazon の商品レビューの言語を判定するために言語検出パッケージを使ったことを思い出してください。この演習では、まず non_english_reviews の各レビューの言語を検出します。レビューは複数言語で書かれていますが、ここではスペイン語のもの「だけ」を選びます。概念を忘れてしまった場合は、外国語検出についての動画に戻って復習しても大丈夫です。

次のステップでは、スペイン語レビューから単語トークンを作成し、スペイン語用の SnowBall ステマーでステミングします。 残念ながら、言語検出パッケージは完璧ではありません。そのため、検出された言語が誤っている場合もあります。

この演習はコースの一部です

Pythonで学ぶSentiment Analysis

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
コードを編集して実行