스페인어 리뷰 어간 추출하기
이전 장에서 Amazon 상품 리뷰의 언어를 판별하기 위해 언어 감지 패키지를 사용했던 것을 기억하시나요? 이번 연습에서는 먼저 non_english_reviews의 언어를 감지합니다. 리뷰는 여러 언어로 되어 있지만, 이 중 스페인어인 리뷰만 선택할 거예요. 개념이 잘 기억나지 않으면 외국어 감지에 대해 설명한 영상을 다시 보셔도 됩니다.
두 번째 단계에서는 스페인어 리뷰에서 단어 토큰을 만든 뒤, 스페인어용 SnowBall stemmer를 사용해 어간 추출을 수행합니다. 안타깝지만 언어 감지 패키지가 완벽하지는 않습니다. 따라서 가끔 감지된 언어가 정확하지 않을 수 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 Sentiment Analysis
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Import the language detection package
import ____
# Loop over the rows of the dataset and append
languages = []
for i in ____(____(non_english_reviews)):
languages.append(____.____(non_english_reviews.iloc[i, 1]))
# Clean the list by splitting
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = languages
# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']