시작하기무료로 시작하기

스페인어 리뷰 어간 추출하기

이전 장에서 Amazon 상품 리뷰의 언어를 판별하기 위해 언어 감지 패키지를 사용했던 것을 기억하시나요? 이번 연습에서는 먼저 non_english_reviews의 언어를 감지합니다. 리뷰는 여러 언어로 되어 있지만, 이 중 스페인어인 리뷰만 선택할 거예요. 개념이 잘 기억나지 않으면 외국어 감지에 대해 설명한 영상을 다시 보셔도 됩니다.

두 번째 단계에서는 스페인어 리뷰에서 단어 토큰을 만든 뒤, 스페인어용 SnowBall stemmer를 사용해 어간 추출을 수행합니다. 안타깝지만 언어 감지 패키지가 완벽하지는 않습니다. 따라서 가끔 감지된 언어가 정확하지 않을 수 있습니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Sentiment Analysis

강의 보기

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the language detection package
import ____

# Loop over the rows of the dataset and append  
languages = [] 
for i in ____(____(non_english_reviews)):
    languages.append(____.____(non_english_reviews.iloc[i, 1]))

# Clean the list by splitting     
languages = [str(lang).split(':')[0][1:] for lang in languages]
# Assign the list to a new feature 
non_english_reviews['language'] = languages

# Select the Spanish ones
filtered_reviews = non_english_reviews[non_english_reviews.language == 'es']
코드 편집 및 실행