시작하기무료로 시작하기

여러 개의 텍스트 열

이 연습 문제에서는 항공사 트위터 데이터 작업을 이어서 진행합니다. 데이터셋 tweets가 이미 로드되어 있어요.

어떤 경우에는 데이터셋에 텍스트 열이 둘 이상 있을 수 있고, 각 텍스트 열에 대해 숫자 표현을 만들고 싶을 때가 있습니다. 여기서는 트윗 본문이 들어 있는 text 열 외에 두 번째 텍스트 열 negativereason이 있습니다. 이 열에는 고객이 부정적인 리뷰를 남긴 이유가 들어 있습니다.

여러분의 과제는 두 열 모두에 대해 BOW 표현을 만들고, 필요한 불용어를 지정하는 것입니다.

이 연습은 강의의 일부입니다

Python으로 배우는 Sentiment Analysis

강의 보기

연습 안내

  • 벡터화 패키지와 기본 영어 불용어 목록을 임포트하세요.
  • 기본 영어 불용어 목록을 업데이트하여 my_stop_words 집합을 만드세요.
  • 첫 번째 벡터라이저의 불용어 인자에는 업데이트된 집합을, 두 번째 벡터라이저에는 기본 영어 불용어 집합을 지정하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Import the vectorizer and default English stop words list
____

# Define the stop words
my_stop_words = ____._____(['airline', 'airlines', '@', 'am', 'pm'])
 
# Build and fit the vectorizers
vect1 = CountVectorizer(____=my_stop_words)
vect2 = CountVectorizer(____=____) 
vect1.fit(tweets.text)
vect2.fit(tweets.negative_reason)

# Print the last 15 features from the first, and all from second vectorizer
print(vect1.get_feature_names()[-15:])
print(vect2.get_feature_names())
코드 편집 및 실행