시작하기무료로 시작하기

데이터 준비

2016년 미국 대선 동안 러시아 트윗 봇이 민주당과 공화당 모두에게 정치적 메시지를 지속적으로 유포했습니다. 이러한 트윗으로 구성된 russian_tweets 데이터셋이 주어졌습니다. 이제 이 트윗을 좌성향(민주당) 또는 우성향(공화당)으로 분류하려고 합니다. 분류 모델을 만들기 전에, 먼저 모델링을 위해 텍스트를 정리하고 준비해야 합니다.

이 연습은 강의의 일부입니다

R로 배우는 자연어 처리 입문

강의 보기

연습 안내

  • 토큰의 어간을 추출하여 토큰화 과정을 마무리하세요.
  • cast_dtm()을 사용해 문서-단어 행렬(document-term matrix)을 만드세요.
  • tf-idf 가중치를 사용해 문서-단어 행렬에 가중치를 부여하세요.
  • 행렬을 출력하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
코드 편집 및 실행