시작하기무료로 시작하기

BoW 예제

문헌고찰에서는 연구자들이 특정 주제에 대해 가능한 한 많은 텍스트를 읽고 요약합니다. 이 과정에서 중복된 글을 읽거나 이미 읽은 글의 요약을 다시 읽게 되기도 해요. 여러분에게는 원유(crude oil)에 관한 20편의 기사가 R 객체 crude_tibble로 주어졌습니다. 각 기사를 곧장 읽기보다, 우선 이 기사들에서 어떤 단어들이 공통으로 등장하는지 살펴보려 합니다. 이를 위해 텍스트의 bag-of-words 표현부터 만들어 보겠습니다.

이 연습은 강의의 일부입니다

R로 배우는 자연어 처리 입문

강의 보기

연습 안내

  • article_id 열을 사용해 기사별 단어 수를 세어 BoW 표현을 만드세요.
  • 출력 결과를 사용해 고유한 기사/단어 조합이 몇 개 생성되었는지 확인하세요.
  • 결과를 'prices' 언급으로 필터링하세요.
  • prices라는 단어가 사용된 기사는 몇 편인가요?

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Count occurrence by article_id and word
words <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(___, ___, sort=TRUE)

# How many different word/article combinations are there?
unique_combinations <- nrow(___)

# Filter to responses with the word "prices"
words_with_prices <- words %>%
  ___(word == "___")

# How many articles had the word "prices"?
number_of_price_articles <- nrow(___)
코드 편집 및 실행