시작하기무료로 시작하기

데이터 프레임에서 VCorpus 만들기

텍스트 데이터가 데이터 프레임에 있다면, 분석을 위해 DataframeSource()를 사용할 수 있어요. DataframeSource()에 전달되는 데이터 프레임은 특정 구조를 따라야 합니다:

  • 첫 번째 열 이름은 doc_id여야 하며, 각 행에 대한 고유한 문자열을 포함해야 해요.
  • 두 번째 열 이름은 text여야 하며 "UTF-8" 인코딩이어야 해요(일반적입니다).
  • 그 밖의 3번째 이후 열은 메타데이터로 간주되며 그대로 유지돼요.

이 연습 문제에서는 각 문서에 연결된 메타데이터를 추출하는 meta()를 소개합니다. 실제 데이터에는 저자, 날짜, 주제 태그, 장소 등 분석에 도움이 되는 메타데이터가 있는 경우가 많아요. 텍스트를 코퍼스로 만든 뒤 meta()를 적용하면 문서 수준의 추가 정보를 확인할 수 있어요.

이 연습은 강의의 일부입니다

R로 배우는 Bag-of-Words 텍스트 마이닝

강의 보기

연습 안내

작업 공간에는 올바른 열 이름과 일부 메타데이터를 가진 간단한 데이터 프레임 example_text가 있어요. 또한 VectorSource()로 만든 휘발성 코퍼스 vec_corpus도 있어요.

  • example_textDataframeSource()를 사용해 df_source를 만드세요.
  • df_sourceVCorpus()휘발성 코퍼스 객체로 변환해 df_corpus를 만드세요.
  • df_corpus를 출력하세요. 몇 개의 문서를 포함하는지와 유지된 문서 수준 메타데이터 개수를 확인해 보세요.
  • df_corpusmeta()를 사용해 문서 관련 메타데이터를 출력하세요.
  • 미리 로드된 vec_corpus 객체를 살펴보세요. 문서 개수를 df_corpus와 비교해 보세요.
  • vec_corpusmeta()를 사용해 vec_corpusdf_corpus 사이에서 발견되는 메타데이터를 비교하세요.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Create a DataframeSource from the example text
df_source <- ___

# Convert df_source to a volatile corpus
df_corpus <- ___

# Examine df_corpus
df_corpus

# Examine df_corpus metadata
___

# Compare the number of documents in the vector source
vec_corpus

# Compare metadata in the vector corpus
___
코드 편집 및 실행