Tạo một VCorpus từ data frame
Nếu dữ liệu văn bản của bạn nằm trong một data frame, bạn có thể dùng DataframeSource() để phân tích. Data frame truyền vào DataframeSource() phải có cấu trúc cụ thể:
- Cột một phải có tên
doc_idvà chứa một chuỗi duy nhất cho mỗi hàng. - Cột hai phải có tên
textvới mã hóa "UTF-8" (khá tiêu chuẩn). - Bất kỳ cột nào khác, từ cột 3 trở đi, được xem là metadata và sẽ được giữ lại như vậy.
Bài tập này giới thiệu meta() để trích xuất metadata gắn với mỗi tài liệu. Thường dữ liệu của bạn sẽ có metadata như tác giả, ngày tháng, thẻ chủ đề hoặc địa điểm giúp ích cho phân tích. Khi văn bản đã là một corpus, bạn có thể dùng meta() để xem thông tin bổ sung ở cấp độ tài liệu.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
Trong workspace của bạn có một data frame đơn giản tên example_text với đúng tên cột và một số metadata. Cũng có vec_corpus là một volatile corpus được tạo bằng VectorSource()
- Tạo
df_sourcebằngDataframeSource()vớiexample_text. - Tạo
df_corpusbằng cách chuyểndf_sourcethành đối tượng corpus volatile vớiVCorpus(). - In
df_corpus. Hãy để ý nó có bao nhiêu tài liệu và số lượng điểm metadata ở cấp tài liệu được giữ lại. - Dùng
meta()trêndf_corpusđể in metadata gắn với tài liệu. - Xem đối tượng
vec_corpusđã được nạp sẵn. So sánh số lượng tài liệu vớidf_corpus. - Dùng
meta()trênvec_corpusđể so sánh bất kỳ metadata nào giữavec_corpusvàdf_corpus.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a DataframeSource from the example text
df_source <- ___
# Convert df_source to a volatile corpus
df_corpus <- ___
# Examine df_corpus
df_corpus
# Examine df_corpus metadata
___
# Compare the number of documents in the vector source
vec_corpus
# Compare metadata in the vector corpus
___