Tạo ma trận thuật-ngữ–tài-liệu (term-document matrix)
Bạn gần hoàn tất phần nền tảng không mấy hào hứng trước khi bước sang các trực quan hóa và phân tích thú vị dựa trên những khái niệm bạn đã học!
Trong bài này, bạn sẽ thực hiện quy trình tương tự nhưng lấy chuyển vị của document-term matrix. Ở đây, term-document matrix có các thuật ngữ ở cột đầu tiên và các tài liệu trải ngang phía trên làm tên các cột riêng lẻ.
TDM thường là ma trận dùng cho phân tích ngôn ngữ. Lý do là bạn thường có nhiều thuật ngữ hơn tác giả hoặc tài liệu, và mọi thứ nói chung dễ xử lý hơn khi số hàng nhiều hơn số cột. Cách đơn giản để bắt đầu phân tích là chuyển ma trận về dạng ma trận thường bằng cách dùng as.matrix() trên TDM.
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Tạo
coffee_tdmbằng cách áp dụngTermDocumentMatrix()lênclean_corp. - Tạo
coffee_mbằng cách chuyểncoffee_tdmthành ma trận bằngas.matrix(). - In kích thước của
coffee_mra console. Lưu ý số hàng và số cột. - In phần tập con của
coffee_mgồm các thuật ngữ (hàng)"star"và"starbucks"và các tài liệu (cột) từ 25 đến 35.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a term-document matrix from the corpus
coffee_tdm <- ___
# Print coffee_tdm data
coffee_tdm
# Convert coffee_tdm to a matrix
coffee_m <- ___
# Print the dimensions of the matrix
___
# Review a portion of the matrix
___[___, ___]