Tạo ma trận tài liệu–thuật ngữ
Hy vọng bạn vẫn còn tỉnh táo sau loạt thao tác khai phá văn bản cơ bản này! Phòng khi buồn ngủ, hãy quay lại với cà phê và ghé Starbucks trong lúc xây dựng một ma trận tài liệu–thuật ngữ từ các tweet về cà phê.
Bắt đầu với tệp coffee.csv, chúng ta đã áp dụng các bước biến đổi phổ biến để tạo ra một corpus sạch có tên clean_corp.
Ma trận tài liệu–thuật ngữ được dùng khi bạn muốn mỗi tài liệu là một hàng. Cách này hữu ích khi bạn so sánh tác giả theo từng hàng, hoặc dữ liệu sắp theo trình tự thời gian và bạn muốn giữ nguyên chuỗi thời gian. Gói tm sử dụng lớp "simple triplet matrix". Tuy nhiên, thường sẽ dễ thao tác và kiểm tra đối tượng hơn nếu bạn chuyển lại kiểu của DTM bằng as.matrix()
Bài tập này là một phần của khóa học
Khai phá văn bản với Bag-of-Words trong R
Hướng dẫn bài tập
- Tạo
coffee_dtmbằng cách áp dụngDocumentTermMatrix()lênclean_corp. - Tạo
coffee_m, phiên bản ma trận củacoffee_dtm, bằngas.matrix(). - In kích thước của
coffee_mra console bằng hàmdim(). Lưu ý số hàng và cột. - In tập con của
coffee_mgồm các tài liệu (hàng) từ 25 đến 35 và các thuật ngữ (cột)"star"và"starbucks".
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create the document-term matrix from the corpus
coffee_dtm <- ___
# Print out coffee_dtm data
coffee_dtm
# Convert coffee_dtm to a matrix
coffee_m <- ___
# Print the dimensions of coffee_m
___
# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]