Bắt đầu ngayBắt đầu miễn phí

Thuật ngữ xuất hiện thường xuyên với qdap

Nếu bạn chấp nhận hy sinh một chút quyền kiểm soát đối với các bước tiền xử lý cụ thể, thì cách nhanh để lấy các thuật ngữ xuất hiện thường xuyên là dùng freq_terms() từ qdap.

Hàm này nhận một biến văn bản, trong trường hợp của chúng ta là vector tweets$text. Bạn có thể chỉ định số lượng thuật ngữ hàng đầu cần hiển thị với đối số top, một vector các từ dừng cần loại bỏ với đối số stopwords, và độ dài ký tự tối thiểu của một từ để được đưa vào với đối số at.least. qdap có danh sách từ dừng riêng, khác với trong tm. Bài tập này sẽ hướng dẫn bạn cách dùng mỗi loại và so sánh kết quả.

Vẽ biểu đồ cơ bản cho kết quả thì rất dễ. Chỉ cần gọi plot() trên đối tượng trả về từ freq_terms().

Bài tập này là một phần của khóa học

Khai phá văn bản với Bag-of-Words trong R

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create frequency
frequency <- ___(
  ___, 
  top = ___, 
  at.least = ___, 
  stopwords = ___
)

# Make a frequency bar chart
Chỉnh sửa và Chạy Mã