Bắt đầu ngayBắt đầu miễn phí

Chuẩn bị dữ liệu

Trong cuộc bầu cử Mỹ năm 2016, các bot tweet từ Nga được dùng để liên tục phát tán thông điệp chính trị tới cả đảng Dân chủ và Cộng hòa. Bạn được cung cấp một bộ dữ liệu các tweet như vậy tên là russian_tweets. Bạn quyết định phân loại các tweet này theo xu hướng thiên tả (Democrat) hoặc thiên hữu (Republican). Trước khi xây dựng mô hình phân loại, bạn cần làm sạch và chuẩn bị văn bản cho việc mô hình hóa.

Bài tập này là một phần của khóa học

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Xem khóa học

Hướng dẫn bài tập

  • Hoàn tất bước tách token bằng cách stemming các token.
  • Dùng cast_dtm() để tạo ma trận tài liệu–thuật ngữ (document-term matrix).
  • Áp dụng trọng số tfidf cho ma trận tài liệu–thuật ngữ.
  • In ma trận ra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Stem the tokens
russian_tokens <- russian_tweets %>%
  unnest_tokens(output = "word", token = "words", input = content) %>%
  anti_join(stop_words) %>%
  ___(word = ___(word))

# Create a document term matrix using TFIDF weighting
tweet_matrix <- russian_tokens %>%
  count(tweet_id, word) %>%
  ___(document = ___, term = ___,
           value = n, weighting = tm::___)

# Print the matrix details 
___
Chỉnh sửa và Chạy Mã