Bắt đầu ngayBắt đầu miễn phí

Luyện tập với h2o

Có nhiều thư viện machine learning trong R. Tuy nhiên, thư viện h2o dễ dùng và có sẵn triển khai word2vec. h2o cũng có thể dùng cho nhiều tác vụ machine learning khác. Tuy nhiên, để dùng thư viện h2o, bạn cần thực hiện thêm một số bước tiền xử lý với dữ liệu. Bạn có một tập dữ liệu tên left_right chứa các tweet được tự động đăng trong chiến dịch bầu cử Mỹ năm 2016.

Thay vì chuẩn bị dữ liệu cho các kỹ thuật phân tích văn bản khác, hãy chuẩn bị tập dữ liệu này để sử dụng với thư viện h2o.

Bài tập này là một phần của khóa học

Nhập môn Xử lý Ngôn ngữ Tự nhiên với R

Xem khóa học

Hướng dẫn bài tập

  • Import thư viện và khởi tạo một phiên h2o.
  • Tạo một đối tượng h2o.
  • Tách token các tweet được lưu ở cột content.
  • Chuyển tất cả từ về chữ thường và loại bỏ mọi stop words.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
Chỉnh sửa và Chạy Mã