Tách từ (Tokenization) với spaCy
Trong bài tập này, bạn sẽ thực hành tách từ cho văn bản. Bạn sẽ dùng bài đánh giá đầu tiên từ bộ dữ liệu Amazon Fine Food Reviews cho bài này. Bạn có thể truy cập bài đánh giá đó thông qua đối tượng text đã cung cấp.
Mô hình en_core_web_sm đã được tải sẵn cho bạn. Bạn có thể truy cập bằng cách gọi nlp(). Bạn có thể dùng list comprehension để tổng hợp các danh sách đầu ra.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Lưu Doc container cho bài đánh giá đã nạp sẵn vào một đối tượng
document. - Lưu và xem lại văn bản của tất cả các token trong
documentvào biếnfirst_text_tokens.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")