Xử lý văn bản với spaCy
Mỗi ứng dụng NLP đều gồm nhiều bước xử lý văn bản. Bạn đã học một số bước như tokenization, lemmatization, phân đoạn câu và nhận dạng thực thể có tên.
Trong bài tập này, bạn sẽ tiếp tục luyện tập các bước xử lý văn bản trong spaCy, như tách văn bản thành các câu và trích xuất thực thể có tên. Bạn sẽ dùng 5 bài đánh giá đầu tiên từ bộ dữ liệu Amazon Fine Food Reviews cho bài này. Bạn có thể truy cập các bài đánh giá đó thông qua đối tượng texts.
Mô hình en_core_web_sm đã được nạp sẵn để bạn sử dụng qua nlp. Danh sách các Doc tương ứng với từng phần tử trong texts cũng đã được chuẩn bị sẵn và có thể truy cập ở documents.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)