Bắt đầu ngayBắt đầu miễn phí

Xử lý văn bản với spaCy

Mỗi ứng dụng NLP đều gồm nhiều bước xử lý văn bản. Bạn đã học một số bước như tokenization, lemmatization, phân đoạn câu và nhận dạng thực thể có tên.

spaCy NLP Pipeline

Trong bài tập này, bạn sẽ tiếp tục luyện tập các bước xử lý văn bản trong spaCy, như tách văn bản thành các câu và trích xuất thực thể có tên. Bạn sẽ dùng 5 bài đánh giá đầu tiên từ bộ dữ liệu Amazon Fine Food Reviews cho bài này. Bạn có thể truy cập các bài đánh giá đó thông qua đối tượng texts.

Mô hình en_core_web_sm đã được nạp sẵn để bạn sử dụng qua nlp. Danh sách các Doc tương ứng với từng phần tử trong texts cũng đã được chuẩn bị sẵn và có thể truy cập ở documents.

Bài tập này là một phần của khóa học

Xử lý ngôn ngữ tự nhiên với spaCy

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
Chỉnh sửa và Chạy Mã