Phân đoạn câu với spaCy
Trong bài tập này, bạn sẽ thực hành phân đoạn câu. Trong NLP, tách một tài liệu thành các câu là một thao tác cơ bản hữu ích. Đây là một trong những bước đầu tiên của nhiều tác vụ NLP phức tạp hơn, chẳng hạn như nhận dạng thực thể có tên. Bên cạnh đó, nắm được số lượng câu cũng có thể giúp bạn ước lượng mức độ thông tin mà văn bản cung cấp.
Bạn có thể truy cập mười bài đánh giá về đồ ăn trong danh sách texts.
Mô hình en_core_web_sm đã được nạp sẵn dưới tên nlp và .
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Chạy mô hình
spaCytrên từng phần tử trong danh sáchtextsđể tạodocuments, một danh sách chứa tất cả các đối tượngDoc. - Trích xuất các câu từ mỗi đối tượng
docbằng cách lặp qua danh sáchdocumentsvà thêm chúng vào danh sáchsentences. - Đếm số câu trong mỗi đối tượng
docbằng cách sử dụng danh sáchsentences.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Generating a documents list of all Doc containers
documents = [____(text) for text in texts]
# Iterate through documents and append sentences in each doc to the sentences list
sentences = []
for doc in documents:
sentences.append([s for s in ____.____])
# Find number of sentences per each doc container
print([len(____) for s in sentences])