Chạy một pipeline spaCy
Bạn đã chạy pipeline NLP của spaCy trên một đoạn văn bản đơn lẻ và cũng đã trích xuất các token từ một danh sách các container Doc. Trong bài tập này, bạn sẽ luyện tập các bước khởi đầu khi chạy pipeline spaCy trên texts, là một danh sách các chuỗi văn bản.
Bạn sẽ dùng model en_core_web_sm cho mục đích này. Gói spaCy đã được nhập sẵn cho bạn.
Bài tập này là một phần của khóa học
Xử lý ngôn ngữ tự nhiên với spaCy
Hướng dẫn bài tập
- Nạp model
en_core_web_smthànhnlp. - Chạy mô hình
nlp()trên từng phần tử củatexts, và thêm mỗiDoctương ứng vào danh sáchdocuments. - In ra văn bản của các token cho mỗi container
Doctrong danh sáchdocuments.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Load en_core_web_sm model as nlp
nlp = spacy.____(____)
# Run an nlp model on each item of texts and append the Doc container to documents
documents = []
for text in ____:
documents.append(____)
# Print the token texts for each Doc container
for doc in documents:
print([____ for ____ in ____])