Bắt đầu ngayBắt đầu miễn phí

Chạy một pipeline spaCy

Bạn đã chạy pipeline NLP của spaCy trên một đoạn văn bản đơn lẻ và cũng đã trích xuất các token từ một danh sách các container Doc. Trong bài tập này, bạn sẽ luyện tập các bước khởi đầu khi chạy pipeline spaCy trên texts, là một danh sách các chuỗi văn bản.

Bạn sẽ dùng model en_core_web_sm cho mục đích này. Gói spaCy đã được nhập sẵn cho bạn.

Bài tập này là một phần của khóa học

Xử lý ngôn ngữ tự nhiên với spaCy

Xem khóa học

Hướng dẫn bài tập

  • Nạp model en_core_web_sm thành nlp.
  • Chạy mô hình nlp() trên từng phần tử của texts, và thêm mỗi Doc tương ứng vào danh sách documents.
  • In ra văn bản của các token cho mỗi container Doc trong danh sách documents.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load en_core_web_sm model as nlp
nlp = spacy.____(____)

# Run an nlp model on each item of texts and append the Doc container to documents
documents = []
for text in ____:
  documents.append(____)
  
# Print the token texts for each Doc container
for doc in documents:
  print([____ for ____ in ____])
Chỉnh sửa và Chạy Mã