Bắt đầu ngayBắt đầu miễn phí

Thêm pipe trong spaCy

Bạn thường sử dụng một mô hình spaCy có sẵn cho nhiều tác vụ NLP khác nhau. Tuy nhiên, trong một số trường hợp, một thành phần pipeline có sẵn như phân đoạn câu có thể mất nhiều thời gian để cho ra kết quả như mong đợi. Trong bài tập này, bạn sẽ thực hành thêm một thành phần pipeline vào một mô hình spaCy (pipeline xử lý văn bản).

Bạn sẽ dùng năm đánh giá đầu tiên từ bộ dữ liệu Amazon Fine Food Reviews cho bài tập này. Bạn có thể truy cập các đánh giá này qua chuỗi texts.

Gói spaCy đã được nhập sẵn để bạn sử dụng.

Bài tập này là một phần của khóa học

Xử lý ngôn ngữ tự nhiên với spaCy

Xem khóa học

Hướng dẫn bài tập

  • Tải một mô hình tiếng Anh spaCy trống và thêm thành phần sentencizer vào mô hình.
  • Tạo một Doc cho texts, tạo một danh sách để lưu các sentences của tài liệu đã cho và in ra số lượng câu.
  • In danh sách token trong câu thứ hai từ danh sách sentences.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
Chỉnh sửa và Chạy Mã