ÎncepețiÎncepe gratuit

Adăugarea de pipe-uri în spaCy

În activitatea NLP de zi cu zi, folosești adesea un model spaCy existent. Totuși, în anumite situații, o componentă de pipeline predefinită – cum ar fi segmentarea propozițiilor – poate dura mult până produce rezultatele așteptate. În acest exercițiu, vei exersa adăugarea unei componente de pipeline la un model spaCy (pipeline de procesare a textului).

Vei folosi primele cinci recenzii din setul de date Amazon Fine Food Reviews. Poți accesa aceste recenzii prin șirul de caractere texts.

Pachetul spaCy este deja importat și disponibil pentru utilizare.

Acest exercițiu face parte din cursul

Procesarea limbajului natural cu spaCy

Vezi cursul

Instrucțiuni pentru exercițiu

  • Încarcă un model spaCy gol pentru limba engleză și adaugă o componentă sentencizer la model.
  • Creează un container Doc pentru texts, creează o listă pentru a stoca propozițiile (sentences) din documentul dat și afișează numărul de propoziții.
  • Afișează lista de tokeni din a doua propoziție din lista sentences.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
Editează și rulează codul