Adăugarea de pipe-uri în spaCy
În activitatea NLP de zi cu zi, folosești adesea un model spaCy existent. Totuși, în anumite situații, o componentă de pipeline predefinită – cum ar fi segmentarea propozițiilor – poate dura mult până produce rezultatele așteptate. În acest exercițiu, vei exersa adăugarea unei componente de pipeline la un model spaCy (pipeline de procesare a textului).
Vei folosi primele cinci recenzii din setul de date Amazon Fine Food Reviews. Poți accesa aceste recenzii prin șirul de caractere texts.
Pachetul spaCy este deja importat și disponibil pentru utilizare.
Acest exercițiu face parte din cursul
Procesarea limbajului natural cu spaCy
Instrucțiuni pentru exercițiu
- Încarcă un model
spaCygol pentru limba engleză și adaugă o componentăsentencizerla model. - Creează un container
Docpentrutexts, creează o listă pentru a stoca propozițiile (sentences) din documentul dat și afișează numărul de propoziții. - Afișează lista de tokeni din a doua propoziție din lista
sentences.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])