Ähnliche Wörter in einem Vokabular

Das Auffinden semantisch ähnlicher Begriffe hat viele Anwendungen im Information Retrieval. In dieser Übung übst du, den semantisch ähnlichsten Begriff zum Wort computer aus dem Vokabular des Modells en_core_web_md zu finden.

Der Wortvektor zu computer wurde bereits extrahiert und als word_vector gespeichert. Das Modell en_core_web_md ist als nlp geladen und das NumPy-Paket als np.

Du kannst die Funktion .most_similar() des Objekts nlp.vocab.vectors verwenden, um die semantisch ähnlichsten Begriffe zu finden. Das Indexieren der Ausgabe dieser Funktion mit [0][0] liefert die Wort-IDs der semantisch ähnlichen Begriffe. nlp.vocab.strings[<a given word>] kann verwendet werden, um die Wort-ID eines gegebenen Wortes zu finden; entsprechend kann damit auch das Wort zu einer gegebenen Wort-ID ermittelt werden.

Diese Übung ist Teil des Kurses

Natural Language Processing mit spaCy

Anleitung zur Übung

Finde den semantisch ähnlichsten Begriff aus dem en_core_web_md-Vokabular.
Ermittle die Liste ähnlicher Wörter anhand der Wort-IDs der ähnlichen Begriffe.

Interaktive Übung

Vervollständige den Beispielcode, um diese Übung erfolgreich abzuschließen.

# Find the most similar word to the word computer
most_similar_words = nlp.vocab.vectors.____(np.asarray([____]), n = 1)

# Find the list of similar words given the word IDs
words = [nlp.____.____[____] for w in most_similar_words[0][0]]
print(words)

Code bearbeiten und ausführen

Diese Übung ist Teil des Kurses

Natural Language Processing mit spaCy

Mittlere SchwierigkeitSchwierigkeitsgrad

4.8+

Kurs kostenlos starten

In diesem Kapitel lernst du NLP kennen, inklusive einiger Anwendungsfälle wie die Erkennung benannter Entitäten und KI-gestützte Chatbots. Du erfährst, wie du die leistungsstarke Bibliothek spaCy für verschiedene Aufgaben der Sprachverarbeitung einsetzt, zum Beispiel Tokenisierung, Satzsegmentierung, POS-Tagging und Erkennung benannter Entitäten.

Exercise 1: Grundlagen der Natural Language Processing (NLP)Exercise 2: Doc-Container in spaCy Exercise 3: Anwendungsfall für NER Exercise 4: Tokenisierung mit spaCy Exercise 5: spaCy-Grundlagen Exercise 6: Eine spaCy-Pipeline ausführen Exercise 7: Lemmatisierung mit spaCy Exercise 8: Satzsegmentierung mit spaCy Exercise 9: Linguistische Merkmale in spaCy Exercise 10: POS-Tagging mit spaCy Exercise 11: NER mit spaCy Exercise 12: Textverarbeitung mit spaCy

Lerne sprachliche Merkmale, Wortvektoren, semantische Ähnlichkeit, Analogien und Operationen mit Wortvektoren kennen. In diesem Kapitel entdeckst du, wie du mit spaCy Wortvektoren extrahierst, Texte zu einem bestimmten Thema kategorisierst und semantisch ähnliche Begriffe zu gegebenen Wörtern aus einem Korpus oder aus dem Vokabular eines spaCy-Modells findest.

Exercise 1: Linguistische Merkmale Exercise 2: Linguistische Annotationen in spaCy Exercise 3: Wortsinndisambiguierung mit spaCy Exercise 4: Dependency Parsing mit spaCy Exercise 5: Einführung in Wortvektoren Exercise 6: spaCy-Vokabular Exercise 7: Wortvektoren im spaCy-Vokabular Exercise 8: Wortvektoren und spaCy Exercise 9: Analogien und Vektoroperationen Exercise 10: Projektion von Wortvektoren Exercise 11: Ähnliche Wörter in einem Vokabular

Aktuelle Übung

Exercise 12: Semantische Ähnlichkeit mit spaCy messen Exercise 13: Doc-Ähnlichkeit mit spaCy Exercise 14: Span-Ähnlichkeit mit spaCy Exercise 15: Semantische Ähnlichkeit zur Kategorisierung von Text

Mach dich mit spaCy-Pipeline-Komponenten vertraut, lerne, wie du eine Pipeline-Komponente hinzufügst, und analysiere die NLP-Pipeline. Außerdem lernst du mehrere Ansätze für regelbasierte Informationsextraktion kennen, mit den Klassen EntityRuler, Matcher und PhraseMatcher in spaCy sowie dem Python-Paket RegEx.

Exercise 1: spaCy-Pipelines Exercise 2: Pipes in spaCy hinzufügen Exercise 3: Pipelines in spaCy analysieren Exercise 4: spaCy EntityRuler Exercise 5: EntityRuler mit leerem spaCy-Modell Exercise 6: EntityRuler für NER Exercise 7: EntityRuler mit mehreren Mustern in spaCy Exercise 8: RegEx mit spaCy Exercise 9: RegEx in Python Exercise 10: RegEx mit EntityRuler in spaCy Exercise 11: spaCy Matcher und PhraseMatcher Exercise 12: Einen einzelnen Begriff in spaCy matchen Exercise 13: PhraseMatcher in spaCy Exercise 14: Abgleichen mit erweiterter Syntax in spaCy

Erkunde mehrere praxisnahe Anwendungsfälle, in denen spaCy-Modelle versagen können, und lerne, wie du sie weitertrainierst, um die Modellleistung zu verbessern. Du wirst in die Trainingsschritte von spaCy eingeführt und verstehst, wie du ein vorhandenes spaCy-Modell oder eines von Grund auf trainierst und das Modell zur Inferenzzeit evaluierst.

Exercise 1: spaCy-Modelle anpassen Exercise 2: spaCy-Modelle trainieren Exercise 3: Modellleistung auf deinen Daten Exercise 4: spaCy-Trainingsdatenformat Exercise 5: Trainingsschritte Exercise 6: Annotation und Vorbereitung von Trainingsdaten Exercise 7: Kompatible Trainingsdaten Exercise 8: Training mit spaCy Exercise 9: Schritte zur Trainingsvorbereitung Exercise 10: Ein vorhandenes NER-Modell trainieren Exercise 11: Ein spaCy-Modell von Grund auf trainieren Exercise 12: Abschluss