Visualizzare e confrontare i word embedding

I word embedding sono ad alta dimensionalità, quindi è difficile interpretarli direttamente. In questo esercizio proietterai alcuni vettori di parole in 2D usando la Principal Component Analysis (PCA) e li visualizzerai. Questo aiuta a rivelare raggruppamenti semantici o somiglianze tra parole nello spazio degli embedding. Poi confronterai le rappresentazioni di embedding di due modelli: glove-wiki-gigaword-50, disponibile tramite la variabile model_glove_wiki, e glove-twitter-25, disponibile tramite model_glove_twitter.

Questo esercizio fa parte del corso

Natural Language Processing (NLP) in Python

Visualizza il corso

Esercizio pratico interattivo

Prova a risolvere questo esercizio completando il codice di esempio.

words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]

# Extract word embeddings
word_vectors = [____[____] for word in words]

# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)

plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
    plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()

Modifica ed esegui il codice

Questo esercizio fa parte del corso

Natural Language Processing (NLP) in Python

IntermediárioNível de habilidade

4.9+

Inizia il corso gratis

Learn the essentials of text processing in Natural Language Processing (NLP). Master techniques such as tokenization, stop word and punctuation removal, and text normalization with lowercasing, stemming, and lemmatization to prepare text data for further analysis and insight extraction.

Exercise 1: Introduction to natural language processing Exercise 2: Sentence and word tokenization Exercise 3: NLP workflow Exercise 4: Stop words and punctuation handling Exercise 5: Removing stop words Exercise 6: Removing punctuation Exercise 7: Text normalization techniques Exercise 8: Lowercasing Exercise 9: Stemming Exercise 10: Lemmatization

Transform raw text into powerful numerical features. Create Bag-of-Words and TF-IDF representations to capture word importance across documents, then explore word embeddings like Word2Vec and GloVe to uncover deep semantic patterns. Visualize frequency, relevance, and similarity to bring your text data to life.

Exercise 1: Rappresentazione Bag-of-Words Exercise 2: Costruire il vocabolario dalle recensioni dei clienti Exercise 3: Trasformare il testo in numeri con BoW Exercise 4: Analisi di frequenza delle recensioni dei prodotti Exercise 5: Visualizzare le frequenze delle parole Exercise 6: Vettorizzazione TF-IDF Exercise 7: Rappresentazione TF-IDF del feedback sui prodotti Exercise 8: Confrontare le rappresentazioni BoW e TF‑IDF Exercise 9: Embeddings Exercise 10: Esplorare le relazioni tra parole con gli embeddings Exercise 11: Visualizzare e confrontare i word embedding

Esercizio in corso

Harness the power of pre-trained models to perform advanced text classification tasks. Use Hugging Face pipelines for sentiment analysis, topic classification, and natural language inference. Evaluate semantic similarity and grammatical correctness with state-of-the-art models, all without building anything from scratch.

Exercise 1: Hugging Face pipelines for sentiment analysis Exercise 2: Analyzing the sentiment of a review Exercise 3: Batch classifying multiple reviews Exercise 4: Comparing models on labeled review data Exercise 5: Zero-shot classification and QNLI Exercise 6: Zero-shot classification of support tickets Exercise 7: Does the text answer the question?Exercise 8: Question similarity and grammatical correctness Exercise 9: Detecting duplicate questions Exercise 10: Checking grammatical correctness

Dive into the core of modern NLP applications with token classification and text generation techniques. Learn to extract meaningful entities and grammatical structures using NER and PoS tagging. Master both extractive and abstractive question answering, and explore advanced generation tasks including summarization, translation, and language modeling using Hugging Face pipelines.

Exercise 1: Token classification Exercise 2: Identifying named entities in news headlines Exercise 3: Part of Speech tagging for text analysis Exercise 4: Question answering Exercise 5: Answering questions from product descriptions Exercise 6: Generating natural answers with abstractive QA Exercise 7: Sequence generation tasks Exercise 8: Summarizing news articles for quick insights Exercise 9: Translating customer reviews to French Exercise 10: Building a search completion system Exercise 11: Congratulations