เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การแสดงภาพและเปรียบเทียบ Word Embeddings

เวกเตอร์ของคำ (word embeddings) มีจำนวนมิติสูงมาก ทำให้ตีความโดยตรงได้ยาก ในแบบฝึกหัดนี้ จะลดมิติของเวกเตอร์คำลงเหลือ 2 มิติโดยใช้ Principal Component Analysis (PCA) แล้วนำมาแสดงผลเป็นภาพ วิธีนี้ช่วยให้เห็นการจัดกลุ่มเชิงความหมายหรือความคล้ายคลึงกันของคำในพื้นที่ embedding จากนั้นจะเปรียบเทียบการแทนค่าด้วย embedding ของสองโมเดล ได้แก่ glove-wiki-gigaword-50 ซึ่งเข้าถึงได้ผ่านตัวแปร model_glove_wiki และ glove-twitter-25 ซึ่งเข้าถึงได้ผ่านตัวแปร model_glove_twitter

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การประมวลผลภาษาธรรมชาติ (NLP) ด้วย Python

ดูคอร์ส

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

words = ["lion", "tiger", "leopard", "banana", "strawberry", "truck", "car", "bus"]

# Extract word embeddings
word_vectors = [____[____] for word in words]

# Reduce dimensions with PCA
pca = PCA(n_components=2)
word_vectors_2d = pca.____(____)

plt.scatter(word_vectors_2d[:, 0], word_vectors_2d[:, 1])
for word, (x, y) in zip(words, word_vectors_2d):
    plt.annotate(word, (x, y))
plt.title("GloVe Wikipedia Word Embeddings (2D PCA)")
plt.show()
แก้ไขและรันโค้ด