ÎncepețiÎncepe gratuit

Modificarea ponderilor de frecvență

Până acum, ai numărat pur și simplu termenii din documente folosind DocumentTermMatrix sau TermDocumentMatrix. În acest exercițiu, vei descoperi ponderarea TfIdf ca alternativă la frecvența simplă a termenilor. TfIdf vine de la term frequency-inverse document frequency (frecvența termenului – frecvența inversă în documente) și se folosește atunci când ai un corpus mare cu o diversitate lexicală redusă.

TfIdf numără termenii (adică Tf), normalizează valoarea în funcție de lungimea documentului și apoi penalizează termenii cu cât apar mai des în documente. Logica e simplă: dacă un cuvânt e foarte comun, are o anumită importanță, dar nu oferă informații valoroase. Acest aspect de penalizare este surprins în frecvența inversă a documentului (adică Idf).

De exemplu, dacă analizezi notițe din serviciul clienți, termenul „cu" poate fi o prescurtare pentru „customer" (client). O notiță poate conține „the cu has a damaged package", iar alta „cu called with question about delivery". Cu ponderarea prin frecvența documentului, „cu" apare de două ori, deci pare informativ. Însă în TfIdf, „cu" este penalizat deoarece apare în toate documentele. Prin urmare, „cu" nu mai este considerat relevant și valoarea sa scade spre 0, permițând altor termeni să aibă valori mai mari pentru analiză.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a TDM
tdm <- ___

# Convert it to a matrix
tdm_m <- ___

# Examine part of the matrix
tdm_m[___, ___]
Editează și rulează codul