ÎncepețiÎncepe gratuit

Detectarea limbii recenziilor de produse

Vei exersa detectarea limbii pe un set de date mic numit non_english_reviews. Acesta este un eșantion de recenzii non-engleze din recenziile de produse Amazon.

Vei itera peste rândurile setului de date, detectând limba fiecărui rând și adăugând-o la o listă goală. Lista trebuie curățată astfel încât să conțină doar codul limbii recenziei – de exemplu 'en' pentru engleză, în loc de rezultatul obișnuit en:0.9987654. Reține că funcția de detectare a limbii poate identifica mai multe limbi, iar primul element din lista returnată reprezintă cel mai probabil candidat. În final, vei atribui lista unei coloane noi.

Logica este aceeași ca în slide-uri și în exercițiul anterior, cu diferența că, în loc să aplici funcția pe o listă, lucrezi cu un set de date.

Acest exercițiu face parte din cursul

Analiza sentimentelor în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Iterează peste rândurile setului de date non_english_reviews.
  • În interiorul buclei, detectează limba celei de-a doua coloane din setul de date.
  • Curăță șirul de caractere împărțindu-l după : în interiorul expresiei de tip list comprehension.
  • În final, atribuie lista curățată unei coloane noi.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Editează și rulează codul