Začněte nyníZačněte zdarma

Detekce jazyka v recenzích produktů

Procvičíš si detekci jazyka na malém datasetu non_english_reviews, který obsahuje vzorek neangličtěných recenzí z databáze Amazon product reviews.

Budeš iterovat přes řádky datasetu, detekovat jazyk každého řádku a přidávat ho do prázdného seznamu. Tento seznam je potřeba vyčistit tak, aby obsahoval pouze kód jazyka, například 'en' pro angličtinu, místo standardního výstupu ve tvaru en:0.9987654. Pamatuj, že funkce pro detekci jazyka může vrátit více jazyků a první položka v vráceném seznamu je nejpravděpodobnější. Nakonec seznam přiřadíš do nového sloupce.

Logika je stejná jako v ukázkách a předchozím cvičení – místo aplikace funkce na seznam ale pracuješ s datasetem.

Toto cvičení je součástí kurzu

Sentiment Analysis v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Iteruj přes řádky datasetu non_english_reviews.
  • Uvnitř smyčky detekuj jazyk druhého sloupce datasetu.
  • Vyčisti řetězec rozdělením podle : ve výrazu list comprehension.
  • Nakonec přiřaď vyčištěný seznam do nového sloupce.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Upravit a spustit kód