Kom igångKom igång gratis

Språkidentifiering av produktrecensioner

I den här övningen får du träna på språkidentifiering med en liten datamängd som heter non_english_reviews. Det är ett urval av icke-engelska recensioner från Amazons produktrecensioner.

Du itererar över datamängdens rader, identifierar språket i varje rad och lägger till det i en tom lista. Listan behöver rensas så att den bara innehåller språkkoden, till exempel 'en' för engelska, i stället för det vanliga utdataformatet en:0.9987654. Kom ihåg att språkidentifieringsfunktionen kan returnera fler än ett språk – det första elementet i listan är det mest sannolika. Till sist tilldelar du listan till en ny kolumn.

Logiken är densamma som i bildspelet och föregående övning, men i stället för att tillämpa funktionen på en lista arbetar du nu med en datamängd.

Den här övningen är en del av kursen

Sentimentanalys i Python

Visa kurs

Övningsinstruktioner

  • Iterera över raderna i datamängden non_english_reviews.
  • Inuti loopen, identifiera språket i den andra kolumnen i datamängden.
  • Rensa strängen genom att dela upp den vid : inuti list comprehension-uttrycket.
  • Tilldela slutligen den rensade listan till en ny kolumn.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

from langdetect import detect_langs
languages = [] 

# Loop over the rows of the dataset and append  
for row in ____(____(non_english_reviews)):
    languages.append(____(non_english_reviews.iloc[row, 1]))

# Clean the list by splitting     
languages = [str(lang).____(':')[0][1:] for lang in languages]

# Assign the list to a new feature 
non_english_reviews['language'] = ____

print(non_english_reviews.head())
Redigera och kör kod