Språkidentifiering av produktrecensioner
I den här övningen får du träna på språkidentifiering med en liten datamängd som heter non_english_reviews. Det är ett urval av icke-engelska recensioner från Amazons produktrecensioner.
Du itererar över datamängdens rader, identifierar språket i varje rad och lägger till det i en tom lista. Listan behöver rensas så att den bara innehåller språkkoden, till exempel 'en' för engelska, i stället för det vanliga utdataformatet en:0.9987654. Kom ihåg att språkidentifieringsfunktionen kan returnera fler än ett språk – det första elementet i listan är det mest sannolika. Till sist tilldelar du listan till en ny kolumn.
Logiken är densamma som i bildspelet och föregående övning, men i stället för att tillämpa funktionen på en lista arbetar du nu med en datamängd.
Den här övningen är en del av kursen
Sentimentanalys i Python
Övningsinstruktioner
- Iterera över raderna i datamängden
non_english_reviews. - Inuti loopen, identifiera språket i den andra kolumnen i datamängden.
- Rensa strängen genom att dela upp den vid
:inuti list comprehension-uttrycket. - Tilldela slutligen den rensade listan till en ny kolumn.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
from langdetect import detect_langs
languages = []
# Loop over the rows of the dataset and append
for row in ____(____(non_english_reviews)):
languages.append(____(non_english_reviews.iloc[row, 1]))
# Clean the list by splitting
languages = [str(lang).____(':')[0][1:] for lang in languages]
# Assign the list to a new feature
non_english_reviews['language'] = ____
print(non_english_reviews.head())