Logistická regrese na datech z Twitteru
V tomto cvičení sestavíš model logistické regrese na základě datasetu tweets. Cílová proměnná je airline_sentiment, kde 0 označuje negativní tweety, 1 neutrální a 2 pozitivní. Jde tedy o úlohu klasifikace do více tříd. Vše, co jsme se naučili o binárních problémech, platí i zde.
Přesnost modelu vyhodnotíš dvěma různými způsoby, které jsme si ukázali ve slidech.
Funkce pro logistickou regresi a výpočet přesnosti jsou již naimportované.
Toto cvičení je součástí kurzu
Sentiment Analysis v Pythonu
Pokyny k cvičení
- Sestav a natrénuj model logistické regrese s použitím definovaných
Xayjako argumentů. - Vypočítej přesnost modelu logistické regrese.
- Predikcuj štítky.
- Vypočítej přesnost (accuracy score) pomocí predikovaných a skutečných štítků.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define the vector of targets and matrix of features
y = tweets.airline_sentiment
X = tweets.drop('airline_sentiment', axis=1)
# Build a logistic regression model and calculate the accuracy
log_reg = ____.____(X, y)
print('Accuracy of logistic regression: ', log_reg.____)
# Create an array of prediction
y_predict = log_reg.____
# Print the accuracy using accuracy score
print('Accuracy of logistic regression: ', ____(___, ____))