Eksploracja zbioru danych 20 News Groups
W tym ćwiczeniu otrzymujesz próbkę zbioru danych 20 News Groups, pobraną za pomocą funkcji fetch_20newsgroups() z biblioteki sklearn.datasets, z filtrowaniem tylko trzech klas: sci.space, alt.atheism i soc.religion.christian.
Zbiór danych jest załadowany do zmiennej news_dataset. Jego atrybuty są wyświetlane w konsoli, dzięki czemu możesz je przejrzeć.
Więcej informacji o tej funkcji znajdziesz w dokumentacji Sklearn.
Krok po kroku dokonasz tokenizacji tekstów i zakodowania etykiet metodą one-hot, aby zrozumieć, jak przebiegają te przekształcenia.
To ćwiczenie jest częścią kursu
Rekurencyjne sieci neuronowe (RNN) do modelowania języka w Keras
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# See example article
print(news_dataset.____[5])