or
Ця вправа є частиною курсу
Навчіться обчислювати базові ознаки, зокрема кількість слів, кількість символів, середню довжину слова та кількість спеціальних символів (наприклад, гештегів і згадок у Twitter). Також ви навчитеся рахувати індекси читабельності та визначати рівень освіти, потрібний, щоб зрозуміти текст.
У цьому розділі ви дізнаєтеся про токенізацію та лематизацію. Далі ви навчитеся виконувати очищення тексту, розмітку частин мови та розпізнавання іменованих сутностей за допомогою бібліотеки spaCy. Засвоївши ці поняття, ви зробите промову в Геттісбурзі зручною для обробки машиною, проаналізуєте вживання іменників у фейкових новинах і визначите людей, згаданих у статті TechCrunch.
Дізнайтеся про моделювання n-gram і застосуйте його для аналізу тональності відгуків на фільми.
Навчіться обчислювати ваги tf-idf і косинусну подібність між двома векторами. Ви застосуєте ці підходи, щоб створити рекомендаційні системи для фільмів і виступів TED. Нарешті, ви також дізнаєтеся про векторні подання слів (word embeddings) і, використовуючи вектори слів, обчислите подібність між різними піснями Pink Floyd.
Поточна вправа