Keras-preprocessing

De op één na belangrijkste module van Keras is keras.preprocessing. Je ziet hoe je de belangrijkste modules en functies gebruikt om ruwe data voor te bereiden op de juiste inputvorm. Keras biedt functionaliteit die de woordenboekaanpak vervangt die je eerder hebt geleerd.

Je gebruikt de module keras.preprocessing.text.Tokenizer om met de methode .fit_on_texts() een woordenboek van woorden te maken en de teksten om te zetten naar numerieke id’s die de index van elk woord in het woordenboek voorstellen met de methode .texts_to_sequences().

Gebruik daarna de functie .pad_sequences() uit keras.preprocessing.sequence om alle sequenties even lang te maken (nodig voor het model) door nullen toe te voegen aan korte teksten en lange teksten af te kappen.

Deze oefening maakt deel uit van de cursus

Recurrent Neural Networks (RNN's) voor taalmodellen met Keras

Oefeninstructies

Importeer Tokenizer en pad_sequences uit de relevante modules.
Fit het object tokenizer op de voorbeelddata in texts.
Zet de teksten om in sequenties van numerieke indexen met de methode .texts_to_sequences().
Maak de lengte van de teksten gelijk door ze te padden.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Import relevant classes/functions
from tensorflow.keras.preprocessing.text import ____
from tensorflow.keras.preprocessing.sequence import ____

# Build the dictionary of indexes
tokenizer = Tokenizer()
tokenizer.fit_on_texts(____)

# Change texts into sequence of indexes
texts_numeric = tokenizer.____(texts)
print("Number of words in the sample texts: ({0}, {1})".format(len(texts_numeric[0]), len(texts_numeric[1])))

# Pad the sequences
texts_pad = ____(texts_numeric, 60)
print("Now the texts have fixed length: 60. Let's see the first one: \n{0}".format(texts_pad[0]))

Code bewerken en uitvoeren

Deze oefening maakt deel uit van de cursus

Recurrent Neural Networks (RNN's) voor taalmodellen met Keras

SkillTag.level.advancedSkillTag.label

4.8+

Begin gratis met de cursus

In dit hoofdstuk leer je de basis van Recurrent Neural Networks (RNN). We beginnen met enkele vereisten, bekijken hoe informatie door het netwerk stroomt en laten tot slot zien hoe je zulke modellen met Keras implementeert voor een taak in sentimentclassificatie.

Exercise 1: Introductie van de cursus Exercise 2: Het aantal parameters van RNN en ANN vergelijken Exercise 3: Sentimentanalyse Exercise 4: Sequence-to-sequence-modellen Exercise 5: Introductie tot taalmodellen Exercise 6: Wennen aan tekstdata Exercise 7: Tekstgegevens voorbereiden voor modelinvoer Exercise 8: Nieuwe tekst transformeren Exercise 9: Introductie tot RNN in Keras Exercise 10: Keras-modellen Exercise 11: Keras-preprocessing

Huidige oefening

Exercise 12: Je eerste RNN-model

Je leert over het vanishing- en exploding-gradient-probleem, dat vaak voorkomt bij RNN's, en hoe je dit aanpakt met GRU- en LSTM-cellen. Verder maak je embedding-lagen voor taalmodellen en pak je de taak van sentimentclassificatie opnieuw op.

Exercise 1: Ver verdwijnende en exploderende gradiënten Exercise 2: Exploding gradient-probleem Exercise 3: Vanishing gradient-probleem Exercise 4: GRU- en LSTM-cellen Exercise 5: GRU-cellen zijn beter dan SimpleRNN Exercise 6: RNN-lagen stapelen Exercise 7: De Embedding-laag Exercise 8: Vergelijking van het aantal parameters Exercise 9: Transfer learning Exercise 10: Embeddings verbeteren de prestaties Exercise 11: Sentimentclassificatie herbekeken Exercise 12: Betere sentimentclassificatie Exercise 13: De CNN-laag gebruiken

Vervolgens leer je in dit hoofdstuk hoe je data voorbereidt voor een multiclass-classificatietaak, en wat de verschillen zijn tussen multiclass-classificatie en binaire classificatie (sentimentanalyse). Tot slot leer je hoe je modellen bouwt en hun prestaties meet met Keras.

Exercise 1: Data preprocessing Exercise 2: Labelvectoren voorbereiden Exercise 3: Data pre-processen Exercise 4: Transfer learning voor taalmodellen Exercise 5: Startpunt voor transfer learning Exercise 6: Word2Vec Exercise 7: Modellen voor multiclass-classificatie Exercise 8: De 20 Newsgroups-gegevensset verkennen Exercise 9: Nieuwsartikelen classificeren Exercise 10: De prestatie van het model beoordelen Exercise 11: Trade-off tussen precisie en recall Exercise 12: Precision of Recall, dát is de vraag Exercise 13: Prestaties bij multi-class classificatie

Dit hoofdstuk introduceert twee toepassingen van RNN-modellen: tekstgeneratie en Neural Machine Translation. Je leert hoe je de tekstdata voorbereidt in het formaat dat de modellen nodig hebben. Het tekstgeneratiemodel wordt gebruikt om de manier van spreken van een personage na te bootsen en we hebben wat lol met het imiteren van Sheldon uit The Big Bang Theory. Neural Machine Translation wordt bijvoorbeeld door Google Translate gebruikt in een veel complexer model. In dit hoofdstuk maak je een model dat korte Portugese zinnen naar het Engels vertaalt.

Exercise 1: Sequence-to-sequence-modellen Exercise 2: Voorbeelden van tekstgeneratie Exercise 3: NMT-voorbeeld Exercise 4: De tekstgeneratiefunctie Exercise 5: Voorspel het volgende teken Exercise 6: Genereer zin met context Exercise 7: Pas de waarschijnlijkheidsschaal aan Exercise 8: Modellen voor tekengeneratie Exercise 9: Maak vectoren van zinnen en volgende tekens Exercise 10: De data voorbereiden voor training Exercise 11: Het tekstgeneratiemodel maken Exercise 12: Neurale machinevertaling Exercise 13: De invoertekst voorbereiden Exercise 14: De uitvoertekst voorbereiden Exercise 15: Vertaal Portugees naar Engels Exercise 16: Gefeliciteerd!