Hallo, mein Name ist Josh Turner. In diesen Lektionen erfahren Sie mehr über TensorFlow-Daten und Vorverarbeitung, TensorFlow-Modelle und TensorFlow professionelle Werkzeuge. Beginnen wir mit der ersten Lektion. In dieser Lektion werde ich Ihnen das Notwendige beibringen Bibliotheken zur Datenvorverarbeitung. Wir werden einige Variablen festlegen und unser eigenes Training vorverarbeiten. Validierung und Testdatensatz. Lass uns anfangen. Das erste, was Sie tun müssen, ist, die Website aufzurufen kaggle.com. Sobald Sie dort sind, können Sie zur Registerkarte „Datensätze“ navigieren und suchen Sie nach dem Satellitenbild-Klassifizierungsdatensatz. Sobald Sie es gefunden haben, können Sie das Satellitenbild herunterladen Klassifizierungsdatensatz in einen eigenen lokalen Ordner kopieren Computer. Gehen Sie in den Ordner, und Sie werden sehen, dass wir vier verschiedene Klassen haben Bilder, bewölkt, Wüste, Grünfläche und Wasser. Sobald Sie dies erfolgreich getan haben, öffnen Sie den Python-Editor von deine Entscheidung. Wir beginnen mit den ersten Schritten unserer Datenvorverarbeitung Bibliothek. Als Erstes müssen Sie das Notwendige importieren Bibliotheken. Wir werden NumPy importieren, damit wir mit Mathematik umgehen können Berechnungen und Arrays. Wir werden TensorFlow importieren, damit wir es vollständig nutzen können Fähigkeiten. Insbesondere verwenden wir TensorFlow .keras . Vorverarbeitungsbibliothek und importieren Sie die imageDatasetFromDirectory-Funktion. Dies ist die Funktion, die wir für unsere Vorverarbeitung verwenden. Wenn Sie dies erfolgreich getan haben, tippen Sie dies ein Führen Sie den Code aus, um sicherzustellen, dass er ordnungsgemäß funktioniert. Alles klar, soweit, so gut. Der nächste Schritt in unserer Datenvorverarbeitung besteht darin, einige festzulegen Variablen. Wo auch immer Sie Ihr imageDataset in Ihrem Verzeichnis gespeichert haben, Sie können den Text in der Cookie-Leiste kopieren und festlegen folgenden Variablen. Legen Sie eine Variable mit dem Namen „Verzeichnis“ fest und schreiben Sie sie in doppelte Anführungszeichen entspricht dem Verzeichnis, das Sie aus der Cookie-Leiste kopiert haben. Denken Sie nebenbei daran, dass Sie die Rückseite wechseln müssen Schrägstriche in Schrägstriche umwandeln, sonst gibt Python eine Fehlermeldung aus. Danach erstellen wir eine Variable namens „batchSize“ und Verwenden Sie eine beliebige Zahl wie 32. Danach erstellen wir eine weitere Variable namens imageSize und verwenden Sie eine andere beliebige Quadratzahl von 160 um 160. Lassen Sie uns diese Codezeilen ausführen, um sicherzustellen, dass alles funktioniert Okay. Alles klar, soweit, so gut. Der nächste Schritt besteht darin, diese Variablen und dieses Verzeichnis zu verwenden Erstellen Sie einen Trainingsdatensatz. Erstellen Sie dazu eine Variable namens train und geben Sie den folgenden Code ein. Setze train gleich imageDataset aus dem Verzeichnis, die Funktion, die wir zuvor importiert haben. Als Variablen werden die Verzeichnisbezeichnungen verwendet, die wird aus dem Verzeichnis abgeleitet, Shuffle-Parameter werden auf „false“ gesetzt, damit wir sie nicht verwechseln Test- und Validierungssätze. In diesem Fall beträgt die Validierungsaufteilung 20 % der Validierung und 80 % für das Training, und dies wird die Trainingsteilmenge sein. Wir verwenden eine BatchSize der Variablen, die wir zuvor erstellt haben eine imageSize der Variablen, die wir zuvor erstellt haben. Dadurch wird der Trainingsdatensatz vervollständigt. Stellen Sie sicher, dass alle Kommas richtig gesetzt sind oder Sie erhalten eine Fehlermeldung. Führen Sie diese Codezeilen aus und wir sehen den ersten Schritt in Pre -Verarbeitung unseres Bilddatensatzes. Sobald Sie diese Codezeilen ausgeführt haben, werden Sie das sehen TensorFlow teilt Ihnen mit, dass 5.631 Dateien gefunden wurden auf vier Klassen mit 4.505 Dateien für das Training. Wenn auf Ihrem Computer ein CUDA-Fehler wie dieser auftritt, tun Sie das nicht Machen Sie sich Sorgen, das liegt nur daran, dass Sie nicht den vollen Nutzen daraus ziehen der TensorFlow-GPUs. OK großartig. Das Schöne ist, dass wir das Gleiche auch für tun können Validierungssatz. Wir müssen nur ein paar Kleinigkeiten ändern. Kopieren Sie den Code von oben, fügen Sie ihn ein und wiederholen Sie alles für Validierungsdatensatz. Sobald Sie es kopiert und eingefügt haben, werden wir einige Dinge ändern um einen Validierungsdatensatz zu erstellen. Wir verwenden weiterhin die Validierungsaufteilung von 20 %. und wir werden die Teilmenge von Training auf Validierung umstellen und wir werden den Variablennamen von train in validation ändern. Alles andere wird gleich bleiben. Okay, also lasst uns fortfahren und den Namen in „Validierung“ ändern. Alles klar, und das nächste, was wir ändern wollen, ist die Teilmenge. Dies wird nicht die Trainingsteilmenge sein, sondern die Validierung Teilmenge. OK großartig. So weit, ist es gut. Auch hier sehen wir, dass wir 5.631 Dateien gefunden haben, die zu vier Klassen gehören. 1.126 Verwendungen zur Validierung. Was Bedeutet es, Dateien zu trainieren und zu validieren? Nun, das bedeutet nur, dass wir ein Modell auf 80 % davon trainieren werden die Dateien und dann werden wir die restlichen 20 % verwenden, um eine zu erstellen Testdatensatz. Der Rest dieses Testdatensatzes wird als bezeichnet Validierungsdatensatz. Wir verwenden den Validierungsdatensatz, um die Parameter zu optimieren unseres Modells, um für jeden Einsatzzweck die beste Passform zu erhalten Fall ist für unser Problem. Okay, jetzt erstellen wir den Testdatensatz. Wir machen das anhand des von uns erstellten Validierungsdatensatzes früher. Mal sehen, wie das funktioniert. Zuerst möchten wir eine Variable namens valbatches erstellen. Wir verwenden die TensorFlow-Daten experimentelle Kardinalitätsfunktion. Dies sagt uns lediglich, wie viele Validierungselemente jeweils enthalten sind Charge. Wenn wir also eine Charge von 32 nehmen würden, könnten es vielleicht acht sein aus der Validierung. Es handelt sich um eine Zufallsstichprobe. Geben Sie darin als Parameter die Typvalidierung ein. Nächste, Wir legen eine Variable namens Testdatensatz fest. Setzen Sie test gleich validation.takevalbatches. Und wir werden das doppelte Divisionssymbol in Python verwenden geteilt durch fünf. Das bedeutet also im Grunde, dass wir 20 % der Validierungen vornehmen werden zum Testen. Und dann überspringen wir alles, was noch übrig ist, und das wird das Neue sein Validierungssatz, den wir verwenden werden, um die Parameter unseres zu optimieren Modell. Führen Sie diese Codezeilen aus und stellen Sie sicher, dass alles gut geklappt hat. Großartig, soweit so gut. Danke fürs zuschauen. Seien Sie gespannt auf die nächste Lektion, in der Sie mehr darüber erfahren TensorFlow-Modelle.