Bonjour, je m'appelle Josh Turner. Dans ces leçons, vous découvrirez les données TensorFlow et prétraitement, modèles TensorFlow et TensorFlow outils professionnels. Commençons par la première leçon. Dans cette leçon, je vais vous apprendre les éléments nécessaires bibliothèques pour effectuer le prétraitement des données. Nous allons définir quelques variables et prétraiter notre propre formation, validation et test de l'ensemble de données. Commençons. La première chose que je dois faire est d'aller sur le site Web kaggle.com. Une fois que vous y êtes, vous pouvez accéder à l'onglet Ensembles de données et recherchez l’ensemble de données de classification des images satellites. Une fois que vous l'avez trouvé, vous pouvez télécharger l'image satellite Ensemble de données de classification dans un dossier local par vous-même ordinateur. Allez dans le dossier, et vous verrez que nous avons quatre classes différentes de images, nuageux, désert, zone verte et eau. Une fois que vous avez réussi, ouvrez l'éditeur Python de votre choix. Nous commencerons par les premières étapes de notre prétraitement des données bibliothèque. La première chose que je dois faire est d'importer le nécessaire bibliothèques. Nous importerons NumPy pour pouvoir gérer les mathématiques calculs et tableaux. Nous importerons TensorFlow afin de pouvoir utiliser l'intégralité de capacités. En particulier, nous utiliserons le TensorFlow .keras . bibliothèque de prétraitement et importez le Fonction imageDatasetFromDirectory. Ce sera la fonction que nous utiliserons pour effectuer notre prétraitement. Une fois que vous avez fait cela avec succès, tapez ceci code, exécutez-le pour voir qu'il fonctionne correctement. Très bien, jusqu'ici, tout va bien. La prochaine étape de notre prétraitement des données consiste à définir certains variables. Où que vous ayez enregistré votre imageDataset dans votre répertoire, vous pouvez copier le texte dans la barre de cookies et définir le variables suivantes. Définissez une variable appelée répertoire et, entre guillemets doubles, faites-la égal au répertoire que vous avez copié depuis la barre de cookies. En passant, n'oubliez pas que vous devrez changer le dos des barres obliques vers des barres obliques, sinon Python vous donnera une erreur. Après cela, nous créerons une variable appelée batchSize et utilisez un nombre arbitraire comme 32. Après cela, nous créerons une autre variable appelée imageSize et utilisez un autre nombre carré arbitraire de 160 par 160. Exécutons ces lignes de code pour nous assurer que tout fonctionne d'accord. Très bien, jusqu'ici, tout va bien. L'étape suivante consiste à utiliser ces variables et ce répertoire pour créer un ensemble de données de formation. Pour ce faire, créez une variable appelée train et tapez le code suivant. Définissez le train égal à imageDataset à partir du répertoire, la fonction que nous avons importée plus tôt. Cela prendra comme variables, les étiquettes des répertoires, qui sera déduit du répertoire, mélanger les paramètres définis sur false afin de ne pas confondre les ensembles de tests et de validation. Pour celui-ci, la répartition de validation sera de 20 % de validation et 80 % pour la formation, et ce sera le sous-ensemble formation. Nous utiliserons un batchSize de la variable que nous avons créée précédemment et une imageSize de la variable que nous avons créée précédemment. Cela complétera l’ensemble de données de formation. Assurez-vous d'avoir toutes les virgules correctes en place ou vous obtiendrez une erreur. Exécutez ces lignes de code et nous verrons la première étape du pré- -traiter notre ensemble de données d'image. Une fois que vous aurez exécuté ces lignes de code, vous verrez que TensorFlow vous dira qu'il a trouvé 5 631 fichiers appartenant à quatre classes utilisant 4 505 fichiers pour la formation. Si vous obtenez une erreur CUDA comme celle-ci sur votre ordinateur, ne le faites pas t'inquiète, c'est juste parce que tu n'en profites pas pleinement des GPU TensorFlow. D'accord génial. Maintenant, ce qui est bien, c'est que nous pouvons aussi faire la même chose pour le ensemble de validation. Nous devons juste changer quelques petites choses. Copiez et collez le code ci-dessus et refaites tout pour le ensemble de données de validation. Une fois que vous l'aurez copié et collé, nous modifierons quelques éléments pour créer un ensemble de données de validation. Nous utiliserons toujours la répartition de validation de 20 % et nous changerons le sous-ensemble de la formation à la validation et nous changerons le nom de la variable de train en validation. Tout le reste restera le même. D'accord, alors allons-y et changeons le nom en validation. Très bien, et la prochaine chose que nous voulons changer est le sous-ensemble. Ce ne sera pas le sous-ensemble de formation, ce sera la validation sous-ensemble. D'accord génial. Jusqu'ici, tout va bien. Encore une fois, nous constatons que nous avons trouvé 5 631 fichiers appartenant à quatre classes. 1 126 utilisations pour validation. Quoi cela signifie-t-il former et valider des fichiers ? Eh bien, cela signifie simplement que nous entraînerons un modèle sur 80 % des les fichiers et nous utiliserons ensuite les 20 % restants pour créer un ensemble de données de test. Le reste de cet ensemble de données de test sera appelé le ensemble de données de validation. Nous utiliserons l'ensemble de données de validation pour ajuster les paramètres de notre modèle pour obtenir le meilleur ajustement quelle que soit l'utilisation l'affaire est pour notre problème. D'accord, créons maintenant l'ensemble de données de test. Nous le ferons à partir de l'ensemble de données de validation que nous avons créé plus tôt. Voyons donc comment cela fonctionne. Tout d’abord, nous voulons créer une variable appelée valbatches. Nous utiliserons les données TensorFlow fonction de cardinalité expérimentale. Cela nous indique simplement combien d'éléments de validation se trouvent dans chacun lot. Donc, si nous en prenions un lot de 32, peut-être que huit d'entre eux pourraient être dès la validation. C'est échantillonné au hasard. À l’intérieur de cela, comme paramètre, tapez validation. Suivant, nous allons définir une variable appelée l'ensemble de données de test. Définissez le test égal à validation.takevalbatches. Et nous utiliserons le symbole de double division en Python divisé par cinq. Cela revient donc essentiellement à dire que 20 % des validations que nous prendrons pour essai. Et puis nous sauterons tout ce qui reste et ce sera le nouveau ensemble de validation que nous utiliserons pour ajuster les paramètres de notre modèle. Exécutez ces lignes de code, assurez-vous que tout s'est bien passé. Super, jusqu'ici tout va bien. Merci d'avoir regardé. Restez à l'écoute pour la prochaine leçon où vous en apprendrez davantage Modèles TensorFlow.