Olá, meu nome é Josh Turner. Nestas lições, você aprenderá sobre dados do TensorFlow e pré-processamento, modelos do TensorFlow e TensorFlow ferramentas profissionais. Vamos começar com a primeira lição. Nesta lição, vou ensiná-lo sobre o necessário bibliotecas para fazer pré-processamento de dados. Definiremos algumas variáveis e pré-processaremos nosso próprio treinamento, validação e teste do conjunto de dados. Vamos começar. A primeira coisa que preciso que você faça é acessar o site kaggle. com. Quando estiver lá, você pode navegar até a guia Conjuntos de dados e pesquise o conjunto de dados de classificação de imagens de satélite. Depois de encontrá-lo, você pode baixar a imagem de satélite Conjunto de dados de classificação para uma pasta local por conta própria computador. Vá para a pasta, e você verá que temos quatro classes diferentes de imagens, nublado, deserto, área verde e água. Depois de fazer isso com sucesso, abra o editor Python de sua escolha. Começaremos com as primeiras etapas em nosso pré-processamento de dados biblioteca. A primeira coisa que preciso que você faça é importar o necessário bibliotecas. Importaremos NumPy para que possamos lidar com matemática cálculos e matrizes. Importaremos o TensorFlow para que possamos usar o completo capacidades. Em particular, usaremos o TensorFlow .keras . biblioteca de pré-processamento e importar o Função imageDatasetFromDirectory. Esta será a função que usaremos para fazer nosso pré-processamento. Depois de fazer isso com sucesso, digite isto código, execute-o para ver se funciona bem. Tudo bem, até agora, tudo bem. A próxima etapa em nosso pré-processamento de dados é definir alguns variáveis. Onde quer que você tenha salvo seu imageDataset em seu diretório, você pode copiar o texto na barra de cookies e definir o seguintes variáveis. Defina uma variável chamada diretório e, entre aspas duplas, coloque-a igual ao diretório que você copiou da barra de cookies. Como observação lateral, lembre-se de que você terá que mudar a parte de trás barras em barras, ou o Python apresentará um erro. Depois disso, criaremos uma variável chamada batchSize e use um número arbitrário como 32. Depois disso, criaremos outra variável chamada imageSize e use outro número quadrado arbitrário por 160 por 160. Vamos executar essas linhas de código para garantir que tudo funcione OK. Tudo bem, até agora, tudo bem. O próximo passo é usar essas variáveis e este diretório para crie um conjunto de dados de treinamento. Para fazer isso, crie uma variável chamada train e digite o seguinte código. Defina o trem igual a imageDataset do diretório, a função que importamos anteriormente. Isso tomará como variáveis os rótulos dos diretórios, que será inferido do diretório, parâmetros aleatórios definidos como falsos para que não misturemos os conjuntos de teste e validação. Para este, a divisão de validação será de 20% de validação e 80% para treinamento, e este será o subconjunto de treinamento. Usaremos um batchSize da variável que criamos anteriormente e um imageSize da variável que criamos anteriormente. Isso completará o conjunto de dados de treinamento. Certifique-se de ter todas as vírgulas corretas no lugar ou você receberá um erro. Execute essas linhas de código e veremos o primeiro passo no pré -processando nosso conjunto de dados de imagens. Depois de executar essas linhas de código, você verá que O TensorFlow informará que encontrou 5.631 arquivos pertencentes para quatro turmas utilizando 4.505 arquivos para treinamento. Se você receber um erro CUDA como este em sua máquina, não se preocupe, é só porque você não está aproveitando ao máximo das GPUs TensorFlow. Certo, ótimo. Agora, o bom é que também podemos fazer a mesma coisa para o conjunto de validação. Só precisamos mudar algumas pequenas coisas. Copie e cole o código acima e refaça tudo para o conjunto de dados de validação. Depois de copiá-lo e colá-lo, mudaremos algumas coisas para criar um conjunto de dados de validação. Ainda usaremos a divisão de validação de 20% e mudaremos o subconjunto de treinamento para validação e mudaremos o nome da variável de trem para validação. Todo o resto permanecerá o mesmo. Ok, então vamos mudar o nome para validação. Tudo bem, e a próxima coisa que queremos mudar é o subconjunto. Este não será o subconjunto de treinamento, será a validação subconjunto. Certo, ótimo. Até agora tudo bem. Novamente, vemos que encontramos 5.631 arquivos pertencentes a quatro classes. 1.126 usos para validação. O que significa treinar e validar arquivos? Bem, isso significa apenas que treinaremos um modelo em 80% do os arquivos e então usaremos os 20% restantes para criar um conjunto de dados de teste. O restante desse conjunto de dados de teste será chamado de conjunto de dados de validação. Usaremos o conjunto de dados de validação para ajustar os parâmetros do nosso modelo para obter o melhor ajuste para qualquer uso caso é para o nosso problema. Ok, agora vamos criar o conjunto de dados de teste. Faremos isso a partir do conjunto de dados de validação que criamos mais cedo. Então, vamos ver como isso funciona. Primeiro, queremos criar uma variável chamada valbatches. Usaremos os dados do TensorFlow função de cardinalidade experimental. Isso apenas nos diz quantos elementos de validação existem em cada lote. Então, se pegássemos um lote de 32, talvez oito deles pudessem ser da validação. É amostrado aleatoriamente. Dentro disso, como parâmetro, digite validação. Próximo, definiremos uma variável chamada conjunto de dados de teste. Defina o teste igual a validação.takevalbatches. E usaremos o símbolo de divisão dupla em Python dividido por cinco. Então, isso significa basicamente 20% das validações que faremos para teste. E então vamos pular o que resta e esse será o novo conjunto de validação que usaremos para ajustar os parâmetros do nosso modelo. Execute essas linhas de código e certifique-se de que tudo funcionou bem. Ótimo, até agora tudo bem. Obrigado por assistir. Fique ligado na próxima lição, onde você aprenderá sobre Modelos TensorFlow.