Bem-vindo ao curso da Cidade do Conhecimento em redes neurais, projeto de rede neural. Durante essas lições, você aprenderá a importância dos dados, tipos de redes neurais, selecionar o tipo de rede a ser usado, funções de ativação, funções de perda e otimizadores, hiperparâmetros, camadas, treinamento, teste e validação. O que você vai aprender. Por que os dados são importantes para as redes neurais? Como a qualidade dos dados se correlaciona para o desempenho da rede neural? Por que é importante considerar questões éticas com os dados que você usa em redes neurais? Então, primeiro, por que os dados são tão importantes para as redes neurais? Se você não se lembra de mais nada sobre redes neurais, você deve se lembrar disso, lixo entrando, lixo saindo. Caso você não esteja familiarizado com esta frase, significa essencialmente que, se você usar baixa qualidade ou dados de lixo, então você obterá resultados de baixa qualidade ou lixo. A rede neural é tão boa como os dados usados para treiná-lo. Por causa disso, você quer evitar o máximo do seguinte ao escolher seus dados quanto possível, dados ruidosos, dados com recursos e instâncias correlacionados, dados com valores ausentes, dados com recursos e instâncias duplicados, dados com valores que têm várias ordens de magnitude. Dados, redes neurais e ética. Embora as redes neurais possam ser extremamente eficientes e útil em vários sistemas, é importante ter em mente que seu desempenho é fortemente baseada em dados. Anteriormente, discutimos alguns exemplos de dados de lixo. No entanto, há outro tipo de dados de lixo, dados tendenciosos. Este tipo de dados não pode conter nenhuma das qualidades para evitar o que foi discutido anteriormente, mas pode levar a classificadores e regressores antiéticos. Dados tendenciosos são dados distorcidos mais na direção de uma determinada classe ou característica. Cada vez mais usos e aplicações de redes neurais envolvendo humanos estão sendo explorados e implementados. Por isso, os dados usados para treinar as redes contém muitas informações relativas à demografia como raça, idade, etnia, orientação sexual e outras características. Nos casos em que as redes estão sendo usadas classificar um determinado indivíduo com base em um, alguns ou todos esses recursos, é fácil criar uma rede que perfila em vez de classificar. Para evitar esses problemas éticos, ao selecionar dados usados para treinar um modelo, é importante ter situações iguais e ideais ou representação quase igual de todos os dados demográficos em todas as classes. É importante lembrar a importância da privacidade ao selecionar os dados a serem usados e tente em suas redes também. Só porque você é capaz de obter informações sobre um indivíduo ou entidade não significa que eles gostariam que você usasse essas informações para ajudar a classificar a si mesmos ou aos outros. Aqui estão alguns exemplos em Python usando o perceptron de camada única no conjunto de dados de câncer de mama. Então, primeiro, temos apenas nossas definições de função. Em seguida, carregarei o conjunto de dados de câncer de mama e imprimir a precisão. Então, como você pode ver aqui, a pontuação do teste é de cerca de 90, 91%. E a pontuação de treinamento é de cerca de 92, 93%. Então agora eu tenho dados duplicados. E o que estou fazendo aqui, Estou apenas criando uma duplicata de todos os recursos no conjunto de dados. Então, em vez de 30 recursos, você tem 60 recursos, mas há dois recursos idênticos para cada recurso. E agora vou treinar o modelo novamente. E o que você verá são as pontuações de treinamento e teste ambos caíram. Agora, isso é particularmente interessante porque não estou introduzindo nenhum dado novo, apenas mais dos mesmos dados, ainda assim, fez com que o classificador tivesse um desempenho pior. Em seguida, vou fazer um exemplo de dados barulhentos. E neste caso, Estou apenas adicionando ruído aleatório aos dados de entrada. E então eu vou treinar o modelo novamente. Agora, como você pode ver aqui, a pontuação do teste e a pontuação do treinamento caíram novamente, não tanto quanto com os dados duplicados, mas mesmo assim foi um decréscimo. Uma coisa importante a notar aqui é que o conjunto de dados de câncer de mama é um conjunto de dados muito limpo. Portanto, independentemente de quão pobre e barulhento seja o conjunto de dados, você ainda obterá resultados bastante bons. Mas se este fosse um conjunto de dados menos limpo, que é provavelmente com o que você trabalhará na prática, então essas coisas podem causar uma queda ainda maior no desempenho. E por último, temos um exemplo de dados correlacionados. Então, aqui estou apenas adicionando os mesmos dados multiplicando-os por um fator de 2,7. Portanto, são realmente os mesmos dados, apenas dimensionados de maneira diferente. E como você pode ver, a pontuação do teste caiu novamente, assim como a pontuação do treinamento. E agora vou aplicar todos os resultados para que você possa ver o que aconteceu. E a linha azul é para os resultados dos testes e a linha verde é para os resultados do treinamento. Então, como você pode ver o original, que é apenas o conjunto de dados limpo regular, sem duplicatas, sem ruído, sem correlação, supera todos os outros conjuntos de dados. Isso conclui esta lição. Obrigada.