Bienvenido al curso de Knowledge City en redes neuronales, diseño de redes neuronales. Durante estas lecciones, aprenderá la importancia de los datos, tipos de redes neuronales, seleccionando el tipo de red a utilizar, funciones de activación, funciones de pérdida y optimizadores, hiperparámetros, capas, entrenamiento, prueba y validación. Lo que vas a aprender. ¿Por qué los datos son importantes para las redes neuronales? ¿Cómo se correlaciona la calidad de los datos al rendimiento de la red neuronal? ¿Por qué es importante considerar las cuestiones éticas? con los datos que usas en las redes neuronales? Primero, ¿por qué los datos son tan importantes para las redes neuronales? Si no recuerda nada más sobre las redes neuronales, Deberías recordar esto, basura adentro, basura afuera. En caso de que no estés familiarizado con esta frase, esencialmente significa que si usa mala calidad o datos basura, entonces obtendrá resultados de mala calidad o basura. La red neuronal es igual de buena como los datos utilizados para entrenarlo. Debido a esto, desea evitar la mayor parte de lo siguiente al elegir sus datos como sea posible, datos ruidosos, datos con características e instancias correlacionadas, datos con valores faltantes, datos con entidades e instancias duplicadas, datos con valores que tienen diferentes órdenes de magnitud. Datos, redes neuronales y ética. Aunque las redes neuronales pueden ser extremadamente eficientes y útil en varios sistemas, es importante tener en cuenta que su rendimiento se basa en gran medida en los datos. Anteriormente, discutimos algunos ejemplos de datos basura. Sin embargo, existe otro tipo de datos basura, los datos sesgados. Este tipo de datos no puede contener ninguna de las cualidades para evitar que se discutieron anteriormente, pero puede conducir a clasificadores y regresores poco éticos. Los datos sesgados son datos sesgados más en la dirección de una clase o característica particular. Cada vez más usos y aplicaciones de redes neuronales involucrando humanos están siendo explorados e implementados. Debido a esto, los datos utilizados para entrenar las redes contiene mucha información relacionada con la demografía como raza, edad, etnia, orientación sexual y otras características. En los casos en que se utilicen las redes para clasificar a un determinado individuo basado en una, algunas o todas estas características, es fácil crear una red que perfila en lugar de clasificar. Para evitar estos problemas éticos, al seleccionar los datos utilizados para entrenar un modelo, es importante tener situaciones iguales e ideales o representación casi igualitaria de todos los datos demográficos en todas las clases. Es importante recordar la importancia de la privacidad. al seleccionar los datos a utilizar y prueba en tus redes, también. Solo porque eres capaz de obtener información sobre un individuo o entidad no significa que querrían que usaras esa información para ayudar a clasificarse a sí mismos o a otros. Aquí hay algunos ejemplos en Python utilizando el perceptrón de una sola capa en el conjunto de datos de cáncer de mama. Entonces, primero, solo tenemos nuestras definiciones de funciones. A continuación, voy a cargar el conjunto de datos de cáncer de mama e imprimiendo la precisión. Entonces, como puede ver aquí, el puntaje de la prueba es de aproximadamente 90, 91%. Y el puntaje de entrenamiento es de aproximadamente 92, 93%. Así que ahora tengo datos duplicados. Y lo que estoy haciendo aquí, Solo estoy creando un duplicado de todas las funciones. en el conjunto de datos. Entonces, en lugar de 30 funciones, tiene 60 funciones, pero hay dos funciones idénticas para cada función. Y ahora voy a entrenar de nuevo al modelo. Y lo que verá son los puntajes de entrenamiento y prueba ambos han caído. Ahora, esto es particularmente interesante. porque en realidad no estoy introduciendo ningún dato nuevo, solo más de los mismos datos, sin embargo, hizo que el clasificador funcionara peor. A continuación, voy a hacer un ejemplo de datos ruidosos. Y en este caso, Solo estoy agregando ruido aleatorio a los datos de entrada. Y luego voy a entrenar al modelo de nuevo. Ahora, como se puede ver aquí, el puntaje de prueba y el puntaje de entrenamiento cayeron nuevamente, no tanto como con los datos duplicados, pero seguía siendo una disminución. Una cosa importante a tener en cuenta aquí es que el conjunto de datos de cáncer de mama es un conjunto de datos muy limpio. Entonces, independientemente de cuán pobre y ruidoso sea el conjunto de datos, todavía obtendrá resultados bastante buenos. Pero si este fuera un conjunto de datos menos limpio, que es probablemente con lo que trabajará en la práctica, entonces estas cosas podrían causar una caída aún mayor en el rendimiento. Y por último, tenemos un ejemplo de datos correlacionados. Así que aquí solo estoy sumando los mismos datos multiplicándolos por un factor de 2.7. Entonces, en realidad son solo los mismos datos, solo que escalados de manera diferente. Y como puedes ver, el puntaje de la prueba volvió a caer al igual que el puntaje de entrenamiento. Y ahora solo voy a aplicar todos los resultados para que puedas ver lo que pasó. Entonces, la línea azul es para los resultados de las pruebas. y la línea verde es para los resultados del entrenamiento. Así como se puede ver el original, que es solo el conjunto de datos limpio normal, sin duplicados, sin ruido, sin correlación, supera a todos los demás conjuntos de datos. Esto concluye esta lección. Gracias.