Bienvenue dans le cours de Knowledge City sur les réseaux de neurones, conception de réseaux de neurones. Au cours de ces leçons, vous apprendrez l'importance des données, types de réseaux de neurones, sélection du type de réseau à utiliser, fonctions d'activation, fonctions de perte et optimiseurs, hyper-paramètres, couches, formation, test et validation. Ce que vous apprendrez. Pourquoi les données sont-elles importantes pour les réseaux de neurones ? Comment la qualité des données est-elle corrélée aux performances du réseau de neurones ? Pourquoi est-il important de considérer les questions éthiques avec les données que vous utilisez dans les réseaux de neurones ? Alors d'abord, pourquoi les données sont-elles si importantes pour les réseaux de neurones ? Si vous ne vous souvenez de rien d'autre sur les réseaux de neurones, vous devriez vous en souvenir, ordures à l'intérieur, ordures à l'extérieur. Au cas où vous ne seriez pas familier avec cette expression, cela signifie essentiellement que si vous utilisez une mauvaise qualité ou des données de déchets, alors vous obtiendrez des résultats de mauvaise qualité ou des ordures. Le réseau de neurones est aussi bon que les données utilisées pour l'entraîner. Pour cette raison, vous voulez éviter autant que possible les choses suivantes lors du choix de vos données que possible, données bruitées, données avec des caractéristiques et des instances corrélées, données avec des valeurs manquantes, des données avec des entités et des instances en double, données avec des valeurs qui ont des ordres de grandeur variables. Données, réseaux de neurones et éthique. Bien que les réseaux de neurones puissent être extrêmement efficaces et utile dans un certain nombre de systèmes, il est important de garder à l'esprit que leurs performances repose fortement sur les données. Plus tôt, nous avons discuté de quelques exemples de données parasites. Cependant, il existe un autre type de données parasites, les données biaisées. Ce type de données ne peut contenir aucune des qualités pour éviter cela ont été discutés précédemment, mais cela peut conduire à des classificateurs et des régresseurs contraires à l'éthique. Les données biaisées sont des données biaisées plus dans le sens d'une classe ou d'une caractéristique particulière. De plus en plus d'utilisations et d'applications de réseaux de neurones impliquant des humains sont explorées et mises en œuvre. De ce fait, les données utilisées pour entraîner les réseaux contient beaucoup d'informations relatives à la démographie tels que la race, l'âge, l'origine ethnique, l'orientation sexuelle et d'autres caractéristiques. Dans les cas où les réseaux sont utilisés classer un certain individu basée sur une, certaines ou toutes ces fonctionnalités, il est facile de créer un réseau qui profile au lieu de classer. Afin d'éviter ces problèmes éthiques, lors de la sélection des données utilisées pour former un modèle, il est important d'avoir des situations égales et idéales ou représentation quasi-égale de toutes les données démographiques dans toutes les classes. Il est important de se rappeler l'importance de la vie privée lors de la sélection des données à utiliser et essayez également dans vos réseaux. Juste parce que vous êtes en mesure d'obtenir des informations concernant une personne ou une entité ne signifie pas qu'ils voudraient que vous utilisiez ces informations pour aider à se classer ou à classer les autres. Voici quelques exemples en Python en utilisant le perceptron monocouche dans l'ensemble de données sur le cancer du sein. Alors d'abord, nous avons juste nos définitions de fonctions. Ensuite, je vais charger l'ensemble de données sur le cancer du sein et impression de la précision. Donc, comme vous pouvez le voir ici, le score au test est d'environ 90, 91%. Et le score de formation est d'environ 92, 93%. Alors maintenant, j'ai des données en double. Et ce que je fais ici, Je suis juste en train de créer un doublon de toutes les fonctionnalités dans l'ensemble de données. Donc au lieu de 30 fonctionnalités, vous avez 60 fonctionnalités, mais il y a deux fonctionnalités identiques pour chaque fonctionnalité. Et maintenant, je vais former à nouveau le modèle. Et ce que vous verrez, ce sont les scores d'entraînement et de test ont tous les deux chuté. Maintenant, c'est particulièrement intéressant parce que je n'introduis pas de nouvelles données, juste plus des mêmes données, pourtant, cela a entraîné une moins bonne performance du classificateur. Ensuite, je vais faire un exemple de données bruyantes. Et dans ce cas, J'ajoute simplement du bruit aléatoire aux données d'entrée. Et puis je vais réentraîner le modèle. Maintenant, comme vous pouvez le voir ici, le score de test et le score de formation ont encore chuté, pas autant qu'avec les données en double, mais c'était quand même une diminution. Une chose importante à noter ici est que l'ensemble de données sur le cancer du sein est un ensemble de données très propre. Ainsi, quelle que soit la pauvreté et le bruit de l'ensemble de données, vous obtiendrez toujours d'assez bons résultats. Mais s'il s'agissait d'un ensemble de données moins propre, qui est probablement ce avec quoi vous travaillerez dans la pratique, alors ces choses pourraient causer une baisse encore plus importante des performances. Et enfin, nous avons un exemple de données corrélées. Donc ici, j'ajoute simplement les mêmes données en les multipliant par un facteur de 2,7. Il s'agit donc en réalité des mêmes données, mises à l'échelle différemment. Et comme vous pouvez le voir, le score des tests a de nouveau chuté, tout comme le score de la formation. Et maintenant je vais juste appliquer tous les résultats pour que vous puissiez voir ce qui s'est passé. Et donc la ligne bleue est pour les résultats des tests et la ligne verte correspond aux résultats de l'entraînement. Donc, comme vous pouvez voir l'original, qui est juste l'ensemble de données propre régulier, pas de doublons, pas de bruit, pas de corrélation, surpasse tous les autres ensembles de données. Ceci conclut cette leçon. Merci.