Bienvenue dans le cours de KnowledgeCity sur l'apprentissage automatique, et les méthodes d'apprentissage automatique supervisé. Dans ces leçons, vous apprendrez Modèles de mélanges gaussiens, clustering, y compris k-means, DB scan et optique, et apprentissage multiple, y compris isomap, Échelle multidimensionnelle, et l'intégration de voisins stochastiques à distribution t. Cette leçon va être sur les modèles de mélange gaussiens où vous apprendrez ce qu'est un modèle de mélange gaussien, comment sont-ils utilisés et comment sont-ils mis en œuvre ? Le modèle de mélange gaussien est un type de modèle probabiliste qui suppose tous les points d'un ensemble de données sont générés à partir d'un nombre fini de distributions gaussiennes. Il peut être considéré comme un moyen de regrouper vos données de manière à ce que chaque cluster ait une distribution gaussienne. Cela permettra d'identifier quel cluster un point inconnu appartient à avec un haut niveau de confiance. Comment les modèles de mélange gaussiens sont-ils utilisés ? En règle générale, ils sont utilisés pour représenter normalement distribué sous-populations au sein d'une population globale. Ils sont également capables d'apprendre automatiquement sous-populations sans indication à quelle sous-population un point particulier peut appartenir. Ensuite, nous allons voir comment les modèles de mélange gaussien sont implémentés en Python. Ceci utilise le paquet scikit-learn, et ici, je vais montrer un exemple de clustering, et ensuite je vais vous montrer à quoi ressemblent les distributions pour chacun des clusters. Donc, tout ce que je fais ici, c'est importer mes packages, puis je crée un ensemble de données de cercles bruyants, dont vous verrez exactement à quoi cela ressemble sous peu. Nous avons donc ici deux cercles. Ils sont juste constitués de, vous savez, 5 000 points au total. Et ici, je définis le modèle de mélange. Et pour n composantes ici, c'est juste le nombre de composants, et donc fondamentalement ce que cela signifie est, parce que je l'utilise ici comme technique de regroupement, il va y avoir deux clusters ou deux sous-populations détectées ou définies. Alors maintenant que c'est fait, je vais tracer les deux clusters. Et donc, comme vous pouvez le voir ici, le modèle de mélange gaussien séparé les cercles en diagonale ici, au lieu d'un cercle intérieur et d'un cercle extérieur. Et maintenant que nous avons ceci, Je veux juste te montrer... Une comparaison. Nous avons donc ici les données complètes sur la population, et puis ici nous avons les données de sous-population. Donc l'idée ici est que parce que c'est un modèle de mélange gaussien, le modèle a fait de son mieux de sorte que les données bleues et les données vertes les deux ont des distributions gaussiennes. Et donc pour vérifier ça, Je vais tracer ces distributions. Et donc, comme vous pouvez le voir ici, les deux distributions sont identiques. En fait, ils ne sont que le reflet l'un de l'autre, et ils ne sont pas parfaitement gaussiens, mais ils ont la forme générale d'une distribution gaussienne. Et donc, deux choses à savoir à ce sujet. Premièrement, les données n'étaient pas réellement distribuées gaussiennes, n'est-ce pas ? Et donc, ce que l'algorithme a fait était de prendre le meilleur, vous savez, fractionnement des données, ou, vous savez, un groupe de données ce serait aussi proche à la distribution gaussienne que possible. Si ces données étaient en fait distribuées gaussiennes, ou même si nous avions plus de points, ces parcelles ressembleraient plus à les courbes de distribution gaussiennes que nous avons l'habitude de voir. Ceci conclut donc cette leçon, et ensuite, nous allons discuter du regroupement. Merci.