Dans ce chapitre, on va regarder à un certain nombre d'algorithmes de clustering et comparez leurs performances sur quelques ensembles de données différents. Ainsi, les ensembles de données que nous allons utiliser comparer les différents algorithmes de clustering ont des propriétés intéressantes et donc ce que nous voulons faire, c'est voir comment les différents algorithmes fonctionnent dans tous ces différents types de situations. Donc, le premier que nous allons regarder at est essentiellement deux cercles concentriques. Donc, probablement si nous voulions regrouper cet ensemble de données, nous voudrions probablement que chaque cercle soit regroupé. La deuxième est similaire, c'est deux lunes et donc, encore une fois, nous voulons probablement pour regrouper chacune de ces lunes ensemble. Le troisième est essentiellement trois gouttes et chacun d'eux a une variance différente. Vous pouvez voir celui au milieu est un peu plus étalé par rapport aux deux autres qui sont beaucoup plus compacts. L'autre chose qui est intéressante à propos de cet ensemble de données est qu'ils ne sont pas séparés comme ils le sont dans les autres exemples de jeux de données. Le troisième est trois cigares, donc à la place d'avoir une sorte de blob de type circulaire dans l'ensemble de données, nous avons ce genre de formes allongées. Le troisième n'est que trois gouttes assez compactes. Et puis le dernier est essentiellement un bruit aléatoire, il n'y a donc pas de modèle dans cet ensemble de données final. D'accord, commençons par les mini-lots K-means. nous savons déjà un peu à propos de l'algorithme des K-moyennes. Une façon de le rendre plus rapide est à la place de classer chaque ligne de données, chaque fois que les centroïdes sont mis à jour, à la place, vous pouvez prendre un échantillon des données et mettre à jour le centroïde en fonction de cela. C'est donc un énorme gain de temps lorsque vous utilisez un grand ensemble de données dans votre problème de clustering, bien qu'il y ait une différence entre les K-means réguliers et les K-means mini-batch, c'est vraiment une petite différence, et donc, dans le cas où vous avez un grand ensemble de données en utilisant quelque chose comme le mini-lot K-means peut être vraiment précieux. Ici, nous allons entrer dans Python et nous allons exécuter cet algorithme. Donc, vous pouvez voir que j'ai ici, le code dessine tous ces six ensembles de données que nous allons utiliser pour la classification et maintenant ce que je veux faire, c'est trois choses différentes. Donc, d'abord, je veux créer mon objet pour exécuter le K-means. Ensuite, je veux ajuster les données. Et puis enfin, je veux représenter graphiquement les résultats du cluster à partir des données afin que nous puissions voir comment cela fonctionne sur les différents jeux de données. Bon, voyons comment cela fonctionne. Vous pouvez voir que notre mini-lot K-means se porte bien sur notre ensemble de données de trois blobs, mais c'est vraiment le seul qui classe dans le sens que nous voudrions. Mais rappelez-vous que K-signifie qu'il a l'air dans les régions autour des centroïdes et donc, au lieu de trouver les motifs connectés là-dedans, ça regarde à laquelle sont proches les uns des autres dans une région et en ignorant les endroits où il y a peu de données. Donc vous pouvez voir qu'il n'en trouve pas des motifs, dans les deux cercles, par exemple, ce n'est pas trouver les motifs avec les trois cigares et ce n'est vraiment que de trouver le modèle dans le jeu de données des deux lunes parce qu'elles sont triées de quelque peu séparés dans l'espace déjà donc, c'est vraiment une sorte de faux résultat moyen dans celui-là. L'autre chose à remarquer est certainement que même lorsque nous avons les trois gouttes inégales, il fait un travail raisonnable pour trouver ces trois clusters, mais vous pouvez voir que dans le cas du cluster orange, ça saigne en quelque sorte dans ce grand groupe central. C'est donc quelque chose que vous devez absolument garder à l'esprit lorsque vous utilisez K-means est qu'il ne regarde pas les endroits où les données sont rares pour former le cluster. Il n'utilise que ces centroïdes afin de déterminer où les clusters commencent et finissent et pour cette raison, vous pouvez obtenir un peu de choses étranges en quelque sorte à l'extérieur de ces grappes. Alors maintenant, vous devriez avoir une idée de la façon dont les mini-lots K-means peuvent fonctionner sur quelques de nos exemples de jeux de données, des endroits où ça marche bien et les endroits où ça ne marche pas aussi bien.