In diesem Kapitel schauen wir uns an bei einer Reihe von Clustering-Algorithmen und vergleichen Sie, wie sie bei einigen verschiedenen Datensätzen abschneiden. Also die Datensätze, die wir verwenden werden um die verschiedenen Clustering-Algorithmen zu vergleichen einige interessante Eigenschaften haben Wir wollen also sehen, wie sich die verschiedenen Algorithmen verhalten in all diesen unterschiedlichen Situationen. Also, das erste, das wir uns ansehen werden at ist im Wesentlichen zwei konzentrische Kreise. Wenn wir also diesen Datensatz gruppieren wollten, Wir möchten wahrscheinlich, dass jeder Kreis zusammen gruppiert wird. Der zweite ist ähnlich, es sind zwei Monde und so wollen wir wahrscheinlich wieder jeden dieser Monde zusammenzufassen. Der dritte besteht im Wesentlichen aus drei Blobs und jeder von ihnen hat eine andere Varianz. Den kannst du sehen in der Mitte ist im Vergleich etwas breiter zu den anderen beiden, die viel kompakter sind. Das andere ist interessant an diesem Datensatz ist, dass sie nicht getrennt sind wie in den anderen Datensatzbeispielen. Die dritte ist drei Zigarren, also stattdessen eine Art kreisförmigen Blob im Datensatz zu haben, Wir haben diese Art von länglichen Formen. Der dritte besteht aus nur drei ziemlich kompakten Blobs. Und dann ist das letzte im Wesentlichen zufälliges Rauschen, Dieser endgültige Datensatz weist also kein Muster auf. Okay, fangen wir also mit Mini-Batch-K-means an. ein bisschen wissen wir schon über den K-Means-Algorithmus. Eine Möglichkeit, es schneller zu machen, ist stattdessen der Klassifizierung jeder Datenzeile, Jedes Mal, wenn die Zentroide aktualisiert werden, Stattdessen können Sie eine Stichprobe der Daten nehmen und aktualisieren Sie den Schwerpunkt basierend darauf. Es ist also eine enorme Zeitersparnis wenn Sie einen großen Datensatz verwenden in Ihrem Clustering-Problem, obwohl es einen unterschied gibt zwischen den regulären K-Means und den Mini-Batch-K-Means, es ist wirklich ein ziemlich kleiner Unterschied, und so, in dem Fall, in dem Sie einen großen Datensatz haben, der etwas verwendet wie die Mini-Batch-K-Mittel können wirklich wertvoll sein. Hier werden wir in Python einsteigen und wir werden diesen Algorithmus ausführen. Sie können also sehen, dass ich hier habe, Der Code zeichnet alle diese sechs Datensätze die wir für die Klassifizierung verwenden werden und jetzt möchte ich drei verschiedene Dinge tun. Also möchte ich zuerst mein Objekt erstellen zum Ausführen des K-Means. Als nächstes möchte ich die Daten anpassen. Und schließlich möchte ich die Cluster-Ergebnisse grafisch darstellen aus den Daten, damit wir sehen können, wie es funktioniert auf den verschiedenen Datensätzen. Okay, also mal sehen, wie das funktioniert. Sie können sehen, dass unser Mini-Batch K-means gut abschneidet auf unserem Datensatz mit drei Blobs, aber das ist wirklich das einzige, das klassifiziert so wie wir es wollen. Aber denken Sie daran, dass K-Aussehen bedeutet in den Regionen um die Schwerpunkte und so, anstatt die verbundenen Muster zu finden da drin sieht es aus bei denen diese innerhalb einer Region dicht beieinander liegen und Ignorieren von Orten, an denen Daten spärlich sind. Sie können also sehen, dass es keine findet der Muster, in den zwei Kreisen, zum Beispiel, es geht nicht darum, die Muster mit den drei Zigarren zu finden und es geht nur darum, das Muster wirklich zu finden im Zwei-Monde-Datensatz, weil sie sortiert sind schon etwas räumlich getrennt also, es ist wirklich eine Art falsches mittelmäßiges Ergebnis in diesem Fall. Die andere Sache, die Sie definitiv bemerken sollten, ist dass selbst wenn wir die drei ungleichen Blobs haben, es macht einen vernünftigen Job, diese drei Cluster zu finden, aber Sie können das im Fall des orangefarbenen Clusters sehen, es blutet irgendwie in diesen großen mittleren Cluster. Das sollten Sie also auf jeden Fall behalten Denken Sie daran, wenn Sie K-Means verwenden dass es nicht nach Orten sucht, an denen die Daten spärlich sind um den Cluster zu bilden. Es verwendet nur diese Schwerpunkte um zu bestimmen, wo die Cluster beginnen und enden und aus diesem grund Sie können ein bisschen seltsame Dinge passieren auf Art der Außenseite dieser Cluster. Jetzt solltest du also eine Idee haben wie Mini-Batch-K-Means bei einigen funktionieren können unserer Beispieldatensätze, Orte, an denen es gut funktioniert und Orte, wo es nicht so gut funktioniert.