Willkommen beim Kurs von KnowledgeCity zum maschinellen Lernen, und überwachte maschinelle Lernverfahren. In diesen Lektionen erfahren Sie mehr über Gaußsche Mischungsmodelle, Clustering, einschließlich k-means, DB-Scan und Optik, und vielfältiges Lernen, einschließlich Isomap, mehrdimensionale Skalierung, und t-verteilte stochastische Nachbareinbettung. Diese Lektion wird sich mit Gaußschen Mischungsmodellen befassen wo Sie lernen, was ein Gaußsches Mischungsmodell ist, Wie werden sie verwendet und wie werden sie implementiert? Das Gaußsche Mischungsmodell ist eine Art Wahrscheinlichkeitsmodell die alle Punkte innerhalb eines Datensatzes annimmt werden aus einer endlichen Zahl erzeugt von Gaußschen Verteilungen. Es kann als eine Möglichkeit angesehen werden, Ihre Daten zu gruppieren so, dass jeder Cluster eine Gaußsche Verteilung hat. Dadurch wird es möglich, den Cluster zu identifizieren ein unbekannter Punkt gehört dazu mit einem hohen Maß an Selbstvertrauen. Wie werden Gaußsche Mischungsmodelle verwendet? Typischerweise werden sie verwendet, um normalverteilt darzustellen Teilpopulationen innerhalb einer Gesamtpopulation. Sie sind auch in der Lage, automatisch zu lernen Subpopulationen ohne Anzeichen zu welcher Subpopulation ein bestimmter Punkt gehören kann. Als nächstes werden wir uns mit Gaußschen Mischungsmodellen befassen sind in Python implementiert. Dies verwendet das Paket scikit-learn, und hier zeige ich ein Clustering-Beispiel, und dann werde ich Ihnen zeigen, wie die Verteilungen aussehen für jeden der Cluster. Alles, was ich hier tue, ist also, meine Pakete zu importieren, und dann erstelle ich einen Datensatz mit lauten Kreisen, wie das genau aussieht, sehen Sie in Kürze. Was wir hier also haben, sind zwei Kreise. Sie bestehen nur aus, weißt du, Insgesamt 5.000 Punkte. Und hier definiere ich das Mischungsmodell. Und für n Komponenten hier, Es ist nur die Anzahl der Komponenten, und im Grunde bedeutet das, weil ich es hier als Clustering-Technik verwende, Es wird zwei Cluster geben oder zwei Subpopulationen, die erkannt oder definiert werden. Nachdem das erledigt ist, werde ich die beiden Cluster zeichnen. Und so, wie Sie hier sehen können, das Gaußsche Mischungsmodell getrennt die Kreise hier diagonal, statt Innenkreis und Außenkreis. Und jetzt, wo wir das haben, Ich will dir nur zeigen... Ein Vergleich. Hier haben wir also die vollständigen Bevölkerungsdaten, und dann haben wir hier die Subpopulationsdaten. Die Idee hier ist also, weil dies ist ein Gaußsches Mischungsmodell, Das Modell hat sein Bestes gegeben so dass die Daten blau und die Daten grün sind beide haben Gaußsche Verteilungen. Und um das zu überprüfen, Ich werde diese Verteilungen plotten. Und so, wie Sie hier sehen können, Beide Distributionen sind gleich. Tatsächlich sind sie nur Spiegelungen voneinander, und sie sind nicht perfekt Gaußsch, aber sie haben die allgemeine Form einer Gaußschen Verteilung. Und so, zwei Dinge, die man darüber wissen sollte. Erstens waren die Daten nicht wirklich Gauß-verteilt, richtig? Und so, Was der Algorithmus tat, war das Beste zu nehmen, Weißt du, Split der Daten, oder, Sie wissen schon, Cluster von Daten das würde es so nah bringen wie möglich an die Gaußsche Verteilung. Wenn diese Daten tatsächlich Gauß-verteilt waren, oder selbst wenn wir mehr Punkte hätten, Diese Plots würden eher so aussehen die Gaußschen Verteilungskurven, die wir gewohnt sind zu sehen. Damit ist diese Lektion abgeschlossen, Als nächstes werden wir Clustering besprechen. Danke.