In diesem Kapitel werden wir einen Blick darauf werfen bei Anomalien und den gängigsten Methoden zur Erkennung von Anomalien. Die Grundvoraussetzung hinter Anomalien und die Anomalieerkennung besteht darin, nach Ausreißern zu suchen, die nicht passen mit den restlichen Daten in irgendeiner Weise. Also die naheliegendste Art zu schauen Dabei geht es darum, die Elemente zu betrachten, die sind an den äußersten Seiten des Datensatzes. Also sowohl die niedrigsten als auch die höchsten Gegenstände und das funktioniert ziemlich gut wenn Sie einen relativ einfachen Datensatz haben wo jede Dimension völlig unabhängig voneinander ist aber in Wirklichkeit die meisten Datensätze die wir verwenden, haben eine Reihe von Faktoren in sich und so können die Ausreißer nicht mehr sein an der Art der Kanten des Datensatzes. Also viele der Anomalieerkennungsalgorithmen die wir verwenden werden etwas raffinierter und tiefer in die Daten eintauchen. Anomalien können sowohl beabsichtigt als auch unbeabsichtigt sein. Absichtliche Anomalien könnten ein Hinweis sein von etwas, das Sie als Unternehmen besondere Aufmerksamkeit schenken möchten. Dinge wie Betrug zeigen sich oft als Anomalien, aber in vielen In den meisten Fällen sind die von uns gefundenen Anomalien unbeabsichtigt und so können sie Hinweise auf Dateneingabefehler sein oder Datenerfassungsfehler oder Daten, die nicht ganz richtig bereinigt wurden und so sind all diese Dinge relevant zur Anomalieerkennung und den Grund, warum Sie darauf achten möchten zur Anomalieerkennung ist das oft Wenn Sie ein Modell bauen, diese Anomalien können Ihre Modellierung negativ beeinflussen durch Erstellen eines Modells, das weniger genau ist. Wenn Sie überwachtes maschinelles Lernen durchführen, anormale Daten zu haben, kann übergroße Auswirkungen haben auf den Modellierungsergebnissen. Also, es ist etwas, was Sie definitiv wollen zu beachten, egal welcher Art der Anwendung für maschinelles Lernen, die Sie haben. Im Großen und Ganzen gibt es zwei Arten von Methoden, die Sie verwenden können zur Erkennung von Anomalien, überwacht und unüberwacht. Für die überwachte Erkennung von Anomalien, Sie müssen einen beschrifteten Datensatz haben. Sie benötigen also einen Datensatz mit einer Reihe von Beobachtungen, die normal sind, sowie eine Reihe von Beobachtungen, die betrügerisch oder anderweitig anormal sind. Mit dieser Erlaubnis können Sie viele verwenden der verschiedenen Machine-Learning-Modellierungstechniken, wie Klassifikationsmodellierung um die Anomalien zu erkennen. Die zweite Methode verwendet unüberwachte maschinelle Lernverfahren und das ist ein wenig anders, weil stattdessen stattdessen diese beschriftete Ergebnisvariable zu haben, Sie betrachten den Datensatz selbst und Sie versuchen, die Struktur der Daten zu verwenden um zu sagen, welche Fälle normal sind und welche Ausreißer sind. In der Praxis sind es meistens unüberwachte Methoden die zur Erkennung von Anomalien verwendet werden und das liegt daran, dass es normalerweise wirklich schwierig ist um beschriftete Datensätze zu finden, die beschriftete Anomalien aufweisen. So, jetzt sollten Sie eine kleine Vorstellung haben welche Art von Problemen die Anomalieerkennung lösen kann und die beiden grundlegenden Methoden zur Erkennung von Anomalien die in der Praxis am häufigsten verwendet werden.