En este capítulo, vamos a echar un vistazo en anomalías y los métodos de detección de anomalías más comunes. La premisa básica detrás de las anomalías y la detección de anomalías es buscar valores atípicos que no encajan con el resto de los datos de alguna manera. Así que la forma más obvia de mirar esto es mirar los elementos que son en los lados extremos del conjunto de datos. Entonces, los artículos más bajos, así como los artículos más altos y esto funciona bastante bien si tiene un conjunto de datos relativamente simple donde cada dimensión es completamente independiente entre sí pero en realidad, la mayoría de los conjuntos de datos que estamos usando tienen una serie de factores en ellos y por lo que los valores atípicos ya no pueden ser en el tipo de bordes del conjunto de datos. Muchos de los algoritmos de detección de anomalías que vamos a usar van a ser un poco más sofisticado y profundizar en los datos de una manera más profunda. Las anomalías pueden ser tanto intencionales como no intencionales. Las anomalías intencionales pueden ser una indicación de algo que usted, como empresa, puede desear prestar especial atención a. Cosas como el fraude a menudo aparecen como anomalías, pero en muchos casos de los casos, las anomalías que encontramos son involuntarias y por lo que pueden ser evidencia de errores de entrada de datos o errores de recopilación de datos o datos que no se han limpiado correctamente y entonces todas estas cosas son relevantes a la detección de anomalías y la razón por la que quieres prestar atención a la detección de anomalías es que a menudo cuando estás construyendo un modelo, esas anomalías pueden afectar negativamente su modelado mediante la creación de un modelo que es menos preciso. A menudo, cuando realiza aprendizaje automático supervisado, tener datos anómalos puede tener un impacto enorme en los resultados del modelado. Entonces, es algo que definitivamente quieres prestar atención a, independientemente de qué tipo de la aplicación de aprendizaje automático que tiene. En términos generales, hay dos estilos de métodos que puede utilizar para la detección de anomalías, supervisadas y no supervisadas. Para la detección supervisada de anomalías, necesita tener un conjunto de datos etiquetado. Por lo tanto, debe tener un conjunto de datos que tenga una serie de observaciones que son normales, así como una serie de observaciones que son fraudulentas o anómalas. Este permiso le permite usar muchos de las diferentes técnicas de modelado de aprendizaje automático, como el modelado de clasificación para detectar las anomalías. El segundo método es usando métodos de aprendizaje automático no supervisados y esto es un poco diferente porque en cambio de tener esa variable de resultado etiquetada, en cambio, estás mirando el conjunto de datos en sí y estás tratando de usar la estructura de los datos para saber qué casos son normales y cuáles son atípicos. La mayoría de las veces, en la práctica, son métodos no supervisados. que se utilizan para detectar anomalías y eso es porque suele ser muy difícil para encontrar conjuntos de datos etiquetados que tengan anomalías etiquetadas. Así que ahora deberías tener una pequeña idea. de qué tipos de problemas puede resolver la detección de anomalías y los dos métodos básicos de detección de anomalías que se utilizan con más frecuencia en la práctica.