Neste capítulo, vamos dar uma olhada em anomalias e os métodos de detecção de anomalias mais comuns. A premissa básica por trás das anomalias e a detecção de anomalias é procurar outliers que não se encaixam com o resto dos dados de alguma forma. Então, a maneira mais óbvia de olhar isso é olhar para os elementos que são nos lados extremos do conjunto de dados. Assim, os itens mais baixos, bem como os itens mais altos e isso funciona muito bem se você tiver um conjunto de dados relativamente simples onde cada dimensão é completamente independente uma da outra mas, na realidade, a maioria dos conjuntos de dados que estamos usando têm vários fatores neles e assim os outliers não podem mais ser no tipo de arestas do conjunto de dados. Então, muitos dos algoritmos de detecção de anomalias que vamos usar serão um pouco mais sofisticado e aprofundar os dados de uma forma mais profunda. As anomalias podem ser intencionais e não intencionais. Anomalias intencionais podem ser uma indicação de algo que você, como empresa, pode querer prestar atenção especial. Coisas como fraude geralmente aparecem como anomalias, mas em muitas dos casos, as anomalias que encontramos não são intencionais e, portanto, podem ser evidências de erros de entrada de dados ou erros de coleta de dados ou dados que não foram limpos adequadamente e assim todas essas coisas são relevantes para detecção de anomalias e o motivo pelo qual você quer prestar atenção à detecção de anomalias é que muitas vezes quando você está construindo um modelo, essas anomalias podem afetar negativamente sua modelagem criando um modelo menos preciso. Muitas vezes, quando você está fazendo aprendizado de máquina supervisionado, ter dados anômalos pode ter um impacto descomunal sobre os resultados da modelagem. Então, é algo que você definitivamente quer prestar atenção, independentemente do tipo do aplicativo de aprendizado de máquina que você tem. Em geral, existem dois estilos de métodos que você pode usar para detecção de anomalias, supervisionadas e não supervisionadas. Para detecção supervisionada de anomalias, você precisa ter um conjunto de dados rotulado. Então, você precisa ter um conjunto de dados que tenha uma série de observações que são normais, bem como uma série de observações fraudulentas ou anômalas. Isso permite que você use muitos das diferentes técnicas de modelagem de aprendizado de máquina, como modelagem de classificação para detectar as anomalias. O segundo método está usando métodos de aprendizado de máquina não supervisionados e isso é um pouco diferente porque em vez disso de ter essa variável de resultado rotulada, em vez disso, você está olhando para o próprio conjunto de dados e você está tentando usar a estrutura dos dados para dizer quais casos são normais e quais são outliers. Na maioria das vezes, na prática, são métodos não supervisionados que são usados para detectar anomalias e isso porque geralmente é muito difícil para encontrar conjuntos de dados rotulados com anomalias rotuladas. Então agora você deve ter um pouco de idéia de que tipos de problemas a detecção de anomalias pode resolver e os dois métodos básicos de uma detecção de anomalia que são mais usados na prática.