Bem-vindo ao curso da KnowledgeCity em aprendizado de máquina, e métodos de aprendizado de máquina supervisionados. Nestas lições, você aprenderá sobre Modelos de mistura gaussiana, agrupamento, incluindo k-means, varredura de banco de dados e óptica, e aprendizagem múltipla, incluindo isomap, dimensionamento multidimensional, e incorporação de vizinhos estocásticos t-distribuídos. Esta lição será sobre modelos de mistura gaussianas onde você aprenderá o que é um modelo de mistura gaussiana, como eles são usados e como eles são implementados? O modelo de mistura gaussiana é um tipo de modelo probabilístico que assume todos os pontos dentro de um conjunto de dados são gerados a partir de um número finito de distribuições gaussianas. Pode ser visto como uma forma de agrupar seus dados de tal forma que cada cluster tenha uma distribuição gaussiana. Isso permitirá identificar qual cluster um ponto desconhecido pertence a com alto nível de confiança. Como os modelos de mistura gaussiana são usados? Normalmente, eles são usados para representar subpopulações dentro de uma população geral. Eles também são capazes de aprender automaticamente subpopulações sem ter qualquer indicação de qual subpopulação um determinado ponto pode pertencer. A seguir, veremos como os modelos de mistura gaussiana são implementados em Python. Isso está usando o pacote scikit-learn, e aqui, vou mostrar um exemplo de agrupamento, e depois vou mostrar como ficam as distribuições para cada um dos agrupamentos. Então tudo que estou fazendo aqui é importar meus pacotes, e então estou criando um conjunto de dados de círculos barulhentos, que você verá exatamente como é em breve. Então o que temos aqui são dois círculos. Eles são feitos de, você sabe, 5.000 pontos no total. E aqui estou definindo o modelo de mistura. E para n componentes aqui, é apenas o número de componentes, e então basicamente o que isso significa é, porque estou usando isso como uma técnica de agrupamento aqui, haverá dois clusters ou duas subpopulações que são detectadas ou definidas. Agora que está feito, vou traçar os dois clusters. E assim, como você pode ver aqui, o modelo de mistura gaussiana separou os círculos diagonalmente aqui, em vez de um círculo interno e um círculo externo. E agora que temos isso, Eu só quero te mostrar... Uma comparação. Então, aqui temos os dados completos da população, e aqui temos os dados da subpopulação. Então a ideia aqui é que porque este é um modelo de mistura gaussiana, o modelo deu o seu melhor para que os dados em azul e os dados em verde ambos têm distribuições gaussianas. E para verificar isso, Vou traçar essas distribuições. E assim, como você pode ver aqui, ambas as distribuições são iguais. Na verdade, eles são apenas reflexos um do outro, e eles não são perfeitamente gaussianos, mas eles têm a forma geral de uma distribuição gaussiana. E entao, duas coisas para saber sobre isso. Primeiro, os dados não foram realmente distribuídos de forma gaussiana, certo? E entao, o que o algoritmo fez foi tirar o melhor, você sabe, divisão dos dados, ou, você sabe, cluster de dados que chegaria o mais perto possível à distribuição gaussiana. Se esses dados fossem realmente distribuídos de forma gaussiana, ou mesmo se tivéssemos mais pontos, essas parcelas seriam mais parecidas as curvas de distribuição gaussianas que estamos acostumados a ver. Então, isso conclui esta lição, e em seguida, vamos discutir clustering. Obrigada.