En este capítulo, vamos a ver en una serie de algoritmos de agrupamiento y compare cómo se desempeñan en algunos conjuntos de datos diferentes. Así que los conjuntos de datos que vamos a usar para comparar los diversos algoritmos de agrupamiento tiene algunas propiedades interesantes y lo que queremos hacer es ver cómo funcionan los diversos algoritmos en todos estos diferentes tipos de situaciones. Entonces, el primero que vamos a mirar Es esencialmente dos círculos concéntricos. Entonces, probablemente si quisiéramos agrupar este conjunto de datos, probablemente querríamos tener cada grupo de círculos juntos. La segunda es parecida, son dos lunas. y así, de nuevo, probablemente queramos para agrupar cada una de esas lunas juntas. El tercero es esencialmente tres gotas. y cada uno de ellos tiene una varianza diferente. Puedes ver el en el medio está un poco más disperso en comparación a los otros dos que son mucho más compactos. Lo otro que es interesante sobre este conjunto de datos es que no están separados como están en los otros ejemplos de conjuntos de datos. El tercero son tres cigarros, así que en vez de tener una especie de blob de tipo circular en el conjunto de datos, tenemos este tipo de formas alargadas. El tercero es solo tres gotas bastante compactas. Y luego el último es esencialmente ruido aleatorio, por lo que no hay patrón para este conjunto de datos final. Bien, empecemos con las medias K de los minilotes. ya sabemos un poco sobre el algoritmo de K-medias. En cambio, una forma de hacerlo más rápido es de clasificar cada fila de datos, cada vez que se actualizan los centroides, en su lugar, puede tomar una muestra de los datos y actualice el centroide basado en eso. Por lo tanto, es un gran ahorro de tiempo. cuando está utilizando un gran conjunto de datos en su problema de agrupamiento, aunque hay una diferencia entre las medias K normales y las medias K de minilotes, es realmente una especie de diferencia bastante leve, y entonces, en el caso de que tenga un gran conjunto de datos usando algo como el mini-lote K-means puede ser realmente valioso. Aquí vamos a entrar en Python y vamos a ejecutar este algoritmo. Entonces, puedes ver que tengo aquí, el código está dibujando todos estos seis conjuntos de datos que vamos a utilizar para la clasificación y ahora lo que quiero hacer son tres cosas diferentes. Entonces, primero, quiero crear mi objeto. para ejecutar las K-medias. A continuación, quiero ajustar los datos. Y finalmente, quiero graficar los resultados del grupo de los datos para que podamos ver cómo funciona sobre los diferentes conjuntos de datos. Bien, entonces veamos cómo funciona esto. Puede ver que nuestro mini-lote K-means funciona bien en nuestro conjunto de datos de tres blobs, pero ese es realmente el único que está clasificando en la forma que queramos. Pero recuerda que K significa apariencia en las regiones alrededor de los centroides y así, en lugar de encontrar los patrones conectados ahí dentro está mirando en cuáles están muy juntos dentro de una región e ignorar lugares donde hay escasez de datos. Entonces puedes ver que no está encontrando ninguna de los patrones, en los dos círculos, por ejemplo, es no encontrar los patrones con los tres puros y es solo encontrar el patrón en el conjunto de datos de dos lunas porque son una especie de algo separados en el espacio ya entonces, es realmente una especie de falso resultado regular en ese. La otra cosa a notar definitivamente es que incluso cuando tenemos las tres gotas desiguales, está haciendo un trabajo razonable al encontrar esos tres grupos, pero se puede ver que en el caso del racimo naranja, es una especie de sangrado en ese grupo medio grande. Así que eso es algo que definitivamente deberías conservar. en mente cuando estás usando K-means es que no busca en lugares donde los datos son escasos para formar el racimo. Solo usa esos centroides. para determinar dónde comienzan y terminan los grupos y por eso, puedes hacer que sucedan un poco de cosas extrañas en una especie de exterior de esos grupos. Así que ahora deberías tener una idea. de cómo los K-means de minilotes pueden funcionar en algunos de nuestros conjuntos de datos de ejemplo, lugares donde funciona bien y lugares donde no funciona tan bien.