En este capítulo, pasaremos por el algoritmo K-means, cuál es el algoritmo de agrupamiento más común que es probable que utilice en la práctica. Ahora, el nombre K-means probablemente le dará un poco de intuición sobre cómo funciona este algoritmo, pero analicémoslo en detalle. Entonces, primero, elige un cierto número de centroides. Entonces, la cantidad de clústeres que elijas es algo que vamos a investigar con un poco más de detalle, pero una de las cosas que debes reconocer es que tienes que especificar realmente el número de clústeres. Así que tienes que decidir qué valor toma K. Entonces, ¿son dos grupos, cinco grupos, 15 grupos? Esta es una elección que tendrá que hacer cuando está ejecutando K-means en sus datos. Así que primero comenzamos eligiendo un número específico de centroides para empezar. Ahora, puede elegir la ubicación de los centroides. ser al azar, o puedes usar un algoritmo específico para decidir dónde comenzar sus centroides. Por lo general, elegirlos con un algoritmo específico hace un mejor trabajo al encontrar clústeres estables, pero puede que no tengas el lujo de poder ejecutar algo que puede llevar mucho tiempo en sus datos primero. Así que simplemente puede elegirlos al azar. Entonces, para cada caso, lo que queremos hacer es colocar ese caso en el grupo con el centroide más cercano. Entonces miras los datos en ese caso específico, determinar a qué centroide está más cercano, y luego vincularlo con ese centroide específico. Repite esto para cada caso en el conjunto de datos. Y luego, al final, actualizar los centroides para que sean el promedio de los puntos de datos dentro de cada grupo. Entonces puedes ver que K es el número de grupos, y luego la media se refiere a tomar el promedio de todos los casos para formar los nuevos centroides. Después de revisar el conjunto de datos una vez, lo que quieres hacer es repetir estos pasos continuamente hasta que los centroides se estabilicen y lleguen a la convergencia. Aquí hay una animación que muestra el algoritmo K-means en acción. Puedes ver que inicialmente elige tres centroides al azar. Ahora, el azul y el amarillo en realidad están bastante juntos. Así que al principio, el grupo azul es en realidad bastante pequeño y el racimo amarillo es mucho más grande. el racimo naranja, porque el centroide comienza bastante lejos de los otros dos centroides, es realmente muy grande al principio. Pero a medida que continuamos actualizando los centroides, el racimo naranja se hace cada vez más pequeño. Este conjunto de datos se llama conjunto de datos de Mickey Mouse, y probablemente puedas averiguar por qué. Esencialmente, se compone de tres gotas, una especie de uno más grande en el medio en la parte inferior, y luego dos más pequeños que son algo que parece un poco como Mickey Mouse y sus orejas. Así que algunas cosas a tener en cuenta sobre el proceso de ejecutar las K-medias. Entonces puedes ver que hace un trabajo bastante bueno. de clasificar los blobs que esperaríamos juntos. Así que los casos en la oreja derecha están aproximadamente juntos, los de la oreja izquierda, de nuevo, están aproximadamente juntos, y luego los de la cara redonda también se agrupan. Pero en este caso, en realidad hay un montón de casos que probablemente, si lo hiciéramos con solo mirarlo y deduciendo el patrón, probablemente lo pondríamos con cada una de las orejas. Así que recuerda esto cuando estés pensando en la intuición alrededor de K-medias, porque en este caso, en este conjunto de datos, lo que tenemos son grupos que tienen variantes desiguales. Y el algoritmo K-means realmente tiene problemas con tener grupos que tienen diferentes varianzas, porque cuando estamos haciendo el cálculo, asumimos que la varianza es igual dentro de cada uno de los K clusters que hemos elegido. Ahora, este ejemplo es solo en las dimensiones X e Y. Así que en realidad solo hay dos variables que se agrupan. Pero casi todo el agrupamiento que hará estará en un número mucho mayor de dimensiones. Así que puedes tener un puñado, o incluso una docena, o dos docenas de variables que está utilizando para formar sus grupos. Entonces, el algoritmo K-means hace una función de tipo análoga, excepto en dimensiones superiores. Entonces, en lugar de mover los centroides dentro de ese plano X e Y, en realidad está moviendo el centroide sin embargo, en las dimensiones que tiene como variables de entrada. Así que podría ser hasta unas pocas docenas de variables. Entonces, hay algunas razones por las que K significa es el algoritmo más popular. La primera es que es relativamente sencillo. y bastante fácil de programar. Así que no necesitamos muchos pasos para entender cómo agrupar las diferentes filas juntas y cómo actualizar el centro del clúster. Lo que eso significa es que es bastante sencillo. para entender cómo se mueven los centroides y poder interpretarlos cuando queremos entender y describir los clusters que hemos creado. Así que ahora deberías tener una intuición sobre cómo funciona el algoritmo K-means en la práctica y la forma en que los centroides se actualizan a través del tiempo, así como la razón por la que este algoritmo se llama K-means.