Clustering, o análisis de clusters, es un método de aprendizaje no supervisado utilizado en análisis de datos y Machine Learning que organiza los datos para que los puntos de datos de un mismo grupo (o cluster) sean más similares entre sí que con respecto a los de otros grupos. Clustering ayuda a comprender grandes conjuntos de datos complejos, ya que revela patrones y tendencias, o realiza predicciones sobre datos no etiquetados.
El clustering es un método de aprendizaje no supervisado que agrupa los datos de modo que los puntos de un mismo grupo sean más similares entre sí que a los de otros grupos, lo que permite descubrir patrones y tendencias en datos no etiquetados.
El clustering es una técnica no supervisada que agrupa datos no etiquetados según su similitud, mientras que la clasificación es un método de aprendizaje supervisado que utiliza datos etiquetados para asignar categorías.
Los algoritmos de clustering más comunes incluyen clustering jerárquico, k-means, modelos de mezcla gaussiana, DBSCAN, mapas autoorganizados, clustering espectral, modelos ocultos de Markov y fuzzy c-means.
El clustering duro asigna cada punto de datos a un solo clúster (como k-means), mientras que el clustering suave permite que cada punto de datos pertenezca a varios clústeres con distintos grados de pertenencia (como los modelos de mezcla gaussiana).
El clustering se utiliza para la compresión de datos, la segmentación de imágenes y datos LiDAR, la detección de anomalías, la imagen médica (detección de tumores y segmentación de tejidos), los sistemas de información geográfica y el análisis de secuencias genéticas en bioinformática.
MATLAB proporciona funciones integradas para los principales algoritmos de clustering, herramientas interactivas como la tarea Cluster Data en el Live Editor y la aplicación Data Cleaner, capacidades de visualización y métodos de evaluación como el análisis de la silueta para determinar el número óptimo de clústeres.
Se pueden utilizar criterios como la estadística gap o el análisis de la silueta para evaluar la calidad de los clústeres y visualizar los resultados mediante herramientas como los dendrogramas.
Sí, el clustering puede utilizarse para segmentar imágenes agrupando regiones de píxeles según similitudes de color o forma. Se aplica, por ejemplo, en la imagen médica para la detección de tumores y en sistemas geográficos para la clasificación del uso del suelo.
Recursos
Amplíe sus conocimientos con documentación, ejemplos, vídeos y mucho más.