Hace unos meses empecé a trabajar en un proyecto donde necesitaba agrupar clientes con comportamientos similares, y me decidí por usar un algoritmo de clustering jerárquico. La parte teórica la tenía clara, pero al aplicarlo a los datos reales me encontré con algo que no esperaba: los resultados cambiaban mucho cada vez que introducía unas pocas muestras nuevas, incluso después de haber normalizado todo cuidadosamente. Me ha dejado pensando si el problema está en mi entendimiento de la estabilidad de estos modelos o si es algo inherente al método con datos tan volátiles como los de ventas.
|
Qué tan estable es el clustering jerárquico con datos volátiles?
|
|
Entiendo esa sensación de subir y bajar las agrupaciones. La estabilidad del agrupamiento jerárquico parece volátil cuando añades unas pocas muestras nuevas.
Quizá la volatilidad de ventas hace que las distancias entre muestras cambien y eso modifique los dendrogramas. La estabilidad depende de la forma en que defines la similitud y de la normalización.
A veces parece que buscas un pegamento entre clientes que no existe. La estabilidad del agrupamiento jerárquico ordena por relaciones y se desordena con muestras nuevas.
Promete estabilidad pero en ventas reales parece pedir milagros. Quizá el clustering jerárquico no es la herramienta adecuada para este tipo de datos.
Una idea para revisar la robustez es hacer bootstrap de las muestras y ver cuántos clusters se mantienen. Observa la variabilidad entre ejecuciones.
¿Y si el problema no es la estabilidad sino qué defines como similar entre clientes?
|
|
« Tema anterior | Tema siguiente »
|

