TECNOLOGÍA

Compártelo

Proceso del Data Mining

“Data Mining es una parte de un proceso de rango superior: el descubrimiento del conocimiento. Sin embargo, Data Mining es un proceso en sí mismo, que a su vez consta de varias fases.”

Recomendación previa, leer:

Origen del Data Mining

Fases de Data Mining

Como se ha comentado anteriormente, Data Mining es una parte de un proceso de rango superior: el descubrimiento del conocimiento. Sin embargo, Data Mining es un proceso en sí mismo, que a su vez consta de varias fases.

Vamos a tomar como referencia el modelo CRISP (se denomina así por sus siglas en inglés Cross Industry Standard Process) de proceso de Data Mining.

Este modelo proporciona la descripción del ciclo de vida del proyecto de Data Mining, las fases de este proyecto, las tareas respectivas a cada fase y las distintas relaciones entre ellas.

El ciclo de vida del proyecto de minería de datos consiste en seis fases: comprensión del negocio, comprensión de los datos, preparación de datos, modelado, evaluación y despliegue.

ciclo-de-vida-del-data-mining

En este nivel de descripción, no es posible identificar todas las relaciones, sin embargo, es importante señalar que el movimiento reiterativo entre fases diferentes es importante para asegurar una visión de conjunto, es decir, como existe una dependencia entre las fases y los resultados producidos en ellas, tras completar las tareas de cada fase es necesario comprobar su impacto en el resto para mantener la coherencia del proceso.

Las relaciones pueden existir entre cualquier fase o tarea del proceso de minería de datos, variando de acuerdo a los objetivos del proceso, el contexto del mismo o por el interés del usuario sobre los datos.

De forma similar a lo comentado anteriormente, la minería de datos no se termina una vez que la solución es desplegada. Las informaciones ocultas que se han descubierto durante el proceso y la propia solución pueden provocar nuevas preguntas que llevan a reiniciar todas las fases en un proceso de mejora, por lo que los procesos de minería subsecuentes se beneficiarán de las experiencias previas.

A continuación, veremos un pequeño detalle de cada fase del proceso:

Comprensión del negocio

Esta es la fase con la que se abre el proceso. Se encuentra enfocada en la comprensión de los objetivos y exigencias de proyecto partiendo desde la perspectiva del negocio.

Tras ello, es necesario adquirir este conocimiento de los datos (repetimos, siempre desde el punto de vista del negocio) y convertirlo en la definición de un problema de minería de datos, trazando un plan preliminar de acuerdo a los objetivos planificados.

Comprensión de los datos

La fase de comprensión de datos comienza con la colección de datos inicial para continuar con las actividades que permiten alcanzar una familiaridad con ellos que permita identificar los problemas de calidad de datos.

La calidad de datos tiene varias dimensiones: exactitud (que se refleje lo que está pasando), totalidad (que se encuentren los datos completos en el sistema), oportunidad (accesible cuando sea necesario), relevancia, nivel de detalle y consistencia (mismos datos en todas las áreas o sistemas), por lo que será necesario comprobar como son los datos en cada una de estas dimensiones.

De esta manera ya se puede empezar a descubrir los primeros conocimientos en los datos, detectar aquellos conjuntos o subconjuntos de información interesantes para formar hipótesis que permitan avanzar en el descubrimiento de información oculta.

Preparación de datos

En esta fase de preparación de datos se quieren cubrir todas las actividades necesarias para adaptar los datos origen en bruto y aproximarlos al conjunto de datos final (los datos que serán fuente de las herramientas de modelado).

Las tareas de preparación o de limpieza de datos van a ser realizadas repetidas veces y no en cualquier orden. Entre estas tareas tenemos la selección de tablas, registros y atributos, así como la transformación y la limpieza de datos para su preparación para las herramientas de modelado.

Modelado

Como veremos en el próximo apartado, existen múltiples técnicas de modelado de datos, siendo en esta fase del proceso cuando, tras el conocimiento adquirido, se seleccionan las adecuadas (siempre de acuerdo a los objetivos de negocio y del proyecto) y se aplican.

En esta fase se buscan los siguientes cuatro tipos de relaciones:

Clases: las observaciones se asignan a grupos predeterminados.
Clusters: se construyen grupos de observaciones similares según un criterio prefijado.
Asociaciones: las observaciones son usadas para identificar asociaciones entre variables.
Patrones secuenciales: se trata de identificar patrones de comportamiento y tendencias.

Entre estas técnicas podemos encontrar: la caracterización o resumen, la discriminación o contraste, el análisis de asociación, la clasificación, la predicción, el clustering o la detección de agrupamientos, la detección de anomalías, el análisis de la evolución y de la desviación… También existen diferentes técnicas para resolver el mismo tipo de problema de minería de datos. Algunas técnicas tienen requerimientos específicos sobre la forma de datos. Por lo tanto, volver a la fase de preparación de datos para adecuar estos a la técnica pues ser necesario.

Evaluación

Como resultado de la fase anterior, en esta etapa en el proyecto ya se ha construido un modelo. Para asegurarnos de que se cumple con los estándares de calidad propuestos para el proyecto es necesario evaluarlo desde una perspectiva de análisis de datos. Es decir, antes del proceder al despliegue final y su puesta en producción, es importante realizar una batería de pruebas junto con la revisión de cada paso ejecutados en la creación del modelo, que ayude a comparar el modelo obtenido con los objetivos de negocio.

Un objetivo clave es determinar si se han cubierto todas las expectativas de negocio, asegurando que no hay “gaps” o lagunas que no hayan sido cubiertas.

Despliegue o Explotación

En esta fase se realiza la explotación y uso de los resultados del proceso de Data Mining lo que, dependiendo de los requerimientos, puede ser tan sencillo como la generación de un informe o tan complejo como la realización repetida de un proceso cruzado de minería de datos a través de la empresa. Por lo que, en muchos casos, es el propio cliente y no el analista de datos, quien realiza la explotación.

Data Mining es un proceso iterativo, por lo que, la creación del modelo no implica el final del proyecto. El conocimiento ganado como resultado del proceso es perfectamente utilizable de nuevo como información de entrada para volver a realizar otro ciclo del proceso KKD completo.

Es decir, una vez que el conocimiento descubierto se presenta al usuario, las medidas de evaluación pueden mejorarse, la minería puede ser refinado, los nuevos datos se pueden seleccionar o transformado de nuevo o agregar nuevas fuentes de datos…, todo esto para obtener resultados diferentes o más apropiados.

Continuación...

Máster en
Protección de Datos y Seguridad de la Información

TECNOLOGÍA

Modalidad

ONLINE

Duración

1500 horas

Evaluación

Continua con casos prácticos

Financiación

Pago en cuotas mensuales sin intereses

MÁS INFORMACIÓN

Compártelo

Sobre el autor

Blog de CEUPE

Comentarios

No hay comentarios por el momento. Se el primero en enviar un comentario.

Suscríbete a nuestro Magazine

Recibe Artículos, Conferencias
y Master Class

Masterclass Tecnología

Tecnología

Librerías

Tecnología

Introducción a las APIs

Tecnología

Intérprete de Python

Noticias más populares

SOBRE CEUPE

CEUPE consolida su liderazgo internacional en el ranking de Financial Magazine 2025

La Escuela de Negocios Online se posiciona en el Top 3 de LATAM.

SOBRE CEUPE

¿Dónde hacer un máster online en España?

¿Interesado en hacer un máster en España desde la distancia? A continuación, te presento 5 universidades top del sector. 7 Universidades para estudiar un máster online en España 1. Universidad Católic...

SOBRE CEUPE

Maestría: Qué es, tipos y ventajas de estudiarla

Las maestrías son un tipo de formación avanzada, cuyos programas son accesibles posterior a la etapa universitaria. Definición de maestría Una maestría es un curso de posgrado con una duración que osc...

EMPRESAS

Matriz RACI: qué es, cómo hacerla y ejemplo práctico

En muchos proyectos, los problemas no aparecen porque falte talento, sino porque nadie tiene claro quién debe hacer cada cosa. Una tarea queda pendien...

MARKETING EMPRESAS

Unit economics: qué son y cómo medir la rentabilidad por cliente

¿Tu empresa gana dinero con cada cliente o solo parece rentable porque factura más? Esta es la pregunta que responden las unit economics, una forma de...

RRHH MARKETING LOGÍSTICA EMPRESAS TECNOLOGÍA

Qué estudiar para trabajar desde casa o en remoto

Trabajar desde casa ya no es una excepción ni una promesa lejana. Para muchos profesionales, se ha convertido en una forma real de seguir creciendo si...

EMPRESAS

Product market fit: qué es y cómo saber si tu producto encaja en el mercado

El product market fit es uno de los conceptos más importantes para cualquier negocio que quiere lanzar, validar o escalar un producto. Sin embargo, ta...

MARKETING

Estrategia de marketing de Sabritas: cómo una marca de papas conquistó México

Hablar de la estrategia de marketing de Sabritas es analizar cómo una marca de consumo masivo puede convertirse en parte de la vida cotidiana de millo...

MARKETING EMPRESAS

Unit economics: qué son y cómo medir la rentabilidad por cliente

¿Tu empresa gana dinero con cada cliente o solo parece rentable porque factura más? Esta es la pregunta que responden las unit economics, una forma de...