Módulo 1: Filosofía & Metodología CRISP-DM
🎯 1. La Filosofía de Cátedra: “El Poder en los Datos y la Herramienta”
“Sin análisis de datos, las empresas son ciegas y sordas, vagando hacia el exterior como ciervos en una autopista.”
— Geoffrey Moore
En la dirección moderna de empresas, acumular terabytes de datos no genera ninguna ventaja competitiva si la organización sufre de «parálisis por análisis»:
- El problema de los reportes tradicionales: Las hojas de cálculo con 50 pestañas y los informes en PDF de 80 páginas terminan archivados sin leerse. No permiten hacer preguntas interactivas en una junta directiva.
- El poder de Power BI: La herramienta permite que un tomador de decisiones cliquee sobre un país (ej. España), un grupo de edad (ej. 35-45 años) o una categoría (ej. Vinos) y vea en menos de un segundo cómo se recalculan todas las métricas operativas y financieras.
- El rol del analista de negocios: No consiste en graficar datos por adornar una diapositiva, sino en estructurar los datos para que respondan preguntas estratégicas.
🔄 2. Metodología CRISP-DM Aplicada (Cero Relleno)
La metodología CRISP-DM (Cross-Industry Standard Process for Data Mining) es el marco estándar mundial para proyectos analíticos. En lugar de abordarla de forma burocrática, la aplicamos en 4 fases directas a la acción:
Fase I: Comprensión del Negocio (Business Understanding)
Antes de abrir Power BI, debemos definir:
- Audiencia Objetivo: ¿A quién le reportamos? (En nuestro caso de estudio: el comité directivo y el equipo de mercadeo de Premium Mart).
- Preguntas de Negocio Concretas: No buscamos “ver qué sale”, sino responder interrogantes precisas: ¿Cuál fue la mejor campaña publicitaria? ¿Qué canal de ventas está perdiendo tracción? ¿Qué productos generan el 80% del margen?
Fase II: Comprensión de los Datos (Data Understanding)
Revisar el catálogo de atributos y verificar sus tipos fundamentales:
- Numéricas Continuas: Montos de gasto en dólares (
ValTotVinos,IngAnual). - Numéricas Discretas: Conteos (
NumComprasTienda,NumNiños). - Categóricas / Texto: País, Estado Civil, Nivel Educativo.
- Binarias / Lógicas: Respuestas a campañas (
AceptaCmp1a5,Reclamos: 1 = Sí, 0 = No). - Temporales: Fecha de registro del cliente (
FechaRegistro).
Fase III: Preparación de Datos (Data Preparation)
Esta etapa consume típicamente entre el 60% y el 80% del tiempo de cualquier analista.
[!IMPORTANT] Las 3 Reglas de Oro en Preparación de Tablas:
- Regla de Filas: Cada fila debe representar estrictamente una única unidad de observación (un cliente único o una transacción individual). Cero duplicados.
- Regla de Columnas: Cada columna debe contener una sola dimensión bien tipada.
- Storytelling en el Orden de Columnas: Estructurar las columnas de lo general a lo particular:
Identificación / Demografía → Hábitos y Canales → Transacciones y Resultados
Tratamiento de Valores Nulos (Missing Values):
- Eliminación: Válida cuando los nulos son un porcentaje residual (menos del 5% de la muestra) y no introducen sesgo sistemático.
- Categorización Explícita: Asignar etiquetas como
"Sin Registro"o"No Aplica"cuando la ausencia de dato tiene significado propio. - Imputación Estadística: Reemplazar por la Media (en distribuciones simétricas sin valores extremos) o por la Mediana (cuando existen valores atípicos o distribuciones asimétricas).
Fase IV: Modelado y Visualización (Modeling)
- Aplicar el principio inquebrantable de la ciencia de datos: “Garbage In, Garbage Out” (si la preparación de datos es deficiente, cualquier tablero o modelo producirá conclusiones falsas).
- Construir objetos visuales apropiados para cada dimensión: tarjetas para KPIs, barras horizontales para categorías con nombres largos y diagramas de dispersión para correlaciones.
🏛️ 3. Gobernanza y Calidad del Dato: La Norma ISO 8000
Para que un panel directivo sea confiable ante una junta de accionistas, los datos maestros deben regirse por los 4 principios de la norma internacional ISO 8000:
| Principio ISO 8000 | Significado Práctico en Business Analytics |
|---|---|
| 1. Intercambio | Los datos deben transferirse entre sistemas (ERP → Excel → Power BI) sin pérdida de integridad ni alteración de valores. |
| 2. Portabilidad | Los datos deben ser utilizables en múltiples herramientas tecnológicas sin dependencia forzada de un formato propietario. |
| 3. Completitud | Los registros analíticos deben contener todos los atributos requeridos para el negocio, resolviendo nulos y vacíos. |
| 4. Sintaxis | Homogeneidad estricta en convenciones de fechas, mayúsculas/minúsculas y formatos numéricos en toda la base. |
4. Repaso de correlación (Pearson, Spearman y Kendall)
Antes de modelar relaciones en Power BI, elige el coeficiente que corresponde a la escala y a los supuestos. Este bloque resume la Sesión 2 del Dr. Bucheli y de la Dra. Dakduk.
Pearson ($r$)
Mide fuerza y dirección lineal entre dos variables cuantitativas continuas. Rango $[-1, +1]$.
| Magnitud de $|r|$ | Lectura | | :--- | :--- | | $0.7$ a $1.0$ | Fuerte | | $0.3$ a $< 0.7$ | Moderada | | $< 0.3$ | Débil o nula |
Cuatro supuestos: variables continuas, muestreo aleatorio independiente, normalidad bivariada y relación lineal. Correlación no implica causalidad.
Spearman ($\rho$) y Kendall ($\tau$)
Úsalos cuando se rompe la normalidad o cuando las escalas son ordinales / Likert.
- Spearman: basado en rangos; primera opción en investigación de mercado por potencia.
- Kendall: más conservador; útil si $n < 30$ o hay muchos empates.
En el lienzo de Power BI, un diagrama de dispersión + una medida de correlación solo tiene sentido si el par de variables cumple estos supuestos. Para Premium Mart, las preguntas del Deber 2 son descriptivas; no exigen un $r$, pero sí evitan confundir volumen (más clientes en España) con una relación causal.