“Big Data y ciencia de datos: la revolución silenciosa de la estadística“
Un punto de vista personal
Cañadas Reche, José Luis
MasOrange?
2025-04-25
Sobre mi
- Soy José Luis Cañadas Reche 👋
- Data Scientist/ Estadístico 💻
- ️MasOrange 🍊
- En unas semanas 🏡
¿Quién fui/soy yo?
- Alumno de esta facultad. No especialmente brillante los primeros años
- Becario en el IECA.
- Otras cosas raras
- Estadístico en Instituto de Estudios Sociales de Andalucía (IESA)
¿Cómo acabé en esto del “Bigdata”?
- Fin de contrato en el IESA
- En Andalucía es/era díficil encontrar trabajo de estadístico
- Migración a Madrid
- Consultora y Telefónica. 2016- 2018
- Orange. 2018-2025
¿Qué es esto del “Bigdata”? ¿Y la ciencia de datos?
- Nadie tiene muy claro qué es BigData. ¿Lo de las 5 V’s?
- En realidad no importa mucho cómo se defina.
- Es un “hype”, igual que ahora el nuevo “hype” es la IA.
- Data Science exists because Statistics (as a field) missed the boat on computers.
- Lo de “ciencia” en ciencia de datos es “cuestionable”
¿Y qué tiene que ver con la Estadística?
¿Qué pintamos los estadísticos?
¿Qué debería hacer un estadístico para ser un buen científico de datos?
- Aprender a programar, ¿R, Python, sql, julia, Rust, C++ ?
- Entender el campo de aplicación, negocio, ciencia.
- Saber contar historias con datos y transmitir conceptos complejos de forma simple.
- Mucha gente se empeña solo en programar y aprender bien un lenguaje. Es útil, pero lo que os diferencia a vosotros es el pensamiento estadístico.
- La estadística es la ciencia de la incertidumbre. 1/3 != 100/300
Oportunidades
- Es más fácil ser un estadístico con habilidades de programación que al revés.
- Alfabetización estadística. Muchos DS’s actuales no tienen ni idea
- Comunicar eficazmente la incertidumbre => Mejores decisiones
- Las empresas están redescubriendo las posibilidades de la IO (ML Prospectivo lo llaman ahora)
Ejemplos en telco.
- Modelos de clasificación. Propensión de compra, fuga de clientes.
- Marketing Mix Modelling.
- Análisis de redes.
- Perfilado de clientes.
Mensaje para estudiantes y egresados
- Confía en tu formación estadística
- No te obsesiones con aprender a programar. ¡Pero aprende!
- Hay mucho desconocimiento estadístico, incluso en empresas top
- No dejes de estudiar y aprender, terminar la carrera es sólo el principio
- Crea un portfolio personal de proyectos, por ejemplo en github
- Participa en comunidades de datos, como R-Hispano, Pydata.
Bola extra. Detalle casos de uso en Telco
Fuga de clientes
Predecir solicitudes de portabilidad.
Elegir diariamente clientes con mayor probabilidad de fuga
Mandar a campaña diaria. Elección grupo de control
Análisis de accionabilidad. Inferencia causal
Marketing Mix Modelling
- Básicamente hacen regresiones multivariantes encadenadas
- Se podría mejorar con
- Ecuaciones estructurales
- Modelos bayesianos.
- Se optimizan usando cosas como cplex, gurobi.
SNA. Definición de vínculo
Criterio seleccionar sólo vínculos fuertes
\[link_{i,j} = \dfrac{\sum{calls_{i,j}}}{\sum calls_i + \sum calls_j - \sum{calls_{i,j}}} \]
Para cada teléfono se obtiene sus contactos importantes a alcance 2.
Perfilado de clientes. Navegación
- Navegación web. Anonimizamos tlfs
- Consideramos las 10 mil urls más visitadas
- Muestreamos tlfs fijos (20% nos basta)
- SVD de la matriz resultante. 400 mil filas x 10 mil columnas. Matriz muy dispersa
Urls similares
> dist_matrix[grep("*.pullandbear.com",rownames(dist_matrix), fixed = TRUE), ] |> enframe() |> arrange(value)
# A tibble: 9,564 × 2
name value
<chr> <dbl>
1 *.pullandbear.com 0
2 *.stradivarius.com 68.1
3 *.pullandbear.net 69.6
4 *.nagich.com 77.9
5 *.backmarket.com 85.6
6 *.bershka.com 86.2
7 *.backmarket.es 89.9
8 *.salesmanago.es 94.6
9 *.turnto.com 101.
10 *.quickcep.com 104.
Esto es todo. ¿Preguntas?
Blog
![]()
Podcast
![]()