Tipología y ciclo de vida de los datos
Aprende a gobernar el dato de principio a fin: de dónde sale, cómo se guarda, cómo se limpia y cómo se publica para que otros puedan confiar en él y reutilizarlo. Es un curso de nivel máster en ciencia de datos centrado en el ciclo de vida de los datos con Python y R: tipos y formatos, adquisición mediante API y web scraping responsable y legal, integración de fuentes, limpieza, validación y calidad, valores perdidos y atípicos, transformación y análisis estadístico, ética y protección de datos (RGPD) documentación y publicación de conjuntos de datos según los principios FAIR y, por último, análisis y modelización en R (regresión logística, agrupamiento y supervivencia).
Qué aprenderás
- A clasificar los datos por estructura, origen, sensibilidad y escala de medida, y a elegir el formato y el sistema de almacenamiento adecuados (CSV, JSON, XML, Parquet, SQLite y bases NoSQL).
- A obtener datos de API REST y portales de datos abiertos, y a construir extractores web con BeautifulSoup que respetan
robots.txt, los términos de uso, la propiedad intelectual y el RGPD. - A integrar fuentes heterogéneas, resolver entidades duplicadas, validar reglas de calidad, diagnosticar y tratar valores perdidos y atípicos, y analizar los datos depurados con contrastes, correlación y regresión.
- A anonimizar, documentar (diccionario de datos, hoja de datos, metadatos Data Package, DCAT, schema.org y DataCite), licenciar y publicar un conjunto de datos con DOI en un repositorio como Zenodo.
- A llevar el ciclo a R con el tidyverse y a modelizar: regresión logística validada con particiones y matriz de confusión, agrupamiento (k-medias, jerárquico) validado e interpretado, y análisis de supervivencia (Kaplan-Meier, log-rank, Cox).
Qué incluye: 14 temas y 5 prácticas evaluables
- Módulo 1 · Los datos: tipos, formatos y almacenamiento — Tema 1 Los datos y su ciclo de vida · Tema 2 Formatos de datos y almacenamiento: ficheros, SQL y NoSQL
- Módulo 2 · Adquisición de datos — Tema 3 Adquisición de datos mediante APIs y portales de datos abiertos · Tema 4 Web scraping responsable y legal · Práctica 1 · Construcción de un conjunto de datos propio
- Módulo 3 · Integración, limpieza y calidad — Tema 5 Integración de fuentes y resolución de entidades · Tema 6 Limpieza, validación y calidad de los datos · Tema 7 Valores perdidos y atípicos: diagnóstico y tratamiento · Práctica 2 · Integración, limpieza y validación
- Módulo 4 · Transformación y análisis — Tema 8 Transformación y análisis estadístico de los datos · Práctica 3 · Análisis de un conjunto de datos depurado
- Módulo 5 · Ética, documentación y publicación — Tema 9 Ética, privacidad y protección de datos · Tema 10 Documentación, publicación y preservación de datos · Práctica 4 · Proyecto final: publicación de un conjunto de datos FAIR
- Módulo 6 · Análisis y modelización de los datos con R — Tema 11 R para el ciclo de vida del dato: lectura, limpieza e integración con el tidyverse · Tema 12 Regresión logística, particiones de validación y matriz de confusión · Tema 13 Agrupamiento: k-medias, jerárquico y validación de grupos · Tema 14 Análisis de supervivencia aplicado: Kaplan-Meier, log-rank y Cox · Práctica 5 · Limpieza, análisis y modelización en R
Cada tema trae un PDF propio, un notebook de entrenamiento con ejercicios autocorregibles y su solución, y una autoevaluación que desbloquea lo siguiente. Las cuatro primeras prácticas forman un hilo: el conjunto de datos que construyes en la primera lo depuras, lo analizas y lo publicas; la quinta limpia, analiza y modeliza en R un conjunto clínico abierto.
A quién va dirigido. A estudiantes de máster en ciencia de datos, ingeniería o estadística y a profesionales (analistas, ingenieros de datos, investigadores) que necesitan obtener, preparar y compartir datos con rigor técnico y legal.
Requisitos previos. Programación en Python con soltura (funciones, estructuras de datos, excepciones), manejo básico de pandas y estadística de nivel universitario (descriptiva y nociones de inferencia). Se repasan las nociones de HTML y HTTP que hacen falta. No hace falta saber R: el tema 11 lo enseña desde pandas.
Metodología y dedicación. Estudio del PDF, entrenamiento práctico, autoevaluación y prácticas con problemas abiertos en las que se valora tanto el código como la justificación de cada decisión. Dedicación estimada: 182 horas de temas y prácticas, más una hora de presentación (unas 10 horas semanales durante 19 semanas).
Herramientas. pandas, requests, BeautifulSoup y lxml, sqlite3, pyarrow (Parquet), scipy y statsmodels, matplotlib y seaborn; en R, dplyr, tidyr, readr, ggplot2, broom, cluster y survival. Todo funciona en local o en Google Colab. Los ejercicios de extracción web funcionan sin conexión con páginas de práctica propias y, si lo prefieres, con sitios creados para practicar.