EUR 199.00

Fundamentos de la ciencia de datos

Categoría de cursosCiencia de datos

Descubre qué es de verdad la ciencia de datos y cómo se trabaja en un proyecto real, de la pregunta de negocio al informe final. Es un curso de nivel máster en ciencia de datos y la puerta de entrada al itinerario de ciencia de datos: te da la visión de conjunto de la disciplina y un primer contacto práctico, en Python, con cada una de sus piezas, para que después elijas con criterio en qué profundizar. Cada tema introduce lo esencial y te indica qué curso del itinerario lo trata a fondo.

Qué aprenderás

  • Qué distingue a la ciencia de datos de la estadística, la inteligencia de negocio y la IA; la pirámide DIKW; los tipos de analítica; los roles de un equipo de datos y qué hace que una organización esté orientada al dato.
  • A plantear y gestionar un proyecto con CRISP-DM y métodos ágiles (Scrum y Kanban): formular el problema, fijar el criterio de éxito y la línea base, y documentar las decisiones.
  • A trabajar con el ecosistema Python de la ciencia de datos: numpy, pandas, matplotlib, seaborn y scikit-learn, para explorar, limpiar y preparar datos, entrenar tus primeros modelos de clasificación, regresión y agrupamiento, y evaluarlos sin engañarte con la validación cruzada y las métricas adecuadas.
  • A revisar un proyecto con mirada ética y legal (sesgos, equidad, privacidad, RGPD, Reglamento europeo de IA y gobierno del dato), a entender cuándo un problema es de big data y qué ofrece la nube, y a comunicar los resultados a quien tiene que decidir.
  • A dirigir un proyecto de datos con PMBOK (acta de constitución, EDT, ruta crítica, riesgos, presupuesto y valor ganado, matriz RACI, calidad y comunicaciones) y a planificar el ciclo de vida de los datos y su gobierno.

Qué incluye: 12 temas y 5 prácticas evaluables

  • Módulo 1 · La ciencia de datos y sus proyectos — Tema 1 Qué es la ciencia de datos: datos, roles y organizaciones · Tema 2 El proyecto de ciencia de datos: CRISP-DM y gestión ágil
  • Módulo 2 · Herramientas y exploración — Tema 3 Python para ciencia de datos: numpy y pandas · Tema 4 Análisis exploratorio y visualización básica · Práctica 1 · Planteamiento y exploración de un proyecto de datos
  • Módulo 3 · Del dato al modelo — Tema 5 Calidad y preparación básica de los datos · Tema 6 Tipos de problemas y primeros modelos con scikit-learn · Tema 7 Evaluación y validación de modelos · Práctica 2 · Del dato al primer modelo
  • Módulo 4 · Datos responsables — Tema 8 Ética, privacidad y gobierno del dato · Práctica 3 · Auditoría ética de un modelo y plan de gobierno del dato
  • Módulo 5 · Escala y comunicación — Tema 9 Big data y ciencia de datos en la nube · Tema 10 Comunicación de resultados y puesta en producción · Práctica 4 · Proyecto final: un proyecto de ciencia de datos de principio a fin
  • Módulo 6 · Dirección de proyectos y ciclo de vida del dato — Tema 11 Dirección de proyectos de ciencia de datos con PMBOK · Tema 12 El ciclo de vida del dato y su gobierno · Práctica 5 · Plan de dirección de un proyecto de datos

Cada tema trae un PDF propio, un notebook de entrenamiento con ejercicios autocorregibles y su solución, y una autoevaluación que desbloquea lo siguiente. Las prácticas siguen el recorrido de un proyecto: lo planteas y exploras los datos, construyes y validas un primer modelo, lo auditas desde la ética, haces un proyecto completo con su informe y, por último, preparas el plan de dirección de un proyecto de datos.

A quién va dirigido. A quien empieza un máster o una formación de posgrado en ciencia de datos, y a profesionales de otras áreas (ingeniería, economía, ciencias, salud, administración) que quieren entender la disciplina y empezar a practicarla. Es el curso recomendado para empezar el itinerario: Tipología y ciclo de vida de los datos, Minería de datos, Minería de datos avanzada, Estadística Avanzada, Visualización de datos, Deep Learning y Aprendizaje por refuerzo parten de lo que aquí se presenta.

Requisitos previos. Saber programar a nivel básico en algún lenguaje (variables, condiciones, bucles y funciones), estadística descriptiva elemental y matemáticas de primer curso universitario. No hace falta experiencia previa con Python ni con aprendizaje automático: el curso enseña lo necesario.

Metodología y dedicación. Estudio del PDF, entrenamiento práctico, autoevaluación y prácticas con problemas abiertos en las que se valora tanto el código como la justificación de cada decisión. Dedicación estimada: 158 horas de temas y prácticas, más una hora de presentación (unas 10 horas semanales durante 16 semanas).

Herramientas. Python 3 con numpy, pandas, matplotlib, seaborn, scikit-learn, pyarrow y DuckDB, en Jupyter, en local o en Google Colab. No necesitas GPU ni conexión a internet para los ejercicios: los datos se generan en los propios notebooks o vienen con las librerías.

Profesor: Leroy Deniz