[Actualizado a 16 de agosto de 2026]
ANÁLISIS DE DATOS EN PYTHON¶
Normativa del módulo¶
Seguiremos la normativa oficial Real Decreto 566/2024, de 18 de junio, por el que se establece el Curso de especialización de Formación Profesional de Grado Superior en Desarrollo de aplicaciones en lenguaje Python y se fijan los aspectos básicos del currículo..
Temporización del curso¶
-
T0. Herramientas - 5w
- GIT 2w
- venv 0w
- docker 3w
- Estilos 0w
require0w- Test unitarios 0w
- Jupyter Notebook 0w
-
T1. Captura, limpieza y normalización de datos - 8w
- T2. Limpieza y estandarización de lotes de datos - 8w
- T3. Análisis exploratorios de datos - 5w
- T4. Desarrollo de modelos - 4w
- Evaluación - 1w
Total: 124 horas (31 sem).
gantt
title Cronograma APROXIMADO del módulo
dateFormat YYYY-MM-DD
axisFormat %d-%m
section T0. Herramientas
GIT :a1, 2026-10-01, 2w
Docker :a2, after a1, 3w
section T1. Ingesta de Datos
T1 :t1, after a2, 7w
Examen 1ª eva: milestone, eva1, 2026-11-23, 1d
T1 :t1b, after nav, 1w
section Navidad
No lectivo: nav, 2026-12-23, 3w
section T2. Procesamiento
T2 :t2, after t1b, 8w
section T3. Análisis
T3 :t3, after sem_santa, 5w
Examen 2ª eva: milestone, eva2, 2027-03-01, 1d
section Semana Santa
No lectivo: sem_santa, 2027-03-22, 1w
section T4. Modelado
T4 :t4, after t3, 4w
section Evaluación
Final: milestone, eva, 2027-06-05, 1d
T0. Herramientas¶
Desarrolla el RA0:
En este RA trabajaremos las herramientas básicas para desarrollo con Python.
Contenidos:
1. Control de versiones con GIT
2. Entornos virtuales con venv
3. Contenedores docker
4. Estilos de codificación (PEP8)
5. Trabajo con APIs con require (Postman like)
6. Test unitarios (pytest o unittest)
7. Jupyter Notebook
T1. Captura, limpieza y normalización de datos.¶
Desarrolla el RA1: Manejo, limpieza y normalización de distintos tipos de datos en función del problema a resolver.
a) Se conocen y se importan las librerías usadas en ciencia de datos. b) Se ha escrito código que permite leer datos de distintos orígenes (csv, xlsx, entre otros). c) Se ha escrito código que permite exportar datos previamente leídos en ficheros de distinto formato (csv, xlsx, entre otros). d) Se ha escrito código que permite acceder a bases de datos usando librerías de ciencia de datos. e) Se manejan selecciones, actualizaciones, adiciones y eliminaciones de datos de una base de datos usando las librerías de Python aplicadas en ciencia de datos. f) Se han realizado pruebas intermedias de verificación.
Contenidos¶
- Librerías más usadas en ciencias de datos en Python.
- Gestión de ficheros contenedores de datos.
- Conexión con BBDD.
- Tipos de datos: numéricos, categóricos, temporales y texto.
-
Lectura y escritura de datos en distintos formatos: CSV, Excel, JSON, Parquet, HDF5, Feather.
-
Manipulación y transformación de datos con las librerías
pandasynumpy. - Introducción al uso de estructuras multidimensionales con
xarray.
La idea clave: del dato al archivo y del archivo al dato 1. Abrir el fichero de forma segura. 2. Leer o escribir según lo que necesitemos. 3. Procesar el contenido (limpiar, filtrar, transformar). 4. Guardar resultados si corresponde. 5. Cerrar correctamente el fichero (aunque haya errores). 6. [Opcional] Seguridad del fichero de salida (evitar errores).
Esta unidad se organiza para que se comprenda ese flujo y se aplique en casos reales.
T2. Limpieza y estandarización en lotes¶
Desarrolla el RA2: Limpia y estandariza lotes de datos de forma lógica y eficiente para su tratamiento posterior de acuerdo al problema a resolver.
a) Se han analizado los datos leídos. b) Se han deducido las operaciones para normalizar y estandarizar datos en Python. c) Se ha escrito código que permite limpiar y estandarizar datos basándose en el problema que hay que resolver. d) Se han aplicado intervalos en series de datos para realizar agrupaciones de forma coherente. e) Se han identificado los datos a convertir de categóricos a numéricos. f) Se ha escrito código que modifica variables categóricas en variables cuantitativas en Python.
Contenidos¶
- Instalación y configuración de
Pandas. - Técnicas de limpieza de datos: detección y tratamiento de valores ausentes, duplicados y formatos inconsistentes.
- Transformación de datos: estandarización, normalización y codificación de variables categóricas.
- Agrupación, agregación y restructuración de datos.
- Automatización de flujos de preprocesamiento con herramientas como
scikit-learn.
T3. Análisis exploratorios¶
R.A.3 Realiza análisis exploratorios en datos teniendo en función del alcance del problema a resolver.
a) Se ha resumido grandes cantidades de datos para toma decisiones. b) Se ha sido capaz de responder preguntas relevantes relativos a los datos. c) Se han reconocido patrones en los datos. d) Se ha escrito código en Python que permita conocer la correlación entre variables.
Contenidos¶
- Diagramas de dispersión.
- Análisis estadístico descriptivo: medidas de tendencia central y dispersión.
- Identificación de relaciones y correlaciones entre variables.
- Visualización gráfica de los datos mediante
matplotliby/oseaborn. - Exploración de distribuciones, detección de valores atípicos y patrones.
- Visualización avanzada de datos multidimensionales con
xarray(opcional).
Pysaurio permite buscar, extraer y depurar información de un conjunto de archivos del mismo tipo; y crear con toda la información seleccionada un archivo, por ejemplo, del tipo CSV.
El módulo Tabulate, desarrollado por Sergey Astanin, permite imprimir en la salida estándar o escribir en un archivo de texto tablas con datos tabulados con varios formatos conocidos. Los datos se alinean automáticamente atendiendo a su tipo (cadena, entero y flotante) aunque es posible cambiar la configuración por defecto.
T4. Desarrollo de modelos¶
Desarrolla RA4: Desarrolla modelos en lenguaje Python dando solución al problema planteado.
a) Se ha analizado la relación entre una variable continua y una o más variables independientes mediante el ajuste de una ecuación lineal. b) Se ha modelado una relación no lineal entre variables independientes y dependientes. c) Se ha determinado correctamente la muestra en la que se ensayará el procedimiento a evaluar. d) Se ha realizado una predicción y se ha comprobado su precisión y validez usando una muestra de datos válida.
Contenidos¶
- Aplicación de modelos de regresión y clasificación utilizando
scikit-learn. - Preparación de los datos para modelado: división en conjuntos de entrenamiento y prueba.
- Evaluación del rendimiento del modelo con métricas adecuadas.
- Automatización del proceso mediante pipelines.
- Guardado y reutilización de modelos entrenados.
Orientaciones pedagógicas¶
Este módulo profesional contiene parte de la formación necesaria para desempeñar la función de facilitar al alumnado las competencias necesarias para el tratamiento, análisis y visualización de datos mediante el uso de herramientas y librerías avanzadas de Python.
La función de facilitar al alumnado las competencias necesarias para el tratamiento, análisis y visualización de datos incluye aspectos como: - Conocimiento en el manejo de librerías especializadas (por ejemplo, Pandas, NumPy). - Comprensión de técnicas básicas de análisis exploratorio y explotación de datos. - Uso de métodos para la limpieza, transformación y representación gráfica de datos.
Las actividades profesionales asociadas a esta función se aplican en: - Analista de datos. - Especialista en la elaboración de informes analíticos para la toma de decisiones. - Desarrollador de soluciones orientadas a la inteligencia de negocios mediante el análisis de datos.
Las líneas de actuación en el proceso de enseñanza-aprendizaje que permiten alcanzar los objetivos del módulo versarán sobre: - Implementación de talleres y laboratorios prácticos en los que se aborden estudios de caso reales, utilizando conjuntos de datos auténticos. - Actividades orientadas a la integración de técnicas de análisis de datos en proyectos interdisciplinarios. - Evaluación mediante la realización de informes analíticos, presentaciones de resultados y la aplicación de metodologías de limpieza y visualización de datos
Bibliografía¶
Realizaremos un seguimiento del "Curso de tratamiento de datos"
Si ya sabes programar utiliza "Python para impacientes"
Si os gustan los libros en papel: "Inventa tus propios juegos de computadora con Python".