Módulo 7: Análisis de Datos con Pandas y NumPy en Colab
Perfilado de sección
-
La crucial transición desde el desarrollo de software puro hacia la Ciencia de Datos (Data Science) da inicio aquí. Se explorará inicialmente la biblioteca NumPy, proveyendo los cimientos para un procesamiento algebraico ultrarrápido mediante matrices y arreglos (arrays) multidimensionales. Esta optimización es vital, pues reduce la carga de la memoria y agiliza las operaciones con respecto a las colecciones nativas abordadas en los módulos iniciales.
La principal herramienta de trabajo será Pandas, el estándar indiscutido para la manipulación tabular de información. Se instruirá paso a paso en la importación de archivos CSV u hojas de cálculo alojadas en Drive, transformándolas en DataFrames. Una vez mapeados, se practicarán técnicas exhaustivas de limpieza de datos, agrupación (
groupby), indexación y el tratamiento de valores atípicos (outliers) o nulos.-
Video Recomendado: Curso Análisis de datos con Pandas en Python y Google Colab - Un excelente taller práctico y prolongado para dominar las funciones de transformación y lectura de datasets.
-
Discute una experiencia real o un escenario analítico en donde consideres que una matriz de datos "sucia" o inconsistente pueda generar sesgos graves y afectar negativamente los resultados de un informe institucional.
-