Semana 3: Preparación de Datos
Perfilado de sección
-
Cualquier modelo inteligente es tan bueno como los datos con los que se entrena. Durante esta semana nos enfocaremos en la limpieza, normalización y feature engineering (ingeniería de características). Aprenderemos a tratar valores nulos, detectar datos atípicos y escalar variables numéricas, pasos que consumen la mayor parte del tiempo de un científico de datos.
En la búsqueda de desarrollar sistemas de Vida Artificial y ecosistemas digitales robustos, la calidad de los datos actúa como el entorno basal. Si queremos que nuestros agentes algorítmicos aprendan de forma autónoma, el preprocesamiento es la primera regla para evitar simulaciones erráticas.
En mis trabajos sobre Modelos del Mundo, he comprobado que la generación de nuevas características (feature engineering) es donde verdaderamente se inyecta el conocimiento experto del dominio humano hacia la máquina, permitiendo que el modelo extraiga correlaciones que de otro modo pasarían desapercibidas.
-
Descarga la base de datos de Diabetes de los Indios Pima desde este enlace directo: Pima Indians Diabetes Dataset (CSV). Utilizando Google Colab y Python, carga el CSV. Identifica cuántos valores iguales a
0existen en las columnas de "Presión Sanguínea" y "Grosor del Pliegue Cutáneo" (que representan valores nulos biológicos) y aplica un método de imputación para reemplazarlos por la mediana de la columna. -
Descarga la base de datos de Pingüinos (Palmer Penguins), ideal para limpieza, desde este enlace directo: Palmer Penguins Dataset (CSV). Utilizando Google Colab y Python, carga el CSV con Pandas. La base de datos tiene valores nulos (
NaN) en varias columnas como la masa corporal. Tu tarea es:-
Identificar cuántos valores nulos hay por columna.
-
Aplicar un método de imputación para reemplazar los nulos numéricos por el promedio de su respectiva columna.
-
Eliminar las filas que tengan texto nulo (ej. la isla o el sexo).
-
-
¿Qué impacto tiene en un modelo predictivo la decisión de rellenar valores nulos con el promedio vs. eliminar la fila completa?