Semana 4: Modelado Supervisado - Clasificación
Perfilado de sección
-
Con los datos limpios, introduciremos las métricas de evaluación de modelos y el uso de bibliotecas fundamentales como NumPy, Pandas y Matplotlib. No basta con que un algoritmo ejecute una predicción; como ingenieros de la Universidad de Concepción, debemos cuantificar rigurosamente su eficacia.
Abordaremos las principales métricas de evaluación de modelos: precisión, recall (sensibilidad) y F1-score. Entender cuándo priorizar la reducción de falsos positivos frente a los falsos negativos es crítico.
Estas herramientas nos permitirán construir los cimientos de arquitecturas predictivas sólidas. Solo un modelo que puede ser medido con exactitud puede ser mejorado y eventualmente integrado en una arquitectura de IA general o de Vida Artificial.
Video MATRIZ DE CONFUSIÓN y MÉTRICAS DE CLASIFICACIÓN con Scikit-Learn
-
Descarga el conjunto de datos de Supervivientes del Titanic: Titanic Dataset (CSV). En Google Colab, utiliza Pandas para cargar los datos y
scikit-learnpara dividir el set en entrenamiento y prueba. Entrena un modelo básico de clasificación (ej. Regresión Logística) para predecir la supervivencia y utiliza Matplotlib o Seaborn para graficar la Matriz de Confusión resultante. -
Si estás desarrollando un software para diagnosticar una enfermedad altamente contagiosa, ¿prefieres optimizar la Precisión (Precision) o la Sensibilidad (Recall)? Justifica tu respuesta.