Perfilado de sección

  • En el cierre de nuestra Unidad 2, garantizaremos que los modelos construidos sean generalizables al mundo real. Estudiaremos la validación cruzada y técnicas de optimización. Un algoritmo sin una validación rigurosa es inservible en entornos productivos.

    Analizaremos en profundidad las causas y soluciones para el overfitting (sobreajuste) y underfitting (subajuste). La validación cruzada (k-fold cross validation) nos enseñará a particionar los datos dinámicamente para asegurar que el aprendizaje no sea una simple memorización de la muestra de entrenamiento.

    Optimizar hiperparámetros de manera metódica es la esencia de la ingeniería de software inteligente. Solo los modelos que han sido testeados frente a perturbaciones de datos logran sostenerse en arquitecturas de sistemas autónomos.

    • Validación Cruzada (Cross Validation) en Python con Scikit-Learn (Nota: Utiliza técnicas de GridSearchCV).

    • Descarga el dataset de Calidad de Vinos: Wine Quality (CSV). En Python, retoma el algoritmo Random Forest. En lugar de hacer una simple división de prueba y entrenamiento, aplica la función cross_val_score de scikit-learn utilizando 5 "folds" (particiones). Imprime el promedio de precisión (accuracy) obtenido a través de las 5 iteraciones.

    • Discute un escenario donde el overfitting (memorizar los datos en lugar de aprender el patrón) podría causar consecuencias fatales si el modelo se implementara en la industria automotriz (ej. conducción autónoma).