Semana 9: Introducción al PLN y Modelos de Lenguaje
Perfilado de sección
-
Iniciamos la Unidad 3 adentrándonos en el Procesamiento de Lenguaje Natural (PLN) y Modelos de Lenguaje Grandes (LLMs). Exploraremos cómo la IA logra codificar y descifrar el lenguaje humano, uno de los hitos más grandes de la emulación cognitiva.
Estudiaremos técnicas fundacionales como la tokenización y el análisis de sentimientos, elementos cruciales para extraer semántica computacional a partir de textos no estructurados. Veremos cómo se transforman oraciones en arreglos vectoriales que la máquina puede procesar.
Comprender los cimientos del PLN es el puente que nos lleva desde el análisis estadístico simple hacia la inteligencia general y la arquitectura de los Modelos del Mundo (Large World Models). Solo entendiendo el lenguaje, la máquina puede simular interacciones sociales complejas.
-
Descarga este conjunto de datos que contiene mensajes clasificados como Spam y No Spam (Ham): SMS Spam Dataset (TSV). En Colab, utiliza la biblioteca
NLTKpara:-
Extraer los primeros 10 mensajes.
-
Aplicar tokenización (separar por palabras).
-
Filtrar y eliminar las stop words (palabras vacías como "el", "de", "y") en inglés utilizando el corpus de NLTK.
-
-
Considerando la complejidad del lenguaje humano, ¿cuál es la principal limitación técnica de los modelos de PLN más antiguos (basados en contar palabras) frente a las arquitecturas vectoriales modernas?