El procesamiento del lenguaje natural (PLN) es una rama de la inteligencia artificial (IA) que enseña a equipos informáticos a comprender el lenguaje humano verbal y escrito. El procesamiento del lenguaje natural combina lingüística computacional con Machine Learning y Deep Learning para procesar datos del habla y texto. También se puede utilizar con otros tipos de datos para desarrollar sistemas de ingeniería inteligentes.
El Procesamiento del lenguaje natural es una rama de la Inteligencia artificial que permite a los ordenadores comprender el lenguaje humano, tanto en su forma escrita como hablada, combinando la lingüística computacional con Machine Learning y Deep Learning.
El Procesamiento del lenguaje natural transforma datos lingüísticos no estructurados en un formato estructurado mediante técnicas de preparación de datos como la tokenización, el stemming y la lematización. A continuación, utiliza modelos de IA para interpretar datos de texto y voz, identificar relaciones y generar nuevos contenidos lingüísticos.
La comprensión del lenguaje natural (NLU) utiliza análisis sintáctico y semántico para extraer el significado de las oraciones en tareas como la clasificación de documentos y el análisis de sentimientos. Por su parte, la generación del lenguaje natural (NLG) engloba los métodos que utilizan los ordenadores para producir respuestas de texto a partir de datos de entrada.
Las aplicaciones más habituales del Procesamiento del lenguaje natural incluyen reconocimiento de voz, reconocimiento de locutores, reconocimiento de entidades nombradas, análisis de sentimientos, clasificación de documentos, resumen automático de texto y traducción automática en sectores como las finanzas, la industria manufacturera y las tecnologías de la información.
Las técnicas de preprocesamiento más comunes incluyen la tokenización (dividir el texto en oraciones o palabras), el stemming (reducir las palabras a su raíz), la lematización (utilizar análisis del vocabulario para eliminar afijos), Word2vec (crear representaciones numéricas de palabras) y el modelado mediante n-gramas.
Los modelos de NLP abarcan desde algoritmos clásicos de Machine Learning, como la regresión logística y los árboles de decisión, hasta arquitecturas de Deep Learning que incluyen redes neuronales convolucionales (CNN), redes neuronales recurrentes (RNN), autoencoders y modelos transformer como BERT y ChatGPT, que constituyen la base de los grandes modelos de lenguaje.
MATLAB permite implementar flujos de trabajo completos de NLP mediante Text Analytics Toolbox para datos textuales y Audio Toolbox para datos de voz. Proporciona herramientas para el preprocesamiento, la extracción de características, el entrenamiento de modelos de Machine Learning y Deep Learning, así como acceso a modelos preentrenados como BERT y VGGish.
El aprendizaje por transferencia permite utilizar grandes modelos de lenguaje preentrenados y adaptarlos para resolver problemas específicos de NLP, por ejemplo ajustando un modelo BERT para un idioma concreto o una tarea de clasificación determinada.